Classé #7 Programmation — L'IA qui écrit du code de production
Z.ai (Zhipu AI)

GLM-5.3

Un agent de programmation poids lourd à poids ouverts, entraîné pour tout ce qui vient après la première réponse : planifier, modifier, tester, se remettre d'un échec et garder le cap pendant de longues interventions dans un dépôt.

Mis à jour 30 août 2026 Coding AgentLong-Horizon1M Context

Mise à jour du classement Le classement « Programmation » a été revu depuis la dernière mise à jour de cette critique (30 août 2026). Le rang affiché ci-dessus est toujours à jour. N° 1 actuel : GPT-6 Astra

9.2sur 10
Site officiel
Idéal pour

Un agent de programmation poids lourd à poids ouverts, entraîné pour tout ce qui vient après la première réponse : planifier, modifier, tester, se remettre d'un échec et garder le cap pendant de longues interventions dans un dépôt.

Pourquoi ça Gagne

Artificial Analysis attribue à GLM-5.3 les scores de 59,5 en Intelligence, 74,8 en Programmation et 59,1 pour le travail agentique — au-dessus de Qwen3.8-Max dans les trois cas. Le tout nouveau classement public de Terminal-Bench 4.0 place GLM au troisième rang avec 41,8 %.

À surveiller

Le checkpoint officiel compte environ 753B de paramètres au total, dont 40B actifs ; il ne traite que le texte, raisonne en permanence et pèse près de 756 Go même en FP8. De nombreux scores détaillés en programmation et cybersécurité restent issus de tests menés par Z.ai, et la licence personnalisée n'est pas MIT.

01

Ce que c'est réellement

La démonstration de programmation la plus facile est la première réponse. Demandez une fonction, regardez le modèle produire un code propre, puis arrêtez l’enregistrement avant que les dépendances n’entrent en conflit ou que les tests ne révèlent une hypothèse erronée. Le véritable travail d’ingénierie commence là où cette démonstration s’arrête. GLM-5.3 est conçu pour la deuxième, la vingtième et la centième action : comprendre ce qui s’est passé, revoir le plan et conserver assez d’état pour aller jusqu’au bout.

Selon Z.ai, le modèle fondamental est la même base que celle de GLM-5.2. Le progrès vient du post-entraînement dans davantage d’environnements exécutables et sur des tâches professionnelles plus longues. Imaginez un jeune diplômé compétent qui commence son apprentissage. Les connaissances qu’il possède ne changent peut-être guère, mais la pratique répétée lui apprend quand mesurer, quand se méfier d’une hypothèse et quand défaire un travail qui paraissait brillant cinq minutes plus tôt.

Ce récit repose désormais sur deux types de preuves. Z.ai annonce de nets progrès dans Terminal-Bench, DeepSWE, AutomationBench et des suites de sécurité. Plus important encore, Artificial Analysis place indépendamment GLM-5.3 à 59,5 en Intelligence, 74,8 en Programmation et 59,1 pour le travail agentique, devant Qwen3.8-Max, qui obtient 58,1, 71,8 et 58,4. La conclusion solide est que GLM mérite de devancer Qwen en programmation, même si chaque dépôt doit encore faire l’objet d’un essai à conditions égales.

La publication des poids le 28 août change sensiblement cette évaluation. Avant cette date, les « poids ouverts » décrivaient une intention. Désormais, on peut examiner les fichiers FP8 et BF16, la configuration, le modèle de conversation et les recettes de déploiement. La reproductibilité devient enfin possible. Elle n’est pas bon marché : le checkpoint FP8 représente environ trois quarts de téraoctet, et les recettes officielles orientent vers des machines équipées de plusieurs accélérateurs de classe H200. Un modèle peut être téléchargeable tout en exigeant une petite salle informatique.

La licence mérite la même franchise. GLM-5.3 n’est pas sous MIT. Sa licence personnalisée autorise largement l’utilisation, la modification, l’ajustement fin, le déploiement et la vente. Sa clause inhabituelle s’applique lorsqu’un licencié ou une société affiliée exploite une activité Model-as-a-Service et dépasse 10 milliards de dollars de chiffre d’affaires cumulé sur une période consécutive de douze mois ; cet opérateur doit réussir l’examen de sécurité de Z.ai avant tout usage commercial. La plupart des particuliers et des équipes produit ordinaires sont très loin de ce seuil, mais parler d’« open source sans aucune condition » resterait inexact.

Les libellés des benchmarks comptent. Le 88,2 obtenu par Z.ai sur Terminal-Bench 2.1 et le résultat indépendant plus faible peuvent tous deux être honnêtes, car le modèle n’est qu’un acteur dans un système agentique. Dans la toute nouvelle suite évolutive, Terminal-Bench 4.0, GLM-5.3 se classe troisième avec 41,8 % ±3,2, derrière Opus 5 et Fable 5, mais devant GPT-5.6 Sol et Grok 4.6. Qwen3.8-Max n’a aucun résultat 4.0 publié : cette absence renforce la confiance accordée à GLM sans constituer pour autant un face-à-face direct.

En pratique, le modèle hébergé est plus facile à tester que les poids. Il accepte un effort de raisonnement low, high ou max, avec max par défaut. Le raisonnement ne peut pas être désactivé. Cela favorise les tâches difficiles, mais peut rendre une mauvaise piste coûteuse : la persévérance d’un agent n’est utile que si elle le conduit vers des preuves. Diffusez les longues exécutions en continu, plafonnez les boucles, conservez correctement l’état du raisonnement et exigez des tests avant d’accepter un message annonçant que le travail est terminé.

GLM-5.3 mérite donc une recommandation plus forte qu’au jour de son lancement, sans pour autant devenir magique. C’est un moteur de programmation à poids ouverts sérieux pour les équipes confrontées à des travaux exigeants dans le terminal, à de longs contextes et disposant soit d’un budget API, soit d’une infrastructure en cluster. Ce n’est ni le meilleur débogueur visuel, ni le modèle privé le plus facile, ni la preuve que chaque benchmark du fournisseur se transpose à votre dépôt. Donnez-lui les mêmes outils, le même budget, les mêmes tests et le même niveau de revue que votre modèle actuel, puis comparez le travail vérifié plutôt que les textes pleins d’assurance.

02

Forces et limites honnêtes

Points Forts

  • Les longues missions sont sa raison d’être : GLM-5.3 est entraîné à diagnostiquer, modifier, utiliser des outils, examiner les échecs et se rétablir au fil de trajectoires prolongées. Cela ressemble davantage à la maintenance d’un vrai code source qu’à un concours où il suffit d’écrire une fonction en une seule requête.
  • Les preuves indépendantes agrégées sont désormais solides : Artificial Analysis le place à 59,5 en Intelligence, 74,8 en Programmation et 59,1 pour le travail agentique. Qwen3.8-Max suit avec respectivement 58,1, 71,8 et 58,4.
  • Les poids sont réellement disponibles : Z.ai a publié les checkpoints FP8 et BF16 le 28 août. Les équipes peuvent maintenant examiner, servir et reproduire le modèle, au lieu de considérer les poids ouverts comme une promesse future.
  • La voie hébergée est simple : Z.ai propose un contexte de 1M, des niveaux d’effort de raisonnement low/high/max, des interfaces compatibles OpenAI et Anthropic, ainsi qu’un tarif de 1,40 $/M de jetons en entrée, 0,26 $/M en entrée mise en cache et 4,40 $/M en sortie.

Limites Honnêtes

  • Poids ouverts ne signifie pas format station de travail : Le dépôt FP8 officiel pèse environ 756 Go, le BF16 près de 1,51 To, et les déploiements documentés utilisent des systèmes équipés de plusieurs accélérateurs de classe H200. C’est un modèle pour cluster privé, pas un téléchargement pour ordinateur portable.
  • La plupart des gros titres propres à une tâche restent des tests du fournisseur : Terminal-Bench 3.0, DeepSWE, AutomationBench, CyberGym et le Z.ai Code Bench privé emploient des bancs d’essai décrits, mais sensibles à la configuration. Ce sont des indices utiles, pas des scores universels.
  • Il ne traite que le texte et réfléchit toujours : Le modèle ne peut pas examiner nativement des captures d’écran ni des interfaces enregistrées, et les requêtes qui tentent de désactiver le raisonnement échouent. Le niveau low aide pour les tâches simples, mais chaque requête paie tout de même une certaine latence de raisonnement.
  • La licence mérite d’être vraiment lue : L’usage commercial est largement autorisé, mais un opérateur MaaS et ses sociétés affiliées dépassant 10 milliards de dollars de chiffre d’affaires sur toute période consécutive de 12 mois doivent réussir l’examen de sécurité de Z.ai. Parlez de poids ouverts, pas d’open source sans réserve.
03

Aperçu des Benchmarks

Artificial Analysis Intelligence / Programmation / Agentique — 59,5 / 74,8 / 59,1

Ces données composites indépendantes placent GLM-5.3 devant Qwen3.8-Max, qui obtient 58,1 / 71,8 / 58,4, et confortent le nouvel ordre du classement du site.

Terminal-Bench 2.1 — 88,2 fournisseur ; environ 83,9 indépendant

L'écart illustre utilement la sensibilité au banc d'essai. Il faut citer l'exécuteur et la configuration plutôt que présenter un chiffre comme une propriété permanente du modèle.

Terminal-Bench 4.0 — 41,8 % ±3,2, #3

Le tout nouveau classement public des agents de terminal place GLM derrière Opus 5 et Fable 5, mais devant GPT-5.6 Sol et Grok 4.6. Qwen3.8-Max n'y figure pas encore : cette absence apporte un élément de contexte favorable, pas une comparaison directe.

DeepSWE v1.1 — 66,9 (test Z.ai)

Un signal solide pour le travail de longue haleine dans un dépôt, avec mini-swe-agent et un budget de six heures, mais que l'artefact public officiel n'a pas encore reproduit indépendamment.

GDPval-AA v2 — groupe de tête, Elo en direct

Les instantanés récents situent GLM-5.3 au milieu des 1700, avec des intervalles de confiance qui recouvrent ceux de GLM Flash et d'autres leaders. Datez la consultation, car l'Elo est recalibré.

04

Le Verdict

GLM-5.3 passe au n°5 en Programmation avec la note de 9,2, derrière Grok 4.6 et devant Qwen3.8-Max au n°6 ainsi que GLM-5.3-Flash au n°7. Ce changement repose sur les preuves : GLM devance Qwen dans les indices Intelligence, Programmation et Agentique d’Artificial Analysis, ainsi que dans les résultats Terminal-Bench 2.1 et DeepSWE publiés par Z.ai dans un même tableau comparatif. Choisissez-le pour les tâches difficiles et prolongées en texte et dans le terminal si vous pouvez financer l’API ou le cluster ; choisissez Flash si l’entrée multimodale et le coût comptent davantage.

05

Foire aux questions