Classé #6 Programmation — L'IA qui écrit du code de production
Z.ai (Zhipu AI)

GLM-5.3

Un bond de post-entraînement sur la même base, conçu pour la partie du code qui suit la première réponse. GLM-5.3 planifie, modifie, teste et récupère sur de longues missions. Les résultats et la capacité cyber sont solides, mais presque toutes les preuves datent du lancement.

Mis à jour 14 août 2026 Coding AgentLong-Horizon1M Context Evals
9.2sur 10
Site officiel
Idéal pour

Un bond de post-entraînement sur la même base, conçu pour la partie du code qui suit la première réponse. GLM-5.3 planifie, modifie, teste et récupère sur de longues missions. Les résultats et la capacité cyber sont solides, mais presque toutes les preuves datent du lancement.

Pourquoi ça Gagne

Z.ai annonce 28,3 à Terminal-Bench 3.0, 66,9 à DeepSWE, 42,5 à SWE-Marathon, 48,2 à AutomationBench et 28,5 à ALE-CLI. Son Code Bench privé montre davantage de réussite avec moins de tokens que 5.2 et, sur certains points, Opus 4.8.

À surveiller

Pas encore d'essais indépendants ni d'API générale ; Coding Plan reste l'accès principal. Le modèle est textuel, la réflexion ne peut être coupée et plusieurs tests profonds restent dominés par des systèmes fermés.

01

Ce que c'est réellement

Beaucoup de démonstrations s’arrêtent avant la difficulté. Le modèle dessine une interface propre ou écrit une fonction plausible, puis personne ne montre le troisième test qui échoue. GLM-5.3 vise l’après : lire l’erreur, revoir le plan, expérimenter encore et rester orienté jusqu’à un résultat vérifié.

Z.ai n’a pas agrandi la base. Il a multiplié les environnements exécutables, les tâches professionnelles et le calcul de post-entraînement sur de longues trajectoires. La base ressemble à un diplômé talentueux ; le post-entraînement à son apprentissage. L’un connaît le langage de l’ingénierie, l’autre apprend quand inspecter, tester ou abandonner une mauvaise idée.

Les chiffres racontent une histoire cohérente, mais fournisseur. Terminal-Bench passe de 4,6 à 28,3, DeepSWE de 46,2 à 66,9, SWE-Marathon de 19,4 à 42,5 et AutomationBench de 26,2 à 48,2. ALE-CLI atteint 28,5. La diversité compte plus qu’un score déclaré vérité absolue.

Le Code Bench privé ajoute l’économie. Max réussit 34,5 % vers 75 000 tokens, contre 23,4 % à 96 000 pour 5.2. High atteint 31,4 % vers 50 000, devant le point Opus 4.8 cité ; Fable 5 reste à 39,5 %. Les tâches privées empêchent la reproduction, mais posent la bonne question : combien de travail vérifié par temps et tokens ?

La capacité cyber surprend : 84,5 % à CyberGym, 54,4 % à ExploitBench, avec un écart persistant sur l’exploitation profonde. L’usage raisonnable est défensif : code autorisé, bac à sable, reproduction, correctif et tests. Ce n’est jamais une permission de viser le système d’autrui.

Tous les Coding Plans et ZCode proposent 5.3 à partir de 18 $ par mois, avec points variables selon entrée, cache, sortie et horaire. L’API générale arrive plus tard, donc la comparaison à l’usage reste floue.

Enfin, la réflexion est obligatoire. Low, high et max la dosent, mais l’ancien mode désactivé échoue. Sans vision native annoncée ni essais indépendants, le #6 convient : concurrent sérieux pour sessions longues, à opposer au modèle actuel sous exactement les mêmes outils et tests.

02

Forces et limites honnêtes

Points Forts

  • Entraîné pour finir le travail : les environnements imitent plusieurs jours d’expertise : diagnostiquer, modifier une vraie pile, expérimenter, préserver la correction et livrer un gain mesurable.
  • Gains publics variés : Terminal-Bench, DeepSWE, SWE-Marathon, AutomationBench et ALE-CLI progressent ; plusieurs familles longues valent mieux qu’un seul harnais favorable.
  • Courbe d’efficacité prometteuse : Max atteint 34,5 % à ~75K tokens contre 23,4 % à 96K pour 5.2 ; High obtient 31,4 % à 50K, au-dessus du point Opus cité. Fable 5 garde la meilleure qualité.
  • Le cyber aide la défense : découvrir, valider et corriger une faille sert la revue sécurisée. 84,5 % à CyberGym et 2 436 découvertes revues sont sérieux dans un cadre autorisé et isolé.
  • Compatible avec des agents connus : tous les Coding Plans et ZCode l’offrent ; Claude Code, OpenCode et d’autres clients sont annoncés. Low, high et max règlent l’effort.

Limites Honnêtes

  • Les tableaux ne sont pas un consensus : Z.ai documente les paramètres mais exécute ou rassemble l’essentiel. Il manque des comparaisons publiques à dépôt et coût identiques.
  • Pas de victoire générale : Fable 5 et Sol gagnent Terminal-Bench 3.0, Sol DeepSWE, Kimi K3 et Opus SWE-Marathon, Fable le test privé Max.
  • Accès incomplet : Coding Plan commence à 18 $, mais les points varient par token et horaire. Sans API générale, pas de comparaison simple à l’usage.
  • Réflexion obligatoire : thinking.type: disabled échoue. Ce changement incompatible ajoute de la latence et exige une migration.
  • Pas de flux visuel natif annoncé : captures, schémas et vidéos nécessitent un outil de vision externe ou un modèle multimodal.
03

Aperçu des Benchmarks

Terminal-Bench 3.0 — 28,3 (Z.ai)

Plus de six fois 4,6, mais sous Fable 5 à 33,7 et Sol à 34,6.

DeepSWE v1.1 — 66,9 (Z.ai)

+20,7 points, proche de Kimi K3 à 67,5 et sous Sol à 72,7.

SWE-Marathon v1.1 — 42,5 (Z.ai)

Plus du double de 19,4 et égal à Sol ; Kimi K3 et Opus 4.8 sont devant.

AutomationBench v1.0.6 — 48,2 (Z.ai)

Meilleur chiffre du tableau, signal utile encore sans réplication.

Z.ai Code Bench — 34,5 % en Max (privé)

Davantage de réussite avec moins de tokens que 5.2 ; preuve produit non reproductible.

04

Le Verdict

GLM-5.3 entre #6 en Code avec 9,2. Sa position reste volontairement sous son meilleur chiffre : preuves larges et documentées, mais pas encore indépendantes. Excellent candidat pour longs dépôts, terminal et revue défensive. Comparez-le au même dépôt, avec mêmes outils, temps, tests et revue. S’il livre davantage de travail vérifié par token, le saut est réel pour votre équipe.

05

Foire aux questions