Classé #3 IA locale / privée — Votre cerveau, votre machine, vos règles
Z.ai (Zhipu AI)

GLM-5.3

Le modèle local le plus intéressant que l'on ne peut pas encore télécharger. GLM-5.3 conserve la base MoE 744B de GLM-5.2 et progresse fortement en code et agents par le seul post-entraînement. Z.ai promet les poids environ deux semaines après le lancement ; jusque-là, c'est un service hébergé avec un avenir auto-hébergé crédible.

Mis à jour 14 août 2026 Weights Pending1M Context Evals744B MoE
9.2sur 10
Site officiel
Idéal pour

Le modèle local le plus intéressant que l'on ne peut pas encore télécharger. GLM-5.3 conserve la base MoE 744B de GLM-5.2 et progresse fortement en code et agents par le seul post-entraînement. Z.ai promet les poids environ deux semaines après le lancement ; jusque-là, c'est un service hébergé avec un avenir auto-hébergé crédible.

Pourquoi ça Gagne

Z.ai annonce 28,3 à Terminal-Bench 3.0, 66,9 à DeepSWE v1.1, 48,2 à AutomationBench et 84,5 % à CyberGym. Tous les gains viendraient d'environnements RL longs plus nombreux, sans agrandir la base 744B/~40B actifs.

À surveiller

Au lancement, ni poids publics, ni licence annoncée, ni API générale : l'accès passe par Coding Plan et ZCode. Les résultats sont surtout exécutés par le fournisseur, le modèle reste énorme et aucune vision native n'est annoncée.

01

Ce que c'est réellement

Imaginez un grand atelier qui progresse sans agrandir son bâtiment. Les outils restent en place ; les ouvriers apprennent à organiser une mission difficile, contrôler l’avancement et changer de plan après un échec. Voilà l’idée de GLM-5.3 : la même base que 5.2, mais un mois de post-entraînement intensif pour les longues tâches d’ingénierie.

Pour l’IA privée, la nuance compte. La taille d’un modèle ressemble à un loyer : chaque paramètre exige stockage, bande passante et exploitation. 5.3 ne réduit pas le loyer élevé de 5.2 ; il promet plus de savoir-faire dans le même bâtiment. Z.ai conserve 744 milliards de paramètres, environ 40 milliards actifs, et augmente environnements, diversité et RL via SAO et slime.

Les résultats suivent provisoirement ce récit. Terminal-Bench 3.0 monte de 4,6 à 28,3, DeepSWE de 46,2 à 66,9 et AutomationBench de 26,2 à 48,2. Il faut utiliser des outils, lire les effets puis se corriger. Un modèle brillant sur une réponse peut se perdre après vingt actions ; l’entraînement vise cette dérive.

La cybersécurité impressionne mais demande de la nuance. 84,5 % à CyberGym mène la découverte et la validation. 54,4 % à ExploitBench double 5.2, tandis que Fable 5 atteint 78,0 et Sol 76,5. GLM trouve mieux les portes dangereuses ; les meilleurs fermés parcourent encore mieux le labyrinthe derrière.

Le registre Z.ai recense 2 436 découvertes dans 269 projets, après revue et déduplication, dont 53 publiques au lancement. Cela reste une preuve conduite par le fournisseur, mais un registre inspectable vaut mieux qu’un slogan.

Le mot local doit rester exact. Aucun téléchargement le premier jour ; poids promis sous deux semaines, licence et API générale absentes. Coding Plan et ZCode sont les accès actuels. Une promesse de fichier n’est pas un fichier sur votre serveur.

Si Z.ai livre, le déploiement ressemblera à 5.2 : énorme mémoire, logiciel mature et quantification prudente. Les opérateurs de 5.2 auront une avance, mais les mesures exactes attendront les poids. D’où le #2 provisoire : DeepSeek V4 Flash demeure le premier choix honnête parce qu’il est exécutable aujourd’hui.

02

Forces et limites honnêtes

Points Forts

  • Vraie amélioration sur la même base : davantage d’environnements, de tâches et de calcul avec SAO et slime promettent plus de capacité sans augmenter l’empreinte à héberger.
  • Le travail long est central : Terminal-Bench passe de 4,6 à 28,3, DeepSWE de 46,2 à 66,9 et AutomationBench de 26,2 à 48,2—des tâches où l’agent agit, vérifie et corrige.
  • Le futur déploiement devrait être familier : la base inchangée fait du matériel GLM-5.2 une estimation logique : mémoire unifiée très élevée ou plusieurs GPU, pas un ordinateur portable ordinaire.
  • Les preuves de sécurité sont concrètes : Z.ai annonce 84,5 % à CyberGym et 54,4 % à ExploitBench ; son registre suit 2 436 découvertes revues dans 269 projets, dont 53 déjà publiques.
  • On peut tester avant de télécharger : tous les niveaux Coding Plan et ZCode donnent accès à 5.3, afin d’évaluer ses propres dépôts avant d’acheter l’infrastructure.

Limites Honnêtes

  • Il n’est pas local aujourd’hui : les poids sont promis environ deux semaines après le 14 août. Pour l’instant, « open weight » reste une intention.
  • Licence inconnue : la licence permissive de 5.2 ne garantit pas celle de 5.3. Il faut attendre la carte et les conditions effectives.
  • Matériel redoutable : 744B paramètres au total et ~40B actifs orientent vers 256 Go ou plusieurs GPU, même avec quantification.
  • Pas de réplication indépendante : Z.ai documente les harnais mais a produit ou assemblé l’essentiel des chiffres. Quelques évaluateurs tiers ne valident pas encore l’ensemble.
  • Texte d’abord, réflexion obligatoire : aucune vision native annoncée et impossible de couper la réflexion ; low, high et max ne font que la doser.
03

Aperçu des Benchmarks

Terminal-Bench 3.0 — 28,3 (Z.ai)

Bond depuis 4,6 ; Fable 5 à 33,7 et GPT-5.6 Sol à 34,6 restent devant.

DeepSWE v1.1 — 66,9 (Z.ai)

Contre 46,2 auparavant, près de Kimi K3 à 67,5 et sous Sol à 72,7.

AutomationBench v1.0.6 — 48,2 (Z.ai)

La hausse depuis 26,2 soutient l'argument des tâches longues.

CyberGym — 84,5 % (Z.ai)

Meilleur score de découverte du tableau, pas une mesure de toute la chaîne d'exploitation.

ExploitBench — 54,4 % (Z.ai)

Plus du double de 24,4, mais loin de Fable 5 à 78,0 et Sol à 76,5.

04

Le Verdict

GLM-5.3 entre #2 en IA locale/privée, devant GLM-5.2 mais derrière DeepSeek V4 Flash, plus petit et déjà téléchargeable. La trajectoire est remarquable, mais local signifie posséder les poids. Sans fichiers ni licence, pas de #1. Testez-le via Coding Plan puis attendez carte, licence, sommes de contrôle, support de serving et essais quantifiés indépendants avant de déployer.

05

Foire aux questions