Guide classé

Programmation — L'IA qui écrit du code de production

Ce sont des agents de programmation, pas des gadgets d'autocomplétion. GPT-6 Astra mène parce qu'il accomplit le travail en terminal avec le moins de tokens, tandis que Claude Opus 5.5 fait jeu égal dans les tests indépendants et excelle sur les grosses bases de code embrouillées. Claude Sonnet 5.5 est l'option rapide, à moitié prix par token, pour les bugs et fonctionnalités bien délimités. GPT-6.1 Sol et Grok 4.7 offrent une programmation proche du sommet pour une fraction du prix, et GLM-5.3, GLM-5.3-Flash et Qwen3.8-Max complètent la sélection avec d'excellents rapports qualité-prix.

La décision d'abord

Notre classement

Commencez par le gagnant, puis comparez les compromis qui pourraient changer votre choix.

#1 Programmation

GPT-6 Astra

OpenAI

GPT-6 Astra s'empare de la couronne du code grâce au vote des développeurs et à l'épreuve du terrain : nouveau nº 1 sur la Code Arena d'Arena.ai (1 797 pts en WebDev), sessions de terminal, analyse d'incidents et configuration de poste en consommant environ un tiers des tokens de Sol.

Pourquoi ça Gagne

Nº 1 au classement général et en WebDev sur la Code Arena d'Arena.ai avec 1 797 pts (+35 pts d'avance sur Claude Fable 5.1 Max et +109 sur Opus 5 Max), nº 1 en Data & Analytics, Consumer Product et outils de création de contenu ; plus 57,7–57,9% sur Terminal-Bench 4.0, score record de 74,1% sur DeepSWE v1.1, 64,6% sur Terminal-Bench Science et 88% pass@1 / 99,2% pass@4 sur SRE-Bench.

L'Accroc

Sur le banc d'essai synthétique d'Artificial Analysis, Fable 5.1 devance encore légèrement Astra (70 contre 67), et SWE-Bench Pro demeure le bastion historique de Claude Fable. Le tarif API est de 10/50 $ (2,5× Sol), les lectures de cache coûtent quatre fois plus cher (1 $ contre 0,25 $ chez Fable 5.1), la concision néglige parfois la mise en forme des rapports et les garde-fous cyber ralentissent certains prompts d'analyse de vulnérabilités.

9.9 Note éditoriale
Lire l'avis
Idéal pour

GPT-6 Astra s'empare de la couronne du code grâce au vote des développeurs et à l'épreuve du terrain : nouveau nº 1 sur la Code Arena d'Arena.ai (1 797 pts en WebDev), sessions de terminal, analyse d'incidents et configuration de poste en consommant environ un tiers des tokens de Sol.

Pourquoi ça Gagne

Nº 1 au classement général et en WebDev sur la Code Arena d'Arena.ai avec 1 797 pts (+35 pts d'avance sur Claude Fable 5.1 Max et +109 sur Opus 5 Max), nº 1 en Data & Analytics, Consumer Product et outils de création de contenu ; plus 57,7–57,9% sur Terminal-Bench 4.0, score record de 74,1% sur DeepSWE v1.1, 64,6% sur Terminal-Bench Science et 88% pass@1 / 99,2% pass@4 sur SRE-Bench.

À surveiller

Sur le banc d'essai synthétique d'Artificial Analysis, Fable 5.1 devance encore légèrement Astra (70 contre 67), et SWE-Bench Pro demeure le bastion historique de Claude Fable. Le tarif API est de 10/50 $ (2,5× Sol), les lectures de cache coûtent quatre fois plus cher (1 $ contre 0,25 $ chez Fable 5.1), la concision néglige parfois la mise en forme des rapports et les garde-fous cyber ralentissent certains prompts d'analyse de vulnérabilités.

#2

Claude Opus 5.5

Anthropic

Claude Opus 5.5 est le modèle de programmation à appeler quand le chantier est vaste et embrouillé : une migration de centaines de milliers de lignes, un bug qui traverse cinq services, un vieux système que plus personne ne comprend vraiment. Sur les benchmarks d'Anthropic, il devance GPT-6 Astra ; sur les tests indépendants, les deux sont à égalité. S'il n'est que deuxième chez nous, c'est uniquement parce qu'Astra accomplit le même travail en terminal avec beaucoup moins de tokens.

9.9 Note éditoriale
Lire l'avis
#3

Claude Sonnet 5.5

Anthropic

Claude Sonnet 5.5 est le modèle de programmation qu'on peut laisser tourner toute la journée : rapide, deux fois moins cher par token qu'Opus 5.5, et assez bon pour que la plupart des corrections de bugs, des nouvelles fonctionnalités et des refactorisations n'aient jamais besoin du modèle phare. Évitez seulement de pousser le curseur d'effort à fond : à son réglage le plus haut, il écrit plus que tout autre modèle mesuré par Artificial Analysis, et certains résultats se dégradent.

9.8 Note éditoriale
Lire l'avis
#4

GPT-6.1 Sol

OpenAI

GPT-6.1 Sol est l'agent de programmation que vous pouvez laisser tourner toute la journée sans surveiller la facture. Lors de tests indépendants, il se classe à un ou deux points seulement de GPT-6 Astra, le modèle phare d'OpenAI, tout en coûtant moins d'un quart du prix pour une tâche classique. Le tarif des jetons reste inchangé par rapport à GPT-6 Sol (2 $ en entrée, 10 $ en sortie par million), mais relire du code en cache ne coûte désormais que 0,10 $ par million de jetons, ce qui représente une économie majeure pour les grands dépôts.

9.8 Note éditoriale
Lire l'avis
#5

Claude Fable 5.1

Anthropic

Le moteur de raisonnement de classe Mythos raffiné pour le codage par agents. Les mêmes poids que le Mythos 5.1 restreint, mais optimisé avec une réduction de cache de 75 % qui transforme l'économie de l'ingénierie à long terme. Déployé de manière optimale dans Claude Code, où son score AA Coding Agent de 70 domine le terrain.

9.8 Note éditoriale
Lire l'avis
#6

Grok 4.7

xAI

Grok 4.7 est le modèle de programmation sérieux le moins cher près du haut du classement. Pour 2 $ en entrée et 6 $ en sortie par million de tokens, il obtient 71,0 % sur DeepSWE et 46,3 % sur CursorBench 4.0, et il fonctionne nativement dans Cursor et Grok Build. C'est un excellent binôme de programmation au quotidien, mais pas encore l'agent qu'on laisse seul des heures dans un terminal.

9.7 Note éditoriale
Lire l'avis
#7

GLM-5.3

Z.ai (Zhipu AI)

Un agent de programmation poids lourd à poids ouverts, entraîné pour tout ce qui vient après la première réponse : planifier, modifier, tester, se remettre d'un échec et garder le cap pendant de longues interventions dans un dépôt.

9.2 Note éditoriale
Lire l'avis
#8

Qwen3.8-Max

Alibaba / Qwen Team

Un challenger de grande valeur, doué pour le contexte long et l'analyse visuelle en programmation, qui se classe désormais #6 après que des tests indépendants ont placé le modèle phare GLM-5.3 devant lui. Son point de contrôle de niveau Max téléchargeable reste remarquable, mais ses 2,4 billions de paramètres font de son auto-hébergement un projet digne d'un centre de données.

9.2 Note éditoriale
Lire l'avis
#9

GLM-5.3-Flash

Z.ai (Zhipu AI)

Des capacités de programmation et d'agent proches de la frontière à des prix exceptionnellement bas, avec vision native et contexte de 1M. Ici, « Flash » signifie efficace et bon marché — pas petit, ni particulièrement rapide.

9.2 Note éditoriale
Lire l'avis
Questions et réponses

Foire aux questions