Classé #2 Programmation — L'IA qui écrit du code de production
Anthropic

Claude Opus 5.5

Claude Opus 5.5 est le modèle de programmation à appeler quand le chantier est vaste et embrouillé : une migration de centaines de milliers de lignes, un bug qui traverse cinq services, un vieux système que plus personne ne comprend vraiment. Sur les benchmarks d'Anthropic, il devance GPT-6 Astra ; sur les tests indépendants, les deux sont à égalité. S'il n'est que deuxième chez nous, c'est uniquement parce qu'Astra accomplit le même travail en terminal avec beaucoup moins de tokens.

Mis à jour 27 septembre 2026 Agentic CodingTerminal-Bench 4.0FrontierCode 54.4%
9.9sur 10
Site officiel
Idéal pour

Claude Opus 5.5 est le modèle de programmation à appeler quand le chantier est vaste et embrouillé : une migration de centaines de milliers de lignes, un bug qui traverse cinq services, un vieux système que plus personne ne comprend vraiment. Sur les benchmarks d'Anthropic, il devance GPT-6 Astra ; sur les tests indépendants, les deux sont à égalité. S'il n'est que deuxième chez nous, c'est uniquement parce qu'Astra accomplit le même travail en terminal avec beaucoup moins de tokens.

Pourquoi ça Gagne

Anthropic annonce 66,4 % sur Terminal-Bench 4.0, 54,4 % sur FrontierCode v1.1 et 57,8 % sur CursorBench 4.0 – devant GPT-6 Astra sur les deux premiers. Les tests indépendants d'Artificial Analysis placent Opus 5.5 et Astra à égalité parfaite sur Terminal-Bench 4.0, à 59,6 %. Les premiers testeurs évoquent une migration de 680 000 lignes en moins d'une journée et un audit de 200 000 lignes en moins de trois heures. Les tokens coûtent 4 $/20 $, la lecture en cache 0,20 $.

À surveiller

En effort maximal, Opus 5.5 est bavard : Artificial Analysis a mesuré environ quatre fois plus de tokens de sortie par tâche que GPT-6 Astra, ce qui explique qu'Astra garde notre première place au coût par tâche terminée. Les garde-fous d'Anthropic confient la plupart des tâches de cybersécurité à Opus 4.8, et les sessions intensives peuvent toujours buter sur les plafonds d'usage des forfaits.

01

Ce que c'est réellement

Il y a une différence entre quelqu’un qui écrit du code et quelqu’un qui comprend un système.

La première personne voit une erreur qui dit undefined is not a function, entoure la ligne d’une condition if et passe à autre chose. Le plantage disparaît. Trois jours plus tard, autre chose casse, à un endroit où personne ne s’y attendait.

La seconde se demande pourquoi la valeur était indéfinie. Elle la suit à rebours à travers les services, découvre qu’une écriture en base de données se terminait avant qu’un message ne soit confirmé, et corrige l’ordre des opérations pour que cet état incohérent ne puisse plus jamais se produire.

Claude Opus 5.5 appartient clairement à la seconde catégorie. Sorti le 22 septembre 2026, il occupe la deuxième place de notre classement Programmation, plus près de la première qu’aucun modèle avant lui.

Son point fort : les chantiers vastes et embrouillés

Les récits des premiers testeurs d’Anthropic se ressemblent tous : d’énormes chantiers qui prenaient auparavant des semaines à une équipe.

  • Un testeur a bouclé une migration de code de 680 000 lignes en moins d’une journée.
  • Un autre a audité et corrigé une base de code de 200 000 lignes en moins de trois heures. Opus 5 avait eu besoin de plus de 20 heures et de 2,5 fois plus de tokens pour le même travail.
  • Lors d’un test interne, Opus 5.5 et Fable 5.1 ont tous deux réécrit de C en Rust HAProxy, le logiciel très répandu qui répartit le trafic web entre les serveurs, et tous deux ont passé presque tous les tests d’HAProxy lui-même. Opus 5.5 a terminé en 9 h 30 au lieu de 12 heures, pour un coût inférieur de 51 %.

Ce sont des anecdotes d’éditeur, pas des mesures indépendantes : voyez-y une indication de tendance plutôt qu’une garantie. Mais le schéma est constant : plus le chantier est vaste et désordonné, plus Opus 5.5 creuse l’écart.

Il sait aussi s’expliquer clairement. L’annonce d’Anthropic le montre en train de diagnostiquer un bug de facturation. Au lieu d’un mur de détails techniques, il commence par l’argent : 1,50 $ de la baisse de revenus d’un client venait d’un changement de tarif, et les 9,92 $ restants d’un bug dans un commit précis, qui cessait de comptabiliser l’utilisation du dernier jour de chaque mois. Quand un agent modifie votre code, ce sont des rapports de ce genre qui le gardent honnête.

Les benchmarks : une égalité, selon qui compte

C’est ici qu’il vaut la peine de ralentir, car tableaux d’éditeurs et tests indépendants ne racontent pas tout à fait la même histoire.

Les chiffres d’Anthropic (septembre 2026) :

  • Terminal-Bench 4.0, qui évalue un travail en plusieurs étapes dans un terminal en ligne de commande : Opus 5.5 obtient 66,4 % (±2,6 points). GPT-6 Astra obtient 57,9 %, chiffre communiqué par OpenAI.
  • FrontierCode v1.1, qui vérifie si les modifications de code sont assez bonnes pour être fusionnées : Opus 5.5 54,4 %, Astra 53,3 %.
  • CursorBench 4.0, qui couvre des tâches de programmation plus longues dans l’éditeur Cursor : Opus 5.5 57,8 %, Fable 5.1 51,8 %.

Les chiffres indépendants : Artificial Analysis a lui-même fait tourner Terminal-Bench 4.0 et obtenu 59,6 % pour Opus 5.5 comme pour Astra. Égalité parfaite.

Notre règle : les mesures indépendantes pèsent plus lourd que les tableaux des éditeurs. Sur la capacité brute, c’est donc une égalité. Le classement se joue ailleurs.

Pourquoi GPT-6 Astra garde la première place

Quand deux modèles se valent, nous les départageons selon ce que vous coûte une tâche terminée.

Là, Astra a un net avantage. En effort maximal, Artificial Analysis a mesuré qu’Opus 5.5 produisait environ 119 000 tokens de sortie par tâche, contre environ 27 000 pour Astra. Les tokens d’Opus sont moins chers (20 $ par million en sortie, contre 50 $ pour Astra), mais il en consomme environ quatre fois plus. Faites le calcul : à plein régime, une tâche moyenne d’Astra coûte à peu près moitié moins.

Anthropic avance un contre-argument légitime. Au niveau d’effort par défaut, Opus 5.5 égalerait Astra sur Terminal-Bench pour environ 40 % du coût, et le battrait sur FrontierCode pour environ 20 % du coût. Si des tests indépendants le confirment, le classement changera. Pour l’instant, c’est une affirmation d’éditeur, et nous attendons des données indépendantes avant de promouvoir un modèle.

Les limites, en toute honnêteté

  • Gardez l’effort maximal pour les problèmes difficiles. Laissé au maximum pour des corrections de routine, Opus 5.5 rédige de longs raisonnements que vous payez.
  • Le travail de sécurité est redirigé. Opus 5.5 est si fort en cybersécurité qu’Anthropic confie la plupart des tâches de sécurité à Opus 4.8, sauf si vous faites partie de son Cyber Verification Program. La correction de bugs normale n’est pas concernée.
  • Les longues sessions butent encore sur des plafonds. Anthropic a relevé les plafonds sur cinq heures des forfaits payants, mais un agent qui tourne des heures sur un gros dépôt peut toujours les atteindre.

Qui recruter ?

Faites appel à GPT-6 Astra si vous avez une file de tickets bien définis et que vous voulez les voir fermés au moindre coût.

Faites appel à Claude Opus 5.5 quand le travail est vaste, ambigu ou risqué : une migration de framework, un audit en profondeur ou un bug qui franchit les frontières entre services. Sur ces chantiers, un raisonnement soigneux vaut plus qu’une réponse laconique. C’est l’ingénieur à qui nous confierions le système auquel personne d’autre ne veut toucher.

02

Forces et limites honnêtes

Points Forts

  • Taillé pour les gros chantiers : les testeurs d’Anthropic l’ont utilisé pour une migration de code de 680 000 lignes bouclée en moins d’une journée, et pour un audit de 200 000 lignes en moins de trois heures, là où Opus 5 avait eu besoin de plus de 20 heures et de 2,5 fois plus de tokens. Plus le travail est vaste et désordonné, plus il prend l’avantage.
  • Il trouve le vrai bug : il remonte une panne jusqu’à sa source au lieu d’emballer le symptôme dans un try/catch. Dans l’exemple d’Anthropic, il explique un bug de facturation en langage clair : ce qui a cassé, quel commit l’a cassé et combien d’argent a été perdu.
  • Des modifications prêtes à fusionner : FrontierCode v1.1 vérifie si les modifications de code d’un modèle sont assez bonnes pour être intégrées à de vrais projets. Opus 5.5 obtient 54,4 % dans le tableau d’Anthropic, juste devant GPT-6 Astra à 53,3 %.
  • Des rapports qu’on lit vraiment : Anthropic a réentraîné la façon dont le modèle écrit. Les explications commencent par la conclusion et laissent tomber le jargon, ce qui accélère nettement la relecture du travail d’un agent.
  • Plus difficile à piéger : selon Anthropic, Opus 5.5 partage avec Fable 5.1 le plus faible taux de réussite des attaques par injection de prompt dans les tests de Gray Swan, et il est bien moins enclin que les modèles précédents à prendre des actions difficiles à annuler. C’est essentiel quand un agent travaille sans surveillance dans votre dépôt.

Limites Honnêtes

  • Bavard en effort maximal : Artificial Analysis a mesuré environ 119 000 tokens de sortie par tâche en effort maximal, contre environ 27 000 pour GPT-6 Astra. À score de pointe égal, Astra devient donc le modèle le moins cher par tâche terminée, malgré un tarif affiché plus élevé.
  • Les chiffres des éditeurs dominent encore : les 66,4 % de Terminal-Bench mis en avant proviennent de la propre exécution d’Anthropic (erreur type de ±2,6 points), et le chiffre de 57,9 % d’Astra retenu pour la comparaison est celui d’OpenAI. L’exécution indépendante d’Artificial Analysis montre une égalité, pas une avance.
  • Le travail de sécurité est redirigé : Opus 5.5 étant très performant en cybersécurité, la plupart des tâches de sécurité sont confiées à Opus 4.8, sauf si vous rejoignez le Cyber Verification Program d’Anthropic. La correction de bugs ordinaire n’est pas concernée.
  • Plafonds d’usage sur les longues sessions : Anthropic a relevé les plafonds sur cinq heures des forfaits payants, mais des exécutions d’agents de plusieurs heures sur de grosses bases de code peuvent encore les atteindre.
03

Aperçu des Benchmarks

Terminal-Bench 4.0 — 59,6 %, égalité indépendante avec Astra (66,4 % selon l'éditeur)

Des tâches complexes en plusieurs étapes dans un terminal en ligne de commande. Artificial Analysis a mesuré Opus 5.5 et GPT-6 Astra (xhigh) à 59,6 % chacun. La propre exécution d'Anthropic donne 66,4 % (±2,6) à Opus 5.5, contre 57,9 % pour Astra selon OpenAI.

FrontierCode v1.1 — 54,4 %

Les modifications de code sont-elles prêtes à être intégrées à de vraies bases de code ? Tableau de lancement d'Anthropic : Opus 5.5 54,4 %, GPT-6 Astra 53,3 %, Fable 5.1 50,3 %, Opus 5 48,0 %.

CursorBench 4.0 — 57,8 %

Des tâches de programmation plus longues dans l'éditeur Cursor. Anthropic annonce 57,8 %, contre 51,8 % pour Fable 5.1 et 41,7 % pour GPT-5.6 Sol.

Tokens de sortie par tâche — ~119k en effort maximal

Mesure d'Artificial Analysis en effort maximal, contre ~27k pour GPT-6 Astra. C'est la raison pour laquelle Astra garde notre première place : le même score de pointe pour environ la moitié du coût par tâche.

Prix — 4 $ / 20 $ par million de tokens, 0,20 $ en lecture de cache

La lecture en cache, qui domine la facture des agents de programmation, baisse de 60 % par rapport à Opus 5. Le mode rapide (jusqu'à 2,5 fois plus rapide) coûte 8 $/40 $.

04

Le Verdict

Claude Opus 5.5 est notre modèle de programmation n° 2, et l’écart avec le n° 1 n’a jamais été aussi mince. Sur le test indépendant Terminal-Bench, il fait jeu égal avec GPT-6 Astra ; sur les exécutions propres à Anthropic de FrontierCode et Terminal-Bench, il est devant. Nous gardons Astra en tête pour une raison que nous assumons publiquement : à plein régime, Astra accomplit le même travail avec environ un quart des tokens de sortie, donc chaque tâche terminée coûte moins cher. S’il s’agit d’une migration tentaculaire, d’un audit en profondeur ou d’un bug que personne d’autre ne trouve, c’est à Opus 5.5 que nous confierions le travail – et au niveau d’effort par défaut, il n’a jamais été aussi abordable.

05

Foire aux questions