Mise à jour du 25 juillet : Opus 5 fait passer Fable 5 au #3. Fable garde SWE-Bench Pro et de minuscules avances CursorBench/FrontierCode ; Opus 5 gagne Frontier-Bench et offre presque la parité à moitié prix par token. La revue de juin reste une preuve utile, pas l’ordre général actuel.
Il y a un chiffre qui rend cette revue facile à écrire : 80,3%. C’est Claude Fable 5 sur SWE-Bench Pro — le benchmark qui se moque des problèmes jouets et ne s’intéresse qu’à la capacité d’une IA à corriger de vrais bugs dans de vraies bases de code de production. GPT-5.5 obtient 58,6%. Le roi précédent, Opus 4.8, obtenait 69,2%. Fable 5 ne se contente pas de gagner — il gagne par une marge qui vous fait vérifier les chiffres deux fois.
Mais SWE-Bench Pro n’est que la moitié de l’histoire. FrontierCode Diamond — le benchmark de Cognition pour déterminer si les modèles peuvent écrire du code de production économe en tokens — raconte l’autre moitié. Fable 5 : 29,3%. Opus 4.8 : 13,4%. GPT-5.5 : 5,7%. Ce n’est pas une avance ; c’est un autre sport. Et le modèle atteint ces scores à effort de raisonnement modéré, ce qui signifie qu’il brûle moins de tokens pour produire un meilleur code. Le modèle cher qui est en réalité moins cher par tâche réelle.
L’étude de cas Stripe n’est pas un fantasme de communiqué de presse. Une base de code Ruby de 50 millions de lignes — le genre de monolithe qui fait transpirer les ingénieurs — a été migrée en une seule journée. Un travail qui aurait pris deux mois à une équipe complète. Le modèle a planifié, exécuté, auto-vérifié et livré. Sur CursorBench, le CEO de Cursor a déclaré qu’il avait « ouvert une classe de problèmes à long horizon qui étaient hors de portée des modèles précédents. » Sur le Senior Engineer Benchmark, il a obtenu 91/100 — tandis que GPT-5.5 et Opus 4.8 ont tous deux atterri dans les bas 60.
Voilà à quoi ressemble l’architecture de classe Mythos quand on l’enveloppe de garde-fous de sécurité et qu’on la confie aux développeurs. Les garde-fous sont réels — les requêtes sur la cybersécurité, la biologie et la chimie sont redirigées vers Opus 4.8 (toujours excellent, mais pas le moteur complet). Mais pour les 95%+ du travail de coding qui ne déclenche pas les classifieurs de sécurité, vous travaillez avec le modèle le plus capable jamais mis à la disposition du public. L’ère du coding agentique vient de trouver son champion incontesté.