Update vom 25. Juli: Opus 5 verschiebt Fable 5 auf #3. Fable behält das veröffentlichte SWE-Bench-Pro-Ergebnis und winzige CursorBench-/FrontierCode-Vorsprünge; Opus 5 gewinnt Frontier-Bench und liefert nahezu Gleichstand zum halben Tokenpreis. Das Juni-Review bleibt nützlicher Beleg, aber nicht die aktuelle Gesamtreihenfolge.
Es gibt eine Zahl, die dieses Review einfach zu schreiben macht: 80,3%. Das ist Claude Fable 5 auf SWE-Bench Pro — dem Benchmark, dem Spielzeugprobleme egal sind und der nur misst, ob KI echte Bugs in echten Produktions-Codebasen beheben kann. GPT-5.5 erreicht 58,6%. Der bisherige König, Opus 4.8, kam auf 69,2%. Fable 5 gewinnt nicht einfach — es gewinnt mit einem Vorsprung, bei dem man die Zahlen nochmal überprüft.
Aber SWE-Bench Pro ist nur die halbe Geschichte. FrontierCode Diamond — Cognitions Benchmark dafür, ob Modelle token-effizienten, produktionsreifen Code schreiben können — erzählt die andere Hälfte. Fable 5: 29,3%. Opus 4.8: 13,4%. GPT-5.5: 5,7%. Das ist kein Vorsprung; das ist eine andere Sportart. Und das Modell erreicht diese Werte bei mittlerem Reasoning-Aufwand, was bedeutet, dass es weniger Token verbrennt, um besseren Code zu produzieren. Das teure Modell, das pro realer Aufgabe tatsächlich günstiger ist.
Die Stripe-Fallstudie ist keine Pressemitteilungs-Fantasie. Eine 50-Millionen-Zeilen-Ruby- Codebasis — die Art von Monolith, bei der Entwickler ins Schwitzen kommen — wurde an einem einzigen Tag migriert. Arbeit, für die ein ganzes Team zwei Monate gebraucht hätte. Das Modell plante, führte aus, verifizierte sich selbst und lieferte ab. Auf CursorBench sagte Cursors CEO, es habe „eine Klasse von Langzeit-Problemen eröffnet, die für frühere Modelle unerreichbar waren." Auf dem Senior Engineer Benchmark erzielte es 91/100 — während GPT-5.5 und Opus 4.8 beide in den niedrigen 60ern landeten.
So sieht Mythos-Klasse-Architektur aus, wenn man sie in Sicherheitsleitplanken verpackt und Entwicklern in die Hand gibt. Die Leitplanken sind real — Anfragen zu Cybersicherheit, Biologie und Chemie werden an Opus 4.8 weitergeleitet (immer noch exzellent, aber nicht der volle Motor). Aber für die mehr als 95% der Programmierarbeit, die keine Sicherheitsklassifikatoren auslösen, arbeiten Sie mit dem leistungsfähigsten Modell, das je der Öffentlichkeit zugänglich gemacht wurde. Die Ära des agentischen Programmierens hat gerade ihren klarsten Champion bekommen.