Es gibt einen Unterschied zwischen jemandem, der Code schreibt, und jemandem, der ein System versteht.
Die erste Person sieht die Fehlermeldung undefined is not a function, setzt eine if-Prüfung um die Zeile und macht weiter. Der Absturz verschwindet. Drei Tage später bricht etwas anderes zusammen, an einer Stelle, mit der niemand gerechnet hat.
Die zweite Person fragt, warum der Wert undefiniert war. Sie verfolgt ihn durch die Dienste zurück, findet heraus, dass ein Datenbank-Schreibvorgang abgeschlossen war, bevor eine Nachricht bestätigt wurde, und korrigiert die Reihenfolge, sodass der fehlerhafte Zustand gar nicht mehr entstehen kann.
Claude Opus 5.5 gehört eindeutig zur zweiten Sorte. Es erschien am 22. September 2026 und steht auf Platz 2 unserer Programmier-Rangliste – näher an Platz 1 als je ein Modell zuvor.
Worin es gut ist: große, verworrene Aufgaben
Die Berichte von Anthropics frühen Testern folgen alle demselben Muster: große Aufgaben, für die früher ein ganzes Team Wochen brauchte.
- Ein Tester schloss eine Code-Migration über 680.000 Zeilen in weniger als einem Tag ab.
- Ein anderer prüfte und reparierte eine Codebasis mit 200.000 Zeilen in unter drei Stunden. Opus 5 brauchte für dieselbe Aufgabe mehr als 20 Stunden und 2,5-mal so viele Token.
- In einem internen Test schrieben Opus 5.5 und Fable 5.1 beide HAProxy, die weit verbreitete Software zur Lastverteilung von Webverkehr, von C nach Rust um, und beide bestanden fast alle HAProxy-eigenen Tests. Opus 5.5 war nach 9,5 statt 12 Stunden fertig, bei 51 % niedrigeren Kosten.
Das sind Anekdoten des Herstellers, keine unabhängigen Messungen – betrachten Sie sie also als Hinweis auf die Richtung, nicht als Garantie. Aber das Muster ist eindeutig: Je größer und chaotischer die Aufgabe, desto weiter zieht Opus 5.5 davon.
Außerdem erklärt es sich verständlich. Anthropics Ankündigung zeigt, wie es einen Abrechnungsfehler diagnostiziert. Statt einer Wand aus technischen Details beginnt es mit dem Geld: $1,50 des Umsatzrückgangs bei einem Kunden gingen auf eine Preisänderung zurück, die übrigen $9,92 auf einen Fehler in einem bestimmten Commit, der die Nutzung am letzten Tag jedes Monats nicht mehr mitzählte. Wenn ein Agent Ihren Code verändert, halten genau solche Berichte ihn ehrlich.
Die Benchmarks: ein Gleichstand – je nachdem, wer zählt
Hier lohnt es sich, langsamer zu werden, denn Herstellertabellen und unabhängige Tests erzählen leicht unterschiedliche Geschichten.
Anthropics Zahlen (September 2026):
- Terminal-Bench 4.0 prüft mehrstufige Arbeit in einem Kommandozeilen-Terminal. Opus 5.5 erreichte 66,4 % (±2,6 Punkte), GPT-6 Astra 57,9 % – ein Wert, den OpenAI selbst gemeldet hat.
- FrontierCode v1.1 prüft, ob Code-Änderungen gut genug zum Übernehmen sind: Opus 5.5 54,4 %, Astra 53,3 %.
- CursorBench 4.0 umfasst längere Programmieraufgaben im Editor Cursor: Opus 5.5 57,8 %, Fable 5.1 51,8 %.
Unabhängige Zahlen: Artificial Analysis hat Terminal-Bench 4.0 selbst durchgeführt und 59,6 % für Opus 5.5 wie für Astra gemessen. Ein exakter Gleichstand.
Unsere Regel lautet: Unabhängige Messungen zählen mehr als Herstellertabellen. Bei der reinen Fähigkeit steht es damit unentschieden. Also entscheidet etwas anderes über die Rangfolge.
Warum GPT-6 Astra Platz 1 behält
Wenn zwei Modelle gleich gut sind, ordnen wir sie danach, was Sie eine erledigte Aufgabe kostet.
Hier hat Astra einen klaren Vorteil. Bei maximalem Aufwand maß Artificial Analysis für Opus 5.5 rund 119.000 Ausgabe-Token pro Aufgabe, für Astra etwa 27.000. Die Token von Opus sind billiger ($20 pro Million Ausgabe-Token gegenüber $50 bei Astra), aber es braucht etwa viermal so viele. Rechnet man das durch, kostet eine durchschnittliche Astra-Aufgabe bei Höchstleistung ungefähr die Hälfte.
Anthropic hält ein berechtigtes Argument dagegen. Auf der Standardstufe erreiche Opus 5.5 bei Terminal-Bench dasselbe wie Astra für etwa 40 % der Kosten und schlage es bei FrontierCode für etwa 20 % der Kosten. Bestätigen unabhängige Tests das, ändert sich die Rangfolge. Bis dahin ist es eine Herstellerangabe, und wir warten auf unabhängige Daten, bevor wir ein Modell nach oben setzen.
Die ehrlichen Einschränkungen
- Heben Sie den maximalen Aufwand für schwierige Probleme auf. Bleibt Opus 5.5 bei Routinekorrekturen auf maximaler Stufe, schreibt es lange Denkprotokolle, die Sie bezahlen.
- Sicherheitsarbeit wird umgeleitet. Opus 5.5 ist in Cybersicherheit so stark, dass Anthropic die meisten Sicherheitsaufgaben an Opus 4.8 weitergibt, sofern Sie nicht am Cyber Verification Program teilnehmen. Normale Fehlerbehebung ist nicht betroffen.
- Lange Sitzungen stoßen weiter an Grenzen. Anthropic hat die Fünf-Stunden-Limits in den bezahlten Tarifen angehoben, aber ein mehrstündiger Agentenlauf über ein großes Repository kann trotzdem daran stoßen.
Wen Sie einstellen sollten
Nehmen Sie GPT-6 Astra, wenn Sie eine Warteschlange klar umrissener Tickets haben und diese so günstig wie möglich erledigt sehen wollen.
Nehmen Sie Claude Opus 5.5, wenn die Arbeit groß, mehrdeutig oder riskant ist: eine Framework-Migration, ein tiefes Audit oder ein Fehler, der über Dienstgrenzen hinweg auftritt. Bei solchen Aufgaben ist sorgfältiges Denken mehr wert als knappe Ausgaben. Es ist der Entwickler, dem wir das System anvertrauen würden, das sonst niemand anfassen will.