Rang #3 Programmierung — KI, die Produktionscode schreibt
Anthropic

Claude Sonnet 5.5

Claude Sonnet 5.5 ist das Programmiermodell, das man den ganzen Tag laufen lassen kann: schnell, zum halben Tokenpreis von Opus 5.5 und gut genug, dass die meisten Bugfixes, Features und Refactorings das Spitzenmodell nie brauchen. Nur den Aufwandsregler sollte man nicht ganz aufdrehen – auf der höchsten Stufe schreibt es mehr als jedes Modell, das Artificial Analysis je gemessen hat, und manche Ergebnisse werden sogar schlechter.

Aktualisiert 29. September 2026 Agentic CodingTerminal-Bench 4.0 64%Claude Code
Am besten für

Claude Sonnet 5.5 ist das Programmiermodell, das man den ganzen Tag laufen lassen kann: schnell, zum halben Tokenpreis von Opus 5.5 und gut genug, dass die meisten Bugfixes, Features und Refactorings das Spitzenmodell nie brauchen. Nur den Aufwandsregler sollte man nicht ganz aufdrehen – auf der höchsten Stufe schreibt es mehr als jedes Modell, das Artificial Analysis je gemessen hat, und manche Ergebnisse werden sogar schlechter.

Warum es gewinnt

In unabhängigen Tests von Artificial Analysis erreicht es 64 % bei Terminal-Bench 4.0, knapp vor Opus 5.5 und GPT-6 Astra (je etwa 60 %). Anthropic meldet 52,1 % bei FrontierCode auf der Stufe xhigh und 55,5 % bei CursorBench 4.0, rund zwei Punkte hinter Opus 5.5. Vals AI führt es auf Platz 2 von 66 Modellen seines Index und auf Platz 1 bei Vibe Code Bench und Code Migration. Token kosten 2/10 US-Dollar, und die Ausgabe kommt über 30 % schneller als bei Sonnet 5.

Zu beachten

Auf der Stufe max verbrauchte es in den Tests von Artificial Analysis etwa 193.000 Ausgabe-Token pro Aufgabe – so viele wie kein anderes gemessenes Modell –, und sein FrontierCode-Ergebnis fällt von 52,1 % auf xhigh auf 46,2 % auf max. Anthropic selbst sagt, dass Opus 5.5 bei komplexer, offener Arbeit klar stärker bleibt. Riskantere Sicherheitsaufgaben fallen auf Sonnet 5 zurück, und API-Nutzer müssen beim Umstieg fünf inkompatible Änderungen beachten.

01

Was es wirklich ist

Stellen Sie sich zwei Tischler vor. Der eine ist der Meister, den man ruft, wenn ein Haus eine neue Treppe braucht und noch niemand die Pläne gezeichnet hat. Der andere ist der verlässliche Handwerker, der in einer Woche vierzig Türen einhängt – und jede davon sitzt im Lot.

Die meiste Arbeit eines Softwareteams besteht aus Türen, nicht aus Treppen: ein fehlschlagender Test, ein Formular, das ein neues Feld braucht, eine API, die ihren Namen geändert hat. Claude Sonnet 5.5 ist für die Türen gebaut.

Anthropic hat es am 28. September 2026 veröffentlicht, als zweites Modell der Claude-5.5-Familie, eine Woche nach Opus 5.5. Es behält den Preis von Sonnet 5 bei: 2 US-Dollar pro Million Eingabe-Token und 10 US-Dollar pro Million Ausgabe-Token – die Hälfte von Opus 5.5. Laut Anthropic läuft es über 30 % schneller als Sonnet 5 und kostet pro Aufgabe bis zu 30 % weniger, weil es mit weniger Schritten ans Ziel kommt.

Die unabhängigen Zahlen

Für Coding-Agenten vertrauen wir am meisten dem Terminal-Bench 4.0: lange, mehrstufige Aufgaben in einer echten Kommandozeile, bei denen das Modell Dinge installieren, ausführen, Fehlermeldungen lesen und es erneut versuchen muss.

Artificial Analysis hat den Test im September 2026 unabhängig durchgeführt. Sonnet 5.5 erreichte 64 %, knapp vor Opus 5.5 und GPT-6 Astra mit je etwa 60 %. Anthropics eigener Lauf liegt höher, bei 70,6 %, aber Hersteller-Testumgebungen schmeicheln meist den eigenen Modellen – die unabhängigen 64 % sind die Zahl, die man sich merken sollte. So oder so ist es ein gewaltiger Sprung gegenüber Sonnet 5, das in Anthropics Tabelle auf 10,3 % kam.

Eine zweite unabhängige Quelle bestätigt das Gesamtbild. Vals AI setzt Sonnet 5.5 mit 69,22 % auf Platz 2 von 66 Modellen seines Index – weniger als einen halben Punkt hinter Opus 5.5, bei etwa zwei Dritteln der Kosten pro Test. Auf zwei Coding-Ranglisten liegt es vorn: Vibe Code Bench (kleine Apps nach einer Beschreibung bauen) mit 92,39 % und Code Migration mit 69,83 %.

Was Anthropics eigene Tests ergänzen

Anthropics Starttabelle liefert die Details:

  • FrontierCode v1.1, das fragt, ob eine Code-Änderung ohne menschliches Zutun übernommen werden könnte: 52,1 % auf der Stufe xhigh. Opus 5.5 kommt auf 54,4 %, GPT-6 Sol auf 49,3 %.
  • CursorBench 4.0, gebaut aus echten Sitzungen im Editor Cursor: 55,5 %, etwa zwei Punkte hinter Opus 5.5 und weit vor den 34,1 % von Sonnet 5.

Aufschlussreicher sind die Kostendiagramme, die für jedes Modell das Ergebnis gegen die Kosten pro Aufgabe auf jeder Aufwandsstufe auftragen. Zwei Befunde stechen heraus. Auf der Stufe High, dem API-Standard, erreicht Sonnet 5.5 das beste FrontierCode-Ergebnis von GPT-6 Sol für etwa ein Fünftel der Kosten pro Aufgabe. Und auf der Stufe Medium, dem Standard in Claude Code, übertrifft es das beste Terminal-Bench-Ergebnis von Sonnet 5 für weniger als ein Zehntel der Kosten.

Frühe Tester beschreiben dasselbe in einfacheren Worten. Lovable sah ungefähr halb so viele Shell-Befehle pro Aufgabe. Slack maß etwa 14 % weniger Ausgabe-Token als bei Sonnet 5. Unity, wo eine Aufgabe erst dann als erledigt gilt, wenn die Änderung zur Laufzeit tatsächlich funktioniert, berichtet, dass der Großteil der Arbeit von Sonnet 5.5 diese Prüfung bestand.

Der Aufwandsregler – und warum die höchste Stufe nach hinten losgeht

Wie Opus 5.5 hat Sonnet 5.5 einen Aufwandsregler mit fünf Stufen: low, medium, high, xhigh und max. Höhere Stufen lassen das Modell länger nachdenken und seine Arbeit gründlicher prüfen. Man würde erwarten, dass max am besten ist. Bei Sonnet 5.5 ist das oft nicht so.

Artificial Analysis hat die ganze Bandbreite in seinem Intelligence Index gemessen:

Aufwand Intelligence Index Kosten pro Aufgabe
Low 36 0,41 $
Medium 41 0,59 $
High 47 1,08 $
Xhigh 52 2,74 $
Max 56 7,60 $

Der Schritt von xhigh auf max bringt vier Punkte mehr für fast die dreifachen Kosten. Auf max schrieb Sonnet 5.5 etwa 193.000 Ausgabe-Token pro Aufgabe. Das ist der höchste Wert, den Artificial Analysis je gemessen hat: rund 60 % mehr als Opus 5.5 auf max und etwa siebenmal so viel wie GPT-6 Astra.

Schlimmer noch: Mehr Aufwand heißt nicht immer besserer Code. Bei FrontierCode erreicht Sonnet 5.5 52,1 % auf xhigh, aber nur 46,2 % auf max. Anthropic erklärt den Grund in einer Fußnote: Auf max startete das Modell häufiger die Code-Review-Routine von Claude Code, die die Prüfung auf viele Hilfsagenten verteilt. In einigen Fällen lief das in einen Timeout oder führte zu zusätzlichen Änderungen über die Aufgabe hinaus – und FrontierCode bestraft Änderungen, um die niemand gebeten hat.

Die Lehre ist einfach: Behandeln Sie xhigh als Obergrenze. Scheitert eine Aufgabe auch auf xhigh, ist der bessere nächste Schritt meist Opus 5.5, nicht max.

Der ehrliche Haken

Opus bleibt der Architekt. Anthropic sagt es offen: In mehreren Tests kommt Sonnet 5.5 auf max nahe an Opus 5.5 heran, doch in Anthropics eigenen Tests und denen externer Tester bleibt Opus 5.5 bei komplexer, offener Arbeit, die anhaltendes Urteilsvermögen verlangt, klar stärker. Auch bei FrontierCode und CursorBench behält Opus die Führung.

Die Claude-Code-Rechnung halbiert sich nicht. Coding-Agenten lesen Ihr Projekt ständig neu, und diese Lesevorgänge werden als Cache-Lesezugriffe abgerechnet – bei Sonnet 5.5 wie bei Opus 5.5 für 0,20 US-Dollar pro Million Token. Sie sparen bei neuer Eingabe und Ausgabe, aber eine lange, cache-lastige Sitzung spart weniger, als der „halbe Preis“ in der Schlagzeile vermuten lässt.

Sicherheitsarbeit wird umgeleitet. Sonnet 5.5 ist das erste Sonnet-Modell, das mit den Cyber-Schutzmechanismen ausgeliefert wird, die Anthropic bei seinen Spitzenmodellen einsetzt. Gewöhnliches Bugfixing ist nicht betroffen, doch riskantere Sicherheitsaufgaben fallen sichtbar auf Sonnet 5 zurück, sofern Ihr Team nicht über Anthropics Cyber Verification Program freigeschaltet ist.

Der Umstieg kostet etwas Arbeit. Anthropic nennt fünf inkompatible Änderungen gegenüber Sonnet 5. Erzwungene Tool-Nutzung liefert jetzt einen Fehler, nicht standardmäßige Temperature-Werte werden abgelehnt, und Text zwischen Tool-Aufrufen kommt in einem anderen Format zurück. Nichts davon ist schwer zu beheben, aber es ist kein Modelltausch in einer Zeile.

Wo es hinpasst

Wenn die Aufgabe … ist Nehmen Sie Warum
ein klar umrissener Bug, ein Feature oder eine Migration Claude Sonnet 5.5 Schnell und günstig auf Medium oder High
offene Architektur oder ein Problem, das noch niemand eingegrenzt hat Claude Opus 5.5 Klar stärkeres Urteilsvermögen, laut Anthropic und Testern
lange unbeaufsichtigte Terminal-Arbeit zu den geringsten Kosten pro Aufgabe GPT-6 Astra Braucht in der Spitze nur einen Bruchteil der Token
Frontend-Feinschliff, Folien, kleine visuelle Projekte Claude Sonnet 5.5 Gutes Gespür für Design und schnelle Iteration

Das Fazit

Claude Sonnet 5.5 ist das Modell, das die meisten Entwickler eingeschaltet lassen sollten. Es erledigt die Türen, alle vierzig, schnell und zum halben Tokenpreis des Spitzenmodells. Lassen Sie es auf Medium oder High laufen, nehmen Sie xhigh für die schweren Fälle – und wenn sich der Auftrag als Treppe entpuppt, rufen Sie Opus.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Unabhängige Terminal-Ergebnisse: Artificial Analysis maß im September 2026 64 % bei Terminal-Bench 4.0, knapp vor Opus 5.5 und GPT-6 Astra mit etwa 60 %. Das ist der unabhängige Test, der die meisten Vergleiche von Coding-Agenten entscheidet – und Sonnet 5.5 schnitt dort gut ab, zum halben Tokenpreis von Opus.
  • Günstig bei vernünftigen Einstellungen: Anthropics Diagramme zeigen: Auf der Stufe High, dem API-Standard, erreicht Sonnet 5.5 das beste FrontierCode-Ergebnis von GPT-6 Sol für etwa ein Fünftel der Kosten pro Aufgabe. Bei Terminal-Bench übertrifft schon die Stufe Medium das beste Ergebnis von Sonnet 5 für weniger als ein Zehntel der Kosten.
  • Kommt mit weniger Schritten ans Ziel: Frühe Tester berichten dasselbe Muster. Slack maß etwa 14 % weniger Ausgabe-Token als bei Sonnet 5, Lovable sah ungefähr halb so viele Shell-Aufrufe pro Aufgabe, und in einem Test von Balyasny brauchte es rund 121.000 Token pro Antwort, wo Sonnet 5 497.000 verbrauchte.
  • Stark bei Migrationen und schnellen Builds: Vals AI setzt Sonnet 5.5 bei Vibe Code Bench (92,39 %) und Code Migration (69,83 %) auf Platz 1 und im Vals Index insgesamt auf Platz 2 – bei etwa zwei Dritteln der Kosten pro Test von Opus 5.5.
  • Ein gutes Auge für Oberflächen: Anthropic bescheinigt Sonnet 5.5 ein ausgeprägtes Gespür für Design: Es kann Benutzeroberflächen den letzten Schliff geben und Folienvorlagen so genau folgen, dass kaum Nacharbeit nötig ist. Außerdem kommt die Ausgabe über 30 % schneller als bei Sonnet 5, was schnelles Hin-und-her-Bearbeiten angenehm macht.

Ehrliche Einschränkungen

  • Die Stufe max ist eine Falle: Artificial Analysis maß auf max etwa 193.000 Ausgabe-Token pro Aufgabe – rund 60 % mehr als Opus 5.5 auf max und etwa siebenmal so viel wie GPT-6 Astra. Auf dieser Stufe schmilzt der Preisvorteil gegenüber Opus fast vollständig weg.
  • Mehr Aufwand, schlechtere Merges: Bei FrontierCode, das prüft, ob Änderungen ohne menschliche Nacharbeit übernommen werden könnten, meldet Anthropic 52,1 % auf xhigh, aber nur 46,2 % auf max. Auf max startete das Modell häufiger eine Code-Review-Routine, die sich auf viele Hilfsagenten verteilt – was manchmal in einen Timeout lief oder über die Aufgabe hinaus Code änderte.
  • Nicht der Architekt: Laut Anthropic bleibt Opus 5.5 bei komplexer, offener Arbeit, die anhaltendes Urteilsvermögen erfordert, klar stärker. Opus führt außerdem bei FrontierCode (54,4 %) und CursorBench (57,8 %).
  • Sicherheitsarbeit wird umgeleitet: Riskantere Cybersicherheitsaufgaben fallen sichtbar auf Sonnet 5 zurück. Gewöhnliches Bugfixing ist nicht betroffen, und verifizierte Sicherheitsteams können erweiterten Zugang beantragen.
  • Kein reiner Modelltausch in der API: Anthropic nennt fünf inkompatible Änderungen gegenüber Sonnet 5, darunter Fehler bei erzwungener Tool-Nutzung und bei nicht standardmäßigen Temperature-Werten. Vor dem Umstieg von Produktionscode lohnt ein Blick in den Migrationsleitfaden.
03

Benchmark-Übersicht

Terminal-Bench 4.0 — 64 % unabhängig (70,6 % laut Hersteller)

Mehrstufige Arbeit in einem Kommandozeilen-Terminal. Artificial Analysis maß 64 %, gegenüber etwa 60 % für Opus 5.5 und GPT-6 Astra (xhigh). Anthropics eigener bester Lauf liegt bei 70,6 %, gegenüber 66,4 % für Opus 5.5 auf xhigh und 10,3 % für Sonnet 5.

FrontierCode v1.1 — 52,1 % auf xhigh, 46,2 % auf max

Ob Code-Änderungen reif zum Übernehmen sind. Anthropics Tabelle: Opus 5.5 54,4 %, GPT-6 Sol 49,3 %, Sonnet 5 42,4 %. Sonnet 5.5 schneidet auf max schlechter ab als auf xhigh.

CursorBench 4.0 — 55,5 %

Mehrdeutige Aufgaben über mehrere Dateien, entnommen aus echten Cursor-Sitzungen. Anthropic meldet 57,8 % für Opus 5.5 und 34,1 % für Sonnet 5.

Vals Index — 69,22 % (Platz 2 von 66)

Unabhängiger Index von Vals AI, 0,47 Punkte hinter Opus 5.5 und vor Fable 5.1, bei 20,80 US-Dollar pro Test gegenüber 32,77 US-Dollar für Opus 5.5. Platz 1 bei Vibe Code Bench und Code Migration.

Ausgabe-Token pro Aufgabe — ca. 193.000 auf max

Messung von Artificial Analysis über seinen Intelligence Index, der höchste je erfasste Wert: etwa 60 % über Opus 5.5 (max) und etwa siebenmal so viel wie GPT-6 Astra (max).

Preis — 2 / 10 US-Dollar pro 1 Mio. Token, 0,20 US-Dollar Cache-Lesen

Unverändert gegenüber Sonnet 5 und die Hälfte der 4/20 US-Dollar von Opus 5.5. Cache-Lesezugriffe kosten dieselben 0,20 US-Dollar wie bei Opus, daher sparen cache-lastige Coding-Sitzungen weniger, als der Listenpreis vermuten lässt. Batch-Anfragen sind 50 % günstiger.

04

Das Fazit

Claude Sonnet 5.5 ist das Modell, das man für die tägliche Entwicklungsarbeit laufen lassen sollte: klar umrissene Bugs, Features, Migrationen und Frontend-Arbeit, auf den Stufen Medium oder High, wo es schnell und günstig ist. Es rangiert knapp hinter GPT-6 Astra und Opus 5.5, weil es sein bestes unabhängiges Terminal-Ergebnis auf der Stufe max erzielt – genau dort, wo es die meisten Token verbrennt und seine Merge-Qualität sinkt. Bleiben Sie unter max und überlassen Sie offene Architekturfragen Opus 5.5.

05

Häufig gestellte Fragen