Die meisten KI-Assistenten verhalten sich wie ein sehr flinker Praktikant. Sie antworten sofort und klingen dabei überzeugt. Gibt man ihnen einen vierzigseitigen Mietvertrag, liefern sie eine ordentliche Zusammenfassung – und übergehen genau die Klausel auf Seite 37, auf die es ankommt.
Claude Opus 5.5 verhält sich eher wie die erfahrene Kollegin, die erst das ganze Dokument liest. Danach sagt sie Ihnen in zwei Sätzen, wo das Problem liegt und wo es steht.
Anthropic hat Opus 5.5 am 22. September 2026 als erstes Modell der Claude-5.5-Familie veröffentlicht. Es übernimmt unseren Platz 1 im Alltags-Ökosystem aus einem einfachen Grund: Es ist das Modell, das in unseren Messungen am sorgfältigsten denkt – und es kostet nicht mehr wie ein Luxusartikel.
Was die unabhängigen Tests sagen
Zwei Zahlen tragen hier das meiste Gewicht, und beide stammen von Artificial Analysis, nicht aus Anthropics Marketing.
Die erste ist der Artificial Analysis Intelligence Index, ein Gesamtwert aus zehn anspruchsvollen Tests zu logischem Denken, Naturwissenschaft, Programmierung und Wissen. Bei maximalem Aufwand erreichte Opus 5.5 im September 2026 58 Punkte. Das war zum Start die Spitze der Rangliste, vor GPT-6 Astra und vor Anthropics eigenem Premium-Modell Claude Fable 5.1. (Der Index wird von Zeit zu Zeit neu skaliert. Ein Wert sagt deshalb nur etwas im Vergleich mit Modellen aus demselben Zeitraum.)
Die zweite ist GDPval-AA v2.1, und sie liegt näher am echten Arbeitsleben. Statt Quizfragen zu beantworten, erstellen die Modelle echte Arbeitsergebnisse – ein Tabellenmodell, ein juristisches Memo, ein Briefing – aus 44 Berufen. Die Ergebnisse werden im direkten Vergleich gegeneinander bewertet, ähnlich wie Schachspieler. Opus 5.5 kam auf 1846 Elo. Fable 5.1 erreichte 1735, Opus 5 1708 und GPT-6 Astra 1542.
Anthropics eigene Tests zeigen in dieselbe Richtung. In einem davon schrieben drei Modelle einen Bericht über die Quartalszahlen eines Unternehmens. Dafür nutzten sie eine Kopie des Webs, in der die Pressemitteilung zu den Zahlen schwer zu finden war, und jede erfundene Zahl oder jedes erfundene Zitat bedeutete: durchgefallen. Opus 5.5 bestand 16 von 18 Mal. Fable 5.1 und Opus 5 bestanden kein einziges Mal. Genau diese Qualität will man von einem Assistenten: nicht nur klug, sondern vorsichtig mit dem, was er behauptet.
Die Preisgeschichte, genau erzählt
Vielleicht haben Sie gelesen, Opus 5.5 sei „40 % günstiger“. Das stimmt – aber es lohnt sich zu verstehen, wie diese Zahl zustande kommt.
- Die Token-Preise sanken um 20 %: $4 pro Million Eingabe-Token und $20 pro Million Ausgabe-Token, vorher $5 und $25.
- Das Lesen aus dem Cache wurde um 60 % billiger: auf $0,20 pro Million. Wenn Sie immer wieder Fragen zum selben langen Dokument stellen, liest das Modell es aus einem Zwischenspeicher neu ein. Dieses erneute Lesen macht bei Agenten und Programmierwerkzeugen den größten Teil der Rechnung aus.
- Auf der Standardstufe verbraucht es weniger Token: Laut Anthropic landen typische Arbeitslasten dadurch rund 40 % unter Opus 5.
Zum Vergleich: Fable 5.1 kostet laut Preisliste $10/$50. Mit Opus 5.5 bekommen Sie den Großteil von Fables Fähigkeiten für 40 % des Token-Preises. Anthropic schreibt sogar, im eigenen Arbeitsalltag sei der Abstand zwischen beiden Modellen „kleiner, als diese Werte vermuten lassen“.
Es schreibt jetzt wie ein Mensch
Eine der häufigsten Beschwerden über Opus 5 war, dass seine Antworten schwer zu verfolgen waren: lang, voller Fachjargon, der entscheidende Punkt versteckt im vierten Absatz. Anthropic sagt, genau daran habe man gearbeitet. Opus 5.5 nennt zuerst das Ergebnis, wählt einfachere Worte und hält sich an die Stilregeln, die Sie ihm geben.
Das klingt nach Kosmetik, ist es aber nicht. Eine Antwort, die Sie in dreißig Sekunden lesen können, können Sie auch überprüfen. Eine brillante Antwort, die Sie erst entschlüsseln müssen, überfliegen Sie – und vertrauen ihr blind.
Der ehrliche Haken
Maximaler Aufwand ist durstig. Auf der höchsten Stufe erkundet Opus 5.5 viele Wege, bevor es antwortet. Artificial Analysis maß bei maximalem Aufwand rund 119.000 Ausgabe-Token pro Aufgabe, bei GPT-6 Astra dagegen etwa 27.000. Bei solchen Mengen garantiert ein niedrigerer Preis pro Token keine niedrigere Rechnung pro Antwort. Die Faustregel ist einfach: Lassen Sie es für die tägliche Arbeit auf der Standardstufe (mittel). Dort schlägt es laut Anthropic bei GDPval bereits Astra auf maximalem Aufwand – für etwa ein Fünftel der Kosten. Drehen Sie es nur hoch, wenn ein Problem wirklich schwierig ist.
Es erzeugt keine Bilder. Claude liest Diagramme, Screenshots und eingescannte PDFs sehr gut, erstellt aber weder Bilder noch Audio oder Video. Wer eine App für alles will, ist mit ChatGPT weiterhin breiter aufgestellt.
Manche Türen sind bewacht. Opus 5.5 ist in Cybersicherheit und Biologie so stark, dass Anthropic zusätzliche Schutzmechanismen einsetzt. Die meisten Sicherheitsaufgaben übernimmt im Hintergrund das ältere Opus 4.8, und manche biologische Forschung erfordert die Teilnahme an Anthropics Verifizierungsprogramm. Die meisten Menschen merken davon nie etwas; Sicherheitsteams schon.
Für wen es sich eignet
| Wenn Ihr Tag so aussieht … | Greifen Sie zu | Warum |
|---|---|---|
| Verträge, Recherche, Berichte, Finanzmodelle | Claude Opus 5.5 | Beste gemessene Wissensarbeit; überprüfbare Antworten |
| „Bediene diese Software auf meinem Computer und erledige die Aufgabe“ | GPT-6 Astra | Stärkerer und sparsamerer Agent für die Computerbedienung |
| Eine App für Chat, Bilder und Sprache | ChatGPT | Breitestes Angebot für Privatnutzer |
| Riesige Mengen einfacher Anfragen | GPT-6 Luna | Bruchteil eines Cents pro Aufgabe |
Das Alltagsfazit
Für kurze E-Mails und beiläufige Fragen reicht fast jeder moderne Assistent. Aber wenn die Dokumente unübersichtlich sind, die Frage mehrdeutig ist und eine falsche Antwort Folgen hat, ist Claude Opus 5.5 der Assistent, dem wir am meisten vertrauen – und zum ersten Mal ist dieses Vertrauen nicht mit einem Luxuspreis verbunden.