Stellen Sie sich eine Baustelle mit zwei Kranführern vor.
Der eine ist der Veteran, der für den Hebevorgang geholt wird, an den sich sonst niemand herantraut: der Stahlträger, der bei Seitenwind zwischen zwei Türmen eingefädelt werden muss. Der andere Bediener ist fast genauso gut und verlangt einen Bruchteil des Tagessatzes. Für jeden gewöhnlichen Hebevorgang, Paletten mit Ziegeln, Dachstühle, die alltägliche Arbeit, wären Sie töricht, den Veteranen zu buchen.
GPT-6.1 Sol ist der zweite Bediener, und in diesem Monat ist der Abstand zwischen den beiden sehr klein geworden.
Eine Veröffentlichung, die aus einer Absage entstand
OpenAI stellte GPT-6.1 Sol am 29. September 2026 auf seinem DevDay-Event vor, nur eine Woche nach GPT-6 Sol. Das Timing hatte eine Vorgeschichte. Am Tag zuvor hatte OpenAI die geplante Einführung von GPT-6.1 Astra abgesagt, nachdem interne Tests ergeben hatten, dass dieses Modell nicht zuverlässig innerhalb des Umfangs und der Berechtigungen seiner Aufgaben blieb. Sol 6.1 ist ein separates, kleineres Modell, und sein eigener Sicherheitsbericht sieht sauberer aus: Im Test von OpenAI, ob ein Agent zugibt, dass sein Suchwerkzeug defekt ist, anstatt zu raten, versäumte GPT-6.1 Sol dies in 2,1 % der Fälle, verglichen mit 4,9 % bei GPT-6 Sol und 1,5 % bei GPT-6 Astra.
Das Verkaufsargument von OpenAI ist kurz: Intelligenz nahe Astra zu einem Fünftel des Preises.
Ist es wirklich nah an Astra?
Das ist der Teil, der zählt, und ausnahmsweise müssen wir uns nicht auf das Wort des Anbieters verlassen.
Artificial Analysis, ein unabhängiges Testunternehmen, führte seine Benchmarks am Tag der Veröffentlichung durch. Auf seinem Intelligence Index, einer Kombination aus zehn schwierigen Evaluierungen, erzielte GPT-6.1 Sol bei maximalem Aufwand 52 Punkte, einen Punkt hinter den 53 von GPT-6 Astra und vier Punkte vor GPT-6 Sol. Auf dem Coding Agent Index ist das Ergebnis noch enger: Bei maximalem Aufwand (Max Effort) liegt Sol 2 Punkte hinter Astra, und bei der zweithöchsten Einstellung, xhigh, übertraf es Astra um einen Punkt für weniger als 15 % der Kosten pro Aufgabe.
Cognition, das Unternehmen hinter dem Coding-Agenten Devin, testete es auf FrontierCode 1.1, einem Benchmark, der eine strenge Frage stellt: Würde ein Senior Engineer diese Änderung tatsächlich mergen? Das beste Ergebnis von GPT-6.1 Sol liegt bei 60,4 % und entspricht im Wesentlichen dem von GPT-6 Sol (60,7 %). Der Unterschied liegt in den Kosten. Bei mittlerem Aufwand gibt es 0,31 $ pro Aufgabe aus, 81 % weniger als GPT-6 Sol bei maximalem Aufwand ausgab, um sein Bestes zu erreichen. Bei niedrigem Aufwand erreicht es 58,1 % für nur 0,21 $, ein Anstieg gegenüber den 50,5 % von GPT-6 Sol bei derselben Einstellung.
Die eigenen Zahlen von OpenAI weisen in dieselbe Richtung. Bei DeepSWE v1.1, komplexen Engineering-Aufgaben in echten Codebasen, zeigt ihre Tabelle 75,2 % bei hohem Aufwand (High Effort) für 0,65 $ pro Aufgabe. Das sind 6,4 Punkte mehr als der Bestwert von GPT-6 Sol und ein Hauch mehr als Astras Bestwert (74,1 %), der 4,43 $ pro Aufgabe kostet. Eine Merkwürdigkeit ist erwähnenswert: Bei xhigh und max erzielt GPT-6.1 Sol tatsächlich ein niedrigeres Ergebnis, nämlich 71,9 %. Mehr Nachdenken bedeutet nicht immer besseres Nachdenken.
Die ehrliche Zusammenfassung lautet also: Programmieren ungefähr auf Astra-Niveau und die gleiche Merge-Qualität wie das Sol von letzter Woche, jedoch zu einem viel niedrigeren Preis pro erledigtem Job.
Warum der Cache-Preis die eigentliche Schlagzeile ist
Ein Coding-Agent liest Ihr Projekt nie nur einmal. Jedes Mal, wenn er einen Test ausführt, den Fehler liest und es erneut versucht, liest er dieselben Dateien, Anweisungen und den Verlauf erneut. Während einer langen Sitzung kann dies bedeuten, dass dieselben paar hunderttausend Token Dutzende Male in das Modell zurückfließen.
Das deckt die gecachte Eingabe (Cached Input) ab: Text, den das Modell in dieser Sitzung kürzlich gesehen hat. GPT-6.1 Sol berechnet 0,10 $ pro Million im Cache gespeicherter Token, 95 % Rabatt auf die normalen 2 $ und die Hälfte des Cache-Preises von GPT-6 Sol. Normale Eingabe- und Ausgabepreise bleiben bei 2 $ und 10 $ pro Million, einem Fünftel der 10 $/50 $ von GPT-6 Astra.
Zählen Sie das zusammen, erhalten Sie die wichtigste Zahl: Artificial Analysis hat gemessen, dass die Ausführung ihres Index mit GPT-6.1 Sol etwa 0,72 $ pro Aufgabe kostet, verglichen mit 3,26 $ für GPT-6 Astra, 5,98 $ für Claude Opus 5.5 und 7,60 $ für Claude Sonnet 5.5. Eine Vorsichtsmaßnahme: Prompts, die länger als 272.000 Token sind, kosten das Doppelte für die Eingabe und das 1,5-fache für die Ausgabe, so dass wirklich gigantische Einzelanfragen teurer werden.
Drehen Sie den Regler nicht ganz auf
GPT-6.1 Sol hat fünf Aufwandsstufen: low, medium (der Standard), high, xhigh und max. Man neigt zu der Annahme, dass Max immer am besten ist. Auf dem Coding Agent Index von Artificial Analysis ist dies nicht der Fall: xhigh erzielte ein höheres Ergebnis als max, und es kostet weniger. Für Routinekorrekturen ist “low” oder “medium” oft ausreichend, wie das Ergebnis von Cognition mit 58,1 % für 0,21 $ zeigt. Heben Sie sich “xhigh” für die Probleme auf, die wirklich die zusätzliche Denkarbeit benötigen.
Die ehrlichen Grenzen
- Besserer Wert, nicht besserer Code. Auf FrontierCode 1.1 bleibt die Merge-Qualität gegenüber GPT-6 Sol und GPT-5.6 Sol unverändert. Wenn Ihr Problem darin bestand, dass die Patches von Sol nicht gut genug waren, behebt 6.1 dies nicht. Es macht dieselben Patches viel billiger.
- Wissenschaft ist immer noch Astras Job. Auf OpenAIs Terminal-Bench Science 0.1, Datenanalyse, Simulationen und Beweisführung in einem Terminal, erzielt GPT-6.1 Sol bei maximalem Aufwand 57,0 %. Das ist mehr als das Doppelte der 27,6 % von GPT-6 Sol, aber weit hinter GPT-6 Astra (68,1 %) und Claude Opus 5.5 (63,3 %). Es kostet 5,47 $ pro Aufgabe, im Vergleich zu etwa 23 $ für jeden der Konkurrenten.
- Claude punktet auf dem breiten Index höher. Claude Opus 5.5 (58) und Claude Sonnet 5.5 (56) liegen auf dem Intelligence Index von Artificial Analysis weiterhin vor GPT-6.1 Sol (52), und obwohl Artificial Analysis einen Gewinn von 12 Punkten im Terminal-Bench 4.0 für GPT-6.1 Sol gegenüber GPT-6 Sol gemessen hat, sind die 64 % von Sonnet in diesem Test immer noch höher. Sonnet erreicht dies, indem es weitaus mehr Token verbrennt, sodass Sol bei den Kosten pro Aufgabe gewinnt.
- Nicht im regulären Chat. In ChatGPT ist GPT-6.1 Sol in ChatGPT Work und Codex für Nutzer der Tarife Plus, Pro, Business, Enterprise und Edu verfügbar. Entwickler verwenden es in der API als
gpt-6.1-sol. OpenAI sagt, dass ein schnellerer “Ultrafast”-Modus für Codex in Arbeit ist, aber er ist noch nicht live.
Wer sollte es nutzen
| Wenn Ihre Arbeit so aussieht… | Greifen Sie zu | Warum |
|---|---|---|
| Bugs, Tests, Refactorings, Agenten, die den ganzen Tag in CI laufen | GPT-6.1 Sol | Programmieren auf nahezu Astra-Niveau zu einem Bruchteil der Kosten pro Aufgabe |
| Wissenschaftliches Rechnen, die schwierigsten Computer-Use-Aufgaben | GPT-6 Astra | Bei Wissenschaftsterminals immer noch klar voraus |
| Offene Architektur- und Ermessensentscheidungen | Claude Opus 5.5 | Höchste Bewertung auf dem breiten unabhängigen Index |
| Lange Terminalsitzungen, bei denen Token keine Rolle spielen | Claude Sonnet 5.5 | Stärkerer unabhängiger Terminal-Wert, höherer Token-Verbrauch |
Das Coding-Fazit
GPT-6.1 Sol hebt nicht die Decke an. Was es tut, ist, die Decke in die Reichweite eines alltäglichen Budgets zu bringen. Unabhängige Tests ordnen es ein oder zwei Punkte vom Flaggschiff von OpenAI entfernt für unter einem Viertel der Kosten pro Aufgabe ein, und seine Cache-Preise sind für die Art und Weise gemacht, wie Coding-Agenten tatsächlich arbeiten. Übergeben Sie ihm das Backlog, stellen Sie es für die harten Tickets auf xhigh ein und schalten Sie Astra oder Opus nur ein, wenn es stecken bleibt.