Rang #4 Programmierung — KI, die Produktionscode schreibt
OpenAI

GPT-6.1 Sol

GPT-6.1 Sol ist der Coding-Agent, den Sie den ganzen Tag laufen lassen können, ohne auf die Rechnung schauen zu müssen. In unabhängigen Tests liegt er nur ein oder zwei Punkte hinter GPT-6 Astra, dem Flaggschiff von OpenAI, dennoch kostet eine typische Aufgabe weniger als ein Viertel. Der Token-Preis hat sich gegenüber GPT-6 Sol nicht geändert (2 $ Eingabe, 10 $ Ausgabe pro Million), aber das erneute Lesen von im Cache gespeichertem Code kostet jetzt nur noch 0,10 $ pro Million Token, und genau bei großen Repositories macht sich diese Ersparnis bemerkbar.

Aktualisiert 30. September 2026 Value Coding AgentDeepSWE 75.2%$0.10 Cached Input
Am besten für

GPT-6.1 Sol ist der Coding-Agent, den Sie den ganzen Tag laufen lassen können, ohne auf die Rechnung schauen zu müssen. In unabhängigen Tests liegt er nur ein oder zwei Punkte hinter GPT-6 Astra, dem Flaggschiff von OpenAI, dennoch kostet eine typische Aufgabe weniger als ein Viertel. Der Token-Preis hat sich gegenüber GPT-6 Sol nicht geändert (2 $ Eingabe, 10 $ Ausgabe pro Million), aber das erneute Lesen von im Cache gespeichertem Code kostet jetzt nur noch 0,10 $ pro Million Token, und genau bei großen Repositories macht sich diese Ersparnis bemerkbar.

Warum es gewinnt

Artificial Analysis (29. September 2026) maß auf dem Intelligence Index einen Punkt Rückstand auf GPT-6 Astra (52 vs. 53) bei 0,72 $ pro Aufgabe im Vergleich zu 3,26 $. Auf dem Coding Agent Index schlug die Einstellung xhigh Astra um einen Punkt für unter 15 % der Kosten. OpenAI meldet 75,2 % auf DeepSWE v1.1 bei hohem Aufwand, und auf Cognitions FrontierCode 1.1 erreicht er 58,1 % bei niedrigem Aufwand für 0,21 $ pro Aufgabe, das beste Ergebnis unter 0,30 $ auf dieser Rangliste.

Zu beachten

Seine Merge-Qualitätsbewertung verbesserte sich nicht: Auf FrontierCode 1.1 erreicht er 60,4 %, genau wie GPT-6 Sol. Der Gewinn liegt bei den Kosten, nicht in einer höheren Obergrenze. OpenAIs eigene Tabellen zeigen, dass GPT-6 Astra bei wissenschaftlicher Terminalarbeit immer noch deutlich vorn liegt. Claude Sonnet 5.5 erzielt auf dem breiten Index von Artificial Analysis höhere Werte, obwohl es pro Aufgabe weitaus mehr kostet. In ChatGPT ist es nur in Work und Codex in kostenpflichtigen Tarifen verfügbar.

01

Was es wirklich ist

Stellen Sie sich eine Baustelle mit zwei Kranführern vor.

Der eine ist der Veteran, der für den Hebevorgang geholt wird, an den sich sonst niemand herantraut: der Stahlträger, der bei Seitenwind zwischen zwei Türmen eingefädelt werden muss. Der andere Bediener ist fast genauso gut und verlangt einen Bruchteil des Tagessatzes. Für jeden gewöhnlichen Hebevorgang, Paletten mit Ziegeln, Dachstühle, die alltägliche Arbeit, wären Sie töricht, den Veteranen zu buchen.

GPT-6.1 Sol ist der zweite Bediener, und in diesem Monat ist der Abstand zwischen den beiden sehr klein geworden.

Eine Veröffentlichung, die aus einer Absage entstand

OpenAI stellte GPT-6.1 Sol am 29. September 2026 auf seinem DevDay-Event vor, nur eine Woche nach GPT-6 Sol. Das Timing hatte eine Vorgeschichte. Am Tag zuvor hatte OpenAI die geplante Einführung von GPT-6.1 Astra abgesagt, nachdem interne Tests ergeben hatten, dass dieses Modell nicht zuverlässig innerhalb des Umfangs und der Berechtigungen seiner Aufgaben blieb. Sol 6.1 ist ein separates, kleineres Modell, und sein eigener Sicherheitsbericht sieht sauberer aus: Im Test von OpenAI, ob ein Agent zugibt, dass sein Suchwerkzeug defekt ist, anstatt zu raten, versäumte GPT-6.1 Sol dies in 2,1 % der Fälle, verglichen mit 4,9 % bei GPT-6 Sol und 1,5 % bei GPT-6 Astra.

Das Verkaufsargument von OpenAI ist kurz: Intelligenz nahe Astra zu einem Fünftel des Preises.

Ist es wirklich nah an Astra?

Das ist der Teil, der zählt, und ausnahmsweise müssen wir uns nicht auf das Wort des Anbieters verlassen.

Artificial Analysis, ein unabhängiges Testunternehmen, führte seine Benchmarks am Tag der Veröffentlichung durch. Auf seinem Intelligence Index, einer Kombination aus zehn schwierigen Evaluierungen, erzielte GPT-6.1 Sol bei maximalem Aufwand 52 Punkte, einen Punkt hinter den 53 von GPT-6 Astra und vier Punkte vor GPT-6 Sol. Auf dem Coding Agent Index ist das Ergebnis noch enger: Bei maximalem Aufwand (Max Effort) liegt Sol 2 Punkte hinter Astra, und bei der zweithöchsten Einstellung, xhigh, übertraf es Astra um einen Punkt für weniger als 15 % der Kosten pro Aufgabe.

Cognition, das Unternehmen hinter dem Coding-Agenten Devin, testete es auf FrontierCode 1.1, einem Benchmark, der eine strenge Frage stellt: Würde ein Senior Engineer diese Änderung tatsächlich mergen? Das beste Ergebnis von GPT-6.1 Sol liegt bei 60,4 % und entspricht im Wesentlichen dem von GPT-6 Sol (60,7 %). Der Unterschied liegt in den Kosten. Bei mittlerem Aufwand gibt es 0,31 $ pro Aufgabe aus, 81 % weniger als GPT-6 Sol bei maximalem Aufwand ausgab, um sein Bestes zu erreichen. Bei niedrigem Aufwand erreicht es 58,1 % für nur 0,21 $, ein Anstieg gegenüber den 50,5 % von GPT-6 Sol bei derselben Einstellung.

Die eigenen Zahlen von OpenAI weisen in dieselbe Richtung. Bei DeepSWE v1.1, komplexen Engineering-Aufgaben in echten Codebasen, zeigt ihre Tabelle 75,2 % bei hohem Aufwand (High Effort) für 0,65 $ pro Aufgabe. Das sind 6,4 Punkte mehr als der Bestwert von GPT-6 Sol und ein Hauch mehr als Astras Bestwert (74,1 %), der 4,43 $ pro Aufgabe kostet. Eine Merkwürdigkeit ist erwähnenswert: Bei xhigh und max erzielt GPT-6.1 Sol tatsächlich ein niedrigeres Ergebnis, nämlich 71,9 %. Mehr Nachdenken bedeutet nicht immer besseres Nachdenken.

Die ehrliche Zusammenfassung lautet also: Programmieren ungefähr auf Astra-Niveau und die gleiche Merge-Qualität wie das Sol von letzter Woche, jedoch zu einem viel niedrigeren Preis pro erledigtem Job.

Warum der Cache-Preis die eigentliche Schlagzeile ist

Ein Coding-Agent liest Ihr Projekt nie nur einmal. Jedes Mal, wenn er einen Test ausführt, den Fehler liest und es erneut versucht, liest er dieselben Dateien, Anweisungen und den Verlauf erneut. Während einer langen Sitzung kann dies bedeuten, dass dieselben paar hunderttausend Token Dutzende Male in das Modell zurückfließen.

Das deckt die gecachte Eingabe (Cached Input) ab: Text, den das Modell in dieser Sitzung kürzlich gesehen hat. GPT-6.1 Sol berechnet 0,10 $ pro Million im Cache gespeicherter Token, 95 % Rabatt auf die normalen 2 $ und die Hälfte des Cache-Preises von GPT-6 Sol. Normale Eingabe- und Ausgabepreise bleiben bei 2 $ und 10 $ pro Million, einem Fünftel der 10 $/50 $ von GPT-6 Astra.

Zählen Sie das zusammen, erhalten Sie die wichtigste Zahl: Artificial Analysis hat gemessen, dass die Ausführung ihres Index mit GPT-6.1 Sol etwa 0,72 $ pro Aufgabe kostet, verglichen mit 3,26 $ für GPT-6 Astra, 5,98 $ für Claude Opus 5.5 und 7,60 $ für Claude Sonnet 5.5. Eine Vorsichtsmaßnahme: Prompts, die länger als 272.000 Token sind, kosten das Doppelte für die Eingabe und das 1,5-fache für die Ausgabe, so dass wirklich gigantische Einzelanfragen teurer werden.

Drehen Sie den Regler nicht ganz auf

GPT-6.1 Sol hat fünf Aufwandsstufen: low, medium (der Standard), high, xhigh und max. Man neigt zu der Annahme, dass Max immer am besten ist. Auf dem Coding Agent Index von Artificial Analysis ist dies nicht der Fall: xhigh erzielte ein höheres Ergebnis als max, und es kostet weniger. Für Routinekorrekturen ist “low” oder “medium” oft ausreichend, wie das Ergebnis von Cognition mit 58,1 % für 0,21 $ zeigt. Heben Sie sich “xhigh” für die Probleme auf, die wirklich die zusätzliche Denkarbeit benötigen.

Die ehrlichen Grenzen

  • Besserer Wert, nicht besserer Code. Auf FrontierCode 1.1 bleibt die Merge-Qualität gegenüber GPT-6 Sol und GPT-5.6 Sol unverändert. Wenn Ihr Problem darin bestand, dass die Patches von Sol nicht gut genug waren, behebt 6.1 dies nicht. Es macht dieselben Patches viel billiger.
  • Wissenschaft ist immer noch Astras Job. Auf OpenAIs Terminal-Bench Science 0.1, Datenanalyse, Simulationen und Beweisführung in einem Terminal, erzielt GPT-6.1 Sol bei maximalem Aufwand 57,0 %. Das ist mehr als das Doppelte der 27,6 % von GPT-6 Sol, aber weit hinter GPT-6 Astra (68,1 %) und Claude Opus 5.5 (63,3 %). Es kostet 5,47 $ pro Aufgabe, im Vergleich zu etwa 23 $ für jeden der Konkurrenten.
  • Claude punktet auf dem breiten Index höher. Claude Opus 5.5 (58) und Claude Sonnet 5.5 (56) liegen auf dem Intelligence Index von Artificial Analysis weiterhin vor GPT-6.1 Sol (52), und obwohl Artificial Analysis einen Gewinn von 12 Punkten im Terminal-Bench 4.0 für GPT-6.1 Sol gegenüber GPT-6 Sol gemessen hat, sind die 64 % von Sonnet in diesem Test immer noch höher. Sonnet erreicht dies, indem es weitaus mehr Token verbrennt, sodass Sol bei den Kosten pro Aufgabe gewinnt.
  • Nicht im regulären Chat. In ChatGPT ist GPT-6.1 Sol in ChatGPT Work und Codex für Nutzer der Tarife Plus, Pro, Business, Enterprise und Edu verfügbar. Entwickler verwenden es in der API als gpt-6.1-sol. OpenAI sagt, dass ein schnellerer “Ultrafast”-Modus für Codex in Arbeit ist, aber er ist noch nicht live.

Wer sollte es nutzen

Wenn Ihre Arbeit so aussieht… Greifen Sie zu Warum
Bugs, Tests, Refactorings, Agenten, die den ganzen Tag in CI laufen GPT-6.1 Sol Programmieren auf nahezu Astra-Niveau zu einem Bruchteil der Kosten pro Aufgabe
Wissenschaftliches Rechnen, die schwierigsten Computer-Use-Aufgaben GPT-6 Astra Bei Wissenschaftsterminals immer noch klar voraus
Offene Architektur- und Ermessensentscheidungen Claude Opus 5.5 Höchste Bewertung auf dem breiten unabhängigen Index
Lange Terminalsitzungen, bei denen Token keine Rolle spielen Claude Sonnet 5.5 Stärkerer unabhängiger Terminal-Wert, höherer Token-Verbrauch

Das Coding-Fazit

GPT-6.1 Sol hebt nicht die Decke an. Was es tut, ist, die Decke in die Reichweite eines alltäglichen Budgets zu bringen. Unabhängige Tests ordnen es ein oder zwei Punkte vom Flaggschiff von OpenAI entfernt für unter einem Viertel der Kosten pro Aufgabe ein, und seine Cache-Preise sind für die Art und Weise gemacht, wie Coding-Agenten tatsächlich arbeiten. Übergeben Sie ihm das Backlog, stellen Sie es für die harten Tickets auf xhigh ein und schalten Sie Astra oder Opus nur ein, wenn es stecken bleibt.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Coding nahe am Flaggschiff, unabhängig geprüft: Artificial Analysis hat den Coding Agent Index am 29. September 2026 gemessen. GPT-6.1 Sol bei maximalem Aufwand liegt 2 Punkte hinter GPT-6 Astra, und seine xhigh-Einstellung schlägt Astra tatsächlich um 1 Punkt für weniger als 15 % der Kosten pro Aufgabe.
  • Günstig pro abgeschlossener Aufgabe, nicht nur pro Token: Die Ausführung des vollständigen Index von Artificial Analysis kostet mit GPT-6.1 Sol etwa 0,72 $ pro Aufgabe, verglichen mit 3,26 $ für GPT-6 Astra, 5,98 $ für Claude Opus 5.5 und 7,60 $ für Claude Sonnet 5.5, alle bei maximalem Aufwand (Max Effort).
  • Cache-Preis für große Codebasen entwickelt: Das erneute Lesen von Text, den das Modell bereits gesehen hat, wie z. B. Ihr Repository, kostet 0,10 $ pro Million Token: Das sind 95 % Rabatt auf den normalen Eingabepreis und die Hälfte des Cache-Preises von GPT-6 Sol. Coding-Agenten lesen dieselben Dateien ständig neu, daher schlägt hier die meiste Ersparnis zu Buche.
  • Stark auch bei niedrigem Aufwand: Auf Cognitions FrontierCode 1.1, das bewertet, ob Codeänderungen gut genug für einen Merge sind, erzielt GPT-6.1 Sol 58,1 % bei niedrigem Aufwand für 0,21 $ pro Aufgabe, ein Anstieg gegenüber den 50,5 % von GPT-6 Sol bei derselben Einstellung. Über alle Aufwandsstufen hinweg läuft es 44–57 % günstiger pro Aufgabe als GPT-6 Sol.
  • Ein größerer Sprung bei echten Engineering-Aufgaben: Auf DeepSWE v1.1 zeigt OpenAIs Tabelle 75,2 % bei hohem Aufwand (High Effort) für 0,65 $ pro Aufgabe, 6,4 Punkte über dem Bestwert von GPT-6 Sol (68,8 % bei max, 2,74 $) und leicht über dem Bestwert von GPT-6 Astra (74,1 % bei xhigh, 4,43 $).

Ehrliche Einschränkungen

  • Merge-Qualität hat sich nicht bewegt: Auf FrontierCode 1.1 entspricht sein bestes Ergebnis von 60,4 % dem von GPT-6 Sol (60,7 %) und GPT-5.6 Sol (60,6 %). Sie erhalten dieselbe Qualität an merge-fähigem Code für viel weniger Geld, keinen besseren Code.
  • Nicht das Modell für Wissenschaftsterminals: Auf OpenAIs Terminal-Bench Science 0.1, das Datenanalyse, Simulationen und Beweisführung abdeckt, erzielt GPT-6.1 Sol 57,0 % bei maximalem Aufwand, mehr als das Doppelte von GPT-6 Sol (27,6 %), aber deutlich hinter GPT-6 Astra (68,1 %) und Claude Opus 5.5 (63,3 %).
  • Claude führt weiterhin auf dem breiten Index: Auf dem Intelligence Index von Artificial Analysis erzielen Claude Opus 5.5 (58) und Claude Sonnet 5.5 (56) höhere Werte als GPT-6.1 Sol (52). Artificial Analysis maß einen 12-Punkte-Gewinn beim Terminal-Bench 4.0 gegenüber GPT-6 Sol, aber der Startwert von Sonnet 5.5 von 64 % ist immer noch höher, auch wenn Sonnet weitaus mehr Token verbraucht, um dorthin zu gelangen.
  • Maximaler Aufwand ist nicht die beste Einstellung: Auf dem Coding Agent Index von Artificial Analysis erzielte xhigh ein höheres Ergebnis als max. Die DeepSWE-Tabelle von OpenAI zeigt das gleiche Muster: 75,2 % bei hohem Aufwand, aber 71,9 % bei xhigh und max, was mehr kostet.
  • Viele Schlagzeilen-Zahlen stammen von OpenAI: DeepSWE, OSWorld, GDP.pdf und AutomationBench stammen aus OpenAIs Einführungstabellen. Die Ergebnisse von Artificial Analysis und Cognition sind unabhängig, und sie stimmen weitgehend überein.
03

Benchmark-Übersicht

Artificial Analysis Coding Agent Index — über GPT-6 Astra bei xhigh

Unabhängig, 29. September 2026. Bei xhigh-Aufwand schlägt GPT-6.1 Sol GPT-6 Astra um 1 Punkt für unter 15 % von Astras Kosten pro Aufgabe. Bei max liegt es 2 Punkte hinter Astra und 3 vor GPT-6 Sol.

Artificial Analysis Intelligence Index — 52 (Maximaler Aufwand)

Unabhängiger Index aus 10 Evaluierungen, einschließlich Terminal-Bench 4.0 und SciCode. Ein Punkt unter GPT-6 Astra (53), gegenüber 48 bei GPT-6 Sol, bei 0,72 $ pro Aufgabe im Vergleich zu 3,26 $ für Astra.

FrontierCode 1.1 — 60,4 % bester Wert; 58,1 % bei 0,21 $ (Niedriger Aufwand)

Cognitions Benchmark für merge-fertigen Code, veröffentlicht am 29. September 2026. Bester Wert gleichauf mit GPT-6 Sol. Das Low-Effort-Ergebnis ist das höchste aller Modelle unter 0,30 $ pro Aufgabe auf dieser Rangliste.

DeepSWE v1.1 — 75,2 % (Hoher Aufwand, 0,65 $ pro Aufgabe)

OpenAIs Tabelle für komplexe Engineering-Aufgaben in echten Codebasen. GPT-6 Astras Bestwert ist 74,1 % bei xhigh für 4,43 $; GPT-6 Sols Bestwert ist 68,8 % bei max für 2,74 $. GPT-6.1 Sol fällt auf 71,9 % bei xhigh und max.

Terminal-Bench Science 0.1 — 57,0 % (Maximaler Aufwand, 5,47 $ pro Aufgabe)

Wissenschaftliche Workflows in einem Terminal, laut OpenAIs Tabelle. GPT-6 Astra führt mit 68,1 % (23,80 $ pro Aufgabe), Claude Opus 5.5 erzielt 63,3 % (23,21 $) und GPT-6 Sol 27,6 % (12,18 $).

Preis — 2 $ / 10 $ pro 1 Mio. Token, 0,10 $ im Cache

Gleicher Token-Preis wie GPT-6 Sol und ein Fünftel von GPT-6 Astras 10 $/50 $. Prompts über 272K Eingabe-Token kosten 2× Eingabe und 1,5× Ausgabe; Batch und Flex erhalten 50 % Rabatt.

04

Das Fazit

GPT-6.1 Sol ist für Teams gedacht, die Coding-Agenten auf nahezu Flaggschiff-Niveau wünschen, die den ganzen Tag zu Preisen der Mittelklasse laufen. Unabhängige Tests ordnen es innerhalb ein oder zwei Punkten von GPT-6 Astra für unter einem Viertel der Kosten pro Aufgabe ein. Es rangiert knapp hinter Claude Sonnet 5.5, weil Sonnet auf dem breiten unabhängigen Index und bei Terminalarbeiten höhere Werte erzielt und weil sich die Merge-Qualitätsbewertung von Sol gegenüber GPT-6 Sol nicht verändert hat. Es rangiert für alltägliches Programmieren aufgrund der Kosten pro abgeschlossener Aufgabe vor Claude Fable 5.1. Behalten Sie GPT-6 Astra für Wissenschaftsterminals und die schwierigsten Computer-Use-Aufgaben. Übergeben Sie GPT-6.1 Sol den Backlog und versuchen Sie xhigh anstelle von max.

05

Häufig gestellte Fragen