Rang #6 Programmierung — KI, die Produktionscode schreibt
xAI

Grok 4.7

Grok 4.7 ist das günstigste ernstzunehmende Programmiermodell in der Nähe der Ranglistenspitze. Für $2 Eingabe und $6 Ausgabe pro Million Token erreicht es 71,0 % bei DeepSWE und 46,3 % bei CursorBench 4.0, und es läuft direkt in Cursor und Grok Build. Ein starker Programmierpartner für den Alltag – aber noch nicht der Agent, den man stundenlang allein im Terminal arbeiten lässt.

Aktualisiert 27. September 2026 DeepSWE 71.0%CursorBench 46.3%Cursor & Grok Build
Am besten für

Grok 4.7 ist das günstigste ernstzunehmende Programmiermodell in der Nähe der Ranglistenspitze. Für $2 Eingabe und $6 Ausgabe pro Million Token erreicht es 71,0 % bei DeepSWE und 46,3 % bei CursorBench 4.0, und es läuft direkt in Cursor und Grok Build. Ein starker Programmierpartner für den Alltag – aber noch nicht der Agent, den man stundenlang allein im Terminal arbeiten lässt.

Warum es gewinnt

In xAIs Starttabelle: CursorBench 4.0 steigt von 40,4 % auf 46,3 %, DeepSWE v1.1 von 65,2 % auf 71,0 % (hohe Stufe), und Terminal-Bench 4.0 verdoppelt sich fast von 20,3 % auf 37,6 %. Der Preis bleibt bei $2/$6, dazu eine schnelle Variante mit doppelter Geschwindigkeit zum doppelten Preis. Verfügbar in Cursor, Grok Build (kostenlos testbar), über die Grok-API und in Coding-Werkzeugen von Drittanbietern.

Zu beachten

Bei langer, autonomer Terminal-Arbeit liegt es weiterhin deutlich hinter den Spitzenreitern: 37,6 % bei Terminal-Bench 4.0 gegenüber 57,9 % für Claude Fable 5.1 und 59,6 % für GPT-6 Astra und Claude Opus 5.5 in unabhängigen Tests. Bei CursorBench liegt es hinter Fable 5.1 (51,8 %). Alle Grok-Zahlen stammen von xAI selbst.

01

Was es wirklich ist

Jeder Entwickler hat schon neben zwei Arten von Kollegen gearbeitet.

Die eine ist brillant und gründlich und hält bei jeder Frage einen fünfzehnminütigen Vortrag. Der andere beugt sich einfach herüber, tippt vierzig Zeilen, lässt die Tests laufen und sagt: „Probier das mal.“

In den Aufstellungen von OpenAI und Anthropic hat die sorgfältige, teure Kollegin die meisten Titel. Grok 4.7 ist der Schnelle, der günstig genug ist, um ihn hundertmal am Tag zu fragen.

Grok 4.7 erschien am 21. September 2026 und steht auf Platz 5 unserer Programmier-Rangliste. Seine Rolle: der preiswerteste Programmierpartner in der Spitzengruppe zu sein.

Die Verbesserungen, die für Entwickler zählen

Grok 4.6 war ein interessanter Herausforderer. Grok 4.7 ist in jedem Programmiertest, den xAI veröffentlicht hat, ein klarer Schritt nach vorn:

  • DeepSWE v1.1, komplexe Entwicklungsaufgaben in echten Codebasen: von 65,2 % auf 71,0 % (auf hoher Stufe). In xAIs Tabelle liegt das knapp vor den 70,0 % von Claude Fable 5.1.
  • CursorBench 4.0, längere Programmieraufgaben im Editor Cursor: von 40,4 % auf 46,3 %.
  • Terminal-Bench 4.0, mehrstündige Arbeit auf der Kommandozeile: von 20,3 % auf 37,6 %, fast eine Verdopplung.

xAI führt die Fortschritte auf ein größeres Basismodell zurück, auf deutlich längeres Training mit Aufgaben, die Stunden dauern, und auf gezielte Arbeit daran, eigene Antworten zu prüfen und mit langem Kontext umzugehen. In der Praxis heißt das: weniger halb fertige Änderungen und weniger selbstbewusste Fehler.

Die Wirtschaftlichkeit des Programmierens im Editor

Wenn Sie in Cursor oder einem ähnlichen Editor programmieren, wird die KI nicht einmal am Tag aufgerufen, sondern ständig. Sie liest Ihre Dateien, schlägt Änderungen vor, erklärt einen Fehler, schreibt eine Funktion um und läuft wieder.

Mit $2 pro Million Eingabe-Token und $6 pro Million Ausgabe-Token hat Grok 4.7 den niedrigsten Ausgabepreis unter den Spitzenmodellen fürs Programmieren. Zum Vergleich: GPT-6 Sol kostet $10, Claude Opus 5.5 $20 und GPT-6 Astra $50. Wer den ganzen Tag im Editor arbeitet, spürt diesen Unterschied im Geldbeutel.

Außerdem gibt es eine schnelle Variante, die doppelt so schnell ausgibt, zum doppelten Preis. Sie lohnt sich, wenn Sie auf jede Antwort warten.

Wo es noch nicht reicht

Lange, unbeaufsichtigte Läufe. Terminal-Bench 4.0 sagt am besten voraus, ob man einen Agenten stundenlang allein im Terminal arbeiten lassen kann. Die 37,6 % von Grok 4.7 sind eine große Verbesserung, doch GPT-6 Astra und Claude Opus 5.5 erreichen in unabhängigen Tests beide 59,6 %, und Fable 5.1 kommt in xAIs eigener Tabelle auf 57,9 %. Für autonome Arbeit über Nacht verlieren sich diese Modelle deutlich seltener.

Die besten Editor-Ergebnisse. Bei CursorBench 4.0 liegt Grok hinter Claude Fable 5.1 (51,8 %) und den von Anthropic gemeldeten 57,8 % für Claude Opus 5.5.

Die neuesten Konkurrenten. xAI vergleicht Grok 4.7 mit GPT-5.6 Sol und Fable 5.1. GPT-6 Sol erschien am nächsten Tag zu einem ähnlichen Preis, und einen unabhängigen direkten Vergleich haben wir noch nicht gesehen. Alle Grok-Zahlen hier stammen von xAI selbst.

Das Fazit

Für lange, unbeaufsichtigte Agentenläufe wählen Sie GPT-6 Astra. Für tiefgreifende Architekturarbeit an einer großen Codebasis wählen Sie Claude Opus 5.5.

Aber für die Stunden, die Sie jeden Tag in Ihrem Editor verbringen – Fehler beheben, Tests schreiben, Komponenten umbauen –, ist Grok 4.7 ein starker, schneller und sehr günstiger Partner. Testen Sie es an Ihrem eigenen Code gegen GPT-6 Sol; eines der beiden wird wahrscheinlich Ihr tägliches Werkzeug.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Der niedrigste Preis in der Spitzengruppe: $2 pro Million Eingabe-Token und $6 pro Million Ausgabe-Token. Bei der Ausgabe ist das günstiger als GPT-6 Sol ($10), Claude Opus 5.5 ($20) und GPT-6 Astra ($50). In einem Editor, der das Modell ständig aufruft, summiert sich das.
  • Solide Fehlerbehebung in echten Projekten: Bei DeepSWE v1.1, das komplexe Entwicklungsaufgaben in echten Codebasen prüft, erreichte Grok 4.7 auf hoher Stufe 71,0 %, gestiegen von 65,2 % bei Grok 4.6. Nach xAIs Zahlen liegt es damit knapp vor Claude Fable 5.1 (70,0 %).
  • Besser bei der Arbeit im Editor: CursorBench 4.0 misst länger laufende Programmieraufgaben im Editor Cursor. Grok 4.7 verbesserte sich von 40,4 % auf 46,3 %, und xAI bezeichnet es bei diesem Test als „an der Spitze beim Preis-Leistungs-Verhältnis“.
  • Bleibt länger bei der Sache: xAI hat es mit Aufgaben trainiert, die viele Stunden dauern, und verbessert, wie es seine eigene Arbeit prüft und mit langem Kontext umgeht. Genau diese Fähigkeiten verhindern, dass ein Agent mitten in einer Änderung abschweift.
  • Dort verfügbar, wo Entwickler arbeiten: Vom ersten Tag an in Cursor und Grok Build integriert, außerdem über die Grok-API, andere Coding-Werkzeuge und Modell-Router nutzbar. Eine schnelle Variante verdoppelt die Ausgabegeschwindigkeit für interaktive Arbeit.

Ehrliche Einschränkungen

  • Noch nicht bereit für lange, unbeaufsichtigte Terminal-Läufe: Terminal-Bench 4.0, das mehrstündige Arbeit auf der Kommandozeile prüft, stieg auf 37,6 %. Ein großer Sprung, aber immer noch weit hinter den rund 58–60 % von Fable 5.1, GPT-6 Astra und Claude Opus 5.5.
  • Hinter den Spitzenreitern bei Editor-Aufgaben: Seine 46,3 % bei CursorBench 4.0 liegen unter Fable 5.1 (51,8 %) und den von Anthropic gemeldeten 57,8 % für Claude Opus 5.5.
  • Mit den Konkurrenten des Vormonats verglichen: xAIs Tabelle stellt Grok 4.7 GPT-5.6 Sol und Fable 5.1 gegenüber, nicht GPT-6 Sol, das am nächsten Tag zu einem ähnlichen Preis erschien.
  • Nur Herstellerzahlen: Jede Grok-Zahl hier stammt von xAI. Wir aktualisieren, sobald unabhängige Ergebnisse vorliegen.
03

Benchmark-Übersicht

DeepSWE v1.1 — 71,0 % (hohe Stufe)

Komplexe Entwicklungsaufgaben in echten Codebasen. Gestiegen von 65,2 % bei Grok 4.6. xAIs Tabelle zeigt Claude Fable 5.1 bei 70,0 % und GPT-5.6 Sol (maximale Stufe) bei 72,7 %.

CursorBench 4.0 — 46,3 %

Länger laufende Programmieraufgaben im Editor Cursor. Gestiegen von 40,4 %; Claude Fable 5.1 erreicht in derselben Tabelle 51,8 %, GPT-5.6 Sol 41,7 %.

Terminal-Bench 4.0 — 37,6 %

Mehrstündige Arbeit auf der Kommandozeile. Fast doppelt so viel wie die 20,3 % von Grok 4.6, aber weit hinter den 57,9 % von Claude Fable 5.1 in xAIs Tabelle. (Anthropics eigener Durchlauf sieht Fable 5.1 bei 55,8 %; unabhängige Tests sehen GPT-6 Astra und Claude Opus 5.5 bei 59,6 %.)

Preis — $2 / $6 pro 1 Mio. Token

Unverändert gegenüber Grok 4.6. Die schnelle Variante läuft mit doppelter Ausgabegeschwindigkeit zum doppelten Preis.

04

Das Fazit

Grok 4.7 ist unser Programmiermodell auf Platz 5 und die beste Wahl, wenn Ihnen die Kosten pro Tastendruck am wichtigsten sind. Für die alltägliche Arbeit im Editor – Fehler beheben, Tests schreiben, Code umbauen – ist es ein wirklich fähiger Programmierpartner, zum niedrigsten Ausgabepreis der Spitzengruppe. Bei langen, unbeaufsichtigten Terminal-Sitzungen bleibt es noch deutlich hinter GPT-6 Astra und Claude Opus 5.5 zurück. Den engsten Preis-Konkurrenten, GPT-6 Sol, sollten Sie an Ihrem eigenen Code dagegen testen, bevor Sie sich festlegen.

05

Häufig gestellte Fragen