Jeder Entwickler hat schon neben zwei Arten von Kollegen gearbeitet.
Die eine ist brillant und gründlich und hält bei jeder Frage einen fünfzehnminütigen Vortrag. Der andere beugt sich einfach herüber, tippt vierzig Zeilen, lässt die Tests laufen und sagt: „Probier das mal.“
In den Aufstellungen von OpenAI und Anthropic hat die sorgfältige, teure Kollegin die meisten Titel. Grok 4.7 ist der Schnelle, der günstig genug ist, um ihn hundertmal am Tag zu fragen.
Grok 4.7 erschien am 21. September 2026 und steht auf Platz 5 unserer Programmier-Rangliste. Seine Rolle: der preiswerteste Programmierpartner in der Spitzengruppe zu sein.
Die Verbesserungen, die für Entwickler zählen
Grok 4.6 war ein interessanter Herausforderer. Grok 4.7 ist in jedem Programmiertest, den xAI veröffentlicht hat, ein klarer Schritt nach vorn:
- DeepSWE v1.1, komplexe Entwicklungsaufgaben in echten Codebasen: von 65,2 % auf 71,0 % (auf hoher Stufe). In xAIs Tabelle liegt das knapp vor den 70,0 % von Claude Fable 5.1.
- CursorBench 4.0, längere Programmieraufgaben im Editor Cursor: von 40,4 % auf 46,3 %.
- Terminal-Bench 4.0, mehrstündige Arbeit auf der Kommandozeile: von 20,3 % auf 37,6 %, fast eine Verdopplung.
xAI führt die Fortschritte auf ein größeres Basismodell zurück, auf deutlich längeres Training mit Aufgaben, die Stunden dauern, und auf gezielte Arbeit daran, eigene Antworten zu prüfen und mit langem Kontext umzugehen. In der Praxis heißt das: weniger halb fertige Änderungen und weniger selbstbewusste Fehler.
Die Wirtschaftlichkeit des Programmierens im Editor
Wenn Sie in Cursor oder einem ähnlichen Editor programmieren, wird die KI nicht einmal am Tag aufgerufen, sondern ständig. Sie liest Ihre Dateien, schlägt Änderungen vor, erklärt einen Fehler, schreibt eine Funktion um und läuft wieder.
Mit $2 pro Million Eingabe-Token und $6 pro Million Ausgabe-Token hat Grok 4.7 den niedrigsten Ausgabepreis unter den Spitzenmodellen fürs Programmieren. Zum Vergleich: GPT-6 Sol kostet $10, Claude Opus 5.5 $20 und GPT-6 Astra $50. Wer den ganzen Tag im Editor arbeitet, spürt diesen Unterschied im Geldbeutel.
Außerdem gibt es eine schnelle Variante, die doppelt so schnell ausgibt, zum doppelten Preis. Sie lohnt sich, wenn Sie auf jede Antwort warten.
Wo es noch nicht reicht
Lange, unbeaufsichtigte Läufe. Terminal-Bench 4.0 sagt am besten voraus, ob man einen Agenten stundenlang allein im Terminal arbeiten lassen kann. Die 37,6 % von Grok 4.7 sind eine große Verbesserung, doch GPT-6 Astra und Claude Opus 5.5 erreichen in unabhängigen Tests beide 59,6 %, und Fable 5.1 kommt in xAIs eigener Tabelle auf 57,9 %. Für autonome Arbeit über Nacht verlieren sich diese Modelle deutlich seltener.
Die besten Editor-Ergebnisse. Bei CursorBench 4.0 liegt Grok hinter Claude Fable 5.1 (51,8 %) und den von Anthropic gemeldeten 57,8 % für Claude Opus 5.5.
Die neuesten Konkurrenten. xAI vergleicht Grok 4.7 mit GPT-5.6 Sol und Fable 5.1. GPT-6 Sol erschien am nächsten Tag zu einem ähnlichen Preis, und einen unabhängigen direkten Vergleich haben wir noch nicht gesehen. Alle Grok-Zahlen hier stammen von xAI selbst.
Das Fazit
Für lange, unbeaufsichtigte Agentenläufe wählen Sie GPT-6 Astra. Für tiefgreifende Architekturarbeit an einer großen Codebasis wählen Sie Claude Opus 5.5.
Aber für die Stunden, die Sie jeden Tag in Ihrem Editor verbringen – Fehler beheben, Tests schreiben, Komponenten umbauen –, ist Grok 4.7 ein starker, schneller und sehr günstiger Partner. Testen Sie es an Ihrem eigenen Code gegen GPT-6 Sol; eines der beiden wird wahrscheinlich Ihr tägliches Werkzeug.