Rang #5 Programmierung — KI, die Produktionscode schreibt
xAI

Grok 4.6

Grok 4.6 ist ein ernstes Coding-Agent-Upgrade: besser bei Repository-Erkundung, langen Implementierungen und visuellen Erstentwürfen, weiterhin für $2/$6 und sofort in Cursor und Grok Build.

Aktualisiert 14. August 2026 Agentic CodingCursorGrok Build
Am besten für

Grok 4.6 ist ein ernstes Coding-Agent-Upgrade: besser bei Repository-Erkundung, langen Implementierungen und visuellen Erstentwürfen, weiterhin für $2/$6 und sofort in Cursor und Grok Build.

Warum es gewinnt

Gegenüber 4.5 steigt Grok bei CursorBench (69,9% vs. 66,7%), DeepSWE (65,9% vs. 54%), FrontierCode (61,3% vs. 56,6%), APEX-Agents (57,5% vs. 47,1%), Terminal-Bench v3 (26% vs. 15,7%) und APEX-SWE (56,4% vs. 53,6%).

Zu beachten

GPT-5.6 Sol führt DeepSWE und Terminal-Bench v3 an; Fable 5 führt mehrere andere Zeilen. Ein vollständiger SWE-bench-Verified-Wert fehlt, und frühe Security-Berichte sprechen für strikte Sandbox und Review.

01

Was es wirklich ist

Ein guter Coding-Agent ist weniger Autocomplete als ein Junior-Engineer mit einem Ticket. Er muss das Repository untersuchen, eine Hypothese bilden, Befehle ausführen, Fehlermeldungen lesen und nach dem zwölften Umweg noch wissen, welches Problem er eigentlich lösen sollte. Grok 4.6 wurde für genau diese längere Schleife trainiert. xAI beschreibt Arbeit über ganze Codebasen, Recherchen in unbekannten Domänen, Webentwicklung, visuelle Anwendungen, mehrere Feedback-Runden und mehr Selbsttests als bei Grok 4.5. Das Ziel ist nicht nur eine elegante Codeantwort, sondern ein Agent, der eine Aufgabe bis zu einem prüfbaren Ergebnis trägt.

Das Muster der Benchmarks spricht für einen echten Generationssprung. Auf CursorBench v3.2 steigt Grok von 66,7% auf 69,9%, auf DeepSWE v1.1 von 54% auf 65,9% und auf FrontierCode v1.1 von 56,6% auf 61,3%. Auch APEX-Agents, APEX-SWE und Terminal-Bench v3 verbessern sich. Eine einzelne gute Zeile kann durch Prompting oder ein besonders passendes Harness entstehen; ein Anstieg über sechs verschiedene Agenten- und Coding-Evaluationen ist deutlich schwerer als Zufall abzutun.

Das macht Grok trotzdem nicht zum universellen Coding-König. In xAIs Vergleich erreicht GPT-5.6 Sol 73% auf DeepSWE, Fable 5 kommt auf 70%. Bei Terminal-Bench v3 liegen Groks 26% unter den veröffentlichten 34,6% beziehungsweise 34,1% der Konkurrenten. Fable 5 hat außerdem kleine Vorsprünge bei CursorBench, FrontierCode, APEX-Agents und APEX-SWE. Der Launch enthält keinen vollständigen Wert für SWE-bench Verified. Diese Lücke darf nicht mit dem Ergebnis eines anderen Tests gefüllt werden: Repository-Reparatur, Terminal-Arbeit und visuelle Produktentwicklung überschneiden sich, messen aber nicht dieselbe Fähigkeit.

Preis und Verfügbarkeit verändern dennoch die praktische Kaufentscheidung. Grok 4.6 war vom ersten Tag an in Cursor und Grok Build verfügbar, zusätzlich über die xAI API, OpenRouter, Vercel und Cloudflare. Der Standardpreis bleibt bei 2 Dollar Input und 6 Dollar Output pro Million Token; die schnellere Variante kostet das Doppelte. Artificial Analysis misst für das allgemeine Modell rund 0,84 Dollar pro Aufgabe. Wenn ein Agent eine Codebasis dreimal untersuchen, zwei Reparaturen versuchen und anschließend einen Reviewer-Lauf bestehen muss, wird der Preis jeder Iteration zu einer echten Engineering-Eigenschaft.

Gerade deshalb wäre es falsch, die Ersparnis in weniger Schutzmaßnahmen umzuwandeln. Frühe Hands-on-Berichte nennen gefährliche Security-Änderungen und unproduktive Reaktionen auf fehlgeschlagene Versuche. Das sind keine kontrollierten Häufigkeitsdaten, aber sie zeigen eine plausible Risikoklasse. Beginne mit read-only Repository-Erkundung, halte Secrets außerhalb der Reichweite des Agenten, begrenze Schreibrechte auf einen separaten Branch, verlange kleine Diffs und lasse CI nach jeder wesentlichen Änderung laufen. Erst wenn das Modell eigene Holdout-Aufgaben zuverlässig besteht, sollte seine Autonomie wachsen.

Ein fairer interner Vergleich muss außerdem das gesamte System prüfen: dasselbe Ticket, dieselben Tools, dieselben Zeit- und Retry-Grenzen und dieselben Tests. Miss nicht nur, ob irgendwann ein Patch entstand, sondern wie viele Modellschritte, Token und menschliche Review-Minuten bis zu einem mergebaren Ergebnis nötig waren. Grok 4.6 ist am besten als Frontier-Value-Coding-Agent zu verstehen: stark genug für ernsthafte Mehrschrittarbeit, günstig genug für einen weiteren Versuch und bereits in den Werkzeugen verfügbar, die Teams nutzen. Sein Vorteil wird erst dann real, wenn der Workflow das Geschriebene konsequent prüft.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Breiter Sprung gegenüber 4.5: Verbesserungen in sechs veröffentlichten Coding- und Agenten-Evaluationen, besonders deutlich bei DeepSWE und Terminal-Bench v3, sprechen gegen einen zufälligen Einzelsieg.
  • Für lange Projekte trainiert: xAI stellt Repository-weite Arbeit, unbekannte Domänen, Webentwicklung, visuelle Apps, Selbsttests und iterative Verfeinerung über kurze Codeantworten.
  • CursorBench ist Frontier-nah: 69,9% liegt dicht an Fable 5 mit 70,5%.
  • Günstige Iteration: $2/$6 pro Million Token und rund $0,84 je gemessener AA-Aufgabe machen Tests, zweite Versuche und Reviews bezahlbar, statt alles auf einen teuren Durchgang zu setzen.
  • Sofort verfügbar: Cursor, Grok Build, API, OpenRouter, Vercel und Cloudflare.

Ehrliche Einschränkungen

  • DeepSWE führt nicht: 65,9% liegt unter GPT-5.6 Sol mit 73% und Fable 5 mit 70%.
  • Terminal-Bench v3 bleibt schwach: 26% ist besser als 4.5, aber unter den Vergleichswerten um 34%.
  • Kein vollständiger SWE-bench-Verified-Wert: Der Launch beantwortet nicht jede Repository-Reparaturfrage.
  • Security-Anekdoten warnen: Berichte über gefährliche Änderungen und defensives Fehlerverhalten sind noch nicht quantifiziert, rechtfertigen aber Read-only-Start, begrenzte Credentials und verpflichtendes Diff-Review.
  • Modell und Harness sind ein System: Prompts, Tools, Stop-Regeln und Tests können Ergebnisse deutlich verschieben.
03

Benchmark-Übersicht

CursorBench v3.2 — 69,9%

3,2 Punkte über Grok 4.5 und nahe am besten Launch-Vergleich.

DeepSWE v1.1 — 65,9%

Großer Generationssprung, aber keine Führung.

FrontierCode v1.1 — 61,3%

Über dem zitierten GPT-5.6-Sol-Wert, unter Fable 5.

APEX-Agents — 57,5%

Starkes allgemeines Agenten-Signal, knapp unter dem besten Vergleich.

Terminal-Bench v3.0 — 26%

Wichtiges Gegengewicht: klar besser als 4.5, aber keine Spitzenposition.

04

Das Fazit

Grok 4.6 gehört zu den besten Value-Coding-Agenten, besonders für lange Repository-Untersuchungen, Produktprototypen, visuelle Apps und Workflows mit mehreren Feedback-Runden. Wähle es für frontiernahe Fähigkeit bei niedrigen Iterationskosten, nicht wegen eines erfundenen Sweeps. CI, Sandbox, eng begrenzte Credentials und menschliches Review bleiben Bestandteile des Gesamtsystems.

05

Häufig gestellte Fragen