Rang #7 Alltags-Ökosystem — Die führenden KI-Assistenten
xAI

Grok 4.7

Grok 4.7 behält den niedrigen Preis von Grok 4.6 bei – $2 für Eingabe, $6 für Ausgabe pro Million Token –, ist aber ein spürbar stärkeres und sorgfältigeres Modell. xAI hat es mit längeren, schwierigeren Aufgaben trainiert und ihm beigebracht, die eigene Arbeit zu überprüfen. Es ist der preiswerteste Weg zu Hilfe nahe der Spitzenklasse bei Büroarbeit, juristischen Entwürfen und technischer Mathematik.

Aktualisiert 27. September 2026 Value Frontier$2/$6 PricingSelf-Verification
Am besten für

Grok 4.7 behält den niedrigen Preis von Grok 4.6 bei – $2 für Eingabe, $6 für Ausgabe pro Million Token –, ist aber ein spürbar stärkeres und sorgfältigeres Modell. xAI hat es mit längeren, schwierigeren Aufgaben trainiert und ihm beigebracht, die eigene Arbeit zu überprüfen. Es ist der preiswerteste Weg zu Hilfe nahe der Spitzenklasse bei Büroarbeit, juristischen Entwürfen und technischer Mathematik.

Warum es gewinnt

Derselbe Preis von $2/$6 wie bei Grok 4.6, dazu eine schnelle Variante mit doppelter Geschwindigkeit zum doppelten Preis. In xAIs Starttabelle erzielt Grok 4.7 den Bestwert beim Harvey Legal Agent Benchmark (19,6 % gegenüber 6,7 % für Claude Fable 5.1) und bei EEBench zur Elektrotechnik (64,0 %). Bei AA Briefcase, einem Test mehrstündiger Büroarbeit, liegt es nah an Fable 5.1 (1.657 zu 1.678). xAI nennt es sein bislang stärkstes Modell beim Ablehnen schädlicher Anfragen und beim Widerstand gegen Jailbreaks.

Zu beachten

Seine Starttabelle vergleicht es mit GPT-5.6 Sol und Claude Fable 5.1, nicht mit den neueren Modellen Claude Opus 5.5 oder GPT-6 Sol – seine Position gegenüber den heute besten Modellen ist also noch offen. Bei langer Terminal-Arbeit liegt es klar zurück (37,6 % bei Terminal-Bench 4.0 gegenüber 57,9 % für Fable 5.1), ebenso beim klinischen Denken. Alle Zahlen stammen von xAI selbst.

01

Was es wirklich ist

Stellen Sie sich eine Billigfluglinie vor, die ihre Ticketpreise gleich lässt, aber still und leise ein größeres, besseres Flugzeug einsetzt.

Ungefähr das hat xAI mit Grok 4.7 gemacht, veröffentlicht am 21. September 2026. Der Preis hat sich nicht geändert: $2 pro Million Eingabe-Token und $6 pro Million Ausgabe-Token, genau wie bei Grok 4.6. Geändert hat sich das Modell darunter.

Was unter der Haube neu ist

xAI beschreibt drei Änderungen, einfach ausgedrückt:

  1. Ein größeres Basismodell. Laut xAI baut 4.7 auf einem größeren Fundament auf als 4.6. Eine Parameterzahl nennt die Ankündigung nicht – betrachten Sie konkrete Angaben, die Sie anderswo lesen, daher als unbestätigt.
  2. Längeres, härteres Training. Das Modell wurde mit bestärkendem Lernen (Reinforcement Learning) auf Aufgaben trainiert, die viele Stunden dauern – genau die Art Arbeit, bei der frühere Modelle auf halber Strecke den Faden verloren.
  3. Die eigene Arbeit prüfen. xAI hat es gezielt darauf trainiert, seine Antworten zu überprüfen und längere Dokumente zuverlässiger zu verarbeiten.

Das Ergebnis ist ein Modell, das bei einer langen Aufgabe besser am Ball bleibt und seine eigenen Fehler findet, bevor Sie es tun.

Wo es uns überrascht hat

Die interessantesten Zahlen in xAIs Starttabelle sind nicht die zum Programmieren. Sie stammen aus Bereichen, in denen man kein Preis-Leistungs-Modell an der Spitze erwarten würde.

  • Juristische Arbeit. Beim Harvey Legal Agent Benchmark, einem Test, wie gut ein KI-Agent echte juristische Aufgaben bewältigt, erreichte Grok 4.7 19,6 %. Das liegt vor Claude Fable 5.1 (6,7 %) und GPT-5.6 Sol (2,5 %). Der Test ist brutal schwer und alle schneiden niedrig ab, aber Grok landete in diesem Vergleich vorn.
  • Technische Mathematik. Bei EEBench, das Aufgaben aus der Elektrotechnik prüft, erzielte es 64,0 %, vor Fable 5.1 mit 56,4 %.
  • Büroarbeit. Bei AA Briefcase, einem Test mehrstündiger Büroaufgaben wie dem Erstellen von Dokumenten und Präsentationen, erreichte es 1.657, knapp hinter den 1.678 von Fable 5.1 und weit über den 1.546 von Grok 4.6.

Einfach gesagt: Bei echter Büro- und Facharbeit spielt Grok 4.7 jetzt in derselben Liga wie Modelle, die ein Vielfaches kosten.

Sicherer als sein Ruf

Grok gilt als der Chatbot mit weniger Leitplanken. Für 4.7 ist dieser Ruf überholt. xAI hat nach eigenen Worten ein völlig neues Sicherheitssystem gebaut und nennt es sein bislang stärkstes Modell beim Ablehnen gefährlicher Anfragen und beim Widerstand gegen Jailbreaks. Zugleich soll das Modell legitime Arbeit, etwa defensive Sicherheitsforschung, nur selten blockieren.

Grok antwortet weiterhin eher direkt, statt seine Antworten in Warnhinweise zu verpacken. Das ist aber eine Stilfrage, kein Verzicht auf Sicherheit.

Der ehrliche Haken

Es hat die neuesten Konkurrenten noch nicht getroffen. xAIs Tabelle vergleicht Grok 4.7 mit GPT-5.6 Sol und Claude Fable 5.1. Einen Tag nach dem Start brachte Anthropic Claude Opus 5.5 und OpenAI GPT-6 Sol heraus – beides starke, günstig bepreiste Konkurrenten. Bis unabhängige Tests sie nebeneinanderstellen, ist Groks genaue Position unklar.

Lange Terminal-Arbeit bleibt eine Schwäche. Bei Terminal-Bench 4.0, das mehrstündige Arbeit auf der Kommandozeile prüft, erreichte Grok 4.7 37,6 %. Das ist fast das Doppelte von Grok 4.6, aber weit hinter den 57,9 % von Fable 5.1.

Medizin ist nicht seine Stärke. Bei HealthBench Professional, einem Test für klinisches Denken, erzielte es 56,7 % und liegt damit unter GPT-5.6 Sol und Fable 5.1.

Das sind alles Zahlen von xAI. Die Vorsprünge bei Recht und Technik sind spannend, aber wir würden sie gern unabhängig bestätigt sehen.

Für wen es sich eignet

Wenn Sie den ganzen Tag mit KI an Dokumenten, Analysen und technischen Fragen arbeiten und die Monatsrechnung eine Rolle spielt, verdient Grok 4.7 einen ernsthaften Test. Es liefert den Großteil der Qualität der Spitzenmodelle zu einem Bruchteil der Kosten.

Wenn Sie das sorgfältigste Urteil brauchen, das es gibt, nehmen Sie Claude Opus 5.5. Wenn ein Agent Software auf Ihrem Computer bedienen soll, nehmen Sie GPT-6 Astra. Für alles dazwischen ist Grok 4.7 das preiswerteste Modell nahe der Spitze.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Arbeit nahe der Spitzenklasse zum Sparpreis: $2 pro Million Eingabe-Token und $6 pro Million Ausgabe-Token. Das ist weniger als ein Drittel des Ausgabepreises von Claude Opus 5.5 und etwa ein Achtel von GPT-6 Astra. Für Teams, die den ganzen Tag mit KI arbeiten, macht sich der Unterschied auf der Monatsrechnung bemerkbar.
  • Überraschend stark bei juristischer Arbeit: Beim Harvey Legal Agent Benchmark erzielte Grok 4.7 in xAIs Tabelle 19,6 %, vor Claude Fable 5.1 (6,7 %) und GPT-5.6 Sol (2,5 %). Es ist ein harter Test, bei dem alle Modelle noch niedrig abschneiden, aber Grok führte den Vergleich an.
  • Gut in technischer Mathematik: Bei EEBench, einem Test mit Aufgaben aus der Elektrotechnik, erzielte es 64,0 % – vor Fable 5.1 (56,4 %) und deutlich über Grok 4.6 (53,0 %).
  • Prüft die eigene Arbeit: xAI hat Grok 4.7 mit längeren, schwierigeren Aufgaben trainiert und gezielt verbessert, wie es seine Antworten überprüft und mit langen Dokumenten umgeht. Bei AA Briefcase, einem Test mehrstündiger Büroarbeit, sprang es von 1.546 auf 1.657 – nah an Fable 5.1 mit 1.678.
  • Sicherer, ohne zu belehren: xAI hat das Sicherheitssystem neu aufgebaut. Das Unternehmen nennt Grok 4.7 sein bislang stärkstes Modell beim Ablehnen gefährlicher Anfragen und beim Widerstand gegen Jailbreaks, das legitime Arbeit wie defensive Sicherheitsforschung dennoch selten blockiert.

Ehrliche Einschränkungen

  • Nicht mit den neuesten Konkurrenten verglichen: xAIs Tabelle stellt Grok 4.7 GPT-5.6 Sol und Claude Fable 5.1 gegenüber. Claude Opus 5.5 und GPT-6 Sol kamen einen Tag später heraus, unabhängige direkte Vergleiche stehen also noch aus.
  • Schwächer bei langen Terminal-Sitzungen: Bei Terminal-Bench 4.0, das mehrstündige Arbeit auf der Kommandozeile prüft, erreichte es 37,6 % – ein großer Sprung gegenüber den 20,3 % von Grok 4.6, aber weit hinter Fable 5.1 mit 57,9 %.
  • Rückstand bei Medizin: Bei HealthBench Professional, einem Test für klinisches Denken, erzielte es 56,7 % und liegt damit unter GPT-5.6 Sol (60,5 %) und Fable 5.1 (62,1 %).
  • Nur Herstellerzahlen: Jede Zahl hier stammt aus xAIs Ankündigung. Betrachten Sie die Vorsprünge bei Recht und Technik als vielversprechend, bis unabhängige Tests sie bestätigen.
03

Benchmark-Übersicht

Harvey Legal Agent Benchmark — 19,6 %

Agentenbasierte juristische Arbeit. xAIs Tabelle: Grok 4.7 19,6 %, Grok 4.6 15,8 %, Claude Fable 5.1 6,7 %, GPT-5.6 Sol 2,5 %. Ein sehr harter Test; niedrige absolute Werte sind normal.

EEBench — 64,0 %

Lösen von Aufgaben aus der Elektrotechnik. Grok 4.6 erreichte in derselben Tabelle 53,0 %, Claude Fable 5.1 56,4 %, GPT-5.6 Sol 39,4 %.

AA Briefcase v1.1 — 1.657

Mehrstündige Büroaufgaben wie Dokumente und Präsentationen. Gestiegen von 1.546 bei Grok 4.6 und knapp hinter Claude Fable 5.1 mit 1.678.

Terminal-Bench 4.0 — 37,6 %

Mehrstündige Terminal-Arbeit. Eine große Verbesserung gegenüber Grok 4.6 (20,3 %), gleichauf mit GPT-5.6 Sol (37,3 %), aber weit hinter Claude Fable 5.1 (57,9 %) in xAIs Tabelle. (Anthropics eigener Durchlauf sieht Fable 5.1 bei 55,8 %; unabhängige Tests sehen GPT-6 Astra und Claude Opus 5.5 bei 59,6 %.)

Preis — $2 / $6 pro 1 Mio. Token

Unverändert gegenüber Grok 4.6. Eine schnelle Variante bietet doppelte Ausgabegeschwindigkeit zum doppelten Preis.

04

Das Fazit

Grok 4.7 hält unseren Platz 5 im Alltags-Ökosystem als preiswertestes Modell nahe der Spitze. Es ist nicht der klügste Assistent, den man kaufen kann. Claude Opus 5.5 und GPT-6 Astra führen weiterhin beim sorgfältigen Abwägen und bei der Bedienung von Software. Aber Grok 4.7 kommt bei Büroarbeit überraschend nah heran, führt seine Starttabelle bei juristischen und technischen Tests an und kostet nur einen Bruchteil. Wer den ganzen Tag mit KI arbeitet und auf die Rechnung achtet, sollte es ernsthaft ausprobieren.

05

Häufig gestellte Fragen