Classé #5 Programmation — L'IA qui écrit du code de production
xAI

Grok 4.6

Grok 4.6 est une vraie mise à niveau pour les agents de code : meilleur pour explorer un dépôt, maintenir une longue implémentation et produire un premier jet visuel, toujours à $2/$6 et disponible immédiatement dans Cursor et Grok Build.

Mis à jour 14 août 2026 Agentic CodingCursorGrok Build
9.7sur 10
Site officiel
Idéal pour

Grok 4.6 est une vraie mise à niveau pour les agents de code : meilleur pour explorer un dépôt, maintenir une longue implémentation et produire un premier jet visuel, toujours à $2/$6 et disponible immédiatement dans Cursor et Grok Build.

Pourquoi ça Gagne

Face à 4.5, il progresse sur CursorBench (69,9% contre 66,7%), DeepSWE (65,9% contre 54%), FrontierCode (61,3% contre 56,6%), APEX-Agents (57,5% contre 47,1%), Terminal-Bench v3 (26% contre 15,7%) et APEX-SWE (56,4% contre 53,6%).

À surveiller

GPT-5.6 Sol mène DeepSWE et Terminal-Bench v3 ; Fable 5 mène plusieurs autres lignes. Il manque un résultat SWE-bench Verified complet, et les premières alertes de sécurité exigent sandbox et relecture stricte.

01

Ce que c'est réellement

Un bon agent de code ressemble moins à l’autocomplétion qu’à un ingénieur junior chargé d’un ticket. Il doit explorer le dépôt, formuler une hypothèse, lancer des commandes, comprendre les erreurs et se souvenir du but après le douzième détour. Grok 4.6 a été entraîné pour cette boucle longue. xAI met en avant le travail sur une base de code entière, la recherche dans un domaine inconnu, le développement web, les applications visuelles, plusieurs cycles de retours et davantage d’autotests qu’avec Grok 4.5. L’objectif n’est plus seulement un joli fragment de code, mais une tâche menée jusqu’à un résultat vérifiable.

Le profil des benchmarks confirme un vrai saut générationnel. CursorBench v3.2 passe de 66,7% à 69,9%, DeepSWE v1.1 de 54% à 65,9% et FrontierCode v1.1 de 56,6% à 61,3%. APEX-Agents, APEX-SWE et Terminal-Bench v3 progressent également. Une seule bonne ligne pourrait dépendre d’un prompt ou d’un harness favorable ; une amélioration sur six évaluations de code et d’agents constitue un signal bien plus difficile à écarter.

Grok ne devient pourtant pas le roi universel du logiciel. Dans la comparaison xAI, GPT-5.6 Sol atteint 73% sur DeepSWE et Fable 5 70%. Sur Terminal-Bench v3, les 26% de Grok restent sous les 34,6% et 34,1% publiés pour ses concurrents. Fable garde aussi de petits avantages sur CursorBench, FrontierCode, APEX-Agents et APEX-SWE. Le lancement ne contient pas de résultat SWE-bench Verified complet. Il serait trompeur de remplir ce blanc avec un autre test : réparer un dépôt, piloter un terminal et construire une interface sont des compétences proches, mais non identiques.

Le prix et l’accès changent néanmoins la décision pratique. Grok 4.6 était disponible dès le premier jour dans Cursor et Grok Build, ainsi que via l’API xAI, OpenRouter, Vercel et Cloudflare. Le tarif standard reste à 2 dollars en entrée et 6 dollars en sortie par million de jetons ; la variante rapide coûte deux fois plus. Artificial Analysis mesure environ 0,84 dollar par tâche pour le modèle général. Lorsqu’un agent doit enquêter trois fois, tenter deux correctifs puis passer une revue finale, le prix de chaque itération devient une caractéristique d’ingénierie.

Cette économie ne doit surtout pas financer moins de garde-fous. Les premiers retours pratiques mentionnent des modifications de sécurité dangereuses et de mauvaises réactions après un échec. Ils ne mesurent pas la fréquence du problème, mais décrivent un risque plausible. Commencez par une exploration du dépôt en lecture seule, gardez les secrets hors de portée, limitez l’écriture à une branche isolée, demandez de petits diffs et lancez la CI après chaque changement important. N’augmentez l’autonomie qu’après la réussite sur des tâches internes tenues à l’écart.

Une comparaison équitable doit enfin porter sur le système complet : même ticket, mêmes outils, mêmes limites de temps et de relances, mêmes tests. Ne notez pas seulement si un correctif a fini par fonctionner ; mesurez le nombre de tours, de jetons et de minutes de revue humaine nécessaires avant un merge. Grok 4.6 est surtout un agent de code de pointe à forte valeur : assez capable pour un travail sérieux en plusieurs étapes, assez économique pour recommencer et déjà présent dans les outils des équipes. Son avantage n’existe que si le processus vérifie rigoureusement ce qu’il écrit.

02

Forces et limites honnêtes

Points Forts

  • Progrès large sur 4.5 : amélioration dans six évaluations publiées, notamment de grands bonds sur DeepSWE et Terminal-Bench v3 ; ce n’est pas une seule ligne chanceuse.
  • Pensé pour les projets longs : xAI privilégie les dépôts entiers, domaines inconnus, applications web et visuelles, autotests et itération plutôt que de courtes réponses de code.
  • CursorBench compétitif : 69,9%, proche des 70,5% de Fable 5.
  • Itération économique : $2/$6 par million et environ $0,84 par tâche AA mesurée rendent tests, secondes tentatives et revue abordables au lieu de tout miser sur un passage coûteux.
  • Disponible dès le lancement : Cursor, Grok Build, API et partenaires d’infrastructure.

Limites Honnêtes

  • Pas leader sur DeepSWE : 65,9% reste sous GPT-5.6 Sol à 73% et Fable 5 à 70%.
  • Terminal-Bench v3 reste faible : 26% progresse fortement, mais reste sous les scores autour de 34%.
  • Pas de SWE-bench Verified complet : le lancement ne tranche pas toute comparaison de réparation.
  • Les anecdotes de sécurité avertissent : lecture seule d’abord, secrets limités et revue de chaque diff.
  • Modèle et harness forment un système : prompts, outils, arrêts et tests modifient le résultat.
03

Aperçu des Benchmarks

CursorBench v3.2 — 69,9%

3,2 points au-dessus de Grok 4.5 et proche du meilleur score cité.

DeepSWE v1.1 — 65,9%

Grand saut générationnel, sans prendre la tête.

FrontierCode v1.1 — 61,3%

Au-dessus de GPT-5.6 Sol et sous Fable 5 dans le tableau xAI.

APEX-Agents — 57,5%

Signal agentique solide, proche du meilleur concurrent.

Terminal-Bench v3.0 — 26%

Le contrepoids important : progrès net, mais pas de leadership.

04

Le Verdict

Grok 4.6 compte parmi les meilleurs agents de code en valeur, notamment pour les longues enquêtes de dépôt, prototypes de produit, applications visuelles et travaux à plusieurs boucles de feedback. Choisissez-le pour sa capacité proche de la pointe et son faible coût d’itération, pas pour un grand chelem imaginaire. CI, sandbox, identifiants limités et revue humaine restent des composants du système.

05

Foire aux questions