Classé #7 Écosystème du quotidien — Les assistants IA leaders
xAI

Grok 4.7

Grok 4.7 conserve le prix bas de Grok 4.6 – 2 $ en entrée, 6 $ en sortie par million de tokens –, mais c'est un modèle nettement plus solide et plus soigneux. xAI l'a entraîné sur des tâches plus longues et plus difficiles, et lui a appris à vérifier son propre travail. C'est le moyen le plus économique d'obtenir une aide proche du meilleur niveau pour le travail de bureau, les projets de textes juridiques et les mathématiques d'ingénieur.

Mis à jour 27 septembre 2026 Value Frontier$2/$6 PricingSelf-Verification
9.6sur 10
Site officiel
Idéal pour

Grok 4.7 conserve le prix bas de Grok 4.6 – 2 $ en entrée, 6 $ en sortie par million de tokens –, mais c'est un modèle nettement plus solide et plus soigneux. xAI l'a entraîné sur des tâches plus longues et plus difficiles, et lui a appris à vérifier son propre travail. C'est le moyen le plus économique d'obtenir une aide proche du meilleur niveau pour le travail de bureau, les projets de textes juridiques et les mathématiques d'ingénieur.

Pourquoi ça Gagne

Même prix de 2 $/6 $ que Grok 4.6, avec une variante rapide deux fois plus véloce pour deux fois le prix. Dans le tableau de lancement de xAI, Grok 4.7 obtient le meilleur score sur le Harvey Legal Agent Benchmark (19,6 %, contre 6,7 % pour Claude Fable 5.1) et sur EEBench en génie électrique (64,0 %). Sur AA Briefcase, un test de travail de bureau de plusieurs heures, il talonne Fable 5.1 (1 657 contre 1 678). xAI le présente comme son modèle le plus solide à ce jour pour refuser les demandes dangereuses et résister aux jailbreaks.

À surveiller

Son tableau de lancement le compare à GPT-5.6 Sol et Claude Fable 5.1, pas aux plus récents Claude Opus 5.5 ou GPT-6 Sol : sa place face aux meilleurs modèles actuels n'est donc pas encore établie. Il reste nettement derrière sur le travail long en terminal (37,6 % sur Terminal-Bench 4.0 contre 57,9 % pour Fable 5.1) et sur le raisonnement clinique. Tous les chiffres viennent de xAI.

01

Ce que c'est réellement

Imaginez une compagnie aérienne low cost qui garde le prix de ses billets mais remplace discrètement ses avions par des appareils plus grands et plus performants.

C’est à peu près ce qu’a fait xAI avec Grok 4.7, sorti le 21 septembre 2026. Le prix n’a pas bougé : 2 $ par million de tokens en entrée et 6 $ par million en sortie, exactement comme Grok 4.6. Ce qui a changé, c’est le modèle en dessous.

Ce qui change sous le capot

xAI décrit trois changements, en termes simples :

  1. Un modèle de base plus grand. Selon xAI, la version 4.7 repose sur une fondation plus vaste que la 4.6. Son annonce ne donne pas de nombre de paramètres : considérez donc comme non confirmé tout chiffre précis lu ailleurs.
  2. Un entraînement plus long et plus exigeant. Le modèle a été entraîné par apprentissage par renforcement sur des tâches qui prennent de nombreuses heures, précisément le type de travail où les modèles précédents perdaient le fil à mi-parcours.
  3. Vérifier son propre travail. xAI l’a entraîné spécifiquement à contrôler ses réponses et à gérer les longs documents de façon plus fiable.

Résultat : un modèle qui tient mieux la distance sur une longue tâche et qui repère ses propres erreurs avant vous.

Là où il nous a surpris

Les chiffres les plus intéressants du tableau de lancement de xAI ne concernent pas la programmation. Ils se trouvent dans des domaines où l’on n’attendrait pas un modèle bon marché en tête.

  • Le travail juridique. Sur le Harvey Legal Agent Benchmark, qui mesure la capacité d’un agent d’IA à mener de vraies tâches juridiques, Grok 4.7 obtient 19,6 %. C’est devant Claude Fable 5.1 (6,7 %) et GPT-5.6 Sol (2,5 %). Le test est d’une difficulté brutale et tout le monde y obtient des scores bas, mais Grok est arrivé en tête de cette comparaison.
  • Les mathématiques d’ingénieur. Sur EEBench, qui évalue des problèmes de génie électrique, il obtient 64,0 %, devant les 56,4 % de Fable 5.1.
  • Le travail de bureau. Sur AA Briefcase, un test de tâches de bureau de plusieurs heures comme la préparation de documents et de présentations, il atteint 1 657, juste derrière les 1 678 de Fable 5.1 et bien au-dessus des 1 546 de Grok 4.6.

En clair : sur le vrai travail de bureau et les tâches professionnelles, Grok 4.7 joue désormais dans la même cour que des modèles plusieurs fois plus chers.

Plus sûr que sa réputation

Grok a la réputation d’être le chatbot aux garde-fous les plus légers. Pour la version 4.7, cette réputation est dépassée. xAI dit avoir construit un système de sécurité entièrement nouveau et le présente comme son modèle le plus solide à ce jour pour refuser les demandes dangereuses et résister aux jailbreaks. L’entreprise affirme aussi qu’il bloque rarement le travail légitime, comme la recherche en sécurité défensive.

Grok continue de répondre franchement plutôt que d’enrober ses réponses d’avertissements. Mais c’est une question de style, pas une absence de sécurité.

Le bémol, en toute franchise

Il n’a pas encore affronté les rivaux les plus récents. Le tableau de xAI compare Grok 4.7 à GPT-5.6 Sol et à Claude Fable 5.1. Le lendemain de sa sortie, Anthropic a lancé Claude Opus 5.5 et OpenAI GPT-6 Sol, deux concurrents solides et bien placés en prix. Tant que des tests indépendants ne les auront pas mis côte à côte, la position exacte de Grok reste incertaine.

Le travail long en terminal reste un point faible. Sur Terminal-Bench 4.0, qui évalue un travail de plusieurs heures en ligne de commande, Grok 4.7 obtient 37,6 %. C’est presque le double de Grok 4.6, mais loin derrière les 57,9 % de Fable 5.1.

La médecine n’est pas son fort. Sur HealthBench Professional, un test de raisonnement clinique, il obtient 56,7 %, sous GPT-5.6 Sol et Fable 5.1.

Ce sont tous des chiffres de xAI. Ses avances en droit et en ingénierie sont enthousiasmantes, mais nous aimerions les voir confirmées de façon indépendante.

Pour qui ?

Si vous utilisez l’IA toute la journée pour des documents, des analyses et des questions techniques, et que la facture mensuelle compte, Grok 4.7 mérite un vrai essai. Il vous donne l’essentiel de la qualité des meilleurs modèles pour une fraction du coût.

Si vous avez besoin du jugement le plus minutieux qui soit, prenez Claude Opus 5.5. Si vous voulez qu’un agent pilote des logiciels sur votre ordinateur, prenez GPT-6 Astra. Pour tout ce qui se situe entre les deux, Grok 4.7 est le meilleur rapport qualité-prix près du sommet.

02

Forces et limites honnêtes

Points Forts

  • Un niveau proche du sommet à prix cassé : 2 $ par million de tokens en entrée et 6 $ par million en sortie. C’est moins d’un tiers du prix de sortie de Claude Opus 5.5 et environ un huitième de celui de GPT-6 Astra. Pour les équipes qui utilisent l’IA toute la journée, la différence se voit sur la facture mensuelle.
  • Étonnamment fort en travail juridique : sur le Harvey Legal Agent Benchmark, Grok 4.7 a obtenu 19,6 % dans le tableau de xAI, devant Claude Fable 5.1 (6,7 %) et GPT-5.6 Sol (2,5 %). C’est un test difficile où tous les modèles restent à des scores bas, mais Grok est arrivé en tête de la comparaison.
  • À l’aise avec les mathématiques d’ingénieur : sur EEBench, un test de problèmes de génie électrique, il a obtenu 64,0 %, devant Fable 5.1 (56,4 %) et bien au-dessus de Grok 4.6 (53,0 %).
  • Il vérifie son propre travail : xAI a entraîné Grok 4.7 sur des tâches plus longues et plus difficiles, et a spécifiquement amélioré sa façon de vérifier ses réponses et de gérer les longs documents. Sur AA Briefcase, un test de travail de bureau de plusieurs heures, il est passé de 1 546 à 1 657, tout près des 1 678 de Fable 5.1.
  • Plus sûr sans faire la morale : xAI a reconstruit son système de sécurité. L’entreprise présente Grok 4.7 comme son modèle le plus solide à ce jour pour refuser les demandes dangereuses et résister aux jailbreaks, tout en bloquant rarement le travail légitime comme la recherche en sécurité défensive.

Limites Honnêtes

  • Pas comparé aux rivaux les plus récents : le tableau de xAI oppose Grok 4.7 à GPT-5.6 Sol et Claude Fable 5.1. Claude Opus 5.5 et GPT-6 Sol sont sortis le lendemain : les comparaisons directes indépendantes restent à faire.
  • Moins bon sur les longues sessions en terminal : sur Terminal-Bench 4.0, qui évalue un travail de plusieurs heures en ligne de commande, il obtient 37,6 %, un grand bond par rapport aux 20,3 % de Grok 4.6, mais loin derrière Fable 5.1 à 57,9 %.
  • En retrait en médecine : sur HealthBench Professional, un test de raisonnement clinique, il obtient 56,7 %, sous GPT-5.6 Sol (60,5 %) et Fable 5.1 (62,1 %).
  • Uniquement des chiffres de l’éditeur : chaque chiffre cité ici provient de l’annonce de xAI. Considérez ses avances en droit et en ingénierie comme prometteuses jusqu’à ce que des tests indépendants les confirment.
03

Aperçu des Benchmarks

Harvey Legal Agent Benchmark — 19,6 %

Travail juridique mené par des agents. Tableau de xAI : Grok 4.7 19,6 %, Grok 4.6 15,8 %, Claude Fable 5.1 6,7 %, GPT-5.6 Sol 2,5 %. Un test très difficile ; des scores absolus bas sont normaux.

EEBench — 64,0 %

Résolution de problèmes de génie électrique. Dans le même tableau, Grok 4.6 obtient 53,0 %, Claude Fable 5.1 56,4 % et GPT-5.6 Sol 39,4 %.

AA Briefcase v1.1 — 1 657

Tâches de bureau de plusieurs heures, comme des documents et des présentations. En hausse par rapport aux 1 546 de Grok 4.6, juste derrière Claude Fable 5.1 à 1 678.

Terminal-Bench 4.0 — 37,6 %

Travail de plusieurs heures en terminal. Un grand progrès par rapport à Grok 4.6 (20,3 %), à égalité avec GPT-5.6 Sol (37,3 %), mais loin derrière Claude Fable 5.1 (57,9 %) dans le tableau de xAI. (La propre exécution d'Anthropic place Fable 5.1 à 55,8 % ; les tests indépendants placent GPT-6 Astra et Claude Opus 5.5 à 59,6 %.)

Prix — 2 $ / 6 $ par million de tokens

Inchangé par rapport à Grok 4.6. Une variante rapide offre une vitesse de sortie doublée pour un prix doublé.

04

Le Verdict

Grok 4.7 garde notre cinquième place dans l’Écosystème du quotidien comme le meilleur rapport qualité-prix près du sommet. Ce n’est pas l’assistant le plus intelligent du marché : Claude Opus 5.5 et GPT-6 Astra restent devant pour le jugement minutieux et le pilotage de logiciels. Mais Grok 4.7 s’en approche étonnamment sur le travail de bureau, arrive en tête de son tableau de lancement sur les tests juridiques et d’ingénierie, et coûte une fraction du prix. Si vous utilisez l’IA toute la journée et surveillez la facture, il mérite un vrai essai.

05

Foire aux questions