Classé #4 Écosystème du quotidien — Les assistants IA leaders
Google DeepMind

Gemini 3.1 Pro

Gemini 3.1 Pro est le spécialiste de la réflexion profonde chez Google : un ancien fleuron toujours remarquable en science, logique nouvelle, longs documents et recherche multimodale. La famille Flash est plus rapide et moins chère, mais 3.1 Pro reste pertinent lorsque la qualité de l'analyse compte plus que la vitesse.

Mis à jour 14 août 2026 Multi-modalReasoningLong context
9.7sur 10
Site officiel
Idéal pour

Gemini 3.1 Pro est le spécialiste de la réflexion profonde chez Google : un ancien fleuron toujours remarquable en science, logique nouvelle, longs documents et recherche multimodale. La famille Flash est plus rapide et moins chère, mais 3.1 Pro reste pertinent lorsque la qualité de l'analyse compte plus que la vitesse.

Pourquoi ça Gagne

Au lancement : 77,1 % à ARC-AGI-2, 94,3 % à GPQA Diamond, 44,4 % à Humanity's Last Exam sans outils et 80,6 % à SWE-Bench Verified. Il accepte texte, images, audio, vidéo et PDF dans un contexte d'un million de tokens.

À surveiller

Six mois plus tard, il est toujours Preview, à 2/12 $ par million de tokens jusqu'à 200k de contexte. Le successeur 3.5 Pro a manqué l'objectif de juin et pourrait avoir été dépassé par la feuille de route Gemini 4 ; 3.7 Flash tient désormais le rôle de modèle de production.

01

Ce que c'est réellement

Imaginez confier le même dossier difficile à trois collègues. Le premier lit tout, compare notes et graphiques, puis rend une argumentation soignée. Le second avance vite, appelle les outils nécessaires et transforme le dossier en tableau de bord avant midi. Le troisième traite mille dossiers semblables à la fois, extrayant les douze mêmes champs sans épuiser le budget.

C’est une bonne image de la famille Gemini actuelle. 3.1 Pro est l’analyste méthodique ; 3.7 Flash, le constructeur et agent rapide ; 3.5 Flash-Lite, la ligne de production bon marché. Le mot Pro ne rend pas le premier supérieur partout : il désigne le compromis pour lequel il a été conçu.

Un fleuron qui a vieilli en public

Google a lancé Gemini 3.1 Pro en Preview le 19 février 2026. Le progrès central concernait le raisonnement. Sur ARC-AGI-2—des énigmes où il faut découvrir des règles visuelles inconnues—Google est passé de 31,1 % avec Gemini 3 Pro à 77,1 %. S’y ajoutent 94,3 % à GPQA Diamond et 44,4 % à Humanity’s Last Exam sans outils.

Artificial Analysis a obtenu une conclusion similaire : 57 points, première place et tête de six composants sur dix. L’organisme mesurait environ 114 tokens de sortie par seconde, rapide pour un grand modèle de raisonnement de l’époque, et jugeait le tarif 2/12 $ attractif face aux fleurons contemporains.

La date est essentielle. Un classement est une photo, pas une ceinture à vie. Six mois de sorties ont déplacé le terrain. 3.1 Pro n’est pas devenu moins intelligent ; d’autres modèles ont progressé en code de longue durée, contrôle d’ordinateur et processus professionnels.

Là où 3.1 Pro garde sa valeur

Il excelle lorsque le problème est difficile avant de devenir répétitif. Un scientifique réunit article et microscopie ; un enquêteur, entretien, chronologie et rapport financier ; une équipe produit, capture vidéo et code source. Tout tient dans une requête multimodale allant jusqu’à un million de tokens.

Il s’agit d’analyse, pas de génération multimédia. 3.1 Pro produit du texte. Veo crée la vidéo, Nano Banana les images et Lyria la musique. Les relier dans un produit ne les transforme pas en fonctions d’un seul modèle, pas plus qu’un chef d’orchestre ne joue chaque instrument.

Le contexte est une immense table, pas une mémoire photographique. Dans MRCR, Google passe de 84,9 % en moyenne à 128k à 26,3 % sur le test ponctuel à 1M. Si tout dépend d’une phrase page 4 000, tout charger et espérer est une mauvaise architecture. Réduisez le corpus, nommez les sources, exigez les pages et contrôlez.

La longue attente de Gemini 3.5 Pro

Le 19 mai, Google disait que 3.5 Pro était utilisé en interne et arriverait « le mois prochain ». Juin s’est terminé sans modèle. Le 16 juillet, Bloomberg a rapporté plusieurs mois de retard : les efforts d’amélioration, surtout en programmation, n’atteignaient pas les objectifs internes.

Cinq jours plus tard, Google lançait 3.6 Flash et 3.5 Flash-Lite. Pro était désormais « testé avec des partenaires » et sortirait « dès qu’il serait prêt ». Le même texte annonçait que le préentraînement le plus ambitieux de Gemini 4 avait commencé. En août, la page publique promet encore “3.5 Pro coming soon” au-dessus de l’ancien 3.1 Pro.

SemiAnalysis affirme qu’il a été discrètement annulé. Les indices rendent l’hypothèse crédible, mais Google ne l’a pas confirmée. Le modèle peut être annulé, renommé, absorbé dans Gemini 4 ou profondément repris. Conclusion pratique : ne financez ni abonnement ni architecture autour d’une promesse sans endpoint.

L’écosystème a continué

Gemini 3.7 Flash, GA depuis le 13 août, est désormais une cible de migration même pour beaucoup de charges 3.1 Pro. Il offre 1M de contexte, 64k de sortie, outils et réflexion faible, moyenne ou élevée. Google publie 43,6 % à FrontierCode, 65,3 % à DeepSWE, 85,8 % à Terminal-Bench et 34 % à GDP.pdf. Son index AA est 56 et sa vitesse voisine de 340 tokens/s. Prix : 0,75/3,75 $ jusqu’en décembre, puis 1,50/7,50 $.

3.5 Flash-Lite occupe une autre couche. Stable, multimodal, doté de 1M de contexte, il coûte 0,30/2,50 $ et approche 350 tokens/s. Ses tâches naturelles sont parsing, classement, extraction de reçus, sous-agents de recherche et variantes parallèles. Il surpasse largement 3.1 Flash-Lite sur Terminal-Bench, contexte long et GDPval-AA. Lite ne devient pas Pro ; il devient un convoyeur étonnamment compétent.

Le choix pratique

Gardez 3.1 Pro si vos évaluations montrent de meilleurs résultats en science, recherche ou logique inconnue. Prenez 3.7 Flash par défaut pour les nouveaux agents, interfaces, automatisations et volumes importants. Placez 3.5 Flash-Lite en coulisses pour de nombreuses petites tâches précises.

Et pour 3.5 Pro, attendez un endpoint. Les noms de modèles sont des promesses ; les endpoints sont des produits.

02

Forces et limites honnêtes

Points Forts

  • Excellent raisonnement abstrait et scientifique : Ses 77,1 % à ARC-AGI-2, 94,3 % à GPQA et 44,4 % à HLE l’ont placé parmi les meilleurs en février. Les benchmarks sont des cartes, pas le territoire, mais convergent vers une vraie aisance avec la logique inédite, la technique et la recherche.
  • Des preuves multimodales réunies dans une analyse : Il raisonne conjointement sur texte, images, audio, vidéo et PDF. On peut relier le ton d’un entretien à un graphique et à une démonstration. La sortie reste du texte ; Veo, Nano Banana et Lyria sont des modèles distincts.
  • Une grande table pour documents et code : Un million de tokens accueille dossiers, corpus scientifiques ou dépôts. Ce n’est pas une mémoire parfaite—Google n’obtient que 26,3 % sur son MRCR ponctuel à 1M—donc il faut cibler les sources et demander des citations.
  • Code et outils solides pour sa génération : Au lancement : 80,6 % à SWE-Bench Verified, 68,5 % à Terminal-Bench 2.0, 85,9 % à BrowseComp et 69,2 % à MCP Atlas. Fonctions, sortie structurée, recherche Google et exécution de code sont prises en charge.
  • Disponible sur les surfaces de travail Google : App Gemini, AI Studio, API, produits Enterprise, AI Mode, Antigravity et NotebookLM. Pour une organisation déjà dans Workspace et Cloud, l’accès gouverné peut compter davantage qu’un petit avantage au classement.

Limites Honnêtes

  • Le successeur promis reste bloqué : En mai, Google annonçait 3.5 Pro pour juin. Le délai a expiré ; Bloomberg a parlé de plusieurs mois de retard et de progrès insuffisants en code. Google a ensuite remplacé la date par des tests partenaires et une sortie ‘dès qu’il sera prêt’.
  • L’annulation est plausible, pas confirmée : SemiAnalysis rapporte une annulation discrète. Deux générations Flash et le préentraînement déjà lancé de Gemini 4 rendent cette lecture crédible, mais la page Google dit toujours ‘coming soon’. Annulation, nouveau nom ou refonte restent des hypothèses.
  • Flash convient mieux à beaucoup de production : 3.7 Flash est GA, meilleur sur de nombreux tests actuels et coûte temporairement 0,75/3,75 $. 3.5 Flash-Lite coûte 0,30/2,50 $ et vise l’extraction documentaire et les sous-agents parallèles.
  • Preview et baisse en contexte long imposent la prudence : Le cycle de vie est moins certain et 1M de tokens ne garantit pas de retrouver chaque fait caché. Il faut figer les versions, tester un repli, demander les sources et vérifier les réponses lourdes de conséquences.
03

Aperçu des Benchmarks

ARC-AGI-2 — 77,1 %

Résultat vérifié par Google sur des puzzles visuels aux règles nouvelles, contre 31,1 % pour Gemini 3 Pro. Le signe le plus clair du progrès abstrait.

GPQA Diamond — 94,3 %

Questions scientifiques difficiles de niveau supérieur sans outils. Un argument pour l'explication scientifique, jamais pour croire un fait sans source.

SWE-Bench Verified — 80,6 %

Excellent résultat sur des problèmes de dépôts réels. Les tests plus récents montrent un modèle encore capable, mais plus à la frontière du code.

Artificial Analysis Intelligence Index — 57 au lancement

Premier en février, à environ 114 tokens de sortie par seconde. Une photographie historique importante, pas un rang actuel.

04

Le Verdict

Gemini 3.1 Pro reste un bon spécialiste du raisonnement difficile, de la science et de la synthèse de preuves diverses. Pour un nouveau système, 3.7 Flash est généralement le choix de production ; 3.5 Flash-Lite est le moteur économique pour extraction et sous-agents. Quant à 3.5 Pro, attendez un endpoint : retards, rapport d’annulation et Gemini 4 indiquent que ce nom précis pourrait ne jamais être livré.

05

Foire aux questions