Imaginez confier le même dossier difficile à trois collègues. Le premier lit tout, compare notes et graphiques, puis rend une argumentation soignée. Le second avance vite, appelle les outils nécessaires et transforme le dossier en tableau de bord avant midi. Le troisième traite mille dossiers semblables à la fois, extrayant les douze mêmes champs sans épuiser le budget.
C’est une bonne image de la famille Gemini actuelle. 3.1 Pro est l’analyste méthodique ; 3.7 Flash, le constructeur et agent rapide ; 3.5 Flash-Lite, la ligne de production bon marché. Le mot Pro ne rend pas le premier supérieur partout : il désigne le compromis pour lequel il a été conçu.
Un fleuron qui a vieilli en public
Google a lancé Gemini 3.1 Pro en Preview le 19 février 2026. Le progrès central concernait le raisonnement. Sur ARC-AGI-2—des énigmes où il faut découvrir des règles visuelles inconnues—Google est passé de 31,1 % avec Gemini 3 Pro à 77,1 %. S’y ajoutent 94,3 % à GPQA Diamond et 44,4 % à Humanity’s Last Exam sans outils.
Artificial Analysis a obtenu une conclusion similaire : 57 points, première place et tête de six composants sur dix. L’organisme mesurait environ 114 tokens de sortie par seconde, rapide pour un grand modèle de raisonnement de l’époque, et jugeait le tarif 2/12 $ attractif face aux fleurons contemporains.
La date est essentielle. Un classement est une photo, pas une ceinture à vie. Six mois de sorties ont déplacé le terrain. 3.1 Pro n’est pas devenu moins intelligent ; d’autres modèles ont progressé en code de longue durée, contrôle d’ordinateur et processus professionnels.
Là où 3.1 Pro garde sa valeur
Il excelle lorsque le problème est difficile avant de devenir répétitif. Un scientifique réunit article et microscopie ; un enquêteur, entretien, chronologie et rapport financier ; une équipe produit, capture vidéo et code source. Tout tient dans une requête multimodale allant jusqu’à un million de tokens.
Il s’agit d’analyse, pas de génération multimédia. 3.1 Pro produit du texte. Veo crée la vidéo, Nano Banana les images et Lyria la musique. Les relier dans un produit ne les transforme pas en fonctions d’un seul modèle, pas plus qu’un chef d’orchestre ne joue chaque instrument.
Le contexte est une immense table, pas une mémoire photographique. Dans MRCR, Google passe de 84,9 % en moyenne à 128k à 26,3 % sur le test ponctuel à 1M. Si tout dépend d’une phrase page 4 000, tout charger et espérer est une mauvaise architecture. Réduisez le corpus, nommez les sources, exigez les pages et contrôlez.
La longue attente de Gemini 3.5 Pro
Le 19 mai, Google disait que 3.5 Pro était utilisé en interne et arriverait « le mois prochain ». Juin s’est terminé sans modèle. Le 16 juillet, Bloomberg a rapporté plusieurs mois de retard : les efforts d’amélioration, surtout en programmation, n’atteignaient pas les objectifs internes.
Cinq jours plus tard, Google lançait 3.6 Flash et 3.5 Flash-Lite. Pro était désormais « testé avec des partenaires » et sortirait « dès qu’il serait prêt ». Le même texte annonçait que le préentraînement le plus ambitieux de Gemini 4 avait commencé. En août, la page publique promet encore “3.5 Pro coming soon” au-dessus de l’ancien 3.1 Pro.
SemiAnalysis affirme qu’il a été discrètement annulé. Les indices rendent l’hypothèse crédible, mais Google ne l’a pas confirmée. Le modèle peut être annulé, renommé, absorbé dans Gemini 4 ou profondément repris. Conclusion pratique : ne financez ni abonnement ni architecture autour d’une promesse sans endpoint.
L’écosystème a continué
Gemini 3.7 Flash, GA depuis le 13 août, est désormais une cible de migration même pour beaucoup de charges 3.1 Pro. Il offre 1M de contexte, 64k de sortie, outils et réflexion faible, moyenne ou élevée. Google publie 43,6 % à FrontierCode, 65,3 % à DeepSWE, 85,8 % à Terminal-Bench et 34 % à GDP.pdf. Son index AA est 56 et sa vitesse voisine de 340 tokens/s. Prix : 0,75/3,75 $ jusqu’en décembre, puis 1,50/7,50 $.
3.5 Flash-Lite occupe une autre couche. Stable, multimodal, doté de 1M de contexte, il coûte 0,30/2,50 $ et approche 350 tokens/s. Ses tâches naturelles sont parsing, classement, extraction de reçus, sous-agents de recherche et variantes parallèles. Il surpasse largement 3.1 Flash-Lite sur Terminal-Bench, contexte long et GDPval-AA. Lite ne devient pas Pro ; il devient un convoyeur étonnamment compétent.
Le choix pratique
Gardez 3.1 Pro si vos évaluations montrent de meilleurs résultats en science, recherche ou logique inconnue. Prenez 3.7 Flash par défaut pour les nouveaux agents, interfaces, automatisations et volumes importants. Placez 3.5 Flash-Lite en coulisses pour de nombreuses petites tâches précises.
Et pour 3.5 Pro, attendez un endpoint. Les noms de modèles sont des promesses ; les endpoints sont des produits.