Guide classé

Écosystème du quotidien — Les assistants IA leaders

Ce sont les couteaux suisses de l'intelligence artificielle : les assistants qu'on ouvre avant même sa messagerie. Ils écrivent, raisonnent, planifient et inventent parfois des choses avec un aplomb impressionnant. Claude Opus 5.5 mène actuellement pour le travail intellectuel soigné et vérifiable, Claude Sonnet 5.5 offre presque les mêmes résultats en travail de bureau, y compris dans l'offre gratuite de Claude, GPT-6 Astra est le plus fort pour piloter des logiciels à votre place, et GPT-6.1 Sol apporte à ChatGPT Work des résultats proches d'Astra pour une fraction du coût. Voici ce que chacun fait bien, où il trébuche, et pourquoi le bon choix dépend de votre journée.

La décision d'abord

Notre classement

Commencez par le gagnant, puis comparez les compromis qui pourraient changer votre choix.

#1 Écosystème Quotidien

Claude Opus 5.5

Anthropic

Claude Opus 5.5 est le modèle auquel nous confierions un dossier embrouillé et à fort enjeu en sachant qu'il reviendra avec la bonne réponse. Selon Anthropic, il atteint le niveau de son modèle haut de gamme, Fable 5.1, sur la plupart des tâches, tout en coûtant moins de la moitié par token. Et il écrit désormais comme un collègue posé, plus comme un jeune diplômé nerveux.

Pourquoi ça Gagne

Meilleur score de l'indice indépendant Artificial Analysis Intelligence Index à sa sortie (58, effort maximal). En tête de GDPval-AA v2.1, un test de vrai travail professionnel, avec 1846 Elo, devant Fable 5.1 (1735). Le prix des tokens baisse de 20 %, à 4 $/20 $, et la lecture en cache de 60 %, à 0,20 $ ; selon Anthropic, une charge de travail typique revient ainsi environ 40 % moins cher qu'avec Opus 5. La génération est plus de 30 % plus rapide, et les plafonds d'usage sur cinq heures ont été relevés dans les forfaits payants.

L'Accroc

En effort maximal, il réfléchit énormément à voix haute : Artificial Analysis a mesuré environ 119 000 tokens de sortie par tâche, contre environ 27 000 pour GPT-6 Astra. Le prix affiché n'est donc avantageux que si le travail courant reste au niveau d'effort par défaut. Pas de génération d'images, le raisonnement ne peut plus être désactivé, et la plupart des demandes de cybersécurité sont discrètement confiées à l'ancien Opus 4.8.

9.8 Note éditoriale
Lire l'avis
Idéal pour

Claude Opus 5.5 est le modèle auquel nous confierions un dossier embrouillé et à fort enjeu en sachant qu'il reviendra avec la bonne réponse. Selon Anthropic, il atteint le niveau de son modèle haut de gamme, Fable 5.1, sur la plupart des tâches, tout en coûtant moins de la moitié par token. Et il écrit désormais comme un collègue posé, plus comme un jeune diplômé nerveux.

Pourquoi ça Gagne

Meilleur score de l'indice indépendant Artificial Analysis Intelligence Index à sa sortie (58, effort maximal). En tête de GDPval-AA v2.1, un test de vrai travail professionnel, avec 1846 Elo, devant Fable 5.1 (1735). Le prix des tokens baisse de 20 %, à 4 $/20 $, et la lecture en cache de 60 %, à 0,20 $ ; selon Anthropic, une charge de travail typique revient ainsi environ 40 % moins cher qu'avec Opus 5. La génération est plus de 30 % plus rapide, et les plafonds d'usage sur cinq heures ont été relevés dans les forfaits payants.

À surveiller

En effort maximal, il réfléchit énormément à voix haute : Artificial Analysis a mesuré environ 119 000 tokens de sortie par tâche, contre environ 27 000 pour GPT-6 Astra. Le prix affiché n'est donc avantageux que si le travail courant reste au niveau d'effort par défaut. Pas de génération d'images, le raisonnement ne peut plus être désactivé, et la plupart des demandes de cybersécurité sont discrètement confiées à l'ancien Opus 4.8.

#2

GPT-6 Astra

OpenAI

GPT-6 Astra est le nouveau vaisseau amiral d'OpenAI pour la part du travail qui se passe hors de la fenêtre de chat. Il pilote le navigateur, clique dans les applications de bureau, mène des flux de travail professionnels en plusieurs étapes jusqu'au bout, et vérifie ses propres faits environ deux fois mieux que GPT-5.6 Sol — dans le même écosystème ChatGPT, Codex et API que vous connaissez déjà.

9.8 Note éditoriale
Lire l'avis
#3

Claude Fable 5.1

Anthropic

Les mêmes poids que l'exclusif Mythos 5.1, mais avec la couche de sécurité que la plupart des utilisateurs obtiennent réellement. C'est le modèle qu'Anthropic vous conseille d'utiliser lorsque Opus 5, avec un effort élevé, échoue à vos évaluations privées — codage à long terme, recherche de plusieurs heures et documents qui doivent rester cohérents.

9.8 Note éditoriale
Lire l'avis
#4

Claude Sonnet 5.5

Anthropic

Claude Sonnet 5.5 est l'assistant de la semaine de travail ordinaire : résumer des documents, construire des tableurs et des présentations, rédiger des rapports. Dans les tests indépendants de travail de bureau, il se place à un ou deux points d'Opus 5.5, il est disponible dans l'offre gratuite de Claude, et ses tokens d'API coûtent moitié moins. Opus connaît toutefois davantage de faits et s'en sort mieux sur les problèmes vraiment embrouillés.

9.7 Note éditoriale
Lire l'avis
#5

GPT-6.1 Sol

OpenAI

GPT-6.1 Sol est le modèle de travail quotidien d'OpenAI : celui à qui vous confiez vos rapports, vos PDF et vos tâches à plusieurs étapes dans ChatGPT Work. Lors de tests indépendants, il se classe juste un point derrière GPT-6 Astra, le modèle phare d'OpenAI, mais il coûte moins d'un quart de son prix pour une tâche classique. Il lit bien les longs documents et fait moins d'erreurs factuelles que le modèle qu'il remplace. Selon OpenAI, il peut également utiliser des applications de bureau presque aussi bien qu'Astra.

9.6 Note éditoriale
Lire l'avis
#6

Gemini 3.1 Pro

Google DeepMind

Gemini 3.1 Pro est le spécialiste de la réflexion profonde chez Google : un ancien fleuron toujours remarquable en science, logique nouvelle, longs documents et recherche multimodale. La famille Flash est plus rapide et moins chère, mais 3.1 Pro reste pertinent lorsque la qualité de l'analyse compte plus que la vitesse.

9.6 Note éditoriale
Lire l'avis
#7

Grok 4.7

xAI

Grok 4.7 conserve le prix bas de Grok 4.6 – 2 $ en entrée, 6 $ en sortie par million de tokens –, mais c'est un modèle nettement plus solide et plus soigneux. xAI l'a entraîné sur des tâches plus longues et plus difficiles, et lui a appris à vérifier son propre travail. C'est le moyen le plus économique d'obtenir une aide proche du meilleur niveau pour le travail de bureau, les projets de textes juridiques et les mathématiques d'ingénieur.

9.6 Note éditoriale
Lire l'avis
#8

Qwen3.8-Max

Alibaba / Qwen Team

Qwen3.8 existe désormais sous deux formes importantes : le produit hébergé Qwen3.8-Max avec vision, outils intégrés et un contexte par défaut d'un million de tokens, et le premier checkpoint téléchargeable de la gamme Max de Qwen. Le modèle ouvert est un modèle textuel de 2,4T au total et 95B actifs, doté d'un contexte natif de 262K extensible à environ un million de tokens.

9.0 Note éditoriale
Lire l'avis
Questions et réponses

Foire aux questions