La plupart des assistants d’IA se comportent comme un stagiaire très vif. Ils répondent instantanément, avec aplomb. Confiez-leur un bail de quarante pages et ils vous rendront un résumé impeccable qui oublie justement la clause de la page 37, celle qui compte.
Claude Opus 5.5 ressemble davantage à la collègue expérimentée qui lit d’abord tout le document. Ensuite, elle vous dit en deux phrases où se trouve le problème et à quelle page le chercher.
Anthropic a lancé Opus 5.5 le 22 septembre 2026, premier modèle de sa famille Claude 5.5. Il prend notre première place dans l’Écosystème du quotidien pour une raison simple : c’est le modèle qui raisonne le plus soigneusement parmi tous ceux que nous pouvons mesurer, et il n’est plus vendu au prix d’un produit de luxe.
Ce que disent les tests indépendants
Deux chiffres portent l’essentiel de l’argument, et tous deux viennent d’Artificial Analysis, pas du service marketing d’Anthropic.
Le premier est l’Artificial Analysis Intelligence Index, un score qui combine dix évaluations exigeantes : raisonnement, sciences, programmation et connaissances. En effort maximal, Opus 5.5 a obtenu 58 en septembre 2026. C’était la tête du classement à sa sortie, devant GPT-6 Astra et devant le propre modèle haut de gamme d’Anthropic, Claude Fable 5.1. (L’indice est recalibré de temps à autre : un score n’a de sens qu’à côté de modèles mesurés à la même époque.)
Le second est GDPval-AA v2.1, plus proche de la vraie vie. Au lieu de répondre à des questions d’examen, les modèles produisent de vrais livrables – un modèle dans un tableur, une note juridique, une synthèse pour la direction – issus de 44 métiers, puis les résultats s’affrontent deux à deux, comme dans un classement d’échecs. Opus 5.5 atteint 1846 Elo. Fable 5.1 obtient 1735, Opus 5 1708 et GPT-6 Astra 1542.
Les tests internes d’Anthropic vont dans le même sens. Dans l’un d’eux, trois modèles devaient rédiger un rapport sur les résultats trimestriels d’une entreprise à partir d’une copie du web où le communiqué de résultats était difficile à trouver ; le moindre chiffre ou la moindre citation inventés valaient un échec. Opus 5.5 a réussi 16 fois sur 18. Fable 5.1 et Opus 5, pas une seule fois. C’est exactement ce qu’on attend d’un assistant : pas seulement de l’intelligence, mais de la prudence dans ce qu’il affirme.
Le prix, raconté avec précision
Vous avez peut-être lu qu’Opus 5.5 est « 40 % moins cher ». C’est vrai, mais il vaut la peine de comprendre d’où vient ce chiffre.
- Le prix des tokens baisse de 20 % : 4 $ par million de tokens en entrée et 20 $ par million en sortie, contre 5 $ et 25 $ auparavant.
- La lecture en cache baisse de 60 % : à 0,20 $ par million. Quand vous enchaînez les questions sur le même long document, le modèle le relit depuis une mémoire tampon, et cette relecture représente l’essentiel de la facture des agents et des outils de programmation.
- Au niveau par défaut, il consomme moins de tokens : selon Anthropic, c’est ce qui place une charge de travail typique environ 40 % sous Opus 5.
Pour comparaison, Fable 5.1 est affiché à 10 $/50 $. Opus 5.5 vous donne l’essentiel des capacités de Fable pour 40 % de son prix au token. Anthropic va jusqu’à dire que, dans son propre usage quotidien, l’écart entre les deux est « plus étroit que ne le suggèrent ces scores ».
Il écrit enfin comme un humain
L’un des reproches les plus fréquents faits à Opus 5 était la difficulté à suivre ses réponses : longues, jargonnantes, avec l’idée principale enfouie au quatrième paragraphe. Anthropic dit s’être attaqué précisément à ce problème. Opus 5.5 commence par la réponse, choisit des mots plus simples et suit les règles de style que vous lui donnez.
Cela paraît cosmétique, mais ça ne l’est pas. Une réponse que l’on peut lire en trente secondes est une réponse que l’on peut vérifier. Une réponse brillante qu’il faut déchiffrer, on finit par la survoler et par lui faire confiance aveuglément.
Le bémol, en toute franchise
L’effort maximal a grand soif. À son niveau le plus élevé, Opus 5.5 explore de nombreuses pistes avant de répondre. Artificial Analysis a mesuré environ 119 000 tokens de sortie par tâche en effort maximal, contre environ 27 000 pour GPT-6 Astra. À ces volumes, un prix au token plus bas ne garantit pas une facture par réponse plus basse. La règle pratique est simple : pour le travail courant, laissez-le au niveau par défaut (moyen), où, selon Anthropic, il bat déjà sur GDPval un Astra poussé à l’effort maximal, pour environ un cinquième du coût. Ne montez d’un cran que lorsqu’un problème est vraiment difficile.
Il ne crée pas d’images. Claude lit très bien les graphiques, les captures d’écran et les PDF scannés, mais il ne génère ni images, ni audio, ni vidéo. Si vous cherchez une application qui fait tout, ChatGPT reste plus complet.
Certaines portes sont gardées. Opus 5.5 est si performant en cybersécurité et en biologie qu’Anthropic lui applique des garde-fous supplémentaires. La plupart des tâches de sécurité sont traitées en coulisses par l’ancien Opus 4.8, et certaines recherches en biologie exigent d’adhérer au programme de vérification d’Anthropic. La plupart des gens ne le remarqueront jamais ; les équipes de sécurité, si.
Pour qui ?
| Si votre journée ressemble à… | Prenez | Pourquoi |
|---|---|---|
| Contrats, recherche, rapports, modèles financiers | Claude Opus 5.5 | Meilleur travail professionnel mesuré ; des réponses vérifiables |
| « Utilise ce logiciel sur mon ordinateur et termine le travail » | GPT-6 Astra | Un agent de pilotage de l’ordinateur plus fort et plus économe |
| Une seule application pour discuter, créer des images et parler | ChatGPT | L’offre grand public la plus large |
| D’énormes volumes de demandes simples | GPT-6 Luna | Une fraction de centime par tâche |
Le verdict pour le quotidien
Pour un e-mail rapide ou une question en passant, presque n’importe quel assistant moderne fera l’affaire. Mais quand les documents sont en désordre, que la question est ambiguë et qu’une erreur a des conséquences, Claude Opus 5.5 est l’assistant auquel nous faisons le plus confiance – et, pour la première fois, cette confiance ne se paie pas au prix du luxe.