Classé #1 Écosystème du quotidien — Les assistants IA leaders
Anthropic

Claude Opus 5.5

Claude Opus 5.5 est le modèle auquel nous confierions un dossier embrouillé et à fort enjeu en sachant qu'il reviendra avec la bonne réponse. Selon Anthropic, il atteint le niveau de son modèle haut de gamme, Fable 5.1, sur la plupart des tâches, tout en coûtant moins de la moitié par token. Et il écrit désormais comme un collègue posé, plus comme un jeune diplômé nerveux.

Mis à jour 27 septembre 2026 AA Index 58 #1Knowledge Work SOTAAdaptive Thinking
9.8sur 10
Site officiel
Idéal pour

Claude Opus 5.5 est le modèle auquel nous confierions un dossier embrouillé et à fort enjeu en sachant qu'il reviendra avec la bonne réponse. Selon Anthropic, il atteint le niveau de son modèle haut de gamme, Fable 5.1, sur la plupart des tâches, tout en coûtant moins de la moitié par token. Et il écrit désormais comme un collègue posé, plus comme un jeune diplômé nerveux.

Pourquoi ça Gagne

Meilleur score de l'indice indépendant Artificial Analysis Intelligence Index à sa sortie (58, effort maximal). En tête de GDPval-AA v2.1, un test de vrai travail professionnel, avec 1846 Elo, devant Fable 5.1 (1735). Le prix des tokens baisse de 20 %, à 4 $/20 $, et la lecture en cache de 60 %, à 0,20 $ ; selon Anthropic, une charge de travail typique revient ainsi environ 40 % moins cher qu'avec Opus 5. La génération est plus de 30 % plus rapide, et les plafonds d'usage sur cinq heures ont été relevés dans les forfaits payants.

À surveiller

En effort maximal, il réfléchit énormément à voix haute : Artificial Analysis a mesuré environ 119 000 tokens de sortie par tâche, contre environ 27 000 pour GPT-6 Astra. Le prix affiché n'est donc avantageux que si le travail courant reste au niveau d'effort par défaut. Pas de génération d'images, le raisonnement ne peut plus être désactivé, et la plupart des demandes de cybersécurité sont discrètement confiées à l'ancien Opus 4.8.

01

Ce que c'est réellement

La plupart des assistants d’IA se comportent comme un stagiaire très vif. Ils répondent instantanément, avec aplomb. Confiez-leur un bail de quarante pages et ils vous rendront un résumé impeccable qui oublie justement la clause de la page 37, celle qui compte.

Claude Opus 5.5 ressemble davantage à la collègue expérimentée qui lit d’abord tout le document. Ensuite, elle vous dit en deux phrases où se trouve le problème et à quelle page le chercher.

Anthropic a lancé Opus 5.5 le 22 septembre 2026, premier modèle de sa famille Claude 5.5. Il prend notre première place dans l’Écosystème du quotidien pour une raison simple : c’est le modèle qui raisonne le plus soigneusement parmi tous ceux que nous pouvons mesurer, et il n’est plus vendu au prix d’un produit de luxe.

Ce que disent les tests indépendants

Deux chiffres portent l’essentiel de l’argument, et tous deux viennent d’Artificial Analysis, pas du service marketing d’Anthropic.

Le premier est l’Artificial Analysis Intelligence Index, un score qui combine dix évaluations exigeantes : raisonnement, sciences, programmation et connaissances. En effort maximal, Opus 5.5 a obtenu 58 en septembre 2026. C’était la tête du classement à sa sortie, devant GPT-6 Astra et devant le propre modèle haut de gamme d’Anthropic, Claude Fable 5.1. (L’indice est recalibré de temps à autre : un score n’a de sens qu’à côté de modèles mesurés à la même époque.)

Le second est GDPval-AA v2.1, plus proche de la vraie vie. Au lieu de répondre à des questions d’examen, les modèles produisent de vrais livrables – un modèle dans un tableur, une note juridique, une synthèse pour la direction – issus de 44 métiers, puis les résultats s’affrontent deux à deux, comme dans un classement d’échecs. Opus 5.5 atteint 1846 Elo. Fable 5.1 obtient 1735, Opus 5 1708 et GPT-6 Astra 1542.

Les tests internes d’Anthropic vont dans le même sens. Dans l’un d’eux, trois modèles devaient rédiger un rapport sur les résultats trimestriels d’une entreprise à partir d’une copie du web où le communiqué de résultats était difficile à trouver ; le moindre chiffre ou la moindre citation inventés valaient un échec. Opus 5.5 a réussi 16 fois sur 18. Fable 5.1 et Opus 5, pas une seule fois. C’est exactement ce qu’on attend d’un assistant : pas seulement de l’intelligence, mais de la prudence dans ce qu’il affirme.

Le prix, raconté avec précision

Vous avez peut-être lu qu’Opus 5.5 est « 40 % moins cher ». C’est vrai, mais il vaut la peine de comprendre d’où vient ce chiffre.

  • Le prix des tokens baisse de 20 % : 4 $ par million de tokens en entrée et 20 $ par million en sortie, contre 5 $ et 25 $ auparavant.
  • La lecture en cache baisse de 60 % : à 0,20 $ par million. Quand vous enchaînez les questions sur le même long document, le modèle le relit depuis une mémoire tampon, et cette relecture représente l’essentiel de la facture des agents et des outils de programmation.
  • Au niveau par défaut, il consomme moins de tokens : selon Anthropic, c’est ce qui place une charge de travail typique environ 40 % sous Opus 5.

Pour comparaison, Fable 5.1 est affiché à 10 $/50 $. Opus 5.5 vous donne l’essentiel des capacités de Fable pour 40 % de son prix au token. Anthropic va jusqu’à dire que, dans son propre usage quotidien, l’écart entre les deux est « plus étroit que ne le suggèrent ces scores ».

Il écrit enfin comme un humain

L’un des reproches les plus fréquents faits à Opus 5 était la difficulté à suivre ses réponses : longues, jargonnantes, avec l’idée principale enfouie au quatrième paragraphe. Anthropic dit s’être attaqué précisément à ce problème. Opus 5.5 commence par la réponse, choisit des mots plus simples et suit les règles de style que vous lui donnez.

Cela paraît cosmétique, mais ça ne l’est pas. Une réponse que l’on peut lire en trente secondes est une réponse que l’on peut vérifier. Une réponse brillante qu’il faut déchiffrer, on finit par la survoler et par lui faire confiance aveuglément.

Le bémol, en toute franchise

L’effort maximal a grand soif. À son niveau le plus élevé, Opus 5.5 explore de nombreuses pistes avant de répondre. Artificial Analysis a mesuré environ 119 000 tokens de sortie par tâche en effort maximal, contre environ 27 000 pour GPT-6 Astra. À ces volumes, un prix au token plus bas ne garantit pas une facture par réponse plus basse. La règle pratique est simple : pour le travail courant, laissez-le au niveau par défaut (moyen), où, selon Anthropic, il bat déjà sur GDPval un Astra poussé à l’effort maximal, pour environ un cinquième du coût. Ne montez d’un cran que lorsqu’un problème est vraiment difficile.

Il ne crée pas d’images. Claude lit très bien les graphiques, les captures d’écran et les PDF scannés, mais il ne génère ni images, ni audio, ni vidéo. Si vous cherchez une application qui fait tout, ChatGPT reste plus complet.

Certaines portes sont gardées. Opus 5.5 est si performant en cybersécurité et en biologie qu’Anthropic lui applique des garde-fous supplémentaires. La plupart des tâches de sécurité sont traitées en coulisses par l’ancien Opus 4.8, et certaines recherches en biologie exigent d’adhérer au programme de vérification d’Anthropic. La plupart des gens ne le remarqueront jamais ; les équipes de sécurité, si.

Pour qui ?

Si votre journée ressemble à… Prenez Pourquoi
Contrats, recherche, rapports, modèles financiers Claude Opus 5.5 Meilleur travail professionnel mesuré ; des réponses vérifiables
« Utilise ce logiciel sur mon ordinateur et termine le travail » GPT-6 Astra Un agent de pilotage de l’ordinateur plus fort et plus économe
Une seule application pour discuter, créer des images et parler ChatGPT L’offre grand public la plus large
D’énormes volumes de demandes simples GPT-6 Luna Une fraction de centime par tâche

Le verdict pour le quotidien

Pour un e-mail rapide ou une question en passant, presque n’importe quel assistant moderne fera l’affaire. Mais quand les documents sont en désordre, que la question est ambiguë et qu’une erreur a des conséquences, Claude Opus 5.5 est l’assistant auquel nous faisons le plus confiance – et, pour la première fois, cette confiance ne se paie pas au prix du luxe.

02

Forces et limites honnêtes

Points Forts

  • Le modèle polyvalent le plus fort qu’on ait mesuré : en septembre 2026, Artificial Analysis lui a attribué 58 points à l’Intelligence Index en effort maximal – la tête du classement à sa sortie, devant GPT-6 Astra et Claude Fable 5.1.
  • Du vrai travail de bureau, pas seulement des questions d’examen : sur GDPval-AA v2.1, qui note des livrables finis issus de 44 métiers, il obtient 1846 Elo, contre 1735 pour Fable 5.1 et 1708 pour Opus 5. Dans un test d’Anthropic où chaque chiffre devait pouvoir être rattaché à une source, 16 de ses 18 rapports ont été validés ; ni Fable 5.1 ni Opus 5 n’ont réussi une seule fois.
  • Des résultats dignes de Fable pour moins cher : 4 $ en entrée et 20 $ en sortie par million de tokens, soit 40 % du tarif de Fable 5.1 (10 $/50 $). La lecture en cache – relire le même long document ou le même code, ce qui représente l’essentiel de la facture d’un agent – baisse de 60 %, à 0,20 $.
  • Plus facile à lire : Anthropic a revu la façon dont le modèle écrit. Il commence par la conclusion, évite le jargon et respecte vos consignes de style. Les premiers testeurs chez Ramp et Deloitte l’ont souligné, et ce n’est pas anodin : un rapport qu’on peut parcourir est un rapport qu’on peut vérifier.
  • Plus rapide et plus généreux : le texte s’affiche plus de 30 % plus vite qu’avec Opus 5, et Anthropic a relevé les plafonds sur cinq heures des forfaits Pro, Max, Team et Enterprise par utilisateur.

Limites Honnêtes

  • L’effort maximal coûte cher : à son niveau le plus élevé, Opus 5.5 explore de nombreuses pistes de raisonnement. Artificial Analysis a mesuré environ 119 000 tokens de sortie par tâche en effort maximal, contre environ 27 000 pour GPT-6 Astra : un token moins cher ne garantit donc pas une réponse moins chère. Les propres chiffres d’Anthropic montrent que l’économie se fait au niveau par défaut (moyen).
  • Ni images ni studio audio : Claude lit très bien les images et les graphiques, mais ne génère ni images, ni audio, ni vidéo. Si vous voulez un seul abonnement qui dessine aussi, ChatGPT reste l’offre grand public la plus large.
  • Les garde-fous détournent certaines tâches : comme Opus 5.5 est très performant en cybersécurité et en biologie, la plupart des tâches de sécurité sont transmises à Opus 4.8, et certains travaux de biologie exigent le programme de vérification d’Anthropic. Les professionnels de la sécurité doivent s’attendre à des frictions tant qu’ils ne sont pas validés.
  • Le raisonnement est toujours actif : on peut baisser le niveau d’effort, mais plus couper complètement le raisonnement, ce qui ajoute un peu d’attente aux demandes triviales.
03

Aperçu des Benchmarks

Artificial Analysis Intelligence Index — 58 (n° 1 à la sortie)

Score composite indépendant en effort maximal, mesuré en septembre 2026. Le plus élevé du classement à la sortie. Artificial Analysis recalibre l'indice de temps à autre : ne le comparez qu'avec des modèles mesurés à la même période.

GDPval-AA v2.1 — 1846 Elo

Livrables professionnels réels issus de 44 métiers, évalués par Artificial Analysis. Dans le tableau de lancement d'Anthropic, Fable 5.1 obtient 1735, Opus 5 1708 et GPT-6 Astra 1542.

Humanity's Last Exam — 67,7 % avec outils

Chiffre d'Anthropic au lancement, outils activés. Dans le même tableau, Fable 5.1 atteint 65,6 % et GPT-6 Astra 57,2 %. Des questions pluridisciplinaires très difficiles rédigées par des spécialistes.

OSWorld 2.0 — 81,8 % (score partiel)

Chiffre d'Anthropic pour l'utilisation d'un vrai bureau d'ordinateur : cliquer, saisir, passer d'une application à l'autre. Noté avec crédit partiel, donc pas directement comparable aux chiffres d'OpenAI portant sur des tâches entièrement accomplies.

Prix — 4 $ / 20 $ par million de tokens, 0,20 $ en lecture de cache

20 % de moins qu'Opus 5 sur les tokens et 60 % de moins sur les lectures en cache. Anthropic estime le coût d'une charge typique environ 40 % plus bas, car le modèle consomme aussi moins de tokens au niveau par défaut. Le mode rapide coûte 8 $/40 $.

04

Le Verdict

Claude Opus 5.5 prend notre première place dans l’Écosystème du quotidien parce qu’il réunit trois atouts : le meilleur score d’intelligence indépendant à sa sortie, le meilleur résultat en travail professionnel réel, et un prix qui rend enfin le discernement de niveau Fable utilisable au quotidien. Ce n’est pas l’application à tout faire : ChatGPT dessine toujours, et GPT-6 Astra pilote toujours les logiciels plus efficacement. Mais quand il faut lire quelque chose de long et d’embrouillé, réfléchir soigneusement et rendre une réponse vérifiable, c’est vers Opus 5.5 que nous nous tournerions en premier. Laissez-le au niveau d’effort par défaut et gardez l’effort maximal pour les problèmes qui le méritent.

05

Foire aux questions