Imaginez un bureau avec deux professionnels chevronnés. La première est l’associée qu’on fait venir en réunion quand le dossier sort de l’ordinaire et que l’enjeu est élevé. Le second est le collègue qui abat la pile de la semaine — quarante e-mails, trois tableurs, une présentation pour jeudi — vite et proprement.
La plupart d’entre nous ont besoin de la seconde personne bien plus souvent que de la première. Claude Sonnet 5.5, c’est ce collègue.
Anthropic l’a lancé le 28 septembre 2026, une semaine après Claude Opus 5.5, comme deuxième modèle de la famille Claude 5.5. Il est pensé comme le complément quotidien d’Opus. Pour reprendre les mots d’Anthropic, Opus est conçu pour le travail complexe qui demande un jugement attentif, tandis que Sonnet 5.5 excelle dans les tâches quotidiennes bien délimitées, la correction de bugs et la création de documents, présentations et tableurs soignés.
À quel point s’approche-t-il d’Opus ?
Plus qu’on ne le croirait, du moins dans les tests indépendants.
Artificial Analysis mène deux tests centrés sur du travail professionnel abouti plutôt que sur des questions d’examen. Dans GDPval-AA v2.1, les modèles produisent de vrais livrables — un modèle financier, une note juridique, une synthèse — et les résultats sont comparés en face-à-face, comme des parties d’échecs. Sonnet 5.5 a obtenu 1844 Elo. Opus 5.5 a obtenu 1846, un écart trop faible pour compter. Sur le plus récent AA-Briefcase, qui évalue un travail intellectuel plus long et en plusieurs étapes, il a obtenu 1811 contre 1822 pour Opus.
La mesure indépendante la plus large est l’Intelligence Index d’Artificial Analysis, un score composite issu d’évaluations exigeantes. En effort max, Sonnet 5.5 a obtenu 56, derrière le seul Opus 5.5 à 58.
Pour un Sonnet, c’est un bond considérable. Son prédécesseur, Sonnet 5, obtenait 1449 sur GDPval-AA. Concrètement, le travail de bureau qui exigeait jusqu’ici le modèle phare peut désormais être confié au modèle plus rapide et moins cher.
Là où Opus garde l’avantage
Il y a deux domaines où l’écart est bien réel.
Les faits. Le test AA-Omniscience d’Artificial Analysis pose des milliers de questions factuelles. Sonnet 5.5 a répondu correctement à 54 % d’entre elles ; Opus 5.5 à 66 %. Un modèle plus petit stocke tout simplement moins de connaissances. Il y a toutefois un bon côté : quand Sonnet 5.5 ne connaissait pas la réponse, il en a inventé une dans 47 % des cas, contre 59 % pour Opus 5.5. Il en sait moins, mais l’admet plus volontiers. Pour une date obscure, un nom ou une statistique, demandez-lui quand même de chercher sur le web ou de citer une source.
Le jugement. Sur ce point, Anthropic est d’une franchise inhabituelle. Sur plusieurs tests, Sonnet 5.5 en effort max fait jeu égal avec Opus 5.5. Mais dans les tests d’Anthropic comme dans ceux de testeurs externes, Opus 5.5 reste nettement plus fort pour le travail complexe et ouvert qui demande un jugement soutenu. Si une question n’a pas de cadre évident — une décision stratégique, un contrat aux clauses inhabituelles —, elle reste du ressort d’Opus.
Ce qu’il fait bien
Anthropic met en avant les documents, les résumés, les tableurs et les présentations, et souligne le sens du design du modèle : il peut suivre un modèle de diapositives d’assez près pour qu’il n’y ait presque rien à retoucher. Sa lecture des graphiques a spectaculairement progressé. Au test Chartography d’Anthropic, qui demande de lire des valeurs sur des graphiques sans outils, il a obtenu 61,6 %, contre 15,6 % pour Sonnet 5.
Il est aussi rapide. Anthropic affirme que la réponse arrive plus de 30 % plus vite qu’avec Sonnet 5, et les premiers testeurs l’ont remarqué : Zendesk indique que les tickets d’assistance ont été traités 20 % plus vite, et Box a mesuré une vitesse 2,4 fois supérieure à celle de la version précédente.
Il sait aussi piloter un ordinateur. Sur OSWorld 2.1, où un modèle clique et tape pour se frayer un chemin dans de vraies applications de bureau, Anthropic annonce 80,1 % avec un barème à crédit partiel, proche des 81,8 % d’Opus 5.5.
Laissez le curseur au milieu
Sonnet 5.5 propose cinq niveaux d’effort : low, medium, high, xhigh et max. Les applications Claude utilisent medium par défaut. Voici ce qu’Artificial Analysis a mesuré à chaque niveau :
| Effort | Intelligence Index | Coût par tâche |
|---|---|---|
| Low | 36 | 0,41 $ |
| Medium | 41 | 0,59 $ |
| High | 47 | 1,08 $ |
| Xhigh | 52 | 2,74 $ |
| Max | 56 | 7,60 $ |
C’est la dernière marche qui coûte cher. En max, Sonnet 5.5 a écrit environ 193 000 tokens de sortie par tâche, le chiffre le plus élevé jamais mesuré par Artificial Analysis, soit environ 60 % de plus qu’Opus 5.5 en max. Pour la plupart des gens dans l’application Claude, cela veut simplement dire attendre plus longtemps. Pour les développeurs qui paient au token, cela veut dire qu’un Sonnet poussé à fond n’est plus l’option économique. Si une tâche demande autant de réflexion, elle mérite généralement Opus.
Le bémol honnête
Pas d’images. Claude lit bien les captures d’écran, les graphiques et les PDF numérisés, mais ne génère ni images, ni audio, ni vidéo. Si vous voulez une seule application qui dessine et parle aussi, ChatGPT et Gemini sont plus complets.
Le prix par token n’est pas le prix par tâche. Les tokens coûtent autant qu’avec Sonnet 5 : 2 dollars par million en entrée et 10 dollars par million en sortie. Anthropic affirme que les tâches courantes coûtent jusqu’à 30 % de moins parce que le modèle termine en moins d’étapes. C’est vrai avec les réglages normaux ; en max, comme le montre le tableau, la facture grimpe vite.
Certaines demandes sont protégées. Sonnet 5.5 est le premier Sonnet livré avec les protections de cybersécurité plus strictes qu’Anthropic applique à ses modèles les plus puissants. Les demandes de sécurité les plus sensibles basculent visiblement vers Sonnet 5. Pour presque tout le monde, cela n’a jamais d’importance.
À qui il s’adresse
| Si votre journée ressemble à… | Prenez | Pourquoi |
|---|---|---|
| E-mails, résumés, tableurs, présentations | Claude Sonnet 5.5 | Travail de bureau presque au niveau d’Opus, rapide, dans l’offre gratuite |
| Décisions à fort enjeu, faits pointus, recherche embrouillée | Claude Opus 5.5 | Plus de connaissances et un jugement nettement plus solide |
| « Pilote ce logiciel sur mon ordinateur et termine le travail » | GPT-6 Astra | Agent d’utilisation d’ordinateur plus fort et plus économe |
| Une seule application pour le chat, les images et la voix | ChatGPT ou Gemini | Boîte à outils créative plus large |
Le verdict au quotidien
Claude Sonnet 5.5 ne remplacera pas Opus pour les questions les plus difficiles, et Anthropic ne prétend pas le contraire. Mais les questions les plus difficiles ne représentent qu’une petite part de la plupart des semaines. Pour tout le reste, il est rapide, compétent, disponible dans l’offre gratuite de Claude et assez bon marché pour qu’on n’ait pas à y penser. Laissez-le sur le réglage par défaut, vérifiez les faits pointus, et faites appel à Opus quand l’enjeu monte.