Claude Sonnet 5.5 : Anthropic mise sur la vitesse et la réduction du coût par tâche
Anthropic a dévoilé Claude Sonnet 5.5 le 28 septembre 2026, six jours après Opus 5.5. Deuxième modèle de la famille Claude 5.5, il se présente comme un complément plus rapide et moins coûteux du modèle phare, pensé pour le travail de tous les jours : correction de bugs, documents, présentations et tableurs. Voici ce que l’on sait, chiffres à l’appui, et ce qu’il faut relativiser.
Ce que promet Anthropic pour son nouveau modèle
Selon Anthropic, Sonnet 5.5 est un modèle plus rapide et moins cher qu’Opus 5.5, qui reste le choix pour les travaux complexes exigeant un jugement soutenu. Sonnet 5.5, lui, est présenté comme le plus efficace sur les tâches bien délimitées, la correction de bugs et la production de documents, de présentations et de tableurs soignés, avec un œil affûté pour le design. Un troisième modèle, Claude Haiku 5.5, destiné aux usages à gros volume et sensibles au coût, doit rejoindre la famille dans les prochaines semaines.
Côté vitesse, l’entreprise annonce des réponses générées plus de 30 % plus vite que Sonnet 5, ce qui en fait son Sonnet le plus rapide à ce jour. Côté tarifs, rien ne change : 2 dollars par million de tokens en entrée, 10 dollars en sortie et 0,20 dollar pour les lectures de cache, contre 4 et 20 dollars en entrée et en sortie pour Opus 5.5. Comme le modèle a besoin de bien moins de tokens pour accomplir la même tâche, Anthropic affirme qu’il coûte jusqu’à 30 % de moins par tâche que son prédécesseur.
Les benchmarks : un net bond, surtout sur le code
Le saut le plus spectaculaire concerne le code agentique. Sur Terminal-Bench 4.0, un test où un agent doit mener à bien des tâches professionnelles complexes en ligne de commande, Sonnet 5.5 atteint 70,6 %, contre 10,3 % pour Sonnet 5. Il dépasse même Opus 5.5, crédité de 66,4 % sur ce test à son réglage d’effort le plus élevé. Sur GDPval-AA, qui évalue des tâches réelles dans 44 métiers, les deux modèles sont quasiment à égalité.
| Test | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 (code agentique) | 70,6 % | 10,3 % | 66,4 % |
| CursorBench 4.0 (code) | 55,5 % | 34,1 % | 57,8 % |
| GDPval-AA v2.1 (travail professionnel, score Elo) | 1844 | 1449 | 1846 |
| OSWorld 2.1 (usage d’un ordinateur, crédit partiel) | 80,1 % | 57,0 % | 81,8 % |
| Humanity’s Last Exam (avec outils) | 64,5 % | 54,9 % | 67,7 % |
| Chartography (lecture de graphiques, sans outils) | 61,6 % | 15,6 % | 64,4 % |
Anthropic ajoute une anecdote parlante : Sonnet 5.5 est le premier modèle de la gamme Sonnet à venir à bout de Pokémon Rouge en travaillant uniquement à partir de captures d’écran. L’entreprise insiste toutefois sur une nuance de taille : ces scores sont les siens, et dans ses propres tests comme dans ceux de testeurs externes, Opus 5.5 reste nettement plus fort sur les travaux ouverts et complexes qui demandent un jugement soutenu.
Le bémol relevé par un testeur indépendant
Le cabinet indépendant Artificial Analysis confirme la bonne performance en code : sur Terminal-Bench 4.0, il mesure 63,6 % pour Sonnet 5.5 contre 59,6 % pour Opus 5.5. Mais il relève aussi un revers important. Au réglage d’effort maximal, Sonnet 5.5 a produit environ 193 000 tokens par tâche, le niveau le plus élevé que le cabinet ait mesuré, soit environ 60 % de plus qu’Opus 5.5. Le coût atteint alors 7,60 dollars par tâche, environ 50 % de plus que Sonnet 5, ce qui contredit la promesse d’économie de 30 % à ce réglage.
La clé est donc le curseur d’effort. Les économies annoncées par Anthropic proviennent des réglages plus bas : à effort moyen, le réglage par défaut dans les applications Claude et dans Claude Code, le modèle dépasse le meilleur score de Sonnet 5 en code pour moins d’un dixième du coût par tâche, selon l’entreprise. Artificial Analysis estime de son côté que l’effort élevé offre le meilleur rapport qualité prix. À noter que le cabinet a testé une version préliminaire du modèle qui contenait un bug, corrigé depuis, dont Anthropic pense qu’il a plutôt sous-estimé les scores.
Ce qu’en disent les premiers testeurs
Anthropic a publié les retours de plusieurs entreprises partenaires, à prendre avec le recul qu’impose un choix éditorial de l’éditeur lui-même. CodeRabbit juge que le modèle fait preuve de meilleur jugement que Sonnet 5 en consommant nettement moins de tokens de sortie, et prévoit de lui confier dès maintenant ses revues de code simples et modérées. Box rapporte un traitement 2,4 fois plus rapide, pour 12 % de tokens en moins. Zendesk indique avoir traité des tickets 20 % plus vite, et Unity affirme que le modèle a mené à bien 90 % des tâches de son test mêlant éditeur et code.
Sécurité : des garde-fous inédits pour un Sonnet
Sonnet 5.5 est le premier modèle de sa gamme à sortir avec des protections en cybersécurité du type de celles réservées jusqu’ici aux modèles les plus puissants. Ses capacités dans ce domaine sont comparables à celles d’Opus 5 : la correction de bugs et le développement courant ne sont pas touchés, mais les demandes les plus risquées basculent visiblement vers Sonnet 5. Les défenseurs en cybersécurité pourront bientôt candidater au programme de vérification élargi d’Anthropic pour obtenir un accès gradué à des capacités plus avancées. Côté biologie, les protections sont identiques à celles de Sonnet 5.
C’est aussi le premier Sonnet livré avec des classificateurs destinés à empêcher l’extraction de son raisonnement, une parade aux attaques dites de distillation, qui consistent à siphonner les capacités d’un modèle via de faux comptes pour en entraîner un autre sans garde-fous. Le modèle étend également la fonction de raisonnement préservé, qui lie la réflexion de Claude au compte qui l’a produite. La plupart des développeurs ne verront aucune différence, sauf s’ils déplacent des conversations d’un compte à l’autre, y compris en changeant de compte en pleine session dans Claude Code.
Disponibilité et migration
Le modèle est disponible dès maintenant sur toutes les plateformes, dont Amazon Web Services, Google Cloud et Microsoft Azure. Les développeurs y accèdent sur la Claude Platform avec l’identifiant claude-sonnet-5-5, avec conservation zéro des données proposée comme pour Opus 5.5 et Sonnet 5. L’effort par défaut est moyen dans les applications Claude et dans Claude Code, et élevé sur la Claude Platform. Un point de vigilance pour ceux qui utilisent Sonnet avec la réflexion désactivée : il faut passer au nouveau paramètre between_tools avant de migrer vers Sonnet 5.5, comme l’explique le guide de migration d’Anthropic.
À retenir
Sonnet 5.5 confirme la stratégie d’Anthropic : proposer un modèle intermédiaire qui rattrape le haut de gamme sur de nombreuses tâches, à moitié prix par token. Le gain est réel, en particulier pour le code et le travail de bureau, mais il dépend fortement du réglage d’effort : bien utilisé, le modèle est rapide et économique, poussé au maximum, il peut coûter plus cher que son prédécesseur. Pour les tâches complexes et ouvertes, Opus 5.5 garde l’avantage, de l’aveu même d’Anthropic. Reste à voir ce que donnera Haiku 5.5, attendu dans les prochaines semaines.
Sources :
Partager cet article