Un score multiplié par sept sans aucune hausse tarifaire
Le 28 septembre 2026, Anthropic a dévoilé Sonnet 5.5, le deuxième fleuron de sa famille de modèles Claude 5.5. Parmi les résultats officiels rendus publics, le chiffre le plus spectaculaire concerne le banc d’essai de programmation Terminal-Bench 4.0 : le taux de réussite est passé de 10,3 % pour la génération précédente à un impressionnant 70,6 %. Sur ce classement de référence mesurant les capacités de développement par agents autonomes, Sonnet 5.5 a même devancé le modèle phare de sa propre génération, Opus 5.5, qui plafonnait à 66,4 %.
Sur une autre épreuve de référence, CursorBench 4.0, Sonnet 5.5 a atteint 55,5 %, surclassant largement les 34,1 % de son prédécesseur et talonnant de près les 57,8 % d’Opus 5.5. Pourtant, la grille tarifaire est demeurée inchangée. Fidèle à son positionnement d’intermédiaire économique, son prix d’entrée reste fixé à 2 dollars par million de jetons en entrée, 10 dollars en sortie et 0,20 dollar pour la lecture en cache de contexte.
Sur OSWorld 2.1, qui évalue l’utilisation autonome d’un ordinateur dans des conditions réelles d’environnement de bureau, Sonnet 5.5 a signé un score de 80,1 %. Il devient ainsi le tout premier modèle de la série Sonnet capable de terminer intégralement Pokémon Rouge uniquement en analysant les captures d’écran. Cette avancée dépasse largement le cadre du code : sur Chartography, un banc d’essai dédié au raisonnement visuel multimodal, son score a bondi à 61,6 %, contre seulement 15,6 % pour la génération précédente.
Lors de l’évaluation GDPval-AA v2.1, qui simule des flux de travail professionnels réels répartis sur 44 métiers, son score a atteint 1844 points, faisant quasiment jeu égal avec les 1846 points d’Opus 5.5 et reléguant loin derrière les 1449 points de l’ancienne version. L’indice AA-Briefcase v1.1 a lui aussi progressé de 1359 à 1811 points. Un modèle situé en milieu de gamme tarifaire délivre désormais directement des capacités d’ingénierie logicielle qui surpassent les fleurons de pointe d’hier.
Refonte de l’efficacité : des coûts unitaires réduits de 90 %
À tarification unitaire équivalente, les dépenses de calcul réelles engagées par les utilisateurs ont chuté de manière vertigineuse. Selon la documentation officielle d’Anthropic, lorsqu’il traite des tâches quotidiennes au périmètre clairement circonscrit, Sonnet 5.5 consomme nettement moins de jetons tout en générant ses réponses plus de 30 % plus vite que son prédécesseur. Les mesures empiriques confirment que le coût financier par tâche unitaire a diminué jusqu’à 30 %. Le bond en avant de cette génération provient d’une compression physique des étapes d’exécution, et non d’une simple débauche de puissance brute.
Les données comparatives révèlent que lorsque Sonnet 5.5 est bridé sur un palier d’effort intermédiaire (« medium effort »), ses scores d’évaluation finaux dépassent encore les meilleurs résultats obtenus par le modèle de la génération précédente lancé à pleine puissance. Dans ce mode intermédiaire, le coût de réalisation d’une tâche unitaire tombe à moins d’un dixième du montant de référence antérieur.
Les premiers testeurs ont constaté que le nouveau modèle excelle dans le regroupement par lots des appels d’outils (tool calls), réduisant ainsi à la source le nombre total d’étapes d’inférence nécessaires aux interactions avec l’environnement extérieur. Les échanges au sein des communautés de développeurs sur Reddit convergent vers le même constat : le « vibe coding » désordonné brûlait jusqu’ici d’immenses volumes de jetons dans des cycles d’essais-erreurs permanents ; grâce à un modèle sachant fusionner ses requêtes et cibler ses outils avec rigueur, le gaspillage de ressources s’est effondré.
Figure : Positionnement du modèle selon les différents paliers d’effort. Plus un point se situe vers le coin supérieur gauche, plus le rendement par dollar est élevé ; Sonnet 5.5 se place nettement au-dessus et à gauche de son prédécesseur. Source : Anthropic
Pourquoi saturer les ressources de calcul dégrade paradoxalement les performances
Toutefois, sur l’ensemble principal du banc d’essai complexe FrontierCode 1.1, une baisse de performance inattendue est apparue. En configurant l’effort sur le niveau « Xhigh », Sonnet 5.5 a enregistré un solide 52,1 %. Mais en augmentant encore les ressources allouées pour passer au niveau maximal (« Max »), le score a brusquement chuté à 46,2 %. Sur ce même benchmark, Opus 5.5 atteignait 54,4 % et GPT-6 Sol 49,3 %. L’accroissement des ressources de calcul ne garantit plus de gains proportionnels ; l’orchestration excessive d’agents génère une surcharge systémique incontrôlable.
L’analyse technique d’Anthropic a révélé qu’au palier Max, le modèle déclenchait ses compétences de revue de code en arrière-plan avec une fréquence excessive, cherchant à subdéléguer les vérifications à une multitude de sous-agents. Ce morcellement extrême des tâches a provoqué de graves dépassements de délais d’exécution (timeouts).
Par ailleurs, le manque de synchronisation entre ces sous-agents a conduit à des modifications intempestives outrepassant le cadre initialement prescrit. Or, le système FrontierCode pénalise très lourdement toute modification hors périmètre. Dès lors que les limites d’exécution se sont brouillées à travers de multiples strates d’agents, les atouts intrinsèques du modèle en matière de raisonnement ont été totalement absorbés par la friction d’ordonnancement et la cascade d’erreurs.
Figure : Courbes de coût et de précision sur d’autres bancs d’essai, comparant la rentabilité de Sonnet 5.5 à celle des modèles phares. Source : Anthropic
L’excédent de puissance contraint le déploiement de garde-fous vers le bas
Dès lors qu’un modèle économique acquiert une redoutable efficacité dans l’exécution de code, sa capacité de nuisance potentielle croît dans les mêmes proportions. Anthropic a explicitement souligné que les aptitudes en cybersécurité démontrées par Sonnet 5.5 se hissent au niveau du précédent fleuron, Opus 5. Il s’agit par conséquent du premier modèle de la gamme Sonnet doté d’une panoplie complète de garde-fous contre les cyberattaques et d’un mécanisme obligatoire de restauration (rollback). Les barrières de sûreté biologique conservent les mêmes critères rigoureux que ceux de la génération précédente. L’intégration de tels dispositifs de sécurité dans les modèles intermédiaires confirme que la formulation d’instructions à haut risque n’est plus l’apanage des modèles de luxe.
Au-delà de la protection contre les attaques, Sonnet 5.5 est également le premier modèle intermédiaire à intégrer un classificateur anti-distillation. Auparavant, les acteurs malveillants ciblaient exclusivement les modèles phares au moyen de comptes automatisés pour capter leurs réponses afin d’entraîner des modèles concurrents. Munir un modèle commercialisé à 10 dollars en sortie de barrières anti-distillation atteste que la qualité de ses réponses rivalise désormais avec les bases d’entraînement d’origine. Les sorties quotidiennes d’un modèle économique constituent, pour la première fois, des actifs stratégiques nécessitant une protection rigoureuse.
Épreuve du terrain : des cycles d’itération divisés par deux en production
Les données des bancs d’essai ont trouvé une résonance directe en conditions réelles d’exploitation. Sur 118 scénarios de conception d’applications suivis par le fournisseur d’infrastructure Base44, Sonnet 5.5 n’a requis en moyenne que 3,6 tours de conversation pour produire un code fonctionnel du niveau d’Opus 5. Pour des tâches identiques, Opus 5 exigeait en moyenne 7,7 tours.
L’éditeur de jeux vidéo Epic Games a conclu, après des tests internes, que Sonnet 5.5 atteignait en audit d’architecture système et en révision des flux de données profonds un niveau de qualité jusque-là réservé aux modèles de premier rang. De même, les ingénieurs de l’équipe Unity ont rapporté que le modèle avait mené à bien de manière autonome 90 % des tâches complexes d’appel d’outils et de codage dans l’éditeur, validant sans accroc des contrôles stricts à l’exécution.
Dans une note post-lancement, les architectes d’Anthropic ont reconnu que les bancs d’essai ne mesurent qu’une facette des performances globales. Face à des problèmes complexes et ouverts en environnement incertain, le modèle phare Opus 5.5 conserve l’avantage en matière de planification stratégique à long terme. Par ailleurs, Haiku 5.5, conçu pour une latence minimale, rejoindra l’offre dans les prochaines semaines. Le succès de ce modèle intermédiaire repose sur une efficacité unitaire exemplaire dans l’usage des outils au sein de périmètres bien définis. Sa percée fait voler en éclats le modèle tarifaire sur lequel les géants de l’IA s’étaient adossés.
Liens de référence :
- Blog officiel d’Anthropic
- Discussions sur la communauté de développeurs Reddit
- Retours d’expérience d’Epic Games et Unity