Le 1er septembre 2026, Anthropic a lancé deux produits distincts basés sur le même modèle sous-jacent. La version publique, Claude Fable 5.1, bénéficie d’une baisse de prix d’environ 25 % sur les charges de travail classiques, tandis que la version intégrale, Mythos 5.1, est assortie de restrictions d’autorisation gouvernementale. Le meilleur modèle de raisonnement scientifique au monde n’est plus accessible au grand public, même avec les moyens financiers nécessaires.
Les scores aux benchmarks scientifiques doublent
Anthropic a dévoilé ses dernières avancées sur les tâches complexes à long terme. Dans le benchmark Terminal-Bench-Science, Fable 5.1 a obtenu un score de 52,6 %, doublant les performances de la génération précédente. Lors du test Humanity’s Last Exam (avec outils), il a atteint 65,0 %, et 73,4 % sur CursorBench. La capacité du modèle à maintenir le cap sur des tâches au long cours a franchi le seuil de viabilité pratique.
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Recherche Scientifique (Terminal-Bench-Science) | 52,6 % | 24,7 % | 29,0 % | 22,4 % |
| Intelligence de Programmation (Terminal-Bench 4.0) | 55,8 % | 42,0 % | 52,3 % | 37,3 % |
| Culture Générale (Humanity’s Last Exam) | 65,0 % | 63,8 % | 63,6 % | — |
| Bureautique & Automation (AutomationBench) | 31,4 % | 17,1 % | 26,9 % | 19,6 % |
La génération précédente n’obtenait que 24,7 % sur les tâches scientifiques ; cette nouvelle mouture fait plus que doubler ce chiffre. Le saut le plus spectaculaire concerne l’automatisation bureautique, passant de 17,1 % à 31,4 %.
Les observations de Craig Falls, responsable de la recherche quantitative chez Jane Street, confirment les données des benchmarks. Il a constaté que Fable 5.1 préserve la lisibilité du code tout au long de tâches comportant de nombreuses étapes. Les flux de travail d’agents autonomes au long cours, qui finissaient autrefois dans des impasses après quelques heures, conservent désormais leur trajectoire et atteignent un niveau de pointe en matière d’intuition financière.
Figure : Visuel principal de l’annonce d’Anthropic. Source : Anthropic
Les agents autonomes au long cours réduisent les coûts de 45 %
Un modèle plus performant est devenu nettement moins cher sur le marché public. Fable 5.1 affiche une baisse de tarif de 25 % par token sur les charges classiques, et une réduction allant jusqu’à 45 % pour les flux d’agents s’appuyant fortement sur la lecture en cache. Le tarif de base reste à 10 $ en entrée et 50 $ en sortie par million de tokens ; la baisse est entièrement obtenue grâce à l’optimisation de l’ordonnancement du cache interne. L’efficacité de la lecture en cache détermine désormais la viabilité commerciale des agents au long cours.
La fintech Ramp a laissé Fable 5.1 exécuter en toute autonomie une tâche de machine learning pendant 38 heures. Le modèle a diagnostiqué que les résultats antérieurs découlaient d’artefacts d’étiquetage, a corrigé de lui-même le pipeline, puis a lancé six expériences en parallèle durant la nuit pour achever la mission. Cette baisse drastique des coûts d’inférence fait de ces sessions d’essais-erreurs autonomes de deux jours une pratique d’ingénierie courante.
Figure : Graphique comparatif des performances de Fable 5.1. Source : Anthropic
Analyse de bibliothèques bas niveau pour débusquer les vulnérabilités anciennes
Le taux de faux positifs des garde-fous de sécurité a chuté de 60 % sur cette génération. Fable 5.1 est explicitement autorisé à détecter les vulnérabilités logicielles, à la condition stricte de ne pas rédiger d’exploits. L’assouplissement des limites d’analysis statique a directement libéré le potentiel d’ingénierie inverse du modèle.
La société d’investissement Millennium faisait face à un plantage système rare que personne n’avait pu résoudre depuis des années. En désassemblant des bibliothèques tierces et en les croisant avec des fichiers core dump, Fable 5.1 a directement identifié l’origine de la fuite mémoire. Le modèle n’est plus un simple jouet textuel limité aux couches d’abstraction supérieures ; il descend sans difficulté jusqu’au jeu d’instructions binaires.
Couplé au système Enterprise Frontier Safety (EFS) prévu pour cet automne, les données seront conservées sur l’infrastructure cloud exclusive du client, garantissant une rétention zéro au niveau physique. Les institutions financières peuvent ainsi confier leur code source fondamental au modèle en toute sérénité.
L’accès aux capacités maximales réservé sous condition d’accréditation
La transformation la plus profonde concerne la modalité de mise à disposition. Mythos 5.1 et Fable 5.1 partagent la même architecture de modèle ; leur seule différence réside dans le niveau des garde-fous. Ciblant la cybersécurité et les sciences de la vie, Mythos 5.1 ne propose aucune API publique, et l’accès à ses capacités en biologie est co-développé avec le gouvernement américain.
Un système d’inscription pour les chercheurs ouvrira prochainement, mais cette procédure d’approbation fixe des frontières de capacités bien définies. Lors du test Terminal-Bench 4.0, Mythos a atteint 60,9 %, surpassant les 55,8 % de Fable. Ces 5 % de performances supplémentaires sont strictement réservés aux partenariats agréés par l’État.
Le lancement de Claude 5.1 marque une rupture nette. L’IA de pointe dans sa version maximale n’est plus une marchandise accessible à tout acheteur ; elle est devenue un outil sous licence nécessitant agrément et contrôle. Les développeurs indépendants bénéficient de versions allégées de plus en plus abordables, mais l’accès direct aux capacités d’élite a été discrètement retiré.
Liens de référence :
- Annonce officielle d’Anthropic
- Discussion HN