El 1 de septiembre de 2026, Anthropic lanzó dos productos distintos basados en el mismo modelo subyacente. La versión pública Claude Fable 5.1 reduce su precio cerca de un 25 % en cargas de trabajo habituales, mientras que la versión completa Mythos 5.1 incorpora restricciones de aprobación gubernamental. El mejor modelo de razonamiento científico del mundo ya no se puede adquirir libremente en el mercado.
Las puntuaciones en pruebas científicas se duplican
Anthropic ha mostrado sus últimos avances en la ejecución de tareas complejas de larga duración. En el benchmark Terminal-Bench-Science, Fable 5.1 alcanzó una puntuación del 52,6 %, duplicando el resultado de la generación anterior. En la prueba Humanity’s Last Exam (con uso de herramientas) llegó al 65,0 %, y en CursorBench alcanzó el 73,4 %. La capacidad del modelo para dar seguimiento a tareas de largo recorrido ha superado el umbral de utilidad práctica.
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Investigación Científica (Terminal-Bench-Science) | 52,6 % | 24,7 % | 29,0 % | 22,4 % |
| Inteligencia de Programación (Terminal-Bench 4.0) | 55,8 % | 42,0 % | 52,3 % | 37,3 % |
| Conocimiento General (Humanity’s Last Exam) | 65,0 % | 63,8 % | 63,6 % | — |
| Automatización de Oficina (AutomationBench) | 31,4 % | 17,1 % | 26,9 % | 19,6 % |
Mientras que la generación anterior obtenía un 24,7 % en tareas científicas, esta nueva versión supera con creces el doble. El salto más pronunciado se observa en la automatización de oficinas: del 17,1 % anterior al 31,4 % actual.
Las observaciones de Craig Falls, director de investigación cuantitativa en Jane Street, respaldan los datos de las pruebas. Señaló que Fable 5.1 mantiene una legibilidad de código constante a lo largo de tareas compuestas por múltiples pasos. Los flujos de trabajo de agentes de larga duración, que antes se estancaban tras unas pocas horas de ejecución, ahora se mantienen en curso y alcanzan niveles de vanguardia en intuición financiera.
Figura: Visual principal del lanzamiento de Anthropic. Fuente: Anthropic
Los agentes de larga duración reducen un 45 % de costes innecesarios
Un modelo más potente se ha vuelto más asequible en el mercado abierto. Fable 5.1 reduce el coste por token un 25 % en cargas de trabajo habituales, y alcanza hasta un 45 % de ahorro en flujos de trabajo de agentes que dependen en gran medida de la lectura en caché. El precio base se mantiene en 10 dólares de entrada y 50 dólares de salida por millón de tokens; la rebaja se logra íntegramente optimizando la programación interna del almacenamiento en caché. La eficiencia en la lectura de caché determina ahora la viabilidad comercial de los agentes de larga duración.
La empresa fintech Ramp dejó a Fable 5.1 ejecutando de forma autónoma una tarea de aprendizaje automático durante 38 horas. El modelo diagnosticó que los resultados anteriores se debían a artefactos en las etiquetas, corrigió automáticamente la secuencia y lanzó seis experimentos en paralelo durante la noche para completarla. Esta drástica bajada de los costes de inferencia convierte las pruebas autónomas de dos días en una práctica de ingeniería habitual.
Figura: Gráfico comparativo de rendimiento de Fable 5.1. Fuente: Anthropic
Análisis de librerías de bajo nivel para detectar vulnerabilidades antiguas
La tasa de falsos positivos en los controles de seguridad disminuyó un 60 % en esta generación. Fable 5.1 tiene permiso explícito para identificar vulnerabilidades de software, con la condición de no redactar código de explotación (exploits). La flexibilización de los límites de escaneo estático ha liberado la capacidad de ingeniería inversa del modelo.
La firma de inversión Millennium sufría un fallo crítico en su sistema interno que llevaba años sin resolverse. Al desensamblar librerías de terceros y cotejarlas con archivos core dump, Fable 5.1 identificó directamente la causa de la fuga de memoria. El modelo ya no es una herramienta orientada solo al texto o limitada a capas de abstracción superiores; puede descender sin obstáculos hasta el conjunto de instrucciones binarias.
En combinación con el sistema Enterprise Frontier Safety (EFS), que se lanzará este otoño, los datos se almacenarán en la infraestructura en la nube exclusiva del cliente, garantizando una retención cero de datos a nivel físico. Gracias a esto, las instituciones financieras pueden enviar código fuente crítico directamente al modelo.
Requisitos de acceso que restringen la máxima capacidad de cómputo
El cambio más relevante radica en la forma de entrega. Mythos 5.1 y Fable 5.1 comparten la misma arquitectura de modelo base; su única diferencia reside en el nivel de las barreras de seguridad. Diseñado específicamente para la ciberseguridad y las ciencias de la vida, Mythos 5.1 no dispone de API pública, y el acceso a sus capacidades biológicas se desarrolla en colaboración con el gobierno de Estados Unidos.
El sistema de registro para científicos se abrirá próximamente, pero este proceso de aprobación marca límites claros en cuanto a capacidades. En la prueba Terminal-Bench 4.0, Mythos obtuvo un 60,9 %, por encima del 55,8 % de Fable. Ese 5 % adicional de rendimiento queda estrictamente restringido tras los muros de las alianzas autorizadas por el gobierno.
El lanzamiento de Claude 5.1 marca un punto de inflexión. La IA de vanguardia en su versión más avanzada deja de ser un producto comercial accesible para cualquiera con capacidad de pago; se convierte en una herramienta bajo licencia que requiere acreditación e inspección. Los desarrolladores independientes dispondrán de versiones reducidas cada vez más baratas, pero el acceso directo a la capacidad máxima ha sido apartado silenciosamente.
Enlaces de referencia:
- Anuncio oficial de Anthropic
- Discusión en HN