2026년 9월 1일, Anthropic은 동일한 기반 모델을 두 개의 서로 다른 제품으로 분리하여 발표했다. 일반 공개 버전인 Claude Fable 5.1은 일반적인 워크로드 기준 토큰 가격을 약 25% 인하한 반면, 풀스펙 버전인 Mythos 5.1에는 정부 승인이라는 엄격한 접근 제한을 적용했다. 세계 최고 수준의 과학적 추론 모델을 이제 일반 개발자는 돈을 주어도 구매할 수 없게 되었다.
과학 벤치마크 점수 2배 급상승
Anthropic은 장기적이고 복잡한 작업 처리에 대한 최신 기술 성과를 공개했다. Terminal-Bench-Science 벤치마크에서 Fable 5.1은 52.6%의 점수를 기록하며 이전 세대 대비 2배 이상의 성장을 달성했다. 도구를 활용하는 Humanity’s Last Exam 테스트에서는 65.0%, CursorBench에서는 73.4%에 도달했다. 장기적 추적 작업에서 모델의 수행 능력이 실용성의 문턱을 확실히 넘어섰다.
| 벤치마크 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| 과학 연구 (Terminal-Bench-Science) | 52.6% | 24.7% | 29.0% | 22.4% |
| 코딩 지능 (Terminal-Bench 4.0) | 55.8% | 42.0% | 52.3% | 37.3% |
| 일반 지식 (Humanity’s Last Exam) | 65.0% | 63.8% | 63.6% | — |
| 업무 자동화 (AutomationBench) | 31.4% | 17.1% | 26.9% | 19.6% |
이전 세대 모델의 과학 작업 점수는 24.7%에 불과했으나, 이번 세대에서는 2배 이상 크게 뛰어올랐다. 가장 격차가 큰 분야는 업무 자동화로, 이전 세대 17.1%에서 이번 세대 31.4%로 거의 2배 가까이 상승했다.
Jane Street의 퀀트 연구 책임자인 Craig Falls의 관찰 역시 이러한 벤치마크 데이터를 뒷받침한다. 그는 Fable 5.1이 다단계 작업 전체에 걸쳐 코드의 가독성을 꾸준히 유지한다는 점을 확인했다. 몇 시간 동안 실행하면 교착 상태에 빠지곤 했던 기존의 장기 에이전트 워크플로우가 이제 원활하게 진행될 뿐만 아니라, 트레이딩 직관 면에서도 최첨단 수준에 도달했다.
그림: Anthropic 발표 페이지 메인 비주얼. 출처: Anthropic
장기 에이전트 비용 부담 45% 절감
더 강력해진 모델이 공개 시장에서는 오히려 더 저렴해졌다. Fable 5.1은 일반적인 워크로드에서 토큰당 가격이 25% 인하되었으며, 프롬프트 캐시 읽기에 의존도가 높은 에이전트 워크플로우에서는 최대 45%의 비용 절감을 달성했다. 기본 요금은 100만 토큰당 입력 10달러, 출력 50달러를 유지하되, 모든 가격 인하는 내부 캐시 스케줄링 최적화를 통해 이루어졌다. 캐시 읽기 효율성이 장기 에이전트의 상업적 가치와 실용성을 결정짓는 핵심 요소가 되었다.
핀테크 기업 Ramp는 Fable 5.1에 무인 상태로 38시간 동안 머신러닝 작업을 실행하도록 맡겼다. 모델은 기존 결과가 라벨 노이즈로 인한 오류임을 스스로 진단하고, 데이터 파이프라인을 자율 정정한 후 6개의 병렬 실험을 밤새 완료했다. 추론 비용의 대폭적인 감소로 이러한 이틀간의 무인 시행착오 작업이 보편적인 엔지니어링 일상이 되고 있다.
그림: Fable 5.1 성능 비교 차트. 출처: Anthropic
저기회율 라이브러리 분석으로 오래된 취약점 발견
이번 세대 모델에서는 안전 가드레일의 오탐률이 60% 감소했다. Fable 5.1은 익스플로잇 코드를 작성하지 않는다는 조건 하에 소프트웨어 취약점 탐지 목적으로 활용할 수 있도록 허용되었다. 정적 스캔의 안전 기준선 완화가 모델의 리버스 엔지니어링 역량을 직접적으로 해방시켰다.
투자기관 Millennium의 내부 시스템에는 수년간 아무도 해결하지 못한 희귀한 시스템 다운 현상이 존재했다. Fable 5.1은 서드파티 라이브러리를 디스어셈블하고 코어 덤프 파일과 대조 분석하여 메모리 누수의 근본 원인을 정확히 찾아냈다. 모델은 더 이상 상위 레이어의 래퍼 작업에만 머무르는 텍스트 도구가 아니라, 바이너리 명령어 세트 레벨까지 제약 없이 파고들 수 있게 되었다.
올가을 도입 예정인 기업용 프론티어 가드레일(EFS) 시스템과 결합하면, 데이터는 고객 전용 클라우드 인프라 내에만 저장되어 물리적 레이어에서 데이터 잔존 제로를 구현한다. 이를 통해 금융 기관도 핵심 저기회율 코드베이스를 안심하고 모델에 투입할 수 있게 된다.
최상위 연산 능력에 대한 접근 자격 통제
이번 발표의 가장 핵심적인 변화는 제공 형태이다. Mythos 5.1과 Fable 5.1은 동일한 기반 모델을 공유하며, 유일한 차이점은 안전 가드레일의 수준이다. 사이버 보안 및 생명 과학 분야를 겨냥한 Mythos 5.1은 공개 API를 제공하지 않으며, 생물학적 역량 접근 프로그램은 미국 정부와의 협업을 통해 개발되고 있다.
과학자 전용 등록 시스템이 곧 개설될 예정이지만, 이 승인 절차는 명확한 능력의 경계선을 설정한다. Terminal-Bench 4.0 테스트에서 Mythos는 Fable의 55.8%보다 높은 60.9%를 기록했다. 상위 5%의 성능 격차는 정부 승인 파트너십이라는 높은 장벽 안에 엄격히 봉인되어 있다.
Claude 5.1의 출시는 명확한 전환점을 의미한다. 최첨단 AI의 최상위 버전은 더 이상 돈만 내면 살 수 있는 일반 상품이 아니라, 자격과 심사가 필요한 특허 도구로 변모했다. 일반 개발자들은 갈수록 저렴해지는 하위 버전을 이용할 수 있지만, 최고 능력으로 향하는 직통 엘리베이터는 조용히 제거되었다.
참고 링크:
- Anthropic 공식 발표
- HN 토론