7배의 점수 폭등에도 청구서는 그대로
2026년 9월 28일, 앤스로픽(Anthropic)은 클로드 5.5(Claude 5.5) 패밀리의 두 번째 모델인 Sonnet 5.5를 공개했다. 공식 발표 데이터 중 가장 상식을 뒤흔든 결과는 터미널 벤치 4.0(Terminal-Bench 4.0) 코딩 벤치마크에서 나왔다. 통과율이 이전 세대의 10.3%에서 무려 70.6%로 폭등한 것이다. 자율형 에이전트 코딩 역량을 측정하는 이 핵심 평가에서 Sonnet 5.5는 동세대 플래그십 모델인 Opus 5.5의 66.4%마저 앞질렀다.
또 다른 코드 평가 지표인 커서벤치 4.0(CursorBench 4.0)에서도 55.5%를 기록했다. 이는 이전 세대의 34.1%를 훌쩍 넘어선 것은 물론, Opus 5.5의 57.8% 턱밑까지 추격한 수치다. 그럼에도 가격표는 단 한 푼도 오르지 않았다. 포지셔닝상 실속형 중급 모델답게 입력 비용은 100만 토큰당 2달러, 출력은 10달러, 프롬프트 캐시 읽기는 0.20달러를 그대로 유지했다.
실제 인간의 컴퓨터 작업 환경을 평가하는 OSWorld 2.1 벤치마크에서는 80.1%를 기록했다. 화면 스크린샷만을 판독해 《포켓몬스터 레드》를 엔딩까지 플레이한 최초의 Sonnet 모델이 되었다. 코드 생성뿐만 아니라 멀티모달 시각 추론 능력을 측정하는 차토그래피(Chartography) 벤치마크에서도 이전 세대의 15.6%에서 61.6%로 수직 상승했다.
44개 전문 직종의 실무 작업을 평가하는 GDPval-AA v2.1 테스트에서는 1844점을 기록했다. 이는 이전 세대의 1449점을 크게 따돌리고 Opus 5.5의 1846점과 사실상 대등한 수준이다. AA-Briefcase v1.1 점수 역시 1359점에서 1811점으로 뛰었다. 연산 비용 표에서 허리를 담당하던 중급 모델이 이제 최전선 플래그십을 능가하는 실무 엔지니어링 수행 능력을 직접 전달하고 있다.
효율성 재구축으로 단일 작업 비용 90% 절감
동일한 토큰 단가임에도 사용자가 지출하는 실제 연산 비용은 눈에 띄게 줄었다. 공식 설명에 따르면, 범위가 명확한 일상적인 작업을 처리할 때 Sonnet 5.5는 통상 훨씬 적은 수의 토큰을 소비하며, 출력 속도는 이전 세대보다 30% 이상 빨라졌다. 공식 실측 데이터에 따르면 단일 작업당 비용 소모는 이전 세대보다 최대 30% 저렴하다. 이번 세대의 성능 도약은 연산 규모의 물리적 확장이 아니라 실행 단계의 효율적 압축에서 비롯되었다.
공식 비교 데이터에 따르면 Sonnet 5.5를 ‘중간 노력(medium effort)’ 설정으로 제한해 실행하더라도, 최종 평가 점수는 이전 세대 모델이 최대 부하로 작동했을 때의 최고 점수를 여전히 웃돈다. 이 중간 설정에서는 단일 작업을 완료하는 데 드는 비용이 기존 테스트의 10분의 1 미만으로 떨어진다.
초기 테스터들은 새 모델이 도구 호출(tool call)을 묶어서 일괄 처리하는 데 탁월하다는 점을 확인했다. 이는 외부 환경과 상호작용하는 총 추론 단계 수를 직접적으로 줄여준다. 레딧(Reddit) 개발자 커뮤니티의 핵심 토론 역시 이 지점에 주목했다. 아키텍처에 대한 이해 없이 감으로 코딩하는 ‘바이브 코딩(vibe coding)‘은 본래 수많은 시행착오로 막대한 토큰을 낭비하기 마련이었다. 그러나 모델이 요청을 취합하고 정밀하게 도구를 호출하는 법을 학습하면서 불필요한 리소스 낭비가 급격히 줄어들었다.
그림: 동일 모델의 effort 등급별 위치. 좌측 상단으로 갈수록 1달러당 얻는 성능이 높으며, Sonnet 5.5는 이전 모델의 좌측 상단에 위치한다. 출처: Anthropic
연산 자원을 최대로 투입할 때 오히려 점수가 떨어지는 이유
그러나 복잡한 FrontierCode 1.1 메인 평가 세트에서는 직관에 반하는 점수 하락 현상이 나타났다. 모델의 effort 설정을 ‘Xhigh’로 두었을 때는 52.1%를 기록했으나, 연산 자원을 더욱 끌어올려 ‘Max’로 설정하자 점수는 오히려 46.2%로 곤두박질쳤다. 동일 벤치마크에서 Opus 5.5는 54.4%, GPT-6 Sol은 49.3%였다. 연산 자원의 투입이 더 이상 비례하는 성과를 보장하지 않으며, 에이전트의 과도한 확장은 통제 불가능한 시스템 오버헤드를 유발한다.
앤스로픽의 원인 분석에 따르면, Max 설정에서 모델은 백그라운드 코드 리뷰 기능을 훨씬 빈번하게 호출했다. 리뷰 작업을 수많은 서브 에이전트에 잘게 쪼개어 위임하려 한 것이다. 과도하게 잘게 쪼개진 작업 분배는 심각한 실행 시간 초과(timeout)를 초래했다.
각 서브 에이전트 간의 동기화가 부족해 당초 지정된 범위를 벗어난 수정을 남발했다. FrontierCode 시스템은 지정된 범위를 초과하는 변경에 대해 무거운 감점 페널티를 부과한다. 다계층 에이전트 구조 속에서 실행 경계가 무너지자, 단일 모델의 우수한 추론 역량이 스케줄링 비용과 오류 전파로 인해 완전히 상쇄되고 만 것이다.
그림: 또 다른 벤치마크의 비용 대 정확도 곡선으로, Sonnet 5.5와 플래그십 모델의 가성비 위치를 비교한 결과. 출처: Anthropic
역량의 상향 평준화가 이끈 보안 방어선의 하향 배치
저렴한 모델이 강력한 자율 코드 실행 역량을 갖추게 되면, 그에 따른 파괴력도 비례해서 커진다. 앤스로픽은 Sonnet 5.5가 보여주는 사이버 보안 역량이 이전 세대 플래그십인 Opus 5와 대등한 수준에 도달했다고 공식 발표했다. 이에 따라 Sonnet 제품군 역사상 최초로 완전한 사이버 공격 가드레일과 강제 롤백 메커니즘이 기본 탑재되었다. 생물학적 안전 가드레일 역시 이전 세대와 동일한 엄격한 규격을 유지한다. 보안 방어선의 배치 단계가 하위 모델로 이동한 것은, 고위험 명령어 생성 역량이 더 이상 최고가 플래그십 모델의 전유물이 아님을 증명한다.
물리적 공격 방어 외에도, 중급 모델 최초로 증류 방지(anti-distillation) 분류기가 탑재되었다. 과거에는 공격자들이 플래그십 모델을 대상으로만 대량의 자동화 계정을 동원해 출력을 긁어모아 경쟁 모델 학습에 사용하곤 했다. 출력 10달러짜리 제품에 증류 방지 가드레일을 장착했다는 것은, 이 모델의 생성 품질이 모체 학습 데이터에 버금가는 정밀도에 도달했음을 의미한다. 실속형 모델의 일상적 출력이 처음으로 엄격히 보호해야 할 핵심 자산이 된 셈이다.
실제 비즈니스 개발 환경에서 입증된 반복 주기 단축
벤치마크의 수치는 실제 비즈니스 프로덕션 환경에서도 그대로 검증되었다. 개발 인프라 플랫폼 Base44가 추적한 118개의 실제 애플리케이션 구축 시나리오에서, Sonnet 5.5는 평균 3.6회의 대화 턴(turn)만으로 Opus 5 수준의 실무 적용 가능한 코드에 도달했다. 동일한 작업에서 Opus 5는 평균 7.7회의 대화가 필요했다.
대형 게임 개발사 에픽게임즈(Epic Games)는 내부 테스트를 거친 후, 시스템 아키텍처 감사와 저수준 데이터 흐름 검토에서 상위 플래그십 모델에 필적하는 코드 품질을 달성했다고 평가했다. 유니티(Unity) 팀 엔지니어들 역시 Sonnet 5.5가 다단계 에디터 도구 호출과 코딩 작업의 90%를 독립적으로 완수하고 엄격한 런타임 검증을 통과했다고 전했다.
앤스로픽의 수석 아키텍트는 출시 후기에서 벤치마크 테스트가 모델 역량의 단면만을 보여줄 뿐이라고 밝혔다. 환경이 완전히 미지수인 복잡한 오픈엔드 과제에서는 동세대 Opus 5.5가 여전히 더 뛰어난 장기 계획 수립 능력을 보여준다. 초고속 응답에 특화된 Haiku 5.5도 수주일 내에 라인업에 추가될 예정이다. 중급 모델의 승리는 명확한 경계 내에서 일어나는 도구 호출의 단일 단계 효율성에 뿌리를 두고 있다. 이 모델의 비약적인 도약은 최상위 프런티어 모델들이 견고하게 지켜온 가격 장벽을 무너뜨렸다.
참고 링크:
- Anthropic 공식 블로그
- Reddit 개발자 커뮤니티 토론
- Epic Games 및 Unity 실제 테스트 피드백