10.3%から70.6%へ急伸:中位モデルSonnet 5.5が覆した計算コストの常識

10.3%から70.6%へ急伸:中位モデルSonnet 5.5が覆した計算コストの常識

AIコーディングモデルAnthropicClaude

データソース:Anthropic 官方公布

7倍のスコア急伸でも価格表は据え置き

2026年9月28日、Anthropic は Claude 5.5 ファミリーの第2弾モデルとなる Sonnet 5.5 を発表した。公式発表データの中で最も常識を覆したのは、プログラミングベンチマーク「Terminal-Bench 4.0」での結果だ。正答率は前世代の 10.3% から一気に 70.6% へと急伸した。自律型コーディングエージェントの能力を測るこの主要ベンチマークにおいて、同世代のフラッグシップモデルである Opus 5.5 の 66.4% を逆転した。

もうひとつのコードベンチマーク「CursorBench 4.0」でも、Sonnet 5.5 は 55.5% を記録した。前世代の 34.1% を大きく上回り、Opus 5.5 の 57.8% に肉薄している。一方で、料金体系には一切の変更がない。「手頃な中位モデル」という位置付けのまま、入力価格は100万トークンあたり2ドル、出力は10ドル、キャッシュ読み取りは0.20ドルを維持している。

人間の実際のコンピュータ操作を評価する「OSWorld 2.1」ベンチマークでは 80.1% のスコアを叩き出し、スクリーンショットの画像認識のみで『ポケットモンスター 赤』をクリアした初の Sonnet モデルとなった。コード生成にとどまらず、マルチモーダルな画像理解力を測定する「Chartography」ベンチマークでも、前世代のわずか 15.6% から 61.6% へと大幅に数値を伸ばした。

44種類の異なる職種の現実的な業務タスクを検証する「GDPval-AA v2.1」評価では 1844 点を獲得。前世代の 1449 点を置き去りにし、Opus 5.5 の 1846 点とほぼ肩を並べる水準に達した。「AA-Briefcase v1.1」スコアも 1359 から 1811 へと上昇した。計算コストの価格表上では中位に位置するモデルが、最前線のフラッグシップを凌駕する実務エンジニアリング代替能力を直接提供し始めている。

効率の再構築でタスクあたりの実行コストを9割削減

同じユニット単価でありながら、ユーザーが実際に支払う計算コストは大幅に減少した。公式リリースによると、スコープが明確な日常的タスクの処理において、Sonnet 5.5 は必要とするトークン数が従来より大幅に少なく、出力速度も前世代比で30%以上高速化された。公式の実測データでは、単一タスクの消費コストは最大で前世代比30%安くなっている。今回の性能飛躍は、計算リソースの規模拡大による力任せの向上ではなく、実行ステップそのものを物理的に圧縮したことによるものだ。

公式の対照データによると、Sonnet 5.5 を「中程度(medium effort)」の設定に制限して実行した場合でも、その最終スコアは前世代モデルが最大負荷で稼働した際のベストスコアを上回る。この中程度の設定下では、単一タスクの完了コストは従来の10分の1未満にまで抑制される。

初期テスターの報告では、新モデルは複数のツール呼び出しをまとめて一括処理する能力に長けていることが確認された。これにより、外部環境との対話に必要な総推論ステップ数が直接的に削減された。Reddit 開発者コミュニティで最も活発に交わされている議論もこの点に集中している。アーキテクチャ設計を意識しない「vibe coding」は、従来試行錯誤のために膨大なトークンを浪費していた。しかしモデルがリクエストの集約と的確なツール呼び出しを学習したことで、余計なリソース消費は劇的に減少した。

タスクあたりのコストと精度の対照 図:異なる effort 設定における各モデルの分布。左上に位置するほど1ドルあたりの能力が高く、Sonnet 5.5 は従来モデルの明確に左上側に位置する。出典:Anthropic

なぜ計算リソースを最大化するとスコアが低下するのか

しかし、より複雑な「FrontierCode 1.1」メインセットのテストでは、直感に反するスコア低下現象が見られた。モデルの effort 設定を「Xhigh」にした段階では 52.1% のスコアを記録したが、計算資源の投入をさらに引き上げて「Max」に設定すると、スコアは 46.2% へと急落した。同ベンチマークにおける Opus 5.5 は 54.4%、GPT-6 Sol は 49.3% である。計算資源を注ぎ込めば比例して成果が出るという図式はもはや成立せず、エージェントの過剰な動員は制御不能なシステムオーバーヘッドをもたらす。

公式の調査報告によると、Max 設定ではモデルがバックグラウンドでコードレビュー機能を過剰に呼び出し、そのレビュー業務を大量のサブエージェントへ細かく分割委託しようとしたことが原因とされる。過度に細分化されたタスク分散が、深刻なタイムアウトを引き起こした。

各サブエージェント間の同期が不十分であったため、指示された範囲を逸脱した変更が頻発した。FrontierCode システムは本来のスコープ外への改変に対して厳格な減点ペナルティを科す。エージェント実行の境界が多層構造の中で見失われた結果、単体推論の優位性はオーケストレーションの摩擦とエラーの連鎖によって相殺されてしまった。

ベンチマークの費用対効果プロット 図:別ベンチマークにおけるコストと精度の曲線。Sonnet 5.5 とフラッグシップモデルの費用対効果を対照。出典:Anthropic

能力の氾濫が迫る防衛ラインの下位展開

安価なモデルが極めて強力なコード実行能力を持つようになると、その破壊力も等しく拡大する。Anthropic は、Sonnet 5.5 が発揮するサイバーセキュリティ能力が前世代フラッグシップの Opus 5 と同等の水準に達していることを明言した。これに伴い、Sonnet モデルとして初めて完全なサイバー攻撃ガードレールと強制ロールバック機構が標準搭載された。バイオセーフティガードレールも前世代と同等の厳格な基準が維持されている。安全防衛ラインの配備レベルが下位モデルへと引き下げられたことは、高リスク指示の生成能力がもはやフラッグシップモデルの専売特許ではなくなったことを示している。

物理的攻撃の防止に加え、中位モデルとして初めて蒸留防止(anti-distillation)分類器が組み込まれた点も特筆される。従来、攻撃者が大量の自動化アカウントを使って出力を吸い上げ、競合モデルの訓練に流用する標的はフラッグシップに限られていた。出力10ドルという価格帯の製品に蒸留防御ガードレールが導入された事実は、その応答精度が基底の訓練データ母本に匹敵するレベルに達したことを意味する。低価格モデルの日常的な出力そのものが、厳重に保護すべき中核的資産となったのだ。

本番開発現場で実証された対話サイクルの半減

ベンチマーク上の数字は、実際の開発現場でも実証されている。開発支援プラットフォーム Base44 が追跡した118件のリアルなアプリケーション構築シナリオにおいて、Sonnet 5.5 は平均わずか3.6回の対話ターンで Opus 5 の本番投入可能コード水準に到達した。同一タスクで Opus 5 は平均7.7ターンを要していた。

大手ゲーム開発の Epic Games は社内テストを経て、システム設計の監査や低レイヤーのデータフローレビューにおいて、ワンランク上のフラッグシップモデルに匹敵するコード品質を達成していると評価した。また Unity チームのエンジニアは、Sonnet 5.5 が複数ステップにわたるエディタ操作とコーディングタスクの90%を自律的に完遂し、厳格なランタイムレビューを通過したと報告している。

Anthropic のアーキテクトはリリース追記において、ベンチマークは能力の一側面に過ぎないと認めている。環境が未知の複雑でオープンエンドなタスクにおいては、同世代の Opus 5.5 が依然として優れた長期計画能力を発揮する。また、超高速応答を重視した Haiku 5.5 も数週間以内にラインナップに加わる予定だ。中位モデルの勝利は、明確な境界内におけるツール呼び出しの単歩効率によって打ち立てられた。その能力の飛躍は、最先端モデル陣営が長らく維持してきた価格の壁を根本から解体した。

参考リンク:

  • Anthropic 公式ブログ
  • Reddit 開発者コミュニティの議論
  • Epic Games および Unity による実機検証レポート