新しいAIモデルカテゴリのライフサイクルは、一体どこまで短縮され得るのでしょうか。9月中旬、Typesafe AIが「Jev」を発表し、コンパクトな小型モデルを用いてエージェントの各分岐アクションに確率スコアを付与する仕組みを提示しました。それからわずか2週間後、Cloudflareは同等のアーキテクチャを持つ2つの自社製モデル「Clef」を、Apache 2.0ライセンスのもとHugging Faceに電撃公開しました。
これは単なる追従デモではありません。完全にゲームのルールを覆す動きです。Jevがプロプライエタリで閉源、アーキテクチャ非公開、API経由のみの提供であるのに対し、Clefは重みを完全オープン化し、さらにJevが看板に掲げていた「Jev Decision Index」で首位を獲得したと主張しています。しかし、この「2週間の再現劇」において、ベンチマーク以上に注目を集めているのはHacker News(HN)のコメント欄で投げかけられた鋭い疑問です。「この仕組みの、どこが一体新しいのか?」
意思決定モデルとは何か:「回答の生成」から「選択肢のスコアリング」へ
まず、Jevによって脚光を浴びたこのカテゴリを整理しておきましょう。従来のLLMが「このサポートチケットをエスカレーションすべきか?」といったタスクを処理する場合、自己回帰(オートレグレッシブ)生成を用います。1トークンずつ順番に答えを「書き出す」ため、推論速度が遅く、出力の制御も難しくなります。一方、意思決定モデル(Decision Model)のアプローチは、テキスト生成プロセスそのものを排除することです。入力状態(state)と型定義された質問スキーマ(schema)を渡すと、モデルは中間テキストを1文字も生成せず、各候補オプションに対する確率スコアをダイレクトに出力します。
Cloudflareの公式ブログでは、チケットルーティングの事例が紹介されています。顧客からの問い合わせメッセージを入力すると、モデルは「緊急性:高 87%」「担当チーム:テクニカル 91%」といった型付きスコアを並列に返します。後続のシステムは、この確率分布を直接参照してルーティング、エスカレーション、オペレーター振り分けを即座に判断できます。テキスト生成のオーバーヘッドが一切ないため、エージェントのクリティカルな意思決定ホットパスに最適です。
図:意思決定モデルのワークフロー。チケット本文とスキーマを入力し、全質問に対して並列に確率を出力。出典:Cloudflare Blog
この技術の本質的な変化は、プロダクト層で起きています。過去、この機能は単に「分類器(Classifier)」と呼ばれていました。BERTの時代、特定領域の分類モデルならノートPCで1時間もあれば学習でき、推論時のVRAM消費も1GB未満で、API呼び出しよりもはるかに高速でした。Jevの功績は、それを汎用プロダクトとして再定義した点にあります。新しい分類カテゴリごとに再学習を行う必要はなく、JSONスキーマを差し替えるだけで用途を変更でき、開発者に扱いやすいAPIとしてパッケージ化しました。JevがPMF(プロダクトマーケットフィット)を証明し、誰もが参入できる舞台を作ったのです。
Clefの技術設計:Qwenベース + prefill-onlyスコアリング
Clefファミリーには、Clef(27B)とClef-flash(9B)の2モデルが用意されており、それぞれQwen3.8-27BおよびQwen3.5-9Bをベースに構築されています。バックボーンネットワークの重みは凍結され、rank-256の低ランクアダプター(LoRA)とルーティングヘッドのみを追加学習させています。
推論時の挙動は極めて明快です。Qwenバックボーンでprefill処理(プロンプトの一括読み込み)を1度だけ実行し、有効なスキーマ候補すべてに対して並列でスコアを算出します。意思決定フェーズが非自己回帰であり、トークンを逐次生成しないことこそが、汎用LLMと比べて構造的に高速である最大の理由です。ブログではこれを「2段階アテンションルーティング」と呼んでいます。各候補オプションがプロンプト関連のコンテキストを抽出し、フィールド間でクロスアテンションを行ってから元の入力を再参照し、スキーマ制約付きスコアリングを実行します。学習目的関数には、ラベルスムージング付きクロスエントロピーと確率較正用のBrier Lossを採用し、さらに隣接する順序選択肢に部分点を与える強化学習バリアント「RLCD(Reinforcement Learning from Categorical Distributions)」を導入しています。
Cloudflareが公開したベンチマーク数値は以下の通りです。
| 項目 | Clef | Clef-flash | Jev |
|---|---|---|---|
| 意思決定指数(Decision Index) | 61.2 | 57.1 | 57.9 |
| レイテンシ中央値 | 209ms | 38.8ms | 524ms |
| コンテキスト長 | 64k | 64k | 32k(state+単一質問) |
| 視覚入力 | 対応(画像・動画) | 対応 | 非対応 |
| 重みの公開状況 | Apache 2.0 オープンソース | Apache 2.0 オープンソース | 非公開(プロプライエタリ) |
| Workers AI 価格 | $0.24 / 100万トークン | $0.09 / 100万トークン | $0.042 / 100万トークン |
特に注目すべき数値が2点あります。まず、Clef-flashはわずか38.8msの遅延で57.1という意思決定スコアを記録しました。非公開のJev(57.9スコア、524ms)と精度面でほぼ肩を並べながら、遅延は約13分の1に短縮されています。またフラッグシップのClefは、公式評価指標で首位を獲得し、Jevを約3ポイント上回りつつレイテンシを半減させました。Cloudflareの社内検証では、ClefとBrowser Runを組み合わせたドメイン分類において、Webサイトのクローリング、レンダリング、分類までを2.2秒で完了。同社の汎用LLMであるgpt-oss-120bが同様の処理に4.7秒を要し、かつ2つのカテゴリしか出力できなかったことと比較すると、その差は歴然です。
図:Jev Decision Indexとレイテンシの比較。Clefシリーズがパレート効率的フロンティアを形成。出典:Cloudflare Blog(自己申告値)
公表されたスコアシートの検証
しかし、ここで冷静になる必要があります。上記の散布図に示されたデータはすべて「Cloudflare(自己申告値)」です。The Registerの取材によると、これらのスコアはまだHugging Face上の公式Decision Indexリーダーボードによる追試・検証プロセスを通過していません。公式ブログ自体が「Jev(クローズド)」と「オープンモデル(ボード検証済み)」というプロットを区別していることからも、自己申告値と第三者検証には隔たりがあることが伺えます。
価格設定も気になる点です。Clefの料金(100万トークンあたり$0.24)はJev($0.042)の約6倍に達し、Clef-flash($0.09)も2倍以上の水準です。HNのコメントでも「パレート図にコスト軸が完全に欠落している」と指摘されています。精度と速度の二軸で見ればClefが圧倒しているように見えますが、コスト軸を加えるとフロンティアの形状は一変します。性能向上は本物であるものの、相応のコストを支払っているのが実態です。
ローカル運用のハードルも低くありません。CloudflareのプロダクトマネージャーであるMichelle Chen氏がThe Registerに明かしたところによると、単一並列・64kコンテキストの環境下で、Clefは85GB、Clef-flashでも41GBのVRAMを要求します。「オープンウェイトでセルフホスト可能」とはいえ、一般的なコンシューマー向けGPUで動かせる代物ではありません。HN上では「特定領域の分類タスクなら、BERT系モデルをノートPCで1時間ファインチューニングすれば、どんなAPIよりも低レイテンシで動く」という意見も上がっています。汎用意思決定モデルの真の居場所は、特定領域の教師データが存在しないコールドスタートのユースケースにあると言えます。
さらに、学習データセットが非公開である点も留意すべきです。重みはApache 2.0で公開されているものの、The Registerは学習データが開示されていないことを確認しています。「オープン」の真価を重みに置くのか、データに置くのかによって受け止め方は分かれます。
HNの議論:真の技術革新か、それとも分類器の焼き直しか
478ポイントを獲得したHNのスレッドで最も議論が白熱したのは、トップコメントの次の指摘でした。「なぜこれほど多くの人々が、わずか数日から数週間で意思決定モデルを構築できているのか? これは昔からある概念ではないか?」
賛同意見の多くは技術的な内実を指摘しています。Transformerはもともとボキャブラリ全体の確率分布を出力する構造を持っています。LLMの構造化出力(structured output)や制約付きデコーディングを分類タスクに利用する手法は、コミュニティで何年も前から実践されてきました。モデルに1文字出力させてlogprobs(対数確率)からスコアを取得する手法は、小規模モデルでも十分に機能します。あるエンジニアはさらに踏み込み、**「Jevの新規性は主にインターフェースとAPIの設計にあり、既存の技術を一般の開発者に直感的に理解させた点にある。そしてAPIは最も模倣しやすい」**と指摘しました。Jevの登場から2週間でHugging Face上に多数のオープンソース対抗馬(AutoJev、Jebadiah、Kev、そしてClef)が登場したスピード感そのものが、参入障壁の低さを物語っています。
一方で、反論も存在します。確率の較正(Calibration)こそが真の参入障壁だという意見です。「高速な分類モデルを作るのは難しくないが、出力される確率スコアに現実的な信頼性を持たせることは極めて困難である」とし、Jevの最大の強みは較正の精度にあると評価する声もあります。データエンジニアリングの観点からの総括も的を射ています。モデルアーキテクチャは「面白く、かつ容易な部分」であり、**「真に困難なのはデータと評価系」**であるという点です。高品質なアノテーションデータがなければ、モデルの分類が正確かどうかを定義することすらできません。
この二つの意見は表裏一体です。技術的な基本原理は模倣できても、信頼できる確率出力を実現するには泥臭いデータエンジニアリングが不可欠です。Cloudflareがわずか2週間でこれに対抗できた背景には、15年間にわたるネットワークトラフィックの蓄積とアノテーション基盤があります。これこそが、単なる週末クローンプロジェクトとCloudflareを分かつ決定的な差です。
併せて発表されたRLプラットフォームの真意
ブログ記事の後半には、Clefそのもの以上に戦略的な発表が含まれています。Cloudflareは同時に「RL(強化学習)ファインチューニングプラットフォーム」を公開し、顧客企業が自社データを用いてClefを特定ドメイン専用モデルへと最適化できるようにしました。
その学習パイプラインは、既存の製品群を組み合わせた無駄のない構造になっています。AI Gatewayが本番トラフィックをキャプチャしてデータセットを構築し、Workers AIがロールアウトを生成。Containers環境で報酬関数のサンドボックスを実行し、新設されたTrainerコンポーネントが重みを更新した上で、BYO Model(モデル持ち込み)機能によりエッジへ再デプロイされます。Cloudflare自身も、Trust & Safetyのコンテンツモデレーション、サポートチケットの自動トリアージ、Bot判定といった社内の大規模ラベル付きタスクにこの仕組みを適用しています。
図:RLファインチューニング基盤のアーキテクチャ。AI Gatewayで本番データを収集し、学習ループを経てエッジへ再展開。出典:Cloudflare Blog
この展開の意図は明白です。Clefの推論トークン販売だけで得られる利益は限られています。真の狙いは、「基盤モデル → 強化学習環境 → エッジデプロイ」というライフサイクル全体を自社プラットフォームに囲い込むことです。AI Gatewayに蓄積されるデータは顧客のものですが、学習と運用基盤はCloudflare上に縛られます。これは同社が掲げる「エージェントクラウド」の構想と直結しています。意思決定モデルはエージェントの処理ループの中で最も頻繁に呼び出されるコンポーネントであり、この中枢を押さえることこそが、次世代エージェントのトラフィックの主導権を握る鍵となるのです。
まとめ
2週間でJevを再現してみせた今回の動きは、「意思決定モデル」というカテゴリ自体の技術的参入障壁が想像以上に低いことを証明しました。既製のQwenをベースにし、自己回帰生成を排除して並列スコアリングを行う構成は、インフラ力のあるチームであれば容易に再現可能です。
今後の真の差別化ポイントは、エッジケースにおける確率較正の信頼性、RLファインチューニングを支えるデータパイプラインの質、そしてグローバルな分散エッジ環境において38msの低遅延をどこまで安定して担保できるかという運用力に移っていくでしょう。
開発者にとって、現時点で最も合理的なアプローチは明快です。ClefのAPIはJevと完全な互換性を持ち、重みもオープンに公開されています。手元のデータセットを持ち込んで10分間のベンチマークを実行すれば、どちらのモデルが自社のユースケースに適しているか、数字が明確な答えを出してくれるはずです。
参考リンク:
- Cloudflare Blog: Introducing Clef — our open-source decision models, and new RL fine-tuning platform
- The Register: Cloudflare tries to outplay Jev with open-weight Clef models
- Hacker News Discussion: Clef — Open-weight decision models, and new RL fine-tuning platform
- Hugging Face: Cloudflare/clef Model Card
- Cloudflare Developer Docs: Workers AI Clef Documentation