一个决策模型的生命周期可以有多短?9 月中旬 Typesafe AI 发布 Jev,演示了用小模型给 agent 的每个分支动作打出概率分;两周后,Cloudflare 把自己训的两个同构模型直接甩上了 Hugging Face,Apache 2.0,名字叫 Clef。
这不是跟进演示,是把牌桌掀了——Jev 闭源、架构保密、只能用 API,Clef 权重全开,还宣称在对方引以为傲的 Jev Decision Index 上拿了第一。这场「两周复刻」竞赛里,比 benchmark 更值得看的是 HN 评论区那个尴尬的问题:这东西到底新在哪?
决策模型是什么:从「生成答案」到「打分」
先讲清楚 Jev 带火的这个品类。传统 LLM 处理「该不该升级这个工单」这种问题时,走的是自回归生成:一个 token 一个 token 地把答案「写」出来,慢,且输出不可控。决策模型的思路是砍掉生成环节——你传入一个状态(state)和一组带类型的问题(schema),模型不写一个字的中间文本,直接对每个选项输出一个概率。
Cloudflare 博客里给的场景是工单路由:传入一条客户消息,模型并行返回「是否紧急:是 87%」「归哪个团队:technical 91%」这样的类型化打分,下游代码直接拿概率做路由、升级或转人工。整个过程没有文本生成,天然适合塞进 agent 决策热路径。
图:决策模型工作流程——工单原文与 schema 输入,所有问题并行输出概率。来源:Cloudflare Blog
关键变化发生在产品层。这类能力以前叫「分类器」,BERT 时代就有,一个窄域分类模型在笔记本上训一小时,推理占用不到 1GB 显存,比调 API 还快。Jev 的贡献在于把它包装成了通用产品:不用针对新分类类别重新训练,换一个 JSON schema 就能换个用途,外加一套好用的 API。PMF 是 Jev 验证的,现在人人都能进场。
Clef 的技术路线:Qwen 底座 + prefill-only 打分
Clef 家族两个型号:Clef(27B)和 Clef-flash(9B),底座分别是 Qwen3.8-27B 和 Qwen3.5-9B。训练方式是冻结骨干网络,只训 rank-256 低秩适配器和一个路由头。
推理时干的事情:Qwen 骨干跑一遍 prefill-only pass,然后对所有合法 schema 选项并行打分。决策这一步非自回归,没有逐 token 生成,这是它比通用 LLM 快的结构性原因。博客里称这是「两阶段注意力路由」:每个候选项提取与 prompt 相关的上下文,字段之间交叉注意力后再回看原始输入,最后做 schema 约束的打分。训练目标是 label-smoothed 交叉熵加 Brier loss(校准概率用),外加一个叫 RLCD 的强化学习变体给相邻序数选项发部分得分。
实际效果,Cloudflare 给了一组自报数字:
| 维度 | Clef | Clef-flash | Jev |
|---|---|---|---|
| 决策指数(Decision Index) | 61.2 | 57.1 | 57.9 |
| 中位延迟 | 209ms | 38.8ms | 524ms |
| 上下文窗口 | 64k | 64k | 32k(state+单问题) |
| 视觉输入 | 支持(图片+视频) | 支持 | 不支持 |
| 权重 | Apache 2.0 开源 | Apache 2.0 开源 | 闭源 |
| Workers AI 定价 | $0.24/百万 token | $0.09/M | $0.042/M |
两个数字值得单独拎出来。Clef-flash 用 38.8ms 达到了 57.1 的决策指数——与闭源 Jev(57.9 分、524ms)质量几乎持平,延迟只有对方 1/13。Clef 本尊则在官方评测里登顶决策指数,比 Jev 高 3 分左右,延迟还砍半。Cloudflare 内部实测:给 Clef 配上 Browser Run 做域名分类,抓取+渲染+分类一个网站 2.2 秒,同样的活他们的通用 LLM gpt-oss-120b 要 4.7 秒,还只能输出两个分类。
图:Jev Decision Index 与延迟对比,Clef 系列位于帕累托前沿。来源:Cloudflare Blog(自报成绩)
这张成绩单的水分
先泼冷水:上面整张散点图,数据来源标注是「Cloudflare (self-reported)」。The Register 查证后确认,这些成绩还没进 Hugging Face 上官方 Decision Index 的 board 复现流程。官方博客自己标注的「Jev (closed)」和「Open models (board-validated)」两种点型之间的区别,本身就说明自报和验证是两回事。
价格是另一个反向指标。Clef 的 $0.24/M token 定价接近 Jev($0.042/M)的六倍,Clef-flash 的 $0.09/M 也有两倍多。HN 评论区有人直接指出:帕累托前沿图里压根没画成本维度。散点图上 Clef 看起来全面占优,把 $ 符号加回坐标轴,前沿形状立刻不同。质量领先是真的,但它是用钱买的。
本地部署的门槛也不低。Cloudflare 产品经理 Michelle Chen 向 The Register 证实:Clef 要 85GB 显存,Clef-flash 也要 41GB——这还是单并发、64k 上下文的假设。「开源可本地跑」没错,但你的消费级显卡就别想了。HN 上贴出来的另一条路线是:窄域任务直接用 BERT 类小模型自己训,笔记本一小时搞定,延迟比调任何 API 都低。通用决策模型解决的「没有窄域训练数据」的场景,才是它的真实生态位。
最后一个保留项:训练数据集不公开。权重 Apache 2.0,The Register 确认训练数据没有开源。「开源」的成色,取决于你在意的是权重还是数据。
HN 之争:新发明,还是分类器换皮
HN 帖子(478 分)里吵得最凶的问题是 top answer 那句:「这么多人是怎么在几天到几周内就搞出决策模型的?这概念早就有了吧?」
高赞回答拆得很清楚:transformer 本来就输出概率分布,把 LLM 的约束解码(structured output)用在分类任务上,这套玩法社区已经用了好几年——prompt 模型输出一个词,取 logprobs 排序拿答案,小模型上效果就很好。有人更进一步:**Jev 主要是界面和 API 的创新,让一个旧技术第一次被大量开发者看懂了,而 API 是最容易抄的东西。**Jev 发布后两周内,Hugging Face 上冒出一整批开源竞品(AutoJev、Jebadiah、Kev、以及如今的 Clef),速度本身就说明竞品门槛很低。
反方论据也存在:校准才是真门槛。有人指出「造出一个快的分类模型不难,难的是让输出的概率真的有意义」,并认为 Jev 目前校准做得最好。数据工程角度的总结很到位:模型架构是「有趣的部分,也是容易的部分」,难的是数据和评测——没有好的标注数据,你连「这个模型分类得准」都没法定义。
两方其实说的是同一件事的两面:技术不是壁垒,但让概率真的可信的数据工程。Cloudflare 敢在这时候开源,恰恰因为它手里有 15 年的网络数据和标注积累——这才是它跟那批一周速成竞品真正不一样的地方。
顺手甩出的 RL 平台
博客的后半段藏着一个比 Clef 本身更值得注意的东西:Cloudflare 同时发布了 RL 微调服务,客户可以用自己的数据把 Clef 调成领域专用版。
训练流程是现成拼图:AI Gateway 抓生产流量做数据集,Workers AI 生成 rollout,Containers 跑奖励函数沙箱,新增的 Trainer 组件更新权重,最后 BYO Model 重新部署。Cloudflare 自己的用法很具体:Trust & Safety 审核分类、支持工单分流、Bot 产品里判定爬虫善恶——全是内部有海量历史标注数据的窄域任务。
图:RL 微调平台架构,AI Gateway 捕获生产数据,经训练流程再部署回生产。来源:Cloudflare Blog
这一步的意图不难读:Clef 卖不了几个钱(token 定价摆在那),真正的生意是把「基础模型 → RL 环境训练 → 边缘部署」整条链锁在 Cloudflare 的平台上。AI Gateway 沉淀的数据是别人的,但训练和部署必须留在自家。这和它「agent cloud」的定位是一条线——决策模型是 agent 热路径上频率最高的调用,谁卡住这个位置,谁就卡住 agent 的流量入口。
结尾
两周复刻一个 Jev,技术上证明了「决策模型」这个品类竞品门槛很低:底座拿现成的 Qwen,创新点在于砍掉自回归生成、并行打分这条路,有 infra 积累的团队都能走通。真正的分化在后面——比拼谁的概率校准得住,谁的数据管道喂得起 RL 微调,谁的边缘网络让 38ms 的承诺在真实地理分布下依然成立。
对开发者,当下最理性的动作可能很简单:Clef 的 API 和 Jev 完全兼容,权重都开源了,自己的数据搬过来跑一遍评测,十分钟就知道这两个数字哪个更适合你的场景。
参考链接:
- Cloudflare 博客:Introducing Clef — our open-source decision models, and new RL fine-tuning platform
- The Register:Cloudflare tries to outplay Jev with open-weight Clef models
- HN 讨论:Clef — Open-weight decision models, and new RL fine-tuning platform
- Hugging Face:Cloudflare/clef 模型卡
- Cloudflare 开发者文档:Workers AI Clef 模型页