前 OpenAI 研究员 Diogo Almeida 潜伏两年的新模型,第一件事是拔掉了它说话的能力。2026 年 9 月 15 日,TypeSafe AI 发布的 Jev 放弃了自然语言生成,它只输出带有校准概率的类型化决策。全世界都在追逐会写诗、会写代码的全能助手,试图用大模型包揽一切任务。Jev 却在反向操作,它用放弃通用生成能力换来了确定的概率契约。
并行采样切断了生成延迟
逐 token 顺序采样的延迟与成本是逐次累加的:回答越长,等待越久。Jev 给出的解法是并行采样,一次 query 直接生成全部类型化输出,绕开了自回归的串行结构。TypeSafe 公布的端到端延迟为 70ms 到 500ms,而前沿模型的响应时间通常在 3 到 329 秒之间。从顺序生成切换到结构化数据的并行抛出,响应时间被拉平到了普通 API 的量级。
图:Jev 在约两个数量级的区间里独占 Pareto 前沿。来源:TypeSafe AI
TypeSafe 给出的定价是输入每百万 token 0.042 美元,输出 token 免费。官方公开宣称在同等智能水平下,Jev 快了 193.6 倍,便宜了 444.6 倍。这组数字出自他们自己的 workflow 评测,官方也承认属于偏高的一端,真实收益会更低。输出 token 免费这件事,官方自己承认无法证明没有补贴——定价能不能长期撑住,只能靠时间验证。
名字里也埋着他们的判断。System One 取自 Kahneman《思考,快与慢》里快而直觉的系统一,Jev 取自 William Stanley Jevons——那位发现蒸汽机效率提升反而推高煤炭需求的英国经济学家。押的是同一个赌注:智能单价每降一个数量级,解锁的用例会多出几个数量级。
新训练路线交付校准概率
传统的语言模型严重倾向于过度自信。即便在提示词中明确要求给出置信度,前沿大模型也无法准确标定自己可能犯错的边界区间。TypeSafe 放弃了依靠人类偏好的 RLHF 与依赖可验证奖励的 RLVR,转而采用 RLCD(校准决策强化学习)路线。RLVR 会沿着整条推理链给导出正确答案的 token 盲目加权,而 RLCD 明确训练模型输出真实的校准概率。
在工程实践中,知道系统有 80% 的概率会出错,比拿回一个看似完美却暗含谬误的长篇大论有价值得多。**校准概率让软件系统能在低置信度时自动触发降级分支,或者将高风险决策回退给人类干预。**当每一个输出都附带可靠的置信度标定时,AI 决策就拥有了可编程的错误容忍度。
社区争议揭开幻觉另一面
Jev 宣称在类型安全测试中实现了 0% 幻觉,这在社区引发了剧烈反弹。在 Hacker News 超过 1400 分的讨论中,高赞质疑指出,所谓的「不可能产生类型错误」仅仅是用 schema matching 在接口层做了强制校验。这与过去几年依靠 BNF 或 grammar 约束解码的技术是同一回事。用硬编码卡死输出格式,离消灭推理链条上的逻辑断裂还有很远的距离。
图:LLM 与 Jev 在幻觉和类型安全上的表现差距。来源:TypeSafe AI
在维基百科页面跳转演示中,Jev 依然虚构了一个不存在的链接地址。支持方认为,幻觉是推理算法随机游走的天然产物,严格的类型约束能收敛搜索空间,对自动化已经够用。反方则坚持,真正不幻觉的模型必须能查证事实,光保证 JSON 格式合法不算数。这场争论的分歧点很清楚:一方要求智能本身百分百真实,另一方只要接口百分百合规。
用评测体系倒逼接口改造
TypeSafe 提出了一种称为 workflow evals 的新评测体系,用 GPT-6 Astra 与 Fable 5.1 等前沿模型的输出作为参考概率分布。所有受测模型跑同一张由代码表示的计算图,对比谁更接近前沿模型的参考答案。这种评测方法直接预设了所有模型都必须输出受约束的格式化数据。官方自己点出了偏差:参考分布取自 OpenAI 与 Anthropic 的模型,因此可能低估自家模型,也可能低估 DeepSeek 的模型。
图:大量独立、可分解的问题,最终由概率驱动离散分支。来源:TypeSafe AI
在官方的 Doom 演示中,模型接受文本形式的游戏状态输入,跑出了每秒 10 次的响应速度,成本仅为每小时 7 美元。虽然非 AI 的规则机器人能打出更高的分数,但这跑通了一条明确的路线。通用模型只要接受接口阉割,就能在不堆算力的前提下胜任高频实时任务。
阻碍大模型走向深度自动化的真瓶颈在接口侧,不在智力水平的绝对差距上。把自由文本输出转换为携带校准概率的类型化决策,同时覆盖了延迟、成本与程序兼容性。AI 进入复杂软件系统的考核标准已经迁移:软件工程愿意为这个非确定性组件支付多少适配代价。
参考链接:
- Introducing System One Models and Jev
- Hacker News Discussion