2026 年 8 月,一个中国 AI 模型在被称为「人类最难 AI 测试」的 ARC-AGI 挑战中登顶效率榜。这个模型叫 DeepSeek V4 Flash 0731,是国产开源大模型 DeepSeek V4 的一个轻快版本。ARC Prize 官方给出的成绩是:在更难的 ARC-AGI-2 上得分 61.4%,每道题成本 4 美分;在 ARC-AGI-1 上得分 89.0%,每道题成本 2 美分。
同一天,这条消息在程序员社区 Hacker News 冲到 754 分、451 条评论,成为当天热度最高的技术帖。前一天它还只有 365 分,一天之内涨了一倍多。
最让笔者觉得有意思的是反差:大家习惯了「便宜没好货」,可这次是「便宜的国产模型」在公认最难的人类推理测试上拿了效率第一。社区有人实测:同时开 5-6 个会话、12 路并发流,一天拼命用,花不到 5 美元。
这场「人类最难测试」考什么
ARC-AGI 的题目长得很朴素:一组彩色小方块的图形谜题。AI 要从几个例子中找出规律,再推理出答案。这些题对人类很友好,普通人花点时间大多能解出来;对 AI 来说却是出了名的难——它考的是抽象推理,背题库没用。ARC Prize 官方的说法是,这套测试专门挑 AI 的弱项。
过去两年,顶尖模型在这里的进步一直不算快,不少模型每道题要烧掉几美元甚至更多。2025 年 ARC Prize 宣布改规则:以后所有成绩必须附带「效率」指标。分数只说明能力,成本说明这个能力贵不贵。
图:ARC Prize 官方效率图(标题意为「光堆算力不够」),ARC-AGI-2 之后所有成绩都要看效率。来源:arcprize.org
从公开信息来看,DeepSeek V4 Flash 0731 是目前效率榜上把「高分」和「白菜价」结合得最突出的模型之一,ARC Prize 官方称它「设定了成本与性能前沿的新标准」。
图:ARC-AGI-2 公开评测题示例(符号解读类)。人类一眼能懂,AI 常在这里翻车。来源:arcprize.org
工程判断:每道题 2 美分,测试成本就从讨论里消失了。过去实验室跑评测要精打细算,现在可以放开跑几千道,跑错了也不心疼。这个变化本身,比分数更有分量。
便宜是怎么做到的
有人觉得便宜意味着偷工减料。从公开信息来看,DeepSeek V4 Flash 是靠三层设计把成本压下来的。
第一层是稀疏专家架构。这个模型总参数约 2840 亿,但处理每道题只激活约 130 亿个。打个比方:图书馆藏书近三千亿册,读者每次来只翻需要的几本,电费自然省。这种「每次只叫醒一小部分专家」的做法,目前是行业里降成本的主流方案之一。
第二层是缓存优化。AI 回答问题时很多计算可以复用,官方 API 的缓存命中率约 99%。第三方评测机构 Artificial Analysis 据此测算,DeepSeek V4 Flash 平均每道题成本约 3 美分;有中文科技媒体报道称,这不足某些美国顶级模型的百分之一。
第三层是开源生态的竞争。DeepSeek V4 Flash 权重公开,谁都能下载自托管,社区和第三方平台可以自己定价。价格由市场竞争决定,不由某一家公司说了算。
图:第三方博客为这次成绩制作的封面图,标注了两档得分与每题成本。来源:explainx.ai
工程判断:架构、缓存、生态三件事叠加,成本坍塌是结构性的,短期看不到反弹的理由。只要这套设计还在,价格就立得住。
贵的 AI 订阅,第一次显得尴尬
社区实测最能说明问题。HN 用户 LaurensBER 说,他同时开 5-6 个会话、跑 12 路并发流,一天拼了命也花不掉 5 美元。他自己订着 Claude Max,但几乎不再打开,因为回去反而要时刻惦记用量限额。他的原话大意是:贵模型确实更强,用起来却像退步。
另一位用户 abixb 说得更直白:「如果这是真的,美国 AI 实验室有大麻烦。除非靠国家安全令禁掉中国模型,否则没人会为前沿模型付溢价。」
这话有点狠,但戳中了行业里一个默认的惯性:前沿模型就该贵。过去买 AI 订阅,本质是买配额——每月几百元,问多了还要排队限流。而 DeepSeek V4 Flash 按量计费,便宜到可以随手扔任务给它:测试挂了让 AI 自动修、日志异常让 AI 自动查、代码覆盖不够让 AI 自动补测试。这些用法以前没人舍得,因为成本不允许。
工程判断:当 AI 便宜到「用完即弃」也不心疼,使用方式会从「省着用」变成「放开用」。HN 评论区有人说,10 美元能买到 140 美元的额度,想烧完都难。这种改变对普通用户的意义,比排行榜上的名次大得多。
普通人能等到什么
对不写代码的普通人来说,这场效率竞赛的好处很直接:AI 服务会整体变便宜。国产模型把价格打下来,国外厂商也得跟着降价,否则用户会用脚投票。过去一年各种 AI 产品的免费额度越来越多、月费越来越低,和这场成本竞赛直接相关。
往远处看,AI 会进入更多「以前不值得用」的场景。小商家雇不起客服,可以让 AI 顶班;家长辅导作业,可以随便问不心疼钱;理账单、写材料、改简历,这些琐事都能交给 AI 打底稿,人再修改。
需要提醒的是,便宜不等于全能。效率榜登顶说的是性价比,DeepSeek V4 Flash 在部分复杂任务上仍和顶级闭源模型有差距。HN 讨论里也有用户指出,长时间多步骤的任务,小模型的小错误会累积成大问题。笔者的建议是:便宜模型当主力,贵模型当备用。
写在最后
从公开信息来看,这次成本坍塌还远没到头。开源模型的追赶速度,正在逼着整个行业重新算账。
笔者更愿意把这次登顶看作一个信号:AI 的竞赛,正在从「谁更聪明」延伸到「谁更便宜」。聪明的部分我们还在等,便宜的部分,已经来了。一天不到 5 美元——比不少人一杯奶茶还便宜,而它登上的,是「人类最难 AI 测试」的效率榜。
参考链接:
- ARC Prize: DeepSeek V4 Flash 0731 评测结果
- HN 讨论 (item?id=49214008)