一天5美元:DeepSeek拿下最难AI考试

一天5美元:DeepSeek拿下最难AI考试

AIDeepSeek推理测试

数据源:HN + web research · HN

2026年8月刚过一周,一份AI成绩单刷了屏。中国公司DeepSeek的轻量模型V4 Flash,在业内公认最难的AI推理测试ARC Prize上拿下365分,登顶效率榜。同样是做题,美国旗舰每道题花2美元,它只要4美分。

成绩公布后,全球最大的程序员社区Hacker News在5小时内涌进382个赞、233条评论。热度最高的评论之一说得很直接:“美国AI实验室有大麻烦了。”

ARC Prize 官方发布的 DeepSeek V4 Flash 0731 成绩卡片 图:ARC Prize 官方为 DeepSeek V4 Flash 0731 发布的验证成绩卡片。来源:arcprize.org

这场考试到底考什么

先把话说清楚:ARC Prize是什么,为什么业内把它叫”AI高考”。考题的内容很朴素:一组彩色小方块的图形谜题,给你三个例子,让你推断规律,画出第四个。成年人看一眼就会,人类平均能考85分左右。

AI却在这类题上卡了很多年。2024年,当时最强的美国模型也只能考三四十分。这种题没有题库可背,规律千变万化,见过原题也帮不上忙。出题人设计这套测试时就赌了一件事:只会背答案的AI过不了这关,能过的才算真会”想”。

人类与AI在抽象推理测试上的得分差距 图:ARC Prize 官网展示的人类与AI得分差距。来源:arcprize.org

DeepSeek这次考的是升级版试卷ARC-AGI-2,比老版更刁钻,满分100,它拿了61.4分。分不算最高,但结合价格看,这个分数的分量完全不同。

两张榜单,两种游戏

ARC Prize的榜单其实有两张。一张看谁分高,一张看谁”划算”,官方管后者叫效率榜。官网上写得很直白:真正的智能不只是解出难题,还要用最少的资源解出来。

两张榜单一对比,反差立刻出来了。美国Anthropic的旗舰Claude Opus 5在升级卷上拿90.4分,每道题要花2.06美元;DeepSeek拿61.4分,每道题只要4美分,差了约50倍。OpenAI的GPT-5.6 Luna顶配版更尴尬:59.6分,比DeepSeek还低,成本却是它的4倍多。

ARC Prize 官网首页的榜单散点图 图:ARC Prize 官网的榜单散点图,横轴为每道题成本,纵轴为得分,越靠左上越划算。来源:arcprize.org

这就是”365分登顶”的含义:在效率榜上,DeepSeek V4 Flash 0731把美国同行全部压在身后。论纯分数,美国旗舰依然领先;但”最强”和”最划算”,现在分属两家公司。

分数榜上,美国公司依然霸榜;效率榜的榜首换人,对商业世界才是更响的信号。企业买AI是按调用量付费的,没有人按排行榜付费。

便宜的秘密:考试时多想一会儿

便宜从哪来?先得理解这类考试的一个规则:允许AI”多想一会儿”。模型可以在交卷前反复推演、打草稿,业内叫”推理时计算”。考场外不必是天才,考场上肯花时间打草稿也能考出好成绩;打草稿要烧电费,谁把”草稿费”压得低,谁就赢。

DeepSeek把这条”小模型+强推理”路线走到了极致。V4 Flash总共有2840亿个参数,但每处理一个词只唤醒其中130亿个,好比一支大部队只在需要时派出尖刀班。加上权重完全开源,谁都能下载、自己部署,省掉了中间环节的加价。官方API定价是每百万字输入0.14美元、输出0.28美元,比美国旗舰便宜一到两个数量级。

开源的意义不止于便宜。公司可以把模型装进自己的服务器,数据不出门、账单不封顶,还能按自家业务调教。对美国那些按次收费的闭源巨头来说,这是商业模式层面的冲击,价格战只是冰山一角。

5美元一天的背后,是普通开发者第一次用得起”顶尖思考”。过去这种级别的推理按次计费,贵到只敢在关键任务上用一下;现在它可以24小时挂在后台,替人盯着一切。

5美元一天的实测

社区已经有人这么干了。开发者LaurensBER在Hacker News上分享:他同时挂着5-6个工作会话、12路并发,拼命用一天也花不掉5美元。他每月200美元的Claude订阅已经吃灰——那个模型当然更强,但”用之前先算额度”这件事本身,让人不想回去。

真正让他兴奋的是便宜解锁的新玩法:程序测试挂了,让AI自动修;代码覆盖率不够,每次提交自动补测试;服务器日志、安全审计、每个异常都值得查一遍。以前这些活”值得干但请不起AI”,现在变成了日常。

单个场景都不起眼,但乘以每天、每个团队,就是一条全新的成本曲线。便宜到可以浪费,本身就是一种能力。

美国实验室的大麻烦

这才是硅谷不安的根源。HN上获赞最多的评论之一写道:美国AI实验室有大麻烦了。除非靠”国家安全”令把中国模型挡在门外,否则国际市场没人愿意再为前沿模型付溢价——同样的活,开源模型几分钱就干,还能自己部署、自己调优。

还有人算过另一笔账:监控日志、审计、数据质量检查这类活,用旗舰模型做贵到不划算,用便宜模型做刚刚好。需求一直存在,只是以前没人付得起。

当然,支持”大模型不可替代”的声音也有道理。另一位评论者指出:简单任务各家都够用,真正的分水岭在要连续干24小时以上的复杂活,小模型的错误会累积,大模型依然不可替代。未来更可能出现的,是”大模型当指挥官、便宜模型当小兵”的混合编队。

从目前的趋势看,这场竞争正在从”谁更强”转向”谁更划算”。就像手机从奢侈品变成日用品,性能不再是最稀缺的东西。

以上分析基于ARC Prize官方页面和公开社区讨论。笔者没有参与这些项目的开发,判断可能有偏差,欢迎指出文中的不足。

参考链接

  • ARC Prize: DeepSeek V4 Flash 0731 结果页
  • ARC Prize: Leaderboard 榜单页
  • HN 讨论 (item?id=49214008)
  • DeepSeek 官方 API 文档
  • Artificial Analysis: DeepSeek V4 Flash 定价与评测
  • vLLM Recipes: DeepSeek V4 Flash 模型说明