67美分对抗百万美元:一人单卡刷穿智力测试

67美分对抗百万美元:一人单卡刷穿智力测试

AIARC-AGI开源

数据源:HN + web research

2026年9月,个人开发者 Mithil Vakde 仅用单张 RTX 5090 运行 1.5 小时,就在 ARC-AGI-1 公开评测中拿到 44% 的成绩。整个训练过程花费仅为 67 美分。单张消费级显卡加不到一美元的账单,直接追平顶级专门求解器 TRM 与 HRM 的得分,并将一众耗资巨大的通用大模型甩在身后。

François Chollet 在 2019 年提出的 ARC-AGI 一直被视为测度人类抽象推理能力的标杆,社区为其挂出了 100 万美元悬赏。一个开放 6 年的标杆级基准,被一个人用基础的 Transformer 架构直接打通。

67美分买下44分成绩

Mithil Vakde 取得的 44% 得分,把开源社区在小参数规模下的效率展露无遗。该项目上一个版本发布时,就引发了 Google DeepMind 的 Lucas Beyer、fast.ai 的 Jeremy Howard 以及 Rohan Anil 等顶尖研究者的公开讨论。个人开发的模型在硬件受限的环境下,打出了与大厂顶尖团队平起平坐的战绩。

大模型依靠烧钱堆数据的路线在小样本推理上尽显疲态。顶级专门求解器需要复杂的架构与昂贵的算力投入,而这套开源方案用不到一美元的成本复现了同等能力。算力堆砌不能掩饰算法在特定任务上的低效,精细的架构裁剪比暴力扩容更有穿透力。

ARC-1 公开评测性能对比图 图:ARC-1 公开评测性能对比图。来源:Mithil Vakde 博客

删掉关键组件让分数腰斩

这套方案没有跳出 Transformer 框架,而是精准引入了 SwiGlu、RMSNorm、3D RoPE 位置编码以及 NorMuon 优化器等现代架构组件。在作者公布的消融实验中,一旦去掉 3D RoPE 或 per-task embedding,模型分数立刻从 44% 跌落至 24% 左右。

配置得分
完整配置(3D RoPE + per-task embedding)44%
去掉 3D RoPE约 24%
去掉 per-task embedding约 24%
只保留最基础设置18%
只训练输出 token(相对上一版)40% → 44%

ARC 任务的本质是处理二维网格与颜色通道,3D RoPE 正好映射了这种多维结构。针对特定任务定制的空间位置编码与嵌入机制,精准补足了模型在局部特征提取上的短板。

这些消融数据说明一件事:对任务结构的精准建模,比堆参数量更值钱。通用大模型习惯的全量参数暴力训练,在高度抽象的推理任务里收益见顶。深入业务逻辑的架构调优,才是撬动高分的直接杠杆。

消融实验:去掉 3D RoPE 与 per-task embedding 的断崖式下跌 图:消融实验:去掉 3D RoPE 与 per-task embedding 的断崖式下跌。来源:Mithil Vakde 博客

研究成本锁死探索空间

Mithil Vakde 给出的大胆判断是,大型语言模型在样本效率上没有任何优势。过去 6 年里没人在 ARC 上走通这条路,并非技术门槛高不可攀,而是昂贵的实验成本锁死了大厂研究员的探索空间。动辄几千上万美元的单次训练费用,让大厂团队跑不起几十上百次的消融实验,自然无法发现哪些架构细节对 ARC 任务真正有效。

几美分的试错成本,让个人开发者可以高频测试各种组件组合。每一项看似微小的参数调整,都能在 1.5 小时内得到验证。大厂用几百万美元训练费堆出来的通用能力,在需要密集试错与精准一击的单点任务面前,显得有些笨重。

其他消融的最优成绩对比 图:其他消融的最优成绩对比。来源:Mithil Vakde 博客

样本效率接管下半场竞赛

当多轮运行的已解任务并集达到 55% 时,作者判断单靠 Transformer 就能在 ARC 上摸到 65% 的门槛。这套包含完整模型权重与训练代码的全开源方案,在 Hacker News 上拿下 546 个赞与 146 条评论,点燃了社区对小模型潜力的期待。除了 ARC-AGI-1 的亮眼表现,该模型在更难的 ARC-2 测试中也拿到了 7% 的分数。

用 67 美分复刻出顶级研究团队的成绩,把大厂数百万美元的投入衬托得有些尴尬。算力霸权无法直接转化成高分,开源社区在微缩成本下展现出的样本效率,才是主导下半场竞赛的核心变量。

参考链接:

  • Mithil Vakde 博客
  • HN 讨论
  • Lobsters 讨论