单卡 67 美分斩获 44% ARC 得分:小样本推理的真正瓶颈在表征

单卡 67 美分斩获 44% ARC 得分:小样本推理的真正瓶颈在表征

ARC-AGITransformer小模型

数据源:HN + web research

67美分撬动算力霸权

2026 年 9 月 1 日,独立开发者 Mithil Vakde 在单张 RTX 5090 显卡上耗时 1.5 小时,以仅 67 美分的成本,在 ARC-AGI-1 公共评测中拿下了 44% 的得分。这一成绩直接追平了此前同类型测试期训练(test-time training)小模型的最高水平 TRM 与 HRM。

ARC-1 公共评测成绩对比图 图:ARC-1 公共评测成绩对比图,与同类型 test-time training 模型对比。来源:mvakde.github.io

用极低的硬件门槛和一杯咖啡的钱,撬动当前最具挑战性的小样本推理排行榜,证明我们正处于一个算法红利尚未被算力堆叠掩盖的窗口期。

作者的核心动机非常清晰:在当前大语言模型主导的技术环境中,样本效率才是下一代人工智能领域最核心的命题。与动辄消耗数万张 GPU 和千万美金成本的主流大模型不同,ARC 评测从根本上拒绝了暴力美学。整个基准库仅包含 1000 个公开谜题,要求系统在极少量的示例中发现规律并泛化到新场景。一个能够在人类眼中直观易解的推理基准至今未被攻克,直接暴露了当前机器在元学习层面的深层缺陷。在这个意义上,67 美分的训练成本,是对模型评估体系的一次重新校准。当数千亿参数的网络在几何推理上频频翻车时,几兆字节的微型网络反而通过针对性的设计撕开了缺口。

抛弃通用路线重归临场训练

在具体的工程路线上,Vakde 抛弃了通过海量语料注入先验知识的通用大模型做法,转而采用高度特化的测试期训练策略。他的系统将每个二维网格的输入输出对转化为一维的 token 序列,在推理测试阶段,直接基于给定的 train 和 eval 谜题从零开始自回归训练一个微型 Transformer。抛弃预训练的包袱,在特定抽象任务中临场构建参数空间,其在受限数据下的信息密度与任务贴合度远高于从千亿参数中进行知识检索。

这种方法论要求系统必须在稀疏的数据上实现拟合,因此数据增强成为了至关重要的工程手段。在测试推断环节,系统会对测试输入进行颜色映射替换与二面体(dihedral)置换增强。生成多个候选结果后,再通过对应的逆向增强操作还原输出,最后统一汇总并提交出现频率最高的两个解答组合(AAIVR 集成策略)。引入这种严密的几何变换机制,体现了在空间逻辑推演任务中,穷尽对称性操作仍然是榨取模型推理极限最有效的手段。

表征设计支撑起 44% 胜率

44% 的高分并非源于参数规模或算力的胜利,而是建立在精细定制化的底层表征设计之上。作者为系统引入了专门处理空间坐标的 3D RoPE(旋转位置编码),并为每一个独立的谜题分配了可学习的专属附加嵌入(per-task embedding)。一旦剥离这些定制化组件,模型的表现会出现断崖式下跌。如果拿掉 3D RoPE 或者 per-task embedding 任何一项,最终的公共评测得分会直接腰斩到 24%。

表征消融图 图:表征消融图:去掉 3D RoPE 或 per-task embedding 后成绩骤降。来源:mvakde.github.io

实验架构与组件设置ARC-1 公共评测得分较完整方案性能损耗
完整方案(3D RoPE + Per-task Embedding)44%-
仅移除 3D RoPE 组件24%45.4%
仅移除 Per-task Embedding24%45.4%
使用 1D RoPE 降级替代 3D 版本24%45.4%
恢复对 input token 的自回归训练~39%11.3%
CompressARC 风格的逐任务独立训练18%59.1%

这些翔实的消融数据直接触及了当前小样本推理任务的核心本质:模型并没有真正习得放之四海而皆准的普适逻辑法则,而是高度依赖这些精心设计的空间几何编码与任务特征隔离机制。对比之下,如果采用 CompressARC 那种逐任务从零独立训练模式,得分仅能达到 18%。跨任务保留绝大部分骨干网络参数作为共享知识,同时辅以微小的特化向量区分任务,比绝对的物理隔离更能够促进基础特征的提取。

监督式训练带来反直觉收益

在整个技术迭代过程中,一个非常反直觉的变动为模型带来了最显著的性能跃升。在早期的实验中,模型采用标准的自回归预测,同时对输入与输出 token 计算损失。随后,作者将策略调整为只计算并反向传播 output token 的梯度,不再对 input token 进行训练更新,这一改动将系统的得分从 40% 拔高到了目前的 44%。作者坦言目前尚无法给出确切的理论解释。在极小样本的微调环境里,限制梯度的回传范围反而保护了已建立的输入表征结构,我们对 Transformer 在少样本分布下的参数动态演化依然缺乏底层认知。

与训练目标的调整同步,底层优化器的替换也贡献了巨大的隐性价值。训练流程中抛弃了默认的 AdamW,转而使用了 NorMuon 这一 Muon 优化器的变体,直接带来了训练迭代速度的物理级跃升。在仅有 1.5 小时的严格运行时间窗内,优化器的单步耗时降低直接等价于模型最终能够探索的解空间广度的增加。在算力受限的竞赛环境下,每一秒钟的提速都能够被直接转化为测试集上真金白银的通过率。

数据泄漏指控与榜单泛化争议

耀眼的榜单成绩背后并非毫无争议。为了扩充可怜的训练数据量,作者在训练集中混入了 ARC-2 基准库里与 ARC-1 不重叠的 347 个新谜题,而问题在于,ARC-2 题库本身包含了多达 773 个 ARC-1 的重复题目。作者在技术文档中明确指出,已经通过严格的过滤脚本清除了这 773 个题目以防止信息污染,同时他也承认,如果采用不加区分的朴素训练策略,将不可避免地导致 100% 的数据泄漏。

这种游走在规则边缘的数据操作在 Hacker News 等技术社区引发了非常两极化的讨论。部分开发者质疑这种做法属于典型的为单一基准过度调优,指责一个针对特定榜单规则编写的模型对训练分布外的问题根本不具备实际的泛化价值。另一方则展开了激烈的反驳,认为这是一次对大语言模型中心论的绝佳实证回应。在这个阵营看来,机器学习技术的版图绝不只有基于海量文本的序列预测,用几十美分计价的低成本实验,是打破唯模型尺寸论与算力崇拜的最佳武器。值得警惕的是,该特化模型在 ARC-2 的评测任务上仅仅拿到了 7% 的惨淡成绩。巨大的跨度差异证实,即便是表现最突出的垂直解法,依然未能跨越从特定模式匹配到通用泛化能力的天然鸿沟。

样本效率正在取代模型规模

对于未来的优化空间,Vakde 表现出了极高的工程底气。他评估认为,甚至不需要引入任何突破性的全新算法思想,仅仅通过进一步的工程打磨与参数搜索,就有机会在现有的 Transformer 框架内将得分推向 65%。他强调,在对现有模型进行多次独立运行后,所有已解决任务的理论并集已经达到了 55%,这个上限为未来的微调优化留下了充足的提升空间。

44% 这个数字本身只是 AI 发展轨迹上的一个临时刻度,它的真正价值在于揭开了 ARC 这类小样本推理基准的工程底牌:核心瓶颈是空间特征表征与任务编码机制的设计。3D RoPE 和特定的附加嵌入操作是决定成败的变量,拿掉一个基础组件导致 24% 的腰斩,证明传统的大规模并行算力堆叠在这里无从发力。样本效率正在成为人工智能领域下一阶段毋庸置疑的主战场,而技术社区对于单一榜单调优价值的持续激辩,正是对现有智能机器评测体系最刺骨的审视。

参考链接: