2.5 万美元大奖颁给「读不懂自己图表」的基准:一场千人 AGI 评测竞赛的评审塌房

2.5 万美元大奖颁给「读不懂自己图表」的基准:一场千人 AGI 评测竞赛的评审塌房

AIbenchmarkKaggle评审自动化

数据源:HN + Lobsters

一场为「衡量 AGI」而办的比赛,自己先被衡量了

Kaggle 与 Google DeepMind 联合举办的「Measuring Progress Toward AGI — Cognitive Abilities」黑客松,本意是征集能够超越死记硬背、真正评估前沿模型如何推理、行动与判断的基准。超过 1000 支队伍在五条认知赛道上提交了基准,最终三个大奖各 2.5 万美元、五个赛道奖各 1 万美元已经公布。

但热闹止步于颁奖公告。几天后,一名参赛者 Scott Weiss 在竞赛讨论区贴出长文,标题直白得刺眼:「Blatant AI Slop just won the Deepmind Kaggle 25k USD Grand Prize」( blatant 的 AI 注水作品拿走了 2.5 万美元大奖)。他用逐条证据指控:首个大奖得主 MEDLEY-BENCH 在核心图表与结论上存在自相矛盾,竞赛规则的评审标准(质量、可辩护性、清晰度、新颖性)与获奖结果严重脱节。该帖被搬运到 Hacker News 后冲上首页,社区里一条高赞评论一针见血:「Kaggle 大概率在用 AI 评审 AI,然后不加常识判断就接受结果。」

这不是一次普通的「落选者不服气」。Weiss 指出自己投入了 100 多个小时,并明确要求公开评审过程细节。问题的核心也不在于某个作品是否优秀,而在于:当评审机制本身不透明、且高度依赖自动化手段时,一个本应「衡量 AGI」的权威赛事,是否正在被它想衡量的那个东西反噬。

证据一:获奖者读错了自己的图,还把误读写成了「核心洞见」

Weiss 的指控围绕大奖作品 MEDLEY-BENCH(Behavioral Metacognition Under Social Pressure,行为层面的元认知在社会压力下的表现)展开。该作品声称要回答一个更难的问题:模型是否知道自己可能出错,并且出于正确的理由更新信念。

争议集中在它的 Finding #1。原帖贴出的图表显示,两条线分别标注为「evaluation」(评估)与「control」(控制)。作品的核心叙事是:橙色线(evaluation)随模型规模上升,蓝色线(control)保持平坦——据此得出「标准 LLM 训练过程更偏好 evaluation 这一能力」的宏大结论。

MEDLEY-BENCH 的 Finding #1 图表:作者声称 evaluation 上升、control 持平,但评论者指出两条线趋势几乎一致

问题出在解读上。Weiss 与其余评论者指出,图中两条线实际上呈现几乎相同的上升趋势——对 Gemma 而言,control 随规模提升的幅度甚至不亚于 evaluation。换言之,支撑那句「核心洞见」的,是一次对自家图表的误读。

更尴尬的是自相矛盾。在作品的「Insight 4」里,作者又改口称 evaluation 其实是四种被测基础能力中最弱的一项。一边把 evaluation 的上升当作训练偏好的证据,一边又承认它是四项能力里最弱的一环——同一篇 20 页附录论文里,作者甚至自己承认四个基础指标高度相关(ρ = 0.79–0.94)。Weiss 的总结毫不留情:①读不懂自己的图,抛出一句荒谬的错误陈述;②把基于误读的狂想当作「核心洞见」;③几段之后又用「universal finding」推翻了这个核心洞见。而四个能力几乎完全相关这一事实,本身就在动摇「我们在测量四种不同能力」这个前提。

另一位评论者(x313)补充了更技术性的质疑:在获奖作品里,图表本身「完全错误」,即便图表正确,其解读也毫无意义(比如暗示更大的模型「得到了更多 RL」?),而作品自己的结果已经显示核心数据集毫无价值——因为所有指标的相关系数都接近完美。他的判断是:「绝无可能有具备相关知识的人类认真读过并理解了这些材料还能给出好评。」

评论者截取的另一张作品图表,用于说明 control 随规模提升的幅度并不亚于 evaluation

证据二:评分标准与结果之间,出现了一道解释不了的裂缝

如果说单篇作品的瑕疵还能归为「主观分歧」,那么另一条线索让事件升级为「机制问题」。参赛队伍 ATLAS 的作者(Thomas Werkmeister,也正是把 Kaggle 帖搬上 HN 的人)做了一份详尽的对照分析,把竞赛官方 rubric 的三项权重与最终结果摆在一起:

  • Dataset Quality & Task Construction(数据集质量与任务构建)占 50%
  • Writeup Quality(写作质量)占 20%
  • Novelty, Insights, Discriminatory Power(新颖性、洞见、区分力)占 30%

他把各作品按官方标准逐项比对。ATLAS 实现了 DeepMind §7.4 分解的全部六个学习子类型,含 540 局对局、逐引擎的程序化 ground truth、难度递进与失败模式诊断;它和最终大奖得主 LearningBench 一样,都跑过组委会的内部员工模型(Claude Fable 5 / OpenAI o3)验证。然而 ATLAS 颗粒无收,LearningBench 却拿下大奖。

更微妙的是权重倒挂的嫌疑:在「区分力」这一项上,ATLAS 提供了逐引擎的性能梯度(Concept 0.96 到 Social 0.50,跨度 0.46)、明确的失败模式信号与难度递进;而部分获奖作品胜出的似乎是「范式新颖性」(人造语法、瞬时语言)。当 50% 权重的「数据集质量」与 30% 权重的「区分力」看起来都被某件作品满足,它却落选,而另一些作品凭「范式新颖」胜出时,参赛者自然要问:究竟是哪个隐藏的权重在起作用?

评论者整理的评分对照片段,呈现各基准在官方 rubric 三项权重下的表现差异

Werkmeister 没有指责某个人,而是向组委会提出了可验证的请求:公开一份带分数的排行榜,展示每个基准在三项标准上的得分;给出每条提交的「做得好 / 不足在哪」的反馈;澄清是否存在并列时的打破规则、以及评分前的资格过滤(重复获奖规则、技术淘汰、迟交等)。这些请求至今未获实质回应——而透明度的缺失,恰恰是让「评审被自动化」的猜测得以滋生的土壤。

反派登场:一个不透明的、难以追责的评审黑箱

这场风波里真正的「反派」,不是某一个敷衍的评委,而是一种结构性不透明:当评审过程既不公开打分明细、也不解释标准如何映射到结果,外界就无法区分三种可能——是人类评委确实看走了眼、是权重在暗中被重新分配、还是评审的某个环节确实外包给了缺乏常识校验的自动化系统。

Kaggle 方面的回应来自赛事 PM、Kaggle Benchmarks 负责人 Nicholas Kang。他给出了几条关键事实:赛事由 Kaggle 与 Google DeepMind 共同组织,共有约 20 名来自双方的评委;评审期从原定的 1.5 个月(至 5 月 31 日)又延长了 1.5 个月(至 7 月 13 日),「想对参与者负责」;每一份获奖提交都至少经过 2 名人类评委、部分多达 3–4 名独立评委依据公开 rubric 打分;他承认定性评审天然带有主观性,但强调「这不是草率外包给 LLM 评委」。

然而这番澄清反而把矛盾摆到了台面上。如果确实有多名人类评委独立审阅,为何连「图里两条线趋势一致」这种一眼可见的事实都没人指出?x313 的质疑直指这点:「绝无可能有相关知识的人类读过这些还给出好评。」一方说「有 ≥2 名人类评委」,另一方说「任何真读过的人类都不可能放行」——两种陈述无法同时为真,而组委会没有公开评分记录来打破这个僵局。

社区里还浮现了更尖锐、也更难证伪的指控。有评论者称「见过项目通过提示注入(prompt injection)让自己被判定为赢家」,并称「现在代码全是生成的,评审也由 AI 完成」;另一条关于 Gemini 3 黑客松的讨论被反复引用:那场同样由 LLM 担任评委的比赛,第三名结果引发众怒。于是 HN 上那句总结被反复点赞:「AI 提交撞上 AI 评委,简直是天作之合。」

WHY:AI 评审为什么容易「盲信」

把个别失误上升到机制层面,需要解释一个「WHY」:为什么用 AI 来评审(或协助评审)基准类作品,特别容易出问题?

第一,基准类评审缺乏客观锚点。Kaggle 传统的表格赛有排行榜分数作为硬指标,评委只需在分数附近做边际判断;而本次黑客松评审的是「这个基准是否真正测量了认知能力」这种定性命题。一旦失去可 hill-climb 的客观指标,评审就退化成「读材料、凭感觉」。HN 上一条被广泛认同的评论点破了这一点:当有客观指标可供优化时,AI 表现不错;当你草草了事、只依赖「LLM 当评委」,结果就不怎么样。

第二,评审者与被评审者使用同一套能力,会形成「同频共振」。当提交物由 LLM 生成、润色、包装(AI 视频、AI 播客、光鲜网站、20 页 arXiv 论文),它天然贴合 LLM 的审美偏好——流畅、结构完整、术语密集。一个由 LLM 或其产物辅助的评审环节,极易被这种「看起来很对」的表层信号说服,而忽略底层逻辑是否自洽。这正是「AI 评审 AI」最危险的反馈回路:两者共享同一套语言习惯,于是错误在彼此的顺从中被放行。

第三,规模压垮了常识校验。1000 多支队伍、五条赛道,评委要在数周内消化海量提交。人类在疲劳与数量压力下,会本能地依赖「表面语言成熟度」这类廉价信号——而这恰恰是 AI 生成物最擅长伪装的维度。当「看一眼就打分」成为常态,最该被抓住的逻辑断裂反而最容易被漏掉。

这对 AGI 评测意味着什么

讽刺之处在于,这场闹剧的主题恰恰是「衡量 AGI」。一个用来评估模型是否真正会推理、会判断的竞赛,其自身的评审却暴露出「不推理、只判断」的痕迹——这本身就是对 AGI 评测现状的一记警钟。

它至少指向三个值得行业正视的结论:

  • 评测的评测必须可审计。任何以「衡量智能」为名的赛事,其评审打分、权重映射、反馈记录都应当可公开复核。否则「谁在评测评测者」的问题永远悬空。
  • LLM-as-Judge 不是不能用,而是不能裸用。在有客观指标对齐、且保留人类终审与常识否决权的场景下,自动化评审是杠杆;一旦把它当作唯一裁判、且对表层流畅度照单全收,它就从工具退化为盲信的放大器。
  • 包装正在凌驾于实质。当一件作品靠 AI 视频、播客、网站和长论文堆出「分量感」,而底层图表自相矛盾却无人察觉,说明社区对「努力量的展示」与「论证的有效性」已经混淆。对 AGI 评测而言,这比某个奖发错更值得警惕。

这场风波并未以组委会认错收场。Nicholas Kang 维持了原判,重申评审有人工把关;质疑者则坚持「作品本身证明评审过程是 sham(骗局)」。双方各执一词,而缺失的评分明细让真相继续悬置。一个本应树立标杆的赛事,最终留给社区的,是一组没有被回答的问题:那 2.5 万美元奖励的,究竟是洞察,还是洞察的精美包装——以及,当我们在衡量 AGI 时,究竟由谁来衡量那个衡量者。

参考链接:

  • Kaggle 讨论原帖:参赛者指控注水作品拿走 2.5 万美元大奖
  • Kaggle 讨论:评审不一致的证据梳理
  • HN 讨论 (48946010)