依靠200万字惊人记性,AI在数学竞赛中击败顶级高手

依靠200万字惊人记性,AI在数学竞赛中击败顶级高手

人工智能认知科学数学推理

数据源:HN + web research

2026年8月,认知科学家达维德·皮费尔(Davide Piffer)发表了一项打破常识的研究观察:AI在顶级数学竞赛中表现优异,主导因素并非具备了某种超越人类的深邃思维,而是拥有惊人的记忆容载量。大部分人常将数学能力归结为纯粹的智商或抽象推理,却忽略了心算过程中最容易断裂的链条往往是记忆。当大语言模型的上下文窗口扩张到百万Token级别,AI实际上拥有了一张无限延伸的外部草稿纸。

4个组块对决200万Token:心算者的天然困境

人类心算两个三位数相乘时感到艰难,核心阻碍并非不懂乘法规则,而是大脑无法同时保持多个中间乘积。认知心理学研究表明,人类短时工作记忆的容量仅有4到9个信息组块。在不借助纸笔的情况下,大脑在推演步骤的同时必须耗费巨大精力维持先前计算出的暂存数值,这构成了人类智力的生理瓶颈。

主流大语言模型的上下文窗口已经扩展至128K到2M+ tokens,相当于一次性调阅数十万字的信息。在这片巨大的符号空间里,模型可以同时放置原始题目、数百个演算步骤的中间方程、多条已被证明废弃的探索路径以及完整的定理定义。这种量级上的差异,直接将人类心算者推入了一个极度不公平的对抗竞技场。

AI与人脑工作记忆对比 图:AI与人类在工作记忆机制上的差异示意。来源:Davide Piffer Substack

一张纸不会让人类突然变聪明,但它显著扩展了人类的有效工作记忆。大语言模型的上下文窗口本质上就是一个海量存储的草稿本加一套快速检索机制。笔者的工程判断是,AI在复杂推演中的稳定度,很大程度上依赖于它永远不会漏掉三分钟前推导出的那个系数。

符号记账本:数学为什么成了AI的快乐主场

数学竞赛恰好是这种「工作记忆优势」最容易变现的领域。在数学体系中,基本假设都被显式化呈现,每一个变换步骤都可以通过严密的符号规则进行代入与验证。这使得AI能够把漫长的证明过程拆解为一场高精度的符号记账游戏。

在人类竞赛选手需要边想思路边提防算错数值时,AI可以通过并行尝试几十条推导分支,并借助代码解释器或形式化证明工具进行即时校验。即使其中99条路径被证明是死胡同,上下文窗口也能完整保留这些失败记录,确保模型不会在同一个地方重复犯错。这种高强度的状态记录与路径筛选,恰好击中了人类短期记忆极易衰减的弱点。

人类工作记忆 Baddeley-Hitch 模型 图:经典 Baddeley & Hitch 人类工作记忆多组件模型。来源:Wikimedia Commons

认知心理学领域的学术积累也印证了这一观察。Alloway等人在2010年开展的一项为期六年的前瞻性跟踪研究表明,儿童5岁时的工作记忆能力相比IQ测验得分,能更准确地预测其后续的学术成就。Friso-van den Bos在2013年的荟萃分析中进一步指出,符号工作记忆与数学能力之间存在极高的正相关性。这说明在数学这门学科中,记性好本身就是一种被长期低估的核心竞争力。

放大版冯·诺依曼,还是未诞生的爱因斯坦

物理学家尤金·维格纳(Eugene Wigner)曾对比过两位天才:冯·诺依曼拥有闪电般的计算速度、令人惊叹的记忆力和跨领域的快速迁移能力;而爱因斯坦则具备极深的穿透力与重构问题本身的独特直觉。如果将这个坐标系引入AI领域,现阶段的大语言模型显然更接近一个被机器算力无限放大后的冯·诺依曼。

大语言模型擅长在庞大的已知符号空间内进行穷举、关联与快速验证,就像hibikir在Hacker News社区讨论中所指出的那样,许多所谓的「高智商表现」,本质上不过是比周围人记住了更多的规则组合。然而在面对需要彻底改变假设、重新定义视角的问题时,海量上下文并不能自发产生概念上的突变。

设想一场思想实验:两个人解同一道数学难题,一个人完全依靠心算,另一个人坐拥无限的纸张、完美的笔记、并发推导多条路线的能力以及自动校验工具。后者在竞赛中胜出,我们往往会将胜利归因于其认知架构的优势,而非智力本尊的升华。AI当前表现出的数学高分,正是这种工程化认知架构叠加后的产物。

在符号纸页上重新划定AI的边界

基于工作记忆这一核心维度,我们可以对AI的能力边界做出更为清晰的工程预测。在涉及多约束交互、漫长步骤计算、大量Case分类讨论以及需要反复引用早期推导成果的任务中,AI拥有压倒性的效率。只要任务依赖于精确的符号记账与规则校验,AI就能凭借庞大的上下文空间碾压人类专家。

相反,在那些上下文极短、依赖概念性跳跃或需要打破已有框架的任务中,AI的优势将迅速缩水。这种区别提醒我们,不能将「记性好」引发的惊人产出误判为模型已经具备了自我演进的深度直觉。

认知科学提供的视角不仅解构了关于AI神话的流行叙事,也重新确立了人类思维的独特性。AI用几百万Token的记忆空间接管了繁重的符号追踪与账目维护,但决定向何处探索、如何重新定义问题,依然取决于人类对世界本质的直觉洞察。当庞大的外部记忆不再是稀缺资源,真正的竞争焦点终将重回那些无法被草稿纸简单承载的概念飞跃。

参考链接:

  • Davide Piffer 观察报告《AI Isn’t Outthinking Mathematicians. It’s Out-Remembering Them.》
  • Hacker News 社区讨论 (item?id=49312845)
  • Alloway & Alloway 学业表现与工作记忆前瞻研究 (2010)
  • Friso-van den Bos 符号工作记忆与数学能力荟萃分析 (2013)