作业涨18%考试跌20%:2.6万学生的AI实验

作业涨18%考试跌20%:2.6万学生的AI实验

AI教育生成式AI教育评估学习科学教育数据

数据源:HN + web research · HN

一间教室里出现了一个让老师困惑的组合:作业交得最快、答得最全的学生,闭卷考试时分数垫底。

2026 年 8 月,The Economist 的图表专栏报道了一篇 CEPR 工作论文,把这个现象量化了。研究者追踪 2.6 万名中国中学生整整 30 个月,发现 AI 让作业分平均上涨 18%、单份作业的完成时间从 64 分钟缩到 45 分钟,代价是半年后的闭卷考试分下跌 20%。

作业和考试,第一次在同一批学生身上走出了方向相反的曲线。

作业和考试,走出了剪刀线

论文来自斯德哥尔摩大学的 David Strömberg 与香港大学的 Victor Lei、Yanhui Wu,编号 CEPR DP21577。样本覆盖 7 到 12 年级的 26811 名学生、9 个学科,数据包含月度闭卷考试、中考和高考成绩、作业分数与完成时长。

识别策略利用 AI 工具在各班级间的错峰采用:先用的班级与没用的班级在同一时间轴上对比,即双重差分设计。结果指向明确的因果效应,而非简单的相关。

学生的采用速度比学校快得多。Chegg 去年的一项调查显示,富裕国家 80% 的大学生把 AI 用进了学业;更新的民调里,英国 94%、德国 93% 的学生都在用。论文数据里的 AI 采用同样是逐班错峰发生的,这让研究者拿到了罕见的准自然实验窗口。

论文事件研究图:作业分与完成时长的变化 图:论文事件研究图。Panel A 为作业分,采用 AI 后显著抬升;Panel B 为作业完成时长,显著下降。来源:CEPR DP21577(经 edtechsims.com 转载)

作业分平均涨 18%,完成时间缩短 30%,表面看是效率革命。六个月后的月度闭卷考试,同一批学生跌了 20%,约合 1.4 个标准差。

高利害升学考试的降幅在 18% 到 24% 之间,完整损失要两年后才完全显现。论文把这种现象称为学习惩罚(learning penalty),标题直接用了这个词。

八成学生把作业外包了

论文把 AI 用户按行为分成两类。约 80% 的使用者符合「作业外包」画像:作业分很高,完成时间却异常短,明显是让模型代写了事。考试损失几乎全部集中在这群人身上。

剩下约 20% 的学生把 AI 当辅导工具,完成时长与不用 AI 的同学相当,考试损失很小。The Economist 的报道补充了一个细节:考试分数的下跌集中在赶作业的学生中,用时正常的 AI 使用者几乎没付出代价。

剂量效应同样清晰。每周用 AI 少于 1 小时的学生,考试分跌约 5%;每周用 5 小时以上的,跌 30%。初中生比高中生损失大四成,男生比女生多 17%。美国大学理事会(College Board)对上千名高中生的调查显示,84% 的学生用 AI 做过作业——这类行为在全球范围内已经是常态。

论文 Figure 6:按学科分组的考试分影响 图:论文 Figure 6——按学科分组的考试分影响,社会学科损失最大,STEM 与语言类次之。来源:CEPR DP21577(经 edtechsims.com 转载)

最反直觉的是尖子生损失更大。可能的解释:平时靠作业巩固知识的路径被 AI 截断后,原有的熟练度变成了空转。学科分布上,社会学科损失最大,其次是 STEM 和语言类。

作业这个信号灯失灵了

作业分数原本是老师判断学情的核心指标。在这份数据里,AI 用户群体的作业分与考试分相关性发生了反转:作业分越高的 AI 使用者,考试分反而越低。

这意味着作业作为学习监测信号的功能正在失效。老师看到的全对作业是模型的输出,家长盯着的完成速度是模型的速度。校长层面反应慢也有结构性原因:单个老师只教一门课,20% 的降幅分摊到单科并不扎眼;学生的下滑是渐进式的,半年里每月掉一点,本人也很难把因果连到 AI 头上。

论文作者给出的政策建议因此很具体:增加闭卷、现场评估的权重;把监测对象从作业产出(分数)转向学习投入(时长与过程);向学生提供外包长期代价的可信信息。

学生查看试卷资料 图:学生查看试卷资料。来源:Getty Images / Kevin Frayer(Fortune 报道配图)

技能的肌肉记忆与迁移问题

学习科学里有个朴素规律:技能靠主动提取和重复练习固化,看一眼答案记不住。作业的价值恰恰在于生产性挣扎——想不出来再查再试的过程,才是记忆与理解的来源。

AI 把这一步整体外包后,作业从练习变成了抄写。1924 年心理学家 Pressey 发明教学机器时就踩过这个坑:学生用机器答题又快又准,脱离机器就答不出来。Skinner 在 1950 年代的改良版重蹈覆辙,两人最终都放弃了这个项目。神经科学家 Jared Cooney Horvath 在给美国参议院的证词里把这称为迁移问题:工具上手了,能力没上身。

同期的随机实验提供了对照。Contractor 和 Reyes 的 RCT 里,大学生用 AI 辅助时即时测试成绩提升 0.27 个标准差,一周后仍然保持;把 AI 当自动写作机的学生,短期收益在撤掉 AI 后立刻消失。用 AI 解释概念的人获益,用 AI 代写的人吃亏,两个研究在这一点上结论一致。

评估体系正在失效

这场剪刀差暴露的还有评估体系的漏洞。作业曾经同时承担两个职能:练习手段和监测信号。AI 让产出可以被廉价伪造后,两个职能同时失守。

HN 讨论里有人说得直接:作业和考试的分岔,说明完成作业这件事本身已经无法证明学习发生。作弊自古就有,过去作弊的学生会在考试里现形;如今 AI 代写的作业在考试前完全无法与真实学习区分,等考试暴露时,损失已经累积了半年。

讨论区也有另一种声音:把 AI 当放大器。自律的学生拿它当私教,省下的时间用来理解概念;自驱力不足的学生拿它当答案机,越用越依赖。工具本身中立,决定结果的是使用姿态。

一个担忧指向自我纠正机制的失灵。过去靠抄答案混作业的学生,考试一考就露馅,作弊的成本即时兑现;AI 代写的作业在考试前与真实学习无法区分,等闭卷考试把差距暴露出来,时间已经过去半年,学生本人甚至意识不到因果。HN 上有条评论说,作弊自古就有,但这一次的风险在于:AI 代写的能力太强,报应可能永远不会落到作弊者头上——损失发生了,却没有人被抓住。

一个数据点值得留意:学习惩罚从 2023 年初的约 25% 收窄到 2025 年中的约 16%,即使固定早期使用者样本也成立。师生在逐渐适应 AI,但损失仍然可观。

闭卷考试因此重新成为唯一可信的评估锚点。当作业信号全面失效,衡量学习的成本回到了 1924 年:把学生按在教室里,亲眼看着他们答题。2.6 万名学生用 30 个月验证了一件事——AI 能提高产出的效率,前提是产出本身还代表学习;当作业分与考试分背道而驰,需要重新设计的,是整套以产出论英雄的评估方式。

参考链接:

  • The Economist Graphic Detail:Does AI stop children from learning?
  • CEPR Discussion Paper 21577:The Generative AI Learning Penalty: Evidence from Chinese Secondary Education
  • Hacker News 讨论:AI boosted homework scores, then exam scores dropped(49357530)
  • Fortune:Study finds AI boosted homework scores 18%—then tanked exam results 20%
  • arXiv 2607.08849:Experimental Evidence on the Learning Impact of Generative AI