AI写的论文从2%暴涨到15%,学术界拦不住了

AI写的论文从2%暴涨到15%,学术界拦不住了

AI学术诚信arXiv科研

数据源:HN + Unslop · HN

2025年,计算机科学领域只有不到2%的新论文疑似AI写的。到了2026年,这个数字变成了15%。不是逐渐增长,是暴涨。

这是Unslop团队最近发布的一项大规模扫描给出的结论。他们分析了arXiv上12,750篇论文的全文,把检测阈值校准到”误伤率仅0.4%“的水平——也就是说,ChatGPT出现之前的人类论文,只有0.4%会被误判为AI写作。在这个基准上,计算机科学领域的AI写作比例从几乎为零一路飙到了15%。如果把范围扩大到最近一个完整季度,这个数字甚至到了32%,2026年初峰值接近39%。

这是发生在2026年真实的事。

学术圈被AI”入侵”到什么程度?

Unslop团队的检测覆盖了十个学科方向。来看一组数据(最近12个月,截至2026年7月):

  • 计算机科学:65% 的新论文被判定为疑似AI写作
  • 定量生物学:56.3%
  • 电气工程与系统:51.3%
  • 经济学与金融:47%
  • 应用物理学:34%
  • 统计学:31.3%
  • 凝聚态物理:24%
  • 高能物理:14%
  • 天体物理学:10.7%
  • 数学:0.7%

这些数据有一个共同的特点:在ChatGPT诞生之前(2021-2022年),这些学科的基础误报率都在0%到3.5%之间。曲线是从2023年初才开始抬头的。

换句话说,学术论文中”读起来像AI写的”文本,已经从一个可以忽略的噪声信号,变成了很多学科的主流

配图1:arXiv论文被判定为AI写作的比例变化趋势(2021-2026) arXiv AI论文趋势图

配图2:各学科被判定为AI写作的比例对比 各学科AI论文对比图

AI写的论文,为什么检测不出来?

你可能会想:AI写的东西不是应该很容易辨认吗?那些大模型的文字不是很有”AI味”吗?

现实恰恰相反。

第一,AI写作水平的进化远超检测工具的进化。 早期的GPT-3输出确实有明显的模式——句子结构重复、喜欢用”同时”和”此外”、结论部分空洞。但到了GPT-4、Claude等新一代模型,再加上用户的精心修改,AI文本和人类文本的边界已经极度模糊。

第二,所谓的”AI检测器”本质上是统计分类器。 它们的工作原理是学习人类写作和AI写作在词语选择、句式分布上的统计差异。但任何统计模型都有两个死穴:一是误报——把人类写的、但风格偏”工整”的文本判为AI;二是漏报——AI文本经过简单修改后,统计特征被破坏,检测器就失灵了。

更扎心的事实是:检测工具的准确率在面对刻意伪装过的AI文本时会断崖式下跌。一个人如果稍微花点时间,把自己用AI生成的草稿做一轮改写——换几个同义词、调整一下段落顺序、加一两句自己的判断——检测器几乎就无能为力了。

HN上有位研究者(pbui)做了一个实验:他把自己2011年写的论文丢进检测器,结果被判定为27%机器写作;2012年的博士论文,40%机器;2015年发表的IEEE论文,74%机器。一个活人写的、在AI诞生之前的论文,被判定为机器写的。 这说明什么?说明这些检测器连”什么是人类写作”都搞不清楚,更别提区分AI和人了。

猫鼠游戏:检测 vs 反检测的军备竞赛

这场博弈本质上是一场不对等的军备竞赛:

防守方(检测工具):要识别所有可能的AI生成策略。但AI模型每天都在更新,提示词工程也在进化,检测器永远在追赶。

进攻方(使用AI的人):只需要让文本”看起来像人写的”。今天用GPT-4写初稿然后改两遍,明天用Claude换一种风格,后天把AI输出扔进改写工具——检测器的训练数据永远慢一步。

Unslop团队自己也坦诚地承认了这一点:他们的检测器对不同的语言模型敏感度不同,而且无法知道用户实际使用的模型和提示词组合。因此,他们报告的数据只能算”下限”——真实比例只会更高,不会更低。

更棘手的是,即使检测器准确率达到99%,只要它在实际中被用在成千上万的论文上,就有大量误报。HN上一位用户(NitpickLawyer)指出:早期所有AI检测器都曾把《独立宣言》判定为100%AI写作。误报的后果是真实的——已经有学生因为检测器的误判被冤枉使用AI写作业。

为什么研究者要用AI写论文?

这背后是两股力量的拉扯:

一方是”学术诚信”。 论文应该代表研究者自己的思考和劳动。如果连写作都交给了AI,那学术到底在”研究”什么?

另一方是”效率主义”——或者说,生存压力。 学术界有一条铁律:publish or perish(不发表就出局)。年轻研究员要看论文数量,教授要拼论文指标,博士生要靠论文毕业。在这种压力下,用AI把思路快速变成一篇规范的论文,看起来是一个合理的选择。

有人是被迫——实验室经费紧张、同行的产出速度惊人、审稿周期越来越长,不用AI根本跟不上节奏。有人是投机——把AI生成的内容稍加修改就投稿,挂上自己名字,量产论文刷指标。

笔者认为,这两种动机在现实中往往是混合的。一个研究员可能初衷是”我就用AI整理一下语言”,然后发现”好像挺顺手的”,最后变成”这篇初稿AI写的大差不差,我改几个地方就行了”。这个过程没有明确的红线,但是它正真实地改变着学术写作的生态。

这对学术诚信意味着什么?

目前主流的学术期刊和会议,对AI写作的态度还处于”摸着石头过河”的阶段。有的明确禁止,有的要求声明,有的睁一只眼闭一只眼。

但问题不在于态度,在于监管的可行性。如果检测工具不可靠,那AI写作的声明只能靠作者自觉。而一个愿意用AI写论文却不声明的作者,也不太可能突然变得诚实。

更深层的危机是:当AI写作的比例高到一定程度,学术文献本身的信号价值就会下降。 如果你花大量时间读一篇论文,却发现它只是一个AI生成的标准模板加上几个公式,那整个学术交流的基础就被动摇了。

当然,也有另一种声音:工具本身没有善恶。如果AI能帮助研究者更快地表达思想、更清晰地组织论证,那它只是写作的辅助。关键是使用方式和使用边界——是用AI来增强思考,还是用它来替代思考。

Unslop团队的研究给我们留下了一个明确的结论:AI在学术写作中的渗透已经不可逆了。 检测工具追不上,规范围堵不住,诚信靠自觉。接下来会发生什么,取决于学术界能不能在”拥抱效率”和”守住底线”之间找到一个站得住脚的平衡点。

学术界面临的真正挑战是**“怎么用AI才不会摧毁学术本身”**。


参考链接:

  • How we measured AI writing across arXiv, and where the measurement breaks — Unslop 团队原文
  • Hacker News 讨论帖:187 points, 137 comments — HN 社区讨论
  • Unslop Detector 技术说明 — 检测器原理与校准方法