2025年、コンピュータサイエンス分野の新規論文のうちAIが書いたと疑われるものは2%未満だった。2026年、その数字は15%に達した。漸増ではなく、急増である。
これはUnslopチームが最近公開した大規模スキャンの結論である。arXiv上の12,750本の論文全文を分析し、検出閾値を「誤検出率0.4%」に調整——つまり、ChatGPT登場以前の人間による論文のうちAI作成と誤判定されるのはわずか0.4%という水準だ。このベースラインにおいて、コンピュータサイエンス分野のAI作成率はほぼゼロから15%まで急上昇した。直近の四半期全体では32%、2026年初頭のピークは39%近くに達する。
これは2026年に現実に起きていることだ。
学術界はAIにどこまで「侵食」されているのか
Unslopチームの検出は10の分野をカバーしている。データを見てみよう(直近12ヶ月、2026年7月時点):
- コンピュータサイエンス:新規論文の65%がAI作成の疑い
- 定量生物学:56.3%
- 電気工学とシステム:51.3%
- 経済学と金融:47%
- 応用物理学:34%
- 統計学:31.3%
- 凝縮系物理学:24%
- 高エネルギー物理学:14%
- 天体物理学:10.7%
- 数学:0.7%
これらのデータには共通点がある。ChatGPT登場前(2021〜2022年)は、これらの全分野でベースライン誤検出率が0%〜3.5%の範囲に収まっていた。曲線が上昇し始めたのは2023年初頭からだ。
言い換えれば、学術論文における「AIが書いたように読める」テキストは、無視できるノイズ信号から、多くの分野で主流になりつつある。
図1:arXiv論文がAI作成と判定された割合の推移(2021〜2026)
図2:各分野におけるAI作成判定の割合比較
AIが書いた論文はなぜ検出できないのか
こう思うかもしれない——AIが書いたものなら簡単に見分けがつくのでは?あの大モデルの文章には「AI臭さ」があるのではないか?
現実はまったく逆である。
第一に、AIの文章生成能力の進化は検出ツールの進化をはるかに上回っている。 初期のGPT-3の出力には確かに明確なパターンがあった——文構造の反復、「同時に」「さらに」などの決まり文句、空虚な結論。しかしGPT-4、Claudeといった次世代モデルに、ユーザーによる入念な編集が加わると、AIテキストと人間のテキストの境界は極めて曖昧になっている。
第二に、いわゆる「AI検出器」は本質的に統計的分類器にすぎない。 その動作原理は、人間の執筆とAIの執筆における語彙選択や文型分布の統計的差異を学習することだ。しかしあらゆる統計モデルには二つの致命点がある。一つは誤検出——人間が書いたがスタイルが「整いすぎている」テキストをAIと判定すること。もう一つは見逃し——AIテキストが軽微な修正を受けると統計的特徴が破壊され、検出器が機能しなくなることだ。
さらに厄介な事実は、検出ツールの精度は意図的に偽装されたAIテキストに対して急落するということだ。少し時間をかけてAI生成の下書きを書き換える——同義語をいくつか置き換え、段落順を調整し、自分の判断を一文加える——これだけで、検出器はほぼ無力になる。
HNのある研究者(pbui)は実験を行った。自身が2011年に書いた論文を検出器にかけたところ、27%が機械生成と判定された。2012年の博士論文は40%機械、2015年発表のIEEE論文は74%機械——AI誕生以前に生身の人間が書いた論文が機械作成と判定されたのだ。これは何を意味するか?これらの検出器は「人間の執筆とは何か」を理解できておらず、ましてやAIと人間を区別できるはずもないのである。
いたちごっこ:検出vs反検出の軍拡競争
この駆け引きは本質的に非対称な軍拡競争である。
防御側(検出ツール):あらゆるAI生成戦略を識別しなければならない。しかしAIモデルは日々更新され、プロンプトエンジニアリングも進化し続けており、検出器は常に後手に回る。
攻撃側(AIを使う側):テキストを「人間が書いたように見せる」ことだけが必要だ。今日はGPT-4で下書きを書いて二回書き直し、明日はClaudeでスタイルを変え、明後日はAIの出力をリライトツールに通す——検出器の訓練データは常に一歩遅れる。
Unslopチーム自身もこの点を率直に認めている。彼らの検出器は言語モデルによって感度が異なり、ユーザーが実際に使用したモデルとプロンプトの組み合わせを知ることはできない。したがって、彼らが報告するデータはあくまで「下限値」であり、実際の割合はこれより高く、低くなることはない。
さらに厄介なのは、検出器の精度が99%に達しても、それが何千もの論文に実際に適用されれば大量の誤検出が発生するという点だ。HNユーザーのNitpickLawyer氏が指摘するように、かつてすべてのAI検出器がアメリカ独立宣言を100%AI作成と判定したことがある。誤検出の結果は現実的なものだ——検出器の誤判定によって学生が不当にAI使用を疑われるケースが実際に発生している。
なぜ研究者はAIで論文を書くのか
この背景には二つの力のせめぎ合いがある。
一方は「学術的誠実性」。論文は研究者自身の思考と労力を反映すべきだ。執筆までもAIに委ねてしまったら、学術は一体何を「研究」しているのか。
もう一方は「効率主義」——あるいは生存圧力。アカデミアには不文律がある:publish or perish(出版するか、さもなくば消えよ)。若手研究者は論文数を求められ、教授は論文指標を競い、博士課程の学生は論文で卒業しなければならない。このプレッシャーの下で、AIを使ってアイデアを素早く規定の論文形式に仕上げることは、合理的な選択に見える。
ある者は追い詰められて——研究室の予算は逼迫し、同僚の生産性は驚異的で、査読期間は長期化する一方——AIを使わなければ競争についていけない。ある者は機会を狙って——AIが生成したコンテンツを軽く修正して投稿し、自分の名前を載せて論文を量産し指標を稼ぐ。
筆者には、これら二つの動機は現実には混ざり合っているように思われる。研究者は「AIで文章を整理するだけ」と始めて、「なかなか便利だ」と気づき、最終的には「この下書きはAIで大方できているから、少し直して提出しよう」となる。このプロセスに明確な線引きはないが、現実に学術執筆のエコシステムを変えつつある。
これは学術的誠実性にとって何を意味するのか
現在の主流の学術誌や学会は、AI執筆に対して暗中模索の段階である。明確に禁止するところもあれば、宣言を求めるところもあり、黙認するところもある。
しかし問題は態度ではなく、規制の実現可能性にある。検出ツールが信頼できない以上、AI執筆の宣言は著者の良心に委ねるほかない。AIで論文を書いても宣言しない著者が、突然正直になるとは考えにくい。
より深層の危機は、AI執筆の割合が一定の水準に達したとき、学術文献自体のシグナル価値が低下するということだ。多くの時間をかけて論文を読んだ結果、それがAIが生成した標準テンプレートに数式をいくつか埋め込んだだけのものだったとしたら、学術コミュニケーションの基盤そのものが揺らぐ。
もちろん、別の見方もある。道具そのものに善悪はない。AIが研究者の思考をより速く表現し、議論をより明確に組み立てる助けになるなら、それは単なる執筆支援にすぎない。重要なのは、使用方法と使用範囲——AIを思考の拡張に使うのか、思考の代替に使うのか——である。
Unslopチームの研究は明確な結論を残している——AIの学術執筆への浸透はもはや不可逆的である。検出ツールは追いつかず、規制では塞げず、誠実性は自己申告任せ。次に何が起きるかは、学界が「効率の追求」と「倫理の維持」の間に立つべきバランスを見出せるかどうかにかかっている。
学界が直面する真の課題は**「AIをどう使えば学術そのものを破壊せずに済むのか」**である。
参考リンク:
- How we measured AI writing across arXiv, and where the measurement breaks — Unslopチーム原文
- Hacker News 議論スレ:187 points, 137 comments — HNコミュニティの議論
- Unslop Detector 技術説明 — 検出器の原理と調整方法
