AI 논문이 2%에서 15%로 폭증, 학계가 막을 수 없는 이유

AI 논문이 2%에서 15%로 폭증, 학계가 막을 수 없는 이유

AI학문적 정직성arXiv연구

데이터 소스:HN + Unslop · HN

2025년만 해도 컴퓨터과학 분야 신규 논문 중 AI가 쓴 것으로 의심되는 비율은 2% 미만이었다. 2026년, 이 숫자는 15%로 뛰었다. 점진적 증가가 아니다. 폭발적이다.

이는 Unslop팀이 최근 발표한 대규모 스캔 결과다. 이들은 arXiv에 등록된 12,750편의 논문 전문을 분석했으며, 탐지 임계값을 ‘오탐률 0.4%’ 수준으로 교정했다—즉, ChatGPT 등장 이전의 인간 논문 중 단 0.4%만 AI 작성으로 오판되도록 설정했다. 이 기준에서 컴퓨터과학 분야의 AI 작성 비율은 거의 0%에서 15%까지 치솟았다. 최근 전체 분기로 범위를 넓히면 이 숫자는 32%에 달하며, 2026년 초 정점은 39%에 근접했다.

이것이 2026년 현실이다.

학계, AI에 얼마나 잠식당했나?

Unslop팀의 탐지는 10개 학문 분야를 포괄한다. 다음 데이터를 보자(최근 12개월, 2026년 7월 기준):

  • 컴퓨터과학: 신규 논문의 65%가 AI 작성 의심 판정
  • 정량생물학: 56.3%
  • 전기공학 및 시스템: 51.3%
  • 경제학 및 금융: 47%
  • 응용물리학: 34%
  • 통계학: 31.3%
  • 응집물질물리학: 24%
  • 고에너지물리학: 14%
  • 천체물리학: 10.7%
  • 수학: 0.7%

이 데이터의 공통점은 ChatGPT 등장 이전(2021-2022년)에는 모든 분야의 기본 오탐률이 0%에서 3.5% 사이였다는 점이다. 곡선이 본격적으로 오르기 시작한 것은 2023년 초부터다.

다시 말해, 학술 논문 중 ‘AI가 쓴 것처럼 읽히는’ 텍스트는 더 이상 무시할 수 있는 잡음 신호가 아니라, 다수 분야에서 주류가 되었다.

그림 1: arXiv 논문 AI 작성 판정 비율 변화 추이(2021-2026) arXiv AI 논문 추이 그래프

그림 2: 분야별 AI 작성 판정 비율 비교 분야별 AI 논문 비교 그래프

AI가 쓴 논문, 왜 탐지되지 않나?

AI가 쓴 글은 쉽게 알아볼 수 있지 않을까? 대형 언어 모델의 글에는 특유의 ‘AI 냄새’가 나지 않을까?

현실은 정반대다.

첫째, AI 글쓰기 수준의 진화가 탐지 도구의 진화를 훨씬 앞질렀다. 초기 GPT-3의 출력물은 확실히 패턴이 드러났다—문장 구조의 반복, ‘동시에’나 ‘또한’의 과다 사용, 결론 부분의 공허함. 하지만 GPT-4, Claude 등 차세대 모델에 사용자의 정교한 수정이 더해지면서 AI 텍스트와 인간 텍스트의 경계는 극도로 모호해졌다.

둘째, 이른바 ‘AI 탐지기’는 본질적으로 통계 분류기에 불과하다. 이는 인간 글쓰기와 AI 글쓰기 간의 단어 선택, 문장 구조 분포의 통계적 차이를 학습하는 방식으로 작동한다. 하지만 모든 통계 모델에는 두 가지 치명적 한계가 있다: 오탐—인간이 썼지만 ‘정돈된’ 스타일의 글을 AI로 판정—과 미탐—AI 텍스트가 약간만 수정되어도 통계적 특징이 깨져 탐지기가 무력화된다.

더 뼈아픈 사실은, 탐지 도구의 정확도는 의도적으로 위장된 AI 텍스트 앞에서 급락한다는 점이다. AI로 초안을 만든 후 동의어 몇 개를 바꾸고, 단락 순서를 조정하고, 자신의 판단을 한두 문장 추가하는 정도만 해도 탐지기는 거의 무력해진다.

HN의 한 연구자(pbui)는 실험을 진행했다. 자신이 2011년에 쓴 논문을 탐지기에 넣었더니 27%가 기계 작성으로 판정되었다. 2012년 박사 논문은 40%, 2015년 IEEE 게재 논문은 74%가 기계 작성으로 나왔다. AI가 탄생하기 전에 살아있는 인간이 쓴 논문이 기계가 쓴 것으로 판정된 것이다. 이는 탐지기가 ‘인간 글쓰기가 무엇인지’조차 제대로 파악하지 못하고 있음을 의미한다.

고양이와 쥐 게임: 탐지와 회피의 군비 경쟁

이 싸움은 본질적으로 불균등한 군비 경쟁이다:

수비 측(탐지 도구): 모든 가능한 AI 생성 전략을 식별해야 한다. 하지만 AI 모델은 매일 업데이트되고, 프롬프트 엔지니어링도 진화하므로 탐지기는 영원히 뒤쫓기만 한다.

공격 측(AI를 사용하는 사람): 텍스트가 ‘인간이 쓴 것처럼’ 보이게만 하면 된다. 오늘은 GPT-4로 초안을 쓰고 두 번 수정하고, 내일은 Claude로 다른 스타일을 시도하고, 모레는 AI 출력을 재작성 도구에 통과시킨다—탐지기의 훈련 데이터는 항상 한 걸음 뒤처진다.

Unslop팀 역시 이를 솔직히 인정한다. 그들의 탐지기는 언어 모델에 따라 민감도가 다르며, 사용자가 실제로 사용한 모델과 프롬프트 조합을 알 수 없다. 따라서 이 데이터는 ‘하한선’에 불과하다—실제 비율은 더 높을 뿐 낮지 않다.

더 골치 아픈 점은, 탐지기의 정확도가 99%에 달하더라도 수천 수만 건의 논문에 실제 적용되면 엄청난 오탐이 발생한다는 것이다. HN의 한 사용자(NitpickLawyer)는 초기 AI 탐지기들이 모두 미국 독립선언문을 100% AI 작성으로 판정했다고 지적했다. 오탐의 결과는 실질적이다—이미 탐지기의 오판으로 AI를 사용해 과제를 작성했다는 누명을 쓴 학생들이 존재한다.

연구자들은 왜 AI로 논문을 쓸까?

여기에는 두 가지 상반된 힘이 작용한다:

한쪽은 ‘학문적 정직성’ 이다. 논문은 연구자 자신의 사고와 노력을 담아야 한다. 글쓰기까지 AI에 맡긴다면, 학문은 대체 무엇을 ‘연구’하는 것일까?

다른 한쪽은 ‘효율주의’—혹은 생존 압박이다. 학계에는 불문율이 있다: publish or perish(출판하거나 도태되거나). 젊은 연구자는 논문 수로 평가받고, 교수는 논문 지표로 경쟁하며, 박사과정생은 논문으로 졸업한다. 이런 압박 속에서 아이디어를 빠르게 규격화된 논문으로 만들어주는 AI는 합리적인 선택지로 보인다.

어떤 이들은 어쩔 수 없이 선택한다—연구실 예산은 빠듯하고, 동료들의 생산 속도는 놀랍고, 심사 기간은 점점 길어지니 AI 없이는 따라잡을 수 없다. 어떤 이들은 기회를 잡는다—AI 생성 내용을 살짝 수정해 투고하고, 자신의 이름을 올려 양산형 논문으로 지표를 쌓는다.

필자가 보기에 이 두 동기는 현실에서 혼재되어 있다. 연구자가 ‘그냥 언어 정도만 정리하려고’ AI를 쓰기 시작했다가 ‘생각보다 편하네’라는 단계를 거쳐 ‘아, 이 초안은 AI가 대충 써도 되니까 내가 몇 군데만 고치면 되겠다’로 변하는 경우가 많다. 이 과정에는 명확한 선이 없지만, 학술 글쓰기의 생태계를 실질적으로 변화시키고 있다.

이것이 학문적 정직성에 의미하는 바

현재 주요 학술지와 학회의 AI 글쓰기에 대한 태도는 ‘시행착오’ 단계에 머물러 있다. 명시적으로 금지하는 곳이 있는가 하면, 공개를 요구하는 곳도 있고, 눈감아주는 곳도 있다.

하지만 문제는 태도가 아니라 규제의 실현 가능성이다. 탐지 도구가 신뢰할 수 없다면, AI 글쓰기 공개는 저자의 양심에 맡겨질 수밖에 없다. 그리고 AI로 논문을 쓰면서도 공개하지 않을 작정인 저자가 갑자기 정직해질 가능성은 희박하다.

더 깊은 위기는 AI 작성 비율이 일정 수준을 넘어서면 학술 문헌 자체의 신호 가치가 하락한다는 점이다. 많은 시간을 들여 논문을 읽었는데, 그것이 AI가 생성한 표준 템플릿에 몇 개의 수식만 추가한 것이라면, 학술 커뮤니케이션의 기초가 흔들린다.

물론 다른 목소리도 있다: 도구 자체에는 선악이 없다. AI가 연구자의 아이디어 표현을 돕고 논증을 명확히 정리하는 데 기여한다면, 그것은 단지 글쓰기의 보조 수단일 뿐이다. 핵심은 사용 방식과 사용 경계—AI를 사고 증진에 사용하느냐, 사고 대체에 사용하느냐에 달려 있다.

Unslop팀의 연구는 분명한 결론을 제시한다: 학술 글쓰기에 AI가 스며드는 현상은 이미 되돌릴 수 없다. 탐지 도구는 따라잡지 못하고, 규제는 막지 못하며, 정직성은 양심에 달렸다. 앞으로 어떤 일이 벌어질지는 학계가 ‘효율 포용’과 ‘선 방어’ 사이에서 균형점을 찾을 수 있느냐에 달려 있다.

학계의 진정한 도전은 ‘AI를 어떻게 써야 학문 자체를 파괴하지 않을까’ 이다.


참고 링크:

  • How we measured AI writing across arXiv, and where the measurement breaks — Unslop 팀 원문
  • Hacker News 토론: 187 points, 137 comments — HN 커뮤니티 토론
  • Unslop Detector 기술 설명 — 탐지기 원리와 교정 방법