How we measured AI writing across arXiv, and where the measurement breaks

개요

arXiv 논문 12,750편의 전문을 분석한 결과, 최근 제출된 논문의 약 3분의 1이 기계 작성처럼 읽히는 것으로 나타났으며, 이는 ChatGPT 출시 이후 급증한 추세이다.

주요 내용

* 연구 방법론:
* ChatGPT 이전 시점(2021-2022년)의 논문을 인간 작성의 기준(ground-truth human)으로 삼아, 탐지기가 실제 인간 작성 논문을 0.4% 미만으로 탐지하도록 보정(calibrated)했다.
* 이 보정된 탐지 임계값을 기준으로, 2023년 1월부터 2026년 7월까지 제출된 논문을 분석 대상으로 삼았다.
* 총 12,750편의 논문(2023-2026년 10개 필드 그룹별 월 25편, 2021-2022년 8개월간의 제어 월 포함)의 버전-1 PDF 전체 텍스트를 스코어링했다.
* 탐지 결과:
* ChatGPT 출시 직후 탐지율이 급증했으며, 2026년 초에는 약 39%까지 최고치를 기록하고 최근 분기에는 약 32%에 달한다.
* 필드별로 탐지율의 편차가 크며, 컴퓨터 과학 분야가 약 65%로 가장 높고, 수학 분야는 약 0.7%로 가장 낮다.
* ChatGPT 이전 시점의 제어 그룹(2021-2022년)에서의 탐지율은 0.4% 수준으로 일관되게 유지되어, 탐지기 자체의 문제로 인한 것이 아님을 시사한다.
* 연구의 한계점:
* 제어 샘플 크기: 필드별 ChatGPT 이전 제어 논문 수가 200편으로 적어, 필드별 정확한 제어율을 산정하기 어렵다.
* 탐지기 편향성: 수학 분야와 같이 기호, 정리, 증명 구조가 주를 이루고 산문이 희소한 분야에서는 탐지기가 훈련된 학술 영어와 다르므로 탐지 정확도가 낮아질 수 있다. 이는 실제 AI 사용률이 낮거나 탐지기의 탐지 능력이 해당 분야에 약한 것일 수 있다.
* 탐지기 커버리지: 특정 AI 생성기(generator)에 더 민감하고, 실제 연구자들이 사용하는 모델과 프롬프트의 정확한 조합을 알 수 없어 탐지율은 실제보다 낮을 수 있으며, 보고된 비율은 최소한의 수치로 간주해야 한다.
* '플래그'의 의미: 탐지기의 '플래그(flag)'는 텍스트가 기계처럼 읽힌다는 것을 의미하며, 100% AI가 작성했음을 의미하는 것은 아니다. 경미한 AI 편집이 포함된 문서도 플래그될 수 있다.

시사점

이 연구는 AI 작성 텍스트 탐지 방법론과 그 한계를 명확히 제시하며, 학술 논문에서 AI 생성 텍스트의 증가 추세와 필드별 편차를 객관적인 데이터로 보여준다. 탐지 결과는 AI 사용의 하한선으로 해석되어야 하며, 특정 개인을 AI 저술가로 단정하는 근거로 사용될 수 없다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions