Detecting LLM-Generated Texts with “Classical” Machine Learning
개요
전통적인 머신러닝 모델을 사용하여 LLM 생성 텍스트와 인간 작성 텍스트를 효과적으로 구분할 수 있으며, 이는 AI 표절 검사기의 작동 방식과 유사하다.
주요 내용
* LLM 생성 텍스트의 통계적 패턴: LLM 생성 텍스트는 2026년 초 기준으로 명확한 통계적 패턴을 보이며, 이는 전통적인 머신러닝 모델로 탐지 가능하다.
* 탐지 방법: 텍스트의 단어 확률을 LLM으로 추정하는 방식은 높은 추론 비용, 낮은 일반화 성능 등의 문제로 비효율적이었다. 대신 scikit-learn의 TF-IDF와 LinearSVC, Naive Bayes와 같은 고전적인 머신러닝 분류기를 활용했다.
* 데이터 생성: 인간 작성 텍스트와 LLM 생성 텍스트 데이터셋을 구축하기 위해 기존 scraped 데이터에서 인간 작성 텍스트를 필터링하고, LLM을 통해 요약 및 재작성하는 방식으로 LLM 생성 텍스트를 생성했다. 이 과정에서 저비용 또는 무료 API 채널을 활용했다.
* 모델 훈련 및 성능: 7개의 이진 분류기(인간 vs. 특정 LLM)를 훈련시킨 후 다수결 투표 방식으로 최종 판정하는 접근 방식을 사용했으며, 개별 모델은 약 85%의 문장 수준 정확도를 보였다.
* 웹 데모 구현: Python 모델을 JavaScript로 변환하여 브라우저에서 직접 추론이 가능한 웹 데모를 구축했으며, 500,000개의 특징을 사용하여 성능과 정확도 간의 균형을 맞췄다.
* 탐지 성능 테스트: 다양한 LLM(Doubao, Deepseek, Claude Sonnet, GPT 등)으로 생성된 텍스트와 실제 웹 소설, 팬픽 등을 테스트한 결과, 대부분의 LLM 생성 텍스트를 높은 정확도로 탐지했으며, 인간 작성 텍스트에 대한 오탐지율은 매우 낮았다.
* 우회 시도: 구글 번역, Youdao 번역, Sogou 번역 등 고전적인 번역 방식과 "AI 느낌을 줄이는" 프롬프트를 사용한 LLM 프롬프트 방식의 우회 시도는 탐지 성능을 크게 저하시키지 못했다.
시사점
고전적인 머신러닝 기법을 통해서도 LLM 생성 텍스트를 효과적으로 탐지할 수 있으며, 이는 AI 콘텐츠 탐지 도구 개발에 있어 실용적인 접근 방식을 제공한다.
댓글
GitHub Discussions