Show HN: Distilling DeepSeek into GPT-OSS doesn't transfer censorship. Try it
개요
DeepSeek V4 Flash와 같은 검열된 중국어 LLM의 출력을 학습한 미국 모델(GPT-OSS-120B)이 검열을 전수받지 않으면서 금융 추론 능력을 향상시킨다는 실험 결과가 발표되었습니다.
주요 내용
* 검열 미전이 실험: 중국어 LLM인 DeepSeek V4 Flash의 출력을 학습한 GPT-OSS-120B 모델은 중국 관련 민감한 질문에 대해 DeepSeek V4 Flash와 달리 검열된 반응을 보이지 않았으며, 정치적 검열이 전이되지 않았습니다.
* 금융 추론 능력 향상: GPT-OSS-120B 모델은 금융 추론 능력에서 유의미한 성능 향상을 보였으며, 이는 중국어 LLM의 검열된 출력으로 학습했음에도 불구하고 나타났습니다.
* 자가 증류(Self-distillation)의 효과: 모델이 자체적으로 실수를 교정하고 이를 학습하는 자가 증류 방식 또한 DeepSeek V4 Flash의 출력을 학습한 모델과 유사한 수준의 금융 추론 성능을 달성했습니다.
* 비용 효율성: 자가 증류된 GPT-OSS-120B 모델은 Kimi K3나 Inkling과 같은 다른 모델에 비해 동일한 예산에서 쿼리당 비용이 훨씬 낮으면서도 높은 성능을 보였습니다.
* LineageEval 도구 개발: 연구진은 검열 전이 여부를 엄격하게 측정하기 위해 304개의 프롬프트 쌍, 통제군, 평가 루브릭, 평가 코드 및 모델 자체를 포함하는 LineageEval 도구를 개발하여 공개했습니다.
* 20B 모델의 성능: 공개된 20B 모델은 금융 추론 작업에서 주의 집중 메커니즘만 활용하는 방식(attention-only tuning)으로는 성능이 제한적이었으나, 전문가 계층을 포함하여 적응시키자 성능이 향상되었습니다.
* 실제 적용 가능성: 제한된 토큰 예산과 잠재적 지연 시간을 고려할 때, 잘 학습된 120B 모델이 더 큰 모델보다 실용적인 작업에서 더 나은 성능을 보일 수 있습니다.
시사점
이번 연구는 검열된 교사 모델로부터 학습된 학생 모델이 검열을 상속받지 않으면서도 특정 분야의 성능을 향상시킬 수 있음을 보여주며, 모델 학습 및 AI 안전성 논의에 중요한 실증적 데이터를 제공합니다.
댓글
GitHub Discussions