An Anthropic researcher just gave us a peek at self-improving AI
개요
Anthropic의 연구원 Chen Yueh-Han이 주도한 자동화된 연구 시스템은 AI 모델의 성능을 개선하는 데 있어 인간 연구자를 능가하는 가능성을 보여주었습니다.
주요 내용
* Anthropic은 "Automated Researchers Can Reliably Mitigate Alignment Failures"라는 제목의 논문을 통해 AI 시스템이 모델의 얼라인먼트 벤치마크 성능을 신뢰성 있게 개선할 수 있음을 제시했습니다.
* 10개의 특정 잘못된 행동 벤치마크에 대해 자동화된 시스템은 전반적인 성능 저하 없이 모든 벤치마크에서 성능을 향상시켰습니다.
* 자동화된 시스템은 전통적인 연구 방식과 유사하게 사용 가능한 문헌을 검색하고, 방법을 제안하며, 30분 동안 모델을 훈련시키고, 점진적으로 벤치마크를 높이는 과정을 반복합니다.
* 효과적인 방법은 유지되고 비효과적인 방법은 폐기되어 시스템이 빠르고 대규모로 운영될 수 있습니다.
* 이 시스템은 6시간 이내에 숙련된 인간이 제안하는 것보다 우수한 성능을 보였으며, 시간당 API 추론 비용은 약 $4로 인간 연구자 급여 $150/시간보다 훨씬 경제적입니다.
* 제한 사항으로는 벤치마크가 실제 얼라인먼트 목표를 얼마나 잘 반영하는지에 따라 시스템의 성능이 달라지며, 벤치마크 설정 및 유지보수, 그리고 자동화된 연구자들이 참조하는 문헌의 확장 및 유지보수에 대한 상당한 작업이 필요합니다.
시사점
해당 연구는 훈련 후 자동화된 얼라인먼트 개선이 단기적으로 실용화될 수 있다는 초기 증거를 제공하며, AI 모델이 스스로를 개선하는 재귀적 자기 개선을 향한 중요한 발걸음으로 볼 수 있습니다.
댓글
GitHub Discussions