SkillOpt: Microsoft Teaches AI Agents to Self-Evolve Without Touching Model Weights

개요

Microsoft Research의 SkillOpt는 AI Agent가 자체적으로 기술(skill)을 발전시킬 수 있도록 지원하는 새로운 연구로, 모델 가중치를 직접 수정하지 않고 Skill Document를 과학적으로 최적화한다.

주요 내용

* Skill Document를 Trainable State로 간주: SkillOpt는 기존의 모델 Fine-tuning, Prompt 엔지니어링, 수동 Skill Document 수정 방식 대신, Skill Document 자체를 AI Agent의 "학습 가능한 상태"로 보고 최적화한다.
* 4단계 자기 발전 루프:
1. Rollout: 현재 Skill Document를 사용하여 Agent가 실제 작업을 수행하고, 그 과정(prompt, 응답, 결과, 점수)을 기록한다.
2. Reflect: 기록된 Agent의 작업 궤적(trajectory)을 분석하여 성공 및 실패 원인을 파악한다.
3. Aggregate & Select: 분석 결과를 바탕으로 Optimizer Model이 Skill Document의 수정(문장 추가, 삭제, 변경)을 제안하며, 이때 제한된 편집 예산(bounded edit budget)을 적용하여 과도한 수정을 방지한다.
4. Validate & Update: 제안된 수정 사항을 보류된 검증 세트(held-out validation set)에서 테스트하여 성능 향상이 확인될 경우에만 수락한다. 거부된 수정 사항은 재발 방지를 위해 저장된다.
* 독립적인 최적화 과정: SkillOpt는 대상 AI 모델의 가중치, 아키텍처, 추론 비용에 영향을 주지 않으면서 Skill Document(best_skill.md)만을 점진적으로 개선시킨다.
* 광범위한 실험 결과: 7개의 다양한 모델, 6개의 벤치마크, 3개의 Harness에서 SkillOpt는 52가지 테스트 항목 모두에서 최고 또는 동등한 성능을 달성했으며, 일부 작업에서는 40점 가까이 성능을 향상시켰다.
* 각 구성 요소의 중요성 입증: Abalation study를 통해 bounded edit budget, rejected-edit buffer, memory/context 등 SkillOpt의 각 구성 요소가 성능 향상에 필수적임을 입증했다.
* 뛰어난 전이 학습 능력: 한 모델 및 Harness에서 학습된 Skill Document는 다른 모델이나 Harness에서도 긍정적인 성능 향상을 보였다.
* SkillOpt-Sleep: 야간 오프라인 자기 발전 엔진으로, 사용자가 별도의 조치 없이도 밤새 Skill Document를 개선할 수 있는 기능을 제공한다.

시사점

SkillOpt는 AI Agent의 Skill Document 작성을 예술에서 과학으로 전환하며, 모델 파인튜닝 없이도 Agent의 성능을 효과적으로 향상시킬 수 있는 실용적인 방법론을 제시하여 Agent 개발 생태계에 중요한 영향을 미칠 것으로 기대된다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions