Migrating a production AI agent to GPT-5.6: 2.2x faster, 27% cheaper
개요
Ploy의 AI 에이전트가 GPT-5.6 Sol 모델로 성공적으로 마이그레이션되었으며, 이 과정에서 Claude Opus 대비 2.2배 빠른 속도와 27% 비용 절감을 달성했습니다.
주요 내용
- GPT-5.6 Sol의 성능 우위: Ploy는 기존 Claude Opus 대비 고품질 기준을 충족하는 모델을 찾지 못했으나, OpenAI의 GPT-5.6 Sol이 이러한 기준을 충족하며 Ploy 워크스페이스의 기본 모델로 채택되었습니다.
- 마이그레이션의 복잡성: GPT-5.6 Sol로 전환하는 과정은 단순히 모델 교체를 넘어, Vercel AI SDK를 사용함에도 불구하고 모델 제공업체별 동작 차이(도구 인자 채우기, 프롬프트 캐싱, 추론 재현 방식)를 파악하고 스택을 조정하는 과정이 필요했습니다.
- 평가 허약점 수정:
- 기존 평가 허약점이 Claude Opus에 맞춰져 있어, GPT-5.6의 병렬 호출 및 파일 일괄 읽기 활용 방식과 충돌하는 문제를 발견하고 수정했습니다.
- 모델별 공정 평가를 위해 평가 데이터셋의 최소 점수 임계값 문제를 해결했습니다.
- 수정 후 GPT-5.6은 Claude Opus 대비 더 낮은 비용, 더 짧은 시간, 더 적은 토큰 사용량으로 유사하거나 더 나은 결과물을 생성했습니다.
- 도구 호출 문제 해결: GPT-5.6이 불필요한 도구 인자까지 모두 채우는 행동을 보였고, 이로 인해 빈 파일 읽기 발생 빈도가 높아졌습니다. 이를 해결하기 위해 제공업체 경계에서 스키마를 변환하여, 모델은 명시적으로 null을 사용할 수 있게 하고 도구는 기존과 동일한 입력을 받도록 조정했습니다.
- 프롬프트 캐싱 재구축: GPT-5.6의 캐싱 모델이 Claude와 달라, 초기에 예상보다 높은 비용이 발생했습니다. GPT-5.6은 부분적인 접두사 일치 캐싱을 지원하지 않고, 명시적인
prompt_cache_key와prompt_cache_breakpoint를 요구하며, 각 키당 요청 처리량이 제한적입니다. 이를 해결하기 위해 워크스페이스별 키를 사용하고 시스템 프롬프트를 계층화하여 비용 효율성을 확보했습니다. - 추론 재현의 자체 포함: GPT-5.6의 Responses API가 서버 측 항목 참조를 사용하면서 문제가 발생했으며,
store: false옵션을 사용하여 암호화된 추론 내용을 재현하고 자체 포함 가능한 블롭으로 처리하도록 수정했습니다.
시사점
AI 에이전트의 성능 최적화는 최신 LLM 모델의 도입뿐만 아니라, 모델 제공업체별 동작 차이를 이해하고 평가 허약점, 도구 호출 방식, 캐싱 메커니즘, 추론 재현 방식을 정교하게 조정하는 엔지니어링 노력에 달려있습니다.
원문을 불러오는 중...
댓글
GitHub Discussions