Your context window bills you every turn

개요

LLM의 컨텍스트 창은 매 턴마다 비용이 발생하며, 자동 요약(compaction)은 이러한 비용을 상환하는 메커니즘으로 작동합니다.

주요 내용

  • LLM과의 상호작용에서 매 턴마다 이전 대화 전체가 재전송되며, '기억'은 무료로 제공되지 않고 컨텍스트 창의 토큰 재읽기 비용으로 발생합니다.
  • 900K 토큰 컨텍스트의 경우, 901번째 턴에도 컨텍스트 창의 일부가 재읽힙니다.
  • 실제 세션 분석 결과, 캐시 읽기 토큰이 쓰기 토큰보다 약 32배 많아, 컨텍스트 창에 추가된 각 토큰이 약 32번 더 비용으로 청구됨을 보여줍니다.
  • 자동 요약은 컨텍스트 창이 최대치에 가까워질 때 발생하며, 이를 통해 이전의 누적된 컨텍스트가 요약으로 대체되어 다음 턴의 비용이 재설정됩니다.
  • 캐싱 메커니즘은 API 요금을 약 86% 절감하여 장기 세션을 경제적으로 유지 가능하게 하며, 이는 컨텍스트 창이 곧 비용임을 인지시키지 않고도 작동하는 방식입니다.
  • 컨텍스트 창의 토큰 수는 일회성 비용이 아니라, 해당 토큰이 컨텍스트 창에 남아있는 동안 매 턴 발생하는 반복적인 비용 항목입니다.
  • 세션 관리에 있어, 관련 없는 작업은 새 세션을 시작하고, 광범위한 탐색은 서브 에이전트에게 위임하며, 주제 전환 시 수동 요약을 통해 비용을 관리하는 것이 효과적입니다.

시사점

LLM의 컨텍스트 창은 무료 저장소가 아니라 매 턴 발생하는 비용 발생원이므로, 이를 인지하고 효율적으로 관리하는 것이 중요하다는 점을 강조합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions