I Built an Error Notebook for My AI Agent - 266 Rules, 66 Interceptions, and a Demo You Can Run

개요

AI 에이전트의 실수를 사전에 포착하고 교정하기 위한 '오류 노트' 시스템 구축 방법을 설명하는 글입니다. 266개의 규칙과 66번의 오류 가로채기를 통해 AI 에이전트의 신뢰성과 효율성을 높이는 과정을 다룹니다.

주요 내용

* 현행 AI 에이전트의 한계: 대부분의 AI 코딩 에이전트는 프로젝트 컨텍스트 파일에 환경 설정이나 일반적인 지침만 저장하며, 과거의 실수로부터 학습하는 '교훈'을 효과적으로 관리하지 못합니다. 이러한 방식은 규칙의 복잡성 증가로 인해 지침 준수율이 낮아지는 문제를 야기합니다.
* '오류 노트' 시스템의 필요성: AI 에이전트가 '실행'해야 할 동적이고 구체적인 '교훈'을 저장하여, '무엇을 하지 말아야 할지'가 아닌 'X가 발생하면 Y를 실행하라'는 식의 실행형 규칙으로 전환합니다.
* 시스템 구조: 266개의 규칙을 3단계로 분류합니다.
* Core (14개 규칙): 매 세션마다 자동 주입되는 핵심 규칙.
* Task (88개 규칙): 작업 유형에 따라 로드되는 규칙.
* Archive (164개 규칙): 필요시 검색 가능한 규칙.
* 오류 가로채기 루프:
* Correction Trigger: "틀렸다", "아니다" 등의 키워드를 감지하여 규칙 추출을 트리거합니다.
* Rule Extraction: 오류를 'X가 발생하면 Y를 실행하라'는 형태의 실행형 규칙으로 압축합니다.
* Boot Injection: 세션 시작 시 Core 규칙을 컨텍스트 최상단에 주입합니다.
* Precision Interception: 에이전트가 실수를 하려 할 때 규칙을 발동시켜 자체적으로 수정하도록 유도합니다.
* Effect Tracking: 가로채기 데이터를 기반으로 규칙을 개선하고, 사용되지 않거나 실패율이 높은 규칙은 조정합니다.
* 실제 데이터: 2개월간 266개의 규칙으로 66회의 오류를 가로챘으며, 특히 '작업 시작 전 매뉴얼 건너뛰기'와 '초안 존재를 완료로 착각하는 것'과 같은 오류가 빈번했습니다.
* 데모: AI 에이전트가 파일 수정 완료를 주장할 때, 실제 파일에 변경 사항이 반영되었는지 검증하는 프롬프트 또는 Python 스크립트(auditor.py)를 제공하여 사용자가 직접 확인할 수 있도록 합니다.
* 한계점: 간접적인 수정 제안이나 키워드 매칭의 한계로 인해 모든 오류를 가로채지는 못하며, 규칙의 수가 많아질수록 컨텍스트 창에 할당되는 실제 작업 공간이 줄어드는 문제가 있습니다.

시사점

본 '오류 노트' 시스템은 AI 에이전트의 신뢰성을 체계적으로 향상시키고, 반복적인 실수를 방지하여 사용자와 AI 간의 협업 효율성을 극대화할 수 있습니다. 사용자는 간단한 규칙 작성과 데모 스크립트 실행을 통해 즉시 AI 에이전트의 정확성을 개선하는 첫걸음을 내디딜 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions