Your AI Agent Project Is Really a Data Project: The Data-Prep Tax

개요

AI 에이전트 프로젝트의 성공은 모델 선택보다 데이터의 상태에 달려 있으며, 핵심 과제는 데이터 준비에 소요되는 시간과 비용, 즉 '데이터 준비 세금(data-prep tax)'에 있다.

주요 내용

- AI 에이전트 프로젝트의 본질: AI 에이전트 프로젝트는 실제로는 데이터 프로젝트이며, 성공 여부는 모델 성능이 아닌 데이터의 정확성과 일관성에 의해 결정된다.
- 데이터 문제의 두 가지 측면:
- 지식 데이터(Knowledge Data): 정책, 문서, FAQ 등 에이전트가 정보를 얻기 위해 참조하는 비정형 데이터로, 형식 및 용어의 불일치 문제가 발생한다.
- 운영 데이터(Operational Data): 고객 기록, 접근 권한 등 에이전트가 작업을 수행하기 위해 사용하는 정형 데이터로, 개체 식별(identity resolution) 및 권한(authority) 문제가 발생한다.
- 데이터 준비 세금(Data-Prep Tax):
- 발생 원인: 에이전트 프로젝트의 초기 계획 단계에서 데이터 준비 작업이 간과되거나 과소평가되는 경향이 있다.
- 반복적인 발생: 비즈니스 환경 변화(신제품 출시, 정책 변경 등)로 인해 데이터는 지속적으로 변경되며, 이를 최신 상태로 유지하기 위한 지속적인 관리 비용이 발생한다.
- 책임 소재 부재: 데이터 유지보수에 대한 명확한 책임자가 지정되지 않으면 데이터의 품질이 저하되고 에이전트의 성능이 점차 떨어진다.
- 데이터 준비 세금의 식별: competent person (능숙한 사람)이 현재 보유한 데이터를 바탕으로 에이전트가 답변하고자 하는 질문에 정확하게 답할 수 있는지 스스로에게 질문하는 것이 프로젝트가 데이터 프로젝트인지 파악하는 지표가 된다. 만약 불가능하다면, 에이전트 구축 전에 데이터 개선이 선행되어야 한다.
- 데이터 준비의 핵심 활동:
- 지식 데이터: 일관된 형식으로 변환, 중복 제거, 용어 통일, 최신 정보 확인 등의 편집 및 정보 아키텍처 작업이 필요하다.
- 운영 데이터: 데이터 모델링, 개체 식별 키(resolution key) 설정, 거버넌스(governance)를 통해 데이터의 진위 여부와 접근 권한을 명확히 해야 한다.
- 프로젝트 재정의: 데이터 준비 작업을 단일 에이전트를 위한 비용이 아닌, 분석, 다른 시스템 통합 등 다양한 후속 작업에 활용될 수 있는 기초 자산 구축으로 인식해야 한다.
- 효율적인 프로젝트 스코핑:
1. 데이터 유형별 인벤토리 구축: 지식 데이터와 운영 데이터를 분리하여 각 유형의 특성에 맞는 준비 계획을 수립한다.
2. 개체 식별 키(Resolved Identity Key) 정의: 중복되거나 변형된 개체를 단일한 쿼리 가능한 개체로 정의한다.
3. Source-of-Truth 및 최신화 정책 수립: 각 정보의 소유 시스템을 결정하고, 정보의 최신성 요구 수준을 정의한다.
4. 접근 권한 모델링: 에이전트가 원본 시스템의 행 수준 및 역할 기반 권한을 준수하도록 설계한다.
5. 에이전트, 플로우, 쿼리 결정: 데이터 준비가 완료된 후, 문제 해결에 가장 적합한 도구(에이전트, 자동화 플로우, 단순 쿼리 등)를 선택한다.

시사점

AI 에이전트 프로젝트의 성공은 기술적 모델 선택보다 데이터의 준비 상태와 유지보수 체계에 크게 좌우되며, 데이터 준비 작업을 프로젝트 초기 단계부터 핵심적인 부분으로 간주하고 충분한 시간과 예산을 할당해야 한다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions