Building a Multi-Modal Evidence Review Agent for Damage Claims
개요
자동차, 노트북, 패키지 손상 보험금 청구의 증거를 검토하고 AI 시스템이 일관되고 설명 가능한 결정을 내릴 수 있도록 하는 다중 모달(멀티모달) 에이전트를 구축하는 내용이다.
주요 내용
* 문제점: 실제 보험금 청구 과정에서 제공되는 증거(텍스트, 사진)가 불완전하거나, 모순되거나, 의도적으로 오해를 불러일으킬 수 있어 AI 시스템이 일관된 결정을 내리기 어렵다. 챗봇 대화는 모호하거나 다국어, 심지어 적대적일 수 있으며, 여러 이미지는 다른 객체나 품질을 보여줄 수 있다.
* 시스템 목표: 텍스트, 이미지, 과거 기록 등 다양한 정보를 종합적으로 추론하여 일관되고 설명 가능한 결정을 내리는 AI 시스템을 구축하며, 규제 및 운영 팀이 요구하는 구조화된 출력(CSV 스키마)을 생성하는 것이다.
* 핵심 설계 원칙:
* 시각적 증거(이미지)를 텍스트보다 우선시한다.
* 모든 결정은 이미지 ID와 짧은 설명을 통해 설명 가능해야 한다.
* 과거 기록은 위험 평가에 영향을 줄 수 있지만, 승인을 결정하지는 않는다.
* 증거가 부족할 경우 불확실성(not\_enough\_information)으로 처리하며 추측하지 않는다.
* 출력은 다운스트림 자동화 및 평가를 위해 고정된 열거형(enum)을 사용한다.
* 챗봇과 이미지 텍스트 모두에서 발생하는 프롬프트 인젝션(prompt injection)을 보안 우려 사항으로 고려한다.
* 구조화된 출력 필드: 각 청구 건에 대해 evidence_standard_met, claim_status, issue_type / object_part, risk_flags, supporting_image_ids, severity 등의 필드를 CSV 형식으로 출력한다.
* 아키텍처: 단일 패스(single-pass) 방식보다 멀티스테이지(multi-stage) 오케스트레이션 파이프라인이 더 효과적이며, 사용자 청구 텍스트 추출, 각 이미지별 분석(Visual-Language Model - VLM 활용), 최종 결정 종합 및 구조화된 출력 생성 단계를 거친다.
시사점
이 시스템은 복잡하고 다양한 형태의 증거를 다루는 보험금 청구 검토 프로세스를 자동화하고, AI 기반 결정의 신뢰성과 설명 가능성을 높여 운영 효율성을 증대하고 잠재적인 위험을 완화하는 데 기여할 수 있다.
댓글
GitHub Discussions