Mistral OCR 4

개요

Mistral OCR 4는 텍스트 추출뿐만 아니라 바운딩 박스, 블록 분류, 인라인 신뢰도 점수 등을 포함한 구조화된 문서를 생성하는 OCR 모델입니다.

주요 내용

* 성능 향상: 독립적인 평가에서 선도적인 OCR 및 문서 AI 시스템 대비 평균 72%의 우위점을 보였으며, OlmOCRBench에서 85.20%의 최고 점수를 기록했습니다.
* 구조화된 출력: 추출된 텍스트와 함께 텍스트의 위치를 나타내는 바운딩 박스, 제목, 표, 수식, 서명 등 블록 유형 분류, 페이지별 및 단어별 인라인 신뢰도 점수를 제공합니다.
* Mistral Search Toolkit 통합: RAG 및 엔터프라이즈 검색을 위한 Mistral의 오픈소스 검색 프레임워크인 Search Toolkit의 컴포넌트로, 구조화된 출력을 통해 인용 가능한 입력 데이터를 제공합니다.
* 다국어 지원: 10개 언어 그룹에 걸쳐 170개 언어를 지원하며, 특히 전문 및 저자원 언어에서 경쟁 시스템 대비 성능 저하가 적습니다.
* 자체 호스팅 가능: 단일 컨테이너에 배포될 만큼 컴팩트하여 데이터 상주, 주권, 규정 준수 요구사항을 충족시키며, 완전한 자체 호스팅 배포가 가능합니다.
* 지원 문서 형식: PDF, DOC, PPT, OpenDocument 등 일반적인 엔터프라이즈 형식을 지원합니다.
* API vs. Document AI: OCR 4 API는 순수 텍스트 추출 및 구조화된 정보(바운딩 박스, 블록 타입, 신뢰도 점수)를 제공하며, Document AI는 지정된 JSON 스키마에 맞춰 출력 형식을 재구성하거나, 이미지 주석, 사용자 정의 프롬프트 적용 등 추가 기능을 제공합니다.
* 가격: OCR 4 API는 1,000 페이지당 4달러이며, 배치 API는 50% 할인된 2달러입니다. Document AI는 1,000 페이지당 5달러입니다.
* 적용 사례: 문서 파싱 및 추출, RAG를 위한 구조화된 콘텐츠 생성, 에이전트 워크플로우 지원(양식 작성, 송장 처리 등), 신뢰도 점수를 활용한 휴먼 검증, 엔터프라이즈 검색 및 지식 베이스 구축 등에 활용될 수 있습니다.
* 지원되지 않는 사용 사례: 의료 진단, 법률 자문, 고위험 금융 결정, 안전이 중요한 시스템, 실시간/지연에 민감한 처리, 비문서 입력 등에는 적합하지 않습니다.

시사점

Mistral OCR 4는 문서 이해 및 처리에 있어 텍스트 추출을 넘어 구조화된 정보를 제공하며, 다양한 다운스트림 워크플로우에서 성능, 효율성, 다국어 지원, 데이터 프라이버시 측면에서 상당한 이점을 제공합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions