OCR It – pull text out of un-copyable documents for your LLM

개요

OCR It은 사용자가 복사할 수 없는 문서에서 텍스트를 추출하여 LLM(거대 언어 모델)에 활용할 수 있도록 돕는 Chrome 확장 프로그램입니다.

주요 내용

  • 기능: 사용자는 문서의 특정 영역을 한 번만 선택하면, 해당 영역을 포함하는 모든 페이지의 스크린샷을 찍고 OCR(광학 문자 인식)을 통해 텍스트를 추출하여 하나의 텍스트 파일로 저장합니다.
  • 자동화: 핫키를 반복적으로 누르거나, 자동 실행 기능을 활성화하여 페이지 넘김과 텍스트 추출을 자동으로 수행할 수 있습니다.
  • 로컬 처리: Tesseract OCR 엔진을 내장하여 모든 처리를 로컬에서 수행하므로 API 키가 필요 없으며, 이미지 데이터가 외부로 전송되지 않아 개인 정보 보호에 강점이 있습니다.
  • 설치 및 사용: Git clone 또는 다운로드 후 chrome://extensions에서 개발자 모드를 켜고 확장 프로그램을 로드합니다. 핫키 설정은 chrome://extensions/shortcuts에서 확인할 수 있습니다.
  • 페이지 넘김: PDF 뷰어, 슬라이드 쇼 등 다양한 문서 뷰어에서 다음 페이지로 넘어가는 방식(클릭, 키 입력 등)을 학습하여 자동 페이지 넘김 기능을 지원합니다. 이는 CSS 선택자가 아닌 화면상의 특정 지점을 저장하는 방식을 사용하여 iframe이나 Shadow DOM 환경에서도 작동합니다.
  • PDF 뷰어 지원: Chrome 내장 PDF 뷰어에서도 작동하지만, 자동 페이지 넘김 기능은 제한적이며 사용자가 직접 페이지 넘김 키를 눌러야 합니다. 로컬 PDF 파일 사용 시 '파일 URL에 대한 액세스 허용' 설정을 해야 합니다.
  • 언어 지원 및 확장: 기본적으로 영어, 포르투갈어, 스페인어를 지원하며, Tesseract의 다른 언어 모델을 추가하여 사용할 수 있습니다. 두 가지 언어를 동시에 사용하여 복합 언어 문서도 처리 가능합니다.
  • 내부 작동 방식: MV3 서비스 워커를 기반으로 하며, OCR 작업의 대부분은 오프스크린 문서에서 처리됩니다. 캡처, 크롭, 업스케일, OCR, 페이지 넘김 등이 순차적으로 이루어집니다.
  • 테스트: 확장 프로그램은 통합 테스트 환경에서 실제 문서와 유사한 환경을 구축하여 영역 선택, 캡처, OCR 정확도, 자동 페이지 넘김 기능 등을 검증합니다.
  • 제한 사항: chrome:// 페이지, 웹 스토어 등 특정 페이지에서는 작동하지 않으며, 화면에 보이는 영역만 캡처할 수 있습니다. OCR 정확도는 원본 문서의 품질에 따라 달라집니다.

시사점

OCR It은 복사 불가능한 문서에서 텍스트 데이터를 효율적으로 추출하여 LLM 기반의 문서 분석, 요약, 질의응답 등 다양한 응용 분야에 실질적인 도움을 줄 수 있는 강력한 도구입니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions