Missed calls, missed revenue: the local-first phone assistant I'm building

개요

개발자는 소규모 컨설팅 사업 운영 시 발생하는 여러 채널의 커뮤니케이션 누락으로 인한 사업 기회 손실 문제를 해결하기 위해, 로컬 환경에서 실행되는 AI 기반의 전화 어시스턴트를 구축하고 있습니다.

주요 내용

  • 사업 문제 정의: 개발자는 개인 컨설팅 사업을 운영하며 전화, 메시지 앱, 이메일 등 여러 채널로 들어오는 고객 커뮤니케이션을 통합 관리하는 데 어려움을 겪고 있습니다. 특히, 전화 통화 및 음성 메일의 후속 조치가 늦어져 놓치는 기회가 많으며, 이는 소규모 비즈니스에서 40-60%에 달하는 콜 손실률로 나타날 수 있습니다. 기존 솔루션들은 개별 채널만 처리하며, 통합적인 관리 및 보고 기능을 제공하지 못합니다.
  • 구축 목표: 개발자가 구축하려는 시스템은 하루 동안 누가 연락했는지, 무엇을 원했는지, 아직 처리되지 않은 사항은 무엇인지, 그리고 예상되는 후속 조치를 요약하여 제공하는 일일 보고서 생성입니다.
  • 기반 인프라: Whisper 모델을 이용한 로컬 음성-텍스트 변환(STT), bge-m3를 이용한 임베딩(semantic search), Gemma를 이용한 이미지 및 스크린샷 처리(VLM) 등 세 가지 AI 모델을 단일 서버에서 순차적으로 실행하며, 모든 오디오, 문서, 이미지는 외부 API 호출 없이 로컬에 유지됩니다.
  • 출력 형식 설계: 보고서의 실질적인 가치를 위해 단순한 녹취록 나열이 아닌, '놓친 연락', '약속 사항', '일정 후보', '미해결 질문' 등 구체적인 항목을 명확한 조건으로 정의했습니다. 예를 들어, "48시간 내 응답이 없는 연락"과 같이 구현 가능한 조건으로 설정했습니다.
  • 엔티티 해상도(Entity Resolution): 서로 다른 채널(전화, 이메일)에서 온 같은 사람의 연락을 통합하기 위한 엔티티 해상도 문제를 해결하는 중입니다. 전화번호나 이메일 주소를 기반으로 개인을 식별하며, 전화번호 형식 정규화, 이메일 별칭 고려, 이름 변형 처리를 통한 매칭 방식을 고려하고 있습니다. (현재 설계 단계)
  • 현재 진행 상황: 로컬 STT, 임베딩, VLM은 개별적으로 작동 중이며, 오디오, 문서, 이미지는 로컬에 유지됩니다. 통화 녹취, 이메일, 메시지 내용을 취합하여 일일 보고서를 생성하는 파이프라인 구축이 진행 중이며, 출력 형식과 엔티티 해상도 접근 방식이 설계되었습니다. 아직 엔드-투-엔드 통합은 완료되지 않았습니다.

시사점

이 프로젝트는 개별 AI 모델의 로컬 실행 능력과 통합적인 커뮤니케이션 관리의 간극을 메우는 실질적인 해결책을 제시하며, 소상공인이나 개인 사업자가 놓칠 수 있는 업무 기회를 줄이고 효율성을 높일 수 있는 방안을 모색하고 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions