Speech Recognition and TTS in less than 500kb

개요

Moonshine Micro는 마이크로컨트롤러와 같은 임베디드 시스템을 위해 설계된 오픈 소스 AI 툴킷으로, 470KB의 RAM으로 음성 인식, 명령 인식, 신경망 음성 합성 기능을 제공합니다.

주요 내용

  • Moonshine Micro: 임베디드 시스템용으로 특화된 Moonshine Voice의 버전으로, Raspberry Pi RP2350과 같은 저가형 마이크로컨트롤러에서 실시간 음성 에이전트 및 애플리케이션 개발을 지원합니다.
  • 자원 제약 시스템 최적화: 음성 활동 감지(VAD), 음성 텍스트 변환(STT), 신경망 음성 합성(TTS) 기능이 각각 Flash 3.6MB, SRAM 468KB 내에서 작동하도록 설계되었습니다.
  • 핵심 구성 요소 및 요구 사항:
  • VAD: 약 89 KiB Flash, 36 KiB SRAM, 0.8 MMAC/frame의 연산량
  • STT (SpellingCNN): 약 1.3 MiB Flash, 346 KiB SRAM, 36 MMAC/s의 연산량
  • TTS (neural diphone synth @ 16 kHz): 약 1.8 MiB Flash (voice pack), 340 KiB SRAM, 65 MMAC/s의 연산량
  • 총계: 약 3.6 MiB Flash, 468 KiB SRAM (VAD, STT, TTS가 384 KiB TFLM arena를 공유)
  • TensorFlow Lite Micro 활용: VAD, STT, TTS 라이브러리는 신경망 연산을 위해 TensorFlow Lite Micro 라이브러리를 사용하며, 각 구성 요소는 독립적으로 활용 가능합니다.
  • MIT 라이선스: 상업적 애플리케이션에 적합한 MIT 라이선스로 코드 전체가 공개되었습니다.
  • 종단 간 예제: RP2350 MCU에서 음성을 이용한 Wi-Fi 연결 설정 예제가 제공됩니다.

시사점

Moonshine Micro는 저렴하고 자원이 제한적인 임베디드 시스템에서도 고품질 음성 인터페이스 구현을 가능하게 함으로써, IoT 기기 및 웨어러블 장치 등 다양한 분야에서 음성 제어 기능의 폭넓은 적용을 촉진할 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions