Show HN: Needle2: 14MB agentic LLM for phones, wearables, smart home and robots

개요

Needle 2는 휴대폰, 웨어러블 기기, 스마트 홈, 로봇 등 저사양 하드웨어에서도 동작할 수 있도록 설계된 14MB 크기의 오픈 소스 Agentic LLM입니다.

주요 내용

  • 소형화 및 효율성: 4500만 개의 파라미터를 가진 Needle 2는 14MB의 단일 바이너리 파일로 구성되며, 28MB의 RAM으로 전체 세션을 실행할 수 있습니다. 이는 CQ2-bit 압축과 자체 엔진 설계를 통해 달성되었습니다.
  • 성능: Raspberry Pi 5에서 초당 500 토큰의 디코드 속도를, Meta Quest 3S 및 Apple Vision Pro와 같은 VR 기기에서 초당 400-1500 토큰, 삼성 A 시리즈와 같은 200달러 미만 스마트폰에서 초당 300-700 토큰의 속도를 제공합니다.
  • 저사양 기기 지원: GPU나 NPU 없이도 작동하며, ESP32-S3와 같은 최신 마이크로컨트롤러에서도 실행 가능합니다.
  • 기능: 도구 호출(tool calling), 기기 제어, 구조화된 데이터 추출에 특화되어 있습니다. 복잡한 문장을 기기 또는 서비스가 제공하는 함수(function)와 매핑하는 데 중점을 둡니다.
  • 엣지-클라우드 협업: 자체적인 신뢰도 점수를 제공하여, 임계값 이하의 요청은 재질문하거나 클라우드로 에스컬레이션할 수 있습니다.
  • 손실 없는 2비트 양자화 (Lossless 2bit Quantization): 학습 단계부터 Cactus Quants를 적용하여 양자화로 인한 성능 저하를 최소화했습니다.
  • 코디자인 모델 및 추론 엔진: 하드웨어 성능을 최적화하기 위해 모델 아키텍처와 추론 엔진이 함께 설계되었으며, CPU를 자동으로 감지하여 최적의 커널을 선택하는 단일 C++ 바이너리로 제공됩니다.
  • 생산 준비 완료: Pebble과 같은 기업에서 이미 로컬에서 네트워크 연결 없이 음성 명령을 실행하는 데 사용하고 있습니다.
  • 평가: Google Mobile Actions, DroidCall, Seal-Tools, BFCL v4 등 다양한 함수 호출 벤치마크에서 다른 소형 모델들과 비교했을 때, 작은 크기 대비 경쟁력 있는 성능을 보여줍니다. 특히, 스마트 홈, 모바일, 웨어러블 등 소비자 기기 관련 작업 및 구조화된 추출에서 강점을 보입니다.

시사점

Needle 2는 저비용, 저전력 하드웨어에서도 강력한 온디바이스 AI를 구현할 수 있는 가능성을 제시하며, 개인 정보 보호와 오프라인 기능을 중요시하는 다양한 엣지 디바이스 애플리케이션에 적용될 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions