Mesh LLM: distributed AI computing on iroh

개요

Mesh LLM은 기존의 GPU 및 메모리 자원을 활용하여 분산형 AI 컴퓨팅을 가능하게 하는 새로운 시스템으로, OpenAI와 호환되는 API를 제공합니다.

주요 내용

* 기존 AI 컴퓨팅의 한계: 데이터센터의 GPU, 종량제 API, 중앙화된 서비스는 모델 변경, 데이터 위치, 하드웨어 제어에 대한 사용자의 통제력을 제한하고 비용 증가의 부담을 안겨줍니다.
* Mesh LLM의 분산형 접근 방식: 사용자가 보유한 여러 기기의 GPU와 메모리를 하나의 풀로 묶어, 마치 단일 시스템처럼 OpenAI 호환 API를 통해 접근할 수 있게 합니다.
* 다양한 실행 모드:
* 로컬 실행: 현재 사용 중인 기기의 GPU를 사용하여 모델을 실행합니다.
* 피어 라우팅: 모델이 로드된 다른 피어(동료)에게 요청을 라우팅합니다.
* 모델 분할 (Skippy): 단일 기기에서 처리하기 어려운 대형 모델을 여러 기기에 걸쳐 분할하여 파이프라인 형태로 실행합니다.
* iroh 기반의 P2P 네트워킹: iroh는 인증된 NAT 통과 QUIC 연결을 제공하여 중앙 서버 없이 기기 간 직접 통신을 지원하며, Mesh LLM은 이를 통해 모델 추론, 피어 관리, 플러그인 통신 등을 수행합니다.
* 플러그인 아키텍처: 플러그인을 통해 새로운 모델이나 기능을 선언하고, 런타임이 이를 시작하고 관리하며 MCP, HTTP, 추론, 메시 이벤트를 통해 노출합니다.
* 다양한 모델 지원: 5억 파라미터 모델부터 235B MoE 모델까지 40개 이상의 모델을 카탈로그로 제공합니다.
* 쉬운 시작 및 확장성: 18MB의 경량 소프트웨어를 설치하여 공개 메시에 참여하거나 비공개 배포를 구성할 수 있으며, 필요에 따라 노드를 추가하여 컴퓨팅 자원을 확장할 수 있습니다.
* OpenAI 클라이언트 호환성: http://localhost:9337/v1로 설정하면 표준 OpenAI 클라이언트가 Mesh LLM의 분산된 백엔드와 상호 작용할 수 있습니다.
* 미래 계획: Swift SDK를 활용한 모바일 앱 개발 및 ACP(Agent Communication Protocol) 표준 지원을 통해 다양한 클라이언트의 메시 참여를 지원할 예정입니다.

시사점

Mesh LLM은 기존의 중앙 집중식 AI 서비스에 대한 대안으로, 사용자에게 더 많은 통제권, 유연성, 비용 효율성을 제공하며 분산형 AI 컴퓨팅 생태계를 구축하는 데 기여합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions