Kog is going deeper to squeeze more inference out of GPUs

개요

프랑스 스타트업 Kog는 기존 데이터센터 GPU에서 AI 추론 속도를 획기적으로 향상시키는 소프트웨어 최적화 기술을 개발하고 있다.

주요 내용

* 목표: 기존 GPU 하드웨어에서 LLM 추론 속도를 극대화하여 AI 워크플로우의 병목 현상을 해결한다.
* 기술: Kog Inference Engine(KIE)은 GPU의 메모리 대역폭을 활용하는 심층적인 GPU 엔지니어링 연구 및 저수준 최적화를 통해 이를 달성한다.
* 데모 결과: 20억 개의 매개변수를 가진 Laneformer 2B 모델에 대해 초당 3,000 토큰(TPS)의 추론 속도를 시연했다.
* 주요 타겟 고객: AI 워크플로우에 의존하는 전문가, 게임 및 앱 개발자 등 지연 시간으로 인해 불편을 겪는 사용자.
* 시장 반응: 200건 이상의 구체적인 비즈니스 문의를 받았으며, 초기 피드백으로는 소프트웨어 엔지니어링이 가장 유망한 사용 사례로 예상된다.
* 개발 전략: 현재 대규모 모델의 개발 가속에 집중하고 있으며, 장기적으로는 에이전트 기반 파이프라인을 통해 더 많은 칩과 모델을 지원할 계획이다.
* 설립자의 배경: 물리학 및 오펜시브 사이버 보안(화이트 해커) 배경을 바탕으로 GPU의 작동 원리를 깊이 이해하고 최적화하는 데 접근 방식을 적용한다.
* 경쟁사 및 차별점: ZML과 같이 CUDA를 우회하는 하드웨어 불가지론적 소프트웨어가 있지만, Kog는 스탠포드 Hazy Research와 같이 GPU 가속에 더 깊이 초점을 맞춘다.
* 향후 계획: 9월까지 주요 모델에서 10배 속도 향상을 구현하고, 이를 바탕으로 고객 확보 및 시리즈 A 펀딩을 진행할 예정이다.

시사점

Kog의 기술은 기존 GPU의 잠재력을 최대한 활용하여 AI 추론 비용과 속도 문제를 해결할 수 있는 가능성을 제시하며, 이는 AI 기반 서비스의 접근성을 높이고 새로운 응용 분야를 창출하는 데 기여할 수 있다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions