OpenAI Jalapeño: Better than Nvidia Blackwell

개요

OpenAI는 LLM 추론을 위해 설계된 자체 개발 칩 "Jalapeño"를 발표했으며, 이는 다양한 벤치마크에서 Nvidia의 Blackwell 및 기타 경쟁 칩을 능가하는 성능을 보여준다.

주요 내용

* Jalapeño 칩 개발: OpenAI는 2024년 중반부터 약 16개월 만에 LLM 추론 전용 ASIC 칩인 Jalapeño를 개발했으며, 이는 이례적으로 빠른 개발 주기다.
* 일반화된 추론 칩: Jalapeño는 특정 OpenAI 모델에 특화된 것이 아니라, 다양한 종류의 LLM 모델 및 워크로드를 실행할 수 있는 일반화된 추론 칩이다.
* 우수한 성능: Jalapeño는 특히 성능/와트(perf/W) 측면에서 Nvidia Blackwell 칩을 포함한 다른 모든 경쟁 칩을 능가하며, 저지연 및 고처리량 시나리오 모두에서 뛰어나다. 단일 토큰 예측(STP) 기준으로는 경쟁사들을 압도한다.
* HBM4 탑재: Jalapeño는 HBM4 메모리를 사용하여 Nvidia 및 AMD의 플래그십 GPU와 유사한 수준의 메모리 대역폭을 제공한다.
* 하드웨어-소프트웨어 코드자인: OpenAI는 극단적인 하드웨어-소프트웨어 코드자인을 통해 Jalapeño의 성능을 극대화했으며, 특히 메모리 이동 최소화 및 고정 지연 제거에 집중했다.
* 프로그래밍 모델: OpenAI는 Triton 위에 구축된 커널 프로그래밍 언어인 Gluon을 사용하여 Jalapeño를 프로그래밍하며, 이는 TensorInfo와 Linear Layouts와 같은 추상화를 통해 하드웨어의 잠재력을 최대한 활용한다.
* AI 지원 칩 설계: AI의 도움으로 칩 설계 과정에서 SIMD 영역 8% 감소, 매트릭스 엔진 영역 10% 감소 등 효율성 향상을 달성했다.
* 확장성: Jalapeño는 최대 2,048개의 XPU를 단일 확장 네트워크 내에서 연결할 수 있으며, 이는 16개의 랙으로 구성된다.
* 진행 중인 개발: 현재 A0 스텝핑의 Jalapeño로 결과를 얻었으며, B0 스텝핑에서는 약 25%의 성능 개선이 예상된다.
* 경쟁사 비교: Nvidia의 Vera Rubin 칩과 비교 시, Jalapeño는 HBM4를 조기에 채택하고 개발 속도 면에서 앞서 나가고 있으며, 성능/TCO 측면에서도 경쟁력 있는 결과를 보인다.

시사점

Jalapeño의 성공은 AI 모델이 칩 설계를 가속화하고, 하드웨어-소프트웨어 코드자인 및 범용성을 갖춘 칩이 LLM 추론 시장에서 강력한 경쟁력을 가질 수 있음을 시사한다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions