OpenAI’s Jalapeño chip is built for fast inference at scale, benchmarks show

개요

OpenAI의 Jalapeño 칩은 대규모 AI 추론에 최적화되어 있으며, 현재 최첨단 추론 프로세서보다 더 높은 성능과 전력 효율성을 제공하는 벤치마크 결과를 발표했습니다.

주요 내용

  • Jalapeño는 SemiAnalysis의 InferenceX 벤치마크에서 사용자당 더 많은 토큰과 킬로와트당 더 높은 처리량을 기록했습니다.
  • 이는 현재 최첨단 Nvidia Blackwell 시스템과의 비교에서도 유의미한 성능 향상을 보여줍니다.
  • Jalapeño는 2026년 말 소량 배포를 시작으로 2027년에 본격적으로 출시될 예정입니다.
  • OpenAI는 Broadcom과의 협력을 통해 칩을 개발했으며, OpenAI 자체 모델도 개발 과정에 활용되었습니다.
  • Jalapeño는 AI 제품, 모델, 칩, 메모리를 통합적으로 개발하는 다세대 플랫폼으로 설계되었습니다.
  • 칩은 특히 추론 과정에서 병목 현상을 자주 유발하는 prefill 및 통신 단계의 지연을 최소화하도록 설계되었습니다.
  • KV 캐시를 포함한 모델 상태를 지역적으로 배치하고 유지하여 각 추론 단계에 맞는 컴퓨팅, 메모리, 네트워킹 조합을 활성화하는 방식으로 데이터 이동 및 통신 지연을 줄였습니다.

시사점

Jalapeño 칩은 AI 워크로드를 더 적은 전력으로 더 빠르게 처리할 수 있게 함으로써, 대규모 AI 서비스 제공의 효율성과 응답 속도를 크게 향상시킬 잠재력을 가지고 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions