AI Chip Architectures

개요

AI 컴퓨팅은 주로 행렬 곱셈 연산에 집중되며, 이를 효율적으로 처리하기 위해 다양한 AI 칩 아키텍처가 개발되고 있다. NVIDIA GPU, Google TPU, Cerebras Wafer-Scale Engine, Groq LPU 등이 대표적이며, 각각 고유한 철학, 확장 방식, 소프트웨어 스택을 가진다.

주요 내용

* AI 컴퓨팅의 핵심: 행렬 곱셈: 트랜스포머 모델은 행렬 곱셈(matmul)의 연속으로 구성되며, 학습 및 추론 과정에서 대규모 곱셈-누적(MAC) 연산이 요구된다.
* 워크로드에 따른 matmul 형태 변화:
* 학습 및 Prefill: 여러 토큰을 동일한 가중치 행렬에 대해 처리하는 대규모 행렬-행렬 곱셈(GEMM)으로, 연산 집약도가 높다.
* Decode: 한 번에 하나의 토큰만 처리하는 행렬-벡터 곱셈(GEMV)으로, 연산 집약도가 낮아지지만 KV 캐시 접근으로 인한 대역폭 병목 현상이 발생할 수 있다.
* 메모리 병목 현상 (Memory Wall): 컴퓨팅 성능은 기하급수적으로 증가했지만 메모리 대역폭은 이를 따라가지 못해, 데이터를 컴퓨팅 유닛으로 빠르게 이동시키는 것이 중요한 과제이다.
* NVIDIA GPU 아키텍처:
* 철학: 수천 개의 스레드를 호스트 CPU로 오케스트레이션하고 CUDA를 통해 노출되는 프로그래밍 가능한 칩으로, 병렬화 가능한 워크로드 실행에 최적화.
* 아키텍처: 수백 개 이상의 스트리밍 멀티프로세서(SM)와 이를 지원하는 심층 메모리 계층 구조. Tensor Core는 행렬 곱셈 연산을, CUDA Core는 행렬 곱셈 외의 연산을 처리.
* Tensor Core 발전: FP16, TF32, BF16, FP8, FP4 등 다양한 정밀도를 지원하며, Warp, Warp Group, CTA-pair 등으로 확장되어 비동기 실행 및 SM 간 협업을 통해 성능 향상.
* 메모리 계층: GPU 외 HBM, L2 캐시, SM 내 L1/SMEM, 레지스터 파일, TMEM(Blackwell) 등으로 구성되며, TMA(Tensor Memory Access)를 통해 데이터 이동이 점진적으로 디커플링.
* Warp Specialization: Hopper 시대부터 생산자(TMA 로드)와 소비자(wgmma 실행) 워프를 분리하고 mbarrier를 통해 동기화하여 효율성 극대화.
* 수치 연산: FP32에서 FP4/FP6까지 정밀도를 낮추고 Transformer Engine을 통해 동적 범위 및 정확도를 복구하며 성능 향상.
* 확장 (Scale-up & Scale-out):
* Scale-up: NVLink 및 NVSwitch를 통해 여러 GPU를 단일 메모리 도메인으로 통합.
* Scale-out: InfiniBand 및 이더넷을 통해 랙/클러스터 수준에서 GPU 도메인 연결.
* 소프트웨어: CUDA를 기반으로 cuBLAS, cuDNN, CUTLASS, TensorRT-LLM 등 다양한 라이브러리와 프레임워크 지원. 20년 간 축적된 서드파티 생태계와 개발자 경험이 강점.
* Google TPU 아키텍처:
* 철학: 프로그래밍 가능한 칩 대신 단일 기본 연산(대규모 서스톨릭 배열에서의 밀집 행렬 곱셈)에 집중하고 XLA 컴파일러가 모든 것을 계획.
* 아키텍처: 행렬 곱셈 엔진(MXU)을 중심으로 VPU(Element-wise), Scalar Unit, XLU, Transpose/Permute Unit 등으로 구성. SparseCore를 통해 임베딩 조회 워크로드 처리.
* Tensor Core (MXU): 서스톨릭 배열 기반으로, 가중치 고정(weight-stationary) 데이터 흐름을 사용하여 높은 데이터 재사용성 확보. XLA 컴파일러가 배열 크기에 맞춰 타일링, 패딩, 스케줄링.
* VPU: 2D 벡터 머신으로, MXU와 병렬로 실행되어 양자화, Layernorm, Softmax 등 다양한 연산을 처리.
* 확장: ICI 인터커넥트를 통해 수천 개의 칩을 묶어 팟(Pod) 단위로 확장.
* 소프트웨어: XLA 컴파일러가 모든 사이클과 메모리 접근을 사전 계획.
* 핵심 경쟁력:
* NVIDIA: 범용성, 프로그래밍 가능성, 오랜 기간 축적된 소프트웨어 생태계 및 개발자 커뮤니티.
* Google TPU: 특정 워크로드(AI 학습/추론)에 대한 압도적인 효율성과 전용 하드웨어 설계.

시사점

AI 칩 아키텍처 경쟁은 컴퓨팅 성능뿐만 아니라 데이터 이동 효율성, 정밀도 최적화, 그리고 소프트웨어 생태계의 중요성을 보여주며, 향후 AI 모델의 발전과 대규모 AI 시스템 구축에 핵심적인 역할을 할 것이다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions