AI 칩 아키텍처

3 hours ago 1

단일 스레드 CPU 성능 증가율이 1980년대 연 52%에서 2018년 3%로 낮아지면서, AI 연산은 도메인 특화 아키텍처 경쟁의 중심이 됨. NVIDIA GPU부터 TPU, AMD Instinct, Cerebras WSE, Trainium, Groq LPU까지 서로 다른 데이터 이동 방식을 택함 Transformer의 학습·prefill은 연산 집약적인 GEMM, decode는 모든 가중치와 KV Cache를 반복해서 읽는 대역폭 집약적인 GEMV가 중심이어서, 칩 경쟁력은 행렬곱 성능뿐 아니라 메모리 배치와 데이터 이동에서 갈림 NVIDIA는 CUDA의 프로그래밍 가능성과 동적 지연 은폐, Google TPU와 AWS Trainium은 컴파일러 스케줄링과 systolic array, Cerebras와 Groq는 대용량 온칩 SRAM과 각각 dataflow·결정론적 실행을 선택함 칩당 FP8 성능은 B200 4.5PF, TPU Ironwood 4.6PF, MI355X 10PF로 약 2배 범위에 모였지만, 시스템은 NVIDIA NVL72의 일관된 랙, TPU의 9,000칩급 광학 torus, AMD Helios와 UALink, Trainium NeuronSwitch처럼 크게 달라짐 최적 플랫폼은 하나로 수렴하지 않으며, 학습·prefill·decode, 모델 크기와 배치, 동적 연산, 통신 패턴, 소프트웨어 생태계, 비용과 지연 시간 중 무엇을 우선하느냐에 따라 달라짐 AI 연산을 가르는 병목 2018년 John Hennessy와 David Patterson은 Turing Lecture 「A New Golden Age for Computer Architecture」에서 Moore’s Law와 Dennard Scaling의 둔화에 대응할 도메인 특화 아키텍처(DSA) 가 필요하다고 봄 Google TPU v1은 프로덕션 신경망 추론에서 CPU 대비 처리량 29배, 에너지 효율 80배를 달성함 이후 GPU, TPU, LPU, NPU, DPU, ASIC, wafer-scale engine, 재구성 dataflow, neuromorphic, photonic, analog 등 수십 가지 접근법이 등장함 Transformer는 Q/K/V projection, attention, output projection, FFN의 행렬곱 사이에 normalization, activation, residual add를 배치하며, 프...

Read Entire Article