[현장] "에이전트 AI 시대, 메모리가 성능 가른다"…SK하이닉스 '3D 적층' 해법 제시

1 hour ago 1

주영표 부사장, '델 테크놀로지스 포럼'서 메모리 기술 발전 방향 소개 "AI 시스템 성능, 메모리 대역폭이 좌우⋯'HBM·3D 통합' 강조" [아이뉴스24 최효경 기자] 주영표 SK하이닉스 시스템아키텍처 담당 부사장은 25일"에이전트 AI 시대의 폭증하는 데이터를 처리하기 위해서는 기존 고대역폭메모리(HBM) 고도화를 넘어, 메모리를 GPU 위에 쌓는 '3D 적층' 기술이 필요하다"고 말했다.주 부사장은 이날 서울 강남구 코엑스에서 열린 '델 테크놀로지스 포럼 2026' 기조연설에서 '보이지 않는 엔진: AI 시대를 완성하는 기술'을 주제로 발표하며 차세대 메모리 기술의 발전 방향을 이같이 밝혔다.주영표 SK하이닉스 시스템아키텍처 담당 부사장이 25일 열린 '델 테크놀로지스 포럼 2026'에서 기조연설을 하고 있다. [사진=최효경 기자] "에이전트 AI 시대, 반복 추론으로 데이터 처리량 급증" 대규모언어모델(LLM)도 가중치를 저장하고 불러오는 데 막대한 메모리를 사용한다. 하지만 에이전트 AI는 여러 AI 에이전트가 역할을 나눠 반복적으로 추론하고 정보를 주고받기 때문에 메모리가 처리해야 할 데이터가 더욱 빠르게 늘어난다. 주 부사장이 기존 HBM의 성능을 계속 높이는 방식만으로는 향후 수요를 따라잡기 어렵다고 본 이유다.주 부사장은 GPT-4급 전문가혼합(MoE) 모델 가정 사례를 소개했다. 이 모델은 가중치를 저장하는 데만 3.5테라바이트(TB)의 메모리가 필요하다. 초당 20개의 토큰을 생성하려면 메모리에서 초당 4.4TB의 데이터를 읽어야 한다.주 부사장은 "에이전트 AI 시대에는 필요한 메모리 성능이 한층 높아진다"고 말했다. AI가 여러 차례 추론을 반복하면 앞선 대화를 기억하기 위한 컨텍스트와 KV캐시 등 메모리에 저장하고 다시 불러와야 할 데이터가 계속 늘어난다. 여러 AI 에이전트가 역할을 나눠 코드를 생성하고 컴파일과 검증을 반복하는 코딩 에이전트의 경우 초당 수백 개에서 수천 개 수준의 토큰 처리가 요구될 수 있다는 설명이다.주 부사장은 "AI 시스템에서는 메모리가 얼마나 많은 대역폭을 공급하는지가 전체 시스템의 성능을 결정한다"고 말했다. GPU의 연산 성능만 높여서는 전체 AI 시스템의 성능을 같은 비율로 끌어올리기 어렵다는 의미다. 디코드와 어텐션 등 AI의 주요 연산은 메모리에서 데이터를 얼마나 빠르게 가져오는 지에 따라 처리 속도가 제한되기 때문이다.SK하이닉스는 HBM1부터 ...

Read Entire Article