Windows에서 AMD GPU로 CUDA 실행하기

3 weeks ago 16

ZLUDA + AMD HIP/ROCm을 이용해 CUDA 대상 Windows 애플리케이션을 AMD GPU에서 실행하는 재현 가능한 호환성 환경으로, CUDA 지원 LibTorch 워크로드도 대상으로 함 현재 검증된 하드웨어는 Radeon RX 9060 XT(gfx1200)뿐이며, 다른 AMD GPU는 지원이 보장되지 않는 미검증 후보임 공식 배포 구성만으로 파라미터 2,216,347개인 PPO 네트워크의 추론, 학습, 옵티마이저 작업을 완료했으며, 검증 실행 한 회에서 65,536 타임스텝을 처리함 nvcuda, cuBLAS, cuBLASLt, cuSPARSE, cuFFT는 검사를 통과했지만, 검증된 안정판 HIP SDK 경로에서는 cuDNN을 사용할 수 없어 모든 CUDA 프로그램이나 AI 모델의 실행을 보장하지 않음 동일 PPO 워크로드의 통제된 비교에서 공식 업스트림 구성은 전체 처리량 중앙값 13,278스텝/초를 기록했으며, 약 3.03% 느린 과거 커스텀 오버레이 대신 기본 구성으로 유지됨 호환성 구조와 검증 범위 CUDA for AMD on Windows는 CUDA 대상 Windows 연산 애플리케이션을 위한 재현 가능한 환경이며, CUDA 지원 LibTorch를 사용하는 워크로드도 포함함 실행 경로는 ZLUDA가 CUDA 대상 애플리케이션과 AMD GPU 사이의 호환 계층을 담당하는 구조임 CUDA 애플리케이션 → ZLUDA → cuBLAS/cuSPARSE/cuFFT 호환 계층 → rocBLAS/hipBLASLt/rocSPARSE/HIP → AMD GPU로 이어짐 현재 검증 기준 장치는 Radeon RX 9060 XT, 아키텍처는 gfx1200/RDNA4임 스캐너가 다른 Windows HIP 아키텍처 계열을 인식해도 미검증 후보로 분류하며, 장치 감지가 워크로드 실행을 입증하지는 않음 AMD의 Windows 하드웨어 범위는 공식 시스템 요구사항에서 확인할 수 있음 공식 배포 구성으로 완료한 학습 검증 비공개 DLL이나 복구한 DLL 없이 공식 업스트림 배포물만으로 검증했으며, 기준 버전은 다음과 같음 ZLUDA v6-preview.69 AMD HIP SDK 6.4 LibTorch 2.3.0 + cu118 실제 파라미터 2,216,347개인 PPO 네트워크가 CUDA 장치로 노출되는 환경에서 순전파/추론, PPO 학습, 옵티마이저 작업을 완료함 저장소가 생성한 런타임으로 검증 반복 한 회에서 65,53...

Read Entire Article