304B 매개변수의 DeepSeek-V4-Flash-0731을 추가 가중치 양자화나 오프로딩 없이 단일 AMD MI300X에서 프로덕션 운영하기 위한 구성과 패치를 제공함 MI300X의 192GB HBM3에 156.67GiB 가중치와 20GB GPU KV 캐시를 배치하고, 퇴거된 프리픽스 캐시는 96GiB CPU 계층에 저장함 고정된 vLLM ROCm·AITER 스택에서 단일 스트림 디코드 중앙값 168.6 tok/s, 8개 스트림 합계 542 tok/s, 64개 버스트 합계 830 tok/s를 기록했으며 256K 컨텍스트를 검증함 MI300X의 FNUZ FP8 형식, 고동시성 MoE 라우팅, 인과적 추측 검증, CPU-KV 동기화, 누락된 gfx942 커널 튜닝을 읽기 전용 오버레이와 AITER 튜닝 테이블로 보완함 성능 수치는 고정된 이미지와 프롬프트에 대한 검증 기준이며, HBM 사용량이 205.8GB 중 약 204.5GB에 달하므로 KV 풀 확대보다 메모리 여유·콜드 및 캐시 경로의 정확성 검증이 중요함 단일 MI300X 배포 구성 DeepSeek-V4-Flash-0731을 AMD MI300X 한 장에서 실행하는 Docker Compose 스택, SHA-256 고정 오버레이, 업스트림 대비 diff, 커널 튜닝 테이블을 제공함 체크포인트는 배포된 그대로 실행하며 추가 가중치 양자화나 오프로딩을 사용하지 않음 고정된 런타임은 vLLM ROCm nightly 0.26.1rc1.dev229+g124154a88.rocm723과 AITER 0.1.19임 공식 vLLM 레시피는 NVIDIA와 MI325X·MI355X를 다루지만, 이 구성은 0731 체크포인트를 단일 MI300X에서 프로덕션 운영하는 데 필요한 수정 사항을 묶음 MI300X를 선택한 이유 AMD Instinct MI300X는 192GB HBM3와 5.3TB/s 메모리 대역폭을 제공하며, H100 SXM5보다 HBM 용량이 2.4배 큼 304B 매개변수 체크포인트 전체가 HBM에 들어가므로 PCIe 가중치 스트리밍이나 계층 오프로딩이 필요 없음 남은 공간에는 20GB GPU KV 풀을 두며, 퇴거된 프리픽스 캐시 항목은 96GiB CPU 계층에 저장함 한 장의 카드로 일반적인 동시 스트림 2~8개와 최대 64개 스트림의 버스트를 처리함 MI300X의 CDNA3는 AMD/Graphcore의 E4M3 FNUZ 변형을 사용하지만 MI325X 이후 제품은 O...
단일 AMD MI300X에서 DeepSeek V4 Flash 실행하기
2 weeks ago
18
Related
SSL에 대해 배운 모든 것이 더는 유효하지 않음 [유튜브]
5 hours ago
2
YC CEO Garry Tan이 말하는 창업자의 새로운 규칙 [유튜브]
5 hours ago
1
Computer Use와 Skills/Files API로 프로덕션 에이전트 구축하기
5 hours ago
1
Rust nightly, 차세대 트레이트 솔버 기본 활성화
6 hours ago
1
KDE에 Btrfs 스냅샷을 통합하는 KIO Snapshot
6 hours ago
1
더 나은 배터리
6 hours ago
1
Rust 1.98.0 발표
6 hours ago
1
Tips
click
Popular
마키나락스, 중견 제조사 현장에 AI 네이티브 팩토리 구축한다
4 weeks ago
64
제니, 빌보드 라디오 차트 1위…'골든' 이어 두 번째
3 weeks ago
62
라온시큐어 화이트해커 23명, 국제 해킹 대회 '데프콘 CTF 2026' 본선행
3 weeks ago
56
'산골총각 영웅' 차승원·김도훈 합류…임영웅과 찰떡+힐링 케미
3 weeks ago
46
© Clint IT 2026. All rights are reserved

![[테크 차이나] DeepSeek V4 Flash 1위… 중국 모델 강세 지속(OpenRouter 주간 AI 모델 사용량 순위)](https://img.etnews.com/news/article/2026/08/06/news-p.v1.20260806.379c2eee15bb4be5b29d934a203a6106_Z1.jpg)








English (US) ·