Qwen 3.8 Flash Next(125B)를 소비자용 하드웨어(RTX 4090)에서 초당 100토큰으로 실행하기

7 hours ago 3

Strata는 1,250억 매개변수 모델 Qwen3.8-Flash-Next를 일반 PC에서 실행하는 무료 오픈소스 도구로, 대화, 코드 작성, 이미지 읽기와 코딩 에이전트 연동을 지원하며 데이터는 PC 밖으로 나가지 않음 GPU, RAM, CPU, SSD에 작업을 분산해 모델을 구동함. 자주 쓰는 전문가를 GPU에 두고 나머지는 CPU가 병렬 처리하며, 작은 보조 모델의 예측을 큰 모델이 검증해 같은 답을 1.6~1.8배 빠르게 생성함 README 실측에서 RTX 5070 12GB는 Q2_0 기준 답변 생성 94토큰/초, 32K 프롬프트 처리 2,650토큰/초를 기록했고, RX 9070 XT 16GB는 각각 60토큰/초와 1,160토큰/초를 기록함 기본 요구 사양은 VRAM 12GB 이상, RAM 32GB 이상이며, RAM 용량에 따라 모델 선택이 달라짐. 작은 양자화 모델은 더 빠르고, 큰 모델은 조금 더 높은 성능을 내지만 메모리 부족 시 SSD를 읽느라 느려짐 OpenAI 호환 API, Anthropic API, OpenAI Responses API로 앱과 코딩 도구에 연결할 수 있음. 기본값은 한 번에 요청 하나를 처리하며, 12GB GPU에서 동시 처리를 켜면 개별 답변 속도가 떨어짐 PC 전체에 분산하는 모델 실행 구조 Strata는 일반 PC에서 Qwen3.8-Flash-Next를 실행하며, 대화, 코드 작성, 이미지 읽기와 앱/코딩 에이전트 연동을 지원함 모델의 24,576개 전문가(expert) 중 단어 하나를 처리하는 데 필요한 전문가는 10개뿐임 GPU에는 가장 자주 사용하는 수천 개 전문가를 유지함 RAM에는 모든 전문가를 보관하고, CPU가 GPU에 없는 전문가의 작업을 동시에 처리함 SSD에는 대형 조회 테이블을 저장함 보조 모델의 예측과 큰 모델의 검증을 결합함 작은 모델이 다음 몇 단어를 예측하면 큰 모델이 한 번에 확인하고 올바른 예측을 채택함 같은 답을 1.6~1.8배 빠르게 얻을 수 있음 긴 텍스트는 한 번에 최대 8,192토큰씩 처리하며, 처리 속도는 초당 1,000토큰 이상임 구조와 수치는 작동 원리, 기술 상세, 논문에서 확인할 수 있음 실측 성능과 측정 범위 답변 생성 속도는 짧은 대화에서 답이 출력되는 속도이며, 프롬프트 처리 속도는 32K토큰 문서, 코드 또는 대화 기록을 읽는 속도임 RTX 5070 12GB, Ryzen 5 7600, RAM 64GB 구성의 실측 결...

Read Entire Article