Qwen4에 적용할 설계를 먼저 공개한 멀티모달 MoE 모델로, 125B 본체와 51B N-gram 임베딩 가운데 토큰당 6B 매개변수만 활성화함 GDN과 QSA로 과거 정보를 압축하고 중요한 문맥을 마이크로 블록 단위로 검색해, 1M 토큰에서 Attention Kernel의 Prefill과 Decode를 각각 최대 7.6배·4.9배 가속함 4개 병렬 잔차 경로, 호스트 메모리로 오프로딩할 수 있는 N-gram 임베딩, 개선된 Muon 최적화로 용량·정보 흐름·훈련 안정성을 함께 확장함 Qwen3.7-Plus보다 훈련 비용을 약 1/9로 낮추면서 코딩과 사무 작업 성능을 높였고, 기본 262,144토큰과 YaRN 기반 최대 1M 토큰 문맥을 지원함 가중치는 Hugging Face와 ModelScope에 공개됐으며, QwenCloud의 qwen3.8-flash는 기본 1M 문맥과 내장 도구를 입력·출력 100만 토큰당 각각 $0.16·$0.47에 제공함 Qwen4 아키텍처의 사전 공개 Qwen3.8-Flash-Next는 Qwen4에 적용할 아키텍처를 커뮤니티가 먼저 검토할 수 있도록 가중치를 공개한 멀티모달 MoE 모델임 Qwen3-Next가 Qwen3.5보다 먼저 Gated DeltaNet과 Gated Attention의 혼합 설계를 공개했던 것과 같은 역할을 맡음 당시 설계는 이후 Qwen3.5·Qwen3.6·Qwen3.7·Qwen3.8 시리즈 전반에 적용됨 새 모델은 Attention·잔차 연결·임베딩·최적화 네 영역을 개편해 모델 능력과 계산 효율, 용량, 훈련 안정성을 개선함 모델 본체는 125B 매개변수이고 별도로 51B N-gram 임베딩을 갖추며, 토큰당 활성 매개변수는 6B임 Qwen3.7-Plus와 비교하면 훈련 비용이 약 1/9이면서 코딩과 사무 작업에서 더 높은 성능을 기록함 기본 문맥 길이는 262,144토큰이고 YaRN으로 1,000,000토큰까지 확장할 수 있으며, 세부 설계와 실험은 기술 보고서에서 확인할 수 있음 GDN과 QSA의 장문 문맥 처리 기존 Full Attention은 모든 이전 토큰에 직접 접근하기 때문에 문맥이 길어질수록 계산량과 KV Cache 메모리 접근 비용이 크게 늘어남 전체 레이어 가운데 4분의 3은 Gated DeltaNet(GDN) 으로 과거 정보를 고정 크기 상태에 계속 압축하고, 나머지 4분의 1은 전역 Attention으로 전체 문맥에서 정보를 정확히...
Qwen3.8-Flash-Next: 비용 효율을 높인 Qwen4 선행 아키텍처
1 month ago
22
Related
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
12 minutes ago
0
토론토 기반 VPN 업체, 적법 접근 법안으로 캐나다 떠날 계획
24 minutes ago
0
Claude Code의 메시지 제안 기능: 진짜 고객은 모델이라는 생각
1 hour ago
1
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
3 hours ago
3
소프트웨어 팩토리 패턴 시도하기
3 hours ago
3
Show GN: 웹 변경 모니터링하는 크롬 확장프로그램
4 hours ago
3
OpenAI, 확률·선택지·점수를 반환하는 Decisions API 공개 베타 시작
4 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·