Qwen 3.8 27B

1 hour ago 1

Qwen3.8-27B-FP8은 이미지·영상 이해와 장기 에이전트 작업을 지원하는 270억 파라미터 밀집형 모델로, 원본과 성능 지표가 거의 같은 세밀한 FP8 양자화 가중치를 제공함 기본 활성화된 사고 모드는 요청별로 끌 수 있으며, reasoning_effort로 추론 깊이를 조절하고 preserve_thinking으로 이전 대화의 추론 문맥을 유지함 기본 문맥 길이는 262,144토큰이며 YaRN으로 100만 토큰까지 확장할 수 있지만, 정적 스케일링은 짧은 입력의 성능에 영향을 줄 수 있음 Terminal Bench 2.1 73.0, SWE-bench Pro 61.7, OSWorld-Verified 84.3, AndroidWorld 81.9 등에서 Qwen3.6-27B보다 높은 점수를 기록했지만, 일부 평가는 자체 벤치마크나 수정된 조건을 사용함 Hugging Face Transformers와 vLLM·SGLang·TokenSpeed를 지원하며, OpenAI 호환 Chat Completions API로 텍스트·이미지·영상을 처리할 수 있고 관리형 Qwen Cloud 서비스도 출시 예정임 모델과 FP8 배포판 Qwen3.8-27B-FP8은 후처리 학습된 Qwen3.8-27B의 가중치와 설정을 Hugging Face Transformers 형식으로 제공함 블록 크기 128의 세밀한 FP8 양자화를 적용했으며, 성능 지표는 원본 모델과 거의 동일함 Qwen3.5 아키텍처를 기반으로 코딩, 전문 업무, 연구, 장기 에이전트 작업 성능을 개선함 이미지와 영상을 직접 이해하는 비전-언어 모델로, 복잡한 다단계 작업을 더 안정적으로 끝내도록 설계됨 Transformers, vLLM, SGLang, TokenSpeed 등과 호환됨 관리형 추론 서비스 Qwen Cloud는 기본 100만 토큰 문맥과 공식 내장 도구 등 프로덕션 기능을 갖춘 호스팅 버전을 제공할 예정임 코딩·연구·에이전트 역량 코딩, 전문 업무, 연구와 장기 에이전트 작업 전반을 핵심 역량으로 삼음 자율 계획과 환경 피드백 처리를 강화해 종단 간 에이전트 실행의 신뢰성을 높임 널리 쓰이는 에이전트 하네스와 개발 도구를 폭넓게 지원해 기존 스택에 통합하기 쉬움 사고 모드는 기본 활성화되지만 요청별로 비활성화할 수 있음 reasoning_effort는 xhigh, medium, low로 추론 깊이와 비용을 조절함 preserve_thinking은 과거 메시지의...

Read Entire Article