Qwen3.8-Omni-Flash는 텍스트, 이미지, 오디오, 비디오를 입력받아 콘텐츠 이해부터 작업 계획, 도구 호출, 결과물 제작까지 수행하는 네이티브 옴니모달 모델로, 100만 토큰 컨텍스트를 지원함 Qwen 공개 평가에서 이전 Qwen3.5-Omni-Plus보다 29개 평가 평균 점수가 25% 이상 상승했으며, 시간당 오디오 입력 API 가격은 98% 이상, 시청각 입력 가격은 93% 이상 낮아짐 장시간 영상에서 질문에 필요한 구간을 스스로 찾아 검증하는 에이전트 방식의 이해를 지원하며, OmniVideoBench에서 정확도를 63.4에서 67.8로 높이고 질의당 토큰 사용량을 약 45.7% 줄임 영상 제작과 업무 실행을 연결해 뮤직비디오 제작, 단편 드라마 번역과 더빙, 장편 영화 해설, 회의 후속 작업, 영상 기반 문서와 재사용 가능한 에이전트 스킬 생성을 지원함 별도 모델 Qwen3.8-Omni-Flash-Realtime은 실시간 시청각 스트림을 받으며 응답하고 도구를 실행하며, 발음 연습, 공간 음향 기반 탐색, 업무 지식과 규칙을 적용한 대화에 활용할 수 있음 모델과 비용 변화 Qwen3.8-Omni-Flash 는 Qianwen AI Platform에서 사용할 수 있으며, 코딩, 텍스트 기반 지식 업무, GUI 조작을 바탕으로 오디오와 비디오 중심의 에이전트 작업을 확장함 텍스트, 이미지, 오디오, 비디오 입력과 100만 토큰 컨텍스트를 지원함 동일 규모의 텍스트 전용 모델과 비슷한 텍스트 성능을 유지하면서 옴니모달 성능을 개선함 Qwen 공개 평가에서 Qwen3.5-Omni-Plus 대비 29개 평가 평균 점수가 25% 이상 상승함 Qwen은 시청각 성능이 Gemini 3.8 Flash에 근접하고, 전반적인 오디오 성능은 이를 넘어선다고 밝힘 평가 범위에는 음성 인식, 음성 번역, 소리와 음악 이해, 시청각 추론, 설명 생성, 상호작용, 멀티모달 에이전트 작업이 포함됨 시간당 API 입력 가격은 이전 모델보다 오디오 98% 이상, 시청각 93% 이상 인하됨 시간당 가격은 2분 분량 입력 비용의 30배로 추정하며, 시청각 입력은 720p, 초당 1프레임을 기준으로 함 비교에서 Gemini 3.8 Flash는 media_resolution=high, Seed 2.0 Lite는 max_frame_tokens=384를 사용하고 나머지 API 설정은 기본값을 사용함 텍스트 입출력 가격 단위는 100만 ...
Related
CrowdSec 소스 코드 유출
22 minutes ago
0
황금 못, 그리고 Vale(n) 프로그래밍 언어의 부활
42 minutes ago
1
주의: 저명한 Rust 개발자를 겨냥한 표적 공격
42 minutes ago
1
OpenJev
1 hour ago
2
Microsoft 임원, AI 스크래핑을 ‘인류 역사상 최대 규모의 노동 절도’라고 칭해
2 hours ago
2
x86 에뮬레이션의 골칫거리
2 hours ago
2
Jemalloc 5.4.0
2 hours ago
2
LLM과 함께 글 쓰는 법
4 hours ago
2
Tips
click
Popular
[팟캐스트] OAuth, 제대로 이해하고 쓰고 있나요?
3 weeks ago
95
고철
3 weeks ago
93
연상호, 토론토영화제서 고레에다 감독과 대담
3 weeks ago
83
‘붉은사막’, 게임스컴 어워드 에픽·최고의 PC 게임 후보작 올라
3 weeks ago
78
취준생 목소리에 귀기울인 '라이너 라이트'..."자소서 기능 이용자 수 13배 늘...
3 weeks ago
78
잔나비, 첫 아시아 투어 곳곳서 떼창 물결…"기적같은 일"
3 weeks ago
75
김재윤 통산 220세이브…삼성, 2연패 탈출
3 weeks ago
73
컴투스, 신작 '제우스: 오만의 신' 사전 다운로드 당일 애플 앱스토어 인기 1위
3 weeks ago
70
남궁훈 아이즈 대표, 카카오게임즈 지분 1% 매입…"게임산업 다시 성장할 것"
3 weeks ago
66
© Clint IT 2026. All rights are reserved

6 hours ago
3








English (US) ·