Qwen-Image-2.1, 소형 고효율 통합 이미지 생성 모델

6 hours ago 1

Qwen-Image-2.1이 오픈소스로 공개됨. 시각 생성 구성 요소가 7B 파라미터인 단일 모델에 텍스트 기반 이미지 생성과 이미지 편집을 통합함 혼합 세분도 어텐션과 KV 캐시 재사용으로 추론 효율을 높이고 메모리 사용량을 줄이며, 특히 여러 입력 이미지를 사용하는 편집에 초점을 맞춤 투명 이미지 생성과 편집을 기본 지원하며, 프롬프트에 따라 일반 이미지나 투명 채널이 있는 이미지를 출력할 수 있음 최대 10장의 참조 이미지 조합과 영역 지정 편집을 지원하며, 인물의 정체성과 제품의 특징을 유지하는 능력을 개선함 타이포그래피와 인물 표현을 개선하고 파노라마, 인포그래픽, 스토리보드 생성을 지원해 디자인, 콘텐츠 제작, 전자상거래, 시각적 스토리텔링에 활용할 수 있음 경량 구조와 추론 효율 Qwen-Image-2.1은 생성 품질, 추론 효율, 비용의 균형을 목표로 하는 Qwen 계열 이미지 모델이며, GitHub, Hugging Face, ModelScope에서 공개됨 시각 생성 구성 요소는 32개 Single-Stream DiT 레이어와 7B 파라미터로 구성됨 Qwen-Image-Bench에서 다른 오픈소스 및 비공개 모델과 이미지 생성 성능을 비교함 혼합 세분도 어텐션(mixed-granularity attention) 으로 텍스트와 이미지에 서로 다른 마스크를 적용함 시스템 접두부와 편집 지시를 포함한 텍스트에는 토큰 단위 인과 마스크를 사용함 이미지 생성에는 청크 단위 마스크를 사용함 KV 캐시 재사용으로 입력 이미지와 편집 지시를 정적 문맥으로 처리함 첫 단계에서 계산하고 캐시해 추론 효율을 높이고 메모리 사용량을 줄임 특히 여러 입력 이미지를 사용하는 편집의 효율 개선에 초점을 맞춤 투명 이미지 생성과 편집 통합 2025년 12월 공개한 전용 모델 Qwen-Image-Layered의 투명 이미지 생성 기능을 하나의 모델에 통합함 프롬프트에 따라 일반 이미지 또는 투명 채널이 있는 이미지를 출력함 단일 피사체뿐 아니라 여러 요소로 구성된 복잡한 투명 이미지도 생성할 수 있음 투명 배경을 유지하면서 편집할 수 있음 피사체의 표정을 변경하거나 투명 레이어 안의 텍스트를 수정할 수 있음 예시에서는 “BLOOM”을 “Qwen-Image”로 교체함 실제 RGB 사진에서 원하는 피사체를 RGBA 레이어로 추출할 수 있어 후속 디자인과 합성 작업에 요소를 재사용하기 쉬워짐 최대 10장의 참조 이미지 조합 최대 1...

Read Entire Article