알리바바 Qwen-Image-2.1 공개: 70억 파라미터로 유료 클로즈드 모델 능가하는 오픈웨이트 이미지 생성 모델

알리바바 Qwen-Image-2.1 공개: 70억 파라미터로 유료 클로즈드 모델 능가하는 오픈웨이트 이미지 생성 모델

알리바바가 소비자 GPU에서 동작하는 70억 파라미터 오픈웨이트 이미지 생성 모델 Qwen-Image-2.1을 공개했어요.

알리바바 Qwen 팀이 9월 20일 오픈웨이트 이미지 생성·편집 모델 Qwen-Image-2.1을 공개했어요. 시각 생성 컴포넌트는 70억 파라미터 규모로, 팀은 자체 벤치마크에서 주요 클로즈드 모델들을 능가한다고 밝혔어요. RTX 3090 같은 소비자용 GPU에서도 실행되며, Hugging Face·GitHub·ModelScope를 통해 누구나 내려받을 수 있어요.

Qwen-Image-2.1의 가장 눈에 띄는 특징은 최대 10장의 참조 이미지를 동시에 활용하는 능력이에요. 그룹 초상화 합성이나 가상 의류 피팅처럼 복잡한 작업도 참조 이미지를 여러 장 넣어주면 훨씬 자연스럽게 처리할 수 있어요. 또한 RGBA 투명 레이어를 네이티브로 생성·편집하고, 원형 마스크나 페인팅 표시를 활용한 로컬 수정도 지원해요. 아키텍처 변경과 KV 캐시 재사용 덕분에 멀티 참조 처리 시 추론 속도도 빨라졌다고 해요. 다만 연구 라이선스로 배포되기 때문에 상업적 활용을 위해서는 별도 계약이 필요하다는 점은 유의해야 해요. 전문가급 이미지 생성을 API 비용 없이 로컬에서 처리할 수 있는 선택지가 생긴 덕분에, 인디 아티스트와 소규모 스튜디오의 제작 환경이 더 넓어질 것으로 보여요.

원문: The Decoder