아래는 출처에서 가져온 원문입니다.

알리바바가 이미지 생성과 편집을 하나의 모델에서 처리할 수 있는 오픈 웨이트 기반 멀티모달 AI 모델을 선보였다. 경량화된 구조를 바탕으로 참조 이미지 합성부터 영역 편집, 투명 배경 생성까지 단일 모델로 구현했지만, 이미 상당수 기능은 다른 첨단 모델에서 구현됐다는 지적도 제기된다.
알리바바는 21일(현지시간) 이미지 생성·편집 통합형 멀티모달 AI 모델 ‘큐원 이미지 2.1(Qwen-Image-2.1)’을 공개했다.
시각 생성 구성 요소에 70억개 매개변수를 적용한 경량 모델이다. 텍스트-이미지 생성과 편집을 단일 체크포인트에서 실행하며, 최대 10개의 참조 이미지를 입력해 인물이나 제품, 의상 등을 하나의 이미지로 조합하는 방식을 지원한다.
사용자는 마스크나 원형 표시를 이용해 인물의 헤어스타일이나 의상을 바꾸는 등 국소적인 부분 편집을 수행할 수 있다.
이와 함께 기존처럼 배경을 딴 뒤 일일이 누끼를 남기는 후처리 작업 없이, 배경이 투명한 이미지(RGBA)를 처음부터 직접 만들거나 편집하는 기능도 갖췄다. 이미지에서 특정 피사체만 깔끔하게 따내 투명 레이어로 분리해 주는 누끼 따기 기능도 기본으로 제공한다.
여러 이미지 입력을 빠르게 처리하기 위한 효율성도 높였다. 텍스트에는 토큰 단위 인과 마스크를, 이미지 생성에는 청크 단위 마스크를 적용하는 ‘혼합 세분화 어텐션’ 구조를 사용한다. 입력 이미지와 편집 지시문을 첫 단계에서 계산한 뒤 KV 캐시를 재사용해 여러 참조 이미지를 활용하는 편집 과정에서 연산량과 메모리 사용량을 줄이는 방식이다.
이미지 품질 측면에서는 인포그래픽, 파노라마, 스토리보드, 가상 피팅 등 다양한 작업을 지원한다. 특히 글자를 이미지 안에 자연스럽게 배치하는 타이포그래피와 인물의 조명, 세부 묘사 등을 개선했다고 밝혔다. 최대 2048×2048 해상도를 기본으로 지원하며 여러 화면 비율에도 대응한다.
Qwen Image 2.1 is here! ️
A 7B params native image generation and editing model, with up to 10 image references
The model comes with it's own prompt enhancement LLMs, integrated with diffusers and ComfyUI
▶️ on Spaces https://t.co/ZuGlJr626j pic.twitter.com/CwAODE6wMn
— Hugging Apps (@HuggingApps) September 20, 2026
자체적으로 실시한 '큐원-이미지-벤치(Qwen-Image-Bench)' 평가에서는 60.28점을 기록하며 오픈 웨이트 모델 가운데 높은 수준의 성능을 확보했다고 강조했지만, 자체 벤치마크라는 점에서 다른 평가 결과와 함께 해석할 필요가 있다.
한편, 기능적 발전과 달리 외부에서는 냉정한 평가도 잇따르고 있다. 텍스트 명령을 통한 부분 수정이나 피사체 추출 등 핵심 기능은 오픈AI의 'GPT-이미지'를 비롯한 기존 모델들에 이미 존재하는 기능이라는 지적이다. 단지 이를 단일 모델로 구현했다는 점 외에는 뒤늦게 기존 트렌드를 따라간 수준에 불과하다는 분석도 나왔다.
생성물 자체의 품질과 정책 면에서의 문제도 도마 위에 올랐다. 인체 디테일 왜곡이나 특유의 색감 치우침이 발생하는 등 합성 데이터 과도 학습에 따른 한계가 지적됐다. 이전 버전과 달리 상업적 이용을 제한하는 연구용 라이선스(Non-Commercial)를 적용했다는 비판도 받았다.
모델은 허깅페이스를 비롯해 Diffusers, ComfyUI, vLLM-Omni, SGLang 등을 통해 활용할 수 있으며 AMD ROCm 등 다양한 하드웨어 환경도 지원한다. 상업적 배포에는 별도의 라이선스가 필요하다.
박찬 기자 cpark@aitimes.com