Qwen-Image-2.1이란? 네이티브 투명도를 지원하는 7B 오픈 이미지 모델

Qwen-Image-2.1 설명: 9월 20일 오픈 가중치 공개, 70억(7B) 통합 생성 및 편집, 네이티브 RGBA 출력, 10개의 참조 이미지, 그리고 상업적 사용을 제한하는 연구 라이선스.

Ashley Innocent

Ashley Innocent

21 September 2026

Qwen-Image-2.1이란? 네이티브 투명도를 지원하는 7B 오픈 이미지 모델

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Alibaba의 Qwen 팀은 2026년 9월 20일에 Qwen-Image-2.1을 오픈 소스로 공개했습니다. 이는 텍스트-이미지 생성 및 이미지 편집을 수행하는 단일 모델이며, 시각 생성 구성 요소에 70억 개의 매개변수를 가지고 있고, 배경 제거 과정을 통해 투명한 배경을 흉내 내는 대신 프롬프트에서 직접 투명한 PNG를 출력할 수 있습니다. 출시 게시물에는 네 가지 변경 사항이 나열되어 있습니다: 더 가볍고 빠른 아키텍처, 네이티브 투명도, 최대 10개의 참조 이미지를 사용한 편집, 그리고 더 나은 타이포그래피 및 인물 세부 묘사. 가중치는 Hugging Face와 ModelScope에 있으며, 코드는 GitHub에 있습니다.

모델 카드에 있는 한 줄은 어떤 기능보다도 중요합니다: 라이선스는 Apache 2.0이 아닌 Qwen 연구 라이선스입니다. 상업적 사용을 위해서는 별도의 계약이 필요합니다. 제품을 위해 2.1을 평가 중이라면 벤치마크를 보기 전에 해당 섹션을 읽으십시오. 이를 실행하고 싶다면, Qwen-Image-2.1 사용 방법 가이드에 디퓨저 코드와 Apidog에서 테스트할 수 있는 HTTP 래퍼가 있습니다. 호스팅된 Qwen Image 3.0 API와 비교하고 있다면, 2.1 대 3.0 비교 페이지가 결정하는 데 도움이 될 것입니다.

Qwen-Image-2.1 한눈에 보기

항목 세부 정보 (출시 게시물, 모델 카드, GitHub README)
출시일 2026년 9월 20일
기능 투명 (RGBA) 출력을 포함한 단일 모델 내 텍스트-이미지 및 이미지 편집
비주얼 생성기 32개 단일 스트림 DiT 레이어, 70억 개 매개변수
텍스트 인코더 Qwen3-VL 8B
VAE 64채널 RGBA 오토인코더, 16배 공간 압축
기본 출력 2048 x 2048; 최대 2752 x 1536까지 7가지 종횡비
참조 이미지 편집당 최대 10개
로컬 편집 원, 채색된 주석 또는 별도의 마스크 이미지
동반 모델 Qwen-Image-2.1-PE-T2I 및 PE-I2I 프롬프트 재작성 모델 (Qwen3.5-VL 9B 미세 조정)
라이선스 Qwen 연구 라이선스 계약; 상업적 사용은 별도의 라이선스 필요
체험하기 Hugging Face Space, Qwen Chat, ComfyUI (출시일부터 기본 지원)

Qwen-Image 계보에서 차지하는 위치

오리지널 Qwen-Image는 2025년 8월에 텍스트 렌더링으로 유명한 20B MMDiT 모델로 출시되었으며, Qwen-Image-Edit는 별도의 편집 모델로 제공되었습니다. 2025년 말까지 이 계보는 더욱 분화되었습니다: 사실성을 위한 2512 새로고침, 다중 인물 일관성을 위한 Edit-2511, 그리고 투명 레이어를 위한 12월의 Qwen-Image-Layered. 2026년 2월의 Qwen-Image-2.0은 생성과 편집 기능을 네이티브 2K 출력이 가능한 하나의 70억 매개변수 모델로 통합했습니다.

버전 2.1은 2.0의 크기와 통합된 디자인을 유지하며 Layered 모델의 투명도를 포함하여, 이제 하나의 체크포인트로 이전에 세 가지 모델이 필요했던 기능을 모두 다룹니다. 또한 새로운 추론 경로(아래에서 자세히 설명)와 마스크 및 여러 참조를 기반으로 구축된 편집 인터페이스를 제공합니다. 동시에 Alibaba는 호스팅된 라인을 운영합니다: Qwen Image 3.0 및 3.0 Pro는 2026년 7월에 가중치 없이 API 모델로 출시되었습니다. 따라서 이름 지정은 순차적인 것이 아니라 분기된 것입니다. 2.1은 다운로드할 수 있는 오픈 모델이고, 3.0은 대여하는 모델입니다.

2.1의 새로운 기능

더 가벼운 아키텍처와 더 빠른 편집 경로

시각 생성기는 32개의 단일 스트림 DiT 레이어로 70억 개의 매개변수를 가지며, 80억 개의 Qwen3-VL 인코더 및 알파 채널을 기본으로 지원하는 VAE와 결합됩니다. 흥미로운 공학적 요소는 어텐션에 있습니다. Qwen은 이를 혼합된 세분성(mixed-granularity)이라고 부릅니다: 텍스트 토큰(시스템 접두사와 편집 지시)은 토큰 수준의 인과 마스크를 사용하고, 이미지 생성은 청크 수준의 마스크를 사용합니다. 입력 이미지와 지시가 디노이징 단계 전반에 걸쳐 정적이므로, 모델은 첫 번째 단계에서 키-값 캐시를 한 번 계산하고 이를 재사용합니다. Qwen이 밝힌 이점은 여러 참조 이미지로 편집할 때 더 낮은 지연 시간과 메모리 사용량이며, 이는 10개 이미지 제한으로 인해 더 무거워진 작업 부하에 정확히 부합합니다.

스케줄러는 오일러 이산 단계(Euler discrete steps)를 사용하는 플로우 매칭(flow matching)이며, 참조 코드는 기본적으로 40단계를 실행합니다.

동일 모델 내 기본 투명도

이것이 핵심입니다. 프롬프트에서 투명 이미지를 요청하면 모델은 RGBA를 반환합니다. README에서 권장하는 문구는 문자 그대로입니다: "이것은 투명도가 있는 RGBA 이미지입니다"로 시작하여 배경이 투명하다고 말하십시오. 출시 게시물은 단일 피사체, 다중 요소 구성 및 투명 입력에 대한 세 가지 편집 사례를 보여줍니다: 알파 값을 유지하면서 피사체의 표정을 변경하는 것, 투명 레이어 내의 텍스트를 대체하는 것, 일반 RGB 사진에서 RGBA 오려내기로 피사체를 추출하는 것.

제품 팀의 경우, 이는 두 가지 모델 파이프라인(생성 후 매트 처리)을 하나의 호출로 대체합니다. 또한 배경 제거기가 머리카락이나 유리 주변에 남기는 할로 아티팩트를 제거합니다. 이는 알파 채널이 나중에 추론되는 것이 아니라 생성되기 때문입니다. 2K 해상도에서 사용자 자산의 가장자리가 잘 유지되는지는 가정하기보다 테스트해야 할 사항입니다. 무료 등급 가이드는 GPU 없이 이러한 테스트를 실행할 수 있는 방법을 보여줍니다.

최대 10개의 참조 및 실제 영역 제어 기능을 통한 편집

출시 예시에서 세 가지 편집 기능이 두드러집니다:

동일한 편집 경로는 셀카에서 파노라마, 제품 사진에서 인포그래픽, 세 가지 시점의 캐릭터 시트에서 스토리보드를 처리합니다. 순차적인 로컬 편집은 짧은 애니메이션으로 연결될 수 있으며, 게시물은 카피바라 클립으로 이를 시연합니다.

타이포그래피 및 인물 사진 품질

Qwen은 첫 Qwen-Image부터 공개 텍스트 렌더링을 선도해왔으며, 2.1은 단순히 철자뿐만 아니라 타입 스타일, 레이아웃, 그리고 텍스트가 구성 내에서 어떻게 배치되는지까지 확장합니다. 인물 사진 조명과 섬세한 디테일도 개선되었습니다. 출시 게시물은 공개 및 비공개 모델에 대한 Qwen-Image-Bench 차트로 이를 뒷받침합니다. 차트는 이미지이며 게시물에 숫자가 인쇄되어 있지 않으므로 여기서는 인용하지 않습니다.

라이선스: 오픈 가중치, 연구 조건

오리지널 Qwen-Image는 Apache 2.0이었습니다. Qwen-Image-2.1은 Qwen 연구 라이선스 계약에 따라 출시되었으며, 라이선스 텍스트는 중요한 핵심 사항에 대해 짧고 명확합니다:

프롬프트 재작성 동반 모델도 동일한 조건으로 제공됩니다. 취미 프로젝트, 연구 논문 또는 내부 평가의 경우 이는 문제가 없습니다. SaaS 기능의 경우, 이는 먼저 Alibaba와 협의하거나, 일반적인 상업적 조건과 이미지당 가격이 적용되는 호스팅된 3.0 API를 사용하는 것을 의미합니다.

두 가지 프롬프트 재작성 모델

생성기와 함께, Qwen은 Qwen-Image-2.1-PE-T2I 및 Qwen-Image-2.1-PE-I2I를 공개했습니다. PE-T2I는 모든 언어로 된 짧은 요청을 받아 상세한 영어 프롬프트와 권장 종횡비가 포함된 JSON을 반환하는 미세 조정된 Qwen3.5-VL 9B입니다. PE-I2I는 편집 기능에 상응합니다 [확인 필요]. 이들은 선택 사항이며, 데모 Space가 한 줄 입력에서 길고 구조화된 프롬프트를 얻는 방식입니다. 2.1을 기반으로 API를 구축하고 있다면, 이는 ChatGPT Images와 같은 제품이 보이지 않게 수행하는 "프롬프트 강화" 단계입니다.

출시 시 언급되지 않은 내용

API 뒤에 두고 테스트하기

대부분의 팀은 애플리케이션 코드에서 디퓨저 파이프라인을 직접 호출하지 않을 것입니다. 그들은 GPU 박스에서 HTTP 서비스로 래핑하여 호출할 것입니다. 일단 엔드포인트가 되면, 그것은 다른 API와 마찬가지이며, Apidog은 이를 설계하고 테스트하는 곳입니다: 요청 스키마(프롬프트, 선택적 참조 이미지, 종횡비, 투명도 플래그)를 정의하고, 실제 호출을 보내고, 응답이 알파 채널이 있는 PNG인지 확인하고, 좋은 사례들을 모델 업데이트 후 다시 실행할 회귀 테스트 스위트로 만드십시오. 또한 GPU가 바쁜 동안 프런트엔드 팀이 안정적인 계약에 대해 개발할 수 있도록 엔드포인트를 모의(mock)할 수도 있습니다. 사용 방법 가이드는 해당 래퍼와 Apidog 테스트를 단계별로 안내합니다.

함께 따라 하려면 Apidog을 다운로드하십시오.

자주 묻는 질문

Qwen-Image-2.1을 상업적으로 무료로 사용할 수 있나요? 아니요, Qwen으로부터 별도의 상업적 라이선스를 받지 않고서는 사용할 수 없습니다. 가중치는 연구 및 비상업적 목적으로 무료로 다운로드하고 사용할 수 있습니다. 무료로 사용해 볼 수 있는 방법은 위 라이선스 섹션과 무료 등급 가이드를 참조하십시오.

2.1은 Qwen-Image-2.0과 어떻게 다른가요? 동일한 70억 매개변수 크기와 통합된 생성+편집 디자인을 가집니다. 2.1의 새로운 기능은 다음과 같습니다: 네이티브 RGBA 출력 및 편집, 최대 10개의 참조 이미지, 마스크 및 주석 기반 로컬 편집, 더 빠른 다중 이미지 편집을 위한 KV 캐시 재사용을 통한 혼합 세분성 어텐션 경로, 그리고 개선된 타이포그래피 및 인물 세부 묘사.

Qwen Image 3.0과 동일한가요? 아닙니다. 3.0과 3.0 Pro는 2026년 7월에 오픈 가중치 없이 출시된 호스팅 API 모델이며, 2.1은 오픈 가중치 모델입니다. 비교는 가격 및 기능 차이를 다룹니다.

어떤 하드웨어가 필요한가요? Qwen은 VRAM 요구 사항을 게시하지 않았습니다. 참조 코드는 하나의 CUDA 장치에 bfloat16으로 파이프라인을 로드하고 CPU 오프로드를 제공합니다; 커뮤니티 서빙 스택은 FP8을 추가합니다. 40단계에서 2K 출력을 위해서는 데이터 센터 또는 하이엔드 소비자 GPU를 예상하십시오.

투명 이미지를 생성할 뿐만 아니라 편집할 수도 있나요? 네. 출시 예시들은 알파 채널을 유지하면서 피사체의 표정을 변경하고 투명 레이어 내의 텍스트를 대체하며, RGB 사진에서 RGBA 피사체를 추출하는 것을 보여줍니다.

다음 단계

Qwen-Image-2.1은 다른 누구도 단일 체크포인트에 제공하지 않는 네이티브 투명도 기능과 사용 가능 여부를 결정하는 연구 라이선스라는 제약 조건을 가진 강력한 오픈 편집 모델입니다. 사용 방법 가이드로 로컬에서 실행하고, 무료 옵션을 통해 GPU 없이 사용해보고, 결정하기 전에 호스팅된 3.0 API와 비교해 보십시오. 어떤 것을 선택하든, 모델 교체가 제품을 조용히 손상시키지 않도록 Apidog에서 엔드포인트를 테스트하십시오.

버튼

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요