알리바바는 이제 버전 시퀀스를 공유하지 않는 두 가지 Qwen 이미지 라인을 출시합니다. 2026년 9월 20일 출시된 Qwen-Image-2.1은 오픈 가중치 모델입니다: 생성기에 7B 매개변수, 기본 투명 출력, 최대 10개의 참조를 사용한 편집 기능을 제공하며, Hugging Face에서 다운로드할 수 있습니다. 2026년 7월 22일 발표되었고 8월 4일부터 API로 제공되는 Qwen Image 3.0 및 3.0 Pro는 이미지당 가격이 책정되며 공개된 가중치가 없는 호스팅 모델입니다. 숫자상으로는 “3.0이 더 최신”이지만, 솔직히 말하면 이들은 서로 다른 질문에 답합니다: 모델을 직접 실행하고 싶으신가요, 아니면 빌려 쓰고 싶으신가요?
이 페이지에서는 두 모델을 라이선스, 비용, 기능 및 운영 측면에서 비교하고, 마지막에는 의사 결정표를 제공합니다. 2.1 기능 안내는 Qwen-Image-2.1이란 무엇인가를 참조하시고, 코드는 사용 방법 가이드를 참조하세요. 어떤 것을 선택하든, 둘 다 앱이 호출하는 HTTP 엔드포인트가 되며, Apidog는 두 모델을 하나의 컬렉션으로 관리할 수 있어 전환이 구성 변경만큼 간단합니다.
측면 비교
| Qwen-Image-2.1 | Qwen Image 3.0 / 3.0 Pro | |
|---|---|---|
| 출시일 | 2026년 9월 20일 | 2026년 7월 22일 발표; API는 2026년 8월 4일 |
| 배포 | 오픈 가중치 (Hugging Face, ModelScope) | 호스팅 API 전용; 공개 가중치 없음 [확인 필요] |
| 라이선스 / 약관 | Qwen 연구 라이선스; 상업적 사용은 별도 라이선스 필요 | 표준 API 서비스 약관 |
| 가격 | 사용자의 GPU 사용 시간 | qwen-image-3.0: 이미지당 $0.03 (1K 또는 2K). qwen-image-3.0-pro: 1K에서 $0.04, 2K에서 $0.075. 입력 이미지당 $0.003 [확인 필요] |
| 생성기 크기 | 7B (32개 Single-Stream DiT 레이어) + Qwen3-VL 8B 인코더 | 공개되지 않음 |
| 최대 해상도 | 기본 2048 x 2048; 최대 2752 x 1536 | 2048 x 2048 |
| 투명 출력 | 네이티브 RGBA 생성 및 편집 | 광고되지 않음 |
| 참조 이미지 | 최대 10개 | 입력 이미지 지원 (이미지당 가격 책정); 제한 미공개 [확인 필요] |
| 로컬 편집 | 원, 페인트 주석, 별도 마스크 | 출시 자료에 광고되지 않음 |
| 텍스트 렌더링 | 개선된 타이포그래피, 스타일 및 레이아웃 | 주요 기능: 약 10px의 미세 텍스트, 12개 언어 (자체 보고) |
| 호출당 출력 | 하나 (사용자가 루프) | 최대 6개 |
| 프롬프트 길이 | 명시되지 않음 | Pro에서 약 4.5K 토큰 (공식 주장) |
| 프롬프트 재작성 | 사용자가 직접 실행하는 별도의 PE-T2I / PE-I2I 모델 | 서버 측에서 처리 |
| 시도할 수 있는 곳 | HF Space, Qwen Chat, ComfyUI | Model Studio 콘솔, Qwen Chat |
3.0 컬럼의 출처는 알리바바의 7월 발표와 LLM Stats에 요약된 QwenCloud 문서입니다. 이미지 가격은 지역별로 다르므로 예산 책정 전에 Model Studio의 가격표를 다시 확인하세요.
라이선스가 첫 번째 필터
대부분의 팀에게 이 항목에서 비교가 끝납니다. 2.1 라이선스는 “별도의 상업적 라이선스를 획득하지 않고는 자료를 상업적 목적으로 사용할 수 없다”고 명시합니다. 이는 오리지널 Qwen-Image가 출시되었던 Apache 2.0 약관과는 다르며, 2.1 기반으로 구축된 고객 대면 기능은 출시 전에 Qwen 비즈니스 팀에 이메일을 보내고 서명된 계약을 체결해야 함을 의미합니다.
Qwen Image 3.0은 표준 상업 약관을 가진 유료 API입니다. 이미지당 비용을 지불하고 제품을 출시할 수 있습니다.
따라서 연구, 평가, 내부 도구 또는 라이선스 협상이 가능한 프로젝트라면 2.1이 고려 대상입니다. 이번 분기 출시 예정이며 법적 예산이 없는 제품 기능에는 3.0이 기본 선택입니다.
비용: GPU 요금 vs 이미지당 3센트
3.0 표준 티어는 어떤 해상도든 이미지당 $0.03이므로, 한 달에 10,000개 이미지는 $300이며, 편집 시 입력 이미지당 $0.003이 추가됩니다. Pro는 2K에서 두 배가 됩니다.
2.1을 자체 호스팅하는 경우 이미지당 가격은 없지만, 이 방식은 대량 사용 시 그리고 유휴 상태로 둘 GPU가 있을 경우에만 유리합니다. Qwen은 처리량 수치를 공개하지 않으므로 직접 측정하세요: 단일 데이터센터 GPU에서 40단계, 2048x2048 해상도로 시간당 이미지를 계산하고, 시간당 요금을 나누어 $0.03과 비교하세요. 많은 참조를 사용하는 편집에서는 2.1의 KV 캐시 재사용이 도움이 됩니다. 참조 이미지는 단계별이 아닌 요청당 한 번 인코딩되기 때문입니다. GPU가 다른 작업과 공유되는 경우, 이미지 생성 시 버스트 동안 GPU를 독점할 수 있다는 점을 기억하세요.
대략적인 규칙: 한 달에 몇 천 장 미만의 이미지라면 엔지니어링 시간을 고려할 때 API가 더 저렴합니다. 한 달에 수만 장 이상을 꾸준히 처리하고 라이선스 계약이 체결된 경우 자체 호스팅이 유리합니다. 그 중간은 이미 GPU를 운영하고 있는지 여부에 따라 다릅니다.
기능: 투명도 vs 빽빽한 텍스트
두 모델은 서로 다른 작업을 위해 만들어졌습니다.
출력에 알파 채널이 필요한 경우 2.1을 선택하세요. 스티커, 제품 오려내기, UI 에셋, 레이어 구성, 사진에서 RGBA로 피사체 추출: 2.1은 투명 레이어를 편집할 때 투명도를 잃지 않으면서도 동일 모델 내에서 이를 기본적으로 처리합니다. 3.0의 출시 자료에는 알파 출력에 대한 언급이 없습니다. 3.0에서 이를 수행하려면 별도의 배경 제거 단계가 필요하며, 이로 인해 헤일로 현상이 발생할 수 있습니다.
편집이 주요 작업인 경우 2.1을 선택하세요. 10개의 참조 이미지, 원, 페인트 또는 마스크를 통한 영역 선택, 얼굴 및 제품에 대한 정밀 작업이 2.1 릴리스의 핵심입니다. 출시 게시물은 6개의 인물 사진에서 그룹 사진, 5개의 제품 사진에서 의상, 10개의 가구 사진에서 가구가 비치된 방을 보여줍니다.
이미지가 주로 텍스트인 경우 3.0을 선택하세요. 대시보드, 와이어프레임, 포스터, 그리고 다양한 언어로 된 미세 텍스트가 있는 슬라이드 형태의 레이아웃이 3.0이 조정된 목적입니다. 2.1도 타이포그래피를 개선했지만, 3.0의 “12개 언어로 10px 텍스트”는 더 강력하게 발표된 주장이며, Pro의 4.5K 토큰 프롬프트 예산은 긴 레이아웃 사양에 적합합니다.
호출당 여러 후보가 필요한 경우 3.0을 선택하세요. 요청당 최대 6개의 출력은 2.1에는 없는 워크플로우 기능입니다. 2.1에서는 시드를 반복해야 합니다.
어떤 공급업체 페이지도 숫자가 있는 벤치마크 표를 인쇄하지 않습니다. 2.1 게시물은 Qwen-Image-Bench 차트를 보여주며, 3.0 주장은 자체 보고된 것입니다. 둘 다 Apidog 섹션에서 반복 가능하게 만드는 자체 평가를 위한 프롬프트로 간주하십시오.
운영: 당신이 소유하는 것
2.1을 자체 호스팅한다는 것은 다음을 소유한다는 의미입니다: 모델 다운로드 및 업데이트, 충분한 메모리를 가진 GPU (Qwen은 VRAM 테이블을 공개하지 않지만, README는 CPU 오프로드를 제공하고 FP8을 사용하는 vLLM-Omni, SGLang, LightX2V를 언급합니다), 서비스 래퍼, 버스트 로드 시 큐잉, 그리고 한 줄 프롬프트를 작동시키려면 두 개의 선택적 프롬프트 재작성 모델. 그 대가로 데이터 지역성, 당신 자신의 제한 외에는 어떤 속도 제한도 없으며, 아무도 변경하지 않는 고정된 모델 버전을 얻습니다.
3.0을 사용한다는 것은 다음을 소유한다는 의미입니다: 알리바바 클라우드 계정 및 지역 선택, API 키, 속도 제한 처리, 그리고 테스트 실행과 프로덕션 사이에 호스팅 모델의 동작이 변경될 위험. 그 대가로 인프라 없이 이미지당 청구서를 받습니다.
Qwen 내에서가 아닌 공급업체 간에 비교하는 경우, Nano Banana 2 API 및 gpt-image-2.5 API 가이드에서는 Google 및 OpenAI에 대해 동일한 호스팅 절충점을 다룹니다.
의사 결정표
| 귀하의 상황 | 선택 |
|---|---|
| 이번 분기 상업 기능 출시, 법적 예산 없음 | 3.0 |
| 투명 PNG 또는 RGBA 편집 필요 | 2.1 (상업용인 경우 라이선스 필요) |
| 많은 참조 이미지를 통한 편집 | 2.1 |
| 여러 언어로 된 텍스트 중심 레이아웃 | 3.0 |
| 연구, 평가, 내부 도구 | 2.1 |
| 월 수천 장 미만의 이미지 | 3.0 |
| 월 수만 장, 이미 GPU 운영 중, 라이선스 계약 완료 | 2.1 |
| 데이터가 네트워크를 벗어날 수 없음 | 2.1 |
| 요청당 6개의 후보를 원함 | 3.0 |
하나의 컬렉션 뒤에서 둘 다 실행
많은 팀에게 실질적인 답은 둘 다 사용하는 것입니다: 투명 자산 파이프라인 및 내부 도구에는 2.1을, 고객 대면 텍스트 레이아웃에는 3.0을 사용하는 것입니다. 두 모델이 하나의 계약 뒤에 있다면 깔끔하게 작동합니다.
Apidog에서 prompt, aspect, transparent, seed 및 references 파일 필드를 사용하여 POST /v1/images 엔드포인트를 한 번 정의하고, 두 개의 환경을 설정합니다: 하나는 2.1 래퍼(2.1 사용 방법 가이드에 40줄 FastAPI 버전이 있습니다)를 가리키는 base_url, 다른 하나는 Model Studio 3.0 엔드포인트용 어댑터를 가리킵니다. 그런 다음:
- 고정된 시드로 동일한 프롬프트 세트를 둘 다에 보내고 응답을 테스트 케이스로 저장합니다.
- 다른 점을 확인합니다:
Content-Type, 응답 크기 하한, 그리고 투명도가 요청되었을 때 2.1의X-Image-Mode: RGBA헤더. - 요청당 응답 시간을 기록합니다. Apidog는 매 실행 시 이를 보여주는데, 이것이 Qwen이 공개하지 않는 처리량 수치입니다.
- 매주 시나리오를 실행합니다. 3.0의 호스팅된 동작이 변경되거나 2.1을 양자화된 빌드로 교체할 때, 차이점은 지원 티켓이 아닌 보고서에 나타납니다.
- 프런트엔드가 계약에 따라 구축되도록 엔드포인트를 모의(mock)하여 모델 선택이 아직 열려 있는 동안에도 작업할 수 있게 합니다.
Apidog를 다운로드하고 엔드포인트를 가져와 비교를 시작하세요.
자주 묻는 질문
Qwen Image 3.0은 오픈 소스인가요? 3.0 또는 3.0 Pro에 대한 공개 가중치는 출시되지 않았습니다. 이들은 호스팅된 API 모델입니다 [확인 필요]. Qwen-Image-2.1은 오픈 가중치 릴리스입니다.
Qwen-Image-2.1을 상업적으로 사용할 수 있나요? Qwen의 별도 상업적 라이선스가 있어야만 가능합니다. 기본 Qwen 연구 라이선스는 상업적 사용을 배제합니다.
어떤 것이 더 저렴한가요? 낮은 볼륨에서는 이미지당 $0.03인 3.0이 더 저렴합니다. 이미 운영 중인 하드웨어에서 높고 꾸준한 볼륨으로 사용할 때는 라이선스를 확보하고 자체 처리량을 측정한 후 2.1이 더 저렴합니다.
3.0은 투명 이미지를 생성하나요? 광고되지 않습니다. 네이티브 RGBA 출력은 2.1의 기능입니다. Qwen-Image-2.1이란 무엇인가를 참조하세요.
둘 중 하나를 무료로 사용해 볼 수 있나요? 2.1은 Hugging Face Space와 Qwen Chat 접근을 제공하며, 무료 티어 가이드에 옵션이 나와 있습니다. 3.0은 Qwen Chat과 Model Studio의 지역별로 다른 시험 사용 할당량을 통해 사용할 수 있습니다.
다음 단계
2.1과 3.0은 업그레이드 경로가 아닌 분기점입니다. 라이선스가 첫 번째 질문을, 워크로드가 두 번째 질문을, 그리고 볼륨이 세 번째 질문을 결정합니다. 어떤 것을 선택하든, 테스트할 계약 뒤에 두십시오: 사용 방법 가이드는 2.1 측을 구축하고, 동일한 Apidog 컬렉션은 필요할 때 3.0 측을 지원할 수 있습니다.
