Alibaba'nın Qwen ekibi, Qwen-Image-2.1'i 20 Eylül 2026'da açık kaynak olarak yayınladı. Bu, metinden görüntüye oluşturma ve görüntü düzenleme yapan tek bir modeldir; görsel oluşturma bileşeninde 7 milyar parametreye sahiptir ve arka plan kaldırma işlemiyle sahtesini yapmak yerine doğrudan bir komut isteminden şeffaf PNG'ler çıktısı verebilir. Lansman yazısı dört değişiklik listeliyor: daha hafif, daha hızlı bir mimari, yerel şeffaflık, 10 adede kadar referans görüntü ile düzenleme ve daha iyi tipografi ve portre detayı. Ağırlıklar Hugging Face ve ModelScope'ta, kod ise GitHub'da bulunmaktadır.
Model kartındaki tek bir satır, herhangi bir özellikten daha önemlidir: lisans, Apache 2.0 değil, Qwen Araştırma Lisansı'dır. Ticari kullanım ayrı bir anlaşma gerektirir. Eğer bir ürün için 2.1'i değerlendiriyorsanız, benchmark'lardan önce o bölümü okuyun. Eğer çalıştırmak istiyorsanız, Qwen-Image-2.1 nasıl yapılır kılavuzu diffusers kodunu ve Apidog'da test edebileceğiniz bir HTTP sarmalayıcıya sahiptir. Eğer barındırılan Qwen Image 3.0 API'si ile karşılaştırıyorsanız, 2.1 ve 3.0 karşılaştırması karar sayfanızdır.
Qwen-Image-2.1'e bir bakış
| Öğe | Detay (lansman yazısı, model kartı, GitHub README) |
|---|---|
| Yayın tarihi | 20 Eylül 2026 |
| Ne işe yarar | Tek bir modelde metinden görüntüye ve görüntü düzenleme, şeffaf (RGBA) çıktı dahil |
| Görsel oluşturucu | 32 Tek Akışlı DiT katmanı, 7 milyar parametre |
| Metin kodlayıcı | Qwen3-VL 8B |
| VAE | 64 kanallı RGBA otomatik kodlayıcı, 16x uzaysal sıkıştırma |
| Varsayılan çıktı | 2048 x 2048; yedi en boy oranı 2752 x 1536'ya kadar |
| Referans görüntüler | Düzenleme başına 10 adede kadar |
| Yerel düzenleme | Daireler, boyalı notlar veya ayrı bir maske görüntüsü |
| Yardımcı modeller | Qwen-Image-2.1-PE-T2I ve PE-I2I komut istemi yeniden yazma modelleri (Qwen3.5-VL 9B ince ayarları) |
| Lisans | Qwen Araştırma Lisans Sözleşmesi; ticari kullanım ayrı bir lisans gerektirir |
| Deneyin | Hugging Face Space, Qwen Chat, ComfyUI (lansman gününden beri yerel destek) |
Qwen-Image serisindeki yeri
Orijinal Qwen-Image, Ağustos 2025'te metin oluşturma özelliğiyle bilinen 20B MMDiT modeli olarak piyasaya sürüldü ve Qwen-Image-Edit ayrı bir düzenleme modeliydi. 2025'in sonlarına doğru seri daha da ayrıldı: gerçekçilik için 2512 yenilemesi, çoklu kişi tutarlılığı için Edit-2511 ve Aralık ayında şeffaf katmanlar için Qwen-Image-Layered. Qwen-Image-2.0, Şubat 2026'da oluşturma ve düzenlemeyi yerel 2K çıktılı tek bir 7B modelde birleştirdi.

Sürüm 2.1, 2.0'ın boyutunu ve birleşik tasarımını koruyor ve Layered modelinin şeffaflığını içeriyor, böylece tek bir kontrol noktası eskiden üç modelin yaptığı işi artık kapsıyor. Ayrıca yeni bir çıkarım yolu (aşağıda daha fazlası) ve maskeler ve çoklu referanslar etrafında inşa edilmiş bir düzenleme arayüzü de elde ediyor. Buna paralel olarak, Alibaba barındırılan bir seri çalıştırıyor: Qwen Image 3.0 ve 3.0 Pro, Temmuz 2026'da yayınlanmış ağırlıkları olmayan API modelleri olarak piyasaya sürüldü. Yani adlandırma bir sıralama değil, bir çatal. 2.1, indirdiğiniz açık modeldir; 3.0 ise kiraladığınız modeldir.
2.1'deki yenilikler
Daha hafif bir mimari ve daha hızlı bir düzenleme yolu
Görsel oluşturucu, 8B Qwen3-VL kodlayıcı ve yerel olarak bir alfa kanalı taşıyan bir VAE ile eşleştirilmiş, 7 milyar parametreli 32 Tek Akışlı DiT katmanıdır. İlginç mühendislik dikkat çekiyor. Qwen buna karma-granülerlik diyor: metin belirteçleri (sistem öneki ve düzenleme talimatınız) belirteç düzeyinde nedensel bir maske kullanırken, görüntü oluşturma yığın düzeyinde bir maske kullanıyor. Giriş görüntüleri ve talimat, gürültü giderme adımları boyunca statik olduğundan, model anahtar-değer önbelleğini ilk adımda bir kez hesaplar ve yeniden kullanır. Qwen'in belirttiği kazanç, birkaç referans görüntüyle düzenleme yaparken daha düşük gecikme ve bellek kullanımıdır, bu da tam olarak 10 görüntülük sınırlamayla ağırlaşan iş yüküdür.

Zamanlayıcı, Euler ayrık adımlarıyla akış eşleştirmesidir ve referans kod varsayılan olarak 40 adım çalıştırır.
Aynı modelde yerel şeffaflık
Bu manşet. Komut isteminde şeffaf bir görüntü istersiniz ve model RGBA döndürür. README'deki önerilen ifade harfidir: "Bu şeffaflığa sahip bir RGBA görüntüsüdür" ile başlayın ve arka planın şeffaf olduğunu söyleyin. Lansman yazısı, tek nesneleri, çok öğeli kompozisyonları ve şeffaf girişlerde üç düzenleme durumunu gösteriyor: alfa kanalını korurken bir nesnenin ifadesini değiştirmek, şeffaf bir katman içindeki metni değiştirmek ve sıradan bir RGB fotoğraftan bir nesneyi RGBA kesiti olarak çıkarmak.

Ürün ekipleri için bu, iki modelli bir pipeline'ı (oluştur, sonra matla) tek bir çağrıyla değiştirir. Ayrıca, alfa sonradan çıkarılmak yerine oluşturulduğu için, arka plan kaldırma araçlarının saç ve cam etrafında bıraktığı hale artefaktlarını da ortadan kaldırır. Kenarların kendi varlıklarınızda 2K'da dayanıp dayanmadığı varsaymak yerine test edilmesi gereken bir şeydir; ücretsiz katman kılavuzu, GPU olmadan bu testlerin nerede yapılacağını gösterir.
10'a kadar referans ve gerçek bölge kontrolü ile düzenleme
Lansman örneklerinde üç düzenleme özelliği öne çıkıyor:
- Çoklu referanslar. Altı portre tek bir grup fotoğrafı haline gelir; bir model, giysiler, ayakkabılar, çanta ve şapka tam bir kıyafet olur; on mobilya fotoğrafı döşenmiş bir oda haline gelir. Sınır 10 giriş görüntüsüdür.
- Üç şekilde yerel düzenleme. Renkli daireler çizin ve her birini komut isteminde renge göre adresleyin ("mavi dairedeki saati kaldırın"), bir bölgenin üzerine boyayın veya kaynakta hiçbir şeyin örtülmemesi için dokunulmamış orijinali artı ayrı bir maskeyi iki giriş olarak geçirin.
- Doğruluk. Qwen, yüz kimliğinin ve ürün metninin, dokusunun ve şeklinin 2.0'dan daha iyi düzenlemelerden kurtulduğunu belirtiyor. Yazı, öncesi ve sonrası çiftlerini gösteriyor ancak herhangi bir metrik vermiyor, bu yüzden kendi SKU'larınızda doğrulanacak bir iddia olarak ele alın.
Aynı düzenleme yolu, bir selfieden panoramalar, bir ürün fotoğrafından infografikler ve üç görünümlü bir karakter sayfasından storyboard'lar oluşturur. Ardışık yerel düzenlemeler, yazının bir kapibara klibiyle gösterdiği kısa animasyonlara dönüştürülebilir.
Tipografi ve portre kalitesi
Qwen, ilk Qwen-Image'dan bu yana açık metin oluşturmada lider olmuştur ve 2.1, bunu sadece yazım değil, tip stilini, düzenini ve metnin kompozisyonda nasıl yer aldığını da kapsayacak şekilde genişletmektedir. Portre aydınlatması ve ince detaylar da iyileştirilmiştir. Lansman yazısı bunu, açık ve kapalı modellere karşı bir Qwen-Image-Bench grafiğiyle desteklemektedir; grafik bir görüntüdür ve yazı herhangi bir sayı vermediği için burada herhangi bir alıntı yapmıyoruz.
Lisans: açık ağırlıklar, araştırma koşulları
Orijinal Qwen-Image Apache 2.0 idi. Qwen-Image-2.1, Qwen Araştırma Lisans Sözleşmesi altında yayınlanmıştır ve lisans metni önemli noktayı kısa ve net bir şekilde belirtir:
- Modeli "ayrı bir ticari lisans almadan ticari amaçla" kullanamazsınız, bu lisans Qwen'den e-posta yoluyla talep edilir.
- Yeniden dağıtım ve türevler, lisansı, "Qwen ile Oluşturuldu" veya "Qwen kullanılarak İyileştirildi" ibaresini ve Hangzhou Tongyi Laboratuvarı'nın telif hakkı satırını taşımalıdır.
- Türev bir ürünün birincil adı olarak "Qwen" kullanamazsınız.
- Sözleşme, Hangzhou yargı yetkisine sahip Çin yasalarına tabidir.
Komut istemi yeniden yazma yardımcıları aynı koşullar altında gönderilir. Bir hobi projesi, bir araştırma makalesi veya dahili bir değerlendirme için bu uygundur. Bir SaaS özelliği için ise, önce Alibaba ile bir görüşme yapılması veya sıradan ticari koşullara ve resim başına bir fiyata sahip barındırılan 3.0 API'sinin kullanılması anlamına gelir.
İki komut istemi yeniden yazma modeli
Qwen, jeneratörle birlikte Qwen-Image-2.1-PE-T2I ve Qwen-Image-2.1-PE-I2I'yi yayınladı. PE-T2I, herhangi bir dilde kısa bir istek alan ve ayrıntılı bir İngilizce komut istemi ve önerilen bir en boy oranı içeren JSON döndüren ince ayarlı bir Qwen3.5-VL 9B'dir. PE-I2I, düzenleme karşılığıdır [DOĞRULA]. İsteğe bağlıdırlar ve demo Space'in tek satırlık girişlerden uzun, yapılandırılmış komut istemleri elde etmesini sağlarlar. Eğer 2.1 etrafında bir API oluşturuyorsanız, bu, ChatGPT Images gibi ürünlerin görünmez bir şekilde yaptığı "komut istemi iyileştirme" adımıdır.
Lansmanda bahsedilmeyenler
- Çözünürlüğe göre VRAM rakamları yok. README, daha hafif veya daha hızlı hizmet için
enable_model_cpu_offload(), FP8 ile vLLM-Omni, SGLang ve LightX2V'ye işaret ediyor, ayrıca AMD desteği var, ancak tablo yok. - Yayınlanmış benchmark sayıları yok, sadece bir grafik.
- Lansman itibarıyla Model Studio'da 2.1 için barındırılan bir API yok [DOĞRULA]; barındırılan seri 3.0'dır.
- Sabit bir çıkarım hızı iddiası yok, sadece KV önbellek yeniden kullanımından "geliştirilmiş verimlilik".
Bir API'nin arkasına koymak ve test etmek
Çoğu ekip, uygulama kodundan bir diffusers pipeline'ı çağırmaz. Bunun yerine, bir GPU kutusunda bir HTTP hizmetiyle sarmalar ve onu çağırır. Bir kez bir uç nokta olduğunda, diğer herhangi bir API gibi olur ve Apidog, onu tasarlayacağınız ve test edeceğiniz yerdir: istek şemasını tanımlayın (komut istemi, isteğe bağlı referans görüntüler, en boy oranı, şeffaflık bayrağı), gerçek çağrılar gönderin, yanıtın alfa kanallı bir PNG olduğunu doğrulayın ve iyi durumları, her model güncellemesinden sonra tekrar çalıştırdığınız bir regresyon paketine dönüştürün. Uç noktayı da taklit edebilirsiniz, böylece GPU meşgulken ön uç ekibi kararlı bir sözleşmeye karşı geliştirme yapar. Nasıl yapılır kılavuzu, bu sarmalayıcıyı ve Apidog testlerini adım adım açıklar.
Takip etmek için Apidog'u indirin.
Sıkça Sorulan Sorular
Qwen-Image-2.1 ticari olarak ücretsiz kullanılabilir mi? Hayır, Qwen'den ayrı bir ticari lisans olmadan kullanılamaz. Ağırlıklar araştırma ve ticari olmayan amaçlar için ücretsiz olarak indirilebilir ve kullanılabilir. Yukarıdaki lisans bölümüne ve denemek için ücretsiz yöntemler için ücretsiz katman kılavuzuna bakın.
2.1'in Qwen-Image-2.0'dan farkı nedir? Aynı 7B boyutu ve birleşik oluşturma-artı-düzenleme tasarımı. 2.1'deki yenilikler: yerel RGBA çıktısı ve düzenleme, 10 adede kadar referans görüntü, maske ve açıklama odaklı yerel düzenlemeler, daha hızlı çoklu görüntü düzenleme için KV önbellek yeniden kullanımıyla karma-granüler dikkat yolu ve geliştirilmiş tipografi ve portre detayı.
Qwen Image 3.0 ile aynı mı? Hayır. 3.0 ve 3.0 Pro, Temmuz 2026'da açık ağırlıkları olmadan piyasaya sürülen barındırılan API modelleridir; 2.1 açık ağırlıklı modeldir. Karşılaştırma, fiyat ve yetenek farklılıklarını kapsar.
Hangi donanıma ihtiyaç duyar? Qwen VRAM gereksinimlerini yayınlamadı. Referans kod, pipeline'ı bfloat16'da tek bir CUDA cihazında yükler ve CPU offload sunar; topluluk servis yığınları FP8 ekler. 40 adımda 2K çıktı için bir veri merkezi veya yüksek seviye tüketici GPU'su bekleyin.
Sadece şeffaf görüntüler oluşturmakla kalmayıp, düzenleyebilir mi? Evet. Lansman örnekleri, alfa kanalını korurken bir nesnenin ifadesini değiştirir ve şeffaf bir katman içindeki metni değiştirir, ayrıca bir RGB fotoğrafından RGBA bir nesneyi çıkarır.
Sıradaki adımlar
Qwen-Image-2.1, tek bir kontrol noktasında başka hiçbir modelin sunmadığı yerel şeffaflık gibi güçlü bir açık düzenleme modelidir ve onu kullanıp kullanamayacağınızı belirleyen bir kısıtlama, araştırma lisansı vardır. Nasıl yapılır kılavuzu ile yerel olarak çalıştırın, ücretsiz seçenekler aracılığıyla GPU olmadan deneyin ve taahhüt etmeden önce barındırılan 3.0 API'sini karşılaştırın. Hangisini seçerseniz seçin, uç noktayı Apidog'da test altına alın, böylece bir model değişikliği ürününüzü sessizce bozmasın.
