Qwen-Image-2.1 Nedir? Doğal Şeffaflığa Sahip 7B Açık Kaynaklı Görüntü Modeli

Qwen-Image-2.1 açıklandı: 20 Eylül'de yayımlanan açık ağırlıklar, 7B birleşik üretim ve düzenleme yeteneği, yerel RGBA çıktısı, 10 referans görseli ve ticari kullanımı sınırlayan araştırma lisansı.

Ashley Innocent

Ashley Innocent

21 September 2026

Qwen-Image-2.1 Nedir? Doğal Şeffaflığa Sahip 7B Açık Kaynaklı Görüntü Modeli

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Alibaba'nın Qwen ekibi, Qwen-Image-2.1'i 20 Eylül 2026'da açık kaynak olarak yayınladı. Bu, metinden görüntüye oluşturma ve görüntü düzenleme yapan tek bir modeldir; görsel oluşturma bileşeninde 7 milyar parametreye sahiptir ve arka plan kaldırma işlemiyle sahtesini yapmak yerine doğrudan bir komut isteminden şeffaf PNG'ler çıktısı verebilir. Lansman yazısı dört değişiklik listeliyor: daha hafif, daha hızlı bir mimari, yerel şeffaflık, 10 adede kadar referans görüntü ile düzenleme ve daha iyi tipografi ve portre detayı. Ağırlıklar Hugging Face ve ModelScope'ta, kod ise GitHub'da bulunmaktadır.

Model kartındaki tek bir satır, herhangi bir özellikten daha önemlidir: lisans, Apache 2.0 değil, Qwen Araştırma Lisansı'dır. Ticari kullanım ayrı bir anlaşma gerektirir. Eğer bir ürün için 2.1'i değerlendiriyorsanız, benchmark'lardan önce o bölümü okuyun. Eğer çalıştırmak istiyorsanız, Qwen-Image-2.1 nasıl yapılır kılavuzu diffusers kodunu ve Apidog'da test edebileceğiniz bir HTTP sarmalayıcıya sahiptir. Eğer barındırılan Qwen Image 3.0 API'si ile karşılaştırıyorsanız, 2.1 ve 3.0 karşılaştırması karar sayfanızdır.

Qwen-Image-2.1'e bir bakış

Öğe Detay (lansman yazısı, model kartı, GitHub README)
Yayın tarihi 20 Eylül 2026
Ne işe yarar Tek bir modelde metinden görüntüye ve görüntü düzenleme, şeffaf (RGBA) çıktı dahil
Görsel oluşturucu 32 Tek Akışlı DiT katmanı, 7 milyar parametre
Metin kodlayıcı Qwen3-VL 8B
VAE 64 kanallı RGBA otomatik kodlayıcı, 16x uzaysal sıkıştırma
Varsayılan çıktı 2048 x 2048; yedi en boy oranı 2752 x 1536'ya kadar
Referans görüntüler Düzenleme başına 10 adede kadar
Yerel düzenleme Daireler, boyalı notlar veya ayrı bir maske görüntüsü
Yardımcı modeller Qwen-Image-2.1-PE-T2I ve PE-I2I komut istemi yeniden yazma modelleri (Qwen3.5-VL 9B ince ayarları)
Lisans Qwen Araştırma Lisans Sözleşmesi; ticari kullanım ayrı bir lisans gerektirir
Deneyin Hugging Face Space, Qwen Chat, ComfyUI (lansman gününden beri yerel destek)

Qwen-Image serisindeki yeri

Orijinal Qwen-Image, Ağustos 2025'te metin oluşturma özelliğiyle bilinen 20B MMDiT modeli olarak piyasaya sürüldü ve Qwen-Image-Edit ayrı bir düzenleme modeliydi. 2025'in sonlarına doğru seri daha da ayrıldı: gerçekçilik için 2512 yenilemesi, çoklu kişi tutarlılığı için Edit-2511 ve Aralık ayında şeffaf katmanlar için Qwen-Image-Layered. Qwen-Image-2.0, Şubat 2026'da oluşturma ve düzenlemeyi yerel 2K çıktılı tek bir 7B modelde birleştirdi.

Sürüm 2.1, 2.0'ın boyutunu ve birleşik tasarımını koruyor ve Layered modelinin şeffaflığını içeriyor, böylece tek bir kontrol noktası eskiden üç modelin yaptığı işi artık kapsıyor. Ayrıca yeni bir çıkarım yolu (aşağıda daha fazlası) ve maskeler ve çoklu referanslar etrafında inşa edilmiş bir düzenleme arayüzü de elde ediyor. Buna paralel olarak, Alibaba barındırılan bir seri çalıştırıyor: Qwen Image 3.0 ve 3.0 Pro, Temmuz 2026'da yayınlanmış ağırlıkları olmayan API modelleri olarak piyasaya sürüldü. Yani adlandırma bir sıralama değil, bir çatal. 2.1, indirdiğiniz açık modeldir; 3.0 ise kiraladığınız modeldir.

2.1'deki yenilikler

Daha hafif bir mimari ve daha hızlı bir düzenleme yolu

Görsel oluşturucu, 8B Qwen3-VL kodlayıcı ve yerel olarak bir alfa kanalı taşıyan bir VAE ile eşleştirilmiş, 7 milyar parametreli 32 Tek Akışlı DiT katmanıdır. İlginç mühendislik dikkat çekiyor. Qwen buna karma-granülerlik diyor: metin belirteçleri (sistem öneki ve düzenleme talimatınız) belirteç düzeyinde nedensel bir maske kullanırken, görüntü oluşturma yığın düzeyinde bir maske kullanıyor. Giriş görüntüleri ve talimat, gürültü giderme adımları boyunca statik olduğundan, model anahtar-değer önbelleğini ilk adımda bir kez hesaplar ve yeniden kullanır. Qwen'in belirttiği kazanç, birkaç referans görüntüyle düzenleme yaparken daha düşük gecikme ve bellek kullanımıdır, bu da tam olarak 10 görüntülük sınırlamayla ağırlaşan iş yüküdür.

Zamanlayıcı, Euler ayrık adımlarıyla akış eşleştirmesidir ve referans kod varsayılan olarak 40 adım çalıştırır.

Aynı modelde yerel şeffaflık

Bu manşet. Komut isteminde şeffaf bir görüntü istersiniz ve model RGBA döndürür. README'deki önerilen ifade harfidir: "Bu şeffaflığa sahip bir RGBA görüntüsüdür" ile başlayın ve arka planın şeffaf olduğunu söyleyin. Lansman yazısı, tek nesneleri, çok öğeli kompozisyonları ve şeffaf girişlerde üç düzenleme durumunu gösteriyor: alfa kanalını korurken bir nesnenin ifadesini değiştirmek, şeffaf bir katman içindeki metni değiştirmek ve sıradan bir RGB fotoğraftan bir nesneyi RGBA kesiti olarak çıkarmak.

Ürün ekipleri için bu, iki modelli bir pipeline'ı (oluştur, sonra matla) tek bir çağrıyla değiştirir. Ayrıca, alfa sonradan çıkarılmak yerine oluşturulduğu için, arka plan kaldırma araçlarının saç ve cam etrafında bıraktığı hale artefaktlarını da ortadan kaldırır. Kenarların kendi varlıklarınızda 2K'da dayanıp dayanmadığı varsaymak yerine test edilmesi gereken bir şeydir; ücretsiz katman kılavuzu, GPU olmadan bu testlerin nerede yapılacağını gösterir.

10'a kadar referans ve gerçek bölge kontrolü ile düzenleme

Lansman örneklerinde üç düzenleme özelliği öne çıkıyor:

Aynı düzenleme yolu, bir selfieden panoramalar, bir ürün fotoğrafından infografikler ve üç görünümlü bir karakter sayfasından storyboard'lar oluşturur. Ardışık yerel düzenlemeler, yazının bir kapibara klibiyle gösterdiği kısa animasyonlara dönüştürülebilir.

Tipografi ve portre kalitesi

Qwen, ilk Qwen-Image'dan bu yana açık metin oluşturmada lider olmuştur ve 2.1, bunu sadece yazım değil, tip stilini, düzenini ve metnin kompozisyonda nasıl yer aldığını da kapsayacak şekilde genişletmektedir. Portre aydınlatması ve ince detaylar da iyileştirilmiştir. Lansman yazısı bunu, açık ve kapalı modellere karşı bir Qwen-Image-Bench grafiğiyle desteklemektedir; grafik bir görüntüdür ve yazı herhangi bir sayı vermediği için burada herhangi bir alıntı yapmıyoruz.

Lisans: açık ağırlıklar, araştırma koşulları

Orijinal Qwen-Image Apache 2.0 idi. Qwen-Image-2.1, Qwen Araştırma Lisans Sözleşmesi altında yayınlanmıştır ve lisans metni önemli noktayı kısa ve net bir şekilde belirtir:

Komut istemi yeniden yazma yardımcıları aynı koşullar altında gönderilir. Bir hobi projesi, bir araştırma makalesi veya dahili bir değerlendirme için bu uygundur. Bir SaaS özelliği için ise, önce Alibaba ile bir görüşme yapılması veya sıradan ticari koşullara ve resim başına bir fiyata sahip barındırılan 3.0 API'sinin kullanılması anlamına gelir.

İki komut istemi yeniden yazma modeli

Qwen, jeneratörle birlikte Qwen-Image-2.1-PE-T2I ve Qwen-Image-2.1-PE-I2I'yi yayınladı. PE-T2I, herhangi bir dilde kısa bir istek alan ve ayrıntılı bir İngilizce komut istemi ve önerilen bir en boy oranı içeren JSON döndüren ince ayarlı bir Qwen3.5-VL 9B'dir. PE-I2I, düzenleme karşılığıdır [DOĞRULA]. İsteğe bağlıdırlar ve demo Space'in tek satırlık girişlerden uzun, yapılandırılmış komut istemleri elde etmesini sağlarlar. Eğer 2.1 etrafında bir API oluşturuyorsanız, bu, ChatGPT Images gibi ürünlerin görünmez bir şekilde yaptığı "komut istemi iyileştirme" adımıdır.

Lansmanda bahsedilmeyenler

Bir API'nin arkasına koymak ve test etmek

Çoğu ekip, uygulama kodundan bir diffusers pipeline'ı çağırmaz. Bunun yerine, bir GPU kutusunda bir HTTP hizmetiyle sarmalar ve onu çağırır. Bir kez bir uç nokta olduğunda, diğer herhangi bir API gibi olur ve Apidog, onu tasarlayacağınız ve test edeceğiniz yerdir: istek şemasını tanımlayın (komut istemi, isteğe bağlı referans görüntüler, en boy oranı, şeffaflık bayrağı), gerçek çağrılar gönderin, yanıtın alfa kanallı bir PNG olduğunu doğrulayın ve iyi durumları, her model güncellemesinden sonra tekrar çalıştırdığınız bir regresyon paketine dönüştürün. Uç noktayı da taklit edebilirsiniz, böylece GPU meşgulken ön uç ekibi kararlı bir sözleşmeye karşı geliştirme yapar. Nasıl yapılır kılavuzu, bu sarmalayıcıyı ve Apidog testlerini adım adım açıklar.

Takip etmek için Apidog'u indirin.

Sıkça Sorulan Sorular

Qwen-Image-2.1 ticari olarak ücretsiz kullanılabilir mi? Hayır, Qwen'den ayrı bir ticari lisans olmadan kullanılamaz. Ağırlıklar araştırma ve ticari olmayan amaçlar için ücretsiz olarak indirilebilir ve kullanılabilir. Yukarıdaki lisans bölümüne ve denemek için ücretsiz yöntemler için ücretsiz katman kılavuzuna bakın.

2.1'in Qwen-Image-2.0'dan farkı nedir? Aynı 7B boyutu ve birleşik oluşturma-artı-düzenleme tasarımı. 2.1'deki yenilikler: yerel RGBA çıktısı ve düzenleme, 10 adede kadar referans görüntü, maske ve açıklama odaklı yerel düzenlemeler, daha hızlı çoklu görüntü düzenleme için KV önbellek yeniden kullanımıyla karma-granüler dikkat yolu ve geliştirilmiş tipografi ve portre detayı.

Qwen Image 3.0 ile aynı mı? Hayır. 3.0 ve 3.0 Pro, Temmuz 2026'da açık ağırlıkları olmadan piyasaya sürülen barındırılan API modelleridir; 2.1 açık ağırlıklı modeldir. Karşılaştırma, fiyat ve yetenek farklılıklarını kapsar.

Hangi donanıma ihtiyaç duyar? Qwen VRAM gereksinimlerini yayınlamadı. Referans kod, pipeline'ı bfloat16'da tek bir CUDA cihazında yükler ve CPU offload sunar; topluluk servis yığınları FP8 ekler. 40 adımda 2K çıktı için bir veri merkezi veya yüksek seviye tüketici GPU'su bekleyin.

Sadece şeffaf görüntüler oluşturmakla kalmayıp, düzenleyebilir mi? Evet. Lansman örnekleri, alfa kanalını korurken bir nesnenin ifadesini değiştirir ve şeffaf bir katman içindeki metni değiştirir, ayrıca bir RGB fotoğrafından RGBA bir nesneyi çıkarır.

Sıradaki adımlar

Qwen-Image-2.1, tek bir kontrol noktasında başka hiçbir modelin sunmadığı yerel şeffaflık gibi güçlü bir açık düzenleme modelidir ve onu kullanıp kullanamayacağınızı belirleyen bir kısıtlama, araştırma lisansı vardır. Nasıl yapılır kılavuzu ile yerel olarak çalıştırın, ücretsiz seçenekler aracılığıyla GPU olmadan deneyin ve taahhüt etmeden önce barındırılan 3.0 API'sini karşılaştırın. Hangisini seçerseniz seçin, uç noktayı Apidog'da test altına alın, böylece bir model değişikliği ürününüzü sessizce bozmasın.

button

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin