Was ist Qwen-Image-2.1? Das 7B Open-Source-Bildmodell mit nativer Transparenz

Qwen-Image-2.1 erklärt: Open-Weights-Veröffentlichung am 20. Sept., 7B vereinheitlichte Generierung und Bearbeitung, native RGBA-Ausgabe, 10 Referenzbilder und die Forschungslizenz, die die kommerzielle Nutzung einschränkt.

Ashley Innocent

Ashley Innocent

21 September 2026

Was ist Qwen-Image-2.1? Das 7B Open-Source-Bildmodell mit nativer Transparenz

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Das Qwen-Team von Alibaba hat Qwen-Image-2.1 am 20. September 2026 als Open-Source veröffentlicht. Es ist ein einziges Modell, das Text-zu-Bild-Generierung und Bildbearbeitung durchführt, mit 7 Milliarden Parametern in seiner visuellen Generierungskomponente, und es kann transparente PNGs direkt aus einem Prompt ausgeben, anstatt sie durch einen Hintergrundentfernungsdurchlauf zu fälschen. Der Launch-Post listet vier Änderungen auf: eine leichtere, schnellere Architektur, native Transparenz, Bearbeitung mit bis zu 10 Referenzbildern sowie verbesserte Typografie und Porträtdetails. Die Gewichte sind auf Hugging Face und ModelScope verfügbar, und der Code ist auf GitHub.

Eine Zeile in der Modellkarte ist wichtiger als jede Funktion: Die Lizenz ist die Qwen Research License, nicht Apache 2.0. Kommerzielle Nutzung erfordert eine separate Vereinbarung. Wenn Sie 2.1 für ein Produkt evaluieren, lesen Sie diesen Abschnitt vor den Benchmarks. Wenn Sie es ausführen möchten, enthält die Qwen-Image-2.1-Anleitung den Diffuser-Code und einen HTTP-Wrapper, den Sie in Apidog testen können. Wenn Sie es mit der gehosteten Qwen Image 3.0 API vergleichen, ist der 2.1 vs 3.0 Vergleich die Entscheidungsseite.

Qwen-Image-2.1 auf einen Blick

Element Details (Launch-Post, Modellkarte, GitHub README)
Veröffentlichungsdatum 20. September 2026
Funktionsweise Text-zu-Bild-Generierung und Bildbearbeitung in einem Modell, einschließlich transparenter (RGBA) Ausgabe
Visueller Generator 32 Single-Stream DiT-Ebenen, 7 Mrd. Parameter
Text-Encoder Qwen3-VL 8B
VAE 64-Kanal-RGBA-Autoencoder, 16-fache räumliche Kompression
Standardausgabe 2048 x 2048; sieben Seitenverhältnisse bis zu 2752 x 1536
Referenzbilder Bis zu 10 pro Bearbeitung
Lokale Bearbeitung Kreise, gemalte Anmerkungen oder ein separates Maskenbild
Begleitmodelle Qwen-Image-2.1-PE-T2I und PE-I2I Prompt-Rewriting-Modelle (Qwen3.5-VL 9B Fine-Tunes)
Lizenz Qwen Research License Agreement; kommerzielle Nutzung erfordert eine separate Lizenz
Probieren Sie es aus Hugging Face Space, Qwen Chat, ComfyUI (native Unterstützung seit dem Launch-Tag)

Wo es sich in der Qwen-Image-Linie einordnet

Das ursprüngliche Qwen-Image wurde im August 2025 als 20B MMDiT-Modell, bekannt für Text-Rendering, ausgeliefert, mit Qwen-Image-Edit als separatem Bearbeitungsmodell. Bis Ende 2025 spaltete sich die Linie weiter auf: das 2512-Update für Realismus, Edit-2511 für Multi-Personen-Konsistenz und Qwen-Image-Layered im Dezember für transparente Ebenen. Qwen-Image-2.0 im Februar 2026 fasste Generierung und Bearbeitung in einem 7B-Modell mit nativer 2K-Ausgabe zusammen.

Version 2.1 behält die Größe und das vereinheitlichte Design von 2.0 bei und integriert die Transparenz des Layered-Modells, sodass ein Checkpoint nun abdeckt, was früher drei erforderte. Es erhält auch einen neuen Inferenzpfad (mehr dazu unten) und eine Bearbeitungsoberfläche, die auf Masken und mehreren Referenzen basiert. Parallel dazu betreibt Alibaba eine gehostete Linie: Qwen Image 3.0 und 3.0 Pro wurden im Juli 2026 als API-Modelle ohne veröffentlichte Gewichte gestartet. Die Namensgebung ist also eine Gabelung, keine Reihenfolge. 2.1 ist das offene Modell, das Sie herunterladen; 3.0 ist das Modell, das Sie mieten.

Was ist neu in 2.1

Eine leichtere Architektur und ein schnellerer Bearbeitungspfad

Der visuelle Generator besteht aus 32 Single-Stream DiT-Ebenen mit 7 Mrd. Parametern, gepaart mit dem 8B Qwen3-VL Encoder und einem VAE, der nativ einen Alpha-Kanal trägt. Die interessante Ingenieursleistung liegt in der Aufmerksamkeit. Qwen nennt es gemischte Granularität: Text-Token (das Systempräfix und Ihre Bearbeitungsanweisung) verwenden eine kausale Maske auf Token-Ebene, während die Bildgenerierung eine Maske auf Chunk-Ebene verwendet. Da Eingabebilder und die Anweisung über Denoising-Schritte hinweg statisch sind, berechnet das Modell ihren Key-Value-Cache einmal im ersten Schritt und verwendet ihn wieder. Qwens angegebener Vorteil ist eine geringere Latenz und Speichernutzung beim Bearbeiten mit mehreren Referenzbildern, was genau die Arbeitslast ist, die mit der Begrenzung auf 10 Bilder schwerer wurde.

Der Scheduler verwendet Flow Matching mit Euler-Diskretisierungsschritten, und der Referenzcode läuft standardmäßig mit 40 Schritten.

Native Transparenz im selben Modell

Das ist die Schlagzeile. Sie fragen in der Eingabeaufforderung nach einem transparenten Bild, und das Modell gibt RGBA zurück. Die empfohlene Formulierung aus der README ist wörtlich: Beginnen Sie mit „Dies ist ein RGBA-Bild mit Transparenz“ und geben Sie an, dass der Hintergrund transparent ist. Der Launch-Post zeigt einzelne Motive, Kompositionen mit mehreren Elementen und drei Bearbeitungsfälle bei transparenten Eingaben: Ändern des Ausdrucks eines Motivs unter Beibehaltung des Alpha-Kanals, Ersetzen von Text innerhalb einer transparenten Ebene und Extrahieren eines Motivs aus einem gewöhnlichen RGB-Foto als RGBA-Ausschnitt.

Für Produktteams ersetzt dies eine Zwei-Modell-Pipeline (generieren, dann freistellen) durch einen einzigen Aufruf. Es entfernt auch die Halo-Artefakte, die Hintergrundentferner um Haare und Glas hinterlassen, da der Alpha-Kanal generiert und nicht nachträglich abgeleitet wird. Ob die Kanten bei 2K auf Ihren eigenen Assets halten, ist etwas, das getestet werden sollte, anstatt es anzunehmen; der Free-Tier-Leitfaden zeigt, wo Sie diese Tests ohne GPU durchführen können.

Bearbeitung mit bis zu 10 Referenzen und echter Regionskontrolle

Drei Bearbeitungsfunktionen stechen in den Launch-Beispielen hervor:

Derselbe Bearbeitungspfad verarbeitet Panoramen aus einem Selfie, Infografiken aus einem Produktfoto und Storyboards aus einem Charakterbogen mit drei Ansichten. Sequenzielle lokale Bearbeitungen können zu kurzen Animationen aneinandergereiht werden, was der Beitrag mit einem Capybara-Clip demonstriert.

Typografie und Porträtqualität

Qwen ist seit dem ersten Qwen-Image führend im Open-Text-Rendering, und 2.1 erweitert dies auf Schriftstil, Layout und die Positionierung von Text in der Komposition, anstatt nur die Rechtschreibung zu berücksichtigen. Porträtbeleuchtung und feine Details erhalten ebenfalls eine Überarbeitung. Der Launch-Post untermauert dies mit einem Qwen-Image-Bench-Diagramm im Vergleich zu offenen und geschlossenen Modellen; das Diagramm ist ein Bild und der Post enthält keine Zahlen, daher zitieren wir hier keine.

Die Lizenz: offene Gewichte, Forschungsbedingungen

Das ursprüngliche Qwen-Image war Apache 2.0. Qwen-Image-2.1 wird unter der Qwen Research License Agreement veröffentlicht, und der Lizenztext ist kurz und klar in dem Punkt, der wichtig ist:

Die Prompt-Rewriting-Begleiter werden unter denselben Bedingungen geliefert. Für ein Hobbyprojekt, eine Forschungsarbeit oder eine interne Evaluierung ist dies in Ordnung. Für eine SaaS-Funktion bedeutet dies zuerst ein Gespräch mit Alibaba oder die Nutzung der gehosteten 3.0 API, die mit üblichen kommerziellen Bedingungen und einem Preis pro Bild verbunden ist.

Die beiden Prompt-Rewriting-Modelle

Neben dem Generator veröffentlichte Qwen Qwen-Image-2.1-PE-T2I und Qwen-Image-2.1-PE-I2I. PE-T2I ist ein feinabgestimmtes Qwen3.5-VL 9B, das eine kurze Anfrage in beliebiger Sprache entgegennimmt und JSON mit einem detaillierten englischen Prompt und einem empfohlenen Seitenverhältnis zurückgibt. PE-I2I ist das Bearbeitungs-Gegenstück [VERIFIZIEREN]. Sie sind optional, und sie sind die Art und Weise, wie der Demo Space lange, strukturierte Prompts aus einzeiligen Eingaben erhält. Wenn Sie eine API um 2.1 herum aufbauen, ist dies der „Prompt-Verbesserungs“-Schritt, den Produkte wie ChatGPT Images unsichtbar ausführen.

Was beim Launch nicht gesagt wurde

Es hinter einer API bereitstellen und testen

Die meisten Teams werden keine Diffuser-Pipeline aus Anwendungscode aufrufen. Sie werden es in einen HTTP-Dienst auf einer GPU-Box einpacken und diesen aufrufen. Sobald es ein Endpunkt ist, ist es eine API wie jede andere, und Apidog ist der Ort, an dem Sie sie entwerfen und testen: definieren Sie das Anfrageschema (Prompt, optionale Referenzbilder, Seitenverhältnis, ein Transparenz-Flag), senden Sie echte Aufrufe, stellen Sie sicher, dass die Antwort ein PNG mit einem Alpha-Kanal ist, und verwandeln Sie die erfolgreichen Fälle in eine Regressionstest-Suite, die Sie nach jedem Modell-Update erneut ausführen. Sie können den Endpunkt auch simulieren, damit das Frontend-Team gegen einen stabilen Vertrag entwickeln kann, während die GPU ausgelastet ist. Die Anleitung führt Schritt für Schritt durch diesen Wrapper und die Apidog-Tests.

Laden Sie Apidog herunter, um mitzumachen.

FAQ

Ist Qwen-Image-2.1 kommerziell frei nutzbar? Nein, nicht ohne eine separate kommerzielle Lizenz von Qwen. Die Gewichte können kostenlos für Forschungs- und nicht-kommerzielle Zwecke heruntergeladen und verwendet werden. Siehe den Lizenzabschnitt oben und den Free-Tier-Leitfaden für kostenlose Möglichkeiten, es auszuprobieren.

Wie unterscheidet sich 2.1 von Qwen-Image-2.0? Gleiche 7B-Größe und vereinheitlichtes Generierungs-plus-Bearbeitungsdesign. Neu in 2.1: native RGBA-Ausgabe und -Bearbeitung, bis zu 10 Referenzbilder, masken- und annotationsgesteuerte lokale Bearbeitungen, ein Aufmerksamkeits-Pfad mit gemischter Granularität und KV-Cache-Wiederverwendung für schnellere Bearbeitung mehrerer Bilder sowie verbesserte Typografie und Porträtdetails.

Ist es dasselbe wie Qwen Image 3.0? Nein. 3.0 und 3.0 Pro sind gehostete API-Modelle, die im Juli 2026 ohne offene Gewichte gestartet wurden; 2.1 ist das Modell mit offenen Gewichten. Der Vergleich deckt Preis- und Leistungsunterschiede ab.

Welche Hardware wird benötigt? Qwen hat keine VRAM-Anforderungen veröffentlicht. Der Referenzcode lädt die Pipeline in bfloat16 auf einem CUDA-Gerät und bietet CPU-Offload; Community-Serving-Stacks fügen FP8 hinzu. Erwarten Sie eine Rechenzentrums- oder High-End-Consumer-GPU für 2K-Ausgabe in 40 Schritten.

Kann es transparente Bilder bearbeiten, nicht nur generieren? Ja. Die Launch-Beispiele ändern den Ausdruck eines Motivs und ersetzen Text innerhalb einer transparenten Ebene, während der Alpha-Kanal beibehalten wird, und extrahieren ein RGBA-Motiv aus einem RGB-Foto.

Nächste Schritte

Qwen-Image-2.1 ist ein starkes offenes Bearbeitungsmodell mit einer Funktion, die sonst niemand in einem einzigen Checkpoint liefert, nativer Transparenz, und einer Einschränkung, die entscheidet, ob Sie es verwenden können, der Forschungslizenz. Führen Sie es lokal mit der Anleitung aus, probieren Sie es ohne GPU über die kostenlosen Optionen aus und vergleichen Sie die gehostete 3.0 API, bevor Sie sich festlegen. Egal, wofür Sie sich entscheiden, testen Sie den Endpunkt in Apidog, damit ein Modellwechsel Ihr Produkt niemals stillschweigend beschädigt.

Apidog herunterladen

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen