Alibaba bietet jetzt zwei Qwen-Bildlinien an, die keine gemeinsame Versionssequenz teilen. Qwen-Image-2.1, veröffentlicht am 20. September 2026, ist das Modell mit offenen Gewichten: 7B Parameter im Generator, native transparente Ausgabe, Bearbeitung mit bis zu 10 Referenzen, herunterladbar von Hugging Face. Qwen Image 3.0 und 3.0 Pro, angekündigt am 22. Juli und seit dem 4. August 2026 über die API verfügbar, sind gehostete Modelle mit Preisen pro Bild und ohne veröffentlichte Gewichte. Die Nummer sagt „3.0 ist neuer“, aber die ehrliche Darstellung ist, dass sie unterschiedliche Fragen beantworten: Möchten Sie das Modell selbst betreiben oder mieten?
Diese Seite stellt die beiden Modelle in Bezug auf Lizenz, Kosten, Funktionen und Betrieb gegenüber und schließt mit einer Entscheidungstabelle. Für eine detaillierte Beschreibung der Funktionen von 2.1 siehe Was ist Qwen-Image-2.1; für Code, die Anleitung. Egal, wofür Sie sich entscheiden, beide enden als HTTP-Endpunkt, den Ihre App aufruft, und Apidog kann beide hinter einer Sammlung halten, sodass ein Wechsel eine Konfigurationsänderung ist.
Nebeneinander
| Qwen-Image-2.1 | Qwen Image 3.0 / 3.0 Pro | |
|---|---|---|
| Veröffentlichung | 20. September 2026 | Angekündigt am 22. Juli 2026; API am 4. August 2026 |
| Verteilung | Offene Gewichte (Hugging Face, ModelScope) | Nur gehostete API; keine veröffentlichten Gewichte [ÜBERPRÜFEN] |
| Lizenz / Bedingungen | Qwen Research License; kommerzielle Nutzung erfordert eine separate Lizenz | Standard-API-Nutzungsbedingungen |
| Preis | Ihre GPU-Zeit | qwen-image-3.0: $0.03 pro Bild (1K oder 2K). qwen-image-3.0-pro: $0.04 bei 1K, $0.075 bei 2K. Eingabebilder $0.003 pro StĂĽck [ĂśBERPRĂśFEN] |
| Generatorgröße | 7B (32 Single-Stream DiT-Schichten) + Qwen3-VL 8B Encoder | Nicht offengelegt |
| Max. Auflösung | Standard 2048 x 2048; bis zu 2752 x 1536 | 2048 x 2048 |
| Transparente Ausgabe | Native RGBA-Generierung und -Bearbeitung | Nicht beworben |
| Referenzbilder | Bis zu 10 | Eingabebilder unterstützt (Preis pro Bild); Limit nicht veröffentlicht [ÜBERPRÜFEN] |
| Lokale Bearbeitung | Kreise, bemalte Anmerkungen, separate Maske | Nicht im Startmaterial beworben |
| Textdarstellung | Verbesserte Typografie, Stil und Layout | Headline-Funktion: feiner Text um 10 px, 12 Sprachen (selbst angegeben) |
| Ausgaben pro Aufruf | Eine (Sie loopen) | Bis zu 6 |
| Prompt-Länge | Nicht angegeben | Etwa 4,5K Tokens bei Pro (offizielle Angabe) |
| Prompt-Umschreibung | Separate PE-T2I / PE-I2I-Modelle, die Sie selbst ausfĂĽhren | Server-seitig gehandhabt |
| Wo man es ausprobieren kann | HF Space, Qwen Chat, ComfyUI | Model Studio Konsole, Qwen Chat |
Quellen fĂĽr die Spalte 3.0 sind die Alibaba-AnkĂĽndigung vom Juli und die QwenCloud-Dokumente, zusammengefasst von LLM Stats; ĂĽberprĂĽfen Sie die Preistabelle im Model Studio, bevor Sie budgetieren, da die Bildpreise regional unterschiedlich sind.
Die Lizenz ist der erste Filter
Für die meisten Teams beendet diese Zeile den Vergleich. Die 2.1 Lizenz besagt, dass Sie „die Materialien nicht für kommerzielle Zwecke ohne eine separate kommerzielle Lizenz verwenden dürfen.“ Das unterscheidet sich von den Apache 2.0-Bedingungen, unter denen das ursprüngliche Qwen-Image ausgeliefert wurde, und bedeutet, dass eine kundenorientierte Funktion, die auf 2.1 basiert, eine E-Mail an das Qwen-Business-Team und eine unterzeichnete Vereinbarung vor dem Start erfordert.
Qwen Image 3.0 ist eine kostenpflichtige API mit Standard-Geschäftsbedingungen. Sie zahlen pro Bild und können versenden.
Also: Forschung, Evaluierung, interne Tools oder ein Projekt, bei dem Sie bereit sind, eine Lizenz zu verhandeln, ist 2.1 eine Option. Eine Produktfunktion, die dieses Quartal ohne Rechtsbudget ausgeliefert wird, ist 3.0 die Standardeinstellung.
Kosten: eine GPU-Rechnung vs. drei Cent pro Bild
Der Standardtarif von 3.0 beträgt 0,03 US-Dollar pro Bild bei jeder Auflösung, sodass 10.000 Bilder pro Monat 300 US-Dollar kosten, plus 0,003 US-Dollar pro Eingabebild bei Bearbeitungen. Pro verdoppelt sich bei 2K.
Das Selbst-Hosting von 2.1 hat keinen Preis pro Bild, aber die Rechnung ist nur bei hohem Volumen und mit einer GPU, die Sie sonst ungenutzt lassen würden, günstig. Qwen veröffentlicht keine Durchsatzwerte, also messen Sie Ihre eigenen: Bei 40 Schritten und 2048 x 2048 auf einer einzelnen Rechenzentrums-GPU zählen Sie Bilder pro Stunde, teilen Sie den Stundensatz und vergleichen Sie mit 0,03 US-Dollar. Die Bearbeitung mit vielen Referenzen ist dort, wo die KV-Cache-Wiederverwendung von 2.1 hilft, da Referenzbilder einmal pro Anfrage und nicht pro Schritt kodiert werden. Wenn Ihre GPU mit anderen Arbeitslasten geteilt wird, denken Sie daran, dass die Bilderzeugung sie während Spitzenzeiten stark beanspruchen wird.
Eine Faustregel: Bei weniger als ein paar tausend Bildern pro Monat ist die API günstiger, wenn man die Ingenieurzeit berücksichtigt. Bei über zehntausend Bildern pro Monat mit konstanter Last und einer bestehenden Lizenzvereinbarung gewinnt das Selbst-Hosting. Dazwischen hängt es davon ab, ob Sie bereits GPUs betreiben.
Funktionen: Transparenz vs. dichter Text
Die beiden Modelle wurden fĂĽr unterschiedliche Aufgaben entwickelt.
Wählen Sie 2.1, wenn die Ausgabe einen Alphakanal benötigt. Aufkleber, Produktfreisteller, UI-Assets, geschichtete Kompositionen, das Extrahieren eines Motivs aus einem Foto als RGBA: 2.1 erledigt dies nativ im selben Modell, einschließlich der Bearbeitung einer transparenten Ebene, ohne deren Transparenz zu verlieren. Das Startmaterial von 3.0 erwähnt keine Alpha-Ausgabe. Dies mit 3.0 zu tun, bedeutet einen separaten Schritt zur Hintergrundentfernung mit den damit verbundenen Halo-Artefakten.
Wählen Sie 2.1, wenn die Bearbeitung die Hauptaufgabe ist. Zehn Referenzbilder, Bereichsauswahl nach Kreis, Pinsel oder Maske sowie Detailarbeit an Gesichtern und Produkten stehen im Mittelpunkt der 2.1-Veröffentlichung. Der Launch-Beitrag zeigt Gruppenfotos aus sechs Porträts, Outfits aus fünf Produktaufnahmen und einen möblierten Raum aus zehn Möbelfotos.
Wählen Sie 3.0, wenn das Bild hauptsächlich Text enthält. Dashboards, Wireframes, Poster und slide-ähnliche Layouts mit feinem Text in vielen Sprachen sind das, wofür 3.0 optimiert wurde. 2.1 verbesserte ebenfalls die Typografie, aber 3.0s „10 px Text in 12 Sprachen“ ist die stärkere veröffentlichte Behauptung, und sein 4,5K-Token-Prompt-Budget bei Pro eignet sich für lange Layout-Spezifikationen.
Wählen Sie 3.0, wenn Sie mehrere Kandidaten pro Aufruf benötigen. Bis zu sechs Ausgaben pro Anfrage ist eine Workflow-Funktion, die 2.1 nicht bietet; mit 2.1 iterieren Sie über Seeds.
Keine der Anbieterseiten veröffentlicht eine Benchmark-Tabelle mit Zahlen. Der 2.1-Beitrag zeigt eine Qwen-Image-Bench-Tabelle; die 3.0-Angaben sind selbst gemeldet. Betrachten Sie beides als Anregung für Ihre eigene Bewertung, die der Abschnitt Apidog wiederholbar macht.
Betrieb: Was Sie besitzen
Das Selbst-Hosting von 2.1 bedeutet, dass Sie Folgendes besitzen: Modelldownloads und -aktualisierungen, eine GPU mit ausreichend Speicher (Qwen veröffentlicht keine VRAM-Tabelle; das README bietet CPU-Offload und verweist auf vLLM-Omni mit FP8, SGLang und LightX2V), einen Serving-Wrapper, Warteschlangen bei Spitzenlast und die beiden optionalen Prompt-Rewriting-Modelle, wenn Sie möchten, dass Ein-Zeilen-Prompts funktionieren. Im Gegenzug erhalten Sie Datenlokalität, keine Ratenbegrenzungen außer Ihren eigenen und eine feste Modellversion, die niemand unter Ihnen ändert.
Die Verwendung von 3.0 bedeutet, dass Sie Folgendes besitzen: ein Alibaba Cloud-Konto und die Wahl der Region, API-Schlüssel, die Handhabung von Ratenbegrenzungen und das Risiko, dass das gehostete Modell sein Verhalten zwischen Ihrem Testlauf und der Produktion ändert. Im Gegenzug erhalten Sie keine Infrastruktur und eine Rechnung pro Bild.
Die Anleitungen fĂĽr die Nano Banana 2 API und die gpt-image-2.5 API behandeln die gleichen gehosteten Kompromisse fĂĽr Google und OpenAI, falls Sie ĂĽber Anbieter hinweg und nicht innerhalb von Qwen vergleichen.
Entscheidungstabelle
| Ihre Situation | Wählen Sie |
|---|---|
| Kommerzielle Funktion dieses Quartal versenden, kein Rechtsbudget | 3.0 |
| Transparente PNGs oder RGBA-Bearbeitung erforderlich | 2.1 (mit Lizenz, falls kommerziell) |
| Bearbeitung mit vielen Referenzbildern | 2.1 |
| Textlastige Layouts in mehreren Sprachen | 3.0 |
| Forschung, Evaluierung, interne Tools | 2.1 |
| Unter ein paar tausend Bildern pro Monat | 3.0 |
| Zehntausende pro Monat, GPUs laufen bereits, Lizenz unterzeichnet | 2.1 |
| Daten dĂĽrfen Ihr Netzwerk nicht verlassen | 2.1 |
| Sechs Kandidaten pro Anfrage gewĂĽnscht | 3.0 |
Beide hinter einer Sammlung betreiben
Die praktische Antwort fĂĽr viele Teams sind beide: 2.1 fĂĽr die transparente Asset-Pipeline und interne Tools, 3.0 fĂĽr die kundenorientierten Textlayouts. Das funktioniert sauber, wenn die beiden hinter einem Vertrag leben.
In Apidog definieren Sie einen POST /v1/images Endpunkt einmal, mit prompt, aspect, transparent, seed und einem references Dateifeld, und richten zwei Umgebungen ein: base_url, die auf Ihren 2.1 Wrapper zeigt (die Anleitung enthält eine 40-zeilige FastAPI-Version) und eine zweite, die auf einen Adapter für den 3.0 Endpunkt von Model Studio zeigt. Dann:
- Senden Sie denselben Prompt-Satz mit festen Seeds an beide und speichern Sie die Antworten als Testfälle.
- PrĂĽfen Sie, was sich unterscheidet:
Content-Type, Mindestgröße der Antwort und für 2.1 derX-Image-Mode: RGBAHeader, wenn Transparenz angefordert wird. - Zeichnen Sie die Antwortzeit pro Anfrage auf; Apidog zeigt sie bei jedem Lauf an, was die von Qwen nicht veröffentlichte Durchsatznummer ist.
- Führen Sie das Szenario wöchentlich aus. Wenn sich das gehostete Verhalten von 3.0 ändert oder Sie 2.1 gegen einen quantisierten Build austauschen, erscheint der Unterschied im Bericht, nicht in Support-Tickets.
- Mocken Sie den Endpunkt, damit das Frontend auf Basis des Vertrags erstellt wird, während die Modellauswahl noch offen ist.
Laden Sie Apidog herunter und importieren Sie den Endpunkt, um mit dem Vergleich zu beginnen.
FAQ
Ist Qwen Image 3.0 Open Source? Für 3.0 oder 3.0 Pro wurden keine öffentlichen Gewichte veröffentlicht; es handelt sich um gehostete API-Modelle [ÜBERPRÜFEN]. Qwen-Image-2.1 ist die Open-Weights-Version.
Kann ich Qwen-Image-2.1 kommerziell nutzen? Nur mit einer separaten kommerziellen Lizenz von Qwen. Die standardmäßige Qwen Research License schließt die kommerzielle Nutzung aus.
Welches ist gĂĽnstiger? Bei geringem Volumen 3.0 fĂĽr 0,03 US-Dollar pro Bild. Bei hohem, konstantem Volumen auf Hardware, die Sie bereits betreiben, 2.1, nachdem Sie eine Lizenz erhalten und Ihren eigenen Durchsatz gemessen haben.
Generiert 3.0 transparente Bilder? Es wird nicht beworben. Die native RGBA-Ausgabe ist eine Funktion von 2.1; siehe Was ist Qwen-Image-2.1.
Kann ich beides kostenlos ausprobieren? 2.1 hat einen Hugging Face Space und Qwen Chat-Zugriff; der Guide fĂĽr den kostenlosen Tarif listet die Optionen auf. 3.0 ist im Qwen Chat und ĂĽber das Testkontingent von Model Studio verfĂĽgbar, das je nach Region variiert.
Nächste Schritte
2.1 und 3.0 sind eine Abspaltung, kein Upgrade-Pfad. Die Lizenz entscheidet die erste Frage, die Arbeitslast die zweite und das Volumen die dritte. Egal, wofür Sie sich entscheiden, sichern Sie es mit einem Vertrag ab, den Sie testen: Die Anleitung erstellt die 2.1-Seite, und dieselbe Apidog-Sammlung kann die 3.0-Seite ansteuern, sobald Sie sie benötigen.
