Qwen-Image-2.1 vs Qwen Image 3.0: modèles ouverts ou l'API hébergée ?

Qwen-Image-2.1 (poids ouverts, licence de recherche, transparence native) contre Qwen Image 3.0 (API hébergée, 0,03 $ par image, texte dense) : licence, coût, capacités et un tableau de décision.

Medy Evrard

28 September 2026

Qwen-Image-2.1 vs Qwen Image 3.0: modèles ouverts ou l'API hébergée ?

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Alibaba propose désormais deux gammes de modèles d'images Qwen qui ne partagent pas la même séquence de versions. Qwen-Image-2.1, sorti le 20 septembre 2026, est le modèle à poids ouverts : 7 milliards de paramètres dans le générateur, sortie transparente native, édition avec jusqu'à 10 références, téléchargeable depuis Hugging Face. Qwen Image 3.0 et 3.0 Pro, annoncés le 22 juillet et disponibles via l'API depuis le 4 août 2026, sont des modèles hébergés avec une tarification par image et sans poids publiés. Le numéro indique que « 3.0 est plus récent », mais la présentation honnête est qu'ils répondent à des questions différentes : souhaitez-vous exécuter le modèle ou le louer ?

Cette page compare les deux modèles côte à côte en termes de licence, de coût, de capacités et d'opérations, et se termine par un tableau de décision. Pour une présentation détaillée des fonctionnalités de la version 2.1, consultez Qu'est-ce que Qwen-Image-2.1 ; pour le code, le guide pratique. Quel que soit votre choix, les deux se présentent comme un point de terminaison HTTP appelé par votre application, et Apidog peut les regrouper derrière une seule collection, ce qui fait du changement une simple modification de configuration.

Comparaison

Qwen-Image-2.1 Qwen Image 3.0 / 3.0 Pro
Date de sortie 20 septembre 2026 Annoncé le 22 juillet 2026 ; API le 4 août 2026
Distribution Poids ouverts (Hugging Face, ModelScope) API hébergée uniquement ; pas de poids publiés [À VÉRIFIER]
Licence / conditions Licence de recherche Qwen ; l'utilisation commerciale nécessite une licence distincte Conditions d'utilisation standard de l'API
Prix Votre temps GPU qwen-image-3.0 : 0,03 $ par image (1K ou 2K). qwen-image-3.0-pro : 0,04 $ pour 1K, 0,075 $ pour 2K. Images d'entrée 0,003 $ chacune [À VÉRIFIER]
Taille du générateur 7 milliards (32 couches DiT à flux unique) + encodeur Qwen3-VL 8 milliards Non divulgué
Résolution maximale 2048 x 2048 par défaut ; jusqu'à 2752 x 1536 2048 x 2048
Sortie transparente Génération et édition RGBA natives Non annoncé
Images de référence Jusqu'à 10 Images d'entrée prises en charge (prix par image) ; limite non publiée [À VÉRIFIER]
Édition locale Cercles, annotations peintes, masque séparé Non annoncé dans le matériel de lancement
Rendu de texte Typographie, style et mise en page améliorés Fonctionnalité phare : texte fin d'environ 10 px, 12 langues (auto-déclaré)
Sorties par appel Une (vous bouclez) Jusqu'à 6
Longueur du prompt Non spécifié Environ 4,5K tokens sur Pro (affirmation officielle)
Réécriture de prompt Modèles PE-T2I / PE-I2I séparés que vous exécutez vous-même Géré côté serveur
Où essayer HF Space, Qwen Chat, ComfyUI Console Model Studio, Qwen Chat

Les sources pour la colonne 3.0 sont l'annonce d'Alibaba de juillet et la documentation QwenCloud telle que résumée par LLM Stats ; vérifiez à nouveau le tableau des prix sur Model Studio avant d'établir votre budget, car la tarification des images est spécifique à chaque région.

La licence est le premier filtre

Pour la plupart des équipes, cette ligne met fin à la comparaison. La licence 2.1 stipule que vous « ne devez pas utiliser les Matériaux à des fins commerciales sans obtenir une licence commerciale distincte ». Cela diffère des conditions Apache 2.0 sous lesquelles le Qwen-Image original a été distribué, et cela signifie qu'une fonctionnalité destinée aux clients, basée sur la version 2.1, nécessite un courriel à l'équipe commerciale de Qwen et un accord signé avant le lancement.

Qwen Image 3.0 est une API payante avec des conditions commerciales standard. Vous payez par image et vous pouvez l'utiliser en production.

Donc : pour la recherche, l'évaluation, les outils internes, ou un projet où vous êtes prêt à négocier une licence, la version 2.1 est envisageable. Une fonctionnalité produit à lancer ce trimestre sans budget juridique, la version 3.0 est le choix par défaut.

Coût : une facture de GPU ou trois centimes par image

Le niveau standard de la version 3.0 est de 0,03 $ par image, quelle que soit la résolution, donc 10 000 images par mois représentent 300 $, plus 0,003 $ par image d'entrée pour les modifications. La version Pro double à 2K.

L'auto-hébergement de la version 2.1 n'a pas de prix par image, mais le calcul n'est favorable qu'à fort volume et avec un GPU que vous laisseriez autrement inactif. Qwen ne publie pas de chiffres de débit, alors mesurez les vôtres : à 40 étapes et 2048 x 2048 sur un seul GPU de centre de données, comptez les images par heure, divisez le taux horaire et comparez à 0,03 $. L'édition avec de nombreuses références est l'endroit où la réutilisation du cache KV de la version 2.1 aide, puisque les images de référence sont encodées une fois par requête plutôt que par étape. Si votre GPU est partagé avec d'autres charges de travail, n'oubliez pas que la génération d'images le monopolisera pendant les pics.

Une règle approximative : pour moins de quelques milliers d'images par mois, l'API est moins chère une fois que vous avez compté le temps d'ingénierie. Au-delà de dizaines de milliers par mois avec une charge constante et un accord de licence en place, l'auto-hébergement est plus avantageux. Entre les deux, cela dépend si vous utilisez déjà des GPU.

Capacités : transparence vs texte dense

Les deux modèles ont été conçus pour des tâches différentes.

Choisissez 2.1 lorsque la sortie nécessite un canal alpha. Autocollants, découpes de produits, éléments d'interface utilisateur, compositions en couches, extraction d'un sujet d'une photo en RGBA : la version 2.1 le fait nativement dans le même modèle, y compris l'édition d'une couche transparente sans perdre sa transparence. Le matériel de lancement de la version 3.0 ne mentionne pas la sortie alpha. Le faire sur la version 3.0 signifie une étape distincte de suppression de l'arrière-plan avec les artefacts de halo qui l'accompagnent.

Choisissez 2.1 lorsque l'édition est la charge de travail principale. Dix images de référence, sélection de région par cercle, peinture ou masque, et travail de fidélité sur les visages et les produits sont au cœur de la version 2.1. L'article de lancement montre des photos de groupe à partir de six portraits, des tenues à partir de cinq photos de produits et une pièce meublée à partir de dix photos de meubles.

Choisissez 3.0 lorsque l'image est principalement du texte. Tableaux de bord, maquettes fonctionnelles, affiches et mises en page de type diapositives avec du texte fin dans de nombreuses langues sont ce pour quoi la version 3.0 a été optimisée. La version 2.1 a également amélioré la typographie, mais l'affirmation publiée de la version 3.0 concernant le « texte de 10 px en 12 langues » est plus solide, et son budget de prompt de 4,5K tokens sur Pro convient aux longues spécifications de mise en page.

Choisissez 3.0 lorsque vous avez besoin de plusieurs candidats par appel. Jusqu'à six sorties par requête est une fonctionnalité de flux de travail que la version 2.1 n'a pas ; avec la version 2.1, vous bouclez sur les graines.

Aucune page de fournisseur ne présente un tableau de benchmarks avec des chiffres. L'article sur la version 2.1 montre un graphique Qwen-Image-Bench ; les affirmations de la version 3.0 sont auto-déclarées. Traitez les deux comme des incitations pour votre propre évaluation, que la section Apidog rend reproductible.

Opérations : ce que vous possédez

L'auto-hébergement de la version 2.1 signifie que vous êtes responsable de : les téléchargements et mises à jour du modèle, un GPU avec suffisamment de mémoire (Qwen ne publie pas de tableau de VRAM ; le README propose un déchargement CPU et pointe vers vLLM-Omni avec FP8, SGLang et LightX2V), un wrapper de service, la mise en file d'attente sous charge de pointe, et les deux modèles optionnels de réécriture de prompt si vous souhaitez que les prompts d'une ligne fonctionnent. En retour, vous obtenez la localité des données, aucune limite de taux autre que les vôtres, et une version de modèle fixe que personne ne modifie à votre insu.

Utiliser la version 3.0 signifie que vous êtes responsable de : un compte Alibaba Cloud et le choix de la région, les clés API, la gestion des limites de taux, et le risque que le modèle hébergé change de comportement entre votre exécution de test et la production. En retour, vous obtenez une infrastructure nulle et une facture par image.

Les guides sur l'API Nano Banana 2 et l'API gpt-image-2.5 abordent les mêmes compromis d'hébergement pour Google et OpenAI, si vous comparez entre fournisseurs plutôt qu'au sein de Qwen.

Tableau de décision

Votre situation Choisissez
Lancement d'une fonctionnalité commerciale ce trimestre, pas de budget juridique 3.0
Besoin de PNG transparents ou d'édition RGBA 2.1 (avec une licence si usage commercial)
Édition avec de nombreuses images de référence 2.1
Mises en page riches en texte dans plusieurs langues 3.0
Recherche, évaluation, outils internes 2.1
Moins de quelques milliers d'images par mois 3.0
Dizaines de milliers par mois, GPU déjà en fonctionnement, licence signée 2.1
Les données ne peuvent pas quitter votre réseau 2.1
Souhaitez six candidats par requête 3.0

Exécuter les deux derrière une seule collection

La réponse pratique pour de nombreuses équipes est les deux : la version 2.1 pour le pipeline d'actifs transparents et les outils internes, la version 3.0 pour les mises en page de texte destinées aux clients. Cela fonctionne proprement si les deux sont regroupés derrière un seul contrat.

Dans Apidog, définissez un point de terminaison POST /v1/images une seule fois, avec prompt, aspect, transparent, seed, et un champ de fichier references, et configurez deux environnements : base_url pointant vers votre wrapper 2.1 (le guide pratique propose une version FastAPI de 40 lignes) et un second pointant vers un adaptateur pour le point de terminaison 3.0 de Model Studio. Ensuite :

Téléchargez Apidog et importez le point de terminaison pour commencer la comparaison.

FAQ

Qwen Image 3.0 est-il open source ? Aucun poids public n'a été publié pour les versions 3.0 ou 3.0 Pro ; ce sont des modèles d'API hébergés [À VÉRIFIER]. Qwen-Image-2.1 est la version à poids ouverts.

Puis-je utiliser Qwen-Image-2.1 à des fins commerciales ? Uniquement avec une licence commerciale distincte de Qwen. La licence de recherche Qwen par défaut exclut l'utilisation commerciale.

Lequel est le moins cher ? À faible volume, la version 3.0 à 0,03 $ par image. À volume élevé et constant sur du matériel que vous utilisez déjà, la version 2.1, après avoir obtenu une licence et mesuré votre propre débit.

La version 3.0 génère-t-elle des images transparentes ? Ce n'est pas annoncé. La sortie RGBA native est une fonctionnalité de la version 2.1 ; voir Qu'est-ce que Qwen-Image-2.1.

Puis-je essayer l'un ou l'autre gratuitement ? La version 2.1 est accessible via Hugging Face Space et Qwen Chat ; le guide des offres gratuites liste les options. La version 3.0 est disponible dans Qwen Chat et via le quota d'essai de Model Studio, qui varie selon la région.

Prochaines étapes

Les versions 2.1 et 3.0 sont une bifurcation, pas un chemin de mise à niveau. La licence décide de la première question, la charge de travail de la deuxième, et le volume de la troisième. Quel que soit votre choix, placez-le derrière un contrat que vous testez : le guide pratique construit le côté 2.1, et la même collection Apidog peut servir de façade pour le côté 3.0 le jour où vous en avez besoin.

bouton

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API