L'équipe Qwen d'Alibaba a publié Qwen-Image-2.1 en open-source le 20 septembre 2026. Il s'agit d'un modèle unique qui effectue la génération de texte en image et l'édition d'image, avec 7 milliards de paramètres dans son composant de génération visuelle, et il peut produire des PNG transparents directement à partir d'une invite au lieu de les simuler avec une passe de suppression d'arrière-plan. Le billet de lancement énumère quatre changements : une architecture plus légère et plus rapide, la transparence native, l'édition avec jusqu'à 10 images de référence, et une meilleure typographie et détail des portraits. Les poids sont disponibles sur Hugging Face et ModelScope, et le code est sur GitHub.
Une ligne dans la fiche du modèle est plus importante que n'importe quelle fonctionnalité : la licence est la Qwen Research License, et non Apache 2.0. L'utilisation commerciale nécessite un accord séparé. Si vous évaluez la version 2.1 pour un produit, lisez cette section avant les benchmarks. Si vous souhaitez l'exécuter, le guide d'utilisation de Qwen-Image-2.1 contient le code diffusers et un wrapper HTTP que vous pouvez tester dans Apidog. Si vous le comparez à l'API hébergée Qwen Image 3.0, la comparaison 2.1 vs 3.0 est la page de décision.
Qwen-Image-2.1 en bref
| Élément | Détail (billet de lancement, fiche du modèle, README GitHub) |
|---|---|
| Date de sortie | 20 septembre 2026 |
| Ce qu'il fait | Génération texte-image et édition d'image en un seul modèle, incluant la sortie transparente (RGBA) |
| Générateur visuel | 32 couches DiT à flux unique, 7 milliards de paramètres |
| Encodeur de texte | Qwen3-VL 8B |
| VAE | Auto-encodeur RGBA à 64 canaux, compression spatiale 16x |
| Sortie par défaut | 2048 x 2048 ; sept rapports d'aspect jusqu'à 2752 x 1536 |
| Images de référence | Jusqu'à 10 par édition |
| Édition locale | Cercles, annotations peintes ou une image de masque séparée |
| Modèles compagnons | Modèles de réécriture d'invite Qwen-Image-2.1-PE-T2I et PE-I2I (fine-tuning de Qwen3.5-VL 9B) |
| Licence | Contrat de licence de recherche Qwen ; l'utilisation commerciale nécessite une licence séparée |
| L'essayer | Hugging Face Space, Qwen Chat, ComfyUI (support natif dès le jour du lancement) |
Sa place dans la gamme Qwen-Image
L'original Qwen-Image a été lancé en août 2025 en tant que modèle MMDiT de 20B reconnu pour le rendu de texte, avec Qwen-Image-Edit comme modèle d'édition séparé. Fin 2025, la gamme s'est encore diversifiée : la mise à jour 2512 pour le réalisme, Edit-2511 pour la cohérence multi-personnes, et Qwen-Image-Layered en décembre pour les calques transparents. Qwen-Image-2.0 en février 2026 a fusionné la génération et l'édition en un seul modèle de 7B avec une sortie native 2K.

La version 2.1 conserve la taille et la conception unifiée de la 2.0 et intègre la transparence du modèle Layered, de sorte qu'un seul checkpoint couvre désormais ce qui en nécessitait trois. Elle bénéficie également d'un nouveau chemin d'inférence (plus de détails ci-dessous) et d'une interface d'édition basée sur les masques et les références multiples. Parallèlement, Alibaba propose une gamme hébergée : Qwen Image 3.0 et 3.0 Pro lancés en juillet 2026 en tant que modèles API sans poids publiés. La dénomination est donc une bifurcation, pas une séquence. La 2.1 est le modèle ouvert que vous téléchargez ; la 3.0 est le modèle que vous louez.
Nouveautés de la version 2.1
Une architecture plus légère et un chemin d'édition plus rapide
Le générateur visuel est composé de 32 couches DiT à flux unique avec 7 milliards de paramètres, associé à l'encodeur Qwen3-VL 8B et à un VAE qui gère nativement un canal alpha. L'ingénierie intéressante réside dans l'attention. Qwen l'appelle à granularité mixte : les tokens de texte (le préfixe système et votre instruction d'édition) utilisent un masque causal au niveau du token, tandis que la génération d'images utilise un masque au niveau du bloc. Étant donné que les images d'entrée et l'instruction sont statiques à travers les étapes de débruitage, le modèle calcule leur cache clé-valeur une seule fois lors de la première étape et le réutilise. L'avantage déclaré par Qwen est une latence et une consommation de mémoire réduites lors de l'édition avec plusieurs images de référence, ce qui correspond exactement à la charge de travail qui s'est alourdie avec la limite de 10 images.

Le planificateur utilise l'appariement de flux avec des étapes discrètes d'Euler, et le code de référence exécute 40 étapes par défaut.
Transparence native dans le même modèle
C'est la nouveauté majeure. Vous demandez une image transparente dans l'invite et le modèle renvoie du RGBA. La formulation recommandée du README est littérale : commencez par « C'est une image RGBA avec transparence » et indiquez que l'arrière-plan est transparent. Le billet de lancement présente des sujets uniques, des compositions multi-éléments et trois cas d'édition sur des entrées transparentes : changer l'expression d'un sujet tout en conservant l'alpha, remplacer du texte à l'intérieur d'un calque transparent, et extraire un sujet d'une photo RGB ordinaire comme découpe RGBA.

Pour les équipes produit, cela remplace un pipeline à deux modèles (générer, puis détourer) par un seul appel. Cela élimine également les artefacts de halo que les outils de suppression d'arrière-plan laissent autour des cheveux et du verre, car l'alpha est généré, non inféré après coup. La tenue des bords en 2K sur vos propres ressources est quelque chose à tester plutôt qu'à supposer ; le guide de la version gratuite montre où effectuer ces tests sans GPU.
Édition avec jusqu'à 10 références et contrôle réel des régions
Trois fonctionnalités d'édition se distinguent dans les exemples de lancement :
- Références multiples. Six portraits deviennent une photo de groupe ; un modèle, des vêtements, des chaussures, un sac et un chapeau forment une tenue complète ; dix photos de meubles deviennent une pièce meublée. La limite est de 10 images d'entrée.
- Édition locale de trois manières. Dessinez des cercles colorés et adressez chacun par couleur dans l'invite (« enlever la montre dans le cercle bleu »), peignez sur une région, ou passez l'original intact plus un masque séparé comme deux entrées afin que rien dans la source ne soit masqué.
- Fidélité. Qwen affirme que l'identité faciale et le texte, la texture et la forme des produits survivent mieux aux modifications que dans la version 2.0. Le billet montre des paires avant-après mais aucune métrique, il faut donc considérer cela comme une affirmation à vérifier sur vos propres SKU.
Le même chemin d'édition gère les panoramas à partir d'un selfie, les infographies à partir d'une photo de produit et les storyboards à partir d'une planche de personnage à trois vues. Les éditions locales séquentielles peuvent être enchaînées en courtes animations, ce que le billet démontre avec un clip de capybara.
Typographie et qualité des portraits
Qwen est à la pointe du rendu de texte ouvert depuis le premier Qwen-Image, et la version 2.1 l'étend au style de police, à la mise en page et à la manière dont le texte s'intègre dans la composition plutôt qu'à la seule orthographe. L'éclairage des portraits et les détails fins sont également améliorés. Le billet de lancement étaye cela avec un tableau Qwen-Image-Bench comparant les modèles ouverts et fermés ; le tableau est une image et le billet ne fournit pas de chiffres, nous n'en citons donc aucun ici.
La licence : poids ouverts, conditions de recherche
L'original Qwen-Image était sous Apache 2.0. Qwen-Image-2.1 est publié sous le contrat de licence de recherche Qwen (Qwen Research License Agreement), et le texte de la licence est court et clair sur le point essentiel :
- Vous ne pouvez pas utiliser le modèle « à des fins commerciales sans obtenir une licence commerciale distincte », demandée par e-mail à Qwen.
- La redistribution et les produits dérivés doivent inclure la licence, une mention « Conçu avec Qwen » ou « Amélioré avec Qwen », et la ligne de copyright nommant Hangzhou Tongyi Laboratory.
- Vous ne pouvez pas utiliser « Qwen » comme nom principal d'un produit dérivé.
- L'accord est régi par le droit chinois avec juridiction à Hangzhou.
Les compagnons de réécriture d'invite sont soumis aux mêmes conditions. Pour un projet personnel, un document de recherche ou une évaluation interne, cela convient. Pour une fonctionnalité SaaS, cela implique une discussion préalable avec Alibaba, ou l'utilisation de l'API 3.0 hébergée, qui est soumise à des conditions commerciales ordinaires et à un prix par image.
Les deux modèles de réécriture d'invite
Parallèlement au générateur, Qwen a publié Qwen-Image-2.1-PE-T2I et Qwen-Image-2.1-PE-I2I. PE-T2I est un modèle Qwen3.5-VL 9B affiné qui prend une courte requête dans n'importe quelle langue et renvoie un JSON avec une invite anglaise détaillée et un rapport d'aspect recommandé. PE-I2I est son équivalent pour l'édition [VÉRIFIER]. Ils sont facultatifs et c'est ainsi que l'espace de démonstration obtient des invites longues et structurées à partir d'entrées d'une seule ligne. Si vous construisez une API autour de la version 2.1, c'est l'étape d'« amélioration de l'invite » que des produits comme ChatGPT Images effectuent de manière invisible.
Ce que le lancement n'a pas dit
- Aucun chiffre VRAM par résolution. Le README indique
enable_model_cpu_offload(), vLLM-Omni avec FP8, SGLang et LightX2V pour un service plus léger ou plus rapide, ainsi que le support AMD, mais pas de tableau. - Aucun chiffre de benchmark publié, seulement un graphique.
- Aucune API hébergée pour la version 2.1 sur Model Studio au moment du lancement [VÉRIFIER] ; la gamme hébergée est la 3.0.
- Aucune affirmation de vitesse d'inférence fixe, seulement une « efficacité améliorée » grâce à la réutilisation du cache KV.
Le mettre derrière une API et le tester
La plupart des équipes n'appelleront pas un pipeline diffusers depuis le code d'application. Elles l'encapsuleront dans un service HTTP sur un serveur GPU et l'appelleront. Une fois que c'est un point de terminaison, c'est une API comme les autres, et Apidog est l'endroit où vous la concevez et la testez : définissez le schéma de requête (invite, images de référence facultatives, rapport d'aspect, un drapeau de transparence), envoyez de vrais appels, affirmez que la réponse est un PNG avec un canal alpha, et transformez les bons cas en une suite de régression que vous réexécutez après chaque mise à jour du modèle. Vous pouvez également simuler le point de terminaison afin que l'équipe front-end puisse travailler contre un contrat stable pendant que le GPU est occupé. Le guide pratique explique ce wrapper et les tests Apidog étape par étape.
Téléchargez Apidog pour suivre.
FAQ
Qwen-Image-2.1 est-il gratuit pour un usage commercial ? Non, pas sans une licence commerciale distincte de Qwen. Les poids sont téléchargeables et utilisables gratuitement à des fins de recherche et non commerciales. Consultez la section sur la licence ci-dessus et le guide de la version gratuite pour les moyens de l'essayer sans frais.
En quoi la version 2.1 diffère-t-elle de Qwen-Image-2.0 ? Même taille de 7B et conception unifiée de génération-plus-édition. Nouveautés de la version 2.1 : sortie et édition RGBA natives, jusqu'à 10 images de référence, éditions locales basées sur des masques et des annotations, un chemin d'attention à granularité mixte avec réutilisation du cache KV pour une édition multi-images plus rapide, et une typographie et des détails de portrait améliorés.
Est-ce la même chose que Qwen Image 3.0 ? Non. Les versions 3.0 et 3.0 Pro sont des modèles API hébergés lancés en juillet 2026 sans poids ouverts ; la version 2.1 est le modèle à poids ouverts. La comparaison couvre les différences de prix et de capacités.
Quel matériel nécessite-t-il ? Qwen n'a pas publié les exigences VRAM. Le code de référence charge le pipeline en bfloat16 sur un périphérique CUDA et propose le déchargement sur CPU ; les stacks de service communautaires ajoutent FP8. Attendez-vous à un GPU de centre de données ou grand public haut de gamme pour une sortie 2K en 40 étapes.
Peut-il éditer des images transparentes, et pas seulement en générer ? Oui. Les exemples de lancement modifient l'expression d'un sujet et remplacent du texte à l'intérieur d'un calque transparent tout en conservant le canal alpha, et extraient un sujet RGBA d'une photo RGB.
Prochaines étapes
Qwen-Image-2.1 est un puissant modèle d'édition ouvert doté d'une fonctionnalité que personne d'autre ne propose en un seul checkpoint, la transparence native, et d'une contrainte qui détermine si vous pouvez l'utiliser, la licence de recherche. Exécutez-le localement avec le guide pratique, essayez-le sans GPU via les options gratuites, et comparez l'API 3.0 hébergée avant de vous engager. Quel que soit votre choix, mettez le point de terminaison à l'épreuve dans Apidog afin qu'un échange de modèle ne brise jamais silencieusement votre produit.
