Qu'est-ce que Qwen-Image-2.1 ? Le modèle d'image open source 7B avec transparence native

Qwen-Image-2.1 expliqué : sortie des poids ouverts le 20 septembre, génération et édition unifiées (7B), sortie RGBA native, 10 images de référence, et la licence de recherche qui limite l'utilisation commerciale.

Ashley Innocent

Ashley Innocent

21 September 2026

Qu'est-ce que Qwen-Image-2.1 ? Le modèle d'image open source 7B avec transparence native

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

L'équipe Qwen d'Alibaba a publié Qwen-Image-2.1 en open-source le 20 septembre 2026. Il s'agit d'un modèle unique qui effectue la génération de texte en image et l'édition d'image, avec 7 milliards de paramètres dans son composant de génération visuelle, et il peut produire des PNG transparents directement à partir d'une invite au lieu de les simuler avec une passe de suppression d'arrière-plan. Le billet de lancement énumère quatre changements : une architecture plus légère et plus rapide, la transparence native, l'édition avec jusqu'à 10 images de référence, et une meilleure typographie et détail des portraits. Les poids sont disponibles sur Hugging Face et ModelScope, et le code est sur GitHub.

Une ligne dans la fiche du modèle est plus importante que n'importe quelle fonctionnalité : la licence est la Qwen Research License, et non Apache 2.0. L'utilisation commerciale nécessite un accord séparé. Si vous évaluez la version 2.1 pour un produit, lisez cette section avant les benchmarks. Si vous souhaitez l'exécuter, le guide d'utilisation de Qwen-Image-2.1 contient le code diffusers et un wrapper HTTP que vous pouvez tester dans Apidog. Si vous le comparez à l'API hébergée Qwen Image 3.0, la comparaison 2.1 vs 3.0 est la page de décision.

Qwen-Image-2.1 en bref

Élément Détail (billet de lancement, fiche du modèle, README GitHub)
Date de sortie 20 septembre 2026
Ce qu'il fait Génération texte-image et édition d'image en un seul modèle, incluant la sortie transparente (RGBA)
Générateur visuel 32 couches DiT à flux unique, 7 milliards de paramètres
Encodeur de texte Qwen3-VL 8B
VAE Auto-encodeur RGBA à 64 canaux, compression spatiale 16x
Sortie par défaut 2048 x 2048 ; sept rapports d'aspect jusqu'à 2752 x 1536
Images de référence Jusqu'à 10 par édition
Édition locale Cercles, annotations peintes ou une image de masque séparée
Modèles compagnons Modèles de réécriture d'invite Qwen-Image-2.1-PE-T2I et PE-I2I (fine-tuning de Qwen3.5-VL 9B)
Licence Contrat de licence de recherche Qwen ; l'utilisation commerciale nécessite une licence séparée
L'essayer Hugging Face Space, Qwen Chat, ComfyUI (support natif dès le jour du lancement)

Sa place dans la gamme Qwen-Image

L'original Qwen-Image a été lancé en août 2025 en tant que modèle MMDiT de 20B reconnu pour le rendu de texte, avec Qwen-Image-Edit comme modèle d'édition séparé. Fin 2025, la gamme s'est encore diversifiée : la mise à jour 2512 pour le réalisme, Edit-2511 pour la cohérence multi-personnes, et Qwen-Image-Layered en décembre pour les calques transparents. Qwen-Image-2.0 en février 2026 a fusionné la génération et l'édition en un seul modèle de 7B avec une sortie native 2K.

La version 2.1 conserve la taille et la conception unifiée de la 2.0 et intègre la transparence du modèle Layered, de sorte qu'un seul checkpoint couvre désormais ce qui en nécessitait trois. Elle bénéficie également d'un nouveau chemin d'inférence (plus de détails ci-dessous) et d'une interface d'édition basée sur les masques et les références multiples. Parallèlement, Alibaba propose une gamme hébergée : Qwen Image 3.0 et 3.0 Pro lancés en juillet 2026 en tant que modèles API sans poids publiés. La dénomination est donc une bifurcation, pas une séquence. La 2.1 est le modèle ouvert que vous téléchargez ; la 3.0 est le modèle que vous louez.

Nouveautés de la version 2.1

Une architecture plus légère et un chemin d'édition plus rapide

Le générateur visuel est composé de 32 couches DiT à flux unique avec 7 milliards de paramètres, associé à l'encodeur Qwen3-VL 8B et à un VAE qui gère nativement un canal alpha. L'ingénierie intéressante réside dans l'attention. Qwen l'appelle à granularité mixte : les tokens de texte (le préfixe système et votre instruction d'édition) utilisent un masque causal au niveau du token, tandis que la génération d'images utilise un masque au niveau du bloc. Étant donné que les images d'entrée et l'instruction sont statiques à travers les étapes de débruitage, le modèle calcule leur cache clé-valeur une seule fois lors de la première étape et le réutilise. L'avantage déclaré par Qwen est une latence et une consommation de mémoire réduites lors de l'édition avec plusieurs images de référence, ce qui correspond exactement à la charge de travail qui s'est alourdie avec la limite de 10 images.

Le planificateur utilise l'appariement de flux avec des étapes discrètes d'Euler, et le code de référence exécute 40 étapes par défaut.

Transparence native dans le même modèle

C'est la nouveauté majeure. Vous demandez une image transparente dans l'invite et le modèle renvoie du RGBA. La formulation recommandée du README est littérale : commencez par « C'est une image RGBA avec transparence » et indiquez que l'arrière-plan est transparent. Le billet de lancement présente des sujets uniques, des compositions multi-éléments et trois cas d'édition sur des entrées transparentes : changer l'expression d'un sujet tout en conservant l'alpha, remplacer du texte à l'intérieur d'un calque transparent, et extraire un sujet d'une photo RGB ordinaire comme découpe RGBA.

Pour les équipes produit, cela remplace un pipeline à deux modèles (générer, puis détourer) par un seul appel. Cela élimine également les artefacts de halo que les outils de suppression d'arrière-plan laissent autour des cheveux et du verre, car l'alpha est généré, non inféré après coup. La tenue des bords en 2K sur vos propres ressources est quelque chose à tester plutôt qu'à supposer ; le guide de la version gratuite montre où effectuer ces tests sans GPU.

Édition avec jusqu'à 10 références et contrôle réel des régions

Trois fonctionnalités d'édition se distinguent dans les exemples de lancement :

Le même chemin d'édition gère les panoramas à partir d'un selfie, les infographies à partir d'une photo de produit et les storyboards à partir d'une planche de personnage à trois vues. Les éditions locales séquentielles peuvent être enchaînées en courtes animations, ce que le billet démontre avec un clip de capybara.

Typographie et qualité des portraits

Qwen est à la pointe du rendu de texte ouvert depuis le premier Qwen-Image, et la version 2.1 l'étend au style de police, à la mise en page et à la manière dont le texte s'intègre dans la composition plutôt qu'à la seule orthographe. L'éclairage des portraits et les détails fins sont également améliorés. Le billet de lancement étaye cela avec un tableau Qwen-Image-Bench comparant les modèles ouverts et fermés ; le tableau est une image et le billet ne fournit pas de chiffres, nous n'en citons donc aucun ici.

La licence : poids ouverts, conditions de recherche

L'original Qwen-Image était sous Apache 2.0. Qwen-Image-2.1 est publié sous le contrat de licence de recherche Qwen (Qwen Research License Agreement), et le texte de la licence est court et clair sur le point essentiel :

Les compagnons de réécriture d'invite sont soumis aux mêmes conditions. Pour un projet personnel, un document de recherche ou une évaluation interne, cela convient. Pour une fonctionnalité SaaS, cela implique une discussion préalable avec Alibaba, ou l'utilisation de l'API 3.0 hébergée, qui est soumise à des conditions commerciales ordinaires et à un prix par image.

Les deux modèles de réécriture d'invite

Parallèlement au générateur, Qwen a publié Qwen-Image-2.1-PE-T2I et Qwen-Image-2.1-PE-I2I. PE-T2I est un modèle Qwen3.5-VL 9B affiné qui prend une courte requête dans n'importe quelle langue et renvoie un JSON avec une invite anglaise détaillée et un rapport d'aspect recommandé. PE-I2I est son équivalent pour l'édition [VÉRIFIER]. Ils sont facultatifs et c'est ainsi que l'espace de démonstration obtient des invites longues et structurées à partir d'entrées d'une seule ligne. Si vous construisez une API autour de la version 2.1, c'est l'étape d'« amélioration de l'invite » que des produits comme ChatGPT Images effectuent de manière invisible.

Ce que le lancement n'a pas dit

Le mettre derrière une API et le tester

La plupart des équipes n'appelleront pas un pipeline diffusers depuis le code d'application. Elles l'encapsuleront dans un service HTTP sur un serveur GPU et l'appelleront. Une fois que c'est un point de terminaison, c'est une API comme les autres, et Apidog est l'endroit où vous la concevez et la testez : définissez le schéma de requête (invite, images de référence facultatives, rapport d'aspect, un drapeau de transparence), envoyez de vrais appels, affirmez que la réponse est un PNG avec un canal alpha, et transformez les bons cas en une suite de régression que vous réexécutez après chaque mise à jour du modèle. Vous pouvez également simuler le point de terminaison afin que l'équipe front-end puisse travailler contre un contrat stable pendant que le GPU est occupé. Le guide pratique explique ce wrapper et les tests Apidog étape par étape.

Téléchargez Apidog pour suivre.

FAQ

Qwen-Image-2.1 est-il gratuit pour un usage commercial ? Non, pas sans une licence commerciale distincte de Qwen. Les poids sont téléchargeables et utilisables gratuitement à des fins de recherche et non commerciales. Consultez la section sur la licence ci-dessus et le guide de la version gratuite pour les moyens de l'essayer sans frais.

En quoi la version 2.1 diffère-t-elle de Qwen-Image-2.0 ? Même taille de 7B et conception unifiée de génération-plus-édition. Nouveautés de la version 2.1 : sortie et édition RGBA natives, jusqu'à 10 images de référence, éditions locales basées sur des masques et des annotations, un chemin d'attention à granularité mixte avec réutilisation du cache KV pour une édition multi-images plus rapide, et une typographie et des détails de portrait améliorés.

Est-ce la même chose que Qwen Image 3.0 ? Non. Les versions 3.0 et 3.0 Pro sont des modèles API hébergés lancés en juillet 2026 sans poids ouverts ; la version 2.1 est le modèle à poids ouverts. La comparaison couvre les différences de prix et de capacités.

Quel matériel nécessite-t-il ? Qwen n'a pas publié les exigences VRAM. Le code de référence charge le pipeline en bfloat16 sur un périphérique CUDA et propose le déchargement sur CPU ; les stacks de service communautaires ajoutent FP8. Attendez-vous à un GPU de centre de données ou grand public haut de gamme pour une sortie 2K en 40 étapes.

Peut-il éditer des images transparentes, et pas seulement en générer ? Oui. Les exemples de lancement modifient l'expression d'un sujet et remplacent du texte à l'intérieur d'un calque transparent tout en conservant le canal alpha, et extraient un sujet RGBA d'une photo RGB.

Prochaines étapes

Qwen-Image-2.1 est un puissant modèle d'édition ouvert doté d'une fonctionnalité que personne d'autre ne propose en un seul checkpoint, la transparence native, et d'une contrainte qui détermine si vous pouvez l'utiliser, la licence de recherche. Exécutez-le localement avec le guide pratique, essayez-le sans GPU via les options gratuites, et comparez l'API 3.0 hébergée avant de vous engager. Quel que soit votre choix, mettez le point de terminaison à l'épreuve dans Apidog afin qu'un échange de modèle ne brise jamais silencieusement votre produit.

bouton

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API