Qwen-Image-2.1: Modelo de imagen 7B de código abierto con transparencia nativa

Qwen-Image-2.1 explicado: lanzamiento de pesos abiertos el 20 de septiembre, generación y edición unificadas de 7B, salida RGBA nativa, 10 imágenes de referencia y la licencia de investigación que limita el uso comercial.

Ashley Innocent

Ashley Innocent

21 September 2026

Qwen-Image-2.1: Modelo de imagen 7B de código abierto con transparencia nativa

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

El equipo Qwen de Alibaba lanzó Qwen-Image-2.1 como código abierto el 20 de septiembre de 2026. Es un modelo que realiza generación de texto a imagen y edición de imágenes, con 7 mil millones de parámetros en su componente de generación visual, y puede generar PNG transparentes directamente desde una indicación en lugar de simularlos con un paso de eliminación de fondo. La publicación de lanzamiento enumera cuatro cambios: una arquitectura más ligera y rápida, transparencia nativa, edición con hasta 10 imágenes de referencia, y mejor tipografía y detalle de retrato. Los pesos están en Hugging Face y ModelScope, y el código está en GitHub.

Una línea en la tarjeta del modelo importa más que cualquier característica: la licencia es la Licencia de Investigación de Qwen, no Apache 2.0. El uso comercial requiere un acuerdo separado. Si estás evaluando la versión 2.1 para un producto, lee esa sección antes de los puntos de referencia. Si deseas ejecutarlo, la guía de uso de Qwen-Image-2.1 tiene el código de diffusers y un wrapper HTTP que puedes probar en Apidog. Si lo estás comparando con la API alojada de Qwen Image 3.0, la comparación 2.1 vs 3.0 es la página de decisión.

Qwen-Image-2.1 de un vistazo

Elemento Detalle (publicación de lanzamiento, tarjeta del modelo, README de GitHub)
Fecha de lanzamiento 20 de septiembre de 2026
Funcionalidad Generación de texto a imagen y edición de imágenes en un solo modelo, incluyendo salida transparente (RGBA)
Generador visual 32 capas DiT de flujo único, 7 mil millones de parámetros
Codificador de texto Qwen3-VL 8B
VAE Autoencoder RGBA de 64 canales, compresión espacial 16x
Salida por defecto 2048 x 2048; siete relaciones de aspecto hasta 2752 x 1536
Imágenes de referencia Hasta 10 por edición
Edición local Círculos, anotaciones pintadas o una imagen de máscara separada
Modelos complementarios Modelos de reescritura de prompts Qwen-Image-2.1-PE-T2I y PE-I2I (ajustes finos de Qwen3.5-VL 9B)
Licencia Acuerdo de Licencia de Investigación de Qwen; el uso comercial requiere una licencia separada
Pruébalo Hugging Face Space, Qwen Chat, ComfyUI (soporte nativo desde el día del lanzamiento)

Su posición en la línea Qwen-Image

El Qwen-Image original se lanzó en agosto de 2025 como un modelo MMDiT de 20 mil millones de parámetros conocido por la representación de texto, con Qwen-Image-Edit como un modelo de edición separado. A finales de 2025, la línea se dividió aún más: la actualización 2512 para realismo, Edit-2511 para consistencia de múltiples personas y Qwen-Image-Layered en diciembre para capas transparentes. Qwen-Image-2.0 en febrero de 2026 unificó la generación y edición en un solo modelo de 7 mil millones de parámetros con salida nativa de 2K.

La versión 2.1 mantiene el tamaño y el diseño unificado de la 2.0 e incorpora la transparencia del modelo Layered, por lo que un solo checkpoint ahora cubre lo que antes requerían tres. También incorpora una nueva ruta de inferencia (más sobre esto a continuación) y una interfaz de edición construida alrededor de máscaras y múltiples referencias. Paralelamente, Alibaba ofrece una línea alojada: Qwen Image 3.0 y 3.0 Pro lanzados en julio de 2026 como modelos API sin pesos publicados. Así, la nomenclatura es una bifurcación, no una secuencia. 2.1 es el modelo abierto que descargas; 3.0 es el modelo que alquilas.

Novedades en 2.1

Una arquitectura más ligera y una ruta de edición más rápida

El generador visual consta de 32 capas DiT de flujo único con 7 mil millones de parámetros, emparejado con el codificador Qwen3-VL de 8 mil millones y un VAE que lleva un canal alfa de forma nativa. La ingeniería interesante reside en la atención. Qwen lo denomina granularidad mixta: los tokens de texto (el prefijo del sistema y tu instrucción de edición) usan una máscara causal a nivel de token, mientras que la generación de imágenes usa una máscara a nivel de fragmento. Debido a que las imágenes de entrada y la instrucción son estáticas a lo largo de los pasos de denoising, el modelo calcula su caché de clave-valor una vez en el primer paso y la reutiliza. La ventaja declarada por Qwen es una menor latencia y consumo de memoria al editar con varias imágenes de referencia, que es precisamente la carga de trabajo que se volvió más pesada con el límite de 10 imágenes.

El programador utiliza coincidencia de flujo con pasos discretos de Euler, y el código de referencia ejecuta 40 pasos por defecto.

Transparencia nativa en el mismo modelo

Esta es la característica principal. Pides una imagen transparente en el prompt y el modelo devuelve RGBA. La fraseología recomendada del README es literal: comienza con "Esta es una imagen RGBA con transparencia" y especifica que el fondo es transparente. La publicación de lanzamiento muestra sujetos individuales, composiciones de múltiples elementos y tres casos de edición en entradas transparentes: cambiar la expresión de un sujeto manteniendo el canal alfa, reemplazar texto dentro de una capa transparente y extraer un sujeto de una foto RGB ordinaria como un recorte RGBA.

Para los equipos de producto, esto reemplaza una pipeline de dos modelos (generar, luego mate) con una sola llamada. También elimina los artefactos de halo que los eliminadores de fondo dejan alrededor del cabello y el vidrio, porque el alfa se genera, no se infiere después. Si los bordes se mantienen a 2K en tus propios activos es algo que debes probar en lugar de asumir; la guía de nivel gratuito muestra dónde ejecutar esas pruebas sin una GPU.

Edición con hasta 10 referencias y control real de regiones

Tres características de edición destacan en los ejemplos de lanzamiento:

La misma ruta de edición maneja panoramas desde una selfie, infografías desde una foto de producto y storyboards desde una hoja de personaje de tres vistas. Las ediciones locales secuenciales se pueden encadenar en animaciones cortas, lo que la publicación demuestra con un clip de carpincho.

Calidad tipográfica y de retrato

Qwen ha liderado la renderización de texto abierto desde el primer Qwen-Image, y la versión 2.1 lo extiende al estilo de la tipografía, el diseño y cómo el texto se integra en la composición en lugar de solo la ortografía. La iluminación de retrato y el detalle fino también reciben una mejora. La publicación de lanzamiento respalda esto con un gráfico Qwen-Image-Bench contra modelos abiertos y cerrados; el gráfico es una imagen y la publicación no imprime números, por lo que no citamos ninguno aquí.

La licencia: pesos abiertos, términos de investigación

El Qwen-Image original era Apache 2.0. Qwen-Image-2.1 se lanza bajo el Acuerdo de Licencia de Investigación de Qwen, y el texto de la licencia es breve y claro en el punto que importa:

Los modelos complementarios de reescritura de prompts se distribuyen bajo los mismos términos. Para un proyecto de hobby, un artículo de investigación o una evaluación interna, esto está bien. Para una característica de SaaS, significa una conversación previa con Alibaba, o el uso de la API alojada 3.0, que viene con términos comerciales ordinarios y un precio por imagen.

Los dos modelos de reescritura de prompts

Junto con el generador, Qwen publicó Qwen-Image-2.1-PE-T2I y Qwen-Image-2.1-PE-I2I. PE-T2I es un Qwen3.5-VL 9B ajustado que toma una solicitud corta en cualquier idioma y devuelve JSON con un prompt detallado en inglés y una relación de aspecto recomendada. PE-I2I es el equivalente de edición [VERIFICAR]. Son opcionales, y son cómo el espacio de demostración obtiene prompts largos y estructurados a partir de entradas de una sola línea. Si estás construyendo una API alrededor de la versión 2.1, este es el paso de "mejora de prompt" que productos como ChatGPT Images hacen de forma invisible.

Lo que no mencionó el lanzamiento

Ponerlo detrás de una API y probarlo

La mayoría de los equipos no llamarán a una pipeline de diffusers desde el código de la aplicación. Lo envolverán en un servicio HTTP en un servidor con GPU y lo llamarán. Una vez que es un endpoint, es una API como cualquier otra, y Apidog es donde la diseñas y pruebas: define el esquema de solicitud (prompt, imágenes de referencia opcionales, relación de aspecto, una bandera de transparencia), envía llamadas reales, verifica que la respuesta sea un PNG con un canal alfa, y convierte los casos exitosos en una suite de regresión que ejecutas después de cada actualización del modelo. También puedes simular el endpoint para que el equipo de frontend construya contra un contrato estable mientras la GPU está ocupada. La guía práctica detalla ese wrapper y las pruebas de Apidog paso a paso.

Descarga Apidog para seguir el proceso.

Preguntas Frecuentes

¿Es Qwen-Image-2.1 de uso comercial gratuito? No, no sin una licencia comercial separada de Qwen. Los pesos son gratuitos para descargar y usar con fines de investigación y no comerciales. Consulta la sección de licencia anterior y la guía de nivel gratuito para las formas sin costo de probarlo.

¿En qué se diferencia 2.1 de Qwen-Image-2.0? El mismo tamaño de 7 mil millones de parámetros y diseño unificado de generación más edición. Novedades en 2.1: salida y edición RGBA nativas, hasta 10 imágenes de referencia, ediciones locales basadas en máscaras y anotaciones, una ruta de atención de granularidad mixta con reutilización de caché KV para una edición de múltiples imágenes más rápida, y tipografía y detalle de retrato mejorados.

¿Es lo mismo que Qwen Image 3.0? No. 3.0 y 3.0 Pro son modelos API alojados lanzados en julio de 2026 sin pesos abiertos; 2.1 es el modelo de pesos abiertos. La comparación cubre las diferencias de precio y capacidad.

¿Qué hardware necesita? Qwen no ha publicado los requisitos de VRAM. El código de referencia carga la pipeline en bfloat16 en un dispositivo CUDA y ofrece descarga a CPU; las pilas de servicio de la comunidad añaden FP8. Espera una GPU de centro de datos o de consumo de gama alta para una salida de 2K en 40 pasos.

¿Puede editar imágenes transparentes, no solo generarlas? Sí. Los ejemplos de lanzamiento cambian la expresión de un sujeto y reemplazan texto dentro de una capa transparente manteniendo el canal alfa, y extraen un sujeto RGBA de una foto RGB.

Próximos pasos

Qwen-Image-2.1 es un potente modelo de edición abierto con una característica que nadie más ofrece en un solo checkpoint, la transparencia nativa, y una limitación que decide si puedes usarlo: la licencia de investigación. Ejecútalo localmente con la guía práctica, pruébalo sin una GPU a través de las opciones gratuitas, y compara la API alojada 3.0 antes de comprometerte. Elijas lo que elijas, somete el endpoint a prueba en Apidog para que un cambio de modelo nunca rompa tu producto silenciosamente.

button

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs