Alibaba ahora ofrece dos líneas de imágenes Qwen que no comparten una secuencia de versiones. Qwen-Image-2.1, lanzado el 20 de septiembre de 2026, es el modelo de pesos abiertos: 7B parámetros en el generador, salida transparente nativa, edición con hasta 10 referencias, descargable desde Hugging Face. Qwen Image 3.0 y 3.0 Pro, anunciados el 22 de julio y disponibles en la API desde el 4 de agosto de 2026, son modelos alojados con precios por imagen y sin pesos publicados. El número dice “3.0 es más nuevo”, pero la verdad es que responden a preguntas diferentes: ¿quieres ejecutar el modelo o alquilarlo?
Esta página compara ambos en cuanto a licencia, coste, capacidades y operaciones, y termina con una tabla de decisiones. Para una descripción detallada de las características de 2.1, consulta Qué es Qwen-Image-2.1; para el código, la guía práctica. Elijas lo que elijas, ambos terminan siendo un endpoint HTTP que tu aplicación llama, y Apidog puede mantener ambos detrás de una misma colección, de modo que el cambio es solo una modificación de configuración.
Comparación
| Qwen-Image-2.1 | Qwen Image 3.0 / 3.0 Pro | |
|---|---|---|
| Lanzamiento | 20 de septiembre de 2026 | Anunciado el 22 de julio de 2026; API el 4 de agosto de 2026 |
| Distribución | Pesos abiertos (Hugging Face, ModelScope) | Solo API alojada; sin pesos publicados [VERIFICAR] |
| Licencia / Términos | Licencia de Investigación Qwen; el uso comercial requiere una licencia separada | Términos de servicio estándar de la API |
| Precio | Tiempo de tu GPU | qwen-image-3.0: $0.03 por imagen (1K o 2K). qwen-image-3.0-pro: $0.04 a 1K, $0.075 a 2K. Imágenes de entrada $0.003 cada una [VERIFICAR] |
| Tamaño del generador | 7B (32 capas DiT de flujo único) + codificador Qwen3-VL 8B | No divulgado |
| Resolución máxima | 2048 x 2048 por defecto; hasta 2752 x 1536 | 2048 x 2048 |
| Salida transparente | Generación y edición nativa RGBA | No anunciado |
| Imágenes de referencia | Hasta 10 | Imágenes de entrada soportadas (precio por imagen); límite no publicado [VERIFICAR] |
| Edición local | Círculos, anotaciones pintadas, máscara separada | No anunciado en el material de lanzamiento |
| Renderizado de texto | Tipografía, estilo y diseño mejorados | Característica destacada: texto fino de alrededor de 10 px, 12 idiomas (autoinformado) |
| Salidas por llamada | Uno (tú haces el bucle) | Hasta 6 |
| Longitud del prompt | No declarado | Alrededor de 4.5K tokens en Pro (afirmación oficial) |
| Reescritura de prompt | Modelos PE-T2I / PE-I2I separados que ejecutas tú mismo | Gestionado en el lado del servidor |
| Dónde probar | HF Space, Qwen Chat, ComfyUI | Consola de Model Studio, Qwen Chat |
Las fuentes para la columna 3.0 son el anuncio de julio de Alibaba y la documentación de QwenCloud resumida por LLM Stats; vuelve a verificar la tabla de precios en Model Studio antes de presupuestar, porque el precio de las imágenes es específico de cada región.
La licencia es el primer filtro
Para la mayoría de los equipos, esta fila termina la comparación. La licencia 2.1 establece que “no se utilizarán los Materiales para ningún propósito comercial sin obtener una licencia comercial separada”. Esto es diferente de los términos Apache 2.0 bajo los cuales se distribuyó el Qwen-Image original, y significa que una característica orientada al cliente construida sobre 2.1 requiere un correo electrónico al equipo comercial de Qwen y un acuerdo firmado antes del lanzamiento.
Qwen Image 3.0 es una API de pago con términos comerciales estándar. Pagas por imagen y puedes desplegar.
Así que: investigación, evaluación, herramientas internas o un proyecto en el que estés dispuesto a negociar una licencia, 2.1 está sobre la mesa. Una característica de producto que se lance este trimestre sin presupuesto legal, 3.0 es la opción por defecto.
Coste: una factura de GPU vs tres céntimos por imagen
El nivel estándar 3.0 es de $0.03 por imagen en cualquiera de las resoluciones, por lo que 10,000 imágenes al mes son $300, más $0.003 por imagen de entrada en ediciones. El nivel Pro duplica el precio a 2K.
El autoalojamiento de 2.1 no tiene un precio por imagen, pero la aritmética solo es favorable en volumen y con una GPU que de otro modo dejarías inactiva. Qwen no publica cifras de rendimiento, así que mide las tuyas propias: con 40 pasos y 2048 x 2048 en una sola GPU de centro de datos, cuenta las imágenes por hora, divide la tarifa horaria y compárala con $0.03. La edición con muchas referencias es donde la reutilización de la caché KV de 2.1 ayuda, ya que las imágenes de referencia se codifican una vez por solicitud en lugar de por paso. Si tu GPU se comparte con otras cargas de trabajo, recuerda que la generación de imágenes la acaparará durante los picos.
Una regla general: por debajo de unos pocos miles de imágenes al mes, la API es más barata una vez que se cuenta el tiempo de ingeniería. Por encima de decenas de miles al mes con carga constante y un acuerdo de licencia, el autoalojamiento es más ventajoso. Entre ambos, depende de si ya utilizas GPUs.
Capacidades: transparencia vs texto denso
Los dos modelos fueron construidos para trabajos diferentes.
Elige 2.1 cuando la salida necesite un canal alfa. Pegatinas, recortes de productos, activos de UI, composiciones en capas, extracción de un sujeto de una foto como RGBA: 2.1 hace esto de forma nativa en el mismo modelo, incluyendo la edición de una capa transparente sin perder su transparencia. El material de lanzamiento de 3.0 no menciona la salida alfa. Hacerlo en 3.0 significaría un paso de eliminación de fondo separado con los artefactos de halo que ello conlleva.
Elige 2.1 cuando la edición sea la carga de trabajo. Diez imágenes de referencia, selección de región por círculo, pintura o máscara, y el trabajo de fidelidad en rostros y productos son el centro de la versión 2.1. La publicación de lanzamiento muestra fotos grupales a partir de seis retratos, atuendos a partir de cinco tomas de productos y una habitación amueblada a partir de diez fotos de muebles.
Elige 3.0 cuando la imagen sea mayormente texto. Paneles de control, wireframes, carteles y diseños tipo diapositiva con texto fino en muchos idiomas son para lo que 3.0 fue ajustado. 2.1 también mejoró la tipografía, pero la afirmación publicada de 3.0 de “texto de 10 px en 12 idiomas” es más sólida, y su presupuesto de prompt de 4.5K tokens en Pro se adapta a especificaciones de diseño largas.
Elige 3.0 cuando necesites varios candidatos por llamada. Hasta seis salidas por solicitud es una característica de flujo de trabajo que 2.1 no tiene; con 2.1, iteras sobre las semillas.
Ninguna página del proveedor imprime una tabla de benchmarks con números. La publicación 2.1 muestra un gráfico Qwen-Image-Bench; las afirmaciones de 3.0 son autoinformadas. Trata ambas como puntos de partida para tu propia evaluación, la cual la sección de Apidog hace repetible.
Operaciones: lo que posees
Autoalojar 2.1 significa ser dueño de: las descargas y actualizaciones del modelo, una GPU con suficiente memoria (Qwen no publica una tabla de VRAM; el README ofrece descarga a CPU y señala vLLM-Omni con FP8, SGLang y LightX2V), un wrapper de servicio, la gestión de colas bajo carga pico, y los dos modelos opcionales de reescritura de prompts si quieres que funcionen los prompts de una sola línea. A cambio, obtienes localidad de datos, sin límites de tasa más allá de los tuyos, y una versión fija del modelo que nadie cambia bajo tu supervisión.
Usar 3.0 significa ser dueño de: una cuenta de Alibaba Cloud y la elección de región, claves de API, manejo de límites de tasa, y el riesgo de que el modelo alojado cambie su comportamiento entre tu ejecución de prueba y la producción. A cambio, obtienes infraestructura cero y una factura por imagen.
Las guías de API de Nano Banana 2 y API de gpt-image-2.5 repasan los mismos compromisos de alojamiento para Google y OpenAI, si estás comparando entre proveedores en lugar de dentro de Qwen.
Tabla de decisiones
| Tu situación | Elige |
|---|---|
| Lanzando una característica comercial este trimestre, sin presupuesto legal | 3.0 |
| Necesitas PNGs transparentes o edición RGBA | 2.1 (con una licencia si es comercial) |
| Edición con muchas imágenes de referencia | 2.1 |
| Diseños con mucho texto en varios idiomas | 3.0 |
| Investigación, evaluación, herramientas internas | 2.1 |
| Menos de unos pocos miles de imágenes al mes | 3.0 |
| Decenas de miles al mes, GPUs ya en funcionamiento, licencia firmada | 2.1 |
| Los datos no pueden salir de tu red | 2.1 |
| Quieres seis candidatos por solicitud | 3.0 |
Ejecuta ambos detrás de una misma colección
La respuesta práctica para muchos equipos es ambos: 2.1 para el pipeline de activos transparentes y herramientas internas, 3.0 para los diseños de texto orientados al cliente. Esto funciona limpiamente si los dos viven bajo un mismo contrato.
En Apidog, define un endpoint POST /v1/images una vez, con prompt, aspect, transparent, seed, y un campo de archivo references, y configura dos entornos: base_url apuntando a tu wrapper 2.1 (la guía práctica tiene una versión FastAPI de 40 líneas) y un segundo apuntando a un adaptador para el endpoint 3.0 de Model Studio. Luego:
- Envía el mismo conjunto de prompts a ambos con semillas fijas y guarda las respuestas como casos de prueba.
- Comprueba lo que difiere:
Content-Type, los límites inferiores del tamaño de la respuesta, y para 2.1 el encabezadoX-Image-Mode: RGBAcuando se solicita transparencia. - Registra el tiempo de respuesta por solicitud; Apidog lo muestra en cada ejecución, lo cual es el número de rendimiento que Qwen no publica.
- Ejecuta el escenario semanalmente. Cuando el comportamiento alojado de 3.0 cambie o intercambies 2.1 por una construcción cuantificada, la diferencia aparecerá en el informe, no en los tickets de soporte.
- Simula el endpoint para que el frontend se construya contra el contrato mientras la elección del modelo aún está abierta.
Descarga Apidog e importa el endpoint para empezar a comparar.
Preguntas Frecuentes
¿Es Qwen Image 3.0 de código abierto? No se han publicado pesos públicos para 3.0 o 3.0 Pro; son modelos de API alojados [VERIFICAR]. Qwen-Image-2.1 es la versión de pesos abiertos.
¿Puedo usar Qwen-Image-2.1 comercialmente? Solo con una licencia comercial separada de Qwen. La Licencia de Investigación Qwen predeterminada excluye el uso comercial.
¿Cuál es más barato? A bajo volumen, 3.0 a $0.03 por imagen. A alto volumen y constante en hardware que ya tienes en funcionamiento, 2.1, después de haber obtenido una licencia y medido tu propio rendimiento.
¿3.0 genera imágenes transparentes? No se anuncia. La salida nativa RGBA es una característica de 2.1; consulta Qué es Qwen-Image-2.1.
¿Puedo probar cualquiera de forma gratuita? 2.1 tiene un Hugging Face Space y acceso a Qwen Chat; la guía de nivel gratuito enumera las opciones. 3.0 está disponible en Qwen Chat y a través de la cuota de prueba de Model Studio, que varía según la región.
Próximos pasos
2.1 y 3.0 son una bifurcación, no una ruta de actualización. La licencia decide la primera pregunta, la carga de trabajo la segunda y el volumen la tercera. Sea cual sea tu elección, ponla detrás de un contrato que pruebes: la guía práctica construye el lado 2.1, y la misma colección de Apidog puede dar soporte al lado 3.0 el día que lo necesites.
