Alibaba lanzó Qwen 3.8-Max a principios de agosto de 2026, y la pregunta sobre el precio finalmente tiene una respuesta real. Durante la ventana de vista previa de julio, la historia que circulaba era una promoción de "precios de vista previa del 10%". Esa historia ha terminado. En la disponibilidad general, la página oficial de precios de Model Studio lista qwen3.8-max a $2 por 1 millón de tokens de entrada y $6 por 1 millón de tokens de salida, un nivel único que cubre toda la ventana de contexto de 1 millón de tokens.
Ese nivel único es la parte interesante. La mayoría de los modelos de frontera cobran más por token una vez que su prompt supera un umbral de contexto. Qwen 3.8-Max no lo hace: envíe 5.000 tokens o 900.000, la tarifa se mantiene en $2/$6.
Este artículo cubre el panorama completo: el diseño de nivel único, comparaciones con Qwen 3.7-Max, Kimi K3, Claude Opus 5 y GPT-5.6 Terra, los descuentos por caché, la letra pequeña de la cuota gratuita y ejemplos de costes resueltos con matemáticas reales. Para una visión general más amplia del modelo, comience con qué es Qwen 3.8 y por qué es importante, luego regrese para los números.
Una nota primero: los precios de etiqueta solo le dan una estimación. Qwen 3.8-Max viene con razonamiento con un esfuerzo xhigh por defecto, y los tokens de pensamiento se facturan como salida. La forma fiable de proyectar costes es enviar solicitudes reales y medir el uso de tokens. Apidog muestra el desglose completo de tokens de cada respuesta mientras realiza pruebas, lo que convierte la estimación de costes en aritmética. Más sobre eso a continuación.
El número de disponibilidad general: $2 de entrada, $6 de salida, un nivel
Aquí está la tabla de tarifas oficial para qwen3.8-max, verificada contra la página de precios de Model Studio a partir del 3 de agosto de 2026:
| Artículo | Precio (por 1 millón de tokens) |
|---|---|
| Entrada | $2.00 |
| Salida (incluyendo tokens de pensamiento) | $6.00 |
| Entrada en caché (acierto de caché) | 10% de la tarifa de entrada |
| Creación explícita de caché | 125% de la tarifa de entrada |
| Nivel de contexto | Nivel único, de 0 a 1 millón de tokens |
| Pensamiento vs no pensamiento | Se factura igual |
Tres detalles a destacar: la ventana de contexto de 1 millón está completamente cubierta por un solo precio, sin recargos por prompts largos. Los modos de pensamiento y no pensamiento cuestan las mismas tarifas, aunque los tokens de pensamiento cuentan como salida (ver la sección de honestidad a continuación). Y la salida máxima es de 65.536 tokens por solicitud, por lo que una sola respuesta factura como máximo unos $0.39 en salida.
El anuncio oficial de Qwen 3.8 posiciona el modelo como el más capaz de Alibaba hasta la fecha: 2.4T de parámetros totales con 95B activos, una ventana de contexto de 1 millón de tokens, entrada multimodal. Obtener eso a $2/$6 socava la mayoría de los niveles de frontera, incluyendo el anterior buque insignia de Alibaba.
Por qué el precio fijo en 1 millón de tokens es inusual
La fijación de precios por niveles de contexto es la norma de la industria: una tarifa por debajo de un umbral de contexto, una tarifa más alta por encima, porque los contextos largos son más costosos de servir.
Alibaba lo hace ella misma. En la misma página de precios de Model Studio, modelos como qwen3-max y qwen3-coder-plus tienen precios en niveles de longitud de contexto, con la tarifa por token aumentando a medida que la entrada crece. Qwen 3.8-Max rompe con ese patrón dentro del propio catálogo de Alibaba: su tabla de precios muestra una fila, "0<Token≤1M", y eso es todo.
Por qué esto importa: con la fijación de precios por niveles, las cargas de trabajo de contexto largo conllevan un multiplicador oculto. Un pipeline RAG que ocasionalmente introduce 300K tokens de documentos en un prompt puede costar varias veces su tarifa típica en esas solicitudes. Con Qwen 3.8-Max, el token marginal siempre cuesta lo mismo, por lo que el presupuesto es lineal: tokens por tarifa, listo. Para el análisis de documentos largos, agentes de grandes bases de código o pipelines de recuperación pesados, esa predictibilidad vale tanto como la propia tarifa baja.
Más barato que Qwen 3.7-Max a precio de lista
- Precio de lista de Qwen 3.7-Max: $2.5 de entrada / $7.5 de salida por 1 millón de tokens
- Qwen 3.8-Max: $2 de entrada / $6 de salida por 1 millón de tokens
Eso es un recorte del 20% en ambos lados mientras el modelo ganó una ventana de contexto más grande, entrada multimodal y mejores puntuaciones de referencia.
Una complicación: Qwen 3.7-Max tiene actualmente una promoción del 50%, lo que lo reduce a $1.25/$3.75. Con las tarifas promocionales, el buque insignia anterior es más barato que el nuevo. Si su carga de trabajo no necesita el contexto de 1 millón de Qwen 3.8 o sus mejoras multimodales y agénticas, el 3.7-Max con descuento es una opción de valor legítima mientras dure la promoción; simplemente no diseñe su modelo de costes en torno a una promoción. Más abajo en la escala, Qwen 3.7-Plus sigue siendo el caballo de batalla económico a $0.4/$1.6, con una promoción del 20% propia.
La sección de honestidad: los tokens de pensamiento se facturan como salida
Esta es la parte que la mayoría de los artículos sobre precios omiten, y la que tiene más probabilidades de sorprenderle en una factura.
Qwen 3.8-Max admite un parámetro reasoning_effort con tres niveles: xhigh, medium y low. El predeterminado es xhigh, la configuración más agresiva. En el modo de pensamiento, el modelo genera tokens de razonamiento internos antes de su respuesta final, y esos tokens de razonamiento se facturan a la tarifa de salida de $6, igual que el texto visible.
La consecuencia: con la configuración predeterminada, las solicitudes que requieren mucho razonamiento cuestan más de lo que predice una estimación ingenua de "tokens de prompt más tokens de respuesta". Una respuesta que muestra 800 tokens de respuesta visible puede haber consumido varios miles de tokens de pensamiento en un problema difícil.
Tres mitigaciones: reduzca reasoning_effort a medium o low para tareas que no necesiten razonamiento profundo (clasificación, extracción, formato); mida el uso real por tipo de tarea antes de proyectar el gasto mensual, ya que el objeto usage en cada respuesta informa recuentos reales que incluyen el razonamiento; y observe específicamente los tokens de salida, porque la salida cuesta 3 veces la entrada aquí y el pensamiento infla la salida.
Caché de contexto: 10% de aciertos, 125% de creación
Si su aplicación reenvía repetidamente el mismo prefijo de prompt (un prompt de sistema largo, un documento estable, definiciones de herramientas), el almacenamiento en caché de contexto cambia la economía significativamente:
- Los aciertos de caché se facturan al 10% de la tarifa de entrada. Los tokens de entrada en caché cuestan $0.20 por 1 millón en lugar de $2.
- La creación explícita de caché se factura al 125% de la tarifa de entrada. Escribir tokens en la caché cuesta $2.50 por 1 millón, una prima única del 25% sobre la entrada normal.
Las matemáticas del punto de equilibrio son simples. La creación cuesta un 25% extra una vez; cada acierto posterior ahorra un 90%. Si un prefijo se reutiliza incluso dos veces, el almacenamiento en caché ya se amortiza. Para agentes de alta frecuencia o aplicaciones de chat con un prompt de sistema pesado, los ahorros se acumulan rápidamente (ejemplo resuelto a continuación).
Letra pequeña de la cuota gratuita: 1 millón de tokens, Singapur, 90 días
Model Studio ofrece una cuota gratuita para qwen3.8-max, y la letra pequeña importa:
- Tamaño: 1 millón de tokens. Suficiente para una evaluación real, no para producción.
- Región: Solo Singapur. Apunte su cliente a
https://dashscope-intl.aliyuncs.com/compatible-mode/v1; la cuota no se aplica a Pekín o US-Virginia. - Duración: 90 días desde la activación. La cuota no utilizada expira.
Los tokens de pensamiento se consumen de esta cuota como cualquier otra salida, por lo que unas pocas docenas de tareas de razonamiento difíciles en xhigh pueden agotar 1 millón de tokens más rápido de lo que cabría esperar. Si el acceso gratuito es su objetivo principal, hemos recopilado todas las rutas sin coste, incluido Qwen Chat, en cómo usar Qwen 3.8 gratis.
Cómo se compara el precio de Qwen 3.8
Aquí está el panorama actual, utilizando precios de lista por 1 millón de tokens. Las tarifas promocionales están marcadas, porque las promociones expiran.
| Modelo | Entrada | Salida | Notas |
|---|---|---|---|
| Qwen 3.8-Max | $2.00 | $6.00 | Plano en 1 millón de contexto; aciertos de caché 10% |
| Qwen 3.7-Max | $2.50 | $7.50 | Actualmente 50% de descuento: $1.25/$3.75 (promo) |
| Qwen 3.7-Plus | $0.40 | $1.60 | Actualmente 20% de descuento (promo) |
| Kimi K3 | $3.00 | $15.00 | Aciertos de caché $0.30 |
| Claude Opus 5 | $5.00 | $25.00 | |
| GPT-5.6 Terra | $2.00 | $12.00 |
Leyendo la tabla:
- Frente a Kimi K3, su rival de código abierto más cercano, Qwen 3.8-Max cuesta un tercio menos en entrada y un 60% menos en salida, y su tasa de acierto de caché ($0.20) es inferior a la de K3 ($0.30). Para trabajos agénticos con mucha salida, esa brecha de salida domina. Consulte la guía de API de Kimi K3 para el lado de K3.
- Frente a Claude Opus 5, Qwen es un 60% más barato en entrada y un 76% más barato en salida.
- Frente a GPT-5.6 Terra, la entrada es idéntica a $2, pero la salida de Qwen es la mitad de precio. Para la generación de formato largo y trabajos con mucho razonamiento, ese es el número que mueve su factura.
El precio no es calidad, y las tablas de referencia de los proveedores son tablas de referencia de los proveedores. Pero a nivel de tarifa pura, Qwen 3.8-Max es el buque insignia de clase frontera más barato de esta línea.
Ejemplos resueltos: cuánto cuestan las tareas reales
Las tarifas de etiqueta significan poco sin matemáticas adaptadas a la tarea. Tres escenarios, calculados a $2/$6:
Ejemplo 1: una sesión de agente de 50.000 tokens
Una ejecución de agente consume 38.000 tokens de entrada (instrucciones, esquemas de herramientas, resultados de herramientas) y produce 12.000 tokens de salida:
- Entrada: 38.000 × $2 / 1.000.000 = $0.076
- Salida: 12.000 × $6 / 1.000.000 = $0.072
- Total: alrededor de $0.15 por sesión
Ahora añada el razonamiento predeterminado xhigh. Supongamos que el modelo gasta 8.000 tokens de pensamiento durante la ejecución. La salida se convierte en 20.000 tokens: 20.000 × $6 / 1.000.000 = $0.12, y la sesión totaliza alrededor de $0.20. Eso es un aumento del 33% solo por el razonamiento, que es exactamente por lo que se mide antes de presupuestar.
Ejemplo 2: análisis de documentos largos con 800.000 tokens
Carga 800.000 tokens de documentos en el contexto y solicita un resumen estructurado de 5.000 tokens:
- Entrada: 800.000 × $2 / 1.000.000 = $1.60
- Salida: 5.000 × $6 / 1.000.000 = $0.03
- Total: alrededor de $1.63 por ejecución
El nivel único está haciendo el trabajo aquí. Cada uno de esos 800K tokens cuesta la misma tarifa de $2/1M que los primeros mil. En un modelo por niveles, esta es precisamente la forma de solicitud que activa el tramo caro.
Ejemplo 3: un prompt de sistema de 100.000 tokens en caché, 50 llamadas al día
Su aplicación carga previamente 100.000 tokens de prompt de sistema, documentos de producto y definiciones de herramientas en cada llamada, 50 veces al día.
Sin caché: 100.000 × $2 / 1.000.000 = $0.20 por llamada, lo que supone $10.00 al día solo por el prefijo.
Con caché explícito: la creación cuesta 100.000 × $2.50 / 1.000.000 = $0.25 una vez, luego 49 aciertos de caché a 100.000 × $0.20 / 1.000.000 = $0.02 cada uno, o $0.98. Total diario: alrededor de $1.23, un ahorro del 88%. En un mes, eso es aproximadamente $300 frente a menos de $40.
Estime los costes a partir del uso medido, no de conjeturas
Los tres ejemplos se basan en recuentos de tokens asumidos. Sus números reales diferirán, y con los tokens de razonamiento en juego, diferirán de maneras que no puede predecir solo a partir de la longitud del prompt. La solución es medir.
Un flujo de trabajo práctico: obtenga su clave API, configure el endpoint (la guía de API de Qwen 3.8 cubre las tres URL base regionales y los protocolos compatibles con OpenAI y Anthropic), y envíe solicitudes representativas para cada tipo de tarea en su aplicación. Cada respuesta devuelve un objeto usage con recuentos exactos de tokens de entrada, salida y razonamiento.
En Apidog, guarde las tres URL base regionales como entornos, realice la misma solicitud en cada nivel de reasoning_effort y lea el uso de tokens directamente desde el inspector de respuestas. Ejecute diez solicitudes representativas por tipo de tarea, promedie los recuentos, multiplique por $2/$6, y tendrá un modelo de costes construido sobre datos medidos. También puede hacer pruebas A/B del mismo prompt contra qwen3.7-max o Kimi K3 en el mismo espacio de trabajo para ver si el modelo más barato se mantiene en su carga de trabajo. Descargue Apidog gratis y podrá tener números reales de costes por tarea en una hora.
En resumen
Qwen 3.8-Max a $2/$6 es un precio agresivo para un buque insignia de clase frontera: por debajo del precio de lista de su predecesor, la mitad de la tasa de salida de GPT-5.6 Terra, una fracción de Opus 5, y plano a lo largo de un contexto completo de 1 millón de tokens donde gran parte del mercado tiene niveles. Añada un 10% de aciertos de caché y la economía para cargas de trabajo de contexto largo y alta repetición parece realmente sólida.
Dos advertencias: el razonamiento xhigh predeterminado infla la facturación de salida por encima de las estimaciones ingenuas, y los anclajes a su alrededor (3.7-Max con 50% de descuento, la cuota gratuita de Singapur) tienen un límite de tiempo. Mida su uso real de tokens, establezca reasoning_effort deliberadamente, y la tabla de tarifas le deparará pocas sorpresas.
Preguntas frecuentes
¿Qwen 3.8 cuesta más para prompts largos?
No. El precio oficial lista un nivel único que cubre de 0 a 1 millón de tokens, por lo que un prompt de 900K tokens se factura a la misma tarifa de entrada de $2 por 1 millón que uno corto. Esto difiere de los modelos por niveles, incluyendo algunos en el propio catálogo de Alibaba en la lista de modelos de Model Studio, donde las tarifas aumentan con la longitud del contexto.
¿Los tokens de pensamiento cuestan extra en Qwen 3.8?
No hay una tarifa de pensamiento separada: los modos de pensamiento y no pensamiento se facturan a los mismos $2/$6. Pero los tokens de pensamiento cuentan como tokens de salida a $6 por 1 millón, y reasoning_effort por defecto es xhigh. Por lo tanto, las solicitudes que requieren mucho razonamiento cuestan más de lo que sugiere la respuesta visible. Reduzca el nivel de esfuerzo para tareas simples y revise el objeto usage en cada respuesta para ver lo que realmente está pagando.
¿Hay alguna forma gratuita de probar Qwen 3.8?
Sí. Model Studio incluye una cuota gratuita de 1 millón de tokens, válida por 90 días, solo en el endpoint de la región de Singapur. Qwen Chat también ofrece acceso gratuito en el navegador. Ambas rutas, además de la letra pequeña, están cubiertas en cómo usar Qwen 3.8 gratis.
¿Sigue disponible el antiguo "precio de vista previa del 10%?"
No. Esa fue una promoción de la época de vista previa informada en la cobertura de prensa de julio de 2026; la disponibilidad general la reemplazó con la tabla de tarifas estándar de $2/$6. Considere la página de precios de Model Studio como la fuente de la verdad.
