GLM-5.3-Flash está actualmente a mitad de precio. Eso termina el 9 de septiembre de 2026, y cuando lo haga, cada proyección de costos basada en las tarifas actuales se duplicará.
Esta publicación cubre cuánto cuesta el modelo ahora, cuánto costará después, cómo se compara con las alternativas y cómo determinar si la diferencia realmente importa para tu carga de trabajo. Todas las cifras fueron verificadas el 27 de agosto de 2026, y las páginas de precios cambian, así que confirma con tu proveedor antes de comprometer un presupuesto.
La tabla de tarifas
| Precio de lanzamiento (hasta el 9 de septiembre de 2026) | Precio de lista (después) | |
|---|---|---|
| Entrada | $0.075 / 1M tokens | $0.15 / 1M tokens |
| Salida | $0.25 / 1M tokens | $0.50 / 1M tokens |
| Entrada en caché | $0.015 / 1M tokens | $0.03 / 1M tokens |
Artificial Analysis publica una cifra combinada de $0.10 por millón de tokens utilizando una proporción de 7:2:1 de aciertos de caché a entrada a salida. Ese es un número único útil para comparar precios, aunque tu propia proporción es lo que determina tu factura.
Lo que esto cuesta en la práctica
Las tarifas abstractas por millón son difíciles de razonar, por lo que aquí hay tres cargas de trabajo concretas al precio de lista, que es el número que importa para la planificación posterior al 9 de septiembre.
Un clasificador de soporte. 100,000 tickets al mes, aproximadamente 800 tokens de entrada y 100 tokens de salida cada uno. Eso son 80M de entrada y 10M de tokens de salida: $12.00 de entrada más $5.00 de salida, lo que suma $17 por mes. Establece reasoning_effort en low y el lado de salida se reduce aún más.
Un asistente de codificación. 500 sesiones al día, aproximadamente 15,000 tokens de entrada (gran parte de ellos contexto de archivo repetido) y 2,000 tokens de salida por sesión. Mensualmente eso son 225M de entrada y 30M de salida. Sin caché: $33.75 más $15.00, lo que suma $48.75. Con el 70% de la entrada golpeando la caché: la entrada cae a aproximadamente $14.85, lo que lo lleva a alrededor de $30.
Un pipeline de documentos con imágenes. 10,000 documentos al mes, aproximadamente 40,000 tokens cada uno, incluyendo contenido de imagen, y 1,500 tokens de salida. Eso son 400M de entrada y 15M de salida: $60.00 más $7.50, o $67.50 por mes para trabajos que requieren visión.
Ninguno de estos son números grandes. Ese es el propósito de este modelo.
La entrada en caché es la mayor palanca
A $0.03 por millón frente a $0.15 por entrada nueva, los tokens en caché cuestan una quinta parte de los no almacenados en caché. Cualquier carga de trabajo con un prefijo estable, un prompt del sistema, un documento sobre el que se pregunta repetidamente, una base de código en contexto, debe estructurarse de manera que ese prefijo permanezca idéntico en todas las llamadas.
El error que destruye silenciosamente las tasas de aciertos de caché es colocar cualquier cosa variable cerca del inicio del prompt. Una marca de tiempo, un ID de solicitud o un nombre de usuario en el prompt del sistema invalida todo lo que sigue. Coloca el contenido estable primero y el contenido variable al final.
Z.ai también ha listado el almacenamiento de entrada en caché como gratuito por un período limitado. Trata esto como promocional y verifica los términos actuales en lugar de construir una arquitectura que dependa de ello.
La segunda palanca es el esfuerzo de razonamiento
reasoning_effort por defecto es max en este modelo. Esa es la configuración más cara, y es lo que obtienes si nunca modificas el parámetro.
Los tres modos son low (bajo), high (alto) y max (máximo). Los tokens de razonamiento se facturan como salida, por lo que una tarea que no necesita deliberación está pagando tarifas de salida por un pensamiento que nadie lee. Para clasificación, extracción, enrutamiento y formato, low puede reducir sustancialmente el lado de salida.
La configuración se cubre en nuestra guía de API. Es un cambio de una sola línea y es lo primero que debes intentar si tu factura parece más alta de lo que sugiere el cálculo anterior.
Cómo se compara
Frente a su propio hermano, al precio de lista:
| Modelo | Combinado por 1M |
|---|---|
| GLM-5.3-Flash | $0.10 |
| GLM-5.3 | $0.90 |
Aproximadamente una brecha de nueve veces por una diferencia de tres puntos en el Índice de Inteligencia de Artificial Analysis, 57 contra 60. Nuestra comparación completa cubre cuándo ese intercambio es incorrecto, y la respuesta corta es: cuando transmites respuestas largas a un humano esperando, porque GLM-5.3 genera casi el doble de rápido.
Frente a GLM-5.2, la afirmación de Z.ai es aproximadamente una décima parte del precio, junto con una cifra de costo por tarea de $0.045. Nuestro desglose de precios de GLM-5.2 tiene la tabla de tarifas anterior si estás presupuestando una migración.
Frente al nivel multimodal económico de otros proveedores, GLM-5.3-Flash es competitivo en precio y poco común por tener licencia MIT, lo que significa que la opción de autoalojamiento permanece abierta. Nuestra publicación sobre precios de Gemini 3.7 Flash cubre la comparación más cercana en el lado de Google.
Los precios de los revendedores difieren, a veces mucho
El modelo está disponible a través de Z.ai directamente, además de OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten y io.net.
No todos cobran lo mismo. AIHubMix, por ejemplo, ha listado tarifas alrededor de $0.113 de entrada y $0.394 de salida, lo que se sitúa entre el precio promocional y el precio de lista de Z.ai. Algunos proveedores aplican el descuento de lanzamiento y otros no.
Si estás enrutando a través de un agregador, verifica su tarifa actual en lugar de asumir que refleja la de Z.ai. La comodidad de una puerta de enlace unificada a veces conlleva un margen, y en estos niveles de precios absolutos, un recargo porcentual es fácil de pasar por alto y fácil de tolerar.
Cuando el autoalojamiento empieza a ser rentable
Los pesos tienen licencia MIT, por lo que ejecutarlo tú mismo es una opción real, y el cálculo del punto de equilibrio se hizo más difícil para el autoalojamiento cuando el precio de la API bajó tanto.
Un marco aproximado: el servicio de precisión completa requiere un nodo de clase 8x H200, que cuesta entre $24 y $48 por día en capacidad de nube alquilada. Llámalo $1,000 por mes como un costo fijo que se acumula ya sea que el nodo esté ocupado o inactivo.
Al precio de lista de la API, $1,000 compran aproximadamente 6.7 mil millones de tokens de entrada. Necesitas estar ejecutando un volumen enorme y sostenido antes de que el costo fijo de un nodo supere eso. Para la mayoría de los equipos, la respuesta honesta es que el autoalojamiento de GLM-5.3-Flash se trata de control, residencia de datos o licencias, más que de costo.
La excepción es el nivel cuantificado. Existen cuantificaciones GGUF, y ejecutar un modelo cuantificado en hardware que ya posees cambia completamente el cálculo porque el costo marginal es la electricidad. Nuestra guía de ejecución local cubre lo que cada nivel de hardware puede hacer realmente.
La alternativa del plan de codificación
Si tu uso es el de un desarrollador que trabaja en Claude Code o Cline en lugar de una aplicación que realiza llamadas a la API, el precio por token puede ser un modelo completamente erróneo. El Plan de Codificación GLM comienza alrededor de $18 por mes, incluye GLM-5.3-Flash y, según se informa, otorga tres veces la cuota utilizable de GLM-5.3. La documentación de Z.ai también menciona que las llamadas fuera de horas pico consumen la mitad de los puntos estándar.
Para un solo desarrollador que codifica a diario, un plan fijo suele ser más barato y siempre más predecible que el acceso medido a la API. Nuestra guía de configuración cubre cómo conectarlo, y nuestra comparación de planes de codificación sitúa el plan GLM frente a las alternativas.
Vigila el lado de la salida
El precio de entrada llama la atención porque los números son mayores en volumen. La salida es donde los presupuestos realmente se rompen, por dos razones.
La salida cuesta más de tres veces lo que cuesta la entrada por token, a $0.50 frente a $0.15. Y los tokens de razonamiento se facturan como salida. Un modelo configurado con un esfuerzo de razonamiento max puede generar varias veces más tokens de los que aparecen en la respuesta final, todos ellos cobrados a la tarifa de salida.
Esa combinación significa que una aplicación con un prompt modesto y un modelo parlanchín puede terminar dominada por la salida, aunque en el papel parezca dominada por la entrada. La cifra combinada de $0.10 por millón asume una relación 7:2:1 que muchas cargas de trabajo reales no igualan.
La solución es la medición en lugar de la estimación. Cada respuesta de finalización contiene un objeto usage con el recuento de tokens para esa llamada. Regístralo, agrégalo y compara la proporción real con la suposición con la que presupuestaste. Si la salida supera aproximadamente el 15% de tus tokens totales, reasoning_effort es el primer lugar a buscar y la longitud del prompt es el segundo.
Qué hacer antes del 9 de septiembre
Tres cosas que vale la pena hacer mientras el descuento está activo:
- Mide tu mezcla real de tokens. La tarifa combinada asume 7:2:1. Si la tuya es pesada en salida, tu costo efectivo está más cerca de la tarifa de salida de $0.50 que de la cifra combinada de $0.10.
- Verifica tu tasa de aciertos de caché. Con una diferencia de precio de 5x entre la entrada en caché y la nueva, aquí es donde está el dinero.
- Vuelve a ejecutar tu modelo de costos al precio de lista. Todo se duplica el 10 de septiembre. Si la carga de trabajo solo resulta rentable con la tarifa promocional, tienes un problema que resolver ahora en lugar de dentro de dos semanas.
El seguimiento del uso real de tokens significa capturar respuestas reales, ya que el objeto usage en cada finalización contiene los recuentos de tokens de entrada, salida y en caché que necesitas. Ejecutar tus llamadas representativas como una colección guardada en Apidog, con el ID del modelo como variable de entorno, te proporciona esos números por solicitud y te permite volver a ejecutar la misma suite contra GLM-5.3 para comparar las facturas en lugar del marketing.
Preguntas frecuentes
¿Es GLM-5.3-Flash gratuito? No. Fue gratuito durante aproximadamente una semana mientras se ejecutaba anónimamente como "ox-alpha" antes de su lanzamiento, pero eso terminó con el anuncio. El descuento actual del 50% no es lo mismo que gratuito.
¿Cuándo exactamente termina el descuento? El 9 de septiembre de 2026. A partir de entonces se aplicarán los precios de lista.
¿Por qué diferentes sitios citan precios diferentes? Algunos citan la tarifa promocional, otros la de lista, y los revendedores establecen sus propios márgenes. Siempre verifica con el proveedor al que realmente llamas.
¿La entrada de imágenes tiene un costo extra? Las imágenes consumen tokens de contexto y se facturan como entrada. No hay un recargo separado por imagen, pero una imagen de alta resolución consume una cantidad significativa de tokens.
¿Es más barato autoalojar? Solo con un volumen sostenido muy grande, o en hardware que ya posees utilizando una compilación cuantificada. A $0.15 por millón de tokens de entrada, alquilar un nodo 8x H200 es difícil de justificar solo por el costo.
