Z.ai lanzó GLM-5.3-Flash el 26 de agosto de 2026. Es un modelo de mezcla de expertos de 320 mil millones de parámetros con 18 mil millones de parámetros activos, se distribuye bajo la licencia MIT y es el primer modelo de la serie GLM-5 que maneja imágenes de forma nativa en lugar de mediante un adaptador de visión adicional.
También es el modelo que muchos desarrolladores ya habían estado usando durante una semana sin saberlo. Más detalles a continuación.
Si llegó aquí esperando que "Flash" significara "rápido", esta publicación no estará de acuerdo con usted. Esa convención de nombres proviene de Google, donde los modelos Flash son genuinamente el nivel de baja latencia. Aquí significa algo diferente, y comprender correctamente esa distinción cambia si este modelo se adapta a su carga de trabajo.
En resumen
- Qué es: un modelo de mezcla de expertos de pesos abiertos (MIT) de 320B-A18B de Z.ai, lanzado el 26 de agosto de 2026.
- El cambio principal: multimodalidad nativa. La entrada de imágenes, videos y archivos va directamente al modelo. GLM-5.3 enruta la visión a través de adaptadores separados, y GLM-5.2 era solo texto.
- Contexto: 1,048,576 tokens, la misma ventana de 1M que GLM-5.3.
- El verdadero atractivo: el costo. Z.ai lo sitúa aproximadamente en una décima parte del precio de GLM-5.2, con una tarifa de lista de $0.15 por millón de tokens de entrada y $0.50 por millón de salida.
- La advertencia honesta: no es rápido. Artificial Analysis mide 48.7 tokens de salida por segundo, lo cual es lento para su clase de tamaño. El tiempo hasta el primer token es genuinamente bueno con 1.52 segundos.
- Dónde conseguirlo: la API de Z.ai como
glm-5.3-flash, además de OpenRouter, Cloudflare Workers AI, Vercel AI Gateway y varios otros proveedores. Los pesos están en Hugging Face.
Las especificaciones
| Propiedad | Valor |
|---|---|
| Parámetros totales | 320B |
| Parámetros activos | 18B |
| Arquitectura | Mezcla de expertos, atención híbrida lineal y dispersa |
| Licencia | MIT |
| Ventana de contexto | 1,048,576 tokens |
| Modalidades de entrada | Texto, imagen, video, archivos |
| Salida | Texto |
| Modos de razonamiento | low, high, max (por defecto max) |
| ID del modelo API | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
Un número a tratar con precaución: los tokens de salida máximos. OpenRouter lista 131,072 y la tarjeta del modelo de Hugging Face indica 163,840. Esas fuentes no están de acuerdo y Z.ai no ha publicado una cifra que lo resuelva. Si su aplicación depende de generaciones individuales muy largas, verifique el límite con su proveedor real antes de construir su solución en torno a ello.
La multimodalidad nativa es la verdadera novedad
Cada capacidad de visión anterior en la línea GLM llegó como un modelo o una vía separada. Z.ai lanzó GLM-5V-Turbo y GLM-4.6V como modelos de visión distintos. Si quería que un modelo GLM viera una captura de pantalla, llamaba a un endpoint diferente al que usaba su tráfico de texto.
GLM-5.3-Flash lo unifica. Las imágenes, videos y archivos son bloques de contenido en la misma solicitud de finalización de chat que contiene su texto. Hay un ID de modelo, una línea de facturación y una ventana de contexto que contiene su imagen y su millón de tokens de texto circundante al mismo tiempo.
Esa última parte es lo interesante. Una ventana de contexto de 1M de tokens que también acepta imágenes significa que puede colocar un documento de especificaciones largo y una captura de pantalla del resultado renderizado en el mismo prompt y pedirle al modelo que los concilie. El propio enfoque de Z.ai se basa en esto: describe que el modelo observa "interfaces, resultados de renderizado y retroalimentación de interacción", lo cual es un caso de uso para agentes de codificación, no para subtítulos de fotos.
Si está trabajando con modelos de visión de manera más general, nuestra guía de la API de GLM-5V-Turbo cubre el enfoque anterior de visión dedicada, y GLM-OCR para la comprensión de documentos cubre el caso especializado.
La arquitectura, brevemente
Z.ai construyó GLM-5.3-Flash sobre un nuevo modelo base en lugar de post-entrenar GLM-5.2. Dos elecciones de diseño son importantes para su comportamiento:

Atención híbrida. El modelo mezcla atención lineal con atención dispersa. La atención lineal maneja las dependencias locales de forma económica; la atención dispersa busca los tokens globalmente relevantes. El resultado declarado es aproximadamente tres veces menos cálculo de atención que GLM-5.3 y una caché KV aproximadamente 4.4 veces más pequeña.
Hiperconexiones con Restricciones de Variedad. Es el término de Z.ai para su trabajo de eficiencia de escalado en esta versión. Todavía no hay suficientes detalles públicos para evaluarlo de forma independiente, así que trátelo como una característica arquitectónica descrita por el proveedor en lugar de una ventaja probada.
La reducción de la caché KV es la parte con consecuencias prácticas obvias. La caché KV es lo que hace que la inferencia de contexto largo sea costosa en memoria, y reducirla en 4.4x es la razón principal por la que este modelo se puede ofrecer a una décima parte del precio de GLM-5.2 manteniendo una ventana de 1M.
El entrenamiento utilizó un corpus que Z.ai describe como aproximadamente 30 billones de tokens multimodales.
Sobre el nombre
Artificial Analysis mide GLM-5.3-Flash en 48.7 tokens de salida por segundo. Para ponerlo en contexto, eso está en el extremo inferior para modelos de pesos abiertos de tamaño comparable. GLM-5.3, el hermano mayor, funciona a unos 86 tokens por segundo en la misma medición.
Así que el modelo Flash es aproximadamente la mitad de rápido que el modelo no-Flash.
Lo que sí gana es el tiempo hasta el primer token, con 1.52 segundos frente a una mediana de 2.14 segundos para modelos de pesos abiertos. Si su carga de trabajo implica muchas interacciones cortas, esa capacidad de respuesta es real. Si su carga de trabajo es generar documentos largos, esperará más de lo que lo haría con GLM-5.3.
La eficiencia que ofrece este modelo está en el costo y la memoria, no en la velocidad de generación real. La caché KV más pequeña y el menor cálculo de atención se traducen en un precio por token más económico y una menor huella de servicio. No se traducen en una transmisión más rápida.
Esto importa porque la mayor parte de la cobertura publicada en los días posteriores al lanzamiento repitió el encuadre del proveedor sin verificar el número de rendimiento, que fue público todo el tiempo. Elija este modelo porque es económico y maneja imágenes, no porque espere que transmita rápidamente.
Benchmarks
Números publicados en el lanzamiento por Z.ai, así que léalos como afirmaciones del proveedor hasta que terceros los reproduzcan:

La cifra independiente es de Artificial Analysis, que sitúa a GLM-5.3-Flash en 57 en su Índice de Inteligencia v4.1.1. GLM-5.3 obtiene 60. La mediana para modelos de pesos abiertos de tamaño similar es 27, por lo que 57 es un resultado sólido para la clase, aunque se sitúe por debajo de su hermano mayor.
Z.ai enmarca el modelo como cercano a Claude Opus 4.8 en trabajo de codificación y como agente. Esa es la caracterización del proveedor de sus propias evaluaciones internas, no un resultado medido por terceros, y la brecha de tres puntos en el Índice de Inteligencia con su propio GLM-5.3 sugiere que se justifica cierta prudencia.
Para saber cómo se desarrolló la historia del benchmark de GLM en versiones anteriores, nuestro análisis detallado de los benchmarks de GLM-5.2 explica qué mide realmente cada una de estas evaluaciones.
La semana de Ox Alpha
El 20 de agosto, un modelo anónimo llamado ox-alpha apareció en plataformas de inferencia de terceros con una ventana de contexto de 1M de tokens y un precio de cero. Se convirtió en uno de los modelos más utilizados en esas plataformas en cuestión de días. La comunidad lo identificó como Zhipu en unas 48 horas basándose en las características de salida.

El 26 de agosto, Z.ai lo confirmó: Ox Alpha era GLM-5.3-Flash, y la semana gratuita fue una prueba de carga deliberada.
Z.ai también dice que durante esa semana, todo el tráfico fue servido en aceleradores chinos domésticos utilizando una pila basada en SGLang, y afirma un costo de servicio por token comparable al hardware NVIDIA convencional. Esa es una afirmación del proveedor sobre su propia infraestructura sin verificación independiente disponible, así que considérelo en consecuencia.
Hemos documentado este patrón antes, cuando Pony Alpha resultó ser un modelo DeepSeek o GLM. Los lanzamientos sigilosos en routers de terceros se están convirtiendo en un paso estándar previo al lanzamiento, y la conclusión útil es que un modelo anónimo inusualmente capaz con una ventana de contexto sospechosamente redonda es casi siempre el buque insignia no lanzado de alguien que recopila datos de evaluación.
Cómo usarlo realmente
API alojada. El endpoint de Z.ai es compatible con OpenAI. Apunte su cliente existente a https://api.z.ai/api/paas/v4/ y configure el modelo en glm-5.3-flash. Nuestra guía de la API de GLM-5.3-Flash explica la autenticación, la carga útil de entrada de imagen y el parámetro de esfuerzo de razonamiento.
Proveedores de terceros. OpenRouter lo ofrece como z-ai/glm-5.3-flash. También está disponible en Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten y io.net. Los precios varían entre revendedores, a veces significativamente.
Agentes de codificación. Flash está incluido en el Plan de Codificación GLM y, según se informa, ofrece tres veces la cuota utilizable de GLM-5.3, lo cual es la razón práctica por la que un suscriptor cambiaría. La documentación de Z.ai también señala que las llamadas fuera de las horas pico consumen la mitad de los puntos estándar.
Autohospedado. Los pesos tienen licencia MIT y están en Hugging Face. vLLM, SGLang, TokenSpeed y KTransformers lo soportan, y existen cuantizaciones GGUF para configuraciones más pequeñas.
¿Deberías usarlo?
Usa GLM-5.3-Flash si necesitas comprensión de imágenes o videos en la misma llamada que tu texto, si tu costo por token es la restricción que estás optimizando, o si quieres pesos abiertos que puedas autoalojar bajo una licencia permisiva.
Opta por GLM-5.3 en su lugar si necesitas los últimos puntos de calidad de razonamiento, o si el rendimiento de la generación te importa más que el precio. Nuestra comparación lado a lado de ambos detalla la decisión, y qué es GLM-5.3 cubre el modelo base en sus propios términos.
Elijas el que elijas, el cambio es una modificación de una sola línea del ID del modelo en un endpoint compatible con OpenAI, lo que facilita probar ambos con tu propia carga de trabajo en lugar de confiar en la tabla de benchmarks de terceros. Esa es la forma correcta de decidir.
Probar un cambio de modelo correctamente significa enviar solicitudes reales y verificar respuestas reales, incluidas las multimodales que son difíciles de crear manualmente en curl. Apidog le permite guardar esas llamadas como una colección reutilizable con aserciones adjuntas, para que cuando pase de GLM-5.3 a Flash, pueda confirmar que la forma de la respuesta no cambió en lugar de descubrirlo en producción.
Preguntas frecuentes
¿Es GLM-5.3-Flash gratuito? Ya no. La semana gratuita de Ox Alpha terminó cuando el modelo fue anunciado oficialmente. Hay un descuento de lanzamiento del 50% vigente hasta el 9 de septiembre de 2026, después de lo cual se aplicarán los precios de lista.
¿Es más rápido que GLM-5.3? No. Genera aproximadamente 49 tokens por segundo frente a los 86 de GLM-5.3. Sin embargo, comienza a responder antes, con 1.52 segundos hasta el primer token.
¿Puede realmente manejar un millón de tokens de contexto? La ventana configurada es de 1,048,576 tokens, confirmada en la configuración del modelo y por Artificial Analysis. Tenga en cuenta que OpenRouter lista una cifra mayor de 1,310,720; trátelo como una lista del proveedor en lugar de una especificación del modelo.
¿Acepta video? La documentación de Z.ai lista entrada de texto, imagen, video y archivos. El soporte de video es más reciente y menos utilizado que la entrada de imágenes, así que valídelo con sus propios medios antes de depender de él.
¿Bajo qué licencia están los pesos? MIT, con los pesos publicados en zai-org/GLM-5.3-Flash en Hugging Face.
