GLM-5.3 es un modelo de lenguaje grande lanzado el 14 de agosto de 2026 por Zhipu AI, el laboratorio chino que opera internacionalmente como Z.ai. Es una actualización post-entrenamiento del modelo base GLM-5, dirigida directamente al trabajo de codificación y agéntico, y Zhipu planea publicar sus pesos abiertos en Hugging Face aproximadamente dos semanas después del lanzamiento. En las evaluaciones internas de Zhipu, la capacidad de codificación mejoró un 50% con respecto a GLM-5.2.
Esa combinación es la razón por la que el lanzamiento es importante: un laboratorio que Seeking Alpha describe como un “competidor chino de OpenAI” está lanzando un modelo de codificación que, según ellos, está “acercándose a Claude Fable 5”, para luego liberar sus pesos. Se lanza un día después del último lanzamiento de DeepSeek, que cubrimos en nuestra guía de API de DeepSeek V4 Pro, por lo que la carrera de modelos abiertos en China ahora avanza a un ritmo semanal.
Este artículo explica qué es GLM-5.3, qué dicen los puntos de referencia (y cuáles provienen de las propias pruebas de Zhipu), cómo funciona el plan de pesos abiertos y cómo enviar su primera solicitud. Puede probar esa solicitud en Apidog sin escribir una sola línea de código.
En resumen
- GLM-5.3 fue lanzado el 14 de agosto de 2026 por Zhipu AI (Z.ai). Mismo modelo base GLM-5; todas las mejoras provienen de un post-entrenamiento escalado.
- La puntuación de Terminal-Bench 3.0 saltó de 4.6 a 28.3, una mejora de 6.2x, clasificándose primero entre los modelos de código abierto. También ocupa el primer lugar entre los modelos abiertos en Agents’ Last Exam.
- CyberGym: 84.5%, ligeramente por encima de Claude Mythos 5 y GPT-5.6 Sol. ExploitBench: 54.4%, todavía detrás de los modelos de vanguardia.
- Los pesos abiertos llegarán a Hugging Face alrededor del 28 de agosto de 2026, después de lo que Zhipu denomina su revisión de riesgos más exhaustiva hasta la fecha.
- Arquitectura de la familia GLM-5 según la documentación oficial: Mezcla de Expertos, 744B parámetros totales, aproximadamente 40B activos por pasada hacia adelante, ventana de contexto de 200K.
- La API es compatible con OpenAI en
https://api.z.ai/api/paas/v4/chat/completions. No se publicó un precio específico para 5.3 en el lanzamiento.
Qué es GLM-5.3
GLM-5.3 es la tercera versión puntual de la familia GLM-5, y la más enfocada. Zhipu no volvió a entrenar la base. La documentación oficial describe la base GLM-5 como un modelo de Mezcla de Expertos con 744B de parámetros totales, alrededor de 40B activados por pasada hacia adelante, y una ventana de contexto de 200K tokens; esas especificaciones se mantienen sin cambios. Lo que cambió es todo lo que está por encima: las mejoras provienen enteramente de un post-entrenamiento escalado aplicado a los mismos pesos base.

Ese detalle importa más de lo que parece. Cuando un laboratorio mejora tanto un modelo sin tocar la base, el propio pipeline de post-entrenamiento es el producto. Zhipu afirma una mejora del 50% en la codificación con respecto a GLM-5.2, y las cargas de trabajo objetivo son específicas: tareas de agente impulsadas por terminal, ingeniería de software de largo plazo y análisis de seguridad. Esto no es una actualización general de chat.
El resumen práctico: GLM-5.3 es el modelo que debería evaluar si desea un comportamiento de codificación autónomo robusto con la economía de un modelo abierto, y con la opción de ejecutarlo en su propio hardware una vez que se liberen los pesos.
Benchmarks de GLM-5.3: los números y sus fuentes
La cobertura de lanzamiento de BigGo Finance y Pandaily informó los siguientes resultados. Tome en serio la columna "fuente": algunos números provienen de clasificaciones públicas, otros de las propias ejecuciones de evaluación de Zhipu, y no son el mismo tipo de evidencia.
| Benchmark | Resultado GLM-5.3 | Contexto | Fuente |
|---|---|---|---|
| Terminal-Bench 3.0 | 28.3 (desde 4.6) | Salto de 6.2x; primero entre modelos de código abierto | Informe de lanzamiento |
| Agents’ Last Exam | Primero entre modelos de código abierto | Puntuación no revelada en el lanzamiento | Informe de lanzamiento |
| CyberGym | 84.5% | Ligeramente por encima de Claude Mythos 5 y GPT-5.6 Sol | Informe de lanzamiento |
| ExploitBench | 54.4% | Por detrás de los modelos de vanguardia | Informe de lanzamiento |
| SWE-Marathon | Aproximadamente 2x GLM-5.2 | Ingeniería de software de largo alcance | Interno de Zhipu |
| Capacidad de codificación (agregada) | +50% vs GLM-5.2 | Afirmación principal de Zhipu | Interno de Zhipu |
Dos interpretaciones son justas. La generosa: un salto de 4.6 a 28.3 en Terminal-Bench 3.0 no es ruido. Los benchmarks de terminal miden si un modelo puede encadenar comandos de shell, leer la salida y recuperarse de errores a lo largo de muchos pasos, y GLM-5.2 era débil en eso. Pasar de estar casi al final a ser el primero entre los modelos abiertos en una sola versión puntual cambia el modelo al que se recurre en los pipelines de agentes.
La escéptica: las dos afirmaciones más citables, la mejora del 50% en codificación y la duplicación de la puntuación en SWE-Marathon, son números internos de Zhipu sin un arnés público para reproducirlos. Esto no los hace falsos, pero permanecen sin verificar hasta que los pesos se liberen y evaluadores independientes vuelvan a ejecutar las suites.
Qué significa en la práctica “acercándose a Claude Fable 5”
El propio enfoque de Zhipu es que la capacidad de codificación y agente de GLM-5.3 está “acercándose a Claude Fable 5”. Esa frase tiene un trabajo cuidadoso.
Donde la afirmación se sostiene: en el lado del agente y la terminal, los números reportados están cerca del territorio de frontera. El primer lugar entre los modelos de código abierto en Terminal-Bench 3.0 y Agents’ Last Exam significa que GLM-5.3 superó a todos los competidores abiertos en las tareas importantes para agentes de codificación autónomos. El resultado de CyberGym del 84.5% incluso supera a Claude Mythos 5 y GPT-5.6 Sol, aunque el margen es lo suficientemente pequeño como para que la varianza entre ejecuciones pueda explicarlo.
Donde no se sostiene: ExploitBench, con un 54.4%, sigue estando claramente por detrás de los modelos de vanguardia. El desarrollo de exploits exige un razonamiento profundo en múltiples pasos bajo ambigüedad, y la brecha ahí sugiere que la vanguardia todavía tiene una ventaja en el trabajo más difícil y que requiere mucho razonamiento. "Acercándose" es la palabra honesta. No es "igualando", y Zhipu, a su favor, no dijo igualando.
La traducción práctica para su pila: GLM-5.3 vale la pena compararlo directamente para agentes de terminal, automatización de CI y tareas de codificación a escala de repositorio. Para los problemas de razonamiento más difíciles, es probable que los modelos cerrados de vanguardia mantengan la ventaja por ahora. Si desea tener una idea de cómo se diferencian los modelos de vanguardia exactamente en estos ejes, nuestra comparación de Grok 4.6 vs GPT-5.6 vs Claude Fable 5 recorre las mismas categorías de benchmark con ejemplos prácticos.
El plan de pesos abiertos: ~28 de agosto en Hugging Face
El detalle del lanzamiento con la vida útil más larga no es un benchmark. Zhipu se comprometió a publicar los pesos abiertos de GLM-5.3 aproximadamente dos semanas después del lanzamiento, lo que sitúa la publicación alrededor del 28 de agosto de 2026, en la organización zai-org de Hugging Face donde residen los lanzamientos abiertos anteriores de la compañía.
El lapso de dos semanas es deliberado. Zhipu afirma haber construido su sistema de revisión de riesgos más extenso hasta la fecha para este lanzamiento, y los benchmarks de seguridad explican por qué: un modelo que obtiene un 84.5% en CyberGym tiene una capacidad significativa de seguridad ofensiva, y liberar esos pesos públicamente es una decisión diferente a servirlos detrás de una API monitoreada. La ventana de revisión es el costo del lanzamiento abierto.
Lo que significa la liberación para usted depende de su hardware. La inferencia de precisión completa en un MoE de 744B parámetros es territorio de clase de servidor incluso con solo ~40B parámetros activos por token, por lo que la mayoría de los equipos esperarán variantes comunitarias cuantificadas. Si planea ejecutarlo localmente, nuestra guía para autoalojar GLM-5.3 cubre el dimensionamiento, las pilas de servicio y la construcción de una línea base contra la API alojada antes de que lleguen los pesos.
Cómo encaja GLM-5.3 en el panorama de modelos abiertos
La comparación obvia es DeepSeek. Ambos laboratorios son chinos, ambos lanzan pesos abiertos, ambos tienen precios agresivos y ambos se lanzaron con 24 horas de diferencia. La diferencia es el enfoque: la línea V4 Pro de DeepSeek es un buque insignia generalista, mientras que GLM-5.3 es una apuesta especializada en que los agentes de codificación son la carga de trabajo que vale la pena ganar. Si su tráfico es mayoritariamente de codificación agéntica, esa especialización es el argumento para probar GLM-5.3 primero.
La economía da forma al resto del panorama. El reciente aumento de precio de DeepSeek, que analizamos en nuestra guía de optimización de costos de la API de DeepSeek, mostró lo rápido que puede moverse el precio de la API de modelos abiertos, y empujó a más equipos hacia el autoalojamiento como una cobertura. Un GLM-5.3 de pesos abiertos que lidera Terminal-Bench ofrece a esos equipos otra opción creíble. Zhipu no había publicado precios específicos de la API 5.3 en el lanzamiento; como referencia, la página oficial de precios listaba GLM-5.2 a $1.4 por 1M de tokens de entrada y $4.4 por 1M de tokens de salida a la fecha de esta publicación, así que espere que el número 5.3 se sitúe en ese rango, y consulte la página antes de presupuestar.
El contexto del ecosistema abierto también importa. Una vez que existan variantes cuantificadas, GLM-5.3 se unirá al conjunto de modelos que puede ejecutar sin ninguna dependencia de API. Nuestro resumen de los mejores LLMs locales en 2026 cubre dónde se encuentran los líderes abiertos actuales; un participante que encabece Terminal-Bench reorganizará esa lista.
Las cuotas del Plan de Codificación GLM fueron restablecidas
Un detalle del día del lanzamiento que afecta directamente a los usuarios existentes: Zhipu restableció las cuotas del Plan de Codificación GLM para todos los usuarios el 14 de agosto. Si está suscrito al Plan de Codificación a través de Z.ai, su asignación comenzó de nuevo el día del lanzamiento, una invitación abierta a gastar esa cuota probando 5.3.
El Plan de Codificación es la oferta de tarifa plana de Zhipu para herramientas de codificación, distinta del acceso a la API de pago por token, y el restablecimiento se aplica solo al plan, no a la facturación de la API. Los usuarios de China continental obtienen el mismo ecosistema a través de open.bigmodel.cn, con sus propios planes y facturación.
Prueba la API en cinco minutos
La API de Z.ai es compatible con OpenAI, por lo que la forma de la solicitud le resultará familiar si ha llamado a alguna API importante de LLM. El endpoint internacional es https://api.z.ai/api/paas/v4/chat/completions; China continental utiliza https://open.bigmodel.cn/api/paas/v4/chat/completions. La autenticación es un token Bearer. Una advertencia: en el lanzamiento, la documentación oficial aún listaba glm-5 como el ID del modelo documentado, por lo que el ID glm-5.3 a continuación sigue la convención de la familia GLM-5. Confirme la cadena exacta en la página de documentación del modelo antes de enviar cualquier cosa.
export GLM_API_KEY="your-key-from-z.ai"
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Write a bash script that finds the five largest files in a git repo, excluding the .git directory."
}
],
"temperature": 0.6,
"max_tokens": 1024
}'
La respuesta sigue el esquema de OpenAI: un array choices con el contenido del mensaje, más un bloque usage con el recuento de tokens.
Un ciclo más rápido que editar cadenas cURL: importe la solicitud a Apidog, almacene GLM_API_KEY como una variable de entorno y cree dos entornos, uno para el endpoint de Z.ai y otro para bigmodel.cn. Cambiar de región o de ID de modelo se convierte en un menú desplegable en lugar de una edición, y las respuestas guardadas se convierten en una línea base de regresión para el día en que se liberen los pesos abiertos.
Para el recorrido completo, incluidos los clientes Python y Node.js, streaming y manejo de errores, consulte la guía de inicio rápido de la API GLM-5.3.
Preguntas Frecuentes
¿Es GLM-5.3 de código abierto?
Todavía no, pero será de pesos abiertos. Zhipu se comprometió a lanzar los pesos en Hugging Face alrededor del 28 de agosto de 2026, aproximadamente dos semanas después del lanzamiento de la API, tras una revisión de riesgos que la compañía describe como la más exhaustiva hasta la fecha. Hasta entonces, el único acceso es a través de la API alojada.
¿En qué se diferencia GLM-5.3 de GLM-5.2?
El modelo base es idéntico. Todas las mejoras provienen de un post-entrenamiento escalado: Zhipu informa una ganancia del 50% en la capacidad de codificación en evaluaciones internas, un salto en Terminal-Bench 3.0 de 4.6 a 28.3, y una puntuación de SWE-Marathon aproximadamente duplicada. La ventana de contexto, el recuento de parámetros y la arquitectura no han cambiado con respecto a la línea base de la familia GLM-5.
¿Cuánto cuesta GLM-5.3?
Zhipu no había publicado precios específicos de la API 5.3 en el lanzamiento. La página oficial de precios listaba GLM-5.2 a $1.4 por 1M de tokens de entrada y $4.4 por 1M de tokens de salida, lo cual es el mejor ancla disponible. Consulte la página de precios en vivo antes de comprometer un presupuesto, y si el costo es su principal limitación, nuestra guía de optimización de costos de la API después del aumento de precio de DeepSeek cubre tácticas que se aplican a cualquier API por token.
¿Puedo ejecutar GLM-5.3 en mi propio hardware?
Después de la liberación de los pesos, sí, con advertencias. La familia GLM-5 es un modelo de Mezcla de Expertos de 744B parámetros con aproximadamente 40B parámetros activos por pasada hacia adelante, por lo que el servicio de precisión completa necesita hardware de servidor multi-GPU. Las compilaciones comunitarias cuantificadas reducirán la barrera; consulte la guía de preparación para el autoalojamiento para un dimensionamiento realista.
¿Es GLM-5.3 mejor que Claude o GPT para codificación?
En los benchmarks de agente y terminal reportados, es competitivo, ocupando el primer lugar entre los modelos abiertos en Terminal-Bench 3.0 y superando a Claude Mythos 5 y GPT-5.6 Sol en CyberGym. En ExploitBench, se queda atrás de la vanguardia con un 54.4%. La respuesta honesta depende de la carga de trabajo: ejecute su propio conjunto de evaluación contra ambos antes de cambiar el tráfico de producción, de la misma manera que probaría cualquier API antes de adoptarla.
Dónde encaja GLM-5.3 en su stack
GLM-5.3 es un lanzamiento especializado con una propuesta clara: rendimiento de agente de codificación casi de vanguardia, pesos abiertos en dos semanas, y una API compatible con OpenAI a la que puede apuntar el código existente hoy. La historia de los benchmarks es sólida en tareas de terminal y agente, honesta sobre la brecha de ExploitBench, y parcialmente sin verificar hasta que aterricen las ejecuciones independientes después del 28 de agosto. Eso es suficiente señal para justificar una evaluación, pero aún no lo suficiente para justificar una migración.
La forma de bajo costo para empezar: envíe la solicitud cURL anterior, guarde la respuesta y construya un pequeño conjunto de prompts para sus cargas de trabajo reales. Descargue Apidog para organizar ese conjunto, mantenga los endpoints de Z.ai y bigmodel.cn como entornos intercambiables, y convierta las llamadas exploratorias de hoy en la línea base de regresión que querrá cuando lleguen los pesos abiertos y compare su propia implementación con la API alojada.
