Zhipu AI, el laboratorio chino que opera internacionalmente como Z.ai, lanzó GLM-5.3 el 14 de agosto de 2026, y las cifras de codificación lo demuestran. Las evaluaciones internas muestran una mejora del 50% en la capacidad de codificación con respecto a GLM-5.2, la puntuación de Terminal-Bench 3.0 saltó de 4.6 a 28.3, y Zhipu describe la capacidad de codificación y de agente del modelo como "aproximándose a Claude Fable 5", según el informe de lanzamiento de BigGo. Los pesos abiertos seguirán en unas dos semanas. Para el desglose completo de la capacidad y la tabla de referencia, lea qué es GLM-5.3; este artículo es la guía de inicio rápido práctico de la API.
Esto es lo que hará: obtener una clave de API, realizar una primera llamada en cURL, portarla a Python y Node.js a través del SDK de OpenAI, transmitir tokens, ajustar los parámetros importantes y conectar todo el ciclo a Apidog para que pueda fijar la forma de la solicitud antes de escribir código de aplicación. La buena noticia de antemano: la API de Z.ai es compatible con OpenAI. Si ha llamado a algún endpoint de estilo OpenAI antes, ya conoce la mayor parte de esto.
Una advertencia antes del código. GLM-5.3 se lanzó hoy, y la documentación de Zhipu se actualiza rápidamente en los días de lanzamiento. Todo lo siguiente que provino directamente de la documentación oficial cuando lo revisé se presenta como verificado; cualquier cosa que la documentación aún no haya actualizado se marca como la convención de la familia GLM-5, con un enlace para que pueda confirmar el estado actual usted mismo.
TL;DR
- GLM-5.3 lanzado el 14 de agosto de 2026. Las evaluaciones internas de Zhipu informan una mejora del 50% en la codificación con respecto a GLM-5.2 y un salto en Terminal-Bench 3.0 de 4.6 a 28.3. Ocupa el primer lugar entre los modelos de código abierto en Terminal-Bench 3.0 y Agents’ Last Exam.
- La API es compatible con OpenAI. Endpoint internacional:
POST https://api.z.ai/api/paas/v4/chat/completionscon la cabeceraAuthorization: Bearer $GLM_API_KEY. China continental:https://open.bigmodel.cn/api/paas/v4/chat/completions. - Al momento de escribir esto, la página de documentación de GLM-5 listaba
glm-5como la ID del modelo. La página de precios de Zhipu listaglm-5.2yglm-5.1como modelos separados, así que se espera queglm-5.3siga la misma convención de puntos. Confirme antes de codificarlo. - Zhipu no había publicado precios específicos de la API 5.3 en el lanzamiento. A modo de escala, la página oficial de precios listaba GLM-5.2 a $1.40 por 1M de tokens de entrada y $4.40 por 1M de tokens de salida, y GLM-5 a $1.00 y $3.20.
- Los pesos abiertos llegarán a Hugging Face alrededor del 28 de agosto de 2026. Las cuotas del Plan de Codificación GLM se restablecieron para todos los usuarios el 14 de agosto.
- Pruebe en Apidog primero: un entorno por endpoint regional, la ID del modelo detrás de una variable, y respuestas guardadas como fixtures para que la iteración de prompts no facture tokens.
Por qué GLM-5.3 es importante
El modelo base no cambió. Todas las ganancias en este lanzamiento provienen de un post-entrenamiento escalado sobre GLM-5, lo que hace que el tamaño de los saltos sea inusual. Terminal-Bench 3.0 pasó de 4.6 a 28.3, un movimiento de 6.2x que llevó a GLM de ser irrelevante a ocupar el primer lugar entre los modelos de código abierto en ese benchmark y en Agents’ Last Exam. SWE-Marathon aproximadamente se duplicó frente a GLM-5.2. En el lado de la seguridad, CyberGym obtuvo un 84.5%, ligeramente por encima de Claude Mythos 5 y GPT-5.6 Sol, mientras que ExploitBench se situó en 54.4%, aún por detrás de los modelos de frontera. Nota sobre la fuente: la afirmación de mejora del 50% en codificación y varias de estas puntuaciones provienen de las propias evaluaciones de Zhipu, así que trátelas como un informe de proveedor hasta que terceros las reproduzcan.

La arquitectura subyacente es la base de la familia GLM-5: un diseño de Mezcla de Expertos con 744B de parámetros totales, alrededor de 40B activos por pasada hacia adelante, y una ventana de contexto de 200K tokens, según la documentación de Z.ai. Esas son especificaciones de la familia, no afirmaciones específicas de 5.3.
Dos razones más por las que este lanzamiento es importante para los usuarios de la API. Primero, Zhipu dice que lanzará los pesos abiertos de GLM-5.3 unas dos semanas después del lanzamiento, alrededor del 28 de agosto, junto con lo que llama su sistema de revisión de riesgos más extenso hasta la fecha, según la cobertura del lanzamiento de Pandaily. Si el autoalojamiento está en su hoja de ruta, la API que configure hoy sirve como su línea de base de regresión; nuestra guía de preparación para el autoalojamiento de GLM-5.3 cubre ese aspecto en detalle. Segundo, Seeking Alpha presenta a Zhipu como el "retador chino de OpenAI", y los lanzamientos de pesos abiertos con este nivel de capacidad tienden a mover los precios en todo el mercado.
Obtenga una clave de API
Z.ai (internacional). Regístrese en z.ai, abra la consola de la API y cree una clave. La documentación está en docs.z.ai. Este es el camino para cualquier persona fuera de China continental, y es el endpoint predeterminado del resto de este artículo.
Bigmodel.cn (China continental). La plataforma doméstica de Zhipu es open.bigmodel.cn. Misma forma de API, mismo esquema de autenticación, diferente host y facturación separada. Si su tráfico se origina en China continental, use esta; la latencia y el cumplimiento apuntan en esa dirección.
export GLM_API_KEY="your-key-from-the-console"
Si utiliza el Plan de Codificación GLM en lugar de la facturación de API de pago por uso, tenga en cuenta que las cuotas se restablecieron para todos los usuarios el 14 de agosto, por lo que comienza la era 5.3 con una asignación limpia.
Endpoint y autenticación
El endpoint de finalizaciones de chat, verificado contra la documentación de GLM-5 al momento de escribir:
POST https://api.z.ai/api/paas/v4/chat/completions
China continental intercambia el host:
POST https://open.bigmodel.cn/api/paas/v4/chat/completions
La autenticación es una cabecera: Authorization: Bearer $GLM_API_KEY. Sin firma, sin handshake de sesión.
Compatible con OpenAI significa exactamente lo que espera que signifique. El cuerpo de la solicitud tiene la forma del modelo más un array de mensajes, la respuesta vuelve con choices, message, finish_reason y usage, y los SDK oficiales de OpenAI funcionan sin modificaciones una vez que apunta base_url a Z.ai. Cualquier código que haya escrito para otro proveedor compatible con OpenAI se transfiere con un cambio de host y modelo; el patrón es el mismo que seguimos para la API de DeepSeek V4 Pro.
Una advertencia honesta sobre la ID del modelo. Cuando obtuve la documentación el día del lanzamiento, la página de GLM-5 listaba glm-5 como la cadena del modelo y aún no se había actualizado para 5.3. La página de precios de Zhipu factura glm-5.2 y glm-5.1 como modelos distintos, por lo que la convención familiar dice que la nueva ID es glm-5.3. Los ejemplos a continuación la utilizan, pero consulte la documentación antes de fijarla en producción. Si glm-5.3 devuelve un 404 en su región, recurra a glm-5 y seguirá en la misma familia.
Su primera solicitud en cURL
curl "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "system",
"content": "You are a code reviewer. Flag issues as blocking or non-blocking."
},
{
"role": "user",
"content": "Review this shell script for safety:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
}
],
"temperature": 0.3,
"max_tokens": 1024
}'
La respuesta tiene la forma estándar de OpenAI: un array choices donde choices[0].message.content contiene la respuesta, y un bloque usage con prompt_tokens y completion_tokens. Dada esa puntuación de Terminal-Bench, las solicitudes de revisión de shell y adyacentes a la terminal como esta son exactamente donde se supone que 5.3 ha mejorado más, por lo que es una prueba de humo adecuada.
La documentación también describe un parámetro thinking que alterna el modo de razonamiento del modelo:
"thinking": { "type": "enabled" }
Habilítelo para tareas de codificación y de agente de varios pasos; omítalo para llamadas de extracción cortas donde los tokens de razonamiento son un gasto desperdiciado.
Inicio rápido con Python
No hay un nuevo SDK que aprender. Instale el paquete de OpenAI y cambie la URL base:
pip install --upgrade openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GLM_API_KEY"],
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[
{
"role": "system",
"content": "You are a code reviewer. Flag issues as blocking or non-blocking.",
},
{
"role": "user",
"content": (
"Review this Flask route for security issues:\n\n"
"@app.route('/user/<id>')\n"
"def get_user(id):\n"
" return db.execute(f'SELECT * FROM users WHERE id = {id}')"
),
},
],
temperature=0.3,
max_tokens=2048,
)
print(response.choices[0].message.content)
print("input tokens:", response.usage.prompt_tokens)
print("output tokens:", response.usage.completion_tokens)
Registre ese bloque usage desde el primer día. Sin precios específicos de 5.3 publicados en el lanzamiento, sus recuentos de tokens son la única forma de proyectar cuánto será su factura una vez que aparezcan las cifras oficiales.
Inicio rápido con Node.js
Lo mismo con el paquete npm openai:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.GLM_API_KEY,
baseURL: "https://api.z.ai/api/paas/v4",
});
const response = await client.chat.completions.create({
model: "glm-5.3",
messages: [
{
role: "system",
content: "You are a terminal automation agent. Return each step as a shell command with a one-line rationale.",
},
{
role: "user",
content: "A Node service on port 3000 stopped responding after a deploy. Give me a diagnosis sequence.",
},
],
temperature: 0.3,
max_tokens: 2048,
});
console.log(response.choices[0].message.content);
Si su base de código ya se comunica con OpenAI, no necesita un cliente paralelo. Instancie una segunda instancia de OpenAI con la baseURL de Z.ai y dirija las solicitudes por tarea. Eso hace que la comparación A/B entre GLM-5.3 y su modelo actual sea una decisión de enrutamiento en lugar de una reescritura.
Streaming
La documentación confirma la compatibilidad con el streaming a través del flag estándar stream. En Python:
stream = client.chat.completions.create(
model="glm-5.3",
messages=[
{"role": "user", "content": "Explain the N+1 query problem with a concrete ORM example."}
],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
A través de HTTP puro, establezca "stream": true en el cuerpo y analice los eventos enviados por el servidor; cada línea data: lleva un delta en el formato de fragmento de OpenAI. Dos notas prácticas. El uso de tokens llega en o después del fragmento final, por lo que la contabilidad solo es precisa una vez que la transmisión se cierra. Y si habilita thinking, espere una pausa más larga antes del primer token visible en prompts difíciles; el modelo está gastando tokens razonando antes de responder, lo cual es el compromiso que aceptó.
Parámetros importantes
Los parámetros que cubre la documentación, en orden de la frecuencia con la que los ajustará:
| Parámetro | Tipo | Qué hace |
|---|---|---|
max_tokens |
entero | Límite estricto en la longitud de la salida. Su principal palanca de costo. |
temperature |
número | Use de 0.2 a 0.4 para código y extracción, 0.7+ para escritura abierta. |
thinking |
objeto | {"type": "enabled"} activa el modo de razonamiento para tareas de varios pasos. |
stream |
booleano | Eventos enviados por el servidor en lugar de un único cuerpo de respuesta. |
messages |
array | Roles estándar de OpenAI: system, user, assistant. |
Sobre el costo: Zhipu no había publicado precios específicos de la API 5.3 en el lanzamiento, así que resista cualquier cifra por token que vea en páginas de revendedores. La página oficial de precios es la fuente de la verdad; al momento de escribir, listaba GLM-5.2 a $1.40 de entrada y $4.40 de salida por 1M de tokens, y GLM-5 a $1.00 y $3.20, lo que enmarca dónde aterrizará plausiblemente 5.3. La entrada en caché en los modelos GLM de pago tiene un descuento del 80 al 85%, así que estructure los prompts de sistema repetidos para aprovechar la caché. Si un proveedor alguna vez lo sorprendió con un cambio de precio, sabe por qué esta disciplina es importante; nuestro post-mortem sobre el aumento de precios de DeepSeek cubre los patrones de control de costos que se transfieren directamente.
Pruebe GLM-5.3 en Apidog antes de escribir el código de la aplicación
La iteración de prompts dentro de un script es un ciclo lento: edite, vuelva a ejecutar, desplácese, repita, y cada ciclo factura tokens. Debido a que la API de Z.ai es compatible con OpenAI, un cliente de API puede absorber toda la fase de exploración.
- Cree un proyecto y añada la solicitud de finalizaciones de chat. Importe cualquier especificación compatible con OpenAI o defina manualmente el único endpoint
POST /chat/completions; el cuerpo tiene la forma familiar demodelmásmessages. - Cree dos entornos:
zai-internationalybigmodel-mainland. Establezca la URL base en cada uno (https://api.z.ai/api/paas/v4yhttps://open.bigmodel.cn/api/paas/v4) y vinculeAuthorization: Bearer {{GLM_API_KEY}}a nivel de entorno. Cambiar de región se convierte en un clic en un desplegable, y la clave nunca llega a una solicitud guardada. - Ponga la ID del modelo detrás de una variable configurada como
glm-5.3. En la semana de lanzamiento, esto es más importante de lo habitual: si la ID cambia a medida que la documentación se estabiliza, o si desea hacer una prueba A/B contraglm-5.2, cambiará una variable en lugar de editar cada solicitud guardada. - Pruebe la opción
thinkingen paralelo. Duplique la solicitud, habilite el razonamiento en una copia y compare la latencia, la calidad de la salida y elusageen el mismo prompt. Esta es la forma más rápida de decidir qué cargas de trabajo merecen tokens de razonamiento. - Acceda al endpoint de streaming. Los fragmentos SSE se renderizan en vivo, por lo que verá el tiempo hasta el primer token de la misma manera que lo verán sus usuarios.
- Guarde las respuestas buenas como ejemplos. Las ejecuciones posteriores accederán al fixture en lugar de a la API en vivo, lo cual es el mayor ahorro de tokens durante el desarrollo.
A partir de ahí, encadene las solicitudes guardadas en escenarios de prueba con aserciones sobre finish_reason, el esquema de respuesta y los recuentos de tokens, y habrá convertido las pruebas de humo en un conjunto de regresión. El mismo flujo de trabajo, generalizado a cualquier API, se encuentra en nuestra guía de pruebas de API para ingenieros de QA.
Gestión de errores y límites de tasa
Espere errores estándar de estilo OpenAI: un objeto error con un message, type y code. Los sospechosos habituales son 401 para una clave faltante o revocada, 400 para un cuerpo malformado o una ID de modelo desconocida, 429 para límites de tasa y 5xx para fallos transitorios del servidor.
- Envuelva cada llamada en un helper de reintentos con retroceso exponencial con jitter en 429 y 5xx. Los lanzamientos de nuevos modelos concentran el tráfico, y la capacidad del primer día es cuando se encontrará con 429s.
- No invente números de límite de tasa. Zhipu publica los detalles de concurrencia y niveles en la documentación oficial; lea los valores en vivo allí en lugar de confiar en una publicación de blog, incluida esta, para mantenerse actualizado.
- Fije la ID del modelo detrás de la configuración. Si un cambio de comportamiento de 5.3 rompe un prompt, revertir a
glm-5.2debería ser un cambio de configuración, no un despliegue. El flujo de trabajo de depuración que construimos para la API de Grok se aplica sin cambios aquí, ya que ambos hablan el dialecto de OpenAI.
FAQ
¿Cuál es la ID del modelo para la API de GLM-5.3?
Espere glm-5.3, siguiendo la convención familiar que nos da glm-5.2 y glm-5.1 en la página de precios de Zhipu. Al momento de escribir, la documentación todavía listaba glm-5 en la página del modelo, así que confirme en docs.z.ai antes de fijarlo, y mantenga la ID en la configuración para que una corrección sea económica.
¿Funciona la API de GLM-5.3 con el SDK de OpenAI?
Sí. La API es compatible con OpenAI, por lo que los paquetes oficiales openai para Python y Node.js funcionan una vez que establezca base_url a https://api.z.ai/api/paas/v4 (o el equivalente de bigmodel.cn) y pase su clave de Z.ai. Las formas de solicitud y respuesta coinciden con el estándar de finalizaciones de chat, incluyendo el streaming.
¿Cuánto cuesta la API de GLM-5.3?
Zhipu no había publicado precios específicos de 5.3 cuando se lanzó el 14 de agosto de 2026. La página oficial de precios listaba GLM-5.2 a $1.40 por 1M de tokens de entrada y $4.40 por 1M de tokens de salida, lo cual es su mejor punto de referencia hasta que aparezca la fila de 5.3. Ignore las estimaciones de precios de revendedores.
¿Cómo se compara GLM-5.3 con Claude y GPT?
Las propias evaluaciones de Zhipu sitúan la capacidad de codificación y de agente "cercana a Claude Fable 5", con CyberGym en 84.5% ligeramente por encima de Claude Mythos 5 y GPT-5.6 Sol, pero ExploitBench en 54.4% aún por detrás de los modelos de frontera. Trate los números del proveedor como afirmaciones hasta que se reproduzcan de forma independiente; para saber cómo comparamos los modelos de frontera entre sí, consulte nuestra comparación de Grok 4.6 vs GPT-5.6 vs Claude Fable 5.
¿Puedo ejecutar GLM-5.3 localmente en lugar de usar la API?
Todavía no. Zhipu dice que los pesos abiertos llegarán unas dos semanas después del lanzamiento, alrededor del 28 de agosto de 2026, en su organización de Hugging Face. El diseño MoE de 744B parámetros significa que el servicio local es trabajo de servidor, no de laptop; use la API alojada ahora y construya la línea de base contra la cual comparará un despliegue autoalojado.
Dónde encaja GLM-5.3 en su stack
GLM-5.3 vale una tarde de evaluación si ejecuta bucles de agente o cargas de trabajo de codificación, y la superficie compatible con OpenAI hace que esa tarde sea económica. Los saltos de Terminal-Bench y SWE-Marathon son informados por el proveedor, pero un movimiento de 6.2x es lo suficientemente grande como para verificarlo usted mismo, y el plazo de dos semanas para los pesos abiertos significa que las solicitudes que guarde hoy se convertirán en la línea base de regresión para un despliegue autoalojado más tarde.
La secuencia sensata: obtenga una clave, ejecute la llamada cURL y mueva la solicitud a un cliente de API antes de tocar el código de la aplicación. Descargue Apidog para configurar los dos entornos regionales, estacione la ID del modelo detrás de una variable y compare thinking activado y desactivado en sus prompts reales. Una vez que las respuestas se vean correctas, el port de Python o Node es una URL base y una variable de entorno, porque el formato de cable nunca fue la parte difícil.
