GLM-5.2 es el modelo insignia más reciente de Z.ai (el laboratorio de IA Zhipu), y llegó con una propuesta clara: pesos abiertos, enfocado en la codificación y competitivo con los modelos frontera cerrados más grandes. Si has estado escuchando el nombre y quieres una respuesta directa a “qué es GLM-5.2”, esta es la explicación canónica. Cubriremos quién lo fabrica, qué es realmente bajo el capó, cómo acceder a él y cuáles son las advertencias honestas.
En resumen
- Qué es: GLM-5.2 es un modelo de lenguaje grande de pesos abiertos de Z.ai, diseñado para codificación, razonamiento y uso de herramientas agentivas.
- Tamaño: Aproximadamente 753 mil millones de parámetros en un diseño de Mezcla de Expertos (MoE), BF16, con un nuevo truco de atención dispersa llamado “IndexShare” para mantener los contextos largos más económicos.
- Contexto: 1M de tokens (1.048.576). La salida máxima se lista como hasta 128K según la documentación de z.ai (verificar en vivo, ya que no todos los hosts listan el mismo límite superior).
- Licencia: MIT, pesos abiertos. Puedes descargarlo, autoalojarlo, ajustarlo y distribuirlo comercialmente.
- Referencia destacada: Terminal-Bench 2.1 saltó de 62.0 de GLM-5.1 a 81.0, según los resultados publicados por Z.ai. SWE-bench Pro se sitúa en 62.1.
- Acceso: API de Z.ai, Claude Code a través del Plan de Codificación GLM, OpenRouter y Ollama.
- Advertencia: Es entrada de texto, salida de texto. No hay una variante de visión confirmada. No esperes entrada de imágenes.
¿Quién fabrica GLM-5.2 y qué es?
GLM-5.2 proviene de Z.ai, el laboratorio también conocido como Zhipu AI. Es la última entrada en la familia GLM ("General Language Model"), siguiendo el lanzamiento de GLM-5.1. El posicionamiento es explícito: este es un modelo insignia de codificación que distribuye sus pesos abiertamente en lugar de esconderse detrás de una pared de solo API.

Esa postura de pesos abiertos es la clave. La mayoría de los modelos que compiten con GPT-5.5 o Claude Opus 4.8 son cerrados. GLM-5.2 pone una capacidad comparable en un archivo que puedes descargar. Si has leído nuestra visión general de GLM-5.1, piensa en el 5.2 como la misma línea con un enfoque más agudo en la codificación y las capacidades agentivas.
GLM-5.2 es un modelo de propósito general con un sesgo hacia la codificación. Maneja el razonamiento, las matemáticas y el texto multilingüe (el inglés y el chino son de primera clase), pero Z.ai lo ha ajustado con mayor intensidad para la ingeniería de software y el trabajo de agente multi-paso impulsado por herramientas.
Identidad: cómo encontrar GLM-5.2 en diferentes plataformas
Una cosa que confunde a la gente con los modelos abiertos es la nomenclatura. El mismo modelo tiene diferentes identificadores dependiendo de dónde lo cargues. Aquí tienes el mapa.
| Plataforma | Identificador |
|---|---|
| Hugging Face | zai-org/GLM-5.2 |
| API de Z.ai | glm-5.2 |
| Ollama | glm-5.2 |
| OpenRouter | z-ai/glm-5.2 |
Los pesos tienen licencia MIT sin restricciones regionales, por lo que el repositorio de Hugging Face es realmente descargable en lugar de estar restringido. Puedes confirmar la ficha y los archivos en la página de GLM-5.2 en Hugging Face.
Arquitectura en términos sencillos: 753B MoE + IndexShare
GLM-5.2 es un modelo de Mezcla de Expertos con aproximadamente 753 mil millones de parámetros totales, servido en BF16. MoE significa que el modelo se divide en muchas subredes de "expertos", y solo una fracción de ellas se activa para cualquier token dado. Obtienes la capacidad de conocimiento de un modelo enorme sin pagar la factura completa de computación en cada pasada hacia adelante. Así es como un modelo de 753B sigue siendo utilizable.

La novedad es la atención dispersa. GLM-5.2 introduce un método que Z.ai llama IndexShare. La atención normal se vuelve costosa rápidamente a medida que tu contexto crece, porque cada token atiende a todos los demás tokens. IndexShare reutiliza un único “indexador” en cada grupo de 4 capas de atención dispersa, en lugar de calcular uno nuevo por capa. En la práctica, esto reduce el costo de la atención en contextos largos, que es exactamente lo que quieres cuando tu ventana es de un millón de tokens de ancho.
No necesitas entender las matemáticas para beneficiarte de ello. La conclusión: GLM-5.2 está diseñado para que alimentarlo con una gran base de código o un documento largo no dispare tu latencia y coste como lo haría un modelo denso.
Una ventana de contexto de 1M de tokens
GLM-5.2 soporta una ventana de contexto de 1M de tokens (1.048.576 tokens, para ser exactos). Eso es suficiente para introducir un repositorio de tamaño mediano completo, una especificación larga o un montón de documentos relacionados en un solo prompt y pedirle al modelo que razone sobre todo ello.
La salida máxima es donde debes tener cuidado. La documentación de z.ai lista una salida de hasta 128K tokens, pero no todos los hosts publican el mismo número, y OpenRouter no lo lista en absoluto. Así que considera 128K como el límite documentado a verificar en vivo, en lugar de una garantía en cada endpoint. Si tu flujo de trabajo depende de generaciones muy largas, verifica el límite en el proveedor específico que estés utilizando.
Para contextualizar cómo esta generación elevó el listón, nuestra comparación de GLM-5.2 vs GLM-5.1 desglosa los cambios entre lanzamientos.
Esfuerzo de pensamiento: Alto, Máximo y cómo desactivarlo
GLM-5.2 es un modelo capaz de razonamiento con un comportamiento de “pensamiento” controlable. Tienes dos niveles de esfuerzo de pensamiento:
- Alto, razonamiento potente con un coste computacional más ligero.
- Máximo, el razonamiento más profundo. Z.ai recomienda Máximo específicamente para tareas de codificación.
También puedes desactivar el pensamiento por completo. Para búsquedas rápidas, formateo o transformaciones simples, no querrás que el modelo queme tokens en una cadena de pensamiento interna. Desactivar el pensamiento mantiene esas llamadas rápidas y económicas.
En la API, esto se mapea a un parámetro thinking ({"type": "enabled"} o {"type": "disabled"}) y un valor reasoning_effort como "max". Profundizamos en la forma de la solicitud en la guía de la API de GLM-5.2, pero el modelo mental es simple: aumenta el razonamiento para trabajos de ingeniería difíciles, desactívalo para llamadas triviales.
Licencia MIT y pesos abiertos: lo que realmente te ofrecen
El término “pesos abiertos” se usa a menudo de forma imprecisa, así que aquí está lo que la licencia MIT de GLM-5.2 permite concretamente:
- Autoalojamiento. Ejecútalo en tu propio hardware o en una GPU alquilada. Nada sale de tu red.
- Ajuste fino. Adáptalo a tu dominio, a las convenciones de tu base de código o a una tarea especializada.
- Uso comercial. La licencia MIT es permisiva. Puedes construir productos sobre ella sin una licencia restrictiva que te limite.
- Sin bloqueo regional. Los pesos no están restringidos por una verificación regional.
Para los equipos con restricciones de residencia de datos o cumplimiento, esto importa más que uno o dos puntos de referencia. Puedes mantener los prompts y el código internamente. Si quieres probar la ruta totalmente local, consulta ejecutar GLM-5 localmente gratis y GLM-5 gratis con Ollama para ver los patrones, que se aplican al 5.2.
Primero la codificación y las capacidades agentivas: los puntos de referencia
Z.ai construyó GLM-5.2 para realizar trabajo de software real, no solo para hablar de ello. La historia de los benchmarks se centra en la codificación y el uso de herramientas agentivas. Los números a continuación son los resultados publicados por Z.ai, así que léelos como las propias mediciones del laboratorio en lugar de puntuaciones independientes de terceros.
| Benchmark | GLM-5.2 | Comparación notable |
|---|---|---|
| Terminal-Bench 2.1 | 81.0 | GLM-5.1 obtuvo 62.0 |
| SWE-bench Pro | 62.1 | GPT-5.5 58.6, GLM-5.1 58.4 |
| MCP-Atlas | 77.0 | GPT-5.5 75.3, Claude Opus 4.8 77.8 |
| El Último Examen de la Humanidad (con herramientas) | 54.7 | GPT-5.5 52.2 |
| AIME 2026 | 99.2 | n/a |
| GPQA-Diamond | 91.2 | n/a |
La estadística principal es Terminal-Bench. Pasar de 62.0 a 81.0 en una sola generación es un gran salto en un benchmark que mide si un modelo puede realmente operar una terminal para completar tareas. SWE-bench Pro con 62.1, superando el 58.6 de GPT-5.5, es la otra noticia destacada: apunta a una genuina resolución de problemas a nivel de repositorio, no a fragmentos de juguete.
Z.ai también informa que GLM-5.2 es el modelo de código abierto más alto en FrontierSWE, PostTrainBench y SWE-Marathon, y lo posiciona contra GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro y DeepSeek-V4-Pro. VentureBeat abordó el ángulo del costo sin rodeos, escribiendo que GLM-5.2 “supera a GPT-5.5 en codificación de largo alcance con aproximadamente 1/6 del costo” (esa frase es una contextualización de VentureBeat, en su cobertura de GLM-5.2, no una medición de Apidog).
Para el desglose completo y las advertencias de comparación directa, consulta nuestra inmersión profunda en los benchmarks de GLM-5.2 y la comparación directa de GLM-5.2 vs GPT-5.5, Claude Opus y Gemini.
Cómo acceder a GLM-5.2 de un vistazo
Tienes cuatro rutas prácticas, dependiendo de si quieres una API alojada, una configuración de codificación agentiva, un enrutador o una instalación local.
| Ruta de acceso | Mejor para | Nota rápida |
|---|---|---|
| API de Z.ai | Llamadas directas y alojadas | Compatible con OpenAI, endpoint en https://api.z.ai/api/paas/v4/ |
| Claude Code (Plan de Codificación GLM) | Codificación agentiva en tu terminal | URL base compatible con Anthropic, selecciona la variante [1m] |
| OpenRouter | Una clave, muchos modelos | ID del modelo z-ai/glm-5.2 |
| Ollama | Local / sin conexión | Descarga glm-5.2 de la biblioteca |
API de Z.ai. La API general es compatible con OpenAI. Accedes a https://api.z.ai/api/paas/v4/chat/completions con una clave Bearer y pasas los parámetros habituales más thinking, reasoning_effort, temperature y stream. Se admiten llamadas a funciones y herramientas.
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Refactor this function for readability."}],
"thinking": {"type": "enabled"},
"reasoning_effort": "max",
"stream": true
}'
Claude Code a través del Plan de Codificación GLM. Z.ai expone un endpoint de codificación compatible con Anthropic, por lo que puedes apuntar Claude Code a GLM-5.2. La URL base de codificación es https://api.z.ai/api/coding/paas/v4 (algunas fuentes muestran open.z.ai/api/paas/v4, así que verifica en vivo), y configuras tu entorno de Claude Code para que enrute a través de ella.
export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000
El sufijo [1m] selecciona la variante de contexto de 1M. Esa línea API_TIMEOUT_MS no es un relleno opcional: las llamadas largas y de gran contexto pueden exceder el tiempo de espera predeterminado de Claude Code, por lo que aumentarlo evita que la herramienta cancele las solicitudes a mitad de camino. Recorremos esta configuración, además de Cline y Cursor, en la guía de GLM-5.2 en Claude Code, Cline y Cursor. Si has utilizado la generación anterior de esa manera, nuestro artículo sobre GLM-5.1 con Claude Code cubre el mismo flujo.
OpenRouter. Si ya enrutas a través de OpenRouter, GLM-5.2 está disponible como z-ai/glm-5.2. Consulta la lista en vivo en openrouter.ai/z-ai/glm-5.2. Ten en cuenta que no hay una vía gratuita de OpenRouter para este modelo, así que no planifiques contando con ella.
Ollama. Para uso local, descárgalo de la biblioteca de Ollama. Esta es la ruta para el trabajo sin conexión o el control estricto de datos, con el obvio inconveniente de que necesitas memoria GPU real para servir un MoE de 753B cómodamente.
Para un resumen de las opciones genuinamente gratuitas, consulta cómo usar GLM-5.2 gratis.
Precios, brevemente
En la API alojada, OpenRouter confirma los precios en $1.40 por 1M de tokens de entrada y $4.40 por 1M de tokens de salida. VentureBeat cita una entrada en caché alrededor de $0.26 por 1M. El Plan de Codificación GLM tiene suscripciones por niveles (Lite, Pro, Max y Team), pero las cifras mensuales exactas varían según las fuentes secundarias, así que confirma los precios actuales en z.ai antes de comprometerte (a junio de 2026). Nuestro desglose de precios de GLM-5.2 mantiene un recuento actualizado.
Dónde encaja Apidog
Si estás desarrollando con la API de GLM-5.2, o integrándola en un agente que llama a tus propios servicios, aún necesitas diseñar, probar y documentar esos endpoints. Ahí es donde Apidog ayuda. Puedes simular los endpoints respaldados por LLM antes de que la integración real esté lista, depurar las formas de las solicitudes y respuestas (incluyendo streaming y payloads de llamadas a herramientas), y mantener tu documentación de API sincronizada a medida que cambia el contrato. Es una plataforma API todo en uno, por lo que el diseño, la depuración, las pruebas, la simulación y la documentación residen en un solo lugar en lugar de en cuatro. Cuando estés listo para probarlo, descarga Apidog y dirígelo a tu integración de GLM-5.2.
Cómo se compara GLM-5.2 con el resto de la familia y el sector
GLM-5.2 es el pináculo de codificación y capacidades agentivas de la línea GLM actual. Si lo estás comparando con lanzamientos anteriores o laboratorios rivales, estas son las siguientes lecturas útiles:
- GLM-5.1 vs Claude, GPT, Gemini y DeepSeek para conocer la posición de la generación anterior.
- GLM-5 vs DeepSeek vs GPT-5 en velocidad y coste para el ángulo de la eficiencia.
- Claude Opus 4.8 vs GPT-5.5 vs Gemini 3.5 para la frontera de modelos cerrados que persigue.
- La publicación oficial del blog de Z.ai sobre GLM-5.2 y la documentación para las especificaciones de referencia.
Preguntas Frecuentes
¿Qué es GLM-5.2 en una frase? Es el LLM insignia de pesos abiertos de Z.ai, un modelo MoE de ~753 mil millones de parámetros ajustado para codificación, razonamiento y uso de herramientas agentivas, con una ventana de contexto de 1M de tokens y una licencia MIT.
¿Es GLM-5.2 realmente gratuito? Los pesos son de descarga gratuita y pueden autoalojarse bajo licencia MIT. La API alojada de Z.ai y el Plan de Codificación GLM son de pago. No existe un nivel gratuito de OpenRouter para él, por lo que “gratuito” aquí significa pesos abiertos, no un endpoint alojado gratuito.
¿Puede GLM-5.2 ver imágenes? No. Es entrada de texto, salida de texto según la documentación de la API, sin variante de visión confirmada. Usa un modelo de visión separado si necesitas entrada de imágenes.
¿En qué se diferencia GLM-5.2 de GLM-5.1? El salto visible más grande está en la codificación agentiva. Terminal-Bench 2.1 pasó de 62.0 a 81.0 según los resultados de Z.ai, además de las mejoras en SWE-bench Pro y la nueva atención dispersa IndexShare. Consulta la comparación de GLM-5.2 vs GLM-5.1 para ver la diferencia completa.
¿Qué longitud de contexto y de salida soporta? El contexto es de 1M de tokens. La salida está documentada en hasta 128K según z.ai, pero no todos los hosts listan el mismo límite superior, así que verifica con tu proveedor.
La versión corta
GLM-5.2 es lo que ocurre cuando un laboratorio de pesos abiertos decide competir de frente con la frontera cerrada en codificación. Obtienes un modelo MoE de 753B con una ventana de un millón de tokens, esfuerzo de razonamiento controlable, una licencia MIT que te permite autoalojar y distribuir, y resultados de benchmark que lo sitúan en la conversación de GPT-5.5 y Claude Opus 4.8, al menos según los propios números de Z.ai. Las advertencias son reales (solo texto, límites de salida a verificar, afirmaciones de benchmark del proveedor), pero la propuesta central se mantiene: este es un modelo de codificación serio que realmente puedes poseer. Comienza con la guía de la API de GLM-5.2 cuando estés listo para construir.
