¿Qué es el GLM-5.2?

¿Qué es GLM-5.2? El buque insignia de codificación de Z.ai, de pesos abiertos y 753B MoE: contexto de 1M, licencia MIT, puntos de referencia y cómo acceder a él a través de API, Claude Code y Ollama.

Ashley Innocent

Ashley Innocent

17 June 2026

¿Qué es el GLM-5.2?

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

GLM-5.2 es el modelo insignia más reciente de Z.ai (el laboratorio de IA Zhipu), y llegó con una propuesta clara: pesos abiertos, enfocado en la codificación y competitivo con los modelos frontera cerrados más grandes. Si has estado escuchando el nombre y quieres una respuesta directa a “qué es GLM-5.2”, esta es la explicación canónica. Cubriremos quién lo fabrica, qué es realmente bajo el capó, cómo acceder a él y cuáles son las advertencias honestas.

botón

En resumen

¿Quién fabrica GLM-5.2 y qué es?

GLM-5.2 proviene de Z.ai, el laboratorio también conocido como Zhipu AI. Es la última entrada en la familia GLM ("General Language Model"), siguiendo el lanzamiento de GLM-5.1. El posicionamiento es explícito: este es un modelo insignia de codificación que distribuye sus pesos abiertamente en lugar de esconderse detrás de una pared de solo API.

Esa postura de pesos abiertos es la clave. La mayoría de los modelos que compiten con GPT-5.5 o Claude Opus 4.8 son cerrados. GLM-5.2 pone una capacidad comparable en un archivo que puedes descargar. Si has leído nuestra visión general de GLM-5.1, piensa en el 5.2 como la misma línea con un enfoque más agudo en la codificación y las capacidades agentivas.

GLM-5.2 es un modelo de propósito general con un sesgo hacia la codificación. Maneja el razonamiento, las matemáticas y el texto multilingüe (el inglés y el chino son de primera clase), pero Z.ai lo ha ajustado con mayor intensidad para la ingeniería de software y el trabajo de agente multi-paso impulsado por herramientas.

Identidad: cómo encontrar GLM-5.2 en diferentes plataformas

Una cosa que confunde a la gente con los modelos abiertos es la nomenclatura. El mismo modelo tiene diferentes identificadores dependiendo de dónde lo cargues. Aquí tienes el mapa.

Plataforma Identificador
Hugging Face zai-org/GLM-5.2
API de Z.ai glm-5.2
Ollama glm-5.2
OpenRouter z-ai/glm-5.2

Los pesos tienen licencia MIT sin restricciones regionales, por lo que el repositorio de Hugging Face es realmente descargable en lugar de estar restringido. Puedes confirmar la ficha y los archivos en la página de GLM-5.2 en Hugging Face.

Arquitectura en términos sencillos: 753B MoE + IndexShare

GLM-5.2 es un modelo de Mezcla de Expertos con aproximadamente 753 mil millones de parámetros totales, servido en BF16. MoE significa que el modelo se divide en muchas subredes de "expertos", y solo una fracción de ellas se activa para cualquier token dado. Obtienes la capacidad de conocimiento de un modelo enorme sin pagar la factura completa de computación en cada pasada hacia adelante. Así es como un modelo de 753B sigue siendo utilizable.

La novedad es la atención dispersa. GLM-5.2 introduce un método que Z.ai llama IndexShare. La atención normal se vuelve costosa rápidamente a medida que tu contexto crece, porque cada token atiende a todos los demás tokens. IndexShare reutiliza un único “indexador” en cada grupo de 4 capas de atención dispersa, en lugar de calcular uno nuevo por capa. En la práctica, esto reduce el costo de la atención en contextos largos, que es exactamente lo que quieres cuando tu ventana es de un millón de tokens de ancho.

No necesitas entender las matemáticas para beneficiarte de ello. La conclusión: GLM-5.2 está diseñado para que alimentarlo con una gran base de código o un documento largo no dispare tu latencia y coste como lo haría un modelo denso.

Una ventana de contexto de 1M de tokens

GLM-5.2 soporta una ventana de contexto de 1M de tokens (1.048.576 tokens, para ser exactos). Eso es suficiente para introducir un repositorio de tamaño mediano completo, una especificación larga o un montón de documentos relacionados en un solo prompt y pedirle al modelo que razone sobre todo ello.

La salida máxima es donde debes tener cuidado. La documentación de z.ai lista una salida de hasta 128K tokens, pero no todos los hosts publican el mismo número, y OpenRouter no lo lista en absoluto. Así que considera 128K como el límite documentado a verificar en vivo, en lugar de una garantía en cada endpoint. Si tu flujo de trabajo depende de generaciones muy largas, verifica el límite en el proveedor específico que estés utilizando.

Para contextualizar cómo esta generación elevó el listón, nuestra comparación de GLM-5.2 vs GLM-5.1 desglosa los cambios entre lanzamientos.

Esfuerzo de pensamiento: Alto, Máximo y cómo desactivarlo

GLM-5.2 es un modelo capaz de razonamiento con un comportamiento de “pensamiento” controlable. Tienes dos niveles de esfuerzo de pensamiento:

También puedes desactivar el pensamiento por completo. Para búsquedas rápidas, formateo o transformaciones simples, no querrás que el modelo queme tokens en una cadena de pensamiento interna. Desactivar el pensamiento mantiene esas llamadas rápidas y económicas.

En la API, esto se mapea a un parámetro thinking ({"type": "enabled"} o {"type": "disabled"}) y un valor reasoning_effort como "max". Profundizamos en la forma de la solicitud en la guía de la API de GLM-5.2, pero el modelo mental es simple: aumenta el razonamiento para trabajos de ingeniería difíciles, desactívalo para llamadas triviales.

Licencia MIT y pesos abiertos: lo que realmente te ofrecen

El término “pesos abiertos” se usa a menudo de forma imprecisa, así que aquí está lo que la licencia MIT de GLM-5.2 permite concretamente:

Para los equipos con restricciones de residencia de datos o cumplimiento, esto importa más que uno o dos puntos de referencia. Puedes mantener los prompts y el código internamente. Si quieres probar la ruta totalmente local, consulta ejecutar GLM-5 localmente gratis y GLM-5 gratis con Ollama para ver los patrones, que se aplican al 5.2.

Primero la codificación y las capacidades agentivas: los puntos de referencia

Z.ai construyó GLM-5.2 para realizar trabajo de software real, no solo para hablar de ello. La historia de los benchmarks se centra en la codificación y el uso de herramientas agentivas. Los números a continuación son los resultados publicados por Z.ai, así que léelos como las propias mediciones del laboratorio en lugar de puntuaciones independientes de terceros.

Benchmark GLM-5.2 Comparación notable
Terminal-Bench 2.1 81.0 GLM-5.1 obtuvo 62.0
SWE-bench Pro 62.1 GPT-5.5 58.6, GLM-5.1 58.4
MCP-Atlas 77.0 GPT-5.5 75.3, Claude Opus 4.8 77.8
El Último Examen de la Humanidad (con herramientas) 54.7 GPT-5.5 52.2
AIME 2026 99.2 n/a
GPQA-Diamond 91.2 n/a

La estadística principal es Terminal-Bench. Pasar de 62.0 a 81.0 en una sola generación es un gran salto en un benchmark que mide si un modelo puede realmente operar una terminal para completar tareas. SWE-bench Pro con 62.1, superando el 58.6 de GPT-5.5, es la otra noticia destacada: apunta a una genuina resolución de problemas a nivel de repositorio, no a fragmentos de juguete.

Z.ai también informa que GLM-5.2 es el modelo de código abierto más alto en FrontierSWE, PostTrainBench y SWE-Marathon, y lo posiciona contra GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro y DeepSeek-V4-Pro. VentureBeat abordó el ángulo del costo sin rodeos, escribiendo que GLM-5.2 “supera a GPT-5.5 en codificación de largo alcance con aproximadamente 1/6 del costo” (esa frase es una contextualización de VentureBeat, en su cobertura de GLM-5.2, no una medición de Apidog).

Para el desglose completo y las advertencias de comparación directa, consulta nuestra inmersión profunda en los benchmarks de GLM-5.2 y la comparación directa de GLM-5.2 vs GPT-5.5, Claude Opus y Gemini.

Cómo acceder a GLM-5.2 de un vistazo

Tienes cuatro rutas prácticas, dependiendo de si quieres una API alojada, una configuración de codificación agentiva, un enrutador o una instalación local.

Ruta de acceso Mejor para Nota rápida
API de Z.ai Llamadas directas y alojadas Compatible con OpenAI, endpoint en https://api.z.ai/api/paas/v4/
Claude Code (Plan de Codificación GLM) Codificación agentiva en tu terminal URL base compatible con Anthropic, selecciona la variante [1m]
OpenRouter Una clave, muchos modelos ID del modelo z-ai/glm-5.2
Ollama Local / sin conexión Descarga glm-5.2 de la biblioteca

API de Z.ai. La API general es compatible con OpenAI. Accedes a https://api.z.ai/api/paas/v4/chat/completions con una clave Bearer y pasas los parámetros habituales más thinking, reasoning_effort, temperature y stream. Se admiten llamadas a funciones y herramientas.

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [{"role": "user", "content": "Refactor this function for readability."}],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "max",
    "stream": true
  }'

Claude Code a través del Plan de Codificación GLM. Z.ai expone un endpoint de codificación compatible con Anthropic, por lo que puedes apuntar Claude Code a GLM-5.2. La URL base de codificación es https://api.z.ai/api/coding/paas/v4 (algunas fuentes muestran open.z.ai/api/paas/v4, así que verifica en vivo), y configuras tu entorno de Claude Code para que enrute a través de ella.

export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000

El sufijo [1m] selecciona la variante de contexto de 1M. Esa línea API_TIMEOUT_MS no es un relleno opcional: las llamadas largas y de gran contexto pueden exceder el tiempo de espera predeterminado de Claude Code, por lo que aumentarlo evita que la herramienta cancele las solicitudes a mitad de camino. Recorremos esta configuración, además de Cline y Cursor, en la guía de GLM-5.2 en Claude Code, Cline y Cursor. Si has utilizado la generación anterior de esa manera, nuestro artículo sobre GLM-5.1 con Claude Code cubre el mismo flujo.

OpenRouter. Si ya enrutas a través de OpenRouter, GLM-5.2 está disponible como z-ai/glm-5.2. Consulta la lista en vivo en openrouter.ai/z-ai/glm-5.2. Ten en cuenta que no hay una vía gratuita de OpenRouter para este modelo, así que no planifiques contando con ella.

Ollama. Para uso local, descárgalo de la biblioteca de Ollama. Esta es la ruta para el trabajo sin conexión o el control estricto de datos, con el obvio inconveniente de que necesitas memoria GPU real para servir un MoE de 753B cómodamente.

Para un resumen de las opciones genuinamente gratuitas, consulta cómo usar GLM-5.2 gratis.

Precios, brevemente

En la API alojada, OpenRouter confirma los precios en $1.40 por 1M de tokens de entrada y $4.40 por 1M de tokens de salida. VentureBeat cita una entrada en caché alrededor de $0.26 por 1M. El Plan de Codificación GLM tiene suscripciones por niveles (Lite, Pro, Max y Team), pero las cifras mensuales exactas varían según las fuentes secundarias, así que confirma los precios actuales en z.ai antes de comprometerte (a junio de 2026). Nuestro desglose de precios de GLM-5.2 mantiene un recuento actualizado.

Dónde encaja Apidog

Si estás desarrollando con la API de GLM-5.2, o integrándola en un agente que llama a tus propios servicios, aún necesitas diseñar, probar y documentar esos endpoints. Ahí es donde Apidog ayuda. Puedes simular los endpoints respaldados por LLM antes de que la integración real esté lista, depurar las formas de las solicitudes y respuestas (incluyendo streaming y payloads de llamadas a herramientas), y mantener tu documentación de API sincronizada a medida que cambia el contrato. Es una plataforma API todo en uno, por lo que el diseño, la depuración, las pruebas, la simulación y la documentación residen en un solo lugar en lugar de en cuatro. Cuando estés listo para probarlo, descarga Apidog y dirígelo a tu integración de GLM-5.2.

Cómo se compara GLM-5.2 con el resto de la familia y el sector

GLM-5.2 es el pináculo de codificación y capacidades agentivas de la línea GLM actual. Si lo estás comparando con lanzamientos anteriores o laboratorios rivales, estas son las siguientes lecturas útiles:

Preguntas Frecuentes

¿Qué es GLM-5.2 en una frase? Es el LLM insignia de pesos abiertos de Z.ai, un modelo MoE de ~753 mil millones de parámetros ajustado para codificación, razonamiento y uso de herramientas agentivas, con una ventana de contexto de 1M de tokens y una licencia MIT.

¿Es GLM-5.2 realmente gratuito? Los pesos son de descarga gratuita y pueden autoalojarse bajo licencia MIT. La API alojada de Z.ai y el Plan de Codificación GLM son de pago. No existe un nivel gratuito de OpenRouter para él, por lo que “gratuito” aquí significa pesos abiertos, no un endpoint alojado gratuito.

¿Puede GLM-5.2 ver imágenes? No. Es entrada de texto, salida de texto según la documentación de la API, sin variante de visión confirmada. Usa un modelo de visión separado si necesitas entrada de imágenes.

¿En qué se diferencia GLM-5.2 de GLM-5.1? El salto visible más grande está en la codificación agentiva. Terminal-Bench 2.1 pasó de 62.0 a 81.0 según los resultados de Z.ai, además de las mejoras en SWE-bench Pro y la nueva atención dispersa IndexShare. Consulta la comparación de GLM-5.2 vs GLM-5.1 para ver la diferencia completa.

¿Qué longitud de contexto y de salida soporta? El contexto es de 1M de tokens. La salida está documentada en hasta 128K según z.ai, pero no todos los hosts listan el mismo límite superior, así que verifica con tu proveedor.

La versión corta

GLM-5.2 es lo que ocurre cuando un laboratorio de pesos abiertos decide competir de frente con la frontera cerrada en codificación. Obtienes un modelo MoE de 753B con una ventana de un millón de tokens, esfuerzo de razonamiento controlable, una licencia MIT que te permite autoalojar y distribuir, y resultados de benchmark que lo sitúan en la conversación de GPT-5.5 y Claude Opus 4.8, al menos según los propios números de Z.ai. Las advertencias son reales (solo texto, límites de salida a verificar, afirmaciones de benchmark del proveedor), pero la propuesta central se mantiene: este es un modelo de codificación serio que realmente puedes poseer. Comienza con la guía de la API de GLM-5.2 cuando estés listo para construir.

botón

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs