GLM-5.2 es uno de los pocos modelos de clase frontera que puedes ejecutar en tu propio hardware. Se distribuye con pesos abiertos bajo una licencia MIT, sin restricciones regionales, por lo que "usarlo sin restricciones" no es un truco. Es un camino soportado. El truco es saber qué restricción estás encontrando realmente, porque la solución es diferente para cada una.
En resumen
- GLM-5.2 (Z.ai / Zhipu AI) tiene pesos abiertos, aproximadamente 753B parámetros (MoE), licencia MIT, contexto de 1M de tokens, sin bloqueo regional.
- La mayoría de las "restricciones" provienen de la interfaz de usuario de chat para consumidores o del ajuste de instrucción del modelo, no de un límite de licencia estricto.
- El acceso directo a la API te da control del prompt del sistema y te permite desactivar el "pensamiento". El autoalojamiento te da control total de la pila.
- Las versiones "abliteradas" de la comunidad eliminan las negativas incorporadas, el mismo patrón usado para DeepSeek R1 y QwQ. La disponibilidad para 5.2 cambia semana a semana, así que verifica en Hugging Face.
- Todavía eres responsable de la moderación y legalmente una vez que te autoalojas. Menos barreras de seguridad significa más responsabilidad, no menos.
Primero, identifica qué restricción estás encontrando
"Restricciones" es una palabra imprecisa. Para GLM-5.2, generalmente significa una de cuatro cosas diferentes, y cada una tiene su propia solución.
- Negativas por ajuste de instrucción. El modelo de chat lanzado está alineado para rechazar algunas solicitudes. Este comportamiento reside en los pesos.
- Filtros de producto en la aplicación de chat. La interfaz de usuario web para consumidores puede añadir su propia capa de moderación sobre el modelo. La API a menudo se comporta de manera diferente a la aplicación.
- Límites de plan y tasa. Los niveles gratuitos y los niveles de plan de codificación limitan las solicitudes, el contexto o la salida. Eso es una cuota, no una regla de contenido.
- Sobrecarga de enrutamiento de pensamiento y seguridad. El razonamiento extendido y el enrutamiento de seguridad añaden latencia y pueden cambiar el tono.
La región no está deliberadamente en esta lista. Los pesos de GLM-5.2 tienen licencia MIT sin restricciones regionales, por lo que el acceso no está restringido por país como ocurre con algunos modelos solo alojados.
Palanca 1: Usa la API pura, no la aplicación de chat
El cambio más rápido con la mayor recompensa es dejar de usar la ventana de chat para consumidores y llamar a la API directamente. El endpoint es compatible con OpenAI, por lo que mantienes tu propio prompt de sistema, configuras tu propia temperatura y puedes deshabilitar la fase de pensamiento.
- URL base:
https://api.z.ai/api/paas/v4/ - Endpoint:
POST /chat/completions - ID del modelo:
glm-5.2
Una llamada `curl` mínima con el pensamiento deshabilitado:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"thinking": { "type": "disabled" },
"temperature": 0.7,
"messages": [
{ "role": "system", "content": "You are a direct, unfiltered technical assistant. Answer concisely." },
{ "role": "user", "content": "Explain how abliteration changes a model." }
]
}'
La misma llamada con el SDK de Python de OpenAI, simplemente redirigida a z.ai:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_ZAI_KEY",
base_url="https://api.z.ai/api/paas/v4/",
)
resp = client.chat.completions.create(
model="glm-5.2",
temperature=0.7,
extra_body={"thinking": {"type": "disabled"}},
messages=[
{"role": "system", "content": "You are a direct, unfiltered technical assistant."},
{"role": "user", "content": "Explain how abliteration changes a model."},
],
)
print(resp.choices[0].message.content)
Aquí importan dos cosas. Tu prompt de sistema es tuyo, por lo que diriges el tono y el alcance directamente en lugar de heredar los valores predeterminados de la aplicación. Y thinking: {"type": "disabled"} omite el paso de razonamiento cuando deseas una salida rápida y sin procesar. Para el conjunto completo de parámetros, consulta la guía de la API de GLM-5.2.
Los precios cambian, así que verifica en vivo antes de presupuestar: al momento de escribir esto, las fuentes secundarias listan aproximadamente $1.40 por 1M de tokens de entrada y $4.40 por 1M de salida. Confirma los números actuales en el desglose de precios de GLM-5.2, y si el costo es la verdadera restricción, lee cómo usar GLM-5.2 gratis.
Palanca 2: Autoaloja los pesos abiertos
Esta es la verdadera respuesta de "sin restricciones". Debido a que los pesos tienen licencia MIT, puedes descargar y servir GLM-5.2 tú mismo. Cuando el modelo se ejecuta en tu máquina, no hay filtro de interfaz de usuario del proveedor ni límite de tasa externo. Tú estableces el prompt del sistema, tú estableces la política.
El camino más sencillo es Ollama:
ollama run glm-5.2
Comprobación de la realidad del hardware: GLM-5.2 es un modelo MoE de aproximadamente 753B de parámetros, por lo que los pesos completos necesitan una VRAM seria. Para la mayoría de las personas, eso significa una compilación cuantificada, una máquina multi-GPU alquilada o una variante GLM más pequeña. Si tu hardware es modesto, GLM-4.7-Flash se ejecuta localmente con mucho menos y es un buen sustituto mientras construyes la tubería. La guía general para ejecutar GLM localmente y el tutorial de configuración de Ollama cubren el resto.
Una vez que se está sirviendo localmente, Ollama expone su propio endpoint compatible con OpenAI en http://localhost:11434/v1, por lo que el mismo código de la Palanca 1 funciona con solo cambiar la URL base.
Palanca 3: Versiones ablitteradas (sin censura) de la comunidad
El ajuste de instrucción es donde residen las negativas. La comunidad de código abierto elimina ese comportamiento a través de un proceso llamado ablitteración, que suprime la dirección interna que dispara una negativa sin un reentrenamiento completo. La misma técnica impulsa las versiones sin censura de otros modelos abiertos, incluyendo QwQ y DeepSeek R1.
Debido a que los pesos de GLM-5.2 son abiertos y tienen licencia MIT, esa técnica también se aplica aquí. No se garantiza que una versión ablitterada de GLM-5.2 ya esté disponible, y la disponibilidad cambia a menudo, así que busca una actual en Hugging Face en lugar de asumir que existe. Si no hay una versión 5.2, el flujo de trabajo es idéntico a las guías de QwQ y DeepSeek R1: descarga los pesos ablitterados, cárgalos en Ollama o vLLM y sírvelos.
Esta es la forma más completa de eliminar las negativas incorporadas, y también es la que te impone la mayor responsabilidad. Lee la sección de responsabilidad antes de implementarlo.
Palanca 4: Elige un proveedor que te permita establecer políticas
Si no quieres ejecutar tu propio servidor, un proveedor de enrutamiento es el punto intermedio. GLM-5.2 está listado en OpenRouter como z-ai/glm-5.2 y en la librería de Ollama. Un enrutador te permite aplicar tus propias configuraciones de moderación e intercambiar el host subyacente sin reescribir tu aplicación, lo que evita el filtro de la interfaz de usuario para consumidores mientras mantienes un endpoint gestionado.
Esta pieza se suma al resumen más amplio de LLMs sin restricciones si quieres comparar GLM-5.2 con otras opciones abiertas antes de comprometerte.
Prueba cada configuración en Apidog antes de implementar
Sea cual sea la palanca que elijas, terminas con un endpoint compatible con OpenAI. Confirma que se comporta como esperas antes de conectarlo a un producto. Apidog es una forma limpia de hacerlo porque puedes inspeccionar la respuesta de streaming en bruto, no solo el texto final.

- Crea una nueva solicitud en Apidog apuntando a tu endpoint (
https://api.z.ai/api/paas/v4/chat/completionspara la API alojada, ohttp://localhost:11434/v1/chat/completionspara una compilación local). - Añade el encabezado
Authorization: Bearer <clave>para la API alojada. Ollama local no necesita clave. - Envía un cuerpo
chat/completionsconmodel: glm-5.2, tu mensajesystemystream: true. - Observa el flujo SSE. Puedes ver los deltas de "pensamiento" y los deltas de contenido por separado, además del objeto
usagecon los recuentos de tokens. - Alterna
thinking(pensamiento) activado y desactivado y compara las dos respuestas lado a lado.
Así es como verificas que tu prompt del sistema realmente tuvo efecto y que el modelo responde como promete la configuración elegida, en lugar de descubrirlo en producción.
Una palabra sobre la responsabilidad
Eliminar los filtros de producto y ejecutar pesos sin censura es legítimo. Es común para la investigación, el "red-teaming" y la construcción de tu propia moderación en lugar de heredar la de otra persona. Pero una vez que te autoalojas, la moderación es tuya, y también lo es la exposición legal. Menos barreras de seguridad significa que tú eres el dueño del resultado. Ten en cuenta tres cosas:
- Todavía estás sujeto a la ley y a los términos de cualquier plataforma en la que implementes.
- Si sirves esto a otras personas, añade una capa de moderación adecuada para tus usuarios.
- "Sin restricciones" se trata de control y de eliminar negativas falsas positivas, no de una licencia para generar contenido dañino o ilegal.
Preguntas frecuentes
¿Es GLM-5.2 realmente de código abierto?
Los pesos se publican bajo una licencia MIT, una de las licencias más permisivas disponibles. Puedes ejecutarlos, modificarlos y autoalojarlos, incluso para uso comercial, sujeto a los términos de la licencia. Para conocer la identidad completa y las especificaciones, consulta qué es GLM-5.2.
¿La API de GLM-5.2 censura las respuestas?
El modelo de instrucción conlleva una alineación de su ajuste, por lo que puede rechazar algunas solicitudes. La API te da control del prompt del sistema y te permite deshabilitar el pensamiento, lo que resuelve la mayoría de los problemas de tono y de excesivas negativas. Para eliminar por completo las negativas incorporadas, autoaloja una compilación ablitterada.
¿Puedo ejecutar GLM-5.2 en un portátil?
No el modelo completo de 753B. Usa una compilación cuantificada, una máquina GPU alquilada o una variante GLM más pequeña como GLM-4.7-Flash para pruebas locales, luego apunta el mismo código al modelo más grande cuando lo necesites.
¿GLM-5.2 está bloqueado por región?
No. Los pesos tienen licencia MIT sin restricciones regionales. La disponibilidad de la API alojada puede variar según el proveedor, pero el autoalojamiento está abierto a cualquiera.
