GLM-5.3-Flash es un modelo de 320 mil millones de parámetros lanzado bajo la licencia MIT. Esos dos hechos tiran en direcciones opuestas: la licencia dice que lo ejecutes como quieras, y el recuento de parámetros dice que necesitarás hardware serio para hacerlo.
La parte interesante es que 18 mil millones de esos 320 mil millones de parámetros están activos por token, y existen compilaciones cuantificadas. Esa combinación pone este modelo al alcance de configuraciones mucho más pequeñas que el nodo 8x H200 que la mayoría de las guías asumen.
Esta publicación recorre honestamente los niveles de hardware, desde un nodo de producción de precisión completa hasta una compilación cuantificada en una estación de trabajo, y cubre cuándo ejecutarlo uno mismo tiene sentido.
Lo que realmente estás cargando
| Propiedad | Valor |
|---|---|
| Parámetros totales | 320B |
| Activos por token | 18B |
| Arquitectura | MoE, atención dispersa y lineal híbrida |
| Contexto | 1.048.576 tokens |
| Licencia | MIT |
| Pesos | zai-org/GLM-5.3-Flash |
| Cuantificaciones GGUF | unsloth/GLM-5.3-Flash-GGUF |
El diseño de mezcla de expertos (MoE) es lo que lo hace factible. Los 320 mil millones de parámetros deben residir en la memoria, pero solo 18 mil millones participan en un token dado, por lo que la demanda de cómputo está muy por debajo de lo que sugiere el total. La memoria es la restricción principal, no los FLOPs.
Z.ai también reporta una caché KV aproximadamente 4,4 veces más pequeña que GLM-5.3, lo que importa enormemente para el trabajo de contexto largo. La caché KV es lo que consume memoria a medida que se llena el contexto, y en una ventana de 1 millón de tokens, eso es normalmente lo que te mata.
Nivel 1: Precisión completa en un nodo de producción
Para servir con calidad completa y concurrencia real, la configuración de referencia es un nodo 8x H200 (141GB cada uno, aproximadamente 1.128GB en total). Un nodo 8x H20 también funciona.
Números aproximados: solo los pesos requieren entre 700 y 800 GB dependiendo de la precisión, y se necesita espacio adicional para la caché KV y la sobrecarga de tiempo de ejecución. La capacidad de la nube alquilada para un nodo como este cuesta entre $24 y $48 por día.
vLLM
vLLM es el valor predeterminado común y tiene el soporte de ecosistema más amplio. El tamaño del paralelismo de tensor debe ser una potencia de dos:
vllm serve zai-org/GLM-5.3-Flash \
--tensor-parallel-size 8 \
--max-model-len 1048576 \
--trust-remote-code
Empieza con un --max-model-len más pequeño mientras validas la configuración. Pedir la ventana completa de un millón de tokens inmediatamente significa asignar caché KV para ella, y un fallo allí se parece a un error de falta de memoria en lugar de un problema de configuración.
SGLang
SGLang tuvo soporte desde el primer día para este modelo, con recetas publicadas para H100, H200, B200, B300, GB200 y GB300, incluido el servicio multimodal. Z.ai utilizó una pila basada en SGLang para su propio servicio previo al lanzamiento.
python -m sglang.launch_server \
--model-path zai-org/GLM-5.3-Flash \
--tp 8 \
--context-length 1048576
SGLang tiende a ganar en la salida estructurada y en cargas de trabajo de agentes de alta concurrencia. Si estás sirviendo un agente de codificación en lugar de una interfaz de chat, vale la pena compararlo con vLLM en lugar de usarlo por defecto.
Ambas pilas necesitan un analizador de llamadas a herramientas configurado para que la llamada a funciones funcione correctamente. Consulta las banderas actuales en la documentación de cada proyecto, ya que los nombres de los analizadores cambian entre versiones.
Nivel 2: Cuantificado en hardware más pequeño
Este es el nivel que la mayoría de la cobertura omite, y es el que importa para cualquiera sin un centro de datos.
Las compilaciones GGUF cuantificadas se publican en unsloth/GLM-5.3-Flash-GGUF, llegando a formatos agresivos de 1 y 2 bits como IQ1_S e IQ2_XXS. Una cuantificación de 2 bits de un modelo de 320B lleva los pesos a un rango que una estación de trabajo de alta memoria o una plataforma de consumo con varias GPU puede soportar, particularmente con descarga de CPU.
Dos advertencias honestas:
La cuantificación agresiva tiene un costo en la calidad. IQ1_S está muy lejos de la precisión completa. En un MoE de 320B, la degradación suele ser más suave que el mismo tratamiento aplicado a un modelo denso, porque hay más redundancia que perder, pero "funciona" y "funciona bien" son afirmaciones diferentes. Pruébalo en tus propias tareas antes de sacar cualquier conclusión.
La documentación de Unsloth para este modelo está marcada como trabajo en progreso. La disponibilidad de la cuantificación y las configuraciones recomendadas aún están en movimiento. Verifica lo que se ha publicado realmente antes de planificar una compilación en torno a un formato específico.
Para configuraciones híbridas y con uso intensivo de CPU, KTransformers está diseñado exactamente para este caso, manteniendo los expertos de MoE en la RAM del sistema y moviendo solo lo necesario a la GPU. En un modelo MoE con 18B de parámetros activos, esa arquitectura encaja inusualmente bien. TokenSpeed también se menciona entre los tiempos de ejecución compatibles.
Nuestra guía para ejecutar GLM-4.7-Flash localmente cubre la versión de modelo más pequeña de este flujo de trabajo, y ejecutar GLM-5 localmente gratis cubre la configuración general de GLM local.
Cálculo de tu presupuesto de memoria
Dos números determinan si una configuración es adecuada.
Pesos. Aproximadamente 2 bytes por parámetro en BF16, 320 mil millones de parámetros son alrededor de 640 GB antes de la sobrecarga. FP8 reduce eso a la mitad. Una cuantificación de 4 bits lo acerca a 160 GB, y los formatos agresivos de 2 bits bajan aún más a un costo real en calidad.
Caché KV. Esto escala con la longitud del contexto y la concurrencia, y es lo que sorprende a la gente. Una configuración que se carga bien con un contexto de 8K puede fallar con 128K porque la caché creció, no los pesos. La reducción de 4,4x reportada por Z.ai frente a GLM-5.3 ayuda mucho aquí, pero el escalado sigue siendo lineal en tokens.
La implicación práctica es dimensionar para tu longitud de contexto real, no el máximo que anuncia el modelo. Muy pocas aplicaciones necesitan el millón de tokens completo, y provisionar para una ventana que nunca usas es la forma más común de hacer que este modelo parezca inasequible.
Si estabas siguiendo la historia anterior de pesos abiertos para esta familia, nuestra publicación sobre el auto-alojamiento de GLM-5.3 fue escrita antes del lanzamiento. Los pesos ya han llegado para Flash bajo MIT, por lo que la guía aquí la reemplaza.
Ajuste fino
La licencia MIT permite el ajuste fino y la redistribución, lo cual es inusual para este nivel de capacidad y es la razón más sólida para mantener los pesos por tu cuenta.
Sé realista sobre el costo. El ajuste fino completo de un modelo de 320B está fuera del alcance de la mayoría de los equipos. Los métodos eficientes en parámetros, como LoRA, son el camino práctico, y en un modelo de mezcla de expertos hay una pregunta de diseño adicional sobre si se adapta el enrutador, los expertos o las capas de atención. Esa es un área activa con una guía menos establecida que para los modelos densos.
Si tu objetivo es la adaptación de dominio en lugar de una nueva capacidad, prueba primero el *prompting* y la recuperación con el modelo base. En un modelo con una ventana de contexto de 1M de tokens, poner tu conocimiento de dominio en el *prompt* suele ser más barato y mejor que entrenarlo.
Configuraciones de muestreo
Z.ai publica diferentes recomendaciones por tarea:
| Caso de uso | temperature | top_p |
|---|---|---|
| General | 1.0 | 0.95 |
| Codificación | 0.95 | 1.0 |
El modelo también soporta tres modos de razonamiento a través de reasoning_effort, con valores low, high y max. Max es el predeterminado. En hardware local esto importa más que en la API, porque los tokens de razonamiento son generación por la que estás pagando en tiempo real en lugar de dólares. Si tu equipo genera lentamente, low es la diferencia entre utilizable y no.
¿Tiene sentido financiero el autoalojamiento?
Normalmente no, y el precio de la API es la razón.
Según el precio de lista, GLM-5.3-Flash cuesta $0.15 por millón de tokens de entrada. Un nodo 8x H200 alquilado por aproximadamente $1,000 al mes te permite un uso de API de aproximadamente 6.7 mil millones de tokens de entrada. Mantener un volumen continuo superior a eso es una operación grande.
El nodo también cuesta lo mismo ya sea que esté saturado o inactivo, mientras que la API solo factura lo que usas. A menos que tu utilización sea realmente alta las 24 horas del día, el costo fijo pierde.
Así que las razones para el autoalojamiento no son el costo:
- Residencia y privacidad de los datos. Nada sale de tu infraestructura.
- Sin límites de tasa. Tu capacidad es tu capacidad.
- Garantías de disponibilidad. Sin dependencia del tiempo de actividad o las decisiones de precios de un proveedor.
- La licencia MIT. Puedes modificar, ajustar y redistribuir. Eso es inusual para un modelo de este nivel de capacidad y es el argumento más fuerte de la lista.
- Hardware que ya posees. Si las GPU están compradas e inactivas, el costo marginal es la electricidad, y todo el cálculo se invierte.
Nuestro desglose de precios analiza la parte de la API de esta comparación con más detalle.
Verificando tu implementación
Tanto vLLM como SGLang exponen puntos finales compatibles con OpenAI, por lo que la misma forma de solicitud funciona tanto en tu servidor local como en Z.ai:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"messages": [{"role": "user", "content": "reply with OK"}]
}'
Vale la pena probar más allá de una verificación de humo: el comportamiento de contexto largo con la longitud que realmente necesitas, la entrada de imagen si estás sirviendo multimodal, la llamada a herramientas con tus esquemas reales y el rendimiento bajo concurrencia en lugar de la latencia de una sola solicitud.
Aquí es donde una colección de pruebas guardada se amortiza. Apunta Apidog tanto a tu servidor local como al punto final de Z.ai con la URL base como variable de entorno, ejecuta la misma suite en cada uno y compara. Descubrirás rápidamente si tu compilación cuantificada aún maneja los esquemas de herramientas de los que depende tu aplicación, que es el modo de fallo que la gente descubre en producción.
Preguntas frecuentes
¿Cuál es el hardware mínimo? Para precisión completa, un nodo de clase 8x H200. Para compilaciones GGUF cuantificadas, considerablemente menos, aunque la calidad disminuye con el nivel de cuantificación.
¿Necesito los 320 mil millones de parámetros en memoria? Sí. Solo 18 mil millones están activos por token, pero el conjunto completo debe residir. La memoria es la restricción; el cómputo no lo es.
¿Cuál es mejor, vLLM o SGLang? SGLang tuvo soporte desde el primer día con recetas multimodales publicadas y a menudo gana en concurrencia y salida estructurada. vLLM tiene un soporte de ecosistema más amplio. Compara ambos en tu carga de trabajo.
¿Puedo ejecutarlo en una sola GPU? No a precisión completa. Con cuantificación agresiva y descarga de CPU a través de KTransformers, un sistema de GPU única de alta memoria más mucha RAM del sistema es plausible. Espera una generación lenta.
¿La licencia es realmente MIT? Sí. Los pesos se publican como MIT, lo que permite el uso comercial, la modificación y la redistribución.
