Como Rodar GLM-5.3-Flash Localmente

Auto-hospede o GLM-5.3-Flash: 8x H200 com vLLM ou SGLang, versões GGUF quantizadas para setups menores, cálculos de memória e se a auto-hospedagem supera a API.

Ashley Goolam

Ashley Goolam

27 agosto 2026

Como Rodar GLM-5.3-Flash Localmente

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

GLM-5.3-Flash é um modelo de 320 bilhões de parâmetros lançado sob a licença MIT. Esses dois fatos apontam em direções opostas: a licença diz para executá-lo como quiser, e a contagem de parâmetros diz que você precisará de hardware sério para isso.

A parte interessante é que 18 bilhões desses 320 bilhões de parâmetros estão ativos por token, e existem builds quantizados. Essa combinação coloca este modelo ao alcance de configurações muito menores do que o nó 8x H200 que a maioria dos guias assume.

Este post aborda os níveis de hardware honestamente, desde um nó de produção de precisão total até um build quantizado em uma estação de trabalho, e cobre quando executá-lo você mesmo faz sentido.

O que você está realmente carregando

Propriedade Valor
Total de parâmetros 320B
Ativos por token 18B
Arquitetura MoE, atenção híbrida linear e esparsa
Contexto 1.048.576 tokens
Licença MIT
Pesos zai-org/GLM-5.3-Flash
Quantizações GGUF unsloth/GLM-5.3-Flash-GGUF

O design mixture-of-experts (MoE) é o que torna isso viável. Todos os 320B parâmetros precisam estar residentes na memória, mas apenas 18B participam de qualquer token dado, então a demanda computacional é muito menor do que o total sugere. A memória é sua restrição limitante, não os FLOPs.

Z.ai também relata um cache KV aproximadamente 4,4 vezes menor que o GLM-5.3, o que é enormemente importante para trabalhos de contexto longo. O cache KV é o que consome memória conforme seu contexto se preenche, e em uma janela de 1M de tokens, é normalmente o que te derruba.

Nível 1: precisão total em um nó de produção

Para servir com qualidade total e concorrência real, a configuração de referência é um nó 8x H200 (141 GB cada, cerca de 1.128 GB no total). Um nó 8x H20 também funciona.

Números aproximados: os pesos sozinhos querem algo entre 700 e 800 GB, dependendo da precisão, e você precisa de espaço extra para cache KV e sobrecarga de tempo de execução. A capacidade de nuvem alugada para um nó como este custa entre US$ 24 e US$ 48 por dia.

vLLM

vLLM é o padrão comum e tem o suporte de ecossistema mais amplo. O tamanho paralelo do tensor deve ser uma potência de dois:

vllm serve zai-org/GLM-5.3-Flash \
  --tensor-parallel-size 8 \
  --max-model-len 1048576 \
  --trust-remote-code

Comece com um --max-model-len menor enquanto estiver validando a configuração. Pedir a janela completa de um milhão de tokens imediatamente significa alocar cache KV para ela, e uma falha ali se parece mais com um erro de falta de memória do que com um problema de configuração.

SGLang

SGLang teve suporte no dia zero para este modelo, com receitas publicadas para H100, H200, B200, B300, GB200 e GB300, incluindo serviço multimodal. Z.ai usou uma pilha baseada em SGLang para seu próprio serviço de pré-lançamento.

python -m sglang.launch_server \
  --model-path zai-org/GLM-5.3-Flash \
  --tp 8 \
  --context-length 1048576

SGLang tende a vencer em saída estruturada e cargas de trabalho agentic de alta concorrência. Se você estiver servindo um agente de codificação em vez de uma interface de bate-papo, vale a pena comparar com vLLM em vez de usar o padrão.

Ambas as pilhas precisam de um analisador de chamadas de ferramentas configurado para que a chamada de funções funcione corretamente. Verifique os sinalizadores atuais na documentação de cada projeto, pois os nomes dos analisadores mudam entre as versões.

Nível 2: quantizado em hardware menor

Este é o nível que a maioria das coberturas pula, e é o que importa para quem não tem um data center.

Os builds GGUF quantizados são publicados em unsloth/GLM-5.3-Flash-GGUF, chegando a formatos agressivos de 1 bit e 2 bits, como IQ1_S e IQ2_XXS. Uma quantização de 2 bits de um modelo de 320B leva os pesos para um alcance que uma estação de trabalho com alta memória ou uma plataforma de consumidor multi-GPU pode suportar, especialmente com offload de CPU.

Duas ressalvas honestas:

A quantização agressiva custa qualidade. IQ1_S está muito longe da precisão total. Em um MoE de 320B, a degradação é frequentemente mais suave do que o mesmo tratamento aplicado a um modelo denso, porque há mais redundância a perder, mas "funciona" e "funciona bem" são afirmações diferentes. Teste em suas próprias tarefas antes de concluir qualquer coisa.

A documentação do Unsloth para este modelo está marcada como trabalho em andamento. A disponibilidade de quantização e as configurações recomendadas ainda estão em movimento. Verifique o que está realmente publicado antes de planejar um build em torno de um formato específico.

Para configurações com uso intensivo de CPU e híbridas, o KTransformers é projetado exatamente para este caso, mantendo os especialistas do MoE na RAM do sistema e movendo apenas o que é necessário para a GPU. Em um modelo MoE com 18B de parâmetros ativos, essa arquitetura se encaixa excepcionalmente bem. O TokenSpeed também está listado entre os runtimes suportados.

Nosso guia para executar GLM-4.7-Flash localmente abrange a versão de modelo menor deste fluxo de trabalho, e executar GLM-5 localmente gratuitamente abrange a configuração geral local-GLM.

Calculando seu orçamento de memória

Dois números determinam se uma configuração se encaixa.

Pesos. Com aproximadamente 2 bytes por parâmetro em BF16, 320B parâmetros são cerca de 640GB antes da sobrecarga. FP8 reduz isso pela metade. Uma quantização de 4 bits aproxima-o de 160GB, e os formatos agressivos de 2 bits vão ainda mais baixo, com um custo real na qualidade.

Cache KV. Isso escala com o comprimento do contexto e a concorrência, e é o que surpreende as pessoas. Uma configuração que carrega bem em 8K de contexto pode falhar em 128K porque o cache cresceu, não os pesos. A redução de 4,4x relatada por Z.ai em relação ao GLM-5.3 ajuda muito aqui, mas o dimensionamento ainda é linear em tokens.

A implicação prática é dimensionar para o seu comprimento de contexto real, não o máximo que o modelo anuncia. Pouquíssimas aplicações precisam de um milhão de tokens completos, e provisionar para uma janela que você nunca usa é a maneira mais comum de fazer este modelo parecer inacessível.

Se você estava acompanhando a história anterior de pesos abertos para esta família, nosso post sobre auto-hospedagem do GLM-5.3 foi escrito antes do lançamento. Os pesos agora foram lançados para o Flash sob MIT, então a orientação aqui a substitui.

Ajuste fino (Fine-tuning)

A licença MIT permite o ajuste fino (fine-tuning) e a redistribuição, o que é incomum neste nível de capacidade e é a razão mais forte para manter os pesos você mesmo.

Seja realista sobre o custo. O ajuste fino completo de um modelo de 320B está fora do alcance da maioria das equipes. Métodos eficientes em parâmetros, como LoRA, são o caminho prático, e em um modelo de mistura de especialistas, há uma questão de design adicional sobre se você adapta o roteador, os especialistas ou as camadas de atenção. Essa é uma área ativa com orientação menos estabelecida do que para modelos densos.

Se o seu objetivo é a adaptação de domínio em vez de novas capacidades, teste a solicitação (prompting) e a recuperação (retrieval) contra o modelo base primeiro. Em um modelo com uma janela de contexto de 1 milhão de tokens, colocar seu conhecimento de domínio na solicitação é frequentemente mais barato e melhor do que treiná-lo.

Configurações de amostragem

Z.ai publica diferentes recomendações por tarefa:

Caso de uso temperatura top_p
Geral 1.0 0.95
Codificação 0.95 1.0

O modelo também suporta três modos de raciocínio através de reasoning_effort, com os valores low, high e max. Max é o padrão. Em hardware local, isso importa mais do que na API, porque os tokens de raciocínio são geração pela qual você está pagando em tempo real (wall-clock time) em vez de dinheiro. Se sua máquina gera lentamente, low faz a diferença entre ser utilizável e não ser.

A auto-hospedagem faz sentido financeiro?

Geralmente não, e o preço da API é o motivo.

No preço de tabela, GLM-5.3-Flash custa US$ 0,15 por milhão de tokens de entrada. Um nó 8x H200 alugado por aproximadamente US$ 1.000 por mês compra cerca de 6,7 bilhões de tokens de entrada de uso da API. Manter um volume acima disso, continuamente, é uma operação grande.

O nó também custa o mesmo, esteja ele saturado ou ocioso, enquanto a API cobra apenas o que você usa. A menos que sua utilização seja genuinamente alta o tempo todo, o custo fixo perde.

Então, as razões para auto-hospedar não são o custo:

Nossa análise de preços detalha mais o lado da API desta comparação.

Verificando sua implantação

Tanto vLLM quanto SGLang expõem endpoints compatíveis com OpenAI, então o mesmo formato de solicitação funciona contra seu servidor local e contra Z.ai:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "messages": [{"role": "user", "content": "reply with OK"}]
  }'

Vale a pena testar além de uma verificação rápida: comportamento de contexto longo no comprimento que você realmente precisa, entrada de imagem se estiver servindo multimodal, chamada de ferramentas com seus esquemas reais e throughput sob concorrência em vez de latência de uma única solicitação.

É aqui que uma coleção de testes salva faz toda a diferença. Aponte o Apidog para seu servidor local e para o endpoint Z.ai com a URL base como uma variável de ambiente, execute a mesma suíte contra cada um e compare. Você descobrirá rapidamente se seu build quantizado ainda lida com os esquemas de ferramentas dos quais sua aplicação depende, que é o modo de falha que as pessoas descobrem em produção.

FAQ

Qual é o hardware mínimo? Para precisão total, um nó de classe 8x H200. Para builds GGUF quantizados, consideravelmente menos, embora a qualidade caia com o nível de quantização.

Preciso de todos os 320B parâmetros na memória? Sim. Apenas 18B estão ativos por token, mas o conjunto completo deve estar residente. A memória é a restrição; o cálculo não é.

Qual é melhor, vLLM ou SGLang? SGLang teve suporte no dia zero com receitas multimodais publicadas e geralmente vence em concorrência e saída estruturada. vLLM tem suporte de ecossistema mais amplo. Compare ambos em sua carga de trabalho.

Posso executá-lo em uma única GPU? Não em precisão total. Com quantização agressiva e offload de CPU através do KTransformers, um sistema de GPU única de alta memória mais muita RAM do sistema é plausível. Espere geração lenta.

A licença é realmente MIT? Sim. Os pesos são publicados como MIT, o que permite uso comercial, modificação e redistribuição.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs