GLM-5.2 é um dos modelos de código aberto mais capazes que você pode executar atualmente, e a licença MIT aberta significa que "gratuito" está genuinamente sobre a mesa. O porém é que "gratuito" e "fácil" não são a mesma coisa para um modelo mixture-of-experts (MoE) de ~753B. Este guia detalha os caminhos reais, desde a auto-hospedagem verdadeiramente gratuita até créditos de teste quase gratuitos e o menor custo pago, com notas honestas sobre hardware e limites.
Se você quer a versão resumida: se você tem o hardware (ou uma GPU alugada barata), auto-hospede os pesos abertos. Se não tem, utilize os créditos de teste do z.ai ou o nível mais barato do Plano de Codificação GLM. Não há uma via OpenRouter gratuita para glm-5.2, então não procure por uma.
A árvore de decisão rápida
Escolha sua linha e pule para essa seção.
| Sua situação | Melhor caminho | Custo real |
|---|---|---|
| Você possui um computador com GPU potente (ou pode alugar um) | Auto-hospedar pesos abertos (Ollama / vLLM) | $0 para pesos; eletricidade ou aluguel de GPU |
| Você quer zero configuração e zero cartão de crédito | Créditos de teste gratuitos do z.ai / camada com limite de taxa | Grátis até os créditos acabarem (verifique a oferta atual) |
| Você quer o caminho pago mais barato e confiável | Plano de Codificação GLM Lite, ou preço de API com entrada em cache | ~$3-6/mês (verifique) ou centavos por chamada |
| Você quer pagar conforme o uso sem compromisso | API OpenRouter | $1.40 / 1M de entrada, $4.40 / 1M de saída |
A regra geral: verdadeiramente gratuito significa auto-hospedagem. Quase gratuito significa créditos de teste ou o plano Lite.

Caminho 1: auto-hospede os pesos abertos da MIT (verdadeiramente gratuito)
O GLM-5.2 é distribuído sob a licença MIT sem restrições regionais, então você pode baixar os pesos e executá-los em seu próprio hardware sem pagar a ninguém. Os pesos estão no Hugging Face em zai-org/GLM-5.2.
A parte honesta: este é um modelo MoE de ~753 bilhões de parâmetros em BF16. Embora apenas uma fração desses parâmetros seja ativada por token, o conjunto completo de pesos ainda precisa residir na memória. Em BF16, isso ultrapassa um terabyte de pesos brutos. Você não vai executar isso em um laptop. A maioria das pessoas que faz auto-hospedagem faz uma destas duas coisas:
- Executa uma compilação quantizada (4-bit ou similar) para reduzir a pegada de memória, aceitando uma pequena troca de qualidade.
- Aluga uma instância multi-GPU por hora de um provedor de nuvem e a desliga quando terminar.
Então, "gratuito" aqui significa livre de custo de licença. Você ainda paga pelo hardware, eletricidade ou aluguel de GPU. Para a maioria dos indivíduos, uma compilação quantizada em uma estação de trabalho com alta VRAM ou uma sessão alugada curta é o caminho realista.
Execute GLM-5.2 com Ollama
Ollama é o executor local mais amigável. GLM-5.2 está disponível na biblioteca Ollama, o fluxo é de dois comandos:
# Baixe o modelo (espere um download muito grande)
ollama pull glm-5.2:cloud

O Ollama usa por padrão uma variante quantizada, o que torna um modelo desse tamanho pensável em hardware de consumidor. Você também pode acessá-lo através do endpoint local compatível com OpenAI do Ollama:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Write a Python function to parse an RFC 3339 timestamp."}]
}'
Fique atento à sua RAM e VRAM. Se o modelo transbordar para o disco, a geração desacelera drasticamente. Uma compilação quantizada mais memória unificada suficiente ou uma divisão multi-GPU é a diferença entre usável e inutilizável.
Se você quer o passo a passo local, os padrões se aplicam quase exatamente da geração anterior. Veja rodando GLM-5 localmente de graça e GLM-5 de graça com Ollama para a configuração completa, escolhas de quantização e solução de problemas. Troque a tag do modelo para glm-5.2 e o fluxo de trabalho é o mesmo.
Execute GLM-5.2 com vLLM
Para taxa de transferência e atendimento de múltiplas solicitações, o vLLM é a opção de nível de produção. Ele lida com o paralelismo de tensores entre GPUs, que é como você realmente consegue encaixar um MoE de 753B.
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model zai-org/GLM-5.2 \
--tensor-parallel-size 8 \
--max-model-len 131072
Esse --tensor-parallel-size 8 assume oito GPUs. A contagem exata depende de suas placas e se você carrega um checkpoint quantizado. O vLLM expõe um servidor compatível com OpenAI, então qualquer cliente que fale o formato de chat-completions funciona sem alterações. O contexto de 1 milhão de tokens (1.048.576 tokens) é a capacidade principal, mas manter um cache KV de um milhão de tokens custa muita memória, então defina --max-model-len para o que você realmente precisa.
Caminho 2: Créditos de teste gratuitos do z.ai e a camada com limite de taxa
Se a auto-hospedagem estiver fora de alcance, o próximo caminho mais barato é a própria plataforma do z.ai. Novas contas geralmente recebem créditos de teste gratuitos e normalmente há uma camada gratuita com limite de taxa para experimentação leve (a partir de junho de 2026, verifique a oferta atual em z.ai, pois os termos de teste mudam frequentemente).
Esta é a maneira mais rápida de experimentar o modelo real com zero configuração. Você cria uma conta, pega uma chave de API e chama o endpoint compatível com OpenAI:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Explain IndexShare sparse attention in two sentences."}],
"thinking": {"type": "enabled"},
"reasoning_effort": "max"
}'
Alguns detalhes específicos do GLM-5.2 que valem a pena saber enquanto você gasta esses créditos:
thinkingalterna o raciocínio entre ligado e desligado. Para codificação, z.ai recomenda o nível de esforço de raciocínio Máximo viareasoning_effort: "max". Existem dois níveis de esforço, Alto e Máximo.- O comprimento de saída é documentado como até 128K, de acordo com a documentação do z.ai, mas trate isso como um número a ser verificado ao vivo, e não como uma garantia rígida, já que fontes secundárias nem sempre o listam.
Os créditos de teste acabam. Quando isso acontece, você passa para um plano pago ou volta para a auto-hospedagem. Detalhes completos dos parâmetros estão no guia GLM-5.2 do z.ai.
Caminho 3: As opções pagas mais baratas (quase gratuitas)
Quando os créditos gratuitos acabam, dois caminhos mantêm seus custos próximos de zero.
Plano de Codificação GLM Lite
Se o seu uso principal é codificação, o Plano de Codificação GLM é a aposta de valor. O nível de entrada Lite custa aproximadamente $12/mês (a partir de junho de 2026, verifique os preços atuais no z.ai, já que os níveis publicados conflitam em várias fontes). Com isso, você obtém acesso à codificação por uma taxa mensal fixa em vez de tokens cobrados por uso, o que torna o uso diário intenso previsível.

O Plano de Codificação também desbloqueia o caminho compatível com Anthropic, permitindo que você aponte Claude Code, Cline ou Cursor para GLM-5.2. A URL base de codificação é https://api.z.ai/api/coding/paas/v4 (algumas fontes mostram open.z.ai/api/paas/v4, então verifique ao vivo). Um ambiente de Claude Code funcionando se parece com isto:
export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="sua-chave-do-plano-de-codificacao-glm"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000
O sufixo [1m] seleciona a variante de contexto de 1M. Defina API_TIMEOUT_MS alto, ou o Claude Code encerrará chamadas longas com grande contexto antes que elas terminem. Para um guia detalhado de ferramentas de agente, consulte GLM-5.2 com Claude Code, Cline e Cursor e o guia da geração anterior GLM-5.1 com Claude Code.
Preço de entrada em cache e pague conforme o uso
Para acesso à API sem assinatura, a API geral padrão custa $1.40 por 1M de tokens de entrada e $4.40 por 1M de tokens de saída, conforme confirmado pelo OpenRouter. O mesmo preço se aplica seja você chamando o z.ai diretamente ou roteando através do OpenRouter como pay-as-you-go.
O truque do "quase grátis" aqui é a entrada em cache. Reportado em torno de $0.26 por 1M de tokens (segundo VentureBeat, atribua devidamente), a entrada em cache reduz drasticamente o custo de contexto repetido, como um prompt de sistema longo ou uma base de código fixa que você consulta repetidamente. Se sua carga de trabalho reutiliza o mesmo prefixo, você paga o preço total uma vez e uma fração depois. Para codificação de longo prazo, VentureBeat observa que o GLM-5.2 "supera o GPT-5.5 em codificação de longo prazo por aproximadamente um sexto do custo", o que é o argumento econômico em uma frase.
Mais uma vez, claramente: não há camada OpenRouter gratuita para glm-5.2. O OpenRouter é barato, não gratuito. Se um guia afirma o contrário, está errado.
Gratuito vs. Quase Gratuito: A Comparação Honesta
| Caminho | Custo inicial | Custo contínuo | Esforço de configuração | Melhor para |
|---|---|---|---|---|
| Auto-hospedagem (Ollama/vLLM) | Hardware ou aluguel | Eletricidade / horas de GPU | Alto | Privacidade, sem medição, controle total |
| Créditos de teste do z.ai | Nenhum | Grátis até o fim dos créditos | Baixo | Primeira experiência, testes rápidos |
| Plano de Codificação GLM Lite | ~$3-6/mês (verifique) | Mensal fixo | Baixo | Codificação diária em Claude Code/Cline/Cursor |
| API + entrada em cache | Nenhum | $1.40/$4.40 por 1M; ~$0.26 em cache | Baixo | Aplicativos, cargas de trabalho com contexto repetido |
Um padrão útil: valide sua ideia com créditos de teste e depois decida. Se você for executá-lo diariamente e for para codificação, adquira o plano Lite. Se precisar de privacidade ou quiser escapar totalmente da cobrança por token, invista na auto-hospedagem. Se estiver construindo um produto com contexto reutilizável, a API com cache é o custo mínimo mais barato e confiável.
Teste seu endpoint GLM-5.2 gratuito com Apidog
Não importa como você faz o GLM-5.2 funcionar, gratuito ou pago, você vai querer confirmar se o endpoint realmente funciona antes de conectá-lo ao seu aplicativo. Seja um servidor Ollama local, uma instância vLLM ou a API de nuvem do z.ai, a resposta é um payload de chat-completions em streaming que você precisa inspecionar.

Apidog é uma plataforma API tudo-em-um exatamente para isso. Você pode enviar uma solicitação ao seu endpoint GLM-5.2, observar os Server-Sent Events transmitidos renderizarem em tempo real, salvar a solicitação como um caso reutilizável e simular a resposta para que seu frontend possa ser construído com base nela antes mesmo de o modelo estar ativo. Aponte-o para http://localhost:11434 para Ollama ou para a URL base do z.ai para nuvem, defina seu cabeçalho Authorization, e você terá um conjunto de testes repetível em um minuto. Baixe o Apidog e mantenha-o ao lado de qualquer caminho gratuito que você escolher.
Perguntas Frequentes
GLM-5.2 é realmente gratuito para usar? Os pesos são gratuitos sob a licença MIT, então a auto-hospedagem não custa nada em termos de licenciamento. Você ainda paga pelo hardware ou aluguel de GPU. A API hospedada é paga, embora o z.ai geralmente ofereça créditos de teste e uma camada com limite de taxa para começar (verifique a oferta atual).
Posso executar o GLM-5.2 gratuitamente com Ollama em um laptop comum? Realisticamente, não. É um modelo MoE de ~753B, e mesmo uma compilação quantizada precisa de muita memória. Ollama facilita os comandos, mas o requisito de hardware é alto. Uma estação de trabalho com alta VRAM, um Mac com grande memória unificada ou uma GPU alugada é o que você precisa. Veja a análise aprofundada local para dimensionamento.
Existe uma camada gratuita do OpenRouter para GLM-5.2? Não. O OpenRouter oferece GLM-5.2 como "pague conforme o uso" por $1.40 de entrada e $4.40 de saída por 1M de tokens. É barato, não gratuito. Não confie em nenhuma fonte que afirme uma via gratuita do OpenRouter.
Qual é a maneira paga mais barata de usar o GLM-5.2 para codificação? A camada Lite do Plano de Codificação GLM, aproximadamente $3-6/mês a partir de junho de 2026 (verifique no z.ai). Ela oferece acesso à codificação com taxa fixa e desbloqueia o endpoint compatível com Anthropic para Claude Code, Cline e Cursor.
Como o GLM-5.2 se compara ao GPT-5.5 em custo? Segundo VentureBeat, o GLM-5.2 supera o GPT-5.5 em vários benchmarks de codificação de longo prazo por cerca de um sexto do custo. Para os números completos, veja o detalhamento dos benchmarks do GLM-5.2 e a comparação direta.
Onde ir a seguir
O caminho mais barato depende inteiramente do seu hardware e da frequência com que você o executará. A auto-hospedagem ganha em privacidade e sem medição se você conseguir atender aos requisitos de memória. Créditos de teste e o plano Lite ganham em conveniência. A API com entrada em cache ganha para aplicativos que reutilizam contexto.
Se você ainda está decidindo se o GLM-5.2 é o modelo certo, comece com o que é o GLM-5.2 e como ele se compara ao GLM-5.1. Quando estiver pronto para construir algo com ele, o guia da API do GLM-5.2 e o detalhamento de preços cobrem o restante, e o Apidog lida com os testes no meio.
