O que é GLM-5.2?

O que é GLM-5.2? O modelo carro-chefe de codificação MoE de 753B com pesos abertos da Z.ai: contexto de 1M, licença MIT, benchmarks e como acessá-lo via API, Claude Code e Ollama.

Ashley Innocent

Ashley Innocent

17 junho 2026

O que é GLM-5.2?

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

GLM-5.2 é o mais novo modelo carro-chefe da Z.ai (o laboratório de IA da Zhipu), e chegou com uma proposta clara: pesos abertos, focado em codificação e competitivo com os maiores modelos de fronteira fechados. Se você tem ouvido o nome e quer uma resposta direta para "o que é GLM-5.2", este é o explicador canônico. Abordaremos quem o fabrica, o que ele realmente é por baixo do capô, como acessá-lo e quais são as ressalvas honestas.

botão

TL;DR

Quem fabrica o GLM-5.2, e o que ele é

GLM-5.2 vem da Z.ai, o laboratório também conhecido como Zhipu AI. É a mais recente entrada na família GLM ("General Language Model"), sucedendo o lançamento do GLM-5.1. O posicionamento é explícito: este é um carro-chefe de codificação que distribui seus pesos abertamente, em vez de se esconder atrás de uma barreira apenas de API.

Essa postura de pesos abertos é toda a história aqui. A maioria dos modelos que competem com GPT-5.5 ou Claude Opus 4.8 são fechados. O GLM-5.2 oferece capacidade comparável em um arquivo que você pode baixar. Se você leu nossa visão geral do GLM-5.1, pense no 5.2 como a mesma linhagem com um foco mais acentuado em codificação e capacidade agentiva.

GLM-5.2 é um modelo de propósito geral com uma inclinação para codificação. Ele lida com raciocínio, matemática e texto multilíngue (inglês e chinês são de primeira classe), mas a Z.ai o otimizou mais intensamente para engenharia de software e trabalho de agente multifacetado e orientado por ferramentas.

Identidade: como encontrar o GLM-5.2 em diferentes plataformas

Uma coisa que confunde as pessoas com modelos abertos é a nomenclatura. O mesmo modelo possui diferentes identificadores dependendo de onde você o carrega. Aqui está o mapa.

Plataforma Identificador
Hugging Face zai-org/GLM-5.2
API da Z.ai glm-5.2
Ollama glm-5.2
OpenRouter z-ai/glm-5.2

Os pesos são licenciados pelo MIT sem restrições regionais, então o repositório do Hugging Face é genuinamente baixável em vez de restrito. Você pode confirmar o cartão e os arquivos na página do GLM-5.2 no Hugging Face.

Arquitetura em termos simples: 753B MoE + IndexShare

GLM-5.2 é um modelo de Mistura de Especialistas com aproximadamente 753B de parâmetros totais, servido em BF16. MoE significa que o modelo é dividido em muitas sub-redes "especialistas", e apenas uma fração delas é ativada para qualquer token dado. Você obtém a capacidade de conhecimento de um modelo enorme sem pagar a conta total de computação em cada passagem direta. É assim que um modelo de 753B permanece utilizável.

A peça mais nova é a atenção esparsa. O GLM-5.2 introduz um método que a Z.ai chama de IndexShare. A atenção normal torna-se cara rapidamente à medida que seu contexto cresce, porque cada token atende a todos os outros tokens. O IndexShare reutiliza um único "indexador" em cada grupo de 4 camadas de atenção esparsa, em vez de calcular um novo por camada. Na prática, isso reduz o custo da atenção em contextos longos, que é exatamente o que você deseja quando sua janela tem um milhão de tokens de largura.

Você não precisa entender a matemática para se beneficiar dela. A conclusão: o GLM-5.2 é projetado para que alimentá-lo com uma grande base de código ou um documento longo não aumente sua latência e custo da maneira que um modelo denso faria.

Uma janela de contexto de 1M de tokens

GLM-5.2 suporta uma janela de contexto de 1M de tokens (1.048.576 tokens, para ser exato). Isso é suficiente para inserir um repositório de tamanho médio inteiro, uma especificação longa ou uma pilha de documentos relacionados em um único prompt e pedir ao modelo para raciocinar sobre tudo isso.

A saída máxima é onde você deve ter cuidado. A documentação da z.ai lista a saída em até 128K tokens, mas nem todo host publica o mesmo número, e o OpenRouter não a lista de forma alguma. Portanto, trate 128K como o teto documentado para verificar ao vivo, em vez de uma garantia em cada endpoint. Se seu fluxo de trabalho depender de gerações muito longas, verifique o limite no provedor específico que você está usando.

Para contexto sobre como esta geração elevou o nível, nossa comparação GLM-5.2 vs GLM-5.1 detalha o que mudou de lançamento para lançamento.

Esforço de pensamento: Alto, Máximo e desligando

GLM-5.2 é um modelo capaz de raciocínio com comportamento de "pensamento" controlável. Você obtém dois níveis de esforço de pensamento:

Você também pode desativar o pensamento completamente. Para buscas rápidas, formatação ou transformações simples, você não quer que o modelo queime tokens em uma cadeia de pensamento interna. Desativar o pensamento mantém essas chamadas rápidas e baratas.

Na API, isso mapeia para um parâmetro thinking ({"type": "enabled"} ou {"type": "disabled"}) e um valor de reasoning_effort como "max". Aprofundamos na forma da requisição no guia da API do GLM-5.2, mas o modelo mental é simples: aumente o raciocínio para trabalhos de engenharia difíceis, e desative-o para chamadas triviais.

Licença MIT e pesos abertos: o que isso realmente oferece

"Pesos abertos" é um termo usado de forma ampla, então aqui está o que a licença MIT do GLM-5.2 permite concretamente:

Para equipes com restrições de residência de dados ou conformidade, isso importa mais do que um ou dois pontos de benchmark. Você pode manter prompts e código internamente. Se você quiser tentar o caminho totalmente local, veja execute o GLM-5 localmente gratuitamente e GLM-5 gratuitamente com Ollama para os padrões, que se estendem ao 5.2.

Codificação em primeiro lugar e agentivo: os benchmarks

A Z.ai construiu o GLM-5.2 para realizar trabalho real de software, não apenas para conversar sobre ele. A história do benchmark é centrada em codificação e uso de ferramentas agentivas. Os números abaixo são os resultados publicados pela Z.ai, então leia-os como as próprias medições do laboratório, em vez de pontuações independentes de terceiros.

Benchmark GLM-5.2 Comparação notável
Terminal-Bench 2.1 81.0 GLM-5.1 marcou 62.0
SWE-bench Pro 62.1 GPT-5.5 58.6, GLM-5.1 58.4
MCP-Atlas 77.0 GPT-5.5 75.3, Claude Opus 4.8 77.8
Último Exame da Humanidade (c/ ferramentas) 54.7 GPT-5.5 52.2
AIME 2026 99.2 n/d
GPQA-Diamond 91.2 n/d

A estatística principal é o Terminal-Bench. Passar de 62.0 para 81.0 em uma única geração é um grande salto em um benchmark que mede se um modelo pode realmente operar um terminal para realizar tarefas. O SWE-bench Pro em 62.1, superando os 58.6 do GPT-5.5, é a outra manchete: ele aponta para uma resolução de problemas genuína em nível de repositório, não para pequenos trechos de código.

A Z.ai também relata o GLM-5.2 como o modelo de código aberto mais alto em FrontierSWE, PostTrainBench e SWE-Marathon, e o posiciona contra GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro e DeepSeek-V4-Pro. A VentureBeat abordou o ângulo do custo de forma direta, escrevendo que o GLM-5.2 "supera o GPT-5.5 em codificação de longo prazo a ~1/6 do custo" (essa linha é a abordagem da VentureBeat, em sua cobertura do GLM-5.2, não uma medição da Apidog).

Para a análise completa e as ressalvas de comparação direta, consulte nossa análise aprofundada dos benchmarks do GLM-5.2 e a comparação direta GLM-5.2 vs GPT-5.5, Claude Opus e Gemini.

Como acessar o GLM-5.2 rapidamente

Você tem quatro caminhos práticos, dependendo se deseja uma API hospedada, uma configuração de codificação agentiva, um roteador ou uma instalação local.

Caminho de acesso Melhor para Nota rápida
API da Z.ai Chamadas diretas e hospedadas Compatível com OpenAI, endpoint em https://api.z.ai/api/paas/v4/
Claude Code (Plano de Codificação GLM) Codificação agentiva no seu terminal URL base compatível com Anthropic, selecione a variante [1m]
OpenRouter Uma chave, muitos modelos ID do modelo z-ai/glm-5.2
Ollama Local / offline Obtenha glm-5.2 da biblioteca

API da Z.ai. A API geral é compatível com OpenAI. Você acessa https://api.z.ai/api/paas/v4/chat/completions com uma chave Bearer e passa os parâmetros usuais mais thinking, reasoning_effort, temperature e stream. Chamadas de funções e ferramentas são suportadas.

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [{"role": "user", "content": "Refactor this function for readability."}],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "max",
    "stream": true
  }'

Claude Code via o Plano de Codificação GLM. A Z.ai expõe um endpoint de codificação compatível com Anthropic, para que você possa apontar o Claude Code para o GLM-5.2. A URL base de codificação é https://api.z.ai/api/coding/paas/v4 (algumas fontes mostram open.z.ai/api/paas/v4, então verifique ao vivo), e você configura seu ambiente Claude Code para rotear através dele.

export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000

O sufixo [1m] seleciona a variante de 1M de contexto. Essa linha API_TIMEOUT_MS não é um preenchimento opcional: chamadas longas e de grande contexto podem exceder o tempo limite padrão do Claude Code, então aumentá-lo impede que a ferramenta encerre as requisições no meio do processo. Detalhamos essa configuração, além de Cline e Cursor, no guia GLM-5.2 no Claude Code, Cline e Cursor. Se você usou a geração anterior dessa forma, nosso artigo sobre GLM-5.1 com Claude Code cobre o mesmo fluxo.

OpenRouter. Se você já roteia através do OpenRouter, o GLM-5.2 está disponível como z-ai/glm-5.2. Verifique a listagem ao vivo em openrouter.ai/z-ai/glm-5.2. Note que não há uma faixa gratuita do OpenRouter para este modelo, então não planeje usá-la.

Ollama. Para uso local, baixe-o da biblioteca Ollama. Esta é a rota para trabalho offline ou controle rigoroso de dados, com a desvantagem óbvia de que você precisa de memória GPU real para servir um MoE de 753B confortavelmente.

Para um resumo das opções genuinamente gratuitas, veja como usar o GLM-5.2 gratuitamente.

Preços, resumidamente

Na API hospedada, o OpenRouter confirma os preços em $1.40 por 1M de tokens de entrada e $4.40 por 1M de tokens de saída. A VentureBeat cita entrada em cache em torno de $0.26 por 1M. O Plano de Codificação GLM possui assinaturas em níveis (Lite, Pro, Max e Team), mas os valores mensais exatos variam entre fontes secundárias, então confirme os preços atuais em z.ai antes de se comprometer (em junho de 2026). Nossa análise de preços do GLM-5.2 mantém um registro contínuo.

Onde a Apidog se encaixa

Se você está desenvolvendo contra a API do GLM-5.2, ou integrando-o a um agente que chama seus próprios serviços, você ainda precisa projetar, testar e documentar esses endpoints. É aí que a Apidog ajuda. Você pode simular os endpoints suportados por LLM antes que a integração real esteja pronta, depurar as formas de requisição e resposta (incluindo payloads de streaming e chamadas de ferramentas) e manter sua documentação da API sincronizada à medida que o contrato muda. É uma plataforma de API tudo-em-um, então design, depuração, teste, simulação e documentação vivem em um só lugar, em vez de quatro. Quando estiver pronto para experimentar, baixe a Apidog e aponte-a para sua integração GLM-5.2.

Como o GLM-5.2 se compara ao resto da família e do campo

O GLM-5.2 é o auge da linha GLM atual em termos de codificação e capacidade agentiva. Se você está comparando-o com lançamentos anteriores ou laboratórios rivais, estas são as próximas leituras úteis:

FAQ

O que é GLM-5.2 em uma frase? É o LLM carro-chefe de pesos abertos da Z.ai, um modelo MoE de ~753B parâmetros otimizado para codificação, raciocínio e uso de ferramentas agentivas, com uma janela de contexto de 1M de tokens e uma licença MIT.

O GLM-5.2 é realmente gratuito? Os pesos são gratuitos para baixar e auto-hospedar sob a licença MIT. A API hospedada da Z.ai e o Plano de Codificação GLM são pagos. Não há um nível gratuito do OpenRouter para ele, então "gratuito" aqui significa pesos abertos, não um endpoint hospedado gratuitamente.

O GLM-5.2 consegue ver imagens? Não. É texto de entrada, texto de saída de acordo com a documentação da API, sem variante de visão confirmada. Use um modelo de visão separado se precisar de entrada de imagem.

Como o GLM-5.2 é diferente do GLM-5.1? O maior salto visível é a codificação agentiva. O Terminal-Bench 2.1 passou de 62.0 para 81.0 de acordo com os resultados da Z.ai, além de ganhos no SWE-bench Pro e a nova atenção esparsa IndexShare. Veja a comparação GLM-5.2 vs GLM-5.1 para a diferença completa.

Qual comprimento de contexto e comprimento de saída ele suporta? O contexto é de 1M de tokens. A saída é documentada em até 128K de acordo com a z.ai, mas nem todo host lista o mesmo teto, então verifique com seu provedor.

A versão curta

GLM-5.2 é o que acontece quando um laboratório de pesos abertos decide competir de frente com a fronteira fechada em codificação. Você obtém um modelo MoE de 753B com uma janela de um milhão de tokens, esforço de raciocínio controlável, uma licença MIT que permite auto-hospedagem e distribuição, e resultados de benchmark que o colocam na conversa de GPT-5.5 e Claude Opus 4.8, pelo menos de acordo com os próprios números da Z.ai. As ressalvas são reais (apenas texto, limites de saída para verificar, alegações de benchmark do fornecedor), mas a proposta central se mantém: este é um modelo sério de codificação que você pode realmente possuir. Comece com o guia da API do GLM-5.2 quando estiver pronto para construir.

botão

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs