A Z.ai lançou o GLM-5.3-Flash em 26 de agosto de 2026. É um modelo mistura de especialistas (mixture-of-experts) de 320 bilhões de parâmetros com 18 bilhões de parâmetros ativos, é distribuído sob a licença MIT, e é o primeiro modelo da série GLM-5 que lida com imagens nativamente em vez de através de um adaptador de visão acoplado.
Também é o modelo que muitos desenvolvedores já estavam usando há uma semana sem saber. Mais sobre isso abaixo.
Se você veio aqui esperando que “Flash” significasse “rápido”, esta postagem vai discordar de você. Essa convenção de nomes vem do Google, onde os modelos Flash são genuinamente a camada de baixa latência. Aqui, significa algo diferente, e entender essa distinção corretamente muda se este modelo se adequa à sua carga de trabalho.
Resumo
- O que é: um modelo mixture-of-experts (MoE) de pesos abertos (MIT) 320B-A18B da Z.ai, lançado em 26 de agosto de 2026.
- A principal mudança: multimodalidade nativa. Entrada de imagem, vídeo e arquivos vai direto para o modelo. O GLM-5.3 roteia a visão através de adaptadores separados, e o GLM-5.2 era apenas texto.
- Contexto: 1.048.576 tokens, a mesma janela de 1M do GLM-5.3.
- O verdadeiro ponto de venda: custo. A Z.ai o posiciona em aproximadamente um décimo do preço do GLM-5.2, com uma taxa de tabela de US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de saída.
- A ressalva honesta: não é rápido. A Artificial Analysis mede 48,7 tokens de saída por segundo, o que é lento para sua classe de tamanho. O tempo para o primeiro token é realmente bom, com 1,52 segundos.
- Onde obtê-lo: na API da Z.ai como
glm-5.3-flash, além de OpenRouter, Cloudflare Workers AI, Vercel AI Gateway e vários outros provedores. Os pesos estão no Hugging Face.
As especificações
| Propriedade | Valor |
|---|---|
| Parâmetros totais | 320B |
| Parâmetros ativos | 18B |
| Arquitetura | Mixture of experts (Mistura de especialistas), atenção híbrida linear e esparsa |
| Licença | MIT |
| Janela de contexto | 1.048.576 tokens |
| Modalidades de entrada | Texto, imagem, vídeo, arquivos |
| Saída | Texto |
| Modos de raciocínio | low, high, max (padrão max) |
| ID do modelo na API | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
Um número a ser tratado com cautela: o máximo de tokens de saída. O OpenRouter lista 131.072 e o cartão do modelo no Hugging Face indica 163.840. Essas fontes discordam e a Z.ai não publicou um número que resolva a questão. Se sua aplicação depende de gerações únicas muito longas, verifique o limite com seu provedor real antes de construir em torno disso.
A multimodalidade nativa é a verdadeira novidade
Toda capacidade de visão anterior na linha GLM chegou como um modelo separado ou um caminho separado. A Z.ai lançou o GLM-5V-Turbo e o GLM-4.6V como modelos de visão distintos. Se você quisesse que um modelo GLM olhasse para uma captura de tela, você chamava um endpoint diferente daquele usado pelo seu tráfego de texto.
O GLM-5.3-Flash unifica isso. Imagens, vídeos e arquivos são blocos de conteúdo na mesma solicitação de conclusão de chat que carrega seu texto. Há um único ID de modelo, uma única linha de cobrança e uma única janela de contexto que mantém sua imagem e seu milhão de tokens de texto circundante ao mesmo tempo.
Essa última parte é o ponto interessante. Uma janela de contexto de 1M de tokens que também aceita imagens significa que você pode colocar um longo documento de especificação e uma captura de tela do resultado renderizado no mesmo prompt e pedir ao modelo para reconciliá-los. A própria abordagem da Z.ai se apoia nisso: ela descreve o modelo observando “interfaces, resultados de renderização e feedback de interação”, o que é um caso de uso de agente de codificação, e não de legenda de fotos.
Se você estiver trabalhando com modelos de visão de forma mais ampla, nosso guia para a API do GLM-5V-Turbo cobre a abordagem mais antiga e dedicada à visão, e o GLM-OCR para compreensão de documentos cobre o caso especializado.
A arquitetura, em resumo
A Z.ai construiu o GLM-5.3-Flash sobre um novo modelo base, em vez de fazer um pós-treinamento do GLM-5.2. Duas escolhas de design são importantes para seu comportamento:

Atenção híbrida. O modelo mistura atenção linear com atenção esparsa. A atenção linear lida com dependências locais de forma barata; a atenção esparsa busca os tokens globalmente relevantes. O resultado declarado é aproximadamente três vezes menos computação de atenção do que o GLM-5.3 e um cache KV cerca de 4,4 vezes menor.
Hiper-Conexões Restritas por Variedade (Manifold-Constrained Hyper-Connections). Termo da Z.ai para seu trabalho de eficiência de escala nesta versão. Ainda não há detalhes públicos suficientes para avaliá-lo de forma independente, então trate-o como um recurso arquitetônico descrito pelo fornecedor, e não como uma vantagem comprovada.
A redução do cache KV é a parte com consequências práticas óbvias. O cache KV é o que torna a inferência de contexto longo cara em memória, e sua redução em 4,4x é a principal razão pela qual este modelo pode ser servido a um décimo do preço do GLM-5.2, mantendo uma janela de 1M.
O treinamento utilizou um corpus que a Z.ai descreve como aproximadamente 30 trilhões de tokens multimodais.
Sobre o nome
A Artificial Analysis mede o GLM-5.3-Flash em 48,7 tokens de saída por segundo. Para contexto, isso está na extremidade inferior para modelos de pesos abertos de tamanho comparável. O GLM-5.3, o irmão maior, opera a cerca de 86 tokens por segundo na mesma medição.
Portanto, o modelo Flash é aproximadamente metade da velocidade do modelo não-Flash.
O que ele ganha é tempo para o primeiro token, em 1,52 segundos contra uma mediana de 2,14 segundos para modelos de pesos abertos. Se sua carga de trabalho envolve muitas interações curtas, essa responsividade é real. Se sua carga de trabalho é gerar documentos longos, você esperará mais do que esperaria no GLM-5.3.
A eficiência que este modelo oferece está no custo e na memória, não na velocidade de geração em tempo real (wall-clock). O cache KV menor e a menor computação de atenção se traduzem em um preço por token mais barato e uma pegada de serviço menor. Eles não se traduzem em streaming mais rápido.
Isso importa porque a maior parte da cobertura publicada nos dias após o lançamento repetiu a abordagem do fornecedor sem verificar o número de throughput, que estava público o tempo todo. Escolha este modelo porque ele é barato e lida com imagens, não porque você espera que ele faça streaming rapidamente.
Benchmarks
Números publicados no lançamento pela Z.ai, então leia-os como afirmações do fornecedor até que terceiros os reproduzam:

O dado independente é da Artificial Analysis, que posiciona o GLM-5.3-Flash em 57 no seu Índice de Inteligência v4.1.1. O GLM-5.3 pontua 60. A mediana para modelos de pesos abertos de tamanho semelhante é 27, então 57 é um resultado forte para a classe, embora esteja abaixo de seu irmão maior.
A Z.ai enquadra o modelo como se aproximando do Claude Opus 4.8 em trabalho de codificação e agente (agentic work). Essa é a caracterização do fornecedor de suas próprias avaliações internas, não um resultado medido por terceiros, e a lacuna de três pontos no Índice de Inteligência em relação ao seu próprio GLM-5.3 sugere alguma cautela.
Para como a história dos benchmarks GLM se desenvolveu em versões anteriores, nossa análise detalhada dos benchmarks do GLM-5.2 explica o que cada uma dessas avaliações realmente mede.
A semana do Ox Alpha
Em 20 de agosto, um modelo anônimo chamado ox-alpha apareceu em plataformas de inferência de terceiros com uma janela de contexto de 1M de tokens e preço zero. Em poucos dias, tornou-se um dos modelos mais usados nessas plataformas. A comunidade o rastreou até Zhipu em cerca de 48 horas com base nas características de saída.

Em 26 de agosto, a Z.ai confirmou: Ox Alpha era o GLM-5.3-Flash, e a semana gratuita foi um teste de carga deliberado.
A Z.ai também afirma que, durante aquela semana, todo o tráfego foi servido em aceleradores chineses domésticos usando uma stack baseada em SGLang, e reivindica um custo de serviço por token comparável ao hardware NVIDIA convencional. Essa é uma afirmação do fornecedor sobre sua própria infraestrutura, sem verificação independente disponível, então pondere-a adequadamente.
Já descrevemos esse padrão antes, quando o Pony Alpha se revelou um modelo DeepSeek ou GLM. Lançamentos furtivos em roteadores de terceiros estão se tornando um passo padrão pré-lançamento, e a conclusão útil é que um modelo anônimo incomumente capaz com uma janela de contexto suspeitosamente redonda é quase sempre o carro-chefe não lançado de alguém coletando dados de avaliação.
Como realmente usá-lo
API Hospedada. O endpoint da Z.ai é compatível com OpenAI. Aponte seu cliente existente para https://api.z.ai/api/paas/v4/ e defina o modelo como glm-5.3-flash. Nosso guia da API do GLM-5.3-Flash detalha a autenticação, o payload de entrada de imagem e o parâmetro de esforço de raciocínio.
Provedores terceirizados. O OpenRouter o oferece como z-ai/glm-5.3-flash. Ele também está disponível em Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten e io.net. Os preços variam entre os revendedores, às vezes significativamente.
Agentes de codificação. O Flash está incluído no Plano de Codificação GLM e, segundo relatos, oferece o triplo da cota utilizável do GLM-5.3, que é a razão prática pela qual um assinante mudaria. A documentação da Z.ai também observa que as chamadas fora do horário de pico consomem metade dos pontos padrão.
Auto-hospedado. Os pesos são licenciados sob MIT e estão no Hugging Face. vLLM, SGLang, TokenSpeed e KTransformers todos o suportam, e quantizações GGUF existem para rigs menores.
Você deve usá-lo?
Use o GLM-5.3-Flash se você precisa de compreensão de imagem ou vídeo na mesma chamada que seu texto, se o custo por token é a restrição que você está otimizando, ou se você quer pesos abertos que pode auto-hospedar sob uma licença permissiva.
Opte pelo GLM-5.3 se você precisa dos últimos pontos de qualidade de raciocínio, ou se o throughput de geração importa mais para você do que o preço. Nossa comparação lado a lado dos dois detalha a decisão, e o que é o GLM-5.3 cobre o modelo base em seus próprios termos.
Qualquer que você escolha, a troca é uma mudança de ID de modelo de uma linha em um endpoint compatível com OpenAI, o que facilita testar ambos contra sua própria carga de trabalho em vez de confiar na tabela de benchmarks de qualquer pessoa. Essa é a maneira certa de resolver isso.
Testar uma troca de modelo corretamente significa enviar requisições reais e verificar respostas reais, incluindo as multimodais que são difíceis de criar manualmente no curl. O Apidog permite que você salve essas chamadas como uma coleção reutilizável com asserções anexadas, então, ao passar do GLM-5.3 para o Flash, você pode confirmar que o formato da resposta não mudou, em vez de descobrir isso em produção.
FAQ
O GLM-5.3-Flash é gratuito? Não mais. A semana gratuita do Ox Alpha terminou quando o modelo foi oficialmente anunciado. Há um desconto de lançamento de 50% válido até 9 de setembro de 2026, após o qual os preços de tabela serão aplicados.
É mais rápido que o GLM-5.3? Não. Ele gera aproximadamente 49 tokens por segundo contra 86 do GLM-5.3. Ele começa a responder mais cedo, em 1,52 segundos para o primeiro token.
Ele pode realmente lidar com um milhão de tokens de contexto? A janela configurada é de 1.048.576 tokens, confirmada na configuração do modelo e pela Artificial Analysis. Note que o OpenRouter lista um número maior, de 1.310.720; trate isso como uma listagem do provedor, e não como uma especificação do modelo.
Ele aceita vídeo? A documentação da Z.ai lista entrada de texto, imagem, vídeo e arquivos. O suporte a vídeo é mais recente e menos exercitado do que a entrada de imagem, então valide-o com sua própria mídia antes de depender dele.
Sob qual licença estão os pesos? MIT, com os pesos publicados em zai-org/GLM-5.3-Flash no Hugging Face.
