O GLM-5.3-Flash está atualmente pela metade do preço. Isso termina em 9 de setembro de 2026 e, quando acontecer, cada projeção de custo baseada nas taxas de hoje dobrará.
Este post cobre o custo atual do modelo, o custo após o término da promoção, como isso se compara às alternativas e como determinar se a diferença realmente importa para sua carga de trabalho. Todos os valores foram verificados em 27 de agosto de 2026, e as páginas de preços mudam, portanto, confirme com seu provedor antes de comprometer um orçamento.
A tabela de preços
| Preço de lançamento (até 9 de setembro de 2026) | Preço de tabela (depois) | |
|---|---|---|
| Entrada | $0,075 / 1M tokens | $0,15 / 1M tokens |
| Saída | $0,25 / 1M tokens | $0,50 / 1M tokens |
| Entrada em cache | $0,015 / 1M tokens | $0,03 / 1M tokens |
A Artificial Analysis publica um valor combinado de $0,10 por milhão de tokens usando uma proporção de 7:2:1 de acerto de cache para entrada e saída. Esse é um número único útil para comparar preços, embora sua própria proporção seja o que determina sua conta.
Quanto isso custa na prática
Taxas abstratas por milhão são difíceis de raciocinar, então aqui estão três cargas de trabalho concretas ao preço de tabela, que é o número que importa para o planejamento após 9 de setembro.
Um classificador de suporte. 100.000 tickets por mês, aproximadamente 800 tokens de entrada e 100 tokens de saída cada. Isso totaliza 80M de entrada e 10M de saída: $12,00 de entrada mais $5,00 de saída, ou seja, $17 por mês. Defina reasoning_effort como low e o lado da saída diminuirá ainda mais.
Um assistente de codificação. 500 sessões por dia, aproximadamente 15.000 tokens de entrada (muito deles contexto de arquivo repetido) e 2.000 tokens de saída por sessão. Mensalmente, isso representa 225M de entrada e 30M de saída. Sem cache: $33,75 mais $15,00, ou seja, $48,75. Com 70% da entrada atingindo o cache: a entrada cai para aproximadamente $14,85, totalizando cerca de $30.
Um pipeline de documentos com imagens. 10.000 documentos por mês, aproximadamente 40.000 tokens cada, incluindo conteúdo de imagem, e 1.500 tokens de saída. Isso representa 400M de entrada e 15M de saída: $60,00 mais $7,50, ou $67,50 por mês para trabalhos que exigem visão.
Nenhum desses são números grandes. Esse é o objetivo deste modelo.
A entrada em cache é a maior alavanca
A $0,03 por milhão em comparação com $0,15 para entrada nova, tokens em cache custam um quinto dos não armazenados em cache. Qualquer carga de trabalho com um prefixo estável, um prompt de sistema, um documento sendo consultado repetidamente, uma base de código em contexto, deve ser estruturada de modo que o prefixo permaneça idêntico em todas as chamadas.
O erro que destrói silenciosamente as taxas de acerto de cache é colocar qualquer coisa variável perto do início do prompt. Um carimbo de data/hora, um ID de solicitação ou um nome de usuário no prompt do sistema invalida tudo o que vem depois. Coloque o conteúdo estável primeiro e o conteúdo variável por último.
A Z.ai também listou o armazenamento de entrada em cache como gratuito por um período limitado. Trate isso como promocional e verifique os termos atuais em vez de construir uma arquitetura que dependa disso.
A segunda alavanca é o esforço de raciocínio
reasoning_effort por padrão é max neste modelo. Essa é a configuração mais cara, e é o que você obtém se nunca tocar no parâmetro.
Os três modos são low, high e max. Tokens de raciocínio são cobrados como saída, então uma tarefa que não precisa de deliberação está pagando taxas de saída por um pensamento que ninguém lê. Para classificação, extração, roteamento e formatação, low pode reduzir substancialmente o lado da saída.
A configuração é abordada em nosso guia de API. É uma mudança de uma linha e é a primeira coisa a tentar se sua conta parecer mais alta do que o cálculo acima sugere.
Como se compara
Em comparação com seu próprio irmão, ao preço de tabela:
| Modelo | Combinado por 1M |
|---|---|
| GLM-5.3-Flash | $0,10 |
| GLM-5.3 | $0,90 |
Aproximadamente uma diferença de nove vezes para uma diferença de três pontos no Índice de Inteligência da Artificial Analysis, 57 contra 60. Nossa comparação completa aborda quando essa troca é desvantajosa, e a resposta curta é: quando você transmite respostas longas para um humano esperando, porque o GLM-5.3 gera quase o dobro da velocidade.
Em comparação com o GLM-5.2, a afirmação da Z.ai é de aproximadamente um décimo do preço, juntamente com um custo por tarefa de $0,045. Nosso detalhamento de preços do GLM-5.2 tem a tabela de preços antiga se você estiver orçando uma migração.
Em comparação com a camada multimodal barata de outros fornecedores, o GLM-5.3-Flash é competitivo em preço e incomum por ser licenciado sob MIT, o que significa que a opção de auto-hospedagem permanece aberta. Nosso post sobre preços do Gemini 3.7 Flash cobre a comparação mais próxima do lado do Google.
Preços de revendedores diferem, às vezes muito
O modelo está disponível diretamente através da Z.ai, além de OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten e io.net.
Nem todos cobram o mesmo. A AIHubMix, por exemplo, listou taxas em torno de $0,113 para entrada e $0,394 para saída, o que se situa entre os preços promocionais e de tabela da Z.ai. Alguns provedores repassam o desconto de lançamento e outros não.
Se você estiver roteando por meio de um agregador, verifique sua taxa atual em vez de presumir que ela espelha a da Z.ai. A conveniência de um gateway unificado às vezes carrega uma margem, e nesses níveis de preços absolutos, uma margem percentual é fácil de ignorar e fácil de tolerar.
Quando a auto-hospedagem começa a valer a pena
Os pesos são licenciados sob MIT, então executá-lo por conta própria é uma opção real, e o cálculo do ponto de equilíbrio para auto-hospedagem ficou mais difícil quando o preço da API caiu tanto.
Uma estimativa aproximada: o serviço de precisão total requer um nó de classe 8x H200, que custa algo em torno de $24 a $48 por dia em capacidade de nuvem alugada. Chame isso de $1.000 por mês como um custo fixo que se acumula independentemente de o nó estar ocupado ou ocioso.
Ao preço de tabela da API, $1.000 compram aproximadamente 6,7 bilhões de tokens de entrada. Você precisa estar executando um volume enorme e sustentado antes que o custo fixo de um nó supere isso. Para a maioria das equipes, a resposta honesta é que a auto-hospedagem do GLM-5.3-Flash é sobre controle, residência de dados ou licenciamento, em vez de custo.
A exceção é a camada quantizada. Existem quantizações GGUF, e executar um modelo quantizado em hardware que você já possui muda completamente o cálculo porque o custo marginal é a eletricidade. Nosso guia de execução local aborda o que cada camada de hardware pode realmente fazer.
A alternativa do plano de codificação
Se seu uso é de um desenvolvedor trabalhando no Claude Code ou Cline em vez de um aplicativo fazendo chamadas de API, o preço por token pode ser o modelo errado. O Plano de Codificação GLM começa em torno de $18 por mês, inclui GLM-5.3-Flash, e supostamente concede três vezes a cota utilizável do GLM-5.3. A documentação da Z.ai também menciona que chamadas fora do pico consomem metade dos pontos padrão.
Para um único desenvolvedor codificando diariamente, um plano fixo geralmente é mais barato e sempre mais previsível do que o acesso à API com medição. Nosso guia de configuração aborda como conectá-lo, e nossa comparação de planos de codificação compara o plano GLM com as alternativas.
Fique de olho no lado da saída
O preço de entrada chama a atenção porque os números são maiores em volume. A saída é onde os orçamentos realmente se quebram, por duas razões.
A saída custa mais de três vezes o que a entrada custa por token, a $0,50 contra $0,15. E os tokens de raciocínio são cobrados como saída. Um modelo configurado para esforço de raciocínio max pode gerar várias vezes mais tokens do que aparecem na resposta final, tudo isso cobrado à taxa de saída.
Essa combinação significa que um aplicativo com um prompt modesto e um modelo "falador" pode acabar sendo dominado pela saída, mesmo que pareça intensivo em entrada no papel. O valor combinado de $0,10 por milhão assume uma proporção de 7:2:1 que muitas cargas de trabalho reais não correspondem.
A solução é a medição em vez da estimativa. Cada resposta de conclusão carrega um objeto usage com a contagem de tokens para essa chamada. Registre-o, agregue-o e compare a proporção real com a suposição que você orçou. Se a saída estiver acima de cerca de 15% do total de seus tokens, reasoning_effort é o primeiro lugar para procurar e o tamanho do prompt é o segundo.
O que fazer antes de 9 de setembro
Três coisas que valem a pena fazer enquanto o desconto está ativo:
- Meça sua mistura real de tokens. A taxa combinada assume 7:2:1. Se a sua for intensiva em saída, seu custo efetivo estará mais próximo da taxa de saída de $0,50 do que do valor combinado de $0,10.
- Verifique sua taxa de acerto de cache. Com uma diferença de preço de 5x entre entrada em cache e nova, é aqui que está o dinheiro.
- Execute novamente seu modelo de custo com o preço de tabela. Tudo dobra em 10 de setembro. Se a carga de trabalho só for viável com a taxa promocional, você tem um problema para resolver agora, e não em duas semanas.
Rastrear o uso real de tokens significa capturar respostas reais, já que o objeto usage em cada conclusão carrega as contagens de tokens de entrada, saída e em cache que você precisa. Executar suas chamadas representativas como uma coleção salva no Apidog, com o ID do modelo como uma variável de ambiente, fornece esses números por solicitação e permite que você execute novamente o mesmo conjunto contra o GLM-5.3 para comparar as contas em vez do marketing.
FAQ
O GLM-5.3-Flash é gratuito? Não. Foi gratuito por cerca de uma semana enquanto rodava anonimamente como "ox-alpha" antes do lançamento, mas isso terminou no anúncio. O desconto atual de 50% não é o mesmo que gratuito.
Quando exatamente o desconto termina? 9 de setembro de 2026. Os preços de tabela se aplicam a partir de então.
Por que sites diferentes citam preços diferentes? Alguns citam a taxa promocional, outros a lista, e os revendedores definem suas próprias margens. Sempre verifique o provedor que você realmente usa.
A entrada de imagem custa extra? Imagens consomem tokens de contexto e são cobradas como entrada. Não há uma sobretaxa separada para imagens, mas uma imagem de alta resolução consome um número significativo de tokens.
É mais barato auto-hospedar? Somente com um volume sustentado muito grande, ou em hardware que você já possui usando uma compilação quantizada. A $0,15 por milhão de tokens de entrada, alugar um nó 8x H200 é difícil de justificar apenas pelo custo.
