GLM-5.3-Flash est actuellement à moitié prix. Cette offre se termine le 9 septembre 2026, et quand ce sera le cas, toutes les projections de coûts basées sur les tarifs actuels doubleront.
Cet article couvre ce que le modèle coûte maintenant, ce qu'il coûtera après, comment cela se compare aux alternatives, et comment déterminer si la différence compte réellement pour votre charge de travail. Tous les chiffres ont été vérifiés le 27 août 2026, et les pages tarifaires peuvent changer, alors confirmez auprès de votre fournisseur avant d'engager un budget.
La grille tarifaire
| Prix de lancement (jusqu'au 9 sept. 2026) | Prix catalogue (après) | |
|---|---|---|
| Input | $0.075 / 1M tokens | $0.15 / 1M tokens |
| Output | $0.25 / 1M tokens | $0.50 / 1M tokens |
| Cached input | $0.015 / 1M tokens | $0.03 / 1M tokens |
Artificial Analysis publie un chiffre combiné de 0,10 $ par million de jetons en utilisant un ratio d'accès au cache/entrée/sortie de 7:2:1. C'est un chiffre unique utile pour comparer les prix, bien que votre propre ratio soit ce qui détermine votre facture.
Ce que cela coûte en pratique
Les tarifs abstraits par million sont difficiles à appréhender, voici donc trois charges de travail concrètes au prix catalogue, qui est le chiffre important pour la planification après le 9 septembre.
Un classificateur de support. 100 000 tickets par mois, environ 800 jetons d'entrée et 100 jetons de sortie chacun. Soit 80 millions de jetons d'entrée et 10 millions de jetons de sortie : 12,00 $ d'entrée plus 5,00 $ de sortie, soit 17 $ par mois. Définissez reasoning_effort sur low et la partie sortie diminue encore.
Un assistant de codage. 500 sessions par jour, environ 15 000 jetons d'entrée (dont beaucoup de contexte de fichier répété) et 2 000 jetons de sortie par session. Par mois, cela représente 225 millions d'entrées et 30 millions de sorties. Sans mise en cache : 33,75 $ plus 15,00 $, soit 48,75 $. Avec 70 % des entrées accédant au cache : l'entrée tombe à environ 14,85 $, ce qui ramène le total à environ 30 $.
Un pipeline de documents avec des images. 10 000 documents par mois, environ 40 000 jetons chacun, y compris le contenu d'image, et 1 500 jetons de sortie. Cela représente 400 millions d'entrées et 15 millions de sorties : 60,00 $ plus 7,50 $, soit 67,50 $ par mois pour un travail nécessitant de la vision.
Aucun de ces chiffres n'est élevé. C'est l'intérêt de ce modèle.
L'entrée en cache est le plus grand levier
À 0,03 $ par million contre 0,15 $ pour une nouvelle entrée, les jetons mis en cache coûtent un cinquième de ceux qui ne le sont pas. Toute charge de travail avec un préfixe stable, une invite système, un document faisant l'objet de requêtes répétées, une base de code en contexte, doit être structurée de manière à ce que ce préfixe reste identique d'un appel à l'autre.
L'erreur qui détruit silencieusement les taux d'accès au cache est de placer quoi que ce soit de variable au début de l'invite. Un horodatage, un identifiant de requête ou un nom d'utilisateur dans l'invite système invalide tout ce qui suit. Placez le contenu stable en premier et le contenu variable en dernier.
Z.ai a également listé le stockage des entrées en cache comme gratuit pour une durée limitée. Considérez cela comme promotionnel et vérifiez les conditions actuelles plutôt que de construire une architecture qui en dépend.
Le second levier est l'effort de raisonnement
reasoning_effort est défini par défaut sur max sur ce modèle. C'est le paramètre le plus cher, et c'est ce que vous obtenez si vous ne touchez jamais au paramètre.
Les trois modes sont low, high et max. Les jetons de raisonnement sont facturés comme des sorties, donc une tâche qui ne nécessite pas de délibération paie des tarifs de sortie pour une réflexion que personne ne lit. Pour la classification, l'extraction, le routage et le formatage, low peut réduire considérablement la partie sortie.
La configuration est couverte dans notre guide API. C'est un changement d'une seule ligne et c'est la première chose à essayer si votre facture semble plus élevée que ce que le calcul ci-dessus suggère.
Comment il se compare
Par rapport à son propre frère, au prix catalogue :
| Model | Blended per 1M |
|---|---|
| GLM-5.3-Flash | $0.10 |
| GLM-5.3 | $0.90 |
Un écart d'environ neuf fois pour une différence de trois points sur l'indice d'intelligence d'Artificial Analysis, 57 contre 60. Notre comparaison complète explique quand cet arbitrage est une erreur, et la réponse courte est : lorsque vous diffusez de longues réponses à un humain en attente, car GLM-5.3 génère presque deux fois plus vite.
Par rapport à GLM-5.2, Z.ai affirme un prix environ dix fois inférieur, avec un coût par tâche de 0,045 $. Notre analyse des prix de GLM-5.2 contient l'ancienne grille tarifaire si vous budgétez une migration.
Par rapport à la gamme multimodale économique d'autres fournisseurs, GLM-5.3-Flash est compétitif sur le prix et inhabituel en étant sous licence MIT, ce qui signifie que l'option d'auto-hébergement reste ouverte. Notre article sur la tarification de Gemini 3.7 Flash couvre la comparaison la plus proche du côté de Google.
Les prix des revendeurs diffèrent, parfois beaucoup
Le modèle est disponible directement via Z.ai, ainsi que via OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten, et io.net.
Tous ne facturent pas le même prix. AIHubMix, par exemple, a affiché des tarifs d'environ 0,113 $ en entrée et 0,394 $ en sortie, ce qui se situe entre les prix promotionnels et catalogue de Z.ai. Certains fournisseurs répercutent la remise de lancement et d'autres non.
Si vous passez par un agrégateur, vérifiez son tarif actuel plutôt que de supposer qu'il reflète celui de Z.ai. La commodité d'une passerelle unifiée entraîne parfois une marge, et à ces niveaux de prix absolus, une majoration en pourcentage est facile à négliger et facile à tolérer.
Quand l'auto-hébergement commence à être avantageux
Les poids sont sous licence MIT, donc l'exécuter vous-même est une option réelle, et le calcul du seuil de rentabilité est devenu plus difficile pour l'auto-hébergement lorsque le prix de l'API a chuté à ce niveau.
Pour donner un ordre de grandeur : un service en pleine précision nécessite un nœud de classe H200 avec 8 GPU, ce qui coûte entre 24 $ et 48 $ par jour sur une capacité cloud louée. Disons 1 000 $ par mois comme coût fixe qui s'accumule que le nœud soit occupé ou inactif.
Au prix catalogue de l'API, 1 000 $ permettent d'acheter environ 6,7 milliards de jetons d'entrée. Vous devez traiter un volume énorme et soutenu avant que le coût fixe d'un nœud ne soit plus avantageux. Pour la plupart des équipes, la réponse honnête est que l'auto-hébergement de GLM-5.3-Flash concerne davantage le contrôle, la résidence des données ou la licence que le coût.
L'exception est le niveau quantifié. Des quantifications GGUF existent, et l'exécution d'un modèle quantifié sur du matériel que vous possédez déjà change complètement le calcul car le coût marginal est l'électricité. Notre guide d'exécution locale explique ce que chaque niveau matériel peut réellement faire.
L'alternative du forfait de codage
Si votre utilisation est celle d'un développeur travaillant dans Claude Code ou Cline plutôt que d'une application effectuant des appels API, la tarification par jeton peut être un modèle complètement inadapté. Le forfait de codage GLM commence autour de 18 $ par mois, inclut GLM-5.3-Flash, et octroie apparemment trois fois le quota utilisable de GLM-5.3. La documentation de Z.ai mentionne également que les appels en heures creuses consomment la moitié des points standards.
Pour un seul développeur codant quotidiennement, un forfait fixe est généralement moins cher et toujours plus prévisible qu'un accès API mesuré. Notre guide de configuration du harnais couvre la mise en place, et notre comparaison des forfaits de codage met le forfait GLM en concurrence avec les alternatives.
Surveillez le côté sortie
La tarification des entrées attire l'attention car les chiffres sont plus importants en volume. La sortie est l'endroit où les budgets se cassent réellement, pour deux raisons.
La sortie coûte plus de trois fois ce que coûte l'entrée par jeton, à 0,50 $ contre 0,15 $. Et les jetons de raisonnement sont facturés comme des sorties. Un modèle réglé sur un effort de raisonnement max peut générer plusieurs fois plus de jetons que ce qui apparaît dans la réponse finale, le tout étant facturé au tarif de sortie.
Cette combinaison signifie qu'une application avec une invite modeste et un modèle bavard peut se retrouver dominée par la sortie même si elle semble très orientée vers l'entrée sur le papier. Le chiffre combiné de 0,10 $ par million suppose un ratio 7:2:1 que de nombreuses charges de travail réelles ne respectent pas.
La solution est la mesure plutôt que l'estimation. Chaque réponse de complétion contient un objet usage avec le nombre de jetons pour cet appel. Enregistrez-le, agrégez-le et comparez le ratio réel avec l'hypothèse que vous aviez budgétisée. Si la sortie représente plus d'environ 15 % de vos jetons totaux, reasoning_effort est le premier endroit à regarder et la longueur de l'invite est le second.
Que faire avant le 9 septembre
Trois choses à faire pendant que la réduction est active :
- Mesurez votre véritable répartition de jetons. Le taux combiné suppose un ratio 7:2:1. Si le vôtre est lourd en sortie, votre coût effectif est plus proche du tarif de sortie de 0,50 $ que du chiffre combiné de 0,10 $.
- Vérifiez votre taux d'accès au cache. Avec une différence de prix de 5x entre l'entrée mise en cache et la nouvelle entrée, c'est là que se trouve l'argent.
- Recalculez votre modèle de coût au prix catalogue. Tout double le 10 septembre. Si la charge de travail n'est rentable qu'au tarif promotionnel, vous avez un problème à résoudre maintenant plutôt que dans deux semaines.
Suivre l'utilisation réelle des jetons signifie capturer les réponses réelles, car l'objet usage de chaque complétion contient les comptes de jetons d'entrée, de sortie et mis en cache dont vous avez besoin. L'exécution de vos appels représentatifs en tant que collection enregistrée dans Apidog, avec l'ID du modèle comme variable d'environnement, vous donne ces chiffres par requête et vous permet de réexécuter la même suite contre GLM-5.3 pour comparer les factures plutôt que le marketing.
FAQ
GLM-5.3-Flash est-il gratuit ? Non. Il a été gratuit pendant environ une semaine alors qu'il fonctionnait anonymement sous le nom de "ox-alpha" avant son lancement, mais cela a pris fin à l'annonce. La réduction actuelle de 50 % n'est pas la même chose que gratuit.
Quand exactement la réduction se termine-t-elle ? Le 9 septembre 2026. Le prix catalogue s'applique à partir de cette date.
Pourquoi différents sites citent-ils des prix différents ? Certains citent le tarif promotionnel, d'autres le prix catalogue, et les revendeurs fixent leurs propres marges. Vérifiez toujours le fournisseur que vous appelez réellement.
L'entrée d'image coûte-t-elle plus cher ? Les images consomment des jetons de contexte et sont facturées comme des entrées. Il n'y a pas de supplément d'image séparé, mais une image haute résolution consomme un nombre significatif de jetons.
Est-il moins cher de s'auto-héberger ? Seulement à très grand volume soutenu, ou sur du matériel que vous possédez déjà en utilisant une version quantifiée. À 0,15 $ par million de jetons d'entrée, louer un nœud H200 avec 8 GPU est difficile à justifier par le seul coût.
