Zhipu AI, le laboratoire chinois qui opère à l'international sous le nom Z.ai, a lancé GLM-5.3 le 14 août 2026, et les chiffres du codage racontent l'histoire. Des évaluations internes montrent une amélioration de 50 % de la capacité de codage par rapport à GLM-5.2, le score Terminal-Bench 3.0 est passé de 4,6 à 28,3, et Zhipu décrit la capacité de codage et d'agent du modèle comme « approchant Claude Fable 5 », selon le rapport de lancement de BigGo. Les poids ouverts suivront dans environ deux semaines. Pour la répartition complète des capacités et le tableau de référence, lisez ce qu'est GLM-5.3 ; cet article est le guide de démarrage rapide de l'API.
Voici ce que vous ferez : obtenir une clé API, effectuer un premier appel en cURL, le porter vers Python et Node.js via le SDK OpenAI, diffuser des jetons, ajuster les paramètres importants, et intégrer la boucle complète dans Apidog afin de verrouiller la forme de la requête avant d'écrire le code de l'application. La bonne nouvelle d'emblée : l'API de Z.ai est compatible avec OpenAI. Si vous avez déjà appelé un point de terminaison de style OpenAI, vous connaissez déjà la plupart de ces informations.
Une mise en garde avant le code. GLM-5.3 a été lancé aujourd'hui, et la documentation de Zhipu évolue rapidement les jours de lancement. Tout ce qui suit et qui provient directement de la documentation officielle lors de ma vérification est présenté comme vérifié ; tout ce que la documentation n'avait pas encore rattrapé est signalé comme convention de la famille GLM-5, avec un lien afin que vous puissiez confirmer l'état actuel par vous-même.
En bref
- GLM-5.3 lancé le 14 août 2026. Les évaluations internes de Zhipu signalent une amélioration de 50 % du codage par rapport à GLM-5.2 et un bond de Terminal-Bench 3.0 de 4,6 à 28,3. Il se classe premier parmi les modèles open source sur Terminal-Bench 3.0 et Agents’ Last Exam.
- L'API est compatible avec OpenAI. Point de terminaison international :
POST https://api.z.ai/api/paas/v4/chat/completionsavec l'en-têteAuthorization: Bearer $GLM_API_KEY. Chine continentale :https://open.bigmodel.cn/api/paas/v4/chat/completions. - Au moment de la rédaction, la page de documentation GLM-5 listait
glm-5comme ID de modèle. La page de tarification de Zhipu listeglm-5.2etglm-5.1comme modèles séparés, attendez-vous donc à ce queglm-5.3suive la même convention de points. Confirmez avant de coder en dur. - Zhipu n'avait pas publié de tarification API spécifique à la version 5.3 au lancement. À titre de comparaison, la page de tarification officielle listait GLM-5.2 à 1,40 $ par million de jetons d'entrée et 4,40 $ par million de jetons de sortie, et GLM-5 à 1,00 $ et 3,20 $.
- Les poids ouverts seront disponibles sur Hugging Face vers le 28 août 2026. Les quotas du plan de codage GLM ont été réinitialisés pour tous les utilisateurs le 14 août.
- Testez d'abord dans Apidog : un environnement par point de terminaison régional, l'ID du modèle derrière une variable, et des réponses enregistrées comme fixtures afin que l'itération des prompts ne facture pas de jetons.
Pourquoi GLM-5.3 est important
Le modèle de base n'a pas changé. Chaque gain de cette version provient d'un post-entraînement à grande échelle en plus de GLM-5, ce qui rend l'ampleur des sauts inhabituelle. Terminal-Bench 3.0 est passé de 4,6 à 28,3, un mouvement de 6,2x qui a fait passer GLM de l'insignifiance à la première place parmi les modèles open source sur ce benchmark et sur Agents’ Last Exam. SWE-Marathon a à peu près doublé par rapport à GLM-5.2. Côté sécurité, CyberGym a atteint 84,5 %, légèrement au-dessus de Claude Mythos 5 et GPT-5.6 Sol, tandis qu'ExploitBench a atterri à 54,4 %, toujours à la traîne des modèles de pointe. Attention à la source : la revendication de 50 % de codage et plusieurs de ces scores proviennent des propres évaluations de Zhipu, traitez-les donc comme un rapport de fournisseur jusqu'à ce que des tiers les reproduisent.

L'architecture sous-jacente est la ligne de base de la famille GLM-5 : une conception de Mélange d'Experts (Mixture of Experts) avec un total de 744 milliards de paramètres, environ 40 milliards actifs par passe avant, et une fenêtre de contexte de 200K jetons, selon la documentation de Z.ai. Ce sont des spécifications de famille, pas des affirmations spécifiques à la version 5.3.
Deux autres raisons pour lesquelles cette version est importante pour les utilisateurs d'API. Premièrement, Zhipu annonce la sortie des poids ouverts de GLM-5.3 environ deux semaines après le lancement, vers le 28 août, parallèlement à ce qu'il appelle son système d'examen des risques le plus complet à ce jour, selon la couverture de lancement de Pandaily. Si l'auto-hébergement est sur votre feuille de route, l'API que vous configurez aujourd'hui sert de référence de régression ; notre guide de préparation à l'auto-hébergement de GLM-5.3 couvre cette stratégie en détail. Deuxièmement, Seeking Alpha présente Zhipu comme le « challenger chinois d'OpenAI », et les sorties de poids ouverts à ce niveau de capacité ont tendance à faire bouger les prix sur l'ensemble du marché.
Obtenir une clé API
Il existe deux plateformes, divisées par région, et cette division s'applique à tout le reste de ce guide.
Z.ai (international). Inscrivez-vous sur z.ai, ouvrez la console API et créez une clé. La documentation se trouve sur docs.z.ai. C'est le chemin pour toute personne en dehors de la Chine continentale, et c'est le point de terminaison par défaut pour le reste de cet article.
Bigmodel.cn (Chine continentale). La plateforme nationale de Zhipu est open.bigmodel.cn. Même forme d'API, même schéma d'authentification, hôte différent et facturation séparée. Si votre trafic provient de Chine continentale, utilisez celle-ci ; la latence et la conformité y sont toutes deux favorables.
Quelle que soit la plateforme que vous choisissez, exportez la clé une fois et gardez-la hors de votre code :
export GLM_API_KEY="votre-clé-de-la-console"
Si vous utilisez le plan de codage GLM plutôt que la facturation API au fur et à mesure, notez que les quotas ont été réinitialisés pour tous les utilisateurs le 14 août, vous commencez donc l'ère 5.3 avec une allocation vierge.
Point de terminaison et authentification
Le point de terminaison de complétion de chat, vérifié par rapport à la documentation GLM-5 au moment de la rédaction :
POST https://api.z.ai/api/paas/v4/chat/completions
La Chine continentale change l'hôte :
POST https://open.bigmodel.cn/api/paas/v4/chat/completions
L'authentification se fait via un en-tête : Authorization: Bearer $GLM_API_KEY. Pas de signature, pas de handshake de session.
Compatible OpenAI signifie exactement ce que vous espérez. Le corps de la requête est la forme model plus le tableau messages, la réponse contient choices, message, finish_reason et usage, et les SDK OpenAI officiels fonctionnent sans modification une fois que vous pointez base_url vers Z.ai. Tout code que vous avez écrit pour un autre fournisseur compatible OpenAI se transfère avec un simple échange d'hôte et de modèle ; le modèle est le même que celui que nous avons exploré pour l'API de DeepSeek V4 Pro.
Une petite réserve honnête sur l'ID du modèle. Lorsque j'ai récupéré la documentation le jour du lancement, la page GLM-5 listait glm-5 comme chaîne de modèle et n'avait pas encore été mise à jour pour la version 5.3. La page de tarification de Zhipu facture glm-5.2 et glm-5.1 comme des modèles distincts, donc la convention familiale indique que le nouvel ID est glm-5.3. Les exemples ci-dessous l'utilisent, mais vérifiez la documentation avant de le fixer en production. Si glm-5.3 renvoie un 404 dans votre région, revenez à glm-5 et vous restez sur la même famille.
Votre première requête en cURL
Un appel complet et fonctionnel :
curl "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "system",
"content": "Vous êtes un réviseur de code. Signalez les problèmes comme bloquants ou non bloquants."
},
{
"role": "user",
"content": "Vérifiez ce script shell pour la sécurité :\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
}
],
"temperature": 0.3,
"max_tokens": 1024
}'
La réponse est de format OpenAI standard : un tableau choices où choices[0].message.content contient la réponse, et un bloc usage avec prompt_tokens et completion_tokens. Compte tenu de ce score Terminal-Bench, les invites de révision de script shell et de terminal comme celle-ci sont exactement là où la version 5.3 est censée s'être le plus améliorée, c'est donc un test de fumée approprié.
La documentation mentionne également un paramètre thinking qui active le mode de raisonnement du modèle :
"thinking": { "type": "enabled" }
Activez-le pour les tâches de codage et d'agent multi-étapes ; ignorez-le pour les appels d'extraction courts où les jetons de raisonnement sont des dépenses inutiles.
Démarrage rapide avec Python
Pas de nouveau SDK à apprendre. Installez le package OpenAI et changez l'URL de base :
pip install --upgrade openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GLM_API_KEY"],
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[
{
"role": "system",
"content": "Vous êtes un réviseur de code. Signalez les problèmes comme bloquants ou non bloquants.",
},
{
"role": "user",
"content": (
"Vérifiez cette route Flask pour les problèmes de sécurité :\n\n"
"@app.route('/user/<id>')\n"
"def get_user(id):\n"
" return db.execute(f'SELECT * FROM users WHERE id = {id}')"
),
},
],
temperature=0.3,
max_tokens=2048,
)
print(response.choices[0].message.content)
print("jetons d'entrée:", response.usage.prompt_tokens)
print("jetons de sortie:", response.usage.completion_tokens)
Consignez ce bloc usage dès le premier jour. Sans tarification spécifique à la version 5.3 publiée au lancement, vos décomptes de jetons sont le seul moyen de prévoir ce que votre facture deviendra une fois les chiffres officiels apparus.
Démarrage rapide avec Node.js
Même démarche avec le package npm openai :
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.GLM_API_KEY,
baseURL: "https://api.z.ai/api/paas/v4",
});
const response = await client.chat.completions.create({
model: "glm-5.3",
messages: [
{
role: "system",
content: "Vous êtes un agent d'automatisation de terminal. Renvoyez chaque étape comme une commande shell avec une justification en une ligne.",
},
{
role": "user",
content: "Un service Node sur le port 3000 a cessé de répondre après un déploiement. Donnez-moi une séquence de diagnostic.",
},
],
temperature: 0.3,
max_tokens: 2048,
});
console.log(response.choices[0].message.content);
Si votre base de code communique déjà avec OpenAI, vous n'avez pas besoin d'un client parallèle. Instanciez une deuxième instance OpenAI avec la baseURL de Z.ai et routez les requêtes par tâche. Cela fait de la comparaison A/B entre GLM-5.3 et votre modèle actuel une décision de routage plutôt qu'une réécriture.
Streaming
La documentation confirme la prise en charge du streaming via le drapeau standard stream. En Python :
stream = client.chat.completions.create(
model="glm-5.3",
messages=[
{"role": "user", "content": "Expliquez le problème de requête N+1 avec un exemple ORM concret."}
],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
En HTTP pur, définissez "stream": true dans le corps et analysez les événements envoyés par le serveur ; chaque ligne data: contient un delta au format de bloc d'OpenAI. Deux remarques pratiques. L'utilisation des jetons arrive au moment ou après le dernier bloc, donc le calcul n'est précis qu'une fois le flux fermé. Et si vous activez thinking, attendez-vous à une pause plus longue avant le premier jeton visible sur les invites difficiles ; le modèle dépense des jetons à raisonner avant de répondre, ce qui est le compromis pour lequel vous avez opté.
Paramètres importants
Les paramètres couverts par la documentation, par ordre de fréquence d'utilisation :
| Paramètre | Type | Ce qu'il fait |
|---|---|---|
max_tokens |
entier | Plafonnement strict de la longueur de sortie. Votre principal levier de coût. |
temperature |
nombre | Utilisez 0,2 à 0,4 pour le code et l'extraction, 0,7+ pour l'écriture ouverte. |
thinking |
objet | {"type": "enabled"} active le mode de raisonnement pour les tâches multi-étapes. |
stream |
booléen | Événements envoyés par le serveur au lieu d'un corps de réponse unique. |
messages |
tableau | Rôles OpenAI standard : system, user, assistant. |
Concernant le coût : Zhipu n'avait pas publié de tarification API spécifique à la version 5.3 au lancement, alors résistez à tout chiffre par jeton que vous voyez sur les pages des revendeurs. La page de tarification officielle est la source de vérité ; au moment de la rédaction, elle listait GLM-5.2 à 1,40 $ en entrée et 4,40 $ en sortie par million de jetons, et GLM-5 à 1,00 $ et 3,20 $, ce qui donne une fourchette plausible pour la version 5.3. L'entrée en cache sur les modèles GLM payants bénéficie d'une réduction de 80 à 85 %, structurez donc les invites système répétées pour utiliser le cache. Si un fournisseur vous a déjà surpris par un changement de prix, vous savez pourquoi cette discipline est importante ; notre autopsie de l'augmentation de prix de DeepSeek couvre les modèles de contrôle des coûts qui se transfèrent directement.
Testez GLM-5.3 dans Apidog avant d'écrire le code de l'application
L'itération des prompts au sein d'un script est une boucle lente : modifier, réexécuter, faire défiler, répéter, et chaque cycle facture des jetons. Parce que l'API de Z.ai est compatible avec OpenAI, un client API peut absorber toute la phase d'exploration.
La configuration dans Apidog :
- Créez un projet et ajoutez la requête de complétion de chat. Importez n'importe quelle spécification compatible OpenAI ou définissez manuellement le point de terminaison unique
POST /chat/completions; le corps est la forme familièremodelplusmessages. - Créez deux environnements :
zai-internationaletbigmodel-mainland. Définissez l'URL de base dans chacun (https://api.z.ai/api/paas/v4ethttps://open.bigmodel.cn/api/paas/v4) et liezAuthorization: Bearer {{GLM_API_KEY}}au niveau de l'environnement. Changer de région devient un clic de menu déroulant, et la clé n'apparaît jamais dans une requête enregistrée. - Placez l'ID du modèle derrière une variable définie à
glm-5.3. Lors de la semaine de lancement, cela compte plus que d'habitude : si l'ID change au fur et à mesure que la documentation s'établit, ou si vous souhaitez faire un A/B testing avecglm-5.2, vous ne changez qu'une seule variable au lieu de modifier chaque requête enregistrée. - Testez le commutateur
thinkingcôte à côte. Dupliquez la requête, activez le raisonnement sur une copie et comparez la latence, la qualité de la sortie et l'usagesur la même invite. C'est le moyen le plus rapide de décider quelles charges de travail méritent des jetons de raisonnement. - Appelez le point de terminaison de streaming. Les blocs SSE s'affichent en direct, vous voyez donc le temps avant le premier jeton, comme vos utilisateurs le verront.
- Enregistrez les bonnes réponses comme exemples. Les exécutions ultérieures utiliseront la fixture au lieu de l'API en direct, ce qui est le plus grand économiseur de jetons pendant le développement.
À partir de là, enchaînez les requêtes enregistrées dans des scénarios de test avec des assertions sur finish_reason, le schéma de réponse et le nombre de jetons, et vous aurez transformé les tests de fumée en suite de régression. Le même flux de travail, généralisé à toute API, se trouve dans notre guide de test d'API pour les ingénieurs QA.
Gestion des erreurs et limites de débit
Attendez-vous à des erreurs de type OpenAI standard : un objet error avec un message, un type et un code. Les coupables habituels sont 401 pour une clé manquante ou révoquée, 400 pour un corps mal formé ou un ID de modèle inconnu, 429 pour les limites de débit et 5xx pour les défaillances transitoires du serveur.
Trois habitudes pour une API le jour du lancement :
- Enveloppez chaque appel dans une fonction de nouvelle tentative avec un backoff exponentiel jitteré sur les erreurs 429 et 5xx. Les lancements de nouveaux modèles concentrent le trafic, et la capacité du premier jour est le moment où vous rencontrerez des 429.
- N'inventez pas de chiffres de limite de débit. Zhipu publie les détails de la concurrence et des niveaux dans la documentation officielle ; lisez les valeurs actuelles là-bas plutôt que de faire confiance à un article de blog, y compris celui-ci, pour rester à jour.
- Épinglez l'ID du modèle derrière la configuration. Si un changement de comportement de la version 5.3 brise une invite, revenir à
glm-5.2devrait être un changement de configuration, pas un déploiement. Le flux de travail de débogage que nous avons construit pour l'API de Grok s'applique ici sans changement, puisque les deux parlent le dialecte OpenAI.
FAQ
Quel est l'ID du modèle pour l'API GLM-5.3 ?
Attendez-vous à glm-5.3, suivant la convention familiale qui nous donne glm-5.2 et glm-5.1 sur la page de tarification de Zhipu. Au moment de la rédaction, la documentation listait toujours glm-5 sur la page du modèle, alors confirmez sur docs.z.ai avant de le fixer, et gardez l'ID dans la configuration pour qu'une correction soit peu coûteuse.
L'API GLM-5.3 fonctionne-t-elle avec le SDK OpenAI ?
Oui. L'API est compatible avec OpenAI, donc les packages officiels openai pour Python et Node.js fonctionnent une fois que vous avez défini base_url sur https://api.z.ai/api/paas/v4 (ou l'équivalent bigmodel.cn) et que vous avez transmis votre clé Z.ai. Les formes des requêtes et des réponses correspondent au standard des complétions de chat, y compris le streaming.
Combien coûte l'API GLM-5.3 ?
Zhipu n'avait pas publié de tarification spécifique à la version 5.3 lors de son lancement le 14 août 2026. La page de tarification officielle listait GLM-5.2 à 1,40 $ par million de jetons d'entrée et 4,40 $ par million de jetons de sortie, ce qui est votre meilleur point de référence jusqu'à ce que la ligne 5.3 apparaisse. Ignorez les estimations de prix des revendeurs.
Comment GLM-5.3 se compare-t-il à Claude et GPT ?
Les propres évaluations de Zhipu situent la capacité de codage et d'agent « approchant Claude Fable 5 », avec CyberGym à 84,5 % légèrement au-dessus de Claude Mythos 5 et GPT-5.6 Sol, mais ExploitBench à 54,4 % toujours derrière les modèles de pointe. Traitez les chiffres des fournisseurs comme des affirmations jusqu'à ce qu'ils soient reproduits indépendamment ; pour savoir comment nous comparons les modèles de pointe entre eux, consultez notre comparaison Grok 4.6 vs GPT-5.6 vs Claude Fable 5.
Puis-je exécuter GLM-5.3 localement au lieu d'utiliser l'API ?
Pas encore. Zhipu indique que les poids ouverts arriveront environ deux semaines après la sortie, vers le 28 août 2026, sur son organisation Hugging Face. La conception MoE de 744 milliards de paramètres signifie que le service local est un travail de classe serveur, pas un travail d'ordinateur portable ; utilisez l'API hébergée maintenant et construisez la référence que vous comparerez à un déploiement auto-hébergé plus tard.
Où GLM-5.3 s'intègre dans votre stack
GLM-5.3 vaut bien une après-midi d'évaluation si vous exécutez des boucles d'agents ou des charges de travail de codage, et l'interface compatible OpenAI rend cette après-midi peu coûteuse. Les bonds de Terminal-Bench et SWE-Marathon sont rapportés par le fournisseur, mais un mouvement de 6,2x est suffisamment important pour que vous le vérifiiez vous-même, et le délai de deux semaines avant les poids ouverts signifie que les requêtes que vous enregistrez aujourd'hui deviennent la référence de régression pour un déploiement auto-hébergé ultérieurement.
La séquence logique : obtenez une clé, exécutez l'appel cURL, et déplacez la requête dans un client API avant de toucher au code de l'application. Téléchargez Apidog pour configurer les deux environnements régionaux, placez l'ID du modèle derrière une variable, et comparez le mode thinking activé et désactivé avec vos prompts réels. Une fois que les réponses semblent correctes, le portage Python ou Node n'est qu'une URL de base et une variable d'environnement, car le format de câblage n'a jamais été la partie difficile.
bouton
