GLM-5.3 est un grand modèle linguistique lancé le 14 août 2026 par Zhipu AI, le laboratoire chinois qui opère internationalement sous le nom de Z.ai. Il s'agit d'une mise à niveau post-entraînement du modèle de base GLM-5, spécifiquement destiné au codage et aux tâches d'agent, et Zhipu prévoit de publier ses poids ouverts sur Hugging Face environ deux semaines après le lancement. Lors des évaluations internes de Zhipu, la capacité de codage a été améliorée de 50 % par rapport à GLM-5.2.
Cette combinaison explique pourquoi cette version est importante : un laboratoire que Seeking Alpha décrit comme un "challenger chinois d'OpenAI" propose un modèle de codage qui, selon eux, "approche Claude Fable 5", puis distribue les poids. Cela intervient un jour après la dernière version de DeepSeek, que nous avons couverte dans notre guide API DeepSeek V4 Pro, de sorte que la course aux modèles ouverts en Chine s'accélère désormais à un rythme hebdomadaire.
Cet article explique ce qu'est GLM-5.3, ce que disent les benchmarks (et lesquels proviennent des propres tests de Zhipu), comment fonctionne le plan de poids ouverts, et comment envoyer votre première requête. Vous pouvez tester cette requête dans Apidog sans écrire de code.
En bref
- GLM-5.3 a été lancé le 14 août 2026 par Zhipu AI (Z.ai). Même modèle de base GLM-5 ; tous les gains proviennent d'un post-entraînement à grande échelle.
- Le score Terminal-Bench 3.0 est passé de 4.6 à 28.3, une amélioration de 6.2x, le classant premier parmi les modèles open-source. Il se classe également premier parmi les modèles ouverts sur Agents’ Last Exam.
- CyberGym : 84.5 %, légèrement au-dessus de Claude Mythos 5 et GPT-5.6 Sol. ExploitBench : 54.4 %, toujours derrière les modèles de pointe.
- Les poids ouverts arrivent sur Hugging Face vers le 28 août 2026, après ce que Zhipu qualifie de son examen des risques le plus approfondi à ce jour.
- Architecture de la famille GLM-5 selon les documents officiels : Mixture of Experts, 744B paramètres totaux, environ 40B actifs par passe avant, fenêtre de contexte de 200K.
- L'API est compatible OpenAI à
https://api.z.ai/api/paas/v4/chat/completions. Aucun prix spécifique à la version 5.3 n'a été publié au lancement.
Qu'est-ce que GLM-5.3
GLM-5.3 est la troisième version ponctuelle de la famille GLM-5, et la plus ciblée. Zhipu n'a pas ré-entraîné le modèle fondamental. Les documents officiels décrivent la base GLM-5 comme un modèle Mixture of Experts avec 744 milliards de paramètres au total, environ 40 milliards activés par passe avant, et une fenêtre de contexte de 200K tokens ; ces spécifications restent inchangées. Ce qui a changé, c'est tout ce qui se trouve au-dessus : les gains proviennent entièrement d'un post-entraînement à grande échelle appliqué aux mêmes poids de base.

Ce détail est plus important qu'il n'y paraît. Lorsqu'un laboratoire améliore autant un modèle sans toucher à la base, le pipeline de post-entraînement lui-même est le produit. Zhipu revendique une amélioration de 50 % du codage par rapport à GLM-5.2, et les charges de travail ciblées sont spécifiques : tâches d'agent pilotées par terminal, ingénierie logicielle à long terme et analyse de sécurité. Il ne s'agit pas d'une mise à jour générale du chat.
En résumé : GLM-5.3 est le modèle que vous évalueriez si vous souhaitez un comportement de codage autonome performant avec une économie de modèle ouvert, et la possibilité de l'exécuter sur votre propre matériel une fois que les poids sont disponibles.
Benchmarks GLM-5.3 : les chiffres et leurs sources
La couverture du lancement par BigGo Finance et Pandaily a rapporté les résultats suivants. Prenez la colonne "Source" au sérieux : certains chiffres proviennent de classements publics, d'autres des propres évaluations de Zhipu, et ce ne sont pas le même type de preuves.
| Benchmark | Résultat GLM-5.3 | Contexte | Source |
|---|---|---|---|
| Terminal-Bench 3.0 | 28.3 (en hausse de 4.6) | Saut de 6.2x ; premier parmi les modèles open-source | Rapport de lancement |
| Agents’ Last Exam | Premier parmi les modèles open-source | Score non divulgué au lancement | Rapport de lancement |
| CyberGym | 84.5% | Légèrement au-dessus de Claude Mythos 5 et GPT-5.6 Sol | Rapport de lancement |
| ExploitBench | 54.4% | En deçà des modèles de pointe | Rapport de lancement |
| SWE-Marathon | Environ 2x GLM-5.2 | Ingénierie logicielle à long terme | Interne Zhipu |
| Capacité de codage (agrégat) | +50% vs GLM-5.2 | Principale revendication de Zhipu | Interne Zhipu |
Deux lectures sont justes. La lecture généreuse : un saut de 4.6 à 28.3 sur Terminal-Bench 3.0 n'est pas anodin. Les benchmarks de terminal mesurent si un modèle peut enchaîner des commandes shell, lire les sorties et récupérer des erreurs sur plusieurs étapes, et GLM-5.2 était faible dans ce domaine. Passer de presque dernier à premier parmi les modèles ouverts en une seule version ponctuelle change le modèle que vous choisirez pour les pipelines d'agents.
La lecture sceptique : les deux affirmations les plus citables, le gain de 50 % en codage et le score doublé de SWE-Marathon, sont des chiffres internes à Zhipu sans banc d'essai public pour les reproduire. Cela ne les rend pas faux, mais ils restent invérifiés jusqu'à ce que les poids soient disponibles et que des évaluateurs indépendants réexécutent les suites.
Ce que signifie "approcher Claude Fable 5" en pratique
Le propre cadre de Zhipu est que les capacités de codage et d'agent de GLM-5.3 "approchent Claude Fable 5". Cette phrase fait un travail minutieux.
Où l'affirmation est vérifiée : du côté des agents et des terminaux, les chiffres rapportés sont proches du territoire des modèles de pointe. La première place parmi les modèles open-source sur Terminal-Bench 3.0 et Agents' Last Exam signifie que GLM-5.3 a dépassé tous les concurrents ouverts sur les tâches importantes pour les agents de codage autonomes. Le résultat de 84,5 % sur CyberGym dépasse même Claude Mythos 5 et GPT-5.6 Sol, bien que la marge soit suffisamment faible pour que la variance d'exécution puisse en être la cause.
Là où ce n'est pas le cas : ExploitBench, à 54,4 %, reste clairement derrière les modèles de pointe. Le développement d'exploits met l'accent sur un raisonnement multi-étapes approfondi en situation d'ambiguïté, et l'écart à ce niveau suggère que les modèles de pointe conservent encore un avantage sur les tâches les plus difficiles nécessitant un raisonnement complexe. "Approcher" est le mot juste. Ce n'est pas "égaler", et Zhipu, à son crédit, n'a pas dit égaler.
La traduction pratique pour votre stack : GLM-5.3 vaut la peine d'être comparé directement pour les agents de terminal, l'automatisation CI et les tâches de codage à l'échelle du dépôt. Pour les problèmes de raisonnement les plus difficiles, les modèles fermés de pointe conservent probablement l'avantage pour l'instant. Si vous voulez avoir une idée de la façon dont les modèles de pointe se distinguent sur ces mêmes axes, notre comparaison Grok 4.6 vs GPT-5.6 vs Claude Fable 5 passe en revue les mêmes catégories de benchmarks avec des exemples concrets.
Le plan de poids ouverts : ~28 août sur Hugging Face
Le détail de la version ayant la plus longue durée de vie n'est pas un benchmark. Zhipu s'est engagé à publier les poids ouverts de GLM-5.3 environ deux semaines après le lancement, ce qui place la publication vers le 28 août 2026, sur l'organisation zai-org Hugging Face où se trouvent les précédentes versions ouvertes de l'entreprise.
L'écart de deux semaines est délibéré. Zhipu affirme avoir mis en place son système d'examen des risques le plus approfondi à ce jour pour cette version, et les benchmarks de sécurité expliquent pourquoi : un modèle obtenant un score de 84,5 % sur CyberGym possède des capacités significatives en matière de sécurité offensive, et la publication publique de ces poids est une décision différente de leur mise à disposition via une API surveillée. La période d'examen est le coût de la publication ouverte.
Ce que cette publication signifie pour vous dépend de votre matériel. L'inférence en pleine précision sur un MoE de 744 milliards de paramètres est du ressort d'un serveur, même avec seulement ~40 milliards de paramètres actifs par jeton, de sorte que la plupart des équipes attendront les variantes quantifiées de la communauté. Si vous prévoyez de l'exécuter localement, notre guide sur l'auto-hébergement de GLM-5.3 couvre le dimensionnement, les piles de services et l'établissement d'une référence par rapport à l'API hébergée avant l'arrivée des poids.
Comment GLM-5.3 s'intègre dans le paysage des modèles ouverts
La comparaison évidente est DeepSeek. Les deux laboratoires sont chinois, les deux publient des poids ouverts, les deux pratiquent des prix agressifs, et les deux ont été lancés à moins de 24 heures d'intervalle. La différence est l'orientation : la ligne V4 Pro de DeepSeek est un modèle généraliste phare, tandis que GLM-5.3 est un pari spécialisé sur le fait que les agents de codage sont la charge de travail à conquérir. Si votre trafic est principalement du codage agentique, cette spécialisation est l'argument pour tester GLM-5.3 en premier.
L'économie façonne le reste du tableau. La récente augmentation de prix de DeepSeek, que nous avons analysée dans notre guide d'optimisation des coûts de l'API DeepSeek, a montré la rapidité avec laquelle la tarification des API de modèles ouverts peut évoluer, et a poussé davantage d'équipes vers l'auto-hébergement comme couverture. Un GLM-5.3 à poids ouverts qui domine Terminal-Bench offre à ces équipes une autre option crédible. Zhipu n'avait pas publié de tarification API spécifique à la version 5.3 au lancement ; à titre de référence, la page de tarification officielle indiquait pour GLM-5.2 1,4 $ par million de tokens d'entrée et 4,4 $ par million de tokens de sortie à la date de rédaction, il faut donc s'attendre à ce que le chiffre pour la version 5.3 se situe dans cet ordre de grandeur, et vérifier la page avant de budgétiser.
Le contexte de l'écosystème ouvert est également important. Une fois que des variantes quantifiées existeront, GLM-5.3 rejoindra le pool de modèles que vous pourrez exécuter sans aucune dépendance API. Notre tour d'horizon des meilleurs LLM locaux en 2026 couvre la position des leaders ouverts actuels ; un nouvel entrant en tête de Terminal-Bench va remanier cette liste.
Les quotas du plan de codage GLM ont été réinitialisés
Un détail du jour du lancement qui affecte directement les utilisateurs existants : Zhipu a réinitialisé les quotas du plan de codage GLM pour tous les utilisateurs le 14 août. Si vous êtes abonné au plan de codage via Z.ai, votre allocation a été renouvelée le jour du lancement, une invitation ouverte à utiliser ce quota pour essayer la version 5.3.
Le plan de codage est l'offre à tarif forfaitaire de Zhipu pour les outils de codage, distincte de l'accès à l'API par jeton, et la réinitialisation s'applique uniquement au plan, et non à la facturation de l'API. Les utilisateurs de Chine continentale bénéficient du même écosystème via open.bigmodel.cn, avec ses propres plans et facturation.
Essayez l'API en cinq minutes
L'API de Z.ai est compatible OpenAI, de sorte que la structure de la requête vous sera familière si vous avez déjà appelé une API LLM majeure. Le point de terminaison international est https://api.z.ai/api/paas/v4/chat/completions ; la Chine continentale utilise https://open.bigmodel.cn/api/paas/v4/chat/completions. L'authentification se fait par un jeton Bearer. Une mise en garde : au lancement, les documents officiels indiquent toujours glm-5 comme ID de modèle documenté, donc l'ID glm-5.3 ci-dessous suit la convention de la famille GLM-5. Confirmez la chaîne exacte sur la page de documentation du modèle avant de déployer quoi que ce soit.
export GLM_API_KEY="votre-clé-de-z.ai"
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Écrivez un script bash qui trouve les cinq fichiers les plus volumineux dans un dépôt git, en excluant le répertoire .git."
}
],
"temperature": 0.6,
"max_tokens": 1024
}'
La réponse suit le schéma OpenAI : un tableau choices avec le contenu du message, plus un bloc usage avec les comptes de tokens.
Une boucle plus rapide que l'édition de chaînes cURL : importez la requête dans Apidog, stockez GLM_API_KEY comme variable d'environnement, et créez deux environnements, un pour le point de terminaison Z.ai et un pour bigmodel.cn. Changer de région ou d'ID de modèle devient une sélection dans une liste déroulante au lieu d'une édition, et les réponses sauvegardées deviennent une base de référence de régression pour le jour où les poids ouverts seront disponibles.
Pour la démonstration complète, y compris les clients Python et Node.js, le streaming et la gestion des erreurs, consultez le guide de démarrage rapide de l'API GLM-5.3.
FAQ
GLM-5.3 est-il open source ?
Pas encore, mais ses poids seront ouverts. Zhipu s'est engagé à publier les poids sur Hugging Face vers le 28 août 2026, environ deux semaines après le lancement de l'API, suite à un examen des risques que l'entreprise décrit comme le plus approfondi à ce jour. D'ici là, le seul accès se fait via l'API hébergée.
En quoi GLM-5.3 est-il différent de GLM-5.2 ?
Le modèle de base est identique. Toutes les améliorations proviennent d'un post-entraînement à grande échelle : Zhipu rapporte un gain de 50 % en capacité de codage lors des évaluations internes, un saut du score Terminal-Bench 3.0 de 4.6 à 28.3, et un score SWE-Marathon environ doublé. La fenêtre de contexte, le nombre de paramètres et l'architecture sont inchangés par rapport à la base de la famille GLM-5.
Combien coûte GLM-5.3 ?
Zhipu n'avait pas publié de tarification API spécifique à la version 5.3 au moment du lancement. La page de tarification officielle indiquait pour GLM-5.2 un coût de 1,4 $ par million de tokens d'entrée et de 4,4 $ par million de tokens de sortie, ce qui constitue la meilleure référence disponible. Vérifiez la page de tarification en direct avant de vous engager sur un budget, et si le coût est votre principale contrainte, notre guide sur l'optimisation des coûts API après l'augmentation de prix de DeepSeek couvre les tactiques applicables à toute API par jeton.
Puis-je exécuter GLM-5.3 sur mon propre matériel ?
Après la publication des poids, oui, avec des réserves. La famille GLM-5 est un modèle Mixture of Experts de 744 milliards de paramètres avec environ 40 milliards de paramètres actifs par passe avant, donc une diffusion en pleine précision nécessite du matériel serveur multi-GPU. Les versions communautaires quantifiées abaisseront la barre ; consultez le guide de préparation à l'auto-hébergement pour un dimensionnement réaliste.
GLM-5.3 est-il meilleur que Claude ou GPT pour le codage ?
Sur les benchmarks d'agent et de terminal rapportés, il est compétitif, se classant premier parmi les modèles ouverts sur Terminal-Bench 3.0 et dépassant légèrement Claude Mythos 5 et GPT-5.6 Sol sur CyberGym. Sur ExploitBench, il est en deçà des modèles de pointe à 54,4 %. La réponse honnête dépend de la charge de travail : exécutez votre propre ensemble d'évaluation contre les deux avant de basculer le trafic de production, de la même manière que vous testeriez toute API avant de l'adopter.
Où GLM-5.3 s'intègre dans votre stack
GLM-5.3 est une version spécialisée avec une proposition claire : des performances d'agent de codage quasi-frontières, des poids ouverts dans deux semaines, et une API compatible OpenAI vers laquelle vous pouvez dès aujourd'hui diriger votre code existant. L'historique des benchmarks est solide sur les tâches de terminal et d'agent, honnête concernant l'écart sur ExploitBench, et partiellement invérifié jusqu'à ce que des exécutions indépendantes soient disponibles après le 28 août. C'est un signal suffisant pour justifier une évaluation, mais pas encore suffisant pour justifier une migration.
La manière la moins coûteuse de commencer : envoyez la requête cURL ci-dessus, sauvegardez la réponse, et construisez une petite suite de prompts adaptée à vos charges de travail réelles. Téléchargez Apidog pour organiser cette suite, conservez les points de terminaison Z.ai et bigmodel.cn comme environnements commutables, et transformez les appels exploratoires d'aujourd'hui en la base de référence de régression que vous voudrez avoir lorsque les poids ouverts arriveront et que vous comparerez votre propre déploiement à l'API hébergée.
