GLM-5.2 est le dernier modèle phare de Z.ai (le laboratoire Zhipu AI), et il est arrivé avec une proposition claire : des poids ouverts, une priorité au codage, et une compétitivité avec les plus grands modèles frontières fermés. Si vous avez entendu ce nom et que vous voulez une réponse directe à la question « qu'est-ce que GLM-5.2 », ceci est l'explication de référence. Nous aborderons qui le fabrique, ce qu'il est réellement sous le capot, comment y accéder, et quelles sont les réserves honnêtes.
TL;DR
- Ce que c'est : GLM-5.2 est un grand modèle linguistique à poids ouverts de Z.ai, conçu pour le codage, le raisonnement et l'utilisation d'outils agentiques.
- Taille : Environ 753 milliards de paramètres dans une architecture Mixture-of-Experts (MoE), en BF16, avec une nouvelle astuce d'attention creuse « IndexShare » pour réduire le coût des contextes longs.
- Contexte : 1 million de tokens (1 048 576). La sortie maximale est indiquée comme pouvant atteindre 128K selon la documentation de z.ai (à vérifier en direct, car tous les hébergeurs n'indiquent pas le même plafond).
- Licence : MIT, poids ouverts. Vous pouvez le télécharger, l'auto-héberger, le fine-tuner et le commercialiser.
- Benchmark principal : Terminal-Bench 2.1 est passé de 62.0 pour GLM-5.1 à 81.0, selon les résultats publiés par Z.ai. SWE-bench Pro se situe à 62.1.
- Accès : API Z.ai, Claude Code via le GLM Coding Plan, OpenRouter et Ollama.
- Mise en garde : C'est du texte en entrée, du texte en sortie. Il n'y a pas de variante visuelle confirmée. Ne vous attendez pas à une entrée d'image.
Qui fabrique GLM-5.2, et qu'est-ce que c'est
GLM-5.2 provient de Z.ai, le laboratoire également connu sous le nom de Zhipu AI. C'est la dernière entrée dans la famille GLM (« General Language Model »), après la sortie de GLM-5.1. Le positionnement est explicite : il s'agit d'un modèle phare pour le codage qui livre ses poids ouvertement plutôt que de se cacher derrière un mur uniquement API.

Cette position de poids ouverts est le cœur de l'histoire ici. La plupart des modèles qui rivalisent avec GPT-5.5 ou Claude Opus 4.8 sont fermés. GLM-5.2 offre des capacités comparables dans un fichier que vous pouvez télécharger. Si vous avez lu notre aperçu de GLM-5.1, considérez le 5.2 comme la même lignée avec une orientation plus marquée vers le codage et les capacités agentiques.
GLM-5.2 est un modèle à usage général avec un biais pour le codage. Il gère le raisonnement, les mathématiques et le texte multilingue (l'anglais et le chinois sont de premier ordre), mais Z.ai l'a entraîné le plus intensément pour l'ingénierie logicielle et le travail d'agent multi-étapes axé sur les outils.
Identité : comment trouver GLM-5.2 sur différentes plateformes
Une chose qui déroute les gens avec les modèles ouverts est la nomenclature. Le même modèle porte des identifiants différents selon l'endroit où vous le chargez. Voici la carte.
| Plateforme | Identifiant |
|---|---|
| Hugging Face | zai-org/GLM-5.2 |
| API Z.ai | glm-5.2 |
| Ollama | glm-5.2 |
| OpenRouter | z-ai/glm-5.2 |
Les poids sont sous licence MIT sans restrictions régionales, de sorte que le dépôt Hugging Face est véritablement téléchargeable et non restreint. Vous pouvez confirmer la fiche et les fichiers sur la page GLM-5.2 sur Hugging Face.
Architecture en termes simples : 753B MoE + IndexShare
GLM-5.2 est un modèle Mixture-of-Experts avec environ 753 milliards de paramètres au total, servi en BF16. MoE signifie que le modèle est divisé en de nombreux sous-réseaux « experts », et seule une fraction d'entre eux s'active pour chaque token donné. Vous obtenez la capacité de connaissance d'un modèle énorme sans payer la totalité de la facture de calcul à chaque passe avant. C'est ainsi qu'un modèle de 753 milliards de paramètres reste utilisable.

La nouveauté est l'attention creuse. GLM-5.2 introduit une méthode que Z.ai appelle IndexShare. L'attention normale devient rapidement coûteuse à mesure que votre contexte s'agrandit, car chaque token s'attache à tous les autres tokens. IndexShare réutilise un seul « indexeur » sur chaque groupe de 4 couches d'attention creuse, au lieu d'en calculer un nouveau par couche. En pratique, cela réduit le coût de l'attention sur des contextes longs, ce qui est exactement ce que vous voulez lorsque votre fenêtre est d'un million de tokens.
Vous n'avez pas besoin de comprendre les mathématiques pour en bénéficier. La leçon à retenir : GLM-5.2 est conçu de manière à ce que lui fournir une grande base de code ou un long document n'augmente pas votre latence et vos coûts comme le ferait un modèle dense.
Une fenêtre de contexte de 1 million de tokens
GLM-5.2 prend en charge une fenêtre de contexte de 1 million de tokens (1 048 576 tokens, pour être exact). Cela suffit pour insérer un référentiel de taille moyenne, une longue spécification ou une pile de documents connexes dans une seule invite et demander au modèle de raisonner sur l'ensemble.
La sortie maximale est l'endroit où vous devez être prudent. La documentation de z.ai indique une sortie allant jusqu'à 128K tokens, mais tous les hébergeurs ne publient pas le même nombre, et OpenRouter ne le liste pas du tout. Considérez donc 128K comme le plafond documenté à vérifier en direct plutôt qu'une garantie sur chaque endpoint. Si votre flux de travail dépend de très longues générations, vérifiez la limite chez le fournisseur spécifique que vous utilisez.
Pour comprendre comment cette génération a fait évoluer les choses, notre comparaison GLM-5.2 vs GLM-5.1 détaille ce qui a changé d'une version à l'autre.
Effort de réflexion : Élevé, Maximum, et désactivation
GLM-5.2 est un modèle capable de raisonnement avec un comportement de « réflexion » contrôlable. Vous disposez de deux niveaux d'effort de réflexion :
- Élevé (High), un raisonnement solide avec un coût de calcul plus léger.
- Maximum (Max), le raisonnement le plus profond. Z.ai recommande spécifiquement Maximum pour les tâches de codage.
Vous pouvez également désactiver complètement la réflexion. Pour des recherches rapides, des formatages ou des transformations simples, vous ne voulez pas que le modèle consomme des tokens pour une chaîne de pensée interne. Désactiver la réflexion rend ces appels rapides et peu coûteux.
Dans l'API, cela correspond à un paramètre `thinking` (`{"type": "enabled"}` ou `{"type": "disabled"}`) et à une valeur `reasoning_effort` telle que `"max"`. Nous approfondissons la forme de la requête dans le guide de l'API GLM-5.2, mais le modèle mental est simple : augmentez le raisonnement pour les travaux d'ingénierie difficiles, désactivez-le pour les appels triviaux.
Licence MIT et poids ouverts : ce que cela vous apporte réellement
Le terme « poids ouverts » est souvent utilisé à la légère, voici donc ce que la licence MIT de GLM-5.2 permet concrètement :
- Auto-hébergement. Exécutez-le sur votre propre matériel ou un GPU loué. Rien ne quitte votre réseau.
- Fine-tuning. Adaptez-le à votre domaine, à vos conventions de base de code ou à une tâche spécialisée.
- Usage commercial. La licence MIT est permissive. Vous pouvez développer des produits basés dessus sans qu'une licence restrictive ne pèse sur vous.
- Pas de verrouillage régional. Les poids ne sont pas soumis à une vérification régionale.
Pour les équipes soumises à des contraintes de résidence des données ou de conformité, cela est plus important qu'un ou deux points de benchmark. Vous pouvez garder les invites et le code en interne. Si vous voulez essayer la voie entièrement locale, consultez exécuter GLM-5 localement gratuitement et GLM-5 gratuitement avec Ollama pour les modèles, qui s'appliquent également au 5.2.
Priorité au codage et agentique : les benchmarks
Z.ai a construit GLM-5.2 pour effectuer un véritable travail logiciel, pas seulement en parler. L'histoire des benchmarks est centrée sur le codage et l'utilisation d'outils agentiques. Les chiffres ci-dessous sont les résultats publiés par Z.ai, il faut donc les interpréter comme les propres mesures du laboratoire plutôt que des scores indépendants de tiers.
| Benchmark | GLM-5.2 | Comparaison notable |
|---|---|---|
| Terminal-Bench 2.1 | 81.0 | GLM-5.1 a obtenu 62.0 |
| SWE-bench Pro | 62.1 | GPT-5.5 58.6, GLM-5.1 58.4 |
| MCP-Atlas | 77.0 | GPT-5.5 75.3, Claude Opus 4.8 77.8 |
| Humanity’s Last Exam (avec outils) | 54.7 | GPT-5.5 52.2 |
| AIME 2026 | 99.2 | n/a |
| GPQA-Diamond | 91.2 | n/a |
La statistique phare est Terminal-Bench. Passer de 62.0 à 81.0 en une seule génération est un grand bond pour un benchmark qui mesure si un modèle peut réellement opérer un terminal pour accomplir des tâches. SWE-bench Pro à 62.1, surpassant le 58.6 de GPT-5.5, est l'autre titre : il indique une résolution de problèmes authentique au niveau du dépôt, et non de simples extraits.
Z.ai rapporte également que GLM-5.2 est le modèle open-source le plus performant sur FrontierSWE, PostTrainBench et SWE-Marathon, et le positionne face à GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro et DeepSeek-V4-Pro. VentureBeat a abordé l'angle du coût sans détour, écrivant que GLM-5.2 « surpasse GPT-5.5 en matière de codage à long terme pour environ 1/6 du coût » (cette phrase est la formulation de VentureBeat, dans leur couverture de GLM-5.2, et non une mesure d'Apidog).
Pour l'analyse complète et les mises en garde pour des comparaisons justes, consultez notre analyse approfondie des benchmarks de GLM-5.2 et la comparaison directe GLM-5.2 vs GPT-5.5, Claude Opus et Gemini.
Comment accéder à GLM-5.2 en un coup d'œil
Vous avez quatre voies pratiques, selon que vous souhaitez une API hébergée, une configuration de codage agentique, un routeur ou une installation locale.
| Chemin d'accès | Idéal pour | Note rapide |
|---|---|---|
| API Z.ai | Appels directs hébergés | Compatible OpenAI, endpoint à https://api.z.ai/api/paas/v4/ |
| Claude Code (GLM Coding Plan) | Codage agentique dans votre terminal | URL de base compatible Anthropic, sélectionnez la variante [1m] |
| OpenRouter | Une clé, plusieurs modèles | ID du modèle z-ai/glm-5.2 |
| Ollama | Local / hors ligne | Téléchargez glm-5.2 depuis la bibliothèque |
API Z.ai. L'API générale est compatible OpenAI. Vous accédez à `https://api.z.ai/api/paas/v4/chat/completions` avec une clé Bearer, et passez les paramètres habituels ainsi que `thinking`, `reasoning_effort`, `temperature` et `stream`. Les appels de fonctions et d'outils sont pris en charge.
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Refactor this function for readability."}],
"thinking": {"type": "enabled"},
"reasoning_effort": "max",
"stream": true
}'
Claude Code via le GLM Coding Plan. Z.ai expose un endpoint de codage compatible Anthropic, vous pouvez donc pointer Claude Code vers GLM-5.2. L'URL de base de codage est `https://api.z.ai/api/coding/paas/v4` (certaines sources indiquent `open.z.ai/api/paas/v4`, donc vérifiez en direct), et vous configurez votre environnement Claude Code pour qu'il route via celle-ci.
export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000
Le suffixe `[1m]` sélectionne la variante de contexte de 1 million. La ligne `API_TIMEOUT_MS` n'est pas un rembourrage facultatif : les appels longs à grand contexte peuvent dépasser le délai d'attente par défaut de Claude Code, donc l'augmenter empêche l'outil d'interrompre les requêtes en cours de vol. Nous détaillons cette configuration, ainsi que Cline et Cursor, dans le guide GLM-5.2 dans Claude Code, Cline et Cursor. Si vous avez utilisé la génération précédente de cette manière, notre article sur GLM-5.1 avec Claude Code couvre le même flux.
OpenRouter. Si vous utilisez déjà OpenRouter, GLM-5.2 est disponible sous le nom `z-ai/glm-5.2`. Vérifiez la liste en direct sur openrouter.ai/z-ai/glm-5.2. Notez qu'il n'y a pas de voie OpenRouter gratuite pour ce modèle, ne comptez donc pas dessus.
Ollama. Pour une utilisation locale, téléchargez-le depuis la bibliothèque Ollama. C'est la voie pour le travail hors ligne ou un contrôle strict des données, avec le compromis évident que vous avez besoin d'une véritable mémoire GPU pour servir confortablement un MoE de 753 milliards de paramètres.
Pour un aperçu des options véritablement gratuites, consultez comment utiliser GLM-5.2 gratuitement.
Tarification, en bref
Sur l'API hébergée, OpenRouter confirme une tarification de **1,40 $ par million de tokens d'entrée** et **4,40 $ par million de tokens de sortie**. VentureBeat cite une entrée en cache autour de 0,26 $ par million. Le GLM Coding Plan propose des abonnements échelonnés (Lite, Pro, Max et Team), mais les chiffres mensuels exacts varient selon les sources secondaires, alors confirmez les prix actuels sur z.ai avant de vous engager (à partir de juin 2026). Notre ventilation des prix de GLM-5.2 tient un décompte à jour.
Où Apidog s'insère
Si vous développez en utilisant l'API GLM-5.2, ou si vous l'intégrez à un agent qui appelle vos propres services, vous devez toujours concevoir, tester et documenter ces endpoints. C'est là qu'Apidog vous aide. Vous pouvez simuler les endpoints basés sur le LLM avant que l'intégration réelle ne soit prête, déboguer les formes de requête et de réponse (y compris le streaming et les charges utiles d'appels d'outils), et maintenir votre documentation API à jour à mesure que le contrat évolue. C'est une plateforme API tout-en-un, de sorte que la conception, le débogage, les tests, la simulation et la documentation se trouvent au même endroit plutôt qu'à quatre. Lorsque vous êtes prêt à l'essayer, téléchargez Apidog et pointez-le vers votre intégration GLM-5.2.
Comment GLM-5.2 se compare au reste de la famille et du marché
GLM-5.2 est le sommet de la ligne GLM actuelle en matière de codage et d'agentique. Si vous le comparez aux versions antérieures ou aux laboratoires rivaux, voici les lectures utiles suivantes :
- GLM-5.1 vs Claude, GPT, Gemini et DeepSeek pour la position de la génération précédente.
- GLM-5 vs DeepSeek vs GPT-5 en termes de vitesse et de coût pour l'aspect efficacité.
- Claude Opus 4.8 vs GPT-5.5 vs Gemini 3.5 pour la frontière des modèles fermés qu'il poursuit.
- Le billet de blog officiel Z.ai sur GLM-5.2 et la documentation pour les spécifications faisant autorité.
FAQ
Qu'est-ce que GLM-5.2 en une phrase ? C'est le LLM phare à poids ouverts de Z.ai, un modèle MoE d'environ 753 milliards de paramètres, optimisé pour le codage, le raisonnement et l'utilisation d'outils agentiques, avec une fenêtre de contexte de 1 million de tokens et une licence MIT.
GLM-5.2 est-il réellement gratuit ? Les poids sont téléchargeables et auto-hébergeables gratuitement sous licence MIT. L'API hébergée de Z.ai et le GLM Coding Plan sont payants. Il n'existe pas de niveau OpenRouter gratuit pour celui-ci, donc « gratuit » signifie ici des poids ouverts, pas un endpoint hébergé gratuit.
GLM-5.2 peut-il voir des images ? Non. C'est du texte en entrée, du texte en sortie selon la documentation de l'API, sans variante visuelle confirmée. Utilisez un modèle de vision distinct si vous avez besoin d'une entrée d'image.
En quoi GLM-5.2 est-il différent de GLM-5.1 ? Le plus grand bond visible concerne le codage agentique. Terminal-Bench 2.1 est passé de 62.0 à 81.0 selon les résultats de Z.ai, avec des gains sur SWE-bench Pro et la nouvelle attention creuse IndexShare. Consultez la comparaison GLM-5.2 vs GLM-5.1 pour la différence complète.
Quelle longueur de contexte et de sortie prend-il en charge ? Le contexte est de 1 million de tokens. La sortie est documentée jusqu'à 128K selon z.ai, mais tous les hébergeurs n'indiquent pas le même plafond, alors vérifiez auprès de votre fournisseur.
La version courte
GLM-5.2 est ce qui se produit lorsqu'un laboratoire de poids ouverts décide de rivaliser directement avec la frontière fermée en matière de codage. Vous obtenez un modèle MoE de 753 milliards de paramètres avec une fenêtre d'un million de tokens, un effort de raisonnement contrôlable, une licence MIT qui vous permet de l'auto-héberger et de le commercialiser, et des résultats de benchmark qui le placent dans la conversation avec GPT-5.5 et Claude Opus 4.8, du moins selon les chiffres de Z.ai. Les réserves sont réelles (texte uniquement, limites de sortie à vérifier, revendications de benchmark du fournisseur), mais la proposition fondamentale tient : c'est un modèle de codage sérieux que vous pouvez réellement posséder. Commencez par le guide de l'API GLM-5.2 lorsque vous êtes prêt à construire.
