Qu'est-ce que GLM-5.2 ?

Qu'est-ce que GLM-5.2 ? Le fleuron de codage de Z.ai, un modèle MoE de 753B à poids ouverts : contexte de 1M, licence MIT, benchmarks, et comment y accéder via l'API, Claude Code et Ollama.

Ashley Innocent

Ashley Innocent

17 June 2026

Qu'est-ce que GLM-5.2 ?

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

GLM-5.2 est le dernier modèle phare de Z.ai (le laboratoire Zhipu AI), et il est arrivé avec une proposition claire : des poids ouverts, une priorité au codage, et une compétitivité avec les plus grands modèles frontières fermés. Si vous avez entendu ce nom et que vous voulez une réponse directe à la question « qu'est-ce que GLM-5.2 », ceci est l'explication de référence. Nous aborderons qui le fabrique, ce qu'il est réellement sous le capot, comment y accéder, et quelles sont les réserves honnêtes.

bouton

TL;DR

Qui fabrique GLM-5.2, et qu'est-ce que c'est

GLM-5.2 provient de Z.ai, le laboratoire également connu sous le nom de Zhipu AI. C'est la dernière entrée dans la famille GLM (« General Language Model »), après la sortie de GLM-5.1. Le positionnement est explicite : il s'agit d'un modèle phare pour le codage qui livre ses poids ouvertement plutôt que de se cacher derrière un mur uniquement API.

Cette position de poids ouverts est le cœur de l'histoire ici. La plupart des modèles qui rivalisent avec GPT-5.5 ou Claude Opus 4.8 sont fermés. GLM-5.2 offre des capacités comparables dans un fichier que vous pouvez télécharger. Si vous avez lu notre aperçu de GLM-5.1, considérez le 5.2 comme la même lignée avec une orientation plus marquée vers le codage et les capacités agentiques.

GLM-5.2 est un modèle à usage général avec un biais pour le codage. Il gère le raisonnement, les mathématiques et le texte multilingue (l'anglais et le chinois sont de premier ordre), mais Z.ai l'a entraîné le plus intensément pour l'ingénierie logicielle et le travail d'agent multi-étapes axé sur les outils.

Identité : comment trouver GLM-5.2 sur différentes plateformes

Une chose qui déroute les gens avec les modèles ouverts est la nomenclature. Le même modèle porte des identifiants différents selon l'endroit où vous le chargez. Voici la carte.

Plateforme Identifiant
Hugging Face zai-org/GLM-5.2
API Z.ai glm-5.2
Ollama glm-5.2
OpenRouter z-ai/glm-5.2

Les poids sont sous licence MIT sans restrictions régionales, de sorte que le dépôt Hugging Face est véritablement téléchargeable et non restreint. Vous pouvez confirmer la fiche et les fichiers sur la page GLM-5.2 sur Hugging Face.

Architecture en termes simples : 753B MoE + IndexShare

GLM-5.2 est un modèle Mixture-of-Experts avec environ 753 milliards de paramètres au total, servi en BF16. MoE signifie que le modèle est divisé en de nombreux sous-réseaux « experts », et seule une fraction d'entre eux s'active pour chaque token donné. Vous obtenez la capacité de connaissance d'un modèle énorme sans payer la totalité de la facture de calcul à chaque passe avant. C'est ainsi qu'un modèle de 753 milliards de paramètres reste utilisable.

La nouveauté est l'attention creuse. GLM-5.2 introduit une méthode que Z.ai appelle IndexShare. L'attention normale devient rapidement coûteuse à mesure que votre contexte s'agrandit, car chaque token s'attache à tous les autres tokens. IndexShare réutilise un seul « indexeur » sur chaque groupe de 4 couches d'attention creuse, au lieu d'en calculer un nouveau par couche. En pratique, cela réduit le coût de l'attention sur des contextes longs, ce qui est exactement ce que vous voulez lorsque votre fenêtre est d'un million de tokens.

Vous n'avez pas besoin de comprendre les mathématiques pour en bénéficier. La leçon à retenir : GLM-5.2 est conçu de manière à ce que lui fournir une grande base de code ou un long document n'augmente pas votre latence et vos coûts comme le ferait un modèle dense.

Une fenêtre de contexte de 1 million de tokens

GLM-5.2 prend en charge une fenêtre de contexte de 1 million de tokens (1 048 576 tokens, pour être exact). Cela suffit pour insérer un référentiel de taille moyenne, une longue spécification ou une pile de documents connexes dans une seule invite et demander au modèle de raisonner sur l'ensemble.

La sortie maximale est l'endroit où vous devez être prudent. La documentation de z.ai indique une sortie allant jusqu'à 128K tokens, mais tous les hébergeurs ne publient pas le même nombre, et OpenRouter ne le liste pas du tout. Considérez donc 128K comme le plafond documenté à vérifier en direct plutôt qu'une garantie sur chaque endpoint. Si votre flux de travail dépend de très longues générations, vérifiez la limite chez le fournisseur spécifique que vous utilisez.

Pour comprendre comment cette génération a fait évoluer les choses, notre comparaison GLM-5.2 vs GLM-5.1 détaille ce qui a changé d'une version à l'autre.

Effort de réflexion : Élevé, Maximum, et désactivation

GLM-5.2 est un modèle capable de raisonnement avec un comportement de « réflexion » contrôlable. Vous disposez de deux niveaux d'effort de réflexion :

Vous pouvez également désactiver complètement la réflexion. Pour des recherches rapides, des formatages ou des transformations simples, vous ne voulez pas que le modèle consomme des tokens pour une chaîne de pensée interne. Désactiver la réflexion rend ces appels rapides et peu coûteux.

Dans l'API, cela correspond à un paramètre `thinking` (`{"type": "enabled"}` ou `{"type": "disabled"}`) et à une valeur `reasoning_effort` telle que `"max"`. Nous approfondissons la forme de la requête dans le guide de l'API GLM-5.2, mais le modèle mental est simple : augmentez le raisonnement pour les travaux d'ingénierie difficiles, désactivez-le pour les appels triviaux.

Licence MIT et poids ouverts : ce que cela vous apporte réellement

Le terme « poids ouverts » est souvent utilisé à la légère, voici donc ce que la licence MIT de GLM-5.2 permet concrètement :

Pour les équipes soumises à des contraintes de résidence des données ou de conformité, cela est plus important qu'un ou deux points de benchmark. Vous pouvez garder les invites et le code en interne. Si vous voulez essayer la voie entièrement locale, consultez exécuter GLM-5 localement gratuitement et GLM-5 gratuitement avec Ollama pour les modèles, qui s'appliquent également au 5.2.

Priorité au codage et agentique : les benchmarks

Z.ai a construit GLM-5.2 pour effectuer un véritable travail logiciel, pas seulement en parler. L'histoire des benchmarks est centrée sur le codage et l'utilisation d'outils agentiques. Les chiffres ci-dessous sont les résultats publiés par Z.ai, il faut donc les interpréter comme les propres mesures du laboratoire plutôt que des scores indépendants de tiers.

Benchmark GLM-5.2 Comparaison notable
Terminal-Bench 2.1 81.0 GLM-5.1 a obtenu 62.0
SWE-bench Pro 62.1 GPT-5.5 58.6, GLM-5.1 58.4
MCP-Atlas 77.0 GPT-5.5 75.3, Claude Opus 4.8 77.8
Humanity’s Last Exam (avec outils) 54.7 GPT-5.5 52.2
AIME 2026 99.2 n/a
GPQA-Diamond 91.2 n/a

La statistique phare est Terminal-Bench. Passer de 62.0 à 81.0 en une seule génération est un grand bond pour un benchmark qui mesure si un modèle peut réellement opérer un terminal pour accomplir des tâches. SWE-bench Pro à 62.1, surpassant le 58.6 de GPT-5.5, est l'autre titre : il indique une résolution de problèmes authentique au niveau du dépôt, et non de simples extraits.

Z.ai rapporte également que GLM-5.2 est le modèle open-source le plus performant sur FrontierSWE, PostTrainBench et SWE-Marathon, et le positionne face à GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro et DeepSeek-V4-Pro. VentureBeat a abordé l'angle du coût sans détour, écrivant que GLM-5.2 « surpasse GPT-5.5 en matière de codage à long terme pour environ 1/6 du coût » (cette phrase est la formulation de VentureBeat, dans leur couverture de GLM-5.2, et non une mesure d'Apidog).

Pour l'analyse complète et les mises en garde pour des comparaisons justes, consultez notre analyse approfondie des benchmarks de GLM-5.2 et la comparaison directe GLM-5.2 vs GPT-5.5, Claude Opus et Gemini.

Comment accéder à GLM-5.2 en un coup d'œil

Vous avez quatre voies pratiques, selon que vous souhaitez une API hébergée, une configuration de codage agentique, un routeur ou une installation locale.

Chemin d'accès Idéal pour Note rapide
API Z.ai Appels directs hébergés Compatible OpenAI, endpoint à https://api.z.ai/api/paas/v4/
Claude Code (GLM Coding Plan) Codage agentique dans votre terminal URL de base compatible Anthropic, sélectionnez la variante [1m]
OpenRouter Une clé, plusieurs modèles ID du modèle z-ai/glm-5.2
Ollama Local / hors ligne Téléchargez glm-5.2 depuis la bibliothèque

API Z.ai. L'API générale est compatible OpenAI. Vous accédez à `https://api.z.ai/api/paas/v4/chat/completions` avec une clé Bearer, et passez les paramètres habituels ainsi que `thinking`, `reasoning_effort`, `temperature` et `stream`. Les appels de fonctions et d'outils sont pris en charge.

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [{"role": "user", "content": "Refactor this function for readability."}],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "max",
    "stream": true
  }'

Claude Code via le GLM Coding Plan. Z.ai expose un endpoint de codage compatible Anthropic, vous pouvez donc pointer Claude Code vers GLM-5.2. L'URL de base de codage est `https://api.z.ai/api/coding/paas/v4` (certaines sources indiquent `open.z.ai/api/paas/v4`, donc vérifiez en direct), et vous configurez votre environnement Claude Code pour qu'il route via celle-ci.

export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000

Le suffixe `[1m]` sélectionne la variante de contexte de 1 million. La ligne `API_TIMEOUT_MS` n'est pas un rembourrage facultatif : les appels longs à grand contexte peuvent dépasser le délai d'attente par défaut de Claude Code, donc l'augmenter empêche l'outil d'interrompre les requêtes en cours de vol. Nous détaillons cette configuration, ainsi que Cline et Cursor, dans le guide GLM-5.2 dans Claude Code, Cline et Cursor. Si vous avez utilisé la génération précédente de cette manière, notre article sur GLM-5.1 avec Claude Code couvre le même flux.

OpenRouter. Si vous utilisez déjà OpenRouter, GLM-5.2 est disponible sous le nom `z-ai/glm-5.2`. Vérifiez la liste en direct sur openrouter.ai/z-ai/glm-5.2. Notez qu'il n'y a pas de voie OpenRouter gratuite pour ce modèle, ne comptez donc pas dessus.

Ollama. Pour une utilisation locale, téléchargez-le depuis la bibliothèque Ollama. C'est la voie pour le travail hors ligne ou un contrôle strict des données, avec le compromis évident que vous avez besoin d'une véritable mémoire GPU pour servir confortablement un MoE de 753 milliards de paramètres.

Pour un aperçu des options véritablement gratuites, consultez comment utiliser GLM-5.2 gratuitement.

Tarification, en bref

Sur l'API hébergée, OpenRouter confirme une tarification de **1,40 $ par million de tokens d'entrée** et **4,40 $ par million de tokens de sortie**. VentureBeat cite une entrée en cache autour de 0,26 $ par million. Le GLM Coding Plan propose des abonnements échelonnés (Lite, Pro, Max et Team), mais les chiffres mensuels exacts varient selon les sources secondaires, alors confirmez les prix actuels sur z.ai avant de vous engager (à partir de juin 2026). Notre ventilation des prix de GLM-5.2 tient un décompte à jour.

Où Apidog s'insère

Si vous développez en utilisant l'API GLM-5.2, ou si vous l'intégrez à un agent qui appelle vos propres services, vous devez toujours concevoir, tester et documenter ces endpoints. C'est là qu'Apidog vous aide. Vous pouvez simuler les endpoints basés sur le LLM avant que l'intégration réelle ne soit prête, déboguer les formes de requête et de réponse (y compris le streaming et les charges utiles d'appels d'outils), et maintenir votre documentation API à jour à mesure que le contrat évolue. C'est une plateforme API tout-en-un, de sorte que la conception, le débogage, les tests, la simulation et la documentation se trouvent au même endroit plutôt qu'à quatre. Lorsque vous êtes prêt à l'essayer, téléchargez Apidog et pointez-le vers votre intégration GLM-5.2.

Comment GLM-5.2 se compare au reste de la famille et du marché

GLM-5.2 est le sommet de la ligne GLM actuelle en matière de codage et d'agentique. Si vous le comparez aux versions antérieures ou aux laboratoires rivaux, voici les lectures utiles suivantes :

FAQ

Qu'est-ce que GLM-5.2 en une phrase ? C'est le LLM phare à poids ouverts de Z.ai, un modèle MoE d'environ 753 milliards de paramètres, optimisé pour le codage, le raisonnement et l'utilisation d'outils agentiques, avec une fenêtre de contexte de 1 million de tokens et une licence MIT.

GLM-5.2 est-il réellement gratuit ? Les poids sont téléchargeables et auto-hébergeables gratuitement sous licence MIT. L'API hébergée de Z.ai et le GLM Coding Plan sont payants. Il n'existe pas de niveau OpenRouter gratuit pour celui-ci, donc « gratuit » signifie ici des poids ouverts, pas un endpoint hébergé gratuit.

GLM-5.2 peut-il voir des images ? Non. C'est du texte en entrée, du texte en sortie selon la documentation de l'API, sans variante visuelle confirmée. Utilisez un modèle de vision distinct si vous avez besoin d'une entrée d'image.

En quoi GLM-5.2 est-il différent de GLM-5.1 ? Le plus grand bond visible concerne le codage agentique. Terminal-Bench 2.1 est passé de 62.0 à 81.0 selon les résultats de Z.ai, avec des gains sur SWE-bench Pro et la nouvelle attention creuse IndexShare. Consultez la comparaison GLM-5.2 vs GLM-5.1 pour la différence complète.

Quelle longueur de contexte et de sortie prend-il en charge ? Le contexte est de 1 million de tokens. La sortie est documentée jusqu'à 128K selon z.ai, mais tous les hébergeurs n'indiquent pas le même plafond, alors vérifiez auprès de votre fournisseur.

La version courte

GLM-5.2 est ce qui se produit lorsqu'un laboratoire de poids ouverts décide de rivaliser directement avec la frontière fermée en matière de codage. Vous obtenez un modèle MoE de 753 milliards de paramètres avec une fenêtre d'un million de tokens, un effort de raisonnement contrôlable, une licence MIT qui vous permet de l'auto-héberger et de le commercialiser, et des résultats de benchmark qui le placent dans la conversation avec GPT-5.5 et Claude Opus 4.8, du moins selon les chiffres de Z.ai. Les réserves sont réelles (texte uniquement, limites de sortie à vérifier, revendications de benchmark du fournisseur), mais la proposition fondamentale tient : c'est un modèle de codage sérieux que vous pouvez réellement posséder. Commencez par le guide de l'API GLM-5.2 lorsque vous êtes prêt à construire.

bouton

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API