Il y a quatre modèles qui méritent d'être discutés mi-2026, et un seul d'entre eux est livré avec des poids ouverts. Il s'agit du GLM-5.2. Le modèle à mélange d'experts de ~753 milliards de paramètres de Z.ai a fait son entrée dans la conversation sur les modèles de pointe en surpassant GPT-5.5 sur SWE-bench Pro, en atteignant le niveau de Claude Opus 4.8 en matière d'utilisation d'outils agentiques, et ce pour environ un sixième du coût (selon VentureBeat). Les trois autres (GPT-5.5, Claude Opus 4.8 et Gemini 3.1 Pro) sont fermés, mesurés et excellents.
Ainsi, la vraie question pour 2026 n'est pas "quel modèle est le plus intelligent". C'est "où un concurrent à poids ouverts rattrape-t-il réellement la frontière fermée, et où l'écart persiste-t-il encore ?" C'est la comparaison GLM-5.2 vs GPT-5.5 vs Claude Opus 4.8, avec Gemini 3.1 Pro dans le mélange, évaluée sur le codage, le travail agentique, le raisonnement, le contexte, l'ouverture et le prix.
Si vous voulez le contexte historique complet, la comparaison LLM à quatre voies GLM-5.1 et la ventilation Claude Opus 4.8 vs GPT-5.5 vs Gemini 3.5 couvrent en profondeur la confrontation des modèles fermés. Cet article se concentre entièrement sur le GLM-5.2.
Les concurrents en un coup d'œil
| Dimension | GLM-5.2 | GPT-5.5 | Claude Opus 4.8 | Gemini 3.1 Pro |
|---|---|---|---|---|
| Poids | Ouverts (MIT) | Fermés | Fermés | Fermés |
| Architecture | ~753B MoE, BF16 | Non divulguée | Non divulguée | Non divulguée |
| Fenêtre contextuelle | 1M jetons | Large (non divulguée) | Large (non divulguée) | Très large |
| Prix entrée API | 1,40 $ / 1M | Plus élevé | Plus élevé | Plus élevé |
| Prix sortie API | 4,40 $ / 1M | Plus élevé | Plus élevé | Plus élevé |
| SWE-bench Pro | 62.1 | 58.6 | n/a | n/a |
| MCP-Atlas (agentique) | 77.0 | 75.3 | 77.8 | n/a |
| Auto-hébergement | Oui | Non | Non | Non |
Les prix des trois modèles fermés varient et changent selon le niveau, c'est pourquoi le tableau les indique comme "Plus élevé" plutôt que de donner des chiffres fluctuants. Les tarifs API du GLM-5.2 sont confirmés : 1,40 $ par million de jetons d'entrée et 4,40 $ par million de jetons de sortie (via OpenRouter), avec une entrée mise en cache autour de 0,26 $ par million (VentureBeat, attribué). Les cellules de référence laissées vides reflètent les chiffres publiés par Z.ai pour ses propres comparaisons directes ; tous les modèles ne rapportent pas tous les tests.

Codage : où GLM-5.2 gagne réellement
Commençons par le titre, car c'est la partie la plus solide de l'argumentaire du GLM-5.2. Sur SWE-bench Pro, les résultats publiés par Z.ai placent le GLM-5.2 à 62.1, devant GPT-5.5 à 58.6 et son propre prédécesseur GLM-5.1 à 58.4. C'est un benchmark d'ingénierie logicielle réel et reproductible, et le fait qu'un modèle à poids ouverts surpasse un modèle de pointe fermé sur ce point est la nouvelle importante.

Le bond de Terminal-Bench 2.1 est celui qui a fait doublement réfléchir les gens. GLM-5.2 obtient un score de 81.0, contre 62.0 pour GLM-5.1. Un saut générationnel d'environ 19 points en codage agentique de type terminal est la statistique héroïque de cette version, et cela correspond au comportement du modèle en pratique : il est axé sur le codage, avec deux niveaux d'effort de réflexion (Élevé et Maximum). Z.ai recommande le niveau Maximum pour le travail de codage.
Z.ai rapporte également que GLM-5.2 est le modèle open source le plus performant sur FrontierSWE, PostTrainBench et SWE-Marathon. Pour la recherche du "meilleur modèle de codage 2026" que tout le monde effectue actuellement, la réponse honnête est partagée : les modèles fermés conservent encore certaines couronnes de qualité, mais GLM-5.2 est le modèle qui l'emporte en termes de codage par dollar et le seul que vous pouvez exécuter sur votre propre matériel.
GPT-5.5 reste un formidable codeur généraliste et s'intègre étroitement à l'écosystème d'outils d'OpenAI. Claude Opus 4.8 est celui que de nombreux ingénieurs privilégient encore pour les refactorisations complexes de plusieurs fichiers et les longues sessions agentiques où le jugement est plus important que les simples points de référence bruts. Gemini 3.1 Pro s'appuie sur son énorme contexte pour le raisonnement sur des dépôts entiers. Rien de tout cela ne change la ligne SWE-bench Pro. Sur ce test, GLM-5.2 contre GPT-5.5 va à GLM-5.2.
Agentique et utilisation d'outils : au niveau des meilleurs
C'est la surprise. Sur MCP-Atlas, qui mesure l'orchestration des outils du protocole de contexte de modèle, GLM-5.2 atteint 77.0. GPT-5.5 est à 75.3. Claude Opus 4.8 mène à 77.8. Donc GLM-5.2 contre Claude Opus 4.8 sur l'utilisation d'outils agentiques est presque à égalité, avec Opus en tête de moins d'un point, et GLM-5.2 devant GPT-5.5.

Le GLM-5.2 soutient cela avec des appels de fonctions et d'outils compatibles OpenAI, ainsi qu'un point de terminaison de codage compatible Anthropic afin de pouvoir s'intégrer dans les harnais d'agents construits pour Claude. Sur Humanity’s Last Exam avec des outils, Z.ai rapporte un score de 54.7 contre 52.2 pour GPT-5.5, un autre avantage en matière de raisonnement agentique.
L'architecture contribue également à l'aspect agentique. L'attention clairsemée "IndexShare" du GLM-5.2 réutilise un indexeur sur toutes les quatre couches d'attention clairsemée, ce qui réduit le coût d'attention sur un contexte long. Pour les agents qui accumulent d'énormes historiques d'appels d'outils, une attention à long contexte moins coûteuse est un avantage structurel, pas seulement une ligne de benchmark. Si vous intégrez le GLM-5.2 dans une pile d'agents, le guide GLM-5.2 avec Claude Code, Cline et Cursor explique la configuration du harnais, et le guide API GLM-5.2 couvre les paramètres d'appel d'outils.
Raisonnement et mathématiques : de premier ordre, avec des réserves
En matière de raisonnement pur, les quatre modèles convergent près du plafond. Z.ai rapporte pour GLM-5.2 un score de 99.2 à l'AIME 2026 et de 91.2 au GPQA-Diamond, tous deux d'élite. Ce sont les chiffres publiés par Z.ai, il faut donc les considérer comme des affirmations de lancement en attendant une réplication tierce généralisée plutôt que comme des faits établis.
GLM-5.2 expose directement le contrôle du raisonnement. Vous définissez `reasoning_effort: "max"` et `thinking: {type: "enabled"}` pour les problèmes difficiles, ou désactivez la réflexion pour des réponses rapides et peu coûteuses. Cette granularité est moins exposée par les modèles fermés. GPT-5.5, Claude Opus 4.8 et Gemini 3.1 Pro raisonnent tous superbement, et sur les tâches de jugement ouvertes les plus difficiles (celles que les benchmarks ont du mal à capturer), la frontière fermée semble encore un cran plus raffinée pour de nombreux utilisateurs. Sur les benchmarks de mathématiques et de sciences notés, GLM-5.2 est tout à fait là.
Contexte et ouverture : l'atout maître des poids ouverts
GLM-5.2 est livré avec une fenêtre contextuelle d'un million de jetons (1 048 576 jetons). La sortie maximale est indiquée comme pouvant atteindre 128K selon la documentation de z.ai, bien que ce chiffre ne soit pas partout, donc vérifiez-le en direct avant de concevoir autour de lui plutôt que d'affirmer un chiffre non qualifié.
Gemini 3.1 Pro est l'autre modèle réputé pour son très grand contexte, et c'est le concurrent le plus proche sur l'axe des documents longs. GPT-5.5 et Claude Opus 4.8 offrent également de grandes fenêtres. Là où GLM-5.2 se distingue, c'est par son ouverture. Il est publié sous licence MIT, sans restrictions régionales, et est disponible sous le nom `zai-org/GLM-5.2` sur Hugging Face et `glm-5.2` dans Ollama. Vous pouvez télécharger les poids, les exécuter en mode air-gapped, les affiner et les déployer sans frais de fournisseur par jeton.
Pour les équipes soumises à des règles de résidence des données ou à une politique stricte de "pas d'API tierce", ce n'est pas un facteur décisif. C'est la décision toute entière. Les trois autres ne peuvent pas être auto-hébergés à n'importe quel prix. Si l'objectif est de l'exécuter vous-même, exécuter GLM-5.2 localement gratuitement et l'ancien guide d'exécution locale de GLM-5 couvrent les chemins matériels et de quantification.
Prix : la ligne ~1/6
Voici l'argument économique, et il est direct. GLM-5.2 coûte 1,40 $ par million de jetons d'entrée et 4,40 $ par million de jetons de sortie via l'API. VentureBeat le présente comme GLM-5.2 "battant GPT-5.5 sur le codage à long terme pour environ 1/6 du coût" (attribué à VentureBeat). L'entrée mise en cache tombe à environ 0,26 $ par million (VentureBeat).
| Facteur de coût | GLM-5.2 | Modèles de pointe fermés (GPT-5.5 / Opus 4.8 / Gemini 3.1 Pro) |
|---|---|---|
| Entrée API (par 1M) | 1,40 $ | Substantiellement plus élevé |
| Sortie API (par 1M) | 4,40 $ | Substantiellement plus élevé |
| Entrée en cache | ~0,26 $ | Varie |
| Option d'auto-hébergement | Oui (pas de frais par jeton) | Aucune |
| Niveau gratuit OpenRouter | Non | Non |
Pour être clair sur ce que GLM-5.2 n'a pas : il n'y a pas de voie gratuite OpenRouter pour lui. Si vous en voyez une annoncée, ce n'est pas le modèle officiel. Pour l'image complète des prix, y compris les niveaux du GLM Coding Plan (Lite, Pro, Max et Team, avec des chiffres sur lesquels les sources secondaires ne s'accordent toujours pas en juin 2026, donc vérifiez les prix actuels sur z.ai), consultez la ventilation dédiée des prix du GLM-5.2. Vous pouvez également le router via OpenRouter sous le nom `z-ai/glm-5.2` si vous préférez ne pas gérer une clé directement.
Pour le calcul des coûts quotidiens, l'article sur la vitesse et le coût de GLM-5 vs DeepSeek vs GPT-5 est un compagnon utile, même s'il est antérieur à cette génération.
Verdict : choisissez par contrainte, pas par battage médiatique
Il n'y a pas de gagnant unique, et prétendre le contraire serait malhonnête. Chaque modèle remporte un argument différent.
- Choisissez GLM-5.2 si vous voulez le meilleur rapport codage/dollar, des poids ouverts que vous pouvez auto-héberger, une utilisation d'outils agentiques compétitive et une fenêtre de 1M de jetons. C'est le choix de la valeur et du contrôle, et il bat véritablement GPT-5.5 sur SWE-bench Pro.
- Choisissez GPT-5.5 si vous vivez dans l'écosystème OpenAI et que vous voulez un généraliste poli et largement capable avec un support d'outils approfondi.
- Choisissez Claude Opus 4.8 si votre travail est long, agentique et exigeant en jugement. Il reste en tête du MCP-Atlas (77.8) et reste le choix par défaut de nombreux ingénieurs pour les refactorisations complexes.
- Choisissez Gemini 3.1 Pro si un contexte très large et une intégration étroite avec Google sont les moteurs de votre stack.
Le résumé honnête de GLM-5.2 contre Gemini 3.1 Pro, GPT-5.5 et Opus 4.8 : la frontière fermée gagne encore en qualité et en finesse sur les tâches ouvertes les plus difficiles. GLM-5.2 gagne sur le prix, l'ouverture, l'auto-hébergement et un codage compétitif à leader. Pour une grande partie du travail d'ingénierie réel en 2026, cette combinaison est suffisante pour en faire le choix par défaut.
Si vous choisissez pour une charge de travail agentique ou à forte API, vous voudrez valider le comportement par rapport à vos propres points de terminaison avant de vous engager. Apidog vous permet de concevoir, déboguer, simuler et tester les appels API derrière n'importe lequel de ces modèles en un seul endroit, afin que vous puissiez comparer la latence réelle et le comportement d'appel d'outils sur votre propre trafic au lieu de faire confiance à un graphique de lancement. Téléchargez Apidog et pointez-le vers le point de terminaison z.ai pour commencer.
Comment GLM-5.2 se compare à son propre prédécesseur
Il est bon de noter rapidement, car cela cadre l'histoire générationnelle. Le saut de modèle à modèle est couvert en détail dans la comparaison GLM-5.2 vs GLM-5.1, et l'analyse approfondie des benchmarks GLM-5.2 présente chaque test noté. Si vous débutez avec la lignée, commencez par ce qu'est GLM-5.2. Pour la surface API de la génération précédente, la référence GLM-5.1 et comment utiliser l'API GLM-5.1 s'appliquent toujours avec des modifications mineures. Les notes de publication officielles sont disponibles sur le blog de Z.ai et la documentation GLM-5.2, avec un contexte indépendant dans la couverture de VentureBeat.
FAQ
GLM-5.2 est-il vraiment meilleur que GPT-5.5 en codage ?
Sur SWE-bench Pro, il obtient un score plus élevé : 62.1 contre 58.6, selon les résultats publiés par Z.ai. C'est un benchmark d'ingénierie logicielle solide et bien connu. GPT-5.5 remporte toujours d'autres tâches et dispose d'un écosystème d'outils plus riche, donc "meilleur en codage" dépend de la charge de travail. Pour le travail SWE mesuré par benchmark et le coût, GLM-5.2 est en tête.
Dans quelle mesure GLM-5.2 est-il proche de Claude Opus 4.8 sur les tâches agentiques ?
Très proche. Sur MCP-Atlas, GLM-5.2 obtient un score de 77.0 contre 77.8 pour Opus 4.8, soit un écart de moins d'un point, et GLM-5.2 devance le 75.3 de GPT-5.5. Pour l'utilisation d'outils et l'orchestration d'agents, considérez GLM-5.2 et Opus 4.8 comme des pairs effectifs.
Pourquoi GLM-5.2 coûte-t-il beaucoup moins cher ?
Il s'agit de poids ouverts et son prix est très agressif : 1,40 $ en entrée et 4,40 $ en sortie par million de jetons. VentureBeat estime qu'il coûte environ un sixième du prix de GPT-5.5 pour le codage à long terme. Vous pouvez également auto-héberger les poids et ne payer aucun frais par jeton.
Le GLM-5.2 dispose-t-il d'un modèle de vision ?
Aucune variante de vision confirmée n'existe en juin 2026. C'est un modèle texte-entrée, texte-sortie selon la documentation de l'API. Ne supposez pas un "GLM-5.2V" tant que Z.ai n'en a pas livré un.
Puis-je exécuter GLM-5.2 avec Claude Code ?
Oui. Il expose un point de terminaison de codage compatible Anthropic, vous pouvez donc définir `ANTHROPIC_BASE_URL` et une clé GLM Coding Plan, puis pointer Claude Code vers la variante `glm-5.2[1m]` pour le modèle à 1M de contexte. Le guide GLM-5.2 avec Claude Code, Cline et Cursor contient la configuration complète de l'environnement.
La frontière n'est plus une seule échelle. C'est un ensemble de compromis, et pour la première fois, un modèle à poids ouverts est une réponse sérieuse à la question "sur lequel devrais-je construire". GLM-5.2 ne bat pas les trois modèles fermés sur tout. Il n'en a pas besoin. Il gagne suffisamment, coûte une fraction, et vous donne les poids.
