Comment utiliser GLM-5.2 sans restrictions

GLM-5.2 est à poids ouverts sous licence MIT, son utilisation sans restrictions est donc une voie prise en charge : contrôle direct de l'API, auto-hébergement, versions non censurées, et la manière de tester chacun d'eux dans Apidog.

Ashley Innocent

Ashley Innocent

7 July 2026

Comment utiliser GLM-5.2 sans restrictions

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

GLM-5.2 est l'un des rares modèles de classe « frontier » que vous pouvez réellement exécuter sur votre propre matériel. Il est livré avec des poids ouverts sous licence MIT, sans restrictions régionales, donc « l'utiliser sans restrictions » n'est pas un piratage. C'est une voie prise en charge. L'astuce est de savoir quelle restriction vous rencontrez réellement, car la solution est différente pour chacune.

bouton

En bref

D'abord, identifiez la restriction que vous rencontrez

« Restrictions » est un terme vague. Pour GLM-5.2, cela signifie généralement l'une des quatre choses différentes, et chacune a sa propre solution.

  1. Refus provenant du réglage d'instruction. Le modèle de chat publié est aligné pour refuser certaines requêtes. Ce comportement réside dans les poids.
  2. Filtres de produit dans l'application de chat. L'interface utilisateur web grand public peut ajouter sa propre couche de modération au-dessus du modèle. L'API se comporte souvent différemment de l'application.
  3. Limites de plan et de débit. Les niveaux gratuits et les niveaux de plan de codage plafonnent les requêtes, le contexte ou la sortie. C'est un quota, pas une règle de contenu.
  4. Surcharge de réflexion et de routage de sécurité. Un raisonnement étendu et un routage de sécurité ajoutent de la latence et peuvent modifier le ton.

La région n'est délibérément pas sur cette liste. Les poids de GLM-5.2 sont sous licence MIT sans restrictions régionales, l'accès n'est donc pas limité par pays comme c'est le cas pour certains modèles uniquement hébergés.

Levier 1 : Utilisez l'API brute, pas l'application de chat

Le changement le plus rapide avec le plus grand bénéfice est d'arrêter d'utiliser la fenêtre de chat grand public et d'appeler directement l'API. Le point de terminaison est compatible OpenAI, vous conservez donc votre propre invite système, définissez votre propre température et pouvez désactiver la phase de « pensée ».

Un appel curl minimal avec la « pensée » désactivée :

curl https://api.z.ai/api/paas/v4/chat/completions \
 -H "Authorization: Bearer $ZAI_API_KEY" \
 -H "Content-Type: application/json" \
 -d '{
 "model": "glm-5.2",
 "thinking": { "type": "disabled" },
 "temperature": 0.7,
 "messages": [
 { "role": "system", "content": "You are a direct, unfiltered technical assistant. Answer concisely." },
 { "role": "user", "content": "Explain how abliteration changes a model." }
 ]
 }'

Le même appel avec le SDK Python d'OpenAI, simplement redirigé vers z.ai :

from openai import OpenAI

client = OpenAI(
 api_key="YOUR_ZAI_KEY",
 base_url="https://api.z.ai/api/paas/v4/",
)

resp = client.chat.completions.create(
 model="glm-5.2",
 temperature=0.7,
 extra_body={"thinking": {"type": "disabled"}},
 messages=[
 {"role": "system", "content": "You are a direct, unfiltered technical assistant."},
 {"role": "user", "content": "Explain how abliteration changes a model."},
 ],
)
print(resp.choices[0].message.content)

Deux choses importent ici. Votre invite système est la vôtre, vous pouvez donc orienter directement le ton et la portée au lieu d'hériter des paramètres par défaut de l'application. Et thinking: {"type": "disabled"} saute l'étape de raisonnement lorsque vous souhaitez une sortie brute et rapide. Pour l'ensemble complet des paramètres, consultez le guide de l'API GLM-5.2.

Les prix évoluent, alors vérifiez en direct avant d'établir votre budget : au moment de la rédaction de cet article, des sources secondaires indiquent environ 1,40 $ par million de tokens en entrée et 4,40 $ par million de tokens en sortie. Confirmez les chiffres actuels sur la ventilation des prix de GLM-5.2, et si le coût est la contrainte réelle, lisez comment utiliser GLM-5.2 gratuitement.

Levier 2 : Auto-hébergez les poids ouverts

C'est la véritable réponse « sans restrictions ». Étant donné que les poids sont sous licence MIT, vous pouvez télécharger et servir GLM-5.2 vous-même. Lorsque le modèle s'exécute sur votre machine, il n'y a pas de filtre d'interface utilisateur de fournisseur ni de limite de débit externe. Vous définissez l'invite système, vous définissez la politique.

Le chemin le plus simple est Ollama :

ollama run glm-5.2

Vérification de la réalité matérielle : GLM-5.2 est un modèle MoE d'environ 753 milliards de paramètres, donc les poids complets nécessitent une VRAM sérieuse. Pour la plupart des gens, cela signifie une version quantifiée, un boîtier multi-GPU loué ou une variante GLM plus petite. Si votre matériel est modeste, GLM-4.7-Flash fonctionne localement avec beaucoup moins de ressources et constitue un excellent substitut pendant que vous construisez le pipeline. Le guide général pour exécuter GLM localement et la procédure de configuration d'Ollama couvrent le reste.

Une fois qu'il est servi localement, Ollama expose son propre point de terminaison compatible OpenAI à http://localhost:11434/v1, de sorte que le même code du Levier 1 fonctionne en modifiant uniquement l'URL de base.

Levier 3 : Versions « ablitérées » non censurées par la communauté

Le réglage d'instruction est l'endroit où résident les refus. La communauté open source supprime ce comportement grâce à un processus appelé « ablitération », qui supprime la directive interne qui déclenche un refus sans un réentraînement complet. La même technique alimente les versions non censurées d'autres modèles ouverts, y compris QwQ et DeepSeek R1.

Étant donné que les poids de GLM-5.2 sont ouverts et sous licence MIT, cette technique s'applique ici aussi. Une version « ablitérée » de GLM-5.2 prête à l'emploi n'est pas encore garantie d'être disponible, et la disponibilité change souvent, alors recherchez-en une actuelle sur Hugging Face plutôt que de supposer qu'elle existe. Si une version 5.2 n'est pas disponible, le processus est identique aux guides QwQ et DeepSeek R1 : téléchargez les poids « ablitérés », chargez-les dans Ollama ou vLLM, et servez.

C'est le moyen le plus complet de supprimer les refus intégrés, et c'est aussi celui qui vous confère le plus de responsabilités. Lisez la section sur la responsabilité avant de le déployer.

Levier 4 : Choisissez un fournisseur qui vous permet de définir la politique

Si vous ne souhaitez pas gérer votre propre machine, un fournisseur de routage est un compromis. GLM-5.2 est répertorié sur OpenRouter sous le nom z-ai/glm-5.2 et dans la bibliothèque Ollama. Un routeur vous permet d'appliquer vos propres paramètres de modération et d'échanger l'hôte sous-jacent sans réécrire votre application, ce qui contourne le filtre de l'interface utilisateur grand public tout en conservant un point de terminaison géré.

Cet article s'inscrit dans un tour d'horizon plus large des LLM sans restrictions si vous souhaitez comparer GLM-5.2 à d'autres options ouvertes avant de vous engager.

Testez chaque configuration dans Apidog avant de déployer

Quel que soit le levier que vous choisissez, vous vous retrouvez avec un point de terminaison compatible OpenAI. Confirmez qu'il se comporte comme vous l'attendez avant de l'intégrer à un produit. Apidog est un moyen propre de le faire car vous pouvez inspecter la réponse de streaming brute, et pas seulement le texte final.

  1. Créez une nouvelle requête dans Apidog pointant vers votre point de terminaison (https://api.z.ai/api/paas/v4/chat/completions pour l'API hébergée, ou http://localhost:11434/v1/chat/completions pour une version locale).
  2. Ajoutez l'en-tête Authorization: Bearer <key> pour l'API hébergée. Ollama local n'a pas besoin de clé.
  3. Envoyez un corps chat/completions avec model: glm-5.2, votre message system, et stream: true.
  4. Observez le flux SSE. Vous pouvez voir les deltas de « pensée » et les deltas de contenu séparément, ainsi que l'objet usage avec le nombre de tokens.
  5. Activez et désactivez la « pensée » et comparez les deux réponses côte à côte.

C'est ainsi que vous vérifiez que votre invite système a bien pris effet et que le modèle répond comme votre configuration choisie le promet, au lieu de le découvrir en production.

Un mot sur la responsabilité

Supprimer les filtres de produit et exécuter des poids non censurés est légitime. C'est courant pour la recherche, le « red-teaming » et la construction de votre propre modération au lieu d'hériter de celle de quelqu'un d'autre. Mais une fois que vous auto-hébergez, la modération est la vôtre, tout comme l'exposition légale. Moins de garde-fous signifie que vous assumez le résultat. Gardez trois choses à l'esprit :

FAQ

GLM-5.2 est-il vraiment open source ?

Les poids sont publiés sous licence MIT, l'une des licences les plus permissives disponibles. Vous pouvez les exécuter, les modifier et les auto-héberger, y compris pour un usage commercial, sous réserve des termes de la licence. Pour l'identité complète et les spécifications, consultez qu'est-ce que GLM-5.2.

L'API GLM-5.2 censure-t-elle les réponses ?

Le modèle d'instruction intègre l'alignement de son réglage, il peut donc refuser certaines invites. L'API vous donne le contrôle de l'invite système et vous permet de désactiver la « pensée », ce qui résout la plupart des problèmes de ton et de refus excessifs. Pour supprimer entièrement les refus intégrés, auto-hébergez une version « ablitérée ».

Puis-je exécuter GLM-5.2 sur un ordinateur portable ?

Pas le modèle complet de 753 milliards. Utilisez une version quantifiée, un boîtier GPU loué ou une variante GLM plus petite comme GLM-4.7-Flash pour les tests locaux, puis dirigez le même code vers le modèle plus grand lorsque vous en avez besoin.

GLM-5.2 est-il verrouillé par région ?

Non. Les poids sont sous licence MIT sans restrictions régionales. La disponibilité de l'API hébergée peut varier selon le fournisseur, mais l'auto-hébergement est ouvert à tous.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API