Comment le GLM-5.3-Flash débridé cesse de refuser le travail légitime

Le GLM-5.3-Flash non censuré fait passer le sur-refus bénin de 2,4% à 0,4%. Ce que vous en tirez, ce que révèlent les évaluations, et pourquoi le refus plafonne à 11%.

Medy Evrard

1 September 2026

Comment le GLM-5.3-Flash débridé cesse de refuser le travail légitime

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

TL;DR: OrcaRouter a publié des poids "abliterated" pour GLM-5.3-Flash, un modèle MoE de 320 milliards de paramètres avec 18 milliards actifs, en deux temps : le block-FP8 natif le 29 août 2026, et une version NVFP4 pour les GPU NVIDIA le 31 août. Les conversions GGUF et MLX sont également disponibles. Les taux de refus rapportés par le fournisseur chutent fortement, par exemple MaliciousInstruct de 96% à 11%, mais pas à zéro. L'affirmation la plus intéressante n'est pas du tout la décensure : OrcaRouter affirme qu'une partie de l'alignement de GLM-5.3-Flash n'est pas médiatisée par une seule direction de refus linéaire, ce qui rendrait l'entraînement de sécurité de Z.ai structurellement plus profond que les modèles que cette technique cible habituellement.

L'ablitération est devenue routinière. Quelqu'un prend un modèle à poids ouverts, identifie la direction interne associée au refus, la supprime et télécharge le résultat. La plupart de ces publications sont sans intérêt, et la plupart des couvertures sont soit dithyrambiques, soit réprimandantes.

Celui-ci mérite d'être lu attentivement, pour une raison qui n'a rien à voir avec ce que le modèle dira désormais. Les notes de version contiennent un résultat négatif sur la façon dont l'alignement est représenté à l'intérieur d'un modèle frontal à poids ouverts, et les résultats négatifs en interprétabilité sont plus rares et plus utiles qu'un autre point de contrôle non censuré.

Ce qui a été réellement publié

Deux annonces, à deux jours d'intervalle, plus un déploiement de formats plus discret depuis.

OrcaRouter a publié des poids non censurés pour GLM-5.3-Flash avec la précision originale block-FP8, ce qui signifie aucune étape de requantification entre le modèle de base et le modèle modifié. 320 milliards de paramètres avec 18 milliards actifs, correspondant à l'architecture du modèle de base, que nous avons couvert dans ce qu'est GLM-5.3-Flash et comment il se compare à GLM-5.3. Le message a depuis dépassé les 2 millions de vues.

31 août 2026 : NVFP4. Une deuxième version ciblant le format à virgule flottante 4 bits de NVIDIA, présentée comme ayant une empreinte plus petite et une inférence plus rapide. Environ 75 000 vues, ce qui indique que la publication de ce format intéresse un public beaucoup plus restreint que l'original.

Depuis lors : GGUF et MLX. Les deux annonces mentionnaient la venue d'autres formats quantifiés. En vérifiant l'organisation Hugging Face le 1er septembre 2026, GLM-5.3-Flash-Uncensored-GGUF et GLM-5.3-Flash-Uncensored-MLX existent tous deux, de sorte que les chemins llama.cpp et Apple Silicon sont arrivés. Les téléchargements pour ces deux-là étaient encore à zéro lorsque nous avons regardé, et la version NVFP4 était à 5, contre 1 541 pour l'original FP8. L'attention est portée sur l'annonce, pas encore sur les artefacts.

Il est à noter pour le contexte : il s'agit d'une ligne de produits, pas d'un cas unique. La même organisation héberge des versions "abliterated" de Qwen3.8-27B, qui a attiré plus de 300 000 téléchargements rien que pour sa version FP8, Qwen3.8-Flash-Next, et Gemma-4-26B. La publication de GLM est la dernière entrée dans un catalogue existant.

Les poids sont sous licence MIT et listent zai-org/GLM-5.3-Flash comme modèle de base. La carte du modèle le qualifie d'abliterated, vision-langage, MoE et capable d'appeler des fonctions, de sorte que les surfaces multimodales et d'utilisation d'outils du modèle de base sont incluses.

Ce que signifie « pas de LoRA, pas de prompt de jailbreak »

Le libellé de l'annonce a une réelle importance, et il vaut la peine de le décortiquer car il le distingue des deux choses que la plupart des gens imaginent.

Un prompt de jailbreak manipule un modèle au moment de l'inférence. L'entraînement de sécurité est intact ; vous contournez la sécurité. C'est fragile, ça se corrige, et ça vous coûte du contexte à chaque requête.

Un adaptateur LoRA est un petit ensemble de poids supplémentaires superposés au moment du chargement. Le modèle de base est inchangé et l'adaptateur peut être retiré. C'est une modification que vous attachez.

L'ablitération identifie la direction d'activation interne qui correspond au comportement de refus et la supprime des poids eux-mêmes. Il n'y a rien à attacher et rien à retirer. Le comportement de refus a disparu de l'artefact, il n'est pas supprimé à l'exécution.

Cette distinction est importante en pratique. Vous ne pouvez pas auditer un modèle "abliterated" en vérifiant les adaptateurs ou en scannant les prompts, car le changement se situe dans les poids. Si vous exécutez des modèles ouverts dans un environnement où la provenance est importante, vérifier la lignée du modèle de base par rapport au point de contrôle réel est désormais une véritable question de chaîne d'approvisionnement. Notre approche générale pour restreindre ce que les modèles sont autorisés à faire se trouve dans les garde-fous des agents IA.

Les chiffres de refus

Ce sont les chiffres rapportés par OrcaRouter, avant et après, et aucune réplication indépendante n'existait au moment de la rédaction. Traitez-les comme des chiffres rapportés par le fournisseur.

Benchmark Refus de base Après ablitération
MaliciousInstruct 96% 11%
JailbreakBench 93% 12%
AdvBench 97% 15%
HarmBench 93% 18%
XSTest sur-refus bénin 2.4% 0.4%

Lisez la dernière ligne différemment des quatre premières. XSTest mesure le sur-refus, c'est-à-dire le modèle qui refuse des requêtes inoffensives qui correspondent superficiellement à quelque chose de risqué. C'est le mode de défaillance que les développeurs rencontrent réellement en production : un modèle refusant d'aider à déboguer un flux de connexion parce que le mot « mot de passe » est apparu, ou refusant d'écrire un scanner de réseau pour votre propre infrastructure. Passer de 2,4 % à 0,4 % est la ligne qui a une valeur légitime au quotidien, et c'est celle que presque personne ne cite.

Les quatre premières lignes sont celles qui en font un artefact de recherche plutôt qu'un outil de productivité, et c'est pourquoi la licence et votre législation locale sont plus importantes que d'habitude ici.

Ce que vous gagnez réellement

La plupart des articles sur les modèles "abliterated" discutent de leur existence sans jamais aborder la raison pour laquelle un ingénieur en activité en utiliserait un. Il y a quatre avantages réels, et ce ne sont pas ceux que les chiffres en titre suggèrent.

Il cesse de refuser un travail qui n'a jamais été nuisible. C'est le point principal, et c'est la ligne XSTest : le sur-refus bénin passant de 2,4% à 0,4%. Le sur-refus est la taxe que chaque développeur paie déjà sur les modèles réglés pour la sécurité. Le modèle qui ne vous aidera pas à déboguer un flux de réinitialisation de mot de passe parce qu'il a vu le mot « mot de passe ». Celui qui refuse d'écrire un scanneur de ports pour une infrastructure que vous possédez. Celui qui refuse de résumer un rapport de menace parce que le rapport décrit des menaces. Rien de tout cela n'est une victoire en matière de sécurité ; c'est un modèle qui ne parvient pas à distinguer un sujet d'une intention, et vous en payez le prix en réessais, en prompts reformulés et en tâches abandonnées. Réduire ce taux par six est l'avantage le plus susceptible de se manifester dans votre semaine.

Pas de taxe par requête et rien à casser. L'alternative que les gens utilisent réellement aujourd'hui est l'ingénierie de prompt pour contourner le refus. Cela coûte du contexte sur chaque appel, produit des résultats incohérents et cesse de fonctionner chaque fois que le fournisseur le corrige. La modification au niveau des poids n'a aucune de ces propriétés. Le comportement est une propriété de l'artefact, il est donc stable à travers les requêtes et ne change pas silencieusement sans votre connaissance un mardi.

Les poids ouverts signifient que le déploiement vous appartient. Sous licence MIT, auto-hébergeable et épinglable à un point de contrôle exact. Vos prompts et documents restent à l'intérieur de votre infrastructure plutôt que de transiter par un fournisseur. Vous n'êtes pas exposé à un fournisseur qui resserre ses filtres en milieu de trimestre et qui casse un workflow que vous avez livré. Pour les environnements réglementés, ce contrôle est souvent l'objectif, et le même argument s'applique aux poids non modifiés, c'est pourquoi nous avons écrit l'auto-hébergement des poids ouverts de GLM-5.3.

La surface de capacité survit. La carte du modèle liste toujours la vision-langage et l'appel de fonctions, ce n'est donc pas une version simplifiée, textuelle uniquement. Les chemins multimodaux et d'utilisation d'outils du modèle de base sont inclus, ce qui est important si vous prévoyiez de l'utiliser pour quelque chose d'agentique plutôt que pour le chat.

Maintenant, les limites honnêtes de tout cela. Aucun de ces avantages n'est une amélioration de capacité. L'ablitération est une modification comportementale, les travaux publiés sur cette technique trouvent généralement un certain coût en qualité, et aucune des annonces ne rapporte si les performances de raisonnement, de codage ou de vision ont évolué. Vous échangez une réduction mesurée du refus contre un risque non mesuré de dégradation. Et toutes les décisions de filtrage que le modèle de base prenait vous incombent désormais, ce qui représente un coût réel en personnel et en surveillance plutôt qu'une économie.

La partie réellement intéressante

Enfouie à la fin de l'annonce se trouve la découverte qui mérite la lecture.

Le refus ne tombe pas uniformément à zéro. Sur quatre benchmarks de danger, il se situe entre 11 % et 18 %, et non entre 0 % et 2 %. L'interprétation déclarée par OrcaRouter est qu'une partie de l'alignement de GLM-5.3-Flash n'est pas médiatisée par une seule direction de refus linéaire, et que Z.ai a peut-être construit un mécanisme de refus substantiellement plus profond que ce que cette technique rencontre habituellement.

C'est une affirmation sur les mécanismes internes du modèle, et si elle se confirme, elle est plus significative que la publication elle-même.

Le modèle mental standard pour l'ablitération est que le refus est largement une direction dans l'espace d'activation. Trouvez-la, supprimez-la, et le comportement s'effondre. Cela a suffisamment bien fonctionné sur suffisamment de modèles pour que les gens le considèrent comme acquis. Un modèle où cette procédure vous fait passer de 96 % à 11 % mais s'y arrête est la preuve que le modèle mental est incomplet, du moins pour ce modèle, et qu'un certain alignement survit sous une forme que la technique n'atteint pas.

Deux mises en garde honnêtes. Premièrement, il s'agit de l'interprétation d'un laboratoire de ses propres résultats, et l'explication alternative est simplement que leur implémentation a laissé des performances sur la table. Deuxièmement, un taux de refus résiduel de 11 % à 18 % n'est pas une propriété de sécurité sur laquelle quiconque devrait se fier. Un modèle qui refuse 15 % des requêtes dangereuses n'est pas un modèle sûr ; c'est un modèle peu fiable.

Pourtant, « notre technique a atteint un plafond et nous pensons que la raison est architecturale » est le genre de chose que les laboratoires omettent généralement de mentionner dans un article de lancement. Le fait qu'OrcaRouter présente la publication comme un artefact pour étudier comment l'alignement est représenté, plutôt que comme une simple baisse de capacité, est la meilleure façon de publier ce travail.

Affirmations à vérifier

Deux points dans la discussion environnante méritent un certain scepticisme, et les signaler n'est pas une critique de la publication.

« Intelligence de niveau Claude Opus 4.8. » Un article de suivi a décrit la publication comme armant les défenseurs d'une intelligence de ce niveau. Aucun benchmark n'accompagnait l'affirmation, et il s'agit d'une comparaison avec une version de modèle qui n'est pas la génération Opus actuelle. Traitez cela comme du marketing. Si la parité de capacité est importante pour votre cas d'utilisation, effectuez votre propre évaluation.

Les taux de refus comme indicateur de capacité. Un faible refus n'est pas une capacité élevée. L'ablitération est une modification comportementale, et les travaux publiés sur cette technique révèlent généralement une certaine dégradation des performances générales comme coût. Rien dans aucune des annonces n'indique si les performances de raisonnement, de codage ou de vision ont évolué par rapport au modèle de base, et c'est le chiffre que la plupart des lecteurs voudraient réellement. Notre couverture des benchmarks et des prix du modèle non modifié se trouve dans les prix de GLM-5.3-Flash et le guide de l'API GLM-5.3-Flash.

L'exécuter, et la réalité matérielle

320 milliards de paramètres n'est pas un modèle pour ordinateur portable, même avec 18 milliards actifs. Les formats désormais disponibles déterminent qui peut le faire fonctionner de manière réaliste :

Si vous auto-hébergez plutôt que d'appeler un endpoint hébergé, nos tutoriels pour le modèle de base s'appliquent directement : exécuter GLM-5.3-Flash localement et auto-héberger les poids ouverts de GLM-5.3. Pour un contexte plus large sur cette catégorie, nous maintenons un aperçu des LLM non censurés et un examen des LLM sans restrictions, et la publication ablitérate de DeepSeek R1 est la comparaison antérieure la plus proche.

Évaluer cela est un problème de test d'API

Voici la partie pratique, et c'est celle que la plupart des couvertures ignorent totalement.

Si vous faites un travail légitime avec un modèle comme celui-ci, c'est-à-dire de la recherche en sécurité, des exercices d'équipes rouge et bleue, ou une évaluation défensive de ce que vos propres filtres détectent, alors le vrai travail consiste à exécuter une suite de requêtes large et reproductible contre un point de terminaison et à affirmer ce qui est renvoyé. C'est du test d'API. Ce n'est pas une discipline nouvelle juste parce que le corps de la réponse contient la sortie du modèle.

Les problèmes spécifiques que vous rencontrez :

C'est exactement à cela que sert une plateforme API. Dans Apidog, vous définissez le point de terminaison une fois, conservez la suite de prompts comme une collection enregistrée, affirmez sur les champs de réponse, échangez l'URL de base entre les fournisseurs ou les quantifications via des variables d'environnement, et exécutez le tout en CI pour que les chiffres soient reproductibles plutôt qu'anecdotiques. Nous avons examiné les mécanismes par rapport au modèle non modifié dans le test de l'API GLM-5.3-Flash avec Apidog, et la même configuration pointe vers tout point de terminaison compatible OpenAI.

Le principe général s'applique bien au-delà de ce modèle : une fois que le comportement du modèle devient quelque chose que vous devez mesurer et défendre, vous avez besoin de la même discipline que celle que vous appliqueriez à tout autre contrat API. Téléchargez Apidog si votre évaluation se trouve actuellement dans un carnet que personne d'autre ne peut réexécuter. Articles connexes : fiabilité des agents IA en production.

Le travail d'équipe rouge nécessite une piste d'audit, pas un terminal

Le deuxième problème pratique est organisationnel, et pour cette catégorie de travail, il n'est pas facultatif.

L'exécution de benchmarks de prompts nuisibles contre un modèle "abliterated" est exactement le type d'activité qui doit être approuvée avant de se produire et attribuable après. Qui l'a exécuté. Contre quel point de contrôle. Avec l'approbation de qui. Sous quelle portée. Si cet enregistrement se trouve dans l'historique du shell d'un chercheur, vous n'avez pas de programme de recherche, vous avez une responsabilité.

Sharkly est conçu pour un travail qui doit survivre à la session, et ce cas d'utilisation s'y prête particulièrement bien :

Un modèle non censuré est un outil de recherche. Les outils de recherche utilisés sans enregistrement sont la raison pour laquelle les organisations finissent par être incapables d'expliquer ce qui s'est passé.

La réalité juridique et sécuritaire

Bref et mérite d'être énoncé clairement.

La licence MIT sur les poids régit les poids. Elle ne vous donne pas la permission de faire des choses illégales avec la sortie, et elle ne vous décharge pas de votre responsabilité. La loi locale, la politique de votre employeur et toutes les conditions de la plateforme sous lesquelles vous opérez s'appliquent toujours, et aucune d'entre elles ne se soucie du fait que le modèle n'ait pas refusé.

Les usages raisonnables sont ceux que la publication mentionne : recherche en sécurité, travail d'interprétabilité, exercices d'équipes rouge et bleue, et étude des mécanismes de refus. L'amélioration du sur-refus XSTest est aussi un argument légitime au quotidien, pour les équipes dont le vrai problème est un modèle qui n'aidera pas avec l'ingénierie de sécurité ordinaire.

Si vous déployez un modèle auprès d'utilisateurs finaux, un point de contrôle non censuré transfère l'intégralité de la charge de filtrage sur votre propre pile. C'est une décision de conception avec des implications en termes de personnel et de surveillance, et non un simple drapeau de configuration.

FAQ

GLM-5.3-Flash-Uncensored est-il le même modèle que GLM-5.3-Flash ? Même architecture et mêmes poids de base, 320 milliards de paramètres avec 18 milliards actifs, avec le comportement de refus supprimé. La couverture du modèle de base se trouve dans ce qu'est GLM-5.3-Flash.

Les chiffres d'évaluation sont-ils vérifiés indépendamment ? Non. Chaque chiffre de l'annonce est le résultat rapporté par OrcaRouter, et aucune réplication tierce n'existait lorsque nous avons écrit ceci. Les benchmarks nommés sont réels et publics, la réplication est donc possible si vous avez le matériel.

Quel format dois-je utiliser ? FP8 est l'artefact de référence et celui sur lequel les évaluations ont été effectuées. NVFP4 est la voie pratique pour un seul nœud NVIDIA. GGUF et MLX existent maintenant et sont la voie pour les postes de travail et les configurations Apple Silicon. Attendez-vous à ce que le comportement change avec la quantification, c'est précisément pourquoi vous voulez une suite de tests reproductible plutôt qu'un ressenti.

L'ablitération nuit-elle aux performances générales ? Les travaux publiés sur cette technique trouvent généralement une certaine dégradation, et aucune des annonces ne l'aborde pour ce modèle. Si la capacité est importante pour vous, comparez-la vous-même au modèle de base plutôt que de supposer la parité.

Pourquoi le refus s'est-il arrêté à 11 à 18 pour cent au lieu de zéro ? C'est la question ouverte et la chose la plus intéressante de la publication. Le point de vue déclaré par OrcaRouter est qu'une partie de l'alignement n'est pas portée par une seule direction de refus linéaire. L'explication concurrente est une implémentation incomplète. Dans tous les cas, ne traitez pas le taux résiduel comme une caractéristique de sécurité.

Puis-je l'utiliser commercialement ? Les poids sont sous licence MIT, ce qui est permissif. Il s'agit d'une réponse de licence, pas d'une réponse juridique ou politique pour votre déploiement spécifique. Demandez à votre équipe juridique, surtout si la sortie atteint les utilisateurs finaux.

En résumé

Deux publications de format en trois jours, 2 millions de vues sur la première, et un catalogue de modèles "abliterated" derrière eux. La décensure elle-même est routinière à ce stade.

La partie à retenir est le résultat négatif. Une technique qui réduit de manière fiable le refus dans la plupart des modèles ouverts a fait passer GLM-5.3-Flash de 96 % à 11 % et s'est arrêtée, et le laboratoire qui l'a fait l'a dit publiquement au lieu d'arrondir. Si cela tient la route après une réplication indépendante, cela en dit long sur la façon dont Z.ai a entraîné ce modèle, et c'est une meilleure contribution que le point de contrôle.

Si vous comptez travailler avec, faites les parties ennuyeuses correctement. Mesurez le comportement avec une suite de requêtes reproductible que vous pouvez pointer vers n'importe quel point de terminaison et réexécuter le mois prochain, ce à quoi sert Apidog. Conservez un enregistrement de qui a exécuté quoi contre quels poids et qui l'a approuvé, ce à quoi sert Sharkly.

bouton

Un modèle non censuré n'enlève pas l'obligation de savoir ce que vous avez exécuté. Il l'augmente.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API