Wie unzensiertes GLM-5.3-Flash keine legitimen Aufgaben mehr ablehnt

Unzensierter GLM-5.3-Flash senkt gutartige Überablehnung von 2,4 % auf 0,4 %. Was Sie gewinnen, was die Auswertungen zeigen und warum die Ablehnung bei 11 % stoppt.

Medy Evrard

1 September 2026

Wie unzensiertes GLM-5.3-Flash keine legitimen Aufgaben mehr ablehnt

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

TL;DR: OrcaRouter veröffentlichte abliterierte Gewichte für GLM-5.3-Flash, ein Mixture-of-Experts-Modell mit 320B Parametern und 18B aktiven, in zwei Schritten: native Block-FP8 am 29. August 2026 und ein NVFP4-Build für NVIDIA GPUs am 31. August. GGUF- und MLX-Konvertierungen sind jetzt ebenfalls live. Die vom Anbieter gemeldeten Ablehnungsraten sinken stark, zum Beispiel MaliciousInstruct von 96% auf 11%, aber nicht auf null. Die interessanteste Behauptung ist überhaupt nicht die Entzensurierung: OrcaRouter sagt, dass ein Teil der Ausrichtung von GLM-5.3-Flash nicht durch eine einzelne lineare Ablehnungsrichtung vermittelt wird, was das Sicherheitstraining von Z.ai strukturell tiefer machen würde als die Modelle, auf die diese Technik normalerweise abzielt.

Abliterierung ist Routine geworden. Jemand nimmt ein Open-Weights-Modell, identifiziert die interne Richtung, die mit der Ablehnung verbunden ist, entfernt sie und lädt das Ergebnis hoch. Die meisten dieser Veröffentlichungen sind unspektakulär, und die meisten Berichte sind entweder atemlos oder tadelnd.

Diese ist es wert, sorgfältig gelesen zu werden, aus einem Grund, der nichts damit zu tun hat, was das Modell jetzt sagen wird. Die Versionshinweise enthalten ein negatives Ergebnis darüber, wie die Ausrichtung in einem bahnbrechenden Open-Weights-Modell dargestellt wird, und negative Ergebnisse in der Interpretierbarkeit sind seltener und nützlicher als ein weiterer unzensierter Checkpoint.

Was tatsächlich veröffentlicht wurde

Zwei Ankündigungen, zwei Tage auseinander, plus eine leisere Format-Einführung seitdem.

OrcaRouter veröffentlichte unzensierte Gewichte für GLM-5.3-Flash in der ursprünglichen Block-FP8-Präzision, was bedeutet, dass kein Rekompaktierungsschritt zwischen dem Basismodell und dem modifizierten Modell erfolgte. 320B Parameter mit 18B aktiven, passend zur Architektur des Basismodells, die wir in was GLM-5.3-Flash ist und wie es sich von GLM-5.3 unterscheidet behandelt haben. Der Beitrag hat seitdem über 2 Millionen Aufrufe erreicht.

31. August 2026: NVFP4. Ein zweiter Build, der NVIDIAs 4-Bit-Gleitkommaformat verwendet, angepriesen mit geringerem Platzbedarf und schnellerer Inferenz. Ungefähr 75.000 Aufrufe, was zeigt, dass das Format-Release ein viel engeres Publikum anspricht als das Original.

Seitdem: GGUF und MLX. Beide Ankündigungen besagten, dass weitere quantisierte Formate kommen würden. Bei der Überprüfung der Hugging Face Organisation am 1. September 2026 existieren sowohl GLM-5.3-Flash-Uncensored-GGUF als auch GLM-5.3-Flash-Uncensored-MLX, sodass llama.cpp- und Apple Silicon-Pfade etabliert wurden. Die Downloads für diese beiden waren, als wir nachsahen, noch bei null, und der NVFP4-Build bei 5, gegenüber 1.541 für das FP8-Original. Die Aufmerksamkeit gilt der Ankündigung, noch nicht den Artefakten.

Es ist wichtig zu beachten: Dies ist eine Produktlinie, keine einmalige Sache. Dieselbe Organisation hostet abliterierte Builds von Qwen3.8-27B, das allein in seinem FP8-Build über 300.000 Downloads verzeichnete, Qwen3.8-Flash-Next und Gemma-4-26B. Die GLM-Veröffentlichung ist der neueste Eintrag in einem bestehenden Katalog.

Die Gewichte tragen eine MIT-Lizenz und listen zai-org/GLM-5.3-Flash als Basismodell. Die Modellkarte kennzeichnet es als abliteriert, Vision-Sprach-, MoE- und Funktionsaufruf-fähig, sodass die multimodalen und Werkzeugnutzungs-Oberflächen des Basismodells übernommen werden.

Was „kein LoRA, kein Jailbreak-Prompt“ bedeutet

Die Formulierung in der Ankündigung hat eine wichtige Bedeutung und es lohnt sich, sie zu entpacken, weil sie dies von den zwei Dingen unterscheidet, die sich die meisten Menschen vorstellen.

Ein Jailbreak-Prompt manipuliert ein Modell zur Inferenzzeit. Das Sicherheitstraining ist intakt; man redet daran vorbei. Es ist fragil, wird geflickt und kostet bei jeder Anfrage Kontext.

Ein LoRA-Adapter ist ein kleiner Satz zusätzlicher Gewichte, die zur Ladezeit hinzugefügt werden. Das Basismodell bleibt unverändert und der Adapter kann entfernt werden. Es ist eine Modifikation, die man anbringt.

Abliterierung identifiziert die interne Aktivierungsrichtung, die dem Ablehnungsverhalten entspricht, und entfernt sie aus den Gewichten selbst. Es gibt nichts anzubringen und nichts zu entfernen. Das Ablehnungsverhalten ist aus dem Artefakt verschwunden, nicht zur Laufzeit unterdrückt.

Diese Unterscheidung ist praktisch wichtig. Sie können ein abliteriertes Modell nicht prüfen, indem Sie nach Adaptern suchen oder Prompts scannen, da die Änderung in den Gewichten liegt. Wenn Sie offene Modelle in einer Umgebung betreiben, in der die Herkunft wichtig ist, ist die Überprüfung der Basismodell-Abstammung gegenüber dem tatsächlichen Checkpoint nun eine echte Frage der Lieferkette. Unsere allgemeine Ansicht zur Einschränkung dessen, was Modelle tun dürfen, finden Sie in KI-Agenten-Guardrails.

Die Ablehnungszahlen

Dies sind OrcaRouters eigene gemeldete Zahlen, vorher und nachher, und zum Zeitpunkt der Erstellung gab es keine unabhängige Replikation. Behandeln Sie sie als vom Anbieter gemeldet.

Benchmark Basis-Ablehnung Nach Abliterierung
MaliciousInstruct 96% 11%
JailbreakBench 93% 12%
AdvBench 97% 15%
HarmBench 93% 18%
XSTest benigne Überablehnung 2.4% 0.4%

Lesen Sie die letzte Zeile anders als die ersten vier. XSTest misst die Überablehnung, d.h. dass das Modell harmlose Anfragen ablehnt, die oberflächlich etwas Riskantem ähneln. Das ist der Fehlermodus, auf den Entwickler in der Produktion tatsächlich stoßen: ein Modell, das sich weigert, beim Debuggen eines Anmeldevorgangs zu helfen, weil das Wort „Passwort“ vorkam, oder das Ablehnen, einen Netzwerk-Scanner für die eigene Infrastruktur zu schreiben. Von 2,4% auf 0,4% zu gehen, ist die Zeile mit dem legitimen Alltagsnutzen, und sie ist diejenige, die fast niemand zitiert.

Die ersten vier Zeilen machen dies zu einem Forschungsartefakt und nicht zu einem Produktivitätswerkzeug, und deshalb sind die Lizenz und Ihr lokales Recht hier wichtiger als üblich.

Was Sie tatsächlich gewinnen

Die meisten Berichte über abliterierte Modelle diskutieren, ob sie existieren sollten, und kommen nie dazu, warum ein arbeitender Ingenieur nach einem greifen würde. Es gibt vier echte Vorteile, und es sind nicht die, die die Schlagzeilenzahlen suggerieren.

Es weigert sich nicht mehr, Arbeit zu verrichten, die niemals schädlich war. Das ist der große Punkt und es ist die XSTest-Zeile: gutartige Überablehnung fällt von 2,4 % auf 0,4 %. Überablehnung ist die Steuer, die jeder Entwickler bereits für sicherheitsoptimierte Modelle zahlt. Das Modell, das Ihnen nicht hilft, einen Passwort-Reset-Vorgang zu debuggen, weil es das Wort „Passwort“ gesehen hat. Dasjenige, das sich weigert, einen Port-Scanner für Ihre eigene Infrastruktur zu schreiben. Dasjenige, das sich weigert, einen Bedrohungsbericht zusammenzufassen, weil der Bericht Bedrohungen beschreibt. Nichts davon ist ein Sicherheitsgewinn; es ist ein Modell, das nicht zwischen einem Thema und einer Absicht unterscheiden kann, und Sie zahlen dafür mit Wiederholungen, umformulierten Prompts und abgebrochenen Aufgaben. Diese Rate um das Sechsfache zu senken, ist der Vorteil, der am wahrscheinlichsten in Ihrer Woche auftaucht.

Keine Gebühr pro Anfrage und nichts, was kaputtgehen kann. Die Alternative, die Menschen heute tatsächlich nutzen, ist Prompt-Engineering um die Ablehnung herum. Das kostet bei jedem einzelnen Aufruf Kontext, führt zu inkonsistenten Ergebnissen und funktioniert nicht mehr, sobald der Anbieter es patcht. Eine Modifikation auf Gewichtsebene hat keine dieser Eigenschaften. Das Verhalten ist eine Eigenschaft des Artefakts, daher ist es stabil über Anfragen hinweg und ändert sich nicht stillschweigend an einem Dienstag unter Ihnen.

Offene Gewichte bedeuten, dass die Bereitstellung Ihnen gehört. MIT-lizenziert, selbst-hostbar und auf einen exakten Checkpoint festlegbar. Ihre Prompts und Dokumente bleiben innerhalb Ihrer Infrastruktur, anstatt einen Anbieter zu durchlaufen. Sie sind nicht der Gefahr ausgesetzt, dass ein Anbieter seine Filter mitten im Quartal verschärft und einen von Ihnen bereitgestellten Workflow unterbricht. Für regulierte Umgebungen ist diese Kontrolle oft der Punkt, und das gleiche Argument gilt für die unmodifizierten Gewichte, weshalb wir GLM-5.3 Open Weights selbst hosten geschrieben haben.

Die Fähigkeitsoberfläche bleibt erhalten. Die Modellkarte listet immer noch Vision-Sprache und Funktionsaufrufe auf, dies ist also kein reiner Text-Stripped-Down-Build. Die multimodalen und Werkzeugnutzungspfade des Basismodells werden übernommen, was wichtig ist, wenn Sie es für agentische Zwecke anstelle von Chat verwenden möchten.

Nun die ehrliche Begrenzung all dessen. Keiner dieser Vorteile sind Fähigkeitsverbesserungen. Abliterierung ist eine Verhaltensänderung, veröffentlichte Arbeiten zu dieser Technik finden im Allgemeinen einen gewissen Qualitätsverlust, und keine der Ankündigungen berichtet, ob sich das Denk-, Code- oder Sehvermögen verändert hat. Sie tauschen eine gemessene Reduzierung der Ablehnung gegen ein ungemessenes Risiko der Degradation ein. Und jede Filterentscheidung, die das Basismodell getroffen hat, liegt nun bei Ihnen, was einen realen Personal- und Überwachungsaufwand darstellt und keinen gesparten.

Der tatsächlich interessante Teil

Am Ende der Ankündigung verborgen ist die Erkenntnis, die das Lesen wert ist.

Die Ablehnung geht nicht einheitlich auf null. Bei vier Schades-Benchmarks liegt sie zwischen 11% und 18%, nicht bei 0% bis 2%. OrcaRouters erklärte Interpretation ist, dass ein Teil der Ausrichtung von GLM-5.3-Flash nicht durch eine einzelne lineare Ablehnungsrichtung vermittelt wird und dass Z.ai möglicherweise einen wesentlich tieferen Ablehnungsmechanismus entwickelt hat, als diese Technik üblicherweise antrifft.

Das ist eine Behauptung über das Modellinnere, und wenn sie sich bewahrheitet, ist sie bedeutsamer als die Veröffentlichung selbst.

Das Standard-Denkmodell für Abliterierung besagt, dass Ablehnung weitgehend eine Richtung im Aktivierungsraum ist. Man findet sie, entfernt sie, und das Verhalten kollabiert. Das hat bei genügend Modellen gut genug funktioniert, dass es als gesichert gilt. Ein Modell, bei dem dieses Verfahren von 96% auf 11% führt, dort aber stagniert, ist ein Beweis dafür, dass das Denkmodell unvollständig ist, zumindest für dieses Modell, und dass ein Teil der Ausrichtung in einer Form überlebt, die die Technik nicht erreicht.

Zwei ehrliche Vorbehalte. Erstens ist dies die Interpretation eines Labors über sein eigenes Ergebnis, und die alternative Erklärung ist einfach, dass ihre Implementierung Leistung auf der Strecke gelassen hat. Zweitens ist eine restliche Ablehnungsrate von 11% bis 18% keine Sicherheitseigenschaft, auf die sich jemand verlassen sollte. Ein Modell, das 15% der schädlichen Anfragen ablehnt, ist kein sicheres Modell; es ist ein unzuverlässiges.

Trotzdem: „Unsere Technik stieß an eine Grenze, und wir glauben, der Grund dafür ist architektonisch“ ist die Art von Aussage, die Labore normalerweise in einem Launch-Post weglassen. OrcaRouter, das die Veröffentlichung als Artefakt zur Untersuchung der Darstellung von Alignment und nicht nur als Fähigkeitsfreigabe darstellt, ist die bessere Version, wie diese Arbeit veröffentlicht wird.

Behauptungen, die es wert sind, überprüft zu werden

Zwei Dinge im umgebenden Kontext verdienen Skepsis, und sie hervorzuheben ist keine Kritik an der Veröffentlichung.

„Intelligenz auf Claude Opus 4.8-Niveau.“ Ein Folgebeitrag beschrieb die Veröffentlichung als Bewaffnung der Verteidiger mit Intelligenz auf diesem Niveau. Kein Benchmark begleitete die Behauptung, und es handelt sich um einen Vergleich mit einer Modellversion, die nicht die aktuelle Opus-Generation ist. Behandeln Sie es als Marketing. Wenn die Fähigkeitsgleichheit für Ihren Anwendungsfall wichtig ist, führen Sie Ihre eigene Bewertung durch.

Ablehnungsraten als Fähigkeitsproxy. Eine niedrige Ablehnung ist keine hohe Fähigkeit. Abliterierung ist eine Verhaltensänderung, und veröffentlichte Arbeiten zu dieser Technik finden im Allgemeinen eine gewisse Verschlechterung der allgemeinen Leistung als Kosten. Nichts in beiden Ankündigungen geht darauf ein, ob sich die Denk-, Code- oder Sehleistung im Vergleich zum Basismodell verändert hat, und das ist die Zahl, die die meisten Leser tatsächlich wünschen würden. Unsere Benchmark- und Preisberichterstattung über das unmodifizierte Modell finden Sie in GLM-5.3-Flash-Preise und im GLM-5.3-Flash API-Leitfaden.

Betrieb und die Hardware-Realität

320B Parameter ist kein Laptop-Modell, selbst bei 18B aktiven. Die jetzt verfügbaren Formate bestimmen, wer es realistischerweise betreiben kann:

Wenn Sie selbst hosten, anstatt einen gehosteten Endpunkt aufzurufen, gelten unsere Anleitungen für das Basismodell direkt: GLM-5.3-Flash lokal ausführen und GLM-5.3 Open Weights selbst hosten. Für einen breiteren Kontext zu dieser Kategorie führen wir eine Übersicht über unzensierte LLMs und einen Blick auf LLMs ohne Einschränkungen, und die DeepSeek R1 abliterierte Veröffentlichung ist der nächstgelegene frühere Vergleich.

Die Bewertung ist ein API-Testproblem

Hier ist der praktische Teil, und es ist der Teil, den die meisten Berichterstattungen völlig auslassen.

Wenn Sie legitime Arbeit mit einem solchen Modell leisten, d.h. Sicherheitsforschung, Red- und Blue-Team-Übungen oder eine defensive Bewertung dessen, was Ihre eigenen Filter erfassen, dann besteht die eigentliche Arbeit darin, eine große, wiederholbare Reihe von Anfragen gegen einen Endpunkt auszuführen und zu prüfen, was zurückkommt. Das ist API-Tests. Es ist keine neue Disziplin, nur weil der Antworttext die Modellausgabe enthält.

Die spezifischen Probleme, auf die Sie stoßen:

Genau dafür ist eine API-Plattform da. In Apidog definieren Sie den Endpunkt einmal, speichern die Prompt-Suite als Sammlung, prüfen die Antwortfelder, tauschen die Basis-URL zwischen Anbietern oder Quantisierungen über Umgebungsvariablen aus und führen das Ganze in CI aus, damit die Zahlen reproduzierbar statt anekdotisch sind. Wir haben die Mechanik am unmodifizierten Modell in Testen der GLM-5.3-Flash API mit Apidog durchgesprochen, und dieselbe Einrichtung funktioniert für jeden OpenAI-kompatiblen Endpunkt.

Das allgemeine Prinzip gilt weit über dieses Modell hinaus: Sobald das Modellverhalten etwas wird, das Sie messen und verteidigen müssen, benötigen Sie dieselbe Disziplin, die Sie bei jedem anderen API-Vertrag anwenden würden. Laden Sie Apidog herunter, wenn Ihre Bewertung derzeit in einem Notizbuch lebt, das niemand sonst erneut ausführen kann. Verwandt: Produktions-KI-Agenten-Zuverlässigkeit.

Red-Team-Arbeit benötigt einen Audit-Trail, kein Terminal

Das zweite praktische Problem ist organisatorisch, und für diese Art von Arbeit ist es nicht optional.

Das Ausführen von Benchmarks für schädliche Prompts gegen ein abliteriertes Modell ist genau die Art von Aktivität, die genehmigt werden muss, bevor sie stattfindet, und danach nachvollziehbar sein muss. Wer hat es ausgeführt. Gegen welchen Checkpoint. Mit wessen Genehmigung. Unter welchem Umfang. Wenn dieser Datensatz in der Shell-Historie eines Forschers lebt, haben Sie kein Forschungsprogramm, Sie haben eine Verbindlichkeit.

Sharkly wurde für Arbeiten entwickelt, die die Sitzung überdauern müssen, und dieser Anwendungsfall passt ungewöhnlich gut dazu:

Ein unzensiertes Modell ist ein Forschungswerkzeug. Forschungswerkzeuge, die ohne Aufzeichnungen verwendet werden, führen dazu, dass Organisationen am Ende nicht erklären können, was passiert ist.

Die rechtliche und sicherheitstechnische Realität

Kurz und bündig gesagt.

Die MIT-Lizenz für die Gewichte regelt die Gewichte. Sie erteilt Ihnen keine Erlaubnis, illegale Dinge mit der Ausgabe zu tun, und sie überträgt die Haftung nicht von Ihnen weg. Lokales Recht, die Richtlinien Ihres Arbeitgebers und alle Plattformbedingungen, unter denen Sie agieren, gelten weiterhin, und keine davon kümmert es, dass das Modell sich nicht geweigert hat.

Die vernünftigen Verwendungen sind die, die die Veröffentlichung nennt: Sicherheitsforschung, Interpretierbarkeitsarbeit, Red- und Blue-Team-Übungen und die Untersuchung von Ablehnungsmechanismen. Die Verbesserung der XSTest-Überablehnung ist auch ein legitimes Alltagsargument für Teams, deren echtes Problem ein Modell ist, das bei der gewöhnlichen Sicherheitstechnik nicht hilft.

Wenn Sie ein Modell für Endbenutzer bereitstellen, verlagert ein unzensierter Checkpoint die gesamte Filterlast auf Ihren eigenen Stack. Das ist eine Designentscheidung mit Personal- und Überwachungs-Implikationen, keine Konfigurationsflagge.

FAQ

Ist GLM-5.3-Flash-Uncensored dasselbe Modell wie GLM-5.3-Flash? Dieselbe Architektur und dieselben Basisgewichte, 320B Parameter mit 18B aktiven, wobei das Ablehnungsverhalten entfernt wurde. Die Abdeckung des Basismodells finden Sie unter was GLM-5.3-Flash ist.

Sind die Bewertungszahlen unabhängig verifiziert? Nein. Jede Zahl in der Ankündigung ist ein von OrcaRouter selbst gemeldetes Ergebnis, und zum Zeitpunkt der Erstellung gab es keine unabhängige Überprüfung durch Dritte. Die genannten Benchmarks sind real und öffentlich, daher ist eine Replikation möglich, wenn Sie die Hardware besitzen.

Welches Format soll ich verwenden? FP8 ist das Referenzartefakt und das, womit die Evaluierungen durchgeführt wurden. NVFP4 ist der praktische Einzelknoten-NVIDIA-Pfad. GGUF und MLX existieren jetzt und sind der Weg für Workstation- und Apple Silicon-Setups. Erwarten Sie, dass sich das Verhalten mit der Quantisierung ändert, weshalb Sie genau eine wiederholbare Testsuite anstelle einer "Gefühlsprüfung" wünschen.

Beeinträchtigt die Abliterierung die allgemeine Leistung? Veröffentlichte Arbeiten zu dieser Technik finden im Allgemeinen eine gewisse Degradation, und keine der Ankündigungen geht für dieses Modell darauf ein. Wenn die Leistungsfähigkeit für Sie wichtig ist, benchmarken Sie es selbst gegenüber dem Basismodell, anstatt Gleichheit anzunehmen.

Warum stoppte die Ablehnung bei 11 bis 18 Prozent statt bei Null? Das ist die offene Frage und das interessanteste an der Veröffentlichung. OrcaRouters erklärte Ansicht ist, dass ein Teil der Ausrichtung nicht durch eine einzelne lineare Ablehnungsrichtung getragen wird. Die konkurrierende Erklärung ist eine unvollständige Implementierung. So oder so, betrachten Sie die Restrate nicht als Sicherheitsmerkmal.

Kann ich dies kommerziell nutzen? Die Gewichte sind MIT-lizenziert, was permissiv ist. Das ist eine Lizenzantwort, keine rechtliche oder politische Antwort für Ihre spezifische Bereitstellung. Fragen Sie Ihr Rechtsteam, insbesondere wenn die Ausgabe Endbenutzer erreicht.

Zusammenfassung

Zwei Format-Releases in drei Tagen, 2 Millionen Aufrufe für das erste, und ein Katalog abliterierter Modelle dahinter. Die Entzensurierung selbst ist an diesem Punkt Routine.

Der Teil, den es sich zu merken lohnt, ist das negative Ergebnis. Eine Technik, die die Ablehnung in den meisten offenen Modellen zuverlässig kollabiert, brachte GLM-5.3-Flash von 96 % auf 11 % und stoppte dort, und das Labor, das dies tat, gab dies öffentlich bekannt, anstatt aufzurunden. Wenn sich das bei unabhängiger Replikation bestätigt, sagt es etwas Reales darüber aus, wie Z.ai dieses Modell trainiert hat, und es ist ein besserer Beitrag als der Checkpoint.

Wenn Sie damit arbeiten wollen, erledigen Sie die langweiligen Teile ordnungsgemäß. Messen Sie das Verhalten mit einer wiederholbaren Anfragesuite, die Sie auf jeden Endpunkt richten und nächsten Monat erneut ausführen können – dafür ist Apidog da. Führen Sie Aufzeichnungen darüber, wer was gegen welche Gewichte ausgeführt und wer es genehmigt hat – dafür ist Sharkly da.

button

Ein unzensiertes Modell entbindet Sie nicht von der Pflicht zu wissen, was Sie ausgeführt haben. Es erhöht sie.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen