GLM-5.3-Flash 無検閲版が正当な作業を拒否しなくなる仕組み

検閲なしのGLM-5.3-Flashは、無害な過剰拒否を2.4%から0.4%に削減します。得られるメリット、評価結果、そして拒否率が11%で止まる理由。

Medy Evrard

1 9月 2026

GLM-5.3-Flash 無検閲版が正当な作業を拒否しなくなる仕組み

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

要約: OrcaRouterは、GLM-5.3-Flash(3200億パラメータ、アクティブなパラメータは180億の混合エキスパートモデル)の無検閲化ウェイトを2回に分けて公開しました。1回目は2026年8月29日にネイティブなblock-FP8形式で、2回目は8月31日にNVIDIA GPU向けのNVFP4ビルドとしてです。GGUFとMLXへの変換も現在公開されています。ベンダー報告による拒否率は大幅に低下しており、例えばMaliciousInstructでは96%から11%に下がりましたが、ゼロにはなっていません。最も興味深い主張は、検閲解除そのものではありません。OrcaRouterは、GLM-5.3-Flashのアライメントの一部が単一の線形な拒否方向によって媒介されていないと述べています。これは、Z.aiの安全トレーニングが、この技術が通常対象とするモデルよりも構造的に深いことを示唆します。

無検閲化は日常的なものになりました。誰かがオープンウェイトモデルを入手し、拒否に関連する内部方向を特定し、それを取り除いて結果をアップロードします。これらのリリースのほとんどは特筆すべきものではなく、報道のほとんどは息をのむようなものか、叱責するようなものです。

この記事は、モデルがこれから何を言うかとは全く関係のない理由で、注意深く読む価値があります。リリースノートには、最先端のオープンウェイトモデル内でアライメントがどのように表現されているかについての否定的な結果が含まれており、解釈可能性における否定的な結果は、別の検閲解除されたチェックポイントよりも稀で有用です。

実際にリリースされたもの

2つの発表が2日間の間隔で行われ、その後静かにフォーマットの展開が続いています。

OrcaRouterは、GLM-5.3-Flashの無検閲ウェイトを元のblock-FP8精度でリリースしました。これは、ベースモデルと修正モデルの間に再量子化ステップがないことを意味します。3200億パラメータのうち180億がアクティブで、ベースモデルのアーキテクチャと一致しています。これについては、「GLM-5.3-Flashとは何か」および「GLM-5.3-FlashとGLM-5.3の比較」で解説しました。この投稿はその後200万回以上の閲覧数を記録しています。

2026年8月31日:NVFP4。NVIDIAの4ビット浮動小数点形式をターゲットとする2番目のビルドで、フットプリントの削減と推論の高速化を謳っています。約75,000回の閲覧があり、これはフォーマットの提供がオリジナルよりもはるかに狭い層の関心事であることを示しています。

その後:GGUFとMLX。両方の発表で、他の量子化フォーマットも登場すると述べられていました。2026年9月1日にHugging Face組織を確認したところ、GLM-5.3-Flash-Uncensored-GGUFGLM-5.3-Flash-Uncensored-MLXの両方が存在しており、llama.cppとApple Siliconのパスが利用可能になっています。これらを調べた時点では、両者のダウンロード数はまだゼロで、NVFP4ビルドは5回、オリジナルのFP8は1,541回でした。関心は発表にあり、まだ成果物には及んでいません。

文脈として注目すべきは、これは単発のものではなく、製品ラインであるということです。同じ組織が、Qwen3.8-27B(FP8ビルド単体で30万回以上のダウンロードを記録)、Qwen3.8-Flash-Next、Gemma-4-26Bの無検閲化ビルドをホストしています。GLMのリリースは、既存のカタログにおける最新の追加項目です。

ウェイトはMITライセンスであり、ベースモデルとしてzai-org/GLM-5.3-Flashが記載されています。モデルカードでは、無検閲化済み、ビジョン言語、MoE、関数呼び出し可能とタグ付けされており、ベースモデルのマルチモーダルおよびツール利用の側面も引き継がれています。

「LoRAなし、ジェイルブレイクプロンプトなし」が意味するもの

発表におけるこの表現は重要な意味を持っており、ほとんどの人が想像する2つのことと区別するため、その内容を詳しく見ていく価値があります。

ジェイルブレイクプロンプトは、推論時にモデルを操作します。安全トレーニングは無傷であり、それを回避するように話しかけることになります。これは脆弱で、パッチが当てられ、リクエストごとにコンテキストコストが発生します。

LoRAアダプターは、ロード時に重ねられる追加ウェイトの小さなセットです。ベースモデルは変更されず、アダプターは取り外し可能です。これはあなたが取り付ける修正です。

無検閲化は、拒否動作に対応する内部活性化方向を特定し、ウェイト自体からそれを編集して削除します。取り付けるものも、取り除くものもありません。拒否動作は成果物から消滅しており、実行時に抑制されるわけではありません。

この区別は実用上重要です。無検閲化されたモデルは、変更がウェイトにあるため、アダプターをチェックしたりプロンプトをスキャンしたりして監査することはできません。出所が重要な環境でオープンモデルを実行している場合、実際のチェックポイントに対してベースモデルの系統を確認することは、今や実際のサプライチェーン上の問題となります。モデルが何を行うことを許されるかを制限することについての一般的な見解は、「AIエージェントのガードレール」に記載されています。

拒否率の数値

これらはOrcaRouterが独自に報告した数値であり、前後を比較したものです。この記事の執筆時点では独立した再現検証は存在しませんでした。ベンダー報告値として扱ってください。

ベンチマーク ベースモデルの拒否率 無検閲化後
MaliciousInstruct 96% 11%
JailbreakBench 93% 12%
AdvBench 97% 15%
HarmBench 93% 18%
XSTest 良性過剰拒否 2.4% 0.4%

最後の行は最初の4行とは異なる視点で読んでください。XSTestは過剰拒否を測定します。これは、モデルが表面上危険なものにパターンマッチする無害なリクエストを拒否することです。これは開発者が実際に本番環境で遭遇する失敗モードです。例えば、「パスワード」という単語が出現したためにログインフローのデバッグを拒否したり、自社のインフラ向けネットワークスキャナーの作成を拒否したりするモデルです。2.4%から0.4%への変化は、正当な日常的な価値を持つ行であり、ほとんど誰も引用しない点です。

最初の4行は、これが生産性ツールではなく研究成果物である理由であり、そのためライセンスと現地の法律が通常よりも重要になります。

実際に得られるもの

無検閲化されたモデルに関するほとんどの報道は、それらが存在すべきかどうかを議論するばかりで、現場のエンジニアがなぜそれを選ぶのかという点には触れません。そこには4つの真の利点があり、それらは見出しの数字が示唆するものではありません。

決して有害ではなかった作業を拒否しなくなります。これが最大の利点で、XSTestの行に示されています。良性過剰拒否が2.4%から0.4%に低下しています。過剰拒否は、安全調整されたモデルに対してすべての開発者がすでに支払っている「税金」です。「パスワード」という単語を見たためにパスワードリセットフローのデバッグを助けてくれないモデル。あなたが所有するインフラ向けのポートスキャナー作成を拒否するモデル。脅威が記述されているからといって脅威レポートの要約を拒否するモデル。これらはどれも安全上のメリットではありません。モデルが話題と意図を区別できていない失敗であり、そのために再試行、プロンプトの修正、タスクの放棄という形で代償を払っています。その割合を6分の1に削減することは、あなたの仕事で最も実感できる利点となるでしょう。

リクエストごとのコストなし、壊れるものなし。今日人々が実際に使っている代替策は、拒否を回避するためのプロンプトエンジニアリングです。これは、すべての呼び出しでコンテキストコストがかかり、一貫性のない結果を生成し、プロバイダーがパッチを当てると機能しなくなります。ウェイトレベルの変更にはこれらの特性は一切ありません。動作は成果物の特性であるため、リクエスト間で安定しており、火曜日にあなたの知らないところでひっそりと変更されることはありません。

オープンウェイトは、デプロイメントがあなたのものになることを意味します。MITライセンスで、セルフホスト可能、そして特定のチェックポイントに固定できます。プロンプトやドキュメントはベンダーを経由することなく、あなたのインフラ内に留まります。四半期途中でプロバイダーがフィルターを厳しくし、あなたがリリースしたワークフローが壊れるといったリスクに晒されることはありません。規制された環境では、その制御がしばしば重要であり、同じ議論は未変更のウェイトにも当てはまります。そのため、「GLM-5.3のオープンウェイトをセルフホストする」という記事を書きました。

機能の表面は維持されます。モデルカードには依然としてビジョン言語と関数呼び出しが記載されており、これはテキストのみの簡易ビルドではありません。ベースモデルのマルチモーダルおよびツール使用のパスも引き継がれており、チャットではなくエージェント的な用途で使用することを計画している場合には重要です。

これらすべてについて正直な限界を述べます。これらの利点はいずれも能力の向上ではありません。無検閲化は行動の編集であり、この技術に関する公開された研究では一般的に何らかの品質コストが見られ、推論、コーディング、またはビジョン性能が変化したかどうかはどちらの発表でも報告されていません。あなたは、測定された拒否の削減と引き換えに、測定されていない性能低下のリスクを負うことになります。そして、ベースモデルが行っていたすべてのフィルタリング決定は、今やあなたが下すことになり、それはコスト削減ではなく、実際の人員配置と監視のコストとなります。

実際に興味深い点

発表の最後に埋もれているのが、読む価値のある発見です。

拒否率は一様にゼロにはなりません。4つのハームベンチマーク全体で、拒否率は0%から2%ではなく、11%から18%の間にとどまります。OrcaRouterの公式な解釈は、GLM-5.3-Flashのアライメントの一部が単一の線形な拒否方向によって媒介されていないこと、そしてZ.aiがこの技術が通常遭遇するものよりも実質的に深い拒否メカニズムを構築している可能性があるということです。

それはモデルの内部に関する主張であり、もしそれが事実であれば、リリースそのものよりもはるかに重要な意味を持ちます。

無検閲化の標準的なメンタルモデルは、拒否は活性化空間におけるほぼ単一の方向であるというものです。それを見つけて削除すれば、その動作は崩壊します。多くのモデルで十分に機能してきたため、人々はそれを既成事実として扱っています。その手順で96%から11%まで下げられるものの、そこで停滞するモデルは、少なくともこのモデルにおいてはメンタルモデルが不完全であること、そして技術が到達できない形で一部のアライメントが残存していることの証拠です。

正直な2つの注意点があります。第一に、これはある研究所が自らの結果を解釈したものであり、別の説明としては、単に彼らの実装が性能を十分に引き出せていなかっただけという可能性もあります。第二に、残存する11%から18%の拒否率は、誰もが頼りにすべき安全特性ではありません。有害なリクエストの15%を拒否するモデルは安全なモデルではなく、信頼できないモデルです。

それでも、「我々の技術は限界に達し、その理由はアーキテクチャにあると考えている」というのは、研究所が通常ローンチ投稿では省く類のことです。OrcaRouterがこのリリースを、純粋な能力向上としてではなく、アライメントがどのように表現されているかを研究するための成果物として位置づけている点は、この種の作業が公開される上でのより良い形です。

検証すべき主張

関連スレッドにある2つの点には懐疑的な見方が必要であり、それらを指摘することはリリースに対する批判ではありません。

「Claude Opus 4.8レベルの知能。」後続の投稿では、このリリースがそのレベルの知能で防御側を武装するものだと記述されています。この主張にはベンチマークが伴っておらず、現在のOpus世代ではないモデルバージョンとの比較です。マーケティングとして扱ってください。機能の同等性があなたのユースケースにとって重要であれば、独自の評価を行ってください。

能力の代理としての拒否率。拒否率が低いことが高い能力を意味するわけではありません。無検閲化は行動の編集であり、この技術に関する発表された研究では一般的に、そのコストとして汎用性能の何らかの低下が見られます。推論、コーディング、またはビジョン性能がベースモデルと比較して変化したかどうかは、どちらの発表でも触れられておらず、それこそがほとんどの読者が実際に知りたい数値です。未変更モデルのベンチマークと価格に関する情報は、「GLM-5.3-Flashの価格設定」および「GLM-5.3-Flash APIガイド」にあります。

実行方法とハードウェアの現実

3200億パラメータは、アクティブなパラメータが180億であっても、ラップトップモデルではありません。現在利用可能なフォーマットは、誰が現実的にそれを実行できるかに影響します。

ホストされたエンドポイントを呼び出すのではなく、セルフホストする場合、ベースモデルのチュートリアルが直接適用されます。「GLM-5.3-Flashをローカルで実行する」と「GLM-5.3のオープンウェイトをセルフホストする」です。このカテゴリのより広い文脈については、「無検閲LLMの調査」と「制限なしLLMの考察」を維持しており、DeepSeek R1の無検閲リリースが最も近い先行比較となります。

これを評価することはAPIテストの問題である

ここが実用的な部分であり、ほとんどの報道が完全にスキップする部分です。

このようなモデルで正当な作業を行う場合、つまり安全研究、レッドチームおよびブルーチームの演習、または自社のフィルターが何を検出するかという防御評価を行う場合、実際の作業は、エンドポイントに対して大規模で再現可能な一連のリクエストを実行し、返される内容をアサートすることです。それはAPIテストです。レスポンスボディにモデルの出力が含まれているからといって、これが新しい分野というわけではありません。

遭遇する具体的な問題点:

これこそがAPIプラットフォームの存在意義です。Apidogでは、エンドポイントを一度定義し、プロンプトスイートを保存されたコレクションとして保持し、レスポンスフィールドをアサートし、プロバイダー間または量子化間で環境変数を通じてベースURLを切り替え、CIで全体を実行することで、数値が逸話的ではなく再現可能になります。未変更モデルに対するメカニズムは、「ApidogでGLM-5.3-Flash APIをテストする」で詳しく解説しました。同じ設定であらゆるOpenAI互換エンドポイントを指すことができます。

この一般的な原則は、このモデルを超えても有効です。モデルの動作が測定し、防御しなければならないものになったら、他のAPI契約に適用するのと同じ規律が必要です。もしあなたの評価が現在、他の誰も再実行できないノートブックにしか存在しないなら、Apidogをダウンロードしてください。関連:「本番環境でのAIエージェントの信頼性」。

レッドチームの作業にはターミナルではなく監査証跡が必要

2つ目の実用的な問題は組織的なものであり、この種の作業においては選択肢ではありません。

無検閲化モデルに対して有害プロンプトベンチマークを実行することは、事前に承認され、事後に帰属可能である必要がある活動そのものです。誰が実行したか。どのチェックポイントに対してか。誰の承認を得てか。どのような範囲でか。その記録が1人の研究者のシェル履歴の中に存在するのであれば、研究プログラムがあるのではなく、負債があることになります。

Sharklyはセッション後も残る必要のある作業のために構築されており、このユースケースに驚くほどよく合致しています。

無検閲モデルは研究ツールです。記録なしで使用される研究ツールは、組織が何が起こったのか説明できなくなる原因となります。

法的および安全性の現実

簡潔に、そして明確に述べる価値があります。

ウェイトに対するMITライセンスは、ウェイトを管理します。それは出力で違法なことを行う許可を与えるものではなく、あなたから責任を転嫁するものでもありません。現地の法律、雇用主のポリシー、およびあなたが運用するあらゆるプラットフォームの規約は依然として適用され、モデルが拒否しなかったことなど、それらのどれも関知しません。

合理的な使用方法は、リリースに記載されているものです。安全研究、解釈可能性の作業、レッドチームとブルーチームの演習、拒否メカニズムの研究です。XSTestの過剰拒否の改善も、日常的な正当な議論となります。これは、通常のセキュリティエンジニアリングを助けてくれないモデルが実際の課題であるチームにとってです。

エンドユーザーにモデルを展開する場合、無検閲チェックポイントはフィルタリングの負担全体を自社のスタックに移します。これは、人員配置と監視に影響を与える設計上の決定であり、設定フラグではありません。

よくある質問

GLM-5.3-Flash-UncensoredはGLM-5.3-Flashと同じモデルですか?同じアーキテクチャとベースウェイトで、3200億パラメータのうち180億がアクティブであり、拒否動作が編集されて削除されています。ベースモデルの詳細については、「GLM-5.3-Flashとは何か」をご覧ください。

評価数値は独立して検証されていますか?いいえ。発表内のすべての数値はOrcaRouterが独自に報告した結果であり、この記事の執筆時点では第三者による再現検証は存在しませんでした。記載されているベンチマークは実在し公開されているため、ハードウェアがあれば再現は可能です。

どのフォーマットを使用すべきですか?FP8はリファレンス成果物であり、評価が実行されたものです。NVFP4は実用的なシングルノードNVIDIAパスです。GGUFとMLXは現在存在し、ワークステーションとApple Siliconセットアップの経路です。量子化によって動作が変化することが予想されるため、感覚的なチェックではなく再現可能なテストスイートが必要とされるのはそのためです。

無検閲化は一般的な性能を損ないますか?この技術に関する公開された研究では一般的に何らかの性能低下が見られ、このモデルについてはどちらの発表でも触れられていません。能力が重要であるならば、同等性を仮定するのではなく、ベースモデルに対して自分でベンチマークを実行してください。

拒否率はなぜゼロではなく11〜18%で停止したのですか?それが未解決の疑問であり、リリースの中で最も興味深い点です。OrcaRouterの公式見解は、アライメントの一部が単一の線形な拒否方向によって伝達されていないということです。対抗する説明としては、実装が不完全であるというものです。どちらにしても、残存する拒否率を安全機能として扱わないでください。

商用利用は可能ですか?ウェイトはMITライセンスであり、許容的です。それはライセンスに関する回答であり、あなたの特定のデプロイメントに関する法的またはポリシー上の回答ではありません。特に、出力がエンドユーザーに到達する場合は、法務チームに相談してください。

まとめ

3日間で2つのフォーマットが公開され、最初のものは200万回の閲覧があり、その背後には無検閲モデルのカタログがあります。検閲解除そのものは、この時点では日常的なものです。

覚えておくべき点は、その否定的な結果です。ほとんどのオープンモデルで拒否を確実に崩壊させる技術が、GLM-5.3-Flashでは96%から11%まで下げたところで停止し、それを行った研究所はそのことを切り上げずに公表しました。もしそれが独立した再現検証で裏付けられれば、それはZ.aiがこのモデルをどのように訓練したかについて真実を語るものであり、チェックポイントよりも優れた貢献となります。

もしこれを使って作業するなら、退屈な部分もきちんと行いましょう。任意のAPIエンドポイントに向けて来月も再実行できる再現性のあるリクエストスイートで動作を測定しましょう。これはApidogの出番です。誰がどのウェイトに対して何を実行し、誰がそれを承認したかの記録を残しましょう。これはSharklyの出番です。

button

無検閲モデルは、あなたが何を動かしたかを知る義務を取り除くものではありません。むしろ、それを高めます。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる