クロードフェーブル5の安全対策の仕組み(ルーティング解説)

クロード・フェーブル5がOpus 4.8への経路機密性の高いクエリをいかに保護するか:分類器、3つの保護領域、そしてフォールバックがアプリにもたらす意味

INEZA Felin-Michel

INEZA Felin-Michel

10 6月 2026

クロードフェーブル5の安全対策の仕組み(ルーティング解説)

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

Claude Fable 5での構築を開始し、一部のリクエストが他と異なる動作をすることに気づいた場合、それはClaude Fable 5のセーフガードが機能しているためです。Fable 5は2026年6月9日にモデルID claude-fable-5でローンチされ、Mythosクラスのモデルとして一般利用向けに安全に作られているため、組み込みの安全ルーティングレイヤーが搭載されています。このメカニズムは、一度理解すれば単純です。分類器がいくつかの機密性の高い領域のクエリを監視し、いずれかがトリガーされると、リクエストは完全なFable 5モデルの代わりにClaude Opus 4.8によって処理されます。これは平均してセッションの5%未満で発生するため、ほとんどの開発者はこれに遭遇することはめったにありません。この記事では、安全ルーティングがどのように機能するか、どのようなトピックをカバーするか、実際にどのように感じるか、そしてAnthropicが拒否するのではなくルーティングを選択した理由を説明します。

要約

Claude Fable 5は、3つの機密性の高い領域のクエリを検出し、それらを完全なFable 5モデルの代わりにClaude Opus 4.8にルーティングする分類器を実行します。セーフガードは平均してセッションの5%未満でトリガーされます。保護されている3つの領域は、サイバーセキュリティ、生物学および化学、そしてモデル蒸留です。設定は不要で、価格も変更されません。

セーフガードの機能

Claude Fable 5のセーフガードの背後にある核となる考え方は、包括的なフィルタではなく、ルーティングの決定です。claude-fable-5に送信するすべてのリクエストは、一連の分類器を通過します。これらの分類器はクエリを分析し、それが保護されたカテゴリのいずれかに該当するかどうかを判断します。大多数のリクエストでは、答えは「いいえ」であり、リクエストは期待どおりに完全なFable 5モデルによって処理されます。

分類器がリクエストを機密であるとフラグ付けした場合でも、リクエストは直ちに拒否されるわけではありません。代わりに、Claude Opus 4.8にフォールバックし、Fable 5の代わりにクエリに回答します。アプリケーションの視点からは、応答は同じAPI呼び出しとモデルIDを通じて返されます。違いは、回答を生成した基盤となるモデルが、完全なFable 5モデルではなくOpus 4.8だったという点です。この区別は重要です。なぜなら、2つのモデルは異なる出力を生成し、フォールバックが適用されるトピックでは異なる動作をする可能性があるからです。

これは設計の核心であるため、改めて述べる価値があります。Fable 5はMythosクラスのモデルであり、Anthropicのラインナップの中でも高機能な部類に属します。このような高機能なモデルを一般向けに安全に利用できるようにするには、最もリスクの高いごく一部の機能の周りにガードレールを設ける必要があります。Anthropicは、Fable 5自体にこれらのクエリを拒否させるのではなく、それらのトピックにおける挙動が十分に理解されており、広く公開しても安全だと考えられるモデルに、静かにリダイレクトするレイヤーを構築しました。モデルクラス自体の背景については、Mythosクラスモデルとは何かに関する説明をご覧ください。

ルーティングは自動であり、Anthropic側で処理されます。渡すパラメータも、設定するヘッダーも、オン/オフを切り替えるリクエスト内のフラグもありません。分類器はすべてのセッションで実行され、いずれかがトリガーされた場合にのみフォールバックが作動します。

3つの保護領域

Claude Fable 5のセーフガードは3つのカテゴリをカバーしています。それぞれが高機能モデルが害を及ぼす障壁を著しく低くする可能性のある領域であるため、各領域がゲートされています。以下の説明は、何がゲートされているかについてであり、これらの領域で何かを行う方法については触れていません。

サイバーセキュリティ

最初の保護領域は、攻撃的なサイバーセキュリティです。これは、エクスプロイト開発、攻撃的なサイバータスク、モデルが攻撃を実行または加速するよう求められるエージェント型ハッキングワークフローなどをカバーします。分類器がこの種​​のクエリを検出すると、リクエストはOpus 4.8にルーティングされます。

サイバーセキュリティのセーフガードは、攻撃能力を測定するサイバー評価タスクにおいてFable 5が進展するのを防ぐように設計されています。モデルをテストした外部パートナーは、有害なサイバークエリに対するFable 5のセーフガードが、彼らがテストした中で最も「堅牢」であると評価しました(情報源の言葉を引用)。ここでの枠組みは防御的です。目標は、モデルが攻撃者の作業を進めるのを防ぎつつ、通常のセキュリティに関する質問、防御作業、および教育資料には影響を与えないことです。

生物学と化学

2番目の保護領域は、生物学と化学の分野で最も危険な機能に触れるクエリをカバーします。例としては、AAV設計や生物兵器関連のクエリが挙げられます。サイバーセキュリティの場合と同様に、分類器がこれらのリクエストのいずれかにフラグを立てると、完全なFable 5モデルではなくOpus 4.8から回答が提供されます。

その意図は、この分野における科学的、医学的、教育的な質問の大部分には影響を与えずに、最もリスクの高い生物学および化学の機能をガードレール内に保持することです。ほとんどの生物学または化学ツールを開発する開発者は、フォールバックに遭遇することはないでしょう。なぜなら、このゲートは真に危険なごく一部のコンテンツを対象としているからです。

モデル蒸留

3番目の保護領域はモデル蒸留です。これは、競合するモデルをトレーニングするために、モデルの挙動を体系的に探って抽出し、他の場所で再現しようとする試みをカバーします。蒸留の試みと見なされるクエリは、サイバークエリや生物学クエリと同様にOpus 4.8にルーティングされます。

モデル蒸留は他の2つの領域とは性質が異なります。現実世界での物理的な危害を防ぐことではなく、モデル自体がコピーされるのを防ぐことが目的です。しかし、ルーティングメカニズムは同じであり、これによりシステム全体がシンプルに保たれます。1つの分類器レイヤー、1つのフォールバックターゲット、3つのカテゴリです。

発動頻度と実際の使用感

見出しとなる数字は、Claude Fable 5のセーフガードが平均してセッションの5%未満でトリガーされるというものです。ほとんどのアプリケーションにとって、これはフォールバックが常に存在するものではなく、稀なイベントであることを意味します。汎用コーディングアシスタント、ライティングツール、顧客サポートボット、またはその他の一般的な製品を開発している場合、これに遭遇することなく長い時間を過ごすかもしれません。

それが起こったとき、どのような感じがするでしょうか? 外から見ると、ほとんど何も変わりません。API呼び出しは成功し、応答を受け取り、その応答は首尾一貫しており、適切なトピックに関するものです。直接見ることができないのは、その回答が完全なFable 5モデルではなくOpus 4.8によって生成されたという点です。2つのモデルは異なるため、特定のトピックに関する出力は、Fable 5が生成したものとはトーン、深さ、またはアプローチが異なる場合があります。

実際には、これはシステムを観察する上でいくつかのことを意味します。

あなたの製品がサイバーセキュリティ、生物学、化学、またはモデル抽出に類似するものを一切扱わない場合、セーフガードに気づくことはまずないでしょう。しかし、あなたの製品がこれらのドメインのいずれかに属する場合、フォールバックはより日常的な体験の一部となり、それに合わせて設計を検討する価値があります。これを自分で確認する実用的な方法は、APIを通じてさまざまなプロンプトを送信し、どれが異なる動作をするかを観察することです。例えばApidogのようなツールでFable 5 APIをテストする際には、プロンプトのコレクションを保存し、繰り返し実行して、どのカテゴリがフォールバックをトリガーするかを特定できます。

拒否ではなくルーティングを選ぶ理由

当然の疑問として、Anthropicが、多くのモデルがそうするようにFable 5に機密性の高いクエリを単に拒否させるのではなく、なぜルーティングレイヤーを構築したのかという点が挙げられます。その答えは、「安全性と能力を両立させる」という設計目標に集約されます。

拒否は行き止まりです。ユーザーが何かを尋ね、モデルが拒否し、対話は停止します。これは真に悪意のあるリクエストにとっては正しい結果ですが、それは鈍器のようなものです。機密性の高い領域に触れる多くのクエリは正当なものです。例えば、防御的な質問をするセキュリティ研究者、生物学のトピックを研究する学生、分類器にとって敵対的に見える何かをデバッグする開発者などです。厳格な拒否はこれらすべてを同じように扱い、正当な作業をしている人々にとって不満の募る経験を生み出します。

Opus 4.8へのルーティングは、より穏やかな対応です。システムは拒否する代わりに、これらの領域における挙動が十分に理解されており、一般公開しても安全だと考えられているモデルにクエリを渡します。ユーザーは引き続き回答を受け取りますが、それはその狭い範囲のトピックにおいて異なる能力プロファイルを持つモデルからのものです。これにより、Fable 5は保護領域外のすべてにおいて完全な能力で広く有用であり続けながら、最もリスクの高い機能が一般に最大限の強度で利用できないように確保されます。

サイバーセキュリティのケースは、この枠組みを明確に示しています。セーフガードの目的は、一般的なセキュリティ作業をブロックすることではなく、モデルが攻撃的なサイバータスクを進めるのを防ぐことです。防御的セキュリティ、教育、および通常のエンジニアリングに関する質問は、通常通りに処理されることを意図しています。外部パートナーが、有害なサイバークエリに対するFable 5のセーフガードが、彼らがテストした中で最も「堅牢」であったと評価したことは、この防御境界がいかにうまく機能するかを示しています。Anthropicは、その一般的なアプローチについて安全性と責任あるスケーリングのページで詳しく公開しており、両モデルのローンチ詳細はFable 5およびMythos 5の発表で確認できます。

セーフガードにおけるFable 5とMythos 5の比較

Fable 5には、Claude Mythos 5という対応するモデルがあります。Mythos 5は、一部の領域でセーフガードが解除された、同じ基盤モデルです。それは異なるアーキテクチャや、一般的な意味でより有能なシステムではありません。公開バージョンを安全に保つためのルーティングの一部がFable 5から取り除かれたものです。

これらのセーフガードを解除するとリスクプロファイルが変化するため、Mythos 5は一般公開されていません。アクセスは、サイバー防御者やインフラストラクチャプロバイダー、および一部の生物学研究者を含むProject Glasswingパートナーに限定されています。これらは、無制限の機能を真に必要とし、適切な監視下で活動する組織および個人です。両モデルの比較については、Fable 5 vs Mythos 5をご覧ください。

ほとんどの開発者にとっての実用的な教訓は簡潔です。あなたはFable 5上で構築しており、セーフガードはその一部であり、無制限バージョンへの公開パスはありません。あなたの作業がいずれかのパートナーカテゴリに該当する場合、Mythos 5へのルートはAPIフラグではなく、Project Glasswingを通じて行われます。

あなたのアプリにとっての意味

一般的なアプリケーションの場合、Claude Fable 5のセーフガードはあなたに何も要求しません。設定手順も、設定するトグルも、リクエストコードに追加する必要のある特別な処理もありません。分類器とフォールバックはすべてAnthropic側で処理されます。あなたはclaude-fable-5モデルIDでAPIを呼び出すだけで、ルーティングは透過的に行われます。

理解すべき主な点は、ごく一部のリクエストがFable 5ではなくOpus 4.8によって処理される可能性があり、これが保護されたトピックに関する出力や挙動に影響を与える可能性があるということです。あなたの製品がサイバーセキュリティ、生物学、化学、またはモデル抽出に類似するものを扱う場合、フォールバックを特殊なケースとしてではなく、通常の体験の一部として計画してください。それ以外のすべての場合、それは非常に稀なため、特別な注意を払う必要はほとんどありません。

留意すべき具体的な点がいくつかあります。

応答は同じ呼び出しとモデルIDを通じて返されるため、単一の応答からどのモデルがそれを生成したかを常に判断できるわけではありません。これは設計上の意図であり、ほとんどのユースケースでは問題ありません。挙動の境界を正確に理解する必要がある場合は、3つの保護領域の端を試すテストスイートを構築し、違いを直接観察することが最も信頼できるアプローチです。Opus 4.8は機密性の高いトピックのリクエストがフォールバックするモデルであるため、Opus 4.8 API利用ガイドは役立つ背景情報となります。

簡単に言えば、Claude Fable 5のセーフガードは、設定不要でコストも変更することなく、機密性の高いリクエストのごく一部をOpus 4.8に送信し、それ以外のすべてをFable 5の全能力で処理する、静かで自動的なルーティングレイヤーです。サイバーセキュリティ、生物学、化学、またはモデル抽出に近い分野で開発を行っている場合、次のステップは、少数のテストプロンプトを作成し、APIを通じて実行し、保護領域がどのように動作するかを観察して、アプリケーションがフォールバックに対応できるようにすることです。モデルファミリーに関するより広範なコンテキストについては、まずClaude Fable 5とは何かモデル概要から始め、次にFable 5 APIガイドでスタックに組み込む方法に進んでください。テストの準備ができたら、Apidogがこれらのプロンプトを実行・比較する場所を提供します。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる