إذا بدأت البناء على Claude Fable 5 ولاحظت أن عددًا قليلاً من الطلبات تتصرف بشكل مختلف عن البقية، فأنت ترى آليات حماية Claude Fable 5 قيد العمل. تم إطلاق Fable 5 في 9 يونيو 2026 بمعرّف النموذج claude-fable-5، ويأتي مزودًا بطبقة توجيه أمان مدمجة لأنه نموذج من فئة Mythos مصمم ليكون آمنًا للاستخدام العام. الآلية واضحة بمجرد فهمها: تراقب المصنفات الاستعلامات في بعض المناطق الحساسة، وعندما يتم تنشيط أحدها، يتم الرد على الطلب بواسطة Claude Opus 4.8 بدلاً من نموذج Fable 5 الكامل. يحدث هذا في أقل من 5% من الجلسات في المتوسط، لذلك نادرًا ما يواجهه معظم المطورين. تشرح هذه المقالة كيفية عمل توجيه الأمان، والمواضيع التي يغطيها، وكيف يبدو في الممارسة العملية، ولماذا اختارت Anthropic التوجيه بدلاً من الرفض.
باختصار
يشغل Claude Fable 5 مصنفات تكتشف الاستعلامات في ثلاث مناطق حساسة وتقوم بتوجيهها إلى Claude Opus 4.8 بدلاً من نموذج Fable 5 الكامل. تتفعيل آليات الحماية في أقل من 5% من الجلسات في المتوسط. المناطق الثلاث المحمية هي الأمن السيبراني، وعلم الأحياء والكيمياء، واستخلاص النماذج. لا تقوم بتكوين أي شيء، والأسعار لا تتغير.
ما تفعله آليات الحماية
الفكرة الأساسية وراء آليات حماية Claude Fable 5 هي قرار توجيهي، وليست تصفية شاملة. يمر كل طلب ترسله إلى claude-fable-5 عبر مجموعة من المصنفات. تنظر هذه المصنفات إلى الاستعلام وتقرر ما إذا كان يندرج ضمن إحدى الفئات المحمية. بالنسبة للغالبية العظمى من الطلبات، تكون الإجابة "لا"، ويتم التعامل مع الطلب بواسطة نموذج Fable 5 الكامل تمامًا كما تتوقع.

عندما يقوم مصنف بتحديد طلب على أنه حساس، لا يتم رفض الطلب بشكل مباشر. بدلاً من ذلك، يعود إلى Claude Opus 4.8، الذي يجيب على الاستعلام بدلاً من Fable 5. من وجهة نظر تطبيقك، لا يزال الرد يأتي عبر نفس استدعاء API ونفس معرّف النموذج. الفرق هو أن النموذج الأساسي الذي أنشأ الإجابة كان Opus 4.8 بدلاً من نموذج Fable 5 الكامل. هذا التمييز مهم لأن النموذجين يمكن أن ينتجا مخرجات مختلفة ويتصرفان بشكل مختلف في المواضيع التي ينطبق عليها الرجوع إلى الوراء.
تستحق هذه النقطة إعادة التأكيد لأنها جوهر التصميم. Fable 5 هو نموذج من فئة Mythos، مما يعني أنه يقع في الطرف ذو القدرات العالية من مجموعة Anthropic. جعل نموذج بهذه القدرة آمنًا للاستخدام العام يعني وضع حواجز حول المجموعة الضيقة من القدرات التي تحمل أكبر قدر من المخاطر. بدلاً من محاولة جعل Fable 5 نفسه يرفض هذه الاستعلامات، قامت Anthropic ببناء طبقة تعيد توجيهها بهدوء إلى نموذج سلوكه في تلك المواضيع مفهوم جيدًا ويعتبر آمنًا للكشف عنه على نطاق واسع. إذا كنت ترغب في الحصول على خلفية عن فئة النموذج نفسها، فراجع الشرح حول ما هو نموذج فئة Mythos.
التوجيه تلقائي ويعيش على جانب Anthropic. لا يوجد معلمة تمررها، ولا عنوان تحدده، ولا علامة في طلبك تقوم بتشغيلها أو إيقافها. تعمل المصنفات في كل جلسة، ولا يتم تفعيل الرجوع إلى الوراء إلا عندما يتم تنشيط أحدها.
المناطق المحمية الثلاث
تغطي آليات حماية Claude Fable 5 ثلاث فئات. كل واحدة منها هي مجال يمكن أن يقلل فيه نموذج عالي القدرة بشكل كبير من حاجز التسبب في الضرر، لذلك كل منها محمي ببوابات. الأوصاف أدناه تغطي ما هو محمي، وليس كيفية فعل أي شيء في هذه المناطق.
الأمن السيبراني
المنطقة المحمية الأولى هي الأمن السيبراني الهجومي. وهذا يشمل أشياء مثل تطوير الاستغلالات، ومهام الهجوم السيبراني، وسير عمل الاختراق الآلي حيث يُطلب من النموذج تنفيذ أو تسريع هجوم. عندما تكتشف المصنفات استعلامًا من هذا النوع، يتم توجيه الطلب إلى Opus 4.8.

تم تصميم آليات حماية الأمن السيبراني لمنع Fable 5 من إحراز تقدم في مهام التقييم السيبراني التي تقيس القدرات الهجومية. وجد شريك خارجي اختبر النموذج أن آليات حماية Fable 5 ضد استعلامات الهجمات السيبرانية الضارة كانت من بين "الأكثر قوة" التي اختبروها، باستخدام كلمة المصدر نفسها. الإطار هنا دفاعي: الهدف هو منع النموذج من تعزيز عمل المهاجم، مع ترك أسئلة الأمان العادية، والعمل الدفاعي، والمواد التعليمية دون تأثير.
علم الأحياء والكيمياء
تغطي المنطقة المحمية الثانية استعلامات علم الأحياء والكيمياء التي تمس أخطر القدرات في تلك المجالات. تشمل الأمثلة تصميم AAV والاستعلامات المتعلقة بالأسلحة البيولوجية. كما هو الحال مع الأمن السيبراني، عندما يقوم مصنف بتحديد أحد هذه الطلبات، تأتي الإجابة من Opus 4.8 بدلاً من نموذج Fable 5 الكامل.

الهدف هو إبقاء قدرات علم الأحياء والكيمياء عالية المخاطر خلف حاجز حماية مع ترك الغالبية العظمى من الأسئلة العلمية والطبية والتعليمية في هذا المجال دون مساس. لن يواجه معظم المطورين الذين يبنون أدوات علم الأحياء أو الكيمياء الرجوع إلى الوراء أبدًا، لأن البوابة تستهدف نطاقًا ضيقًا من المحتوى الخطير حقًا.
استخلاص النماذج
المنطقة المحمية الثالثة هي استخلاص النماذج. وهذا يشمل محاولات استخراج النموذج لتدريب نماذج منافسة، على سبيل المثال عن طريق استكشافه بشكل منهجي لالتقاط سلوكه وإعادة إنتاجه في مكان آخر. الاستعلامات التي تبدو وكأنها محاولات استخلاص يتم توجيهها إلى Opus 4.8 بنفس طريقة استعلامات الأمن السيبراني والبيولوجيا.
يختلف استخلاص النماذج في طبيعته عن المنطقتين الأخريين. إنه لا يتعلق بمنع الضرر المادي في العالم الحقيقي؛ بل يتعلق بحماية النموذج نفسه من النسخ. لكن آلية التوجيه متطابقة، مما يحافظ على بساطة النظام العام: طبقة مصنف واحدة، هدف احتياطي واحد، ثلاث فئات.
كم مرة يتم تنشيطه وكيف يبدو في الممارسة العملية
الرقم الرئيسي هو أن آليات حماية Claude Fable 5 تتنشط في أقل من 5% من الجلسات في المتوسط. بالنسبة لمعظم التطبيقات، هذا يعني أن الرجوع إلى الوراء حدث نادر بدلاً من وجود دائم. إذا كنت تبني مساعدًا برمجيًا للأغراض العامة، أو أداة كتابة، أو روبوت دعم عملاء، أو معظم المنتجات الشائعة الأخرى، فقد يمر وقت طويل دون رؤية ذلك أبدًا.
كيف يبدو الأمر عندما يحدث؟ من الخارج، يتغير القليل جدًا. ينجح استدعاء API الخاص بك، وتحصل على استجابة، وتكون الاستجابة متماسكة ومناسبة للموضوع. الشيء الذي لا يمكنك رؤيته مباشرة هو أن الإجابة تم إنشاؤها بواسطة Opus 4.8 بدلاً من نموذج Fable 5 الكامل. نظرًا لاختلاف النموذجين، يمكن أن يختلف الناتج في تلك المواضيع المحددة في النبرة أو العمق أو النهج عما كان سينتجه Fable 5.
عمليًا، هذا يعني بعض الأشياء لكيفية مراقبة النظام:
- سيتم خدمة نسبة صغيرة من الطلبات، تركزت في المناطق المحمية الثلاث، بواسطة Opus 4.8.
- قد لا تتطابق المخرجات في تلك المواضيع مع نمط أو ملف تعريف القدرة الذي اعتدت عليه من Fable 5 في المواضيع غير ذات الصلة.
- لن تحصل على خطأ أو رفض قاطع في الحالة النموذجية؛ يكتمل الطلب بشكل طبيعي.
- السلوك متسق: يميل نفس النوع من الاستعلامات الحساسة إلى التوجيه بنفس الطريقة.
إذا لم يمس منتجك أبدًا الأمن السيبراني، أو علم الأحياء، أو الكيمياء، أو أي شيء يشبه استخلاص النماذج، فمن المحتمل أنك لن تلاحظ آليات الحماية على الإطلاق. إذا كان منتجك يعيش في أحد هذه المجالات، فسيكون الرجوع إلى الوراء جزءًا أكثر انتظامًا من تجربتك، ويستحق التصميم حوله. طريقة عملية لرؤية ذلك بنفسك هي إرسال مجموعة من المطالبات عبر API ومراقبة أي منها يتصرف بشكل مختلف. عندما تختبر Fable 5 API في أداة مثل Apidog، يمكنك حفظ مجموعة من المطالبات وتشغيلها بشكل متكرر لتحديد الفئات التي تؤدي إلى الرجوع إلى الوراء.
لماذا يتم التوجيه بدلاً من الرفض
سؤال طبيعي هو لماذا قامت Anthropic ببناء طبقة توجيه على الإطلاق بدلاً من جعل Fable 5 يرفض ببساطة الاستعلامات الحساسة بالطريقة التي تفعلها العديد من النماذج. الإجابة تعود إلى هدف تصميم "القدرة مع الأمان".
الرفض هو طريق مسدود. يسأل المستخدم شيئًا، يرفض النموذج، ويتوقف التفاعل. هذه هي النتيجة الصحيحة للطلبات الخبيثة حقًا، لكنها أداة خشنة. الكثير من الاستعلامات التي تلامس منطقة حساسة تكون مشروعة: باحث أمني يسأل سؤالًا دفاعيًا، طالب يدرس موضوعًا في علم الأحياء، مطور يصحح خطأ ما يبدو عدائيًا للمصنف. الرفض القاطع يعامل كل هذه الحالات بنفس الطريقة وينتج تجربة محبطة للأشخاص الذين يقومون بعمل مشروع.
التوجيه إلى Opus 4.8 هو استجابة أكثر ليونة. بدلاً من الرفض، يسلم النظام الاستعلام إلى نموذج سلوكه في هذه المناطق مفهوم جيدًا ويعتبر آمنًا للكشف عنه للجمهور. لا يزال المستخدم يحصل على إجابة؛ إنها تأتي فقط من نموذج بملف تعريف قدرة مختلف في تلك المجموعة الضيقة من المواضيع. هذا يحافظ على فائدة Fable 5 على نطاق واسع بقدرته الكاملة لكل شيء خارج المناطق المحمية، مع ضمان عدم توفر القدرات عالية المخاطر بكامل قوتها للجمهور العام.
توضح حالة الأمن السيبراني الإطار بوضوح. الهدف من آلية الحماية ليس حظر العمل الأمني بشكل عام ولكن منع النموذج من إحراز تقدم في مهام الهجوم السيبراني. يُقصد أن يمر الأمن الدفاعي والتعليم والأسئلة الهندسية العادية بشكل طبيعي. إن اكتشاف الشريك الخارجي أن آليات حماية Fable 5 ضد استعلامات الهجمات السيبرانية الضارة كانت من بين "الأكثر قوة" التي اختبروها يدل على مدى جودة هذا الحد الدفاعي. تنشر Anthropic المزيد حول نهجها العام في صفحة الأمان والتوسيع المسؤول، وتفاصيل الإطلاق لكلا النموذجين موجودة في إعلان Fable 5 و Mythos 5.
Fable 5 مقابل Mythos 5 بشأن آليات الحماية
لدى Fable 5 نظير يسمى Claude Mythos 5. Mythos 5 هو نفس النموذج الأساسي مع رفع آليات الحماية في بعض المناطق. إنه ليس بنية مختلفة أو نظامًا أكثر قدرة بالمعنى العام؛ إنه Fable 5 بدون بعض التوجيه الذي يحافظ على أمان النسخة العامة.
نظرًا لأن رفع آليات الحماية تلك يغير ملف تعريف المخاطر، فإن Mythos 5 ليس متاحًا للجمهور. يقتصر الوصول على شركاء Project Glasswing، والذي يشمل المدافعين عن الأمن السيبراني ومزودي البنية التحتية، بالإضافة إلى باحثي علم الأحياء المختارين. هؤلاء هم منظمات وأفراد يتطلب عملهم حقًا القدرات غير المقيدة ويعملون تحت إشراف مناسب. للحصول على مقارنة جنبًا إلى جنب للنموذجين، راجع Fable 5 مقابل Mythos 5.
الملخص العملي لمعظم المطورين قصير: أنت تبني على Fable 5، وآليات الحماية جزء منه، ولا يوجد مسار عام للوصول إلى النسخة غير المقيدة. إذا كان عملك يقع ضمن إحدى فئات الشركاء، فإن الطريق إلى Mythos 5 يمر عبر Project Glasswing، وليس عبر علامة API.
ماذا يعني هذا لتطبيقك
بالنسبة للتطبيق النموذجي، لا تتطلب آليات حماية Claude Fable 5 منك أي شيء. لا توجد خطوة تكوين، ولا مفتاح لضبطه، ولا معالجة خاصة تحتاج إلى إضافتها إلى رمز طلبك. تعيش المصنفات والرجوع إلى الوراء بالكامل على جانب Anthropic. تستدعي API بمعرّف النموذج claude-fable-5، ويحدث التوجيه بشفافية.
الشيء الرئيسي الذي يجب استيعابه هو أن جزءًا صغيرًا من طلباتك قد يتم خدمته بواسطة Opus 4.8 بدلاً من Fable 5، وأن هذا يمكن أن يؤثر على المخرجات والسلوك في المواضيع المحمية. إذا كان منتجك يمس الأمن السيبراني، أو علم الأحياء، أو الكيمياء، أو أي شيء يشبه استخلاص النماذج، فخطط للرجوع إلى الوراء كجزء طبيعي من التجربة بدلاً من كونه حالة هامشية. بالنسبة للجميع، إنه نادر بما يكفي بحيث نادرًا ما يستدعي اهتمامًا خاصًا.
بعض النقاط المحددة التي يجب وضعها في الاعتبار:
- لا يوجد شيء لتكوينه. آليات الحماية تلقائية ولا يمكن إيقاف تشغيلها عبر API.
- التكلفة لا تتغير. تظل أسعار Fable 5 عند 10 دولارات لكل مليون رمز إدخال و 50 دولارًا لكل مليون رمز إخراج بغض النظر عما إذا كان طلب معين قد تم خدمته بواسطة Fable 5 أو عاد إلى Opus 4.8. لا ينقلك الرجوع إلى الوراء إلى سعر مختلف. إذا كنت تريد تفصيلًا كاملاً للأسعار، فراجع دليل تسعير Claude Fable 5.
- إذا كنت تبني في مجالات حساسة، فتوقع الرجوع إلى الوراء. صمم مطالباتك وتقييماتك وتوقعات المستخدم مع وضع التوجيه في الاعتبار.
- اختبر قبل النشر. قم بتشغيل مجموعة تمثيلية من المطالبات عبر API وراقب أي الفئات تتصرف بشكل مختلف حتى لا تتفاجأ في الإنتاج.
نظرًا لأن الاستجابة تعود عبر نفس الاستدعاء ونفس معرّف النموذج، لا يمكنك دائمًا معرفة من استجابة واحدة أي نموذج أنشأها. هذا مقصود وهو مناسب لمعظم حالات الاستخدام. إذا كنت بحاجة إلى فهم حدود السلوك بدقة، فإن النهج الأكثر موثوقية هو بناء مجموعة اختبار تمارس حواف المناطق المحمية الثلاث ومراقبة الاختلافات مباشرة. دليل استخدام API لـ Opus 4.8 هو خلفية مفيدة، حيث أن Opus 4.8 هو النموذج الذي تعود إليه طلباتك المتعلقة بالمواضيع الحساسة.
النسخة المختصرة هي أن آليات حماية Claude Fable 5 عبارة عن طبقة توجيه هادئة وتلقائية ترسل شريحة صغيرة من الطلبات الحساسة إلى Opus 4.8، تاركة كل شيء آخر بقدرة Fable 5 الكاملة بدون إعداد وبدون تغيير في تكلفتك. إذا كنت تبني في مجال الأمن السيبراني، أو علم الأحياء، أو الكيمياء، أو أي مجال قريب من استخلاص النماذج، فإن خطوتك التالية هي تجميع مجموعة صغيرة من مطالبات الاختبار، وتشغيلها عبر API، ومراقبة كيفية تصرف المناطق المحمية حتى يكون تطبيقك جاهزًا للرجوع إلى الوراء. للحصول على سياق أوسع حول عائلة النماذج، ابدأ بـ ما هو Claude Fable 5 و نظرة عامة على النماذج، ثم انتقل إلى ربطه بمجموعتك التقنية باستخدام دليل API لـ Fable 5. عندما تكون مستعدًا للاختبار، يوفر لك Apidog مكانًا لتشغيل ومقارنة هذه المطالبات.
