Claude Fable 5 üzerinde geliştirme yapmaya başladıysanız ve birkaç isteğin diğerlerinden farklı davrandığını fark ettiyseniz, Claude Fable 5 güvenlik önlemlerinin devrede olduğunu görüyorsunuz demektir. Fable 5, 9 Haziran 2026'da claude-fable-5 model kimliğiyle piyasaya sürüldü ve genel kullanım için güvenli hale getirilmiş bir Mythos sınıfı model olduğu için dahili bir güvenlik yönlendirme katmanıyla birlikte gelir. Mekanizma anlaşıldığında oldukça basittir: sınıflandırıcılar birkaç hassas alandaki sorguları izler ve bunlardan biri tetiklendiğinde, istek tam Fable 5 modeli yerine Claude Opus 4.8 tarafından yanıtlanır. Bu durum ortalama olarak oturumların %5'inden daha azında gerçekleşir, bu nedenle çoğu geliştirici nadiren karşılaşır. Bu makale, güvenlik yönlendirmesinin nasıl çalıştığını, hangi konuları kapsadığını, pratikte nasıl hissettirdiğini ve Anthropic'in neden reddetmek yerine yönlendirmeyi seçtiğini açıklamaktadır.
Özetle
Claude Fable 5, üç hassas alandaki sorguları algılayan sınıflandırıcılar çalıştırır ve bunları tam Fable 5 modeli yerine Claude Opus 4.8'e yönlendirir. Güvenlik önlemleri ortalama olarak oturumların %5'inden daha azında tetiklenir. Korunan üç alan siber güvenlik, biyoloji ve kimya ile model damıtmadır. Hiçbir şey yapılandırmazsınız ve fiyatlandırma değişmez.
Güvenlik önlemleri ne işe yarar
Claude Fable 5 güvenlik önlemlerinin arkasındaki temel fikir, genel bir filtre değil, bir yönlendirme kararıdır. claude-fable-5'e gönderdiğiniz her istek bir dizi sınıflandırıcıdan geçer. Bu sınıflandırıcılar sorguyu inceler ve korunan kategorilerden birine girip girmediğine karar verir. İsteklerin büyük çoğunluğu için yanıt hayırdır ve istek beklediğiniz gibi tam Fable 5 modeli tarafından işlenir.

Bir sınıflandırıcı bir isteği hassas olarak işaretlediğinde, istek doğrudan reddedilmez. Bunun yerine, Fable 5 yerine sorguyu yanıtlayan Claude Opus 4.8'e geri döner. Uygulamanızın bakış açısından, yanıt hala aynı API çağrısı ve aynı model kimliği aracılığıyla geri gelir. Fark, yanıtı oluşturan temel modelin tam Fable 5 modeli yerine Opus 4.8 olmasıdır. Bu ayrım önemlidir çünkü iki model farklı çıktılar üretebilir ve geri dönüşün uygulandığı konularda farklı davranabilir.
Tasarımın kalbi olduğu için bunu tekrar belirtmekte fayda var. Fable 5, Anthropic'in ürün yelpazesinin yüksek yetenekli ucunda yer alan bir Mythos sınıfı modeldir. Bu kadar yetenekli bir modeli genel halk kullanımı için güvenli hale getirmek, en fazla riski taşıyan dar bir yetenek setinin etrafına koruyucu bariyerler koymak anlamına gelir. Anthropic, Fable 5'in bu sorguları kendisinin reddetmesini sağlamak yerine, bu konulardaki davranışları iyi bilinen ve geniş çapta ifşa edilmesi güvenli kabul edilen bir modele bunları sessizce yönlendiren bir katman oluşturdu. Model sınıfının kendisi hakkında bilgi edinmek isterseniz, Mythos sınıfı bir modelin ne olduğunu açıklayan makaleye bakın.
Yönlendirme otomatiktir ve Anthropic tarafında yer alır. Geçtiğiniz bir parametre, ayarladığınız bir başlık veya isteğinizde açıp kapatan bir bayrak yoktur. Sınıflandırıcılar her oturumda çalışır ve geri dönüş yalnızca bunlardan biri tetiklendiğinde devreye girer.
Üç korunan alan
Claude Fable 5 güvenlik önlemleri üç kategoriyi kapsar. Her biri, yüksek yetenekli bir modelin zarar verme engellerini önemli ölçüde düşürebileceği bir alandır, bu yüzden her biri engellenmiştir. Aşağıdaki açıklamalar neyin engellendiğini kapsar, bu alanlarda herhangi bir şeyin nasıl yapılacağını değil.
Siber güvenlik
İlk korunan alan saldırı siber güvenliğidir. Bu, sömürü geliştirme, saldırı siber görevleri ve bir modelden bir saldırıyı gerçekleştirmesinin veya hızlandırmasının isteneceği ajanssal hackleme iş akışları gibi konuları kapsar. Sınıflandırıcılar bu tür bir sorgu algıladığında, istek Opus 4.8'e yönlendirilir.

Siber güvenlik önlemleri, Fable 5'in saldırı yeteneğini ölçen siber değerlendirme görevlerinde ilerleme kaydetmesini engellemek için tasarlanmıştır. Modeli test eden harici bir ortak, Fable 5'in zararlı siber sorgulara karşı güvenlik önlemlerinin test ettikleri en "sağlam" önlemler arasında olduğunu, kaynağın kendi kelimesini kullanarak belirtti. Buradaki çerçeveleme savunmacıdır: amaç, modelin bir saldırganın çalışmasını ilerletmesini önlerken, sıradan güvenlik sorularını, savunma çalışmalarını ve eğitim materyalini etkilenmeden bırakmaktır.
Biyoloji ve kimya
İkinci korunan alan, bu alanlardaki en tehlikeli yeteneklere değinen biyoloji ve kimya sorgularını kapsar. Örnekler arasında AAV tasarımı ve biyolojik silahlarla ilgili sorgular bulunur. Siber güvenlikte olduğu gibi, bir sınıflandırıcı bu isteklerden birini işaretlediğinde, yanıt tam Fable 5 modeli yerine Opus 4.8'den gelir.

Amaç, en yüksek riskli biyoloji ve kimya yeteneklerini bir koruyucu bariyerin arkasında tutarken, bu alandaki bilimsel, tıbbi ve eğitimle ilgili soruların büyük çoğunluğunu dokunulmadan bırakmaktır. Biyoloji veya kimya araçları geliştiren çoğu geliştirici geri dönüşü asla yaşamayacaktır, çünkü engel gerçekten tehlikeli içeriğin dar bir bandını hedeflemektedir.
Damıtma
Üçüncü korunan alan model damıtmadır. Bu, rekabetçi modeller eğitmek amacıyla modeli çıkarmaya yönelik girişimleri kapsar; örneğin, davranışını yakalamak ve başka bir yerde yeniden üretmek için sistematik olarak sorgulayarak. Damıtma girişimlerine benzeyen sorgular, siber ve biyoloji sorguları gibi Opus 4.8'e yönlendirilir.
Damıtma, diğer iki alandan karakter olarak farklıdır. Gerçek dünyadaki fiziksel zararı önlemekle ilgili değil; modelin kendisini kopyalanmaktan korumakla ilgilidir. Ancak yönlendirme mekanizması aynıdır, bu da genel sistemi basit tutar: bir sınıflandırıcı katmanı, bir geri dönüş hedefi, üç kategori.
Ne sıklıkta tetiklenir ve pratikte nasıl hissedilir
Anahtar sayı, Claude Fable 5 güvenlik önlemlerinin ortalama olarak oturumların %5'inden daha azında tetiklenmesidir. Çoğu uygulama için bu, geri dönüşün sürekli bir varlık olmaktan ziyade nadir bir olay olduğu anlamına gelir. Genel amaçlı bir kodlama asistanı, bir yazı aracı, bir müşteri destek botu veya diğer çoğu yaygın ürünü geliştiriyorsanız, onu hiç görmeden uzun süre devam edebilirsiniz.
Peki bu gerçekleştiğinde nasıl hissedilir? Dışarıdan bakıldığında çok az şey değişir. API çağrınız başarılı olur, bir yanıt alırsınız ve yanıt tutarlı ve konuyla ilgilidir. Doğrudan göremediğiniz şey, yanıtın tam Fable 5 modeli yerine Opus 4.8 tarafından oluşturulmuş olmasıdır. İki model farklı olduğu için, bu belirli konulardaki çıktı, Fable 5'in üreteceğinden ton, derinlik veya yaklaşım açısından farklılık gösterebilir.
Pratikte, bu, sistemi nasıl gözlemlediğiniz açısından birkaç şeyi ifade eder:
- Üç korunan alanda yoğunlaşan küçük bir kısım istek Opus 4.8 tarafından sunulacaktır.
- Bu konulardaki çıktılar, Fable 5'ten alakasız konularda beklediğiniz stil veya yetenek profiliyle eşleşmeyebilir.
- Tipik durumda bir hata veya kesin bir reddedilme almazsınız; istek normal şekilde tamamlanır.
- Davranış tutarlıdır: aynı tür hassas sorgu genellikle aynı şekilde yönlendirilir.
Ürününüz siber güvenliğe, biyolojiye, kimyaya veya model çıkarımına benzeyen herhangi bir şeye hiç değinmiyorsa, güvenlik önlemlerini büyük olasılıkla hiç fark etmeyeceksiniz. Ürününüz bu alanlardan birinde yer alıyorsa, geri dönüş deneyiminizin daha düzenli bir parçası olacak ve buna göre tasarlamak faydalı olacaktır. Bunu kendiniz görmek için pratik bir yol, API aracılığıyla çeşitli istemler göndermek ve hangilerinin farklı davrandığını izlemektir. Apidog gibi bir araçta Fable 5 API'sini test ettiğinizde, bir istem koleksiyonunu kaydedebilir ve hangi kategorilerin geri dönüşü tetiklediğini belirlemek için bunları tekrar tekrar çalıştırabilirsiniz.
Neden reddetmek yerine yönlendirme
Doğal bir soru, Anthropic'in neden Fable 5'in birçok modelin yaptığı gibi hassas sorguları reddetmesini sağlamak yerine bir yönlendirme katmanı oluşturduğudur. Cevap, güvenlik-ile-yetenek tasarım hedefine dayanmaktadır.
Reddetme bir çıkmazdır. Kullanıcı bir şey sorar, model reddeder ve etkileşim durur. Bu, gerçekten kötü niyetli istekler için doğru sonuçtur, ancak kaba bir araçtır. Hassas bir alana değinen birçok sorgu meşrudur: savunma amaçlı bir soru soran bir güvenlik araştırmacısı, biyoloji konusu çalışan bir öğrenci, bir sınıflandırıcıya düşmanca görünen bir şeyi hata ayıklayan bir geliştirici. Kesin bir reddetme, tüm bunları aynı şekilde ele alır ve meşru iş yapan kişiler için sinir bozucu bir deneyim yaratır.
Opus 4.8'e yönlendirme daha yumuşak bir yanıttır. Reddetmek yerine, sistem sorguyu bu alanlardaki davranışı iyi bilinen ve halka açık bir şekilde ifşa edilmesi güvenli kabul edilen bir modele devreder. Kullanıcı hala bir yanıt alır; bu yanıt, o dar konu setinde farklı bir yetenek profiline sahip bir modelden gelir. Bu, Fable 5'i korunan alanlar dışındaki her şey için tam yeteneğiyle geniş çapta kullanışlı tutarken, en yüksek riskli yeteneklerin genel halka tam güçle sunulmamasını sağlar.
Siber güvenlik durumu, çerçevelemeyi açıkça gösterir. Güvenlik önleminin amacı genel olarak güvenlik çalışmalarını engellemek değil, modelin saldırı siber görevlerinde ilerleme kaydetmesini önlemektir. Savunma güvenliği, eğitim ve sıradan mühendislik sorularının normal şekilde akması amaçlanmaktadır. Harici ortağın, Fable 5'in zararlı siber sorgulara karşı güvenlik önlemlerinin test ettikleri en "sağlam" önlemler arasında olduğunu bulması, bu savunma sınırının ne kadar iyi işlediğini gösterir. Anthropic, genel yaklaşımı hakkında daha fazla bilgiyi güvenlik ve sorumlu ölçeklendirme sayfasında yayınlamakta olup, her iki modelin lansman detayları Fable 5 ve Mythos 5 duyurusunda yer almaktadır.
Güvenlik önlemleri açısından Fable 5 ve Mythos 5
Fable 5'in Claude Mythos 5 adında bir muadili vardır. Mythos 5, bazı alanlarda güvenlik önlemleri kaldırılmış aynı temel modeldir. Genel anlamda farklı bir mimariye veya daha yetenekli bir sisteme sahip değildir; kamuya açık sürümünü güvenli tutan bazı yönlendirmeler olmadan Fable 5'tir.
Bu güvenlik önlemlerini kaldırmak risk profilini değiştirdiği için Mythos 5 halka açık değildir. Erişim, siber savunmacılar ve altyapı sağlayıcıları ile seçkin biyoloji araştırmacılarını içeren Project Glasswing ortaklarıyla sınırlıdır. Bunlar, çalışmaları gerçekten sınırsız yetenekler gerektiren ve uygun denetim altında çalışan kuruluşlar ve bireylerdir. İki modelin karşılaştırmalı dökümü için Fable 5 vs Mythos 5 bölümüne bakın.
Çoğu geliştirici için pratik çıkarım kısadır: Fable 5 üzerinde geliştirme yapıyorsunuz, güvenlik önlemleri bunun bir parçasıdır ve sınırsız sürüme giden halka açık bir yol yoktur. Çalışmanız ortak kategorilerinden birine giriyorsa, Mythos 5'e giden yol bir API bayrağı aracılığıyla değil, Project Glasswing aracılığıyla işler.
Uygulamanız için ne anlama geliyor
Tipik bir uygulama için, Claude Fable 5 güvenlik önlemleri sizden hiçbir şey gerektirmez. Ayarlama adımı, ayarlanacak bir anahtar veya istek kodunuza eklemeniz gereken özel bir işlem yoktur. Sınıflandırıcılar ve geri dönüş tamamen Anthropic tarafında yer alır. API'yi claude-fable-5 model kimliğiyle çağırırsınız ve yönlendirme şeffaf bir şekilde gerçekleşir.
İçselleştirmeniz gereken ana şey, isteklerinizin küçük bir kısmının Fable 5 yerine Opus 4.8 tarafından sunulabileceği ve bunun korunan konulardaki çıktıları ve davranışı etkileyebileceğidir. Ürününüz siber güvenliğe, biyolojiye, kimyaya veya model çıkarımına benzeyen herhangi bir şeye değiniyorsa, geri dönüşü bir uç durum olarak değil, deneyimin normal bir parçası olarak planlayın. Diğer herkes için ise, nadiren özel dikkat gerektirecek kadar seyrek görülür.
Akılda tutulması gereken birkaç somut nokta:
- Yapılandırılacak hiçbir şey yoktur. Güvenlik önlemleri otomatiktir ve API aracılığıyla kapatılamaz.
- Maliyet değişmez. Fable 5 fiyatlandırması, belirli bir isteğin Fable 5 tarafından sunulmuş veya Opus 4.8'e geri dönmüş olmasından bağımsız olarak, milyon giriş tokenı başına 10 dolar ve milyon çıkış tokenı başına 50 dolar olarak kalır. Geri dönüş sizi farklı bir fiyata geçirmez. Tam fiyatlandırma dökümünü görmek isterseniz, Claude Fable 5 fiyatlandırma kılavuzuna bakın.
- Hassas alanlarda geliştirme yapıyorsanız, geri dönüşü bekleyin. İstemlerinizi, değerlendirmelerinizi ve kullanıcı beklentilerinizi yönlendirmeyi göz önünde bulundurarak tasarlayın.
- Yayınlamadan önce test edin. API aracılığıyla temsili bir istem kümesi çalıştırın ve hangi kategorilerin farklı davrandığını gözlemleyin, böylece üretimde şaşırmazsınız.
Yanıt aynı çağrı ve aynı model kimliği aracılığıyla geri geldiği için, tek bir yanıttan hangi modelin onu oluşturduğunu her zaman anlayamazsınız. Bu, tasarımdan kaynaklanmaktadır ve çoğu kullanım durumu için uygundur. Davranış sınırını tam olarak anlamanız gerekiyorsa, en güvenilir yaklaşım, üç korunan alanın sınırlarını zorlayan bir test paketi oluşturmak ve farklılıkları doğrudan gözlemlemektir. Opus 4.8, hassas konulu isteklerinizin geri döndüğü model olduğu için Opus 4.8 API kullanım kılavuzu faydalı bir arka plan bilgisidir.
Kısa versiyonu, Claude Fable 5 güvenlik önlemlerinin, hassas isteklerin küçük bir kısmını Opus 4.8'e gönderen, geri kalan her şeyi Fable 5'in tam yeteneğiyle, hiçbir kurulum ve maliyet değişikliği olmadan bırakan sessiz, otomatik bir yönlendirme katmanı olduğudur. Siber güvenlik, biyoloji, kimya veya model çıkarımına yakın herhangi bir alanda geliştirme yapıyorsanız, bir sonraki adımınız küçük bir test istemleri kümesi oluşturmak, bunları API aracılığıyla çalıştırmak ve korunan alanların nasıl davrandığını izlemek olacaktır, böylece uygulamanız geri dönüş için hazır olur. Model ailesi hakkında daha geniş bir bağlam için, Claude Fable 5 nedir ve modeller genel bakışı ile başlayın, ardından Fable 5 API kılavuzu ile onu yığınınızla entegre etmeye geçin. Test etmeye hazır olduğunuzda, Apidog size bu istemleri çalıştırma ve karşılaştırma imkanı sunar.
