Jika Anda mulai membangun di Claude Fable 5 dan menyadari bahwa beberapa permintaan berperilaku berbeda dari yang lain, Anda sedang melihat pengaman Claude Fable 5 beraksi. Fable 5 diluncurkan pada 9 Juni 2026 dengan ID model claude-fable-5, dan dilengkapi dengan lapisan perutean keamanan bawaan karena ini adalah model kelas Mythos yang dibuat aman untuk penggunaan umum. Mekanismenya cukup sederhana setelah Anda memahaminya: pengklasifikasi memantau kueri di beberapa area sensitif, dan ketika salah satunya terpicu, permintaan akan dijawab oleh Claude Opus 4.8 alih-alih model Fable 5 penuh. Ini terjadi kurang dari 5% sesi rata-rata, sehingga sebagian besar pengembang jarang menemukannya. Artikel ini menjelaskan cara kerja perutean keamanan, topik apa saja yang dicakupnya, bagaimana rasanya dalam praktik, dan mengapa Anthropic memilih untuk merutekan daripada menolak.
Intinya
Claude Fable 5 menjalankan pengklasifikasi yang mendeteksi kueri di tiga area sensitif dan merutekannya ke Claude Opus 4.8 alih-alih model Fable 5 penuh. Pengaman terpicu rata-rata kurang dari 5% sesi. Tiga area yang dilindungi adalah keamanan siber, biologi dan kimia, serta distilasi model. Anda tidak perlu mengonfigurasi apa pun, dan harga tidak berubah.
Cara kerja pengaman
Gagasan inti di balik pengaman Claude Fable 5 adalah keputusan perutean, bukan filter umum. Setiap permintaan yang Anda kirimkan ke claude-fable-5 melewati serangkaian pengklasifikasi. Pengklasifikasi tersebut melihat kueri dan memutuskan apakah kueri tersebut termasuk dalam salah satu kategori yang dilindungi. Untuk sebagian besar permintaan, jawabannya adalah tidak, dan permintaan ditangani oleh model Fable 5 penuh persis seperti yang Anda harapkan.

Ketika pengklasifikasi menandai permintaan sebagai sensitif, permintaan tersebut tidak langsung ditolak. Sebaliknya, ia kembali ke Claude Opus 4.8, yang menjawab kueri sebagai pengganti Fable 5. Dari sudut pandang aplikasi Anda, respons masih datang melalui panggilan API yang sama dan ID model yang sama. Perbedaannya adalah model dasar yang menghasilkan jawaban adalah Opus 4.8 daripada model Fable 5 penuh. Perbedaan itu penting karena kedua model dapat menghasilkan output yang berbeda dan berperilaku berbeda pada topik di mana pengalihan berlaku.
Ini layak ditekankan kembali karena ini adalah inti dari desain. Fable 5 adalah model kelas Mythos, yang berarti berada di ujung kapabilitas tinggi dari jajaran Anthropic. Membuat model dengan kapabilitas itu aman untuk penggunaan publik umum berarti menempatkan pagar pembatas di sekitar kumpulan kapabilitas sempit yang paling berisiko. Daripada mencoba membuat Fable 5 itu sendiri menolak kueri tersebut, Anthropic membangun lapisan yang diam-diam mengalihkan mereka ke model yang perilakunya pada topik tersebut dipahami dengan baik dan dianggap aman untuk diekspos secara luas. Jika Anda ingin latar belakang tentang kelas model itu sendiri, lihat penjelasan tentang apa itu model kelas Mythos.
Perutean bersifat otomatis dan berada di pihak Anthropic. Tidak ada parameter yang Anda kirimkan, tidak ada header yang Anda atur, dan tidak ada tanda dalam permintaan Anda yang menghidupkan atau mematikannya. Pengklasifikasi berjalan di setiap sesi, dan pengalihan hanya berfungsi ketika salah satunya terpicu.
Tiga area yang dilindungi
Pengaman Claude Fable 5 mencakup tiga kategori. Masing-masing adalah domain di mana model berkemampuan tinggi secara signifikan dapat menurunkan hambatan untuk menyebabkan bahaya, sehingga masing-masing dijaga. Deskripsi di bawah ini mencakup apa yang dijaga, bukan cara melakukan sesuatu di area ini.
Keamanan siber
Area yang dilindungi pertama adalah keamanan siber ofensif. Ini mencakup hal-hal seperti pengembangan eksploit, tugas siber ofensif, dan alur kerja peretasan agen di mana model akan diminta untuk melaksanakan atau mempercepat serangan. Ketika pengklasifikasi mendeteksi kueri jenis ini, permintaan dirutekan ke Opus 4.8.

Pengaman keamanan siber dirancang untuk mencegah Fable 5 membuat kemajuan pada tugas evaluasi siber yang mengukur kapabilitas ofensif. Mitra eksternal yang menguji model menemukan pengaman Fable 5 terhadap kueri siber berbahaya termasuk yang paling "kuat" yang mereka uji, menggunakan kata dari sumber itu sendiri. Kerangka di sini bersifat defensif: tujuannya adalah untuk mencegah model memajukan pekerjaan penyerang, sambil menyisakan pertanyaan keamanan biasa, pekerjaan defensif, dan materi edukasi tidak terpengaruh.
Biologi dan kimia
Area yang dilindungi kedua mencakup kueri biologi dan kimia yang menyentuh kapabilitas paling berbahaya di bidang tersebut. Contohnya termasuk desain AAV dan kueri terkait senjata biologis. Seperti halnya keamanan siber, ketika pengklasifikasi menandai salah satu permintaan ini, jawaban berasal dari Opus 4.8 daripada model Fable 5 penuh.

Tujuannya adalah untuk menjaga kapabilitas biologi dan kimia berisiko tinggi di balik pagar pembatas sambil menyisakan sebagian besar pertanyaan ilmiah, medis, dan edukasi di bidang ini tidak tersentuh. Sebagian besar pengembang yang membangun perkakas biologi atau kimia tidak akan pernah mengalami pengalihan, karena penjagaan ditujukan pada cakupan sempit konten yang benar-benar berbahaya.
Distilasi
Area yang dilindungi ketiga adalah distilasi model. Ini mencakup upaya untuk mengekstraksi model guna melatih model pesaing, misalnya dengan menyelidikinya secara sistematis untuk menangkap perilakunya dan mereproduksikannya di tempat lain. Kueri yang menyerupai upaya distilasi dirutekan ke Opus 4.8 dengan cara yang sama seperti kueri siber dan bio.
Distilasi berbeda karakternya dari dua area lainnya. Ini bukan tentang mencegah kerugian fisik di dunia nyata; ini tentang melindungi model itu sendiri agar tidak disalin. Tetapi mekanisme peruteannya identik, yang membuat sistem keseluruhan sederhana: satu lapisan pengklasifikasi, satu target pengalihan, tiga kategori.
Seberapa sering terpicu dan bagaimana rasanya dalam praktiknya
Angka utamanya adalah pengaman Claude Fable 5 terpicu rata-rata kurang dari 5% sesi. Untuk sebagian besar aplikasi, itu berarti pengalihan adalah peristiwa langka daripada kehadiran yang konstan. Jika Anda membangun asisten pengkodean serbaguna, alat tulis, bot dukungan pelanggan, atau sebagian besar produk umum lainnya, Anda mungkin lama tidak pernah melihatnya.
Bagaimana rasanya ketika itu terjadi? Dari luar, sangat sedikit yang berubah. Panggilan API Anda berhasil, Anda mendapatkan respons, dan responsnya koheren dan relevan dengan topik. Hal yang tidak bisa Anda lihat secara langsung adalah bahwa jawaban dihasilkan oleh Opus 4.8 daripada model Fable 5 penuh. Karena kedua model berbeda, output pada topik spesifik tersebut dapat berbeda dalam nada, kedalaman, atau pendekatan dari apa yang akan dihasilkan Fable 5.
Dalam praktiknya, ini berarti beberapa hal tentang bagaimana Anda mengamati sistem:
- Sebagian kecil permintaan, yang terkonsentrasi di tiga area yang dilindungi, akan dilayani oleh Opus 4.8.
- Output pada topik tersebut mungkin tidak sesuai dengan gaya atau profil kapabilitas yang Anda harapkan dari Fable 5 pada topik yang tidak terkait.
- Anda tidak akan mendapatkan kesalahan atau penolakan keras dalam kasus tipikal; permintaan selesai secara normal.
- Perilakunya konsisten: jenis kueri sensitif yang sama cenderung dirutekan dengan cara yang sama.
Jika produk Anda tidak pernah menyentuh keamanan siber, biologi, kimia, atau apa pun yang menyerupai ekstraksi model, kemungkinan besar Anda tidak akan pernah menyadari pengaman sama sekali. Jika produk Anda berada di salah satu domain tersebut, pengalihan akan menjadi bagian yang lebih rutin dari pengalaman Anda, dan layak untuk diperhitungkan dalam desain. Cara praktis untuk melihat ini sendiri adalah dengan mengirimkan berbagai prompt melalui API dan mengamati mana yang berperilaku berbeda. Ketika Anda menguji API Fable 5 dalam alat seperti Apidog, Anda dapat menyimpan kumpulan prompt dan menjalankannya berulang kali untuk menemukan kategori mana yang memicu pengalihan.
Mengapa merutekan alih-alih menolak
Pertanyaan alami adalah mengapa Anthropic membangun lapisan perutean sama sekali alih-alih hanya membuat Fable 5 menolak kueri sensitif seperti yang dilakukan banyak model. Jawabannya bermuara pada tujuan desain kapabilitas-dengan-keamanan.
Penolakan adalah jalan buntu. Pengguna bertanya sesuatu, model menolak, dan interaksi berhenti. Itu adalah hasil yang tepat untuk permintaan yang benar-benar berbahaya, tetapi ini adalah alat yang tumpul. Banyak kueri yang menyentuh area sensitif adalah sah: seorang peneliti keamanan yang mengajukan pertanyaan defensif, seorang siswa yang mempelajari topik biologi, seorang pengembang yang melakukan debug sesuatu yang kebetulan terlihat antagonistik bagi pengklasifikasi. Penolakan keras memperlakukan semua ini dengan cara yang sama dan menghasilkan pengalaman yang membuat frustrasi bagi orang-orang yang melakukan pekerjaan yang sah.
Perutean ke Opus 4.8 adalah respons yang lebih lunak. Alih-alih menolak, sistem menyerahkan kueri ke model yang perilakunya di area ini dipahami dengan baik dan dianggap aman untuk diekspos kepada publik. Pengguna masih mendapatkan jawaban; itu hanya berasal dari model dengan profil kapabilitas yang berbeda pada kumpulan topik sempit tersebut. Ini menjaga Fable 5 bermanfaat luas dengan kapabilitas penuh untuk segala sesuatu di luar area yang dilindungi, sambil memastikan bahwa kapabilitas berisiko tertinggi tidak tersedia dengan kekuatan penuh untuk masyarakat umum.
Kasus keamanan siber menunjukkan kerangka dengan jelas. Tujuan pengaman bukan untuk memblokir pekerjaan keamanan secara umum tetapi untuk mencegah model membuat kemajuan pada tugas siber ofensif. Keamanan defensif, edukasi, dan pertanyaan teknik biasa dimaksudkan untuk mengalir secara normal. Temuan mitra eksternal bahwa pengaman Fable 5 terhadap kueri siber berbahaya termasuk yang paling "kuat" yang mereka uji menunjukkan seberapa baik batas defensif ini bertahan. Anthropic menerbitkan lebih banyak tentang pendekatan umumnya di halaman keamanan dan penskalaan yang bertanggung jawab mereka, dan detail peluncuran untuk kedua model ada di pengumuman Fable 5 dan Mythos 5.
Fable 5 vs Mythos 5 tentang pengamanan
Fable 5 memiliki mitra yang disebut Claude Mythos 5. Mythos 5 adalah model dasar yang sama dengan pengaman diangkat di beberapa area. Ini bukan arsitektur yang berbeda atau sistem yang lebih berkemampuan dalam pengertian umum; ini adalah Fable 5 tanpa sebagian dari perutean yang menjaga versi publik tetap aman.
Karena mengangkat pengaman tersebut mengubah profil risiko, Mythos 5 tidak publik. Akses dibatasi untuk mitra Project Glasswing, yang meliputi pembela siber dan penyedia infrastruktur, bersama dengan peneliti biologi terpilih. Ini adalah organisasi dan individu yang pekerjaannya benar-benar membutuhkan kapabilitas yang tidak terbatas dan yang beroperasi di bawah pengawasan yang sesuai. Untuk perbandingan berdampingan kedua model, lihat Fable 5 vs Mythos 5.
Poin penting praktis bagi sebagian besar pengembang adalah singkat: Anda membangun di Fable 5, pengaman adalah bagian darinya, dan tidak ada jalur publik ke versi yang tidak terbatas. Jika pekerjaan Anda termasuk dalam salah satu kategori mitra, jalur ke Mythos 5 melalui Project Glasswing, bukan melalui flag API.
Apa artinya ini bagi aplikasi Anda
Untuk aplikasi tipikal, pengaman Claude Fable 5 tidak memerlukan apa pun dari Anda. Tidak ada langkah konfigurasi, tidak ada tombol untuk diatur, dan tidak ada penanganan khusus yang perlu Anda tambahkan ke kode permintaan Anda. Pengklasifikasi dan pengalihan seluruhnya berada di pihak Anthropic. Anda memanggil API dengan ID model claude-fable-5, dan perutean terjadi secara transparan.
Hal utama yang perlu diinternalisasi adalah bahwa sebagian kecil permintaan Anda mungkin dilayani oleh Opus 4.8 daripada Fable 5, dan bahwa ini dapat memengaruhi output dan perilaku pada topik yang dilindungi. Jika produk Anda menyentuh keamanan siber, biologi, kimia, atau apa pun yang menyerupai ekstraksi model, rencanakan pengalihan sebagai bagian normal dari pengalaman daripada kasus ekstrem. Untuk semua orang lain, ini cukup langka sehingga jarang memerlukan perhatian khusus.
Beberapa poin konkret yang perlu diingat:
- Tidak ada yang perlu dikonfigurasi. Pengaman otomatis dan tidak dapat dimatikan melalui API.
- Biaya tidak berubah. Harga Fable 5 tetap $10 per juta token masukan dan $50 per juta token keluaran terlepas dari apakah permintaan tertentu dilayani oleh Fable 5 atau dialihkan ke Opus 4.8. Pengalihan tidak akan mengalihkan Anda ke harga yang berbeda. Jika Anda ingin rincian harga lengkap, lihat panduan harga Claude Fable 5.
- Jika Anda membangun di domain sensitif, harapkan pengalihan. Rancang prompt, evaluasi, dan ekspektasi pengguna Anda dengan mempertimbangkan perutean ini.
- Uji sebelum Anda merilis. Jalankan serangkaian prompt yang representatif melalui API dan amati kategori mana yang berperilaku berbeda agar Anda tidak terkejut saat produksi.
Karena respons kembali melalui panggilan yang sama dan ID model yang sama, Anda tidak selalu dapat mengetahui dari satu respons model mana yang menghasilkannya. Itu berdasarkan desain dan baik-baik saja untuk sebagian besar kasus penggunaan. Jika Anda perlu memahami batas perilaku secara tepat, pendekatan paling andal adalah membangun rangkaian pengujian yang menguji batas-batas tiga area yang dilindungi dan mengamati perbedaannya secara langsung. Panduan penggunaan API Opus 4.8 adalah latar belakang yang berguna, karena Opus 4.8 adalah model tempat permintaan topik sensitif Anda dialihkan kembali.
Versi singkatnya adalah pengaman Claude Fable 5 adalah lapisan perutean otomatis yang senyap yang mengirimkan sebagian kecil permintaan sensitif ke Opus 4.8, menyisakan yang lainnya dengan kapabilitas penuh Fable 5 tanpa pengaturan dan tanpa perubahan biaya Anda. Jika Anda membangun di keamanan siber, biologi, kimia, atau di mana pun yang mendekati ekstraksi model, langkah selanjutnya adalah menyusun serangkaian kecil prompt uji, menjalankannya melalui API, dan mengamati bagaimana area yang dilindungi berperilaku sehingga aplikasi Anda siap untuk pengalihan. Untuk konteks yang lebih luas tentang keluarga model, mulailah dengan apa itu Claude Fable 5 dan gambaran umum model, lalu lanjutkan untuk menghubungkannya ke tumpukan Anda dengan panduan API Fable 5. Ketika Anda siap untuk menguji, Apidog memberi Anda tempat untuk menjalankan dan membandingkan prompt tersebut.
