Cơ chế bảo vệ an toàn của Claude Fable 5 hoạt động thế nào (Giải thích định tuyến)

Cách Claude Fable 5 bảo mật việc định tuyến các truy vấn nhạy cảm đến Opus 4.8: các bộ phân loại, ba khu vực được bảo vệ và ý nghĩa của cơ chế dự phòng đối với ứng dụng của bạn.

INEZA Felin-Michel

INEZA Felin-Michel

10 tháng 6 2026

Cơ chế bảo vệ an toàn của Claude Fable 5 hoạt động thế nào (Giải thích định tuyến)

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Nếu bạn đã bắt đầu xây dựng trên Claude Fable 5 và nhận thấy một số yêu cầu hoạt động khác với phần còn lại, đó là bạn đang chứng kiến các biện pháp bảo vệ của Claude Fable 5 đang hoạt động. Fable 5 ra mắt vào ngày 9 tháng 6 năm 2026 với ID mô hình claude-fable-5, và nó được tích hợp một lớp định tuyến an toàn vì đây là mô hình thuộc lớp Mythos được thiết kế an toàn cho việc sử dụng rộng rãi. Cơ chế này khá đơn giản một khi bạn hiểu nó: các bộ phân loại theo dõi các truy vấn trong một vài lĩnh vực nhạy cảm, và khi một truy vấn kích hoạt, yêu cầu sẽ được trả lời bởi Claude Opus 4.8 thay vì mô hình Fable 5 đầy đủ. Điều này xảy ra trong ít hơn 5% số phiên trung bình, vì vậy hầu hết các nhà phát triển hiếm khi gặp phải. Bài viết này giải thích cách thức hoạt động của định tuyến an toàn, các chủ đề mà nó bao gồm, cảm giác thực tế khi sử dụng và lý do Anthropic chọn định tuyến thay vì từ chối.

TL;DR

Claude Fable 5 chạy các bộ phân loại để phát hiện các truy vấn trong ba lĩnh vực nhạy cảm và định tuyến chúng đến Claude Opus 4.8 thay vì mô hình Fable 5 đầy đủ. Các biện pháp bảo vệ kích hoạt trong ít hơn 5% số phiên trung bình. Ba lĩnh vực được bảo vệ là an ninh mạng, sinh học và hóa học, và chắt lọc mô hình (model distillation). Bạn không cần cấu hình gì cả, và giá cả không thay đổi.

Các biện pháp bảo vệ làm gì

Ý tưởng cốt lõi đằng sau các biện pháp bảo vệ của Claude Fable 5 là một quyết định định tuyến, chứ không phải là một bộ lọc tổng thể. Mọi yêu cầu bạn gửi đến claude-fable-5 đều đi qua một tập hợp các bộ phân loại. Các bộ phân loại này xem xét truy vấn và quyết định xem nó có thuộc một trong các danh mục được bảo vệ hay không. Đối với phần lớn các yêu cầu, câu trả lời là không, và yêu cầu được xử lý bởi mô hình Fable 5 đầy đủ đúng như bạn mong đợi.

Khi một bộ phân loại gắn cờ một yêu cầu là nhạy cảm, yêu cầu đó không bị từ chối thẳng thừng. Thay vào đó, nó chuyển sang Claude Opus 4.8, mô hình này sẽ trả lời truy vấn thay cho Fable 5. Từ góc độ của ứng dụng của bạn, phản hồi vẫn trả về thông qua cùng một lệnh gọi API và cùng một ID mô hình. Sự khác biệt là mô hình cơ bản tạo ra câu trả lời là Opus 4.8 chứ không phải mô hình Fable 5 đầy đủ. Sự khác biệt đó quan trọng vì hai mô hình có thể tạo ra các kết quả đầu ra khác nhau và hoạt động khác nhau trên các chủ đề mà cơ chế dự phòng được áp dụng.

Điều này đáng được nhắc lại vì nó là cốt lõi của thiết kế. Fable 5 là một mô hình thuộc lớp Mythos, có nghĩa là nó nằm ở phân khúc khả năng cao trong dòng sản phẩm của Anthropic. Để một mô hình có khả năng như vậy an toàn cho việc sử dụng rộng rãi, cần phải đặt ra các rào cản xung quanh tập hợp nhỏ các khả năng mang lại rủi ro cao nhất. Thay vì cố gắng làm cho Fable 5 tự từ chối các truy vấn đó, Anthropic đã xây dựng một lớp âm thầm chuyển hướng chúng đến một mô hình mà hành vi của nó trên các chủ đề đó đã được hiểu rõ và được coi là an toàn để công bố rộng rãi. Nếu bạn muốn tìm hiểu về lớp mô hình này, hãy xem phần giải thích về mô hình Mythos-class là gì.

Việc định tuyến là tự động và nằm ở phía Anthropic. Không có tham số nào bạn truyền vào, không có tiêu đề nào bạn đặt và không có cờ nào trong yêu cầu của bạn để bật hoặc tắt nó. Các bộ phân loại chạy trên mọi phiên và cơ chế dự phòng chỉ được kích hoạt khi một trong số chúng được kích hoạt.

Ba lĩnh vực được bảo vệ

Các biện pháp bảo vệ của Claude Fable 5 bao gồm ba danh mục. Mỗi danh mục là một lĩnh vực mà một mô hình có khả năng cao có thể làm giảm đáng kể rào cản gây hại, vì vậy mỗi danh mục đều được kiểm soát. Các mô tả dưới đây bao gồm những gì được kiểm soát, chứ không phải cách thực hiện bất kỳ điều gì trong các lĩnh vực này.

An ninh mạng

Lĩnh vực được bảo vệ đầu tiên là an ninh mạng tấn công. Điều này bao gồm những thứ như phát triển khai thác lỗ hổng, các tác vụ tấn công mạng, và các quy trình hack tự động nơi một mô hình sẽ được yêu cầu thực hiện hoặc đẩy nhanh một cuộc tấn công. Khi các bộ phân loại phát hiện một truy vấn thuộc loại này, yêu cầu sẽ được định tuyến đến Opus 4.8.

Các biện pháp bảo vệ an ninh mạng được thiết kế để ngăn Fable 5 tiến triển trong các nhiệm vụ đánh giá mạng đo lường khả năng tấn công. Một đối tác bên ngoài đã thử nghiệm mô hình nhận thấy các biện pháp bảo vệ của Fable 5 chống lại các truy vấn mạng có hại nằm trong số những biện pháp “mạnh mẽ” nhất mà họ đã thử nghiệm, theo lời của nguồn tin. Cách tiếp cận ở đây là phòng thủ: mục tiêu là ngăn mô hình hỗ trợ công việc của kẻ tấn công, đồng thời giữ nguyên các câu hỏi bảo mật thông thường, công việc phòng thủ và tài liệu giáo dục không bị ảnh hưởng.

Sinh học và hóa học

Lĩnh vực được bảo vệ thứ hai bao gồm các truy vấn sinh học và hóa học liên quan đến những khả năng nguy hiểm nhất trong các lĩnh vực đó. Ví dụ bao gồm thiết kế AAV và các truy vấn liên quan đến vũ khí sinh học. Tương tự như an ninh mạng, khi một bộ phân loại gắn cờ một trong các yêu cầu này, câu trả lời sẽ đến từ Opus 4.8 chứ không phải mô hình Fable 5 đầy đủ.

Mục đích là giữ các khả năng sinh học và hóa học có rủi ro cao nhất sau một hàng rào bảo vệ, đồng thời không động đến phần lớn các câu hỏi khoa học, y tế và giáo dục trong lĩnh vực này. Hầu hết các nhà phát triển xây dựng công cụ sinh học hoặc hóa học sẽ không bao giờ gặp phải trường hợp dự phòng, vì cổng bảo vệ chỉ nhắm vào một phạm vi hẹp các nội dung thực sự nguy hiểm.

Chắt lọc mô hình

Lĩnh vực được bảo vệ thứ ba là chắt lọc mô hình. Điều này bao gồm các nỗ lực trích xuất mô hình để đào tạo các mô hình cạnh tranh, ví dụ bằng cách thăm dò hệ thống để nắm bắt hành vi của nó và tái tạo nó ở nơi khác. Các truy vấn có vẻ giống nỗ lực chắt lọc mô hình sẽ được định tuyến đến Opus 4.8 tương tự như các truy vấn về an ninh mạng và sinh học.

Chắt lọc mô hình khác về bản chất so với hai lĩnh vực kia. Nó không nhằm ngăn chặn tổn hại vật lý trong thế giới thực; nó nhằm bảo vệ chính mô hình khỏi bị sao chép. Nhưng cơ chế định tuyến là giống hệt nhau, điều này giữ cho hệ thống tổng thể đơn giản: một lớp phân loại, một mục tiêu dự phòng, ba danh mục.

Tần suất kích hoạt và cảm giác thực tế khi sử dụng

Con số đáng chú ý là các biện pháp bảo vệ của Claude Fable 5 kích hoạt trong ít hơn 5% số phiên trung bình. Đối với hầu hết các ứng dụng, điều đó có nghĩa là việc dự phòng là một sự kiện hiếm hoi chứ không phải là một sự hiện diện liên tục. Nếu bạn đang xây dựng một trợ lý lập trình đa năng, một công cụ viết, một bot hỗ trợ khách hàng hoặc hầu hết các sản phẩm phổ biến khác, bạn có thể sẽ không bao giờ thấy nó trong một thời gian dài.

Cảm giác như thế nào khi điều đó xảy ra? Từ bên ngoài, rất ít thay đổi. Lệnh gọi API của bạn thành công, bạn nhận được phản hồi, và phản hồi đó mạch lạc và đúng chủ đề. Điều bạn không thể thấy trực tiếp là câu trả lời được tạo ra bởi Opus 4.8 chứ không phải mô hình Fable 5 đầy đủ. Vì hai mô hình khác nhau, đầu ra về các chủ đề cụ thể đó có thể khác về giọng điệu, độ sâu hoặc cách tiếp cận so với những gì Fable 5 sẽ tạo ra.

Trong thực tế, điều này có nghĩa là một vài điều về cách bạn quan sát hệ thống:

Nếu sản phẩm của bạn không bao giờ liên quan đến an ninh mạng, sinh học, hóa học hoặc bất cứ điều gì giống như trích xuất mô hình, bạn có thể sẽ không bao giờ nhận thấy các biện pháp bảo vệ này. Nếu sản phẩm của bạn hoạt động trong một trong những lĩnh vực đó, cơ chế dự phòng sẽ là một phần thường xuyên hơn trong trải nghiệm của bạn, và đáng để thiết kế xung quanh nó. Một cách thực tế để tự mình kiểm chứng điều này là gửi một loạt các câu lệnh (prompt) qua API và xem câu lệnh nào hoạt động khác nhau. Khi bạn kiểm tra API Fable 5 trong một công cụ như Apidog, bạn có thể lưu một bộ sưu tập các câu lệnh và chạy chúng nhiều lần để phát hiện danh mục nào kích hoạt cơ chế dự phòng.

Tại sao định tuyến thay vì từ chối

Một câu hỏi tự nhiên là tại sao Anthropic lại xây dựng một lớp định tuyến mà không đơn giản là để Fable 5 từ chối các truy vấn nhạy cảm như nhiều mô hình khác. Câu trả lời nằm ở mục tiêu thiết kế "khả năng đi đôi với an toàn".

Một sự từ chối là một ngõ cụt. Người dùng hỏi một điều gì đó, mô hình từ chối, và tương tác dừng lại. Đó là kết quả đúng đắn cho các yêu cầu thực sự độc hại, nhưng nó là một công cụ thô thiển. Rất nhiều truy vấn chạm đến một lĩnh vực nhạy cảm là hợp pháp: một nhà nghiên cứu bảo mật đặt câu hỏi phòng thủ, một sinh viên học một chủ đề sinh học, một nhà phát triển gỡ lỗi một thứ gì đó tình cờ trông có vẻ đối kháng với bộ phân loại. Một sự từ chối cứng nhắc đối xử với tất cả những trường hợp này như nhau và tạo ra trải nghiệm khó chịu cho những người đang thực hiện công việc hợp pháp.

Định tuyến đến Opus 4.8 là một phản hồi nhẹ nhàng hơn. Thay vì từ chối, hệ thống chuyển truy vấn đến một mô hình mà hành vi của nó trong các lĩnh vực này đã được hiểu rõ và được coi là an toàn để công bố rộng rãi. Người dùng vẫn nhận được câu trả lời; nó chỉ đến từ một mô hình có hồ sơ khả năng khác trên tập hợp các chủ đề hẹp đó. Điều này giữ cho Fable 5 hữu ích rộng rãi với đầy đủ khả năng cho mọi thứ bên ngoài các khu vực được bảo vệ, đồng thời đảm bảo rằng các khả năng rủi ro cao nhất không được cung cấp đầy đủ sức mạnh cho công chúng.

Trường hợp an ninh mạng thể hiện rõ ràng khuôn khổ này. Mục đích của biện pháp bảo vệ không phải là chặn công việc bảo mật nói chung mà là ngăn mô hình tiến triển trong các nhiệm vụ tấn công mạng. An ninh phòng thủ, giáo dục và các câu hỏi kỹ thuật thông thường được cho phép hoạt động bình thường. Việc đối tác bên ngoài nhận thấy các biện pháp bảo vệ của Fable 5 chống lại các truy vấn mạng có hại nằm trong số những biện pháp “mạnh mẽ” nhất mà họ đã thử nghiệm cho thấy ranh giới phòng thủ này được duy trì tốt như thế nào. Anthropic công bố thêm về cách tiếp cận chung của mình trên trang về an toàn và mở rộng quy mô có trách nhiệm, và chi tiết ra mắt của cả hai mô hình nằm trong thông báo về Fable 5 và Mythos 5.

Fable 5 so với Mythos 5 về các biện pháp bảo vệ

Fable 5 có một phiên bản đối tác gọi là Claude Mythos 5. Mythos 5 là cùng một mô hình cơ bản nhưng các biện pháp bảo vệ đã được gỡ bỏ ở một số khu vực. Nó không phải là một kiến trúc khác hay một hệ thống có khả năng hơn theo nghĩa chung; nó là Fable 5 nhưng không có một số định tuyến giúp phiên bản công khai an toàn.

Bởi vì việc gỡ bỏ các biện pháp bảo vệ đó làm thay đổi hồ sơ rủi ro, Mythos 5 không được công khai. Quyền truy cập bị hạn chế đối với các đối tác của Project Glasswing, bao gồm các chuyên gia phòng thủ mạng và nhà cung cấp hạ tầng, cùng với một số nhà nghiên cứu sinh học được chọn. Đây là các tổ chức và cá nhân mà công việc của họ thực sự yêu cầu các khả năng không bị hạn chế và hoạt động dưới sự giám sát phù hợp. Để xem phân tích so sánh hai mô hình, hãy xem Fable 5 vs Mythos 5.

Điểm mấu chốt thực tế đối với hầu hết các nhà phát triển là: bạn đang xây dựng trên Fable 5, các biện pháp bảo vệ là một phần của nó, và không có con đường công khai nào để truy cập phiên bản không hạn chế. Nếu công việc của bạn thuộc một trong các danh mục đối tác, con đường đến Mythos 5 là thông qua Project Glasswing, chứ không phải qua một cờ API.

Điều này có ý nghĩa gì đối với ứng dụng của bạn

Đối với một ứng dụng thông thường, các biện pháp bảo vệ của Claude Fable 5 không yêu cầu gì từ bạn. Không có bước cấu hình, không có công tắc để cài đặt, và không có xử lý đặc biệt nào bạn cần thêm vào mã yêu cầu của mình. Các bộ phân loại và cơ chế dự phòng hoàn toàn nằm ở phía Anthropic. Bạn gọi API với ID mô hình claude-fable-5, và việc định tuyến diễn ra một cách minh bạch.

Điều chính cần hiểu rõ là một phần nhỏ các yêu cầu của bạn có thể được xử lý bởi Opus 4.8 thay vì Fable 5, và điều này có thể ảnh hưởng đến đầu ra và hành vi trên các chủ đề được bảo vệ. Nếu sản phẩm của bạn liên quan đến an ninh mạng, sinh học, hóa học hoặc bất cứ điều gì tương tự như trích xuất mô hình, hãy xem xét cơ chế dự phòng như một phần bình thường của trải nghiệm chứ không phải là một trường hợp ngoại lệ. Đối với những người khác, nó đủ hiếm để hiếm khi cần sự chú ý đặc biệt.

Một vài điểm cụ thể cần lưu ý:

Bởi vì phản hồi trả về thông qua cùng một lệnh gọi và cùng một ID mô hình, bạn không thể luôn biết từ một phản hồi duy nhất mô hình nào đã tạo ra nó. Điều đó là theo thiết kế và phù hợp với hầu hết các trường hợp sử dụng. Nếu bạn cần hiểu chính xác ranh giới hành vi, cách tiếp cận đáng tin cậy nhất là xây dựng một bộ kiểm thử để kiểm tra các giới hạn của ba khu vực được bảo vệ và quan sát trực tiếp các khác biệt. Hướng dẫn sử dụng API Opus 4.8 là tài liệu hữu ích, vì Opus 4.8 là mô hình mà các yêu cầu chủ đề nhạy cảm của bạn sẽ chuyển về.

Tóm lại, các biện pháp bảo vệ của Claude Fable 5 là một lớp định tuyến tự động, âm thầm, chuyển một phần nhỏ các yêu cầu nhạy cảm đến Opus 4.8, để lại mọi thứ khác với đầy đủ khả năng của Fable 5 mà không cần thiết lập và không thay đổi chi phí của bạn. Nếu bạn phát triển trong lĩnh vực an ninh mạng, sinh học, hóa học, hoặc bất kỳ nơi nào gần với việc trích xuất mô hình, bước tiếp theo của bạn là chuẩn bị một bộ câu lệnh kiểm thử nhỏ, chạy chúng thông qua API và quan sát cách các khu vực được bảo vệ hoạt động để ứng dụng của bạn sẵn sàng cho cơ chế dự phòng. Để có cái nhìn tổng quan hơn về dòng mô hình này, hãy bắt đầu với Claude Fable 5 là gìtổng quan về các mô hình, sau đó chuyển sang tích hợp nó vào ngăn xếp công nghệ của bạn với hướng dẫn API Fable 5. Khi bạn đã sẵn sàng kiểm tra, Apidog cung cấp cho bạn một nơi để chạy và so sánh các câu lệnh đó.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API