Nếu bạn đang xây dựng trên mô hình mới nhất của Anthropic và thắc mắc về giới hạn tốc độ của Claude Fable 5, đây là câu trả lời thẳng thắn ngay từ đầu: Anthropic đã không phát hành một hệ thống giới hạn tốc độ riêng biệt, chỉ dành cho Fable 5 tại thời điểm ra mắt. Fable 5 (ID mô hình claude-fable-5, với giá 10 đô la cho mỗi triệu token đầu vào và 50 đô la cho mỗi triệu token đầu ra, ra mắt vào ngày 9 tháng 6 năm 2026) sử dụng cùng API Tin nhắn tiêu chuẩn và dựa trên giới hạn tốc độ API tiêu chuẩn, theo cấp bậc của tổ chức bạn. Các giới hạn này thay đổi theo mức độ sử dụng và lịch sử chi tiêu của tài khoản bạn, chúng được áp dụng cho mỗi tổ chức và mỗi lớp mô hình, và các con số chính xác bạn nhận được phụ thuộc vào cấp độ sử dụng bạn đang ở. Cách trình bày này quan trọng, bởi vì nếu bạn đang cố gắng lập kế hoạch dung lượng cho một tác nhân Fable 5, bạn đang lập kế hoạch dựa trên hệ thống cấp bậc của Anthropic, chứ không phải dựa trên một con số thần kỳ được in trên thông báo ra mắt. Nếu bạn mới làm quen với mô hình này, tổng quan về Claude Fable 5 là một tài liệu đọc bổ sung hữu ích.
TL;DR (Tóm tắt)
Claude Fable 5 sử dụng giới hạn tốc độ theo cấp bậc tiêu chuẩn của Anthropic: số yêu cầu mỗi phút (RPM) cộng với số token đầu vào mỗi phút (ITPM) và số token đầu ra mỗi phút (OTPM), được áp dụng cho mỗi tổ chức và mỗi lớp mô hình. Giới hạn tăng lên khi tổng chi tiêu tích lũy của bạn di chuyển bạn lên các cấp độ sử dụng (từ 1 đến 4). Luôn xác nhận các con số thực của bạn trong Bảng điều khiển Anthropic, và xử lý mã lỗi 429 bằng cách đọc tiêu đề retry-after của nó.
Cách Anthropic giới hạn tốc độ hoạt động
Anthropic không đặt một “giới hạn API” chung toàn cầu duy nhất. Họ vận hành một hệ thống cấp độ sử dụng, và cấp độ của bạn quyết định bạn nhận được bao nhiêu thông lượng. Có hai khái niệm liên quan: giới hạn chi tiêu (số tiền bạn có thể bị tính phí mỗi tháng dương lịch) và giới hạn tốc độ (tốc độ bạn có thể gọi API). Bài viết này nói về khái niệm thứ hai, nhưng hai khái niệm này có liên quan, bởi vì cấp độ của bạn là yếu tố thúc đẩy cả hai.

Các loại giới hạn
Đối với API Tin nhắn, giới hạn tốc độ được đo theo ba chiều, mỗi chiều được áp dụng mỗi phút và mỗi lớp mô hình:
- Số yêu cầu mỗi phút (RPM). Số lượng cuộc gọi API riêng biệt bạn có thể bắt đầu mỗi phút.
- Số token đầu vào mỗi phút (ITPM). Số lượng token đầu vào bạn có thể gửi mỗi phút. Trên hầu hết các mô hình hiện tại, chỉ các token đầu vào không được lưu vào bộ nhớ cache mới được tính ở đây. Các token đọc từ bộ nhớ cache nhắc không được tính vào ITPM, đó là lý do tại sao việc lưu vào bộ nhớ cache có thể tăng thông lượng hiệu quả của bạn lên cao hơn nhiều so với con số thô.
- Số token đầu ra mỗi phút (OTPM). Số lượng token mà mô hình có thể tạo cho bạn mỗi phút. Điều này được đánh giá theo thời gian thực khi các token được truyền ra, và giới hạn
max_tokenscủa bạn không tính trước vào đó. Việc đặtmax_tokenscao, tự nó không làm tiêu tốn OTPM; chỉ các token thực sự được tạo mới được tính.
Anthropic áp dụng các giới hạn này bằng thuật toán thùng token. Thay vì đặt lại toàn bộ hạn ngạch của bạn vào đầu mỗi phút, dung lượng của bạn được bổ sung liên tục cho đến mức tối đa. Hậu quả thực tế là giới hạn như “50 RPM” có thể hoạt động giống như khoảng một yêu cầu mỗi giây, vì vậy một loạt các cuộc gọi chặt chẽ có thể chạm giới hạn ngay cả khi mức trung bình mỗi phút của bạn trông vẫn ổn. Lưu lượng truy cập đều đặn, ổn định sẽ tận dụng được nhiều hơn từ các con số giống nhau so với lưu lượng truy cập thất thường.
Theo tổ chức, theo lớp mô hình
Hai chi tiết nữa định hình cách các con số áp dụng cho bạn. Thứ nhất, các giới hạn được đặt ở cấp độ tổ chức, không phải trên mỗi khóa API, vì vậy mỗi khóa trong tổ chức của bạn đều lấy từ cùng một nguồn (bạn có thể tạo các giới hạn nhỏ hơn cho mỗi không gian làm việc nếu bạn muốn bảo vệ một không gian làm việc khỏi không gian làm việc khác). Thứ hai, các giới hạn được áp dụng cho mỗi lớp mô hình. Điều đó có nghĩa là lưu lượng truy cập Fable 5 và, chẳng hạn, lưu lượng truy cập Opus được đo lường dựa trên các thùng riêng biệt của chúng. Bạn có thể chạy các lớp mô hình khác nhau đến giới hạn tương ứng của chúng cùng lúc mà không có cái nào làm chậm cái kia.
Cách các cấp độ tăng lên
Các cấp độ tự động tăng lên khi tổng số tiền mua tín dụng tích lũy của bạn vượt qua các ngưỡng. Theo các cấp độ được Anthropic công bố (xác minh trạng thái của riêng bạn trong Bảng điều khiển), cấu trúc trông như sau: Cấp 1 mở khóa với 5 đô la mua tín dụng, Cấp 2 với 40 đô la tích lũy, Cấp 3 với 200 đô la tích lũy và Cấp 4 với 400 đô la tích lũy, với trần chi tiêu hàng tháng tăng lên ở mỗi bước. Bạn sẽ di chuyển lên ngay khi vượt qua một ngưỡng; bạn không cần phải gửi yêu cầu hỗ trợ. Trên Cấp 4, các trần cao hơn sẽ thông qua bán hàng hoặc thanh toán hàng tháng.
Để tìm hiểu sâu hơn về cách các khoản mua này chuyển thành chi phí trên mô hình cụ thể này, phân tích giá của Claude Fable 5 kết hợp tốt với phần này.
Điều này có ý nghĩa gì đối với Claude Fable 5 nói riêng
Đây là phần mà mọi người muốn được làm rõ nhất. Fable 5 không có một khung giới hạn lạ, dành riêng cho mô hình. Nó nằm trong bảng cấp độ tiêu chuẩn như một lớp mô hình riêng, vì vậy câu hỏi “giới hạn Fable 5 của tôi là gì?” được giải quyết thành “tổ chức của tôi đang ở cấp độ nào, và hàng Fable 5 nói gì cho cấp độ đó?”
Theo các cấp độ giới hạn tốc độ được Anthropic công bố (một lần nữa, hãy xác nhận của bạn trong Bảng điều khiển, vì các thỏa thuận tùy chỉnh và doanh nghiệp khác nhau), hàng Fable 5 thay đổi gần đúng như sau:
- Cấp 1: 50 RPM, 100.000 ITPM, 20.000 OTPM.
- Cấp 2: 1.000 RPM, 500.000 ITPM, 100.000 OTPM.
- Cấp 3: 2.000 RPM, 1.500.000 ITPM, 300.000 OTPM.
- Cấp 4: 4.000 RPM, 4.000.000 ITPM, 800.000 OTPM.
Hãy coi đó là hình dạng của hệ thống, không phải một hợp đồng. Anthropic cập nhật các bảng, các thỏa thuận Ưu tiên và doanh nghiệp thay đổi bức tranh, và Bảng điều khiển của bạn là nguồn thông tin chính xác. Nếu một con số ở đây từng không khớp với những gì tài khoản của bạn hiển thị, hãy tin vào tài khoản của bạn.
Yếu tố gây khó khăn nhất cho Fable 5 là OTPM. Fable 5 được xây dựng cho công việc có thời gian dài, hàng triệu token, loại chạy mà một tác nhân xử lý một tác vụ lớn và tạo ra nhiều đầu ra trên đường đi. Một thế hệ dài không tiêu thụ một lượng lớn OTPM ngay từ đầu; nó rút ngân sách đầu ra của bạn đều đặn khi nó được truyền đi. Vì vậy, một công việc Fable 5 đầy tham vọng có thể nằm gần trần OTPM của bạn trong một khoảng thời gian dài, và nếu bạn chạy đồng thời nhiều công việc như vậy, OTPM thường là bức tường đầu tiên bạn gặp phải, chứ không phải RPM. Hai thói quen xuất phát từ đó: điều chỉnh kích thước max_tokens sao cho một thế hệ vượt ngoài tầm kiểm soát không thể phình to, và truyền các đầu ra dài để bạn không phải giữ một kết nối mở chờ đợi một phản hồi không truyền lớn (điều này cũng giúp bạn tránh các lỗi thời gian chờ yêu cầu). Nếu bạn đang kết nối mô hình lần đầu tiên, hướng dẫn API Claude Fable 5 sẽ chỉ ra hình dạng yêu cầu mà các giới hạn này áp dụng.
Đọc và kiểm tra giới hạn của bạn
Đừng bao giờ đoán giới hạn của bạn từ một bài đăng trên blog, bao gồm cả bài này. Có hai cách đáng tin cậy để xem các con số thực.
Cách đầu tiên là Bảng điều khiển Anthropic. Trang Giới hạn trong phần cài đặt hiển thị cấp độ hiện tại của tổ chức bạn và các giới hạn tốc độ theo mô hình đang có hiệu lực, và trang Sử dụng biểu đồ tốc độ token đầu vào và đầu ra thực tế của bạn theo thời gian so với trần của bạn, bao gồm cả tỷ lệ lượt truy cập bộ nhớ cache của bạn. Các biểu đồ đó là cách nhanh nhất để trả lời câu hỏi “tôi còn chỗ trống không, hay tôi sắp chạm giới hạn?” trước khi bạn tăng lưu lượng truy cập.
Cách thứ hai là các tiêu đề phản hồi trên mỗi cuộc gọi API. Anthropic trả về một bộ tiêu đề anthropic-ratelimit-* cho bạn biết chính xác tình trạng của bạn vào thời điểm đó:
anthropic-ratelimit-requests-limitvàanthropic-ratelimit-requests-remainingcho RPM.anthropic-ratelimit-input-tokens-limitvàanthropic-ratelimit-input-tokens-remainingcho ITPM.anthropic-ratelimit-output-tokens-limitvàanthropic-ratelimit-output-tokens-remainingcho OTPM.- Một tiêu đề
*-resettương ứng cho mỗi loại, ở định dạng RFC 3339, cho bạn biết khi nào thùng đó được bổ sung đầy đủ.
Các tiêu đề token còn lại được làm tròn đến hàng nghìn gần nhất, và các tiêu đề token kết hợp báo cáo giới hạn nào đang hạn chế nhất hiện tại (ví dụ: giới hạn cấp độ không gian làm việc nếu bạn đã đặt một). Đọc *-remaining trên mỗi phản hồi cho phép máy khách của bạn tự điều chỉnh tốc độ trước khi nó gặp lỗi 429, đây là sự khác biệt giữa áp lực ngược linh hoạt và một luồng lỗi.
Xử lý lỗi 429 một cách linh hoạt
Phản hồi 429 có nghĩa là bạn đã đạt đến một trong các giới hạn. Phần nội dung cho bạn biết đó là giới hạn nào, và quan trọng là, phản hồi mang theo một tiêu đề retry-after với số giây cần đợi trước khi thử lại. Thử lại sớm hơn so với retry-after sẽ lại thất bại, vì vậy hãy tuân thủ nó.
Tin tốt là các SDK chính thức đã thực hiện đúng. SDK của Anthropic tự động thử lại các phản hồi 429 và 5xx với cơ chế lùi lũy thừa (mặc định là hai lần thử lại), đọc retry-after để định thời gian cho mỗi lần thử. Đối với hầu hết các ứng dụng, hành vi tích hợp sẵn đó là đủ, và bạn không nên tự viết vòng lặp thử lại trừ khi bạn cần thứ gì đó mà SDK không cung cấp. Đây là cuộc gọi cơ bản với Fable 5:
import anthropic
client = anthropic.Anthropic() # đọc ANTHROPIC_API_KEY từ môi trường
# Tăng max_retries cao hơn mặc định là 2 cho một khối lượng công việc hàng loạt dễ gặp lỗi 429.
resilient = client.with_options(max_retries=5)
message = resilient.messages.create(
model="claude-fable-5",
max_tokens=4096,
messages=[
{"role": "user", "content": "Soạn bản tóm tắt phát hành cho nhật ký thay đổi tháng 6 của chúng tôi."}
],
)
print(message.content[0].text)
Nếu bạn cần kiểm soát rõ ràng, ví dụ để hiển thị trạng thái “chúng tôi đang bận, đang thử lại” trong giao diện người dùng của riêng bạn, bạn có thể bắt ngoại lệ đã định kiểu và tự đọc tiêu đề:
import anthropic
client = anthropic.Anthropic()
try:
message = client.messages.create(
model="claude-fable-5",
max_tokens=4096,
messages=[{"role": "user", "content": "Tóm tắt báo cáo sự cố này."}],
)
except anthropic.RateLimitError as exc:
wait_seconds = int(exc.response.headers.get("retry-after", "60"))
print(f"Bị giới hạn tốc độ. Đang tạm dừng {wait_seconds} giây trước khi thử lại.")
Ngoài việc thử lại, cách khắc phục lâu dài cho áp lực kéo dài là xếp hàng. Nếu lưu lượng truy cập của bạn theo đợt, hãy đặt các yêu cầu vào một hàng đợi và xử lý nó với tốc độ mà cấp độ của bạn có thể hấp thụ, sử dụng các tiêu đề anthropic-ratelimit-*-remaining để điều chỉnh tốc độ xử lý. Điều đó biến một loạt lỗi 429 thành một quy trình trơn tru, chậm hơn một chút, đây gần như luôn là điều bạn thực sự muốn. Kỷ luật điều chỉnh và xếp hàng tương tự cũng xuất hiện khi bạn kiểm tra bất kỳ API nào bị giới hạn tốc độ, và các mẫu trong kiểm tra API ChatGPT với Apidog chuyển trực tiếp sang công việc Claude.
Tăng giới hạn và giảm áp lực
Khi bạn liên tục gặp phải giới hạn, bạn có hai đòn bẩy: có thêm dung lượng, hoặc cần ít dung lượng hơn.
Để có thêm dung lượng, hãy nâng cấp cấp độ của bạn. Vì các cấp độ thay đổi theo tổng số tiền mua tín dụng tích lũy, việc sử dụng thực tế ổn định sẽ tự động kéo bạn lên bảng, và mỗi bước sẽ tăng đáng kể RPM, ITPM và OTPM. Nếu bạn cần vượt lên trước lịch trình tự động, hoặc bạn cần giới hạn tùy chỉnh hoặc doanh nghiệp, hãy liên hệ với bộ phận bán hàng thông qua trang Giới hạn trong Bảng điều khiển; Cấp Ưu tiên và thanh toán hàng tháng tồn tại chính xác cho các khối lượng công việc cam kết, lớn.
Để cần ít dung lượng hơn, hãy tấn công trực tiếp vào thông lượng token:
- Sử dụng API Hàng loạt cho công việc không nhạy cảm với độ trễ. Nó xử lý các yêu cầu API Tin nhắn không đồng bộ với chi phí khoảng 50 phần trăm so với tiêu chuẩn, và nó có nhóm giới hạn tốc độ riêng biệt, vì vậy nó giúp các công việc hàng loạt không cạnh tranh với lưu lượng truy cập trực tiếp, tương tác của bạn.
- Bật bộ nhớ đệm nhắc cho ngữ cảnh lặp lại. Vì các token đầu vào được lưu vào bộ nhớ đệm nói chung không được tính vào ITPM, việc lưu một lời nhắc hệ thống lớn, bộ công cụ hoặc tài liệu tham chiếu vào bộ nhớ đệm trên một lô Fable 5 có thể nhân lên thông lượng đầu vào hiệu quả của bạn mà không ảnh hưởng đến cấp độ của bạn. Theo dõi tỷ lệ lượt truy cập bộ nhớ đệm của bạn trên trang Sử dụng để xác nhận rằng nó đang hoạt động.
- Điều chỉnh kích thước
max_tokens. Không có hình phạt OTPM nào cho giới hạn trần cao, nhưng mộtmax_tokensrộng rãi cho phép một phản hồi duy nhất chạy dài và rút OTPM lâu hơn. Đặt nó theo những gì tác vụ thực sự cần. - Truyền các đầu ra dài. Truyền bảo vệ bạn khỏi thời gian chờ yêu cầu trên các thế hệ lớn và cho phép bạn xem đầu ra tích lũy theo thời gian thực, điều này kết hợp tự nhiên với việc đọc các tiêu đề OTPM.
Các kỹ thuật này kết hợp với nhau. Một quy trình Fable 5 được lưu vào bộ nhớ đệm, xử lý hàng loạt, được truyền tốt có thể thực hiện nhiều công việc hơn nhiều trong cùng cấp độ so với một quy trình đơn giản. Đối với các khối lượng công việc kiểu tác nhân nói riêng, hướng dẫn về tác nhân Claude Fable 5 cho thấy cách các đòn bẩy này phù hợp với một vòng lặp chạy dài. Và nếu bạn đang so sánh các lớp mô hình cho một công việc nhạy cảm với thông lượng, hướng dẫn API Claude Opus 4.8 và các ghi chú giá Opus 4.8 là những điểm tham chiếu hữu ích, vì mỗi lớp mô hình có một thùng giới hạn riêng.
Giám sát việc sử dụng Fable 5 của bạn với Apidog
Cách rõ ràng nhất để hiểu giới hạn thực của bạn là theo dõi chúng trên các yêu cầu trực tiếp, và một máy khách API làm cho điều đó trở nên cụ thể. Với Apidog, bạn có thể xây dựng một yêu cầu Fable 5 chống lại API Tin nhắn, gửi nó và kiểm tra toàn bộ phản hồi, bao gồm các tiêu đề anthropic-ratelimit-* và đối tượng usage báo cáo số lượng token đầu vào, đầu ra và đã lưu vào bộ nhớ đệm cho cuộc gọi đó. Xem những con số đó cạnh nhau, yêu cầu sau yêu cầu, cho bạn biết chính xác bạn đang chạy gần ITPM và OTPM đến mức nào, và việc lưu vào bộ nhớ đệm thực sự giúp bạn tiết kiệm được bao nhiêu, mà không cần chờ lỗi 429 để tìm hiểu.

Một vòng lặp thực tế trong khi bạn đang xây dựng: gửi một lời nhắc Fable 5 đại diện trong Apidog, đọc anthropic-ratelimit-output-tokens-remaining và giá trị usage.output_tokens từ phản hồi, và ghi lại tốc độ một thế hệ dài làm giảm số lượng còn lại. Sau đó thêm một lời nhắc hệ thống được lưu vào bộ nhớ đệm, gửi lại, và xác nhận usage.cache_read_input_tokens tăng lên trong khi mức tiêu thụ ITPM của bạn hầu như không thay đổi. So sánh hai yêu cầu đó biến bảng cấp độ trừu tượng thành cảm giác về dung lượng của riêng bạn. Bạn cũng có thể lưu yêu cầu, thay đổi max_tokens, và xem mức tiêu thụ OTPM theo dõi đầu ra thực tế thay vì giới hạn trần của bạn, đây là cách nhanh nhất để thuyết phục bản thân rằng max_tokens cao là an toàn. Tải xuống Apidog nếu bạn muốn chạy thử nghiệm đó với khóa của riêng mình, và theo dõi các tiêu đề phản hồi khi bạn điều chỉnh tốc độ yêu cầu của mình. Các nhóm đã chuẩn hóa trên Apidog cho thiết kế và kiểm thử API có thể tích hợp giám sát Fable 5 vào cùng một không gian làm việc mà họ sử dụng cho mọi thứ khác.
