Claude Fable 5.1 có giá $10 cho mỗi triệu token đầu vào và $50 cho mỗi triệu token đầu ra, chính xác như Fable 5 đã tính phí. Con số thay đổi là việc đọc bộ đệm gợi ý (prompt cache): $0.25 cho mỗi triệu token, giảm từ $1 trên Fable 5 và bằng một nửa $0.50 của Opus 5. Anthropic ước tính rằng điều này làm cho các khối lượng công việc thông thường rẻ hơn khoảng 25% so với Fable 5 và các khối lượng công việc đòi hỏi tính tác nhân cao rẻ hơn tới khoảng 45%.
Hướng dẫn này trình bày mọi mức giá trên trang giá chính thức, tái hiện các tuyên bố 25% và 45% để bạn có thể tự tính toán tỷ lệ cache-hit của mình, đưa ra ba ví dụ thực tế về chi phí cho mỗi tác vụ, và liệt kê các yếu tố ảnh hưởng đến hóa đơn. Nếu bạn muốn tổng quan về mô hình trước tiên, hãy đọc Claude Fable 5.1 là gì.
Bảng giá Claude Fable 5.1
| Mức giá | Claude Fable 5.1 |
|---|---|
| Đầu vào cơ bản | $10 cho mỗi triệu token |
| Đầu ra | $50 cho mỗi triệu token |
| Ghi bộ đệm 5 phút | $12.50 cho mỗi triệu (1.25x đầu vào) |
| Ghi bộ đệm 1 giờ | $20 cho mỗi triệu (2x đầu vào) |
| Đọc bộ đệm (trúng hoặc làm mới) | $0.25 cho mỗi triệu (0.025x đầu vào) |
| Đầu vào API theo lô (Batch API) | $5 cho mỗi triệu |
| Đầu ra API theo lô (Batch API) | $25 cho mỗi triệu |
| Phí cao cấp cho ngữ cảnh dài | Không; cửa sổ 1M đầy đủ được tính theo giá tiêu chuẩn |
inference_geo: "us" |
1.1 lần cho mọi loại token |
| Chế độ nhanh | Không khả dụng (chỉ Opus 5 và Opus 4.8) |
| Hạng ưu tiên | Không được hỗ trợ |
| Tìm kiếm web | $10 cho mỗi 1.000 lượt tìm kiếm, cộng thêm token |
Claude Mythos 5.1 có mức giá tương tự. Chiết khấu theo lô (Batch discount) và các hệ số nhân bộ đệm (cache multipliers) được cộng dồn, vì vậy một lượt đọc bộ đệm theo lô có giá $0.125 cho mỗi triệu token.
So sánh giá đọc bộ đệm
| Mô hình | Đầu vào cơ bản | Đọc bộ đệm | Đọc bộ đệm theo tỷ lệ đầu vào |
|---|---|---|---|
| Claude Fable 5.1 | $10 | $0.25 | 2.5% |
| Claude Fable 5 | $10 | $1.00 | 10% |
| Claude Opus 5 | $5 | $0.50 | 10% |
| Claude Opus 4.8 | $5 | $0.50 | 10% |
| Claude Sonnet 5 | $2 | $0.20 | 10% |
| Claude Haiku 4.5 | $1 | $0.10 | 10% |
Mọi mô hình Claude khác đều tính giá cho một lượt trúng bộ đệm là 10% của đầu vào cơ bản. Fable 5.1 tính giá 2.5%. Hiệu ứng thực tế: một lượt trúng bộ đệm của Fable 5.1 rẻ hơn so với Opus 5, mặc dù đầu vào không được lưu vào bộ đệm của Fable 5.1 có giá gấp đôi. Đối với một khối lượng công việc mà hầu hết các token đầu vào là tiền tố được lưu vào bộ đệm, tỷ lệ đầu vào hiệu quả trên Fable 5.1 có thể giảm xuống dưới Opus 5.

Một lưu ý về Sonnet 5, vì so sánh Opus 5 và Sonnet 5 đã chỉ ra một đợt tăng giá vào tháng 9: Anthropic đã hủy bỏ nó. Sonnet 5 vẫn giữ nguyên mức $2 và $10.
Tái hiện các tuyên bố 25% và 45%
Anthropic không công bố sự kết hợp khối lượng công việc đằng sau những ước tính đó, vì vậy hãy coi đây là một sự tái cấu trúc cho thấy tỷ lệ cache-hit mà họ ngụ ý, chứ không phải là mô hình chính xác của họ.
Giả sử một yêu cầu có U token đầu vào không được lưu vào bộ đệm, C token đầu vào được lưu vào bộ đệm và O token đầu ra. Chi phí cho mỗi triệu token trên Fable 5 là 10U + 1.0C + 50O; trên Fable 5.1 là 10U + 0.25C + 50O. Khoản tiết kiệm là 0.75C, và tỷ lệ tiết kiệm phần trăm là 0.75C / (10U + C + 50O).
Một khối lượng công việc kiểu trò chuyện thông thường. Giả sử 20.000 token được lưu vào bộ đệm, 2.000 token đầu vào không được lưu vào bộ đệm và 1.500 token đầu ra cho mỗi yêu cầu. Fable 5: 10(0.002) + 1.0(0.02) + 50(0.0015) = $0.02 + $0.02 + $0.075 = $0.115. Fable 5.1: $0.02 + $0.005 + $0.075 = $0.100. Tiết kiệm: 13%. Để đạt được 25% của Anthropic, phần được lưu vào bộ đệm phải lớn hơn so với đầu ra, ví dụ 60.000 token được lưu vào bộ đệm so với cùng 1.500 token đầu ra, điều này mang lại $0.155 so với $0.110, tiết kiệm 29%.
Một vòng lặp tác nhân. Một tác nhân đọc lại tiền tố 150.000 token được lưu vào bộ đệm trên mỗi 40 lượt gọi công cụ, thêm 1.000 token không được lưu vào bộ đệm mỗi lượt và tạo ra 800 token đầu ra mỗi lượt. Mỗi lượt trên Fable 5: 10(0.001) + 1.0(0.15) + 50(0.0008) = $0.01 + $0.15 + $0.04 = $0.20. Trên Fable 5.1: $0.01 + $0.0375 + $0.04 = $0.0875. Tiết kiệm: 56% mỗi lượt, trước khi ghi bộ đệm một lần. Trong 40 lượt, đó là $8.00 so với $3.50. Con số "lên tới 45%" của Anthropic nằm gọn trong phạm vi này khi bạn cộng thêm các lượt ghi bộ đệm và các lượt không được lưu vào bộ đệm mà mọi tác nhân thực tế đều có.
Quy tắc rút ra là: việc tiết kiệm tỷ lệ thuận với tỷ lệ đầu vào được lưu vào bộ đệm so với đầu ra. Các khối lượng công việc nặng về đầu ra (tạo ra văn bản dài từ các gợi ý ngắn) hầu như không nhận thấy sự thay đổi. Các khối lượng công việc nặng về tiền tố (tác nhân, RAG với ngữ cảnh lớn ổn định, bot hỗ trợ đa lượt) sẽ thấy hiệu quả rõ rệt.
Ba ví dụ chi phí thực tế cho mỗi tác vụ
Cả ba ví dụ đều giả định Fable 5.1 ở mức giá tiêu chuẩn, với lượt ghi bộ đệm 5 phút được trả một lần.
1. Một lần xem xét mã code. 30.000 token đầu vào (diff cộng với một gợi ý hệ thống), 4.000 token đầu ra, không có bộ đệm. Đầu vào $0.30, đầu ra $0.20. Tổng cộng: $0.50. Cùng một lần xem xét trên Opus 5 là $0.25. Đây là trường hợp mà Fable 5.1 đắt gấp đôi, vì không có gì được lưu vào bộ đệm.
2. Một cuộc hội thoại hỗ trợ 25 lượt. Một gợi ý hệ thống ổn định 12.000 token được lưu vào bộ đệm một lần ($0.15 cho lượt ghi), sau đó 25 lượt mỗi lượt thêm 300 token đầu vào không được lưu vào bộ đệm và 250 token đầu ra, với tiền tố được cung cấp từ bộ đệm. Đầu vào không được lưu vào bộ đệm trong suốt cuộc hội thoại: 7.500 token = $0.075. Đọc bộ đệm: 25 x 12.000 = 300.000 token = $0.075. Đầu ra: 6.250 token = $0.3125. Tổng cộng: khoảng $0.61. Trên Fable 5, riêng việc đọc bộ đệm sẽ là $0.30, tổng cộng gần $0.84.
3. Một tác vụ xây dựng tác nhân kéo dài hai giờ. 120 lượt gọi công cụ với một tiền tố tăng từ 20.000 lên 200.000 token (trung bình 110.000 được lưu vào bộ đệm), 1.500 token không được lưu vào bộ đệm mỗi lượt, 1.200 token đầu ra mỗi lượt, và khoảng sáu lần làm mới bộ đệm khi tiền tố tăng lên. Đọc bộ đệm: 120 x 110.000 = 13.2M token = $3.30. Đầu vào không được lưu vào bộ đệm: 180.000 token = $1.80. Đầu ra: 144.000 token = $7.20. Ghi bộ đệm: khoảng 660.000 token với giá $12.50 = $8.25. Tổng cộng: khoảng $20.55. Trên Fable 5, việc đọc bộ đệm sẽ là $13.20 thay vì $3.30, tổng cộng gần $30.45. Đó là mức tiết kiệm 33% cho một lần chạy mà đầu ra vẫn là mục chi phí lớn nhất.
Lưu ý trong ví dụ 3 rằng việc ghi bộ đệm hiện là chi phí lớn thứ hai. Đó là mặt trái của việc đọc rẻ: một lần trượt bộ đệm đắt gấp 40 lần một lần trúng, vì vậy bất cứ điều gì làm đặt lại bộ đệm giữa phiên (xây dựng lại gợi ý hệ thống, chỉnh sửa lượt trước đó, thay đổi mảng công cụ) sẽ tốn kém hơn nhiều so với trạng thái ổn định so với trên Fable 5.
Các yếu tố ảnh hưởng đến hóa đơn
Nỗ lực (Effort). output_config.effort là yếu tố đơn lẻ lớn nhất ảnh hưởng đến token đầu ra, và đầu ra có giá $50 cho mỗi triệu token. Hướng dẫn của Anthropic cho Fable 5.1 là bắt đầu ở mức high (cao), và họ tuyên bố rằng medium (trung bình) gần như khớp với chất lượng của Fable 5 với chi phí thấp hơn, trong khi low (thấp) thường cạnh tranh với Opus và Sonnet về chi phí cho mỗi tác vụ. Hãy tự chạy các đánh giá của riêng bạn. Chế độ beta 'effort' theo từng tin nhắn cho phép bạn giảm xuống low cho các lượt thông thường và tăng lên cho các lượt khó mà không cần đặt lại bộ đệm.
Giữ bộ đệm luôn sẵn sàng. Lưu bộ đệm gợi ý (Prompt caching) là yếu tố giúp giảm giá. Với việc đọc ở mức $0.25 và ghi ở mức $12.50, điểm hòa vốn trên TTL 5 phút là một lần trúng. Đối với khoảng thời gian ngừng hoạt động từ năm đến sáu mươi phút, việc gửi lại duy trì kết nối max_tokens: 0 trên TTL 5 phút thường rẻ hơn so với việc trả phí ghi bộ đệm gấp 2 lần cho TTL 1 giờ. Và cùng một quy tắc chỉ thêm vào mà bảo toàn các khối tư duy trên mô hình này cũng bảo toàn bộ đệm: không bao giờ xây dựng lại system hoặc tools giữa phiên, sử dụng các tin nhắn hệ thống giữa cuộc hội thoại cho các thay đổi, và sử dụng các tin nhắn theo lượt cho các lời nhắc mỗi lượt.
Xử lý theo lô những gì có thể chờ. API theo lô (Batch API) giảm một nửa mọi chi phí, vì vậy một yêu cầu theo lô của Fable 5.1 có giá $5 và $25, tương đương với giá đồng bộ của Opus 5. Các đánh giá, điền lại dữ liệu và xử lý tài liệu hàng đêm thuộc về đó. Lưu ý rằng fallbacks bị từ chối trên các lô, vì vậy các mục bị từ chối cần được gửi lại thủ công.
Chọn cấp độ theo tuyến đường. Tài liệu của Anthropic khuyên nên bắt đầu với Opus 5 và chuyển sang Fable 5.1 khi Opus 5 ở mức nỗ lực cao hơn vẫn không đáp ứng đủ. Đối với các tuyến đường mà Opus 5 vượt qua các đánh giá của bạn, bạn đang trả gấp đôi mà không nhận được gì. So sánh Fable 5.1 và Opus 5 sẽ phân tích quyết định dựa trên khối lượng công việc.
Theo dõi chi phí công cụ. Mọi yêu cầu có công cụ đều mang theo một lời nhắc hệ thống sử dụng công cụ ẩn. Anthropic công bố số lượng cho Opus 5 (286 token) nhưng chưa công bố con số cho Fable 5.1, vì vậy hãy đo lường nó bằng điểm cuối đếm token. Một bộ công cụ trình duyệt thêm khoảng 6.600 token cho mỗi yêu cầu và bộ công cụ máy tính khoảng 4.500, tất cả đều được lưu vào bộ đệm sau lần gửi đầu tiên.
Từ chối không mất phí, thử lại thì có. Một từ chối phân loại trước khi có bất kỳ đầu ra nào sẽ không bị tính phí. Một dự phòng phía máy chủ sẽ tính phí theo mức giá của mô hình dự phòng cho lần thử lại, và tín dụng dự phòng của Anthropic sẽ hoàn lại chi phí bộ đệm khi chuyển đổi. Hãy đo lường các từ chối như một chỉ số riêng để bạn biết bao nhiêu chi phí Fable 5.1 của bạn đang được phục vụ bởi Opus 5.
Hầu hết các kỹ thuật chung trong hướng dẫn cắt giảm hóa đơn API Claude của chúng tôi vẫn áp dụng, với cách tính toán đọc bộ đệm được dịch chuyển có lợi cho Fable 5.1.
Những gì bạn không thể mua trên Fable 5.1
Chế độ nhanh (Fast mode) chỉ có trên Opus 5 và Opus 4.8, với giá $10 và $50. Không có cách nào để trả tiền cho đầu ra Fable 5.1 nhanh hơn. Hạng ưu tiên (Priority Tier) không được hỗ trợ trên Fable 5.1 hoặc Mythos 5.1, trong khi Fable 5 vẫn duy trì nó, vì vậy việc lập kế hoạch năng lực doanh nghiệp phụ thuộc vào nó phải duy trì trên Fable 5 hoặc chuyển sang Opus 5. Và tính năng không lưu trữ dữ liệu (zero data retention) không khả dụng trừ khi Anthropic cấp quyền rõ ràng; một tổ chức ZDR sẽ nhận lỗi 400 trên mỗi yêu cầu.
Kiểm tra chi phí thực tế của bạn trong Apidog
Cách đáng tin cậy duy nhất để biết chi phí của một yêu cầu là đối tượng usage, và cách nhanh nhất để đọc nó là thông qua một bộ sưu tập kiểm thử. Trong Apidog, hãy lưu lời nhắc hệ thống sản xuất của bạn dưới dạng một yêu cầu có bật cache_control, gửi nó hai lần và thêm các xác nhận trên usage.cache_creation_input_tokens cho lần gửi đầu tiên và usage.cache_read_input_tokens cho lần thứ hai. Sau đó, thêm một tập lệnh sau phản hồi nhân mỗi trường với tỷ lệ của nó và ghi lại chi phí cho mỗi yêu cầu. Chạy bộ sưu tập bất cứ khi nào bạn thay đổi lời nhắc hoặc định nghĩa công cụ, và bạn sẽ phát hiện ra một chỉnh sửa làm mất bộ đệm trước khi nó ảnh hưởng đến hóa đơn. Tải Apidog để xây dựng nó; hướng dẫn API chi tiết sẽ chỉ ra các yêu cầu chính xác.
Giá Fable 5.1 trong các ứng dụng Claude
Giá API được tính theo token. Trong các ứng dụng Claude, Fable 5.1 được tính theo gói. Các gói Max bao gồm các mô hình Fable cho tối đa 50% giới hạn sử dụng hàng tuần mà không mất thêm chi phí, sau đó tiếp tục sử dụng tín dụng. Các ghế Pro và Team tiêu chuẩn tính Fable 5.1 thông qua tín dụng sử dụng ngay từ tin nhắn đầu tiên. Các ghế Enterprise tiêu chuẩn cần bật tín dụng sử dụng để sử dụng vượt quá giới hạn gói, và hóa đơn Enterprise dựa trên mức sử dụng được tính theo giá API tiêu chuẩn. Các yêu cầu mà các biện pháp bảo vệ chuyển hướng sang mô hình khác sẽ không bị tính phí theo giá Fable. Hướng dẫn các đường dẫn miễn phí và rẻ nhất đề cập đến ý nghĩa thực tế của điều này.
Câu hỏi thường gặp
Claude Fable 5.1 có giá bao nhiêu cho mỗi triệu token? $10 đầu vào và $50 đầu ra, không thay đổi so với Fable 5. Đọc bộ đệm là $0.25 cho mỗi triệu token, ghi bộ đệm là $12.50 (5 phút) và $20 (1 giờ), và API theo lô (Batch API) là $5 và $25.
Claude Fable 5.1 có rẻ hơn Fable 5 không? Tính theo token thì không. Trên thực tế, có đối với bất kỳ thứ gì sử dụng tính năng lưu bộ đệm gợi ý (prompt caching), vì việc đọc bộ đệm đã giảm từ $1 xuống $0.25 cho mỗi triệu token. Anthropic ước tính rẻ hơn 25% đối với các khối lượng công việc thông thường và lên đến 45% đối với các khối lượng công việc đòi hỏi tính tác nhân cao. Các khối lượng công việc nặng về đầu ra ít có sự thay đổi.
Claude Fable 5.1 có rẻ hơn Opus 5 không? Nếu không lưu bộ đệm thì không: nó đắt gấp đôi. Nếu có lưu bộ đệm, tình hình sẽ đảo ngược: một lượt trúng bộ đệm của Fable 5.1 ($0.25) có giá bằng một nửa so với Opus 5 ($0.50). Đầu ra vẫn là $50 so với $25, vì vậy Opus 5 thắng thế trên bất kỳ tuyến đường nào nặng về đầu ra.
Claude Fable 5.1 có chế độ nhanh (Fast mode) hoặc Hạng ưu tiên (Priority Tier) không? Không có cả hai. Chế độ nhanh chỉ có trên Opus 5 và Opus 4.8. Hạng ưu tiên được hỗ trợ trên Fable 5 nhưng không có trên Fable 5.1.
Có phí cao cấp cho ngữ cảnh dài trên Claude Fable 5.1 không? Không. Cửa sổ 1M token đầy đủ được tính theo giá tiêu chuẩn, và các chiết khấu bộ đệm và theo lô được áp dụng trên toàn bộ.
Claude Fable 5.1 có giá bao nhiêu trên Bedrock hoặc Google Cloud? Các nền tảng đó tự đặt giá và thêm 10% phí cao cấp cho các điểm cuối khu vực. Nền tảng Claude trên AWS và Microsoft Foundry tính phí theo mức API tiêu chuẩn thông qua Đơn vị tiêu thụ Claude (Claude Consumption Units). Hướng dẫn khả dụng trên đám mây của chúng tôi bao gồm cách thiết lập trên từng nền tảng.
