Giá của Claude Fable 5 bắt đầu từ $10 cho mỗi triệu token đầu vào và $50 cho mỗi triệu token đầu ra trên API của Anthropic. Đây là toàn bộ thông tin đối với hầu hết mọi người chỉ muốn một con số cụ thể, nhưng bức tranh đầy đủ có một vài yếu tố động mà bạn cần biết trước khi tích hợp mô hình này vào sản xuất. Fable 5 ra mắt vào ngày 9 tháng 6 năm 2026 và Anthropic định vị nó có giá “ít hơn một nửa so với Claude Mythos Preview”. Hướng dẫn này sẽ đi sâu vào mọi yếu tố chi phí: tỷ lệ API, chi phí bạn phải trả trên các gói Pro và Max, ba ví dụ thực tế với các phép tính cụ thể, và cách Fable 5 so sánh với các mô hình rẻ hơn như Claude Opus 4.8. Nếu bạn chỉ cần kiểm tra chi phí nhanh, phần tiếp theo sẽ cung cấp thông tin đó.
TL;DR
Claude Fable 5 có giá $10 cho mỗi triệu token đầu vào và $50 cho mỗi triệu token đầu ra trên API. Từ ngày 9 tháng 6 đến ngày 22 tháng 6 năm 2026, nó được bao gồm miễn phí trên các gói Pro, Max, Team và Enterprise dựa trên số chỗ ngồi. Bắt đầu từ ngày 23 tháng 6 năm 2026, việc sử dụng trên các gói đó sẽ trừ vào tín dụng sử dụng được tính theo tỷ lệ token $10/$50 tương tự.
Tổng quan về giá Claude Fable 5
Dưới đây là các con số tiêu đề trong một bảng. Cột “mỗi 1K token” là cùng một mức giá được thể hiện ở đơn vị nhỏ hơn, rất tiện lợi khi bạn ước tính chi phí cho một yêu cầu duy nhất.
| Loại Token | Giá mỗi 1M token | Giá mỗi 1K token | Ghi chú |
|---|---|---|---|
| Đầu vào (Input) | $10.00 | $0.01 | Mọi thứ bạn gửi: lời nhắc (prompt), thông báo hệ thống, ngữ cảnh, định nghĩa công cụ |
| Đầu ra (Output) | $50.00 | $0.05 | Mọi thứ mô hình tạo ra, bao gồm lý luận và các lệnh gọi công cụ |
ID mô hình API là claude-fable-5. Token đầu ra có giá gấp 5 lần so với token đầu vào, điều này là bình thường đối với các mô hình tiên tiến của Anthropic và định hình hầu hết các lời khuyên tối ưu hóa sau này trong bài viết này. Bạn có thể xác nhận tỷ lệ hiện tại bất cứ lúc nào trên trang giá của Anthropic và trong tài liệu về mô hình và giá cả.
Bạn phải trả bao nhiêu trên API
Anthropic tính phí hai thứ riêng biệt, và bạn phải trả cho cả hai. Token đầu vào là tất cả những gì bạn gửi đến mô hình trong một yêu cầu. Điều đó bao gồm văn bản lời nhắc của bạn, thông báo hệ thống, bất kỳ lượt hội thoại trước đó bạn phát lại để làm ngữ cảnh, tài liệu đã truy xuất và JSON cho bất kỳ công cụ nào bạn định nghĩa. Những thứ này được tính với giá $10 cho mỗi triệu, hoặc một xu cho mỗi nghìn. Token đầu ra là tất cả những gì mô hình tạo ra. Đó là câu trả lời hiển thị cộng với bất kỳ lý luận nội bộ nào mà mô hình tạo ra và bất kỳ đối số gọi công cụ nào nó viết. Những thứ này được tính với giá $50 cho mỗi triệu, hoặc năm xu cho mỗi nghìn. Vì vậy, một yêu cầu duy nhất gửi 2.000 token đầu vào và nhận lại 600 token đầu ra sẽ tiêu tốn của bạn 2.000 token đầu vào cộng với 600 token đầu ra, được tính theo tỷ lệ riêng biệt. Không có phí cố định cho mỗi yêu cầu. Hóa đơn của bạn hoàn toàn là tổng số token đầu vào và đầu ra trên mỗi lệnh gọi bạn thực hiện. Anthropic mô tả Fable 5 có giá “ít hơn một nửa so với Claude Mythos Preview”, đây là cách định vị của mô hình này so với tầng preview tiên tiến trước đó. Mô hình anh em hạn chế, Claude Mythos 5, có tỷ lệ đầu vào $10 và đầu ra $50 giống hệt, vì vậy việc chuyển đổi giữa hai mô hình không làm thay đổi chi phí mỗi token của bạn. Nếu bạn muốn hiểu rõ hơn về mô hình này trước khi lập ngân sách, bài viết Claude Fable 5 là gì sẽ nói về các khả năng của nó.
Bao gồm trong gói so với tín dụng sử dụng
Giá trên API là một chuyện. Những gì bạn phải trả trong một gói đăng ký Claude tuân theo một lịch trình khác, và ngày tháng rất quan trọng. Từ ngày 9 tháng 6 đến ngày 22 tháng 6 năm 2026, Claude Fable 5 được bao gồm miễn phí trên các gói Pro, Max, Team và Enterprise dựa trên số chỗ ngồi. Trong khoảng thời gian này, bạn có thể sử dụng mô hình trên các gói đó mà không bị tính vào bất kỳ số dư được tính toán nào. Đây là một chương trình khuyến mãi ra mắt, không phải là trạng thái vĩnh viễn. Vào ngày 23 tháng 6 năm 2026, Fable 5 sẽ bị xóa khỏi danh sách các mô hình được bao gồm trong các gói đó. Sau ngày đó, việc sử dụng Fable 5 trên Pro, Max, Team hoặc Enterprise dựa trên số chỗ ngồi sẽ trừ vào tín dụng sử dụng, có nghĩa là nó được tính toán theo tỷ lệ $10 đầu vào và $50 đầu ra cho mỗi triệu token mà bạn sẽ phải trả trên API thô. Anthropic đã nói rằng họ có kế hoạch khôi phục quyền truy cập gói tiêu chuẩn khi dung lượng cho phép, vì vậy trạng thái sau ngày 23 tháng 6 có thể được nới lỏng sau này, nhưng hành vi tính theo tín dụng là điều bạn nên dự trù ngân sách ngay bây giờ. Các gói Enterprise dựa trên tiêu dùng thì khác. Fable 5 hoàn toàn có sẵn ở đó ngay từ khi ra mắt mà không cần lo lắng về thời gian bao gồm, vì các gói đó tính phí theo mức sử dụng ngay từ đầu. Nếu câu hỏi về quyền truy cập của bạn rộng hơn vấn đề thanh toán, cách truy cập Claude Fable 5 sẽ chỉ ra mọi điểm truy cập. Bài học thực tế: nếu bạn đang thử nghiệm trên gói Pro hoặc Max trong tuần này, bạn sẽ được sử dụng thoải mái đến hết ngày 22 tháng 6. Hãy lên kế hoạch cho các thử nghiệm lớn hơn của bạn một cách phù hợp, và nếu bạn dự kiến lưu lượng sản xuất liên tục, hãy tính toán chi phí của bạn dựa trên tỷ lệ API $10/$50 thay vì giai đoạn miễn phí, vì đó là chi phí bạn sẽ phải trả.
Các ví dụ thực tế: chi phí của một khối lượng công việc thực tế
Các con số mỗi triệu token là trừu tượng. Dưới đây là ba khối lượng công việc cụ thể với các phép tính được trình bày chi tiết, để bạn có thể áp dụng mức sử dụng của riêng mình vào chúng. Công thức luôn giống nhau: (token đầu vào / 1.000.000) * $10 cộng với (token đầu ra / 1.000.000) * $50.
Ví dụ 1: Một lượt chatbot hỗ trợ
Một lượt hỗ trợ khách hàng điển hình bao gồm một số hướng dẫn hệ thống và lịch sử hội thoại ngắn, sau đó trả về một câu trả lời tập trung. Giả sử 1.500 token đầu vào và 500 token đầu ra. * Đầu vào: 1.500 / 1.000.000 * $10 = $0.015 * Đầu ra: 500 / 1.000.000 * $50 = $0.025 * Tổng cộng: $0.04 mỗi lượt Bốn xu một lượt. Nếu chatbot đó xử lý 1.000 lượt mỗi ngày, bạn sẽ phải chi khoảng $40/ngày, hoặc khoảng $1.200/tháng, trước khi tính đến bất kỳ yếu tố giảm chi phí nào trong phần tiếp theo. Đây là một kiểm tra nhanh hữu ích: các khối lượng công việc kiểu trò chuyện trên Fable 5 vẫn rẻ mỗi lượt gọi nhưng sẽ tăng lên theo khối lượng.
Ví dụ 2: Yêu cầu tạo mã
Tạo mã thường gửi nhiều ngữ cảnh hơn: tệp bạn đang chỉnh sửa, các đoạn mã liên quan và hướng dẫn. Giả sử 8.000 token đầu vào và 3.000 token đầu ra cho một hàm được tạo ra đáng kể với giải thích. * Đầu vào: 8.000 / 1.000.000 * $10 = $0.08 * Đầu ra: 3.000 / 1.000.000 * $50 = $0.15 * Tổng cộng: $0.23 mỗi yêu cầu Lưu ý rằng mặc dù bạn đã gửi lượng đầu vào gần gấp 3 lần lượng đầu ra, nhưng đầu ra vẫn chiếm phần lớn hóa đơn với $0.15 trong số $0.23. Tỷ lệ giá đầu ra so với đầu vào 5:1 đó là lý do tại sao việc cắt giảm các thế hệ dài dòng sẽ tiết kiệm được rất nhiều tiền.
Ví dụ 3: Một tác vụ agent dài hạn
Các tác vụ tác nhân (agentic runs) đọc các cơ sở mã hoặc tài liệu lớn và thực hiện nhiều bước đẩy lượng đầu vào lên cao. Giả sử 300.000 token đầu vào (rất nhiều ngữ cảnh được truy xuất phát lại qua các bước) và 50.000 token đầu ra. * Đầu vào: 300.000 / 1.000.000 * $10 = $3.00 * Đầu ra: 50.000 / 1.000.000 * $50 = $2.50 * Tổng cộng: $5.50 mỗi lần chạy Một lần chạy agent sâu duy nhất tiêu tốn khoảng năm rưỡi đô la. Chạy 200 lần mỗi ngày trong một nhóm và bạn sẽ chi $1.100/ngày. Đây chính xác là khối lượng công việc mà bộ nhớ đệm (cache) lời nhắc sẽ phát huy tác dụng, vì các agent phát lại cùng một ngữ cảnh lớn nhiều lần. Chúng ta sẽ định lượng điều đó tiếp theo.
Cách cắt giảm hóa đơn Claude Fable 5 của bạn
Khi bạn đã quyết định Fable 5 là mô hình phù hợp, đây là các tính năng API tiêu chuẩn của Anthropic giúp giảm chi phí. Không tính năng nào trong số đó yêu cầu quyền truy cập đặc biệt. * **Bộ nhớ đệm lời nhắc (Prompt caching).** Chi phí đọc từ bộ nhớ đệm chỉ khoảng 0.1 lần giá đầu vào, vì vậy đầu vào được lưu trong bộ nhớ đệm có giá khoảng $1 mỗi triệu thay vì $10. Chi phí ghi vào bộ nhớ đệm khoảng 1.25 lần đầu vào (khoảng $12.50 mỗi triệu cho TTL 5 phút), vì vậy việc lưu vào bộ nhớ đệm sẽ có lợi khi bạn tái sử dụng cùng một ngữ cảnh trên nhiều yêu cầu. Lấy tác vụ agent từ Ví dụ 3: nếu 250.000 trong số 300.000 token đầu vào là ngữ cảnh ổn định được cung cấp từ bộ nhớ đệm, thì đầu vào đó giảm từ $3.00 xuống khoảng $0.25 (250K đọc từ bộ nhớ đệm với giá $1/M = $0.25, cộng với 50K đầu vào mới với giá $10/M = $0.50). Toàn bộ tác vụ giảm từ $5.50 xuống khoảng $3.25. Đối với các agent và chatbot phát lại một lời nhắc hệ thống lớn, bộ nhớ đệm là thay đổi chi phí lớn nhất mà bạn có thể thực hiện. * **API theo lô (Batches API).** Đối với công việc không cần trả lời ngay lập tức, như xử lý tài liệu qua đêm hoặc phân loại hàng loạt, API theo lô chạy với mức giảm giá khoảng 50%. Điều đó biến tỷ lệ $10/$50 thành khoảng $5/$25, đây là mức giá của Opus cho đầu ra cấp Fable. Nếu công việc của bạn có thể chịu được sự chậm trễ, đây gần như là tiền miễn phí. * **Chọn kích thước mô hình phù hợp.** Không phải mọi yêu cầu đều cần Fable 5. Hãy chuyển các tác vụ lý luận khó, mới lạ cho Fable và gửi lưu lượng truy cập thường xuyên cho Opus 4.8, Sonnet 4.6 hoặc Haiku 4.5. Một bộ định tuyến phân tầng gửi 80% các cuộc gọi đến một mô hình rẻ hơn có thể tự mình cắt giảm hóa đơn hơn một nửa. * **Cắt giảm max_tokens.** Đầu ra là phần đắt đỏ với giá $50 mỗi triệu. Đặt max_tokens theo những gì nhiệm vụ thực sự cần thay vì để nó mở rộng, và yêu cầu câu trả lời ngắn gọn trong lời nhắc. Cắt giảm một thế hệ 3.000 token xuống 1.500 token sẽ giảm một nửa chi phí đầu ra của cuộc gọi đó. * **Truyền phát phản hồi (Stream responses).** Truyền phát không làm thay đổi giá mỗi token, nhưng nó cho phép bạn dừng tạo ra phản hồi sớm khi bạn đã có được thứ mình cần, và nó cải thiện độ trễ cảm nhận để bạn ít bị cám dỗ yêu cầu quá mức hơn. Kết hợp với max_tokens chặt chẽ, nó giữ cho chi tiêu đầu ra được trung thực.
Theo dõi chi tiêu Claude Fable 5 với Apidog
Cách tốt nhất để giữ cho chi phí token hiển thị trong khi bạn xây dựng là theo dõi chúng trên mỗi yêu cầu, chứ không phải vào cuối tháng khi hóa đơn đến. Apidog là một ứng dụng khách API mà bạn có thể sử dụng để gửi yêu cầu đến API Anthropic và kiểm tra chính xác những gì được trả về. Khi bạn gọi claude-fable-5 thông qua Apidog, phần thân phản hồi bao gồm một đối tượng usage với input_tokens và output_tokens cho yêu cầu đó. Đọc hai con số đó cho bạn biết chi phí chính xác của cuộc gọi: nhân token đầu vào với $0.00001 và token đầu ra với $0.00005, cộng chúng lại, và bạn có hóa đơn cho yêu cầu đó đến từng phần nhỏ của xu. Thực hiện điều này trong khi bạn lặp lại các lời nhắc sẽ cho bạn thấy ngay lập tức khi một thay đổi làm tăng số lượng token của bạn, rất lâu trước khi nó xuất hiện trong sản xuất. Một quy trình làm việc thiết thực: thiết lập yêu cầu hoàn thành trò chuyện Anthropic trong Apidog, lưu một vài lời nhắc đại diện làm ví dụ và so sánh các số usage giữa các biến thể lời nhắc. Bạn sẽ nhanh chóng thấy những chỉnh sửa thông báo hệ thống nào thêm hàng trăm token đầu vào và những thay đổi định dạng phản hồi nào làm tăng đáng kể đầu ra. Phản hồi này khó có được chỉ từ bảng điều khiển. Tải Apidog để thiết lập điều này và kết hợp nó với hướng dẫn API Claude Fable 5 để biết cấu trúc yêu cầu. Nếu bạn đang theo dõi ngân sách chặt chẽ, cách sử dụng Claude Fable 5 miễn phí sẽ bao gồm các cách không tốn phí trong thời gian bao gồm. Apidog cũng lưu giữ lịch sử yêu cầu, vì vậy bạn có thể xem lại các cuộc gọi trước đó và số lượng token của chúng khi bạn ước tính chi phí cho một tính năng mới. Coi Apidog là lớp kiểm tra chi phí của bạn trong quá trình phát triển có nghĩa là sẽ không có bất ngờ về token khi lưu lượng truy cập tăng lên. Giá của Claude Fable 5 chỉ đơn giản là một cặp số, $10 đầu vào và $50 đầu ra cho mỗi triệu token, với một khoảng thời gian sử dụng miễn phí đến ngày 22 tháng 6 và tín dụng được tính sau ngày 23 tháng 6. Phần còn lại là toán học về khối lượng công việc và một vài đòn bẩy chi phí: lưu trữ ngữ cảnh ổn định của bạn, xử lý theo lô những gì không khẩn cấp, và giảm xuống Opus 4.8 hoặc Sonnet 4.6 khi tác vụ không cần tầng tiên tiến. Bước tiếp theo của bạn là kết nối một yêu cầu claude-fable-5 duy nhất và đọc đối tượng usage để ước tính của bạn dựa trên số lượng token thực tế. Tải Apidog để gửi yêu cầu đầu tiên đó và xem chi phí theo thời gian thực.
