Claude Opus 5 ra mắt vào ngày 24 tháng 7 năm 2026 với giá 5 đô la cho mỗi triệu token đầu vào và 25 đô la cho mỗi triệu token đầu ra. Đây là mức giá tương tự mà Anthropic đã tính cho Opus 4.8, và chính xác bằng một nửa chi phí của Fable 5. Tất cả các bài đưa tin về sự kiện ra mắt đều chạy với tiêu đề đó, và điều này là chính xác cho đến thời điểm hiện tại.
Những gì bài đưa tin bỏ qua là phần quyết định hóa đơn của bạn: ghi vào bộ nhớ đệm, truy cập bộ nhớ đệm, tỷ lệ xử lý theo lô, chế độ nhanh, hệ số nhân theo khu vực và những thay đổi về hành vi làm thay đổi số lượng token một cách âm thầm. Hướng dẫn này cung cấp cho bạn bảng giá đầy đủ, sau đó tính toán chi phí dựa trên các hình dạng yêu cầu thực tế để bạn có thể ước tính ngân sách trước khi triển khai. Để kiểm tra các con số này với lưu lượng truy cập của riêng bạn, hãy gửi các yêu cầu từ Apidog và đọc khối usage trong mỗi phản hồi.
nút
Bảng giá đầy đủ của Claude Opus 5
Mỗi mức giá dưới đây đều lấy từ tài liệu định giá của Anthropic và áp dụng cho ID mô hình claude-opus-5.
| Danh mục token | Giá trên mỗi triệu token |
|---|---|
| Đầu vào (tiêu chuẩn) | $5.00 |
| Đầu ra (tiêu chuẩn) | $25.00 |
| Ghi bộ nhớ đệm prompt, TTL 5 phút | $6.25 |
| Ghi bộ nhớ đệm prompt, TTL 1 giờ | $10.00 |
| Truy cập và làm mới bộ nhớ đệm | $0.50 |
| Đầu vào Batch API | $2.50 |
| Đầu ra Batch API | $12.50 |
| Đầu vào chế độ nhanh | $10.00 |
| Đầu ra chế độ nhanh | $50.00 |
Một vài điều cần lưu ý:
- Truy cập bộ nhớ đệm có chi phí bằng một phần mười đầu vào tiêu chuẩn. Đây là đòn bẩy lớn nhất trong bảng.
- Việc ghi bộ nhớ đệm 5 phút có mức phí cao hơn 1.25 lần so với đầu vào tiêu chuẩn; việc ghi 1 giờ cao hơn 2 lần.
- Batch (Xử lý theo lô) được giảm giá cố định 50% cho cả đầu vào và đầu ra.
- Chế độ nhanh có giá chính xác gấp 2 lần giá tiêu chuẩn để đạt tốc độ đầu ra nhanh hơn 2.5 lần. Đây là bản xem trước nghiên cứu, chỉ dành cho API bên thứ nhất (không phải Bedrock, Google Cloud, hoặc Microsoft Foundry), và nó không kết hợp với Batch API.
- Không có phí cao cấp cho ngữ cảnh dài. Cửa sổ ngữ cảnh 1 triệu token là mặc định và tối đa, và các token vượt quá bất kỳ ngưỡng nào cũng được tính phí với cùng mức 5 đô la. Một số mô hình cạnh tranh tính phí cao hơn khi bạn vượt qua một cấp ngữ cảnh. Opus 5 thì không.

Điểm cuối cùng đó đặt ra một giới hạn cứng cho một yêu cầu duy nhất. Cuộc gọi API Messages đắt nhất có thể là 1 triệu token đầu vào cộng với tối đa 128k token đầu ra: $5.00 + $3.20, hoặc $8.20. Trên Batch API, nơi đầu ra tối đa tăng lên 300k với tiêu đề beta output-300k-2026-03-24, phần đầu ra được giới hạn ở $3.75.
Điểm mốc: giống 4.8, bằng một nửa Fable 5
Đây là vị trí của Opus 5 so với các mô hình mà bạn có nhiều khả năng so sánh nhất.
| Mô hình | Đầu vào / Triệu token | Đầu ra / Triệu token |
|---|---|---|
| Claude Opus 5 | $5.00 | $25.00 |
| Claude Opus 4.8 | $5.00 | $25.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| Claude Sonnet 5 (giới thiệu, đến hết 31 tháng 8 năm 2026) | $2.00 | $10.00 |
| Claude Sonnet 5 (từ 1 tháng 9 năm 2026) | $3.00 | $15.00 |
Hai cách đọc bảng này có ý nghĩa quan trọng.
Đầu tiên, nâng cấp từ Opus 4.8 không tốn thêm chi phí mỗi token. Mức giá là như nhau, và đã duy trì qua các phiên bản 4.5, 4.6, 4.7 và 4.8. Việc thay đổi ID mô hình không ảnh hưởng đến kinh tế đơn vị của bạn. Điều nó thay đổi là khối lượng token của bạn, mà chúng ta sẽ đề cập bên dưới. Phân tích giá của Opus 4.8 vẫn có giá trị đối với bất kỳ thứ gì trên ID cũ hơn.
Thứ hai, Opus 5 có giá bằng một nửa Fable 5. Các con số ra mắt của Anthropic tuyên bố Opus 5 đạt được trong khoảng 0.5% hiệu suất cao nhất của Fable 5 trên CursorBench 3.2 và vượt qua nó trên OSWorld 2.0 với chi phí mỗi tác vụ chỉ bằng khoảng một phần ba. Đó là các số liệu do nhà cung cấp công bố từ bài đăng ra mắt Opus 5, và chưa ai độc lập tái tạo chúng tính đến ngày 25 tháng 7 năm 2026. Hãy coi chúng là các tuyên bố, không phải kết quả đã được xác nhận. So sánh Opus 5 và Fable 5 phân tích khi nào khoảng cách giá là đáng giá, và trang giá Fable 5 có thông tin chi tiết về cấp cao hơn.
Ví dụ thực tế 1: một yêu cầu duy nhất
Bắt đầu với hình dạng đơn giản nhất. Một lệnh tóm tắt với 8.000 token đầu vào và 1.200 token đầu ra.
- Đầu vào: 8.000 / 1.000.000 x $5.00 = $0.040
- Đầu ra: 1.200 / 1.000.000 x $25.00 = $0.030
- Tổng cộng: $0.070 mỗi cuộc gọi
Với 10.000 cuộc gọi mỗi tháng, tổng cộng là $700. Khối lượng công việc tương tự trên Fable 5 có giá $0.140 mỗi cuộc gọi, hoặc $1.400 mỗi tháng. Trên Sonnet 5 với mức giá giới thiệu, nó có giá $0.028 mỗi cuộc gọi, hoặc $280.
Lưu ý rằng đầu ra chiếm 43% hóa đơn cho một yêu cầu có số lượng đầu vào gần gấp bảy lần đầu ra. Chi phí đầu ra gấp năm lần chi phí đầu vào, do đó khối lượng đầu ra chiếm ưu thế nhanh hơn hầu hết mọi người mong đợi. Điều này quan trọng hơn trên Opus 5 so với 4.8, vì các token suy nghĩ được tính phí như đầu ra và tính năng suy nghĩ thích ứng hiện được bật theo mặc định.
Ví dụ thực tế 2: một phiên làm việc agentic dài với bộ nhớ đệm
Đây là nơi tiền thật nằm ở đó, và cũng là nơi tiết kiệm thực sự. Lấy một agent viết mã với prompt hệ thống 120.000 token cộng với ngữ cảnh kho lưu trữ, chạy một phiên 40 lượt. Mỗi lượt thêm 1.500 token hội thoại mới và tạo ra 2.500 token đầu ra.
Nếu không có bộ nhớ đệm prompt, bạn gửi lại toàn bộ ngữ cảnh mỗi lượt:
| Mục | Token | Tỷ lệ | Chi phí |
|---|---|---|---|
| Đầu vào (120.000 x 40, cộng 60.000 mới) | 4,860,000 | $5.00 | $24.30 |
| Đầu ra (2.500 x 40) | 100,000 | $25.00 | $2.50 |
| Tổng cộng | $26.80 |
Với bộ nhớ đệm prompt 5 phút cho tiền tố 120.000 token:
| Mục | Token | Tỷ lệ | Chi phí |
|---|---|---|---|
| Ghi bộ nhớ đệm, một lần | 120,000 | $6.25 | $0.75 |
| Đọc bộ nhớ đệm (39 lượt) | 4,680,000 | $0.50 | $2.34 |
| Đầu vào mới (1.500 x 40) | 60,000 | $5.00 | $0.30 |
| Đầu ra (2.500 x 40) | 100,000 | $25.00 | $2.50 |
| Tổng cộng | $5.89 |
Đó là giảm 78%, và đầu ra hiện chiếm 42% hóa đơn thay vì 9%. Khi bạn đã sử dụng bộ nhớ đệm đúng cách, đầu ra là thứ bạn tối ưu hóa tiếp theo.
Một lưu ý về TTL 5 phút: việc đọc bộ nhớ đệm sẽ làm mới nó, vì vậy một phiên có các lượt cách nhau dưới năm phút sẽ duy trì trạng thái "ấm" chỉ với một lần ghi duy nhất. Nếu agent của bạn không hoạt động lâu hơn thế, hãy sử dụng tùy chọn ghi 1 giờ với giá 10 đô la mỗi triệu. Trong trường hợp này, chi phí ghi sẽ tăng từ $0.75 lên $1.20 và tổng chi phí lên $6.34, vẫn thấp hơn 76% so với việc không sử dụng bộ nhớ đệm.
Ví dụ thực tế 3: xử lý theo lô (batch processing)
Đối với bất kỳ thứ gì không cần phản hồi đồng bộ, Batch API được giảm giá cố định 50%. Lấy 50.000 tài liệu với 1.200 token đầu vào và 150 token đầu ra mỗi tài liệu.
| Cách thức | Chi phí đầu vào | Chi phí đầu ra | Tổng cộng |
|---|---|---|---|
| Tiêu chuẩn | 60 Triệu token x $5.00 = $300.00 | 7.5 Triệu token x $25.00 = $187.50 | $487.50 |
| Theo lô | 60 Triệu token x $2.50 = $150.00 | 7.5 Triệu token x $12.50 = $93.75 | $243.75 |
Cùng số token, cùng mô hình, tiết kiệm $243.75. Sự đánh đổi ở đây là độ trễ, không phải chất lượng. Nếu công việc phân loại, làm giàu dữ liệu hoặc đánh giá của bạn chấp nhận việc phân phối không đồng bộ, việc chạy nó trên điểm cuối tiêu chuẩn sẽ bỏ lỡ một nửa ngân sách có thể tiết kiệm được.
Ví dụ thực tế 4: chi phí thực tế của chế độ nhanh
Chế độ nhanh tăng gấp đôi mức giá lên $10 / $50 để đạt tốc độ đầu ra nhanh hơn khoảng 2.5 lần. Chạy yêu cầu trong ví dụ 1 thông qua chế độ này và bạn sẽ nhận được $0.080 đầu vào cộng với $0.060 đầu ra, hoặc $0.140 mỗi cuộc gọi, chính xác gấp đôi.
Điều đó định giá Opus 5 tương đương với mức giá tiêu chuẩn của Fable 5: bạn đang trả giá cấp tiên phong cho độ trễ, không phải cho khả năng. Điều này đáng giá cho các giao diện tương tác nơi người dùng theo dõi các token xuất hiện, nhưng khó để biện minh cho công việc nền. Nó không kết hợp với Batch API, vì vậy hai đòn bẩy chi phí này được thiết kế để loại trừ lẫn nhau.
Bốn đòn bẩy thực sự thay đổi hóa đơn của bạn
Bốn yếu tố này là đặc trưng của Opus 5, và đặc biệt về mức độ chúng giúp tiết kiệm.
1. Giảm yêu cầu tối thiểu cho bộ nhớ đệm prompt xuống 512 token
Trên Opus 4.8, số token tối thiểu có thể lưu vào bộ nhớ đệm là 1.024 token. Trên Opus 5 là 512. Các prompt trước đây quá ngắn để lưu vào bộ nhớ đệm giờ đây có thể được lưu mà không cần thay đổi mã nào ngoài việc thêm khối điều khiển bộ nhớ đệm.
Phép tính điểm hòa vốn tốt hơn hầu hết mọi người nghĩ. Một lần ghi vào bộ nhớ đệm có giá gấp 1.25 lần đầu vào tiêu chuẩn, một lần đọc có giá 0.1 lần. Tính toán điểm mà việc sử dụng bộ nhớ đệm mang lại lợi ích:
- TTL 5 phút: hòa vốn sau 1.3 yêu cầu. Bạn có lợi từ cuộc gọi thứ hai trở đi.
- TTL 1 giờ: hòa vốn sau 2.1 yêu cầu. Bạn có lợi từ cuộc gọi thứ ba trở đi.
Cụ thể, một prompt hệ thống 700 token được tái sử dụng qua 1.000 cuộc gọi trong một đợt sẽ có giá $3.50 nếu không được lưu vào bộ nhớ đệm. Nếu được lưu vào bộ nhớ đệm, nó có giá $0.0044 cho lần ghi cộng với 999 lần đọc với giá $0.00035, tổng cộng là $0.354. Prompt đó hoàn toàn không thể được lưu vào bộ nhớ đệm trên Opus 4.8.
2. Xử lý theo lô với mức giảm 50%
Đã đề cập ở trên, nhưng đáng nhắc lại như một đòn bẩy: hãy kiểm tra những khối lượng công việc nào thực sự cần phản hồi đồng bộ. Các lần chạy đánh giá, điền lại dữ liệu (backfills), tóm tắt hàng đêm và phân loại nội dung thường không cần.
3. Mức độ nỗ lực (Effort) low và medium cuối cùng đã có thể sử dụng được
output_config.effort kiểm soát mức độ mô hình suy nghĩ, và các token suy nghĩ được tính phí như đầu ra ở mức 25 đô la mỗi triệu. Opus 5 đã hiệu chỉnh lại các cấp độ nỗ lực, và Anthropic cho biết low và medium mạnh hơn đáng kể so với các mô hình Opus trước đây. Mặc định là high; xhigh vẫn là lựa chọn khởi đầu được khuyến nghị cho công việc viết mã và agentic.
Tiết kiệm tỷ lệ thuận với khối lượng token suy nghĩ. Nếu một tác vụ trung bình 8.000 token suy nghĩ ở mức xhigh và 1.500 ở mức low, bạn sẽ tiết kiệm 6.500 token đầu ra, hoặc $0.1625 cho mỗi tác vụ, tương đương $16.250 cho 100.000 tác vụ. Những con số này chỉ mang tính minh họa: sự khác biệt thực tế phụ thuộc vào các prompt của bạn, đó là lý do tại sao Anthropic khuyên bạn nên chạy một đợt kiểm tra mức độ nỗ lực mới dựa trên các đánh giá của riêng bạn thay vì giữ nguyên cài đặt của 4.8. Hướng dẫn tham số nỗ lực đề cập đến việc kiểm tra đó.
Một cạm bẫy: giảm mức độ nỗ lực sẽ cắt giảm các token suy nghĩ, chứ không phải độ dài phản hồi hiển thị. Các phản hồi mặc định và sản phẩm văn bản của Opus 5 dài hơn so với Opus 4.8, và mức độ nỗ lực sẽ không khắc phục được điều đó. Nếu bạn muốn câu trả lời ngắn hơn, hãy yêu cầu câu trả lời ngắn hơn.
4. Giảm chi phí phụ trội của prompt hệ thống khi sử dụng công cụ
Khi bạn gửi định nghĩa công cụ, API sẽ chèn một prompt hệ thống mà bạn phải trả tiền. Trên Opus 5, chi phí phụ trội đó là 286 token cho lựa chọn công cụ auto hoặc none, giảm từ 290 trên Opus 4.8 và 675 trên Opus 4.7.
Hãy thành thật về tầm quan trọng của điều này. So với 4.8, sự khác biệt bốn token là $20 trên một triệu yêu cầu: không đáng kể. So với 4.7, sự khác biệt 389 token là $0.001945 mỗi yêu cầu, hoặc $1.945 trên một triệu yêu cầu. Nếu bạn vẫn đang sử dụng 4.7 thì đó là số tiền đáng kể; trên 4.8 thì đó chỉ là một sai số làm tròn.
Đối với các đòn bẩy áp dụng cho toàn bộ dòng sản phẩm Claude, hướng dẫn của chúng tôi về cắt giảm hóa đơn API Claude của bạn sẽ đi sâu hơn.
Hai mục mà mọi người thường bỏ qua
Hệ số nhân inference_geo: "us" là 1.1 lần. Ghim suy luận vào cơ sở hạ tầng chỉ ở Hoa Kỳ để tuân thủ hoặc lưu trữ dữ liệu và mỗi danh mục token sẽ được nhân với 1.1: đầu vào $5.50, đầu ra $27.50, truy cập bộ nhớ đệm $0.55, xử lý theo lô $2.75 / $13.75. Khối lượng công việc trong ví dụ 1 sẽ tăng từ $700 một tháng lên $770. Đối với hóa đơn $50.000, đây là một mục $5.000, vì vậy hãy xác nhận bạn cần ghim trước khi thiết lập.
Bậc ưu tiên (Priority Tier) không được hỗ trợ trên Opus 5. Opus 4.8 vẫn giữ nó. Nếu việc lập kế hoạch năng lực của bạn phụ thuộc vào cam kết Bậc ưu tiên, thì đó là một hạn chế thực sự khi chuyển đổi. Hướng dẫn di chuyển từ Opus 4.8 sang Opus 5 đề cập đến vấn đề này cùng với các thay đổi API gây phá vỡ.
Những thay đổi về hành vi xuất hiện trên hóa đơn của bạn
Giá mỗi token chỉ là một nửa hóa đơn. Khối lượng token là nửa còn lại, và ba thay đổi hành vi của Opus 5 sẽ đẩy khối lượng lên nếu bạn không làm gì.
- Tính năng suy nghĩ được bật theo mặc định. Trên Opus 4.8, một yêu cầu không có trường
thinkingsẽ chạy mà không suy nghĩ. Trên Opus 5, cùng một yêu cầu sẽ chạy tính năng suy nghĩ thích ứng, và các token đó được tính phí như đầu ra. Vìmax_tokensgiới hạn tổng số token suy nghĩ cộng với phản hồi, một số khối lượng công việc cũng sẽ bắt đầu bị cắt ngắn. - Opus 5 ủy quyền cho các tác nhân phụ (subagents) dễ dàng hơn. Mỗi tác nhân phụ có bộ token riêng được tính phí. Hãy giới hạn hoặc định rõ phạm vi ủy quyền trên các khối lượng công việc nhạy cảm về chi phí.
- Opus 5 tự kiểm tra công việc của mình mà không cần nhắc nhở. Nếu bạn đã giữ lại các hướng dẫn “kiểm tra lại công việc của bạn”, hướng dẫn prompt của Anthropic khuyến nghị loại bỏ chúng. Việc kiểm tra quá mức sẽ tốn token.
Không điều nào trong số này thay đổi giá mỗi token. Tất cả chúng đều thay đổi số tiền bạn phải trả.
Xác nhận chi phí thực tế của bạn với Apidog
Cách nhanh nhất để ngừng đoán mò là đọc đối tượng usage trong mỗi phản hồi. Nó báo cáo riêng biệt input_tokens, output_tokens, cache_creation_input_tokens và cache_read_input_tokens, đây là phân tích chính xác bạn cần để kiểm tra các phép tính trên với lưu lượng truy cập của riêng bạn.

Apidog là một nền tảng phát triển và kiểm thử API, vì vậy nó xử lý việc này rất tốt. Hãy trỏ một yêu cầu đến điểm cuối Messages với "model": "claude-opus-5", sau đó:
- Sao chép yêu cầu đã lưu một lần cho mỗi cấp độ nỗ lực và so sánh khối lượng token suy nghĩ cạnh nhau trên các prompt giống hệt nhau.
- Xác nhận rằng
usage.cache_read_input_tokenslớn hơn 0, để bộ nhớ đệm bị hỏng một cách âm thầm sẽ hiển thị dưới dạng một kiểm thử thất bại thay vì một hóa đơn bất ngờ. - Lưu khóa dưới dạng biến môi trường thay vì trong phần thân yêu cầu, để khóa phát triển không bao giờ chạy một lô có kích thước sản xuất.
- Theo dõi luồng SSE để xem các token đầu ra đi đến đâu trong các thế hệ dài.
Tải xuống Apidog để chạy các kiểm tra này cùng với hướng dẫn chi tiết trong hướng dẫn API Opus 5 của chúng tôi.
Những gì bạn thực sự đang mua với giá $5 / $25
Opus 5 có vị trí mạnh về giá-trên-khả năng, và nó không phải là đỉnh của bộ sản phẩm Claude. Fable 5 vẫn là mô hình được phát hành rộng rãi có khả năng nhất của Anthropic, và Opus 5 vẫn kém Mythos 5 về khai thác an ninh mạng và nghiên cứu sinh học tự động. Anthropic tuyên bố cả hai điều này một cách rõ ràng. Cách nhìn nhận trung thực là khả năng cấp tiên phong với một nửa giá tiên phong, với một giới hạn được đặt tên ở phía trên. Giải thích về mô hình lớp Mythos của chúng tôi đề cập đến những gì nằm trên ranh giới đó.
Đối với hầu hết các nhóm, câu hỏi thực sự không phải là Opus 5 so với giới hạn cao nhất. Mà là liệu khối lượng công việc có cần Opus hay không, hay liệu Sonnet 5 với giá $2 / $10 (tăng lên $3 / $15 vào ngày 1 tháng 9 năm 2026) có thực hiện được công việc với 40% chi phí hay không. Hãy chạy cả hai để đánh giá của riêng bạn trước khi cam kết ngân sách. Thông số kỹ thuật đầy đủ và khả năng sẵn có nằm trong tổng quan về Claude Opus 5 của chúng tôi; tổng quan về các mô hình của Anthropic có bảng tiêu chuẩn.
Câu hỏi thường gặp
Claude Opus 5 có giá bao nhiêu? $5 cho mỗi triệu token đầu vào và $25 cho mỗi triệu token đầu ra trên API tiêu chuẩn. Truy cập bộ nhớ đệm có giá $0.50, xử lý theo lô với giá $2.50 / $12.50, và chế độ nhanh với giá $10 / $50.
Claude Opus 5 có đắt hơn Opus 4.8 không? Theo mỗi token thì không: các mức giá giống hệt nhau. Hóa đơn của bạn vẫn có thể tăng, vì tính năng suy nghĩ được bật theo mặc định và các phản hồi mặc định dài hơn. Hãy đo lường khối lượng token thay vì giả định ngang bằng.
Có phụ phí ngữ cảnh dài trên cửa sổ 1 triệu token không? Không. Cửa sổ ngữ cảnh 1 triệu token vừa là mặc định vừa là tối đa, và không có cấp cao cấp nào cho đầu vào dài.
Cách rẻ nhất để chạy Claude Opus 5 là gì? Lưu vào bộ nhớ đệm một cách chủ động (mức tối thiểu 512 token có nghĩa là hầu hết mọi tiền tố được tái sử dụng đều đủ điều kiện), chạy các công việc không khẩn cấp thông qua Batch API để được giảm giá cố định 50%, và kiểm tra các mức độ nỗ lực để tìm ra mức thấp nhất vượt qua các đánh giá của bạn. Hướng dẫn miễn phí và cách rẻ nhất có thêm thông tin.
Việc ghim khu vực có tốn thêm chi phí không? Có. Đặt inference_geo: "us" áp dụng hệ số nhân 1.1 lần cho mọi danh mục token, bao gồm cả truy cập bộ nhớ đệm và xử lý theo lô.
