Claude Sonnet 5.5 Giá: Phân Tích Chi Phí Toàn Diện (API, Caching, Batch và Gói)

Giá Claude Sonnet 5.5: 2 đô la (đầu vào)/10 đô la (đầu ra) cho mỗi triệu token, 0,20 đô la cho mỗi lần đọc bộ nhớ đệm, xử lý theo lô giảm giá một nửa. Các ví dụ về chi phí đã tính toán, chi phí nỗ lực và giá gói.

Ashley Goolam

Ashley Goolam

29 tháng 9 2026

Claude Sonnet 5.5 Giá: Phân Tích Chi Phí Toàn Diện (API, Caching, Batch và Gói)

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Claude Sonnet 5.5 có giá 2 đô la cho mỗi triệu token đầu vào và 10 đô la cho mỗi triệu token đầu ra trên Claude API, tương tự như Sonnet 5. Đọc bộ nhớ đệm có giá 0.20 đô la mỗi triệu, Batch API giảm một nửa cả hai mức giá xuống còn 1 đô la và 5 đô la, cửa sổ ngữ cảnh 1M đầy đủ được tính theo tỷ lệ tiêu chuẩn và chế độ nhanh không được cung cấp. Mức tăng giá dự kiến của Sonnet 5 vào ngày 1 tháng 9 lên 3/15 đô la đã bị hủy bỏ, vì vậy 2/10 đô la hiện là mức giá tiêu chuẩn.

Hướng dẫn này liệt kê từng mục giá của Claude Sonnet 5.5, trình bày ba ví dụ về chi phí với phép tính minh họa và giải thích lý do tại sao "nỗ lực" lại ảnh hưởng đến hóa đơn của bạn nhiều hơn là tỷ lệ mỗi token. Mới sử dụng mô hình này? Bắt đầu với Claude Sonnet 5.5 là gì, hoặc đọc cách sử dụng Claude Sonnet 5.5 miễn phí. Để kiểm tra các con số với lưu lượng truy cập của riêng bạn, hãy gửi yêu cầu từ Apidog và đọc khối usage trên mỗi phản hồi.

Bảng giá API Claude Sonnet 5.5

Giá mỗi triệu token (MTok), từ tài liệu giá của Anthropic:

Mục Giá mỗi MTok
Đầu vào $2.00
Ghi bộ nhớ đệm 5 phút $2.50
Ghi bộ nhớ đệm 1 giờ $4.00
Đọc bộ nhớ đệm $0.20
Đầu ra $10.00
Đầu vào hàng loạt $1.00
Đầu ra hàng loạt $5.00

Ba chi tiết thay đổi mức phí bạn phải trả:

Sonnet 5.5 so sánh về giá niêm yết như thế nào

Mô hình Đầu vào Đầu ra Ghi chú
Claude Sonnet 5.5 $2 $10 Đọc bộ nhớ đệm $0.20; ngữ cảnh 1M; không có chế độ nhanh
Claude Sonnet 5 $2 $10 Đọc bộ nhớ đệm $0.20; mức tăng $3/$15 đã bị hủy
Claude Opus 5.5 $4 $20 Đọc bộ nhớ đệm $0.20; chế độ nhanh $8/$40
Claude Haiku 4.5 $1 $5 Ngữ cảnh 200k
GPT-6 Sol $2 $10 Giảm 90% cho đầu vào được lưu vào bộ nhớ đệm; ngữ cảnh 872k
GPT-6 Luna $0.10 $0.50 Ngữ cảnh 1M

Sonnet 5.5 có giá bằng một nửa Opus 5.5 về đầu vào, đầu ra và ghi bộ nhớ đệm. Nó có chung mức giá niêm yết chính xác 2/10 đô la với GPT-6 Sol, vì vậy việc lựa chọn giữa hai mô hình này phụ thuộc vào kết quả trên mỗi tác vụ. Để biết thêm thông tin chi tiết, hãy xem giá của Claude Sonnet 5, cuộc chiến giá mô hình AI tháng 9 năm 2026 và giá của GPT-6 Sol.

Ví dụ minh họa: chi phí thực tế của các yêu cầu

Công thức cho mỗi dòng: token ÷ 1.000.000 × giá mỗi MTok. Tính giá từng mục, sau đó cộng lại.

Ví dụ 1: một yêu cầu kiểu trò chuyện

3.000 token đầu vào, 800 token đầu ra, không lưu vào bộ nhớ đệm.

Một nghìn yêu cầu như vậy có giá 14 đô la. Đầu ra chiếm 21% số token nhưng chiếm 57% hóa đơn, do đó độ dài đầu ra quan trọng hơn độ dài lời nhắc.

Ví dụ 2: một tác nhân đọc lại tiền tố 50.000 token

Một vòng lặp tác nhân gửi cùng một tiền tố 50.000 token (lời nhắc hệ thống, công cụ, ngữ cảnh kho lưu trữ) trên 20 lệnh gọi. Chỉ tiền tố được tính giá ở đây.

Không bộ nhớ đệm: 20 × 50.000 = 1.000.000 token; 1.000.000 ÷ 1.000.000 × $2 = $2.00

Đã lưu vào bộ nhớ đệm, với thao tác ghi 5 phút:

Điều đó tiết kiệm được 1.685 đô la, khoảng 84%. Thao tác ghi 5 phút chỉ có lợi khi các lệnh gọi nằm trong khoảng thời gian đó; đối với các vòng lặp chậm hơn, thao tác ghi 1 giờ có giá 50.000 ÷ 1.000.000 × $4 = $0.20, vì vậy tổng cộng là $0.20 + $0.19 = $0.39, vẫn thấp hơn khoảng 80% so với không sử dụng bộ nhớ đệm. Lý do tương tự được áp dụng cho Opus trong phép tính chi phí lưu bộ nhớ đệm lời nhắc của chúng tôi; tốc độ đọc 0.20 đô la là giống hệt.

Ví dụ 3: một công việc hàng loạt gồm 10.000 yêu cầu

Cùng hình dạng như Ví dụ 1, được gửi qua Batch API.

Batch cũng nâng giới hạn đầu ra từ 128K lên 300K token với phiên bản beta output-300k-2026-03-24.

Chi phí mỗi tác vụ, không phải mỗi token

Biểu phí cho bạn biết một token có giá bao nhiêu, chứ không phải tác vụ của bạn tiêu tốn bao nhiêu token. Con số thứ hai này dao động nhiều hơn theo "nỗ lực" so với bất kỳ khoảng cách giá nào giữa các mô hình.

Anthropic cho biết trong thử nghiệm của họ, Sonnet 5.5 “có chi phí mỗi tác vụ thấp hơn tới 30% so với phiên bản tiền nhiệm.” Bài đăng ra mắt cũng trình bày chi phí ở mọi cấp độ nỗ lực. Các lần chạy Terminal-Bench 4.0 là của Anthropic, FrontierCode được chạy bởi Cognition, và chi phí chỉ số đến từ Artificial Analysis:

Nỗ lực Terminal-Bench 4.0 (điểm, $/lần thử) FrontierCode v1.1 (điểm, $/tác vụ) Chỉ số AA (điểm, chi phí chạy)
thấp 20.0%, $0.76 29.3%, $0.19 35.8, $544
trung bình 28.8%, $0.83 36.5%, $0.24 40.7, $701
cao 43.0%, $1.94 49.4%, $0.42 46.7, $1,176
rất cao 61.5%, $5.30 52.1%, $1.59 51.9, $2,738
tối đa 70.6%, $12.54 46.2%, $20.78 56.0, $8,977

Những điểm nổi bật:

Tính dài dòng ở mức tối đa là một cái bẫy khác. Báo cáo của OfficeChai về dữ liệu Artificial Analysis cho thấy Sonnet 5.5 tạo ra khoảng 193.000 token đầu ra cho mỗi tác vụ chỉ mục ở mức tối đa, với chi phí mỗi tác vụ cao hơn khoảng 50% so với Sonnet 5. Simon Willison đã báo cáo trên Hacker News rằng một lần chạy ở mức tối đa đã tiêu tốn 128.000 token "suy nghĩ" và hết token trước khi tạo ra câu trả lời.

Sáu đòn bẩy giúp giảm hóa đơn

  1. Đặt mức nỗ lực có chủ đích. API mặc định là high (cao); Claude Code và các ứng dụng Claude mặc định là medium (trung bình). Hướng dẫn tạo lời nhắc của Anthropic đề xuất medium hoặc low cho trò chuyện và xhigh hoặc max chỉ khi cần đạt được lợi ích chất lượng có thể đo lường. Đừng sử dụng lại các cài đặt của Sonnet 5; thang đo đã được hiệu chỉnh lại.
  2. Sử dụng between_tools ở những nơi bạn đã tắt suy nghĩ. thinking: {"type": "disabled"} hiện trả về lỗi 400; {"type": "between_tools"} thay thế nó ở các mức low, medium và high.
  3. Lưu vào bộ nhớ đệm bất cứ thứ gì được tái sử dụng. Lời nhắc có thể lưu vào bộ nhớ đệm tối thiểu là 512 token (1.024 trên Sonnet 5). Thay đổi mức effort cấp cao nhất giữa các yêu cầu sẽ làm mất hiệu lực bộ nhớ đệm, vì vậy hãy giữ ổn định.
  4. Xử lý hàng loạt những gì có thể chờ. Giảm một nửa giá cho đầu vào và đầu ra.
  5. Giữ max_tokens đúng với thực tế. Hướng dẫn của Anthropic coi stop_reason: "max_tokens" là một phản hồi thất bại, vì vậy một câu trả lời bị cắt bớt là một khoản chi phí mà không có gì để gửi đi.
  6. Cắt bỏ công việc không được yêu cầu. Sonnet 5.5 thêm các bài kiểm tra, tài liệu và tệp bạn không yêu cầu, đồng thời bắt đầu các vòng đánh giá bổ sung ở mức xhigh và max. Đoạn lời nhắc hệ thống được Anthropic đề xuất đã cắt giảm khoảng một phần ba chi phí phiên ở mức max mà không làm thay đổi chất lượng.

Bạn còn trả tiền cho Sonnet 5.5 ở đâu khác

Bạn đang tìm kiếm tín dụng thay vì trả tiền? Hãy xem có API Claude Sonnet 5.5 miễn phí không.

Theo dõi chi phí mỗi yêu cầu trong Apidog

Mỗi phản hồi tin nhắn đều chứa một đối tượng usage với input_tokens, output_tokens và số lượng bộ nhớ đệm. Điều đó đủ để định giá bất kỳ lệnh gọi nào trong Apidog:

  1. Lưu khóa của bạn dưới dạng biến môi trường ANTHROPIC_API_KEY.
  2. Lưu yêu cầu này một lần cho mỗi mức độ nỗ lực (low, medium, high) với cùng một lời nhắc:
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 4000,
    "thinking": {"type": "between_tools"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'
  1. Thêm một bộ xử lý hậu kỳ định giá lệnh gọi và báo lỗi nếu bị cắt bớt:
const body = pm.response.json();
const u = body.usage;
const cost = (u.input_tokens * 2 + u.output_tokens * 10) / 1e6;
pm.environment.set("last_call_usd", cost.toFixed(5));
pm.test("not truncated", () => pm.expect(body.stop_reason).to.not.eql("max_tokens"));
  1. Chạy cả ba và so sánh usage.output_tokens và chi phí song song. Nếu bạn lưu vào bộ nhớ đệm, hãy thêm số lượng bộ nhớ đệm theo mức giá riêng của chúng.

Hướng dẫn đầy đủ về yêu cầu nằm trong cách sử dụng API Claude Sonnet 5.5.

Câu hỏi thường gặp

Claude Sonnet 5.5 có giá bao nhiêu mỗi triệu token? 2 đô la đầu vào và 10 đô la đầu ra trên Claude API. Đọc bộ nhớ đệm có giá 0.20 đô la; Batch API tính phí 1 đô la và 5 đô la.

Sonnet 5.5 có đắt hơn Sonnet 5 không? Không. Giá mỗi token giống hệt nhau, và Anthropic cho biết Sonnet 5.5 có chi phí mỗi tác vụ thấp hơn tới 30% trong thử nghiệm của họ.

Có phụ phí nào trên 200k token không? Không. Cửa sổ 1M đầy đủ được tính theo mức giá tiêu chuẩn.

Sonnet 5.5 có chế độ nhanh không? Không. Chế độ nhanh chỉ có sẵn trên Opus 5.5, Opus 5 và Opus 4.8.

Claude Sonnet 5.5 có miễn phí không? Trong ứng dụng trò chuyện Claude, có: bất kỳ ai cũng có thể trò chuyện với nó trên gói Miễn phí. API chạy trên tín dụng trả trước; hướng dẫn API miễn phí bao gồm các chương trình tín dụng.

Bước tiếp theo: định giá khối lượng công việc của riêng bạn

Lấy ba hình dạng yêu cầu phổ biến nhất của bạn, chạy mỗi yêu cầu ở hai mức độ nỗ lực và nhân các số usage với bảng trên. Bạn sẽ nhanh chóng thấy liệu medium có đáp ứng được tiêu chuẩn chất lượng của bạn hay high xứng đáng với số token phụ trội của nó. Tải xuống Apidog để giữ các yêu cầu đó và tập lệnh tính chi phí cạnh nhau.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API