Claude Opus 5.5 Đệm Prompt: Phân tích Hòa vốn cho 0,20 USD mỗi Lượt đọc Cache

Claude Opus 5.5 tính phí 0,20 đô la cho mỗi triệu token đầu vào được cache, so với 4,00 đô la cho token đầu vào mới và 5,00 đô la để tạo output. Đây là tỷ lệ tái sử dụng hòa vốn, 21%, được tính toán dựa trên các mẫu yêu cầu thực tế.

INEZA Felin-Michel

INEZA Felin-Michel

23 tháng 9 2026

Claude Opus 5.5 Đệm Prompt: Phân tích Hòa vốn cho 0,20 USD mỗi Lượt đọc Cache

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Đặc vụ của bạn gửi lại 40.000 token của lời nhắc hệ thống, định nghĩa công cụ và tài liệu chính sách giống hệt nhau trong mỗi lần gọi. Với mức giá đầu vào Claude Opus 5.5 là 4 đô la cho mỗi triệu token, tiền tố đó có giá 0,16 đô la mỗi khi nó di chuyển, bất kể một byte nào của nó có thay đổi kể từ yêu cầu cuối cùng hay không.

Bộ nhớ đệm lời nhắc là giải pháp, và Anthropic đã định giá rất cạnh tranh cho Opus 5.5. Một lần đọc được lưu trong bộ nhớ đệm có giá 0,20 đô la cho mỗi triệu token so với 4,00 đô la cho đầu vào mới, giảm giá 95%. Nhưng một lần ghi vào bộ nhớ đệm có giá 5,00 đô la cho mỗi triệu, cao hơn so với việc gửi các token không qua bộ nhớ đệm. Vì vậy, việc lưu vào bộ nhớ đệm không phải là tiền miễn phí. Đó là một canh bạc rằng bạn sẽ tái sử dụng tiền tố, và canh bạc này có một điểm hòa vốn chính xác mà hầu như không ai tính toán trước khi bật nó lên.

Bài viết này sẽ tính toán điều đó. Câu trả lời ngắn gọn: với một tiền tố duy nhất, bạn sẽ hòa vốn sau 1,26 lần gọi, và ở trạng thái ổn định, bạn sẽ hòa vốn ở tỷ lệ truy cập bộ nhớ đệm khoảng 21%. Dưới mức đó, việc lưu vào bộ nhớ đệm sẽ khiến bạn tốn tiền.

nút

Trước tiên, đáng để nói về quy mô. OpenAI đã tiết lộ tại buổi ra mắt của mình rằng nhà nghiên cứu trung bình của họ chi hơn 600 đô la mỗi ngày cho các tác nhân mã hóa, với phân vị thứ 90 trên 7.000 đô la mỗi ngày. Với khối lượng đó, chênh lệch 20 điểm phần trăm trong tỷ lệ truy cập tương đương một khoản lương. Để có cái nhìn rộng hơn về giá cả trên cả ba lần ra mắt vào tháng 9, hãy xem phân tích cuộc chiến giá mô hình tháng 9 năm 2026 của chúng tôi.

Ba mức giá quyết định mọi thứ

Loại token Giá Claude Opus 5.5 trên mỗi triệu So với đầu vào mới
Đầu vào mới $4.00 cơ sở
Ghi vào bộ đệm $5.00 Phí cao cấp 1,00 đô la
Đọc từ bộ đệm $0.20 Tiết kiệm 3,80 đô la
Đầu ra $20.00 bộ đệm không ảnh hưởng

Hai sự thật rút ra từ bảng đó. Ghi một tiền tố vào bộ đệm tốn của bạn thêm 1,00 đô la mỗi triệu so với việc không lưu vào bộ đệm chút nào. Mỗi lần đọc sau đó từ tiền tố đó sẽ giúp bạn tiết kiệm 3,80 đô la mỗi triệu. Giá đầu ra không bao giờ thay đổi, vì vậy một tác nhân tạo ra câu trả lời dài từ một lời nhắc ngắn sẽ không có nhiều lợi ích ở đây, trong khi một tác nhân đọc một ngữ cảnh ổn định lớn và trả về một phán quyết ngắn sẽ có rất nhiều lợi ích.

Bảng thông số kỹ thuật đầy đủ, bao gồm cửa sổ ngữ cảnh 1.000.000 token và đầu ra tối đa 128.000 token, có trong bài viết Claude Opus 5.5 là gì.

Điểm hòa vốn là 1,26 lần gọi, không phải hai

Lấy một tiền tố chính xác một triệu token và N lần gọi sử dụng chung nó, một lần ghi và N trừ một lần đọc.

uncached:  N * $4.00
cached:    $5.00 + (N - 1) * $0.20

4.00N = 5.00 + 0.20(N - 1)
3.80N = 4.80
N     = 1.26

Bạn cần 1,26 lần gọi để bù lại phí ghi thêm. Vì các lần gọi là số nguyên, điều đó có nghĩa là: nếu tiền tố từng được đọc lại dù chỉ một lần, việc lưu nó vào bộ đệm là đúng đắn. Hai lần gọi đã giúp bạn vượt trước 35%.

Số lần gọi chia sẻ một lần ghi Chi phí không đệm cho 1M tiền tố Chi phí đã đệm Tiết kiệm
1 $4.00 $5.00 25% tệ hơn
2 $8.00 $5.20 35%
5 $20.00 $5.80 71%
10 $40.00 $6.80 83%
100 $400.00 $24.80 94%

Bảng đó giả định một lần ghi và tái sử dụng hoàn hảo sau đó. Các hệ thống thực tế phức tạp hơn, đó là nơi phép tính thứ hai xuất hiện.

Ở trạng thái ổn định, con số duy nhất quan trọng là tỷ lệ truy cập

Trong một ngày lưu lượng truy cập, bạn không chỉ ghi một lần. Bộ đệm hết hạn, tiền tố được chỉnh sửa, người dùng mới xuất hiện. Gọi h là tỷ lệ token tiền tố của bạn được phục vụ từ bộ đệm. Một lần truy cập trượt sẽ được tính là một lần ghi, một lần truy cập trúng sẽ được tính là một lần đọc:

effective cost per 1M prefix tokens = $5.00 * (1 - h) + $0.20 * h
                                    = $5.00 - $4.80h

break-even against $4.00 uncached:  h = 1.00 / 4.80 = 20.8%

Hai mươi mốt phần trăm là con số cần nhớ. Nếu ít hơn khoảng một trong năm token tiền tố của bạn được phục vụ từ bộ đệm, việc bật bộ đệm sẽ khiến hóa đơn của bạn tồi tệ hơn.

Tỷ lệ truy cập bộ đệm Chi phí hiệu quả cho 1M tiền tố So với 4,00 đô la không đệm
0% $5.00 25% tệ hơn
20.8% $4.00 hòa vốn
50% $2.60 Rẻ hơn 35%
75% $1.40 Rẻ hơn 65%
90% $0.68 Rẻ hơn 83%
95% $0.44 Rẻ hơn 89%
99% $0.25 Rẻ hơn 94%
100% $0.20 Rẻ hơn 95%

Hai bảng là cùng một phương trình được nhìn từ các góc độ khác nhau, vì một lần ghi cho mỗi N lần gọi có tỷ lệ truy cập là (N-1)/N. Mười lần gọi cho mỗi lần ghi có tỷ lệ truy cập 90% và cả hai bảng đều nói 83%.

Ba dạng yêu cầu, đã tính toán

Dạng 1: tác nhân tần số cao, tiền tố nhỏ

Một tác nhân phân loại hỗ trợ với tiền tố 40.000 token, một lượt người dùng thay đổi 800 token, 600 token đầu ra, 10.000 cuộc gọi mỗi ngày. Giả sử ghi trên 3% số cuộc gọi, do đó tỷ lệ truy cập là 97%.

Chưa đệm Đã đệm
Tiền tố, 400M token/ngày $1,600.00 $137.60
Lượt biến đổi, 8M token/ngày $32.00 $32.00
Tổng đầu vào mỗi ngày $1,632.00 $169.60

Đó là giảm 89,6% so với dòng đầu vào, khoảng 1.462 đô la mỗi ngày, hoặc 43.800 đô la mỗi tháng. Đầu ra vẫn ở mức 120 đô la mỗi ngày dù thế nào đi nữa. Lưu ý rằng tiền tố chỉ có 40.000 token. Việc lưu vào bộ đệm mang lại lợi ích ở đây vì tần suất, không phải kích thước.

Dạng 2: một lần xử lý trên ngữ cảnh 1M

Một triệu token đầu vào, một câu trả lời đầu ra, không bao giờ tái sử dụng. Cuộc gọi không đệm đó tốn 4,00 đô la đầu vào. Đã đệm thì tốn 5,00 đô la, vì bạn đã trả tiền để ghi một tiền tố mà không ai đọc. Chạy 500 tài liệu mỗi ngày theo mẫu đó và việc lưu vào bộ đệm khiến bạn tốn thêm 500 đô la mỗi ngày mà không có lợi ích gì.

Đây là dạng mà mọi người thường mắc sai lầm nhất, bởi vì ngữ cảnh rất lớn và bản năng cho rằng ngữ cảnh lớn rõ ràng cần được lưu vào bộ đệm. Kích thước không liên quan. Tái sử dụng mới là biến số quan trọng nhất.

Dạng 3: phiên tác nhân dài trên cửa sổ 1M

Bây giờ hãy lấy cùng ngữ cảnh một triệu token đó và để một tác nhân đọc lại nó qua 200 lượt, đó chính xác là những gì một vòng lặp tác vụ 18 giờ trông như thế nào.

Chi phí
Chưa đệm, 200 x $4.00 $800.00
Đã đệm, 1 ghi + 199 đọc $44.80
Đã đệm, 5 ghi + 195 đọc $64.00

Ngay cả khi bộ đệm bị xóa bốn lần giữa phiên và bạn phải trả năm lần ghi đầy đủ, bạn vẫn tiết kiệm được 92% so với hóa đơn không dùng bộ đệm. Các phiên dài là nơi mức giá 0,20 đô la khẳng định danh tiếng của nó.

Sai lầm đắt giá: lưu vào bộ đệm phần thay đổi

Xem xét 5.000 tài liệu, mỗi tài liệu 60.000 token, được tóm tắt một lần riêng biệt sau một tiêu đề hướng dẫn 6.000 token được chia sẻ.

Chiến lược Chi phí đầu vào
Không lưu vào bộ đệm gì cả $1,320
Lưu toàn bộ yêu cầu, bao gồm từng tài liệu $1,650
Chỉ lưu tiêu đề 6.000 token $1,206

Lưu vào bộ đệm sai ranh giới tồi tệ hơn 25% so với không lưu vào bộ đệm. Lưu vào bộ đệm đúng sẽ tốt hơn 9%. Cùng một tính năng, cùng mức giá, chênh lệch 444 đô la hoàn toàn được quyết định bởi nơi kết thúc của tiền tố được lưu vào bộ đệm.

Quy tắc rút ra từ đây: hãy lưu vào bộ đệm chuỗi byte dẫn đầu dài nhất giống hệt nhau qua các lần gọi, và không hơn một byte nào. Nếu một dấu thời gian, ID yêu cầu hoặc tài liệu theo yêu cầu nằm bên trong tiền tố được lưu vào bộ đệm của bạn, tỷ lệ truy cập của bạn sẽ giảm xuống 0 và mỗi cuộc gọi sẽ được tính 5,00 đô la thay vì 4,00 đô la. Cơ chế chung của việc so khớp tiền tố được đề cập trong hướng dẫn cơ bản về lưu bộ đệm lời nhắc của chúng tôi.

95% là tiệm cận, không phải mức giảm giá bạn nhận được

Con số tiêu đề là đọc từ bộ đệm có giá 5% so với đầu vào mới. Bạn sẽ không bao giờ thực sự trả 5%, vì bạn luôn phải trả tiền cho ít nhất một lần ghi. Với 100 lần gọi cho mỗi lần ghi, bạn sẽ tiết kiệm được 94%. Với 10 lần gọi cho mỗi lần ghi, bạn tiết kiệm được 83%. Với 2 lần gọi, bạn tiết kiệm được 35%.

Hãy lập ngân sách dựa trên bảng tỷ lệ truy cập, chứ không phải dựa trên tiêu đề. Một nhóm tài chính mô hình hóa mức tiết kiệm 95% và quan sát thấy 83% sẽ kết luận tính năng này bị lỗi trong khi nó đang hoạt động đúng như giá đã định.

Những gì tài liệu ra mắt không nói cho bạn biết

Ba yếu tố đầu vào cho phép tính toán này không có trong tài liệu ra mắt Opus 5.5 của Anthropic, và việc đoán mò chúng sẽ là cách nhanh nhất để đưa ra một ngân sách sai lầm:

Kiểm tra cả ba điều này trên trang giá của nhà cung cấp trước khi cam kết một con số. Các mức giá trong bài viết này đã được công bố. Ba điều này thì chưa.

Kiểm tra xem bộ đệm có thực sự đang được truy cập hay không

Chế độ lỗi là im lặng. Không có gì báo lỗi khi một tiền tố bị xóa khỏi bộ đệm. Ai đó thêm một ID gỡ lỗi vào thông báo hệ thống, tỷ lệ truy cập giảm từ 97% xuống 0, và tín hiệu duy nhất là một dòng trên hóa đơn ba tuần sau đó.

"usage": {
  "input_tokens": 812,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 40960,
  "output_tokens": 604
}

Trong lần gọi đầu tiên, cache_creation_input_tokens chứa tiền tố. Trong mỗi lần gọi sau đó, trường đó phải bằng 0 và cache_read_input_tokens phải chứa cùng lượng tải. Lưu yêu cầu một lần trong Apidog, thực hiện hai lần, và theo dõi trường nào thay đổi.

Sau đó, biến quan sát đó thành một xác nhận để nó không thể âm thầm thoái hóa. Một kịch bản kiểm thử Apidog gửi yêu cầu hai lần và khẳng định cache_read_input_tokens > 40000 trong phản hồi thứ hai sẽ thất bại trong CI ngay khi một đồng đội làm cho tiền tố không còn xác định được nữa. Đó là một kiểm thử chỉ với một dòng code đứng giữa bạn và việc tăng phí tiền tố lên 25 lần, và đó là điều mang lại lợi nhuận cao nhất trong bài viết này.

GPT-6 có cùng phép tính như thế nào

GPT-6 Sol liệt kê đầu vào ở mức 2,00 đô la cho mỗi triệu với chiết khấu 90% cho các lần đọc từ bộ đệm, điều này đưa một lần đọc từ bộ đệm xuống còn 0,20 đô la cho mỗi triệu, cùng con số với Opus 5.5. GPT-6 Luna với 0,10 đô la cho mỗi triệu đầu vào thì là 0,01 đô la cho mỗi triệu khi được lưu vào bộ đệm.

Sự khác biệt là những gì chúng ta có thể tính toán. Tài liệu ra mắt của OpenAI không nêu rõ tỷ lệ ghi vào bộ đệm, vì vậy tỷ lệ tái sử dụng hòa vốn cho GPT-6 không thể được suy ra theo cách của Opus 5.5. Việc Anthropic công bố giá ghi rõ ràng là 5,00 đô la chính là điều giúp con số 21% có thể tính toán được. Phần còn lại của bản phát hành bộ đệm của OpenAI, bao gồm các thay đổi nỗ lực bảo toàn bộ đệm và các công cụ chẩn đoán mới, có trong bài viết về lưu bộ đệm lời nhắc GPT-6 của chúng tôi.

Điểm mấu chốt

Lưu bộ đệm lời nhắc trên Claude Opus 5.5 là một câu hỏi toán học: liệu hơn một phần năm token tiền tố của bạn có được truy xuất từ bộ đệm (warm) không? Nếu có, hãy bật nó lên và mong đợi giảm 83% đến 94% chi phí đầu vào thay vì 95% được quảng cáo. Nếu khối lượng công việc của bạn là các lần xử lý một lần qua các tài liệu duy nhất, hãy tắt nó đi và tiết kiệm phí ghi 1,00 đô la mỗi triệu. Và dù bạn chọn cách nào, hãy xác nhận trên cache_read_input_tokens trong CI, vì lỗi hồi quy bộ đệm không bao giờ tự thông báo.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API