Claude Opus 5.5 Prompt Caching: Perhitungan Titik Impas Pembacaan Cache Berbiaya $0.20

Claude Opus 5.5 mengenakan biaya $0,20 per sejuta token input yang tersimpan di cache, dibandingkan dengan $4,00 untuk input baru dan $5,00 untuk penulisan. Berikut adalah tingkat penggunaan kembali titik impas, 21%, yang dihitung berdasarkan bentuk permintaan nyata.

INEZA Felin-Michel

INEZA Felin-Michel

23 September 2026

Claude Opus 5.5 Prompt Caching: Perhitungan Titik Impas Pembacaan Cache Berbiaya $0.20

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Agen Anda mengirim ulang 40.000 token yang sama dari perintah sistem, definisi alat, dan dokumen kebijakan pada setiap panggilan. Dengan harga input Claude Opus 5.5 sebesar $4 per juta token, awalan tersebut berharga $0,16 setiap kali bergerak, terlepas apakah ada satu byte pun yang berubah sejak permintaan terakhir.

Penyimpanan cache prompt adalah solusinya, dan Anthropic menetapkan harga yang agresif pada Opus 5.5. Pembacaan dari cache berharga $0,20 per juta token dibandingkan $4,00 untuk input baru, diskon 95%. Tetapi penulisan ke cache berharga $5,00 per juta, yang lebih mahal daripada mengirim token tanpa cache. Jadi caching bukanlah uang gratis. Ini adalah taruhan bahwa Anda akan menggunakan kembali awalan tersebut, dan taruhan ini memiliki titik impas yang tepat yang hampir tidak ada yang menghitung sebelum mengaktifkannya.

Artikel ini menghitung aritmetika tersebut. Jawaban singkatnya: pada satu awalan, Anda akan impas setelah 1,26 panggilan, dan dalam kondisi stabil, Anda akan impas pada tingkat hit cache sekitar 21%. Di bawah itu, caching akan merugikan Anda.

tombol

Skala ini perlu disebutkan terlebih dahulu. OpenAI mengungkapkan pada peluncurannya sendiri bahwa peneliti mediannya menghabiskan lebih dari $600 per hari untuk agen pengkodean, dengan persentil ke-90 di atas $7.000 per hari. Pada volume tersebut, perbedaan 20 persen poin dalam tingkat hit setara dengan satu gaji. Untuk gambaran harga yang lebih luas di ketiga peluncuran September, lihat analisis perang harga model AI September 2026 kami.

Tiga tingkat yang menentukan segalanya

Jenis token Tarif Claude Opus 5.5 per juta Relatif terhadap input baru
Input baru $4,00 dasar
Penulisan cache $5,00 premi $1,00
Pembacaan cache $0,20 penghematan $3,80
Output $20,00 caching tidak menyentuhnya

Dua fakta langsung muncul dari tabel tersebut. Menulis awalan ke dalam cache merugikan Anda $1,00 per juta lebih banyak daripada tidak melakukan caching sama sekali. Setiap pembacaan awalan tersebut selanjutnya menghemat Anda $3,80 per juta. Harga output tidak pernah bergerak, jadi agen yang mengeluarkan jawaban panjang dari prompt pendek tidak banyak mendapatkan keuntungan di sini, sedangkan agen yang membaca konteks stabil yang besar dan mengembalikan putusan singkat memiliki banyak keuntungan.

Spesifikasi lengkap, termasuk jendela konteks 1.000.000 token dan output maksimum 128.000 token, ada di apa itu Claude Opus 5.5.

Titik impas adalah 1,26 panggilan, bukan dua

Ambil awalan tepat satu juta token dan N panggilan yang membaginya, satu penulisan dan N minus satu pembacaan.

tanpa cache: N * $4,00
dengan cache: $5,00 + (N - 1) * $0,20

4,00N = 5,00 + 0,20(N - 1)
3,80N = 4,80
N     = 1,26

Anda membutuhkan 1,26 panggilan untuk membayar kembali premi penulisan. Karena panggilan datang dalam bilangan bulat, itu berarti: jika awalan pernah dibaca kembali bahkan sekali, meng-cache-nya adalah tindakan yang benar. Dua panggilan sudah membuat Anda 35% lebih maju.

Panggilan yang berbagi satu penulisan Biaya tanpa cache per 1 juta awalan Biaya dengan cache Penghematan
1 $4,00 $5,00 25% lebih buruk
2 $8,00 $5,20 35%
5 $20,00 $5,80 71%
10 $40,00 $6,80 83%
100 $400,00 $24,80 94%

Tabel itu mengasumsikan satu penulisan dan penggunaan ulang yang sempurna setelahnya. Sistem nyata lebih rumit, di sinilah perhitungan kedua masuk.

Dalam kondisi stabil, satu-satunya angka yang penting adalah tingkat hit

Sepanjang hari lalu lintas, Anda tidak hanya menulis sekali. Cache kedaluwarsa, awalan diedit, penyewa baru tiba. Biarkan h menjadi bagian dari token awalan Anda yang dilayani dari cache. Sebuah miss ditagih sebagai penulisan, sebuah hit ditagih sebagai pembacaan:

biaya efektif per 1 juta token awalan = $5,00 * (1 - h) + $0,20 * h
                                     = $5,00 - $4,80h

impas terhadap $4,00 tanpa cache:  h = 1,00 / 4,80 = 20,8%

Dua puluh satu persen adalah angka yang harus diingat. Jika kurang dari seperlima token awalan Anda dilayani dari cache, mengaktifkan caching akan membuat tagihan Anda lebih buruk.

Tingkat hit cache Biaya efektif per 1 juta awalan Dibanding $4,00 tanpa cache
0% $5,00 25% lebih buruk
20,8% $4,00 impas
50% $2,60 35% lebih murah
75% $1,40 65% lebih murah
90% $0,68 83% lebih murah
95% $0,44 89% lebih murah
99% $0,25 94% lebih murah
100% $0,20 95% lebih murah

Kedua tabel adalah persamaan yang sama dilihat dari sisi yang berbeda, karena satu penulisan per N panggilan adalah tingkat hit (N-1)/N. Sepuluh panggilan per penulisan adalah tingkat hit 90% dan kedua tabel menunjukkan 83%.

Tiga bentuk permintaan, dijabarkan

Bentuk 1: agen frekuensi tinggi, awalan kecil

Agen triase dukungan dengan awalan 40.000 token, giliran pengguna variabel 800 token, output 600 token, 10.000 panggilan sehari. Asumsikan penulisan pada 3% panggilan, jadi tingkat hit 97%.

Tanpa cache Dengan cache
Awalan, 400 juta token/hari $1.600,00 $137,60
Giliran variabel, 8 juta token/hari $32,00 $32,00
Total input per hari $1.632,00 $169,60

Itu adalah diskon 89,6% dari jalur input, sekitar $1.462 sehari, atau $43.800 sebulan. Output tetap $120 sehari dalam kedua kasus. Perhatikan awalan hanya 40.000 token. Caching menguntungkan di sini karena frekuensi, bukan ukuran.

Bentuk 2: satu kali proses pada konteks 1 juta

Satu juta token masuk, satu jawaban keluar, tidak pernah digunakan kembali. Tanpa cache, panggilan itu berharga $4,00 input. Dengan cache berharga $5,00, karena Anda membayar untuk menulis awalan yang tidak dibaca siapa pun. Jalankan 500 dokumen sehari melalui pola itu dan caching akan merugikan Anda $500 ekstra sehari tanpa hasil.

Ini adalah bentuk yang paling sering salah dipahami orang, karena konteksnya sangat besar dan nalurinya adalah konteks yang sangat besar jelas membutuhkan caching. Ukuran tidak relevan. Penggunaan kembali adalah satu-satunya variabel.

Bentuk 3: sesi agen panjang pada jendela 1 juta

Sekarang ambil konteks satu juta token yang sama dan minta agen membacanya kembali melalui 200 giliran, yang persis seperti yang terlihat pada loop tugas 18 jam.

Biaya
Tanpa cache, 200 x $4,00 $800,00
Dengan cache, 1 penulisan + 199 pembacaan $44,80
Dengan cache, 5 penulisan + 195 pembacaan $64,00

Bahkan jika cache menjadi dingin empat kali di tengah sesi dan Anda membayar lima penulisan penuh, Anda masih 92% di bawah tagihan tanpa cache. Sesi panjang adalah tempat tarif $0,20 mendapatkan reputasinya.

Kesalahan mahal: menyimpan bagian yang berubah ke dalam cache

Pertimbangkan 5.000 dokumen masing-masing 60.000 token, diringkas satu per satu di balik header instruksi bersama 6.000 token.

Strategi Biaya input
Tidak ada caching sama sekali $1.320
Cache seluruh permintaan, termasuk setiap dokumen $1.650
Hanya cache header 6.000 token $1.206

Mencaching batas yang salah adalah 25% lebih buruk daripada tidak mencaching. Mencaching yang benar adalah 9% lebih baik. Fitur yang sama, tarif yang sama, selisih $444 yang sepenuhnya ditentukan oleh di mana awalan cache berakhir.

Aturan yang muncul dari sini: cache rangkaian byte terdepan terpanjang yang identik di seluruh panggilan, dan tidak satu byte pun lebih. Jika stempel waktu, ID permintaan, atau dokumen per permintaan berada di dalam awalan cache Anda, tingkat hit Anda akan anjlok menjadi nol dan setiap panggilan akan ditagih $5,00 alih-alih $4,00. Mekanisme umum pencocokan awalan dibahas dalam primer caching prompt kami.

95% adalah asimtot, bukan diskon yang Anda terima

Angka utama adalah bahwa pembacaan dari cache berharga 5% dari input baru. Anda tidak akan pernah benar-benar membayar 5%, karena Anda selalu membayar setidaknya satu penulisan. Pada 100 panggilan per penulisan, Anda berada di 94%. Pada 10 panggilan per penulisan, Anda berada di 83%. Pada 2 panggilan, Anda berada di 35%.

Anggarkan dari tabel tingkat hit, bukan dari judul utama. Tim keuangan yang memodelkan penghematan 95% dan mengamati 83% akan menyimpulkan fitur tersebut rusak padahal berfungsi persis seperti yang dihargai.

Apa yang tidak diberitahukan oleh materi peluncuran kepada Anda

Tiga input untuk aritmetika ini tidak ada dalam materi peluncuran Anthropic Opus 5.5, dan menebaknya akan menjadi cara tercepat untuk salah anggaran:

Periksa ketiga hal ini di halaman harga vendor sebelum berkomitmen pada suatu angka. Tarif dalam artikel ini dipublikasikan. Ketiga hal ini tidak.

Uji bahwa cache benar-benar mengenai

Mode kegagalan ini tidak bersuara. Tidak ada yang mengeluarkan kesalahan ketika awalan menjadi dingin. Seseorang menambahkan ID debug ke pesan sistem, tingkat hit turun dari 97% menjadi 0, dan satu-satunya sinyal adalah baris pada faktur tiga minggu kemudian.

API Pesan melaporkan pemisahan pada setiap respons:

"usage": {
  "input_tokens": 812,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 40960,
  "output_tokens": 604
}

Pada panggilan pertama `cache_creation_input_tokens` membawa awalan. Pada setiap panggilan setelahnya, bidang itu harus 0 dan `cache_read_input_tokens` harus membawa beban yang sama. Simpan permintaan sekali di Apidog, tembak dua kali, dan perhatikan bidang mana yang bergerak.

Kemudian ubah pengamatan itu menjadi sebuah pernyataan agar tidak regresi secara diam-diam. Skenario uji Apidog yang mengirim permintaan dua kali dan menegaskan `cache_read_input_tokens > 40000` pada respons kedua akan gagal di CI saat rekan tim membuat awalan tidak deterministik. Itu adalah uji satu baris yang berdiri di antara Anda dan peningkatan tagihan awalan 25x, dan itu adalah hal dengan pengembalian tertinggi di artikel ini.

Di mana GPT-6 berada pada perhitungan yang sama

GPT-6 Sol mencantumkan input seharga $2,00 per juta dengan diskon 90% untuk pembacaan dari cache, yang menempatkan pembacaan dari cache seharga $0,20 per juta, angka yang sama dengan Opus 5.5. GPT-6 Luna dengan $0,10 per juta input menghasilkan $0,01 per juta dari cache.

Perbedaannya adalah apa yang bisa kita hitung. Materi peluncuran OpenAI tidak menyatakan tingkat penulisan cache, jadi tingkat penggunaan ulang titik impas untuk GPT-6 tidak dapat diturunkan seperti halnya untuk Opus 5.5. Publikasi harga penulisan $5,00 yang eksplisit oleh Anthropiclah yang membuat angka 21% dapat dihitung sama sekali. Sisa rilis caching OpenAI, termasuk perubahan upaya yang mempertahankan cache dan alat diagnostik baru, ada di ulasan caching prompt GPT-6 kami.

Intinya

Caching prompt pada Claude Opus 5.5 adalah satu pertanyaan aritmetika: apakah lebih dari seperlima token awalan Anda akan kembali hangat? Jika ya, aktifkan dan harapkan diskon 83% hingga 94% dari jalur input daripada 95% yang diiklankan. Jika beban kerja Anda adalah proses sekali jalan pada dokumen unik, biarkan nonaktif dan hemat premi penulisan $1,00 per juta. Dan apa pun yang Anda pilih, pastikan `cache_read_input_tokens` di CI, karena regresi cache tidak pernah mengumumkan dirinya.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.