Claude Opus 5 diluncurkan pada 24 Juli 2026 dengan harga $5 per juta token input dan $25 per juta token output. Ini adalah tarif yang sama dengan yang dikenakan Anthropic untuk Opus 4.8, dan tepat setengah dari biaya Fable 5. Liputan peluncuran semuanya menampilkan berita utama tersebut, dan itu akurat sejauh ini.
Yang dilewatkan oleh liputan tersebut adalah bagian yang menentukan faktur Anda: penulisan cache, hit cache, tarif batch, mode cepat, pengganda regional, dan perubahan perilaku yang secara diam-diam menggeser jumlah token. Panduan ini memberi Anda tabel harga lengkap, lalu menghitung biaya berdasarkan bentuk permintaan nyata sehingga Anda dapat memperkirakan anggaran sebelum Anda mengirimkan. Untuk memeriksa angka-angka tersebut terhadap lalu lintas Anda sendiri, kirim permintaan dari Apidog dan baca blok usage pada setiap respons.
Tabel harga lengkap Claude Opus 5
Setiap tarif di bawah ini berasal dari dokumentasi harga Anthropic dan berlaku untuk ID model claude-opus-5.
| Kategori Token | Harga per Juta Token |
|---|---|
| Input (standar) | $5.00 |
| Output (standar) | $25.00 |
| Penulisan cache prompt, TTL 5 menit | $6.25 |
| Penulisan cache prompt, TTL 1 jam | $10.00 |
| Hit cache dan penyegaran | $0.50 |
| Input API Batch | $2.50 |
| Output API Batch | $12.50 |
| Input mode cepat | $10.00 |
| Output mode cepat | $50.00 |
Beberapa hal yang perlu diperhatikan:
- Hit cache berharga sepersepuluh dari input standar. Ini adalah pengungkit terbesar dalam tabel.
- Penulisan cache 5 menit membawa premi 1.25x dibandingkan input standar; penulisan 1 jam membawa 2x.
- Batch mendapatkan diskon rata 50% untuk input dan output.
- Mode cepat persis 2x harga standar untuk kecepatan output 2.5x. Ini adalah pratinjau riset, hanya API pihak pertama (bukan Bedrock, Google Cloud, atau Microsoft Foundry), dan tidak dapat digabungkan dengan API Batch.
- Tidak ada premium konteks panjang. Jendela konteks 1 juta token adalah default dan maksimum, dan token melewati ambang batas mana pun ditagih dengan $5 yang sama. Beberapa model pesaing mengenakan biaya lebih banyak setelah Anda melewati tingkat konteks. Opus 5 tidak.

Poin terakhir itu menempatkan batas atas yang ketat pada satu permintaan. Panggilan Messages API yang paling mahal adalah 1 juta token input ditambah maksimum 128 ribu output: $5.00 + $3.20, atau $8.20. Pada API Batch, di mana output maksimum naik menjadi 300 ribu dengan header beta output-300k-2026-03-24, sisi output dibatasi pada $3.75.
Jangkar: sama dengan 4.8, setengah dari Fable 5
Berikut adalah posisi Opus 5 dibandingkan dengan model yang kemungkinan besar Anda bandingkan dengannya.
| Model | Input / Juta Token | Output / Juta Token |
|---|---|---|
| Claude Opus 5 | $5.00 | $25.00 |
| Claude Opus 4.8 | $5.00 | $25.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| Claude Sonnet 5 (perkenalan, hingga 31 Agustus 2026) | $2.00 | $10.00 |
| Claude Sonnet 5 (mulai 1 September 2026) | $3.00 | $15.00 |
Dua pembacaan tabel ini penting.
Pertama, pembaruan dari Opus 4.8 tidak dikenakan biaya per token. Tarifnya identik, dan telah sama di seluruh versi 4.5, 4.6, 4.7, dan 4.8. Pergantian ID model tidak memengaruhi ekonomi unit Anda. Yang berubah adalah volume token Anda, yang akan kita bahas di bawah. Rincian harga Opus 4.8 masih berlaku untuk apa pun dengan ID lama.
Kedua, Opus 5 adalah setengah dari Fable 5. Angka peluncuran Anthropic mengklaim Opus 5 mencapai dalam 0.5% dari puncak Fable 5 di CursorBench 3.2 dan melampauinya di OSWorld 2.0 dengan sekitar sepertiga biaya per tugas. Itu adalah angka yang dijalankan vendor dari postingan peluncuran Opus 5, dan belum ada yang mereproduksi secara independen pada 25 Juli 2026. Anggap itu sebagai klaim, bukan hasil yang pasti. Perbandingan Opus 5 vs Fable 5 membahas di mana perbedaan harga itu sepadan, dan halaman harga Fable 5 memiliki detail tingkat yang lebih tinggi.
Contoh kerja 1: satu permintaan
Dimulai dengan bentuk paling sederhana. Panggilan ringkasan dengan 8,000 token input dan 1,200 token output.
- Input: 8,000 / 1,000,000 x $5.00 = $0.040
- Output: 1,200 / 1,000,000 x $25.00 = $0.030
- Total: $0.070 per panggilan
Dengan 10,000 panggilan per bulan, itu adalah $700. Beban kerja yang sama pada Fable 5 berharga $0.140 per panggilan, atau $1,400 per bulan. Pada Sonnet 5 dengan tarif perkenalan berharga $0.028 per panggilan, atau $280.
Perhatikan bahwa output adalah 43% dari tagihan pada permintaan dengan input hampir tujuh kali lebih banyak daripada output. Output berharga lima kali lipat dari biaya input, sehingga volume output mendominasi lebih cepat dari yang kebanyakan orang harapkan. Itu lebih penting pada Opus 5 daripada 4.8, karena token "berpikir" ditagih sebagai output dan pemikiran adaptif sekarang aktif secara default.
Contoh kerja 2: sesi agenik panjang dengan caching
Di sinilah uang sebenarnya, dan penghematan sebenarnya. Ambil agen pengkodean dengan prompt sistem 120,000 token ditambah konteks repo, menjalankan sesi 40 giliran. Setiap giliran menambahkan 1,500 token percakapan baru dan menghasilkan 2,500 token output.
Tanpa caching prompt, Anda mengirim ulang konteks penuh setiap giliran:
| Item baris | Token | Tarif | Biaya |
|---|---|---|---|
| Input (120,000 x 40, ditambah 60,000 baru) | 4,860,000 | $5.00 | $24.30 |
| Output (2,500 x 40) | 100,000 | $25.00 | $2.50 |
| Total | $26.80 |
Dengan cache prompt 5 menit pada awalan 120,000 token:
| Item baris | Token | Tarif | Biaya |
|---|---|---|---|
| Penulisan cache, sekali | 120,000 | $6.25 | $0.75 |
| Pembacaan cache (39 giliran) | 4,680,000 | $0.50 | $2.34 |
| Input baru (1,500 x 40) | 60,000 | $5.00 | $0.30 |
| Output (2,500 x 40) | 100,000 | $25.00 | $2.50 |
| Total | $5.89 |
Itu adalah pengurangan 78%, dan output sekarang 42% dari tagihan alih-alih 9%. Setelah Anda melakukan caching dengan benar, output adalah hal berikutnya yang Anda optimalkan.
Satu peringatan tentang TTL 5 menit: pembacaan cache menyegarkannya, jadi sesi dengan giliran kurang dari lima menit terpisah tetap aktif dengan satu penulisan. Jika agen Anda menganggur lebih lama dari itu, gunakan penulisan 1 jam dengan biaya $10 per juta. Di sini, itu meningkatkan penulisan dari $0.75 menjadi $1.20 dan total menjadi $6.34, masih 76% di bawah eksekusi tanpa cache.
Contoh kerja 3: pemrosesan batch
Untuk apa pun yang tidak memerlukan respons sinkron, API Batch memberikan diskon rata 50%. Ambil 50,000 dokumen dengan masing-masing 1,200 token input dan 150 token output.
| Jalur | Biaya input | Biaya output | Total |
|---|---|---|---|
| Standar | 60 Juta Token x $5.00 = $300.00 | 7.5 Juta Token x $25.00 = $187.50 | $487.50 |
| Batch | 60 Juta Token x $2.50 = $150.00 | 7.5 Juta Token x $12.50 = $93.75 | $243.75 |
Token yang sama, model yang sama, $243.75 dihemat. Imbalannya adalah latensi, bukan kualitas. Jika pekerjaan klasifikasi, pengayaan, atau evaluasi Anda mentolerir pengiriman asinkron, menjalankannya pada titik akhir standar akan menyisakan setengah anggaran yang belum terpakai.
Contoh kerja 4: berapa sebenarnya biaya mode cepat
Mode cepat menggandakan tarif menjadi $10 / $50 untuk kecepatan output sekitar 2.5x. Jalankan permintaan contoh 1 melaluinya dan Anda mendapatkan $0.080 input ditambah $0.060 output, atau $0.140 per panggilan, tepat dua kali lipat.
Harga tersebut menempatkan Opus 5 identik dengan tarif standar Fable 5: Anda membayar harga tingkat terdepan untuk latensi, bukan kemampuan. Layak untuk antarmuka interaktif di mana pengguna melihat token muncul, sulit dibenarkan untuk pekerjaan latar belakang. Ini tidak dapat digabungkan dengan API Batch, jadi kedua pengungkit biaya ini saling eksklusif berdasarkan desain.
Empat pengungkit yang benar-benar menggerakkan tagihan Anda
Keempat hal ini spesifik untuk Opus 5, dan spesifik tentang seberapa banyak yang mereka hemat.
1. Minimum cache prompt turun menjadi 512 token
Pada Opus 4.8, minimum yang dapat di-cache adalah 1,024 token. Pada Opus 5, kini menjadi 512. Prompt yang sebelumnya terlalu pendek untuk di-cache kini dapat di-cache tanpa perubahan kode selain menambahkan blok kontrol cache.
Perhitungan titik impas lebih baik daripada yang kebanyakan orang asumsikan. Penulisan cache berharga 1.25x input standar, pembacaan berharga 0.1x. Mencari titik di mana caching menguntungkan:
- TTL 5 menit: mencapai titik impas pada 1.3 permintaan. Anda untung mulai dari panggilan kedua dan seterusnya.
- TTL 1 jam: mencapai titik impas pada 2.1 permintaan. Anda untung mulai dari panggilan ketiga dan seterusnya.
Secara konkret, prompt sistem 700 token yang digunakan kembali di 1,000 panggilan dalam sekali ledakan berharga $3.50 tanpa cache. Dengan cache, biaya penulisan $0.0044 ditambah 999 pembacaan seharga $0.00035, atau total $0.354. Prompt tersebut sama sekali tidak dapat di-cache pada Opus 4.8.
2. Batch dengan diskon 50%
Telah dibahas di atas, tetapi layak diulang sebagai pengungkit: audit beban kerja mana yang benar-benar membutuhkan respons sinkron. Eksekusi evaluasi, pengisian ulang data, ringkasan malam hari, dan klasifikasi konten biasanya tidak.
3. Tingkat upaya (effort) low dan medium akhirnya dapat digunakan
output_config.effort mengontrol seberapa banyak model berpikir, dan token "berpikir" ditagih sebagai output dengan $25 per juta. Opus 5 mengkalibrasi ulang tingkat upaya, dan Anthropic menyatakan bahwa low dan medium secara signifikan lebih kuat daripada model Opus sebelumnya. Default-nya adalah high; xhigh tetap menjadi rekomendasi awal untuk pekerjaan pengkodean dan agenik.
Penghematan berskala langsung dengan volume token "berpikir". Jika suatu tugas rata-rata 8,000 token "berpikir" pada xhigh dan 1,500 pada low, Anda menghemat 6,500 token output, atau $0.1625 per tugas, yang berarti $16,250 untuk 100,000 tugas. Angka-angka tersebut bersifat ilustratif: perbedaan sebenarnya tergantung pada prompt Anda, itulah sebabnya Anthropic menyarankan Anda untuk menjalankan evaluasi upaya baru terhadap evaluasi Anda sendiri daripada mempertahankan pengaturan 4.8. Panduan parameter upaya mencakup evaluasi tersebut.
Satu jebakan: menurunkan upaya mengurangi token "berpikir", bukan panjang respons yang terlihat. Respons default dan hasil tertulis Opus 5 berjalan lebih panjang dari Opus 4.8, dan upaya tidak akan memperbaikinya. Jika Anda menginginkan jawaban yang lebih pendek, mintalah jawaban yang lebih pendek.
4. Overhead prompt sistem penggunaan alat yang lebih rendah
Saat Anda mengirim definisi alat, API menyuntikkan prompt sistem yang Anda bayar. Pada Opus 5, overhead tersebut adalah 286 token untuk pilihan alat auto atau none, turun dari 290 pada Opus 4.8 dan 675 pada Opus 4.7.
Jujurlah tentang ukuran ini. Dibandingkan 4.8, perbedaan empat token adalah $20 untuk satu juta permintaan: tidak signifikan. Dibandingkan 4.7, perbedaan 389 token adalah $0.001945 per permintaan, atau $1,945 per juta permintaan. Jika Anda masih menggunakan 4.7, itu adalah uang sungguhan; pada 4.8, itu adalah kesalahan pembulatan.
Untuk pengungkit yang berlaku di seluruh jajaran Claude, panduan kami tentang memangkas tagihan API Claude Anda membahas lebih luas.
Dua item baris yang sering terlewatkan
Pengganda inference_geo: "us" adalah 1.1x. Sematkan inferensi ke infrastruktur khusus AS untuk kepatuhan atau residensi data dan setiap kategori token akan dikalikan 1.1: input $5.50, output $27.50, hit cache $0.55, batch $2.75 / $13.75. Beban kerja contoh 1 berubah dari $700 per bulan menjadi $770. Pada tagihan $50,000 itu adalah item baris $5,000, jadi pastikan Anda memerlukan penyematan sebelum mengaturnya.
Priority Tier tidak didukung di Opus 5. Opus 4.8 masih mendukungnya. Jika perencanaan kapasitas Anda bergantung pada komitmen Priority Tier, itu adalah batasan nyata untuk beralih. Panduan migrasi Opus 4.8 ke Opus 5 mencakup hal ini bersamaan dengan perubahan API yang mengganggu.
Perubahan perilaku yang muncul di faktur Anda
Tarif per token adalah setengah dari tagihan. Volume token adalah setengah lainnya, dan tiga perubahan perilaku Opus 5 meningkatkan volume jika Anda tidak melakukan apa-apa.
- Berpikir (thinking) aktif secara default. Pada Opus 4.8, permintaan tanpa bidang
thinkingberjalan tanpa berpikir. Pada Opus 5, permintaan yang sama menjalankan pemikiran adaptif, dan token tersebut ditagih sebagai output. Karenamax_tokensmembatasi pemikiran ditambah respons secara bersamaan, beberapa beban kerja tersebut juga akan mulai terpotong. - Opus 5 lebih mudah mendelegasikan kepada subagen. Setiap subagen memiliki set token yang ditagih sendiri. Batasi atau cakup delegasi pada beban kerja yang sensitif biaya.
- Opus 5 memverifikasi pekerjaannya sendiri tanpa diminta. Jika Anda membawa instruksi "periksa kembali pekerjaan Anda", panduan prompt Anthropic mengatakan untuk menghapusnya. Verifikasi berlebihan adalah token.
Tidak satu pun dari ini yang mengubah harga per token. Semuanya mengubah apa yang Anda bayar.
Memastikan pengeluaran riil Anda dengan Apidog
Cara tercepat untuk berhenti menebak adalah dengan membaca objek usage pada setiap respons. Ini melaporkan input_tokens, output_tokens, cache_creation_input_tokens, dan cache_read_input_tokens secara terpisah, yang merupakan rincian persis yang Anda butuhkan untuk memeriksa perhitungan di atas terhadap lalu lintas Anda sendiri.

Apidog adalah platform pengembangan dan pengujian API, jadi ia menanganinya dengan baik. Arahkan permintaan ke titik akhir Messages dengan "model": "claude-opus-5", lalu:
- Duplikasikan permintaan yang disimpan sekali per tingkat upaya dan bandingkan volume token "berpikir" secara berdampingan pada prompt yang identik.
- Tegaskan bahwa
usage.cache_read_input_tokenslebih besar dari nol, sehingga cache yang rusak secara diam-diam muncul sebagai tes yang gagal alih-alih faktur kejutan. - Simpan kunci sebagai variabel lingkungan daripada di badan permintaan, sehingga kunci pengembang tidak pernah menjalankan batch berukuran produksi.
- Pantau aliran SSE untuk melihat ke mana perginya token output pada generasi panjang.
Unduh Apidog untuk menjalankan pemeriksaan ini bersama dengan panduan langkah demi langkah di panduan API Opus 5 kami.
Apa yang sebenarnya Anda beli dengan harga $5 / $25
Opus 5 berada pada posisi harga-per-kemampuan yang kuat, dan itu bukan yang teratas dari tumpukan Claude. Fable 5 tetap menjadi model Anthropic yang paling mumpuni yang dirilis secara luas, dan Opus 5 masih tertinggal dari Mythos 5 dalam eksploitasi keamanan siber dan penelitian biologi otonom. Anthropic menyatakan keduanya dengan jelas. Pembingkaian jujurnya adalah kemampuan kelas terdepan dengan setengah harga terdepan, dengan batas atas yang disebutkan di atasnya. Penjelasan kelas Mythos kami mencakup apa yang berada di atas batas itu.
Bagi kebanyakan tim, pertanyaan sebenarnya bukanlah Opus 5 versus batas atas. Pertanyaannya adalah apakah beban kerja itu membutuhkan Opus sama sekali, atau apakah Sonnet 5 dengan harga $2 / $10 (naik menjadi $3 / $15 pada 1 September 2026) dapat melakukan pekerjaan tersebut dengan 40% dari harga. Jalankan keduanya terhadap evaluasi Anda sendiri sebelum mengalokasikan anggaran. Spesifikasi lengkap dan ketersediaan ada di ikhtisar Claude Opus 5 kami; ikhtisar model Anthropic memiliki tabel kanonis.
FAQ
Berapa biaya Claude Opus 5? $5 per juta token input dan $25 per juta token output pada API standar. Hit cache berharga $0.50, batch berjalan pada $2.50 / $12.50, dan mode cepat pada $10 / $50.
Apakah Claude Opus 5 lebih mahal dari Opus 4.8? Per token, tidak: tarifnya identik. Tagihan Anda masih bisa naik, karena "berpikir" aktif secara default dan respons default berjalan lebih panjang. Ukur volume token daripada mengasumsikan paritas.
Apakah ada biaya tambahan konteks panjang pada jendela 1 juta? Tidak. Jendela konteks 1 juta token adalah default dan maksimum, dan tidak ada tingkat premium untuk input panjang.
Apa cara termurah untuk menjalankan Claude Opus 5? Lakukan caching secara agresif (minimum 512 token berarti hampir semua awalan yang digunakan kembali memenuhi syarat), jalankan pekerjaan yang tidak mendesak melalui API Batch untuk diskon rata 50%, dan uji tingkat upaya untuk yang terendah yang lolos evaluasi Anda. Panduan jalur gratis dan termurah memiliki lebih banyak informasi.
Apakah penyematan regional dikenakan biaya tambahan? Ya. Mengatur inference_geo: "us" menerapkan pengganda 1.1x untuk setiap kategori token, termasuk hit cache dan batch.
