Claude Sonnet 5.5 berharga $2 per juta token input dan $10 per juta token output pada Claude API, sama seperti Sonnet 5. Pembacaan cache berharga $0.20 per juta, Batch API membagi dua kedua tarif menjadi $1 dan $5, jendela konteks 1M penuh ditagih dengan tarif standar, dan mode cepat tidak ditawarkan. Kenaikan harga Sonnet 5 yang direncanakan pada 1 September menjadi $3/$15 telah dibatalkan, jadi $2/$10 sekarang adalah harga standar.
Panduan ini mencantumkan setiap item biaya harga Claude Sonnet 5.5, membahas tiga contoh biaya dengan perhitungan yang ditunjukkan, dan menjelaskan mengapa tingkat upaya lebih memengaruhi tagihan Anda daripada tarif per-token. Baru mengenal model ini? Mulai dengan apa itu Claude Sonnet 5.5, atau baca cara menggunakan Claude Sonnet 5.5 secara gratis. Untuk memeriksa angka-angka terhadap lalu lintas Anda sendiri, kirim permintaan dari Apidog dan baca blok usage pada setiap respons.
Tabel Harga API Claude Sonnet 5.5
Harga per juta token (MTok), dari dokumen harga Anthropic:
| Item Baris | Harga per MTok |
|---|---|
| Input | $2.00 |
| Penulisan cache 5 menit | $2.50 |
| Penulisan cache 1 jam | $4.00 |
| Pembacaan cache | $0.20 |
| Output | $10.00 |
| Input Batch | $1.00 |
| Output Batch | $5.00 |
Tiga detail mengubah apa yang Anda bayar:
- Inferensi khusus AS.
inference_geo: "us"berharga 1.1x pada setiap kategori token di Claude API dan Claude Platform di AWS (input $2.20, output $11, pembacaan cache $0.22). Deployment Zona Data AS Foundry memiliki 1.1x yang sama; Bedrock dan Google Cloud mematok harga secara terpisah. - Tidak ada premi konteks panjang. Permintaan 900k-token berharga sama per token dengan permintaan 9k-token.
- Tokenizer yang sama dengan Sonnet 5. Jumlah token Anda diteruskan tanpa perubahan.
Perbandingan Sonnet 5.5 pada Harga Daftar
| Model | Input | Output | Catatan |
|---|---|---|---|
| Claude Sonnet 5.5 | $2 | $10 | Pembacaan cache $0.20; konteks 1M; tanpa mode cepat |
| Claude Sonnet 5 | $2 | $10 | Pembacaan cache $0.20; kenaikan $3/$15 dibatalkan |
| Claude Opus 5.5 | $4 | $20 | Pembacaan cache $0.20; mode cepat $8/$40 |
| Claude Haiku 4.5 | $1 | $5 | konteks 200k |
| GPT-6 Sol | $2 | $10 | Diskon 90% untuk input cache; konteks 872k |
| GPT-6 Luna | $0.10 | $0.50 | konteks 1M |
Sonnet 5.5 berharga setengah dari Opus 5.5 pada input, output, dan penulisan cache. Ia berbagi harga daftar $2/$10 yang persis sama dengan GPT-6 Sol, jadi pilihan antara keduanya bergantung pada hasil per tugas. Untuk latar belakang, lihat harga Claude Sonnet 5, perang harga September 2026, dan harga GPT-6 Sol.
Contoh Kasus: berapa biaya permintaan nyata
Rumus untuk setiap baris: token ÷ 1.000.000 × harga per MTok. Harga setiap item baris, lalu tambahkan.
Contoh 1: satu permintaan gaya obrolan
3.000 token input, 800 token output, tanpa caching.
- Input: 3.000 ÷ 1.000.000 × $2 = $0.006
- Output: 800 ÷ 1.000.000 × $10 = $0.008
- Total: $0.006 + $0.008 = $0.014
Seribu permintaan tersebut berharga $14. Output adalah 21% dari token tetapi 57% dari tagihan, jadi panjang output lebih penting daripada panjang prompt.
Contoh 2: agen membaca ulang awalan 50.000-token
Sebuah loop agen mengirimkan awalan 50.000-token yang sama (prompt sistem, alat, konteks repo) dalam 20 panggilan. Hanya awalan yang diperhitungkan biayanya di sini.
Tanpa cache: 20 × 50.000 = 1.000.000 token; 1.000.000 ÷ 1.000.000 × $2 = $2.00
Dengan cache, dengan penulisan 5 menit:
- Panggilan 1 menulis cache: 50.000 ÷ 1.000.000 × $2.50 = $0.125
- Panggilan 2 hingga 20 membacanya: 19 × 50.000 = 950.000 token; 950.000 ÷ 1.000.000 × $0.20 = $0.19
- Total: $0.125 + $0.19 = $0.315
Itu menghemat $1.685, sekitar 84%. Penulisan 5 menit hanya terbayar selama panggilan berada dalam jendela waktu tersebut; untuk loop yang lebih lambat, penulisan 1 jam berharga 50.000 ÷ 1.000.000 × $4 = $0.20, sehingga totalnya adalah $0.20 + $0.19 = $0.39, masih sekitar 80% di bawah yang tidak di-cache. Penalaran yang sama diterapkan untuk Opus dalam perhitungan biaya caching prompt kami; tarif pembacaan $0.20 identik.
Contoh 3: pekerjaan batch 10.000 permintaan
Bentuk yang sama dengan Contoh 1, dikirim melalui Batch API.
- Input: 10.000 × 3.000 = 30.000.000 token; 30 × $1 = $30
- Output: 10.000 × 800 = 8.000.000 token; 8 × $5 = $40
- Total Batch: $70, dibandingkan 30 × $2 + 8 × $10 = $140 dengan tarif standar
Batch juga meningkatkan batas output dari 128K menjadi 300K token dengan beta `output-300k-2026-03-24`.
Biaya per tugas, bukan per token
Kartu tarif memberi tahu Anda berapa biaya satu token, bukan berapa banyak token yang digunakan tugas Anda. Angka kedua itu berfluktuasi jauh lebih banyak dengan upaya daripada selisih tarif antar model mana pun.
Anthropic mengatakan bahwa dalam pengujiannya, Sonnet 5.5 “berharga hingga 30% lebih murah per tugas daripada pendahulunya.” Posting peluncuran juga memplot biaya di setiap tingkat upaya. Uji coba Terminal-Bench 4.0 adalah milik Anthropic, FrontierCode dijalankan oleh Cognition, dan biaya indeks berasal dari Artificial Analysis:
| Upaya | Terminal-Bench 4.0 (skor, $/percobaan) | FrontierCode v1.1 (skor, $/tugas) | Indeks AA (skor, biaya untuk menjalankan) |
|---|---|---|---|
| rendah | 20.0%, $0.76 | 29.3%, $0.19 | 35.8, $544 |
| sedang | 28.8%, $0.83 | 36.5%, $0.24 | 40.7, $701 |
| tinggi | 43.0%, $1.94 | 49.4%, $0.42 | 46.7, $1,176 |
| x-tinggi | 61.5%, $5.30 | 52.1%, $1.59 | 51.9, $2,738 |
| maks | 70.6%, $12.54 | 46.2%, $20.78 | 56.0, $8,977 |
Apa yang menonjol:
- Maksimum berharga sekitar 6.5x lebih tinggi pada Terminal-Bench ($12.54 ÷ $1.94 = 6.46). Biaya indeks Artificial Analysis sekitar 16.5x lebih mahal untuk dijalankan pada maksimum daripada pada rendah ($8,977 ÷ $544).
- Lebih banyak upaya tidak selalu lebih baik. FrontierCode turun dari 52.1% pada x-tinggi menjadi 46.2% pada maksimum sementara biaya per tugas naik 13x ($20.78 ÷ $1.59). Catatan kaki Anthropic mengatakan bahwa pada maksimum model lebih sering menjalankan keterampilan ulasan yang menyebar ke sub-agen, yang menyebabkan batas waktu habis atau pengeditan di luar cakupan dalam kasus yang diperiksa Cognition.
- Opus dengan upaya lebih rendah bersaing. Opus 5.5 pada tingkat sedang mencetak 57.6% pada Terminal-Bench dengan biaya $2.94, dibandingkan dengan Sonnet 5.5 yang mencetak 43.0% pada tingkat tinggi dengan biaya $1.94. Perbandingan Sonnet 5.5 vs Opus 5.5 kami membahas pertukaran tersebut.
Kevokalitas pada maksimum adalah jebakan lainnya. Tulisan OfficeChai tentang data Artificial Analysis menempatkan Sonnet 5.5 sekitar 193.000 token output per tugas indeks pada maksimum, dengan biaya per tugas sekitar 50% di atas Sonnet 5. Simon Willison melaporkan di Hacker News bahwa upaya maksimum membakar 128.000 token berpikir dan kehabisan sebelum menghasilkan jawaban.
Enam Pengungkit yang Mengurangi Tagihan
- Tetapkan upaya dengan tujuan. API secara default ke `high`; Claude Code dan aplikasi Claude secara default ke `medium`. Panduan prompt Anthropic menyarankan `medium` atau `low` untuk obrolan dan `xhigh` atau `max` hanya untuk peningkatan kualitas yang terukur. Jangan membawa pengaturan Sonnet 5; skalanya telah dikalibrasi ulang.
- Gunakan `between_tools` di mana Anda sebelumnya mematikan pemikiran. `thinking: {"type": "disabled"}` sekarang mengembalikan 400; `{"type": "between_tools"}` menggantikannya pada `low`, `medium`, dan `high`.
- Cache apa pun yang digunakan kembali. Prompt minimal yang dapat di-cache adalah 512 token (1.024 pada Sonnet 5). Mengubah `effort` tingkat atas antar permintaan akan membatalkan cache, jadi pertahankan agar tetap stabil.
- Batch apa yang bisa menunggu. Setengah harga untuk input dan output.
- Jaga `max_tokens` tetap jujur. Panduan Anthropic memperlakukan `stop_reason: "max_tokens"` sebagai respons yang gagal, jadi jawaban yang terpotong berarti pengeluaran tanpa hasil yang dikirimkan.
- Pangkas pekerjaan yang tidak diminta. Sonnet 5.5 menambahkan tes, dokumen, dan file yang tidak Anda minta, dan memulai putaran ulasan tambahan pada `xhigh` dan `max`. Paragraf prompt sistem yang disarankan Anthropic memotong biaya sesi sekitar sepertiga pada `max` tanpa perubahan kualitas.
Di mana lagi Anda membayar Sonnet 5.5
- Paket Claude (claude.com/pricing): Gratis adalah $0 dan termasuk Sonnet dalam obrolan, tanpa Claude Code. Pro adalah $17/bulan jika ditagih tahunan atau $20 bulanan. Max dimulai dari $100/bulan. Kursi tim adalah $20/$25 (standar) atau $100/$125 (premium), tahunan/bulanan. Tidak satu pun dari mereka termasuk akses API.
- GitHub Copilot: Pro ($10/bulan), Pro+, Max, Business dan Enterprise, ditagih dengan harga daftar penyedia. Copilot Pro mencakup 1.500 kredit AI sebulan masing-masing $0.01, sekitar $15 token, atau kira-kira 1.070 permintaan Contoh 1 ($15 ÷ $0.014). Copilot Gratis dan Pelajar tidak dapat memilihnya.
- Cursor: tarif yang sama dari kumpulan Model Lain (Pro, Pro Plus, dan Ultra), ditambah 10% untuk endpoint khusus AS ($2.20/$11).
- OpenRouter: $2/$10, atau $1/$5 pada varian `:batch`. Tidak ada varian `:free`.
- Vercel AI Gateway: $2/$10 dengan pembacaan cache $0.20. Kredit gratis $5 tidak mencakup Sonnet 5.5.
- Bedrock, Google Cloud, Foundry: halaman harga masing-masing cloud. Bedrock hanya mendukung tingkat Standar, tanpa Batch.
Mencari kredit sebagai gantinya? Lihat apakah ada API Claude Sonnet 5.5 gratis.
Lacak biaya per permintaan di Apidog
Setiap respons Pesan membawa objek `usage` dengan `input_tokens`, `output_tokens`, dan jumlah cache. Itu cukup untuk menentukan harga setiap panggilan di Apidog:

- Simpan kunci Anda sebagai variabel lingkungan `ANTHROPIC_API_KEY`.
- Simpan permintaan ini sekali per tingkat upaya (`low`, `medium`, `high`) dengan prompt yang sama:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 4000,
"thinking": {"type": "between_tools"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
- Tambahkan post-processor yang menghitung biaya panggilan dan gagal jika terpotong:
const body = pm.response.json();
const u = body.usage;
const cost = (u.input_tokens * 2 + u.output_tokens * 10) / 1e6;
pm.environment.set("last_call_usd", cost.toFixed(5));
pm.test("not truncated", () => pm.expect(body.stop_reason).to.not.eql("max_tokens"));
- Jalankan ketiga perintah dan bandingkan `usage.output_tokens` dan biaya secara berdampingan. Jika Anda menggunakan cache, tambahkan jumlah cache pada tarifnya sendiri.
Panduan lengkap permintaan ada di cara menggunakan API Claude Sonnet 5.5.
FAQ
Berapa biaya Claude Sonnet 5.5 per juta token? $2 input dan $10 output pada Claude API. Pembacaan cache berharga $0.20; Batch API mengenakan biaya $1 dan $5.
Apakah Sonnet 5.5 lebih mahal dari Sonnet 5? Tidak. Harga per-token identik, dan Anthropic mengatakan Sonnet 5.5 berharga hingga 30% lebih murah per tugas dalam pengujiannya.
Apakah ada biaya tambahan di atas 200k token? Tidak. Jendela 1M penuh ditagih dengan tarif standar.
Apakah Sonnet 5.5 memiliki mode cepat? Tidak. Mode cepat hanya tersedia pada Opus 5.5, Opus 5, dan Opus 4.8.
Apakah Claude Sonnet 5.5 gratis? Di aplikasi obrolan Claude, ya: siapa pun dapat mengobrol dengannya di paket Gratis. API berjalan dengan kredit prabayar; panduan API gratis mencakup program kredit tersebut.
Langkah selanjutnya: hargai beban kerja Anda sendiri
Ambil tiga bentuk permintaan Anda yang paling umum, jalankan masing-masing pada dua tingkat upaya, dan kalikan angka `usage` dengan tabel di atas. Anda akan segera melihat apakah `medium` memenuhi standar kualitas Anda atau `high` menghasilkan token ekstra. Unduh Apidog untuk menyimpan permintaan tersebut dan skrip biaya secara berdampingan.
