Claude Sonnet 5.5 vs Opus 5.5: Separuh Harga, Kualitas Setara, Kapan Harus Bayar Opus

Sonnet 5.5 vs Opus 5.5: $2/$10 dibandingkan $4/$20, tolok ukur yang hanya berselisih beberapa poin, dan data biaya per upaya yang menunjukkan kapan Opus 5.5 sepadan dengan harganya.

INEZA Felin-Michel

INEZA Felin-Michel

29 September 2026

Claude Sonnet 5.5 vs Opus 5.5: Separuh Harga, Kualitas Setara, Kapan Harus Bayar Opus

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Claude Sonnet 5.5 berharga $2/$10 per juta token input/output, separuh dari harga Claude Opus 5.5 yaitu $4/$20. Pada tabel peluncuran Anthropic, ia mendekati Opus 5.5 dalam beberapa poin di sebagian besar baris dan mengalahkannya pada Terminal-Bench 4.0 (70,6% vs 66,4%), namun Anthropic mengatakan Opus 5.5 "tetap jelas lebih kuat dalam pekerjaan yang kompleks dan terbuka." Putusan: arahkan pekerjaan bervolume tinggi dan terdefinisi dengan baik serta subagen ke Sonnet 5.5 pada upaya rendah hingga tinggi. Bayar untuk Opus 5.5 pada tugas-tugas panjang dan terbuka, atau di mana pun Anda akan mendorong Sonnet ke xhigh atau max, karena Opus pada medium atau high seringkali mencetak skor lebih tinggi dengan uang yang sama atau lebih sedikit.

tombol

Untuk setiap model secara terpisah, lihat apa itu Claude Sonnet 5.5 dan apa itu Claude Opus 5.5. Bagian terakhir menunjukkan cara menguji keduanya dengan prompt Anda sendiri di Apidog.

Spesifikasi dan harga berdampingan

Sonnet 5.5 Opus 5.5
ID model API claude-sonnet-5-5 claude-opus-5-5
Input / output, per 1 juta token $2 / $10 $4 / $20
Penulisan cache (5 menit) $2.50 $5
Pembacaan cache $0.20 $0.20
Mode cepat Tidak tersedia $8 / $40
Upaya default pada API high medium
Pemikiran Adaptif secara default, atau between_tools Adaptif, selalu aktif
Kontek / output maksimum 1M / 128K 1M / 128K
Kelas latensi Cepat Sedang

Tiga baris yang paling penting:

Benchmark: dekat pada tabel peluncuran, lebih lebar pada kartu sistem

Baris satu hingga delapan adalah tabel peluncuran Anthropic; sisanya berasal dari kartu sistem. Cognition menjalankan FrontierCode, Cursor menjalankan CursorBench, Zapier menjalankan AutomationBench, dan Artificial Analysis (AA) menjalankan GDPval-AA dan AA-Briefcase; Anthropic menjalankan yang lain. Sonnet berada pada upaya maksimum kecuali disebutkan.

Benchmark Sonnet 5.5 Opus 5.5
Terminal-Bench 4.0 70.6% 66.4% (xhigh)
FrontierCode 1.1 Main 46.2% max, 52.1% xhigh 54.4%
CursorBench 4.0 55.5% 57.8%
GDPval-AA v2.1 (Elo) 1844 1846
AA-Briefcase v1.1 (Elo) 1811 1822
HLE, with tools 64.5% 67.7%
OSWorld 2.1, partial 80.1% 81.8%
Chartography, no tools 61.6% 64.4%
SWE-Bench Pro 81.3 89.9
SWE-Bench Multimodal 54.3 61.4
HLE, no tools 56.9 64.4
OSWorld 2.1, strict pass 43.5% 48.7%
ProgramBench, long context 79.7% 91.2%
Terminal-Bench-Science 0.1 59.9% 58.7%
AutomationBench 44.7 42.5
HealthBench Professional 69.2 65.6

Tabel peluncuran adalah potongan yang menguntungkan: di luar Terminal-Bench, Opus memimpin baris persentasenya sebesar 1,7 hingga 3,2 poin, termasuk skor FrontierCode xhigh Sonnet. Lima baris kartu sistem memperlebar jarak menjadi 5,2 hingga 11,5 poin: SWE-Bench Pro, SWE-Bench Multimodal, HLE tanpa alat, OSWorld ketat, dan ProgramBench dengan kontek panjang. Pekerjaan tugas yang panjang, tanpa bantuan, dan menyeluruh adalah tempat Opus tetap unggul.

Baca kemenangan Terminal-Bench 4.0 dengan hati-hati: bagian 8.5 kartu sistem mengatakan bahwa fallback perlindungan menyentuh 10% percobaan Opus dibandingkan 1,5% Sonnet, dan pengujian AA sendiri mencetak Sonnet 5.5 pada 63,6%. Detailnya ada di benchmark Claude Sonnet 5.5.

Upaya menentukan pertandingan

Tabel peluncuran membandingkan setiap model pada pengaturan terbaiknya. Tagihan Anda tidak. Halaman peluncuran Anthropic memplot setiap tingkat upaya dengan biaya per percobaan atau tugas:

Benchmark, model Rendah Sedang Tinggi Xtinggi Maks
Terminal-Bench, Sonnet 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Terminal-Bench, Opus 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
CursorBench, Sonnet 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
CursorBench, Opus 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98) 57.8% ($13.43)
FrontierCode, Sonnet 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
FrontierCode, Opus 47.3% ($0.40) 54.6% ($0.80) 54.0% ($1.09) 51.4% ($2.25) 54.4% ($6.19)
AA-Briefcase, Sonnet 1264 ($0.87) 1461 ($1.64) 1634 ($3.95) 1746 ($9.63) 1811 ($29.19)
AA-Briefcase, Opus 1285 ($1.15) 1642 ($4.40) 1705 ($6.27) 1780 ($12.27) 1822 ($21.05)

Apa yang ditunjukkannya:

Setengah harga token bukanlah setengah biaya per tugas: Sonnet menghabiskan lebih banyak token saat upaya meningkat. Data AA, seperti yang dilaporkan OfficeChai, menempatkan Sonnet 5.5 sekitar 193.000 token output per tugas indeks pada tingkat maks, kira-kira 60% lebih banyak dari Opus 5.5.

Itulah perdebatan utama dalam thread Hacker News: banyak komentator membaca grafik tersebut sebagai mengatakan bahwa Opus dengan upaya yang lebih rendah cocok atau mengalahkan Sonnet pada tingkat tinggi atau xhigh, meninggalkan ceruk Sonnet pada upaya rendah atau sedang dan sebagai subagen di bawah orkestrator Opus.

Panduan prompting Anthropic mengatakan upaya Sonnet 5.5 dikalibrasi ulang: mulai dari high (medium untuk coding agen yang terdefinisi dengan baik) dan simpan xhigh dan max untuk keuntungan yang terukur. Mengubah upaya tingkat atas antar permintaan akan membatalkan cache prompt, jadi atur per beban kerja (panduan API).

Perbedaan keamanan dan perilaku

Hasil injeksi prompt terbagi. Pada benchmark injeksi prompt tidak langsung Gray Swan, tingkat keberhasilan serangan Sonnet 5.5 adalah 3,4% pada 15 percobaan (Sonnet 5: 6,7%): kurang resistan dibandingkan Opus 5.5, lebih dari setiap model non-Claude yang diuji, paling lemah dalam penggunaan komputer GUI (12,5%). Terhadap penyerang adaptif Shade, Sonnet mengalahkan Opus dalam pengkodean (3,01% vs 54,61% tanpa pengaman, 2,63% vs 11,13% dengan probe aktif) dan menyainginya dalam penggunaan komputer (0,07%); dalam penggunaan browser, ini adalah model pertama yang dievaluasi Anthropic tanpa serangan yang berhasil. Lihat Opus 5.5 dan injeksi prompt.

Kedua model dilengkapi pengaman siber; Sonnet 5.5 adalah Sonnet pertama yang memilikinya. Tugas siber berisiko tinggi yang ditandai akan kembali ke Sonnet 5, secara otomatis di aplikasi Anthropic dan pada API hanya jika Anda memilih (fallbacks: "default", beta). Kartu sistem memperingatkan lebih banyak penolakan bahkan pada pekerjaan keamanan yang tidak berbahaya.

Kartu sistem juga menemukan Sonnet 5.5 lebih jujur di bawah tekanan dibandingkan Opus 5.5 tetapi lebih rentan terhadap halusinasi.

Mencampur Sonnet 5.5 dan Opus 5.5 dalam satu sistem

Salah satu cara untuk mendapatkan keduanya: Opus merencanakan, Sonnet mengeksekusi. Tiga mekanisme yang penting.

Blok pemikiran tidak saling melintasi. Sonnet 5.5 menghilangkan blok pemikiran Opus 5 dan Opus 5.5 (tidak ditagih; permintaan masih mengembalikan 200), dan blok terikat pada model, percakapan, dan akun. Beralih model di tengah percakapan dan penalaran hilang, jadi serahkan melalui teks: Opus menulis rencana sebagai pesan, Sonnet mulai dari situ (panduan migrasi).

Alat penasihat menerima Opus 5.5 sebagai penasihat untuk eksekutor Sonnet 5.5; saran dikembalikan terenkripsi sebagai advisor_redacted_result.

Claude Code memiliki opusplan: Opus dalam mode rencana, Sonnet untuk eksekusi. Alias sonnet berarti Sonnet 5.5 hanya pada API Anthropic (v2.1.284 atau lebih baru), jadi di Bedrock, Google Cloud, dan Foundry opusplan mengeksekusi pada Sonnet yang lebih lama. Lihat Claude Sonnet 5.5 di Claude Code.

Di mana GPT-6 Sol cocok

GPT-6 Sol memiliki harga daftar yang sama dengan Sonnet 5.5 yaitu $2/$10, dengan pembacaan cache $0,20 (diskon 90%) dan jendela kontek 872 ribu. Tabel Anthropic memberikan Sol empat sel: FrontierCode 49,3%, GDPval-AA 1487, AA-Briefcase 1483 dan Chartography 53,6% tanpa alat. Sebuah catatan kaki mengatakan OpenAI baru-baru ini memperbaiki bug pemahaman gambar Sol yang mungkin belum tercermin dalam skor AA dan Surge AI.

Biaya per tugas berbalik berdasarkan benchmark. Pada AA-Briefcase pada tingkat maks, Sol berharga $2,67 per tugas dibandingkan Sonnet $29,19, mencetak 1483 banding 1811. Pada FrontierCode, Sonnet pada tingkat tinggi cocok dengan yang terbaik dari Sol (49,4% vs 49,3%) dengan $0,42 dibandingkan $2,07. Lihat GPT-6 Sol vs Claude Opus 5.5 dan apa itu GPT-6 Sol.

Model mana untuk beban kerja mana

Beban Kerja Model dan upaya
Obrolan bervolume tinggi, klasifikasi, ekstraksi Sonnet 5.5, low atau medium
Perbaikan bug yang terdefinisi dengan baik, perubahan seukuran PR Sonnet 5.5, medium atau high
Subagen yang menjalankan rencana Opus Sonnet 5.5, medium atau high
Pekerjaan agen yang panjang dan terbuka Opus 5.5, medium lalu high
Apa pun yang membutuhkan Sonnet pada xhigh atau max Opus 5.5, medium atau high
Penalaran basis kode kontek panjang Opus 5.5, medium atau di atasnya
Agen yang membaca konten tidak tepercaya Keduanya; uji kasus injeksi Anda sendiri

Uji keduanya pada lalu lintas Anda sendiri

Setiap grafik di atas berasal dari alat orang lain, bukan prompt, alat, atau campuran token Anda. Mulailah dengan pasangan yang ditunjukkan oleh data:

ask() {
  curl -s https://api.anthropic.com/v1/messages \
    -H "x-api-key: $ANTHROPIC_API_KEY" \
    -H "anthropic-version: 2023-06-01" \
    -H "content-type: application/json" \
    -d '{"model":"'"$1"'","max_tokens":16000,
         "output_config":{"effort":"'"$2"'"},
         "messages":[{"role":"user","content":"Review this diff and list each bug as JSON: ..."}]}' \
  | jq '{model, stop_reason, usage}'
}
ask claude-sonnet-5-5 high
ask claude-opus-5-5 medium

Di Apidog, buat agar dapat diulang: satu permintaan ke https://api.anthropic.com/v1/messages, ANTHROPIC_API_KEY sebagai variabel lingkungan, dan {{model}} serta {{effort}} di dalam body. Duplikasikan per pasangan dan tambahkan pasca-pemrosesan sehingga setiap eksekusi memeriksa hal yang sama:

const body = pm.response.json();
pm.test("finished cleanly", () => {
  pm.expect(body.stop_reason).to.not.be.oneOf(["max_tokens", "refusal"]);
});
pm.test("stays inside the token budget", () => {
  pm.expect(body.usage.output_tokens).to.be.below(8000);
});

Jalankan setiap pasangan 10 hingga 20 kali dan bandingkan usage, waktu respons, dan tingkat kelulusan; token dikalikan harga daftar adalah biaya riil Anda per tugas. Selengkapnya di cara menguji aplikasi LLM.

FAQ

Apakah Claude Sonnet 5.5 lebih baik dari Opus 5.5? Tidak di sebagian besar baris. Opus 5.5 memimpin tabel peluncuran kecuali pada Terminal-Bench 4.0 dan hampir seri di GDPval-AA. Perbandingan generasi sebelumnya: Claude Opus 5 vs Sonnet 5.

Apakah Sonnet 5.5 setengah biaya Opus 5.5? Per token, ya. Per tugas itu tergantung pada upaya: pada tingkat maks, Sonnet berharga lebih mahal pada AA-Briefcase ($29,19 vs $21,05).

Bisakah saya beralih model di tengah percakapan? Ya, tetapi Sonnet 5.5 menghilangkan blok pemikiran Opus 5.5, jadi kirimkan status sebagai teks.

Sonnet 5.5 atau GPT-6 Sol pada harga $2/$10? Sonnet memimpin keempat baris bersama pada pengaturan terbaiknya; Sol bisa jauh lebih murah per tugas. Uji keduanya.

Langkah selanjutnya

Jalankan dua prompt termahal Anda melalui Sonnet 5.5 pada high dan Opus 5.5 pada medium, dan bandingkan tingkat kelulusan serta biaya per tugas sebelum Anda mengubah aturan routing. Untuk menyimpan permintaan, pernyataan, dan hasil dalam satu proyek, unduh Apidog.

tombol

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.