Claude Sonnet 5.5 berharga $2/$10 per juta token input/output, separuh dari harga Claude Opus 5.5 yaitu $4/$20. Pada tabel peluncuran Anthropic, ia mendekati Opus 5.5 dalam beberapa poin di sebagian besar baris dan mengalahkannya pada Terminal-Bench 4.0 (70,6% vs 66,4%), namun Anthropic mengatakan Opus 5.5 "tetap jelas lebih kuat dalam pekerjaan yang kompleks dan terbuka." Putusan: arahkan pekerjaan bervolume tinggi dan terdefinisi dengan baik serta subagen ke Sonnet 5.5 pada upaya rendah hingga tinggi. Bayar untuk Opus 5.5 pada tugas-tugas panjang dan terbuka, atau di mana pun Anda akan mendorong Sonnet ke xhigh atau max, karena Opus pada medium atau high seringkali mencetak skor lebih tinggi dengan uang yang sama atau lebih sedikit.
Untuk setiap model secara terpisah, lihat apa itu Claude Sonnet 5.5 dan apa itu Claude Opus 5.5. Bagian terakhir menunjukkan cara menguji keduanya dengan prompt Anda sendiri di Apidog.
Spesifikasi dan harga berdampingan
| Sonnet 5.5 | Opus 5.5 | |
|---|---|---|
| ID model API | claude-sonnet-5-5 |
claude-opus-5-5 |
| Input / output, per 1 juta token | $2 / $10 | $4 / $20 |
| Penulisan cache (5 menit) | $2.50 | $5 |
| Pembacaan cache | $0.20 | $0.20 |
| Mode cepat | Tidak tersedia | $8 / $40 |
| Upaya default pada API | high |
medium |
| Pemikiran | Adaptif secara default, atau between_tools |
Adaptif, selalu aktif |
| Kontek / output maksimum | 1M / 128K | 1M / 128K |
| Kelas latensi | Cepat | Sedang |
Tiga baris yang paling penting:
- Pembacaan cache berharga sama, jadi dalam loop agen yang banyak menggunakan cache, perbedaannya sebagian besar terletak pada output dan penulisan cache. Harga Claude Sonnet 5.5 melakukan perhitungan. Tidak ada model yang mengenakan premi kontek panjang.
- Upaya default berbeda. Tes pengaturan default mengadu Sonnet pada
highmelawan Opus padamedium, pasangan di mana Opus cenderung menang. - Mode cepat hanya untuk Opus (dokumen). Anthropic mengatakan Sonnet 5.5 menghasilkan output 30%+ lebih cepat dari Sonnet 5.
Benchmark: dekat pada tabel peluncuran, lebih lebar pada kartu sistem
Baris satu hingga delapan adalah tabel peluncuran Anthropic; sisanya berasal dari kartu sistem. Cognition menjalankan FrontierCode, Cursor menjalankan CursorBench, Zapier menjalankan AutomationBench, dan Artificial Analysis (AA) menjalankan GDPval-AA dan AA-Briefcase; Anthropic menjalankan yang lain. Sonnet berada pada upaya maksimum kecuali disebutkan.
| Benchmark | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% (xhigh) |
| FrontierCode 1.1 Main | 46.2% max, 52.1% xhigh | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 (Elo) | 1844 | 1846 |
| AA-Briefcase v1.1 (Elo) | 1811 | 1822 |
| HLE, with tools | 64.5% | 67.7% |
| OSWorld 2.1, partial | 80.1% | 81.8% |
| Chartography, no tools | 61.6% | 64.4% |
| SWE-Bench Pro | 81.3 | 89.9 |
| SWE-Bench Multimodal | 54.3 | 61.4 |
| HLE, no tools | 56.9 | 64.4 |
| OSWorld 2.1, strict pass | 43.5% | 48.7% |
| ProgramBench, long context | 79.7% | 91.2% |
| Terminal-Bench-Science 0.1 | 59.9% | 58.7% |
| AutomationBench | 44.7 | 42.5 |
| HealthBench Professional | 69.2 | 65.6 |
Tabel peluncuran adalah potongan yang menguntungkan: di luar Terminal-Bench, Opus memimpin baris persentasenya sebesar 1,7 hingga 3,2 poin, termasuk skor FrontierCode xhigh Sonnet. Lima baris kartu sistem memperlebar jarak menjadi 5,2 hingga 11,5 poin: SWE-Bench Pro, SWE-Bench Multimodal, HLE tanpa alat, OSWorld ketat, dan ProgramBench dengan kontek panjang. Pekerjaan tugas yang panjang, tanpa bantuan, dan menyeluruh adalah tempat Opus tetap unggul.
Baca kemenangan Terminal-Bench 4.0 dengan hati-hati: bagian 8.5 kartu sistem mengatakan bahwa fallback perlindungan menyentuh 10% percobaan Opus dibandingkan 1,5% Sonnet, dan pengujian AA sendiri mencetak Sonnet 5.5 pada 63,6%. Detailnya ada di benchmark Claude Sonnet 5.5.
Upaya menentukan pertandingan
Tabel peluncuran membandingkan setiap model pada pengaturan terbaiknya. Tagihan Anda tidak. Halaman peluncuran Anthropic memplot setiap tingkat upaya dengan biaya per percobaan atau tugas:
| Benchmark, model | Rendah | Sedang | Tinggi | Xtinggi | Maks |
|---|---|---|---|---|---|
| Terminal-Bench, Sonnet | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Terminal-Bench, Opus | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| CursorBench, Sonnet | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| CursorBench, Opus | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| FrontierCode, Sonnet | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| FrontierCode, Opus | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| AA-Briefcase, Sonnet | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| AA-Briefcase, Opus | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
Apa yang ditunjukkannya:
- Opus pada tingkat sedang seringkali mengalahkan Sonnet pada tingkat tinggi. Terminal-Bench 4.0: Opus mencetak 57,6% dengan $2,94 per percobaan, Sonnet 43,0% dengan $1,94.
- Opus di bawah maksimum dapat mengalahkan hasil terbaik Sonnet dengan biaya lebih rendah. CursorBench: Opus pada tingkat tinggi (56,0%, $3,97) vs Sonnet pada tingkat maks (55,5%, $9,67). FrontierCode: Opus pada tingkat sedang (54,6%, $0,80) vs hasil terbaik Sonnet (52,1%, $1,59).
- Sonnet pada tingkat maks bisa lebih mahal daripada Opus pada tingkat maks: $29,19 vs $21,05 pada AA-Briefcase, untuk skor yang lebih rendah. Pada FrontierCode, skor maks Sonnet turun di bawah skor xhigh-nya karena ia menyebarkan subagen peninjau, demikian catatan kaki Anthropic.
- Sonnet menguasai bagian bawah kurva. Pengaturan rendahnya mengalahkan titik termurah Opus di setiap grafik.
Setengah harga token bukanlah setengah biaya per tugas: Sonnet menghabiskan lebih banyak token saat upaya meningkat. Data AA, seperti yang dilaporkan OfficeChai, menempatkan Sonnet 5.5 sekitar 193.000 token output per tugas indeks pada tingkat maks, kira-kira 60% lebih banyak dari Opus 5.5.
Itulah perdebatan utama dalam thread Hacker News: banyak komentator membaca grafik tersebut sebagai mengatakan bahwa Opus dengan upaya yang lebih rendah cocok atau mengalahkan Sonnet pada tingkat tinggi atau xhigh, meninggalkan ceruk Sonnet pada upaya rendah atau sedang dan sebagai subagen di bawah orkestrator Opus.
Panduan prompting Anthropic mengatakan upaya Sonnet 5.5 dikalibrasi ulang: mulai dari high (medium untuk coding agen yang terdefinisi dengan baik) dan simpan xhigh dan max untuk keuntungan yang terukur. Mengubah upaya tingkat atas antar permintaan akan membatalkan cache prompt, jadi atur per beban kerja (panduan API).
Perbedaan keamanan dan perilaku
Hasil injeksi prompt terbagi. Pada benchmark injeksi prompt tidak langsung Gray Swan, tingkat keberhasilan serangan Sonnet 5.5 adalah 3,4% pada 15 percobaan (Sonnet 5: 6,7%): kurang resistan dibandingkan Opus 5.5, lebih dari setiap model non-Claude yang diuji, paling lemah dalam penggunaan komputer GUI (12,5%). Terhadap penyerang adaptif Shade, Sonnet mengalahkan Opus dalam pengkodean (3,01% vs 54,61% tanpa pengaman, 2,63% vs 11,13% dengan probe aktif) dan menyainginya dalam penggunaan komputer (0,07%); dalam penggunaan browser, ini adalah model pertama yang dievaluasi Anthropic tanpa serangan yang berhasil. Lihat Opus 5.5 dan injeksi prompt.
Kedua model dilengkapi pengaman siber; Sonnet 5.5 adalah Sonnet pertama yang memilikinya. Tugas siber berisiko tinggi yang ditandai akan kembali ke Sonnet 5, secara otomatis di aplikasi Anthropic dan pada API hanya jika Anda memilih (fallbacks: "default", beta). Kartu sistem memperingatkan lebih banyak penolakan bahkan pada pekerjaan keamanan yang tidak berbahaya.
Kartu sistem juga menemukan Sonnet 5.5 lebih jujur di bawah tekanan dibandingkan Opus 5.5 tetapi lebih rentan terhadap halusinasi.
Mencampur Sonnet 5.5 dan Opus 5.5 dalam satu sistem
Salah satu cara untuk mendapatkan keduanya: Opus merencanakan, Sonnet mengeksekusi. Tiga mekanisme yang penting.
Blok pemikiran tidak saling melintasi. Sonnet 5.5 menghilangkan blok pemikiran Opus 5 dan Opus 5.5 (tidak ditagih; permintaan masih mengembalikan 200), dan blok terikat pada model, percakapan, dan akun. Beralih model di tengah percakapan dan penalaran hilang, jadi serahkan melalui teks: Opus menulis rencana sebagai pesan, Sonnet mulai dari situ (panduan migrasi).
Alat penasihat menerima Opus 5.5 sebagai penasihat untuk eksekutor Sonnet 5.5; saran dikembalikan terenkripsi sebagai advisor_redacted_result.
Claude Code memiliki opusplan: Opus dalam mode rencana, Sonnet untuk eksekusi. Alias sonnet berarti Sonnet 5.5 hanya pada API Anthropic (v2.1.284 atau lebih baru), jadi di Bedrock, Google Cloud, dan Foundry opusplan mengeksekusi pada Sonnet yang lebih lama. Lihat Claude Sonnet 5.5 di Claude Code.
Di mana GPT-6 Sol cocok
GPT-6 Sol memiliki harga daftar yang sama dengan Sonnet 5.5 yaitu $2/$10, dengan pembacaan cache $0,20 (diskon 90%) dan jendela kontek 872 ribu. Tabel Anthropic memberikan Sol empat sel: FrontierCode 49,3%, GDPval-AA 1487, AA-Briefcase 1483 dan Chartography 53,6% tanpa alat. Sebuah catatan kaki mengatakan OpenAI baru-baru ini memperbaiki bug pemahaman gambar Sol yang mungkin belum tercermin dalam skor AA dan Surge AI.
Biaya per tugas berbalik berdasarkan benchmark. Pada AA-Briefcase pada tingkat maks, Sol berharga $2,67 per tugas dibandingkan Sonnet $29,19, mencetak 1483 banding 1811. Pada FrontierCode, Sonnet pada tingkat tinggi cocok dengan yang terbaik dari Sol (49,4% vs 49,3%) dengan $0,42 dibandingkan $2,07. Lihat GPT-6 Sol vs Claude Opus 5.5 dan apa itu GPT-6 Sol.
Model mana untuk beban kerja mana
| Beban Kerja | Model dan upaya |
|---|---|
| Obrolan bervolume tinggi, klasifikasi, ekstraksi | Sonnet 5.5, low atau medium |
| Perbaikan bug yang terdefinisi dengan baik, perubahan seukuran PR | Sonnet 5.5, medium atau high |
| Subagen yang menjalankan rencana Opus | Sonnet 5.5, medium atau high |
| Pekerjaan agen yang panjang dan terbuka | Opus 5.5, medium lalu high |
Apa pun yang membutuhkan Sonnet pada xhigh atau max |
Opus 5.5, medium atau high |
| Penalaran basis kode kontek panjang | Opus 5.5, medium atau di atasnya |
| Agen yang membaca konten tidak tepercaya | Keduanya; uji kasus injeksi Anda sendiri |
Uji keduanya pada lalu lintas Anda sendiri
Setiap grafik di atas berasal dari alat orang lain, bukan prompt, alat, atau campuran token Anda. Mulailah dengan pasangan yang ditunjukkan oleh data:
ask() {
curl -s https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"'"$1"'","max_tokens":16000,
"output_config":{"effort":"'"$2"'"},
"messages":[{"role":"user","content":"Review this diff and list each bug as JSON: ..."}]}' \
| jq '{model, stop_reason, usage}'
}
ask claude-sonnet-5-5 high
ask claude-opus-5-5 medium
Di Apidog, buat agar dapat diulang: satu permintaan ke https://api.anthropic.com/v1/messages, ANTHROPIC_API_KEY sebagai variabel lingkungan, dan {{model}} serta {{effort}} di dalam body. Duplikasikan per pasangan dan tambahkan pasca-pemrosesan sehingga setiap eksekusi memeriksa hal yang sama:
const body = pm.response.json();
pm.test("finished cleanly", () => {
pm.expect(body.stop_reason).to.not.be.oneOf(["max_tokens", "refusal"]);
});
pm.test("stays inside the token budget", () => {
pm.expect(body.usage.output_tokens).to.be.below(8000);
});
Jalankan setiap pasangan 10 hingga 20 kali dan bandingkan usage, waktu respons, dan tingkat kelulusan; token dikalikan harga daftar adalah biaya riil Anda per tugas. Selengkapnya di cara menguji aplikasi LLM.
FAQ
Apakah Claude Sonnet 5.5 lebih baik dari Opus 5.5? Tidak di sebagian besar baris. Opus 5.5 memimpin tabel peluncuran kecuali pada Terminal-Bench 4.0 dan hampir seri di GDPval-AA. Perbandingan generasi sebelumnya: Claude Opus 5 vs Sonnet 5.
Apakah Sonnet 5.5 setengah biaya Opus 5.5? Per token, ya. Per tugas itu tergantung pada upaya: pada tingkat maks, Sonnet berharga lebih mahal pada AA-Briefcase ($29,19 vs $21,05).
Bisakah saya beralih model di tengah percakapan? Ya, tetapi Sonnet 5.5 menghilangkan blok pemikiran Opus 5.5, jadi kirimkan status sebagai teks.
Sonnet 5.5 atau GPT-6 Sol pada harga $2/$10? Sonnet memimpin keempat baris bersama pada pengaturan terbaiknya; Sol bisa jauh lebih murah per tugas. Uji keduanya.
Langkah selanjutnya
Jalankan dua prompt termahal Anda melalui Sonnet 5.5 pada high dan Opus 5.5 pada medium, dan bandingkan tingkat kelulusan serta biaya per tugas sebelum Anda mengubah aturan routing. Untuk menyimpan permintaan, pernyataan, dan hasil dalam satu proyek, unduh Apidog.
