Claude Sonnet 5.5 meraih skor 70,6% pada Terminal-Bench 4.0, 55,5% pada CursorBench 4.0, 46,2% pada FrontierCode 1.1 pada upaya maksimum (52,1% pada xhigh) dan 81,3 pada SWE-Bench Pro, naik dari 10,3%, 34,1%, 42,4% dan 63,2 milik Sonnet 5. Opus 5.5 memimpin sebagian besar baris tabel peluncuran sekitar 2 hingga 3 poin tetapi tertinggal pada Terminal-Bench. Artificial Analysis secara independen menilai Sonnet 5.5 pada angka 56 pada Indeks Intelijennya, #3 dari 216.
Di bawah ini: tolok ukur lengkap Claude Sonnet 5.5, siapa yang menjalankannya, perubahan upaya apa saja, dan cara menguji model pada traffic Anda sendiri di Apidog. Untuk spesifikasi, lihat apa itu Claude Sonnet 5.5.
Tabel peluncuran
Pos peluncuran Anthropic membandingkan empat model (“n/r” menandai tanda hubung). Sel Sonnet 5.5 adalah upaya maksimum kecuali ditandai; API secara default ke tinggi, Claude Code dan aplikasi ke sedang.
| Tolok Ukur | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | n/r |
| FrontierCode 1.1 (Utama) | 46.2% Maks² / 52.1% Xhigh | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | n/r |
| GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| Humanity’s Last Exam (dengan alat) | 64.5% | 54.9% | 67.7% | n/r |
| OSWorld 2.1 (parsial) | 80.1% | 57.0% | 81.8% | n/r |
| Chartography (tanpa alat) | 61.6% | 15.6% | 64.4% | 53.6%⁴ |
Catatan kaki, dalam istilah sederhana:
- Skor Terminal-Bench Opus 5.5 berada pada xhigh, yang terbaik; pada maks, skornya 64,8%.
- FrontierCode memberikan penalti untuk pengeditan di luar cakupan. Pada maks, Sonnet 5.5 lebih sering menjalankan keterampilan peninjauan kode Claude Code, menyebar ke banyak subagen; dalam dua kasus yang diperiksa Cognition, hal itu menyebabkan timeout atau pengeditan di luar cakupan.
- Artificial Analysis menjalankan kedua uji coba pekerjaan-pengetahuan pada penerapan pra-rilis dengan bug keluaran terstruktur, yang telah diperbaiki. Anthropic memperkirakan dampak kecil, bahkan mungkin meremehkan Sonnet 5.5.
- OpenAI baru-baru ini memperbaiki bug pemahaman gambar GPT-6 Sol yang mungkin tidak tercermin dalam skor AA dan Surge AI.
Siapa yang menjalankan setiap tolok ukur
Anthropic menjalankan setiap pengujian sendiri kecuali pihak ketiga disebutkan. Baris lintas-vendor berbagi nama tolok ukur, bukan harness atau pengaturan upaya.
| Pelaksana | Tolok Ukur | Kondisi |
|---|---|---|
| Anthropic | Terminal-Bench 4.0, HLE, OSWorld 2.1 | TB: Claude Code --bare, 5 percobaan, perlindungan aktif. HLE: pencarian dan eksekusi kode. OSWorld: 108 tugas |
| Cognition | FrontierCode 1.1 | Claude di Claude Code, GPT di Codex CLI |
| Cursor | CursorBench 4.0 | Harness produksi Cursor; Anthropic memperkirakan biaya pada harga daftar |
| Artificial Analysis | GDPval-AA, AA-Briefcase | Penerapan pra-rilis |
| Anthropic | Chartography | Tolok ukur Surge AI, dinilai dengan Gemini 3.5 Flash; skor Sol dari Surge |
Fallback menyentuh 1,5% percobaan Terminal-Bench Sonnet 5.5 tetapi 10% percobaan Opus 5.5 (kartu sistem §8.5), jadi bacalah keunggulan 4,2 poin Sonnet dengan hati-hati.
Ekstra kartu sistem
Baris satu hingga enam adalah ringkasan upaya maksimum kartu sistem.
| Tolok Ukur | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 81.3 | 63.2 | 89.9 |
| SWE-Bench Multilingual | 90.3 | 78.3 | 93.9 |
| SWE-Bench Multimodal | 54.3 | 28.1 | 61.4 |
| HLE, tanpa alat | 56.9 | 43.1 | 64.4 |
| HealthBench Professional | 69.2 | 57.8 | 65.6 |
| AutomationBench (jalankan oleh Zapier) | 44.7 | 10.7 | 42.5 |
| DeepSWE v1.1 | 71.0% | n/r | n/r |
| Terminal-Bench-Science 0.1 | 59.9% | n/r | 58.7% |
| FrontierSWE v2 (jalankan oleh Proximal) | 61.9% | n/r | 62.3% |
| ArXivMath (tanpa alat / alat) | 86.8% / 95.2% | n/r | 91.2% / 96.9% |
| ProgramBench (konteks panjang) | 79.7% | 77.3% | 91.2% |
| OSWorld 2.1, lulus ketat | 43.5% | 25.6% | 48.7% |
| Toolathlon-Verified (Lulus@1) | 77.8% | 74.7% | 77.8% |
| OfficeQA / OfficeQA Pro | 76.9% / 65.6% | 75.1% / 62.1% | 78.9% / 67.7% |
Sonnet 5.5 mengungguli Opus 5.5 pada HealthBench Professional, AutomationBench, dan Terminal-Bench-Science; Opus memimpin paling jauh pada ProgramBench, SWE-Bench Pro, dan HLE tanpa alat. Angka utama 80,1% OSWorld adalah kredit parsial; hanya 43,5% tugas yang lulus sepenuhnya.
Upaya mengubah gambaran
Bagan peluncuran, sebagai skor (biaya). Biaya Terminal-Bench adalah per percobaan, yang lain per tugas. Dua bagan menunjukkan GPT-5.6 Sol (*) karena angka GPT-6 Sol tidak dipublikasikan.
| Model | Rendah | Sedang | Tinggi | Xhigh | Maks |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | |||||
| Sonnet 5.5 | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Opus 5.5 | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| Sonnet 5 | 3.2% ($3.78) | 4.4% ($4.83) | 4.5% ($8.20) | 7.0% ($9.95) | 10.3% ($11.62) |
| GPT-5.6 Sol* | 7.9% ($1.46) | 20.9% ($2.69) | 26.1% ($4.12) | 28.5% ($5.39) | 37.3% ($7.89) |
| FrontierCode 1.1 Utama | |||||
| Sonnet 5.5 | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| Opus 5.5 | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| Sonnet 5 | 28.7% ($2.39) | 35.2% ($3.81) | 39.4% ($6.10) | 42.7% ($10.07) | 42.4% ($17.12) |
| GPT-6 Sol | 37.3% ($0.43) | 45.9% ($0.77) | 47.7% ($1.04) | 48.4% ($1.32) | 49.3% ($2.07) |
| CursorBench 4.0 | |||||
| Sonnet 5.5 | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| Opus 5.5 | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| Sonnet 5 | 24.1% ($1.39) | 28.0% ($2.31) | 30.8% ($3.48) | 32.0% ($4.55) | 34.1% ($7.17) |
| GPT-5.6 Sol* | 24.6% ($0.87) | 31.1% ($1.77) | 35.7% ($2.85) | 37.7% ($4.40) | 41.7% ($8.23) |
| AA-Briefcase v1.1 (Elo) | |||||
| Sonnet 5.5 | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| Opus 5.5 | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
| Sonnet 5 | 923 ($0.82) | 1056 ($1.73) | 1177 ($3.76) | 1274 ($7.56) | 1359 ($14.43) |
| GPT-6 Sol | 905 ($0.12) | 1142 ($0.34) | 1289 ($0.63) | 1364 ($1.19) | 1483 ($2.67) |
- Sebagian besar keuntungan tercapai pada xhigh. Maks menambah 9,1 poin pada Terminal-Bench dengan biaya 2,4x, 2,4 pada CursorBench dengan 2,5x.
- Skor maks FrontierCode lebih rendah dan biayanya 13x lebih mahal dari xhigh (46,2% pada $20,78 vs 52,1% pada $1,59).
- Opus 5.5 dengan upaya lebih rendah adalah saingan sejati. Pada Terminal-Bench, Opus pada sedang mendapatkan 57,6% dengan $2,94; Sonnet pada tinggi mendapatkan 43,0% dengan $1,94. Opus pada tinggi (64,2%, $3,88) mengalahkan Sonnet pada xhigh (61,5%, $5,30). Lihat Sonnet 5.5 vs Opus 5.5.
- Tinggi adalah titik manis biaya Sonnet. FrontierCode pada tinggi: 49,4% dengan $0,42, menyamai yang terbaik dari GPT-6 Sol (49,3%) dengan sekitar seperlima dari biaya (rincian harga).
Hasil independen
Artificial Analysis menilai Sonnet 5.5 pada angka 56 pada Intelligence Index v4.3.2, #3 dari 216, hanya kalah dari Opus 5.5 pada maks dan xhigh. Sonnet 5 mencetak 38. Biaya untuk menjalankan indeks:
| Upaya | Skor indeks | Biaya untuk menjalankan |
|---|---|---|
| maks | 55.98 | $8,977 |
| xhigh | 51.85 | $2,738 |
| tinggi | 46.74 | $1,176 |
| sedang | 40.74 | $701 |
| rendah | 35.84 | $544 |
Maks membutuhkan biaya 7,6x tinggi untuk 9,2 poin lebih. Pembacaan OfficeChai tentang AA menempatkan Sonnet 5.5 di luar batas Pareto, paling kompetitif biaya pada tinggi, dan menghitung sekitar 193.000 token keluaran per tugas indeks pada maks.
- Jalankan Terminal-Bench 4.0 milik AA sendiri: 63,6%, dibandingkan dengan 70,6% milik Anthropic.
- Skor rendah Sonnet 5 adalah nyata: AA mengukur 14,1% (lihat tolok ukur Sonnet 5).
- AA-Omniscience (menurut OfficeChai): akurasi 54% dan tingkat halusinasi 47%, dibandingkan dengan 66% dan 59% untuk Opus 5.5.
- Belum terukur: kecepatan keluaran dan waktu hingga token pertama, jadi klaim Anthropic “30%+ lebih cepat” tetap berlaku. Belum ada daftar LMArena.
Tolok ukur keamanan
Injeksi prompt, sesuai kartu sistem:
- Gray Swan: keberhasilan serangan 0,4%, 2,7%, dan 3,4% pada k=1, 10, dan 15 (Sonnet 5: 0,7%, 5,1%, 6,7%). Penggunaan komputer GUI paling lemah pada 12,5% (k=15).
- Shade, pengkodean: 3,01% tanpa perlindungan, sebagian besar melalui fallback siber Sonnet 5; Sonnet 5.5 sendiri disusupi pada 4 dari 5.901 permintaan.
- Penggunaan browser: tidak ada serangan yang berhasil di 110 skenario.
Evaluasi siber berjalan dengan perlindungan mati: 46,1% pada CyScenarioBench (Sonnet 5: 0,7%, Opus 5.5: 67,6%). Ini adalah Sonnet pertama dengan perlindungan siber, dan Anthropic memperingatkan akan lebih banyak penolakan bahkan pada tugas keamanan yang tidak berbahaya. Lihat panduan injeksi prompt kami.
Jalankan evaluasi Anda sendiri
Tolok ukur tidak terlihat seperti traffic Anda, dan panduan prompt Anthropic mengatakan bahwa upaya dikalibrasi ulang, jadi jangan gunakan kembali pengaturan Sonnet 5. Di Apidog:
- Simpan
ANTHROPIC_API_KEYsebagai variabel lingkungan dan simpan 20 hingga 50 prompt nyata sebagai permintaan Pesan. - Pastikan status 200,
stop_reasonselain"max_tokens"atau"refusal", dan konten yang dibutuhkan jawaban yang benar. - Jalankan pada
low,medium,high, danxhigh, masing-masing satu kali; mengubah upaya membatalkan cache prompt. - Catat tingkat kelulusan dan jumlah token dalam
usage, dengan harga $2 masukan dan $10 keluaran per juta.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
Kirimkan upaya terendah yang tingkat kelulusannya Anda terima. Lihat menguji aplikasi LLM dan menguji API agen AI, lalu unduh Apidog untuk membangun koleksinya.
FAQ
Apakah Sonnet 5.5 mengalahkan Opus 5.5? Pada Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science, dan Chartography dengan alat, ya. Opus 5.5 memimpin atau seri di sisanya.
Berapa skor SWE-Bench Sonnet 5.5? 81,3 pada SWE-Bench Pro dan 90,3 pada Multilingual, pada upaya maksimum.
Mengapa ada dua angka FrontierCode? 46,2% adalah maks, 52,1% adalah xhigh; penyebaran subagen maks menyebabkan penalti di luar cakupan.
Haruskah saya meningkatkan dari Sonnet 5? Ya pada tolok ukur, tetapi baca perubahan API yang merusak di Sonnet 5.5 vs Sonnet 5 terlebih dahulu.
Langkah selanjutnya
Mulai dari high (atau medium untuk pengkodean agentic yang ditentukan dengan baik), seperti yang disarankan Anthropic, dan biarkan evaluasi Anda di Apidog memutuskan apakah peningkatan itu sepadan.
