Benchmark Claude Sonnet 5.5: Angka Anthropic, Hasil Independen, dan Maknanya

Tolok ukur Claude Sonnet 5.5: 70,6% Terminal-Bench 4.0, 81,3 SWE-Bench Pro, indeks AA 56. Siapa yang menjalankan setiap pengujian, berapa biaya upayanya, cara menjalankan evaluasi Anda sendiri.

Medy Evrard

29 September 2026

Benchmark Claude Sonnet 5.5: Angka Anthropic, Hasil Independen, dan Maknanya

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Claude Sonnet 5.5 meraih skor 70,6% pada Terminal-Bench 4.0, 55,5% pada CursorBench 4.0, 46,2% pada FrontierCode 1.1 pada upaya maksimum (52,1% pada xhigh) dan 81,3 pada SWE-Bench Pro, naik dari 10,3%, 34,1%, 42,4% dan 63,2 milik Sonnet 5. Opus 5.5 memimpin sebagian besar baris tabel peluncuran sekitar 2 hingga 3 poin tetapi tertinggal pada Terminal-Bench. Artificial Analysis secara independen menilai Sonnet 5.5 pada angka 56 pada Indeks Intelijennya, #3 dari 216.

Di bawah ini: tolok ukur lengkap Claude Sonnet 5.5, siapa yang menjalankannya, perubahan upaya apa saja, dan cara menguji model pada traffic Anda sendiri di Apidog. Untuk spesifikasi, lihat apa itu Claude Sonnet 5.5.

Tabel peluncuran

Pos peluncuran Anthropic membandingkan empat model (“n/r” menandai tanda hubung). Sel Sonnet 5.5 adalah upaya maksimum kecuali ditandai; API secara default ke tinggi, Claude Code dan aplikasi ke sedang.

Tolok Ukur Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ n/r
FrontierCode 1.1 (Utama) 46.2% Maks² / 52.1% Xhigh 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% n/r
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
Humanity’s Last Exam (dengan alat) 64.5% 54.9% 67.7% n/r
OSWorld 2.1 (parsial) 80.1% 57.0% 81.8% n/r
Chartography (tanpa alat) 61.6% 15.6% 64.4% 53.6%⁴

Catatan kaki, dalam istilah sederhana:

  1. Skor Terminal-Bench Opus 5.5 berada pada xhigh, yang terbaik; pada maks, skornya 64,8%.
  2. FrontierCode memberikan penalti untuk pengeditan di luar cakupan. Pada maks, Sonnet 5.5 lebih sering menjalankan keterampilan peninjauan kode Claude Code, menyebar ke banyak subagen; dalam dua kasus yang diperiksa Cognition, hal itu menyebabkan timeout atau pengeditan di luar cakupan.
  3. Artificial Analysis menjalankan kedua uji coba pekerjaan-pengetahuan pada penerapan pra-rilis dengan bug keluaran terstruktur, yang telah diperbaiki. Anthropic memperkirakan dampak kecil, bahkan mungkin meremehkan Sonnet 5.5.
  4. OpenAI baru-baru ini memperbaiki bug pemahaman gambar GPT-6 Sol yang mungkin tidak tercermin dalam skor AA dan Surge AI.

Siapa yang menjalankan setiap tolok ukur

Anthropic menjalankan setiap pengujian sendiri kecuali pihak ketiga disebutkan. Baris lintas-vendor berbagi nama tolok ukur, bukan harness atau pengaturan upaya.

Pelaksana Tolok Ukur Kondisi
Anthropic Terminal-Bench 4.0, HLE, OSWorld 2.1 TB: Claude Code --bare, 5 percobaan, perlindungan aktif. HLE: pencarian dan eksekusi kode. OSWorld: 108 tugas
Cognition FrontierCode 1.1 Claude di Claude Code, GPT di Codex CLI
Cursor CursorBench 4.0 Harness produksi Cursor; Anthropic memperkirakan biaya pada harga daftar
Artificial Analysis GDPval-AA, AA-Briefcase Penerapan pra-rilis
Anthropic Chartography Tolok ukur Surge AI, dinilai dengan Gemini 3.5 Flash; skor Sol dari Surge

Fallback menyentuh 1,5% percobaan Terminal-Bench Sonnet 5.5 tetapi 10% percobaan Opus 5.5 (kartu sistem §8.5), jadi bacalah keunggulan 4,2 poin Sonnet dengan hati-hati.

Ekstra kartu sistem

Baris satu hingga enam adalah ringkasan upaya maksimum kartu sistem.

Tolok Ukur Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench Multilingual 90.3 78.3 93.9
SWE-Bench Multimodal 54.3 28.1 61.4
HLE, tanpa alat 56.9 43.1 64.4
HealthBench Professional 69.2 57.8 65.6
AutomationBench (jalankan oleh Zapier) 44.7 10.7 42.5
DeepSWE v1.1 71.0% n/r n/r
Terminal-Bench-Science 0.1 59.9% n/r 58.7%
FrontierSWE v2 (jalankan oleh Proximal) 61.9% n/r 62.3%
ArXivMath (tanpa alat / alat) 86.8% / 95.2% n/r 91.2% / 96.9%
ProgramBench (konteks panjang) 79.7% 77.3% 91.2%
OSWorld 2.1, lulus ketat 43.5% 25.6% 48.7%
Toolathlon-Verified (Lulus@1) 77.8% 74.7% 77.8%
OfficeQA / OfficeQA Pro 76.9% / 65.6% 75.1% / 62.1% 78.9% / 67.7%

Sonnet 5.5 mengungguli Opus 5.5 pada HealthBench Professional, AutomationBench, dan Terminal-Bench-Science; Opus memimpin paling jauh pada ProgramBench, SWE-Bench Pro, dan HLE tanpa alat. Angka utama 80,1% OSWorld adalah kredit parsial; hanya 43,5% tugas yang lulus sepenuhnya.

Upaya mengubah gambaran

Bagan peluncuran, sebagai skor (biaya). Biaya Terminal-Bench adalah per percobaan, yang lain per tugas. Dua bagan menunjukkan GPT-5.6 Sol (*) karena angka GPT-6 Sol tidak dipublikasikan.

Model Rendah Sedang Tinggi Xhigh Maks
Terminal-Bench 4.0
Sonnet 5.5 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Opus 5.5 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
Sonnet 5 3.2% ($3.78) 4.4% ($4.83) 4.5% ($8.20) 7.0% ($9.95) 10.3% ($11.62)
GPT-5.6 Sol* 7.9% ($1.46) 20.9% ($2.69) 26.1% ($4.12) 28.5% ($5.39) 37.3% ($7.89)
FrontierCode 1.1 Utama
Sonnet 5.5 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
Opus 5.5 47.3% ($0.40) 54.6% ($0.80) 54.0% ($1.09) 51.4% ($2.25) 54.4% ($6.19)
Sonnet 5 28.7% ($2.39) 35.2% ($3.81) 39.4% ($6.10) 42.7% ($10.07) 42.4% ($17.12)
GPT-6 Sol 37.3% ($0.43) 45.9% ($0.77) 47.7% ($1.04) 48.4% ($1.32) 49.3% ($2.07)
CursorBench 4.0
Sonnet 5.5 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
Opus 5.5 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98) 57.8% ($13.43)
Sonnet 5 24.1% ($1.39) 28.0% ($2.31) 30.8% ($3.48) 32.0% ($4.55) 34.1% ($7.17)
GPT-5.6 Sol* 24.6% ($0.87) 31.1% ($1.77) 35.7% ($2.85) 37.7% ($4.40) 41.7% ($8.23)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 ($0.87) 1461 ($1.64) 1634 ($3.95) 1746 ($9.63) 1811 ($29.19)
Opus 5.5 1285 ($1.15) 1642 ($4.40) 1705 ($6.27) 1780 ($12.27) 1822 ($21.05)
Sonnet 5 923 ($0.82) 1056 ($1.73) 1177 ($3.76) 1274 ($7.56) 1359 ($14.43)
GPT-6 Sol 905 ($0.12) 1142 ($0.34) 1289 ($0.63) 1364 ($1.19) 1483 ($2.67)

Hasil independen

Artificial Analysis menilai Sonnet 5.5 pada angka 56 pada Intelligence Index v4.3.2, #3 dari 216, hanya kalah dari Opus 5.5 pada maks dan xhigh. Sonnet 5 mencetak 38. Biaya untuk menjalankan indeks:

Upaya Skor indeks Biaya untuk menjalankan
maks 55.98 $8,977
xhigh 51.85 $2,738
tinggi 46.74 $1,176
sedang 40.74 $701
rendah 35.84 $544

Maks membutuhkan biaya 7,6x tinggi untuk 9,2 poin lebih. Pembacaan OfficeChai tentang AA menempatkan Sonnet 5.5 di luar batas Pareto, paling kompetitif biaya pada tinggi, dan menghitung sekitar 193.000 token keluaran per tugas indeks pada maks.

Tolok ukur keamanan

Injeksi prompt, sesuai kartu sistem:

Evaluasi siber berjalan dengan perlindungan mati: 46,1% pada CyScenarioBench (Sonnet 5: 0,7%, Opus 5.5: 67,6%). Ini adalah Sonnet pertama dengan perlindungan siber, dan Anthropic memperingatkan akan lebih banyak penolakan bahkan pada tugas keamanan yang tidak berbahaya. Lihat panduan injeksi prompt kami.

Jalankan evaluasi Anda sendiri

Tolok ukur tidak terlihat seperti traffic Anda, dan panduan prompt Anthropic mengatakan bahwa upaya dikalibrasi ulang, jadi jangan gunakan kembali pengaturan Sonnet 5. Di Apidog:

  1. Simpan ANTHROPIC_API_KEY sebagai variabel lingkungan dan simpan 20 hingga 50 prompt nyata sebagai permintaan Pesan.
  2. Pastikan status 200, stop_reason selain "max_tokens" atau "refusal", dan konten yang dibutuhkan jawaban yang benar.
  3. Jalankan pada low, medium, high, dan xhigh, masing-masing satu kali; mengubah upaya membatalkan cache prompt.
  4. Catat tingkat kelulusan dan jumlah token dalam usage, dengan harga $2 masukan dan $10 keluaran per juta.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'

Kirimkan upaya terendah yang tingkat kelulusannya Anda terima. Lihat menguji aplikasi LLM dan menguji API agen AI, lalu unduh Apidog untuk membangun koleksinya.

FAQ

Apakah Sonnet 5.5 mengalahkan Opus 5.5? Pada Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science, dan Chartography dengan alat, ya. Opus 5.5 memimpin atau seri di sisanya.

Berapa skor SWE-Bench Sonnet 5.5? 81,3 pada SWE-Bench Pro dan 90,3 pada Multilingual, pada upaya maksimum.

Mengapa ada dua angka FrontierCode? 46,2% adalah maks, 52,1% adalah xhigh; penyebaran subagen maks menyebabkan penalti di luar cakupan.

Haruskah saya meningkatkan dari Sonnet 5? Ya pada tolok ukur, tetapi baca perubahan API yang merusak di Sonnet 5.5 vs Sonnet 5 terlebih dahulu.

Langkah selanjutnya

Mulai dari high (atau medium untuk pengkodean agentic yang ditentukan dengan baik), seperti yang disarankan Anthropic, dan biarkan evaluasi Anda di Apidog memutuskan apakah peningkatan itu sepadan.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.