Claude Haiku 5.5 Benchmark

Tolok ukur Claude Haiku 5.5: 72,4% OSWorld, 1620 GDPval-AA, 39,2% Terminal-Bench pada upaya maksimal. Siapa yang menjalankan setiap tes, biaya per upaya, dan evaluasi Anda sendiri.

Ashley Goolam

Ashley Goolam

8 October 2026

Claude Haiku 5.5 Benchmark

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Claude Haiku 5.5 mencetak 72,4% pada OSWorld 2.1, 1620 pada GDPval-AA v2.1, 46,4% pada FrontierCode 1.1, dan 39,2% pada Terminal-Bench 4.0. Haiku 4.5 mencetak 15,7%, 735, dan 0,0% pada tiga di antaranya. Semua adalah angka-angka dengan upaya maksimal; pada upaya standar medium, GDPval-AA turun menjadi 1277. Belum ada laboratorium independen yang menerbitkan hasil Haiku 5.5.

Di bawah ini: setiap tolok ukur Claude Haiku 5.5, siapa yang menjalankannya, bagaimana upaya memengaruhi skor dan biaya, serta cara menguji model pada lalu lintas Anda sendiri di Apidog. Untuk spesifikasi dan harga, mulailah dengan apa itu Claude Haiku 5.5.

tombol

Tabel peluncuran

Setiap sel Haiku 5.5 menggunakan pemikiran adaptif pada upaya maksimal, biasanya dirata-ratakan dari lima percobaan (Terminal-Bench menggunakan sepuluh per tugas). "n/r" berarti tidak ada hasil yang diterbitkan.

Tolok Ukur Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, subset offline 72.4% 15.7% 48.9% 83.9%
Ujian Terakhir Manusia, tanpa alat 45.9% 10.2% n/r 56.9%
Ujian Terakhir Manusia, dengan alat 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (Utama) 46.4% n/r 42.4% 52.1% (sangat tinggi)
Kartografi, tanpa alat 46.4% 6.4% 29.1% 61.6%

Siapa yang menjalankan setiap tolok ukur

Anthropic menjalankan sebagian besar tes sendiri. Baris antar vendor berbagi nama tolok ukur, tidak selalu sama dalam pengaturan harness atau upaya.

Tolok Ukur Siapa yang menjalankannya Kondisi
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, secara independen GDPval-AA: 220 tugas, 44 pekerjaan, Elo dijangkarkan ke DeepSeek V4.1 Flash (maks) pada 1600; Briefcase: proyek multi-minggu
FrontierCode 1.1 Cognition Claude di Claude Code, GPT di Codex; Utama = 100 tugas tersulit dari 150
Kartografi Anthropic, pada tolok ukur Surge AI Penilai Gemini 3.5 Flash; skor Luna dari Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 tugas, 10 percobaan masing-masing, pengamanan aktif
OSWorld 2.1 Anthropic 82 dari 108 tugas, 1080p, hingga 500 langkah
Ujian Terakhir Manusia Anthropic Anggaran tugas 980K token, penilai Opus 4.6

Dua sel GPT-6 Luna memerlukan konteks. Anthropic menjalankan skor OSWorld Luna melalui API OpenAI pada 82 tugas yang sama. Terminal-Bench Luna 16,4% berasal dari papan peringkat publik (Codex CLI, upaya maksimal). Pada Terminal-Bench, pengamanan menghentikan 1,8% percobaan Haiku 5.5 (12 dari 660), dan setiap percobaan dihitung sebagai kegagalan.

Jebakan FrontierCode

Tabel peluncuran menempatkan Haiku 5.5 pada maks (46,4%) di samping Sonnet 5.5 pada sangat tinggi (52,1%), skor terbaik Sonnet. Kartu sistem memberikan angka-angka yang sebanding:

FrontierCode 1.1 Utama Diperluas
Haiku 5.5, maks 46.4% 58.4%
Haiku 5.5, sangat tinggi 45.8% n/r
Sonnet 5.5, maks 46.2% 59.1%
Sonnet 5.5, sangat tinggi 52.1% 64.4%

Pada upaya maksimal, Haiku 5.5 sedikit mengungguli Sonnet 5.5 pada Utama, 46,4% berbanding 46,2%. Pada pengaturan terbaik setiap model, Sonnet memimpin dengan 5,7 poin. Sebutkan upaya yang Anda maksud saat mengutip salah satunya.

Tambahan kartu sistem

Kartu sistem menambahkan baris yang dilewati postingan peluncuran. Semua adalah upaya maksimal kecuali jika disebutkan.

Tolok Ukur Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench Multilingual 83.7 67.4 90.3
SWE-bench Multimodal 30.7 19.8 54.3
OSWorld 2.1, tingkat kelulusan ketat 37.1% n/r 48.8%
Kartografi, dengan alat 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Profesional (disesuaikan panjang) 64.8% 32.2% 69.2%

72,4% OSWorld adalah kredit parsial; hanya 37,1% tugas yang lulus sepenuhnya. Kartografi hampir dua kali lipat dengan alat (46,4% menjadi 86,2%), jadi berikan alat kepada Haiku 5.5 untuk pekerjaan grafik.

Skor upaya standar lebih rendah

Haiku 5.5 secara default menggunakan medium pada API Claude dan di Claude Code. Kartu sistem melaporkan hasil upaya standar ini:

Tolok Ukur Menengah (standar) Maks Catatan
GDPval-AA v2.1 1277 1620 Menengah menggunakan sekitar sepersepuluh token output maks
AA-Briefcase v1.1 1372 1578 Menengah menggunakan kurang dari seperempat token output maks
HealthBench Profesional 59.9% 64.8% Rendah 57,9%, tinggi 61,3%

Panggil API tanpa output_config.effort dan harapkan kolom kiri. Dokumen upaya mencakup kelima tingkatan.

Skor dan biaya berdasarkan upaya

Dari grafik peluncuran, sebagai skor (biaya). Biaya OSWorld dan Terminal-Bench adalah per percobaan; GDPval-AA adalah per tugas.

Model Rendah Menengah Tinggi Sangat tinggi Maks
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

Biaya menggunakan harga daftar: $0.10/$0.50 per juta token untuk prompt hingga 100K token, lebih tinggi di atas itu (lihat rincian harga).

Di mana Haiku 5.5 masih tertinggal

Sonnet 5.5 memimpin setiap baris tabel peluncuran. Satu-satunya kemenangan head-to-head Haiku adalah FrontierCode pada upaya maksimal yang cocok. Kesenjangan terluas adalah Terminal-Bench 4.0: 39,2% versus 70,6%. SWE-Bench Pro (64,8 versus 81,3) dan SWE-bench Multimodal (30,7 versus 54,3) menunjukkan pola yang sama.

Anthropic setuju: Sonnet 5.5 dan Opus 5.5 "tetap menjadi pilihan yang lebih baik untuk tugas pengkodean agen yang kompleks." Haiku 5.5 cocok untuk pekerjaan dengan cakupan sempit: pemadatan, peringkasan, klasifikasi, penggunaan browser, dan sub-agen di bawah model yang lebih besar. Menjalankannya sebagai sub-agen murah dibahas di Haiku 5.5 di Claude Code.

Hasil independen: belum ada

Per 8 Oktober 2026, belum ada laboratorium independen yang menerbitkan hasil Haiku 5.5. Halaman Haiku 5.5 Artificial Analysis mengembalikan 404, dan papan peringkatnya hanya mencantumkan Claude 4.5 Haiku. Vals, LMArena, SWE-bench, dan Aider juga tidak menunjukkan apa pun. Tidak ada angka kecepatan pihak ketiga; Anthropic menyebut Haiku 5.5 sebagai "model tercepat hingga saat ini" pada kecepatan standar, lebih lambat dari Opus dalam Mode Cepat.

Angka eksternal terdekat berasal dari Cursor. Dokumen modelnya mengatakan Haiku 5.5 "mencetak 48,4% pada CursorBench pada upaya maksimal," naik dari 30,9% pada rendah. Dengan pemikiran dimatikan, Cursor melaporkan 22,1% hingga 26,2% pada tingkat upaya yang sama di mana pemikiran dihidupkan mencetak 30,9% hingga 42,3%.

Apa yang dilaporkan pelanggan

Ini berasal dari postingan peluncuran Anthropic dan belum diverifikasi secara independen:

Jalankan evaluasi Anda sendiri

Tolok ukur tidak terlihat seperti lalu lintas Anda. Panduan prompt Anthropic menyarankan penggunaan xhigh atau maks hanya jika evaluasi Anda menunjukkan peningkatan, dan menjalankan evaluasi yang sama pada Sonnet 5.5 untuk membandingkan. Di Apidog:

  1. Simpan ANTHROPIC_API_KEY sebagai variabel lingkungan dan simpan 20 hingga 50 prompt nyata sebagai permintaan Pesan.
  2. Tambahkan penegasan: status 200, stop_reason selain "max_tokens" atau "refusal", dan konten yang diperlukan untuk jawaban yang benar.
  3. Jalankan set pada low, medium, dan high. Mengubah upaya membatalkan cache prompt.
  4. Catat tingkat kelulusan dan jumlah token dalam usage. Tokenizer baru menghasilkan sekitar 30% lebih banyak token daripada Haiku 4.5 untuk teks yang sama.
  5. Duplikat koleksi, ganti dengan claude-sonnet-5-5, dan bandingkan kedua model dalam satu proyek.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
  }'

Jangan mengirim temperature, top_p, top_k, atau prefill asisten; masing-masing mengembalikan 400 pada Haiku 5.5. Pilih blok respons berdasarkan type, karena blok thinking dapat muncul terlebih dahulu. Lihat panduan API dan pengujian aplikasi LLM.

FAQ

Apakah Claude Haiku 5.5 lebih baik dari Sonnet 5.5? Tidak berdasarkan angka Anthropic. Sonnet 5.5 memimpin setiap baris tabel peluncuran; Haiku hanya sedikit mengunggulinya pada FrontierCode ketika keduanya berjalan pada maksimal (46,4% vs 46,2%). Lihat Haiku 5.5 vs Haiku 4.5 untuk pandangan peningkatan.

Berapa skor SWE-bench Haiku 5.5? 64,8 pada SWE-Bench Pro, 83,7 pada SWE-bench Multilingual, dan 30,7 pada SWE-bench Multimodal, semuanya pada upaya maksimal.

Pada upaya berapa tolok ukur dijalankan? Maksimal, biasanya dirata-ratakan dari lima percobaan. Standar API adalah medium, di mana GDPval-AA mencetak 1277 alih-alih 1620.

Apakah ada tolok ukur Haiku 5.5 independen? Belum. Artificial Analysis menjalankan GDPval-AA dan AA-Briefcase secara independen, tetapi Anthropic menerbitkan skor tersebut; AA tidak memiliki halaman Haiku 5.5.

Apakah GPT-6 Luna lebih murah? Biasanya. Luna memiliki biaya lebih rendah pada setiap tingkat upaya GDPval-AA dan setiap tingkat OSWorld kecuali menengah, di mana keduanya memiliki biaya yang hampir sama. Haiku 5.5 mencetak lebih tinggi pada keduanya.

Langkah selanjutnya

Mulailah pada medium dan tingkatkan hanya jika peningkatan tingkat kelulusan Anda sepadan dengan biayanya. Unduh Apidog, bangun koleksi evaluasi di atas, dan simpan hasilnya di Apidog di samping baseline Sonnet 5.5 Anda sebelum Anda mengalihkan lalu lintas produksi.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.