Claude Haiku 5.5 mencetak 72,4% pada OSWorld 2.1, 1620 pada GDPval-AA v2.1, 46,4% pada FrontierCode 1.1, dan 39,2% pada Terminal-Bench 4.0. Haiku 4.5 mencetak 15,7%, 735, dan 0,0% pada tiga di antaranya. Semua adalah angka-angka dengan upaya maksimal; pada upaya standar medium, GDPval-AA turun menjadi 1277. Belum ada laboratorium independen yang menerbitkan hasil Haiku 5.5.
Di bawah ini: setiap tolok ukur Claude Haiku 5.5, siapa yang menjalankannya, bagaimana upaya memengaruhi skor dan biaya, serta cara menguji model pada lalu lintas Anda sendiri di Apidog. Untuk spesifikasi dan harga, mulailah dengan apa itu Claude Haiku 5.5.
Tabel peluncuran
Setiap sel Haiku 5.5 menggunakan pemikiran adaptif pada upaya maksimal, biasanya dirata-ratakan dari lima percobaan (Terminal-Bench menggunakan sepuluh per tugas). "n/r" berarti tidak ada hasil yang diterbitkan.
| Tolok Ukur | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, subset offline | 72.4% | 15.7% | 48.9% | 83.9% |
| Ujian Terakhir Manusia, tanpa alat | 45.9% | 10.2% | n/r | 56.9% |
| Ujian Terakhir Manusia, dengan alat | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (Utama) | 46.4% | n/r | 42.4% | 52.1% (sangat tinggi) |
| Kartografi, tanpa alat | 46.4% | 6.4% | 29.1% | 61.6% |
Siapa yang menjalankan setiap tolok ukur
Anthropic menjalankan sebagian besar tes sendiri. Baris antar vendor berbagi nama tolok ukur, tidak selalu sama dalam pengaturan harness atau upaya.
| Tolok Ukur | Siapa yang menjalankannya | Kondisi |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, secara independen | GDPval-AA: 220 tugas, 44 pekerjaan, Elo dijangkarkan ke DeepSeek V4.1 Flash (maks) pada 1600; Briefcase: proyek multi-minggu |
| FrontierCode 1.1 | Cognition | Claude di Claude Code, GPT di Codex; Utama = 100 tugas tersulit dari 150 |
| Kartografi | Anthropic, pada tolok ukur Surge AI | Penilai Gemini 3.5 Flash; skor Luna dari Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 tugas, 10 percobaan masing-masing, pengamanan aktif |
| OSWorld 2.1 | Anthropic | 82 dari 108 tugas, 1080p, hingga 500 langkah |
| Ujian Terakhir Manusia | Anthropic | Anggaran tugas 980K token, penilai Opus 4.6 |
Dua sel GPT-6 Luna memerlukan konteks. Anthropic menjalankan skor OSWorld Luna melalui API OpenAI pada 82 tugas yang sama. Terminal-Bench Luna 16,4% berasal dari papan peringkat publik (Codex CLI, upaya maksimal). Pada Terminal-Bench, pengamanan menghentikan 1,8% percobaan Haiku 5.5 (12 dari 660), dan setiap percobaan dihitung sebagai kegagalan.
Jebakan FrontierCode
Tabel peluncuran menempatkan Haiku 5.5 pada maks (46,4%) di samping Sonnet 5.5 pada sangat tinggi (52,1%), skor terbaik Sonnet. Kartu sistem memberikan angka-angka yang sebanding:
| FrontierCode 1.1 | Utama | Diperluas |
|---|---|---|
| Haiku 5.5, maks | 46.4% | 58.4% |
| Haiku 5.5, sangat tinggi | 45.8% | n/r |
| Sonnet 5.5, maks | 46.2% | 59.1% |
| Sonnet 5.5, sangat tinggi | 52.1% | 64.4% |
Pada upaya maksimal, Haiku 5.5 sedikit mengungguli Sonnet 5.5 pada Utama, 46,4% berbanding 46,2%. Pada pengaturan terbaik setiap model, Sonnet memimpin dengan 5,7 poin. Sebutkan upaya yang Anda maksud saat mengutip salah satunya.
Tambahan kartu sistem
Kartu sistem menambahkan baris yang dilewati postingan peluncuran. Semua adalah upaya maksimal kecuali jika disebutkan.
| Tolok Ukur | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench Multilingual | 83.7 | 67.4 | 90.3 |
| SWE-bench Multimodal | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, tingkat kelulusan ketat | 37.1% | n/r | 48.8% |
| Kartografi, dengan alat | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Profesional (disesuaikan panjang) | 64.8% | 32.2% | 69.2% |
72,4% OSWorld adalah kredit parsial; hanya 37,1% tugas yang lulus sepenuhnya. Kartografi hampir dua kali lipat dengan alat (46,4% menjadi 86,2%), jadi berikan alat kepada Haiku 5.5 untuk pekerjaan grafik.
Skor upaya standar lebih rendah
Haiku 5.5 secara default menggunakan medium pada API Claude dan di Claude Code. Kartu sistem melaporkan hasil upaya standar ini:
| Tolok Ukur | Menengah (standar) | Maks | Catatan |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Menengah menggunakan sekitar sepersepuluh token output maks |
| AA-Briefcase v1.1 | 1372 | 1578 | Menengah menggunakan kurang dari seperempat token output maks |
| HealthBench Profesional | 59.9% | 64.8% | Rendah 57,9%, tinggi 61,3% |
Panggil API tanpa output_config.effort dan harapkan kolom kiri. Dokumen upaya mencakup kelima tingkatan.
Skor dan biaya berdasarkan upaya
Dari grafik peluncuran, sebagai skor (biaya). Biaya OSWorld dan Terminal-Bench adalah per percobaan; GDPval-AA adalah per tugas.
| Model | Rendah | Menengah | Tinggi | Sangat tinggi | Maks |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
- Maksimal mahal untuk langkah terakhirnya. Pada GDPval-AA, maksimal menghabiskan sekitar 28x menengah untuk 343 poin Elo lebih. Pada OSWorld, maksimal menghabiskan lebih dari dua kali sangat tinggi untuk 4,8 poin.
- Haiku 5.5 pada menengah mengalahkan Luna pada maksimal di OSWorld: 53,3% untuk $0.13 versus 48,9% untuk $0.21. Luna lebih murah pada setiap tingkatan pencocokan lainnya; pada menengah keduanya memiliki biaya yang hampir sama. Lihat Haiku 5.5 vs GPT-6 Luna.
- Haiku 5.5 pada maksimal mengalahkan Sonnet 5.5 pada menengah di OSWorld (72,4% untuk $0.61 versus 66,0% untuk $0.93).
- Terminal-Bench adalah pengecualian. Sonnet 5.5 pada tinggi (43,0%, $1.46) mengalahkan Haiku 5.5 pada maksimal (39,2%, $2.64) dengan biaya lebih sedikit. Biaya Sonnet menggunakan harga baca cache baru $0.10.
Biaya menggunakan harga daftar: $0.10/$0.50 per juta token untuk prompt hingga 100K token, lebih tinggi di atas itu (lihat rincian harga).
Di mana Haiku 5.5 masih tertinggal
Sonnet 5.5 memimpin setiap baris tabel peluncuran. Satu-satunya kemenangan head-to-head Haiku adalah FrontierCode pada upaya maksimal yang cocok. Kesenjangan terluas adalah Terminal-Bench 4.0: 39,2% versus 70,6%. SWE-Bench Pro (64,8 versus 81,3) dan SWE-bench Multimodal (30,7 versus 54,3) menunjukkan pola yang sama.
Anthropic setuju: Sonnet 5.5 dan Opus 5.5 "tetap menjadi pilihan yang lebih baik untuk tugas pengkodean agen yang kompleks." Haiku 5.5 cocok untuk pekerjaan dengan cakupan sempit: pemadatan, peringkasan, klasifikasi, penggunaan browser, dan sub-agen di bawah model yang lebih besar. Menjalankannya sebagai sub-agen murah dibahas di Haiku 5.5 di Claude Code.
Hasil independen: belum ada
Per 8 Oktober 2026, belum ada laboratorium independen yang menerbitkan hasil Haiku 5.5. Halaman Haiku 5.5 Artificial Analysis mengembalikan 404, dan papan peringkatnya hanya mencantumkan Claude 4.5 Haiku. Vals, LMArena, SWE-bench, dan Aider juga tidak menunjukkan apa pun. Tidak ada angka kecepatan pihak ketiga; Anthropic menyebut Haiku 5.5 sebagai "model tercepat hingga saat ini" pada kecepatan standar, lebih lambat dari Opus dalam Mode Cepat.
Angka eksternal terdekat berasal dari Cursor. Dokumen modelnya mengatakan Haiku 5.5 "mencetak 48,4% pada CursorBench pada upaya maksimal," naik dari 30,9% pada rendah. Dengan pemikiran dimatikan, Cursor melaporkan 22,1% hingga 26,2% pada tingkat upaya yang sama di mana pemikiran dihidupkan mencetak 30,9% hingga 42,3%.
Apa yang dilaporkan pelanggan
Ini berasal dari postingan peluncuran Anthropic dan belum diverifikasi secara independen:
- HubSpot: 92,8% rata-rata dari tiga percobaan pada suite portal CRM simulasinya, skor terbaik yang pernah dilihatnya pada suite tersebut.
- AlphaSense: 0,84 versus 0,76 Haiku 4.5 pada 400 kueri Tanya dalam Dokumen, yang disebutnya signifikan secara statistik.
- Box: 11 poin lebih tinggi dari Haiku 4.5 dengan sekitar setengah latensi, dalam pengujian awal.
- Asana: latensi lebih dari 30% lebih rendah untuk penyelesaian tugas versus modelnya saat ini.
- Cognition: Devin Fusion memegang skor FrontierCode 66,2 dengan Haiku 5.5 sebagai rekan dan Opus 5.5 sebagai pemimpin. Itu adalah sistem dua model, bukan Haiku saja.
Jalankan evaluasi Anda sendiri
Tolok ukur tidak terlihat seperti lalu lintas Anda. Panduan prompt Anthropic menyarankan penggunaan xhigh atau maks hanya jika evaluasi Anda menunjukkan peningkatan, dan menjalankan evaluasi yang sama pada Sonnet 5.5 untuk membandingkan. Di Apidog:
- Simpan
ANTHROPIC_API_KEYsebagai variabel lingkungan dan simpan 20 hingga 50 prompt nyata sebagai permintaan Pesan. - Tambahkan penegasan: status 200,
stop_reasonselain"max_tokens"atau"refusal", dan konten yang diperlukan untuk jawaban yang benar. - Jalankan set pada
low,medium, danhigh. Mengubah upaya membatalkan cache prompt. - Catat tingkat kelulusan dan jumlah token dalam
usage. Tokenizer baru menghasilkan sekitar 30% lebih banyak token daripada Haiku 4.5 untuk teks yang sama. - Duplikat koleksi, ganti dengan
claude-sonnet-5-5, dan bandingkan kedua model dalam satu proyek.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
}'
Jangan mengirim temperature, top_p, top_k, atau prefill asisten; masing-masing mengembalikan 400 pada Haiku 5.5. Pilih blok respons berdasarkan type, karena blok thinking dapat muncul terlebih dahulu. Lihat panduan API dan pengujian aplikasi LLM.
FAQ
Apakah Claude Haiku 5.5 lebih baik dari Sonnet 5.5? Tidak berdasarkan angka Anthropic. Sonnet 5.5 memimpin setiap baris tabel peluncuran; Haiku hanya sedikit mengunggulinya pada FrontierCode ketika keduanya berjalan pada maksimal (46,4% vs 46,2%). Lihat Haiku 5.5 vs Haiku 4.5 untuk pandangan peningkatan.
Berapa skor SWE-bench Haiku 5.5? 64,8 pada SWE-Bench Pro, 83,7 pada SWE-bench Multilingual, dan 30,7 pada SWE-bench Multimodal, semuanya pada upaya maksimal.
Pada upaya berapa tolok ukur dijalankan? Maksimal, biasanya dirata-ratakan dari lima percobaan. Standar API adalah medium, di mana GDPval-AA mencetak 1277 alih-alih 1620.
Apakah ada tolok ukur Haiku 5.5 independen? Belum. Artificial Analysis menjalankan GDPval-AA dan AA-Briefcase secara independen, tetapi Anthropic menerbitkan skor tersebut; AA tidak memiliki halaman Haiku 5.5.
Apakah GPT-6 Luna lebih murah? Biasanya. Luna memiliki biaya lebih rendah pada setiap tingkat upaya GDPval-AA dan setiap tingkat OSWorld kecuali menengah, di mana keduanya memiliki biaya yang hampir sama. Haiku 5.5 mencetak lebih tinggi pada keduanya.
Langkah selanjutnya
Mulailah pada medium dan tingkatkan hanya jika peningkatan tingkat kelulusan Anda sepadan dengan biayanya. Unduh Apidog, bangun koleksi evaluasi di atas, dan simpan hasilnya di Apidog di samping baseline Sonnet 5.5 Anda sebelum Anda mengalihkan lalu lintas produksi.
