Claude Haiku 5.5 Benchmark Testleri

Claude Haiku 5.5 kıyaslamaları: %72,4 OSWorld, 1620 GDPval-AA, %39,2 Terminal-Bench azami çabayla. Her testi kim çalıştırdı, çaba başına maliyetler ve kendi değerlendirmeniz.

Ashley Goolam

Ashley Goolam

8 October 2026

Claude Haiku 5.5 Benchmark Testleri

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Claude Haiku 5.5, OSWorld 2.1'de %72,4, GDPval-AA v2.1'de 1620, FrontierCode 1.1'de %46,4 ve Terminal-Bench 4.0'da %39,2 puan almıştır. Haiku 4.5, bunlardan üçünde %15,7, 735 ve %0,0 puan almıştır. Bunların hepsi maksimum çaba sayılardır; varsayılan orta çaba düzeyinde, GDPval-AA 1277'ye düşer. Henüz hiçbir bağımsız laboratuvar Haiku 5.5 sonuçlarını yayımlamamıştır.

Aşağıda: her Claude Haiku 5.5 kıyaslaması, bunu kimin çalıştırdığı, çaba düzeyinin puan ve maliyeti nasıl etkilediği ve modeli Apidog'da kendi trafiğinizde nasıl test edeceğiniz yer almaktadır. Özellikler ve fiyatlandırma için, Claude Haiku 5.5 nedir makalesiyle başlayın.

button

Lansman tablosu

Her Haiku 5.5 hücresi, maksimum çaba düzeyinde adaptif düşünme kullanır ve genellikle beş deneme üzerinden ortalaması alınır (Terminal-Bench görev başına on deneme kullanmıştır). “n/r” yayımlanmış bir sonuç olmadığını belirtir.

Kıyaslama Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, çevrimdışı alt küme %72,4 %15,7 %48,9 %83,9
Humanity’s Last Exam, araçsız %45,9 %10,2 n/r %56,9
Humanity’s Last Exam, araçlarla %57,4 %18,7 n/r %64,5
Terminal-Bench 4.0 %39,2 %0,0 %16,4 %70,6
FrontierCode 1.1 (Ana) %46,4 n/r %42,4 %52,1 (xhigh)
Chartography, araçsız %46,4 %6,4 %29,1 %61,6

Her kıyaslamayı kim çalıştırdı

Anthropic testlerin çoğunu kendi yürüttü. Tedarikçi bazında farklı satırlar bir kıyaslama adını paylaşır, ancak her zaman aynı test çerçevesini veya çaba ayarını değil.

Kıyaslama Kim çalıştırdı Koşullar
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, bağımsız olarak GDPval-AA: 220 görev, 44 meslek, Elo 1600'de DeepSeek V4.1 Flash (maks) ile sabitlenmiş; Briefcase: çok haftalı projeler
FrontierCode 1.1 Cognition Claude Code'da Claude, Codex'te GPT; Ana = 150 görevin en zor 100'ü
Chartography Anthropic, Surge AI'ın kıyaslamasında Gemini 3.5 Flash değerlendirici; Luna puanı Surge AI'dan
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 görev, her biri 10 deneme, korumalar açık
OSWorld 2.1 Anthropic 108 görevin 82'si, 1080p, 500 adıma kadar
Humanity’s Last Exam Anthropic 980 bin belirteç görev bütçesi, Opus 4.6 değerlendirici

İki GPT-6 Luna hücresinin bağlama ihtiyacı var. Anthropic, Luna'nın OSWorld puanını OpenAI'ın API'si aracılığıyla aynı 82 görev üzerinde çalıştırdı. Luna'nın Terminal-Bench %16,4'ü genel liderlik tablosundan gelmektedir (Codex CLI, maksimum çaba). Terminal-Bench'te, korumalar Haiku 5.5 denemelerinin %1,8'ini (660'tan 12'si) durdurdu ve her biri başarısız sayıldı.

FrontierCode tuzağı

Lansman tablosu, Haiku 5.5'i maksimumda (%46,4) Sonnet 5.5'in en iyi puanı olan xhigh (%52,1) ile yan yana koyar. Sistem kartı, benzer karşılaştırmalı sayıları vermektedir:

FrontierCode 1.1 Ana Genişletilmiş
Haiku 5.5, maks %46,4 %58,4
Haiku 5.5, xhigh %45,8 n/r
Sonnet 5.5, maks %46,2 %59,1
Sonnet 5.5, xhigh %52,1 %64,4

Maksimum çaba düzeyinde, Haiku 5.5, Ana kategoride Sonnet 5.5'i %46,4'e %46,2 ile az farkla geçer. Her modelin en iyi ayarında, Sonnet 5,7 puan öndedir. Alıntı yaparken hangi çaba düzeyini kastettiğinizi belirtin.

Sistem kartı ekstraları

Sistem kartı, lansman gönderisinin atladığı satırları ekler. Belirtilmediği sürece hepsi maksimum çaba düzeyindedir.

Kıyaslama Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64,8 n/r 81,3
SWE-bench Çok Dilli 83,7 67,4 90,3
SWE-bench Çok Modlu 30,7 19,8 54,3
OSWorld 2.1, katı geçme oranı %37,1 n/r %48,8
Chartography, araçlarla %86,2 %8,8 %90,2
OfficeQA / OfficeQA Pro %73,5 / %60,3 %63,0 / %47,1 %76,9 / %65,6
HealthBench Professional (uzunluğa göre ayarlanmış) %64,8 %32,2 %69,2

OSWorld'ün %72,4'ü kısmi kredi; görevlerin yalnızca %37,1'i doğrudan geçer. Chartography, araçlarla neredeyse ikiye katlanır (%46,4'ten %86,2'ye), bu nedenle Haiku 5.5'e grafik çalışmaları için araçlar sağlayın.

Varsayılan çaba düzeyinde puanlar daha düşük

Haiku 5.5, Claude API'sinde ve Claude Code'da varsayılan olarak orta çaba düzeyindedir. Sistem kartı bu varsayılan çaba düzeyindeki sonuçları rapor eder:

Kıyaslama Orta (varsayılan) Maksimum Not
GDPval-AA v2.1 1277 1620 Orta, maksimumun çıkış belirteçlerinin yaklaşık onda birini kullandı
AA-Briefcase v1.1 1372 1578 Orta, maksimumun çıkış belirteçlerinin dörtte birinden azını kullandı
HealthBench Professional %59,9 %64,8 Düşük %57,9, yüksek %61,3

output_config.effort olmadan API'yi çağırırsanız sol sütunu bekleyin. Çaba düzeyleri belgeleri beş seviyenin hepsini kapsar.

Çaba düzeyine göre puan ve maliyet

Lansman grafiklerinden, puan (maliyet) olarak. OSWorld ve Terminal-Bench maliyeti deneme başına; GDPval-AA görev başınadır.

Model Düşük Orta Yüksek Çok Yüksek Maksimum
OSWorld 2.1
Haiku 5.5 %42,0 (0,07$) %53,3 (0,13$) %61,3 (0,18$) %67,6 (0,28$) %72,4 (0,61$)
Sonnet 5.5 %57,9 (0,68$) %66,0 (0,93$) %73,2 (1,38$) %81,1 (2,22$) %83,9 (5,73$)
GPT-6 Luna %19,2 (0,04$) %37,5 (0,13$) %42,3 (0,14$) %44,8 (0,17$) %48,9 (0,21$)
GDPval-AA v2.1
Haiku 5.5 1125 (0,012$) 1277 (0,030$) 1420 (0,089$) 1513 (0,27$) 1620 (0,87$)
Sonnet 5.5 1179 (0,22$) 1324 (0,27$) 1551 (0,62$) 1731 (1,88$) 1840 (6,78$)
GPT-6 Luna 1036 (0,004$) 1262 (0,02$) 1344 (0,03$) 1364 (0,05$) 1437 (0,09$)
Terminal-Bench 4.0
Haiku 5.5 %12,7 (0,42$) %20,3 (0,68$) %24,8 (1,04$) %31,5 (1,75$) %39,2 (2,64$)
Sonnet 5.5 %20,0 (0,62$) %28,8 (0,68$) %43,0 (1,46$) %61,5 (4,34$) %70,6 (10,44$)

Maliyetler liste fiyatlarını kullanır: 100 bin belirtece kadar olan istemler için milyon belirteç başına 0,10$/0,50$, bunun üzeri daha yüksek (bkz. fiyatlandırma dökümü).

Haiku 5.5'in hala geride kaldığı yerler

Sonnet 5.5, lansman tablosunun her satırında öndedir. Haiku'nun tek başa baş zaferi, FrontierCode'da eşit maksimum çaba düzeyindedir. En büyük fark Terminal-Bench 4.0'dadır: %39,2'ye %70,6. SWE-Bench Pro (64,8'e 81,3) ve SWE-bench Multimodal (30,7'ye 54,3) aynı deseni göstermektedir.

Anthropic da kabul ediyor: Sonnet 5.5 ve Opus 5.5, "karmaşık ajanik kodlama görevleri için daha iyi seçenekler olmaya devam ediyor." Haiku 5.5, dar kapsamlı işlere uyar: sıkıştırma, özetleme, sınıflandırma, tarayıcı kullanımı ve daha büyük bir modelin altındaki alt ajanlar. Bunu ucuz bir alt ajan olarak çalıştırmak Claude Code'da Haiku 5.5 makalesinde ele alınmıştır.

Bağımsız sonuçlar: henüz yok

8 Ekim 2026 itibarıyla hiçbir bağımsız laboratuvar Haiku 5.5 sonuçlarını yayımlamamıştır. Artificial Analysis'in Haiku 5.5 sayfası 404 hatası döndürüyor ve liderlik tablosu yalnızca Claude 4.5 Haiku'yu listeliyor. Vals, LMArena, SWE-bench ve Aider da hiçbir şey göstermedi. Üçüncü taraf bir hız verisi yok; Anthropic, Haiku 5.5'i standart hızda "bugüne kadarki en hızlı modeli" olarak adlandırıyor, Hızlı Mod'daki Opus'tan daha yavaş.

En yakın dış sayı Cursor'dan geliyor. Model belgeleri, Haiku 5.5'in "maksimum çaba düzeyinde CursorBench'te %48,4 puan aldığını" belirtiyor, bu düşük düzeyde %30,9'dan artış demek. Düşünme kapalıyken, Cursor, düşünme açıkken %30,9 ila %42,3 puan alınan aynı çaba düzeylerinde %22,1 ila %26,2 rapor ediyor.

Müşteriler ne rapor ediyor

Bunlar Anthropic'in lansman gönderisinden alınmıştır ve bağımsız olarak doğrulanmamıştır:

Kendi değerlendirmenizi çalıştırın

Kıyaslamalar trafiğinize benzemez. Anthropic'in istem rehberi, xhigh veya maksimumu yalnızca değerlendirmelerinizin bir kazanç gösterdiği durumlarda kullanmanızı ve karşılaştırmak için aynı değerlendirmeleri Sonnet 5.5 üzerinde çalıştırmanızı önerir. Apidog'da:

  1. ANTHROPIC_API_KEY'i bir ortam değişkeni olarak saklayın ve 20 ila 50 gerçek istemi Mesajlar isteği olarak kaydedin.
  2. Onaylamalar ekleyin: durum 200, "max_tokens" veya "refusal" dışında bir stop_reason ve doğru bir cevabın ihtiyaç duyduğu içerik.
  3. Kümeyi düşük, orta ve yüksek seviyelerde çalıştırın. Çaba düzeyini değiştirmek istem önbelleğini geçersiz kılar.
  4. Başarı oranını ve kullanım içindeki belirteç sayılarını kaydedin. Yeni belirteçleyici, aynı metin için Haiku 4.5'inkinden yaklaşık %30 daha fazla belirteç üretir.
  5. Koleksiyonu çoğaltın, claude-sonnet-5-5'i yerleştirin ve her iki modeli tek bir projede karşılaştırın.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
  }'

temperature, top_p, top_k veya bir asistan ön doldurma göndermeyin; her biri Haiku 5.5'te 400 döndürür. Yanıt bloklarını type'a göre seçin, çünkü bir thinking bloğu önce gelebilir. Bkz. API rehberi ve LLM uygulamalarını test etme.

Sıkça Sorulan Sorular

Sonraki adım

ortadan başlayın ve yalnızca başarı oranı kazancınızın kendini karşıladığı yerlerde yükseltin. Apidog'u indirin, yukarıdaki değerlendirme koleksiyonunu oluşturun ve üretim trafiğini değiştirmeden önce sonuçları Sonnet 5.5 temelinizle birlikte Apidog'da saklayın.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin