Claude Haiku 5.5, OSWorld 2.1'de %72,4, GDPval-AA v2.1'de 1620, FrontierCode 1.1'de %46,4 ve Terminal-Bench 4.0'da %39,2 puan almıştır. Haiku 4.5, bunlardan üçünde %15,7, 735 ve %0,0 puan almıştır. Bunların hepsi maksimum çaba sayılardır; varsayılan orta çaba düzeyinde, GDPval-AA 1277'ye düşer. Henüz hiçbir bağımsız laboratuvar Haiku 5.5 sonuçlarını yayımlamamıştır.
Aşağıda: her Claude Haiku 5.5 kıyaslaması, bunu kimin çalıştırdığı, çaba düzeyinin puan ve maliyeti nasıl etkilediği ve modeli Apidog'da kendi trafiğinizde nasıl test edeceğiniz yer almaktadır. Özellikler ve fiyatlandırma için, Claude Haiku 5.5 nedir makalesiyle başlayın.
Lansman tablosu
Her Haiku 5.5 hücresi, maksimum çaba düzeyinde adaptif düşünme kullanır ve genellikle beş deneme üzerinden ortalaması alınır (Terminal-Bench görev başına on deneme kullanmıştır). “n/r” yayımlanmış bir sonuç olmadığını belirtir.
| Kıyaslama | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, çevrimdışı alt küme | %72,4 | %15,7 | %48,9 | %83,9 |
| Humanity’s Last Exam, araçsız | %45,9 | %10,2 | n/r | %56,9 |
| Humanity’s Last Exam, araçlarla | %57,4 | %18,7 | n/r | %64,5 |
| Terminal-Bench 4.0 | %39,2 | %0,0 | %16,4 | %70,6 |
| FrontierCode 1.1 (Ana) | %46,4 | n/r | %42,4 | %52,1 (xhigh) |
| Chartography, araçsız | %46,4 | %6,4 | %29,1 | %61,6 |
Her kıyaslamayı kim çalıştırdı
Anthropic testlerin çoğunu kendi yürüttü. Tedarikçi bazında farklı satırlar bir kıyaslama adını paylaşır, ancak her zaman aynı test çerçevesini veya çaba ayarını değil.
| Kıyaslama | Kim çalıştırdı | Koşullar |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, bağımsız olarak | GDPval-AA: 220 görev, 44 meslek, Elo 1600'de DeepSeek V4.1 Flash (maks) ile sabitlenmiş; Briefcase: çok haftalı projeler |
| FrontierCode 1.1 | Cognition | Claude Code'da Claude, Codex'te GPT; Ana = 150 görevin en zor 100'ü |
| Chartography | Anthropic, Surge AI'ın kıyaslamasında | Gemini 3.5 Flash değerlendirici; Luna puanı Surge AI'dan |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 görev, her biri 10 deneme, korumalar açık |
| OSWorld 2.1 | Anthropic | 108 görevin 82'si, 1080p, 500 adıma kadar |
| Humanity’s Last Exam | Anthropic | 980 bin belirteç görev bütçesi, Opus 4.6 değerlendirici |
İki GPT-6 Luna hücresinin bağlama ihtiyacı var. Anthropic, Luna'nın OSWorld puanını OpenAI'ın API'si aracılığıyla aynı 82 görev üzerinde çalıştırdı. Luna'nın Terminal-Bench %16,4'ü genel liderlik tablosundan gelmektedir (Codex CLI, maksimum çaba). Terminal-Bench'te, korumalar Haiku 5.5 denemelerinin %1,8'ini (660'tan 12'si) durdurdu ve her biri başarısız sayıldı.
FrontierCode tuzağı
Lansman tablosu, Haiku 5.5'i maksimumda (%46,4) Sonnet 5.5'in en iyi puanı olan xhigh (%52,1) ile yan yana koyar. Sistem kartı, benzer karşılaştırmalı sayıları vermektedir:
| FrontierCode 1.1 | Ana | Genişletilmiş |
|---|---|---|
| Haiku 5.5, maks | %46,4 | %58,4 |
| Haiku 5.5, xhigh | %45,8 | n/r |
| Sonnet 5.5, maks | %46,2 | %59,1 |
| Sonnet 5.5, xhigh | %52,1 | %64,4 |
Maksimum çaba düzeyinde, Haiku 5.5, Ana kategoride Sonnet 5.5'i %46,4'e %46,2 ile az farkla geçer. Her modelin en iyi ayarında, Sonnet 5,7 puan öndedir. Alıntı yaparken hangi çaba düzeyini kastettiğinizi belirtin.
Sistem kartı ekstraları
Sistem kartı, lansman gönderisinin atladığı satırları ekler. Belirtilmediği sürece hepsi maksimum çaba düzeyindedir.
| Kıyaslama | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64,8 | n/r | 81,3 |
| SWE-bench Çok Dilli | 83,7 | 67,4 | 90,3 |
| SWE-bench Çok Modlu | 30,7 | 19,8 | 54,3 |
| OSWorld 2.1, katı geçme oranı | %37,1 | n/r | %48,8 |
| Chartography, araçlarla | %86,2 | %8,8 | %90,2 |
| OfficeQA / OfficeQA Pro | %73,5 / %60,3 | %63,0 / %47,1 | %76,9 / %65,6 |
| HealthBench Professional (uzunluğa göre ayarlanmış) | %64,8 | %32,2 | %69,2 |
OSWorld'ün %72,4'ü kısmi kredi; görevlerin yalnızca %37,1'i doğrudan geçer. Chartography, araçlarla neredeyse ikiye katlanır (%46,4'ten %86,2'ye), bu nedenle Haiku 5.5'e grafik çalışmaları için araçlar sağlayın.
Varsayılan çaba düzeyinde puanlar daha düşük
Haiku 5.5, Claude API'sinde ve Claude Code'da varsayılan olarak orta çaba düzeyindedir. Sistem kartı bu varsayılan çaba düzeyindeki sonuçları rapor eder:
| Kıyaslama | Orta (varsayılan) | Maksimum | Not |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Orta, maksimumun çıkış belirteçlerinin yaklaşık onda birini kullandı |
| AA-Briefcase v1.1 | 1372 | 1578 | Orta, maksimumun çıkış belirteçlerinin dörtte birinden azını kullandı |
| HealthBench Professional | %59,9 | %64,8 | Düşük %57,9, yüksek %61,3 |
output_config.effort olmadan API'yi çağırırsanız sol sütunu bekleyin. Çaba düzeyleri belgeleri beş seviyenin hepsini kapsar.
Çaba düzeyine göre puan ve maliyet
Lansman grafiklerinden, puan (maliyet) olarak. OSWorld ve Terminal-Bench maliyeti deneme başına; GDPval-AA görev başınadır.
| Model | Düşük | Orta | Yüksek | Çok Yüksek | Maksimum |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | %42,0 (0,07$) | %53,3 (0,13$) | %61,3 (0,18$) | %67,6 (0,28$) | %72,4 (0,61$) |
| Sonnet 5.5 | %57,9 (0,68$) | %66,0 (0,93$) | %73,2 (1,38$) | %81,1 (2,22$) | %83,9 (5,73$) |
| GPT-6 Luna | %19,2 (0,04$) | %37,5 (0,13$) | %42,3 (0,14$) | %44,8 (0,17$) | %48,9 (0,21$) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 (0,012$) | 1277 (0,030$) | 1420 (0,089$) | 1513 (0,27$) | 1620 (0,87$) |
| Sonnet 5.5 | 1179 (0,22$) | 1324 (0,27$) | 1551 (0,62$) | 1731 (1,88$) | 1840 (6,78$) |
| GPT-6 Luna | 1036 (0,004$) | 1262 (0,02$) | 1344 (0,03$) | 1364 (0,05$) | 1437 (0,09$) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | %12,7 (0,42$) | %20,3 (0,68$) | %24,8 (1,04$) | %31,5 (1,75$) | %39,2 (2,64$) |
| Sonnet 5.5 | %20,0 (0,62$) | %28,8 (0,68$) | %43,0 (1,46$) | %61,5 (4,34$) | %70,6 (10,44$) |
- Maksimum, son adımı için pahalıdır. GDPval-AA'da, maksimum 343 daha fazla Elo puanı için ortanın yaklaşık 28 katına mal olur. OSWorld'de, maksimum 4,8 puan için çok yükseğin iki katından fazlaya mal olur.
- Haiku 5.5, orta düzeyde OSWorld'de Luna'yı maksimumda yener: %53,3 için 0,13$ karşısında %48,9 için 0,21$. Ancak Luna, diğer her eşleşen düzeyde daha ucuzdur; orta düzeyde ikisi yaklaşık olarak aynı maliyete sahiptir. Bkz. Haiku 5.5 vs GPT-6 Luna.
- Haiku 5.5, maksimumda OSWorld'de Sonnet 5.5'i orta düzeyde yener (%72,4 için 0,61$ karşısında %66,0 için 0,93$).
- Terminal-Bench istisnadır. Sonnet 5.5 yüksek düzeyde (%43,0, 1,46$) Haiku 5.5'i maksimumda (%39,2, 2,64$) daha az paraya yener. Sonnet maliyetleri yeni 0,10$'lık önbellek okuma fiyatını kullanır.
Maliyetler liste fiyatlarını kullanır: 100 bin belirtece kadar olan istemler için milyon belirteç başına 0,10$/0,50$, bunun üzeri daha yüksek (bkz. fiyatlandırma dökümü).
Haiku 5.5'in hala geride kaldığı yerler
Sonnet 5.5, lansman tablosunun her satırında öndedir. Haiku'nun tek başa baş zaferi, FrontierCode'da eşit maksimum çaba düzeyindedir. En büyük fark Terminal-Bench 4.0'dadır: %39,2'ye %70,6. SWE-Bench Pro (64,8'e 81,3) ve SWE-bench Multimodal (30,7'ye 54,3) aynı deseni göstermektedir.
Anthropic da kabul ediyor: Sonnet 5.5 ve Opus 5.5, "karmaşık ajanik kodlama görevleri için daha iyi seçenekler olmaya devam ediyor." Haiku 5.5, dar kapsamlı işlere uyar: sıkıştırma, özetleme, sınıflandırma, tarayıcı kullanımı ve daha büyük bir modelin altındaki alt ajanlar. Bunu ucuz bir alt ajan olarak çalıştırmak Claude Code'da Haiku 5.5 makalesinde ele alınmıştır.
Bağımsız sonuçlar: henüz yok
8 Ekim 2026 itibarıyla hiçbir bağımsız laboratuvar Haiku 5.5 sonuçlarını yayımlamamıştır. Artificial Analysis'in Haiku 5.5 sayfası 404 hatası döndürüyor ve liderlik tablosu yalnızca Claude 4.5 Haiku'yu listeliyor. Vals, LMArena, SWE-bench ve Aider da hiçbir şey göstermedi. Üçüncü taraf bir hız verisi yok; Anthropic, Haiku 5.5'i standart hızda "bugüne kadarki en hızlı modeli" olarak adlandırıyor, Hızlı Mod'daki Opus'tan daha yavaş.
En yakın dış sayı Cursor'dan geliyor. Model belgeleri, Haiku 5.5'in "maksimum çaba düzeyinde CursorBench'te %48,4 puan aldığını" belirtiyor, bu düşük düzeyde %30,9'dan artış demek. Düşünme kapalıyken, Cursor, düşünme açıkken %30,9 ila %42,3 puan alınan aynı çaba düzeylerinde %22,1 ila %26,2 rapor ediyor.
Müşteriler ne rapor ediyor
Bunlar Anthropic'in lansman gönderisinden alınmıştır ve bağımsız olarak doğrulanmamıştır:
- HubSpot: Simüle edilmiş CRM portal paketinde üç çalıştırma üzerinden ortalama %92,8, bu pakette gördüğü en iyi puan.
- AlphaSense: 400 Belge İçi Sorgu'da Haiku 4.5'in 0,76'sına karşılık 0,84, bunu istatistiksel olarak önemli buluyor.
- Box: Erken testlerde, Haiku 4.5'ten 11 puan daha yüksek, yaklaşık yarı gecikme süresiyle.
- Asana: görev tamamlamaları için mevcut modeline göre %30'dan fazla daha düşük gecikme.
- Cognition: Devin Fusion, Haiku 5.5'i yardımcı, Opus 5.5'i lider olarak kullanarak FrontierCode'da 66,2 puan elde etti. Bu iki modelli bir sistemdir, sadece Haiku değildir.
Kendi değerlendirmenizi çalıştırın
Kıyaslamalar trafiğinize benzemez. Anthropic'in istem rehberi, xhigh veya maksimumu yalnızca değerlendirmelerinizin bir kazanç gösterdiği durumlarda kullanmanızı ve karşılaştırmak için aynı değerlendirmeleri Sonnet 5.5 üzerinde çalıştırmanızı önerir. Apidog'da:
ANTHROPIC_API_KEY'i bir ortam değişkeni olarak saklayın ve 20 ila 50 gerçek istemi Mesajlar isteği olarak kaydedin.- Onaylamalar ekleyin: durum 200,
"max_tokens"veya"refusal"dışında birstop_reasonve doğru bir cevabın ihtiyaç duyduğu içerik. - Kümeyi
düşük,ortaveyüksekseviyelerde çalıştırın. Çaba düzeyini değiştirmek istem önbelleğini geçersiz kılar. - Başarı oranını ve
kullanımiçindeki belirteç sayılarını kaydedin. Yeni belirteçleyici, aynı metin için Haiku 4.5'inkinden yaklaşık %30 daha fazla belirteç üretir. - Koleksiyonu çoğaltın,
claude-sonnet-5-5'i yerleştirin ve her iki modeli tek bir projede karşılaştırın.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
}'
temperature, top_p, top_k veya bir asistan ön doldurma göndermeyin; her biri Haiku 5.5'te 400 döndürür. Yanıt bloklarını type'a göre seçin, çünkü bir thinking bloğu önce gelebilir. Bkz. API rehberi ve LLM uygulamalarını test etme.
Sıkça Sorulan Sorular
- Claude Haiku 5.5, Sonnet 5.5'ten daha mı iyi? Anthropic'in sayılarına göre değil. Sonnet 5.5, lansman tablosunun her satırında öndedir; Haiku, yalnızca FrontierCode'da her ikisi de maksimumda çalışırken onu az farkla (%46,4'e %46,2) geçer. Yükseltme görünümü için Haiku 5.5 vs Haiku 4.5 makalesine bakın.
- Haiku 5.5'in SWE-bench puanı nedir? SWE-Bench Pro'da 64,8, SWE-bench Multilingual'de 83,7 ve SWE-bench Multimodal'da 30,7, hepsi maksimum çaba düzeyinde.
- Kıyaslamalar hangi çaba düzeyinde çalıştırıldı? Maksimum, genellikle beş deneme üzerinden ortalaması alınır. API varsayılanı ortadır; burada GDPval-AA 1620 yerine 1277 puan alır.
- Bağımsız Haiku 5.5 kıyaslamaları var mı? Henüz yok. Artificial Analysis, GDPval-AA ve AA-Briefcase'i bağımsız olarak çalıştırdı, ancak bu puanları Anthropic yayımladı; AA'nın Haiku 5.5 sayfası bulunmamaktadır.
- GPT-6 Luna daha mı ucuz? Genellikle. Luna, her GDPval-AA çaba düzeyinde ve orta hariç her OSWorld düzeyinde daha az maliyetlidir; ortada ikisi yaklaşık olarak aynı fiyattadır. Haiku 5.5 her ikisinde de daha yüksek puan alır.
Sonraki adım
ortadan başlayın ve yalnızca başarı oranı kazancınızın kendini karşıladığı yerlerde yükseltin. Apidog'u indirin, yukarıdaki değerlendirme koleksiyonunu oluşturun ve üretim trafiğini değiştirmeden önce sonuçları Sonnet 5.5 temelinizle birlikte Apidog'da saklayın.
