Claude Sonnet 5.5 Kıyaslama Testleri: Anthropic'in Verileri, Bağımsız Sonuçlar ve Anlamları

Claude Sonnet 5.5 kıyaslamaları: %70,6 Terminal-Bench 4.0, %81,3 SWE-Bench Pro, AA indeksi 56. Her testi kim çalıştırdı, çaba maliyetleri nelerdir, kendi değerlendirmenizi nasıl çalıştırırsınız.

Medy Evrard

29 September 2026

Claude Sonnet 5.5 Kıyaslama Testleri: Anthropic'in Verileri, Bağımsız Sonuçlar ve Anlamları

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Claude Sonnet 5.5, Terminal-Bench 4.0'da %70,6, CursorBench 4.0'da %55,5, FrontierCode 1.1'de maksimum çabayla %46,2 (xhigh'da %52,1) ve SWE-Bench Pro'da %81,3 puan alarak Sonnet 5'in %10,3, %34,1, %42,4 ve %63,2'lik oranlarını geride bıraktı. Opus 5.5, çoğu lansman tablosu satırında yaklaşık 2 ila 3 puan önde olsa da Terminal-Bench'te geride kalıyor. Artificial Analysis, Sonnet 5.5'i Bağımsız Zeka Endeksi'nde 56 puanla, 216 model arasında 3. sıraya yerleştirdi.

Aşağıda: Claude Sonnet 5.5 kıyaslamaları, bunları kimin çalıştırdığı, çaba değişiklikleri ve Apidog'da modeli kendi trafiğinizde nasıl test edeceğiniz hakkında tüm detaylar bulunmaktadır. Özellikler için Claude Sonnet 5.5 nedir başlıklı makaleye bakın.

Lansman tablosu

Anthropic'in lansman gönderisi dört modeli karşılaştırır ("n/r" bir tire işaretler). İşaretlenmediği sürece Sonnet 5.5 hücreleri maksimum çabayladır; API varsayılan olarak yükseğe, Claude Code ve uygulamalar ortama ayarlanmıştır.

Kıyaslama Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 %70.6 %10.3 %66.4¹ n/r
FrontierCode 1.1 (Ana) %46.2 Maks² / %52.1 Xhigh %42.4 %54.4 %49.3
CursorBench 4.0 %55.5 %34.1 %57.8 n/r
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
İnsanlığın Son Sınavı (araçlarla) %64.5 %54.9 %67.7 n/r
OSWorld 2.1 (kısmi) %80.1 %57.0 %81.8 n/r
Grafikleme (araçsız) %61.6 %15.6 %64.4 %53.6⁴

Dipnotlar, basit terimlerle:

  1. Opus 5.5'in Terminal-Bench skoru xhigh'da, en iyi performansı; maksimumda %64,8 puan aldı.
  2. FrontierCode, kapsam dışı düzenlemeleri cezalandırır. Maksimumda, Sonnet 5.5 daha sık Claude Code'un kod inceleme becerisini çalıştırdı ve birçok alt ajana yayıldı; Cognition'ın incelediği iki durumda, bu durum bir zaman aşımına veya kapsam dışı düzenlemelere neden oldu.
  3. Artificial Analysis, her iki bilgi işi testini de, daha sonra düzeltilen, yapılandırılmış çıktı hatası içeren bir ön sürüm dağıtımında gerçekleştirdi. Anthropic, Sonnet 5.5'i olduğundan az gösteren küçük bir etki bekliyor.
  4. OpenAI, yakın zamanda AA ve Surge AI skorlarının yansıtmayabileceği bir GPT-6 Sol görüntü anlama hatasını düzeltti.

Her kıyaslamayı kimler çalıştırdı

Üçüncü bir taraf belirtilmediği sürece Anthropic, her testi kendisi çalıştırdı. Farklı satıcılar arası satırlar, bir kıyaslama adını paylaşır, bir donanımı veya çaba ayarını değil.

Çalıştıran Kıyaslama Koşullar
Anthropic Terminal-Bench 4.0, HLE, OSWorld 2.1 TB: Claude Code --bare, 5 deneme, korumalar açık. HLE: arama ve kod yürütme. OSWorld: 108 görev
Cognition FrontierCode 1.1 Claude Code'da Claude, Codex CLI'da GPT
Cursor CursorBench 4.0 Cursor'ın üretim donanımı; Anthropic maliyeti liste fiyatından tahmin etti
Artificial Analysis GDPval-AA, AA-Briefcase Ön sürüm dağıtımı
Anthropic Grafikleme Surge AI'ın kıyaslaması, Gemini 3.5 Flash ile derecelendirildi; Sol'un skoru Surge'den

Yedekleme, Sonnet 5.5'in Terminal-Bench denemelerinin %1,5'ine, ancak Opus 5.5'in %10'una (sistem kartı §8.5) dokundu, bu nedenle Sonnet'in 4.2 puanlık liderliğini dikkatle okuyun.

Sistem kartı ekstraları

Bir ila altı arasındaki satırlar, sistem kartının maksimum çaba özetidir.

Kıyaslama Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench Çok Dilli 90.3 78.3 93.9
SWE-Bench Çok Modlu 54.3 28.1 61.4
HLE, araçsız 56.9 43.1 64.4
HealthBench Profesyonel 69.2 57.8 65.6
AutomationBench (Zapier'in çalışması) 44.7 10.7 42.5
DeepSWE v1.1 %71.0 n/r n/r
Terminal-Bench-Science 0.1 %59.9 n/r %58.7
FrontierSWE v2 (Proximal'ın çalışması) %61.9 n/r %62.3
ArXivMath (araçsız / araçlarla) %86.8 / %95.2 n/r %91.2 / %96.9
ProgramBench (uzun bağlam) %79.7 %77.3 %91.2
OSWorld 2.1, kesin geçiş %43.5 %25.6 %48.7
Toolathlon-Doğrulanmış (Pass@1) %77.8 %74.7 %77.8
OfficeQA / OfficeQA Pro %76.9 / %65.6 %75.1 / %62.1 %78.9 / %67.7

Sonnet 5.5, HealthBench Professional, AutomationBench ve Terminal-Bench-Science'ta Opus 5.5'i geride bırakıyor; Opus, ProgramBench, SWE-Bench Pro ve araçsız HLE'de en geniş farkla önde. OSWorld'ün %80,1'lik başlığı kısmi kredidir; görevlerin sadece %43,5'i doğrudan geçiyor.

Çaba, tabloyu değiştiriyor

Lansman grafikleri, puan (maliyet) olarak. Terminal-Bench maliyeti deneme başına, diğerleri görev başına. İki grafik GPT-5.6 Sol (*) gösteriyor çünkü GPT-6 Sol sayıları yayımlanmadı.

Model Düşük Orta Yüksek Çok yüksek Maks
Terminal-Bench 4.0
Sonnet 5.5 %20.0 (0.76$) %28.8 (0.83$) %43.0 (1.94$) %61.5 (5.30$) %70.6 (12.54$)
Opus 5.5 %38.5 (1.29$) %57.6 (2.94$) %64.2 (3.88$) %66.4 (7.35$) %64.8 (11.24$)
Sonnet 5 %3.2 (3.78$) %4.4 (4.83$) %4.5 (8.20$) %7.0 (9.95$) %10.3 (11.62$)
GPT-5.6 Sol* %7.9 (1.46$) %20.9 (2.69$) %26.1 (4.12$) %28.5 (5.39$) %37.3 (7.89$)
FrontierCode 1.1 Ana
Sonnet 5.5 %29.3 (0.19$) %36.5 (0.24$) %49.4 (0.42$) %52.1 (1.59$) %46.2 (20.78$)
Opus 5.5 %47.3 (0.40$) %54.6 (0.80$) %54.0 (1.09$) %51.4 (2.25$) %54.4 (6.19$)
Sonnet 5 %28.7 (2.39$) %35.2 (3.81$) %39.4 (6.10$) %42.7 (10.07$) %42.4 (17.12$)
GPT-6 Sol %37.3 (0.43$) %45.9 (0.77$) %47.7 (1.04$) %48.4 (1.32$) %49.3 (2.07$)
CursorBench 4.0
Sonnet 5.5 %35.8 (0.50$) %39.2 (0.70$) %47.8 (1.67$) %53.1 (3.88$) %55.5 (9.67$)
Opus 5.5 %43.7 (1.17$) %52.5 (2.91$) %56.0 (3.97$) %56.0 (6.98$) %57.8 (13.43$)
Sonnet 5 %24.1 (1.39$) %28.0 (2.31$) %30.8 (3.48$) %32.0 (4.55$) %34.1 (7.17$)
GPT-5.6 Sol* %24.6 (0.87$) %31.1 (1.77$) %35.7 (2.85$) %37.7 (4.40$) %41.7 (8.23$)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 (0.87$) 1461 (1.64$) 1634 (3.95$) 1746 (9.63$) 1811 (29.19$)
Opus 5.5 1285 (1.15$) 1642 (4.40$) 1705 (6.27$) 1780 (12.27$) 1822 (21.05$)
Sonnet 5 923 (0.82$) 1056 (1.73$) 1177 (3.76$) 1274 (7.56$) 1359 (14.43$)
GPT-6 Sol 905 (0.12$) 1142 (0.34$) 1289 (0.63$) 1364 (1.19$) 1483 (2.67$)

Bağımsız sonuçlar

Artificial Analysis, Sonnet 5.5'i Intelligence Index v4.3.2'de 56 puanla, 216 model arasında 3. sıraya yerleştirerek sadece maksimum ve xhigh'daki Opus 5.5'in gerisinde kaldı. Sonnet 5 ise 38 puan aldı. Endeksi çalıştırma maliyeti:

Çaba Endeks puanı Çalıştırma maliyeti
maks 55.98 $8,977
çok yüksek 51.85 $2,738
yüksek 46.74 $1,176
orta 40.74 $701
düşük 35.84 $544

Maksimum, 9.2 ek puan için yüksek çabanın 7.6 katı maliyetlidir. OfficeChai'nin AA okuması, Sonnet 5.5'i Pareto sınırının dışında bırakıyor, yüksek çabada en maliyet-rekabetçi olduğunu ve maksimumda endeks görevi başına yaklaşık 193.000 çıktı jetonu saydığını belirtiyor.

Güvenlik kıyaslamaları

Sistem kartına göre komut enjeksiyonu:

Siber değerlendirmeler korumalar kapalıyken çalıştırıldı: CyScenarioBench'te %46,1 (Sonnet 5: %0,7, Opus 5.5: %67,6). Siber korumalı ilk Sonnet'tir ve Anthropic, iyi huylu güvenlik görevlerinde bile daha fazla reddetme konusunda uyarıyor. Komut enjeksiyonu kılavuzumuza bakın.

Kendi değerlendirmenizi yapın

Kıyaslamalar sizin trafiğinize benzemez ve Anthropic'in komut istemi kılavuzu, çabanın yeniden kalibre edildiğini söylüyor, bu nedenle Sonnet 5 ayarlarını tekrar kullanmayın. Apidog'da:

  1. ANTHROPIC_API_KEY'i bir ortam değişkeni olarak saklayın ve 20 ila 50 gerçek komut istemini Mesaj isteği olarak kaydedin.
  2. Durumun 200 olduğunu, "max_tokens" veya "refusal" dışında bir stop_reason olduğunu ve içeriğin doğru bir cevap için gerekli olduğunu doğrulayın.
  3. Düşük, orta, yüksek ve çok yüksek çabalarda, her biri birer kez çalıştırın; çaba değiştirmek komut istemi önbelleğini geçersiz kılar.
  4. Geçme oranını ve kullanımda belirteç sayılarını kaydedin, milyon başına 2$ giriş ve 10$ çıkış olarak fiyatlandırılır.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'

Kabul ettiğiniz en düşük çaba seviyesini kullanın. LLM uygulamalarını test etme ve AI ajan API'lerini test etme makalelerine bakın, ardından koleksiyonu oluşturmak için Apidog'u indirin.

Sıkça Sorulan Sorular

Sonnet 5.5, Opus 5.5'i yener mi? Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science ve araçlarla Chartography'de evet. Opus 5.5 diğerlerinde önde veya berabere.

Sonnet 5.5'in SWE-Bench skoru nedir? Maksimum çabayla SWE-Bench Pro'da 81.3 ve Multilingual'da 90.3.

Neden iki FrontierCode sayısı var? %46,2 maksimum, %52,1 çok yüksek; maksimumun alt ajan yayılımı kapsam dışı cezalar aldı.

Sonnet 5'ten yükseltmeli miyim? Kıyaslamalarda evet, ancak önce Sonnet 5.5 vs Sonnet 5'teki API değişikliklerini okuyun.

Sonraki adım

Anthropic'in önerdiği gibi yüksek çabadan (veya iyi tanımlanmış ajans kodlaması için orta çabadan) başlayın ve Apidog'daki değerlendirmenizin bir adım yukarı çıkmanın karşılığını verip vermediğine karar vermesine izin verin.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin