Claude Sonnet 5.5, Terminal-Bench 4.0'da %70,6, CursorBench 4.0'da %55,5, FrontierCode 1.1'de maksimum çabayla %46,2 (xhigh'da %52,1) ve SWE-Bench Pro'da %81,3 puan alarak Sonnet 5'in %10,3, %34,1, %42,4 ve %63,2'lik oranlarını geride bıraktı. Opus 5.5, çoğu lansman tablosu satırında yaklaşık 2 ila 3 puan önde olsa da Terminal-Bench'te geride kalıyor. Artificial Analysis, Sonnet 5.5'i Bağımsız Zeka Endeksi'nde 56 puanla, 216 model arasında 3. sıraya yerleştirdi.
Aşağıda: Claude Sonnet 5.5 kıyaslamaları, bunları kimin çalıştırdığı, çaba değişiklikleri ve Apidog'da modeli kendi trafiğinizde nasıl test edeceğiniz hakkında tüm detaylar bulunmaktadır. Özellikler için Claude Sonnet 5.5 nedir başlıklı makaleye bakın.
Lansman tablosu
Anthropic'in lansman gönderisi dört modeli karşılaştırır ("n/r" bir tire işaretler). İşaretlenmediği sürece Sonnet 5.5 hücreleri maksimum çabayladır; API varsayılan olarak yükseğe, Claude Code ve uygulamalar ortama ayarlanmıştır.
| Kıyaslama | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | %70.6 | %10.3 | %66.4¹ | n/r |
| FrontierCode 1.1 (Ana) | %46.2 Maks² / %52.1 Xhigh | %42.4 | %54.4 | %49.3 |
| CursorBench 4.0 | %55.5 | %34.1 | %57.8 | n/r |
| GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| İnsanlığın Son Sınavı (araçlarla) | %64.5 | %54.9 | %67.7 | n/r |
| OSWorld 2.1 (kısmi) | %80.1 | %57.0 | %81.8 | n/r |
| Grafikleme (araçsız) | %61.6 | %15.6 | %64.4 | %53.6⁴ |
Dipnotlar, basit terimlerle:
- Opus 5.5'in Terminal-Bench skoru xhigh'da, en iyi performansı; maksimumda %64,8 puan aldı.
- FrontierCode, kapsam dışı düzenlemeleri cezalandırır. Maksimumda, Sonnet 5.5 daha sık Claude Code'un kod inceleme becerisini çalıştırdı ve birçok alt ajana yayıldı; Cognition'ın incelediği iki durumda, bu durum bir zaman aşımına veya kapsam dışı düzenlemelere neden oldu.
- Artificial Analysis, her iki bilgi işi testini de, daha sonra düzeltilen, yapılandırılmış çıktı hatası içeren bir ön sürüm dağıtımında gerçekleştirdi. Anthropic, Sonnet 5.5'i olduğundan az gösteren küçük bir etki bekliyor.
- OpenAI, yakın zamanda AA ve Surge AI skorlarının yansıtmayabileceği bir GPT-6 Sol görüntü anlama hatasını düzeltti.
Her kıyaslamayı kimler çalıştırdı
Üçüncü bir taraf belirtilmediği sürece Anthropic, her testi kendisi çalıştırdı. Farklı satıcılar arası satırlar, bir kıyaslama adını paylaşır, bir donanımı veya çaba ayarını değil.
| Çalıştıran | Kıyaslama | Koşullar |
|---|---|---|
| Anthropic | Terminal-Bench 4.0, HLE, OSWorld 2.1 | TB: Claude Code --bare, 5 deneme, korumalar açık. HLE: arama ve kod yürütme. OSWorld: 108 görev |
| Cognition | FrontierCode 1.1 | Claude Code'da Claude, Codex CLI'da GPT |
| Cursor | CursorBench 4.0 | Cursor'ın üretim donanımı; Anthropic maliyeti liste fiyatından tahmin etti |
| Artificial Analysis | GDPval-AA, AA-Briefcase | Ön sürüm dağıtımı |
| Anthropic | Grafikleme | Surge AI'ın kıyaslaması, Gemini 3.5 Flash ile derecelendirildi; Sol'un skoru Surge'den |
Yedekleme, Sonnet 5.5'in Terminal-Bench denemelerinin %1,5'ine, ancak Opus 5.5'in %10'una (sistem kartı §8.5) dokundu, bu nedenle Sonnet'in 4.2 puanlık liderliğini dikkatle okuyun.
Sistem kartı ekstraları
Bir ila altı arasındaki satırlar, sistem kartının maksimum çaba özetidir.
| Kıyaslama | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 81.3 | 63.2 | 89.9 |
| SWE-Bench Çok Dilli | 90.3 | 78.3 | 93.9 |
| SWE-Bench Çok Modlu | 54.3 | 28.1 | 61.4 |
| HLE, araçsız | 56.9 | 43.1 | 64.4 |
| HealthBench Profesyonel | 69.2 | 57.8 | 65.6 |
| AutomationBench (Zapier'in çalışması) | 44.7 | 10.7 | 42.5 |
| DeepSWE v1.1 | %71.0 | n/r | n/r |
| Terminal-Bench-Science 0.1 | %59.9 | n/r | %58.7 |
| FrontierSWE v2 (Proximal'ın çalışması) | %61.9 | n/r | %62.3 |
| ArXivMath (araçsız / araçlarla) | %86.8 / %95.2 | n/r | %91.2 / %96.9 |
| ProgramBench (uzun bağlam) | %79.7 | %77.3 | %91.2 |
| OSWorld 2.1, kesin geçiş | %43.5 | %25.6 | %48.7 |
| Toolathlon-Doğrulanmış (Pass@1) | %77.8 | %74.7 | %77.8 |
| OfficeQA / OfficeQA Pro | %76.9 / %65.6 | %75.1 / %62.1 | %78.9 / %67.7 |
Sonnet 5.5, HealthBench Professional, AutomationBench ve Terminal-Bench-Science'ta Opus 5.5'i geride bırakıyor; Opus, ProgramBench, SWE-Bench Pro ve araçsız HLE'de en geniş farkla önde. OSWorld'ün %80,1'lik başlığı kısmi kredidir; görevlerin sadece %43,5'i doğrudan geçiyor.
Çaba, tabloyu değiştiriyor
Lansman grafikleri, puan (maliyet) olarak. Terminal-Bench maliyeti deneme başına, diğerleri görev başına. İki grafik GPT-5.6 Sol (*) gösteriyor çünkü GPT-6 Sol sayıları yayımlanmadı.
| Model | Düşük | Orta | Yüksek | Çok yüksek | Maks |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | |||||
| Sonnet 5.5 | %20.0 (0.76$) | %28.8 (0.83$) | %43.0 (1.94$) | %61.5 (5.30$) | %70.6 (12.54$) |
| Opus 5.5 | %38.5 (1.29$) | %57.6 (2.94$) | %64.2 (3.88$) | %66.4 (7.35$) | %64.8 (11.24$) |
| Sonnet 5 | %3.2 (3.78$) | %4.4 (4.83$) | %4.5 (8.20$) | %7.0 (9.95$) | %10.3 (11.62$) |
| GPT-5.6 Sol* | %7.9 (1.46$) | %20.9 (2.69$) | %26.1 (4.12$) | %28.5 (5.39$) | %37.3 (7.89$) |
| FrontierCode 1.1 Ana | |||||
| Sonnet 5.5 | %29.3 (0.19$) | %36.5 (0.24$) | %49.4 (0.42$) | %52.1 (1.59$) | %46.2 (20.78$) |
| Opus 5.5 | %47.3 (0.40$) | %54.6 (0.80$) | %54.0 (1.09$) | %51.4 (2.25$) | %54.4 (6.19$) |
| Sonnet 5 | %28.7 (2.39$) | %35.2 (3.81$) | %39.4 (6.10$) | %42.7 (10.07$) | %42.4 (17.12$) |
| GPT-6 Sol | %37.3 (0.43$) | %45.9 (0.77$) | %47.7 (1.04$) | %48.4 (1.32$) | %49.3 (2.07$) |
| CursorBench 4.0 | |||||
| Sonnet 5.5 | %35.8 (0.50$) | %39.2 (0.70$) | %47.8 (1.67$) | %53.1 (3.88$) | %55.5 (9.67$) |
| Opus 5.5 | %43.7 (1.17$) | %52.5 (2.91$) | %56.0 (3.97$) | %56.0 (6.98$) | %57.8 (13.43$) |
| Sonnet 5 | %24.1 (1.39$) | %28.0 (2.31$) | %30.8 (3.48$) | %32.0 (4.55$) | %34.1 (7.17$) |
| GPT-5.6 Sol* | %24.6 (0.87$) | %31.1 (1.77$) | %35.7 (2.85$) | %37.7 (4.40$) | %41.7 (8.23$) |
| AA-Briefcase v1.1 (Elo) | |||||
| Sonnet 5.5 | 1264 (0.87$) | 1461 (1.64$) | 1634 (3.95$) | 1746 (9.63$) | 1811 (29.19$) |
| Opus 5.5 | 1285 (1.15$) | 1642 (4.40$) | 1705 (6.27$) | 1780 (12.27$) | 1822 (21.05$) |
| Sonnet 5 | 923 (0.82$) | 1056 (1.73$) | 1177 (3.76$) | 1274 (7.56$) | 1359 (14.43$) |
| GPT-6 Sol | 905 (0.12$) | 1142 (0.34$) | 1289 (0.63$) | 1364 (1.19$) | 1483 (2.67$) |
- Kazançların çoğu xhigh'da elde edilir. Maksimum, Terminal-Bench'te maliyetin 2,4 katı için 9,1 puan, CursorBench'te 2,5 katı için 2,4 puan ekler.
- FrontierCode maksimum skorları daha düşük ve xhigh'dan 13 kat daha pahalıdır (20.78 dolarda %46.2'ye karşılık 1.59 dolarda %52.1).
- Düşük çabadaki Opus 5.5 gerçek rakiptir. Terminal-Bench'te, orta çabadaki Opus 2.94 dolara %57.6; yüksek çabadaki Sonnet 1.94 dolara %43.0 alır. Yüksek çabadaki Opus (%64.2, 3.88 dolar), çok yüksek çabadaki Sonnet'i (%61.5, 5.30 dolar) yener. Sonnet 5.5 vs Opus 5.5'i inceleyin.
- Yüksek çaba, Sonnet'in maliyet açısından tatlı noktasıdır. Yüksek çabadaki FrontierCode: 0.42 dolara %49.4, GPT-6 Sol'un en iyi (%49.3) skorunu maliyetin yaklaşık beşte biriyle yakalar (fiyatlandırma dökümü).
Bağımsız sonuçlar
Artificial Analysis, Sonnet 5.5'i Intelligence Index v4.3.2'de 56 puanla, 216 model arasında 3. sıraya yerleştirerek sadece maksimum ve xhigh'daki Opus 5.5'in gerisinde kaldı. Sonnet 5 ise 38 puan aldı. Endeksi çalıştırma maliyeti:
| Çaba | Endeks puanı | Çalıştırma maliyeti |
|---|---|---|
| maks | 55.98 | $8,977 |
| çok yüksek | 51.85 | $2,738 |
| yüksek | 46.74 | $1,176 |
| orta | 40.74 | $701 |
| düşük | 35.84 | $544 |
Maksimum, 9.2 ek puan için yüksek çabanın 7.6 katı maliyetlidir. OfficeChai'nin AA okuması, Sonnet 5.5'i Pareto sınırının dışında bırakıyor, yüksek çabada en maliyet-rekabetçi olduğunu ve maksimumda endeks görevi başına yaklaşık 193.000 çıktı jetonu saydığını belirtiyor.
- AA'nın kendi Terminal-Bench 4.0 çalışması: %63,6, Anthropic'in %70,6'sına karşı.
- Sonnet 5'in düşük skoru gerçek: AA %14,1 ölçtü (Sonnet 5 kıyaslamaları bölümüne bakın).
- AA-Omniscience (OfficeChai'ye göre): %54 doğruluk ve %47 halüsinasyon oranı, Opus 5.5 için %66 ve %59'a karşı.
- Henüz ölçülmedi: çıktı hızı ve ilk jetona kadar geçen süre, bu yüzden "30%+ daha hızlı" Anthropic'in iddiası olmaya devam ediyor. Henüz LMArena listesi yok.
Güvenlik kıyaslamaları
Sistem kartına göre komut enjeksiyonu:
- Gray Swan: k=1, 10 ve 15'te saldırı başarı oranı %0,4, %2,7 ve %3,4 (Sonnet 5: %0,7, %5,1, %6,7). GUI bilgisayar kullanımı k=15'te %12,5 ile en zayıf.
- Shade, kodlama: korumalar olmadan %3,01, çoğunlukla Sonnet 5 siber yedeklemesi aracılığıyla; Sonnet 5.5'in kendisi 5.901 isteğin 4'ünde tehlikeye atıldı.
- Tarayıcı kullanımı: 110 senaryonun hiçbirinde saldırı başarılı olamadı.
Siber değerlendirmeler korumalar kapalıyken çalıştırıldı: CyScenarioBench'te %46,1 (Sonnet 5: %0,7, Opus 5.5: %67,6). Siber korumalı ilk Sonnet'tir ve Anthropic, iyi huylu güvenlik görevlerinde bile daha fazla reddetme konusunda uyarıyor. Komut enjeksiyonu kılavuzumuza bakın.
Kendi değerlendirmenizi yapın
Kıyaslamalar sizin trafiğinize benzemez ve Anthropic'in komut istemi kılavuzu, çabanın yeniden kalibre edildiğini söylüyor, bu nedenle Sonnet 5 ayarlarını tekrar kullanmayın. Apidog'da:
ANTHROPIC_API_KEY'i bir ortam değişkeni olarak saklayın ve 20 ila 50 gerçek komut istemini Mesaj isteği olarak kaydedin.- Durumun 200 olduğunu,
"max_tokens"veya"refusal"dışında birstop_reasonolduğunu ve içeriğin doğru bir cevap için gerekli olduğunu doğrulayın. - Düşük, orta, yüksek ve çok yüksek çabalarda, her biri birer kez çalıştırın; çaba değiştirmek komut istemi önbelleğini geçersiz kılar.
- Geçme oranını ve kullanımda belirteç sayılarını kaydedin, milyon başına 2$ giriş ve 10$ çıkış olarak fiyatlandırılır.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
Kabul ettiğiniz en düşük çaba seviyesini kullanın. LLM uygulamalarını test etme ve AI ajan API'lerini test etme makalelerine bakın, ardından koleksiyonu oluşturmak için Apidog'u indirin.
Sıkça Sorulan Sorular
Sonnet 5.5, Opus 5.5'i yener mi? Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science ve araçlarla Chartography'de evet. Opus 5.5 diğerlerinde önde veya berabere.
Sonnet 5.5'in SWE-Bench skoru nedir? Maksimum çabayla SWE-Bench Pro'da 81.3 ve Multilingual'da 90.3.
Neden iki FrontierCode sayısı var? %46,2 maksimum, %52,1 çok yüksek; maksimumun alt ajan yayılımı kapsam dışı cezalar aldı.
Sonnet 5'ten yükseltmeli miyim? Kıyaslamalarda evet, ancak önce Sonnet 5.5 vs Sonnet 5'teki API değişikliklerini okuyun.
Sonraki adım
Anthropic'in önerdiği gibi yüksek çabadan (veya iyi tanımlanmış ajans kodlaması için orta çabadan) başlayın ve Apidog'daki değerlendirmenizin bir adım yukarı çıkmanın karşılığını verip vermediğine karar vermesine izin verin.
