Claude Sonnet 5.5, milyon giriş/çıkış token başına 2$/10$ maliyetle, Claude Opus 5.5'in 4$/20$ maliyetinin yarısı kadardır. Anthropic'in lansman tablosunda çoğu satırda Opus 5.5'e birkaç puan yakın konumlanıyor ve Terminal-Bench 4.0'da (yüzde 70,6'ya karşı yüzde 66,4) onu geride bırakıyor, ancak Anthropic, Opus 5.5'in "karmaşık, ucu açık çalışmalarda açıkça daha güçlü kaldığını" belirtiyor. Karar: iyi kapsamlı, yüksek hacimli işleri ve alt aracıları düşük ila yüksek eforla Sonnet 5.5'e yönlendirin. Uzun, ucu açık görevler veya Sonnet'i çok yüksek veya maksimum seviyeye çıkaracağınız her yerde Opus 5.5 için ödeme yapın, çünkü Opus orta veya yüksek eforda genellikle benzer veya daha az parayla daha yüksek puanlar alır.
Her bir model için ayrı ayrı Claude Sonnet 5.5 nedir ve Claude Opus 5.5 nedir makalelerine bakın. Son bölüm, her ikisini de kendi istemlerinizle Apidog'da nasıl test edeceğinizi gösterir.
Özellikler ve fiyat karşılaştırması
| Sonnet 5.5 | Opus 5.5 | |
|---|---|---|
| API model kimliği | claude-sonnet-5-5 |
claude-opus-5-5 |
| Giriş / çıkış, 1 milyon token başına | $2 / $10 | $4 / $20 |
| Önbellek yazma (5 dk) | $2.50 | $5 |
| Önbellek okuma | $0.20 | $0.20 |
| Hızlı mod | Mevcut değil | $8 / $40 |
| API'de varsayılan efor | high |
medium |
| Düşünme | Varsayılan olarak adaptif veya between_tools |
Adaptif, her zaman açık |
| Bağlam / maks. çıkış | 1M / 128K | 1M / 128K |
| Gecikme sınıfı | Hızlı | Orta |
En önemli üç satır:
- Önbellek okumaları aynı maliyete sahiptir, bu nedenle önbellek yoğun aracı döngülerinde fark çoğunlukla çıktı ve önbellek yazımlarında ortaya çıkar. Claude Sonnet 5.5 fiyatlandırması hesaplamayı yapar. Her iki model de uzun bağlam primi talep etmez.
- Varsayılan efor farklılık gösterir. Varsayılan ayar testi, Sonnet'i
yüksekeforla, Opus'u iseortaeforla karşılaştırır; bu eşleşmede Opus kazanma eğilimindedir. - Hızlı mod sadece Opus'a özeldir (belgeler). Anthropic, Sonnet 5.5'in Sonnet 5'ten yüzde 30+ daha hızlı çıktı ürettiğini belirtiyor.
Kıyaslamalar: lansman tablosunda yakın, sistem kartında daha geniş
Birinci ila sekizinci satırlar Anthropic'in lansman tablosudur; geri kalanlar sistem kartından alınmıştır. Cognition FrontierCode'u, Cursor CursorBench'i, Zapier AutomationBench'i ve Artificial Analysis (AA) GDPval-AA ve AA-Briefcase'i çalıştırdı; diğerlerini Anthropic çalıştırdı. Aksi belirtilmedikçe Sonnet maksimum efordadır.
| Kıyaslama | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | %70.6 | %66.4 (çok yüksek) |
| FrontierCode 1.1 Main | %46.2 maks, %52.1 çok yüksek | %54.4 |
| CursorBench 4.0 | %55.5 | %57.8 |
| GDPval-AA v2.1 (Elo) | 1844 | 1846 |
| AA-Briefcase v1.1 (Elo) | 1811 | 1822 |
| HLE, araçlarla | %64.5 | %67.7 |
| OSWorld 2.1, kısmi | %80.1 | %81.8 |
| Chartography, araçsız | %61.6 | %64.4 |
| SWE-Bench Pro | 81.3 | 89.9 |
| SWE-Bench Multimodal | 54.3 | 61.4 |
| HLE, araçsız | 56.9 | 64.4 |
| OSWorld 2.1, katı geçiş | %43.5 | %48.7 |
| ProgramBench, uzun bağlam | %79.7 | %91.2 |
| Terminal-Bench-Science 0.1 | %59.9 | %58.7 |
| AutomationBench | 44.7 | 42.5 |
| HealthBench Professional | 69.2 | 65.6 |
Lansman tablosu, gurur verici bir kesittir: Terminal-Bench dışındaki yüzde bazlı satırlarda Opus, Sonnet'in çok yüksek FrontierCode puanı sayıldığında 1,7 ila 3,2 puan önde yer alıyor. Beş sistem kartı satırı farkı 5,2 ila 11,5 puana çıkarıyor: SWE-Bench Pro, SWE-Bench Multimodal, araçsız HLE, katı OSWorld ve uzun bağlamlı ProgramBench. Uzun, yardımsız, tam görevli çalışmalar Opus'un önde kaldığı alanlardır.
Terminal-Bench 4.0 galibiyetini dikkatli okuyun: sistem kartı bölüm 8.5, güvenlik önlemi geri dönüşünün Opus denemelerinin yüzde 10'unu, Sonnet'in ise yüzde 1,5'ini etkilediğini ve AA'nın kendi çalışmasının Sonnet 5.5'i yüzde 63,6 olarak puanladığını belirtiyor. Detaylar Claude Sonnet 5.5 kıyaslamaları makalesinde.
Efor, eşleşmeyi belirler
Lansman tablosu her modeli en iyi ayarında karşılaştırır. Faturanız bunu yapmaz. Anthropic'in lansman sayfası, her efor seviyesini deneme veya görev başına maliyetle birlikte gösterir:
| Kıyaslama, model | Düşük | Orta | Yüksek | Çok Yüksek | Maks |
|---|---|---|---|---|---|
| Terminal-Bench, Sonnet | %20.0 ($0.76) | %28.8 ($0.83) | %43.0 ($1.94) | %61.5 ($5.30) | %70.6 ($12.54) |
| Terminal-Bench, Opus | %38.5 ($1.29) | %57.6 ($2.94) | %64.2 ($3.88) | %66.4 ($7.35) | %64.8 ($11.24) |
| CursorBench, Sonnet | %35.8 ($0.50) | %39.2 ($0.70) | %47.8 ($1.67) | %53.1 ($3.88) | %55.5 ($9.67) |
| CursorBench, Opus | %43.7 ($1.17) | %52.5 ($2.91) | %56.0 ($3.97) | %56.0 ($6.98) | %57.8 ($13.43) |
| FrontierCode, Sonnet | %29.3 ($0.19) | %36.5 ($0.24) | %49.4 ($0.42) | %52.1 ($1.59) | %46.2 ($20.78) |
| FrontierCode, Opus | %47.3 ($0.40) | %54.6 ($0.80) | %54.0 ($1.09) | %51.4 ($2.25) | %54.4 ($6.19) |
| AA-Briefcase, Sonnet | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| AA-Briefcase, Opus | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
Gösterdikleri:
- Orta efordaki Opus, yüksek efordaki Sonnet'i genellikle geçer. Terminal-Bench 4.0: Opus deneme başına 2,94$ karşılığında yüzde 57,6 puan alırken, Sonnet 1,94$ karşılığında yüzde 43,0 puan alır.
- Maksimumun altındaki Opus, Sonnet'in en iyisini daha ucuza geçebilir. CursorBench: Yüksek efordaki Opus (yüzde 56,0, 3,97$) ile maksimum efordaki Sonnet (yüzde 55,5, 9,67$) karşılaştırması. FrontierCode: Orta efordaki Opus (yüzde 54,6, 0,80$) ile Sonnet'in en iyisi (yüzde 52,1, 1,59$) karşılaştırması.
- Maksimum efordaki Sonnet, AA-Briefcase'de daha düşük bir puan için maksimum efordaki Opus'tan daha pahalıya mal olabilir: 29,19$'a karşı 21,05$. Anthropic'in dipnotuna göre, FrontierCode'da Sonnet'in maksimum puanı, inceleme alt aracılarını yaydığı için çok yüksek puanının altına düştü.
- Sonnet eğrinin alt kısmına hakimdir. Düşük ayarı, her grafikte Opus'un en ucuz noktasını geride bırakır.
Token fiyatının yarısı, görev başına maliyetin yarısı değildir: Sonnet, efor arttıkça daha fazla token harcar. OfficeChai'nin bildirdiği AA verileri, Sonnet 5.5'i maksimumda indeks görevi başına yaklaşık 193.000 çıktı token'ı olarak gösteriyor ki bu, Opus 5.5'ten yaklaşık yüzde 60 daha fazladır.
Bu, Hacker News başlığındaki ana tartışmadır: birçok yorumcu, grafikleri, düşük efordaki Opus'un yüksek veya çok yüksek efordaki Sonnet ile eşleştiği veya onu geride bıraktığı, Sonnet'in nişinin düşük veya orta eforda ve bir Opus orkestratörünün altında bir alt aracı olarak kaldığı şeklinde okuyor.
Anthropic'in istem kılavuzu, Sonnet 5.5'in eforunun yeniden kalibre edildiğini belirtiyor: yüksek (`iyi tanımlanmış ajanlı kodlama için orta`) ile başlayın ve ölçülen kazançlar için çok yüksek ve maksimum seviyelerini saklayın. İstekler arasında üst düzey eforu değiştirmek istem önbelleğini geçersiz kılar, bu nedenle bunu iş yükü başına ayarlayın (API kılavuzu).
Güvenlik ve davranış farklılıkları
İstem enjeksiyonu sonuçları farklılık gösterir. Gray Swan'ın dolaylı istem enjeksiyonu kıyaslamasında, Sonnet 5.5'in 15 denemede saldırı başarı oranı yüzde 3,4'tür (Sonnet 5: yüzde 6,7): Opus 5.5'ten daha az dirençli, test edilen diğer tüm Claude olmayan modellerden daha fazla, GUI bilgisayar kullanımında en zayıf (yüzde 12,5). Shade'in adaptif saldırganlarına karşı, Sonnet kodlamada Opus'u geride bırakır (korumasız yüzde 3,01'e karşı yüzde 54,61; problar açıkken yüzde 2,63'e karşı yüzde 11,13) ve bilgisayar kullanımında onunla beraberedir (yüzde 0,07); tarayıcı kullanımında ise Anthropic'in başarılı saldırı olmadan değerlendirdiği ilk modeldir. Bkz. Opus 5.5 ve istem enjeksiyonu.
Her iki model de siber güvenlik önlemleri içerir; Sonnet 5.5 bunları alan ilk Sonnet'tir. Yüksek riskli olarak işaretlenen siber görevler, Anthropic uygulamalarında otomatik olarak ve API'de yalnızca etkinleştirirseniz (fallbacks: "default", beta) Sonnet 5'e geri döner. Sistem kartı, iyi niyetli güvenlik çalışmalarında bile daha fazla reddedilme konusunda uyarır.
Sistem kartı ayrıca Sonnet 5.5'i baskı altında Opus 5.5'ten daha dürüst, ancak sanrıya daha yatkın buluyor.
Tek bir sistemde Sonnet 5.5 ve Opus 5.5'i karıştırma
Her ikisini de elde etmenin bir yolu: Opus planlar, Sonnet yürütür. Üç mekanik önemlidir.
- Düşünme blokları çapraz geçmez. Sonnet 5.5, Opus 5 ve Opus 5.5 düşünme bloklarını düşürür (faturalandırılmaz; istek yine de 200 döner) ve bloklar modele, konuşmaya ve hesaba bağlıdır. Konuşma ortasında modelleri değiştirirseniz muhakeme kaybolur, bu nedenle metin aracılığıyla devredin: Opus planı bir mesaj olarak yazar, Sonnet ondan başlar (geçiş kılavuzu).
- Danışman aracı, Opus 5.5'i bir Sonnet 5.5 yürütücüsüne danışman olarak kabul eder; tavsiye
advisor_redacted_resultolarak şifrelenmiş olarak döner. - Claude Code'da
opusplanbulunur: Opus plan modunda, Sonnet yürütme için.sonnettakma adı, yalnızca Anthropic API'de (v2.1.284 veya sonrası) Sonnet 5.5 anlamına gelir, bu nedenle Bedrock, Google Cloud ve Foundry'deopusplandaha eski bir Sonnet üzerinde yürütülür. Bkz. Claude Code'da Claude Sonnet 5.5.
GPT-6 Sol'un yeri
GPT-6 Sol, Sonnet 5.5'in 2$/10$'lık liste fiyatını, 0,20$'lık önbelleğe alınmış okumalarla (yüzde 90 indirimli) ve 872k bağlam penceresiyle paylaşır. Anthropic'in tablosu Sol'a dört hücre verir: FrontierCode yüzde 49,3, GDPval-AA 1487, AA-Briefcase 1483 ve araçsız Chartography yüzde 53,6. Bir dipnot, OpenAI'ın kısa süre önce AA ve Surge AI puanlarına henüz yansımamış olabilecek bir Sol görüntü anlama hatasını düzelttiğini belirtiyor.
Görev başına maliyet kıyaslamaya göre değişir. Maksimumdaki AA-Briefcase'de, Sol görev başına 2,67$'a mal olurken, Sonnet 29,19$'a mal olur ve 1483'e 1811 puan alır. FrontierCode'da, yüksek efordaki Sonnet, Sol'un en iyisiyle (yüzde 49,4'e karşı yüzde 49,3) 0,42$'a karşı 2,07$ karşılığında eşleşir. Bkz. GPT-6 Sol ve Claude Opus 5.5 ve GPT-6 Sol nedir.
Hangi iş yükü için hangi model
| İş Yükü | Model ve efor |
|---|---|
| Yüksek hacimli sohbet, sınıflandırma, veri çıkarma | Sonnet 5.5, düşük veya orta |
| İyi kapsamlı hata düzeltmeleri, PR boyutunda değişiklikler | Sonnet 5.5, orta veya yüksek |
| Bir Opus planı yürüten alt aracılar | Sonnet 5.5, orta veya yüksek |
| Uzun, ucu açık ajanlı çalışma | Opus 5.5, önce orta sonra yüksek |
Sonnet'in çok yüksek veya maksimum efora ihtiyaç duyduğu her şey |
Opus 5.5, orta veya yüksek |
| Uzun bağlamlı kod tabanı muhakemesi | Opus 5.5, orta veya üzeri |
| Güvenilmeyen içeriği okuyan aracılar | İkisi de; kendi enjeksiyon durumlarınızı test edin |
Her ikisini de kendi trafiğinizde test edin
Yukarıdaki her grafik başkalarının kıyaslamalarından gelmiştir, sizin istemlerinizden, araçlarınızdan veya token karışımınızdan değil. Verilerin işaret ettiği eşleştirmeyle başlayın:
ask() {
curl -s https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"'"$1"'","max_tokens":16000,
"output_config":{"effort":"'"$2"'"},
"messages":[{"role":"user","content":"Review this diff and list each bug as JSON: ..."}]}' \
| jq '{model, stop_reason, usage}'
}
ask claude-sonnet-5-5 high
ask claude-opus-5-5 medium
Apidog'da bunu tekrarlanabilir hale getirin: https://api.anthropic.com/v1/messages adresine tek bir istek, ortam değişkeni olarak ANTHROPIC_API_KEY ve gövdede {{model}} ile {{effort}} kullanın. Her eşleşme için kopyalayın ve her çalıştırmanın aynı şeyleri kontrol etmesi için bir son işlemci ekleyin:
const body = pm.response.json();
pm.test("finished cleanly", () => {
pm.expect(body.stop_reason).to.not.be.oneOf(["max_tokens", "refusal"]);
});
pm.test("stays inside the token budget", () => {
pm.expect(body.usage.output_tokens).to.be.below(8000);
});
Her çifti 10 ila 20 kez çalıştırın ve kullanım, yanıt süresi ve geçiş oranını karşılaştırın; token sayısı çarpı liste fiyatı, görev başına gerçek maliyetinizdir. Daha fazlası için LLM uygulamaları nasıl test edilir makalesine bakın.
Sıkça Sorulan Sorular
- Claude Sonnet 5.5, Opus 5.5'ten daha mı iyi? Çoğu satırda değil. Opus 5.5, Terminal-Bench 4.0 ve GDPval-AA'daki yakın beraberlik dışında lansman tablosunda önde gidiyor. Önceki neslin karşılaştırması: Claude Opus 5 ve Sonnet 5.
- Sonnet 5.5, Opus 5.5'in yarı fiyatına mı? Token başına evet. Görev başına ise efora bağlıdır: maksimumda, Sonnet AA-Briefcase'de daha pahalıya mal oldu (29,19$'a karşı 21,05$).
- Konuşma ortasında modelleri değiştirebilir miyim? Evet, ancak Sonnet 5.5, Opus 5.5'in düşünme bloklarını düşürür, bu nedenle durumu metin olarak aktarın.
- 2$/10$ fiyatla Sonnet 5.5 mi, yoksa GPT-6 Sol mu? Sonnet en iyi ayarında paylaşılan dört satırın hepsinde önde; Sol görev başına çok daha ucuz olabilir. Her ikisini de test edin.
Sonraki adım
Yönlendirme kuralını değiştirmeden önce en pahalı iki isteminizi yüksek eforda Sonnet 5.5 ve orta eforda Opus 5.5 üzerinden çalıştırın ve geçiş oranını ile görev başına maliyeti karşılaştırın. İstekleri, doğrulamaları ve sonuçları tek bir projede tutmak için Apidog'u indirin.
