Claude Opus 5 Performans Testleri: Sayıların Gerçek Anlamı

Her Claude Opus 5 kıyaslama iddiası tek bir atfedilen tabloda: Frontier-Bench, ARC-AGI 3, OSWorld 2.0, CursorBench 3.2, AutomationBench. Hepsi satıcılar tarafından çalıştırıldı, hiçbiri tekrarlanmadı.

Ashley Innocent

Ashley Innocent

25 July 2026

Claude Opus 5 Performans Testleri: Sayıların Gerçek Anlamı

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Anthropic, Claude Opus 5'i 24 Temmuz 2026'da, tam bir başarı öyküsü gibi okunan bir dizi kıyaslama iddiasıyla piyasaya sürdü. Bir değerlendirmede Opus 4.8'in iki katından fazlasını elde etti. Bir başkasında en iyi ikinci modelin üç katını. Üçüncü bir değerlendirmede Fable 5'i maliyetinin üçte biriyle geride bıraktı.

Bu, onların yanlış olduğu anlamına gelmez. Ancak onları, herhangi bir satıcının lansman grafiğini okuduğunuz gibi okumanız gerektiği anlamına gelir: dikkatli bir şekilde, neyin ölçüldüğüne ve neyin dışarıda bırakıldığına dikkat ederek. Bu kılavuz, yayınlanmış her Opus 5 kıyaslama iddiasını tek bir atıflı tabloda sunar, her sayının neleri destekleyip neleri destekleyemeyeceğini açıklar, Anthropic'in kendi modelinin üzerine koyduğu tavanı belirtir ve Apidog'da kendinizin çalıştırabileceği bir değerlendirme planıyla sona erer.

düğme

Modelin kendisi için (claude-opus-5, 1M bağlam, 128k maksimum çıktı, Mayıs 2026 bilgi kesimi), Claude Opus 5 nedir ile başlayın. Aşağıdaki birincil kaynak, Anthropic'in Claude Opus 5 lansman gönderisidir.

Yayınlanan her iddia, tek bir tabloda

Anthropic'in lansmanda yaptığı kıyaslama açıklamalarının tamamı burada. Karşılaştırma sütunu, sonuç sütunu kadar önemlidir, çünkü bunların birçoğu bir puan olarak değil, başka bir modele göre belirtilmiştir.

Kıyaslama Anthropic'in İddiası Belirtilme Şekli Kıyaslandığı Model/Referans
Frontier-Bench v0.1 Diğer tüm modelleri geride bırakıyor; görev başına daha düşük maliyetle Opus 4.8'in puanını iki katından fazla artırıyor Oran artı maliyet iddiası Opus 4.8 ve diğerleri
ARC-AGI 3 En iyi ikinci modelin puanının yaklaşık 3 katı Oran Adı belirtilmeyen en iyi ikinci model
OSWorld 2.0 Fable 5'i maliyetinin üçte biriyle geride bırakıyor Sıralama artı maliyet iddiası Fable 5
CursorBench 3.2 Fable 5'in zirvesinin %0,5'i içinde, yarı fiyatına Fark artı maliyet iddiası Fable 5
Zapier AutomationBench Başarı oranı en iyi ikinci modelin yaklaşık 1,5 katı Oran Adı belirtilmeyen en iyi ikinci model
Organik kimya Opus 4.8'e göre +10,2 puan Mutlak fark Opus 4.8
Protein analizi Opus 4.8'e göre +7,7 puan Mutlak fark Opus 4.8
Siber güvenlik istismarı Mythos 5'in gerisinde Sıralama Mythos 5
Otonom biyoloji araştırmaları Mythos 5'in gerisinde Sıralama Mythos 5

Yukarıdakilerin tümünün kaynağı: Anthropic'in lansman gönderisi ve model belgeleri. Yazım anında hiçbir üçüncü taraf, bu sonuçların herhangi birinin bir reprodüksiyonunu yayınlamamıştır.

Herhangi bir sayıyı okumadan önce iki şey dikkat çekiyor. Dokuz satırdan sadece ikisi puanlarda mutlak bir hareket sağlıyor. Ve Anthropic'in kendisi, yeni amiral gemisinin kaybettiği son iki satırı sunuyor.

Oran sorunu ve neden önemli olduğu

İddialardan dördü (Frontier-Bench, ARC-AGI 3, AutomationBench ve bir dereceye kadar CursorBench) puan olarak değil, oran veya fark olarak belirtilmiştir. Bu, bir önemsiz ayrıntı değil, gerçek bir sınırlamadır ve neden böyle olduğunu açıkça belirtmeye değerdir.

Bir oran paydadan gizler. ARC-AGI 3'te "en iyi ikinci modelin yaklaşık 3 katı" ifadesi, alanın nerede olduğuna bağlı olarak farklı bir anlama gelir. Eğer en iyi ikinci model %8 puan alıyorsa, 3 katı %24'tür: kimsenin çözmeye yakın olmadığı bir kıyaslamada gerçek bir hareket. Eğer en iyi ikinci model %25 puan alıyorsa, 3 katı %75'tir, kategorik olarak farklı bir sonuç. Her ikisi de dürüstçe "3 katı" olarak tanımlanabilir. Hangisinin gerçekleştiğini söyleyemezsiniz ve Anthropic de söylemedi.

Bir ölçeğin altında ikiye katlamak daha kolaydır. Frontier-Bench v0.1'de "Opus 4.8'in puanını iki katından fazla artırıyor" ifadesi aynı sorunun bir şeklidir. Önceki amiral gemisinin tek haneli veya düşük onlu sayılarda puan aldığı zorlu, yeni bir kıyaslamada, ikiye katlamak, ifadenin ima ettiğinden daha küçük bir mutlak sıçramadır. 4.8'in zaten %40 puan aldığı bir kıyaslamada, ikiye katlamak olağanüstü olurdu. Sürüm dizisi burada bir ipucu: v0.1, yayınlanmış bir geçmişi, topluluk tarafından doğrulanmamış sonuçları ve yerleşik bir doygunluk noktası olmayan bir kıyaslamadır.

"En iyi ikinci model" adı belirtilmemiş. İki iddia, Opus 5'i belirtilmeyen bir rakiple karşılaştırıyor. Bu rakip Fable 5, Mythos 5 veya başka bir laboratuvardan bir model olabilir. Karşılaştırma kümesi, oranın ne kadar anlam ifade ettiğini belirler ve bu açıklanmamıştır.

Farklar birimlere ihtiyaç duyar. CursorBench 3.2'deki "Fable 5'in zirvesinin %0,5'i içinde" ifadesi, bunun 0,5 yüzdelik puan mı yoksa %0,5'lik göreceli bir fark mı olduğunu belirtmez ve "zirve" varsayılan bir çalıştırmadan ziyade en iyi yapılandırmalı bir çalıştırmayı önerir. Bir kodlama kıyaslamasında, varsayılan bir effort ayarı ile maksimum seviyeye çıkarılmış bir ayar arasındaki fark önemsiz değildir. Fable 5 kıyaslama dökümümüz, bu modelin kendi sayılarının nasıl çerçevelendiğini kapsar.

İki bilimsel veri, tam da tüm bunları önledikleri için setteki en açık iddialardır: organik kimyada +10,2 puan ve protein analizinde +7,7 puan, adlandırılmış bir temele göre mutlak farklardır. Başlangıç puanını hala alamıyorsunuz, ancak modelin ne kadar hareket ettiğini tam olarak biliyorsunuz.

Görev başına maliyet iddiaları yapılandırmaya bağlıdır

Anthropic'in iddialarından üçü yeteneği maliyetle birleştiriyor: Frontier-Bench'te görev başına daha düşük maliyet, OSWorld 2.0'da maliyetin üçte biri, CursorBench 3.2'de yarı fiyatına.

Bunun liste fiyatı yarısı doğrulanabilir ve geçerlidir. Opus 5, milyon girdi jetonu başına 5 dolar ve milyon çıktı jetonu başına 25 dolardır; bu, Opus 4.8 ile aynı ve Fable 5'in 10/50 dolarlık fiyatının tam olarak yarısıdır. Bu, Anthropic'in fiyatlandırma sayfasında yayınlanmıştır ve hiç de bir kıyaslama sonucu değildir. Önbellek yazmaları, toplu iş oranları ve hızlı mod premiumu dahil tüm aritmetik, Opus 5 fiyatlandırma dökümümüzde yer almaktadır.

Görev başına maliyet farklı bir niceliktir. Çalıştırmanın ne kadar jeton tükettiğine bağlıdır; bu da çaba seviyesine, düşünmenin etkin olup olmadığına, aracı döngünün kaç tur sürdüğüne ve kaç alt ajanın oluşturulduğuna bağlıdır. Anthropic'in kendi istem kılavuzu, Opus 5'in Opus 4.8'den daha uzun varsayılan yanıtlar ürettiğini, alt ajanlara daha kolay delege ettiğini ve görev kapsamını daha sık genişlettiğini belirtir. Bu üçü de gerçek iş yüklerinde jeton tüketimini artırır, bu nedenle görev başına maliyet grafiği için ayarlanmış bir çalıştırma, otomatik olarak göndereceğiniz yapılandırma değildir.

Bunların hiçbiri maliyet hikayesini yanlış kılmaz. Liste fiyatının yarısı, liste fiyatının yarısıdır ve Opus 5 ile Fable 5 karşılaştırmamız, bu farkın aslında nerede işe yaradığını inceler. Bu, görev başına maliyet oranının belirli bir kurulumun bir sonucu olduğu ve sizinkinin farklı olacağı anlamına gelir. Ölçün.

Anthropic'in kendi adlandırdığı tavan

Lansman materyalindeki en faydalı satır, bir zafer olmayan satırdır. Anthropic açıkça belirtiyor ki Opus 5, siber güvenlik istismarı ve otonom biyoloji araştırmalarında hala Mythos 5'in gerisindedir. Fable 5 ayrıca "en yetenekli geniş çapta yayınlanmış model" unvanını koruyor.

Bu, basın haberlerinin bunu büyük ölçüde atladığı için tekrar belirtmeye değerdir. Opus 5, Claude yığınının zirvesi değildir. Dürüst özet, sınır sınıfı yeteneği sınır fiyatının yarısına sunmasıdır, üzerinde adlandırılmış bir tavanla. Sınır güvenliği araştırmaları veya otonom bilimsel çalışmalar için kıyaslama cevabı hala Mythos sınıfıdır; bu konuyu Mythos sınıfı model açıklayıcımızda ve Fable 5 ile Mythos 5 karşılaştırmamızda ele aldık.

Operasyonel bir sonucu da var. Anthropic, Opus 5 bir siber kategori isteğini reddettiğinde otomatik olarak Opus 4.8'e geri dönen bir fallbacks: "default" seçeneği (server-side-fallback-2026-07-01 beta başlığının arkasında) yayınladı. Daha sıkı siber reddetmeleri olan bir modelin bir kaçış yolu gerekir ve bu kaçış yolunun varlığı, grafiğin size söylemediği bir şeyi anlatır.

Kıyaslamaların hiç kapsamadığı şeyler

Kıyaslamalar görev tamamlamayı ölçer. Bir modelin ürününüzde çalışıp çalışmayacağını belirleyen şeyleri ölçmezler:

Gerçekten neyi kendiniz test etmelisiniz

Satıcı kıyaslamaları bir başlangıç hipotezidir. İşte bir öğleden sonra çalıştırabileceğiniz ve iş yükünüz için Opus 5 hakkında yukarıdaki her sayıdan daha fazlasını size söyleyecek kompakt bir değerlendirme.

Önceki bir lansmandaki karşılaştırma metodolojisi için Sonnet 5 kıyaslama yazımız aynı uygulamayı inceler ve Opus 5 API kılavuzunda istek şekilleri bulunur.

Değerlendirmeyi Apidog'da çalıştırma

Yukarıdaki değerlendirme, yetkilendirme başlıkları, JSON gövdeleri, akış yanıtları ve her çağrıda okumanız gereken bir usage bloğu içeren bir yığın HTTP isteğidir. Bu, Apidog'un hallettiği sıradan bir API işidir.

Uygulanabilir bir kurulum:

  1. Anthropic Mesajlar uç noktasına karşı bir istek oluşturun ve API anahtarınızı gövdeye yapıştırmak yerine bir ortam değişkeni olarak saklayın.
  2. Bu isteği her çaba seviyesi için bir kez çoğaltın, böylece aynı istemi low'dan xhigh'a kadar gönderebilir ve yanıtları yan yana karşılaştırabilirsiniz.
  3. Akışı açın ve görünür yanıt başlamadan önce düşünme jetonlarının nasıl biriktiğini görmeniz gerektiğinde SSE olaylarını doğrudan inceleyin.
  4. Modelin aslında yapılandırılmış araç çağrıları yayımladığını, bunları düz yazı şeklinde açıklamadığını doğrulamak için yanıttaki araç çağrı yüklerini inceleyin; bu, düşünme devre dışı bırakıldığında dikkat edilmesi gereken bir artefakttır.
  5. Önbellek isabetleri ve jeton toplamlarının her çalıştırmada gözle kontrol edilmek yerine yakalanması için usage alanlarına bir iddia ekleyin.
  6. Bir sonraki model lansmanının yeniden inşa değil, model kimliği takası olması için tümünü bir koleksiyon olarak kaydedin.

Temel istek şudur:

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 8192,
    "output_config": {"effort": "medium"},
    "messages": [
      {"role": "user", "content": "Fix the failing test in this diff."}
    ]
  }'

Her çalıştırmada bir alanı değiştirin, diğer her şeyi sabit tutun ve her seferinde usage bloğunu kaydedin. Ortamlar ve iddialar zaten hazır kurulu olarak bu deseni takip etmek isterseniz Apidog'u indirin.

Dürüst özet

Opus 5'in kıyaslama hikayesi gerçekten güçlü: Anthropic'in bir Opus sürümü için iddia ettiği, değişmeyen liste fiyatlandırmasıyla selefinden en büyük sıçrama. Aynı zamanda tamamen satıcı tarafından yapılmış, 25 Temmuz 2026 itibarıyla yeniden üretilmemiş ve büyük ölçüde paydalarını gizleyen oranlarla belirtilmiştir. Bu iki şey aynı anda doğrudur.

Bu sayfanın başındaki tabloyu Anthropic'in kendi modeli hakkındaki hipotezi olarak kabul edin. Sonra gidin kendi numaranızı alın. Bir lansman grafiği ile bir üretim iş yükü arasındaki boşluk, her model geçişinin gerçekten karara bağlandığı yerdir ve Opus 5 temel kılavuzu değişen diğer her şeyi kapsar.

düğme

Sıkça Sorulan Sorular

Claude Opus 5 kıyaslamaları bağımsız olarak doğrulandı mı? Hayır. 25 Temmuz 2026 itibarıyla, yayınlanmış her Opus 5 kıyaslama sonucu Anthropic'ten gelmektedir. Hiçbir üçüncü taraf laboratuvar veya bağımsız değerlendirici bir reprodüksiyon yayınlamamıştır. Bunları satıcı tarafından bildirilen rakamlar olarak okuyun.

En büyük Opus 5 kıyaslama iddiası nedir? Frontier-Bench v0.1'dir; burada Anthropic, Opus 5'in görev başına daha düşük maliyetle Opus 4.8'in puanını iki katından fazla artırdığını belirtiyor. Anthropic, temel puanları değil, yalnızca oranı yayınladı ve Frontier-Bench v0.1, yerleşik bir geçmişi olmayan yeni bir kıyaslamadır.

Claude Opus 5 en yetenekli Claude modeli mi? Hayır. Fable 5 "en yetenekli geniş çapta yayınlanmış" unvanını koruyor ve Anthropic, Opus 5'in siber güvenlik istismarı ve otonom biyoloji araştırmalarında hala Mythos 5'in gerisinde olduğunu belirtiyor. Opus 5'in iddiası, Fable 5 fiyatının yarısına sınır sınıfı yetenek sunmaktır, yığının en üstü değildir.

Opus 5, bilim görevlerinde Opus 4.8'den ne kadar daha iyi? Anthropic, Opus 4.8'e göre organik kimyada +10,2 puan ve protein analizinde +7,7 puan bildiriyor. Bunlar oranlar yerine mutlak farklar olarak belirtilen iki iddiadır ve bu da onları yorumlamayı en kolay hale getirir, ancak temel puanlar yayınlanmamıştır.

Opus 5, Fable 5'i geride bırakıyor mu? Anthropic'in sayılarına göre, OSWorld 2.0'da Fable 5'i maliyetinin üçte biriyle geride bırakıyor ve CursorBench 3.2'de Fable 5'in zirvesinin %0,5'i içinde, yarı fiyatına yer alıyor. Fable 5 hala genel yetenek unvanını koruyor. Tam karşılaştırmaya bakın.

Neyi kendim kıyaslamalıyım? Kendi birikmiş işlerinizden yirmi ila elli gerçek görev üzerinde çözülen görev başına maliyet, birden fazla çaba seviyesinde çalıştırılmış, gerçek araçlarınız takılı ve çoklu tur döngüleri etkinleştirilmiş. Bugün kullandığınız ne olursa olsun, aynı ortamda ona karşı karşılaştırın.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin