Anthropic, Claude Opus 5'i 24 Temmuz 2026'da, tam bir başarı öyküsü gibi okunan bir dizi kıyaslama iddiasıyla piyasaya sürdü. Bir değerlendirmede Opus 4.8'in iki katından fazlasını elde etti. Bir başkasında en iyi ikinci modelin üç katını. Üçüncü bir değerlendirmede Fable 5'i maliyetinin üçte biriyle geride bıraktı.
Bu, onların yanlış olduğu anlamına gelmez. Ancak onları, herhangi bir satıcının lansman grafiğini okuduğunuz gibi okumanız gerektiği anlamına gelir: dikkatli bir şekilde, neyin ölçüldüğüne ve neyin dışarıda bırakıldığına dikkat ederek. Bu kılavuz, yayınlanmış her Opus 5 kıyaslama iddiasını tek bir atıflı tabloda sunar, her sayının neleri destekleyip neleri destekleyemeyeceğini açıklar, Anthropic'in kendi modelinin üzerine koyduğu tavanı belirtir ve Apidog'da kendinizin çalıştırabileceği bir değerlendirme planıyla sona erer.
Modelin kendisi için (claude-opus-5, 1M bağlam, 128k maksimum çıktı, Mayıs 2026 bilgi kesimi), Claude Opus 5 nedir ile başlayın. Aşağıdaki birincil kaynak, Anthropic'in Claude Opus 5 lansman gönderisidir.
Yayınlanan her iddia, tek bir tabloda
Anthropic'in lansmanda yaptığı kıyaslama açıklamalarının tamamı burada. Karşılaştırma sütunu, sonuç sütunu kadar önemlidir, çünkü bunların birçoğu bir puan olarak değil, başka bir modele göre belirtilmiştir.
| Kıyaslama | Anthropic'in İddiası | Belirtilme Şekli | Kıyaslandığı Model/Referans |
|---|---|---|---|
| Frontier-Bench v0.1 | Diğer tüm modelleri geride bırakıyor; görev başına daha düşük maliyetle Opus 4.8'in puanını iki katından fazla artırıyor | Oran artı maliyet iddiası | Opus 4.8 ve diğerleri |
| ARC-AGI 3 | En iyi ikinci modelin puanının yaklaşık 3 katı | Oran | Adı belirtilmeyen en iyi ikinci model |
| OSWorld 2.0 | Fable 5'i maliyetinin üçte biriyle geride bırakıyor | Sıralama artı maliyet iddiası | Fable 5 |
| CursorBench 3.2 | Fable 5'in zirvesinin %0,5'i içinde, yarı fiyatına | Fark artı maliyet iddiası | Fable 5 |
| Zapier AutomationBench | Başarı oranı en iyi ikinci modelin yaklaşık 1,5 katı | Oran | Adı belirtilmeyen en iyi ikinci model |
| Organik kimya | Opus 4.8'e göre +10,2 puan | Mutlak fark | Opus 4.8 |
| Protein analizi | Opus 4.8'e göre +7,7 puan | Mutlak fark | Opus 4.8 |
| Siber güvenlik istismarı | Mythos 5'in gerisinde | Sıralama | Mythos 5 |
| Otonom biyoloji araştırmaları | Mythos 5'in gerisinde | Sıralama | Mythos 5 |
Yukarıdakilerin tümünün kaynağı: Anthropic'in lansman gönderisi ve model belgeleri. Yazım anında hiçbir üçüncü taraf, bu sonuçların herhangi birinin bir reprodüksiyonunu yayınlamamıştır.

Herhangi bir sayıyı okumadan önce iki şey dikkat çekiyor. Dokuz satırdan sadece ikisi puanlarda mutlak bir hareket sağlıyor. Ve Anthropic'in kendisi, yeni amiral gemisinin kaybettiği son iki satırı sunuyor.
Oran sorunu ve neden önemli olduğu
İddialardan dördü (Frontier-Bench, ARC-AGI 3, AutomationBench ve bir dereceye kadar CursorBench) puan olarak değil, oran veya fark olarak belirtilmiştir. Bu, bir önemsiz ayrıntı değil, gerçek bir sınırlamadır ve neden böyle olduğunu açıkça belirtmeye değerdir.
Bir oran paydadan gizler. ARC-AGI 3'te "en iyi ikinci modelin yaklaşık 3 katı" ifadesi, alanın nerede olduğuna bağlı olarak farklı bir anlama gelir. Eğer en iyi ikinci model %8 puan alıyorsa, 3 katı %24'tür: kimsenin çözmeye yakın olmadığı bir kıyaslamada gerçek bir hareket. Eğer en iyi ikinci model %25 puan alıyorsa, 3 katı %75'tir, kategorik olarak farklı bir sonuç. Her ikisi de dürüstçe "3 katı" olarak tanımlanabilir. Hangisinin gerçekleştiğini söyleyemezsiniz ve Anthropic de söylemedi.
Bir ölçeğin altında ikiye katlamak daha kolaydır. Frontier-Bench v0.1'de "Opus 4.8'in puanını iki katından fazla artırıyor" ifadesi aynı sorunun bir şeklidir. Önceki amiral gemisinin tek haneli veya düşük onlu sayılarda puan aldığı zorlu, yeni bir kıyaslamada, ikiye katlamak, ifadenin ima ettiğinden daha küçük bir mutlak sıçramadır. 4.8'in zaten %40 puan aldığı bir kıyaslamada, ikiye katlamak olağanüstü olurdu. Sürüm dizisi burada bir ipucu: v0.1, yayınlanmış bir geçmişi, topluluk tarafından doğrulanmamış sonuçları ve yerleşik bir doygunluk noktası olmayan bir kıyaslamadır.
"En iyi ikinci model" adı belirtilmemiş. İki iddia, Opus 5'i belirtilmeyen bir rakiple karşılaştırıyor. Bu rakip Fable 5, Mythos 5 veya başka bir laboratuvardan bir model olabilir. Karşılaştırma kümesi, oranın ne kadar anlam ifade ettiğini belirler ve bu açıklanmamıştır.
Farklar birimlere ihtiyaç duyar. CursorBench 3.2'deki "Fable 5'in zirvesinin %0,5'i içinde" ifadesi, bunun 0,5 yüzdelik puan mı yoksa %0,5'lik göreceli bir fark mı olduğunu belirtmez ve "zirve" varsayılan bir çalıştırmadan ziyade en iyi yapılandırmalı bir çalıştırmayı önerir. Bir kodlama kıyaslamasında, varsayılan bir effort ayarı ile maksimum seviyeye çıkarılmış bir ayar arasındaki fark önemsiz değildir. Fable 5 kıyaslama dökümümüz, bu modelin kendi sayılarının nasıl çerçevelendiğini kapsar.
İki bilimsel veri, tam da tüm bunları önledikleri için setteki en açık iddialardır: organik kimyada +10,2 puan ve protein analizinde +7,7 puan, adlandırılmış bir temele göre mutlak farklardır. Başlangıç puanını hala alamıyorsunuz, ancak modelin ne kadar hareket ettiğini tam olarak biliyorsunuz.
Görev başına maliyet iddiaları yapılandırmaya bağlıdır
Anthropic'in iddialarından üçü yeteneği maliyetle birleştiriyor: Frontier-Bench'te görev başına daha düşük maliyet, OSWorld 2.0'da maliyetin üçte biri, CursorBench 3.2'de yarı fiyatına.
Bunun liste fiyatı yarısı doğrulanabilir ve geçerlidir. Opus 5, milyon girdi jetonu başına 5 dolar ve milyon çıktı jetonu başına 25 dolardır; bu, Opus 4.8 ile aynı ve Fable 5'in 10/50 dolarlık fiyatının tam olarak yarısıdır. Bu, Anthropic'in fiyatlandırma sayfasında yayınlanmıştır ve hiç de bir kıyaslama sonucu değildir. Önbellek yazmaları, toplu iş oranları ve hızlı mod premiumu dahil tüm aritmetik, Opus 5 fiyatlandırma dökümümüzde yer almaktadır.
Görev başına maliyet farklı bir niceliktir. Çalıştırmanın ne kadar jeton tükettiğine bağlıdır; bu da çaba seviyesine, düşünmenin etkin olup olmadığına, aracı döngünün kaç tur sürdüğüne ve kaç alt ajanın oluşturulduğuna bağlıdır. Anthropic'in kendi istem kılavuzu, Opus 5'in Opus 4.8'den daha uzun varsayılan yanıtlar ürettiğini, alt ajanlara daha kolay delege ettiğini ve görev kapsamını daha sık genişlettiğini belirtir. Bu üçü de gerçek iş yüklerinde jeton tüketimini artırır, bu nedenle görev başına maliyet grafiği için ayarlanmış bir çalıştırma, otomatik olarak göndereceğiniz yapılandırma değildir.

Bunların hiçbiri maliyet hikayesini yanlış kılmaz. Liste fiyatının yarısı, liste fiyatının yarısıdır ve Opus 5 ile Fable 5 karşılaştırmamız, bu farkın aslında nerede işe yaradığını inceler. Bu, görev başına maliyet oranının belirli bir kurulumun bir sonucu olduğu ve sizinkinin farklı olacağı anlamına gelir. Ölçün.
Anthropic'in kendi adlandırdığı tavan
Lansman materyalindeki en faydalı satır, bir zafer olmayan satırdır. Anthropic açıkça belirtiyor ki Opus 5, siber güvenlik istismarı ve otonom biyoloji araştırmalarında hala Mythos 5'in gerisindedir. Fable 5 ayrıca "en yetenekli geniş çapta yayınlanmış model" unvanını koruyor.

Bu, basın haberlerinin bunu büyük ölçüde atladığı için tekrar belirtmeye değerdir. Opus 5, Claude yığınının zirvesi değildir. Dürüst özet, sınır sınıfı yeteneği sınır fiyatının yarısına sunmasıdır, üzerinde adlandırılmış bir tavanla. Sınır güvenliği araştırmaları veya otonom bilimsel çalışmalar için kıyaslama cevabı hala Mythos sınıfıdır; bu konuyu Mythos sınıfı model açıklayıcımızda ve Fable 5 ile Mythos 5 karşılaştırmamızda ele aldık.
Operasyonel bir sonucu da var. Anthropic, Opus 5 bir siber kategori isteğini reddettiğinde otomatik olarak Opus 4.8'e geri dönen bir fallbacks: "default" seçeneği (server-side-fallback-2026-07-01 beta başlığının arkasında) yayınladı. Daha sıkı siber reddetmeleri olan bir modelin bir kaçış yolu gerekir ve bu kaçış yolunun varlığı, grafiğin size söylemediği bir şeyi anlatır.
Kıyaslamaların hiç kapsamadığı şeyler
Kıyaslamalar görev tamamlamayı ölçer. Bir modelin ürününüzde çalışıp çalışmayacağını belirleyen şeyleri ölçmezler:
- Geçişte davranışsal kayma. Opus 5 kendi işini istemeden doğrular. Eğer istemleriniz hala Opus 4.8'den kalma "cevabınızı iki kez kontrol edin" talimatlarını taşıyorsa, aşırı doğrulama ve boşa harcanan jetonlarla karşılaşırsınız. Anthropic'in Opus 5 için istem kılavuzu, bunları kaldırmanızı söyler.
- Çıktı uzunluğu. Varsayılan yanıtlar ve yazılı teslimatlar Opus 4.8'den daha uzundur. Çabayı azaltmak düşünme jetonlarını keser, görünür uzunluğu değil. Açıkça kısa olmasını istemeniz gerekir.
- Düşünme devre dışı bırakıldığında hata modları.
thinking: {type: "disabled"}ile araç çağrıları bazen hiç yürütülmeyen düz metin olarak görünür ve ardından bir aracı döngüdeki sonraki turları bozar, ve dahili XML etiketleri bazen görünür çıktıya sızar. Hiçbir kıyaslama tablosu size bunu göstermez. - Çaba yeniden kalibrasyonu. Çaba seviyeleri Opus 5'te yeniden kalibre edildi ve Anthropic, 4.8 ayarlarını taşımak yerine yeniden tarama yapmanızı öneriyor. Bir çaba seviyesindeki bir kıyaslama sonucu, başka bir çaba seviyesindeki veriminiz hakkında hiçbir şey söylemez. çaba parametresi kılavuzuna bakın.
- Karşılaşacağınız 400 hatası.
thinking: {type: "disabled"}ilexhighveyamaxçabasını birleştirmek, istek başına uygulanan bir 400 hatası döndürür. Bu bir geçiş ayrıntısıdır, yetenek ayrıntısı değil, ve Opus 4.8'den Opus 5'e geçiş kılavuzunda ele alınmıştır.
Gerçekten neyi kendiniz test etmelisiniz
Satıcı kıyaslamaları bir başlangıç hipotezidir. İşte bir öğleden sonra çalıştırabileceğiniz ve iş yükünüz için Opus 5 hakkında yukarıdaki her sayıdan daha fazlasını size söyleyecek kompakt bir değerlendirme.
- 1. Kendi geçmişinizden küçük bir görev kümesi oluşturun. Yirmi ila elli gerçek görev: kapatılmış biletler, birleştirilmiş PR'lar, modelinizin halletmiş olacağı destek konuları. Gerçek girdiler, gerçek formatınızı, belirsizliğinizi ve uç durumları taşıdıkları için sentetik olanlardan daha iyidir.
- 2. Yapılandırmayı sabitleyin ve not alın. Tam olarak
claude-opus-5model kimliği, ayrıcaoutput_config.effortseviyeniz, düşünmenin açık olup olmadığı vemax_tokensdeğeriniz. Sabitlenmemiş bir yapılandırma, sonraki her karşılaştırmayı anlamsız kılar. - 3. Çözülen görev başına maliyeti puanlayın, jeton başına maliyeti değil. Her yanıttaki
usagebloğunu okuyun ve görev başına girdi, çıktı, önbellek okuma ve önbellek yazma jetonlarını kaydedin. Ardından, toplam harcamayı, kabul kontrolünüzden gerçekten geçen görev sayısına bölün. Bu, Anthropic'in grafiğinin iddia ettiği sayıdır, bu yüzden yeniden üretilmesi gereken sayıdır. - 4. Gerçek bir çaba taraması yapın. Aynı görev kümesini
low,medium,highvexhighseviyelerinde çalıştırın. Yeniden kalibrasyon,lowvemedium'un Opus 5'te önceki Opus modellerine göre anlamlı şekilde daha güçlü olduğu anlamına gelir ve birçok iş yükü daha ucuz bir seviyenin de aynı sıklıkta geçtiğini görecektir. Yüksek seviyedemax_tokens'i izleyin. - 5. Tek bir turu değil, aracı döngüyü test edin. Lansman kıyaslamalarının çoğu aracılıdır (OSWorld, CursorBench, AutomationBench). Tek tur spot kontrolleri bunları yeniden üretmeyecektir. Gerçek araçlarınız takılıyken çoklu tur çalıştırın ve sadece sonuçları değil, tur sayılarını da sayın.
- 6. Mevcut modelinizle aynı görev kümesi üzerinde karşılaştırın. Bugün ne çalıştırıyorsanız, Opus 4.8 veya Sonnet 5 veya başka bir şey, onu aynı ortamda çalıştırın. Kendi verilerinizdeki göreceli bir sonuç, başkasının verilerindeki mutlak bir puandan daha değerlidir.
- 7. Reddetmeleri ayrı ayrı kaydedin. Siber ile ilgili işler, 4.8'den daha sık reddetmelerle karşılaşacaktır. Yedek başlığı bağlamaya değip değmeyeceğine karar vermeden önce bunları sayın.
Önceki bir lansmandaki karşılaştırma metodolojisi için Sonnet 5 kıyaslama yazımız aynı uygulamayı inceler ve Opus 5 API kılavuzunda istek şekilleri bulunur.
Değerlendirmeyi Apidog'da çalıştırma
Yukarıdaki değerlendirme, yetkilendirme başlıkları, JSON gövdeleri, akış yanıtları ve her çağrıda okumanız gereken bir usage bloğu içeren bir yığın HTTP isteğidir. Bu, Apidog'un hallettiği sıradan bir API işidir.

Uygulanabilir bir kurulum:
- Anthropic Mesajlar uç noktasına karşı bir istek oluşturun ve API anahtarınızı gövdeye yapıştırmak yerine bir ortam değişkeni olarak saklayın.
- Bu isteği her çaba seviyesi için bir kez çoğaltın, böylece aynı istemi
low'danxhigh'a kadar gönderebilir ve yanıtları yan yana karşılaştırabilirsiniz. - Akışı açın ve görünür yanıt başlamadan önce düşünme jetonlarının nasıl biriktiğini görmeniz gerektiğinde SSE olaylarını doğrudan inceleyin.
- Modelin aslında yapılandırılmış araç çağrıları yayımladığını, bunları düz yazı şeklinde açıklamadığını doğrulamak için yanıttaki araç çağrı yüklerini inceleyin; bu, düşünme devre dışı bırakıldığında dikkat edilmesi gereken bir artefakttır.
- Önbellek isabetleri ve jeton toplamlarının her çalıştırmada gözle kontrol edilmek yerine yakalanması için
usagealanlarına bir iddia ekleyin. - Bir sonraki model lansmanının yeniden inşa değil, model kimliği takası olması için tümünü bir koleksiyon olarak kaydedin.
Temel istek şudur:
curl https://api.anthropic.com/v1/messages \
--header "x-api-key: $ANTHROPIC_API_KEY" \
--header "anthropic-version: 2023-06-01" \
--header "content-type: application/json" \
--data '{
"model": "claude-opus-5",
"max_tokens": 8192,
"output_config": {"effort": "medium"},
"messages": [
{"role": "user", "content": "Fix the failing test in this diff."}
]
}'
Her çalıştırmada bir alanı değiştirin, diğer her şeyi sabit tutun ve her seferinde usage bloğunu kaydedin. Ortamlar ve iddialar zaten hazır kurulu olarak bu deseni takip etmek isterseniz Apidog'u indirin.
Dürüst özet
Opus 5'in kıyaslama hikayesi gerçekten güçlü: Anthropic'in bir Opus sürümü için iddia ettiği, değişmeyen liste fiyatlandırmasıyla selefinden en büyük sıçrama. Aynı zamanda tamamen satıcı tarafından yapılmış, 25 Temmuz 2026 itibarıyla yeniden üretilmemiş ve büyük ölçüde paydalarını gizleyen oranlarla belirtilmiştir. Bu iki şey aynı anda doğrudur.
Bu sayfanın başındaki tabloyu Anthropic'in kendi modeli hakkındaki hipotezi olarak kabul edin. Sonra gidin kendi numaranızı alın. Bir lansman grafiği ile bir üretim iş yükü arasındaki boşluk, her model geçişinin gerçekten karara bağlandığı yerdir ve Opus 5 temel kılavuzu değişen diğer her şeyi kapsar.
Sıkça Sorulan Sorular
Claude Opus 5 kıyaslamaları bağımsız olarak doğrulandı mı? Hayır. 25 Temmuz 2026 itibarıyla, yayınlanmış her Opus 5 kıyaslama sonucu Anthropic'ten gelmektedir. Hiçbir üçüncü taraf laboratuvar veya bağımsız değerlendirici bir reprodüksiyon yayınlamamıştır. Bunları satıcı tarafından bildirilen rakamlar olarak okuyun.
En büyük Opus 5 kıyaslama iddiası nedir? Frontier-Bench v0.1'dir; burada Anthropic, Opus 5'in görev başına daha düşük maliyetle Opus 4.8'in puanını iki katından fazla artırdığını belirtiyor. Anthropic, temel puanları değil, yalnızca oranı yayınladı ve Frontier-Bench v0.1, yerleşik bir geçmişi olmayan yeni bir kıyaslamadır.
Claude Opus 5 en yetenekli Claude modeli mi? Hayır. Fable 5 "en yetenekli geniş çapta yayınlanmış" unvanını koruyor ve Anthropic, Opus 5'in siber güvenlik istismarı ve otonom biyoloji araştırmalarında hala Mythos 5'in gerisinde olduğunu belirtiyor. Opus 5'in iddiası, Fable 5 fiyatının yarısına sınır sınıfı yetenek sunmaktır, yığının en üstü değildir.
Opus 5, bilim görevlerinde Opus 4.8'den ne kadar daha iyi? Anthropic, Opus 4.8'e göre organik kimyada +10,2 puan ve protein analizinde +7,7 puan bildiriyor. Bunlar oranlar yerine mutlak farklar olarak belirtilen iki iddiadır ve bu da onları yorumlamayı en kolay hale getirir, ancak temel puanlar yayınlanmamıştır.
Opus 5, Fable 5'i geride bırakıyor mu? Anthropic'in sayılarına göre, OSWorld 2.0'da Fable 5'i maliyetinin üçte biriyle geride bırakıyor ve CursorBench 3.2'de Fable 5'in zirvesinin %0,5'i içinde, yarı fiyatına yer alıyor. Fable 5 hala genel yetenek unvanını koruyor. Tam karşılaştırmaya bakın.
Neyi kendim kıyaslamalıyım? Kendi birikmiş işlerinizden yirmi ila elli gerçek görev üzerinde çözülen görev başına maliyet, birden fazla çaba seviyesinde çalıştırılmış, gerçek araçlarınız takılı ve çoklu tur döngüleri etkinleştirilmiş. Bugün kullandığınız ne olursa olsun, aynı ortamda ona karşı karşılaştırın.
