Claude Fable 5.1 Benchmark Sonuçları: Rakamlar Gerçekte Ne Anlatıyor

Claude Fable 5.1'in atıflı her karşılaştırmalı test sonucu: Terminal-Bench-Science %52,6, Terminal-Bench 4.0 %55,8, CursorBench %73,4; Fable 5, Opus 5 ve GPT-5.6 Sol'a karşı.

INEZA Felin-Michel

INEZA Felin-Michel

2 September 2026

Claude Fable 5.1 Benchmark Sonuçları: Rakamlar Gerçekte Ne Anlatıyor

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Anthropic, Claude Fable 5.1'i 1 Eylül 2026'da piyasaya sürdü ve bu sürümde Fable 5, Opus 5 ve GPT-5.6 Sol'u dokuz testte karşılaştıran bir kıyaslama tablosu yer aldı. Her yayın organının manşeti Terminal-Bench-Science idi; burada Fable 5.1, Fable 5'in %24,7'sine karşı %52,6 puan aldı. Daha az yayın organının haberleştirdiği rakam ise CursorBench idi; burada Opus 5 ile arasındaki fark, iki kat daha pahalı olan bir modelde 3,4 puandı.

Bu kılavuz, yayınlanan her sayıyı atıfla birlikte tek bir yerde topluyor, her bir kıyaslamanın neyi ölçtüğünü açıklıyor, büyük farkları küçük olanlardan ayırıyor ve ardından lansman haberlerinin atladığı bölümü ele alıyor: bunların hepsi satıcı tarafından yürütülen sonuçlardır, her ikisinin de yayınlandığı tek ajan tabanlı kodlama testinde Mythos 5.1, Fable 5.1'i geride bırakıyor ve bir lansman tablosuna doğru yanıt, kendi değerlendirmelerinizi yapmaktır. Birincil kaynak Anthropic'in lansman yazısıdır; model bağlamı Claude Fable 5.1 nedir yazısındadır.

Tam tablo

Kıyaslama Neyi ölçer Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 Bir terminalde ajan tabanlı bilimsel araştırma %52.6 %24.7 %29.0 %22.4
Terminal-Bench 4.0 Bir terminalde ajan tabanlı kodlama %55.8 %42.0 %52.3 %37.3
GDPval-AA v2 Ekonomik olarak değerli bilgi çalışması (Elo) 1853 1723 1824 1711
OSWorld 2.0 (kısmi kredi) Gerçek masaüstü görevlerinde bilgisayar kullanımı %77.9 %72.9 %75.4 bildirilmedi
OSWorld 2.0 (katı) Aynı, sadece tam görev tamamlama %41.7 %36.1 %39.6 bildirilmedi
İnsanlığın Son Sınavı (araçsız) Uzman düzeyinde muhakeme soruları %60.9 %57.8 %56.6 bildirilmedi
İnsanlığın Son Sınavı (araçlı) Aynı, arama ve kod ile %65.0 %63.8 %63.6 bildirilmedi
AutomationBench Uçtan uca iş akışları %31.4 %17.1 %26.9 %19.6
CursorBench 3.2.0 IDE tarzı kodlama görevleri %73.4 %70.5 %70.0 %67.2

Anthropic ayrıca Terminal-Bench 4.0'da %60,9'luk bir Mythos 5.1 sayısı da yayınladı. VentureBeat ayrıca Fable 5.1 için %82'lik bir Browserbase sonucu rapor etti; bu sonuç, en zorlu tarayıcı-ajan görevlerinde Opus 5 için %74 ve Fable 5 için %57'ye karşıydı; bu rakam lansman yazısından ziyade basın yayınlarından alındı, bu yüzden buna göre değerlendirin.

Büyük farklar

Terminal-Bench-Science 0.1: %52.6'ya karşı %24.7 (Fable 5) ve %29.0 (Opus 5). İşte sonuç bu. Fable 5.1, kendisinden önceki modeli iki katından fazla geride bırakıyor ve bilimsel araçlar içeren bir terminalde modelin çok adımlı araştırmalar yapmasını isteyen bir kıyaslamada Opus 5'i neredeyse ikiye katlıyor. Bu, Anthropic'in belirttiği "uzun vadeli problem çözme" odak noktasının ölçülebilir bir şey ürettiğinin en açık kanıtıdır. Aynı zamanda bu bir sürüm 0.1 kıyaslamasıdır, yani görev seti yeni ve olgunlaştıkça puanların değişmesi muhtemeldir.

AutomationBench: %31.4'e karşı %17.1 (Fable 5) ve %26.9 (Opus 5). Uygulamalar arası uçtan uca iş akışlarının kıyaslaması, burada mutlak sayıların herkes için düşük olduğu görülüyor. Fable 5.1 burada Fable 5'i neredeyse ikiye katlıyor ve Opus 5'in 4.5 puan önünde. Ürününüz çok uygulamalı iş görevlerini otomatikleştiriyorsa, bu satır sizin için önemlidir.

Terminal-Bench 4.0: %55.8'e karşı %42.0 (Fable 5). Ajan tabanlı kodlamada Fable 5'e göre 13.8 puanlık bir sıçrama, bu Anthropic'in lansman yazısında kodlama bölümünde öne çıkardığı sayıydı. Opus 5'e karşı fark 3.5 puan. Opus 5, bu kıyaslamada Fable 5'i Temmuz ayında zaten geçmişti, bu yüzden Fable serisinin ajan tabanlı kodlamada Opus serisine karşı avantajı geri döndü, ancak Haziran ayındakinden daha dar. Opus 5 kıyaslama detayları Temmuz sayılarını içerir.

GDPval-AA v2: 1853'e karşı 1723 (Fable 5). Bilgi işi görevlerinde Fable 5'e göre 130 Elo'luk bir kazanç ve Anthropic'in belge, e-tablo ve slayt iddiaları için işaret ettiği kıyaslama. Opus 5'e karşı fark 29 Elo, ki bu küçük.

Küçük farklar

CursorBench 3.2.0: %73.4'e karşı %70.5 (Fable 5) ve %70.0 (Opus 5). IDE tarzı kodlama görevleri. Her iki modelden de üç puan fazla. Bu, geliştiricilerin en geniş kitlesi için en önemli olan kıyaslama noktasıdır ve Fable 5.1'in farkının en az olduğu yerdir. İş yükünüz "editörümde bana yardım et" şeklindeyse, lansman tablosu tek başına 2 kat fiyatı haklı çıkarmaz.

OSWorld 2.0: %77.9 / %41.7'ye karşı %75.4 / %39.6 (Opus 5). Bilgisayar kullanımı. Her iki puanlamada da Opus 5'in iki puan, Fable 5'in beş puan önünde. Gerçek, dramatik değil. Kesin skoru dikkate alın: herhangi bir modelde görevlerin yarısından azı tamamen tamamlanmıştır. Bilgisayar kullanımı hala bu alanın en zayıf noktasıdır.

İnsanlığın Son Sınavı: %60.9 / %65.0'ye karşı %56.6 / %63.6 (Opus 5). Araçsız, Opus 5'e karşı 4.3 puanlık bir fark, bu küçük farkların en büyüğü. Araçlarla birlikte 1.4 puana düşüyor, çünkü arama ve kod yürütme alanı dengeliyor. Araçsız sayı, ham muhakemenin daha iyi bir ölçüsüdür; araçlı sayı ise modelin nasıl kullanıldığına daha yakındır.

Fable 5.1 vs GPT-5.6 Sol

Anthropic, GPT-5.6 Sol sütunlu dört satır yayınladı ve Fable 5.1 dördünde de önde: Terminal-Bench-Science'ta 30.2 puan, Terminal-Bench 4.0'da 18.5, AutomationBench'te 11.8 ve CursorBench'te 6.2 puan farkla. GDPval-AA 1853'e karşı 1711 gösteriyor. İki uyarı: Bunlar Anthropic'in rakip bir model üzerinde yaptığı çalıştırmalardır ve GPT-5.6 Sol sütunu olmayan beş satır, Anthropic'in belirtmediği bir nedenle eksik. GPT-5.6 Sol ve Fable 5 karşılaştırmamız önceki eşleşmeyi ele almıştı; bu rakamlara göre Fable 5.1, Fable 5'in sahip olduğu her farkı genişletiyor.

Lansman haberlerinin atladığı noktalar

Her sayı satıcı tarafından yapılmıştır. Anthropic, rakip sütun dahil olmak üzere hepsini kendisi çalıştırmıştır ve hiçbir bağımsız laboratuvar lansman sırasında bunlardan hiçbirini yeniden üretememişti. Anthropic'in kıyaslama geçmişi genellikle sağlam olmuştur, ancak CursorBench ve OSWorld farkları o kadar küçüktür ki, farklı bir test çerçevesi veya puanlama tercihi onları tersine çevirebilir.

Mythos 5.1 gerçek tavan noktasıdır. Anthropic'in sistem kartı ve lansman yazısı, Fable 5.1 ve Mythos 5.1'in "farklı düzeylerde güvenlik önlemlerine sahip aynı model" olduğunu belirtiyor ve Mythos 5.1'i Terminal-Bench 4.0'da %60.9 olarak yayınlarken, Fable 5.1'in %55.8'ine karşıdır. Bu beş puanlık fark, ajan tabanlı kodlamadaki güvenlik önlemlerinin maliyetidir ve "Anthropic'in en yetenekli yaygın olarak piyasaya sürülen modelinin" üzerinde daha iyi bilinen bir kardeşi olduğu anlamına gelir. Mythos 5.1 ve Fable 5.1 karşılaştırması kimlerin erişebileceğini kapsar.

Çaba belirtilmedi. Anthropic'in çaba dokümantasyonu, Fable 5.1'in kazançlarının `xhigh` ve `max` seviyelerinde en büyük olduğunu söylüyor. Lansman yazısı, her bir skoru hangi çaba seviyesinin ürettiğini veya karşılaştırma modellerinin hangi çabayla çalıştığını belirtmiyor. Çaba, bu modellerdeki birincil kalite kaldıracı olduğundan, bir sayıyı yeniden üretmeye çalıştığınızda bu eksiklik önemlidir.

Çok dillilik sabit. Anthropic, çok dilli performansın Fable 5 ile aynı seviyede olduğunu, iyileşmediğini belirtiyor. İş yükünüz İngilizce dışındaysa, lansman tablosu kazancı abartır.

Güvenlik önlemi sayıları farklı bir kıyaslama türüdür. Anthropic, Fable 5'e kıyasla iyi huylu isteklerde %85 daha az biyoloji yanlış pozitifliği ve Claude Code oturumu başına yaklaşık %60 daha az siber müdahale rapor ediyor. Bunlar Anthropic'in kendi trafiğinde ölçülür ve harici olarak yeniden üretilemez, ancak retlerle karşılaşan bir Fable 5 kullanıcısı için herhangi bir yetenek satırından daha önemli olabilirler.

Kendinizin Test Edeceği Şeyler

Bir lansman tablosu nereye bakacağınızı söyler. Kendi değerlendirmeleriniz ise ilerleyip ilerlemeyeceğinizi. Yukarıdaki satırlara karşılık gelen dört test:

  1. Kendi ürününüzden uzun vadeli bir ajan görevi, Fable 5.1'de `high`, Opus 5'te `xhigh` ve Fable 5'te `high` çaba seviyesinde tamamlanana kadar çalıştırın. Bu, Terminal-Bench-Science ve AutomationBench analoğudur ve 2 kat fiyatın ya karşılığını verdiği ya da vermediği yerdir.
  2. En zorlu on kodlama isteminiz, Fable 5.1 ve Opus 5'te aynı çaba seviyesinde. Sonuçlar eşitse, CursorBench hikayesini yeniden üretmişsiniz demektir ve cevap Opus 5'tir.
  3. Sadece Fable 5.1 üzerinde bir çaba taraması, `low`dan `max`e kadar, rutin bir görevde. Anthropic'in iddiası, `medium`un Fable 5 ile eşleştiği ve `low`un görev başına maliyet açısından Opus 5 ile rekabet ettiğidir. Kontrol edin.
  4. İyi huylu güvenlik veya yaşam bilimleri istemlerinizdeki ret sayısı, Fable 5 ve Fable 5.1 arasında. Bu, %60 ve %85 iddiasıdır ve öğleden sonra doğrulayabileceğiniz bir iddiadır.

Dördünü de Apidog'da `model` ve `effort`u ortam değişkenleri olarak kullanarak istekler olarak oluşturun, `stop_reason` ve yanıtta beklenen bir dizenin varlığı hakkında iddialar ekleyin ve koleksiyonu modele göre çalıştırın. Çalışma geçmişi size yeni altyapı olmadan yeniden üretilebilir bir değerlendirme tablosu sunar. Kurmak için Apidog'u indirin; API rehberi istek şekillerini içerir.

Kıyaslamalar karara nasıl yansır

Sıkça Sorulan Sorular

Claude Fable 5.1'in en iyi kıyaslama sonucu nedir? Terminal-Bench-Science 0.1'de %52.6 ile Fable 5'in %24.7'sini iki katından fazla, Opus 5'in %29.0'ını ve GPT-5.6 Sol'un %22.4'ünü geride bırakıyor. Tüm rakamlar Anthropic'e aittir.

Fable 5.1, kodlama konusunda Opus 5 ile nasıl karşılaştırılır? Anthropic'in rakamlarına göre Terminal-Bench 4.0'da %55.8'e karşı %52.3 ve CursorBench 3.2.0'da %73.4'e karşı %70.0. Yaklaşık üç puanlık gerçek ama dar farklar.

Fable 5.1, GPT-5.6 Sol'dan daha mı iyi? Anthropic'in her ikisini de yayınladığı dört kıyaslamada evet, 6 ila 30 puan farkla. Anthropic, GPT-5.6 Sol sayılarını kendisi çalıştırdı ve dokuz satırından beşinde GPT-5.6 Sol girişi bulunmuyor.

Fable 5.1 kıyaslamaları bağımsız olarak doğrulandı mı? Lansman sırasında değil. Her sayı Anthropic tarafından yürütüldü. Bunları kendi iş yükünüzde test edilecek iddialar olarak kabul edin.

Mythos 5.1 nasıl puan alır? Anthropic tek bir sayı yayınladı: Terminal-Bench 4.0'da %60.9, Fable 5.1'in %55.8'inden beş puan yukarıda. İkisi farklı güvenlik önlemlerine sahip aynı modeldir.

Bu puanları hangi çaba seviyesi üretti? Anthropic belirtmedi. Rehberliği, Fable 5.1'in kazançlarının `xhigh` ve `max` seviyelerinde en büyük olduğudur, bu nedenle yüksek çaba varsayın ve daha düşük ayarlamaların daha düşük puan almasını bekleyin.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin