Sakana'nın Fugu kıyaslamaları, bağımsız olarak doğrulanmış performans karneleri değil, tedarikçi tarafından bildirilen eşdeğerlik iddialarıdır. Sakana'nın yayın sayfasına göre, Fugu Ultra "mühendislik, bilimsel ve akıl yürütme görevlerinde Fable 5 ve Mythos Preview gibi önde gelen modellerle omuz omuza duruyor" ve Fugu, belirtilen bir uygulama setinde Gemini 3.1 Pro, Opus 4.8 ve GPT 5.5'ten "sürekli olarak daha iyi performans gösteriyor". Herhangi bir sayıyı okumadan önce anlaşılması gereken önemli nokta: Fugu, diğer tedarikçilerin öncü modellerini çağıran bir orkestratördür, bu nedenle sonuçları, Fable 5'inkiler gibi tek model zaferleri değildir.
Fugu aslında nedir ve kıyaslamaları okuma şeklinizi neden değiştirir?
Fugu tek bir temel model değildir. Tek bir OpenAI uyumlu API'nin arkasında tek bir model olarak sunulan çok ajanlı bir orkestrasyon sistemidir. Sakana bunu, yetki devri, ajan iletişimi ve iş sentezinde uzmanlaşmış eğitimli bir dil modeli olarak tanımlıyor. Kendisinin özyinelemeli örnekleri de dahil olmak üzere birden fazla LLM'yi dinamik olarak koordine eder ve doğrudan yanıtlayıp yanıtlamayacağına veya bir ekip kurup kurmayacağına karar verir. Yayın başlığı "Hepsine Hükmedecek Tek Model"dir.
Bu tasarım detayı, kıyaslamalar için tüm hikayeyi anlatır. Normal bir model bir puan yayınladığında, bu sayı o modelin kendi ağırlıklarının işi yaptığını yansıtır. Fugu bir puan yayınladığında ise, bu sayı Fugu'nun Opus 4.8'i veya GPT 5.5'i veya Gemini 3.1 Pro'yu çağırdığını ve ardından çıktılarını sentezlediğini yansıtabilir. Bu nedenle, "Opus 4.8'i yendi" sonucu, Opus'u çağıran ve onu diğer modellerle birleştiren bir sistemden gelebilir. Bu, tek bir modelin sonucu değil, modellerin-modeli sonucudur. Daha derin mimari bağlamı istiyorsanız, Sakana Fugu'nun ne olduğuna dair açıklayıcımız orkestrasyon döngüsünü anlatmaktadır.
Eşdeğerlik iddiası: "Fable 5 ve Mythos Preview ile omuz omuza"
İşte ilk iddia, dikkatlice ifade edilmiştir.
Sakana'ya göre, Fugu Ultra "mühendislik, bilimsel ve akıl yürütme kıyaslamalarında Fable 5 ve Mythos Preview gibi önde gelen modellerle omuz omuza duruyor". Fiili okuyun. Bu bir "geçtiği" iddiası değil, bir eşdeğerlik iddiasıdır. Sakana, Fugu Ultra'yı öncü bir akran olarak konumlandırıyor, öncü bir lider olarak değil.
İki şeyin altı çizilmelidir.
İlk olarak, adı geçen rakip, Anthropic'in yayınlanamayacak kadar tehlikeli olarak tanımladığı Nisan ayının öncü modeli "Mythos Preview"dır. Bu, şu anda genel olarak mevcut olan Mythos 5 değildir. Mythos sınıfı model hakkında okuduysanız, Preview ve piyasaya sürülen sürümün farklı yapılar olduğunu bilirsiniz. Bir eşdeğerlik iddiasını mevcut modele değil, Preview'e sabitlemek bir seçimdir ve iddianın ne kadar etkileyici göründüğü açısından önemlidir.
İkincisi, bu iddiayı Sakana dışından kimsenin tekrar çalıştıramayacağı bir biçimde destekleyen hiçbir kıyaslama tablosu yoktur. İddia, yayın sayfasında niteldir. Yayınlanmış bir metodoloji, görev bazında bir puan tablosu ve üçüncü taraf tarafından yeniden üretimi yoktur. "Omuz omuza" ifadesini, bir tedarikçinin kendi iç sonuçlarını çerçevelemesi olarak kabul edin.
Daha güçlü iddia: Belirtilen uygulamalarda "sürekli olarak daha iyi performans gösteriyor"
Sakana ikinci, daha cesur bir iddiada bulunuyor ve bunu ilk iddiadan ayırmak faydalıdır.
Sakana'ya göre, Fugu, belirli bir uygulama listesinde üç yapılandırılmış rakipten "sürekli olarak daha iyi performans gösteriyor":
- Gemini 3.1 Pro (yüksek)
- Opus 4.8 (maks)
- GPT 5.5 (çok yüksek)
Adı geçen uygulamalar AutoResearch, Rubik Küpü, Mekanik Tasarım, Japon El Yazısı Analizi, Tek Atış Satranç ve Finansal Zaman Serisi Tahmini'dir.
Bu, standart bir akademik kıyaslama paketi değil, uygulama düzeyinde performanstır. Bunlar, bir orkestrasyon sisteminin parlamak için yer bulabileceği uçtan uca görevlerdir, çünkü alt sorunları hangi temel modelin en iyi şekilde ele aldığına yönlendirebilir ve ardından sonuçları bir araya getirebilir. Bir orkestra şefinin herhangi bir tek oyuncuyu yenmesi gereken yer tam olarak burasıdır.
Ancak dürüstlük ilkesini tekrar uygulayın. Bu rakiplerin birçoğu Fugu'nun çağırabileceği modellerdir. AutoResearch'te "Opus 4.8'i (maks) yendi" sonucu, Fugu'nun Opus'u çağırması, diğer modelleri çağırması ve daha güçlü bir birleşik yanıt sentezlemesinden kaynaklanabilir. Bu gerçek bir yetenektir ve size gerçekten yardımcı olabilir. Bu, tek bir Sakana modelinin Opus'tan daha iyi akıl yürüttüğüne dair bir kanıt değildir. Bu sayıları asla tek model zaferi olarak okumayın ve asla "Fugu, Fable 5'i yendi" şeklinde ifade etmeyin, çünkü Sakana bunu iddia bile etmedi. Eşdeğerlik iddiası ve daha iyi performans iddiası farklı rakipleri hedefliyor.
Bu sayılar neden henüz bağımsız olarak doğrulanamıyor?
Henüz bağımsız tekrarlama yok. Bu sayfadaki her Fugu kıyaslama rakamı, Sakana'nın kendi kurulumunda, Sakana'nın seçtiği rakip yapılandırmalarla ( "yüksek", "maks" ve "çok yüksek" çaba ayarları) ölçülmüş, tedarikçi tarafından bildirilmiştir. 22.06.2026 itibarıyla, hiçbir üçüncü taraf bu görevleri yeniden çalıştırmadı, görev bazında hiçbir puan tablosu yayınlanmadı ve hiçbir değerlendirme aracı yayınlanmadı. Doğru duruş, hepsini bir ölçüm olarak değil, bir iddia olarak ele almaktır.
Bu özellikle Sakana'ya yönelik bir eleştiri değildir. Lansman günündeki herhangi bir model için varsayılan durum budur. Fugu'daki fark, orkestrasyon tasarımının bağımsız tekrarlamayı daha kolay değil, daha zor hale getirmesidir.
Tek bir modelin kıyaslamasını yeniden üretmek için modele ve teste ihtiyacınız vardır. Fugu'nun kıyaslamalarını yeniden üretmek için ise Fugu'ya ve yönlendirdiği her temel modele, aynı sürümlerde ve çaba ayarlarında erişime, ayrıca Sakana'nın çalıştırdığı aynı orkestrasyon topolojisine ihtiyacınız vardır. Sistem, sağlayıcı kısıtlamalarını "dinamik olarak aşar" ve ajan topolojisini göreve göre uyarlar, bu nedenle aynı komutun iki farklı çalıştırması aynı dahili ekibi bile kullanmayabilir. Bu uyarlanabilirlik kullanıcılar için bir özellik, tekrarlanabilirlik için ise bir baş belasıdır.
Bu nedenle burada net birebir karşılaştırma tabloları bulamazsınız ve ikincil kaynaklardan dolaşan herhangi bir "Fugu X puanı aldı" şeklindeki sayılara şüpheyle yaklaşmalısınız. Bu ikincil yazılımların birkaçı yanlış rakip sürümlerini adlandırmaktadır (örneğin, Mythos Preview yerine mevcut Mythos). Şu anda dürüst sonuç, sıfır veri durumudur. Fugu Ultra ile Fable 5 ve Mythos karşılaştırmamız da aynı nedenle nitel kalmaktadır.
İddiaların arkasındaki araştırma kayıtları
Sakana'nın pazarlaması, gerçek, atıfta bulunulabilir araştırmalara dayanmaktadır. İki ICLR 2026 makalesi soy ağacını tanımlamaktadır. Hiçbiri bir ürün kıyaslaması olarak iddia edilmemiştir, bu nedenle bunları Fugu teknik özellikleri olarak değil, araştırma kayıtları olarak okuyun.
Birincisi, "Gelişmiş Bir LLM Koordinatörü" olan Trinity'dir (arXiv:2512.04695). Trinity, Türevsiz Evrim ile optimize edilmiş, Düşünür, Çalışan ve Doğrulayıcı rollerine sahip 20.000'den az parametreli bir koordinatördür. Küçük ve evrilmiş, gradyan inişi ile eğitilmemiştir.
İkincisi, "Doğal Dilde Ajanları Organize Etmeyi Öğrenmek" olan Conductor'dır (arXiv:2512.04388). Conductor, ajanlar arasındaki iletişim yapısını öğrenen, takviyeli öğrenme ile eğitilmiş 7B parametreli bir modeldir. Makale, daha düşük maliyetle Mixture-of-Agents'ı yendiğini iddia ediyor.
Bunlar farklı yöntemler ve farklı boyutlardır. Trinity, 20K'den az parametrede evrimi kullanır. Conductor, 7B parametrede takviyeli öğrenmeyi kullanır. Onları karıştırmayın. Ve bu makalelerin kesin teknik özelliklerinin piyasaya sürülen ürünü tanımladığını varsaymayın. 7B rakamını veya herhangi bir belirli temel modeli, piyasaya sürülen Fugu'ya eşlemek üçüncü taraf çıkarımıdır. Resmi sürümde ürün parametre sayısı verilmemiştir.
İddiaların yanında tutulması gereken bir teknik özellikler kenar çubuğu
İşte makul ölçüde kanıtlanmış olanlar ile hala doğrulanmamış olanlar. Mimari çizgisini doğrulanmamış kabul edin.
| Öğe | Sakana / kaynaklar ne diyor | Güvenilirlik |
|---|---|---|
| Sistem tipi | Tek bir modelin arkasındaki çok ajanlı orkestratör | Yayın sayfasında belirtilmiştir |
| Varyantlar | Fugu (dengeli, düşük gecikme) ve Fugu Ultra (maksimum kalite) | Yayın sayfasında belirtilmiştir |
| Eski beta adı | Küçük varyant, beta ve basında "Fugu Mini" olarak adlandırıldı | Tarihsel |
| API yüzeyi | Tek OpenAI uyumlu uç nokta, her iki varyant için | Yayın sayfasında belirtilmiştir |
| Temel modeller | Birden fazla öncü LLM'yi çağırır, özyinelemeli olarak kendini de dahil eder | Yayın sayfasında belirtilmiştir |
| Ürün parametre sayısı | Yayınlanmamış; 7B / Conductor ayrıntıları üçüncü taraf çıkarımıdır | [DOĞRULA] |
| Kıyaslama metodolojisi | Tedarikçi tarafından bildirilen, Sakana'nın kendi kurulumu, araç yayınlanmamış | [DOĞRULA] |
İsimlendirme notunu bir kez daha tekrarlamakta fayda var: küçük varyant, yaklaşık 24-25 Nisan 2026 civarında açılan yaklaşık 500 kullanıcılı beta sırasında "Fugu Mini" olarak adlandırılıyordu. Yayın sayfasında "Fugu" ve "Fugu Ultra" kullanılıyor. Güncel isimlerle başlayın.
Kendi testleriniz için bu ne anlama geliyor?
Sakana'nın kıyaslamalarını doğrulayamazsınız. Kendi kıyaslamalarınızı yapabilirsiniz.
Fugu, OpenAI sohbet tamamlama protokolünü kullandığı için, mevcut bir OpenAI istemcisini Fugu temel URL'sine yönlendirir ve gerçek görevlerinizi gönderirsiniz. SDK geçişi yok. Temel URL, 22.06.2026 itibarıyla hiçbir genel sayfada yayınlanmamıştır, bu nedenle console.sakana.ai adresindeki konsolunuzdan kopyalayın ve asla uydurma bir ana bilgisayara güvenmeyin. Aşağıdaki kalıp, standart OpenAI sohbet tamamlama isteğini yansıtmaktadır:
from openai import OpenAI
# console.sakana.ai adresinden giriş yaptıktan sonra gerçek temel URL'yi kopyalayın.
client = OpenAI(
api_key="SİZİN_FUGU_API_ANAHTARINIZ",
base_url="",
)
resp = client.chat.completions.create(
model="fugu-ultra", # dengeli varyant için 'fugu'; bildirilen kimlikleri konsolda doğrulayın
messages=[
{"role": "system", "content": "Siz titiz bir kod inceleyicisiniz."},
{"role": "user", "content": "Bu fonksiyonu güvenlik açıkları açısından inceleyin:\n"},
],
)
print(resp.choices[0].message.content)
Şimdiye kadar bildirilen model kimliği dizeleri `fugu` ve `fugu-ultra` olup, muhtemelen tarihli bir biçime sahiptir. Yapılandırmanıza bir kimlik yerleştirmek yerine kesin kimlikleri konsolda onaylayın. Fugu, doğrudan yanıtlayıp yanıtlamayacağına veya bir ekip oluşturup oluşturmayacağına her istek için karar verdiğinden, aynı komut farklı çalıştırmalarda farklı gecikme ve maliyet üretebilir. İkisini de kaydedin.
Kendi değerlendirmenizi çalıştırmanın normalden daha önemli olduğu yer burasıdır. AutoResearch veya tek atış satranç değil, gerçekten önemsediğiniz görevleri gönderin ve kullandığınız tek modellerle gecikmeyi, maliyeti ve çıktı kalitesini ölçün. Tedarikçi kıyaslamaları size Sakana'nın ne ölçtüğünü söyler. Kendi denemeleriniz size ne elde edeceğinizi söyler.
Bu, Apidog iş akışınıza nasıl uyuyor?
Bir tedarikçinin kıyaslama iddialarını baskı testi yapmak için yeni bir araca ihtiyacınız yok. Aynı komutu birden fazla uç noktaya göndermenin ve yanıtları yan yana karşılaştırmanın bir yoluna ihtiyacınız var.

Apidog, Fugu uç noktasını OpenAI uyumlu bir API olarak kaydetmenize, gerçek değerlendirme komutlarınızı istek olarak kaydetmenize ve bunları bir test senaryosu olarak çalıştırmanıza olanak tanır. Fugu, Fable 5 ve bir Opus uç noktasını aynı ortama yerleştirin, aynı girdileri gönderin ve çıktıları, durum kodlarını, gecikmeyi ve token kullanımını tek bir yerde yakalayın. Bu, arkasında hiçbir metodoloji olmayan bir eşdeğerlik iddiasından çok daha faydalı bir karşılaştırmadır. Fugu'nun adaptif yönlendirmesinden kaynaklanan maliyet kaymasını izlemek istediğinizde, yanıt süresi ve token sayılarındaki onaylar bunu her çalıştırmada ortaya çıkarır. Apidog'u indirin ve karşılaştırmayı bir kez oluşturun, ardından yeni bir model sürümü çıktığında yeniden çalıştırın.
Sıkça Sorulan Sorular
Fugu, Fable 5'i kıyaslamalarda geçiyor mu?
Hayır, Sakana bunu asla iddia etmedi. İddia eşdeğerliktir: Sakana'ya göre Fugu Ultra, Fable 5 ve Mythos Preview ile "omuz omuza duruyor". Ayrı "daha iyi performans gösteriyor" iddiası, Fable 5'i değil, belirli uygulamalarda Gemini 3.1 Pro, Opus 4.8 ve GPT 5.5'i hedefliyor. Bu karşılaştırmanın tek model tarafı için, Claude Fable 5 kıyaslamalarına bakın.
Fugu kıyaslama sayıları bağımsız olarak doğrulandı mı?
Hayır. 22.06.2026 itibarıyla, her rakam, Sakana'nın kendi kurulumunda, Sakana'nın seçtiği rakip çaba ayarlarıyla tedarikçi tarafından bildirilmiştir. Hiçbir üçüncü taraf görevleri yeniden çalıştırmadı ve hiçbir değerlendirme aracı yayınlanmadı. Sakana dışından biri onları yeniden üretinceye kadar iddiaları iddia olarak kabul edin.
Fugu'nun bir orkestratör olması neden önemli?
Çünkü Fugu, kendini de özyinelemeli olarak içeren diğer tedarikçilerin öncü modellerini çağırdığından, "Opus 4.8'i yendi" sonucu, Fugu'nun Opus'u çağırması ve sentezlemesinden kaynaklanabilir. Bu, tek model zaferi değil, modellerin-modeli zaferidir. Fable 5 ve Mythos serisi, tek Anthropic modelleridir; bu da doğrudan birebir karşılaştırmayı elma-armut karşılaştırması yapar.
Sakana hangi Mythos ile karşılaştırdı?
Nisan ayından kalan daha eski Mythos Preview, Anthropic'in yayınlanamayacak kadar tehlikeli olarak tanımladığı öncü model, mevcut Mythos 5 değil. Bazı ikincil yazılımlar yanlış sürümü adlandırıyor. Mythos sınıfı açıklayıcı, Preview ile piyasaya sürülen sürüm arasındaki farkı kapsamaktadır.
Trinity ve Conductor arasındaki fark nedir?
Bunlar iki ayrı ICLR 2026 makalesidir. Trinity (arXiv:2512.04695), evrimle optimize edilmiş, 20.000'den az parametreli bir koordinatördür. Conductor (arXiv:2512.04388), takviyeli öğrenme ile eğitilmiş 7B parametreli bir modeldir. Farklı yöntemler, farklı boyutlar. Hiçbiri, piyasaya sürülen ürünün teknik veri sayfası olarak iddia edilmiyor.
Fugu'nun performansını kendim nasıl test edebilirim?
OpenAI uyumlu bir istemciyi console.sakana.ai adresindeki Fugu temel URL'sine yönlendirin, kendi görevlerinizi gönderin ve kaliteyi, gecikmeyi ve maliyeti ölçün. Fugu'yu, kullandığınız tek modellerle, aynı komutlar ve yakalanan metriklerle karşılaştırmak için uç noktayı Apidog'da kaydedin.
