Sakana Fugu Benchmarks: Was auf Augenhöhe mit Fable 5 wirklich bedeutet

Sakanas Fugu-Benchmarks sind vom Anbieter gemeldete Paritätsaussagen, keine verifizierten Ergebnisse. Erfahren Sie, was jede Behauptung aussagt, wer sie aufgestellt hat und warum sie unbewiesen ist.

INEZA Felin-Michel

INEZA Felin-Michel

22 June 2026

Sakana Fugu Benchmarks: Was auf Augenhöhe mit Fable 5 wirklich bedeutet

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Sakanas Fugu-Benchmarks sind vom Anbieter gemeldete Gleichstandsaussagen, keine unabhängig überprüften Leistungsübersichten. Laut Sakanas Veröffentlichungsseite steht Fugu Ultra bei Ingenieurs-, wissenschaftlichen und Denkaufgaben „Schulter an Schulter mit führenden Modellen wie Fable 5 und Mythos Preview“, und Fugu „übertrifft durchweg“ Gemini 3.1 Pro, Opus 4.8 und GPT 5.5 in einer Reihe namentlich genannter Anwendungen. Der Haken, den Sie verstehen sollten, bevor Sie eine Zahl lesen: Fugu ist ein Orchestrator, der die Grenzmodelle anderer Anbieter aufruft, sodass seine Ergebnisse keine Siege eines Einzelmodells sind, so wie es bei Fable 5 der Fall ist.

Schaltfläche

Was Fugu tatsächlich ist und warum es die Art und Weise verändert, wie Sie Benchmarks lesen

Fugu ist kein einzelnes Basismodell. Es ist ein Multi-Agenten-Orchestrierungssystem, das als ein Modell hinter einer OpenAI-kompatiblen API präsentiert wird. Sakana beschreibt es als ein trainiertes Sprachmodell, das auf Delegation, Agentenkommunikation und Arbeitssynthese spezialisiert ist. Es koordiniert dynamisch mehrere LLMs, einschließlich rekursiver Instanzen seiner selbst, und entscheidet, ob es direkt antwortet oder ein Team zusammenstellt. Die Schlagzeile der Veröffentlichung lautet „Ein Modell, um sie alle zu befehlen.“

Dieses Designdetail ist die ganze Geschichte für Benchmarks. Wenn ein normales Modell eine Punktzahl veröffentlicht, spiegelt die Zahl die eigenen Gewichte dieses Modells wider, die die Arbeit leisten. Wenn Fugu eine Punktzahl veröffentlicht, kann die Zahl widerspiegeln, dass Fugu Opus 4.8, GPT 5.5 oder Gemini 3.1 Pro aufruft und dann deren Ausgaben synthetisiert. Ein Ergebnis wie „schlägt Opus 4.8“ kann also von einem System stammen, das Opus aufruft und es mit anderen Modellen kombiniert. Das ist ein Modell-von-Modellen-Ergebnis, kein Einzelmodell-Ergebnis. Wenn Sie den tieferen Architekturkontext wünschen, erläutert unser Erklärungsartikel zu Sakana Fugu den Orchestrierungszyklus.

Die Gleichstandsaussage: „Schulter an Schulter mit Fable 5 und Mythos Preview“

Hier ist die erste, sorgfältig formulierte Behauptung.

Laut Sakana steht Fugu Ultra bei Ingenieurs-, wissenschaftlichen und Denk-Benchmarks „Schulter an Schulter mit führenden Modellen wie Fable 5 und Mythos Preview“. Beachten Sie das Verb. Dies ist eine Gleichstandsaussage, keine „schlägt“-Aussage. Sakana positioniert Fugu Ultra als einen Grenzmodell-Ebenbürtigen, nicht als einen Grenzmodell-Führer.

Zwei Dinge verdienen eine Anmerkung.

Erstens ist der genannte Rivale „Mythos Preview“, das Grenzmodell vom April, das Anthropic als zu gefährlich zur Veröffentlichung bezeichnete. Es ist nicht das derzeit allgemein verfügbare Mythos 5. Wenn Sie über das Modell der Mythos-Klasse gelesen haben, wissen Sie, dass Preview und die ausgelieferte Version unterschiedliche Artefakte sind. Eine Gleichstandsaussage an Preview statt an das aktuelle Modell zu knüpfen, ist eine bewusste Entscheidung, und es ist wichtig, wie eindrucksvoll die Behauptung dadurch wirkt.

Zweitens unterstützt keine Benchmark-Tabelle dies in einer Form, die jemand außerhalb von Sakana nachvollziehen könnte. Die Behauptung ist auf der Veröffentlichungsseite qualitativ. Es gibt keine veröffentlichte Methodik, kein aufgabenbezogenes Punkteschema pro Aufgabe und keine Reproduktion durch Dritte. Behandeln Sie „Schulter an Schulter“ als die Darstellung eigener interner Ergebnisse des Anbieters.

Die stärkere Behauptung: „übertrifft durchweg“ bei genannten Anwendungen

Sakana stellt eine zweite, kühnere Behauptung auf, die es wert ist, von der ersten getrennt zu werden.

Laut Sakana „übertrifft“ Fugu drei konfigurierte Konkurrenten auf einer spezifischen Liste von Anwendungen „durchweg“:

Die genannten Anwendungen sind AutoResearch, Rubik’s Cube, Mechanisches Design, Japanische Handschriftenanalyse, One-Shot-Schach und Finanzzeitreihenprognose.

Dies ist eine Leistung auf Anwendungsebene, keine standardisierte akademische Benchmark-Suite. Dies sind End-to-End-Aufgaben, bei denen ein Orchestrierungssystem glänzen kann, da es Teilprobleme an das jeweils zugrunde liegende Modell weiterleiten kann, das sie am besten bewältigt, und die Ergebnisse dann zusammenfügt. Genau hier sollte ein Dirigent jeden einzelnen Spieler übertreffen.

Doch bleiben Sie wieder ehrlich. Mehrere dieser Konkurrenten sind Modelle, die Fugu aufrufen kann. Ein Ergebnis wie „schlägt Opus 4.8 (max)“ bei AutoResearch könnte bedeuten, dass Fugu Opus aufruft und es mit anderen Modellen kombiniert. Das ist eine echte Fähigkeit, und sie kann Ihnen wirklich helfen. Es ist kein Beweis dafür, dass ein einzelnes Sakana-Modell Opus in der Denkfähigkeit übertrifft. Lesen Sie diese Zahlen niemals als Sieg eines Einzelmodells und formulieren Sie es niemals als „Fugu schlägt Fable 5“, denn Sakana hat dies nicht einmal behauptet. Die Gleichstandsaussage und die Überlegenheitsaussage zielen auf unterschiedliche Rivalen ab.

Warum diese Zahlen noch nicht unabhängig überprüft werden können

Noch keine unabhängige Replikation. Jede Fugu-Benchmark-Angabe auf dieser Seite wird vom Anbieter gemeldet, auf Sakanas eigener Einrichtung gemessen, mit Konkurrentenkonfigurationen, die Sakana gewählt hat (die Anstrengungsstufen „hoch“, „max“ und „sehr hoch“). Stand 22.06.2026 hat keine dritte Partei diese Aufgaben erneut ausgeführt, kein aufgabenbezogenes Punkteschema wurde veröffentlicht und kein Evaluierungssystem wurde freigegeben. Die richtige Haltung ist, all dies als Behauptung und nicht als Messung zu behandeln.

Dies ist keine spezifische Kritik an Sakana. Dies ist der Standardzustand für jedes Modell am Starttag. Der Unterschied bei Fugu ist, dass das Orchestrierungsdesign die unabhängige Replikation erschwert, nicht erleichtert.

Um den Benchmark eines einzelnen Modells zu reproduzieren, benötigen Sie das Modell und den Test. Um Fugu’s zu reproduzieren, benötigen Sie Fugu plus Zugriff auf jedes zugrunde liegende Modell, an das es weiterleitet, in denselben Versionen und mit denselben Anstrengungseinstellungen, sowie dieselbe Orchestrierungstopologie, die Sakana verwendet hat. Das System „umgeht dynamisch“ Anbieterbeschränkungen und passt seine Agententopologie pro Aufgabe an, sodass zwei Ausführungen desselben Prompts möglicherweise nicht einmal dasselbe interne Team verwenden. Diese Anpassungsfähigkeit ist eine Funktion für Benutzer und ein Kopfzerbrechen für die Reproduzierbarkeit.

Sie werden hier also keine sauberen Direktvergleichstabellen finden, und Sie sollten skeptisch gegenüber allen kursierenden „Fugu erreichte X“-Zahlen aus Sekundärquellen sein. Mehrere dieser Sekundärartikel nennen die falschen Rivalenversionen (z. B. aktuelles Mythos statt Mythos Preview). Ein Zustand ohne konkrete Zahlen ist im Moment das ehrlichste Ergebnis. Unser Fugu Ultra vs. Fable 5 vs. Mythos Vergleich bleibt aus demselben Grund qualitativ.

Die Forschungsberichte hinter den Behauptungen

Sakanas Marketing basiert auf echter, zitierfähiger Forschung. Zwei ICLR 2026-Papiere beschreiben die Herkunft. Keines wird als Produkt-Benchmark behauptet, lesen Sie sie daher als Forschungsberichte, nicht als Fugu-Spezifikationsblätter.

Das erste ist Trinity, „Ein entwickelter LLM-Koordinator“ (arXiv:2512.04695). Trinity ist ein Koordinator mit unter 20.000 Parametern, optimiert durch ableitungsfreie Evolution, mit Rollen als Denker, Arbeiter und Verifizierer. Es ist winzig und entwickelt, nicht durch Gradientenabstieg trainiert.

Das zweite ist Conductor, „Lernen, Agenten in natürlicher Sprache zu orchestrieren“ (arXiv:2512.04388). Conductor ist ein 7B-Modell, das mit Reinforcement Learning trainiert wurde und die Kommunikationsstruktur zwischen Agenten lernt. Das Papier behauptet, dass es Mixture-of-Agents zu geringeren Kosten übertrifft.

Dies sind unterschiedliche Methoden und Größen. Trinity verwendet Evolution mit unter 20K Parametern. Conductor verwendet RL mit 7B Parametern. Verwechseln Sie sie nicht. Und gehen Sie nicht davon aus, dass die genauen Spezifikationen eines der Papiere das ausgelieferte Produkt beschreiben. Die Abbildung der 7B-Zahl oder eines spezifischen Basismodells auf das veröffentlichte Fugu ist eine Schlussfolgerung Dritter. Die offizielle Veröffentlichung gibt keine Produktparameteranzahl an.

Eine Spezifikationen-Randnotiz, die man neben den Behauptungen behalten sollte

Hier ist, was vernünftigerweise feststeht, gegenüber dem, was noch unbestätigt ist. Betrachten Sie die Architekturlinie als unbestätigt.

Punkt Was Sakana / Quellen sagen Vertrauenswürdigkeit
Systemtyp Multi-Agenten-Orchestrator hinter einem Modell Auf Veröffentlichungsseite angegeben
Varianten Fugu (ausgewogen, geringe Latenz) und Fugu Ultra (maximale Qualität) Auf Veröffentlichungsseite angegeben
Alter Beta-Name Kleine Variante wurde in Beta und Presse „Fugu Mini“ genannt Historisch
API-Schnittstelle Ein OpenAI-kompatibler Endpunkt, beide Varianten Auf Veröffentlichungsseite angegeben
Zugrunde liegende Modelle Ruft mehrere Frontier-LLMs auf, rekursiv sich selbst einschließend Auf Veröffentlichungsseite angegeben
Produktparameteranzahl Nicht veröffentlicht; 7B / Conductor-Spezifika sind Schlussfolgerung Dritter [PRÜFEN]
Benchmark-Methodik Vom Anbieter gemeldet, Sakanas eigene Einrichtung, kein System veröffentlicht [PRÜFEN]

Die Namensgebung sollte einmal wiederholt werden: Die kleine Variante wurde während der etwa 500 Nutzer umfassenden Beta-Phase, die um den 24.-25. April 2026 begann, „Fugu Mini“ genannt. Die Veröffentlichungsseite verwendet „Fugu“ und „Fugu Ultra“. Verwenden Sie die aktuellen Namen.

Was das für Ihre eigenen Tests bedeutet

Sie können Sakanas Benchmarks nicht überprüfen. Sie können Ihre eigenen durchführen.

Da Fugu das OpenAI-Chat-Completions-Protokoll spricht, richten Sie einen bestehenden OpenAI-Client auf die Fugu-Basis-URL und senden Ihre tatsächlichen Aufgaben. Keine SDK-Migration. Die Basis-URL ist mit Stand 22.06.2026 auf keiner öffentlichen Seite veröffentlicht. Kopieren Sie sie daher aus Ihrer Konsole unter console.sakana.ai und vertrauen Sie niemals einem erfundenen Host. Das untenstehende Muster entspricht der Standard- OpenAI-Chat-Completions-Anfrage:

from openai import OpenAI

# Kopieren Sie die echte Basis-URL von console.sakana.ai, nachdem Sie sich angemeldet haben.
client = OpenAI(
    api_key="YOUR_FUGU_API_KEY",
    base_url="<YOUR_FUGU_BASE_URL_FROM_CONSOLE>",
)

resp = client.chat.completions.create(
    model="fugu-ultra",  # 'fugu' für die ausgewogene Variante; gemeldete IDs, in der Konsole überprüfen
    messages=[
        {"role": "system", "content": "You are a precise code reviewer."},
        {"role": "user", "content": "Review this function for security issues:\n<Code hier einfügen>"},
    ],
)

print(resp.choices[0].message.content)

Die bisher gemeldeten Modell-ID-Strings sind fugu und fugu-ultra, möglicherweise mit einer datierten Form. Bestätigen Sie die genauen IDs in der Konsole, anstatt eine in Ihre Konfiguration einzubacken. Da Fugu pro Anfrage entscheidet, ob es direkt antwortet oder ein Team zusammenstellt, kann derselbe Prompt bei verschiedenen Durchläufen unterschiedliche Latenz und Kosten verursachen. Protokollieren Sie beides.

Hier ist es wichtiger als sonst, Ihre eigene Bewertung durchzuführen. Senden Sie die Aufgaben, die Ihnen wirklich wichtig sind, nicht AutoResearch oder One-Shot-Schach, und messen Sie Latenz, Kosten und Ausgabequalität im Vergleich zu den einzelnen Modellen, die Sie bereits verwenden. Anbieter-Benchmarks sagen Ihnen, was Sakana gemessen hat. Ihre eigenen Durchläufe sagen Ihnen, was Sie bekommen werden.

Wie dies in Ihren Apidog-Workflow passt

Sie brauchen kein neues Tool, um die Benchmark-Behauptungen eines Anbieters auf die Probe zu stellen. Sie benötigen eine Möglichkeit, denselben Prompt an mehrere Endpunkte zu senden und die Antworten nebeneinander zu vergleichen.

Apidog ermöglicht es Ihnen, den Fugu-Endpunkt als OpenAI-kompatible API zu registrieren, Ihre echten Evaluierungs-Prompts als Anfragen zu speichern und diese als Testszenario auszuführen. Legen Sie Fugu, Fable 5 und einen Opus-Endpunkt in dieselbe Umgebung, senden Sie identische Eingaben und erfassen Sie die Ausgaben, Statuscodes, Latenz und Token-Nutzung an einem Ort. Das ist ein weitaus nützlicherer Vergleich als eine Gleichstandsaussage ohne dahinterstehende Methodik. Wenn Sie die Kostenverschiebung durch Fugus adaptives Routing verfolgen möchten, decken Behauptungen über Antwortzeit und Token-Anzahl dies bei jedem Durchlauf auf. Laden Sie Apidog herunter, erstellen Sie den Vergleich einmal und wiederholen Sie ihn dann, wann immer eine neue Modellversion veröffentlicht wird.

Schaltfläche

Häufig gestellte Fragen

Schlägt Fugu Fable 5 bei Benchmarks?

Nein, und Sakana hat das nie behauptet. Die Behauptung ist ein Gleichstand: Fugu Ultra „steht Schulter an Schulter mit“ Fable 5 und Mythos Preview, laut Sakana. Die separate „übertrifft“-Behauptung zielt auf Gemini 3.1 Pro, Opus 4.8 und GPT 5.5 in spezifischen Anwendungen ab, nicht auf Fable 5. Für die Einzelmodellseite dieses Vergleichs siehe die Claude Fable 5 Benchmarks.

Sind die Fugu-Benchmark-Zahlen unabhängig überprüft?

Nein. Stand 22.06.2026 wird jede Zahl vom Anbieter auf Sakanas eigener Einrichtung gemeldet, mit Konkurrenten-Anstrengungseinstellungen, die Sakana gewählt hat. Keine dritte Partei hat die Aufgaben erneut ausgeführt, und kein Evaluierungssystem wurde veröffentlicht. Behandeln Sie die Behauptungen als Behauptungen, bis jemand außerhalb von Sakana sie reproduziert.

Warum ist es wichtig, dass Fugu ein Orchestrator ist?

Da Fugu die Grenzmodelle anderer Anbieter aufruft, rekursiv sich selbst einschließend, kann ein Ergebnis wie „schlägt Opus 4.8“ von Fugu stammen, das Opus aufruft und synthetisiert. Das ist ein Modell-von-Modellen-Sieg, kein Einzelmodell-Sieg. Fable 5 und die Mythos-Linie sind einzelne Anthropic-Modelle, was einen direkten Vergleich zu einem Äpfel-und-Birnen-Vergleich macht.

Gegen welches Mythos hat Sakana verglichen?

Das ältere Mythos Preview vom April, das Grenzmodell, das Anthropic als zu gefährlich zur Veröffentlichung bezeichnete, nicht das aktuelle Mythos 5. Einige Sekundärartikel nennen die falsche Version. Der Mythos-Klasse-Erklärer behandelt den Unterschied zwischen Preview und der ausgelieferten Version.

Was ist der Unterschied zwischen Trinity und Conductor?

Es sind zwei separate ICLR 2026-Papiere. Trinity (arXiv:2512.04695) ist ein Koordinator mit unter 20.000 Parametern, optimiert durch Evolution. Conductor (arXiv:2512.04388) ist ein 7B-Modell, das mit Reinforcement Learning trainiert wurde. Unterschiedliche Methoden, unterschiedliche Größen. Keines wird als Spezifikationsblatt des ausgelieferten Produkts behauptet.

Wie kann ich Fugus Leistung selbst testen?

Richten Sie einen OpenAI-kompatiblen Client auf die Fugu-Basis-URL von console.sakana.ai, senden Sie Ihre eigenen Aufgaben und messen Sie Qualität, Latenz und Kosten. Registrieren Sie den Endpunkt in Apidog, um Fugu mit den einzelnen Modellen, die Sie bereits verwenden, mit identischen Prompts und erfassten Metriken zu vergleichen.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen