Fugu Ultra ist Sakana AIs Top-Variante von Fugu, und die Veröffentlichung stellt sie als ebenbürtig zur aktuellen Spitzenklasse dar, nicht als deren Bezwinger. Laut Sakana steht Fugu Ultra „Schulter an Schulter mit führenden Modellen wie Fable 5 und Mythos Preview“ bei Engineering-, wissenschaftlichen und Reasoning-Benchmarks. Das ist eine Gleichwertigkeitsaussage, keine „Überlegenheit“-Aussage. Der wichtige Haken: Fugu ist ein Orchestrator, der Modelle anderer Anbieter aufruft, und konkurriert daher in einer anderen Kategorie als die einzelnen Anthropic-Modelle, neben denen es steht. Die vollständigen Details finden Sie auf der Sakana Fugu Release-Seite, und Sie können unsere ausführlichere Analyse in Was ist Sakana Fugu lesen.
Was Sie vergleichen
Fugu ist ein Multi-Agenten-Orchestrierungssystem, das als ein einziges Basismodell hinter einer OpenAI-kompatiblen API präsentiert wird. Sakana beschreibt es als ein trainiertes Sprachmodell, das auf Delegation, Agentenkommunikation und Arbeitssynthese spezialisiert ist. Es koordiniert dynamisch mehrere LLMs, einschließlich rekursiver Instanzen von sich selbst, und entscheidet bei jeder Anfrage, ob es direkt antwortet oder ein Team zusammenstellt. Die Schlagzeile der Veröffentlichung lautet: „Ein Modell, um sie alle zu befehligen.“

Fable 5 und Mythos sind unterschiedlich. Sie sind einzelne Anthropic-Modelle. Fable 5 ist das leistungsstärkste allgemein verfügbare Modell von Anthropic, ein Modell der „Mythos-Klasse“, das für die öffentliche Nutzung sicher gemacht wurde, eine Stufe über Opus 4.8. Mythos Preview, veröffentlicht am 7. April 2026, ist das Spitzenmodell, das Anthropic als zu gefährlich für eine Veröffentlichung beschrieb. Ein wichtiges Detail zur Namensgebung: Sakana nannte in seinem Vergleich die ältere Mythos Preview, nicht das aktuelle Mythos 5. Wir behandeln die Anthropic-Seite in Fable 5 vs. Mythos 5 und das Modell der Mythos-Klasse erklärt.
Das Matchup ist also ein Modell-aus-Modellen gegen einzelne Modelle. Behalten Sie diesen Rahmen im Kopf. Er verändert, wie Sie jede Zahl unten lesen.
Fugu und Fugu Ultra, kurz gesagt
Fugu wird in zwei Varianten über einen Endpunkt ausgeliefert. „Fugu“ ist die ausgewogene Option mit geringer Latenz für die tägliche Arbeit, Codierung, Code-Reviews, Chatbots und interaktive Dienste. „Fugu Ultra“ zielt auf maximale Antwortqualität für KI-Forschung, Papierreplikation, Cybersicherheitsanalysen sowie Literatur- oder Patentuntersuchungen ab. Die Beta-Version und ein Großteil der Presse nannten die kleine Variante „Fugu Mini“, aber die Release-Seite führt „Fugu“ und „Fugu Ultra“ an, daher sind dies die zu verwendenden Namen.

Das ehrliche Rückgrat: Orchestrator vs. Einzelmodell
Das ist der Teil, den Sie nicht überspringen können. Fugu ist ein Orchestrator. Wenn es eine starke Antwort produziert, hat es dies möglicherweise getan, indem es das Spitzenmodell eines anderen Anbieters aufgerufen und das Ergebnis synthetisiert hat. Dazu gehört das Aufrufen von Opus 4.8, Gemini oder rekursiven Kopien von sich selbst.
Wenn Sie also ein Ergebnis sehen, bei dem Fugu „Opus 4.8 schlägt“, ist es durchaus möglich, dass Fugu dieses Ergebnis erzielt hat, indem es Opus 4.8 aufgerufen und eine Verifikations- oder Syntheseschicht hinzugefügt hat. Das ist eine echte Fähigkeit und kann wirklich nützlich sein. Es ist nicht dasselbe, wie wenn ein einzelnes Modell Opus mit seinen eigenen Gewichten schlägt.
Fable 5 und Mythos sind Einzelmodelle. Sie antworten aus ihren eigenen Parametern. Es gibt kein Team hinter dem Vorhang.
Deshalb werden wir in diesem Artikel niemals schreiben „Fugu schlägt Fable 5“, und Sie sollten jeder Quelle, die dies tut, skeptisch gegenüberstehen. Die Kategorien sind unterschiedlich. Eine faire Lesart ist: „Ein orchestriertes System erreichte eine mit der Spitzenklasse vergleichbare Qualität, teilweise durch Weiterleitung an Spitzenmodelle.“ Dieser Satz ist weniger prägnant, aber weitaus genauer. Eine vollständige Erläuterung der Benchmarks finden Sie unter Sakana Fugu Benchmarks.
Stufe eins: Gleichwertigkeit mit Fable 5 und Mythos Preview
Sakanas erster Anspruch ist die Gleichwertigkeit. Laut Sakana steht Fugu Ultra bei Engineering-, wissenschaftlichen und Reasoning-Benchmarks Schulter an Schulter mit Fable 5 und Mythos Preview. Lesen Sie das sorgfältig. „Schulter an Schulter“ ist ein Wort für Gleichwertigkeit. Es sagt nicht, dass Fugu Ultra gewinnt. Es sagt, dass Fugu Ultra mithält.
Zwei Dinge machen diese Behauptung interessanter als eine bloße Punktzahl.
Erstens, der von Sakana gewählte Konkurrent. Mythos Preview ist das April-Spitzenmodell, nicht das aktuelle Mythos 5. Die Preisgestaltung spiegelt diese Lücke wider: Anthropic listet Fable 5 und Mythos 5 mit 10 $ pro Million Input-Token und 50 $ pro Million Output, während Mythos Preview bei 25 $ Input und 125 $ Output lag (Anthropic-Preise, 9. Juni 2026). Die Nennung der älteren Preview ist eine vertretbare Wahl für einen reproduzierbaren Vergleich, aber es ist wichtig, dies klar darzulegen, damit Sie nicht mit einem Modell vergleichen, das die aktuelle Obergrenze nicht mehr darstellt.
Zweitens, der Mechanismus. Wenn Fugu Ultra ein Reasoning-Niveau wie Fable 5 erreicht, indem es ein Team orchestriert, ist die Gleichwertigkeit auf Systemebene real, selbst wenn kein einzelnes zugrunde liegendes Modell Fable 5 allein erreicht hat. Das ist die ehrliche Formulierung. Für die Einzelmodell-Seite dieses Vergleichs erklärt Claude Fable 5 vs. Opus 4.8, wo Fable 5 selbst steht.
Stufe zwei: Wo Sakana behauptet, dass Fugu übertrifft
Dies ist eine separate Behauptung, gegen eine separate Reihe von Modellen, und sie verdient einen eigenen Abschnitt, damit sie niemals mit der obigen Gleichwertigkeitsbehauptung verschwimmt.
Laut Sakana „übertrifft“ Fugu drei Spitzenmodelle bei spezifischen Anwendungen „konstant“:
- Gemini 3.1 Pro (high)
- Opus 4.8 (max)
- GPT 5.5 (xhigh)
Die genannten Anwendungen sind eng und konkret: AutoResearch, Rubik's Cube, Mechanische Konstruktion, Analyse japanischer Handschriften, One-Shot-Schach und Finanzzeitreihenprognose.
Auch hier gelten zwei ehrliche Anmerkungen. Dies sind Gewinne auf Anwendungsebene, keine allgemeinen Benchmark-Gewinne. Ein Orchestrator kann bei einer strukturierten, mehrstufigen Aufgabe wie AutoResearch oder Schach hohe Punktzahlen erzielen, weil er planen, delegieren, überprüfen und wiederholen kann. Genau hier verdient eine Koordinationsschicht ihr Geld. Und noch einmal: Die Überlegenheit kann teilweise daher rühren, dass sie an dieselben Spitzenmodelle weiterleitet, mit denen sie verglichen wird. Ein Ergebnis „schlägt Opus 4.8 beim Rubik's Cube“, das durch Aufruf von Opus innerhalb der Schleife erzielt wurde, ist ein Systemgewinn, kein Gewichtsgewinn.
Die genaue Zusammenfassung lautet also: Fugus Koordinationsschicht bietet messbaren Mehrwert bei strukturierten, überprüfbaren Aufgaben, manchmal genug, um ein einzelnes Spitzenmodell bei dieser spezifischen Aufgabe zu übertreffen.
Die Vergleichstabelle
Diese Tabelle hält die Kategorienzeile absichtlich zuerst. Lesen Sie diese Zeile vor dem Rest.
| Dimension | Fugu / Fugu Ultra | Fable 5 | Mythos (Preview / 5) |
|---|---|---|---|
| Art des Systems | Orchestrator: Trainierter Dirigent, der mehrere LLMs aufruft, einschließlich sich selbst | Einzelnes Anthropic-Modell | Einzelnes Anthropic-Modell |
| Anbieter | Sakana AI | Anthropic | Anthropic |
| Sakanas Behauptung vs. dieses Modell | Gleichwertigkeit („Schulter an Schulter“) mit Fable 5 und Mythos Preview | Genannter Gleichwertigkeits-Peer | Genannter Gleichwertigkeits-Peer (Preview, nicht 5) |
| Separate Überlegenheitsbehauptung | Vs. Gemini 3.1 Pro, Opus 4.8, GPT 5.5 bei genannten Anwendungen | Nicht das Überlegenheitsziel | Nicht das Überlegenheitsziel |
| Preisgestaltung (Quelle) | Gemeldete Stufen + PAYG, alles [ÜBERPRÜFEN] | $10 Eingang / $50 Ausgang pro 1 Mio. | Preview $25 Eingang / $125 Ausgang; Mythos 5 $10 / $50 |
| API-Schnittstelle | Ein OpenAI-kompatibler Endpunkt, beide Varianten | Anthropic API | Anthropic API |
| Stärke | Strukturierte mehrstufige Aufgaben, Governance-Routing | Allgemeine Spitzenqualität, GA-sicher | Rohe Spitzenobergrenze |
Die Preisangaben für Fugu sind gemeldet und stammen nicht von der Release-Seite selbst, daher behandeln Sie jede Fugu-Dollarzahl als unbestätigt, bis Sie sie live überprüfen. Die Anthropic-Zahlen stammen aus der Preisliste von Anthropic vom 9. Juni 2026. Eine genauere Betrachtung der eigenen Ergebnisse von Fable 5 finden Sie unter Claude Fable 5 Benchmarks.
Preisgestaltung, ehrlich dargelegt
Sakana bestätigte auf der Release-Seite eine Preisstruktur: Abonnementstufen für den täglichen Gebrauch, plus einen Pay-as-you-go-Plan für größere und Unternehmens-Workloads. Dieses Konzept ist solide.
Jede tatsächliche Zahl ist es nicht. Stand 22.06.2026 stammen die gemeldeten Zahlen aus JS-gerenderten oder sekundären Quellen, nicht von der Release-Seite. Gemeldete Abonnementstufen liegen bei 20 $, 100 $ und 200 $ pro Monat für beide Modelle, mit einer Einführungsaktion für einen kostenlosen zweiten Monat, wenn Sie vor Ende Juli 2026 abonnieren. Gemeldete Pay-as-you-go-Preise liegen bei etwa 5 $ Input, 30 $ Output und 0,50 $ für gecachte Daten pro Million Token, mit einem Kontextzuschlag über 272.000 Token. Die Basisvariante „Fugu“ wird Berichten zufolge zum Standardtarif des zugrunde liegenden Modells, das sie aufruft, weiterberechnet. Es wurde kein eigenständiger kostenloser Tarif bekannt.
Gemeldet, Stand 22.06.2026 live überprüfen. Planen Sie kein Budget mit diesen Zahlen, bevor Sie sie in Ihrer Konsole bestätigt haben. Die Struktur ist real; die Zahlen noch nicht.
Die Forschungsgeschichte und was sie nicht beweist
Sakana hat die Orchestrierung nicht erfunden. Mixture-of-Agents von Together AI (ICLR 2025) zeigte bereits, dass orchestrierte Modelle einzelne Modelle schlagen. Fugus engere Neuheit ist eine gelernte, adaptive, kosten-selektive Topologie, die als ein Endpunkt ausgeliefert wird, gestützt durch eine Forschungslinie von trainierten Dirigenten.
Diese Linie ist real und zitierbar. Zwei ICLR 2026-Papiere stehen hinter dem Ansatz. Trinity, „An Evolved LLM Coordinator“ (arXiv:2512.04695), ist ein Koordinator mit unter 20.000 Parametern, optimiert durch ableitungsfreie Evolution, mit Denker-, Arbeiter- und Prüferrollen. Conductor, „Learning to Orchestrate Agents in Natural Language“ (arXiv:2512.04388), ist ein 7B-Modell, das mit Reinforcement Learning trainiert wurde, die Kommunikationsstruktur lernt und behauptet, Mixture-of-Agents zu geringeren Kosten zu übertreffen.
Dies sind unterschiedliche Methoden und Größen. Evolution versus RL, unter 20.000 versus 7B. Verwechseln Sie sie nicht und gehen Sie nicht davon aus, dass sich die jeweiligen Besonderheiten nahtlos auf das ausgelieferte Produkt übertragen lassen. Die offizielle Veröffentlichung gibt keine Produktparameteranzahl an, daher ist die Anwendung der 7B-Details auf Fugu selbst eine Schlussfolgerung Dritter, keine festgestellte Tatsache.
Was Fugu von seinen Nachbarn unterscheidet, ist konkret. Router wie OpenRouter oder Martian wählen ein Modell aus und leiten Ihre Anfrage dorthin. Agenten-Frameworks wie Swarm, AutoGen oder LangGraph machen Sie zum Koordinator. Fugu trainiert den Koordinator und verbirgt ihn hinter einem einzigen Aufruf.
Wie dies in Ihren Apidog-Workflow passt
Fugu stellt einen OpenAI-kompatiblen Endpunkt bereit. Sie richten einen vorhandenen OpenAI-Client mit Ihrem Schlüssel darauf aus und müssen kein SDK migrieren. Beide Varianten laufen über denselben Endpunkt, und Fugu entscheidet, ob es direkt antwortet oder ein Team zusammenstellt.
Die Basis-URL ist Stand 22.06.2026 auf keiner öffentlichen Seite veröffentlicht, vertrauen Sie also keinem Host, den Sie herumschweben sehen. Kopieren Sie die echte Basis-URL aus Ihrer Konsole unter console.sakana.ai und fügen Sie sie dann in eine standardmäßige OpenAI-Anfrage ein. Die gemeldeten Modell-ID-Strings sind fugu und fugu-ultra, mit einer möglichen datierten Form; bestätigen Sie die genaue ID in Ihrer Konsole, anstatt eine datierte Zeichenfolge fest zu codieren.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_SAKANA_API_KEY",
base_url="<YOUR_FUGU_BASE_URL_FROM_CONSOLE>", # copy from console.sakana.ai
)
response = client.chat.completions.create(
model="fugu-ultra", # confirm exact id in console; "fugu" for the balanced variant
messages=[
{"role": "system", "content": "You are a careful code reviewer."},
{"role": "user", "content": "Review this pull request for security issues."},
],
)
print(response.choices[0].message.content)
Da es das OpenAI Chat Completions-Format (OpenAI API-Referenz) spricht, können Sie Fugu auf dieselbe Weise testen wie jeden anderen Modellendpunkt. Erstellen Sie in Apidog eine Anfrage gegen Ihre Konsolen-Basis-URL, setzen Sie das Modellfeld auf fugu-ultra und speichern Sie es als wiederverwendbaren Fall. Sie können dieselbe Anfrage parallel gegen Fable 5- oder Opus 4.8-Endpunkte ausführen, Antworten vergleichen und die für Sie wichtigen Teile überprüfen. Das ist der praktische Weg, Sakanas Gleichwertigkeitsbehauptung mit Ihren eigenen Prompts zu überprüfen, anstatt einer Marketingtabelle zu vertrauen. Laden Sie Apidog herunter, um den Vergleich einzurichten.
Ein operatives Detail, das für Compliance-Teams hervorzuheben ist. Fugus Agenten sind austauschbar, Sie können bestimmte Agenten aus dem Pool für Daten- oder Compliance-Gründe ausschließen, und Sakana sagt, dass Fugu dynamisch Anbieterbeschränkungen umgeht. Wenn Sie in einem regulierten Kontext testen, nutzen Sie diesen Opt-out-Pfad und stellen Sie sicher, dass ausgeschlossene Anbieter niemals in der Antwortspur erscheinen.
Das Urteil, beide Seiten sachlich betrachtet
Argumente für Beeindruckung: Sakana lieferte einen trainierten Dirigenten als einen sauberen Endpunkt, gestützt durch eine echte Forschungslinie, und behauptete sowohl Spitzen-Gleichwertigkeit als auch Anwendungsebene-Siege. Bei strukturierten, überprüfbaren Aufgaben wie AutoResearch und Schach ist eine Koordinationsschicht genau das richtige Werkzeug, und frühe Nutzer bestätigen dies. Sakana berichtet von einem Softwareingenieur, der sagte, Fugu Ultra habe in einem Code-Review mehr als zwanzig Probleme aufgedeckt, wo andere Tools etwa drei kennzeichnen, und nannte es besser als GPT-5.5. Ein Sicherheitsingenieur sagte, eine einzige zielgerichtete Anweisung habe eine vollständige End-to-End-Bewertung, einschließlich Aufklärung und Authentifizierungsprüfung, ermöglicht, während sie im Rahmen blieb.
Argumente für Zurückhaltung: Die Gleichwertigkeitsbehauptung bezieht sich auf die ältere Mythos Preview, nicht auf Mythos 5, und die Überlegenheitsbehauptung sitzt in einer separaten Kategorie gegen einen anderen Modellsatz. Beide Behauptungen stammen von einem System, das seine Zahlen erreichen kann, indem es dieselben Modelle aufruft, mit denen es verglichen wird. Mixture-of-Agents hat bereits bewiesen, dass Orchestrierung einzelne Modelle schlagen kann, daher ist die übergeordnete Idee nicht neu. Die ehrliche Lesart ist „Spitzenklasse-vergleichbare Orchestrierung mit einem gelernten Dirigenten und einer starken Governance-Story“, nicht „das neue beste Modell“.
Für die meisten Teams ist der richtige Schritt weder Hype noch Ablehnung. Führen Sie Fugu Ultra gegen Fable 5 und Opus 4.8 bei Ihren eigenen strukturierten Aufgaben aus, beobachten Sie, wo die Koordinationsschicht ihre Kosten rechtfertigt, und überprüfen Sie jede Preiszahl, bevor Sie sich festlegen. Sakanas Branding lehnt sich an die Metapher an: Fugu ist der Kugelfisch, sicher nur, wenn ein erfahrener Koch ihn zubereitet, und Orchestrierung ist diese sorgfältige Zubereitung. Ob die Zubereitung den Aufpreis wert ist, kann Ihre eigene Testsuite schneller beantworten als jede Release-Seite.
Häufig gestellte Fragen
Schlägt Fugu Ultra Fable 5?
Nein, und Sakana behauptet das auch nicht. Laut Sakana steht Fugu Ultra Schulter an Schulter mit Fable 5 und Mythos Preview, was eine Gleichwertigkeitsbehauptung und kein Sieg ist. Da Fugu ein Orchestrator ist, der Spitzenmodelle aufrufen kann, kann jeder „Sieg“, den Sie sehen, durch die Weiterleitung an diese Modelle zustande kommen. Siehe Fable 5 vs. Mythos 5 für die Einzelmodell-Seite.
Was meint Sakana, wenn es sagt, Fugu übertrifft Opus 4.8?
Das ist eine separate Behauptung von der Gleichwertigkeitsbehauptung und gilt für spezifische Anwendungen, nicht für allgemeine Benchmarks. Laut Sakana übertrifft Fugu Gemini 3.1 Pro, Opus 4.8 und GPT 5.5 bei Aufgaben wie AutoResearch, One-Shot-Schach und Finanzzeitreihenprognose konstant. Beachten Sie, dass Fugu diese Ergebnisse möglicherweise durch Aufruf von Opus innerhalb seiner eigenen Schleife erzielt, es ist also ein Systemgewinn, kein Einzelmodellgewinn.
Warum vergleicht Sakana mit Mythos Preview statt mit Mythos 5?
Mythos Preview ist das April 2026 Spitzenmodell, das Anthropic als zu gefährlich zur Veröffentlichung bezeichnete, während Mythos 5 die aktuell allgemein verfügbare Version ist. Sakana nannte in seinem Vergleich die ältere Preview. Es ist eine vertretbare Wahl für einen reproduzierbaren Test, bedeutet aber, dass die Gleichwertigkeitsbehauptung nicht gegen die heutige Obergrenze gemessen wird. Das Modell der Mythos-Klasse erklärt behandelt den Unterschied.
Ist Fugu ein einzelnes Modell oder eine Gruppe von Modellen?
Es ist eine Gruppe. Fugu ist ein trainierter Dirigent, der Aufgaben an mehrere LLMs delegiert, einschließlich rekursiver Kopien von sich selbst, und das gesamte System als ein Modell hinter einer OpenAI-kompatiblen API präsentiert. Fable 5 und Mythos sind einzelne Anthropic-Modelle, die aus ihren eigenen Gewichten antworten, was der Hauptgrund ist, warum dieser Vergleich zwei verschiedene Systemkategorien überschneidet.
Wie teste ich Fugu selbst gegen Fable 5?
Richten Sie einen OpenAI-kompatiblen Client auf Ihre Sakana-Konsolen-Basis-URL, stellen Sie das Modell auf fugu-ultra ein und führen Sie dieselben Prompts aus, die Sie gegen Fable 5 oder Opus 4.8 verwenden. In Apidog können Sie jedes Modell als Anfrage speichern, sie nebeneinander ausführen und den für Sie wichtigen Output überprüfen. Das macht Sakanas Gleichwertigkeitsbehauptung zu etwas, das Sie messen, anstatt ihr zu vertrauen.
Wie viel kostet Fugu im Vergleich zu Fable 5?
Die Preisstruktur ist bestätigt (Abonnementstufen plus Pay-as-you-go), aber jede Fugu-Dollarzahl wird aus sekundären Quellen gemeldet und ist Stand 22.06.2026 unbestätigt, überprüfen Sie dies also in Ihrer Konsole, bevor Sie budgetieren. Als Referenz listet Anthropic Fable 5 mit 10 $ pro Million Input-Token und 50 $ pro Million Output. Unser Artikel Sakana Fugu Benchmarks verfolgt die Preisgestaltung, sobald sie bestätigt wird.
