Um die Sakana Fugu API in Apidog zu testen, erstellen Sie eine neue HTTP-Anfrage, die auf Fugu’s OpenAI-kompatiblen Pfad /chat/completions zeigt, fügen Sie einen Authorization: Bearer Header mit Ihrem Schlüssel hinzu und senden Sie eine Nutzlast, die entweder das Modell fugu oder fugu-ultra benennt. Da Fugu einen OpenAI-kompatiblen Endpunkt bereitstellt, funktioniert jedes Tool, das das OpenAI-Chat-Format spricht, ohne SDK-Austausch, und Apidog bietet Ihnen Streaming-Inspektion, gespeicherte Anfragvarianten und Response-Diffing in einem Fenster. Dieser Leitfaden führt den vollständigen Ablauf durch: Erstellen der Anfrage, Beobachten der SSE-Deltas, Lesen des usage-Objekts und Vergleichen der Latenz zwischen der ausgewogenen Stufe und der langsameren Ultra-Stufe, damit Sie die Kosten des Orchestrierungssprungs in realen Antworten sehen können.
Wenn Sie den Code-First-Integrationspfad anstelle des Test-und-Beobachtungs-Pfads wünschen, behandelt der begleitende Leitfaden zur Verwendung der Sakana Fugu API die SDK-Verdrahtung. Dieser Artikel bleibt innerhalb von Apidog.
Was Sie tatsächlich mit Fugu testen
Fugu ist kein einfaches Chat-Modell. Laut Sakana ist es ein Multi-Agenten-Orchestrierungssystem, das als einzelnes Basismodell hinter einer API präsentiert wird. Ein trainiertes Sprachmodell spezialisiert sich auf Delegation, Agentenkommunikation und Arbeitssynthese und koordiniert dann dynamisch mehrere LLMs, einschließlich rekursiver Instanzen seiner selbst. Die Schlagzeile der Veröffentlichung lautet „Ein Modell, um sie alle zu befehligen.“ Für die Hintergrundgeschichte der Orchestrierung siehe den Erklärer, was Sakana Fugu ist.

Dieses Design ist wichtig für Tests. Wenn Sie eine Anfrage senden, entscheidet Fugu, ob es direkt antworten oder ein Team hinter den Kulissen zusammenstellen soll. Sie sehen eine Antwort, aber die zugrunde liegende Arbeit kann mehrere Modelle durchlaufen haben. Daher unterscheiden sich die in Apidog zu messenden Dinge von einem normalen Modelltest: Sie beobachten die Latenz als Indikator dafür, ob Fugu einen einzelnen Durchlauf oder einen Orchestrierungssprung ausgeführt hat, und Sie lesen das usage-Objekt, um die Token-Kosten des übergeordneten Aufrufs zu sehen.
Zwei Varianten teilen sich diesen einzelnen Endpunkt:
- Fugu (die ausgewogene Variante mit geringer Latenz) zielt auf alltägliche Aufgaben ab: Codierung, Code-Review, Chatbots und interaktive Dienste.
- Fugu Ultra zielt auf maximale Antwortqualität ab: KI-Forschung, Reproduktion von Veröffentlichungen, Cybersicherheitsanalyse sowie Literatur- oder Patentforschung.
Die Beta und ein Großteil der frühen Presse nannten die kleine Variante „Fugu Mini“. Die Release-Seite führt mit „Fugu“ und „Fugu Ultra“, also verwenden Sie diese Namen; „Mini“ ist die alte Beta-Bezeichnung.
Basis-URL und Schlüssel vor Beginn abrufen
Fugu befindet sich hinter einer Login-Schranke. Sie melden sich unter console.sakana.ai mit Google oder E-Mail an, und die Konsole ist der Ort, an dem Sie Ihren API-Schlüssel und die Basis-URL kopieren.
Ein wichtiger Hinweis für den 22.06.2026: Die Basis-URL ist auf keiner öffentlichen Sakana-Seite veröffentlicht. Raten Sie sie nicht. Kopieren Sie den tatsächlichen Host aus der Konsole und speichern Sie ihn als Variable. Überall in diesem Leitfaden, wo Sie <YOUR_FUGU_BASE_URL_FROM_CONSOLE> sehen, ersetzen Sie es durch den Wert, den Ihnen die Konsole anzeigt. Der Zugang hat sich auch von einer Betaversion mit etwa 500 Nutzern hin zur allgemeinen Verfügbarkeit entwickelt; ob die Selbstregistrierung vollständig offen ist und ob es eine EU/EWR-Beschränkung gibt, sollte beides live in der Konsole überprüft werden.
Die Fugu-Anfrage in Apidog einrichten
Laden Sie Apidog herunter, falls Sie es noch nicht haben, und erstellen Sie dann ein neues Projekt und eine neue HTTP-Anfrage.
Umgebungsvariablen für Schlüssel und Host verwenden
Fügen Sie keine Geheimnisse in die URL-Leiste ein. Apidog-Umgebungen ermöglichen es Ihnen, die Basis-URL und den Schlüssel einmal zu speichern und in jeder Anfrage darauf zu verweisen. Erstellen Sie eine Umgebung (nennen Sie sie Fugu Prod) und fügen Sie zwei Variablen hinzu:
fugu_base_urlauf Ihren<YOUR_FUGU_BASE_URL_FROM_CONSOLE>-Wert setzen.fugu_keyauf Ihren Konsolen-API-Schlüssel setzen.
Nun wird Ihre Anfrage-URL zu {{fugu_base_url}}/chat/completions und Ihr Header-Wert zu Bearer {{fugu_key}}. Der Wechsel zwischen einem Staging-Schlüssel und einem Produktionsschlüssel ist eine Dropdown-Änderung, kein Suchen und Ersetzen über Anfragen hinweg. Wenn Sie zuvor andere OpenAI-kompatible Anbieter über ein Gateway verdrahtet haben, spiegelt dies das Muster im Claude Code mit OpenRouter Walkthrough wider, wo eine Basis-URL und ein Bearer-Token einen OpenAI-Client auf ein neues Backend umleiten.
Den Anfragetext erstellen
Stellen Sie die Methode auf POST, die URL auf {{fugu_base_url}}/chat/completions ein und fügen Sie diese Header hinzu:
Authorization: Bearer {{fugu_key}}
Content-Type: application/json
Dann fügen Sie eine Standard-OpenAI-Chat-Nutzlast in den JSON-Body ein:
{
"model": "fugu",
"messages": [
{ "role": "system", "content": "You are a concise API testing assistant." },
{ "role": "user", "content": "Summarize what an SSE delta is in two sentences." }
],
"stream": false
}
Die Form entspricht exakt der OpenAI-Chat-Completions-Referenz, was der Sinn eines OpenAI-kompatiblen Endpunkts ist. Die bei der Einführung gemeldeten Modell-ID-Strings sind fugu und fugu-ultra (und möglicherweise eine datierte Form wie fugu-ultra-20260615). Bestätigen Sie die genaue ID in der Konsole, anstatt eine datierte Zeichenfolge fest zu codieren, da datierte IDs rotieren.
Senden Sie es. Sie sollten ein normales Chat-Completion-Objekt zurückerhalten, mit einem choices-Array und einem usage-Block. Speichern Sie diese Anfrage in Apidog als „Fugu ausgewogen“.
An die Ultra-Variante senden und beide speichern
Duplizieren Sie die gespeicherte Anfrage, ändern Sie ein Feld, und Sie haben Ihren zweiten Testfall:
{
"model": "fugu-ultra",
"messages": [
{ "role": "user", "content": "Reproduce the core result of the Trinity coordinator paper in plain language and note one limitation." }
],
"stream": false
}
Speichern Sie dies als „Fugu Ultra“. Jetzt haben Sie zwei gespeicherte Anfragen, die denselben Endpunkt treffen, nur durch das Feld model getrennt. Dies ist die Einrichtung, die den Rest des Tests sinnvoll macht. Sie senden denselben Prompt an beide, vergleichen dann die Antworten und die Zeitmessung. Apidog speichert einen Antwortverlauf pro Anfrage, sodass Sie jede erneut ausführen und beobachten können, wie sich die Antworten und die Latenz verändern. Für ein breiteres Muster zum Verketten und Vergleichen von API-Aufrufen behandelt der API-Test-Orchestrierungsleitfaden, wie man mehrere Anfragen sequenziert und bestätigt.
SSE-Streaming-Deltas inspizieren
Streaming ist der Bereich, in dem Fugu's Verhalten interessant wird, denn ein langer Orchestrierungssprung streamt immer noch Tokens, während sie finalisiert werden. Schalten Sie stream auf true:
{
"model": "fugu-ultra",
"messages": [
{ "role": "user", "content": "Walk through a one-shot chess opening analysis, step by step." }
],
"stream": true
}
Bei aktiviertem Streaming ist die Antwort text/event-stream und kommt als eine Reihe von data:-Chunks an. Apidog rendert den SSE-Stream live, sodass Sie sehen, wie Deltas eintreffen, anstatt auf einen Spinner zu starren. Jeder Chunk sieht so aus:
data: {"id":"chatcmpl-xxx","object":"chat.completion.chunk","choices":[{"index":0,"delta":{"content":"The"},"finish_reason":null}]}
data: {"id":"chatcmpl-xxx","object":"chat.completion.chunk","choices":[{"index":0,"delta":{"content":" Sicilian"},"finish_reason":null}]}
data: [DONE]
Das delta-Objekt enthält den inkrementellen Token-Inhalt. Der erste Chunk enthält normalerweise die role, dann enthalten nachfolgende Chunks content-Fragmente, und der Stream endet mit einem gesetzten finish_reason und einer abschließenden data: [DONE]-Zeile. Achten Sie auf die Lücke vor dem ersten Delta bei Ultra. Eine lange Pause, bevor Tokens beginnen, gefolgt von einem stetigen Stream, ist ein nützliches Signal dafür, dass Fugu ein Team zusammengestellt hat, bevor es geantwortet hat. Die ausgewogene Variante neigt dazu, früher mit dem Streaming zu beginnen, da sie häufiger direkt antwortet.
Das Nutzungs-Objekt lesen und Kosten vergleichen
Sobald ein nicht-streaming-Aufruf zurückkehrt, öffnen Sie den usage-Block in der Antwort:
{
"usage": {
"prompt_tokens": 38,
"completion_tokens": 412,
"total_tokens": 450
}
}
Die Token-Zählungen des übergeordneten Aufrufs sind das, was Apidog Ihnen direkt anzeigt. Beachten Sie einen wichtigen Punkt: Fugu ist ein Orchestrator, der die Spitzenmodelle anderer Anbieter aufruft, sich selbst rekursiv einschließend. Die von Ihnen gelesene usage ist die Abrechnung Ihrer Anfrage an Fugu, nicht ein Einblick in jedes nachgeschaltete Modell, das es möglicherweise aufgerufen hat. Die Preisstruktur, laut Sakana, besteht aus Abonnementstufen für den täglichen Gebrauch plus einem Pay-as-you-go-Plan für größere und Unternehmensarbeitslasten.
Als fundierter Vergleichspunkt liegen Anthropic's veröffentlichte Preise (09.06.2026) für Fable 5 und Mythos 5 bei 10 $ pro 1 Mio. Eingabe und 50 $ pro 1 Mio. Ausgabe. Der begleitende Claude Fable 5 API-Leitfaden behandelt diesen Endpunkt, wenn Sie eine Einzelmodell-Baseline wünschen, um sie neben Fugu im selben Apidog-Projekt zu testen.
Die Kosten des Orchestrierungssprungs in der Latenz messen
Dies ist der Test, der das Ausführen beider Varianten rechtfertigt. Senden Sie denselben Prompt an „Fugu ausgewogen“ und „Fugu Ultra“, und lesen Sie dann die von Apidog am Ende jedes Ergebnisses angezeigte Antwortzeit.
Sie werden normalerweise feststellen, dass die ausgewogene Variante schneller antwortet. Laut Sakana zielt das ausgewogene „Fugu“ auf geringe Latenz und interaktive Dienste ab, während Ultra auf maximale Qualität für Forschungsarbeiten abzielt. Das Latenzdelta ist Ihre sichtbare Ablesung des Orchestrierungssprungs: Wenn Ultra länger braucht, ist diese zusätzliche Zeit Fugu, das ein Team koordiniert, anstatt in einem Durchgang zu antworten. Apidog’s zeitliche Messung pro Anfrage und gespeicherter Verlauf ermöglichen es Ihnen, jede Variante mehrmals auszuführen und abzuschätzen, ob der Unterschied stabil oder prompt-abhängig ist.
Um den Unterschied zu betonen, wählen Sie eine Aufgabe aus Sakana’s eigener Anwendungsliste, bei der starke Ergebnisse beansprucht werden: AutoResearch, mechanisches Design, Finanzzeitreihenprognose oder One-Shot-Schach. Laut Sakana übertrifft Fugu Gemini 3.1 Pro, Opus 4.8 und GPT 5.5 bei diesen spezifischen Anwendungen durchweg. Lesen Sie diese Behauptung sorgfältig. Fugu kann diese Ergebnisse erreichen, indem es genau diese Modelle aufruft und deren Ausgabe synthetisiert, sodass ein „schlägt Opus 4.8“-Ergebnis ein Modell-von-Modellen-Ergebnis sein kann, kein Einzelmodell-Sieg. Sakana positioniert Fugu Ultra auch so, dass es bei technischen und logischen Benchmarks mit Fable 5 und der älteren Mythos Preview gleichauf liegt, was eine Gleichheitsbehauptung und keine „schlägt“-Behauptung ist. Testen Sie es selbst und beurteilen Sie es anhand Ihrer eigenen Prompts.
Agenten-Routing und -Governance, die Sie untersuchen können
Fugu’s Release-Seite beschreibt Mechanismen, die es wert sind, direkt getestet zu werden. Agenten im Pool sind austauschbar. Teams können bestimmte Agenten aus Daten- oder Compliance-Gründen abwählen. Fugu umgeht auch dynamisch Anbieterbeschränkungen. Wenn Ihre Konsole Agentenpool-Steuerungen freigibt, können Sie ändern, welche Modelle zulässig sind, und Ihre gespeicherten Apidog-Anfragen erneut ausführen, um zu beobachten, wie sich Routing und Antworten verschieben.
Die Forschungslinie ist real und zitierfähig. Zwei ICLR 2026-Papiere liegen diesem Ansatz zugrunde: Trinity, „An Evolved LLM Coordinator“, ein Koordinator mit weniger als 20.000 Parametern, optimiert durch ableitungsfreie Evolution mit den Rollen Thinker, Worker und Verifier, und Conductor, „Learning to Orchestrate Agents in Natural Language“, ein 7B-Modell, das mit Reinforcement Learning trainiert wurde, seine eigene Kommunikationsstruktur lernt und behauptet, Mixture-of-Agents zu geringeren Kosten zu schlagen. Sie verwenden unterschiedliche Methoden und Größen, verwechseln Sie sie also nicht, und beachten Sie, dass die Zuordnung einer bestimmten Parameteranzahl zum ausgelieferten Produkt eine Schlussfolgerung Dritter und keine offizielle Angabe ist.
Wie dies in Ihren Apidog-Workflow passt
Der Sinn des Testens von Fugu in Apidog anstatt eines einmaligen Curl-Befehls ist die Wiederholbarkeit. Sie speichern beide Variantenanfragen, bewahren Ihren Schlüssel und Host in einer Umgebung auf, spielen sie gegen neue Prompts ab, vergleichen die Antworten nebeneinander und lesen Latenz und usage, ohne das Tool zu verlassen. Wenn Fugu eine Modell-ID rotiert oder Sie von einem Staging-Schlüssel zu einem Produktionsschlüssel wechseln, ändern Sie eine Umgebungsvariable, und jede gespeicherte Anfrage folgt. Das ist die Test-und-Beobachtungs-Schleife: einmal erstellen, dann beobachten, wie sich ein Orchestrierungssystem verhält, wenn Sie verschiedene Prompts durch es schieben.

Sakana leitet seinen Namen vom japanischen Wort für Fisch ab, und das "Fischschwarm"-Branding passt zu einem Orchestrator, der viele Modelle zu einer Antwort koordiniert. Fugu, der Kugelfisch, ist eine Delikatesse, die nur dann sicher ist, wenn ein erfahrener Koch sie zubereitet. Die Metapher der sorgfältigen Zubereitung ist eine gute Möglichkeit, über die Verteilung von Arbeit auf Agenten nachzudenken, solange man sich daran erinnert, dass es sich um eine Metapher und nicht um einen Benchmark handelt.
Richten Sie Ihre OpenAI-kompatiblen Anfragen auf Fugu, speichern Sie Ihre Varianten und lassen Sie sich von Apidog zeigen, was der Orchestrator unter Last leistet. Laden Sie Apidog herunter, um Ihre erste Fugu-Umgebung einzurichten, und beginnen Sie, indem Sie denselben Prompt an beide Varianten senden, um den Orchestrierungssprung selbst zu sehen.
Häufig gestellte Fragen
Welche Basis-URL verwende ich, um Fugu in Apidog zu testen?
Kopieren Sie die Basis-URL von console.sakana.ai, nachdem Sie sich angemeldet haben. Sakana hat den Host ab dem 22.06.2026 auf keiner öffentlichen Seite veröffentlicht, also raten Sie ihn nicht. Speichern Sie ihn als Apidog-Umgebungsvariable und referenzieren Sie ihn als {{fugu_base_url}}/chat/completions.
Benötige ich ein spezielles SDK, um Fugu aufzurufen?
Nein. Fugu bietet einen OpenAI-kompatiblen Endpunkt, sodass jeder OpenAI-Client oder jedes Tool, das das OpenAI-Chat-Format spricht, nur mit einer Basis-URL- und Schlüsseländerung funktioniert. Das gleiche Umleitungsmuster erscheint im Claude Code mit OpenRouter Leitfaden.
Wie teste ich Streaming-Antworten von Fugu?
Setzen Sie "stream": true im Anfragetext. Die Antwort kommt als text/event-stream mit data:-Chunks an, die inkrementellen delta-Inhalt tragen und mit data: [DONE] enden. Apidog rendert den SSE-Stream live, sodass Sie beobachten können, wie Deltas in Echtzeit eintreffen.
Was ist der Unterschied zwischen Fugu und Fugu Ultra?
Fugu ist die ausgewogene, latenzarme Variante für das tägliche Codieren, Überprüfen und Chatbots. Fugu Ultra zielt auf maximale Antwortqualität für Forschung, die Reproduktion von Veröffentlichungen und Sicherheitsanalysen ab. Beide laufen über denselben Endpunkt, nur durch das Feld model getrennt, was sie in Apidog einfach zu speichern und zu vergleichen macht.
Warum ist Fugu Ultra langsamer als die ausgewogene Variante?
Die zusätzliche Latenz ist der Orchestrierungssprung. Laut Sakana kann Fugu direkt antworten oder ein Team von Modellen zusammenstellen, und Ultra neigt zu tieferer Koordination für Qualität. Die langsamere Antwortzeit, die Sie in Apidog ablesen, ist Ihr sichtbares Signal, dass Fugu mehrere Modelle koordiniert hat, anstatt in einem Durchgang zu antworten.
Sind Fugu’s Benchmark-Gewinne Einzelmodell-Ergebnisse?
Nein. Fugu ist ein Orchestrator, der die Spitzenmodelle anderer Anbieter aufruft, sich selbst rekursiv einschließend. Ein Ergebnis, das laut Sakana „Opus 4.8 schlägt“, kann also durch den Aufruf von Opus und die Synthese seiner Ausgabe entstehen. Behandeln Sie Fugu’s Zahlen als Modell-von-Modellen-Ergebnisse, nicht als Einzelmodell-Gewinne, und überprüfen Sie sie anhand Ihrer eigenen Prompts.
