Les benchmarks Fugu de Sakana sont des affirmations de parité rapportées par le fournisseur, et non des tableaux de bord vérifiés indépendamment. Selon la page de publication de Sakana, Fugu Ultra « est au coude à coude avec des modèles de pointe comme Fable 5 et Mythos Preview » pour les tâches d'ingénierie, scientifiques et de raisonnement, et Fugu « surpasse constamment » Gemini 3.1 Pro, Opus 4.8 et GPT 5.5 sur un ensemble d'applications nommé. Le piège à comprendre avant de lire n'importe quel chiffre : Fugu est un orchestrateur qui appelle les modèles de pointe d'autres fournisseurs, de sorte que ses résultats ne sont pas des victoires d'un modèle unique comme ceux de Fable 5.
Ce qu'est réellement Fugu, et pourquoi cela change la façon dont vous lisez les benchmarks
Fugu n'est pas un modèle de fondation unique. C'est un système d'orchestration multi-agents présenté comme un modèle unique derrière une API compatible OpenAI. Sakana le décrit comme un modèle de langage entraîné, spécialisé dans la délégation, la communication d'agents et la synthèse de travail. Il coordonne dynamiquement plusieurs LLM, y compris des instances récursives de lui-même, et décide de répondre directement ou d'assembler une équipe. Le titre de la publication est « Un seul modèle pour les commander tous ».
Ce détail de conception est essentiel pour les benchmarks. Lorsqu'un modèle normal publie un score, le chiffre reflète le travail effectué par ses propres pondérations. Lorsque Fugu publie un score, le chiffre peut refléter que Fugu appelle Opus 4.8, ou GPT 5.5, ou Gemini 3.1 Pro, puis synthétise leurs sorties. Ainsi, un résultat « bat Opus 4.8 » peut provenir d'un système qui appelle Opus et le combine avec d'autres modèles. C'est un résultat de modèle-de-modèles, et non un résultat de modèle unique. Si vous souhaitez un contexte architectural plus approfondi, notre explication de ce qu'est Sakana Fugu détaille la boucle d'orchestration.
La revendication de parité : « au coude à coude avec Fable 5 et Mythos Preview »
Voici la première affirmation, énoncée avec précaution.
Selon Sakana, Fugu Ultra « est au coude à coude avec des modèles de pointe comme Fable 5 et Mythos Preview » sur les benchmarks d'ingénierie, scientifiques et de raisonnement. Lisez le verbe. Il s'agit d'une revendication de parité, et non d'une revendication de « supériorité ». Sakana positionne Fugu Ultra comme un pair de pointe, et non comme un leader de pointe.
Deux choses méritent d'être signalées.
Premièrement, le rival nommé est « Mythos Preview », le modèle de pointe d'avril qu'Anthropic a décrit comme trop dangereux pour être publié. Il ne s'agit pas du Mythos 5 actuellement disponible au grand public. Si vous avez lu à propos du modèle de classe Mythos, vous savez que Preview et la version commercialisée sont des artefacts différents. Faire reposer une revendication de parité sur Preview plutôt que sur le modèle actuel est un choix, et cela influe sur l'impression que la revendication donne.
Deuxièmement, aucune table de benchmark ne confirme cela sous une forme que quiconque en dehors de Sakana pourrait reproduire. La revendication est qualitative sur la page de publication. Il n'y a pas de méthodologie publiée, pas de grille de scores par tâche, et pas de reproduction par des tiers. Considérez « au coude à coude » comme la présentation par un fournisseur de ses propres résultats internes.
L'affirmation plus forte : « surpasse constamment » sur des applications nommées
Sakana fait une deuxième affirmation, plus audacieuse, et il est utile de la distinguer de la première.
Selon Sakana, Fugu « surpasse constamment » trois concurrents configurés sur une liste spécifique d'applications :
- Gemini 3.1 Pro (élevé)
- Opus 4.8 (max)
- GPT 5.5 (très élevé)
Les applications nommées sont AutoResearch, Rubik’s Cube, Conception Mécanique, Analyse d'Écriture Manuscrite Japonaise, Échecs en un coup et Prédiction de Séries Temporelles Financières.
Il s'agit de performances au niveau des applications, et non d'une suite de benchmarks académiques standard. Ce sont des tâches de bout en bout où un système d'orchestration a l'opportunité de briller, car il peut acheminer les sous-problèmes vers le modèle sous-jacent qui les gère le mieux, puis assembler les résultats. C'est précisément là qu'un chef d'orchestre devrait surpasser n'importe quel joueur individuel.
Mais soyons de nouveau honnêtes. Plusieurs de ces concurrents sont des modèles que Fugu peut appeler. Un résultat « bat Opus 4.8 (max) » sur AutoResearch peut provenir de Fugu appelant Opus, appelant d'autres modèles, et synthétisant une réponse combinée plus forte. C'est une capacité réelle, et elle peut véritablement vous aider. Ce n'est pas la preuve qu'un modèle Sakana unique surpasse Opus en matière de raisonnement. Ne lisez jamais ces chiffres comme une victoire d'un modèle unique, et ne le formulez jamais comme « Fugu bat Fable 5 », car Sakana ne l'a même pas revendiqué. La revendication de parité et la revendication de supériorité ciblent des rivaux différents.
Pourquoi ces chiffres ne peuvent pas encore être vérifiés indépendamment
Pas de reproduction indépendante pour l'instant. Chaque chiffre de benchmark Fugu sur cette page est rapporté par le fournisseur, mesuré sur la propre configuration de Sakana, avec des configurations concurrentes choisies par Sakana (les paramètres d'effort « high », « max » et « xhigh »). Au 22/06/2026, aucune tierce partie n'a reproduit ces tâches, aucune grille de scores par tâche n'a été publiée, et aucun banc d'évaluation n'a été publié. La bonne approche est de considérer tout cela comme une affirmation, et non comme une mesure.
Ce n'est pas une critique spécifique envers Sakana. C'est l'état par défaut pour tout modèle le jour de son lancement. La différence avec Fugu est que la conception de l'orchestration rend la reproduction indépendante plus difficile, et non plus facile.
Pour reproduire le benchmark d'un modèle unique, vous avez besoin du modèle et du test. Pour reproduire celui de Fugu, vous avez besoin de Fugu plus l'accès à chaque modèle sous-jacent vers lequel il achemine, aux mêmes versions et paramètres d'effort, plus la même topologie d'orchestration que Sakana a exécutée. Le système « contourne dynamiquement » les restrictions des fournisseurs et adapte sa topologie d'agents par tâche, de sorte que deux exécutions de la même invite peuvent ne pas utiliser la même équipe interne. Cette adaptativité est une fonctionnalité pour les utilisateurs et un casse-tête pour la reproductibilité.
Vous ne trouverez donc pas ici de tableaux comparatifs directs clairs, et vous devriez être sceptiques face à tout chiffre « Fugu a obtenu X » circulant de sources secondaires. Plusieurs de ces articles secondaires mentionnent les mauvaises versions des rivaux (Mythos actuel au lieu de Mythos Preview, par exemple). Un état sans chiffres est le résultat honnête à l'heure actuelle. Notre comparaison Fugu Ultra vs Fable 5 vs Mythos reste qualitative pour la même raison.
Les publications de recherche derrière les affirmations
Le marketing de Sakana repose sur des recherches réelles et citables. Deux articles de l'ICLR 2026 décrivent la lignée. Aucun n'est présenté comme un benchmark de produit, alors lisez-les comme des publications de recherche, et non comme des fiches techniques de Fugu.
Le premier est Trinity, « Un coordinateur LLM évolué » (arXiv:2512.04695). Trinity est un coordinateur de moins de 20 000 paramètres optimisé par évolution sans dérivée, avec des rôles de Penseur, Travailleur et Vérificateur. Il est minuscule et évolué, non entraîné par descente de gradient.
Le second est Conductor, « Apprendre à orchestrer des agents en langage naturel » (arXiv:2512.04388). Conductor est un modèle de 7 milliards de paramètres entraîné par apprentissage par renforcement qui apprend la structure de communication entre les agents. L'article affirme qu'il surpasse Mixture-of-Agents à moindre coût.
Ce sont des méthodes différentes et des tailles différentes. Trinity utilise l'évolution pour moins de 20 000 paramètres. Conductor utilise l'apprentissage par renforcement (RL) pour 7 milliards de paramètres. Ne les confondez pas. Et ne supposez pas que les spécifications exactes de l'un ou l'autre article décrivent le produit commercialisé. Faire correspondre le chiffre de 7 milliards, ou tout modèle de base spécifique, au Fugu publié est une inférence de tiers. La publication officielle ne fournit aucun nombre de paramètres du produit.
Une note technique à garder à l'esprit concernant les affirmations
Voici ce qui est raisonnablement établi par rapport à ce qui est encore non confirmé. Considérez la ligne d'architecture comme non vérifiée.
| Élément | Ce que Sakana / les sources disent | Confiance |
|---|---|---|
| Type de système | Orchestrateur multi-agents derrière un modèle unique | Indiqué sur la page de publication |
| Variantes | Fugu (équilibré, faible latence) et Fugu Ultra (qualité maximale) | Indiqué sur la page de publication |
| Ancien nom de la version bêta | La petite variante était appelée « Fugu Mini » en version bêta et dans la presse | Historique |
| Surface de l'API | Un point de terminaison compatible OpenAI, les deux variantes | Indiqué sur la page de publication |
| Modèles sous-jacents | Appelle plusieurs LLM de pointe, y compris lui-même de manière récursive | Indiqué sur la page de publication |
| Nombre de paramètres du produit | Non publié ; les spécificités 7B / Conductor sont des inférences de tiers | [À VÉRIFIER] |
| Méthodologie des benchmarks | Rapporté par le fournisseur, configuration propre à Sakana, aucun banc d'essai publié | [À VÉRIFIER] |
Il est bon de répéter une fois la note de nommage : la petite variante était appelée « Fugu Mini » pendant la version bêta d'environ 500 utilisateurs qui a été lancée vers le 24-25 avril 2026. La page de publication utilise « Fugu » et « Fugu Ultra ». Utilisez les noms actuels.
Ce que cela signifie pour vos propres tests
Vous ne pouvez pas vérifier les benchmarks de Sakana. Vous pouvez exécuter les vôtres.
Parce que Fugu utilise le protocole OpenAI chat-completions, vous pouvez pointer un client OpenAI existant vers l'URL de base de Fugu et envoyer vos tâches réelles. Aucune migration de SDK. L'URL de base n'est publiée sur aucune page publique au 22/06/2026, copiez-la donc depuis votre console sur console.sakana.ai et ne faites jamais confiance à un hôte inventé. Le modèle ci-dessous reproduit la requête de complétion de chat OpenAI standard :
from openai import OpenAI
# Copiez l'URL de base réelle depuis console.sakana.ai après vous être connecté.
client = OpenAI(
api_key="YOUR_FUGU_API_KEY",
base_url="<YOUR_FUGU_BASE_URL_FROM_CONSOLE>",
)
resp = client.chat.completions.create(
model="fugu-ultra", # 'fugu' pour la variante équilibrée ; identifiants rapportés, vérifiez dans la console
messages=[
{"role": "system", "content": "Vous êtes un réviseur de code précis."},
{"role": "user", "content": "Examinez cette fonction pour des problèmes de sécurité :\n<collez le code>"},
],
)
print(resp.choices[0].message.content)
Les chaînes d'identifiants de modèle rapportées jusqu'à présent sont fugu et fugu-ultra, éventuellement avec une forme datée. Confirmez les identifiants exacts dans la console plutôt que d'en intégrer un dans votre configuration. Parce que Fugu décide par requête s'il doit répondre directement ou assembler une équipe, la même invite peut produire une latence et un coût différents lors de différentes exécutions. Enregistrez les deux.
C'est là que l'exécution de votre propre évaluation est plus importante que d'habitude. Envoyez les tâches qui vous intéressent réellement, et non AutoResearch ou les échecs en un coup, et mesurez la latence, le coût et la qualité de la sortie par rapport aux modèles uniques que vous utilisez déjà. Les benchmarks des fournisseurs vous disent ce que Sakana a mesuré. Vos propres exécutions vous diront ce que vous obtiendrez.
Comment cela s'intègre à votre flux de travail Apidog
Vous n'avez pas besoin d'un nouvel outil pour tester les affirmations de benchmark d'un fournisseur. Vous avez besoin d'un moyen d'envoyer la même invite à plusieurs points de terminaison et de comparer les réponses côte à côte.

Apidog vous permet d'enregistrer le point de terminaison Fugu en tant qu'API compatible OpenAI, d'enregistrer vos véritables invites d'évaluation en tant que requêtes et de les exécuter comme un scénario de test. Placez Fugu, Fable 5 et un point de terminaison Opus dans le même environnement, envoyez des entrées identiques et capturez les sorties, les codes d'état, la latence et l'utilisation des jetons en un seul endroit. C'est une comparaison bien plus utile qu'une affirmation de parité sans méthodologie. Lorsque vous souhaitez suivre la dérive des coûts due au routage adaptatif de Fugu, les assertions sur le temps de réponse et le nombre de jetons la mettent en évidence exécution après exécution. Téléchargez Apidog et construisez la comparaison une fois, puis réexécutez-la chaque fois qu'une nouvelle version du modèle est publiée.
Foire aux questions
Fugu bat-il Fable 5 sur les benchmarks ?
Non, et Sakana ne l'a jamais affirmé. L'affirmation est de parité : Fugu Ultra « est au coude à coude avec » Fable 5 et Mythos Preview, selon Sakana. L'affirmation distincte de « surpasse » cible Gemini 3.1 Pro, Opus 4.8 et GPT 5.5 sur des applications spécifiques, et non Fable 5. Pour le côté modèle unique de cette comparaison, consultez les benchmarks de Claude Fable 5.
Les chiffres des benchmarks Fugu sont-ils vérifiés indépendamment ?
Non. Au 22/06/2026, chaque chiffre est rapporté par le fournisseur sur la propre configuration de Sakana, avec les paramètres d'effort concurrents choisis par Sakana. Aucune tierce partie n'a reproduit les tâches, et aucun banc d'évaluation n'a été publié. Traitez ces affirmations comme des affirmations jusqu'à ce que quelqu'un en dehors de Sakana les reproduise.
Pourquoi est-ce important que Fugu soit un orchestrateur ?
Parce que Fugu appelle les modèles de pointe d'autres fournisseurs, y compris lui-même de manière récursive, un résultat « bat Opus 4.8 » peut provenir de Fugu appelant Opus et synthétisant. C'est une victoire de modèle-de-modèles, et non une victoire de modèle unique. Fable 5 et la gamme Mythos sont des modèles Anthropic uniques, ce qui rend une comparaison directe non pertinente.
À quel Mythos Sakana s'est-il comparé ?
L'ancien Mythos Preview d'avril, le modèle de pointe qu'Anthropic a décrit comme trop dangereux pour être publié, et non le Mythos 5 actuel. Certains articles secondaires mentionnent la mauvaise version. L'explication du modèle de classe Mythos couvre la différence entre Preview et la version commercialisée.
Quelle est la différence entre Trinity et Conductor ?
Ce sont deux articles distincts de l'ICLR 2026. Trinity (arXiv:2512.04695) est un coordinateur de moins de 20 000 paramètres optimisé par évolution. Conductor (arXiv:2512.04388) est un modèle de 7 milliards de paramètres entraîné par apprentissage par renforcement. Méthodes différentes, tailles différentes. Aucun n'est présenté comme la fiche technique du produit commercialisé.
Comment puis-je tester les performances de Fugu moi-même ?
Pointez un client compatible OpenAI vers l'URL de base de Fugu depuis console.sakana.ai, envoyez vos propres tâches et mesurez la qualité, la latence et le coût. Enregistrez le point de terminaison dans Apidog pour comparer Fugu aux modèles uniques que vous utilisez déjà, avec des invites identiques et des métriques capturées.
