Sakana Fugu Benchmarks: O Que Lado a Lado Com Fable 5 Realmente Significa

Os benchmarks Fugu da Sakana são alegações de paridade relatadas pelos fornecedores, e não pontuações verificadas. Veja o que cada alegação afirma, quem a fez e por que não é comprovada.

INEZA Felin-Michel

INEZA Felin-Michel

22 junho 2026

Sakana Fugu Benchmarks: O Que Lado a Lado Com Fable 5 Realmente Significa

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Os benchmarks Fugu da Sakana são alegações de paridade reportadas pelo fornecedor, não scorecards verificados independentemente. De acordo com a página de lançamento da Sakana, o Fugu Ultra “se iguala a modelos líderes como Fable 5 e Mythos Preview” em tarefas de engenharia, científicas e de raciocínio, e o Fugu “supera consistentemente” Gemini 3.1 Pro, Opus 4.8 e GPT 5.5 em um conjunto nomeado de aplicações. O ponto a ser entendido antes de ler qualquer número: Fugu é um orquestrador que chama modelos de fronteira de outros fornecedores, então seus resultados não são vitórias de modelo único da mesma forma que os do Fable 5 são.

botão

O que Fugu realmente é, e por que isso muda como você lê os benchmarks

Fugu não é um único modelo de fundação. É um sistema de orquestração multi-agente apresentado como um único modelo por trás de uma API compatível com OpenAI. A Sakana o descreve como um modelo de linguagem treinado especializado em delegação, comunicação entre agentes e síntese de trabalho. Ele coordena dinamicamente vários LLMs, incluindo instâncias recursivas de si mesmo, e decide se responde diretamente ou se reúne uma equipe. O título do lançamento é “Um Modelo Para Comandar Todos Eles.”

Esse detalhe de design é toda a história para os benchmarks. Quando um modelo normal publica uma pontuação, o número reflete os próprios pesos desse modelo realizando o trabalho. Quando Fugu publica uma pontuação, o número pode refletir Fugu chamando Opus 4.8, ou GPT 5.5, ou Gemini 3.1 Pro, e então sintetizando suas saídas. Assim, um resultado de “supera Opus 4.8” pode vir de um sistema que chama Opus e o combina com outros modelos. Isso é um resultado de modelo-de-modelos, não um resultado de modelo único. Se você quiser o contexto de arquitetura mais profundo, nosso explicador sobre o que é Sakana Fugu detalha o loop de orquestração.

A alegação de paridade: “ombro a ombro com Fable 5 e Mythos Preview”

Aqui está a primeira alegação, declarada cuidadosamente.

De acordo com a Sakana, o Fugu Ultra “se iguala a modelos líderes como Fable 5 e Mythos Preview” em benchmarks de engenharia, científicos e de raciocínio. Leia o verbo. Esta é uma alegação de paridade, não uma alegação de “supera”. A Sakana está posicionando o Fugu Ultra como um par de fronteira, não um líder de fronteira.

Duas coisas merecem destaque.

Primeiro, o rival nomeado é “Mythos Preview”, o modelo de fronteira de abril que a Anthropic descreveu como perigoso demais para ser lançado. Não é o Mythos 5 atualmente disponível. Se você leu sobre o modelo de classe Mythos, sabe que o Preview e a linha lançada são artefatos diferentes. Anexar uma alegação de paridade ao Preview em vez do modelo atual é uma escolha, e isso importa para quão impressionante a alegação parece.

Segundo, nenhuma tabela de benchmark comprova isso de uma forma que qualquer pessoa fora da Sakana possa reproduzir. A alegação é qualitativa na página de lançamento. Não há metodologia publicada, nenhuma grade de pontuação por tarefa e nenhuma reprodução por terceiros. Trate “ombro a ombro” como a forma como um fornecedor enquadra seus próprios resultados internos.

A alegação mais forte: “supera consistentemente” em aplicações nomeadas

A Sakana faz uma segunda alegação, mais ousada, e vale a pena separá-la da primeira.

De acordo com a Sakana, o Fugu “supera consistentemente” três concorrentes configurados em uma lista específica de aplicações:

As aplicações nomeadas são AutoResearch, Cubo Mágico, Projeto Mecânico, Análise de Caligrafia Japonesa, Xadrez de Uma Jogada e Previsão de Séries Temporais Financeiras.

Este é um desempenho em nível de aplicação, não uma suíte de benchmark acadêmico padrão. São tarefas de ponta a ponta onde um sistema de orquestração tem espaço para brilhar, pois pode rotear subproblemas para o modelo subjacente que melhor os lida e então juntar os resultados. É exatamente aí que um maestro deve superar qualquer músico individual.

Mas aplique novamente a coluna da honestidade. Vários desses concorrentes são modelos que Fugu pode chamar. Um resultado de “supera Opus 4.8 (máx.)” no AutoResearch pode ser Fugu chamando Opus, chamando outros modelos e sintetizando uma resposta combinada mais forte. Essa é uma capacidade real, e pode realmente ajudá-lo. Não é evidência de que um único modelo Sakana supera o Opus em raciocínio. Nunca leia esses números como uma vitória de modelo único, e nunca diga “Fugu supera Fable 5”, porque a Sakana nem sequer alegou isso. A alegação de paridade e a alegação de superação visam rivais diferentes.

Por que esses números não podem ser verificados independentemente ainda

Nenhuma replicação independente ainda. Cada número de benchmark do Fugu nesta página é relatado pelo fornecedor, medido na própria configuração da Sakana, com configurações de concorrentes que a Sakana escolheu (as configurações de esforço “alto,” “máx.,” e “altíssimo”). Até 22/06/2026, nenhum terceiro executou essas tarefas novamente, nenhuma grade de pontuação por tarefa foi publicada e nenhum sistema de avaliação foi lançado. A postura correta é tratar tudo isso como uma alegação, não uma medição.

Esta não é uma crítica específica à Sakana. É o estado padrão para qualquer modelo no dia do lançamento. A diferença com Fugu é que o design de orquestração torna a replicação independente mais difícil, não mais fácil.

Para reproduzir o benchmark de um único modelo, você precisa do modelo e do teste. Para reproduzir o do Fugu, você precisa do Fugu mais acesso a todos os modelos subjacentes para os quais ele roteia, nas mesmas versões e configurações de esforço, além da mesma topologia de orquestração que a Sakana executou. O sistema “roteia dinamicamente” as restrições do provedor e adapta sua topologia de agente por tarefa, então duas execuções do mesmo prompt podem nem usar a mesma equipe interna. Essa adaptabilidade é um recurso para os usuários e uma dor de cabeça para a reprodutibilidade.

Portanto, você não encontrará tabelas limpas de comparação direta aqui, e deve ser cético em relação a quaisquer números flutuantes de “Fugu obteve X” circulando de fontes secundárias. Vários desses artigos secundários nomeiam as versões erradas dos rivais (Mythos atual em vez de Mythos Preview, por exemplo). Um estado de número vazio é o resultado honesto agora. Nossa comparação Fugu Ultra vs Fable 5 vs Mythos permanece qualitativa pela mesma razão.

Os registros de pesquisa por trás das alegações

O marketing da Sakana baseia-se em pesquisas reais e citáveis. Dois artigos da ICLR 2026 descrevem a linhagem. Nenhum é afirmado como um benchmark de produto, então leia-os como registros de pesquisa, não como folhas de especificações do Fugu.

O primeiro é Trinity, “Um Coordenador LLM Evoluído” (arXiv:2512.04695). Trinity é um coordenador com menos de 20.000 parâmetros otimizado por evolução sem gradiente, com funções de Pensador, Trabalhador e Verificador. É minúsculo e evoluído, não treinado por descida de gradiente.

O segundo é Conductor, “Aprendendo a Orquestrar Agentes em Linguagem Natural” (arXiv:2512.04388). Conductor é um modelo 7B treinado com aprendizado por reforço que aprende a estrutura de comunicação entre agentes. O artigo afirma que ele supera Mixture-of-Agents a um custo menor.

Estes são métodos diferentes e tamanhos diferentes. Trinity usa evolução em menos de 20K parâmetros. Conductor usa RL em 7B parâmetros. Não os confunda. E não assuma que as especificações exatas de qualquer um dos artigos descrevem o produto lançado. Mapear o número de 7B, ou qualquer modelo base específico, para o Fugu lançado é inferência de terceiros. O lançamento oficial não fornece a contagem de parâmetros do produto.

Uma barra lateral de especificações para manter junto às alegações

Aqui está o que está razoavelmente estabelecido versus o que ainda não foi confirmado. Trate a linha de arquitetura como não verificada.

Item O que a Sakana / fontes dizem Confiança
Tipo de sistema Orquestrador multi-agente por trás de um modelo Declarado na página de lançamento
Variantes Fugu (balanceado, baixa latência) e Fugu Ultra (qualidade máxima) Declarado na página de lançamento
Antigo nome beta A variante pequena foi chamada de “Fugu Mini” no beta e na imprensa Histórico
Superfície da API Um endpoint compatível com OpenAI, ambas as variantes Declarado na página de lançamento
Modelos subjacentes Chama múltiplos LLMs de fronteira, incluindo recursivamente a si mesmo Declarado na página de lançamento
Contagem de parâmetros do produto Não publicado; detalhes de 7B / Conductor são inferência de terceiros [VERIFICAR]
Metodologia de benchmark Relatado pelo fornecedor, configuração própria da Sakana, nenhum sistema de avaliação lançado [VERIFICAR]

Vale a pena repetir a nota sobre a nomenclatura: a variante pequena foi chamada de “Fugu Mini” durante o beta de aproximadamente 500 usuários que foi lançado por volta de 24-25 de abril de 2026. A página de lançamento usa “Fugu” e “Fugu Ultra.” Use os nomes atuais.

O que isso significa para seus próprios testes

Você não pode verificar os benchmarks da Sakana. Você pode executar os seus próprios.

Como o Fugu fala o protocolo de chat-completions da OpenAI, você aponta um cliente OpenAI existente para a URL base do Fugu e envia suas tarefas reais. Sem migração de SDK. A URL base não está publicada em nenhuma página pública até 22/06/2026, então copie-a do seu console em console.sakana.ai e nunca confie em um host inventado. O padrão abaixo espelha a solicitação padrão de chat completions da OpenAI:

from openai import OpenAI

# Copie a URL base real de console.sakana.ai depois de fazer login.
client = OpenAI(
    api_key="SUA_CHAVE_API_FUGU",
    base_url="<SUA_URL_BASE_FUGU_DO_CONSOLE>",
)

resp = client.chat.completions.create(
    model="fugu-ultra",  # 'fugu' para a variante balanceada; IDs reportados, verifique no console
    messages=[
        {"role": "system", "content": "Você é um revisor de código preciso."},
        {"role": "user", "content": "Revise esta função em busca de problemas de segurança:\n<cole o código>"},
    ],
)

print(resp.choices[0].message.content)

As strings de ID de modelo relatadas até agora são fugu e fugu-ultra, possivelmente com um formato datado. Confirme os IDs exatos no console em vez de incorporar um em sua configuração. Como o Fugu decide por solicitação se responde diretamente ou reúne uma equipe, o mesmo prompt pode produzir latência e custo diferentes em execuções distintas. Registre ambos.

É aqui que executar sua própria avaliação importa mais do que o usual. Envie as tarefas que você realmente se importa, não AutoResearch ou xadrez de uma jogada, e meça latência, custo e qualidade de saída contra os modelos únicos que você já usa. Os benchmarks do fornecedor dizem o que a Sakana mediu. Suas próprias execuções dizem o que você obterá.

Como isso se encaixa no seu fluxo de trabalho Apidog

Você não precisa de uma nova ferramenta para testar as alegações de benchmark de um fornecedor. Você precisa de uma maneira de disparar o mesmo prompt em vários endpoints e comparar as respostas lado a lado.

O Apidog permite que você registre o endpoint do Fugu como uma API compatível com OpenAI, salve seus prompts de avaliação reais como requisições e os execute como um cenário de teste. Coloque Fugu, Fable 5 e um endpoint Opus no mesmo ambiente, envie entradas idênticas e capture as saídas, códigos de status, latência e uso de tokens em um só lugar. Essa é uma comparação muito mais útil do que uma alegação de paridade sem metodologia por trás dela. Quando você quiser rastrear o desvio de custo do roteamento adaptativo do Fugu, as asserções sobre o tempo de resposta e a contagem de tokens o evidenciam a cada execução. Baixe o Apidog e construa a comparação uma vez, então execute-a novamente sempre que uma nova versão do modelo for lançada.

botão

Perguntas Frequentes

O Fugu supera o Fable 5 nos benchmarks?

Não, e a Sakana nunca alegou isso. A alegação é de paridade: o Fugu Ultra “se iguala a” Fable 5 e Mythos Preview, de acordo com a Sakana. A alegação separada de “supera” visa Gemini 3.1 Pro, Opus 4.8 e GPT 5.5 em aplicações específicas, não Fable 5. Para o lado de modelo único dessa comparação, veja os benchmarks do Claude Fable 5.

Os números do benchmark do Fugu são verificados independentemente?

Não. Até 22/06/2026, cada número é relatado pelo fornecedor na própria configuração da Sakana, com as configurações de esforço de concorrentes que a Sakana escolheu. Nenhum terceiro executou as tarefas novamente, e nenhum sistema de avaliação foi publicado. Trate as alegações como alegações até que alguém de fora da Sakana as reproduza.

Por que é importante que o Fugu seja um orquestrador?

Porque o Fugu chama modelos de fronteira de outros fornecedores, incluindo recursivamente a si mesmo, um resultado de “supera Opus 4.8” pode vir do Fugu chamando Opus e sintetizando. Essa é uma vitória de modelo-de-modelos, não uma vitória de modelo único. Fable 5 e a linha Mythos são modelos Anthropic únicos, o que torna uma comparação direta um "apples-to-oranges" (comparação injusta).

Contra qual Mythos a Sakana comparou?

Contra o Mythos Preview mais antigo de abril, o modelo de fronteira que a Anthropic descreveu como perigoso demais para ser lançado, não o Mythos 5 atual. Alguns artigos secundários nomeiam a versão errada. O explicador da classe Mythos aborda a diferença entre o Preview e a linha lançada.

Qual a diferença entre Trinity e Conductor?

São dois artigos separados da ICLR 2026. Trinity (arXiv:2512.04695) é um coordenador com menos de 20.000 parâmetros otimizado por evolução. Conductor (arXiv:2512.04388) é um modelo 7B treinado com aprendizado por reforço. Métodos diferentes, tamanhos diferentes. Nenhum é afirmado como a folha de especificações do produto lançado.

Como posso testar o desempenho do Fugu por conta própria?

Aponte um cliente compatível com OpenAI para a URL base do Fugu de console.sakana.ai, envie suas próprias tarefas e meça qualidade, latência e custo. Registre o endpoint no Apidog para comparar o Fugu com os modelos únicos que você já usa, com prompts idênticos e métricas capturadas.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs