Sakana Fugu Benchmarks: Qué significa realmente Al nivel de Fable 5

Los benchmarks Fugu de Sakana son afirmaciones de paridad informadas por el proveedor, no puntuaciones verificadas. Vea lo que dice cada afirmación, quién la dijo y por qué no está probada.

INEZA Felin-Michel

INEZA Felin-Michel

22 June 2026

Sakana Fugu Benchmarks: Qué significa realmente Al nivel de Fable 5

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Los benchmarks Fugu de Sakana son afirmaciones de paridad reportadas por el proveedor, no fichas de resultados verificadas independientemente. Según la página de lanzamiento de Sakana, Fugu Ultra "está a la altura de modelos líderes como Fable 5 y Mythos Preview" en tareas de ingeniería, científicas y de razonamiento, y Fugu "supera consistentemente" a Gemini 3.1 Pro, Opus 4.8 y GPT 5.5 en un conjunto de aplicaciones específicas. La salvedad que vale la pena entender antes de leer cualquier número: Fugu es un orquestador que llama a modelos frontera de otros proveedores, por lo que sus resultados no son victorias de un solo modelo como lo son los de Fable 5.

button

Qué es realmente Fugu y por qué cambia cómo se leen los benchmarks

Fugu no es un modelo fundacional único. Es un sistema de orquestación multiagente presentado como un solo modelo detrás de una API compatible con OpenAI. Sakana lo describe como un modelo de lenguaje entrenado especializado en delegación, comunicación entre agentes y síntesis de trabajo. Coordina dinámicamente múltiples LLMs, incluyendo instancias recursivas de sí mismo, y decide si responder directamente o ensamblar un equipo. El titular del lanzamiento es "Un Modelo para Dominarlos a Todos".

Ese detalle de diseño es toda la historia para los benchmarks. Cuando un modelo normal publica una puntuación, el número refleja el trabajo de los propios pesos de ese modelo. Cuando Fugu publica una puntuación, el número puede reflejar que Fugu llama a Opus 4.8, o GPT 5.5, o Gemini 3.1 Pro, y luego sintetiza sus salidas. Así, un resultado de "supera a Opus 4.8" puede provenir de un sistema que llama a Opus y lo combina con otros modelos. Ese es un resultado de modelo de modelos, no un resultado de modelo único. Si desea un contexto arquitectónico más profundo, nuestro explicador sobre qué es Sakana Fugu detalla el bucle de orquestación.

La afirmación de paridad: "a la altura de Fable 5 y Mythos Preview"

Aquí está la primera afirmación, expresada con cuidado.

Según Sakana, Fugu Ultra "está a la altura de modelos líderes como Fable 5 y Mythos Preview" en benchmarks de ingeniería, científicos y de razonamiento. Lea el verbo. Esta es una afirmación de paridad, no una afirmación de "superación". Sakana está posicionando a Fugu Ultra como un par en la frontera, no como un líder en la frontera.

Dos cosas merecen una advertencia.

Primero, el rival nombrado es "Mythos Preview", el modelo frontera de abril que Anthropic describió como demasiado peligroso para lanzar. No es el Mythos 5 actual, disponible de forma general. Si ha leído sobre el modelo de clase Mythos, sabe que Preview y la línea lanzada son artefactos diferentes. Basar una afirmación de paridad en Preview en lugar del modelo actual es una elección, y es importante para cuán impresionante se lea la afirmación.

Segundo, ninguna tabla de benchmarks respalda esto de una forma que cualquiera fuera de Sakana pueda replicar. La afirmación es cualitativa en la página de lanzamiento. No hay una metodología publicada, ni una cuadrícula de puntuaciones por tarea, ni una reproducción por terceros. Trate "a la altura" como la descripción de un proveedor de sus propios resultados internos.

La afirmación más fuerte: "supera consistentemente" en aplicaciones específicas

Sakana hace una segunda afirmación, más audaz, y vale la pena separarla de la primera.

Según Sakana, Fugu "supera consistentemente" a tres competidores configurados en una lista específica de aplicaciones:

Las aplicaciones mencionadas son AutoResearch, Cubo de Rubik, Diseño Mecánico, Análisis de Escritura Japonesa, Ajedrez de un Tiro y Predicción de Series Temporales Financieras.

Este es un rendimiento a nivel de aplicación, no un conjunto de benchmarks académicos estándar. Son tareas de extremo a extremo donde un sistema de orquestación tiene espacio para brillar, porque puede enrutar subproblemas al modelo subyacente que mejor los maneje y luego unir los resultados. Ahí es exactamente donde un director debería superar a cualquier jugador individual.

Pero apliquemos de nuevo la honestidad. Varios de esos competidores son modelos a los que Fugu puede llamar. Un resultado de "supera a Opus 4.8 (máx)" en AutoResearch puede ser Fugu llamando a Opus, llamando a otros modelos y sintetizando una respuesta combinada más fuerte. Esa es una capacidad real, y puede ser de gran ayuda. No es evidencia de que un solo modelo de Sakana razone mejor que Opus. Nunca lea estos números como una victoria de un solo modelo, y nunca lo formule como "Fugu vence a Fable 5", porque Sakana ni siquiera afirmó eso. La afirmación de paridad y la afirmación de rendimiento superior apuntan a rivales diferentes.

Por qué estos números no pueden verificarse independientemente todavía

Sin replicación independiente aún. Cada cifra de benchmark de Fugu en esta página es reportada por el proveedor, medida en la configuración propia de Sakana, con configuraciones de esfuerzo de los competidores que Sakana eligió (los ajustes "alto", "máx" y "extra alto"). A fecha de 22-06-2026, ningún tercero ha vuelto a ejecutar estas tareas, no se ha publicado una cuadrícula de puntuaciones por tarea, y no se ha lanzado un arnés de evaluación. La postura correcta es tratar todo esto como una afirmación, no como una medición.

Esto no es una crítica específica a Sakana. Es el estado predeterminado para cualquier modelo el día de su lanzamiento. La diferencia con Fugu es que el diseño de orquestación hace que la replicación independiente sea más difícil, no más fácil.

Para reproducir el benchmark de un modelo único, se necesita el modelo y la prueba. Para reproducir el de Fugu, se necesita Fugu más acceso a cada modelo subyacente al que enruta, en las mismas versiones y configuraciones de esfuerzo, además de la misma topología de orquestación que Sakana utilizó. El sistema "enruta dinámicamente" alrededor de las restricciones del proveedor y adapta su topología de agente por tarea, por lo que dos ejecuciones del mismo prompt pueden ni siquiera usar el mismo equipo interno. Esa adaptabilidad es una característica para los usuarios y un dolor de cabeza para la reproducibilidad.

Así que no encontrará tablas limpias de comparación directa aquí, y debería ser escéptico ante cualquier número flotante "Fugu obtuvo X" que circule de fuentes secundarias. Varios de esos informes secundarios nombran versiones de rivales incorrectas (Mythos actual en lugar de Mythos Preview, por ejemplo). Un estado de "número vacío" es el resultado honesto en este momento. Nuestra comparación Fugu Ultra vs Fable 5 vs Mythos se mantiene cualitativa por la misma razón.

Los registros de investigación detrás de las afirmaciones

El marketing de Sakana se basa en investigación real y citable. Dos artículos de ICLR 2026 describen el linaje. Ninguno se presenta como un benchmark de producto, así que léalos como registros de investigación, no como hojas de especificaciones de Fugu.

El primero es Trinity, "An Evolved LLM Coordinator" (arXiv:2512.04695). Trinity es un coordinador de menos de 20.000 parámetros optimizado por evolución sin derivadas, con roles de Pensador, Trabajador y Verificador. Es diminuto y evolucionado, no entrenado por descenso de gradiente.

El segundo es Conductor, "Learning to Orchestrate Agents in Natural Language" (arXiv:2512.04388). Conductor es un modelo de 7B entrenado con aprendizaje por refuerzo que aprende la estructura de comunicación entre agentes. El artículo afirma que supera a Mixture-of-Agents a menor costo.

Estos son métodos y tamaños diferentes. Trinity utiliza la evolución con menos de 20.000 parámetros. Conductor utiliza RL con 7B de parámetros. No los confunda. Y no asuma que las especificaciones exactas de ninguno de los documentos describen el producto enviado. Mapear la cifra de 7B, o cualquier modelo base específico, al Fugu lanzado es una inferencia de terceros. El lanzamiento oficial no proporciona el recuento de parámetros del producto.

Una sección de especificaciones para tener en cuenta junto a las afirmaciones

Aquí está lo que está razonablemente establecido frente a lo que aún no está confirmado. Trate la línea de arquitectura como no verificada.

Elemento Lo que dice Sakana / las fuentes Confianza
Tipo de sistema Orquestador multiagente detrás de un solo modelo Declarado en la página de lanzamiento
Variantes Fugu (equilibrado, baja latencia) y Fugu Ultra (máxima calidad) Declarado en la página de lanzamiento
Antiguo nombre beta La variante pequeña se llamó "Fugu Mini" en beta y prensa Histórico
Superficie API Un endpoint compatible con OpenAI, ambas variantes Declarado en la página de lanzamiento
Modelos subyacentes Llama a múltiples LLMs frontera, incluyéndose a sí mismo recursivamente Declarado en la página de lanzamiento
Recuento de parámetros del producto No publicado; los detalles de 7B / Conductor son inferencia de terceros [VERIFICAR]
Metodología de benchmark Reportado por el proveedor, configuración propia de Sakana, no se ha lanzado un arnés [VERIFICAR]

La nota sobre la nomenclatura merece repetirse una vez: la variante pequeña se llamó "Fugu Mini" durante la beta de aproximadamente 500 usuarios que se abrió alrededor del 24-25 de abril de 2026. La página de lanzamiento utiliza "Fugu" y "Fugu Ultra". Utilice los nombres actuales.

Qué significa esto para sus propias pruebas

No puede verificar los benchmarks de Sakana. Puede ejecutar los suyos propios.

Dado que Fugu habla el protocolo de completado de chat de OpenAI, puede apuntar un cliente OpenAI existente a la URL base de Fugu y enviar sus tareas reales. Sin migración de SDK. La URL base no está publicada en ninguna página pública a fecha de 22-06-2026, así que cópiela de su consola en console.sakana.ai y nunca confíe en un host inventado. El patrón a continuación refleja la solicitud estándar de completado de chat de OpenAI:

from openai import OpenAI

# Copia la URL base real de console.sakana.ai después de iniciar sesión.
client = OpenAI(
    api_key="YOUR_FUGU_API_KEY",
    base_url="<YOUR_FUGU_BASE_URL_FROM_CONSOLE>",
)

resp = client.chat.completions.create(
    model="fugu-ultra",  # 'fugu' para la variante equilibrada; IDs reportados, verificar en la consola
    messages=[
        {"role": "system", "content": "You are a precise code reviewer."},
        {"role": "user", "content": "Review this function for security issues:\n<paste code>"},
    ],
)

print(resp.choices[0].message.content)

Los ID de modelo reportados hasta ahora son `fugu` y `fugu-ultra`, posiblemente con un formato fechado. Confirme los ID exactos en la consola en lugar de incluirlos directamente en su configuración. Dado que Fugu decide por cada solicitud si responder directamente o ensamblar un equipo, el mismo prompt puede producir diferente latencia y costo en diferentes ejecuciones. Registre ambos.

Aquí es donde ejecutar su propia evaluación importa más de lo habitual. Envíe las tareas que realmente le interesan, no AutoResearch o ajedrez de un tiro, y mida la latencia, el costo y la calidad de la salida en comparación con los modelos únicos que ya utiliza. Los benchmarks del proveedor le dicen lo que Sakana midió. Sus propias ejecuciones le dirán lo que obtendrá.

Cómo encaja esto en su flujo de trabajo de Apidog

No necesita una nueva herramienta para poner a prueba las afirmaciones de benchmark de un proveedor. Necesita una forma de enviar el mismo prompt a varios endpoints y comparar las respuestas una al lado de la otra.

Apidog le permite registrar el endpoint de Fugu como una API compatible con OpenAI, guardar sus prompts de evaluación reales como solicitudes y ejecutarlos como un escenario de prueba. Coloque Fugu, Fable 5 y un endpoint de Opus en el mismo entorno, envíe entradas idénticas y capture las salidas, códigos de estado, latencia y uso de tokens en un solo lugar. Esa es una comparación mucho más útil que una afirmación de paridad sin una metodología que la respalde. Cuando desee rastrear la variación de costos del enrutamiento adaptativo de Fugu, las aserciones sobre el tiempo de respuesta y el recuento de tokens lo revelarán ejecución tras ejecución. Descargue Apidog y cree la comparación una vez, luego vuelva a ejecutarla cada vez que se lance una nueva versión del modelo.

button

Preguntas Frecuentes

¿Fugu supera a Fable 5 en los benchmarks?

No, y Sakana nunca afirmó eso. La afirmación es de paridad: Fugu Ultra "está a la altura de" Fable 5 y Mythos Preview, según Sakana. La afirmación separada de "superación" apunta a Gemini 3.1 Pro, Opus 4.8 y GPT 5.5 en aplicaciones específicas, no a Fable 5. Para el lado de modelo único de esa comparación, consulte los benchmarks de Claude Fable 5.

¿Están verificados independientemente los números de benchmark de Fugu?

No. A fecha de 22-06-2026, cada cifra es reportada por el proveedor en la configuración propia de Sakana, con los ajustes de esfuerzo de los competidores que Sakana eligió. Ningún tercero ha vuelto a ejecutar las tareas, y no se ha publicado ningún arnés de evaluación. Trate las afirmaciones como afirmaciones hasta que alguien fuera de Sakana las reproduzca.

¿Por qué importa que Fugu sea un orquestador?

Debido a que Fugu llama a modelos frontera de otros proveedores, incluyéndose a sí mismo recursivamente, un resultado de "supera a Opus 4.8" puede provenir de Fugu llamando a Opus y sintetizando. Esa es una victoria de un modelo de modelos, no una victoria de un solo modelo. Fable 5 y la línea Mythos son modelos únicos de Anthropic, lo que hace que una comparación directa sea como comparar manzanas con naranjas.

¿Contra qué Mythos comparó Sakana?

El Mythos Preview anterior de abril, el modelo frontera que Anthropic describió como demasiado peligroso para lanzar, no el Mythos 5 actual. Algunos informes secundarios nombran la versión incorrecta. El explicador de la clase Mythos cubre la diferencia entre Preview y la línea lanzada.

¿Cuál es la diferencia entre Trinity y Conductor?

Son dos artículos de ICLR 2026 separados. Trinity (arXiv:2512.04695) es un coordinador de menos de 20.000 parámetros optimizado por evolución. Conductor (arXiv:2512.04388) es un modelo de 7B entrenado con aprendizaje por refuerzo. Métodos diferentes, tamaños diferentes. Ninguno se afirma como la hoja de especificaciones del producto enviado.

¿Cómo puedo probar el rendimiento de Fugu por mí mismo?

Apunte un cliente compatible con OpenAI a la URL base de Fugu desde console.sakana.ai, envíe sus propias tareas y mida la calidad, la latencia y el costo. Registre el endpoint en Apidog para comparar Fugu con los modelos únicos que ya utiliza, con prompts idénticos y métricas capturadas.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs