사카나 푸구 벤치마크: 페이블 5와 어깨를 나란히 한다는 것의 진실

사카나의 푸구 벤치마크는 벤더가 자체적으로 보고한 동등성 주장이며, 검증된 점수가 아닙니다. 각 주장이 무엇을 말하는지, 누가 주장했는지, 그리고 왜 입증되지 않았는지 살펴보세요.

INEZA Felin-Michel

INEZA Felin-Michel

22 June 2026

사카나 푸구 벤치마크: 페이블 5와 어깨를 나란히 한다는 것의 진실

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

사카나의 Fugu 벤치마크는 공급업체가 보고한 동등성 주장이며, 독립적으로 검증된 성적표가 아닙니다. 사카나의 릴리스 페이지에 따르면, Fugu Ultra는 엔지니어링, 과학 및 추론 작업에서 "Fable 5 및 Mythos Preview와 같은 선도적인 모델들과 어깨를 나란히 한다"고 하며, Fugu는 특정 애플리케이션 세트에서 Gemini 3.1 Pro, Opus 4.8 및 GPT 5.5를 "꾸준히 능가합니다". 어떤 수치를 읽기 전에 이해해야 할 중요한 점은 다음과 같습니다. Fugu는 다른 공급업체의 최신 모델을 호출하는 오케스트레이터이므로, 그 결과는 Fable 5의 경우처럼 단일 모델의 승리가 아닙니다.

button

Fugu의 실제 정체와 벤치마크를 읽는 방식이 바뀌는 이유

Fugu는 단일 기반 모델이 아닙니다. Fugu는 OpenAI 호환 API 뒤에 하나의 모델로 제시되는 다중 에이전트 오케스트레이션 시스템입니다. 사카나는 이를 위임, 에이전트 통신 및 작업 종합에 특화된 훈련된 언어 모델로 설명합니다. Fugu는 자체 재귀 인스턴스를 포함하여 여러 LLM을 동적으로 조정하고, 직접 답변할지 또는 팀을 구성할지 결정합니다. 릴리스 헤드라인은 "모든 것을 지휘하는 하나의 모델"입니다.

이러한 설계 세부 사항이 벤치마크의 전체 이야기입니다. 일반 모델이 점수를 게시할 때, 그 숫자는 해당 모델 자체의 가중치가 작업을 수행한 것을 반영합니다. Fugu가 점수를 게시할 때, 그 숫자는 Fugu가 Opus 4.8, 또는 GPT 5.5, 또는 Gemini 3.1 Pro를 호출한 다음 그들의 출력을 종합한 것을 반영할 수 있습니다. 따라서 "Opus 4.8을 능가한다"는 결과는 Opus를 호출하고 다른 모델과 결합하는 시스템에서 나올 수 있습니다. 이는 단일 모델 결과가 아니라 모델들의 모델 결과입니다. 더 깊은 아키텍처 컨텍스트를 원하시면, 사카나 Fugu가 무엇인지에 대한 우리의 설명에서 오케스트레이션 루프를 자세히 설명합니다.

동등성 주장: "Fable 5 및 Mythos Preview와 어깨를 나란히 한다"

다음은 신중하게 명시된 첫 번째 주장입니다.

사카나에 따르면, Fugu Ultra는 엔지니어링, 과학 및 추론 벤치마크 전반에 걸쳐 "Fable 5 및 Mythos Preview와 같은 선도적인 모델들과 어깨를 나란히 한다"고 합니다. 동사를 잘 살펴보세요. 이것은 "능가한다"는 주장이 아니라 동등성 주장입니다. 사카나는 Fugu Ultra를 최신 기술의 선두 주자가 아닌 동등한 수준의 모델로 포지셔닝하고 있습니다.

두 가지 주목할 점이 있습니다.

첫째, 언급된 경쟁 모델은 Anthropic이 출시하기에는 너무 위험하다고 설명했던 4월의 최신 모델인 "Mythos Preview"입니다. 현재 일반적으로 사용 가능한 Mythos 5가 아닙니다. Mythos급 모델에 대해 읽어보셨다면, Preview와 출시된 모델 라인이 서로 다른 인공물이라는 것을 아실 것입니다. 현재 모델이 아닌 Preview에 동등성 주장을 고정하는 것은 선택 사항이며, 이 주장이 얼마나 인상적으로 들리는지에 영향을 미칩니다.

둘째, 사카나 외부의 누구도 다시 실행할 수 있는 형태로 이 주장을 뒷받침하는 벤치마크 표가 없습니다. 이 주장은 릴리스 페이지에서 질적인 형태로 제시됩니다. 공개된 방법론, 작업별 점수표, 제3자 재현이 없습니다. "어깨를 나란히 한다"는 것을 공급업체가 자체 내부 결과를 표현하는 방식이라고 생각하십시오.

더 강력한 주장: "특정 애플리케이션에서 꾸준히 능가한다"

사카나는 첫 번째 주장과 구별할 가치가 있는 두 번째이자 더 대담한 주장을 합니다.

사카나에 따르면, Fugu는 특정 애플리케이션 목록에서 세 가지 구성된 경쟁 모델을 "꾸준히 능가합니다":

언급된 애플리케이션은 AutoResearch, 루빅스 큐브, 기계 설계, 일본어 필기 분석, 원샷 체스 및 금융 시계열 예측입니다.

이것은 표준 학술 벤치마크 스위트가 아닌 애플리케이션 수준의 성능입니다. 이는 오케스트레이션 시스템이 빛을 발할 수 있는 종단 간 작업입니다. 왜냐하면 오케스트레이션 시스템은 하위 문제를 가장 잘 처리하는 기본 모델로 라우팅한 다음 결과를 함께 엮을 수 있기 때문입니다. 이는 지휘자가 어떤 단일 연주자보다 뛰어나야 하는 바로 그 지점입니다.

하지만 다시 정직한 관점을 적용해 봅시다. 이 경쟁 모델들 중 일부는 Fugu가 호출할 수 있는 모델입니다. AutoResearch에서 "Opus 4.8 (최대)를 능가한다"는 결과는 Fugu가 Opus를 호출하고, 다른 모델들을 호출하며, 더 강력한 결합된 답변을 종합하여 나온 것일 수 있습니다. 이는 실제 능력이며, 실제로 도움이 될 수 있습니다. 이것은 단일 사카나 모델이 Opus보다 추론 능력이 뛰어나다는 증거는 아닙니다. 이 수치들을 단일 모델의 승리로 절대 읽지 마십시오. 그리고 "Fugu가 Fable 5를 능가한다"고 표현하지 마십시오. 사카나는 그렇게 주장하지도 않았기 때문입니다. 동등성 주장과 능가 주장은 서로 다른 경쟁 모델을 대상으로 합니다.

이 수치들을 아직 독립적으로 검증할 수 없는 이유

아직 독립적인 재현 없음. 이 페이지의 모든 Fugu 벤치마크 수치는 공급업체가 보고한 것이며, 사카나 자체 설정에서 측정되었고, 사카나가 선택한 경쟁 모델 구성("높음", "최대", "초고성능" 노력 설정)을 사용했습니다. 2026년 6월 22일 현재, 어떤 제3자도 이 작업을 다시 실행하지 않았으며, 작업별 점수표도 공개되지 않았고, 평가 도구도 출시되지 않았습니다. 올바른 자세는 이 모든 것을 측정치가 아닌 주장으로 간주하는 것입니다.

이것은 사카나를 특별히 비난하는 것이 아닙니다. 이는 출시 당일의 모든 모델에 대한 기본 상태입니다. Fugu의 차이점은 오케스트레이션 설계로 인해 독립적인 재현이 더 어려워진다는 것입니다.

단일 모델의 벤치마크를 재현하려면 모델과 테스트가 필요합니다. Fugu의 벤치마크를 재현하려면 Fugu와 Fugu가 라우팅하는 모든 기본 모델(동일한 버전 및 노력 설정), 그리고 사카나가 실행한 것과 동일한 오케스트레이션 토폴로지에 대한 접근 권한이 필요합니다. 이 시스템은 공급자 제한을 "동적으로 우회"하고 작업별로 에이전트 토폴로지를 조정하므로, 동일한 프롬프트를 두 번 실행해도 동일한 내부 팀을 사용하지 않을 수 있습니다. 이러한 적응성은 사용자에게는 기능이지만 재현성에는 골칫거리입니다.

따라서 여기서는 명확한 정면 비교표를 찾을 수 없을 것이며, 보조 출처에서 떠도는 "Fugu가 X점을 획득했다"는 어떤 수치에 대해서도 회의적이어야 합니다. 이 보조 자료들 중 일부는 잘못된 경쟁 모델 버전(예: Mythos Preview 대신 현재 Mythos)을 언급합니다. 현재로서는 수치가 없는 상태가 솔직한 결과입니다. Fugu Ultra vs Fable 5 vs Mythos 비교가 동일한 이유로 질적인 평가에 머무르는 것입니다.

주장 이면의 연구 기록

사카나의 마케팅은 실제 인용 가능한 연구에 기반을 두고 있습니다. 두 편의 ICLR 2026 논문이 그 계보를 설명합니다. 이들 중 어느 것도 제품 벤치마크로 주장되지 않으므로, Fugu 사양 시트가 아닌 연구 기록으로 읽으십시오.

첫 번째는 트리니티(Trinity), "진화된 LLM 코디네이터" (arXiv:2512.04695)입니다. 트리니티는 미분 없는 진화로 최적화된 20,000개 미만의 매개변수를 가진 코디네이터로, Thinker, Worker, Verifier 역할을 가집니다. 이는 작고 진화된 모델이며, 경사 하강법으로 훈련되지 않았습니다.

두 번째는 컨덕터(Conductor), "자연어에서 에이전트를 오케스트레이션하는 학습" (arXiv:2512.04388)입니다. 컨덕터는 에이전트 간의 통신 구조를 학습하는 강화 학습으로 훈련된 7B 모델입니다. 이 논문은 Mixture-of-Agents를 더 낮은 비용으로 능가한다고 주장합니다.

이것들은 서로 다른 방법론과 다른 크기입니다. 트리니티는 2만 개 미만의 매개변수로 진화를 사용합니다. 컨덕터는 7B 매개변수로 RL을 사용합니다. 이들을 혼동하지 마십시오. 그리고 어느 논문의 정확한 사양도 출시된 제품을 설명한다고 가정하지 마십시오. 7B 수치 또는 특정 기본 모델을 출시된 Fugu에 연결하는 것은 제3자의 추론입니다. 공식 릴리스에는 제품 매개변수 수가 나와 있지 않습니다.

주장과 함께 알아두어야 할 사양 요약

다음은 합리적으로 확립된 내용과 아직 확인되지 않은 내용입니다. 아키텍처 라인은 검증되지 않은 것으로 간주하십시오.

항목 사카나/출처의 언급 확실성
시스템 유형 하나의 모델 뒤에 있는 다중 에이전트 오케스트레이터 릴리스 페이지에 명시됨
변형 Fugu (균형 잡힌, 낮은 지연 시간) 및 Fugu Ultra (최대 품질) 릴리스 페이지에 명시됨
이전 베타 이름 베타 및 언론에서 작은 변형 모델은 "Fugu Mini"로 불렸음 역사적
API 표면 하나의 OpenAI 호환 엔드포인트, 두 변형 모델 모두 릴리스 페이지에 명시됨
기반 모델 재귀적으로 자신을 포함하여 여러 최신 LLM을 호출함 릴리스 페이지에 명시됨
제품 매개변수 수 공개되지 않음; 7B / Conductor 세부 사항은 제3자 추론 [확인 필요]
벤치마크 방법론 공급업체 보고, 사카나 자체 설정, 평가 도구 미공개 [확인 필요]

이름에 대한 주의사항을 다시 한번 강조할 가치가 있습니다. 약 2026년 4월 24-25일경에 시작된 약 500명의 사용자 베타 기간 동안 작은 변형 모델은 "Fugu Mini"라고 불렸습니다. 릴리스 페이지에서는 "Fugu"와 "Fugu Ultra"를 사용합니다. 현재 이름을 사용하십시오.

이것이 사용자 자신의 테스트에 의미하는 바

사카나의 벤치마크를 검증할 수는 없습니다. 하지만 사용자 자신의 테스트를 실행할 수 있습니다.

Fugu는 OpenAI chat-completions 프로토콜을 사용하므로, 기존 OpenAI 클라이언트를 Fugu 기본 URL로 지정하고 실제 작업을 전송할 수 있습니다. SDK 마이그레이션은 필요 없습니다. 2026년 6월 22일 현재 기본 URL은 어떤 공개 페이지에도 게시되어 있지 않으므로, console.sakana.ai의 콘솔에서 복사하고 임의로 만들어진 호스트를 절대 신뢰하지 마십시오. 아래 패턴은 표준 OpenAI 채팅 완료 요청을 반영합니다.

from openai import OpenAI

# 로그인 후 console.sakana.ai에서 실제 기본 URL을 복사하십시오.
client = OpenAI(
    api_key="YOUR_FUGU_API_KEY",
    base_url="<YOUR_FUGU_BASE_URL_FROM_CONSOLE>",
)

resp = client.chat.completions.create(
    model="fugu-ultra",  # 균형 잡힌 변형에는 'fugu' 사용; ID는 보고되었지만, 콘솔에서 확인하십시오.
    messages=[
        {"role": "system", "content": "당신은 정확한 코드 검토자입니다."},
        {"role": "user", "content": "이 함수의 보안 문제를 검토하세요:\n<코드 붙여넣기>"},
    ],
)

print(resp.choices[0].message.content)

지금까지 보고된 모델 ID 문자열은 `fugu`와 `fugu-ultra`이며, 날짜가 포함된 형태일 수도 있습니다. 설정에 하나를 고정하기보다는 콘솔에서 정확한 ID를 확인하십시오. Fugu는 요청마다 직접 답변할지 또는 팀을 구성할지 결정하므로, 동일한 프롬프트라도 실행마다 다른 지연 시간과 비용을 발생시킬 수 있습니다. 둘 다 기록하십시오.

이것이 사용자 자신의 평가를 실행하는 것이 평소보다 더 중요한 이유입니다. AutoResearch나 원샷 체스가 아닌, 실제로 중요한 작업을 전송하고, 이미 사용 중인 단일 모델과 비교하여 지연 시간, 비용 및 출력 품질을 측정하십시오. 공급업체 벤치마크는 사카나가 측정한 것을 알려줍니다. 사용자 자신의 실행은 사용자가 얻게 될 것을 알려줍니다.

이것이 Apidog 워크플로우에 어떻게 적용되는가

공급업체의 벤치마크 주장을 압력 테스트하기 위해 새로운 도구가 필요하지 않습니다. 여러 엔드포인트에 동일한 프롬프트를 보내고 응답을 나란히 비교할 수 있는 방법이 필요합니다.

Apidog는 Fugu 엔드포인트를 OpenAI 호환 API로 등록하고, 실제 평가 프롬프트를 요청으로 저장하며, 이를 테스트 시나리오로 실행할 수 있도록 합니다. Fugu, Fable 5 및 Opus 엔드포인트를 동일한 환경에 넣고, 동일한 입력을 전송하며, 출력, 상태 코드, 지연 시간 및 토큰 사용량을 한 곳에서 캡처할 수 있습니다. 이는 방법론이 없는 동등성 주장보다 훨씬 더 유용한 비교입니다. Fugu의 적응형 라우팅으로 인한 비용 변화를 추적하고 싶을 때, 응답 시간 및 토큰 수에 대한 어설션은 실행마다 이를 드러냅니다. Apidog를 다운로드하여 비교를 한 번 구축한 다음, 새 모델 버전이 출시될 때마다 다시 실행하십시오.

button

자주 묻는 질문

Fugu가 벤치마크에서 Fable 5를 능가하나요?

아니요, 사카나는 그렇게 주장한 적이 없습니다. 사카나에 따르면, 주장은 동등성입니다: Fugu Ultra는 Fable 5 및 Mythos Preview와 "어깨를 나란히 합니다". 별도의 "능가한다"는 주장은 Fable 5가 아닌 특정 애플리케이션에서 Gemini 3.1 Pro, Opus 4.8 및 GPT 5.5를 대상으로 합니다. 해당 비교의 단일 모델 측면은 Claude Fable 5 벤치마크를 참조하십시오.

Fugu 벤치마크 수치는 독립적으로 검증되었나요?

아니요. 2026년 6월 22일 현재, 모든 수치는 사카나 자체 설정에서 측정되었고, 사카나가 선택한 경쟁 모델 노력 설정을 사용한 공급업체 보고입니다. 어떤 제3자도 작업을 다시 실행하지 않았으며, 평가 도구도 게시되지 않았습니다. 사카나 외부에서 누군가 이를 재현할 때까지는 주장을 주장으로 간주하십시오.

Fugu가 오케스트레이터라는 것이 왜 중요한가요?

Fugu는 재귀적으로 자신을 포함하여 다른 공급업체의 최신 모델을 호출하기 때문에, "Opus 4.8을 능가한다"는 결과는 Fugu가 Opus를 호출하고 종합하여 나온 것일 수 있습니다. 이는 단일 모델의 승리가 아니라 모델들의 모델 승리입니다. Fable 5와 Mythos 라인은 단일 Anthropic 모델이므로, 직접적인 정면 비교는 동질성 없는 비교가 됩니다.

사카나는 어떤 Mythos와 비교했나요?

현재 Mythos 5가 아닌, Anthropic이 출시하기에는 너무 위험하다고 설명했던 4월의 이전 모델인 Mythos Preview입니다. 일부 보조 자료에서는 잘못된 버전을 언급합니다. Mythos급 설명에서 Preview와 출시된 모델 라인의 차이점을 다룹니다.

Trinity와 Conductor의 차이점은 무엇인가요?

이들은 두 개의 별개 ICLR 2026 논문입니다. Trinity (arXiv:2512.04695)는 진화로 최적화된 20,000개 미만의 매개변수를 가진 코디네이터입니다. Conductor (arXiv:2512.04388)는 강화 학습으로 훈련된 7B 모델입니다. 방법론과 크기가 다릅니다. 둘 다 출시된 제품의 사양 시트로 주장되지 않습니다.

Fugu의 성능을 직접 테스트하려면 어떻게 해야 하나요?

console.sakana.ai에서 Fugu 기본 URL로 OpenAI 호환 클라이언트를 지정하고, 사용자 자신의 작업을 전송하며, 품질, 지연 시간 및 비용을 측정하십시오. Apidog에 엔드포인트를 등록하여, 동일한 프롬프트와 캡처된 지표를 사용하여 이미 사용 중인 단일 모델과 Fugu를 비교하십시오.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요