Fugu Ultra는 Sakana AI의 Fugu 최고 변형 모델이며, 이번 출시는 Fugu Ultra를 현재 기술의 정복자가 아닌 동등한 수준의 모델로 제시합니다. Sakana에 따르면, Fugu Ultra는 공학, 과학, 추론 벤치마크에서 "Fable 5 및 Mythos Preview와 같은 선도적인 모델들과 어깨를 나란히 합니다." 이는 "압도한다"는 주장이 아닌 "동등하다"는 주장입니다. 중요한 점은 Fugu가 다른 공급업체의 모델을 호출하는 오케스트레이터이므로, 단일 Anthropic 모델들과는 다른 범주에서 경쟁한다는 것입니다. 전체 세부 정보는 Sakana Fugu 출시 페이지에서 확인할 수 있으며, 더 자세한 분석은 Sakana Fugu란 무엇인가에서 읽을 수 있습니다.
비교 대상
Fugu는 하나의 OpenAI 호환 API 뒤에 하나의 파운데이션 모델로 제시되는 다중 에이전트 오케스트레이션 시스템입니다. Sakana는 이를 위임, 에이전트 통신 및 작업 통합에 특화된 훈련된 언어 모델로 설명합니다. Fugu는 자신을 포함한 여러 LLM 인스턴스를 동적으로 조정하며, 각 요청에 대해 직접 응답할지 아니면 팀을 구성할지 결정합니다. 출시 헤드라인은 "모두를 지휘하는 하나의 모델(One Model to Command Them All)"입니다.

Fable 5와 Mythos는 다릅니다. 이들은 단일 Anthropic 모델입니다. Fable 5는 Anthropic에서 가장 강력하게 일반적으로 사용 가능한 모델이며, Opus 4.8보다 한 단계 높은 공개 사용을 위해 안전하게 만들어진 "Mythos-클래스" 모델입니다. 2026년 4월 7일 출시된 Mythos Preview는 Anthropic이 출시하기에는 너무 위험하다고 설명한 선두 모델입니다. 한 가지 중요한 명명 세부 사항: Sakana는 비교에서 현재 Mythos 5가 아닌 이전 버전의 Mythos Preview를 언급했습니다. Anthropic 측면은 Fable 5 vs Mythos 5와 Mythos-클래스 모델 설명에서 다룹니다.
따라서 대결은 모델들의 모델과 단일 모델 간의 대결입니다. 이 프레임을 기억하십시오. 이는 아래의 모든 숫자를 읽는 방식을 바꿀 것입니다.
Fugu 및 Fugu Ultra 간략히
Fugu는 하나의 엔드포인트를 통해 두 가지 변형으로 제공됩니다. "Fugu"는 일상 업무, 코딩, 코드 검토, 챗봇 및 대화형 서비스를 위한 균형 잡힌 저지연 옵션입니다. "Fugu Ultra"는 AI 연구, 논문 재현, 사이버 보안 분석, 문헌 또는 특허 조사를 위한 최대 답변 품질을 목표로 합니다. 베타 버전과 많은 언론에서는 작은 변형을 "Fugu Mini"라고 불렀지만, 출시 페이지에서는 "Fugu"와 "Fugu Ultra"를 주요 이름으로 사용하므로 이 이름들을 사용해야 합니다.

솔직한 핵심: 오케스트레이터 대 단일 모델
이 부분은 건너뛸 수 없습니다. Fugu는 오케스트레이터입니다. 강력한 답변을 생성할 때, 다른 공급업체의 선두 모델을 호출하여 결과를 합성했을 수 있습니다. 여기에는 Opus 4.8 호출, Gemini 호출 또는 자신을 재귀적으로 호출하는 것이 포함됩니다.
따라서 Fugu가 "Opus 4.8을 압도한다"는 결과를 볼 때, Fugu가 Opus 4.8을 호출하고 그 위에 검증 또는 합성 레이어를 추가하여 그 결과를 얻었을 가능성이 전적으로 있습니다. 이는 실제 기능이며 진정으로 유용할 수 있습니다. 단일 모델이 자체 가중치만으로 Opus를 이기는 것과는 다릅니다.
Fable 5와 Mythos는 단일 모델입니다. 이들은 자체 파라미터로 응답합니다. 막 뒤에 팀은 없습니다.
이것이 바로 이 글에서 "Fugu가 Fable 5를 압도한다"고 쓰지 않는 이유이며, 그렇게 주장하는 어떤 출처에 대해서도 회의적이어야 합니다. 범주가 다릅니다. 공정한 해석은 "오케스트레이션된 시스템이 선두 모델로 라우팅하는 방식으로 부분적으로 선두 모델과 비교할 만한 품질에 도달했다"는 것입니다. 이 문장은 덜 자극적이지만 훨씬 더 정확합니다. 전체 벤치마크 과정이 궁금하다면 Sakana Fugu 벤치마크를 참조하십시오.
1단계: Fable 5 및 Mythos Preview와의 동등성
Sakana의 첫 번째 주장은 동등성입니다. Sakana에 따르면, Fugu Ultra는 공학, 과학, 추론 벤치마크 전반에 걸쳐 Fable 5 및 Mythos Preview와 어깨를 나란히 합니다. 이를 주의 깊게 읽어보십시오. "어깨를 나란히 한다"는 동등성을 나타내는 단어입니다. Fugu Ultra가 이긴다고 말하지 않습니다. Fugu Ultra가 보조를 맞춘다고 말합니다.
두 가지 사실이 이 주장을 단순한 점수보다 더 흥미롭게 만듭니다.
첫째, Sakana가 선택한 동등 모델입니다. Mythos Preview는 4월의 선두 모델이며, 현재 Mythos 5가 아닙니다. 가격은 그 차이를 반영합니다: Anthropic은 Fable 5와 Mythos 5를 백만 입력 토큰당 10달러, 백만 출력 토큰당 50달러로 책정했지만, Mythos Preview는 입력 25달러, 출력 125달러였습니다 (Anthropic 가격, 2026년 6월 9일). 이전 프리뷰 버전을 명명한 것은 재현 가능한 비교를 위한 정당한 선택이지만, 현재 최고 수준을 나타내지 않는 모델과 비교하지 않도록 명확하게 언급할 가치가 있습니다.
둘째, 메커니즘입니다. Fugu Ultra가 팀을 오케스트레이션하여 Fable-5 수준의 추론에 도달한다면, 단일 기본 모델만으로는 Fable 5에 미치지 못하더라도 시스템 수준에서는 동등성이 실제로 존재합니다. 이것이 솔직한 설명입니다. 이 대결의 단일 모델 측면에 대해서는 Claude Fable 5 vs Opus 4.8에서 Fable 5 자체가 어떤 위치에 있는지 설명합니다.
2단계: Sakana가 Fugu의 우수성을 주장하는 부분
이것은 별개의 모델 집합에 대한 별개의 주장이며, 위의 동등성 주장과 혼동되지 않도록 별도의 섹션으로 다룰 가치가 있습니다.
Sakana에 따르면, Fugu는 특정 애플리케이션에서 세 가지 선두 모델보다 "일관적으로 우수합니다":
- Gemini 3.1 Pro (높음)
- Opus 4.8 (최대)
- GPT 5.5 (최고)
명명된 애플리케이션은 좁고 구체적입니다: 자동 연구(AutoResearch), 루빅스 큐브(Rubik’s Cube), 기계 설계(Mechanical Design), 일본어 필기 분석(Japanese Handwriting Analysis), 원샷 체스(One-Shot Chess), 재무 시계열 예측(Financial Time Series Prediction).
여기에도 두 가지 솔직한 언급이 적용됩니다. 이것은 애플리케이션 수준의 승리이지 일반 벤치마크 승리가 아닙니다. 오케스트레이터는 계획, 위임, 검증, 재시도를 할 수 있기 때문에 자동 연구(AutoResearch)나 체스와 같은 구조화되고 다단계적인 작업에서 높은 점수를 얻을 수 있습니다. 이것이 바로 조정 레이어가 제 역할을 하는 지점입니다. 그리고 다시 말하지만, 우수성은 비교 대상인 동일한 선두 모델로 라우팅함으로써 부분적으로 발생할 수 있습니다. 루빅스 큐브에서 Opus를 호출하여 달성된 "Opus 4.8을 압도한다"는 결과는 시스템 승리이지 가중치 승리가 아닙니다.
따라서 정확한 요약은 다음과 같습니다: Fugu의 조정 레이어는 구조화되고 검증 가능한 작업에서 측정 가능한 가치를 추가하며, 때로는 특정 작업에서 단일 선두 모델을 능가하기에 충분합니다.
비교표
이 표는 의도적으로 카테고리 행을 가장 먼저 배치했습니다. 다른 내용을 읽기 전에 이 행을 읽으십시오.
| 차원 | Fugu / Fugu Ultra | Fable 5 | Mythos (Preview / 5) |
|---|---|---|---|
| 시스템 종류 | 오케스트레이터: 자체 포함 여러 LLM을 호출하는 훈련된 지휘자 | 단일 Anthropic 모델 | 단일 Anthropic 모델 |
| 공급업체 | Sakana AI | Anthropic | Anthropic |
| Sakana의 이 모델 대비 주장 | Fable 5 및 Mythos Preview와 동등성 ("어깨를 나란히 함") | 명명된 동등 모델 | 명명된 동등 모델 (Preview, 5 아님) |
| 별도의 우수성 주장 | 명명된 앱에서 Gemini 3.1 Pro, Opus 4.8, GPT 5.5 대비 | 우수성 목표 아님 | 우수성 목표 아님 |
| 가격 (출처 명시) | 보고된 등급 + PAYG, 모두 [확인 필요] | 100만 입력당 $10 / 100만 출력당 $50 | Preview: 입력 $25 / 출력 $125; Mythos 5: $10 / $50 |
| API 표면 | 하나의 OpenAI 호환 엔드포인트, 두 변형 모두 | Anthropic API | Anthropic API |
| 강점 | 구조화된 다단계 작업, 거버넌스 라우팅 | 범용 선두 품질, 일반 공개 안전 | 원시 선두 최고 성능 |
Fugu의 가격 수치는 보고된 것이며 출시 페이지 자체에서 나온 것이 아니므로, 실시간으로 확인하기 전까지는 Fugu의 모든 달러 수치를 검증되지 않은 것으로 간주하십시오. Anthropic 수치는 2026년 6월 9일 Anthropic의 가격에서 가져온 것입니다. Fable 5 자체 점수에 대한 자세한 내용은 Claude Fable 5 벤치마크를 참조하십시오.
가격, 솔직하게 제한됨
Sakana는 출시 페이지에서 가격 구조를 확인했습니다: 일상적인 사용을 위한 구독 등급과 더 많은 사용량 및 엔터프라이즈 워크로드를 위한 종량제 요금제. 이 개념은 확실합니다.
하지만 실제 숫자는 그렇지 않습니다. 2026년 6월 22일 현재, 보고된 수치는 출시 페이지가 아닌 JS 렌더링 또는 보조 출처에서 나옵니다. 보고된 구독 등급은 두 모델 모두 월 $20, $100, $200이며, 2026년 7월 말 이전에 구독하면 두 번째 달이 무료인 출시 프로모션이 있습니다. 보고된 종량제 가격은 백만 토큰당 입력 약 $5, 출력 $30, 캐시 $0.50이며, 272K 토큰을 초과하는 컨텍스트에 대한 추가 요금이 있습니다. 기본 "Fugu" 변형은 호출하는 기본 모델의 표준 요율로 패스스루 방식으로 청구되는 것으로 알려져 있습니다. 독립적인 무료 등급은 나타나지 않았습니다.
2026년 6월 22일 현재 보고된 내용이므로 실시간으로 확인하십시오. 콘솔에서 확인하기 전까지는 이 숫자를 기반으로 예산을 계획하지 마십시오. 구조는 실제이지만, 숫자는 아직 확정되지 않았습니다.
연구 계보와 그것이 증명하지 않는 것
Sakana가 오케스트레이션을 발명한 것은 아닙니다. Together AI의 Mixture-of-Agents (ICLR 2025)는 이미 오케스트레이션된 모델이 단일 모델을 능가한다는 것을 보여주었습니다. Fugu의 더 좁은 참신성은 훈련된 지휘자 연구 라인을 기반으로, 하나의 엔드포인트로 제공되는 학습된, 적응형, 비용 선택적 토폴로지입니다.
그 계보는 실제이며 인용 가능합니다. 이 접근 방식 뒤에는 두 개의 ICLR 2026 논문이 있습니다. "진화된 LLM 코디네이터(An Evolved LLM Coordinator)"(arXiv:2512.04695)인 Trinity는 미분 없는 진화로 최적화된 20K 미만 파라미터 코디네이터로, 사고자(Thinker), 작업자(Worker), 검증자(Verifier) 역할을 합니다. "자연어 에이전트 오케스트레이션 학습(Learning to Orchestrate Agents in Natural Language)"(arXiv:2512.04388)인 Conductor는 강화 학습으로 훈련된 7B 모델로, 통신 구조를 학습하고 더 낮은 비용으로 Mixture-of-Agents를 능가한다고 주장합니다.
이들은 다른 방법과 다른 크기를 가집니다. 진화 대 강화 학습, 20K 미만 대 7B. 이들을 혼동하지 마십시오. 또한 특정 세트가 출시된 제품에 깔끔하게 매핑된다고 가정하지 마십시오. 공식 출시에서는 제품 파라미터 수를 제공하지 않으므로, 7B 세부 정보를 Fugu 자체에 적용하는 것은 제3자 추론이며 명시된 사실이 아닙니다.
Fugu가 다른 모델들과 구별되는 점은 명확합니다. OpenRouter 또는 Martian과 같은 라우터는 하나의 모델을 선택하여 요청을 보냅니다. Swarm, AutoGen 또는 LangGraph와 같은 에이전트 프레임워크는 사용자가 코디네이터가 됩니다. Fugu는 코디네이터를 훈련하고 단일 호출 뒤에 숨깁니다.
Apidog 워크플로에 적용하는 방법
Fugu는 하나의 OpenAI 호환 엔드포인트를 노출합니다. 기존 OpenAI 클라이언트를 키와 함께 이 엔드포인트로 지정하면 SDK를 마이그레이션할 필요가 없습니다. 두 변형 모두 동일한 엔드포인트를 통해 실행되며, Fugu는 직접 응답할지 또는 팀을 구성할지 결정합니다.
2026년 6월 22일 현재 기본 URL은 어떤 공개 페이지에도 게시되지 않았으므로, 떠도는 호스트를 신뢰하지 마십시오. console.sakana.ai 콘솔에서 실제 기본 URL을 복사한 다음, 표준 OpenAI 요청에 삽입하십시오. 보고된 모델 ID 문자열은 fugu와 fugu-ultra이며, 날짜가 포함된 형식이 있을 수 있습니다. 날짜가 포함된 문자열을 하드코딩하는 대신 콘솔에서 정확한 ID를 확인하십시오.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_SAKANA_API_KEY",
base_url="<YOUR_FUGU_BASE_URL_FROM_CONSOLE>", # console.sakana.ai에서 복사
)
response = client.chat.completions.create(
model="fugu-ultra", # 콘솔에서 정확한 ID 확인; 균형 잡힌 변형은 "fugu"
messages=[
{"role": "system", "content": "You are a careful code reviewer."},
{"role": "user", "content": "Review this pull request for security issues."},
],
)
print(response.choices[0].message.content)
OpenAI 채팅 완성 형식(OpenAI API 참조)을 사용하므로, 다른 모델 엔드포인트를 테스트하는 것과 동일한 방식으로 Fugu를 테스트할 수 있습니다. Apidog에서 콘솔 기본 URL에 대한 요청을 생성하고, 모델 필드를 fugu-ultra로 설정한 다음, 재사용 가능한 사례로 저장하십시오. Fable 5 또는 Opus 4.8 엔드포인트에 대해 동일한 요청을 나란히 실행하고 응답을 비교하며, 중요한 부분에 대해 확인할 수 있습니다. 이것은 마케팅 표를 신뢰하는 대신 자신만의 프롬프트로 Sakana의 동등성 주장을 확인하는 실용적인 방법입니다. 비교를 설정하려면 Apidog를 다운로드하십시오.
규제 준수 팀을 위한 한 가지 운영 세부 사항입니다. Fugu의 에이전트는 교체 가능하며, 데이터 또는 규제 준수 이유로 특정 에이전트를 풀에서 제외할 수 있으며, Sakana는 Fugu가 공급업체 제한을 동적으로 우회한다고 말합니다. 규제된 환경에서 테스트하는 경우, 해당 옵트아웃 경로를 실행하고 제외된 공급업체가 응답 추적에 나타나지 않는지 확인하십시오.
판결, 양측 주장의 핵심을 강화하여
감명받을 만한 사례: Sakana는 실제 연구 라인을 기반으로 훈련된 지휘자를 하나의 깔끔한 엔드포인트로 출시했으며, 선두 모델과의 동등성과 애플리케이션 수준의 성과를 모두 주장했습니다. 자동 연구(AutoResearch) 및 체스와 같은 구조화되고 검증 가능한 작업에서 조정 레이어는 정확히 올바른 도구이며, 초기 사용자들도 이를 지지합니다. Sakana는 다른 도구들이 약 세 개의 문제를 지적하는 코드 검토에서 Fugu Ultra가 20개 이상의 문제를 발견했으며, 이를 GPT-5.5보다 낫다고 평가한 소프트웨어 엔지니어의 말을 보고합니다. 한 보안 엔지니어는 범위 내에서 정찰 및 인증 검토를 포함한 완전한 엔드투엔드 평가를 한 가지 범위 지정 지시로 수행했다고 말했습니다.
신중해야 할 사례: 동등성 주장은 Mythos 5가 아닌 이전 버전의 Mythos Preview에 대한 것이며, 우수성 주장은 다른 모델 세트에 대한 별도의 계층에 있습니다. 두 주장 모두 비교 대상인 모델들을 호출하여 수치를 달성할 수 있는 시스템에서 나옵니다. Mixture-of-Agents는 이미 오케스트레이션이 단일 모델을 능가할 수 있음을 증명했으므로, 이 높은 수준의 아이디어는 새로운 것이 아닙니다. 솔직한 해석은 "학습된 지휘자와 강력한 거버넌스 스토리를 갖춘 선두 모델과 비교할 만한 오케스트레이션"이지, "새로운 최고의 모델"이 아닙니다.
대부분의 팀에게 올바른 움직임은 과대광고도 무시도 아닙니다. Fugu Ultra를 Fable 5 및 Opus 4.8과 비교하여 자체 구조화된 작업에서 실행하고, 조정 레이어가 그 비용을 정당화하는 지점을 확인하며, 약정하기 전에 모든 가격 수치를 검증하십시오. Sakana의 브랜딩은 은유에 기대어 있습니다: 복어(fugu)는 숙련된 요리사가 준비해야만 안전하며, 오케스트레이션은 바로 그 세심한 준비입니다. 그 준비가 추가 비용을 지불할 가치가 있는지는 어떤 출시 페이지보다 여러분 자신의 테스트 스위트가 더 빨리 답해줄 수 있는 질문입니다.
자주 묻는 질문
Fugu Ultra가 Fable 5를 능가하나요?
아니요, Sakana도 그렇게 주장하지 않습니다. Sakana에 따르면, Fugu Ultra는 Fable 5 및 Mythos Preview와 어깨를 나란히 하며, 이는 동등성 주장이지 승리 주장이 아닙니다. Fugu는 선두 모델을 호출할 수 있는 오케스트레이터이므로, 보이는 "승리"는 해당 모델로 라우팅하는 데서 비롯될 수 있습니다. 단일 모델 측면은 Fable 5 vs Mythos 5를 참조하십시오.
Sakana가 Fugu가 Opus 4.8보다 우수하다고 말하는 것은 무엇을 의미합니까?
이는 동등성 주장과는 별개의 주장이며, 일반적인 벤치마크가 아닌 특정 애플리케이션에 적용됩니다. Sakana에 따르면, Fugu는 자동 연구(AutoResearch), 원샷 체스(one-shot chess), 재무 시계열 예측(financial time-series prediction)과 같은 작업에서 Gemini 3.1 Pro, Opus 4.8, GPT 5.5보다 일관적으로 우수합니다. Fugu가 자체 루프 내에서 Opus를 호출하여 이러한 결과를 얻을 수 있다는 점을 명심하십시오. 따라서 이는 시스템 승리이지 단일 모델 승리가 아닙니다.
Sakana는 왜 Mythos 5 대신 Mythos Preview와 비교합니까?
Mythos Preview는 Anthropic이 출시하기에는 너무 위험하다고 명명한 2026년 4월의 선두 모델이며, Mythos 5는 현재 일반적으로 사용 가능한 버전입니다. Sakana는 비교에서 이전 프리뷰 버전을 언급했습니다. 이는 재현 가능한 테스트를 위한 정당한 선택이지만, 동등성 주장이 오늘날의 최고 수준을 기준으로 측정되지 않음을 의미합니다. Mythos-클래스 모델 설명에서 이 차이점을 다룹니다.
Fugu는 단일 모델인가요 아니면 모델 그룹인가요?
그룹입니다. Fugu는 자체를 재귀적으로 복사한 것을 포함하여 여러 LLM에 위임하고 전체 시스템을 하나의 OpenAI 호환 API 뒤의 단일 모델로 제시하는 훈련된 지휘자입니다. Fable 5와 Mythos는 자체 가중치로 응답하는 단일 Anthropic 모델이며, 이것이 이 비교가 두 가지 다른 시스템 범주를 가로지르는 핵심 이유입니다.
Fugu를 Fable 5와 직접 테스트하려면 어떻게 해야 합니까?
OpenAI 호환 클라이언트를 Sakana 콘솔 기본 URL로 지정하고, 모델을 fugu-ultra로 설정한 다음, Fable 5 또는 Opus 4.8에 대해 실행하는 동일한 프롬프트를 실행하십시오. Apidog에서는 각 모델을 요청으로 저장하고, 나란히 실행하며, 중요한 출력에 대해 확인할 수 있습니다. 이는 Sakana의 동등성 주장을 신뢰하는 대신 측정하는 것으로 바꿉니다.
Fugu의 비용은 Fable 5와 비교하여 얼마입니까?
가격 구조는 확인되었지만(구독 등급과 종량제), Fugu의 모든 달러 수치는 2026년 6월 22일 현재 보조 출처에서 보고된 것이며 검증되지 않았으므로, 예산을 책정하기 전에 콘솔에서 확인하십시오. 참고로 Anthropic은 Fable 5를 백만 입력 토큰당 $10, 백만 출력 토큰당 $50로 책정합니다. Sakana Fugu 벤치마크 글은 가격이 확인되는 대로 추적합니다.
