Các điểm chuẩn Fugu của Sakana là các tuyên bố về sự ngang bằng do nhà cung cấp báo cáo, không phải là các bảng điểm được xác minh độc lập. Theo trang phát hành của Sakana, Fugu Ultra "đứng ngang hàng với các mô hình hàng đầu như Fable 5 và Mythos Preview" trong các tác vụ kỹ thuật, khoa học và suy luận, và Fugu "liên tục vượt trội" Gemini 3.1 Pro, Opus 4.8 và GPT 5.5 trên một tập hợp các ứng dụng được đặt tên. Điều đáng hiểu trước khi bạn đọc bất kỳ con số nào: Fugu là một công cụ điều phối gọi các mô hình tiên tiến của các nhà cung cấp khác, vì vậy kết quả của nó không phải là chiến thắng của một mô hình đơn lẻ như Fable 5.
Fugu thực sự là gì, và tại sao nó thay đổi cách bạn đọc điểm chuẩn
Fugu không phải là một mô hình nền tảng đơn lẻ. Nó là một hệ thống điều phối đa tác nhân được trình bày như một mô hình duy nhất đằng sau một API tương thích OpenAI. Sakana mô tả nó là một mô hình ngôn ngữ được đào tạo chuyên về ủy quyền, giao tiếp tác nhân và tổng hợp công việc. Nó điều phối động nhiều LLM, bao gồm các phiên bản đệ quy của chính nó, và quyết định xem nên trả lời trực tiếp hay tập hợp một nhóm. Tiêu đề phát hành là "Một mô hình để chỉ huy tất cả."
Chi tiết thiết kế đó là toàn bộ câu chuyện về điểm chuẩn. Khi một mô hình bình thường đăng điểm, con số đó phản ánh chính các trọng số của mô hình đó đang thực hiện công việc. Khi Fugu đăng điểm, con số đó có thể phản ánh việc Fugu gọi Opus 4.8, hoặc GPT 5.5, hoặc Gemini 3.1 Pro, sau đó tổng hợp các đầu ra của chúng. Vì vậy, kết quả "đánh bại Opus 4.8" có thể đến từ một hệ thống gọi Opus và kết hợp nó với các mô hình khác. Đó là kết quả của một mô hình-của-các-mô hình, không phải là kết quả của một mô hình đơn lẻ. Nếu bạn muốn bối cảnh kiến trúc sâu hơn, phần giải thích của chúng tôi về Sakana Fugu là gì sẽ đi sâu vào vòng lặp điều phối.
Tuyên bố về sự ngang bằng: “ngang hàng với Fable 5 và Mythos Preview”
Đây là tuyên bố đầu tiên, được nêu một cách cẩn thận.
Theo Sakana, Fugu Ultra "đứng ngang hàng với các mô hình hàng đầu như Fable 5 và Mythos Preview" trên các điểm chuẩn kỹ thuật, khoa học và suy luận. Hãy đọc động từ. Đây là một tuyên bố về sự ngang bằng, không phải là tuyên bố "đánh bại". Sakana đang định vị Fugu Ultra là một đối thủ hàng đầu, chứ không phải là người dẫn đầu.
Hai điều đáng lưu ý.
Đầu tiên, đối thủ được nhắc đến là "Mythos Preview," mô hình tiên tiến tháng Tư mà Anthropic mô tả là quá nguy hiểm để phát hành. Nó không phải là Mythos 5 hiện có sẵn rộng rãi. Nếu bạn đã đọc về mô hình lớp Mythos, bạn sẽ biết Preview và dòng sản phẩm đã ra mắt là những hiện vật khác nhau. Việc gắn tuyên bố ngang bằng với Preview thay vì mô hình hiện tại là một lựa chọn, và nó quan trọng đối với mức độ ấn tượng của tuyên bố.
Thứ hai, không có bảng điểm chuẩn nào hỗ trợ điều này dưới dạng mà bất kỳ ai ngoài Sakana có thể chạy lại. Tuyên bố là định tính trên trang phát hành. Không có phương pháp luận được công bố, không có lưới điểm theo từng tác vụ, và không có sự tái tạo của bên thứ ba. Hãy coi "ngang hàng" là một cách trình bày của nhà cung cấp về kết quả nội bộ của chính họ.
Tuyên bố mạnh mẽ hơn: “liên tục vượt trội” trên các ứng dụng được đặt tên
Sakana đưa ra một tuyên bố thứ hai, táo bạo hơn, và đáng để tách biệt khỏi tuyên bố đầu tiên.
Theo Sakana, Fugu "liên tục vượt trội" ba đối thủ cạnh tranh đã được cấu hình trên một danh sách ứng dụng cụ thể:
- Gemini 3.1 Pro (cao)
- Opus 4.8 (tối đa)
- GPT 5.5 (rất cao)
Các ứng dụng được đặt tên là AutoResearch, Rubik’s Cube, Mechanical Design, Japanese Handwriting Analysis, One-Shot Chess và Financial Time Series Prediction.
Đây là hiệu suất cấp ứng dụng, không phải là một bộ điểm chuẩn học thuật tiêu chuẩn. Đây là các tác vụ đầu cuối mà một hệ thống điều phối có thể tỏa sáng, bởi vì nó có thể định tuyến các vấn đề phụ đến bất kỳ mô hình cơ bản nào xử lý chúng tốt nhất và sau đó ghép nối các kết quả lại với nhau. Đó chính là nơi một người điều khiển nên đánh bại bất kỳ người chơi đơn lẻ nào.
Nhưng hãy áp dụng nguyên tắc trung thực một lần nữa. Một số đối thủ cạnh tranh đó là các mô hình mà Fugu có thể gọi. Kết quả "đánh bại Opus 4.8 (tối đa)" trên AutoResearch có thể là Fugu gọi Opus, gọi các mô hình khác và tổng hợp một câu trả lời kết hợp mạnh mẽ hơn. Đó là một khả năng thực sự, và nó có thể thực sự giúp bạn. Nó không phải là bằng chứng cho thấy một mô hình Sakana duy nhất vượt trội hơn Opus về khả năng suy luận. Đừng bao giờ đọc những con số này như một chiến thắng của một mô hình đơn lẻ, và đừng bao giờ diễn đạt nó là "Fugu đánh bại Fable 5," bởi vì Sakana thậm chí không tuyên bố điều đó. Tuyên bố ngang bằng và tuyên bố vượt trội nhắm đến các đối thủ khác nhau.
Tại sao những con số này chưa thể được xác minh độc lập
Chưa có sự sao chép độc lập. Mọi con số điểm chuẩn Fugu trên trang này đều do nhà cung cấp báo cáo, được đo trên thiết lập riêng của Sakana, với cấu hình đối thủ cạnh tranh mà Sakana đã chọn (các cài đặt nỗ lực "cao," "tối đa," và "rất cao"). Tính đến ngày 22-06-2026, chưa có bên thứ ba nào chạy lại các tác vụ này, chưa có lưới điểm theo từng tác vụ nào được công bố, và chưa có bộ công cụ đánh giá nào được phát hành. Thái độ đúng đắn là coi tất cả đều là tuyên bố, không phải là một phép đo.
Đây không phải là một lời chỉ trích riêng đối với Sakana. Đó là trạng thái mặc định cho bất kỳ mô hình nào vào ngày ra mắt. Điểm khác biệt với Fugu là thiết kế điều phối làm cho việc sao chép độc lập trở nên khó khăn hơn, chứ không phải dễ dàng hơn.
Để tái tạo điểm chuẩn của một mô hình đơn lẻ, bạn cần mô hình và bài kiểm tra. Để tái tạo của Fugu, bạn cần Fugu cộng với quyền truy cập vào mọi mô hình cơ bản mà nó định tuyến đến, ở cùng phiên bản và cài đặt nỗ lực, cộng với cùng cấu trúc điều phối mà Sakana đã chạy. Hệ thống "định tuyến động" xung quanh các hạn chế của nhà cung cấp và điều chỉnh cấu trúc tác nhân của nó theo từng tác vụ, vì vậy hai lần chạy cùng một lời nhắc thậm chí có thể không sử dụng cùng một đội nội bộ. Khả năng thích ứng đó là một tính năng cho người dùng và là một cơn đau đầu cho khả năng tái tạo.
Vì vậy, bạn sẽ không tìm thấy các bảng so sánh trực tiếp rõ ràng ở đây, và bạn nên nghi ngờ bất kỳ con số "Fugu đạt X điểm" nào đang lan truyền từ các nguồn thứ cấp. Một số bài viết thứ cấp đó đặt tên sai phiên bản đối thủ (ví dụ, Mythos hiện tại thay vì Mythos Preview). Một trạng thái không có con số nào là kết quả trung thực ngay bây giờ. So sánh Fugu Ultra vs Fable 5 vs Mythos của chúng tôi vẫn mang tính định tính vì lý do tương tự.
Các hồ sơ nghiên cứu đằng sau các tuyên bố
Tiếp thị của Sakana dựa trên nghiên cứu thực tế, có thể trích dẫn. Hai bài báo ICLR 2026 mô tả dòng dõi. Không bài nào được khẳng định là điểm chuẩn sản phẩm, vì vậy hãy đọc chúng như các hồ sơ nghiên cứu, chứ không phải bảng thông số kỹ thuật Fugu.
Đầu tiên là Trinity, “Một Điều phối viên LLM tiến hóa” (arXiv:2512.04695). Trinity là một điều phối viên dưới 20.000 tham số được tối ưu hóa bằng cách tiến hóa không đạo hàm, với các vai trò Thinker, Worker và Verifier. Nó nhỏ gọn và tiến hóa, không được đào tạo bằng cách giảm gradient.
Thứ hai là Conductor, “Học cách điều phối tác nhân bằng ngôn ngữ tự nhiên” (arXiv:2512.04388). Conductor là một mô hình 7B được đào tạo bằng học tăng cường, học cấu trúc giao tiếp giữa các tác nhân. Bài báo tuyên bố nó đánh bại Mixture-of-Agents với chi phí thấp hơn.
Đây là các phương pháp khác nhau và kích thước khác nhau. Trinity sử dụng tiến hóa ở dưới 20K tham số. Conductor sử dụng RL ở 7B tham số. Đừng lẫn lộn chúng. Và đừng cho rằng các thông số kỹ thuật chính xác của một trong hai bài báo mô tả sản phẩm đã xuất xưởng. Việc ánh xạ con số 7B, hoặc bất kỳ mô hình cơ sở cụ thể nào, vào Fugu đã phát hành là suy luận của bên thứ ba. Bản phát hành chính thức không đưa ra số lượng tham số sản phẩm.
Phụ lục thông số kỹ thuật để tham khảo cùng với các tuyên bố
Đây là những gì được xác định một cách hợp lý so với những gì vẫn chưa được xác nhận. Hãy coi dòng kiến trúc là chưa được xác minh.
| Mục | Sakana / các nguồn nói gì | Độ tin cậy |
|---|---|---|
| Loại hệ thống | Bộ điều phối đa tác nhân đằng sau một mô hình | Được nêu trên trang phát hành |
| Các biến thể | Fugu (cân bằng, độ trễ thấp) và Fugu Ultra (chất lượng tối đa) | Được nêu trên trang phát hành |
| Tên phiên bản beta cũ | Biến thể nhỏ được gọi là "Fugu Mini" trong bản beta và báo chí | Lịch sử |
| Bề mặt API | Một điểm cuối tương thích OpenAI, cả hai biến thể | Được nêu trên trang phát hành |
| Các mô hình cơ bản | Gọi nhiều LLM tiên tiến, bao gồm cả chính nó một cách đệ quy | Được nêu trên trang phát hành |
| Số lượng tham số sản phẩm | Chưa được công bố; thông số cụ thể 7B / Conductor là suy luận của bên thứ ba | [XÁC MINH] |
| Phương pháp điểm chuẩn | Do nhà cung cấp báo cáo, thiết lập riêng của Sakana, chưa phát hành bộ công cụ đánh giá | [XÁC MINH] |
Lưu ý về tên đáng được nhắc lại một lần nữa: biến thể nhỏ được gọi là "Fugu Mini" trong giai đoạn beta khoảng 500 người dùng bắt đầu vào khoảng ngày 24-25 tháng 4 năm 2026. Trang phát hành sử dụng "Fugu" và "Fugu Ultra." Hãy dùng các tên hiện tại.
Điều này có ý nghĩa gì đối với việc thử nghiệm của riêng bạn
Bạn không thể xác minh các điểm chuẩn của Sakana. Bạn có thể tự chạy các điểm chuẩn của riêng mình.
Vì Fugu sử dụng giao thức hoàn thành trò chuyện của OpenAI, bạn có thể hướng một client OpenAI hiện có đến URL cơ sở của Fugu và gửi các tác vụ thực tế của mình. Không cần di chuyển SDK. URL cơ sở không được công bố trên bất kỳ trang công khai nào tính đến ngày 22-06-2026, vì vậy hãy sao chép nó từ bảng điều khiển của bạn tại console.sakana.ai và đừng bao giờ tin tưởng một máy chủ được tạo ra. Mẫu bên dưới phản ánh yêu cầu hoàn thành trò chuyện OpenAI tiêu chuẩn:
from openai import OpenAI
# Sao chép URL cơ sở thực tế từ console.sakana.ai sau khi bạn đăng nhập.
client = OpenAI(
api_key="YOUR_FUGU_API_KEY",
base_url="<YOUR_FUGU_BASE_URL_FROM_CONSOLE>",
)
resp = client.chat.completions.create(
model="fugu-ultra", # 'fugu' cho biến thể cân bằng; id được báo cáo, xác minh trong console
messages=[
{"role": "system", "content": "Bạn là một người đánh giá mã chính xác."},
{"role": "user", "content": "Xem xét chức năng này để tìm các vấn đề bảo mật:\n<dán mã>"},
],
)
print(resp.choices[0].message.content)
Các chuỗi ID mô hình được báo cáo cho đến nay là fugu và fugu-ultra, có thể có dạng có ngày tháng. Xác nhận ID chính xác trong bảng điều khiển thay vì mã hóa một ID vào cấu hình của bạn. Vì Fugu quyết định mỗi yêu cầu liệu có trả lời trực tiếp hay tập hợp một nhóm, cùng một lời nhắc có thể tạo ra độ trễ và chi phí khác nhau trong các lần chạy khác nhau. Hãy ghi lại cả hai.
Đây là lúc việc tự chạy đánh giá của riêng bạn trở nên quan trọng hơn bình thường. Hãy gửi các tác vụ mà bạn thực sự quan tâm, không phải AutoResearch hay cờ vua một lần chơi, và đo lường độ trễ, chi phí và chất lượng đầu ra so với các mô hình đơn lẻ mà bạn đã sử dụng. Các điểm chuẩn của nhà cung cấp cho bạn biết Sakana đã đo lường gì. Các lần chạy của riêng bạn cho bạn biết bạn sẽ nhận được gì.
Điều này phù hợp với quy trình làm việc Apidog của bạn như thế nào
Bạn không cần một công cụ mới để kiểm tra các tuyên bố điểm chuẩn của nhà cung cấp. Bạn cần một cách để gửi cùng một lời nhắc đến nhiều điểm cuối và so sánh các phản hồi cạnh nhau.

Apidog cho phép bạn đăng ký điểm cuối Fugu dưới dạng API tương thích OpenAI, lưu các lời nhắc đánh giá thực tế của bạn dưới dạng yêu cầu và chạy chúng như một kịch bản kiểm tra. Đặt Fugu, Fable 5 và điểm cuối Opus trong cùng một môi trường, gửi các đầu vào giống hệt nhau và ghi lại đầu ra, mã trạng thái, độ trễ và mức sử dụng token ở một nơi. Đó là một so sánh hữu ích hơn nhiều so với một tuyên bố ngang bằng không có phương pháp luận đằng sau. Khi bạn muốn theo dõi sự thay đổi chi phí từ định tuyến thích ứng của Fugu, các xác nhận về thời gian phản hồi và số lượng token sẽ hiển thị nó trong mỗi lần chạy. Tải xuống Apidog và xây dựng so sánh một lần, sau đó chạy lại bất cứ khi nào một phiên bản mô hình mới được phát hành.
Các câu hỏi thường gặp
Fugu có đánh bại Fable 5 trên các điểm chuẩn không?
Không, và Sakana chưa bao giờ tuyên bố điều đó. Tuyên bố là ngang bằng: Fugu Ultra "đứng ngang hàng với" Fable 5 và Mythos Preview, theo Sakana. Tuyên bố "vượt trội" riêng biệt nhắm vào Gemini 3.1 Pro, Opus 4.8 và GPT 5.5 trên các ứng dụng cụ thể, không phải Fable 5. Để xem mặt so sánh mô hình đơn lẻ đó, hãy xem các điểm chuẩn Claude Fable 5.
Các con số điểm chuẩn Fugu có được xác minh độc lập không?
Không. Tính đến ngày 22-06-2026, mọi con số đều do nhà cung cấp báo cáo trên thiết lập riêng của Sakana, với các cài đặt nỗ lực của đối thủ cạnh tranh mà Sakana đã chọn. Chưa có bên thứ ba nào chạy lại các tác vụ, và chưa có bộ công cụ đánh giá nào được công bố. Hãy coi các tuyên bố là tuyên bố cho đến khi ai đó ngoài Sakana tái tạo chúng.
Tại sao việc Fugu là một công cụ điều phối lại quan trọng?
Bởi vì Fugu gọi các mô hình tiên tiến của các nhà cung cấp khác, bao gồm cả chính nó một cách đệ quy, kết quả "đánh bại Opus 4.8" có thể đến từ Fugu gọi Opus và tổng hợp. Đó là chiến thắng của một mô hình-của-các-mô hình, không phải là chiến thắng của một mô hình đơn lẻ. Fable 5 và dòng Mythos là các mô hình Anthropic đơn lẻ, điều này khiến việc so sánh trực tiếp trở thành một sự so sánh không tương xứng.
Sakana đã so sánh với Mythos nào?
Mythos Preview cũ hơn từ tháng 4, mô hình tiên tiến mà Anthropic mô tả là quá nguy hiểm để phát hành, không phải Mythos 5 hiện tại. Một số bài viết thứ cấp đặt tên sai phiên bản. Phần giải thích về lớp Mythos bao gồm sự khác biệt giữa Preview và dòng sản phẩm đã xuất xưởng.
Sự khác biệt giữa Trinity và Conductor là gì?
Chúng là hai bài báo ICLR 2026 riêng biệt. Trinity (arXiv:2512.04695) là một điều phối viên dưới 20.000 tham số được tối ưu hóa bằng tiến hóa. Conductor (arXiv:2512.04388) là một mô hình 7B được đào tạo bằng học tăng cường. Các phương pháp khác nhau, kích thước khác nhau. Không bài nào được khẳng định là bảng thông số kỹ thuật của sản phẩm đã xuất xưởng.
Làm cách nào tôi có thể tự kiểm tra hiệu suất của Fugu?
Hướng một client tương thích OpenAI đến URL cơ sở của Fugu từ console.sakana.ai, gửi các tác vụ của riêng bạn và đo lường chất lượng, độ trễ và chi phí. Đăng ký điểm cuối trong Apidog để so sánh Fugu với các mô hình đơn lẻ mà bạn đã sử dụng, với các lời nhắc giống hệt nhau và các chỉ số được ghi lại.
