Sakana Fugu Benchmark: Apa Arti Sebenarnya Bersanding dengan Fable 5

Tolok ukur Fugu Sakana adalah klaim kesetaraan yang dilaporkan vendor, bukan skor yang terverifikasi. Lihat apa yang dikatakan setiap klaim, siapa yang mengatakannya, dan mengapa itu tidak terbukti.

INEZA Felin-Michel

INEZA Felin-Michel

22 June 2026

Sakana Fugu Benchmark: Apa Arti Sebenarnya Bersanding dengan Fable 5

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Benchmark Fugu dari Sakana adalah klaim kesetaraan yang dilaporkan oleh vendor, bukan kartu skor yang diverifikasi secara independen. Menurut halaman rilis Sakana, Fugu Ultra “sejajar dengan model-model terkemuka seperti Fable 5 dan Mythos Preview” dalam tugas-tugas rekayasa, ilmiah, dan penalaran, dan Fugu “secara konsisten mengungguli” Gemini 3.1 Pro, Opus 4.8, dan GPT 5.5 pada serangkaian aplikasi yang disebutkan. Hal penting yang perlu dipahami sebelum Anda membaca angka apa pun: Fugu adalah orkestrator yang memanggil model-model frontier vendor lain, sehingga hasilnya bukanlah kemenangan model tunggal seperti yang dicapai Fable 5.

button

Apa Sebenarnya Fugu, dan Mengapa Itu Mengubah Cara Anda Membaca Benchmark

Fugu bukanlah model dasar tunggal. Ini adalah sistem orkestrasi multi-agen yang disajikan sebagai satu model di balik satu API yang kompatibel dengan OpenAI. Sakana menggambarkannya sebagai model bahasa terlatih yang berspesialisasi dalam delegasi, komunikasi agen, dan sintesis pekerjaan. Ini secara dinamis mengkoordinasikan beberapa LLM, termasuk instansi rekursif dari dirinya sendiri, dan memutuskan apakah akan menjawab langsung atau membentuk tim. Judul rilisnya adalah “Satu Model untuk Memerintah Semuanya.”

Detail desain tersebut adalah keseluruhan cerita untuk benchmark. Ketika model normal memposting skor, angka tersebut mencerminkan bobot model itu sendiri yang melakukan pekerjaan. Ketika Fugu memposting skor, angka tersebut mungkin mencerminkan Fugu memanggil Opus 4.8, atau GPT 5.5, atau Gemini 3.1 Pro, kemudian mensintesis keluarannya. Jadi, hasil “mengalahkan Opus 4.8” bisa berasal dari sistem yang memanggil Opus dan menggabungkannya dengan model lain. Itu adalah hasil model-dari-model, bukan hasil model tunggal. Jika Anda ingin konteks arsitektur yang lebih dalam, penjelasan kami tentang Sakana Fugu membahas siklus orkestrasi.

Klaim Kesetaraan: “sejajar dengan Fable 5 dan Mythos Preview”

Berikut adalah klaim pertama, dinyatakan dengan hati-hati.

Menurut Sakana, Fugu Ultra “sejajar dengan model-model terkemuka seperti Fable 5 dan Mythos Preview” di seluruh benchmark rekayasa, ilmiah, dan penalaran. Perhatikan kata kerjanya. Ini adalah klaim kesetaraan, bukan klaim “mengalahkan”. Sakana memposisikan Fugu Ultra sebagai rekan terdepan, bukan pemimpin terdepan.

Dua hal patut diberi perhatian.

Pertama, saingan yang disebutkan adalah “Mythos Preview,” model frontier April yang digambarkan Anthropic sebagai terlalu berbahaya untuk dirilis. Ini bukan Mythos 5 yang saat ini tersedia secara umum. Jika Anda telah membaca tentang model kelas Mythos, Anda tahu bahwa Preview dan versi yang dirilis adalah artefak yang berbeda. Mengaitkan klaim kesetaraan dengan Preview daripada model saat ini adalah sebuah pilihan, dan ini penting untuk seberapa mengesankannya klaim tersebut.

Kedua, tidak ada tabel benchmark yang mendukung hal ini dalam bentuk yang dapat dijalankan kembali oleh siapa pun di luar Sakana. Klaim ini bersifat kualitatif pada halaman rilis. Tidak ada metodologi yang diterbitkan, tidak ada kisi skor per tugas, dan tidak ada reproduksi oleh pihak ketiga. Perlakukan “sejajar” sebagai kerangka vendor untuk hasil internalnya sendiri.

Klaim yang Lebih Kuat: “secara konsisten mengungguli” pada aplikasi yang disebutkan

Sakana membuat klaim kedua yang lebih berani, dan patut dipisahkan dari yang pertama.

Menurut Sakana, Fugu “secara konsisten mengungguli” tiga pesaing yang dikonfigurasi pada daftar aplikasi tertentu:

Aplikasi yang disebutkan adalah AutoResearch, Rubik’s Cube, Mechanical Design, Japanese Handwriting Analysis, One-Shot Chess, dan Financial Time Series Prediction.

Ini adalah kinerja tingkat aplikasi, bukan rangkaian benchmark akademik standar. Ini adalah tugas ujung-ke-ujung di mana sistem orkestrasi memiliki ruang untuk bersinar, karena dapat mengarahkan sub-masalah ke model dasar mana pun yang menanganinya dengan terbaik dan kemudian menggabungkan hasilnya. Di sinilah seorang konduktor harus mengalahkan pemain tunggal mana pun.

Namun, terapkan prinsip kejujuran ini lagi. Beberapa dari pesaing tersebut adalah model yang dapat dipanggil Fugu. Hasil “mengalahkan Opus 4.8 (maks)” pada AutoResearch mungkin berasal dari Fugu yang memanggil Opus, memanggil model lain, dan mensintesis jawaban gabungan yang lebih kuat. Itu adalah kemampuan nyata, dan mungkin benar-benar membantu Anda. Itu bukan bukti bahwa satu model Sakana mengalahkan penalaran Opus. Jangan pernah membaca angka-angka ini sebagai kemenangan model tunggal, dan jangan pernah mengatakannya sebagai “Fugu mengalahkan Fable 5,” karena Sakana bahkan tidak mengklaim itu. Klaim kesetaraan dan klaim kinerja unggul menargetkan saingan yang berbeda.

Mengapa angka-angka ini belum dapat diverifikasi secara independen

Belum ada replikasi independen. Setiap angka benchmark Fugu pada halaman ini dilaporkan oleh vendor, diukur pada pengaturan Sakana sendiri, dengan konfigurasi pesaing yang dipilih Sakana (pengaturan upaya “tinggi,” “maks,” dan “sangat tinggi”). Per 22-06-2026, tidak ada pihak ketiga yang menjalankan kembali tugas-tugas ini, tidak ada kisi skor per tugas yang diterbitkan, dan tidak ada kerangka evaluasi yang dirilis. Sikap yang benar adalah memperlakukan semua ini sebagai klaim, bukan pengukuran.

Ini bukan kritik khusus terhadap Sakana. Ini adalah kondisi standar untuk model apa pun pada hari peluncuran. Perbedaannya dengan Fugu adalah desain orkestrasi membuat replikasi independen menjadi lebih sulit, bukan lebih mudah.

Untuk mereproduksi benchmark model tunggal, Anda memerlukan model dan uji coba tersebut. Untuk mereproduksi Fugu, Anda memerlukan Fugu ditambah akses ke setiap model dasar yang menjadi rutenya, dengan versi dan pengaturan upaya yang sama, ditambah topologi orkestrasi yang sama yang dijalankan Sakana. Sistem ini “secara dinamis mengarahkan” batasan penyedia dan mengadaptasi topologi agennya per tugas, sehingga dua kali jalankan prompt yang sama mungkin bahkan tidak menggunakan tim internal yang sama. Adaptabilitas itu adalah fitur bagi pengguna dan masalah besar untuk reproduksibilitas.

Jadi, Anda tidak akan menemukan tabel perbandingan langsung yang bersih di sini, dan Anda harus skeptis terhadap angka “Fugu mencetak X” yang beredar dari sumber sekunder. Beberapa tulisan sekunder tersebut menyebutkan versi saingan yang salah (misalnya, Mythos saat ini alih-alih Mythos Preview). Keadaan tanpa angka adalah hasil yang jujur saat ini. Perbandingan Fugu Ultra vs Fable 5 vs Mythos kami tetap kualitatif karena alasan yang sama.

Catatan Penelitian di Balik Klaim

Pemasaran Sakana didasarkan pada penelitian nyata yang dapat dikutip. Dua makalah ICLR 2026 menjelaskan silsilahnya. Tidak ada yang ditegaskan sebagai benchmark produk, jadi bacalah sebagai catatan penelitian, bukan lembar spesifikasi Fugu.

Yang pertama adalah Trinity, “Koordinator LLM yang Berevolusi” (arXiv:2512.04695). Trinity adalah koordinator dengan kurang dari 20.000 parameter yang dioptimalkan oleh evolusi bebas-derivatif, dengan peran Thinker, Worker, dan Verifier. Ini kecil dan berevolusi, tidak dilatih dengan penurunan gradien.

Yang kedua adalah Conductor, “Belajar Mengorkestrasi Agen dalam Bahasa Alami” (arXiv:2512.04388). Conductor adalah model 7B yang dilatih dengan pembelajaran penguatan yang mempelajari struktur komunikasi antar agen. Makalah ini mengklaim bahwa ini mengungguli Mixture-of-Agents dengan biaya lebih rendah.

Ini adalah metode dan ukuran yang berbeda. Trinity menggunakan evolusi pada parameter di bawah 20K. Conductor menggunakan RL pada parameter 7B. Jangan mencampuradukkan keduanya. Dan jangan berasumsi bahwa spesifikasi persis dari salah satu makalah menggambarkan produk yang dikirimkan. Memetakan angka 7B, atau model dasar spesifik apa pun, ke Fugu yang dirilis adalah inferensi pihak ketiga. Rilis resmi tidak memberikan jumlah parameter produk.

Catatan Samping Spesifikasi untuk Mendukung Klaim

Berikut adalah apa yang cukup mapan versus apa yang masih belum dikonfirmasi. Perlakukan garis arsitektur sebagai belum diverifikasi.

Item Apa yang dikatakan Sakana / sumber Kepercayaan
Jenis sistem Orkestrator multi-agen di balik satu model Disebutkan pada halaman rilis
Varian Fugu (seimbang, latensi rendah) dan Fugu Ultra (kualitas maks) Disebutkan pada halaman rilis
Nama beta lama Varian kecil disebut “Fugu Mini” dalam beta dan pers Historis
Permukaan API Satu endpoint yang kompatibel dengan OpenAI, kedua varian Disebutkan pada halaman rilis
Model dasar Memanggil beberapa LLM frontier, termasuk dirinya sendiri secara rekursif Disebutkan pada halaman rilis
Jumlah parameter produk Tidak diterbitkan; spesifikasi 7B / Conductor adalah inferensi pihak ketiga [VERIFIKASI]
Metodologi benchmark Dilaporkan vendor, pengaturan Sakana sendiri, tidak ada kerangka kerja yang dirilis [VERIFIKASI]

Catatan penamaan ini layak diulang sekali: varian kecil disebut “Fugu Mini” selama beta sekitar 500 pengguna yang dibuka sekitar 24-25 April 2026. Halaman rilis menggunakan “Fugu” dan “Fugu Ultra.” Gunakan nama-nama saat ini.

Apa Artinya Ini untuk Pengujian Anda Sendiri

Anda tidak dapat memverifikasi benchmark Sakana. Anda dapat menjalankan sendiri.

Karena Fugu menggunakan protokol chat-completions OpenAI, Anda mengarahkan klien OpenAI yang ada ke URL dasar Fugu dan mengirimkan tugas-tugas Anda yang sebenarnya. Tidak ada migrasi SDK. URL dasar tidak diterbitkan di halaman publik mana pun per 22-06-2026, jadi salin dari konsol Anda di console.sakana.ai dan jangan pernah percaya host buatan. Pola di bawah ini meniru permintaan penyelesaian obrolan OpenAI standar:

from openai import OpenAI

# Salin URL dasar yang sebenarnya dari console.sakana.ai setelah Anda masuk.
client = OpenAI(
    api_key="YOUR_FUGU_API_KEY",
    base_url="<YOUR_FUGU_BASE_URL_FROM_CONSOLE>",
)

resp = client.chat.completions.create(
    model="fugu-ultra",  # 'fugu' untuk varian seimbang; ID yang dilaporkan, verifikasi di konsol
    messages=[
        {"role": "system", "content": "You are a precise code reviewer."},
        {"role": "user", "content": "Review this function for security issues:\n<paste code>"},
    ],
)

print(resp.choices[0].message.content)

String ID model yang dilaporkan sejauh ini adalah fugu dan fugu-ultra, mungkin dengan format tanggal. Konfirmasikan ID yang tepat di konsol daripada menanamkannya ke dalam konfigurasi Anda. Karena Fugu memutuskan per permintaan apakah akan menjawab langsung atau membentuk tim, prompt yang sama dapat menghasilkan latensi dan biaya yang berbeda pada eksekusi yang berbeda. Catat keduanya.

Di sinilah menjalankan evaluasi Anda sendiri lebih penting dari biasanya. Kirim tugas-tugas yang benar-benar Anda pedulikan, bukan AutoResearch atau catur sekali jalan, dan ukur latensi, biaya, dan kualitas keluaran terhadap model tunggal yang sudah Anda gunakan. Benchmark vendor memberi tahu Anda apa yang diukur Sakana. Eksekusi Anda sendiri memberi tahu Anda apa yang akan Anda dapatkan.

Bagaimana Ini Sesuai dengan Alur Kerja Apidog Anda

Anda tidak memerlukan alat baru untuk menguji klaim benchmark vendor. Anda memerlukan cara untuk mengirim prompt yang sama ke beberapa endpoint dan membandingkan responsnya secara berdampingan.

Apidog memungkinkan Anda mendaftarkan endpoint Fugu sebagai API yang kompatibel dengan OpenAI, menyimpan prompt evaluasi Anda yang sebenarnya sebagai permintaan, dan menjalankannya sebagai skenario uji. Tempatkan Fugu, Fable 5, dan endpoint Opus di lingkungan yang sama, kirim input identik, dan tangkap keluarannya, kode status, latensi, serta penggunaan token di satu tempat. Itu adalah perbandingan yang jauh lebih berguna daripada klaim kesetaraan tanpa metodologi di baliknya. Ketika Anda ingin melacak pergeseran biaya dari perutean adaptif Fugu, penegasan pada waktu respons dan jumlah token akan menampilkannya setiap kali dijalankan. Unduh Apidog dan bangun perbandingan sekali, lalu jalankan kembali setiap kali versi model baru dirilis.

button

Pertanyaan yang Sering Diajukan

Apakah Fugu mengalahkan Fable 5 dalam benchmark?

Tidak, dan Sakana tidak pernah mengklaim itu. Klaimnya adalah kesetaraan: Fugu Ultra “sejajar dengan” Fable 5 dan Mythos Preview, menurut Sakana. Klaim “mengungguli” yang terpisah menargetkan Gemini 3.1 Pro, Opus 4.8, dan GPT 5.5 pada aplikasi tertentu, bukan Fable 5. Untuk sisi perbandingan model tunggal tersebut, lihat benchmark Fable 5 Claude.

Apakah angka benchmark Fugu diverifikasi secara independen?

Tidak. Per 22-06-2026, setiap angka dilaporkan oleh vendor pada pengaturan Sakana sendiri, dengan pengaturan upaya pesaing yang dipilih Sakana. Tidak ada pihak ketiga yang menjalankan kembali tugas-tugas tersebut, dan tidak ada kerangka evaluasi yang diterbitkan. Perlakukan klaim tersebut sebagai klaim sampai seseorang di luar Sakana mereproduksinya.

Mengapa penting bahwa Fugu adalah orkestrator?

Karena Fugu memanggil model-model frontier vendor lain, termasuk dirinya sendiri secara rekursif, hasil “mengalahkan Opus 4.8” mungkin berasal dari Fugu yang memanggil Opus dan mensintesisnya. Itu adalah kemenangan model-dari-model, bukan kemenangan model tunggal. Fable 5 dan lini Mythos adalah model Anthropic tunggal, yang membuat perbandingan langsung menjadi tidak sebanding.

Mythos mana yang dibandingkan oleh Sakana?

Mythos Preview yang lebih lama dari April, model frontier yang digambarkan Anthropic sebagai terlalu berbahaya untuk dirilis, bukan Mythos 5 saat ini. Beberapa tulisan sekunder menyebutkan versi yang salah. Penjelasan kelas Mythos mencakup perbedaan antara Preview dan versi yang dirilis.

Apa perbedaan antara Trinity dan Conductor?

Mereka adalah dua makalah ICLR 2026 yang terpisah. Trinity (arXiv:2512.04695) adalah koordinator dengan kurang dari 20.000 parameter yang dioptimalkan oleh evolusi. Conductor (arXiv:2512.04388) adalah model 7B yang dilatih dengan pembelajaran penguatan. Metode yang berbeda, ukuran yang berbeda. Tidak ada yang ditegaskan sebagai lembar spesifikasi produk yang dikirimkan.

Bagaimana saya bisa menguji kinerja Fugu sendiri?

Arahkan klien yang kompatibel dengan OpenAI ke URL dasar Fugu dari console.sakana.ai, kirim tugas Anda sendiri, dan ukur kualitas, latensi, serta biaya. Daftarkan endpoint di Apidog untuk membandingkan Fugu dengan model tunggal yang sudah Anda gunakan, dengan prompt identik dan metrik yang terekam.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.