معايير أداء ساكانا فوجو: ماذا يعني أن يضاهي فيبل 5؟

مقاييس أداء فوغو (Fugu) الخاصة بساكانا (Sakana) هي ادعاءات تكافؤ مقدمة من البائع، وليست نتائجًا مؤكدة. اطلع على ما تقوله كل دعوى، ومن صرح بها، ولماذا هي غير مثبتة.

INEZA Felin-Michel

INEZA Felin-Michel

22 يونيو 2026

معايير أداء ساكانا فوجو: ماذا يعني أن يضاهي فيبل 5؟

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

معايير Fugu من Sakana هي ادعاءات تكافؤ أبلغ عنها البائع، وليست بطاقات أداء تم التحقق منها بشكل مستقل. وفقًا لصفحة إصدار Sakana، فإن Fugu Ultra "يقف كتفًا بكتف مع النماذج الرائدة مثل Fable 5 وMythos Preview" في مهام الهندسة والعلوم والاستدلال، وأن Fugu "يتفوق باستمرار" على Gemini 3.1 Pro وOpus 4.8 وGPT 5.5 في مجموعة محددة من التطبيقات. النقطة الجديرة بالفهم قبل قراءة أي رقم: Fugu هو منسق يستدعي نماذج متطورة من بائعين آخرين، لذا فإن نتائجه ليست انتصارات لنموذج واحد بالطريقة التي هي عليها نتائج Fable 5.

زر

ما هو Fugu حقًا، ولماذا يغير طريقة قراءتك للمعايير

Fugu ليس نموذجًا أساسيًا واحدًا. إنه نظام تنسيق متعدد الوكلاء يقدم كنموذج واحد خلف واجهة برمجة تطبيقات (API) واحدة متوافقة مع OpenAI. تصفه Sakana بأنه نموذج لغوي مدرب متخصص في التفويض، واتصال الوكلاء، وتجميع العمل. ينسق ديناميكيًا نماذج لغوية كبيرة متعددة (LLMs)، بما في ذلك مثيلات متكررة لذاته، ويقرر ما إذا كان سيرد مباشرة أو سيقوم بتجميع فريق. عنوان الإصدار هو "نموذج واحد لقيادتها كلها."

هذا التفصيل التصميمي هو القصة بأكملها فيما يتعلق بالمعايير. عندما يسجل نموذج عادي نتيجة، يعكس الرقم أوزان النموذج نفسه التي تقوم بالعمل. عندما يسجل Fugu نتيجة، قد يعكس الرقم استدعاء Fugu لـ Opus 4.8، أو GPT 5.5، أو Gemini 3.1 Pro، ثم تجميع مخرجاتها. لذا فإن نتيجة "يهزم Opus 4.8" يمكن أن تأتي من نظام يستدعي Opus ويجمعه مع نماذج أخرى. هذه نتيجة لنموذج من النماذج، وليست نتيجة لنموذج واحد. إذا كنت تريد سياقًا معماريًا أعمق، فإن شرحنا لماهية Sakana Fugu يوضح حلقة التنسيق.

ادعاء التكافؤ: "كتفًا بكتف مع Fable 5 وMythos Preview"

هنا الادعاء الأول، مذكورًا بعناية.

وفقًا لـ Sakana، فإن Fugu Ultra "يقف كتفًا بكتف مع النماذج الرائدة مثل Fable 5 وMythos Preview" عبر معايير الهندسة والعلوم والاستدلال. اقرأ الفعل. هذا ادعاء تكافؤ، وليس ادعاء "هزيمة". Sakana تضع Fugu Ultra كنموذج رائد مكافئ، وليس قائدًا رائدًا.

هناك أمران يستحقان الانتباه.

أولاً، المنافس المسمى هو "Mythos Preview"، النموذج الرائد لشهر أبريل الذي وصفته Anthropic بأنه خطير للغاية بحيث لا يمكن إصداره. إنه ليس Mythos 5 الحالي المتاح بشكل عام. إذا كنت قد قرأت عن نموذج فئة Mythos، فأنت تعلم أن Preview والنسخة المشحونة هما نتاجان مختلفان. ربط ادعاء التكافؤ بـ Preview بدلاً من النموذج الحالي هو خيار، وهو مهم لمدى إثارة الإعجاب التي يتركها الادعاء.

ثانيًا، لا يوجد جدول معايير يدعم هذا بشكل يمكن لأي شخص خارج Sakana إعادة تشغيله. الادعاء نوعي في صفحة الإصدار. لا توجد منهجية منشورة، ولا شبكة نقاط لكل مهمة، ولا إعادة إنتاج من طرف ثالث. عامل "كتفًا بكتف" كتأطير من قبل البائع لنتائجه الداخلية الخاصة.

الادعاء الأقوى: "يتفوق باستمرار" في تطبيقات محددة

تقدم Sakana ادعاءً ثانيًا وأكثر جرأة، ويستحق فصله عن الأول.

وفقًا لـ Sakana، فإن Fugu "يتفوق باستمرار" على ثلاثة منافسين مهيئين في قائمة محددة من التطبيقات:

التطبيقات المذكورة هي AutoResearch، مكعب روبيك، التصميم الميكانيكي، تحليل الخط اليدوي الياباني، الشطرنج بلقطة واحدة، والتنبؤ بالسلاسل الزمنية المالية.

هذا أداء على مستوى التطبيق، وليس مجموعة معايير أكاديمية قياسية. هذه مهام شاملة (end-to-end) حيث يكون لنظام التنسيق مجال للتألق، لأنه يمكنه توجيه المشاكل الفرعية إلى النموذج الأساسي الذي يتعامل معها بشكل أفضل ثم تجميع النتائج معًا. وهذا بالضبط حيث يجب أن يتفوق القائد على أي لاعب فردي.

لكن لنتحلى بالصدق مرة أخرى. العديد من هؤلاء المنافسين هي نماذج يمكن لـ Fugu استدعاؤها. قد تكون نتيجة "يهزم Opus 4.8 (أقصى)" في AutoResearch ناتجة عن استدعاء Fugu لـ Opus، واستدعاء نماذج أخرى، وتجميع إجابة مدمجة أقوى. هذه قدرة حقيقية، وقد تساعدك بصدق. إنها ليست دليلًا على أن نموذج Sakana واحد يتفوق في الاستدلال على Opus. لا تقرأ هذه الأرقام أبدًا على أنها فوز لنموذج واحد، ولا تصغها أبدًا على أنها "Fugu يهزم Fable 5"، لأن Sakana لم تدعِ ذلك حتى. ادعاء التكافؤ وادعاء التفوق يستهدفان منافسين مختلفين.

لماذا لا يمكن التحقق من هذه الأرقام بشكل مستقل بعد

لا يوجد تكرار مستقل بعد. كل رقم من معايير Fugu في هذه الصفحة هو تقرير من البائع، وتم قياسه على إعدادات Sakana الخاصة، مع تهيئات المنافسين التي اختارتها Sakana (إعدادات الجهد "عالي" و"أقصى" و"فائق العلو"). اعتبارًا من 22 يونيو 2026، لم يُعد أي طرف ثالث تشغيل هذه المهام، ولم يتم نشر شبكة نقاط لكل مهمة، ولم يتم إصدار أي أداة تقييم. الموقف الصحيح هو التعامل مع كل هذا على أنه ادعاء، وليس قياسًا.

هذا ليس انتقادًا لـ Sakana تحديدًا. إنها الحالة الافتراضية لأي نموذج في يوم الإطلاق. الفرق مع Fugu هو أن تصميم التنسيق يجعل التكرار المستقل أكثر صعوبة، وليس أسهل.

لإعادة إنتاج معيار نموذج واحد، تحتاج إلى النموذج والاختبار. لإعادة إنتاج معايير Fugu، تحتاج إلى Fugu بالإضافة إلى الوصول إلى كل نموذج أساسي يقوم بتوجيه إليه، بنفس الإصدارات وإعدادات الجهد، بالإضافة إلى نفس طوبولوجيا التنسيق التي استخدمتها Sakana. يقوم النظام "بتجاوز" قيود المزود ديناميكيًا ويكيف طوبولوجيا وكيله لكل مهمة، لذلك قد لا يستخدم تشغيلان لنفس المطالبة نفس الفريق الداخلي. هذه القدرة على التكيف هي ميزة للمستخدمين وصداع للموثوقية.

لذلك لن تجد جداول مقارنة مباشرة واضحة هنا، ويجب أن تكون متشككًا في أي أرقام "Fugu سجل X" متداولة من مصادر ثانوية. العديد من هذه المقالات الثانوية تسمي إصدارات المنافسين الخاطئة (Mythos الحالي بدلاً من Mythos Preview، على سبيل المثال). حالة الأرقام الفارغة هي النتيجة الصادقة في الوقت الحالي. مقارنتنا بين Fugu Ultra و Fable 5 و Mythos تبقى نوعية لنفس السبب.

السجلات البحثية وراء الادعاءات

يعتمد تسويق Sakana على أبحاث حقيقية يمكن الاستشهاد بها. تصف ورقتان بحثيتان من ICLR 2026 السلالة. لا يُزعم أن أيًا منهما هو معيار للمنتج، لذا اقرأها كسجلات بحثية، وليس كصحائف مواصفات Fugu.

الأول هو Trinity، "منسق نماذج لغوية كبيرة (LLM) متطور" (arXiv:2512.04695). Trinity هو منسق بأقل من 20,000 معلمة تم تحسينه من خلال التطور الخالي من المشتقات، بأدوار المفكر والعامل والمحقق. إنه صغير ومتطور، ولم يتم تدريبه بواسطة الانحدار التدرجي.

الثاني هو Conductor، "تعلم تنسيق الوكلاء باللغة الطبيعية" (arXiv:2512.04388). Conductor هو نموذج بحجم 7B تم تدريبه بالتعلم المعزز يتعلم بنية الاتصال بين الوكلاء. تزعم الورقة أنه يتفوق على Mixture-of-Agents بتكلفة أقل.

هذه طرق مختلفة وأحجام مختلفة. يستخدم Trinity التطور بمعلمات أقل من 20 ألفًا. يستخدم Conductor التعلم المعزز (RL) بمعلمات 7B. لا تخلط بينهما. ولا تفترض أن المواصفات الدقيقة لأي من الورقتين تصف المنتج المشحون. إن ربط الرقم 7B، أو أي نموذج أساسي محدد، بـ Fugu الذي تم إصداره هو استنتاج من طرف ثالث. لا يقدم الإصدار الرسمي عدد معلمات المنتج.

ملخص المواصفات للاحتفاظ به بجانب الادعاءات

إليك ما تم تأكيده بشكل معقول مقابل ما لا يزال غير مؤكد. تعامل مع الخط المعماري على أنه غير متحقق منه.

البند ما تقوله Sakana / المصادر الثقة
نوع النظام منسق متعدد الوكلاء خلف نموذج واحد مذكور في صفحة الإصدار
المتغيرات Fugu (متوازن، زمن انتقال منخفض) و Fugu Ultra (أقصى جودة) مذكور في صفحة الإصدار
الاسم التجريبي القديم كان المتغير الصغير يسمى "Fugu Mini" في النسخة التجريبية والصحافة تاريخي
واجهة برمجة التطبيقات (API) نقطة نهاية واحدة متوافقة مع OpenAI، لكلا المتغيرين مذكور في صفحة الإصدار
النماذج الأساسية يستدعي نماذج لغوية كبيرة (LLMs) متطورة متعددة، بما في ذلك نفسه بشكل متكرر مذكور في صفحة الإصدار
عدد معلمات المنتج غير منشور؛ تفاصيل 7B / Conductor هي استنتاجات من طرف ثالث [تحقق]
منهجية المعايير أبلغ عنها البائع، إعداد Sakana الخاص، لم يتم إصدار أداة [تحقق]

ملاحظة التسمية تستحق التكرار مرة واحدة: كان المتغير الصغير يسمى "Fugu Mini" خلال النسخة التجريبية التي ضمت حوالي 500 مستخدم والتي بدأت حوالي 24-25 أبريل 2026. تستخدم صفحة الإصدار "Fugu" و "Fugu Ultra". استخدم الأسماء الحالية.

ما يعنيه هذا لاختباراتك الخاصة

لا يمكنك التحقق من معايير Sakana. ولكن يمكنك تشغيل معاييرك الخاصة.

نظرًا لأن Fugu يتحدث بروتوكول إكمال الدردشة الخاص بـ OpenAI، يمكنك توجيه عميل OpenAI موجود إلى عنوان URL الأساسي لـ Fugu وإرسال مهامك الحقيقية. لا حاجة لترحيل حزمة تطوير البرمجيات (SDK). لم يتم نشر عنوان URL الأساسي في أي صفحة عامة اعتبارًا من 22 يونيو 2026، لذا انسخه من لوحة التحكم الخاصة بك على console.sakana.ai ولا تثق أبدًا بمضيف مبتكر. النمط أدناه يعكس طلب إكمال الدردشة القياسي لـ OpenAI:

from openai import OpenAI

# انسخ عنوان URL الأساسي الحقيقي من console.sakana.ai بعد تسجيل الدخول.
client = OpenAI(
    api_key="YOUR_FUGU_API_KEY",
    base_url="<YOUR_FUGU_BASE_URL_FROM_CONSOLE>",
)

resp = client.chat.completions.create(
    model="fugu-ultra",  # 'fugu' للمتغير المتوازن؛ المعرفات المبلغ عنها، تحقق في لوحة التحكم
    messages=[
        {"role": "system", "content": "You are a precise code reviewer."},
        {"role": "user", "content": "Review this function for security issues:\n<paste code>"},
    ],
)

print(resp.choices[0].message.content)

سلاسل معرفات النموذج المبلغ عنها حتى الآن هي fugu وfugu-ultra، وربما مع شكل مؤرخ. تأكد من المعرفات الدقيقة في لوحة التحكم بدلاً من تضمين أحدها في تكوينك. نظرًا لأن Fugu يقرر لكل طلب ما إذا كان سيرد مباشرة أو سيقوم بتجميع فريق، فإن نفس المطالبة يمكن أن تنتج زمن انتقال وتكلفة مختلفين في تشغيلات مختلفة. سجل كلاهما.

هذا هو المكان الذي يصبح فيه تشغيل تقييمك الخاص أكثر أهمية من المعتاد. أرسل المهام التي تهتم بها فعليًا، وليس AutoResearch أو الشطرنج بلقطة واحدة، وقم بقياس زمن الانتقال والتكلفة وجودة المخرجات مقابل النماذج الفردية التي تستخدمها بالفعل. تخبرك معايير البائع بما قاسه Sakana. تخبرك تشغيلاتك الخاصة بما ستحصل عليه.

كيف يتناسب هذا مع سير عملك في Apidog

لا تحتاج إلى أداة جديدة لاختبار ادعاءات البائع المتعلقة بالمعايير. تحتاج إلى طريقة لإطلاق نفس المطالبة على عدة نقاط نهاية ومقارنة الاستجابات جنبًا إلى جنب.

يتيح لك Apidog تسجيل نقطة نهاية Fugu كواجهة برمجة تطبيقات (API) متوافقة مع OpenAI، وحفظ مطالبات التقييم الحقيقية الخاصة بك كطلبات، وتشغيلها كسيناريو اختبار. ضع Fugu و Fable 5 ونقطة نهاية Opus في نفس البيئة، وأرسل مدخلات متطابقة، والتقط المخرجات، ورموز الحالة، وزمن الانتقال، واستخدام الرمز المميز في مكان واحد. هذه مقارنة أكثر فائدة بكثير من ادعاء التكافؤ الذي لا يستند إلى منهجية. عندما ترغب في تتبع انحراف التكلفة من توجيه Fugu التكيفي، فإن التأكيدات على وقت الاستجابة وعدد الرموز المميزة تظهر ذلك في كل عملية تشغيل. قم بتنزيل Apidog وقم ببناء المقارنة مرة واحدة، ثم أعد تشغيلها كلما تم إصدار إصدار نموذج جديد.

زر

الأسئلة المتكررة

هل يتفوق Fugu على Fable 5 في المعايير؟

لا، ولم تدّعِ Sakana ذلك أبدًا. الادعاء هو التكافؤ: Fugu Ultra "يقف كتفًا بكتف مع" Fable 5 وMythos Preview، وفقًا لـ Sakana. يستهدف ادعاء "التفوق" المنفصل Gemini 3.1 Pro وOpus 4.8 وGPT 5.5 في تطبيقات محددة، وليس Fable 5. للجانب الخاص بالنموذج الواحد من تلك المقارنة، راجع معايير Claude Fable 5.

هل أرقام معايير Fugu تم التحقق منها بشكل مستقل؟

لا. اعتبارًا من 22 يونيو 2026، كل رقم هو تقرير من البائع، وتم قياسه على إعدادات Sakana الخاصة، مع إعدادات جهد المنافسين التي اختارتها Sakana. لم يُعد أي طرف ثالث تشغيل المهام، ولم يتم نشر أداة تقييم. عامل الادعاءات كادعاءات حتى يقوم شخص خارج Sakana بإعادة إنتاجها.

لماذا يهم أن يكون Fugu منسقًا؟

لأن Fugu يستدعي نماذج متطورة من بائعين آخرين، بما في ذلك نفسه بشكل متكرر، فإن نتيجة "يهزم Opus 4.8" قد تأتي من استدعاء Fugu لـ Opus وتجميعها. هذا انتصار لنموذج من النماذج، وليس انتصارًا لنموذج واحد. Fable 5 وسلسلة Mythos هي نماذج Anthropic مفردة، مما يجعل المقارنة المباشرة قراءة غير متجانسة.

أي إصدار من Mythos قارنته Sakana؟

إصدار Mythos Preview الأقدم من أبريل، وهو النموذج الرائد الذي وصفته Anthropic بأنه خطير للغاية بحيث لا يمكن إصداره، وليس Mythos 5 الحالي. بعض المقالات الثانوية تسمي الإصدار الخاطئ. شرح فئة Mythos يغطي الفرق بين Preview والنسخة المشحونة.

ما الفرق بين Trinity و Conductor؟

إنهما ورقتان بحثيتان منفصلتان من ICLR 2026. Trinity (arXiv:2512.04695) هو منسق بأقل من 20,000 معلمة تم تحسينه بواسطة التطور الخالي من المشتقات. Conductor (arXiv:2512.04388) هو نموذج بحجم 7B تم تدريبه بالتعلم المعزز. طرق مختلفة وأحجام مختلفة. لا يُزعم أن أيًا منهما هو صحيفة مواصفات المنتج المشحون.

كيف يمكنني اختبار أداء Fugu بنفسي؟

وجه عميلًا متوافقًا مع OpenAI إلى عنوان URL الأساسي لـ Fugu من console.sakana.ai، وأرسل مهامك الخاصة، وقم بقياس الجودة، وزمن الانتقال، والتكلفة. سجل نقطة النهاية في Apidog لمقارنة Fugu بالنماذج الفردية التي تستخدمها بالفعل، مع مطالبات متطابقة ومقاييس مسجلة.

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات

معايير أداء ساكانا فوجو: ماذا يعني أن يضاهي فيبل 5؟