Sakana Fugu Benchmarks: เทียบชั้น Fable 5 หมายถึงอะไรกันแน่

เกณฑ์มาตรฐาน Fugu ของ Sakana เป็นการกล่าวอ้างความทัดเทียมที่ผู้จำหน่ายรายงาน ไม่ใช่คะแนนที่ได้รับการยืนยัน โปรดดูว่าแต่ละข้ออ้างระบุอะไร ใครเป็นผู้กล่าวอ้าง และเหตุใดจึงยังไม่ได้รับการพิสูจน์

INEZA Felin-Michel

INEZA Felin-Michel

22 June 2026

Sakana Fugu Benchmarks: เทียบชั้น Fable 5 หมายถึงอะไรกันแน่

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

เกณฑ์มาตรฐาน Fugu ของ Sakana เป็นการกล่าวอ้างความเท่าเทียมกันที่รายงานโดยผู้จำหน่าย ไม่ใช่การประเมินที่ได้รับการตรวจสอบโดยอิสระ ตามหน้าเผยแพร่ของ Sakana, Fugu Ultra "มีความสามารถทัดเทียมกับโมเดลชั้นนำอย่าง Fable 5 และ Mythos Preview" ในงานด้านวิศวกรรม วิทยาศาสตร์ และการให้เหตุผล และ Fugu "ทำงานได้ดีกว่าอย่างสม่ำเสมอ" เมื่อเทียบกับ Gemini 3.1 Pro, Opus 4.8 และ GPT 5.5 ในชุดแอปพลิเคชันที่ระบุ ข้อควรทำความเข้าใจก่อนที่คุณจะอ่านตัวเลขใดๆ ก็คือ: Fugu เป็นตัวควบคุมที่เรียกใช้โมเดลระดับแนวหน้าของผู้จำหน่ายรายอื่น ดังนั้นผลลัพธ์ของมันจึงไม่ใช่ชัยชนะของโมเดลเดี่ยวในแบบที่Fable 5 เป็น

ดาวน์โหลดแอป

Fugu คืออะไร และเหตุใดจึงเปลี่ยนวิธีที่คุณอ่านเกณฑ์มาตรฐาน

Fugu ไม่ใช่โมเดลพื้นฐานเดียว เป็นระบบการประสานงานแบบหลายเอเจนต์ที่นำเสนอเป็นโมเดลเดียวภายใต้ API ที่เข้ากันได้กับ OpenAI Sakana อธิบายว่าเป็นโมเดลภาษาที่ได้รับการฝึกฝนมาโดยเฉพาะในด้านการมอบหมายงาน การสื่อสารระหว่างเอเจนต์ และการสังเคราะห์งาน มันประสานงาน LLM หลายตัวแบบไดนามิก รวมถึงอินสแตนซ์ที่เรียกตัวเองซ้ำๆ และตัดสินใจว่าจะตอบโดยตรงหรือรวมทีม หัวข้อข่าวการเปิดตัวคือ “หนึ่งโมเดลเพื่อควบคุมทุกสิ่ง”

รายละเอียดการออกแบบนี้คือหัวใจสำคัญของเกณฑ์มาตรฐาน เมื่อโมเดลปกติรายงานคะแนน ตัวเลขนั้นสะท้อนถึงน้ำหนักการทำงานของโมเดลนั้นเอง เมื่อ Fugu รายงานคะแนน ตัวเลขนั้นอาจสะท้อนถึง Fugu ที่เรียกใช้ Opus 4.8 หรือ GPT 5.5 หรือ Gemini 3.1 Pro จากนั้นจึงสังเคราะห์ผลลัพธ์ของพวกมัน ดังนั้นผลลัพธ์ที่ระบุว่า "เหนือกว่า Opus 4.8" จึงอาจมาจากระบบที่เรียกใช้ Opus และรวมเข้ากับโมเดลอื่นๆ นั่นคือผลลัพธ์ของโมเดลหลายตัวรวมกัน ไม่ใช่ผลลัพธ์ของโมเดลเดียว หากคุณต้องการบริบททางสถาปัตยกรรมที่ลึกซึ้งยิ่งขึ้น คำอธิบายของเราเกี่ยวกับ Sakana Fugu จะอธิบายวงจรการประสานงาน

การกล่าวอ้างความเท่าเทียม: "มีความสามารถทัดเทียมกับ Fable 5 และ Mythos Preview"

นี่คือคำกล่าวอ้างแรก ที่ระบุไว้อย่างละเอียด

ตามที่ Sakana ระบุ Fugu Ultra "มีความสามารถทัดเทียมกับโมเดลชั้นนำอย่าง Fable 5 และ Mythos Preview" ในเกณฑ์มาตรฐานด้านวิศวกรรม วิทยาศาสตร์ และการให้เหตุผล สังเกตคำกริยา นี่คือการกล่าวอ้างถึงความเท่าเทียม ไม่ใช่การกล่าวอ้างว่า "เหนือกว่า" Sakana วางตำแหน่ง Fugu Ultra ให้เป็นคู่แข่งระดับแนวหน้า ไม่ใช่ผู้นำระดับแนวหน้า

มีสองสิ่งที่ควรสังเกต

ประการแรก คู่แข่งที่ระบุคือ "Mythos Preview" ซึ่งเป็นโมเดลระดับแนวหน้าเมื่อเดือนเมษายนที่ Anthropic อธิบายว่าอันตรายเกินกว่าจะเปิดตัว ไม่ใช่ Mythos 5 เวอร์ชันปัจจุบันที่เปิดให้ใช้งานทั่วไป หากคุณเคยอ่านเกี่ยวกับโมเดลตระกูล Mythos คุณจะทราบว่า Preview และเวอร์ชันที่เปิดตัวนั้นเป็นผลงานที่แตกต่างกัน การอ้างความเท่าเทียมกับ Preview แทนที่จะเป็นโมเดลปัจจุบันเป็นทางเลือกหนึ่ง และมีความสำคัญต่อความน่าประทับใจของคำกล่าวอ้าง

ประการที่สอง ไม่มีตารางเกณฑ์มาตรฐานใดๆ ที่สนับสนุนสิ่งนี้ในรูปแบบที่บุคคลภายนอก Sakana สามารถเรียกใช้ซ้ำได้ ข้อเรียกร้องนี้เป็นเชิงคุณภาพบนหน้าการเปิดตัว ไม่มีระเบียบวิธีที่เผยแพร่ ไม่มีตารางคะแนนต่อภารกิจ และไม่มีการทำซ้ำโดยบุคคลที่สาม ให้ถือว่า "มีความสามารถทัดเทียม" เป็นการกำหนดกรอบผลลัพธ์ภายในของตนเองโดยผู้จำหน่าย

คำกล่าวอ้างที่แข็งแกร่งกว่า: "ทำงานได้ดีกว่าอย่างสม่ำเสมอ" บนแอปพลิเคชันที่ระบุ

Sakana อ้างสิทธิ์ที่สองที่กล้าหาญกว่า และควรแยกออกจากสิทธิ์แรก

ตามที่ Sakana ระบุ Fugu "ทำงานได้ดีกว่าอย่างสม่ำเสมอ" เมื่อเทียบกับคู่แข่งสามรายที่กำหนดค่าไว้ ในรายการแอปพลิเคชันเฉพาะ:

แอปพลิเคชันที่ระบุคือ AutoResearch, Rubik’s Cube, Mechanical Design, Japanese Handwriting Analysis, One-Shot Chess และ Financial Time Series Prediction

นี่คือประสิทธิภาพในระดับแอปพลิเคชัน ไม่ใช่ชุดเกณฑ์มาตรฐานทางวิชาการมาตรฐาน สิ่งเหล่านี้คืองานแบบ end-to-end ที่ระบบการประสานงานมีโอกาสที่จะแสดงศักยภาพ เพราะสามารถส่งปัญหาของงานย่อยไปยังโมเดลพื้นฐานใดก็ตามที่จัดการได้ดีที่สุด จากนั้นจึงนำผลลัพธ์มารวมกัน นี่คือจุดที่ผู้ควบคุมควรจะเอาชนะผู้เล่นเดี่ยวคนใดก็ได้

แต่จงยึดหลักความซื่อสัตย์อีกครั้ง คู่แข่งหลายรายเหล่านั้นเป็นโมเดลที่ Fugu สามารถเรียกใช้ได้ ผลลัพธ์ที่ว่า "เหนือกว่า Opus 4.8 (สูงสุด)" ใน AutoResearch อาจมาจาก Fugu ที่เรียกใช้ Opus, เรียกใช้โมเดลอื่นๆ และสังเคราะห์คำตอบที่รวมกันได้ดีกว่า นั่นคือความสามารถที่แท้จริง และอาจช่วยคุณได้อย่างแท้จริง มันไม่ใช่หลักฐานว่าโมเดล Sakana เพียงตัวเดียวมีเหตุผลเหนือกว่า Opus อย่าตีความตัวเลขเหล่านี้ว่าเป็นชัยชนะของโมเดลเดี่ยว และอย่าพูดว่า "Fugu เอาชนะ Fable 5" เพราะ Sakana ไม่ได้อ้างสิทธิ์นั้นด้วยซ้ำ การกล่าวอ้างความเท่าเทียมและการกล่าวอ้างว่าทำงานได้ดีกว่านั้น มุ่งเป้าไปที่คู่แข่งที่แตกต่างกัน

เหตุใดตัวเลขเหล่านี้จึงยังไม่สามารถตรวจสอบได้โดยอิสระ

ยังไม่มีการทำซ้ำโดยอิสระ ตัวเลขเกณฑ์มาตรฐาน Fugu ทุกตัวในหน้านี้เป็นข้อมูลที่ผู้จำหน่ายรายงาน โดยวัดจากระบบของ Sakana เอง ด้วยการกำหนดค่าคู่แข่งที่ Sakana เลือก (การตั้งค่าความพยายาม "สูง" "สูงสุด" และ "สูงมาก") ณ วันที่ 2026-06-22 ยังไม่มีบุคคลที่สามรายใดได้เรียกใช้งานเหล่านี้ซ้ำ ไม่มีตารางคะแนนต่อภารกิจที่เผยแพร่ และไม่มีเครื่องมือประเมินผลใดๆ ที่เปิดตัว ท่าทีที่ถูกต้องคือการถือว่าทั้งหมดเป็นเพียงคำกล่าวอ้าง ไม่ใช่การวัดผล

นี่ไม่ใช่การวิพากษ์วิจารณ์ Sakana โดยเฉพาะ เป็นสถานะเริ่มต้นสำหรับโมเดลใดๆ ในวันเปิดตัว ความแตกต่างของ Fugu คือการออกแบบระบบการประสานงานทำให้การทำซ้ำโดยอิสระยากขึ้น ไม่ใช่เรื่องง่ายขึ้น

ในการทำซ้ำเกณฑ์มาตรฐานของโมเดลเดียว คุณต้องมีโมเดลและชุดทดสอบ ในการทำซ้ำของ Fugu คุณต้องมี Fugu รวมถึงการเข้าถึงโมเดลพื้นฐานทุกตัวที่ Fugu เรียกใช้ ในเวอร์ชันและการตั้งค่าความพยายามเดียวกัน พร้อมด้วยโครงสร้างการประสานงานแบบเดียวกันกับที่ Sakana ใช้ ระบบจะ "หลีกเลี่ยงข้อจำกัดของผู้ให้บริการแบบไดนามิก" และปรับเปลี่ยนโครงสร้างเอเจนต์ต่อภารกิจ ดังนั้นการเรียกใช้พรอมต์เดียวกันสองครั้งอาจไม่ได้ใช้ทีมภายในเดียวกันด้วยซ้ำ ความสามารถในการปรับตัวนั้นเป็นคุณสมบัติที่เป็นประโยชน์สำหรับผู้ใช้ แต่เป็นเรื่องน่าปวดหัวสำหรับการทำซ้ำ

ดังนั้นคุณจะไม่พบตารางการเปรียบเทียบแบบตัวต่อตัวที่ชัดเจนในที่นี้ และคุณควรสงสัยตัวเลข "Fugu ได้คะแนน X" ที่แพร่กระจายจากแหล่งข้อมูลรอง บทความรองหลายฉบับระบุเวอร์ชันคู่แข่งผิด (เช่น Mythos ปัจจุบันแทนที่จะเป็น Mythos Preview) สถานะที่ไม่มีตัวเลขที่ชัดเจนคือผลลัพธ์ที่ตรงไปตรงมาในตอนนี้ การเปรียบเทียบ Fugu Ultra กับ Fable 5 กับ Mythos ของเรายังคงเป็นเชิงคุณภาพด้วยเหตุผลเดียวกัน

บันทึกการวิจัยที่อยู่เบื้องหลังคำกล่าวอ้าง

การตลาดของ Sakana อิงจากการวิจัยจริงที่สามารถอ้างอิงได้ เอกสาร ICLR 2026 สองฉบับอธิบายถึงที่มา ไม่มีฉบับใดที่ระบุว่าเป็นเกณฑ์มาตรฐานของผลิตภัณฑ์ ดังนั้นควรอ่านในฐานะบันทึกการวิจัย ไม่ใช่เอกสารข้อมูลจำเพาะของ Fugu

ฉบับแรกคือ Trinity, "An Evolved LLM Coordinator" (arXiv:2512.04695) Trinity เป็นตัวประสานงานที่มีพารามิเตอร์น้อยกว่า 20,000 ตัว ซึ่งได้รับการปรับปรุงด้วยการวิวัฒนาการแบบไร้อนุพันธ์ โดยมีบทบาทเป็น Thinker, Worker และ Verifier มันมีขนาดเล็กและได้รับการวิวัฒนาการ ไม่ได้ถูกฝึกฝนด้วย Gradient Descent

ฉบับที่สองคือ Conductor, "Learning to Orchestrate Agents in Natural Language" (arXiv:2512.04388) Conductor เป็นโมเดลขนาด 7B ที่ได้รับการฝึกฝนด้วย Reinforcement Learning ซึ่งเรียนรู้โครงสร้างการสื่อสารระหว่างเอเจนต์ เอกสารอ้างว่ามันเอาชนะ Mixture-of-Agents ได้ด้วยต้นทุนที่ต่ำกว่า

สิ่งเหล่านี้คือวิธีการที่แตกต่างกันและขนาดที่แตกต่างกัน Trinity ใช้วิวัฒนาการกับพารามิเตอร์ที่น้อยกว่า 20K Conductor ใช้ RL กับพารามิเตอร์ 7B อย่าสับสนระหว่างพวกมัน และอย่าสมมติว่าข้อมูลจำเพาะที่แน่นอนของเอกสารฉบับใดฉบับหนึ่งอธิบายถึงผลิตภัณฑ์ที่เปิดตัว การนำตัวเลข 7B หรือโมเดลพื้นฐานเฉพาะใดๆ มาเชื่อมโยงกับ Fugu ที่เปิดตัว เป็นการอนุมานของบุคคลที่สาม การเปิดตัวอย่างเป็นทางการไม่ได้ระบุจำนวนพารามิเตอร์ของผลิตภัณฑ์

ข้อมูลจำเพาะเพิ่มเติมเพื่อประกอบคำกล่าวอ้าง

นี่คือสิ่งที่ได้รับการยืนยันอย่างสมเหตุสมผลเทียบกับสิ่งที่ยังไม่ได้รับการยืนยัน ให้ถือว่าข้อมูลสถาปัตยกรรมยังไม่ได้รับการตรวจสอบ

รายการ สิ่งที่ Sakana / แหล่งข้อมูลกล่าว ความน่าเชื่อถือ
ประเภทระบบ ตัวประสานงานแบบหลายเอเจนต์ที่อยู่เบื้องหลังโมเดลเดียว ระบุในหน้าเผยแพร่
รุ่นย่อย Fugu (สมดุล, เวลาแฝงต่ำ) และ Fugu Ultra (คุณภาพสูงสุด) ระบุในหน้าเผยแพร่
ชื่อเบต้าเก่า รุ่นย่อยขนาดเล็กถูกเรียกว่า “Fugu Mini” ในช่วงเบต้าและในข่าวประชาสัมพันธ์ ข้อมูลในอดีต
ส่วนเชื่อมต่อ API หนึ่งปลายทางที่เข้ากันได้กับ OpenAI สำหรับทั้งสองรุ่นย่อย ระบุในหน้าเผยแพร่
โมเดลพื้นฐาน เรียกใช้ LLM ระดับแนวหน้าหลายตัว รวมถึงตัวมันเองแบบวนซ้ำ ระบุในหน้าเผยแพร่
จำนวนพารามิเตอร์ของผลิตภัณฑ์ ไม่ได้เผยแพร่; รายละเอียด 7B / Conductor เป็นการอนุมานของบุคคลที่สาม [ตรวจสอบ]
ระเบียบวิธีเกณฑ์มาตรฐาน รายงานโดยผู้จำหน่าย, การตั้งค่าของ Sakana เอง, ไม่มีเครื่องมือประเมินผลที่เปิดตัว [ตรวจสอบ]

ข้อควรจำเกี่ยวกับชื่อที่ควรย้ำอีกครั้ง: รุ่นย่อยขนาดเล็กถูกเรียกว่า “Fugu Mini” ในช่วงเบต้าที่มีผู้ใช้ประมาณ 500 คน ซึ่งเปิดตัวประมาณวันที่ 24-25 เมษายน 2026 หน้าการเปิดตัวใช้ชื่อ “Fugu” และ “Fugu Ultra” ให้ใช้ชื่อปัจจุบันเป็นหลัก

สิ่งนี้มีความหมายอย่างไรต่อการทดสอบของคุณเอง

คุณไม่สามารถตรวจสอบเกณฑ์มาตรฐานของ Sakana ได้ คุณสามารถดำเนินการทดสอบของคุณเองได้

เนื่องจาก Fugu ใช้โปรโตคอลการทำ Chat Completions ของ OpenAI คุณจึงสามารถชี้ไคลเอ็นต์ OpenAI ที่มีอยู่ไปยัง URL พื้นฐานของ Fugu และส่งงานจริงของคุณได้ ไม่ต้องโยกย้าย SDK URL พื้นฐานยังไม่ได้รับการเผยแพร่ในหน้าสาธารณะใดๆ ณ วันที่ 2026-06-22 ดังนั้นให้คัดลอกจากคอนโซลของคุณที่ console.sakana.ai และอย่าเชื่อถือโฮสต์ที่สร้างขึ้นเอง รูปแบบด้านล่างสะท้อนถึงคำขอ Chat Completions มาตรฐานของ OpenAI:

from openai import OpenAI

# คัดลอก URL พื้นฐานจริงจาก console.sakana.ai หลังจากที่คุณลงชื่อเข้าใช้
client = OpenAI(
    api_key="YOUR_FUGU_API_KEY",
    base_url="<YOUR_FUGU_BASE_URL_FROM_CONSOLE>",
)

resp = client.chat.completions.create(
    model="fugu-ultra",  # ใช้ 'fugu' สำหรับรุ่นที่สมดุล; id ที่รายงาน ให้ตรวจสอบในคอนโซล
    messages=[
        {"role": "system", "content": "คุณคือผู้ตรวจสอบโค้ดที่แม่นยำ"},
        {"role": "user", "content": "ตรวจสอบฟังก์ชันนี้เพื่อหาปัญหาด้านความปลอดภัย:\n<วางโค้ด>"},
    ],
)

print(resp.choices[0].message.content)

สตริง id ของโมเดลที่รายงานจนถึงตอนนี้คือ fugu และ fugu-ultra ซึ่งอาจมาพร้อมกับรูปแบบที่มีวันที่กำกับ ยืนยัน id ที่แน่นอนในคอนโซล แทนที่จะใส่เข้าไปใน config ของคุณ เนื่องจาก Fugu ตัดสินใจต่อคำขอว่าจะตอบโดยตรงหรือรวมทีม พรอมต์เดียวกันจึงสามารถสร้างเวลาแฝงและค่าใช้จ่ายที่แตกต่างกันในการเรียกใช้แต่ละครั้ง บันทึกทั้งสองอย่าง

นี่คือจุดที่การประเมินของคุณเองมีความสำคัญมากกว่าปกติ ส่งงานที่คุณสนใจจริงๆ ไม่ใช่ AutoResearch หรือ One-Shot Chess และวัดเวลาแฝง ค่าใช้จ่าย และคุณภาพของผลลัพธ์เทียบกับโมเดลเดี่ยวที่คุณใช้อยู่แล้ว เกณฑ์มาตรฐานของผู้จำหน่ายบอกคุณว่า Sakana วัดอะไร การรันของคุณเองจะบอกคุณว่าคุณจะได้อะไร

สิ่งนี้เข้ากับขั้นตอนการทำงานของ Apidog ของคุณอย่างไร

คุณไม่จำเป็นต้องมีเครื่องมือใหม่เพื่อทดสอบคำกล่าวอ้างเกณฑ์มาตรฐานของผู้จำหน่าย คุณต้องการวิธีที่จะส่งพรอมต์เดียวกันไปยังปลายทางหลายแห่ง และเปรียบเทียบการตอบสนองแบบเคียงข้างกัน

Apidog ช่วยให้คุณสามารถลงทะเบียนปลายทาง Fugu เป็น API ที่เข้ากันได้กับ OpenAI บันทึกพรอมต์การประเมินจริงของคุณเป็นคำขอ และเรียกใช้เป็นสถานการณ์ทดสอบ วาง Fugu, Fable 5 และปลายทาง Opus ในสภาพแวดล้อมเดียวกัน ส่งอินพุตที่เหมือนกัน และบันทึกผลลัพธ์ รหัสสถานะ เวลาแฝง และการใช้โทเค็นไว้ในที่เดียว นั่นคือการเปรียบเทียบที่มีประโยชน์มากกว่าการกล่าวอ้างความเท่าเทียมกันที่ไม่มีระเบียบวิธีรองรับ เมื่อคุณต้องการติดตามการเปลี่ยนแปลงของค่าใช้จ่ายจากการกำหนดเส้นทางแบบปรับเปลี่ยนได้ของ Fugu การยืนยันเวลาตอบสนองและจำนวนโทเค็นจะแสดงให้เห็นเมื่อเรียกใช้แต่ละครั้ง ดาวน์โหลด Apidog และสร้างการเปรียบเทียบเพียงครั้งเดียว จากนั้นเรียกใช้ซ้ำได้ทุกครั้งที่มีโมเดลเวอร์ชันใหม่เปิดตัว

ดาวน์โหลดแอป

คำถามที่พบบ่อย

Fugu เอาชนะ Fable 5 ในเกณฑ์มาตรฐานได้หรือไม่?

ไม่ และ Sakana ไม่เคยอ้างสิทธิ์นั้น คำกล่าวอ้างคือความเท่าเทียม: Fugu Ultra "มีความสามารถทัดเทียมกับ" Fable 5 และ Mythos Preview ตามที่ Sakana ระบุ คำกล่าวอ้างว่า "ทำงานได้ดีกว่า" ที่แยกต่างหากนั้นมุ่งเป้าไปที่ Gemini 3.1 Pro, Opus 4.8 และ GPT 5.5 ในแอปพลิเคชันเฉพาะ ไม่ใช่ Fable 5 สำหรับการเปรียบเทียบในส่วนของโมเดลเดี่ยว โปรดดูที่เกณฑ์มาตรฐาน Claude Fable 5

ตัวเลขเกณฑ์มาตรฐาน Fugu ได้รับการตรวจสอบโดยอิสระหรือไม่?

ไม่ ณ วันที่ 2026-06-22 ตัวเลขทุกตัวเป็นการรายงานจากผู้จำหน่ายบนระบบของ Sakana เอง โดยมีการตั้งค่าความพยายามของคู่แข่งที่ Sakana เลือก ยังไม่มีบุคคลที่สามรายใดได้เรียกใช้งานเหล่านี้ซ้ำ และไม่มีเครื่องมือประเมินผลใดๆ ที่เปิดตัว ให้ถือว่าคำกล่าวอ้างเหล่านี้เป็นเพียงคำกล่าวอ้าง จนกว่าบุคคลภายนอก Sakana จะสามารถทำซ้ำได้

เหตุใดการที่ Fugu เป็นตัวประสานงานจึงสำคัญ?

เนื่องจากการที่ Fugu เรียกใช้โมเดลระดับแนวหน้าของผู้จำหน่ายรายอื่น รวมถึงเรียกใช้ตัวเองซ้ำๆ ผลลัพธ์ที่ว่า "เหนือกว่า Opus 4.8" อาจมาจาก Fugu ที่เรียกใช้ Opus แล้วสังเคราะห์ผลลัพธ์ นั่นคือชัยชนะของโมเดลหลายตัวรวมกัน ไม่ใช่ชัยชนะของโมเดลเดี่ยว Fable 5 และตระกูล Mythos เป็นโมเดลเดี่ยวของ Anthropic ซึ่งทำให้การเปรียบเทียบแบบตัวต่อตัวเป็นเหมือนการเปรียบเทียบแอปเปิลกับส้ม

Sakana เปรียบเทียบกับ Mythos เวอร์ชันใด?

Mythos Preview เวอร์ชันเก่าจากเดือนเมษายน ซึ่งเป็นโมเดลระดับแนวหน้า ที่ Anthropic อธิบายว่าอันตรายเกินกว่าจะเปิดตัว ไม่ใช่ Mythos 5 เวอร์ชันปัจจุบัน บทความรองบางฉบับระบุเวอร์ชันผิด คำอธิบายโมเดลตระกูล Mythos ครอบคลุมความแตกต่างระหว่าง Preview และเวอร์ชันที่เปิดตัว

Trinity และ Conductor แตกต่างกันอย่างไร?

เป็นเอกสาร ICLR 2026 สองฉบับที่แยกจากกัน Trinity (arXiv:2512.04695) เป็นตัวประสานงานที่มีพารามิเตอร์น้อยกว่า 20,000 ตัว ซึ่งได้รับการปรับปรุงด้วยการวิวัฒนาการ Conductor (arXiv:2512.04388) เป็นโมเดล 7B ที่ได้รับการฝึกฝนด้วย Reinforcement Learning ใช้วิธีการที่แตกต่างกัน ขนาดที่แตกต่างกัน ไม่มีฉบับใดที่ระบุว่าเป็นเอกสารข้อมูลจำเพาะของผลิตภัณฑ์ที่เปิดตัว

ฉันจะทดสอบประสิทธิภาพของ Fugu ด้วยตัวเองได้อย่างไร?

ชี้ไคลเอ็นต์ที่เข้ากันได้กับ OpenAI ไปยัง URL พื้นฐานของ Fugu จาก console.sakana.ai ส่งงานของคุณเอง และวัดคุณภาพ เวลาแฝง และค่าใช้จ่าย ลงทะเบียนปลายทางใน Apidog เพื่อเปรียบเทียบ Fugu กับโมเดลเดี่ยวที่คุณใช้อยู่แล้ว ด้วยพรอมต์ที่เหมือนกันและเมตริกที่บันทึกไว้

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API