Claude Fable 5.1 Benchmarks: ผลการทดสอบเผยความจริงของตัวเลข

ผลการทดสอบมาตรฐานทุกรายการของ Claude Fable 5.1 พร้อมระบุแหล่งที่มา: Terminal-Bench-Science 52.6%, Terminal-Bench 4.0 55.8%, CursorBench 73.4% เทียบกับ Fable 5, Opus 5 และ GPT-5.6 Sol

INEZA Felin-Michel

INEZA Felin-Michel

2 September 2026

Claude Fable 5.1 Benchmarks: ผลการทดสอบเผยความจริงของตัวเลข

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

Anthropic ได้เปิดตัว Claude Fable 5.1 เมื่อวันที่ 1 กันยายน 2026 พร้อมตารางเกณฑ์มาตรฐานที่เปรียบเทียบกับ Fable 5, Opus 5 และ GPT-5.6 Sol ในการทดสอบเก้าครั้ง หัวข้อข่าวที่สื่อทุกสำนักให้ความสำคัญคือ Terminal-Bench-Science ซึ่ง Fable 5.1 ทำคะแนนได้ 52.6% เทียบกับ 24.7% ของ Fable 5 ตัวเลขที่สื่อไม่ค่อยกล่าวถึงคือ CursorBench ซึ่งมีส่วนต่าง 3.4 คะแนนเมื่อเทียบกับ Opus 5 บนโมเดลที่มีราคาสูงกว่าถึงสองเท่า

คู่มือนี้รวบรวมตัวเลขที่เผยแพร่ทั้งหมดไว้ในที่เดียวพร้อมแหล่งที่มา อธิบายว่าแต่ละเกณฑ์มาตรฐานวัดผลอะไร แยกแยะความแตกต่างใหญ่ๆ ออกจากความแตกต่างเล็กๆ และครอบคลุมส่วนที่การนำเสนอข่าวการเปิดตัวข้ามไป: ผลลัพธ์เหล่านี้ทั้งหมดจัดทำโดยผู้ขาย Mythos 5.1 ทำคะแนนได้ดีกว่า Fable 5.1 ในการทดสอบการเขียนโค้ดแบบ agentic เพียงครั้งเดียวที่มีการเผยแพร่ทั้งสองรุ่น และการตอบสนองที่ถูกต้องต่อตารางการเปิดตัวคือการทดสอบประเมินผลของคุณเอง แหล่งที่มาหลักคือ โพสต์เปิดตัว ของ Anthropic; บริบทของโมเดลอยู่ใน Claude Fable 5.1 คืออะไร

ตารางฉบับเต็ม

เกณฑ์มาตรฐาน สิ่งที่วัดผล Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 การวิจัยทางวิทยาศาสตร์แบบ Agentic ในเทอร์มินัล 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 การเขียนโค้ดแบบ Agentic ในเทอร์มินัล 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 งานความรู้ที่มีมูลค่าทางเศรษฐกิจ (Elo) 1853 1723 1824 1711
OSWorld 2.0 (partial credit) การใช้งานคอมพิวเตอร์ในงานเดสก์ท็อปจริง 77.9% 72.9% 75.4% ไม่มีรายงาน
OSWorld 2.0 (strict) เหมือนเดิม, เฉพาะงานที่เสร็จสมบูรณ์เท่านั้น 41.7% 36.1% 39.6% ไม่มีรายงาน
Humanity’s Last Exam (no tools) คำถามการให้เหตุผลระดับผู้เชี่ยวชาญ 60.9% 57.8% 56.6% ไม่มีรายงาน
Humanity’s Last Exam (with tools) เหมือนเดิม, พร้อมการค้นหาและโค้ด 65.0% 63.8% 63.6% ไม่มีรายงาน
AutomationBench เวิร์กโฟลว์ธุรกิจแบบครบวงจร 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 งานเขียนโค้ดสไตล์ IDE 73.4% 70.5% 70.0% 67.2%

Anthropic ยังเผยแพร่ตัวเลขของ Mythos 5.1 หนึ่งรายการ: คือ 60.9% บน Terminal-Bench 4.0 VentureBeat ยังรายงานผล Browserbase ของ Fable 5.1 ที่ 82% เทียบกับ 74% ของ Opus 5 และ 57% ของ Fable 5 ในงาน browser-agent ที่ยากที่สุด ตัวเลขดังกล่าวมาจากข่าวประชาสัมพันธ์มากกว่าโพสต์เปิดตัว ดังนั้นควรพิจารณาตามความเหมาะสม

ความแตกต่างที่ชัดเจน

Terminal-Bench-Science 0.1: 52.6% เทียบกับ 24.7% (Fable 5) และ 29.0% (Opus 5) นี่คือผลลัพธ์ที่โดดเด่น Fable 5.1 ทำคะแนนได้มากกว่าสองเท่าของรุ่นก่อนหน้า และเกือบสองเท่าของ Opus 5 ในเกณฑ์มาตรฐานที่ให้โมเดลอยู่ในเทอร์มินัลพร้อมเครื่องมือทางวิทยาศาสตร์ และขอให้ดำเนินการวิจัยหลายขั้นตอน เป็นหลักฐานที่ชัดเจนที่สุดว่าการมุ่งเน้นของ Anthropic ในการ "แก้ปัญหาที่มีความซับซ้อนในระยะยาว" ได้สร้างผลลัพธ์ที่วัดผลได้ นอกจากนี้ยังเป็นเกณฑ์มาตรฐานเวอร์ชัน 0.1 ซึ่งหมายความว่าชุดงานยังใหม่และคะแนนมีแนวโน้มที่จะเปลี่ยนแปลงเมื่อเวลาผ่านไป

AutomationBench: 31.4% เทียบกับ 17.1% (Fable 5) และ 26.9% (Opus 5) เกณฑ์มาตรฐานสำหรับเวิร์กโฟลว์ธุรกิจแบบครบวงจรข้ามแอปพลิเคชัน ซึ่งตัวเลขจริงยังต่ำสำหรับทุกรุ่น Fable 5.1 เกือบสองเท่าของ Fable 5 ในส่วนนี้ และนำ Opus 5 อยู่ 4.5 คะแนน หากผลิตภัณฑ์ของคุณทำงานอัตโนมัติสำหรับงานธุรกิจที่ใช้หลายแอปพลิเคชัน นี่คือแถวที่คุณควรให้ความสนใจ

Terminal-Bench 4.0: 55.8% เทียบกับ 42.0% (Fable 5) ก้าวกระโดด 13.8 จุดเหนือ Fable 5 ในการเขียนโค้ดแบบ agentic ซึ่งเป็นตัวเลขที่ Anthropic ใช้เป็นหัวข้อหลักในส่วนการเขียนโค้ดของโพสต์เปิดตัว เมื่อเทียบกับ Opus 5 ส่วนต่างคือ 3.5 คะแนน Opus 5 ได้แซง Fable 5 ในเกณฑ์มาตรฐานนี้ไปแล้วในเดือนกรกฎาคม ดังนั้นข้อได้เปรียบของรุ่น Fable เหนือรุ่น Opus ในการเขียนโค้ดแบบ agentic จึงกลับมาแล้ว แต่แคบลงกว่าเมื่อเดือนมิถุนายน รายละเอียดเกณฑ์มาตรฐานของ Opus 5 มีตัวเลขของเดือนกรกฎาคม

GDPval-AA v2: 1853 เทียบกับ 1723 (Fable 5) เพิ่มขึ้น 130 Elo เหนือ Fable 5 ในงานที่ต้องใช้ความรู้ และเป็นเกณฑ์มาตรฐานที่ Anthropic ชี้ให้เห็นสำหรับข้อกล่าวอ้างเรื่องเอกสาร สเปรดชีต และสไลด์ เมื่อเทียบกับ Opus 5 ส่วนต่างคือ 29 Elo ซึ่งถือว่าเล็กน้อย

ความแตกต่างเล็กน้อย

CursorBench 3.2.0: 73.4% เทียบกับ 70.5% (Fable 5) และ 70.0% (Opus 5) งานเขียนโค้ดสไตล์ IDE สูงกว่าทั้งสองโมเดลสามจุด นี่คือเกณฑ์มาตรฐานที่สำคัญที่สุดสำหรับนักพัฒนาส่วนใหญ่ และเป็นจุดที่ Fable 5.1 มีคะแนนนำน้อยที่สุด หากภาระงานของคุณคือ “ช่วยฉันในตัวแก้ไขของฉัน” ตารางการเปิดตัวนี้เพียงอย่างเดียวไม่สามารถพิสูจน์ราคาที่แพงกว่าสองเท่าได้

OSWorld 2.0: 77.9% / 41.7% เทียบกับ 75.4% / 39.6% (Opus 5) การใช้งานคอมพิวเตอร์ สูงกว่า Opus 5 สองจุดในทั้งสองการให้คะแนน และสูงกว่า Fable 5 ห้าจุด มีอยู่จริง แต่ไม่น่าทึ่ง สังเกตคะแนนแบบเข้มงวด: งานที่เสร็จสมบูรณ์น้อยกว่าครึ่งหนึ่งบนโมเดลใดๆ การใช้งานคอมพิวเตอร์ยังคงเป็นจุดอ่อนที่สุดของเทคโนโลยีชั้นนำ

Humanity’s Last Exam: 60.9% / 65.0% เทียบกับ 56.6% / 63.6% (Opus 5) หากไม่มีเครื่องมือ นำ Opus 5 อยู่ 4.3 จุด ซึ่งเป็นส่วนต่างที่ใหญ่ที่สุดในกลุ่มความแตกต่างเล็กน้อย เมื่อใช้เครื่องมือ ส่วนต่างจะลดลงเหลือ 1.4 จุด เนื่องจากการค้นหาและการดำเนินการโค้ดทำให้สถานการณ์เท่าเทียมกัน ตัวเลขที่ไม่มีเครื่องมือคือการวัดผลการให้เหตุผลดิบที่ดีกว่า ตัวเลขที่ใช้เครื่องมือใกล้เคียงกับการใช้งานโมเดลจริง

Fable 5.1 เทียบกับ GPT-5.6 Sol

Anthropic เผยแพร่สี่แถวที่มีคอลัมน์ GPT-5.6 Sol และ Fable 5.1 เป็นผู้นำทั้งสี่แถว: Terminal-Bench-Science 30.2 จุด, Terminal-Bench 4.0 18.5 จุด, AutomationBench 11.8 จุด และ CursorBench 6.2 จุด GDPval-AA แสดง 1853 เทียบกับ 1711 ข้อควรระวังสองประการ: นี่คือผลการทดสอบของ Anthropic ที่ดำเนินการกับโมเดลของคู่แข่ง และอีกห้าแถวที่ไม่มีคอลัมน์ GPT-5.6 Sol หายไปเนื่องจากเหตุผลที่ Anthropic ไม่ได้ระบุไว้ การเปรียบเทียบ GPT-5.6 Sol กับ Fable 5 ของเราครอบคลุมการแข่งขันก่อนหน้านี้ ด้วยตัวเลขเหล่านี้ Fable 5.1 ขยายช่องว่างทั้งหมดที่ Fable 5 มีอยู่

สิ่งที่ข่าวการเปิดตัวข้ามไป

ทุกตัวเลขดำเนินการโดยผู้ขาย Anthropic ดำเนินการทั้งหมด รวมถึงคอลัมน์ของคู่แข่ง และไม่มีห้องปฏิบัติการอิสระใดๆ ที่ทำซ้ำผลลัพธ์เหล่านี้ได้ ณ ตอนเปิดตัว ประวัติเกณฑ์มาตรฐานของ Anthropic โดยทั่วไปถือว่าน่าเชื่อถือ แต่ช่องว่างของ CursorBench และ OSWorld มีขนาดเล็กพอที่การใช้ชุดเครื่องมือหรือการเลือกการให้คะแนนที่แตกต่างกันอาจทำให้ผลลัพธ์เปลี่ยนแปลงไปได้

Mythos 5.1 คือขีดจำกัดที่แท้จริง System card และโพสต์เปิดตัวของ Anthropic ระบุว่า Fable 5.1 และ Mythos 5.1 เป็น "โมเดลเดียวกันแต่มีระดับการป้องกันที่แตกต่างกัน" และมีการเผยแพร่ Mythos 5.1 ที่ 60.9% บน Terminal-Bench 4.0 เทียบกับ 55.8% ของ Fable 5.1 ช่องว่างห้าจุดนั้นคือต้นทุนของการป้องกันในการเขียนโค้ดแบบ agentic และหมายความว่า "โมเดลที่สามารถทำงานได้ดีที่สุดของ Anthropic ที่เปิดตัวอย่างแพร่หลาย" มีรุ่นพี่ที่เก่งกว่าซึ่งเป็นที่รู้จักอยู่ การเปรียบเทียบ Mythos 5.1 กับ Fable 5.1 ครอบคลุมว่าใครสามารถเข้าถึงได้

ไม่ได้ระบุระดับความพยายาม เอกสารความพยายาม ของ Anthropic ระบุว่า Fable 5.1 มีประสิทธิภาพเพิ่มขึ้นมากที่สุดที่ xhigh และ max โพสต์เปิดตัวไม่ได้ระบุว่าคะแนนแต่ละรายการเกิดขึ้นที่ระดับความพยายามใด หรือโมเดลที่ใช้เปรียบเทียบทำงานที่ระดับความพยายามใด เนื่องจากความพยายามเป็นปัจจัยหลักในการกำหนดคุณภาพของโมเดลเหล่านี้ การละเว้นข้อมูลนั้นจึงสำคัญเมื่อคุณพยายามทำซ้ำตัวเลข

ภาษาต่างประเทศไม่มีการเปลี่ยนแปลง Anthropic ระบุว่าประสิทธิภาพด้านภาษาต่างประเทศเทียบเท่ากับ Fable 5 ไม่ได้ดีขึ้น หากภาระงานของคุณไม่ใช่ภาษาอังกฤษ ตารางเปิดตัวนี้จะแสดงการเพิ่มประสิทธิภาพเกินจริง

ตัวเลขการป้องกันเป็นเกณฑ์มาตรฐานประเภทอื่น Anthropic รายงานว่ามีผลบวกปลอมทางชีววิทยา (biology false positives) ลดลง 85% ในคำขอที่ไม่เป็นอันตราย และมีการแทรกแซงทางไซเบอร์ลดลงประมาณ 60% ต่อเซสชัน Claude Code เมื่อเทียบกับ Fable 5 สิ่งเหล่านี้วัดจากทราฟฟิกของ Anthropic เองและไม่สามารถทำซ้ำจากภายนอกได้ แต่สำหรับผู้ใช้ Fable 5 ที่เคยพบการปฏิเสธ สิ่งเหล่านี้อาจมีความสำคัญมากกว่าประสิทธิภาพใดๆ

สิ่งที่คุณควรทดสอบด้วยตนเอง

ตารางการเปิดตัวจะบอกคุณว่าควรพิจารณาจุดใด การประเมินผลของคุณจะบอกคุณว่าควรเปลี่ยนไปใช้หรือไม่ การทดสอบสี่ข้อที่สอดคล้องกับแถวข้างต้น:

  1. งาน Agent ระยะยาวจากผลิตภัณฑ์ของคุณเอง ซึ่งดำเนินการจนเสร็จสิ้นบน Fable 5.1 ที่ระดับ high, Opus 5 ที่ xhigh และ Fable 5 ที่ high นี่คือการจำลอง Terminal-Bench-Science และ AutomationBench และเป็นจุดที่ราคาที่แพงกว่า 2 เท่าจะคุ้มค่าหรือไม่คุ้มค่า
  2. พร้อมท์การเขียนโค้ดที่ยากที่สุดสิบรายการของคุณ ด้วยความพยายามในระดับเดียวกันบน Fable 5.1 และ Opus 5 หากผลลัพธ์เท่ากัน คุณได้จำลองสถานการณ์ของ CursorBench ได้แล้ว และ Opus 5 คือคำตอบ
  3. การทดสอบระดับความพยายามบน Fable 5.1 เพียงอย่างเดียว ตั้งแต่ low ถึง max ในงานประจำ Anthropic อ้างว่า medium เทียบเท่า Fable 5 และ low สามารถแข่งขันกับ Opus 5 ได้ในด้านต้นทุนต่องาน ตรวจสอบดู
  4. จำนวนการปฏิเสธ ในพร้อมท์ด้านความปลอดภัยที่ไม่เป็นอันตรายหรือวิทยาศาสตร์ชีวภาพของคุณ เปรียบเทียบ Fable 5 กับ Fable 5.1 นั่นคือข้ออ้าง 60% และ 85% และเป็นสิ่งที่คุณสามารถตรวจสอบได้ภายในบ่ายวันเดียว

สร้างทั้งสี่อย่างเป็นคำขอใน Apidog โดยใช้ model และ effort เป็นตัวแปรสภาพแวดล้อม เพิ่มการยืนยันใน stop_reason และการมีอยู่ของสตริงที่คาดหวังในคำตอบ และเรียกใช้คอลเลกชันสำหรับแต่ละโมเดล ประวัติการเรียกใช้จะให้ตารางการประเมินที่ทำซ้ำได้โดยไม่ต้องใช้โครงสร้างพื้นฐานใหม่ ดาวน์โหลด Apidog เพื่อตั้งค่า; คำแนะนำการใช้งาน API มีรูปแบบคำขอ

เกณฑ์มาตรฐานเหล่านี้เชื่อมโยงกับการตัดสินใจอย่างไร

คำถามที่พบบ่อย

ผลเกณฑ์มาตรฐานที่ดีที่สุดของ Claude Fable 5.1 คืออะไร? Terminal-Bench-Science 0.1 ที่ 52.6% ซึ่งมากกว่าสองเท่าของ Fable 5 ที่ 24.7% และนำหน้า Opus 5 ที่ 29.0% และ GPT-5.6 Sol ที่ 22.4% ตัวเลขทั้งหมดมาจาก Anthropic

Fable 5.1 เปรียบเทียบกับ Opus 5 ในการเขียนโค้ดอย่างไร? 55.8% เทียบกับ 52.3% บน Terminal-Bench 4.0 และ 73.4% เทียบกับ 70.0% บน CursorBench 3.2.0 ตามตัวเลขของ Anthropic เป็นผู้นำที่มีอยู่จริงแต่แคบประมาณสามจุด

Fable 5.1 ดีกว่า GPT-5.6 Sol หรือไม่? ในเกณฑ์มาตรฐานสี่รายการที่ Anthropic เผยแพร่ทั้งสองรุ่น คำตอบคือใช่ โดยมีคะแนนนำ 6 ถึง 30 จุด Anthropic เป็นผู้ดำเนินการทดสอบตัวเลขของ GPT-5.6 Sol เอง และห้าในเก้าแถวไม่มีข้อมูลของ GPT-5.6 Sol

เกณฑ์มาตรฐานของ Fable 5.1 ได้รับการตรวจสอบโดยอิสระหรือไม่? ไม่ใช่ในขณะเปิดตัว ทุกตัวเลขดำเนินการโดย Anthropic ถือว่าเป็นข้อกล่าวอ้างที่คุณต้องทดสอบกับภาระงานของคุณเอง

Mythos 5.1 ทำคะแนนได้เท่าไหร่? Anthropic เผยแพร่หนึ่งตัวเลข: 60.9% บน Terminal-Bench 4.0 สูงกว่า Fable 5.1 ที่ 55.8% ห้าจุด ทั้งสองเป็นโมเดลเดียวกันแต่มีระดับการป้องกันที่แตกต่างกัน

ระดับความพยายามใดที่ทำให้เกิดคะแนนเหล่านี้? Anthropic ไม่ได้ระบุ คำแนะนำคือ Fable 5.1 มีประสิทธิภาพเพิ่มขึ้นมากที่สุดที่ xhigh และ max ดังนั้นให้สันนิษฐานว่าใช้ความพยายามสูง และคาดว่าการตั้งค่าที่ต่ำกว่าจะทำคะแนนได้ต่ำกว่า

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API