Anthropic ได้เปิดตัว Claude Fable 5.1 เมื่อวันที่ 1 กันยายน 2026 พร้อมตารางเกณฑ์มาตรฐานที่เปรียบเทียบกับ Fable 5, Opus 5 และ GPT-5.6 Sol ในการทดสอบเก้าครั้ง หัวข้อข่าวที่สื่อทุกสำนักให้ความสำคัญคือ Terminal-Bench-Science ซึ่ง Fable 5.1 ทำคะแนนได้ 52.6% เทียบกับ 24.7% ของ Fable 5 ตัวเลขที่สื่อไม่ค่อยกล่าวถึงคือ CursorBench ซึ่งมีส่วนต่าง 3.4 คะแนนเมื่อเทียบกับ Opus 5 บนโมเดลที่มีราคาสูงกว่าถึงสองเท่า
คู่มือนี้รวบรวมตัวเลขที่เผยแพร่ทั้งหมดไว้ในที่เดียวพร้อมแหล่งที่มา อธิบายว่าแต่ละเกณฑ์มาตรฐานวัดผลอะไร แยกแยะความแตกต่างใหญ่ๆ ออกจากความแตกต่างเล็กๆ และครอบคลุมส่วนที่การนำเสนอข่าวการเปิดตัวข้ามไป: ผลลัพธ์เหล่านี้ทั้งหมดจัดทำโดยผู้ขาย Mythos 5.1 ทำคะแนนได้ดีกว่า Fable 5.1 ในการทดสอบการเขียนโค้ดแบบ agentic เพียงครั้งเดียวที่มีการเผยแพร่ทั้งสองรุ่น และการตอบสนองที่ถูกต้องต่อตารางการเปิดตัวคือการทดสอบประเมินผลของคุณเอง แหล่งที่มาหลักคือ โพสต์เปิดตัว ของ Anthropic; บริบทของโมเดลอยู่ใน Claude Fable 5.1 คืออะไร
ตารางฉบับเต็ม
| เกณฑ์มาตรฐาน | สิ่งที่วัดผล | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | การวิจัยทางวิทยาศาสตร์แบบ Agentic ในเทอร์มินัล | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | การเขียนโค้ดแบบ Agentic ในเทอร์มินัล | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | งานความรู้ที่มีมูลค่าทางเศรษฐกิจ (Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (partial credit) | การใช้งานคอมพิวเตอร์ในงานเดสก์ท็อปจริง | 77.9% | 72.9% | 75.4% | ไม่มีรายงาน |
| OSWorld 2.0 (strict) | เหมือนเดิม, เฉพาะงานที่เสร็จสมบูรณ์เท่านั้น | 41.7% | 36.1% | 39.6% | ไม่มีรายงาน |
| Humanity’s Last Exam (no tools) | คำถามการให้เหตุผลระดับผู้เชี่ยวชาญ | 60.9% | 57.8% | 56.6% | ไม่มีรายงาน |
| Humanity’s Last Exam (with tools) | เหมือนเดิม, พร้อมการค้นหาและโค้ด | 65.0% | 63.8% | 63.6% | ไม่มีรายงาน |
| AutomationBench | เวิร์กโฟลว์ธุรกิจแบบครบวงจร | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | งานเขียนโค้ดสไตล์ IDE | 73.4% | 70.5% | 70.0% | 67.2% |
Anthropic ยังเผยแพร่ตัวเลขของ Mythos 5.1 หนึ่งรายการ: คือ 60.9% บน Terminal-Bench 4.0 VentureBeat ยังรายงานผล Browserbase ของ Fable 5.1 ที่ 82% เทียบกับ 74% ของ Opus 5 และ 57% ของ Fable 5 ในงาน browser-agent ที่ยากที่สุด ตัวเลขดังกล่าวมาจากข่าวประชาสัมพันธ์มากกว่าโพสต์เปิดตัว ดังนั้นควรพิจารณาตามความเหมาะสม
ความแตกต่างที่ชัดเจน
Terminal-Bench-Science 0.1: 52.6% เทียบกับ 24.7% (Fable 5) และ 29.0% (Opus 5) นี่คือผลลัพธ์ที่โดดเด่น Fable 5.1 ทำคะแนนได้มากกว่าสองเท่าของรุ่นก่อนหน้า และเกือบสองเท่าของ Opus 5 ในเกณฑ์มาตรฐานที่ให้โมเดลอยู่ในเทอร์มินัลพร้อมเครื่องมือทางวิทยาศาสตร์ และขอให้ดำเนินการวิจัยหลายขั้นตอน เป็นหลักฐานที่ชัดเจนที่สุดว่าการมุ่งเน้นของ Anthropic ในการ "แก้ปัญหาที่มีความซับซ้อนในระยะยาว" ได้สร้างผลลัพธ์ที่วัดผลได้ นอกจากนี้ยังเป็นเกณฑ์มาตรฐานเวอร์ชัน 0.1 ซึ่งหมายความว่าชุดงานยังใหม่และคะแนนมีแนวโน้มที่จะเปลี่ยนแปลงเมื่อเวลาผ่านไป

AutomationBench: 31.4% เทียบกับ 17.1% (Fable 5) และ 26.9% (Opus 5) เกณฑ์มาตรฐานสำหรับเวิร์กโฟลว์ธุรกิจแบบครบวงจรข้ามแอปพลิเคชัน ซึ่งตัวเลขจริงยังต่ำสำหรับทุกรุ่น Fable 5.1 เกือบสองเท่าของ Fable 5 ในส่วนนี้ และนำ Opus 5 อยู่ 4.5 คะแนน หากผลิตภัณฑ์ของคุณทำงานอัตโนมัติสำหรับงานธุรกิจที่ใช้หลายแอปพลิเคชัน นี่คือแถวที่คุณควรให้ความสนใจ
Terminal-Bench 4.0: 55.8% เทียบกับ 42.0% (Fable 5) ก้าวกระโดด 13.8 จุดเหนือ Fable 5 ในการเขียนโค้ดแบบ agentic ซึ่งเป็นตัวเลขที่ Anthropic ใช้เป็นหัวข้อหลักในส่วนการเขียนโค้ดของโพสต์เปิดตัว เมื่อเทียบกับ Opus 5 ส่วนต่างคือ 3.5 คะแนน Opus 5 ได้แซง Fable 5 ในเกณฑ์มาตรฐานนี้ไปแล้วในเดือนกรกฎาคม ดังนั้นข้อได้เปรียบของรุ่น Fable เหนือรุ่น Opus ในการเขียนโค้ดแบบ agentic จึงกลับมาแล้ว แต่แคบลงกว่าเมื่อเดือนมิถุนายน รายละเอียดเกณฑ์มาตรฐานของ Opus 5 มีตัวเลขของเดือนกรกฎาคม

GDPval-AA v2: 1853 เทียบกับ 1723 (Fable 5) เพิ่มขึ้น 130 Elo เหนือ Fable 5 ในงานที่ต้องใช้ความรู้ และเป็นเกณฑ์มาตรฐานที่ Anthropic ชี้ให้เห็นสำหรับข้อกล่าวอ้างเรื่องเอกสาร สเปรดชีต และสไลด์ เมื่อเทียบกับ Opus 5 ส่วนต่างคือ 29 Elo ซึ่งถือว่าเล็กน้อย
ความแตกต่างเล็กน้อย
CursorBench 3.2.0: 73.4% เทียบกับ 70.5% (Fable 5) และ 70.0% (Opus 5) งานเขียนโค้ดสไตล์ IDE สูงกว่าทั้งสองโมเดลสามจุด นี่คือเกณฑ์มาตรฐานที่สำคัญที่สุดสำหรับนักพัฒนาส่วนใหญ่ และเป็นจุดที่ Fable 5.1 มีคะแนนนำน้อยที่สุด หากภาระงานของคุณคือ “ช่วยฉันในตัวแก้ไขของฉัน” ตารางการเปิดตัวนี้เพียงอย่างเดียวไม่สามารถพิสูจน์ราคาที่แพงกว่าสองเท่าได้

OSWorld 2.0: 77.9% / 41.7% เทียบกับ 75.4% / 39.6% (Opus 5) การใช้งานคอมพิวเตอร์ สูงกว่า Opus 5 สองจุดในทั้งสองการให้คะแนน และสูงกว่า Fable 5 ห้าจุด มีอยู่จริง แต่ไม่น่าทึ่ง สังเกตคะแนนแบบเข้มงวด: งานที่เสร็จสมบูรณ์น้อยกว่าครึ่งหนึ่งบนโมเดลใดๆ การใช้งานคอมพิวเตอร์ยังคงเป็นจุดอ่อนที่สุดของเทคโนโลยีชั้นนำ
Humanity’s Last Exam: 60.9% / 65.0% เทียบกับ 56.6% / 63.6% (Opus 5) หากไม่มีเครื่องมือ นำ Opus 5 อยู่ 4.3 จุด ซึ่งเป็นส่วนต่างที่ใหญ่ที่สุดในกลุ่มความแตกต่างเล็กน้อย เมื่อใช้เครื่องมือ ส่วนต่างจะลดลงเหลือ 1.4 จุด เนื่องจากการค้นหาและการดำเนินการโค้ดทำให้สถานการณ์เท่าเทียมกัน ตัวเลขที่ไม่มีเครื่องมือคือการวัดผลการให้เหตุผลดิบที่ดีกว่า ตัวเลขที่ใช้เครื่องมือใกล้เคียงกับการใช้งานโมเดลจริง

Fable 5.1 เทียบกับ GPT-5.6 Sol
Anthropic เผยแพร่สี่แถวที่มีคอลัมน์ GPT-5.6 Sol และ Fable 5.1 เป็นผู้นำทั้งสี่แถว: Terminal-Bench-Science 30.2 จุด, Terminal-Bench 4.0 18.5 จุด, AutomationBench 11.8 จุด และ CursorBench 6.2 จุด GDPval-AA แสดง 1853 เทียบกับ 1711 ข้อควรระวังสองประการ: นี่คือผลการทดสอบของ Anthropic ที่ดำเนินการกับโมเดลของคู่แข่ง และอีกห้าแถวที่ไม่มีคอลัมน์ GPT-5.6 Sol หายไปเนื่องจากเหตุผลที่ Anthropic ไม่ได้ระบุไว้ การเปรียบเทียบ GPT-5.6 Sol กับ Fable 5 ของเราครอบคลุมการแข่งขันก่อนหน้านี้ ด้วยตัวเลขเหล่านี้ Fable 5.1 ขยายช่องว่างทั้งหมดที่ Fable 5 มีอยู่
สิ่งที่ข่าวการเปิดตัวข้ามไป
ทุกตัวเลขดำเนินการโดยผู้ขาย Anthropic ดำเนินการทั้งหมด รวมถึงคอลัมน์ของคู่แข่ง และไม่มีห้องปฏิบัติการอิสระใดๆ ที่ทำซ้ำผลลัพธ์เหล่านี้ได้ ณ ตอนเปิดตัว ประวัติเกณฑ์มาตรฐานของ Anthropic โดยทั่วไปถือว่าน่าเชื่อถือ แต่ช่องว่างของ CursorBench และ OSWorld มีขนาดเล็กพอที่การใช้ชุดเครื่องมือหรือการเลือกการให้คะแนนที่แตกต่างกันอาจทำให้ผลลัพธ์เปลี่ยนแปลงไปได้
Mythos 5.1 คือขีดจำกัดที่แท้จริง System card และโพสต์เปิดตัวของ Anthropic ระบุว่า Fable 5.1 และ Mythos 5.1 เป็น "โมเดลเดียวกันแต่มีระดับการป้องกันที่แตกต่างกัน" และมีการเผยแพร่ Mythos 5.1 ที่ 60.9% บน Terminal-Bench 4.0 เทียบกับ 55.8% ของ Fable 5.1 ช่องว่างห้าจุดนั้นคือต้นทุนของการป้องกันในการเขียนโค้ดแบบ agentic และหมายความว่า "โมเดลที่สามารถทำงานได้ดีที่สุดของ Anthropic ที่เปิดตัวอย่างแพร่หลาย" มีรุ่นพี่ที่เก่งกว่าซึ่งเป็นที่รู้จักอยู่ การเปรียบเทียบ Mythos 5.1 กับ Fable 5.1 ครอบคลุมว่าใครสามารถเข้าถึงได้
ไม่ได้ระบุระดับความพยายาม เอกสารความพยายาม ของ Anthropic ระบุว่า Fable 5.1 มีประสิทธิภาพเพิ่มขึ้นมากที่สุดที่ xhigh และ max โพสต์เปิดตัวไม่ได้ระบุว่าคะแนนแต่ละรายการเกิดขึ้นที่ระดับความพยายามใด หรือโมเดลที่ใช้เปรียบเทียบทำงานที่ระดับความพยายามใด เนื่องจากความพยายามเป็นปัจจัยหลักในการกำหนดคุณภาพของโมเดลเหล่านี้ การละเว้นข้อมูลนั้นจึงสำคัญเมื่อคุณพยายามทำซ้ำตัวเลข
ภาษาต่างประเทศไม่มีการเปลี่ยนแปลง Anthropic ระบุว่าประสิทธิภาพด้านภาษาต่างประเทศเทียบเท่ากับ Fable 5 ไม่ได้ดีขึ้น หากภาระงานของคุณไม่ใช่ภาษาอังกฤษ ตารางเปิดตัวนี้จะแสดงการเพิ่มประสิทธิภาพเกินจริง
ตัวเลขการป้องกันเป็นเกณฑ์มาตรฐานประเภทอื่น Anthropic รายงานว่ามีผลบวกปลอมทางชีววิทยา (biology false positives) ลดลง 85% ในคำขอที่ไม่เป็นอันตราย และมีการแทรกแซงทางไซเบอร์ลดลงประมาณ 60% ต่อเซสชัน Claude Code เมื่อเทียบกับ Fable 5 สิ่งเหล่านี้วัดจากทราฟฟิกของ Anthropic เองและไม่สามารถทำซ้ำจากภายนอกได้ แต่สำหรับผู้ใช้ Fable 5 ที่เคยพบการปฏิเสธ สิ่งเหล่านี้อาจมีความสำคัญมากกว่าประสิทธิภาพใดๆ
สิ่งที่คุณควรทดสอบด้วยตนเอง
ตารางการเปิดตัวจะบอกคุณว่าควรพิจารณาจุดใด การประเมินผลของคุณจะบอกคุณว่าควรเปลี่ยนไปใช้หรือไม่ การทดสอบสี่ข้อที่สอดคล้องกับแถวข้างต้น:
- งาน Agent ระยะยาวจากผลิตภัณฑ์ของคุณเอง ซึ่งดำเนินการจนเสร็จสิ้นบน Fable 5.1 ที่ระดับ
high, Opus 5 ที่xhighและ Fable 5 ที่highนี่คือการจำลอง Terminal-Bench-Science และ AutomationBench และเป็นจุดที่ราคาที่แพงกว่า 2 เท่าจะคุ้มค่าหรือไม่คุ้มค่า - พร้อมท์การเขียนโค้ดที่ยากที่สุดสิบรายการของคุณ ด้วยความพยายามในระดับเดียวกันบน Fable 5.1 และ Opus 5 หากผลลัพธ์เท่ากัน คุณได้จำลองสถานการณ์ของ CursorBench ได้แล้ว และ Opus 5 คือคำตอบ
- การทดสอบระดับความพยายามบน Fable 5.1 เพียงอย่างเดียว ตั้งแต่
lowถึงmaxในงานประจำ Anthropic อ้างว่าmediumเทียบเท่า Fable 5 และlowสามารถแข่งขันกับ Opus 5 ได้ในด้านต้นทุนต่องาน ตรวจสอบดู - จำนวนการปฏิเสธ ในพร้อมท์ด้านความปลอดภัยที่ไม่เป็นอันตรายหรือวิทยาศาสตร์ชีวภาพของคุณ เปรียบเทียบ Fable 5 กับ Fable 5.1 นั่นคือข้ออ้าง 60% และ 85% และเป็นสิ่งที่คุณสามารถตรวจสอบได้ภายในบ่ายวันเดียว
สร้างทั้งสี่อย่างเป็นคำขอใน Apidog โดยใช้ model และ effort เป็นตัวแปรสภาพแวดล้อม เพิ่มการยืนยันใน stop_reason และการมีอยู่ของสตริงที่คาดหวังในคำตอบ และเรียกใช้คอลเลกชันสำหรับแต่ละโมเดล ประวัติการเรียกใช้จะให้ตารางการประเมินที่ทำซ้ำได้โดยไม่ต้องใช้โครงสร้างพื้นฐานใหม่ ดาวน์โหลด Apidog เพื่อตั้งค่า; คำแนะนำการใช้งาน API มีรูปแบบคำขอ

เกณฑ์มาตรฐานเหล่านี้เชื่อมโยงกับการตัดสินใจอย่างไร
- Agent ระยะยาว, การวิจัย, ระบบอัตโนมัติ: ความแตกต่างมีขนาดใหญ่และสอดคล้องกัน Fable 5.1 คือโมเดลที่แนะนำ และ รายละเอียดราคา แสดงให้เห็นว่าการอ่านแคชที่ถูกกว่าช่วยลดช่องว่างด้านต้นทุนสำหรับภาระงานเหล่านี้โดยเฉพาะ
- การเขียนโค้ด IDE, Q&A ด้านความรู้, การให้เหตุผลโดยใช้เครื่องมือช่วย: ความแตกต่างกับ Opus 5 อยู่ที่หนึ่งถึงสี่จุด กฎของ Anthropic เองก็ใช้ได้: ให้ใช้ Opus 5 ต่อไป เว้นแต่ว่ามันจะล้มเหลวในการประเมินของคุณที่ระดับความพยายามที่สูงขึ้น การเปรียบเทียบ Fable 5.1 กับ Opus 5 ได้อธิบายเรื่องนี้ไว้แล้ว
- สำหรับผู้ที่มาจาก Fable 5: ทุกแถวมีการปรับปรุง ราคาไม่ได้เปลี่ยนแปลง และอัตราผลบวกปลอมลดลง การเปรียบเทียบ Fable 5.1 กับ Fable 5 ครอบคลุมถึงต้นทุนในการย้ายข้อมูล
คำถามที่พบบ่อย
ผลเกณฑ์มาตรฐานที่ดีที่สุดของ Claude Fable 5.1 คืออะไร? Terminal-Bench-Science 0.1 ที่ 52.6% ซึ่งมากกว่าสองเท่าของ Fable 5 ที่ 24.7% และนำหน้า Opus 5 ที่ 29.0% และ GPT-5.6 Sol ที่ 22.4% ตัวเลขทั้งหมดมาจาก Anthropic
Fable 5.1 เปรียบเทียบกับ Opus 5 ในการเขียนโค้ดอย่างไร? 55.8% เทียบกับ 52.3% บน Terminal-Bench 4.0 และ 73.4% เทียบกับ 70.0% บน CursorBench 3.2.0 ตามตัวเลขของ Anthropic เป็นผู้นำที่มีอยู่จริงแต่แคบประมาณสามจุด
Fable 5.1 ดีกว่า GPT-5.6 Sol หรือไม่? ในเกณฑ์มาตรฐานสี่รายการที่ Anthropic เผยแพร่ทั้งสองรุ่น คำตอบคือใช่ โดยมีคะแนนนำ 6 ถึง 30 จุด Anthropic เป็นผู้ดำเนินการทดสอบตัวเลขของ GPT-5.6 Sol เอง และห้าในเก้าแถวไม่มีข้อมูลของ GPT-5.6 Sol
เกณฑ์มาตรฐานของ Fable 5.1 ได้รับการตรวจสอบโดยอิสระหรือไม่? ไม่ใช่ในขณะเปิดตัว ทุกตัวเลขดำเนินการโดย Anthropic ถือว่าเป็นข้อกล่าวอ้างที่คุณต้องทดสอบกับภาระงานของคุณเอง
Mythos 5.1 ทำคะแนนได้เท่าไหร่? Anthropic เผยแพร่หนึ่งตัวเลข: 60.9% บน Terminal-Bench 4.0 สูงกว่า Fable 5.1 ที่ 55.8% ห้าจุด ทั้งสองเป็นโมเดลเดียวกันแต่มีระดับการป้องกันที่แตกต่างกัน
ระดับความพยายามใดที่ทำให้เกิดคะแนนเหล่านี้? Anthropic ไม่ได้ระบุ คำแนะนำคือ Fable 5.1 มีประสิทธิภาพเพิ่มขึ้นมากที่สุดที่ xhigh และ max ดังนั้นให้สันนิษฐานว่าใช้ความพยายามสูง และคาดว่าการตั้งค่าที่ต่ำกว่าจะทำคะแนนได้ต่ำกว่า
