เมื่อ Anthropic เปิดตัว Claude Fable 5 ในวันที่ 9 มิถุนายน 2026 บริษัทได้กล่าวว่าโมเดลนี้เป็นเทคโนโลยีที่ล้ำสมัยที่สุดในเกือบทุกเกณฑ์มาตรฐานที่ได้ทดสอบ หากคุณมาที่นี่เพื่อค้นหาข้อมูลเปรียบเทียบ (benchmark) ของ Claude Fable 5 ที่ชัดเจนพร้อมตัวเลขที่แน่นอนสำหรับการประเมินแต่ละครั้ง มีข้อควรระวังที่ซื่อสัตย์แต่แรกคือ: การประกาศของ Anthropic รายงาน ตำแหน่ง ของเกณฑ์มาตรฐาน (ว่า Fable 5 อยู่ในอันดับใดเมื่อเทียบกับโมเดลแนวหน้าอื่นๆ) มากกว่าตารางคะแนนตัวเลขเต็มรูปแบบในข้อความ และแผนภูมิพาดหัวข่าวหลายรายการมาในรูปแบบรูปภาพมากกว่าตารางที่สามารถคัดลอกและวางได้ ดังนั้นบทสรุปนี้จึงมุ่งเน้นไปที่ความหมายที่แท้จริงของตำแหน่งเหล่านี้ Fable 5 อยู่ในตำแหน่งใด และคุณจะสามารถทำการประเมินอย่างรวดเร็วของคุณเองได้อย่างไร หากคุณต้องการตัวเลขที่คุณควบคุมได้ สำหรับการเปรียบเทียบขอบเขตปัจจุบันที่กว้างขึ้น การวิเคราะห์ของเราเกี่ยวกับ Opus 4.8 เทียบกับ GPT-5.5 และ Gemini 3.5 จะเป็นประโยชน์
Fable 5 มีค่าใช้จ่าย 10 ดอลลาร์ต่อล้านโทเค็นอินพุต และ 50 ดอลลาร์ต่อล้านโทเค็นเอาต์พุต ภายใต้รหัสโมเดล claude-fable-5 โดยอยู่ในระดับที่สูงกว่า Opus 4.8 ทั้งในด้านความสามารถและราคา และ Anthropic วางตำแหน่งให้เป็น Claude ที่เปิดเผยต่อสาธารณะที่แข็งแกร่งที่สุดสำหรับวิศวกรรมซอฟต์แวร์ งานความรู้ การมองเห็น และการวิจัยทางวิทยาศาสตร์
สรุปสั้นๆ
Claude Fable 5 อยู่ในอันดับที่หนึ่งในบรรดาโมเดลแนวหน้าใน FrontierCode และ FrontierBench (ทั้งสองจาก Cognition) เป็นเทคโนโลยีที่ล้ำสมัยที่สุดใน CursorBench และได้คะแนนสูงสุดใน Finance Benchmark ของ Hebbia แสดงให้เห็นถึงความแข็งแกร่งที่ชัดเจนในงานที่ต้องใช้ระยะเวลานานและทำงานได้ด้วยตนเอง Anthropic รายงานสิ่งเหล่านี้เป็นตำแหน่ง ดังนั้นคะแนนสาธารณะที่แน่นอนจึงมีจำกัด ให้ถือว่าการจัดอันดับเป็นแนวทาง ไม่ใช่ข้อมูลสุดท้าย
ผลลัพธ์หลัก
ประโยคเดียวที่ใช้เป็นกรอบในการอภิปรายเกณฑ์มาตรฐานของ Claude Fable 5 ทุกครั้งคือ: Anthropic อธิบายว่าโมเดลนี้เป็นเทคโนโลยีที่ล้ำสมัยที่สุดในเกือบทุกเกณฑ์มาตรฐานที่ได้ทดสอบ ครอบคลุมถึงวิศวกรรมซอฟต์แวร์ งานความรู้ การมองเห็น และการวิจัยทางวิทยาศาสตร์ นี่เป็นการกล่าวอ้างที่กว้างขวาง และการกล่าวอ้างที่กว้างขวางก็สมควรได้รับการอ่านอย่างละเอียดถี่ถ้วน

“เป็นเทคโนโลยีที่ล้ำสมัยที่สุดในเกือบทุกเกณฑ์มาตรฐาน” หมายความว่า Fable 5 อยู่ในอันดับสูงสุดหรืออยู่ในกลุ่มอันดับต้นๆ ในการประเมินส่วนใหญ่ที่ Anthropic เลือกที่จะรายงาน ไม่ได้หมายความว่า Fable 5 ชนะทุกการทดสอบด้วยคะแนนที่ห่างกันมาก และไม่ได้หมายความว่าห้องปฏิบัติการอิสระได้ทำซ้ำผลลัพธ์แต่ละอย่าง สิ่งที่บ่งบอกคือความสอดคล้อง: โมเดลที่เป็นเลิศในการเขียนโค้ดแต่มีประสิทธิภาพปานกลางในการให้เหตุผลจากเอกสารจะไม่ได้รับการกล่าวถึงเช่นนั้น Fable 5 ดูเหมือนจะครองตำแหน่งสูงสุดในหมวดหมู่ที่มักจะมีการแลกเปลี่ยนกัน
ความกว้างขวางนั้นสำคัญกว่าแผนภูมิใดๆ โมเดลจำนวนมากมีประสิทธิภาพโดดเด่นในเกณฑ์มาตรฐานที่ชื่นชอบแต่กลับอ่อนด้อยในด้านอื่น โมเดลที่ยังคงอยู่ในอันดับต้นๆ ทั้งในด้านการเขียนโค้ด การเงิน การมองเห็น และวิทยาศาสตร์นั้นยากต่อการถูกหลอกลวง เพราะคุณไม่สามารถปรับแต่งทักษะสี่อย่างที่ไม่เกี่ยวข้องกันพร้อมกันได้หากไม่มีความสามารถที่แท้จริงอยู่เบื้องหลัง หากคุณกำลังตัดสินใจว่า Fable 5 คุ้มค่าที่จะอัปเกรดจากระดับที่ถูกกว่าหรือไม่ ความกว้างขวางของการจัดอันดับคือส่วนที่ต้องพิจารณา สำหรับข้อมูลเบื้องต้นเกี่ยวกับโมเดลนี้ทั้งหมด โปรดดู Claude Fable 5 คืออะไร
ธีมที่สองที่ปรากฏในผลลัพธ์คือ: งานที่ต้องใช้ระยะเวลานาน Anthropic กล่าวว่า Fable 5 “ยังคงมุ่งเน้นไปที่การทำงานในงานที่ใช้เวลานานนับล้านโทเค็น” และทำงานได้ด้วยตนเองนานกว่า Claude รุ่นก่อนๆ ตำแหน่งหลายรายการด้านล่างไม่ใช่การทดสอบความแม่นยำแบบครั้งเดียว แต่เป็นการให้รางวัลแก่โมเดลที่สามารถรักษาแผนการทำงานร่วมกันได้ตลอดหลายพันขั้นตอนโดยไม่หลงทาง นั่นคือจุดที่ Fable 5 มีรายงานว่านำหน้าคู่แข่งมากที่สุด และยังเป็นความสามารถที่ยากที่สุดในการแสดงเป็นตัวเลขเดียว
เกณฑ์มาตรฐานการเขียนโค้ด: FrontierCode และ CursorBench
การเขียนโค้ดคือจุดที่เรื่องราวเกณฑ์มาตรฐานของ Fable 5 แข็งแกร่งและชัดเจนที่สุด
สำหรับ FrontierCode ซึ่งเป็นการประเมินการเขียนโค้ดจาก Cognition (ทีมงานเบื้องหลัง Devin coding agent) Anthropic รายงานว่า Fable 5 เป็นโมเดลแนวหน้าที่มีคะแนนสูงสุด และยังคงรักษาตำแหน่งผู้นำไว้ได้แม้จะใช้ ความพยายามระดับปานกลาง คุณสมบัติ “ความพยายาม” นี้ควรค่าแก่การพิจารณา โมเดลแนวหน้าหลายรุ่นสามารถเพิ่มความแม่นยำได้โดยการใช้การประมวลผลการอนุมานที่มากขึ้น (โทเค็นการให้เหตุผลที่มากขึ้น ความพยายามที่มากขึ้น การตั้งค่าความพยายามที่สูงขึ้น) โมเดลที่นำหน้าอยู่แล้วด้วยความพยายามระดับปานกลาง แสดงว่าเข้าถึงจุดสูงสุดได้โดยไม่ต้องใช้การกำหนดค่าที่แพงที่สุด ซึ่งเป็นสัญญาณที่ดีกว่าสำหรับการใช้งานในชีวิตประจำวัน มากกว่าตัวเลขที่ปรากฏเฉพาะเมื่อใช้จ่ายสูงสุด

สำหรับ CursorBench, Anthropic อธิบายว่า Fable 5 เป็นเทคโนโลยีที่ล้ำสมัยที่สุดและนำเสนอผลลัพธ์โดยมุ่งเน้นไปที่ขอบเขตการใช้งานมากกว่าตัวเลขความแม่นยำเพียงอย่างเดียว วลีจากการประกาศคือ Fable 5 “ได้เปิดทางให้แก้ปัญหาแบบ long-horizon ซึ่งเคยทำไม่ได้ในโมเดลก่อนหน้า” CursorBench เน้นงานวิศวกรรมที่เกี่ยวข้องกับหลายไฟล์และหลายขั้นตอนที่ฐานโค้ดจริงต้องการ ดังนั้นการจัดอันดับที่เป็นเทคโนโลยีที่ล้ำสมัยที่สุดในที่นี้จึงบ่งบอกถึงการเขียนโค้ดแบบ agentic มากกว่าการเขียนฟังก์ชันแบบแยกส่วน

ผลลัพธ์ทั้งสองชี้ไปในทิศทางเดียวกัน: Fable 5 ถูกสร้างขึ้นเพื่อวิศวกรรมที่ยั่งยืน ไม่ใช่การเติมโค้ดเพียงเล็กน้อย หากคุณใช้เวลาตลอดวันในการทำงานกับ coding agent ที่วางแผน แก้ไขข้ามไฟล์ รันการทดสอบ และวนซ้ำ สิ่งเหล่านี้คือเกณฑ์มาตรฐานที่ตรงกับขั้นตอนการทำงานของคุณ โมเดลที่นำ FrontierCode ด้วยความพยายามปานกลางและผลักดัน CursorBench ไปสู่ขอบเขตใหม่ ควรจะทำงานได้ดีในการทำงานของ agent ที่ยาวนาน แทนที่จะล้มเหลวหลังจากผ่านไปไม่กี่ครั้ง
ความรู้และการเงิน: Finance Benchmark (Hebbia)
นอกเหนือจากการเขียนโค้ด ผลลัพธ์ที่ชัดเจนที่สุดสำหรับงานความรู้มาจาก Finance Benchmark ที่สร้างโดย Hebbia ซึ่งเป็นบริษัทที่มุ่งเน้น AI สำหรับงานด้านการเงินและกฎหมายที่เกี่ยวข้องกับเอกสารจำนวนมาก
Anthropic รายงานว่า Fable 5 ได้คะแนนสูงสุดกว่าโมเดลใดๆ ในเกณฑ์มาตรฐานนี้ โดยมีคะแนนที่เพิ่มขึ้นในสามด้านหลัก: การให้เหตุผลจากเอกสาร แผนภูมิ และตาราง การรวมกันนี้บ่งบอกได้ชัดเจน การวิเคราะห์ทางการเงินไม่ค่อยเป็นคำถามเรื่องความรู้ทั่วไป แต่มันคือการอ่านเอกสารจำนวนมาก การตรวจสอบตัวเลขหลายหน้า การเปรียบเทียบแผนภูมิกับข้อความที่อธิบาย และการดึงเซลล์ที่ถูกต้องออกจากตารางที่ซับซ้อนโดยไม่อ่านคอลัมน์ผิด นั่นคือทักษะที่ Finance Benchmark เน้นย้ำ และเป็นทักษะที่โมเดลที่เก่งเรื่องข้อความแต่ด้อยเรื่องข้อมูลที่มีโครงสร้างมักจะทำผิดพลาด
มุมมองด้านการมองเห็นก็มีความสำคัญในที่นี้เช่นกัน แผนภูมิและตารางมักเป็นรูปภาพหรือรูปแบบผสม ดังนั้นคะแนน Finance Benchmark ที่สูงจึงเป็นผลลัพธ์ส่วนหนึ่งจากการมองเห็น ซึ่งสอดคล้องกับการกล่าวอ้างที่กว้างขึ้นของ Anthropic ที่ว่า Fable 5 มีความแข็งแกร่งในการมองเห็น และบ่งบอกว่าโมเดลนี้สามารถจัดการเอกสารที่ยุ่งเหยิงในโลกแห่งความเป็นจริงที่พนักงานที่ทำงานด้านความรู้ต้องเจอ แทนที่จะเป็นเพียงอินพุตที่เป็นข้อความสะอาดๆ เท่านั้น
สำหรับนักพัฒนา การตีความเชิงปฏิบัติคือ Fable 5 เป็นตัวเลือกที่เหมาะสมสำหรับไปป์ไลน์การดึงข้อมูลจากเอกสาร เครื่องมือวิเคราะห์ทางการเงิน และเวิร์กโฟลว์ใดๆ ที่อินพุตเป็นไฟล์ PDF ที่เต็มไปด้วยตัวเลข แทนที่จะเป็น JSON payload ที่เป็นระเบียบเรียบร้อย หากผลิตภัณฑ์ของคุณอ่านสัญญา ใบแจ้งยอด หรือรายงาน และต้องถูกต้องเกี่ยวกับตัวเลข นี่คือตำแหน่งที่ต้องจับตามอง ตรวจสอบกับเอกสารของคุณเองก่อนที่จะเชื่อถือเกณฑ์มาตรฐานในการทำนายผลลัพธ์ของคุณ
การให้เหตุผลแบบ Long-horizon: FrontierBench (Cognition)
การประเมินจาก Cognition ครั้งที่สองคือ FrontierBench ซึ่งเป็นจุดที่เรื่องราวของความเป็นอิสระกลายเป็นการจัดอันดับเกณฑ์มาตรฐาน Anthropic รายงานว่า Fable 5 เป็นโมเดลที่มีคะแนนสูงสุดใน FrontierBench และชี้ให้เห็นว่าการให้เหตุผลแบบ long-horizon คือเหตุผลหลัก
การให้เหตุผลแบบ long-horizon คือความสามารถในการรักษากำหนดเป้าหมายและแผนการทำงานให้สอดคล้องกันตลอดงานที่ยาวนาน: หลายขั้นตอน หลายโทเค็น มีโอกาสมากมายที่จะหลงทาง เกณฑ์มาตรฐานส่วนใหญ่ให้รางวัลสำหรับคำตอบที่ถูกต้องสำหรับคำถามที่จำกัด แต่ FrontierBench ตามกรอบของ Anthropic ให้รางวัลแก่โมเดลที่สามารถทำงานได้อย่างต่อเนื่องในขณะที่หน้าต่างบริบทเต็มไปด้วยงานกลางที่โมเดลสร้างขึ้นเอง นั่นเป็นทักษะที่แตกต่างกัน และเป็นสิ่งที่ Anthropic ชี้ให้เห็นอยู่เสมอด้วยวลีเช่น “ยังคงมุ่งเน้นไปที่การทำงานนับล้านโทเค็น”
นี่เป็นตำแหน่งที่ตรวจสอบได้ยากที่สุดจากภายนอก โดยเฉพาะอย่างยิ่งเพราะมันยากที่จะวัดผล การประเมินแบบ long-horizon ต้องกำหนดว่า “การทำงานอย่างต่อเนื่อง” หมายถึงอะไร คะแนนความก้าวหน้าบางส่วนจะถูกนับอย่างไร และจะหยุดไม่ให้โมเดลโกงเมตริกโดยการถ่วงเวลาได้อย่างไร ดังนั้น ให้ถือว่าตำแหน่งใน FrontierBench เป็นสัญญาณที่แข็งแกร่งบ่งบอกว่า Fable 5 ถูกสร้างมาสำหรับ agent ที่ทำงานได้ด้วยตนเองและทำงานได้ยาวนาน โดยคำนึงว่าการให้คะแนนแบบ long-horizon เป็นพื้นที่ที่กำลังพัฒนา ซึ่งวิธีการยังคงแตกต่างกันไปในแต่ละห้องปฏิบัติการ เมื่อพิจารณาร่วมกับ CursorBench เรื่องราวก็สอดคล้องกัน: จุดแข็งของ Fable 5 ไม่ได้อยู่ที่การตอบคำถามยากๆ เพียงข้อเดียว แต่อยู่ที่การไม่ล้มเหลวเมื่อต้องทำงานที่ยาวนาน
ประสิทธิภาพในโลกแห่งความเป็นจริงที่เหนือกว่าเกณฑ์มาตรฐาน
เกณฑ์มาตรฐานเป็นเพียงตัวแทน ผลลัพธ์สองอย่างที่ Anthropic เน้นย้ำจากการใช้งานจริงนั้นอาจให้ข้อมูลที่เป็นประโยชน์มากกว่าตารางอันดับใดๆ เพราะมันแสดงให้เห็นว่าโมเดลกำลังทำงานจริง แทนที่จะเป็นการผ่านการทดสอบเท่านั้น
อย่างแรกคือ การย้ายฐานโค้ดของ Stripe Anthropic รายงานว่า Fable 5 สามารถย้ายฐานโค้ด Ruby ขนาด 50 ล้านบรรทัดสำหรับ Stripe ได้ในวันเดียว ซึ่งทีมงานประเมินว่าจะใช้เวลาสองเดือนหรือมากกว่านั้น โปรดอ่านอย่างรอบคอบ การย้ายฐานโค้ดขนาด 50 ล้านบรรทัดไม่ใช่ปริศนาการเขียนโค้ด แต่มันเป็นงานที่ใหญ่โต ซ้ำซาก และต้องใช้บริบทจำนวนมากในไฟล์นับพัน ซึ่งความไม่สอดคล้องกันเพียงเล็กน้อยก็สามารถทำให้บิลด์เสียหายได้ สัญญาณที่ได้ไม่ใช่ว่า Fable 5 ฉลาด แต่คือความสามารถในการแก้ไขโค้ดได้อย่างถูกต้องและสม่ำเสมอในขนาดที่ใหญ่มากโดยไม่หลงทาง ซึ่งเป็นความสามารถแบบ long-horizon ที่เกณฑ์มาตรฐานชี้ให้เห็น และแสดงให้เห็นบนระบบการผลิตจริง
อย่างที่สองคือ การทดสอบ Slay the Spire Slay the Spire เป็นเกมแนวเด็คสร้างโร๊คไลค์ และ Anthropic ใช้มันเพื่อทดสอบหน่วยความจำมากกว่าการเขียนโค้ด ด้วยการเปิดใช้งานหน่วยความจำไฟล์แบบถาวร Fable 5 แสดงให้เห็นการปรับปรุงประสิทธิภาพ 3 เท่าเมื่อเทียบกับ Opus 4.8 ในเกม กลไกที่น่าสนใจคือ: การปรับปรุงนี้มาจากการที่โมเดลสามารถเขียนบันทึกไปยังไฟล์และอ่านกลับมาได้ตลอดการเล่นแต่ละครั้ง สะสมกลยุทธ์เหมือนกับที่ผู้เล่นมนุษย์ทำ ซึ่งบ่งบอกว่าโมเดลจะดีขึ้นอย่างมีนัยสำคัญเมื่อคุณให้หน่วยความจำที่คงทน แทนที่จะเริ่มต้นใหม่ทุกครั้งที่ใช้งาน
สิ่งเหล่านี้บอกอะไรคุณที่เกณฑ์มาตรฐานไม่ได้บอก? มีสองสิ่ง อย่างแรกคือ ความทนทานต่อขนาด: คำถามในเกณฑ์มาตรฐานมักมีขนาดเล็กโดยเจตนา และผลลัพธ์ของ Stripe แสดงพฤติกรรมในขนาดที่ไม่มีการประเมินมาตรฐานใดทำได้ถึง อย่างที่สองคือ หน่วยความจำและการใช้เครื่องมือเป็นตัวเพิ่มประสิทธิภาพ ผลลัพธ์จาก Slay the Spire ไม่ได้เกี่ยวกับ IQ ดิบของโมเดล แต่เกี่ยวกับว่าโมเดลจะดีขึ้นได้อย่างไรเมื่อเชื่อมต่อกับสภาพแวดล้อมที่มีสถานะถาวร คุณสมบัติทั้งสองนี้คุณจะเห็นได้ก็ต่อเมื่อโมเดลถูกฝังอยู่ในระบบจริง ซึ่งเป็นเหตุผลว่าทำไมจึงเปรียบเทียบข้ามผู้จำหน่ายได้ยากกว่า หากคุณกำลังประเมิน Fable 5 สำหรับ agent ที่ทำงานได้นานหลายชั่วโมงและเก็บบันทึกของตัวเอง สัญญาณเหล่านี้มีความสำคัญมากกว่าเปอร์เซ็นต์ความแม่นยำเพียงอย่างเดียว
วิธีอ่านผลลัพธ์เหล่านี้
สรุปเกณฑ์มาตรฐานที่เอาแต่ยกยอไม่มีประโยชน์ นี่คือข้อควรระวังที่ควรพิจารณาควบคู่ไปกับการจัดอันดับ
เจ้าของเกณฑ์มาตรฐานเป็นพันธมิตร. FrontierCode และ FrontierBench มาจาก Cognition และ Finance Benchmark มาจาก Hebbia องค์กรเหล่านี้เป็นองค์กรที่น่าเชื่อถือที่สร้างการประเมินที่จริงจัง และการมีส่วนร่วมของพวกเขาก็เป็นข้อดี ไม่ใช่สัญญาณอันตราย แต่พวกเขาก็เป็นพันธมิตรในการนำเสนอเรื่องราวการเปิดตัวด้วย และเกณฑ์มาตรฐานที่ออกแบบโดยฝ่ายหนึ่งมักจะให้รางวัลแก่ความสามารถที่ฝ่ายนั้นให้ความสำคัญ นั่นไม่ได้ทำให้ผลลัพธ์ผิดพลาด แต่มันหมายความว่าคุณควรต้องการการทำซ้ำจากแหล่งอิสระก่อนที่จะถือว่าผลลัพธ์นั้นเป็นที่สิ้นสุด ตรวจสอบข้ามกับข้อมูลเปรียบเทียบที่เป็นกลาง เช่น บทความของเราเกี่ยวกับ MiniMax M3 เทียบกับ Opus 4.7 เทียบกับ GPT-5.5 เพื่อดูว่าโมเดลของ Anthropic เปรียบเทียบกับกรอบการประเมินอื่นๆ ได้อย่างไร
การตั้งค่า “ความพยายาม” ทำให้ผลลัพธ์แตกต่างกันไป. ผลลัพธ์ของ FrontierCode รายงานที่ความพยายามระดับปานกลาง ซึ่งเป็นเรื่องที่น่าพอใจ แต่ความพยายามเป็นตัวแปรที่แท้จริงในการประเมินเหล่านี้ โมเดลสองรุ่นที่เปรียบเทียบกันที่ระดับความพยายามที่ต่างกันนั้นไม่ใช่การเปรียบเทียบที่เป็นธรรม และตัวเลขที่อ้างถึงโดยไม่มีการตั้งค่าความพยายามก็ถือว่าไม่สมบูรณ์ เมื่อคุณเห็นคะแนน Fable 5 ออนไลน์ ให้ตรวจสอบว่าความพยายามและจำนวนครั้งที่ใช้ในการสร้างคะแนนนั้นเป็นอย่างไร ก่อนที่คุณจะนำไปเปรียบเทียบกับสิ่งอื่นใด
คะแนนสาธารณะมีจำกัด. การประกาศของ Anthropic เน้นที่ตำแหน่งการจัดอันดับ และแผนภูมิที่มีรายละเอียดมาในรูปแบบรูปภาพ ซึ่งเป็นเหตุผลว่าทำไมบทความนี้จึงเน้นที่เชิงคุณภาพในการประเมินเฉพาะ ตัวเลือกสำรองได้เติมเต็มช่องว่างด้วยตัวเลข แต่ตัวเลขเหล่านั้นแตกต่างกันไปและไม่สามารถสืบค้นกลับไปยังแหล่งที่มาหลักได้ทั้งหมด ดังนั้นจึงไม่ควรใช้เป็นจุดยึดในการตัดสินใจซื้อในตอนนี้ เมื่อ Cognition และ Hebbia เผยแพร่ตารางอันดับของตนเอง ให้เลือกใช้ข้อมูลเหล่านั้นจะดีกว่า
ตำแหน่งไม่ใช่ส่วนต่าง. “คะแนนสูงสุด” บอกอันดับของคุณ ไม่ใช่ส่วนต่าง โมเดลสามารถนำหน้าด้วยหนึ่งคะแนนหรือยี่สิบคะแนน และทั้งสองมีความหมายที่แตกต่างกันสำหรับการพิจารณาว่าการอัปเกรดนั้นคุ้มค่ากับราคา 10/50 ดอลลาร์หรือไม่ หากไม่มีคะแนนพื้นฐาน ให้ถือว่าการนำหน้านั้นเป็นจริงแต่ไม่ได้ระบุปริมาณ
ทั้งหมดนี้ไม่ใช่เหตุผลที่จะละทิ้งผลลัพธ์ การที่ Fable 5 นำหน้าทั้งในด้านการเขียนโค้ด การเงิน การมองเห็น และการให้เหตุผลแบบ long-horizon รวมถึงการนำไปใช้งานจริงกับ Stripe และ Slay the Spire ถือเป็นภาพรวมที่แข็งแกร่งและสอดคล้องกัน เป็นเหตุผลที่คุณควรตรวจสอบกับปริมาณงานของคุณเองก่อนตัดสินใจใช้งาน ซึ่งเป็นการดำเนินการที่ถูกต้องสำหรับโมเดลใหม่ๆ ไม่ว่าจะสร้างโดยใครก็ตาม ภาพรวมโมเดล เป็นแหล่งข้อมูลที่ใช้ยืนยัน ID ปัจจุบัน ราคา และข้อจำกัดของบริบท ก่อนที่คุณจะเริ่มใช้งาน
รันเกณฑ์มาตรฐานของคุณเองด้วย Apidog
เกณฑ์มาตรฐานที่น่าเชื่อถือที่สุดคือเกณฑ์มาตรฐานที่ใช้พร้อมท์ของคุณเองและคำจำกัดความของ “ดี” ของคุณเอง คุณไม่จำเป็นต้องมีเครื่องมือวิจัยที่ซับซ้อนเพื่ออ่านค่าที่เป็นประโยชน์ สร้างการประเมินแบบ DIY ที่ไม่ซับซ้อนโดยการส่งพร้อมท์ทดสอบที่กำหนดไปยัง Fable 5 API และเปรียบเทียบการตอบสนองกับ Opus 4.8 ในสามแกนที่คุณสามารถวัดได้โดยตรง: คุณภาพของผลลัพธ์ ความหน่วง และค่าใช้จ่ายโทเค็น

นี่คือวิธีง่ายๆ ในการทำเช่นนั้นด้วย Apidog ซึ่งเป็นแพลตฟอร์ม API สำหรับการออกแบบ ทดสอบ และจัดทำเอกสารคำขอ แนวคิดคือการสร้างคำขอหนึ่งรายการใน Apidog ชี้ไปยังแต่ละโมเดล และอ่านการตอบสนอง เวลา และการใช้โทเค็นเทียบเคียงกัน
ตั้งค่าคำขอ POST ไปยังเอนด์พอยต์ข้อความของ Claude และบันทึกเป็นคำขอที่นำกลับมาใช้ใหม่ได้ใน Apidog เพื่อให้คุณสามารถรันซ้ำได้โดยไม่ต้องพิมพ์ใหม่
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json
ระบุเนื้อหาที่มีงานที่กำหนดไว้ เลือกพร้อมท์ที่ดูเหมือนงานจริงของคุณ ไม่ใช่แค่ของเล่น คำสั่งแบบการย้ายข้อมูลเป็นการทดสอบความเครียดที่ดีสำหรับโมเดลการเขียนโค้ด:
{
"model": "claude-fable-5",
"max_tokens": 2048,
"messages": [
{
"role": "user",
"content": "Refactor this Ruby method to use keyword arguments and add RSpec tests. Return only the updated code:\n\ndef charge(amount, currency, customer_id, idempotency_key)\n # ...\nend"
}
]
}
รันหนึ่งครั้งกับ claude-fable-5 จากนั้นทำซ้ำคำขอ เปลี่ยนช่อง model เป็น claude-opus-4-8 และรันพร้อมท์เดียวกัน เนื่องจากอินพุตเหมือนกัน ความแตกต่างใดๆ ในเอาต์พุตจึงมาจากโมเดล ไม่ใช่พร้อมท์
ตอนนี้อ่านสัญญาณสามอย่างที่ Apidog แสดงให้เห็นสำหรับการเรียกแต่ละครั้ง:
- คุณภาพ. ประเมินการตอบสนองทั้งสองรายการด้วยเกณฑ์ของคุณเอง การทดสอบครอบคลุมกรณีขอบหรือไม่? การปรับโครงสร้างยังคงถูกต้องหรือไม่? ให้คะแนนทั้งสองก่อนที่คุณจะดูว่าโมเดลใดสร้างผลลัพธ์ใด
- ความหน่วง. Apidog แสดงเวลาตอบสนองสำหรับแต่ละคำขอ สำหรับเครื่องมือแบบโต้ตอบ โมเดลที่แม่นยำเป็นสองเท่าแต่ช้ากว่าสี่เท่าก็อาจยังไม่ใช่ตัวเลือกที่ถูกต้อง
- ค่าใช้จ่ายโทเค็น. การตอบสนองของ Claude จะมีบล็อก
usageที่มีinput_tokensและoutput_tokensคูณด้วยอัตราที่เผยแพร่ (10 ดอลลาร์และ 50 ดอลลาร์ต่อล้านสำหรับ Fable 5, 5 ดอลลาร์และ 25 ดอลลาร์สำหรับ Opus 4.8) เพื่อให้ได้ค่าใช้จ่ายที่แท้จริงของการตอบแต่ละครั้ง
ทำซ้ำขั้นตอนนี้กับพร้อมท์ห้าถึงสิบรายการที่สะท้อนการใช้งานจริงของคุณ และคุณจะมีเกณฑ์มาตรฐานขนาดเล็กที่ซื่อสัตย์ซึ่งบอกคุณในสิ่งที่ตารางอันดับสาธารณะบอกไม่ได้: ว่า Fable 5 มีข้อได้เปรียบในงานของคุณในราคาที่คุณยินดีจ่ายหรือไม่ คุณสามารถ ดาวน์โหลด Apidog และตั้งค่านี้ได้ภายในไม่กี่นาที สำหรับการวิเคราะห์ต้นทุนที่ลึกซึ้งยิ่งขึ้น คู่มือ การกำหนดราคา Fable 5 ของเราได้คำนวณไว้แล้ว
