GPT-5.6 ของ OpenAI เปิดให้บริการทั่วไปเมื่อวันที่ 9 กรกฎาคม 2026 หลังจากช่วงพรีวิวแบบปิดเป็นเวลาสองสัปดาห์ และรุ่นเรือธง Sol ก็เปิดตัวพร้อมกับตัวเลขที่ประกาศว่าครองตำแหน่งสูงสุดด้าน agentic Claude Fable 5 ของ Anthropic ได้ชูธง "โมเดลที่ทรงประสิทธิภาพที่สุด" อีกด้านหนึ่งมาตั้งแต่ต้นเดือนมิถุนายน หากคุณกำลังเลือกรุ่นเรือธงสำหรับงานจริงในไตรมาสนี้ ตอนนี้คุณมีสองคำตอบที่น่าเชื่อถือและพาดหัวข่าวที่ขัดแย้งกันมากมาย
นี่คือส่วนที่การเปรียบเทียบส่วนใหญ่มักจะละเลย: ไม่มีโมเดลใดที่ชนะทุกอย่าง และตัวเลขจากผู้พัฒนาก็เป็นเช่นนั้น ตามรายงานการเปิดตัวของ OpenAI, Sol นำหน้าในการวัดประสิทธิภาพด้าน agentic โดยรวมอย่างมาก รายงานเดียวกันนี้ยังแสดงให้เห็นว่า Claude Fable 5 นำหน้า SWE-Bench Pro เกือบ 16 คะแนน การเปรียบเทียบใดๆ ที่ยกให้ฝ่ายใดฝ่ายหนึ่งเป็นผู้ชนะโดยรวมนั้นมักจะมีอะไรแอบแฝง
ดังนั้นบทความนี้จะไม่เป็นเช่นนั้น ด้านล่างนี้คือการแบ่งผลการวัดประสิทธิภาพพร้อมตัวเลขที่อ้างอิงทั้งหมด ความหมายของการแบ่งนี้สำหรับงานที่คุณทำ ราคาของทั้งสองฝ่าย ความแตกต่างของ API และคู่มือการตัดสินใจ เราได้ครอบคลุม GPT-5.6 Sol คืออะไร ในคำอธิบายแยกต่างหาก และ ประกาศอย่างเป็นทางการของ GPT-5.6 เป็นแหล่งข้อมูลหลักสำหรับการกล่าวอ้างของ OpenAI
บทสรุปเบื้องต้น
| งานที่ต้องทำ | ตัวเลือกที่แข็งแกร่งกว่าในวันนี้ | หลักฐาน |
|---|---|---|
| การทำงานแบบ agentic ทั่วไป | GPT-5.6 Sol | Agents’ Last Exam ~53 เทียบกับ GPT-5.5 ที่ 46.9 ตามข้อมูลของ OpenAI |
| วิศวกรรมซอฟต์แวร์เชิงลึก | Claude Fable 5 | SWE-Bench Pro 80.3% เทียบกับ Sol ที่ 64.6% ตามตารางของ OpenAI เอง |
| งาน agent ที่ขับเคลื่อนด้วยเทอร์มินัล | GPT-5.6 Sol, เฉือนชนะ | Terminal-Bench 2.1: 88.8%, 91.9% เมื่อใช้โหมด ultra ตามข้อมูลของ OpenAI |
| ราคาต่อโทเค็นที่ถูกที่สุด | GPT-5.6 Sol | $5 / $30 ต่อ 1 ล้านโทเค็น เทียบกับ Fable 5 ที่ประกาศไว้ $10 / $50 |
| การทำงานแบบหลาย agent พร้อมกันในตัว | GPT-5.6 | การตั้งค่า ultra รันสี่ agents พร้อมกันโดยค่าเริ่มต้น |
| โมเดลเดียวที่ชนะทุกอย่าง | ไม่มี | โมเดลนั้นยังไม่มีอยู่ในขณะนี้ |
ข้อควรระวังหนึ่งข้อที่ครอบคลุมตารางทั้งหมดคือ: ตัวเลขการวัดประสิทธิภาพทุกตัวถูกรายงานโดยผู้พัฒนา เผยแพร่เมื่อเปิดตัว และยังไม่ได้ถูกทำซ้ำโดยอิสระ ควรอ่านเป็นแผนที่ของการกล่าวอ้าง ไม่ใช่การจัดอันดับที่แน่นอน การวัดประสิทธิภาพเพียงอย่างเดียวที่ตัดสินทุกอย่างได้คืองานของคุณเอง และเราจะแสดงวิธีรันงานนั้นเทียบเคียงกันใน Apidog เกือบจะในตอนท้าย
การแบ่งผลการวัดประสิทธิภาพ ตามข้อมูลของ OpenAI
ตัวเลขสามตัวกำหนดการเปรียบเทียบนี้ และทั้งสามตัวมาจากเอกสารการเปิดตัวของ OpenAI แหล่งข้อมูลนั้นมีทั้งข้อดีและข้อเสีย ดังนั้นโปรดพิจารณาไว้
| การวัดประสิทธิภาพ | GPT-5.6 Sol | Claude Fable 5 | ที่มา |
|---|---|---|---|
| Agents’ Last Exam | ~53 (รายงานระบุช่วง 52.7 ถึง 53.6) | ตามหลัง Sol ประมาณ 13 คะแนน | OpenAI, วันเปิดตัว |
| SWE-Bench Pro | 64.6% | 80.3% | OpenAI, วันเปิดตัว |
| Terminal-Bench 2.1 | 88.8% (91.9% เมื่อใช้โหมด ultra) | ไม่ได้ระบุในตารางของ OpenAI | OpenAI, วันเปิดตัว |
ในการทดสอบ Agents’ Last Exam, OpenAI รายงานว่า Sol ได้ประมาณ 53 คะแนน ซึ่งเพิ่มขึ้นจาก 46.9 ของ GPT-5.5 และนำ Claude Fable 5 อยู่ประมาณ 13 คะแนน นี่คือการก้าวกระโดดครั้งใหญ่ในการวัดประสิทธิภาพที่สร้างขึ้นจากงาน agentic ที่ซับซ้อนหลายขั้นตอน และเป็นตัวเลขที่ OpenAI นำเสนอเป็นหลัก
ในการทดสอบ SWE-Bench Pro ภาพกลับกัน ตารางเปรียบเทียบของ OpenAI เองแสดงให้เห็นว่า Claude Fable 5 ได้ 80.3% เทียบกับ Sol ที่ 64.6% ต้องให้เครดิตตรงที่ การเผยแพร่ผลขาดทุน 15.7 คะแนนในเอกสารเปิดตัวของคุณเองนั้นเป็นเรื่องไม่ปกติ และทำให้ตารางส่วนที่เหลือดูน่าเชื่อถือมากขึ้น นอกจากนี้ยังตรงกับสิ่งที่ SWE-Bench Pro วัด ซึ่งคือการแก้ไขปัญหาทางวิศวกรรมซอฟต์แวร์ที่ยากในคลังเก็บโค้ดจริงตั้งแต่ต้นจนจบ
Terminal-Bench 2.1 สรุปกรณีของ Sol OpenAI รายงาน 88.8% สำหรับ Sol มาตรฐาน และ 91.9% เมื่อโหมด ultra กระจายงานไปยัง agent สี่ตัวแบบขนาน โปรดทราบว่าตัวเลขของโหมด ultra เป็นโหมดการทำงานที่แตกต่างกัน โดยมีการใช้โทเค็นที่สูงขึ้นโดยเจตนา ไม่ใช่โมเดลเดียวกันที่คิดหนักขึ้น
มีสองข้อที่ต้องพิจารณาก่อนที่คุณจะให้น้ำหนักกับข้อมูลเหล่านี้ ประการแรก นี่คือการกล่าวอ้างในวันเปิดตัวจากผู้พัฒนาที่มีผลประโยชน์สูงสุด ยังไม่มีใครภายนอก OpenAI ทำซ้ำได้ และการเลือกชุดเครื่องมือประเมินก็สามารถทำให้คะแนนเปลี่ยนแปลงได้ ประการที่สอง การวัดประสิทธิภาพเดี่ยวๆ มักจะรวมข้อมูลไว้มาก บทความเปิดตัวของ Simon Willison เป็นการอ่านอิสระที่เป็นประโยชน์เกี่ยวกับการเปิดตัวนี้ และ การวิเคราะห์การวัดประสิทธิภาพของ GPT-5.6 Sol ของเราจะอธิบายรายละเอียดว่าแต่ละการทดสอบวัดอะไร
ความหมายของการแบ่ง
รูปแบบในตัวเลขสามตัวนั้นไม่ได้สุ่มเกิดขึ้น มันแสดงให้เห็นถึงความเชี่ยวชาญที่แตกต่างกันสองอย่าง
จุดเด่นของ Sol คือความครอบคลุม Agents’ Last Exam และ Terminal-Bench ทั้งคู่ให้รางวัลโมเดลที่สามารถวางแผนหลายขั้นตอน จัดการเครื่องมือ กู้คืนจากข้อผิดพลาด และขับเคลื่อนงานที่หลากหลายให้สำเร็จ หากงานของคุณเป็นเหมือนกองทัพของ agents ที่จัดการตั๋ว การวิจัย ระบบอัตโนมัติในการดำเนินงาน หรือไปป์ไลน์ที่ขับเคลื่อนด้วยเทอร์มินัล ตัวเลขของ OpenAI ชี้ว่า Sol เป็นตัวเลือกที่แข็งแกร่งกว่า
จุดเด่นของ Fable 5 คือความลึก SWE-Bench Pro เป็นตัวชี้วัดสาธารณะที่ใกล้เคียงที่สุดสำหรับคำถามที่ว่า "โมเดลนี้สามารถทำงานวิศวกรรมซอฟต์แวร์ที่ซับซ้อนและเป็นจริงในโค้ดเบสที่มีอยู่ได้หรือไม่ โดยไม่ต้องให้มนุษย์มาแก้ไขในภายหลัง" การนำ 15.7 คะแนนในจุดนั้น ซึ่งคู่แข่งยอมรับ ไม่ใช่เรื่องเล็กน้อย แม้จะรวมช่วงความคลาดเคลื่อนที่กว้างแล้วก็ตาม หากงานของคุณเป็นการปรับโครงสร้างโค้ดขนาดใหญ่ การดีบักที่ซับซ้อน หรือการรันงานวิศวกรรมโครงการเดียวที่ยาวนาน นั่นคือตัวเลขที่คุณควรยึดเป็นค่าเริ่มต้น
ซึ่งหมายความว่าคำถามที่ถูกต้องไม่ใช่ "โมเดลไหนดีกว่ากัน" แต่เป็น "งานไหนในสองงานนี้ที่ดูคล้ายกับงานของฉันมากกว่า" การเลือกตามคะแนนรวมบนกระดานจัดอันดับเป็นการเพิ่มประสิทธิภาพสำหรับงานที่คุณไม่มี
การเปรียบเทียบราคา
OpenAI ได้เผยแพร่ราคา GA ที่ชัดเจนสำหรับ GPT-5.6 ทั้งสามระดับ ราคา Fable 5 ของ Anthropic ด้านล่างนี้คือราคาที่เผยแพร่เมื่อเปิดตัว โปรดยืนยันอัตราปัจจุบันในหน้าการกำหนดราคาของ Anthropic ก่อนจัดทำงบประมาณ เนื่องจากเงื่อนไขการเข้าถึงได้เปลี่ยนไปใช้เครดิตการใช้งานสำหรับสมาชิกในเดือนกรกฎาคม
| โมเดล | อินพุตต่อ 1 ล้านโทเค็น | เอาต์พุตต่อ 1 ล้านโทเค็น |
|---|---|---|
| gpt-5.6-sol (ชื่อเรียก gpt-5.6 เปล่าๆ จะถูกส่งมาที่นี่) | $5.00 | $30.00 |
| gpt-5.6-terra | $2.50 | $15.00 |
| gpt-5.6-luna | $1.00 | $6.00 |
| claude-fable-5 | $10.00 (ตามที่ประกาศ; ตรวจสอบอีกครั้ง) | $50.00 (ตามที่ประกาศ; ตรวจสอบอีกครั้ง) |
ตามตารางราคา Sol มีราคาถูกกว่า Fable 5 ครึ่งหนึ่งต่อโทเค็น ทั้งอินพุตและเอาต์พุต นั่นคือความแตกต่างที่สำคัญ แต่ราคาหน้าฉลากเป็นตัวบ่งชี้ที่ไม่ดีนักว่างานหนึ่งๆ มีค่าใช้จ่ายเท่าไร โมเดลทั้งสองมีการโทเค็นที่แตกต่างกัน ผลิตความยาวเอาต์พุตที่แตกต่างกันสำหรับพร้อมต์เดียวกัน และใช้ปริมาณการให้เหตุผลที่แตกต่างกันเพื่อไปถึงคำตอบ โมเดลที่มีราคาถูกกว่าต่อโทเค็นและพูดมากต่อภารกิจอาจมีต้นทุนเท่ากันในที่สุด
การแคชช่วยลดช่องว่างลงได้อีกจากทั้งสองฝ่าย GPT-5.6 รองรับจุดพักแคชที่ชัดเจน โดยการเขียนแคชคิดค่าบริการ 1.25 เท่าของอัตราอินพุตที่ไม่ได้แคช การอ่านแคชจะได้รับส่วนลด 90% และมีอายุแคชขั้นต่ำ 30 นาที การแคชพร้อมต์ของ Fable 5 ยังให้ส่วนลด 90% สำหรับ cache hits ซึ่งมีความสำคัญเป็นสองเท่าเมื่อเทียบกับอัตราพื้นฐานที่สูงกว่า การวิเคราะห์ราคา Claude Fable 5 ของเราครอบคลุมว่าการประหยัดเหล่านั้นปรากฏขึ้นในทางปฏิบัติอย่างไร ไม่ว่าด้วยวิธีใด ตัวเลขที่ต้องติดตามคือต้นทุนต่องานที่เสร็จสมบูรณ์ ไม่ใช่ต้นทุนต่อล้านโทเค็น
ความแตกต่างของ API
ตอนนี้ทั้งสองบริษัทไม่ได้นำเสนอเพียงแค่เอนด์พอยต์สำหรับการสนทนาเท่านั้น และรูปแบบที่แตกต่างกันก็มีผลต่อการตัดสินใจ
พื้นผิว API ของ GPT-5.6 ตาม เอกสารสำหรับนักพัฒนาของ OpenAI มุ่งเน้นไปที่การควบคุมและการจัดการภายใน Responses API:
- ระดับความพยายามในการให้เหตุผลหกระดับ ตั้งแต่ไม่มีเลยไปจนถึงสูงสุด เพื่อให้คุณสามารถปรับความลึกได้ตามแต่ละคำขอ
- โหมด Pro เป็นการตั้งค่า (reasoning.mode: “pro”) บนโมเดลทั้งสามสำหรับงานที่เน้นคุณภาพเป็นอันดับแรก มันเป็นเพียงปุ่มปรับ ไม่ใช่โมเดลแยกต่างหาก
- Ultra, การตั้งค่าแบบหลาย agent ที่รัน agent สี่ตัวแบบขนานโดยค่าเริ่มต้น มันแลกมาด้วยการใช้โทเค็นที่สูงขึ้นเพื่อผลลัพธ์ที่รวดเร็วกว่า และมีอยู่ใน ChatGPT Work สำหรับแผน Pro และ Enterprise รวมถึง Codex จาก Plus ขึ้นไป
- การเรียกใช้เครื่องมือแบบโปรแกรม ที่โมเดลเขียน JavaScript เพื่อจัดการการเรียกใช้เครื่องมือของคุณภายใน V8 runtime ที่แยกต่างหากโดยไม่มีการเข้าถึงเครือข่าย
- การให้เหตุผลที่คงอยู่ข้ามการสนทนา การทำงานแบบหลาย agent ในเวอร์ชันเบต้า และการตั้งค่ารายละเอียดการมองเห็นที่รักษาขนาดภาพต้นฉบับ
Claude Fable 5 เป็นโมเดลระดับสูงสุดในตระกูล Claude 5 ซึ่งเปิดตัวพร้อมกับ Claude Mythos 5 ใน ประกาศของ Anthropic พื้นผิว API ที่เผยแพร่ของโมเดลนี้ประกอบด้วยหน้าต่างบริบท (context window) ขนาด 1 ล้านโทเค็นเป็นค่าเริ่มต้น, เอาต์พุตสูงสุด 128K โทเค็นต่อคำขอ และพารามิเตอร์การสำรองข้อมูลฝั่งเซิร์ฟเวอร์ (server-side fallbacks) ที่สามารถเปลี่ยนเส้นทางคำขอที่ถูกปฏิเสธด้วยเหตุผลด้านความปลอดภัยไปยัง Claude Opus 4.8 ภายใน API call เดียวกัน Anthropic นำเสนอโมเดลนี้สำหรับงานที่ต้องการการให้เหตุผลสูงและงาน agentic ระยะยาว และมีชุด agentic ของตัวเองที่ประกอบด้วย Claude Code และเวิร์กโฟลว์ย่อยของ agent คำอธิบาย Claude Fable 5 ของเราครอบคลุมรายละเอียดคุณสมบัติทั้งหมด
ขนาดของ context window เกือบจะเท่ากัน: Fable 5 ที่ 1M ได้รับการยืนยันแล้ว และเอกสารในช่วงแรกรายงานว่า GPT-5.6 ก็มีขนาด 1M เช่นกัน แม้ว่าหน้าข้อมูลจำเพาะของ OpenAI ควรเป็นแหล่งข้อมูลที่เชื่อถือได้ของคุณ ความแตกต่างที่ใหญ่กว่าคือปรัชญา OpenAI กำลังเปิดเผยฟังก์ชันพื้นฐานสำหรับการจัดการ (การทำงานแบบขนาน, การเรียกใช้เครื่องมือแบบโปรแกรม, การปรับระดับความพยายาม) ในฐานะคุณสมบัติ API ระดับแนวหน้า Anthropic กำลังนำเสนอเอนจินโมเดลเดี่ยวที่ลึกซึ้งพร้อมระบบความน่าเชื่อถือที่ซับซ้อน ไม่มีแนวทางใดผิดพลาด ทั้งสองสะท้อนให้เห็นถึงการแบ่งความกว้างเทียบกับความลึกแบบเดียวกับที่ผลการวัดประสิทธิภาพแสดง
คู่มือการตัดสินใจเชิงปฏิบัติ
หากตัดเสียงรบกวนจากการเปิดตัวออกไป การเลือกจะเหลือเพียงไม่กี่คำถาม
เลือก GPT-5.6 Sol เป็นค่าเริ่มต้นของคุณเมื่อ:
- งานของคุณคือการจัดการฝูง agent, การจัดการเครื่องมือ หรือการทำงานที่หลากหลายจำนวนมากโดยไม่มีผู้ดูแล
- คุณต้องการการทำงานแบบขนานและการควบคุมความพยายามต่อคำขอเป็นฟังก์ชันพื้นฐานของ API แทนที่จะต้องสร้างเอง
- ข้อจำกัดด้านงบประมาณโทเค็นเป็นเรื่องจริง และตารางราคา $5 / $30 พร้อมกับ Terra และ Luna เป็นตัวเลือกที่ลดระดับลงนั้นเหมาะสมกับเศรษฐศาสตร์หน่วยของคุณ
เลือก Claude Fable 5 เป็นค่าเริ่มต้นของคุณเมื่อ:
- งานคืองานวิศวกรรมซอฟต์แวร์ที่ซับซ้อนในคลังเก็บโค้ดจริง ซึ่งเป็นจุดที่ SWE-Bench Pro ชี้ให้เห็นถึงความแตกต่าง
- คุณรันงานเดี่ยวที่ยาวนานและลึกซึ้ง และให้ความสำคัญกับความสามารถสูงสุดต่องานมากกว่าปริมาณงานของระบบโดยรวม
- คุณได้ลงทุนในชุดเครื่องมือของ Claude อยู่แล้ว และพฤติกรรมการสำรองข้อมูลและการแคชของมัน
ใช้ทั้งสองเมื่อทำได้ API เหล่านี้เป็น HTTP API ที่มี SDKs ที่สมบูรณ์แล้ว และการกำหนดเส้นทางตามประเภทงาน (Sol สำหรับงานที่เน้นการจัดการ, Fable 5 สำหรับงานที่เน้นวิศวกรรม) เป็นสถาปัตยกรรมปกติในปี 2026 ไม่ใช่เรื่องแปลกใหม่
ทดสอบทั้งสองกับงานของคุณเอง
การวัดประสิทธิภาพของผู้พัฒนาทำให้คุณมีตัวเลือกสองตัว พร้อมต์ของคุณเองควรเป็นการตัดสินใจขั้นสุดท้าย และสิ่งนี้ต้องใช้เวลาช่วงบ่าย ไม่ใช่การวิ่งแข่ง
โมเดลทั้งสองสามารถเข้าถึงได้ผ่าน HTTP ธรรมดา: GPT-5.6 ผ่าน Responses API ของ OpenAI และ Fable 5 ผ่าน Messages API ของ Anthropic ใน Apidog ให้บันทึกแต่ละโมเดลเป็นสภาพแวดล้อมของตัวเอง โดยมี Base URL, หัวข้อการยืนยันตัวตน (auth header) และ ID โมเดลเป็นตัวแปร จากนั้นสร้างชุดคำขอ 10 ถึง 20 พร้อมต์จากงานจริงของคุณ ตั๋ว, diffs และชุดการเรียกใช้เครื่องมือที่คุณจัดการทุกสัปดาห์ และรันชุดนั้นกับแต่ละสภาพแวดล้อม
เปรียบเทียบสองสิ่งต่อพร้อมต์ ประการแรก คุณภาพของคำตอบ โดยตัดสินโดยผู้ที่รับผิดชอบงานนั้นๆ ประการที่สอง ช่องการใช้งานในแต่ละส่วนของคำตอบ เนื่องจากจำนวนโทเค็นคูณอัตราค่าบริการจะให้ต้นทุนที่แท้จริงต่องาน ซึ่งเป็นจุดที่การประมาณการ "Sol ราคาถูกกว่าครึ่งหนึ่ง" จะถูกทดสอบกับเอาต์พุตที่สั้นกว่าหรือยาวกว่าของ Fable 5 บนข้อมูลของคุณ หาก agent ของคุณจะจัดการเครื่องมือภายใน ให้จำลองเอนด์พอยต์ของเครื่องมือเหล่านั้นก่อน เพื่อให้ทั้งสองโมเดลวางแผนตามการตอบสนองที่เหมือนกันและเสถียร หลักฐานจากการทดสอบเคียงข้างกันเพียงหนึ่งชั่วโมงก็ดีกว่าตารางเปิดตัวใดๆ
คำถามที่พบบ่อย
GPT-5.6 Sol ดีกว่า Claude Fable 5 หรือไม่?
ในบางงาน ตามตัวเลขการเปิดตัวของ OpenAI Sol นำหน้า Agents’ Last Exam ประมาณ 13 คะแนน ในขณะที่ Fable 5 นำหน้า SWE-Bench Pro 15.7 คะแนนในตารางเดียวกัน ไม่มีผู้ชนะเพียงหนึ่งเดียวที่แท้จริง จับคู่โมเดลกับงาน: งาน agentic ทั่วไปเหมาะกับ Sol, วิศวกรรมซอฟต์แวร์เชิงลึกเหมาะกับ Fable 5
โมเดลใดมีค่าใช้จ่ายในการรันถูกกว่ากัน?
ตารางราคาของ Sol มีราคาเป็นครึ่งหนึ่งของราคาที่ประกาศไว้ของ Fable 5: $5 / $30 ต่อ 1 ล้านโทเค็น เทียบกับ $10 / $50 (ตรวจสอบอัตราปัจจุบันของ Anthropic ก่อนจัดทำงบประมาณ) ต้นทุนจริงขึ้นอยู่กับการโทเค็น ความยาวของเอาต์พุต และการแคช ดังนั้นควรวัดต้นทุนต่องานที่เสร็จสมบูรณ์ด้วยพร้อมต์ของคุณเอง ก่อนที่จะสรุปว่าช่องว่าง 2 เท่านี้เป็นจริงเสมอ
ฉันสามารถใช้ทั้งสองโมเดลในผลิตภัณฑ์เดียวได้หรือไม่?
ได้ และหลายทีมก็ทำเช่นนั้น ทั้งคู่เป็น HTTP API มาตรฐาน ดังนั้นคุณสามารถกำหนดเส้นทางงานที่เน้นการจัดการไปยัง Sol และงานที่เน้นวิศวกรรมไปยัง Fable 5 ผ่านอินเทอร์เฟซเดียว คู่มือของเราเกี่ยวกับ วิธีใช้ Claude Fable 5 API ครอบคลุมฝั่ง Anthropic รวมถึงการยืนยันตัวตนและรูปแบบคำขอ
ตัวเลขการวัดประสิทธิภาพเหล่านี้ได้รับการยืนยันโดยอิสระหรือไม่?
ไม่ ตัวเลขทุกตัวในบทความนี้ถูกรายงานโดยผู้พัฒนาจากเอกสารเปิดตัวของ OpenAI เมื่อวันที่ 9 กรกฎาคม รวมถึงผลลัพธ์ SWE-Bench Pro ที่ Fable 5 ชนะ การทำซ้ำโดยอิสระมักจะเกิดขึ้นภายในไม่กี่สัปดาห์หลังจากมีการเปิดตัว GA จนกว่าจะถึงเวลานั้น ให้ถือว่าทั้งหมดนี้เป็นการกล่าวอ้าง และให้ความสำคัญกับการทดสอบของคุณเองมากกว่า
การเปรียบเทียบที่สำคัญคือของคุณเอง
คำตัดสินที่แยกกันนี้คือผลลัพธ์ ไม่ใช่การหลีกเลี่ยงความรับผิดชอบ ตารางเปิดตัวของ OpenAI เองยกให้ Sol เป็นผู้ครองตำแหน่งด้านความครอบคลุมของ agentic และ Fable 5 เป็นผู้ครองตำแหน่งด้านวิศวกรรมซอฟต์แวร์ และทั้งสองบริษัทได้นำเสนอโมเดลเรือธงที่ใช้งานได้จริงภายในไม่กี่สัปดาห์จากกัน การเลือกตามคะแนนรวมบนกระดานจัดอันดับละเลยตัวแปรหนึ่งที่ตัดสินผลลัพธ์ของคุณ: ลักษณะงานของคุณ
ดังนั้น ให้ทำการทดสอบ ดึงพร้อมต์จริง 15 พร้อมต์จากงานสัปดาห์ที่แล้ว ดาวน์โหลด Apidog ตั้งค่า API ทั้งสองเป็นสภาพแวดล้อม และเปรียบเทียบคุณภาพและต้นทุนต่องานบนข้อมูลของคุณเอง คุณจะมีคำตอบที่สามารถยืนยันได้ ก่อนที่การทำซ้ำการวัดประสิทธิภาพโดยอิสระครั้งแรกจะออกมา
