เมื่อ xAI เปิดตัว Grok 4.5 เมื่อวันที่ 8 กรกฎาคม 2026 อีลอน มัสก์ได้เลือกการเปรียบเทียบด้วยตัวเองว่า: “เป็นโมเดลระดับ Opus แต่เร็วกว่า ใช้โทเค็นอย่างมีประสิทธิภาพมากกว่า และมีต้นทุนที่ต่ำกว่า” นี่คือข้อกล่าวอ้างที่เฉพาะเจาะจงและตรวจสอบได้เกี่ยวกับ Claude Opus 4.8 ซึ่งเป็นโมเดลการเขียนโค้ดหลักของ Anthropic
ดังนั้น มาตรวจสอบกัน การเปรียบเทียบนี้ใช้ตัวเลขที่ xAI เผยแพร่ใน ประกาศของตน ราคาที่ Anthropic เผยแพร่ และส่วนของเรื่องราวที่ผู้ค้าทั้งสองรายไม่ได้เน้นในหัวข้อข่าว สรุปสั้นๆ คือ ข้ออ้างนี้ส่วนใหญ่เป็นจริง โดยมีการแพ้สองการทดสอบมาตรฐาน และมีเครื่องหมายดอกจันขนาดใหญ่หนึ่งอันเกี่ยวกับการตรวจสอบความถูกต้อง
ใบคะแนน
xAI ได้เผยแพร่การทดสอบมาตรฐานการเขียนโค้ดสี่รายการ นี่คือทั้งหมดนั้น พร้อมด้วยโมเดลทั้งสองและบริบทขอบเขตโดยรอบ:
| การทดสอบมาตรฐาน | Grok 4.5 | Opus 4.8 (max) | ผู้ชนะ |
|---|---|---|---|
| DeepSWE 1.0 (pass@1) | 62.0% | 55.75% | Grok 4.5 (+6.25) |
| DeepSWE 1.1 | 53% | 59% | Opus 4.8 (+6) |
| Terminal Bench 2.1 | 83.3% | 78.9% | Grok 4.5 (+4.4) |
| SWE Bench Pro (resolve) | 64.7% | 69.2% | Opus 4.8 (+4.5) |
ชนะไปฝ่ายละสองครั้ง จากกราฟของ xAI เอง คำว่า “ระดับ Opus” นั้นถูกต้องในฐานะระดับความสามารถ แต่ไม่ถูกต้องในฐานะข้ออ้างที่เหนือกว่า ซึ่งต้องยกความดีความชอบให้ xAI ว่าไม่ใช่สิ่งที่มัสก์กล่าวอ้าง

สิ่งที่ควรทราบ: Claude Fable 5 (สูงสุด) ทำคะแนนสูงสุดในการทดสอบทั้งสี่รายการนี้ (66.1 / 70 / 84.3 / 80.4) และ GPT 5.5 (xhigh) เอาชนะโมเดลทั้งสองในสามในสี่รายการ Grok 4.5 กำลังแข่งขันในระดับที่ต่ำกว่าขีดสุด โดยเปรียบเทียบกับโมเดลที่ Anthropic กำหนดราคาสำหรับการทำงานประจำวัน แทนที่จะเป็นความสามารถสูงสุด หากคุณต้องการการต่อสู้ระดับแนวหน้า นั่นคือ Fable 5 vs Opus 4.8
เครื่องหมายดอกจันเรื่องแหล่งที่มา
นี่ไม่ใช่ผลการทดสอบที่เป็นอิสระ xAI ระบุว่าตัวเลขของคู่แข่งมาจาก “เอกสารระบบที่นักพัฒนาแต่ละรายเผยแพร่ หรือกระดานจัดอันดับการทดสอบมาตรฐาน” โดยมีการประเมิน DeepSWE ที่สร้างโดย Datacurve และการรันที่จัดการด้วยฮาร์เนสของผู้ให้บริการแต่ละราย นั่นดีกว่าการรายงานตนเองที่ไม่โปร่งใส แต่การผสมผสานแหล่งที่มาหมายความว่าความแตกต่างของฮาร์เนสและโครงสร้างจะส่งผลต่อการเปรียบเทียบ ยังไม่มีบุคคลที่สามที่เป็นอิสระอย่างแท้จริงได้ทำการทดสอบมาตรฐาน Grok 4.5 การเจาะลึกการทดสอบมาตรฐาน ของเราจะติดตามสถานการณ์นั้น
ราคา: Grok ชนะบนกระดาษ แต่ยิ่งใหญ่กว่าในการใช้งานจริง
ราคาป้ายต่อล้านโทเค็น:
| Grok 4.5 | Opus 4.8 | |
|---|---|---|
| อินพุต | $2.00 | $5.00 |
| เอาต์พุต | $6.00 | $25.00 |
นั่นคือ 40% ของราคาอินพุตของ Opus และ 24% ของราคาเอาต์พุต (รายละเอียดทั้งหมดฝั่ง Anthropic อยู่ใน การวิเคราะห์ราคา Opus 4.8 ของเรา)
ช่องว่างจะกว้างขึ้นเมื่อคุณพิจารณาความละเอียดของการตอบสนอง xAI รายงานว่า Grok 4.5 แก้ไขงาน SWE Bench Pro โดยมีค่าเฉลี่ย 15,954 โทเค็นเอาต์พุต; Opus 4.8 (สูงสุด) มีค่าเฉลี่ย 67,020 ในการทดสอบมาตรฐานเดียวกัน คูณออกมาต่องานที่แก้ไขได้:
- Grok 4.5: 15,954 โทเค็น × $6/M ≈ $0.10 ของเอาต์พุตต่องาน
- Opus 4.8 (max): 67,020 โทเค็น × $25/M ≈ $1.68 ของเอาต์พุตต่องาน
ถูกกว่าประมาณ 17 เท่าสำหรับการผลิตเอาต์พุตต่องานที่เสร็จสมบูรณ์ ตามจำนวนโทเค็นที่ผู้จำหน่ายรายงาน ควรใช้ความระมัดระวังกับอัตราส่วนที่แน่นอน (การทดสอบมาตรฐานเดียว การวัดจากผู้จำหน่ายรายเดียว และโหมด “สูงสุด” ที่เพิ่มจำนวนโทเค็นของ Opus) แต่ทิศทางนั้นยากที่จะโต้แย้ง: โมเดลที่กระชับในราคา $6 ชนะโมเดลที่ละเอียดในราคา $25 ได้มากกว่าที่ราคาในเอกสารแนะนำ เรามีสถานการณ์จำลองที่ละเอียดกว่าใน คำอธิบายราคา Grok 4.5
ข้อควรระวังนี้ยังส่งผลในทางกลับกันด้วย: Opus ใช้โทเค็นต่อภารกิจมากขึ้นส่วนหนึ่งเป็นเพราะโหมด “สูงสุด” ให้เหตุผลอย่างละเอียด และการให้เหตุผลนั้นเป็นส่วนหนึ่งที่ทำให้มันชนะ SWE Bench Pro ไป 4.5 คะแนน คุณกำลังจ่ายเงินเพื่อความคิด บางครั้งความคิดก็คือผลิตภัณฑ์
ความเร็ว: 80 TPS และคำตอบที่สั้นลงส่งผลรวมกัน
Grok 4.5 ให้บริการที่ประมาณ 80 โทเค็นต่อวินาที ซึ่ง xAI เรียกว่า “ความเร็วระดับโมเดลเร็ว” เมื่อรวมกับเอาต์พุตที่มีความยาวเพียงหนึ่งในสี่ เวลาจริงที่ใช้ต่องานจะลดลงสองเท่า: โทเค็นน้อยลง ส่งมอบเร็วขึ้น สำหรับลูปของเอเจนต์ที่เรียกใช้โมเดลหลายสิบครั้ง เวลาแฝงต่อขั้นตอนจะส่งผลรวมกันเป็นการประหยัดเวลาหลายนาทีต่อเซสชัน
Anthropic ไม่ได้เผยแพร่ตัวเลข TPS ที่เทียบเท่าสำหรับ Opus 4.8 และความเร็วในโลกแห่งความเป็นจริงจะแตกต่างกันไปตามภาระงานและระดับ ดังนั้นควรทดสอบมาตรฐานนี้ด้วยข้อมูลของคุณเอง แทนที่จะเชื่อถือหน้าการตลาดของทั้งสองฝ่าย
Opus 4.8 ยังคงความได้เปรียบในด้านใด
ราคาไม่ใช่ทุกสิ่ง และใบคะแนนก็ระบุถึงด้านที่ไม่ใช่:
- การเขียนโค้ดแบบเอเจนต์ที่ยากที่สุด SWE Bench Pro ซึ่งเป็นรายการที่ใกล้เคียงที่สุดกับงานจริงที่ซับซ้อนในบรรดาสี่รายการนั้น Opus ได้ไป 4.5 คะแนน DeepSWE 1.1 ซึ่งเป็นการแก้ไขใหม่กว่านั้น Opus ได้ไป 6 คะแนน
- ความสมบูรณ์ของระบบนิเวศ Opus 4.8 เข้ากันได้ดีกับ Claude Code รูปแบบการใช้งานเครื่องมือที่เป็นที่ยอมรับ และการปรับปรุงเพื่อการผลิตตลอดหนึ่งปี Grok 4.5 เปิดตัวเมื่อวานนี้; อินเทอร์เฟซการผสานรวมคือ Grok Build, Cursor และ API ใหม่เอี่ยม ค่าใช้จ่ายในการย้ายข้อมูลนั้นเป็นเรื่องจริง แม้ว่าค่าใช้จ่ายต่อโทเค็นจะต่ำกว่าก็ตาม
- ความสามารถในการคาดเดา พฤติกรรมของ Opus ภายใต้บริบทที่ยาวนาน รูปแบบการปฏิเสธ และโหมดความล้มเหลวนั้นมีการบันทึกไว้อย่างดี รวมถึง โดยเรา ด้วย Grok 4.5 เพิ่งเปิดตัวได้หนึ่งสัปดาห์
คุณควรใช้ตัวไหน?
เลือก Grok 4.5 หาก ภาระงานของคุณคือการเขียนโค้ดแบบเอเจนต์ปริมาณมากหรืองานความรู้ ค่า API เป็นรายการที่คุณจับตามอง และการแบ่งคะแนน 2 ใน 4 ในราคาเอาต์พุตเพียงหนึ่งในสี่ดูเหมือนเป็นโอกาสในการเก็งกำไร ราคาเปิดตัวรวมกับ ช่วงเวลาฟรีในปัจจุบัน ทำให้การทดลองใช้แทบไม่มีค่าใช้จ่ายในเดือนนี้
คงใช้ Opus 4.8 หาก คุณใช้ระบบนิเวศของ Anthropic อย่างลึกซึ้ง คุณต้องการคะแนนที่เผยแพร่สูงสุดในการทดสอบมาตรฐานระดับ repo ที่ยากในระดับราคานี้ หรือคุณไม่สามารถยอมรับความเสี่ยงของโมเดลที่เพิ่งเปิดตัวได้ในการผลิต
ไม่ว่าจะทางใด จงวัดผลด้วยตัวคุณเอง API ทั้งสองรองรับรูปแบบที่เข้ากันได้กับ OpenAI ดังนั้นการสร้าง A/B harness จึงมีค่าใช้จ่ายไม่แพง ใน Apidog ให้บันทึกคำขอหนึ่งรายการต่อโมเดล ชี้ไปยังข้อความจริงที่ยากที่สุดห้าข้อของคุณ และเปรียบเทียบคุณภาพเอาต์พุต เวลาแฝง และวัตถุการใช้งานเคียงข้างกัน ยืนยันที่ output_tokens โดยเฉพาะ: หากคำตอบของ Grok ในข้อความของคุณไม่สั้นลง หลักเศรษฐศาสตร์ข้างต้นจะไม่ใช้กับคุณ ดาวน์โหลด Apidog ฟรี และทำการเปรียบเทียบกับข้อมูลของคุณเองก่อนที่จะย้ายภาระงาน
คู่มือการตั้งค่าสำหรับทั้งสองฝ่าย: วิธีใช้ Grok 4.5 API และ วิธีใช้ Claude Opus 4.8 API
คำถามที่พบบ่อย
Grok 4.5 ดีกว่า Claude Opus 4.8 หรือไม่? พวกมันแบ่งการทดสอบมาตรฐานที่ xAI เผยแพร่ออกเป็น 2-2 Grok 4.5 ถูกกว่าและใช้โทเค็นอย่างมีประสิทธิภาพมากกว่า; Opus 4.8 ชนะการประเมินระดับ repo ที่ยากกว่าสองรายการ “ดีกว่า” ขึ้นอยู่กับว่าข้อจำกัดของคุณคือ งบประมาณ หรือ ความสามารถสูงสุด
Grok 4.5 ถูกกว่า Opus 4.8 แค่ไหน? $2 เทียบกับ $5 ต่อล้านโทเค็นอินพุต และ $6 เทียบกับ $25 ต่อล้านโทเค็นเอาต์พุต ต่องานเขียนโค้ดที่แก้ไขได้ จำนวนโทเค็นที่ผู้จำหน่ายรายงานบ่งชี้ถึงช่องว่างที่มีประสิทธิภาพที่ใหญ่กว่ามาก
มีการทดสอบมาตรฐานที่เป็นอิสระสำหรับ Grok 4.5 หรือไม่? ยังไม่มี ตัวเลขที่เผยแพร่ผสมผสานการรันของ xAI การประเมินของ Datacurve และเอกสารระบบของผู้จำหน่ายรายอื่น ตัวเลขที่เป็นอิสระควรจะออกมาภายในไม่กี่สัปดาห์หลังการเปิดตัว
ฉันสามารถทดสอบโมเดลทั้งสองด้วยโค้ดเดียวกันได้หรือไม่? ส่วนใหญ่แล้ว ได้ ทั้งสองรองรับการเติมข้อความแชทที่เข้ากันได้กับ OpenAI ดังนั้นการเปลี่ยน base_url, คีย์ และ ID โมเดลก็ครอบคลุมพื้นฐานแล้ว รายละเอียดการเรียกใช้เครื่องมือและเอาต์พุตที่มีโครงสร้างแตกต่างกัน; ควรทดสอบเส้นทางเหล่านั้นอย่างชัดเจนก่อนที่จะเปลี่ยน
