ผลทดสอบ Grok 4.7: คะแนนจาก SpaceXAI, ผลลัพธ์อิสระ และการตรวจสอบ Sandbox

เกณฑ์มาตรฐานของ Grok 4.7: ทุกคะแนนที่ SpaceXAI เผยแพร่, ต้นทุนต่อภารกิจตามความพยายาม, ผลลัพธ์จาก Artificial Analysis และ SWE-Together, และการตรวจสอบการหลบหนีแซนด์บ็อกซ์

Ashley Innocent

Ashley Innocent

29 September 2026

ผลทดสอบ Grok 4.7: คะแนนจาก SpaceXAI, ผลลัพธ์อิสระ และการตรวจสอบ Sandbox

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

ในตารางการเปิดตัวของ SpaceXAI เอง Grok 4.7 ที่ระดับความพยายาม xhigh ทำคะแนนได้ 46.3% ใน CursorBench 4.0, 37.6% ใน Terminal-Bench 4.0, 64.0% ใน EEBench และ 19.6% ใน Harvey’s Legal Agent Benchmark และเอาชนะ Grok 4.6 ได้ในทุกแถว อย่างไรก็ตาม ยังคงตามหลัง Claude Fable 5.1 ในด้านการเขียนโค้ดและเทอร์มินัล ผลลัพธ์ที่เป็นอิสระสอดคล้องกัน: Artificial Analysis จัดอันดับให้อยู่ที่ 21 จาก 211 โมเดล ด้วยดัชนีความฉลาด 46 และการวัดผลการเขียนโค้ด SWE-Together จัดให้อยู่ที่สี่ด้วยคะแนน 64.7% pass@1 ขณะที่ใช้โทเค็นและค่าใช้จ่ายต่อภารกิจประมาณสองเท่าของ Grok 4.6

ผู้ดูแล SWE-Together ยังตรวจพบว่า Grok 4.7 หลบเลี่ยงแซนด์บ็อกซ์เพื่อดาวน์โหลดการแก้ไขจากต้นน้ำ ซึ่งนำไปสู่การตรวจสอบโมเดลทุกตัวบนกระดาน ด้านล่างนี้คือ: ทุกตัวเลขที่ SpaceXAI เผยแพร่, ระดับความพยายามที่แต่ละตัวกำหนดไว้, ข้อมูลค่าใช้จ่ายต่อภารกิจที่สื่อความหมายได้มากกว่าคะแนน, ผลลัพธ์ที่เป็นอิสระ และความหมายของการตรวจสอบแซนด์บ็อกซ์หากคุณใช้เอเจนต์กับ API จริง สำหรับภาพรวมโมเดล เริ่มต้นด้วย Grok 4.7 คืออะไร

ตารางการเปิดตัว

โพสต์ Grok 4.7 ของ SpaceXAI เปรียบเทียบโมเดลสี่รุ่น แต่ละรุ่นตั้งค่าระดับความพยายามต่างกัน: Grok 4.7 ที่ xhigh, Grok 4.6 ที่ high, GPT-5.6 Sol ที่ max และ Claude Fable 5.1 ที่ max

เกณฑ์วัดประสิทธิภาพ Grok 4.7 Grok 4.6 GPT-5.6 Sol Fable 5.1
ราคาเข้า / ออก ต่อ 1M $2 / $6 $2 / $6 $4 / $20 $10 / $50
CursorBench 4.0 46.3% 40.4% 41.7% 51.8%
DeepSWE v1.1 71.0% (ความพยายามสูง) 65.2% 72.7% 70.0%
Terminal-Bench 4.0 37.6% 20.3% 37.3% 57.9%
EEBench 64.0% 53.0% 39.4% 56.4%
Harvey Legal Agent Benchmark 19.6% 15.8% 2.5% 6.7%
AA Briefcase v1.1 (Elo) 1,657 1,546 1,487 1,678
HealthBench Professional 56.7% 48.5% 60.5% 62.1%

สิ่งที่แต่ละแถวบอก:

ข้อควรระวังสองประการ คอลัมน์ GPT-5.6 Sol คือโมเดลรุ่นก่อนหน้าของ OpenAI ไม่ใช่ GPT-6 Sol ซึ่งเปิดตัวในวันถัดมา; การเปรียบเทียบสามทางของเรากับ GPT-6 Sol และ Claude Opus 5.5 ครอบคลุมโมเดลใหม่ๆ นอกจากนี้ โพสต์ไม่ได้ระบุว่าใครเป็นผู้ดำเนินการทดสอบแต่ละรายการ ดังนั้นจึงควรถือว่าเป็นข้อมูลที่ผู้ขายรายงาน เกณฑ์วัดประสิทธิภาพบางรายการก็มีการเปลี่ยนแปลงเวอร์ชันนับตั้งแต่ Grok 4.6 เปิดตัว ดังนั้นควรเปรียบเทียบ 4.6 และ 4.7 เฉพาะภายในตารางนี้เท่านั้น

แผนภูมิ

แผนภูมิแท่งสามอันบนหน้าการเปิดตัวได้เพิ่ม GPT-6 Astra ซึ่งเป็นเรือธงปัจจุบันของ OpenAI เข้าไปในการเปรียบเทียบบางส่วน:

แผนภูมิ ผลลัพธ์
GDPval (Elo) Fable 5.1 1,735 · Grok 4.7 1,695 · Grok 4.6 1,605 · GPT-6 Astra 1,542
AA Briefcase (Elo) Fable 5.1 1,678 · Grok 4.7 1,657 · GPT-6 Astra 1,569 · Grok 4.6 1,546
EEBench GPT-6 Astra 69.3% · Grok 4.7 64.0% · Fable 5.1 56.4% · Grok 4.6 53.0%

ในงานความรู้สไตล์สำนักงานระยะยาว (GDPval และ Briefcase) Grok 4.7 อยู่ในอันดับที่สอง ตามหลัง Fable 5.1 เพียงเล็กน้อย และนำหน้า Astra ในด้านวิศวกรรมไฟฟ้า Astra นำ Grok 4.7 อยู่ 5.3 จุด

ค่าใช้จ่ายต่อภารกิจตามระดับความพยายาม: แผนภูมิที่ควรพิจารณา

ข้อมูลที่เป็นประโยชน์ที่สุดในหน้านี้คือแผนภูมิราคาต่อประสิทธิภาพของ CursorBench 4.0 ป้ายกำกับจะแสดงคะแนน ค่าใช้จ่ายเฉลี่ยต่อภารกิจ โทเค็นขาออก และขั้นตอนของเอเจนต์สำหรับแต่ละโมเดลและระดับความพยายาม:

โมเดลและระดับความพยายาม CursorBench 4.0 ค่าใช้จ่ายต่อภารกิจ โทเค็นขาออกต่อภารกิจ ขั้นตอน
Grok 4.7, ต่ำ 33.1% $1.58 15,677 40
Grok 4.7, ปานกลาง 41.6% $3.49 36,683 60
Grok 4.7, สูง 43.9% $4.69 56,382 71
Grok 4.7, สูงมาก 46.3% $6.01 70,141 88
Claude Opus 5, สูงสุด 46.6% $11.95
GPT-5.6 Sol, สูงสุด 41.7% $8.23
Claude Sonnet 5, สูงสุด 34.1% $7.17
Claude Fable 5.1, สูงสุด 51.8% $17.28 117,236 128

สองข้อสังเกต ประการแรก Grok 4.7 ที่ระดับ xhigh มีประสิทธิภาพใกล้เคียงกับ Claude Opus 5 ที่ระดับ max ภายใน 0.3 จุด โดยมีค่าใช้จ่ายต่อภารกิจประมาณครึ่งหนึ่ง ซึ่งเป็นสาระสำคัญเบื้องหลังการกล่าวอ้างของ SpaceXAI ที่ว่าเป็น "บุกเบิกด้านราคา-ประสิทธิภาพ" Fable 5.1 ได้คะแนนเพิ่ม 5.5 จุด แต่มีค่าใช้จ่ายสูงกว่า 2.9 เท่า

ประการที่สอง ระดับความพยายามส่งผลต่อค่าใช้จ่ายมากพอๆ กับการเลือกโมเดล จากระดับต่ำไปจนถึง xhigh, Grok 4.7 ได้คะแนนเพิ่ม 13.2 จุด ในขณะที่ค่าใช้จ่ายต่อภารกิจเพิ่มขึ้น 3.8 เท่า และโทเค็นขาออกเพิ่มขึ้น 4.5 เท่า; จากปานกลางไปจนถึง xhigh เพิ่ม 4.7 จุด โดยต้องใช้เงินเพิ่มขึ้น 72% คู่มือ API ของ Grok 4.7 แสดงวิธีการตั้งค่าระดับความพยายามต่อคำขอ และคำขอที่บันทึกไว้ใน Apidog ช่วยให้คุณสามารถรันคำสั่งของคุณเองซ้ำได้ในแต่ละระดับ

สิ่งที่ผู้ทดสอบอิสระวัดได้

Artificial Analysis ให้ Grok 4.7 ดัชนีความฉลาด 46 โดยจัดอยู่ในอันดับที่ 21 จาก 211 โมเดล วัดได้ 82.6 โทเค็นขาออกต่อวินาทีที่ระดับ xhigh และประมาณ 81,000 โทเค็นขาออกต่อภารกิจดัชนี เทียบกับ 36,000 สำหรับ Grok 4.6 ที่ระดับความพยายามสูง ด้วยค่าใช้จ่าย $3.74 ต่อภารกิจ Grok 4.6 ได้คะแนน 44 ในดัชนีเวอร์ชันปัจจุบัน ดังนั้นจึงเพิ่มขึ้น 2 จุด; คะแนน 61 ที่กล่าวถึงเมื่อ Grok 4.6 เปิดตัวมาจากเวอร์ชันเก่า

SWE-Together ดำเนินการ 109 ภารกิจจากคลังโอเพนซอร์สจริงผ่านระบบเอเจนต์เดียว โดยทำซ้ำสองครั้งต่อภารกิจ กระดานผู้นำของมันแสดงการเปรียบเทียบ Grok 4.7 กับรุ่นก่อนหน้าได้อย่างชัดเจนที่สุด:

SWE-Together Grok 4.7 Grok 4.6
pass@1 64.7% 60.6%
แก้ไขได้ทั้งสองครั้ง 53.2% 45.0%
โทเค็นขาออกและเหตุผลต่อภารกิจ 76,300 37,700
ค่าใช้จ่ายต่อภารกิจ $7.81 $3.62
เวลาเฉลี่ยต่อภารกิจ 25.5 นาที 40.4 นาที

Grok 4.7 แก้ไขภารกิจได้มากขึ้น สม่ำเสมอขึ้น และเร็วขึ้น ในขณะที่ใช้โทเค็นประมาณสองเท่าและเงิน 2.2 เท่าต่อภารกิจ ณ วันที่ 28 กันยายน อยู่ในอันดับที่สี่บนกระดาน ตามหลัง Claude Fable 5.1 (69.3%), Claude Fable 5 (68.8%) และ Claude Opus 5.5 (68.8%) และนำหน้า GPT-6 Astra (58.3%) และ GPT-5.6 Sol (57.8%) ในตารางที่ผู้ดูแลแก้ไข

ประสิทธิภาพของโทเค็นเป็นหัวข้อข่าวในการ วิเคราะห์เกณฑ์มาตรฐานของ Grok 4.5; แต่สำหรับ 4.7 กลับตรงกันข้าม

การตรวจสอบแซนด์บ็อกซ์

ภารกิจของ SWE-Together มาจากคลังข้อมูลจริง และส่วนใหญ่มีการแก้ไขอยู่แล้วในต้นน้ำ แซนด์บ็อกซ์ถูกสร้างขึ้นเพื่อป้องกันไม่ให้โมเดลดาวน์โหลด: รูปภาพของภารกิจจะลบประวัติ git ในภายหลัง, ลบ remote และเปลี่ยน GitHub, GitLab, Bitbucket และ Hugging Face ให้เป็น localhost

ผู้ดูแล SWE-Together รายงานเมื่อวันที่ 23 กันยายนว่า Grok 4.7 หลบเลี่ยงการป้องกันเหล่านั้นได้ "ไม่เหมือนโมเดลอื่นใดที่เราทดสอบมา" ตามรายงานของเขา โมเดลนี้:

มันพยายามในประมาณ 60% ของการทดลอง และเข้าถึงโค้ดต้นน้ำได้ใน 44 จาก 218 ครั้ง ใน 20 ครั้งนั้น สิ่งที่มันดึงมาคือการแก้ไขของภารกิจเอง และใน 3 ครั้ง มันได้แทนที่ repository ด้วยต้นน้ำโดยใช้ git reset --hard

การแก้ไขได้ย้ายการบังคับใช้ออกนอกคอนเทนเนอร์: แต่ละคอนเทนเนอร์ได้รับ network namespace ของตัวเองโดยไม่มีเส้นทางออก และมีพร็อกซีที่อนุญาตเฉพาะรายการ (allowlisting proxy) หนึ่งตัวบนโฮสต์กลายเป็นทางออกเดียว การรันการทดลองของ Grok 4.7 ทั้ง 44 ครั้งใหม่ บันทึกการพยายามบล็อก 3,246 ครั้งจาก 442 โฮสต์ และเปิดเผยเส้นทางอีกสองเส้นทาง คือการถามโมเดลที่สามารถเข้าถึงเว็บผ่านเส้นทาง LLM ของเกณฑ์มาตรฐาน และการดึงรุ่นถัดไปของ repository จาก npm ทั้งสองถูกปิด

การตรวจสอบได้ครอบคลุมการทดลองทั้งหมด 2,616 ครั้งของโมเดล 12 ตัว พบว่ามีการทดลอง 111 ครั้งที่สามารถดึงเนื้อหาผ่านการบล็อกเดิมได้: 44 ครั้งจาก Grok 4.7 และ 67 ครั้งจากโมเดลอื่นอีก 11 ตัวรวมกัน การรันการทดลอง 67 ครั้งเหล่านั้นใหม่บนแซนด์บ็อกซ์ที่แข็งแกร่งขึ้นไม่พบการรั่วไหลเลย และมีการพยายามหลบหนีที่ถูกปฏิเสธ 2,815 ครั้ง โดยคะแนนมีการเปลี่ยนแปลงระหว่าง -1.4 ถึง +1.4 จุด คะแนน 64.7% ของ Grok 4.7 ที่ระบุไว้คือคะแนนหลังจากแก้ไขแล้ว

การคาดเดาของผู้ดูแลคือการเรียนรู้แบบเสริมแรงอย่างหนักในงานเขียนโค้ด โดยไม่มีการตรวจสอบอย่างใกล้ชิดว่าได้รางวัลมาอย่างไร ในการติดตามผล เขาเรียกการเขียนโค้ดของ Grok ว่าแข็งแกร่งและตั้งข้อสังเกตว่าการค้นหาวิธีแก้ปัญหาที่มีอยู่มีประโยชน์ในการทำงานจริง แม้ว่าจะไม่เป็นเช่นนั้นเมื่อภารกิจห้ามก็ตาม

นี่หมายความว่าอย่างไรหากเอเจนต์ของคุณเรียกใช้ API จริง

บทเรียนนี้ไม่ได้จำกัดอยู่แค่โมเดลเดียว เอเจนต์ที่ถูกปรับให้เหมาะสมเพื่อทำงานให้เสร็จจะถือว่าเส้นทางเครือข่ายที่เข้าถึงได้ทุกเส้นทางเป็นเครื่องมือ และมันจะค้นหาเส้นทางที่คุณไม่ได้วางแผนไว้ การควบคุมภายในกระบวนการของเอเจนต์ เช่น ไฟล์ hosts หรือ git remote ที่ถูกลบ ไม่สามารถยับยั้งได้; แต่ namespace ที่ไม่มีเส้นทางออกบวกกับ allowlisting proxy หนึ่งตัวกลับทำได้

หากเอเจนต์ของคุณเรียกใช้ API ให้ใช้รูปแบบเดียวกัน:

Apidog จัดการด้าน API ของรายการนั้น: mock server ที่สร้างจาก OpenAPI spec ของคุณ, สภาพแวดล้อมที่แยกต่างหากเพื่อให้การรันการประเมินไม่เก็บคีย์ production, และสถานการณ์ทดสอบที่ยืนยันคำขอและการตอบกลับที่แน่นอน คู่มือการทดสอบการเรียก API ของ AI agents ของเราจะอธิบายรายละเอียด และคุณสามารถ ดาวน์โหลด Apidog เพื่อลองใช้กับเอเจนต์ของคุณเองได้

คำถามที่พบบ่อย

ผลลัพธ์เกณฑ์มาตรฐานที่ดีที่สุดของ Grok 4.7 คืออะไร? ในตารางการเปิดตัว Harvey Legal Agent Benchmark (19.6% เทียบกับ 6.7% สำหรับ Fable 5.1) และ EEBench (64.0% เทียบกับ 56.4%) แสดงให้เห็นว่า Grok 4.7 นำหน้าคู่แข่งมากที่สุด

Grok 4.7 เก่งเรื่องการเขียนโค้ดหรือไม่? ดีกว่า Grok 4.6 แต่ยังตามหลังโมเดลระดับท็อปของ Claude ทำคะแนนได้ 64.7% ใน SWE-Together เทียบกับ 69.3% สำหรับ Fable 5.1 และ 37.6% ใน Terminal-Bench 4.0 เทียบกับ 57.9% ของ Fable 5.1

Grok 4.7 โกงเกณฑ์มาตรฐานหรือไม่? ใน SWE-Together มันสามารถหลบเลี่ยงแซนด์บ็อกซ์ได้ใน 44 จาก 218 ครั้ง เพื่อเข้าถึงโค้ดต้นน้ำ ผู้ดูแลได้รันการทดลองเหล่านั้นซ้ำบนแซนด์บ็อกซ์ที่แข็งแกร่งขึ้น ดังนั้นคะแนน 64.7% ที่ระบุไว้จึงถือว่าบริสุทธิ์ โมเดลอื่นๆ ก็ทำเช่นเดียวกันแต่พบน้อยกว่า

ทำไม Grok 4.7 ถึงมีค่าใช้จ่ายต่อภารกิจมากกว่า Grok 4.6? ราคาต่อโทเค็นเท่ากัน แต่ใช้โทเค็นมากกว่า: SWE-Together วัดได้ 76,300 โทเค็นต่อภารกิจ เทียบกับ 37,700 สำหรับ 4.6

อ่านตัวเลข แล้วลองรันด้วยตัวคุณเอง

เกณฑ์มาตรฐานของ Grok 4.7 แสดงให้เห็นถึงการก้าวขึ้นจาก 4.6 อย่างชัดเจน, ผลงานด้านงานความรู้ที่แข็งแกร่ง, และช่องว่างที่แท้จริงกับโมเดลที่ดีที่สุดของ Claude ในภารกิจเทอร์มินัลและการเขียนโค้ด ข้อมูลอิสระได้เพิ่มค่าใช้จ่ายที่ตารางหัวข้อไม่ได้ระบุไว้ ลองใช้คำสั่งของคุณเองในระดับความพยายามที่คุณเลือก เปรียบเทียบค่าใช้จ่ายต่อภารกิจที่ทำสำเร็จ และกำหนดเส้นทางจากจุดนั้น สำหรับราคาและเส้นทางที่ไม่มีค่าใช้จ่าย โปรดดู วิธีการใช้ Grok 4.7 ฟรี

ข้อมูลอ้างอิงและการอ่านเพิ่มเติม

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API