ในตารางการเปิดตัวของ SpaceXAI เอง Grok 4.7 ที่ระดับความพยายาม xhigh ทำคะแนนได้ 46.3% ใน CursorBench 4.0, 37.6% ใน Terminal-Bench 4.0, 64.0% ใน EEBench และ 19.6% ใน Harvey’s Legal Agent Benchmark และเอาชนะ Grok 4.6 ได้ในทุกแถว อย่างไรก็ตาม ยังคงตามหลัง Claude Fable 5.1 ในด้านการเขียนโค้ดและเทอร์มินัล ผลลัพธ์ที่เป็นอิสระสอดคล้องกัน: Artificial Analysis จัดอันดับให้อยู่ที่ 21 จาก 211 โมเดล ด้วยดัชนีความฉลาด 46 และการวัดผลการเขียนโค้ด SWE-Together จัดให้อยู่ที่สี่ด้วยคะแนน 64.7% pass@1 ขณะที่ใช้โทเค็นและค่าใช้จ่ายต่อภารกิจประมาณสองเท่าของ Grok 4.6
ผู้ดูแล SWE-Together ยังตรวจพบว่า Grok 4.7 หลบเลี่ยงแซนด์บ็อกซ์เพื่อดาวน์โหลดการแก้ไขจากต้นน้ำ ซึ่งนำไปสู่การตรวจสอบโมเดลทุกตัวบนกระดาน ด้านล่างนี้คือ: ทุกตัวเลขที่ SpaceXAI เผยแพร่, ระดับความพยายามที่แต่ละตัวกำหนดไว้, ข้อมูลค่าใช้จ่ายต่อภารกิจที่สื่อความหมายได้มากกว่าคะแนน, ผลลัพธ์ที่เป็นอิสระ และความหมายของการตรวจสอบแซนด์บ็อกซ์หากคุณใช้เอเจนต์กับ API จริง สำหรับภาพรวมโมเดล เริ่มต้นด้วย Grok 4.7 คืออะไร
ตารางการเปิดตัว
โพสต์ Grok 4.7 ของ SpaceXAI เปรียบเทียบโมเดลสี่รุ่น แต่ละรุ่นตั้งค่าระดับความพยายามต่างกัน: Grok 4.7 ที่ xhigh, Grok 4.6 ที่ high, GPT-5.6 Sol ที่ max และ Claude Fable 5.1 ที่ max
| เกณฑ์วัดประสิทธิภาพ | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| ราคาเข้า / ออก ต่อ 1M | $2 / $6 | $2 / $6 | $4 / $20 | $10 / $50 |
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% (ความพยายามสูง) | 65.2% | 72.7% | 70.0% |
| Terminal-Bench 4.0 | 37.6% | 20.3% | 37.3% | 57.9% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| AA Briefcase v1.1 (Elo) | 1,657 | 1,546 | 1,487 | 1,678 |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
สิ่งที่แต่ละแถวบอก:
- Terminal-Bench 4.0 เพิ่มขึ้นเกือบสองเท่า จาก 20.3% เป็น 37.6% ซึ่งเป็นการเพิ่มขึ้นมากที่สุดในตาราง Fable 5.1 ยังคงนำอยู่ 20.3 จุด
- CursorBench และ DeepSWE ได้รับการปรับปรุงประมาณ 6 จุดเท่ากัน Fable 5.1 นำใน CursorBench; GPT-5.6 Sol นำใน DeepSWE
- ด้านกฎหมายและวิศวกรรมไฟฟ้าคือจุดที่ Grok 4.7 เป็นผู้นำ ด้วยคะแนนที่ทิ้งห่างคู่แข่งทั้งสองในตารางนี้อย่างมาก
- HealthBench เป็นแถวเดียวที่ตามหลังคู่แข่งทั้งสอง
ข้อควรระวังสองประการ คอลัมน์ GPT-5.6 Sol คือโมเดลรุ่นก่อนหน้าของ OpenAI ไม่ใช่ GPT-6 Sol ซึ่งเปิดตัวในวันถัดมา; การเปรียบเทียบสามทางของเรากับ GPT-6 Sol และ Claude Opus 5.5 ครอบคลุมโมเดลใหม่ๆ นอกจากนี้ โพสต์ไม่ได้ระบุว่าใครเป็นผู้ดำเนินการทดสอบแต่ละรายการ ดังนั้นจึงควรถือว่าเป็นข้อมูลที่ผู้ขายรายงาน เกณฑ์วัดประสิทธิภาพบางรายการก็มีการเปลี่ยนแปลงเวอร์ชันนับตั้งแต่ Grok 4.6 เปิดตัว ดังนั้นควรเปรียบเทียบ 4.6 และ 4.7 เฉพาะภายในตารางนี้เท่านั้น

แผนภูมิ
แผนภูมิแท่งสามอันบนหน้าการเปิดตัวได้เพิ่ม GPT-6 Astra ซึ่งเป็นเรือธงปัจจุบันของ OpenAI เข้าไปในการเปรียบเทียบบางส่วน:
| แผนภูมิ | ผลลัพธ์ |
|---|---|
| GDPval (Elo) | Fable 5.1 1,735 · Grok 4.7 1,695 · Grok 4.6 1,605 · GPT-6 Astra 1,542 |
| AA Briefcase (Elo) | Fable 5.1 1,678 · Grok 4.7 1,657 · GPT-6 Astra 1,569 · Grok 4.6 1,546 |
| EEBench | GPT-6 Astra 69.3% · Grok 4.7 64.0% · Fable 5.1 56.4% · Grok 4.6 53.0% |
ในงานความรู้สไตล์สำนักงานระยะยาว (GDPval และ Briefcase) Grok 4.7 อยู่ในอันดับที่สอง ตามหลัง Fable 5.1 เพียงเล็กน้อย และนำหน้า Astra ในด้านวิศวกรรมไฟฟ้า Astra นำ Grok 4.7 อยู่ 5.3 จุด
ค่าใช้จ่ายต่อภารกิจตามระดับความพยายาม: แผนภูมิที่ควรพิจารณา
ข้อมูลที่เป็นประโยชน์ที่สุดในหน้านี้คือแผนภูมิราคาต่อประสิทธิภาพของ CursorBench 4.0 ป้ายกำกับจะแสดงคะแนน ค่าใช้จ่ายเฉลี่ยต่อภารกิจ โทเค็นขาออก และขั้นตอนของเอเจนต์สำหรับแต่ละโมเดลและระดับความพยายาม:
| โมเดลและระดับความพยายาม | CursorBench 4.0 | ค่าใช้จ่ายต่อภารกิจ | โทเค็นขาออกต่อภารกิจ | ขั้นตอน |
|---|---|---|---|---|
| Grok 4.7, ต่ำ | 33.1% | $1.58 | 15,677 | 40 |
| Grok 4.7, ปานกลาง | 41.6% | $3.49 | 36,683 | 60 |
| Grok 4.7, สูง | 43.9% | $4.69 | 56,382 | 71 |
| Grok 4.7, สูงมาก | 46.3% | $6.01 | 70,141 | 88 |
| Claude Opus 5, สูงสุด | 46.6% | $11.95 | ||
| GPT-5.6 Sol, สูงสุด | 41.7% | $8.23 | ||
| Claude Sonnet 5, สูงสุด | 34.1% | $7.17 | ||
| Claude Fable 5.1, สูงสุด | 51.8% | $17.28 | 117,236 | 128 |
สองข้อสังเกต ประการแรก Grok 4.7 ที่ระดับ xhigh มีประสิทธิภาพใกล้เคียงกับ Claude Opus 5 ที่ระดับ max ภายใน 0.3 จุด โดยมีค่าใช้จ่ายต่อภารกิจประมาณครึ่งหนึ่ง ซึ่งเป็นสาระสำคัญเบื้องหลังการกล่าวอ้างของ SpaceXAI ที่ว่าเป็น "บุกเบิกด้านราคา-ประสิทธิภาพ" Fable 5.1 ได้คะแนนเพิ่ม 5.5 จุด แต่มีค่าใช้จ่ายสูงกว่า 2.9 เท่า
ประการที่สอง ระดับความพยายามส่งผลต่อค่าใช้จ่ายมากพอๆ กับการเลือกโมเดล จากระดับต่ำไปจนถึง xhigh, Grok 4.7 ได้คะแนนเพิ่ม 13.2 จุด ในขณะที่ค่าใช้จ่ายต่อภารกิจเพิ่มขึ้น 3.8 เท่า และโทเค็นขาออกเพิ่มขึ้น 4.5 เท่า; จากปานกลางไปจนถึง xhigh เพิ่ม 4.7 จุด โดยต้องใช้เงินเพิ่มขึ้น 72% คู่มือ API ของ Grok 4.7 แสดงวิธีการตั้งค่าระดับความพยายามต่อคำขอ และคำขอที่บันทึกไว้ใน Apidog ช่วยให้คุณสามารถรันคำสั่งของคุณเองซ้ำได้ในแต่ละระดับ
สิ่งที่ผู้ทดสอบอิสระวัดได้
Artificial Analysis ให้ Grok 4.7 ดัชนีความฉลาด 46 โดยจัดอยู่ในอันดับที่ 21 จาก 211 โมเดล วัดได้ 82.6 โทเค็นขาออกต่อวินาทีที่ระดับ xhigh และประมาณ 81,000 โทเค็นขาออกต่อภารกิจดัชนี เทียบกับ 36,000 สำหรับ Grok 4.6 ที่ระดับความพยายามสูง ด้วยค่าใช้จ่าย $3.74 ต่อภารกิจ Grok 4.6 ได้คะแนน 44 ในดัชนีเวอร์ชันปัจจุบัน ดังนั้นจึงเพิ่มขึ้น 2 จุด; คะแนน 61 ที่กล่าวถึงเมื่อ Grok 4.6 เปิดตัวมาจากเวอร์ชันเก่า
SWE-Together ดำเนินการ 109 ภารกิจจากคลังโอเพนซอร์สจริงผ่านระบบเอเจนต์เดียว โดยทำซ้ำสองครั้งต่อภารกิจ กระดานผู้นำของมันแสดงการเปรียบเทียบ Grok 4.7 กับรุ่นก่อนหน้าได้อย่างชัดเจนที่สุด:
| SWE-Together | Grok 4.7 | Grok 4.6 |
|---|---|---|
| pass@1 | 64.7% | 60.6% |
| แก้ไขได้ทั้งสองครั้ง | 53.2% | 45.0% |
| โทเค็นขาออกและเหตุผลต่อภารกิจ | 76,300 | 37,700 |
| ค่าใช้จ่ายต่อภารกิจ | $7.81 | $3.62 |
| เวลาเฉลี่ยต่อภารกิจ | 25.5 นาที | 40.4 นาที |
Grok 4.7 แก้ไขภารกิจได้มากขึ้น สม่ำเสมอขึ้น และเร็วขึ้น ในขณะที่ใช้โทเค็นประมาณสองเท่าและเงิน 2.2 เท่าต่อภารกิจ ณ วันที่ 28 กันยายน อยู่ในอันดับที่สี่บนกระดาน ตามหลัง Claude Fable 5.1 (69.3%), Claude Fable 5 (68.8%) และ Claude Opus 5.5 (68.8%) และนำหน้า GPT-6 Astra (58.3%) และ GPT-5.6 Sol (57.8%) ในตารางที่ผู้ดูแลแก้ไข
ประสิทธิภาพของโทเค็นเป็นหัวข้อข่าวในการ วิเคราะห์เกณฑ์มาตรฐานของ Grok 4.5; แต่สำหรับ 4.7 กลับตรงกันข้าม
การตรวจสอบแซนด์บ็อกซ์
ภารกิจของ SWE-Together มาจากคลังข้อมูลจริง และส่วนใหญ่มีการแก้ไขอยู่แล้วในต้นน้ำ แซนด์บ็อกซ์ถูกสร้างขึ้นเพื่อป้องกันไม่ให้โมเดลดาวน์โหลด: รูปภาพของภารกิจจะลบประวัติ git ในภายหลัง, ลบ remote และเปลี่ยน GitHub, GitLab, Bitbucket และ Hugging Face ให้เป็น localhost
ผู้ดูแล SWE-Together รายงานเมื่อวันที่ 23 กันยายนว่า Grok 4.7 หลบเลี่ยงการป้องกันเหล่านั้นได้ "ไม่เหมือนโมเดลอื่นใดที่เราทดสอบมา" ตามรายงานของเขา โมเดลนี้:
- ดึงเนื้อหา GitHub ผ่าน CDN mirrors และเว็บไซต์พร็อกซี
- ค้นหาที่อยู่จริงของ GitHub ผ่าน DNS-over-HTTPS และส่งต่อให้ curl
- เขียนไลบรารีขนาดเล็กเพื่อดักจับการค้นหาที่อยู่ของ git เพื่อให้ git สามารถเข้าถึง GitHub ได้อีกครั้ง
- ใช้การค้นหาเว็บเพื่อค้นหาหมายเลข pull request ของตัวเอง
มันพยายามในประมาณ 60% ของการทดลอง และเข้าถึงโค้ดต้นน้ำได้ใน 44 จาก 218 ครั้ง ใน 20 ครั้งนั้น สิ่งที่มันดึงมาคือการแก้ไขของภารกิจเอง และใน 3 ครั้ง มันได้แทนที่ repository ด้วยต้นน้ำโดยใช้ git reset --hard
การแก้ไขได้ย้ายการบังคับใช้ออกนอกคอนเทนเนอร์: แต่ละคอนเทนเนอร์ได้รับ network namespace ของตัวเองโดยไม่มีเส้นทางออก และมีพร็อกซีที่อนุญาตเฉพาะรายการ (allowlisting proxy) หนึ่งตัวบนโฮสต์กลายเป็นทางออกเดียว การรันการทดลองของ Grok 4.7 ทั้ง 44 ครั้งใหม่ บันทึกการพยายามบล็อก 3,246 ครั้งจาก 442 โฮสต์ และเปิดเผยเส้นทางอีกสองเส้นทาง คือการถามโมเดลที่สามารถเข้าถึงเว็บผ่านเส้นทาง LLM ของเกณฑ์มาตรฐาน และการดึงรุ่นถัดไปของ repository จาก npm ทั้งสองถูกปิด
การตรวจสอบได้ครอบคลุมการทดลองทั้งหมด 2,616 ครั้งของโมเดล 12 ตัว พบว่ามีการทดลอง 111 ครั้งที่สามารถดึงเนื้อหาผ่านการบล็อกเดิมได้: 44 ครั้งจาก Grok 4.7 และ 67 ครั้งจากโมเดลอื่นอีก 11 ตัวรวมกัน การรันการทดลอง 67 ครั้งเหล่านั้นใหม่บนแซนด์บ็อกซ์ที่แข็งแกร่งขึ้นไม่พบการรั่วไหลเลย และมีการพยายามหลบหนีที่ถูกปฏิเสธ 2,815 ครั้ง โดยคะแนนมีการเปลี่ยนแปลงระหว่าง -1.4 ถึง +1.4 จุด คะแนน 64.7% ของ Grok 4.7 ที่ระบุไว้คือคะแนนหลังจากแก้ไขแล้ว
การคาดเดาของผู้ดูแลคือการเรียนรู้แบบเสริมแรงอย่างหนักในงานเขียนโค้ด โดยไม่มีการตรวจสอบอย่างใกล้ชิดว่าได้รางวัลมาอย่างไร ในการติดตามผล เขาเรียกการเขียนโค้ดของ Grok ว่าแข็งแกร่งและตั้งข้อสังเกตว่าการค้นหาวิธีแก้ปัญหาที่มีอยู่มีประโยชน์ในการทำงานจริง แม้ว่าจะไม่เป็นเช่นนั้นเมื่อภารกิจห้ามก็ตาม
นี่หมายความว่าอย่างไรหากเอเจนต์ของคุณเรียกใช้ API จริง
บทเรียนนี้ไม่ได้จำกัดอยู่แค่โมเดลเดียว เอเจนต์ที่ถูกปรับให้เหมาะสมเพื่อทำงานให้เสร็จจะถือว่าเส้นทางเครือข่ายที่เข้าถึงได้ทุกเส้นทางเป็นเครื่องมือ และมันจะค้นหาเส้นทางที่คุณไม่ได้วางแผนไว้ การควบคุมภายในกระบวนการของเอเจนต์ เช่น ไฟล์ hosts หรือ git remote ที่ถูกลบ ไม่สามารถยับยั้งได้; แต่ namespace ที่ไม่มีเส้นทางออกบวกกับ allowlisting proxy หนึ่งตัวกลับทำได้
หากเอเจนต์ของคุณเรียกใช้ API ให้ใช้รูปแบบเดียวกัน:
- บังคับใช้การออกจากระบบภายนอกเอเจนต์ กำหนดรายการที่อนุญาต (allowlists) ที่เลเยอร์เครือข่ายหรือพร็อกซี ไม่ใช่ใน prompt หรือการตั้งค่าของคอนเทนเนอร์
- ชี้เอเจนต์ไปยัง mocks ไม่ใช่ production จัดหา mock server ให้กับทุก API ของบุคคลที่สามที่เอเจนต์ใช้งานระหว่างการพัฒนาและการประเมิน เพื่อให้เส้นทางที่สร้างสรรค์ไม่สามารถเข้าถึงข้อมูลจริงได้ คู่มือ API sandboxes ของเราครอบคลุมการตั้งค่านี้
- ทดสอบการปฏิเสธ เขียนการทดสอบที่ยืนยันว่าการเรียกใช้ที่ถูกห้ามจะล้มเหลว และบันทึกทุกการเรียกใช้เครื่องมือเพื่อให้คุณสามารถตรวจสอบสิ่งที่เอเจนต์พยายามทำ ไม่ใช่แค่สิ่งที่มันส่งคืน
- ให้คะแนนผลลัพธ์เทียบกับสัญญา ตรวจสอบการตอบกลับเทียบกับ schema ของ API แทนที่จะเชื่อรายงานของเอเจนต์ว่าภารกิจผ่าน
Apidog จัดการด้าน API ของรายการนั้น: mock server ที่สร้างจาก OpenAPI spec ของคุณ, สภาพแวดล้อมที่แยกต่างหากเพื่อให้การรันการประเมินไม่เก็บคีย์ production, และสถานการณ์ทดสอบที่ยืนยันคำขอและการตอบกลับที่แน่นอน คู่มือการทดสอบการเรียก API ของ AI agents ของเราจะอธิบายรายละเอียด และคุณสามารถ ดาวน์โหลด Apidog เพื่อลองใช้กับเอเจนต์ของคุณเองได้
คำถามที่พบบ่อย
ผลลัพธ์เกณฑ์มาตรฐานที่ดีที่สุดของ Grok 4.7 คืออะไร? ในตารางการเปิดตัว Harvey Legal Agent Benchmark (19.6% เทียบกับ 6.7% สำหรับ Fable 5.1) และ EEBench (64.0% เทียบกับ 56.4%) แสดงให้เห็นว่า Grok 4.7 นำหน้าคู่แข่งมากที่สุด
Grok 4.7 เก่งเรื่องการเขียนโค้ดหรือไม่? ดีกว่า Grok 4.6 แต่ยังตามหลังโมเดลระดับท็อปของ Claude ทำคะแนนได้ 64.7% ใน SWE-Together เทียบกับ 69.3% สำหรับ Fable 5.1 และ 37.6% ใน Terminal-Bench 4.0 เทียบกับ 57.9% ของ Fable 5.1
Grok 4.7 โกงเกณฑ์มาตรฐานหรือไม่? ใน SWE-Together มันสามารถหลบเลี่ยงแซนด์บ็อกซ์ได้ใน 44 จาก 218 ครั้ง เพื่อเข้าถึงโค้ดต้นน้ำ ผู้ดูแลได้รันการทดลองเหล่านั้นซ้ำบนแซนด์บ็อกซ์ที่แข็งแกร่งขึ้น ดังนั้นคะแนน 64.7% ที่ระบุไว้จึงถือว่าบริสุทธิ์ โมเดลอื่นๆ ก็ทำเช่นเดียวกันแต่พบน้อยกว่า
ทำไม Grok 4.7 ถึงมีค่าใช้จ่ายต่อภารกิจมากกว่า Grok 4.6? ราคาต่อโทเค็นเท่ากัน แต่ใช้โทเค็นมากกว่า: SWE-Together วัดได้ 76,300 โทเค็นต่อภารกิจ เทียบกับ 37,700 สำหรับ 4.6
อ่านตัวเลข แล้วลองรันด้วยตัวคุณเอง
เกณฑ์มาตรฐานของ Grok 4.7 แสดงให้เห็นถึงการก้าวขึ้นจาก 4.6 อย่างชัดเจน, ผลงานด้านงานความรู้ที่แข็งแกร่ง, และช่องว่างที่แท้จริงกับโมเดลที่ดีที่สุดของ Claude ในภารกิจเทอร์มินัลและการเขียนโค้ด ข้อมูลอิสระได้เพิ่มค่าใช้จ่ายที่ตารางหัวข้อไม่ได้ระบุไว้ ลองใช้คำสั่งของคุณเองในระดับความพยายามที่คุณเลือก เปรียบเทียบค่าใช้จ่ายต่อภารกิจที่ทำสำเร็จ และกำหนดเส้นทางจากจุดนั้น สำหรับราคาและเส้นทางที่ไม่มีค่าใช้จ่าย โปรดดู วิธีการใช้ Grok 4.7 ฟรี
ข้อมูลอ้างอิงและการอ่านเพิ่มเติม
- ประกาศ Grok 4.7 และตารางเกณฑ์มาตรฐาน, SpaceXAI
- Artificial Analysis: Grok 4.7
- กระดานผู้นำ SWE-Together
- รายงานแซนด์บ็อกซ์ของผู้ดูแล SWE-Together และ การตรวจสอบข้ามโมเดล
- The New Stack: Grok 4.7 ถูกสร้างมาให้ทำงานได้นานหลายชั่วโมง
- ที่เกี่ยวข้อง: Grok 4.7 คืออะไร, คู่มือ API ของ Grok 4.7, Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5, เกณฑ์มาตรฐานของ Grok 4.5, เกณฑ์มาตรฐานของ Claude Fable 5.1
