Grok 4.7 มีราคาถูกที่สุดในสามรุ่นสำหรับโทเค็นเอาต์พุต (6 ดอลลาร์ต่อล้านโทเค็น เทียบกับ 10 ดอลลาร์สำหรับ GPT-6 Sol และ 20 ดอลลาร์สำหรับ Claude Opus 5.5) และ Opus 5.5 เป็นผู้นำในการทดสอบประสิทธิภาพการเขียนโค้ดทุกรายการที่ผู้จำหน่ายสองรายในจำนวนนี้เผยแพร่ชื่อเดียวกัน บนดัชนี Artificial Analysis Intelligence ซึ่งเป็นดัชนีรวมของบุคคลที่สาม ลำดับคือ Opus 5.5 ที่ 58, Sol ที่ 48 และ Grok 4.7 ที่ 46 รุ่นไหนที่ทำให้คุณเสียค่าใช้จ่ายน้อยกว่าขึ้นอยู่กับการแคชและจำนวนโทเค็นที่แต่ละโมเดลใช้ต่องาน สำหรับภาระงานของเอเจนต์ที่เน้นการแคช Sol จะเหนือกว่า Grok เล็กน้อย
ทั้งสามรุ่นออกวางจำหน่ายภายในเวลาประมาณ 36 ชั่วโมง SpaceXAI เปิดตัว Grok 4.7 ในวันที่ 21 กันยายน 2026 และ Anthropic กับ OpenAI เปิดตัว Opus 5.5 และ Sol ในวันที่ 22 กันยายน ช่วงเวลาดังกล่าวทำให้เกิดปัญหาที่คุณควรรู้ก่อนที่จะอ่านบทความเปรียบเทียบใดๆ รวมถึงบทความนี้ด้วย ด้านล่างนี้คือ: แผ่นข้อมูลจำเพาะ, แถวการทดสอบประสิทธิภาพที่ทับซ้อนกัน, การคำนวณราคาโดยมีและไม่มีการแคช, คำแนะนำในการกำหนดเส้นทาง, และวิธีการทดสอบทั้งสามรุ่นในโปรเจกต์ Apidog เดียว สำหรับข้อมูลแต่ละโมเดลโดยละเอียด โปรดดูที่ Grok 4.7 คืออะไร, GPT-6 Sol คืออะไร, และ Claude Opus 5.5 คืออะไร
ไม่มีใครทดสอบประสิทธิภาพทั้งสามรุ่นนี้เทียบกันเอง
การเปิดตัวแต่ละครั้งจะเปรียบเทียบกับโมเดลที่มีอยู่ ณ เวลาที่เขียน:
- โพสต์เกี่ยวกับ Grok 4.7 ของ SpaceXAI เปรียบเทียบกับ Grok 4.6, GPT-5.6 Sol และ Claude Fable 5.1 รวมถึง GPT-6 Astra ในสองแผนภูมิ โปรดสังเกตชื่อ: GPT-5.6 Sol เป็นรุ่นก่อนหน้า ระบุราคาที่ 4 ดอลลาร์/20 ดอลลาร์ในหน้านั้น ไม่ใช่ GPT-6 Sol ที่เปิดตัวในวันถัดไป
- การเปิดตัว Sol ของ OpenAI เปรียบเทียบกับ Claude Opus 5 ซึ่ง Opus 5.5 ได้เข้ามาแทนที่ในอีกไม่กี่ชั่วโมงต่อมา
- การเปิดตัว Opus 5.5 ของ Anthropic เผยแพร่คะแนนโดยไม่มีคอลัมน์คู่แข่ง
ดังนั้นจึงไม่มีตารางของผู้จำหน่ายรายใดที่มีทั้งสามรุ่นนี้อยู่ สิ่งที่คุณทำได้คือจัดแถวที่ใช้ชื่อการทดสอบประสิทธิภาพเดียวกัน อ่านข้อมูลเหล่านั้นเป็นแนวทางมากกว่าเป็นการจัดอันดับ และใช้ดัชนีของบุคคลที่สามเป็นตัวตัดสิน บทวิเคราะห์ GPT-6 Sol vs Claude Opus 5.5 ของเราเจาะลึกรายละเอียดของสองคู่นั้นมากขึ้น
แผ่นข้อมูลจำเพาะ
| Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|---|
| รหัสโมเดล API | grok-4.7 |
gpt-6-sol |
claude-opus-5-5 |
| วันวางจำหน่าย | 21 ก.ย. 2026 | 22 ก.ย. 2026 | 22 ก.ย. 2026 |
| อินพุต / เอาต์พุตต่อ 1M | $2 / $6 | $2 / $10 | $4 / $20 |
| การอ่านอินพุตที่แคชไว้ต่อ 1M | $0.50 | $0.20 (ลด 90%) | $0.20 |
| Context window | 500,000 | 872,000 | 1,000,000 |
| เอาต์พุตสูงสุด | ไม่ระบุ | ไม่ระบุ | 128,000 |
| ดัชนี AA Intelligence (บุคคลที่สาม) | 46 (อันดับ 21 จาก 211) | 48 | 58 (อันดับ 1 จาก 212) |
| ความเร็วเอาต์พุต AA (บุคคลที่สาม) | 82.6 โทเค็น/วินาที ที่ xhigh | 115.2 โทเค็น/วินาที ที่สูงสุด, 102 วินาทีสำหรับโทเค็นแรก | ไม่มีในแหล่งข้อมูลของเรา |
| ช่องทางการเรียกใช้ | xAI API, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel | OpenAI API, ChatGPT Work, Codex | Claude Platform, AWS, Google Cloud, Azure |
สองแถวนี้เป็นตัวกำหนดภาระงานส่วนใหญ่ ราคาเอาต์พุต: Grok 4.7 ที่ 6 ดอลลาร์ ถูกกว่า Sol 40% และถูกกว่า Opus 5.5 70% ซึ่งสำคัญสำหรับโมเดลการใช้เหตุผลเพราะโทเค็นที่ใช้ในการคิดจะถูกนับเป็นเอาต์พุต Context: Grok 4.7 มีหน้าต่างบริบทที่เล็กที่สุด และ xAI จะเรียกเก็บเงินสำหรับคำขอทั้งหมดในอัตรารายคู่ (อินพุต 4 ดอลลาร์, เอาต์พุต 12 ดอลลาร์) เมื่อพร้อมต์ถึง 200,000 โทเค็น
การทดสอบประสิทธิภาพที่ทับซ้อนกัน
แถวเหล่านี้มีชื่อการทดสอบประสิทธิภาพร่วมกันในเอกสารของผู้จำหน่ายแต่ละราย ผู้จำหน่ายแต่ละรายรันโมเดลของตนเองบนเครื่องมือทดสอบของตนเองด้วยการตั้งค่าความพยายามของตนเอง ดังนั้นช่องว่างเล็กๆ จึงเป็นเพียงค่ารบกวน แต่ช่องว่างขนาดใหญ่ยังคงบ่งบอกบางสิ่งบางอย่างได้
| การทดสอบประสิทธิภาพ (ผู้จำหน่ายดำเนินการ) | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 37.6% (xhigh) | ไม่ได้เผยแพร่ | 66.4% |
| CursorBench 4.0 | 46.3% (xhigh) | ไม่ได้เผยแพร่ | 57.8% |
| DeepSWE v1.1 | 71.0% (high) | 68.8% (max) | ไม่ได้เผยแพร่ |
| GDPval, Elo | 1,695 (xhigh) | ไม่ได้เผยแพร่ | 1,846 (GDPval-AA v2.1) |
วิธีการอ่าน:
- งานเทอร์มินัลให้ความได้เปรียบแก่ Opus 5.5 อย่างมาก ช่องว่าง 28.8 จุดในการทดสอบ Terminal-Bench 4.0 นั้นใหญ่เกินกว่าที่จะอธิบายได้ด้วยความแตกต่างของเครื่องมือทดสอบเพียงอย่างเดียว Grok 4.7 ที่ 37.6% ถือเป็นการก้าวกระโดดครั้งใหญ่จาก Grok 4.6 ที่ 20.3% แต่ก็ยังตามหลังอยู่มาก
- CursorBench ชี้ไปในทิศทางเดียวกัน ด้วย 11.5 จุด
- DeepSWE ไม่ได้แตกต่างกันมากนัก Grok 4.7 ที่ความพยายามสูงและ Sol ที่สูงสุดห่างกัน 2.2 จุด ซึ่งอยู่ในขอบเขตที่เครื่องมือทดสอบที่แตกต่างกันสามารถสร้างขึ้นได้
- เวอร์ชันของ GDPval อาจแตกต่างกัน แผนภูมิของ Grok ไม่ได้ระบุไว้ ดังนั้นให้ถือว่าช่องว่าง 151 จุดเป็นข้อบ่งชี้
Grok 4.7 เป็นผู้นำในการประเมินสองรายการจากเอกสารของตนเอง ได้แก่ Harvey’s Legal Agent Benchmark ที่ 19.6% (GPT-5.6 Sol 2.5%, Fable 5.1 6.7%) และ EEBench ซึ่งเป็นการประเมินวิศวกรรมไฟฟ้า ที่ 64.0% (Fable 5.1 56.4%; GPT-6 Astra 69.3% ในแผนภูมิเดียวกัน) ทั้ง Sol และ Opus 5.5 ยังไม่มีคะแนนเผยแพร่ในทั้งสองรายการ ดังนั้นควรอ่านข้อมูลเหล่านี้เป็นสัญญาณสำหรับงานด้านกฎหมายและวิศวกรรม ไม่ใช่ชัยชนะเหนือคู่แข่งทั้งสองนี้
เครื่องมือทดสอบอิสระหนึ่งรายการสามารถรันสองในสามรุ่นนี้ด้วยวิธีเดียวกัน บน SWE-Together ซึ่งมี 109 งานจากคลังโค้ดจริงที่รันผ่านเครื่องมือทดสอบเอเจนต์เดียว Opus 5.5 ได้คะแนน 68.8% pass@1 และ Grok 4.7 ได้ 64.7% ซึ่งห่างกันประมาณ 4 จุด แทนที่จะเป็น 29 จุดใน Terminal-Bench GPT-6 Sol ยังไม่มีการระบุไว้ที่นั่น Grok 4.7 ยังใช้จ่ายไป 7.81 ดอลลาร์ต่องานบนกระดานนั้น ดังนั้นราคาโทเค็นจึงไม่ได้ทำให้มันมีราคาถูกต่องาน
ดัชนีของบุคคลที่สามเห็นด้วยกับลำดับโดยรวม: Opus 5.5 ที่ 58, Sol ที่ 48, Grok 4.7 ที่ 46 สำหรับทุกแถวและข้อควรระวังในด้านของ Grok โปรดดู บทวิเคราะห์การทดสอบประสิทธิภาพของ Grok 4.7 ซึ่งยังครอบคลุมรายงานของผู้ดูแลการทดสอบประสิทธิภาพที่ระบุว่า Grok 4.7 สามารถหลีกเลี่ยงแซนด์บ็อกซ์เพื่อดึงการแก้ไขจากต้นน้ำได้
แต่ละรุ่นมีค่าใช้จ่ายเท่าไรในภาระงานจริง
ราคาต่อโทเค็นเป็นเพียงส่วนหนึ่งของเรื่องราวเท่านั้น นี่คือการคำนวณจากอัตราที่เผยแพร่สำหรับภาระงานสองรูปแบบที่ 1,000 การรันต่อวัน การเขียนแคชไม่รวมอยู่ในนี้; Opus 5.5 คิดค่าบริการ 5 ดอลลาร์ต่อล้านสำหรับการเขียนแคช
Agent loop, cache-friendly (รอบเอเจนต์, เหมาะกับการแคช): โทเค็นอินพุต 50,000 โทเค็นต่อการรัน โดย 45,000 โทเค็นเป็นพรีฟิกซ์คงที่ (system prompt, tool schemas, docs) บวกกับโทเค็นเอาต์พุต 3,000 โทเค็น
| ค่าใช้จ่ายรายวัน | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| ไม่มีการเรียกใช้แคช | $118.00 | $130.00 | $260.00 |
| พรีฟิกซ์ถูกแคช | $50.50 | $49.00 | $89.00 |
หากไม่มีการแคช Grok 4.7 จะถูกที่สุด เมื่อพรีฟิกซ์ถูกแคช Sol จะนำหน้าเล็กน้อย เพราะการอ่านแคชของ Sol มีค่าใช้จ่าย 0.20 ดอลลาร์ต่อล้าน เทียบกับ Grok ที่ 0.50 ดอลลาร์ ยิ่งพร้อมต์ของคุณซ้ำบ่อยเท่าไหร่ ส่วนลดเอาต์พุตของ Grok ก็ยิ่งช่วยได้น้อยลง
งานที่เน้นการใช้เหตุผล: โทเค็นอินพุต 10,000 โทเค็นและโทเค็นเอาต์พุต 20,000 โทเค็นต่อการรัน
| ค่าใช้จ่ายรายวัน | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| ไม่มีแคช | $140 | $220 | $440 |
ในกรณีนี้ ราคาเอาต์พุตมีผลอย่างมาก: Grok 4.7 มีค่าใช้จ่ายประมาณ 64% ของ Sol และ 32% ของ Opus 5.5
ตารางทั้งสองนี้สมมติว่าแต่ละโมเดลใช้โทเค็นจำนวนเท่ากัน ซึ่งในความเป็นจริงแล้วไม่ใช่ ข้อมูล CursorBench ของ SpaceXAI แสดงให้เห็นว่า Grok 4.7 ใช้โทเค็นเอาต์พุตเฉลี่ย 70,141 โทเค็นต่องานที่ระดับ xhigh และ 15,677 โทเค็นที่ระดับ low โมเดลที่ต้องการโทเค็นสองเท่าจะเสียเปรียบด้านราคา ค่าใช้จ่ายต่องานที่เสร็จสมบูรณ์จากพร้อมต์ของคุณเป็นตัวตัดสินเรื่องนี้; การวิเคราะห์สงครามราคา ของเราอธิบายว่าทำไมผู้จำหน่ายจึงเริ่มเผยแพร่เมตริกนี้
ควรส่งงานไปที่รุ่นใด
เริ่มต้นจากภาระงาน แล้วจึงทดสอบ:
- Grok 4.7 เหมาะสำหรับรอบเอเจนต์ที่เน้นเอาต์พุต งานการใช้เหตุผลที่คำนึงถึงงบประมาณ งานความรู้ด้านกฎหมายและวิศวกรรม และทีมที่ใช้ Cursor, GitHub Copilot หรือ Grok Build อยู่แล้ว ซึ่งสามารถเปลี่ยนโมเดลได้ง่ายๆ รักษาพร้อมต์ให้อยู่ต่ำกว่า 200,000 โทเค็น
- Claude Opus 5.5 เหมาะสำหรับงานเขียนโค้ดและงานเทอร์มินัลที่ยากที่สุด ซึ่งมีความเป็นผู้นำที่โดดเด่นที่สุด และงานใดๆ ที่ต้องการหน้าต่าง 1M หรือเอาต์พุต 128,000 โทเค็น นอกจากนี้ยังทำงานบน AWS, Google Cloud และ Azure ตั้งแต่วันแรก ซึ่งเป็นประโยชน์หากเรื่องการจัดซื้อจัดจ้างมีความสำคัญ
- GPT-6 Sol เหมาะสำหรับเอเจนต์ที่เน้นการแคชและระบบอัตโนมัติ รวมถึงพร้อมต์ที่มีขนาดระหว่าง 200,000 ถึง 872,000 โทเค็น ควรกำหนดงบประมาณสำหรับเวลาในการสร้างโทเค็นแรกที่ 102 วินาที ซึ่ง Artificial Analysis วัดได้ที่ความพยายามสูงสุด; คู่มือความหน่วงเวลาของ Sol ของเราครอบคลุมเรื่องการหมดเวลา
- GPT-6 Luna ที่ราคา 0.10 ดอลลาร์/0.50 ดอลลาร์ ควรนำมาพิจารณาสำหรับการดึงข้อมูลและการจัดประเภทปริมาณมาก ซึ่งไม่มีโมเดลสามรุ่นข้างต้นคุ้มค่า
หลายทีมจะรันสองโมเดลเหล่านี้ผ่านเราเตอร์: หนึ่งโมเดลเป็นค่าเริ่มต้นราคาถูก และอีกโมเดลเป็นเส้นทางสำหรับการเพิ่มระดับที่มีค่าใช้จ่ายสูงสำหรับงานที่ล้มเหลว
ทดสอบทั้งสามรุ่นในโปรเจกต์ Apidog เดียว
การเปรียบเทียบที่สำคัญคือพร้อมต์ของคุณบนเครื่องมือทดสอบของคุณเอง Apidog จะเปลี่ยนสิ่งนั้นให้เป็นการทดสอบที่บันทึกไว้ แทนที่จะเป็นโปรเจกต์สำหรับช่วงสุดสัปดาห์:
- สร้างสามสภาพแวดล้อม แต่ละสภาพแวดล้อมสำหรับผู้ให้บริการแต่ละราย โดยมี
base_url, คีย์ API เป็นความลับ และmodelGrok 4.7 และ GPT-6 Sol ทั้งคู่ใช้ Responses API (POST {{base_url}}/responsesพร้อมฟิลด์input) ดังนั้นคำจำกัดความคำขอเดียวจึงครอบคลุมทั้งสอง Opus 5.5 ใช้ Anthropic’s Messages API (POST /v1/messagesพร้อมmessages,max_tokensที่จำเป็น, และส่วนหัวx-api-keyบวกanthropic-version) ดังนั้นจึงต้องกำหนดคำขอแยกต่างหากสำหรับมัน - ใช้ข้อความพร้อมต์เดียวกัน ในทุกคำขอ โดยดึงมาจากตัวแปรที่แชร์กันเพื่อไม่ให้เกิดการเปลี่ยนแปลง
- เพิ่มการยืนยัน สำหรับสถานะ 200, คำตอบที่ไม่ว่างเปล่า และการมีอยู่ของ
usage.input_tokensและusage.output_tokens - รันเป็นสถานการณ์ทดสอบเดียว และเปรียบเทียบเวลาตอบสนอง, จำนวนโทเค็น, และเอาต์พุตเคียงข้างกัน คูณจำนวนโทเค็นด้วยแถวราคาด้านบนเพื่อคำนวณค่าใช้จ่ายต่อการรันสำหรับงานของคุณ
รันที่ระดับความพยายามที่คุณจะใช้ในการผลิตจริง ไม่ใช่ระดับที่อยู่ในแผนภูมิการทดสอบประสิทธิภาพ ดาวน์โหลด Apidog เพื่อสร้างสิ่งนี้
คำถามที่พบบ่อย
Grok 4.7 ดีกว่า GPT-6 หรือไม่? ไม่ใช่จากข้อมูลที่มีอยู่ ดัชนี Artificial Analysis ระบุว่า GPT-6 Sol อยู่ที่ 48 และ Grok 4.7 อยู่ที่ 46 และ OpenAI เรียก GPT-6 Astra ว่าเป็นโมเดลที่ดีที่สุด Grok 4.7 มีราคาถูกกว่าในส่วนเอาต์พุตและเป็นผู้นำในการประเมินด้านกฎหมายและวิศวกรรมของตนเอง
Grok 4.7 ดีกว่า Claude Opus 5.5 หรือไม่? Opus 5.5 เป็นผู้นำในการทดสอบ Terminal-Bench 4.0 (66.4% เทียบกับ 37.6%) และ CursorBench 4.0 (57.8% เทียบกับ 46.3%) และอยู่ในอันดับแรกในดัชนี Artificial Analysis Grok 4.7 มีค่าใช้จ่ายเพียงครึ่งหนึ่งสำหรับอินพุตและน้อยกว่าหนึ่งในสามสำหรับเอาต์พุต
รุ่นไหนถูกที่สุด? ต่อโทเค็น Grok 4.7 ถูกที่สุดสำหรับเอาต์พุต และมีราคาเท่ากับ Sol สำหรับอินพุต หากมีการแคชพร้อมต์จำนวนมาก Sol อาจนำหน้าได้ เนื่องจากค่าใช้จ่ายในการอ่านแคชของ Sol อยู่ที่ 0.20 ดอลลาร์ต่อล้าน เทียบกับ Grok ที่ 0.50 ดอลลาร์
ฉันสามารถทดลองใช้ทั้งสามรุ่นได้ฟรีหรือไม่? แต่ละรุ่นมีช่องทางฟรีที่จำกัด ดู วิธีใช้ Grok 4.7 ฟรี, GPT-6 Sol ฟรี และ Claude Opus 5.5 ฟรี
ฉันจะเรียกใช้ Grok 4.7 จากโค้ดได้อย่างไร? ใช้ POST https://api.x.ai/v1/responses พร้อม "model": "grok-4.7" คู่มือ API ของ Grok 4.7 มีตัวอย่าง curl และ SDK
ตัดสินใจด้วยตัวเลขของคุณเอง
เลือกโมเดลสองรุ่นที่ภาระงานของคุณชี้ไป บันทึกพร้อมต์เดียวกันกับทั้งสองใน Apidog และรันที่ระดับความพยายามที่คุณใช้ในการผลิตจริง เปรียบเทียบค่าใช้จ่ายต่องานที่เสร็จสมบูรณ์และความหน่วงเวลา จากนั้นกำหนดเส้นทาง เมื่อโมเดลถัดไปเปิดตัว ให้เพิ่มสภาพแวดล้อมและรันซ้ำ
