Grok 4.7, GPT-6 Sol, Claude Opus 5.5: เปรียบเทียบราคา, ผลทดสอบประสิทธิภาพ และเลือกรุ่นไหนดีที่สุด

Grok 4.7 เทียบกับ GPT-6 Sol เทียบกับ Claude Opus 5.5: ราคา, บริบท, เกณฑ์มาตรฐานที่ทับซ้อนกัน, การวิเคราะห์ประสิทธิภาพการแคชในภาระงานจริง และควรเลือกใช้ตัวไหน

Ashley Innocent

Ashley Innocent

29 September 2026

Grok 4.7, GPT-6 Sol, Claude Opus 5.5: เปรียบเทียบราคา, ผลทดสอบประสิทธิภาพ และเลือกรุ่นไหนดีที่สุด

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

Grok 4.7 มีราคาถูกที่สุดในสามรุ่นสำหรับโทเค็นเอาต์พุต (6 ดอลลาร์ต่อล้านโทเค็น เทียบกับ 10 ดอลลาร์สำหรับ GPT-6 Sol และ 20 ดอลลาร์สำหรับ Claude Opus 5.5) และ Opus 5.5 เป็นผู้นำในการทดสอบประสิทธิภาพการเขียนโค้ดทุกรายการที่ผู้จำหน่ายสองรายในจำนวนนี้เผยแพร่ชื่อเดียวกัน บนดัชนี Artificial Analysis Intelligence ซึ่งเป็นดัชนีรวมของบุคคลที่สาม ลำดับคือ Opus 5.5 ที่ 58, Sol ที่ 48 และ Grok 4.7 ที่ 46 รุ่นไหนที่ทำให้คุณเสียค่าใช้จ่ายน้อยกว่าขึ้นอยู่กับการแคชและจำนวนโทเค็นที่แต่ละโมเดลใช้ต่องาน สำหรับภาระงานของเอเจนต์ที่เน้นการแคช Sol จะเหนือกว่า Grok เล็กน้อย

ปุ่ม

ทั้งสามรุ่นออกวางจำหน่ายภายในเวลาประมาณ 36 ชั่วโมง SpaceXAI เปิดตัว Grok 4.7 ในวันที่ 21 กันยายน 2026 และ Anthropic กับ OpenAI เปิดตัว Opus 5.5 และ Sol ในวันที่ 22 กันยายน ช่วงเวลาดังกล่าวทำให้เกิดปัญหาที่คุณควรรู้ก่อนที่จะอ่านบทความเปรียบเทียบใดๆ รวมถึงบทความนี้ด้วย ด้านล่างนี้คือ: แผ่นข้อมูลจำเพาะ, แถวการทดสอบประสิทธิภาพที่ทับซ้อนกัน, การคำนวณราคาโดยมีและไม่มีการแคช, คำแนะนำในการกำหนดเส้นทาง, และวิธีการทดสอบทั้งสามรุ่นในโปรเจกต์ Apidog เดียว สำหรับข้อมูลแต่ละโมเดลโดยละเอียด โปรดดูที่ Grok 4.7 คืออะไร, GPT-6 Sol คืออะไร, และ Claude Opus 5.5 คืออะไร

ไม่มีใครทดสอบประสิทธิภาพทั้งสามรุ่นนี้เทียบกันเอง

การเปิดตัวแต่ละครั้งจะเปรียบเทียบกับโมเดลที่มีอยู่ ณ เวลาที่เขียน:

ดังนั้นจึงไม่มีตารางของผู้จำหน่ายรายใดที่มีทั้งสามรุ่นนี้อยู่ สิ่งที่คุณทำได้คือจัดแถวที่ใช้ชื่อการทดสอบประสิทธิภาพเดียวกัน อ่านข้อมูลเหล่านั้นเป็นแนวทางมากกว่าเป็นการจัดอันดับ และใช้ดัชนีของบุคคลที่สามเป็นตัวตัดสิน บทวิเคราะห์ GPT-6 Sol vs Claude Opus 5.5 ของเราเจาะลึกรายละเอียดของสองคู่นั้นมากขึ้น

แผ่นข้อมูลจำเพาะ

Grok 4.7 GPT-6 Sol Claude Opus 5.5
รหัสโมเดล API grok-4.7 gpt-6-sol claude-opus-5-5
วันวางจำหน่าย 21 ก.ย. 2026 22 ก.ย. 2026 22 ก.ย. 2026
อินพุต / เอาต์พุตต่อ 1M $2 / $6 $2 / $10 $4 / $20
การอ่านอินพุตที่แคชไว้ต่อ 1M $0.50 $0.20 (ลด 90%) $0.20
Context window 500,000 872,000 1,000,000
เอาต์พุตสูงสุด ไม่ระบุ ไม่ระบุ 128,000
ดัชนี AA Intelligence (บุคคลที่สาม) 46 (อันดับ 21 จาก 211) 48 58 (อันดับ 1 จาก 212)
ความเร็วเอาต์พุต AA (บุคคลที่สาม) 82.6 โทเค็น/วินาที ที่ xhigh 115.2 โทเค็น/วินาที ที่สูงสุด, 102 วินาทีสำหรับโทเค็นแรก ไม่มีในแหล่งข้อมูลของเรา
ช่องทางการเรียกใช้ xAI API, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel OpenAI API, ChatGPT Work, Codex Claude Platform, AWS, Google Cloud, Azure

สองแถวนี้เป็นตัวกำหนดภาระงานส่วนใหญ่ ราคาเอาต์พุต: Grok 4.7 ที่ 6 ดอลลาร์ ถูกกว่า Sol 40% และถูกกว่า Opus 5.5 70% ซึ่งสำคัญสำหรับโมเดลการใช้เหตุผลเพราะโทเค็นที่ใช้ในการคิดจะถูกนับเป็นเอาต์พุต Context: Grok 4.7 มีหน้าต่างบริบทที่เล็กที่สุด และ xAI จะเรียกเก็บเงินสำหรับคำขอทั้งหมดในอัตรารายคู่ (อินพุต 4 ดอลลาร์, เอาต์พุต 12 ดอลลาร์) เมื่อพร้อมต์ถึง 200,000 โทเค็น

การทดสอบประสิทธิภาพที่ทับซ้อนกัน

แถวเหล่านี้มีชื่อการทดสอบประสิทธิภาพร่วมกันในเอกสารของผู้จำหน่ายแต่ละราย ผู้จำหน่ายแต่ละรายรันโมเดลของตนเองบนเครื่องมือทดสอบของตนเองด้วยการตั้งค่าความพยายามของตนเอง ดังนั้นช่องว่างเล็กๆ จึงเป็นเพียงค่ารบกวน แต่ช่องว่างขนาดใหญ่ยังคงบ่งบอกบางสิ่งบางอย่างได้

การทดสอบประสิทธิภาพ (ผู้จำหน่ายดำเนินการ) Grok 4.7 GPT-6 Sol Claude Opus 5.5
Terminal-Bench 4.0 37.6% (xhigh) ไม่ได้เผยแพร่ 66.4%
CursorBench 4.0 46.3% (xhigh) ไม่ได้เผยแพร่ 57.8%
DeepSWE v1.1 71.0% (high) 68.8% (max) ไม่ได้เผยแพร่
GDPval, Elo 1,695 (xhigh) ไม่ได้เผยแพร่ 1,846 (GDPval-AA v2.1)

วิธีการอ่าน:

Grok 4.7 เป็นผู้นำในการประเมินสองรายการจากเอกสารของตนเอง ได้แก่ Harvey’s Legal Agent Benchmark ที่ 19.6% (GPT-5.6 Sol 2.5%, Fable 5.1 6.7%) และ EEBench ซึ่งเป็นการประเมินวิศวกรรมไฟฟ้า ที่ 64.0% (Fable 5.1 56.4%; GPT-6 Astra 69.3% ในแผนภูมิเดียวกัน) ทั้ง Sol และ Opus 5.5 ยังไม่มีคะแนนเผยแพร่ในทั้งสองรายการ ดังนั้นควรอ่านข้อมูลเหล่านี้เป็นสัญญาณสำหรับงานด้านกฎหมายและวิศวกรรม ไม่ใช่ชัยชนะเหนือคู่แข่งทั้งสองนี้

เครื่องมือทดสอบอิสระหนึ่งรายการสามารถรันสองในสามรุ่นนี้ด้วยวิธีเดียวกัน บน SWE-Together ซึ่งมี 109 งานจากคลังโค้ดจริงที่รันผ่านเครื่องมือทดสอบเอเจนต์เดียว Opus 5.5 ได้คะแนน 68.8% pass@1 และ Grok 4.7 ได้ 64.7% ซึ่งห่างกันประมาณ 4 จุด แทนที่จะเป็น 29 จุดใน Terminal-Bench GPT-6 Sol ยังไม่มีการระบุไว้ที่นั่น Grok 4.7 ยังใช้จ่ายไป 7.81 ดอลลาร์ต่องานบนกระดานนั้น ดังนั้นราคาโทเค็นจึงไม่ได้ทำให้มันมีราคาถูกต่องาน

ดัชนีของบุคคลที่สามเห็นด้วยกับลำดับโดยรวม: Opus 5.5 ที่ 58, Sol ที่ 48, Grok 4.7 ที่ 46 สำหรับทุกแถวและข้อควรระวังในด้านของ Grok โปรดดู บทวิเคราะห์การทดสอบประสิทธิภาพของ Grok 4.7 ซึ่งยังครอบคลุมรายงานของผู้ดูแลการทดสอบประสิทธิภาพที่ระบุว่า Grok 4.7 สามารถหลีกเลี่ยงแซนด์บ็อกซ์เพื่อดึงการแก้ไขจากต้นน้ำได้

แต่ละรุ่นมีค่าใช้จ่ายเท่าไรในภาระงานจริง

ราคาต่อโทเค็นเป็นเพียงส่วนหนึ่งของเรื่องราวเท่านั้น นี่คือการคำนวณจากอัตราที่เผยแพร่สำหรับภาระงานสองรูปแบบที่ 1,000 การรันต่อวัน การเขียนแคชไม่รวมอยู่ในนี้; Opus 5.5 คิดค่าบริการ 5 ดอลลาร์ต่อล้านสำหรับการเขียนแคช

Agent loop, cache-friendly (รอบเอเจนต์, เหมาะกับการแคช): โทเค็นอินพุต 50,000 โทเค็นต่อการรัน โดย 45,000 โทเค็นเป็นพรีฟิกซ์คงที่ (system prompt, tool schemas, docs) บวกกับโทเค็นเอาต์พุต 3,000 โทเค็น

ค่าใช้จ่ายรายวัน Grok 4.7 GPT-6 Sol Claude Opus 5.5
ไม่มีการเรียกใช้แคช $118.00 $130.00 $260.00
พรีฟิกซ์ถูกแคช $50.50 $49.00 $89.00

หากไม่มีการแคช Grok 4.7 จะถูกที่สุด เมื่อพรีฟิกซ์ถูกแคช Sol จะนำหน้าเล็กน้อย เพราะการอ่านแคชของ Sol มีค่าใช้จ่าย 0.20 ดอลลาร์ต่อล้าน เทียบกับ Grok ที่ 0.50 ดอลลาร์ ยิ่งพร้อมต์ของคุณซ้ำบ่อยเท่าไหร่ ส่วนลดเอาต์พุตของ Grok ก็ยิ่งช่วยได้น้อยลง

งานที่เน้นการใช้เหตุผล: โทเค็นอินพุต 10,000 โทเค็นและโทเค็นเอาต์พุต 20,000 โทเค็นต่อการรัน

ค่าใช้จ่ายรายวัน Grok 4.7 GPT-6 Sol Claude Opus 5.5
ไม่มีแคช $140 $220 $440

ในกรณีนี้ ราคาเอาต์พุตมีผลอย่างมาก: Grok 4.7 มีค่าใช้จ่ายประมาณ 64% ของ Sol และ 32% ของ Opus 5.5

ตารางทั้งสองนี้สมมติว่าแต่ละโมเดลใช้โทเค็นจำนวนเท่ากัน ซึ่งในความเป็นจริงแล้วไม่ใช่ ข้อมูล CursorBench ของ SpaceXAI แสดงให้เห็นว่า Grok 4.7 ใช้โทเค็นเอาต์พุตเฉลี่ย 70,141 โทเค็นต่องานที่ระดับ xhigh และ 15,677 โทเค็นที่ระดับ low โมเดลที่ต้องการโทเค็นสองเท่าจะเสียเปรียบด้านราคา ค่าใช้จ่ายต่องานที่เสร็จสมบูรณ์จากพร้อมต์ของคุณเป็นตัวตัดสินเรื่องนี้; การวิเคราะห์สงครามราคา ของเราอธิบายว่าทำไมผู้จำหน่ายจึงเริ่มเผยแพร่เมตริกนี้

ควรส่งงานไปที่รุ่นใด

เริ่มต้นจากภาระงาน แล้วจึงทดสอบ:

หลายทีมจะรันสองโมเดลเหล่านี้ผ่านเราเตอร์: หนึ่งโมเดลเป็นค่าเริ่มต้นราคาถูก และอีกโมเดลเป็นเส้นทางสำหรับการเพิ่มระดับที่มีค่าใช้จ่ายสูงสำหรับงานที่ล้มเหลว

ทดสอบทั้งสามรุ่นในโปรเจกต์ Apidog เดียว

การเปรียบเทียบที่สำคัญคือพร้อมต์ของคุณบนเครื่องมือทดสอบของคุณเอง Apidog จะเปลี่ยนสิ่งนั้นให้เป็นการทดสอบที่บันทึกไว้ แทนที่จะเป็นโปรเจกต์สำหรับช่วงสุดสัปดาห์:

  1. สร้างสามสภาพแวดล้อม แต่ละสภาพแวดล้อมสำหรับผู้ให้บริการแต่ละราย โดยมี base_url, คีย์ API เป็นความลับ และ model Grok 4.7 และ GPT-6 Sol ทั้งคู่ใช้ Responses API (POST {{base_url}}/responses พร้อมฟิลด์ input) ดังนั้นคำจำกัดความคำขอเดียวจึงครอบคลุมทั้งสอง Opus 5.5 ใช้ Anthropic’s Messages API (POST /v1/messages พร้อม messages, max_tokens ที่จำเป็น, และส่วนหัว x-api-key บวก anthropic-version) ดังนั้นจึงต้องกำหนดคำขอแยกต่างหากสำหรับมัน
  2. ใช้ข้อความพร้อมต์เดียวกัน ในทุกคำขอ โดยดึงมาจากตัวแปรที่แชร์กันเพื่อไม่ให้เกิดการเปลี่ยนแปลง
  3. เพิ่มการยืนยัน สำหรับสถานะ 200, คำตอบที่ไม่ว่างเปล่า และการมีอยู่ของ usage.input_tokens และ usage.output_tokens
  4. รันเป็นสถานการณ์ทดสอบเดียว และเปรียบเทียบเวลาตอบสนอง, จำนวนโทเค็น, และเอาต์พุตเคียงข้างกัน คูณจำนวนโทเค็นด้วยแถวราคาด้านบนเพื่อคำนวณค่าใช้จ่ายต่อการรันสำหรับงานของคุณ

รันที่ระดับความพยายามที่คุณจะใช้ในการผลิตจริง ไม่ใช่ระดับที่อยู่ในแผนภูมิการทดสอบประสิทธิภาพ ดาวน์โหลด Apidog เพื่อสร้างสิ่งนี้

คำถามที่พบบ่อย

Grok 4.7 ดีกว่า GPT-6 หรือไม่? ไม่ใช่จากข้อมูลที่มีอยู่ ดัชนี Artificial Analysis ระบุว่า GPT-6 Sol อยู่ที่ 48 และ Grok 4.7 อยู่ที่ 46 และ OpenAI เรียก GPT-6 Astra ว่าเป็นโมเดลที่ดีที่สุด Grok 4.7 มีราคาถูกกว่าในส่วนเอาต์พุตและเป็นผู้นำในการประเมินด้านกฎหมายและวิศวกรรมของตนเอง

Grok 4.7 ดีกว่า Claude Opus 5.5 หรือไม่? Opus 5.5 เป็นผู้นำในการทดสอบ Terminal-Bench 4.0 (66.4% เทียบกับ 37.6%) และ CursorBench 4.0 (57.8% เทียบกับ 46.3%) และอยู่ในอันดับแรกในดัชนี Artificial Analysis Grok 4.7 มีค่าใช้จ่ายเพียงครึ่งหนึ่งสำหรับอินพุตและน้อยกว่าหนึ่งในสามสำหรับเอาต์พุต

รุ่นไหนถูกที่สุด? ต่อโทเค็น Grok 4.7 ถูกที่สุดสำหรับเอาต์พุต และมีราคาเท่ากับ Sol สำหรับอินพุต หากมีการแคชพร้อมต์จำนวนมาก Sol อาจนำหน้าได้ เนื่องจากค่าใช้จ่ายในการอ่านแคชของ Sol อยู่ที่ 0.20 ดอลลาร์ต่อล้าน เทียบกับ Grok ที่ 0.50 ดอลลาร์

ฉันสามารถทดลองใช้ทั้งสามรุ่นได้ฟรีหรือไม่? แต่ละรุ่นมีช่องทางฟรีที่จำกัด ดู วิธีใช้ Grok 4.7 ฟรี, GPT-6 Sol ฟรี และ Claude Opus 5.5 ฟรี

ฉันจะเรียกใช้ Grok 4.7 จากโค้ดได้อย่างไร? ใช้ POST https://api.x.ai/v1/responses พร้อม "model": "grok-4.7" คู่มือ API ของ Grok 4.7 มีตัวอย่าง curl และ SDK

ตัดสินใจด้วยตัวเลขของคุณเอง

เลือกโมเดลสองรุ่นที่ภาระงานของคุณชี้ไป บันทึกพร้อมต์เดียวกันกับทั้งสองใน Apidog และรันที่ระดับความพยายามที่คุณใช้ในการผลิตจริง เปรียบเทียบค่าใช้จ่ายต่องานที่เสร็จสมบูรณ์และความหน่วงเวลา จากนั้นกำหนดเส้นทาง เมื่อโมเดลถัดไปเปิดตัว ให้เพิ่มสภาพแวดล้อมและรันซ้ำ

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API