So sánh Grok 4.7, GPT-6 Sol và Claude Opus 5.5: Giá, Hiệu năng và Lựa chọn tối ưu

So sánh Grok 4.7, GPT-6 Sol và Claude Opus 5.5: giá cả, ngữ cảnh, các tiêu chí đánh giá trùng lặp, tính toán bộ nhớ đệm trên các tải công việc thực tế, và nên chọn mô hình nào.

Ashley Innocent

Ashley Innocent

29 tháng 9 2026

So sánh Grok 4.7, GPT-6 Sol và Claude Opus 5.5: Giá, Hiệu năng và Lựa chọn tối ưu

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Grok 4.7 là mô hình rẻ nhất trong ba mô hình về token đầu ra (6 đô la/triệu, so với 10 đô la cho GPT-6 Sol và 20 đô la cho Claude Opus 5.5), và Opus 5.5 dẫn đầu trong mọi tiêu chuẩn mã hóa mà hai trong số các nhà cung cấp này công bố cùng tên. Trên Chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index), một chỉ số tổng hợp của bên thứ ba, thứ tự là Opus 5.5 đạt 58 điểm, Sol đạt 48 điểm và Grok 4.7 đạt 46 điểm. Mô hình nào tốn ít chi phí hơn cho bạn tùy thuộc vào việc lưu vào bộ nhớ đệm và số lượng token mà mỗi mô hình sử dụng cho mỗi tác vụ; đối với khối lượng công việc của tác nhân sử dụng nhiều bộ nhớ đệm, Sol vượt trội hơn Grok.

nút

Cả ba mô hình đều được phát hành trong vòng khoảng 36 giờ. SpaceXAI đã ra mắt Grok 4.7 vào ngày 21 tháng 9 năm 2026, và Anthropic cùng OpenAI đã phát hành Opus 5.5 và Sol vào ngày 22 tháng 9. Thời điểm này tạo ra một vấn đề mà bạn nên biết trước khi đọc bất kỳ so sánh nào, kể cả bài này. Dưới đây: bảng thông số kỹ thuật, các hàng tiêu chuẩn trùng lặp, cách tính giá có và không có bộ nhớ đệm, lời khuyên về định tuyến, và cách để kiểm tra cả ba trong một dự án Apidog. Để tìm hiểu về từng mô hình, hãy xem Grok 4.7 là gì, GPT-6 Sol là gì, và Claude Opus 5.5 là gì.

Không ai chấm điểm chuẩn ba mô hình này với nhau

Mỗi lần ra mắt đều so sánh với các mô hình đã tồn tại vào thời điểm đó:

Vì vậy, không có bảng nào của nhà cung cấp chứa cả ba. Điều bạn có thể làm là xếp các hàng có cùng tên tiêu chuẩn, coi chúng là định hướng hơn là thứ hạng, và sử dụng chỉ số của bên thứ ba để phá vỡ thế bế tắc. Bài so sánh chi tiết GPT-6 Sol vs Claude Opus 5.5 của chúng tôi đi sâu hơn vào cặp này.

Bảng thông số kỹ thuật

Grok 4.7 GPT-6 Sol Claude Opus 5.5
ID mô hình API grok-4.7 gpt-6-sol claude-opus-5-5
Phát hành 21 tháng 9 năm 2026 22 tháng 9 năm 2026 22 tháng 9 năm 2026
Đầu vào / đầu ra mỗi 1 triệu 2 đô la / 6 đô la 2 đô la / 10 đô la 4 đô la / 20 đô la
Đọc đầu vào đã lưu vào bộ đệm mỗi 1 triệu 0,50 đô la 0,20 đô la (giảm 90%) 0,20 đô la
Cửa sổ ngữ cảnh 500.000 872.000 1.000.000
Đầu ra tối đa không được liệt kê không nêu rõ 128.000
Chỉ số trí tuệ AA (bên thứ ba) 46 (#21 trên 211) 48 58 (#1 trên 212)
Tốc độ đầu ra AA (bên thứ ba) 82,6 token/giây ở mức xhigh 115,2 token/giây ở mức tối đa, 102 giây cho token đầu tiên không có trong nguồn của chúng tôi
Nơi gọi xAI API, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel OpenAI API, ChatGPT Work, Codex Claude Platform, AWS, Google Cloud, Azure

Hai hàng quyết định hầu hết các khối lượng công việc. Giá đầu ra: 6 đô la của Grok 4.7 thấp hơn Sol 40% và thấp hơn Opus 5.5 70%, điều này quan trọng đối với các mô hình suy luận vì các token tư duy được tính phí như đầu ra. Ngữ cảnh: Grok 4.7 có cửa sổ nhỏ nhất và xAI tính phí toàn bộ yêu cầu với giá gấp đôi (4 đô la đầu vào, 12 đô la đầu ra) một khi lời nhắc đạt 200.000 token.

Các tiêu chuẩn trùng lặp

Các hàng này chia sẻ cùng tên tiêu chuẩn trên các bảng của nhà cung cấp. Mỗi nhà cung cấp đều chạy mô hình của riêng mình trên hệ thống của riêng mình với cài đặt nỗ lực riêng, vì vậy những khoảng cách nhỏ chỉ là nhiễu. Những khoảng cách lớn vẫn nói lên điều gì đó.

Tiêu chuẩn (do nhà cung cấp chạy) Grok 4.7 GPT-6 Sol Claude Opus 5.5
Terminal-Bench 4.0 37,6% (xhigh) chưa công bố 66,4%
CursorBench 4.0 46,3% (xhigh) chưa công bố 57,8%
DeepSWE v1.1 71,0% (high) 68,8% (max) chưa công bố
GDPval, Elo 1.695 (xhigh) chưa công bố 1.846 (GDPval-AA v2.1)

Cách đọc:

Grok 4.7 dẫn đầu trong hai đánh giá từ bảng riêng của nó: Tiêu chuẩn Đại lý Pháp lý của Harvey (Harvey’s Legal Agent Benchmark) ở mức 19,6% (GPT-5.6 Sol 2,5%, Fable 5.1 6,7%) và EEBench, một đánh giá kỹ thuật điện, ở mức 64,0% (Fable 5.1 56,4%; GPT-6 Astra 69,3% trên cùng biểu đồ). Cả Sol và Opus 5.5 đều không có điểm số được công bố trên cả hai, vì vậy hãy coi đây là tín hiệu cho công việc kiến thức pháp lý và kỹ thuật, chứ không phải là chiến thắng so với hai đối thủ này.

Một hệ thống độc lập chạy hai trong ba mô hình theo cùng một cách. Trên SWE-Together, với 109 tác vụ kho lưu trữ thực chạy qua một hệ thống tác nhân, Opus 5.5 đạt 68,8% pass@1 và Grok 4.7 đạt 64,7%, cách nhau khoảng 4 điểm thay vì 29 điểm trên Terminal-Bench. GPT-6 Sol chưa được liệt kê ở đó. Grok 4.7 cũng tiêu tốn 7,81 đô la cho mỗi tác vụ trên bảng đó, vì vậy giá token của nó không làm cho nó rẻ hơn trên mỗi tác vụ.

Chỉ số của bên thứ ba đồng ý với thứ tự tổng thể: Opus 5.5 58, Sol 48, Grok 4.7 46. Đối với mỗi hàng và lưu ý về Grok, hãy xem bài phân tích chi tiết tiêu chuẩn của Grok 4.7 của chúng tôi, bài này cũng bao gồm báo cáo của người duy trì tiêu chuẩn rằng Grok 4.7 đã vượt qua hộp cát của họ để lấy các bản sửa lỗi từ nguồn.

Chi phí của mỗi mô hình trên khối lượng công việc thực tế

Giá mỗi token chỉ kể một phần câu chuyện. Dưới đây là tính toán dựa trên mức giá công bố cho hai dạng khối lượng công việc với 1.000 lượt chạy mỗi ngày. Các thao tác ghi vào bộ nhớ đệm được loại trừ; Opus 5.5 tính phí 5 đô la cho mỗi triệu thao tác này.

Vòng lặp tác nhân, thân thiện với bộ nhớ đệm: 50.000 token đầu vào mỗi lần chạy, trong đó 45.000 là tiền tố ổn định (lời nhắc hệ thống, lược đồ công cụ, tài liệu), cộng với 3.000 token đầu ra.

Chi phí hàng ngày Grok 4.7 GPT-6 Sol Claude Opus 5.5
Không có lượt truy cập bộ đệm 118,00 đô la 130,00 đô la 260,00 đô la
Tiền tố được lưu vào bộ đệm 50,50 đô la 49,00 đô la 89,00 đô la

Không có bộ nhớ đệm, Grok 4.7 là rẻ nhất. Với tiền tố được lưu vào bộ nhớ đệm, Sol dẫn trước, vì việc đọc từ bộ nhớ đệm của nó tốn 0,20 đô la mỗi triệu, so với 0,50 đô la của Grok. Các lời nhắc của bạn càng lặp lại nhiều, thì ưu đãi về đầu ra của Grok càng ít hữu ích.

Tác vụ nặng về suy luận: 10.000 token đầu vào và 20.000 token đầu ra mỗi lần chạy.

Chi phí hàng ngày Grok 4.7 GPT-6 Sol Claude Opus 5.5
Chưa lưu vào bộ đệm 140 đô la 220 đô la 440 đô la

Ở đây, giá đầu ra chiếm ưu thế: Grok 4.7 có giá khoảng 64% so với Sol và 32% so với Opus 5.5.

Cả hai bảng đều giả định mỗi mô hình tiêu tốn cùng một số lượng token, nhưng thực tế không phải vậy. Dữ liệu CursorBench của SpaceXAI cho thấy Grok 4.7 trung bình 70.141 token đầu ra mỗi tác vụ ở mức xhigh và 15.677 ở mức low. Một mô hình cần số token gấp đôi sẽ mất đi lợi thế về giá. Chi phí cho mỗi tác vụ hoàn thành trên các lời nhắc của bạn sẽ quyết định điều này; phân tích cuộc chiến giá cả mô hình AI của chúng tôi giải thích lý do tại sao các nhà cung cấp bắt đầu công bố chỉ số đó.

Nên chọn mô hình nào để định tuyến

Bắt đầu từ khối lượng công việc, sau đó kiểm tra:

Nhiều nhóm sẽ chạy hai trong số này đằng sau một bộ định tuyến: một mặc định giá rẻ và một đường dẫn leo thang đắt tiền cho các tác vụ thất bại.

Kiểm tra cả ba trong một dự án Apidog

So sánh quan trọng là các lời nhắc của bạn trên hệ thống của bạn. Apidog biến điều đó thành một bài kiểm tra đã lưu thay vì một dự án cuối tuần:

  1. Tạo ba môi trường, mỗi môi trường cho một nhà cung cấp, mỗi môi trường chứa base_url, khóa API dưới dạng bí mật và model. Grok 4.7 và GPT-6 Sol đều sử dụng API Phản hồi (POST {{base_url}}/responses với trường input), vì vậy một định nghĩa yêu cầu có thể bao gồm cả hai. Opus 5.5 sử dụng API Tin nhắn của Anthropic (POST /v1/messages với messages, một max_tokens bắt buộc, và các tiêu đề x-api-key cộng với anthropic-version), vì vậy hãy tạo một yêu cầu riêng cho nó.
  2. Sử dụng cùng một văn bản lời nhắc trong mỗi yêu cầu, được lấy từ một biến chung để tránh sai lệch.
  3. Thêm các xác nhận cho trạng thái 200, một câu trả lời không trống, và sự hiện diện của usage.input_tokens và usage.output_tokens.
  4. Chạy chúng như một kịch bản kiểm thử duy nhất và so sánh thời gian phản hồi, số lượng token, và đầu ra cạnh nhau. Nhân số token với các hàng giá ở trên để có chi phí cho mỗi lần chạy trên tác vụ của bạn.

Chạy nó ở mức độ nỗ lực mà bạn sẽ triển khai, chứ không phải mức độ trên biểu đồ tiêu chuẩn. Tải xuống Apidog để xây dựng nó.

Câu hỏi thường gặp

Grok 4.7 có tốt hơn GPT-6 không? Không dựa trên các số liệu có sẵn. Chỉ số Artificial Analysis đặt GPT-6 Sol ở 48 và Grok 4.7 ở 46, và OpenAI gọi GPT-6 Astra là mô hình tốt nhất của họ. Grok 4.7 rẻ hơn về đầu ra và dẫn đầu trong các đánh giá pháp lý và kỹ thuật riêng của nó.

Grok 4.7 có tốt hơn Claude Opus 5.5 không? Opus 5.5 dẫn đầu trên Terminal-Bench 4.0 (66,4% so với 37,6%) và CursorBench 4.0 (57,8% so với 46,3%) và đứng đầu trên chỉ số Artificial Analysis. Grok 4.7 có chi phí đầu vào bằng một nửa và đầu ra ít hơn một phần ba.

Mô hình nào rẻ nhất? Theo mỗi token, Grok 4.7 về đầu ra, ngang bằng với Sol về đầu vào. Với việc lưu trữ lời nhắc vào bộ đệm nhiều, Sol có thể dẫn trước vì chi phí đọc từ bộ đệm của nó là 0,20 đô la mỗi triệu, so với 0,50 đô la của Grok.

Tôi có thể dùng thử cả ba miễn phí không? Mỗi mô hình đều có các tuyến đường miễn phí hạn chế. Hãy xem cách sử dụng Grok 4.7 miễn phí, GPT-6 Sol miễn phí, và Claude Opus 5.5 miễn phí.

Làm thế nào để gọi Grok 4.7 từ mã? POST https://api.x.ai/v1/responses với "model": "grok-4.7". Hướng dẫn API Grok 4.7 có các ví dụ về curl và SDK.

Quyết định bằng số liệu của riêng bạn

Chọn hai mô hình mà khối lượng công việc của bạn hướng tới, lưu cùng một lời nhắc cho cả hai trong Apidog và chạy nó ở mức độ nỗ lực sản xuất của bạn. So sánh chi phí cho mỗi tác vụ hoàn thành và độ trễ, sau đó định tuyến. Khi mô hình tiếp theo ra mắt, hãy thêm một môi trường và chạy lại.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API