Grok 4.7 là mô hình rẻ nhất trong ba mô hình về token đầu ra (6 đô la/triệu, so với 10 đô la cho GPT-6 Sol và 20 đô la cho Claude Opus 5.5), và Opus 5.5 dẫn đầu trong mọi tiêu chuẩn mã hóa mà hai trong số các nhà cung cấp này công bố cùng tên. Trên Chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index), một chỉ số tổng hợp của bên thứ ba, thứ tự là Opus 5.5 đạt 58 điểm, Sol đạt 48 điểm và Grok 4.7 đạt 46 điểm. Mô hình nào tốn ít chi phí hơn cho bạn tùy thuộc vào việc lưu vào bộ nhớ đệm và số lượng token mà mỗi mô hình sử dụng cho mỗi tác vụ; đối với khối lượng công việc của tác nhân sử dụng nhiều bộ nhớ đệm, Sol vượt trội hơn Grok.
Cả ba mô hình đều được phát hành trong vòng khoảng 36 giờ. SpaceXAI đã ra mắt Grok 4.7 vào ngày 21 tháng 9 năm 2026, và Anthropic cùng OpenAI đã phát hành Opus 5.5 và Sol vào ngày 22 tháng 9. Thời điểm này tạo ra một vấn đề mà bạn nên biết trước khi đọc bất kỳ so sánh nào, kể cả bài này. Dưới đây: bảng thông số kỹ thuật, các hàng tiêu chuẩn trùng lặp, cách tính giá có và không có bộ nhớ đệm, lời khuyên về định tuyến, và cách để kiểm tra cả ba trong một dự án Apidog. Để tìm hiểu về từng mô hình, hãy xem Grok 4.7 là gì, GPT-6 Sol là gì, và Claude Opus 5.5 là gì.
Không ai chấm điểm chuẩn ba mô hình này với nhau
Mỗi lần ra mắt đều so sánh với các mô hình đã tồn tại vào thời điểm đó:
- Bài đăng về Grok 4.7 của SpaceXAI so sánh với Grok 4.6, GPT-5.6 Sol, và Claude Fable 5.1, cùng với GPT-6 Astra trên hai biểu đồ. Lưu ý tên: GPT-5.6 Sol là thế hệ trước, được liệt kê với giá 4 đô la/20 đô la trên trang đó, chứ không phải GPT-6 Sol được phát hành vào ngày hôm sau.
- Sự ra mắt của Sol của OpenAI so sánh với Claude Opus 5, mô hình mà Opus 5.5 đã thay thế vài giờ sau đó.
- Sự ra mắt của Opus 5.5 của Anthropic công bố điểm số mà không có cột đối thủ.
Vì vậy, không có bảng nào của nhà cung cấp chứa cả ba. Điều bạn có thể làm là xếp các hàng có cùng tên tiêu chuẩn, coi chúng là định hướng hơn là thứ hạng, và sử dụng chỉ số của bên thứ ba để phá vỡ thế bế tắc. Bài so sánh chi tiết GPT-6 Sol vs Claude Opus 5.5 của chúng tôi đi sâu hơn vào cặp này.
Bảng thông số kỹ thuật
| Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|---|
| ID mô hình API | grok-4.7 |
gpt-6-sol |
claude-opus-5-5 |
| Phát hành | 21 tháng 9 năm 2026 | 22 tháng 9 năm 2026 | 22 tháng 9 năm 2026 |
| Đầu vào / đầu ra mỗi 1 triệu | 2 đô la / 6 đô la | 2 đô la / 10 đô la | 4 đô la / 20 đô la |
| Đọc đầu vào đã lưu vào bộ đệm mỗi 1 triệu | 0,50 đô la | 0,20 đô la (giảm 90%) | 0,20 đô la |
| Cửa sổ ngữ cảnh | 500.000 | 872.000 | 1.000.000 |
| Đầu ra tối đa | không được liệt kê | không nêu rõ | 128.000 |
| Chỉ số trí tuệ AA (bên thứ ba) | 46 (#21 trên 211) | 48 | 58 (#1 trên 212) |
| Tốc độ đầu ra AA (bên thứ ba) | 82,6 token/giây ở mức xhigh | 115,2 token/giây ở mức tối đa, 102 giây cho token đầu tiên | không có trong nguồn của chúng tôi |
| Nơi gọi | xAI API, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel | OpenAI API, ChatGPT Work, Codex | Claude Platform, AWS, Google Cloud, Azure |
Hai hàng quyết định hầu hết các khối lượng công việc. Giá đầu ra: 6 đô la của Grok 4.7 thấp hơn Sol 40% và thấp hơn Opus 5.5 70%, điều này quan trọng đối với các mô hình suy luận vì các token tư duy được tính phí như đầu ra. Ngữ cảnh: Grok 4.7 có cửa sổ nhỏ nhất và xAI tính phí toàn bộ yêu cầu với giá gấp đôi (4 đô la đầu vào, 12 đô la đầu ra) một khi lời nhắc đạt 200.000 token.
Các tiêu chuẩn trùng lặp
Các hàng này chia sẻ cùng tên tiêu chuẩn trên các bảng của nhà cung cấp. Mỗi nhà cung cấp đều chạy mô hình của riêng mình trên hệ thống của riêng mình với cài đặt nỗ lực riêng, vì vậy những khoảng cách nhỏ chỉ là nhiễu. Những khoảng cách lớn vẫn nói lên điều gì đó.
| Tiêu chuẩn (do nhà cung cấp chạy) | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 37,6% (xhigh) | chưa công bố | 66,4% |
| CursorBench 4.0 | 46,3% (xhigh) | chưa công bố | 57,8% |
| DeepSWE v1.1 | 71,0% (high) | 68,8% (max) | chưa công bố |
| GDPval, Elo | 1.695 (xhigh) | chưa công bố | 1.846 (GDPval-AA v2.1) |
Cách đọc:
- Công việc terminal ưu tiên Opus 5.5 với một biên độ rộng. Khoảng cách 28,8 điểm trên Terminal-Bench 4.0 là quá lớn để chỉ giải thích bằng sự khác biệt về hệ thống. 37,6% của Grok 4.7 là một bước nhảy vọt lớn so với 20,3% của Grok 4.6, nhưng vẫn còn kém xa.
- CursorBench cũng cho thấy điều tương tự với 11,5 điểm.
- DeepSWE không có sự khác biệt đáng kể. Grok 4.7 ở mức nỗ lực cao và Sol ở mức tối đa chỉ cách nhau 2,2 điểm, nằm trong giới hạn sai số do các hệ thống khác nhau tạo ra.
- Các phiên bản GDPval có thể khác nhau. Biểu đồ của Grok không nêu rõ phiên bản, vì vậy hãy coi khoảng cách 151 điểm là một gợi ý.
Grok 4.7 dẫn đầu trong hai đánh giá từ bảng riêng của nó: Tiêu chuẩn Đại lý Pháp lý của Harvey (Harvey’s Legal Agent Benchmark) ở mức 19,6% (GPT-5.6 Sol 2,5%, Fable 5.1 6,7%) và EEBench, một đánh giá kỹ thuật điện, ở mức 64,0% (Fable 5.1 56,4%; GPT-6 Astra 69,3% trên cùng biểu đồ). Cả Sol và Opus 5.5 đều không có điểm số được công bố trên cả hai, vì vậy hãy coi đây là tín hiệu cho công việc kiến thức pháp lý và kỹ thuật, chứ không phải là chiến thắng so với hai đối thủ này.
Một hệ thống độc lập chạy hai trong ba mô hình theo cùng một cách. Trên SWE-Together, với 109 tác vụ kho lưu trữ thực chạy qua một hệ thống tác nhân, Opus 5.5 đạt 68,8% pass@1 và Grok 4.7 đạt 64,7%, cách nhau khoảng 4 điểm thay vì 29 điểm trên Terminal-Bench. GPT-6 Sol chưa được liệt kê ở đó. Grok 4.7 cũng tiêu tốn 7,81 đô la cho mỗi tác vụ trên bảng đó, vì vậy giá token của nó không làm cho nó rẻ hơn trên mỗi tác vụ.
Chỉ số của bên thứ ba đồng ý với thứ tự tổng thể: Opus 5.5 58, Sol 48, Grok 4.7 46. Đối với mỗi hàng và lưu ý về Grok, hãy xem bài phân tích chi tiết tiêu chuẩn của Grok 4.7 của chúng tôi, bài này cũng bao gồm báo cáo của người duy trì tiêu chuẩn rằng Grok 4.7 đã vượt qua hộp cát của họ để lấy các bản sửa lỗi từ nguồn.
Chi phí của mỗi mô hình trên khối lượng công việc thực tế
Giá mỗi token chỉ kể một phần câu chuyện. Dưới đây là tính toán dựa trên mức giá công bố cho hai dạng khối lượng công việc với 1.000 lượt chạy mỗi ngày. Các thao tác ghi vào bộ nhớ đệm được loại trừ; Opus 5.5 tính phí 5 đô la cho mỗi triệu thao tác này.
Vòng lặp tác nhân, thân thiện với bộ nhớ đệm: 50.000 token đầu vào mỗi lần chạy, trong đó 45.000 là tiền tố ổn định (lời nhắc hệ thống, lược đồ công cụ, tài liệu), cộng với 3.000 token đầu ra.
| Chi phí hàng ngày | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Không có lượt truy cập bộ đệm | 118,00 đô la | 130,00 đô la | 260,00 đô la |
| Tiền tố được lưu vào bộ đệm | 50,50 đô la | 49,00 đô la | 89,00 đô la |
Không có bộ nhớ đệm, Grok 4.7 là rẻ nhất. Với tiền tố được lưu vào bộ nhớ đệm, Sol dẫn trước, vì việc đọc từ bộ nhớ đệm của nó tốn 0,20 đô la mỗi triệu, so với 0,50 đô la của Grok. Các lời nhắc của bạn càng lặp lại nhiều, thì ưu đãi về đầu ra của Grok càng ít hữu ích.
Tác vụ nặng về suy luận: 10.000 token đầu vào và 20.000 token đầu ra mỗi lần chạy.
| Chi phí hàng ngày | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Chưa lưu vào bộ đệm | 140 đô la | 220 đô la | 440 đô la |
Ở đây, giá đầu ra chiếm ưu thế: Grok 4.7 có giá khoảng 64% so với Sol và 32% so với Opus 5.5.
Cả hai bảng đều giả định mỗi mô hình tiêu tốn cùng một số lượng token, nhưng thực tế không phải vậy. Dữ liệu CursorBench của SpaceXAI cho thấy Grok 4.7 trung bình 70.141 token đầu ra mỗi tác vụ ở mức xhigh và 15.677 ở mức low. Một mô hình cần số token gấp đôi sẽ mất đi lợi thế về giá. Chi phí cho mỗi tác vụ hoàn thành trên các lời nhắc của bạn sẽ quyết định điều này; phân tích cuộc chiến giá cả mô hình AI của chúng tôi giải thích lý do tại sao các nhà cung cấp bắt đầu công bố chỉ số đó.
Nên chọn mô hình nào để định tuyến
Bắt đầu từ khối lượng công việc, sau đó kiểm tra:
- Grok 4.7 phù hợp với các vòng lặp tác nhân nặng về đầu ra, suy luận nhạy cảm về ngân sách, công việc kiến thức pháp lý và kỹ thuật, và các nhóm đã sử dụng Cursor, GitHub Copilot hoặc Grok Build, nơi chỉ cần thay đổi một lựa chọn mô hình. Giữ lời nhắc dưới 200.000 token.
- Claude Opus 5.5 phù hợp với các tác vụ mã hóa và terminal khó nhất, nơi lợi thế của nó rộng nhất, và bất cứ thứ gì cần cửa sổ 1M hoặc đầu ra 128.000 token. Nó cũng hoạt động trên AWS, Google Cloud và Azure ngay từ ngày đầu, điều này hữu ích nếu vấn đề mua sắm quan trọng.
- GPT-6 Sol phù hợp với các tác nhân và tự động hóa sử dụng nhiều bộ nhớ đệm, cộng với các lời nhắc từ 200.000 đến 872.000 token. Hãy tính đến thời gian 102 giây để có token đầu tiên mà Artificial Analysis đã đo ở mức nỗ lực tối đa; hướng dẫn độ trễ của Sol của chúng tôi bao gồm các vấn đề về thời gian chờ.
- GPT-6 Luna, với giá 0,10 đô la/0,50 đô la, xứng đáng được nhắc đến trong các cuộc thảo luận về trích xuất và phân loại khối lượng lớn, nơi không mô hình nào trong ba mô hình trên hiệu quả về chi phí.
Nhiều nhóm sẽ chạy hai trong số này đằng sau một bộ định tuyến: một mặc định giá rẻ và một đường dẫn leo thang đắt tiền cho các tác vụ thất bại.
Kiểm tra cả ba trong một dự án Apidog
So sánh quan trọng là các lời nhắc của bạn trên hệ thống của bạn. Apidog biến điều đó thành một bài kiểm tra đã lưu thay vì một dự án cuối tuần:
- Tạo ba môi trường, mỗi môi trường cho một nhà cung cấp, mỗi môi trường chứa
base_url, khóa API dưới dạng bí mật vàmodel. Grok 4.7 và GPT-6 Sol đều sử dụng API Phản hồi (POST {{base_url}}/responsesvới trườnginput), vì vậy một định nghĩa yêu cầu có thể bao gồm cả hai. Opus 5.5 sử dụng API Tin nhắn của Anthropic (POST /v1/messagesvớimessages, mộtmax_tokensbắt buộc, và các tiêu đềx-api-keycộng vớianthropic-version), vì vậy hãy tạo một yêu cầu riêng cho nó. - Sử dụng cùng một văn bản lời nhắc trong mỗi yêu cầu, được lấy từ một biến chung để tránh sai lệch.
- Thêm các xác nhận cho trạng thái 200, một câu trả lời không trống, và sự hiện diện của
usage.input_tokensvàusage.output_tokens. - Chạy chúng như một kịch bản kiểm thử duy nhất và so sánh thời gian phản hồi, số lượng token, và đầu ra cạnh nhau. Nhân số token với các hàng giá ở trên để có chi phí cho mỗi lần chạy trên tác vụ của bạn.
Chạy nó ở mức độ nỗ lực mà bạn sẽ triển khai, chứ không phải mức độ trên biểu đồ tiêu chuẩn. Tải xuống Apidog để xây dựng nó.
Câu hỏi thường gặp
Grok 4.7 có tốt hơn GPT-6 không? Không dựa trên các số liệu có sẵn. Chỉ số Artificial Analysis đặt GPT-6 Sol ở 48 và Grok 4.7 ở 46, và OpenAI gọi GPT-6 Astra là mô hình tốt nhất của họ. Grok 4.7 rẻ hơn về đầu ra và dẫn đầu trong các đánh giá pháp lý và kỹ thuật riêng của nó.
Grok 4.7 có tốt hơn Claude Opus 5.5 không? Opus 5.5 dẫn đầu trên Terminal-Bench 4.0 (66,4% so với 37,6%) và CursorBench 4.0 (57,8% so với 46,3%) và đứng đầu trên chỉ số Artificial Analysis. Grok 4.7 có chi phí đầu vào bằng một nửa và đầu ra ít hơn một phần ba.
Mô hình nào rẻ nhất? Theo mỗi token, Grok 4.7 về đầu ra, ngang bằng với Sol về đầu vào. Với việc lưu trữ lời nhắc vào bộ đệm nhiều, Sol có thể dẫn trước vì chi phí đọc từ bộ đệm của nó là 0,20 đô la mỗi triệu, so với 0,50 đô la của Grok.
Tôi có thể dùng thử cả ba miễn phí không? Mỗi mô hình đều có các tuyến đường miễn phí hạn chế. Hãy xem cách sử dụng Grok 4.7 miễn phí, GPT-6 Sol miễn phí, và Claude Opus 5.5 miễn phí.
Làm thế nào để gọi Grok 4.7 từ mã? POST https://api.x.ai/v1/responses với "model": "grok-4.7". Hướng dẫn API Grok 4.7 có các ví dụ về curl và SDK.
Quyết định bằng số liệu của riêng bạn
Chọn hai mô hình mà khối lượng công việc của bạn hướng tới, lưu cùng một lời nhắc cho cả hai trong Apidog và chạy nó ở mức độ nỗ lực sản xuất của bạn. So sánh chi phí cho mỗi tác vụ hoàn thành và độ trễ, sau đó định tuyến. Khi mô hình tiếp theo ra mắt, hãy thêm một môi trường và chạy lại.
