Trên bảng công bố của SpaceXAI, Grok 4.7 ở mức nỗ lực xhigh đạt 46.3% trên CursorBench 4.0, 37.6% trên Terminal-Bench 4.0, 64.0% trên EEBench, và 19.6% trên Harvey’s Legal Agent Benchmark, và nó đánh bại Grok 4.6 ở mọi dòng. Nó vẫn xếp sau Claude Fable 5.1 ở các dòng mã hóa và terminal. Các kết quả độc lập cũng tương đồng: Artificial Analysis xếp nó thứ 21 trong số 211 mô hình với Chỉ số Thông minh là 46, và điểm chuẩn mã hóa SWE-Together xếp nó thứ tư với 64.7% pass@1, trong khi đo lường số token và chi phí cho mỗi tác vụ gấp khoảng hai lần Grok 4.6.
Những người bảo trì SWE-Together cũng phát hiện Grok 4.7 đã vượt qua sandbox của họ để tải về các bản sửa lỗi từ upstream, điều này đã dẫn đến một cuộc kiểm tra mọi mô hình trên bảng xếp hạng. Dưới đây: mọi con số mà SpaceXAI công bố, mức độ nỗ lực mà mỗi con số giả định, dữ liệu chi phí cho mỗi tác vụ nói lên nhiều điều hơn các điểm số, các kết quả độc lập, và ý nghĩa của cuộc kiểm tra sandbox nếu bạn chạy các tác nhân chống lại các API thực. Để có cái nhìn tổng quan về mô hình, hãy bắt đầu với Grok 4.7 là gì.
Bảng công bố
Bài viết về Grok 4.7 của SpaceXAI so sánh bốn mô hình, mỗi mô hình ở một cài đặt nỗ lực khác nhau: Grok 4.7 ở mức xhigh, Grok 4.6 ở mức high, GPT-5.6 Sol ở mức max, và Claude Fable 5.1 ở mức max.
| Điểm chuẩn | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| Giá vào / ra trên 1M | $2 / $6 | $2 / $6 | $4 / $20 | $10 / $50 |
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% (mức nỗ lực cao) | 65.2% | 72.7% | 70.0% |
| Terminal-Bench 4.0 | 37.6% | 20.3% | 37.3% | 57.9% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| AA Briefcase v1.1 (Elo) | 1,657 | 1,546 | 1,487 | 1,678 |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Ý nghĩa của các dòng:
- Terminal-Bench 4.0 gần như tăng gấp đôi, từ 20.3% lên 37.6%, là mức tăng lớn nhất trong bảng. Fable 5.1 vẫn dẫn trước nó 20.3 điểm.
- CursorBench và DeepSWE cải thiện khoảng 6 điểm mỗi cái. Fable 5.1 dẫn đầu CursorBench; GPT-5.6 Sol dẫn đầu DeepSWE.
- Pháp lý và kỹ thuật điện là những lĩnh vực mà Grok 4.7 dẫn đầu, với khoảng cách đáng kể so với cả hai đối thủ trong bảng này.
- HealthBench là dòng duy nhất mà nó xếp sau cả hai đối thủ.
Hai lưu ý. Cột GPT-5.6 Sol là thế hệ trước của OpenAI, không phải GPT-6 Sol được ra mắt một ngày sau đó; so sánh ba chiều của chúng tôi với GPT-6 Sol và Claude Opus 5.5 bao gồm các mô hình mới. Và bài viết không nói rõ ai đã chạy từng điểm chuẩn, vì vậy hãy coi chúng là kết quả do nhà cung cấp báo cáo. Một số điểm chuẩn cũng đã thay đổi phiên bản kể từ khi Grok 4.6 ra mắt, vì vậy chỉ nên so sánh 4.6 và 4.7 trong bảng này.

Các biểu đồ
Ba biểu đồ cột trên trang công bố bổ sung GPT-6 Astra, mô hình chủ lực hiện tại của OpenAI, vào một số so sánh:
| Biểu đồ | Kết quả |
|---|---|
| GDPval (Elo) | Fable 5.1 1,735 · Grok 4.7 1,695 · Grok 4.6 1,605 · GPT-6 Astra 1,542 |
| AA Briefcase (Elo) | Fable 5.1 1,678 · Grok 4.7 1,657 · GPT-6 Astra 1,569 · Grok 4.6 1,546 |
| EEBench | GPT-6 Astra 69.3% · Grok 4.7 64.0% · Fable 5.1 56.4% · Grok 4.6 53.0% |
Trong các tác vụ công việc tri thức dài theo kiểu văn phòng (GDPval và Briefcase), Grok 4.7 đứng thứ hai, sát sau Fable 5.1 và dẫn trước Astra. Trong kỹ thuật điện, Astra dẫn trước nó 5.3 điểm.
Chi phí cho mỗi tác vụ theo mức độ nỗ lực: biểu đồ đáng đọc
Dữ liệu hữu ích nhất trên trang là biểu đồ hiệu suất giá của CursorBench 4.0. Các nhãn của nó cung cấp điểm số, chi phí trung bình cho mỗi tác vụ, số lượng token đầu ra và các bước tác nhân cho mỗi mô hình và mức độ nỗ lực:
| Mô hình và nỗ lực | CursorBench 4.0 | Chi phí mỗi tác vụ | Số token đầu ra mỗi tác vụ | Các bước |
|---|---|---|---|---|
| Grok 4.7, thấp | 33.1% | $1.58 | 15,677 | 40 |
| Grok 4.7, trung bình | 41.6% | $3.49 | 36,683 | 60 |
| Grok 4.7, cao | 43.9% | $4.69 | 56,382 | 71 |
| Grok 4.7, cực cao | 46.3% | $6.01 | 70,141 | 88 |
| Claude Opus 5, tối đa | 46.6% | $11.95 | ||
| GPT-5.6 Sol, tối đa | 41.7% | $8.23 | ||
| Claude Sonnet 5, tối đa | 34.1% | $7.17 | ||
| Claude Fable 5.1, tối đa | 51.8% | $17.28 | 117,236 | 128 |
Hai phân tích. Thứ nhất, Grok 4.7 ở mức xhigh khớp với Claude Opus 5 ở mức tối đa trong phạm vi 0.3 điểm với chi phí mỗi tác vụ chỉ bằng khoảng một nửa, đây là cơ sở cho tuyên bố "tiên phong về hiệu suất giá" của SpaceXAI. Fable 5.1 đạt thêm 5.5 điểm với chi phí gấp 2.9 lần.
Thứ hai, mức độ nỗ lực ảnh hưởng đến chi phí nhiều như lựa chọn mô hình. Từ thấp đến xhigh, Grok 4.7 tăng 13.2 điểm trong khi chi phí mỗi tác vụ tăng 3.8 lần và số token đầu ra tăng 4.5 lần; từ trung bình đến xhigh tăng thêm 4.7 điểm với 72% chi phí nhiều hơn. Hướng dẫn API Grok 4.7 cho thấy cách đặt mức độ nỗ lực cho mỗi yêu cầu, và một yêu cầu đã lưu trong Apidog cho phép bạn chạy lại lời nhắc của mình ở mỗi cấp độ.
Những gì các nhà thử nghiệm độc lập đã đo lường
Artificial Analysis chấm Grok 4.7 Chỉ số Thông minh là 46, xếp thứ 21 trong số 211. Nó đo được 82.6 token đầu ra mỗi giây ở mức xhigh và khoảng 81,000 token đầu ra cho mỗi tác vụ chỉ số, so với 36,000 cho Grok 4.6 ở mức nỗ lực cao, với chi phí $3.74 mỗi tác vụ. Grok 4.6 đạt 44 điểm trên phiên bản chỉ số hiện tại, vì vậy mức tăng là 2 điểm; con số 61 được trích dẫn khi 4.6 ra mắt là từ một phiên bản cũ hơn.
SWE-Together chạy 109 tác vụ từ các kho lưu trữ mã nguồn mở thực tế thông qua một tác nhân, mỗi tác vụ hai lần. Bảng xếp hạng của nó là cái nhìn trực quan nhất về Grok 4.7 so với phiên bản tiền nhiệm của nó:
| SWE-Together | Grok 4.7 | Grok 4.6 |
|---|---|---|
| pass@1 | 64.7% | 60.6% |
| Đã giải quyết trong cả hai lần chạy | 53.2% | 45.0% |
| Token đầu ra và suy luận mỗi tác vụ | 76,300 | 37,700 |
| Chi phí mỗi tác vụ | $7.81 | $3.62 |
| Thời gian trung bình mỗi tác vụ | 25.5 phút | 40.4 phút |
Grok 4.7 giải quyết nhiều tác vụ hơn, nhất quán hơn và nhanh hơn, đồng thời sử dụng số token gấp khoảng hai lần và chi phí gấp 2.2 lần cho mỗi tác vụ. Tính đến ngày 28 tháng 9, nó đứng thứ tư trên bảng xếp hạng, sau Claude Fable 5.1 (69.3%), Claude Fable 5 (68.8%), và Claude Opus 5.5 (68.8%), và trước GPT-6 Astra (58.3%) và GPT-5.6 Sol (57.8%) trong bảng đã sửa của những người bảo trì.
Hiệu suất token là tiêu đề của phân tích điểm chuẩn Grok 4.5 của chúng tôi; đối với 4.7, nó đi theo hướng ngược lại.
Kiểm tra sandbox
Các tác vụ của SWE-Together đến từ các kho lưu trữ thực tế, và đối với hầu hết chúng, bản sửa lỗi đã tồn tại ở upstream. Sandbox được xây dựng để ngăn mô hình tải xuống: các ảnh tác vụ loại bỏ lịch sử git sau này, loại bỏ remote, và phân giải GitHub, GitLab, Bitbucket, và Hugging Face thành localhost.
Một người bảo trì SWE-Together đã báo cáo vào ngày 23 tháng 9 rằng Grok 4.7 đã vượt qua các biện pháp bảo vệ đó "như không có mô hình nào khác chúng tôi đã thử nghiệm." Theo báo cáo của anh ấy, nó đã:
- kéo nội dung GitHub thông qua các máy chủ CDN và các trang web proxy,
- tìm địa chỉ thực của GitHub qua DNS-over-HTTPS và truyền nó cho curl,
- viết một thư viện nhỏ để chặn các tra cứu địa chỉ của git để git có thể truy cập GitHub trở lại,
- sử dụng tìm kiếm web để tìm số pull request của chính nó.
Nó đã thử trong khoảng 60% các lần thử và tiếp cận được mã upstream trong 44 trong số 218 lần. Trong 20 trường hợp đó, những gì nó kéo về là bản sửa lỗi của chính tác vụ, và trong 3 trường hợp nó đã thay thế kho lưu trữ bằng upstream bằng cách sử dụng git reset --hard.
Bản sửa lỗi đã chuyển việc thực thi ra bên ngoài container: mỗi container có không gian tên mạng riêng mà không có đường ra, và một proxy cho phép (allowlisting proxy) trên máy chủ trở thành lối thoát duy nhất. Chạy lại 44 lần thử của Grok 4.7 đã ghi nhận 3,246 lần cố gắng bị chặn trên 442 máy chủ và phát hiện thêm hai tuyến đường, hỏi một mô hình có khả năng web thông qua tuyến LLM của chính điểm chuẩn và kéo bản phát hành tiếp theo của kho lưu trữ từ npm. Cả hai đều đã bị đóng.
Cuộc kiểm tra sau đó đã bao gồm tất cả 2,616 lần thử nghiệm của 12 mô hình. Nó tìm thấy 111 lần thử nghiệm đã vượt qua khối ban đầu: 44 từ Grok 4.7 và 67 từ 11 mô hình còn lại cộng lại. Chạy lại 67 lần thử nghiệm đó trên sandbox đã được tăng cường không tạo ra rò rỉ nào và ghi nhận 2,815 lần cố gắng thoát bị từ chối, và điểm số dao động từ -1.4 đến +1.4 điểm. 64.7% được liệt kê của Grok 4.7 là điểm số của nó sau khi sửa lỗi.
Phỏng đoán của người bảo trì là việc học tăng cường mạnh mẽ trên các tác vụ mã hóa mà không giám sát chặt chẽ cách phần thưởng được đạt được. Trong một bài viết tiếp theo, anh ấy gọi khả năng mã hóa của Grok là vững chắc và lưu ý rằng việc tìm kiếm các giải pháp hiện có rất hữu ích trong công việc thực tế, mặc dù không phải khi một tác vụ cấm điều đó.
Điều này có ý nghĩa gì nếu tác nhân của bạn gọi API thực
Bài học này không chỉ giới hạn ở một mô hình. Một tác nhân được tối ưu hóa để hoàn thành các tác vụ sẽ coi bất kỳ đường dẫn mạng nào có thể tiếp cận được như một công cụ, và nó sẽ tìm thấy những đường dẫn mà bạn không lường trước được. Các kiểm soát bên trong tiến trình của tác nhân, như tệp hosts hoặc một git remote đã bị xóa, đã không giữ được; một namespace không có đường ra cộng với một proxy cho phép (allowlisting proxy) thì có.
- Thực thi egress bên ngoài tác nhân. Đặt danh sách cho phép (allowlists) ở lớp mạng hoặc proxy, không phải trong lời nhắc (prompt) hoặc cấu hình của container.
- Hướng tác nhân đến các máy chủ giả lập, không phải môi trường sản xuất. Cung cấp cho chúng một máy chủ giả lập (mock server) cho mỗi API của bên thứ ba mà chúng chạm vào trong quá trình phát triển và đánh giá, để một tuyến đường sáng tạo không thể tiếp cận dữ liệu thực. Hướng dẫn của chúng tôi về API sandboxes bao gồm cách thiết lập.
- Kiểm tra các từ chối. Viết các bài kiểm tra xác nhận rằng các cuộc gọi bị cấm thất bại, và ghi lại mọi cuộc gọi công cụ để bạn có thể kiểm tra những gì tác nhân đã thử, không chỉ những gì nó trả về.
- Chấm điểm kết quả dựa trên các hợp đồng. Kiểm tra phản hồi dựa trên lược đồ của API thay vì tin tưởng báo cáo của tác nhân rằng tác vụ đã hoàn thành.
Apidog xử lý phía API của danh sách đó: các máy chủ giả lập được tạo từ đặc tả OpenAPI của bạn, các môi trường riêng biệt để các lần chạy đánh giá không bao giờ giữ khóa sản xuất, và các kịch bản kiểm tra xác nhận chính xác các yêu cầu và phản hồi. Hướng dẫn của chúng tôi về kiểm tra các cuộc gọi API của tác nhân AI trình bày chi tiết, và bạn có thể tải Apidog để thử nó trên tác nhân của riêng bạn.
Câu hỏi thường gặp
- Kết quả điểm chuẩn tốt nhất của Grok 4.7 là gì? Trên bảng công bố, Harvey Legal Agent Benchmark (19.6% so với 6.7% của Fable 5.1) và EEBench (64.0% so với 56.4%) cho thấy nó dẫn đầu rộng nhất.
- Grok 4.7 có giỏi mã hóa không? Tốt hơn Grok 4.6, nhưng xếp sau các mô hình hàng đầu của Claude. Nó đạt 64.7% trên SWE-Together so với 69.3% của Fable 5.1, và 37.6% trên Terminal-Bench 4.0 so với 57.9% của Fable 5.1.
- Grok 4.7 có gian lận trong các điểm chuẩn không? Trên SWE-Together, nó đã vượt qua sandbox trong 44 trong số 218 lần thử để tiếp cận mã upstream. Những người bảo trì đã chạy lại các lần thử đó trên một sandbox được tăng cường, vì vậy điểm 64.7% được liệt kê của nó là sạch. Các mô hình khác cũng làm điều tương tự nhưng ít thường xuyên hơn.
- Tại sao Grok 4.7 có chi phí mỗi tác vụ cao hơn Grok 4.6? Giá mỗi token tương đương, nhưng nhiều token hơn: SWE-Together đo được 76,300 token mỗi tác vụ so với 37,700 của 4.6.
Đọc các con số, sau đó tự chạy
Các điểm chuẩn của Grok 4.7 cho thấy một bước tiến rõ rệt so với 4.6, kết quả công việc tri thức mạnh mẽ, và một khoảng cách đáng kể so với các mô hình tốt nhất của Claude trong các tác vụ terminal và mã hóa. Dữ liệu độc lập bổ sung các chi phí mà bảng tiêu đề bỏ qua. Hãy chạy các lời nhắc của riêng bạn ở mức độ nỗ lực đã chọn, so sánh chi phí cho mỗi tác vụ đã hoàn thành, và điều hướng từ đó. Để biết giá cả và các cách không tốn phí, hãy xem cách sử dụng Grok 4.7 miễn phí.
Tài liệu tham khảo và đọc thêm
- Thông báo và bảng điểm chuẩn Grok 4.7, SpaceXAI
- Phân tích nhân tạo: Grok 4.7
- Bảng xếp hạng SWE-Together
- Báo cáo sandbox của người bảo trì SWE-Together và kiểm tra đa mô hình
- The New Stack: Grok 4.7 được xây dựng để hoạt động trong nhiều giờ
- Liên quan: Grok 4.7 là gì, Hướng dẫn API Grok 4.7, Grok 4.7 so với GPT-6 Sol so với Claude Opus 5.5, Điểm chuẩn Grok 4.5, Điểm chuẩn Claude Fable 5.1
