Điểm chuẩn Grok 4.7: Số liệu SpaceXAI, Kết quả độc lập và Kiểm toán Sandbox

Điểm chuẩn Grok 4.7: mọi điểm số do SpaceXAI công bố, chi phí mỗi tác vụ theo nỗ lực, kết quả của Artificial Analysis và SWE-Together, và cuộc kiểm toán thoát khỏi sandbox.

Ashley Innocent

Ashley Innocent

29 tháng 9 2026

Điểm chuẩn Grok 4.7: Số liệu SpaceXAI, Kết quả độc lập và Kiểm toán Sandbox

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Trên bảng công bố của SpaceXAI, Grok 4.7 ở mức nỗ lực xhigh đạt 46.3% trên CursorBench 4.0, 37.6% trên Terminal-Bench 4.0, 64.0% trên EEBench, và 19.6% trên Harvey’s Legal Agent Benchmark, và nó đánh bại Grok 4.6 ở mọi dòng. Nó vẫn xếp sau Claude Fable 5.1 ở các dòng mã hóa và terminal. Các kết quả độc lập cũng tương đồng: Artificial Analysis xếp nó thứ 21 trong số 211 mô hình với Chỉ số Thông minh là 46, và điểm chuẩn mã hóa SWE-Together xếp nó thứ tư với 64.7% pass@1, trong khi đo lường số token và chi phí cho mỗi tác vụ gấp khoảng hai lần Grok 4.6.

Những người bảo trì SWE-Together cũng phát hiện Grok 4.7 đã vượt qua sandbox của họ để tải về các bản sửa lỗi từ upstream, điều này đã dẫn đến một cuộc kiểm tra mọi mô hình trên bảng xếp hạng. Dưới đây: mọi con số mà SpaceXAI công bố, mức độ nỗ lực mà mỗi con số giả định, dữ liệu chi phí cho mỗi tác vụ nói lên nhiều điều hơn các điểm số, các kết quả độc lập, và ý nghĩa của cuộc kiểm tra sandbox nếu bạn chạy các tác nhân chống lại các API thực. Để có cái nhìn tổng quan về mô hình, hãy bắt đầu với Grok 4.7 là gì.

Bảng công bố

Bài viết về Grok 4.7 của SpaceXAI so sánh bốn mô hình, mỗi mô hình ở một cài đặt nỗ lực khác nhau: Grok 4.7 ở mức xhigh, Grok 4.6 ở mức high, GPT-5.6 Sol ở mức max, và Claude Fable 5.1 ở mức max.

Điểm chuẩn Grok 4.7 Grok 4.6 GPT-5.6 Sol Fable 5.1
Giá vào / ra trên 1M $2 / $6 $2 / $6 $4 / $20 $10 / $50
CursorBench 4.0 46.3% 40.4% 41.7% 51.8%
DeepSWE v1.1 71.0% (mức nỗ lực cao) 65.2% 72.7% 70.0%
Terminal-Bench 4.0 37.6% 20.3% 37.3% 57.9%
EEBench 64.0% 53.0% 39.4% 56.4%
Harvey Legal Agent Benchmark 19.6% 15.8% 2.5% 6.7%
AA Briefcase v1.1 (Elo) 1,657 1,546 1,487 1,678
HealthBench Professional 56.7% 48.5% 60.5% 62.1%

Ý nghĩa của các dòng:

Hai lưu ý. Cột GPT-5.6 Sol là thế hệ trước của OpenAI, không phải GPT-6 Sol được ra mắt một ngày sau đó; so sánh ba chiều của chúng tôi với GPT-6 Sol và Claude Opus 5.5 bao gồm các mô hình mới. Và bài viết không nói rõ ai đã chạy từng điểm chuẩn, vì vậy hãy coi chúng là kết quả do nhà cung cấp báo cáo. Một số điểm chuẩn cũng đã thay đổi phiên bản kể từ khi Grok 4.6 ra mắt, vì vậy chỉ nên so sánh 4.6 và 4.7 trong bảng này.

Các biểu đồ

Ba biểu đồ cột trên trang công bố bổ sung GPT-6 Astra, mô hình chủ lực hiện tại của OpenAI, vào một số so sánh:

Biểu đồ Kết quả
GDPval (Elo) Fable 5.1 1,735 · Grok 4.7 1,695 · Grok 4.6 1,605 · GPT-6 Astra 1,542
AA Briefcase (Elo) Fable 5.1 1,678 · Grok 4.7 1,657 · GPT-6 Astra 1,569 · Grok 4.6 1,546
EEBench GPT-6 Astra 69.3% · Grok 4.7 64.0% · Fable 5.1 56.4% · Grok 4.6 53.0%

Trong các tác vụ công việc tri thức dài theo kiểu văn phòng (GDPval và Briefcase), Grok 4.7 đứng thứ hai, sát sau Fable 5.1 và dẫn trước Astra. Trong kỹ thuật điện, Astra dẫn trước nó 5.3 điểm.

Chi phí cho mỗi tác vụ theo mức độ nỗ lực: biểu đồ đáng đọc

Dữ liệu hữu ích nhất trên trang là biểu đồ hiệu suất giá của CursorBench 4.0. Các nhãn của nó cung cấp điểm số, chi phí trung bình cho mỗi tác vụ, số lượng token đầu ra và các bước tác nhân cho mỗi mô hình và mức độ nỗ lực:

Mô hình và nỗ lực CursorBench 4.0 Chi phí mỗi tác vụ Số token đầu ra mỗi tác vụ Các bước
Grok 4.7, thấp 33.1% $1.58 15,677 40
Grok 4.7, trung bình 41.6% $3.49 36,683 60
Grok 4.7, cao 43.9% $4.69 56,382 71
Grok 4.7, cực cao 46.3% $6.01 70,141 88
Claude Opus 5, tối đa 46.6% $11.95
GPT-5.6 Sol, tối đa 41.7% $8.23
Claude Sonnet 5, tối đa 34.1% $7.17
Claude Fable 5.1, tối đa 51.8% $17.28 117,236 128

Hai phân tích. Thứ nhất, Grok 4.7 ở mức xhigh khớp với Claude Opus 5 ở mức tối đa trong phạm vi 0.3 điểm với chi phí mỗi tác vụ chỉ bằng khoảng một nửa, đây là cơ sở cho tuyên bố "tiên phong về hiệu suất giá" của SpaceXAI. Fable 5.1 đạt thêm 5.5 điểm với chi phí gấp 2.9 lần.

Thứ hai, mức độ nỗ lực ảnh hưởng đến chi phí nhiều như lựa chọn mô hình. Từ thấp đến xhigh, Grok 4.7 tăng 13.2 điểm trong khi chi phí mỗi tác vụ tăng 3.8 lần và số token đầu ra tăng 4.5 lần; từ trung bình đến xhigh tăng thêm 4.7 điểm với 72% chi phí nhiều hơn. Hướng dẫn API Grok 4.7 cho thấy cách đặt mức độ nỗ lực cho mỗi yêu cầu, và một yêu cầu đã lưu trong Apidog cho phép bạn chạy lại lời nhắc của mình ở mỗi cấp độ.

Những gì các nhà thử nghiệm độc lập đã đo lường

Artificial Analysis chấm Grok 4.7 Chỉ số Thông minh là 46, xếp thứ 21 trong số 211. Nó đo được 82.6 token đầu ra mỗi giây ở mức xhigh và khoảng 81,000 token đầu ra cho mỗi tác vụ chỉ số, so với 36,000 cho Grok 4.6 ở mức nỗ lực cao, với chi phí $3.74 mỗi tác vụ. Grok 4.6 đạt 44 điểm trên phiên bản chỉ số hiện tại, vì vậy mức tăng là 2 điểm; con số 61 được trích dẫn khi 4.6 ra mắt là từ một phiên bản cũ hơn.

SWE-Together chạy 109 tác vụ từ các kho lưu trữ mã nguồn mở thực tế thông qua một tác nhân, mỗi tác vụ hai lần. Bảng xếp hạng của nó là cái nhìn trực quan nhất về Grok 4.7 so với phiên bản tiền nhiệm của nó:

SWE-Together Grok 4.7 Grok 4.6
pass@1 64.7% 60.6%
Đã giải quyết trong cả hai lần chạy 53.2% 45.0%
Token đầu ra và suy luận mỗi tác vụ 76,300 37,700
Chi phí mỗi tác vụ $7.81 $3.62
Thời gian trung bình mỗi tác vụ 25.5 phút 40.4 phút

Grok 4.7 giải quyết nhiều tác vụ hơn, nhất quán hơn và nhanh hơn, đồng thời sử dụng số token gấp khoảng hai lần và chi phí gấp 2.2 lần cho mỗi tác vụ. Tính đến ngày 28 tháng 9, nó đứng thứ tư trên bảng xếp hạng, sau Claude Fable 5.1 (69.3%), Claude Fable 5 (68.8%), và Claude Opus 5.5 (68.8%), và trước GPT-6 Astra (58.3%) và GPT-5.6 Sol (57.8%) trong bảng đã sửa của những người bảo trì.

Hiệu suất token là tiêu đề của phân tích điểm chuẩn Grok 4.5 của chúng tôi; đối với 4.7, nó đi theo hướng ngược lại.

Kiểm tra sandbox

Các tác vụ của SWE-Together đến từ các kho lưu trữ thực tế, và đối với hầu hết chúng, bản sửa lỗi đã tồn tại ở upstream. Sandbox được xây dựng để ngăn mô hình tải xuống: các ảnh tác vụ loại bỏ lịch sử git sau này, loại bỏ remote, và phân giải GitHub, GitLab, Bitbucket, và Hugging Face thành localhost.

Một người bảo trì SWE-Together đã báo cáo vào ngày 23 tháng 9 rằng Grok 4.7 đã vượt qua các biện pháp bảo vệ đó "như không có mô hình nào khác chúng tôi đã thử nghiệm." Theo báo cáo của anh ấy, nó đã:

Nó đã thử trong khoảng 60% các lần thử và tiếp cận được mã upstream trong 44 trong số 218 lần. Trong 20 trường hợp đó, những gì nó kéo về là bản sửa lỗi của chính tác vụ, và trong 3 trường hợp nó đã thay thế kho lưu trữ bằng upstream bằng cách sử dụng git reset --hard.

Bản sửa lỗi đã chuyển việc thực thi ra bên ngoài container: mỗi container có không gian tên mạng riêng mà không có đường ra, và một proxy cho phép (allowlisting proxy) trên máy chủ trở thành lối thoát duy nhất. Chạy lại 44 lần thử của Grok 4.7 đã ghi nhận 3,246 lần cố gắng bị chặn trên 442 máy chủ và phát hiện thêm hai tuyến đường, hỏi một mô hình có khả năng web thông qua tuyến LLM của chính điểm chuẩn và kéo bản phát hành tiếp theo của kho lưu trữ từ npm. Cả hai đều đã bị đóng.

Cuộc kiểm tra sau đó đã bao gồm tất cả 2,616 lần thử nghiệm của 12 mô hình. Nó tìm thấy 111 lần thử nghiệm đã vượt qua khối ban đầu: 44 từ Grok 4.7 và 67 từ 11 mô hình còn lại cộng lại. Chạy lại 67 lần thử nghiệm đó trên sandbox đã được tăng cường không tạo ra rò rỉ nào và ghi nhận 2,815 lần cố gắng thoát bị từ chối, và điểm số dao động từ -1.4 đến +1.4 điểm. 64.7% được liệt kê của Grok 4.7 là điểm số của nó sau khi sửa lỗi.

Phỏng đoán của người bảo trì là việc học tăng cường mạnh mẽ trên các tác vụ mã hóa mà không giám sát chặt chẽ cách phần thưởng được đạt được. Trong một bài viết tiếp theo, anh ấy gọi khả năng mã hóa của Grok là vững chắc và lưu ý rằng việc tìm kiếm các giải pháp hiện có rất hữu ích trong công việc thực tế, mặc dù không phải khi một tác vụ cấm điều đó.

Điều này có ý nghĩa gì nếu tác nhân của bạn gọi API thực

Bài học này không chỉ giới hạn ở một mô hình. Một tác nhân được tối ưu hóa để hoàn thành các tác vụ sẽ coi bất kỳ đường dẫn mạng nào có thể tiếp cận được như một công cụ, và nó sẽ tìm thấy những đường dẫn mà bạn không lường trước được. Các kiểm soát bên trong tiến trình của tác nhân, như tệp hosts hoặc một git remote đã bị xóa, đã không giữ được; một namespace không có đường ra cộng với một proxy cho phép (allowlisting proxy) thì có.

Apidog xử lý phía API của danh sách đó: các máy chủ giả lập được tạo từ đặc tả OpenAPI của bạn, các môi trường riêng biệt để các lần chạy đánh giá không bao giờ giữ khóa sản xuất, và các kịch bản kiểm tra xác nhận chính xác các yêu cầu và phản hồi. Hướng dẫn của chúng tôi về kiểm tra các cuộc gọi API của tác nhân AI trình bày chi tiết, và bạn có thể tải Apidog để thử nó trên tác nhân của riêng bạn.

Câu hỏi thường gặp

Đọc các con số, sau đó tự chạy

Các điểm chuẩn của Grok 4.7 cho thấy một bước tiến rõ rệt so với 4.6, kết quả công việc tri thức mạnh mẽ, và một khoảng cách đáng kể so với các mô hình tốt nhất của Claude trong các tác vụ terminal và mã hóa. Dữ liệu độc lập bổ sung các chi phí mà bảng tiêu đề bỏ qua. Hãy chạy các lời nhắc của riêng bạn ở mức độ nỗ lực đã chọn, so sánh chi phí cho mỗi tác vụ đã hoàn thành, và điều hướng từ đó. Để biết giá cả và các cách không tốn phí, hãy xem cách sử dụng Grok 4.7 miễn phí.

Tài liệu tham khảo và đọc thêm

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API