Khi xAI phát hành Grok 4.5 vào ngày 8 tháng 7 năm 2026, Elon Musk đã tự mình đưa ra so sánh: “một mô hình đẳng cấp Opus, nhưng nhanh hơn, hiệu quả token hơn và chi phí thấp hơn.” Đó là một tuyên bố cụ thể, có thể kiểm chứng về Claude Opus 4.8, mô hình mã hóa chủ lực của Anthropic.
Vì vậy, hãy cùng kiểm tra. So sánh này sử dụng các con số mà xAI đã công bố trong thông báo của mình, giá cả được Anthropic công bố và những phần của câu chuyện mà cả hai nhà cung cấp đều không đưa vào tiêu đề. Phiên bản ngắn gọn: tuyên bố này hầu hết vẫn đúng, với hai lần thua điểm chuẩn và một dấu hoa thị lớn về xác minh.
Bảng điểm
xAI đã công bố bốn điểm chuẩn mã hóa. Dưới đây là chúng, với cả hai mô hình cùng với bối cảnh tiên tiến xung quanh chúng:
| Điểm chuẩn | Grok 4.5 | Opus 4.8 (tối đa) | Người chiến thắng |
|---|---|---|---|
| DeepSWE 1.0 (pass@1) | 62.0% | 55.75% | Grok 4.5 (+6.25) |
| DeepSWE 1.1 | 53% | 59% | Opus 4.8 (+6) |
| Terminal Bench 2.1 | 83.3% | 78.9% | Grok 4.5 (+4.4) |
| SWE Bench Pro (giải quyết) | 64.7% | 69.2% | Opus 4.8 (+4.5) |
Mỗi bên thắng hai trận. Theo biểu đồ của xAI, "đẳng cấp Opus" là chính xác về cấp độ khả năng và sai lầm nếu là tuyên bố về sự vượt trội, điều mà, công bằng mà nói với xAI, không phải là tuyên bố mà Musk đưa ra.

Đáng chú ý: Claude Fable 5 (tối đa) đứng đầu cả bốn biểu đồ này (66.1 / 70 / 84.3 / 80.4), và GPT 5.5 (xhigh) đánh bại cả hai mô hình trên ba trong bốn. Grok 4.5 đang cạnh tranh ở cấp độ dưới mức tiên tiến, chống lại mô hình mà Anthropic định giá cho công việc hàng ngày chứ không phải khả năng cao nhất. Nếu bạn muốn cuộc chiến tiên phong, đó là Fable 5 vs Opus 4.8.
Dấu hoa thị về nguồn gốc
Đây không phải là kết quả thử nghiệm độc lập. xAI lưu ý rằng các số liệu của đối thủ cạnh tranh đến từ "thẻ hệ thống hoặc bảng xếp hạng điểm chuẩn được công bố của các nhà phát triển tương ứng," với các đánh giá DeepSWE do Datacurve tạo ra và các lần chạy được xử lý bằng công cụ của mỗi nhà cung cấp. Điều đó tốt hơn so với việc tự báo cáo mờ mịt, nhưng việc trộn lẫn các nguồn có nghĩa là sự khác biệt về công cụ và cấu trúc rò rỉ vào so sánh. Chưa có bên thứ ba độc lập nào đánh giá Grok 4.5. Phân tích chuyên sâu điểm chuẩn của chúng tôi theo dõi tình hình đó.
Giá: Grok thắng trên lý thuyết, lớn hơn trong thực tế
Giá niêm yết trên mỗi triệu token:
| Grok 4.5 | Opus 4.8 | |
|---|---|---|
| Đầu vào | $2.00 | $5.00 |
| Đầu ra | $6.00 | $25.00 |
Đó là 40% giá đầu vào của Opus và 24% giá đầu ra của nó. (Chi tiết đầy đủ về Anthropic trong phân tích giá Opus 4.8 của chúng tôi.)
Khoảng cách nới rộng khi bạn tính đến độ dài lời giải. xAI báo cáo Grok 4.5 giải quyết các nhiệm vụ SWE Bench Pro với trung bình 15.954 token đầu ra; Opus 4.8 (tối đa) trung bình 67.020 trên cùng một điểm chuẩn. Nhân nó ra cho mỗi nhiệm vụ đã giải quyết:
- Grok 4.5: 15.954 token × $6/M ≈ $0.10 đầu ra cho mỗi tác vụ
- Opus 4.8 (tối đa): 67.020 token × $25/M ≈ $1.68 đầu ra cho mỗi tác vụ
Rẻ hơn khoảng 17 lần về đầu ra trên mỗi tác vụ hoàn thành, theo số lượng token do nhà cung cấp báo cáo. Hãy thận trọng với bội số chính xác (một điểm chuẩn, một phép đo của nhà cung cấp, và chế độ nỗ lực "tối đa" làm tăng số lượng token của Opus), nhưng hướng đi thì khó có thể tranh cãi: một mô hình ngắn gọn với giá $6 đánh bại một mô hình dài dòng với giá $25 nhiều hơn những gì bảng giá gợi ý. Chúng tôi chạy các kịch bản đầy đủ hơn trong Giải thích giá Grok 4.5.
Lưu ý này cũng đi theo hướng ngược lại: Opus mất nhiều token hơn cho mỗi tác vụ một phần vì chế độ "tối đa" lập luận dài dòng, và lập luận đó là một phần lý do tại sao nó thắng SWE Bench Pro với 4.5 điểm. Bạn đang trả tiền cho việc suy nghĩ. Đôi khi việc suy nghĩ là sản phẩm.
Tốc độ: 80 TPS và câu trả lời ngắn hơn cộng hưởng
Grok 4.5 phục vụ khoảng 80 token mỗi giây, điều mà xAI gọi là “tốc độ của mô hình nhanh.” Kết hợp với đầu ra chỉ bằng một phần tư độ dài, thời gian thực hiện mỗi tác vụ giảm đi hai lần: ít token hơn, được cung cấp nhanh hơn. Đối với các vòng lặp tác nhân mà chuỗi hàng chục lệnh gọi mô hình, độ trễ trên mỗi bước tích lũy thành phút tiết kiệm được cho mỗi phiên.
Anthropic không công bố con số TPS tương đương cho Opus 4.8, và tốc độ thực tế thay đổi tùy theo tải và cấp độ, vì vậy hãy kiểm tra điều này trên lưu lượng truy cập của riêng bạn thay vì tin tưởng vào trang tiếp thị nào.
Nơi Opus 4.8 giữ lợi thế
Giá cả không phải là tất cả, và bảng điểm nêu rõ những nơi nó không phải:
- Việc mã hóa tác nhân khó nhất. SWE Bench Pro, gần nhất trong bốn điểm chuẩn với công việc kho lưu trữ thực tế phức tạp, thuộc về Opus với 4.5 điểm. DeepSWE 1.1, phiên bản mới hơn, thuộc về Opus với 6 điểm.
- Sự trưởng thành của hệ sinh thái. Opus 4.8 tích hợp vào Claude Code, các mẫu sử dụng công cụ đã được thiết lập và một năm kiểm chứng trong sản xuất. Grok 4.5 ra mắt hôm qua; bề mặt tích hợp của nó là Grok Build, Cursor và một API mới. Chi phí di chuyển là có thật ngay cả khi chi phí mỗi token thấp hơn.
- Khả năng dự đoán. Hành vi của Opus trong các ngữ cảnh dài, các mẫu từ chối và các chế độ lỗi của nó đã được ghi chép đầy đủ, bao gồm bởi chúng tôi. Các thông tin về Grok 4.5 mới chỉ có từ một tuần.
Bạn nên sử dụng cái nào?
Hãy chọn Grok 4.5 nếu khối lượng công việc của bạn là mã hóa tác nhân hoặc công việc tri thức khối lượng lớn, hóa đơn API là một khoản mục bạn theo dõi, và việc chia đôi điểm chuẩn 2-2 với một phần tư giá đầu ra nghe có vẻ như là cơ hội kiếm lời chênh lệch giá. Giá ra mắt cộng với các khoảng thời gian miễn phí hiện tại làm cho việc dùng thử gần như không tốn kém trong tháng này.
Hãy tiếp tục sử dụng Opus 4.8 nếu bạn đã quen thuộc sâu sắc với hệ sinh thái Anthropic, bạn cần điểm số mạnh nhất được công bố trên các điểm chuẩn cấp độ kho lưu trữ khó trong phân khúc giá này, hoặc bạn không thể chấp nhận rủi ro mô hình trong tuần đầu tiên ở môi trường sản xuất.
Dù bằng cách nào, hãy tự đo lường. Cả hai API đều có cấu trúc tương thích OpenAI, vì vậy một công cụ A/B dễ dàng xây dựng. Trong Apidog, lưu một yêu cầu cho mỗi mô hình, trỏ chúng đến năm lời nhắc thực tế khó nhất của bạn và so sánh chất lượng đầu ra, độ trễ và đối tượng sử dụng cạnh nhau. Đặc biệt kiểm tra output_tokens: nếu câu trả lời của Grok trên lời nhắc của bạn không ngắn hơn, các yếu tố kinh tế trên không áp dụng cho bạn. Tải Apidog miễn phí và chạy so sánh trên lưu lượng truy cập của riêng bạn trước khi di chuyển khối lượng công việc.
Hướng dẫn thiết lập cho cả hai bên: cách sử dụng API Grok 4.5 và cách sử dụng API Claude Opus 4.8.
Câu hỏi thường gặp
Grok 4.5 có tốt hơn Claude Opus 4.8 không? Chúng chia đều các điểm chuẩn được xAI công bố 2-2. Grok 4.5 rẻ hơn và hiệu quả token hơn; Opus 4.8 thắng hai bài kiểm tra cấp độ kho lưu trữ khó hơn. "Tốt hơn" phụ thuộc vào việc giới hạn của bạn là ngân sách hay khả năng cao nhất.
Grok 4.5 rẻ hơn Opus 4.8 bao nhiêu? $2 so với $5 cho mỗi triệu token đầu vào và $6 so với $25 cho mỗi triệu token đầu ra. Theo mỗi tác vụ mã hóa được giải quyết, số lượng token do nhà cung cấp báo cáo cho thấy một khoảng cách hiệu quả lớn hơn nhiều.
Có điểm chuẩn độc lập nào cho Grok 4.5 không? Chưa có. Các số liệu được công bố pha trộn các lần chạy của xAI, đánh giá của Datacurve và thẻ hệ thống của các nhà cung cấp khác. Các con số độc lập dự kiến sẽ có trong vài tuần sau khi ra mắt.
Tôi có thể kiểm tra cả hai mô hình bằng cùng một mã không? Hầu hết là có. Cả hai đều cung cấp tính năng hoàn thành trò chuyện tương thích OpenAI, vì vậy việc thay đổi base_url, khóa và ID mô hình sẽ bao gồm các yếu tố cơ bản. Chi tiết về gọi công cụ và đầu ra có cấu trúc khác nhau; hãy kiểm tra rõ ràng các đường dẫn đó trước khi chuyển đổi.
