Grok 4.5 so với Claude Opus 4.8: Cái nào tốt nhất?

Grok 4.5 và Claude Opus 4.8: kết quả đối sánh 2-2, mức giá $2/$6 so với $5/$25, hiệu quả token gấp 4.2 lần, và mô hình nào xứng đáng có vị trí trong ngăn xếp công nghệ của bạn.

Ashley Innocent

Ashley Innocent

9 tháng 7 2026

Grok 4.5 so với Claude Opus 4.8: Cái nào tốt nhất?

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Khi xAI phát hành Grok 4.5 vào ngày 8 tháng 7 năm 2026, Elon Musk đã tự mình đưa ra so sánh: “một mô hình đẳng cấp Opus, nhưng nhanh hơn, hiệu quả token hơn và chi phí thấp hơn.” Đó là một tuyên bố cụ thể, có thể kiểm chứng về Claude Opus 4.8, mô hình mã hóa chủ lực của Anthropic.

Vì vậy, hãy cùng kiểm tra. So sánh này sử dụng các con số mà xAI đã công bố trong thông báo của mình, giá cả được Anthropic công bố và những phần của câu chuyện mà cả hai nhà cung cấp đều không đưa vào tiêu đề. Phiên bản ngắn gọn: tuyên bố này hầu hết vẫn đúng, với hai lần thua điểm chuẩn và một dấu hoa thị lớn về xác minh.

nút

Bảng điểm

xAI đã công bố bốn điểm chuẩn mã hóa. Dưới đây là chúng, với cả hai mô hình cùng với bối cảnh tiên tiến xung quanh chúng:

Điểm chuẩn Grok 4.5 Opus 4.8 (tối đa) Người chiến thắng
DeepSWE 1.0 (pass@1) 62.0% 55.75% Grok 4.5 (+6.25)
DeepSWE 1.1 53% 59% Opus 4.8 (+6)
Terminal Bench 2.1 83.3% 78.9% Grok 4.5 (+4.4)
SWE Bench Pro (giải quyết) 64.7% 69.2% Opus 4.8 (+4.5)

Mỗi bên thắng hai trận. Theo biểu đồ của xAI, "đẳng cấp Opus" là chính xác về cấp độ khả năng và sai lầm nếu là tuyên bố về sự vượt trội, điều mà, công bằng mà nói với xAI, không phải là tuyên bố mà Musk đưa ra.

Đáng chú ý: Claude Fable 5 (tối đa) đứng đầu cả bốn biểu đồ này (66.1 / 70 / 84.3 / 80.4), và GPT 5.5 (xhigh) đánh bại cả hai mô hình trên ba trong bốn. Grok 4.5 đang cạnh tranh ở cấp độ dưới mức tiên tiến, chống lại mô hình mà Anthropic định giá cho công việc hàng ngày chứ không phải khả năng cao nhất. Nếu bạn muốn cuộc chiến tiên phong, đó là Fable 5 vs Opus 4.8.

Dấu hoa thị về nguồn gốc

Đây không phải là kết quả thử nghiệm độc lập. xAI lưu ý rằng các số liệu của đối thủ cạnh tranh đến từ "thẻ hệ thống hoặc bảng xếp hạng điểm chuẩn được công bố của các nhà phát triển tương ứng," với các đánh giá DeepSWE do Datacurve tạo ra và các lần chạy được xử lý bằng công cụ của mỗi nhà cung cấp. Điều đó tốt hơn so với việc tự báo cáo mờ mịt, nhưng việc trộn lẫn các nguồn có nghĩa là sự khác biệt về công cụ và cấu trúc rò rỉ vào so sánh. Chưa có bên thứ ba độc lập nào đánh giá Grok 4.5. Phân tích chuyên sâu điểm chuẩn của chúng tôi theo dõi tình hình đó.

Giá: Grok thắng trên lý thuyết, lớn hơn trong thực tế

Giá niêm yết trên mỗi triệu token:

Grok 4.5 Opus 4.8
Đầu vào $2.00 $5.00
Đầu ra $6.00 $25.00

Đó là 40% giá đầu vào của Opus và 24% giá đầu ra của nó. (Chi tiết đầy đủ về Anthropic trong phân tích giá Opus 4.8 của chúng tôi.)

Khoảng cách nới rộng khi bạn tính đến độ dài lời giải. xAI báo cáo Grok 4.5 giải quyết các nhiệm vụ SWE Bench Pro với trung bình 15.954 token đầu ra; Opus 4.8 (tối đa) trung bình 67.020 trên cùng một điểm chuẩn. Nhân nó ra cho mỗi nhiệm vụ đã giải quyết:

Rẻ hơn khoảng 17 lần về đầu ra trên mỗi tác vụ hoàn thành, theo số lượng token do nhà cung cấp báo cáo. Hãy thận trọng với bội số chính xác (một điểm chuẩn, một phép đo của nhà cung cấp, và chế độ nỗ lực "tối đa" làm tăng số lượng token của Opus), nhưng hướng đi thì khó có thể tranh cãi: một mô hình ngắn gọn với giá $6 đánh bại một mô hình dài dòng với giá $25 nhiều hơn những gì bảng giá gợi ý. Chúng tôi chạy các kịch bản đầy đủ hơn trong Giải thích giá Grok 4.5.

Lưu ý này cũng đi theo hướng ngược lại: Opus mất nhiều token hơn cho mỗi tác vụ một phần vì chế độ "tối đa" lập luận dài dòng, và lập luận đó là một phần lý do tại sao nó thắng SWE Bench Pro với 4.5 điểm. Bạn đang trả tiền cho việc suy nghĩ. Đôi khi việc suy nghĩ là sản phẩm.

Tốc độ: 80 TPS và câu trả lời ngắn hơn cộng hưởng

Grok 4.5 phục vụ khoảng 80 token mỗi giây, điều mà xAI gọi là “tốc độ của mô hình nhanh.” Kết hợp với đầu ra chỉ bằng một phần tư độ dài, thời gian thực hiện mỗi tác vụ giảm đi hai lần: ít token hơn, được cung cấp nhanh hơn. Đối với các vòng lặp tác nhân mà chuỗi hàng chục lệnh gọi mô hình, độ trễ trên mỗi bước tích lũy thành phút tiết kiệm được cho mỗi phiên.

Anthropic không công bố con số TPS tương đương cho Opus 4.8, và tốc độ thực tế thay đổi tùy theo tải và cấp độ, vì vậy hãy kiểm tra điều này trên lưu lượng truy cập của riêng bạn thay vì tin tưởng vào trang tiếp thị nào.

Nơi Opus 4.8 giữ lợi thế

Giá cả không phải là tất cả, và bảng điểm nêu rõ những nơi nó không phải:

Bạn nên sử dụng cái nào?

Hãy chọn Grok 4.5 nếu khối lượng công việc của bạn là mã hóa tác nhân hoặc công việc tri thức khối lượng lớn, hóa đơn API là một khoản mục bạn theo dõi, và việc chia đôi điểm chuẩn 2-2 với một phần tư giá đầu ra nghe có vẻ như là cơ hội kiếm lời chênh lệch giá. Giá ra mắt cộng với các khoảng thời gian miễn phí hiện tại làm cho việc dùng thử gần như không tốn kém trong tháng này.

Hãy tiếp tục sử dụng Opus 4.8 nếu bạn đã quen thuộc sâu sắc với hệ sinh thái Anthropic, bạn cần điểm số mạnh nhất được công bố trên các điểm chuẩn cấp độ kho lưu trữ khó trong phân khúc giá này, hoặc bạn không thể chấp nhận rủi ro mô hình trong tuần đầu tiên ở môi trường sản xuất.

Dù bằng cách nào, hãy tự đo lường. Cả hai API đều có cấu trúc tương thích OpenAI, vì vậy một công cụ A/B dễ dàng xây dựng. Trong Apidog, lưu một yêu cầu cho mỗi mô hình, trỏ chúng đến năm lời nhắc thực tế khó nhất của bạn và so sánh chất lượng đầu ra, độ trễ và đối tượng sử dụng cạnh nhau. Đặc biệt kiểm tra output_tokens: nếu câu trả lời của Grok trên lời nhắc của bạn không ngắn hơn, các yếu tố kinh tế trên không áp dụng cho bạn. Tải Apidog miễn phí và chạy so sánh trên lưu lượng truy cập của riêng bạn trước khi di chuyển khối lượng công việc.

Hướng dẫn thiết lập cho cả hai bên: cách sử dụng API Grok 4.5cách sử dụng API Claude Opus 4.8.

Câu hỏi thường gặp

Grok 4.5 có tốt hơn Claude Opus 4.8 không? Chúng chia đều các điểm chuẩn được xAI công bố 2-2. Grok 4.5 rẻ hơn và hiệu quả token hơn; Opus 4.8 thắng hai bài kiểm tra cấp độ kho lưu trữ khó hơn. "Tốt hơn" phụ thuộc vào việc giới hạn của bạn là ngân sách hay khả năng cao nhất.

Grok 4.5 rẻ hơn Opus 4.8 bao nhiêu? $2 so với $5 cho mỗi triệu token đầu vào và $6 so với $25 cho mỗi triệu token đầu ra. Theo mỗi tác vụ mã hóa được giải quyết, số lượng token do nhà cung cấp báo cáo cho thấy một khoảng cách hiệu quả lớn hơn nhiều.

Có điểm chuẩn độc lập nào cho Grok 4.5 không? Chưa có. Các số liệu được công bố pha trộn các lần chạy của xAI, đánh giá của Datacurve và thẻ hệ thống của các nhà cung cấp khác. Các con số độc lập dự kiến sẽ có trong vài tuần sau khi ra mắt.

Tôi có thể kiểm tra cả hai mô hình bằng cùng một mã không? Hầu hết là có. Cả hai đều cung cấp tính năng hoàn thành trò chuyện tương thích OpenAI, vì vậy việc thay đổi base_url, khóa và ID mô hình sẽ bao gồm các yếu tố cơ bản. Chi tiết về gọi công cụ và đầu ra có cấu trúc khác nhau; hãy kiểm tra rõ ràng các đường dẫn đó trước khi chuyển đổi.

nút

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API