Gemini 4 Argon: Đánh giá 19 hạng mục, cách Google chạy và 5 điểm thua kém

Điểm chuẩn Gemini 4 Argon: tất cả 19 hàng với thông tin ai đã thực hiện đo lường từng hàng, 5 trường hợp nó thất bại, các lưu ý về phương pháp luận của Google, và điểm số của AA, Vals và Arena.

INEZA Felin-Michel

INEZA Felin-Michel

2 tháng 10 2026

Gemini 4 Argon: Đánh giá 19 hạng mục, cách Google chạy và 5 điểm thua kém

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Gemini 4 Argon dẫn đầu hoàn toàn 13 trên 19 dòng trong bảng ra mắt của Google, hòa 1 dòng (CWE-bench v1, với GPT-6 Astra), và thua kém trên 5 dòng: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 và OSWorld-2.0. Vấn đề là quyền truy cập. Argon hiện chỉ có sẵn cho các nhà bảo vệ Chương trình Fairwind, vì vậy chưa ai ngoài danh sách đối tác của Google và một vài tổ chức đánh giá hiệu năng có thể chạy lại những con số này.

Dưới đây: bảng đầy đủ với người đã đo lường từng dòng, năm điểm thua, các chi tiết nhỏ, điểm số an ninh mạng, bảng điểm của bên thứ ba và cách xây dựng đánh giá của riêng bạn trong Apidog trước khi quyền truy cập được mở. Để có tổng quan về mô hình, hãy bắt đầu với Gemini 4 Argon là gì. Để đưa ra quyết định mua hàng, hãy xem Argon so với GPT-6 Astra so với Claude Opus 5.5.

Bảng đầy đủ, với người đã đo lường từng dòng

Đây là kết quả do Google báo cáo từ bài đăng ra mắt và tài liệu PDF về phương pháp đánh giá, có tiêu đề "kết quả tính đến tháng 10 năm 2026". Google đã tự tính toán 10 trên 19 điểm số của Argon; 9 điểm còn lại đến từ các bảng xếp hạng công khai. Các con số của đối thủ đến từ các bảng xếp hạng đó, các lần chạy của riêng Google, hoặc thẻ hệ thống và bài đăng blog của các nhà cung cấp, và các công cụ đánh giá khác nhau theo từng dòng. In đậm đánh dấu người dẫn đầu dòng.

Tiêu chuẩn Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 Ai đã đo lường nó
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% Bảng xếp hạng Zapier (bộ dữ liệu riêng tư)
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% Argon tự tính toán; bảng xếp hạng Astra; thẻ hệ thống Anthropic
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% Bảng xếp hạng Proximal
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% Argon tự tính toán; bảng xếp hạng của đối thủ
PostTrainBench 45.3% 44.3% 40.2% 49.3% Tự tính toán cho tất cả các mô hình
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% Argon tự tính toán; bảng xếp hạng của đối thủ
LABBench 2 88.8% 85.4% 68.6% 73.1% Tự tính toán cho tất cả các mô hình
RiemannBench 76.0% 72.0% 65.6% 69.6% Bảng xếp hạng Surge
GraphWalks up to 128K 99.7% 98.7% 91.4% 90.6% Tự tính toán cho tất cả các mô hình
GraphWalks 256K to 1M 84.2% 71.8% 65.0% 66.8% Tự tính toán cho tất cả các mô hình
Agent’s Last Exam 39.5% 34.2% n/r 38.2% Argon tự tính toán; bảng xếp hạng của đối thủ
OSWorld-2.0 (offline) 69.2% 72.6% n/r n/r Argon tự tính toán; Astra từ bài đăng blog của OpenAI
Chartography 71.6% 71.0% 46.2% 66.3% Bảng xếp hạng Surge
LVBench 91.7% 87.5% 79.7% 83.7% Tự tính toán cho tất cả các mô hình
CWE-bench v1 68.0% 68.0% 58.0% 67.0% Bảng xếp hạng công khai

n/r = không báo cáo. Grok 4.7, không có trong bảng của Google, cũng đạt 68% trên bảng xếp hạng CWE-bench, vì vậy đó là một trận hòa ba bên.

Sắp xếp theo nguồn, 9 dòng đến từ các bảng xếp hạng công khai cho mọi mô hình (Vals AI, Zapier, Proximal, Surge và CWE-bench). Argon dẫn đầu 7 trong số 9 dòng đó và hòa 1. Google đã tự thực hiện 5 dòng cho cả bốn mô hình, và Argon dẫn đầu 4. 5 dòng còn lại kết hợp điểm số của Argon do Google thực hiện với các con số của đối thủ từ nơi khác, và đó là nơi Argon thua nhiều nhất: 3 trong số 5 trận thua của nó nằm trong các dòng hỗn hợp đó. Nếu việc tự tính toán làm Argon được ưu ái, bạn sẽ mong đợi điều ngược lại.

Nơi Argon thua kém, và tại sao điều đó quan trọng đối với lập trình tác nhân

Lập trình tác nhân chia 2-2. Argon thắng DeepSWE v1.1 và Vibe Code Bench, sau đó đứng cuối trên FrontierSWE v2 và Terminal-bench 4.0. Chiến thắng DeepSWE kết hợp các công cụ đánh giá: Argon chạy trên một công cụ đánh giá tác nhân mini-swe, số liệu của Astra từ bảng xếp hạng công khai, và các số liệu của Claude từ thẻ hệ thống. Vibe Code Bench rõ ràng hơn, vì Vals AI đã chấm điểm cả bốn, nhưng biên độ chỉ là 1.6 điểm.

Nếu khối lượng công việc của bạn là các tác nhân nặng về terminal hoặc các tác vụ kho lưu trữ dài, hãy cân nhắc hai dòng cuối cùng đó cao hơn tổng số tiêu đề. Astra giữ vị trí dẫn đầu FrontierSWE; trải nghiệm thực tế GPT-6 Astra của chúng tôi cho thấy mô hình đó hoạt động như thế nào khi sử dụng ngày nay. Về phía Anthropic, phân tích điểm chuẩn Claude Fable 5.1 bao gồm các con số ra mắt của Fable.

Bloomberg báo cáo rằng các nhân viên ẩn danh của Google có quyền truy cập nói rằng Argon không gây ấn tượng trong một số công việc lập trình và thiết kế giao diện người dùng so với điểm chuẩn của nó. Google gọi mô tả đó là không chính xác.

Những cảnh báo về phương pháp luận làm thay đổi cách bạn đọc bảng

Các dòng về an ninh mạng từ trang an ninh mạng của DeepMind

Trang an ninh mạng DeepMind thêm bốn điểm ngoài bảng ra mắt:

Đánh giá an ninh mạng Gemini 4 Argon So sánh
Phát hiện lỗ hổng thực tế 85.8% Gemini 3.8 Flash Cyber 71.0%
Điểm chuẩn kiểm tra thâm nhập Wiz 70.9% Gemini 3.8 Flash Cyber 58.2%
Tỷ lệ thành công tấn công Gray Swan IPI (k=15, thấp hơn là tốt hơn) 0.7% Thấp nhất trên biểu đồ; Kimi K3 cao nhất ở 52.7%
CWE-bench v1 68% Hòa ba bên với Grok 4.7 và GPT-6 Astra; Opus 5.5 ở 67%

Đánh giá lỗ hổng sử dụng một công cụ đánh giá Antigravity nội bộ "không chuyên về an ninh mạng", với quyền truy cập mã nguồn. Bài kiểm tra Wiz cho phép mô hình "chỉ truy cập vào trang web đang chạy và hành vi công khai của nó, không có mã nguồn ứng dụng". Cả hai so sánh tiêu đề đều là với mô hình an ninh mạng trước đây của Google, không phải đối thủ. Giải thích về khả năng phòng thủ an ninh mạng của Argon của chúng tôi bao gồm ý nghĩa của những điều này đối với các API bạn chạy.

Bảng điểm của bên thứ ba

Các tổ chức này đã đăng điểm trong vòng vài phút sau khi ra mắt, vì vậy họ có quyền truy cập trước khi phát hành.

Tại sao các trang tin công bố 12, 13 và 14 chiến thắng

Các trang tin đã công bố ba số lượng chiến thắng khác nhau. Dưới đây là thống kê lại từ 19 dòng của Google:

Đếm theo Argon thắng Hòa Argon thua Không báo cáo
Tốt nhất trong số ba đối thủ 13 1 5 0
Chỉ GPT-6 Astra 14 1 4 0
Chỉ Claude Opus 5.5 14 0 4 1
Chỉ Claude Fable 5.1 15 0 2 2

Con số 13 là đúng so với toàn bộ lĩnh vực. Con số 14 là đúng khi đối đầu trực tiếp với Astra hoặc Opus 5.5. Con số 12 không khớp với bất kỳ cách trình bày nào trong số này của 19 dòng đầy đủ, vì vậy hãy kiểm tra xem nguồn đó đã đếm những dòng nào. Biên độ cũng khác nhau: Harvey Legal Agent (19.6% so với 6.7%) là rộng; Chartography là 0.6 điểm.

Cách tự chạy đánh giá vào ngày quyền truy cập được mở

Các điểm chuẩn mô tả công cụ đánh giá của Google; lời nhắc của bạn mô tả sản phẩm của bạn. Xây dựng đánh giá ngay hôm nay trên một mô hình bạn có thể gọi, sau đó hướng nó vào Argon chỉ với một thay đổi.

  1. Chọn các lời nhắc thực tế phù hợp với các dòng bạn quan tâm: sửa lỗi kho lưu trữ, tác vụ terminal, câu hỏi tài liệu dài.
  2. Trong Apidog, tạo một môi trường với GEMINI_API_KEY và GEMINI_MODEL được đặt thành gemini-3.8-flash. Google chưa công bố ID mô hình của Argon, vì vậy biến này là giá trị duy nhất bạn sẽ thay đổi.
  3. Lưu mỗi lời nhắc dưới dạng một yêu cầu đọc mô hình từ {{GEMINI_MODEL}}, được nhóm thành một kịch bản kiểm thử.
  4. Thêm các xác nhận trên đầu ra (trạng thái, các trường bắt buộc, nội dung mong đợi) và trên usageMetadata, bao gồm một giới hạn trên thoughtsTokenCount có kích thước theo giới hạn chi phí của bạn.
  5. Chạy kịch bản trên 3.8 Flash ngay bây giờ và giữ báo cáo làm cơ sở của bạn.

Vào ngày ID của Argon được phát hành, hoán đổi biến và chạy lại. Google nói rằng "tất cả các mô hình mới" sẽ ra mắt trên API Interactions, vì vậy hãy lưu một phiên bản Interactions của mỗi yêu cầu. So sánh Argon với Gemini 3.8 Flash của chúng tôi bao gồm những gì mong đợi về giá cả và giới hạn.

Câu hỏi thường gặp

Các điểm chuẩn của Gemini 4 Argon có được xác minh độc lập không? Một phần. Chín trong số 19 dòng đến từ các bảng xếp hạng công khai cho mọi mô hình, và Artificial Analysis, Vals AI và Arena đã đăng kết quả của riêng họ. Phần còn lại do Google thực hiện cho Argon.

Điểm DeepSWE của Gemini 4 Argon là bao nhiêu? 77.9% trên DeepSWE v1.1, dẫn trước Opus 5.5 (74.2%) và Astra (74.1%). Lần chạy của Argon sử dụng một công cụ đánh giá tác nhân mini-swe, trong khi các số liệu của đối thủ đến từ bảng xếp hạng và thẻ hệ thống.

Argon có đánh bại GPT-6 Astra trên các điểm chuẩn không? Đối đầu trực tiếp trong bảng của Google, Argon thắng 14 dòng, hòa 1 và thua 4. Trên Artificial Analysis họ hòa ở mức 53.

Tôi có thể tự chạy lại các điểm chuẩn này không? Chưa. Argon giới hạn cho các đối tác Fairwind, và Google chưa đưa ra ngày phát hành công khai; công cụ theo dõi ngày phát hành Argon của chúng tôi theo dõi quá trình triển khai.

Bước tiếp theo

Xây dựng kịch bản ngay bây giờ, chạy nó trên 3.8 Flash, và giữ báo cáo. Khi Argon ra mắt, bạn sẽ có số liệu của riêng mình chỉ vài phút sau khi thay đổi. Tải xuống Apidog để thiết lập nó.

button

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API