Gemini 4 Argon dẫn đầu hoàn toàn 13 trên 19 dòng trong bảng ra mắt của Google, hòa 1 dòng (CWE-bench v1, với GPT-6 Astra), và thua kém trên 5 dòng: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 và OSWorld-2.0. Vấn đề là quyền truy cập. Argon hiện chỉ có sẵn cho các nhà bảo vệ Chương trình Fairwind, vì vậy chưa ai ngoài danh sách đối tác của Google và một vài tổ chức đánh giá hiệu năng có thể chạy lại những con số này.
Dưới đây: bảng đầy đủ với người đã đo lường từng dòng, năm điểm thua, các chi tiết nhỏ, điểm số an ninh mạng, bảng điểm của bên thứ ba và cách xây dựng đánh giá của riêng bạn trong Apidog trước khi quyền truy cập được mở. Để có tổng quan về mô hình, hãy bắt đầu với Gemini 4 Argon là gì. Để đưa ra quyết định mua hàng, hãy xem Argon so với GPT-6 Astra so với Claude Opus 5.5.
Bảng đầy đủ, với người đã đo lường từng dòng
Đây là kết quả do Google báo cáo từ bài đăng ra mắt và tài liệu PDF về phương pháp đánh giá, có tiêu đề "kết quả tính đến tháng 10 năm 2026". Google đã tự tính toán 10 trên 19 điểm số của Argon; 9 điểm còn lại đến từ các bảng xếp hạng công khai. Các con số của đối thủ đến từ các bảng xếp hạng đó, các lần chạy của riêng Google, hoặc thẻ hệ thống và bài đăng blog của các nhà cung cấp, và các công cụ đánh giá khác nhau theo từng dòng. In đậm đánh dấu người dẫn đầu dòng.
| Tiêu chuẩn | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Ai đã đo lường nó |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | Bảng xếp hạng Zapier (bộ dữ liệu riêng tư) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Argon tự tính toán; bảng xếp hạng Astra; thẻ hệ thống Anthropic |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | Bảng xếp hạng Proximal |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Argon tự tính toán; bảng xếp hạng của đối thủ |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | Tự tính toán cho tất cả các mô hình |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Argon tự tính toán; bảng xếp hạng của đối thủ |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | Tự tính toán cho tất cả các mô hình |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | Bảng xếp hạng Surge |
| GraphWalks up to 128K | 99.7% | 98.7% | 91.4% | 90.6% | Tự tính toán cho tất cả các mô hình |
| GraphWalks 256K to 1M | 84.2% | 71.8% | 65.0% | 66.8% | Tự tính toán cho tất cả các mô hình |
| Agent’s Last Exam | 39.5% | 34.2% | n/r | 38.2% | Argon tự tính toán; bảng xếp hạng của đối thủ |
| OSWorld-2.0 (offline) | 69.2% | 72.6% | n/r | n/r | Argon tự tính toán; Astra từ bài đăng blog của OpenAI |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | Bảng xếp hạng Surge |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | Tự tính toán cho tất cả các mô hình |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | Bảng xếp hạng công khai |
n/r = không báo cáo. Grok 4.7, không có trong bảng của Google, cũng đạt 68% trên bảng xếp hạng CWE-bench, vì vậy đó là một trận hòa ba bên.
Sắp xếp theo nguồn, 9 dòng đến từ các bảng xếp hạng công khai cho mọi mô hình (Vals AI, Zapier, Proximal, Surge và CWE-bench). Argon dẫn đầu 7 trong số 9 dòng đó và hòa 1. Google đã tự thực hiện 5 dòng cho cả bốn mô hình, và Argon dẫn đầu 4. 5 dòng còn lại kết hợp điểm số của Argon do Google thực hiện với các con số của đối thủ từ nơi khác, và đó là nơi Argon thua nhiều nhất: 3 trong số 5 trận thua của nó nằm trong các dòng hỗn hợp đó. Nếu việc tự tính toán làm Argon được ưu ái, bạn sẽ mong đợi điều ngược lại.
Nơi Argon thua kém, và tại sao điều đó quan trọng đối với lập trình tác nhân
- FrontierSWE v2: 55.0% so với 65.5% của Astra. Argon đứng cuối cùng trong số bốn mô hình, sau Fable 5.1 (56.3%) và Opus 5.5 (62.3%), trên một bảng xếp hạng đã chấm điểm mọi mô hình.
- Terminal-bench 4.0: 57.4% so với 66.4% của Opus 5.5. Lại đứng cuối cùng, mặc dù Astra và Fable 5.1 chỉ cách nhau một điểm.
- PostTrainBench: 45.3% so với 49.3% của Opus 5.5. Vị trí thứ hai, trên một dòng mà Google đã chạy cho tất cả các mô hình.
- Terminal-Bench Science 0.1: 57.6% so với 68.1% của Astra. Thứ ba, chỉ đứng trước Fable 5.1. Google đã chạy thử nghiệm của Argon với thời gian chờ xác minh gấp 6 lần.
- OSWorld-2.0 (tập hợp ngoại tuyến): 69.2% so với 72.6% của Astra. Anthropic chỉ báo cáo điểm tổng hợp trực tuyến và ngoại tuyến, vì vậy không có mô hình Claude nào xuất hiện.
Lập trình tác nhân chia 2-2. Argon thắng DeepSWE v1.1 và Vibe Code Bench, sau đó đứng cuối trên FrontierSWE v2 và Terminal-bench 4.0. Chiến thắng DeepSWE kết hợp các công cụ đánh giá: Argon chạy trên một công cụ đánh giá tác nhân mini-swe, số liệu của Astra từ bảng xếp hạng công khai, và các số liệu của Claude từ thẻ hệ thống. Vibe Code Bench rõ ràng hơn, vì Vals AI đã chấm điểm cả bốn, nhưng biên độ chỉ là 1.6 điểm.
Nếu khối lượng công việc của bạn là các tác nhân nặng về terminal hoặc các tác vụ kho lưu trữ dài, hãy cân nhắc hai dòng cuối cùng đó cao hơn tổng số tiêu đề. Astra giữ vị trí dẫn đầu FrontierSWE; trải nghiệm thực tế GPT-6 Astra của chúng tôi cho thấy mô hình đó hoạt động như thế nào khi sử dụng ngày nay. Về phía Anthropic, phân tích điểm chuẩn Claude Fable 5.1 bao gồm các con số ra mắt của Fable.
Bloomberg báo cáo rằng các nhân viên ẩn danh của Google có quyền truy cập nói rằng Argon không gây ấn tượng trong một số công việc lập trình và thiết kế giao diện người dùng so với điểm chuẩn của nó. Google gọi mô tả đó là không chính xác.
Những cảnh báo về phương pháp luận làm thay đổi cách bạn đọc bảng
- Nỗ lực tối đa từ cả hai phía. Argon chạy "với API Gemini với cài đặt suy nghĩ cao nhất". Đối với Astra, Fable 5.1 và Opus 5.5, Google mặc định sử dụng "cài đặt suy nghĩ/lý luận tối đa có sẵn". Điều đó so sánh giới hạn trên, không phải hành vi mặc định hoặc chi phí.
- Khung hình LVBench. Google đã tự chạy LVBench cho cả bốn mô hình, không có công cụ. Gemini lấy mẫu video ở 1 FPS. Astra nhận được 800 khung hình, Fable 5.1 nhận được 300 và Opus 5.5 nhận được 600, "do các giới hạn API". Các mô hình không thấy đầu vào giống hệt nhau.
- OSWorld tốt nhất trong ba. Điểm của Argon là "tối đa hóa qua 3 lần chạy với một lần thử cho mỗi lần chạy", là lần chạy tốt nhất chứ không phải trung bình.
- Thời gian cho bài kiểm tra cuối cùng của Agent. Argon chạy trên công cụ đánh giá ALE-Claw với cửa sổ 5 giờ.
- Bật bộ lọc an toàn. Bài kiểm tra cuối cùng của Agent và OSWorld chạy với bộ lọc an toàn được bật, và các phản hồi bị gắn cờ trở lại dưới dạng chuỗi rỗng. Nếu có, điều đó chống lại Argon.
Các dòng về an ninh mạng từ trang an ninh mạng của DeepMind
Trang an ninh mạng DeepMind thêm bốn điểm ngoài bảng ra mắt:
| Đánh giá an ninh mạng | Gemini 4 Argon | So sánh |
|---|---|---|
| Phát hiện lỗ hổng thực tế | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| Điểm chuẩn kiểm tra thâm nhập Wiz | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
| Tỷ lệ thành công tấn công Gray Swan IPI (k=15, thấp hơn là tốt hơn) | 0.7% | Thấp nhất trên biểu đồ; Kimi K3 cao nhất ở 52.7% |
| CWE-bench v1 | 68% | Hòa ba bên với Grok 4.7 và GPT-6 Astra; Opus 5.5 ở 67% |
Đánh giá lỗ hổng sử dụng một công cụ đánh giá Antigravity nội bộ "không chuyên về an ninh mạng", với quyền truy cập mã nguồn. Bài kiểm tra Wiz cho phép mô hình "chỉ truy cập vào trang web đang chạy và hành vi công khai của nó, không có mã nguồn ứng dụng". Cả hai so sánh tiêu đề đều là với mô hình an ninh mạng trước đây của Google, không phải đối thủ. Giải thích về khả năng phòng thủ an ninh mạng của Argon của chúng tôi bao gồm ý nghĩa của những điều này đối với các API bạn chạy.
Bảng điểm của bên thứ ba
Các tổ chức này đã đăng điểm trong vòng vài phút sau khi ra mắt, vì vậy họ có quyền truy cập trước khi phát hành.
- Phân tích nhân tạo (Artificial Analysis) liệt kê Gemini 4 Argon (Cao) với Chỉ số thông minh là 53, #8 trong số 223. Xếp hạng đó tính riêng từng cài đặt lý luận. Theo mô hình riêng biệt, Argon hòa Fable 5.1 và GPT-6 Astra và đứng sau Opus 5.5 (58 tối đa) và Sonnet 5.5 (56 tối đa). AA báo cáo tỷ lệ ảo giác 15% trên AA-Omniscience (Astra tối đa, 51%), với độ chính xác 50% so với 63%. Chạy chỉ số này tốn 1.99 đô la cho mỗi tác vụ, với khoảng 62K token đầu ra cho mỗi tác vụ so với khoảng 27K cho Astra tối đa. Artificial Analysis không hiển thị dữ liệu về tốc độ hoặc độ trễ.
- Vals AI đặt Argon ở mức 68.90% trên Vals Index, #1 trong số 41 và là mô hình Gemini đầu tiên đứng đầu, với 15.68 đô la cho mỗi thử nghiệm. Vals AI liệt kê đầu ra tối đa 262K cho cấu hình mà nó đã thử nghiệm, thấp hơn 1M mà Google đã nêu.
- Arena xếp Argon #1 về Văn bản ở 1525, được đánh dấu Sơ bộ trên 4,942 phiếu bầu, và #8 về WebDev.
Tại sao các trang tin công bố 12, 13 và 14 chiến thắng
Các trang tin đã công bố ba số lượng chiến thắng khác nhau. Dưới đây là thống kê lại từ 19 dòng của Google:
| Đếm theo | Argon thắng | Hòa | Argon thua | Không báo cáo |
|---|---|---|---|---|
| Tốt nhất trong số ba đối thủ | 13 | 1 | 5 | 0 |
| Chỉ GPT-6 Astra | 14 | 1 | 4 | 0 |
| Chỉ Claude Opus 5.5 | 14 | 0 | 4 | 1 |
| Chỉ Claude Fable 5.1 | 15 | 0 | 2 | 2 |
Con số 13 là đúng so với toàn bộ lĩnh vực. Con số 14 là đúng khi đối đầu trực tiếp với Astra hoặc Opus 5.5. Con số 12 không khớp với bất kỳ cách trình bày nào trong số này của 19 dòng đầy đủ, vì vậy hãy kiểm tra xem nguồn đó đã đếm những dòng nào. Biên độ cũng khác nhau: Harvey Legal Agent (19.6% so với 6.7%) là rộng; Chartography là 0.6 điểm.
Cách tự chạy đánh giá vào ngày quyền truy cập được mở
Các điểm chuẩn mô tả công cụ đánh giá của Google; lời nhắc của bạn mô tả sản phẩm của bạn. Xây dựng đánh giá ngay hôm nay trên một mô hình bạn có thể gọi, sau đó hướng nó vào Argon chỉ với một thay đổi.
- Chọn các lời nhắc thực tế phù hợp với các dòng bạn quan tâm: sửa lỗi kho lưu trữ, tác vụ terminal, câu hỏi tài liệu dài.
- Trong Apidog, tạo một môi trường với
GEMINI_API_KEYvàGEMINI_MODELđược đặt thànhgemini-3.8-flash. Google chưa công bố ID mô hình của Argon, vì vậy biến này là giá trị duy nhất bạn sẽ thay đổi. - Lưu mỗi lời nhắc dưới dạng một yêu cầu đọc mô hình từ
{{GEMINI_MODEL}}, được nhóm thành một kịch bản kiểm thử. - Thêm các xác nhận trên đầu ra (trạng thái, các trường bắt buộc, nội dung mong đợi) và trên
usageMetadata, bao gồm một giới hạn trênthoughtsTokenCountcó kích thước theo giới hạn chi phí của bạn. - Chạy kịch bản trên 3.8 Flash ngay bây giờ và giữ báo cáo làm cơ sở của bạn.
Vào ngày ID của Argon được phát hành, hoán đổi biến và chạy lại. Google nói rằng "tất cả các mô hình mới" sẽ ra mắt trên API Interactions, vì vậy hãy lưu một phiên bản Interactions của mỗi yêu cầu. So sánh Argon với Gemini 3.8 Flash của chúng tôi bao gồm những gì mong đợi về giá cả và giới hạn.
Câu hỏi thường gặp
Các điểm chuẩn của Gemini 4 Argon có được xác minh độc lập không? Một phần. Chín trong số 19 dòng đến từ các bảng xếp hạng công khai cho mọi mô hình, và Artificial Analysis, Vals AI và Arena đã đăng kết quả của riêng họ. Phần còn lại do Google thực hiện cho Argon.
Điểm DeepSWE của Gemini 4 Argon là bao nhiêu? 77.9% trên DeepSWE v1.1, dẫn trước Opus 5.5 (74.2%) và Astra (74.1%). Lần chạy của Argon sử dụng một công cụ đánh giá tác nhân mini-swe, trong khi các số liệu của đối thủ đến từ bảng xếp hạng và thẻ hệ thống.
Argon có đánh bại GPT-6 Astra trên các điểm chuẩn không? Đối đầu trực tiếp trong bảng của Google, Argon thắng 14 dòng, hòa 1 và thua 4. Trên Artificial Analysis họ hòa ở mức 53.
Tôi có thể tự chạy lại các điểm chuẩn này không? Chưa. Argon giới hạn cho các đối tác Fairwind, và Google chưa đưa ra ngày phát hành công khai; công cụ theo dõi ngày phát hành Argon của chúng tôi theo dõi quá trình triển khai.
Bước tiếp theo
Xây dựng kịch bản ngay bây giờ, chạy nó trên 3.8 Flash, và giữ báo cáo. Khi Argon ra mắt, bạn sẽ có số liệu của riêng mình chỉ vài phút sau khi thay đổi. Tải xuống Apidog để thiết lập nó.
