So sánh Gemini 4 Argon với GPT-6 Astra và Claude Opus 5.5

Gemini 4 Argon so với GPT-6 Astra so với Claude Opus 5.5: giá, giới hạn đầu ra, vị trí dẫn đầu của từng mô hình trên bảng xếp hạng benchmark của Google và nên sử dụng mô hình nào hôm nay.

Ashley Innocent

Ashley Innocent

2 tháng 10 2026

So sánh Gemini 4 Argon với GPT-6 Astra và Claude Opus 5.5

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Gemini 4 Argon dẫn đầu bảng xếp hạng chuẩn của Google trên 13 trong số 19 hàng so với GPT-6 Astra, Claude Opus 5.5 và Claude Fable 5.1, nhưng một thực tế quan trọng hơn bất kỳ điểm số nào: bạn có thể mua Astra và Opus 5.5 ngay hôm nay, còn Argon thì không. Mô hình tiên tiến mới của Google hiện chỉ dành cho các đối tác của Chương trình Fairwind, với giá 2 đô la/10 đô la cho mỗi triệu token trong thời gian giới thiệu và 4 đô la/20 đô la sau đó, mức giá này chính xác bằng Opus 5.5.

Bài so sánh này đối chiếu bốn mô hình về giá cả và giới hạn, nhóm các hàng chuẩn theo mô hình chiến thắng, giải thích tại sao các con số không hoàn toàn tương đồng và kết thúc bằng hướng dẫn định tuyến cũng như cách kiểm tra cả ba mô hình trên các câu lệnh của riêng bạn trong Apidog. Mới làm quen với Argon? Bắt đầu với Gemini 4 Argon là gì; để biết thời gian, hãy xem hướng dẫn ngày phát hành Argon.

nút

Giá và giới hạn đặt cạnh nhau

Bảng của Google bao gồm Claude Fable 5.1, vì vậy nó cũng có một cột. Giá là trên 1 triệu token, từ trang riêng của mỗi nhà cung cấp: bài đăng ra mắt của Google, trang mô hình GPT-6 Astra của OpenAI và trang giá của Anthropic.

Gemini 4 Argon GPT-6 Astra Claude Opus 5.5 Claude Fable 5.1
Bạn có thể gọi nó ngay hôm nay không? Không, chỉ Fairwind Có Có Có
ID mô hình API Chưa công bố gpt-6-astra claude-opus-5-5 claude-fable-5-1
Đầu vào 2 đô la giới thiệu, sau đó 4 đô la 10 đô la 4 đô la 10 đô la
Đầu vào đã lưu vào bộ nhớ cache 0,10 đô la giới thiệu, sau đó 0,20 đô la 1 đô la 0,20 đô la 0,25 đô la
Đầu ra 10 đô la giới thiệu, sau đó 20 đô la 50 đô la 20 đô la 50 đô la
Đầu ra tối đa 1 triệu (giới hạn công bố của Google) 128 nghìn 128 nghìn (300 nghìn trên Batch, beta) 128 nghìn
Cửa sổ ngữ cảnh Chưa công bố 1.050.000 (đầu vào tối đa 922 nghìn) 1 triệu 1 triệu
Phụ phí cho câu lệnh dài Chưa nêu Trên 272 nghìn đầu vào: 2 lần đầu vào và bộ nhớ đệm, 1,5 lần đầu ra, trên toàn bộ yêu cầu Không có Không có

Ba điều nổi bật. Giá tiêu chuẩn của Argon khớp với Opus 5.5 về đầu vào, đầu vào đã lưu vào bộ nhớ cache và đầu ra, vì vậy lợi thế về giá của nó so với Anthropic chỉ kéo dài trong thời gian giới thiệu, và Google chưa công bố thời điểm kết thúc. Astra và Fable 5.1 có giá niêm yết gấp 2,5 lần tỷ lệ đầu vào và đầu ra tiêu chuẩn của Argon và gấp 5 lần tỷ lệ giới thiệu của nó. Và con số đầu ra 1 triệu là của Google: Vals AI liệt kê đầu ra tối đa 262 nghìn cho cấu hình Argon mà họ đã thử nghiệm. Để tính toán chi phí mỗi yêu cầu, hãy xem giá Gemini 4 Argon.

Mỗi mô hình dẫn đầu ở đâu trong bảng của Google

Trước khi nói về các con số: đây là bảng của Google. Điểm của Argon được Google báo cáo, một số tự tính toán và một số từ bảng xếp hạng; điểm của đối thủ cạnh tranh chủ yếu là số liệu của chính các nhà cung cấp hoặc kết quả bảng xếp hạng công khai, ở cài đặt lý luận tối đa nếu có. Các hệ thống thử nghiệm khác nhau, vì vậy hãy coi những khác biệt nhỏ là nhiễu.

Ai dẫn đầu Điểm chuẩn Argon Astra Fable 5.1 Opus 5.5
Argon: công việc tri thức Vals Index 68.9% 63.1% 65.8% 67.0%
Argon: công việc tri thức AutomationBench 51.3% 41.4% 31.4% 42.5%
Argon: công việc tri thức Harvey’s Legal Agent Benchmark 19.6% 5.4% 6.7% 3.8%
Argon: lập trình DeepSWE v1.1 77.9% 74.1% 67.4% 74.2%
Argon: ngữ cảnh dài GraphWalks 256K đến 1M (F1) 84.2% 71.8% 65.0% 66.8%
Argon: đa phương thức LVBench 91.7% 87.5% 79.7% 83.7%
Argon: đa phương thức Chartography 71.6% 71.0% 46.2% 66.3%
Astra FrontierSWE v2 55.0% 65.5% 56.3% 62.3%
Astra Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3%
Astra OSWorld-2.0 (ngoại tuyến, một phần) 69.2% 72.6% không báo cáo không báo cáo
Opus 5.5 Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4%
Opus 5.5 PostTrainBench 45.3% 44.3% 40.2% 49.3%
Hòa CWE-bench v1 68.0% 68.0% 58.0% 67.0%

Các chiến thắng tuyệt đối khác của Argon là Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks lên đến 128 nghìn và Agent’s Last Exam. Fable 5.1 không dẫn đầu hàng nào. Trên CWE-bench v1, bảng xếp hạng an ninh mạng của DeepMind cho thấy ba mô hình Argon, Astra và Grok 4.7 hòa nhau ở 68%, với Opus 5.5 ở 67%.

Về Gemini 4 Argon so với Fable 5.1, Argon đạt điểm cao hơn trên 15 trong số 17 hàng mà cả hai đều báo cáo; Fable chỉ vượt trội trên FrontierSWE v2 (56,3% so với 55,0%) và Terminal-bench 4.0 (57,9% so với 57,4%). Các con số của Anthropic có trong bài đăng điểm chuẩn Claude Fable 5.1 của chúng tôi, và bảng 19 hàng đầy đủ nằm trong điểm chuẩn Gemini 4 Argon.

Ba lưu ý trước khi bạn tin tưởng vào những khác biệt

Các con số của đối thủ cạnh tranh không phải là kết quả chạy của Google. Phương pháp luận của Google nói rằng kết quả cho các mô hình không phải Gemini "được lấy từ các con số tự báo cáo của nhà cung cấp trừ khi có ghi chú khác," và một số hàng đến từ các bảng xếp hạng công khai do Vals AI, Proximal và Surge thực hiện.

Các hệ thống thử nghiệm khác nhau. Trên DeepSWE v1.1, Google tự tính toán 77,9% của Argon bằng một hệ thống mini-swe-agent, trong khi điểm của Astra đến từ bảng xếp hạng công khai và điểm của Anthropic đến từ thẻ hệ thống. Trên LVBench, Gemini lấy mẫu video ở tốc độ 1 khung hình mỗi giây, trong khi Astra có 800 khung hình, Opus 5.5 600 và Fable 5.1 300, "do các hạn chế của API."

Cùng một mô hình nhưng cho ra các điểm số khác nhau trên các biểu đồ. Con số Terminal-bench 4.0 của Opus 5.5 khác nhau giữa các biểu đồ tùy thuộc vào hệ thống thử nghiệm và cài đặt nỗ lực; Anthropic báo cáo 66,4% của mình ở nỗ lực xhigh. Vì vậy, đừng bao giờ trộn lẫn các nguồn trong một bảng.

Đánh giá của các bên thứ ba nói gì

Các bảng xếp hạng độc lập thu hẹp khoảng cách. Artificial Analysis liệt kê Argon ở vị trí thứ 8 trong số 223, nhưng danh sách đó tính riêng từng cài đặt lý luận. Theo mô hình riêng biệt, Argon (53) hòa với GPT-6 Astra và Claude Fable 5.1 và đứng sau Claude Opus 5.5 (58 ở mức tối đa) và Claude Sonnet 5.5 (56). AA cũng liệt kê tỷ lệ ảo giác của Argon trên AA-Omniscience ở mức 15%, so với 51% của Astra ở cài đặt tối đa.

Trên Arena, Argon đứng đầu trong Văn bản ở mức 1525, được đánh dấu Sơ bộ trên 4.942 phiếu bầu, với Opus 5.5 đứng thứ tư. Vals AI xếp nó đứng đầu trong số 41 mô hình trên Vals Index, là mô hình Gemini đầu tiên đứng đầu.

Không phải ai trong Google cũng bị thuyết phục: Bloomberg đưa tin rằng một số nhân viên có quyền truy cập nói rằng Argon không ấn tượng trong một số công việc lập trình và thiết kế giao diện người dùng so với các điểm chuẩn của nó, một mô tả mà Google gọi là không chính xác.

Định tuyến đến mô hình nào

Không có mô hình tiên phong nào tốt nhất duy nhất vào năm 2026. Hãy định tuyến theo tác vụ và giữ cột Argon cho đến ngày nó ra mắt:

Tác vụ Định tuyến hôm nay Khi Argon ra mắt
Đặc vụ pháp lý, tài chính và tự động hóa văn phòng Opus 5.5 (67.0% Vals Index) Kiểm tra Argon: nó dẫn đầu cả bốn hàng công việc tri thức
Đặc vụ lập trình sử dụng nhiều terminal Opus 5.5 (66.4% Terminal-bench 4.0) Opus 5.5 vẫn dẫn đầu
Kỹ thuật phần mềm tác tử Astra (65.5% FrontierSWE v2) hoặc Opus 5.5 Argon dẫn đầu DeepSWE nhưng thua FrontierSWE; hãy thử cả hai
Đặc vụ sử dụng máy tính và GUI Astra (72.6% OSWorld-2.0) Astra dẫn đầu OSWorld; Argon dẫn đầu Agent’s Last Exam
Lý luận trên các câu lệnh hơn 256 nghìn token Opus 5.5 (không phụ phí) hoặc Astra (phụ phí trên 272 nghìn) Argon (84.2% GraphWalks 256K đến 1M)
Hiểu video và biểu đồ Astra (87.5% LVBench) Argon (91.7%), với lưu ý về số khung hình
Kỹ thuật khoa học và ML Astra (Terminal-Bench Science), Opus 5.5 (PostTrainBench) Argon dẫn đầu LABBench 2 và RiemannBench; hãy thử nó
Phản hồi đơn lẻ trên 128 nghìn token Opus 5.5 trên Batch (300K, beta) Argon, lên đến 1 triệu theo công bố của Google
Khối lượng lớn, công việc nhạy cảm về chi phí Opus 5.5 (4 đô la/20 đô la) Argon ở mức 2 đô la/10 đô la trong thời gian giới thiệu

Nếu giá quan trọng hơn điểm số cao nhất, so sánh GPT-6 Sol so với Claude Opus 5.5 của chúng tôi đề cập đến dòng Sol rẻ hơn của OpenAI so với Opus.

So sánh cả ba trên các câu lệnh của riêng bạn

Các bảng của nhà cung cấp không thể cho bạn biết mỗi mô hình xử lý các câu lệnh của bạn như thế nào. Một đánh giá nhỏ trong Apidog có thể làm được, và bạn có thể xây dựng nó ngay hôm nay.

  1. Tạo một dự án với ba yêu cầu: GPT-6 Astra, Claude Opus 5.5 và một yêu cầu Gemini có trường mô hình đọc {{GEMINI_MODEL}}, được đặt thành gemini-3.8-flash cho đến khi Google công bố ID của Argon. Hướng dẫn API GPT-6 Astra của chúng tôi và Claude Opus 5.5 là gì đề cập đến định dạng yêu cầu của từng nhà cung cấp.
  2. Lưu khóa API của mỗi nhà cung cấp dưới dạng biến môi trường và đặt câu lệnh vào một biến dùng chung để cả ba yêu cầu nhận được đầu vào giống hệt nhau.
  3. Thêm các xác nhận: trạng thái 200, một câu trả lời không trống, token đầu ra dưới một giới hạn và chi phí tính toán dưới ngân sách của bạn theo tỷ lệ công bố của mỗi nhà cung cấp.
  4. Chạy ba yêu cầu dưới dạng một kịch bản kiểm thử và so sánh kết quả của mỗi yêu cầu trong báo cáo kiểm thử.

Xác nhận chi phí là phép tính số học đơn giản. Đối với yêu cầu với 20.000 token đầu vào và 4.000 token đầu ra, Astra có giá 20.000 x 10 đô la/1 triệu + 4.000 x 50 đô la/1 triệu = 0,20 đô la + 0,20 đô la = 0,40 đô la. Opus 5.5 có giá 0,08 đô la + 0,08 đô la = 0,16 đô la. Argon sẽ có giá 0,08 đô la ở mức giới thiệu và 0,16 đô la ở mức tiêu chuẩn. Giá mỗi token không phải là chi phí mỗi tác vụ, tuy nhiên: Artificial Analysis đo lường Argon ở khoảng 62 nghìn token đầu ra mỗi tác vụ so với khoảng 27 nghìn cho Astra ở nỗ lực tối đa, vì vậy hãy đo token đầu ra trên các câu lệnh của riêng bạn.

Khi Argon ra mắt, hãy thay đổi GEMINI_MODEL, chạy lại kịch bản và bạn sẽ có một so sánh cùng câu lệnh với hai mô hình bạn có thể mua ngay bây giờ.

Câu hỏi thường gặp

Gemini 4 Argon có tốt hơn GPT-6 Astra không? Chúng hòa nhau ở mức 53 trên Artificial Analysis. Trong bảng của Google, Argon đạt điểm cao hơn trên hầu hết các hàng, nhưng Astra thắng FrontierSWE v2, Terminal-Bench Science 0.1 và OSWorld-2.0, và Astra là mô hình bạn có thể gọi ngay hôm nay.

Gemini 4 Argon so với Claude Opus 5.5: cái nào tốt hơn? Bảng của Google ưu ái Argon trên hầu hết các hàng; Opus 5.5 thắng Terminal-bench 4.0 và PostTrainBench và dẫn đầu Artificial Analysis từ 58 đến 53. Ở mức giá tiêu chuẩn, chúng có giá như nhau.

Gemini 4 Argon có rẻ hơn Claude Opus 5.5 không? Trong thời gian giới thiệu, nó rẻ bằng một nửa (2 đô la/10 đô la so với 4 đô la/20 đô la). Sau đó, giá niêm yết là giống hệt nhau, và Google chưa nói khi nào thời gian giới thiệu kết thúc.

Mô hình nào có giới hạn đầu ra lớn nhất? Argon, ở mức công bố 1 triệu token, mặc dù Vals AI liệt kê 262 nghìn cho cấu hình mà họ đã thử nghiệm. Các mô hình khác giới hạn đầu ra đồng bộ ở 128 nghìn. Hướng dẫn 1 triệu token đầu ra của chúng tôi đề cập đến ý nghĩa của điều đó đối với máy khách của bạn.

Tôi có thể sử dụng Gemini 4 Argon ngay hôm nay không? Chỉ thông qua Chương trình Fairwind của Google, dành cho một nhóm các đối tác phòng thủ an ninh mạng đã được kiểm duyệt. Khách hàng API trả phí và người đăng ký Google AI Ultra sẽ có sau, nhưng chưa có ngày cụ thể.

Chọn theo khối lượng công việc, sau đó kiểm tra

Argon có vẻ mạnh nhất trong công việc tri thức, ngữ cảnh dài và các hàng đa phương thức; Astra trên FrontierSWE, Terminal-Bench Science và OSWorld; Opus 5.5 trên công việc terminal và kỹ thuật ML, với mức giá mà Argon sẽ tính sau thời gian giới thiệu của nó. Hãy xây dựng trên hai mô hình bạn có thể mua ngay bây giờ, giữ mô hình Gemini trong một biến và chạy lại kịch bản của bạn vào ngày Argon mở. Để thiết lập so sánh ba yêu cầu trong một dự án, hãy tải Apidog.

nút

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API