So sánh Gemini 4 Argon và Gemini 3.8 Flash: Nên chờ Argon hay dùng Flash ngay bây giờ?

Gemini 4 Argon và Gemini 3.8 Flash: giá, giới hạn đầu ra, các điểm chuẩn chung và chi phí cho một lần gọi. Triển khai trên Flash ngay bây giờ hay đợi Argon?

Medy Evrard

2 tháng 10 2026

So sánh Gemini 4 Argon và Gemini 3.8 Flash: Nên chờ Argon hay dùng Flash ngay bây giờ?

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Gemini 3.8 Flash có sẵn ngay hôm nay: một mô hình ổn định với gói miễn phí, có giá $0.75 cho đầu vào và $3.75 cho đầu ra trên mỗi 1 triệu token đến hết ngày 31 tháng 12 năm 2026, sau đó là $1.50 và $7.50, với giới hạn đầu ra 64K. Gemini 4 Argon thì chưa. Bài đăng ra mắt của Google định giá nó ở mức $2 và $10 trong thời gian giới thiệu không xác định, sau đó là $4 và $20. Google cho biết giới hạn đầu ra của nó là 1 triệu token và hôm nay nó chỉ có sẵn cho những người bảo vệ Chương trình Fairwind. Nếu bạn cần triển khai trong quý này, hãy triển khai trên Flash và giữ Argon ở trạng thái chỉ cần một thay đổi cấu hình.

Bài đăng này so sánh hai mô hình về thông số kỹ thuật, các hàng điểm chuẩn mà cả hai bài đăng ra mắt đều chia sẻ, điểm số cyber và chi phí cho một cuộc gọi giống hệt nhau, sau đó đưa ra quy tắc quyết định cho bạn. Để biết thêm thông tin cơ bản, hãy xem Gemini 4 Argon là gì và Gemini 3.8 Flash là gì. Phần cuối cùng cho thấy thiết lập Apidog giúp việc chuyển đổi chỉ là một biến số duy nhất.

nút

So sánh trực tiếp: những gì bạn có thể sử dụng ngay hôm nay

Gemini 3.8 Flash Gemini 4 Argon
Khả dụng Ổn định trên Gemini API, AI Studio, Antigravity và Gemini Enterprise Một tập hợp con các đối tác Chương trình Fairwind, dưới dạng mô hình được quản lý trên Gemini Enterprise
ID mô hình gemini-3.8-flash Chưa công bố
Giá mỗi 1 triệu token (đầu vào / đầu ra) $0.75 / $3.75 đến 31-12-2026, sau đó $1.50 / $7.50 $2 / $10 giới thiệu (không nêu ngày kết thúc), sau đó $4 / $20
Đầu vào được lưu vào bộ nhớ cache mỗi 1 triệu $0.075, sau đó $0.15 $0.10 giới thiệu, sau đó $0.20 (giảm 95% đầu vào)
Giới hạn đầu ra 65.536 token 1 triệu token (giới hạn được Google công bố)
Cửa sổ đầu vào 1.048.576 token Chưa công bố
Cấp độ tư duy low, medium (mặc định), high; minimal trả về HTTP 400 Chưa được ghi lại
Gói API miễn phí Có, bị giới hạn tốc độ Chưa có thông báo nào
Truy cập của người tiêu dùng Ứng dụng Gemini trên AI Pro và Ultra, Chế độ AI trong Tìm kiếm Chưa; người đăng ký AI Ultra nằm trong đợt đầu tiên, chưa có ngày cụ thể

Một vài ô cần ngữ cảnh. Google chưa công bố cửa sổ đầu vào của Argon, mặc dù đánh giá ngữ cảnh dài của riêng nó đã sử dụng các lời nhắc lên đến 1 triệu token. Google nói rằng giới hạn đầu ra của Argon là 1 triệu token; ít nhất một công cụ đánh giá bên thứ ba, Vals AI, liệt kê đầu ra tối đa 262K cho cấu hình mà họ đã thử nghiệm. Các đánh giá của Argon được chạy với "thiết lập tư duy cao nhất", vì vậy một cấp độ cao có thể tồn tại, nhưng Google chưa đặt tên cho các cấp độ hoặc cấp độ mặc định. Các cấp độ của Flash có trong tài liệu tư duy của Google và trong hướng dẫn cấp độ tư duy Gemini 3.8 Flash của chúng tôi.

Gói miễn phí của Flash bị giới hạn tốc độ, và Google nói rằng dữ liệu gói miễn phí "được sử dụng để cải thiện sản phẩm của chúng tôi." Google chưa công bố bất kỳ cách miễn phí nào để sử dụng Argon; phần giải thích về quyền truy cập miễn phí Argon của chúng tôi đề cập đến những gì bạn có thể sử dụng thay thế.

Các hàng điểm chuẩn mà cả hai bài đăng ra mắt đều chia sẻ dưới dạng văn bản

Các bảng ra mắt của Google cho hai mô hình chia sẻ hai hàng dưới dạng văn bản. Đây là các số liệu do Google báo cáo, và phương pháp luận của Argon gán cả hai hàng cho Vals AI.

Điểm chuẩn Gemini 3.8 Flash (bảng ngày 2 tháng 9) Gemini 4 Argon (bảng ngày 30 tháng 9)
Vals Finance Agent v2 61.4% 65.4%
Điểm chuẩn Đại lý Pháp lý Harvey 10.0% 19.6%

Google đã công bố các bảng này cách nhau một tháng, với các bộ đối thủ khác nhau, vì vậy hãy xem khoảng cách đó là định hướng hơn là một thử nghiệm được kiểm soát. Ngay cả như vậy, hàng pháp lý vẫn nổi bật: 19.6% của Argon gần gấp đôi 10.0% của Flash. Khoảng cách tài chính là 4 điểm.

Mọi thứ khác trong bảng của Argon không có đối tác 3.8 Flash tương ứng trong văn bản. Bảng Gemini 3.8 Flash của Google đã báo cáo HLE-Verified, điều mà bảng của Argon không có, và điểm DeepSWE của Flash chỉ xuất hiện trong hình ảnh thẻ mô hình. Trên bảng xếp hạng Text của Arena, một xếp hạng của bên thứ ba, Argon (Cao) đứng ở vị trí số 1 trong các phiếu bầu sơ bộ, trong khi Gemini 3.8 Flash (Cao) đứng ở vị trí số 11. Bảng Argon đầy đủ 19 hàng, với ai đã đo lường từng hàng, có trong phân tích điểm chuẩn Argon của chúng tôi.

Cyber: Argon so với 3.8 Flash Cyber

Trang cyber của DeepMind so sánh Argon với Gemini 3.8 Flash Cyber, phiên bản cyber của Flash được kiểm soát bởi Fairwind:

Đánh giá Cyber Gemini 4 Argon Gemini 3.8 Flash Cyber
Phát hiện lỗ hổng thực tế 85.8% 71.0%
Điểm chuẩn Kiểm tra Xâm nhập Wiz 70.9% 58.2%

Cả hai mô hình đều bị kiểm soát. Gemini 3.8 Flash Cyber có sẵn chung (GA) sau danh sách cho phép trên Gemini Enterprise Agent Platform, và Argon chỉ dành cho Fairwind. Nếu bạn không phải là đối tác Fairwind, cả hai con số này đều không thay đổi những gì bạn có thể sử dụng hôm nay. Mô hình 3.8 Flash chung là mô hình bạn có thể xây dựng trên đó.

Chi phí cho cùng một cuộc gọi trên cả hai

Lấy một cuộc gọi với 100.000 token đầu vào và 8.000 token đầu ra. Các mô hình Gemini hiện tại, bao gồm 3.8 Flash, tính token tư duy là đầu ra, vì vậy 8.000 token bao gồm chúng. Google chưa cho biết Argon tính chúng như thế nào; các hàng của Argon giả định nó tuân theo các mô hình Gemini hiện tại.

Mô hình và giai đoạn Chi phí đầu vào Chi phí đầu ra Tổng cộng mỗi cuộc gọi
3.8 Flash, giới thiệu 0.1M x $0.75 = $0.075 0.008M x $3.75 = $0.030 $0.105
3.8 Flash, từ 01-01-2027 0.1M x $1.50 = $0.150 0.008M x $7.50 = $0.060 $0.210
Argon, giới thiệu 0.1M x $2 = $0.200 0.008M x $10 = $0.080 $0.280
Argon, tiêu chuẩn 0.1M x $4 = $0.400 0.008M x $20 = $0.160 $0.560

Tỷ lệ mỗi token của Argon gấp 8/3 (khoảng 2.67 lần) so với Flash, cả về giá giới thiệu và giá tiêu chuẩn. Với 1.000 cuộc gọi như vậy mỗi ngày, đó là $105 mỗi ngày trên Flash so với $280 trên Argon theo tỷ lệ giới thiệu.

Ba điều phá vỡ tỷ lệ gọn gàng:

Flash cũng có Batch với mức giảm giá 50% ($0.375 và $1.875 đến hết ngày 31 tháng 12), theo trang giá Gemini API. Google chưa công bố giá Batch cho Argon. Hướng dẫn định giá Argon và hướng dẫn định giá 3.8 Flash của chúng tôi đi sâu hơn.

Bạn nên chờ Argon hay triển khai trên Flash?

Triển khai trên 3.8 Flash ngay bây giờ khi

Lập kế hoạch cho Argon khi

Bạn không phải chọn một lần. Định tuyến phần lớn lưu lượng truy cập đến Flash và gửi phần khó đến Argon khi nó được phát hành, với cả hai đều nằm sau cùng một cấu hình.

Một yêu cầu đã lưu, hai mô hình

Đây là mẫu. Giữ tên mô hình trong một biến môi trường, chạy các yêu cầu thực của bạn đối với 3.8 Flash ngay bây giờ, và hoán đổi biến đó vào ngày ID mô hình của Argon được phát hành. Google chưa công bố ID đó, vì vậy đừng đoán một cái nào.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"

curl -s -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Summarize this contract clause in 3 bullets."}]}],
       "generationConfig":{"thinkingConfig":{"thinkingLevel":"medium"},"maxOutputTokens":8192}}'

Mọi phản hồi generateContent đều kết thúc bằng usageMetadata. Trong Apidog, lưu trữ GEMINI_API_KEY và GEMINI_MODEL trong một môi trường, lưu yêu cầu này và thêm các xác nhận: trạng thái 200, các trường mà ứng dụng của bạn đọc, và một giới hạn trên usageMetadata.thoughtsTokenCount được điều chỉnh theo giới hạn chi phí của bạn. Giữ maxOutputTokens được đặt để một câu trả lời dài không thể vượt quá ngân sách của bạn. Thêm nó vào một kịch bản kiểm tra, chạy nó trên Flash và giữ báo cáo làm cơ sở.

Hai cảnh báo cho ngày ra mắt. Google nói "tất cả các mô hình mới" sẽ ra mắt trên Interactions API và chưa nói liệu Argon có hỗ trợ generateContent hay không, vì vậy hãy lưu một phiên bản Interactions (POST https://generativelanguage.googleapis.com/v1beta/interactions với generation_config.thinking_level) bên cạnh cái này. Và tên cấp độ tư duy của Argon chưa được ghi lại, vì vậy medium có thể không được chuyển sang. Khi Argon ra mắt, hãy thay đổi một biến, chạy lại và so sánh đầu ra và usageMetadata cạnh nhau.

Câu hỏi thường gặp

Gemini 4 Argon có tốt hơn Gemini 3.8 Flash không? Trên hai hàng mà cả hai bảng ra mắt đều chia sẻ dưới dạng văn bản, có: 65.4% so với 61.4% trên Vals Finance Agent v2 và 19.6% so với 10.0% trên Điểm chuẩn Đại lý Pháp lý Harvey. Nó cũng có giá cao gấp khoảng 2.67 lần mỗi token, và bạn chưa thể sử dụng nó.

Tôi có nên chờ Gemini 4 Argon không? Không nếu bạn cần triển khai. Google chưa đưa ra ngày phát hành nào, chỉ nói "sớm nhất có thể", bắt đầu với khách hàng API trả phí và người đăng ký AI Ultra.

Gemini 3.8 Flash hay Argon cho một dự án mới? Bắt đầu với 3.8 Flash với mô hình trong một biến. Di chuyển các yêu cầu cần đầu ra dài hoặc chuyên sâu về pháp lý và tài chính sang Argon sau khi bạn đã thử nghiệm nó với các lời nhắc của riêng mình.

Có cách nào miễn phí để sử dụng Argon không? Không. Google chưa công bố gói miễn phí; xem phần giải thích quyền truy cập miễn phí Argon của chúng tôi để biết các mô hình Gemini miễn phí bạn có thể sử dụng hôm nay.

Argon có thay thế Gemini 3.8 Flash không? Google chưa nói. Google gọi Argon là mô hình tiên phong mới của họ, và Reuters báo cáo nó lớn hơn dòng Pro trước đó, vì vậy nó là một cấp độ khác so với Flash.

Bước tiếp theo

Thiết lập yêu cầu ngay hôm nay, chạy nó trên 3.8 Flash và lưu báo cáo. Khi Argon được phát hành, bạn sẽ biết trong vòng vài phút liệu nó có xứng đáng với giá của nó đối với lưu lượng truy cập của bạn hay không. Tải xuống Apidog để xây dựng so sánh.

nút

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API