Gemini 3.8 Flash có sẵn ngay hôm nay: một mô hình ổn định với gói miễn phí, có giá $0.75 cho đầu vào và $3.75 cho đầu ra trên mỗi 1 triệu token đến hết ngày 31 tháng 12 năm 2026, sau đó là $1.50 và $7.50, với giới hạn đầu ra 64K. Gemini 4 Argon thì chưa. Bài đăng ra mắt của Google định giá nó ở mức $2 và $10 trong thời gian giới thiệu không xác định, sau đó là $4 và $20. Google cho biết giới hạn đầu ra của nó là 1 triệu token và hôm nay nó chỉ có sẵn cho những người bảo vệ Chương trình Fairwind. Nếu bạn cần triển khai trong quý này, hãy triển khai trên Flash và giữ Argon ở trạng thái chỉ cần một thay đổi cấu hình.
Bài đăng này so sánh hai mô hình về thông số kỹ thuật, các hàng điểm chuẩn mà cả hai bài đăng ra mắt đều chia sẻ, điểm số cyber và chi phí cho một cuộc gọi giống hệt nhau, sau đó đưa ra quy tắc quyết định cho bạn. Để biết thêm thông tin cơ bản, hãy xem Gemini 4 Argon là gì và Gemini 3.8 Flash là gì. Phần cuối cùng cho thấy thiết lập Apidog giúp việc chuyển đổi chỉ là một biến số duy nhất.
So sánh trực tiếp: những gì bạn có thể sử dụng ngay hôm nay
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| Khả dụng | Ổn định trên Gemini API, AI Studio, Antigravity và Gemini Enterprise | Một tập hợp con các đối tác Chương trình Fairwind, dưới dạng mô hình được quản lý trên Gemini Enterprise |
| ID mô hình | gemini-3.8-flash |
Chưa công bố |
| Giá mỗi 1 triệu token (đầu vào / đầu ra) | $0.75 / $3.75 đến 31-12-2026, sau đó $1.50 / $7.50 | $2 / $10 giới thiệu (không nêu ngày kết thúc), sau đó $4 / $20 |
| Đầu vào được lưu vào bộ nhớ cache mỗi 1 triệu | $0.075, sau đó $0.15 | $0.10 giới thiệu, sau đó $0.20 (giảm 95% đầu vào) |
| Giới hạn đầu ra | 65.536 token | 1 triệu token (giới hạn được Google công bố) |
| Cửa sổ đầu vào | 1.048.576 token | Chưa công bố |
| Cấp độ tư duy | low, medium (mặc định), high; minimal trả về HTTP 400 |
Chưa được ghi lại |
| Gói API miễn phí | Có, bị giới hạn tốc độ | Chưa có thông báo nào |
| Truy cập của người tiêu dùng | Ứng dụng Gemini trên AI Pro và Ultra, Chế độ AI trong Tìm kiếm | Chưa; người đăng ký AI Ultra nằm trong đợt đầu tiên, chưa có ngày cụ thể |
Một vài ô cần ngữ cảnh. Google chưa công bố cửa sổ đầu vào của Argon, mặc dù đánh giá ngữ cảnh dài của riêng nó đã sử dụng các lời nhắc lên đến 1 triệu token. Google nói rằng giới hạn đầu ra của Argon là 1 triệu token; ít nhất một công cụ đánh giá bên thứ ba, Vals AI, liệt kê đầu ra tối đa 262K cho cấu hình mà họ đã thử nghiệm. Các đánh giá của Argon được chạy với "thiết lập tư duy cao nhất", vì vậy một cấp độ cao có thể tồn tại, nhưng Google chưa đặt tên cho các cấp độ hoặc cấp độ mặc định. Các cấp độ của Flash có trong tài liệu tư duy của Google và trong hướng dẫn cấp độ tư duy Gemini 3.8 Flash của chúng tôi.
Gói miễn phí của Flash bị giới hạn tốc độ, và Google nói rằng dữ liệu gói miễn phí "được sử dụng để cải thiện sản phẩm của chúng tôi." Google chưa công bố bất kỳ cách miễn phí nào để sử dụng Argon; phần giải thích về quyền truy cập miễn phí Argon của chúng tôi đề cập đến những gì bạn có thể sử dụng thay thế.
Các hàng điểm chuẩn mà cả hai bài đăng ra mắt đều chia sẻ dưới dạng văn bản
Các bảng ra mắt của Google cho hai mô hình chia sẻ hai hàng dưới dạng văn bản. Đây là các số liệu do Google báo cáo, và phương pháp luận của Argon gán cả hai hàng cho Vals AI.
| Điểm chuẩn | Gemini 3.8 Flash (bảng ngày 2 tháng 9) | Gemini 4 Argon (bảng ngày 30 tháng 9) |
|---|---|---|
| Vals Finance Agent v2 | 61.4% | 65.4% |
| Điểm chuẩn Đại lý Pháp lý Harvey | 10.0% | 19.6% |
Google đã công bố các bảng này cách nhau một tháng, với các bộ đối thủ khác nhau, vì vậy hãy xem khoảng cách đó là định hướng hơn là một thử nghiệm được kiểm soát. Ngay cả như vậy, hàng pháp lý vẫn nổi bật: 19.6% của Argon gần gấp đôi 10.0% của Flash. Khoảng cách tài chính là 4 điểm.
Mọi thứ khác trong bảng của Argon không có đối tác 3.8 Flash tương ứng trong văn bản. Bảng Gemini 3.8 Flash của Google đã báo cáo HLE-Verified, điều mà bảng của Argon không có, và điểm DeepSWE của Flash chỉ xuất hiện trong hình ảnh thẻ mô hình. Trên bảng xếp hạng Text của Arena, một xếp hạng của bên thứ ba, Argon (Cao) đứng ở vị trí số 1 trong các phiếu bầu sơ bộ, trong khi Gemini 3.8 Flash (Cao) đứng ở vị trí số 11. Bảng Argon đầy đủ 19 hàng, với ai đã đo lường từng hàng, có trong phân tích điểm chuẩn Argon của chúng tôi.
Cyber: Argon so với 3.8 Flash Cyber
Trang cyber của DeepMind so sánh Argon với Gemini 3.8 Flash Cyber, phiên bản cyber của Flash được kiểm soát bởi Fairwind:
| Đánh giá Cyber | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| Phát hiện lỗ hổng thực tế | 85.8% | 71.0% |
| Điểm chuẩn Kiểm tra Xâm nhập Wiz | 70.9% | 58.2% |
Cả hai mô hình đều bị kiểm soát. Gemini 3.8 Flash Cyber có sẵn chung (GA) sau danh sách cho phép trên Gemini Enterprise Agent Platform, và Argon chỉ dành cho Fairwind. Nếu bạn không phải là đối tác Fairwind, cả hai con số này đều không thay đổi những gì bạn có thể sử dụng hôm nay. Mô hình 3.8 Flash chung là mô hình bạn có thể xây dựng trên đó.
Chi phí cho cùng một cuộc gọi trên cả hai
Lấy một cuộc gọi với 100.000 token đầu vào và 8.000 token đầu ra. Các mô hình Gemini hiện tại, bao gồm 3.8 Flash, tính token tư duy là đầu ra, vì vậy 8.000 token bao gồm chúng. Google chưa cho biết Argon tính chúng như thế nào; các hàng của Argon giả định nó tuân theo các mô hình Gemini hiện tại.
| Mô hình và giai đoạn | Chi phí đầu vào | Chi phí đầu ra | Tổng cộng mỗi cuộc gọi |
|---|---|---|---|
| 3.8 Flash, giới thiệu | 0.1M x $0.75 = $0.075 | 0.008M x $3.75 = $0.030 | $0.105 |
| 3.8 Flash, từ 01-01-2027 | 0.1M x $1.50 = $0.150 | 0.008M x $7.50 = $0.060 | $0.210 |
| Argon, giới thiệu | 0.1M x $2 = $0.200 | 0.008M x $10 = $0.080 | $0.280 |
| Argon, tiêu chuẩn | 0.1M x $4 = $0.400 | 0.008M x $20 = $0.160 | $0.560 |
Tỷ lệ mỗi token của Argon gấp 8/3 (khoảng 2.67 lần) so với Flash, cả về giá giới thiệu và giá tiêu chuẩn. Với 1.000 cuộc gọi như vậy mỗi ngày, đó là $105 mỗi ngày trên Flash so với $280 trên Argon theo tỷ lệ giới thiệu.
Ba điều phá vỡ tỷ lệ gọn gàng:
- Số lượng token sẽ không khớp. Cùng một lời nhắc tạo ra số lượng token đầu ra và token tư duy khác nhau trên các mô hình khác nhau. Các đánh giá được công bố của Argon được chạy ở cài đặt tư duy cao nhất, và trên 3.8 Flash Google cảnh báo rằng các cấp độ nỗ lực cao hơn có thể sử dụng nhiều token hơn.
- Đầu ra dài làm thay đổi phép tính. Một câu trả lời 200.000 token không vừa trong giới hạn 65.536 token của Flash, vì vậy bạn sẽ phải chia nó thành nhiều cuộc gọi. Theo giới hạn được công bố của Argon, đó là một phản hồi: 0.2M x $10 = $2.00 với giá giới thiệu, hoặc $4.00 với giá tiêu chuẩn. Một câu trả lời đầy đủ 1 triệu token có giá $10 giới thiệu hoặc $20 tiêu chuẩn.
- Chỉ có một ngày kết thúc giới thiệu được biết. Giá giới thiệu của Flash kết thúc vào ngày 31 tháng 12 năm 2026. Google chưa cho biết khi nào giá giới thiệu của Argon kết thúc.
Flash cũng có Batch với mức giảm giá 50% ($0.375 và $1.875 đến hết ngày 31 tháng 12), theo trang giá Gemini API. Google chưa công bố giá Batch cho Argon. Hướng dẫn định giá Argon và hướng dẫn định giá 3.8 Flash của chúng tôi đi sâu hơn.
Bạn nên chờ Argon hay triển khai trên Flash?
Triển khai trên 3.8 Flash ngay bây giờ khi
- Bạn bị ràng buộc về chi phí. Flash có giá bằng 3/8 so với Argon mỗi token, và Batch giảm một nửa số đó.
- Bạn chạy với khối lượng lớn. Phân loại, trích xuất, định tuyến và trò chuyện ở quy mô lớn sẽ tăng lên nhanh chóng với $10 cho mỗi 1 triệu token đầu ra.
- Bạn cần nó ngay hôm nay. Flash có ID mô hình ổn định, gói miễn phí để tạo nguyên mẫu và lịch giá đã công bố.
- Các phản hồi của bạn nằm trong 65.536 token. Hầu hết các khối lượng công việc API đều như vậy.
Lập kế hoạch cho Argon khi
- Công việc có tầm nhìn dài hạn. Google nói rằng Argon được "xây dựng để duy trì lý luận sâu sắc trong các quy trình làm việc phức tạp, dài hạn."
- Bạn cần đầu ra vượt quá 64K. Viết lại toàn bộ mô-đun, báo cáo dài và di chuyển lớn là trường hợp cần giới hạn đầu ra 1 triệu.
- Bạn chạy các tác nhân pháp lý hoặc tài chính. Đó là hai hàng mà Google đã công bố cả hai mô hình, và Argon dẫn đầu cả hai.
- Bạn là người bảo vệ đủ điều kiện tham gia Fairwind. Argon là mô hình mà chương trình hiện đang dẫn đầu.
Bạn không phải chọn một lần. Định tuyến phần lớn lưu lượng truy cập đến Flash và gửi phần khó đến Argon khi nó được phát hành, với cả hai đều nằm sau cùng một cấu hình.
Một yêu cầu đã lưu, hai mô hình
Đây là mẫu. Giữ tên mô hình trong một biến môi trường, chạy các yêu cầu thực của bạn đối với 3.8 Flash ngay bây giờ, và hoán đổi biến đó vào ngày ID mô hình của Argon được phát hành. Google chưa công bố ID đó, vì vậy đừng đoán một cái nào.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize this contract clause in 3 bullets."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"medium"},"maxOutputTokens":8192}}'
Mọi phản hồi generateContent đều kết thúc bằng usageMetadata. Trong Apidog, lưu trữ GEMINI_API_KEY và GEMINI_MODEL trong một môi trường, lưu yêu cầu này và thêm các xác nhận: trạng thái 200, các trường mà ứng dụng của bạn đọc, và một giới hạn trên usageMetadata.thoughtsTokenCount được điều chỉnh theo giới hạn chi phí của bạn. Giữ maxOutputTokens được đặt để một câu trả lời dài không thể vượt quá ngân sách của bạn. Thêm nó vào một kịch bản kiểm tra, chạy nó trên Flash và giữ báo cáo làm cơ sở.
Hai cảnh báo cho ngày ra mắt. Google nói "tất cả các mô hình mới" sẽ ra mắt trên Interactions API và chưa nói liệu Argon có hỗ trợ generateContent hay không, vì vậy hãy lưu một phiên bản Interactions (POST https://generativelanguage.googleapis.com/v1beta/interactions với generation_config.thinking_level) bên cạnh cái này. Và tên cấp độ tư duy của Argon chưa được ghi lại, vì vậy medium có thể không được chuyển sang. Khi Argon ra mắt, hãy thay đổi một biến, chạy lại và so sánh đầu ra và usageMetadata cạnh nhau.
Câu hỏi thường gặp
Gemini 4 Argon có tốt hơn Gemini 3.8 Flash không? Trên hai hàng mà cả hai bảng ra mắt đều chia sẻ dưới dạng văn bản, có: 65.4% so với 61.4% trên Vals Finance Agent v2 và 19.6% so với 10.0% trên Điểm chuẩn Đại lý Pháp lý Harvey. Nó cũng có giá cao gấp khoảng 2.67 lần mỗi token, và bạn chưa thể sử dụng nó.
Tôi có nên chờ Gemini 4 Argon không? Không nếu bạn cần triển khai. Google chưa đưa ra ngày phát hành nào, chỉ nói "sớm nhất có thể", bắt đầu với khách hàng API trả phí và người đăng ký AI Ultra.
Gemini 3.8 Flash hay Argon cho một dự án mới? Bắt đầu với 3.8 Flash với mô hình trong một biến. Di chuyển các yêu cầu cần đầu ra dài hoặc chuyên sâu về pháp lý và tài chính sang Argon sau khi bạn đã thử nghiệm nó với các lời nhắc của riêng mình.
Có cách nào miễn phí để sử dụng Argon không? Không. Google chưa công bố gói miễn phí; xem phần giải thích quyền truy cập miễn phí Argon của chúng tôi để biết các mô hình Gemini miễn phí bạn có thể sử dụng hôm nay.
Argon có thay thế Gemini 3.8 Flash không? Google chưa nói. Google gọi Argon là mô hình tiên phong mới của họ, và Reuters báo cáo nó lớn hơn dòng Pro trước đó, vì vậy nó là một cấp độ khác so với Flash.
Bước tiếp theo
Thiết lập yêu cầu ngay hôm nay, chạy nó trên 3.8 Flash và lưu báo cáo. Khi Argon được phát hành, bạn sẽ biết trong vòng vài phút liệu nó có xứng đáng với giá của nó đối với lưu lượng truy cập của bạn hay không. Tải xuống Apidog để xây dựng so sánh.
