Gemini 4 Argon có giá 2 đô la cho 1 triệu token đầu vào và 10 đô la cho 1 triệu token đầu ra trong giai đoạn giới thiệu, sau đó là 4 đô la và 20 đô la. Đầu vào được lưu trữ giảm giá 95% so với giá đầu vào, tương đương 0,10 đô la cho 1 triệu token với mức giá giới thiệu và 0,20 đô la sau đó. Google chưa cho biết thời gian giai đoạn giới thiệu kéo dài bao lâu, và bạn chưa thể mua Argon: nó đã được công bố nhưng chưa có sẵn rộng rãi, và hôm nay nó chỉ được triển khai cho các chuyên gia an ninh mạng thuộc Chương trình Fairwind.
Bài đăng này chuyển bảng giá đó thành các con số ngân sách: so sánh với bảy mô hình hiện tại, bốn kịch bản đã thực hiện, chi phí bên thứ ba cho mỗi tác vụ và các kiểm soát chi phí cần thiết lập ngay bây giờ. Đối với chính mô hình, hãy bắt đầu với Gemini 4 Argon là gì; để truy cập, hãy xem Gemini 4 Argon có miễn phí không. Bạn có thể xây dựng các khẳng định chi phí trong Apidog đối với một mô hình bạn có thể gọi ngay hôm nay và thay đổi tên mô hình sau.

Bảng giá
Google đã công bố giá trong bài đăng ra mắt Gemini 4 Argon, với mức giá sau giai đoạn giới thiệu trong chú thích 1: “Sau khi giai đoạn giới thiệu kết thúc, mức giá 4 đô la cho 1 triệu token đầu vào và 20 đô la cho 1 triệu token đầu ra sẽ được áp dụng.”
| Gemini 4 Argon, mỗi 1 triệu token | Giới thiệu | Tiêu chuẩn (sau giới thiệu) |
|---|---|---|
| Đầu vào | 2,00 đô la | 4,00 đô la |
| Đầu vào được lưu trữ (giảm 95% giá đầu vào) | 0,10 đô la | 0,20 đô la |
| Đầu ra | 10,00 đô la | 20,00 đô la |
| Đầu ra tối đa mỗi phản hồi (Google) | 1 triệu token | 1 triệu token |
| Chi phí của một đầu ra 1 triệu token đầy đủ | 10,00 đô la | 20,00 đô la |
Các mức giá được lưu trữ là kết quả tính toán từ quy tắc 95% của Google (2 đô la x 0,05 và 4 đô la x 0,05). Google chưa công bố cửa sổ ngữ cảnh đầu vào hoặc ID mô hình. Họ cho biết giới hạn đầu ra là 1 triệu token, “tăng từ 64K token trước đây”; ít nhất một nhà đánh giá bên thứ ba, Vals AI, liệt kê đầu ra tối đa là 262K cho cấu hình mà họ đã thử nghiệm.
Argon so với các mô hình tiên tiến và Gemini hiện tại
Tất cả các mức giá đều tính trên mỗi 1 triệu token.
| Mô hình | Đầu vào | Đầu vào được lưu trữ | Đầu ra | Đầu ra tối đa |
|---|---|---|---|---|
| Gemini 4 Argon (giới thiệu) | 2 đô la | 0,10 đô la | 10 đô la | 1 triệu |
| Gemini 4 Argon (tiêu chuẩn) | 4 đô la | 0,20 đô la | 20 đô la | 1 triệu |
| GPT-6 Astra | 10 đô la | 1 đô la | 50 đô la | 128.000 |
| Claude Opus 5.5 | 4 đô la | 0,20 đô la | 20 đô la | 128K (300K trên Batch, beta) |
| Claude Sonnet 5.5 | 2 đô la | 0,20 đô la | 10 đô la | 128K (300K trên Batch, beta) |
| GPT-6.1 Sol | 2 đô la | 0,10 đô la | 10 đô la | 128.000 |
| Claude Fable 5.1 | 10 đô la | 0,25 đô la | 50 đô la | 128K |
| gemini-3.1-pro-preview (lời nhắc <=200K / >200K) | 2 đô la / 4 đô la | 0,20 đô la / 0,40 đô la | 12 đô la / 18 đô la | 65.536 |
| gemini-3.8-flash (giới thiệu / từ 2027-01-01) | 0,75 đô la / 1,50 đô la | 0,075 đô la / 0,15 đô la | 3,75 đô la / 7,50 đô la | 65.536 |
Giá của các đối thủ cạnh tranh lấy từ các trang riêng của nhà cung cấp: trang GPT-6 Astra của OpenAI, trang giá của Anthropic, và trang giá API Gemini của Google.
- Argon tiêu chuẩn = Claude Opus 5.5. Cùng mức 4 đô la/20 đô la, cùng 0,20 đô la đầu vào được lưu trữ.
- Argon giới thiệu = Claude Sonnet 5.5 và GPT-6.1 Sol. Cùng mức 2 đô la/10 đô la; mức giá 0,10 đô la đầu vào được lưu trữ trong giai đoạn giới thiệu khớp với GPT-6.1 Sol.
- GPT-6 Astra và Claude Fable 5.1 có giá gấp 5 lần Argon giới thiệu và 2,5 lần Argon tiêu chuẩn. Xem giá Claude Fable 5.1.
- Đầu ra giới thiệu của Argon (10 đô la) thấp hơn gemini-3.1-pro-preview (12 đô la), mô hình Pro hàng đầu trước đây của Google.
- Lời nhắc dài thay đổi phép tính. OpenAI tính phí các lời nhắc trên 272K token đầu vào với mức 2x đầu vào và bộ nhớ đệm, và 1.5x đầu ra cho toàn bộ yêu cầu. Gemini 3.1 Pro tính phí cao hơn khi trên 200K; Anthropic thì không. Google chưa cho biết liệu Argon có một cấp độ lời nhắc dài hay không.
Để biết khả năng cùng với giá, hãy xem Gemini 4 Argon so với GPT-6 Astra so với Claude Opus 5.5.
Token suy nghĩ được tính phí như đầu ra
Trên các mô hình Gemini hiện tại, token suy nghĩ được tính phí như đầu ra: tài liệu về suy nghĩ của Google nói rằng “giá phản hồi là tổng của token đầu ra và token suy nghĩ.” Google chưa tài liệu hóa Argon cụ thể, nhưng hãy tính đến cùng quy tắc này. Google đã chạy các đánh giá của Argon “với các cài đặt suy nghĩ cao nhất,” vì vậy hãy hiểu “10 đô la cho 1 triệu token đầu ra” là câu trả lời cộng với lý do.
Bốn kịch bản đã thực hiện
Mỗi con số dưới đây là số token chia cho 1 triệu, nhân với tỷ lệ trên mỗi 1 triệu. Các kịch bản từ 1 đến 3 giả định không có bộ nhớ đệm.
1. Một cuộc gọi API điển hình: 20K đầu vào, 5K đầu ra
- Giới thiệu: 20.000 / 1M x 2 đô la = 0,04 đô la đầu vào, cộng với 5.000 / 1M x 10 đô la = 0,05 đô la đầu ra. Tổng cộng 0,09 đô la.
- Tiêu chuẩn: 0,08 đô la + 0,10 đô la = 0,18 đô la.
Với 1.000 cuộc gọi mỗi ngày, chi phí là 90 đô la (giới thiệu) hoặc 180 đô la (tiêu chuẩn). Cuộc gọi tương tự tốn 0,18 đô la trên Claude Opus 5.5, 0,45 đô la trên GPT-6 Astra (0,20 đô la + 0,25 đô la), 0,10 đô la trên gemini-3.1-pro-preview (0,04 đô la + 0,06 đô la), và khoảng 0,034 đô la trên gemini-3.8-flash với mức giá giới thiệu của nó (0,015 đô la + 0,019 đô la).
2. Một lượt tác nhân dài: 200K đầu vào, 50K đầu ra
- Giới thiệu: 200.000 / 1M x 2 đô la = 0,40 đô la, cộng với 50.000 / 1M x 10 đô la = 0,50 đô la. Tổng cộng 0,90 đô la.
- Tiêu chuẩn: 0,80 đô la + 1,00 đô la = 1,80 đô la.
GPT-6 Astra sẽ tính 4,50 đô la (2,00 đô la + 2,50 đô la). gemini-3.1-pro-preview tính 1,00 đô la (0,40 đô la + 0,60 đô la), nhưng 200K là ranh giới cấp của nó: lời nhắc dài hơn sẽ tính phí 4 đô la/18 đô la. Nếu Argon có một cấp độ tương tự, các lượt dài hơn sẽ tốn kém hơn.
3. Một phản hồi tối đa: 1 triệu token đầu ra
Chỉ riêng đầu ra là 1.000.000 / 1M x 10 đô la = 10,00 đô la ở mức giới thiệu và 20,00 đô la ở mức tiêu chuẩn. Thêm một lời nhắc 100K token (0,20 đô la giới thiệu, 0,40 đô la tiêu chuẩn) và cuộc gọi sẽ tốn 10,20 đô la hoặc 20,40 đô la.
Không có mô hình nào khác trong bảng có thể tạo ra điều này trong một phản hồi đồng bộ: các đối thủ cạnh tranh giới hạn ở 128K, Gemini Pro trước đây là 65.536. Với đầu ra tối đa 262K được liệt kê bởi Vals, một phản hồi đầy đủ tốn khoảng 2,62 đô la giới thiệu hoặc 5,24 đô la tiêu chuẩn. Phía kỹ thuật (thời gian chờ, phát trực tuyến, cổng) được trình bày trong 1 triệu token đầu ra của Gemini 4 Argon.
4. Một lời nhắc 500K token được lưu trữ và tái sử dụng 10 lần
Giả sử bạn gửi cùng một cơ sở mã hoặc bộ hợp đồng 500K token mười lần, với mỗi lần 5K token đầu ra. Giả sử cuộc gọi đầu tiên trả đủ giá đầu vào để xây dựng bộ nhớ đệm và chín cuộc gọi tiếp theo đọc từ đó.
| 10 cuộc gọi, lời nhắc 500K, 5K đầu ra mỗi lần | Giới thiệu | Tiêu chuẩn |
|---|---|---|
| Đầu vào, không có bộ nhớ đệm (10 x 500K) | 10,00 đô la | 20,00 đô la |
| Đầu vào, có bộ nhớ đệm (1 đầy đủ + 9 được lưu trữ) | 1,00 đô la + 9 x 0,05 đô la = 1,45 đô la | 2,00 đô la + 9 x 0,10 đô la = 2,90 đô la |
| Đầu ra (10 x 5K) | 0,50 đô la | 1,00 đô la |
| Tổng cộng với bộ nhớ đệm | 1,95 đô la | 3,90 đô la |
| Tổng cộng không có bộ nhớ đệm | 10,50 đô la | 21,00 đô la |
Bộ nhớ đệm giảm hóa đơn đầu vào 85,5%. Hai lưu ý: Google chưa cho biết liệu Argon có tính phí lưu trữ bộ nhớ đệm hay không (gemini-3.1-pro-preview tính 4,50 đô la cho mỗi 1 triệu token mỗi giờ, sẽ cộng thêm 2,25 đô la để giữ 500K token trong một giờ), và lời nhắc 500K đã vượt quá giới hạn 200K của 3.1 Pro. Mức giá lưu trữ tiêu chuẩn của Argon khớp với 0,20 đô la của Opus 5.5, vì vậy logic hòa vốn trong phép tính chi phí lưu trữ lời nhắc Claude Opus 5.5 vẫn được áp dụng.
Giá mỗi token không phải là chi phí mỗi tác vụ
Artificial Analysis liệt kê 1,99 đô la mỗi tác vụ để chạy Chỉ số Thông minh của họ trên Gemini 4 Argon (Cao) với giá giới thiệu; The Decoder đưa ra cùng một lần chạy với giá 3,98 đô la ở mức giá tiêu chuẩn. AA chấm Argon 53 điểm, bằng với GPT-6 Astra (tối đa), mà họ liệt kê là 3,26 đô la mỗi tác vụ.
Vấn đề là khối lượng token. AA tính khoảng 62K token đầu ra mỗi tác vụ cho Argon (cao) so với khoảng 27K cho Astra ở cài đặt tối đa của nó, khoảng 2,3 lần. Đầu ra mỗi tác vụ ở mức giới thiệu: 62.000 / 1M x 10 đô la = 0,62 đô la, so với 27.000 / 1M x 50 đô la = 1,35 đô la cho Astra. Ở mức tiêu chuẩn, con số toàn tác vụ của The Decoder cho Argon (3,98 đô la) cao hơn 3,26 đô la của AA cho Astra (tối đa), mặc dù mức giá tiêu chuẩn của Argon thấp hơn 60% so với Astra.
Vals AI cũng cho thấy cùng một mẫu hình. Họ liệt kê 15,68 đô la mỗi thử nghiệm cho Argon trên Chỉ số Vals, so với 32,14 đô la cho Claude Opus 5.5, 21,34 đô la cho Claude Sonnet 5.5, và 3,24 đô la cho GPT-6.1 Sol, và họ liệt kê Argon ở mức giá tiêu chuẩn 4 đô la/20 đô la. Sonnet 5.5 và GPT-6.1 Sol chia sẻ giá giới thiệu của Argon trên giấy tờ, nhưng chi phí mỗi thử nghiệm của chúng cách biệt hơn 6 lần.
Hãy lập ngân sách từ số lượng token của riêng bạn, không phải từ bảng giá.
Kiểm soát chi phí cần thiết lập trước khi Argon ra mắt
- Giới hạn đầu ra. Trên generateContent,
generationConfig.maxOutputTokensđặt một giới hạn. Google cho biết các mô hình mới ra mắt trên API Interactions, vì vậy hãy đặt giới hạn tương đương ở đó ngay khi tài liệu liệt kê cho Argon. Giới hạn 1M là giới hạn đầu ra 20 đô la cho mỗi cuộc gọi ở mức giá tiêu chuẩn. - Lưu trữ nội dung ổn định. Hướng dẫn hệ thống, sơ đồ và tài liệu tham khảo lặp lại trên các cuộc gọi là nơi mức giảm giá 95% phát huy tác dụng.
- Chọn mức độ suy nghĩ có chủ đích. Google chưa công bố các cấp độ của Argon. Hiện tại gemini-3.1-pro-preview mặc định là
highvà gemini-3.8-flash làmedium. Khi các cấp độ của Argon được tài liệu hóa, hãy kiểm tra xem mức thấp hơn có giữ được chất lượng cho tác vụ của bạn không. - Xác nhận mức sử dụng. Mỗi phản hồi generateContent đều kết thúc bằng
usageMetadata. Trong Apidog, lưu yêu cầu với mô hình trong biến môi trườngGEMINI_MODEL, thêm một xác nhận sau phản hồi tính toán chi phí từ số lượng token trongusageMetadata, và thất bại thử nghiệm khi một cuộc gọi vượt quá giới hạn của bạn. Chạy nó với gemini-3.8-flash ngay hôm nay; khi ID của Argon ra mắt, bạn thay đổi một biến và chạy lại bộ thử nghiệm.
Phép tính cho khẳng định đó:
chi_phi = dau_vao_khong_cache / 1.000.000 x ty_le_dau_vao
+ dau_vao_cache / 1.000.000 x ty_le_cache
+ (dau_ra + suy_nghi) / 1.000.000 x ty_le_dau_ra
Những gì Google chưa định giá
Độ dài của giai đoạn giới thiệu và ngày bắt đầu mức 4 đô la/20 đô la; liệu lời nhắc trên 200K có tốn kém hơn không; giá Batch hoặc Flex (3.1 Pro có cả hai, ở mức 1 đô la/2 đô la đầu vào và 6 đô la/9 đô la đầu ra); phí lưu trữ bộ nhớ đệm; giới hạn tốc độ; và liệu có cấp độ miễn phí nào không.
Câu hỏi thường gặp
Gemini 4 Argon có giá bao nhiêu cho mỗi triệu token? 2 đô la đầu vào và 10 đô la đầu ra trong giai đoạn giới thiệu, sau đó là 4 đô la và 20 đô la. Đầu vào được lưu trữ giảm giá 95%: 0,10 đô la, sau đó là 0,20 đô la.
Giá giới thiệu kéo dài bao lâu? Google chưa công bố. Bài đăng ra mắt không đưa ra ngày kết thúc hoặc thời gian cụ thể.
Token suy nghĩ có được tính phí như đầu ra không? Trên các mô hình Gemini hiện tại, có. Google chưa tài liệu hóa các quy tắc của Argon một cách cụ thể.
Một phản hồi đầu ra 1 triệu token có giá bao nhiêu? 10 đô la với giá giới thiệu và 20 đô la với giá tiêu chuẩn, chưa tính đầu vào.
Argon có rẻ hơn Claude Opus 5.5 hay GPT-6 Astra không? Theo token, Argon tiêu chuẩn bằng Opus 5.5 và thấp hơn 60% so với Astra. Theo tác vụ, nó phụ thuộc vào khối lượng token: Artificial Analysis đo được Argon sử dụng khoảng 2,3 lần số token đầu ra của Astra. Đối với một Gemini rẻ hơn hiện nay, hãy xem giá Gemini 3.8 Flash.
Tôi có thể trả tiền cho Argon ngay hôm nay không? Không. Nó hiện chỉ được triển khai cho các đối tác của Chương trình Fairwind. Khách hàng API trả phí và người đăng ký Google AI Ultra sẽ được tiếp theo, nhưng chưa có ngày cụ thể.
Lập ngân sách ngay, đo lường sau
Nhân số lượng token lưu lượng truy cập hiện tại của bạn với 2 đô la/10 đô la và 4 đô la/20 đô la, và bạn sẽ có phạm vi giá giới thiệu và tiêu chuẩn của Argon. Sau đó xây dựng phép đo: tải xuống Apidog, lưu yêu cầu của bạn đối với gemini-3.8-flash với GEMINI_MODEL là một biến, và thêm một xác nhận chi phí trên usageMetadata. Khi Google công bố ID mô hình, bạn thay đổi một giá trị và xem chi phí thực tế mỗi cuộc gọi của bạn ngay từ ngày đầu tiên.
