Giá Gemini 4 Argon: $2/$10 ban đầu, $4/$20 sau đó và chi phí câu trả lời 1M token

Giá Gemini 4 Argon: 2 USD/10 USD cho 1 triệu token (giai đoạn giới thiệu), 4 USD/20 USD sau đó, đầu vào được lưu trữ giảm 95%. Đã tính toán chi phí, một câu trả lời dài 1 triệu token và giá của đối thủ cạnh tranh.

INEZA Felin-Michel

INEZA Felin-Michel

2 tháng 10 2026

Giá Gemini 4 Argon: $2/$10 ban đầu, $4/$20 sau đó và chi phí câu trả lời 1M token

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Gemini 4 Argon có giá 2 đô la cho 1 triệu token đầu vào và 10 đô la cho 1 triệu token đầu ra trong giai đoạn giới thiệu, sau đó là 4 đô la và 20 đô la. Đầu vào được lưu trữ giảm giá 95% so với giá đầu vào, tương đương 0,10 đô la cho 1 triệu token với mức giá giới thiệu và 0,20 đô la sau đó. Google chưa cho biết thời gian giai đoạn giới thiệu kéo dài bao lâu, và bạn chưa thể mua Argon: nó đã được công bố nhưng chưa có sẵn rộng rãi, và hôm nay nó chỉ được triển khai cho các chuyên gia an ninh mạng thuộc Chương trình Fairwind.

button

Bài đăng này chuyển bảng giá đó thành các con số ngân sách: so sánh với bảy mô hình hiện tại, bốn kịch bản đã thực hiện, chi phí bên thứ ba cho mỗi tác vụ và các kiểm soát chi phí cần thiết lập ngay bây giờ. Đối với chính mô hình, hãy bắt đầu với Gemini 4 Argon là gì; để truy cập, hãy xem Gemini 4 Argon có miễn phí không. Bạn có thể xây dựng các khẳng định chi phí trong Apidog đối với một mô hình bạn có thể gọi ngay hôm nay và thay đổi tên mô hình sau.

fe

Bảng giá

Google đã công bố giá trong bài đăng ra mắt Gemini 4 Argon, với mức giá sau giai đoạn giới thiệu trong chú thích 1: “Sau khi giai đoạn giới thiệu kết thúc, mức giá 4 đô la cho 1 triệu token đầu vào và 20 đô la cho 1 triệu token đầu ra sẽ được áp dụng.”

Gemini 4 Argon, mỗi 1 triệu token Giới thiệu Tiêu chuẩn (sau giới thiệu)
Đầu vào 2,00 đô la 4,00 đô la
Đầu vào được lưu trữ (giảm 95% giá đầu vào) 0,10 đô la 0,20 đô la
Đầu ra 10,00 đô la 20,00 đô la
Đầu ra tối đa mỗi phản hồi (Google) 1 triệu token 1 triệu token
Chi phí của một đầu ra 1 triệu token đầy đủ 10,00 đô la 20,00 đô la

Các mức giá được lưu trữ là kết quả tính toán từ quy tắc 95% của Google (2 đô la x 0,05 và 4 đô la x 0,05). Google chưa công bố cửa sổ ngữ cảnh đầu vào hoặc ID mô hình. Họ cho biết giới hạn đầu ra là 1 triệu token, “tăng từ 64K token trước đây”; ít nhất một nhà đánh giá bên thứ ba, Vals AI, liệt kê đầu ra tối đa là 262K cho cấu hình mà họ đã thử nghiệm.

Argon so với các mô hình tiên tiến và Gemini hiện tại

Tất cả các mức giá đều tính trên mỗi 1 triệu token.

Mô hình Đầu vào Đầu vào được lưu trữ Đầu ra Đầu ra tối đa
Gemini 4 Argon (giới thiệu) 2 đô la 0,10 đô la 10 đô la 1 triệu
Gemini 4 Argon (tiêu chuẩn) 4 đô la 0,20 đô la 20 đô la 1 triệu
GPT-6 Astra 10 đô la 1 đô la 50 đô la 128.000
Claude Opus 5.5 4 đô la 0,20 đô la 20 đô la 128K (300K trên Batch, beta)
Claude Sonnet 5.5 2 đô la 0,20 đô la 10 đô la 128K (300K trên Batch, beta)
GPT-6.1 Sol 2 đô la 0,10 đô la 10 đô la 128.000
Claude Fable 5.1 10 đô la 0,25 đô la 50 đô la 128K
gemini-3.1-pro-preview (lời nhắc <=200K / >200K) 2 đô la / 4 đô la 0,20 đô la / 0,40 đô la 12 đô la / 18 đô la 65.536
gemini-3.8-flash (giới thiệu / từ 2027-01-01) 0,75 đô la / 1,50 đô la 0,075 đô la / 0,15 đô la 3,75 đô la / 7,50 đô la 65.536

Giá của các đối thủ cạnh tranh lấy từ các trang riêng của nhà cung cấp: trang GPT-6 Astra của OpenAI, trang giá của Anthropic, và trang giá API Gemini của Google.

Để biết khả năng cùng với giá, hãy xem Gemini 4 Argon so với GPT-6 Astra so với Claude Opus 5.5.

Token suy nghĩ được tính phí như đầu ra

Trên các mô hình Gemini hiện tại, token suy nghĩ được tính phí như đầu ra: tài liệu về suy nghĩ của Google nói rằng “giá phản hồi là tổng của token đầu ra và token suy nghĩ.” Google chưa tài liệu hóa Argon cụ thể, nhưng hãy tính đến cùng quy tắc này. Google đã chạy các đánh giá của Argon “với các cài đặt suy nghĩ cao nhất,” vì vậy hãy hiểu “10 đô la cho 1 triệu token đầu ra” là câu trả lời cộng với lý do.

Bốn kịch bản đã thực hiện

Mỗi con số dưới đây là số token chia cho 1 triệu, nhân với tỷ lệ trên mỗi 1 triệu. Các kịch bản từ 1 đến 3 giả định không có bộ nhớ đệm.

1. Một cuộc gọi API điển hình: 20K đầu vào, 5K đầu ra

Với 1.000 cuộc gọi mỗi ngày, chi phí là 90 đô la (giới thiệu) hoặc 180 đô la (tiêu chuẩn). Cuộc gọi tương tự tốn 0,18 đô la trên Claude Opus 5.5, 0,45 đô la trên GPT-6 Astra (0,20 đô la + 0,25 đô la), 0,10 đô la trên gemini-3.1-pro-preview (0,04 đô la + 0,06 đô la), và khoảng 0,034 đô la trên gemini-3.8-flash với mức giá giới thiệu của nó (0,015 đô la + 0,019 đô la).

2. Một lượt tác nhân dài: 200K đầu vào, 50K đầu ra

GPT-6 Astra sẽ tính 4,50 đô la (2,00 đô la + 2,50 đô la). gemini-3.1-pro-preview tính 1,00 đô la (0,40 đô la + 0,60 đô la), nhưng 200K là ranh giới cấp của nó: lời nhắc dài hơn sẽ tính phí 4 đô la/18 đô la. Nếu Argon có một cấp độ tương tự, các lượt dài hơn sẽ tốn kém hơn.

3. Một phản hồi tối đa: 1 triệu token đầu ra

Chỉ riêng đầu ra là 1.000.000 / 1M x 10 đô la = 10,00 đô la ở mức giới thiệu và 20,00 đô la ở mức tiêu chuẩn. Thêm một lời nhắc 100K token (0,20 đô la giới thiệu, 0,40 đô la tiêu chuẩn) và cuộc gọi sẽ tốn 10,20 đô la hoặc 20,40 đô la.

Không có mô hình nào khác trong bảng có thể tạo ra điều này trong một phản hồi đồng bộ: các đối thủ cạnh tranh giới hạn ở 128K, Gemini Pro trước đây là 65.536. Với đầu ra tối đa 262K được liệt kê bởi Vals, một phản hồi đầy đủ tốn khoảng 2,62 đô la giới thiệu hoặc 5,24 đô la tiêu chuẩn. Phía kỹ thuật (thời gian chờ, phát trực tuyến, cổng) được trình bày trong 1 triệu token đầu ra của Gemini 4 Argon.

4. Một lời nhắc 500K token được lưu trữ và tái sử dụng 10 lần

Giả sử bạn gửi cùng một cơ sở mã hoặc bộ hợp đồng 500K token mười lần, với mỗi lần 5K token đầu ra. Giả sử cuộc gọi đầu tiên trả đủ giá đầu vào để xây dựng bộ nhớ đệm và chín cuộc gọi tiếp theo đọc từ đó.

10 cuộc gọi, lời nhắc 500K, 5K đầu ra mỗi lần Giới thiệu Tiêu chuẩn
Đầu vào, không có bộ nhớ đệm (10 x 500K) 10,00 đô la 20,00 đô la
Đầu vào, có bộ nhớ đệm (1 đầy đủ + 9 được lưu trữ) 1,00 đô la + 9 x 0,05 đô la = 1,45 đô la 2,00 đô la + 9 x 0,10 đô la = 2,90 đô la
Đầu ra (10 x 5K) 0,50 đô la 1,00 đô la
Tổng cộng với bộ nhớ đệm 1,95 đô la 3,90 đô la
Tổng cộng không có bộ nhớ đệm 10,50 đô la 21,00 đô la

Bộ nhớ đệm giảm hóa đơn đầu vào 85,5%. Hai lưu ý: Google chưa cho biết liệu Argon có tính phí lưu trữ bộ nhớ đệm hay không (gemini-3.1-pro-preview tính 4,50 đô la cho mỗi 1 triệu token mỗi giờ, sẽ cộng thêm 2,25 đô la để giữ 500K token trong một giờ), và lời nhắc 500K đã vượt quá giới hạn 200K của 3.1 Pro. Mức giá lưu trữ tiêu chuẩn của Argon khớp với 0,20 đô la của Opus 5.5, vì vậy logic hòa vốn trong phép tính chi phí lưu trữ lời nhắc Claude Opus 5.5 vẫn được áp dụng.

Giá mỗi token không phải là chi phí mỗi tác vụ

Artificial Analysis liệt kê 1,99 đô la mỗi tác vụ để chạy Chỉ số Thông minh của họ trên Gemini 4 Argon (Cao) với giá giới thiệu; The Decoder đưa ra cùng một lần chạy với giá 3,98 đô la ở mức giá tiêu chuẩn. AA chấm Argon 53 điểm, bằng với GPT-6 Astra (tối đa), mà họ liệt kê là 3,26 đô la mỗi tác vụ.

Vấn đề là khối lượng token. AA tính khoảng 62K token đầu ra mỗi tác vụ cho Argon (cao) so với khoảng 27K cho Astra ở cài đặt tối đa của nó, khoảng 2,3 lần. Đầu ra mỗi tác vụ ở mức giới thiệu: 62.000 / 1M x 10 đô la = 0,62 đô la, so với 27.000 / 1M x 50 đô la = 1,35 đô la cho Astra. Ở mức tiêu chuẩn, con số toàn tác vụ của The Decoder cho Argon (3,98 đô la) cao hơn 3,26 đô la của AA cho Astra (tối đa), mặc dù mức giá tiêu chuẩn của Argon thấp hơn 60% so với Astra.

Vals AI cũng cho thấy cùng một mẫu hình. Họ liệt kê 15,68 đô la mỗi thử nghiệm cho Argon trên Chỉ số Vals, so với 32,14 đô la cho Claude Opus 5.5, 21,34 đô la cho Claude Sonnet 5.5, và 3,24 đô la cho GPT-6.1 Sol, và họ liệt kê Argon ở mức giá tiêu chuẩn 4 đô la/20 đô la. Sonnet 5.5 và GPT-6.1 Sol chia sẻ giá giới thiệu của Argon trên giấy tờ, nhưng chi phí mỗi thử nghiệm của chúng cách biệt hơn 6 lần.

Hãy lập ngân sách từ số lượng token của riêng bạn, không phải từ bảng giá.

Kiểm soát chi phí cần thiết lập trước khi Argon ra mắt

Phép tính cho khẳng định đó:

chi_phi = dau_vao_khong_cache / 1.000.000 x ty_le_dau_vao
     + dau_vao_cache   / 1.000.000 x ty_le_cache
     + (dau_ra + suy_nghi) / 1.000.000 x ty_le_dau_ra

Những gì Google chưa định giá

Độ dài của giai đoạn giới thiệu và ngày bắt đầu mức 4 đô la/20 đô la; liệu lời nhắc trên 200K có tốn kém hơn không; giá Batch hoặc Flex (3.1 Pro có cả hai, ở mức 1 đô la/2 đô la đầu vào và 6 đô la/9 đô la đầu ra); phí lưu trữ bộ nhớ đệm; giới hạn tốc độ; và liệu có cấp độ miễn phí nào không.

Câu hỏi thường gặp

Gemini 4 Argon có giá bao nhiêu cho mỗi triệu token? 2 đô la đầu vào và 10 đô la đầu ra trong giai đoạn giới thiệu, sau đó là 4 đô la và 20 đô la. Đầu vào được lưu trữ giảm giá 95%: 0,10 đô la, sau đó là 0,20 đô la.

Giá giới thiệu kéo dài bao lâu? Google chưa công bố. Bài đăng ra mắt không đưa ra ngày kết thúc hoặc thời gian cụ thể.

Token suy nghĩ có được tính phí như đầu ra không? Trên các mô hình Gemini hiện tại, có. Google chưa tài liệu hóa các quy tắc của Argon một cách cụ thể.

Một phản hồi đầu ra 1 triệu token có giá bao nhiêu? 10 đô la với giá giới thiệu và 20 đô la với giá tiêu chuẩn, chưa tính đầu vào.

Argon có rẻ hơn Claude Opus 5.5 hay GPT-6 Astra không? Theo token, Argon tiêu chuẩn bằng Opus 5.5 và thấp hơn 60% so với Astra. Theo tác vụ, nó phụ thuộc vào khối lượng token: Artificial Analysis đo được Argon sử dụng khoảng 2,3 lần số token đầu ra của Astra. Đối với một Gemini rẻ hơn hiện nay, hãy xem giá Gemini 3.8 Flash.

Tôi có thể trả tiền cho Argon ngay hôm nay không? Không. Nó hiện chỉ được triển khai cho các đối tác của Chương trình Fairwind. Khách hàng API trả phí và người đăng ký Google AI Ultra sẽ được tiếp theo, nhưng chưa có ngày cụ thể.

Lập ngân sách ngay, đo lường sau

Nhân số lượng token lưu lượng truy cập hiện tại của bạn với 2 đô la/10 đô la và 4 đô la/20 đô la, và bạn sẽ có phạm vi giá giới thiệu và tiêu chuẩn của Argon. Sau đó xây dựng phép đo: tải xuống Apidog, lưu yêu cầu của bạn đối với gemini-3.8-flash với GEMINI_MODEL là một biến, và thêm một xác nhận chi phí trên usageMetadata. Khi Google công bố ID mô hình, bạn thay đổi một giá trị và xem chi phí thực tế mỗi cuộc gọi của bạn ngay từ ngày đầu tiên.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API