Gemini 4 Argon custa US$ 2 por 1 milhão de tokens de entrada e US$ 10 por 1 milhão de tokens de saída durante um período introdutório, depois US$ 4 e US$ 20. A entrada em cache tem um desconto de 95% sobre o preço da entrada, o que equivale a US$ 0,10 por 1 milhão de tokens na taxa introdutória e US$ 0,20 depois. O Google não informou quanto tempo dura o período introdutório, e você ainda não pode comprar o Argon: ele foi anunciado, mas não está geralmente disponível, e hoje está sendo lançado apenas para os defensores cibernéticos do Programa Fairwind.
Este post transforma essa tabela de preços em números de orçamento: uma comparação com sete modelos atuais, quatro cenários trabalhados, custo por tarefa de terceiros e os controles de custo para configurar agora. Para o modelo em si, comece com o que é o Gemini 4 Argon; para acesso, veja se o Gemini 4 Argon é gratuito. Você pode construir afirmações de custo no Apidog contra um modelo que você pode chamar hoje e trocar o nome do modelo mais tarde.

A tabela de preços
O Google publicou os preços no post de lançamento do Gemini 4 Argon, com a taxa pós-introdução na nota de rodapé 1: "Após o período introdutório expirar, o preço de US$ 4 por 1 milhão de tokens de entrada e US$ 20 por 1 milhão de tokens de saída será aplicado."
| Gemini 4 Argon, por 1 milhão de tokens | Intro | Padrão (após a introdução) |
|---|---|---|
| Entrada | $2.00 | $4.00 |
| Entrada em cache (95% de desconto na entrada) | $0.10 | $0.20 |
| Saída | $10.00 | $20.00 |
| Saída máxima por resposta (Google) | 1M tokens | 1M tokens |
| Custo de uma saída completa de 1M de tokens | $10.00 | $20.00 |
As taxas em cache são aritméticas a partir da regra de 95% do Google (US$ 2 x 0,05 e US$ 4 x 0,05). O Google não publicou uma janela de contexto de entrada ou um ID de modelo. Ele afirma que o limite de saída é de 1 milhão de tokens, "acima dos 64 mil tokens anteriores"; pelo menos um avaliador terceirizado, Vals AI, lista um máximo de 262 mil tokens de saída para a configuração que testou.
Argon vs. modelos de ponta e Gemini atuais
Todos os preços são por 1 milhão de tokens.
| Modelo | Entrada | Entrada em cache | Saída | Saída máxima |
|---|---|---|---|---|
| Gemini 4 Argon (intro) | $2 | $0.10 | $10 | 1M |
| Gemini 4 Argon (padrão) | $4 | $0.20 | $20 | 1M |
| GPT-6 Astra | $10 | $1 | $50 | 128,000 |
| Claude Opus 5.5 | $4 | $0.20 | $20 | 128K (300K em Batch, beta) |
| Claude Sonnet 5.5 | $2 | $0.20 | $10 | 128K (300K em Batch, beta) |
| GPT-6.1 Sol | $2 | $0.10 | $10 | 128,000 |
| Claude Fable 5.1 | $10 | $0.25 | $50 | 128K |
| gemini-3.1-pro-preview (prompt <=200K / >200K) | $2 / $4 | $0.20 / $0.40 | $12 / $18 | 65,536 |
| gemini-3.8-flash (intro / de 2027-01-01) | $0.75 / $1.50 | $0.075 / $0.15 | $3.75 / $7.50 | 65,536 |
Os preços dos concorrentes vêm das próprias páginas dos fornecedores: página do GPT-6 Astra da OpenAI, página de preços da Anthropic e página de preços da API Gemini do Google.
- Argon Padrão = Claude Opus 5.5. Mesmos US$ 4/US$ 20, mesma entrada em cache de US$ 0,20.
- Argon Intro = Claude Sonnet 5.5 e GPT-6.1 Sol. Mesmos US$ 2/US$ 10; a taxa de cache introdutória de US$ 0,10 corresponde ao GPT-6.1 Sol.
- GPT-6 Astra e Claude Fable 5.1 custam 5x o Argon intro e 2,5x o Argon padrão. Veja preços do Claude Fable 5.1.
- A saída introdutória do Argon (US$ 10) está abaixo da do gemini-3.1-pro-preview (US$ 12), o modelo Pro top anterior do Google.
- Prompts longos mudam a matemática. A OpenAI cobra prompts acima de 272K tokens de entrada 2x a entrada e o cache e 1,5x a saída para a solicitação completa. O Gemini 3.1 Pro cobra mais acima de 200K; a Anthropic não. O Google não disse se o Argon tem uma camada de prompt longo.
Para capacidade junto com o preço, veja Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5.
Tokens de pensamento cobrados como saída
Nos modelos Gemini atuais, os tokens de pensamento são cobrados como saída: a documentação de pensamento do Google diz que "o preço da resposta é a soma dos tokens de saída e dos tokens de pensamento". O Google não documentou o Argon especificamente, mas planeje com a mesma regra. O Google executou as avaliações do Argon "com as configurações de pensamento mais altas", então leia "US$ 10 por 1 milhão de tokens de saída" como resposta mais raciocínio.
Quatro cenários trabalhados
Cada figura abaixo é tokens divididos por 1 milhão, vezes a taxa por 1 milhão. Os cenários 1 a 3 assumem nenhum cache.
1. Uma chamada de API típica: 20K de entrada, 5K de saída
- Intro: 20.000 / 1M x US$ 2 = US$ 0,04 de entrada, mais 5.000 / 1M x US$ 10 = US$ 0,05 de saída. Total US$ 0,09.
- Padrão: US$ 0,08 + US$ 0,10 = US$ 0,18.
Com 1.000 chamadas por dia, isso é US$ 90 na introdução ou US$ 180 no padrão. A mesma chamada custa US$ 0,18 no Claude Opus 5.5, US$ 0,45 no GPT-6 Astra (US$ 0,20 + US$ 0,25), US$ 0,10 no gemini-3.1-pro-preview (US$ 0,04 + US$ 0,06) e cerca de US$ 0,034 no gemini-3.8-flash na sua taxa introdutória (US$ 0,015 + US$ 0,019).
2. Uma longa rodada de agente: 200K de entrada, 50K de saída
- Intro: 200.000 / 1M x US$ 2 = US$ 0,40, mais 50.000 / 1M x US$ 10 = US$ 0,50. Total US$ 0,90.
- Padrão: US$ 0,80 + US$ 1,00 = US$ 1,80.
O GPT-6 Astra cobraria US$ 4,50 (US$ 2,00 + US$ 2,50). O gemini-3.1-pro-preview cobra US$ 1,00 (US$ 0,40 + US$ 0,60), mas 200K é o seu limite de nível: prompts mais longos são cobrados a US$ 4/US$ 18. Se o Argon tiver um nível semelhante, as rodadas mais longas custarão mais.
3. Uma resposta maximizada: 1 milhão de tokens de saída
A saída sozinha é de 1.000.000 / 1M x US$ 10 = US$ 10,00 na introdução e US$ 20,00 no padrão. Adicione um prompt de 100K tokens (US$ 0,20 introdutório, US$ 0,40 padrão) e a chamada custará US$ 10,20 ou US$ 20,40.
Nenhum outro modelo na tabela produz isso em uma única resposta síncrona: os concorrentes limitam-se a 128K, o Gemini Pro anterior a 65.536. Com o limite de saída máximo de 262K listado pela Vals, uma resposta completa custa cerca de US$ 2,62 na introdução ou US$ 5,24 no padrão. O lado da engenharia (timeouts, streaming, gateways) está em Tokens de saída de 1M do Gemini 4 Argon.
4. Um prompt em cache de 500K tokens reutilizado 10 vezes
Digamos que você envie o mesmo código-base ou conjunto de contratos de 500K tokens dez vezes, com 5K tokens de saída em cada. Assuma que a primeira chamada paga o preço total de entrada para construir o cache e as nove seguintes leem a partir dele.
| 10 chamadas, prompt de 500K, 5K de saída cada | Intro | Padrão |
|---|---|---|
| Entrada, sem cache (10 x 500K) | $10.00 | $20.00 |
| Entrada, em cache (1 completa + 9 em cache) | $1.00 + 9 x $0.05 = $1.45 | $2.00 + 9 x $0.10 = $2.90 |
| Saída (10 x 5K) | $0.50 | $1.00 |
| Total com cache | $1.95 | $3.90 |
| Total sem cache | $10.50 | $21.00 |
O cache reduz a conta de entrada em 85,5%. Duas ressalvas: o Google não disse se o Argon cobra pelo armazenamento em cache (o gemini-3.1-pro-preview cobra US$ 4,50 por 1 milhão de tokens por hora, o que adicionaria US$ 2,25 para manter 500K tokens por uma hora), e um prompt de 500K está acima do limite de 200K do 3.1 Pro. A taxa de cache padrão do Argon corresponde à de US$ 0,20 do Opus 5.5, então a lógica de ponto de equilíbrio em matemática de custo de cache de prompt do Claude Opus 5.5 se aplica.
Preço por token não é custo por tarefa
A Artificial Analysis lista US$ 1,99 por tarefa para executar seu Índice de Inteligência no Gemini 4 Argon (Alto) a preços introdutórios; The Decoder coloca a mesma execução em US$ 3,98 a preços padrão. A AA pontua o Argon em 53, o mesmo que o GPT-6 Astra (máximo), que ela lista em US$ 3,26 por tarefa.
O problema é o volume de tokens. A AA conta aproximadamente 62K tokens de saída por tarefa para Argon (alto) contra aproximadamente 27K para Astra em sua configuração máxima, cerca de 2,3x. Saída por tarefa na introdução: 62.000 / 1M x US$ 10 = US$ 0,62, contra 27.000 / 1M x US$ 50 = US$ 1,35 para Astra. No padrão, o valor total da tarefa do The Decoder para Argon (US$ 3,98) fica acima dos US$ 3,26 da AA para Astra (máx.), mesmo que as taxas padrão do Argon estejam 60% abaixo das do Astra.
A Vals AI mostra o mesmo padrão. Ela lista US$ 15,68 por teste para Argon no Índice Vals, contra US$ 32,14 para Claude Opus 5.5, US$ 21,34 para Claude Sonnet 5.5 e US$ 3,24 para GPT-6.1 Sol, e lista Argon na taxa padrão de US$ 4/US$ 20. Sonnet 5.5 e GPT-6.1 Sol compartilham o preço introdutório do Argon no papel, mas seus custos por teste ficam mais de 6x distantes.
Orçamente com base em suas próprias contagens de tokens, não na tabela de preços.
Controles de custo para configurar antes do lançamento do Argon
- Limite a saída. Em generateContent, `generationConfig.maxOutputTokens` define um teto. O Google diz que novos modelos são lançados na API Interactions, então defina o limite equivalente lá assim que a documentação o listar para Argon. Um teto de 1M é um teto de saída de US$ 20 por chamada nas taxas padrão.
- Armazene o conteúdo estável em cache. Instruções do sistema, esquemas e documentos de referência que se repetem em chamadas são onde o desconto de 95% compensa.
- Escolha o nível de pensamento intencionalmente. O Google não publicou os níveis do Argon. Hoje, o gemini-3.1-pro-preview assume o padrão `high` e o gemini-3.8-flash assume o `medium`. Quando os do Argon forem documentados, teste se um nível inferior mantém a qualidade em sua tarefa.
- Afirme sobre o uso. Toda resposta generateContent termina com `usageMetadata`. No Apidog, salve a solicitação com o modelo em uma variável de ambiente `GEMINI_MODEL`, adicione uma afirmação pós-resposta que calcula o custo a partir das contagens de tokens em `usageMetadata` e falhe o teste quando uma chamada exceder seu limite. Execute-o contra o gemini-3.8-flash hoje; quando o ID do Argon for lançado, troque uma variável e execute novamente o pacote.
A aritmética para essa afirmação:
custo = entrada_sem_cache / 1.000.000 x taxa_entrada
+ entrada_em_cache / 1.000.000 x taxa_cache
+ (saída + pensamento) / 1.000.000 x taxa_saída
O que o Google ainda não precificou
A duração do período introdutório e a data em que os US$ 4/US$ 20 começam; se os prompts acima de 200K custam mais; preços de Batch ou Flex (3.1 Pro tem ambos, a US$ 1/US$ 2 de entrada e US$ 6/US$ 9 de saída); taxas de armazenamento em cache; limites de taxa; e se há uma camada gratuita.
Perguntas Frequentes
Quanto custa o Gemini 4 Argon por milhão de tokens? US$ 2 de entrada e US$ 10 de saída durante o período introdutório, depois US$ 4 e US$ 20. A entrada em cache tem 95% de desconto: US$ 0,10, depois US$ 0,20.
Quanto tempo dura o preço introdutório? O Google não informou. O post de lançamento não especifica data de término ou duração.
Os tokens de pensamento são cobrados como saída? Nos modelos Gemini atuais, sim. O Google não documentou as regras do Argon especificamente.
Quanto custa uma resposta de saída de 1 milhão de tokens? US$ 10 com preço introdutório e US$ 20 com preço padrão, antes da entrada.
O Argon é mais barato que o Claude Opus 5.5 ou GPT-6 Astra? Por token, o Argon padrão é igual ao Opus 5.5 e está 60% abaixo do Astra. Por tarefa, depende do volume de tokens: a Artificial Analysis mediu o Argon usando cerca de 2,3x os tokens de saída do Astra. Para um Gemini mais barato hoje, veja preços do Gemini 3.8 Flash.
Posso pagar pelo Argon hoje? Não. Ele está sendo lançado apenas para parceiros do Programa Fairwind. Clientes da API paga e assinantes do Google AI Ultra vêm em seguida, sem data definida.
Orce agora, meça depois
Multiplique as contagens de tokens do seu tráfego atual por US$ 2/US$ 10 e US$ 4/US$ 20, e você terá a faixa introdutória e padrão do Argon. Em seguida, construa a medição: baixe o Apidog, salve sua solicitação contra o gemini-3.8-flash com `GEMINI_MODEL` como variável e adicione uma afirmação de custo em `usageMetadata`. Quando o Google publicar o ID do modelo, você troca um valor e vê o custo real por chamada no primeiro dia.
