Gemini 4 Argon API: Detalhes Confirmados, Custo e Como Preparar Seu Código

API do Gemini 4 Argon: sem acesso público ou ID de modelo ainda. O que o Google confirmou sobre preço e desempenho, e código para se preparar no Gemini 3.8 Flash hoje.

Ashley Innocent

Ashley Innocent

2 outubro 2026

Gemini 4 Argon API: Detalhes Confirmados, Custo e Como Preparar Seu Código

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Ainda não há uma API pública do Gemini 4 Argon, e o Google não publicou um ID de modelo. O Google anunciou o Argon em 30 de setembro de 2026, e ele está disponível hoje apenas para os defensores do Programa Fairwind: um conjunto de parceiros Fairwind o utiliza como um modelo gerenciado no Gemini Enterprise. A Artificial Analysis lista o Google AI Studio como o único provedor de API do Argon, mas sem dados de velocidade ou latência, o que se encaixa mais em um acesso pré-lançamento permitido do que em um endpoint ao qual você pode se inscrever. Quando a distribuição mais ampla começar, o Google afirma que ela se inicia "com clientes de API pagos e assinantes do Google AI Ultra", então uma chave de API Gemini paga o coloca em primeiro lugar na fila.

Essa lacuna entre o anúncio e o acesso é um tempo que você pode aproveitar. Este guia separa o que o Google confirmou sobre a API Argon do que não confirmou, e então percorre o código que você pode executar hoje no Gemini 3.8 Flash para que a mudança para o Argon se torne uma alteração de uma única variável. Você construirá a solicitação, configurará um alerta de entrada em produção, simulará a resposta no Apidog e adicionará um teto de custo com base nos preços do Argon. Para o modelo em si, comece com o que é o Gemini 4 Argon; para os estágios de lançamento, consulte o guia de data de lançamento do Gemini 4 Argon.

O que está confirmado sobre a API Gemini 4 Argon e o que não está

A publicação de lançamento do Google fornece preços e um limite de saída. Quase todo o resto que uma integração precisa ainda não foi publicado.

Item Status Detalhe
Preço de entrada Confirmado US$ 2 por 1M tokens (intro), US$ 4 após o período introdutório
Preço de saída Confirmado US$ 10 por 1M tokens (intro), US$ 20 depois
Entrada em cache Confirmado 95% de desconto na entrada: US$ 0,10 intro, US$ 0,20 padrão
Limite de saída Confirmado 1M tokens, um aumento de 64K
Superfície da API Sinalizado Os documentos do Google dizem que todos os novos modelos são lançados na API de Interações
ID do modelo Não publicado Ausente da página de modelos, página de preços e changelog
Janela de contexto de entrada Não publicado A avaliação de contexto longo do Google usou prompts de até 1M tokens, mas isso não é uma especificação
Níveis de pensamento Não publicado As avaliações foram executadas nas "configurações de pensamento mais altas"; nomes e padrão desconhecidos
Limites de taxa Não publicado Nenhum nível anunciado
Suporte a lote Não publicado Nenhum preço de lote ou Flex
Nível de prompt longo Não publicado O 3.1 Pro cobra mais acima de 200K; a regra do Argon não foi declarada
Duração do período introdutório Não publicado Nenhuma data final para US$ 2/US$ 10

Duas linhas merecem um olhar mais atento. A linha da superfície da API vem dos documentos da API de Interações, que afirmam que novos modelos "serão lançados na API de Interações". O Argon é um novo modelo, então espere-o lá primeiro; o Google não disse se `generateContent` o servirá. A linha de saída é o limite declarado do Google para o modelo, mas o Vals AI lista um máximo de 262K de saída para a configuração que testou, então não presuma que todo endpoint servirá o milhão completo no primeiro dia. Nosso guia de 1M de tokens de saída cobre o que esse limite faz com streaming, timeouts e armazenamento.

Sobre o preço, um parágrafo é suficiente aqui. Uma solicitação com um prompt de 20.000 tokens e 5.000 tokens de saída custa 20.000 x US$ 2/1M + 5.000 x US$ 10/1M = US$ 0,04 + US$ 0,05 = US$ 0,09 nas taxas introdutórias, e US$ 0,18 nas taxas padrão de US$ 4/US$ 20. O preço de saída introdutório do Argon (US$ 10) está abaixo dos US$ 12 do Gemini 3.1 Pro Preview, e seu preço padrão corresponde exatamente ao Claude Opus 5.5. A análise de preços do Gemini 4 Argon detalha todos os cenários, incluindo entrada em cache e uma resposta máxima de 1M de tokens.

Não codifique um ID de modelo que você encontrou online

Procure pelo ID do modelo Argon e você encontrará strings em sites de benchmark, agregadores e pull requests de código aberto. São placeholders. O Vals AI usa seu próprio slug para sua página de modelo, um pull request do GitHub adiciona um ID "provisoriamente", e o caminho estilo OpenRouter leva a uma página não encontrada. O Google não confirmou nenhum deles, e várias fontes alertam explicitamente contra codificar uma suposição.

Um ID adivinhado falha da maneira menos útil: um 404 em produção no dia da implantação, ou um fallback silencioso se seu wrapper capturar erros de forma muito ampla. Mantenha o nome do modelo na configuração. Em cada exemplo abaixo, o modelo vem de uma variável de ambiente `GEMINI_MODEL` que padroniza para `gemini-3.8-flash`, um modelo estável que você pode chamar hoje. Quando o Google publicar o ID do Argon, você mudará um único valor.

Prepare seu código no Gemini 3.8 Flash

O Gemini 3.8 Flash (`gemini-3.8-flash`) roda nos mesmos endpoints, cabeçalhos e formatos de resposta que o Argon deve usar, a US$ 0,75/US$ 3,75 por 1M tokens até 31 de dezembro de 2026. Sua chave reside em `GEMINI_API_KEY`; nunca a cole no código. A configuração completa está em nosso guia da API Gemini 3.8 Flash.

Passo 1: Envie uma solicitação da API de Interações

A API de Interações é a API principal do Google, Geralmente Disponível desde junho de 2026. Mantenha tanto o modelo quanto o nível de pensamento em variáveis, porque os nomes dos níveis do Argon não foram publicados.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"

curl -s -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"model\": \"${MODEL}\",
    \"input\": \"List the retry rules a REST client should follow for HTTP 429.\",
    \"generation_config\": {\"thinking_level\": \"${THINKING}\"}
  }"

O SDK Python precisa do `google-genai` 2.3.0 ou posterior para a API de Interações:

# pip install "google-genai>=2.3.0"
import os
from google import genai

MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
THINKING = os.environ.get("GEMINI_THINKING", "medium")

client = genai.Client()  # lê GEMINI_API_KEY do ambiente
interaction = client.interactions.create(
    model=MODEL,
    input="List the retry rules a REST client should follow for HTTP 429.",
    generation_config={"thinking_level": THINKING},
)
print(interaction.output_text)

No 3.8 Flash, os níveis válidos são `low` (baixo), `medium` (médio) (o padrão) e `high` (alto); `minimal` (mínimo) retorna HTTP 400. Nosso guia de níveis de pensamento explica as compensações. Para trabalho multi-turn, passe o ID da resposta anterior como `previous_interaction_id` e envie `store: false` para desabilitar o armazenamento do lado do servidor.

Passo 2: Mantenha o caminho de generateContent funcionando

A maioria dos códigos existentes chama o endpoint legado `generateContent`, que o Google afirma que continua totalmente suportado. Aqui está a mesma solicitação:

curl -s "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"contents\": [{\"parts\": [{\"text\": \"List the retry rules a REST client should follow for HTTP 429.\"}]}],
    \"generationConfig\": {\"thinkingConfig\": {\"thinkingLevel\": \"${THINKING}\"}}
  }"

Observe onde o pensamento reside: `generation_config.thinking_level` nas Interações, `generationConfig.thinkingConfig.thinkingLevel` aqui. Se o seu cliente envolver ambos, direcione novos modelos para Interações por padrão. As definições de ferramentas precisam do mesmo cuidado; veja chamada de função do Gemini 3.8 Flash.

Passo 3: Agende uma verificação de entrada em produção com models.list

Não atualize o changelog. Pergunte à API. O endpoint de modelos retorna os modelos disponíveis com seus limites de tokens e métodos suportados:

import os, sys, requests

resp = requests.get(
    "https://generativelanguage.googleapis.com/v1beta/models",
    params={"pageSize": 1000},
    headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]},
    timeout=30,
)
resp.raise_for_status()
hits = [m for m in resp.json().get("models", []) if "argon" in m["name"].lower()]
for m in hits:
    print(m["name"], "in:", m.get("inputTokenLimit"),
          "out:", m.get("outputTokenLimit"), m.get("supportedGenerationMethods"))
sys.exit(1 if hits else 0)  # uma execução falha é o alerta

Execute-o de hora em hora do cron ou de um agendador de CI, usando a chave que seu aplicativo de produção utiliza. Quando executamos esta chamada em 1º de outubro de 2026, com uma chave de projeto paga, ela retornou 61 modelos, nenhum `nextPageToken` e nenhum nome contendo "argon". No dia em que corresponder, a entrada informará três coisas de uma vez: o nome real do modelo, se `outputTokenLimit` é o 1M completo e quais métodos estão listados.

Passo 4: Simule a resposta para que o cliente seja construído antes do acesso

Você não precisa do Argon para construir o código que consome o Argon. Salve a solicitação do Passo 2 no Apidog com `GEMINI_API_KEY` e `GEMINI_MODEL` como variáveis de ambiente, envie-a uma vez contra o 3.8 Flash e extraia a resposta real para o endpoint como um exemplo de resposta. O Smart Mock padrão do Apidog gera dados a partir do esquema, então defina o método de mock padrão do projeto para "Exemplo de resposta primeiro" (Configurações do Projeto, Configurações de Recursos, Configurações de Mock). A URL de mock então retorna sua resposta salva, para que seu front-end, workers de fila e parsers possam rodar contra ela sem gastar tokens.

Seja claro sobre o que é este mock: o esquema de resposta atual do Gemini, não um esquema específico do Argon, porque o Google não publicou um. Ainda é a aposta certa, já que o Argon deve estar na mesma API. Para ensaiar uma resposta pesada do Argon, edite o `usageMetadata` do exemplo para contagens grandes e confirme que seu código de faturamento e alerta reage.

Passo 5: Afirme em usageMetadata e um teto de custo

Toda resposta de `generateContent` inclui `usageMetadata`. Adicione um script de pós-processamento no Apidog que precifique cada resposta com as taxas padrão do Argon, para que um teste falhe antes que uma conta o faça:

// Pós-processador do Apidog: precifique esta resposta com as taxas padrão do Gemini 4 Argon
const u = pm.response.json().usageMetadata;
const IN = 4 / 1e6;   // USD por token de entrada após o período introdutório
const OUT = 20 / 1e6; // USD por token de saída; o pensamento é cobrado como saída nos modelos Gemini atuais
const out = (u.candidatesTokenCount || 0) + (u.thoughtsTokenCount || 0);
const cost = u.promptTokenCount * IN + out * OUT;
pm.test("usageMetadata está presente", () => pm.expect(u).to.be.an("object"));
pm.test("custo abaixo de US$ 0,10 nas taxas do Argon", () => pm.expect(cost).to.be.below(0.10));

Escolha o teto por solicitação; US$ 0,10 é adequado para um prompt curto como este. O Google não declarou como o Argon cobra os tokens de pensamento, então o script assume a regra atual do Gemini. Mantenha a mesma solicitação salva e execute-a contra o 3.8 Flash agora e o Argon depois: a diferença nas contagens de tokens e no custo é a sua comparação de regressão.

FAQ

A API Gemini 4 Argon está disponível? Não publicamente. O Argon está sendo lançado apenas para um conjunto de parceiros do Programa Fairwind, que o utilizam através do Gemini Enterprise. Clientes de API pagos e assinantes do Google AI Ultra vêm em seguida, sem data definida.

Qual é o ID do modelo Gemini 4 Argon? O Google não publicou um. Strings em sites de terceiros são placeholders, então mantenha o modelo em uma variável de ambiente e monitore `models.list`.

Quanto custará a API Gemini 4 Argon? US$ 2 de entrada e US$ 10 de saída por 1M de tokens durante um período introdutório de duração não especificada, depois US$ 4 e US$ 20. A entrada em cache tem 95% de desconto. Veja preços do Gemini 4 Argon.

O Argon funcionará com generateContent? O Google não disse. Seus documentos afirmam que todos os novos modelos são lançados na API de Interações, então construa em Interações e trate `generateContent` como um fallback.

O Google AI Ultra me dá acesso à API? Não. O AI Ultra é uma assinatura de consumidor, não uma chave de API. O Google diz que o acesso à API começa com clientes de API pagos.

Seu próximo passo

Defina `GEMINI_MODEL` em todos os ambientes, agende a verificação de `models.list` e salve as solicitações de Interações e `generateContent` com a asserção de custo anexada. Baixe o Apidog para manter essas solicitações, mocks e testes em um único espaço de trabalho, e então altere uma variável quando o Google publicar o ID.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs