Como usar a API Grok 4.7

Chame Grok 4.7 via api.x.ai/v1/responses: ID do modelo grok-4.7, preços de $2/$6, esforço de raciocínio, raciocínio criptografado, cache, ferramentas e limites de taxa.

Medy Evrard

29 setembro 2026

Como usar a API Grok 4.7

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Para chamar o Grok 4.7, envie uma requisição POST para https://api.x.ai/v1/responses com "model": "grok-4.7" e sua chave xAI como um token Bearer. Custa US$ 2 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de entrada em cache e US$ 6 por milhão de tokens de saída para prompts abaixo de 200.000 tokens, com uma janela de contexto de 500.000 tokens. A SpaceXAI (a empresa anteriormente chamada xAI) o lançou em 21 de setembro de 2026, com o mesmo preço do Grok 4.6, então para a maioria das integrações existentes, a atualização é uma mudança de uma única linha.

botão

Abaixo: a primeira requisição, esforço de raciocínio e seu impacto na sua conta, raciocínio criptografado, cache, streaming, ferramentas, limites de taxa e uma configuração de teste reutilizável no Apidog. Para saber mais sobre o modelo, leia o que é o Grok 4.7 e o que mudou; a referência oficial é a página do Grok 4.7 na documentação da xAI.

API do Grok 4.7 em resumo

Propriedade Valor
ID do Modelo grok-4.7
Endpoint POST https://api.x.ai/v1/responses (Chat Completions ainda funciona como um endpoint legado)
Janela de contexto 500.000 tokens
Limite de saída Nenhum listado pela xAI
Entrada / cache / saída, abaixo de 200k US$ 2,00 / US$ 0,50 / US$ 6,00 por 1M de tokens
Entrada / cache / saída, 200k e acima US$ 4,00 / US$ 1,00 / US$ 12,00 por 1M de tokens
Esforço de raciocínio low, medium, high (padrão), xhigh
Entradas Texto e imagens (JPG ou PNG, até 20 MiB)
Ferramentas Chamada de função, busca na web, busca no X, execução de código
Corte de conhecimento Maio de 2026
API em lote Não suportado

Passo 1: obtenha uma chave e carregue créditos

Crie uma conta em console.x.ai, carregue-a com créditos (a API é pré-paga) e gere uma chave. Nosso guia de chaves da API Grok mostra as telas do console. Mantenha a chave fora do seu código:

export XAI_API_KEY="your-key-here"

Passo 2: faça sua primeira requisição

A API Responses é o endpoint principal e o que todos os exemplos na documentação da xAI usam:

curl https://api.x.ai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": "Review this function for bugs: function median(a){a.sort();return a[a.length/2]}"
  }'

A API funciona com o SDK da OpenAI. Aponte o cliente para a URL base da xAI e chame responses.create:

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.XAI_API_KEY,
  baseURL: "https://api.x.ai/v1",
});

const response = await client.responses.create({
  model: "grok-4.7",
  reasoning: { effort: "medium" },
  input: [
    { role: "system", content: "You are a senior backend reviewer." },
    { role: "user", content: "Find the bug in: function median(a){a.sort();return a[a.length/2]}" },
  ],
});

console.log(response.output_text);

Se preferir outro cliente, o mesmo modelo é grok-4.7 no SDK Python da xAI (xai_sdk), xai.responses('grok-4.7') no Vercel AI SDK e xai/grok-4.7 no LiteLLM. Duas notas de compatibilidade: a xAI agora rotula as Chat Completions como um endpoint legado, e sua compatibilidade com o SDK da Anthropic está totalmente depreciada. O novo código deve visar /v1/responses.

Passo 3: escolha um nível de esforço de raciocínio

O Grok 4.7 sempre raciocina. Você não pode desativá-lo, mas controla o quão intensamente ele pensa com reasoning.effort na API Responses (reasoning_effort no SDK da xAI): low para chamadas de ferramentas sensíveis à latência, medium para análise e contexto longo, high (o padrão) para problemas complexos de múltiplas etapas e xhigh quando a qualidade supera o tempo de resposta.

Esta configuração é a maior alavanca na sua conta. A página de lançamento da SpaceXAI publica os resultados do CursorBench 4.0 por nível de esforço, e a diferença é grande:

Esforço CursorBench 4.0 Custo médio por tarefa Tokens de saída médios por tarefa
low 33.1% US$ 1,58 15.677
medium 41.6% US$ 3,49 36.683
high 43.9% US$ 4,69 56.382
xhigh 46.3% US$ 6,01 70.141

Passar de low para xhigh compra 13,2 pontos e custa cerca de 3,8 vezes mais por tarefa, porque o modelo escreve cerca de 4,5 vezes mais tokens de saída. Comece com medium e aumente um caminho apenas quando seus próprios testes mostrarem que a qualidade extra importa.

Mais uma restrição: modelos de raciocínio rejeitam presencePenalty, frequencyPenalty e stop. Se um wrapper mais antigo ainda enviar algum deles, a requisição retorna um erro.

Passo 4: lide com o raciocínio criptografado em chamadas multi-turn

Esta é a mudança de comportamento mais provável de surpreendê-lo. Na API Responses, o grok-4.7 sempre retorna reasoning.encrypted_content, mesmo quando sua lista include não o solicita. Você não pode ler o raciocínio, mas pode levá-lo adiante.

Para conversas multi-turn, passe os itens de raciocínio da resposta anterior de volta inalterados no input da próxima requisição. Isso mantém o raciocínio do modelo intacto entre as turns. Não edite, corte ou reordene esses itens. Se seu código filtra o array output para itens message antes de construir a próxima turn, ele agora descarta o contexto que o Grok 4.7 espera receber de volta. O comportamento do Chat Completions permanece inalterado.

Passo 5: faça o cache funcionar para você

A entrada em cache custa US$ 0,50 por milhão de tokens, contra US$ 2 para entrada nova, um desconto de 75%. O problema: um acerto de cache exige que sua requisição chegue a um servidor que já contém o prefixo. A SpaceXAI "altamente recomenda" definir prompt_cache_key nas chamadas da API Responses (ou o cabeçalho x-grok-conv-id nas Chat Completions). Isso roteia as requisições de uma conversa para o mesmo servidor; sem ele, a xAI alerta, você frequentemente paga o preço total de entrada em um servidor sem cache.

Organize o prompt para reutilização: prompt do sistema, esquemas de ferramentas e documentos de referência primeiro, a nova mensagem do usuário por último. Qualquer coisa que mude perto do início quebra o prefixo e o desconto.

Passo 6: respostas em streaming

Adicione "stream": true para receber eventos enviados pelo servidor em vez de um único corpo JSON no final. Como o raciocínio está sempre ativado, o modelo pode pensar por um tempo antes do primeiro token de resposta, e uma chamada sem streaming pode parecer travada ou causar um timeout HTTP curto. O Grok 4.7 faz streaming de resumos de raciocínio, para que você possa mostrar o progresso enquanto ele pensa.

As chamadas de função são a exceção: de acordo com a documentação da xAI, uma chamada de função chega inteira em um único chunk. Analise-a quando esse chunk chegar, em vez de montar argumentos a partir de deltas. Nosso guia para testar APIs LLM que fazem streaming via SSE mostra como inspecionar a sequência de eventos brutos no Apidog.

Passo 7: adicione ferramentas

A chamada de função usa o formato de ferramenta da API Responses. Você descreve a função, o Grok retorna um item function_call, você o executa e envia de volta um function_call_output com o call_id correspondente:

curl https://api.x.ai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": [{"role": "user", "content": "Has order 10482 shipped yet?"}],
    "tools": [{
      "type": "function",
      "name": "get_order_status",
      "description": "Look up the fulfillment status of an order",
      "parameters": {
        "type": "object",
        "properties": { "order_id": {"type": "string"} },
        "required": ["order_id"]
      }
    }]
  }'

Saídas estruturadas também são suportadas, para que você possa manter a resposta final em um esquema JSON.

As ferramentas do lado do servidor são executadas no lado da xAI: {"type": "web_search"}, busca no X e execução de código. Elas são cobradas além dos tokens: a busca na web custa US$ 5 por 1.000 chamadas, a busca no X US$ 5 por 1.000 postagens e a execução de código US$ 5 por 1.000 chamadas, então um agente que pesquisa a cada turn paga essa taxa a cada turn. A busca na web aceita allowed_domains e excluded_domains (até cinco de cada). Sem uma ferramenta de busca, o Grok 4.7 não tem dados ao vivo; seu conhecimento para em maio de 2026.

Cuidado com o limite de preço de 200k

A tabela de preços tem duas linhas por um motivo. Uma vez que um prompt atinge 200.000 tokens, toda a requisição é cobrada pela taxa mais alta: US$ 4 de entrada, US$ 1 em cache, US$ 12 de saída. Não são apenas os tokens acima da linha que custam mais.

Um prompt de 190.000 tokens com uma resposta de 4.000 tokens custa cerca de US$ 0,40. Um prompt de 210.000 tokens com a mesma resposta custa cerca de US$ 0,89. Aproximadamente 10% mais de entrada mais do que dobra a conta.

Conte os tokens antes de enviar, resuma o histórico conforme uma conversa se aproxima do limite e use a compactação de contexto da xAI para loops de agente longos. A parte barata da janela de 500.000 tokens termina em 200.000.

Limites de taxa e 429s

Os limites escalam com seus gastos cumulativos e correspondem aos do Grok 4.6:

Nível (gasto cumulativo) Requisições por segundo Tokens por minuto
T0 (US$ 0) 150 50M
T1 (US$ 50) 172 53M
T2 (US$ 250) 208 60M
T3 (US$ 1.000) 312 74M
T4 (US$ 5.000) 500 100M

Tokens em cache contam para tokens por minuto. Se você exceder, receberá HTTP 429. Tente novamente com backoff exponencial e jitter em vez de sobrecarregar o endpoint; nosso guia para erros de limite de taxa excedido aborda os padrões.

Migrando do Grok 4.6

A maioria das integrações precisa de uma mudança: grok-4.6 se torna grok-4.7. Preço, janela de contexto, limites de taxa e níveis de esforço são idênticos. Re-teste três coisas antes de mover o tráfego de produção:

Nosso guia da API Grok 4.6 ainda é válido para tudo o que não mudou. Duas notas: https://us.api.x.ai/v1 mantém a inferência nos EUA por um prêmio de 10%, e o Grok 4.7 Fast (2x preço) está disponível apenas no Cursor e Grok Build, não na API pública.

Teste a API do Grok 4.7 no Apidog

Uma requisição salva e repetível supera um comando curl no histórico do seu shell quando você está comparando níveis de esforço ou verificando uma atualização.

  1. Crie um ambiente no Apidog com base_url definido como https://api.x.ai/v1 e XAI_API_KEY armazenado como uma variável secreta. Adicione um segundo ambiente para o endpoint dos EUA se precisar.
  2. Salve a requisição: POST {{base_url}}/responses com um cabeçalho Authorization: Bearer {{XAI_API_KEY}} e seu prompt real no corpo.
  3. Adicione asserções: o status é 200, model é igual a grok-4.7, usage existe e output contém um item message. Isso detecta uma chave errada, um ID de modelo errado ou um formato de resposta alterado antes que seu aplicativo o faça.
  4. Clone-o por nível de esforço (low, medium, high, xhigh) e execute os quatro como um cenário de teste. Você obtém tempo de resposta e uso de tokens lado a lado para seu prompt, e não para um benchmark.
  5. Simule o endpoint assim que o formato da resposta estiver estável, para que o trabalho de frontend continue sem gastar créditos.

Quando o próximo modelo for lançado, altere uma variável e execute novamente. Baixe o Apidog para configurá-lo.

FAQ

Qual é o ID do modelo Grok 4.7? grok-4.7. Em plataformas parceiras é spacexai/grok-4.7 (Vercel AI Gateway) e x-ai/grok-4.7 (OpenRouter).

Quanto custa a API do Grok 4.7? US$ 2 por milhão de tokens de entrada, US$ 0,50 em cache e US$ 6 de saída para prompts abaixo de 200.000 tokens, e o dobro disso em 200.000 e acima. Não há desconto em lote para o 4.7.

Posso desativar o raciocínio? Não. Use o esforço low para as respostas mais rápidas e baratas.

Existe uma API Grok 4.7 gratuita? A API da xAI funciona com créditos pré-pagos. Nosso guia sobre como usar o Grok 4.7 gratuitamente aborda as rotas sem custo que existem.

Como o Grok 4.7 se compara ao GPT-6 Sol e ao Claude Opus 5.5? Ele tem o menor preço de saída dos três e fica atrás do Opus 5.5 nos benchmarks de codificação que ambos os fornecedores relatam. A comparação entre os três tem os números.

Comece com uma requisição salva

Envie a requisição curl acima e, em seguida, salve-a no Apidog com asserções e um cenário de nível de esforço. Você obtém um custo base por tarefa em seus próprios prompts antes de mover o tráfego. Para escolher um nível de esforço padrão, leia a análise dos benchmarks do Grok 4.7 em seguida.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs