Para chamar o Grok 4.7, envie uma requisição POST para https://api.x.ai/v1/responses com "model": "grok-4.7" e sua chave xAI como um token Bearer. Custa US$ 2 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de entrada em cache e US$ 6 por milhão de tokens de saída para prompts abaixo de 200.000 tokens, com uma janela de contexto de 500.000 tokens. A SpaceXAI (a empresa anteriormente chamada xAI) o lançou em 21 de setembro de 2026, com o mesmo preço do Grok 4.6, então para a maioria das integrações existentes, a atualização é uma mudança de uma única linha.
Abaixo: a primeira requisição, esforço de raciocínio e seu impacto na sua conta, raciocínio criptografado, cache, streaming, ferramentas, limites de taxa e uma configuração de teste reutilizável no Apidog. Para saber mais sobre o modelo, leia o que é o Grok 4.7 e o que mudou; a referência oficial é a página do Grok 4.7 na documentação da xAI.
API do Grok 4.7 em resumo
| Propriedade | Valor |
|---|---|
| ID do Modelo | grok-4.7 |
| Endpoint | POST https://api.x.ai/v1/responses (Chat Completions ainda funciona como um endpoint legado) |
| Janela de contexto | 500.000 tokens |
| Limite de saída | Nenhum listado pela xAI |
| Entrada / cache / saída, abaixo de 200k | US$ 2,00 / US$ 0,50 / US$ 6,00 por 1M de tokens |
| Entrada / cache / saída, 200k e acima | US$ 4,00 / US$ 1,00 / US$ 12,00 por 1M de tokens |
| Esforço de raciocínio | low, medium, high (padrão), xhigh |
| Entradas | Texto e imagens (JPG ou PNG, até 20 MiB) |
| Ferramentas | Chamada de função, busca na web, busca no X, execução de código |
| Corte de conhecimento | Maio de 2026 |
| API em lote | Não suportado |
Passo 1: obtenha uma chave e carregue créditos
Crie uma conta em console.x.ai, carregue-a com créditos (a API é pré-paga) e gere uma chave. Nosso guia de chaves da API Grok mostra as telas do console. Mantenha a chave fora do seu código:
export XAI_API_KEY="your-key-here"
Passo 2: faça sua primeira requisição
A API Responses é o endpoint principal e o que todos os exemplos na documentação da xAI usam:
curl https://api.x.ai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4.7",
"input": "Review this function for bugs: function median(a){a.sort();return a[a.length/2]}"
}'
A API funciona com o SDK da OpenAI. Aponte o cliente para a URL base da xAI e chame responses.create:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.XAI_API_KEY,
baseURL: "https://api.x.ai/v1",
});
const response = await client.responses.create({
model: "grok-4.7",
reasoning: { effort: "medium" },
input: [
{ role: "system", content: "You are a senior backend reviewer." },
{ role: "user", content: "Find the bug in: function median(a){a.sort();return a[a.length/2]}" },
],
});
console.log(response.output_text);
Se preferir outro cliente, o mesmo modelo é grok-4.7 no SDK Python da xAI (xai_sdk), xai.responses('grok-4.7') no Vercel AI SDK e xai/grok-4.7 no LiteLLM. Duas notas de compatibilidade: a xAI agora rotula as Chat Completions como um endpoint legado, e sua compatibilidade com o SDK da Anthropic está totalmente depreciada. O novo código deve visar /v1/responses.
Passo 3: escolha um nível de esforço de raciocínio
O Grok 4.7 sempre raciocina. Você não pode desativá-lo, mas controla o quão intensamente ele pensa com reasoning.effort na API Responses (reasoning_effort no SDK da xAI): low para chamadas de ferramentas sensíveis à latência, medium para análise e contexto longo, high (o padrão) para problemas complexos de múltiplas etapas e xhigh quando a qualidade supera o tempo de resposta.
Esta configuração é a maior alavanca na sua conta. A página de lançamento da SpaceXAI publica os resultados do CursorBench 4.0 por nível de esforço, e a diferença é grande:
| Esforço | CursorBench 4.0 | Custo médio por tarefa | Tokens de saída médios por tarefa |
|---|---|---|---|
| low | 33.1% | US$ 1,58 | 15.677 |
| medium | 41.6% | US$ 3,49 | 36.683 |
| high | 43.9% | US$ 4,69 | 56.382 |
| xhigh | 46.3% | US$ 6,01 | 70.141 |
Passar de low para xhigh compra 13,2 pontos e custa cerca de 3,8 vezes mais por tarefa, porque o modelo escreve cerca de 4,5 vezes mais tokens de saída. Comece com medium e aumente um caminho apenas quando seus próprios testes mostrarem que a qualidade extra importa.
Mais uma restrição: modelos de raciocínio rejeitam presencePenalty, frequencyPenalty e stop. Se um wrapper mais antigo ainda enviar algum deles, a requisição retorna um erro.
Passo 4: lide com o raciocínio criptografado em chamadas multi-turn
Esta é a mudança de comportamento mais provável de surpreendê-lo. Na API Responses, o grok-4.7 sempre retorna reasoning.encrypted_content, mesmo quando sua lista include não o solicita. Você não pode ler o raciocínio, mas pode levá-lo adiante.
Para conversas multi-turn, passe os itens de raciocínio da resposta anterior de volta inalterados no input da próxima requisição. Isso mantém o raciocínio do modelo intacto entre as turns. Não edite, corte ou reordene esses itens. Se seu código filtra o array output para itens message antes de construir a próxima turn, ele agora descarta o contexto que o Grok 4.7 espera receber de volta. O comportamento do Chat Completions permanece inalterado.
Passo 5: faça o cache funcionar para você
A entrada em cache custa US$ 0,50 por milhão de tokens, contra US$ 2 para entrada nova, um desconto de 75%. O problema: um acerto de cache exige que sua requisição chegue a um servidor que já contém o prefixo. A SpaceXAI "altamente recomenda" definir prompt_cache_key nas chamadas da API Responses (ou o cabeçalho x-grok-conv-id nas Chat Completions). Isso roteia as requisições de uma conversa para o mesmo servidor; sem ele, a xAI alerta, você frequentemente paga o preço total de entrada em um servidor sem cache.
Organize o prompt para reutilização: prompt do sistema, esquemas de ferramentas e documentos de referência primeiro, a nova mensagem do usuário por último. Qualquer coisa que mude perto do início quebra o prefixo e o desconto.
Passo 6: respostas em streaming
Adicione "stream": true para receber eventos enviados pelo servidor em vez de um único corpo JSON no final. Como o raciocínio está sempre ativado, o modelo pode pensar por um tempo antes do primeiro token de resposta, e uma chamada sem streaming pode parecer travada ou causar um timeout HTTP curto. O Grok 4.7 faz streaming de resumos de raciocínio, para que você possa mostrar o progresso enquanto ele pensa.
As chamadas de função são a exceção: de acordo com a documentação da xAI, uma chamada de função chega inteira em um único chunk. Analise-a quando esse chunk chegar, em vez de montar argumentos a partir de deltas. Nosso guia para testar APIs LLM que fazem streaming via SSE mostra como inspecionar a sequência de eventos brutos no Apidog.
Passo 7: adicione ferramentas
A chamada de função usa o formato de ferramenta da API Responses. Você descreve a função, o Grok retorna um item function_call, você o executa e envia de volta um function_call_output com o call_id correspondente:
curl https://api.x.ai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4.7",
"input": [{"role": "user", "content": "Has order 10482 shipped yet?"}],
"tools": [{
"type": "function",
"name": "get_order_status",
"description": "Look up the fulfillment status of an order",
"parameters": {
"type": "object",
"properties": { "order_id": {"type": "string"} },
"required": ["order_id"]
}
}]
}'
Saídas estruturadas também são suportadas, para que você possa manter a resposta final em um esquema JSON.
As ferramentas do lado do servidor são executadas no lado da xAI: {"type": "web_search"}, busca no X e execução de código. Elas são cobradas além dos tokens: a busca na web custa US$ 5 por 1.000 chamadas, a busca no X US$ 5 por 1.000 postagens e a execução de código US$ 5 por 1.000 chamadas, então um agente que pesquisa a cada turn paga essa taxa a cada turn. A busca na web aceita allowed_domains e excluded_domains (até cinco de cada). Sem uma ferramenta de busca, o Grok 4.7 não tem dados ao vivo; seu conhecimento para em maio de 2026.
Cuidado com o limite de preço de 200k
A tabela de preços tem duas linhas por um motivo. Uma vez que um prompt atinge 200.000 tokens, toda a requisição é cobrada pela taxa mais alta: US$ 4 de entrada, US$ 1 em cache, US$ 12 de saída. Não são apenas os tokens acima da linha que custam mais.
Um prompt de 190.000 tokens com uma resposta de 4.000 tokens custa cerca de US$ 0,40. Um prompt de 210.000 tokens com a mesma resposta custa cerca de US$ 0,89. Aproximadamente 10% mais de entrada mais do que dobra a conta.
Conte os tokens antes de enviar, resuma o histórico conforme uma conversa se aproxima do limite e use a compactação de contexto da xAI para loops de agente longos. A parte barata da janela de 500.000 tokens termina em 200.000.
Limites de taxa e 429s
Os limites escalam com seus gastos cumulativos e correspondem aos do Grok 4.6:
| Nível (gasto cumulativo) | Requisições por segundo | Tokens por minuto |
|---|---|---|
| T0 (US$ 0) | 150 | 50M |
| T1 (US$ 50) | 172 | 53M |
| T2 (US$ 250) | 208 | 60M |
| T3 (US$ 1.000) | 312 | 74M |
| T4 (US$ 5.000) | 500 | 100M |
Tokens em cache contam para tokens por minuto. Se você exceder, receberá HTTP 429. Tente novamente com backoff exponencial e jitter em vez de sobrecarregar o endpoint; nosso guia para erros de limite de taxa excedido aborda os padrões.
Migrando do Grok 4.6
A maioria das integrações precisa de uma mudança: grok-4.6 se torna grok-4.7. Preço, janela de contexto, limites de taxa e níveis de esforço são idênticos. Re-teste três coisas antes de mover o tráfego de produção:
- Manipulação de múltiplas turns. Confirme se seu código passa os itens de raciocínio criptografados de volta inalterados.
- Tokens por tarefa. Um novo modelo base, maior, muda quantos tokens uma tarefa consome, mesmo com a mesma taxa por token. Meça seus prompts reais.
- Mapeamento de esforço. A documentação do Cursor diz que os níveis de esforço são mais separados do que no Grok 4.6, então uma rota ajustada para
mediumpode se comportar de forma diferente.
Nosso guia da API Grok 4.6 ainda é válido para tudo o que não mudou. Duas notas: https://us.api.x.ai/v1 mantém a inferência nos EUA por um prêmio de 10%, e o Grok 4.7 Fast (2x preço) está disponível apenas no Cursor e Grok Build, não na API pública.
Teste a API do Grok 4.7 no Apidog
Uma requisição salva e repetível supera um comando curl no histórico do seu shell quando você está comparando níveis de esforço ou verificando uma atualização.
- Crie um ambiente no Apidog com
base_urldefinido comohttps://api.x.ai/v1eXAI_API_KEYarmazenado como uma variável secreta. Adicione um segundo ambiente para o endpoint dos EUA se precisar. - Salve a requisição:
POST {{base_url}}/responsescom um cabeçalhoAuthorization: Bearer {{XAI_API_KEY}}e seu prompt real no corpo. - Adicione asserções: o status é 200,
modelé igual agrok-4.7,usageexiste eoutputcontém um itemmessage. Isso detecta uma chave errada, um ID de modelo errado ou um formato de resposta alterado antes que seu aplicativo o faça. - Clone-o por nível de esforço (
low,medium,high,xhigh) e execute os quatro como um cenário de teste. Você obtém tempo de resposta e uso de tokens lado a lado para seu prompt, e não para um benchmark. - Simule o endpoint assim que o formato da resposta estiver estável, para que o trabalho de frontend continue sem gastar créditos.
Quando o próximo modelo for lançado, altere uma variável e execute novamente. Baixe o Apidog para configurá-lo.
FAQ
Qual é o ID do modelo Grok 4.7? grok-4.7. Em plataformas parceiras é spacexai/grok-4.7 (Vercel AI Gateway) e x-ai/grok-4.7 (OpenRouter).
Quanto custa a API do Grok 4.7? US$ 2 por milhão de tokens de entrada, US$ 0,50 em cache e US$ 6 de saída para prompts abaixo de 200.000 tokens, e o dobro disso em 200.000 e acima. Não há desconto em lote para o 4.7.
Posso desativar o raciocínio? Não. Use o esforço low para as respostas mais rápidas e baratas.
Existe uma API Grok 4.7 gratuita? A API da xAI funciona com créditos pré-pagos. Nosso guia sobre como usar o Grok 4.7 gratuitamente aborda as rotas sem custo que existem.
Como o Grok 4.7 se compara ao GPT-6 Sol e ao Claude Opus 5.5? Ele tem o menor preço de saída dos três e fica atrás do Opus 5.5 nos benchmarks de codificação que ambos os fornecedores relatam. A comparação entre os três tem os números.
Comece com uma requisição salva
Envie a requisição curl acima e, em seguida, salve-a no Apidog com asserções e um cenário de nível de esforço. Você obtém um custo base por tarefa em seus próprios prompts antes de mover o tráfego. Para escolher um nível de esforço padrão, leia a análise dos benchmarks do Grok 4.7 em seguida.
