A xAI lançou o Grok 4.3 em fases: beta em 17 de abril de 2026, acesso à API em 30 de abril e disponibilidade geral completa em 6 de maio. A proposta é direta: uma janela de contexto de 1.000.000 de tokens, entrada de vídeo nativa pela primeira vez na linha Grok, raciocínio sempre ativo e um corte de preço de aproximadamente 40% em relação ao Grok 4.20. Oito modelos Grok legados serão desativados em 15 de maio, então qualquer pessoa que utilize as séries grok-3 ou grok-4 deve planejar uma migração esta semana.
Este guia cobre como chamar o Grok 4.3 a partir do seu código: formato do endpoint, autenticação, a URL base compatível com OpenAI, o parâmetro de esforço de raciocínio, entrada de vídeo, chamada de funções e uma configuração de teste funcional no Apidog.
Para o lado de voz do mesmo lançamento, consulte Como usar o Grok Voice gratuitamente. Para a comparação direta contra o modelo de voz principal da OpenAI, consulte Grok Voice vs GPT-Realtime.
TL;DR
- O Grok 4.3 foi lançado para disponibilidade geral em 6 de maio de 2026. Oito modelos legados serão desativados em 15 de maio de 2026.
- Preços: US$1,25 por 1M de tokens de entrada, US$2,50 por 1M de tokens de saída, entrada em cache US$0,20 por 1M. Aproximadamente um corte de 40% em relação ao Grok 4.20.
- Janela de contexto de 1M de tokens. Entrada de vídeo nativa. Raciocínio sempre ativo.
- Esforço de raciocínio:
low/medium/high. O padrão émedium. - Endpoint:
https://api.x.ai/v1/chat/completions(URL base compatível com OpenAI). - Vazão: ~159 tokens/segundo em níveis padrão.
- Índice de Inteligência 53 (Análise Artificial), classificado em 10º lugar entre 146 modelos globalmente.
- Use o Apidog para roteirizar a requisição, manter as configurações de raciocínio como variáveis e reproduzir em ambos os modos de compatibilidade Grok e OpenAI.
O que mudou no Grok 4.3
As principais atualizações, em ordem de impacto para a maioria das equipes:
- Queda de 40% no preço. A entrada caiu 37,5% em relação ao Grok 4.20; a saída caiu 58,3%. A taxa de entrada em cache agora é de US$0,20/1M, um corte agressivo que torna os prompts de sistema longos e estáveis muito mais baratos.
- Contexto de 1M de tokens. Aumentou de 256k no Grok 4.20. Suficiente para caber uma base de código de tamanho médio, uma chamada de lucros completa ou um contrato legal completo em um único prompt.
- Entrada de vídeo nativa. Pela primeira vez na linha Grok. Passe uma URL de vídeo e o modelo raciocina sobre os frames nativamente.
- Raciocínio sempre ativo. O Grok 4.3 vem com uma etapa de raciocínio base em cada requisição. O parâmetro
reasoning_effortescala a profundidade, mas o modelo nunca raciocina menos do quelow. - Grande ganho agêntico. +300 pontos Elo no GDPval-AA em comparação com o Grok 4.20. O despacho de ferramentas e os fluxos de trabalho de várias etapas se comportam notavelmente melhor.
O Índice de Inteligência de 53 (Análise Artificial) coloca o Grok 4.3 acima da média de 35 para sua faixa de preço, e em décimo lugar entre 146 modelos monitorados.
Pré-requisitos
Antes da primeira requisição, prepare quatro coisas:
- Uma conta xAI Console em
console.x.ai. O mesmo fluxo de login do Grok Voice. - Um nível de faturamento com uma chave de API. Chaves com escopo de projeto são recomendadas para produção.
- O SDK da OpenAI (Grok 4.3 é compatível com OpenAI) ou o SDK da xAI. Ambos funcionam.
- Um cliente de API que pode reproduzir requisições sem lotar seu terminal.

Exporte a chave uma vez:
export XAI_API_KEY="xai-..."
Endpoint e autenticação
O Grok 4.3 é fornecido na superfície de Completions de Chat compatível com OpenAI, com a URL base da xAI.
POST https://api.x.ai/v1/chat/completions
A autenticação é um token de portador (bearer token). Os cabeçalhos são padrão:
Authorization: Bearer $XAI_API_KEY
Content-Type: application/json
A compatibilidade com OpenAI significa que você pode usar o SDK Python ou Node da OpenAI e mudar a base_url. Esse é o caminho de menor resistência para a maioria das equipes que migram do gpt-4 ou gpt-5.
from openai import OpenAI
client = OpenAI(
api_key=os.environ["XAI_API_KEY"],
base_url="https://api.x.ai/v1",
)
response = client.chat.completions.create(
model="grok-4.3",
messages=[
{"role": "user", "content": "Resuma os prós e contras de GraphQL vs REST em três tópicos."}
],
reasoning_effort="medium",
)
print(response.choices[0].message.content)
Se preferir o SDK da xAI, o formato da chamada é o mesmo; a única mudança é a importação.
Parâmetros da requisição
O mapa completo de parâmetros para o Grok 4.3:
| Parâmetro | Tipo | Valores | Observações |
|---|---|---|---|
model |
string | grok-4.3 |
Obrigatório. |
messages |
array | Formato de mensagem OpenAI | Obrigatório. Suporta role: system / user / assistant. |
reasoning_effort |
string | low, medium, high |
Opcional. Padrão: medium. Níveis mais altos aumentam a latência e os tokens de saída. |
max_tokens |
int | 1–32768 | Limita a saída. |
temperature |
float | 0.0–2.0 | Padrão 1.0. |
top_p |
float | 0.0–1.0 | Amostragem de núcleo. |
stream |
bool | true / false | Eventos enviados pelo servidor quando verdadeiro. |
tools |
array | Formato de ferramenta OpenAI | Chamada de função. |
tool_choice |
string / object | auto, none, ou ferramenta específica |
Semântica padrão OpenAI. |
response_format |
object | { type: "json_object" } |
Saída estruturada. |
seed |
int | qualquer | Para reprodutibilidade em temperature: 0. |
Uma requisição curl funcional:
curl https://api.x.ai/v1/chat/completions \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.3",
"messages": [
{"role": "system", "content": "Você é um engenheiro de backend sênior."},
{"role": "user", "content": "Analise este plano de consulta e aponte o gargalo."}
],
"reasoning_effort": "high"
}'
A resposta segue o formato padrão da OpenAI: choices[].message.content, mais um objeto usage com prompt_tokens, completion_tokens, reasoning_tokens e total_tokens detalhados.
Esforço de raciocínio
Três níveis, com orientação concreta:
low. Use para classificação, sumarização, extração de regras, Q&A simples. A latência é baixa, a saída é direta.medium. Padrão. Use para atendimento ao cliente, chamada de funções, análise de dados, uso de ferramentas de uma única etapa. A profundidade do raciocínio é suficiente para a maioria do tráfego de produção.high. Use para agentes de múltiplas etapas, revisão de código de cadeia longa, matemática complexa e tarefas onde o modelo precisa planejar antes de responder.
O raciocínio sempre ativo significa que mesmo low realiza algum pensamento; é isso que impulsiona o ganho de precisão factual em relação ao Grok 4.20. Não espere economizar dinheiro evitando o raciocínio completamente; ele está incorporado.
Chamada de funções
O formato padrão da OpenAI funciona diretamente. Declare as ferramentas, o modelo emite um array tool_calls na mensagem do assistente, você executa, você responde com uma mensagem de role tool:
tools = [{
"type": "function",
"function": {
"name": "lookup_user",
"description": "Procura um usuário por ID.",
"parameters": {
"type": "object",
"properties": {"user_id": {"type": "string"}},
"required": ["user_id"],
},
},
}]
response = client.chat.completions.create(
model="grok-4.3",
messages=[{"role": "user", "content": "Encontre o usuário u_42 e me diga o último login dele."}],
tools=tools,
reasoning_effort="medium",
)
tool_calls = response.choices[0].message.tool_calls
O ganho de 300 pontos Elo no GDPval-AA se manifesta aqui na prática; o Grok 4.3 escolhe ferramentas melhores, faz menos chamadas redundantes e se recupera de um erro de ferramenta sem travar. Se você estiver testando fluxos de ferramentas, o teste de servidor MCP no Apidog cobre a configuração de repetição que usamos internamente.
Entrada de vídeo
O Grok 4.3 é o primeiro modelo Grok com entrada de vídeo nativa. Passe uma URL de vídeo dentro de um bloco de conteúdo:
response = client.chat.completions.create(
model="grok-4.3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Descreva o que acontece neste clipe e aponte quaisquer anomalias."},
{"type": "video_url", "video_url": {"url": "https://example.com/clip.mp4"}},
],
}],
)
Os tokens de vídeo contam para o medidor de entrada. Clipes longos consomem o contexto rapidamente; faça o downsample ou corte antes de enviar se o custo for um fator. O modelo raciocina sobre os frames nativamente, então você não precisa extrair keyframes manualmente.
Contexto de 1M de tokens
A janela de contexto de 1M é uma ferramenta de produção real, não um troféu de benchmark. Padrões comuns:
- Revisão de código de toda a base. Concatene o diff, todos os arquivos modificados e a saída do linter. Peça ao Grok para revisar.
- QA de documentos longos. Insira um contrato de 200 páginas e faça perguntas direcionadas.
- Memória de conversação. Mantenha um mês inteiro de conversas do agente em contexto para personalização.
A entrada em cache a US$0,20/1M torna isso acessível. Um prompt de sistema de 400k tokens que você mantém estável consome US$0,08 por chamada em cache em vez de US$0,50 recém-processado.
Migração de modelos Grok legados
Oito modelos Grok legados serão desativados em 15 de maio de 2026, 12:00 PM PT. Se você estiver usando qualquer um deles, troque a string do model para grok-4.3 antes do prazo. A maioria das chamadas funcionará sem mais alterações, pois o formato da requisição permanece o mesmo.
Duas coisas para observar:
- Esforço de raciocínio. Alguns modelos legados não aceitavam
reasoning_effort. O Grok 4.3 sempre raciocina; se seu código anterior dependia de um caminho rápido sem raciocínio, aceite o aumento da latência ou permaneça emlow. - Formatação de saída. O Grok 4.3 é mais estruturado que o Grok 4.20 por padrão. Se você usou pós-processamento pesado com regex, reteste antes de trocar.
Para a comparação completa de preços em toda a linha OpenAI, consulte Preços do GPT-5.5; para os modelos de raciocínio diretos, consulte Como usar a API do GPT-5.5.
Testando no Apidog
A maneira mais rápida de validar o Grok 4.3 em relação ao seu próprio caso de uso:
- Crie um ambiente Apidog com
XAI_API_KEYeBASE_URL = https://api.x.ai/v1. - Salve uma coleção de requisições com três variantes: raciocínio
low,medium,high. O mesmo prompt, esforço diferente. - Execute todas as três. Compare a resposta, a latência e a contagem de
usage.reasoning_tokenslado a lado. - Adicione uma quarta variante apontando para a URL base da OpenAI para comparar o Grok 4.3 com o GPT-5.5 em entrada idêntica. Mesmo SDK, modelo e URL base diferentes.
Baixe o Apidog para executar a comparação. A coleção é facilmente portável quando você troca de provedores, o que é o objetivo. Para uma estratégia de teste de API mais ampla, consulte Ferramenta de teste de API para engenheiros de QA.

Limites de taxa
Os limites de nível no Console da xAI variam de uma linha de base de alguns milhares de requisições por minuto no Nível 1 a centenas de milhares em níveis corporativos. Os números concretos mudam; verifique o painel do console. A vazão de 159 tokens/segundo que a xAI anuncia é a velocidade de saída por stream, não agregada; requisições concorrentes escalam linearmente dentro dos limites de nível.
Se você atingir os limites de taxa, a API retorna um 429 com um cabeçalho retry-after. O backoff exponencial padrão lida com isso.
FAQ
O Grok 4.3 é totalmente compatível com OpenAI? Para Completions de Chat, sim. Use o SDK da OpenAI, mude a base_url, mude o model. Chamada de funções, saída estruturada e streaming funcionam todos de forma idêntica.
Ele suporta a Responses API? A superfície da xAI hoje é Chat Completions. A Responses API é exclusiva da OpenAI.
Qual é o limite real de contexto na prática? 1.000.000 de tokens. Entradas longas custam dinheiro real mesmo a US$1,25/1M; faça cache agressivamente se seu prompt for estável.
Como o raciocínio sempre ativo afeta a latência? A latência do primeiro token é ligeiramente maior do que em modelos sem raciocínio, mas o Grok 4.3 transmite a saída a ~159 tokens/segundo, então o tempo de resposta ponta a ponta é competitivo. A compensação vale a pena para cargas de trabalho sensíveis à precisão.
Posso usar o Grok 4.3 com o Grok Voice? Sim. O agente de voz (grok-voice-think-fast-1.0) chama o Grok 4.3 internamente quando raciocina. Você também pode chamar o Grok 4.3 diretamente de um loop de voz que você construir sobre primitivos de TTS e STT.
O que acontece com minhas chamadas antigas do Grok 3 / Grok 4 após 15 de maio? Elas falharão com um 410 (modelo desativado). Migre antes do prazo.
O Grok 4.3 suporta entrada de imagem? Sim, junto com a nova entrada de vídeo. Passe uma URL de imagem em um bloco de conteúdo, no mesmo formato que o OpenAI.
Conclusão
O Grok 4.3 é o movimento de preço-desempenho mais agressivo que a xAI lançou. O corte de 40%, o contexto de 1M, o raciocínio sempre ativo e o vídeo nativo juntos o tornam uma ferramenta séria para a maioria das cargas de trabalho de agentes no dia a dia. A compatibilidade com OpenAI significa que a migração é uma mudança de URL base, não uma reescrita.
O caminho de validação mais rápido: roteirize três variantes de raciocínio no Apidog, insira seus prompts reais, meça a latência e os tokens de raciocínio. Migre antes de 15 de maio.
