Grok 4.7 é o mais barato dos três em tokens de saída (US$ 6 por milhão, contra US$ 10 para GPT-6 Sol e US$ 20 para Claude Opus 5.5), e o Opus 5.5 lidera em todos os benchmarks de codificação onde dois desses fornecedores publicam o mesmo nome. No Índice de Inteligência da Artificial Analysis, um composto de terceiros, a ordem é Opus 5.5 com 58, Sol com 48 e Grok 4.7 com 46. Qual custa menos para você depende do cache e de quantos tokens cada modelo gasta por tarefa; em uma carga de trabalho de agente com muito cache, o Sol supera o Grok.
Todos os três foram lançados em cerca de 36 horas. A SpaceXAI lançou o Grok 4.7 em 21 de setembro de 2026, e a Anthropic e a OpenAI lançaram o Opus 5.5 e o Sol em 22 de setembro. Esse momento criou um problema que você deve saber antes de ler qualquer comparação, incluindo esta. Abaixo: a folha de especificações, as linhas de benchmark que se sobrepõem, o cálculo de preços com e sem cache, conselhos de roteamento e uma maneira de testar os três em um único projeto Apidog. Para cada modelo individualmente, veja o que é o Grok 4.7, o que é o GPT-6 Sol, e o que é o Claude Opus 5.5.
Ninguém comparou esses três entre si
Cada lançamento compara-se com modelos que existiam quando foi escrito:
- A publicação do Grok 4.7 da SpaceXAI compara-se com Grok 4.6, GPT-5.6 Sol e Claude Fable 5.1, além de GPT-6 Astra em dois gráficos. Preste atenção ao nome: GPT-5.6 Sol é a geração anterior, listada por US$ 4/US$ 20 naquela página, e não o GPT-6 Sol lançado no dia seguinte.
- O lançamento do Sol da OpenAI compara-se com Claude Opus 5, que o Opus 5.5 substituiu horas depois.
- O lançamento do Opus 5.5 da Anthropic publica pontuações sem colunas de concorrentes.
Portanto, nenhuma tabela de fornecedor contém os três. O que você pode fazer é alinhar as linhas que compartilham um nome de benchmark, lê-las como uma direção em vez de um ranking, e usar um índice de terceiros como desempate. Nossa análise de GPT-6 Sol vs Claude Opus 5.5 aprofunda-se nesse par.
A folha de especificações
| Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|---|
| ID do modelo API | grok-4.7 |
gpt-6-sol |
claude-opus-5-5 |
| Lançado | 21 de setembro de 2026 | 22 de setembro de 2026 | 22 de setembro de 2026 |
| Entrada / saída por 1M | $2 / $6 | $2 / $10 | $4 / $20 |
| Leitura de entrada em cache por 1M | $0.50 | $0.20 (90% off) | $0.20 |
| Janela de contexto | 500.000 | 872.000 | 1.000.000 |
| Saída máxima | não listado | não informado | 128.000 |
| Índice de Inteligência AA (terceiros) | 46 (#21 de 211) | 48 | 58 (#1 de 212) |
| Velocidade de saída AA (terceiros) | 82.6 tokens/s em xhigh | 115.2 tokens/s no máximo, 102 s para o primeiro token | não está em nossas fontes |
| Onde chamar | API da xAI, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel | API da OpenAI, ChatGPT Work, Codex | Plataforma Claude, AWS, Google Cloud, Azure |
Duas linhas decidem a maioria das cargas de trabalho. Preço de saída: Os US$ 6 do Grok 4.7 estão 40% abaixo do Sol e 70% abaixo do Opus 5.5, e isso é importante para modelos de raciocínio porque os tokens de "pensamento" são cobrados como saída. Contexto: Grok 4.7 tem a menor janela, e a xAI cobra a requisição inteira com taxas dobradas (US$ 4 de entrada, US$ 12 de saída) assim que um prompt atinge 200.000 tokens.
Os benchmarks que se sobrepõem
Essas linhas compartilham um nome de benchmark entre as folhas dos fornecedores. Cada fornecedor executou seu próprio modelo em sua própria estrutura com sua própria configuração de esforço, então pequenas lacunas são ruído. Grandes lacunas ainda lhe dizem algo.
| Benchmark (executado pelo fornecedor) | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 37.6% (xhigh) | não publicado | 66.4% |
| CursorBench 4.0 | 46.3% (xhigh) | não publicado | 57.8% |
| DeepSWE v1.1 | 71.0% (high) | 68.8% (max) | não publicado |
| GDPval, Elo | 1,695 (xhigh) | não publicado | 1,846 (GDPval-AA v2.1) |
Como ler:
- O trabalho de terminal favorece o Opus 5.5 por uma ampla margem. Uma diferença de 28,8 pontos no Terminal-Bench 4.0 é muito grande para ser explicada apenas com diferenças de estrutura. Os 37,6% do Grok 4.7 são um grande salto dos 20,3% do Grok 4.6, e ainda bem atrás.
- O CursorBench aponta para a mesma direção com 11,5 pontos.
- DeepSWE é um empate. Grok 4.7 com alto esforço e Sol no máximo ficam a 2,2 pontos de diferença, dentro do que diferentes estruturas produzem.
- As versões do GDPval podem diferir. O gráfico do Grok não especifica uma, então trate a diferença de 151 pontos como uma dica.
O Grok 4.7 lidera em duas avaliações de sua própria folha: o Harvey’s Legal Agent Benchmark com 19,6% (GPT-5.6 Sol 2.5%, Fable 5.1 6.7%) e o EEBench, uma avaliação de engenharia elétrica, com 64,0% (Fable 5.1 56.4%; GPT-6 Astra 69.3% no mesmo gráfico). Nem Sol nem Opus 5.5 têm uma pontuação publicada em nenhum dos dois, então leia-os como sinais para trabalho de conhecimento jurídico e de engenharia, não como vitórias sobre esses dois rivais.
Uma estrutura independente executa dois dos três da mesma forma. No SWE-Together, 109 tarefas de repositório reais executadas por uma única estrutura de agente, o Opus 5.5 pontua 68,8% pass@1 e o Grok 4.7 64,7%, cerca de 4 pontos de diferença em vez dos 29 no Terminal-Bench. O GPT-6 Sol ainda não está listado lá. O Grok 4.7 também gastou US$ 7,81 por tarefa nesse placar, então seu preço por token não o tornou barato por tarefa.
O índice de terceiros concorda com a ordem geral: Opus 5.5 58, Sol 48, Grok 4.7 46. Para cada linha e ressalva do lado do Grok, veja nossa análise dos benchmarks do Grok 4.7, que também aborda um relatório do mantenedor de benchmark de que o Grok 4.7 contornou seu sandbox para buscar correções upstream.
Quanto cada um custa em uma carga de trabalho real
Os preços por token contam apenas parte da história. Aqui está a aritmética sobre as taxas publicadas para dois tipos de carga de trabalho com 1.000 execuções por dia. As escritas em cache são excluídas; o Opus 5.5 cobra US$ 5 por milhão por elas.
Loop de agente, amigável ao cache: 50.000 tokens de entrada por execução, 45.000 deles um prefixo estável (prompt do sistema, esquemas de ferramentas, documentos), mais 3.000 tokens de saída.
| Custo diário | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Sem acertos de cache | $118.00 | $130.00 | $260.00 |
| Prefixo em cache | $50.50 | $49.00 | $89.00 |
Sem cache, o Grok 4.7 é o mais barato. Com o prefixo em cache, o Sol avança, porque suas leituras em cache custam US$ 0,20 por milhão contra os US$ 0,50 do Grok. Quanto mais seus prompts se repetem, menos o desconto de saída do Grok ajuda.
Tarefa com raciocínio intenso: 10.000 tokens de entrada e 20.000 tokens de saída por execução.
| Custo diário | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Sem cache | $140 | $220 | $440 |
Aqui o preço de saída domina: o Grok 4.7 custa cerca de 64% do Sol e 32% do Opus 5.5.
Ambas as tabelas assumem que cada modelo gasta o mesmo número de tokens, e eles não gastam. Os próprios dados do CursorBench da SpaceXAI mostram que o Grok 4.7 tem uma média de 70.141 tokens de saída por tarefa em nível xhigh e 15.677 em nível baixo. Um modelo que precisa do dobro de tokens perde sua vantagem de preço. O custo por tarefa concluída em seus prompts decide isso; nossa análise da guerra de preços de modelos de IA explica por que os fornecedores começaram a publicar essa métrica.
Para qual rotear
Comece pela carga de trabalho e depois teste:
- O Grok 4.7 se encaixa em loops de agente com muita saída, raciocínio sensível ao orçamento, trabalho de conhecimento jurídico e de engenharia, e equipes já em Cursor, GitHub Copilot ou Grok Build, onde está a uma simples mudança de modelo. Mantenha os prompts abaixo de 200.000 tokens.
- O Claude Opus 5.5 se encaixa nas tarefas de codificação e terminal mais difíceis, onde sua liderança é mais ampla, e em qualquer coisa que precise de uma janela de 1M ou saídas de 128.000 tokens. Ele também rodou na AWS, Google Cloud e Azure desde o primeiro dia, o que ajuda se a aquisição for importante.
- O GPT-6 Sol se encaixa em agentes e automação com muito cache, além de prompts entre 200.000 e 872.000 tokens. Considere o tempo de 102 segundos para o primeiro token que a Artificial Analysis mediu no esforço máximo; nosso guia de latência do Sol cobre os timeouts.
- O GPT-6 Luna, a US$ 0,10/US$ 0,50, entra na conversa para extração e classificação de alto volume, onde nenhum dos três acima é rentável.
Muitas equipes executarão dois desses modelos atrás de um roteador: um padrão barato e um caminho de escalonamento caro para as tarefas que falham.
Teste os três em um único projeto Apidog
A comparação que importa são seus prompts em sua estrutura. O Apidog transforma isso em um teste salvo em vez de um projeto de fim de semana:
- Crie três ambientes, um por provedor, cada um contendo
base_url, a chave API como segredo emodel. Grok 4.7 e GPT-6 Sol usam a API de Respostas (POST {{base_url}}/responsescom um campoinput), então uma definição de requisição cobre ambos. Opus 5.5 usa a API de Mensagens da Anthropic (POST /v1/messagescommessages, ummax_tokensobrigatório e cabeçalhosx-api-keymaisanthropic-version), então dê a ele sua própria requisição. - Use o mesmo texto de prompt em cada requisição, extraído de uma variável compartilhada para que não haja desvios.
- Adicione asserções para status 200, uma resposta não vazia e a presença de
usage.input_tokenseusage.output_tokens. - Execute-os como um cenário de teste e compare o tempo de resposta, a contagem de tokens e a saída lado a lado. Multiplique os tokens pelas linhas de preço acima para obter o custo por execução em sua tarefa.
Execute-o no nível de esforço que você usaria em produção, não no que está no gráfico de benchmark. Baixe o Apidog para construí-lo.
FAQ
O Grok 4.7 é melhor que o GPT-6? Não pelos números disponíveis. O índice da Artificial Analysis coloca o GPT-6 Sol em 48 e o Grok 4.7 em 46, e a OpenAI chama o GPT-6 Astra de seu melhor modelo. O Grok 4.7 é mais barato na saída e lidera em suas próprias avaliações jurídicas e de engenharia.
O Grok 4.7 é melhor que o Claude Opus 5.5? O Opus 5.5 lidera no Terminal-Bench 4.0 (66,4% vs 37,6%) e CursorBench 4.0 (57,8% vs 46,3%) e ocupa o primeiro lugar no índice da Artificial Analysis. O Grok 4.7 custa metade na entrada e menos de um terço na saída.
Qual é o mais barato? Por token, Grok 4.7 na saída, empatado com Sol na entrada. Com cache de prompts intenso, o Sol pode sair na frente porque suas leituras em cache custam US$ 0,20 por milhão contra os US$ 0,50 do Grok.
Posso experimentar os três de graça? Cada um tem rotas limitadas e sem custo. Veja como usar o Grok 4.7 de graça, GPT-6 Sol de graça e Claude Opus 5.5 de graça.
Como chamo o Grok 4.7 via código? POST https://api.x.ai/v1/responses com "model": "grok-4.7". O guia da API do Grok 4.7 tem exemplos de curl e SDK.
Decida com seus próprios números
Escolha os dois modelos que sua carga de trabalho aponta, salve o mesmo prompt para ambos no Apidog e execute-o no nível de esforço de sua produção. Compare o custo por tarefa concluída e a latência, então roteie. Quando o próximo modelo for lançado, adicione um ambiente e execute novamente.
