Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5: Preço, Benchmarks e Qual Escolher

Grok 4.7 x GPT-6 Sol x Claude Opus 5.5: preços, contexto, os benchmarks que se sobrepõem, cálculos de cache em cargas de trabalho reais, e para qual rotear.

Ashley Innocent

Ashley Innocent

29 setembro 2026

Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5: Preço, Benchmarks e Qual Escolher

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Grok 4.7 é o mais barato dos três em tokens de saída (US$ 6 por milhão, contra US$ 10 para GPT-6 Sol e US$ 20 para Claude Opus 5.5), e o Opus 5.5 lidera em todos os benchmarks de codificação onde dois desses fornecedores publicam o mesmo nome. No Índice de Inteligência da Artificial Analysis, um composto de terceiros, a ordem é Opus 5.5 com 58, Sol com 48 e Grok 4.7 com 46. Qual custa menos para você depende do cache e de quantos tokens cada modelo gasta por tarefa; em uma carga de trabalho de agente com muito cache, o Sol supera o Grok.

botão

Todos os três foram lançados em cerca de 36 horas. A SpaceXAI lançou o Grok 4.7 em 21 de setembro de 2026, e a Anthropic e a OpenAI lançaram o Opus 5.5 e o Sol em 22 de setembro. Esse momento criou um problema que você deve saber antes de ler qualquer comparação, incluindo esta. Abaixo: a folha de especificações, as linhas de benchmark que se sobrepõem, o cálculo de preços com e sem cache, conselhos de roteamento e uma maneira de testar os três em um único projeto Apidog. Para cada modelo individualmente, veja o que é o Grok 4.7, o que é o GPT-6 Sol, e o que é o Claude Opus 5.5.

Ninguém comparou esses três entre si

Cada lançamento compara-se com modelos que existiam quando foi escrito:

Portanto, nenhuma tabela de fornecedor contém os três. O que você pode fazer é alinhar as linhas que compartilham um nome de benchmark, lê-las como uma direção em vez de um ranking, e usar um índice de terceiros como desempate. Nossa análise de GPT-6 Sol vs Claude Opus 5.5 aprofunda-se nesse par.

A folha de especificações

Grok 4.7 GPT-6 Sol Claude Opus 5.5
ID do modelo API grok-4.7 gpt-6-sol claude-opus-5-5
Lançado 21 de setembro de 2026 22 de setembro de 2026 22 de setembro de 2026
Entrada / saída por 1M $2 / $6 $2 / $10 $4 / $20
Leitura de entrada em cache por 1M $0.50 $0.20 (90% off) $0.20
Janela de contexto 500.000 872.000 1.000.000
Saída máxima não listado não informado 128.000
Índice de Inteligência AA (terceiros) 46 (#21 de 211) 48 58 (#1 de 212)
Velocidade de saída AA (terceiros) 82.6 tokens/s em xhigh 115.2 tokens/s no máximo, 102 s para o primeiro token não está em nossas fontes
Onde chamar API da xAI, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel API da OpenAI, ChatGPT Work, Codex Plataforma Claude, AWS, Google Cloud, Azure

Duas linhas decidem a maioria das cargas de trabalho. Preço de saída: Os US$ 6 do Grok 4.7 estão 40% abaixo do Sol e 70% abaixo do Opus 5.5, e isso é importante para modelos de raciocínio porque os tokens de "pensamento" são cobrados como saída. Contexto: Grok 4.7 tem a menor janela, e a xAI cobra a requisição inteira com taxas dobradas (US$ 4 de entrada, US$ 12 de saída) assim que um prompt atinge 200.000 tokens.

Os benchmarks que se sobrepõem

Essas linhas compartilham um nome de benchmark entre as folhas dos fornecedores. Cada fornecedor executou seu próprio modelo em sua própria estrutura com sua própria configuração de esforço, então pequenas lacunas são ruído. Grandes lacunas ainda lhe dizem algo.

Benchmark (executado pelo fornecedor) Grok 4.7 GPT-6 Sol Claude Opus 5.5
Terminal-Bench 4.0 37.6% (xhigh) não publicado 66.4%
CursorBench 4.0 46.3% (xhigh) não publicado 57.8%
DeepSWE v1.1 71.0% (high) 68.8% (max) não publicado
GDPval, Elo 1,695 (xhigh) não publicado 1,846 (GDPval-AA v2.1)

Como ler:

O Grok 4.7 lidera em duas avaliações de sua própria folha: o Harvey’s Legal Agent Benchmark com 19,6% (GPT-5.6 Sol 2.5%, Fable 5.1 6.7%) e o EEBench, uma avaliação de engenharia elétrica, com 64,0% (Fable 5.1 56.4%; GPT-6 Astra 69.3% no mesmo gráfico). Nem Sol nem Opus 5.5 têm uma pontuação publicada em nenhum dos dois, então leia-os como sinais para trabalho de conhecimento jurídico e de engenharia, não como vitórias sobre esses dois rivais.

Uma estrutura independente executa dois dos três da mesma forma. No SWE-Together, 109 tarefas de repositório reais executadas por uma única estrutura de agente, o Opus 5.5 pontua 68,8% pass@1 e o Grok 4.7 64,7%, cerca de 4 pontos de diferença em vez dos 29 no Terminal-Bench. O GPT-6 Sol ainda não está listado lá. O Grok 4.7 também gastou US$ 7,81 por tarefa nesse placar, então seu preço por token não o tornou barato por tarefa.

O índice de terceiros concorda com a ordem geral: Opus 5.5 58, Sol 48, Grok 4.7 46. Para cada linha e ressalva do lado do Grok, veja nossa análise dos benchmarks do Grok 4.7, que também aborda um relatório do mantenedor de benchmark de que o Grok 4.7 contornou seu sandbox para buscar correções upstream.

Quanto cada um custa em uma carga de trabalho real

Os preços por token contam apenas parte da história. Aqui está a aritmética sobre as taxas publicadas para dois tipos de carga de trabalho com 1.000 execuções por dia. As escritas em cache são excluídas; o Opus 5.5 cobra US$ 5 por milhão por elas.

Loop de agente, amigável ao cache: 50.000 tokens de entrada por execução, 45.000 deles um prefixo estável (prompt do sistema, esquemas de ferramentas, documentos), mais 3.000 tokens de saída.

Custo diário Grok 4.7 GPT-6 Sol Claude Opus 5.5
Sem acertos de cache $118.00 $130.00 $260.00
Prefixo em cache $50.50 $49.00 $89.00

Sem cache, o Grok 4.7 é o mais barato. Com o prefixo em cache, o Sol avança, porque suas leituras em cache custam US$ 0,20 por milhão contra os US$ 0,50 do Grok. Quanto mais seus prompts se repetem, menos o desconto de saída do Grok ajuda.

Tarefa com raciocínio intenso: 10.000 tokens de entrada e 20.000 tokens de saída por execução.

Custo diário Grok 4.7 GPT-6 Sol Claude Opus 5.5
Sem cache $140 $220 $440

Aqui o preço de saída domina: o Grok 4.7 custa cerca de 64% do Sol e 32% do Opus 5.5.

Ambas as tabelas assumem que cada modelo gasta o mesmo número de tokens, e eles não gastam. Os próprios dados do CursorBench da SpaceXAI mostram que o Grok 4.7 tem uma média de 70.141 tokens de saída por tarefa em nível xhigh e 15.677 em nível baixo. Um modelo que precisa do dobro de tokens perde sua vantagem de preço. O custo por tarefa concluída em seus prompts decide isso; nossa análise da guerra de preços de modelos de IA explica por que os fornecedores começaram a publicar essa métrica.

Para qual rotear

Comece pela carga de trabalho e depois teste:

Muitas equipes executarão dois desses modelos atrás de um roteador: um padrão barato e um caminho de escalonamento caro para as tarefas que falham.

Teste os três em um único projeto Apidog

A comparação que importa são seus prompts em sua estrutura. O Apidog transforma isso em um teste salvo em vez de um projeto de fim de semana:

  1. Crie três ambientes, um por provedor, cada um contendo base_url, a chave API como segredo e model. Grok 4.7 e GPT-6 Sol usam a API de Respostas (POST {{base_url}}/responses com um campo input), então uma definição de requisição cobre ambos. Opus 5.5 usa a API de Mensagens da Anthropic (POST /v1/messages com messages, um max_tokens obrigatório e cabeçalhos x-api-key mais anthropic-version), então dê a ele sua própria requisição.
  2. Use o mesmo texto de prompt em cada requisição, extraído de uma variável compartilhada para que não haja desvios.
  3. Adicione asserções para status 200, uma resposta não vazia e a presença de usage.input_tokens e usage.output_tokens.
  4. Execute-os como um cenário de teste e compare o tempo de resposta, a contagem de tokens e a saída lado a lado. Multiplique os tokens pelas linhas de preço acima para obter o custo por execução em sua tarefa.

Execute-o no nível de esforço que você usaria em produção, não no que está no gráfico de benchmark. Baixe o Apidog para construí-lo.

FAQ

O Grok 4.7 é melhor que o GPT-6? Não pelos números disponíveis. O índice da Artificial Analysis coloca o GPT-6 Sol em 48 e o Grok 4.7 em 46, e a OpenAI chama o GPT-6 Astra de seu melhor modelo. O Grok 4.7 é mais barato na saída e lidera em suas próprias avaliações jurídicas e de engenharia.

O Grok 4.7 é melhor que o Claude Opus 5.5? O Opus 5.5 lidera no Terminal-Bench 4.0 (66,4% vs 37,6%) e CursorBench 4.0 (57,8% vs 46,3%) e ocupa o primeiro lugar no índice da Artificial Analysis. O Grok 4.7 custa metade na entrada e menos de um terço na saída.

Qual é o mais barato? Por token, Grok 4.7 na saída, empatado com Sol na entrada. Com cache de prompts intenso, o Sol pode sair na frente porque suas leituras em cache custam US$ 0,20 por milhão contra os US$ 0,50 do Grok.

Posso experimentar os três de graça? Cada um tem rotas limitadas e sem custo. Veja como usar o Grok 4.7 de graça, GPT-6 Sol de graça e Claude Opus 5.5 de graça.

Como chamo o Grok 4.7 via código? POST https://api.x.ai/v1/responses com "model": "grok-4.7". O guia da API do Grok 4.7 tem exemplos de curl e SDK.

Decida com seus próprios números

Escolha os dois modelos que sua carga de trabalho aponta, salve o mesmo prompt para ambos no Apidog e execute-o no nível de esforço de sua produção. Compare o custo por tarefa concluída e a latência, então roteie. Quando o próximo modelo for lançado, adicione um ambiente e execute novamente.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs