Quando a xAI lançou o Grok 4.5 em 8 de julho de 2026, Elon Musk fez a comparação ele mesmo: “um modelo de classe Opus, mas mais rápido, mais eficiente em tokens e com custo menor.” Essa é uma afirmação específica e verificável sobre o Claude Opus 4.8, o modelo de codificação carro-chefe da Anthropic.
Então, vamos verificar. Esta comparação utiliza os números publicados pela xAI em seu anúncio, os preços publicados pela Anthropic e as partes da história que nenhum dos fornecedores destaca. A versão resumida: a afirmação é majoritariamente verdadeira, com duas perdas em benchmarks e um grande asterisco sobre a verificação.
O placar
A xAI publicou quatro benchmarks de codificação. Aqui estão eles, com ambos os modelos e o contexto de fronteira ao redor:
| Benchmark | Grok 4.5 | Opus 4.8 (máx) | Vencedor |
|---|---|---|---|
| DeepSWE 1.0 (pass@1) | 62.0% | 55.75% | Grok 4.5 (+6.25) |
| DeepSWE 1.1 | 53% | 59% | Opus 4.8 (+6) |
| Terminal Bench 2.1 | 83.3% | 78.9% | Grok 4.5 (+4.4) |
| SWE Bench Pro (resolver) | 64.7% | 69.2% | Opus 4.8 (+4.5) |
Duas vitórias para cada. Nos próprios gráficos da xAI, “classe Opus” é preciso como um nível de capacidade e incorreto como uma alegação de superioridade, o que, para o crédito da xAI, não é a afirmação que Musk fez.

Vale a pena notar: o Claude Fable 5 (máx) supera todos os quatro gráficos (66.1 / 70 / 84.3 / 80.4), e o GPT 5.5 (xhigh) vence ambos os modelos em três dos quatro. O Grok 4.5 está competindo no nível abaixo da fronteira, contra o modelo que a Anthropic precifica para o trabalho diário em vez da capacidade máxima. Se você quer a batalha da fronteira, essa é Fable 5 vs Opus 4.8.
O asterisco de proveniência
Estes não são resultados de testes independentes. A xAI observa que os números dos concorrentes vêm de “cards de sistema publicados pelos respectivos desenvolvedores ou tabelas de classificação de benchmarks”, com as avaliações DeepSWE criadas pela Datacurve e as execuções gerenciadas com o harness de cada provedor. Isso é melhor do que a autoavaliação opaca, mas misturar as fontes significa que as diferenças de harness e scaffold vazam para a comparação. Nenhuma terceira parte totalmente independente fez benchmark do Grok 4.5 ainda. Nossa análise aprofundada de benchmarks acompanha essa situação.
Preço: Grok vence no papel, mais ainda na prática
Preços de tabela por milhão de tokens:
| Grok 4.5 | Opus 4.8 | |
|---|---|---|
| Entrada | $2.00 | $5.00 |
| Saída | $6.00 | $25.00 |
Isso representa 40% do preço de entrada do Opus e 24% do seu preço de saída. (Detalhes completos do lado da Anthropic em nossa análise de preços do Opus 4.8.)
A diferença aumenta quando você leva em conta a verbosidade. A xAI relata que o Grok 4.5 resolve tarefas do SWE Bench Pro com uma média de 15.954 tokens de saída; o Opus 4.8 (máx) tem uma média de 67.020 no mesmo benchmark. Multiplique por tarefa resolvida:
- Grok 4.5: 15.954 tokens × $6/M ≈ $0,10 de saída por tarefa
- Opus 4.8 (máx): 67.020 tokens × $25/M ≈ $1,68 de saída por tarefa
Aproximadamente 17x mais barato na saída por tarefa concluída, de acordo com as contagens de tokens relatadas pelo fornecedor. Trate a multiplicação exata com cautela (um benchmark, uma medição de um fornecedor e o modo de esforço “máx” infla a contagem de tokens do Opus), mas a direção é difícil de argumentar: um modelo conciso a $6 vence um modelo verboso a $25 por mais do que a tabela de preços sugere. Executamos cenários mais completos em Preços do Grok 4.5 explicados.
A ressalva também funciona ao contrário: o Opus perde mais tokens por tarefa em parte porque o modo “máx” raciocina extensivamente, e esse raciocínio é parte do motivo pelo qual ele vence o SWE Bench Pro por 4,5 pontos. Você está pagando por pensar. Às vezes, o pensamento é o produto.
Velocidade: 80 TPS e respostas mais curtas se acumulam
O Grok 4.5 atende a cerca de 80 tokens por segundo, o que a xAI chama de “velocidades de modelo rápido”. Combinado com saídas que são um quarto do comprimento, o tempo real por tarefa cai duas vezes: menos tokens, entregues mais rapidamente. Para loops de agente que encadeiam dezenas de chamadas de modelo, a latência por etapa se acumula em minutos economizados por sessão.
A Anthropic não publica um valor de TPS equivalente para o Opus 4.8, e as velocidades no mundo real variam de acordo com a carga e o nível, então faça o benchmark com seu próprio tráfego em vez de confiar em qualquer página de marketing.
Onde o Opus 4.8 mantém a vantagem
Preço não é tudo, e o placar nomeia os lugares onde não é:
- A codificação agentic mais difícil. SWE Bench Pro, o mais próximo dos quatro do trabalho de repositório real e complexo, vai para o Opus por 4,5 pontos. DeepSWE 1.1, a revisão mais recente, vai para o Opus por 6.
- Maturidade do ecossistema. O Opus 4.8 se encaixa no Claude Code, em padrões de uso de ferramentas estabelecidos e em um ano de aprimoramento de produção. O Grok 4.5 foi lançado ontem; sua superfície de integração é Grok Build, Cursor e uma nova API. O custo de migração é real mesmo quando o custo por token é menor.
- Previsibilidade. O comportamento do Opus em contextos longos, seus padrões de recusa e seus modos de falha são bem documentados, inclusive por nós. Os do Grok 4.5 têm uma semana de idade.
Qual você deve usar?
Escolha o Grok 4.5 se sua carga de trabalho envolve codificação agentic de alto volume ou trabalho de conhecimento, sua fatura de API é um item que você monitora, e uma divisão de benchmark de 2 em 4 por um quarto do preço de saída parece uma oportunidade de arbitragem. O preço de lançamento mais as janelas gratuitas atuais tornam a tentativa quase sem custo este mês.
Mantenha-se no Opus 4.8 se você está imerso no ecossistema da Anthropic, precisa das pontuações publicadas mais fortes em benchmarks difíceis de nível de repositório nesta classe de preço, ou não pode aceitar o risco de modelo de primeira semana em produção.
De qualquer forma, meça você mesmo. Ambas as APIs falam formatos compatíveis com OpenAI, então um harness A/B é barato de construir. No Apidog, salve uma requisição por modelo, aponte-as para seus cinco prompts reais mais difíceis e compare a qualidade da saída, a latência e o objeto de uso lado a lado. Verifique especificamente os output_tokens: se as respostas do Grok aos seus prompts não forem mais curtas, a economia acima não se aplica a você. Baixe o Apidog gratuitamente e execute a comparação em seu próprio tráfego antes de mover uma carga de trabalho.
Guias de configuração para ambos os lados: como usar a API Grok 4.5 e como usar a API Claude Opus 4.8.
FAQ
O Grok 4.5 é melhor que o Claude Opus 4.8? Eles dividiram os benchmarks publicados pela xAI em 2-2. O Grok 4.5 é mais barato e mais eficiente em tokens; o Opus 4.8 vence as duas avaliações de nível de repositório mais difíceis. “Melhor” depende se sua restrição é orçamento ou capacidade máxima.
Quão mais barato é o Grok 4.5 em comparação com o Opus 4.8? $2 vs $5 por milhão de tokens de entrada e $6 vs $25 por milhão de saída. Por tarefa de codificação resolvida, as contagens de tokens relatadas pelo fornecedor sugerem uma lacuna efetiva muito maior.
Existem benchmarks independentes para o Grok 4.5? Ainda não. Os números publicados misturam as execuções da xAI, as avaliações da Datacurve e os cards de sistema de outros fornecedores. Números independentes devem surgir dentro de semanas após o lançamento.
Posso testar ambos os modelos com o mesmo código? Principalmente, sim. Ambos expõem completions de chat compatíveis com OpenAI, então trocar base_url, key e model ID cobre o básico. Os detalhes de chamada de ferramentas e saída estruturada diferem; teste esses caminhos explicitamente antes de mudar.
