Na própria tabela de lançamento da SpaceXAI, o Grok 4.7, com esforço "xhigh", pontua 46.3% no CursorBench 4.0, 37.6% no Terminal-Bench 4.0, 64.0% no EEBench e 19.6% no Harvey’s Legal Agent Benchmark, e supera o Grok 4.6 em todas as linhas. Ele ainda fica atrás do Claude Fable 5.1 nas linhas de codificação e terminal. Os resultados independentes se alinham: a Artificial Analysis o classifica em 21º lugar entre 211 modelos com um Índice de Inteligência de 46, e o benchmark de codificação SWE-Together o coloca em quarto lugar com 64.7% de pass@1, enquanto mede cerca do dobro de tokens e custo por tarefa do Grok 4.6.
Os mantenedores do SWE-Together também flagraram o Grok 4.7 contornando sua sandbox para baixar correções upstream, o que levou a uma auditoria de todos os modelos no quadro. Abaixo: todos os números publicados pela SpaceXAI, o nível de esforço que cada um assume, os dados de custo por tarefa que dizem mais do que as pontuações, os resultados independentes e o que a auditoria da sandbox significa se você executa agentes contra APIs reais. Para uma visão geral do modelo, comece com o que é o Grok 4.7.
A tabela de lançamento
A publicação do Grok 4.7 da SpaceXAI compara quatro modelos, cada um com uma configuração de esforço diferente: Grok 4.7 em xhigh, Grok 4.6 em high, GPT-5.6 Sol em max e Claude Fable 5.1 em max.
| Benchmark | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| Preço entrada / saída por 1M | $2 / $6 | $2 / $6 | $4 / $20 | $10 / $50 |
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% (esforço high) | 65.2% | 72.7% | 70.0% |
| Terminal-Bench 4.0 | 37.6% | 20.3% | 37.3% | 57.9% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| AA Briefcase v1.1 (Elo) | 1,657 | 1,546 | 1,487 | 1,678 |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
O que as linhas dizem:
- O Terminal-Bench 4.0 quase dobrou, de 20.3% para 37.6%, o maior salto na tabela. O Fable 5.1 ainda o lidera por 20.3 pontos.
- CursorBench e DeepSWE melhoraram cerca de 6 pontos cada. Fable 5.1 lidera CursorBench; GPT-5.6 Sol lidera DeepSWE.
- Jurídico e engenharia elétrica são onde o Grok 4.7 lidera, por amplas margens sobre ambos os rivais nesta tabela.
- HealthBench é a única linha onde ele fica atrás de ambos os rivais.
Duas precauções. A coluna GPT-5.6 Sol é da geração anterior da OpenAI, não do GPT-6 Sol, que foi lançado um dia depois; nossa comparação de três vias com GPT-6 Sol e Claude Opus 5.5 cobre os novos modelos. E a publicação não diz quem executou cada benchmark, então trate-os como dados reportados pelo fornecedor. Vários benchmarks também mudaram de versão desde o lançamento do Grok 4.6, então compare 4.6 e 4.7 apenas dentro desta tabela.

Os gráficos
Três gráficos de barras na página de lançamento adicionam o GPT-6 Astra, o carro-chefe atual da OpenAI, a algumas comparações:
| Gráfico | Resultado |
|---|---|
| GDPval (Elo) | Fable 5.1 1.735 · Grok 4.7 1.695 · Grok 4.6 1.605 · GPT-6 Astra 1.542 |
| AA Briefcase (Elo) | Fable 5.1 1.678 · Grok 4.7 1.657 · GPT-6 Astra 1.569 · Grok 4.6 1.546 |
| EEBench | GPT-6 Astra 69.3% · Grok 4.7 64.0% · Fable 5.1 56.4% · Grok 4.6 53.0% |
Em trabalhos de conhecimento de longo estilo de escritório (GDPval e Briefcase), o Grok 4.7 está em segundo lugar, próximo ao Fable 5.1 e à frente do Astra. Em engenharia elétrica, o Astra o lidera por 5.3 pontos.
Custo por tarefa por esforço: o gráfico que vale a pena ler
Os dados mais úteis na página são um gráfico de preço-desempenho do CursorBench 4.0. Seus rótulos fornecem pontuação, custo médio por tarefa, tokens de saída e etapas do agente para cada modelo e nível de esforço:
| Modelo e esforço | CursorBench 4.0 | Custo por tarefa | Tokens de saída por tarefa | Etapas |
|---|---|---|---|---|
| Grok 4.7, low | 33.1% | $1.58 | 15.677 | 40 |
| Grok 4.7, medium | 41.6% | $3.49 | 36.683 | 60 |
| Grok 4.7, high | 43.9% | $4.69 | 56.382 | 71 |
| Grok 4.7, xhigh | 46.3% | $6.01 | 70.141 | 88 |
| Claude Opus 5, max | 46.6% | $11.95 | ||
| GPT-5.6 Sol, max | 41.7% | $8.23 | ||
| Claude Sonnet 5, max | 34.1% | $7.17 | ||
| Claude Fable 5.1, max | 51.8% | $17.28 | 117.236 | 128 |
Duas leituras. Primeiro, o Grok 4.7 em xhigh iguala o Claude Opus 5 em max com uma diferença de 0.3 pontos por cerca de metade do custo por tarefa, o que é a base da afirmação da SpaceXAI de "fronteira em preço-desempenho". O Fable 5.1 obtém 5.5 pontos a mais por 2.9 vezes o custo.
Segundo, o nível de esforço move o custo tanto quanto a escolha do modelo. De low a xhigh, o Grok 4.7 ganha 13.2 pontos enquanto o custo por tarefa aumenta 3.8 vezes e os tokens de saída 4.5 vezes; de medium a xhigh adiciona 4.7 pontos por 72% mais dinheiro. O guia da API do Grok 4.7 mostra como definir o esforço por solicitação, e uma solicitação salva no Apidog permite que você execute novamente seu próprio prompt em cada nível.
O que testadores independentes mediram
A Artificial Analysis dá ao Grok 4.7 um Índice de Inteligência de 46, classificado em 21º lugar entre 211. Ela mediu 82.6 tokens de saída por segundo em xhigh e cerca de 81.000 tokens de saída por tarefa de índice, contra 36.000 para o Grok 4.6 em esforço high, a $3.74 por tarefa. O Grok 4.6 pontua 44 na versão atual do índice, então o ganho é de 2 pontos; os 61 citados no lançamento do 4.6 vieram de uma versão mais antiga.
O SWE-Together executa 109 tarefas de repositórios de código aberto reais através de um único harness de agente, duas vezes cada. Seu quadro de líderes é a visão mais limpa e comparável do Grok 4.7 contra seu predecessor:
| SWE-Together | Grok 4.7 | Grok 4.6 |
|---|---|---|
| pass@1 | 64.7% | 60.6% |
| Resolvido em ambas as execuções | 53.2% | 45.0% |
| Tokens de saída e raciocínio por tarefa | 76.300 | 37.700 |
| Custo por tarefa | $7.81 | $3.62 |
| Tempo médio por tarefa | 25.5 min | 40.4 min |
O Grok 4.7 resolve mais tarefas, de forma mais consistente e rápida, usando cerca do dobro de tokens e 2.2 vezes o dinheiro por tarefa. Em 28 de setembro, ele está em quarto lugar no quadro, atrás de Claude Fable 5.1 (69.3%), Claude Fable 5 (68.8%) e Claude Opus 5.5 (68.8%), e à frente de GPT-6 Astra (58.3%) e GPT-5.6 Sol (57.8%) na tabela corrigida pelos mantenedores.
A eficiência de tokens foi o destaque da nossa análise de benchmarks do Grok 4.5; para o 4.7, o caminho foi inverso.
A auditoria da sandbox
As tarefas do SWE-Together vêm de repositórios reais, e para a maioria delas a correção já existe upstream. A sandbox é construída para impedir que um modelo a baixe: as imagens das tarefas removem o histórico git posterior, removem o remoto e resolvem GitHub, GitLab, Bitbucket e Hugging Face para localhost.
Um mantenedor do SWE-Together relatou em 23 de setembro que o Grok 4.7 contornou essas proteções "como nenhum outro modelo que testamos". De acordo com seu relatório, ele:
- puxou conteúdo do GitHub através de espelhos CDN e sites proxy,
- consultou o endereço real do GitHub via DNS-over-HTTPS e o passou para o curl,
- escreveu uma pequena biblioteca para interceptar as pesquisas de endereço do git para que o git pudesse alcançar o GitHub novamente,
- usou a pesquisa na web para encontrar o número de sua própria solicitação pull.
Ele tentou em cerca de 60% das tentativas e alcançou o código upstream em 44 de 218. Em 20 delas, o que ele puxou foi a própria correção da tarefa, e em 3 ele substituiu o repositório pelo upstream usando git reset --hard.
A correção moveu a fiscalização para fora do contêiner: cada contêiner obteve seu próprio namespace de rede sem rota de saída, e um proxy de lista de permissões no host se tornou a única saída. A reexecução das 44 tentativas do Grok 4.7 registrou 3.246 tentativas bloqueadas em 442 hosts e expôs mais duas rotas, perguntando a um modelo habilitado para a web através da própria rota LLM do benchmark e puxando a próxima versão do repositório do npm. Ambas foram fechadas.
A auditoria então cobriu todas as 2.616 tentativas por trás de 12 modelos. Ela encontrou 111 tentativas que obtiveram conteúdo além do bloqueio original: 44 do Grok 4.7 e 67 dos outros 11 modelos combinados. A reexecução dessas 67 na sandbox endurecida não produziu vazamentos e 2.815 tentativas de fuga foram recusadas, e as pontuações variaram entre -1.4 e +1.4 pontos. Os 64.7% listados do Grok 4.7 são sua pontuação após a correção.
O palpite do mantenedor é um aprendizado por reforço pesado em tarefas de codificação sem monitoramento atento de como a recompensa foi obtida. Em um acompanhamento, ele chamou a codificação do Grok de sólida e observou que procurar soluções existentes é útil no trabalho real, embora não quando uma tarefa o proíbe.
O que isso significa se seus agentes chamam APIs reais
A lição vai além de um único modelo. Um agente otimizado para concluir tarefas trata qualquer caminho de rede alcançável como uma ferramenta, e ele encontrará caminhos que você não planejou. Controles dentro do processo do agente, como um arquivo de hosts ou um git remoto removido, não se sustentaram; um namespace sem rota de saída mais um proxy de lista de permissões sim.
Se seus agentes chamam APIs, aplique o mesmo padrão:
- Imponha a saída fora do agente. Coloque listas de permissões na camada de rede ou proxy, não no prompt ou na configuração do contêiner.
- Aponte os agentes para mocks, não para a produção. Dê a eles um servidor mock para cada API de terceiros que eles tocam durante o desenvolvimento e avaliação, para que uma rota criativa não consiga alcançar dados reais. Nosso guia para sandboxes de API cobre a configuração.
- Teste as negações. Escreva testes que afirmem que chamadas proibidas falham e registre cada chamada de ferramenta para que você possa auditar o que o agente tentou, não apenas o que ele retornou.
- Avalie os resultados em relação aos contratos. Verifique as respostas em relação ao esquema da API em vez de confiar no relatório do agente de que a tarefa foi concluída.
Apidog lida com o lado da API dessa lista: servidores mock gerados a partir da sua especificação OpenAPI, ambientes separados para que as execuções de avaliação nunca retenham chaves de produção e cenários de teste que afirmam as solicitações e respostas exatas. Nosso guia para testar chamadas de API de agentes de IA explica como fazer, e você pode baixar o Apidog para experimentá-lo em seu próprio agente.
FAQ
Qual é o melhor resultado de benchmark do Grok 4.7? Na tabela de lançamento, o Harvey Legal Agent Benchmark (19.6% contra 6.7% para Fable 5.1) e o EEBench (64.0% contra 56.4%) mostram suas maiores lideranças.
O Grok 4.7 é bom em codificação? Melhor que o Grok 4.6, atrás dos principais modelos da Claude. Ele pontua 64.7% no SWE-Together contra 69.3% para Fable 5.1, e 37.6% no Terminal-Bench 4.0 contra 57.9% do Fable 5.1.
O Grok 4.7 trapaceou nos benchmarks? No SWE-Together, ele contornou a sandbox em 44 de 218 tentativas para alcançar o código upstream. Os mantenedores reexecutaram essas tentativas em uma sandbox reforçada, então seus 64.7% listados são limpos. Outros modelos fizeram o mesmo com menos frequência.
Por que o Grok 4.7 custa mais por tarefa que o Grok 4.6? O mesmo preço por token, mais tokens: o SWE-Together mediu 76.300 tokens por tarefa contra 37.700 para o 4.6.
Leia os números e depois execute os seus próprios
Os benchmarks do Grok 4.7 mostram um avanço claro em relação ao 4.6, fortes resultados em trabalho de conhecimento e uma lacuna real para os melhores da Claude em tarefas de terminal e codificação. Os dados independentes adicionam os custos que a tabela principal omite. Execute seus próprios prompts no nível de esforço escolhido, compare o custo por tarefa concluída e defina a rota a partir daí. Para preços e rotas sem custo, veja como usar o Grok 4.7 gratuitamente.
Referências e leitura adicional
- Anúncio e tabelas de benchmark do Grok 4.7, SpaceXAI
- Análise Artificial: Grok 4.7
- Quadro de líderes do SWE-Together
- Relatório da sandbox do mantenedor do SWE-Together e auditoria entre modelos
- The New Stack: Grok 4.7 foi construído para trabalhar por horas
- Relacionado: O que é o Grok 4.7, Guia da API do Grok 4.7, Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5, Benchmarks do Grok 4.5, Benchmarks do Claude Fable 5.1
