Claude Opus 5 Benchmarks: O Que os Números Realmente Dizem

Todas as afirmações de benchmark do Claude Opus 5 em uma tabela atribuída: Frontier-Bench, ARC-AGI 3, OSWorld 2.0, CursorBench 3.2, AutomationBench. Todos executados pelo fornecedor, nenhum reproduzido.

Ashley Innocent

Ashley Innocent

25 julho 2026

Claude Opus 5 Benchmarks: O Que os Números Realmente Dizem

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

A Anthropic lançou o Claude Opus 5 em 24 de julho de 2026 com um conjunto de alegações de benchmark que parecem uma vitória esmagadora. Mais que o dobro do Opus 4.8 em uma avaliação. Três vezes o próximo melhor modelo em outra. Superou o Fable 5 a um terço do custo em uma terceira.

Isso não os torna errados. Significa que você deve lê-los da mesma forma que leria o gráfico de lançamento de qualquer fornecedor: cuidadosamente, com atenção ao que está sendo medido e ao que foi omitido. Este guia reúne todas as alegações de benchmark publicadas do Opus 5 em uma tabela atribuída, explica o que cada número pode e não pode suportar, nomeia o teto que a Anthropic coloca acima de seu próprio modelo e finaliza com um plano de avaliação que você pode executar por si mesmo no Apidog.

botão

Para o modelo em si (claude-opus-5, contexto de 1M, saída máxima de 128k, corte de conhecimento de maio de 2026), comece com o que é o Claude Opus 5. A fonte primária abaixo é o post de lançamento do Claude Opus 5 da Anthropic.

Todas as alegações publicadas, em uma tabela

Aqui está o conjunto completo de declarações de benchmark que a Anthropic fez no lançamento. A coluna de comparação é tão importante quanto a coluna de resultados, porque várias delas são declaradas em relação a outro modelo, e não como uma pontuação.

Benchmark Alegação da Anthropic Declarado como Comparado com
Frontier-Bench v0.1 Supera todos os outros modelos; mais que o dobro da pontuação do Opus 4.8, a um custo menor por tarefa Proporção mais alegação de custo Opus 4.8 e o campo
ARC-AGI 3 Aproximadamente 3x a pontuação do próximo melhor modelo Proporção Próximo melhor modelo não nomeado
OSWorld 2.0 Supera o Fable 5 a um terço do custo Ordinal mais alegação de custo Fable 5
CursorBench 3.2 Dentro de 0.5% do pico do Fable 5, pela metade do preço Lacuna mais alegação de custo Fable 5
Zapier AutomationBench Taxa de aprovação aproximadamente 1.5x a do próximo melhor modelo Proporção Próximo melhor modelo não nomeado
Química orgânica +10.2 pontos sobre o Opus 4.8 Delta absoluto Opus 4.8
Análise de proteínas +7.7 pontos sobre o Opus 4.8 Delta absoluto Opus 4.8
Exploração de segurança cibernética Atrás do Mythos 5 Ordinal Mythos 5
Pesquisa biológica autônoma Atrás do Mythos 5 Ordinal Mythos 5

Fonte para tudo o que foi dito acima: post de lançamento da Anthropic e documentação do modelo. Nenhuma terceira parte publicou uma reprodução de qualquer um desses resultados no momento da escrita.

Duas coisas saltam à vista antes de você ler qualquer número individual. Apenas duas das nove linhas dão um movimento absoluto em pontos. E a própria Anthropic fornece as duas últimas linhas, onde seu novo carro-chefe perde.

O problema da proporção e por que ele importa

Quatro das alegações (Frontier-Bench, ARC-AGI 3, AutomationBench e, em certo grau, CursorBench) são declaradas como proporções ou lacunas, e não como pontuações. Isso é uma limitação real, não uma trivialidade, e vale a pena ser específico sobre o porquê.

Uma proporção esconde o denominador. “Aproximadamente 3x o próximo melhor modelo” no ARC-AGI 3 significa algo diferente dependendo de onde o campo se encontra. Se o próximo melhor modelo pontuar 8%, então 3x é 24%: um movimento real em um benchmark que ninguém está perto de resolver. Se o próximo melhor modelo pontuar 25%, então 3x é 75%, um resultado categoricamente diferente. Ambos são honestamente descritíveis como “3x”. Você não pode dizer qual deles aconteceu, e a Anthropic não disse.

Dobrar é mais fácil na parte inferior de uma escala. “Mais que o dobro da pontuação do Opus 4.8” no Frontier-Bench v0.1 é o mesmo tipo de problema. Em um benchmark difícil e novo, onde o carro-chefe anterior pontuou em um dígito ou pouco mais, dobrar é um salto absoluto menor do que a frase implica. Em um benchmark onde o 4.8 já pontuou 40%, dobrar seria extraordinário. A string da versão é uma dica aqui: v0.1 é um benchmark sem histórico publicado, sem reproduções da comunidade e sem ponto de saturação estabelecido.

“Próximo melhor modelo” não é nomeado. Duas alegações comparam o Opus 5 a um concorrente não especificado. Esse concorrente pode ser o Fable 5, o Mythos 5 ou um modelo de outro laboratório. O conjunto de comparação determina o quanto a proporção significa, e isso não é divulgado.

Lacunas precisam de unidades. “Dentro de 0.5% do pico do Fable 5” no CursorBench 3.2 não diz se isso é 0.5 pontos percentuais ou uma diferença relativa de 0.5%, e “pico” sugere uma execução de melhor configuração, e não uma padrão. Em um benchmark de codificação, a diferença entre uma configuração padrão de `esforço` e uma maximizada não é trivial. Nossa análise dos benchmarks do Fable 5 aborda como os próprios números desse modelo foram enquadrados.

Os dois números científicos são as alegações mais claras do conjunto precisamente porque evitam tudo isso: +10.2 pontos em química orgânica e +7.7 pontos em análise de proteínas são deltas absolutos em relação a uma linha de base nomeada. Você ainda não obtém a pontuação inicial, mas sabe exatamente o quanto o modelo se moveu.

As alegações de custo por tarefa dependem da configuração

Três das alegações da Anthropic agrupam capacidade com custo: menor custo por tarefa no Frontier-Bench, um terço do custo no OSWorld 2.0, metade do preço no CursorBench 3.2.

A parte do preço de tabela é verificável e se mantém. O Opus 5 custa $5 por milhão de tokens de entrada e $25 por milhão de saída, idêntico ao Opus 4.8 e exatamente metade do $10/$50 do Fable 5. Isso é publicado na página de preços da Anthropic e não é um resultado de benchmark. A aritmética completa, incluindo gravações de cache, taxas de lote e o prêmio do modo rápido, está em nossa análise de preços do Opus 5.

O custo por tarefa é uma quantidade diferente. Depende de quantos tokens a execução consumiu, o que depende do nível de esforço, se o pensamento foi habilitado, quantas voltas o loop agêntico levou e quantos subagentes foram gerados. A própria orientação de prompt da Anthropic observa que o Opus 5 produz respostas padrão mais longas do que o Opus 4.8, delega aos subagentes com mais facilidade e expande o escopo da tarefa com mais frequência. Todos os três aumentam o consumo de tokens em cargas de trabalho reais, então uma execução ajustada para um gráfico de custo por tarefa não é automaticamente a configuração que você enviaria.

Nada disso torna a história de custo falsa. Metade do preço de tabela é metade do preço de tabela, e nossa comparação Opus 5 vs Fable 5 detalha onde essa lacuna realmente compensa. Isso significa que a relação custo por tarefa é um artefato de uma configuração específica, e a sua será diferente. Meça-a.

O teto que a Anthropic nomeia para si mesma

A linha mais útil no material de lançamento é aquela que não é uma vitória. A Anthropic declara claramente que o Opus 5 ainda está atrás do Mythos 5 na exploração de segurança cibernética e na pesquisa biológica autônoma. O Fable 5 também mantém a designação de "modelo amplamente lançado mais capaz".

Isso vale a pena ser reafirmado porque a cobertura da imprensa em grande parte o omitiu. O Opus 5 não é o topo da pilha Claude. O resumo honesto é capacidade de classe de fronteira pela metade do preço de fronteira, com um teto nomeado acima dele. Para pesquisa de segurança de fronteira ou trabalho científico autônomo, a resposta do benchmark ainda é de classe Mythos, abordada em nosso explicador de modelo de classe Mythos e Fable 5 vs Mythos 5.

Há uma consequência operacional também. A Anthropic enviou uma opção `fallbacks: "default"` (por trás do cabeçalho beta `server-side-fallback-2026-07-01`) que automaticamente retorna ao Opus 4.8 quando o Opus 5 recusa uma solicitação de categoria cibernética. Um modelo com recusas cibernéticas mais restritas precisa de uma saída de emergência, e a existência dessa saída de emergência diz algo que o gráfico não diz.

O que os benchmarks não cobrem de forma alguma

Os benchmarks medem a conclusão da tarefa. Eles não medem as coisas que decidem se um modelo funciona em seu produto:

O que realmente testar por si mesmo

Benchmarks de fornecedores são uma hipótese inicial. Aqui está uma avaliação compacta que você pode executar em uma tarde e que lhe dirá mais sobre o Opus 5 para sua carga de trabalho do que todos os números acima combinados.

1. Crie um pequeno conjunto de tarefas a partir do seu próprio histórico. Vinte a cinquenta tarefas reais: tickets fechados, PRs mesclados, threads de suporte que seu modelo teria lidado. Entradas reais são melhores que as sintéticas porque carregam sua formatação, ambiguidade e casos extremos reais.

2. Fixe a configuração e registre-a. ID do modelo exatamente claude-opus-5, mais seu nível de output_config.effort, se o pensamento está ativado e seu max_tokens. Uma configuração não fixa torna qualquer comparação posterior sem sentido.

3. Pontue o custo por tarefa resolvida, não o custo por token. Leia o bloco usage em cada resposta e registre os tokens de entrada, saída, leitura de cache e escrita de cache por tarefa. Em seguida, divida o gasto total pelas tarefas que realmente passaram em sua verificação de aceitação. Este é o número que o gráfico da Anthropic está alegando, então é o número a ser reproduzido.

4. Execute uma varredura de esforço real. O mesmo conjunto de tarefas em low, medium, high e xhigh. A recalibração significa que low e medium são significativamente mais fortes no Opus 5 do que nos modelos Opus anteriores, e muitas cargas de trabalho encontrarão um nível mais barato que passa com a mesma frequência. Observe o max_tokens no limite superior.

5. Teste o loop agêntico, não a única vez. A maioria dos benchmarks de lançamento são agênticos (OSWorld, CursorBench, AutomationBench). Verificações pontuais de uma única vez não os reproduzirão. Execute múltiplas vezes com suas ferramentas reais anexadas e conte as vezes, não apenas os resultados.

6. Compare com seu modelo atual no mesmo conjunto de tarefas. Seja o que for que você use hoje, Opus 4.8 ou Sonnet 5 ou outra coisa, execute-o através do mesmo harness. Um resultado relativo em seus próprios dados vale mais do que uma pontuação absoluta nos dados de outra pessoa.

7. Registre as recusas separadamente. O trabalho relacionado à segurança cibernética terá recusas com mais frequência do que no 4.8. Conte-as antes de decidir se o cabeçalho de fallback vale a pena ser configurado.

Para metodologia de comparação em um lançamento anterior, nosso artigo sobre os benchmarks do Sonnet 5 detalha o mesmo exercício, e o guia da API do Opus 5 tem os formatos de solicitação.

Executando a avaliação no Apidog

A avaliação acima é um conjunto de requisições HTTP com cabeçalhos de autenticação, corpos JSON, respostas de streaming e um bloco `usage` que você precisa ler em cada chamada. Esse é um trabalho de API comum, que é o que o Apidog gerencia.

Uma configuração viável:

  1. Crie uma requisição para o endpoint de Mensagens da Anthropic e armazene sua chave de API como uma variável de ambiente em vez de colá-la no corpo.
  2. Duplique essa requisição uma vez por nível de esforço para que você possa disparar o mesmo prompt de `low` a `xhigh` e comparar as respostas lado a lado.
  3. Ative o streaming e inspecione os eventos SSE diretamente quando precisar ver como os tokens de pensamento se acumulam antes do início da resposta visível.
  4. Inspecione os payloads de chamadas de ferramentas na resposta para confirmar que o modelo está realmente emitindo chamadas de ferramentas estruturadas em vez de descrevê-las em prosa, que é o artefato de pensamento desabilitado a ser observado.
  5. Adicione uma asserção nos campos `usage` para que os acertos de cache e os totais de tokens sejam capturados em cada execução, em vez de serem verificados visualmente.
  6. Salve tudo como uma coleção para que o próximo lançamento do modelo seja uma troca de ID de modelo, não uma reconstrução.

Aqui está a requisição base:

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 8192,
    "output_config": {"effort": "medium"},
    "messages": [
      {"role": "user", "content": "Fix the failing test in this diff."}
    ]
  }'

Altere um campo por execução, mantenha todo o resto fixo e registre o bloco `usage` a cada vez. Baixe o Apidog se quiser seguir esse padrão com os ambientes e asserções já configurados.

O resumo honesto

A história de benchmark do Opus 5 é genuinamente forte: o maior salto sobre seu predecessor que a Anthropic alegou para um lançamento do Opus, com preços de tabela inalterados. É também inteiramente executada pelo fornecedor, não reproduzida até 25 de julho de 2026, e declarada principalmente em proporções que escondem seus denominadores. Ambas as coisas são verdadeiras ao mesmo tempo.

Trate a tabela no topo desta página como a hipótese da Anthropic sobre seu próprio modelo. Então, vá e obtenha seus próprios números. A lacuna entre um gráfico de lançamento e uma carga de trabalho de produção é onde cada migração de modelo é realmente decidida, e o guia principal do Opus 5 cobre o resto do que mudou.

botão

FAQ

Os benchmarks do Claude Opus 5 são verificados independentemente? Não. Em 25 de julho de 2026, todos os resultados de benchmark publicados do Opus 5 vêm da Anthropic. Nenhum laboratório de terceiros ou avaliador independente divulgou uma reprodução. Leia-os como dados reportados pelo fornecedor.

Qual é a maior alegação de benchmark do Opus 5? Frontier-Bench v0.1, onde a Anthropic afirma que o Opus 5 mais que dobra a pontuação do Opus 4.8 a um custo menor por tarefa. A Anthropic não publicou as pontuações subjacentes, apenas a proporção, e o Frontier-Bench v0.1 é um novo benchmark sem um histórico estabelecido.

O Claude Opus 5 é o modelo Claude mais capaz? Não. O Fable 5 mantém a designação de "o modelo mais capaz amplamente lançado", e a Anthropic declara que o Opus 5 ainda está atrás do Mythos 5 na exploração de segurança cibernética e pesquisa biológica autônoma. A proposta do Opus 5 é capacidade de classe de fronteira pela metade do preço do Fable 5, não o topo da pilha.

Quanto melhor é o Opus 5 do que o Opus 4.8 em tarefas científicas? A Anthropic relata +10.2 pontos em química orgânica e +7.7 pontos em análise de proteínas sobre o Opus 4.8. Estas são as duas alegações declaradas como deltas absolutos em vez de proporções, o que as torna as mais fáceis de interpretar, embora as pontuações de linha de base não tenham sido publicadas.

O Opus 5 vence o Fable 5? Pelos números da Anthropic, ele supera o Fable 5 no OSWorld 2.0 a um terço do custo e fica dentro de 0.5% do pico do Fable 5 no CursorBench 3.2 pela metade do preço. O Fable 5 ainda detém a designação de capacidade geral. Veja a comparação completa.

O que devo testar por conta própria? O custo por tarefa resolvida em vinte a cinquenta tarefas reais do seu próprio backlog, executadas em múltiplos níveis de esforço, com suas ferramentas reais conectadas e loops multi-turn ativados. Compare com o que você usa hoje no mesmo harness.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs