Claude Sonnet 5.5: Benchmarks, Números da Anthropic, Resultados Independentes e Suas Implicações

Benchmarks do Claude Sonnet 5.5: 70,6% no Terminal-Bench 4.0, 81,3 no SWE-Bench Pro, índice AA 56. Quem executou cada teste, quais os custos de esforço, como rodar sua própria avaliação.

Medy Evrard

29 setembro 2026

Claude Sonnet 5.5: Benchmarks, Números da Anthropic, Resultados Independentes e Suas Implicações

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Claude Sonnet 5.5 alcança 70.6% no Terminal-Bench 4.0, 55.5% no CursorBench 4.0, 46.2% no FrontierCode 1.1 com esforço máximo (52.1% em xhigh) e 81.3 no SWE-Bench Pro, subindo de 10.3%, 34.1%, 42.4% e 63.2% do Sonnet 5. Opus 5.5 lidera a maioria das linhas da tabela de lançamento em cerca de 2 a 3 pontos, mas fica atrás no Terminal-Bench. A Artificial Analysis classifica independentemente o Sonnet 5.5 com 56 em seu Índice de Inteligência, #3 de 216.

Abaixo: os benchmarks completos do Claude Sonnet 5.5, quem os executou, o que muda no esforço e como testar o modelo em seu próprio tráfego no Apidog. Para especificações, consulte o que é Claude Sonnet 5.5.

A tabela de lançamento

A publicação de lançamento da Anthropic compara quatro modelos ("n/r" marca um traço). As células do Sonnet 5.5 são de esforço máximo, a menos que marcadas; a API padrão é alta, Claude Code e os aplicativos são médios.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ n/r
FrontierCode 1.1 (Main) 46.2% Max² / 52.1% Xhigh 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% n/r
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
Humanity’s Last Exam (with tools) 64.5% 54.9% 67.7% n/r
OSWorld 2.1 (partial) 80.1% 57.0% 81.8% n/r
Chartography (no tools) 61.6% 15.6% 64.4% 53.6%⁴

As notas de rodapé, em termos simples:

  1. A pontuação do Opus 5.5 no Terminal-Bench é em xhigh, sua melhor; no máximo, marcou 64.8%.
  2. FrontierCode penaliza edições fora do escopo. No máximo, o Sonnet 5.5 executou com mais frequência a habilidade de revisão de código do Claude Code, ramificando para muitos subagentes; em dois casos examinados pela Cognition, isso causou um tempo limite ou edições fora do escopo.
  3. Artificial Analysis executou ambos os testes de trabalho de conhecimento em uma implantação pré-lançamento com um bug de saída estruturada, já corrigido. A Anthropic espera um pequeno efeito, se houver, subestimando o Sonnet 5.5.
  4. A OpenAI corrigiu recentemente um bug de compreensão de imagem do GPT-6 Sol que as pontuações da AA e da Surge AI podem não refletir.

Quem executou cada benchmark

A Anthropic executou todos os testes ela mesma, a menos que um terceiro seja nomeado. As linhas entre fornecedores compartilham um nome de benchmark, não um harness ou configuração de esforço.

Executor Benchmark Condições
Anthropic Terminal-Bench 4.0, HLE, OSWorld 2.1 TB: Claude Code --bare, 5 tentativas, salvaguardas ativadas. HLE: pesquisa e execução de código. OSWorld: 108 tarefas
Cognition FrontierCode 1.1 Claude no Claude Code, GPT no Codex CLI
Cursor CursorBench 4.0 Harness de produção do Cursor; Anthropic estimou o custo pelo preço de tabela
Artificial Analysis GDPval-AA, AA-Briefcase Implantação pré-lançamento
Anthropic Chartography Benchmark da Surge AI, avaliado com Gemini 3.5 Flash; pontuação do Sol da Surge

O fallback atingiu 1.5% das tentativas do Sonnet 5.5 no Terminal-Bench, mas 10% das do Opus 5.5 (cartão do sistema §8.5), então leia a liderança de 4.2 pontos do Sonnet com cuidado.

Extras do cartão do sistema

As linhas um a seis são o resumo de esforço máximo do cartão do sistema.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench Multilingual 90.3 78.3 93.9
SWE-Bench Multimodal 54.3 28.1 61.4
HLE, no tools 56.9 43.1 64.4
HealthBench Professional 69.2 57.8 65.6
AutomationBench (Zapier’s run) 44.7 10.7 42.5
DeepSWE v1.1 71.0% n/r n/r
Terminal-Bench-Science 0.1 59.9% n/r 58.7%
FrontierSWE v2 (Proximal’s run) 61.9% n/r 62.3%
ArXivMath (no tools / tools) 86.8% / 95.2% n/r 91.2% / 96.9%
ProgramBench (long context) 79.7% 77.3% 91.2%
OSWorld 2.1, strict pass 43.5% 25.6% 48.7%
Toolathlon-Verified (Pass@1) 77.8% 74.7% 77.8%
OfficeQA / OfficeQA Pro 76.9% / 65.6% 75.1% / 62.1% 78.9% / 67.7%

Sonnet 5.5 supera o Opus 5.5 no HealthBench Professional, AutomationBench e Terminal-Bench-Science; o Opus lidera com a maior margem no ProgramBench, SWE-Bench Pro e HLE sem ferramentas. A pontuação principal de 80.1% do OSWorld é crédito parcial; apenas 43.5% das tarefas são aprovadas diretamente.

O esforço muda o cenário

Os gráficos de lançamento, como pontuação (custo). O custo do Terminal-Bench é por tentativa, os outros por tarefa. Dois gráficos mostram GPT-5.6 Sol (*) porque os números do GPT-6 Sol não foram publicados.

Modelo Baixo Médio Alto Xalto Máximo
Terminal-Bench 4.0
Sonnet 5.5 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Opus 5.5 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
Sonnet 5 3.2% ($3.78) 4.4% ($4.83) 4.5% ($8.20) 7.0% ($9.95) 10.3% ($11.62)
GPT-5.6 Sol* 7.9% ($1.46) 20.9% ($2.69) 26.1% ($4.12) 28.5% ($5.39) 37.3% ($7.89)
FrontierCode 1.1 Main
Sonnet 5.5 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
Opus 5.5 47.3% ($0.40) 54.6% ($0.80) 54.0% ($1.09) 51.4% ($2.25) 54.4% ($6.19)
Sonnet 5 28.7% ($2.39) 35.2% ($3.81) 39.4% ($6.10) 42.7% ($10.07) 42.4% ($17.12)
GPT-6 Sol 37.3% ($0.43) 45.9% ($0.77) 47.7% ($1.04) 48.4% ($1.32) 49.3% ($2.07)
CursorBench 4.0
Sonnet 5.5 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
Opus 5.5 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98) 57.8% ($13.43)
Sonnet 5 24.1% ($1.39) 28.0% ($2.31) 30.8% ($3.48) 32.0% ($4.55) 34.1% ($7.17)
GPT-5.6 Sol* 24.6% ($0.87) 31.1% ($1.77) 35.7% ($2.85) 37.7% ($4.40) 41.7% ($8.23)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 ($0.87) 1461 ($1.64) 1634 ($3.95) 1746 ($9.63) 1811 ($29.19)
Opus 5.5 1285 ($1.15) 1642 ($4.40) 1705 ($6.27) 1780 ($12.27) 1822 ($21.05)
Sonnet 5 923 ($0.82) 1056 ($1.73) 1177 ($3.76) 1274 ($7.56) 1359 ($14.43)
GPT-6 Sol 905 ($0.12) 1142 ($0.34) 1289 ($0.63) 1364 ($1.19) 1483 ($2.67)

Resultados independentes

Artificial Analysis classifica o Sonnet 5.5 com 56 no Intelligence Index v4.3.2, #3 de 216, atrás apenas do Opus 5.5 no máximo e xhigh. Sonnet 5 marcou 38. Custo para executar o índice:

Esforço Pontuação do índice Custo para executar
máximo 55.98 $8,977
xalto 51.85 $2,738
alto 46.74 $1,176
médio 40.74 $701
baixo 35.84 $544

O máximo custa 7.6x o alto para 9.2 pontos a mais. A leitura da AA pela OfficeChai coloca o Sonnet 5.5 fora da fronteira de Pareto, mais competitivo em custo no alto, e conta cerca de 193,000 tokens de saída por tarefa de índice no máximo.

Benchmarks de segurança

Injeção de prompt, conforme o cartão do sistema:

As avaliações cibernéticas foram executadas com salvaguardas desativadas: 46.1% no CyScenarioBench (Sonnet 5: 0.7%, Opus 5.5: 67.6%). É o primeiro Sonnet com salvaguardas cibernéticas, e a Anthropic alerta para mais recusas, mesmo em tarefas de segurança benignas. Consulte nosso guia de injeção de prompt.

Execute sua própria avaliação

Os benchmarks não se parecem com seu tráfego, e o guia de prompt da Anthropic diz que o esforço é recalibrado, então não reutilize as configurações do Sonnet 5. No Apidog:

  1. Armazene ANTHROPIC_API_KEY como uma variável de ambiente e salve de 20 a 50 prompts reais como requisições de Mensagens.
  2. Afirme o status 200, um stop_reason diferente de "max_tokens" ou "refusal", e o conteúdo que uma resposta correta precisa.
  3. Execute em low, medium, high e xhigh, uma passagem para cada; mudar o esforço invalida o cache de prompts.
  4. Registre a taxa de aprovação e a contagem de tokens em usage, precificados em $2 de entrada e $10 de saída por milhão.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'

Envie o esforço mais baixo cuja taxa de aprovação você aceita. Veja testando aplicativos LLM e testando APIs de agentes de IA, então baixe o Apidog para construir a coleção.

FAQ

O Sonnet 5.5 supera o Opus 5.5? No Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science e Chartography com ferramentas, sim. O Opus 5.5 lidera ou empata no resto.

Qual é a pontuação do Sonnet 5.5 no SWE-Bench? 81.3 no SWE-Bench Pro e 90.3 no Multilingual, com esforço máximo.

Por que há dois números para o FrontierCode? 46.2% é máximo, 52.1% é xhigh; a ramificação de subagentes do máximo gerou penalidades por estar fora do escopo.

Devo fazer upgrade do Sonnet 5? Sim nos benchmarks, mas leia as mudanças drásticas da API em Sonnet 5.5 vs Sonnet 5 primeiro.

Próximo passo

Comece em high (ou medium para codificação agêntica bem especificada), como sugere a Anthropic, e deixe sua avaliação no Apidog decidir se um passo adiante compensa.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs