Claude Sonnet 5.5 alcança 70.6% no Terminal-Bench 4.0, 55.5% no CursorBench 4.0, 46.2% no FrontierCode 1.1 com esforço máximo (52.1% em xhigh) e 81.3 no SWE-Bench Pro, subindo de 10.3%, 34.1%, 42.4% e 63.2% do Sonnet 5. Opus 5.5 lidera a maioria das linhas da tabela de lançamento em cerca de 2 a 3 pontos, mas fica atrás no Terminal-Bench. A Artificial Analysis classifica independentemente o Sonnet 5.5 com 56 em seu Índice de Inteligência, #3 de 216.
Abaixo: os benchmarks completos do Claude Sonnet 5.5, quem os executou, o que muda no esforço e como testar o modelo em seu próprio tráfego no Apidog. Para especificações, consulte o que é Claude Sonnet 5.5.
A tabela de lançamento
A publicação de lançamento da Anthropic compara quatro modelos ("n/r" marca um traço). As células do Sonnet 5.5 são de esforço máximo, a menos que marcadas; a API padrão é alta, Claude Code e os aplicativos são médios.
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | n/r |
| FrontierCode 1.1 (Main) | 46.2% Max² / 52.1% Xhigh | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | n/r |
| GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| Humanity’s Last Exam (with tools) | 64.5% | 54.9% | 67.7% | n/r |
| OSWorld 2.1 (partial) | 80.1% | 57.0% | 81.8% | n/r |
| Chartography (no tools) | 61.6% | 15.6% | 64.4% | 53.6%⁴ |
As notas de rodapé, em termos simples:
- A pontuação do Opus 5.5 no Terminal-Bench é em xhigh, sua melhor; no máximo, marcou 64.8%.
- FrontierCode penaliza edições fora do escopo. No máximo, o Sonnet 5.5 executou com mais frequência a habilidade de revisão de código do Claude Code, ramificando para muitos subagentes; em dois casos examinados pela Cognition, isso causou um tempo limite ou edições fora do escopo.
- Artificial Analysis executou ambos os testes de trabalho de conhecimento em uma implantação pré-lançamento com um bug de saída estruturada, já corrigido. A Anthropic espera um pequeno efeito, se houver, subestimando o Sonnet 5.5.
- A OpenAI corrigiu recentemente um bug de compreensão de imagem do GPT-6 Sol que as pontuações da AA e da Surge AI podem não refletir.
Quem executou cada benchmark
A Anthropic executou todos os testes ela mesma, a menos que um terceiro seja nomeado. As linhas entre fornecedores compartilham um nome de benchmark, não um harness ou configuração de esforço.
| Executor | Benchmark | Condições |
|---|---|---|
| Anthropic | Terminal-Bench 4.0, HLE, OSWorld 2.1 | TB: Claude Code --bare, 5 tentativas, salvaguardas ativadas. HLE: pesquisa e execução de código. OSWorld: 108 tarefas |
| Cognition | FrontierCode 1.1 | Claude no Claude Code, GPT no Codex CLI |
| Cursor | CursorBench 4.0 | Harness de produção do Cursor; Anthropic estimou o custo pelo preço de tabela |
| Artificial Analysis | GDPval-AA, AA-Briefcase | Implantação pré-lançamento |
| Anthropic | Chartography | Benchmark da Surge AI, avaliado com Gemini 3.5 Flash; pontuação do Sol da Surge |
O fallback atingiu 1.5% das tentativas do Sonnet 5.5 no Terminal-Bench, mas 10% das do Opus 5.5 (cartão do sistema §8.5), então leia a liderança de 4.2 pontos do Sonnet com cuidado.
Extras do cartão do sistema
As linhas um a seis são o resumo de esforço máximo do cartão do sistema.
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 81.3 | 63.2 | 89.9 |
| SWE-Bench Multilingual | 90.3 | 78.3 | 93.9 |
| SWE-Bench Multimodal | 54.3 | 28.1 | 61.4 |
| HLE, no tools | 56.9 | 43.1 | 64.4 |
| HealthBench Professional | 69.2 | 57.8 | 65.6 |
| AutomationBench (Zapier’s run) | 44.7 | 10.7 | 42.5 |
| DeepSWE v1.1 | 71.0% | n/r | n/r |
| Terminal-Bench-Science 0.1 | 59.9% | n/r | 58.7% |
| FrontierSWE v2 (Proximal’s run) | 61.9% | n/r | 62.3% |
| ArXivMath (no tools / tools) | 86.8% / 95.2% | n/r | 91.2% / 96.9% |
| ProgramBench (long context) | 79.7% | 77.3% | 91.2% |
| OSWorld 2.1, strict pass | 43.5% | 25.6% | 48.7% |
| Toolathlon-Verified (Pass@1) | 77.8% | 74.7% | 77.8% |
| OfficeQA / OfficeQA Pro | 76.9% / 65.6% | 75.1% / 62.1% | 78.9% / 67.7% |
Sonnet 5.5 supera o Opus 5.5 no HealthBench Professional, AutomationBench e Terminal-Bench-Science; o Opus lidera com a maior margem no ProgramBench, SWE-Bench Pro e HLE sem ferramentas. A pontuação principal de 80.1% do OSWorld é crédito parcial; apenas 43.5% das tarefas são aprovadas diretamente.
O esforço muda o cenário
Os gráficos de lançamento, como pontuação (custo). O custo do Terminal-Bench é por tentativa, os outros por tarefa. Dois gráficos mostram GPT-5.6 Sol (*) porque os números do GPT-6 Sol não foram publicados.
| Modelo | Baixo | Médio | Alto | Xalto | Máximo |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | |||||
| Sonnet 5.5 | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Opus 5.5 | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| Sonnet 5 | 3.2% ($3.78) | 4.4% ($4.83) | 4.5% ($8.20) | 7.0% ($9.95) | 10.3% ($11.62) |
| GPT-5.6 Sol* | 7.9% ($1.46) | 20.9% ($2.69) | 26.1% ($4.12) | 28.5% ($5.39) | 37.3% ($7.89) |
| FrontierCode 1.1 Main | |||||
| Sonnet 5.5 | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| Opus 5.5 | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| Sonnet 5 | 28.7% ($2.39) | 35.2% ($3.81) | 39.4% ($6.10) | 42.7% ($10.07) | 42.4% ($17.12) |
| GPT-6 Sol | 37.3% ($0.43) | 45.9% ($0.77) | 47.7% ($1.04) | 48.4% ($1.32) | 49.3% ($2.07) |
| CursorBench 4.0 | |||||
| Sonnet 5.5 | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| Opus 5.5 | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| Sonnet 5 | 24.1% ($1.39) | 28.0% ($2.31) | 30.8% ($3.48) | 32.0% ($4.55) | 34.1% ($7.17) |
| GPT-5.6 Sol* | 24.6% ($0.87) | 31.1% ($1.77) | 35.7% ($2.85) | 37.7% ($4.40) | 41.7% ($8.23) |
| AA-Briefcase v1.1 (Elo) | |||||
| Sonnet 5.5 | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| Opus 5.5 | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
| Sonnet 5 | 923 ($0.82) | 1056 ($1.73) | 1177 ($3.76) | 1274 ($7.56) | 1359 ($14.43) |
| GPT-6 Sol | 905 ($0.12) | 1142 ($0.34) | 1289 ($0.63) | 1364 ($1.19) | 1483 ($2.67) |
- A maioria dos ganhos chega em xhigh. O máximo adiciona 9.1 pontos no Terminal-Bench por 2.4x o custo, 2.4 no CursorBench por 2.5x.
- As pontuações máximas do FrontierCode são mais baixas e custam 13x mais do que xhigh (46.2% a $20.78 vs 52.1% a $1.59).
- Opus 5.5 com menor esforço é o verdadeiro rival. No Terminal-Bench, Opus no médio obtém 57.6% por $2.94; Sonnet no alto obtém 43.0% por $1.94. Opus no alto (64.2%, $3.88) vence Sonnet no xhigh (61.5%, $5.30). Veja Sonnet 5.5 vs Opus 5.5.
- Alto é o ponto ideal de custo do Sonnet. FrontierCode no alto: 49.4% por $0.42, igualando o melhor do GPT-6 Sol (49.3%) por cerca de um quinto do custo (detalhamento de preços).
Resultados independentes
Artificial Analysis classifica o Sonnet 5.5 com 56 no Intelligence Index v4.3.2, #3 de 216, atrás apenas do Opus 5.5 no máximo e xhigh. Sonnet 5 marcou 38. Custo para executar o índice:
| Esforço | Pontuação do índice | Custo para executar |
|---|---|---|
| máximo | 55.98 | $8,977 |
| xalto | 51.85 | $2,738 |
| alto | 46.74 | $1,176 |
| médio | 40.74 | $701 |
| baixo | 35.84 | $544 |
O máximo custa 7.6x o alto para 9.2 pontos a mais. A leitura da AA pela OfficeChai coloca o Sonnet 5.5 fora da fronteira de Pareto, mais competitivo em custo no alto, e conta cerca de 193,000 tokens de saída por tarefa de índice no máximo.
- Própria execução do Terminal-Bench 4.0 da AA: 63.6%, contra 70.6% da Anthropic.
- A baixa pontuação do Sonnet 5 é real: a AA mediu 14.1% (veja benchmarks do Sonnet 5).
- AA-Omnisciência (segundo OfficeChai): 54% de precisão e uma taxa de alucinação de 47%, contra 66% e 59% para Opus 5.5.
- Ainda não medido: velocidade de saída e tempo para o primeiro token, então "30%+ mais rápido" permanece a afirmação da Anthropic. Nenhuma listagem no LMArena ainda.
Benchmarks de segurança
Injeção de prompt, conforme o cartão do sistema:
- Gray Swan: sucesso de ataque 0.4%, 2.7% e 3.4% em k=1, 10 e 15 (Sonnet 5: 0.7%, 5.1%, 6.7%). O uso de computador GUI é mais fraco em 12.5% (k=15).
- Shade, codificação: 3.01% sem salvaguardas, principalmente via fallback cibernético do Sonnet 5; o próprio Sonnet 5.5 foi comprometido em 4 de 5,901 solicitações.
- Uso do navegador: nenhum ataque obteve sucesso em 110 cenários.
As avaliações cibernéticas foram executadas com salvaguardas desativadas: 46.1% no CyScenarioBench (Sonnet 5: 0.7%, Opus 5.5: 67.6%). É o primeiro Sonnet com salvaguardas cibernéticas, e a Anthropic alerta para mais recusas, mesmo em tarefas de segurança benignas. Consulte nosso guia de injeção de prompt.
Execute sua própria avaliação
Os benchmarks não se parecem com seu tráfego, e o guia de prompt da Anthropic diz que o esforço é recalibrado, então não reutilize as configurações do Sonnet 5. No Apidog:
- Armazene
ANTHROPIC_API_KEYcomo uma variável de ambiente e salve de 20 a 50 prompts reais como requisições de Mensagens. - Afirme o status 200, um
stop_reasondiferente de"max_tokens"ou"refusal", e o conteúdo que uma resposta correta precisa. - Execute em
low,medium,highexhigh, uma passagem para cada; mudar o esforço invalida o cache de prompts. - Registre a taxa de aprovação e a contagem de tokens em
usage, precificados em $2 de entrada e $10 de saída por milhão.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
Envie o esforço mais baixo cuja taxa de aprovação você aceita. Veja testando aplicativos LLM e testando APIs de agentes de IA, então baixe o Apidog para construir a coleção.
FAQ
O Sonnet 5.5 supera o Opus 5.5? No Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science e Chartography com ferramentas, sim. O Opus 5.5 lidera ou empata no resto.
Qual é a pontuação do Sonnet 5.5 no SWE-Bench? 81.3 no SWE-Bench Pro e 90.3 no Multilingual, com esforço máximo.
Por que há dois números para o FrontierCode? 46.2% é máximo, 52.1% é xhigh; a ramificação de subagentes do máximo gerou penalidades por estar fora do escopo.
Devo fazer upgrade do Sonnet 5? Sim nos benchmarks, mas leia as mudanças drásticas da API em Sonnet 5.5 vs Sonnet 5 primeiro.
Próximo passo
Comece em high (ou medium para codificação agêntica bem especificada), como sugere a Anthropic, e deixe sua avaliação no Apidog decidir se um passo adiante compensa.
