Claude Haiku 5.5 pontua 72,4% no OSWorld 2.1, 1620 no GDPval-AA v2.1, 46,4% no FrontierCode 1.1 e 39,2% no Terminal-Bench 4.0. Haiku 4.5 pontuou 15,7%, 735 e 0,0% em três desses. Todos são números de esforço máximo; no esforço padrão medium, o GDPval-AA cai para 1277. Nenhum laboratório independente publicou resultados do Haiku 5.5 ainda.
Abaixo: cada benchmark do Claude Haiku 5.5, quem o executou, como o esforço afeta a pontuação e o custo, e como testar o modelo no seu próprio tráfego no Apidog. Para especificações e preços, comece com o que é Claude Haiku 5.5.
A tabela de lançamento
Cada célula do Haiku 5.5 usa pensamento adaptativo no esforço máximo, geralmente com média de cinco tentativas (o Terminal-Bench usou dez por tarefa). “n/r” significa que nenhum resultado foi publicado.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, offline subset | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity’s Last Exam, no tools | 45.9% | 10.2% | n/r | 56.9% |
| Humanity’s Last Exam, with tools | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (Main) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| Chartography, no tools | 46.4% | 6.4% | 29.1% | 61.6% |
Quem executou cada benchmark
A Anthropic executou a maioria dos testes por conta própria. Linhas de diferentes fornecedores compartilham um nome de benchmark, nem sempre um ambiente de teste ou configuração de esforço.
| Benchmark | Quem executou | Condições |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, de forma independente | GDPval-AA: 220 tarefas, 44 ocupações, Elo ancorado no DeepSeek V4.1 Flash (máx) em 1600; Briefcase: projetos de várias semanas |
| FrontierCode 1.1 | Cognition | Claude no Claude Code, GPT no Codex; Main = as 100 tarefas mais difíceis de 150 |
| Chartography | Anthropic, no benchmark da Surge AI | Avaliador Gemini 3.5 Flash; pontuação Luna da Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 tarefas, 10 tentativas cada, salvaguardas ativadas |
| OSWorld 2.1 | Anthropic | 82 de 108 tarefas, 1080p, até 500 passos |
| Humanity’s Last Exam | Anthropic | Orçamento de tarefa de 980K tokens, avaliador Opus 4.6 |
Duas células do GPT-6 Luna precisam de contexto. A Anthropic executou a pontuação OSWorld da Luna através da API da OpenAI nas mesmas 82 tarefas. Os 16,4% da Luna no Terminal-Bench vêm do placar público (Codex CLI, esforço máximo). No Terminal-Bench, as salvaguardas interromperam 1,8% das tentativas do Haiku 5.5 (12 de 660), e cada uma foi contada como falha.
A armadilha do FrontierCode
A tabela de lançamento coloca o Haiku 5.5 no máximo (46,4%) ao lado do Sonnet 5.5 no xhigh (52,1%), a melhor pontuação do Sonnet. O cartão do sistema fornece os números comparáveis:
| FrontierCode 1.1 | Main | Extended |
|---|---|---|
| Haiku 5.5, max | 46.4% | 58.4% |
| Haiku 5.5, xhigh | 45.8% | n/r |
| Sonnet 5.5, max | 46.2% | 59.1% |
| Sonnet 5.5, xhigh | 52.1% | 64.4% |
No esforço máximo, o Haiku 5.5 supera o Sonnet 5.5 no Main, 46,4% a 46,2%. Na melhor configuração de cada modelo, o Sonnet lidera por 5,7 pontos. Diga qual esforço você se refere ao citar qualquer um.
Extras do cartão do sistema
O cartão do sistema adiciona linhas que a publicação de lançamento omitiu. Todos são esforço máximo, salvo indicação em contrário.
| Benchmark | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench Multilingual | 83.7 | 67.4 | 90.3 |
| SWE-bench Multimodal | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, strict pass rate | 37.1% | n/r | 48.8% |
| Chartography, with tools | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional (length-adjusted) | 64.8% | 32.2% | 69.2% |
Os 72,4% do OSWorld são crédito parcial; apenas 37,1% das tarefas são aprovadas diretamente. O Chartography quase dobra com ferramentas (46,4% para 86,2%), então forneça ferramentas ao Haiku 5.5 para trabalhos com gráficos.
Esforço padrão pontua mais baixo
O Haiku 5.5 assume o padrão medium na API do Claude e no Claude Code. O cartão do sistema relata estes resultados de esforço padrão:
| Benchmark | Médio (padrão) | Max | Nota |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Médio usou cerca de um décimo dos tokens de saída do máximo |
| AA-Briefcase v1.1 | 1372 | 1578 | Médio usou menos de um quarto dos tokens de saída do máximo |
| HealthBench Professional | 59.9% | 64.8% | Baixo 57,9%, alto 61,3% |
Chame a API sem output_config.effort e espere a coluna da esquerda. A documentação de esforço cobre todos os cinco níveis.
Pontuação e custo por esforço
Dos gráficos de lançamento, como pontuação (custo). O custo do OSWorld e Terminal-Bench é por tentativa; o GDPval-AA é por tarefa.
| Modelo | Baixo | Médio | Alto | Xhigh | Max |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
- O máximo é caro pelo seu último passo. No GDPval-AA, o máximo custa cerca de 28x o médio para 343 pontos Elo a mais. No OSWorld, o máximo custa mais que o dobro do xhigh por 4,8 pontos.
- Haiku 5.5 no médio supera Luna no máximo no OSWorld: 53,3% por US$ 0,13 versus 48,9% por US$ 0,21. Luna é mais barato em todos os outros níveis correspondentes, no entanto; no médio, os dois custam aproximadamente o mesmo. Veja Haiku 5.5 vs GPT-6 Luna.
- Haiku 5.5 no máximo supera Sonnet 5.5 no médio no OSWorld (72,4% por US$ 0,61 versus 66,0% por US$ 0,93).
- O Terminal-Bench é a exceção. Sonnet 5.5 no alto (43,0%, US$ 1,46) supera Haiku 5.5 no máximo (39,2%, US$ 2,64) por menos dinheiro. Os custos do Sonnet usam o novo preço de leitura de cache de US$ 0,10.
Os custos usam preços de tabela: US$ 0,10/US$ 0,50 por milhão de tokens para prompts de até 100K tokens, mais alto acima disso (veja o detalhamento de preços).
Onde o Haiku 5.5 ainda está atrás
Sonnet 5.5 lidera todas as linhas da tabela de lançamento. A única vitória direta do Haiku é no FrontierCode com esforço máximo correspondente. A maior diferença é no Terminal-Bench 4.0: 39,2% versus 70,6%. SWE-Bench Pro (64,8 versus 81,3) e SWE-bench Multimodal (30,7 versus 54,3) mostram o mesmo padrão.
A Anthropic concorda: Sonnet 5.5 e Opus 5.5 “permanecem melhores escolhas para tarefas complexas de codificação agentic.” Haiku 5.5 se encaixa em trabalhos de escopo restrito: compactação, sumarização, classificação, uso de navegador e subagentes sob um modelo maior. Executá-lo como um subagente barato é abordado em Haiku 5.5 no Claude Code.
Resultados independentes: nenhum ainda
Em 8 de outubro de 2026, nenhum laboratório independente publicou resultados do Haiku 5.5. A página do Haiku 5.5 da Artificial Analysis retorna um 404, e seu ranking lista apenas o Claude 4.5 Haiku. Vals, LMArena, SWE-bench e Aider também não mostraram nada. Não há dados de velocidade de terceiros; a Anthropic chama o Haiku 5.5 de seu “modelo mais rápido até o momento” na velocidade padrão, mais lento que o Opus no Modo Rápido.
O número externo mais próximo vem do Cursor. Sua documentação do modelo diz que o Haiku 5.5 “pontua 48,4% no CursorBench com esforço máximo,” acima dos 30,9% no baixo. Com o pensamento desativado, o Cursor relata de 22,1% a 26,2% nos mesmos níveis de esforço onde o pensamento ativado pontuou de 30,9% a 42,3%.
O que os clientes relatam
Estes vêm da publicação de lançamento da Anthropic e não foram verificados independentemente:
- HubSpot: 92,8% em média em três execuções em sua suíte de portal CRM simulado, a melhor pontuação que viu nessa suíte.
- AlphaSense: 0,84 versus 0,76 do Haiku 4.5 em 400 consultas de "Perguntar no Documento", o que considera estatisticamente significativo.
- Box: 11 pontos mais alto que o Haiku 4.5 com cerca de metade da latência, em testes iniciais.
- Asana: mais de 30% menor latência para conclusão de tarefas em comparação com seu modelo atual.
- Cognition: Devin Fusion detém uma pontuação FrontierCode de 66,2 com Haiku 5.5 como auxiliar e Opus 5.5 como líder. Esse é um sistema de dois modelos, não apenas o Haiku.
Execute sua própria avaliação
Benchmarks não se parecem com seu tráfego. O guia de prompts da Anthropic sugere usar xhigh ou max apenas onde suas avaliações mostram um ganho, e executar as mesmas avaliações no Sonnet 5.5 para comparar. No Apidog:
- Armazene
ANTHROPIC_API_KEYcomo uma variável de ambiente e salve de 20 a 50 prompts reais como requisições de Mensagens. - Adicione asserções: status 200, um
stop_reasondiferente de"max_tokens"ou"refusal", e o conteúdo que uma resposta correta precisa. - Execute o conjunto em
low,mediumehigh. Alterar o esforço invalida o cache de prompts. - Registre a taxa de aprovação e a contagem de tokens em
usage. O novo tokenizador produz cerca de 30% mais tokens do que o do Haiku 4.5 para o mesmo texto. - Duplique a coleção, troque por
claude-sonnet-5-5e compare ambos os modelos em um projeto.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
}'
Não envie temperature, top_p, top_k ou um preenchimento inicial do assistente; cada um retorna um 400 no Haiku 5.5. Selecione os blocos de resposta por type, já que um bloco thinking pode vir primeiro. Veja o guia da API e testando aplicativos LLM.
Perguntas Frequentes
O Claude Haiku 5.5 é melhor que o Sonnet 5.5? Não pelos números da Anthropic. Sonnet 5.5 lidera todas as linhas da tabela de lançamento; Haiku só o supera no FrontierCode quando ambos rodam no máximo (46,4% vs 46,2%). Veja Haiku 5.5 vs Haiku 4.5 para a visão de atualização.
Qual é a pontuação SWE-bench do Haiku 5.5? 64,8 no SWE-Bench Pro, 83,7 no SWE-bench Multilingual e 30,7 no SWE-bench Multimodal, todos com esforço máximo.
Com qual esforço os benchmarks foram executados? Máximo, geralmente com média de cinco tentativas. O padrão da API é médio, onde o GDPval-AA pontua 1277 em vez de 1620.
Existem benchmarks independentes para o Haiku 5.5? Ainda não. A Artificial Analysis executou o GDPval-AA e o AA-Briefcase de forma independente, mas a Anthropic publicou essas pontuações; a AA não tem uma página para o Haiku 5.5.
O GPT-6 Luna é mais barato? Geralmente. Luna custa menos em todos os níveis de esforço do GDPval-AA e em todos os níveis do OSWorld, exceto no médio, onde os dois custam aproximadamente o mesmo. Haiku 5.5 pontua mais alto em ambos.
Próximo passo
Comece em medium e aumente o esforço apenas onde o ganho na sua taxa de aprovação se pagar. Baixe o Apidog, crie a coleção de avaliação acima e mantenha os resultados no Apidog ao lado da sua linha de base do Sonnet 5.5 antes de alternar o tráfego de produção.
