Claude Haiku 5.5 Benchmarks

Benchmarks do Claude Haiku 5.5: 72,4% no OSWorld, 1620 no GDPval-AA, 39,2% no Terminal-Bench com esforço máximo. Quem executou cada teste, custos por esforço e sua própria avaliação.

Ashley Goolam

Ashley Goolam

8 outubro 2026

Claude Haiku 5.5 Benchmarks

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Claude Haiku 5.5 pontua 72,4% no OSWorld 2.1, 1620 no GDPval-AA v2.1, 46,4% no FrontierCode 1.1 e 39,2% no Terminal-Bench 4.0. Haiku 4.5 pontuou 15,7%, 735 e 0,0% em três desses. Todos são números de esforço máximo; no esforço padrão medium, o GDPval-AA cai para 1277. Nenhum laboratório independente publicou resultados do Haiku 5.5 ainda.

Abaixo: cada benchmark do Claude Haiku 5.5, quem o executou, como o esforço afeta a pontuação e o custo, e como testar o modelo no seu próprio tráfego no Apidog. Para especificações e preços, comece com o que é Claude Haiku 5.5.

botão

A tabela de lançamento

Cada célula do Haiku 5.5 usa pensamento adaptativo no esforço máximo, geralmente com média de cinco tentativas (o Terminal-Bench usou dez por tarefa). “n/r” significa que nenhum resultado foi publicado.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, offline subset 72.4% 15.7% 48.9% 83.9%
Humanity’s Last Exam, no tools 45.9% 10.2% n/r 56.9%
Humanity’s Last Exam, with tools 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (Main) 46.4% n/r 42.4% 52.1% (xhigh)
Chartography, no tools 46.4% 6.4% 29.1% 61.6%

Quem executou cada benchmark

A Anthropic executou a maioria dos testes por conta própria. Linhas de diferentes fornecedores compartilham um nome de benchmark, nem sempre um ambiente de teste ou configuração de esforço.

Benchmark Quem executou Condições
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, de forma independente GDPval-AA: 220 tarefas, 44 ocupações, Elo ancorado no DeepSeek V4.1 Flash (máx) em 1600; Briefcase: projetos de várias semanas
FrontierCode 1.1 Cognition Claude no Claude Code, GPT no Codex; Main = as 100 tarefas mais difíceis de 150
Chartography Anthropic, no benchmark da Surge AI Avaliador Gemini 3.5 Flash; pontuação Luna da Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 tarefas, 10 tentativas cada, salvaguardas ativadas
OSWorld 2.1 Anthropic 82 de 108 tarefas, 1080p, até 500 passos
Humanity’s Last Exam Anthropic Orçamento de tarefa de 980K tokens, avaliador Opus 4.6

Duas células do GPT-6 Luna precisam de contexto. A Anthropic executou a pontuação OSWorld da Luna através da API da OpenAI nas mesmas 82 tarefas. Os 16,4% da Luna no Terminal-Bench vêm do placar público (Codex CLI, esforço máximo). No Terminal-Bench, as salvaguardas interromperam 1,8% das tentativas do Haiku 5.5 (12 de 660), e cada uma foi contada como falha.

A armadilha do FrontierCode

A tabela de lançamento coloca o Haiku 5.5 no máximo (46,4%) ao lado do Sonnet 5.5 no xhigh (52,1%), a melhor pontuação do Sonnet. O cartão do sistema fornece os números comparáveis:

FrontierCode 1.1 Main Extended
Haiku 5.5, max 46.4% 58.4%
Haiku 5.5, xhigh 45.8% n/r
Sonnet 5.5, max 46.2% 59.1%
Sonnet 5.5, xhigh 52.1% 64.4%

No esforço máximo, o Haiku 5.5 supera o Sonnet 5.5 no Main, 46,4% a 46,2%. Na melhor configuração de cada modelo, o Sonnet lidera por 5,7 pontos. Diga qual esforço você se refere ao citar qualquer um.

Extras do cartão do sistema

O cartão do sistema adiciona linhas que a publicação de lançamento omitiu. Todos são esforço máximo, salvo indicação em contrário.

Benchmark Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench Multilingual 83.7 67.4 90.3
SWE-bench Multimodal 30.7 19.8 54.3
OSWorld 2.1, strict pass rate 37.1% n/r 48.8%
Chartography, with tools 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional (length-adjusted) 64.8% 32.2% 69.2%

Os 72,4% do OSWorld são crédito parcial; apenas 37,1% das tarefas são aprovadas diretamente. O Chartography quase dobra com ferramentas (46,4% para 86,2%), então forneça ferramentas ao Haiku 5.5 para trabalhos com gráficos.

Esforço padrão pontua mais baixo

O Haiku 5.5 assume o padrão medium na API do Claude e no Claude Code. O cartão do sistema relata estes resultados de esforço padrão:

Benchmark Médio (padrão) Max Nota
GDPval-AA v2.1 1277 1620 Médio usou cerca de um décimo dos tokens de saída do máximo
AA-Briefcase v1.1 1372 1578 Médio usou menos de um quarto dos tokens de saída do máximo
HealthBench Professional 59.9% 64.8% Baixo 57,9%, alto 61,3%

Chame a API sem output_config.effort e espere a coluna da esquerda. A documentação de esforço cobre todos os cinco níveis.

Pontuação e custo por esforço

Dos gráficos de lançamento, como pontuação (custo). O custo do OSWorld e Terminal-Bench é por tentativa; o GDPval-AA é por tarefa.

Modelo Baixo Médio Alto Xhigh Max
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

Os custos usam preços de tabela: US$ 0,10/US$ 0,50 por milhão de tokens para prompts de até 100K tokens, mais alto acima disso (veja o detalhamento de preços).

Onde o Haiku 5.5 ainda está atrás

Sonnet 5.5 lidera todas as linhas da tabela de lançamento. A única vitória direta do Haiku é no FrontierCode com esforço máximo correspondente. A maior diferença é no Terminal-Bench 4.0: 39,2% versus 70,6%. SWE-Bench Pro (64,8 versus 81,3) e SWE-bench Multimodal (30,7 versus 54,3) mostram o mesmo padrão.

A Anthropic concorda: Sonnet 5.5 e Opus 5.5 “permanecem melhores escolhas para tarefas complexas de codificação agentic.” Haiku 5.5 se encaixa em trabalhos de escopo restrito: compactação, sumarização, classificação, uso de navegador e subagentes sob um modelo maior. Executá-lo como um subagente barato é abordado em Haiku 5.5 no Claude Code.

Resultados independentes: nenhum ainda

Em 8 de outubro de 2026, nenhum laboratório independente publicou resultados do Haiku 5.5. A página do Haiku 5.5 da Artificial Analysis retorna um 404, e seu ranking lista apenas o Claude 4.5 Haiku. Vals, LMArena, SWE-bench e Aider também não mostraram nada. Não há dados de velocidade de terceiros; a Anthropic chama o Haiku 5.5 de seu “modelo mais rápido até o momento” na velocidade padrão, mais lento que o Opus no Modo Rápido.

O número externo mais próximo vem do Cursor. Sua documentação do modelo diz que o Haiku 5.5 “pontua 48,4% no CursorBench com esforço máximo,” acima dos 30,9% no baixo. Com o pensamento desativado, o Cursor relata de 22,1% a 26,2% nos mesmos níveis de esforço onde o pensamento ativado pontuou de 30,9% a 42,3%.

O que os clientes relatam

Estes vêm da publicação de lançamento da Anthropic e não foram verificados independentemente:

Execute sua própria avaliação

Benchmarks não se parecem com seu tráfego. O guia de prompts da Anthropic sugere usar xhigh ou max apenas onde suas avaliações mostram um ganho, e executar as mesmas avaliações no Sonnet 5.5 para comparar. No Apidog:

  1. Armazene ANTHROPIC_API_KEY como uma variável de ambiente e salve de 20 a 50 prompts reais como requisições de Mensagens.
  2. Adicione asserções: status 200, um stop_reason diferente de "max_tokens" ou "refusal", e o conteúdo que uma resposta correta precisa.
  3. Execute o conjunto em low, medium e high. Alterar o esforço invalida o cache de prompts.
  4. Registre a taxa de aprovação e a contagem de tokens em usage. O novo tokenizador produz cerca de 30% mais tokens do que o do Haiku 4.5 para o mesmo texto.
  5. Duplique a coleção, troque por claude-sonnet-5-5 e compare ambos os modelos em um projeto.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
  }'

Não envie temperature, top_p, top_k ou um preenchimento inicial do assistente; cada um retorna um 400 no Haiku 5.5. Selecione os blocos de resposta por type, já que um bloco thinking pode vir primeiro. Veja o guia da API e testando aplicativos LLM.

Perguntas Frequentes

O Claude Haiku 5.5 é melhor que o Sonnet 5.5? Não pelos números da Anthropic. Sonnet 5.5 lidera todas as linhas da tabela de lançamento; Haiku só o supera no FrontierCode quando ambos rodam no máximo (46,4% vs 46,2%). Veja Haiku 5.5 vs Haiku 4.5 para a visão de atualização.

Qual é a pontuação SWE-bench do Haiku 5.5? 64,8 no SWE-Bench Pro, 83,7 no SWE-bench Multilingual e 30,7 no SWE-bench Multimodal, todos com esforço máximo.

Com qual esforço os benchmarks foram executados? Máximo, geralmente com média de cinco tentativas. O padrão da API é médio, onde o GDPval-AA pontua 1277 em vez de 1620.

Existem benchmarks independentes para o Haiku 5.5? Ainda não. A Artificial Analysis executou o GDPval-AA e o AA-Briefcase de forma independente, mas a Anthropic publicou essas pontuações; a AA não tem uma página para o Haiku 5.5.

O GPT-6 Luna é mais barato? Geralmente. Luna custa menos em todos os níveis de esforço do GDPval-AA e em todos os níveis do OSWorld, exceto no médio, onde os dois custam aproximadamente o mesmo. Haiku 5.5 pontua mais alto em ambos.

Próximo passo

Comece em medium e aumente o esforço apenas onde o ganho na sua taxa de aprovação se pagar. Baixe o Apidog, crie a coleção de avaliação acima e mantenha os resultados no Apidog ao lado da sua linha de base do Sonnet 5.5 antes de alternar o tráfego de produção.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs