A Anthropic lançou o Claude Fable 5.1 em 1º de setembro de 2026, com uma tabela comparativa de desempenho que o compara ao Fable 5, Opus 5 e GPT-5.6 Sol em nove testes. A manchete que todas as mídias destacaram foi a do Terminal-Bench-Science, onde o Fable 5.1 atingiu 52,6% contra 24,7% do Fable 5. O número que menos veículos destacaram foi o CursorBench, onde a diferença para o Opus 5 é de 3,4 pontos em um modelo que custa o dobro.
Este guia reúne todos os números publicados em um só lugar com atribuição, explica o que cada benchmark mede, separa as grandes diferenças das pequenas e, então, aborda a parte que a cobertura de lançamento omitiu: todos esses são resultados fornecidos pelo desenvolvedor, o Mythos 5.1 supera o Fable 5.1 no único teste de codificação autônoma onde ambos foram publicados, e a resposta correta a uma tabela de lançamento é executar suas próprias avaliações. A fonte primária é a publicação de lançamento da Anthropic; o contexto do modelo está em o que é o Claude Fable 5.1.
A tabela completa
| Benchmark | O que mede | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Pesquisa científica autônoma em um terminal | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Codificação autônoma em um terminal | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Trabalho de conhecimento economicamente valioso (Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (crédito parcial) | Uso de computador em tarefas reais de desktop | 77.9% | 72.9% | 75.4% | não reportado |
| OSWorld 2.0 (estrito) | Mesmo, apenas conclusão total da tarefa | 41.7% | 36.1% | 39.6% | não reportado |
| Humanity’s Last Exam (sem ferramentas) | Perguntas de raciocínio de nível especialista | 60.9% | 57.8% | 56.6% | não reportado |
| Humanity’s Last Exam (com ferramentas) | Mesmo, com pesquisa e código | 65.0% | 63.8% | 63.6% | não reportado |
| AutomationBench | Fluxos de trabalho de negócios de ponta a ponta | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Tarefas de codificação estilo IDE | 73.4% | 70.5% | 70.0% | 67.2% |
A Anthropic também publicou um número do Mythos 5.1: 60,9% no Terminal-Bench 4.0. A VentureBeat também relatou um resultado de 82% no Browserbase para o Fable 5.1 contra 74% para o Opus 5 e 57% para o Fable 5 nas tarefas mais difíceis de agente de navegador; esse valor é da cobertura da imprensa e não da publicação de lançamento, então pondere-o de acordo.
As grandes diferenças
Terminal-Bench-Science 0.1: 52,6% vs 24,7% (Fable 5) e 29,0% (Opus 5). Este é o resultado. O Fable 5.1 mais que dobra seu predecessor e quase dobra o Opus 5 em um benchmark que coloca o modelo em um terminal com ferramentas científicas e pede para ele executar pesquisas em múltiplas etapas. É a evidência mais clara de que o foco declarado da Anthropic em “resolução de problemas de longo prazo” produziu algo mensurável. É também um benchmark de versão 0.1, o que significa que o conjunto de tarefas é novo e as pontuações provavelmente mudarão à medida que amadurecer.

AutomationBench: 31,4% vs 17,1% (Fable 5) e 26,9% (Opus 5). Um benchmark de fluxos de trabalho de negócios de ponta a ponta em várias aplicações, onde os números absolutos são baixos para todos. O Fable 5.1 quase dobra o Fable 5 aqui e lidera o Opus 5 por 4,5 pontos. Se seu produto automatiza tarefas de negócios multiaplicativos, esta é a linha a se importar.
Terminal-Bench 4.0: 55,8% vs 42,0% (Fable 5). Um salto de 13,8 pontos sobre o Fable 5 em codificação autônoma, que é o número que a publicação de lançamento da Anthropic destacou na seção de codificação. Contra o Opus 5, a liderança é de 3,5 pontos. O Opus 5 já havia ultrapassado o Fable 5 neste benchmark em julho, então a vantagem da camada Fable sobre a camada Opus em codificação autônoma está de volta, mas mais estreita do que era em junho. A análise dos benchmarks do Opus 5 tem os números de julho.

GDPval-AA v2: 1853 vs 1723 (Fable 5). Um ganho de 130 Elo sobre o Fable 5 em tarefas de trabalho de conhecimento, e o benchmark que a Anthropic aponta para suas afirmações sobre documentos, planilhas e slides. Contra o Opus 5, a diferença é de 29 Elo, que é pequena.
As pequenas diferenças
CursorBench 3.2.0: 73,4% vs 70,5% (Fable 5) e 70,0% (Opus 5). Tarefas de codificação estilo IDE. Três pontos sobre qualquer um dos modelos. Este é o benchmark que mais importa para a maior população de desenvolvedores, e é onde a vantagem do Fable 5.1 é a mais fina. Se sua carga de trabalho é “me ajudar no meu editor”, a tabela de lançamento não justifica um preço 2x por si só.

OSWorld 2.0: 77,9% / 41,7% vs 75,4% / 39,6% (Opus 5). Uso de computador. Dois pontos sobre o Opus 5 em ambas as pontuações, cinco sobre o Fable 5. Real, não dramático. Observe a pontuação estrita: menos da metade das tarefas totalmente concluídas em qualquer modelo. O uso do computador ainda é a área mais fraca da fronteira.
Humanity’s Last Exam: 60,9% / 65,0% vs 56,6% / 63,6% (Opus 5). Sem ferramentas, uma liderança de 4,3 pontos sobre o Opus 5, que é a maior das pequenas diferenças. Com ferramentas, ela encolhe para 1,4 pontos, porque a pesquisa e a execução de código nivelam o campo. O número sem ferramentas é a melhor medida de raciocínio bruto; o número com ferramentas está mais próximo de como o modelo é usado.

Fable 5.1 vs GPT-5.6 Sol
A Anthropic publicou quatro linhas com uma coluna GPT-5.6 Sol, e o Fable 5.1 lidera em todas as quatro: Terminal-Bench-Science por 30,2 pontos, Terminal-Bench 4.0 por 18,5, AutomationBench por 11,8 e CursorBench por 6,2. O GDPval-AA mostra 1853 contra 1711. Duas ressalvas. Estas são execuções da Anthropic de um modelo concorrente, e as cinco linhas sem uma coluna GPT-5.6 Sol estão faltando por uma razão que a Anthropic não declarou. Nossa comparação GPT-5.6 Sol vs Fable 5 cobriu o confronto anterior; com esses números, o Fable 5.1 amplia todas as diferenças que o Fable 5 tinha.
O que a cobertura de lançamento omitiu
Todo número é executado pelo fornecedor. A Anthropic executou todos eles, incluindo a coluna do concorrente, e nenhum laboratório independente havia reproduzido nenhum deles no lançamento. O histórico de benchmarks da Anthropic geralmente se manteve, mas as diferenças do CursorBench e OSWorld são pequenas o suficiente para que uma metodologia de teste ou escolha de pontuação diferente possa invertê-los.
Mythos 5.1 é o verdadeiro teto. O cartão do sistema e a publicação de lançamento da Anthropic afirmam que Fable 5.1 e Mythos 5.1 são “o mesmo modelo, mas com diferentes níveis de salvaguardas”, e ele publicou o Mythos 5.1 com 60,9% no Terminal-Bench 4.0 contra 55,8% do Fable 5.1. Essa diferença de cinco pontos é o custo das salvaguardas na codificação autônoma, e significa que o “modelo amplamente lançado mais capaz da Anthropic” tem um irmão superior conhecido acima dele. A comparação Mythos 5.1 vs Fable 5.1 aborda quem pode acessá-lo.
O esforço não foi declarado. A documentação de esforço da Anthropic diz que os ganhos do Fable 5.1 são maiores em xhigh e max. A publicação de lançamento não diz qual nível de esforço produziu cada pontuação, ou em que esforço os modelos de comparação foram executados. Como o esforço é a principal alavanca de qualidade nesses modelos, essa omissão importa quando se tenta reproduzir um número.
Multilíngue está estável. A Anthropic afirma que o desempenho multilíngue está a par com o Fable 5, não melhorou. Se sua carga de trabalho não for em inglês, a tabela de lançamento superestima o ganho.
Os números de salvaguarda são um tipo diferente de benchmark. A Anthropic relata 85% menos falsos positivos em biologia em solicitações benignas e cerca de 60% menos intervenções cibernéticas por sessão do Claude Code em comparação com o Fable 5. Isso é medido no tráfego da própria Anthropic e não é reproduzível externamente, mas para um usuário do Fable 5 que encontrava recusas, isso pode importar mais do que qualquer linha de capacidade.
O que testar você mesmo
Uma tabela de lançamento diz onde procurar. Suas avaliações dizem se você deve mudar. Quatro testes que correspondem às linhas acima:
- Uma tarefa de agente de longo prazo do seu próprio produto, executada até a conclusão no Fable 5.1 em
high, Opus 5 emxhighe Fable 5 emhigh. Este é o análogo do Terminal-Bench-Science e AutomationBench, e é onde o preço 2x compensa ou não. - Seus dez prompts de codificação mais difíceis com o mesmo esforço no Fable 5.1 e Opus 5. Se os resultados empatarem, você reproduziu a história do CursorBench e o Opus 5 é a resposta.
- Uma varredura de esforço no Fable 5.1 sozinho, de
lowamax, em uma tarefa rotineira. A afirmação da Anthropic é quemediumcorresponde ao Fable 5 elowcompete com o Opus 5 em custo por tarefa. Verifique. - Uma contagem de recusas em seus prompts benignos de segurança ou ciências da vida, Fable 5 versus Fable 5.1. Essa é a afirmação de 60% e 85%, e é a que você pode verificar em uma tarde.
Crie todos os quatro como solicitações no Apidog com model e effort como variáveis de ambiente, adicione asserções em stop_reason e na presença de uma string esperada na resposta, e execute a coleção por modelo. O histórico de execução fornece uma tabela de avaliação reproduzível sem nenhuma nova infraestrutura. Baixe o Apidog para configurá-lo; o passo a passo da API tem os formatos de solicitação.

Como os benchmarks se mapeiam para a decisão
- Agentes de longo prazo, pesquisa, automação: as diferenças são grandes e consistentes. O Fable 5.1 é o modelo, e a análise de preços mostra que as leituras de cache mais baratas reduzem a diferença de custo exatamente nessas cargas de trabalho.
- Codificação IDE, Q&A de conhecimento, raciocínio assistido por ferramentas: as diferenças para o Opus 5 são de um a quatro pontos. A própria regra da Anthropic se aplica: mantenha-se no Opus 5 a menos que ele falhe em suas avaliações com maior esforço. A comparação Fable 5.1 vs Opus 5 aborda isso.
- Vindo do Fable 5: todas as linhas melhoraram, o preço não, e a taxa de falsos positivos caiu. A comparação Fable 5.1 vs Fable 5 cobre o custo de migração.
FAQ
Qual é o melhor resultado de benchmark do Claude Fable 5.1? Terminal-Bench-Science 0.1 com 52,6%, mais que o dobro dos 24,7% do Fable 5 e à frente dos 29,0% do Opus 5 e dos 22,4% do GPT-5.6 Sol. Todos os números são da Anthropic.
Como o Fable 5.1 se compara ao Opus 5 em codificação? 55,8% vs 52,3% no Terminal-Bench 4.0 e 73,4% vs 70,0% no CursorBench 3.2.0, de acordo com os números da Anthropic. Vantagens reais, mas estreitas, de cerca de três pontos.
O Fable 5.1 é melhor que o GPT-5.6 Sol? Nos quatro benchmarks onde a Anthropic publicou ambos, sim, por 6 a 30 pontos. A Anthropic executou os números do GPT-5.6 Sol por conta própria, e cinco de suas nove linhas não têm entrada para o GPT-5.6 Sol.
Os benchmarks do Fable 5.1 são verificados independentemente? Não no lançamento. Todos os números são executados pela Anthropic. Trate-os como reivindicações para testar em sua própria carga de trabalho.
Como o Mythos 5.1 pontua? A Anthropic publicou um número: 60,9% no Terminal-Bench 4.0, cinco pontos acima dos 55,8% do Fable 5.1. Os dois são o mesmo modelo com diferentes salvaguardas.
Qual nível de esforço produziu essas pontuações? A Anthropic não informou. Sua orientação é que os ganhos do Fable 5.1 são maiores em xhigh e max, então assuma alto esforço e espere que configurações mais baixas pontuem menos.
