Claude Fable 5.1 custa US$10 por milhão de tokens de entrada e US$50 por milhão de tokens de saída, exatamente o que Fable 5 cobrava. O número que mudou são as leituras de cache de prompt: US$0,25 por milhão de tokens, uma redução de US$1 no Fable 5 e metade dos US$0,50 do Opus 5. A Anthropic estima que isso torna as cargas de trabalho típicas cerca de 25% mais baratas que o Fable 5 e as altamente agentivas até cerca de 45% mais baratas.
Este guia apresenta todas as taxas na página oficial de preços, reproduz as alegações de 25% e 45% para que você possa inserir sua própria taxa de acerto de cache, trabalha com três exemplos reais de custo por tarefa e lista as alavancas que movimentam a conta. Se você quiser primeiro uma visão geral do modelo, leia o que é o Claude Fable 5.1.
Tabela de preços do Claude Fable 5.1
| Taxa | Claude Fable 5.1 |
|---|---|
| Entrada base | US$10 por milhão de tokens |
| Saída | US$50 por milhão de tokens |
| Escrita de cache de 5 minutos | US$12,50 por milhão (1,25x entrada) |
| Escrita de cache de 1 hora | US$20 por milhão (2x entrada) |
| Leitura de cache (acerto ou atualização) | US$0,25 por milhão (0,025x entrada) |
| Entrada da API em lote | US$5 por milhão |
| Saída da API em lote | US$25 por milhão |
| Prêmio por contexto longo | Nenhum; a janela completa de 1M é cobrada pelas taxas padrão |
inference_geo: "us" |
1,1x em todas as categorias de token |
| Modo rápido | Não disponível (somente Opus 5 e Opus 4.8) |
| Nível de Prioridade | Não suportado |
| Pesquisa na web | US$10 por 1.000 pesquisas, mais tokens |
Claude Mythos 5.1 tem as mesmas taxas. O desconto de lote e os multiplicadores de cache se acumulam, então uma leitura de cache em lote custa US$0,125 por milhão.
Como o preço da leitura de cache se compara
| Modelo | Entrada base | Leitura de cache | Leitura de cache como parcela da entrada |
|---|---|---|---|
| Claude Fable 5.1 | US$10 | US$0,25 | 2,5% |
| Claude Fable 5 | US$10 | US$1,00 | 10% |
| Claude Opus 5 | US$5 | US$0,50 | 10% |
| Claude Opus 4.8 | US$5 | US$0,50 | 10% |
| Claude Sonnet 5 | US$2 | US$0,20 | 10% |
| Claude Haiku 4.5 | US$1 | US$0,10 | 10% |
Todos os outros modelos Claude precificam um acerto de cache em 10% da entrada base. O Fable 5.1 o precifica em 2,5%. O efeito prático: um acerto de cache do Fable 5.1 é mais barato do que um acerto de cache do Opus 5, mesmo que a entrada não armazenada em cache do Fable 5.1 seja o dobro do preço. Para uma carga de trabalho onde a maioria dos tokens de entrada são prefixos armazenados em cache, a taxa de entrada efetiva no Fable 5.1 pode cair abaixo da do Opus 5.

Uma nota sobre o Sonnet 5, já que a comparação entre Opus 5 e Sonnet 5 apontou um aumento de preço em setembro: a Anthropic o cancelou. O Sonnet 5 permanece em US$2 e US$10.
Reproduzindo as alegações de 25% e 45%
A Anthropic não publicou a combinação de carga de trabalho por trás dessas estimativas, então trate isso como uma reconstrução que mostra qual taxa de acerto de cache elas implicam, e não como o modelo exato delas.
Seja uma solicitação com `U` tokens de entrada não armazenados em cache, `C` tokens de entrada armazenados em cache e `O` tokens de saída. O custo por milhão no Fable 5 é `10U + 1.0C + 50O`; no Fable 5.1 é `10U + 0.25C + 50O`. A economia é `0.75C`, e a porcentagem de economia é `0.75C / (10U + C + 50O)`.
Uma carga de trabalho típica estilo chat. Digamos 20.000 tokens armazenados em cache, 2.000 tokens de entrada não armazenados em cache e 1.500 tokens de saída por solicitação. Fable 5: `10(0.002) + 1.0(0.02) + 50(0.0015)` = US$0,02 + US$0,02 + US$0,075 = US$0,115. Fable 5.1: US$0,02 + US$0,005 + US$0,075 = US$0,100. Economia: 13%. Para atingir os 25% da Anthropic, a parcela armazenada em cache deve ser maior em relação à saída, por exemplo, 60.000 tokens armazenados em cache em relação aos mesmos 1.500 tokens de saída, o que resulta em US$0,155 vs US$0,110, uma economia de 29%.
Um loop agentivo. Um agente que relê um prefixo de 150.000 tokens armazenado em cache em cada uma das 40 chamadas de ferramenta, adiciona 1.000 tokens não armazenados em cache por chamada e produz 800 tokens de saída por chamada. Por chamada no Fable 5: `10(0.001) + 1.0(0.15) + 50(0.0008)` = US$0,01 + US$0,15 + US$0,04 = US$0,20. No Fable 5.1: US$0,01 + US$0,0375 + US$0,04 = US$0,0875. Economia: 56% por chamada, antes da escrita de cache única. Em 40 chamadas, isso é US$8,00 vs US$3,50. Os "até 45%" da Anthropic se encaixam confortavelmente nessa faixa depois que você adiciona as escritas de cache e as chamadas não armazenadas em cache que todo agente real tem.
A regra que se desprende: a economia escala com a proporção de entrada armazenada em cache para saída. Cargas de trabalho que são pesadas em saída (gerações longas a partir de prompts curtos) mal percebem a mudança. Cargas de trabalho que são pesadas em prefixo (agentes, RAG com grande contexto estável, bots de suporte multi-turnos) veem o efeito completo.
Três exemplos de custo por tarefa resolvidos
Todos os três assumem Fable 5.1 nas taxas padrão, com a escrita de cache de 5 minutos paga uma vez.
1. Uma única revisão de código. 30.000 tokens de entrada (a diferença mais um prompt de sistema), 4.000 tokens de saída, sem cache. Entrada US$0,30, saída US$0,20. Total: US$0,50. A mesma revisão no Opus 5 custa US$0,25. Este é o caso em que o Fable 5.1 é simplesmente o dobro do preço, porque nada é armazenado em cache.
2. Uma conversa de suporte de 25 turnos. Um prompt de sistema estável de 12.000 tokens armazenado em cache uma vez (US$0,15 pela escrita), depois 25 turnos, cada um adicionando 300 tokens de entrada não armazenados em cache e 250 tokens de saída, com o prefixo servido do cache. Entrada não armazenada em cache durante a conversa: 7.500 tokens = US$0,075. Leituras de cache: 25 x 12.000 = 300.000 tokens = US$0,075. Saída: 6.250 tokens = US$0,3125. Total: cerca de US$0,61. No Fable 5, as leituras de cache sozinhas custariam US$0,30, para um total próximo de US$0,84.
3. Uma construção agentiva de duas horas. 120 turnos de chamada de ferramenta contra um prefixo que cresce de 20.000 para 200.000 tokens (média de 110.000 armazenados em cache), 1.500 tokens não armazenados em cache por turno, 1.200 tokens de saída por turno e cerca de seis atualizações de cache conforme o prefixo cresce. Leituras de cache: 120 x 110.000 = 13,2M tokens = US$3,30. Entrada não armazenada em cache: 180.000 tokens = US$1,80. Saída: 144.000 tokens = US$7,20. Escritas de cache: aproximadamente 660.000 tokens a US$12,50 = US$8,25. Total: cerca de US$20,55. No Fable 5, as leituras de cache seriam US$13,20 em vez de US$3,30, para um total próximo de US$30,45. Essa é uma economia de 33% em uma execução onde a saída ainda é o item de maior custo.
Observe no exemplo 3 que as escritas de cache são agora o segundo maior custo. Esse é o outro lado das leituras baratas: uma perda é 40x um acerto, então qualquer coisa que redefina o cache no meio da sessão (reconstruir o prompt do sistema, editar um turno anterior, mudar o array de ferramentas) custa muito mais em relação ao estado estável do que custava no Fable 5.
As alavancas que movimentam a conta
Esforço. `output_config.effort` é a maior alavanca individual nos tokens de saída, e a saída custa US$50 por milhão. A orientação da Anthropic para o Fable 5.1 é começar em `high`, e a alegação deles é que `medium` se equipara aproximadamente à qualidade do Fable 5 a um custo menor, enquanto `low` é frequentemente competitivo com Opus e Sonnet no custo por tarefa. Execute a varredura em suas próprias avaliações. O beta de esforço por mensagem permite que você mude para `low` para turnos rotineiros e o aumente para os difíceis sem um reset de cache.
Mantenha o cache aquecido. O armazenamento em cache de prompt é o desconto. Com leituras a US$0,25 e escritas a US$12,50, o ponto de equilíbrio para o TTL de 5 minutos é um acerto. Para intervalos ociosos entre cinco e sessenta minutos, um reenvio de `max_tokens: 0` para manter o TTL de 5 minutos ativo geralmente é mais barato do que pagar 2x pela escrita para o TTL de 1 hora. E a mesma disciplina de "append-only" que preserva blocos de pensamento neste modelo preserva o cache: nunca reconstrua `system` ou `tools` no meio da sessão, use mensagens de sistema no meio da conversa para mudanças, e use mensagens com escopo de turno para lembretes por turno.
Lote o que pode esperar. A API em Lote reduz tudo pela metade, então uma solicitação em lote do Fable 5.1 custa US$5 e US$25, o mesmo preço síncrono do Opus 5. Avaliações, preenchimentos retroativos e processamento noturno de documentos pertencem a ela. Observe que `fallbacks` são rejeitados em lotes, então itens recusados precisam de um reenvio manual.
Escolha o nível por rota. A própria documentação da Anthropic sugere começar com o Opus 5 e mudar para o Fable 5.1 quando o Opus 5 com maior esforço ainda não for suficiente. Para rotas onde o Opus 5 passa nas suas avaliações, você está pagando o dobro por nada. A comparação Fable 5.1 vs Opus 5 aborda a decisão por carga de trabalho.
Observe a sobrecarga de ferramentas. Cada solicitação com ferramentas carrega um prompt de sistema de uso de ferramenta oculto. A Anthropic publica a contagem para o Opus 5 (286 tokens), mas ainda não publicou um valor para o Fable 5.1, então meça-o com o endpoint de contagem de tokens. Um conjunto de ferramentas de navegador adiciona cerca de 6.600 tokens por solicitação e o conjunto de ferramentas de computador cerca de 4.500, todos armazenados em cache após o primeiro envio.
Recusas são gratuitas, retentativas não. Uma recusa do classificador antes de qualquer saída não é faturada. Um fallback no lado do servidor cobra as taxas do modelo de fallback pela nova tentativa, e o crédito de fallback da Anthropic reembolsa o custo do cache pela mudança. Monitore as recusas como uma métrica própria para saber quanto do seu gasto com Fable 5.1 está sendo atendido pelo Opus 5.
A maioria das técnicas gerais em nosso guia para cortar a conta da API Claude ainda se aplica, com a matemática da leitura de cache mudada a favor do Fable 5.1.
O que você não pode comprar no Fable 5.1
O modo rápido é apenas para Opus 5 e Opus 4.8, a US$10 e US$50. Não há como pagar por uma saída mais rápida do Fable 5.1. O Nível de Prioridade não é suportado no Fable 5.1 ou Mythos 5.1, enquanto o Fable 5 o mantém, então o planejamento de capacidade empresarial que depende dele deve permanecer no Fable 5 ou mudar para o Opus 5. E a retenção zero de dados não está disponível a menos que a Anthropic a autorize expressamente; uma organização ZDR recebe um 400 em cada solicitação.
Verificando seu gasto real no Apidog
A única maneira confiável de saber quanto custa uma solicitação é o objeto `usage`, e a maneira mais rápida de lê-lo é uma coleção de testes. No Apidog, salve seu prompt de sistema de produção como uma solicitação com `cache_control` ativado, envie-o duas vezes e adicione asserções em `usage.cache_creation_input_tokens` para o primeiro envio e `usage.cache_read_input_tokens` para o segundo. Em seguida, adicione um script pós-resposta que multiplica cada campo por sua taxa e registra um custo por solicitação. Execute a coleção sempre que alterar um prompt ou uma definição de ferramenta, e você pegará uma edição que quebra o cache antes que ela afete a conta. Baixe o Apidog para construí-lo; o passo a passo da API mostra as solicitações exatas.
Preços do Fable 5.1 nos aplicativos Claude
O preço da API é por token. Nos aplicativos Claude, o Fable 5.1 é medido por plano. Os planos Max incluem modelos Fable para até 50% do limite de uso semanal sem custo extra, e depois continuam com créditos de uso. Assentos Pro e padrão de Equipe medem o Fable 5.1 por meio de créditos de uso desde a primeira mensagem. Assentos empresariais padrão precisam de créditos de uso habilitados para uso além dos limites do plano, e as contas empresariais baseadas em uso cobram as taxas padrão da API. Solicitações que as salvaguardas redirecionam para outro modelo não são cobradas pelos preços Fable. O guia de caminhos gratuitos e mais baratos explica o que isso significa na prática.
FAQ
Quanto custa Claude Fable 5.1 por milhão de tokens? US$10 de entrada e US$50 de saída, inalterados em relação ao Fable 5. As leituras de cache custam US$0,25 por milhão, as escritas de cache são US$12,50 (5 minutos) e US$20 (1 hora), e a API em Lote custa US$5 e US$25.
Claude Fable 5.1 é mais barato que Fable 5? Por token, não. Na prática, sim para qualquer coisa que use cache de prompt, porque as leituras de cache caíram de US$1 para US$0,25 por milhão. A Anthropic estima 25% mais barato em cargas de trabalho típicas e até 45% em cargas agentivas. Cargas de trabalho pesadas em saída veem pouca mudança.
Claude Fable 5.1 é mais barato que Opus 5? Sem cache, não: é exatamente o dobro do preço. Com cache, o cenário muda: um acerto de cache do Fable 5.1 (US$0,25) custa metade de um acerto de cache do Opus 5 (US$0,50). A saída ainda é US$50 vs US$25, então o Opus 5 vence em qualquer rota pesada em saída.
Claude Fable 5.1 tem modo rápido ou Nível de Prioridade? Não para ambos. O modo rápido é apenas para Opus 5 e Opus 4.8. O Nível de Prioridade é suportado no Fable 5, mas não no Fable 5.1.
Existe um prêmio por contexto longo no Claude Fable 5.1? Não. A janela completa de 1M de tokens é cobrada pelas taxas padrão, e os descontos de cache e lote se aplicam a ela.
Quanto custa Claude Fable 5.1 no Bedrock ou Google Cloud? Essas plataformas definem seus próprios preços e adicionam um prêmio de 10% para endpoints regionais. O Claude Platform na AWS e Microsoft Foundry cobram as taxas padrão da API por meio das Unidades de Consumo Claude. Nosso guia de disponibilidade em nuvem aborda a configuração em cada um.
