Seu agente reenvia os mesmos 40.000 tokens de prompt do sistema, definições de ferramentas e documentos de política a cada chamada. Com o preço de entrada do Claude Opus 5.5 de $4 por milhão de tokens, esse prefixo custa $0.16 cada vez que se move, independentemente de um único byte ter mudado desde a última solicitação.
O cache de prompt é a solução, e a Anthropic o precificou agressivamente no Opus 5.5. Uma leitura em cache custa $0.20 por milhão de tokens, contra $4.00 para entrada nova, um desconto de 95%. Mas uma gravação em cache custa $5.00 por milhão, o que é mais do que enviar os tokens sem cache. Portanto, o cache não é dinheiro grátis. É uma aposta de que você reutilizará o prefixo, e a aposta tem um ponto de equilíbrio preciso que quase ninguém calcula antes de ativá-lo.
Este artigo detalha essa aritmética. A resposta curta: em um único prefixo, você atinge o ponto de equilíbrio após 1.26 chamadas, e em estado estacionário, você atinge o ponto de equilíbrio com uma taxa de acerto de cache de cerca de 21%. Abaixo disso, o cache custa dinheiro.
A escala vale a pena ser mencionada primeiro. A OpenAI divulgou em seu próprio lançamento que seu pesquisador mediano gasta mais de $600 por dia em agentes de codificação, com o percentil 90 acima de $7.000 por dia. Nesse volume, uma diferença de 20 pontos percentuais na taxa de acerto equivale a um salário. Para uma visão mais ampla dos preços em todos os três lançamentos de setembro, consulte nossa análise da guerra de preços de modelos de IA de setembro de 2026.
As três taxas que decidem tudo
| Tipo de Token | Taxa do Claude Opus 5.5 por milhão | Relativo à entrada nova |
|---|---|---|
| Entrada nova | $4.00 | linha de base |
| Gravação em cache | $5.00 | prêmio de $1.00 |
| Leitura em cache | $0.20 | economia de $3.80 |
| Saída | $20.00 | o cache não afeta isso |
Dois fatos saltam imediatamente dessa tabela. Gravar um prefixo no cache custa $1.00 por milhão a mais do que não o armazenar em cache. Cada leitura posterior desse prefixo economiza $3.80 por milhão. O preço da saída nunca muda, então um agente que emite respostas longas a partir de um prompt curto tem pouco a ganhar aqui, enquanto um que lê um grande contexto estável e retorna um veredito curto tem muito a ganhar.
A folha de especificações completa, incluindo a janela de contexto de 1.000.000 de tokens e a saída máxima de 128.000 tokens, está em o que é o Claude Opus 5.5.
O ponto de equilíbrio é de 1.26 chamadas, não duas
Considere um prefixo de exatamente um milhão de tokens e N chamadas que o compartilham, uma gravação e N menos uma leitura.
sem cache: N * $4.00
com cache: $5.00 + (N - 1) * $0.20
4.00N = 5.00 + 0.20(N - 1)
3.80N = 4.80
N = 1.26
Você precisa de 1.26 chamadas para pagar o prêmio de gravação. Como as chamadas vêm em números inteiros, isso significa: se o prefixo for lido de volta mesmo uma vez, armazená-lo em cache estava correto. Duas chamadas já o deixam 35% à frente.
| Chamadas compartilhando uma gravação | Custo sem cache por 1M de prefixo | Custo em cache | Economia |
|---|---|---|---|
| 1 | $4.00 | $5.00 | 25% pior |
| 2 | $8.00 | $5.20 | 35% |
| 5 | $20.00 | $5.80 | 71% |
| 10 | $40.00 | $6.80 | 83% |
| 100 | $400.00 | $24.80 | 94% |
Essa tabela assume uma gravação e reutilização perfeita depois. Sistemas reais são mais complicados, e é aí que entra o segundo cálculo.
Em estado estacionário, o único número que importa é a taxa de acertos
Ao longo de um dia de tráfego, você não está gravando apenas uma vez. Os caches expiram, os prefixos são editados, novos inquilinos chegam. Seja h a fração dos seus tokens de prefixo servidos a partir do cache. Uma falha (miss) é cobrada como uma gravação, um acerto (hit) é cobrado como uma leitura:
custo efetivo por 1M de tokens de prefixo = $5.00 * (1 - h) + $0.20 * h
= $5.00 - $4.80h
ponto de equilíbrio contra $4.00 sem cache: h = 1.00 / 4.80 = 20.8%
Vinte e um por cento é o número a ser lembrado. Se menos de aproximadamente um em cada cinco dos seus tokens de prefixo forem servidos do cache, ativar o cache piorou sua conta.
| Taxa de acerto do cache | Custo efetivo por 1M de prefixo | Comparado a $4.00 sem cache |
|---|---|---|
| 0% | $5.00 | 25% pior |
| 20.8% | $4.00 | ponto de equilíbrio |
| 50% | $2.60 | 35% mais barato |
| 75% | $1.40 | 65% mais barato |
| 90% | $0.68 | 83% mais barato |
| 95% | $0.44 | 89% mais barato |
| 99% | $0.25 | 94% mais barato |
| 100% | $0.20 | 95% mais barato |
As duas tabelas são a mesma equação vista de diferentes ângulos, já que uma gravação por N chamadas é uma taxa de acerto de (N-1)/N. Dez chamadas por gravação é uma taxa de acerto de 90% e ambas as tabelas indicam 83%.
Três formatos de solicitação, exemplificados
Formato 1: agente de alta frequência, prefixo pequeno
Um agente de triagem de suporte com um prefixo de 40.000 tokens, uma interação variável do usuário de 800 tokens, 600 tokens de saída, 10.000 chamadas por dia. Assuma gravações em 3% das chamadas, resultando em uma taxa de acerto de 97%.
| Sem Cache | Com Cache | |
|---|---|---|
| Prefixo, 400M tokens/dia | $1,600.00 | $137.60 |
| Interação variável, 8M tokens/dia | $32.00 | $32.00 |
| Total de entrada por dia | $1,632.00 | $169.60 |
Isso representa 89.6% de economia na linha de entrada, cerca de $1,462 por dia, ou $43,800 por mês. A saída permanece em $120 por dia de qualquer forma. Observe que o prefixo tem apenas 40.000 tokens. O cache compensa aqui por causa da frequência, não do tamanho.
Formato 2: passagem única sobre um contexto de 1M
Um milhão de tokens de entrada, uma resposta de saída, nunca reutilizado. Sem cache, essa chamada custa $4.00 de entrada. Com cache, custa $5.00, porque você pagou para gravar um prefixo que ninguém leu. Execute 500 documentos por dia nesse padrão e o cache custará $500 extras por dia à toa.
Este é o formato que as pessoas mais erram, porque o contexto é enorme e o instinto é que contextos enormes obviamente precisam de cache. O tamanho é irrelevante. A reutilização é a única variável.
Formato 3: sessão longa de agente em uma janela de 1M
Agora pegue o mesmo contexto de um milhão de tokens e faça com que um agente o releia em 200 interações, que é exatamente como um loop de tarefa de 18 horas se parece.
| Custo | |
|---|---|
| Sem cache, 200 x $4.00 | $800.00 |
| Com cache, 1 gravação + 199 leituras | $44.80 |
| Com cache, 5 gravações + 195 leituras | $64.00 |
Mesmo que o cache "esfrie" quatro vezes no meio da sessão e você pague por cinco gravações completas, você ainda estará 92% abaixo da conta sem cache. Sessões longas são onde a taxa de $0.20 ganha sua reputação.
O erro caro: armazenar em cache a parte que muda
Considere 5.000 documentos de 60.000 tokens cada, resumidos uma vez cada atrás de um cabeçalho de instrução compartilhado de 6.000 tokens.
| Estratégia | Custo de entrada |
|---|---|
| Sem cache | $1,320 |
| Armazenar em cache a requisição inteira, incluindo cada documento | $1,650 |
| Armazenar em cache apenas o cabeçalho de 6.000 tokens | $1,206 |
Armazenar em cache o limite errado é 25% pior do que não armazenar em cache. Armazenar em cache o certo é 9% melhor. Mesma funcionalidade, mesmas taxas, uma diferença de $444 decidida inteiramente por onde o prefixo em cache termina.
A regra que se extrai disso: armazene em cache a sequência mais longa de bytes iniciais que seja idêntica entre as chamadas, e nem um byte a mais. Se um carimbo de data/hora, um ID de solicitação ou um documento por solicitação estiver dentro do seu prefixo em cache, sua taxa de acerto desaba para zero e cada chamada será cobrada a $5.00 em vez de $4.00. A mecânica geral da correspondência de prefixo é abordada em nosso guia básico de cache de prompt.
95% é uma assíntota, não um desconto que você recebe
O número de destaque é que as leituras em cache custam 5% da entrada nova. Você nunca pagará de fato 5%, porque sempre pagou por pelo menos uma gravação. A 100 chamadas por gravação, você está em 94%. A 10 chamadas por gravação, você está em 83%. A 2 chamadas, você está em 35%.
Planeje com base na tabela de taxa de acertos, não no título. Uma equipe financeira que modela uma economia de 95% e observa 83% concluirá que o recurso está quebrado quando ele está funcionando exatamente como precificado.
O que o material de lançamento não te diz
Três variáveis para esta aritmética não estão no material de lançamento do Anthropic Opus 5.5, e tentar adivinhá-las seria a maneira mais rápida de errar um orçamento:
- Tempo de vida do cache. Quanto tempo um prefixo gravado permanece "quente" define diretamente sua taxa de acerto em estado estacionário. Cada exemplo trabalhado acima mantém h constante como uma suposição, não como uma garantia da plataforma.
- Comprimento mínimo de prefixo cacheável. As plataformas geralmente se recusam a armazenar em cache prefixos muito curtos. Se o seu estiver abaixo do limite, sua taxa de acerto efetiva será zero, não importa quão estáveis sejam os bytes.
- Escopo do cache. Se um prefixo "quente" é compartilhado entre chaves de API, workspaces ou regiões, isso muda substancialmente a contagem de gravações em uma implantação multi-tenant.
Verifique todos os três na página de preços do fornecedor antes de se comprometer com um número. As taxas neste artigo são publicadas. Essas três não são.
Teste se o cache está realmente funcionando
O modo de falha é silencioso. Nada gera um erro quando um prefixo "esfria". Alguém adiciona um ID de depuração à mensagem do sistema, a taxa de acerto cai de 97% para 0, e o único sinal é uma linha em uma fatura três semanas depois.
A API Messages reporta a divisão em cada resposta:
"usage": {
"input_tokens": 812,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 40960,
"output_tokens": 604
}
Na primeira chamada, cache_creation_input_tokens carrega o prefixo. Em cada chamada subsequente, esse campo deve ser 0 e cache_read_input_tokens deve carregar a mesma carga. Salve a solicitação uma vez no Apidog, execute-a duas vezes e observe qual campo se move.
Então transforme essa observação em uma asserção para que não possa regredir silenciosamente. Um cenário de teste do Apidog que envia a solicitação duas vezes e afirma cache_read_input_tokens > 40000 na segunda resposta falhará no CI no momento em que um colega de equipe tornar o prefixo não-determinístico. Esse é um teste de uma linha que está entre você e um aumento de 25x na cobrança de prefixos, e é a coisa de maior retorno neste artigo.
Onde o GPT-6 se encaixa na mesma matemática
O GPT-6 Sol lista a entrada a $2.00 por milhão com um desconto de 90% em leituras em cache, o que coloca uma leitura em cache a $0.20 por milhão, o mesmo valor que o Opus 5.5. O GPT-6 Luna a $0.10 por milhão de entrada resulta em $0.01 por milhão em cache.
A diferença é o que podemos calcular. O material de lançamento da OpenAI não indica uma taxa de gravação em cache, então a taxa de reutilização de ponto de equilíbrio para o GPT-6 não pode ser derivada da mesma forma que para o Opus 5.5. A Anthropic publicar um preço explícito de gravação de $5.00 é o que torna o valor de 21% calculável. O restante do lançamento do cache da OpenAI, incluindo as mudanças de esforço para preservação do cache e as novas ferramentas de diagnóstico, está em nossa análise do cache de prompt do GPT-6.
Conclusão
O cache de prompt no Claude Opus 5.5 é uma questão aritmética: mais de um quinto dos seus tokens de prefixo retornará "quente"? Se sim, ative-o e espere uma economia de 83% a 94% na linha de entrada, em vez dos 95% anunciados. Se sua carga de trabalho envolve passagens únicas sobre documentos exclusivos, mantenha-o desativado e economize o prêmio de gravação de $1.00 por milhão. E seja qual for a sua escolha, faça uma asserção em cache_read_input_tokens no CI, porque uma regressão de cache nunca se anuncia.
