Claude Opus 5 foi lançado em 24 de julho de 2026 a $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída. Essa é a mesma taxa que a Anthropic cobrava pelo Opus 4.8, e exatamente a metade do custo do Fable 5. A cobertura de lançamento destacou essa manchete, e ela é precisa até certo ponto.
O que a cobertura omitiu é a parte que decide sua fatura: escritas de cache, acertos de cache, taxas de lote, modo rápido, o multiplicador regional e as mudanças de comportamento que silenciosamente alteram a contagem de tokens. Este guia oferece a tabela de preços completa e, em seguida, calcula os custos em formatos de solicitação reais para que você possa dimensionar um orçamento antes de enviar. Para verificar os números em relação ao seu próprio tráfego, envie as solicitações do Apidog e leia o bloco usage em cada resposta.
A tabela de preços completa do Claude Opus 5
Cada taxa abaixo vem da documentação de preços da Anthropic e se aplica ao ID do modelo claude-opus-5.
| Categoria de Token | Preço por milhão de tokens |
|---|---|
| Entrada (padrão) | $5,00 |
| Saída (padrão) | $25,00 |
| Escrita de cache de prompt, TTL de 5 minutos | $6,25 |
| Escrita de cache de prompt, TTL de 1 hora | $10,00 |
| Acertos e atualizações de cache | $0,50 |
| Entrada da API em lote | $2,50 |
| Saída da API em lote | $12,50 |
| Entrada em modo rápido | $10,00 |
| Saída em modo rápido | $50,00 |
Alguns pontos a serem observados:
- Acertos de cache custam um décimo da entrada padrão. Essa é a maior alavanca na tabela.
- A escrita de cache de 5 minutos tem um prêmio de 1.25x sobre a entrada padrão; a escrita de 1 hora tem 2x.
- O processamento em lote tem um desconto fixo de 50% tanto para entrada quanto para saída.
- O modo rápido custa exatamente 2x o preço padrão para uma velocidade de saída 2.5x maior. É uma prévia de pesquisa, apenas para API de primeira parte (não Bedrock, Google Cloud ou Microsoft Foundry), e não se combina com a API em lote.
- Não há prêmio para contexto longo. A janela de contexto de 1 milhão de tokens é o padrão e o máximo, e os tokens que ultrapassam qualquer limite são cobrados pelos mesmos $5. Alguns modelos concorrentes cobram mais ao ultrapassar um nível de contexto. O Opus 5 não.

Esse último ponto impõe um limite rígido a uma única solicitação. A chamada mais cara possível da API de Mensagens é de 1 milhão de tokens de entrada mais o máximo de 128 mil tokens de saída: $5,00 + $3,20, ou $8,20. Na API em lote, onde a saída máxima aumenta para 300 mil com o cabeçalho beta output-300k-2026-03-24, o lado da saída é limitado a $3,75.
A referência: o mesmo que 4.8, metade do Fable 5
Veja onde o Opus 5 se posiciona em relação aos modelos com os quais você provavelmente o está comparando.
| Modelo | Entrada / MTok | Saída / MTok |
|---|---|---|
| Claude Opus 5 | $5,00 | $25,00 |
| Claude Opus 4.8 | $5,00 | $25,00 |
| Claude Fable 5 | $10,00 | $50,00 |
| Claude Sonnet 5 (introdução, até 31 de agosto de 2026) | $2,00 | $10,00 |
| Claude Sonnet 5 (a partir de 1º de setembro de 2026) | $3,00 | $15,00 |
Duas leituras desta tabela são importantes.
Primeiro, a atualização do Opus 4.8 não custa nada por token. A taxa é idêntica e tem sido a mesma para as versões 4.5, 4.6, 4.7 e 4.8. A troca do ID do modelo não afeta sua economia unitária. O que ela muda é o seu volume de tokens, que abordaremos abaixo. O detalhamento de preços do Opus 4.8 ainda se aplica a qualquer coisa com o ID mais antigo.
Segundo, o Opus 5 custa a metade do Fable 5. Os números de lançamento da Anthropic afirmam que o Opus 5 atinge uma performance dentro de 0.5% do pico do Fable 5 no CursorBench 3.2 e o supera no OSWorld 2.0 a aproximadamente um terço do custo por tarefa. Esses são números fornecidos pelo fornecedor, extraídos da publicação de lançamento do Opus 5, e ninguém os reproduziu independentemente até 25 de julho de 2026. Trate-os como afirmações, não como resultados comprovados. A comparação entre Opus 5 e Fable 5 detalha onde a diferença de preço vale a pena, e a página de preços do Fable 5 tem os detalhes dos níveis mais altos.
Exemplo prático 1: uma única solicitação
Comece com o formato mais simples. Uma chamada de sumarização com 8.000 tokens de entrada e 1.200 tokens de saída.
- Entrada: 8.000 / 1.000.000 x $5,00 = $0,040
- Saída: 1.200 / 1.000.000 x $25,00 = $0,030
- Total: $0,070 por chamada
A 10.000 chamadas por mês, isso equivale a $700. A mesma carga de trabalho no Fable 5 custa $0,140 por chamada, ou $1.400 por mês. No Sonnet 5, na taxa introdutória, custa $0,028 por chamada, ou $280.
Observe que a saída representa 43% da fatura em uma solicitação com quase sete vezes mais entrada do que saída. A saída custa cinco vezes mais do que a entrada, então o volume de saída domina mais rapidamente do que a maioria das pessoas espera. Isso importa mais no Opus 5 do que no 4.8, porque os tokens de "pensamento" são cobrados como saída e o pensamento adaptativo agora está ativado por padrão.
Exemplo prático 2: uma sessão agêntica longa com cache
É aqui que está o dinheiro real e a verdadeira economia. Considere um agente de codificação com um prompt de sistema de 120.000 tokens mais o contexto do repositório, executando uma sessão de 40 turnos. Cada turno adiciona 1.500 tokens de nova conversa e produz 2.500 tokens de saída.
Sem cache de prompt, você reenvia o contexto completo a cada turno:
| Item | Tokens | Taxa | Custo |
|---|---|---|---|
| Entrada (120.000 x 40, mais 60.000 novos) | 4.860.000 | $5,00 | $24,30 |
| Saída (2.500 x 40) | 100.000 | $25,00 | $2,50 |
| Total | $26,80 |
Com um cache de prompt de 5 minutos no prefixo de 120.000 tokens:
| Item | Tokens | Taxa | Custo |
|---|---|---|---|
| Escrita de cache, uma vez | 120.000 | $6,25 | $0,75 |
| Leituras de cache (39 turnos) | 4.680.000 | $0,50 | $2,34 |
| Nova entrada (1.500 x 40) | 60.000 | $5,00 | $0,30 |
| Saída (2.500 x 40) | 100.000 | $25,00 | $2,50 |
| Total | $5,89 |
Isso representa uma redução de 78%, e a saída agora é 42% da fatura, em vez de 9%. Uma vez que você faz o cache corretamente, a saída é a próxima coisa a otimizar.
Uma ressalva sobre o TTL de 5 minutos: as leituras de cache o atualizam, então uma sessão com turnos com menos de cinco minutos de diferença permanece ativa com uma única escrita. Se seu agente ficar inativo por mais tempo, use a escrita de 1 hora a $10 por milhão. Nesse caso, isso eleva a escrita de $0,75 para $1,20 e o total para $6,34, ainda 76% abaixo da execução sem cache.
Exemplo prático 3: processamento em lote
Para qualquer coisa que não precise de uma resposta síncrona, a API em Lote oferece um desconto fixo de 50%. Considere 50.000 documentos com 1.200 tokens de entrada e 150 tokens de saída cada.
| Caminho | Custo de Entrada | Custo de Saída | Total |
|---|---|---|---|
| Padrão | 60 MTok x $5,00 = $300,00 | 7,5 MTok x $25,00 = $187,50 | $487,50 |
| Lote | 60 MTok x $2,50 = $150,00 | 7,5 MTok x $12,50 = $93,75 | $243,75 |
Mesmos tokens, mesmo modelo, $243,75 economizados. A troca é pela latência, não pela qualidade. Se seu trabalho de classificação, enriquecimento ou avaliação tolera entrega assíncrona, executá-lo no endpoint padrão deixa metade do orçamento na mesa.
Exemplo prático 4: o custo real do modo rápido
O modo rápido dobra a taxa para $10 / $50 para aproximadamente 2.5x a velocidade de saída. Execute a solicitação do exemplo 1 através dele e você obterá $0,080 de entrada mais $0,060 de saída, ou $0,140 por chamada, exatamente o dobro.
Isso precifica o Opus 5 de forma idêntica à taxa padrão do Fable 5: você está pagando preços de ponta por latência, não por capacidade. Vale a pena para interfaces interativas onde um usuário vê os tokens aparecerem, mas difícil de justificar para trabalho em segundo plano. Ele não se combina com a API em Lote, então as duas alavancas de custo são mutuamente exclusivas por design.
As quatro alavancas que realmente movem sua fatura
Essas quatro são específicas do Opus 5 e detalham o quanto elas economizam.
1. O mínimo de cache de prompt caiu para 512 tokens
No Opus 4.8, o mínimo de cache era de 1.024 tokens. No Opus 5, é de 512. Prompts anteriormente muito curtos para serem armazenados em cache agora são armazenados sem alteração de código, além de adicionar o bloco de controle de cache.
O cálculo do ponto de equilíbrio é melhor do que a maioria das pessoas supõe. Uma escrita de cache custa 1.25x a entrada padrão, uma leitura custa 0.1x. Resolvendo para o ponto em que o cache compensa:
- TTL de 5 minutos: o ponto de equilíbrio é atingido em 1,3 solicitações. Você já está à frente a partir da segunda chamada.
- TTL de 1 hora: o ponto de equilíbrio é atingido em 2,1 solicitações. Você já está à frente a partir da terceira chamada.
Concretamente, um prompt de sistema de 700 tokens reutilizado em 1.000 chamadas em uma rajada custa $3,50 sem cache. Com cache, custa $0,0044 pela escrita mais 999 leituras a $0,00035, ou um total de $0,354. Esse prompt não poderia ser armazenado em cache no Opus 4.8.
2. Lote com 50% de desconto
Abordado acima, mas vale a pena reafirmar como uma alavanca: audite quais cargas de trabalho realmente precisam de uma resposta síncrona. Execuções de avaliação, preenchimento de dados (backfills), sumarização noturna e classificação de conteúdo geralmente não precisam.
3. Os níveis de esforço low e medium são finalmente utilizáveis
output_config.effort controla o quanto o modelo "pensa", e os tokens de pensamento são cobrados como saída a $25 por milhão. O Opus 5 recalibrou os níveis de esforço, e a Anthropic afirma que low e medium são significativamente mais fortes do que nos modelos Opus anteriores. O padrão é high; xhigh continua sendo o início recomendado para codificação e trabalho agêntico.
As economias aumentam diretamente com o volume de tokens de pensamento. Se uma tarefa usa em média 8.000 tokens de pensamento em xhigh e 1.500 em low, você economiza 6.500 tokens de saída, ou $0,1625 por tarefa, o que representa $16.250 em 100.000 tarefas. Esses números são ilustrativos: a diferença real depende dos seus prompts, e é por isso que a Anthropic recomenda que você faça uma nova varredura de esforço em suas próprias avaliações, em vez de usar as configurações do 4.8. O guia de parâmetros de esforço cobre essa varredura.
Uma armadilha: diminuir o esforço reduz os tokens de pensamento, não o comprimento da resposta visível. As respostas padrão e os entregáveis escritos do Opus 5 são mais longos que os do Opus 4.8, e o esforço não resolverá isso. Se você quiser respostas mais curtas, peça respostas mais curtas.
4. Menor sobrecarga de prompt de sistema para uso de ferramentas
Quando você envia definições de ferramentas, a API injeta um prompt de sistema pelo qual você paga. No Opus 5, essa sobrecarga é de 286 tokens para escolha de ferramenta auto ou none, uma redução em relação aos 290 do Opus 4.8 e 675 do Opus 4.7.
Seja honesto sobre a magnitude disso. Em relação ao 4.8, a diferença de quatro tokens representa $20 em um milhão de solicitações: insignificante. Em relação ao 4.7, a diferença de 389 tokens é de $0,001945 por solicitação, ou $1.945 por milhão de solicitações. Se você ainda usa o 4.7, é dinheiro de verdade; no 4.8, é um erro de arredondamento.
Para alavancas que se aplicam a toda a linha Claude, nosso guia sobre como reduzir sua fatura da API Claude abrange mais opções.
Dois itens que as pessoas esquecem
O multiplicador inference_geo: "us" é de 1.1x. Fixar a inferência à infraestrutura apenas dos EUA para conformidade ou residência de dados e cada categoria de token é multiplicada por 1.1: entrada $5,50, saída $27,50, acertos de cache $0,55, lote $2,75 / $13,75. A carga de trabalho do exemplo 1 passa de $700 por mês para $770. Em uma fatura de $50.000, é um item de $5.000, então confirme se você precisa fixar antes de configurá-lo.
O Nível de Prioridade (Priority Tier) não é suportado no Opus 5. O Opus 4.8 o mantém. Se o seu planejamento de capacidade depende de compromissos com o Nível de Prioridade, essa é uma restrição real para a migração. O guia de migração do Opus 4.8 para o Opus 5 aborda isso juntamente com as mudanças que quebram a API.
Mudanças de comportamento que aparecem na sua fatura
As taxas por token são metade de uma fatura. O volume de tokens é a outra metade, e três mudanças de comportamento do Opus 5 aumentam o volume se você não fizer nada.
- O "pensamento" está ativado por padrão. No Opus 4.8, uma solicitação sem o campo
thinkingera executada sem "pensar". No Opus 5, a mesma solicitação executa o pensamento adaptativo, e esses tokens são cobrados como saída. Comomax_tokenslimita o pensamento e a resposta juntos, algumas dessas cargas de trabalho também começarão a ser truncadas. - O Opus 5 delega a subagentes com mais facilidade. Cada subagente tem seu próprio conjunto de tokens cobrados. Limite ou defina o escopo da delegação em cargas de trabalho sensíveis a custos.
- O Opus 5 verifica seu próprio trabalho sem ser solicitado. Se você manteve as instruções "verifique seu trabalho", o guia de prompting da Anthropic recomenda removê-las. Excesso de verificação são tokens.
Nenhuma dessas mudanças altera o preço por token. Todas elas mudam o que você paga.
Confirmando seu gasto real com Apidog
A maneira mais rápida de parar de adivinhar é lendo o objeto usage em cada resposta. Ele relata input_tokens, output_tokens, cache_creation_input_tokens e cache_read_input_tokens separadamente, que é o detalhamento exato que você precisa para verificar os cálculos acima em relação ao seu próprio tráfego.

Apidog é uma plataforma de desenvolvimento e teste de API, então ele lida bem com isso. Direcione uma solicitação para o endpoint Messages com "model": "claude-opus-5", então:
- Duplique a solicitação salva uma vez por nível de esforço e compare o volume de tokens de pensamento lado a lado em prompts idênticos.
- Afirme que
usage.cache_read_input_tokensé maior que zero, para que um cache silenciosamente quebrado apareça como um teste com falha em vez de uma fatura surpresa. - Armazene as chaves como variáveis de ambiente em vez de no corpo da solicitação, para que uma chave de desenvolvedor nunca execute um lote em tamanho de produção.
- Observe o fluxo SSE para ver onde os tokens de saída são usados em gerações longas.
Baixe o Apidog para executar essas verificações juntamente com o passo a passo em nosso guia da API do Opus 5.
O que você está realmente comprando por $5 / $25
O Opus 5 tem uma forte posição de preço por capacidade, e não é o topo da pilha Claude. O Fable 5 continua sendo o modelo mais capaz da Anthropic amplamente lançado, e o Opus 5 ainda está atrás do Mythos 5 em exploração de cibersegurança e pesquisa autônoma em biologia. A Anthropic declara ambos claramente. A abordagem honesta é capacidade de classe de ponta pela metade do preço de ponta, com um teto nomeado acima dele. Nosso explicador de modelos de classe Mythos aborda o que está acima dessa linha.
Para a maioria das equipes, a verdadeira questão não é o Opus 5 versus o teto. É se a carga de trabalho precisa do Opus, ou se o Sonnet 5 a $2 / $10 (subindo para $3 / $15 em 1º de setembro de 2026) faz o trabalho por 40% do preço. Execute ambos em suas próprias avaliações antes de comprometer um orçamento. As especificações completas e a disponibilidade estão em nossa visão geral do Claude Opus 5; a visão geral de modelos da Anthropic possui a tabela canônica.
FAQ
Quanto custa o Claude Opus 5? $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída na API padrão. Acertos de cache custam $0,50, execuções em lote a $2,50 / $12,50, e o modo rápido a $10 / $50.
O Claude Opus 5 é mais caro que o Opus 4.8? Por token, não: as taxas são idênticas. Sua fatura ainda pode aumentar, porque o pensamento está ativado por padrão e as respostas padrão são mais longas. Meça o volume de tokens em vez de assumir paridade.
Há uma sobretaxa para contexto longo na janela de 1M? Não. A janela de contexto de 1M de tokens é tanto o padrão quanto o máximo, e não há nível premium para entradas longas.
Qual é a maneira mais barata de executar o Claude Opus 5? Armazene em cache agressivamente (o mínimo de 512 tokens significa que quase qualquer prefixo reutilizado se qualifica), execute trabalhos não urgentes através da API em Lote com um desconto fixo de 50%, e avalie os níveis de esforço para encontrar o mais baixo que passe suas avaliações. O guia de caminho mais barato e gratuito tem mais informações.
A fixação regional custa extra? Sim. Definir inference_geo: "us" aplica um multiplicador de 1.1x a cada categoria de token, incluindo acertos de cache e processamento em lote.
