Claude Sonnet 5.5 Preços: Análise Completa de Custos (API, Cache, Lote e Planos)

Preços do Claude Sonnet 5.5: $2/$10 por milhão de tokens, $0,20 por leitura de cache, processamento em lote pela metade do preço. Exemplos de custos calculados, custos de esforço e preços dos planos.

Ashley Goolam

Ashley Goolam

29 setembro 2026

Claude Sonnet 5.5 Preços: Análise Completa de Custos (API, Cache, Lote e Planos)

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

O Claude Sonnet 5.5 custa US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída na API do Claude, o mesmo que o Sonnet 5. As leituras de cache custam US$ 0,20 por milhão, a API Batch reduz ambas as taxas para US$ 1 e US$ 5, a janela de contexto completa de 1M é cobrada pela taxa padrão, e o modo rápido não é oferecido. O aumento planejado do Sonnet 5 para 1º de setembro para US$ 3/US$ 15 foi cancelado, então US$ 2/US$ 10 é agora o preço padrão.

Este guia lista cada item de preço do Claude Sonnet 5.5, apresenta três exemplos de custo com a aritmética mostrada e explica por que o esforço afeta sua conta mais do que a taxa por token. Novo no modelo? Comece com o que é o Claude Sonnet 5.5, ou leia como usar o Claude Sonnet 5.5 gratuitamente. Para verificar os números em relação ao seu próprio tráfego, envie a solicitação do Apidog e leia o bloco usage em cada resposta.

Tabela de preços da API Claude Sonnet 5.5

Preços por milhão de tokens (MTok), da documentação de preços da Anthropic:

Item Preço por MTok
Entrada US$ 2,00
Escrita de cache de 5 minutos US$ 2,50
Escrita de cache de 1 hora US$ 4,00
Leitura de cache US$ 0,20
Saída US$ 10,00
Entrada em lote US$ 1,00
Saída em lote US$ 5,00

Três detalhes mudam o que você paga:

Como o Sonnet 5.5 se compara em preço de tabela

Modelo Entrada Saída Observações
Claude Sonnet 5.5 US$ 2 US$ 10 Leitura de cache US$ 0,20; contexto de 1M; sem modo rápido
Claude Sonnet 5 US$ 2 US$ 10 Leitura de cache US$ 0,20; aumento de US$ 3/US$ 15 cancelado
Claude Opus 5.5 US$ 4 US$ 20 Leitura de cache US$ 0,20; modo rápido US$ 8/US$ 40
Claude Haiku 4.5 US$ 1 US$ 5 contexto de 200 mil
GPT-6 Sol US$ 2 US$ 10 90% de desconto na entrada em cache; contexto de 872 mil
GPT-6 Luna US$ 0,10 US$ 0,50 contexto de 1M

O Sonnet 5.5 custa metade do Opus 5.5 em entrada, saída e escritas de cache. Ele compartilha o preço de tabela exato de US$ 2/US$ 10 com o GPT-6 Sol, então a escolha entre os dois se resume aos resultados por tarefa. Para o histórico, veja preços do Claude Sonnet 5, a guerra de preços de setembro de 2026 e preços do GPT-6 Sol.

Exemplos práticos: o custo de solicitações reais

A fórmula para cada linha: tokens ÷ 1.000.000 × preço por MTok. Precifique cada item, depois some.

Exemplo 1: uma solicitação estilo chat

3.000 tokens de entrada, 800 tokens de saída, sem cache.

Mil dessas custam US$ 14. A saída representa 21% dos tokens, mas 57% da conta, então o comprimento da saída importa mais do que o comprimento do prompt.

Exemplo 2: um agente relendo um prefixo de 50.000 tokens

Um loop de agente envia o mesmo prefixo de 50.000 tokens (prompt do sistema, ferramentas, contexto do repositório) em 20 chamadas. Apenas o prefixo é precificado aqui.

Sem cache: 20 × 50.000 = 1.000.000 tokens; 1.000.000 ÷ 1.000.000 × US$ 2 = US$ 2,00

Em cache, com uma escrita de 5 minutos:

Isso economiza US$ 1,685, cerca de 84%. A escrita de 5 minutos compensa apenas enquanto as chamadas ocorrem dentro da janela; para loops mais lentos, uma escrita de 1 hora custa 50.000 ÷ 1.000.000 × US$ 4 = US$ 0,20, então o total é US$ 0,20 + US$ 0,19 = US$ 0,39, ainda cerca de 80% abaixo do custo sem cache. O mesmo raciocínio é aplicado para o Opus em nossa matemática de custo de cache de prompt; a taxa de leitura de US$ 0,20 é idêntica.

Exemplo 3: um trabalho em lote de 10.000 solicitações

Mesmo formato do Exemplo 1, enviado através da API Batch.

O Batch também eleva o limite de saída de 128 mil para 300 mil tokens com a beta output-300k-2026-03-24.

Custo por tarefa, não por token

O cartão de tarifas informa quanto custa um token, não quantos tokens sua tarefa consome. Esse segundo número varia muito mais com o esforço do que qualquer diferença de taxa entre os modelos.

A Anthropic afirma que, em seus testes, o Sonnet 5.5 "custa até 30% menos por tarefa do que seu predecessor". O post de lançamento também mostra o custo em cada nível de esforço. As execuções do Terminal-Bench 4.0 são da própria Anthropic, o FrontierCode foi executado pela Cognition, e os custos de índice vêm da Artificial Analysis:

Esforço Terminal-Bench 4.0 (pontuação, US$/tentativa) FrontierCode v1.1 (pontuação, US$/tarefa) Índice AA (pontuação, custo para executar)
baixo 20,0%, US$ 0,76 29,3%, US$ 0,19 35,8, US$ 544
médio 28,8%, US$ 0,83 36,5%, US$ 0,24 40,7, US$ 701
alto 43,0%, US$ 1,94 49,4%, US$ 0,42 46,7, US$ 1.176
muito alto 61,5%, US$ 5,30 52,1%, US$ 1,59 51,9, US$ 2.738
máximo 70,6%, US$ 12,54 46,2%, US$ 20,78 56,0, US$ 8.977

O que se destaca:

A verbosidade no máximo é a outra armadilha. A análise da OfficeChai dos dados da Artificial Analysis coloca o Sonnet 5.5 em cerca de 193.000 tokens de saída por tarefa de índice no máximo, com um custo por tarefa cerca de 50% acima do Sonnet 5. Simon Willison relatou no Hacker News que uma execução de esforço máximo consumiu 128.000 tokens de pensamento e esgotou-se antes de produzir a resposta.

Seis alavancas que reduzem a conta

  1. Defina o esforço intencionalmente. A API padrão é high; o Claude Code e os aplicativos Claude padrão são medium. O guia de prompt da Anthropic sugere medium ou low para chat e xhigh ou max apenas para ganhos de qualidade medidos. Não transfira as configurações do Sonnet 5; a escala foi recalibrada.
  2. Use between_tools onde você tinha o pensamento desativado. thinking: {"type": "disabled"} agora retorna um erro 400; {"type": "between_tools"} o substitui em low, medium e high.
  3. Armazene em cache tudo que for reutilizado. O prompt mínimo armazenável em cache é de 512 tokens (1.024 no Sonnet 5). Alterar o effort de nível superior entre as solicitações invalida o cache, então mantenha-o estável.
  4. Agrupe o que pode esperar. Metade do preço na entrada e na saída.
  5. Mantenha max_tokens honesto. O guia da Anthropic trata stop_reason: "max_tokens" como uma resposta falha, então uma resposta truncada é um gasto sem nada a entregar.
  6. Corte o trabalho não solicitado. O Sonnet 5.5 adiciona testes, documentos e arquivos que você não pediu, e inicia rodadas extras de revisão em xhigh e max. O parágrafo de prompt de sistema sugerido pela Anthropic reduziu o custo da sessão em cerca de um terço no max sem alteração na qualidade.

Onde mais você paga pelo Sonnet 5.5

Procurando por créditos em vez disso? Veja existe uma API gratuita do Claude Sonnet 5.5.

Rastreie o custo por solicitação no Apidog

Cada resposta de Mensagens contém um objeto usage com input_tokens, output_tokens e contagens de cache. Isso é suficiente para precificar qualquer chamada no Apidog:

  1. Armazene sua chave como uma variável de ambiente ANTHROPIC_API_KEY.
  2. Salve esta solicitação uma vez por nível de esforço (low, medium, high) com o mesmo prompt:
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 4000,
    "thinking": {"type": "between_tools"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'
  1. Adicione um pós-processador que precifica a chamada e falha em caso de truncamento:
const body = pm.response.json();
const u = body.usage;
const cost = (u.input_tokens * 2 + u.output_tokens * 10) / 1e6;
pm.environment.set("last_call_usd", cost.toFixed(5));
pm.test("not truncated", () => pm.expect(body.stop_reason).to.not.eql("max_tokens"));
  1. Execute os três e compare usage.output_tokens e o custo lado a lado. Se você usar cache, adicione as contagens de cache às suas próprias taxas.

O passo a passo completo da solicitação está em como usar a API Claude Sonnet 5.5.

FAQ

Próximo passo: precifique sua própria carga de trabalho

Pegue suas três formas de solicitação mais comuns, execute cada uma em dois níveis de esforço e multiplique os números de usage pela tabela acima. Você verá rapidamente se o medium atende ao seu padrão de qualidade ou se o high justifica seus tokens extras. Baixe o Apidog para manter essas solicitações e o script de custo lado a lado.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs