Aumento de Preço da DeepSeek API: Manual de Otimização de Custos para Desenvolvedores

A DeepSeek informa que um aumento significativo no preço da API está a caminho. Reduza sua exposição agora: cache de prompts, roteamento Flash/Pro, processamento em lote fora do horário de pico, teste de failover e como cenários de 1,5x a 3x impactam sua fatura.

INEZA Felin-Michel

INEZA Felin-Michel

13 agosto 2026

Aumento de Preço da DeepSeek API: Manual de Otimização de Custos para Desenvolvedores

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

DeepSeek construiu sua base de desenvolvedores com uma troca simples: modelos quase de ponta a preços que tornavam o custo irrelevante. Em 6 de agosto de 2026, a empresa alertou que essa troca está prestes a mudar. Em um anúncio primeiramente coberto por Dataconomy, a DeepSeek disse que os preços da API aumentarão "em breve" e que o aumento deverá ser "significativo". Sem números. Sem data efetiva. Sem detalhamento por modelo ou nível de preço.

O contexto torna o aviso crível. A DeepSeek cita o aumento dos custos de computação, gargalos de capacidade e tráfego massivo em V4-Flash e V4-Pro. Esta é a segunda mudança de preço em menos de um mês, tarifas de pico e fora de pico chegaram em meados de julho, e isso ocorre quando o V4 Pro 0813 atingiu disponibilidade geral em 12 de agosto, o que aumenta a demanda, não a diminui. A eWeek enquadra a mudança como um teste da vantagem de baixo custo que tornou a DeepSeek a escolha padrão econômica para equipes em toda a APAC e além.

Você não pode controlar as novas taxas. Você pode controlar quantos tokens você compra, em qual nível, em que hora e de qual provedor. Este guia cobre cinco movimentos a serem feitos antes que o aumento chegue, além do que cenários de 1.5x, 2x e 3x fariam a uma carga de trabalho de exemplo.

TL;DR

O Que a DeepSeek Anunciou e o Que Não Anunciou

A divulgação em si é escassa: os preços da API aumentarão "em breve", o aumento será "significativo", e as causas são custos de computação, gargalos de capacidade e tráfego intenso nos endpoints V4-Flash e V4-Pro. Isso é tudo que a DeepSeek disse. A partir de hoje, 13 de agosto, as taxas atuais ainda se aplicam, e o relógio está correndo.

Agora as lacunas. A DeepSeek não disse quanto os preços aumentarão, quando aumentarão, se V4-Flash e V4-Pro se moverão pelo mesmo fator, se as taxas de cache-hit escalam em sincronia com as taxas de cache-miss, ou se as cargas de trabalho de raciocínio serão tratadas de forma diferente. Tópicos do Hacker News especulam de 2x a 3x. Isso é especulação não confirmada sem apoio oficial, planeje para uma faixa, não para um número.

Aqui está o cartão de tarifas que esses cenários multiplicariam:

Modelo Entrada (cache miss) Entrada (cache hit) Saída
DeepSeek V4-Pro $0.435 / M tokens $0.003625 / M tokens $0.87 / M tokens
DeepSeek V4-Flash $0.14 / M tokens $0.28 / M tokens

Ambos os modelos possuem uma janela de contexto de 1M tokens. Para o detalhamento completo, consulte nosso guia de preços da API DeepSeek V4; o cartão de tarifas ao vivo está na documentação da API DeepSeek.

Duas proporções nessa tabela impulsionam todo o guia: a entrada em cache custa menos de 1% da entrada de cache-miss, e o V4-Pro custa aproximadamente 3x o V4-Flash tanto na entrada quanto na saída. Cada etapa abaixo explora uma dessas lacunas.

Passo 1: Meça Sua Exposição Antes Que o Preço Aumente

Um aumento de preço é um multiplicador sobre um número que a maioria das equipes não consegue determinar com precisão. Antes de mexer nos prompts ou no roteamento, instrumente seu uso para saber a que o multiplicador se aplica.

Marque cada chamada de modelo com a funcionalidade ou endpoint que a acionou, e então registre as contagens de tokens que a API já retorna:

usage = response.usage
log.info("llm_call", extra={
    "feature": "ticket-summarizer", # quem está gastando
    "model": "deepseek-v4-flash",
    "input_tokens": usage.prompt_tokens,
    "output_tokens": usage.completion_tokens,
    "cache_hit_tokens": usage.prompt_cache_hit_tokens,
})

O padrão completo, atribuição, painéis, economia de unidade por funcionalidade, está em como rastrear o gasto da API OpenAI por funcionalidade, e ele se transfere para a DeepSeek inalterado.

Uma semana de dados responde às perguntas que decidem todo o resto: o que impulsiona a maior parte do seu gasto, qual parcela dos tokens de entrada atinge o cache, quanto tráfego V4-Pro está fazendo trabalho semelhante ao V4-Flash e em qual multiplicador cada funcionalidade quebra sua economia de unidade. Esse último número é seu limite do Passo 5, anote-o.

Passo 2: Maximize os Hits de Cache, a Maior Alavanca Única

A DeepSeek armazena em cache prefixos de prompt automaticamente. Quando os tokens iniciais de uma requisição correspondem a uma requisição recente, esse prefixo repetido é cobrado à taxa de cache-hit: $0,003625 por milhão de tokens de entrada no V4-Pro em vez de $0,435. Sem flags de controle de cache, sem gerenciamento de TTL, o desconto depende inteiramente de quão repetível é a estrutura do seu prompt. Se o cache de prefixo é novo para você, nosso guia sobre o que é cache de prompt e como funciona cobre a mecânica.

Torne seus prefixos estáveis em bytes

O cache corresponde a prefixos exatos de tokens, então estruture os prompts como estático-primeiro, dinâmico-último:

Leia sua taxa de acertos em cada resposta

DeepSeek reporta o desempenho do cache no objeto `usage` de cada resposta, documentado em DeepSeek’s API docs:

u = response.usage
hit_rate = u.prompt_cache_hit_tokens / (
    u.prompt_cache_hit_tokens + u.prompt_cache_miss_tokens
)

Rastreie essa taxa por funcionalidade na instrumentação do Passo 1. Se uma funcionalidade com estrutura repetitiva mostra uma baixa taxa de acerto, algo em seu prefixo está mudando, e corrigi-lo geralmente é uma refatoração de prompt de um dia com um retorno permanente, independentemente das taxas futuras.

Passo 3: Encaminhe Por Tarefa, Não Por Hábito

V4-Pro a aproximadamente 3x V4-Flash é um preço justo para raciocínio profundo. É um preço ruim para reformatar JSON. A maioria das bases de código escolhe um modelo durante a prototipagem e nunca mais o revisita, geralmente Pro por padrão. Audite seus dados do Passo 1 e encaminhe deliberadamente:

Forma da carga de trabalho Encaminhe para
Classificação, extração, formatação, roteamento de intenções V4-Flash, pensamento mínimo
Resumos, respostas RAG, geração de rascunhos Primeiro V4-Flash; promova para Pro apenas onde as avaliações falharem
Loops de agente multi-passos, depuração difícil, análise de arquitetura V4-Pro, com um orçamento de pensamento

A disciplina de pensamento importa tanto quanto a escolha do modelo. Os rastros de raciocínio são cobrados como tokens de saída, os tokens mais caros que a DeepSeek vende a $0,87 por milhão no Pro, então uma configuração de pensamento de esforço máximo em uma rota de classificação paga preços de raciocínio para uma consulta. Limite o esforço de pensamento por rota: nenhum ou mínimo para tarefas mecânicas, pensamento profundo reservado para os loops de agente e trabalhos de análise que beneficiam mensuravelmente.

Faça as degradações com evidências, não com intuição: mova uma rota para o Flash ou um orçamento de pensamento menor, execute seu conjunto de avaliações e mantenha a mudança quando a qualidade se mantiver.

Passo 4: Mova o Trabalho em Lote Para Horários Fora de Pico

A precificação de pico/fora de pico que a DeepSeek introduziu em meados de julho é a única mudança recente que joga a seu favor, e a maioria das equipes ainda a ignora. As janelas e descontos atuais são publicados no cartão de tarifas na documentação da API DeepSeek.

Qualquer coisa sem um humano esperando é um candidato: execuções de avaliação noturnas, preenchimento de embeddings, rotulagem de conjuntos de dados, suítes de regressão de prompt CI. Coloque esses trabalhos em uma fila com uma janela de liberação em vez de dispará-los sob demanda, uma mudança de agendamento de um dia que não precisa de validação de qualidade, já que os tokens são idênticos e apenas o relógio se move.

Uma ressalva: a DeepSeek não disse se a diferença de preço fora de pico sobreviverá ao aumento. Aproveite agora; verifique novamente quando as novas tarifas forem publicadas.

Sua Conta em 1.5x, 2x e 3x

Estes são cenários ilustrativos, não previsões. DeepSeek não anunciou nenhum multiplicador, e ninguém sabe se todos os níveis escalam uniformemente, a tabela abaixo assume que sim, aplicada a uma carga de trabalho fictícia, mas realista.

A carga de trabalho de exemplo, mensal: V4-Pro processa 400M tokens de entrada com uma taxa de acerto de cache de 60% mais 60M tokens de saída ($69.60 miss + $0.87 hit + $52.20 output = $122.67). V4-Flash processa 600M tokens de entrada e 120M tokens de saída ($84.00 + $33.60 = $117.60). Fatura base: $240.27.

A coluna "otimizada" aplica os Passos 2 a 3: a reestruturação do prefixo eleva a taxa de acerto de cache do Pro para 85%, e os orçamentos de pensamento reduzem a saída do Pro para 45M tokens ($26.10 + $1.23 + $39.15 = $66.48, Flash inalterado, total $184.08). Os valores são arredondados para dólares inteiros:

Cenário de taxa Conta não otimizada Otimizada (Passos 2-3)
Taxas atuais $240 $184
Aumento de 1.5x $360 $276
Aumento de 2x $481 $368
Aumento de 3x $721 $552

Leia a diagonal: a carga de trabalho otimizada com um aumento de 2x ($368) custa aproximadamente o mesmo que a não otimizada com um aumento de 1.5x ($360). As economias estruturais escalam com qualquer multiplicador que venha, uma redução de 23% vale $56 hoje e $168 em um cenário de 3x. O loteamento fora de pico não é modelado aqui porque o desconto depende do cronograma ao vivo, então trate a coluna otimizada como conservadora.

Quando Trocar Modelos Supera a Otimização

Mesmo o lado pessimista da especulação deixa a DeepSeek barata em termos absolutos: um aumento de 3x coloca a saída do V4-Pro em $2,61 por milhão de tokens, enquanto comparações públicas colocam a saída de concorrentes de ponta em $25–30 por milhão. A lacuna de ordem de magnitude sobrevive a todos os cenários rumorados, a eWeek chama isso de erosão da vantagem da DeepSeek, não o fim dela.

Então, quando a troca compensa?

Otimize e permaneça quando a DeepSeek passar em suas avaliações de qualidade, seu gasto estiver concentrado em tráfego cacheável e roteável, e você tiver tempo de engenharia antes que as taxas entrem em vigor. O playbook acima é cumulativo; os custos de mudança são únicos e grandes.

Troque, ou divida o tráfego quando o seu limite de acerto de cache for estruturalmente baixo (cada solicitação carrega documentos longos e únicos, então não há prefixo para reutilizar), quando você estiver pagando preços Pro para tarefas que um modelo menor de um concorrente passa nas suas avaliações, ou quando o multiplicador anunciado estiver acima do limite de equilíbrio que você calculou no Passo 1.

Para a maioria das equipes, a resposta honesta é híbrida: mantenha a DeepSeek onde ela vence em custo por avaliação aprovada, mova as rotas onde não vence e mantenha o conjunto de paridade do Passo 5 em execução para que a próxima surpresa de preços, de qualquer fornecedor, seja uma mudança de configuração, não uma crise.

Conclusão

A DeepSeek informou que o preço vai subir e não disse mais nada. As equipes que se saem melhor são aquelas que agem durante o período de lacuna: instrumentam o gasto por funcionalidade, estabilizam os prefixos de prompt, roteiam o trabalho no formato Flash para o Flash, empurram os trabalhos em lote para fora do pico e provam que um segundo provedor funciona antes que você precise dele.

Cada passo é mensurável, e a maioria leva dias, não sprints. Para lidar com a metade do failover em uma ferramenta, baixe o Apidog gratuitamente: construa o conjunto de testes uma vez, aponte-o para api.deepseek.com e seu fallback com ambientes por provedor, e agende-o para manter ambos honestos enquanto as notícias de preços se desenvolvem.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs