DeepSeek-V4.1-Flash: Preços Explicados, Tarifas de Pico vs Fora de Pico e Matemática do Cache-Hit

A tabela de preços completa em USD e CNY para deepseek-flash, os cortes percentuais em relação ao V4-Flash e o redirecionamento para o V4-Pro, janelas de pico convertidas para o seu fuso horário, e dois exemplos de cache-hit com a aritmética demonstrada.

Medy Evrard

10 setembro 2026

DeepSeek-V4.1-Flash: Preços Explicados, Tarifas de Pico vs Fora de Pico e Matemática do Cache-Hit

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

DeepSeek-V4.1-Flash foi lançado para o público geral (GA) na API em 10 de setembro de 2026, e a nota de lançamento veio com um corte de preço. A entrada com acerto de cache agora custa US$0,003 por milhão de tokens fora do horário de pico, a entrada com erro de cache US$0,15, a saída US$0,60. Quatro dias depois, em 14 de setembro, DeepSeek começa a rotear cada solicitação de deepseek-v4-pro para o V4.1-Flash e cobrá-la com as taxas Flash. Se você executa qualquer coisa na API DeepSeek, sua fatura muda esta semana, quer você toque ou não no seu código.

Este post é a metade da história sobre preços: as tabelas completas em USD e CNY, as mudanças percentuais em relação ao V4-Flash e V4-Pro, onde as janelas de pico se encaixam no seu fuso horário e dois exemplos de acertos de cache com a aritmética mostrada. Para o modelo em si, comece com o que é DeepSeek-V4.1-Flash.

Uma ressalva inicial. Cada número de benchmark neste grupo é um dado reportado pela DeepSeek na ficha do modelo. Os preços vêm da página de preços, verificados em 10 de setembro. A última seção mostra como medir seus próprios gastos com Apidog lendo o bloco usage em cada resposta, em vez de confiar em uma estimativa.

button

TL;DR

A tabela de preços completa

Todos os valores são por 1M de tokens, a partir de 10 de setembro de 2026 às 04:00 UTC.

deepseek-flash fora do pico deepseek-flash pico deepseek-v4-pro fora do pico deepseek-v4-pro pico
Entrada, acerto de cache $0.003 $0.006 $0.022 $0.044
Entrada, erro de cache $0.15 $0.30 $0.66 $1.32
Saída $0.60 $1.20 $1.98 $3.96
Concorrência 2,500 2,500 500 500

As colunas deepseek-v4-pro importam por mais quatro dias. A partir de 14 de setembro às 04:00 UTC (12:00 em Pequim), as solicitações para esse nome de modelo serão atendidas pelo V4.1-Flash e cobradas das duas primeiras colunas. O guia de aposentadoria e migração do V4-Pro cobre o que testar antes disso.

Se sua conta é liquidada em yuan, a página de preços zh-cn lista deepseek-flash como:

Fora do pico (CNY) Pico (CNY)
Entrada, acerto de cache ¥0.02 ¥0.04
Entrada, erro de cache ¥1.00 ¥2.00
Saída ¥4.00 ¥8.00

Cada linha CNY é a linha USD multiplicada por cerca de 6,67. Dois detalhes que a tabela omite: o cache de contexto é automático, sem flag para configurar, e o ID do modelo agora é deepseek-flash. Os nomes antigos deepseek-v4-flash e deepseek-v4-flash-vision-exp ainda são resolvidos, mas chegam ao V4.1-Flash com estas taxas.

O que mudou em relação ao V4-Flash e V4-Pro

Em 21 de agosto de 2026, o deepseek-v4-flash cobrava US$0,007 / US$0,22 / US$0,66 fora do pico (acerto de cache / erro de cache / saída) e US$0,014 / US$0,44 / US$1,32 no pico. O changelog diz que o preço foi “reduzido de acordo” com este lançamento. Veja o que “de acordo” significa, calculado a partir das duas listas:

Item V4-Flash (21 de agosto) V4.1-Flash (10 de setembro) Corte
Acerto de cache, fora do pico $0.007 $0.003 57%
Erro de cache, fora do pico $0.22 $0.15 32%
Saída, fora do pico $0.66 $0.60 9%

As linhas de pico apresentam percentagens idênticas, já que ambas as listas dobram no pico. O padrão é intencional: o corte mais acentuado está nos acertos de cache, o menor na saída. A DeepSeek está precificando para loops de agentes que releem um prefixo longo a cada turno, e o cache FP4 KV no V4.1 (890 bytes por token, cerca de um quarto da pegada do V4-Flash) é o que torna um preço de acerto de US$0,003 sustentável por parte deles.

Para usuários do V4-Pro, os números são maiores, porque o redirecionamento ocorre com as taxas Flash:

A DeepSeek afirma que o V4.1-Flash “superou amplamente o V4 Pro em desempenho, custo, velocidade e tempo total”, uma afirmação a ser verificada com seus próprios prompts antes do dia 14. Para o arco mais longo dos preços da família, incluindo o período em que a DeepSeek aumentou os preços da API, a análise de preços da API DeepSeek V4 tem o histórico.

Janelas de pico no seu fuso horário

O pico se aplica apenas de segunda a sexta-feira, em dois blocos: das 01:00 às 04:00 UTC e das 06:00 às 10:00 UTC. Isso corresponde das 9:00 às 12:00 e das 14:00 às 18:00 no horário de Pequim. Sete horas de pico por dia útil, 35 por semana, então o pico cobre cerca de 21% da semana de 168 horas. Todo o resto, incluindo todo o sábado e domingo, é cobrado pela tarifa fora do pico.

Janela UTC Pequim (UTC+8) Pacífico dos EUA (PDT, UTC-7) Europa Central (CEST, UTC+2)
Pico 1 01:00 às 04:00 09:00 às 12:00 18:00 às 21:00 (noite anterior) 03:00 às 06:00
Pico 2 06:00 às 10:00 14:00 às 18:00 23:00 às 03:00 (durante a noite) 08:00 às 12:00

As colunas do Pacífico e da Europa Central usam horário de verão. Após a mudança do horário (25 de outubro na UE, 1º de novembro nos EUA), desloque ambas as colunas uma hora antes. Os limites UTC nunca se movem.

Um dia de trabalho na Costa Oeste dos EUA nunca atinge um bloco de pico. Uma manhã na Europa Central se encaixa no Pico 2, e um lote noturno europeu às 03:00 local paga o dobro; movê-lo para as 23:00 CEST (21:00 UTC) o coloca de volta pela metade do preço.

Matemática do acerto de cache, em dois exemplos

Um acerto custa 1/50 de um erro (US$0,003 versus US$0,15), então a proporção de prefixo repetido para tokens novos decide seu custo de entrada mais do que a contagem bruta de tokens. Se o cache de prefixo é novo para você, o guia básico de cache de prompt explica o que é considerado um prefixo armazenável em cache: bytes idênticos no início da solicitação.

Exemplo 1: um loop de agente com um prompt de sistema de 20K tokens, 1.000 chamadas no pico.

Um agente de triagem de suporte carrega um prompt de sistema de 20.000 tokens (políticas, esquemas de ferramentas, exemplos few-shot), lê 2.000 tokens novos de texto de ticket por chamada e escreve 1.000 tokens de saída. Em mais de 1.000 chamadas:

  1. A entrada total é de 1.000 × 22.000 = 22M tokens. A saída total é de 1M tokens.
  2. A primeira chamada falha em todos os 22.000 tokens. Cada chamada posterior acerta o prefixo de 20.000 tokens e falha em seus 2.000 tokens novos.
  3. Tokens com acerto: 999 × 20.000 = 19,98M. A US$0,006 por 1M: 19,98 × 0,006 = US$0,12.
  4. Tokens com erro: 22.000 + 999 × 2.000 = 2,02M. A US$0,30 por 1M: 2,02 × 0,30 = US$0,61.
  5. Saída: 1M × US$1,20 = US$1,20.
  6. Total: US$0,12 + US$0,61 + US$1,20 = US$1,93.

Sem cache, a entrada por si só custaria 22 × US$0,30 = US$6,60 e o trabalho custaria US$7,80. O cache elimina 75% da fatura. Execute o mesmo loop fora do horário de pico e cada linha é reduzida pela metade: US$0,06 + US$0,30 + US$0,60 = US$0,96.

As mesmas 1.000 chamadas no V4-Pro no pico (acertos US$0,88, erros US$2,67, saída US$3,96) totalizam US$7,51, o número que um cliente Pro deve ter em mente ao lado de US$1,93 quando o redirecionamento ocorrer.

Exemplo 2: um trabalho em lote com 10M de tokens de saída, movido para fora do pico.

Uma equipe de catálogo gera 10.000 descrições de produtos. Cada chamada envia 1.500 tokens de dados de produto (únicos por item, sem benefício de cache) e recebe 1.000 tokens de texto. Isso representa 15M de tokens de entrada, todos erros, e 10M de tokens de saída.

  1. No pico: entrada 15 × US$0,30 = US$4,50. Saída 10 × US$1,20 = US$12,00. Total US$16,50.
  2. Fora do pico: entrada 15 × US$0,15 = US$2,25. Saída 10 × US$0,60 = US$6,00. Total US$8,25.
  3. Economia apenas pelo carimbo de data/hora: US$8,25, sem alteração nos prompts.

A saída domina este trabalho e teve o menor corte no lançamento, então a janela fora do pico é a maior alavanca. É uma janela generosa: 15 horas em cada dia útil a partir das 10:00 UTC, mais 48 horas ininterruptas a cada fim de semana.

Contexto, saída e por que a concorrência faz parte do preço

Ambos os nomes de modelo suportam um contexto de 1M de tokens e uma saída máxima de 384K tokens. A ficha do modelo recomenda um máximo de 256K tokens ou mais, então defina esse limite intencionalmente: uma resposta que atinja 384K tokens de saída custa US$0,46 no pico, o que é bom para uma transcrição de agente e um problema para o preenchimento automático.

A concorrência é de 2.500 para Flash contra 500 para Pro. Ela pertence a um artigo de preços porque o desconto fora do pico só vale a pena se você puder fazer o trabalho durante essa janela, e porque o tráfego deepseek-v4-pro redirecionado em 14 de setembro herda o limite Flash: uma integração Pro que costumava fazer fila atrás de 500 slots obtém cinco vezes mais capacidade sem uma alteração de configuração.

Meça o gasto real com Apidog

As tabelas de preços informam a tarifa. O objeto usage em cada resposta informa o que foi cobrado. Aqui está um fluxo de trabalho do Apidog que torna essa verificação repetível.

  1. Adicione o endpoint. Crie POST https://api.deepseek.com/chat/completions, ou importe uma especificação OpenAPI compatível com OpenAI.
  2. Coloque os preços em ambientes. Crie dois ambientes Apidog, deepseek-peak e deepseek-offpeak, cada um contendo DEEPSEEK_API_KEY mais PRICE_HIT, PRICE_MISS e PRICE_OUT como {{variables}}. O pico mantém 0,006 / 0,30 / 1,20; o fora do pico mantém 0,003 / 0,15 / 0,60.
  3. Envie uma vez e leia usage. DeepSeek divide a entrada em prompt_cache_hit_tokens e prompt_cache_miss_tokens junto com completion_tokens [VERIFICAR]. Salve a requisição como um caso de teste.
  4. Crie um cenário de teste que afirme o comportamento do cache. Encadeie a requisição salva duas vezes com o mesmo prompt de sistema de 20K tokens. No segundo passo, afirme que o campo de token de acerto é de pelo menos 19.000 e que o custo calculado (acertos × {{PRICE_HIT}} + erros × {{PRICE_MISS}} + saída × {{PRICE_OUT}}, dividido por 1M) permanece dentro do orçamento. Um erro no segundo passo significa que o prefixo mudou, e a afirmação o detecta antes que a fatura o faça.
  5. Compare o pico com o fora do pico. Execute o cenário em cada ambiente e compare a linha de custo, ou execute-o a partir do CI com apidog-cli em um cronograma que cruza um limite de pico UTC.

Baixe o Apidog e todo o cenário, incluindo os ambientes, funciona no plano gratuito.

Onde isso deixa sua fatura

O V4.1-Flash é mais barato que o V4-Flash em todas as linhas e de 70% a 86% mais barato que as taxas do V4-Pro que ele substitui. Dois fatores importam: mantenha seu prefixo longo byte a byte idêntico para que ele acerte o cache, e agende trabalhos em lote fora das sete horas de pico dos dias úteis. Em seguida, registre o usage em cada chamada, verifique a contagem de acertos e deixe que os números mostrem se o corte chegou à sua fatura.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs