DeepSeek-V4.1-Flash foi lançado para o público geral (GA) na API em 10 de setembro de 2026, e a nota de lançamento veio com um corte de preço. A entrada com acerto de cache agora custa US$0,003 por milhão de tokens fora do horário de pico, a entrada com erro de cache US$0,15, a saída US$0,60. Quatro dias depois, em 14 de setembro, DeepSeek começa a rotear cada solicitação de deepseek-v4-pro para o V4.1-Flash e cobrá-la com as taxas Flash. Se você executa qualquer coisa na API DeepSeek, sua fatura muda esta semana, quer você toque ou não no seu código.
Este post é a metade da história sobre preços: as tabelas completas em USD e CNY, as mudanças percentuais em relação ao V4-Flash e V4-Pro, onde as janelas de pico se encaixam no seu fuso horário e dois exemplos de acertos de cache com a aritmética mostrada. Para o modelo em si, comece com o que é DeepSeek-V4.1-Flash.
Uma ressalva inicial. Cada número de benchmark neste grupo é um dado reportado pela DeepSeek na ficha do modelo. Os preços vêm da página de preços, verificados em 10 de setembro. A última seção mostra como medir seus próprios gastos com Apidog lendo o bloco usage em cada resposta, em vez de confiar em uma estimativa.
TL;DR
- Fora do horário de pico,
deepseek-flashcusta US$0,003 por 1M de tokens de entrada com acerto de cache, US$0,15 por 1M de tokens de entrada com erro de cache e US$0,60 por 1M de tokens de saída. O horário de pico é exatamente o dobro. - Em comparação com o V4-Flash em 21 de agosto: entrada com acerto de cache 57% menor, entrada com erro de cache 32% menor, saída 9% menor.
- Em comparação com o V4-Pro no horário de pico: uma carga de trabalho redirecionada paga 77% menos pela entrada com erro de cache e 70% menos pela saída a partir de 14 de setembro.
- O horário de pico é de segunda a sexta-feira, das 01:00 às 04:00 e das 06:00 às 10:00 UTC. Os fins de semana são totalmente fora do horário de pico.
A tabela de preços completa
Todos os valores são por 1M de tokens, a partir de 10 de setembro de 2026 às 04:00 UTC.
| deepseek-flash fora do pico | deepseek-flash pico | deepseek-v4-pro fora do pico | deepseek-v4-pro pico | |
|---|---|---|---|---|
| Entrada, acerto de cache | $0.003 | $0.006 | $0.022 | $0.044 |
| Entrada, erro de cache | $0.15 | $0.30 | $0.66 | $1.32 |
| Saída | $0.60 | $1.20 | $1.98 | $3.96 |
| Concorrência | 2,500 | 2,500 | 500 | 500 |
As colunas deepseek-v4-pro importam por mais quatro dias. A partir de 14 de setembro às 04:00 UTC (12:00 em Pequim), as solicitações para esse nome de modelo serão atendidas pelo V4.1-Flash e cobradas das duas primeiras colunas. O guia de aposentadoria e migração do V4-Pro cobre o que testar antes disso.
Se sua conta é liquidada em yuan, a página de preços zh-cn lista deepseek-flash como:
| Fora do pico (CNY) | Pico (CNY) | |
|---|---|---|
| Entrada, acerto de cache | ¥0.02 | ¥0.04 |
| Entrada, erro de cache | ¥1.00 | ¥2.00 |
| Saída | ¥4.00 | ¥8.00 |
Cada linha CNY é a linha USD multiplicada por cerca de 6,67. Dois detalhes que a tabela omite: o cache de contexto é automático, sem flag para configurar, e o ID do modelo agora é deepseek-flash. Os nomes antigos deepseek-v4-flash e deepseek-v4-flash-vision-exp ainda são resolvidos, mas chegam ao V4.1-Flash com estas taxas.
O que mudou em relação ao V4-Flash e V4-Pro
Em 21 de agosto de 2026, o deepseek-v4-flash cobrava US$0,007 / US$0,22 / US$0,66 fora do pico (acerto de cache / erro de cache / saída) e US$0,014 / US$0,44 / US$1,32 no pico. O changelog diz que o preço foi “reduzido de acordo” com este lançamento. Veja o que “de acordo” significa, calculado a partir das duas listas:
| Item | V4-Flash (21 de agosto) | V4.1-Flash (10 de setembro) | Corte |
|---|---|---|---|
| Acerto de cache, fora do pico | $0.007 | $0.003 | 57% |
| Erro de cache, fora do pico | $0.22 | $0.15 | 32% |
| Saída, fora do pico | $0.66 | $0.60 | 9% |
As linhas de pico apresentam percentagens idênticas, já que ambas as listas dobram no pico. O padrão é intencional: o corte mais acentuado está nos acertos de cache, o menor na saída. A DeepSeek está precificando para loops de agentes que releem um prefixo longo a cada turno, e o cache FP4 KV no V4.1 (890 bytes por token, cerca de um quarto da pegada do V4-Flash) é o que torna um preço de acerto de US$0,003 sustentável por parte deles.
Para usuários do V4-Pro, os números são maiores, porque o redirecionamento ocorre com as taxas Flash:
- Entrada com erro de cache no pico: US$1,32 torna-se US$0,30, um corte de 77%.
- Saída no pico: US$3,96 torna-se US$1,20, um corte de 70%.
- Entrada com acerto de cache no pico: US$0,044 torna-se US$0,006, um corte de 86%.
A DeepSeek afirma que o V4.1-Flash “superou amplamente o V4 Pro em desempenho, custo, velocidade e tempo total”, uma afirmação a ser verificada com seus próprios prompts antes do dia 14. Para o arco mais longo dos preços da família, incluindo o período em que a DeepSeek aumentou os preços da API, a análise de preços da API DeepSeek V4 tem o histórico.
Janelas de pico no seu fuso horário
O pico se aplica apenas de segunda a sexta-feira, em dois blocos: das 01:00 às 04:00 UTC e das 06:00 às 10:00 UTC. Isso corresponde das 9:00 às 12:00 e das 14:00 às 18:00 no horário de Pequim. Sete horas de pico por dia útil, 35 por semana, então o pico cobre cerca de 21% da semana de 168 horas. Todo o resto, incluindo todo o sábado e domingo, é cobrado pela tarifa fora do pico.
| Janela | UTC | Pequim (UTC+8) | Pacífico dos EUA (PDT, UTC-7) | Europa Central (CEST, UTC+2) |
|---|---|---|---|---|
| Pico 1 | 01:00 às 04:00 | 09:00 às 12:00 | 18:00 às 21:00 (noite anterior) | 03:00 às 06:00 |
| Pico 2 | 06:00 às 10:00 | 14:00 às 18:00 | 23:00 às 03:00 (durante a noite) | 08:00 às 12:00 |
As colunas do Pacífico e da Europa Central usam horário de verão. Após a mudança do horário (25 de outubro na UE, 1º de novembro nos EUA), desloque ambas as colunas uma hora antes. Os limites UTC nunca se movem.
Um dia de trabalho na Costa Oeste dos EUA nunca atinge um bloco de pico. Uma manhã na Europa Central se encaixa no Pico 2, e um lote noturno europeu às 03:00 local paga o dobro; movê-lo para as 23:00 CEST (21:00 UTC) o coloca de volta pela metade do preço.
Matemática do acerto de cache, em dois exemplos
Um acerto custa 1/50 de um erro (US$0,003 versus US$0,15), então a proporção de prefixo repetido para tokens novos decide seu custo de entrada mais do que a contagem bruta de tokens. Se o cache de prefixo é novo para você, o guia básico de cache de prompt explica o que é considerado um prefixo armazenável em cache: bytes idênticos no início da solicitação.
Exemplo 1: um loop de agente com um prompt de sistema de 20K tokens, 1.000 chamadas no pico.
Um agente de triagem de suporte carrega um prompt de sistema de 20.000 tokens (políticas, esquemas de ferramentas, exemplos few-shot), lê 2.000 tokens novos de texto de ticket por chamada e escreve 1.000 tokens de saída. Em mais de 1.000 chamadas:
- A entrada total é de 1.000 × 22.000 = 22M tokens. A saída total é de 1M tokens.
- A primeira chamada falha em todos os 22.000 tokens. Cada chamada posterior acerta o prefixo de 20.000 tokens e falha em seus 2.000 tokens novos.
- Tokens com acerto: 999 × 20.000 = 19,98M. A US$0,006 por 1M: 19,98 × 0,006 = US$0,12.
- Tokens com erro: 22.000 + 999 × 2.000 = 2,02M. A US$0,30 por 1M: 2,02 × 0,30 = US$0,61.
- Saída: 1M × US$1,20 = US$1,20.
- Total: US$0,12 + US$0,61 + US$1,20 = US$1,93.
Sem cache, a entrada por si só custaria 22 × US$0,30 = US$6,60 e o trabalho custaria US$7,80. O cache elimina 75% da fatura. Execute o mesmo loop fora do horário de pico e cada linha é reduzida pela metade: US$0,06 + US$0,30 + US$0,60 = US$0,96.
As mesmas 1.000 chamadas no V4-Pro no pico (acertos US$0,88, erros US$2,67, saída US$3,96) totalizam US$7,51, o número que um cliente Pro deve ter em mente ao lado de US$1,93 quando o redirecionamento ocorrer.
Exemplo 2: um trabalho em lote com 10M de tokens de saída, movido para fora do pico.
Uma equipe de catálogo gera 10.000 descrições de produtos. Cada chamada envia 1.500 tokens de dados de produto (únicos por item, sem benefício de cache) e recebe 1.000 tokens de texto. Isso representa 15M de tokens de entrada, todos erros, e 10M de tokens de saída.
- No pico: entrada 15 × US$0,30 = US$4,50. Saída 10 × US$1,20 = US$12,00. Total US$16,50.
- Fora do pico: entrada 15 × US$0,15 = US$2,25. Saída 10 × US$0,60 = US$6,00. Total US$8,25.
- Economia apenas pelo carimbo de data/hora: US$8,25, sem alteração nos prompts.
A saída domina este trabalho e teve o menor corte no lançamento, então a janela fora do pico é a maior alavanca. É uma janela generosa: 15 horas em cada dia útil a partir das 10:00 UTC, mais 48 horas ininterruptas a cada fim de semana.
Contexto, saída e por que a concorrência faz parte do preço
Ambos os nomes de modelo suportam um contexto de 1M de tokens e uma saída máxima de 384K tokens. A ficha do modelo recomenda um máximo de 256K tokens ou mais, então defina esse limite intencionalmente: uma resposta que atinja 384K tokens de saída custa US$0,46 no pico, o que é bom para uma transcrição de agente e um problema para o preenchimento automático.
A concorrência é de 2.500 para Flash contra 500 para Pro. Ela pertence a um artigo de preços porque o desconto fora do pico só vale a pena se você puder fazer o trabalho durante essa janela, e porque o tráfego deepseek-v4-pro redirecionado em 14 de setembro herda o limite Flash: uma integração Pro que costumava fazer fila atrás de 500 slots obtém cinco vezes mais capacidade sem uma alteração de configuração.
Meça o gasto real com Apidog
As tabelas de preços informam a tarifa. O objeto usage em cada resposta informa o que foi cobrado. Aqui está um fluxo de trabalho do Apidog que torna essa verificação repetível.

- Adicione o endpoint. Crie
POST https://api.deepseek.com/chat/completions, ou importe uma especificação OpenAPI compatível com OpenAI. - Coloque os preços em ambientes. Crie dois ambientes Apidog,
deepseek-peakedeepseek-offpeak, cada um contendoDEEPSEEK_API_KEYmaisPRICE_HIT,PRICE_MISSePRICE_OUTcomo{{variables}}. O pico mantém 0,006 / 0,30 / 1,20; o fora do pico mantém 0,003 / 0,15 / 0,60. - Envie uma vez e leia
usage. DeepSeek divide a entrada emprompt_cache_hit_tokenseprompt_cache_miss_tokensjunto comcompletion_tokens[VERIFICAR]. Salve a requisição como um caso de teste. - Crie um cenário de teste que afirme o comportamento do cache. Encadeie a requisição salva duas vezes com o mesmo prompt de sistema de 20K tokens. No segundo passo, afirme que o campo de token de acerto é de pelo menos 19.000 e que o custo calculado (acertos ×
{{PRICE_HIT}}+ erros ×{{PRICE_MISS}}+ saída ×{{PRICE_OUT}}, dividido por 1M) permanece dentro do orçamento. Um erro no segundo passo significa que o prefixo mudou, e a afirmação o detecta antes que a fatura o faça. - Compare o pico com o fora do pico. Execute o cenário em cada ambiente e compare a linha de custo, ou execute-o a partir do CI com
apidog-cliem um cronograma que cruza um limite de pico UTC.
Baixe o Apidog e todo o cenário, incluindo os ambientes, funciona no plano gratuito.
Onde isso deixa sua fatura
O V4.1-Flash é mais barato que o V4-Flash em todas as linhas e de 70% a 86% mais barato que as taxas do V4-Pro que ele substitui. Dois fatores importam: mantenha seu prefixo longo byte a byte idêntico para que ele acerte o cache, e agende trabalhos em lote fora das sete horas de pico dos dias úteis. Em seguida, registre o usage em cada chamada, verifique a contagem de acertos e deixe que os números mostrem se o corte chegou à sua fatura.
