DeepSeek deu aos usuários de deepseek-v4-pro quatro dias. Em 14 de setembro de 2026, às 04:00 UTC (12:00 Pequim), toda solicitação que nomear deepseek-v4-pro será roteada para DeepSeek-V4.1-Flash e cobrada pelas taxas do V4.1-Flash. Nada dará erro. Nada avisará. Sua conta diminuirá, e um modelo diferente começará a responder aos seus prompts.
Essa última parte é a que exige planejamento. A nota de lançamento enquadra a mudança como uma atualização, e pelos próprios números da DeepSeek, é. Mas “redirecionado silenciosamente” não é o mesmo que “testado”. Se o seu produto depende de um formato específico de chamada de ferramenta ou de um orçamento de latência que você ajustou para o V4-Pro, você vai querer saber o que muda antes de domingo, não depois.
Este guia aborda o que a DeepSeek anunciou, o que acontece se você não fizer nada, uma lista de verificação de migração e uma maneira de construir um conjunto de testes de regressão Pro versus Flash no Apidog para que a transição seja um não-evento. Para o modelo em si, leia primeiro o que é o DeepSeek-V4.1-Flash.
Em resumo
- Transição: 14 de setembro de 2026, 04:00 UTC. As solicitações
deepseek-v4-proserão direcionadas para o V4.1-Flash a partir desse momento. - Suas chamadas não falharão e você não pagará preços Pro. A entrada de cache-miss de pico cai de US$ 1,32 para US$ 0,30 por 1 milhão de tokens (77% menos); a saída cai de US$ 3,96 para US$ 1,20 (70% menos).
- Renomeie o ID do modelo para
deepseek-flashvocê mesmo, depois reteste a chamada de função, saída estruturada, streaming e esforço de raciocínio. - A DeepSeek afirma que o V4.1-Flash supera o V4-Pro em todos os benchmarks listados. Esses são números do fornecedor. Execute suas próprias avaliações.
O que a DeepSeek anunciou em 10 de setembro
A entrada do changelog de 10 de setembro aborda duas coisas: o V4.1-Flash entrando em disponibilidade geral (GA) na API, e o V4-Pro sendo descontinuado quatro dias depois.

Sobre o V4-Pro, a redação é direta. A DeepSeek afirma que o V4.1-Flash “superou de forma abrangente o V4 Pro em desempenho, custo, velocidade e tempo total”, citando “testes de múltiplas partes”. A partir de 14 de setembro às 04:00 UTC, as solicitações para deepseek-v4-pro serão atendidas pelo V4.1-Flash e precificadas como V4.1-Flash. Não há período de carência em que o Pro continue funcionando sob um nome legado.
A limpeza de nomes vai além do Pro:
| Nome do modelo | Status após 10 de setembro |
|---|---|
deepseek-flash |
Novo ID canônico para V4.1-Flash |
deepseek-v4-flash |
Ainda aceito, atendido pelo V4.1-Flash |
deepseek-v4-flash-vision-exp |
Ainda aceito, atendido pelo V4.1-Flash |
deepseek-v4-pro |
Atendido pelo V4-Pro até 14 de setembro às 04:00 UTC, então redirecionado para o V4.1-Flash |
V4-Flash e V4-Flash-Vision-Exp como modelos foram descontinuados; apenas seus nomes continuam como aliases. As URLs base não mudam: https://api.deepseek.com para o formato compatível com OpenAI e https://api.deepseek.com/anthropic para o compatível com Anthropic. O passo a passo para a API V4.1-Flash aborda o novo ID do modelo, controle de raciocínio e entrada de imagem em detalhes.
O que acontece se você não fizer nada
Versão curta: sua integração continua funcionando e fica mais barata. Versão mais longa: cinco coisas mudam para você.
Um modelo diferente responde. O V4.1-Flash é um MoE de 552 bilhões de parâmetros com um novo layout Causal Encoder-Decoder: 40 camadas, 20 encoders e 20 decoders, 8 bilhões de parâmetros ativos durante o preenchimento e 16 bilhões durante a decodificação. Seus prompts agora atingem um orçamento de parâmetros ativos diferente e um design de atenção diferente (Compressed Sparse Attention 2). Espere diferentes formulações, diferentes verbosidades padrão e, ocasionalmente, diferentes decisões em chamadas de ferramenta limítrofes.
O limite de saída é o mesmo, as configurações recomendadas não. Ambos os modelos listam 1M de contexto e 384K de saída máxima. O cartão do modelo V4.1-Flash recomenda temperatura 1.0, top_p 0.95 ou 1.0, e tokens máximos de 256K ou mais. Se você definiu um max_tokens apertado no V4-Pro para limitar o custo, verifique se a saída de raciocínio agora é truncada antes que a resposta chegue.
O esforço de raciocínio funciona em uma escala diferente. A DeepSeek descreve o esforço de raciocínio do V4.1-Flash como “continuamente controlável” em uma escala de 1 a 100. O V4-Flash aceitava reasoning_effort mais extra_body={"thinking": {"type": "enabled"}}. Como a escala de 1 a 100 se mapeia para o parâmetro da API é [VERIFICAR] contra a documentação atual; não assuma que um nível nomeado como "high" significa a profundidade que tinha no Pro.
Os preços mudam a seu favor, com uma janela de pico. Os horários de pico são de segunda a sexta-feira, das 01:00 às 04:00 e das 06:00 às 10:00 UTC. Fora do pico é metade do pico. O tráfego Pro redirecionado paga as taxas Flash em ambas as janelas.
A folga de concorrência aumenta. O limite do V4-Pro era de 500 solicitações concorrentes. O do Flash é 2.500. O tráfego redirecionado herda o limite superior, então revise qualquer backoff do lado do cliente ajustado para 500.
Lista de verificação de migração
Faça isso na ordem. Juntos, eles transformam um redirecionamento silencioso em um lançamento deliberado.
- Renomeie o ID do modelo. Procure em sua base de código e configuração por
deepseek-v4-proe substitua pordeepseek-flash. Faça isso mesmo que o alias continue funcionando: IDs explícitos tornam os incidentes mais fáceis de ler posteriormente.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash", # era "deepseek-v4-pro"
messages=[
{"role": "system", "content": "You triage support tickets. Return a JSON object with priority, team, and summary."},
{"role": "user", "content": "Customer reports checkout returns 502 after applying a discount code."},
],
response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
- Revise as configurações de esforço de raciocínio. Liste todos os locais onde você definiu
reasoning_effortou um toggle de pensamento. Decida por endpoint se você quer profundidade ou latência, e então teste cada um contra a nova escala em vez de manter o valor antigo. - Execute novamente os testes de chamada de função e saída estruturada. A formatação de argumentos de chamada de ferramenta é onde as trocas de modelo mais pegam. Se você escreveu testes ao configurar a chamada de função no V4-Pro, execute-os contra
deepseek-flashagora. Se não o fez, o fluxo de trabalho do Apidog abaixo oferece um conjunto. - Verifique seus parsers de streaming. O V4.1-Flash transmite deltas de raciocínio e deltas de resposta separadamente no modo de pensamento. Confirme se seu manipulador SSE não os concatena e se seu cronômetro de “primeiro token” mede o que você pensa que mede.
- Re-estabeleça a linha de base de latência e custo. Registre a latência p50 e p95 mais os tokens por solicitação no V4-Pro esta semana, e depois o mesmo no
deepseek-flash. Você vai querer ambos os números quando alguém perguntar por que o painel mudou na segunda-feira. - Atualize painéis e orçamentos. Os alertas de custo calibrados para US$ 3,96 de saída no pico ficam silenciosos quando você está pagando US$ 1,20, e um orçamento que nunca dispara é um que ninguém olha. Redefina os limites para as taxas na página de preços e corrija qualquer detalhamento por modelo que filtre pelo ID antigo.
Se você chamar os formatos da API compatíveis com Anthropic ou Responses em vez de conclusões de chat, os mesmos passos se aplicam; a comparação de formatos da API V4-Pro mostra como cada solicitação se parece para que você possa mapear os campos.
V4-Pro vs V4.1-Flash em um relance
Os números de benchmark são relatados pela DeepSeek, do cartão do modelo V4.1-Flash. Os preços são em USD por 1 milhão de tokens, válidos a partir de 10 de setembro de 2026.
| deepseek-v4-pro | deepseek-flash (V4.1) | |
|---|---|---|
| Parâmetros ativos | Não redefinido no cartão V4.1 | 8B pré-preenchimento / 16B decodificação |
| HumanEval | 76.8 | 79.4 |
| GSM8K | 92.6 | 93.0 |
| DeepSWE v1.1 | 62.7 | 74.2 |
| Terminal-Bench 2.1 | 87.9 | 90.6 |
| Entrada, acerto de cache (fora do pico / pico) | $0.022 / $0.044 | $0.003 / $0.006 |
| Entrada, cache-miss (fora do pico / pico) | $0.66 / $1.32 | $0.15 / $0.30 |
| Saída (fora do pico / pico) | $1.98 / $3.96 | $0.60 / $1.20 |
| Contexto / saída máxima | 1M / 384K | 1M / 384K |
| Limite de concorrência | 500 | 2.500 |
A maior diferença é no DeepSWE, com aumento de 11,5 pontos. A menor é no GSM8K, com aumento de 0,4. Se sua carga de trabalho se parece com matemática do ensino fundamental, espere paridade; se parece com edições de código de múltiplos arquivos, os números da DeepSeek dizem que você ganha. A divisão em três vias, incluindo V4-Flash, está em V4.1-Flash vs V4-Pro vs V4-Flash.
O risco: benchmarks do fornecedor medem tarefas do fornecedor
Cada número naquela tabela veio da DeepSeek. “Testes por múltiplas partes” é a frase da DeepSeek, e as partes não são nomeadas na nota de lançamento. Isso não torna os números errados. Significa que eles foram medidos em conjuntos de benchmarks, não em seus prompts, seus esquemas de ferramentas ou nas entradas desorganizadas de seus usuários.
Um modelo pode pontuar mais alto no Terminal-Bench e ainda assim mudar a forma como ele formata um argumento de chamada de ferramenta do qual seu parser depende. Tokens de saída mais baratos não ajudam se o modelo escreve o dobro. A única maneira de saber é executar seu próprio tráfego através de ambos os modelos enquanto ambos existirem. Você tem até 14 de setembro.
Crie um conjunto de regressão no Apidog antes da transição
Aqui está um fluxo de trabalho no Apidog que oferece uma comparação Pro versus Flash repetível e entrega a execução para o CI.
- Importe suas solicitações V4-Pro existentes. Importe uma especificação OpenAPI compatível com OpenAI, ou cole os comandos curl que você usa em produção. Coloque
DEEPSEEK_API_KEYem um ambiente e referencie-o comoBearer {{DEEPSEEK_API_KEY}}no cabeçalho de Autorização. Adicione uma segunda variável,{{MODEL_ID}}, definida comodeepseek-v4-pro. - Duplique cada solicitação com
deepseek-flash. Defina{{MODEL_ID}}paradeepseek-flashem um segundo ambiente, ou codifique os dois IDs em solicitações emparelhadas. Mesmos prompts, mesmo array de ferramentas, mesmomax_tokens. A única diferença deve ser o modelo. - Adicione asserções sobre o formato JSON e a estrutura de chamada de ferramenta. Para saída estruturada, afirme que
choices[0].message.contenté analisado como JSON e contém as chaves que você espera. Para chamada de função, afirme quechoices[0].message.tool_calls[0].function.nameé igual à ferramenta que você espera e queargumentsé analisado. Essas verificações detectam desvios de formato silenciosos. - Execute ambos como um único cenário de teste. Encadeie as solicitações Pro e Flash em um único cenário para que cada execução produza um relatório. Inclua uma solicitação de streaming com
stream: true; o Apidog renderiza eventos SSE um por um, para que você possa ver se os deltas de raciocínio e resposta chegam da maneira que seu parser espera. - Compare os resultados. Compare as duas metades do relatório: taxa de aprovação de asserções, tempo de resposta e
usage.completion_tokens. Um modelo que passa em todas as asserções, mas emite 40% mais tokens de saída, muda sua matemática de custos, e você verá isso antes da conta. - Agende-o no CI com
apidog-cli. Execute o cenário de seu pipeline diariamente até 14 de setembro e continue executando depois. Uma vez que o Pro se foi, a metade Pro também retorna respostas Flash e a diferença colapsa para zero: confirmação de que a transição ocorreu e suas asserções ainda são válidas.
Baixe o Apidog para configurar isso. O fluxo reside em um projeto compartilhado, então quem é responsável pela conta e quem é responsável pelos prompts lê o mesmo relatório.
Perguntas Frequentes
Minhas chamadas V4-Pro falharão em 14 de setembro? Não. As solicitações que especificam deepseek-v4-pro são redirecionadas para o V4.1-Flash. Você recebe uma resposta 200 e uma resposta do V4.1-Flash. O modo de falha é comportamental, não um código de erro.
Serei cobrado pelos preços do V4-Pro após a transição? Não. As solicitações redirecionadas são cobradas pelas taxas do V4.1-Flash: no pico, US$ 0,30 em vez de US$ 1,32 por 1 milhão de tokens de entrada com cache-miss e US$ 1,20 em vez de US$ 3,96 por 1 milhão de tokens de saída.
Devo renomear o ID para deepseek-flash ou manter deepseek-v4-pro? Renomeie. O alias funciona, mas um ID explícito significa que seus logs, painéis e relatórios de custo indicam o que está sendo chamado.
A configuração do V4-Pro-0813 ainda se aplica? A chave, URL base e formato de solicitação do guia da API V4-Pro-0813 permanecem inalterados. O que muda é o modelo por trás deles e o controle do esforço de raciocínio, então reteste em vez de assumir.
O V4.1-Flash é pior que o V4-Pro em alguma coisa? Os benchmarks publicados da DeepSeek mostram ganhos em todas as tarefas listadas. Resultados independentes não estavam disponíveis no momento da publicação. Trate “melhor em tudo” como uma afirmação a ser testada.
Quatro dias são suficientes
A migração é uma mudança de string mais uma execução de teste. A mudança da string leva um minuto. A execução do teste informa se o modelo pelo qual você pagará na próxima semana se comporta como aquele em torno do qual você projetou. Construa o conjunto, execute-o enquanto deepseek-v4-pro ainda se resolve para Pro, e leia a diferença. Se estiver limpo, você terá uma conta 70% mais barata e cinco vezes a concorrência gratuitamente. Se não estiver, você descobriu em seu cronograma, não no da DeepSeek.
botão
