DeepSeek V4-Pro Será Descontinuado em 14 de Setembro: Como Migrar para V4.1-Flash

DeepSeek desativará o V4-Pro em 14 de setembro de 2026 e redirecionará as solicitações para o V4.1-Flash. O que muda, um checklist de migração e como testar antes da transição.

INEZA Felin-Michel

INEZA Felin-Michel

10 setembro 2026

DeepSeek V4-Pro Será Descontinuado em 14 de Setembro: Como Migrar para V4.1-Flash

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

DeepSeek deu aos usuários de deepseek-v4-pro quatro dias. Em 14 de setembro de 2026, às 04:00 UTC (12:00 Pequim), toda solicitação que nomear deepseek-v4-pro será roteada para DeepSeek-V4.1-Flash e cobrada pelas taxas do V4.1-Flash. Nada dará erro. Nada avisará. Sua conta diminuirá, e um modelo diferente começará a responder aos seus prompts.

Essa última parte é a que exige planejamento. A nota de lançamento enquadra a mudança como uma atualização, e pelos próprios números da DeepSeek, é. Mas “redirecionado silenciosamente” não é o mesmo que “testado”. Se o seu produto depende de um formato específico de chamada de ferramenta ou de um orçamento de latência que você ajustou para o V4-Pro, você vai querer saber o que muda antes de domingo, não depois.

Este guia aborda o que a DeepSeek anunciou, o que acontece se você não fizer nada, uma lista de verificação de migração e uma maneira de construir um conjunto de testes de regressão Pro versus Flash no Apidog para que a transição seja um não-evento. Para o modelo em si, leia primeiro o que é o DeepSeek-V4.1-Flash.

Em resumo

O que a DeepSeek anunciou em 10 de setembro

A entrada do changelog de 10 de setembro aborda duas coisas: o V4.1-Flash entrando em disponibilidade geral (GA) na API, e o V4-Pro sendo descontinuado quatro dias depois.

Sobre o V4-Pro, a redação é direta. A DeepSeek afirma que o V4.1-Flash “superou de forma abrangente o V4 Pro em desempenho, custo, velocidade e tempo total”, citando “testes de múltiplas partes”. A partir de 14 de setembro às 04:00 UTC, as solicitações para deepseek-v4-pro serão atendidas pelo V4.1-Flash e precificadas como V4.1-Flash. Não há período de carência em que o Pro continue funcionando sob um nome legado.

A limpeza de nomes vai além do Pro:

Nome do modelo Status após 10 de setembro
deepseek-flash Novo ID canônico para V4.1-Flash
deepseek-v4-flash Ainda aceito, atendido pelo V4.1-Flash
deepseek-v4-flash-vision-exp Ainda aceito, atendido pelo V4.1-Flash
deepseek-v4-pro Atendido pelo V4-Pro até 14 de setembro às 04:00 UTC, então redirecionado para o V4.1-Flash

V4-Flash e V4-Flash-Vision-Exp como modelos foram descontinuados; apenas seus nomes continuam como aliases. As URLs base não mudam: https://api.deepseek.com para o formato compatível com OpenAI e https://api.deepseek.com/anthropic para o compatível com Anthropic. O passo a passo para a API V4.1-Flash aborda o novo ID do modelo, controle de raciocínio e entrada de imagem em detalhes.

O que acontece se você não fizer nada

Versão curta: sua integração continua funcionando e fica mais barata. Versão mais longa: cinco coisas mudam para você.

Um modelo diferente responde. O V4.1-Flash é um MoE de 552 bilhões de parâmetros com um novo layout Causal Encoder-Decoder: 40 camadas, 20 encoders e 20 decoders, 8 bilhões de parâmetros ativos durante o preenchimento e 16 bilhões durante a decodificação. Seus prompts agora atingem um orçamento de parâmetros ativos diferente e um design de atenção diferente (Compressed Sparse Attention 2). Espere diferentes formulações, diferentes verbosidades padrão e, ocasionalmente, diferentes decisões em chamadas de ferramenta limítrofes.

O limite de saída é o mesmo, as configurações recomendadas não. Ambos os modelos listam 1M de contexto e 384K de saída máxima. O cartão do modelo V4.1-Flash recomenda temperatura 1.0, top_p 0.95 ou 1.0, e tokens máximos de 256K ou mais. Se você definiu um max_tokens apertado no V4-Pro para limitar o custo, verifique se a saída de raciocínio agora é truncada antes que a resposta chegue.

O esforço de raciocínio funciona em uma escala diferente. A DeepSeek descreve o esforço de raciocínio do V4.1-Flash como “continuamente controlável” em uma escala de 1 a 100. O V4-Flash aceitava reasoning_effort mais extra_body={"thinking": {"type": "enabled"}}. Como a escala de 1 a 100 se mapeia para o parâmetro da API é [VERIFICAR] contra a documentação atual; não assuma que um nível nomeado como "high" significa a profundidade que tinha no Pro.

Os preços mudam a seu favor, com uma janela de pico. Os horários de pico são de segunda a sexta-feira, das 01:00 às 04:00 e das 06:00 às 10:00 UTC. Fora do pico é metade do pico. O tráfego Pro redirecionado paga as taxas Flash em ambas as janelas.

A folga de concorrência aumenta. O limite do V4-Pro era de 500 solicitações concorrentes. O do Flash é 2.500. O tráfego redirecionado herda o limite superior, então revise qualquer backoff do lado do cliente ajustado para 500.

Lista de verificação de migração

Faça isso na ordem. Juntos, eles transformam um redirecionamento silencioso em um lançamento deliberado.

  1. Renomeie o ID do modelo. Procure em sua base de código e configuração por deepseek-v4-pro e substitua por deepseek-flash. Faça isso mesmo que o alias continue funcionando: IDs explícitos tornam os incidentes mais fáceis de ler posteriormente.
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",  # era "deepseek-v4-pro"
    messages=[
        {"role": "system", "content": "You triage support tickets. Return a JSON object with priority, team, and summary."},
        {"role": "user", "content": "Customer reports checkout returns 502 after applying a discount code."},
    ],
    response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
  1. Revise as configurações de esforço de raciocínio. Liste todos os locais onde você definiu reasoning_effort ou um toggle de pensamento. Decida por endpoint se você quer profundidade ou latência, e então teste cada um contra a nova escala em vez de manter o valor antigo.
  2. Execute novamente os testes de chamada de função e saída estruturada. A formatação de argumentos de chamada de ferramenta é onde as trocas de modelo mais pegam. Se você escreveu testes ao configurar a chamada de função no V4-Pro, execute-os contra deepseek-flash agora. Se não o fez, o fluxo de trabalho do Apidog abaixo oferece um conjunto.
  3. Verifique seus parsers de streaming. O V4.1-Flash transmite deltas de raciocínio e deltas de resposta separadamente no modo de pensamento. Confirme se seu manipulador SSE não os concatena e se seu cronômetro de “primeiro token” mede o que você pensa que mede.
  4. Re-estabeleça a linha de base de latência e custo. Registre a latência p50 e p95 mais os tokens por solicitação no V4-Pro esta semana, e depois o mesmo no deepseek-flash. Você vai querer ambos os números quando alguém perguntar por que o painel mudou na segunda-feira.
  5. Atualize painéis e orçamentos. Os alertas de custo calibrados para US$ 3,96 de saída no pico ficam silenciosos quando você está pagando US$ 1,20, e um orçamento que nunca dispara é um que ninguém olha. Redefina os limites para as taxas na página de preços e corrija qualquer detalhamento por modelo que filtre pelo ID antigo.

Se você chamar os formatos da API compatíveis com Anthropic ou Responses em vez de conclusões de chat, os mesmos passos se aplicam; a comparação de formatos da API V4-Pro mostra como cada solicitação se parece para que você possa mapear os campos.

V4-Pro vs V4.1-Flash em um relance

Os números de benchmark são relatados pela DeepSeek, do cartão do modelo V4.1-Flash. Os preços são em USD por 1 milhão de tokens, válidos a partir de 10 de setembro de 2026.

deepseek-v4-pro deepseek-flash (V4.1)
Parâmetros ativos Não redefinido no cartão V4.1 8B pré-preenchimento / 16B decodificação
HumanEval 76.8 79.4
GSM8K 92.6 93.0
DeepSWE v1.1 62.7 74.2
Terminal-Bench 2.1 87.9 90.6
Entrada, acerto de cache (fora do pico / pico) $0.022 / $0.044 $0.003 / $0.006
Entrada, cache-miss (fora do pico / pico) $0.66 / $1.32 $0.15 / $0.30
Saída (fora do pico / pico) $1.98 / $3.96 $0.60 / $1.20
Contexto / saída máxima 1M / 384K 1M / 384K
Limite de concorrência 500 2.500

A maior diferença é no DeepSWE, com aumento de 11,5 pontos. A menor é no GSM8K, com aumento de 0,4. Se sua carga de trabalho se parece com matemática do ensino fundamental, espere paridade; se parece com edições de código de múltiplos arquivos, os números da DeepSeek dizem que você ganha. A divisão em três vias, incluindo V4-Flash, está em V4.1-Flash vs V4-Pro vs V4-Flash.

O risco: benchmarks do fornecedor medem tarefas do fornecedor

Cada número naquela tabela veio da DeepSeek. “Testes por múltiplas partes” é a frase da DeepSeek, e as partes não são nomeadas na nota de lançamento. Isso não torna os números errados. Significa que eles foram medidos em conjuntos de benchmarks, não em seus prompts, seus esquemas de ferramentas ou nas entradas desorganizadas de seus usuários.

Um modelo pode pontuar mais alto no Terminal-Bench e ainda assim mudar a forma como ele formata um argumento de chamada de ferramenta do qual seu parser depende. Tokens de saída mais baratos não ajudam se o modelo escreve o dobro. A única maneira de saber é executar seu próprio tráfego através de ambos os modelos enquanto ambos existirem. Você tem até 14 de setembro.

Crie um conjunto de regressão no Apidog antes da transição

Aqui está um fluxo de trabalho no Apidog que oferece uma comparação Pro versus Flash repetível e entrega a execução para o CI.

  1. Importe suas solicitações V4-Pro existentes. Importe uma especificação OpenAPI compatível com OpenAI, ou cole os comandos curl que você usa em produção. Coloque DEEPSEEK_API_KEY em um ambiente e referencie-o como Bearer {{DEEPSEEK_API_KEY}} no cabeçalho de Autorização. Adicione uma segunda variável, {{MODEL_ID}}, definida como deepseek-v4-pro.
  2. Duplique cada solicitação com deepseek-flash. Defina {{MODEL_ID}} para deepseek-flash em um segundo ambiente, ou codifique os dois IDs em solicitações emparelhadas. Mesmos prompts, mesmo array de ferramentas, mesmo max_tokens. A única diferença deve ser o modelo.
  3. Adicione asserções sobre o formato JSON e a estrutura de chamada de ferramenta. Para saída estruturada, afirme que choices[0].message.content é analisado como JSON e contém as chaves que você espera. Para chamada de função, afirme que choices[0].message.tool_calls[0].function.name é igual à ferramenta que você espera e que arguments é analisado. Essas verificações detectam desvios de formato silenciosos.
  4. Execute ambos como um único cenário de teste. Encadeie as solicitações Pro e Flash em um único cenário para que cada execução produza um relatório. Inclua uma solicitação de streaming com stream: true; o Apidog renderiza eventos SSE um por um, para que você possa ver se os deltas de raciocínio e resposta chegam da maneira que seu parser espera.
  5. Compare os resultados. Compare as duas metades do relatório: taxa de aprovação de asserções, tempo de resposta e usage.completion_tokens. Um modelo que passa em todas as asserções, mas emite 40% mais tokens de saída, muda sua matemática de custos, e você verá isso antes da conta.
  6. Agende-o no CI com apidog-cli. Execute o cenário de seu pipeline diariamente até 14 de setembro e continue executando depois. Uma vez que o Pro se foi, a metade Pro também retorna respostas Flash e a diferença colapsa para zero: confirmação de que a transição ocorreu e suas asserções ainda são válidas.

Baixe o Apidog para configurar isso. O fluxo reside em um projeto compartilhado, então quem é responsável pela conta e quem é responsável pelos prompts lê o mesmo relatório.

Perguntas Frequentes

Minhas chamadas V4-Pro falharão em 14 de setembro? Não. As solicitações que especificam deepseek-v4-pro são redirecionadas para o V4.1-Flash. Você recebe uma resposta 200 e uma resposta do V4.1-Flash. O modo de falha é comportamental, não um código de erro.

Serei cobrado pelos preços do V4-Pro após a transição? Não. As solicitações redirecionadas são cobradas pelas taxas do V4.1-Flash: no pico, US$ 0,30 em vez de US$ 1,32 por 1 milhão de tokens de entrada com cache-miss e US$ 1,20 em vez de US$ 3,96 por 1 milhão de tokens de saída.

Devo renomear o ID para deepseek-flash ou manter deepseek-v4-pro? Renomeie. O alias funciona, mas um ID explícito significa que seus logs, painéis e relatórios de custo indicam o que está sendo chamado.

A configuração do V4-Pro-0813 ainda se aplica? A chave, URL base e formato de solicitação do guia da API V4-Pro-0813 permanecem inalterados. O que muda é o modelo por trás deles e o controle do esforço de raciocínio, então reteste em vez de assumir.

O V4.1-Flash é pior que o V4-Pro em alguma coisa? Os benchmarks publicados da DeepSeek mostram ganhos em todas as tarefas listadas. Resultados independentes não estavam disponíveis no momento da publicação. Trate “melhor em tudo” como uma afirmação a ser testada.

Quatro dias são suficientes

A migração é uma mudança de string mais uma execução de teste. A mudança da string leva um minuto. A execução do teste informa se o modelo pelo qual você pagará na próxima semana se comporta como aquele em torno do qual você projetou. Construa o conjunto, execute-o enquanto deepseek-v4-pro ainda se resolve para Pro, e leia a diferença. Se estiver limpo, você terá uma conta 70% mais barata e cinco vezes a concorrência gratuitamente. Se não estiver, você descobriu em seu cronograma, não no da DeepSeek.

botão

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs