DeepSeek-V4.1-Flash foi disponibilizado (GA) na API hoje, 10 de setembro de 2026. A nota de lançamento é curta, mas altera três coisas para quem chama a API DeepSeek: há um único ID de modelo para usar a partir de agora, deepseek-flash; as taxas por token caíram novamente; e em quatro dias, em 14 de setembro, toda requisição para deepseek-v4-pro será redirecionada para este modelo e cobrada com os preços Flash.
Esse último ponto é a razão pela qual este guia existe. Se você tem código em produção no V4-Pro, você não poderá escolher uma data de migração. Se você está no V4-Flash, já está sendo atendido pelo novo modelo sob o nome antigo. De qualquer forma, vale a pena verificar os parâmetros que você envia hoje.
Este post aborda o lado prático: ID do modelo, URLs base, uma primeira chamada em três idiomas, esforço de raciocínio, entrada de imagem, streaming e precificação. Para a arquitetura e a história dos benchmarks, leia O que é DeepSeek-V4.1-Flash primeiro.
Antes de conectar qualquer coisa ao código, você vai querer uma maneira rápida de enviar requisições e comparar respostas. O Apidog cuida disso: aponte-o para https://api.deepseek.com, armazene a chave como uma variável e salve cada chamada funcional como um teste reutilizável. O fluxo de trabalho está perto do final.
Em Resumo
- ID do modelo:
deepseek-flash. Nomes legadosdeepseek-v4-flashedeepseek-v4-flash-vision-expainda funcionam, mas se resolvem para V4.1-Flash. - URLs base inalteradas:
https://api.deepseek.com(compatível com OpenAI) ehttps://api.deepseek.com/anthropic(compatível com Anthropic). deepseek-v4-proredireciona para V4.1-Flash em 14 de setembro de 2026 às 04:00 UTC.- Contexto de 1M tokens, saída máxima de 384K, limite de concorrência de 2.500.
- Preços fora do pico por 1M tokens: $0,003 acerto de cache, $0,15 erro de cache, $0,60 saída. No pico é o dobro.
- Visão é nativa. Imagens vão no array
contentcomo partesimage_url.
O que mudou para os usuários da API
Aqui está a diferença, extraída da nota de lançamento e do registro de alterações.
Um ID de modelo. O nome canônico agora é deepseek-flash, sem a versão. Fixe seus prompts e testes ao comportamento, não a uma string de versão, porque a próxima versão Flash será lançada sob o mesmo nome.
Nomes legados ainda redirecionam. deepseek-v4-flash e deepseek-v4-flash-vision-exp são aceitos por enquanto, mas os modelos por trás deles, V4-Flash e V4-Flash-Vision-Exp, foram desativados. Requisições para esses nomes são atendidas pelo V4.1-Flash. Nada quebra, mas você não estará executando o modelo que pensa. Renomeie quando puder.
O nome beta foi removido. O beta de dois dias de 8 de setembro rodou como deepseek-v4.1-flash-expires-on-0910. Ele expirou conforme prometido. Mude para deepseek-flash.
URLs base e formatos inalterados. Chamadas compatíveis com OpenAI vão para https://api.deepseek.com, chamadas compatíveis com Anthropic vão para https://api.deepseek.com/anthropic, e o formato de API de Respostas que a linha Flash já suportava é mantido. A configuração do seu SDK não muda.
O V4-Pro tem quatro dias. A partir de 14 de setembro de 2026 às 04:00 UTC (12:00 Beijing), toda requisição deepseek-v4-pro será redirecionada para o V4.1-Flash e cobrada com as taxas do V4.1-Flash. A razão declarada da DeepSeek é que o V4.1-Flash "superou de forma abrangente o V4 Pro em desempenho, custo, velocidade e tempo total", citando testes de múltiplas partes. Essa é uma alegação do fornecedor. O guia de migração para aposentadoria do V4-Pro mostra como verificar isso em seus próprios prompts antes que a mudança aconteça para você.
Passo 1: obtenha uma chave
Faça login na plataforma DeepSeek, abra Chaves API e crie uma. As chaves começam com sk-. Exporte-a em vez de colá-la no código-fonte:
export DEEPSEEK_API_KEY="sk-sua-chave-aqui"
Nenhum SDK específico do DeepSeek é necessário. As bibliotecas cliente OpenAI e Anthropic funcionam assim que você muda a URL base.
Passo 2: faça sua primeira chamada
Curl primeiro, porque ele remove todas as variáveis, exceto a própria API:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-flash",
"messages": [
{"role": "system", "content": "Você é um engenheiro de suporte para uma API de pagamentos."},
{"role": "user", "content": "Um cliente recebe HTTP 402 em /v1/charges. Liste as três causas mais prováveis."}
],
"stream": false
}'
A mesma chamada através do SDK Python da OpenAI:
# pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "system", "content": "Você é um engenheiro de suporte para uma API de pagamentos."},
{"role": "user", "content": "Um cliente recebe HTTP 402 em /v1/charges. Liste as três causas mais prováveis."},
],
)
print(response.choices[0].message.content)
E Node:
// npm install openai
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await client.chat.completions.create({
model: "deepseek-flash",
messages: [
{ role: "user", content: "Escreva uma migração Postgres que adicione um timestamp nullable refunded_at a faturas." },
],
});
console.log(completion.choices[0].message.content);
Se você configurou para a versão anterior seguindo o guia da API V4-Flash, a única diferença é a string do modelo.
Passo 3: esforço de raciocínio e modo de pensamento
A ficha do modelo descreve o esforço de raciocínio como "controlável continuamente" em uma escala de 1 a 100. Isso é um afastamento dos presets baixo/médio/alto que a maioria das APIs expõe, e significa que você pode ajustar o custo e a latência por endpoint em vez de por nível.
A forma do parâmetro que carrega esse valor de 1 a 100 é [VERIFICAR] contra a documentação da API. Até que eles confirmem, comece pelo padrão V4-Flash: reasoning_effort mais um objeto thinking passado através de extra_body:
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Nosso cluster Redis perde 2% dos SETs sob carga. Planeje a investigação."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}},
)
Configurações de amostragem recomendadas da ficha do modelo: temperature 1.0, top_p 0.95 ou 1.0, e max_tokens de 256K ou mais para longos rastros de raciocínio. A saída máxima é de 384K tokens.
Uma divisão prática: pensamento desativado para preenchimento automático, classificação e qualquer coisa que um usuário esteja esperando; pensamento ativado em alto esforço para loops de agentes, refatorações multi-arquivo e depuração. Então meça. Esforço que você não pode ver na saída é esforço pelo qual você está pagando de qualquer forma.
Passo 4: envie uma imagem
O V4.1-Flash é nativamente multimodal, treinado em um corpus multimodal de 45T tokens com um encoder DeepSeek-ViT treinado do zero. O formato da requisição é herdado do V4-Flash-Vision-Exp: imagens são partes do array content da mensagem do usuário.
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extraia cada item de linha e o total deste recibo como JSON."},
{"type": "image_url", "image_url": {"url": "https://cdn.example-shop.com/receipts/48213.png"}},
],
}],
)
Para um arquivo local, codifique-o como uma URL de dados base64:
import base64
with open("receipt.png", "rb") as f:
data_url = "data:image/png;base64," + base64.b64encode(f.read()).decode()
# então passe {"url": data_url} na parte image_url
Limites: URLs de dados base64 de até 32 MiB, URLs externas de até 8.192 caracteres, ou um ID de arquivo. Um campo detail opcional é aceito. A DeepSeek relata DocVQA 95.6, que é o caso de leitura de documentos acima. O guia da API de visão cobre prompts multi-imagem, níveis de detalhe e quanto as imagens custam por requisição.
Passo 5: transmita a resposta
Defina stream=True e o endpoint retornará eventos enviados pelo servidor. Conteúdo de raciocínio e conteúdo da resposta chegam como deltas separados, o que importa quando você está renderizando um estado de "pensamento" em uma UI.
stream = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Explique chaves de idempotência em um parágrafo."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
if delta.content:
print(delta.content, end="", flush=True)
Se SSE é novo para você, o streaming de respostas LLM com eventos enviados pelo servidor explica o formato de comunicação e os casos de borda de reconexão.
Preços em um relance
Da página oficial de preços, com efeito a partir de 10 de setembro de 2026 às 04:00 UTC, em USD por 1M tokens:
| deepseek-flash fora do pico | deepseek-flash pico | |
|---|---|---|
| Entrada, acerto de cache | $0.003 | $0.006 |
| Entrada, erro de cache | $0.15 | $0.30 |
| Saída | $0.60 | $1.20 |
Três coisas a saber:
- Os períodos de pico são de segunda a sexta-feira, das 01:00 às 04:00 e das 06:00 às 10:00 UTC (9:00 às 12:00 e 14:00 às 18:00 Beijing). Fora do pico é metade do preço. Tarefas em lote que podem esperar devem esperar.
- Acertos de cache são automáticos. Um acerto custa 50x menos que um erro, então um prompt de sistema estável no início de cada requisição é a otimização mais barata disponível. O que é cache de prompt explica como a correspondência de prefixo funciona.
- Em comparação com o V4-Flash, a redução é de cerca de 57% na entrada com acerto de cache, 32% na entrada com erro de cache e 9% na saída. Uma carga de trabalho V4-Pro redirecionada em 14 de setembro paga $0,30 em vez de $1,32 por 1 milhão de entradas com erro de cache no pico, e $1,20 em vez de $3,96 para saída.
Teste a API no Apidog
Uma vez que a primeira chamada funciona, a questão é se ela continua funcionando. O deepseek-flash não possui versão, então a próxima atualização será silenciosa. Aqui está um fluxo de trabalho do Apidog que o detecta:

- Adicione o endpoint. Crie
POST https://api.deepseek.com/chat/completions, ou importe uma especificação OpenAPI compatível com OpenAI para que cada rota chegue de uma vez. - Armazene a chave como uma variável de ambiente. Coloque
DEEPSEEK_API_KEYem um ambiente Apidog e defina o cabeçalho comoBearer {{DEEPSEEK_API_KEY}}. Alternar entre uma chave pessoal e a chave de produção se torna um menu suspenso. - Salve uma requisição por nível de esforço. Duplique a requisição base em variantes: pensamento desativado, pensamento ativado em baixo esforço, pensamento ativado em alto esforço. Mesmo prompt, parâmetros diferentes. Envie todos os três e compare o uso de tokens e a latência lado a lado.
- Assista ao stream. Para
stream: true, o Apidog renderiza eventos SSE à medida que chegam, então deltas de raciocínio e deltas de conteúdo aparecem como linhas separadas em vez de uma parede de prefixosdata:. - Transforme as variantes em um cenário de teste. Adicione asserções no código de status, na contagem de acertos de cache no
usagesendo maior que zero na segunda execução, e na resposta contendo os campos que seu aplicativo analisa. Rexecute o cenário após cada atualização do modelo, e em 14 de setembro, quando o redirecionamento V4-Pro entrar em vigor. - Execute-o na CI. O
apidog-cliexecuta o mesmo cenário a partir de um pipeline, então uma mudança silenciosa do modelo falha na construção em vez de falhar para um cliente.
Baixe o Apidog e toda a configuração leva cerca de dez minutos.
FAQ
Eu tenho que renomear deepseek-v4-flash para deepseek-flash? Não hoje. O nome legado ainda redireciona para o V4.1-Flash. Mas o V4-Flash em si foi desativado, e a DeepSeek não disse quando o apelido será removido. Renomeie na sua próxima implantação.
O que acontece com o meu código V4-Pro em 14 de setembro? Nada quebra. Requisições para deepseek-v4-pro são respondidas pelo V4.1-Flash e cobradas com as taxas Flash a partir das 04:00 UTC. Suas saídas podem mudar, no entanto, então execute seu conjunto de avaliação antes dessa data. O guia de migração possui uma lista de verificação.
O endpoint compatível com Anthropic suporta o novo modelo? Sim. https://api.deepseek.com/anthropic está inalterado; use deepseek-flash como o nome do modelo lá também.
Existe um plano gratuito? A API é paga conforme o uso, sem um plano gratuito permanente. Os pesos são licenciados pelo MIT no Hugging Face se você quiser auto-hospedar. As opções atuais estão reunidas em como usar a API DeepSeek V4 gratuitamente.
Quão rápido é? A DeepSeek não publicou um número de tokens por segundo. Um usuário do X relatou "quase 400 t/s" em testes de vídeo, o que é uma anedota, não uma especificação. Meça em seus próprios prompts durante um período de pico.
Antes do redirecionamento
A superfície da API mal se moveu: as mesmas URLs base, o mesmo formato de requisição, um novo ID de modelo. O que mudou foi o preço e, em 14 de setembro, o roteamento de cada chamada V4-Pro. Renomeie deepseek-v4-flash para deepseek-flash, escolha um nível de esforço por endpoint e execute seus prompts através do novo modelo antes que a DeepSeek faça isso por você.
Salve esses prompts como testes enquanto estiver nisso. O Apidog os executa novamente com um clique, e a próxima atualização silenciosa do Flash aparecerá como uma asserção falha em vez de um ticket de suporte.
