DeepSeek lançou a API oficial DeepSeek-V4-Flash esta manhã. O anúncio foi feito em 31 de julho de 2026, e as notas de lançamento deixam três coisas claras: as capacidades de agente do modelo receberam uma atualização séria, ele agora "fala" nativamente o formato de API de Respostas da OpenAI, e funciona com Codex desde o primeiro dia.
Se você tem chamado deepseek-v4-flash desde abril, você estava usando a versão de prévia. Este lançamento gradua o modelo para sua versão oficial, DeepSeek-V4-Flash-0731, e você obtém a atualização sem mudar uma única linha de código. O nome do modelo permanece o mesmo.
Este guia aborda tudo: como obter uma chave, fazer sua primeira chamada, ativar e desativar o modo de pensamento, e como funciona o preço da beta pública. Se você é novo na linha DeepSeek, comece com O Que É DeepSeek V4? para ter uma visão geral da família, e depois volte aqui.
O que foi realmente lançado em 31 de julho
De acordo com o registro oficial de mudanças, o lançamento abrange apenas a API. O aplicativo DeepSeek e os modelos da web permanecem inalterados, e a API V4-Pro também não sofreu alterações. Aqui está o resumo:
- DeepSeek-V4-Flash-0731 é o lançamento oficial da linha V4-Flash, agora em beta público na API.
- Mesma arquitetura e tamanho que o V4-Flash-Preview. DeepSeek afirma que o modelo foi apenas re-pós-treinado, então os ganhos vêm do treinamento, não de uma rede maior.
- Os benchmarks de agente superaram o V4-Pro-Preview. DeepSeek relata Terminal Bench 2.1 em 82.7, Cybergym em 76.7, Toolathlon verificado em 70.3, e DeepSWE em 54.4. Estes são os números publicados pela própria DeepSeek, testados com sua estrutura no esforço máximo.
- Suporte nativo à API de Respostas e integração oficial do Codex. Cobrimos ambos em profundidade em DeepSeek-V4-Flash agora suporta a API de Respostas e Codex.
- O lançamento oficial do DeepSeek-V4-Pro "seguirá em breve", de acordo com o registro de alterações. O suporte à API de Respostas e ao Codex para o V4-Pro é esperado para o início de agosto de 2026.
Uma nota de honestidade: a alegação de benchmark principal ("superando em muito o V4-Pro-Preview") vem da própria avaliação da DeepSeek, e dois dos benchmarks listados (DSBench-FullStack e DSBench-Hard) são conjuntos de testes internos. Números independentes levarão alguns dias para aparecer.

Passo 1: Obtenha sua chave de API
Vá para a Plataforma DeepSeek, faça login e crie uma chave na página de Chaves de API. As chaves começam com sk-. Armazene-a como uma variável de ambiente em vez de codificá-la diretamente:
export DEEPSEEK_API_KEY="sk-your-key-here"
A API DeepSeek é compatível com os formatos de API da OpenAI e da Anthropic, então você não precisa de um SDK específico da DeepSeek. Duas URLs base importam:
| Formato | URL Base |
|---|---|
| Compatível com OpenAI | https://api.deepseek.com |
| Compatível com Anthropic | https://api.deepseek.com/anthropic |
Passo 2: Faça sua primeira chamada
O teste de sanidade mais rápido é o curl:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "Você é um assistente útil."},
{"role": "user", "content": "Resuma o que mudou no DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
A mesma chamada através do SDK Python da OpenAI:
# pip3 install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "Você é um assistente útil."},
{"role": "user", "content": "Escreva uma função Python que valide um endereço de e-mail."}
],
stream=False
)
print(response.choices[0].message.content)
E Node.js:
// npm install openai
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "Olá!" }],
});
console.log(completion.choices[0].message.content);
Como o nome do modelo deepseek-v4-flash agora aponta para o lançamento 0731, qualquer integração existente que você construiu para a versão de prévia passa a usar o novo modelo automaticamente. Nada a migrar.
Passo 3: Controle o modo de pensamento e o esforço de raciocínio
O V4-Flash suporta tanto um modo sem pensamento quanto um modo com pensamento, sendo o modo de pensamento o padrão. Você o controla com o parâmetro thinking, e pode ajustar a profundidade com reasoning_effort:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Planeje uma migração de banco de dados do MySQL para o Postgres."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
Dois comportamentos importantes a saber antes de ajustar os parâmetros:
temperatureetop_pnão têm efeito enquanto o modo de pensamento está ativado.- A conclusão FIM (fill-in-the-middle, ainda em beta) funciona apenas no modo sem pensamento.
Para endpoints sensíveis à latência, como autocompletar, desative o pensamento. Para loops de agente e tarefas de depuração difíceis, mantenha-o ativado e aumente o nível de esforço.
Passo 4: Transmita a resposta
Defina stream: true e a API retornará eventos enviados pelo servidor (server-sent events). Se você nunca depurou payloads SSE antes, nosso guia sobre streaming de respostas de LLM com eventos enviados pelo servidor aborda o formato em detalhes.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Explique o pool de conexões."}],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Preços durante a beta pública
De acordo com a página oficial de Modelos e Preços, o V4-Flash permanece agressivamente barato:
| Item | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Entrada, acerto de cache (por 1M tokens) | $0.0028 | $0.003625 |
| Entrada, erro de cache (por 1M tokens) | $0.14 | $0.435 |
| Saída (por 1M tokens) | $0.28 | $0.87 |
| Comprimento do contexto | 1M tokens | 1M tokens |
| Saída máxima | 384K | 384K |
| Limite de concorrência | 2.500 | 500 |
Três observações sobre os preços:
- O cache de contexto é automático, e um acerto de cache custa 50 vezes menos que um erro. Sessões de agente de longa duração que reutilizam um prompt de sistema se beneficiam enormemente.
- DeepSeek anunciou uma política de horário de pico/fora de pico: o uso em horários de pico (9:00-12:00 e 14:00-18:00 horário de Pequim) será cobrado com o dobro dos preços regulares. A partir de 31 de julho, a documentação informa que a data de efetivação está "sujeita ao anúncio oficial", então ainda não está ativa. Fique de olho na página de preços.
- O limite de concorrência já diz muito: 2.500 requisições simultâneas para o Flash versus 500 para o Pro. DeepSeek construiu este modelo para ser "martelado" por frotas de agentes.
Para ter uma visão mais completa dos custos em toda a família V4, incluindo o histórico do corte permanente de preços do V4-Pro, consulte nosso detalhamento de preços da API DeepSeek V4.
Teste e depure a API no Apidog
O curl bruto funciona para um teste rápido, mas no momento em que você está comparando a saída com e sem "pensamento", ou observando como o modelo transmite chamadas de ferramentas, você deseja visibilidade. Aqui está um fluxo de trabalho que leva cerca de cinco minutos no Apidog:

- Crie um projeto e adicione o endpoint. Adicione
POST https://api.deepseek.com/chat/completions(ou importe uma especificação compatível com OpenAI para que todos os endpoints sejam importados de uma vez). - Armazene a chave como uma variável de ambiente. Coloque
DEEPSEEK_API_KEYem um ambiente Apidog e referencie-a no cabeçalho de Autorização comoBearer {{DEEPSEEK_API_KEY}}. Alternar entre uma chave de teste e uma chave de produção torna-se um clique em um menu suspenso. - Envie e inspecione. Para chamadas de streaming, o Apidog renderiza os eventos SSE à medida que chegam, para que você possa observar o conteúdo de raciocínio e o conteúdo da resposta chegarem como deltas separados, em vez de analisar uma parede de linhas
data:brutas. - Salve variantes como casos de teste. Mantenha uma requisição salva com o pensamento ativado e outra sem, e depois execute ambas novamente após cada atualização do modelo. Quando a DeepSeek lançar a próxima atualização silenciosa para
deepseek-v4-flash, você saberá com um clique se seus prompts ainda se comportam como esperado.
Baixe o Apidog gratuitamente, todo o fluxo acima funciona no plano gratuito.
Perguntas Frequentes
Preciso mudar meu código para usar o novo modelo? Não. O nome do modelo deepseek-v4-flash agora serve o DeepSeek-V4-Flash-0731. Integrações existentes são atualizadas automaticamente.
Este é o mesmo modelo do aplicativo DeepSeek? Não. A atualização de 31 de julho abrange apenas a API. O aplicativo e os modelos da web permanecem inalterados.
O que aconteceu com deepseek-chat e deepseek-reasoner? Esses nomes de modelos legados estavam programados para serem descontinuados em 24 de julho de 2026. Use deepseek-v4-flash ou deepseek-v4-pro. Nosso guia sobre como usar a API DeepSeek V4 aborda a migração.
Posso usá-lo gratuitamente? A API da DeepSeek é paga conforme o uso, sem um nível gratuito permanente, mas o preço de acerto de cache torna a experimentação praticamente gratuita na prática. Veja como usar a API DeepSeek V4 gratuitamente para as opções atuais.
O V4-Flash funciona com Codex e a API de Respostas? Sim, ambos, e é o único modelo DeepSeek que o faz até agora. O suporte ao V4-Pro é esperado para o início de agosto de 2026. A configuração completa está em nosso guia da API de Respostas e Codex.
Conclusão
DeepSeek-V4-Flash-0731 é um tipo de lançamento discreto: mesmo nome de modelo, mesmos preços, mesma arquitetura e um conjunto de pontuações de benchmark de agente que agora superam o maior V4-Pro-Preview, pelo menos nos próprios testes da DeepSeek. O suporte à API de Respostas e a adaptação ao Codex sinalizam para onde este modelo está direcionado: cargas de trabalho de agente de alta concorrência a preços que superam qualquer laboratório ocidental.
Pegue uma chave, aponte seu SDK OpenAI para https://api.deepseek.com e submeta o modelo à sua própria suíte de testes antes de confiar na tabela de benchmarks. O Apidog torna esse ciclo de verificação rápido: salve seus prompts como casos de teste uma vez, execute-os novamente em cada atualização de modelo, e você nunca mais será surpreendido por uma atualização silenciosa.
