DeepSeek-V4-Flash API Lançada: Tutorial de Uso da API Oficial (Beta Pública)

DeepSeek-V4-Flash-0731 está disponível em beta público. Obtenha uma chave de API, faça sua primeira chamada, controle o modo de raciocínio e confira a precificação por acerto de cache neste guia prático.

Ashley Innocent

Ashley Innocent

31 julho 2026

DeepSeek-V4-Flash API Lançada: Tutorial de Uso da API Oficial (Beta Pública)

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

DeepSeek lançou a API oficial DeepSeek-V4-Flash esta manhã. O anúncio foi feito em 31 de julho de 2026, e as notas de lançamento deixam três coisas claras: as capacidades de agente do modelo receberam uma atualização séria, ele agora "fala" nativamente o formato de API de Respostas da OpenAI, e funciona com Codex desde o primeiro dia.

Se você tem chamado deepseek-v4-flash desde abril, você estava usando a versão de prévia. Este lançamento gradua o modelo para sua versão oficial, DeepSeek-V4-Flash-0731, e você obtém a atualização sem mudar uma única linha de código. O nome do modelo permanece o mesmo.

Este guia aborda tudo: como obter uma chave, fazer sua primeira chamada, ativar e desativar o modo de pensamento, e como funciona o preço da beta pública. Se você é novo na linha DeepSeek, comece com O Que É DeepSeek V4? para ter uma visão geral da família, e depois volte aqui.

💡
Depois de ter uma chave, você vai querer uma maneira rápida de testar os endpoints antes de incorporá-los ao código. O Apidog permite enviar requisições para a API DeepSeek, inspecionar respostas de streaming evento por evento e salvar cada chamada funcional como um teste reutilizável. Mais sobre essa configuração abaixo.
button

O que foi realmente lançado em 31 de julho

De acordo com o registro oficial de mudanças, o lançamento abrange apenas a API. O aplicativo DeepSeek e os modelos da web permanecem inalterados, e a API V4-Pro também não sofreu alterações. Aqui está o resumo:

Uma nota de honestidade: a alegação de benchmark principal ("superando em muito o V4-Pro-Preview") vem da própria avaliação da DeepSeek, e dois dos benchmarks listados (DSBench-FullStack e DSBench-Hard) são conjuntos de testes internos. Números independentes levarão alguns dias para aparecer.

Passo 1: Obtenha sua chave de API

Vá para a Plataforma DeepSeek, faça login e crie uma chave na página de Chaves de API. As chaves começam com sk-. Armazene-a como uma variável de ambiente em vez de codificá-la diretamente:

export DEEPSEEK_API_KEY="sk-your-key-here"

A API DeepSeek é compatível com os formatos de API da OpenAI e da Anthropic, então você não precisa de um SDK específico da DeepSeek. Duas URLs base importam:

Formato URL Base
Compatível com OpenAI https://api.deepseek.com
Compatível com Anthropic https://api.deepseek.com/anthropic

Passo 2: Faça sua primeira chamada

O teste de sanidade mais rápido é o curl:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {"role": "system", "content": "Você é um assistente útil."},
      {"role": "user", "content": "Resuma o que mudou no DeepSeek-V4-Flash-0731."}
    ],
    "stream": false
  }'

A mesma chamada através do SDK Python da OpenAI:

# pip3 install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "Você é um assistente útil."},
        {"role": "user", "content": "Escreva uma função Python que valide um endereço de e-mail."}
    ],
    stream=False
)

print(response.choices[0].message.content)

E Node.js:

// npm install openai
import OpenAI from "openai";

const openai = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await openai.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [{ role: "user", content: "Olá!" }],
});

console.log(completion.choices[0].message.content);

Como o nome do modelo deepseek-v4-flash agora aponta para o lançamento 0731, qualquer integração existente que você construiu para a versão de prévia passa a usar o novo modelo automaticamente. Nada a migrar.

Passo 3: Controle o modo de pensamento e o esforço de raciocínio

O V4-Flash suporta tanto um modo sem pensamento quanto um modo com pensamento, sendo o modo de pensamento o padrão. Você o controla com o parâmetro thinking, e pode ajustar a profundidade com reasoning_effort:

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Planeje uma migração de banco de dados do MySQL para o Postgres."}],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}}
)

Dois comportamentos importantes a saber antes de ajustar os parâmetros:

Para endpoints sensíveis à latência, como autocompletar, desative o pensamento. Para loops de agente e tarefas de depuração difíceis, mantenha-o ativado e aumente o nível de esforço.

Passo 4: Transmita a resposta

Defina stream: true e a API retornará eventos enviados pelo servidor (server-sent events). Se você nunca depurou payloads SSE antes, nosso guia sobre streaming de respostas de LLM com eventos enviados pelo servidor aborda o formato em detalhes.

stream = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Explique o pool de conexões."}],
    stream=True
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

Preços durante a beta pública

De acordo com a página oficial de Modelos e Preços, o V4-Flash permanece agressivamente barato:

Item deepseek-v4-flash deepseek-v4-pro
Entrada, acerto de cache (por 1M tokens) $0.0028 $0.003625
Entrada, erro de cache (por 1M tokens) $0.14 $0.435
Saída (por 1M tokens) $0.28 $0.87
Comprimento do contexto 1M tokens 1M tokens
Saída máxima 384K 384K
Limite de concorrência 2.500 500

Três observações sobre os preços:

Para ter uma visão mais completa dos custos em toda a família V4, incluindo o histórico do corte permanente de preços do V4-Pro, consulte nosso detalhamento de preços da API DeepSeek V4.

Teste e depure a API no Apidog

O curl bruto funciona para um teste rápido, mas no momento em que você está comparando a saída com e sem "pensamento", ou observando como o modelo transmite chamadas de ferramentas, você deseja visibilidade. Aqui está um fluxo de trabalho que leva cerca de cinco minutos no Apidog:

  1. Crie um projeto e adicione o endpoint. Adicione POST https://api.deepseek.com/chat/completions (ou importe uma especificação compatível com OpenAI para que todos os endpoints sejam importados de uma vez).
  2. Armazene a chave como uma variável de ambiente. Coloque DEEPSEEK_API_KEY em um ambiente Apidog e referencie-a no cabeçalho de Autorização como Bearer {{DEEPSEEK_API_KEY}}. Alternar entre uma chave de teste e uma chave de produção torna-se um clique em um menu suspenso.
  3. Envie e inspecione. Para chamadas de streaming, o Apidog renderiza os eventos SSE à medida que chegam, para que você possa observar o conteúdo de raciocínio e o conteúdo da resposta chegarem como deltas separados, em vez de analisar uma parede de linhas data: brutas.
  4. Salve variantes como casos de teste. Mantenha uma requisição salva com o pensamento ativado e outra sem, e depois execute ambas novamente após cada atualização do modelo. Quando a DeepSeek lançar a próxima atualização silenciosa para deepseek-v4-flash, você saberá com um clique se seus prompts ainda se comportam como esperado.

Baixe o Apidog gratuitamente, todo o fluxo acima funciona no plano gratuito.

Perguntas Frequentes

Preciso mudar meu código para usar o novo modelo? Não. O nome do modelo deepseek-v4-flash agora serve o DeepSeek-V4-Flash-0731. Integrações existentes são atualizadas automaticamente.

Este é o mesmo modelo do aplicativo DeepSeek? Não. A atualização de 31 de julho abrange apenas a API. O aplicativo e os modelos da web permanecem inalterados.

O que aconteceu com deepseek-chat e deepseek-reasoner? Esses nomes de modelos legados estavam programados para serem descontinuados em 24 de julho de 2026. Use deepseek-v4-flash ou deepseek-v4-pro. Nosso guia sobre como usar a API DeepSeek V4 aborda a migração.

Posso usá-lo gratuitamente? A API da DeepSeek é paga conforme o uso, sem um nível gratuito permanente, mas o preço de acerto de cache torna a experimentação praticamente gratuita na prática. Veja como usar a API DeepSeek V4 gratuitamente para as opções atuais.

O V4-Flash funciona com Codex e a API de Respostas? Sim, ambos, e é o único modelo DeepSeek que o faz até agora. O suporte ao V4-Pro é esperado para o início de agosto de 2026. A configuração completa está em nosso guia da API de Respostas e Codex.

Conclusão

DeepSeek-V4-Flash-0731 é um tipo de lançamento discreto: mesmo nome de modelo, mesmos preços, mesma arquitetura e um conjunto de pontuações de benchmark de agente que agora superam o maior V4-Pro-Preview, pelo menos nos próprios testes da DeepSeek. O suporte à API de Respostas e a adaptação ao Codex sinalizam para onde este modelo está direcionado: cargas de trabalho de agente de alta concorrência a preços que superam qualquer laboratório ocidental.

Pegue uma chave, aponte seu SDK OpenAI para https://api.deepseek.com e submeta o modelo à sua própria suíte de testes antes de confiar na tabela de benchmarks. O Apidog torna esse ciclo de verificação rápido: salve seus prompts como casos de teste uma vez, execute-os novamente em cada atualização de modelo, e você nunca mais será surpreendido por uma atualização silenciosa.

button

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs