Como Usar a API DeepSeek-V4.1-Flash?

Chamar a API DeepSeek-V4.1-Flash: ID do modelo deepseek-flash, URLs base, primeira chamada em curl/Python/Node, esforço de raciocínio, entrada de imagem, streaming, preços.

INEZA Felin-Michel

INEZA Felin-Michel

10 setembro 2026

Como Usar a API DeepSeek-V4.1-Flash?

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

DeepSeek-V4.1-Flash foi disponibilizado (GA) na API hoje, 10 de setembro de 2026. A nota de lançamento é curta, mas altera três coisas para quem chama a API DeepSeek: há um único ID de modelo para usar a partir de agora, deepseek-flash; as taxas por token caíram novamente; e em quatro dias, em 14 de setembro, toda requisição para deepseek-v4-pro será redirecionada para este modelo e cobrada com os preços Flash.

Esse último ponto é a razão pela qual este guia existe. Se você tem código em produção no V4-Pro, você não poderá escolher uma data de migração. Se você está no V4-Flash, já está sendo atendido pelo novo modelo sob o nome antigo. De qualquer forma, vale a pena verificar os parâmetros que você envia hoje.

Este post aborda o lado prático: ID do modelo, URLs base, uma primeira chamada em três idiomas, esforço de raciocínio, entrada de imagem, streaming e precificação. Para a arquitetura e a história dos benchmarks, leia O que é DeepSeek-V4.1-Flash primeiro.

Antes de conectar qualquer coisa ao código, você vai querer uma maneira rápida de enviar requisições e comparar respostas. O Apidog cuida disso: aponte-o para https://api.deepseek.com, armazene a chave como uma variável e salve cada chamada funcional como um teste reutilizável. O fluxo de trabalho está perto do final.

botão

Em Resumo

O que mudou para os usuários da API

Aqui está a diferença, extraída da nota de lançamento e do registro de alterações.

Um ID de modelo. O nome canônico agora é deepseek-flash, sem a versão. Fixe seus prompts e testes ao comportamento, não a uma string de versão, porque a próxima versão Flash será lançada sob o mesmo nome.

Nomes legados ainda redirecionam. deepseek-v4-flash e deepseek-v4-flash-vision-exp são aceitos por enquanto, mas os modelos por trás deles, V4-Flash e V4-Flash-Vision-Exp, foram desativados. Requisições para esses nomes são atendidas pelo V4.1-Flash. Nada quebra, mas você não estará executando o modelo que pensa. Renomeie quando puder.

O nome beta foi removido. O beta de dois dias de 8 de setembro rodou como deepseek-v4.1-flash-expires-on-0910. Ele expirou conforme prometido. Mude para deepseek-flash.

URLs base e formatos inalterados. Chamadas compatíveis com OpenAI vão para https://api.deepseek.com, chamadas compatíveis com Anthropic vão para https://api.deepseek.com/anthropic, e o formato de API de Respostas que a linha Flash já suportava é mantido. A configuração do seu SDK não muda.

O V4-Pro tem quatro dias. A partir de 14 de setembro de 2026 às 04:00 UTC (12:00 Beijing), toda requisição deepseek-v4-pro será redirecionada para o V4.1-Flash e cobrada com as taxas do V4.1-Flash. A razão declarada da DeepSeek é que o V4.1-Flash "superou de forma abrangente o V4 Pro em desempenho, custo, velocidade e tempo total", citando testes de múltiplas partes. Essa é uma alegação do fornecedor. O guia de migração para aposentadoria do V4-Pro mostra como verificar isso em seus próprios prompts antes que a mudança aconteça para você.

Passo 1: obtenha uma chave

Faça login na plataforma DeepSeek, abra Chaves API e crie uma. As chaves começam com sk-. Exporte-a em vez de colá-la no código-fonte:

export DEEPSEEK_API_KEY="sk-sua-chave-aqui"

Nenhum SDK específico do DeepSeek é necessário. As bibliotecas cliente OpenAI e Anthropic funcionam assim que você muda a URL base.

Passo 2: faça sua primeira chamada

Curl primeiro, porque ele remove todas as variáveis, exceto a própria API:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {"role": "system", "content": "Você é um engenheiro de suporte para uma API de pagamentos."},
      {"role": "user", "content": "Um cliente recebe HTTP 402 em /v1/charges. Liste as três causas mais prováveis."}
    ],
    "stream": false
  }'

A mesma chamada através do SDK Python da OpenAI:

# pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "system", "content": "Você é um engenheiro de suporte para uma API de pagamentos."},
        {"role": "user", "content": "Um cliente recebe HTTP 402 em /v1/charges. Liste as três causas mais prováveis."},
    ],
)

print(response.choices[0].message.content)

E Node:

// npm install openai
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await client.chat.completions.create({
  model: "deepseek-flash",
  messages: [
    { role: "user", content: "Escreva uma migração Postgres que adicione um timestamp nullable refunded_at a faturas." },
  ],
});

console.log(completion.choices[0].message.content);

Se você configurou para a versão anterior seguindo o guia da API V4-Flash, a única diferença é a string do modelo.

Passo 3: esforço de raciocínio e modo de pensamento

A ficha do modelo descreve o esforço de raciocínio como "controlável continuamente" em uma escala de 1 a 100. Isso é um afastamento dos presets baixo/médio/alto que a maioria das APIs expõe, e significa que você pode ajustar o custo e a latência por endpoint em vez de por nível.

A forma do parâmetro que carrega esse valor de 1 a 100 é [VERIFICAR] contra a documentação da API. Até que eles confirmem, comece pelo padrão V4-Flash: reasoning_effort mais um objeto thinking passado através de extra_body:

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Nosso cluster Redis perde 2% dos SETs sob carga. Planeje a investigação."}],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}},
)

Configurações de amostragem recomendadas da ficha do modelo: temperature 1.0, top_p 0.95 ou 1.0, e max_tokens de 256K ou mais para longos rastros de raciocínio. A saída máxima é de 384K tokens.

Uma divisão prática: pensamento desativado para preenchimento automático, classificação e qualquer coisa que um usuário esteja esperando; pensamento ativado em alto esforço para loops de agentes, refatorações multi-arquivo e depuração. Então meça. Esforço que você não pode ver na saída é esforço pelo qual você está pagando de qualquer forma.

Passo 4: envie uma imagem

O V4.1-Flash é nativamente multimodal, treinado em um corpus multimodal de 45T tokens com um encoder DeepSeek-ViT treinado do zero. O formato da requisição é herdado do V4-Flash-Vision-Exp: imagens são partes do array content da mensagem do usuário.

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Extraia cada item de linha e o total deste recibo como JSON."},
            {"type": "image_url", "image_url": {"url": "https://cdn.example-shop.com/receipts/48213.png"}},
        ],
    }],
)

Para um arquivo local, codifique-o como uma URL de dados base64:

import base64

with open("receipt.png", "rb") as f:
    data_url = "data:image/png;base64," + base64.b64encode(f.read()).decode()

# então passe {"url": data_url} na parte image_url

Limites: URLs de dados base64 de até 32 MiB, URLs externas de até 8.192 caracteres, ou um ID de arquivo. Um campo detail opcional é aceito. A DeepSeek relata DocVQA 95.6, que é o caso de leitura de documentos acima. O guia da API de visão cobre prompts multi-imagem, níveis de detalhe e quanto as imagens custam por requisição.

Passo 5: transmita a resposta

Defina stream=True e o endpoint retornará eventos enviados pelo servidor. Conteúdo de raciocínio e conteúdo da resposta chegam como deltas separados, o que importa quando você está renderizando um estado de "pensamento" em uma UI.

stream = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Explique chaves de idempotência em um parágrafo."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    if delta.content:
        print(delta.content, end="", flush=True)

Se SSE é novo para você, o streaming de respostas LLM com eventos enviados pelo servidor explica o formato de comunicação e os casos de borda de reconexão.

Preços em um relance

Da página oficial de preços, com efeito a partir de 10 de setembro de 2026 às 04:00 UTC, em USD por 1M tokens:

deepseek-flash fora do pico deepseek-flash pico
Entrada, acerto de cache $0.003 $0.006
Entrada, erro de cache $0.15 $0.30
Saída $0.60 $1.20

Três coisas a saber:

Teste a API no Apidog

Uma vez que a primeira chamada funciona, a questão é se ela continua funcionando. O deepseek-flash não possui versão, então a próxima atualização será silenciosa. Aqui está um fluxo de trabalho do Apidog que o detecta:

  1. Adicione o endpoint. Crie POST https://api.deepseek.com/chat/completions, ou importe uma especificação OpenAPI compatível com OpenAI para que cada rota chegue de uma vez.
  2. Armazene a chave como uma variável de ambiente. Coloque DEEPSEEK_API_KEY em um ambiente Apidog e defina o cabeçalho como Bearer {{DEEPSEEK_API_KEY}}. Alternar entre uma chave pessoal e a chave de produção se torna um menu suspenso.
  3. Salve uma requisição por nível de esforço. Duplique a requisição base em variantes: pensamento desativado, pensamento ativado em baixo esforço, pensamento ativado em alto esforço. Mesmo prompt, parâmetros diferentes. Envie todos os três e compare o uso de tokens e a latência lado a lado.
  4. Assista ao stream. Para stream: true, o Apidog renderiza eventos SSE à medida que chegam, então deltas de raciocínio e deltas de conteúdo aparecem como linhas separadas em vez de uma parede de prefixos data:.
  5. Transforme as variantes em um cenário de teste. Adicione asserções no código de status, na contagem de acertos de cache no usage sendo maior que zero na segunda execução, e na resposta contendo os campos que seu aplicativo analisa. Rexecute o cenário após cada atualização do modelo, e em 14 de setembro, quando o redirecionamento V4-Pro entrar em vigor.
  6. Execute-o na CI. O apidog-cli executa o mesmo cenário a partir de um pipeline, então uma mudança silenciosa do modelo falha na construção em vez de falhar para um cliente.

Baixe o Apidog e toda a configuração leva cerca de dez minutos.

FAQ

Eu tenho que renomear deepseek-v4-flash para deepseek-flash? Não hoje. O nome legado ainda redireciona para o V4.1-Flash. Mas o V4-Flash em si foi desativado, e a DeepSeek não disse quando o apelido será removido. Renomeie na sua próxima implantação.

O que acontece com o meu código V4-Pro em 14 de setembro? Nada quebra. Requisições para deepseek-v4-pro são respondidas pelo V4.1-Flash e cobradas com as taxas Flash a partir das 04:00 UTC. Suas saídas podem mudar, no entanto, então execute seu conjunto de avaliação antes dessa data. O guia de migração possui uma lista de verificação.

O endpoint compatível com Anthropic suporta o novo modelo? Sim. https://api.deepseek.com/anthropic está inalterado; use deepseek-flash como o nome do modelo lá também.

Existe um plano gratuito? A API é paga conforme o uso, sem um plano gratuito permanente. Os pesos são licenciados pelo MIT no Hugging Face se você quiser auto-hospedar. As opções atuais estão reunidas em como usar a API DeepSeek V4 gratuitamente.

Quão rápido é? A DeepSeek não publicou um número de tokens por segundo. Um usuário do X relatou "quase 400 t/s" em testes de vídeo, o que é uma anedota, não uma especificação. Meça em seus próprios prompts durante um período de pico.

Antes do redirecionamento

A superfície da API mal se moveu: as mesmas URLs base, o mesmo formato de requisição, um novo ID de modelo. O que mudou foi o preço e, em 14 de setembro, o roteamento de cada chamada V4-Pro. Renomeie deepseek-v4-flash para deepseek-flash, escolha um nível de esforço por endpoint e execute seus prompts através do novo modelo antes que a DeepSeek faça isso por você.

Salve esses prompts como testes enquanto estiver nisso. O Apidog os executa novamente com um clique, e a próxima atualização silenciosa do Flash aparecerá como uma asserção falha em vez de um ticket de suporte.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs