DeepSeek-V4-Flash Agora Suporta a API de Respostas e o Codex: O Que Desenvolvedores Precisam Saber

DeepSeek-V4-Flash agora suporta a API de Respostas da OpenAI e roda dentro do Codex. Confira a matriz de compatibilidade completa, a configuração de 2 minutos e os pontos críticos a evitar.

Ashley Innocent

Ashley Innocent

31 julho 2026

DeepSeek-V4-Flash Agora Suporta a API de Respostas e o Codex: O Que Desenvolvedores Precisam Saber

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Enterrada no anúncio de lançamento do V4-Flash da DeepSeek de 31 de julho está a linha mais estrategicamente interessante: o V4-Flash oficial “suporta nativamente o formato Responses API e está totalmente adaptado para Codex.”

Leia novamente. Um laboratório chinês de código aberto acabou de implementar o formato de API mais recente da OpenAI, aquele que a OpenAI construiu para seus próprios produtos de agente, especificamente para que o próprio agente de codificação da OpenAI possa ser executado em um modelo DeepSeek. O registro de mudanças declara a motivação claramente: “Para atender à demanda por Codex, nossa API agora suporta o formato Responses API.”

Este artigo aborda o que isso significa na prática: quão compatível é a implementação, o que é silenciosamente ignorado, como conectar o V4-Flash ao Codex em dois minutos e onde estão as arestas. Se você precisa apenas da configuração básica da API primeiro, comece com nosso guia beta público do V4-Flash.

botão

Por que a Responses API importa aqui

A OpenAI introduziu a Responses API como a sucessora do Chat Completions: uma única interface projetada para cargas de trabalho de agentes, com itens de raciocínio de primeira classe, ferramentas integradas e eventos de streaming semântico. Detalhamos o formato em Como usar a Responses API da OpenAI, mas a versão curta é: é o formato que a pilha de agentes da OpenAI, incluindo o Codex, fala nativamente.

Até agora, executar um modelo que não fosse da OpenAI por trás de um cliente da Responses API significava um proxy de tradução ou nada. A DeepSeek pulou o proxy e implementou o formato no lado do servidor em https://api.deepseek.com. Seu SDK existente da OpenAI funciona sem alterações:

# pip3 install openai
from openai import OpenAI

client = OpenAI(
    api_key="<your DeepSeek API key>",
    base_url="https://api.deepseek.com"
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful assistant.",
    input="Hi, how are you?",
)

print(response.output_text)

Uma observação de escopo antes que você se empolgue: a Responses API atualmente funciona apenas com deepseek-v4-flash. A DeepSeek informa que o suporte para deepseek-v4-pro chegará no início de agosto de 2026.

Quão completa é a compatibilidade?

A DeepSeek publicou uma matriz de compatibilidade completa, o que é mais do que a maioria dos provedores “compatíveis com OpenAI” se dão ao trabalho de fazer. As linhas importantes:

Suportado e funcionando:

Aceito, mas inerte:

Não suportado, por design:

A parte elegante: parâmetros não suportados são silenciosamente ignorados em vez de rejeitados, então clientes existentes da Responses API se conectam sem modificação. A parte implacável: requisições que excedem a janela de contexto de 1M de tokens retornam um erro 400 em vez de serem truncadas.

O streaming segue o modelo de eventos da Responses API, de response.created até response.completed, com deltas de raciocínio (response.reasoning_text.delta) chegando como eventos separados do texto de saída. Não há terminador data: [DONE]; o stream termina com um evento response.completed, response.incomplete ou response.failed. Se o seu handler SSE esperar por [DONE], ele ficará travado. Nosso guia sobre streaming de respostas de API com server-sent events aborda padrões de parsing defensivos para exatamente esse tipo de diferença de dialeto.

Configurando o Codex com DeepSeek-V4-Flash

O Codex se comunica com os modelos através da Responses API, que é a principal razão desta versão existir. O guia de integração da DeepSeek oferece dois caminhos, e ambos configuram todos os clientes Codex de uma vez (CLI, aplicativo de desktop ChatGPT e a extensão do VS Code), já que eles compartilham uma única configuração.

O script de um clique

Certifique-se de que o Codex CLI ou o aplicativo de desktop ChatGPT esteja instalado e tenha sido executado pelo menos uma vez, então:

bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)

Usuários do Windows executam a variante PowerShell:

irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

O script solicita sua chave de API DeepSeek na primeira execução e, em seguida, faz quatro coisas: faz backup do seu ~/.codex/config.toml existente para ~/.codex/backup-deepseek/, escreve um catálogo de modelos para ~/.codex/models.json, adiciona uma seção [model_providers.deepseek] à sua configuração, preservando os servidores MCP e as configurações de confiança do projeto, e valida a sintaxe antes de escrever qualquer coisa. Execute-o novamente a qualquer momento para alternar modelos ou restaurar sua configuração original a partir do menu.

A cautela padrão se aplica ao direcionar curl para bash: leia o script primeiro se essa for sua política. O comportamento de backup e validação é um bom sinal, mas ainda é um script de terceiros que acessa sua configuração do Codex.

O que o catálogo de modelos informa

O arquivo models.json que o script escreve vale a pena ser lido, pois documenta como a DeepSeek posiciona o modelo dentro do Codex:

O catálogo descreve o V4-Flash como o “modelo de codificação agêntico de última geração”, e apenas o deepseek-v4-flash funciona hoje. O catálogo já inclui o deepseek-v4-pro para quando o suporte for lançado no início de agosto.

Será que realmente funciona bem dentro do Codex?

A proposta da DeepSeek é que o retreinamento de 31/07 foi direcionado exatamente para essa carga de trabalho. Seus números de agente publicados: Terminal Bench 2.1 com 82.7, Cybergym com 76.7, Toolathlon verificado com 70.3, DeepSWE com 54.4, todos relatados como superando o V4-Pro-Preview. Trate estes como números do fornecedor até que apareçam execuções independentes; eles foram produzidos com a própria estrutura de testes da DeepSeek com esforço máximo, e dois dos benchmarks no anúncio são conjuntos de testes internos.

A economia é mais difícil de contestar. A $0.14 por milhão de tokens de entrada (cache miss) e $0.28 por milhão de saída, o V4-Flash custa uma fração dos modelos que o Codex normalmente executa, e os acertos de cache reduzem o custo de entrada para $0.0028. Um dia de sessões intensivas de agente custa menos do que o café que você bebe durante ele. Para a tabela de custos completa, consulte a seção de preços do nosso guia beta. Se você está avaliando o próprio Codex contra alternativas, nossa comparação entre Claude Code e Codex CLI cobre o lado do agente da equação.

Verifique o endpoint antes de confiar no agente

Um agente é tão depurável quanto a API por trás dele, e um novo endpoint beta público merece um teste rigoroso antes de você liberar o Codex em um repositório real. Este é um trabalho de cinco minutos no Apidog:

  1. Adicione POST https://api.deepseek.com/responses como um endpoint e armazene sua chave em uma variável de ambiente.
  2. Envie um payload mínimo de responses.create e confirme o formato dos itens de saída: um item reasoning seguido por um item message.
  3. Ative stream: true e observe a sequência de eventos ao vivo. O Apidog exibe cada evento SSE à medida que ele chega, o que torna óbvio se seu cliente deve estar ouvindo por response.output_text.delta ou esperando por algo que nunca vem.
  4. Salve uma requisição com uma ferramenta function anexada e confirme se o formato de saída de function_call corresponde ao que seu handler espera.

Quando o lançamento do V4-Pro Responses acontecer em agosto, execute as mesmas requisições salvas contra o novo nome do modelo e compare o comportamento. Baixe o Apidog gratuitamente e mantenha todo o conjunto em um único projeto.

FAQ

Quais modelos DeepSeek funcionam com a Responses API? Apenas o deepseek-v4-flash hoje. O suporte ao deepseek-v4-pro está agendado para o início de agosto de 2026.

Preciso de um novo SDK? Não. O SDK oficial da OpenAI funciona; aponte base_url para https://api.deepseek.com e chame client.responses.create. Detalhes de configuração estão no nosso guia beta público do V4-Flash.

O estado multi-turn funciona como na versão da OpenAI? Não. A implementação da DeepSeek é stateless: previous_response_id, conversation e store não são suportados. Envie o histórico completo como itens de entrada em cada chamada.

Posso usar o DeepSeek no Codex junto com minha conta OpenAI? Sim. A configuração adiciona o DeepSeek como um provedor de modelo; o menu do script alterna entre os modelos, e sua configuração original é feita backup para que você possa restaurá-la.

Isso é o mesmo que a compatibilidade da API da Anthropic? Recurso separado. A DeepSeek também expõe um endpoint no formato Anthropic em https://api.deepseek.com/anthropic, que é como funciona a integração do Claude Code. O endpoint da Responses API existe para ferramentas de agente no formato OpenAI, como o Codex.

O que este lançamento realmente sinaliza

A qualidade dos modelos está convergindo, então a concorrência está se movendo para a camada de integração. A DeepSeek observou onde os desenvolvedores realmente trabalham, dentro de agentes como o Codex, e construiu a infraestrutura exata necessária para ser um backend direto lá, chegando a publicar quais parâmetros são silenciosamente ignorados. Essa transparência é rara e torna a história de compatibilidade crível.

A estratégia é óbvia e inteligente: a OpenAI fornece o agente, a DeepSeek serve os tokens por um décimo do preço. Se o modelo de 07/31 realmente supera o V4-Pro-Preview no seu codebase é algo que apenas suas próprias avaliações podem responder. Conecte-o ao Apidog, execute sua suíte de testes contra ambos e deixe os resultados, e não a tabela de benchmarks, decidirem.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs