Enterrada no anúncio de lançamento do V4-Flash da DeepSeek de 31 de julho está a linha mais estrategicamente interessante: o V4-Flash oficial “suporta nativamente o formato Responses API e está totalmente adaptado para Codex.”
Leia novamente. Um laboratório chinês de código aberto acabou de implementar o formato de API mais recente da OpenAI, aquele que a OpenAI construiu para seus próprios produtos de agente, especificamente para que o próprio agente de codificação da OpenAI possa ser executado em um modelo DeepSeek. O registro de mudanças declara a motivação claramente: “Para atender à demanda por Codex, nossa API agora suporta o formato Responses API.”
Este artigo aborda o que isso significa na prática: quão compatível é a implementação, o que é silenciosamente ignorado, como conectar o V4-Flash ao Codex em dois minutos e onde estão as arestas. Se você precisa apenas da configuração básica da API primeiro, comece com nosso guia beta público do V4-Flash.
Por que a Responses API importa aqui
A OpenAI introduziu a Responses API como a sucessora do Chat Completions: uma única interface projetada para cargas de trabalho de agentes, com itens de raciocínio de primeira classe, ferramentas integradas e eventos de streaming semântico. Detalhamos o formato em Como usar a Responses API da OpenAI, mas a versão curta é: é o formato que a pilha de agentes da OpenAI, incluindo o Codex, fala nativamente.
Até agora, executar um modelo que não fosse da OpenAI por trás de um cliente da Responses API significava um proxy de tradução ou nada. A DeepSeek pulou o proxy e implementou o formato no lado do servidor em https://api.deepseek.com. Seu SDK existente da OpenAI funciona sem alterações:
# pip3 install openai
from openai import OpenAI
client = OpenAI(
api_key="<your DeepSeek API key>",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful assistant.",
input="Hi, how are you?",
)
print(response.output_text)
Uma observação de escopo antes que você se empolgue: a Responses API atualmente funciona apenas com deepseek-v4-flash. A DeepSeek informa que o suporte para deepseek-v4-pro chegará no início de agosto de 2026.

Quão completa é a compatibilidade?
A DeepSeek publicou uma matriz de compatibilidade completa, o que é mais do que a maioria dos provedores “compatíveis com OpenAI” se dão ao trabalho de fazer. As linhas importantes:
Suportado e funcionando:
inputeinstructions, em formato de string ou lista de itensstreamcom a sequência completa de eventos semânticostemperature,top_p,max_output_tokens,top_logprobstoolscom tiposfunctioneweb_search; a busca na web é executada no lado do servidortool_choiceincluindo forçar uma função específicareasoning.effortpara profundidade de pensamento
Aceito, mas inerte:
reasoning.summaryé aceito, mas nenhum resumo é geradotext.verbosityé aceito sem efeitoparallel_tool_callsé ignorado porque a chamada de ferramentas paralela está sempre ativada
Não suportado, por design:
previous_response_ideconversation: a API é stateless, então você gerencia o histórico da conversa e o envia como uma lista de itens de entradastore: toda resposta retorna comstore: falsebackground,metadata,include,service_tiere chaves de cache de prompt; o cache de contexto ocorre automaticamente
A parte elegante: parâmetros não suportados são silenciosamente ignorados em vez de rejeitados, então clientes existentes da Responses API se conectam sem modificação. A parte implacável: requisições que excedem a janela de contexto de 1M de tokens retornam um erro 400 em vez de serem truncadas.
O streaming segue o modelo de eventos da Responses API, de response.created até response.completed, com deltas de raciocínio (response.reasoning_text.delta) chegando como eventos separados do texto de saída. Não há terminador data: [DONE]; o stream termina com um evento response.completed, response.incomplete ou response.failed. Se o seu handler SSE esperar por [DONE], ele ficará travado. Nosso guia sobre streaming de respostas de API com server-sent events aborda padrões de parsing defensivos para exatamente esse tipo de diferença de dialeto.
Configurando o Codex com DeepSeek-V4-Flash
O Codex se comunica com os modelos através da Responses API, que é a principal razão desta versão existir. O guia de integração da DeepSeek oferece dois caminhos, e ambos configuram todos os clientes Codex de uma vez (CLI, aplicativo de desktop ChatGPT e a extensão do VS Code), já que eles compartilham uma única configuração.
O script de um clique
Certifique-se de que o Codex CLI ou o aplicativo de desktop ChatGPT esteja instalado e tenha sido executado pelo menos uma vez, então:
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
Usuários do Windows executam a variante PowerShell:
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
O script solicita sua chave de API DeepSeek na primeira execução e, em seguida, faz quatro coisas: faz backup do seu ~/.codex/config.toml existente para ~/.codex/backup-deepseek/, escreve um catálogo de modelos para ~/.codex/models.json, adiciona uma seção [model_providers.deepseek] à sua configuração, preservando os servidores MCP e as configurações de confiança do projeto, e valida a sintaxe antes de escrever qualquer coisa. Execute-o novamente a qualquer momento para alternar modelos ou restaurar sua configuração original a partir do menu.
A cautela padrão se aplica ao direcionar curl para bash: leia o script primeiro se essa for sua política. O comportamento de backup e validação é um bom sinal, mas ainda é um script de terceiros que acessa sua configuração do Codex.
O que o catálogo de modelos informa
O arquivo models.json que o script escreve vale a pena ser lido, pois documenta como a DeepSeek posiciona o modelo dentro do Codex:
- Janela de contexto: 1.048.576 tokens
- Níveis de raciocínio:
low,highemax, comhighcomo padrão - Chamadas de ferramentas paralelas suportadas
- Requer a versão do cliente Codex 0.144.0 ou mais recente
O catálogo descreve o V4-Flash como o “modelo de codificação agêntico de última geração”, e apenas o deepseek-v4-flash funciona hoje. O catálogo já inclui o deepseek-v4-pro para quando o suporte for lançado no início de agosto.
Será que realmente funciona bem dentro do Codex?
A proposta da DeepSeek é que o retreinamento de 31/07 foi direcionado exatamente para essa carga de trabalho. Seus números de agente publicados: Terminal Bench 2.1 com 82.7, Cybergym com 76.7, Toolathlon verificado com 70.3, DeepSWE com 54.4, todos relatados como superando o V4-Pro-Preview. Trate estes como números do fornecedor até que apareçam execuções independentes; eles foram produzidos com a própria estrutura de testes da DeepSeek com esforço máximo, e dois dos benchmarks no anúncio são conjuntos de testes internos.
A economia é mais difícil de contestar. A $0.14 por milhão de tokens de entrada (cache miss) e $0.28 por milhão de saída, o V4-Flash custa uma fração dos modelos que o Codex normalmente executa, e os acertos de cache reduzem o custo de entrada para $0.0028. Um dia de sessões intensivas de agente custa menos do que o café que você bebe durante ele. Para a tabela de custos completa, consulte a seção de preços do nosso guia beta. Se você está avaliando o próprio Codex contra alternativas, nossa comparação entre Claude Code e Codex CLI cobre o lado do agente da equação.
Verifique o endpoint antes de confiar no agente
Um agente é tão depurável quanto a API por trás dele, e um novo endpoint beta público merece um teste rigoroso antes de você liberar o Codex em um repositório real. Este é um trabalho de cinco minutos no Apidog:
- Adicione
POST https://api.deepseek.com/responsescomo um endpoint e armazene sua chave em uma variável de ambiente. - Envie um payload mínimo de
responses.createe confirme o formato dos itens de saída: um itemreasoningseguido por um itemmessage. - Ative
stream: truee observe a sequência de eventos ao vivo. O Apidog exibe cada evento SSE à medida que ele chega, o que torna óbvio se seu cliente deve estar ouvindo porresponse.output_text.deltaou esperando por algo que nunca vem. - Salve uma requisição com uma ferramenta
functionanexada e confirme se o formato de saída defunction_callcorresponde ao que seu handler espera.
Quando o lançamento do V4-Pro Responses acontecer em agosto, execute as mesmas requisições salvas contra o novo nome do modelo e compare o comportamento. Baixe o Apidog gratuitamente e mantenha todo o conjunto em um único projeto.
FAQ
Quais modelos DeepSeek funcionam com a Responses API? Apenas o deepseek-v4-flash hoje. O suporte ao deepseek-v4-pro está agendado para o início de agosto de 2026.
Preciso de um novo SDK? Não. O SDK oficial da OpenAI funciona; aponte base_url para https://api.deepseek.com e chame client.responses.create. Detalhes de configuração estão no nosso guia beta público do V4-Flash.
O estado multi-turn funciona como na versão da OpenAI? Não. A implementação da DeepSeek é stateless: previous_response_id, conversation e store não são suportados. Envie o histórico completo como itens de entrada em cada chamada.
Posso usar o DeepSeek no Codex junto com minha conta OpenAI? Sim. A configuração adiciona o DeepSeek como um provedor de modelo; o menu do script alterna entre os modelos, e sua configuração original é feita backup para que você possa restaurá-la.
Isso é o mesmo que a compatibilidade da API da Anthropic? Recurso separado. A DeepSeek também expõe um endpoint no formato Anthropic em https://api.deepseek.com/anthropic, que é como funciona a integração do Claude Code. O endpoint da Responses API existe para ferramentas de agente no formato OpenAI, como o Codex.
O que este lançamento realmente sinaliza
A qualidade dos modelos está convergindo, então a concorrência está se movendo para a camada de integração. A DeepSeek observou onde os desenvolvedores realmente trabalham, dentro de agentes como o Codex, e construiu a infraestrutura exata necessária para ser um backend direto lá, chegando a publicar quais parâmetros são silenciosamente ignorados. Essa transparência é rara e torna a história de compatibilidade crível.
A estratégia é óbvia e inteligente: a OpenAI fornece o agente, a DeepSeek serve os tokens por um décimo do preço. Se o modelo de 07/31 realmente supera o V4-Pro-Preview no seu codebase é algo que apenas suas próprias avaliações podem responder. Conecte-o ao Apidog, execute sua suíte de testes contra ambos e deixe os resultados, e não a tabela de benchmarks, decidirem.
