DeepSeek-V4-Flash, 이제 Responses API 및 Codex 지원: 개발자 핵심 가이드

DeepSeek-V4-Flash는 이제 OpenAI의 Responses API를 지원하며 Codex 내에서 실행됩니다. 전체 호환성 매트릭스, 2분 설정, 그리고 피해야 할 주의 사항을 확인하세요.

Ashley Innocent

Ashley Innocent

31 July 2026

DeepSeek-V4-Flash, 이제 Responses API 및 Codex 지원: 개발자 핵심 가이드

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

DeepSeek의 7월 31일 V4-Flash 출시 발표 속에는 전략적으로 가장 흥미로운 문장이 숨겨져 있습니다: 공식 V4-Flash는 "Responses API 형식을 기본적으로 지원하며 Codex에 완전히 맞춰져 있습니다."

다시 읽어보세요. 한 중국 오픈웨이트 연구소가 OpenAI의 최신 API 형식을 구현했습니다. 이 형식은 OpenAI가 자체 에이전트 제품을 위해 구축한 것으로, 특히 OpenAI의 코딩 에이전트가 DeepSeek 모델에서 실행될 수 있도록 하기 위함입니다. 변경 로그는 그 동기를 분명히 밝히고 있습니다: "Codex에 대한 요구를 충족시키기 위해, 저희 API는 이제 Responses API 형식을 지원합니다."

이 글에서는 이것이 실제적으로 무엇을 의미하는지 다룹니다: 구현의 호환성, 조용히 무시되는 부분, V4-Flash를 2분 안에 Codex에 연결하는 방법, 그리고 주의할 점들입니다. 기본적인 API 설정이 먼저 필요하다면, V4-Flash 공개 베타 가이드부터 시작하십시오.

버튼

여기서 Responses API가 중요한 이유

OpenAI는 Chat Completions의 후속으로 Responses API를 도입했습니다. 이는 에이전트 워크로드를 위해 설계된 단일 인터페이스로, 일류 추론 항목, 내장 도구 및 의미론적 스트리밍 이벤트를 포함합니다. 우리는 OpenAI Responses API 사용 방법에서 이 형식을 자세히 설명하지만, 요약하자면 OpenAI의 에이전트 스택(Codex 포함)이 기본적으로 사용하는 형식입니다.

지금까지는 Responses API 클라이언트 뒤에서 OpenAI가 아닌 모델을 실행하려면 번역 프록시를 사용하거나 아무것도 할 수 없었습니다. DeepSeek은 프록시를 건너뛰고 https://api.deepseek.com에서 서버 측으로 형식을 구현했습니다. 기존 OpenAI SDK는 변경 없이 작동합니다:

# pip3 install openai
from openai import OpenAI

client = OpenAI(
    api_key="<your DeepSeek API key>",
    base_url="https://api.deepseek.com"
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful assistant.",
    input="Hi, how are you?",
)

print(response.output_text)

흥분하기 전에 한 가지 주의할 점: Responses API는 현재 deepseek-v4-flash에서만 작동합니다. DeepSeek은 deepseek-v4-pro 지원이 2026년 8월 초에 제공될 것이라고 말합니다.

호환성은 얼마나 완벽한가요?

DeepSeek은 완벽한 호환성 매트릭스를 공개했는데, 이는 대부분의 "OpenAI 호환" 제공업체가 신경 쓰지 않는 부분입니다. 중요한 행은 다음과 같습니다:

지원 및 작동:

허용되지만 비활성:

설계상 지원되지 않음:

우아한 부분: 지원되지 않는 매개변수는 거부되지 않고 조용히 무시되므로, 기존 Responses API 클라이언트는 수정 없이 연결됩니다. 가혹한 부분: 1M 토큰 컨텍스트 창을 초과하는 요청은 잘리지 않고 400 오류를 반환합니다.

스트리밍은 response.created부터 response.completed까지 Responses API 이벤트 모델을 따르며, 추론 델타(response.reasoning_text.delta)는 출력 텍스트와 별도의 이벤트로 도착합니다. data: [DONE] 종료자는 없으며, 스트림은 response.completed, response.incomplete 또는 response.failed 이벤트로 끝납니다. SSE 핸들러가 [DONE]을 기다리면 멈출 것입니다. 서버 전송 이벤트로 API 응답 스트리밍에 대한 저희 가이드는 이러한 종류의 방언 차이에 대한 방어적 파싱 패턴을 다룹니다.

DeepSeek-V4-Flash로 Codex 설정하기

Codex는 Responses API를 통해 모델과 통신하며, 이것이 이 릴리스가 존재하는 모든 이유입니다. DeepSeek의 통합 가이드는 두 가지 경로를 제공하며, 두 경로 모두 하나의 구성을 공유하므로 모든 Codex 클라이언트(CLI, ChatGPT 데스크톱 앱 및 VS Code 확장)를 한 번에 구성합니다.

원클릭 스크립트

Codex CLI 또는 ChatGPT 데스크톱 앱이 설치되어 있고 최소 한 번 실행되었는지 확인한 다음:

bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)

Windows 사용자는 PowerShell 버전을 실행합니다:

irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

스크립트는 첫 실행 시 DeepSeek API 키를 요청한 다음 네 가지 작업을 수행합니다: 기존 ~/.codex/config.toml~/.codex/backup-deepseek/로 백업하고, 모델 카탈로그를 ~/.codex/models.json에 작성하고, MCP 서버 및 프로젝트 신뢰 설정을 보존하면서 구성에 [model_providers.deepseek] 섹션을 추가하고, 아무것도 작성하기 전에 구문을 검증합니다. 언제든지 다시 실행하여 모델을 전환하거나 메뉴에서 원래 설정을 복원할 수 있습니다.

curl을 bash로 파이핑하는 데는 일반적인 주의 사항이 적용됩니다: 정책에 따라 스크립트를 먼저 읽으십시오. 백업 및 검증 동작은 좋은 신호이지만, 여전히 Codex 구성을 건드리는 타사 스크립트입니다.

모델 카탈로그가 알려주는 것

스크립트가 작성하는 models.json은 DeepSeek이 Codex 내에서 모델을 어떻게 배치하는지 문서화하므로 읽어볼 가치가 있습니다:

카탈로그는 V4-Flash를 "최신 프론티어 에이전트 코딩 모델"이라고 설명하며, 오늘날에는 deepseek-v4-flash만 작동합니다. 카탈로그는 8월 초에 지원이 시작될 때를 대비하여 이미 deepseek-v4-pro를 포함하고 있습니다.

정말로 Codex 내에서 잘 작동할까?

DeepSeek의 주장은 0731 재사후 훈련이 바로 이러한 워크로드를 목표로 했다는 것입니다. 그들이 발표한 에이전트 수치: Terminal Bench 2.1에서 82.7, Cybergym에서 76.7, Toolathlon에서 70.3 검증, DeepSWE에서 54.4로, 모두 V4-Pro-Preview를 능가한다고 보고되었습니다. 독립적인 실행 결과가 나올 때까지는 이를 공급업체 수치로 취급하십시오. 이 수치들은 DeepSeek 자체 하네스를 사용하여 최대 노력으로 생성되었으며, 발표의 벤치마크 중 두 가지는 내부 테스트 세트입니다.

경제성은 논쟁하기 더 어렵습니다. 백만 입력 토큰당 $0.14(캐시 미스) 및 백만 출력 토큰당 $0.28로, V4-Flash는 Codex가 일반적으로 실행하는 모델 비용의 일부에 불과하며, 캐시 히트는 입력 비용을 $0.0028로 낮춥니다. 하루 종일 에이전트 세션을 집중적으로 사용해도 그동안 마시는 커피 한 잔보다 비용이 적게 듭니다. 전체 비용표는 베타 가이드의 가격 섹션을 참조하십시오. Codex 자체와 대안을 비교하고 있다면, Claude Code vs Codex CLI 비교가 에이전트 측면을 다룹니다.

에이전트를 신뢰하기 전에 엔드포인트를 확인하세요

에이전트는 그 뒤에 있는 API만큼만 디버깅할 수 있으며, 완전히 새로운 공개 베타 엔드포인트는 Codex를 실제 저장소에 적용하기 전에 흔들어볼 가치가 있습니다. Apidog에서 5분이면 할 수 있는 작업입니다:

  1. POST https://api.deepseek.com/responses를 엔드포인트로 추가하고 환경 변수에 키를 저장합니다.
  2. 최소한의 responses.create 페이로드를 보내고 출력 항목의 형태를 확인합니다: reasoning 항목 다음에 message 항목이 옵니다.
  3. stream: true를 켜고 이벤트 시퀀스를 실시간으로 관찰합니다. Apidog은 각 SSE 이벤트가 도착할 때 표시하므로, 클라이언트가 response.output_text.delta를 수신해야 하는지 아니면 결코 오지 않을 것을 기다려야 하는지 명확하게 알 수 있습니다.
  4. function 도구가 첨부된 요청을 저장하고 function_call 출력 형식이 핸들러가 예상하는 것과 일치하는지 확인합니다.

8월에 V4-Pro Responses 출시가 이루어지면, 새로운 모델 이름을 대상으로 동일하게 저장된 요청을 다시 실행하고 동작을 비교하십시오. Apidog을 무료로 다운로드하여 전체 스위트를 하나의 프로젝트에 보관하세요.

자주 묻는 질문 (FAQ)

Responses API와 함께 작동하는 DeepSeek 모델은 무엇인가요? 현재는 deepseek-v4-flash만 해당됩니다. deepseek-v4-pro 지원은 2026년 8월 초로 예정되어 있습니다.

새로운 SDK가 필요한가요? 아니요. 공식 OpenAI SDK가 작동합니다. base_urlhttps://api.deepseek.com으로 지정하고 client.responses.create를 호출하면 됩니다. 설정 세부 정보는 V4-Flash 공개 베타 가이드에 있습니다.

멀티턴 상태가 OpenAI 버전처럼 작동하나요? 아니요. DeepSeek 구현은 상태 비저장입니다: previous_response_id, conversation, store는 지원되지 않습니다. 모든 호출에서 전체 기록을 입력 항목으로 보내야 합니다.

OpenAI 계정과 함께 Codex에서 DeepSeek을 사용할 수 있나요? 네. 설정은 DeepSeek을 모델 제공업체로 추가합니다. 스크립트 메뉴에서 모델을 전환할 수 있으며, 원래 구성은 백업되어 복원할 수 있습니다.

이것이 Anthropic API 호환성과 동일한가요? 별도의 기능입니다. DeepSeek은 https://api.deepseek.com/anthropic에 Anthropic 형식 엔드포인트도 노출하며, 이는 Claude Code 통합이 작동하는 방식입니다. Responses API 엔드포인트는 Codex와 같은 OpenAI 형식 에이전트 도구를 위해 존재합니다.

이 릴리스가 정말로 의미하는 것

모델 품질은 수렴하고 있으므로, 경쟁은 통합 레이어로 이동하고 있습니다. DeepSeek은 개발자들이 실제로 Codex와 같은 에이전트 내부에서 작업하는 곳을 보고, 그곳에 드롭인 백엔드가 되기 위해 필요한 정확한 배관을 구축했으며, 어떤 매개변수가 조용히 무시되는지까지 공개했습니다. 이러한 투명성은 드물며, 호환성 스토리를 신뢰할 수 있게 만듭니다.

이 전략은 명확하고 현명합니다: OpenAI는 에이전트를 제공하고, DeepSeek은 10분의 1 가격으로 토큰을 제공합니다. 0731 모델이 코드베이스에서 V4-Pro-Preview를 진정으로 능가하는지 여부는 오직 당신 자신의 평가만이 답할 수 있습니다. Apidog에 연결하고, 두 가지에 대해 테스트 스위트를 실행한 다음, 벤치마크 표가 아닌 결과가 결정하게 하십시오.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요