딥시크(DeepSeek)는 오늘 아침 공식 DeepSeek-V4-Flash API를 출시했습니다. 발표는 2026년 7월 31일에 있었으며, 릴리스 노트는 세 가지를 명확히 합니다: 모델의 에이전트 기능이 심각하게 업그레이드되었고, 이제 OpenAI의 Responses API 형식을 기본적으로 지원하며, 첫날부터 Codex와 함께 작동합니다.
4월부터 deepseek-v4-flash를 호출해왔다면, 프리뷰 버전을 사용하고 계셨을 것입니다. 이번 릴리스는 모델을 공식 버전인 DeepSeek-V4-Flash-0731로 격상시키며, 코드를 한 줄도 변경하지 않고 업그레이드를 받을 수 있습니다. 모델 이름은 동일하게 유지됩니다.
이 가이드는 키 발급, 첫 호출, 사고 모드 켜고 끄기, 공개 베타 가격 등 모든 것을 안내합니다. 딥시크 라인업이 처음이라면, 전반적인 내용을 보려면 DeepSeek V4란 무엇인가?부터 시작한 다음 여기로 돌아오세요.
7월 31일에 실제로 출시된 것
공식 변경 로그에 따르면, 이번 릴리스는 API만 해당됩니다. DeepSeek 앱 및 웹 모델은 변경되지 않았으며, V4-Pro API도 변경되지 않았습니다. 요약은 다음과 같습니다:
- DeepSeek-V4-Flash-0731은 현재 API에서 공개 베타 중인 V4-Flash 라인의 공식 릴리스입니다.
- V4-Flash-Preview와 동일한 아키텍처 및 크기입니다. 딥시크는 모델이 재사후 학습되었을 뿐이므로, 개선 사항은 더 큰 네트워크가 아닌 학습에서 비롯된 것이라고 말합니다.
- 에이전트 벤치마크가 V4-Pro-Preview를 넘어섰습니다. 딥시크는 Terminal Bench 2.1에서 82.7, Cybergym에서 76.7, Toolathlon 검증에서 70.3, DeepSWE에서 54.4를 기록했다고 보고합니다. 이는 딥시크 자체적으로 공개한 수치이며, 최대 노력으로 자체 하네스를 사용하여 테스트되었습니다.
- 네이티브 Responses API 지원 및 공식 Codex 통합. 자세한 내용은 DeepSeek-V4-Flash가 이제 Responses API와 Codex를 지원합니다에서 다룹니다.
- 변경 로그에 따르면 DeepSeek-V4-Pro의 공식 릴리스는 "곧 출시될 예정"입니다. V4-Pro에 대한 Responses API 및 Codex 지원은 2026년 8월 초에 제공될 것으로 예상됩니다.
솔직히 말씀드리자면: 헤드라인 벤치마크 주장("V4-Pro-Preview를 훨씬 능가함")은 딥시크 자체 평가에서 나온 것이며, 나열된 벤치마크 중 두 가지(DSBench-FullStack 및 DSBench-Hard)는 내부 테스트 세트입니다. 독립적인 수치가 나오려면 며칠이 걸릴 것입니다.

1단계: API 키 발급받기
DeepSeek 플랫폼으로 이동하여 로그인한 후 API 키 페이지에서 키를 생성하세요. 키는 sk-로 시작합니다. 하드코딩하는 대신 환경 변수로 저장하세요:
export DEEPSEEK_API_KEY="sk-your-key-here"
DeepSeek API는 OpenAI 및 Anthropic API 형식과 모두 호환되므로, DeepSeek 전용 SDK가 필요하지 않습니다. 중요한 기본 URL은 두 가지입니다:
| 형식 | 기본 URL |
|---|---|
| OpenAI 호환 | https://api.deepseek.com |
| Anthropic 호환 | https://api.deepseek.com/anthropic |
2단계: 첫 호출하기
가장 빠른 정상 작동 확인 방법은 curl입니다:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Summarize what changed in DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
OpenAI Python SDK를 통한 동일한 호출:
# pip3 install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Write a Python function that validates an email address."}
],
stream=False
)
print(response.choices[0].message.content)
그리고 Node.js:
// npm install openai
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "Hello!" }],
});
console.log(completion.choices[0].message.content);
deepseek-v4-flash 모델 이름이 이제 0731 릴리스를 가리키므로, 프리뷰 버전을 기반으로 구축한 기존 통합은 자동으로 새 모델을 사용하게 됩니다. 마이그레이션할 필요가 없습니다.
3단계: 사고 모드 및 추론 노력 제어
V4-Flash는 비사고 모드와 사고 모드를 모두 지원하며, 사고 모드가 기본값입니다. thinking 매개변수로 제어하고, reasoning_effort로 깊이를 조정할 수 있습니다:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Plan a database migration from MySQL to Postgres."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
매개변수를 조정하기 전에 알아야 할 두 가지 동작:
temperature와top_p가 사고 모드가 켜져 있는 동안에는 영향을 미치지 않습니다.- FIM 완성(중간 채우기, 아직 베타)은 비사고 모드에서만 작동합니다.
자동 완성처럼 지연 시간에 민감한 엔드포인트의 경우 사고 모드를 비활성화하세요. 에이전트 루프 및 어려운 디버깅 작업의 경우 사고 모드를 켜고 노력 수준을 높게 유지하세요.
4단계: 응답 스트리밍하기
stream: true로 설정하면 API가 서버 전송 이벤트를 반환합니다. 이전에 SSE 페이로드를 디버깅해본 적이 없다면, 서버 전송 이벤트를 사용하여 LLM 응답 스트리밍에 대한 저희 가이드에서 형식에 대해 자세히 다루고 있습니다.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Explain connection pooling."}],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
공개 베타 기간 동안의 가격
공식 모델 및 가격 페이지에 따르면, V4-Flash는 공격적으로 저렴한 가격을 유지합니다:
| 항목 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| 입력, 캐시 히트 (100만 토큰당) | $0.0028 | $0.003625 |
| 입력, 캐시 미스 (100만 토큰당) | $0.14 | $0.435 |
| 출력 (100만 토큰당) | $0.28 | $0.87 |
| 컨텍스트 길이 | 100만 토큰 | 100만 토큰 |
| 최대 출력 | 384K | 384K |
| 동시성 제한 | 2,500 | 500 |
세 가지 가격 참고 사항:
- 컨텍스트 캐싱은 자동으로 이루어지며, 캐시 히트는 캐시 미스보다 50배 저렴합니다. 시스템 프롬프트를 재사용하는 장기 실행 에이전트 세션은 엄청난 이점을 얻습니다.
- 딥시크는 피크/오프피크 정책을 발표했습니다: 피크 시간 사용량(베이징 시간 9:00-12:00 및 14:00-18:00)은 일반 가격의 2배로 청구됩니다. 7월 31일 현재 문서에는 유효 날짜가 "공식 발표에 따름"이라고 되어 있으므로 아직 활성화되지 않았습니다. 가격 페이지를 주시하세요.
- 동시성 제한은 그 자체로 의미가 있습니다: Flash는 2,500개의 동시 요청을, Pro는 500개의 동시 요청을 지원합니다. 딥시크는 에이전트 플릿에 의해 많이 사용되도록 이 모델을 구축했습니다.
V4-Pro 영구 가격 인하의 이력을 포함하여 V4 제품군의 전체 비용 구조는 DeepSeek V4 API 가격 분석을 참조하세요.
Apidog에서 API 테스트 및 디버깅
기본 curl은 스모크 테스트에는 유용하지만, 사고 모드와 비사고 모드 출력을 비교하거나 모델이 도구 호출을 어떻게 스트리밍하는지 관찰할 때는 가시성이 필요합니다. Apidog에서 약 5분 정도 걸리는 워크플로우는 다음과 같습니다:

- 프로젝트를 생성하고 엔드포인트를 추가합니다.
POST https://api.deepseek.com/chat/completions를 추가합니다(또는 OpenAI 호환 사양을 가져와서 모든 엔드포인트를 한 번에 가져올 수도 있습니다). - 키를 환경 변수로 저장합니다. Apidog 환경에
DEEPSEEK_API_KEY를 넣고, Authorization 헤더에서Bearer {{DEEPSEEK_API_KEY}}와 같이 참조합니다. 테스트 키와 프로덕션 키 간 전환은 드롭다운 클릭으로 가능해집니다. - 전송 및 검사. 스트리밍 호출의 경우, Apidog는 SSE 이벤트를 도착하는 대로 렌더링하므로, 원시
data:줄의 벽을 직접 살펴보는 대신 추론 내용과 답변 내용이 별도의 델타로 전달되는 것을 볼 수 있습니다. - 변형을 테스트 케이스로 저장합니다. 사고 모드가 활성화된 요청과 비활성화된 요청을 하나씩 저장한 다음, 모델이 업데이트될 때마다 둘 다 다시 실행합니다. 딥시크가
deepseek-v4-flash에 대한 다음 무음 업그레이드를 출시하면, 프롬프트가 여전히 예상대로 작동하는지 한 번의 클릭으로 알 수 있습니다.
Apidog를 무료로 다운로드하세요. 위의 전체 흐름은 무료 플랜에서 작동합니다.
자주 묻는 질문 (FAQ)
새 모델을 사용하려면 코드를 변경해야 하나요? 아니요. deepseek-v4-flash 모델 이름은 이제 DeepSeek-V4-Flash-0731을 제공합니다. 기존 통합은 자동으로 업그레이드됩니다.
이 모델은 DeepSeek 앱과 동일한 모델인가요? 아니요. 7월 31일 업데이트는 API에만 해당됩니다. 앱 및 웹 모델은 변경되지 않았습니다.
deepseek-chat 및 deepseek-reasoner는 어떻게 되었나요? 해당 레거시 모델 이름은 2026년 7월 24일에 서비스 종료될 예정이었습니다. deepseek-v4-flash 또는 deepseek-v4-pro를 사용하세요. DeepSeek V4 API 사용 방법에 대한 저희 가이드에서 마이그레이션 방법을 다룹니다.
무료로 사용할 수 있나요? DeepSeek API는 영구적인 무료 티어가 없는 종량제 서비스이지만, 캐시 히트 가격 정책으로 인해 실제로는 실험이 거의 무료입니다. 현재 옵션에 대한 내용은 DeepSeek V4 API를 무료로 사용하는 방법을 참조하세요.
V4-Flash가 Codex 및 Responses API와 작동하나요? 네, 둘 다 작동하며, 현재까지는 유일한 DeepSeek 모델입니다. V4-Pro 지원은 2026년 8월 초에 예상됩니다. 전체 설정은 Responses API 및 Codex 가이드에서 확인하세요.
결론
DeepSeek-V4-Flash-0731은 조용한 릴리스입니다: 동일한 모델 이름, 동일한 가격, 동일한 아키텍처를 가지며, 적어도 딥시크 자체 테스트에서는 더 큰 V4-Pro-Preview를 능가하는 에이전트 벤치마크 점수를 보여줍니다. Responses API 지원 및 Codex 적응은 이 모델이 목표로 하는 바를 나타냅니다: 모든 서구 연구실보다 저렴한 가격으로 높은 동시성 에이전트 워크로드를 처리하는 것입니다.
키를 발급받고, OpenAI SDK를 https://api.deepseek.com으로 설정한 다음, 벤치마크 테이블을 신뢰하기 전에 자체 테스트 스위트로 모델을 테스트해보세요. Apidog는 이러한 검증 과정을 빠르게 만듭니다: 프롬프트를 한 번 테스트 케이스로 저장하고, 모델이 업데이트될 때마다 다시 실행하면, 다시는 조용한 업그레이드에 놀라지 않을 것입니다.
