딥시크 V4-Pro 9월 14일 서비스 종료: V4.1-플래시로 마이그레이션하는 방법

DeepSeek은 2026년 9월 14일부로 V4-Pro 서비스를 종료하고, 모든 요청을 V4.1-Flash로 리라우팅할 예정입니다. 변경 사항, 마이그레이션 체크리스트, 그리고 전환 전 테스트 방법을 안내해 드립니다.

INEZA Felin-Michel

INEZA Felin-Michel

10 September 2026

딥시크 V4-Pro 9월 14일 서비스 종료: V4.1-플래시로 마이그레이션하는 방법

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

DeepSeek은 deepseek-v4-pro 사용자에게 4일의 시간을 주었습니다. 2026년 9월 14일 04:00 UTC(베이징 12:00)에 deepseek-v4-pro를 명시하는 모든 요청은 DeepSeek-V4.1-Flash로 라우팅되며 V4.1-Flash 요금으로 청구됩니다. 오류도, 경고도 없습니다. 청구 요금이 내려가고, 다른 모델이 프롬프트에 응답하기 시작합니다.

마지막 부분이 바로 대비해야 할 부분입니다. 릴리스 노트는 이번 변경을 업그레이드로 설명하며, DeepSeek 자체 수치로도 그렇습니다. 그러나 "조용히 재라우팅"되는 것은 "테스트됨"과 동일하지 않습니다. 만약 귀하의 제품이 특정 도구 호출 형태나 V4-Pro에 맞춰 조정한 지연 시간 예산에 의존한다면, 일요일 이후가 아닌 이전에 어떤 변경 사항이 있는지 알아두고 싶을 것입니다.

이 가이드는 DeepSeek이 발표한 내용, 아무 조치도 취하지 않을 경우 발생하는 상황, 마이그레이션 체크리스트, 그리고 전환이 별다른 문제 없이 이루어지도록 Apidog에서 Pro와 Flash 간의 회귀 테스트 스위트를 구축하는 방법을 다룹니다. 모델 자체에 대해서는 먼저 DeepSeek-V4.1-Flash가 무엇인지 읽어보세요.

요약

DeepSeek이 9월 10일에 발표한 내용

9월 10일자 변경 로그 항목은 두 가지를 다룹니다: V4.1-Flash의 API 일반 출시(GA)와 4일 후 V4-Pro의 서비스 종료.

V4-Pro에 대한 언급은 직접적입니다. DeepSeek은 V4.1-Flash가 "성능, 비용, 속도 및 총 소요 시간 면에서 V4 Pro를 종합적으로 능가했다"고 말하며, "여러 당사자의 테스트"를 인용했습니다. 9월 14일 04:00 UTC부터 deepseek-v4-pro에 대한 요청은 V4.1-Flash에 의해 처리되며 V4.1-Flash 요금으로 청구됩니다. Pro가 레거시 이름으로 계속 실행되는 유예 기간은 없습니다.

명칭 정리는 Pro를 넘어섭니다:

모델 이름 9월 10일 이후 상태
deepseek-flash V4.1-Flash의 새로운 정식 ID
deepseek-v4-flash 계속 허용되며 V4.1-Flash에 의해 처리됨
deepseek-v4-flash-vision-exp 계속 허용되며 V4.1-Flash에 의해 처리됨
deepseek-v4-pro 9월 14일 04:00 UTC까지 V4-Pro에 의해 처리되며, 이후 V4.1-Flash로 재라우팅됨

V4-Flash 및 V4-Flash-Vision-Exp 모델은 서비스가 종료되며, 그 이름만 별칭으로 남아 있습니다. 기본 URL은 변경되지 않습니다: OpenAI 호환 형식의 경우 https://api.deepseek.com, Anthropic 호환 형식의 경우 https://api.deepseek.com/anthropic입니다. V4.1-Flash API 사용 방법은 새로운 모델 ID, 추론 제어 및 이미지 입력을 자세히 다룹니다.

아무 조치도 취하지 않을 경우 발생하는 일

요약: 귀하의 통합은 계속 작동하며 비용은 더 저렴해집니다. 자세한 내용: 다섯 가지 사항이 귀하도 모르게 변경됩니다.

다른 모델이 응답합니다. V4.1-Flash는 새로운 Causal Encoder-Decoder 레이아웃을 가진 552B-매개변수 MoE 모델입니다: 40개 레이어(20개 인코더, 20개 디코더), 사전 채우기(prefill) 시 8B 매개변수 활성화, 디코딩 시 16B 매개변수 활성화. 이제 귀하의 프롬프트는 다른 활성 매개변수 예산과 다른 어텐션 디자인(Compressed Sparse Attention 2)에 도달합니다. 다른 표현, 다른 기본 상세도, 그리고 때로는 경계선에 있는 도구 호출에 대해 다른 결정이 나올 수 있습니다.

출력 한도는 동일하지만, 권장 설정은 다릅니다. 두 모델 모두 1M 컨텍스트와 384K 최대 출력을 명시합니다. V4.1-Flash 모델 카드는 temperature 1.0, top_p 0.95 또는 1.0, 그리고 최대 토큰을 256K 이상으로 권장합니다. 비용을 제한하기 위해 V4-Pro에서 max_tokens를 엄격하게 설정했다면, 이제 답변이 도착하기 전에 추론 출력이 잘리는지 확인하세요.

추론 노력이 다른 척도로 작동합니다. DeepSeek은 V4.1-Flash의 추론 노력을 1에서 100까지의 척도로 "연속적으로 제어 가능하다"고 설명합니다. V4-Flash는 reasoning_effortextra_body={"thinking": {"type": "enabled"}}를 허용했습니다. 1에서 100 척도가 API 매개변수에 어떻게 매핑되는지는 현재 문서를 [확인]해야 합니다. "high"와 같은 명명된 수준이 Pro에서 그랬던 것과 동일한 깊이를 의미한다고 가정하지 마세요.

피크 시간 창과 함께 귀하에게 유리하게 요금이 변경됩니다. 피크 시간은 월요일부터 금요일 01:00부터 04:00, 06:00부터 10:00 UTC입니다. 비피크 시간은 피크 시간의 절반입니다. 재라우팅된 Pro 트래픽은 두 시간대 모두 Flash 요금으로 지불됩니다.

동시성 여유가 크게 늘어납니다. V4-Pro의 동시 요청 한도는 500개였습니다. Flash는 2,500개입니다. 재라우팅된 트래픽은 더 높은 한도를 상속받으므로, 500개에 맞춰 조정된 클라이언트 측 백오프를 다시 검토하세요.

마이그레이션 체크리스트

순서대로 진행하세요. 이들을 함께 수행하면 조용한 재라우팅이 의도적인 릴리스로 바뀝니다.

  1. 모델 ID를 변경하세요. 코드베이스와 설정에서 deepseek-v4-pro를 검색하여 deepseek-flash로 대체하세요. 별칭이 계속 작동하더라도 이렇게 하는 것이 좋습니다. 명시적인 ID를 사용하면 나중에 인시던트를 더 쉽게 파악할 수 있습니다.
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",  # 이전 "deepseek-v4-pro"
    messages=[
        {"role": "system", "content": "지원 티켓을 분류합니다. 우선순위, 팀, 요약을 포함하는 JSON 객체를 반환합니다."},
        {"role": "user", "content": "고객이 할인 코드를 적용한 후 결제 시 502 오류가 발생한다고 보고했습니다."},
    ],
    response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
  1. 추론 노력 설정을 검토하세요. reasoning_effort 또는 사고 토글을 설정한 모든 위치를 나열하세요. 각 엔드포인트별로 깊이를 원하는지 또는 지연 시간을 원하는지 결정한 다음, 이전 값을 그대로 사용하지 않고 새로운 척도에 대해 각각 테스트하세요.
  2. 함수 호출 및 구조화된 출력 테스트를 다시 실행하세요. 모델 교체 시 도구 호출 인자 형식 지정에서 가장 큰 문제가 발생합니다. V4-Pro에서 함수 호출을 설정할 때 테스트를 작성했다면, 지금 deepseek-flash에 대해 실행하세요. 작성하지 않았다면 아래 Apidog 워크플로우에서 세트를 제공합니다.
  3. 스트리밍 파서를 확인하세요. V4.1-Flash는 사고 모드에서 추론 델타와 답변 델타를 별도로 스트리밍합니다. SSE 핸들러가 이를 연결하지 않는지, 그리고 "첫 번째 토큰" 타이머가 예상대로 작동하는지 확인하세요.
  4. 지연 시간과 비용을 다시 기준 측정하세요. 이번 주에 V4-Pro에서 p50 및 p95 지연 시간과 요청당 토큰 수를 기록한 다음, deepseek-flash에서도 동일하게 기록하세요. 월요일에 대시보드가 왜 변경되었는지 누군가 물었을 때 두 숫자가 모두 필요할 것입니다.
  5. 대시보드와 예산을 업데이트하세요. 피크 시 $3.96 출력에 맞춰 조정된 비용 알림은 $1.20을 지불하게 되면 잠잠해질 것이며, 한 번도 트리거되지 않는 예산은 아무도 보지 않는 예산입니다. 가격 책정 페이지의 요율로 임계값을 재설정하고, 이전 ID를 필터링하는 모델별 분류가 있다면 수정하세요.

채팅 완료 대신 Anthropic 호환 또는 응답 API 형식을 호출하는 경우에도 동일한 단계가 적용됩니다. V4-Pro API 형식 비교는 각 요청이 어떻게 생겼는지 보여주므로 필드를 매핑할 수 있습니다.

V4-Pro 대 V4.1-Flash 한눈에 보기

벤치마크 수치는 DeepSeek이 V4.1-Flash 모델 카드에서 보고한 내용입니다. 가격은 2026년 9월 10일부로 적용되는 100만 토큰당 USD입니다.

deepseek-v4-pro deepseek-flash (V4.1)
활성 매개변수 V4.1 카드에 명시되지 않음 8B 사전 채우기 / 16B 디코딩
HumanEval 76.8 79.4
GSM8K 92.6 93.0
DeepSWE v1.1 62.7 74.2
Terminal-Bench 2.1 87.9 90.6
입력, 캐시 히트 (비피크 / 피크) $0.022 / $0.044 $0.003 / $0.006
입력, 캐시 미스 (비피크 / 피크) $0.66 / $1.32 $0.15 / $0.30
출력 (비피크 / 피크) $1.98 / $3.96 $0.60 / $1.20
컨텍스트 / 최대 출력 1M / 384K 1M / 384K
동시성 한도 500 2,500

가장 큰 차이는 DeepSWE로, 11.5점 상승했습니다. 가장 작은 차이는 GSM8K로, 0.4점 상승했습니다. 귀하의 작업량이 초등학교 수학과 같다면 동등할 것으로 예상할 수 있으며, 다중 파일 코드 편집과 같다면 DeepSeek의 수치에 따르면 이득을 얻을 수 있습니다. V4-Flash를 포함한 3자 비교는 V4.1-Flash 대 V4-Pro 대 V4-Flash에서 확인할 수 있습니다.

위험: 공급업체 벤치마크는 공급업체 작업을 측정합니다

해당 표의 모든 수치는 DeepSeek에서 제공한 것입니다. "여러 당사자의 테스트"는 DeepSeek의 표현이며, 릴리스 노트에는 당사자의 이름이 명시되어 있지 않습니다. 그렇다고 해서 그 수치들이 틀린 것은 아닙니다. 이는 귀하의 프롬프트, 도구 스키마, 또는 사용자들의 복잡한 입력이 아니라 벤치마크 스위트를 통해 측정되었다는 것을 의미합니다.

모델이 Terminal-Bench에서 더 높은 점수를 얻더라도 파서가 의존하는 도구 호출 인자 형식을 변경할 수 있습니다. 모델이 두 배 많은 토큰을 작성한다면 더 저렴한 출력 토큰은 도움이 되지 않습니다. 이를 알 수 있는 유일한 방법은 두 모델이 모두 존재하는 동안 자체 트래픽을 두 모델에 통과시키는 것입니다. 9월 14일까지 시간이 있습니다.

전환 전에 Apidog에서 회귀 테스트 스위트 구축하기

다음은 Apidog에서 반복 가능한 Pro 대 Flash 비교를 제공하고 CI에 실행을 넘겨주는 워크플로우입니다.

  1. 기존 V4-Pro 요청을 가져오세요. OpenAI 호환 OpenAPI 사양을 가져오거나, 프로덕션에서 사용하는 curl 명령을 붙여넣으세요. DEEPSEEK_API_KEY를 환경 변수에 넣고 Authorization 헤더에서 Bearer {{DEEPSEEK_API_KEY}}로 참조하세요. 두 번째 변수 {{MODEL_ID}}deepseek-v4-pro로 설정하여 추가하세요.
  2. 각 요청을 deepseek-flash로 복제하세요. 두 번째 환경에서 {{MODEL_ID}}deepseek-flash로 설정하거나, 쌍을 이루는 요청에 두 ID를 하드코딩하세요. 동일한 프롬프트, 동일한 도구 배열, 동일한 max_tokens를 사용하세요. 유일한 차이점은 모델이어야 합니다.
  3. JSON 형태 및 도구 호출 구조에 대한 단언(assertion)을 추가하세요. 구조화된 출력의 경우, choices[0].message.content가 JSON으로 파싱되고 예상하는 키를 포함하는지 단언하세요. 함수 호출의 경우, choices[0].message.tool_calls[0].function.name이 예상하는 도구와 같고 arguments가 파싱되는지 단언하세요. 이러한 검사는 조용한 형식 변화를 잡아냅니다.
  4. 둘 다 하나의 테스트 시나리오로 실행하세요. Pro 및 Flash 요청을 단일 시나리오로 연결하여 각 실행이 하나의 보고서를 생성하도록 하세요. stream: true를 포함하는 스트리밍 요청을 포함하세요. Apidog은 SSE 이벤트를 하나씩 렌더링하므로, 추론 및 답변 델타가 파서가 예상하는 방식으로 도착하는지 확인할 수 있습니다.
  5. 결과를 비교하세요. 보고서의 두 부분을 비교하세요: 단언 통과율, 응답 시간, 그리고 usage.completion_tokens. 모든 단언을 통과하지만 40% 더 많은 출력 토큰을 방출하는 모델은 비용 계산을 변경하며, 청구서가 오기 전에 이를 확인할 수 있습니다.
  6. apidog-cli를 사용하여 CI에 예약하세요. 9월 14일까지 매일 파이프라인에서 시나리오를 실행하고 그 이후에도 계속 실행하세요. Pro가 사라지면 Pro 부분도 Flash 응답을 반환하고 차이는 0으로 줄어듭니다. 이는 전환이 발생했고 귀하의 단언이 여전히 유효하다는 확인입니다.

이를 설정하려면 Apidog을 다운로드하세요. 이 워크플로우는 공유 프로젝트에 있으므로, 청구서를 담당하는 사람과 프롬프트를 담당하는 사람이 동일한 보고서를 읽을 수 있습니다.

자주 묻는 질문

9월 14일에 V4-Pro 호출이 실패하나요? 아니요. deepseek-v4-pro를 명시한 요청은 V4.1-Flash로 재라우팅됩니다. 200 응답과 V4.1-Flash 답변을 받게 됩니다. 실패 모드는 동작상의 문제이지, 오류 코드가 아닙니다.

전환 후에도 V4-Pro 가격으로 청구되나요? 아니요. 재라우팅된 요청은 V4.1-Flash 요율로 청구됩니다. 피크 시 100만 캐시 미스 입력 토큰당 $1.32 대신 $0.30, 100만 출력 토큰당 $3.96 대신 $1.20이 부과됩니다.

ID를 deepseek-flash로 변경해야 하나요, 아니면 deepseek-v4-pro를 유지해야 하나요? 변경하세요. 별칭이 작동하더라도, 명시적인 ID는 로그, 대시보드 및 비용 보고서에 무엇이 호출되는지 명확하게 표시합니다.

V4-Pro-0813 설정이 여전히 적용되나요? V4-Pro-0813 API 가이드의 키, 기본 URL 및 요청 형태는 변경 없이 이월됩니다. 변경되는 것은 그 뒤에 있는 모델과 추론 노력 제어이므로, 가정하지 말고 재테스트하세요.

V4.1-Flash가 V4-Pro보다 어떤 면에서 더 나쁜가요? DeepSeek이 발표한 벤치마크는 나열된 모든 작업에서 개선된 성능을 보여줍니다. 게시 시점에는 독립적인 결과가 제공되지 않았습니다. "어떤 면에서도 나쁘지 않다"는 주장은 테스트해야 할 대상으로 간주하세요.

4일이면 충분합니다

마이그레이션은 한 줄의 문자열 변경과 테스트 실행입니다. 문자열 변경은 1분도 걸리지 않습니다. 테스트 실행은 다음 주에 지불하게 될 모델이 귀하가 설계한 모델처럼 작동하는지 알려줄 것입니다. 스위트를 구축하고, deepseek-v4-pro가 여전히 Pro로 해석될 때 실행하고, 차이점을 확인하세요. 깨끗하다면, 70% 더 저렴한 요금과 5배의 동시성을 무료로 얻게 됩니다. 그렇지 않다면, DeepSeek의 일정에 따라가기 전에 귀하의 일정에 맞춰 문제를 발견한 것입니다.

버튼

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요