DeepSeek-V4.1-Flash 요금 분석: 피크 vs 비피크 요금 및 캐시 히트 계산법

deepseek-flash의 전체 USD 및 CNY 가격표, V4-Flash 및 V4-Pro 재경유 대비 할인율, 귀하의 시간대로 변환된 피크 시간대, 그리고 계산 방식이 명시된 두 가지 캐시 히트 예시.

Medy Evrard

10 September 2026

DeepSeek-V4.1-Flash 요금 분석: 피크 vs 비피크 요금 및 캐시 히트 계산법

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

DeepSeek-V4.1-Flash가 2026년 9월 10일 API에 정식 출시되었으며, 출시 노트와 함께 가격 인하가 적용되었습니다. 이제 캐시 적중 입력은 비수기 백만 토큰당 $0.003, 캐시 미스 입력은 $0.15, 출력은 $0.60입니다. 4일 후인 9월 14일, DeepSeek은 모든 deepseek-v4-pro 요청을 V4.1-Flash로 라우팅하고 Flash 요율로 청구하기 시작합니다. DeepSeek API에서 무엇이든 실행하는 경우, 코드를 수정하든 안 하든 이번 주에 요금이 변경됩니다.

이 게시물은 이야기의 절반인 가격 책정에 대한 내용입니다: 전체 USD 및 CNY 표, V4-Flash 및 V4-Pro 대비 변경된 비율, 시간대별 피크 시간대, 그리고 계산이 포함된 두 가지 캐시 적중 예시를 다룹니다. 모델 자체에 대해서는 DeepSeek-V4.1-Flash가 무엇인지부터 시작하십시오.

먼저 한 가지 주의사항이 있습니다. 이 클러스터의 모든 벤치마크 수치는 모델 카드에 DeepSeek이 보고한 수치입니다. 가격은 9월 10일에 확인된 가격 페이지에서 가져왔습니다. 마지막 섹션에서는 추정치를 신뢰하는 대신 모든 응답의 usage 블록을 읽어서 Apidog으로 자신의 지출을 측정하는 방법을 보여줍니다.

버튼

TL;DR

전체 가격표

모든 수치는 2026년 9월 10일 04:00 UTC부터 적용되며, 1백만 토큰당 기준입니다.

deepseek-flash 비수기 deepseek-flash 피크 deepseek-v4-pro 비수기 deepseek-v4-pro 피크
입력, 캐시 적중 $0.003 $0.006 $0.022 $0.044
입력, 캐시 미스 $0.15 $0.30 $0.66 $1.32
출력 $0.60 $1.20 $1.98 $3.96
동시성 2,500 2,500 500 500

deepseek-v4-pro 열은 앞으로 4일 동안 유효합니다. 9월 14일 04:00 UTC (베이징 시간 12:00)부터 해당 모델 이름으로의 요청은 V4.1-Flash에 의해 처리되며 첫 두 열의 요율로 청구됩니다. V4-Pro 서비스 종료 및 마이그레이션 가이드에서는 그 전에 테스트해야 할 사항을 다룹니다.

계정이 위안화로 결제되는 경우, zh-cn 가격 페이지에는 deepseek-flash가 다음과 같이 표시됩니다.

비수기 (CNY) 피크 (CNY)
입력, 캐시 적중 ¥0.02 ¥0.04
입력, 캐시 미스 ¥1.00 ¥2.00
출력 ¥4.00 ¥8.00

각 CNY 행은 USD 행에 약 6.67을 곱한 값입니다. 테이블에 빠진 두 가지 세부 정보는 다음과 같습니다: 컨텍스트 캐싱은 플래그 설정 없이 자동으로 이루어지며, 모델 ID는 이제 deepseek-flash입니다. 이전 이름인 deepseek-v4-flashdeepseek-v4-flash-vision-exp도 여전히 확인되지만, 이 요율로 V4.1-Flash에 적용됩니다.

V4-Flash 및 V4-Pro 대비 변경된 사항

2026년 8월 21일, deepseek-v4-flash는 비수기(캐시 적중 / 캐시 미스 / 출력)에 $0.007 / $0.22 / $0.66, 피크 시간대에 $0.014 / $0.44 / $1.32로 청구되었습니다. 변경 로그에는 이번 릴리스와 함께 가격이 “그에 따라 인하되었다”고 명시되어 있습니다. 다음은 두 목록에서 계산된 “그에 따라”의 의미입니다.

항목 V4-Flash (8월 21일) V4.1-Flash (9월 10일) 인하율
캐시 적중, 비수기 $0.007 $0.003 57%
캐시 미스, 비수기 $0.22 $0.15 32%
출력, 비수기 $0.66 $0.60 9%

피크 시간대에는 두 목록 모두 두 배가 되므로, 피크 행은 동일한 비율을 가집니다. 이러한 패턴은 의도적입니다: 가장 큰 인하율은 캐시 적중에, 가장 작은 인하율은 출력에 적용됩니다. DeepSeek은 매 턴마다 긴 접두사를 다시 읽는 에이전트 루프에 대한 가격을 책정하고 있으며, V4.1의 FP4 KV 캐시(토큰당 890바이트, V4-Flash의 약 1/4 크기)가 $0.003의 적중 가격을 유지 가능하게 합니다.

V4-Pro 사용자에게는 더 큰 수치가 적용됩니다. 왜냐하면 재라우팅이 Flash 요율로 발생하기 때문입니다.

DeepSeek은 V4.1-Flash가 “성능, 비용, 속도 및 총 시간 면에서 V4 Pro를 종합적으로 능가했다”고 말하며, 이 주장은 14일 이전에 직접 프롬프트로 확인해봐야 합니다. DeepSeek이 API 가격을 인상했던 시기를 포함하여 DeepSeek 제품군 가격 책정의 더 긴 역사는 DeepSeek V4 API 가격 분석에서 확인할 수 있습니다.

당신의 시간대별 피크 시간대

피크 시간대는 월요일부터 금요일까지만 적용되며, 두 블록으로 나뉩니다: 01:00~04:00 UTC와 06:00~10:00 UTC. 이는 베이징 시간으로 9:00~12:00 및 14:00~18:00입니다. 주중 하루 7시간, 주당 35시간의 피크 시간이므로, 전체 168시간 중 약 21%를 차지합니다. 토요일과 일요일 전체를 포함한 나머지 시간은 비수기 요율로 청구됩니다.

시간대 UTC 베이징 (UTC+8) 미국 태평양 (PDT, UTC-7) 중앙 유럽 (CEST, UTC+2)
피크 1 01:00 to 04:00 09:00 to 12:00 18:00 to 21:00 (전날 저녁) 03:00 to 06:00
피크 2 06:00 to 10:00 14:00 to 18:00 23:00 to 03:00 (밤샘) 08:00 to 12:00

태평양 및 중앙 유럽 열은 서머타임을 사용합니다. 시계가 변경된 후(EU는 10월 25일, 미국은 11월 1일), 두 열 모두 한 시간 앞당겨야 합니다. UTC 경계는 변하지 않습니다.

미국 서해안의 근무일은 피크 시간대와 겹치지 않습니다. 중앙 유럽의 아침은 피크 2 시간대에 속하며, 현지 시간 03:00의 유럽 야간 일괄 작업은 두 배로 청구됩니다; 이를 23:00 CEST (21:00 UTC)로 옮기면 절반 가격으로 돌아갑니다.

캐시 적중 계산, 두 번 적용

적중은 미스 비용의 1/50($0.003 대 $0.15)이므로, 반복되는 접두사와 새 토큰의 비율이 원시 토큰 수보다 입력 비용을 더 많이 결정합니다. 접두사 캐싱이 처음이시라면, 프롬프트 캐싱 입문서가 캐시 가능한 접두사로 간주되는 것(요청 시작 부분의 동일한 바이트)을 설명합니다.

예시 1: 20K 토큰 시스템 프롬프트가 포함된 에이전트 루프, 피크 시간대 1,000회 호출.

지원 분류 에이전트가 20,000토큰 시스템 프롬프트(정책, 도구 스키마, 소수 예시)를 사용하고, 호출당 2,000개의 새로운 티켓 텍스트 토큰을 읽고, 1,000개의 출력 토큰을 작성합니다. 1,000회 호출 시:

  1. 총 입력은 1,000 × 22,000 = 2,200만 토큰입니다. 총 출력은 1백만 토큰입니다.
  2. 첫 번째 호출은 22,000 토큰 모두에 대해 미스가 발생합니다. 이후의 모든 호출은 20,000 토큰 접두사에 적중하고 2,000개의 새로운 토큰에는 미스가 발생합니다.
  3. 적중 토큰: 999 × 20,000 = 1,998만 토큰. 1백만 개당 $0.006: 19.98 × 0.006 = $0.12.
  4. 미스 토큰: 22,000 + 999 × 2,000 = 202만 토큰. 1백만 개당 $0.30: 2.02 × 0.30 = $0.61.
  5. 출력: 1백만 토큰 × $1.20 = $1.20.
  6. 총계: $0.12 + $0.61 + $1.20 = $1.93.

캐싱이 없는 경우, 입력만으로 22 × $0.30 = $6.60이며, 작업 비용은 $7.80입니다. 캐싱은 청구액의 75%를 절감합니다. 동일한 루프를 비수기에 실행하면 모든 항목이 절반으로 줄어듭니다: $0.06 + $0.30 + $0.60 = $0.96.

피크 시간대 V4-Pro에서 동일한 1,000회 호출(적중 $0.88, 미스 $2.67, 출력 $3.96)은 총 $7.51이며, 이는 재라우팅 시 Pro 고객이 $1.93과 비교해야 할 수치입니다.

예시 2: 1천만 출력 토큰을 포함하는 일괄 작업, 비수기로 이동.

카탈로그 팀은 10,000개의 제품 설명을 생성합니다. 각 호출은 1,500개의 제품 데이터 토큰(항목당 고유하므로 캐시 이점 없음)을 보내고 1,000개의 복사본 토큰을 받습니다. 이는 모두 미스인 1,500만 입력 토큰과 1,000만 출력 토큰입니다.

  1. 피크 시간대: 입력 15 × $0.30 = $4.50. 출력 10 × $1.20 = $12.00. 총계 $16.50.
  2. 비수기: 입력 15 × $0.15 = $2.25. 출력 10 × $0.60 = $6.00. 총계 $8.25.
  3. 타임스탬프만으로 절감된 금액: $8.25, 프롬프트 변경 없이.

이 작업에서는 출력이 지배적이며 릴리스에서 가장 작은 인하율을 받았으므로, 비수기 시간대가 더 큰 레버리지입니다. 이는 너그러운 시간대입니다: 매주 평일 10:00 UTC부터 15시간, 그리고 매 주말 48시간 동안 중단 없이 이용할 수 있습니다.

컨텍스트, 출력 및 동시성이 가격의 일부인 이유

두 모델 이름 모두 1백만 토큰 컨텍스트와 384K 토큰 최대 출력을 지원합니다. 모델 카드에서는 최대 토큰을 256K 이상으로 권장하므로, 의도적으로 해당 상한선을 설정하십시오: 384K 출력 토큰에 이르는 응답은 피크 시간대에 $0.46가 소요되며, 이는 에이전트 기록에는 적합하지만 자동 완성에는 버그가 될 수 있습니다.

Flash의 동시성은 2,500이고 Pro는 500입니다. 이 내용은 가격 책정 문서에 포함되어야 합니다. 비수기 할인은 해당 시간대에 작업을 처리할 수 있을 때만 가치가 있으며, 9월 14일에 재라우팅된 deepseek-v4-pro 트래픽이 Flash 제한을 상속받기 때문입니다: 500개의 슬롯 뒤에서 대기하던 Pro 통합은 구성 변경 없이 5배 더 많은 여유 공간을 얻게 됩니다.

Apidog으로 실제 지출 측정

가격표는 요율을 알려줍니다. 각 응답의 usage 객체는 청구된 내역을 알려줍니다. 다음은 반복 가능한 검사를 수행하는 Apidog 워크플로우입니다.

  1. 엔드포인트 추가. POST https://api.deepseek.com/chat/completions를 생성하거나, OpenAI 호환 OpenAPI 사양을 가져옵니다.
  2. 환경에 가격 설정. DEEPSEEK_API_KEYPRICE_HIT, PRICE_MISS, PRICE_OUT{{variables}}로 포함하는 deepseek-peakdeepseek-offpeak 두 개의 Apidog 환경을 생성합니다. 피크 환경에는 0.006 / 0.30 / 1.20을, 비수기 환경에는 0.003 / 0.15 / 0.60을 설정합니다.
  3. 한 번 보내고 usage 읽기. DeepSeek은 입력을 prompt_cache_hit_tokensprompt_cache_miss_tokens로 나누고, 그 옆에 completion_tokens도 제공합니다 [확인 필요]. 요청을 테스트 케이스로 저장합니다.
  4. 캐시 동작을 단언하는 테스트 시나리오 구축. 저장된 요청을 동일한 20K 토큰 시스템 프롬프트로 두 번 연결합니다. 두 번째 단계에서는 적중 토큰 필드가 19,000 이상이고 계산된 비용(적중 수 × {{PRICE_HIT}} + 미스 수 × {{PRICE_MISS}} + 출력 수 × {{PRICE_OUT}}, 1백만으로 나눔)이 예산 내에 있는지 단언합니다. 두 번째 단계에서 미스가 발생하면 접두사가 변경되었음을 의미하며, 청구서가 발행되기 전에 이 단언이 이를 감지합니다.
  5. 피크와 비수기 비교. 각 환경에서 시나리오를 실행하고 비용 라인을 비교하거나, UTC 피크 경계에 걸쳐 있는 일정으로 CI에서 apidog-cli를 사용하여 실행합니다.

Apidog을 다운로드하면 전체 시나리오(환경 포함)가 무료 플랜에서 작동합니다.

이것이 당신의 청구서에 미치는 영향

V4.1-Flash는 모든 면에서 V4-Flash보다 저렴하며, 대체하는 V4-Pro 요율보다 70~86% 저렴합니다. 두 가지 중요한 요소가 있습니다: 긴 접두사를 바이트 단위로 동일하게 유지하여 캐시를 적중하게 하고, 일괄 작업을 주중 7시간의 피크 시간대 외부에 예약하는 것입니다. 그런 다음 모든 호출에 usage를 기록하고, 적중 횟수를 단언하며, 그 수치가 청구서에 반영되었는지 확인하십시오.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요