DeepSeek-V4.1-Flash: Phân tích giá, phí cao điểm, thấp điểm và cách tính Cache-Hit

Bảng giá đầy đủ bằng USD và CNY cho deepseek-flash, các mức giảm phần trăm so với V4-Flash và phương án định tuyến lại V4-Pro, các khung giờ cao điểm được chuyển đổi sang múi giờ của bạn, và hai ví dụ về cache-hit kèm theo phép tính được trình bày.

Medy Evrard

10 tháng 9 2026

DeepSeek-V4.1-Flash: Phân tích giá, phí cao điểm, thấp điểm và cách tính Cache-Hit

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

DeepSeek-V4.1-Flash đã ra mắt rộng rãi trên API vào ngày 10 tháng 9 năm 2026, và thông báo phát hành đi kèm với việc giảm giá. Đầu vào cache-hit (lượt truy cập bộ nhớ đệm) hiện có giá 0.003 USD cho mỗi triệu token vào giờ thấp điểm, đầu vào cache-miss (lượt bỏ lỡ bộ nhớ đệm) là 0.15 USD, đầu ra là 0.60 USD. Bốn ngày sau, vào ngày 14 tháng 9, DeepSeek bắt đầu định tuyến mọi yêu cầu deepseek-v4-pro tới V4.1-Flash và tính phí theo mức của Flash. Nếu bạn chạy bất kỳ thứ gì trên DeepSeek API, hóa đơn của bạn sẽ thay đổi trong tuần này bất kể bạn có sửa đổi mã của mình hay không.

Bài viết này là một nửa câu chuyện về giá cả: bảng giá đầy đủ bằng USD và CNY, phần trăm thay đổi so với V4-Flash và V4-Pro, các khung giờ cao điểm theo múi giờ của bạn, và hai ví dụ về cache-hit với các phép tính được trình bày. Đối với bản thân mô hình, hãy bắt đầu với DeepSeek-V4.1-Flash là gì.

Một lưu ý ngay từ đầu. Mọi con số benchmark trong nhóm này đều là số liệu do DeepSeek báo cáo từ thẻ mô hình. Giá cả lấy từ trang giá, được xác minh vào ngày 10 tháng 9. Phần cuối cùng cho thấy cách đo chi tiêu của riêng bạn bằng Apidog bằng cách đọc khối usage trên mỗi phản hồi thay vì tin tưởng vào một ước tính.

nút

TL;DR

Bảng giá đầy đủ

Tất cả các con số tính trên 1 triệu token, có hiệu lực từ ngày 10 tháng 9 năm 2026 lúc 04:00 UTC.

deepseek-flash thấp điểm deepseek-flash cao điểm deepseek-v4-pro thấp điểm deepseek-v4-pro cao điểm
Đầu vào, cache hit $0.003 $0.006 $0.022 $0.044
Đầu vào, cache miss $0.15 $0.30 $0.66 $1.32
Đầu ra $0.60 $1.20 $1.98 $3.96
Đồng thời 2,500 2,500 500 500

Các cột deepseek-v4-pro vẫn còn quan trọng trong bốn ngày nữa. Từ ngày 14 tháng 9 lúc 04:00 UTC (12:00 giờ Bắc Kinh), các yêu cầu đến tên mô hình đó sẽ được phục vụ bởi V4.1-Flash và tính phí từ hai cột đầu tiên. Hướng dẫn ngưng sử dụng và di chuyển V4-Pro trình bày những gì cần kiểm tra trước đó.

Nếu tài khoản của bạn thanh toán bằng nhân dân tệ, trang giá zh-cn liệt kê deepseek-flash như sau:

Thấp điểm (CNY) Cao điểm (CNY)
Đầu vào, cache hit ¥0.02 ¥0.04
Đầu vào, cache miss ¥1.00 ¥2.00
Đầu ra ¥4.00 ¥8.00

Mỗi hàng CNY bằng hàng USD nhân khoảng 6.67. Hai chi tiết mà bảng bỏ qua: bộ nhớ đệm ngữ cảnh là tự động, không cần đặt cờ, và ID mô hình hiện là deepseek-flash. Các tên cũ deepseek-v4-flashdeepseek-v4-flash-vision-exp vẫn được giải quyết nhưng chuyển hướng đến V4.1-Flash với các mức giá này.

Những gì đã thay đổi so với V4-Flash và V4-Pro

Vào ngày 21 tháng 8 năm 2026, deepseek-v4-flash được tính phí 0.007 USD / 0.22 USD / 0.66 USD ngoài giờ cao điểm (cache hit / cache miss / đầu ra) và 0.014 USD / 0.44 USD / 1.32 USD vào giờ cao điểm. Nhật ký thay đổi nói rằng giá đã "giảm tương ứng" với bản phát hành này. Dưới đây là ý nghĩa của "tương ứng", được tính từ hai danh sách:

Khoản mục V4-Flash (21 Thg 8) V4.1-Flash (10 Thg 9) Giảm
Cache hit, thấp điểm $0.007 $0.003 57%
Cache miss, thấp điểm $0.22 $0.15 32%
Đầu ra, thấp điểm $0.66 $0.60 9%

Các hàng giờ cao điểm có phần trăm giống hệt nhau, vì cả hai danh sách đều nhân đôi vào giờ cao điểm. Mô hình này là có chủ đích: mức giảm lớn nhất nằm ở cache hits, nhỏ nhất ở đầu ra. DeepSeek đang định giá cho các vòng lặp tác nhân đọc lại một tiền tố dài trong mỗi lượt, và bộ nhớ đệm FP4 KV trong V4.1 (890 byte mỗi token, khoảng một phần tư dung lượng của V4-Flash) là điều khiến giá hit 0.003 USD trở nên bền vững từ phía họ.

Đối với người dùng V4-Pro, các con số lớn hơn, vì việc định tuyến lại diễn ra ở tốc độ Flash:

DeepSeek tuyên bố V4.1-Flash "đã vượt trội hoàn toàn so với V4 Pro về hiệu suất, chi phí, tốc độ và tổng thời gian", một tuyên bố cần kiểm tra với các lời nhắc của riêng bạn trước ngày 14. Để biết lịch sử giá của dòng sản phẩm này, bao gồm cả giai đoạn mà DeepSeek đã tăng giá API, phân tích giá DeepSeek V4 API có đầy đủ lịch sử.

Các khung giờ cao điểm theo múi giờ của bạn

Giờ cao điểm chỉ áp dụng từ Thứ Hai đến Thứ Sáu, trong hai khung: 01:00 đến 04:00 UTC và 06:00 đến 10:00 UTC. Tức là 9:00 đến 12:00 và 14:00 đến 18:00 giờ Bắc Kinh. Bảy giờ cao điểm mỗi ngày làm việc, 35 giờ mỗi tuần, vì vậy giờ cao điểm chiếm khoảng 21% trong tuần 168 giờ. Mọi thứ khác, bao gồm toàn bộ Thứ Bảy và Chủ Nhật, sẽ được tính theo mức giá thấp điểm.

Khung giờ UTC Bắc Kinh (UTC+8) US Pacific (PDT, UTC-7) Trung Âu (CEST, UTC+2)
Cao điểm 1 01:00 đến 04:00 09:00 đến 12:00 18:00 đến 21:00 (tối hôm trước) 03:00 đến 06:00
Cao điểm 2 06:00 đến 10:00 14:00 đến 18:00 23:00 đến 03:00 (qua đêm) 08:00 đến 12:00

Các cột Pacific và Trung Âu sử dụng giờ mùa hè. Sau khi đồng hồ đổi giờ (25 tháng 10 ở EU, 1 tháng 11 ở Mỹ), hãy dịch chuyển cả hai cột sớm hơn một giờ. Ranh giới UTC không bao giờ thay đổi.

Một ngày làm việc ở Bờ Tây Hoa Kỳ không bao giờ chạm đến khung giờ cao điểm. Một buổi sáng ở Trung Âu nằm trong Khung giờ cao điểm 2, và một lượt chạy theo lô hàng đêm của Châu Âu lúc 03:00 giờ địa phương sẽ phải trả gấp đôi; chuyển nó sang 23:00 CEST (21:00 UTC) sẽ đưa nó trở lại mức giá một nửa.

Phép toán Cache-hit, được thực hiện hai lần

Một lượt hit có giá bằng 1/50 của một lượt miss (0.003 USD so với 0.15 USD), vì vậy tỷ lệ tiền tố lặp lại so với token mới quyết định chi phí đầu vào của bạn nhiều hơn là số lượng token thô. Nếu bộ nhớ đệm tiền tố là mới đối với bạn, bài giới thiệu về bộ nhớ đệm lời nhắc giải thích những gì được tính là tiền tố có thể được bộ nhớ đệm: các byte giống hệt nhau ở đầu yêu cầu.

Ví dụ 1: một vòng lặp tác nhân với lời nhắc hệ thống 20K token, 1,000 cuộc gọi vào giờ cao điểm.

Một tác nhân phân loại hỗ trợ mang theo lời nhắc hệ thống 20,000 token (chính sách, sơ đồ công cụ, ví dụ few-shot), đọc 2,000 token văn bản vé mới mỗi cuộc gọi và viết 1,000 token đầu ra. Sau 1,000 cuộc gọi:

  1. Tổng đầu vào là 1,000 × 22,000 = 22 triệu token. Tổng đầu ra là 1 triệu token.
  2. Cuộc gọi đầu tiên bỏ lỡ tất cả 22,000 token. Mọi cuộc gọi sau đó sẽ hit tiền tố 20,000 token và miss 2,000 token mới của nó.
  3. Token hit: 999 × 20,000 = 19.98 triệu. Với 0.006 USD mỗi 1 triệu: 19.98 × 0.006 = 0.12 USD.
  4. Token miss: 22,000 + 999 × 2,000 = 2.02 triệu. Với 0.30 USD mỗi 1 triệu: 2.02 × 0.30 = 0.61 USD.
  5. Đầu ra: 1 triệu × 1.20 USD = 1.20 USD.
  6. Tổng cộng: 0.12 USD + 0.61 USD + 1.20 USD = 1.93 USD.

Nếu không có bộ nhớ đệm, riêng đầu vào sẽ là 22 × 0.30 USD = 6.60 USD và công việc sẽ tốn 7.80 USD. Bộ nhớ đệm giúp giảm 75% hóa đơn. Chạy vòng lặp tương tự ngoài giờ cao điểm và mọi dòng giảm một nửa: 0.06 USD + 0.30 USD + 0.60 USD = 0.96 USD.

1,000 cuộc gọi tương tự trên V4-Pro vào giờ cao điểm (hit 0.88 USD, miss 2.67 USD, đầu ra 3.96 USD) tổng cộng 7.51 USD, con số mà khách hàng Pro nên so sánh với 1.93 USD khi việc định tuyến lại diễn ra.

Ví dụ 2: một công việc theo lô với 10 triệu token đầu ra, được chuyển ra ngoài giờ cao điểm.

Một nhóm danh mục tạo ra 10,000 mô tả sản phẩm. Mỗi cuộc gọi gửi 1,500 token dữ liệu sản phẩm (duy nhất cho mỗi mặt hàng, vì vậy không có lợi ích từ bộ nhớ đệm) và nhận lại 1,000 token nội dung. Đó là 15 triệu token đầu vào, tất cả đều miss, và 10 triệu token đầu ra.

  1. Vào giờ cao điểm: đầu vào 15 × 0.30 USD = 4.50 USD. Đầu ra 10 × 1.20 USD = 12.00 USD. Tổng cộng 16.50 USD.
  2. Ngoài giờ cao điểm: đầu vào 15 × 0.15 USD = 2.25 USD. Đầu ra 10 × 0.60 USD = 6.00 USD. Tổng cộng 8.25 USD.
  3. Tiết kiệm chỉ từ thời điểm: 8.25 USD, không cần thay đổi lời nhắc.

Đầu ra chiếm ưu thế trong công việc này và có mức giảm nhỏ nhất trong bản phát hành, vì vậy khung giờ thấp điểm là đòn bẩy lớn hơn. Đó là một khung giờ rộng rãi: 15 giờ mỗi ngày trong tuần từ 10:00 UTC, cộng thêm 48 giờ không bị gián đoạn mỗi cuối tuần.

Ngữ cảnh, đầu ra và lý do tại sao đồng thời là một phần của giá

Cả hai tên mô hình đều có ngữ cảnh 1 triệu token và đầu ra tối đa 384K token. Thẻ mô hình khuyến nghị tối đa 256K token trở lên, vì vậy hãy đặt giới hạn đó một cách có chủ đích: một phản hồi lên đến 384K token đầu ra có giá 0.46 USD vào giờ cao điểm, tốt cho một bản ghi tác nhân và là một lỗi cho tính năng tự động hoàn thành.

Đồng thời là 2,500 cho Flash so với 500 cho Pro. Nó thuộc về một bài viết về giá vì mức giảm giá ngoài giờ cao điểm chỉ có giá trị nếu bạn có thể đẩy công việc qua khung thời gian đó, và vì lưu lượng truy cập deepseek-v4-pro được định tuyến lại vào ngày 14 tháng 9 kế thừa giới hạn của Flash: một tích hợp Pro từng xếp hàng sau 500 vị trí sẽ có dung lượng gấp năm lần mà không cần thay đổi cấu hình.

Đo chi tiêu thực tế bằng Apidog

Bảng giá cho bạn biết tỷ lệ. Đối tượng usage trên mỗi phản hồi cho bạn biết bạn đã bị tính phí cho những gì. Dưới đây là một quy trình làm việc Apidog giúp việc kiểm tra này có thể lặp lại.

  1. Thêm điểm cuối. Tạo POST https://api.deepseek.com/chat/completions, hoặc nhập một đặc tả OpenAPI tương thích OpenAI.
  2. Đặt giá vào môi trường. Tạo hai môi trường Apidog, deepseek-peakdeepseek-offpeak, mỗi môi trường chứa DEEPSEEK_API_KEY cộng với PRICE_HIT, PRICE_MISS, và PRICE_OUT dưới dạng {{variables}}. Peak chứa 0.006 / 0.30 / 1.20; off-peak chứa 0.003 / 0.15 / 0.60.
  3. Gửi một lần và đọc usage. DeepSeek chia đầu vào thành prompt_cache_hit_tokensprompt_cache_miss_tokens cùng với completion_tokens [XÁC MINH]. Lưu yêu cầu dưới dạng trường hợp thử nghiệm.
  4. Xây dựng một kịch bản thử nghiệm khẳng định hành vi bộ nhớ đệm. Nối yêu cầu đã lưu hai lần với cùng một lời nhắc hệ thống 20K token. Ở bước thứ hai, khẳng định rằng trường token hit ít nhất là 19,000 và chi phí tính toán (hits × {{PRICE_HIT}} + misses × {{PRICE_MISS}} + output × {{PRICE_OUT}}, chia cho 1M) vẫn nằm trong ngân sách. Một lượt miss ở bước hai có nghĩa là tiền tố đã thay đổi, và khẳng định sẽ bắt được nó trước khi hóa đơn làm vậy.
  5. So sánh cao điểm với thấp điểm. Chạy kịch bản trong từng môi trường và so sánh dòng chi phí, hoặc chạy nó từ CI với apidog-cli theo một lịch trình trải dài qua ranh giới cao điểm UTC.

Tải xuống Apidog và toàn bộ kịch bản, bao gồm môi trường, hoạt động trên gói miễn phí.

Điều này ảnh hưởng đến hóa đơn của bạn như thế nào

V4.1-Flash rẻ hơn V4-Flash trên mọi phương diện và rẻ hơn 70 đến 86% so với mức giá của V4-Pro mà nó thay thế. Hai đòn bẩy quan trọng: giữ tiền tố dài của bạn giống hệt từng byte để nó có thể được bộ nhớ đệm, và lên lịch các công việc theo lô ngoài bảy giờ cao điểm các ngày trong tuần. Sau đó, ghi lại usage trên mỗi cuộc gọi, khẳng định số lượt hit, và để các con số cho thấy liệu mức giảm có đến được hóa đơn của bạn hay không.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API