DeepSeek API Sắp Tăng Giá: Cẩm Nang Tối Ưu Chi Phí Cho Developer

DeepSeek cho biết giá API sắp tăng đáng kể. Hãy giảm thiểu rủi ro của bạn ngay bây giờ: lưu bộ nhớ đệm lời nhắc, định tuyến Flash/Pro, xử lý theo lô ngoài giờ cao điểm, kiểm tra chuyển đổi dự phòng và xem các kịch bản tăng giá gấp 1,5 đến 3 lần sẽ ảnh hưởng đến hóa đơn của bạn như thế nào.

INEZA Felin-Michel

INEZA Felin-Michel

13 tháng 8 2026

DeepSeek API Sắp Tăng Giá: Cẩm Nang Tối Ưu Chi Phí Cho Developer

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

DeepSeek đã xây dựng cộng đồng nhà phát triển của mình dựa trên một giao dịch đơn giản: các mô hình gần tiên tiến với mức giá khiến đồng hồ đo trở nên không đáng kể. Vào ngày 6 tháng 8 năm 2026, công ty cảnh báo rằng giao dịch này sắp thay đổi. Trong một thông báo được Dataconomy đưa tin đầu tiên, DeepSeek cho biết giá API sẽ tăng "trong thời gian tới" và mức tăng này dự kiến sẽ "đáng kể". Không có con số cụ thể. Không có ngày hiệu lực. Không có chi tiết phân tích theo mô hình hoặc bậc giá.

Bối cảnh khiến cảnh báo này trở nên đáng tin cậy. DeepSeek viện dẫn chi phí tính toán tăng cao, tắc nghẽn dung lượng và lượng truy cập khổng lồ trên V4-Flash và V4-Pro. Đây là lần thay đổi giá thứ hai trong vòng chưa đầy một tháng, giá cao điểm và thấp điểm đã được áp dụng vào giữa tháng 7, và nó diễn ra khi V4 Pro 0813 đạt được trạng thái khả dụng rộng rãi vào ngày 12 tháng 8, điều này đẩy nhu cầu tăng lên chứ không giảm xuống. eWeek nhận định động thái này là một phép thử đối với lợi thế chi phí thấp đã biến DeepSeek thành lựa chọn mặc định cho các nhóm trong khu vực APAC và hơn thế nữa.

Bạn không thể kiểm soát các mức giá mới. Bạn có thể kiểm soát số lượng token bạn mua, ở bậc nào, vào giờ nào và từ nhà cung cấp nào. Hướng dẫn này bao gồm năm động thái cần thực hiện trước khi mức tăng giá có hiệu lực, cộng với việc các kịch bản tăng 1.5 lần, 2 lần và 3 lần sẽ ảnh hưởng như thế nào đến một khối lượng công việc mẫu.

TL;DR

DeepSeek đã công bố gì và chưa công bố gì

Thông tin tiết lộ khá ít ỏi: giá trên toàn bộ API sẽ tăng "trong thời gian tới", mức tăng sẽ "đáng kể", và các nguyên nhân là chi phí tính toán, tắc nghẽn dung lượng, và lượng truy cập lớn trên các điểm cuối V4-Flash và V4-Pro. Đó là tất cả những gì DeepSeek đã nói. Tính đến hôm nay, ngày 13 tháng 8, các mức giá hiện tại vẫn được áp dụng, và thời gian đang trôi.

Bây giờ là những khoảng trống. DeepSeek chưa nói rõ giá sẽ tăng bao nhiêu, khi nào tăng, liệu V4-Flash và V4-Pro có tăng theo cùng một hệ số không, liệu tỷ lệ truy cập bộ nhớ đệm (cache-hit rates) có tỷ lệ thuận với tỷ lệ không truy cập bộ nhớ đệm (cache-miss rates) không, hay liệu các khối lượng công việc suy luận có được xử lý khác biệt không. Các chủ đề trên Hacker News dự đoán mức tăng từ 2 đến 3 lần. Đó là suy đoán chưa được xác nhận và không có sự hỗ trợ chính thức, hãy lên kế hoạch cho một khoảng giá trị chứ không phải một con số cụ thể.

Đây là bảng giá mà các kịch bản đó sẽ nhân lên:

Mô hình Đầu vào (lỗi bộ nhớ đệm) Đầu vào (đạt bộ nhớ đệm) Đầu ra
DeepSeek V4-Pro $0.435 / M tokens $0.003625 / M tokens $0.87 / M tokens
DeepSeek V4-Flash $0.14 / M tokens $0.28 / M tokens

Cả hai mô hình đều có cửa sổ ngữ cảnh 1 triệu token. Để biết chi tiết đầy đủ, hãy xem hướng dẫn giá API DeepSeek V4 của chúng tôi; bảng giá trực tiếp nằm trong tài liệu API của DeepSeek.

Hai tỷ lệ trong bảng đó định hướng toàn bộ kế hoạch: đầu vào đã lưu vào bộ nhớ đệm có chi phí chưa đến 1% so với đầu vào không tìm thấy trong bộ nhớ đệm, và V4-Pro có giá khoảng gấp 3 lần V4-Flash ở cả đầu vào và đầu ra. Mỗi bước dưới đây đều khai thác một trong những khoảng cách đó.

Bước 1: Đo lường mức độ ảnh hưởng của bạn trước khi giá tăng

Việc tăng giá là một hệ số nhân trên một con số mà hầu hết các nhóm không thể xác định chính xác. Trước khi điều chỉnh lời nhắc hoặc định tuyến, hãy đo lường mức độ sử dụng của bạn để bạn biết hệ số nhân này áp dụng cho cái gì.

Gắn thẻ mỗi cuộc gọi mô hình với tính năng hoặc điểm cuối đã kích hoạt nó, sau đó ghi lại số lượng token mà API đã trả về:

usage = response.usage
log.info("llm_call", extra={
    "feature": "ticket-summarizer", # ai đang chi tiêu
    "model": "deepseek-v4-flash",
    "input_tokens": usage.prompt_tokens,
    "output_tokens": usage.completion_tokens,
    "cache_hit_tokens": usage.prompt_cache_hit_tokens,
})

Mẫu đầy đủ, phân bổ, bảng điều khiển, kinh tế đơn vị theo tính năng, có trong cách theo dõi chi tiêu API OpenAI theo tính năng, và nó có thể chuyển sang DeepSeek mà không thay đổi.

Một tuần dữ liệu sẽ trả lời các câu hỏi quyết định mọi thứ khác: điều gì đã thúc đẩy phần lớn chi tiêu của bạn, tỷ lệ token đầu vào nào được lưu vào bộ nhớ đệm, bao nhiêu lưu lượng truy cập V4-Pro đang thực hiện công việc có hình dạng V4-Flash, và ở mức hệ số nhân nào mỗi tính năng làm hỏng kinh tế đơn vị của bạn. Con số cuối cùng đó là ngưỡng của Bước 5 của bạn, hãy ghi lại.

Bước 2: Tối đa hóa số lần truy cập bộ nhớ đệm, đòn bẩy lớn nhất

DeepSeek tự động lưu trữ các tiền tố lời nhắc. Khi các token mở đầu của một yêu cầu khớp với một yêu cầu gần đây, tiền tố lặp lại đó sẽ được tính theo tỷ lệ truy cập bộ nhớ đệm: 0.003625 đô la cho mỗi triệu token đầu vào trên V4-Pro thay vì 0.435 đô la. Không có cờ kiểm soát bộ nhớ đệm, không quản lý TTL, giảm giá hoàn toàn phụ thuộc vào mức độ lặp lại của cấu trúc lời nhắc của bạn. Nếu bộ nhớ đệm tiền tố là điều mới mẻ đối với bạn, hướng dẫn cơ bản của chúng tôi về bộ nhớ đệm lời nhắc là gì và cách nó hoạt động sẽ giải thích cơ chế.

Giúp tiền tố của bạn ổn định theo byte

Đọc tỷ lệ truy cập của bạn từ mỗi phản hồi

DeepSeek báo cáo hiệu suất bộ nhớ đệm trong đối tượng usage của mỗi phản hồi, được ghi lại trong tài liệu API của DeepSeek:

u = response.usage
hit_rate = u.prompt_cache_hit_tokens / (
    u.prompt_cache_hit_tokens + u.prompt_cache_miss_tokens
)

Theo dõi tỷ lệ đó cho mỗi tính năng trong công cụ đo lường từ Bước 1. Nếu một tính năng có cấu trúc lặp lại cho thấy tỷ lệ truy cập thấp, có nghĩa là có điều gì đó trong tiền tố của nó đang thay đổi, và việc sửa lỗi đó thường chỉ mất một ngày để điều chỉnh lời nhắc với lợi ích vĩnh viễn ở bất kỳ mức giá nào tiếp theo.

Bước 3: Định tuyến theo tác vụ, không theo thói quen

V4-Pro với giá gấp khoảng 3 lần V4-Flash là mức giá tốt cho việc suy luận sâu. Nhưng đó là mức giá tệ để định dạng lại JSON. Hầu hết các cơ sở mã chọn một mô hình trong giai đoạn tạo mẫu và không bao giờ xem xét lại, thường là Pro theo mặc định. Hãy kiểm tra dữ liệu Bước 1 của bạn và định tuyến một cách có chủ đích:

Dạng khối lượng công việc Định tuyến đến
Phân loại, trích xuất, định dạng, định tuyến ý định V4-Flash, suy nghĩ tối thiểu
Tóm tắt, trả lời RAG, tạo bản nháp đầu tiên Ưu tiên V4-Flash; chỉ nâng cấp lên Pro khi đánh giá thất bại
Vòng lặp tác nhân đa bước, gỡ lỗi khó, phân tích kiến trúc V4-Pro, với ngân sách suy nghĩ

Kỷ luật trong suy nghĩ quan trọng không kém việc lựa chọn mô hình. Các dấu vết suy luận được tính phí dưới dạng token đầu ra, những token đắt nhất mà DeepSeek bán với giá 0.87 đô la cho mỗi triệu trên Pro, vì vậy việc cài đặt suy nghĩ tối đa cho một lộ trình phân loại sẽ phải trả giá suy luận cho một lần tra cứu. Giới hạn nỗ lực suy nghĩ cho mỗi lộ trình: không hoặc tối thiểu cho các tác vụ cơ học, suy nghĩ sâu sắc dành cho các vòng lặp tác nhân và công việc phân tích mang lại lợi ích rõ rệt.

Hãy hạ cấp dựa trên bằng chứng, không phải cảm tính: chuyển một lộ trình sang Flash hoặc ngân sách suy nghĩ thấp hơn, chạy bộ đánh giá của bạn và duy trì thay đổi khi chất lượng được giữ vững.

Bước 4: Chuyển công việc theo lô sang khung giờ thấp điểm

Giá cao điểm/thấp điểm mà DeepSeek giới thiệu vào giữa tháng 7 là một thay đổi gần đây có lợi cho bạn, nhưng hầu hết các nhóm vẫn bỏ qua nó. Các khung giờ và giảm giá hiện tại được công bố trên bảng giá trong tài liệu API của DeepSeek.

Bất kỳ công việc nào không có con người chờ đợi đều là ứng cử viên: các lần chạy đánh giá hàng đêm, điền lại nhúng (embedding backfills), gắn nhãn tập dữ liệu, bộ kiểm thử hồi quy lời nhắc CI. Đặt những công việc đó vào một hàng đợi với một cửa sổ phát hành thay vì kích hoạt chúng theo yêu cầu, một thay đổi lịch trình một ngày mà không cần xác thực chất lượng, vì các token là giống hệt nhau và chỉ có thời gian thay đổi.

Một lưu ý: DeepSeek chưa nói liệu mức chênh lệch giá ngoài giờ cao điểm có được duy trì sau khi tăng giá hay không. Hãy tận dụng nó ngay bây giờ; kiểm tra lại khi có thông báo giá mới.

Hóa đơn của bạn ở mức 1.5 lần, 2 lần và 3 lần

Đây là các kịch bản minh họa, không phải dự đoán. DeepSeek chưa công bố bất kỳ hệ số nhân nào, và không ai biết liệu tất cả các bậc có tăng đồng đều hay không, bảng dưới đây giả định là có, được áp dụng cho một khối lượng công việc hư cấu nhưng thực tế.

Khối lượng công việc mẫu hàng tháng: V4-Pro xử lý 400 triệu token đầu vào với tỷ lệ truy cập bộ nhớ đệm 60% cộng với 60 triệu token đầu ra (69.60 đô la lỗi + 0.87 đô la truy cập + 52.20 đô la đầu ra = 122.67 đô la). V4-Flash xử lý 600 triệu token đầu vào và 120 triệu token đầu ra (84.00 đô la + 33.60 đô la = 117.60 đô la). Hóa đơn cơ bản: 240.27 đô la.

Cột "đã tối ưu hóa" áp dụng Bước 2–3: tái cấu trúc tiền tố nâng tỷ lệ truy cập bộ nhớ đệm của Pro lên 85%, và ngân sách suy nghĩ cắt giảm đầu ra của Pro xuống còn 45 triệu token (26.10 đô la + 1.23 đô la + 39.15 đô la = 66.48 đô la, Flash không thay đổi, tổng cộng 184.08 đô la). Các số liệu được làm tròn đến đô la:

Kịch bản tỷ lệ Hóa đơn chưa tối ưu Đã tối ưu (Bước 2–3)
Giá hiện tại $240 $184
Tăng 1.5 lần $360 $276
Tăng 2 lần $481 $368
Tăng 3 lần $721 $552

Đọc theo đường chéo: khối lượng công việc đã tối ưu hóa với mức tăng 2 lần (368 đô la) có chi phí xấp xỉ mức mà khối lượng công việc chưa tối ưu phải trả ở mức tăng 1.5 lần (360 đô la). Tiết kiệm cấu trúc tỷ lệ thuận với bất kỳ hệ số nhân nào, mức giảm 23% có giá trị 56 đô la hôm nay và 168 đô la trong kịch bản tăng 3 lần. Việc xử lý theo lô ngoài giờ cao điểm không được mô hình hóa ở đây vì mức giảm giá phụ thuộc vào lịch trình trực tiếp, vì vậy hãy coi cột đã tối ưu hóa là thận trọng.

Khi nào chuyển đổi mô hình tốt hơn việc tối ưu hóa

Ngay cả kịch bản tiêu cực nhất của những suy đoán cũng cho thấy DeepSeek vẫn rẻ xét về mặt tuyệt đối: mức tăng 3 lần đẩy giá đầu ra của V4-Pro lên 2.61 đô la cho mỗi triệu token, trong khi các so sánh công khai đặt đầu ra của các đối thủ tiên phong ở mức 25–30 đô la cho mỗi triệu. Khoảng cách về độ lớn vẫn tồn tại trong mọi kịch bản được đồn đại, eWeek gọi đây là sự xói mòn lợi thế của DeepSeek, chứ không phải là sự kết thúc của nó.

Vậy khi nào thì việc chuyển đổi sẽ thắng thế?

Hãy tối ưu hóa và duy trì khi DeepSeek vượt qua các đánh giá chất lượng của bạn, chi tiêu của bạn tập trung vào lưu lượng có thể lưu vào bộ nhớ đệm và định tuyến, và bạn có đủ thời gian kỹ thuật trước khi các mức giá mới được áp dụng. Kế hoạch trên mang lại hiệu quả cộng dồn; chi phí chuyển đổi là một lần và lớn.

Hãy chuyển đổi, hoặc chia lưu lượng khi giới hạn truy cập bộ nhớ đệm của bạn thấp về mặt cấu trúc (mỗi yêu cầu mang theo các tài liệu dài độc đáo, nên không có tiền tố nào để tái sử dụng), khi bạn đang trả giá Pro cho các tác vụ mà một mô hình nhỏ hơn của đối thủ cạnh tranh vượt qua trong các đánh giá của bạn, hoặc khi hệ số nhân được công bố vượt quá ngưỡng hòa vốn mà bạn đã tính toán trong Bước 1.

Đối với hầu hết các nhóm, câu trả lời trung thực là kết hợp: giữ DeepSeek ở những nơi nó chiến thắng về chi phí trên mỗi đánh giá đạt, di chuyển các lộ trình không hiệu quả, và duy trì bộ kiểm thử tương đương Bước 5 để bất kỳ bất ngờ về giá nào tiếp theo, từ bất kỳ nhà cung cấp nào, chỉ là một thay đổi cấu hình, chứ không phải là một cuộc khủng hoảng.

Tổng kết

DeepSeek đã nói với bạn rằng giá sẽ tăng nhưng không nói gì thêm. Các nhóm thành công sẽ là những nhóm hành động trong khoảng thời gian này: đo lường chi tiêu theo tính năng, ổn định các tiền tố lời nhắc, định tuyến công việc dạng Flash tới Flash, đẩy các công việc theo lô vào giờ thấp điểm, và chứng minh rằng nhà cung cấp thứ hai hoạt động tốt trước khi bạn cần đến nó.

Mỗi bước đều có thể đo lường được, và hầu hết chỉ mất vài ngày, không phải các đợt chạy nước rút. Để xử lý một nửa việc chuyển đổi dự phòng trong một công cụ, hãy tải Apidog miễn phí: xây dựng bộ kiểm thử một lần, trỏ nó đến api.deepseek.com và phương án dự phòng của bạn với các môi trường cho từng nhà cung cấp, và lên lịch để giữ cả hai minh bạch trong khi tin tức về giá cả phát triển.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API