DeepSeek V4 Pro đã rời khỏi giai đoạn xem trước vào ngày 12 tháng 8 năm 2026. Bản dựng GA (General Availability), được đánh số 0813, hiện đang phục vụ điểm cuối API `deepseek-v4-pro` và nó đi kèm với những con số có vẻ như là lỗi đánh máy: cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 384 nghìn token và giá đầu vào giảm xuống còn 0,003625 USD cho mỗi triệu token khi có lượt truy cập bộ nhớ đệm. Như Unite.AI đã báo cáo, mô hình đã trải qua bốn tháng xem trước giờ đây là sản phẩm chủ lực của DeepSeek.
Thông tin ra mắt cho bạn biết những gì đã được phát hành, chứ không phải cách gọi nó. Hướng dẫn này bao gồm phần thực hành: yêu cầu đầu tiên với OpenAI SDK, các chế độ tư duy và trường `reasoning_content`, truyền tải (streaming), gọi công cụ (tool calling), và phép toán bộ nhớ đệm lời nhắc (prompt-caching) quyết định liệu ngữ cảnh 1 triệu token đó có hợp lý hay gây tốn kém. Nếu bạn muốn tìm hiểu về kiến trúc trước, hãy đọc bài DeepSeek V4 là gì và quay lại đây.
Tóm tắt
- DeepSeek-V4-Pro-0813 là phiên bản GA (General Availability) đằng sau điểm cuối `deepseek-v4-pro` kể từ ngày 12 tháng 8 năm 2026, là bản dựng cần nhắm đến trong môi trường sản xuất.
- API tương thích với OpenAI: hướng SDK `openai` đến `https://api.deepseek.com`, đặt `model="deepseek-v4-pro"`, xong. Định dạng Anthropic Messages và DeepSeek’s Responses API cũng hoạt động.
- Ngữ cảnh 1 triệu token, đầu ra tối đa 384 nghìn token, ba chế độ tư duy (`non-think`, `think high`, `think max`) trả về trường `reasoning_content` cùng với câu trả lời.
- Giá: 0,435 USD/M đầu vào (lỗi bộ nhớ đệm), 0,003625 USD/M đầu vào (truy cập bộ nhớ đệm, rẻ hơn 120 lần), 0,87 USD/M đầu ra. Việc lưu trữ bộ nhớ đệm tự động thực hiện trên các tiền tố lời nhắc lặp lại.
- DeepSeek đã cảnh báo vào ngày 6 tháng 8 rằng một đợt tăng giá API "đáng kể" sắp tới. Chưa có con số hoặc ngày cụ thể, vì vậy hãy lập ngân sách với biên độ an toàn.
- Kiểm tra điểm cuối, kiểm tra luồng SSE và giữ các môi trường pro/flash song song trong Apidog trước khi bạn tích hợp nó vào bất kỳ hệ thống thực tế nào.
Bản dựng GA 0813 thay đổi gì cho nhà phát triển
Phiên bản xem trước ra mắt vào tháng 4 năm 2026, phiên bản V4 Flash nhỏ hơn được phát hành vào tháng 7, và vào ngày 12 tháng 8, mô hình Pro đã được phát hành rộng rãi (GA) dưới dạng bản dựng 0813, theo quy ước ghi ngày tháng thông thường của DeepSeek (tương tự như cách `v3-0324` đánh dấu một phiên bản V3).

Ba điều thay đổi với GA:
- Phiên bản đã ổn định. Các mô hình xem trước có thể thay đổi liên tục, làm mất hiệu lực các đánh giá và tinh chỉnh lời nhắc một cách lặng lẽ. Bản dựng 0813 là một mục tiêu cố định cho đến khi DeepSeek công bố một phiên bản mới.
- Điểm cuối là biệt danh sản xuất. Trên API chính thức, bạn gọi `deepseek-v4-pro` và nhận bản dựng 0813; để ghim phiên bản một cách rõ ràng, OpenRouter liệt kê nó là `deepseek/deepseek-v4-pro-0813`.
- Toàn bộ tính năng đã được kích hoạt. Các chế độ tư duy, gọi hàm (function calling), đầu ra có cấu trúc (structured outputs), lưu trữ bộ nhớ đệm lời nhắc (prompt caching), và API đa định dạng (OpenAI, Anthropic, Responses) đều đã hoạt động trên điểm cuối GA.
Về mặt kỹ thuật, V4 Pro là một mô hình "mixture-of-experts" với tổng cộng 1.6T tham số và 49B tham số hoạt động trên mỗi token. Câu chuyện kỹ thuật nổi bật là hiệu quả: hai lược đồ chú ý, Chú ý Thưa thớt Nén (Compressed Sparse Attention) và Chú ý Nén Mạnh (Heavily Compressed Attention), giúp giảm chi phí tính toán suy luận một token xuống 27% so với V3.2 và bộ nhớ đệm KV xuống 10%. Việc giảm bộ nhớ đệm KV này là điều giúp cho ngữ cảnh 1 triệu token có thể được phục vụ với mức giá này thay vì chỉ là một tính năng trình diễn.
DeepSeek V4 Pro 0813: Thông số kỹ thuật nhanh
| Thông số | DeepSeek V4 Pro 0813 |
|---|---|
| Phát hành | GA vào ngày 12 tháng 8 năm 2026 (phiên bản `0813`) |
| Kiến trúc | Mixture-of-experts, 1.6T tổng tham số, 49B hoạt động trên mỗi token |
| Chú ý (Attention) | Compressed Sparse Attention + Heavily Compressed Attention |
| Chi phí suy luận so với V3.2 | 27% tính toán một token, 10% bộ nhớ đệm KV |
| Cửa sổ ngữ cảnh | 1.000.000 token |
| Đầu ra tối đa | 384K token |
| Chế độ tư duy | non-think, think high, think max |
| Giá đầu vào | 0,435 USD/M token (lỗi bộ nhớ đệm), 0,003625 USD/M (truy cập bộ nhớ đệm) |
| Giá đầu ra | 0,87 USD/M token |
| Định dạng API | OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses |
| ID mô hình | `deepseek-v4-pro` |
| Phiên bản nhỏ hơn | `deepseek-v4-flash` (284B tổng / 13B hoạt động), 0,14 USD/M đầu vào, 0,28 USD/M đầu ra |
Về khả năng, thẻ mô hình của DeepSeek liệt kê SWE-bench Verified ở mức 80,6%, Terminal Bench 2.0 ở 67,9%, GPQA Diamond ở 90,1% và LiveCodeBench ở 93,5% cho V4-Pro-Max, cấu hình tư duy tối đa. Đây là những con số do nhà cung cấp tự báo cáo và chưa được bên thứ ba xác minh, vì vậy hãy chạy các đánh giá theo nhiệm vụ riêng của bạn trước khi di chuyển bất kỳ điều gì quan trọng.
Lấy khóa API và thực hiện yêu cầu đầu tiên của bạn
Thiết lập mất khoảng năm phút:
- Tạo tài khoản trên nền tảng DeepSeek (platform.deepseek.com) và thêm tín dụng, API là trả trước.
- Mở Khóa API (API Keys), tạo khóa và sao chép ngay lập tức (nó chỉ hiển thị một lần).
- Xuất nó dưới dạng biến môi trường thay vì dán vào mã:
export DEEPSEEK_API_KEY="sk-..."
API sử dụng giao thức OpenAI Chat Completions, vì vậy gói `openai` tiêu chuẩn là client. Cả `https://api.deepseek.com` và `https://api.deepseek.com/v1` đều hoạt động như URL cơ sở; `/v1` là khả năng tương thích giao thức, không phải phiên bản mô hình.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "You are a concise technical assistant."},
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
],
)
print(response.choices[0].message.content)
print(response.usage)
In `response.usage` ngay từ ngày đầu tiên. Với một mô hình rẻ như thế này khi có lượt truy cập bộ nhớ đệm và đắt như thế này khi 1 triệu token bị lỗi bộ nhớ đệm, việc tính toán token là sự khác biệt giữa một sai số nhỏ và một hóa đơn thực sự lớn.
Yêu cầu tương tự qua HTTP thô, hữu ích cho các thử nghiệm đơn giản và để nhập vào các công cụ API:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "List three ways to version a REST API."}
]
}'
Tài liệu tham khảo đầy đủ về các tham số có trong tài liệu chính thức của DeepSeek, bao gồm cả điểm cuối tương thích với Anthropic (có thể sử dụng từ Anthropic SDK và Claude Code mà không cần viết lại bất cứ điều gì) và DeepSeek’s Responses API riêng.
Làm việc với ba chế độ tư duy
V4 Pro phơi bày khả năng lý luận như một núm xoay thay vì một mô hình riêng biệt. Một điểm cuối, ba chế độ:
- non-think: mô hình trả lời trực tiếp. Nhanh nhất và rẻ nhất, phù hợp cho việc trích xuất, phân loại, định dạng và tóm tắt.
- think high: mô hình lý luận trước khi trả lời và trả về quá trình lý luận đó trong trường `reasoning_content`. Đây là chế độ mặc định cho việc viết mã, gỡ lỗi và phân tích nhiều bước.
- think max: ngân sách lý luận tối đa, cấu hình đằng sau các số liệu điểm chuẩn V4-Pro-Max. Dành cho các vấn đề thực sự khó.
Các chế độ này ánh xạ tới tham số `reasoning_effort` tiêu chuẩn, vì vậy không cần cài đặt đặc trưng nhà cung cấp:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high", # "none" | "high" | "max"
messages=[
{"role": "user", "content": "Our API returns 502s under load but only behind the CDN. Walk through likely causes in order of probability."},
],
)
message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)
Hai lưu ý thực tế. Thứ nhất, không bao giờ đưa `reasoning_content` trở lại lịch sử hội thoại; chỉ gửi `content` của các lượt trước đó. Thứ hai, các token lý luận được tính phí như các token đầu ra với giá 0,87 USD/M, vì vậy "think max" tốn tiền thật và độ trễ thật. Hãy khớp chế độ với nhiệm vụ thay vì mặc định sử dụng tối đa.
Truyền tải phản hồi (Streaming responses)
Với đầu ra tối đa 384 nghìn và các chế độ tư duy có thể lý luận dài dòng, các yêu cầu không truyền tải sẽ mang lại trải nghiệm người dùng không tốt. Đặt `stream=True` và xử lý cả hai loại delta; trong các chế độ tư duy, các phần `reasoning_content` đến trước, sau đó là câu trả lời:
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{"role": "user", "content": "Design a rate limiter for a public API. Compare token bucket and sliding window."},
],
)
for chunk in stream:
if not chunk.choices:
continue # final chunk may carry usage data only
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True) # thinking phase
elif delta.content:
print(delta.content, end="", flush=True) # answer phase
Một mẫu giao diện người dùng hợp lý: hiển thị giai đoạn lý luận được thu gọn dưới dạng chỉ báo "đang tư duy", sau đó chuyển sang hiển thị bình thường khi các delta `content` bắt đầu. Về cơ bản, đây là các sự kiện được máy chủ gửi (server-sent events) tiêu chuẩn; hướng dẫn của chúng tôi về truyền tải phản hồi API với SSE bao gồm các cơ chế.
Gọi công cụ và đầu ra có cấu trúc
V4 Pro hỗ trợ gọi hàm theo kiểu OpenAI, có nghĩa là các vòng lặp tác nhân hiện có có thể được chuyển đổi mà không cần sửa đổi. Định nghĩa công cụ, đọc `tool_calls`, thực thi, nối kết quả, lặp lại:
tools = [{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {"type": "string", "description": "Path, e.g. /v1/orders"}
},
"required": ["endpoint"],
},
},
}]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Is /v1/orders healthy right now?"}],
tools=tools,
)
print(response.choices[0].message.tool_calls)
Đầu ra có cấu trúc hoạt động thông qua tham số `response_format` tiêu chuẩn khi bạn cần JSON có thể phân tích được đảm bảo. Một hướng dẫn đầy đủ về các vòng lặp công cụ đa bước xứng đáng có một bài viết riêng; tài liệu chính thức bao gồm các chi tiết về cấu trúc thông báo.
Kinh tế học lưu bộ nhớ đệm lời nhắc: con số thay đổi kiến trúc của bạn
Đây là thông số kỹ thuật xứng đáng được chú ý hơn các điểm chuẩn. DeepSeek tự động lưu trữ các tiền tố lời nhắc, không có tiêu đề kiểm soát bộ nhớ đệm, không có cấu hình TTL, và các tiền tố lặp lại sẽ được tính phí 0,003625 USD/M thay vì 0,435 USD/M. Đó là mức giảm giá 120 lần cho đầu vào mà API đã thấy.
Hãy xem xét các con số trên một khối lượng công việc thực tế. Giả sử bạn đang xây dựng một tác nhân lập trình giữ ngữ cảnh kho lưu trữ 200 nghìn token và thực hiện 50 cuộc gọi trong một phiên:
- Không có bộ nhớ đệm: 50 cuộc gọi × 200 nghìn token × 0,435 USD/M ≈ 4,35 USD chi phí đầu vào.
- Với bộ nhớ đệm tự động: một lần lỗi bộ nhớ đệm (0,087 USD) + 49 lần truy cập bộ nhớ đệm (≈ 0,0007 USD mỗi lần) ≈ 0,12 USD.
Cùng một phiên, rẻ hơn khoảng 35 lần, và tất cả chỉ cần cấu trúc lời nhắc: nội dung ổn định trước (lời nhắc hệ thống, tài liệu, ngữ cảnh kho lưu trữ), nội dung thay đổi sau (tin nhắn mới nhất của người dùng, dấu thời gian, ID yêu cầu). Bất kỳ thay đổi nào sớm trong lời nhắc sẽ làm mất hiệu lực tiền tố đã lưu trong bộ nhớ đệm từ điểm đó trở đi, vì vậy một dấu thời gian trong lời nhắc hệ thống của bạn sẽ âm thầm chuyển đổi mọi cuộc gọi thành một lỗi bộ nhớ đệm với giá đầy đủ.
Điều này cũng định nghĩa lại cửa sổ ngữ cảnh 1 triệu token: việc điền vào nó tốn 0,435 USD khi bị lỗi, nhưng như một tiền tố phiên ổn định, nó sẽ đọc với giá khoảng một phần ba xu cho mỗi cuộc gọi. Để biết lý thuyết chung, hãy xem bài Prompt Caching là gì.
Kiểm tra deepseek-v4-pro trong Apidog
Trước khi V4 Pro được đưa vào mã sản xuất, hãy đặt điểm cuối dưới một trình gỡ lỗi phù hợp. Vì API của DeepSeek tương thích với OpenAI, Apidog sẽ nhận diện nó mà không cần xử lý đặc biệt:

- Nhập điểm cuối. Dán lệnh curl từ trước đó vào Apidog và nó sẽ trở thành một yêu cầu có thể chỉnh sửa, với tiêu đề, xác thực và nội dung được phân tích tự động.
- Thiết lập môi trường cho Pro và Flash. Lưu `base_url` và khóa API của bạn dưới dạng biến môi trường, đồng thời đặt tên mô hình cũng là một biến. Việc chuyển đổi giữa `deepseek-v4-pro` và `deepseek-v4-flash` trở thành thay đổi môi trường chỉ bằng một cú nhấp chuột, điều này làm cho câu hỏi "Pro có đáng giá gấp 3 lần Flash cho lời nhắc này không?" trở thành một câu hỏi thực nghiệm thay vì một cuộc tranh luận.
- Kiểm tra luồng SSE. Gửi yêu cầu với `"stream": true` và Apidog sẽ hiển thị luồng sự kiện dưới dạng dòng thời gian trực tiếp thay vì một mớ hỗn độn các dòng `data:` thô, hợp nhất các delta để bạn có thể xem `reasoning_content` đến trước câu trả lời. Khi một cuộc gọi "think-max" cảm thấy chậm, chế độ xem này cho bạn thấy chính xác thời gian đã đi đâu.
- Lưu phiên làm một bộ sưu tập. Khi DeepSeek phát hành phiên bản tiếp theo, hãy chạy lại các yêu cầu tương tự và so sánh hành vi trước khi bạn nâng cấp, quy trình làm việc tương tự mà các nhóm sử dụng cho các điểm cuối tương thích OpenAI nói chung.
Trình xem phản hồi cũng hiển thị khối `usage` trên mọi yêu cầu, đây là cách nhanh nhất để xác minh tỷ lệ truy cập bộ nhớ đệm của bạn trong khi bạn tinh chỉnh cấu trúc lời nhắc.
Giá hiện tại và đợt tăng giá sắp tới
Giá niêm yết hiện tại cho hai điểm cuối V4:
| Mô hình | Đầu vào (lỗi) | Đầu vào (truy cập bộ nhớ đệm) | Đầu ra |
|---|---|---|---|
| `deepseek-v4-pro` | 0,435 USD/M | 0,003625 USD/M | 0,87 USD/M |
| `deepseek-v4-flash` | 0,14 USD/M | 0,28 USD/M |
Ngay cả với giá Pro, điều này vẫn cắt giảm đáng kể so với các mô hình tiên tiến của phương Tây. Nhưng hãy lên kế hoạch với một cảnh báo: vào ngày 6 tháng 8 năm 2026, sáu ngày trước GA, DeepSeek đã cảnh báo rằng một đợt tăng giá API "đáng kể" sắp tới, chưa có con số, chưa có ngày hiệu lực.
Các biện pháp phòng ngừa thực tế khi con số chưa được biết:
- Đo lường chi phí thực tế cho mỗi nhiệm vụ của bạn ngay bây giờ, với dữ liệu `usage` từ khối lượng công việc thực tế, để bạn có thể mô hình hóa bất kỳ mức tăng nào được công bố trong vài phút thay vì đoán.
- Tối đa hóa lượt truy cập bộ nhớ đệm. Nếu mức tăng áp dụng theo tỷ lệ, các kiến trúc có nhiều tiền tố sẽ giữ được hầu hết lợi thế của chúng.
- Giữ V4 Flash làm phương án dự phòng định tuyến. Với giá 0,14 USD/0,28 USD với 13B tham số hoạt động, nó xử lý các nhiệm vụ đơn giản khối lượng lớn để Pro được dành cho các yêu cầu cần thiết.
Để biết phân tích chi tiết hơn về cấu trúc giá V4 và cách nó so sánh giữa các nhà cung cấp, hãy xem hướng dẫn định giá API DeepSeek V4 của chúng tôi.
Câu hỏi thường gặp
Mã OpenAI SDK hiện có của tôi có hoạt động mà không thay đổi không?
Gần như vậy. Thay đổi `base_url` thành `https://api.deepseek.com`, thay thế khóa API và đặt `model="deepseek-v4-pro"`. Chat Completions, streaming, tools và structured outputs tuân theo cấu trúc của OpenAI. Các nhóm sử dụng Anthropic SDK có thể sử dụng điểm cuối Anthropic Messages của DeepSeek thay thế.
Khi nào tôi nên sử dụng V4 Flash thay vì V4 Pro?
Flash (tổng 284B, 13B hoạt động) là mô hình khối lượng lớn: phân loại, trích xuất, trò chuyện đơn giản, bất kỳ thứ gì nhạy cảm với độ trễ mà không cần lý luận sâu sắc. Pro kiếm được giá đầu ra gấp 3 lần nhờ khả năng lập trình tác nhân, phân tích ngữ cảnh dài và khối lượng công việc ở chế độ tư duy. Định tuyến theo nhiệm vụ, không theo sự trung thành.
Tôi có thể sử dụng V4 Pro 0813 trong Cursor không?
Có, Cursor chấp nhận các điểm cuối tương thích OpenAI tùy chỉnh, vì vậy bản dựng GA có thể được thêm vào dưới dạng mô hình tùy chỉnh. Chúng tôi sẽ hướng dẫn chi tiết cách thiết lập trong bài Cách sử dụng DeepSeek V4 Pro với Cursor.
Tóm lại
Ngày đầu tiên với một mô hình GA là thời điểm thích hợp để xây dựng thói quen: khóa, yêu cầu đầu tiên, các chế độ tư duy, truyền tải và bố cục lời nhắc có nhận biết bộ nhớ đệm. V4 Pro thưởng cho thói quen cuối cùng này nhiều hơn bất kỳ mô hình nào trước đó, chiết khấu bộ nhớ đệm 120 lần khiến cấu trúc lời nhắc trở thành một quyết định kiến trúc. Hãy thử các ví dụ trên, theo dõi các con số `usage` và giữ một bộ sưu tập Apidog đã lưu để bạn có thể xác minh lại hành vi khi phiên bản tiếp theo hoặc thay đổi giá được công bố.
