Hướng dẫn sử dụng API DeepSeek V4 Pro 0813

DeepSeek V4 Pro đã ra mắt chính thức dưới dạng bản dựng 0813. Gọi API deepseek-v4-pro bằng Python: thiết lập, các chế độ tư duy với nội dung lý luận, truyền phát, gọi công cụ và tiết kiệm bộ nhớ đệm lời nhắc gấp 120 lần.

@apidog

@apidog

13 tháng 8 2026

Hướng dẫn sử dụng API DeepSeek V4 Pro 0813

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

DeepSeek V4 Pro đã rời khỏi giai đoạn xem trước vào ngày 12 tháng 8 năm 2026. Bản dựng GA (General Availability), được đánh số 0813, hiện đang phục vụ điểm cuối API `deepseek-v4-pro` và nó đi kèm với những con số có vẻ như là lỗi đánh máy: cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 384 nghìn token và giá đầu vào giảm xuống còn 0,003625 USD cho mỗi triệu token khi có lượt truy cập bộ nhớ đệm. Như Unite.AI đã báo cáo, mô hình đã trải qua bốn tháng xem trước giờ đây là sản phẩm chủ lực của DeepSeek.

Thông tin ra mắt cho bạn biết những gì đã được phát hành, chứ không phải cách gọi nó. Hướng dẫn này bao gồm phần thực hành: yêu cầu đầu tiên với OpenAI SDK, các chế độ tư duy và trường `reasoning_content`, truyền tải (streaming), gọi công cụ (tool calling), và phép toán bộ nhớ đệm lời nhắc (prompt-caching) quyết định liệu ngữ cảnh 1 triệu token đó có hợp lý hay gây tốn kém. Nếu bạn muốn tìm hiểu về kiến trúc trước, hãy đọc bài DeepSeek V4 là gì và quay lại đây.

Tóm tắt

Bản dựng GA 0813 thay đổi gì cho nhà phát triển

Phiên bản xem trước ra mắt vào tháng 4 năm 2026, phiên bản V4 Flash nhỏ hơn được phát hành vào tháng 7, và vào ngày 12 tháng 8, mô hình Pro đã được phát hành rộng rãi (GA) dưới dạng bản dựng 0813, theo quy ước ghi ngày tháng thông thường của DeepSeek (tương tự như cách `v3-0324` đánh dấu một phiên bản V3).

Ba điều thay đổi với GA:

  1. Phiên bản đã ổn định. Các mô hình xem trước có thể thay đổi liên tục, làm mất hiệu lực các đánh giá và tinh chỉnh lời nhắc một cách lặng lẽ. Bản dựng 0813 là một mục tiêu cố định cho đến khi DeepSeek công bố một phiên bản mới.
  2. Điểm cuối là biệt danh sản xuất. Trên API chính thức, bạn gọi `deepseek-v4-pro` và nhận bản dựng 0813; để ghim phiên bản một cách rõ ràng, OpenRouter liệt kê nó là `deepseek/deepseek-v4-pro-0813`.
  3. Toàn bộ tính năng đã được kích hoạt. Các chế độ tư duy, gọi hàm (function calling), đầu ra có cấu trúc (structured outputs), lưu trữ bộ nhớ đệm lời nhắc (prompt caching), và API đa định dạng (OpenAI, Anthropic, Responses) đều đã hoạt động trên điểm cuối GA.

Về mặt kỹ thuật, V4 Pro là một mô hình "mixture-of-experts" với tổng cộng 1.6T tham số và 49B tham số hoạt động trên mỗi token. Câu chuyện kỹ thuật nổi bật là hiệu quả: hai lược đồ chú ý, Chú ý Thưa thớt Nén (Compressed Sparse Attention) và Chú ý Nén Mạnh (Heavily Compressed Attention), giúp giảm chi phí tính toán suy luận một token xuống 27% so với V3.2 và bộ nhớ đệm KV xuống 10%. Việc giảm bộ nhớ đệm KV này là điều giúp cho ngữ cảnh 1 triệu token có thể được phục vụ với mức giá này thay vì chỉ là một tính năng trình diễn.

DeepSeek V4 Pro 0813: Thông số kỹ thuật nhanh

Thông số DeepSeek V4 Pro 0813
Phát hành GA vào ngày 12 tháng 8 năm 2026 (phiên bản `0813`)
Kiến trúc Mixture-of-experts, 1.6T tổng tham số, 49B hoạt động trên mỗi token
Chú ý (Attention) Compressed Sparse Attention + Heavily Compressed Attention
Chi phí suy luận so với V3.2 27% tính toán một token, 10% bộ nhớ đệm KV
Cửa sổ ngữ cảnh 1.000.000 token
Đầu ra tối đa 384K token
Chế độ tư duy non-think, think high, think max
Giá đầu vào 0,435 USD/M token (lỗi bộ nhớ đệm), 0,003625 USD/M (truy cập bộ nhớ đệm)
Giá đầu ra 0,87 USD/M token
Định dạng API OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses
ID mô hình `deepseek-v4-pro`
Phiên bản nhỏ hơn `deepseek-v4-flash` (284B tổng / 13B hoạt động), 0,14 USD/M đầu vào, 0,28 USD/M đầu ra

Về khả năng, thẻ mô hình của DeepSeek liệt kê SWE-bench Verified ở mức 80,6%, Terminal Bench 2.0 ở 67,9%, GPQA Diamond ở 90,1% và LiveCodeBench ở 93,5% cho V4-Pro-Max, cấu hình tư duy tối đa. Đây là những con số do nhà cung cấp tự báo cáo và chưa được bên thứ ba xác minh, vì vậy hãy chạy các đánh giá theo nhiệm vụ riêng của bạn trước khi di chuyển bất kỳ điều gì quan trọng.

Lấy khóa API và thực hiện yêu cầu đầu tiên của bạn

Thiết lập mất khoảng năm phút:

  1. Tạo tài khoản trên nền tảng DeepSeek (platform.deepseek.com) và thêm tín dụng, API là trả trước.
  2. Mở Khóa API (API Keys), tạo khóa và sao chép ngay lập tức (nó chỉ hiển thị một lần).
  3. Xuất nó dưới dạng biến môi trường thay vì dán vào mã:
export DEEPSEEK_API_KEY="sk-..."

API sử dụng giao thức OpenAI Chat Completions, vì vậy gói `openai` tiêu chuẩn là client. Cả `https://api.deepseek.com` và `https://api.deepseek.com/v1` đều hoạt động như URL cơ sở; `/v1` là khả năng tương thích giao thức, không phải phiên bản mô hình.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "system", "content": "You are a concise technical assistant."},
        {"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
    ],
)

print(response.choices[0].message.content)
print(response.usage)

In `response.usage` ngay từ ngày đầu tiên. Với một mô hình rẻ như thế này khi có lượt truy cập bộ nhớ đệm và đắt như thế này khi 1 triệu token bị lỗi bộ nhớ đệm, việc tính toán token là sự khác biệt giữa một sai số nhỏ và một hóa đơn thực sự lớn.

Yêu cầu tương tự qua HTTP thô, hữu ích cho các thử nghiệm đơn giản và để nhập vào các công cụ API:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "List three ways to version a REST API."}
    ]
  }'

Tài liệu tham khảo đầy đủ về các tham số có trong tài liệu chính thức của DeepSeek, bao gồm cả điểm cuối tương thích với Anthropic (có thể sử dụng từ Anthropic SDK và Claude Code mà không cần viết lại bất cứ điều gì) và DeepSeek’s Responses API riêng.

Làm việc với ba chế độ tư duy

V4 Pro phơi bày khả năng lý luận như một núm xoay thay vì một mô hình riêng biệt. Một điểm cuối, ba chế độ:

Các chế độ này ánh xạ tới tham số `reasoning_effort` tiêu chuẩn, vì vậy không cần cài đặt đặc trưng nhà cung cấp:

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high", # "none" | "high" | "max"
    messages=[
        {"role": "user", "content": "Our API returns 502s under load but only behind the CDN. Walk through likely causes in order of probability."},
    ],
)

message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)

Hai lưu ý thực tế. Thứ nhất, không bao giờ đưa `reasoning_content` trở lại lịch sử hội thoại; chỉ gửi `content` của các lượt trước đó. Thứ hai, các token lý luận được tính phí như các token đầu ra với giá 0,87 USD/M, vì vậy "think max" tốn tiền thật và độ trễ thật. Hãy khớp chế độ với nhiệm vụ thay vì mặc định sử dụng tối đa.

Truyền tải phản hồi (Streaming responses)

Với đầu ra tối đa 384 nghìn và các chế độ tư duy có thể lý luận dài dòng, các yêu cầu không truyền tải sẽ mang lại trải nghiệm người dùng không tốt. Đặt `stream=True` và xử lý cả hai loại delta; trong các chế độ tư duy, các phần `reasoning_content` đến trước, sau đó là câu trả lời:

stream = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",
    stream=True,
    messages=[
        {"role": "user", "content": "Design a rate limiter for a public API. Compare token bucket and sliding window."},
    ],
)

for chunk in stream:
    if not chunk.choices:
        continue # final chunk may carry usage data only
    delta = chunk.choices[0].delta
    if getattr(delta, "reasoning_content", None):
        print(delta.reasoning_content, end="", flush=True) # thinking phase
    elif delta.content:
        print(delta.content, end="", flush=True) # answer phase

Một mẫu giao diện người dùng hợp lý: hiển thị giai đoạn lý luận được thu gọn dưới dạng chỉ báo "đang tư duy", sau đó chuyển sang hiển thị bình thường khi các delta `content` bắt đầu. Về cơ bản, đây là các sự kiện được máy chủ gửi (server-sent events) tiêu chuẩn; hướng dẫn của chúng tôi về truyền tải phản hồi API với SSE bao gồm các cơ chế.

Gọi công cụ và đầu ra có cấu trúc

V4 Pro hỗ trợ gọi hàm theo kiểu OpenAI, có nghĩa là các vòng lặp tác nhân hiện có có thể được chuyển đổi mà không cần sửa đổi. Định nghĩa công cụ, đọc `tool_calls`, thực thi, nối kết quả, lặp lại:

tools = [{
    "type": "function",
    "function": {
        "name": "get_endpoint_status",
        "description": "Check the health of an internal API endpoint",
        "parameters": {
            "type": "object",
            "properties": {
                "endpoint": {"type": "string", "description": "Path, e.g. /v1/orders"}
            },
            "required": ["endpoint"],
        },
    },
}]

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Is /v1/orders healthy right now?"}],
    tools=tools,
)

print(response.choices[0].message.tool_calls)

Đầu ra có cấu trúc hoạt động thông qua tham số `response_format` tiêu chuẩn khi bạn cần JSON có thể phân tích được đảm bảo. Một hướng dẫn đầy đủ về các vòng lặp công cụ đa bước xứng đáng có một bài viết riêng; tài liệu chính thức bao gồm các chi tiết về cấu trúc thông báo.

Kinh tế học lưu bộ nhớ đệm lời nhắc: con số thay đổi kiến trúc của bạn

Đây là thông số kỹ thuật xứng đáng được chú ý hơn các điểm chuẩn. DeepSeek tự động lưu trữ các tiền tố lời nhắc, không có tiêu đề kiểm soát bộ nhớ đệm, không có cấu hình TTL, và các tiền tố lặp lại sẽ được tính phí 0,003625 USD/M thay vì 0,435 USD/M. Đó là mức giảm giá 120 lần cho đầu vào mà API đã thấy.

Hãy xem xét các con số trên một khối lượng công việc thực tế. Giả sử bạn đang xây dựng một tác nhân lập trình giữ ngữ cảnh kho lưu trữ 200 nghìn token và thực hiện 50 cuộc gọi trong một phiên:

Cùng một phiên, rẻ hơn khoảng 35 lần, và tất cả chỉ cần cấu trúc lời nhắc: nội dung ổn định trước (lời nhắc hệ thống, tài liệu, ngữ cảnh kho lưu trữ), nội dung thay đổi sau (tin nhắn mới nhất của người dùng, dấu thời gian, ID yêu cầu). Bất kỳ thay đổi nào sớm trong lời nhắc sẽ làm mất hiệu lực tiền tố đã lưu trong bộ nhớ đệm từ điểm đó trở đi, vì vậy một dấu thời gian trong lời nhắc hệ thống của bạn sẽ âm thầm chuyển đổi mọi cuộc gọi thành một lỗi bộ nhớ đệm với giá đầy đủ.

Điều này cũng định nghĩa lại cửa sổ ngữ cảnh 1 triệu token: việc điền vào nó tốn 0,435 USD khi bị lỗi, nhưng như một tiền tố phiên ổn định, nó sẽ đọc với giá khoảng một phần ba xu cho mỗi cuộc gọi. Để biết lý thuyết chung, hãy xem bài Prompt Caching là gì.

Kiểm tra deepseek-v4-pro trong Apidog

Trước khi V4 Pro được đưa vào mã sản xuất, hãy đặt điểm cuối dưới một trình gỡ lỗi phù hợp. Vì API của DeepSeek tương thích với OpenAI, Apidog sẽ nhận diện nó mà không cần xử lý đặc biệt:

  1. Nhập điểm cuối. Dán lệnh curl từ trước đó vào Apidog và nó sẽ trở thành một yêu cầu có thể chỉnh sửa, với tiêu đề, xác thực và nội dung được phân tích tự động.
  2. Thiết lập môi trường cho Pro và Flash. Lưu `base_url` và khóa API của bạn dưới dạng biến môi trường, đồng thời đặt tên mô hình cũng là một biến. Việc chuyển đổi giữa `deepseek-v4-pro` và `deepseek-v4-flash` trở thành thay đổi môi trường chỉ bằng một cú nhấp chuột, điều này làm cho câu hỏi "Pro có đáng giá gấp 3 lần Flash cho lời nhắc này không?" trở thành một câu hỏi thực nghiệm thay vì một cuộc tranh luận.
  3. Kiểm tra luồng SSE. Gửi yêu cầu với `"stream": true` và Apidog sẽ hiển thị luồng sự kiện dưới dạng dòng thời gian trực tiếp thay vì một mớ hỗn độn các dòng `data:` thô, hợp nhất các delta để bạn có thể xem `reasoning_content` đến trước câu trả lời. Khi một cuộc gọi "think-max" cảm thấy chậm, chế độ xem này cho bạn thấy chính xác thời gian đã đi đâu.
  4. Lưu phiên làm một bộ sưu tập. Khi DeepSeek phát hành phiên bản tiếp theo, hãy chạy lại các yêu cầu tương tự và so sánh hành vi trước khi bạn nâng cấp, quy trình làm việc tương tự mà các nhóm sử dụng cho các điểm cuối tương thích OpenAI nói chung.

Trình xem phản hồi cũng hiển thị khối `usage` trên mọi yêu cầu, đây là cách nhanh nhất để xác minh tỷ lệ truy cập bộ nhớ đệm của bạn trong khi bạn tinh chỉnh cấu trúc lời nhắc.

Giá hiện tại và đợt tăng giá sắp tới

Giá niêm yết hiện tại cho hai điểm cuối V4:

Mô hình Đầu vào (lỗi) Đầu vào (truy cập bộ nhớ đệm) Đầu ra
`deepseek-v4-pro` 0,435 USD/M 0,003625 USD/M 0,87 USD/M
`deepseek-v4-flash` 0,14 USD/M 0,28 USD/M

Ngay cả với giá Pro, điều này vẫn cắt giảm đáng kể so với các mô hình tiên tiến của phương Tây. Nhưng hãy lên kế hoạch với một cảnh báo: vào ngày 6 tháng 8 năm 2026, sáu ngày trước GA, DeepSeek đã cảnh báo rằng một đợt tăng giá API "đáng kể" sắp tới, chưa có con số, chưa có ngày hiệu lực.

Các biện pháp phòng ngừa thực tế khi con số chưa được biết:

Để biết phân tích chi tiết hơn về cấu trúc giá V4 và cách nó so sánh giữa các nhà cung cấp, hãy xem hướng dẫn định giá API DeepSeek V4 của chúng tôi.

Câu hỏi thường gặp

Mã OpenAI SDK hiện có của tôi có hoạt động mà không thay đổi không?

Gần như vậy. Thay đổi `base_url` thành `https://api.deepseek.com`, thay thế khóa API và đặt `model="deepseek-v4-pro"`. Chat Completions, streaming, tools và structured outputs tuân theo cấu trúc của OpenAI. Các nhóm sử dụng Anthropic SDK có thể sử dụng điểm cuối Anthropic Messages của DeepSeek thay thế.

Khi nào tôi nên sử dụng V4 Flash thay vì V4 Pro?

Flash (tổng 284B, 13B hoạt động) là mô hình khối lượng lớn: phân loại, trích xuất, trò chuyện đơn giản, bất kỳ thứ gì nhạy cảm với độ trễ mà không cần lý luận sâu sắc. Pro kiếm được giá đầu ra gấp 3 lần nhờ khả năng lập trình tác nhân, phân tích ngữ cảnh dài và khối lượng công việc ở chế độ tư duy. Định tuyến theo nhiệm vụ, không theo sự trung thành.

Tôi có thể sử dụng V4 Pro 0813 trong Cursor không?

Có, Cursor chấp nhận các điểm cuối tương thích OpenAI tùy chỉnh, vì vậy bản dựng GA có thể được thêm vào dưới dạng mô hình tùy chỉnh. Chúng tôi sẽ hướng dẫn chi tiết cách thiết lập trong bài Cách sử dụng DeepSeek V4 Pro với Cursor.

Tóm lại

Ngày đầu tiên với một mô hình GA là thời điểm thích hợp để xây dựng thói quen: khóa, yêu cầu đầu tiên, các chế độ tư duy, truyền tải và bố cục lời nhắc có nhận biết bộ nhớ đệm. V4 Pro thưởng cho thói quen cuối cùng này nhiều hơn bất kỳ mô hình nào trước đó, chiết khấu bộ nhớ đệm 120 lần khiến cấu trúc lời nhắc trở thành một quyết định kiến trúc. Hãy thử các ví dụ trên, theo dõi các con số `usage` và giữ một bộ sưu tập Apidog đã lưu để bạn có thể xác minh lại hành vi khi phiên bản tiếp theo hoặc thay đổi giá được công bố.

Tải ứng dụng

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API