DeepSeek đã phát hành API DeepSeek-V4-Flash chính thức vào sáng nay. Thông báo được đưa ra vào ngày 31 tháng 7 năm 2026, và ghi chú phát hành đã làm rõ ba điều: khả năng tác tử của mô hình đã được nâng cấp đáng kể, nó hiện hỗ trợ định dạng Responses API của OpenAI một cách tự nhiên, và nó hoạt động với Codex ngay từ ngày đầu tiên.
Nếu bạn đã sử dụng deepseek-v4-flash từ tháng 4, bạn đang dùng phiên bản xem trước. Bản phát hành này nâng cấp mô hình lên phiên bản chính thức, DeepSeek-V4-Flash-0731, và bạn sẽ nhận được bản nâng cấp mà không cần thay đổi bất kỳ dòng mã nào. Tên mô hình vẫn giữ nguyên.
Hướng dẫn này sẽ trình bày mọi thứ: lấy khóa API, thực hiện cuộc gọi đầu tiên của bạn, bật và tắt chế độ tư duy, và giá của phiên bản beta công khai trông như thế nào. Nếu bạn mới làm quen với các sản phẩm của DeepSeek, hãy bắt đầu với DeepSeek V4 là gì? để có cái nhìn tổng quan về dòng sản phẩm, sau đó quay lại đây.
Những gì thực sự được phát hành vào ngày 31 tháng 7
Theo nhật ký thay đổi chính thức, bản phát hành chỉ bao gồm API. Các mô hình ứng dụng và web của DeepSeek không thay đổi, và API V4-Pro cũng không thay đổi. Đây là tóm tắt:
- DeepSeek-V4-Flash-0731 là bản phát hành chính thức của dòng V4-Flash, hiện đang trong giai đoạn thử nghiệm công khai trên API.
- Kiến trúc và kích thước giống như V4-Flash-Preview. DeepSeek cho biết mô hình chỉ được huấn luyện lại sau đó, vì vậy những cải tiến đến từ việc huấn luyện, chứ không phải từ một mạng lớn hơn.
- Điểm chuẩn tác tử đã vượt qua V4-Pro-Preview. DeepSeek báo cáo Terminal Bench 2.1 đạt 82.7, Cybergym đạt 76.7, Toolathlon xác minh đạt 70.3, và DeepSWE đạt 54.4. Đây là những số liệu do DeepSeek tự công bố, được kiểm tra với bộ công cụ của họ ở mức nỗ lực tối đa.
- Hỗ trợ Responses API gốc và tích hợp Codex chính thức. Chúng tôi sẽ đi sâu vào cả hai trong bài viết DeepSeek-V4-Flash hiện hỗ trợ Responses API và Codex.
- Bản phát hành chính thức của DeepSeek-V4-Pro “sẽ sớm ra mắt,” theo nhật ký thay đổi. Hỗ trợ Responses API và Codex cho V4-Pro dự kiến vào đầu tháng 8 năm 2026.
Một lưu ý chân thành: tuyên bố điểm chuẩn nổi bật (“vượt xa V4-Pro-Preview”) đến từ đánh giá nội bộ của DeepSeek, và hai trong số các điểm chuẩn được liệt kê (DSBench-FullStack và DSBench-Hard) là các bộ dữ liệu thử nghiệm nội bộ. Các số liệu độc lập sẽ cần vài ngày để xuất hiện.

Bước 1: Lấy khóa API của bạn
Truy cập Nền tảng DeepSeek, đăng nhập và tạo khóa từ trang Khóa API. Các khóa bắt đầu bằng sk-. Lưu nó dưới dạng biến môi trường thay vì mã hóa cứng:
export DEEPSEEK_API_KEY="sk-your-key-here"
DeepSeek API tương thích với cả định dạng API của OpenAI và Anthropic, vì vậy bạn không cần một SDK dành riêng cho DeepSeek. Hai URL cơ sở quan trọng là:
| Định dạng | URL cơ sở |
|---|---|
| Tương thích OpenAI | https://api.deepseek.com |
| Tương thích Anthropic | https://api.deepseek.com/anthropic |
Bước 2: Thực hiện cuộc gọi đầu tiên của bạn
Cách kiểm tra nhanh nhất là dùng curl:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Summarize what changed in DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
Cuộc gọi tương tự thông qua OpenAI Python SDK:
# pip3 install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Write a Python function that validates an email address."}
],
stream=False
)
print(response.choices[0].message.content)
Và Node.js:
// npm install openai
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "Hello!" }],
});
console.log(completion.choices[0].message.content);
Vì tên mô hình deepseek-v4-flash hiện trỏ đến bản phát hành 0731, mọi tích hợp hiện có mà bạn đã xây dựng dựa trên phiên bản xem trước sẽ tự động nhận mô hình mới. Không cần di chuyển gì cả.
Bước 3: Kiểm soát chế độ tư duy và nỗ lực suy luận
V4-Flash hỗ trợ cả chế độ không tư duy và chế độ tư duy, và tư duy là mặc định. Bạn kiểm soát nó bằng tham số thinking, và có thể điều chỉnh độ sâu bằng reasoning_effort:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Plan a database migration from MySQL to Postgres."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
Hai hành vi đáng chú ý trước khi bạn điều chỉnh các tham số:
temperaturevàtop_pkhông có tác dụng khi chế độ tư duy đang bật.- Hoàn thành FIM (điền vào giữa, vẫn còn bản beta) chỉ hoạt động ở chế độ không tư duy.
Đối với các điểm cuối nhạy cảm với độ trễ như tự động hoàn thành, hãy tắt chế độ tư duy. Đối với các vòng lặp tác tử và các tác vụ gỡ lỗi khó, hãy bật chế độ này và tăng mức độ nỗ lực.
Bước 4: Truyền tải phản hồi
Đặt stream: true và API sẽ trả về các sự kiện được gửi từ máy chủ (server-sent events). Nếu bạn chưa từng gỡ lỗi các tải trọng SSE trước đây, hướng dẫn của chúng tôi về truyền tải phản hồi LLM bằng các sự kiện được gửi từ máy chủ sẽ trình bày chi tiết định dạng này.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Explain connection pooling."}],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Giá trong giai đoạn beta công khai
Theo trang Mô hình & Giá cả chính thức, V4-Flash vẫn có giá rất cạnh tranh:
| Mục | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Đầu vào, trúng cache (mỗi 1 triệu token) | $0.0028 | $0.003625 |
| Đầu vào, trượt cache (mỗi 1 triệu token) | $0.14 | $0.435 |
| Đầu ra (mỗi 1 triệu token) | $0.28 | $0.87 |
| Độ dài ngữ cảnh | 1 triệu token | 1 triệu token |
| Đầu ra tối đa | 384K | 384K |
| Giới hạn đồng thời | 2,500 | 500 |
Ba lưu ý về giá:
- Việc lưu cache ngữ cảnh là tự động, và một lần trúng cache tốn kém ít hơn 50 lần so với trượt cache. Các phiên tác tử chạy dài sử dụng lại một lời nhắc hệ thống sẽ hưởng lợi rất lớn.
- DeepSeek đã công bố chính sách giờ cao điểm/thấp điểm: sử dụng trong giờ cao điểm (9:00-12:00 và 14:00-18:00 giờ Bắc Kinh) sẽ được tính phí gấp 2 lần giá thông thường. Tính đến ngày 31 tháng 7, tài liệu ghi rằng ngày có hiệu lực là “tùy thuộc vào thông báo chính thức,” vì vậy nó chưa hoạt động. Hãy theo dõi trang giá cả.
- Giới hạn đồng thời nói lên điều riêng của nó: 2.500 yêu cầu đồng thời cho Flash so với 500 cho Pro. DeepSeek đã xây dựng mô hình này để được sử dụng mạnh mẽ bởi các đội tác tử.
Để có cái nhìn toàn diện hơn về chi phí trên toàn bộ dòng V4, bao gồm lịch sử giảm giá vĩnh viễn V4-Pro, hãy xem phân tích giá DeepSeek V4 API của chúng tôi.
Kiểm tra và gỡ lỗi API trong Apidog
Sử dụng curl thô hoạt động cho một thử nghiệm sơ bộ, nhưng khi bạn so sánh đầu ra tư duy với không tư duy, hoặc xem cách mô hình truyền tải các lệnh gọi công cụ, bạn cần khả năng hiển thị. Dưới đây là một quy trình làm việc mất khoảng năm phút trong Apidog:

- Tạo dự án và thêm điểm cuối. Thêm
POST https://api.deepseek.com/chat/completions(hoặc nhập một thông số kỹ thuật tương thích với OpenAI để tất cả các điểm cuối được thêm cùng lúc). - Lưu khóa dưới dạng biến môi trường. Đặt
DEEPSEEK_API_KEYvào một môi trường Apidog và tham chiếu nó trong tiêu đề Authorization dưới dạngBearer {{DEEPSEEK_API_KEY}}. Việc chuyển đổi giữa khóa thử nghiệm và khóa sản xuất chỉ bằng một cú nhấp chuột chọn từ menu thả xuống. - Gửi và kiểm tra. Đối với các cuộc gọi streaming, Apidog hiển thị các sự kiện SSE khi chúng đến, vì vậy bạn có thể xem nội dung suy luận và nội dung trả lời xuất hiện dưới dạng các delta riêng biệt thay vì phải nhìn chằm chằm vào một khối các dòng
data:thô. - Lưu các biến thể dưới dạng trường hợp thử nghiệm. Giữ một yêu cầu đã lưu với chế độ tư duy được bật và một yêu cầu không có, sau đó chạy lại cả hai sau mỗi lần cập nhật mô hình. Khi DeepSeek phát hành bản nâng cấp ẩn tiếp theo cho
deepseek-v4-flash, bạn sẽ biết chỉ trong một cú nhấp chuột liệu các lời nhắc của mình có còn hoạt động đúng như mong đợi hay không.
Tải Apidog miễn phí, toàn bộ quy trình trên hoạt động trên gói miễn phí.
Câu hỏi thường gặp
Tôi có cần thay đổi mã của mình để có được mô hình mới không? Không. Tên mô hình deepseek-v4-flash hiện phục vụ DeepSeek-V4-Flash-0731. Các tích hợp hiện có sẽ tự động nâng cấp.
Đây có phải là cùng một mô hình với ứng dụng DeepSeek không? Không. Bản cập nhật ngày 31 tháng 7 chỉ bao gồm API. Các mô hình ứng dụng và web không thay đổi.
Điều gì đã xảy ra với deepseek-chat và deepseek-reasoner? Các tên mô hình cũ đó đã được lên lịch ngừng hoạt động vào ngày 24 tháng 7 năm 2026. Hãy sử dụng deepseek-v4-flash hoặc deepseek-v4-pro. Hướng dẫn của chúng tôi về cách sử dụng DeepSeek V4 API bao gồm việc di chuyển.
Tôi có thể sử dụng miễn phí không? API của DeepSeek là hình thức trả tiền theo mức sử dụng mà không có gói miễn phí vĩnh viễn, nhưng giá trúng cache làm cho việc thử nghiệm gần như miễn phí trong thực tế. Xem cách sử dụng DeepSeek V4 API miễn phí để biết các tùy chọn hiện tại.
V4-Flash có hoạt động với Codex và Responses API không? Có, cả hai, và đây là mô hình DeepSeek duy nhất làm được điều đó cho đến nay. Hỗ trợ V4-Pro dự kiến vào đầu tháng 8 năm 2026. Thiết lập đầy đủ trong hướng dẫn Responses API và Codex của chúng tôi.
Tổng kết
DeepSeek-V4-Flash-0731 là một bản phát hành "thầm lặng": cùng tên mô hình, cùng mức giá, cùng kiến trúc, và một bộ điểm chuẩn tác tử hiện đã đánh bại V4-Pro-Preview lớn hơn, ít nhất là theo các thử nghiệm của DeepSeek. Hỗ trợ Responses API và khả năng thích ứng với Codex báo hiệu mục tiêu của mô hình này: khối lượng công việc tác tử đồng thời cao với mức giá thấp hơn mọi phòng thí nghiệm phương Tây.
Hãy lấy một khóa, trỏ OpenAI SDK của bạn đến https://api.deepseek.com, và chạy mô hình qua bộ thử nghiệm của riêng bạn trước khi tin tưởng vào bảng điểm chuẩn. Apidog giúp vòng lặp xác minh đó nhanh chóng: lưu các lời nhắc của bạn dưới dạng trường hợp thử nghiệm một lần, chạy lại chúng sau mỗi lần cập nhật mô hình, và bạn sẽ không bao giờ bị bất ngờ bởi một bản nâng cấp ẩn nữa.
