DeepSeek-V4-Flash API Đã Ra Mắt: Hướng Dẫn Sử Dụng API Chính Thức (Bản Thử Nghiệm Công Khai)

DeepSeek-V4-Flash-0731 hiện đã ra mắt bản thử nghiệm công khai. Nhận khóa API, thực hiện lời gọi đầu tiên, kiểm soát chế độ tư duy và xem giá dựa trên lượt truy cập bộ nhớ đệm trong hướng dẫn thực hành này.

Ashley Innocent

Ashley Innocent

31 tháng 7 2026

DeepSeek-V4-Flash API Đã Ra Mắt: Hướng Dẫn Sử Dụng API Chính Thức (Bản Thử Nghiệm Công Khai)

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

DeepSeek đã phát hành API DeepSeek-V4-Flash chính thức vào sáng nay. Thông báo được đưa ra vào ngày 31 tháng 7 năm 2026, và ghi chú phát hành đã làm rõ ba điều: khả năng tác tử của mô hình đã được nâng cấp đáng kể, nó hiện hỗ trợ định dạng Responses API của OpenAI một cách tự nhiên, và nó hoạt động với Codex ngay từ ngày đầu tiên.

Nếu bạn đã sử dụng deepseek-v4-flash từ tháng 4, bạn đang dùng phiên bản xem trước. Bản phát hành này nâng cấp mô hình lên phiên bản chính thức, DeepSeek-V4-Flash-0731, và bạn sẽ nhận được bản nâng cấp mà không cần thay đổi bất kỳ dòng mã nào. Tên mô hình vẫn giữ nguyên.

Hướng dẫn này sẽ trình bày mọi thứ: lấy khóa API, thực hiện cuộc gọi đầu tiên của bạn, bật và tắt chế độ tư duy, và giá của phiên bản beta công khai trông như thế nào. Nếu bạn mới làm quen với các sản phẩm của DeepSeek, hãy bắt đầu với DeepSeek V4 là gì? để có cái nhìn tổng quan về dòng sản phẩm, sau đó quay lại đây.

💡
Sau khi có khóa, bạn sẽ muốn có một cách nhanh chóng để kiểm tra các điểm cuối trước khi đưa chúng vào mã. Apidog cho phép bạn gửi yêu cầu đến DeepSeek API, kiểm tra các phản hồi streaming từng sự kiện một và lưu mỗi cuộc gọi hoạt động như một bài kiểm tra có thể tái sử dụng. Chi tiết về thiết lập này bên dưới.
nút

Những gì thực sự được phát hành vào ngày 31 tháng 7

Theo nhật ký thay đổi chính thức, bản phát hành chỉ bao gồm API. Các mô hình ứng dụng và web của DeepSeek không thay đổi, và API V4-Pro cũng không thay đổi. Đây là tóm tắt:

Một lưu ý chân thành: tuyên bố điểm chuẩn nổi bật (“vượt xa V4-Pro-Preview”) đến từ đánh giá nội bộ của DeepSeek, và hai trong số các điểm chuẩn được liệt kê (DSBench-FullStack và DSBench-Hard) là các bộ dữ liệu thử nghiệm nội bộ. Các số liệu độc lập sẽ cần vài ngày để xuất hiện.

Bước 1: Lấy khóa API của bạn

Truy cập Nền tảng DeepSeek, đăng nhập và tạo khóa từ trang Khóa API. Các khóa bắt đầu bằng sk-. Lưu nó dưới dạng biến môi trường thay vì mã hóa cứng:

export DEEPSEEK_API_KEY="sk-your-key-here"

DeepSeek API tương thích với cả định dạng API của OpenAI và Anthropic, vì vậy bạn không cần một SDK dành riêng cho DeepSeek. Hai URL cơ sở quan trọng là:

Định dạng URL cơ sở
Tương thích OpenAI https://api.deepseek.com
Tương thích Anthropic https://api.deepseek.com/anthropic

Bước 2: Thực hiện cuộc gọi đầu tiên của bạn

Cách kiểm tra nhanh nhất là dùng curl:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "Summarize what changed in DeepSeek-V4-Flash-0731."}
    ],
    "stream": false
  }'

Cuộc gọi tương tự thông qua OpenAI Python SDK:

# pip3 install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Write a Python function that validates an email address."}
    ],
    stream=False
)

print(response.choices[0].message.content)

Và Node.js:

// npm install openai
import OpenAI from "openai";

const openai = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await openai.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [{ role: "user", content: "Hello!" }],
});

console.log(completion.choices[0].message.content);

Vì tên mô hình deepseek-v4-flash hiện trỏ đến bản phát hành 0731, mọi tích hợp hiện có mà bạn đã xây dựng dựa trên phiên bản xem trước sẽ tự động nhận mô hình mới. Không cần di chuyển gì cả.

Bước 3: Kiểm soát chế độ tư duy và nỗ lực suy luận

V4-Flash hỗ trợ cả chế độ không tư duy và chế độ tư duy, và tư duy là mặc định. Bạn kiểm soát nó bằng tham số thinking, và có thể điều chỉnh độ sâu bằng reasoning_effort:

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Plan a database migration from MySQL to Postgres."}],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}}
)

Hai hành vi đáng chú ý trước khi bạn điều chỉnh các tham số:

Đối với các điểm cuối nhạy cảm với độ trễ như tự động hoàn thành, hãy tắt chế độ tư duy. Đối với các vòng lặp tác tử và các tác vụ gỡ lỗi khó, hãy bật chế độ này và tăng mức độ nỗ lực.

Bước 4: Truyền tải phản hồi

Đặt stream: true và API sẽ trả về các sự kiện được gửi từ máy chủ (server-sent events). Nếu bạn chưa từng gỡ lỗi các tải trọng SSE trước đây, hướng dẫn của chúng tôi về truyền tải phản hồi LLM bằng các sự kiện được gửi từ máy chủ sẽ trình bày chi tiết định dạng này.

stream = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Explain connection pooling."}],
    stream=True
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

Giá trong giai đoạn beta công khai

Theo trang Mô hình & Giá cả chính thức, V4-Flash vẫn có giá rất cạnh tranh:

Mục deepseek-v4-flash deepseek-v4-pro
Đầu vào, trúng cache (mỗi 1 triệu token) $0.0028 $0.003625
Đầu vào, trượt cache (mỗi 1 triệu token) $0.14 $0.435
Đầu ra (mỗi 1 triệu token) $0.28 $0.87
Độ dài ngữ cảnh 1 triệu token 1 triệu token
Đầu ra tối đa 384K 384K
Giới hạn đồng thời 2,500 500

Ba lưu ý về giá:

Để có cái nhìn toàn diện hơn về chi phí trên toàn bộ dòng V4, bao gồm lịch sử giảm giá vĩnh viễn V4-Pro, hãy xem phân tích giá DeepSeek V4 API của chúng tôi.

Kiểm tra và gỡ lỗi API trong Apidog

Sử dụng curl thô hoạt động cho một thử nghiệm sơ bộ, nhưng khi bạn so sánh đầu ra tư duy với không tư duy, hoặc xem cách mô hình truyền tải các lệnh gọi công cụ, bạn cần khả năng hiển thị. Dưới đây là một quy trình làm việc mất khoảng năm phút trong Apidog:

  1. Tạo dự án và thêm điểm cuối. Thêm POST https://api.deepseek.com/chat/completions (hoặc nhập một thông số kỹ thuật tương thích với OpenAI để tất cả các điểm cuối được thêm cùng lúc).
  2. Lưu khóa dưới dạng biến môi trường. Đặt DEEPSEEK_API_KEY vào một môi trường Apidog và tham chiếu nó trong tiêu đề Authorization dưới dạng Bearer {{DEEPSEEK_API_KEY}}. Việc chuyển đổi giữa khóa thử nghiệm và khóa sản xuất chỉ bằng một cú nhấp chuột chọn từ menu thả xuống.
  3. Gửi và kiểm tra. Đối với các cuộc gọi streaming, Apidog hiển thị các sự kiện SSE khi chúng đến, vì vậy bạn có thể xem nội dung suy luận và nội dung trả lời xuất hiện dưới dạng các delta riêng biệt thay vì phải nhìn chằm chằm vào một khối các dòng data: thô.
  4. Lưu các biến thể dưới dạng trường hợp thử nghiệm. Giữ một yêu cầu đã lưu với chế độ tư duy được bật và một yêu cầu không có, sau đó chạy lại cả hai sau mỗi lần cập nhật mô hình. Khi DeepSeek phát hành bản nâng cấp ẩn tiếp theo cho deepseek-v4-flash, bạn sẽ biết chỉ trong một cú nhấp chuột liệu các lời nhắc của mình có còn hoạt động đúng như mong đợi hay không.

Tải Apidog miễn phí, toàn bộ quy trình trên hoạt động trên gói miễn phí.

Câu hỏi thường gặp

Tôi có cần thay đổi mã của mình để có được mô hình mới không? Không. Tên mô hình deepseek-v4-flash hiện phục vụ DeepSeek-V4-Flash-0731. Các tích hợp hiện có sẽ tự động nâng cấp.

Đây có phải là cùng một mô hình với ứng dụng DeepSeek không? Không. Bản cập nhật ngày 31 tháng 7 chỉ bao gồm API. Các mô hình ứng dụng và web không thay đổi.

Điều gì đã xảy ra với deepseek-chat và deepseek-reasoner? Các tên mô hình cũ đó đã được lên lịch ngừng hoạt động vào ngày 24 tháng 7 năm 2026. Hãy sử dụng deepseek-v4-flash hoặc deepseek-v4-pro. Hướng dẫn của chúng tôi về cách sử dụng DeepSeek V4 API bao gồm việc di chuyển.

Tôi có thể sử dụng miễn phí không? API của DeepSeek là hình thức trả tiền theo mức sử dụng mà không có gói miễn phí vĩnh viễn, nhưng giá trúng cache làm cho việc thử nghiệm gần như miễn phí trong thực tế. Xem cách sử dụng DeepSeek V4 API miễn phí để biết các tùy chọn hiện tại.

V4-Flash có hoạt động với Codex và Responses API không? Có, cả hai, và đây là mô hình DeepSeek duy nhất làm được điều đó cho đến nay. Hỗ trợ V4-Pro dự kiến vào đầu tháng 8 năm 2026. Thiết lập đầy đủ trong hướng dẫn Responses API và Codex của chúng tôi.

Tổng kết

DeepSeek-V4-Flash-0731 là một bản phát hành "thầm lặng": cùng tên mô hình, cùng mức giá, cùng kiến trúc, và một bộ điểm chuẩn tác tử hiện đã đánh bại V4-Pro-Preview lớn hơn, ít nhất là theo các thử nghiệm của DeepSeek. Hỗ trợ Responses API và khả năng thích ứng với Codex báo hiệu mục tiêu của mô hình này: khối lượng công việc tác tử đồng thời cao với mức giá thấp hơn mọi phòng thí nghiệm phương Tây.

Hãy lấy một khóa, trỏ OpenAI SDK của bạn đến https://api.deepseek.com, và chạy mô hình qua bộ thử nghiệm của riêng bạn trước khi tin tưởng vào bảng điểm chuẩn. Apidog giúp vòng lặp xác minh đó nhanh chóng: lưu các lời nhắc của bạn dưới dạng trường hợp thử nghiệm một lần, chạy lại chúng sau mỗi lần cập nhật mô hình, và bạn sẽ không bao giờ bị bất ngờ bởi một bản nâng cấp ẩn nữa.

nút

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API