Cách sử dụng API DeepSeek-V4.1-Flash?

Gọi API DeepSeek-V4.1-Flash: ID mô hình deepseek-flash, URL cơ sở, lần gọi đầu tiên bằng curl/Python/Node, nỗ lực suy luận, đầu vào hình ảnh, phát trực tuyến, giá cả.

INEZA Felin-Michel

INEZA Felin-Michel

10 tháng 9 2026

Cách sử dụng API DeepSeek-V4.1-Flash?

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

DeepSeek-V4.1-Flash đã ra mắt chính thức API hôm nay, ngày 10 tháng 9 năm 2026. Thông báo phát hành ngắn gọn, nhưng nó thay đổi ba điều đối với bất kỳ ai gọi API DeepSeek: từ nay về sau sẽ có một ID mô hình duy nhất để sử dụng, đó là deepseek-flash; giá mỗi token lại giảm; và trong bốn ngày nữa, vào ngày 14 tháng 9, mọi yêu cầu tới deepseek-v4-pro sẽ được chuyển hướng sang mô hình này và tính phí theo giá Flash.

Điểm cuối cùng đó là lý do tại sao hướng dẫn này tồn tại. Nếu bạn có mã sản xuất chạy trên V4-Pro, bạn sẽ không được chọn ngày di chuyển. Nếu bạn đang dùng V4-Flash, bạn đã được phục vụ bởi mô hình mới dưới tên cũ. Dù bằng cách nào, các tham số bạn gửi hôm nay đều đáng để kiểm tra.

Bài đăng này bao gồm các khía cạnh thực tế: ID mô hình, URL cơ sở, lần gọi đầu tiên bằng ba ngôn ngữ, nỗ lực suy luận, đầu vào hình ảnh, truyền phát (streaming) và giá cả. Để biết về kiến trúc và câu chuyện điểm chuẩn, hãy đọc DeepSeek-V4.1-Flash là gì trước.

Trước khi đưa bất cứ thứ gì vào mã, bạn sẽ muốn có một cách nhanh chóng để gửi yêu cầu và so sánh phản hồi. Apidog xử lý điều đó: trỏ nó đến https://api.deepseek.com, lưu khóa dưới dạng biến và lưu mỗi lệnh gọi hoạt động như một bài kiểm tra có thể chạy lại. Quy trình làm việc nằm gần cuối.

button

Tóm tắt nhanh

Những thay đổi dành cho người gọi API

Đây là những thay đổi, được lấy từ thông báo phát hành và nhật ký thay đổi.

Một ID mô hình duy nhất. Tên chính thức hiện là deepseek-flash, không có số phiên bản. Hãy gắn các lời nhắc (prompts) và kiểm tra của bạn vào hành vi, chứ không phải chuỗi phiên bản, vì bản phát hành Flash tiếp theo sẽ ra mắt dưới cùng tên này.

Các tên cũ vẫn được định tuyến. deepseek-v4-flashdeepseek-v4-flash-vision-exp hiện vẫn được chấp nhận, nhưng các mô hình đằng sau chúng, V4-Flash và V4-Flash-Vision-Exp, đã ngừng hoạt động. Các yêu cầu tới những tên đó sẽ được phục vụ bởi V4.1-Flash. Không có gì bị hỏng, nhưng bạn không chạy mô hình mà bạn nghĩ. Hãy đổi tên khi có thể.

Tên bản beta đã biến mất. Bản beta hai ngày từ ngày 8 tháng 9 chạy dưới tên deepseek-v4.1-flash-expires-on-0910. Nó đã hết hạn như đã hứa. Chuyển sang deepseek-flash.

URL cơ sở và định dạng không thay đổi. Các lệnh gọi tương thích OpenAI đến https://api.deepseek.com, các lệnh gọi tương thích Anthropic đến https://api.deepseek.com/anthropic, và định dạng API Phản hồi mà dòng Flash đã hỗ trợ vẫn được giữ nguyên. Cấu hình SDK của bạn không thay đổi.

V4-Pro chỉ còn bốn ngày. Từ ngày 14 tháng 9 năm 2026 lúc 04:00 UTC (12:00 Bắc Kinh), mọi yêu cầu deepseek-v4-pro sẽ được định tuyến đến V4.1-Flash và tính phí theo giá V4.1-Flash. Lý do DeepSeek đưa ra là V4.1-Flash "đã vượt trội hoàn toàn so với V4 Pro về hiệu suất, chi phí, tốc độ và tổng thời gian", trích dẫn các thử nghiệm của nhiều bên. Đó là một tuyên bố của nhà cung cấp. Hướng dẫn di chuyển khi ngừng hoạt động của V4-Pro cho bạn biết cách kiểm tra điều này trên các lời nhắc của riêng bạn trước khi việc chuyển đổi xảy ra.

Bước 1: Lấy khóa API

Đăng nhập vào nền tảng DeepSeek, mở API Keys và tạo một khóa. Khóa bắt đầu bằng sk-. Xuất nó thay vì dán trực tiếp vào mã nguồn:

export DEEPSEEK_API_KEY="sk-your-key-here"

Không cần SDK cụ thể của DeepSeek. Các thư viện client của OpenAI và Anthropic đều hoạt động sau khi bạn thay đổi URL cơ sở.

Bước 2: Thực hiện cuộc gọi đầu tiên của bạn

Sử dụng curl trước, vì nó loại bỏ mọi biến trừ chính API:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {"role": "system", "content": "You are a support engineer for a payments API."},
      {"role": "user", "content": "A customer gets HTTP 402 on /v1/charges. List the three most likely causes."}
    ],
    "stream": false
  }'

Cuộc gọi tương tự thông qua OpenAI Python SDK:

# pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "system", "content": "You are a support engineer for a payments API."},
        {"role": "user", "content": "A customer gets HTTP 402 on /v1/charges. List the three most likely causes."},
    ],
)

print(response.choices[0].message.content)

Và Node:

// npm install openai
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await client.chat.completions.create({
  model: "deepseek-flash",
  messages: [
    { role: "user", content: "Write a Postgres migration that adds a nullable refunded_at timestamp to invoices." },
  ],
});

console.log(completion.choices[0].message.content);

Nếu bạn đã thiết lập với bản phát hành trước bằng cách làm theo hướng dẫn API V4-Flash, điểm khác biệt duy nhất là chuỗi mô hình.

Bước 3: Nỗ lực suy luận và chế độ tư duy

Thẻ mô hình mô tả nỗ lực suy luận là "có thể kiểm soát liên tục" trên thang điểm từ 1 đến 100. Đó là sự khác biệt so với các cài đặt sẵn thấp/trung bình/cao mà hầu hết các API hiển thị, và nó có nghĩa là bạn có thể điều chỉnh chi phí và độ trễ cho từng endpoint thay vì từng cấp.

Hình dạng tham số mang giá trị từ 1 đến 100 đó là [XÁC MINH] so với tài liệu API. Cho đến khi họ xác nhận, hãy bắt đầu từ mẫu V4-Flash: reasoning_effort cộng với một đối tượng thinking được truyền qua extra_body:

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Our Redis cluster drops 2% of SETs under load. Plan the investigation."}],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}},
)

Cài đặt lấy mẫu được khuyến nghị từ thẻ mô hình: temperature 1.0, top_p 0.95 hoặc 1.0, và max_tokens từ 256K trở lên cho các chuỗi suy luận dài. Đầu ra tối đa là 384K token.

Một cách phân chia thực tế: tắt chế độ tư duy (thinking off) cho tự động hoàn thành, phân loại và bất cứ điều gì người dùng đang chờ đợi; bật chế độ tư duy (thinking on) ở nỗ lực cao cho các vòng lặp tác nhân, tái cấu trúc nhiều tệp và gỡ lỗi. Sau đó đo lường. Nỗ lực mà bạn không thấy trong đầu ra vẫn là nỗ lực mà bạn phải trả tiền.

Bước 4: Gửi hình ảnh

V4.1-Flash là mô hình đa phương thức bản địa, được đào tạo trên một kho dữ liệu đa phương thức 45T token với bộ mã hóa DeepSeek-ViT được đào tạo từ đầu. Định dạng yêu cầu được kế thừa từ V4-Flash-Vision-Exp: hình ảnh là một phần của mảng content trong tin nhắn người dùng.

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Extract every line item and the total from this receipt as JSON."},
            {"type": "image_url", "image_url": {"url": "https://cdn.example-shop.com/receipts/48213.png"}},
        ],
    }],
)

Đối với tệp cục bộ, hãy mã hóa nó dưới dạng URL dữ liệu base64:

import base64

with open("receipt.png", "rb") as f:
    data_url = "data:image/png;base64," + base64.b64encode(f.read()).decode()

# sau đó truyền {"url": data_url} vào phần image_url

Giới hạn: URL dữ liệu base64 lên đến 32 MiB, URL bên ngoài lên đến 8.192 ký tự hoặc ID tệp. Trường `detail` tùy chọn được chấp nhận. DeepSeek báo cáo DocVQA 95.6, là trường hợp đọc tài liệu ở trên. Hướng dẫn API thị giác bao gồm các lời nhắc đa hình ảnh, mức độ chi tiết và chi phí của hình ảnh cho mỗi yêu cầu.

Bước 5: Truyền phát phản hồi

Đặt stream=True và endpoint sẽ trả về các sự kiện được gửi từ máy chủ (server-sent events). Nội dung suy luận và nội dung câu trả lời đến dưới dạng các delta riêng biệt, điều này quan trọng khi bạn hiển thị trạng thái "đang suy nghĩ" trong giao diện người dùng.

stream = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Explain idempotency keys in one paragraph."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    if delta.content:
        print(delta.content, end="", flush=True)

Nếu SSE còn mới với bạn, truyền phát phản hồi LLM bằng các sự kiện được gửi từ máy chủ giải thích định dạng truyền tải và các trường hợp lỗi kết nối lại.

Giá tổng quan

Từ trang giá chính thức, có hiệu lực từ ngày 10 tháng 9 năm 2026 lúc 04:00 UTC, tính bằng USD cho mỗi 1 triệu token:

deepseek-flash ngoài giờ cao điểm deepseek-flash giờ cao điểm
Đầu vào, trúng bộ nhớ đệm $0.003 $0.006
Đầu vào, trượt bộ nhớ đệm $0.15 $0.30
Đầu ra $0.60 $1.20

Ba điều cần biết:

Kiểm tra API trong Apidog

Khi cuộc gọi đầu tiên hoạt động, câu hỏi đặt ra là liệu nó có tiếp tục hoạt động hay không. deepseek-flash không mang phiên bản, vì vậy bản nâng cấp tiếp theo sẽ diễn ra âm thầm. Đây là quy trình làm việc của Apidog giúp phát hiện điều đó:

  1. Thêm endpoint. Tạo POST https://api.deepseek.com/chat/completions, hoặc nhập một đặc tả OpenAPI tương thích OpenAI để mọi tuyến đường được đưa vào cùng lúc.
  2. Lưu khóa dưới dạng biến môi trường. Đặt DEEPSEEK_API_KEY vào môi trường Apidog và đặt tiêu đề là Bearer {{DEEPSEEK_API_KEY}}. Việc chuyển đổi giữa khóa cá nhân và khóa sản xuất trở thành một menu thả xuống.
  3. Lưu một yêu cầu cho mỗi cấp độ nỗ lực. Sao chép yêu cầu cơ sở thành các biến thể: tắt chế độ tư duy, bật chế độ tư duy ở mức nỗ lực thấp, bật chế độ tư duy ở mức nỗ lực cao. Cùng một lời nhắc, các tham số khác nhau. Gửi cả ba và so sánh việc sử dụng token và độ trễ song song.
  4. Theo dõi luồng. Đối với stream: true, Apidog hiển thị các sự kiện SSE khi chúng đến, vì vậy các delta suy luận và delta nội dung sẽ xuất hiện dưới dạng các dòng riêng biệt thay vì một loạt các tiền tố data:.
  5. Biến các biến thể thành một kịch bản kiểm thử. Thêm các xác nhận về mã trạng thái, về số lượt trúng bộ nhớ đệm trong usage lớn hơn 0 trong lần chạy thứ hai, và về phản hồi chứa các trường mà ứng dụng của bạn phân tích cú pháp. Chạy lại kịch bản sau mỗi lần cập nhật mô hình và vào ngày 14 tháng 9 khi việc chuyển hướng V4-Pro có hiệu lực.
  6. Chạy trong CI. apidog-cli thực thi cùng một kịch bản từ một pipeline, vì vậy một thay đổi mô hình âm thầm sẽ làm lỗi bản dựng thay vì ảnh hưởng đến khách hàng.

Tải xuống Apidog và toàn bộ thiết lập mất khoảng mười phút.

Câu hỏi thường gặp

Trước khi chuyển hướng

Bề mặt API hầu như không thay đổi: cùng URL cơ sở, cùng định dạng yêu cầu, một ID mô hình mới. Cái đã thay đổi là giá cả và, vào ngày 14 tháng 9, việc định tuyến mọi cuộc gọi V4-Pro. Đổi tên deepseek-v4-flash thành deepseek-flash, chọn một mức độ nỗ lực cho mỗi endpoint và chạy các lời nhắc của bạn qua mô hình mới trước khi DeepSeek làm điều đó cho bạn.

Lưu các lời nhắc đó dưới dạng kiểm thử trong khi bạn thực hiện. Apidog chạy lại chúng chỉ với một cú nhấp chuột, và bản nâng cấp Flash âm thầm tiếp theo sẽ hiển thị dưới dạng một xác nhận thất bại thay vì một yêu cầu hỗ trợ.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API