DeepSeek V4-Pro ngừng hoạt động 14/9: Hướng dẫn di chuyển sang V4.1-Flash

DeepSeek ngừng hoạt động V4-Pro vào ngày 14 tháng 9 năm 2026 và chuyển hướng các yêu cầu đến V4.1-Flash. Những thay đổi nào, một danh sách kiểm tra di chuyển và cách kiểm tra trước khi chuyển đổi.

INEZA Felin-Michel

INEZA Felin-Michel

10 tháng 9 2026

DeepSeek V4-Pro ngừng hoạt động 14/9: Hướng dẫn di chuyển sang V4.1-Flash

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

DeepSeek đã cho người dùng deepseek-v4-pro bốn ngày. Vào ngày 14 tháng 9 năm 2026 lúc 04:00 UTC (12:00 Bắc Kinh), mọi yêu cầu gọi deepseek-v4-pro sẽ được chuyển hướng đến DeepSeek-V4.1-Flash và tính phí theo mức của V4.1-Flash. Không có lỗi. Không có cảnh báo. Hóa đơn của bạn sẽ giảm, và một mô hình khác sẽ bắt đầu trả lời các yêu cầu của bạn.

Phần cuối cùng đó là điều cần lên kế hoạch. Thông báo phát hành mô tả sự thay đổi này như một bản nâng cấp, và theo số liệu của DeepSeek thì đúng là như vậy. Nhưng “chuyển hướng ngầm” không giống như “đã được kiểm thử”. Nếu sản phẩm của bạn phụ thuộc vào một định dạng gọi công cụ cụ thể hoặc một ngân sách độ trễ mà bạn đã điều chỉnh dựa trên V4-Pro, bạn sẽ muốn biết những thay đổi này trước Chủ Nhật, chứ không phải sau đó.

Hướng dẫn này bao gồm những gì DeepSeek đã công bố, điều gì sẽ xảy ra nếu bạn không làm gì, danh sách kiểm tra di chuyển và cách xây dựng bộ kiểm thử hồi quy Pro so với Flash trong Apidog để quá trình chuyển đổi diễn ra suôn sẻ. Đối với bản thân mô hình, trước tiên hãy đọc DeepSeek-V4.1-Flash là gì.

TÓM TẮT

DeepSeek đã công bố gì vào ngày 10 tháng 9

Mục nhật ký thay đổi ngày 10 tháng 9 bao gồm hai điều: V4.1-Flash được phát hành rộng rãi trên API và V4-Pro sẽ ngừng hoạt động bốn ngày sau đó.

Về V4-Pro, DeepSeek nói thẳng rằng V4.1-Flash “đã vượt trội hoàn toàn so với V4 Pro về hiệu suất, chi phí, tốc độ và tổng thời gian”, trích dẫn “các thử nghiệm bởi nhiều bên”. Từ ngày 14 tháng 9 lúc 04:00 UTC, các yêu cầu đến deepseek-v4-pro sẽ được phục vụ bởi V4.1-Flash và tính phí theo mức của V4.1-Flash. Không có thời gian ân hạn nào mà Pro tiếp tục chạy dưới tên cũ.

Việc dọn dẹp tên gọi còn mở rộng hơn cả Pro:

Tên mô hình Trạng thái sau ngày 10 tháng 9
deepseek-flash ID chính tắc mới cho V4.1-Flash
deepseek-v4-flash Vẫn được chấp nhận, được phục vụ bởi V4.1-Flash
deepseek-v4-flash-vision-exp Vẫn được chấp nhận, được phục vụ bởi V4.1-Flash
deepseek-v4-pro Được phục vụ bởi V4-Pro cho đến 04:00 UTC ngày 14 tháng 9, sau đó được chuyển hướng sang V4.1-Flash

V4-Flash và V4-Flash-Vision-Exp với tư cách là các mô hình đã ngừng hoạt động; chỉ tên của chúng còn tồn tại dưới dạng bí danh. Các URL cơ sở không thay đổi: https://api.deepseek.com cho định dạng tương thích OpenAI và https://api.deepseek.com/anthropic cho định dạng tương thích Anthropic. Hướng dẫn sử dụng API V4.1-Flash trình bày chi tiết về ID mô hình mới, kiểm soát lập luận và đầu vào hình ảnh.

Điều gì sẽ xảy ra nếu bạn không làm gì

Phiên bản ngắn gọn: tích hợp của bạn vẫn hoạt động và trở nên rẻ hơn. Phiên bản dài hơn: năm điều sẽ thay đổi mà bạn không hay biết.

Một mô hình khác trả lời. V4.1-Flash là một MoE 552B tham số với bố cục Mã hóa-Giải mã Causal mới: 40 lớp, 20 bộ mã hóa và 20 bộ giải mã, 8 tỷ tham số hoạt động trong giai đoạn tiền điền và 16 tỷ trong giai đoạn giải mã. Các yêu cầu của bạn hiện sẽ sử dụng ngân sách tham số hoạt động khác và thiết kế cơ chế chú ý khác (Compressed Sparse Attention 2). Hãy mong đợi cách diễn đạt khác, độ chi tiết mặc định khác và đôi khi là các quyết định khác nhau đối với các cuộc gọi công cụ cận biên.

Giới hạn đầu ra vẫn giữ nguyên, nhưng các cài đặt được khuyến nghị thì không. Cả hai mô hình đều liệt kê 1 triệu ngữ cảnh và 384K đầu ra tối đa. Thẻ mô hình V4.1-Flash khuyến nghị nhiệt độ 1.0, top_p 0.95 hoặc 1.0, và tối đa token 256K trở lên. Nếu bạn đặt max_tokens chặt chẽ trên V4-Pro để giới hạn chi phí, hãy kiểm tra xem đầu ra lập luận có bị cắt cụt trước khi câu trả lời đến hay không.

Nỗ lực lập luận hoạt động trên một thang đo khác. DeepSeek mô tả nỗ lực lập luận của V4.1-Flash là "có thể kiểm soát liên tục" trên thang điểm từ 1 đến 100. V4-Flash chấp nhận reasoning_effort cộng với extra_body={"thinking": {"type": "enabled"}}. Cách thang điểm 1 đến 100 ánh xạ vào tham số API là [KIỂM TRA] dựa trên tài liệu hiện tại; đừng cho rằng một mức độ được đặt tên như "high" có nghĩa là độ sâu như nó đã làm trên Pro.

Giá thay đổi có lợi cho bạn, với một khung giờ cao điểm. Giờ cao điểm là từ Thứ Hai đến Thứ Sáu, 01:00 đến 04:00 và 06:00 đến 10:00 UTC. Giờ thấp điểm bằng một nửa giờ cao điểm. Lưu lượng truy cập Pro được chuyển hướng sẽ trả theo mức giá Flash trong cả hai khung giờ.

Giới hạn đồng thời tăng vọt. Giới hạn của V4-Pro là 500 yêu cầu đồng thời. Flash là 2.500. Lưu lượng truy cập được chuyển hướng kế thừa giới hạn cao hơn, vì vậy hãy xem xét lại mọi cài đặt backoff phía máy khách đã điều chỉnh theo 500.

Danh sách kiểm tra di chuyển

Thực hiện theo thứ tự. Cùng nhau, chúng sẽ biến việc chuyển hướng ngầm thành một bản phát hành có chủ đích.

  1. Đổi tên ID mô hình. Tìm kiếm trong codebase và cấu hình của bạn từ deepseek-v4-pro và thay thế bằng deepseek-flash. Hãy làm điều này ngay cả khi bí danh vẫn hoạt động: ID rõ ràng giúp các sự cố dễ đọc hơn sau này.
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",  # trước đây là "deepseek-v4-pro"
    messages=[
        {"role": "system", "content": "Bạn xử lý các yêu cầu hỗ trợ. Trả về một đối tượng JSON với mức độ ưu tiên, đội ngũ và tóm tắt."},
        {"role": "user", "content": "Khách hàng báo cáo rằng thanh toán trả về lỗi 502 sau khi áp dụng mã giảm giá."},
    ],
    response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
  1. Kiểm tra lại cài đặt nỗ lực lập luận. Liệt kê mọi nơi bạn đã đặt reasoning_effort hoặc một công tắc tư duy. Quyết định cho từng điểm cuối xem bạn muốn độ sâu hay độ trễ, sau đó kiểm tra từng cái với thang đo mới thay vì giữ nguyên giá trị cũ.
  2. Chạy lại các bài kiểm thử gọi hàm và đầu ra có cấu trúc. Định dạng đối số gọi công cụ là nơi việc thay đổi mô hình gây khó khăn nhất. Nếu bạn đã viết các bài kiểm thử khi thiết lập gọi hàm trên V4-Pro, hãy chạy chúng với deepseek-flash ngay bây giờ. Nếu bạn chưa, quy trình làm việc Apidog bên dưới sẽ cung cấp cho bạn một bộ.
  3. Kiểm tra lại trình phân tích luồng của bạn. V4.1-Flash truyền tải các delta lập luận và delta câu trả lời riêng biệt ở chế độ tư duy. Xác nhận rằng bộ xử lý SSE của bạn không nối chúng lại với nhau và bộ đếm thời gian "token đầu tiên" của bạn đo lường chính xác những gì bạn nghĩ nó đang làm.
  4. Thiết lập lại đường cơ sở độ trễ và chi phí. Ghi lại độ trễ p50 và p95 cùng số token trên mỗi yêu cầu trên V4-Pro trong tuần này, sau đó làm tương tự trên deepseek-flash. Bạn sẽ cần cả hai con số khi ai đó hỏi tại sao bảng điều khiển thay đổi vào thứ Hai.
  5. Cập nhật bảng điều khiển và ngân sách. Các cảnh báo chi phí được hiệu chỉnh cho đầu ra 3.96 đô la vào giờ cao điểm sẽ không còn báo động khi bạn chỉ phải trả 1.20 đô la, và một ngân sách không bao giờ được kích hoạt là một ngân sách không ai để ý. Đặt lại ngưỡng theo mức giá trên trang giá và sửa bất kỳ phân tích chi phí theo mô hình nào lọc theo ID cũ.

Nếu bạn gọi các định dạng API tương thích Anthropic hoặc Responses thay vì hoàn thành cuộc trò chuyện, các bước tương tự cũng được áp dụng; so sánh các định dạng API của V4-Pro cho thấy mỗi yêu cầu trông như thế nào để bạn có thể ánh xạ các trường.

V4-Pro so với V4.1-Flash: Tổng quan nhanh

Các số liệu điểm chuẩn do DeepSeek báo cáo, từ thẻ mô hình V4.1-Flash. Giá là USD trên 1 triệu token, có hiệu lực từ ngày 10 tháng 9 năm 2026.

deepseek-v4-pro deepseek-flash (V4.1)
Tham số hoạt động Không được nêu lại trên thẻ V4.1 8B tiền điền / 16B giải mã
HumanEval 76.8 79.4
GSM8K 92.6 93.0
DeepSWE v1.1 62.7 74.2
Terminal-Bench 2.1 87.9 90.6
Đầu vào, cache hit (thấp điểm / cao điểm) $0.022 / $0.044 $0.003 / $0.006
Đầu vào, cache miss (thấp điểm / cao điểm) $0.66 / $1.32 $0.15 / $0.30
Đầu ra (thấp điểm / cao điểm) $1.98 / $3.96 $0.60 / $1.20
Ngữ cảnh / đầu ra tối đa 1M / 384K 1M / 384K
Giới hạn đồng thời 500 2.500

Khoảng cách lớn nhất là DeepSWE, tăng 11.5 điểm. Nhỏ nhất là GSM8K, tăng 0.4 điểm. Nếu khối lượng công việc của bạn giống như các phép toán cấp tiểu học, hãy kỳ vọng sự tương đương; nếu nó giống như việc chỉnh sửa mã nhiều tệp, các con số của DeepSeek cho thấy bạn sẽ có lợi. Phân tích ba chiều bao gồm V4-Flash có trong V4.1-Flash so với V4-Pro so với V4-Flash.

Rủi ro: điểm chuẩn của nhà cung cấp đo lường các tác vụ của nhà cung cấp

Mọi con số trong bảng đó đều đến từ DeepSeek. “Các thử nghiệm bởi nhiều bên” là cụm từ của DeepSeek, và các bên đó không được nêu tên trong thông báo phát hành. Điều đó không có nghĩa là các con số sai. Điều đó có nghĩa là chúng được đo lường trên các bộ điểm chuẩn, chứ không phải trên các yêu cầu của bạn, lược đồ công cụ của bạn, hoặc đầu vào lộn xộn của người dùng của bạn.

Một mô hình có thể đạt điểm cao hơn trên Terminal-Bench nhưng vẫn thay đổi cách định dạng một đối số gọi công cụ mà trình phân tích của bạn phụ thuộc vào. Token đầu ra rẻ hơn sẽ không hữu ích nếu mô hình viết ra nhiều gấp đôi. Cách duy nhất để biết là chạy lưu lượng truy cập của riêng bạn thông qua cả hai mô hình trong khi cả hai còn tồn tại. Bạn có thời gian cho đến ngày 14 tháng 9.

Xây dựng bộ kiểm thử hồi quy trong Apidog trước khi chuyển đổi

Dưới đây là quy trình làm việc trong Apidog giúp bạn so sánh Pro với Flash một cách lặp lại và chuyển quá trình chạy sang CI.

  1. Nhập các yêu cầu V4-Pro hiện có của bạn. Nhập một thông số kỹ thuật OpenAPI tương thích OpenAI, hoặc dán các lệnh curl bạn sử dụng trong môi trường sản xuất. Đặt DEEPSEEK_API_KEY vào một môi trường và tham chiếu nó dưới dạng Bearer {{DEEPSEEK_API_KEY}} trong tiêu đề Authorization. Thêm một biến thứ hai, {{MODEL_ID}}, đặt thành deepseek-v4-pro.
  2. Sao chép từng yêu cầu với deepseek-flash. Đặt {{MODEL_ID}} thành deepseek-flash trong một môi trường thứ hai, hoặc mã hóa cứng hai ID trong các yêu cầu được ghép nối. Cùng các yêu cầu, cùng mảng công cụ, cùng max_tokens. Điểm khác biệt duy nhất phải là mô hình.
  3. Thêm các xác nhận về cấu trúc JSON và cấu trúc gọi công cụ. Đối với đầu ra có cấu trúc, hãy xác nhận rằng choices[0].message.content phân tích dưới dạng JSON và chứa các khóa bạn mong đợi. Đối với việc gọi hàm, hãy xác nhận rằng choices[0].message.tool_calls[0].function.name bằng với công cụ bạn mong đợi và rằng arguments được phân tích cú pháp. Những kiểm tra này sẽ phát hiện sự thay đổi định dạng ngầm.
  4. Chạy cả hai như một kịch bản kiểm thử. Xâu chuỗi các yêu cầu Pro và Flash thành một kịch bản duy nhất để mỗi lần chạy tạo ra một báo cáo. Bao gồm một yêu cầu streaming với stream: true; Apidog hiển thị các sự kiện SSE từng cái một, vì vậy bạn có thể thấy liệu các delta lập luận và câu trả lời có đến theo cách trình phân tích của bạn mong đợi hay không.
  5. So sánh kết quả. So sánh hai phần của báo cáo: tỷ lệ vượt qua xác nhận, thời gian phản hồi và usage.completion_tokens. Một mô hình vượt qua mọi xác nhận nhưng phát ra nhiều hơn 40% token đầu ra sẽ thay đổi tính toán chi phí của bạn, và bạn sẽ thấy điều đó trước khi hóa đơn được gửi.
  6. Lên lịch trong CI với apidog-cli. Chạy kịch bản từ pipeline của bạn hàng ngày cho đến ngày 14 tháng 9 và tiếp tục chạy sau đó. Khi Pro không còn, phần Pro cũng trả về phản hồi Flash và sự khác biệt sẽ về 0: xác nhận rằng việc chuyển đổi đã xảy ra và các xác nhận của bạn vẫn đúng.

Tải Apidog để thiết lập điều này. Quy trình này nằm trong một dự án chung, vì vậy bất kỳ ai chịu trách nhiệm về hóa đơn và bất kỳ ai sở hữu các lời nhắc đều đọc cùng một báo cáo.

Câu hỏi thường gặp

Bốn ngày là đủ

Quá trình di chuyển chỉ là một thay đổi chuỗi cộng với một lần chạy thử nghiệm. Thay đổi chuỗi mất một phút. Lần chạy thử nghiệm sẽ cho bạn biết liệu mô hình bạn sẽ trả tiền vào tuần tới có hoạt động giống như mô hình bạn đã thiết kế hay không. Xây dựng bộ kiểm thử, chạy nó trong khi deepseek-v4-pro vẫn giải quyết thành Pro, và đọc sự khác biệt. Nếu mọi thứ suôn sẻ, bạn sẽ nhận được hóa đơn rẻ hơn 70% và khả năng đồng thời gấp năm lần miễn phí. Nếu không, bạn đã phát hiện ra điều đó theo lịch trình của riêng bạn, chứ không phải của DeepSeek.

button

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API