Ẩn sâu trong thông báo phát hành V4-Flash ngày 31 tháng 7 của DeepSeek là một dòng đáng chú ý nhất về mặt chiến lược: V4-Flash chính thức “hỗ trợ nguyên bản định dạng Responses API và hoàn toàn thích ứng với Codex.”
Hãy đọc lại điều đó. Một phòng thí nghiệm mã nguồn mở của Trung Quốc vừa triển khai định dạng API mới nhất của OpenAI, định dạng mà OpenAI đã xây dựng cho các sản phẩm tác nhân của riêng mình, đặc biệt là để tác nhân mã hóa của OpenAI có thể chạy trên mô hình DeepSeek. Nhật ký thay đổi nêu rõ động cơ một cách đơn giản: “Để đáp ứng nhu cầu của Codex, API của chúng tôi hiện hỗ trợ định dạng Responses API.”
Bài viết này đề cập đến ý nghĩa thực tế của điều đó: mức độ tương thích của việc triển khai, những gì bị bỏ qua một cách âm thầm, cách kết nối V4-Flash vào Codex trong hai phút và những điểm khó khăn. Nếu bạn chỉ cần thiết lập API cơ bản trước tiên, hãy bắt đầu với hướng dẫn beta công khai V4-Flash của chúng tôi.
Tại sao Responses API lại quan trọng ở đây
OpenAI đã giới thiệu Responses API như là phiên bản kế nhiệm của Chat Completions: một giao diện duy nhất được thiết kế cho các tác vụ tác nhân, với các mục lý luận hạng nhất, công cụ tích hợp và các sự kiện truyền dữ liệu ngữ nghĩa. Chúng tôi đã phân tích định dạng này trong bài Cách sử dụng Responses API của OpenAI, nhưng tóm lại thì: đó là định dạng mà ngăn xếp tác nhân của OpenAI, bao gồm Codex, sử dụng nguyên bản.
Cho đến nay, việc chạy một mô hình không phải của OpenAI phía sau một máy khách Responses API có nghĩa là phải có một proxy dịch thuật hoặc không thể chạy được. DeepSeek đã bỏ qua proxy và triển khai định dạng này ở phía máy chủ tại https://api.deepseek.com. SDK OpenAI hiện có của bạn hoạt động không thay đổi:
# pip3 install openai
from openai import OpenAI
client = OpenAI(
api_key="<khóa API DeepSeek của bạn>",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="Bạn là một trợ lý hữu ích.",
input="Xin chào, bạn khỏe không?",
)
print(response.output_text)
Một lưu ý trước khi bạn hào hứng: Responses API hiện chỉ hoạt động với deepseek-v4-flash. DeepSeek cho biết hỗ trợ deepseek-v4-pro sẽ có vào đầu tháng 8 năm 2026.

Mức độ tương thích hoàn chỉnh đến mức nào?
DeepSeek đã công bố ma trận tương thích đầy đủ, điều mà hầu hết các nhà cung cấp “tương thích với OpenAI” không bận tâm thực hiện. Các hàng quan trọng:
Được hỗ trợ và hoạt động:
inputvàinstructions, dạng chuỗi hoặc danh sách mụcstreamvới chuỗi sự kiện ngữ nghĩa đầy đủtemperature,top_p,max_output_tokens,top_logprobstoolsvới các loại `function` và `web_search`; tìm kiếm web được thực thi phía máy chủtool_choicebao gồm việc buộc sử dụng một chức năng cụ thểreasoning.effortcho độ sâu suy nghĩ
Được chấp nhận nhưng không hoạt động:
reasoning.summaryđược chấp nhận, nhưng không có tóm tắt nào được tạotext.verbosityđược chấp nhận nhưng không có hiệu lựcparallel_tool_callsbị bỏ qua vì việc gọi công cụ song song luôn được bật
Không được hỗ trợ, theo thiết kế:
previous_response_idvàconversation: API là không trạng thái, vì vậy bạn tự quản lý lịch sử hội thoại và gửi nó dưới dạng danh sách mục đầu vàostore: mọi phản hồi đều trả về vớistore: falsebackground,metadata,include,service_tiervà các khóa bộ nhớ đệm lời nhắc; bộ nhớ đệm ngữ cảnh xảy ra tự động thay thế
Phần tốt là: các tham số không được hỗ trợ sẽ bị bỏ qua một cách âm thầm thay vì bị từ chối, do đó các máy khách Responses API hiện có có thể kết nối mà không cần sửa đổi. Phần khó khăn là: các yêu cầu vượt quá cửa sổ ngữ cảnh 1M token sẽ trả về lỗi 400 thay vì bị cắt ngắn.
Streaming tuân theo mô hình sự kiện Responses API, từ response.created đến response.completed, với các delta lý luận (response.reasoning_text.delta) đến dưới dạng các sự kiện riêng biệt từ văn bản đầu ra. Không có bộ kết thúc data: [DONE]; luồng kết thúc bằng một sự kiện response.completed, response.incomplete hoặc response.failed. Nếu trình xử lý SSE của bạn chờ [DONE], nó sẽ bị treo. Hướng dẫn của chúng tôi về truyền dữ liệu phản hồi API với các sự kiện server-sent bao gồm các mẫu phân tích cú pháp phòng ngừa cho sự khác biệt phương ngữ kiểu này.
Thiết lập Codex với DeepSeek-V4-Flash
Codex giao tiếp với các mô hình thông qua Responses API, đó là toàn bộ lý do tồn tại của bản phát hành này. Hướng dẫn tích hợp của DeepSeek cung cấp hai cách, và cả hai đều cấu hình mọi máy khách Codex cùng một lúc (CLI, ứng dụng ChatGPT dành cho máy tính để bàn và tiện ích mở rộng VS Code), vì chúng chia sẻ một cấu hình.
Tập lệnh một cú nhấp chuột
Đảm bảo Codex CLI hoặc ứng dụng ChatGPT dành cho máy tính để bàn đã được cài đặt và chạy ít nhất một lần, sau đó:
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
Người dùng Windows chạy phiên bản PowerShell:
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
Tập lệnh sẽ yêu cầu khóa API DeepSeek của bạn trong lần chạy đầu tiên, sau đó thực hiện bốn việc: sao lưu ~/.codex/config.toml hiện có của bạn vào ~/.codex/backup-deepseek/, ghi một danh mục mô hình vào ~/.codex/models.json, thêm một phần [model_providers.deepseek] vào cấu hình của bạn trong khi vẫn giữ nguyên máy chủ MCP và cài đặt tin cậy dự án, và xác thực cú pháp trước khi ghi bất kỳ thứ gì. Chạy lại bất cứ lúc nào để chuyển đổi mô hình hoặc khôi phục cài đặt ban đầu của bạn từ menu.
Thận trọng tiêu chuẩn áp dụng cho việc truyền curl vào bash: hãy đọc tập lệnh trước nếu đó là chính sách của bạn. Hành vi sao lưu và xác thực là một dấu hiệu tốt, nhưng nó vẫn là một tập lệnh của bên thứ ba chạm vào cấu hình Codex của bạn.
Danh mục mô hình cho bạn biết điều gì
Tệp models.json mà tập lệnh ghi ra đáng để đọc, vì nó ghi lại cách DeepSeek định vị mô hình bên trong Codex:
- Cửa sổ ngữ cảnh: 1.048.576 token
- Mức độ lý luận:
low,highvàmax, vớihighlà mặc định - Hỗ trợ gọi công cụ song song
- Yêu cầu phiên bản máy khách Codex 0.144.0 trở lên
Danh mục mô tả V4-Flash là “mô hình mã hóa tác nhân tiên tiến nhất”, và hiện chỉ có deepseek-v4-flash hoạt động. Danh mục đã bao gồm deepseek-v4-pro cho khi hỗ trợ ra mắt vào đầu tháng 8.
Liệu nó có thực sự hoạt động tốt bên trong Codex không?
DeepSeek lập luận rằng việc huấn luyện lại sau khi đăng tải vào ngày 31 tháng 7 chính là nhằm vào khối lượng công việc này. Các số liệu tác nhân được công bố của họ: Terminal Bench 2.1 đạt 82.7, Cybergym đạt 76.7, Toolathlon được xác minh đạt 70.3, DeepSWE đạt 54.4, tất cả đều được báo cáo là đánh bại V4-Pro-Preview. Hãy coi đây là số liệu của nhà cung cấp cho đến khi có các chạy thử nghiệm độc lập; chúng được tạo ra bằng công cụ của DeepSeek với nỗ lực tối đa, và hai trong số các điểm chuẩn trong thông báo là các bộ thử nghiệm nội bộ.
Về mặt kinh tế, khó mà tranh cãi được. Với $0.14 cho mỗi triệu token đầu vào (cache miss) và $0.28 cho mỗi triệu token đầu ra, V4-Flash có chi phí chỉ bằng một phần nhỏ so với các mô hình mà Codex thường chạy, và cache hit giúp giảm chi phí đầu vào xuống còn $0.0028. Một ngày làm việc nặng với các phiên tác nhân tốn ít hơn ly cà phê bạn uống trong thời gian đó. Để xem bảng chi phí đầy đủ, hãy tham khảo phần giá cả trong hướng dẫn beta của chúng tôi. Nếu bạn đang cân nhắc Codex với các lựa chọn thay thế, so sánh Claude Code với Codex CLI của chúng tôi sẽ đề cập đến khía cạnh tác nhân của phương trình.
Xác minh điểm cuối trước khi tin tưởng tác nhân
Một tác nhân chỉ có thể gỡ lỗi được như API đằng sau nó, và một điểm cuối beta công khai hoàn toàn mới xứng đáng được kiểm tra kỹ lưỡng trước khi bạn cho phép Codex hoạt động trên một kho lưu trữ thực sự. Đây là công việc năm phút trong Apidog:
- Thêm
POST https://api.deepseek.com/responseslàm điểm cuối và lưu khóa của bạn vào một biến môi trường. - Gửi một payload
responses.createtối thiểu và xác nhận hình dạng của các mục đầu ra: một mục `reasoning` theo sau là một mục `message`. - Bật
stream: truevà xem chuỗi sự kiện trực tiếp. Apidog hiển thị mỗi sự kiện SSE khi nó đến, điều này làm cho việc liệu máy khách của bạn nên lắng ngheresponse.output_text.deltahay chờ đợi thứ gì đó không bao giờ đến trở nên rõ ràng. - Lưu một yêu cầu với một công cụ `function` đính kèm và xác nhận định dạng đầu ra `function_call` khớp với những gì trình xử lý của bạn mong đợi.
Khi triển khai V4-Pro Responses vào tháng 8, hãy chạy lại các yêu cầu đã lưu tương tự với tên mô hình mới và so sánh hành vi. Tải Apidog miễn phí và giữ toàn bộ bộ công cụ trong một dự án.
Câu hỏi thường gặp
Những mô hình DeepSeek nào hoạt động với Responses API? Hiện tại chỉ có deepseek-v4-flash. Hỗ trợ deepseek-v4-pro dự kiến vào đầu tháng 8 năm 2026.
Tôi có cần một SDK mới không? Không. SDK OpenAI chính thức hoạt động; hãy trỏ base_url đến https://api.deepseek.com và gọi client.responses.create. Chi tiết thiết lập có trong hướng dẫn beta công khai V4-Flash của chúng tôi.
Trạng thái đa lượt có hoạt động như phiên bản của OpenAI không? Không. Việc triển khai của DeepSeek là không trạng thái: previous_response_id, conversation và store không được hỗ trợ. Gửi toàn bộ lịch sử dưới dạng các mục đầu vào trong mỗi lần gọi.
Tôi có thể sử dụng DeepSeek trong Codex cùng với tài khoản OpenAI của mình không? Có. Thiết lập này thêm DeepSeek làm nhà cung cấp mô hình; menu của tập lệnh sẽ chuyển đổi giữa các mô hình, và cấu hình gốc của bạn được sao lưu để bạn có thể khôi phục.
Điều này có giống với khả năng tương thích Anthropic API không? Đây là một tính năng riêng biệt. DeepSeek cũng cung cấp một điểm cuối định dạng Anthropic tại https://api.deepseek.com/anthropic, đó là cách tích hợp Claude Code hoạt động. Điểm cuối Responses API tồn tại cho các công cụ tác nhân định dạng OpenAI như Codex.
Điều mà bản phát hành này thực sự báo hiệu
Chất lượng mô hình đang hội tụ, vì vậy cuộc cạnh tranh đang chuyển sang lớp tích hợp. DeepSeek đã xem xét nơi các nhà phát triển thực sự hoạt động, bên trong các tác nhân như Codex, và xây dựng chính xác hạ tầng cần thiết để trở thành một backend thay thế dễ dàng ở đó, thậm chí còn công bố những tham số nào bị bỏ qua một cách âm thầm. Sự minh bạch đó là hiếm có, và nó làm cho câu chuyện tương thích trở nên đáng tin cậy.
Chiến lược này là rõ ràng và thông minh: OpenAI cung cấp tác nhân, DeepSeek cung cấp token với giá chỉ bằng một phần mười. Liệu mô hình 0731 có thực sự vượt trội hơn V4-Pro-Preview trong codebase của bạn hay không là điều mà chỉ các đánh giá của riêng bạn mới có thể trả lời. Hãy kết nối nó vào Apidog, chạy bộ kiểm thử của bạn với cả hai, và để kết quả, chứ không phải bảng điểm chuẩn, quyết định.
