Mô hình rẻ nhất của DeepSeek giờ đây đã có thể "nhìn". Vào ngày 21 tháng 8 năm 2026, DeepSeek đã phát hành deepseek-v4-flash-vision-exp, một phiên bản V4-Flash có khả năng thị giác, chấp nhận hình ảnh thông qua cùng API sản xuất, với mức giá tương đương mô hình chỉ có văn bản, và mỗi hình ảnh được tính phí không quá 384 token đầu vào. Thông báo phát hành chính thức nêu rõ: khả năng xử lý văn bản tương tự V4-Flash, cộng thêm khả năng hiểu hình ảnh mà DeepSeek cho biết đưa hiệu suất tác nhân đa phương thức của họ gần với Opus 4.8.
Hướng dẫn này sẽ đề cập đến mô hình này là gì, ý nghĩa của chữ "Exp" trong tên đối với việc sử dụng trong sản xuất, ba cách để gửi hình ảnh, các giới hạn bạn cần lưu ý và cách kiểm tra các yêu cầu đa phương thức một cách chính xác. Vì các yêu cầu thị giác thường kết hợp nhiều loại nội dung và nhanh chóng trở nên lớn, chúng chính xác là loại lệnh gọi API đáng xây dựng trong Apidog hơn là chỉnh sửa JSON thủ công trong terminal.
deepseek-v4-flash-vision-exp là gì
Mô hình này là V4-Flash-0731 được gắn thêm một bộ mã hóa hình ảnh. Theo DeepSeek, nó tương đương với mô hình cơ bản trong các tác vụ văn bản, bao gồm khối lượng công việc của tác nhân, suy luận và kiến thức thế giới, vì vậy bạn có thể thay thế nó mà không mất đi những gì V4-Flash đã thực hiện. Danh sách trên OpenRouter mô tả nó như một mô hình mixture-of-experts thưa thớt với 13 tỷ tham số hoạt động trên tổng số 284 tỷ.
Bối cảnh quan trọng: V4-Flash là dòng sản phẩm giá rẻ của DeepSeek. Chúng tôi đã đề cập đến mô hình văn bản khi nó ra mắt trong hướng dẫn API DeepSeek V4-Flash của chúng tôi, và các yếu tố kinh tế không thay đổi. Khả năng thị giác với mức giá "flash" đã làm giảm giá hầu hết các API đa phương thức trên thị trường, đó là lý do tại sao tuyên bố "gần Opus 4.8 trên các điểm chuẩn tác nhân đa phương thức", cách DeepSeek tự định hình, đã thu hút sự chú ý. Hãy coi các tuyên bố điểm chuẩn của nhà cung cấp là tuyên bố; hãy tự chạy đánh giá trên tài liệu của riêng bạn trước khi bạn di chuyển bất cứ điều gì.
Mặc dù có nhãn "experimental" (thử nghiệm), đây không phải là một món đồ chơi trong sandbox. Mô hình chạy trên các điểm cuối API sản xuất với cùng giới hạn tốc độ và SLA như các mô hình V4 khác, và không có danh sách chờ hoặc yêu cầu truy cập đặc biệt.
Giá cả: giá flash, bao gồm hình ảnh
Bảng giá giống hệt với deepseek-v4-flash chỉ có văn bản, theo trang giá của DeepSeek:
| Off-peak | Peak | |
|---|---|---|
| Input, cache hit (per 1M tokens) | $0.007 | $0.014 |
| Input, cache miss (per 1M tokens) | $0.22 | $0.44 |
| Output (per 1M tokens) | $0.66 | $1.32 |
Hình ảnh được token hóa để tính phí với tối đa 384 token mỗi hình ảnh và được tính theo giá đầu vào. Với giá cache-miss cao điểm, một hình ảnh đầy đủ chi phí khoảng $0.00017. Một nghìn hình ảnh có giá chưa bằng một tách cà phê.
Hai hành vi định giá được kế thừa từ mô hình văn bản. Giá ngoài giờ cao điểm bằng một nửa giá cao điểm, với giờ cao điểm từ 01:00 đến 04:00 và 06:00 đến 10:00 UTC vào các ngày trong tuần, vì vậy các công việc thị giác theo lô được lên lịch ngoài khung giờ đó sẽ có giá chỉ bằng một nửa. Và việc lưu trữ ngữ cảnh (context caching) áp dụng cho đầu vào lặp lại, điều này quan trọng khi bạn gửi lại cùng một lời nhắc hệ thống với các hình ảnh khác nhau. Trang giá liệt kê cửa sổ ngữ cảnh 1 triệu token cho dòng V4, với đầu ra bị giới hạn thấp hơn nhiều trong thực tế.
Ba cách gửi hình ảnh
Mô hình hoạt động thông qua điểm cuối Chat Completions tiêu chuẩn của DeepSeek tại https://api.deepseek.com/chat/completions (các lệnh gọi kiểu Messages và Responses cũng được hỗ trợ, như sự ra mắt API V4-Flash Responses đã xác định). Hình ảnh được đưa vào mảng content của một tin nhắn người dùng, và bạn có ba tùy chọn gửi.
1. Base64 nội tuyến. Mã hóa hình ảnh dưới dạng URL dữ liệu. Đơn giản, tự chứa, và giới hạn ở 32 MiB mỗi hình ảnh:
import base64
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
with open("invoice.png", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extract the line items and totals as JSON."},
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
]
}]
)
print(response.choices[0].message.content)
2. URL bên ngoài. Truyền một liên kết có thể truy cập công khai (tối đa 8.192 ký tự) thay vì mã hóa:
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
3. Tham chiếu API Tệp. Tải lên một lần, tái sử dụng bằng ID. API Tệp của DeepSeek hiện chấp nhận tải lên hình ảnh miễn phí, và một tham chiếu file_id giúp bỏ qua việc tải lên lại cùng một hình ảnh qua các yêu cầu, với giới hạn cao hơn là 64 MiB mỗi hình ảnh:
{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}
Sử dụng base64 cho các lệnh gọi một lần, URL khi hình ảnh của bạn đã nằm trên CDN, và ID tệp cho bất kỳ quy trình làm việc nào xử lý cùng một hình ảnh nhiều hơn một lần.
Tham số detail
Trường detail tùy chọn trên mỗi hình ảnh kiểm soát việc tiền xử lý:
"low": thu nhỏ xuống 512x512. Rẻ nhất và nhanh nhất, phù hợp cho các câu hỏi cấp phân loại."high"/"original": giữ nguyên kích thước gốc, cho các tài liệu dày đặc và văn bản nhỏ."auto": cho phép API tự quyết định.
Nội bộ, hình ảnh được chuẩn hóa về khoảng 800x800 để đếm token, đó là cách giới hạn 384 token mỗi hình ảnh được duy trì. Nếu bạn đang thực hiện công việc liên quan đến OCR trên hóa đơn hoặc bảng điều khiển, hãy kiểm tra "low" so với "high" trên tập dữ liệu thực của bạn; sự khác biệt về chi phí là nhỏ ở mức giá này, nhưng sự khác biệt về độ chính xác có thể lớn.
Các giới hạn cần biết trước khi đưa vào sản xuất
| Constraint | Value |
|---|---|
| Max images per request | 600 |
| Inline (base64) image size | 32 MiB |
| Files API image size | 64 MiB |
| Total request body | 48 MiB |
| Image dimensions | 8,192 px per side (4,096 px when a request carries 15+ images) |
| External URL length | 8,192 characters |
| Image placement | user messages only |
Dòng cuối cùng đó là nguyên nhân thực sự gây ra lỗi 400: hình ảnh trong tin nhắn system hoặc assistant bị từ chối. Các yêu cầu đa hình ảnh được hỗ trợ và xen kẽ tự do với văn bản, điều này làm cho mô hình có thể sử dụng được cho các vòng lặp tác nhân chụp màn hình, suy luận và hành động. Nếu bạn đang điều phối các vòng lặp đó, DeepSeek đã hỗ trợ gốc cho mô hình này trong DeepSeek Harness 0.1.1 cùng ngày; tổng quan về DeepSeek Harness của chúng tôi bao gồm ngăn xếp đó. Cũng lưu ý rằng việc gọi công cụ hoạt động cùng với khả năng thị giác, giống như luồng của mô hình văn bản được mô tả trong hướng dẫn gọi hàm của chúng tôi.
"Exp" có ý nghĩa gì đối với bạn
Hậu tố này là một cách gắn nhãn trung thực, không phải là bức tường phí. Hãy mong đợi mô hình sẽ được sửa đổi hoặc thay thế trong thời gian ngắn, giống như cách các điểm cuối thử nghiệm của DeepSeek đã từng. Các biện pháp phòng ngừa thực tế:
- Đừng mã hóa cứng ID mô hình ở mười hai nơi. Hãy đặt
deepseek-v4-flash-vision-expvào một giá trị cấu hình hoặc biến môi trường. - Giữ một phương án dự phòng chỉ có văn bản. Vì mô hình khớp với
deepseek-v4-flashvề các tác vụ văn bản, việc định tuyến lưu lượng không có hình ảnh đến ID ổn định sẽ không tốn kém gì cho bạn. - Lưu lại các đánh giá của bạn. Khi một phiên bản kế nhiệm không thử nghiệm ra mắt, bạn sẽ muốn có một so sánh trước/sau trên các tác vụ của riêng bạn, chứ không phải của nhà cung cấp.
Ví dụ thực tế: Chi phí của một quy trình tài liệu
Những con số làm cho giá cả trở nên cụ thể. Giả sử bạn xử lý 50.000 hóa đơn được quét mỗi tháng, mỗi hóa đơn một hình ảnh, với một lời nhắc hướng dẫn 200 token và khoảng 400 token đầu ra JSON mỗi lần gọi:
- Đầu vào hình ảnh: 50.000 x 384 token = 19,2 triệu token. Với tỷ lệ cache-miss cao điểm ($0.44/1 triệu), đó là $8.45.
- Đầu vào văn bản: 50.000 x 200 = 10 triệu token, khoảng $4.40 ở mức cao điểm. Với tính năng cache ngữ cảnh trên khối hướng dẫn lặp lại, hầu hết sẽ giảm xuống tỷ lệ cache-hit ($0.014/1 triệu), hoặc khoảng $0.14.
- Đầu ra: 50.000 x 400 = 20 triệu token với giá $1.32/1 triệu, tức là $26.40.
Tổng cộng: khoảng $35 đến $40 mỗi tháng ở mức giá cao điểm, và khoảng một nửa nếu lô chạy ngoài khung giờ từ 01:00 đến 10:00 UTC vào các ngày trong tuần. Các token đầu ra chiếm ưu thế, đây là bài học hữu ích: với hình ảnh rẻ như vậy, bạn tối ưu hóa một quy trình thị giác bằng cách thắt chặt định dạng phản hồi, chứ không phải bằng cách giảm kích thước hình ảnh. Việc nhắc nhở để có JSON nhỏ gọn thay vì mô tả văn xuôi sẽ cắt giảm hóa đơn nhiều hơn bất kỳ quá trình tiền xử lý hình ảnh nào.
Hồ sơ chi phí đó cũng là lý do tại sao mô hình thay đổi tính toán cho các vòng lặp tác nhân. Một chu trình chụp màn hình-suy luận-hành động từng quá đắt đỏ để chạy liên tục trên các mô hình đa phương thức hàng đầu nay trở nên khả thi với 384 token mỗi khung hình.
Kiểm tra các yêu cầu đa phương thức trong Apidog
Các yêu cầu thị giác gây khó chịu khi lặp lại bằng tay: các khối base64 làm cho JSON thô khó đọc, và việc so sánh cài đặt detail có nghĩa là phải xử lý các payload gần như giống hệt nhau. Một vòng lặp gọn gàng hơn:
- Lưu yêu cầu một lần trong một dự án Apidog, với
{{model_id}},{{detail}}, và payload hình ảnh dưới dạng biến. Việc thay đổi hình ảnh thử nghiệm hoặc mức độ chi tiết trở thành một thay đổi trong menu thả xuống. - Viết script để mã hóa. Một script tiền yêu cầu đọc hình ảnh và chèn chuỗi base64, để phần thân yêu cầu hiển thị vẫn dễ đọc.
- Xác nhận cấu trúc, không phải cảm giác. Nếu bạn nhắc để có đầu ra JSON (các mục dòng, mô tả giới hạn, giá trị biểu đồ), hãy thêm các xác nhận phân tích phản hồi và kiểm tra các trường. Điều đó biến "mô hình có vẻ ổn" thành một kết quả đạt/không đạt mà bạn có thể chạy lại sau mỗi lần sửa đổi mô hình Exp.
- Mô phỏng hình dạng phản hồi cho giao diện người dùng của bạn trong khi lời nhắc vẫn đang được điều chỉnh; tính năng mô phỏng thông minh của Apidog phục vụ lược đồ mà không tốn các lệnh gọi API.
Tải Apidog miễn phí và toàn bộ quá trình chỉ mất vài phút; việc chạy lại khi DeepSeek sửa đổi mô hình thử nghiệm chỉ cần một cú nhấp chuột.
Câu hỏi thường gặp
deepseek-v4-flash-vision-exp có miễn phí không? Không, nhưng nó rất gần với miễn phí. Nó tính phí chính xác theo mức giá flash của mô hình văn bản, với hình ảnh được giới hạn ở 384 token đầu vào mỗi hình ảnh. Lưu trữ hình ảnh của API Files của DeepSeek là miễn phí; bạn chỉ trả tiền khi hình ảnh được đưa vào một yêu cầu.
Nó có thay thế deepseek-v4-flash không? Không. Mô hình văn bản vẫn là ID ổn định. Phiên bản thị giác tương đương nó trong các tác vụ văn bản, vì vậy bạn có thể hợp nhất trên ID thị giác nếu bạn chấp nhận sự thay đổi thử nghiệm, nhưng mô hình thận trọng là chỉ định tuyến lưu lượng chứa hình ảnh đến nó.
Tôi có thể sử dụng nó thông qua định dạng API kiểu Anthropic không? Có. Các điểm cuối V4 của DeepSeek chấp nhận các lệnh gọi Chat Completions, định dạng Messages và định dạng Responses, vì vậy các client hiện có trên bất kỳ ba kiểu nào đều có thể thêm các khối hình ảnh mà không cần chuyển đổi phương ngữ yêu cầu. Hướng dẫn API V4 Pro của chúng tôi cho thấy cơ chế điểm cuối được chia sẻ trên toàn bộ dòng sản phẩm.
Giá của nó so với GPT hoặc Claude vision như thế nào? Với $0.22 đến $0.44 cho mỗi triệu token đầu vào với hình ảnh 384 token, nó thấp hơn một bậc so với mức giá của các mô hình đa phương thức hàng đầu. Câu hỏi còn bỏ ngỏ là độ chính xác trên khối lượng công việc của bạn, đó là mục đích của kịch bản đánh giá ở trên.
Tóm lại
DeepSeek vẫn tiếp tục thực hiện chiến lược tương tự: lấy khả năng mà mọi người đều tính giá cao cấp, cung cấp nó với giá flash, và gắn nhãn trung thực trong khi nó ổn định. deepseek-v4-flash-vision-exp mang đến cho bạn khả năng hiểu hình ảnh trên các điểm cuối sản xuất với chi phí chỉ vài phần trăm xu cho mỗi hình ảnh, với ba đường dẫn đầu vào và các giới hạn thực tế mà bạn có thể thiết kế xung quanh. Xây dựng yêu cầu một lần trong Apidog, ghim các xác nhận của bạn, và bạn sẽ sẵn sàng sử dụng mô hình Exp hôm nay cũng như đánh giá phiên bản kế nhiệm của nó vào ngày nó ra mắt.
