โมเดลที่ราคาถูกที่สุดของ DeepSeek สามารถประมวลผลรูปภาพได้แล้ว DeepSeek ได้เปิดตัว deepseek-v4-flash-vision-exp เมื่อวันที่ 21 สิงหาคม 2026 ซึ่งเป็นเวอร์ชันที่เปิดใช้งานการมองเห็นของ V4-Flash ที่รับภาพผ่าน API การผลิตเดียวกัน ในราคาเดียวกับโมเดลที่ประมวลผลเฉพาะข้อความ โดยแต่ละภาพจะถูกคิดค่าบริการไม่เกิน 384 โทเค็นอินพุต ประกาศเปิดตัวอย่างเป็นทางการ ระบุไว้อย่างชัดเจนว่า มีความสามารถด้านข้อความเช่นเดียวกับ V4-Flash และเพิ่มความเข้าใจภาพที่ DeepSeek กล่าวว่าทำให้ประสิทธิภาพตัวแทนแบบ multimodal ของมันใกล้เคียงกับ Opus 4.8
คู่มือนี้จะครอบคลุมว่าโมเดลนี้คืออะไร ความหมายของ “Exp” ในชื่อสำหรับการใช้งานจริง วิธีส่งภาพสามวิธี ข้อจำกัดที่คุณควรรู้ และวิธีการทดสอบคำขอแบบ multimodal อย่างถูกต้อง เนื่องจากการร้องขอที่เกี่ยวข้องกับภาพจะผสมประเภทเนื้อหาและมีขนาดใหญ่ขึ้นอย่างรวดเร็ว จึงเป็นประเภทของการเรียก API ที่คุ้มค่าที่จะสร้างใน Apidog มากกว่าการแก้ไข JSON ด้วยตนเองในเทอร์มินัล
DeepSeek-v4-flash-vision-exp คืออะไร
โมเดลนี้คือ V4-Flash-0731 ที่มี Image Encoder แนบมาด้วย ตามที่ DeepSeek ระบุ โมเดลนี้มีความสามารถเทียบเท่ากับโมเดลพื้นฐานในงานที่เกี่ยวกับข้อความ รวมถึงการทำงานของ Agent, การให้เหตุผล และความรู้รอบโลก ดังนั้นคุณสามารถเปลี่ยนไปใช้ได้โดยไม่สูญเสียความสามารถเดิมของ V4-Flash รายการบน OpenRouter อธิบายว่าเป็นโมเดล mixture-of-experts แบบเบาบาง (sparse) ที่มีพารามิเตอร์ที่ใช้งานอยู่ 13 พันล้านพารามิเตอร์ จากทั้งหมด 284 พันล้านพารามิเตอร์
บริบทที่สำคัญคือ V4-Flash เป็นสายผลิตภัณฑ์ราคาประหยัดของ DeepSeek เราได้กล่าวถึงโมเดลข้อความเมื่อเปิดตัวใน คู่มือ DeepSeek V4-Flash API ของเรา และหลักเศรษฐศาสตร์ก็ยังไม่เปลี่ยนแปลง ความสามารถด้านการมองเห็นในราคา Flash ทำให้ราคาต่ำกว่า API แบบ multimodal เกือบทั้งหมดในตลาด ซึ่งเป็นเหตุผลที่การกล่าวอ้างว่า "ใกล้เคียงกับ Opus 4.8 ในเกณฑ์มาตรฐานของ multimodal agent" ซึ่งเป็นการนำเสนอของ DeepSeek เอง ได้รับความสนใจ โปรดถือว่าการกล่าวอ้างเกณฑ์มาตรฐานของผู้ขายเป็นเพียงการกล่าวอ้างเท่านั้น ให้ทดลองประเมินผลด้วยเอกสารของคุณเองก่อนที่จะย้ายข้อมูลใดๆ
แม้จะมีป้ายกำกับว่า 'ทดลอง' แต่นี่ไม่ใช่ของเล่นสำหรับทดลอง โมเดลนี้ทำงานบน API endpoints สำหรับการผลิต ด้วยข้อจำกัดอัตรา (rate limits) และ SLA (Service Level Agreement) เดียวกันกับโมเดล V4 อื่นๆ และไม่มีรายการรอหรือคำขอเข้าถึงพิเศษ
ราคา: อัตรา Flash, รวมรูปภาพ
อัตราค่าบริการเหมือนกับ deepseek-v4-flash เฉพาะข้อความ ตาม หน้าอัตราค่าบริการ ของ DeepSeek:
| นอกช่วงเวลาเร่งด่วน (Off-peak) | ช่วงเวลาเร่งด่วน (Peak) | |
|---|---|---|
| อินพุต, Cache Hit (ต่อ 1 ล้านโทเค็น) | $0.007 | $0.014 |
| อินพุต, Cache Miss (ต่อ 1 ล้านโทเค็น) | $0.22 | $0.44 |
| เอาต์พุต (ต่อ 1 ล้านโทเค็น) | $0.66 | $1.32 |
รูปภาพจะถูกแปลงเป็นโทเค็นเพื่อการเรียกเก็บเงินสูงสุด 384 โทเค็นต่อภาพ และคิดค่าบริการในอัตราอินพุต ในราคาช่วงเวลาเร่งด่วนแบบ cache-miss รูปภาพหนึ่งภาพจะมีค่าใช้จ่ายประมาณ $0.00017 ภาพพันภาพมีราคาถูกกว่ากาแฟหนึ่งแก้ว
พฤติกรรมการกำหนดราคา 2 อย่างที่สืบทอดมาจากโมเดลข้อความ อัตรานอกช่วงเวลาเร่งด่วนจะอยู่ที่ครึ่งหนึ่งของช่วงเวลาเร่งด่วน โดยช่วงเวลาเร่งด่วนคือ 01:00 ถึง 04:00 น. และ 06:00 ถึง 10:00 น. ตามเวลา UTC ในวันธรรมดา ดังนั้นงานประมวลผลภาพแบบ batch ที่กำหนดไว้นอกช่วงเวลานั้นจะมีค่าใช้จ่ายเพียงครึ่งเดียว และการทำ context caching จะใช้ได้กับอินพุตที่ซ้ำกัน ซึ่งสำคัญเมื่อคุณส่ง system prompt เดิมซ้ำๆ รอบภาพที่แตกต่างกัน หน้าอัตราค่าบริการระบุหน้าต่างบริบท (context window) ขนาด 1 ล้านโทเค็นสำหรับสายผลิตภัณฑ์ V4 โดยเอาต์พุตจะถูกจำกัดไว้ต่ำกว่านั้นมากในการใช้งานจริง
สามวิธีในการส่งรูปภาพ
โมเดลนี้ทำงานผ่าน DeepSeek’s standard Chat Completions endpoint ที่ https://api.deepseek.com/chat/completions (รองรับการเรียกใช้แบบ Messages-style และ Responses-style ด้วย ดังที่ การเปิดตัว V4-Flash Responses API ได้ระบุไว้) รูปภาพจะถูกส่งไปในอาร์เรย์ content ของข้อความผู้ใช้ และคุณมีสามทางเลือกในการส่ง
1. Base64 แบบฝังใน (Inline). เข้ารหัสรูปภาพเป็น data URL ง่าย สะดวกในตัวเอง และจำกัดขนาดที่ 32 MiB ต่อภาพ:
import base64
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
with open("invoice.png", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extract the line items and totals as JSON."},
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
]
}]
)
print(response.choices[0].message.content)
2. URL ภายนอก (External URL). ส่งลิงก์ที่เข้าถึงได้จากสาธารณะ (สูงสุด 8,192 ตัวอักษร) แทนการเข้ารหัส:
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
3. การอ้างอิง Files API. อัปโหลดครั้งเดียว ใช้งานซ้ำด้วย ID Files API ของ DeepSeek ตอนนี้รองรับการอัปโหลดรูปภาพฟรี และการอ้างอิง file_id จะช่วยให้ไม่ต้องอัปโหลดภาพเดิมซ้ำๆ ในแต่ละคำขอ โดยมีขีดจำกัดขนาดภาพที่สูงขึ้นคือ 64 MiB ต่อภาพ:
{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}
ใช้ base64 สำหรับการเรียกใช้งานครั้งเดียว (one-shot calls), ใช้ URL เมื่อรูปภาพของคุณอยู่บน CDN อยู่แล้ว, และใช้ file ID สำหรับเวิร์กโฟลว์ใดๆ ที่เกี่ยวข้องกับรูปภาพเดียวกันมากกว่าหนึ่งครั้ง
พารามิเตอร์ detail
ฟิลด์ detail ซึ่งเป็นทางเลือกบนแต่ละรูปภาพ ควบคุมการประมวลผลล่วงหน้า:
"low": ลดขนาดเป็น 512x512 ประหยัดที่สุดและเร็วที่สุด เหมาะสำหรับคำถามระดับการจัดหมวดหมู่"high"/"original": เก็บขนาดเดิมไว้ เหมาะสำหรับเอกสารที่มีความหนาแน่นและข้อความขนาดเล็ก"auto": ให้ API ตัดสินใจเอง
ภายในแล้ว รูปภาพจะถูกปรับขนาดให้ใกล้เคียงกับ 800x800 สำหรับการนับโทเค็น ซึ่งเป็นเหตุผลว่าทำไมจึงมีการจำกัดเพดานที่ 384 โทเค็นต่อภาพ หากคุณกำลังทำงานที่เกี่ยวข้องกับ OCR บนใบเสร็จหรือแดชบอร์ด ให้ทดสอบ "low" เทียบกับ "high" บนชุดข้อมูลจริงของคุณ ความแตกต่างของต้นทุนอาจน้อยที่ราคาเหล่านี้ แต่ความแตกต่างของความแม่นยำอาจมาก
ข้อจำกัดที่ควรรู้ก่อนนำไปใช้งานจริง
| ข้อจำกัด | ค่า |
|---|---|
| รูปภาพสูงสุดต่อคำขอ | 600 |
| ขนาดรูปภาพแบบฝัง (Base64 Inline) | 32 MiB |
| ขนาดรูปภาพสำหรับ Files API | 64 MiB |
| ขนาดรวมของ Request Body | 48 MiB |
| ขนาดรูปภาพ (มิติ) | 8,192 px ต่อด้าน (4,096 px เมื่อคำขอมีรูปภาพตั้งแต่ 15 ภาพขึ้นไป) |
| ความยาว External URL | 8,192 ตัวอักษร |
| ตำแหน่งรูปภาพ | ข้อความ user เท่านั้น |
แถวสุดท้ายนั้นเป็นสาเหตุของการเกิดข้อผิดพลาด 400 จริงๆ: รูปภาพในข้อความ system หรือ assistant จะถูกปฏิเสธ รองรับคำขอแบบหลายภาพและสามารถสลับกับข้อความได้อย่างอิสระ ซึ่งทำให้โมเดลนี้สามารถใช้งานได้สำหรับ agent loops ที่มีการจับภาพหน้าจอ ให้เหตุผล และดำเนินการ หากคุณกำลังจัดการ agent loops เหล่านั้น DeepSeek ได้จัดส่งการสนับสนุนดั้งเดิมสำหรับโมเดลนี้ใน DeepSeek Harness 0.1.1 ในวันเดียวกัน ภาพรวม DeepSeek Harness ของเราครอบคลุมโครงสร้างดังกล่าว นอกจากนี้ การเรียกใช้เครื่องมือ (tool calling) ยังทำงานควบคู่ไปกับความสามารถด้านการมองเห็นได้เช่นเดียวกับขั้นตอนของโมเดลข้อความที่อธิบายไว้ใน คู่มือการเรียกใช้ฟังก์ชัน (function calling) ของเรา
“Exp” หมายถึงอะไรสำหรับคุณ
ส่วนต่อท้ายเป็นป้ายกำกับที่ซื่อสัตย์ ไม่ใช่กำแพงกั้นการจ่ายเงิน คาดว่าโมเดลจะได้รับการปรับปรุงหรือเปลี่ยนใหม่โดยแจ้งให้ทราบล่วงหน้าในระยะเวลาอันสั้น เช่นเดียวกับที่เคยเกิดขึ้นกับ experimental DeepSeek endpoints ก่อนหน้านี้ ข้อควรระวังเชิงปฏิบัติ:
- อย่าฮาร์ดโค้ด model ID ในหลายๆ ที่ ให้ใส่
deepseek-v4-flash-vision-expไว้ในค่าคอนฟิกหรือตัวแปรสภาพแวดล้อมเพียงจุดเดียว - มีตัวสำรองสำหรับข้อความเท่านั้น เนื่องจากโมเดลนี้มีความสามารถเทียบเท่า
deepseek-v4-flashในงานข้อความ การส่งทราฟฟิกที่ไม่ใช่รูปภาพไปยัง ID ที่เสถียรจะไม่ทำให้คุณเสียค่าใช้จ่ายใดๆ - ถ่ายภาพการประเมินของคุณ (Snapshot your evals) เมื่อมีเวอร์ชันที่ไม่ได้ทดลองเปิดตัว คุณจะต้องมีข้อมูลก่อน/หลัง สำหรับงานของคุณเอง ไม่ใช่ของ vendor
ตัวอย่างการทำงาน: ค่าใช้จ่ายของกระบวนการเอกสาร
ตัวเลขจะทำให้ราคาเป็นรูปธรรมมากขึ้น สมมติว่าคุณประมวลผลใบแจ้งหนี้ที่สแกน 50,000 ฉบับต่อเดือน โดยแต่ละฉบับมีรูปภาพหนึ่งภาพ พร้อมกับ instruction prompt 200 โทเค็น และเอาต์พุต JSON ประมาณ 400 โทเค็นต่อการเรียกใช้งาน:
- อินพุตภาพ: 50,000 x 384 โทเค็น = 19.2M โทเค็น ในอัตรา cache-miss ช่วงเวลาเร่งด่วน ($0.44/1M) จะอยู่ที่ $8.45
- อินพุตข้อความ: 50,000 x 200 = 10M โทเค็น ประมาณ $4.40 ในช่วงเวลาเร่งด่วน ด้วย context caching ในบล็อก instruction ที่ซ้ำกัน ส่วนใหญ่จะลดลงเป็นอัตรา cache-hit ($0.014/1M) หรือประมาณ $0.14
- เอาต์พุต: 50,000 x 400 = 20M โทเค็น ที่ $1.32/1M ดังนั้นจึงเป็น $26.40
รวม: ประมาณ $35 ถึง $40 ต่อเดือนในอัตราช่วงเวลาเร่งด่วน และประมาณครึ่งหนึ่งหากงาน batch ทำงานนอกช่วงเวลา 01:00 ถึง 10:00 UTC ในวันธรรมดา โทเค็นเอาต์พุตเป็นส่วนที่โดดเด่น ซึ่งเป็นบทเรียนที่เป็นประโยชน์: ด้วยราคาภาพที่ถูกขนาดนี้ คุณสามารถเพิ่มประสิทธิภาพของ vision pipeline ได้ด้วยการกระชับรูปแบบการตอบสนอง ไม่ใช่ด้วยการลดขนาดภาพ การสั่งให้ตอบกลับเป็น JSON ที่กระชับแทนคำอธิบายแบบบรรยาย จะช่วยลดค่าใช้จ่ายได้มากกว่าการประมวลผลภาพล่วงหน้าใดๆ
โปรไฟล์ต้นทุนดังกล่าวยังเป็นเหตุผลว่าทำไมโมเดลจึงเปลี่ยนการคำนวณสำหรับ agent loops วงจร screenshot-reason-act ที่เคยมีค่าใช้จ่ายสูงเกินไปที่จะรันต่อเนื่องบนโมเดล multimodal ระดับเรือธง ก็กลายเป็นไปได้ที่ 384 โทเค็นต่อเฟรม
การทดสอบคำขอแบบ Multimodal ใน Apidog
คำขอที่เกี่ยวข้องกับภาพนั้นน่ารำคาญในการทำซ้ำด้วยตนเอง: base64 blobs ทำให้ JSON ดิบอ่านยาก และการเปรียบเทียบการตั้งค่า detail หมายถึงการจัดการเพย์โหลดที่เกือบจะเหมือนกัน วงจรที่สะอาดกว่า:
- บันทึกคำขอเพียงครั้งเดียว ในโปรเจกต์ Apidog โดยใช้
{{model_id}},{{detail}}และ payload รูปภาพเป็นตัวแปร การสลับรูปภาพทดสอบหรือระดับรายละเอียดจะกลายเป็นการเปลี่ยนจากเมนูดรอปดาวน์ - เขียนสคริปต์การเข้ารหัส สคริปต์ก่อนการร้องขอจะอ่านรูปภาพและแทรกสตริง base64 ทำให้ request body ที่แสดงยังคงอ่านง่าย
- ยืนยันตามโครงสร้าง ไม่ใช่อารมณ์ หากคุณสั่งให้ส่งออกเป็น JSON (รายการสินค้า, คำอธิบายขอบเขต, ค่าแผนภูมิ) ให้เพิ่มการยืนยันที่วิเคราะห์การตอบกลับและตรวจสอบฟิลด์ สิ่งนี้จะเปลี่ยนจาก "โมเดลดูเหมือนจะใช้ได้" เป็นการผ่าน/ไม่ผ่านที่คุณสามารถเรียกใช้ซ้ำได้หลังจากการแก้ไขโมเดล Exp ทุกครั้ง
- จำลองรูปแบบการตอบกลับ (Mock the response shape) สำหรับส่วนหน้าของคุณในขณะที่พรอมต์ยังคงได้รับการปรับแต่งอยู่ Apidog’s smart mock จะให้บริการ schema โดยไม่สิ้นเปลืองการเรียก API
ดาวน์โหลด Apidog ฟรี และการตั้งค่าทั้งหมดใช้เวลาเพียงไม่กี่นาที การรันซ้ำเมื่อ DeepSeek ปรับปรุงโมเดลทดลองก็ทำได้ด้วยคลิกเดียว
คำถามที่พบบ่อย (FAQ)
- deepseek-v4-flash-vision-exp ฟรีหรือไม่? ไม่ แต่ก็ใกล้เคียง มันคิดค่าบริการตามอัตรา flash ของโมเดลข้อความ โดยจำกัดภาพที่ 384 โทเค็นอินพุตต่อภาพ พื้นที่เก็บภาพของ DeepSeek’s Files API ฟรี คุณจะจ่ายก็ต่อเมื่อภาพถูกส่งเข้าสู่คำขอเท่านั้น
- มันจะมาแทนที่ deepseek-v4-flash หรือไม่? ไม่ โมเดลข้อความยังคงเป็น ID ที่เสถียร เวอร์ชันวิชั่นมีความสามารถเทียบเท่าในงานข้อความ ดังนั้นคุณสามารถรวมการใช้งานบน ID วิชั่นได้หากคุณยอมรับการเปลี่ยนแปลงในเวอร์ชันทดลอง แต่รูปแบบที่ระมัดระวังคือการส่งเฉพาะทราฟฟิกที่มีภาพไปยังโมเดลนี้เท่านั้น
- ฉันสามารถใช้ผ่านรูปแบบ API สไตล์ Anthropic ได้หรือไม่? ได้ DeepSeek’s V4 endpoints รองรับการเรียกใช้แบบ Chat Completions, Messages-format และ Responses-format ดังนั้นไคลเอนต์ที่มีอยู่ซึ่งใช้รูปแบบใดรูปแบบหนึ่งในสามแบบนี้สามารถเพิ่มบล็อกรูปภาพได้โดยไม่ต้องเปลี่ยนรูปแบบการเรียก API คู่มือการใช้งาน V4 Pro API ของเราแสดงกลไกของ endpoint ที่ใช้ร่วมกันทั้งตระกูล
- ราคาเทียบกับ GPT หรือ Claude Vision เป็นอย่างไร? ที่ $0.22 ถึง $0.44 ต่อล้านโทเค็นอินพุต พร้อมรูปภาพ 384 โทเค็น ถือว่าราคาต่ำกว่าอัตราของโมเดล multimodal ระดับเรือธงอย่างมาก คำถามที่เปิดกว้างคือความแม่นยำในภาระงานของคุณ ซึ่งเป็นเหตุผลสำหรับการประเมินตามสถานการณ์ข้างต้น
สรุป
DeepSeek ยังคงดำเนินตามกลยุทธ์เดิม: นำความสามารถที่ทุกคนคิดค่าบริการในอัตราพรีเมียม มานำเสนอในราคา Flash และติดป้ายกำกับอย่างซื่อสัตย์ในขณะที่กำลังทำให้เสถียร deepseek-v4-flash-vision-exp มอบความสามารถในการทำความเข้าใจภาพบน production endpoints ในราคาเพียงเศษสตางค์ต่อภาพ ด้วยสามเส้นทางอินพุตและข้อจำกัดที่แท้จริงที่คุณสามารถออกแบบได้ สร้างคำขอเพียงครั้งเดียวใน Apidog กำหนดการยืนยันของคุณ แล้วคุณจะพร้อมใช้งานโมเดล Exp ในวันนี้และพร้อมที่จะตัดสินผู้สืบทอดในวันที่เปิดตัว
