วิธีใช้งาน DeepSeek V4-Flash-Vision API: คู่มือการป้อนภาพ

โมเดลที่ถูกที่สุดของ DeepSeek ตอนนี้สามารถมองเห็นได้แล้ว รหัสโมเดล, ราคาแบบ Flash-rate สำหรับรูปภาพขนาด 384 โทเค็น, วิธีการป้อนข้อมูลสามแบบ, ข้อจำกัด และตัวอย่างการคำนวณต้นทุน

Ashley Innocent

Ashley Innocent

24 August 2026

วิธีใช้งาน DeepSeek V4-Flash-Vision API: คู่มือการป้อนภาพ

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

โมเดลที่ราคาถูกที่สุดของ DeepSeek สามารถประมวลผลรูปภาพได้แล้ว DeepSeek ได้เปิดตัว deepseek-v4-flash-vision-exp เมื่อวันที่ 21 สิงหาคม 2026 ซึ่งเป็นเวอร์ชันที่เปิดใช้งานการมองเห็นของ V4-Flash ที่รับภาพผ่าน API การผลิตเดียวกัน ในราคาเดียวกับโมเดลที่ประมวลผลเฉพาะข้อความ โดยแต่ละภาพจะถูกคิดค่าบริการไม่เกิน 384 โทเค็นอินพุต ประกาศเปิดตัวอย่างเป็นทางการ ระบุไว้อย่างชัดเจนว่า มีความสามารถด้านข้อความเช่นเดียวกับ V4-Flash และเพิ่มความเข้าใจภาพที่ DeepSeek กล่าวว่าทำให้ประสิทธิภาพตัวแทนแบบ multimodal ของมันใกล้เคียงกับ Opus 4.8

คู่มือนี้จะครอบคลุมว่าโมเดลนี้คืออะไร ความหมายของ “Exp” ในชื่อสำหรับการใช้งานจริง วิธีส่งภาพสามวิธี ข้อจำกัดที่คุณควรรู้ และวิธีการทดสอบคำขอแบบ multimodal อย่างถูกต้อง เนื่องจากการร้องขอที่เกี่ยวข้องกับภาพจะผสมประเภทเนื้อหาและมีขนาดใหญ่ขึ้นอย่างรวดเร็ว จึงเป็นประเภทของการเรียก API ที่คุ้มค่าที่จะสร้างใน Apidog มากกว่าการแก้ไข JSON ด้วยตนเองในเทอร์มินัล

button

DeepSeek-v4-flash-vision-exp คืออะไร

โมเดลนี้คือ V4-Flash-0731 ที่มี Image Encoder แนบมาด้วย ตามที่ DeepSeek ระบุ โมเดลนี้มีความสามารถเทียบเท่ากับโมเดลพื้นฐานในงานที่เกี่ยวกับข้อความ รวมถึงการทำงานของ Agent, การให้เหตุผล และความรู้รอบโลก ดังนั้นคุณสามารถเปลี่ยนไปใช้ได้โดยไม่สูญเสียความสามารถเดิมของ V4-Flash รายการบน OpenRouter อธิบายว่าเป็นโมเดล mixture-of-experts แบบเบาบาง (sparse) ที่มีพารามิเตอร์ที่ใช้งานอยู่ 13 พันล้านพารามิเตอร์ จากทั้งหมด 284 พันล้านพารามิเตอร์

บริบทที่สำคัญคือ V4-Flash เป็นสายผลิตภัณฑ์ราคาประหยัดของ DeepSeek เราได้กล่าวถึงโมเดลข้อความเมื่อเปิดตัวใน คู่มือ DeepSeek V4-Flash API ของเรา และหลักเศรษฐศาสตร์ก็ยังไม่เปลี่ยนแปลง ความสามารถด้านการมองเห็นในราคา Flash ทำให้ราคาต่ำกว่า API แบบ multimodal เกือบทั้งหมดในตลาด ซึ่งเป็นเหตุผลที่การกล่าวอ้างว่า "ใกล้เคียงกับ Opus 4.8 ในเกณฑ์มาตรฐานของ multimodal agent" ซึ่งเป็นการนำเสนอของ DeepSeek เอง ได้รับความสนใจ โปรดถือว่าการกล่าวอ้างเกณฑ์มาตรฐานของผู้ขายเป็นเพียงการกล่าวอ้างเท่านั้น ให้ทดลองประเมินผลด้วยเอกสารของคุณเองก่อนที่จะย้ายข้อมูลใดๆ

แม้จะมีป้ายกำกับว่า 'ทดลอง' แต่นี่ไม่ใช่ของเล่นสำหรับทดลอง โมเดลนี้ทำงานบน API endpoints สำหรับการผลิต ด้วยข้อจำกัดอัตรา (rate limits) และ SLA (Service Level Agreement) เดียวกันกับโมเดล V4 อื่นๆ และไม่มีรายการรอหรือคำขอเข้าถึงพิเศษ

ราคา: อัตรา Flash, รวมรูปภาพ

อัตราค่าบริการเหมือนกับ deepseek-v4-flash เฉพาะข้อความ ตาม หน้าอัตราค่าบริการ ของ DeepSeek:

นอกช่วงเวลาเร่งด่วน (Off-peak) ช่วงเวลาเร่งด่วน (Peak)
อินพุต, Cache Hit (ต่อ 1 ล้านโทเค็น) $0.007 $0.014
อินพุต, Cache Miss (ต่อ 1 ล้านโทเค็น) $0.22 $0.44
เอาต์พุต (ต่อ 1 ล้านโทเค็น) $0.66 $1.32

รูปภาพจะถูกแปลงเป็นโทเค็นเพื่อการเรียกเก็บเงินสูงสุด 384 โทเค็นต่อภาพ และคิดค่าบริการในอัตราอินพุต ในราคาช่วงเวลาเร่งด่วนแบบ cache-miss รูปภาพหนึ่งภาพจะมีค่าใช้จ่ายประมาณ $0.00017 ภาพพันภาพมีราคาถูกกว่ากาแฟหนึ่งแก้ว

พฤติกรรมการกำหนดราคา 2 อย่างที่สืบทอดมาจากโมเดลข้อความ อัตรานอกช่วงเวลาเร่งด่วนจะอยู่ที่ครึ่งหนึ่งของช่วงเวลาเร่งด่วน โดยช่วงเวลาเร่งด่วนคือ 01:00 ถึง 04:00 น. และ 06:00 ถึง 10:00 น. ตามเวลา UTC ในวันธรรมดา ดังนั้นงานประมวลผลภาพแบบ batch ที่กำหนดไว้นอกช่วงเวลานั้นจะมีค่าใช้จ่ายเพียงครึ่งเดียว และการทำ context caching จะใช้ได้กับอินพุตที่ซ้ำกัน ซึ่งสำคัญเมื่อคุณส่ง system prompt เดิมซ้ำๆ รอบภาพที่แตกต่างกัน หน้าอัตราค่าบริการระบุหน้าต่างบริบท (context window) ขนาด 1 ล้านโทเค็นสำหรับสายผลิตภัณฑ์ V4 โดยเอาต์พุตจะถูกจำกัดไว้ต่ำกว่านั้นมากในการใช้งานจริง

สามวิธีในการส่งรูปภาพ

โมเดลนี้ทำงานผ่าน DeepSeek’s standard Chat Completions endpoint ที่ https://api.deepseek.com/chat/completions (รองรับการเรียกใช้แบบ Messages-style และ Responses-style ด้วย ดังที่ การเปิดตัว V4-Flash Responses API ได้ระบุไว้) รูปภาพจะถูกส่งไปในอาร์เรย์ content ของข้อความผู้ใช้ และคุณมีสามทางเลือกในการส่ง

1. Base64 แบบฝังใน (Inline). เข้ารหัสรูปภาพเป็น data URL ง่าย สะดวกในตัวเอง และจำกัดขนาดที่ 32 MiB ต่อภาพ:

import base64
from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")

with open("invoice.png", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Extract the line items and totals as JSON."},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
        ]
    }]
)
print(response.choices[0].message.content)

2. URL ภายนอก (External URL). ส่งลิงก์ที่เข้าถึงได้จากสาธารณะ (สูงสุด 8,192 ตัวอักษร) แทนการเข้ารหัส:

{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}

3. การอ้างอิง Files API. อัปโหลดครั้งเดียว ใช้งานซ้ำด้วย ID Files API ของ DeepSeek ตอนนี้รองรับการอัปโหลดรูปภาพฟรี และการอ้างอิง file_id จะช่วยให้ไม่ต้องอัปโหลดภาพเดิมซ้ำๆ ในแต่ละคำขอ โดยมีขีดจำกัดขนาดภาพที่สูงขึ้นคือ 64 MiB ต่อภาพ:

{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}

ใช้ base64 สำหรับการเรียกใช้งานครั้งเดียว (one-shot calls), ใช้ URL เมื่อรูปภาพของคุณอยู่บน CDN อยู่แล้ว, และใช้ file ID สำหรับเวิร์กโฟลว์ใดๆ ที่เกี่ยวข้องกับรูปภาพเดียวกันมากกว่าหนึ่งครั้ง

พารามิเตอร์ detail

ฟิลด์ detail ซึ่งเป็นทางเลือกบนแต่ละรูปภาพ ควบคุมการประมวลผลล่วงหน้า:

ภายในแล้ว รูปภาพจะถูกปรับขนาดให้ใกล้เคียงกับ 800x800 สำหรับการนับโทเค็น ซึ่งเป็นเหตุผลว่าทำไมจึงมีการจำกัดเพดานที่ 384 โทเค็นต่อภาพ หากคุณกำลังทำงานที่เกี่ยวข้องกับ OCR บนใบเสร็จหรือแดชบอร์ด ให้ทดสอบ "low" เทียบกับ "high" บนชุดข้อมูลจริงของคุณ ความแตกต่างของต้นทุนอาจน้อยที่ราคาเหล่านี้ แต่ความแตกต่างของความแม่นยำอาจมาก

ข้อจำกัดที่ควรรู้ก่อนนำไปใช้งานจริง

ข้อจำกัด ค่า
รูปภาพสูงสุดต่อคำขอ 600
ขนาดรูปภาพแบบฝัง (Base64 Inline) 32 MiB
ขนาดรูปภาพสำหรับ Files API 64 MiB
ขนาดรวมของ Request Body 48 MiB
ขนาดรูปภาพ (มิติ) 8,192 px ต่อด้าน (4,096 px เมื่อคำขอมีรูปภาพตั้งแต่ 15 ภาพขึ้นไป)
ความยาว External URL 8,192 ตัวอักษร
ตำแหน่งรูปภาพ ข้อความ user เท่านั้น

แถวสุดท้ายนั้นเป็นสาเหตุของการเกิดข้อผิดพลาด 400 จริงๆ: รูปภาพในข้อความ system หรือ assistant จะถูกปฏิเสธ รองรับคำขอแบบหลายภาพและสามารถสลับกับข้อความได้อย่างอิสระ ซึ่งทำให้โมเดลนี้สามารถใช้งานได้สำหรับ agent loops ที่มีการจับภาพหน้าจอ ให้เหตุผล และดำเนินการ หากคุณกำลังจัดการ agent loops เหล่านั้น DeepSeek ได้จัดส่งการสนับสนุนดั้งเดิมสำหรับโมเดลนี้ใน DeepSeek Harness 0.1.1 ในวันเดียวกัน ภาพรวม DeepSeek Harness ของเราครอบคลุมโครงสร้างดังกล่าว นอกจากนี้ การเรียกใช้เครื่องมือ (tool calling) ยังทำงานควบคู่ไปกับความสามารถด้านการมองเห็นได้เช่นเดียวกับขั้นตอนของโมเดลข้อความที่อธิบายไว้ใน คู่มือการเรียกใช้ฟังก์ชัน (function calling) ของเรา

“Exp” หมายถึงอะไรสำหรับคุณ

ส่วนต่อท้ายเป็นป้ายกำกับที่ซื่อสัตย์ ไม่ใช่กำแพงกั้นการจ่ายเงิน คาดว่าโมเดลจะได้รับการปรับปรุงหรือเปลี่ยนใหม่โดยแจ้งให้ทราบล่วงหน้าในระยะเวลาอันสั้น เช่นเดียวกับที่เคยเกิดขึ้นกับ experimental DeepSeek endpoints ก่อนหน้านี้ ข้อควรระวังเชิงปฏิบัติ:

ตัวอย่างการทำงาน: ค่าใช้จ่ายของกระบวนการเอกสาร

ตัวเลขจะทำให้ราคาเป็นรูปธรรมมากขึ้น สมมติว่าคุณประมวลผลใบแจ้งหนี้ที่สแกน 50,000 ฉบับต่อเดือน โดยแต่ละฉบับมีรูปภาพหนึ่งภาพ พร้อมกับ instruction prompt 200 โทเค็น และเอาต์พุต JSON ประมาณ 400 โทเค็นต่อการเรียกใช้งาน:

รวม: ประมาณ $35 ถึง $40 ต่อเดือนในอัตราช่วงเวลาเร่งด่วน และประมาณครึ่งหนึ่งหากงาน batch ทำงานนอกช่วงเวลา 01:00 ถึง 10:00 UTC ในวันธรรมดา โทเค็นเอาต์พุตเป็นส่วนที่โดดเด่น ซึ่งเป็นบทเรียนที่เป็นประโยชน์: ด้วยราคาภาพที่ถูกขนาดนี้ คุณสามารถเพิ่มประสิทธิภาพของ vision pipeline ได้ด้วยการกระชับรูปแบบการตอบสนอง ไม่ใช่ด้วยการลดขนาดภาพ การสั่งให้ตอบกลับเป็น JSON ที่กระชับแทนคำอธิบายแบบบรรยาย จะช่วยลดค่าใช้จ่ายได้มากกว่าการประมวลผลภาพล่วงหน้าใดๆ

โปรไฟล์ต้นทุนดังกล่าวยังเป็นเหตุผลว่าทำไมโมเดลจึงเปลี่ยนการคำนวณสำหรับ agent loops วงจร screenshot-reason-act ที่เคยมีค่าใช้จ่ายสูงเกินไปที่จะรันต่อเนื่องบนโมเดล multimodal ระดับเรือธง ก็กลายเป็นไปได้ที่ 384 โทเค็นต่อเฟรม

การทดสอบคำขอแบบ Multimodal ใน Apidog

คำขอที่เกี่ยวข้องกับภาพนั้นน่ารำคาญในการทำซ้ำด้วยตนเอง: base64 blobs ทำให้ JSON ดิบอ่านยาก และการเปรียบเทียบการตั้งค่า detail หมายถึงการจัดการเพย์โหลดที่เกือบจะเหมือนกัน วงจรที่สะอาดกว่า:

  1. บันทึกคำขอเพียงครั้งเดียว ในโปรเจกต์ Apidog โดยใช้ {{model_id}}, {{detail}} และ payload รูปภาพเป็นตัวแปร การสลับรูปภาพทดสอบหรือระดับรายละเอียดจะกลายเป็นการเปลี่ยนจากเมนูดรอปดาวน์
  2. เขียนสคริปต์การเข้ารหัส สคริปต์ก่อนการร้องขอจะอ่านรูปภาพและแทรกสตริง base64 ทำให้ request body ที่แสดงยังคงอ่านง่าย
  3. ยืนยันตามโครงสร้าง ไม่ใช่อารมณ์ หากคุณสั่งให้ส่งออกเป็น JSON (รายการสินค้า, คำอธิบายขอบเขต, ค่าแผนภูมิ) ให้เพิ่มการยืนยันที่วิเคราะห์การตอบกลับและตรวจสอบฟิลด์ สิ่งนี้จะเปลี่ยนจาก "โมเดลดูเหมือนจะใช้ได้" เป็นการผ่าน/ไม่ผ่านที่คุณสามารถเรียกใช้ซ้ำได้หลังจากการแก้ไขโมเดล Exp ทุกครั้ง
  4. จำลองรูปแบบการตอบกลับ (Mock the response shape) สำหรับส่วนหน้าของคุณในขณะที่พรอมต์ยังคงได้รับการปรับแต่งอยู่ Apidog’s smart mock จะให้บริการ schema โดยไม่สิ้นเปลืองการเรียก API

ดาวน์โหลด Apidog ฟรี และการตั้งค่าทั้งหมดใช้เวลาเพียงไม่กี่นาที การรันซ้ำเมื่อ DeepSeek ปรับปรุงโมเดลทดลองก็ทำได้ด้วยคลิกเดียว

คำถามที่พบบ่อย (FAQ)

สรุป

DeepSeek ยังคงดำเนินตามกลยุทธ์เดิม: นำความสามารถที่ทุกคนคิดค่าบริการในอัตราพรีเมียม มานำเสนอในราคา Flash และติดป้ายกำกับอย่างซื่อสัตย์ในขณะที่กำลังทำให้เสถียร deepseek-v4-flash-vision-exp มอบความสามารถในการทำความเข้าใจภาพบน production endpoints ในราคาเพียงเศษสตางค์ต่อภาพ ด้วยสามเส้นทางอินพุตและข้อจำกัดที่แท้จริงที่คุณสามารถออกแบบได้ สร้างคำขอเพียงครั้งเดียวใน Apidog กำหนดการยืนยันของคุณ แล้วคุณจะพร้อมใช้งานโมเดล Exp ในวันนี้และพร้อมที่จะตัดสินผู้สืบทอดในวันที่เปิดตัว

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API