Model termurah DeepSeek kini dapat "melihat". Pada 21 Agustus 2026, DeepSeek merilis deepseek-v4-flash-vision-exp, sebuah versi V4-Flash yang dilengkapi visi yang menerima gambar melalui API produksi yang sama, dengan harga yang sama seperti model teks-saja, dengan setiap gambar ditagih tidak lebih dari 384 token input. Catatan rilis resmi menyatakan dengan jelas: kemampuan teks yang sama dengan V4-Flash, ditambah pemahaman gambar yang menurut DeepSeek membawa kinerja agen multimodal mereka mendekati Opus 4.8.
Panduan ini mencakup apa itu model, apa arti "Exp" dalam nama untuk penggunaan produksi, tiga cara untuk mengirim gambar, batasan yang akan menyulitkan Anda, dan cara menguji permintaan multimodal dengan benar. Karena permintaan visi mencampur jenis konten dan cepat menjadi besar, permintaan tersebut adalah jenis panggilan API yang layak dibuat di Apidog daripada mengedit JSON secara manual di terminal.
Apa itu deepseek-v4-flash-vision-exp
Model ini adalah V4-Flash-0731 dengan encoder gambar terpasang. Menurut DeepSeek, model ini cocok dengan model dasar dalam tugas-tugas teks, termasuk beban kerja agen, penalaran, dan pengetahuan dunia, sehingga Anda dapat menggantinya tanpa kehilangan apa yang sudah dilakukan V4-Flash. Daftar OpenRouter menggambarkannya sebagai model campuran ahli (sparse mixture-of-experts) dengan 13 miliar parameter aktif dari total 284 miliar.
Konteks penting: V4-Flash adalah lini hemat DeepSeek. Kami membahas model teks ketika diluncurkan dalam panduan API DeepSeek V4-Flash kami, dan ekonomi belum berubah. Visi dengan harga flash mengalahkan hampir setiap API multimodal di pasar, itulah sebabnya klaim "mendekati Opus 4.8 pada tolok ukur agen multimodal", framing dari DeepSeek sendiri, menarik perhatian. Perlakukan klaim tolok ukur vendor sebagai klaim; jalankan evaluasi Anda sendiri pada dokumen Anda sendiri sebelum Anda memigrasikan apa pun.
Meskipun diberi label eksperimental, ini bukan mainan kotak pasir. Model ini berjalan pada titik akhir API produksi dengan batas laju dan SLA yang sama dengan model V4 lainnya, dan tidak ada daftar tunggu atau permintaan akses khusus.
Harga: tarif flash, termasuk gambar
Kartu tarif identik dengan deepseek-v4-flash hanya-teks, menurut halaman harga DeepSeek:
| Non-puncak | Puncak | |
|---|---|---|
| Input, cache hit (per 1M token) | $0.007 | $0.014 |
| Input, cache miss (per 1M token) | $0.22 | $0.44 |
| Output (per 1M token) | $0.66 | $1.32 |
Gambar ditokenisasi untuk penagihan hingga 384 token masing-masing dan dikenakan biaya dengan tarif input. Pada harga puncak tanpa cache (cache-miss), sebuah gambar berbiaya penuh sekitar $0.00017. Seribu gambar berharga kurang dari secangkir kopi.
Dua perilaku harga diteruskan dari model teks. Tarif non-puncak adalah setengah dari tarif puncak, dengan jam puncak berjalan dari 01:00 hingga 04:00 dan 06:00 hingga 10:00 UTC pada hari kerja, sehingga pekerjaan visi batch yang dijadwalkan di luar jendela tersebut berharga setengah lebih murah. Dan caching konteks berlaku untuk input berulang, yang penting ketika Anda mengirim ulang prompt sistem yang sama di sekitar gambar yang bervariasi. Halaman harga mencantumkan jendela konteks 1 juta token untuk lini V4, dengan output dibatasi jauh di bawah itu dalam praktiknya.
Tiga cara mengirim gambar
Model ini bekerja melalui titik akhir Chat Completions standar DeepSeek di https://api.deepseek.com/chat/completions (panggilan gaya Pesan dan gaya Respons juga didukung, seperti yang ditetapkan dalam peluncuran API DeepSeek V4-Flash Responses). Gambar berada dalam array content dari pesan pengguna, dan Anda memiliki tiga opsi pengiriman.
1. Base64 sebaris. Encode gambar sebagai URL data. Sederhana, mandiri, dan dibatasi 32 MiB per gambar:
import base64
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
with open("invoice.png", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extract the line items and totals as JSON."},
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
]
}]
)
print(response.choices[0].message.content)
2. URL eksternal. Teruskan tautan yang dapat dijangkau publik (hingga 8.192 karakter) alih-alih melakukan encoding:
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
3. Referensi API File. Unggah sekali, gunakan kembali berdasarkan ID. API File DeepSeek sekarang menerima unggahan gambar secara gratis, dan referensi file_id melewatkan pengunggahan ulang gambar yang sama di seluruh permintaan, dengan batas yang lebih tinggi yaitu 64 MiB per gambar:
{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}
Gunakan base64 untuk panggilan sekali pakai, URL ketika gambar Anda sudah ada di CDN, dan ID file untuk alur kerja apa pun yang menyentuh gambar yang sama lebih dari sekali.
Parameter detail
Bidang detail opsional pada setiap gambar mengontrol pra-pemrosesan:
"low": menurunkan skala menjadi 512x512. Paling murah dan tercepat, cocok untuk pertanyaan tingkat klasifikasi."high"/"original": mempertahankan dimensi asli, untuk dokumen padat dan teks kecil."auto": membiarkan API memutuskan.
Secara internal, gambar dinormalisasi mendekati 800x800 untuk penghitungan token, begitulah cara batas 384-token per gambar tetap berlaku. Jika Anda melakukan pekerjaan yang mirip OCR pada tanda terima atau dasbor, uji "low" versus "high" pada korpus nyata Anda; perbedaan biaya kecil pada harga ini, tetapi perbedaan akurasi bisa besar.
Batas yang perlu diketahui sebelum produksi
| Batasan | Nilai |
|---|---|
| Maksimal gambar per permintaan | 600 |
| Ukuran gambar sebaris (base64) | 32 MiB |
| Ukuran gambar API File | 64 MiB |
| Total badan permintaan | 48 MiB |
| Dimensi gambar | 8.192 px per sisi (4.096 px ketika permintaan membawa 15+ gambar) |
| Panjang URL eksternal | 8.192 karakter |
| Penempatan gambar | Hanya pesan user |
Baris terakhir itu adalah penyebab nyata error 400: gambar dalam pesan system atau assistant ditolak. Permintaan multi-gambar didukung dan dapat disisipkan secara bebas dengan teks, inilah yang membuat model ini dapat digunakan untuk agen yang melakukan tangkapan layar, penalaran, dan tindakan. Jika Anda mengatur loop tersebut, DeepSeek menyediakan dukungan asli untuk model ini di DeepSeek Harness 0.1.1 pada hari yang sama; gambaran umum DeepSeek Harness kami membahas tumpukan tersebut. Perhatikan juga bahwa pemanggilan alat (tool calling) berfungsi bersama visi, sama seperti alur model teks yang dijelaskan dalam panduan pemanggilan fungsi kami.
Apa arti "Exp" bagi Anda
Akhiran ini adalah pelabelan yang jujur, bukan batasan berbayar (paywall). Harapkan model ini akan direvisi atau diganti dalam waktu singkat, seperti yang pernah terjadi pada titik akhir eksperimental DeepSeek sebelumnya. Tindakan pencegahan praktis:
- Jangan mengkodekan ID model di dua belas tempat. Letakkan
deepseek-v4-flash-vision-expdalam satu nilai konfigurasi atau variabel lingkungan. - Sediakan fallback teks-saja. Karena model ini cocok dengan
deepseek-v4-flashdalam tugas teks, mengarahkan lalu lintas non-gambar ke ID stabil tidak akan merugikan Anda. - Simpan snapshot evaluasi Anda. Ketika pengganti non-eksperimental tiba, Anda ingin perbandingan sebelum/sesudah pada tugas Anda sendiri, bukan tugas vendor.
Contoh kerja: berapa biaya pipeline dokumen
Angka membuat harga menjadi nyata. Misalkan Anda memproses 50.000 faktur yang dipindai setiap bulan, satu gambar masing-masing, dengan prompt instruksi 200-token dan sekitar 400 token output JSON per panggilan:
- Input gambar: 50.000 x 384 token = 19,2 juta token. Pada tarif puncak cache-miss ($0,44/1 juta), itu $8,45.
- Input teks: 50.000 x 200 = 10 juta token, sekitar $4,40 pada puncak. Dengan caching konteks pada blok instruksi yang berulang, sebagian besar akan turun ke tarif cache-hit ($0,014/1 juta), atau sekitar $0,14.
- Output: 50.000 x 400 = 20 juta token pada $1,32/1 juta, jadi $26,40.
Total: sekitar $35 hingga $40 per bulan pada tarif puncak, dan sekitar setengahnya jika batch berjalan di luar jendela hari kerja pukul 01:00 hingga 10:00 UTC. Token output mendominasi, yang merupakan pelajaran yang berguna: dengan gambar semurah ini, Anda mengoptimalkan pipeline visi dengan mengencangkan format respons, bukan dengan menurunkan skala gambar. Memberi prompt untuk JSON ringkas alih-alih deskripsi prosa mengurangi tagihan lebih dari pra-pemrosesan gambar apa pun.
Profil biaya itu juga mengapa model ini mengubah perhitungan untuk agen loop. Siklus tangkapan layar-penalaran-tindakan yang terlalu mahal untuk dijalankan terus-menerus pada model multimodal unggulan menjadi layak pada 384 token per bingkai.
Menguji permintaan multimodal di Apidog
Permintaan visi merepotkan untuk diulang secara manual: blob base64 membuat JSON mentah tidak terbaca, dan membandingkan pengaturan detail berarti mengelola payload yang hampir identik. Sebuah loop yang lebih bersih:
- Simpan permintaan sekali dalam proyek Apidog, dengan
{{model_id}},{{detail}}, dan payload gambar sebagai variabel. Mengganti gambar uji atau tingkat detail menjadi perubahan dropdown. - Skrip encoding. Skrip pra-permintaan membaca gambar dan menyuntikkan string base64, sehingga badan permintaan yang terlihat tetap terbaca.
- Tegaskan pada struktur, bukan perasaan. Jika Anda memberi prompt untuk output JSON (item baris, deskripsi pembatas, nilai grafik), tambahkan penegasan yang mengurai respons dan memeriksa bidang. Itu mengubah "model tampaknya baik-baik saja" menjadi lulus/gagal yang dapat Anda jalankan kembali setelah setiap revisi model Exp.
- Mock bentuk respons untuk frontend Anda sementara prompt masih disesuaikan; mock cerdas Apidog menyajikan skema tanpa membakar panggilan API.
Unduh Apidog secara gratis dan seluruh sistem membutuhkan waktu beberapa menit; menjalankannya kembali ketika DeepSeek merevisi model eksperimental hanya dengan satu klik.
FAQ
Apakah deepseek-v4-flash-vision-exp gratis? Tidak, tetapi mendekati gratis. Ini ditagih dengan tarif flash model teks, dengan gambar dibatasi 384 token input masing-masing. Penyimpanan gambar API DeepSeek Files gratis; Anda hanya membayar ketika gambar masuk ke permintaan.
Apakah ini menggantikan deepseek-v4-flash? Tidak. Model teks tetap menjadi ID stabil. Build visi cocok dengan itu pada tugas teks, sehingga Anda dapat mengkonsolidasikan pada ID visi jika Anda menerima perubahan eksperimental, tetapi pola konservatif adalah hanya mengarahkan lalu lintas yang membawa gambar ke sana.
Bisakah saya menggunakannya melalui format API gaya Anthropic? Ya. Titik akhir V4 DeepSeek menerima panggilan Chat Completions, format Pesan, dan format Respons, sehingga klien yang ada pada salah satu dari tiga gaya dapat menambahkan blok gambar tanpa mengubah dialek permintaan. Panduan API V4 Pro kami menunjukkan mekanisme titik akhir yang dibagikan di seluruh keluarga.
Bagaimana perbandingan harganya dengan visi GPT atau Claude? Dengan $0,22 hingga $0,44 per juta token input dengan gambar 384-token, ini adalah satu ordo besaran di bawah tarif multimodal unggulan. Pertanyaan terbukanya adalah akurasi pada beban kerja Anda, itulah gunanya skenario evaluasi di atas.
Kesimpulan
DeepSeek terus menjalankan strategi yang sama: mengambil kemampuan yang semua orang kenakan biaya premium, mengirimkannya dengan harga flash, dan melabelinya dengan jujur saat stabil. deepseek-v4-flash-vision-exp memberi Anda pemahaman gambar pada titik akhir produksi dengan biaya sepersekian sen per gambar, dengan tiga jalur input dan batasan nyata yang dapat Anda rancang. Bangun permintaan sekali di Apidog, sematkan penegasan Anda, dan Anda akan siap untuk menggunakan model Exp hari ini dan menilai penggantinya pada hari peluncurannya.
