Cara Menggunakan DeepSeek V4-Flash-Vision API: Panduan Input Gambar

Model DeepSeek termurah kini dapat melihat. ID Model, harga tarif kilat dengan gambar 384-token, tiga metode masukan, batasan, dan contoh perhitungan biaya.

Ashley Innocent

Ashley Innocent

24 August 2026

Cara Menggunakan DeepSeek V4-Flash-Vision API: Panduan Input Gambar

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Model termurah DeepSeek kini dapat "melihat". Pada 21 Agustus 2026, DeepSeek merilis deepseek-v4-flash-vision-exp, sebuah versi V4-Flash yang dilengkapi visi yang menerima gambar melalui API produksi yang sama, dengan harga yang sama seperti model teks-saja, dengan setiap gambar ditagih tidak lebih dari 384 token input. Catatan rilis resmi menyatakan dengan jelas: kemampuan teks yang sama dengan V4-Flash, ditambah pemahaman gambar yang menurut DeepSeek membawa kinerja agen multimodal mereka mendekati Opus 4.8.

Panduan ini mencakup apa itu model, apa arti "Exp" dalam nama untuk penggunaan produksi, tiga cara untuk mengirim gambar, batasan yang akan menyulitkan Anda, dan cara menguji permintaan multimodal dengan benar. Karena permintaan visi mencampur jenis konten dan cepat menjadi besar, permintaan tersebut adalah jenis panggilan API yang layak dibuat di Apidog daripada mengedit JSON secara manual di terminal.

button

Apa itu deepseek-v4-flash-vision-exp

Model ini adalah V4-Flash-0731 dengan encoder gambar terpasang. Menurut DeepSeek, model ini cocok dengan model dasar dalam tugas-tugas teks, termasuk beban kerja agen, penalaran, dan pengetahuan dunia, sehingga Anda dapat menggantinya tanpa kehilangan apa yang sudah dilakukan V4-Flash. Daftar OpenRouter menggambarkannya sebagai model campuran ahli (sparse mixture-of-experts) dengan 13 miliar parameter aktif dari total 284 miliar.

Konteks penting: V4-Flash adalah lini hemat DeepSeek. Kami membahas model teks ketika diluncurkan dalam panduan API DeepSeek V4-Flash kami, dan ekonomi belum berubah. Visi dengan harga flash mengalahkan hampir setiap API multimodal di pasar, itulah sebabnya klaim "mendekati Opus 4.8 pada tolok ukur agen multimodal", framing dari DeepSeek sendiri, menarik perhatian. Perlakukan klaim tolok ukur vendor sebagai klaim; jalankan evaluasi Anda sendiri pada dokumen Anda sendiri sebelum Anda memigrasikan apa pun.

Meskipun diberi label eksperimental, ini bukan mainan kotak pasir. Model ini berjalan pada titik akhir API produksi dengan batas laju dan SLA yang sama dengan model V4 lainnya, dan tidak ada daftar tunggu atau permintaan akses khusus.

Harga: tarif flash, termasuk gambar

Kartu tarif identik dengan deepseek-v4-flash hanya-teks, menurut halaman harga DeepSeek:

Non-puncak Puncak
Input, cache hit (per 1M token) $0.007 $0.014
Input, cache miss (per 1M token) $0.22 $0.44
Output (per 1M token) $0.66 $1.32

Gambar ditokenisasi untuk penagihan hingga 384 token masing-masing dan dikenakan biaya dengan tarif input. Pada harga puncak tanpa cache (cache-miss), sebuah gambar berbiaya penuh sekitar $0.00017. Seribu gambar berharga kurang dari secangkir kopi.

Dua perilaku harga diteruskan dari model teks. Tarif non-puncak adalah setengah dari tarif puncak, dengan jam puncak berjalan dari 01:00 hingga 04:00 dan 06:00 hingga 10:00 UTC pada hari kerja, sehingga pekerjaan visi batch yang dijadwalkan di luar jendela tersebut berharga setengah lebih murah. Dan caching konteks berlaku untuk input berulang, yang penting ketika Anda mengirim ulang prompt sistem yang sama di sekitar gambar yang bervariasi. Halaman harga mencantumkan jendela konteks 1 juta token untuk lini V4, dengan output dibatasi jauh di bawah itu dalam praktiknya.

Tiga cara mengirim gambar

Model ini bekerja melalui titik akhir Chat Completions standar DeepSeek di https://api.deepseek.com/chat/completions (panggilan gaya Pesan dan gaya Respons juga didukung, seperti yang ditetapkan dalam peluncuran API DeepSeek V4-Flash Responses). Gambar berada dalam array content dari pesan pengguna, dan Anda memiliki tiga opsi pengiriman.

1. Base64 sebaris. Encode gambar sebagai URL data. Sederhana, mandiri, dan dibatasi 32 MiB per gambar:

import base64
from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")

with open("invoice.png", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Extract the line items and totals as JSON."},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
        ]
    }]
)
print(response.choices[0].message.content)

2. URL eksternal. Teruskan tautan yang dapat dijangkau publik (hingga 8.192 karakter) alih-alih melakukan encoding:

{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}

3. Referensi API File. Unggah sekali, gunakan kembali berdasarkan ID. API File DeepSeek sekarang menerima unggahan gambar secara gratis, dan referensi file_id melewatkan pengunggahan ulang gambar yang sama di seluruh permintaan, dengan batas yang lebih tinggi yaitu 64 MiB per gambar:

{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}

Gunakan base64 untuk panggilan sekali pakai, URL ketika gambar Anda sudah ada di CDN, dan ID file untuk alur kerja apa pun yang menyentuh gambar yang sama lebih dari sekali.

Parameter detail

Bidang detail opsional pada setiap gambar mengontrol pra-pemrosesan:

Secara internal, gambar dinormalisasi mendekati 800x800 untuk penghitungan token, begitulah cara batas 384-token per gambar tetap berlaku. Jika Anda melakukan pekerjaan yang mirip OCR pada tanda terima atau dasbor, uji "low" versus "high" pada korpus nyata Anda; perbedaan biaya kecil pada harga ini, tetapi perbedaan akurasi bisa besar.

Batas yang perlu diketahui sebelum produksi

Batasan Nilai
Maksimal gambar per permintaan 600
Ukuran gambar sebaris (base64) 32 MiB
Ukuran gambar API File 64 MiB
Total badan permintaan 48 MiB
Dimensi gambar 8.192 px per sisi (4.096 px ketika permintaan membawa 15+ gambar)
Panjang URL eksternal 8.192 karakter
Penempatan gambar Hanya pesan user

Baris terakhir itu adalah penyebab nyata error 400: gambar dalam pesan system atau assistant ditolak. Permintaan multi-gambar didukung dan dapat disisipkan secara bebas dengan teks, inilah yang membuat model ini dapat digunakan untuk agen yang melakukan tangkapan layar, penalaran, dan tindakan. Jika Anda mengatur loop tersebut, DeepSeek menyediakan dukungan asli untuk model ini di DeepSeek Harness 0.1.1 pada hari yang sama; gambaran umum DeepSeek Harness kami membahas tumpukan tersebut. Perhatikan juga bahwa pemanggilan alat (tool calling) berfungsi bersama visi, sama seperti alur model teks yang dijelaskan dalam panduan pemanggilan fungsi kami.

Apa arti "Exp" bagi Anda

Akhiran ini adalah pelabelan yang jujur, bukan batasan berbayar (paywall). Harapkan model ini akan direvisi atau diganti dalam waktu singkat, seperti yang pernah terjadi pada titik akhir eksperimental DeepSeek sebelumnya. Tindakan pencegahan praktis:

Contoh kerja: berapa biaya pipeline dokumen

Angka membuat harga menjadi nyata. Misalkan Anda memproses 50.000 faktur yang dipindai setiap bulan, satu gambar masing-masing, dengan prompt instruksi 200-token dan sekitar 400 token output JSON per panggilan:

Total: sekitar $35 hingga $40 per bulan pada tarif puncak, dan sekitar setengahnya jika batch berjalan di luar jendela hari kerja pukul 01:00 hingga 10:00 UTC. Token output mendominasi, yang merupakan pelajaran yang berguna: dengan gambar semurah ini, Anda mengoptimalkan pipeline visi dengan mengencangkan format respons, bukan dengan menurunkan skala gambar. Memberi prompt untuk JSON ringkas alih-alih deskripsi prosa mengurangi tagihan lebih dari pra-pemrosesan gambar apa pun.

Profil biaya itu juga mengapa model ini mengubah perhitungan untuk agen loop. Siklus tangkapan layar-penalaran-tindakan yang terlalu mahal untuk dijalankan terus-menerus pada model multimodal unggulan menjadi layak pada 384 token per bingkai.

Menguji permintaan multimodal di Apidog

Permintaan visi merepotkan untuk diulang secara manual: blob base64 membuat JSON mentah tidak terbaca, dan membandingkan pengaturan detail berarti mengelola payload yang hampir identik. Sebuah loop yang lebih bersih:

  1. Simpan permintaan sekali dalam proyek Apidog, dengan {{model_id}}, {{detail}}, dan payload gambar sebagai variabel. Mengganti gambar uji atau tingkat detail menjadi perubahan dropdown.
  2. Skrip encoding. Skrip pra-permintaan membaca gambar dan menyuntikkan string base64, sehingga badan permintaan yang terlihat tetap terbaca.
  3. Tegaskan pada struktur, bukan perasaan. Jika Anda memberi prompt untuk output JSON (item baris, deskripsi pembatas, nilai grafik), tambahkan penegasan yang mengurai respons dan memeriksa bidang. Itu mengubah "model tampaknya baik-baik saja" menjadi lulus/gagal yang dapat Anda jalankan kembali setelah setiap revisi model Exp.
  4. Mock bentuk respons untuk frontend Anda sementara prompt masih disesuaikan; mock cerdas Apidog menyajikan skema tanpa membakar panggilan API.

Unduh Apidog secara gratis dan seluruh sistem membutuhkan waktu beberapa menit; menjalankannya kembali ketika DeepSeek merevisi model eksperimental hanya dengan satu klik.

FAQ

Apakah deepseek-v4-flash-vision-exp gratis? Tidak, tetapi mendekati gratis. Ini ditagih dengan tarif flash model teks, dengan gambar dibatasi 384 token input masing-masing. Penyimpanan gambar API DeepSeek Files gratis; Anda hanya membayar ketika gambar masuk ke permintaan.

Apakah ini menggantikan deepseek-v4-flash? Tidak. Model teks tetap menjadi ID stabil. Build visi cocok dengan itu pada tugas teks, sehingga Anda dapat mengkonsolidasikan pada ID visi jika Anda menerima perubahan eksperimental, tetapi pola konservatif adalah hanya mengarahkan lalu lintas yang membawa gambar ke sana.

Bisakah saya menggunakannya melalui format API gaya Anthropic? Ya. Titik akhir V4 DeepSeek menerima panggilan Chat Completions, format Pesan, dan format Respons, sehingga klien yang ada pada salah satu dari tiga gaya dapat menambahkan blok gambar tanpa mengubah dialek permintaan. Panduan API V4 Pro kami menunjukkan mekanisme titik akhir yang dibagikan di seluruh keluarga.

Bagaimana perbandingan harganya dengan visi GPT atau Claude? Dengan $0,22 hingga $0,44 per juta token input dengan gambar 384-token, ini adalah satu ordo besaran di bawah tarif multimodal unggulan. Pertanyaan terbukanya adalah akurasi pada beban kerja Anda, itulah gunanya skenario evaluasi di atas.

Kesimpulan

DeepSeek terus menjalankan strategi yang sama: mengambil kemampuan yang semua orang kenakan biaya premium, mengirimkannya dengan harga flash, dan melabelinya dengan jujur saat stabil. deepseek-v4-flash-vision-exp memberi Anda pemahaman gambar pada titik akhir produksi dengan biaya sepersekian sen per gambar, dengan tiga jalur input dan batasan nyata yang dapat Anda rancang. Bangun permintaan sekali di Apidog, sematkan penegasan Anda, dan Anda akan siap untuk menggunakan model Exp hari ini dan menilai penggantinya pada hari peluncurannya.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.