DeepSeek-V4.1-Flash resmi diluncurkan (GA) di API hari ini, 10 September 2026. Catatan rilisnya singkat, namun mengubah tiga hal bagi siapa pun yang memanggil API DeepSeek: ada satu ID model yang akan digunakan mulai sekarang, yaitu deepseek-flash; tarif per-token turun lagi; dan dalam empat hari, pada 14 September, setiap permintaan ke deepseek-v4-pro akan dialihkan ke model ini dan ditagih dengan harga Flash.
Poin terakhir itulah mengapa panduan ini ada. Jika Anda memiliki kode produksi yang menggunakan V4-Pro, Anda tidak bisa memilih tanggal migrasi. Jika Anda menggunakan V4-Flash, Anda sudah dilayani oleh model baru dengan nama lama. Apa pun itu, parameter yang Anda kirim hari ini patut diperiksa.
Pos ini membahas sisi praktisnya: ID model, URL dasar, panggilan pertama dalam tiga bahasa, upaya penalaran, input gambar, streaming, dan harga. Untuk arsitektur dan cerita benchmark, baca dulu Apa itu DeepSeek-V4.1-Flash.
Sebelum menghubungkan apa pun ke dalam kode, Anda pasti ingin cara cepat untuk mengirim permintaan dan membandingkan respons. Apidog menanganinya: arahkan ke https://api.deepseek.com, simpan kunci sebagai variabel, dan simpan setiap panggilan yang berfungsi sebagai pengujian yang dapat diulang. Alur kerja ada di bagian akhir.
TL;DR
- ID Model:
deepseek-flash. Nama lamadeepseek-v4-flashdandeepseek-v4-flash-vision-expmasih berfungsi tetapi mengarah ke V4.1-Flash. - URL Dasar tidak berubah:
https://api.deepseek.com(kompatibel dengan OpenAI) danhttps://api.deepseek.com/anthropic(kompatibel dengan Anthropic). deepseek-v4-prodialihkan ke V4.1-Flash pada 14 September 2026 pukul 04:00 UTC.- Konteks 1 juta token, output maksimum 384 ribu, batas konkurensi 2.500.
- Harga di luar jam sibuk per 1 juta token: $0.003 cache hit, $0.15 cache miss, $0.60 output. Jam sibuk dua kali lipat.
- Visi bersifat asli (native). Gambar masuk ke dalam array
contentsebagai bagianimage_url.
Apa yang berubah untuk pemanggil API
Berikut adalah perbedaannya, diambil dari catatan rilis dan changelog.
Satu ID model. Nama kanonisnya sekarang adalah deepseek-flash, tanpa versi di dalamnya. Sematkan prompt dan pengujian Anda pada perilaku, bukan pada string versi, karena rilis Flash berikutnya akan diluncurkan dengan nama yang sama.
Nama lama masih berfungsi. deepseek-v4-flash dan deepseek-v4-flash-vision-exp diterima untuk saat ini, tetapi model di belakangnya, V4-Flash dan V4-Flash-Vision-Exp, sudah pensiun. Permintaan ke nama-nama tersebut dilayani oleh V4.1-Flash. Tidak ada yang rusak, tetapi Anda tidak menjalankan model yang Anda kira. Ganti nama kapan pun Anda bisa.
Nama beta sudah tidak ada. Beta dua hari dari 8 September berjalan sebagai deepseek-v4.1-flash-expires-on-0910. Ini berakhir seperti yang dijanjikan. Beralihlah ke deepseek-flash.
URL dasar dan format tidak berubah. Panggilan yang kompatibel dengan OpenAI pergi ke https://api.deepseek.com, panggilan yang kompatibel dengan Anthropic pergi ke https://api.deepseek.com/anthropic, dan format API Respons yang sudah didukung oleh seri Flash tetap ada. Konfigurasi SDK Anda tidak perlu diubah.
V4-Pro memiliki empat hari. Mulai 14 September 2026 pukul 04:00 UTC (12:00 Beijing), setiap permintaan deepseek-v4-pro dialihkan ke V4.1-Flash dan ditagih dengan tarif V4.1-Flash. Alasan DeepSeek adalah bahwa V4.1-Flash "telah secara komprehensif melampaui V4 Pro dalam kinerja, biaya, kecepatan, dan waktu total", mengutip pengujian oleh berbagai pihak. Itu adalah klaim vendor. Panduan migrasi pensiun V4-Pro menunjukkan cara memeriksanya pada prompt Anda sendiri sebelum perubahan terjadi.
Langkah 1: dapatkan kunci
Masuk ke platform DeepSeek, buka API Keys, dan buat satu. Kunci dimulai dengan sk-. Ekspor alih-alih menempelkannya ke sumber:
export DEEPSEEK_API_KEY="sk-kunci-anda-di-sini"
Tidak diperlukan SDK khusus DeepSeek. Pustaka klien OpenAI dan Anthropic keduanya berfungsi setelah Anda mengubah URL dasar.
Langkah 2: lakukan panggilan pertama Anda
Curl dulu, karena menghilangkan setiap variabel kecuali API itu sendiri:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-flash",
"messages": [
{"role": "system", "content": "Anda adalah teknisi dukungan untuk API pembayaran."},
{"role": "user", "content": "Pelanggan mendapatkan HTTP 402 pada /v1/charges. Sebutkan tiga penyebab paling mungkin."}
],
"stream": false
}'
Panggilan yang sama melalui OpenAI Python SDK:
# pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "system", "content": "Anda adalah teknisi dukungan untuk API pembayaran."},
{"role": "user", "content": "Pelanggan mendapatkan HTTP 402 pada /v1/charges. Sebutkan tiga penyebab paling mungkin."},
],
)
print(response.choices[0].message.content)
Dan Node:
// npm install openai
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await client.chat.completions.create({
model: "deepseek-flash",
messages: [
{ role: "user", content: "Tulis migrasi Postgres yang menambahkan stempel waktu refunded_at yang bisa null ke faktur." },
],
});
console.log(completion.choices[0].message.content);
Jika Anda menyiapkan terhadap rilis sebelumnya dengan mengikuti panduan API V4-Flash, satu-satunya perbedaan adalah string model.
Langkah 3: upaya penalaran dan mode berpikir
Kartu model menjelaskan upaya penalaran sebagai "dapat dikontrol secara terus-menerus" pada skala 1 hingga 100. Ini adalah keberangkatan dari preset rendah/menengah/tinggi yang diekspos sebagian besar API, dan itu berarti Anda dapat menyetel biaya dan latensi per endpoint, bukan per tingkat.
Bentuk parameter yang membawa nilai 1 hingga 100 itu adalah [VERIFIKASI] terhadap dokumen API. Sampai mereka mengonfirmasinya, mulailah dari pola V4-Flash: reasoning_effort ditambah objek thinking yang dilewatkan melalui extra_body:
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Kluster Redis kami menjatuhkan 2% SET di bawah beban. Rencanakan penyelidikannya."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}},
)
Pengaturan sampling yang direkomendasikan dari kartu model: temperature 1.0, top_p 0.95 atau 1.0, dan max_tokens 256K atau lebih untuk jejak penalaran yang panjang. Output maksimum adalah 384K token.
Pembagian praktis: berpikir mati untuk autokomplet, klasifikasi, dan apa pun yang ditunggu pengguna; berpikir aktif dengan upaya tinggi untuk loop agen, refaktor multi-file, dan debugging. Lalu ukur. Upaya yang tidak dapat Anda lihat di output adalah upaya yang Anda bayar.
Langkah 4: kirim gambar
V4.1-Flash bersifat multimodal secara native, dilatih pada korpus multimodal 45T-token dengan encoder DeepSeek-ViT yang dilatih dari awal. Format permintaan diwarisi dari V4-Flash-Vision-Exp: gambar adalah bagian dari array content pesan pengguna.
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Ekstrak setiap item baris dan total dari tanda terima ini sebagai JSON."},
{"type": "image_url", "image_url": {"url": "https://cdn.example-shop.com/receipts/48213.png"}},
],
}],
)
Untuk file lokal, enkode sebagai URL data base64:
import base64
with open("receipt.png", "rb") as f:
data_url = "data:image/png;base64," + base64.b64encode(f.read()).decode()
# kemudian lewatkan {"url": data_url} di bagian image_url
Batas: URL data base64 hingga 32 MiB, URL eksternal hingga 8.192 karakter, atau ID file. Bidang detail opsional diterima. DeepSeek melaporkan DocVQA 95.6, yang merupakan kasus pembacaan dokumen di atas. Panduan API visi membahas prompt multi-gambar, tingkat detail, dan biaya gambar per permintaan.
Langkah 5: streaming respons
Atur stream=True dan endpoint akan mengembalikan peristiwa server-sent. Konten penalaran dan konten jawaban tiba sebagai delta terpisah, yang penting ketika Anda merender status "berpikir" di UI.
stream = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Jelaskan kunci idempotensi dalam satu paragraf."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
if delta.content:
print(delta.content, end="", flush=True)
Jika SSE baru bagi Anda, streaming respons LLM dengan peristiwa server-sent menjelaskan format kabel dan kasus tepi koneksi ulang.
Harga Sekilas
Dari halaman harga resmi, berlaku mulai 10 September 2026 pukul 04:00 UTC, dalam USD per 1 juta token:
| deepseek-flash di luar jam sibuk | deepseek-flash jam sibuk | |
|---|---|---|
| Input, cache hit | $0.003 | $0.006 |
| Input, cache miss | $0.15 | $0.30 |
| Output | $0.60 | $1.20 |
Tiga hal yang perlu diketahui:
- Jendela jam sibuk adalah Senin hingga Jumat, pukul 01:00 hingga 04:00 dan 06:00 hingga 10:00 UTC (09:00 hingga 12:00 dan 14:00 hingga 18:00 Beijing). Di luar jam sibuk harganya setengah. Pekerjaan batch yang bisa menunggu harus menunggu.
- Cache hit bersifat otomatis. Sebuah hit berharga 50x lebih murah daripada miss, jadi prompt sistem yang stabil di depan setiap permintaan adalah optimasi termurah yang tersedia. Apa itu prompt caching menjelaskan cara kerja pencocokan awalan.
- Dibandingkan V4-Flash, pemotongannya sekitar 57% pada input cache-hit, 32% pada input cache-miss, dan 9% pada output. Beban kerja V4-Pro yang dialihkan pada 14 September membayar $0.30, bukan $1.32 per 1 juta input cache-miss pada jam sibuk, dan $1.20, bukan $3.96 untuk output.
Uji API di Apidog
Setelah panggilan pertama berfungsi, pertanyaannya adalah apakah itu akan terus berfungsi. deepseek-flash tidak membawa versi, jadi peningkatan berikutnya akan senyap. Berikut adalah alur kerja Apidog yang dapat menangkapnya:

- Tambahkan endpoint. Buat
POST https://api.deepseek.com/chat/completions, atau impor spesifikasi OpenAPI yang kompatibel dengan OpenAI agar setiap rute tiba sekaligus. - Simpan kunci sebagai variabel lingkungan. Masukkan
DEEPSEEK_API_KEYke lingkungan Apidog dan atur header menjadiBearer {{DEEPSEEK_API_KEY}}. Beralih antara kunci pribadi dan kunci produksi menjadi mudah dengan dropdown. - Simpan satu permintaan per tingkat upaya. Duplikasi permintaan dasar ke dalam varian: berpikir mati, berpikir aktif dengan upaya rendah, berpikir aktif dengan upaya tinggi. Prompt yang sama, parameter yang berbeda. Kirim ketiga-tiganya dan bandingkan penggunaan token serta latensi secara berdampingan.
- Tonton stream-nya. Untuk
stream: true, Apidog merender peristiwa SSE saat tiba, sehingga delta penalaran dan delta konten muncul sebagai baris terpisah alih-alih dinding awalandata:. - Ubah varian menjadi skenario pengujian. Tambahkan pernyataan pada kode status, pada jumlah cache-hit di
usageyang di atas nol pada eksekusi kedua, dan pada respons yang berisi bidang yang diuraikan aplikasi Anda. Jalankan ulang skenario setelah setiap pembaruan model, dan pada 14 September ketika pengalihan V4-Pro aktif. - Jalankan di CI.
apidog-climengeksekusi skenario yang sama dari pipeline, sehingga perubahan model yang senyap akan menggagalkan build alih-alih menjadi tiket dukungan.
Unduh Apidog dan seluruh penyiapan hanya membutuhkan waktu sekitar sepuluh menit.
FAQ
Apakah saya harus mengganti nama deepseek-v4-flash menjadi deepseek-flash? Tidak hari ini. Nama lama masih mengarah ke V4.1-Flash. Namun V4-Flash sendiri sudah pensiun, dan DeepSeek belum mengatakan kapan alias tersebut akan hilang. Ganti nama di deploy Anda berikutnya.
Apa yang terjadi pada kode V4-Pro saya pada 14 September? Tidak ada yang rusak. Permintaan ke deepseek-v4-pro dijawab oleh V4.1-Flash dan ditagih dengan tarif Flash mulai pukul 04:00 UTC. Output Anda dapat berubah, jadi jalankan set evaluasi Anda sebelum tanggal tersebut. Panduan migrasi memiliki daftar periksa.
Apakah endpoint yang kompatibel dengan Anthropic mendukung model baru? Ya. https://api.deepseek.com/anthropic tidak berubah; gunakan deepseek-flash sebagai nama model di sana juga.
Apakah ada tingkatan gratis? API adalah pay-as-you-go tanpa tingkatan gratis permanen. Weights dilisensikan MIT di Hugging Face jika Anda ingin meng-host sendiri. Opsi saat ini dikumpulkan dalam cara menggunakan API DeepSeek V4 secara gratis.
Seberapa cepat? DeepSeek belum menerbitkan angka token per detik. Salah satu pengguna X melaporkan "hampir 400 t/s" dalam pengujian video, yang merupakan anekdot, bukan spesifikasi. Ukur pada prompt Anda sendiri selama jendela jam sibuk.
Sebelum Pengalihan
Permukaan API hampir tidak bergerak: URL dasar yang sama, format permintaan yang sama, satu ID model baru. Yang bergerak adalah harga dan, pada 14 September, pengalihan setiap panggilan V4-Pro. Ganti nama deepseek-v4-flash menjadi deepseek-flash, pilih tingkat upaya per endpoint, dan jalankan prompt Anda melalui model baru sebelum DeepSeek melakukannya untuk Anda.
Simpan prompt tersebut sebagai pengujian selagi Anda melakukannya. Apidog menjalankannya kembali dengan satu klik, dan peningkatan Flash senyap berikutnya akan muncul sebagai pernyataan yang gagal alih-alih tiket dukungan.
