DeepSeek-V4.1-Flash dirilis secara umum (GA) pada API pada 10 September 2026, dan catatan rilisnya disertai dengan pemotongan harga. Input cache-hit sekarang berharga $0,003 per juta token di luar jam sibuk, input cache-miss $0,15, output $0,60. Empat hari kemudian, pada 14 September, DeepSeek mulai mengarahkan setiap permintaan deepseek-v4-pro ke V4.1-Flash dan menagihnya dengan tarif Flash. Jika Anda menjalankan apa pun di DeepSeek API, tagihan Anda berubah minggu ini terlepas dari apakah Anda mengubah kode Anda atau tidak.
Postingan ini adalah setengah bagian cerita mengenai harga: tabel USD dan CNY lengkap, perubahan persentase terhadap V4-Flash dan V4-Pro, di mana jendela puncak berlaku di zona waktu Anda, dan dua contoh cache-hit dengan perhitungan yang ditunjukkan. Untuk model itu sendiri, mulailah dengan apa itu DeepSeek-V4.1-Flash.
Sebagai catatan awal. Setiap angka benchmark dalam kelompok ini adalah angka yang dilaporkan DeepSeek dari kartu model. Harga berasal dari halaman harga, diverifikasi pada 10 September. Bagian terakhir menunjukkan cara mengukur pengeluaran Anda sendiri dengan Apidog dengan membaca blok usage pada setiap respons alih-alih mempercayai perkiraan.
tombol
TL;DR
- Di luar jam sibuk,
deepseek-flashberharga $0,003 per 1 juta token input cache-hit, $0,15 per 1 juta token input cache-miss, dan $0,60 per 1 juta token output. Pada jam sibuk harganya persis dua kali lipat. - Dibandingkan dengan V4-Flash pada 21 Agustus: input cache-hit turun 57%, input cache-miss turun 32%, output turun 9%.
- Dibandingkan dengan V4-Pro pada jam sibuk: beban kerja yang dialihkan membayar 77% lebih murah untuk input cache-miss dan 70% lebih murah untuk output mulai 14 September.
- Jam sibuk berlaku Senin hingga Jumat, 01:00 hingga 04:00 dan 06:00 hingga 10:00 UTC. Akhir pekan sepenuhnya di luar jam sibuk.
Tabel harga lengkap
Semua angka adalah per 1 juta token, berlaku efektif 10 September 2026 pukul 04:00 UTC.
| deepseek-flash di luar jam sibuk | deepseek-flash jam sibuk | deepseek-v4-pro di luar jam sibuk | deepseek-v4-pro jam sibuk | |
|---|---|---|---|---|
| Input, cache hit | $0.003 | $0.006 | $0.022 | $0.044 |
| Input, cache miss | $0.15 | $0.30 | $0.66 | $1.32 |
| Output | $0.60 | $1.20 | $1.98 | $3.96 |
| Konkurensi | 2,500 | 2,500 | 500 | 500 |
Kolom deepseek-v4-pro penting selama empat hari lagi. Mulai 14 September pukul 04:00 UTC (12:00 Beijing), permintaan ke nama model tersebut dilayani oleh V4.1-Flash dan ditagih berdasarkan dua kolom pertama. Panduan penghentian dan migrasi V4-Pro mencakup apa yang perlu diuji sebelum itu.
Jika akun Anda diatur dalam yuan, halaman harga zh-cn mencantumkan deepseek-flash sebagai:
| Di luar jam sibuk (CNY) | Jam sibuk (CNY) | |
|---|---|---|
| Input, cache hit | ¥0.02 | ¥0.04 |
| Input, cache miss | ¥1.00 | ¥2.00 |
| Output | ¥4.00 | ¥8.00 |
Setiap baris CNY adalah baris USD dikalikan sekitar 6,67. Dua detail yang tidak disebutkan dalam tabel: penyimpanan konteks otomatis, tanpa perlu mengatur flag, dan id model sekarang adalah deepseek-flash. Nama lama deepseek-v4-flash dan deepseek-v4-flash-vision-exp masih mengarah namun mendarat di V4.1-Flash dengan tarif ini.
Apa yang berubah dibandingkan V4-Flash dan V4-Pro
Pada 21 Agustus 2026, deepseek-v4-flash ditagih $0,007 / $0,22 / $0,66 di luar jam sibuk (cache hit / cache miss / output) dan $0,014 / $0,44 / $1,32 pada jam sibuk. Changelog menyatakan bahwa harga "disesuaikan secara proporsional" dengan rilis ini. Berikut adalah arti "sesuai", dihitung dari dua daftar:
| Item Baris | V4-Flash (21 Agustus) | V4.1-Flash (10 Sep) | Pemotongan |
|---|---|---|---|
| Cache hit, di luar jam sibuk | $0.007 | $0.003 | 57% |
| Cache miss, di luar jam sibuk | $0.22 | $0.15 | 32% |
| Output, di luar jam sibuk | $0.66 | $0.60 | 9% |
Baris jam sibuk memiliki persentase yang identik, karena kedua daftar berlipat ganda pada jam sibuk. Pola ini disengaja: pemotongan paling tajam berlaku pada cache hits, yang terkecil pada output. DeepSeek menetapkan harga untuk loop agen yang membaca ulang prefiks panjang di setiap giliran, dan cache KV FP4 di V4.1 (890 byte per token, sekitar seperempat dari jejak V4-Flash) adalah yang membuat harga hit $0,003 berkelanjutan di pihak mereka.
Untuk pengguna V4-Pro, angkanya lebih besar, karena pengalihan rute terjadi pada tarif Flash:
- Input cache-miss pada jam sibuk: $1,32 menjadi $0,30, pemotongan 77%.
- Output pada jam sibuk: $3,96 menjadi $1,20, pemotongan 70%.
- Input cache-hit pada jam sibuk: $0,044 menjadi $0,006, pemotongan 86%.
DeepSeek mengatakan V4.1-Flash "telah melampaui V4 Pro secara komprehensif dalam kinerja, biaya, kecepatan, dan total waktu", sebuah klaim yang perlu Anda periksa dengan prompt Anda sendiri sebelum tanggal 14. Untuk evolusi harga keluarga yang lebih panjang, termasuk periode ketika DeepSeek menaikkan harga API, rincian harga API DeepSeek V4 memiliki sejarahnya.
Jendela jam sibuk di zona waktu Anda
Jam sibuk berlaku hanya Senin hingga Jumat, dalam dua blok waktu: 01:00 hingga 04:00 UTC dan 06:00 hingga 10:00 UTC. Yaitu 09:00 hingga 12:00 dan 14:00 hingga 18:00 waktu Beijing. Tujuh jam sibuk per hari kerja, 35 per minggu, jadi jam sibuk mencakup sekitar 21% dari 168 jam dalam seminggu. Waktu lainnya, termasuk seluruh hari Sabtu dan Minggu, ditagih dengan tarif di luar jam sibuk.
| Jendela Waktu | UTC | Beijing (UTC+8) | US Pacific (PDT, UTC-7) | Eropa Tengah (CEST, UTC+2) |
|---|---|---|---|---|
| Puncak 1 | 01:00 hingga 04:00 | 09:00 hingga 12:00 | 18:00 hingga 21:00 (malam sebelumnya) | 03:00 hingga 06:00 |
| Puncak 2 | 06:00 hingga 10:00 | 14:00 hingga 18:00 | 23:00 hingga 03:00 (semalam) | 08:00 hingga 12:00 |
Kolom Pacific dan Eropa Tengah menggunakan waktu musim panas. Setelah perubahan jam (25 Oktober di Uni Eropa, 1 November di AS), geser kedua kolom satu jam lebih awal. Batas UTC tidak pernah berubah.
Hari kerja Pantai Barat AS tidak pernah menyentuh blok jam sibuk. Pagi hari di Eropa Tengah berada di dalam Puncak 2, dan batch malam Eropa pukul 03:00 waktu setempat membayar dua kali lipat; memindahkannya ke 23:00 CEST (21:00 UTC) mengembalikannya ke harga setengah.
Matematika cache-hit, dikerjakan dua kali
Satu hit berharga 1/50 dari satu miss ($0,003 versus $0,15), jadi rasio prefiks yang diulang terhadap token baru lebih menentukan biaya input Anda daripada jumlah token mentah. Jika caching prefiks adalah hal baru bagi Anda, panduan dasar caching prompt menjelaskan apa yang dihitung sebagai prefiks yang dapat di-cache: byte identik di awal permintaan.
Contoh 1: loop agen dengan prompt sistem 20K token, 1.000 panggilan pada jam sibuk.
Agen triage dukungan membawa prompt sistem 20.000 token (kebijakan, skema alat, contoh beberapa-shot), membaca 2.000 token baru dari teks tiket per panggilan, dan menulis 1.000 token output. Selama 1.000 panggilan:
- Total input adalah 1.000 × 22.000 = 22 juta token. Total output adalah 1 juta token.
- Panggilan pertama tidak mengenai semua 22.000 token. Setiap panggilan berikutnya mengenai prefiks 20.000 token dan tidak mengenai 2.000 token barunya.
- Token yang mengenai cache: 999 × 20.000 = 19,98 juta. Dengan $0,006 per 1 juta: 19,98 × 0,006 = $0,12.
- Token yang tidak mengenai cache: 22.000 + 999 × 2.000 = 2,02 juta. Dengan $0,30 per 1 juta: 2,02 × 0,30 = $0,61.
- Output: 1 juta × $1,20 = $1,20.
- Total: $0,12 + $0,61 + $1,20 = $1,93.
Tanpa caching, input saja akan menjadi 22 × $0,30 = $6,60 dan pekerjaan itu akan berharga $7,80. Caching mengurangi 75% dari tagihan. Jalankan loop yang sama di luar jam sibuk dan setiap baris menjadi setengahnya: $0,06 + $0,30 + $0,60 = $0,96.
1.000 panggilan yang sama pada V4-Pro di jam sibuk (hits $0,88, misses $2,67, output $3,96) berjumlah $7,51, angka yang harus dibandingkan oleh pelanggan Pro dengan $1,93 ketika pengalihan rute terjadi.
Contoh 2: pekerjaan batch dengan 10 juta token output, dipindahkan ke luar jam sibuk.
Tim katalog menghasilkan 10.000 deskripsi produk. Setiap panggilan mengirim 1.500 token data produk (unik per item, jadi tidak ada manfaat cache) dan mendapatkan kembali 1.000 token salinan teks. Itu adalah 15 juta token input, semua tidak mengenai cache, dan 10 juta token output.
- Pada jam sibuk: input 15 × $0,30 = $4,50. Output 10 × $1,20 = $12,00. Total $16,50.
- Di luar jam sibuk: input 15 × $0,15 = $2,25. Output 10 × $0,60 = $6,00. Total $8,25.
- Penghematan dari waktu saja: $8,25, tanpa perubahan pada prompt.
Output mendominasi pekerjaan ini dan mendapatkan pemotongan terkecil dalam rilis, jadi jendela waktu di luar jam sibuk adalah pengungkit yang lebih besar. Ini adalah jendela waktu yang murah hati: 15 jam setiap hari kerja mulai pukul 10:00 UTC, ditambah 48 jam tanpa gangguan setiap akhir pekan.
Konteks, output, dan mengapa konkurensi adalah bagian dari harga
Kedua nama model membawa konteks 1 juta token dan output maksimum 384 ribu token. Kartu model merekomendasikan token maksimum 256 ribu atau lebih, jadi tetapkan batas itu dengan sengaja: respons yang menghasilkan 384 ribu token output berharga $0,46 pada jam sibuk, bagus untuk transkrip agen dan masalah untuk pelengkapan otomatis.
Konkurensi adalah 2.500 untuk Flash dibandingkan 500 untuk Pro. Ini termasuk dalam artikel harga karena diskon di luar jam sibuk hanya berarti jika Anda dapat menyelesaikan pekerjaan dalam jendela waktu tersebut, dan karena lalu lintas deepseek-v4-pro yang dialihkan pada 14 September mewarisi batas Flash: integrasi Pro yang sebelumnya mengantri di belakang 500 slot mendapatkan lima kali lipat ruang gerak tanpa perubahan konfigurasi.
Ukur pengeluaran nyata dengan Apidog
Tabel harga memberi tahu Anda tarifnya. Objek usage pada setiap respons memberi tahu Anda apa yang ditagihkan kepada Anda. Berikut adalah alur kerja Apidog yang membuat itu menjadi pemeriksaan yang dapat diulang.

- Tambahkan titik akhir. Buat
POST https://api.deepseek.com/chat/completions, atau impor spesifikasi OpenAPI yang kompatibel dengan OpenAI. - Masukkan harga ke dalam lingkungan. Buat dua lingkungan Apidog,
deepseek-peakdandeepseek-offpeak, masing-masing menyimpanDEEPSEEK_API_KEYditambahPRICE_HIT,PRICE_MISS, danPRICE_OUTsebagai{{variabel}}. Peak berisi 0,006 / 0,30 / 1,20; off-peak berisi 0,003 / 0,15 / 0,60. - Kirim sekali dan baca
usage. DeepSeek membagi input menjadiprompt_cache_hit_tokensdanprompt_cache_miss_tokensdi sampingcompletion_tokens[VERIFIKASI]. Simpan permintaan sebagai kasus uji. - Buat skenario pengujian yang menegaskan perilaku cache. Rantaikan permintaan yang disimpan dua kali dengan prompt sistem 20K token yang sama. Pada langkah kedua, tegaskan bahwa bidang token-hit setidaknya 19.000 dan bahwa biaya yang dihitung (hits ×
{{PRICE_HIT}}+ misses ×{{PRICE_MISS}}+ output ×{{PRICE_OUT}}, dibagi 1 juta) tetap di bawah anggaran. Kegagalan pada langkah kedua berarti prefiks telah berubah, dan penegasan menangkapnya sebelum tagihan datang. - Bandingkan jam sibuk dengan di luar jam sibuk. Jalankan skenario di setiap lingkungan dan bedakan baris biaya, atau jalankan dari CI dengan
apidog-clipada jadwal yang melintasi batas puncak UTC.
Unduh Apidog dan seluruh skenario, termasuk lingkungan, berfungsi pada paket gratis.
Dampak ini pada tagihan Anda
V4.1-Flash lebih murah daripada V4-Flash pada setiap baris dan 70 hingga 86% lebih murah daripada tarif V4-Pro yang digantikannya. Dua pengungkit penting: jaga agar prefiks panjang Anda identik secara byte sehingga mengenai cache, dan jadwalkan pekerjaan batch di luar tujuh jam sibuk hari kerja. Kemudian catat usage pada setiap panggilan, tegaskan jumlah hit, dan biarkan angka-angka menunjukkan apakah pemotongan tersebut mencapai tagihan Anda.
