Penjelasan Harga DeepSeek-V4.1-Flash: Tarif Puncak vs Off-Peak dan Perhitungan Cache-Hit

Tabel harga penuh USD dan CNY untuk deepseek-flash, potongan persentase dibandingkan V4-Flash dan pengalihan rute V4-Pro, periode puncak yang dikonversi ke zona waktu Anda, serta dua contoh cache-hit dengan perhitungan yang ditampilkan.

Medy Evrard

10 September 2026

Penjelasan Harga DeepSeek-V4.1-Flash: Tarif Puncak vs Off-Peak dan Perhitungan Cache-Hit

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

DeepSeek-V4.1-Flash dirilis secara umum (GA) pada API pada 10 September 2026, dan catatan rilisnya disertai dengan pemotongan harga. Input cache-hit sekarang berharga $0,003 per juta token di luar jam sibuk, input cache-miss $0,15, output $0,60. Empat hari kemudian, pada 14 September, DeepSeek mulai mengarahkan setiap permintaan deepseek-v4-pro ke V4.1-Flash dan menagihnya dengan tarif Flash. Jika Anda menjalankan apa pun di DeepSeek API, tagihan Anda berubah minggu ini terlepas dari apakah Anda mengubah kode Anda atau tidak.

Postingan ini adalah setengah bagian cerita mengenai harga: tabel USD dan CNY lengkap, perubahan persentase terhadap V4-Flash dan V4-Pro, di mana jendela puncak berlaku di zona waktu Anda, dan dua contoh cache-hit dengan perhitungan yang ditunjukkan. Untuk model itu sendiri, mulailah dengan apa itu DeepSeek-V4.1-Flash.

Sebagai catatan awal. Setiap angka benchmark dalam kelompok ini adalah angka yang dilaporkan DeepSeek dari kartu model. Harga berasal dari halaman harga, diverifikasi pada 10 September. Bagian terakhir menunjukkan cara mengukur pengeluaran Anda sendiri dengan Apidog dengan membaca blok usage pada setiap respons alih-alih mempercayai perkiraan.

tombol

TL;DR

Tabel harga lengkap

Semua angka adalah per 1 juta token, berlaku efektif 10 September 2026 pukul 04:00 UTC.

deepseek-flash di luar jam sibuk deepseek-flash jam sibuk deepseek-v4-pro di luar jam sibuk deepseek-v4-pro jam sibuk
Input, cache hit $0.003 $0.006 $0.022 $0.044
Input, cache miss $0.15 $0.30 $0.66 $1.32
Output $0.60 $1.20 $1.98 $3.96
Konkurensi 2,500 2,500 500 500

Kolom deepseek-v4-pro penting selama empat hari lagi. Mulai 14 September pukul 04:00 UTC (12:00 Beijing), permintaan ke nama model tersebut dilayani oleh V4.1-Flash dan ditagih berdasarkan dua kolom pertama. Panduan penghentian dan migrasi V4-Pro mencakup apa yang perlu diuji sebelum itu.

Jika akun Anda diatur dalam yuan, halaman harga zh-cn mencantumkan deepseek-flash sebagai:

Di luar jam sibuk (CNY) Jam sibuk (CNY)
Input, cache hit ¥0.02 ¥0.04
Input, cache miss ¥1.00 ¥2.00
Output ¥4.00 ¥8.00

Setiap baris CNY adalah baris USD dikalikan sekitar 6,67. Dua detail yang tidak disebutkan dalam tabel: penyimpanan konteks otomatis, tanpa perlu mengatur flag, dan id model sekarang adalah deepseek-flash. Nama lama deepseek-v4-flash dan deepseek-v4-flash-vision-exp masih mengarah namun mendarat di V4.1-Flash dengan tarif ini.

Apa yang berubah dibandingkan V4-Flash dan V4-Pro

Pada 21 Agustus 2026, deepseek-v4-flash ditagih $0,007 / $0,22 / $0,66 di luar jam sibuk (cache hit / cache miss / output) dan $0,014 / $0,44 / $1,32 pada jam sibuk. Changelog menyatakan bahwa harga "disesuaikan secara proporsional" dengan rilis ini. Berikut adalah arti "sesuai", dihitung dari dua daftar:

Item Baris V4-Flash (21 Agustus) V4.1-Flash (10 Sep) Pemotongan
Cache hit, di luar jam sibuk $0.007 $0.003 57%
Cache miss, di luar jam sibuk $0.22 $0.15 32%
Output, di luar jam sibuk $0.66 $0.60 9%

Baris jam sibuk memiliki persentase yang identik, karena kedua daftar berlipat ganda pada jam sibuk. Pola ini disengaja: pemotongan paling tajam berlaku pada cache hits, yang terkecil pada output. DeepSeek menetapkan harga untuk loop agen yang membaca ulang prefiks panjang di setiap giliran, dan cache KV FP4 di V4.1 (890 byte per token, sekitar seperempat dari jejak V4-Flash) adalah yang membuat harga hit $0,003 berkelanjutan di pihak mereka.

Untuk pengguna V4-Pro, angkanya lebih besar, karena pengalihan rute terjadi pada tarif Flash:

DeepSeek mengatakan V4.1-Flash "telah melampaui V4 Pro secara komprehensif dalam kinerja, biaya, kecepatan, dan total waktu", sebuah klaim yang perlu Anda periksa dengan prompt Anda sendiri sebelum tanggal 14. Untuk evolusi harga keluarga yang lebih panjang, termasuk periode ketika DeepSeek menaikkan harga API, rincian harga API DeepSeek V4 memiliki sejarahnya.

Jendela jam sibuk di zona waktu Anda

Jam sibuk berlaku hanya Senin hingga Jumat, dalam dua blok waktu: 01:00 hingga 04:00 UTC dan 06:00 hingga 10:00 UTC. Yaitu 09:00 hingga 12:00 dan 14:00 hingga 18:00 waktu Beijing. Tujuh jam sibuk per hari kerja, 35 per minggu, jadi jam sibuk mencakup sekitar 21% dari 168 jam dalam seminggu. Waktu lainnya, termasuk seluruh hari Sabtu dan Minggu, ditagih dengan tarif di luar jam sibuk.

Jendela Waktu UTC Beijing (UTC+8) US Pacific (PDT, UTC-7) Eropa Tengah (CEST, UTC+2)
Puncak 1 01:00 hingga 04:00 09:00 hingga 12:00 18:00 hingga 21:00 (malam sebelumnya) 03:00 hingga 06:00
Puncak 2 06:00 hingga 10:00 14:00 hingga 18:00 23:00 hingga 03:00 (semalam) 08:00 hingga 12:00

Kolom Pacific dan Eropa Tengah menggunakan waktu musim panas. Setelah perubahan jam (25 Oktober di Uni Eropa, 1 November di AS), geser kedua kolom satu jam lebih awal. Batas UTC tidak pernah berubah.

Hari kerja Pantai Barat AS tidak pernah menyentuh blok jam sibuk. Pagi hari di Eropa Tengah berada di dalam Puncak 2, dan batch malam Eropa pukul 03:00 waktu setempat membayar dua kali lipat; memindahkannya ke 23:00 CEST (21:00 UTC) mengembalikannya ke harga setengah.

Matematika cache-hit, dikerjakan dua kali

Satu hit berharga 1/50 dari satu miss ($0,003 versus $0,15), jadi rasio prefiks yang diulang terhadap token baru lebih menentukan biaya input Anda daripada jumlah token mentah. Jika caching prefiks adalah hal baru bagi Anda, panduan dasar caching prompt menjelaskan apa yang dihitung sebagai prefiks yang dapat di-cache: byte identik di awal permintaan.

Contoh 1: loop agen dengan prompt sistem 20K token, 1.000 panggilan pada jam sibuk.

Agen triage dukungan membawa prompt sistem 20.000 token (kebijakan, skema alat, contoh beberapa-shot), membaca 2.000 token baru dari teks tiket per panggilan, dan menulis 1.000 token output. Selama 1.000 panggilan:

  1. Total input adalah 1.000 × 22.000 = 22 juta token. Total output adalah 1 juta token.
  2. Panggilan pertama tidak mengenai semua 22.000 token. Setiap panggilan berikutnya mengenai prefiks 20.000 token dan tidak mengenai 2.000 token barunya.
  3. Token yang mengenai cache: 999 × 20.000 = 19,98 juta. Dengan $0,006 per 1 juta: 19,98 × 0,006 = $0,12.
  4. Token yang tidak mengenai cache: 22.000 + 999 × 2.000 = 2,02 juta. Dengan $0,30 per 1 juta: 2,02 × 0,30 = $0,61.
  5. Output: 1 juta × $1,20 = $1,20.
  6. Total: $0,12 + $0,61 + $1,20 = $1,93.

Tanpa caching, input saja akan menjadi 22 × $0,30 = $6,60 dan pekerjaan itu akan berharga $7,80. Caching mengurangi 75% dari tagihan. Jalankan loop yang sama di luar jam sibuk dan setiap baris menjadi setengahnya: $0,06 + $0,30 + $0,60 = $0,96.

1.000 panggilan yang sama pada V4-Pro di jam sibuk (hits $0,88, misses $2,67, output $3,96) berjumlah $7,51, angka yang harus dibandingkan oleh pelanggan Pro dengan $1,93 ketika pengalihan rute terjadi.

Contoh 2: pekerjaan batch dengan 10 juta token output, dipindahkan ke luar jam sibuk.

Tim katalog menghasilkan 10.000 deskripsi produk. Setiap panggilan mengirim 1.500 token data produk (unik per item, jadi tidak ada manfaat cache) dan mendapatkan kembali 1.000 token salinan teks. Itu adalah 15 juta token input, semua tidak mengenai cache, dan 10 juta token output.

  1. Pada jam sibuk: input 15 × $0,30 = $4,50. Output 10 × $1,20 = $12,00. Total $16,50.
  2. Di luar jam sibuk: input 15 × $0,15 = $2,25. Output 10 × $0,60 = $6,00. Total $8,25.
  3. Penghematan dari waktu saja: $8,25, tanpa perubahan pada prompt.

Output mendominasi pekerjaan ini dan mendapatkan pemotongan terkecil dalam rilis, jadi jendela waktu di luar jam sibuk adalah pengungkit yang lebih besar. Ini adalah jendela waktu yang murah hati: 15 jam setiap hari kerja mulai pukul 10:00 UTC, ditambah 48 jam tanpa gangguan setiap akhir pekan.

Konteks, output, dan mengapa konkurensi adalah bagian dari harga

Kedua nama model membawa konteks 1 juta token dan output maksimum 384 ribu token. Kartu model merekomendasikan token maksimum 256 ribu atau lebih, jadi tetapkan batas itu dengan sengaja: respons yang menghasilkan 384 ribu token output berharga $0,46 pada jam sibuk, bagus untuk transkrip agen dan masalah untuk pelengkapan otomatis.

Konkurensi adalah 2.500 untuk Flash dibandingkan 500 untuk Pro. Ini termasuk dalam artikel harga karena diskon di luar jam sibuk hanya berarti jika Anda dapat menyelesaikan pekerjaan dalam jendela waktu tersebut, dan karena lalu lintas deepseek-v4-pro yang dialihkan pada 14 September mewarisi batas Flash: integrasi Pro yang sebelumnya mengantri di belakang 500 slot mendapatkan lima kali lipat ruang gerak tanpa perubahan konfigurasi.

Ukur pengeluaran nyata dengan Apidog

Tabel harga memberi tahu Anda tarifnya. Objek usage pada setiap respons memberi tahu Anda apa yang ditagihkan kepada Anda. Berikut adalah alur kerja Apidog yang membuat itu menjadi pemeriksaan yang dapat diulang.

  1. Tambahkan titik akhir. Buat POST https://api.deepseek.com/chat/completions, atau impor spesifikasi OpenAPI yang kompatibel dengan OpenAI.
  2. Masukkan harga ke dalam lingkungan. Buat dua lingkungan Apidog, deepseek-peak dan deepseek-offpeak, masing-masing menyimpan DEEPSEEK_API_KEY ditambah PRICE_HIT, PRICE_MISS, dan PRICE_OUT sebagai {{variabel}}. Peak berisi 0,006 / 0,30 / 1,20; off-peak berisi 0,003 / 0,15 / 0,60.
  3. Kirim sekali dan baca usage. DeepSeek membagi input menjadi prompt_cache_hit_tokens dan prompt_cache_miss_tokens di samping completion_tokens [VERIFIKASI]. Simpan permintaan sebagai kasus uji.
  4. Buat skenario pengujian yang menegaskan perilaku cache. Rantaikan permintaan yang disimpan dua kali dengan prompt sistem 20K token yang sama. Pada langkah kedua, tegaskan bahwa bidang token-hit setidaknya 19.000 dan bahwa biaya yang dihitung (hits × {{PRICE_HIT}} + misses × {{PRICE_MISS}} + output × {{PRICE_OUT}}, dibagi 1 juta) tetap di bawah anggaran. Kegagalan pada langkah kedua berarti prefiks telah berubah, dan penegasan menangkapnya sebelum tagihan datang.
  5. Bandingkan jam sibuk dengan di luar jam sibuk. Jalankan skenario di setiap lingkungan dan bedakan baris biaya, atau jalankan dari CI dengan apidog-cli pada jadwal yang melintasi batas puncak UTC.

Unduh Apidog dan seluruh skenario, termasuk lingkungan, berfungsi pada paket gratis.

Dampak ini pada tagihan Anda

V4.1-Flash lebih murah daripada V4-Flash pada setiap baris dan 70 hingga 86% lebih murah daripada tarif V4-Pro yang digantikannya. Dua pengungkit penting: jaga agar prefiks panjang Anda identik secara byte sehingga mengenai cache, dan jadwalkan pekerjaan batch di luar tujuh jam sibuk hari kerja. Kemudian catat usage pada setiap panggilan, tegaskan jumlah hit, dan biarkan angka-angka menunjukkan apakah pemotongan tersebut mencapai tagihan Anda.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.