DeepSeek membangun basis pengembangnya dengan tawaran sederhana: model-model mendekati batas canggih dengan harga yang membuat meteran tidak relevan. Pada 6 Agustus 2026, perusahaan memperingatkan bahwa tawaran tersebut akan berubah. Dalam pengumuman yang pertama kali diliput oleh Dataconomy, DeepSeek mengatakan harga API akan naik "dalam waktu dekat" dan bahwa kenaikan tersebut diperkirakan akan "signifikan." Tidak ada angka. Tidak ada tanggal efektif. Tidak ada perincian berdasarkan model atau tingkatan tarif.
Konteksnya membuat peringatan ini kredibel. DeepSeek menyebutkan kenaikan biaya komputasi, kemacetan kapasitas, dan lalu lintas besar-besaran pada V4-Flash dan V4-Pro. Ini adalah perubahan harga kedua dalam waktu kurang dari sebulan, tarif puncak dan di luar jam sibuk tiba pada pertengahan Juli, dan ini terjadi saat V4 Pro 0813 mencapai ketersediaan umum pada 12 Agustus, yang mendorong permintaan naik, bukan turun. eWeek membingkai langkah ini sebagai ujian keunggulan biaya rendah yang menjadikan DeepSeek pilihan anggaran default bagi tim di seluruh APAC dan sekitarnya.
Anda tidak dapat mengontrol tarif baru. Anda dapat mengontrol berapa banyak token yang Anda beli, di tingkatan mana, pada jam berapa, dan dari penyedia mana. Panduan ini mencakup lima langkah yang harus dilakukan sebelum kenaikan berlaku, ditambah apa yang akan terjadi pada beban kerja sampel dalam skenario 1,5x, 2x, dan 3x.
TL;DR
- DeepSeek mengumumkan kenaikan harga API yang "signifikan" pada 6 Agustus 2026, tanpa jumlah, tanpa tanggal, tanpa detail per model.
- Pengungkit terbesar Anda adalah cache awalan prompt otomatis: input yang di-cache ditagih kurang dari 1% dari tarif cache-miss. Stabilkan awalan prompt Anda sekarang.
- Rute berdasarkan tugas: V4-Flash untuk panggilan sederhana bervolume tinggi, V4-Pro untuk penalaran mendalam. Batasi anggaran pemikiran agar klasifikasi tidak membayar harga penalaran.
- Pindahkan beban kerja batch ke jendela di luar jam sibuk yang diperkenalkan DeepSeek pada pertengahan Juli.
- Lakukan lindung nilai dengan penyedia kedua. OpenRouter memberi harga model DeepSeek secara independen, dan satu rangkaian pengujian Apidog yang dijalankan terhadap keduanya membuktikan bahwa cadangan Anda berfungsi.
- Bahkan pada skenario spekulatif 3x, output V4-Pro akan berharga $2,61 per juta token dibandingkan dengan $25–30 yang dikaitkan perbandingan publik dengan pesaing canggih. Bersiaplah; jangan panik.
Apa yang Diumumkan DeepSeek, dan Apa yang Tidak
Pengungkapannya sendiri tipis: harga di seluruh API akan naik "dalam waktu dekat," kenaikannya akan "signifikan," dan penyebabnya adalah biaya komputasi, kemacetan kapasitas, dan lalu lintas padat di endpoint V4-Flash dan V4-Pro. Itulah semua yang DeepSeek katakan. Hingga hari ini, 13 Agustus, tarif saat ini masih berlaku, dan waktu terus berjalan.
Sekarang celahnya. DeepSeek belum mengatakan seberapa besar harga akan naik, kapan akan naik, apakah V4-Flash dan V4-Pro bergerak dengan faktor yang sama, apakah tingkat cache-hit meningkat sejalan dengan tingkat cache-miss, atau apakah beban kerja penalaran diperlakukan secara berbeda. Thread Hacker News menebak 2x hingga 3x. Itu adalah spekulasi yang belum dikonfirmasi tanpa dukungan resmi, rencanakan untuk suatu rentang, bukan satu angka.
Berikut adalah kartu tarif yang akan dikalikan oleh skenario-skenario tersebut:
| Model | Input (cache miss) | Input (cache hit) | Output |
|---|---|---|---|
| DeepSeek V4-Pro | $0.435 / Juta token | $0.003625 / Juta token | $0.87 / Juta token |
| DeepSeek V4-Flash | $0.14 / Juta token | $0.28 / Juta token |
Kedua model memiliki jendela konteks 1 Juta token. Untuk rincian lengkap, lihat panduan harga API DeepSeek V4 kami; kartu tarif langsung tersedia di dokumentasi API DeepSeek.
Dua rasio dalam tabel tersebut mendorong seluruh panduan ini: input yang di-cache berharga kurang dari 1% dari input cache-miss, dan V4-Pro berjalan kira-kira 3x V4-Flash baik pada input maupun output. Setiap langkah di bawah ini memanfaatkan salah satu celah tersebut.
Langkah 1: Ukur Eksposur Anda Sebelum Harga Naik
Kenaikan harga adalah pengali pada angka yang tidak dapat disebutkan dengan tepat oleh sebagian besar tim. Sebelum menyentuh prompt atau perutean, instrumen penggunaan Anda sehingga Anda tahu apa yang diterapkan oleh pengali tersebut.
Beri tag setiap panggilan model dengan fitur atau endpoint yang memicunya, lalu catat jumlah token yang sudah dikembalikan API:
usage = response.usage
log.info("llm_call", extra={
"feature": "ticket-summarizer", # siapa yang melakukan pengeluaran
"model": "deepseek-v4-flash",
"input_tokens": usage.prompt_tokens,
"output_tokens": usage.completion_tokens,
"cache_hit_tokens": usage.prompt_cache_hit_tokens,
})
Pola lengkap, atribusi, dasbor, ekonomi unit per fitur, ada di cara melacak pengeluaran API OpenAI per fitur, dan dapat diterapkan ke DeepSeek tanpa perubahan.
Data satu minggu menjawab pertanyaan-pertanyaan yang menentukan segalanya: mana yang paling banyak mendorong pengeluaran Anda, berapa bagian token input yang mengenai cache, seberapa banyak lalu lintas V4-Pro yang melakukan pekerjaan berbentuk V4-Flash, dan pada pengali berapa setiap fitur melanggar ekonomi unit Anda. Angka terakhir itu adalah ambang batas Langkah 5 Anda, catatlah.
Langkah 2: Maksimalkan Cache Hits, Pengungkit Terbesar
DeepSeek secara otomatis melakukan cache pada awalan prompt. Ketika token pembuka dari sebuah permintaan cocok dengan permintaan terbaru, awalan yang berulang itu ditagih dengan tarif cache-hit: $0.003625 per juta token input pada V4-Pro, bukan $0.435. Tidak ada flag kontrol cache, tidak ada manajemen TTL, diskon sepenuhnya bergantung pada seberapa berulang struktur prompt Anda. Jika caching awalan adalah hal baru bagi Anda, panduan kami tentang apa itu prompt caching dan cara kerjanya mencakup mekanismenya.
Buat awalan Anda stabil secara byte
- Awali dengan konten yang tidak pernah berubah: prompt sistem, definisi alat, contoh few-shot, teks kebijakan, byte identik, urutan identik, setiap panggilan.
- Dorong konten variabel ke akhir: pesan pengguna, dokumen yang diambil, data sesi.
- Cari pemutus awalan: stempel waktu di dalam prompt sistem, ID permintaan di baris pertama, sapaan yang dipersonalisasi di bagian atas, atau daftar alat yang diserialisasikan dalam urutan yang tidak deterministik. Setiap hal tersebut mengubah diskon 99% menjadi harga penuh.
- Perhatikan loop multi-giliran: alur kerja agen mengirim ulang seluruh percakapan setiap giliran. Dengan awalan yang stabil, semua sebelum pesan terbaru akan ditagih sebagai cache, sehingga beban kerja yang banyak menggunakan agen paling diuntungkan di sini dan paling rugi ketika awalan berubah-ubah.
Baca tingkat hit Anda dari setiap respons
DeepSeek melaporkan kinerja cache dalam objek usage dari setiap respons, didokumentasikan di dokumentasi API DeepSeek:
u = response.usage
hit_rate = u.prompt_cache_hit_tokens / (
u.prompt_cache_hit_tokens + u.prompt_cache_miss_tokens
)
Lacak tingkat tersebut per fitur dalam instrumentasi dari Langkah 1. Jika fitur dengan struktur berulang menunjukkan tingkat hit yang rendah, ada sesuatu dalam awalannya yang berubah-ubah, dan memperbaikinya biasanya adalah refaktor prompt satu hari dengan hasil permanen pada tarif berapa pun yang datang berikutnya.
Langkah 3: Rute Berdasarkan Tugas, Bukan Kebiasaan
V4-Pro dengan harga sekitar 3x V4-Flash adalah harga yang baik untuk penalaran mendalam. Ini adalah harga yang buruk untuk memformat ulang JSON. Kebanyakan codebase memilih satu model selama prototyping dan tidak pernah mengunjunginya lagi, biasanya Pro secara default. Audit data Langkah 1 Anda dan lakukan perutean secara sengaja:
| Bentuk Beban Kerja | Rute ke |
|---|---|
| Klasifikasi, ekstraksi, pemformatan, perutean maksud | V4-Flash, pemikiran minimal |
| Ringkasan, jawaban RAG, pembuatan draf pertama | V4-Flash terlebih dahulu; promosikan ke Pro hanya jika evaluasi gagal |
| Loop agen multi-langkah, debugging sulit, analisis arsitektur | V4-Pro, dengan anggaran pemikiran |
Disiplin berpikir sama pentingnya dengan pemilihan model. Jejak penalaran ditagih sebagai token output, token termahal yang dijual DeepSeek seharga $0.87 per juta pada Pro, jadi pengaturan pemikiran dengan upaya maksimal pada rute klasifikasi membayar harga penalaran untuk sebuah pencarian. Batasi upaya berpikir per rute: tidak ada atau minimal untuk tugas-tugas mekanis, pemikiran mendalam dicadangkan untuk loop agen dan pekerjaan analisis yang terbukti memberikan manfaat.
Lakukan penurunan kualitas dengan bukti, bukan perasaan: pindahkan rute ke Flash atau anggaran pemikiran yang lebih rendah, jalankan rangkaian evaluasi Anda, dan pertahankan perubahan tersebut jika kualitas tetap terjaga.
Langkah 4: Pindahkan Pekerjaan Batch ke Jendela di Luar Jam Sibuk
Penetapan harga jam sibuk/non-sibuk yang diperkenalkan DeepSeek pada pertengahan Juli adalah satu-satunya perubahan terbaru yang menguntungkan Anda, dan sebagian besar tim masih mengabaikannya. Jendela waktu dan diskon saat ini dipublikasikan pada kartu tarif di dokumentasi API DeepSeek.
Apapun yang tidak memerlukan campur tangan manusia adalah kandidat: eksekusi evaluasi malam, pengisian ulang embedding, pelabelan dataset, rangkaian prompt-regression CI. Masukkan pekerjaan tersebut ke dalam antrean dengan jendela rilis alih-alih menjalankannya sesuai permintaan, perubahan penjadwalan satu hari yang tidak memerlukan validasi kualitas, karena tokennya identik dan hanya waktu yang bergerak.
Satu peringatan: DeepSeek belum mengatakan apakah selisih harga di luar jam sibuk akan bertahan setelah kenaikan. Manfaatkan sekarang; periksa kembali saat tarif baru dipublikasikan.
Tagihan Anda pada 1.5x, 2x, dan 3x
Ini adalah skenario ilustratif, bukan prediksi. DeepSeek belum mengumumkan pengali apa pun, dan tidak ada yang tahu apakah semua tingkatan akan berskala secara seragam, tabel di bawah ini mengasumsikan demikian, diterapkan pada beban kerja yang dibuat-buat tetapi realistis.
Contoh beban kerja, bulanan: V4-Pro menangani 400 Juta token input dengan tingkat cache-hit 60% ditambah 60 Juta token output ($69.60 miss + $0.87 hit + $52.20 output = $122.67). V4-Flash menangani 600 Juta input dan 120 Juta token output ($84.00 + $33.60 = $117.60). Tagihan dasar: $240.27.
Kolom "dioptimalkan" menerapkan Langkah 2–3: restrukturisasi awalan meningkatkan tingkat cache-hit Pro menjadi 85%, dan anggaran pemikiran memangkas output Pro menjadi 45 Juta token ($26.10 + $1.23 + $39.15 = $66.48, Flash tidak berubah, total $184.08). Angka dibulatkan ke dolar penuh:
| Skenario Tarif | Tagihan Tidak Optimal | Dioptimalkan (Langkah 2–3) |
|---|---|---|
| Tarif saat ini | $240 | $184 |
| Kenaikan 1.5x | $360 | $276 |
| Kenaikan 2x | $481 | $368 |
| Kenaikan 3x | $721 | $552 |
Baca secara diagonal: beban kerja yang dioptimalkan pada kenaikan 2x ($368) berharga sekitar sama dengan yang tidak dioptimalkan pada 1.5x ($360). Penghematan struktural berskala dengan pengali apa pun yang diterapkan, pengurangan 23% bernilai $56 hari ini dan $168 di bawah skenario 3x. Batching di luar jam sibuk tidak dimodelkan di sini karena diskon bergantung pada jadwal langsung, jadi perlakukan kolom yang dioptimalkan sebagai konservatif.
Kapan Beralih Model Lebih Baik daripada Mengoptimalkan
Bahkan skenario spekulasi yang paling pesimis pun membuat DeepSeek tetap murah secara absolut: kenaikan 3x menempatkan output V4-Pro pada $2.61 per juta token, sementara perbandingan publik menempatkan output pesaing canggih pada $25–30 per juta. Kesenjangan skala besaran ini bertahan dalam setiap skenario yang dikabarkan, eWeek menyebut ini sebagai pengikisan keunggulan DeepSeek, bukan akhir darinya.
Jadi kapan beralih model menjadi pilihan terbaik?
Optimalkan dan tetap gunakan DeepSeek jika DeepSeek memenuhi evaluasi kualitas Anda, pengeluaran Anda terkonsentrasi pada lalu lintas yang dapat di-cache dan dirutekan, dan Anda memiliki waktu rekayasa sebelum tarif berlaku. Panduan di atas bersifat berlipat ganda; biaya peralihan bersifat satu kali dan besar.
Beralih, atau bagi lalu lintas ketika batas cache-hit Anda secara struktural rendah (setiap permintaan membawa dokumen panjang yang unik, sehingga tidak ada awalan yang dapat digunakan kembali), ketika Anda membayar harga Pro untuk tugas-tugas yang dapat dilewati oleh model kecil pesaing pada evaluasi Anda, atau ketika pengali yang diumumkan berada di atas ambang batas pulang pokok yang Anda hitung di Langkah 1.
Bagi sebagian besar tim, jawaban jujur adalah hibrida: pertahankan DeepSeek di mana ia unggul dalam biaya per evaluasi yang lulus, pindahkan rute di mana ia tidak unggul, dan terus jalankan suite paritas Langkah 5 agar kejutan harga berikutnya, dari vendor mana pun, adalah perubahan konfigurasi, bukan krisis.
Kesimpulan
DeepSeek memberi tahu Anda bahwa harga akan naik dan tidak mengatakan apa-apa lagi. Tim yang akan unggul adalah mereka yang bertindak selama jeda ini: menginstrumentasikan pengeluaran per fitur, menstabilkan awalan prompt, merutekan pekerjaan berbentuk Flash ke Flash, mendorong pekerjaan batch di luar jam sibuk, dan membuktikan bahwa penyedia kedua berfungsi sebelum Anda membutuhkannya.
Setiap langkah dapat diukur, dan sebagian besar membutuhkan waktu berhari-hari, bukan sprint. Untuk menangani setengah failover dalam satu alat, unduh Apidog secara gratis: buat suite pengujian sekali, arahkan ke api.deepseek.com dan cadangan Anda dengan lingkungan per penyedia, dan jadwalkan untuk menjaga keduanya tetap jujur saat berita harga berkembang.
