DeepSeek API Akan Naik Harga: Panduan Optimalisasi Biaya untuk Developer

DeepSeek mengatakan kenaikan harga API yang signifikan akan datang. Kurangi eksposur Anda sekarang: caching prompt, perutean Flash/Pro, batching di luar jam sibuk, pengujian failover, dan apa dampak skenario 1,5x-3x terhadap tagihan Anda.

INEZA Felin-Michel

INEZA Felin-Michel

13 August 2026

DeepSeek API Akan Naik Harga: Panduan Optimalisasi Biaya untuk Developer

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

DeepSeek membangun basis pengembangnya dengan tawaran sederhana: model-model mendekati batas canggih dengan harga yang membuat meteran tidak relevan. Pada 6 Agustus 2026, perusahaan memperingatkan bahwa tawaran tersebut akan berubah. Dalam pengumuman yang pertama kali diliput oleh Dataconomy, DeepSeek mengatakan harga API akan naik "dalam waktu dekat" dan bahwa kenaikan tersebut diperkirakan akan "signifikan." Tidak ada angka. Tidak ada tanggal efektif. Tidak ada perincian berdasarkan model atau tingkatan tarif.

Konteksnya membuat peringatan ini kredibel. DeepSeek menyebutkan kenaikan biaya komputasi, kemacetan kapasitas, dan lalu lintas besar-besaran pada V4-Flash dan V4-Pro. Ini adalah perubahan harga kedua dalam waktu kurang dari sebulan, tarif puncak dan di luar jam sibuk tiba pada pertengahan Juli, dan ini terjadi saat V4 Pro 0813 mencapai ketersediaan umum pada 12 Agustus, yang mendorong permintaan naik, bukan turun. eWeek membingkai langkah ini sebagai ujian keunggulan biaya rendah yang menjadikan DeepSeek pilihan anggaran default bagi tim di seluruh APAC dan sekitarnya.

Anda tidak dapat mengontrol tarif baru. Anda dapat mengontrol berapa banyak token yang Anda beli, di tingkatan mana, pada jam berapa, dan dari penyedia mana. Panduan ini mencakup lima langkah yang harus dilakukan sebelum kenaikan berlaku, ditambah apa yang akan terjadi pada beban kerja sampel dalam skenario 1,5x, 2x, dan 3x.

TL;DR

Apa yang Diumumkan DeepSeek, dan Apa yang Tidak

Pengungkapannya sendiri tipis: harga di seluruh API akan naik "dalam waktu dekat," kenaikannya akan "signifikan," dan penyebabnya adalah biaya komputasi, kemacetan kapasitas, dan lalu lintas padat di endpoint V4-Flash dan V4-Pro. Itulah semua yang DeepSeek katakan. Hingga hari ini, 13 Agustus, tarif saat ini masih berlaku, dan waktu terus berjalan.

Sekarang celahnya. DeepSeek belum mengatakan seberapa besar harga akan naik, kapan akan naik, apakah V4-Flash dan V4-Pro bergerak dengan faktor yang sama, apakah tingkat cache-hit meningkat sejalan dengan tingkat cache-miss, atau apakah beban kerja penalaran diperlakukan secara berbeda. Thread Hacker News menebak 2x hingga 3x. Itu adalah spekulasi yang belum dikonfirmasi tanpa dukungan resmi, rencanakan untuk suatu rentang, bukan satu angka.

Berikut adalah kartu tarif yang akan dikalikan oleh skenario-skenario tersebut:

Model Input (cache miss) Input (cache hit) Output
DeepSeek V4-Pro $0.435 / Juta token $0.003625 / Juta token $0.87 / Juta token
DeepSeek V4-Flash $0.14 / Juta token $0.28 / Juta token

Kedua model memiliki jendela konteks 1 Juta token. Untuk rincian lengkap, lihat panduan harga API DeepSeek V4 kami; kartu tarif langsung tersedia di dokumentasi API DeepSeek.

Dua rasio dalam tabel tersebut mendorong seluruh panduan ini: input yang di-cache berharga kurang dari 1% dari input cache-miss, dan V4-Pro berjalan kira-kira 3x V4-Flash baik pada input maupun output. Setiap langkah di bawah ini memanfaatkan salah satu celah tersebut.

Langkah 1: Ukur Eksposur Anda Sebelum Harga Naik

Kenaikan harga adalah pengali pada angka yang tidak dapat disebutkan dengan tepat oleh sebagian besar tim. Sebelum menyentuh prompt atau perutean, instrumen penggunaan Anda sehingga Anda tahu apa yang diterapkan oleh pengali tersebut.

Beri tag setiap panggilan model dengan fitur atau endpoint yang memicunya, lalu catat jumlah token yang sudah dikembalikan API:

usage = response.usage
log.info("llm_call", extra={
    "feature": "ticket-summarizer", # siapa yang melakukan pengeluaran
    "model": "deepseek-v4-flash",
    "input_tokens": usage.prompt_tokens,
    "output_tokens": usage.completion_tokens,
    "cache_hit_tokens": usage.prompt_cache_hit_tokens,
})

Pola lengkap, atribusi, dasbor, ekonomi unit per fitur, ada di cara melacak pengeluaran API OpenAI per fitur, dan dapat diterapkan ke DeepSeek tanpa perubahan.

Data satu minggu menjawab pertanyaan-pertanyaan yang menentukan segalanya: mana yang paling banyak mendorong pengeluaran Anda, berapa bagian token input yang mengenai cache, seberapa banyak lalu lintas V4-Pro yang melakukan pekerjaan berbentuk V4-Flash, dan pada pengali berapa setiap fitur melanggar ekonomi unit Anda. Angka terakhir itu adalah ambang batas Langkah 5 Anda, catatlah.

Langkah 2: Maksimalkan Cache Hits, Pengungkit Terbesar

DeepSeek secara otomatis melakukan cache pada awalan prompt. Ketika token pembuka dari sebuah permintaan cocok dengan permintaan terbaru, awalan yang berulang itu ditagih dengan tarif cache-hit: $0.003625 per juta token input pada V4-Pro, bukan $0.435. Tidak ada flag kontrol cache, tidak ada manajemen TTL, diskon sepenuhnya bergantung pada seberapa berulang struktur prompt Anda. Jika caching awalan adalah hal baru bagi Anda, panduan kami tentang apa itu prompt caching dan cara kerjanya mencakup mekanismenya.

Buat awalan Anda stabil secara byte

Baca tingkat hit Anda dari setiap respons

DeepSeek melaporkan kinerja cache dalam objek usage dari setiap respons, didokumentasikan di dokumentasi API DeepSeek:

u = response.usage
hit_rate = u.prompt_cache_hit_tokens / (
    u.prompt_cache_hit_tokens + u.prompt_cache_miss_tokens
)

Lacak tingkat tersebut per fitur dalam instrumentasi dari Langkah 1. Jika fitur dengan struktur berulang menunjukkan tingkat hit yang rendah, ada sesuatu dalam awalannya yang berubah-ubah, dan memperbaikinya biasanya adalah refaktor prompt satu hari dengan hasil permanen pada tarif berapa pun yang datang berikutnya.

Langkah 3: Rute Berdasarkan Tugas, Bukan Kebiasaan

V4-Pro dengan harga sekitar 3x V4-Flash adalah harga yang baik untuk penalaran mendalam. Ini adalah harga yang buruk untuk memformat ulang JSON. Kebanyakan codebase memilih satu model selama prototyping dan tidak pernah mengunjunginya lagi, biasanya Pro secara default. Audit data Langkah 1 Anda dan lakukan perutean secara sengaja:

Bentuk Beban Kerja Rute ke
Klasifikasi, ekstraksi, pemformatan, perutean maksud V4-Flash, pemikiran minimal
Ringkasan, jawaban RAG, pembuatan draf pertama V4-Flash terlebih dahulu; promosikan ke Pro hanya jika evaluasi gagal
Loop agen multi-langkah, debugging sulit, analisis arsitektur V4-Pro, dengan anggaran pemikiran

Disiplin berpikir sama pentingnya dengan pemilihan model. Jejak penalaran ditagih sebagai token output, token termahal yang dijual DeepSeek seharga $0.87 per juta pada Pro, jadi pengaturan pemikiran dengan upaya maksimal pada rute klasifikasi membayar harga penalaran untuk sebuah pencarian. Batasi upaya berpikir per rute: tidak ada atau minimal untuk tugas-tugas mekanis, pemikiran mendalam dicadangkan untuk loop agen dan pekerjaan analisis yang terbukti memberikan manfaat.

Lakukan penurunan kualitas dengan bukti, bukan perasaan: pindahkan rute ke Flash atau anggaran pemikiran yang lebih rendah, jalankan rangkaian evaluasi Anda, dan pertahankan perubahan tersebut jika kualitas tetap terjaga.

Langkah 4: Pindahkan Pekerjaan Batch ke Jendela di Luar Jam Sibuk

Penetapan harga jam sibuk/non-sibuk yang diperkenalkan DeepSeek pada pertengahan Juli adalah satu-satunya perubahan terbaru yang menguntungkan Anda, dan sebagian besar tim masih mengabaikannya. Jendela waktu dan diskon saat ini dipublikasikan pada kartu tarif di dokumentasi API DeepSeek.

Apapun yang tidak memerlukan campur tangan manusia adalah kandidat: eksekusi evaluasi malam, pengisian ulang embedding, pelabelan dataset, rangkaian prompt-regression CI. Masukkan pekerjaan tersebut ke dalam antrean dengan jendela rilis alih-alih menjalankannya sesuai permintaan, perubahan penjadwalan satu hari yang tidak memerlukan validasi kualitas, karena tokennya identik dan hanya waktu yang bergerak.

Satu peringatan: DeepSeek belum mengatakan apakah selisih harga di luar jam sibuk akan bertahan setelah kenaikan. Manfaatkan sekarang; periksa kembali saat tarif baru dipublikasikan.

Tagihan Anda pada 1.5x, 2x, dan 3x

Ini adalah skenario ilustratif, bukan prediksi. DeepSeek belum mengumumkan pengali apa pun, dan tidak ada yang tahu apakah semua tingkatan akan berskala secara seragam, tabel di bawah ini mengasumsikan demikian, diterapkan pada beban kerja yang dibuat-buat tetapi realistis.

Contoh beban kerja, bulanan: V4-Pro menangani 400 Juta token input dengan tingkat cache-hit 60% ditambah 60 Juta token output ($69.60 miss + $0.87 hit + $52.20 output = $122.67). V4-Flash menangani 600 Juta input dan 120 Juta token output ($84.00 + $33.60 = $117.60). Tagihan dasar: $240.27.

Kolom "dioptimalkan" menerapkan Langkah 2–3: restrukturisasi awalan meningkatkan tingkat cache-hit Pro menjadi 85%, dan anggaran pemikiran memangkas output Pro menjadi 45 Juta token ($26.10 + $1.23 + $39.15 = $66.48, Flash tidak berubah, total $184.08). Angka dibulatkan ke dolar penuh:

Skenario Tarif Tagihan Tidak Optimal Dioptimalkan (Langkah 2–3)
Tarif saat ini $240 $184
Kenaikan 1.5x $360 $276
Kenaikan 2x $481 $368
Kenaikan 3x $721 $552

Baca secara diagonal: beban kerja yang dioptimalkan pada kenaikan 2x ($368) berharga sekitar sama dengan yang tidak dioptimalkan pada 1.5x ($360). Penghematan struktural berskala dengan pengali apa pun yang diterapkan, pengurangan 23% bernilai $56 hari ini dan $168 di bawah skenario 3x. Batching di luar jam sibuk tidak dimodelkan di sini karena diskon bergantung pada jadwal langsung, jadi perlakukan kolom yang dioptimalkan sebagai konservatif.

Kapan Beralih Model Lebih Baik daripada Mengoptimalkan

Bahkan skenario spekulasi yang paling pesimis pun membuat DeepSeek tetap murah secara absolut: kenaikan 3x menempatkan output V4-Pro pada $2.61 per juta token, sementara perbandingan publik menempatkan output pesaing canggih pada $25–30 per juta. Kesenjangan skala besaran ini bertahan dalam setiap skenario yang dikabarkan, eWeek menyebut ini sebagai pengikisan keunggulan DeepSeek, bukan akhir darinya.

Jadi kapan beralih model menjadi pilihan terbaik?

Optimalkan dan tetap gunakan DeepSeek jika DeepSeek memenuhi evaluasi kualitas Anda, pengeluaran Anda terkonsentrasi pada lalu lintas yang dapat di-cache dan dirutekan, dan Anda memiliki waktu rekayasa sebelum tarif berlaku. Panduan di atas bersifat berlipat ganda; biaya peralihan bersifat satu kali dan besar.

Beralih, atau bagi lalu lintas ketika batas cache-hit Anda secara struktural rendah (setiap permintaan membawa dokumen panjang yang unik, sehingga tidak ada awalan yang dapat digunakan kembali), ketika Anda membayar harga Pro untuk tugas-tugas yang dapat dilewati oleh model kecil pesaing pada evaluasi Anda, atau ketika pengali yang diumumkan berada di atas ambang batas pulang pokok yang Anda hitung di Langkah 1.

Bagi sebagian besar tim, jawaban jujur adalah hibrida: pertahankan DeepSeek di mana ia unggul dalam biaya per evaluasi yang lulus, pindahkan rute di mana ia tidak unggul, dan terus jalankan suite paritas Langkah 5 agar kejutan harga berikutnya, dari vendor mana pun, adalah perubahan konfigurasi, bukan krisis.

Kesimpulan

DeepSeek memberi tahu Anda bahwa harga akan naik dan tidak mengatakan apa-apa lagi. Tim yang akan unggul adalah mereka yang bertindak selama jeda ini: menginstrumentasikan pengeluaran per fitur, menstabilkan awalan prompt, merutekan pekerjaan berbentuk Flash ke Flash, mendorong pekerjaan batch di luar jam sibuk, dan membuktikan bahwa penyedia kedua berfungsi sebelum Anda membutuhkannya.

Setiap langkah dapat diukur, dan sebagian besar membutuhkan waktu berhari-hari, bukan sprint. Untuk menangani setengah failover dalam satu alat, unduh Apidog secara gratis: buat suite pengujian sekali, arahkan ke api.deepseek.com dan cadangan Anda dengan lingkungan per penyedia, dan jadwalkan untuk menjaga keduanya tetap jujur saat berita harga berkembang.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.