DeepSeek memberi pengguna deepseek-v4-pro waktu empat hari. Pada 14 September 2026 pukul 04:00 UTC (12:00 Beijing), setiap permintaan yang menyebut deepseek-v4-pro akan dialihkan ke DeepSeek-V4.1-Flash dan ditagih dengan tarif V4.1-Flash. Tidak ada kesalahan. Tidak ada peringatan. Tagihan Anda turun, dan model yang berbeda mulai menjawab prompt Anda.
Bagian terakhir itulah yang perlu direncanakan. Catatan rilis ini menganggap perubahan tersebut sebagai peningkatan, dan menurut angka DeepSeek sendiri memang demikian. Namun, "dialihkan secara diam-diam" tidak sama dengan "diuji". Jika produk Anda bergantung pada bentuk panggilan alat tertentu atau anggaran latensi yang Anda sesuaikan dengan V4-Pro, Anda ingin tahu apa yang berubah sebelum hari Minggu, bukan sesudahnya.
Panduan ini membahas apa yang diumumkan DeepSeek, apa yang terjadi jika Anda tidak melakukan apa-apa, daftar periksa migrasi, dan cara membangun suite regresi Pro versus Flash di Apidog agar transisi berjalan mulus. Untuk model itu sendiri, bacalah apa itu DeepSeek-V4.1-Flash terlebih dahulu.
Singkatnya
- Transisi: 14 September 2026, 04:00 UTC. Permintaan
deepseek-v4-proakan dialihkan ke V4.1-Flash mulai saat itu. - Panggilan Anda tidak akan gagal dan Anda tidak akan membayar harga Pro. Input cache-miss puncak turun dari $1.32 menjadi $0.30 per 1 Juta token (77% lebih murah); output turun dari $3.96 menjadi $1.20 (70% lebih murah).
- Ubah nama ID model menjadi
deepseek-flashsendiri, lalu uji ulang pemanggilan fungsi, output terstruktur, streaming, dan upaya penalaran. - DeepSeek mengatakan V4.1-Flash mengungguli V4-Pro pada setiap benchmark yang tercantum. Itu adalah angka vendor. Jalankan evaluasi Anda sendiri.
Apa yang Diumumkan DeepSeek pada 10 September
Entri changelog 10 September membahas dua hal: V4.1-Flash yang menjadi GA di API, dan V4-Pro yang pensiun empat hari kemudian.

Mengenai V4-Pro, kata-katanya lugas. DeepSeek mengatakan V4.1-Flash “telah melampaui V4 Pro secara komprehensif dalam kinerja, biaya, kecepatan, dan waktu total”, mengutip “pengujian oleh berbagai pihak”. Mulai 14 September pukul 04:00 UTC, permintaan ke deepseek-v4-pro akan dilayani oleh V4.1-Flash dan dihargai sesuai V4.1-Flash. Tidak ada masa tenggang di mana Pro tetap berjalan dengan nama lama.
Pembersihan nama melampaui Pro:
| Nama Model | Status setelah 10 September |
|---|---|
deepseek-flash |
ID kanonis baru untuk V4.1-Flash |
deepseek-v4-flash |
Masih diterima, dilayani oleh V4.1-Flash |
deepseek-v4-flash-vision-exp |
Masih diterima, dilayani oleh V4.1-Flash |
deepseek-v4-pro |
Dilayani oleh V4-Pro hingga 14 September pukul 04:00 UTC, kemudian dialihkan ke V4.1-Flash |
V4-Flash dan V4-Flash-Vision-Exp sebagai model telah pensiun; hanya nama mereka yang tetap hidup sebagai alias. URL dasar tidak berubah: https://api.deepseek.com untuk format yang kompatibel dengan OpenAI dan https://api.deepseek.com/anthropic untuk format yang kompatibel dengan Anthropic. Cara menggunakan API V4.1-Flash membahas ID model baru, kontrol penalaran, dan input gambar secara detail.
Apa yang Terjadi Jika Anda Tidak Melakukan Apa-apa
Versi singkat: integrasi Anda tetap berfungsi dan menjadi lebih murah. Versi panjang: lima hal berubah tanpa Anda sadari.
Model yang Berbeda Menjawab. V4.1-Flash adalah MoE 552B-parameter dengan tata letak Causal Encoder-Decoder baru: 40 lapisan, 20 encoder dan 20 decoder, 8B parameter aktif selama prefill dan 16B selama decode. Prompt Anda sekarang mencapai anggaran parameter aktif yang berbeda dan desain perhatian yang berbeda (Compressed Sparse Attention 2). Harapkan frasa yang berbeda, verbositas default yang berbeda, dan terkadang keputusan yang berbeda pada panggilan alat yang ambigu.
Batas output sama, pengaturan yang direkomendasikan tidak. Kedua model mencantumkan konteks 1 Juta dan output maksimal 384 Ribu. Kartu model V4.1-Flash merekomendasikan suhu 1.0, top_p 0.95 atau 1.0, dan token maksimal 256 Ribu atau lebih. Jika Anda menetapkan max_tokens yang ketat pada V4-Pro untuk membatasi biaya, periksa apakah output penalaran sekarang terpotong sebelum jawaban tiba.
Upaya penalaran bekerja pada skala yang berbeda. DeepSeek menggambarkan upaya penalaran V4.1-Flash sebagai “dapat dikontrol secara berkelanjutan” pada skala 1 hingga 100. V4-Flash menerima reasoning_effort ditambah extra_body={"thinking": {"type": "enabled"}}. Bagaimana skala 1 hingga 100 dipetakan ke parameter API adalah [VERIFIKASI] terhadap dokumen saat ini; jangan berasumsi bahwa tingkat bernama seperti "high" berarti kedalaman yang sama seperti pada Pro.
Harga berubah menguntungkan Anda, dengan periode puncak. Jam sibuk adalah Senin hingga Jumat, 01:00 hingga 04:00 dan 06:00 hingga 10:00 UTC. Di luar jam sibuk adalah setengah dari jam sibuk. Lalu lintas Pro yang dialihkan membayar tarif Flash di kedua periode.
Batas konkurensi meningkat. Batas V4-Pro adalah 500 permintaan bersamaan. Flash adalah 2.500. Lalu lintas yang dialihkan mewarisi batas yang lebih tinggi, jadi tinjau kembali setiap backoff sisi klien yang disetel ke 500.
Daftar Periksa Migrasi
Lakukan ini secara berurutan. Bersama-sama, mereka mengubah pengalihan diam-diam menjadi rilis yang disengaja.
- Ganti nama ID model. Cari
deepseek-v4-prodi codebase dan konfigurasi Anda, lalu ganti dengandeepseek-flash. Lakukan ini meskipun alias tetap berfungsi: ID yang eksplisit membuat insiden lebih mudah dibaca nanti.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash", # was "deepseek-v4-pro"
messages=[
{"role": "system", "content": "You triage support tickets. Return a JSON object with priority, team, and summary."},
{"role": "user", "content": "Customer reports checkout returns 502 after applying a discount code."},
],
response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
- Tinjau pengaturan upaya penalaran. Daftarkan setiap tempat Anda mengatur
reasoning_effortatau tombol berpikir. Putuskan per endpoint apakah Anda menginginkan kedalaman atau latensi, lalu uji masing-masing terhadap skala baru alih-alih menggunakan nilai lama. - Jalankan kembali pengujian pemanggilan fungsi dan output terstruktur. Pemformatan argumen panggilan alat adalah titik tersulit saat pertukaran model. Jika Anda menulis pengujian saat menyiapkan pemanggilan fungsi pada V4-Pro, jalankan sekarang terhadap
deepseek-flash. Jika belum, alur kerja Apidog di bawah ini akan memberikan Anda satu set. - Periksa parser streaming Anda. V4.1-Flash melakukan streaming delta penalaran dan delta jawaban secara terpisah dalam mode berpikir. Konfirmasikan bahwa penangan SSE Anda tidak menggabungkannya dan bahwa pengukur waktu “token pertama” Anda mengukur apa yang Anda kira.
- Evaluasi ulang latensi dan biaya. Catat latensi p50 dan p95 serta token per permintaan pada V4-Pro minggu ini, lalu hal yang sama pada
deepseek-flash. Anda akan membutuhkan kedua angka tersebut ketika seseorang bertanya mengapa dasbor berubah pada hari Senin. - Perbarui dasbor dan anggaran. Peringatan biaya yang dikalibrasi pada output $3.96 pada puncak akan tenang setelah Anda membayar $1.20, dan anggaran yang tidak pernah terpicu adalah anggaran yang tidak pernah dilihat siapa pun. Setel ulang ambang batas ke tarif di halaman harga dan perbaiki setiap perincian per model yang memfilter ID lama.
Jika Anda memanggil format API Anthropic-compatible atau Responses alih-alih chat completions, langkah-langkah yang sama berlaku; perbandingan format API V4-Pro menunjukkan seperti apa setiap permintaan sehingga Anda dapat memetakan bidang-bidang tersebut.
V4-Pro vs V4.1-Flash Sekilas
Angka benchmark dilaporkan oleh DeepSeek, dari kartu model V4.1-Flash. Harga adalah USD per 1 Juta token, berlaku mulai 10 September 2026.
| deepseek-v4-pro | deepseek-flash (V4.1) | |
|---|---|---|
| Parameter aktif | Tidak dinyatakan ulang pada kartu V4.1 | 8B prefill / 16B decode |
| HumanEval | 76.8 | 79.4 |
| GSM8K | 92.6 | 93.0 |
| DeepSWE v1.1 | 62.7 | 74.2 |
| Terminal-Bench 2.1 | 87.9 | 90.6 |
| Input, cache hit (non-puncak / puncak) | $0.022 / $0.044 | $0.003 / $0.006 |
| Input, cache miss (non-puncak / puncak) | $0.66 / $1.32 | $0.15 / $0.30 |
| Output (non-puncak / puncak) | $1.98 / $3.96 | $0.60 / $1.20 |
| Konteks / output maks | 1 Juta / 384 Ribu | 1 Juta / 384 Ribu |
| Batas konkurensi | 500 | 2.500 |
Kesenjangan terbesar adalah DeepSWE, naik 11,5 poin. Yang terkecil adalah GSM8K, naik 0,4. Jika beban kerja Anda menyerupai matematika sekolah dasar, harapkan kesetaraan; jika menyerupai pengeditan kode multi-file, angka DeepSeek menunjukkan Anda mendapatkan keuntungan. Perincian tiga arah termasuk V4-Flash ada di V4.1-Flash vs V4-Pro vs V4-Flash.
Risiko: benchmark vendor mengukur tugas vendor
Setiap angka dalam tabel tersebut berasal dari DeepSeek. “Pengujian oleh berbagai pihak” adalah frasa DeepSeek, dan pihak-pihak tersebut tidak disebutkan dalam catatan rilis. Itu tidak membuat angka-angka tersebut salah. Itu berarti mereka diukur pada suite benchmark, bukan pada prompt Anda, skema alat Anda, atau input kacau pengguna Anda.
Sebuah model dapat mencetak skor lebih tinggi pada Terminal-Bench dan masih mengubah cara memformat argumen panggilan alat yang bergantung pada parser Anda. Token output yang lebih murah tidak membantu jika model menulis dua kali lebih banyak. Satu-satunya cara untuk mengetahuinya adalah dengan menjalankan lalu lintas Anda sendiri melalui kedua model selagi keduanya ada. Anda punya waktu hingga 14 September.
Bangun Suite Regresi di Apidog Sebelum Transisi
Berikut adalah alur kerja di Apidog yang memberi Anda perbandingan Pro versus Flash yang dapat diulang dan menyerahkan hasil eksekusi ke CI.
- Impor permintaan V4-Pro yang ada. Impor spesifikasi OpenAPI yang kompatibel dengan OpenAI, atau tempel perintah curl yang Anda gunakan dalam produksi. Tempatkan
DEEPSEEK_API_KEYdalam lingkungan dan referensikan sebagaiBearer {{DEEPSEEK_API_KEY}}di header Otorisasi. Tambahkan variabel kedua,{{MODEL_ID}}, setel kedeepseek-v4-pro. - Duplikasi setiap permintaan dengan
deepseek-flash. Setel{{MODEL_ID}}kedeepseek-flashdi lingkungan kedua, atau hardcode kedua ID dalam permintaan berpasangan. Prompt yang sama, array alat yang sama,max_tokensyang sama. Satu-satunya perbedaan seharusnya adalah modelnya. - Tambahkan pernyataan pada bentuk JSON dan struktur panggilan alat. Untuk output terstruktur, pastikan bahwa
choices[0].message.contentdiurai sebagai JSON dan berisi kunci yang Anda harapkan. Untuk pemanggilan fungsi, pastikan bahwachoices[0].message.tool_calls[0].function.namesama dengan alat yang Anda harapkan dan bahwaargumentsdiurai. Pemeriksaan ini menangkap penyimpangan format secara diam-diam. - Jalankan keduanya sebagai satu skenario pengujian. Rangkaikan permintaan Pro dan Flash menjadi satu skenario sehingga setiap eksekusi menghasilkan satu laporan. Sertakan permintaan streaming dengan
stream: true; Apidog merender event SSE satu per satu, sehingga Anda dapat melihat apakah delta penalaran dan jawaban tiba sesuai harapan parser Anda. - Lihat perbedaan hasilnya. Bandingkan dua bagian laporan: tingkat keberhasilan pernyataan, waktu respons, dan
usage.completion_tokens. Model yang melewati setiap pernyataan tetapi mengeluarkan 40% lebih banyak token output akan mengubah perhitungan biaya Anda, dan Anda akan melihatnya sebelum tagihan tiba. - Jadwalkan di CI dengan
apidog-cli. Jalankan skenario dari pipeline Anda setiap hari hingga 14 September dan terus jalankan setelahnya. Setelah Pro tidak ada, bagian Pro juga akan mengembalikan respons Flash dan perbedaannya akan menjadi nol: konfirmasi bahwa transisi telah terjadi dan pernyataan Anda masih berlaku.
Unduh Apidog untuk menyiapkan ini. Alur ini berada dalam proyek bersama, sehingga siapa pun pemilik tagihan dan siapa pun pemilik prompt membaca laporan yang sama.
FAQ
Apakah panggilan V4-Pro saya akan gagal pada 14 September? Tidak. Permintaan yang menentukan deepseek-v4-pro akan dialihkan ke V4.1-Flash. Anda akan mendapatkan respons 200 dan jawaban V4.1-Flash. Mode kegagalannya bersifat perilaku, bukan kode kesalahan.
Apakah saya akan ditagih harga V4-Pro setelah transisi? Tidak. Permintaan yang dialihkan akan ditagih dengan tarif V4.1-Flash: pada puncaknya, $0.30 alih-alih $1.32 per 1 Juta token input cache-miss dan $1.20 alih-alih $3.96 per 1 Juta token output.
Haruskah saya mengganti nama ID menjadi deepseek-flash atau mempertahankan deepseek-v4-pro? Ganti nama. Alias berfungsi, tetapi ID yang eksplisit berarti log, dasbor, dan laporan biaya Anda akan menunjukkan apa yang sedang dipanggil.
Apakah pengaturan V4-Pro-0813 masih berlaku? Kunci, URL dasar, dan bentuk permintaan dari panduan API V4-Pro-0813 tetap tidak berubah. Yang berubah adalah model di belakangnya dan kontrol upaya penalaran, jadi uji ulang alih-alih berasumsi.
Apakah V4.1-Flash lebih buruk dari V4-Pro dalam hal apa pun? Benchmark yang diterbitkan DeepSeek menunjukkan peningkatan pada setiap tugas yang tercantum. Hasil independen tidak tersedia pada saat publikasi. Perlakukan “tidak lebih buruk dalam hal apa pun” sebagai klaim untuk diuji.
Empat Hari Cukup
Migrasi ini hanyalah satu perubahan string ditambah satu eksekusi pengujian. Perubahan string hanya memakan waktu satu menit. Eksekusi pengujian memberi tahu Anda apakah model yang akan Anda bayar minggu depan berperilaku seperti model yang Anda rancang. Bangun suite-nya, jalankan selagi deepseek-v4-pro masih merujuk ke Pro, dan baca perbedaannya. Jika bersih, Anda akan mendapatkan tagihan 70% lebih murah dan lima kali lipat konkurensi secara gratis. Jika tidak, Anda mengetahuinya sesuai jadwal Anda, bukan DeepSeek.
