DeepSeek merilis API resmi DeepSeek-V4-Flash pagi ini. Pengumuman tersebut disampaikan pada 31 Juli 2026, dan catatan rilis menjelaskan tiga hal: kapabilitas agen model mendapatkan peningkatan serius, kini model tersebut secara native mendukung format Responses API OpenAI, dan bekerja dengan Codex sejak hari pertama.
Jika Anda telah memanggil deepseek-v4-flash sejak April, Anda menggunakan versi pratinjau. Rilis ini mempromosikan model ke versi resminya, DeepSeek-V4-Flash-0731, dan Anda mendapatkan pembaruan tanpa mengubah satu baris kode pun. Nama model tetap sama.
Panduan ini menjelaskan segalanya: cara mendapatkan kunci, melakukan panggilan pertama Anda, mengaktifkan dan menonaktifkan mode berpikir, serta seperti apa harga beta publik. Jika Anda baru mengenal jajaran DeepSeek, mulailah dengan Apa Itu DeepSeek V4? untuk gambaran umum keluarga, lalu kembali ke sini.
Apa yang sebenarnya dirilis pada 31 Juli
Menurut log perubahan resmi, rilis ini hanya mencakup API. Aplikasi DeepSeek dan model web tidak berubah, dan API V4-Pro tidak berubah. Berikut ringkasannya:
- DeepSeek-V4-Flash-0731 adalah rilis resmi dari lini V4-Flash, kini dalam beta publik di API.
- Arsitektur dan ukuran yang sama dengan V4-Flash-Preview. DeepSeek mengatakan model hanya dilatih ulang pasca-pelatihan, sehingga peningkatan berasal dari pelatihan, bukan jaringan yang lebih besar.
- Benchmark agen melampaui V4-Pro-Preview. DeepSeek melaporkan Terminal Bench 2.1 pada 82.7, Cybergym pada 76.7, Toolathlon terverifikasi pada 70.3, dan DeepSWE pada 54.4. Ini adalah angka yang diterbitkan sendiri oleh DeepSeek, diuji dengan harness mereka pada upaya maksimal.
- Dukungan Responses API native dan integrasi Codex resmi. Kami membahas keduanya secara mendalam di DeepSeek-V4-Flash kini mendukung Responses API dan Codex.
- Rilis resmi DeepSeek-V4-Pro "akan segera menyusul," menurut log perubahan. Dukungan Responses API dan Codex untuk V4-Pro diharapkan pada awal Agustus 2026.
Satu catatan kejujuran: klaim benchmark utama ("jauh melampaui V4-Pro-Preview") berasal dari evaluasi DeepSeek sendiri, dan dua dari benchmark yang terdaftar (DSBench-FullStack dan DSBench-Hard) adalah kumpulan pengujian internal. Angka independen akan membutuhkan beberapa hari untuk muncul.

Langkah 1: Dapatkan kunci API Anda
Kunjungi DeepSeek Platform, masuk, dan buat kunci dari halaman Kunci API. Kunci dimulai dengan sk-. Simpan sebagai variabel lingkungan daripada mengkodekannya secara langsung:
export DEEPSEEK_API_KEY="sk-kunci-anda-di-sini"
DeepSeek API kompatibel dengan format API OpenAI dan Anthropic, jadi Anda tidak memerlukan SDK khusus DeepSeek. Ada dua URL dasar yang penting:
| Format | URL Dasar |
|---|---|
| Kompatibel-OpenAI | https://api.deepseek.com |
| Kompatibel-Anthropic | https://api.deepseek.com/anthropic |
Langkah 2: Lakukan panggilan pertama Anda
Pemeriksaan kewarasan tercepat adalah curl:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "Anda adalah asisten yang membantu."},
{"role": "user", "content": "Ringkas apa yang berubah di DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
Panggilan yang sama melalui OpenAI Python SDK:
# pip3 install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "Anda adalah asisten yang membantu."},
{"role": "user", "content": "Tulis fungsi Python yang memvalidasi alamat email."}
],
stream=False
)
print(response.choices[0].message.content)
Dan Node.js:
// npm install openai
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "Halo!" }],
});
console.log(completion.choices[0].message.content);
Karena nama model deepseek-v4-flash sekarang menunjuk ke rilis 0731, setiap integrasi yang ada yang Anda buat terhadap pratinjau akan secara otomatis menggunakan model baru. Tidak ada yang perlu dimigrasi.
Langkah 3: Kontrol mode berpikir dan upaya penalaran
V4-Flash mendukung mode tanpa berpikir dan mode berpikir, dan berpikir adalah defaultnya. Anda mengontrolnya dengan parameter thinking, dan Anda dapat menyetel kedalaman dengan reasoning_effort:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Rencanakan migrasi database dari MySQL ke Postgres."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
Dua perilaku yang perlu diketahui sebelum Anda menyetel parameter:
temperaturedantop_ptidak berpengaruh saat mode berpikir aktif.- Penyelesaian FIM (fill-in-the-middle, masih beta) hanya berfungsi dalam mode tanpa berpikir.
Untuk endpoint yang sensitif terhadap latensi seperti pelengkapan otomatis, nonaktifkan pemikiran. Untuk perulangan agen dan tugas debugging yang sulit, biarkan aktif dan tingkatkan tingkat upaya.
Langkah 4: Streaming respons
Atur stream: true dan API akan mengembalikan event yang dikirim server (server-sent events). Jika Anda belum pernah melakukan debug payload SSE sebelumnya, panduan kami tentang streaming respons LLM menggunakan server-sent events membahas formatnya secara detail.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Jelaskan connection pooling."}],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Harga selama beta publik
Menurut halaman Model & Harga resmi, V4-Flash tetap sangat murah:
| Item | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Input, cache hit (per 1 Juta token) | $0.0028 | $0.003625 |
| Input, cache miss (per 1 Juta token) | $0.14 | $0.435 |
| Output (per 1 Juta token) | $0.28 | $0.87 |
| Panjang konteks | 1 Juta token | 1 Juta token |
| Output maks | 384K | 384K |
| Batas konkurensi | 2,500 | 500 |
Tiga catatan harga:
- Penyimpanan cache konteks bersifat otomatis, dan cache hit biayanya 50x lebih murah daripada cache miss. Sesi agen yang berjalan lama yang menggunakan kembali prompt sistem akan sangat diuntungkan.
- DeepSeek telah mengumumkan kebijakan puncak/non-puncak: penggunaan jam puncak (9:00-12:00 dan 14:00-18:00 waktu Beijing) akan ditagih 2x harga reguler. Per 31 Juli, dokumen menyatakan tanggal efektif "tergantung pada pengumuman resmi," jadi ini belum aktif. Perhatikan halaman harga.
- Batas konkurensi menceritakan kisahnya sendiri: 2.500 permintaan bersamaan untuk Flash versus 500 untuk Pro. DeepSeek membangun model ini untuk digunakan secara masif oleh armada agen.
Untuk gambaran biaya yang lebih lengkap di seluruh keluarga V4, termasuk riwayat pemotongan harga permanen V4-Pro, lihat rincian harga DeepSeek V4 API kami.
Uji dan debug API di Apidog
Curl mentah berfungsi untuk pengujian asap, tetapi saat Anda membandingkan output berpikir versus tidak berpikir, atau mengamati bagaimana model mengalirkan panggilan alat, Anda menginginkan visibilitas. Berikut adalah alur kerja yang memakan waktu sekitar lima menit di Apidog:

- Buat proyek dan tambahkan endpoint. Tambahkan
POST https://api.deepseek.com/chat/completions(atau impor spesifikasi yang kompatibel dengan OpenAI sehingga semua endpoint tiba sekaligus). - Simpan kunci sebagai variabel lingkungan. Letakkan
DEEPSEEK_API_KEYdi lingkungan Apidog dan referensikan di header Otorisasi sebagaiBearer {{DEEPSEEK_API_KEY}}. Beralih antara kunci pengujian dan kunci produksi menjadi semudah mengklik drop-down. - Kirim dan periksa. Untuk panggilan streaming, Apidog menampilkan event SSE saat tiba, sehingga Anda dapat melihat konten penalaran dan konten jawaban datang sebagai delta terpisah alih-alih mengamati deretan baris
data:mentah. - Simpan varian sebagai kasus uji. Simpan satu permintaan yang disimpan dengan pemikiran diaktifkan dan satu tanpa, lalu jalankan kembali keduanya setelah setiap pembaruan model. Saat DeepSeek merilis peningkatan senyap berikutnya ke
deepseek-v4-flash, Anda akan tahu dengan satu klik apakah prompt Anda masih berfungsi.
Unduh Apidog secara gratis, seluruh alur di atas berfungsi pada paket gratis.
FAQ
Apakah saya perlu mengubah kode saya untuk mendapatkan model baru? Tidak. Nama model deepseek-v4-flash sekarang melayani DeepSeek-V4-Flash-0731. Integrasi yang ada akan diperbarui secara otomatis.
Apakah ini model yang sama dengan aplikasi DeepSeek? Tidak. Pembaruan 31 Juli hanya mencakup API. Aplikasi dan model web tidak berubah.
Apa yang terjadi pada deepseek-chat dan deepseek-reasoner? Nama-nama model lama tersebut dijadwalkan untuk dihentikan pada 24 Juli 2026. Gunakan deepseek-v4-flash atau deepseek-v4-pro. Panduan kami tentang cara menggunakan DeepSeek V4 API mencakup migrasi.
Bisakah saya menggunakannya secara gratis? API DeepSeek adalah bayar sesuai pemakaian tanpa tingkatan gratis permanen, tetapi harga cache-hit membuat eksperimen hampir gratis dalam praktiknya. Lihat cara menggunakan DeepSeek V4 API secara gratis untuk opsi saat ini.
Apakah V4-Flash berfungsi dengan Codex dan Responses API? Ya, keduanya, dan ini adalah satu-satunya model DeepSeek yang melakukannya sejauh ini. Dukungan V4-Pro diharapkan pada awal Agustus 2026. Penyiapan lengkap ada di panduan Responses API dan Codex kami.
Intinya
DeepSeek-V4-Flash-0731 adalah jenis rilis yang tenang: nama model yang sama, harga yang sama, arsitektur yang sama, dan serangkaian skor benchmark agen yang kini mengalahkan V4-Pro-Preview yang lebih besar, setidaknya pada pengujian DeepSeek sendiri. Dukungan Responses API dan adaptasi Codex menandakan tujuan model ini: beban kerja agen dengan konkurensi tinggi dengan harga yang mengalahkan setiap laboratorium Barat.
Ambil kunci, arahkan OpenAI SDK Anda ke https://api.deepseek.com, dan uji model ini dengan rangkaian pengujian Anda sendiri sebelum mempercayai tabel benchmark. Apidog membuat siklus verifikasi itu cepat: simpan prompt Anda sebagai kasus uji sekali, jalankan kembali pada setiap pembaruan model, dan Anda tidak akan pernah terkejut lagi oleh pembaruan senyap.
