Cara Menggunakan DeepSeek-V4.1-Flash API

Panggil API DeepSeek-V4.1-Flash: id model deepseek-flash, URL dasar, panggilan pertama dalam curl/Python/Node, upaya penalaran, input gambar, streaming, harga.

INEZA Felin-Michel

INEZA Felin-Michel

10 September 2026

Cara Menggunakan DeepSeek-V4.1-Flash API

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

DeepSeek-V4.1-Flash resmi diluncurkan (GA) di API hari ini, 10 September 2026. Catatan rilisnya singkat, namun mengubah tiga hal bagi siapa pun yang memanggil API DeepSeek: ada satu ID model yang akan digunakan mulai sekarang, yaitu deepseek-flash; tarif per-token turun lagi; dan dalam empat hari, pada 14 September, setiap permintaan ke deepseek-v4-pro akan dialihkan ke model ini dan ditagih dengan harga Flash.

Poin terakhir itulah mengapa panduan ini ada. Jika Anda memiliki kode produksi yang menggunakan V4-Pro, Anda tidak bisa memilih tanggal migrasi. Jika Anda menggunakan V4-Flash, Anda sudah dilayani oleh model baru dengan nama lama. Apa pun itu, parameter yang Anda kirim hari ini patut diperiksa.

Pos ini membahas sisi praktisnya: ID model, URL dasar, panggilan pertama dalam tiga bahasa, upaya penalaran, input gambar, streaming, dan harga. Untuk arsitektur dan cerita benchmark, baca dulu Apa itu DeepSeek-V4.1-Flash.

Sebelum menghubungkan apa pun ke dalam kode, Anda pasti ingin cara cepat untuk mengirim permintaan dan membandingkan respons. Apidog menanganinya: arahkan ke https://api.deepseek.com, simpan kunci sebagai variabel, dan simpan setiap panggilan yang berfungsi sebagai pengujian yang dapat diulang. Alur kerja ada di bagian akhir.

button

TL;DR

Apa yang berubah untuk pemanggil API

Berikut adalah perbedaannya, diambil dari catatan rilis dan changelog.

Satu ID model. Nama kanonisnya sekarang adalah deepseek-flash, tanpa versi di dalamnya. Sematkan prompt dan pengujian Anda pada perilaku, bukan pada string versi, karena rilis Flash berikutnya akan diluncurkan dengan nama yang sama.

Nama lama masih berfungsi. deepseek-v4-flash dan deepseek-v4-flash-vision-exp diterima untuk saat ini, tetapi model di belakangnya, V4-Flash dan V4-Flash-Vision-Exp, sudah pensiun. Permintaan ke nama-nama tersebut dilayani oleh V4.1-Flash. Tidak ada yang rusak, tetapi Anda tidak menjalankan model yang Anda kira. Ganti nama kapan pun Anda bisa.

Nama beta sudah tidak ada. Beta dua hari dari 8 September berjalan sebagai deepseek-v4.1-flash-expires-on-0910. Ini berakhir seperti yang dijanjikan. Beralihlah ke deepseek-flash.

URL dasar dan format tidak berubah. Panggilan yang kompatibel dengan OpenAI pergi ke https://api.deepseek.com, panggilan yang kompatibel dengan Anthropic pergi ke https://api.deepseek.com/anthropic, dan format API Respons yang sudah didukung oleh seri Flash tetap ada. Konfigurasi SDK Anda tidak perlu diubah.

V4-Pro memiliki empat hari. Mulai 14 September 2026 pukul 04:00 UTC (12:00 Beijing), setiap permintaan deepseek-v4-pro dialihkan ke V4.1-Flash dan ditagih dengan tarif V4.1-Flash. Alasan DeepSeek adalah bahwa V4.1-Flash "telah secara komprehensif melampaui V4 Pro dalam kinerja, biaya, kecepatan, dan waktu total", mengutip pengujian oleh berbagai pihak. Itu adalah klaim vendor. Panduan migrasi pensiun V4-Pro menunjukkan cara memeriksanya pada prompt Anda sendiri sebelum perubahan terjadi.

Langkah 1: dapatkan kunci

Masuk ke platform DeepSeek, buka API Keys, dan buat satu. Kunci dimulai dengan sk-. Ekspor alih-alih menempelkannya ke sumber:

export DEEPSEEK_API_KEY="sk-kunci-anda-di-sini"

Tidak diperlukan SDK khusus DeepSeek. Pustaka klien OpenAI dan Anthropic keduanya berfungsi setelah Anda mengubah URL dasar.

Langkah 2: lakukan panggilan pertama Anda

Curl dulu, karena menghilangkan setiap variabel kecuali API itu sendiri:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {"role": "system", "content": "Anda adalah teknisi dukungan untuk API pembayaran."},
      {"role": "user", "content": "Pelanggan mendapatkan HTTP 402 pada /v1/charges. Sebutkan tiga penyebab paling mungkin."}
    ],
    "stream": false
  }'

Panggilan yang sama melalui OpenAI Python SDK:

# pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "system", "content": "Anda adalah teknisi dukungan untuk API pembayaran."},
        {"role": "user", "content": "Pelanggan mendapatkan HTTP 402 pada /v1/charges. Sebutkan tiga penyebab paling mungkin."},
    ],
)

print(response.choices[0].message.content)

Dan Node:

// npm install openai
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await client.chat.completions.create({
  model: "deepseek-flash",
  messages: [
    { role: "user", content: "Tulis migrasi Postgres yang menambahkan stempel waktu refunded_at yang bisa null ke faktur." },
  ],
});

console.log(completion.choices[0].message.content);

Jika Anda menyiapkan terhadap rilis sebelumnya dengan mengikuti panduan API V4-Flash, satu-satunya perbedaan adalah string model.

Langkah 3: upaya penalaran dan mode berpikir

Kartu model menjelaskan upaya penalaran sebagai "dapat dikontrol secara terus-menerus" pada skala 1 hingga 100. Ini adalah keberangkatan dari preset rendah/menengah/tinggi yang diekspos sebagian besar API, dan itu berarti Anda dapat menyetel biaya dan latensi per endpoint, bukan per tingkat.

Bentuk parameter yang membawa nilai 1 hingga 100 itu adalah [VERIFIKASI] terhadap dokumen API. Sampai mereka mengonfirmasinya, mulailah dari pola V4-Flash: reasoning_effort ditambah objek thinking yang dilewatkan melalui extra_body:

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Kluster Redis kami menjatuhkan 2% SET di bawah beban. Rencanakan penyelidikannya."}],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}},
)

Pengaturan sampling yang direkomendasikan dari kartu model: temperature 1.0, top_p 0.95 atau 1.0, dan max_tokens 256K atau lebih untuk jejak penalaran yang panjang. Output maksimum adalah 384K token.

Pembagian praktis: berpikir mati untuk autokomplet, klasifikasi, dan apa pun yang ditunggu pengguna; berpikir aktif dengan upaya tinggi untuk loop agen, refaktor multi-file, dan debugging. Lalu ukur. Upaya yang tidak dapat Anda lihat di output adalah upaya yang Anda bayar.

Langkah 4: kirim gambar

V4.1-Flash bersifat multimodal secara native, dilatih pada korpus multimodal 45T-token dengan encoder DeepSeek-ViT yang dilatih dari awal. Format permintaan diwarisi dari V4-Flash-Vision-Exp: gambar adalah bagian dari array content pesan pengguna.

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Ekstrak setiap item baris dan total dari tanda terima ini sebagai JSON."},
            {"type": "image_url", "image_url": {"url": "https://cdn.example-shop.com/receipts/48213.png"}},
        ],
    }],
)

Untuk file lokal, enkode sebagai URL data base64:

import base64

with open("receipt.png", "rb") as f:
    data_url = "data:image/png;base64," + base64.b64encode(f.read()).decode()

# kemudian lewatkan {"url": data_url} di bagian image_url

Batas: URL data base64 hingga 32 MiB, URL eksternal hingga 8.192 karakter, atau ID file. Bidang detail opsional diterima. DeepSeek melaporkan DocVQA 95.6, yang merupakan kasus pembacaan dokumen di atas. Panduan API visi membahas prompt multi-gambar, tingkat detail, dan biaya gambar per permintaan.

Langkah 5: streaming respons

Atur stream=True dan endpoint akan mengembalikan peristiwa server-sent. Konten penalaran dan konten jawaban tiba sebagai delta terpisah, yang penting ketika Anda merender status "berpikir" di UI.

stream = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Jelaskan kunci idempotensi dalam satu paragraf."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    if delta.content:
        print(delta.content, end="", flush=True)

Jika SSE baru bagi Anda, streaming respons LLM dengan peristiwa server-sent menjelaskan format kabel dan kasus tepi koneksi ulang.

Harga Sekilas

Dari halaman harga resmi, berlaku mulai 10 September 2026 pukul 04:00 UTC, dalam USD per 1 juta token:

deepseek-flash di luar jam sibuk deepseek-flash jam sibuk
Input, cache hit $0.003 $0.006
Input, cache miss $0.15 $0.30
Output $0.60 $1.20

Tiga hal yang perlu diketahui:

Uji API di Apidog

Setelah panggilan pertama berfungsi, pertanyaannya adalah apakah itu akan terus berfungsi. deepseek-flash tidak membawa versi, jadi peningkatan berikutnya akan senyap. Berikut adalah alur kerja Apidog yang dapat menangkapnya:

  1. Tambahkan endpoint. Buat POST https://api.deepseek.com/chat/completions, atau impor spesifikasi OpenAPI yang kompatibel dengan OpenAI agar setiap rute tiba sekaligus.
  2. Simpan kunci sebagai variabel lingkungan. Masukkan DEEPSEEK_API_KEY ke lingkungan Apidog dan atur header menjadi Bearer {{DEEPSEEK_API_KEY}}. Beralih antara kunci pribadi dan kunci produksi menjadi mudah dengan dropdown.
  3. Simpan satu permintaan per tingkat upaya. Duplikasi permintaan dasar ke dalam varian: berpikir mati, berpikir aktif dengan upaya rendah, berpikir aktif dengan upaya tinggi. Prompt yang sama, parameter yang berbeda. Kirim ketiga-tiganya dan bandingkan penggunaan token serta latensi secara berdampingan.
  4. Tonton stream-nya. Untuk stream: true, Apidog merender peristiwa SSE saat tiba, sehingga delta penalaran dan delta konten muncul sebagai baris terpisah alih-alih dinding awalan data:.
  5. Ubah varian menjadi skenario pengujian. Tambahkan pernyataan pada kode status, pada jumlah cache-hit di usage yang di atas nol pada eksekusi kedua, dan pada respons yang berisi bidang yang diuraikan aplikasi Anda. Jalankan ulang skenario setelah setiap pembaruan model, dan pada 14 September ketika pengalihan V4-Pro aktif.
  6. Jalankan di CI. apidog-cli mengeksekusi skenario yang sama dari pipeline, sehingga perubahan model yang senyap akan menggagalkan build alih-alih menjadi tiket dukungan.

Unduh Apidog dan seluruh penyiapan hanya membutuhkan waktu sekitar sepuluh menit.

FAQ

Apakah saya harus mengganti nama deepseek-v4-flash menjadi deepseek-flash? Tidak hari ini. Nama lama masih mengarah ke V4.1-Flash. Namun V4-Flash sendiri sudah pensiun, dan DeepSeek belum mengatakan kapan alias tersebut akan hilang. Ganti nama di deploy Anda berikutnya.

Apa yang terjadi pada kode V4-Pro saya pada 14 September? Tidak ada yang rusak. Permintaan ke deepseek-v4-pro dijawab oleh V4.1-Flash dan ditagih dengan tarif Flash mulai pukul 04:00 UTC. Output Anda dapat berubah, jadi jalankan set evaluasi Anda sebelum tanggal tersebut. Panduan migrasi memiliki daftar periksa.

Apakah endpoint yang kompatibel dengan Anthropic mendukung model baru? Ya. https://api.deepseek.com/anthropic tidak berubah; gunakan deepseek-flash sebagai nama model di sana juga.

Apakah ada tingkatan gratis? API adalah pay-as-you-go tanpa tingkatan gratis permanen. Weights dilisensikan MIT di Hugging Face jika Anda ingin meng-host sendiri. Opsi saat ini dikumpulkan dalam cara menggunakan API DeepSeek V4 secara gratis.

Seberapa cepat? DeepSeek belum menerbitkan angka token per detik. Salah satu pengguna X melaporkan "hampir 400 t/s" dalam pengujian video, yang merupakan anekdot, bukan spesifikasi. Ukur pada prompt Anda sendiri selama jendela jam sibuk.

Sebelum Pengalihan

Permukaan API hampir tidak bergerak: URL dasar yang sama, format permintaan yang sama, satu ID model baru. Yang bergerak adalah harga dan, pada 14 September, pengalihan setiap panggilan V4-Pro. Ganti nama deepseek-v4-flash menjadi deepseek-flash, pilih tingkat upaya per endpoint, dan jalankan prompt Anda melalui model baru sebelum DeepSeek melakukannya untuk Anda.

Simpan prompt tersebut sebagai pengujian selagi Anda melakukannya. Apidog menjalankannya kembali dengan satu klik, dan peningkatan Flash senyap berikutnya akan muncul sebagai pernyataan yang gagal alih-alih tiket dukungan.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.