DeepSeek V4 Pro önizlemeden 12 Ağustos 2026 tarihinde çıktı. 0813 damgalı GA (Genel Kullanıma Açık) sürümü artık deepseek-v4-pro API uç noktasına hizmet veriyor ve yazım hatası gibi okunan sayılarla geliyor: 1M jetonluk bir bağlam penceresi, 384K jetonluk maksimum çıktı ve önbellek isabetlerinde milyon jeton başına 0,003625 dolara düşen giriş fiyatlandırması. Unite.AI'nin bildirdiğine göre, dört ay önizlemede kalan model artık DeepSeek'in amiral gemisi.
Lansman haberleri, neyin piyasaya sürüldüğünü söyler, nasıl çağıracağınızı değil. Bu rehber uygulamalı kısmı ele alıyor: OpenAI SDK ile ilk istek, düşünme modları ve reasoning_content alanı, akış, araç çağırma ve 1M'lik bağlamın uygun fiyatlı mı yoksa yıkıcı mı olduğunu belirleyen istem önbellekleme matematiği. Önce mimari geçmişini öğrenmek isterseniz, DeepSeek V4 Nedir yazısını okuyun ve geri gelin.
ÖZETLE
- DeepSeek-V4-Pro-0813, 12 Ağustos 2026 itibarıyla
deepseek-v4-prouç noktasının arkasındaki GA anlık görüntüsüdür ve üretimde hedeflenecek yapıdır. - API, OpenAI uyumludur:
openaiSDK'yıhttps://api.deepseek.com'a yönlendirin,model="deepseek-v4-pro"ayarlayın, hepsi bu. Anthropic Mesajlar formatı ve DeepSeek'in kendi Yanıtlar API'si de çalışır. - 1M jetonluk bağlam, 384K maksimum çıktı, üç düşünme modu (
non-think,think high,think max) yanıtın yanı sıra birreasoning_contentalanı döndürür. - Fiyatlandırma: 0,435 $/M giriş (önbellek kaçırma), 0,003625 $/M giriş (önbellek isabeti, 120 kat daha ucuz), 0,87 $/M çıktı. Önbellekleme, tekrar eden istem önekleri için otomatiktir.
- DeepSeek, 6 Ağustos'ta "önemli" bir API fiyat artışının geleceği konusunda uyardı. Henüz rakam veya tarih yok, bu yüzden pay bırakarak bütçe yapın.
- Herhangi bir gerçek şeye bağlamadan önce uç noktayı test edin, SSE akışını inceleyin ve Apidog'da pro/flash ortamlarını yan yana tutun.
GA sürümü 0813 geliştiriciler için neyi değiştiriyor?
Önizleme Nisan 2026'da açıldı, daha küçük kardeş V4 Flash Temmuz'da piyasaya sürüldü ve 12 Ağustos'ta Pro modeli, DeepSeek'in olağan tarih damgası geleneğini takiben (v3-0324'ün bir V3 anlık görüntüsünü işaretlediği gibi) 0813 sürümü olarak genel kullanıma açıldı.

GA ile üç şey değişiyor:
- Anlık görüntü kararlıdır. Önizleme modelleri ayaklarınızın altından kayabilir, bu da değerlendirmeleri ve istem ayarlamalarını sessizce geçersiz kılar. 0813 sürümü, DeepSeek yeni bir anlık görüntü duyurana kadar sabit bir hedeftir.
- Uç nokta üretim takma adıdır. Resmi API'de
deepseek-v4-pro'yu çağırırsınız ve 0813 sürümünü alırsınız; anlık görüntüyü açıkça sabitlemek için, OpenRouter onudeepseek/deepseek-v4-pro-0813olarak listeler. - Tüm özellik yüzeyi açık. Düşünme modları, fonksiyon çağırma, yapılandırılmış çıktılar, istem önbellekleme ve çok formatlı API (OpenAI, Anthropic, Responses) GA uç noktasında canlıdır.
Kulislerde, V4 Pro, toplam 1.6T parametreye ve jeton başına 49B aktif parametreye sahip bir uzman karışımı modelidir. Öne çıkan mühendislik hikayesi verimliliktir: iki dikkat şeması, Sıkıştırılmış Seyrek Dikkat (Compressed Sparse Attention) ve Yoğun Sıkıştırılmış Dikkat (Heavily Compressed Attention), tek jetonlu çıkarım hesaplamasını V3.2'nin %27'sine ve KV önbelleğini %10'una düşürür. Bu KV önbelleği azaltması, 1M jetonluk bir bağlamın demo özelliği yerine bu fiyatlarla sunulabilir olmasını sağlayan şeydir.
DeepSeek V4 Pro 0813: bir bakışta özellikler
| Özellik | DeepSeek V4 Pro 0813 |
|---|---|
| Sürüm | 12 Ağustos 2026'da GA (anlık görüntü 0813) |
| Mimari | Uzman karışımı, toplam 1.6T parametre, jeton başına 49B aktif |
| Dikkat Mekanizması | Sıkıştırılmış Seyrek Dikkat + Yoğun Sıkıştırılmış Dikkat |
| Çıkarım maliyeti V3.2'ye göre | Tek jetonlu hesaplamanın %27'si, KV önbelleğinin %10'u |
| Bağlam penceresi | 1.000.000 jeton |
| Maksimum çıktı | 384K jeton |
| Düşünme modları | düşünmesiz, yüksek düşünme, maksimum düşünme |
| Giriş fiyatı | 0,435 $/M jeton (önbellek kaçırma), 0,003625 $/M (önbellek isabeti) |
| Çıkış fiyatı | 0,87 $/M jeton |
| API formatları | OpenAI Sohbet Tamamlama, Anthropic Mesajları, DeepSeek Yanıtları |
| Model Kimliği | deepseek-v4-pro |
| Daha küçük kardeş | deepseek-v4-flash (toplam 284B / 13B aktif), 0,14 $/M giriş, 0,28 $/M çıkış |
Yetenek açısından, DeepSeek'in kendi model kartında V4-Pro-Max (maksimum düşünme yapılandırması) için SWE-bench Doğrulanmış %80,6, Terminal Bench 2.0 %67,9, GPQA Diamond %90,1 ve LiveCodeBench %93,5 olarak listeleniyor. Bunlar, henüz hiçbir üçüncü tarafın doğrulamadığı satıcı tarafından bildirilen rakamlardır, bu nedenle önemli bir şeyi taşımadan önce kendi göreve özel değerlendirmelerinizi çalıştırın.
Bir API anahtarı alın ve ilk isteğinizi yapın
Kurulum yaklaşık beş dakika sürer:
- DeepSeek platformunda (platform.deepseek.com) bir hesap oluşturun ve kredi ekleyin, API ön ödemelidir.
- API Anahtarlarını açın, bir anahtar oluşturun ve hemen kopyalayın (bir kez gösterilir).
- Koda yapıştırmak yerine ortam değişkeni olarak dışa aktarın:
export DEEPSEEK_API_KEY="sk-..."
API, OpenAI Sohbet Tamamlama protokolünü konuşur, bu nedenle standart openai paketi istemcidir. Hem https://api.deepseek.com hem de https://api.deepseek.com/v1 temel URL olarak çalışır; /v1 protokol uyumluluğudur, model sürümü değildir.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "You are a concise technical assistant."},
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
],
)
print(response.choices[0].message.content)
print(response.usage)
İlk günden itibaren response.usage'ı yazdırın. Önbellek isabetlerinde bu kadar ucuz ve 1M jetonluk önbellek kaçırmalarında bu kadar pahalı bir modelle, jeton muhasebesi bir yuvarlama hatası ile gerçek bir fatura arasındaki farktır.
Ham HTTP üzerinden aynı istek, hızlı testler ve API araçlarına aktarmak için kullanışlıdır:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "List three ways to version a REST API."}
]
}'
Tam parametre referansı, Anthropic uyumlu uç nokta (Anthropic SDK ve Claude Code'dan hiçbir şeyi yeniden yazmadan kullanılabilir) ve DeepSeek'in kendi Yanıtlar API'si dahil olmak üzere resmi DeepSeek belgelerinde yer almaktadır.
Üç düşünme moduyla çalışmak
V4 Pro, akıl yürütmeyi ayrı bir model yerine bir kadran olarak sunar. Bir uç nokta, üç mod:
- düşünmesiz: model doğrudan yanıt verir. En hızlı ve en ucuzdur, çıkarma, sınıflandırma, biçimlendirme ve özetler için uygundur.
- yüksek düşünme: model yanıtlamadan önce akıl yürütür ve bu akıl yürütmeyi bir
reasoning_contentalanında döndürür. Kodlama, hata ayıklama ve çok adımlı analiz için varsayılandır. - maksimum düşünme: maksimum akıl yürütme bütçesi, V4-Pro-Max kıyaslama sayılarının arkasındaki yapılandırma. Gerçekten zor sorunlar için saklayın.
Modlar, standart reasoning_effort parametresine eşlenir, bu nedenle satıcıya özel bir bağlantıya gerek yoktur:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high", # "none" | "high" | "max"
messages=[
{"role": "user", "content": "Our API returns 502s under load but only behind the CDN. Walk through likely causes in order of probability."},
],
)
message = response.choices[0].message
print("--- Akıl Yürütme ---")
print(message.reasoning_content)
print("--- Yanıt ---")
print(message.content)
İki pratik not. Birincisi, reasoning_content'ı asla konuşma geçmişine geri beslemeyin; yalnızca önceki konuşmaların content'ini gönderin. İkincisi, akıl yürütme jetonları çıktı jetonları olarak 0,87 $/M fiyatla faturalandırılır, bu nedenle maksimum düşünme gerçek paraya ve gerçek gecikmeye mal olur. Maksimumu varsaymak yerine modu göreve göre eşleştirin.
Akışlı yanıtlar
384K maksimum çıktı ve uzun uzadıya akıl yürütebilen düşünme modlarıyla, akışsız istekler kötü bir kullanıcı deneyimi yaratır. stream=True olarak ayarlayın ve her iki delta türünü de işleyin; düşünme modlarında, reasoning_content parçaları önce gelir, sonra yanıt:
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{"role": "user", "content": "Design a rate limiter for a public API. Compare token bucket and sliding window."},
],
)
for chunk in stream:
if not chunk.choices:
continue # son parça yalnızca kullanım verilerini taşıyabilir
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True) # düşünme aşaması
elif delta.content:
print(delta.content, end="", flush=True) # yanıt aşaması
Mantıklı bir kullanıcı arayüzü deseni: düşünme aşamasını "düşünüyor" göstergesi olarak daraltılmış şekilde render edin, ardından content deltaları başladığında normal render etmeye geçin. Kulislerde bu standart sunucu tarafından gönderilen olaylardır; SSE ile API yanıtlarının akışı hakkındaki rehberimiz mekaniği kapsar.
Araç çağırma ve yapılandırılmış çıktılar
V4 Pro, OpenAI tarzı fonksiyon çağırmayı destekler, bu da mevcut ajan döngülerinin değişiklik yapmadan taşınabileceği anlamına gelir. Araçları tanımlayın, tool_calls'ı okuyun, yürütün, sonuçları ekleyin, tekrarlayın:
tools = [{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {"type": "string", "description": "Path, e.g. /v1/orders"}
},
"required": ["endpoint"],
},
},
}]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Is /v1/orders healthy right now?"}],
tools=tools,
)
print(response.choices[0].message.tool_calls)
Yapılandırılmış çıktılar, garantili ayrıştırılabilir JSON'a ihtiyacınız olduğunda standart response_format parametresi aracılığıyla çalışır. Çok adımlı araç döngülerinin tam bir incelemesi ayrı bir makaleyi hak ediyor; resmi belgeler mesaj şekli detaylarını kapsar.
İstem önbellekleme ekonomisi: mimarinizi değiştiren sayı
İşte kıyaslama testlerinden daha fazla dikkat hak eden özellik. DeepSeek istem öneklerini otomatik olarak önbelleğe alır, önbellek kontrol başlıkları yok, TTL yapılandırması yok ve tekrar eden önekler 0,435 $/M yerine 0,003625 $/M olarak faturalandırılır. Bu, API'nin zaten gördüğü giriş için 120 kat indirimdir.
Gerçekçi bir iş yükü üzerinde sayıları çalıştırın. Diyelim ki 200K jetonluk bir depo bağlamı tutan ve bir oturumda 50 çağrı yapan bir kodlama ajanı inşa ediyorsunuz:
- Önbellekleme olmadan: 50 çağrı × 200K jeton × 0,435 $/M ≈ 4,35 $ giriş maliyeti.
- Otomatik önbellekleme ile: bir önbellek kaçırma (0,087 $) + 49 önbellek isabeti (≈ her biri 0,0007 $) ≈ 0,12 $.
Aynı oturum, kabaca 35 kat daha ucuz ve tek gereken istem yapısıdır: önce sabit içerik (sistem istemi, dokümantasyon, depo bağlamı), en son değişken içerik (kullanıcının en son mesajı, zaman damgaları, istek kimlikleri). İstemdeki herhangi bir erken değişiklik, önbelleğe alınmış öneki o noktadan itibaren geçersiz kılar, bu nedenle sistem isteminizdeki bir zaman damgası, her çağrıyı sessizce tam fiyatlı bir önbellek kaçırmasına dönüştürür.
Bu aynı zamanda 1M bağlam penceresini de yeniden çerçeveler: bir kaçırmada doldurmak 0,435 $'a mal olur, ancak sabit bir oturum öneki olarak çağrı başına yaklaşık üçte bir sente okunur. Genel teori için, İstem önbellekleme nedir makalesine bakın.
Apidog'da deepseek-v4-pro'yu test etme
V4 Pro herhangi bir üretim koduna yaklaşmadan önce, uç noktayı uygun bir hata ayıklayıcıya sokun. DeepSeek'in API'si OpenAI uyumlu olduğu için, Apidog onu sıfır özel işlemle algılar:

- Uç noktayı içe aktarın. Daha önceki curl komutunu Apidog'a yapıştırın ve bu, başlıkları, kimlik doğrulamayı ve gövdeyi otomatik olarak ayrıştırılmış düzenlenebilir bir istek haline gelir.
- Pro ve Flash için ortamları ayarlayın.
base_url'i ve API anahtarınızı ortam değişkenleri olarak saklayın ve model adını da bir değişken yapın.deepseek-v4-provedeepseek-v4-flasharasında geçiş tek tıklamayla bir ortam değişikliği haline gelir, bu da "Bu istemde Pro, Flash'ın fiyatının 3 katına değer mi?" sorusunu bir tartışma yerine ampirik bir soru yapar. - SSE akışını inceleyin.
"stream": trueile bir istek gönderin ve Apidog, olay akışını hamdata:satırları duvarı yerine canlı bir zaman çizelgesi olarak render eder, deltaları birleştirerekreasoning_content'ın yanıttan önce geldiğini izleyebilirsiniz. Bir think-max çağrısı yavaş hissettiğinde, bu görünüm size zamanın tam olarak nereye gittiğini gösterir. - Oturumu bir koleksiyon olarak kaydedin. DeepSeek bir sonraki anlık görüntüyü gönderdiğinde, yükseltmeden önce aynı istekleri tekrar çalıştırın ve davranışları karşılaştırın, genel olarak OpenAI uyumlu uç noktalar için ekiplerin kullandığı aynı iş akışı.
Yanıt görüntüleyici ayrıca her istekteki usage bloğunu da gösterir, bu da istem yapısını ayarlarken önbellek isabet oranınızı doğrulamanın en hızlı yoludur.
Bugünün fiyatlandırması ve gelecek olan artış
İki V4 uç noktası için mevcut liste fiyatları:
| Model | Giriş (kaçırma) | Giriş (önbellek isabeti) | Çıkış |
|---|---|---|---|
deepseek-v4-pro |
0,435 $/M | 0,003625 $/M | 0,87 $/M |
deepseek-v4-flash |
0,14 $/M | 0,28 $/M |
Pro fiyatlarında bile, bu Batılı öncü modelleri geniş bir farkla alt ediyor. Ancak bir uyarıyı göz önünde bulundurarak plan yapın: 6 Ağustos 2026'da, GA'dan altı gün önce, DeepSeek "önemli" bir API fiyat artışının geleceği konusunda uyardı, rakam yok, yürürlük tarihi yok.
Sayı bilinmezken pratik önlemler:
- Gerçek görev başına maliyetinizi şimdi, gerçek iş yüklerinden alınan
usageverileriyle ölçün, böylece açıklanacak herhangi bir artışı tahmin etmek yerine dakikalar içinde modelleyebilirsiniz. - Önbellek isabetlerini maksimize edin. Artış orantılı olarak uygulanırsa, önek ağırlıklı mimariler avantajlarının çoğunu korur.
- V4 Flash'ı bir yönlendirme yedeği olarak tutun. 13B aktif parametreyle 0,14 $/0,28 $ fiyatla, yüksek hacimli basit görevleri halleder, böylece Pro, ona ihtiyaç duyan istekler için ayrılır.
V4 fiyatlandırma yapısının daha derin bir dökümü ve sağlayıcılar arasında nasıl karşılaştırıldığı için DeepSeek V4 API fiyatlandırma rehberimize bakın.
SSS
Mevcut OpenAI SDK kodum değişiklik yapmadan çalışacak mı?
Neredeyse. base_url'i https://api.deepseek.com olarak değiştirin, API anahtarını takas edin ve model="deepseek-v4-pro" ayarlayın. Sohbet Tamamlamaları, akış, araçlar ve yapılandırılmış çıktılar OpenAI şekillerini takip eder. Anthropic SDK'daki ekipler bunun yerine DeepSeek'in Anthropic Mesajlar uç noktasını kullanabilir.
V4 Pro yerine V4 Flash'ı ne zaman kullanmalıyım?
Flash (toplam 284B, 13B aktif) hacim modelidir: sınıflandırma, çıkarma, basit sohbet, derin akıl yürütmeye ihtiyaç duymayan gecikmeye duyarlı her şey. Pro, ajan tabanlı kodlama, uzun bağlam analizi ve düşünme modu iş yüklerinde 3 kat çıktı fiyatını hak eder. Göreve göre yönlendirin, sadakate göre değil.
V4 Pro 0813'ü Cursor'da kullanabilir miyim?
Evet, Cursor özel OpenAI uyumlu uç noktaları kabul eder, bu nedenle GA sürümü özel bir model olarak entegre edilebilir. Tam kurulumu DeepSeek V4 Pro'yu Cursor ile nasıl kullanacağınız rehberimizde adım adım açıklıyoruz.
Sonuç
GA modeliyle ilk gün, kas hafızası oluşturmak için doğru zamandır: anahtar, ilk istek, düşünme modları, akış ve önbellekleme bilincine sahip bir istem düzeni. V4 Pro, bu son alışkanlığı kendisinden önceki tüm modellerden daha fazla ödüllendiriyor, 120 kat önbellek indirimi, istem yapısını bir mimari kararı haline getiriyor. Yukarıdaki örnekleri bağlayın, usage sayılarını izleyin ve bir sonraki anlık görüntü veya açıklanan fiyat değişikliği geldiğinde davranışı yeniden doğrulayabilmeniz için kaydedilmiş bir Apidog koleksiyonunu saklayın.
