DeepSeek, amiral gemisi modelini en küçük modeliyle emekliye ayırdı. 10 Eylül 2026'da DeepSeek-V4.1-Flash API'de genel kullanıma sunuldu ve sürüm notu çoğu laboratuvarın gizleyeceği bir cümle içeriyordu: 14 Eylül'den itibaren, deepseek-v4-pro'ya yapılan her istek V4.1-Flash'a yönlendirilecek ve Flash fiyatlarıyla faturalandırılacak. Girişte 8 milyar parametre etkin olan 552 milyar parametreli Flash modeli, artık tüm V4 ailesinin sorumluluğunu üstleniyor.
Bu, bu haftaki "deepseek v4.1 flash" aramalarının ardındaki hikayedir ve iki nedenden dolayı önemlidir. İlk olarak, mimari yenidir. Nedensel Kodlayıcı-Çözücü ayrımı, belirteç başına 890 baytlık FP4 KV önbellekleme ve ilk ön eğitim adımından itibaren yerel görüş, DeepSeek V4'e yapılan artımlı değişiklikler değildir. İkincisi, fiyat tablosu da onunla birlikte değişti. V4-Pro oranlarını ödüyorsanız, 14'ünde herhangi bir değişiklik yapıp yapmamanıza bakılmaksızın faturanız %70 veya daha fazla düşecektir.
Bu rehber, gönderilenleri, mimarinin geliştirici açısından nasıl çalıştığını, satıcı benchmarklarının ne söylediğini ve fiyatlandırma matematiğini kapsar. Apidog'da modeli kendi istemlerinizle test etmek için bir iş akışıyla kapanır, çünkü bir benchmark tablosu bir başlangıç noktasıdır, bir karar değildir.
TL;DR
- DeepSeek-V4.1-Flash, 10 Eylül 2026 itibarıyla genel kullanımdadır. Model kimliği:
deepseek-flash. Temel URL değişmedenhttps://api.deepseek.com'da kaldı. - 552B MoE (görüş kodlayıcısı ile 763B), ön doldurma için 8B etkin, çözümleme için 16B etkin. 1M bağlam, 384K maksimum çıktı.
- DeepSeek'in kendi verilerine göre HumanEval, GSM8K, DeepSWE ve Terminal-Bench'te V4-Pro'yu geride bırakıyor.
- En yüksek fiyatlandırma: 1M önbellek-kaçıran giriş başına 0,30 dolar, 1M çıktı başına 1,20 dolar. Düşük yoğunluklu saatler bunun yarısıdır.
- V4-Pro istekleri, 14 Eylül saat 04:00 UTC'de V4.1-Flash'a yeniden yönlendirilecek.
10 Eylül'de Neler Gönderildi
DeepSeek, 8 Eylül'den itibaren iki günlük dahili beta sürümünü deepseek-v4.1-flash-expires-on-0910 model adıyla çalıştırdı, hesap başına 20 eşzamanlı istek ile sınırlıydı ve deepseek-v4-flash ile aynı fiyattaydı. TechNode bu beta sürümünü bildirdi. İki gün sonra model genel kullanıma sunuldu, 2026-09-10 tarihli bir değişiklik günlüğü girişi ve X'te bir duyuru ile.
Kodunuz için üç adlandırma değişikliği önemlidir:
- Yeni model kimliği
deepseek-flash'tir. Yeni entegrasyonlar için bunu kullanın. - Eski adlar
deepseek-v4-flashvedeepseek-v4-flash-vision-exphala çözümlenir, ancak V4.1-Flash tarafından sunulurlar. V4-Flash ve V4-Flash-Vision-Exp ayrı modeller olarak kullanımdan kaldırılmıştır. deepseek-v4-pro, 14 Eylül'e kadar çalışmaya devam eder, sonra V4.1-Flash'a yönlendirilir.
Temel URL'ler değişmedi: OpenAI formatı için https://api.deepseek.com, Anthropic formatı için https://api.deepseek.com/anthropic. Yanıtlar API'si Flash serisinde zaten destekleniyordu, bu nedenle Codex tarzı entegrasyonlar aktarılıyor. Görüntü girişi ve akıl yürütme çabası dahil olmak üzere parametre ayrıntıları için DeepSeek-V4.1-Flash API'sini nasıl kullanacağınızı görün.
Geliştiriciler için Nedensel Kodlayıcı-Çözücü Mimari
Model kartı, DeepSeek'in Nedensel Kodlayıcı-Çözücü veya CED olarak adlandırdığı bir tasarımı tanımlar. Belirteçler için ödeme yapan kişi siz olduğunuzda her sayının ne anlama geldiği aşağıdadır.
552 milyar parametre, görüşle birlikte 763 milyar. Dil omurgası 552 milyar parametreli bir uzmanlar karışımı modelidir. Bu sürüm için sıfırdan eğitilmiş DeepSeek-ViT kodlayıcısını ekleyin ve tam model 763 milyara ulaşır. Bunlar depolanan parametrelerdir, bir isteğin maliyeti değildir.
Ön doldurma için 8B etkin, çözümleme için 16B etkin. Bu manşet değişikliğidir. 40 katman, 20 kodlayıcı ve 20 çözücü katmanına ayrılır. İsteminizi okuma (ön doldurma), belirteç başına yaklaşık 8B parametreyi etkinleştirir. Yanıtı yazma (çözümleme), yaklaşık 16B'yi etkinleştirir. Önceki DeepSeek MoE modelleri, her iki faz için de tek bir etkin-parametre bütçesi kullanıyordu.
Bu ayrım neden önemlidir? Ön doldurma hesaplama yoğunlukludur: 200 bin belirteçlik bir belgeyi tek geçişte modelden geçirirsiniz. Çözümleme bellek yoğunlukludur: her seferinde bir belirteç üretirsiniz ve maliyet HBM'den ağırlıkları ve KV önbelleğini okumaktır. Ön doldurmada daha az parametre, uzun girdilerde ilk belirtece kadar geçen süreyi kısaltır. Çözümlemede daha fazla parametre, ek hesaplamanın bellek trafiğine göre ucuz olduğu yerlerde yanıt kalitesi sağlar. 2 bin belirteçlik bir yanıt üreten 1 milyon bağlamlı bir aracı izlemesi, belirteçlerinin %99,8'i için ucuz yolu kullanır.
Katman başına 384 yönlendirilmiş uzman artı 1 paylaşılan uzman. Yönlendirici, belirteç başına 384 uzmandan birkaçını seçer ve paylaşılan uzman her zaman çalışır. 552 milyar depolanan parametrenin 8 milyar veya 16 milyar etkin hale gelmesi bu şekildedir.
CSA2 ve FP4 KV önbelleği. Sıkıştırılmış Seyrek Dikkat 2, üç statik dikkat moduyla birlikte gelir. Ana KV önbelleği için FP4 depolama ile eşleştirildiğinde, genel önbellek ayak izi belirteç başına 890 bayttır, DeepSeek-V4-Flash'ın yaklaşık dörtte biri. Sürüm notu, önceki neslin HBM'sinin 1/4'ü ve SSD depolamasının 1/8'i olarak belirtiyor. Belirteç başına 890 bayt ile, tam 1M belirteçli bir bağlam yaklaşık 0,9 GB KV önbelleğine ihtiyaç duyar. Eşzamanlılık sınırının Pro için 500'e karşı Flash için 2.500 olmasının bir nedeni de budur.
1M bağlam, 384K çıktı. Seyrek dikkat, 64K'da eğitildi ve 45T belirteçli bir multimodal korpusun 34T belirteç markasında 1M'ye uzatıldı. Akıl yürütme çabası, 1'den 100'e kadar sürekli olarak kontrol edilebilir olarak tanımlanır; bu ölçek için tam API parametre şekli belgelerle [DOĞRULANACAK].
Benchmarklar: DeepSeek'in Bildirdikleri
Bu bölümdeki her sayı DeepSeek tarafından model kartından raporlanmıştır. 10 Eylül itibarıyla bağımsız bir değerlendirme yayınlanmamıştı. Bunları satıcının iddiası olarak okuyun, sonra kendi testlerinizi yapın.

Desen tutarlı: V4.1-Flash her satırda V4-Pro'nun üzerinde yer alıyor, en geniş fark aracısal kodlamada. DeepSWE, Pro'ya göre 11,5, eski Flash'a göre neredeyse 20 puan atlıyor. GSM8K doygunluğa ulaştığından, 0,4 puanlık fark size pek bir şey söylemez.
Görüş skorları, yine satıcı tarafından bildirilenler: MMMU-Pro 56.5, CVBench 77.9, DocVQA 95.6, RefCOCO 86.0. Doküman ayrıştırma çoğu üretim görüş trafiğinin gittiği yer olduğundan, DocVQA izlenmesi gereken sayıdır.
DeepSeek'in V4-Pro yeniden yönlendirmesi için çerçevesi, V4.1-Flash'ın "çoklu tarafların testlerine atıfta bulunarak performans, maliyet, hız ve toplam sürede V4 Pro'yu kapsamlı bir şekilde geride bıraktığı" şeklindedir. Taraflar adlandırılmamıştır. Bu cümleyi kontrol edebileceğiniz bir iddia olarak değerlendirin.
Fiyatlandırma ve V4-Pro Yeniden Yönlendirmesi
Aşağıdaki oranlar, fiyatlandırma sayfasından alınmıştır ve 10 Eylül saat 04:00 UTC itibarıyla, 1M belirteç başına USD cinsindendir.
| deepseek-flash yoğun olmayan saatler | deepseek-flash yoğun saatler | deepseek-v4-pro yoğun olmayan saatler | deepseek-v4-pro yoğun saatler | |
|---|---|---|---|---|
| Giriş, önbellek isabeti | 0,003 dolar | 0,006 dolar | 0,022 dolar | 0,044 dolar |
| Giriş, önbellek isabeti yok | 0,15 dolar | 0,30 dolar | 0,66 dolar | 1,32 dolar |
| Çıktı | 0,60 dolar | 1,20 dolar | 1,98 dolar | 3,96 dolar |
Yoğun saatler hafta içi 01:00 ile 04:00 ve 06:00 ile 10:00 UTC arasıdır; yoğun olmayan saatler zirvenin %50'sidir. Bağlam önbellekleme otomatiktir ve bir önbellek isabeti, her iki katmanda da bir kaçırmadan 50 kat daha az maliyetlidir.
V4-Flash'ın Ağustos oranlarına kıyasla, V4.1-Flash önbellek-isabetli girişi yaklaşık %57, önbellek-kaçıran girişi yaklaşık %32 ve çıktıyı yaklaşık %9 oranında düşürür.
V4-Pro sütunu izlenmesi gereken yerdir. 14 Eylül'den sonra, deepseek-v4-pro'ya gönderilen bir istek Flash sütunundaki fiyatı öder. Zirve saatlerinde, 1M önbellek-kaçıran giriş başına 1,32 dolar yerine 0,30 dolar (%77 daha az) ve 1M çıktı başına 3,96 dolar yerine 1,20 dolar (%70 daha az) ödersiniz. Hiçbir kodu değiştirmeden indirim alırsınız, ancak yine de eski bir takma ada bağlı kalmak yerine model kimliğini güncellemelisiniz. Geçiş rehberi kontrol listesini adım adım anlatır ve fiyatlandırma derinlemesine incelemesi uzun aracı oturumları için önbellek-isabet matematiğini kapsar.
Apidog'da Kendi İsteklerinizle V4.1-Flash'ı Değerlendirin
Satıcı tablosu modelin DeepSWE'de iyi olduğunu söylüyor. Ancak, sizin çıkarma şemanızı, araç çağırma formatınızı veya 300 bin belirteçlik destek transkriptlerinizi işleyip işlemediğini söylemiyor. İşte Apidog'da bu soruları bir öğleden sonra yanıtlayan ve her sessiz model güncellemesinden sonra yanıtlamaya devam eden bir iş akışı.
- Anahtarı bir ortam değişkeni olarak saklayın. Bir Apidog ortamı oluşturun ve DeepSeek platformundan
DEEPSEEK_API_KEY'i ekleyin. Yetkilendirme başlığındaBearer {{DEEPSEEK_API_KEY}}olarak referans verin. - Uç noktayı ekleyin.
POST https://api.deepseek.com/chat/completionsoluşturun veya bir OpenAPI belirtimi içe aktarın. - Her gerçek istem için bir istek kaydedin. Üretim günlüklerinden beş ila on istem alın ve her birini
"model": "deepseek-flash"ile kendi isteği olarak kaydedin. Çıktıları yan yana karşılaştırabilmek için 14'üne kadardeepseek-v4-pro'ya işaret eden bir kopyasını saklayın. - Akışı izleyin ve olayları görün.
"stream": trueolarak ayarlayın. Apidog, SSE yanıtlarını olay bazında işler, böylece akıl yürütme deltaları ve yanıt deltaları birdata:satır duvarı yerine ayrı ayrı görünür. Uzun ön doldurmada ilk belirtece kadar geçen süreyi görmenin en hızlı yoludur. - Onaylar ekleyin ve bir test senaryosu oluşturun. Durum kodunu, beklediğiniz bir
tool_callsalanını ve çıktının JSON geçerliliğini onaylayın. Kaydedilen istekleri bir test senaryosunda birleştirin. - Her model güncellemesinde tekrar çalıştırın. DeepSeek,
deepseek-flash'ın arkasındaki bir sonraki değişikliği yayınladığında, senaryoyu çalıştırın. Her dağıtımda çalışacak şekildeapidog-cliile CI'ya bağlayın.
İşte OpenAI SDK'sını kullanarak kaydedilen istemlerden birinin gövdesi:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "system", "content": "Extract the order ID, SKU list, and refund amount as JSON."},
{"role": "user", "content": "Ticket #48213: customer wants a refund of $42.90 for SKUs KB-220 and MS-114 from order ORD-99117."},
],
stream=True,
)
for chunk in response:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Apidog'u indirin ve bu gövdeyi kaydedilmiş bir isteğe yapıştırın. Apidog, bir model ana bilgisayarını değil, API katmanını test eder, bu nedenle gördüğünüz yanıt, kullanıcılarınızın alacağı yanıttır.
SSS
DeepSeek-V4.1-Flash, V4-Pro'nun yerine mi geçiyor? Evet, DeepSeek'in kararıyla. 14 Eylül saat 04:00 UTC'den itibaren, deepseek-v4-pro istekleri V4.1-Flash tarafından Flash fiyatlarıyla sunulacak. V4 API serisinde daha büyük bir model kalmadı.
Model kimliğimi değiştirmem gerekiyor mu? Hemen değil. deepseek-v4-flash, deepseek-v4-flash-vision-exp ve (14'ünden sonra) deepseek-v4-pro hepsi V4.1-Flash'a çözümlenir. Entegrasyona bir dahaki dokunduğunuzda deepseek-flash'a geçin. API rehberi tam parametre referansına sahiptir.
8B ön doldurma / 16B çözümleme gecikme için ne anlama geliyor? Girişte daha az etkin parametre, uzun istemlerde ilk belirtece kadar geçen sürenin daha hızlı olmasını sağlar. Çıkışta daha fazlası, hesaplamanın üretim kalitesinin belirlendiği yere gitmesi anlamına gelir. Belirteç başına 890 baytlık KV önbelleği, uzun oturumların bellekte ucuz tutulmasını sağlar.
Yerel olarak çalıştırabilir miyim? Ağırlıklar Hugging Face'te MIT lisanslıdır. Omurga tek başına 8 bit'te yaklaşık 552 GB veya 4 bit'te 280 GB'tır, bu nedenle bu bir dizüstü bilgisayar projesi değil, çoklu GPU veya SSD akış projesidir. Sıfırıncı gün çıkarım motoru desteği [DOĞRULANACAK].
Benchmarklar bağımsız mı? Hayır. Yukarıdaki her puan DeepSeek'in model kartından gelmektedir. Teknik rapor metodolojiyi içerir.
Bu, V4 Serisini Nerede Bırakıyor
DeepSeek, iki modelli bir API'yi tek bir API'ye düşürdü. İddia, 16 milyar çözme bütçesi, çeyrek boyutlu bir KV önbelleği ve hesap başına 2.500 eşzamanlı oturumu olan 552 milyar parametreli bir modelin, üç ila dört kat daha pahalı olan daha büyük bir modelden daha iyi aracı iş yüklerine hizmet ettiğidir. Satıcının sayıları bu iddiayı destekliyor; iş yükünüz bunun geçerli olup olmadığını belirler.
SDK'nızı deepseek-flash'a yönlendirin, 14'ünden önce kendi istemlerinizi üzerinde çalıştırın ve test senaryosunu koruyun. Orijinal V4-Flash API'si üzerine inşa ettiyseniz, entegrasyonunuz zaten çalışıyor demektir. Değişen şey arkasındaki modeldir ve ölçmeye değer kısım da budur.
