DeepSeek ได้ปลดประจำการเรือธงด้วยโมเดลที่เล็กที่สุด เมื่อวันที่ 10 กันยายน 2026, DeepSeek-V4.1-Flash ได้เปิดตัวสู่สาธารณะ (GA) บน API และ บันทึกการเปิดตัว มีข้อความที่ห้องปฏิบัติการส่วนใหญ่จะซ่อนไว้: เริ่มตั้งแต่วันที่ 14 กันยายน ทุกคำขอไปยัง deepseek-v4-pro จะถูกส่งไปยัง V4.1-Flash และคิดค่าบริการตามราคา Flash โมเดล Flash ขนาด 552 พันล้านพารามิเตอร์ ซึ่งมี 8 พันล้านพารามิเตอร์ที่ทำงานอยู่เมื่อป้อนข้อมูล จะทำหน้าที่ตอบสนองตระกูล V4 ทั้งหมด
นั่นคือเบื้องหลังการค้นหา "deepseek v4.1 flash" ในสัปดาห์นี้ และมันสำคัญด้วยสองเหตุผล ประการแรก สถาปัตยกรรมใหม่ การแยกส่วน Causal Encoder-Decoder, การแคช FP4 KV ที่ 890 ไบต์ต่อโทเค็น และความสามารถในการมองเห็นแบบเนทีฟตั้งแต่ขั้นตอนการฝึกอบรมล่วงหน้าครั้งแรก ไม่ใช่การเปลี่ยนแปลงเล็กน้อยสำหรับ DeepSeek V4 ประการที่สอง ตารางราคาเปลี่ยนแปลงไปพร้อมกัน หากคุณกำลังจ่ายในอัตรา V4-Pro บิลของคุณจะลดลง 70% หรือมากกว่าในวันที่ 14 ไม่ว่าคุณจะเปลี่ยนแปลงอะไรหรือไม่ก็ตาม
คู่มือนี้จะครอบคลุมสิ่งที่เปิดตัว สถาปัตยกรรมทำงานอย่างไรในมุมมองของนักพัฒนา สิ่งที่เกณฑ์มาตรฐานของผู้จำหน่ายกล่าวถึง และการคำนวณราคา คู่มือนี้จะปิดท้ายด้วยขั้นตอนการทำงานสำหรับการทดสอบโมเดลกับข้อความแจ้งเตือนของคุณเองใน Apidog เพราะตารางเกณฑ์มาตรฐานเป็นเพียงจุดเริ่มต้น ไม่ใช่คำตัดสิน
สรุป
- DeepSeek-V4.1-Flash เปิดตัวสู่สาธารณะ (GA) ตั้งแต่วันที่ 10 กันยายน 2026 ID โมเดล:
deepseek-flash. URL พื้นฐานไม่เปลี่ยนแปลงที่https://api.deepseek.com. - MoE 552B (763B พร้อมวิชันเอนโค้ดเดอร์), 8B ใช้งานสำหรับการเติมล่วงหน้า, 16B ใช้งานสำหรับการถอดรหัส บริบท 1M, เอาต์พุตสูงสุด 384K.
- จากตัวเลขของ DeepSeek เอง มันดีกว่า V4-Pro ใน HumanEval, GSM8K, DeepSWE และ Terminal-Bench.
- ราคาช่วงพีค: $0.30 ต่ออินพุตที่แคชพลาด 1M, $1.20 ต่อเอาต์พุต 1M ช่วงนอกพีคคือครึ่งหนึ่งของราคาดังกล่าว.
- คำขอ V4-Pro จะถูกเปลี่ยนเส้นทางไปยัง V4.1-Flash ในวันที่ 14 กันยายน เวลา 04:00 UTC.
สิ่งที่เปิดตัวเมื่อวันที่ 10 กันยายน
DeepSeek ได้ทำการทดสอบเบต้าภายในเป็นเวลาสองวันตั้งแต่วันที่ 8 กันยายน ภายใต้ชื่อโมเดล deepseek-v4.1-flash-expires-on-0910 โดยจำกัดคำขอพร้อมกัน 20 คำขอต่อบัญชี และมีราคาเท่ากับ deepseek-v4-flash TechNode รายงานเกี่ยวกับการทดสอบเบต้านั้น สองวันต่อมา โมเดลก็เปิดตัวสู่สาธารณะ (GA) พร้อมด้วยรายการ บันทึกการเปลี่ยนแปลง ที่ลงวันที่ 2026-09-10 และประกาศบน X
การเปลี่ยนแปลงชื่อสามอย่างที่สำคัญสำหรับโค้ดของคุณ:
- ID โมเดลใหม่คือ
deepseek-flashใช้สำหรับการรวมระบบใหม่. - ชื่อเดิม
deepseek-v4-flashและdeepseek-v4-flash-vision-expยังคงใช้งานได้ แต่จะให้บริการโดย V4.1-Flash โดย V4-Flash และ V4-Flash-Vision-Exp ได้ถูกปลดประจำการในฐานะโมเดลแยกต่างหาก. deepseek-v4-proยังคงทำงานได้จนถึงวันที่ 14 กันยายน จากนั้นจะถูกส่งไปยัง V4.1-Flash.
URL พื้นฐานไม่ได้เปลี่ยนแปลง: https://api.deepseek.com สำหรับรูปแบบ OpenAI, https://api.deepseek.com/anthropic สำหรับรูปแบบ Anthropic Responses API ได้รับการสนับสนุนแล้วบนสายผลิตภัณฑ์ Flash ดังนั้นการรวมระบบแบบ Codex จึงยังคงใช้งานได้ สำหรับรายละเอียดพารามิเตอร์ รวมถึงการป้อนภาพและความพยายามในการให้เหตุผล โปรดดูที่ วิธีใช้ DeepSeek-V4.1-Flash API
สถาปัตยกรรม Causal Encoder-Decoder สำหรับนักพัฒนา
บัตรโมเดล อธิบายถึงการออกแบบที่ DeepSeek เรียกว่า Causal Encoder-Decoder หรือ CED นี่คือความหมายของแต่ละตัวเลขเมื่อคุณเป็นผู้จ่ายค่าโทเค็น
552 พันล้านพารามิเตอร์, 763 พันล้านพร้อมวิชัน. แกนหลักของภาษาคือโมเดล mixture-of-experts ขนาด 552 พันล้านพารามิเตอร์ เพิ่ม DeepSeek-ViT encoder ที่ฝึกอบรมใหม่ทั้งหมดสำหรับการเปิดตัวนี้ และโมเดลเต็มจะมีขนาด 763 พันล้านพารามิเตอร์ เหล่านี้คือพารามิเตอร์ที่เก็บไว้ ไม่ใช่ค่าใช้จ่ายของคำขอ
8 พันล้านใช้งานสำหรับการเติมล่วงหน้า, 16 พันล้านใช้งานสำหรับการถอดรหัส. นี่คือการเปลี่ยนแปลงที่สำคัญ 40 เลเยอร์ถูกแบ่งออกเป็น 20 เลเยอร์ของเอนโค้ดเดอร์ และ 20 เลเยอร์ของดีโค้ดเดอร์ การอ่านข้อความแจ้งเตือนของคุณ (เติมล่วงหน้า) จะเปิดใช้งานพารามิเตอร์ประมาณ 8 พันล้านต่อโทเค็น การเขียนคำตอบ (ถอดรหัส) จะเปิดใช้งานพารามิเตอร์ประมาณ 16 พันล้าน โมเดล DeepSeek MoE ก่อนหน้านี้ใช้ งบประมาณพารามิเตอร์ที่ใช้งานอยู่หนึ่งชุดสำหรับทั้งสองขั้นตอน
ทำไมการแยกส่วนนี้ถึงสำคัญ? การเติมล่วงหน้าถูกจำกัดด้วยการคำนวณ: คุณป้อนเอกสารขนาด 200K โทเค็นผ่านโมเดลในการส่งครั้งเดียว การถอดรหัสถูกจำกัดด้วยหน่วยความจำ: คุณสร้างโทเค็นทีละตัว และค่าใช้จ่ายคือการอ่านน้ำหนักและการแคช KV จาก HBM จำนวนพารามิเตอร์ที่น้อยลงในการเติมล่วงหน้าช่วยลดเวลาในการสร้างโทเค็นแรกสำหรับอินพุตที่ยาวขึ้น การใช้พารามิเตอร์มากขึ้นในการถอดรหัสช่วยเพิ่มคุณภาพของคำตอบ โดยที่การคำนวณพิเศษมีราคาถูกเมื่อเทียบกับการใช้งานหน่วยความจำ การติดตามของเอเจนต์ที่มีบริบท 1M ที่สร้างการตอบกลับขนาด 2K โทเค็น จะใช้เส้นทางที่ประหยัดกว่าสำหรับ 99.8% ของโทเค็น
ผู้เชี่ยวชาญที่ถูกกำหนดเส้นทาง 384 คน บวกกับผู้เชี่ยวชาญที่ใช้ร่วมกัน 1 คนต่อเลเยอร์. เราเตอร์จะเลือกผู้เชี่ยวชาญสองสามคนจาก 384 คนต่อโทเค็น และผู้เชี่ยวชาญที่ใช้ร่วมกันจะทำงานทุกครั้ง นั่นคือวิธีที่ 552 พันล้านพารามิเตอร์ที่เก็บไว้กลายเป็น 8 พันล้านหรือ 16 พันล้านที่ใช้งานอยู่
CSA2 และแคช FP4 KV. Compressed Sparse Attention 2 มาพร้อมกับโหมดความสนใจแบบคงที่สามโหมด เมื่อจับคู่กับการจัดเก็บ FP4 สำหรับแคช KV หลัก รอยเท้าแคชทั่วโลกคือ 890 ไบต์ต่อโทเค็น ซึ่งประมาณหนึ่งในสี่ของ DeepSeek-V4-Flash บันทึกการเปิดตัวระบุว่าเป็น 1/4 ของ HBM และ 1/8 ของพื้นที่เก็บข้อมูล SSD ของรุ่นก่อนหน้า ที่ 890 ไบต์ต่อโทเค็น บริบท 1M โทเค็นเต็มต้องการแคช KV ประมาณ 0.9 GB นั่นคือส่วนหนึ่งที่ทำให้ขีดจำกัดการทำงานพร้อมกันอยู่ที่ 2,500 สำหรับ Flash เทียบกับ 500 สำหรับ Pro
บริบท 1M, เอาต์พุต 384K. การให้ความสนใจแบบสปาร์สได้รับการฝึกฝนที่ 64K และขยายเป็น 1M ที่เครื่องหมาย 34T โทเค็นของชุดข้อมูล multimodal ขนาด 45T โทเค็น ความพยายามในการให้เหตุผลถูกอธิบายว่าสามารถควบคุมได้อย่างต่อเนื่องในระดับ 1 ถึง 100; รูปแบบพารามิเตอร์ API ที่แน่นอนสำหรับมาตราส่วนนั้นคือ [ตรวจสอบ] กับเอกสาร
เกณฑ์มาตรฐาน: สิ่งที่ DeepSeek รายงาน
ทุกตัวเลขในส่วนนี้เป็นข้อมูลที่ DeepSeek รายงานจากบัตรโมเดล ยังไม่มีการประเมินอิสระเผยแพร่ ณ วันที่ 10 กันยายน โปรดอ่านข้อมูลเหล่านี้ในฐานะคำกล่าวอ้างของผู้จำหน่าย แล้วทำการทดสอบของคุณเอง

รูปแบบมีความสอดคล้องกัน: V4.1-Flash อยู่เหนือ V4-Pro ในทุกแถว โดยมีช่องว่างที่กว้างที่สุดในการเขียนโค้ดแบบเอเจนต์ DeepSWE เพิ่มขึ้น 11.5 คะแนนเหนือ Pro และเกือบ 20 คะแนนเหนือ Flash รุ่นเก่า GSM8K อิ่มตัวแล้ว ดังนั้นข้อได้เปรียบ 0.4 คะแนนจึงบอกอะไรคุณได้ไม่มาก
คะแนนวิชัน ซึ่งรายงานโดยผู้จำหน่ายอีกครั้ง: MMMU-Pro 56.5, CVBench 77.9, DocVQA 95.6, RefCOCO 86.0 DocVQA เป็นตัวเลขที่น่าจับตา เนื่องจากเป็นส่วนที่การประมวลผลเอกสารส่วนใหญ่เกิดขึ้น
DeepSeek นำเสนอการเปลี่ยนเส้นทาง V4-Pro โดยระบุว่า V4.1-Flash "ได้แซงหน้า V4 Pro อย่างครอบคลุมในด้านประสิทธิภาพ, ต้นทุน, ความเร็ว และเวลาทั้งหมด" โดยอ้างอิงจากการทดสอบโดยหลายฝ่าย ไม่มีการระบุชื่อฝ่ายเหล่านั้น โปรดถือว่าประโยคนั้นเป็นข้ออ้างที่คุณสามารถตรวจสอบได้
ราคาและการเปลี่ยนเส้นทาง V4-Pro
อัตราด้านล่างนี้มาจาก หน้าการกำหนดราคา มีผลตั้งแต่วันที่ 10 กันยายน เวลา 04:00 UTC ในสกุลเงินดอลลาร์สหรัฐฯ ต่อ 1M โทเค็น
| deepseek-flash นอกช่วงพีค | deepseek-flash ช่วงพีค | deepseek-v4-pro นอกช่วงพีค | deepseek-v4-pro ช่วงพีค | |
|---|---|---|---|---|
| อินพุต, แคช hit | $0.003 | $0.006 | $0.022 | $0.044 |
| อินพุต, แคช miss | $0.15 | $0.30 | $0.66 | $1.32 |
| เอาต์พุต | $0.60 | $1.20 | $1.98 | $3.96 |
ช่วงเวลาพีคคือ 01:00 ถึง 04:00 และ 06:00 ถึง 10:00 UTC ในวันธรรมดา; ช่วงนอกพีคคือ 50% ของช่วงพีค การแคชบริบทเป็นแบบอัตโนมัติ และการแคช hit มีค่าใช้จ่ายน้อยกว่าการแคช miss ถึง 50 เท่าในแต่ละระดับ
เมื่อเทียบกับอัตราของ V4-Flash ในเดือนสิงหาคม V4.1-Flash ลดอินพุตแบบ cache-hit ลงประมาณ 57%, อินพุตแบบ cache-miss ลงประมาณ 32% และเอาต์พุตลงประมาณ 9%
คอลัมน์ V4-Pro เป็นสิ่งที่คุณต้องจับตามอง หลังจากวันที่ 14 กันยายน คำขอที่ส่งไปยัง deepseek-v4-pro จะถูกคิดค่าบริการตามคอลัมน์ Flash ในช่วงพีค นั่นคือ $0.30 แทนที่จะเป็น $1.32 ต่อ 1M อินพุตที่แคชพลาด (ลดลง 77%) และ $1.20 แทนที่จะเป็น $3.96 ต่อ 1M เอาต์พุต (ลดลง 70%) คุณจะได้รับการลดราคาโดยไม่ต้องแตะโค้ดเลย แม้ว่าคุณควรจะอัปเดต ID โมเดลอยู่ดี แทนที่จะพึ่งพาชื่อที่เลิกใช้แล้ว คู่มือการย้ายข้อมูล จะอธิบายรายการตรวจสอบโดยละเอียด และ การเจาะลึกราคา จะครอบคลุมการคำนวณ cache-hit สำหรับเซสชันเอเจนต์ที่ยาวนาน
ประเมิน V4.1-Flash ด้วยข้อความแจ้งเตือนของคุณเองใน Apidog
ตารางของผู้จำหน่ายระบุว่าโมเดลนี้เก่งใน DeepSWE แต่ไม่ได้ระบุว่าโมเดลสามารถจัดการกับ schema การสกัดข้อมูลของคุณ, รูปแบบการเรียกใช้เครื่องมือของคุณ หรือบันทึกการสนับสนุนขนาด 300K โทเค็นของคุณได้หรือไม่ นี่คือขั้นตอนการทำงานใน Apidog ที่จะตอบคำถามเหล่านั้นได้ในบ่ายวันเดียว และยังคงตอบคำถามเหล่านั้นต่อไปหลังจากทุกการอัปเดตโมเดลแบบเงียบ
- จัดเก็บคีย์เป็นตัวแปรสภาพแวดล้อม. สร้างสภาพแวดล้อม Apidog และเพิ่ม
DEEPSEEK_API_KEYจาก แพลตฟอร์ม DeepSeek อ้างอิงในส่วนหัว Authorization เป็นBearer {{DEEPSEEK_API_KEY}}. - เพิ่มปลายทาง. สร้าง
POST https://api.deepseek.com/chat/completionsหรือนำเข้าข้อมูลจำเพาะ OpenAPI. - บันทึกคำขอหนึ่งรายการต่อข้อความแจ้งเตือนจริง. นำข้อความแจ้งเตือนห้าถึงสิบรายการจากบันทึกการผลิต และบันทึกแต่ละรายการเป็นคำขอของตนเองด้วย
"model": "deepseek-flash"เก็บสำเนาที่ชี้ไปยังdeepseek-v4-proจนถึงวันที่ 14 เพื่อให้คุณสามารถเปรียบเทียบเอาต์พุตได้. - สตรีมและดูเหตุการณ์. ตั้งค่า
"stream": trueApidog จะแสดงผลการตอบกลับ SSE ทีละเหตุการณ์ ดังนั้นความแตกต่างของการให้เหตุผลและความแตกต่างของคำตอบจะแสดงแยกกัน แทนที่จะเป็นกำแพงของบรรทัดdata:เป็นวิธีที่เร็วที่สุดในการดูเวลาในการสร้างโทเค็นแรกในการเติมล่วงหน้าที่มีความยาว. - เพิ่มการยืนยันและสร้างสถานการณ์การทดสอบ. ยืนยันรหัสสถานะ, ในช่อง
tool_callsที่คุณคาดหวัง, และความถูกต้องของ JSON ของเอาต์พุต เชื่อมโยงคำขอที่บันทึกไว้เข้ากับสถานการณ์การทดสอบ. - เรียกใช้ใหม่ทุกครั้งที่อัปเดตโมเดล. เมื่อ DeepSeek ผลักดันการเปลี่ยนแปลงครั้งต่อไปเบื้องหลัง
deepseek-flashให้เรียกใช้สถานการณ์นี้ เชื่อมโยงเข้ากับ CI ด้วยapidog-cliเพื่อให้ทำงานในการปรับใช้ทุกครั้ง.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "system", "content": "Extract the order ID, SKU list, and refund amount as JSON."},
{"role": "user", "content": "Ticket #48213: customer wants a refund of $42.90 for SKUs KB-220 and MS-114 from order ORD-99117."},
],
stream=True,
)
for chunk in response:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
ดาวน์โหลด Apidog และวางส่วนเนื้อหานั้นลงในคำขอที่บันทึกไว้ Apidog จะทดสอบเลเยอร์ API ไม่ใช่โฮสต์โมเดล ดังนั้นสิ่งที่คุณเห็นคือการตอบสนองที่ผู้ใช้ของคุณจะได้รับ
คำถามที่พบบ่อย
DeepSeek-V4.1-Flash เป็นตัวแทนของ V4-Pro หรือไม่? ใช่ ตามการตัดสินใจของ DeepSeek ตั้งแต่วันที่ 14 กันยายน เวลา 04:00 UTC คำขอ deepseek-v4-pro จะให้บริการโดย V4.1-Flash ในราคา Flash ไม่มีโมเดลที่ใหญ่กว่าเหลืออยู่ในกลุ่มผลิตภัณฑ์ V4 API อีกต่อไป
ฉันจำเป็นต้องเปลี่ยน ID โมเดลหรือไม่? ไม่จำเป็นทันที deepseek-v4-flash, deepseek-v4-flash-vision-exp และ (หลังวันที่ 14) deepseek-v4-pro ทั้งหมดจะถูกส่งไปยัง V4.1-Flash เปลี่ยนไปใช้ deepseek-flash เมื่อคุณแก้ไขการรวมระบบครั้งต่อไป คู่มือ API มีการอ้างอิงพารามิเตอร์ทั้งหมด
8 พันล้านสำหรับเติมล่วงหน้า / 16 พันล้านสำหรับการถอดรหัส หมายถึงอะไรสำหรับความหน่วง? พารามิเตอร์ที่ทำงานอยู่บนอินพุตที่น้อยลงหมายถึงเวลาในการสร้างโทเค็นแรกที่เร็วขึ้นสำหรับข้อความแจ้งเตือนที่ยาวขึ้น พารามิเตอร์ที่มากขึ้นสำหรับเอาต์พุตหมายถึงการประมวลผลถูกนำไปใช้ในจุดที่คุณภาพของการสร้างถูกกำหนด แคช KV ขนาด 890 ไบต์ต่อโทเค็นช่วยให้เซสชันที่ยาวนานมีค่าใช้จ่ายในการเก็บไว้ในหน่วยความจำต่ำ
ฉันสามารถเรียกใช้แบบโลคัลได้หรือไม่? น้ำหนักโมเดลอยู่ภายใต้ใบอนุญาต MIT บน Hugging Face แกนหลักเพียงอย่างเดียวมีขนาดประมาณ 552 GB ที่ 8 บิต หรือ 280 GB ที่ 4 บิต ดังนั้นนี่จึงเป็นโครงการที่ต้องใช้ multi-GPU หรือการสตรีมจาก SSD ไม่ใช่โปรเจกต์สำหรับแล็ปท็อป การรองรับเอ็นจิ้นการอนุมานตั้งแต่วันแรกคือ [ตรวจสอบ]
เกณฑ์มาตรฐานเป็นอิสระหรือไม่? ไม่ใช่ ทุกคะแนนข้างต้นมาจากบัตรโมเดลของ DeepSeek รายงานทางเทคนิค มีระเบียบวิธี
ผลกระทบต่อสายผลิตภัณฑ์ V4
DeepSeek ได้รวม API สองโมเดลเข้าเป็นหนึ่งเดียว การเดิมพันคือโมเดล 552B ที่มีงบประมาณการถอดรหัส 16B, แคช KV ขนาดหนึ่งในสี่ และเซสชันพร้อมกัน 2,500 ครั้งต่อบัญชี จะให้บริการเวิร์กโหลดของเอเจนต์ได้ดีกว่าโมเดลที่ใหญ่กว่าในราคาที่สูงกว่าสามถึงสี่เท่า ตัวเลขของผู้จำหน่ายสนับสนุนการเดิมพันนี้; เวิร์กโหลดของคุณจะเป็นตัวตัดสินว่ามันจริงหรือไม่
ชี้ SDK ของคุณไปที่ deepseek-flash เรียกใช้ข้อความแจ้งเตือนของคุณเองผ่านโมเดลก่อนวันที่ 14 และเก็บสถานการณ์การทดสอบไว้ หากคุณพัฒนาบน DeepSeek-V4-Flash API ดั้งเดิม การรวมระบบของคุณก็ยังคงใช้งานได้ สิ่งที่เปลี่ยนแปลงคือโมเดลที่อยู่เบื้องหลัง และนั่นคือส่วนที่ควรค่าแก่การวัดผล
