DeepSeek-V4.1-Flash คืออะไร

DeepSeek-V4.1-Flash อธิบายเกี่ยวกับ: การออกแบบ Encoder-Decoder แบบ Causal, พารามิเตอร์ที่ใช้งาน 8 พันล้าน/16 พันล้าน, เกณฑ์มาตรฐานของผู้จำหน่าย, ราคา, และเหตุผลที่ V4-Pro จะเปลี่ยนเส้นทางมาใช้งานรุ่นนี้ในวันที่ 14 กันยายน

Ashley Innocent

Ashley Innocent

10 September 2026

DeepSeek-V4.1-Flash คืออะไร

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

DeepSeek ได้ปลดประจำการเรือธงด้วยโมเดลที่เล็กที่สุด เมื่อวันที่ 10 กันยายน 2026, DeepSeek-V4.1-Flash ได้เปิดตัวสู่สาธารณะ (GA) บน API และ บันทึกการเปิดตัว มีข้อความที่ห้องปฏิบัติการส่วนใหญ่จะซ่อนไว้: เริ่มตั้งแต่วันที่ 14 กันยายน ทุกคำขอไปยัง deepseek-v4-pro จะถูกส่งไปยัง V4.1-Flash และคิดค่าบริการตามราคา Flash โมเดล Flash ขนาด 552 พันล้านพารามิเตอร์ ซึ่งมี 8 พันล้านพารามิเตอร์ที่ทำงานอยู่เมื่อป้อนข้อมูล จะทำหน้าที่ตอบสนองตระกูล V4 ทั้งหมด

นั่นคือเบื้องหลังการค้นหา "deepseek v4.1 flash" ในสัปดาห์นี้ และมันสำคัญด้วยสองเหตุผล ประการแรก สถาปัตยกรรมใหม่ การแยกส่วน Causal Encoder-Decoder, การแคช FP4 KV ที่ 890 ไบต์ต่อโทเค็น และความสามารถในการมองเห็นแบบเนทีฟตั้งแต่ขั้นตอนการฝึกอบรมล่วงหน้าครั้งแรก ไม่ใช่การเปลี่ยนแปลงเล็กน้อยสำหรับ DeepSeek V4 ประการที่สอง ตารางราคาเปลี่ยนแปลงไปพร้อมกัน หากคุณกำลังจ่ายในอัตรา V4-Pro บิลของคุณจะลดลง 70% หรือมากกว่าในวันที่ 14 ไม่ว่าคุณจะเปลี่ยนแปลงอะไรหรือไม่ก็ตาม

คู่มือนี้จะครอบคลุมสิ่งที่เปิดตัว สถาปัตยกรรมทำงานอย่างไรในมุมมองของนักพัฒนา สิ่งที่เกณฑ์มาตรฐานของผู้จำหน่ายกล่าวถึง และการคำนวณราคา คู่มือนี้จะปิดท้ายด้วยขั้นตอนการทำงานสำหรับการทดสอบโมเดลกับข้อความแจ้งเตือนของคุณเองใน Apidog เพราะตารางเกณฑ์มาตรฐานเป็นเพียงจุดเริ่มต้น ไม่ใช่คำตัดสิน

สรุป

สิ่งที่เปิดตัวเมื่อวันที่ 10 กันยายน

DeepSeek ได้ทำการทดสอบเบต้าภายในเป็นเวลาสองวันตั้งแต่วันที่ 8 กันยายน ภายใต้ชื่อโมเดล deepseek-v4.1-flash-expires-on-0910 โดยจำกัดคำขอพร้อมกัน 20 คำขอต่อบัญชี และมีราคาเท่ากับ deepseek-v4-flash TechNode รายงานเกี่ยวกับการทดสอบเบต้านั้น สองวันต่อมา โมเดลก็เปิดตัวสู่สาธารณะ (GA) พร้อมด้วยรายการ บันทึกการเปลี่ยนแปลง ที่ลงวันที่ 2026-09-10 และประกาศบน X

การเปลี่ยนแปลงชื่อสามอย่างที่สำคัญสำหรับโค้ดของคุณ:

URL พื้นฐานไม่ได้เปลี่ยนแปลง: https://api.deepseek.com สำหรับรูปแบบ OpenAI, https://api.deepseek.com/anthropic สำหรับรูปแบบ Anthropic Responses API ได้รับการสนับสนุนแล้วบนสายผลิตภัณฑ์ Flash ดังนั้นการรวมระบบแบบ Codex จึงยังคงใช้งานได้ สำหรับรายละเอียดพารามิเตอร์ รวมถึงการป้อนภาพและความพยายามในการให้เหตุผล โปรดดูที่ วิธีใช้ DeepSeek-V4.1-Flash API

สถาปัตยกรรม Causal Encoder-Decoder สำหรับนักพัฒนา

บัตรโมเดล อธิบายถึงการออกแบบที่ DeepSeek เรียกว่า Causal Encoder-Decoder หรือ CED นี่คือความหมายของแต่ละตัวเลขเมื่อคุณเป็นผู้จ่ายค่าโทเค็น

552 พันล้านพารามิเตอร์, 763 พันล้านพร้อมวิชัน. แกนหลักของภาษาคือโมเดล mixture-of-experts ขนาด 552 พันล้านพารามิเตอร์ เพิ่ม DeepSeek-ViT encoder ที่ฝึกอบรมใหม่ทั้งหมดสำหรับการเปิดตัวนี้ และโมเดลเต็มจะมีขนาด 763 พันล้านพารามิเตอร์ เหล่านี้คือพารามิเตอร์ที่เก็บไว้ ไม่ใช่ค่าใช้จ่ายของคำขอ

8 พันล้านใช้งานสำหรับการเติมล่วงหน้า, 16 พันล้านใช้งานสำหรับการถอดรหัส. นี่คือการเปลี่ยนแปลงที่สำคัญ 40 เลเยอร์ถูกแบ่งออกเป็น 20 เลเยอร์ของเอนโค้ดเดอร์ และ 20 เลเยอร์ของดีโค้ดเดอร์ การอ่านข้อความแจ้งเตือนของคุณ (เติมล่วงหน้า) จะเปิดใช้งานพารามิเตอร์ประมาณ 8 พันล้านต่อโทเค็น การเขียนคำตอบ (ถอดรหัส) จะเปิดใช้งานพารามิเตอร์ประมาณ 16 พันล้าน โมเดล DeepSeek MoE ก่อนหน้านี้ใช้ งบประมาณพารามิเตอร์ที่ใช้งานอยู่หนึ่งชุดสำหรับทั้งสองขั้นตอน

ทำไมการแยกส่วนนี้ถึงสำคัญ? การเติมล่วงหน้าถูกจำกัดด้วยการคำนวณ: คุณป้อนเอกสารขนาด 200K โทเค็นผ่านโมเดลในการส่งครั้งเดียว การถอดรหัสถูกจำกัดด้วยหน่วยความจำ: คุณสร้างโทเค็นทีละตัว และค่าใช้จ่ายคือการอ่านน้ำหนักและการแคช KV จาก HBM จำนวนพารามิเตอร์ที่น้อยลงในการเติมล่วงหน้าช่วยลดเวลาในการสร้างโทเค็นแรกสำหรับอินพุตที่ยาวขึ้น การใช้พารามิเตอร์มากขึ้นในการถอดรหัสช่วยเพิ่มคุณภาพของคำตอบ โดยที่การคำนวณพิเศษมีราคาถูกเมื่อเทียบกับการใช้งานหน่วยความจำ การติดตามของเอเจนต์ที่มีบริบท 1M ที่สร้างการตอบกลับขนาด 2K โทเค็น จะใช้เส้นทางที่ประหยัดกว่าสำหรับ 99.8% ของโทเค็น

ผู้เชี่ยวชาญที่ถูกกำหนดเส้นทาง 384 คน บวกกับผู้เชี่ยวชาญที่ใช้ร่วมกัน 1 คนต่อเลเยอร์. เราเตอร์จะเลือกผู้เชี่ยวชาญสองสามคนจาก 384 คนต่อโทเค็น และผู้เชี่ยวชาญที่ใช้ร่วมกันจะทำงานทุกครั้ง นั่นคือวิธีที่ 552 พันล้านพารามิเตอร์ที่เก็บไว้กลายเป็น 8 พันล้านหรือ 16 พันล้านที่ใช้งานอยู่

CSA2 และแคช FP4 KV. Compressed Sparse Attention 2 มาพร้อมกับโหมดความสนใจแบบคงที่สามโหมด เมื่อจับคู่กับการจัดเก็บ FP4 สำหรับแคช KV หลัก รอยเท้าแคชทั่วโลกคือ 890 ไบต์ต่อโทเค็น ซึ่งประมาณหนึ่งในสี่ของ DeepSeek-V4-Flash บันทึกการเปิดตัวระบุว่าเป็น 1/4 ของ HBM และ 1/8 ของพื้นที่เก็บข้อมูล SSD ของรุ่นก่อนหน้า ที่ 890 ไบต์ต่อโทเค็น บริบท 1M โทเค็นเต็มต้องการแคช KV ประมาณ 0.9 GB นั่นคือส่วนหนึ่งที่ทำให้ขีดจำกัดการทำงานพร้อมกันอยู่ที่ 2,500 สำหรับ Flash เทียบกับ 500 สำหรับ Pro

บริบท 1M, เอาต์พุต 384K. การให้ความสนใจแบบสปาร์สได้รับการฝึกฝนที่ 64K และขยายเป็น 1M ที่เครื่องหมาย 34T โทเค็นของชุดข้อมูล multimodal ขนาด 45T โทเค็น ความพยายามในการให้เหตุผลถูกอธิบายว่าสามารถควบคุมได้อย่างต่อเนื่องในระดับ 1 ถึง 100; รูปแบบพารามิเตอร์ API ที่แน่นอนสำหรับมาตราส่วนนั้นคือ [ตรวจสอบ] กับเอกสาร

เกณฑ์มาตรฐาน: สิ่งที่ DeepSeek รายงาน

ทุกตัวเลขในส่วนนี้เป็นข้อมูลที่ DeepSeek รายงานจากบัตรโมเดล ยังไม่มีการประเมินอิสระเผยแพร่ ณ วันที่ 10 กันยายน โปรดอ่านข้อมูลเหล่านี้ในฐานะคำกล่าวอ้างของผู้จำหน่าย แล้วทำการทดสอบของคุณเอง

รูปแบบมีความสอดคล้องกัน: V4.1-Flash อยู่เหนือ V4-Pro ในทุกแถว โดยมีช่องว่างที่กว้างที่สุดในการเขียนโค้ดแบบเอเจนต์ DeepSWE เพิ่มขึ้น 11.5 คะแนนเหนือ Pro และเกือบ 20 คะแนนเหนือ Flash รุ่นเก่า GSM8K อิ่มตัวแล้ว ดังนั้นข้อได้เปรียบ 0.4 คะแนนจึงบอกอะไรคุณได้ไม่มาก

คะแนนวิชัน ซึ่งรายงานโดยผู้จำหน่ายอีกครั้ง: MMMU-Pro 56.5, CVBench 77.9, DocVQA 95.6, RefCOCO 86.0 DocVQA เป็นตัวเลขที่น่าจับตา เนื่องจากเป็นส่วนที่การประมวลผลเอกสารส่วนใหญ่เกิดขึ้น

DeepSeek นำเสนอการเปลี่ยนเส้นทาง V4-Pro โดยระบุว่า V4.1-Flash "ได้แซงหน้า V4 Pro อย่างครอบคลุมในด้านประสิทธิภาพ, ต้นทุน, ความเร็ว และเวลาทั้งหมด" โดยอ้างอิงจากการทดสอบโดยหลายฝ่าย ไม่มีการระบุชื่อฝ่ายเหล่านั้น โปรดถือว่าประโยคนั้นเป็นข้ออ้างที่คุณสามารถตรวจสอบได้

ราคาและการเปลี่ยนเส้นทาง V4-Pro

อัตราด้านล่างนี้มาจาก หน้าการกำหนดราคา มีผลตั้งแต่วันที่ 10 กันยายน เวลา 04:00 UTC ในสกุลเงินดอลลาร์สหรัฐฯ ต่อ 1M โทเค็น

deepseek-flash นอกช่วงพีค deepseek-flash ช่วงพีค deepseek-v4-pro นอกช่วงพีค deepseek-v4-pro ช่วงพีค
อินพุต, แคช hit $0.003 $0.006 $0.022 $0.044
อินพุต, แคช miss $0.15 $0.30 $0.66 $1.32
เอาต์พุต $0.60 $1.20 $1.98 $3.96

ช่วงเวลาพีคคือ 01:00 ถึง 04:00 และ 06:00 ถึง 10:00 UTC ในวันธรรมดา; ช่วงนอกพีคคือ 50% ของช่วงพีค การแคชบริบทเป็นแบบอัตโนมัติ และการแคช hit มีค่าใช้จ่ายน้อยกว่าการแคช miss ถึง 50 เท่าในแต่ละระดับ

เมื่อเทียบกับอัตราของ V4-Flash ในเดือนสิงหาคม V4.1-Flash ลดอินพุตแบบ cache-hit ลงประมาณ 57%, อินพุตแบบ cache-miss ลงประมาณ 32% และเอาต์พุตลงประมาณ 9%

คอลัมน์ V4-Pro เป็นสิ่งที่คุณต้องจับตามอง หลังจากวันที่ 14 กันยายน คำขอที่ส่งไปยัง deepseek-v4-pro จะถูกคิดค่าบริการตามคอลัมน์ Flash ในช่วงพีค นั่นคือ $0.30 แทนที่จะเป็น $1.32 ต่อ 1M อินพุตที่แคชพลาด (ลดลง 77%) และ $1.20 แทนที่จะเป็น $3.96 ต่อ 1M เอาต์พุต (ลดลง 70%) คุณจะได้รับการลดราคาโดยไม่ต้องแตะโค้ดเลย แม้ว่าคุณควรจะอัปเดต ID โมเดลอยู่ดี แทนที่จะพึ่งพาชื่อที่เลิกใช้แล้ว คู่มือการย้ายข้อมูล จะอธิบายรายการตรวจสอบโดยละเอียด และ การเจาะลึกราคา จะครอบคลุมการคำนวณ cache-hit สำหรับเซสชันเอเจนต์ที่ยาวนาน

ประเมิน V4.1-Flash ด้วยข้อความแจ้งเตือนของคุณเองใน Apidog

ตารางของผู้จำหน่ายระบุว่าโมเดลนี้เก่งใน DeepSWE แต่ไม่ได้ระบุว่าโมเดลสามารถจัดการกับ schema การสกัดข้อมูลของคุณ, รูปแบบการเรียกใช้เครื่องมือของคุณ หรือบันทึกการสนับสนุนขนาด 300K โทเค็นของคุณได้หรือไม่ นี่คือขั้นตอนการทำงานใน Apidog ที่จะตอบคำถามเหล่านั้นได้ในบ่ายวันเดียว และยังคงตอบคำถามเหล่านั้นต่อไปหลังจากทุกการอัปเดตโมเดลแบบเงียบ

  1. จัดเก็บคีย์เป็นตัวแปรสภาพแวดล้อม. สร้างสภาพแวดล้อม Apidog และเพิ่ม DEEPSEEK_API_KEY จาก แพลตฟอร์ม DeepSeek อ้างอิงในส่วนหัว Authorization เป็น Bearer {{DEEPSEEK_API_KEY}}.
  2. เพิ่มปลายทาง. สร้าง POST https://api.deepseek.com/chat/completions หรือนำเข้าข้อมูลจำเพาะ OpenAPI.
  3. บันทึกคำขอหนึ่งรายการต่อข้อความแจ้งเตือนจริง. นำข้อความแจ้งเตือนห้าถึงสิบรายการจากบันทึกการผลิต และบันทึกแต่ละรายการเป็นคำขอของตนเองด้วย "model": "deepseek-flash" เก็บสำเนาที่ชี้ไปยัง deepseek-v4-pro จนถึงวันที่ 14 เพื่อให้คุณสามารถเปรียบเทียบเอาต์พุตได้.
  4. สตรีมและดูเหตุการณ์. ตั้งค่า "stream": true Apidog จะแสดงผลการตอบกลับ SSE ทีละเหตุการณ์ ดังนั้นความแตกต่างของการให้เหตุผลและความแตกต่างของคำตอบจะแสดงแยกกัน แทนที่จะเป็นกำแพงของบรรทัด data: เป็นวิธีที่เร็วที่สุดในการดูเวลาในการสร้างโทเค็นแรกในการเติมล่วงหน้าที่มีความยาว.
  5. เพิ่มการยืนยันและสร้างสถานการณ์การทดสอบ. ยืนยันรหัสสถานะ, ในช่อง tool_calls ที่คุณคาดหวัง, และความถูกต้องของ JSON ของเอาต์พุต เชื่อมโยงคำขอที่บันทึกไว้เข้ากับสถานการณ์การทดสอบ.
  6. เรียกใช้ใหม่ทุกครั้งที่อัปเดตโมเดล. เมื่อ DeepSeek ผลักดันการเปลี่ยนแปลงครั้งต่อไปเบื้องหลัง deepseek-flash ให้เรียกใช้สถานการณ์นี้ เชื่อมโยงเข้ากับ CI ด้วย apidog-cli เพื่อให้ทำงานในการปรับใช้ทุกครั้ง.
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "system", "content": "Extract the order ID, SKU list, and refund amount as JSON."},
        {"role": "user", "content": "Ticket #48213: customer wants a refund of $42.90 for SKUs KB-220 and MS-114 from order ORD-99117."},
    ],
    stream=True,
)

for chunk in response:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

ดาวน์โหลด Apidog และวางส่วนเนื้อหานั้นลงในคำขอที่บันทึกไว้ Apidog จะทดสอบเลเยอร์ API ไม่ใช่โฮสต์โมเดล ดังนั้นสิ่งที่คุณเห็นคือการตอบสนองที่ผู้ใช้ของคุณจะได้รับ

คำถามที่พบบ่อย

DeepSeek-V4.1-Flash เป็นตัวแทนของ V4-Pro หรือไม่? ใช่ ตามการตัดสินใจของ DeepSeek ตั้งแต่วันที่ 14 กันยายน เวลา 04:00 UTC คำขอ deepseek-v4-pro จะให้บริการโดย V4.1-Flash ในราคา Flash ไม่มีโมเดลที่ใหญ่กว่าเหลืออยู่ในกลุ่มผลิตภัณฑ์ V4 API อีกต่อไป

ฉันจำเป็นต้องเปลี่ยน ID โมเดลหรือไม่? ไม่จำเป็นทันที deepseek-v4-flash, deepseek-v4-flash-vision-exp และ (หลังวันที่ 14) deepseek-v4-pro ทั้งหมดจะถูกส่งไปยัง V4.1-Flash เปลี่ยนไปใช้ deepseek-flash เมื่อคุณแก้ไขการรวมระบบครั้งต่อไป คู่มือ API มีการอ้างอิงพารามิเตอร์ทั้งหมด

8 พันล้านสำหรับเติมล่วงหน้า / 16 พันล้านสำหรับการถอดรหัส หมายถึงอะไรสำหรับความหน่วง? พารามิเตอร์ที่ทำงานอยู่บนอินพุตที่น้อยลงหมายถึงเวลาในการสร้างโทเค็นแรกที่เร็วขึ้นสำหรับข้อความแจ้งเตือนที่ยาวขึ้น พารามิเตอร์ที่มากขึ้นสำหรับเอาต์พุตหมายถึงการประมวลผลถูกนำไปใช้ในจุดที่คุณภาพของการสร้างถูกกำหนด แคช KV ขนาด 890 ไบต์ต่อโทเค็นช่วยให้เซสชันที่ยาวนานมีค่าใช้จ่ายในการเก็บไว้ในหน่วยความจำต่ำ

ฉันสามารถเรียกใช้แบบโลคัลได้หรือไม่? น้ำหนักโมเดลอยู่ภายใต้ใบอนุญาต MIT บน Hugging Face แกนหลักเพียงอย่างเดียวมีขนาดประมาณ 552 GB ที่ 8 บิต หรือ 280 GB ที่ 4 บิต ดังนั้นนี่จึงเป็นโครงการที่ต้องใช้ multi-GPU หรือการสตรีมจาก SSD ไม่ใช่โปรเจกต์สำหรับแล็ปท็อป การรองรับเอ็นจิ้นการอนุมานตั้งแต่วันแรกคือ [ตรวจสอบ]

เกณฑ์มาตรฐานเป็นอิสระหรือไม่? ไม่ใช่ ทุกคะแนนข้างต้นมาจากบัตรโมเดลของ DeepSeek รายงานทางเทคนิค มีระเบียบวิธี

ผลกระทบต่อสายผลิตภัณฑ์ V4

DeepSeek ได้รวม API สองโมเดลเข้าเป็นหนึ่งเดียว การเดิมพันคือโมเดล 552B ที่มีงบประมาณการถอดรหัส 16B, แคช KV ขนาดหนึ่งในสี่ และเซสชันพร้อมกัน 2,500 ครั้งต่อบัญชี จะให้บริการเวิร์กโหลดของเอเจนต์ได้ดีกว่าโมเดลที่ใหญ่กว่าในราคาที่สูงกว่าสามถึงสี่เท่า ตัวเลขของผู้จำหน่ายสนับสนุนการเดิมพันนี้; เวิร์กโหลดของคุณจะเป็นตัวตัดสินว่ามันจริงหรือไม่

ชี้ SDK ของคุณไปที่ deepseek-flash เรียกใช้ข้อความแจ้งเตือนของคุณเองผ่านโมเดลก่อนวันที่ 14 และเก็บสถานการณ์การทดสอบไว้ หากคุณพัฒนาบน DeepSeek-V4-Flash API ดั้งเดิม การรวมระบบของคุณก็ยังคงใช้งานได้ สิ่งที่เปลี่ยนแปลงคือโมเดลที่อยู่เบื้องหลัง และนั่นคือส่วนที่ควรค่าแก่การวัดผล

button

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API