วิธีรัน DeepSeek-V4.1-Flash แบบโลคอล

คุณสามารถรัน DeepSeek-V4.1-Flash บนเครื่องของคุณเองได้หรือไม่? การคำนวณหน่วยความจำสำหรับน้ำหนักโมเดล 552B MIT, แคช FP4 KV ขนาด 890 ไบต์, ระดับฮาร์ดแวร์ที่เป็นไปได้ และคำสั่งการตั้งค่า

Medy Evrard

10 September 2026

วิธีรัน DeepSeek-V4.1-Flash แบบโลคอล

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

DeepSeek ได้เผยแพร่น้ำหนักโมเดล DeepSeek-V4.1-Flash บน Hugging Face ภายใต้ใบอนุญาต MIT เมื่อวันที่ 10 กันยายน 2026 ซึ่งเป็นวันเดียวกับที่โมเดลเปิดให้บริการทั่วไป (GA) บน API นี่เป็นช่วงเวลาที่ไม่ปกติ ห้องแล็บส่วนใหญ่จะเปิดตัวเอนด์พอยต์แบบโฮสต์ก่อน แล้วจึงปล่อยน้ำหนักโมเดลในอีกหลายสัปดาห์ต่อมา หากมีการปล่อยเลย

ตัวเลขพาดหัวอาจทำให้ผู้อ่านส่วนใหญ่ตกใจ: พารามิเตอร์ 552 พันล้านตัวในโครงสร้างหลัก และ 763 พันล้านตัวเมื่อรวมกับตัวเข้ารหัสภาพ แต่การออกแบบภายใต้นั้นเป็นมิตรกับการโฮสต์ด้วยตนเองมากกว่าที่ขนาดของโมเดลบ่งบอก มีเพียง 8 พันล้านพารามิเตอร์ที่ทำงานระหว่าง prefill และ 16 พันล้านพารามิเตอร์ระหว่าง decode และแคช FP4 KV แบบใหม่ใช้พื้นที่เพียง 890 ไบต์ต่อโทเค็น ซึ่งประมาณหนึ่งในสี่ของที่ V4-Flash ต้องการ การคำนวณนั้นถูก แต่หน่วยความจำคือข้อจำกัด

ไม่ว่าอย่างไรก็ตาม ผู้คนก็จะลองดูอยู่ดี คู่มือนี้จะให้ข้อมูลการคำนวณหน่วยความจำ เส้นทางที่เป็นไปได้สำหรับฮาร์ดแวร์แต่ละระดับ คำสั่งตั้งค่าทั่วไป และวิธีทดสอบเอนด์พอยต์ที่เข้ากันได้กับ OpenAI แบบโลคัลเทียบกับ API แบบโฮสต์ใน Apidog หากคุณต้องการภาพรวมของโมเดลก่อน ให้อ่าน DeepSeek-V4.1-Flash คืออะไร? แล้วค่อยกลับมาที่นี่

button

สรุป (TL;DR)

สิ่งที่คุณกำลังดาวน์โหลด

การ์ดโมเดล อธิบายถึงโครงสร้างหลักแบบ Mixture-of-Experts ที่มีพารามิเตอร์ 552B พร้อมเลย์เอาต์ Causal Encoder-Decoder แบบใหม่: 40 เลเยอร์, แบ่งเป็น 20 ตัวเข้ารหัสและ 20 ตัวถอดรหัส แต่ละเลเยอร์จะส่งข้อมูลผ่านผู้เชี่ยวชาญ 384 คนบวกกับผู้เชี่ยวชาญที่ใช้ร่วมกัน 1 คน ตัวเข้ารหัสภาพ DeepSeek-ViT ทำให้เช็คพอยต์ทั้งหมดมีพารามิเตอร์ถึง 763B และคุณจะต้องดาวน์โหลดทั้งหมดแม้ว่าคุณจะต้องการเพียงข้อความก็ตาม

สามประเด็นสำคัญสำหรับการอนุมานในเครื่อง:

  1. พารามิเตอร์ที่ทำงานอยู่มีขนาดเล็ก 8B ทำงานระหว่าง prefill, 16B ทำงานระหว่าง decode จำนวน FLOPs ต่อโทเค็นดูเหมือนโมเดลขนาดกลางแบบหนาแน่น ปัญหาคือพารามิเตอร์ 552B ทุกตัวจะต้องอยู่ในตำแหน่งที่ forward pass สามารถเข้าถึงได้
  2. แคช KV เป็นแบบ FP4 บันทึกการเปิดตัว ระบุว่าแคชใช้ HBM เพียง 1/4 และพื้นที่จัดเก็บ SSD เพียง 1/8 เมื่อเทียบกับรุ่นก่อนหน้า ที่ 890 ไบต์ต่อโทเค็น บริบทแบบยาวจึงไม่ใช่ปัญหาด้านหน่วยความจำอีกต่อไป
  3. กลไก Attention ถูกออกแบบมาให้บางเบา (sparse) Compressed Sparse Attention 2 ที่มีสามโหมดคงที่ได้รับการฝึกฝนที่บริบท 64K และขยายไปถึง 1M ในช่วงท้ายของการรัน 45T-โทเค็น นี่คือเหตุผลที่ตัวเลข KV ยังคงเล็กเมื่อบริบทเป็น 1M

รายงานทางเทคนิค ครอบคลุมสถาปัตยกรรมทั้งหมด ตัวเลขเกณฑ์มาตรฐานทุกตัวบนการ์ดรายงานโดย DeepSeek; ให้ถือว่าเป็นข้อกล่าวอ้าง

การคำนวณหน่วยความจำ

ตัวเลขด้านล่างนี้เป็นการคูณโดยตรง ไม่ใช่การวัด และไม่รวมโอเวอร์เฮดของเอนจิน, activations, และตัวเข้ารหัสภาพ

ส่วนประกอบ ขนาด วิธีการคำนวณ
น้ำหนักโครงสร้างหลัก, 8-บิต ~552 GB 552B พารามิเตอร์ x 1 ไบต์
น้ำหนักโครงสร้างหลัก, 4-บิต ~280 GB 552B พารามิเตอร์ x 0.5 ไบต์
แคช KV, ต่อโทเค็น 890 ไบต์ จากการ์ดโมเดล
แคช KV ที่บริบท 128K ~0.11 GB 890 x 128,000
แคช KV ที่บริบท 1M ~0.89 GB 890 x 1,000,000

มีสองสิ่งที่โดดเด่น ประการแรก แคช KV เป็นเพียงค่าปัดเศษ เซสชัน 1M โทเค็นใช้พื้นที่ไม่ถึงหนึ่งกิกะไบต์ ดังนั้นคุณสามารถเก็บเซสชันยาวๆ ได้หลายสิบเซสชันโดยไม่กระทบงบประมาณน้ำหนักโมเดล ประการที่สอง น้ำหนักโมเดลคือปัญหาทั้งหมด ไม่มีเทคนิคการหาปริมาณใดที่จะทำให้พารามิเตอร์ 552B พอดีกับ GPU สำหรับผู้บริโภคเครื่องเดียวได้ และการออกแบบ 8B-active ก็ไม่ได้ช่วยอะไร เพราะการกำหนดเส้นทางแบบ MoE ยังคงต้องการให้ผู้เชี่ยวชาญทุกคนถูกโหลดและสามารถเข้าถึงได้

นั่นเป็นเหตุผลที่การตั้งค่าแบบ offloaded รู้สึกไม่สมดุล Prefill จะประมวลผลเป็นชุดข้อมูลตลอดทั้ง prompt และยังคงถูกจำกัดด้วยการคำนวณ Decode จะเรียกพารามิเตอร์ที่ใช้งานอยู่ 16B จาก RAM หรือ SSD สำหรับทุกโทเค็น แบนด์วิดท์ต่างหาก ไม่ใช่ FLOPs ที่เป็นตัวกำหนดจำนวนโทเค็นต่อวินาทีของคุณ

ระดับฮาร์ดแวร์ที่เป็นไปได้จริง

ไม่มีตัวเลข throughput (ปริมาณงาน) ในที่นี้ ไม่มีใครนอก DeepSeek ที่มีน้ำหนักโมเดลนานพอที่จะเผยแพร่เกณฑ์มาตรฐานที่เชื่อถือได้

ระดับ 1: เซิร์ฟเวอร์หลาย GPU, การ์ด 4 ถึง 8 ใบในคลาส 80 GB การ์ด 80 GB สี่ใบให้คุณ 320 GB ซึ่งเพียงพอสำหรับน้ำหนักโมเดล 4-บิต พร้อมพื้นที่เล็กน้อยสำหรับแคช KV และโอเวอร์เฮดของเอนจิน การ์ดแปดใบให้คุณ 640 GB ซึ่งเพียงพอสำหรับเช็คพอยต์ 8-บิต หรือการปรับใช้ 4-บิตที่สะดวกสบายด้วยแบทช์ขนาดใหญ่ นี่เป็นระดับเดียวที่ “รันในเครื่อง” หมายถึงการให้บริการระดับโปรดักชันด้วย tensor parallelism และเป็นการลงทุนห้าหรือหกหลัก หรือการเช่าคลาวด์หลายดอลลาร์ต่อชั่วโมง

ระดับ 2: เวิร์กสเตชันหน่วยความจำสูงเครื่องเดียวพร้อม CPU offload คอมพิวเตอร์ที่มี RAM ระบบ 512 GB ขึ้นไปและ GPU หนึ่งหรือสองตัวสามารถเก็บน้ำหนักโมเดล 4-บิตใน RAM และส่งสตรีมเลเยอร์ผู้เชี่ยวชาญไปยัง GPU ตามความต้องการ มันใช้งานได้ แต่ช้า เพราะแบนด์วิดท์ของ decode คือบัส DDR5 ของคุณแทนที่จะเป็น HBM ใช้สำหรับการประมวลผลแบบแบทช์และการประเมินผลข้ามคืน ไม่ใช่สำหรับการสนทนาแบบโต้ตอบ

ระดับ 3: Apple Silicon พร้อมการสตรีมจาก SSD เส้นทางสำหรับผู้ที่ชื่นชอบ Mac Studio ขนาด 512 GB สามารถเก็บน้ำหนักโมเดล 4-บิตในหน่วยความจำแบบรวม (unified memory) ซึ่งเป็นตัวเลือกที่ใช้งานได้จริงหากคุณมีอยู่แล้ว ต่ำกว่านั้น คุณจะอยู่ในอาณาเขตของ กระทู้ Kimi K3 HN: น้ำหนักโมเดลถูกแบ่งเก็บใน SSD ภายนอก, mmap ทำงานหนัก, ได้ประมาณ 1 โทเค็นต่อวินาที มันพิสูจน์ว่าโมเดลทำงานได้ แต่ไม่ได้หมายความว่ามันมีประโยชน์บนเครื่องนั้น คู่มือของเราเกี่ยวกับการรัน Kimi K3 ในเครื่อง ครอบคลุมการแลกเปลี่ยนเดียวกันกับโมเดลที่ใหญ่กว่า และ วิธีการรัน DeepSeek V4 ในเครื่อง ครอบคลุมรุ่นก่อนหน้า

เส้นทางการตั้งค่า

เมื่อมีฮาร์ดแวร์พร้อมแล้ว ขั้นตอนคือ: ดาวน์โหลด, ให้บริการผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI, ทดสอบ

pip3 install -U "huggingface_hub[cli]"
huggingface-cli download deepseek-ai/DeepSeek-V4.1-Flash \
  --local-dir ./models/deepseek-v4.1-flash \
  --max-workers 8

บนสาย 1 Gbps, ทุก 100 GB ใช้เวลาประมาณ 15 นาทีที่ความเร็วเต็มที่ ควรเผื่อเวลาไว้หนึ่งชั่วโมงหรือมากกว่า

การให้บริการคือจุดที่ต้องระมัดระวัง การสนับสนุน Day-0 ใน vLLM, SGLang, llama.cpp และ Ollama สำหรับสถาปัตยกรรม CED และ CSA2 attention นั้น [ตรวจสอบ]; ประเภทเลเยอร์ใหม่มักจะต้องมีการแก้ไขเอนจินก่อนที่น้ำหนักโมเดลจะถูกโหลด และบันทึกการเปิดตัวไม่ได้ระบุชื่อเอนจินเฉพาะ ค้นหาบันทึกการเปลี่ยนแปลงของแต่ละโปรเจกต์สำหรับ “DeepSeek-V4.1” ก่อนที่คุณจะตัดสินใจดาวน์โหลด เมื่อมีการสนับสนุนแล้ว การให้บริการด้วย vLLM ข้าม 8 GPU จะมีลักษณะดังนี้:

vllm serve ./models/deepseek-v4.1-flash \
  --tensor-parallel-size 8 \
  --max-model-len 131072 \
  --served-model-name deepseek-flash \
  --port 8000

`llama-server` ของ llama.cpp หรือโมเดล Ollama จะเปิดเผยเอนด์พอยต์สไตล์ `http://localhost:8000/v1` เดียวกันเมื่อมีการแปลง GGUF แล้ว ดังนั้นไคลเอ็นต์ OpenAI SDK ใดๆ ก็สามารถทำงานได้โดยการเปลี่ยนเพียงบรรทัดเดียว:

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Summarize this incident report and list the three root causes."}],
    temperature=1.0,
    top_p=0.95,
)
print(response.choices[0].message.content)

ค่า `temperature=1.0` และ `top_p=0.95` ตรงกับการตั้งค่าที่แนะนำในการ์ดโมเดล สำหรับ Ollama, คู่มือ Ollama ของเราครอบคลุมขั้นตอน Modelfile และ คู่มือ vLLM ครอบคลุมแฟล็ก multi-GPU อย่างละเอียด

ทางเลือกที่เป็นประโยชน์: API แบบโฮสต์

ในช่วงนอกเวลาทำการ หน้าราคา ระบุว่า `deepseek-flash` คิดค่าบริการ $0.15 ต่อ 1M โทเค็นอินพุตแบบ cache-miss, $0.003 ต่อ 1M โทเค็นอินพุตแบบ cache-hit และ $0.60 ต่อ 1M โทเค็นเอาต์พุต ในช่วงเวลาเร่งด่วน ราคาจะเพิ่มเป็นสองเท่า ดังนั้น 1 พันล้านโทเค็นอินพุตบวก 200 ล้านโทเค็นเอาต์พุตต่อเดือนจะมีค่าใช้จ่ายประมาณ $270 ในช่วงนอกเวลาทำการ และ $540 ในช่วงเวลาเร่งด่วน ก่อนที่ cache hits จะลดฝั่งอินพุตลงอีก เซิร์ฟเวอร์ 8-GPU ในคลาส 80 GB มีค่าใช้จ่ายต่อเดือนมากกว่านั้นเฉพาะค่าไฟฟ้าและค่าทำความเย็นภายใต้การใช้งานอย่างต่อเนื่อง ก่อนที่คุณจะตัดค่าเสื่อมราคาฮาร์ดแวร์หรือจ้างคนดูแล เว้นแต่คุณจะมีกฎการเก็บรักษาข้อมูล (data-residency rule) หรือฮาร์ดแวร์ที่ว่างอยู่แล้ว API ก็คุ้มค่ากว่า การเปลี่ยนทำได้ง่ายๆ เพียงแค่เปลี่ยน `base_url` คู่มือ API ของ DeepSeek-V4.1-Flash ของเราจะอธิบายวิธีการ

การรันในเครื่องจะดีกว่าเมื่อข้อจำกัดไม่ใช่เรื่องเงิน: สภาพแวดล้อมแบบ air-gapped, ข้อมูล prompt ที่คุณไม่สามารถส่งออกไปที่ใดได้ หรือการวิจัยที่ต้องการปรับเปลี่ยนน้ำหนักโมเดล

ทดสอบเอนด์พอยต์ในเครื่องเทียบกับ API แบบโฮสต์ใน Apidog

ไม่ว่าจะเลือกทางไหน ให้ทดสอบก่อนที่จะเชื่อถือ กำหนด Apidog ไปยังเอนด์พอยต์ทั้งสอง รันคำขอที่บันทึกไว้ชุดเดียวกัน และปล่อยให้ assertion บอกคุณว่าบิลด์ในเครื่องของคุณตรงกับเวอร์ชันอ้างอิงหรือไม่

  1. สร้างสองสภาพแวดล้อม หนึ่งชื่อ `local` โดยตั้งค่า `base_url` เป็น `http://localhost:8000/v1` และอีกหนึ่งชื่อ `hosted` โดยตั้งค่า `base_url` เป็น `https://api.deepseek.com` และคีย์จริงของคุณ ทุกคำขอจะใช้ `{{base_url}}/chat/completions` และ `Bearer {{api_key}}`
  2. บันทึกชุด prompt ขนาดเล็กเป็นคำขอ Prompt ห้าถึงสิบ prompt ที่แสดงถึงปริมาณงานของคุณ: การแยก JSON, การแก้ไขโค้ด, สรุปบริบทแบบยาว ตั้งค่า `model` เป็น `deepseek-flash` ในทุกคำขอ เพราะมันทำงานได้ทั้งบนเซิร์ฟเวอร์ทั้งสอง
  3. เพิ่ม assertion สำหรับงาน JSON ให้ยืนยันว่าการตอบกลับสามารถแยกวิเคราะห์ได้และมีคีย์ที่จำเป็นอยู่ สำหรับทุกคำขอ ให้ยืนยันว่า `finish_reason` เท่ากับ `stop` ซึ่งจะช่วยจับการตัดทอนที่เกิดจากการตั้งค่าบริบทที่ไม่ถูกต้อง
  4. รันชุดคำขอเทียบกับทั้งสองสภาพแวดล้อม สลับดรอปดาวน์สภาพแวดล้อมจาก `hosted` เป็น `local` และรันสถานการณ์ทดสอบเดิมซ้ำ ความล้มเหลวที่ปรากฏเฉพาะบน `local` คือปัญหาการหาปริมาณหรือเทมเพลตของคุณ ซึ่งสามารถแยกแยะได้ด้วยการคลิกเดียว
  5. ดูการสตรีม ตั้งค่า `stream: true` และใช้มุมมอง SSE เพื่อดูเหตุการณ์ที่มาถึงทีละรายการ เซิร์ฟเวอร์ในเครื่องที่บัฟเฟอร์การตอบกลับทั้งหมดก่อนส่งจะดูปกติในการเรียกที่ไม่ใช่การสตรีม แต่จะผิดพลาดในที่นี้
  6. รวมเข้าใน CI รันสถานการณ์ด้วย `apidog-cli` ในทุกการอัปเกรดเอนจิน เพื่อให้เทมเพลตแชทที่เสียจะทำให้ไปป์ไลน์ล้มเหลวแทนผู้ใช้

ดาวน์โหลด Apidog และขั้นตอนทั้งหมดจะรันจากโปรเจกต์เดียว

คำถามที่พบบ่อย (FAQ)

สิ่งนี้บอกอะไรคุณได้บ้าง

DeepSeek-V4.1-Flash เป็นโอเพนซอร์สในด้านที่สำคัญทางกฎหมายและเทคนิค: น้ำหนักโมเดล MIT, รายงานทางเทคนิคสาธารณะ และการออกแบบแคช KV ที่ทำให้เซสชัน 1M โทเค็นแทบไม่ใช้หน่วยความจำ มันไม่ได้เปิดเผยในลักษณะที่คุณสามารถรันบนเครื่องใต้โต๊ะของคุณได้ สำหรับทีมส่วนใหญ่ การเลือกใช้ API แบบโฮสต์ที่ราคา $0.15 ต่อ 1M โทเค็นอินพุตในช่วงนอกเวลาทำการคือทางเลือกที่เหมาะสม โดยจะสงวนการปรับใช้ในเครื่องไว้สำหรับข้อมูลที่ไม่สามารถออกจากอาคารได้

ไม่ว่าจะเลือกทางไหน ให้ทดสอบก่อนที่จะเชื่อถือ กำหนด Apidog ไปยังเอนด์พอยต์ทั้งสอง รันคำขอที่บันทึกไว้ชุดเดียวกัน และปล่อยให้ assertion บอกคุณว่าบิลด์ในเครื่องของคุณตรงกับเวอร์ชันอ้างอิงหรือไม่

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API