GLM-5.3-Flash เป็นโมเดลขนาด 320 พันล้านพารามิเตอร์ที่เผยแพร่ภายใต้ใบอนุญาต MIT ข้อเท็จจริงสองประการนี้ดึงกันคนละทาง: ใบอนุญาตระบุว่าคุณสามารถใช้งานได้ตามต้องการ ในขณะที่จำนวนพารามิเตอร์บ่งบอกว่าคุณจะต้องใช้ฮาร์ดแวร์ที่จริงจังในการรันโมเดล
ส่วนที่น่าสนใจคือ มีพารามิเตอร์ 18 พันล้านจากทั้งหมด 320 พันล้านพารามิเตอร์ที่ทำงานต่อโทเค็น และมีเวอร์ชันควอนไทซ์ (quantized builds) อยู่ การรวมกันนี้ทำให้โมเดลนี้สามารถใช้งานได้บนการตั้งค่าที่เล็กกว่าโหนด 8x H200 ที่คู่มือส่วนใหญ่สันนิษฐานไว้มาก
โพสต์นี้จะอธิบายระดับฮาร์ดแวร์อย่างตรงไปตรงมา ตั้งแต่โหนดการผลิตที่ใช้ความแม่นยำเต็มรูปแบบ ไปจนถึงเวอร์ชันควอนไทซ์บนเวิร์กสเตชัน และครอบคลุมถึงกรณีที่การรันด้วยตัวเองนั้นสมเหตุสมผล
สิ่งที่คุณกำลังโหลดอยู่จริง
| คุณสมบัติ | ค่า |
|---|---|
| พารามิเตอร์ทั้งหมด | 320B |
| ทำงานต่อโทเค็น | 18B |
| สถาปัตยกรรม | MoE, hybrid linear and sparse attention |
| บริบท | 1,048,576 โทเค็น |
| ใบอนุญาต | MIT |
| น้ำหนักโมเดล | zai-org/GLM-5.3-Flash |
| GGUF quants | unsloth/GLM-5.3-Flash-GGUF |
การออกแบบแบบ Mixture-of-Experts (MoE) คือสิ่งที่ทำให้สิ่งนี้เป็นไปได้ พารามิเตอร์ทั้งหมด 320 พันล้านจะต้องอยู่ในหน่วยความจำ แต่มีเพียง 18 พันล้านเท่านั้นที่เข้าร่วมในโทเค็นใดๆ ดังนั้นความต้องการในการประมวลผลจึงต่ำกว่าที่ยอดรวมบ่งบอกไว้มาก หน่วยความจำคือข้อจำกัดหลักของคุณ ไม่ใช่ FLOPs
Z.ai ยังรายงานว่า KV cache มีขนาดเล็กลงประมาณ 4.4 เท่าเมื่อเทียบกับ GLM-5.3 ซึ่งสำคัญอย่างยิ่งสำหรับงานที่ใช้บริบทขนาดยาว KV cache คือสิ่งที่ใช้หน่วยความจำเมื่อบริบทของคุณเต็ม และในหน้าต่าง 1 ล้านโทเค็น นั่นคือสิ่งที่มักจะทำให้เกิดปัญหา
ระดับ 1: ความแม่นยำเต็มรูปแบบบนโหนดการผลิต
สำหรับการให้บริการด้วยคุณภาพเต็มรูปแบบและมีการทำงานพร้อมกันอย่างแท้จริง การกำหนดค่าอ้างอิงคือ **โหนด 8x H200** (แต่ละตัวมี 141GB รวมประมาณ 1,128GB) โหนด 8x H20 ก็สามารถใช้งานได้เช่นกัน
ตัวเลขโดยประมาณ: เฉพาะน้ำหนักโมเดลก็ต้องการพื้นที่ประมาณ 700 ถึง 800GB ขึ้นอยู่กับความแม่นยำ และคุณยังต้องการพื้นที่เพิ่มเติมสำหรับ KV cache และโอเวอร์เฮดขณะรัน ความจุคลาวด์ที่เช่าสำหรับโหนดแบบนี้มีค่าใช้จ่ายประมาณ $24 ถึง $48 ต่อวัน
vLLM
vLLM เป็นค่าเริ่มต้นที่ใช้กันทั่วไปและมีการสนับสนุนระบบนิเวศที่กว้างขวางที่สุด ขนาด tensor parallel ควรเป็นเลขยกกำลังของสอง:
vllm serve zai-org/GLM-5.3-Flash \
--tensor-parallel-size 8 \
--max-model-len 1048576 \
--trust-remote-code
เริ่มต้นด้วย `--max-model-len` ที่เล็กกว่าในขณะที่คุณกำลังตรวจสอบการตั้งค่า การขอหน้าต่าง 1 ล้านโทเค็นเต็มทันทีหมายถึงการจัดสรร KV cache สำหรับมัน และความล้มเหลวในส่วนนั้นจะดูเหมือนข้อผิดพลาดหน่วยความจำไม่พอ (out-of-memory) มากกว่าปัญหาการกำหนดค่า
SGLang
SGLang ได้รับการสนับสนุนโมเดลนี้ตั้งแต่วันแรก โดยมีสูตรที่เผยแพร่สำหรับการใช้งาน H100, H200, B200, B300, GB200 และ GB300 รวมถึงการให้บริการแบบมัลติโมดอล Z.ai ใช้สแต็กที่อิง SGLang สำหรับการให้บริการก่อนเปิดตัวของตัวเอง
python -m sglang.launch_server \
--model-path zai-org/GLM-5.3-Flash \
--tp 8 \
--context-length 1048576
SGLang มักจะเหนือกว่าในการสร้างผลลัพธ์ที่มีโครงสร้างและปริมาณงานแบบ Agentic ที่มีการทำงานพร้อมกันสูง หากคุณกำลังให้บริการ Coding Agent แทนที่จะเป็น Chat Interface ควรเปรียบเทียบประสิทธิภาพกับ vLLM แทนที่จะใช้ค่าเริ่มต้นไปเลย
สแต็กทั้งสองต้องการการตั้งค่า tool-call parser หากคุณต้องการให้ฟังก์ชันการเรียกทำงานได้อย่างถูกต้อง ตรวจสอบแฟล็กปัจจุบันในเอกสารประกอบของแต่ละโปรเจกต์ เนื่องจากชื่อของ parser อาจเปลี่ยนแปลงได้ระหว่างการเผยแพร่
ระดับ 2: ควอนไทซ์บนฮาร์ดแวร์ขนาดเล็กกว่า
นี่คือระดับที่บทความส่วนใหญ่มักจะข้ามไป แต่เป็นระดับที่สำคัญสำหรับทุกคนที่ไม่มีดาต้าเซ็นเตอร์
เวอร์ชัน GGUF แบบควอนไทซ์เผยแพร่ที่ `unsloth/GLM-5.3-Flash-GGUF` โดยมีรูปแบบที่ใช้บิตน้อยลงอย่างมาก เช่น 1-bit และ 2-bit formats เช่น IQ1_S และ IQ2_XXS การควอนไทซ์แบบ 2 บิตของโมเดล 320 พันล้านพารามิเตอร์ทำให้น้ำหนักโมเดลอยู่ในช่วงที่เวิร์กสเตชันที่มีหน่วยความจำสูงหรือเครื่องคอมพิวเตอร์ผู้ใช้ที่มีหลาย GPU สามารถรองรับได้ โดยเฉพาะอย่างยิ่งเมื่อมีการโหลดบางส่วนไปยัง CPU (CPU offload)
ข้อควรระวังสองประการที่ตรงไปตรงมา:
- **การควอนไทซ์แบบรุนแรงส่งผลกระทบต่อคุณภาพ** IQ1_S มีความแม่นยำที่ห่างไกลจากความแม่นยำเต็มรูปแบบมาก ในโมเดล MoE ขนาด 320 พันล้านพารามิเตอร์ การลดคุณภาพมักจะน้อยกว่าเมื่อเทียบกับการใช้วิธีเดียวกันกับโมเดลหนาแน่น (dense model) เนื่องจากมีความซ้ำซ้อนให้สูญเสียมากกว่า แต่คำว่า "รันได้" กับ "รันได้ดี" นั้นแตกต่างกัน ทดสอบกับงานของคุณเองก่อนที่จะสรุปผลใดๆ
- **เอกสารประกอบของ Unsloth สำหรับโมเดลนี้ระบุว่าเป็นระหว่างดำเนินการ** การจัดหา Quant และการตั้งค่าที่แนะนำยังคงมีการเปลี่ยนแปลง ตรวจสอบสิ่งที่เผยแพร่อยู่จริงก่อนที่จะวางแผนสร้างโดยยึดตามรูปแบบใดรูปแบบหนึ่ง
สำหรับการตั้งค่าที่เน้น CPU และแบบไฮบริด **KTransformers** ได้รับการออกแบบมาเพื่อกรณีนี้โดยเฉพาะ โดยเก็บ MoE experts ไว้ใน RAM ของระบบและย้ายเฉพาะสิ่งที่จำเป็นไปยัง GPU ในโมเดล MoE ที่มีพารามิเตอร์ที่ทำงานอยู่ 18 พันล้าน สถาปัตยกรรมดังกล่าวเหมาะสมเป็นพิเศษ **TokenSpeed** ก็เป็นหนึ่งในรันไทม์ที่รองรับด้วย
คู่มือของเราเกี่ยวกับการ รัน GLM-4.7-Flash บนเครื่องของคุณ ครอบคลุมขั้นตอนการทำงานของโมเดลขนาดเล็กกว่านี้ และการ รัน GLM-5 บนเครื่องของคุณฟรี ครอบคลุมการตั้งค่า GLM แบบโลคัลโดยทั่วไป
การคำนวณงบประมาณหน่วยความจำของคุณ
ตัวเลขสองชุดเป็นตัวกำหนดว่าการกำหนดค่าเหมาะสมหรือไม่
- **น้ำหนักโมเดล (Weights)** ที่ประมาณ 2 ไบต์ต่อพารามิเตอร์ใน BF16 พารามิเตอร์ 320 พันล้านตัวจะมีขนาดประมาณ 640GB ก่อนรวมโอเวอร์เฮด FP8 จะลดขนาดลงประมาณครึ่งหนึ่ง การควอนไทซ์แบบ 4 บิตจะลดขนาดลงเหลือประมาณ 160GB และรูปแบบ 2 บิตที่ใช้บิตน้อยลงมากจะทำให้ขนาดเล็กลงไปอีก แต่ก็แลกมาด้วยคุณภาพที่ลดลงอย่างแท้จริง
- **KV cache** สิ่งนี้จะปรับขนาดตามความยาวของบริบทและการทำงานพร้อมกัน และเป็นสิ่งที่ทำให้ผู้คนประหลาดใจ การกำหนดค่าที่โหลดได้ดีที่บริบท 8K อาจล้มเหลวที่ 128K เนื่องจากแคชมีขนาดใหญ่ขึ้น ไม่ใช่น้ำหนักโมเดล การลดขนาด 4.4 เท่าที่ Z.ai รายงานเมื่อเทียบกับ GLM-5.3 ช่วยได้มากในจุดนี้ แต่การปรับขนาดก็ยังคงเป็นเชิงเส้นตามจำนวนโทเค็น
ความหมายในทางปฏิบัติคือการกำหนดขนาดตามความยาวบริบทจริงของคุณ ไม่ใช่ความยาวสูงสุดที่โมเดลโฆษณา แอปพลิเคชันจำนวนน้อยมากที่ต้องการโทเค็นเต็มล้าน และการจัดเตรียมสำหรับหน้าต่างที่คุณไม่เคยใช้นั้นเป็นวิธีที่พบบ่อยที่สุดที่ทำให้โมเดลนี้ดูมีราคาแพงเกินไป
หากคุณติดตามเรื่องราวของน้ำหนักโมเดลแบบเปิด (open-weights) ของตระกูลนี้ก่อนหน้านี้ โพสต์การโฮสต์ GLM-5.3 ด้วยตัวเองของเรา เขียนขึ้นก่อนการเปิดตัว ตอนนี้น้ำหนักโมเดลสำหรับ Flash ได้รับการเผยแพร่ภายใต้ใบอนุญาต MIT แล้ว ดังนั้นคำแนะนำในที่นี้จึงมาแทนที่ของเดิม
การปรับแต่ง (Fine-tuning)
ใบอนุญาต MIT อนุญาตให้ปรับแต่งและเผยแพร่ซ้ำได้ ซึ่งเป็นเรื่องที่ไม่ธรรมดาสำหรับระดับความสามารถนี้ และเป็นเหตุผลที่แข็งแกร่งที่สุดในการเป็นเจ้าของน้ำหนักโมเดลด้วยตัวเอง
ต้องพิจารณาเรื่องค่าใช้จ่ายตามความเป็นจริง การปรับแต่งโมเดล 320 พันล้านพารามิเตอร์แบบเต็มรูปแบบนั้นเกินความสามารถของทีมส่วนใหญ่ วิธีการที่ประหยัดพารามิเตอร์ เช่น LoRA เป็นแนวทางที่ทำได้จริง และสำหรับโมเดลแบบ Mixture-of-Experts ยังมีคำถามการออกแบบเพิ่มเติมว่าคุณจะปรับ router, experts หรือ attention layers ซึ่งเป็นพื้นที่ที่ยังคงมีการพัฒนาและมีคำแนะนำที่ยังไม่ชัดเจนเท่ากับโมเดลแบบหนาแน่น
หากเป้าหมายของคุณคือการปรับให้เข้ากับโดเมน (domain adaptation) แทนที่จะสร้างความสามารถใหม่ ให้ลองทดสอบการพร้อมท์และการเรียกใช้กับโมเดลพื้นฐานก่อน สำหรับโมเดลที่มีหน้าต่างบริบท 1 ล้านโทเค็น การใส่ความรู้เฉพาะโดเมนของคุณลงในพร้อมท์มักจะถูกกว่าและดีกว่าการฝึกฝนเข้าไปในโมเดล
การตั้งค่าการสุ่ม (Sampling settings)
Z.ai เผยแพร่คำแนะนำที่แตกต่างกันตามประเภทงาน:
| กรณีการใช้งาน | temperature | top_p |
|---|---|---|
| ทั่วไป | 1.0 | 0.95 |
| การเขียนโค้ด | 0.95 | 1.0 |
โมเดลยังรองรับโหมดการให้เหตุผลสามแบบผ่าน `reasoning_effort` โดยมีค่าเป็น `low`, `high` และ `max` **Max เป็นค่าเริ่มต้น** บนฮาร์ดแวร์ท้องถิ่น สิ่งนี้มีความสำคัญมากกว่าบน API เพราะโทเค็นการให้เหตุผลคือการสร้างที่คุณต้องจ่ายด้วยเวลาจริง (wall-clock time) ไม่ใช่เป็นเงินดอลลาร์ หากเครื่องของคุณสร้างคำตอบช้า `low` จะเป็นตัวกำหนดความแตกต่างระหว่างใช้งานได้กับใช้งานไม่ได้
การโฮสต์ด้วยตัวเองคุ้มค่าทางเศรษฐกิจหรือไม่?
ส่วนใหญ่แล้วไม่คุ้ม และราคา API คือเหตุผล
ตามราคาปกติ GLM-5.3-Flash มีค่าใช้จ่าย $0.15 ต่อหนึ่งล้านโทเค็นอินพุต โหนด 8x H200 ที่เช่าในราคาประมาณ $1,000 ต่อเดือน ให้คุณใช้งาน API ได้ประมาณ 6.7 พันล้านโทเค็นอินพุต การรักษาระดับการใช้งานที่สูงกว่านั้นอย่างต่อเนื่องเป็นการดำเนินงานขนาดใหญ่
โหนดก็มีค่าใช้จ่ายเท่ากันไม่ว่าจะถูกใช้งานเต็มที่หรือไม่ได้ใช้งานเลย ในขณะที่ API จะคิดค่าใช้จ่ายเฉพาะสิ่งที่คุณใช้เท่านั้น เว้นแต่ว่าการใช้งานของคุณจะสูงจริงตลอด 24 ชั่วโมง มิฉะนั้นค่าใช้จ่ายคงที่ก็จะแพ้ไป
ดังนั้น เหตุผลในการโฮสต์ด้วยตัวเองจึงไม่ใช่เรื่องค่าใช้จ่าย:
- **ถิ่นที่อยู่ของข้อมูลและความเป็นส่วนตัว** ไม่มีข้อมูลใดๆ ออกจากโครงสร้างพื้นฐานของคุณ
- **ไม่มีการจำกัดอัตรา** ความจุของคุณคือความจุของคุณเอง
- **รับประกันความพร้อมใช้งาน** ไม่ต้องพึ่งพาเวลาทำงานหรือการตัดสินใจด้านราคาของผู้ให้บริการ
- **ใบอนุญาต MIT** คุณสามารถปรับเปลี่ยน, ปรับแต่ง และเผยแพร่ซ้ำได้ ซึ่งเป็นเรื่องไม่ธรรมดาสำหรับโมเดลในระดับความสามารถนี้ และเป็นข้อโต้แย้งที่แข็งแกร่งที่สุดในรายการนี้
- **ฮาร์ดแวร์ที่คุณมีอยู่แล้ว** หาก GPU ถูกซื้อมาและไม่ได้ใช้งาน ค่าใช้จ่ายส่วนเพิ่มคือค่าไฟฟ้า และการคำนวณทั้งหมดก็จะกลับด้าน
การวิเคราะห์ราคาของเรา จะอธิบายด้าน API ของการเปรียบเทียบนี้อย่างละเอียดเพิ่มเติม
การตรวจสอบการติดตั้งใช้งานของคุณ
ทั้ง vLLM และ SGLang มี endpoints ที่เข้ากันได้กับ OpenAI ดังนั้นรูปแบบคำขอเดียวกันจึงสามารถใช้ได้กับเซิร์ฟเวอร์ในเครื่องของคุณและ Z.ai:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"messages": [{"role": "user", "content": "reply with OK"}]
}'
สิ่งที่ควรทดสอบนอกเหนือจากการตรวจสอบเบื้องต้น: พฤติกรรมของบริบทขนาดยาวที่ความยาวที่คุณต้องการจริง การป้อนรูปภาพหากคุณกำลังให้บริการแบบมัลติโมดอล การเรียกใช้เครื่องมือด้วย schema จริงของคุณ และปริมาณงานภายใต้การทำงานพร้อมกัน แทนที่จะเป็นแค่ความหน่วงของคำขอเดี่ยว
นี่คือจุดที่ชุดทดสอบที่บันทึกไว้จะแสดงประโยชน์ของมัน ชี้ Apidog ไปยังเซิร์ฟเวอร์ในเครื่องของคุณและ endpoint ของ Z.ai โดยใช้ Base URL เป็นตัวแปรสภาพแวดล้อม จากนั้นรันชุดทดสอบเดียวกันกับแต่ละตัว และเปรียบเทียบ คุณจะพบได้อย่างรวดเร็วว่าเวอร์ชันควอนไทซ์ของคุณยังคงรองรับ tool schemas ที่แอปพลิเคชันของคุณพึ่งพาหรือไม่ ซึ่งเป็นโหมดความล้มเหลวที่ผู้คนมักจะพบในการใช้งานจริงแทนที่จะเป็นก่อนหน้านั้น
คำถามที่พบบ่อย
- **ฮาร์ดแวร์ขั้นต่ำคืออะไร?** สำหรับความแม่นยำเต็มรูปแบบ คือโหนดขนาด 8x H200 สำหรับเวอร์ชัน GGUF แบบควอนไทซ์ ใช้ฮาร์ดแวร์น้อยกว่ามาก แต่คุณภาพจะลดลงตามระดับการควอนไทซ์
- **จำเป็นต้องมีพารามิเตอร์ทั้งหมด 320 พันล้านตัวในหน่วยความจำหรือไม่?** ใช่ มีเพียง 18 พันล้านตัวเท่านั้นที่ทำงานต่อโทเค็น แต่ชุดเต็มทั้งหมดต้องอยู่ในหน่วยความจำ หน่วยความจำเป็นข้อจำกัด; การประมวลผลไม่ใช่
- **vLLM หรือ SGLang อันไหนดีกว่ากัน?** SGLang ได้รับการสนับสนุนตั้งแต่วันแรกพร้อมสูตรมัลติโมดอลที่เผยแพร่ และมักจะเหนือกว่าในด้านการทำงานพร้อมกันและผลลัพธ์ที่มีโครงสร้าง vLLM มีการสนับสนุนระบบนิเวศที่กว้างขวางกว่า ลองเปรียบเทียบประสิทธิภาพทั้งสองบนปริมาณงานของคุณ
- **ฉันสามารถรันบน GPU ตัวเดียวได้หรือไม่?** ไม่ได้หากต้องการความแม่นยำเต็มรูปแบบ ด้วยการควอนไทซ์ที่เข้มข้นและการโหลดบางส่วนไป CPU ผ่าน KTransformers ระบบ GPU ตัวเดียวที่มีหน่วยความจำสูงและ RAM ของระบบจำนวนมากเป็นไปได้ แต่คาดว่าจะสร้างคำตอบได้ช้า
- **ใบอนุญาตเป็น MIT จริงหรือ?** ใช่ น้ำหนักโมเดลได้รับการเผยแพร่ภายใต้ใบอนุญาต MIT ซึ่งอนุญาตให้ใช้งานเชิงพาณิชย์ การปรับเปลี่ยน และการเผยแพร่ซ้ำได้
