GLM-5.2 เป็นหนึ่งในโมเดลแบบ open-weights ที่มีความสามารถสูงที่สุดที่คุณสามารถรันได้ในตอนนี้ และใบอนุญาต MIT แบบเปิดหมายความว่า "ฟรี" เป็นไปได้จริง ข้อเสียคือ "ฟรี" และ "ง่าย" ไม่ใช่สิ่งเดียวกันสำหรับโมเดล mixture-of-experts ขนาด ~753B คู่มือนี้จะแนะนำเส้นทางที่แท้จริง ตั้งแต่การโฮสต์ด้วยตัวเองแบบฟรีจริง ๆ ไปจนถึงเครดิตทดลองใช้เกือบฟรี และระดับราคาที่ถูกที่สุด พร้อมข้อสังเกตที่ตรงไปตรงมาเกี่ยวกับฮาร์ดแวร์และข้อจำกัด
หากคุณต้องการเวอร์ชันสั้น ๆ: หากคุณมีฮาร์ดแวร์ (หรือเช่า GPU ราคาถูก) ให้โฮสต์โมเดลแบบ open-weights ด้วยตัวเอง หากคุณไม่มี ให้พึ่งพาเครดิตทดลองใช้ของ z.ai หรือแพ็กเกจ GLM Coding Plan ที่ถูกที่สุด ไม่มีช่องทาง OpenRouter ฟรีสำหรับ glm-5.2 ดังนั้นอย่าพยายามหา
แผนผังการตัดสินใจฉบับย่อ
เลือกแถวของคุณแล้วข้ามไปยังส่วนนั้นได้เลย
| สถานการณ์ของคุณ | เส้นทางที่ดีที่สุด | ค่าใช้จ่ายจริง |
|---|---|---|
| คุณเป็นเจ้าของคอมพิวเตอร์ GPU ที่ทรงพลัง (หรือสามารถเช่าได้) | โฮสต์โมเดลแบบเปิดด้วยตัวเอง (Ollama / vLLM) | $0 สำหรับโมเดล; ค่าไฟฟ้าหรือค่าเช่า GPU |
| คุณต้องการใช้งานโดยไม่ต้องตั้งค่าและไม่มีบัตรเครดิต | z.ai เครดิตทดลองใช้ฟรี / ระดับจำกัดการใช้งาน | ฟรีจนกว่าเครดิตจะหมด (ตรวจสอบข้อเสนอปัจจุบัน) |
| คุณต้องการเส้นทางแบบชำระเงินที่ถูกที่สุดและน่าเชื่อถือ | GLM Coding Plan Lite หรือราคา API สำหรับอินพุตที่แคช | ประมาณ $3-6/เดือน (ตรวจสอบ) หรือไม่กี่สตางค์ต่อการเรียกใช้ |
| คุณต้องการจ่ายตามการใช้งานโดยไม่มีข้อผูกมัด | OpenRouter API | $1.40 / 1M อินพุต, $4.40 / 1M เอาต์พุต |
กฎง่าย ๆ คือ: ฟรีจริง ๆ หมายถึงโฮสต์ด้วยตัวเอง เกือบฟรีหมายถึงเครดิตทดลองใช้หรือแพ็กเกจ Lite

เส้นทางที่ 1: โฮสต์โมเดล MIT แบบเปิดด้วยตัวเอง (ฟรีจริง ๆ)
GLM-5.2 มาพร้อมกับใบอนุญาต MIT โดยไม่มีข้อจำกัดทางภูมิภาค ดังนั้นคุณสามารถดาวน์โหลดโมเดลและรันบนฮาร์ดแวร์ของคุณเองได้โดยไม่ต้องจ่ายเงินให้ใคร โมเดลนี้อยู่ที่ Hugging Face ที่ zai-org/GLM-5.2
ส่วนที่ตรงไปตรงมาคือ: นี่คือโมเดล MoE ขนาด ~753B พารามิเตอร์ใน BF16 แม้ว่าจะมีเพียงบางส่วนของพารามิเตอร์เหล่านี้ที่ทำงานต่อโทเค็น แต่ชุดโมเดลทั้งหมดก็ยังต้องอยู่ในหน่วยความจำ ใน BF16 นั่นคือโมเดลดิบที่มีขนาดมากกว่าหนึ่งเทราไบต์ คุณไม่สามารถรันสิ่งนี้บนแล็ปท็อปได้ คนส่วนใหญ่ที่โฮสต์ด้วยตัวเองจะทำอย่างใดอย่างหนึ่งในสองวิธีดังนี้:
- รัน quantized build (4-บิต หรือคล้ายกัน) เพื่อลดการใช้หน่วยความจำ โดยยอมรับการลดคุณภาพเล็กน้อย
- เช่าอินสแตนซ์ multi-GPU รายชั่วโมงจากผู้ให้บริการคลาวด์ และปิดเมื่อใช้งานเสร็จ
ดังนั้น "ฟรี" ในที่นี้หมายถึงไม่มีค่าใบอนุญาต คุณยังคงต้องจ่ายค่าฮาร์ดแวร์ ค่าไฟฟ้า หรือค่าเช่า GPU สำหรับบุคคลทั่วไป การรัน quantized build บนเวิร์กสเตชันที่มี VRAM สูง หรือการเช่าเซสชันสั้น ๆ เป็นเส้นทางที่เป็นไปได้จริง
รัน GLM-5.2 ด้วย Ollama
Ollama เป็นโปรแกรมรันในเครื่องที่ใช้งานง่ายที่สุด GLM-5.2 มีอยู่ใน ไลบรารี Ollama ซึ่งมีขั้นตอนสองคำสั่งดังนี้:
# ดึงโมเดล (คาดว่าจะมีการดาวน์โหลดขนาดใหญ่มาก)
ollama pull glm-5.2:cloud

Ollama จะใช้ quantized variant โดยค่าเริ่มต้น ซึ่งทำให้โมเดลขนาดนี้สามารถใช้งานได้บนฮาร์ดแวร์ทั่วไป คุณยังสามารถเรียกใช้งานผ่าน endpoint ที่เข้ากันได้กับ OpenAI ของ Ollama ได้ดังนี้:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Write a Python function to parse an RFC 3339 timestamp."}]
}'
เฝ้าระวัง RAM และ VRAM ของคุณ หากโมเดลล้นไปยังดิสก์ การสร้างข้อความจะช้าลงอย่างมาก การใช้ quantized build บวกกับหน่วยความจำรวมที่เพียงพอ หรือการแบ่งใช้งาน multi-GPU คือความแตกต่างระหว่างการใช้งานได้กับการใช้งานไม่ได้
หากคุณต้องการคำแนะนำการใช้งานในเครื่องแบบทีละขั้นตอน รูปแบบจะคล้ายกับรุ่นก่อนหน้าเกือบทุกประการ ดู การรัน GLM-5 ในเครื่องฟรี และ GLM-5 ฟรีด้วย Ollama สำหรับการตั้งค่าทั้งหมด การเลือก quantization และการแก้ไขปัญหา เพียงแค่เปลี่ยนแท็กโมเดลเป็น glm-5.2 และขั้นตอนการทำงานก็เหมือนกัน
รัน GLM-5.2 ด้วย vLLM
สำหรับการรับส่งข้อมูล (throughput) และการให้บริการคำขอหลายรายการ vLLM เป็นตัวเลือกเกรดการผลิต มันจัดการการประมวลผลแบบขนานของเทนเซอร์ (tensor parallelism) ทั่วทั้ง GPU ซึ่งเป็นวิธีที่คุณจะสามารถใช้ MoE ขนาด 753B ได้จริง
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model zai-org/GLM-5.2 \
--tensor-parallel-size 8 \
--max-model-len 131072
--tensor-parallel-size 8 นั้นสมมติว่าใช้ GPU แปดตัว จำนวนที่แน่นอนขึ้นอยู่กับการ์ดของคุณและว่าคุณโหลด quantized checkpoint หรือไม่ vLLM มีเซิร์ฟเวอร์ที่เข้ากันได้กับ OpenAI ดังนั้นไคลเอนต์ใด ๆ ที่พูดรูปแบบ chat-completions สามารถทำงานได้โดยไม่ต้องเปลี่ยนแปลงใด ๆ บริบท 1M โทเค็น (1,048,576 โทเค็น) เป็นความสามารถที่โดดเด่น แต่การเก็บ KV cache หนึ่งล้านโทเค็นใช้หน่วยความจำจำนวนมาก ดังนั้นให้ตั้งค่า --max-model-len ตามที่คุณต้องการจริง ๆ
เส้นทางที่ 2: เครดิตทดลองใช้ฟรีของ z.ai และระดับจำกัดการใช้งาน
หากการโฮสต์ด้วยตัวเองไม่สามารถทำได้ เส้นทางที่ถูกที่สุดถัดไปคือแพลตฟอร์มของ z.ai บัญชีใหม่มักจะได้รับ เครดิตทดลองใช้ฟรี และมักจะมี ระดับฟรีแบบจำกัดการใช้งาน สำหรับการทดลองเล็กน้อย (ณ เดือนมิถุนายน 2026 โปรดตรวจสอบข้อเสนอปัจจุบันที่ z.ai เนื่องจากเงื่อนไขการทดลองอาจเปลี่ยนแปลงบ่อย)
นี่เป็นวิธีที่เร็วที่สุดในการลองใช้โมเดลจริงโดยไม่ต้องตั้งค่าใด ๆ คุณสร้างบัญชี รับ API key และเรียกใช้ endpoint ที่เข้ากันได้กับ OpenAI:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Explain IndexShare sparse attention in two sentences."}],
"thinking": {"type": "enabled"},
"reasoning_effort": "max"
}'
ข้อควรทราบเฉพาะของ GLM-5.2 สองสามอย่างในขณะที่คุณใช้เครดิตเหล่านั้น:
thinkingสลับเปิด/ปิดการใช้เหตุผล สำหรับการเขียนโค้ด z.ai แนะนำระดับความพยายามในการใช้เหตุผล Max ผ่านreasoning_effort: "max"มีสองระดับคือ High และ Max- ความยาวของเอาต์พุตระบุไว้สูงสุด 128K ตามเอกสารของ z.ai แต่ให้ถือว่านี่เป็นตัวเลขที่ต้องตรวจสอบด้วยตัวเองมากกว่าการรับประกันที่แน่นอน เนื่องจากแหล่งข้อมูลรองไม่ได้ระบุไว้เสมอไป
เครดิตทดลองใช้จะหมดลง เมื่อหมด คุณจะต้องเปลี่ยนไปใช้แผนแบบชำระเงินหรือกลับไปโฮสต์ด้วยตัวเอง รายละเอียดพารามิเตอร์ทั้งหมดอยู่ใน คู่มือ GLM-5.2 ของ z.ai
เส้นทางที่ 3: ระดับราคาแบบชำระเงินที่ถูกที่สุด (เกือบฟรี)
เมื่อเครดิตฟรีหมดลง มีสองเส้นทางที่จะทำให้ค่าใช้จ่ายของคุณใกล้เคียงศูนย์
GLM Coding Plan Lite
หากการใช้งานหลักของคุณคือการเขียนโค้ด GLM Coding Plan คือตัวเลือกที่คุ้มค่า แพ็กเกจเริ่มต้น Lite tier มีราคาประมาณ $12/เดือน (ณ เดือนมิถุนายน 2026 โปรดตรวจสอบราคาปัจจุบันที่ z.ai เนื่องจากระดับราคาที่เผยแพร่อาจขัดแย้งกันในบางแหล่ง) สำหรับราคานี้ คุณจะได้รับการเข้าถึงการเขียนโค้ดในอัตราเหมาจ่ายรายเดือนแทนการคิดค่าใช้จ่ายตามโทเค็น ซึ่งทำให้การใช้งานหนัก ๆ ในแต่ละวันสามารถคาดการณ์ค่าใช้จ่ายได้

Coding Plan ยังปลดล็อกเส้นทางที่เข้ากันได้กับ Anthropic ทำให้คุณสามารถใช้ Claude Code, Cline หรือ Cursor กับ GLM-5.2 ได้ URL พื้นฐานสำหรับการเขียนโค้ดคือ https://api.z.ai/api/coding/paas/v4 (บางแหล่งอาจแสดง open.z.ai/api/paas/v4 ดังนั้นโปรดตรวจสอบด้วยตัวเอง) สภาพแวดล้อม Claude Code ที่ใช้งานได้จะมีลักษณะดังนี้:
export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000
ส่วนต่อท้าย [1m] จะเลือกโมเดลบริบท 1M ตั้งค่า API_TIMEOUT_MS ให้สูง มิฉะนั้น Claude Code อาจยกเลิกการเรียกใช้บริบทขนาดใหญ่ที่ใช้เวลานานก่อนที่จะเสร็จสิ้น สำหรับการแนะนำเครื่องมือตัวแทนอย่างละเอียด ดู GLM-5.2 กับ Claude Code, Cline และ Cursor และคู่มือรุ่นก่อนหน้า GLM-5.1 กับ Claude Code
ราคาอินพุตแบบแคชและการจ่ายตามการใช้งาน
สำหรับการเข้าถึง API โดยไม่มีการสมัครสมาชิก API ทั่วไปมาตรฐานมีราคา $1.40 ต่อ 1M โทเค็นอินพุต และ $4.40 ต่อ 1M โทเค็นเอาต์พุต ซึ่งได้รับการยืนยันโดย OpenRouter ราคาเดียวกันนี้ใช้ได้ไม่ว่าคุณจะเรียกใช้ z.ai โดยตรง หรือผ่าน OpenRouter แบบจ่ายตามการใช้งาน
เคล็ดลับเกือบฟรีในที่นี้คือ อินพุตแบบแคช (cached input) ซึ่งมีรายงานราคาอยู่ที่ประมาณ $0.26 ต่อ 1M โทเค็น (ตาม VentureBeat โปรดอ้างอิงตามนั้น) อินพุตแบบแคชช่วยลดค่าใช้จ่ายของบริบทที่ซ้ำกัน เช่น system prompt ที่ยาว หรือโค้ดเบสที่คุณเรียกใช้ซ้ำแล้วซ้ำอีก หากเวิร์กโหลดของคุณใช้ prefix เดิมซ้ำ ๆ คุณจะจ่ายราคาเต็มเพียงครั้งเดียวและจ่ายเพียงเศษส่วนหลังจากนั้น สำหรับการเขียนโค้ดแบบ long-horizon, VentureBeat ตั้งข้อสังเกตว่า GLM-5.2 "ทำได้ดีกว่า GPT-5.5 ในการเขียนโค้ดแบบ long-horizon โดยมีค่าใช้จ่ายประมาณหนึ่งในหก" ซึ่งเป็นเหตุผลทางเศรษฐกิจในประโยคเดียว
ขอย้ำอีกครั้งอย่างชัดเจนว่า: ไม่มี OpenRouter แบบฟรีสำหรับ glm-5.2 OpenRouter ราคาถูก แต่ไม่ฟรี หากคู่มือใดกล่าวอ้างเป็นอย่างอื่น ถือว่าผิด
ฟรี vs. เกือบฟรี: การเปรียบเทียบที่ตรงไปตรงมา
| เส้นทาง | ค่าใช้จ่ายเริ่มต้น | ค่าใช้จ่ายต่อเนื่อง | ความพยายามในการตั้งค่า | เหมาะสำหรับ |
|---|---|---|---|---|
| โฮสต์เอง (Ollama/vLLM) | ฮาร์ดแวร์หรือค่าเช่า | ค่าไฟฟ้า / ชั่วโมงการใช้ GPU | สูง | ความเป็นส่วนตัว, ไม่มีมิเตอร์วัด, ควบคุมเต็มที่ |
| z.ai เครดิตทดลองใช้ | ไม่มี | ฟรีจนกว่าเครดิตจะหมด | ต่ำ | ทดลองใช้ครั้งแรก, ทดสอบด่วน |
| GLM Coding Plan Lite | ~$3-6/เดือน (ตรวจสอบ) | รายเดือนแบบเหมาจ่าย | ต่ำ | การเขียนโค้ดประจำวันใน Claude Code/Cline/Cursor |
| API + อินพุตแบบแคช | ไม่มี | $1.40/$4.40 ต่อ 1M; ~$0.26 สำหรับแคช | ต่ำ | แอปพลิเคชัน, เวิร์กโหลดที่มีบริบทซ้ำ |
รูปแบบที่เป็นประโยชน์: ตรวจสอบแนวคิดของคุณด้วยเครดิตทดลองใช้ จากนั้นตัดสินใจ หากคุณจะรันทุกวันและเป็นงานเขียนโค้ด ให้เลือกแผน Lite หากคุณต้องการความเป็นส่วนตัวหรือต้องการหลีกเลี่ยงการคิดค่าบริการต่อโทเค็นโดยสิ้นเชิง ให้ลงทุนในการโฮสต์ด้วยตัวเอง หากคุณกำลังสร้างผลิตภัณฑ์ที่มีบริบทที่สามารถนำกลับมาใช้ใหม่ได้ API ที่มีการแคชคือระดับราคาที่ถูกที่สุดและน่าเชื่อถือ
ทดสอบ GLM-5.2 endpoint ฟรีของคุณด้วย Apidog
ไม่ว่าคุณจะใช้งาน GLM-5.2 ได้อย่างไร ไม่ว่าจะฟรีหรือเสียเงิน คุณจะต้องยืนยันว่า endpoint ทำงานได้จริงก่อนที่จะนำไปเชื่อมต่อกับแอปของคุณ ไม่ว่าจะเป็นเซิร์ฟเวอร์ Ollama ในเครื่อง, อินสแตนซ์ vLLM หรือ z.ai cloud API การตอบสนองจะเป็น payload ของ chat-completions แบบสตรีมมิ่งที่คุณต้องตรวจสอบ

Apidog เป็นแพลตฟอร์ม API แบบครบวงจรสำหรับสิ่งนี้โดยเฉพาะ คุณสามารถส่งคำขอไปยัง GLM-5.2 endpoint ของคุณ ดูเหตุการณ์ Server-Sent Events ที่สตรีมแบบเรียลไทม์ บันทึกคำขอเป็นเคสที่นำกลับมาใช้ใหม่ได้ และจำลองการตอบสนองเพื่อให้ frontend ของคุณสามารถสร้างได้ก่อนที่โมเดลจะพร้อมใช้งานจริง ชี้ไปที่ http://localhost:11434 สำหรับ Ollama หรือที่ URL พื้นฐานของ z.ai สำหรับคลาวด์ ตั้งค่า Authorization header ของคุณ และคุณก็จะมีชุดทดสอบที่ทำซ้ำได้ในเวลาไม่กี่นาที ดาวน์โหลด Apidog และเก็บไว้ข้าง ๆ เส้นทางฟรีที่คุณเลือก
คำถามที่พบบ่อย
GLM-5.2 ใช้งานได้ฟรีจริงหรือไม่? โมเดลนี้ฟรีภายใต้ใบอนุญาต MIT ดังนั้นการโฮสต์ด้วยตัวเองจึงไม่มีค่าใช้จ่ายด้านลิขสิทธิ์ คุณยังคงต้องจ่ายค่าฮาร์ดแวร์หรือค่าเช่า GPU API แบบโฮสต์มีค่าใช้จ่าย แม้ว่า z.ai มักจะมีเครดิตทดลองใช้และระดับจำกัดการใช้งานให้เริ่มต้น (ตรวจสอบข้อเสนอปัจจุบัน)
ฉันสามารถรัน GLM-5.2 ฟรีด้วย Ollama บนแล็ปท็อปทั่วไปได้หรือไม่? ตามความเป็นจริงแล้ว ไม่ได้ เป็นโมเดล MoE ขนาดประมาณ 753B และแม้แต่ quantized build ก็ยังต้องการหน่วยความจำจำนวนมาก Ollama ทำให้คำสั่งใช้งานง่าย แต่ความต้องการด้านฮาร์ดแวร์สูงมาก คุณต้องใช้เวิร์กสเตชันที่มี VRAM สูง, Mac ที่มีหน่วยความจำรวมขนาดใหญ่, หรือ GPU ที่เช่ามา ดู การเจาะลึกการติดตั้งในเครื่อง สำหรับขนาดที่ต้องการ
มี OpenRouter แบบฟรีสำหรับ GLM-5.2 หรือไม่? ไม่มี OpenRouter ให้บริการ GLM-5.2 แบบจ่ายตามการใช้งานในราคา $1.40 สำหรับอินพุต และ $4.40 สำหรับเอาต์พุตต่อ 1M โทเค็น มันถูก แต่ไม่ฟรี อย่าเชื่อแหล่งข้อมูลใด ๆ ที่อ้างว่ามีช่องทาง OpenRouter ฟรี
วิธีชำระเงินที่ถูกที่สุดในการใช้ GLM-5.2 สำหรับการเขียนโค้ดคืออะไร? GLM Coding Plan Lite tier ราคาประมาณ $3-6/เดือน ณ เดือนมิถุนายน 2026 (ตรวจสอบที่ z.ai) แผนนี้ให้สิทธิ์การเข้าถึงการเขียนโค้ดแบบเหมาจ่ายรายเดือนและปลดล็อก endpoint ที่เข้ากันได้กับ Anthropic สำหรับ Claude Code, Cline และ Cursor
GLM-5.2 เปรียบเทียบกับ GPT-5.5 ในด้านราคาอย่างไร? ตาม VentureBeat, GLM-5.2 ทำได้ดีกว่า GPT-5.5 ในการเปรียบเทียบการเขียนโค้ดแบบ long-horizon หลายรายการ โดยมีค่าใช้จ่ายประมาณหนึ่งในหก สำหรับตัวเลขเต็ม ดูรายละเอียด เกณฑ์มาตรฐานของ GLM-5.2 และ การเปรียบเทียบแบบตัวต่อตัว
จะไปต่อที่ไหนดี
เส้นทางที่ถูกที่สุดขึ้นอยู่กับฮาร์ดแวร์ของคุณทั้งหมด และความถี่ในการใช้งาน การโฮสต์ด้วยตัวเองได้เปรียบในเรื่องความเป็นส่วนตัวและไม่มีการคิดค่าใช้จ่ายตามมิเตอร์ หากคุณสามารถจัดการเรื่องหน่วยความจำได้ เครดิตทดลองใช้และแผน Lite ได้เปรียบในเรื่องความสะดวกสบาย API ที่มีอินพุตแบบแคชได้เปรียบสำหรับแอปที่ใช้บริบทซ้ำ
หากคุณยังคงตัดสินใจอยู่ว่า GLM-5.2 เป็นโมเดลที่ใช่หรือไม่ ให้เริ่มต้นด้วย GLM-5.2 คืออะไร และ GLM-5.2 เปรียบเทียบกับ GLM-5.1 อย่างไร เมื่อคุณพร้อมที่จะสร้างโดยใช้โมเดลนี้ คู่มือ API ของ GLM-5.2 และ รายละเอียดราคา จะครอบคลุมส่วนที่เหลือ และ Apidog จะช่วยจัดการการทดสอบระหว่างนั้น
