Z.ai เปิดตัว GLM-5.3-Flash เมื่อวันที่ 26 สิงหาคม 2026 เป็นโมเดลแบบ mixture-of-experts ที่มีพารามิเตอร์รวม 320 พันล้านตัว โดยมีพารามิเตอร์ที่ทำงานอยู่ 18 พันล้านตัว เผยแพร่ภายใต้ใบอนุญาต MIT และเป็นโมเดลแรกในซีรีส์ GLM-5 ที่จัดการรูปภาพได้ในตัวโดยไม่ต้องใช้อะแดปเตอร์วิชันที่ติดตั้งเพิ่มเติม
นอกจากนี้ยังเป็นโมเดลที่นักพัฒนาจำนวนมากใช้งานมาแล้วหนึ่งสัปดาษโดยไม่รู้ตัว รายละเอียดเพิ่มเติมอยู่ด้านล่างนี้
หากคุณมาที่นี่โดยคาดหวังว่าคำว่า “Flash” จะหมายถึง “เร็ว” โพสต์นี้จะขอโต้แย้งกับคุณ การตั้งชื่อแบบนั้นมาจาก Google ซึ่งโมเดล Flash เป็นโมเดลที่มีความหน่วงต่ำจริงๆ แต่ในที่นี้มันมีความหมายแตกต่างกัน และการเข้าใจความแตกต่างนี้อย่างถูกต้องจะส่งผลต่อว่าโมเดลนี้เหมาะกับปริมาณงานของคุณหรือไม่
สรุปสั้นๆ
- มันคืออะไร: โมเดลแบบ open-weights (MIT) แบบ mixture-of-experts ขนาด 320B-A18B จาก Z.ai เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026
- การเปลี่ยนแปลงหลัก: ความสามารถหลายรูปแบบในตัว (native multimodality) การป้อนข้อมูลรูปภาพ วิดีโอ และไฟล์เข้าสู่โมเดลโดยตรง GLM-5.3 กำหนดเส้นทางวิชันผ่านอะแดปเตอร์แยกต่างหาก และ GLM-5.2 รองรับเฉพาะข้อความ
- บริบท: 1,048,576 โทเค็น ซึ่งเป็นหน้าต่าง 1M เดียวกันกับ GLM-5.3
- จุดขายที่แท้จริง: ราคา Z.ai ระบุว่ามีราคาประมาณหนึ่งในสิบของ GLM-5.2 โดยมีอัตรามาตรฐานที่ $0.15 ต่อหนึ่งล้านโทเค็นอินพุต และ $0.50 ต่อหนึ่งล้านโทเค็นเอาต์พุต
- คำเตือนที่ซื่อสัตย์: มันไม่เร็ว Artificial Analysis วัดได้ 48.7 โทเค็นเอาต์พุตต่อวินาที ซึ่งถือว่าช้าสำหรับขนาดของมัน แต่เวลาในการแสดงผลโทเค็นแรกนั้นดีมากที่ 1.52 วินาที
- หาได้จากที่ไหน: Z.ai API ในชื่อ
glm-5.3-flashรวมถึง OpenRouter, Cloudflare Workers AI, Vercel AI Gateway และผู้ให้บริการอื่นๆ อีกหลายราย น้ำหนักโมเดลอยู่บน Hugging Face
ข้อมูลจำเพาะ
| คุณสมบัติ | ค่า |
|---|---|
| พารามิเตอร์รวม | 320B |
| พารามิเตอร์ที่ทำงานอยู่ | 18B |
| สถาปัตยกรรม | Mixture of experts, hybrid linear และ sparse attention |
| ใบอนุญาต | MIT |
| หน้าต่างบริบท | 1,048,576 โทเค็น |
| รูปแบบอินพุต | ข้อความ, รูปภาพ, วิดีโอ, ไฟล์ |
| เอาต์พุต | ข้อความ |
| โหมดการให้เหตุผล | low, high, max (ค่าเริ่มต้น max) |
| API model id | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
ตัวเลขหนึ่งที่ต้องพิจารณาอย่างระมัดระวังคือ: โทเค็นเอาต์พุตสูงสุด OpenRouter ระบุ 131,072 และการ์ดโมเดลของ Hugging Face ระบุ 163,840 แหล่งข้อมูลเหล่านี้ไม่ตรงกันและ Z.ai ยังไม่ได้เผยแพร่ตัวเลขที่ชัดเจน หากแอปพลิเคชันของคุณขึ้นอยู่กับการสร้างผลลัพธ์ที่ยาวมากในการเรียกครั้งเดียว โปรดตรวจสอบขีดจำกัดกับผู้ให้บริการจริงของคุณก่อนที่จะนำไปใช้งาน
ความสามารถหลายรูปแบบในตัวคือข่าวจริง
ความสามารถในการมองเห็นก่อนหน้านี้ทั้งหมดในสายผลิตภัณฑ์ GLM มาในรูปแบบโมเดลแยกต่างหากหรือเส้นทางแยกต่างหาก Z.ai ได้เผยแพร่ GLM-5V-Turbo และ GLM-4.6V เป็นโมเดลวิชันที่แยกต่างหาก หากคุณต้องการให้โมเดล GLM ดูภาพหน้าจอ คุณจะต้องเรียกใช้เอนด์พอยต์ที่แตกต่างจากที่ใช้สำหรับการรับส่งข้อมูลข้อความของคุณ
GLM-5.3-Flash รวมสิ่งเหล่านั้นเข้าด้วยกัน รูปภาพ วิดีโอ และไฟล์เป็นบล็อกเนื้อหาในการร้องขอการสร้างข้อความแชทเดียวกันกับที่ส่งข้อความของคุณ มี ID โมเดลเดียว บรรทัดการเรียกเก็บเงินเดียว และหน้าต่างบริบทเดียวที่เก็บรูปภาพของคุณและข้อความแวดล้อมหนึ่งล้านโทเค็นพร้อมกัน
ส่วนสุดท้ายนั่นแหละที่น่าสนใจ หน้าต่างบริบท 1M โทเค็นที่ยอมรับรูปภาพได้หมายความว่าคุณสามารถใส่เอกสารข้อมูลจำเพาะขนาดยาวและภาพหน้าจอของผลลัพธ์ที่แสดงในพรอมต์เดียวกัน และขอให้โมเดลประนีประนอมข้อมูลเหล่านั้น การนำเสนอของ Z.ai เองก็เน้นย้ำเรื่องนี้: โดยอธิบายว่าโมเดลสังเกต “อินเทอร์เฟซ ผลลัพธ์การเรนเดอร์ และข้อเสนอแนะการโต้ตอบ” ซึ่งเป็นกรณีการใช้งานของตัวแทนโค้ด ไม่ใช่การบรรยายภาพถ่าย
หากคุณกำลังทำงานกับโมเดลวิชันในวงกว้างมากขึ้น คู่มือของเราเกี่ยวกับ API ของ GLM-5V-Turbo จะครอบคลุมแนวทางวิชันแบบเฉพาะที่เก่ากว่า และ GLM-OCR สำหรับการทำความเข้าใจเอกสาร ครอบคลุมกรณีเฉพาะทาง
สถาปัตยกรรมโดยสังเขป
Z.ai สร้าง GLM-5.3-Flash บนโมเดลพื้นฐานใหม่ แทนที่จะเป็นการฝึกอบรมเพิ่มเติมจาก GLM-5.2 การออกแบบสองอย่างมีความสำคัญต่อพฤติกรรมของมัน:

Hybrid attention โมเดลผสมผสาน linear attention เข้ากับ sparse attention โดย linear attention จัดการการพึ่งพากันภายในพื้นที่ได้อย่างประหยัด ในขณะที่ sparse attention เข้าถึงโทเค็นที่มีความเกี่ยวข้องในระดับสากล ผลลัพธ์ที่ระบุคือการคำนวณ attention น้อยลงประมาณสามเท่าเมื่อเทียบกับ GLM-5.3 และแคช KV ที่เล็กลงประมาณ 4.4 เท่า
Manifold-Constrained Hyper-Connections เป็นคำศัพท์ของ Z.ai สำหรับการทำงานด้านประสิทธิภาพการปรับขนาดในการเปิดตัวครั้งนี้ ยังไม่มีรายละเอียดสาธารณะเพียงพอที่จะประเมินได้อย่างอิสระ ดังนั้นจึงควรถือว่าเป็นคุณสมบัติทางสถาปัตยกรรมที่ผู้ขายอธิบายไว้มากกว่าข้อได้เปรียบที่ได้รับการพิสูจน์แล้ว
การลดแคช KV เป็นส่วนที่มีผลกระทบในทางปฏิบัติที่ชัดเจน แคช KV คือสิ่งที่ทำให้การอนุมานบริบทที่ยาวนานต้องใช้หน่วยความจำสูง และการลดขนาดลง 4.4 เท่าเป็นเหตุผลหลักที่ทำให้โมเดลนี้สามารถให้บริการได้ในราคาเพียงหนึ่งในสิบของ GLM-5.2 ในขณะที่ยังคงรักษาหน้าต่าง 1M ไว้ได้
การฝึกอบรมใช้คลังข้อมูลที่ Z.ai อธิบายว่าเป็นโทเค็นหลายรูปแบบประมาณ 30 ล้านล้านโทเค็น
เกี่ยวกับชื่อ
Artificial Analysis วัด GLM-5.3-Flash ได้ที่ 48.7 โทเค็นเอาต์พุตต่อวินาที สำหรับบริบทแล้ว นี่คืออัตราที่ค่อนข้างต่ำสำหรับโมเดล open-weight ที่มีขนาดใกล้เคียงกัน GLM-5.3 ซึ่งเป็นรุ่นพี่ที่ใหญ่กว่า ทำงานได้ประมาณ 86 โทเค็นต่อวินาทีในการวัดเดียวกัน
ดังนั้นโมเดล Flash จึงมีความเร็วประมาณครึ่งหนึ่งของโมเดลที่ไม่ใช่ Flash
สิ่งที่มันทำได้ดีคือเวลาในการแสดงผลโทเค็นแรก ซึ่งอยู่ที่ 1.52 วินาที เทียบกับค่ามัธยฐานของโมเดล open-weight ที่ 2.14 วินาที หากปริมาณงานของคุณมีการโต้ตอบสั้นๆ หลายครั้ง การตอบสนองนี้มีประโยชน์จริง แต่ถ้าปริมาณงานของคุณคือการสร้างเอกสารขนาดยาว คุณจะต้องรอนานกว่าที่ใช้กับ GLM-5.3
ประสิทธิภาพที่โมเดลนี้นำเสนอคือในเรื่องของ ต้นทุนและหน่วยความจำ ไม่ใช่ความเร็วในการสร้างผลลัพธ์จริงในเวลานาฬิกา การลดแคช KV และการคำนวณ attention ที่ต่ำกว่าส่งผลให้ราคาต่อโทเค็นถูกลงและใช้พื้นที่ในการให้บริการน้อยลง แต่ไม่ได้หมายถึงการสตรีมที่เร็วขึ้น
สิ่งนี้สำคัญเพราะข่าวสารส่วนใหญ่ที่เผยแพร่ในวันหลังการเปิดตัวมักจะย้ำกรอบการนำเสนอของผู้ขายโดยไม่ได้ตรวจสอบตัวเลขปริมาณงาน ซึ่งเป็นข้อมูลสาธารณะตลอดเวลา เลือกรุ่นนี้เพราะราคาไม่แพงและจัดการรูปภาพได้ ไม่ใช่เพราะคาดหวังว่าจะสตรีมได้เร็ว
ผลการทดสอบ
ตัวเลขที่ Z.ai เผยแพร่เมื่อเปิดตัว ดังนั้นโปรดอ่านว่าเป็นคำกล่าวอ้างของผู้ขายจนกว่าบุคคลที่สามจะสามารถทำซ้ำได้:

ตัวเลขที่เป็นอิสระมาจาก Artificial Analysis ซึ่งจัดอันดับ GLM-5.3-Flash อยู่ที่ 57 ใน Intelligence Index v4.1.1 ของพวกเขา GLM-5.3 ทำคะแนนได้ 60 ค่ามัธยฐานสำหรับโมเดล open-weight ที่มีขนาดใกล้เคียงกันคือ 27 ดังนั้น 57 จึงเป็นผลลัพธ์ที่ดีสำหรับโมเดลประเภทนี้ แม้ว่าจะต่ำกว่ารุ่นพี่ของมันก็ตาม
Z.ai นำเสนอโมเดลนี้ว่ามีความใกล้เคียงกับ Claude Opus 4.8 ในด้านการเขียนโค้ดและการทำงานแบบตัวแทน นี่เป็นการระบุลักษณะของโมเดลโดยผู้ขายจากการประเมินภายในของตนเอง ไม่ใช่ผลลัพธ์ที่วัดได้จากบุคคลที่สาม และช่องว่างสามคะแนนใน Intelligence Index เมื่อเทียบกับ GLM-5.3 ของตัวเอง บ่งชี้ว่าควรใช้ความระมัดระวังในการเชื่อถือ
สำหรับวิธีการพัฒนาเรื่องราวเกณฑ์มาตรฐาน GLM ในการเผยแพร่ครั้งก่อนๆ การวิเคราะห์เกณฑ์มาตรฐาน GLM-5.2 ของเราอธิบายว่าการประเมินแต่ละรายการวัดอะไรบ้าง
สัปดาห์ Ox Alpha
เมื่อวันที่ 20 สิงหาคม โมเดลนิรนามชื่อ ox-alpha ปรากฏบนแพลตฟอร์มการอนุมานของบุคคลที่สาม โดยมีหน้าต่างบริบท 1M โทเค็นและราคาเป็นศูนย์ มันกลายเป็นหนึ่งในโมเดลที่ใช้งานมากที่สุดบนแพลตฟอร์มเหล่านั้นภายในไม่กี่วัน ชุมชนระบุว่าเป็น Zhipu ภายในเวลาประมาณ 48 ชั่วโมง โดยพิจารณาจากลักษณะผลลัพธ์

เมื่อวันที่ 26 สิงหาคม Z.ai ยืนยันว่า: Ox Alpha คือ GLM-5.3-Flash และสัปดาห์ฟรีนั้นเป็นการทดสอบปริมาณงานที่จงใจ
Z.ai ยังกล่าวอีกว่า ในช่วงสัปดาห์นั้น การรับส่งข้อมูลทั้งหมดให้บริการบนตัวเร่งความเร็วของจีนโดยใช้สแตกที่ใช้ SGLang และอ้างว่าต้นทุนการให้บริการต่อโทเค็นเทียบเท่ากับฮาร์ดแวร์ NVIDIA ทั่วไป นี่คือคำกล่าวอ้างของผู้ขายเกี่ยวกับโครงสร้างพื้นฐานของตนเองที่ไม่มีการตรวจสอบอิสระ ดังนั้นโปรดพิจารณาตามความเหมาะสม
เราเคยเขียนถึงรูปแบบนี้มาก่อนเมื่อ Pony Alpha กลายเป็นโมเดล DeepSeek หรือ GLM การเปิดตัวแบบลับๆ บนเราเตอร์ของบุคคลที่สามกำลังกลายเป็นขั้นตอนมาตรฐานก่อนการเผยแพร่ และข้อคิดที่มีประโยชน์คือ โมเดลนิรนามที่มีความสามารถพิเศษพร้อมหน้าต่างบริบทที่ดูแปลกๆ มักจะเป็นโมเดลเรือธงที่ยังไม่เปิดตัวของใครบางคนที่กำลังรวบรวมข้อมูลการประเมิน
วิธีการใช้งานจริง
Hosted API เอนด์พอยต์ของ Z.ai เข้ากันได้กับ OpenAI ชี้ไคลเอ็นต์ที่มีอยู่ของคุณไปที่ https://api.z.ai/api/paas/v4/ และตั้งค่าโมเดลเป็น glm-5.3-flash คู่มือ API ของ GLM-5.3-Flash ของเราจะอธิบายขั้นตอนการยืนยันตัวตน เพย์โหลดอินพุตรูปภาพ และพารามิเตอร์ความพยายามในการให้เหตุผล
ผู้ให้บริการบุคคลที่สาม OpenRouter มีให้บริการในชื่อ z-ai/glm-5.3-flash นอกจากนี้ยังมีอยู่บน Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten และ io.net ราคาอาจแตกต่างกันไประหว่างผู้ค้าปลีก บางครั้งก็แตกต่างกันมาก
เอเจนต์เขียนโค้ด Flash ถูกรวมอยู่ใน GLM Coding Plan และมีโควตาที่ใช้งานได้มากกว่า GLM-5.3 ถึงสามเท่า ซึ่งเป็นเหตุผลในทางปฏิบัติที่ผู้สมัครสมาชิกจะเปลี่ยนไปใช้ เอกสารประกอบของ Z.ai ยังระบุด้วยว่าการเรียกนอกเวลาทำการจะใช้คะแนนมาตรฐานเพียงครึ่งหนึ่ง
ติดตั้งเอง (Self-hosted) น้ำหนักโมเดลอยู่ภายใต้ใบอนุญาต MIT และอยู่บน Hugging Face vLLM, SGLang, TokenSpeed และ KTransformers ทั้งหมดรองรับ และมีการทำ quantization แบบ GGUF สำหรับเครื่องที่มีขนาดเล็กกว่า
คุณควรใช้มันหรือไม่?
ใช้ GLM-5.3-Flash หากคุณต้องการความเข้าใจภาพหรือวิดีโอในการเรียกใช้พร้อมกับข้อความของคุณ หากต้นทุนต่อโทเค็นคือข้อจำกัดที่คุณกำลังปรับให้เหมาะสม หรือหากคุณต้องการน้ำหนักโมเดลแบบ open-source ที่คุณสามารถโฮสต์เองได้ภายใต้ใบอนุญาตที่อนุญาต
เลือกใช้ GLM-5.3 แทน หากคุณต้องการคุณภาพการให้เหตุผลที่สูงที่สุด หรือหากปริมาณงานการสร้างผลลัพธ์สำคัญกว่าราคาสำหรับคุณ การเปรียบเทียบเคียงข้างกันของทั้งสองรุ่น ของเราจะอธิบายการตัดสินใจอย่างละเอียด และ GLM-5.3 คืออะไร ครอบคลุมโมเดลพื้นฐานในแง่ของตัวมันเอง
ไม่ว่าคุณจะเลือกอะไร การสลับโมเดลก็แค่การเปลี่ยน ID โมเดลเพียงบรรทัดเดียวบนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ซึ่งทำให้ง่ายต่อการทดสอบทั้งสองกับปริมาณงานของคุณเอง แทนที่จะเชื่อถือตารางเปรียบเทียบของใครก็ตาม นั่นเป็นวิธีที่ถูกต้องในการตัดสินใจ
การทดสอบการสลับโมเดลอย่างถูกต้องหมายถึงการส่งคำขอจริงและตรวจสอบการตอบสนองจริง รวมถึงการตอบสนองแบบหลายรูปแบบที่ยากต่อการสร้างด้วยตนเองใน curl Apidog ช่วยให้คุณบันทึกการเรียกเหล่านั้นเป็นคอลเลกชันที่นำกลับมาใช้ใหม่ได้พร้อมกับการยืนยันที่แนบมา ดังนั้นเมื่อคุณเปลี่ยนจาก GLM-5.3 เป็น Flash คุณจะสามารถยืนยันได้ว่ารูปแบบการตอบสนองไม่เปลี่ยนแปลง แทนที่จะไปพบเอาตอนที่ใช้งานจริง
คำถามที่พบบ่อย
GLM-5.3-Flash ฟรีหรือไม่? ไม่ฟรีอีกต่อไปแล้ว สัปดาห์ฟรี Ox Alpha สิ้นสุดลงเมื่อมีการประกาศโมเดลอย่างเป็นทางการ มีส่วนลด 50% สำหรับการเปิดตัวจนถึงวันที่ 9 กันยายน 2026 หลังจากนั้นจะใช้อัตราปกติ
มันเร็วกว่า GLM-5.3 หรือไม่? ไม่ มันสร้างโทเค็นได้ประมาณ 49 โทเค็นต่อวินาที เทียบกับ GLM-5.3 ที่ทำได้ 86 โทเค็นต่อวินาที แต่มันเริ่มตอบสนองเร็วกว่า โดยใช้เวลา 1.52 วินาทีในการแสดงผลโทเค็นแรก
มันสามารถจัดการบริบทหนึ่งล้านโทเค็นได้จริงหรือ? หน้าต่างที่กำหนดค่าไว้คือ 1,048,576 โทเค็น ซึ่งได้รับการยืนยันในการกำหนดค่าโมเดลและโดย Artificial Analysis โปรดทราบว่า OpenRouter ระบุตัวเลขที่สูงกว่าคือ 1,310,720; ควรถือว่าเป็นรายการของผู้ให้บริการมากกว่าเป็นข้อมูลจำเพาะของโมเดล
มันรับวิดีโอได้หรือไม่? เอกสารประกอบของ Z.ai ระบุว่ารองรับอินพุตข้อความ รูปภาพ วิดีโอ และไฟล์ การสนับสนุนวิดีโอเป็นของใหม่และยังไม่ได้รับการใช้งานอย่างแพร่หลายเท่ากับอินพุตรูปภาพ ดังนั้นโปรดตรวจสอบกับสื่อของคุณเองก่อนที่จะพึ่งพา
น้ำหนักโมเดลอยู่ภายใต้ใบอนุญาตใด? MIT โดยน้ำหนักโมเดลเผยแพร่ที่ zai-org/GLM-5.3-Flash บน Hugging Face
