GLM-5.3-Flash คืออะไร? โมเดล Open-Weights มัลติโมดอลโดยกำเนิดตัวแรกจาก Z.ai

GLM-5.3-Flash ของ Z.ai เป็นโมเดล MIT ขนาด 320B-A18B ที่รองรับอินพุตภาพในตัวและมีคอนเท็กซ์ 1M สเปก ผลการทดสอบ และทำไม Flash จึงหมายถึงราคาถูก ไม่ใช่รวดเร็ว

INEZA Felin-Michel

INEZA Felin-Michel

27 August 2026

GLM-5.3-Flash คืออะไร? โมเดล Open-Weights มัลติโมดอลโดยกำเนิดตัวแรกจาก Z.ai

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

Z.ai เปิดตัว GLM-5.3-Flash เมื่อวันที่ 26 สิงหาคม 2026 เป็นโมเดลแบบ mixture-of-experts ที่มีพารามิเตอร์รวม 320 พันล้านตัว โดยมีพารามิเตอร์ที่ทำงานอยู่ 18 พันล้านตัว เผยแพร่ภายใต้ใบอนุญาต MIT และเป็นโมเดลแรกในซีรีส์ GLM-5 ที่จัดการรูปภาพได้ในตัวโดยไม่ต้องใช้อะแดปเตอร์วิชันที่ติดตั้งเพิ่มเติม

นอกจากนี้ยังเป็นโมเดลที่นักพัฒนาจำนวนมากใช้งานมาแล้วหนึ่งสัปดาษโดยไม่รู้ตัว รายละเอียดเพิ่มเติมอยู่ด้านล่างนี้

หากคุณมาที่นี่โดยคาดหวังว่าคำว่า “Flash” จะหมายถึง “เร็ว” โพสต์นี้จะขอโต้แย้งกับคุณ การตั้งชื่อแบบนั้นมาจาก Google ซึ่งโมเดล Flash เป็นโมเดลที่มีความหน่วงต่ำจริงๆ แต่ในที่นี้มันมีความหมายแตกต่างกัน และการเข้าใจความแตกต่างนี้อย่างถูกต้องจะส่งผลต่อว่าโมเดลนี้เหมาะกับปริมาณงานของคุณหรือไม่

สรุปสั้นๆ

ข้อมูลจำเพาะ

คุณสมบัติ ค่า
พารามิเตอร์รวม 320B
พารามิเตอร์ที่ทำงานอยู่ 18B
สถาปัตยกรรม Mixture of experts, hybrid linear และ sparse attention
ใบอนุญาต MIT
หน้าต่างบริบท 1,048,576 โทเค็น
รูปแบบอินพุต ข้อความ, รูปภาพ, วิดีโอ, ไฟล์
เอาต์พุต ข้อความ
โหมดการให้เหตุผล low, high, max (ค่าเริ่มต้น max)
API model id glm-5.3-flash
Hugging Face zai-org/GLM-5.3-Flash

ตัวเลขหนึ่งที่ต้องพิจารณาอย่างระมัดระวังคือ: โทเค็นเอาต์พุตสูงสุด OpenRouter ระบุ 131,072 และการ์ดโมเดลของ Hugging Face ระบุ 163,840 แหล่งข้อมูลเหล่านี้ไม่ตรงกันและ Z.ai ยังไม่ได้เผยแพร่ตัวเลขที่ชัดเจน หากแอปพลิเคชันของคุณขึ้นอยู่กับการสร้างผลลัพธ์ที่ยาวมากในการเรียกครั้งเดียว โปรดตรวจสอบขีดจำกัดกับผู้ให้บริการจริงของคุณก่อนที่จะนำไปใช้งาน

ความสามารถหลายรูปแบบในตัวคือข่าวจริง

ความสามารถในการมองเห็นก่อนหน้านี้ทั้งหมดในสายผลิตภัณฑ์ GLM มาในรูปแบบโมเดลแยกต่างหากหรือเส้นทางแยกต่างหาก Z.ai ได้เผยแพร่ GLM-5V-Turbo และ GLM-4.6V เป็นโมเดลวิชันที่แยกต่างหาก หากคุณต้องการให้โมเดล GLM ดูภาพหน้าจอ คุณจะต้องเรียกใช้เอนด์พอยต์ที่แตกต่างจากที่ใช้สำหรับการรับส่งข้อมูลข้อความของคุณ

GLM-5.3-Flash รวมสิ่งเหล่านั้นเข้าด้วยกัน รูปภาพ วิดีโอ และไฟล์เป็นบล็อกเนื้อหาในการร้องขอการสร้างข้อความแชทเดียวกันกับที่ส่งข้อความของคุณ มี ID โมเดลเดียว บรรทัดการเรียกเก็บเงินเดียว และหน้าต่างบริบทเดียวที่เก็บรูปภาพของคุณและข้อความแวดล้อมหนึ่งล้านโทเค็นพร้อมกัน

ส่วนสุดท้ายนั่นแหละที่น่าสนใจ หน้าต่างบริบท 1M โทเค็นที่ยอมรับรูปภาพได้หมายความว่าคุณสามารถใส่เอกสารข้อมูลจำเพาะขนาดยาวและภาพหน้าจอของผลลัพธ์ที่แสดงในพรอมต์เดียวกัน และขอให้โมเดลประนีประนอมข้อมูลเหล่านั้น การนำเสนอของ Z.ai เองก็เน้นย้ำเรื่องนี้: โดยอธิบายว่าโมเดลสังเกต “อินเทอร์เฟซ ผลลัพธ์การเรนเดอร์ และข้อเสนอแนะการโต้ตอบ” ซึ่งเป็นกรณีการใช้งานของตัวแทนโค้ด ไม่ใช่การบรรยายภาพถ่าย

หากคุณกำลังทำงานกับโมเดลวิชันในวงกว้างมากขึ้น คู่มือของเราเกี่ยวกับ API ของ GLM-5V-Turbo จะครอบคลุมแนวทางวิชันแบบเฉพาะที่เก่ากว่า และ GLM-OCR สำหรับการทำความเข้าใจเอกสาร ครอบคลุมกรณีเฉพาะทาง

สถาปัตยกรรมโดยสังเขป

Z.ai สร้าง GLM-5.3-Flash บนโมเดลพื้นฐานใหม่ แทนที่จะเป็นการฝึกอบรมเพิ่มเติมจาก GLM-5.2 การออกแบบสองอย่างมีความสำคัญต่อพฤติกรรมของมัน:

กราฟแสดงโครงสร้าง hybrid linear และ sparse attention

Hybrid attention โมเดลผสมผสาน linear attention เข้ากับ sparse attention โดย linear attention จัดการการพึ่งพากันภายในพื้นที่ได้อย่างประหยัด ในขณะที่ sparse attention เข้าถึงโทเค็นที่มีความเกี่ยวข้องในระดับสากล ผลลัพธ์ที่ระบุคือการคำนวณ attention น้อยลงประมาณสามเท่าเมื่อเทียบกับ GLM-5.3 และแคช KV ที่เล็กลงประมาณ 4.4 เท่า

Manifold-Constrained Hyper-Connections เป็นคำศัพท์ของ Z.ai สำหรับการทำงานด้านประสิทธิภาพการปรับขนาดในการเปิดตัวครั้งนี้ ยังไม่มีรายละเอียดสาธารณะเพียงพอที่จะประเมินได้อย่างอิสระ ดังนั้นจึงควรถือว่าเป็นคุณสมบัติทางสถาปัตยกรรมที่ผู้ขายอธิบายไว้มากกว่าข้อได้เปรียบที่ได้รับการพิสูจน์แล้ว

การลดแคช KV เป็นส่วนที่มีผลกระทบในทางปฏิบัติที่ชัดเจน แคช KV คือสิ่งที่ทำให้การอนุมานบริบทที่ยาวนานต้องใช้หน่วยความจำสูง และการลดขนาดลง 4.4 เท่าเป็นเหตุผลหลักที่ทำให้โมเดลนี้สามารถให้บริการได้ในราคาเพียงหนึ่งในสิบของ GLM-5.2 ในขณะที่ยังคงรักษาหน้าต่าง 1M ไว้ได้

การฝึกอบรมใช้คลังข้อมูลที่ Z.ai อธิบายว่าเป็นโทเค็นหลายรูปแบบประมาณ 30 ล้านล้านโทเค็น

เกี่ยวกับชื่อ

Artificial Analysis วัด GLM-5.3-Flash ได้ที่ 48.7 โทเค็นเอาต์พุตต่อวินาที สำหรับบริบทแล้ว นี่คืออัตราที่ค่อนข้างต่ำสำหรับโมเดล open-weight ที่มีขนาดใกล้เคียงกัน GLM-5.3 ซึ่งเป็นรุ่นพี่ที่ใหญ่กว่า ทำงานได้ประมาณ 86 โทเค็นต่อวินาทีในการวัดเดียวกัน

ดังนั้นโมเดล Flash จึงมีความเร็วประมาณครึ่งหนึ่งของโมเดลที่ไม่ใช่ Flash

สิ่งที่มันทำได้ดีคือเวลาในการแสดงผลโทเค็นแรก ซึ่งอยู่ที่ 1.52 วินาที เทียบกับค่ามัธยฐานของโมเดล open-weight ที่ 2.14 วินาที หากปริมาณงานของคุณมีการโต้ตอบสั้นๆ หลายครั้ง การตอบสนองนี้มีประโยชน์จริง แต่ถ้าปริมาณงานของคุณคือการสร้างเอกสารขนาดยาว คุณจะต้องรอนานกว่าที่ใช้กับ GLM-5.3

ประสิทธิภาพที่โมเดลนี้นำเสนอคือในเรื่องของ ต้นทุนและหน่วยความจำ ไม่ใช่ความเร็วในการสร้างผลลัพธ์จริงในเวลานาฬิกา การลดแคช KV และการคำนวณ attention ที่ต่ำกว่าส่งผลให้ราคาต่อโทเค็นถูกลงและใช้พื้นที่ในการให้บริการน้อยลง แต่ไม่ได้หมายถึงการสตรีมที่เร็วขึ้น

สิ่งนี้สำคัญเพราะข่าวสารส่วนใหญ่ที่เผยแพร่ในวันหลังการเปิดตัวมักจะย้ำกรอบการนำเสนอของผู้ขายโดยไม่ได้ตรวจสอบตัวเลขปริมาณงาน ซึ่งเป็นข้อมูลสาธารณะตลอดเวลา เลือกรุ่นนี้เพราะราคาไม่แพงและจัดการรูปภาพได้ ไม่ใช่เพราะคาดหวังว่าจะสตรีมได้เร็ว

ผลการทดสอบ

ตัวเลขที่ Z.ai เผยแพร่เมื่อเปิดตัว ดังนั้นโปรดอ่านว่าเป็นคำกล่าวอ้างของผู้ขายจนกว่าบุคคลที่สามจะสามารถทำซ้ำได้:

กราฟเปรียบเทียบผลการทดสอบของโมเดลต่างๆ

ตัวเลขที่เป็นอิสระมาจาก Artificial Analysis ซึ่งจัดอันดับ GLM-5.3-Flash อยู่ที่ 57 ใน Intelligence Index v4.1.1 ของพวกเขา GLM-5.3 ทำคะแนนได้ 60 ค่ามัธยฐานสำหรับโมเดล open-weight ที่มีขนาดใกล้เคียงกันคือ 27 ดังนั้น 57 จึงเป็นผลลัพธ์ที่ดีสำหรับโมเดลประเภทนี้ แม้ว่าจะต่ำกว่ารุ่นพี่ของมันก็ตาม

Z.ai นำเสนอโมเดลนี้ว่ามีความใกล้เคียงกับ Claude Opus 4.8 ในด้านการเขียนโค้ดและการทำงานแบบตัวแทน นี่เป็นการระบุลักษณะของโมเดลโดยผู้ขายจากการประเมินภายในของตนเอง ไม่ใช่ผลลัพธ์ที่วัดได้จากบุคคลที่สาม และช่องว่างสามคะแนนใน Intelligence Index เมื่อเทียบกับ GLM-5.3 ของตัวเอง บ่งชี้ว่าควรใช้ความระมัดระวังในการเชื่อถือ

สำหรับวิธีการพัฒนาเรื่องราวเกณฑ์มาตรฐาน GLM ในการเผยแพร่ครั้งก่อนๆ การวิเคราะห์เกณฑ์มาตรฐาน GLM-5.2 ของเราอธิบายว่าการประเมินแต่ละรายการวัดอะไรบ้าง

สัปดาห์ Ox Alpha

เมื่อวันที่ 20 สิงหาคม โมเดลนิรนามชื่อ ox-alpha ปรากฏบนแพลตฟอร์มการอนุมานของบุคคลที่สาม โดยมีหน้าต่างบริบท 1M โทเค็นและราคาเป็นศูนย์ มันกลายเป็นหนึ่งในโมเดลที่ใช้งานมากที่สุดบนแพลตฟอร์มเหล่านั้นภายในไม่กี่วัน ชุมชนระบุว่าเป็น Zhipu ภายในเวลาประมาณ 48 ชั่วโมง โดยพิจารณาจากลักษณะผลลัพธ์

ภาพแสดงหน้าจอการใช้งานโมเดล ox-alpha

เมื่อวันที่ 26 สิงหาคม Z.ai ยืนยันว่า: Ox Alpha คือ GLM-5.3-Flash และสัปดาห์ฟรีนั้นเป็นการทดสอบปริมาณงานที่จงใจ

Z.ai ยังกล่าวอีกว่า ในช่วงสัปดาห์นั้น การรับส่งข้อมูลทั้งหมดให้บริการบนตัวเร่งความเร็วของจีนโดยใช้สแตกที่ใช้ SGLang และอ้างว่าต้นทุนการให้บริการต่อโทเค็นเทียบเท่ากับฮาร์ดแวร์ NVIDIA ทั่วไป นี่คือคำกล่าวอ้างของผู้ขายเกี่ยวกับโครงสร้างพื้นฐานของตนเองที่ไม่มีการตรวจสอบอิสระ ดังนั้นโปรดพิจารณาตามความเหมาะสม

เราเคยเขียนถึงรูปแบบนี้มาก่อนเมื่อ Pony Alpha กลายเป็นโมเดล DeepSeek หรือ GLM การเปิดตัวแบบลับๆ บนเราเตอร์ของบุคคลที่สามกำลังกลายเป็นขั้นตอนมาตรฐานก่อนการเผยแพร่ และข้อคิดที่มีประโยชน์คือ โมเดลนิรนามที่มีความสามารถพิเศษพร้อมหน้าต่างบริบทที่ดูแปลกๆ มักจะเป็นโมเดลเรือธงที่ยังไม่เปิดตัวของใครบางคนที่กำลังรวบรวมข้อมูลการประเมิน

วิธีการใช้งานจริง

Hosted API เอนด์พอยต์ของ Z.ai เข้ากันได้กับ OpenAI ชี้ไคลเอ็นต์ที่มีอยู่ของคุณไปที่ https://api.z.ai/api/paas/v4/ และตั้งค่าโมเดลเป็น glm-5.3-flash คู่มือ API ของ GLM-5.3-Flash ของเราจะอธิบายขั้นตอนการยืนยันตัวตน เพย์โหลดอินพุตรูปภาพ และพารามิเตอร์ความพยายามในการให้เหตุผล

ผู้ให้บริการบุคคลที่สาม OpenRouter มีให้บริการในชื่อ z-ai/glm-5.3-flash นอกจากนี้ยังมีอยู่บน Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten และ io.net ราคาอาจแตกต่างกันไประหว่างผู้ค้าปลีก บางครั้งก็แตกต่างกันมาก

เอเจนต์เขียนโค้ด Flash ถูกรวมอยู่ใน GLM Coding Plan และมีโควตาที่ใช้งานได้มากกว่า GLM-5.3 ถึงสามเท่า ซึ่งเป็นเหตุผลในทางปฏิบัติที่ผู้สมัครสมาชิกจะเปลี่ยนไปใช้ เอกสารประกอบของ Z.ai ยังระบุด้วยว่าการเรียกนอกเวลาทำการจะใช้คะแนนมาตรฐานเพียงครึ่งหนึ่ง

ติดตั้งเอง (Self-hosted) น้ำหนักโมเดลอยู่ภายใต้ใบอนุญาต MIT และอยู่บน Hugging Face vLLM, SGLang, TokenSpeed และ KTransformers ทั้งหมดรองรับ และมีการทำ quantization แบบ GGUF สำหรับเครื่องที่มีขนาดเล็กกว่า

คุณควรใช้มันหรือไม่?

ใช้ GLM-5.3-Flash หากคุณต้องการความเข้าใจภาพหรือวิดีโอในการเรียกใช้พร้อมกับข้อความของคุณ หากต้นทุนต่อโทเค็นคือข้อจำกัดที่คุณกำลังปรับให้เหมาะสม หรือหากคุณต้องการน้ำหนักโมเดลแบบ open-source ที่คุณสามารถโฮสต์เองได้ภายใต้ใบอนุญาตที่อนุญาต

เลือกใช้ GLM-5.3 แทน หากคุณต้องการคุณภาพการให้เหตุผลที่สูงที่สุด หรือหากปริมาณงานการสร้างผลลัพธ์สำคัญกว่าราคาสำหรับคุณ การเปรียบเทียบเคียงข้างกันของทั้งสองรุ่น ของเราจะอธิบายการตัดสินใจอย่างละเอียด และ GLM-5.3 คืออะไร ครอบคลุมโมเดลพื้นฐานในแง่ของตัวมันเอง

ไม่ว่าคุณจะเลือกอะไร การสลับโมเดลก็แค่การเปลี่ยน ID โมเดลเพียงบรรทัดเดียวบนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ซึ่งทำให้ง่ายต่อการทดสอบทั้งสองกับปริมาณงานของคุณเอง แทนที่จะเชื่อถือตารางเปรียบเทียบของใครก็ตาม นั่นเป็นวิธีที่ถูกต้องในการตัดสินใจ

การทดสอบการสลับโมเดลอย่างถูกต้องหมายถึงการส่งคำขอจริงและตรวจสอบการตอบสนองจริง รวมถึงการตอบสนองแบบหลายรูปแบบที่ยากต่อการสร้างด้วยตนเองใน curl Apidog ช่วยให้คุณบันทึกการเรียกเหล่านั้นเป็นคอลเลกชันที่นำกลับมาใช้ใหม่ได้พร้อมกับการยืนยันที่แนบมา ดังนั้นเมื่อคุณเปลี่ยนจาก GLM-5.3 เป็น Flash คุณจะสามารถยืนยันได้ว่ารูปแบบการตอบสนองไม่เปลี่ยนแปลง แทนที่จะไปพบเอาตอนที่ใช้งานจริง

คำถามที่พบบ่อย

GLM-5.3-Flash ฟรีหรือไม่? ไม่ฟรีอีกต่อไปแล้ว สัปดาห์ฟรี Ox Alpha สิ้นสุดลงเมื่อมีการประกาศโมเดลอย่างเป็นทางการ มีส่วนลด 50% สำหรับการเปิดตัวจนถึงวันที่ 9 กันยายน 2026 หลังจากนั้นจะใช้อัตราปกติ

มันเร็วกว่า GLM-5.3 หรือไม่? ไม่ มันสร้างโทเค็นได้ประมาณ 49 โทเค็นต่อวินาที เทียบกับ GLM-5.3 ที่ทำได้ 86 โทเค็นต่อวินาที แต่มันเริ่มตอบสนองเร็วกว่า โดยใช้เวลา 1.52 วินาทีในการแสดงผลโทเค็นแรก

มันสามารถจัดการบริบทหนึ่งล้านโทเค็นได้จริงหรือ? หน้าต่างที่กำหนดค่าไว้คือ 1,048,576 โทเค็น ซึ่งได้รับการยืนยันในการกำหนดค่าโมเดลและโดย Artificial Analysis โปรดทราบว่า OpenRouter ระบุตัวเลขที่สูงกว่าคือ 1,310,720; ควรถือว่าเป็นรายการของผู้ให้บริการมากกว่าเป็นข้อมูลจำเพาะของโมเดล

มันรับวิดีโอได้หรือไม่? เอกสารประกอบของ Z.ai ระบุว่ารองรับอินพุตข้อความ รูปภาพ วิดีโอ และไฟล์ การสนับสนุนวิดีโอเป็นของใหม่และยังไม่ได้รับการใช้งานอย่างแพร่หลายเท่ากับอินพุตรูปภาพ ดังนั้นโปรดตรวจสอบกับสื่อของคุณเองก่อนที่จะพึ่งพา

น้ำหนักโมเดลอยู่ภายใต้ใบอนุญาตใด? MIT โดยน้ำหนักโมเดลเผยแพร่ที่ zai-org/GLM-5.3-Flash บน Hugging Face

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API