أصدرت Z.ai نموذج GLM-5.3-Flash في 26 أغسطس 2026. وهو نموذج مزيج من الخبراء (mixture-of-experts) يضم 320 مليار معامل مع 18 مليار معامل نشط، ويتم شحنه بترخيص MIT، وهو النموذج الأول في سلسلة GLM-5 الذي يتعامل مع الصور بشكل أساسي بدلاً من خلال محول رؤية إضافي.
كما أنه النموذج الذي كان العديد من المطورين يستخدمونه بالفعل لمدة أسبوع دون علمهم. المزيد حول ذلك أدناه.
إذا أتيت إلى هنا متوقعًا أن كلمة "Flash" تعني "سريع"، فإن هذا المنشور سيخالفك الرأي. يأتي هذا الاصطلاح في التسمية من Google، حيث نماذج Flash هي بالفعل الفئة ذات زمن الاستجابة المنخفض. هنا، تعني شيئًا مختلفًا، وفهم هذا التمييز بشكل صحيح يغير ما إذا كان هذا النموذج يناسب عبء عملك أم لا.
خلاصة القول (TL;DR)
- ما هو: نموذج مزيج من الخبراء مفتوح الأوزان (MIT) بحجم 320 مليار معامل (18 مليار معامل نشط) من Z.ai، تم إصداره في 26 أغسطس 2026.
- التغيير الأبرز: تعدد الوسائط الأصيل (native multimodality). يتم إدخال الصور ومقاطع الفيديو والملفات مباشرة إلى النموذج. يوجه GLM-5.3 الرؤية عبر محولات منفصلة، وكان GLM-5.2 نصيًا فقط.
- السياق: 1,048,576 رمزًا، نفس نافذة الـ 1M مثل GLM-5.3.
- نقطة البيع الحقيقية: التكلفة. تقدرها Z.ai بحوالي عُشر سعر GLM-5.2، بمعدل سعر قائمة يبلغ 0.15 دولار لكل مليون رمز إدخال و 0.50 دولار لكل مليون رمز إخراج.
- التحذير الصادق: إنه ليس سريعًا. يقيس Artificial Analysis 48.7 رمز إخراج في الثانية، وهو بطيء بالنسبة لفئته الحجمية. وقت الحصول على الرمز الأول جيد بالفعل عند 1.52 ثانية.
- من أين تحصل عليه: واجهة برمجة تطبيقات Z.ai باسم
glm-5.3-flash، بالإضافة إلى OpenRouter، Cloudflare Workers AI، Vercel AI Gateway، والعديد من الموفرين الآخرين. الأوزان متوفرة على Hugging Face.
المواصفات
| الخاصية | القيمة |
|---|---|
| إجمالي المعاملات | 320 مليار |
| المعاملات النشطة | 18 مليار |
| البنية | مزيج من الخبراء، انتباه خطي ومبعثر هجين |
| الترخيص | MIT |
| نافذة السياق | 1,048,576 رمزًا |
| وسائط الإدخال | نص، صورة، فيديو، ملفات |
| الإخراج | نص |
| أنماط الاستدلال | منخفض، مرتفع، أقصى (الافتراضي أقصى) |
| معرف نموذج API | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
رقم واحد يجب التعامل معه بحذر: الحد الأقصى لرموز الإخراج. يسرد OpenRouter 131,072 وتشير بطاقة نموذج Hugging Face إلى 163,840. هذه المصادر تختلف ولم تنشر Z.ai رقمًا يحسم الأمر. إذا كان تطبيقك يعتمد على عمليات توليد فردية طويلة جدًا، فتحقق من الحد الأقصى مع مزودك الفعلي قبل البناء حوله.
تعدد الوسائط الأصيل هو الخبر الحقيقي
كل قدرة رؤية سابقة في خط GLM وصلت كنموذج منفصل أو مسار منفصل. شحنت Z.ai نموذجي GLM-5V-Turbo و GLM-4.6V كنماذج رؤية مميزة. إذا أردت أن ينظر نموذج GLM إلى لقطة شاشة، كنت تستدعي نقطة نهاية مختلفة عن تلك التي يستخدمها حركة المرور النصية الخاصة بك.
يعمل GLM-5.3-Flash على دمج ذلك. الصور ومقاطع الفيديو والملفات هي كتل محتوى في نفس طلب إكمال الدردشة الذي يحمل نصك. يوجد معرف نموذج واحد، وسطر فاتورة واحد، ونافذة سياق واحدة تحتفظ بصورتك ومليون رمز من النص المحيط في نفس الوقت.
هذا الجزء الأخير هو المثير للاهتمام. نافذة سياق بحجم 1M رمز تقبل الصور أيضًا تعني أنه يمكنك وضع وثيقة مواصفات طويلة ولقطة شاشة للنتيجة المعروضة في نفس المطالبة وطلب من النموذج التوفيق بينهما. تعتمد Z.ai في وصفها الخاص على هذا: حيث تصف النموذج وهو يلاحظ "الواجهات، نتائج العرض، وردود فعل التفاعل"، وهي حالة استخدام لوكيل برمجي، وليست لالتقاط صور.
إذا كنت تعمل مع نماذج الرؤية على نطاق أوسع، فإن دليلنا لواجهة برمجة تطبيقات GLM-5V-Turbo يغطي نهج الرؤية المخصص الأقدم، ويغطي GLM-OCR لفهم المستندات الحالة المتخصصة.
الهندسة المعمارية، بإيجاز
قامت Z.ai ببناء GLM-5.3-Flash على نموذج أساسي جديد بدلاً من إعادة تدريب GLM-5.2. هناك خياران تصميميان مهمان لكيفية تصرفه:

الانتباه الهجين (Hybrid attention). يمزج النموذج بين الانتباه الخطي (linear attention) والانتباه المبعثر (sparse attention). يتعامل الانتباه الخطي مع التبعيات المحلية بتكلفة منخفضة؛ بينما يصل الانتباه المبعثر إلى الرموز ذات الصلة العالمية. النتيجة المعلنة هي حوالي ثلاثة أضعاف حوسبة انتباه أقل من GLM-5.3 وذاكرة تخزين مؤقت KV أصغر بحوالي 4.4 مرة.
الروابط الفائقة المقيدة بالمتشعبات (Manifold-Constrained Hyper-Connections). هذا هو مصطلح Z.ai لعملها في كفاءة التوسع في هذا الإصدار. لا توجد تفاصيل عامة كافية حتى الآن لتقييمها بشكل مستقل، لذا تعامل معها كميزة معمارية وصفها البائع وليست ميزة مثبتة.
يعد تقليل ذاكرة التخزين المؤقت KV هو الجزء الذي له عواقب عملية واضحة. ذاكرة التخزين المؤقت KV هي ما يجعل الاستدلال ذو السياق الطويل مكلفًا في الذاكرة، وتقليصها بمقدار 4.4x هو السبب الرئيسي وراء إمكانية تقديم هذا النموذج بعُشر سعر GLM-5.2 مع الحفاظ على نافذة بحجم 1M.
استخدم التدريب مجموعة بيانات تصفها Z.ai بأنها حوالي 30 تريليون رمز متعدد الوسائط.
حول الاسم
يقيس Artificial Analysis نموذج GLM-5.3-Flash بسرعة 48.7 رمز إخراج في الثانية. وللسياق، هذا يقع في الطرف الأدنى لنماذج الأوزان المفتوحة ذات الحجم المماثل. يعمل GLM-5.3، الأخ الأكبر، بسرعة حوالي 86 رمزًا في الثانية بنفس القياس.
إذًا، نموذج Flash أسرع بنصف سرعة النموذج غير Flash تقريبًا.
ما يحققه هو وقت الرمز الأول، عند 1.52 ثانية مقارنة بمتوسط 2.14 ثانية للنماذج مفتوحة الأوزان. إذا كان عبء عملك يتضمن العديد من التفاعلات القصيرة، فإن هذه الاستجابة حقيقية. أما إذا كان عبء عملك يتضمن توليد مستندات طويلة، فسوف تنتظر وقتًا أطول مما تنتظره مع GLM-5.3.
الكفاءة التي يقدمها هذا النموذج تكمن في التكلفة والذاكرة، وليس سرعة التوليد الفعلية. تؤدي ذاكرة التخزين المؤقت KV الأصغر وحساب الانتباه الأقل إلى سعر أقل لكل رمز وبصمة تشغيل أصغر. لكنها لا تترجم إلى بث أسرع.
هذا مهم لأن معظم التغطية المنشورة في الأيام التالية للإطلاق كررت إطار البائع دون التحقق من رقم الإنتاجية، والذي كان متاحًا للعامة طوال الوقت. اختر هذا النموذج لأنه غير مكلف ويتعامل مع الصور، وليس لأنك تتوقع منه البث بسرعة.
المقاييس المعيارية
الأرقام التي نشرتها Z.ai عند الإطلاق، لذا اقرأها على أنها ادعاءات من البائع حتى يتمكن أطراف ثالثة من إعادة إنتاجها:

الرقم المستقل هو من Artificial Analysis، والذي يضع GLM-5.3-Flash عند 57 على مؤشر الذكاء الخاص به الإصدار 4.1.1. يسجل GLM-5.3 60 نقطة. المتوسط لنماذج الأوزان المفتوحة ذات الحجم المماثل هو 27، لذا فإن 57 نقطة تعد نتيجة قوية لهذه الفئة حتى لو كانت أدنى من شقيقها الأكبر.
تصف Z.ai النموذج بأنه يقترب من Claude Opus 4.8 في أعمال البرمجة والوكالة. هذا هو وصف البائع لتقييماته الداخلية، وليس نتيجة طرف ثالث مقاسة، وتشير فجوة مؤشر الذكاء بثلاث نقاط عن GLM-5.3 الخاص بها إلى ضرورة بعض التحفظ.
لكيفية تطور قصة معايير GLM عبر الإصدارات السابقة، يشرح تحليلنا لمعايير GLM-5.2 ما يقيسه كل من هذه التقييمات فعليًا.
أسبوع Ox Alpha
في 20 أغسطس، ظهر نموذج مجهول يُدعى ox-alpha على منصات الاستدلال التابعة لجهات خارجية، مع نافذة سياق بحجم 1M رمز وسعر صفر. أصبح أحد أكثر النماذج استخدامًا على تلك المنصات في غضون أيام. تعرّف المجتمع عليه بأنه من Zhipu في غضون حوالي 48 ساعة بناءً على خصائص الإخراج.

في 26 أغسطس، أكدت Z.ai ذلك: كان Ox Alpha هو GLM-5.3-Flash، وكان الأسبوع المجاني اختبار حمل متعمدًا.
تقول Z.ai أيضًا إنه خلال ذلك الأسبوع، تم تقديم جميع حركة المرور على مسرّعات صينية محلية باستخدام مكدس يعتمد على SGLang، وتزعم أن تكلفة التقديم لكل رمز قابلة للمقارنة مع أجهزة NVIDIA السائدة. هذا ادعاء من البائع حول بنيته التحتية الخاصة به ولا يتوفر تحقق مستقل، لذا تعامل معه وفقًا لذلك.
لقد كتبنا عن هذا النمط من قبل عندما تبين أن Pony Alpha هو نموذج DeepSeek أو GLM. أصبحت عمليات الإطلاق السرية على الموجهات الخارجية خطوة قياسية قبل الإصدار، والنتيجة المفيدة هي أن نموذجًا مجهولًا قادرًا بشكل غير عادي مع نافذة سياق مستديرة بشكل مريب هو دائمًا تقريبًا نموذج رائد غير مُعلن عنه يجمع بيانات التقييم.
كيفية استخدامه فعليًا
واجهة برمجة تطبيقات مستضافة (Hosted API). نقطة نهاية Z.ai متوافقة مع OpenAI. وجه عميلك الحالي إلى https://api.z.ai/api/paas/v4/ واضبط النموذج على glm-5.3-flash. يرشدك دليل واجهة برمجة تطبيقات GLM-5.3-Flash عبر المصادقة، وحمولة إدخال الصورة، ومعامل جهد الاستدلال.
موفرو الجهات الخارجية. يقدم OpenRouter النموذج باسم z-ai/glm-5.3-flash. كما يتوفر على Cloudflare Workers AI، Vercel AI Gateway، DeepInfra، Novita، GMICloud، Baseten، و io.net. تختلف الأسعار بين البائعين، أحيانًا بشكل كبير.
وكلاء البرمجة. يتضمن Flash في خطة GLM للبرمجة ويُقال إنه يحمل ثلاثة أضعاف الحصة القابلة للاستخدام لـ GLM-5.3، وهو السبب العملي الذي قد يدفع المشترك للتبديل. تشير وثائق Z.ai أيضًا إلى أن المكالمات خارج أوقات الذروة تستهلك نصف النقاط القياسية.
استضافة ذاتية (Self-hosted). الأوزان مرخصة بترخيص MIT ومتوفرة على Hugging Face. يدعمها vLLM، SGLang، TokenSpeed، و KTransformers جميعًا، وتوجد تحويلات GGUF للأجهزة الأصغر.
هل يجب عليك استخدامه؟
استخدم GLM-5.3-Flash إذا كنت بحاجة إلى فهم الصور أو الفيديو في نفس الاستدعاء مع نصك، أو إذا كانت تكلفة الرمز الواحد هي القيد الذي تحاول تحسينه، أو إذا كنت تريد أوزانًا مفتوحة يمكنك استضافتها ذاتيًا بموجب ترخيص متساهل.
الجا إلى GLM-5.3 بدلاً من ذلك إذا كنت بحاجة إلى النقاط القليلة الأخيرة من جودة الاستدلال، أو إذا كانت إنتاجية التوليد تهمك أكثر من السعر. يعالج مقارنتنا جنبًا إلى جنب بين الاثنين القرار بالتفصيل، ويغطي ما هو GLM-5.3 النموذج الأساسي بشروطه الخاصة.
أيًا كان اختيارك، فإن التبديل هو تغيير معرف نموذج بسطر واحد على نقطة نهاية متوافقة مع OpenAI، مما يسهل اختبار كلا النموذجين مقابل عبء عملك بدلاً من الثقة بجدول المعايير الخاص بأي شخص. هذه هي الطريقة الصحيحة لحسم الأمر.
يتطلب اختبار تبديل النموذج بشكل صحيح إرسال طلبات حقيقية والتحقق من الاستجابات الحقيقية، بما في ذلك الاستجابات متعددة الوسائط التي يصعب إنشاؤها يدويًا باستخدام curl. يتيح لك Apidog حفظ هذه الاستدعاءات كمجموعة قابلة لإعادة الاستخدام مع تأكيدات مرفقة، بحيث عندما تنتقل من GLM-5.3 إلى Flash، يمكنك التأكد من أن شكل الاستجابة لم يتغير بدلاً من اكتشاف ذلك في مرحلة الإنتاج.
الأسئلة الشائعة
هل GLM-5.3-Flash مجاني؟ لم يعد كذلك. انتهى أسبوع Ox Alpha المجاني عندما تم الإعلان الرسمي عن النموذج. يوجد خصم إطلاق بنسبة 50% مستمر حتى 9 سبتمبر 2026، وبعد ذلك تطبق أسعار القائمة.
هل هو أسرع من GLM-5.3؟ لا. يقوم بتوليد حوالي 49 رمزًا في الثانية مقارنة بـ 86 رمزًا لـ GLM-5.3. ولكنه يبدأ الاستجابة بشكل أسرع، عند 1.52 ثانية للرمز الأول.
هل يمكنه حقًا التعامل مع مليون رمز من السياق؟ النافذة المكونة هي 1,048,576 رمزًا، وهو ما تم تأكيده في تكوين النموذج ومن قبل Artificial Analysis. لاحظ أن OpenRouter يسرد رقمًا أكبر قدره 1,310,720؛ تعامل مع هذا على أنه قائمة خاصة بالموفر وليس مواصفات للنموذج.
هل يقبل الفيديو؟ وثائق Z.ai تسرد إدخال النص والصور والفيديو والملفات. دعم الفيديو أحدث وأقل استخدامًا على نطاق واسع من إدخال الصور، لذا تحقق منه مقابل الوسائط الخاصة بك قبل الاعتماد عليه.
ما هو ترخيص الأوزان؟ MIT، مع نشر الأوزان على zai-org/GLM-5.3-Flash على Hugging Face.
