كيف تشغل GLM-5.3-Flash محليًا

استضافة GLM-5.3-Flash ذاتيًا: ثماني وحدات H200 مع vLLM أو SGLang، تجميعات GGUF المكممة للمنصات الأصغر، حسابات الذاكرة، وما إذا كانت الاستضافة الذاتية تتفوق على واجهة برمجة التطبيقات.

Ashley Goolam

Ashley Goolam

27 أغسطس 2026

كيف تشغل GLM-5.3-Flash محليًا

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

GLM-5.3-Flash هو نموذج بـ 320 مليار معلمة تم إصداره بموجب ترخيص MIT. هاتان الحقيقتان تسيران في اتجاهين متعاكسين: فالترخيص يسمح بتشغيله كيفما تشاء، ويشير عدد المعلمات إلى أنك ستحتاج إلى أجهزة قوية جدًا للقيام بذلك.

الجزء المثير للاهتمام هو أن 18 مليارًا من تلك الـ 320 مليار معلمة تكون نشطة لكل رمز، وتوجد إصدارات مكممة. هذا المزيج يضع هذا النموذج في متناول إعدادات أصغر بكثير من عقدة 8x H200 التي تفترضها معظم الأدلة.

تستعرض هذه المشاركة مستويات الأجهزة بصدق، بدءًا من عقدة إنتاج بدقة كاملة وصولاً إلى إصدار مكمم على محطة عمل، وتغطي متى يكون تشغيله بنفسك منطقيًا على الإطلاق.

ما تقوم بتحميله فعليًا

الخاصية القيمة
إجمالي المعلمات 320 مليار
النشطة لكل رمز 18 مليار
الهندسة المعمارية MoE، اهتمام هجين خطي ومتباعد
السياق 1,048,576 رمزًا
الترخيص MIT
الأوزان zai-org/GLM-5.3-Flash
تكميمات GGUF unsloth/GLM-5.3-Flash-GGUF

إن تصميم "مزيج الخبراء" (mixture-of-experts) هو ما يجعل هذا الأمر ممكنًا. يجب أن تكون جميع المعلمات البالغ عددها 320 مليارًا موجودة في الذاكرة، ولكن 18 مليارًا فقط تشارك في أي رمز معين، لذا فإن الطلب على الحوسبة أقل بكثير مما يوحي به الإجمالي. الذاكرة هي قيدك الأساسي، وليست عمليات الفلوبس (FLOPs).

كما تشير Z.ai إلى ذاكرة تخزين مؤقت KV أصغر بحوالي 4.4 مرة من GLM-5.3، وهو ما يهم كثيرًا لعمل السياق الطويل. ذاكرة التخزين المؤقت KV هي ما يستهلك الذاكرة كلما امتلأ سياقك، وفي نافذة مليون رمز، هذا عادة هو ما يقضي عليك.

المستوى 1: الدقة الكاملة على عقدة إنتاج

لتقديم خدمة بجودة كاملة وتزامن حقيقي، الإعداد المرجعي هو **عقدة 8x H200** (141 جيجابايت لكل منها، حوالي 1,128 جيجابايت إجمالاً). تعمل عقدة 8x H20 بشكل جيد أيضًا.

أرقام تقريبية: الأوزان وحدها تحتاج ما بين 700 إلى 800 جيجابايت حسب الدقة، وتحتاج إلى مساحة إضافية لذاكرة التخزين المؤقت KV والنفقات العامة لوقت التشغيل. تبلغ تكلفة السعة السحابية المستأجرة لعقدة كهذه حوالي 24 إلى 48 دولارًا يوميًا.

vLLM

vLLM هو الافتراضي الشائع ويحظى بأوسع دعم للنظام البيئي. يجب أن يكون حجم التوازي التنسوري قوة لاثنين:

vllm serve zai-org/GLM-5.3-Flash \
  --tensor-parallel-size 8 \
  --max-model-len 1048576 \
  --trust-remote-code

ابدأ بـ --max-model-len أصغر أثناء التحقق من الإعداد. طلب نافذة المليون رمز الكاملة يعني فورًا تخصيص ذاكرة تخزين مؤقت KV لها، والفشل هناك يبدو وكأنه خطأ نفاد الذاكرة بدلاً من مشكلة في التكوين.

SGLang

كان لدى SGLang دعم في اليوم الأول لهذا النموذج، مع وصفات منشورة لـ H100 وH200 وB200 وB300 وGB200 وGB300، بما في ذلك خدمة الوسائط المتعددة. استخدمت Z.ai حزمة قائمة على SGLang لخدمتها قبل الإطلاق.

python -m sglang.launch_server \
  --model-path zai-org/GLM-5.3-Flash \
  --tp 8 \
  --context-length 1048576

يميل SGLang إلى التفوق في الإخراج المنظم وأعباء العمل الوكيلة عالية التزامن. إذا كنت تقدم خدمة وكيل ترميز بدلاً من واجهة دردشة، فمن المفيد مقارنته بـ vLLM بدلاً من استخدام الافتراضي.

تحتاج كلتا الحزمتين إلى محلل استدعاء أداة (tool-call parser) مهيأ إذا كنت تريد أن يعمل استدعاء الوظائف بشكل صحيح. تحقق من العلامات الحالية في وثائق كل مشروع، حيث تتغير أسماء المحللات بين الإصدارات.

المستوى 2: التكميم على أجهزة أصغر

هذا هو المستوى الذي تتجاهله معظم التغطيات، وهو المستوى الذي يهم أي شخص ليس لديه مركز بيانات.

تُنشَر إصدارات GGUF المكممة على `unsloth/GLM-5.3-Flash-GGUF`، وتصل إلى تنسيقات 1 بت و2 بت قوية مثل IQ1_S وIQ2_XXS. تكميم نموذج 320B إلى 2 بت يضع الأوزان في نطاق يمكن أن تحتويه محطة عمل عالية الذاكرة أو جهاز استهلاكي متعدد وحدات معالجة الرسوميات، خاصة مع التفريغ إلى وحدة المعالجة المركزية.

تحذيران صادقان:

التكميم القوي يؤثر على الجودة. IQ1_S بعيد كل البعد عن الدقة الكاملة. في نموذج MoE بحجم 320 مليار معلمة، غالبًا ما يكون التدهور ألطف من نفس المعالجة المطبقة على نموذج كثيف، لأن هناك تكرارًا أكبر يمكن فقده، لكن "يعمل" و"يعمل بشكل جيد" هما ادعاءان مختلفان. اختبره على مهامك الخاصة قبل استنتاج أي شيء.

وثائق Unsloth لهذا النموذج معلمة بأنها قيد العمل. توفر التكميم والإعدادات الموصى بها لا تزال تتغير. تحقق مما تم نشره بالفعل قبل التخطيط لبناء حول تنسيق معين.

بالنسبة للإعدادات التي تعتمد بشكل كبير على وحدة المعالجة المركزية والإعدادات الهجينة، تم تصميم **KTransformers** لهذه الحالة بالضبط، حيث يحتفظ بخبراء MoE في ذاكرة الوصول العشوائي للنظام وينقل فقط ما هو ضروري إلى وحدة معالجة الرسوميات. في نموذج MoE مع 18 مليار معلمة نشطة، تتناسب هذه الهندسة المعمارية بشكل جيد للغاية. يتم إدراج **TokenSpeed** أيضًا ضمن أوقات التشغيل المدعومة.

دليلنا حول تشغيل GLM-4.7-Flash محليًا يغطي إصدار النموذج الأصغر من سير العمل هذا، ويغطي تشغيل GLM-5 محليًا مجانًا الإعداد العام لـ GLM المحلي.

تحديد ميزانية الذاكرة الخاصة بك

رقمان يحددان ما إذا كان التكوين مناسبًا.

الأوزان. بحوالي 2 بايت لكل معلمة في BF16، فإن 320 مليار معلمة تعني حوالي 640 جيجابايت قبل النفقات العامة. FP8 يقلل ذلك إلى النصف تقريبًا. تكميم 4 بت يجعله يقترب من 160 جيجابايت، وتنسيقات 2 بت القوية تنخفض أكثر على حساب حقيقي في الجودة.

ذاكرة التخزين المؤقت KV. تتناسب هذه مع طول السياق والتزامن، وهي ما يفاجئ الناس. التكوين الذي يتم تحميله بشكل جيد في سياق 8K يمكن أن يفشل في 128K لأن الذاكرة المؤقتة نمت، وليس الأوزان. تقليل Z.ai المعلن بمقدار 4.4 مرة مقارنة بـ GLM-5.3 يساعد كثيرًا هنا، لكن التوسع لا يزال خطيًا في الرموز.

الخلاصة العملية هي التحديد حسب طول سياقك الحقيقي، وليس الحد الأقصى الذي يعلن عنه النموذج. عدد قليل جدًا من التطبيقات تحتاج إلى المليون رمز بالكامل، وتوفير نافذة لا تستخدمها أبدًا هو الطريقة الأكثر شيوعًا لجعل هذا النموذج يبدو غير ميسور التكلفة.

إذا كنت تتابع قصة الأوزان المفتوحة السابقة لهذه العائلة، فقد كُتِبَ منشورنا حول استضافة GLM-5.3 ذاتيًا قبل إصداره. لقد تم الآن إطلاق الأوزان لـ Flash تحت ترخيص MIT، لذا فإن الإرشادات هنا تحل محلها.

الضبط الدقيق (Fine-tuning)

يسمح ترخيص MIT بالضبط الدقيق وإعادة التوزيع، وهو أمر غير معتاد في هذا المستوى من القدرة وهو أقوى سبب للاحتفاظ بالأوزان بنفسك.

كن واقعيًا بشأن التكلفة. الضبط الدقيق الكامل لنموذج بحجم 320 مليار معلمة خارج نطاق معظم الفرق. الطرق الفعالة للمعلمات مثل LoRA هي المسار العملي، وفي نموذج مزيج الخبراء هناك سؤال تصميم إضافي حول ما إذا كنت تكيف الموجه، أو الخبراء، أو طبقات الانتباه. هذه منطقة نشطة ذات إرشادات أقل استقرارًا من النماذج الكثيفة.

إذا كان هدفك هو تكييف المجال بدلاً من قدرة جديدة، فاختبر التحفيز والاسترجاع مقابل النموذج الأساسي أولاً. في نموذج بنافذة سياق بحجم مليون رمز، غالبًا ما يكون وضع معرفتك بالمجال في الموجه أرخص وأفضل من تدريب النموذج عليها.

إعدادات أخذ العينات

تنشر Z.ai توصيات مختلفة حسب المهمة:

حالة الاستخدام درجة الحرارة (temperature) top_p
عام 1.0 0.95
الترميز 0.95 1.0

يدعم النموذج أيضًا ثلاثة أوضاع استدلال عبر `reasoning_effort`، بقيم `low` و`high` و`max`. **`max` هو الافتراضي.** على الأجهزة المحلية، هذا الأمر يهم أكثر مما هو عليه في واجهة برمجة التطبيقات (API)، لأن رموز الاستدلال هي جيل تدفع ثمنه بوقت الساعة الحائطية بدلاً من الدولارات. إذا كان جهازك يولد ببطء، فإن `low` هو الفرق بين أن يكون قابلاً للاستخدام أو لا.

هل الاستضافة الذاتية منطقية من الناحية المالية؟

عادة لا، وسعر واجهة برمجة التطبيقات هو السبب.

بالأسعار المعلنة، يكلف GLM-5.3-Flash 0.15 دولار لكل مليون رمز إدخال. عقدة H200 مؤجرة 8x بتكلفة حوالي 1,000 دولار شهريًا توفر لك حوالي 6.7 مليار رمز إدخال من استخدام واجهة برمجة التطبيقات. الحفاظ على حجم أعلى من ذلك، باستمرار، هو عملية ضخمة.

تكلفة العقدة هي نفسها سواء كانت مشغولة بالكامل أو خاملة، بينما واجهة برمجة التطبيقات تحاسب فقط على ما تستخدمه. ما لم يكن استخدامك مرتفعًا بالفعل على مدار الساعة، فإن التكلفة الثابتة ستكون خاسرة.

لذا فإن أسباب الاستضافة الذاتية ليست التكلفة:

تحليلنا للأسعار يتناول جانب واجهة برمجة التطبيقات من هذه المقارنة بمزيد من التفصيل.

التحقق من نشرك

يعرض كل من vLLM و SGLang نقاط نهاية متوافقة مع OpenAI، لذا فإن نفس شكل الطلب يعمل مع خادمك المحلي ومع Z.ai:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "messages": [{"role": "user", "content": "reply with OK"}]
  }'

من الجدير بالذكر الاختبار بما يتجاوز الفحص السريع: سلوك السياق الطويل بالطول الذي تحتاجه بالفعل، إدخال الصور إذا كنت تقدم خدمة متعددة الوسائط، استدعاء الأدوات باستخدام مخططاتك الحقيقية، والإنتاجية تحت التزامن بدلاً من زمن الاستجابة لطلب واحد.

هذا هو المكان الذي تحقق فيه مجموعة الاختبارات المحفوظة فائدتها. وجه Apidog إلى كل من خادمك المحلي ونقطة نهاية Z.ai مع عنوان URL الأساسي كمتغير بيئة، وقم بتشغيل نفس الحزمة ضد كل منهما، ثم قارن. ستكتشف بسرعة ما إذا كان إصدارك المكمم لا يزال يتعامل مع مخططات الأدوات التي يعتمد عليها تطبيقك، وهو نمط الفشل الذي يكتشفه الناس في الإنتاج بدلاً من ذلك.

الأسئلة الشائعة

ما هو الحد الأدنى من الأجهزة؟ للدقة الكاملة، عقدة من فئة 8x H200. لإصدارات GGUF المكممة، أقل بكثير، على الرغم من أن الجودة تنخفض مع مستوى التكميم.

هل أحتاج إلى جميع المعلمات البالغ عددها 320 مليارًا في الذاكرة؟ نعم. 18 مليارًا فقط تكون نشطة لكل رمز، ولكن يجب أن يكون الإعداد الكامل موجودًا. الذاكرة هي القيد؛ الحوسبة ليست كذلك.

أيهما أفضل، vLLM أم SGLang؟ كان لدى SGLang دعم في اليوم الأول مع وصفات متعددة الوسائط منشورة وغالبًا ما يتفوق في التزامن والإخراج المنظم. يتمتع vLLM بدعم أوسع للنظام البيئي. قارن كلاهما في عبء عملك.

هل يمكن تشغيله على وحدة معالجة رسومات واحدة؟ ليس بدقة كاملة. مع التكميم القوي والتفريغ إلى وحدة المعالجة المركزية عبر KTransformers، يمكن لنظام ذي وحدة معالجة رسومات واحدة وذاكرة عالية بالإضافة إلى الكثير من ذاكرة الوصول العشوائي للنظام أن يكون قابلاً للتطبيق. توقع جيلًا بطيئًا.

هل الترخيص حقًا MIT؟ نعم. تُنشر الأوزان بترخيص MIT، الذي يسمح بالاستخدام التجاري والتعديل وإعادة التوزيع.

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات