GLM-5.3-Flash Yerel Olarak Nasıl Çalıştırılır

GLM-5.3-Flash'ı kendin barındır: 8 adet H200 ile (vLLM veya SGLang kullanarak), daha küçük sistemler için nicelendirilmiş GGUF derlemeleri, bellek hesaplamaları ve kendi kendine barındırmanın API'den daha iyi olup olmadığı.

Ashley Goolam

Ashley Goolam

27 August 2026

GLM-5.3-Flash Yerel Olarak Nasıl Çalıştırılır

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

GLM-5.3-Flash, MIT lisansı altında yayınlanmış 320 milyar parametreli bir modeldir. Bu iki gerçek zıt yönlere çekiyor: lisans onu istediğiniz gibi çalıştırmanızı söylerken, parametre sayısı bunu yapmak için ciddi donanıma ihtiyacınız olacağını belirtiyor.

İlginç olan, bu 320 milyar parametrenin 18 milyarının jeton başına aktif olması ve nicelenmiş derlemelerin mevcut olmasıdır. Bu kombinasyon, bu modeli çoğu rehberin varsaydığı 8x H200 düğümünden çok daha küçük kurulumların erişimine sunar.

Bu yazı, donanım katmanlarını dürüstçe ele alıyor; tam hassasiyetli bir üretim düğümünden bir iş istasyonunda nicelenmiş bir derlemeye kadar uzanıyor ve kendi başınıza çalıştırmanın ne zaman mantıklı olduğunu kapsıyor.

Gerçekte ne yüklüyorsunuz

Özellik Değer
Toplam parametreler 320B
Jeton başına aktif 18B
Mimari MoE, hibrit doğrusal ve seyrek dikkat
Bağlam 1.048.576 jeton
Lisans MIT
Ağırlıklar zai-org/GLM-5.3-Flash
GGUF nicellemeleri unsloth/GLM-5.3-Flash-GGUF

Uzmanlar karışımı (mixture-of-experts) tasarımı, bunu mümkün kılan şeydir. Tüm 320B parametrenin bellekte kalıcı olması gerekir, ancak herhangi bir jetonda yalnızca 18B'si yer alır, bu nedenle hesaplama talebi toplamın önerdiğinden çok daha düşüktür. Bağlayıcı kısıtlamanız bellek, FLOP'lar değil.

Z.ai ayrıca GLM-5.3'ten yaklaşık 4.4 kat daha küçük bir KV önbelleği bildirmekte, bu da uzun bağlamlı çalışmalar için son derece önemlidir. KV önbelleği, bağlamınız doldukça bellek tüketir ve 1M jetonluk bir pencerede normalde sizi bitiren şey budur.

Katman 1: Bir üretim düğümünde tam hassasiyet

Gerçek eşzamanlılıkla tam kalitede hizmet vermek için referans yapılandırma, bir 8x H200 düğümüdür (her biri 141 GB, toplam yaklaşık 1.128 GB). Bir 8x H20 düğümü de iş görür.

Yaklaşık rakamlar: yalnızca ağırlıklar, hassasiyete bağlı olarak 700 ila 800 GB civarında bir yer ister ve KV önbelleği ve çalışma zamanı ek yükü için üzerinde ek boş alana ihtiyacınız vardır. Böyle bir düğüm için kiralanan bulut kapasitesi günlük yaklaşık 24 ila 48 dolar civarındadır.

vLLM

vLLM yaygın bir varsayılan olup en geniş ekosistem desteğine sahiptir. Tensör paralel boyutu ikinin kuvveti olmalıdır:

vllm serve zai-org/GLM-5.3-Flash \
  --tensor-parallel-size 8 \
  --max-model-len 1048576 \
  --trust-remote-code

Kurulumu doğrulamaya çalışırken daha küçük bir --max-model-len ile başlayın. Tam milyon jetonluk pencereyi hemen istemek, bunun için KV önbelleği ayırmak anlamına gelir ve buradaki bir hata, yapılandırma sorunundan ziyade bellek yetersizliği hatası gibi görünür.

SGLang

SGLang, bu model için ilk günden itibaren destek verdi; H100, H200, B200, B300, GB200 ve GB300 için yayınlanmış reçeteler dahil, çok modlu hizmet de içeriyordu. Z.ai, kendi lansman öncesi hizmeti için SGLang tabanlı bir yığın kullandı.

python -m sglang.launch_server \
  --model-path zai-org/GLM-5.3-Flash \
  --tp 8 \
  --context-length 1048576

SGLang, yapılandırılmış çıktı ve yüksek eşzamanlılığa sahip ajanik iş yüklerinde genellikle daha iyi performans gösterir. Sohbet arayüzü yerine bir kodlama ajanı hizmeti veriyorsanız, varsayılanı kullanmak yerine vLLM ile karşılaştırmalı test yapmaya değer.

Her iki yığının da işlev çağrılarının düzgün çalışmasını istiyorsanız yapılandırılmış bir araç çağrısı ayrıştırıcısına ihtiyacı vardır. Ayrıştırıcı adları sürümler arasında değiştiğinden, her projenin belgelerindeki güncel bayrakları kontrol edin.

Katman 2: Daha küçük donanımda nicelenmiş

Bu, çoğu yayının atladığı ve veri merkezi olmayan herkes için önemli olan katmandır.

Nicelenmiş GGUF derlemeleri unsloth/GLM-5.3-Flash-GGUF adresinde yayınlanmaktadır ve IQ1_S ve IQ2_XXS gibi agresif 1-bit ve 2-bit formatlarına kadar inmektedir. 320B'lik bir modelin 2-bit nicelenmesi, ağırlıkları yüksek bellekli bir iş istasyonu veya çoklu GPU'lu bir tüketici sisteminin barındırabileceği bir aralığa getirir, özellikle CPU boşaltma ile.

İki dürüst uyarı:

Agresif niceleme kaliteden ödün verir. IQ1_S, tam hassasiyetten çok uzaktır. 320B'lik bir MoE modelinde bozulma, yoğun bir modele uygulanan aynı işlemden genellikle daha hafiftir, çünkü kaybedilecek daha fazla yedeklilik vardır, ancak "çalışıyor" ve "iyi çalışıyor" farklı iddialardır. Herhangi bir sonuca varmadan önce kendi görevlerinizde test edin.

Unsloth'un bu modele ilişkin belgeleri "geliştirilme aşamasında" olarak işaretlenmiştir. Niceleme kullanılabilirliği ve önerilen ayarlar hala değişiyor. Belirli bir formata göre bir derleme planlamadan önce gerçekten neyin yayınlandığını kontrol edin.

CPU yoğun ve hibrit kurulumlar için KTransformers tam da bu durum için tasarlanmıştır, MoE uzmanlarını sistem RAM'inde tutarak yalnızca ihtiyaç duyulanı GPU'ya taşır. 18B aktif parametreli bir MoE modelinde, bu mimari olağanüstü derecede iyi uyuyor. TokenSpeed de desteklenen çalışma zamanları arasında listelenmiştir.

GLM-4.7-Flash'ı yerel olarak çalıştırma rehberimiz bu iş akışının daha küçük model versiyonunu kapsar ve GLM-5'i yerel olarak ücretsiz çalıştırma ise genel yerel GLM kurulumunu kapsar.

Bellek bütçenizi hesaplamak

İki sayı, bir yapılandırmanın uygun olup olmadığını belirler.

Ağırlıklar. BF16'da parametre başına yaklaşık 2 bayt ile, 320B parametre ek yükten önce yaklaşık 640 GB'tır. FP8 bunu kabaca yarıya indirir. 4-bit bir niceleme onu 160 GB'a yaklaştırır ve agresif 2-bit formatları kaliteden gerçek bir ödün vererek daha da düşer.

KV önbelleği. Bu, bağlam uzunluğu ve eşzamanlılıkla ölçeklenir ve insanları şaşırtan şey budur. 8K bağlamda sorunsuz yüklenen bir yapılandırma, ağırlıklar değil önbellek büyüdüğü için 128K'da başarısız olabilir. Z.ai'nin GLM-5.3'e kıyasla bildirdiği 4.4 kat azalma burada çok yardımcı olur, ancak ölçeklendirme hala jetonlarda doğrusaldır.

Pratik çıkarım, modelin reklamını yaptığı maksimuma göre değil, gerçek bağlam uzunluğunuza göre boyutlandırmaktır. Çok az uygulama tam milyon jetona ihtiyaç duyar ve asla kullanmadığınız bir pencere için sağlama yapmak, bu modeli karşılanamaz göstermenin en yaygın yoludur.

Bu aile için daha önceki açık ağırlık hikayesini takip ediyorsanız, GLM-5.3 kendi kendine barındırma yazımız yayınlanmadan önce yazılmıştı. Ağırlıklar artık MIT lisansı altında Flash için yayımlandı, bu nedenle buradaki rehberlik onun yerini almaktadır.

İnce Ayar

MIT lisansı, ince ayar yapılmasına ve yeniden dağıtıma izin verir; bu, bu yetenek seviyesinde alışılmadık bir durumdur ve ağırlıkları kendiniz tutmak için en güçlü nedendir.

Maliyet konusunda gerçekçi olun. 320B'lik bir modelin tam ince ayarı çoğu takım için erişilemezdir. LoRA gibi parametre verimli yöntemler pratik yoldur ve uzmanlar karışımı bir modelde, yönlendiriciyi, uzmanları veya dikkat katmanlarını uyarlayıp uyarlamayacağınıza dair ek bir tasarım sorunu vardır. Bu, yoğun modellerden daha az yerleşik rehberliğe sahip aktif bir alandır.

Amacınız yeni bir yetenekten ziyade alan uyarlaması ise, önce temel modele karşı istemleri ve geri almayı test edin. 1M jetonluk bağlam penceresi olan bir modelde, alan bilginizi isteme koymak, onu eğitmeye göre genellikle daha ucuz ve daha iyidir.

Örnekleme Ayarları

Z.ai, göreve göre farklı öneriler yayınlar:

Kullanım durumu sıcaklık top_p
Genel 1.0 0.95
Kodlama 0.95 1.0

Model ayrıca reasoning_effort aracılığıyla low, high ve max değerleriyle üç akıl yürütme modunu destekler. Maksimum varsayılandır. Yerel donanımda bu, API'de olduğundan daha fazla önem taşır, çünkü akıl yürütme jetonları, dolar yerine gerçek zaman saatiyle ödediğiniz bir üretimdir. Eğer sisteminiz yavaş üretim yapıyorsa, low kullanılabilir ile kullanılamaz arasındaki farkı yaratır.

Kendi sunucunda barındırmak finansal açıdan mantıklı mı?

Genellikle hayır, API fiyatı da bu yüzden.

Liste fiyatlandırmasında, GLM-5.3-Flash milyon giriş jetonu başına 0,15 dolara mal oluyor. Yaklaşık ayda 1.000 dolara kiralanan bir 8x H200 düğümü, size yaklaşık 6,7 milyar giriş jetonu API kullanımı sağlar. Bunun üzerinde, sürekli olarak hacmi sürdürmek büyük bir operasyondur.

Düğüm, dolu veya boş olsa da aynı maliyete sahiptir, oysa API yalnızca kullandığınızı faturalandırır. Kullanımınız gerçekten günün her saati yüksek değilse, sabit maliyet dezavantajlıdır.

Yani kendi sunucunuzda barındırma nedenleri maliyet değildir:

Fiyatlandırma dökümümüz, bu karşılaştırmanın API tarafını daha ayrıntılı olarak ele alıyor.

Dağıtımınızı Doğrulama

Hem vLLM hem de SGLang, OpenAI uyumlu uç noktaları açığa çıkarır, bu nedenle aynı istek şekli yerel sunucunuza ve Z.ai'ye karşı çalışır:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "messages": [{"role": "user", "content": "reply with OK"}]
  }'

Basit bir testten öte test etmeye değer: gerçekten ihtiyacınız olan uzunlukta uzun bağlam davranışı, çok modlu hizmet veriyorsanız görüntü girişi, gerçek şemalarınızla araç çağırma ve tek istek gecikmesi yerine eşzamanlılık altında iş hacmi.

İşte burada kaydedilmiş bir test koleksiyonu işe yarar. Apidog'u hem yerel sunucunuza hem de temel URL'yi bir ortam değişkeni olarak kullanarak Z.ai uç noktasına yönlendirin, her birine karşı aynı paketi çalıştırın ve karşılaştırın. Nicelenmiş derlemenizin, uygulamanızın bağlı olduğu araç şemalarını hala işleyip işlemediğini hızla öğreneceksiniz; bu, insanların bunun yerine üretimde keşfettiği hata modudur.

SSS

Minimum donanım nedir? Tam hassasiyet için, 8x H200 sınıfı bir düğüm. Nicelenmiş GGUF derlemeleri için önemli ölçüde daha az, ancak niceleme seviyesiyle kalite düşer.

Tüm 320B parametreye bellekte ihtiyacım var mı? Evet. Jeton başına yalnızca 18B aktif, ancak tüm set bellekte kalıcı olmalıdır. Kısıtlama bellek; hesaplama değil.

Hangisi daha iyi, vLLM mi yoksa SGLang mı? SGLang, yayınlanmış çok modlu tariflerle ilk günden itibaren destek verdi ve genellikle eşzamanlılık ve yapılandırılmış çıktıda daha iyi performans gösterir. vLLM daha geniş ekosistem desteğine sahiptir. İş yükünüzde her ikisini de karşılaştırmalı olarak test edin.

Tek bir GPU'da çalıştırabilir miyim? Tam hassasiyette değil. KTransformers aracılığıyla agresif niceleme ve CPU boşaltma ile, yüksek bellekli tek GPU'lu bir sistem artı çok fazla sistem RAM'i makul olabilir. Yavaş üretim bekleyin.

Lisans gerçekten MIT mi? Evet. Ağırlıklar MIT olarak yayınlanmıştır, bu da ticari kullanıma, değiştirmeye ve yeniden dağıtmaya izin verir.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin