Zhipu AI, GLM-5.3'ü 14 Ağustos 2026'da piyasaya sürdü ve lansman haberlerinde altyapı ekipleri için en önemli satır gizliydi: açık ağırlıklar yaklaşık iki hafta sonra, 28 Ağustos civarında, Zhipu'nun Hugging Face organizasyonuna geliyor. Bu boşluk bir hediye. Tek bir safetensor parçası kamuya açılmadan önce donanımı boyutlandırmanız, bir sunum yığını seçmeniz ve barındırılan API'ye karşı bir regresyon temelini yakalamanız için size zaman tanıyor.
Model bu ön çalışmayı hak ediyor. Zhipu'nun dahili değerlendirmeleri, kodlama yeteneğini GLM-5.2'nin %50 önüne koydu, Terminal-Bench 3.0 4.6'dan 28.3'e sıçradı ve şirket, lansman raporlarına göre ajan performansını "Claude Fable 5'e yaklaşıyor" olarak tanımlıyor. Sınır modellerinin hala gerisinde kaldığı noktalar da dahil olmak üzere tüm kıyaslama hikayesi, GLM-5.3 açıklayıcımızda yer alıyor. Bu makale tek bir soruya odaklanıyor: GLM-5.3'ü kendi başınıza sunabilmeniz için çıkış gününde nelerin hazır olması gerekiyor?
Açık olmak gerekirse: ağırlıklar bugün indirilemiyor. Aşağıdaki her şey yayın penceresini hedefliyor ve Zhipu'nun doğrulamadığı her şey bir beklenti olarak işaretleniyor, bir gerçek değil. Şu anda yapabileceğiniz şey bir temel oluşturmak ve bu Apidog aracılığıyla yapılıyor: bu hafta barındırılan API yanıtlarının anlık görüntüsünü alın, ardından aynı koleksiyonu daha sonra yerel uç noktanıza karşı tekrar oynatın.
ÖZET
- GLM-5.3, 14 Ağustos 2026'da piyasaya sürüldü. Zhipu, bugüne kadarki en kapsamlı risk incelemesinden sonra açık ağırlıkların yaklaşık iki hafta sonra, 28 Ağustos civarında geleceğini belirtiyor. Beklenen iniş noktası: huggingface.co/zai-org.
- GLM-5 ailesi mimarisi (Z.ai belgelerine göre): Uzman Karışımı (Mixture of Experts), toplam 744B parametre, pas başına yaklaşık 40B aktif, 200K bağlam. Temel model 5.3'te değişmedi; tüm kazanımlar ölçeklendirilmiş eğitim sonrası süreçten geliyor.
- 744B parametre üzerinde aritmetik: ağırlıklar tek başına BF16'da yaklaşık 1.5 TB, FP8'de bunun yaklaşık yarısı kadar yer kaplar (KV önbelleği hariç). Tam hassasiyetli kendi kendine barındırma, çoklu GPU sunucu alanıdır.
- Önceki her GLM-5 sürümü, Hugging Face'te eşleştirilmiş BF16 ve FP8 depoları olarak gönderildi, bu nedenle ilk gün
GLM-5.3veGLM-5.3-FP8bekleyin; topluluk GGUF kuantları günler veya haftalar sonra gelecektir. - vLLM ve SGLang, gerçekçi ilk gün sunum yığınlarıdır. Her ikisi de OpenAI uyumlu uç noktalar sunar, bu nedenle Z.ai'nin barındırılan API'sine karşı yazılmış istemci kodu, bir
base_urldeğişikliğiyle geçiş yapabilir. - Apidog'da barındırılan-yerel regresyon temelini şimdi oluşturun: bir koleksiyon, iki ortam, şekil ve içerik üzerinde iddialar.
Zhipu neyi ve ne zaman yayınlıyor
Zhipu (uluslararası olarak Z.ai markasıyla) GLM-5.3 API lansmanını iki haftalık açık ağırlık vaadiyle birleştirdi: model 28 Ağustos 2026 civarında Hugging Face'e gidecek. Gecikme keyfi değil. Zhipu, bu sürüm için bugüne kadarki en kapsamlı risk inceleme sistemini kurduğunu belirtiyor, bu da modelin CyberGym'de Claude Mythos 5 ve GPT-5.6 Sol'ün biraz üzerinde olan %84.5'lik puanı göz önüne alındığında dikkat çekici. Seeking Alpha, bu sürümü Zhipu'nun yıl boyunca DeepSeek ile el değiştirdiği açık model liderliğini sürdürme çabası olarak çerçeveliyor.
Sürümden iki detay, kendi kendine barındıranlar için önemlidir:
- Temel model değişmedi. GLM-5.3, ölçeklendirilmiş eğitim sonrası süreçle GLM-5 tabanıdır. Sunum yığınınızın ihtiyaç duyduğu mimari, vLLM ve SGLang'ın GLM-5 ve GLM-5.2 için zaten kullandığı mimaridir. Yeni bir dikkat varyantı veya tokenleştirici sürprizi beklenmiyor.
- Yayın modeli belirlendi. Zhipu'nun Hugging Face organizasyonu, GLM-5, GLM-5.1 ve GLM-5.2'yi barındırıyor ve her biri bir FP8 deposuna eşlik ediyor. Yalnızca GLM-5.2, 2.69M indirme gösteriyor. 5.3 için de aynı şekli bekleyin: bir BF16 safetensor sürümü artı resmi bir FP8 varyantı.
5.3 için lisans koşulları lansman haberlerinde doğrulanmadı. Ticari bir ürüne dönüştürmeden önce depo göründüğünde model kartını kontrol edin.
Toplam 744B, aktif 40B'nin donanımınız için anlamı
GLM-5 ailesi bir Uzman Karışımı (Mixture of Experts) tasarımıdır: Z.ai belgelerine göre toplam 744B parametre, ileri besleme başına yaklaşık 40B aktif, 200K bağlam (Hugging Face depoları, gömülü modelleri içeren biraz daha yüksek toplamlar listeler). Bunlar 5.3'e özel iddialar değil, aile spesifikasyonlarıdır; ancak temel model değişmediği için doğru planlama sayılarıdır.
MoE ayrımı, bellek-işlem asimetrisi yaratır:
- İşlem, 40B yoğun bir model gibi davranır. Belirteç başına, yalnızca yönlendirilen uzmanlar etkinleşir, bu nedenle model sığdığında GPU başına verim, 744B yoğun bir modelin önereceğinden çok daha iyidir.
- Bellek, 744B bir model gibi davranır. Her uzmanın adreslenebilir bir yerde bulunması gerekir. Parametre başına 2 bayt (BF16) ile 744B, yaklaşık 1.5 TB ağırlığa denk gelir; 1 bayt (FP8) ile yaklaşık 744 GB. Bu, yayınlanan rakamlar üzerinden yapılan bir aritmetiktir, test edilmiş bir konfigürasyon değildir ve KV önbelleğini içermez.
Kesin GPU sayılarına aldırış etmeden, pratik katmanlar:
| Hassasiyet | Ağırlık kapladığı alan (aritmetik) | Gerçekçi konum |
|---|---|---|
| BF16 | ~1.5 TB | Çok düğümlü küme veya en büyük tek sunuculu GPU konfigürasyonları |
| FP8 (resmi) | ~745 GB | Yüksek performanslı çoklu GPU sunucu, tek düğüm |
| INT4 sınıfı topluluk kuantları | ~370-400 GB aralığı | Daha küçük çoklu GPU sistemleri; kalite raporlarını bekleyin |
Bütçeniz tek bir tüketici GPU'su ise, GLM-5.3'ün tam ağırlıkları hedefiniz değildir ve bu sorun değil. Değerlendirme için GPU saatleri kiralayın, agresif topluluk kuantlarını bekleyin veya daha küçük açık modelleri yerel olarak çalıştırırken ağır modeli barındırılan API'de tutun. 2026'daki en iyi yerel LLM'ler rehberimiz, bugün tek GPU ve iş istasyonu bütçelerine neyin uyduğunu kapsar.
200K bağlam penceresini de bir bellek kararı olarak değerlendirin: KV önbelleği bağlam ve parti boyutuyla birlikte büyür, bu nedenle çıkış gününden önce modelin tavanına varsayılan olarak ayarlamak yerine her dağıtım katmanı için sunulan bağlamı sınırlayın.
Ağırlıklar gelmeden önce sunum yığınınızı seçin
Burada üç sunum yazılımı ailesi önemlidir ve hepsi aynı anda hazır olmayacaktır.
vLLM bu ölçekte varsayılan yanıttır: orijinal sürümden bu yana GLM-5 aile desteği, MoE yönlendirme, GPU'lar ve düğümler arasında tensör ve uzman paralelliği ve yerel bir OpenAI uyumlu sunucu. Depo var olduğunda bir başlatma komutu şöyle görünecektir:
vllm serve zai-org/GLM-5.3-FP8 \
--tensor-parallel-size 8 \
--max-model-len 65536 \
--served-model-name glm-5.3
Bayrakları bir şablon olarak değerlendirin: depo adı Zhipu'nun adlandırma düzenini takip eder ve paralellik ayarları GPU sayınıza ve belleğinize bağlıdır.
SGLang, güçlü MoE performansı ve uzun paylaşılan istemleri yeniden gönderen ajan iş yükleri için faydalı olan radix-tree önek önbelleklemesi ile ana alternatiftir. Ayrıca OpenAI uyumlu bir uç nokta sunar, bu nedenle daha sonra ikisi arasında geçiş yapmak istemci koduna dokunmaz.
llama.cpp ailesi (llama.cpp, Ollama, LM Studio), bir safetensor düşüşünden günler veya haftalar sonra topluluktan gelen GGUF dönüşümlerine ihtiyaç duyar. Bu yol, modeli sonunda daha küçük donanımlara getirir, ancak kalite seviyelerini körü körüne kabul etmek yerine kendi temel çizginize göre doğrulamanız gerekir.
Donanımınız varsa bu hafta GLM-5.2'nin genel ağırlıklarını kullanarak yığınınızı kurun ve kuru çalıştırma yapın veya yoksa daha küçük bir MoE modeli kullanın. 28 Ağustos'ta CUDA sürücülerini ayıklamak, kaçınılabilir bir hata modudur.
Barındırılan API'yi bugün temel çizginiz olarak kullanın
Çoğu ekibin atladığı hazırlık adımı şudur: bir modeli kendi kendinize barındırmadan önce, referans uygulamanın ne ürettiğini kaydedin. Zhipu'nun barındırılan API'si bu referanstır ve şu anda canlıdır. Yerel dağıtımınız farklı yanıt verdiğinde, kaydedilmiş bir temel çizgi, boşluğun kuantizasyon seçiminizden, bir sunum yığını hatasından veya normal örnekleme varyansından kaynaklanıp kaynaklanmadığını size söyler.
Barındırılan API, OpenAI uyumludur: uluslararası olarak https://api.z.ai/api/paas/v4/chat/completions, anakara Çin için https://open.bigmodel.cn/api/paas/v4/chat/completions, Authorization: Bearer <key> yetkilendirmesi. Z.ai belgeleri bugün glm-5'i listeliyor; glm-5.3 aile kuralına uyar, bu nedenle kesin dizeyi resmi belgelerde doğrulayın. Her iki bölge için tam kurulum, GLM-5.3 API hızlı başlangıç kılavuzumuzda yer almaktadır.
Sıcaklık 0'da sabit istemlerle temel çizgileri yakalayın:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"temperature": 0,
"messages": [
{"role": "user", "content": "Write a Python function that parses RFC 3339 timestamps and returns UTC datetimes. Include error handling for invalid input."}
]
}' > baseline-rfc3339.json
Gerçek iş yüklerinizi kapsayan 20 ila 50 tane oluşturun: kod oluşturma görevleri, ajan araç çağrı kalıpları, uzun bağlam özetleme. Sıcaklık 0, çıktıları mükemmel bir şekilde tekrarlanabilir yapmayacaktır, ancak bir niceleme kaynaklı kalite düşüşünün belirginleşeceği kadar varyansı daraltır.
Regresyon test takımını Apidog'da oluşturun
Ham cURL betikleri, iki uç noktanız, üç niceleme seviyeniz ve bir ekip arkadaşınızın hangi yapılandırmanın geçtiğini sormasına kadar işe yarar. Yapılandırılmış bir test takımı daha iyi ölçeklenir ve bu, QA mühendisleri için API test kılavuzumuzda ele alınan aynı disiplin olan standart bir API regresyon problemidir.
Apidog'daki kurulum:
- Tek bir koleksiyon, her temel istem. Sohbet tamamlama yolu için her temel durum başına bir istek oluşturun. OpenAI uyumlu şema, OpenAI tarzı bir spesifikasyonu içe aktarabileceğiniz ve istek şeklini ücretsiz olarak doğrulayabileceğiniz anlamına gelir.
- İki ortam:
hostedvelocal.hosted, temel URL'yiGLM_API_KEY'inizlehttps://api.z.ai/api/paas/v4olarak ayarlar;local, yer tutucu bir anahtarlahttp://localhost:8000/v1(vLLM'nin varsayılanı) adresini gösterir. Her istek{{base_url}}'e referans verir, bu nedenle hedefleri değiştirmek tek bir açılır menüden yapılır. - Önce şekil, sonra içerik üzerinde iddialar. HTTP 200'ü, boş olmayan bir
choices[0].message.content'i ve mantıklı birusagebloğunu doğrulayın. Kod temel çizgileri için, ifade kaymasını atlatabilen içerik kontrolleri ekleyin: yanıtdefiçeriyor,datetime'dan bahsediyor, birtrydeseni içeriyor. - Barındırılan yanıtları örnek olarak kaydedin. Bunlar referans donanımlarınız olur. Yayın günü, koleksiyonu
local'e karşı yeniden çalıştırır ve farkları kontrol edersiniz. - CLI'dan çalıştırın. Apidog'un çalıştırıcısı koleksiyonu başsız olarak yürütür, böylece karşılaştırma, niceleme seviyesi, sunum yığını veya yapılandırma değişikliği başına yeniden çalıştırdığınız senaryolaştırılabilir bir adım haline gelir.
28 Ağustos'a kadar istediğiniz çıktı, 'dağıtımım barındırılan model gibi davranıyor mu' sorusuna, hissiyat yerine istem başına geçme/kalma şeklinde tek komutluk bir yanıttır.
İstemci kodunuz değişmez
OpenAI uyumlu kuralın getirisi: barındırılan API'ye karşı yazılmış uygulamalar, yeniden yazma değil, bir yapılandırma değişikliği ile kendi kendine barındırılan uç noktanıza taşınır. Bir ortam değişkeni hedefi kontrol eder:
import os
from openai import OpenAI
# Hosted: GLM_BASE_URL=https://api.z.ai/api/paas/v4
# Local: GLM_BASE_URL=http://localhost:8000/v1
client = OpenAI(
base_url=os.environ["GLM_BASE_URL"],
api_key=os.environ.get("GLM_API_KEY", "local-serving"),
)
response = client.chat.completions.create(
model="glm-5.3",
temperature=0,
messages=[
{"role": "user", "content": "Refactor this function to remove the nested loops: ..."},
],
)
print(response.choices[0].message.content)
```vLLM ve SGLang, sunum sırasında kaydettiğiniz model adını kabul eder, bu nedenle --served-model-name glm-5.3, model dizesini barındırılan kimliğe bile aynı tutar. Akış, araç çağrıları ve JSON modu aynı yüzeyde çalışır, ancak özellikle araç çağrısını regresyon testi yapın: yerel yığınların barındırılan davranıştan en sık ayrıldığı yer burasıdır.
Maliyet çerçevesi: barındırılan API'ye karşı kendi GPU'larınız
Zhipu, lansman sırasında 5.3'e özel API fiyatlandırmasını yayınlamamıştı; maliyetleri modellemeden önce güncel rakamlar için resmi fiyatlandırma sayfasını kontrol edin. Bu nedenle buradaki karşılaştırma yapısal olup, belirteç başına değildir.
744B sınıfı bir MoE'yi kendi kendine barındırmak, belirteç akışı olsun ya da olmasın GPU kapasitesi için ödeme yapmak anlamına gelir. Bu üç durumda kendini gösterir: belirteç başına ücretlerin amorti edilmiş donanım veya kiralama maliyetini aşacağı kadar yüksek sürdürülebilir kullanım, istemleri ağınızda tutan veri yönetimi ve paylaşılan bir API'nin garanti edemediği gecikme veya kullanılabilirlik kontrolü. Bunun altında, barındırılan çözümler fiyat açısından kazanır ve değerlendirme için GPU saatleri kiralamak, doğrulanmamış bir model için donanım satın almaktan daha iyidir.
Ayrıca bir korunma argümanı da var. Sağlayıcı fiyatlandırması değişebilir; DeepSeek'in 2026'daki artışı, lansman oranlarına dayalı birim ekonomisi oluşturan ekipleri yakaladı, bunu DeepSeek API fiyat artışı analizimizde ele almıştık. Açık ağırlıklar bu olumsuzluğu sınırlar: eğer barındırılan fiyatlandırma değişirse, kendi kendine barındırma yolunuz zaten kanıtlanmıştır.
Yayın günü kontrol listesi
Yukarıdaki her şey bu listeye sıkıştırılmıştır. 1'den 6'ya kadar olan maddeler bugün yapılabilir.
Yukarıdaki aritmetik aralıkları kullanarak erişebileceğiniz donanıma karşı hedef hassasiyet seviyenizi (BF16, FP8 veya kuantları bekle) onaylayın.vLLM veya SGLang'i kurun ve GLM-5.2'nin genel ağırlıkları veya başka bir MoE modeliyle kuru çalıştırma yapın.BirZ.aiAPI anahtarı oluşturun ve tam 5.3 model kimliğinicanlı belgelerledoğrulayın.Barındırılan API'den 20 ila 50 sıcaklık-0 temel yanıtını yakalayın.hosted ve local ortamları ve şekil iddiaları ile Apidog koleksiyonunu oluşturun.Dağıtım katmanı başına maksimum sunulan bağlam uzunluğunuzu belirleyin.Yayınlandığında: GLM-5.3 ve GLM-5.3-FP8 depoları içinhuggingface.co/zai-org'u izleyin ve ticari olarak dağıtmadan önce model kartı lisansını okuyun.Ağırlıkları indirin, sunucuyu başlatın, local ortamını ona yönlendirin ve koleksiyonu çalıştırın.Yerel olanı barındırılan donanımlara karşı farklılıklarını kontrol edin. Trafiği ölçeklemeden önce içerik düzeyindeki hataları araştırın.Ancak o zaman ayarlamalara başlayın: niceleme seviyesi, paralellik düzeni, önek önbellekleme, bağlam limitleri.
Sıkça Sorulan Sorular
GLM-5.3 ağırlıklarını şu anda indirebilir miyim?
Hayır. 14 Ağustos 2026 itibarıyla yalnızca barındırılan API canlıdır. Zhipu, açık ağırlıkların yayınlandıktan yaklaşık iki hafta sonra, 28 Ağustos civarında geleceğini belirtiyor. Beklenen hedef, GLM-5, 5.1 ve 5.2'nin zaten bulunduğu zai-org Hugging Face sayfasıdır.
GLM-5.3 tek bir tüketici GPU'sunda çalışır mı?
Tam ağırlıklarla hayır. Ailenin toplam 744B parametresi, KV önbelleği öncesinde FP8'de yaklaşık 744 GB'tır, bu da herhangi bir tek kartın çok ötesindedir ve hatta INT4 sınıfı kuantlar bile çoklu GPU alanına girer. Tek GPU bütçeleri için, daha küçük açık modelleri yerel olarak çalıştırın ve GLM-5.3'ü barındırılan API'de tutun; yerel LLM derlememiz neyin uyduğunu listeler.
GLM-5.3 için hangi sunum çerçevesini kullanmalıyım?
vLLM en güvenli varsayılandır: kanıtlanmış GLM-5 aile desteği, MoE farkındalıklı paralellik ve OpenAI uyumlu bir sunucu. SGLang, ajan döngülerinin yaptığı gibi iş yükünüzün uzun paylaşılan önekleri yeniden göndermesi durumunda güçlü bir alternatiftir. llama.cpp ve Ollama yolu, topluluk GGUF dönüşümleri ortaya çıktıktan sonra açılır.
Mevcut OpenAI SDK kodum kendi kendine barındırılan bir GLM-5.3'e karşı çalışır mı?
Evet, OpenAI uyumlu kuralın her iki taraftaki amacı budur. SDK'nın base_url'ini https://api.z.ai/api/paas/v4 yerine vLLM veya SGLang sunucunuza yönlendirin ve aynı istek şeklini koruyun. Özellikle araç çağırma ve akışı test edin; yerel yığınların ara sıra farklılık gösterdiği noktalar bunlardır.
Kendi kendime barındırmayı planlıyorsam neden barındırılan API ile uğraşayım?
Çünkü bu sizin referans uygulamanızdır. Barındırılan temel çizgiler olmadan, garip bir yerel çıktının nicelemenizin çok agresif olduğu anlamına mı geldiğini yoksa modelin her yerde bu şekilde mi davrandığını anlayamazsınız. GLM-5.3 API hızlı başlangıç kılavuzumuzdaki kurulumu kullanarak barındırılan uç nokta aracılığıyla şimdi temel çizgileri yakalayın, böylece yayın günü tahminde bulunmak yerine bir fark kontrolü alıştırması haline gelir.
GLM-5.3 yığınınızda nerede yer alıyor
GLM-5.3, yılın şimdiye kadarki en güçlü açık ağırlık kodlama duyurusudur: Terminal-Bench 3.0 ve Agents' Last Exam'de açık modeller arasında birinci, iki sınır modelinden daha yüksek bir CyberGym puanı ve kamuya açık bir programa göre gelen ağırlıklar. İlk haftada değer elde edecek ekipler en büyük GPU bütçelerine sahip olanlar olmayacak. Onlar, iki haftalık pencereyi çekici olmayan işlere harcayanlar olacak: yığın kurulu, hassasiyet seviyesi seçilmiş, temel çizgiler yakalanmış, test takımı hazır.
Yukarıdaki kontrol listesiyle başlayın. Bu hafta barındırılan temel çizgilerinizi yakalayın ve bunları tutmak için Apidog'u indirin: bir koleksiyon, bir hosted ve bir local ortamı ve 'dağıtımım çalışıyor mu' sorusunu, bir niceleme seviyesi veya bir sunum bayrağını her değiştirdiğinizde yeniden çalıştırabileceğiniz bir geçme/kalma raporuna dönüştüren iddialar.
