Z.ai, GLM-5.3-Flash'i 26 Ağustos 2026'da yayınladı. Bu, 320 milyar parametreli ve 18 milyar aktif parametreli bir uzman karışımı modelidir. MIT lisansı altında yayınlanmıştır ve GLM-5 serisinin, eklenmiş bir görüntü bağdaştırıcısı yerine görüntüleri yerel olarak işleyen ilk modelidir.
Aynı zamanda birçok geliştiricinin, bilmeden bir haftadır kullandığı modeldir. Daha fazlası aşağıda.
Buraya "Flash"ın "hızlı" anlamına geldiğini bekleyerek geldiyseniz, bu yazı sizinle aynı fikirde olmayacak. Bu adlandırma kuralı, Flash modellerinin gerçekten de düşük gecikmeli katman olduğu Google'dan geliyor. Burada farklı bir anlama geliyor ve bu ayrımı doğru anlamak, bu modelin iş yükünüze uygun olup olmadığını belirliyor.
ÖZET
- Nedir: Z.ai'den 26 Ağustos 2026'da yayınlanan, açık ağırlıklı (MIT) 320B-A18B uzman karışımı modeli.
- Manşet değişikliği: Yerel çok modluluk. Görüntü, video ve dosya girişi doğrudan modele gider. GLM-5.3 görüntüleri ayrı adaptörler aracılığıyla yönlendirirken, GLM-5.2 yalnızca metin tabanlıydı.
- Bağlam: 1.048.576 token, GLM-5.3 ile aynı 1M penceresi.
- Asıl satış noktası: maliyet. Z.ai, GLM-5.2'nin yaklaşık onda biri fiyatında olduğunu belirtiyor; giriş tokenları için milyon başına 0,15 dolar ve çıktı için milyon başına 0,50 dolar liste fiyatı ile.
- Dürüst uyarı: hızlı değil. Artificial Analysis, saniyede 48,7 çıktı tokenı ölçüyor ki bu, boyut sınıfı için yavaş. İlk token süresi ise 1,52 saniye ile gerçekten iyi.
- Nereden alınır: Z.ai API'sinde `glm-5.3-flash` olarak, ayrıca OpenRouter, Cloudflare Workers AI, Vercel AI Gateway ve diğer birçok sağlayıcıda. Ağırlıklar Hugging Face'te.
Teknik özellikler
| Özellik | Değer |
|---|---|
| Toplam parametreler | 320B |
| Aktif parametreler | 18B |
| Mimari | Uzman karışımı, hibrit doğrusal ve seyrek dikkat mekanizması |
| Lisans | MIT |
| Bağlam penceresi | 1.048.576 token |
| Giriş modları | Metin, görüntü, video, dosyalar |
| Çıktı | Metin |
| Akıl yürütme modları | düşük, yüksek, maks (varsayılan maks) |
| API model kimliği | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
Dikkatle ele alınması gereken bir sayı: maksimum çıktı tokenları. OpenRouter 131.072 listelerken, Hugging Face model kartı 163.840 belirtiyor. Bu kaynaklar çelişiyor ve Z.ai bunu kesinleştirecek bir rakam yayınlamadı. Uygulamanız çok uzun tekli üretimlere bağlıysa, geliştirmeye başlamadan önce limitini gerçek sağlayıcınızla kontrol edin.
Yerel çok modluluk asıl haberdir
GLM serisindeki önceki her görüntü yeteneği ayrı bir model veya ayrı bir yol olarak geldi. Z.ai, GLM-5V-Turbo ve GLM-4.6V'yi ayrı görüntü modelleri olarak yayınladı. Bir GLM modelinin bir ekran görüntüsüne bakmasını istiyorsanız, metin trafiğinizin kullandığı uç noktadan farklı bir uç noktayı çağırırdınız.
GLM-5.3-Flash bunu birleştiriyor. Görüntüler, videolar ve dosyalar, metninizi taşıyan aynı sohbet tamamlama isteğindeki içerik bloklarıdır. Tek bir model kimliği, tek bir faturalandırma satırı ve hem görüntünüzü hem de çevresindeki bir milyon tokenlık metninizi aynı anda barındıran tek bir bağlam penceresi vardır.
Son kısım ilginç. Görüntüleri de kabul eden 1M tokenlık bir bağlam penceresi, uzun bir spesifikasyon belgesi ile işlenmiş sonucun bir ekran görüntüsünü aynı istemde bir araya getirip modelden bunları uzlaştırmasını isteyebileceğiniz anlamına gelir. Z.ai'nin kendi çerçevelemesi buna dayanıyor: modelin "arayüzleri, işleme sonuçlarını ve etkileşim geri bildirimlerini" gözlemlediğini açıklıyor ki bu, bir fotoğraf alt yazısı değil, bir kodlama ajanı kullanım durumudur.
Görüntü modelleriyle daha geniş çapta çalışıyorsanız, GLM-5V-Turbo'nun API'si hakkındaki rehberimiz eski özel görüntü yaklaşımını kapsar ve belge anlama için GLM-OCR uzmanlık durumunu kapsar.
Mimariye kısaca
Z.ai, GLM-5.3-Flash'i GLM-5.2'yi eğitim sonrası yerine yeni bir temel model üzerine inşa etti. Davranışı açısından önemli olan iki tasarım seçimi var:

Hibrit dikkat mekanizması. Model, doğrusal dikkati seyrek dikkatle karıştırır. Doğrusal dikkat, yerel bağımlılıkları ucuza halleder; seyrek dikkat ise küresel olarak ilgili tokenlara ulaşır. Belirtilen sonuç, GLM-5.3'ten yaklaşık üç kat daha az dikkat hesaplaması ve yaklaşık 4,4 kat daha küçük bir KV önbelleğidir.
Çok Yüzeyli Kısıtlı Hiper Bağlantılar. Z.ai'nin bu sürümdeki ölçekleme verimliliği çalışması için kullandığı terim. Henüz bağımsız olarak değerlendirmek için yeterli kamu detayı yok, bu yüzden bunu kanıtlanmış bir avantajdan ziyade satıcı tarafından tanımlanmış bir mimari özellik olarak ele alın.
KV önbellek azalması, açık pratik sonuçları olan kısımdır. KV önbelleği, uzun bağlam çıkarımını bellek açısından pahalı hale getirir ve bunu 4,4 kat küçültmek, bu modelin 1M pencereyi korurken GLM-5.2'nin onda biri fiyatına sunulabilmesinin temel nedenidir.
Eğitim, Z.ai'nin kabaca 30 trilyon çok modlu token olarak tanımladığı bir veri kümesi kullanılarak yapıldı.
Adı hakkında
Artificial Analysis, GLM-5.3-Flash'ı saniyede 48,7 çıktı tokenı olarak ölçüyor. Bağlam için, bu, benzer boyuttaki açık ağırlıklı modeller için alt sınırdadır. Daha büyük kardeş olan GLM-5.3, aynı ölçümde yaklaşık saniyede 86 token hızında çalışır.
Yani Flash modeli, Flash olmayan modelin yaklaşık yarısı hızındadır.
Kazandığı şey ise ilk tokena kadar geçen süredir; 1,52 saniye ile açık ağırlıklı modellerin ortalama 2,14 saniyesine karşı. İş yükünüz birçok kısa etkileşimli dönüş ise, bu yanıt hızı gerçektir. İş yükünüz uzun belgeler üretmek ise, GLM-5.3'e göre daha uzun bekleyeceksiniz.
Bu modelin sunduğu verimlilik, duvar saati üretim hızında değil, maliyet ve bellektedir. Daha küçük KV önbelleği ve daha düşük dikkat hesaplaması, token başına daha ucuz bir fiyat ve daha küçük bir sunum alanı anlamına gelir. Daha hızlı akış anlamına gelmez.
Bu önemlidir, çünkü lansmandan sonraki günlerde yayınlanan haberlerin çoğu, tedarikçinin çerçevelemesini, her zaman kamuya açık olan verim sayısını kontrol etmeden tekrarladı. Bu modeli, ucuz olduğu ve görüntüleri işlediği için seçin, hızlı akış yapmasını beklediğiniz için değil.
Kıyaslamalar
Z.ai tarafından lansmanda yayınlanan sayılar, bu yüzden üçüncü taraflar bunları doğrulamadan önce bunları satıcı iddiaları olarak okuyun:

Bağımsız rakam Artificial Analysis'ten gelmektedir ve GLM-5.3-Flash'i Intelligence Index v4.1.1'de 57 olarak konumlandırır. GLM-5.3 ise 60 puan alır. Benzer boyuttaki açık ağırlıklı modeller için medyan 27'dir, bu nedenle 57, daha büyük kardeşinin altında olsa da sınıfı için güçlü bir sonuçtur.
Z.ai, modeli kodlama ve aracı işlerde Claude Opus 4.8'e yaklaştığını belirtiyor. Bu, satıcının kendi dahili değerlendirmelerinin bir karakterizasyonudur, ölçülmüş bir üçüncü taraf sonucu değildir ve kendi GLM-5.3'üne olan üç puanlık Zeka Endeksi farkı, biraz ihtiyatlı olunmasını gerektirir.
GLM kıyaslama hikayesinin önceki sürümlerde nasıl geliştiğini merak ediyorsanız, GLM-5.2 kıyaslama analizimiz bu değerlendirmelerin her birinin aslında neyi ölçtüğünü açıklar.
Ox Alpha haftası
20 Ağustos'ta, üçüncü taraf çıkarım platformlarında `ox-alpha` adında anonim bir model ortaya çıktı. 1M tokenlık bir bağlam penceresine ve sıfır fiyata sahipti. Günler içinde bu platformlarda en çok kullanılan modellerden biri haline geldi. Topluluk, çıktı özelliklerine dayanarak yaklaşık 48 saat içinde bunun Zhipu'ya ait olduğunu tespit etti.

26 Ağustos'ta Z.ai bunu doğruladı: Ox Alpha, GLM-5.3-Flash'tı ve ücretsiz hafta kasıtlı bir yük testiydi.
Z.ai ayrıca o hafta boyunca tüm trafiğin SGLang tabanlı bir yığın kullanılarak yerel Çin hızlandırıcılarında servis edildiğini ve token başına servis maliyetinin ana akım NVIDIA donanımıyla karşılaştırılabilir olduğunu iddia etti. Bu, kendi altyapısı hakkında bağımsız doğrulaması olmayan bir satıcı iddiasıdır, bu yüzden buna göre değerlendirin.
Bu deseni daha önce Pony Alpha'nın bir DeepSeek veya GLM modeli olduğu ortaya çıktığında yazmıştık. Üçüncü taraf yönlendiricilerde gizli lansmanlar standart bir ön-yayın adımı haline geliyor ve faydalı çıkarım şudur ki, şüpheli derecede yuvarlak bir bağlam penceresine sahip alışılmadık derecede yetenekli anonim bir model neredeyse her zaman birisinin yayınlanmamış amiral gemisinin değerlendirme verisi topladığı anlamına gelir.
Gerçekte nasıl kullanılır
Barındırılan API. Z.ai uç noktası OpenAI uyumludur. Mevcut istemcinizi `https://api.z.ai/api/paas/v4/` adresine yönlendirin ve modeli `glm-5.3-flash` olarak ayarlayın. GLM-5.3-Flash API rehberimiz kimlik doğrulamasını, görüntü girişi yükünü ve akıl yürütme çabası parametresini adım adım açıklar.
Üçüncü taraf sağlayıcılar. OpenRouter bunu `z-ai/glm-5.3-flash` olarak taşıyor. Ayrıca Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten ve io.net'te de mevcut. Fiyatlar bayiler arasında, bazen önemli ölçüde değişir.
Kodlama ajanları. Flash, GLM Kodlama Planı'na dahildir ve GLM-5.3'ün kullanılabilir kotasının üç katını taşıdığı bildirilmektedir, bu da bir abonenin geçiş yapması için pratik bir nedendir. Z.ai'nin belgeleri ayrıca, yoğun olmayan saatlerdeki aramaların standart puanların yarısını tükettiğini belirtir.
Kendi kendine barındırılan. Ağırlıklar MIT lisanslıdır ve Hugging Face'tedir. vLLM, SGLang, TokenSpeed ve KTransformers hepsi bunu destekler ve daha küçük donanımlar için GGUF nicelemeleri mevcuttur.
Kullanmalı mısınız?
Metninizle aynı çağrıda görüntü veya video anlayışına ihtiyacınız varsa, token başına maliyetiniz optimize ettiğiniz kısıtlama ise veya hoşgörülü bir lisans altında kendi kendine barındırabileceğiniz açık ağırlıklar istiyorsanız GLM-5.3-Flash'ı kullanın.
Akıl yürütme kalitesinde son birkaç puana ihtiyacınız varsa veya üretim verimi sizin için fiyattan daha önemliyse bunun yerine GLM-5.3'e yönelin. İkisinin yan yana karşılaştırmamız kararı ayrıntılı olarak inceler ve GLM-5.3'ün ne olduğu temel modeli kendi terimleriyle ele alır.
Hangisini seçerseniz seçin, model değişimi OpenAI uyumlu bir uç noktada tek satırlık bir model kimliği değişikliğidir, bu da herhangi bir kıyaslama tablosuna güvenmek yerine ikisini de kendi iş yükünüze göre test etmeyi kolaylaştırır. Doğru olanı budur.
Bir model değişimini düzgün bir şekilde test etmek, gerçek istekler göndermek ve gerçek yanıtları kontrol etmek anlamına gelir; buna, curl'de manuel olarak oluşturması zor olan çok modlu olanlar da dahildir. Apidog, bu çağrıları ekli doğrulayıcılarla yeniden kullanılabilir bir koleksiyon olarak kaydetmenize olanak tanır, böylece GLM-5.3'ten Flash'a geçtiğinizde yanıt şeklinin değişmediğini üretimde öğrenmek yerine onaylayabilirsiniz.
Sıkça Sorulan Sorular
GLM-5.3-Flash ücretsiz mi? Artık değil. Ücretsiz Ox Alpha haftası, model resmi olarak duyurulduğunda sona erdi. 9 Eylül 2026'ya kadar süren %50'lik bir lansman indirimi var, bundan sonra liste fiyatlandırması uygulanacak.
GLM-5.3'ten daha mı hızlı? Hayır. GLM-5.3'ün saniyede 86 tokenına karşı yaklaşık saniyede 49 token üretir. Ancak 1,52 saniyede ilk tokena yanıt vermeye daha erken başlar.
Gerçekten bir milyon tokenlık bir bağlamı işleyebilir mi? Yapılandırılmış pencere 1.048.576 tokendir, model yapılandırmasında ve Artificial Analysis tarafından onaylanmıştır. OpenRouter'ın 1.310.720 gibi daha büyük bir rakam listelediğini unutmayın; bunu bir model özelliği yerine sağlayıcı tarafı listesi olarak değerlendirin.
Video kabul ediyor mu? Z.ai'nin belgeleri metin, görüntü, video ve dosya girişi listeler. Video desteği, görüntü girişine göre daha yeni ve daha az yaygın olarak kullanıldığından, ona güvenmeden önce kendi medyanızla doğrulayın.
Ağırlıklar hangi lisans altında? MIT, ağırlıklar Hugging Face'te `zai-org/GLM-5.3-Flash` adresinde yayınlanmıştır.
