GLM-5.2, şu anda çalıştırabileceğiniz en yetenekli açık ağırlıklı modellerden biridir ve açık MIT lisansı, "ücretsiz" olmanın gerçekten masada olduğu anlamına gelir. Ancak "ücretsiz" ve "kolay", yaklaşık 753B parametreli uzmanlar-karışımı bir model için aynı şeyler değildir. Bu rehber, gerçekten ücretsiz kendi kendine barındırmadan neredeyse ücretsiz deneme kredilerine ve en ucuz ücretli tabana kadar gerçek yolları, donanım ve sınırlamalar hakkında dürüst notlarla birlikte anlatmaktadır.
Kısa versiyonunu istiyorsanız: eğer donanımınız (veya ucuz kiralık bir GPU) varsa, açık ağırlıkları kendi sunucunuzda barındırın. Yoksa, z.ai deneme kredilerine veya en ucuz GLM Kodlama Planı katmanına yönelin. glm-5.2 için ücretsiz bir OpenRouter yolu yoktur, bu yüzden onu aramayın.
Hızlı karar ağacı
Satırınızı seçin ve o bölüme atlayın.
| Durumunuz | En iyi yol | Gerçek maliyet |
|---|---|---|
| Güçlü bir GPU kutusuna sahipsiniz (veya kiralayabilirsiniz) | Açık ağırlıkları kendi sunucunuzda barındırın (Ollama / vLLM) | Ağırlıklar için 0$; elektrik veya GPU kiralama |
| Sıfır kurulum ve kart gereksinimi istiyorsunuz | z.ai ücretsiz deneme kredileri / hız sınırlı katman | Krediler bitene kadar ücretsiz (mevcut teklifi doğrulayın) |
| En ucuz güvenilir ücretli yolu istiyorsunuz | GLM Kodlama Planı Lite veya önbelleğe alınmış giriş API fiyatlandırması | ~3-6$/ay (doğrulayın) veya çağrı başına kuruşlar |
| Taahhüt olmadan kullandığın kadar öde istiyorsunuz | OpenRouter API | 1M giriş başına 1.40$, 1M çıkış başına 4.40$ |
Genel kural: gerçekten ücretsiz demek kendi sunucunda barındırmak demektir. Neredeyse ücretsiz demek deneme kredileri veya Lite plan demektir.

Rota 1: Açık MIT ağırlıklarını kendi sunucunuzda barındırın (gerçekten ücretsiz)
GLM-5.2, MIT lisansı altında bölgesel kısıtlamalar olmaksızın sunulmaktadır, bu sayede ağırlıkları indirip kimseye ödeme yapmadan kendi donanımınızda çalıştırabilirsiniz. Ağırlıklar Hugging Face'te zai-org/GLM-5.2 adresinde bulunmaktadır.
Dürüst kısım: Bu, BF16 formatında yaklaşık 753B parametreli bir Uzmanlar-Karışımı (MoE) modelidir. Bu parametrelerin yalnızca bir kısmı belirteç başına etkinleşse bile, tüm ağırlık kümesi bellekte bulunmalıdır. BF16'da bu, bir terabayttan fazla ham ağırlık anlamına gelir. Bunu bir dizüstü bilgisayarda çalıştıramazsınız. Kendi kendine barındıran çoğu kişi iki şeyden birini yapar:
- Bellek ayak izini küçültmek için **nicelenmiş bir yapı** (4-bit veya benzeri) çalıştırır, küçük bir kalite tavizini kabul ederek.
- Bir bulut sağlayıcıdan saatlik olarak **çoklu GPU örneği kiralar** ve işi bittiğinde kapatır.
Yani buradaki "ücretsiz" lisans maliyetinden muaf olmak anlamına gelir. Donanım, elektrik veya GPU kiralama ücretini yine ödersiniz. Çoğu birey için, yüksek VRAM'li bir iş istasyonunda nicelenmiş bir yapı veya kısa süreli kiralanmış bir oturum gerçekçi bir yoldur.
GLM-5.2'yi Ollama ile Çalıştırın
Ollama, en kullanıcı dostu yerel çalıştırıcıdır. GLM-5.2, Ollama kütüphanesinde mevcuttur, iş akışı iki komutluktur:
# Modeli çekin (çok büyük bir indirme bekleyin)
ollama pull glm-5.2:cloud

Ollama varsayılan olarak nicelenmiş bir varyant kullanır; bu da bu boyuttaki bir modelin tüketici sınıfı donanımda bile düşünülebilir olmasını sağlar. Ayrıca Ollama'nın yerel OpenAI uyumlu uç noktasından da erişebilirsiniz:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "RFC 3339 zaman damgasını ayrıştırmak için bir Python işlevi yazın."}]
}'
RAM ve VRAM'inizi izleyin. Model diske taşarsa, üretim hızı düşer. Nicelenmiş bir yapı artı yeterli birleşik bellek veya çoklu GPU bölünmesi, kullanılabilir ile kullanılamaz arasındaki farkı yaratır.
Adım adım yerel rehberi istiyorsanız, kalıplar önceki nesilden neredeyse tamamen aktarılır. Tam kurulum, nicemleme seçimleri ve sorun giderme için GLM-5'i yerel olarak ücretsiz çalıştırma ve GLM-5'i Ollama ile ücretsiz çalıştırma rehberlerine bakın. Model etiketini glm-5.2 olarak değiştirin ve iş akışı aynıdır.
GLM-5.2'yi vLLM ile Çalıştırın
Verim ve birden çok isteğe hizmet vermek için vLLM, üretim seviyesi bir seçenektir. GPU'lar arası tensör paralelliğini yönetir, bu da 753B MoE'yi gerçekten nasıl sığdıracağınızdır.
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model zai-org/GLM-5.2 \
--tensor-parallel-size 8 \
--max-model-len 131072
Bu --tensor-parallel-size 8 sekiz GPU varsayar. Tam sayı kartlarınıza ve nicelenmiş bir kontrol noktası yükleyip yüklemediğinize bağlıdır. vLLM, OpenAI uyumlu bir sunucu sunar, bu nedenle sohbet tamamlama formatını konuşan herhangi bir istemci değişiklik yapmadan çalışır. 1M belirteç bağlamı (1.048.576 belirteç) manşet özelliğidir, ancak bir milyon belirteçlik KV önbelleğini tutmak çok fazla bellek maliyeti getirir, bu nedenle --max-model-len'i gerçekten ihtiyacınız olana ayarlayın.
Rota 2: z.ai ücretsiz deneme kredileri ve hız sınırlı katman
Kendi kendine barındırma ulaşılamazsa, bir sonraki en ucuz yol z.ai'nin kendi platformudur. Yeni hesaplar genellikle **ücretsiz deneme kredileri** alır ve genellikle hafif deneyler için **hız sınırlı ücretsiz bir katman** bulunur (Haziran 2026 itibarıyla, deneme koşulları sık sık değiştiği için mevcut teklifi z.ai adresinden doğrulayın).
Bu, gerçek modeli sıfır kurulumla denemenin en hızlı yoludur. Bir hesap oluşturur, bir API anahtarı alır ve OpenAI uyumlu uç noktayı çağırırsınız:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "IndexShare seyrek dikkatini iki cümleyle açıklayın."}],
"thinking": {"type": "enabled"},
"reasoning_effort": "max"
}'
Bu kredileri harcarken bilmeye değer birkaç GLM-5.2'ye özgü detay:
thinkingmantık yürütmeyi açar veya kapatır. Kodlama için z.ai,reasoning_effort: "max"aracılığıyla **Maksimum** düşünme-çabası seviyesini önerir. İki çaba seviyesi vardır: Yüksek ve Maksimum.- Çıkış uzunluğu z.ai belgelerine göre 128K'ya kadar belgelenmiştir, ancak ikincil kaynaklar bunu her zaman listelemediği için bunu katı bir garanti yerine canlı olarak doğrulanması gereken bir sayı olarak kabul edin.
Deneme kredileri biter. Bittiklerinde, ya ücretli bir plana geçersiniz ya da kendi kendine barındırmaya geri dönersiniz. Tam parametre detayları z.ai GLM-5.2 rehberindedir.
Rota 3: En ucuz ücretli tabanlar (neredeyse ücretsiz)
Ücretsiz krediler bittiğinde, iki yol maliyetlerinizi sıfıra yakın tutar.
GLM Kodlama Planı Lite
Ana kullanımınız kodlamaysa, GLM Kodlama Planı değerli bir seçenektir. Giriş **Lite katmanı yaklaşık 12$/aydır** (Haziran 2026 itibarıyla, yayınlanan katmanlar kaynaklar arasında çeliştiği için mevcut fiyatlandırmayı z.ai adresinden doğrulayın). Bunun karşılığında, ölçülen belirteçler yerine sabit aylık ücretle kodlama erişimi elde edersiniz, bu da yoğun günlük kullanımı öngörülebilir hale getirir.

Kodlama Planı ayrıca Anthropic uyumlu yolu da açar, böylece Claude Code, Cline veya Cursor'ı GLM-5.2'ye yönlendirebilirsiniz. Kodlama temel URL'si https://api.z.ai/api/coding/paas/v4'tür (bazı kaynaklar open.z.ai/api/paas/v4'ü gösterir, bu yüzden canlı doğrulayın). Çalışan bir Claude Code ortamı şöyle görünür:
export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000
[1m] eki 1M bağlam varyantını seçer. API_TIMEOUT_MS'i yüksek ayarlayın, aksi takdirde Claude Code, uzun, büyük bağlamlı çağrıları bitmeden sonlandıracaktır. Daha derin acente-araçlandırma rehberi için, GLM-5.2 ile Claude Code, Cline ve Cursor ve önceki nesil GLM-5.1 ile Claude Code rehberine bakın.
Önbelleğe alınmış giriş fiyatlandırması ve kullandıkça öde
Abonelik olmadan API erişimi için, standart genel API, OpenRouter tarafından onaylandığı üzere, **1M giriş belirteci başına 1.40$ ve 1M çıkış belirteci başına 4.40$** olarak çalışır. z.ai'yi doğrudan arasanız da veya kullandıkça öde olarak OpenRouter üzerinden yönlendirseniz de aynı fiyatlandırma geçerlidir.
Buradaki neredeyse ücretsiz hile **önbelleğe alınmış giriştir**. VentureBeat'e göre (buna göre atfedin), 1M belirteç başına yaklaşık 0.26$ olarak rapor edilen önbelleğe alınmış giriş, uzun bir sistem istemi veya sürekli sorguladığınız sabit bir kod tabanı gibi tekrarlanan bağlamın maliyetini düşürür. İş yükünüz aynı öneki yeniden kullanıyorsa, bir kez tam fiyat ödersiniz ve sonrasında bir kısmını. Uzun ufuklu kodlama için VentureBeat, GLM-5.2'nin "uzun ufuklu kodlamada GPT-5.5'i yaklaşık altıda bir maliyetle yendiğini" belirtiyor, ki bu tek cümlede ekonomik argümandır.
Bir kez daha, açıkça: glm-5.2 için **ücretsiz bir OpenRouter katmanı yoktur**. OpenRouter ucuzdur, ücretsiz değildir. Bir rehber aksini iddia ediyorsa, yanlıştır.
Ücretsiz ve neredeyse ücretsiz: dürüst karşılaştırma
| Yol | Peşin maliyet | Devam eden maliyet | Kurulum çabası | En uygun olduğu durumlar |
|---|---|---|---|---|
| Kendi kendine barındırma (Ollama/vLLM) | Donanım veya kiralama | Elektrik / GPU saatleri | Yüksek | Gizlilik, ölçüm yok, tam kontrol |
| z.ai deneme kredileri | Yok | Krediler bitene kadar ücretsiz | Düşük | İlk deneme, hızlı testler |
| GLM Kodlama Planı Lite | ~3-6$/ay (doğrulayın) | Sabit aylık | Düşük | Claude Code/Cline/Cursor'da günlük kodlama |
| API + önbelleğe alınmış giriş | Yok | 1M başına 1.40$/4.40$; önbelleğe alınmış 0.26$ | Düşük | Uygulamalar, tekrarlanan bağlam iş yükleri |
Faydalı bir desen: fikrinizi deneme kredileriyle doğrulayın, sonra karar verin. Her gün çalıştıracaksanız ve kodlama yapıyorsanız, Lite planı edinin. Gizliliğe ihtiyacınız varsa veya belirteç başına faturalandırmadan tamamen kurtulmak istiyorsanız, kendi kendine barındırmaya yatırım yapın. Yeniden kullanılabilir bağlamla bir ürün geliştiriyorsanız, önbelleğe alma özellikli API en ucuz güvenilir tabandır.
Ücretsiz GLM-5.2 uç noktanızı Apidog ile test edin
GLM-5.2'yi ücretsiz veya ücretli olarak nasıl çalıştırırsanız çalıştırın, uygulamanıza bağlamadan önce uç noktanın gerçekten çalıştığını doğrulamanız gerekecek. İster yerel bir Ollama sunucusu, ister bir vLLM örneği veya z.ai bulut API'si olsun, yanıt, incelemeniz gereken akışlı bir sohbet tamamlama yüküdür.

Apidog, tam da bunun için hepsi bir arada bir API platformudur. GLM-5.2 uç noktanıza bir istek gönderebilir, akışla gelen Sunucu Tarafından Gönderilen Olayların gerçek zamanlı olarak işlenmesini izleyebilir, isteği yeniden kullanılabilir bir durum olarak kaydedebilir ve model canlı hale gelmeden önce ön ucunuzun ona göre geliştirme yapabilmesi için yanıtı taklit edebilirsiniz. Ollama için http://localhost:11434'e veya bulut için z.ai temel URL'sine yönlendirin, Authorization başlığınızı ayarlayın ve bir dakika içinde tekrarlanabilir bir test donanımına sahip olun. Apidog'u indirin ve seçtiğiniz ücretsiz yolun yanında bulundurun.
Sıkça Sorulan Sorular
GLM-5.2'yi kullanmak gerçekten ücretsiz mi? Ağırlıklar MIT lisansı altında ücretsizdir, bu nedenle kendi kendine barındırma lisanslama açısından hiçbir maliyeti yoktur. Donanım veya GPU kiralama ücretini yine ödersiniz. Barındırılan API ücretlidir, ancak z.ai genellikle başlangıçta deneme kredileri ve hız sınırlı bir katman sunar (mevcut teklifi doğrulayın).
GLM-5.2'yi normal bir dizüstü bilgisayarda Ollama ile ücretsiz çalıştırabilir miyim? Gerçekçi olarak, hayır. Yaklaşık 753B parametreli bir MoE modelidir ve nicelenmiş bir yapı bile ciddi bellek gerektirir. Ollama komutları kolaylaştırır, ancak donanım eşiği yüksektir. Yüksek VRAM'li bir iş istasyonu, büyük birleşik belleğe sahip bir Mac veya kiralanmış bir GPU ihtiyacınız olan şeydir. Boyutlandırma için yerel derinlemesine incelemeye bakın.
GLM-5.2 için ücretsiz bir OpenRouter katmanı var mı? Hayır. OpenRouter, GLM-5.2'yi kullandıkça öde modeliyle, 1M belirteç başına 1.40$ giriş ve 4.40$ çıkış ücretiyle sunar. Ucuzdur, ücretsiz değildir. Ücretsiz bir OpenRouter yolu olduğunu iddia eden hiçbir kaynağa güvenmeyin.
GLM-5.2'yi kodlama için kullanmanın en ucuz ücretli yolu nedir? GLM Kodlama Planı Lite katmanı, Haziran 2026 itibarıyla yaklaşık 3-6$/ay (z.ai adresinden doğrulayın). Sabit oranlı kodlama erişimi sağlar ve Claude Code, Cline ve Cursor için Anthropic uyumlu uç noktayı açar.
GLM-5.2, maliyet açısından GPT-5.5 ile nasıl karşılaştırılır? VentureBeat'e göre, GLM-5.2, birçok uzun ufuklu kodlama kıyaslamasında GPT-5.5'i yaklaşık altıda bir maliyetle yener. Tam rakamlar için GLM-5.2 kıyaslama dökümüne ve kafa kafaya karşılaştırmaya bakın.
Sırada ne var
En ucuz yol tamamen donanımınıza ve ne sıklıkta çalıştıracağınıza bağlıdır. Bellek bariyerini aşabilirseniz, kendi kendine barındırma gizlilik ve sıfır ölçüm konusunda kazanır. Deneme kredileri ve Lite planı kolaylık konusunda kazanır. Önbelleğe alınmış girişli API, bağlamı yeniden kullanan uygulamalar için kazanır.
GLM-5.2'nin doğru model olup olmadığına hala karar veriyorsanız, GLM-5.2'nin ne olduğunu ve GLM-5.1 ile nasıl karşılaştırıldığını inceleyerek başlayın. Ona karşı geliştirmeye hazır olduğunuzda, GLM-5.2 API rehberi ve fiyatlandırma dökümü gerisini kapsar ve Apidog aradaki testleri halleder.
