GLM-5.3-Flash Fiyatlandırması: Lansman İndirimi Öncesi ve Sonrası Maliyeti

GLM-5.3-Flash 9 Eylül 2026'ya kadar yarı fiyatına. Liste fiyatları, hesaplanmış maliyet örnekleri, önbelleğe alınmış girdi ve akıl yürütme çabası kaldıraçları.

Medy Evrard

27 August 2026

GLM-5.3-Flash Fiyatlandırması: Lansman İndirimi Öncesi ve Sonrası Maliyeti

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

GLM-5.3-Flash şu anda yarı fiyatına. Bu durum 9 Eylül 2026'da sona erecek ve sona erdiğinde, bugünkü oranlar üzerinden yapılan her maliyet tahmini iki katına çıkacak.

Bu gönderi, modelin şu anki maliyetini, sonrasında ne kadara mal olacağını, alternatiflerle nasıl karşılaştırıldığını ve farkın iş yükünüz için gerçekten önemli olup olmadığını nasıl anlayacağınızı ele almaktadır. Tüm rakamlar 27 Ağustos 2026'da doğrulanmıştır ve fiyatlandırma sayfaları değişebilir, bu nedenle bütçenizi onaylamadan önce sağlayıcınızla teyit edin.

Fiyat kartı

Lansman fiyatı (9 Eylül 2026'ya kadar) Liste fiyatı (sonrası)
Girdi $0.075 / 1M token $0.15 / 1M token
Çıktı $0.25 / 1M token $0.50 / 1M token
Önbelleğe alınmış girdi $0.015 / 1M token $0.03 / 1M token

Yapay Analiz, 7:2:1 önbellek isabeti, girdi ve çıktı oranı kullanarak milyon token başına 0,10 dolarlık karma bir rakam yayınlamaktadır. Bu, karşılaştırmalı alışveriş için faydalı tek bir sayıdır, ancak kendi oranınız faturanızı belirler.

Pratikteki maliyeti

Milyon başına soyut oranları anlamak zordur, bu nedenle 9 Eylül'den sonraki planlama için önemli olan liste fiyatı üzerinden üç somut iş yükü aşağıdadır.

Bir destek sınıflandırıcısı. Ayda 100.000 bilet, her biri yaklaşık 800 girdi tokenı ve 100 çıktı tokenı. Bu, 80M girdi ve 10M çıktı tokenıdır: 12,00 $ girdi artı 5,00 $ çıktı, yani aylık 17 $. `reasoning_effort` ayarını `low` olarak ayarlayın, çıktı tarafı daha da küçülür.

Bir kodlama asistanı. Günde 500 oturum, her oturum için yaklaşık 15.000 girdi tokenı (çoğu tekrarlanan dosya içeriği) ve 2.000 çıktı tokenı. Aylık olarak bu, 225M girdi ve 30M çıktı demektir. Önbelleğe alma olmadan: 33,75 $ artı 15,00 $, yani 48,75 $. Girdinin %70'i önbelleğe alındığında: girdi yaklaşık 14,85 $'a düşerek yaklaşık 30 $'a iner.

Görüntülü bir belge işlem hattı. Ayda 10.000 belge, her biri görüntü içeriği dahil yaklaşık 40.000 token ve 1.500 çıktı tokenı. Bu, 400M girdi ve 15M çıktı demektir: 60,00 $ artı 7,50 $, yani görme gerektiren işler için aylık 67,50 $.

Bunların hiçbiri büyük sayılar değil. Bu modelin amacı da budur.

Önbelleğe alınmış girdi en büyük kaldıraçtır

Yeni girdi için 0,15 $'a karşılık milyon başına 0,03 $ ile önbelleğe alınmış tokenlar, önbelleğe alınmamış tokenların beşte biri maliyetindedir. Sabit bir ön ek, bir sistem komutu, tekrar tekrar sorgulanan bir belge, bağlamdaki bir kod tabanı olan herhangi bir iş yükü, bu ön ekin çağrılar arasında aynı kalacağı şekilde yapılandırılmalıdır.

Önbellek isabet oranlarını sessizce yok eden hata, istemin önüne değişken herhangi bir şey koymaktır. Sistem istemindeki bir zaman damgası, bir istek kimliği veya bir kullanıcı adı, ondan sonraki her şeyi geçersiz kılar. Sabit içeriği önce, değişken içeriği ise sona koyun.

Z.ai ayrıca önbelleğe alınmış girdi depolamasını sınırlı bir süre için ücretsiz olarak listeledi. Bunu promosyon olarak kabul edin ve ona bağımlı bir mimari oluşturmak yerine mevcut şartları doğrulayın.

İkinci kaldıraç, akıl yürütme çabasıdır

Bu modelde `reasoning_effort` varsayılan olarak `max` olarak ayarlanmıştır. Bu en pahalı ayardır ve parametreye hiç dokunmazsanız elde edeceğiniz budur.

Üç mod `low`, `high` ve `max`'tır. Akıl yürütme tokenları çıktı olarak faturalandırılır, bu nedenle müzakereye ihtiyaç duymayan bir görev, kimsenin okumadığı düşünme için çıktı oranları öder. Sınıflandırma, çıkarma, yönlendirme ve biçimlendirme için `low` çıktıyı önemli ölçüde azaltabilir.

Kurulum, API kılavuzumuzda ele alınmıştır. Tek satırlık bir değişikliktir ve faturanız yukarıdaki matematiğin gösterdiğinden daha yüksek görünüyorsa denenecek ilk şeydir.

Nasıl karşılaştırılır

Kendi kardeşine karşı, liste fiyatıyla:

Model 1M başına karma
GLM-5.3-Flash $0.10
GLM-5.3 $0.90

Yapay Analiz Zeka Endeksi'nde 57'ye karşı 60 olmak üzere üç puanlık bir fark için kabaca dokuz katlık bir boşluk. Tam karşılaştırmamız, bu takasın ne zaman yanlış olduğunu ele alır ve kısa cevap şudur: bekleyen bir insana uzun yanıtlar akışla gönderdiğinizde, çünkü GLM-5.3 neredeyse iki kat daha hızlı üretir.

GLM-5.2'ye kıyasla, Z.ai'nin iddiası, görev başına 0,045 $ maliyet rakamının yanı sıra kabaca onda biri fiyatına olmasıdır. GLM-5.2 fiyatlandırma dökümümüz, bir geçiş bütçeliyorsanız eski fiyat kartını içerir.

Diğer satıcıların ucuz çok modlu katmanına kıyasla, GLM-5.3-Flash fiyat açısından rekabetçi ve MIT lisanslı olmasıyla olağandışıdır, bu da kendi kendine barındırma seçeneğinin açık kaldığı anlamına gelir. Gemini 3.7 Flash fiyatlandırma gönderimiz, Google tarafındaki en yakın karşılaştırmayı ele alır.

Satıcı fiyatları farklılık gösterir, bazen çok

Model doğrudan Z.ai aracılığıyla ve ayrıca OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten ve io.net üzerinden mevcuttur.

Bunların hepsi aynı ücreti almaz. Örneğin AIHubMix, Z.ai'nin promosyon ve liste fiyatlandırması arasında yer alan, girdi için yaklaşık 0,113 $ ve çıktı için 0,394 $ oranları listelemiştir. Bazı sağlayıcılar lansman indirimini yansıtırken, bazıları yansıtmaz.

Bir toplayıcı üzerinden yönlendirme yapıyorsanız, Z.ai'yi yansıttığını varsaymak yerine güncel oranını kontrol edin. Birleşik bir ağ geçidinin rahatlığı bazen bir marj taşır ve bu mutlak fiyat seviyelerinde yüzde bir fiyat artışı gözden kaçırmak kolay ve tolere etmesi kolaydır.

Kendi kendine barındırmanın kazanmaya başladığı zaman

Ağırlıklar MIT lisanslıdır, bu nedenle kendi başınıza çalıştırmak gerçek bir seçenektir ve API fiyatı bu kadar düştüğünde kendi kendine barındırma için başabaş matematik zorlaştı.

Kabaca bir çerçeve: tam hassasiyetli hizmet, kiralanmış bulut kapasitesinde günde 24 ila 48 $ civarında çalışan 8x H200 sınıfı bir düğüm ister. Buna, düğümün meşgul veya boş olmasına bakılmaksızın biriken sabit bir maliyet olarak aylık 1.000 $ diyelim.

Liste API fiyatlandırmasında, 1.000 $ kabaca 6,7 milyar girdi tokenı satın alır. Bir düğümün sabit maliyetinin bunu geçmesi için çok büyük, sürekli bir hacim çalıştırmanız gerekir. Çoğu ekip için dürüst cevap, GLM-5.3-Flash'ı kendi kendine barındırmanın maliyetten ziyade kontrol, veri ikametgahı veya lisanslama ile ilgili olduğudur.

İstisna, nicelenmiş katmandır. GGUF nicemlemeleri mevcuttur ve sahip olduğunuz donanım üzerinde nicelenmiş bir model çalıştırmak, marjinal maliyet elektrik olduğu için matematiği tamamen değiştirir. Yerel çalıştırma kılavuzumuz, her donanım katmanının aslında neler yapabileceğini ele alır.

Kodlama planı alternatifi

Kullanımınız API çağrıları yapan bir uygulama yerine Claude Code veya Cline'da çalışan bir geliştirici ise, token başına fiyatlandırma tamamen yanlış bir model olabilir. GLM Kodlama Planı aylık yaklaşık 18 $'dan başlar, GLM-5.3-Flash'ı içerir ve bildirildiğine göre GLM-5.3'ün üç katı kullanılabilir kota sağlar. Z.ai'nin belgeleri ayrıca yoğun olmayan saatlerdeki çağrıların standart puanların yarısını tükettiğinden bahseder.

Günlük kodlama yapan tek bir geliştirici için, sabit bir plan genellikle ölçülü API erişiminden daha ucuz ve her zaman daha tahmin edilebilirdir. Koşum takımı kurulum kılavuzumuz bunu nasıl bağlayacağınızı kapsar ve kodlama planlarının karşılaştırmamız GLM planını alternatiflere karşı koyar.

Çıktı tarafını izleyin

Girdi fiyatlandırması dikkat çeker çünkü sayılar hacim olarak daha büyüktür. Bütçeler aslında çıktı tarafında biter, iki nedenden dolayı.

Çıktı, token başına girdinin maliyetinden üç kattan fazla, 0,15 $'a karşı 0,50 $ maliyetindedir. Ve akıl yürütme tokenları çıktı olarak faturalandırılır. `max` akıl yürütme çabasına ayarlanmış bir model, nihai yanıtta görünenden birkaç kat daha fazla token üretebilir ve bunların hepsi çıktı oranında ücretlendirilir.

Bu kombinasyon, mütevazı bir isteme ve konuşkan bir modele sahip bir uygulamanın, kağıt üzerinde girdi ağırlıklı görünse bile çıktı ağırlıklı hale gelebileceği anlamına gelir. Milyon başına 0,10 $'lık karma rakam, birçok gerçek iş yükünün uymadığı 7:2:1 oranını varsayar.

Çözüm, tahminden ziyade ölçümdür. Her tamamlama yanıtı, o çağrı için token sayılarını içeren bir `usage` nesnesi taşır. Bunu kaydedin, birleştirin ve gerçek oranı bütçelediğiniz varsayıma karşılaştırın. Çıktı, toplam tokenlarınızın yaklaşık %15'inin üzerinde çalışıyorsa, bakılacak ilk yer `reasoning_effort` ve ikincisi istem uzunluğudur.

9 Eylül'den önce ne yapılmalı

İndirim devam ederken yapmaya değer üç şey:

  1. Gerçek token karışımınızı ölçün. Karma oran 7:2:1'i varsayar. Sizinki çıktı ağırlıklıysa, etkili maliyetiniz 0,10 $'lık karma rakamdan ziyade 0,50 $'lık çıktı oranına daha yakındır.
  2. Önbellek isabet oranınızı kontrol edin. Önbelleğe alınmış ve yeni girdi arasında 5 kat fiyat farkı olduğunda, para buradadır.
  3. Maliyet modelinizi liste fiyatından yeniden çalıştırın. 10 Eylül'de her şey iki katına çıkacak. İş yükü yalnızca promosyon oranıyla karşılanabiliyorsa, iki hafta sonra değil, şimdi çözmeniz gereken bir sorununuz var demektir.

Gerçek token kullanımını izlemek, her tamamlamadaki `usage` nesnesi ihtiyacınız olan girdi, çıktı ve önbelleğe alınmış token sayılarını taşıdığı için gerçek yanıtları yakalamak anlamına gelir. Temsili çağrılarınızı Apidog'da kaydedilmiş bir koleksiyon olarak, model kimliği bir ortam değişkeni olarak çalıştırdığınızda, size istek başına bu sayıları verir ve faturaları pazarlamayla karşılaştırmak yerine GLM-5.3'e karşı aynı paketi yeniden çalıştırmanıza olanak tanır.

button

Sıkça Sorulan Sorular

GLM-5.3-Flash ücretsiz mi? Hayır. Lansmandan önce "ox-alpha" olarak anonim olarak çalışırken yaklaşık bir hafta ücretsizdi, ancak bu duyuruyla sona erdi. Mevcut %50 indirim, ücretsiz olmakla aynı şey değildir.

İndirim tam olarak ne zaman sona eriyor? 9 Eylül 2026. Liste fiyatlandırması o tarihten itibaren geçerli olacaktır.

Neden farklı siteler farklı fiyatlar belirtiyor? Bazıları promosyon oranını, bazıları liste fiyatını belirtir ve satıcılar kendi marjlarını belirler. Her zaman gerçekten kullandığınız sağlayıcıyı kontrol edin.

Görüntü girişi ek ücrete tabi mi? Görüntüler bağlam tokenlarını tüketir ve girdi olarak faturalandırılır. Ayrı bir görüntü ek ücreti yoktur, ancak yüksek çözünürlüklü bir görüntü önemli sayıda token tüketir.

Kendi kendine barındırmak daha mı ucuz? Yalnızca çok büyük sürekli hacimlerde veya zaten sahip olduğunuz donanımda nicelenmiş bir yapı kullanarak. Milyon girdi tokenı başına 0,15 $ ile, 8x H200 bir düğüm kiralamak sadece maliyet açısından haklı çıkarmak zordur.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin