Harga GLM-5.3-Flash Sebelum dan Sesudah Diskon Peluncuran

GLM-5.3-Flash setengah harga hingga 9 September 2026. Daftar tarif, contoh perhitungan biaya, serta pengendali input yang di-cache dan upaya penalaran.

Medy Evrard

27 August 2026

Harga GLM-5.3-Flash Sebelum dan Sesudah Diskon Peluncuran

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

GLM-5.3-Flash saat ini setengah harga. Promo ini berakhir pada 9 September 2026, dan setelah itu, setiap proyeksi biaya yang dibuat berdasarkan tarif hari ini akan berlipat ganda.

Postingan ini membahas biaya model saat ini, biayanya setelah promo, bagaimana perbandingannya dengan alternatif lain, dan cara menentukan apakah perbedaan tersebut benar-benar penting untuk beban kerja Anda. Semua angka diverifikasi pada 27 Agustus 2026, dan halaman harga dapat berubah, jadi pastikan untuk mengonfirmasi dengan penyedia Anda sebelum Anda mengalokasikan anggaran.

Kartu tarif

Harga peluncuran (hingga 9 September 2026) Harga daftar (setelah)
Masukan $0.075 / 1 juta token $0.15 / 1 juta token
Keluaran $0.25 / 1 juta token $0.50 / 1 juta token
Masukan dalam cache $0.015 / 1 juta token $0.03 / 1 juta token

Artificial Analysis menerbitkan angka gabungan sebesar $0.10 per satu juta token menggunakan rasio cache-hit terhadap input terhadap output sebesar 7:2:1. Itu adalah angka tunggal yang berguna untuk perbandingan harga, meskipun rasio Anda sendiri yang menentukan tagihan Anda.

Berapa biayanya dalam praktik

Tarif per juta abstrak sulit dipahami, jadi berikut adalah tiga beban kerja konkret dengan harga daftar, yang merupakan angka penting untuk perencanaan setelah 9 September.

Pengklasifikasi dukungan. 100.000 tiket per bulan, kira-kira 800 token masukan dan 100 token keluaran masing-masing. Itu berarti 80 juta masukan dan 10 juta token keluaran: $12.00 untuk masukan ditambah $5.00 untuk keluaran, jadi $17 per bulan. Atur reasoning_effort ke low dan sisi keluaran akan semakin berkurang.

Asisten pengkodean. 500 sesi per hari, kira-kira 15.000 token masukan (banyak di antaranya konteks file yang diulang) dan 2.000 token keluaran per sesi. Setiap bulan berarti 225 juta masukan dan 30 juta keluaran. Tanpa caching: $33.75 ditambah $15.00, jadi $48.75. Dengan 70% masukan menggunakan cache: masukan turun menjadi sekitar $14.85, sehingga totalnya menjadi sekitar $30.

Pipeline dokumen dengan gambar. 10.000 dokumen per bulan, kira-kira 40.000 token masing-masing termasuk konten gambar, dan 1.500 token keluaran. Itu berarti 400 juta masukan dan 15 juta keluaran: $60.00 ditambah $7.50, atau $67.50 per bulan untuk pekerjaan yang memerlukan visi.

Tidak ada satupun angka-angka ini yang besar. Itulah tujuan dari model ini.

Masukan dalam cache adalah pengungkit terbesar

Dengan harga $0.03 per juta berbanding $0.15 untuk masukan baru, token dalam cache berharga seperlima dari token yang tidak di-cache. Beban kerja apa pun dengan awalan yang stabil, prompt sistem, dokumen yang ditanyakan berulang kali, basis kode dalam konteks, harus distrukturkan sehingga awalan tersebut tetap identik di seluruh panggilan.

Kesalahan yang diam-diam merusak tingkat cache hit adalah menempatkan variabel apa pun di dekat bagian depan prompt. Stempel waktu, ID permintaan, atau nama pengguna dalam prompt sistem akan membatalkan semua yang ada setelahnya. Letakkan konten yang stabil terlebih dahulu dan konten yang bervariasi terakhir.

Z.ai juga telah mencantumkan penyimpanan masukan dalam cache sebagai gratis untuk periode terbatas. Perlakukan itu sebagai promosi dan verifikasi syarat saat ini daripada membangun arsitektur yang bergantung padanya.

Pengungkit kedua adalah upaya penalaran

reasoning_effort secara default diatur ke max pada model ini. Itu adalah pengaturan yang paling mahal, dan itulah yang Anda dapatkan jika Anda tidak pernah menyentuh parameter tersebut.

Ketiga mode tersebut adalah low, high, dan max. Token penalaran ditagih sebagai keluaran, jadi tugas yang tidak memerlukan pertimbangan akan membayar tarif keluaran untuk pemikiran yang tidak ada yang membaca. Untuk klasifikasi, ekstraksi, perutean, dan pemformatan, low dapat mengurangi sisi keluaran secara substansial.

Pengaturannya dibahas dalam panduan API kami. Ini adalah perubahan satu baris dan merupakan hal pertama yang harus dicoba jika tagihan Anda terlihat lebih tinggi dari yang disarankan oleh perhitungan di atas.

Perbandingan

Terhadap saudaranya sendiri, dengan harga daftar:

Model Gabungan per 1 juta
GLM-5.3-Flash $0.10
GLM-5.3 $0.90

Kira-kira perbedaan sembilan kali lipat untuk selisih tiga poin pada Indeks Intelijen Analisis Artifisial, 57 berbanding 60. Perbandingan lengkap kami membahas kapan pertukaran itu salah, dan jawaban singkatnya adalah: ketika Anda melakukan streaming respons panjang ke manusia yang menunggu, karena GLM-5.3 menghasilkan hampir dua kali lebih cepat.

Terhadap GLM-5.2, klaim Z.ai kira-kira sepersepuluh harga, di samping angka biaya per tugas sebesar $0.045. Rincian harga GLM-5.2 kami memiliki kartu tarif yang lebih lama jika Anda menganggarkan migrasi.

Terhadap tingkat multimodal murah dari vendor lain, GLM-5.3-Flash kompetitif dalam harga dan tidak biasa karena berlisensi MIT, yang berarti opsi self-hosting tetap terbuka. Postingan harga Gemini 3.7 Flash kami membahas perbandingan terdekat di sisi Google.

Harga reseller berbeda, terkadang jauh

Model ini tersedia melalui Z.ai secara langsung ditambah OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten, dan io.net.

Harga-harga ini tidak semuanya sama. AIHubMix, misalnya, memiliki tarif terdaftar sekitar $0.113 untuk masukan dan $0.394 untuk keluaran, yang berada di antara harga promosi dan daftar Z.ai. Beberapa penyedia meneruskan diskon peluncuran dan beberapa tidak.

Jika Anda merutekan melalui agregator, periksa tarifnya saat ini daripada berasumsi itu mencerminkan Z.ai. Kenyamanan gateway terpadu terkadang membawa margin, dan pada tingkat harga absolut ini, persentase mark-up mudah diabaikan dan mudah ditoleransi.

Kapan self-hosting mulai unggul

Bobotnya berlisensi MIT, jadi menjalankannya sendiri adalah pilihan yang nyata, dan perhitungan titik impas menjadi lebih sulit untuk self-hosting ketika harga API turun serendah ini.

Sebagai gambaran kasar: penyajian presisi penuh memerlukan node kelas H200 8x, yang beroperasi di kisaran $24 hingga $48 per hari pada kapasitas cloud sewaan. Sebut saja $1.000 per bulan sebagai biaya tetap yang bertambah baik node sibuk maupun menganggur.

Dengan harga daftar API, $1.000 dapat membeli sekitar 6,7 miliar token masukan. Anda perlu menjalankan volume yang sangat besar dan berkelanjutan sebelum biaya tetap sebuah node mengalahkan angka tersebut. Bagi sebagian besar tim, jawaban jujurnya adalah bahwa self-hosting GLM-5.3-Flash adalah tentang kontrol, residensi data, atau lisensi daripada biaya.

Pengecualiannya adalah tingkat terkuantisasi. Kuantisasi GGUF ada, dan menjalankan model terkuantisasi pada perangkat keras yang sudah Anda miliki sepenuhnya mengubah perhitungannya karena biaya marjinalnya adalah listrik. Panduan menjalankan lokal kami mencakup apa yang sebenarnya dapat dilakukan oleh setiap tingkat perangkat keras.

Alternatif paket pengkodean

Jika penggunaan Anda adalah seorang pengembang yang bekerja di Claude Code atau Cline daripada aplikasi yang melakukan panggilan API, harga per token mungkin merupakan model yang salah sama sekali. Paket Pengkodean GLM dimulai sekitar $18 per bulan, termasuk GLM-5.3-Flash, dan dilaporkan memberikan tiga kali lipat kuota yang dapat digunakan dari GLM-5.3. Dokumentasi Z.ai juga menyebutkan panggilan di luar jam sibuk mengonsumsi setengah poin standar.

Untuk seorang pengembang tunggal yang melakukan coding setiap hari, paket flat biasanya lebih murah dan selalu lebih dapat diprediksi daripada akses API yang diukur. Panduan pengaturan harness kami mencakup cara menghubungkannya, dan perbandingan paket coding kami menempatkan paket GLM melawan alternatif.

Perhatikan sisi keluaran

Harga masukan mendapat perhatian karena angka-angka yang lebih besar dalam volume. Keluaran adalah tempat anggaran benar-benar jebol, karena dua alasan.

Keluaran berharga lebih dari tiga kali lipat biaya masukan per token, yaitu $0.50 berbanding $0.15. Dan token penalaran ditagih sebagai keluaran. Model yang diatur ke upaya penalaran max dapat menghasilkan beberapa kali lebih banyak token daripada yang muncul di jawaban akhir, semuanya dibebankan pada tarif keluaran.

Kombinasi itu berarti aplikasi dengan prompt sederhana dan model yang banyak bicara dapat berakhir didominasi oleh keluaran meskipun di atas kertas terlihat berat pada masukan. Angka gabungan $0.10 per juta mengasumsikan rasio 7:2:1 yang tidak sesuai dengan banyak beban kerja nyata.

Solusinya adalah pengukuran daripada estimasi. Setiap respons penyelesaian membawa objek usage dengan jumlah token untuk panggilan tersebut. Catat, agregasikan, dan bandingkan rasio sebenarnya dengan asumsi yang Anda anggarkan. Jika keluaran berjalan di atas sekitar 15% dari total token Anda, reasoning_effort adalah tempat pertama untuk mencari dan panjang prompt adalah yang kedua.

Apa yang harus dilakukan sebelum 9 September

  1. Ukur campuran token aktual Anda. Tarif gabungan mengasumsikan 7:2:1. Jika beban Anda didominasi keluaran, biaya efektif Anda lebih dekat ke tarif keluaran $0.50 daripada angka gabungan $0.10.
  2. Periksa tingkat cache hit Anda. Dengan perbedaan harga 5x antara input yang di-cache dan yang baru, di sinilah uang berada.
  3. Jalankan ulang model biaya Anda dengan harga daftar. Semuanya berlipat ganda pada 10 September. Jika beban kerja hanya menguntungkan pada tarif promosi, Anda memiliki masalah yang harus diselesaikan sekarang daripada dalam dua minggu.

Melacak penggunaan token aktual berarti menangkap respons nyata, karena objek usage pada setiap penyelesaian membawa jumlah input, output, dan token yang di-cache yang Anda butuhkan. Menjalankan panggilan representatif Anda sebagai koleksi tersimpan di Apidog, dengan ID model sebagai variabel lingkungan, memberi Anda angka-angka tersebut per permintaan dan memungkinkan Anda menjalankan kembali rangkaian yang sama terhadap GLM-5.3 untuk membandingkan tagihan daripada pemasaran.

button

FAQ

Apakah GLM-5.3-Flash gratis? Tidak. Itu gratis selama sekitar seminggu saat berjalan secara anonim sebagai “ox-alpha” sebelum peluncuran, tetapi itu berakhir pada pengumuman. Diskon 50% saat ini tidak sama dengan gratis.

Kapan tepatnya diskon berakhir? 9 September 2026. Harga daftar berlaku mulai saat itu.

Mengapa situs yang berbeda mengutip harga yang berbeda? Beberapa mengutip tarif promosi, beberapa mengutip harga daftar, dan reseller menetapkan margin mereka sendiri. Selalu periksa penyedia yang sebenarnya Anda panggil.

Apakah masukan gambar dikenakan biaya tambahan? Gambar mengonsumsi token konteks dan ditagih sebagai masukan. Tidak ada biaya tambahan gambar terpisah, tetapi gambar beresolusi tinggi mengonsumsi sejumlah token yang signifikan.

Apakah lebih murah untuk self-host? Hanya pada volume berkelanjutan yang sangat besar, atau pada perangkat keras yang sudah Anda miliki menggunakan build terkuantisasi. Dengan $0.15 per juta token masukan, menyewa node H200 8x sulit dibenarkan hanya berdasarkan biaya.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.