GLM-5.3-Flash Preise: Was es vor und nach dem Einführungsrabatt kostet

GLM-5.3-Flash ist zum halben Preis bis zum 9. September 2026. Listenpreise, ausgearbeitete Kostenbeispiele, die Stellschrauben für die zwischengespeicherte Eingabe und den Schlussfolgerungsaufwand.

Medy Evrard

27 August 2026

GLM-5.3-Flash Preise: Was es vor und nach dem Einführungsrabatt kostet

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

GLM-5.3-Flash ist derzeit zum halben Preis erhältlich. Das Angebot endet am **9. September 2026**, und danach verdoppelt sich jede Kostenprognose, die auf den heutigen Preisen basiert.

Dieser Beitrag behandelt, was das Modell jetzt kostet, was es danach kostet, wie es sich im Vergleich zu den Alternativen verhält und wie Sie herausfinden können, ob der Unterschied für Ihre Arbeitslast tatsächlich relevant ist. Alle Zahlen wurden am 27. August 2026 überprüft, und die Preisseiten ändern sich, daher sollten Sie die Angaben bei Ihrem Anbieter bestätigen, bevor Sie ein Budget festlegen.

Die Preisliste

Einführungspreis (bis 9. Sep 2026) Listenpreis (danach)
Eingabe $0.075 / 1 Mio. Token $0.15 / 1 Mio. Token
Ausgabe $0.25 / 1 Mio. Token $0.50 / 1 Mio. Token
Gecachte Eingabe $0.015 / 1 Mio. Token $0.03 / 1 Mio. Token

Artificial Analysis veröffentlicht einen gemischten Wert von **0,10 $ pro Million Token** bei einem Cache-Hit-zu-Eingabe-zu-Ausgabe-Verhältnis von 7:2:1. Dies ist eine nützliche einzelne Zahl für den Preisvergleich, obwohl Ihr eigenes Verhältnis ausschlaggebend für Ihre Rechnung ist.

Was das in der Praxis kostet

Abstrakte Raten pro Million sind schwer zu beurteilen, daher finden Sie hier drei konkrete Workloads zum **Listenpreis**, der für die Planung nach dem 9. September relevant ist.

**Ein Support-Klassifikator.** 100.000 Tickets pro Monat, ungefähr 800 Eingabetoken und 100 Ausgabetoken pro Ticket. Das sind 80 Millionen Eingabe- und 10 Millionen Ausgabetoken: 12,00 $ Eingabe plus 5,00 $ Ausgabe, also **17 $ pro Monat**. Setzen Sie `reasoning_effort` auf `low`, und die Ausgabeseite schrumpft weiter.

**Ein Programmierassistent.** 500 Sitzungen pro Tag, ungefähr 15.000 Eingabetoken (ein Großteil davon wiederholter Dateikontext) und 2.000 Ausgabetoken pro Sitzung. Monatlich sind das 225 Millionen Eingabe- und 30 Millionen Ausgabetoken. Ohne Caching: 33,75 $ plus 15,00 $, also **48,75 $**. Wenn 70 % der Eingaben den Cache treffen: die Eingabe sinkt auf etwa 14,85 $, was es auf **etwa 30 $** bringt.

**Eine Dokumenten-Pipeline mit Bildern.** 10.000 Dokumente pro Monat, ungefähr 40.000 Token pro Dokument, einschließlich Bildinhalt, und 1.500 Ausgabetoken. Das sind 400 Millionen Eingabe- und 15 Millionen Ausgabetoken: 60,00 $ plus 7,50 $, oder **67,50 $ pro Monat** für Aufgaben, die Vision erfordern.

Keine davon sind große Zahlen. Das ist der Sinn dieses Modells.

Gecachte Eingabe ist der größte Hebel

Bei 0,03 $ pro Million gegenüber 0,15 $ für frische Eingaben kosten gecachte Token **ein Fünftel** der ungecachten. Jeder Workload mit einem stabilen Präfix, einem System-Prompt, einem wiederholt abgefragten Dokument, einer Codebasis im Kontext, sollte so strukturiert sein, dass dieses Präfix über alle Aufrufe hinweg identisch bleibt.

Der Fehler, der die Cache-Trefferraten stillschweigend zerstört, ist, etwas Variables nahe am Anfang des Prompts zu platzieren. Ein Zeitstempel, eine Anfrage-ID oder ein Benutzername im System-Prompt invalidiert alles danach. Setzen Sie den stabilen Inhalt zuerst und den variablen Inhalt zuletzt.

Z.ai hat auch die Speicherung gecachter Eingaben für einen begrenzten Zeitraum als kostenlos aufgeführt. Betrachten Sie dies als Werbeaktion und überprüfen Sie die aktuellen Bedingungen, anstatt eine Architektur darauf aufzubauen.

Der zweite Hebel ist der Denkaufwand

`reasoning_effort` ist bei diesem Modell standardmäßig auf **`max`** eingestellt. Das ist die teuerste Einstellung, und es ist das, was Sie erhalten, wenn Sie den Parameter nie ändern.

Die drei Modi sind `low`, `high` und `max`. Denktoken werden als Ausgabe abgerechnet, sodass eine Aufgabe, die keine Überlegung erfordert, Ausgaberaten für Gedanken bezahlt, die niemand liest. Für Klassifizierung, Extraktion, Routing und Formatierung kann `low` die Ausgabeseite erheblich reduzieren.

Die Einrichtung ist in unserem API-Leitfaden beschrieben. Es ist eine Änderung in einer Zeile und das Erste, was Sie versuchen sollten, wenn Ihre Rechnung höher aussieht, als die obige Berechnung vermuten lässt.

Wie es sich vergleicht

Im Vergleich zu seinem eigenen Geschwistermodell, zum Listenpreis:

Modell Durchschnitt pro 1 Mio.
GLM-5.3-Flash $0.10
GLM-5.3 $0.90

Etwa ein neunfacher Unterschied bei einem Drei-Punkte-Unterschied im Artificial Analysis Intelligence Index, 57 gegenüber 60. Unser vollständiger Vergleich behandelt, wann dieser Kompromiss falsch ist, und die kurze Antwort lautet: Wenn Sie lange Antworten an einen wartenden Menschen streamen, da GLM-5.3 fast doppelt so schnell generiert.

Im Vergleich zu GLM-5.2 liegt Z.ai's Behauptung bei etwa **einem Zehntel des Preises**, zusammen mit einer Kosten-pro-Aufgabe-Zahl von 0,045 $. Unsere GLM-5.2 Preisübersicht enthält die ältere Preisliste, falls Sie eine Migration budgetieren.

Im Vergleich zur günstigen multimodalen Stufe anderer Anbieter ist GLM-5.3-Flash preislich wettbewerbsfähig und ungewöhnlich, da es MIT-lizenziert ist, was die Option des Self-Hostings offen hält. Unser Beitrag zur Gemini 3.7 Flash-Preisgestaltung behandelt den engsten Vergleich auf der Google-Seite.

Wiederverkäuferpreise unterscheiden sich, manchmal erheblich

Das Modell ist direkt über Z.ai sowie über OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten und io.net verfügbar.

Diese berechnen nicht alle dasselbe. AIHubMix beispielsweise hat Raten von etwa 0,113 $ für Eingabe und 0,394 $ für Ausgabe aufgeführt, was zwischen den Aktions- und Listenpreisen von Z.ai liegt. Einige Anbieter geben den Einführungsrabatt weiter, andere nicht.

Wenn Sie über einen Aggregator routen, überprüfen Sie dessen aktuellen Tarif, anstatt davon auszugehen, dass er Z.ai widerspiegelt. Die Bequemlichkeit eines einheitlichen Gateways kann manchmal eine Marge beinhalten, und bei diesen absoluten Preisniveaus ist ein prozentualer Aufschlag leicht zu übersehen und leicht zu tolerieren.

Wann Self-Hosting sich zu lohnen beginnt

Die Gewichte sind MIT-lizenziert, daher ist der Eigenbetrieb eine echte Option, und die Rentabilitätsrechnung für das Self-Hosting wurde schwieriger, als der API-Preis so niedrig fiel.

Ein grober Rahmen: Full-Precision-Serving erfordert einen Knoten der H200-Klasse mit 8x, der auf gemieteter Cloud-Kapazität etwa 24 bis 48 $ pro Tag kostet. Nennen wir es 1.000 $ pro Monat als Fixkosten, die anfallen, egal ob der Knoten ausgelastet ist oder nicht.

Zum Listenpreis der API kaufen 1.000 $ etwa 6,7 Milliarden Eingabetoken. Sie müssen ein enormes, konstantes Volumen betreiben, bevor die Fixkosten eines Knotens das übertreffen. Für die meisten Teams ist die ehrliche Antwort, dass es beim Self-Hosting von GLM-5.3-Flash eher um Kontrolle, Datenresidenz oder Lizenzierung geht als um Kosten.

Die Ausnahme ist die quantisierte Stufe. GGUF-Quantisierungen existieren, und der Betrieb eines quantisierten Modells auf bereits vorhandener Hardware ändert die Rechnung komplett, da die Grenzkosten Strom sind. Unser Leitfaden für den lokalen Betrieb behandelt, was jede Hardware-Stufe tatsächlich leisten kann.

Die Alternative: der Coding-Plan

Wenn Ihre Nutzung ein Entwickler ist, der in Claude Code oder Cline arbeitet, anstatt einer Anwendung, die API-Aufrufe tätigt, ist die Preisgestaltung pro Token möglicherweise das falsche Modell. Der GLM Coding Plan beginnt bei etwa 18 $ pro Monat, beinhaltet GLM-5.3-Flash und soll die **dreifache nutzbare Quote** von GLM-5.3 gewähren. Die Dokumentation von Z.ai erwähnt auch, dass Off-Peak-Anrufe die Hälfte der Standardpunkte verbrauchen.

Für einen einzelnen Entwickler, der täglich programmiert, ist ein Pauschalplan in der Regel günstiger und immer besser vorhersehbar als ein getakteter API-Zugang. Unser Leitfaden zur Einrichtung des Harness behandelt die Verkabelung, und unser Vergleich der Coding-Pläne stellt den GLM-Plan den Alternativen gegenüber.

Behalten Sie die Ausgabeseite im Auge

Die Preise für die Eingabe erhalten die Aufmerksamkeit, weil die Mengen größer sind. Die Ausgabe ist der Punkt, an dem Budgets tatsächlich platzen, aus zwei Gründen.

Die Ausgabe kostet **mehr als das Dreifache** der Eingabekosten pro Token, nämlich 0,50 $ gegenüber 0,15 $. Und Denktoken werden als Ausgabe abgerechnet. Ein Modell, das auf maximalen Denkaufwand eingestellt ist, kann um ein Vielfaches mehr Token generieren, als in der endgültigen Antwort erscheinen, alles zum Ausgabepreis.

Diese Kombination bedeutet, dass eine Anwendung mit einem bescheidenen Prompt und einem gesprächigen Modell letztendlich ausgabe-dominiert sein kann, obwohl sie auf dem Papier eingabe-lastig aussieht. Die gemischte Zahl von 0,10 $ pro Million geht von einem 7:2:1-Verhältnis aus, das viele reale Workloads nicht erreichen.

Die Lösung ist Messung statt Schätzung. Jede Vervollständigungsantwort enthält ein `usage`-Objekt mit den Token-Zahlen für diesen Aufruf. Protokollieren Sie es, aggregieren Sie es und vergleichen Sie das tatsächliche Verhältnis mit der Annahme, die Sie budgetiert haben. Wenn die Ausgabe über etwa 15 % Ihrer gesamten Token liegt, ist `reasoning_effort` die erste Stelle, an der Sie suchen sollten, und die Prompt-Länge die zweite.

Was Sie vor dem 9. September tun sollten

Drei Dinge, die Sie tun sollten, solange der Rabatt gültig ist:

  1. **Messen Sie Ihre tatsächliche Token-Mischung.** Die gemischte Rate geht von 7:2:1 aus. Wenn Ihre Ausgabe-lastig ist, liegen Ihre effektiven Kosten näher am Ausgabepreis von 0,50 $ als an der gemischten Zahl von 0,10 $.
  2. **Überprüfen Sie Ihre Cache-Trefferrate.** Bei einem 5-fachen Preisunterschied zwischen gecachter und frischer Eingabe liegt hier das Geld.
  3. **Führen Sie Ihr Kostenmodell zum Listenpreis erneut aus.** Am 10. September verdoppelt sich alles. Wenn der Workload nur mit dem Aktionspreis rentabel ist, haben Sie jetzt ein Problem zu lösen und nicht erst in zwei Wochen.

Das Verfolgen der tatsächlichen Token-Nutzung bedeutet das Erfassen realer Antworten, da das `usage`-Objekt bei jeder Vervollständigung die benötigten Eingabe-, Ausgabe- und gecachten Token-Anzahlen enthält. Das Ausführen Ihrer repräsentativen Aufrufe als gespeicherte Sammlung in Apidog, mit der Modell-ID als Umgebungsvariable, liefert Ihnen diese Zahlen pro Anfrage und ermöglicht es Ihnen, dieselbe Suite erneut gegen GLM-5.3 auszuführen, um die Rechnungen statt des Marketings zu vergleichen.

button

FAQ

**Ist GLM-5.3-Flash kostenlos?** Nein. Es war etwa eine Woche lang kostenlos, als es vor dem Start anonym als „ox-alpha“ lief, aber das endete mit der Ankündigung. Der aktuelle 50%-Rabatt ist nicht dasselbe wie kostenlos.

**Wann genau endet der Rabatt?** Am 9. September 2026. Ab dann gelten die Listenpreise.

**Warum nennen verschiedene Websites unterschiedliche Preise?** Einige nennen den Aktionspreis, andere den Listenpreis, und Wiederverkäufer legen ihre eigenen Margen fest. Überprüfen Sie immer den Anbieter, den Sie tatsächlich anrufen.

**Kosten Bildeingaben extra?** Bilder verbrauchen Kontext-Token und werden als Eingabe abgerechnet. Es gibt keinen separaten Bildzuschlag, aber ein hochauflösendes Bild verbraucht eine beträchtliche Anzahl von Token.

**Ist Self-Hosting günstiger?** Nur bei sehr großem, anhaltendem Volumen oder auf Hardware, die Sie bereits besitzen, unter Verwendung eines quantisierten Builds. Bei 0,15 $ pro Million Eingabe-Token ist die Anmietung eines 8x H200-Knotens allein aus Kostengründen schwer zu rechtfertigen.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen