Was ist GLM-5.3-Flash? Z.ais erstes nativ multimodales Open-Weights-Modell

GLM-5.3-Flash von Z.ai ist ein 320B-A18B MIT-Modell mit nativer Bildeingabe und 1M Kontext. Spezifikationen, Benchmarks und warum Flash billig, nicht schnell bedeutet.

INEZA Felin-Michel

INEZA Felin-Michel

27 August 2026

Was ist GLM-5.3-Flash? Z.ais erstes nativ multimodales Open-Weights-Modell

Apidog fĂĽr Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Z.ai veröffentlichte GLM-5.3-Flash am 26. August 2026. Es ist ein Mixture-of-Experts-Modell mit 320 Milliarden Parametern und 18 Milliarden aktiven Parametern. Es wird unter der MIT-Lizenz vertrieben und ist das erste Modell der GLM-5-Serie, das Bilder nativ verarbeitet, anstatt über einen aufgesetzten Vision-Adapter.

Es ist auch das Modell, das viele Entwickler bereits seit einer Woche nutzten, ohne es zu wissen. Mehr dazu unten.

Wenn Sie hierherkamen und erwarteten, dass „Flash“ „schnell“ bedeutet, wird dieser Beitrag Ihnen widersprechen. Diese Namenskonvention stammt von Google, wo Flash-Modelle tatsächlich die Kategorie mit niedriger Latenz darstellen. Hier bedeutet es etwas anderes, und das richtige Verständnis dieses Unterschieds entscheidet darüber, ob dieses Modell für Ihre Arbeitslast geeignet ist.

Kurz gesagt (TL;DR)

Die Spezifikationen

Eigenschaft Wert
Gesamtparameter 320B
Aktive Parameter 18B
Architektur Mixture of Experts, hybride lineare und sparse Attention
Lizenz MIT
Kontextfenster 1.048.576 Tokens
Eingabemodalitäten Text, Bild, Video, Dateien
Ausgabe Text
Reasoning-Modi low, high, max (Standard max)
API-Modell-ID glm-5.3-flash
Hugging Face zai-org/GLM-5.3-Flash

Eine Zahl, die man vorsichtig behandeln sollte: maximale Ausgabe-Tokens. OpenRouter listet 131.072 und die Hugging Face Modellkarte weist 163.840 aus. Diese Quellen widersprechen sich, und Z.ai hat keine Zahl veröffentlicht, die dies klärt. Wenn Ihre Anwendung von sehr langen Einzelgenerierungen abhängt, überprüfen Sie das Limit bei Ihrem tatsächlichen Anbieter, bevor Sie darauf aufbauen.

Native Multimodalität ist die eigentliche Neuigkeit

Jede frühere Visionsfähigkeit in der GLM-Linie kam als separates Modell oder als separater Pfad. Z.ai lieferte GLM-5V-Turbo und GLM-4.6V als eigenständige Vision-Modelle aus. Wenn Sie wollten, dass ein GLM-Modell einen Screenshot betrachtet, riefen Sie einen anderen Endpunkt auf als den, den Ihr Textverkehr verwendete.

GLM-5.3-Flash fasst das zusammen. Bilder, Videos und Dateien sind Inhaltsblöcke in derselben Chat-Vervollständigungsanforderung, die Ihren Text enthält. Es gibt eine Modell-ID, eine Abrechnungsposition und ein Kontextfenster, das Ihr Bild und Ihre Millionen Tokens des umgebenden Textes gleichzeitig enthält.

Dieser letzte Teil ist der interessante Aspekt. Ein 1M-Token-Kontextfenster, das auch Bilder akzeptiert, bedeutet, dass Sie ein langes Spezifikationsdokument und einen Screenshot des gerenderten Ergebnisses in dieselbe Eingabeaufforderung legen und das Modell bitten können, sie abzugleichen. Z.ai’s eigene Formulierung betont dies: Es beschreibt, wie das Modell „Schnittstellen, Rendering-Ergebnisse und Interaktionsfeedback“ beobachtet, was ein Anwendungsfall für Coding-Agenten ist, nicht für Bildunterschriften.

Wenn Sie breiter mit Vision-Modellen arbeiten, behandelt unser Leitfaden zur API von GLM-5V-Turbo den älteren Ansatz für dedizierte Vision, und GLM-OCR für die Dokumentenverständnis behandelt den Spezialfall.

Die Architektur, kurz gefasst

Z.ai baute GLM-5.3-Flash auf einem neuen Basismodell auf, anstatt GLM-5.2 nachzutrainieren. Zwei Designentscheidungen sind entscheidend fĂĽr sein Verhalten:

Hybride Attention. Das Modell mischt lineare Attention mit Sparse Attention. Lineare Attention verarbeitet lokale Abhängigkeiten kostengünstig; Sparse Attention greift nach den global relevanten Tokens. Das angegebene Ergebnis ist ungefähr dreimal weniger Attention-Rechenleistung als bei GLM-5.3 und ein KV-Cache, der etwa 4,4-mal kleiner ist.

Manifold-Constrained Hyper-Connections. Z.ai’s Begriff für seine Skalierungseffizienz-Arbeit in dieser Version. Es gibt noch nicht genug öffentliche Details, um es unabhängig zu bewerten, daher sollte man es als eine vom Anbieter beschriebene Architekturfunktion und nicht als einen bewiesenen Vorteil betrachten.

Die Reduzierung des KV-Caches ist der Teil mit offensichtlichen praktischen Konsequenzen. Der KV-Cache macht das Inferenz von langen Kontexten speicherintensiv, und seine Verkleinerung um das 4,4-fache ist der Hauptgrund, warum dieses Modell zu einem Zehntel des Preises von GLM-5.2 angeboten werden kann, während ein 1M-Fenster beibehalten wird.

Das Training verwendete einen Korpus, den Z.ai als ungefähr 30 Billionen multimodale Tokens beschreibt.

Ăśber den Namen

Artificial Analysis misst GLM-5.3-Flash mit 48,7 Ausgabe-Tokens pro Sekunde. Zum Vergleich: Das ist am unteren Ende für Open-Weight-Modelle vergleichbarer Größe. GLM-5.3, der größere Bruder, läuft bei derselben Messung mit etwa 86 Tokens pro Sekunde.

Das Flash-Modell ist also ungefähr halb so schnell wie das Nicht-Flash-Modell.

Was es gewinnt, ist die Zeit bis zum ersten Token, mit 1,52 Sekunden gegenüber einem Open-Weight-Median von 2,14 Sekunden. Wenn Ihre Arbeitslast aus vielen kurzen interaktiven Durchgängen besteht, ist diese Reaktionsfähigkeit real. Wenn Ihre Arbeitslast lange Dokumente generiert, warten Sie länger als bei GLM-5.3.

Die Effizienz, die dieses Modell liefert, liegt in Kosten und Speicher, nicht in der Generierungsgeschwindigkeit nach Uhrzeit. Der kleinere KV-Cache und die geringere Attention-Rechenleistung fĂĽhren zu einem gĂĽnstigeren Preis pro Token und einem kleineren Bereitstellungs-Footprint. Sie fĂĽhren nicht zu schnellerem Streaming.

Dies ist wichtig, da die meisten Berichte, die in den Tagen nach der Veröffentlichung erschienen, die Darstellung des Anbieters wiederholten, ohne die Durchsatzrate zu überprüfen, die die ganze Zeit öffentlich war. Wählen Sie dieses Modell, weil es kostengünstig ist und Bilder verarbeitet, nicht weil Sie erwarten, dass es schnell streamt.

Benchmarks

Zahlen, die von Z.ai bei der Veröffentlichung veröffentlicht wurden, daher sollten sie als Anbieterangaben gelesen werden, bis Dritte sie reproduzieren:

Die unabhängige Zahl stammt von Artificial Analysis, die GLM-5.3-Flash auf 57 auf ihrem Intelligence Index v4.1.1 platziert. GLM-5.3 erzielt 60 Punkte. Der Median für Open-Weight-Modelle ähnlicher Größe liegt bei 27, daher ist 57 ein starkes Ergebnis für diese Klasse, auch wenn es unter seinem größeren Geschwistermodell liegt.

Z.ai stellt das Modell als Claude Opus 4.8 im Bereich Coding und Agentenarbeit annähernd dar. Dies ist die Charakterisierung des Anbieters aus eigenen internen Bewertungen, kein gemessenes Ergebnis Dritter, und die Drei-Punkte-Lücke im Intelligence Index zu seinem eigenen GLM-5.3 deutet darauf hin, dass eine gewisse Zurückhaltung angebracht ist.

Wie sich die GLM-Benchmark-Story bei früheren Veröffentlichungen entwickelt hat, erklärt unsere GLM-5.2-Benchmark-Analyse, was jede dieser Evaluierungen tatsächlich misst.

Die Ox Alpha Woche

Am 20. August erschien ein anonymes Modell namens ox-alpha auf Drittanbieter-Inferenzplattformen mit einem 1M-Token-Kontextfenster und einem Preis von null. Es wurde innerhalb weniger Tage zu einem der meistgenutzten Modelle auf diesen Plattformen. Die Community identifizierte es innerhalb von etwa 48 Stunden basierend auf den Ausgabemerkmalen als Zhipu.

Am 26. August bestätigte Z.ai: Ox Alpha war GLM-5.3-Flash, und die kostenlose Woche war ein bewusster Belastungstest.

Z.ai sagt auch, dass in dieser Woche der gesamte Datenverkehr über inländische chinesische Beschleuniger mit einem SGLang-basierten Stack abgewickelt wurde und behauptet, dass die Serving-Kosten pro Token mit denen gängiger NVIDIA-Hardware vergleichbar sind. Dies ist eine Anbieterbehauptung über die eigene Infrastruktur, für die keine unabhängige Überprüfung verfügbar ist, daher sollte sie entsprechend gewichtet werden.

Wir haben dieses Muster bereits beschrieben, als sich Pony Alpha als DeepSeek- oder GLM-Modell entpuppte. Heimliche Starts auf Drittanbieter-Routern werden zu einem standardmäßigen Vorab-Schritt, und die nützliche Erkenntnis ist, dass ein ungewöhnlich fähiges anonymes Modell mit einem verdächtig runden Kontextfenster fast immer das unveröffentlichte Flaggschiff von jemandem ist, das Bewertungsdaten sammelt.

Wie man es tatsächlich benutzt

Gehostete API. Der Z.ai-Endpunkt ist OpenAI-kompatibel. Richten Sie Ihren bestehenden Client auf https://api.z.ai/api/paas/v4/ und setzen Sie das Modell auf glm-5.3-flash. Unser GLM-5.3-Flash API-Leitfaden fĂĽhrt Sie durch die Authentifizierung, die Bild-Eingabe-Payload und den Reasoning-Effort-Parameter.

Drittanbieter. OpenRouter führt es als z-ai/glm-5.3-flash. Es ist auch auf Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten und io.net verfügbar. Die Preise variieren zwischen den Wiederverkäufern, manchmal erheblich.

Coding Agents. Flash ist im GLM Coding Plan enthalten und soll die dreifache nutzbare Quote von GLM-5.3 bieten, was der praktische Grund wäre, warum ein Abonnent wechseln sollte. Die Dokumentation von Z.ai weist auch darauf hin, dass Off-Peak-Anrufe die Hälfte der Standardpunkte verbrauchen.

Selbst gehostet. Die Gewichte sind MIT-lizenziert und auf Hugging Face verfĂĽgbar. vLLM, SGLang, TokenSpeed und KTransformers unterstĂĽtzen es alle, und GGUF-Quantisierungen existieren fĂĽr kleinere Systeme.

Sollten Sie es verwenden?

Verwenden Sie GLM-5.3-Flash, wenn Sie Bild- oder Videoerkennung im selben Aufruf wie Ihren Text benötigen, wenn Ihre Kosten pro Token die zu optimierende Einschränkung sind, oder wenn Sie offene Gewichte möchten, die Sie unter einer liberalen Lizenz selbst hosten können.

Greifen Sie stattdessen zu GLM-5.3, wenn Sie die letzten Punkte an Reasoning-Qualität benötigen oder wenn die Generierungsdurchsatzrate Ihnen wichtiger ist als der Preis. Unser direkter Vergleich der beiden erläutert die Entscheidung im Detail, und was GLM-5.3 ist behandelt das Basismodell eigenständig.

Welches Sie auch immer wählen, der Wechsel ist eine einzeilige Änderung der Modell-ID an einem OpenAI-kompatiblen Endpunkt, was es einfach macht, beide an Ihrer eigenen Arbeitslast zu testen, anstatt sich auf die Benchmark-Tabelle anderer zu verlassen. Das ist der richtige Weg, um es zu entscheiden.

Das ordnungsgemäße Testen eines Modellwechsels bedeutet, echte Anfragen zu senden und echte Antworten zu überprüfen, einschließlich der multimodalen, die in Curl umständlich von Hand zu erstellen sind. Apidog ermöglicht es Ihnen, diese Aufrufe als wiederverwendbare Sammlung mit angehängten Zusicherungen zu speichern, sodass Sie beim Wechsel von GLM-5.3 zu Flash bestätigen können, dass sich die Antwortform nicht geändert hat, anstatt dies erst in der Produktion herauszufinden.

FAQ

Ist GLM-5.3-Flash kostenlos? Nicht mehr. Die kostenlose Ox Alpha Woche endete mit der offiziellen Ankündigung des Modells. Es gibt einen Einführungsrabatt von 50%, der bis zum 9. September 2026 läuft, danach gelten die Listenpreise.

Ist es schneller als GLM-5.3? Nein. Es generiert etwa 49 Tokens pro Sekunde gegenĂĽber 86 bei GLM-5.3. Es beginnt jedoch frĂĽher zu antworten, mit 1,52 Sekunden bis zum ersten Token.

Kann es wirklich eine Million Tokens Kontext verarbeiten? Das konfigurierte Fenster beträgt 1.048.576 Tokens, bestätigt in der Modellkonfiguration und von Artificial Analysis. Beachten Sie, dass OpenRouter einen größeren Wert von 1.310.720 auflistet; betrachten Sie dies als eine anbieterseitige Angabe und nicht als eine Modellspezifikation.

Akzeptiert es Videos? Die Dokumentation von Z.ai listet Text-, Bild-, Video- und Dateieingaben auf. Videounterstützung ist neuer und weniger verbreitet als Bildeingabe, daher validieren Sie sie vor der Abhängigkeit von Ihren eigenen Medien.

Unter welcher Lizenz stehen die Gewichte? MIT, mit den Gewichten veröffentlicht unter zai-org/GLM-5.3-Flash auf Hugging Face.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen