Was ist GLM-5.3? Zhipus Open-Weight Programmiermodell erklärt

Was ist GLM-5.3? Zhipus Codierungsmodell erklärt: Benchmark-Tabelle, die Behauptung 'nähert sich Claude Fable 5' aufgeschlüsselt, der Open-Weights-Plan vom 28. August und ein cURL-Test.

Ashley Innocent

Ashley Innocent

16 August 2026

Was ist GLM-5.3? Zhipus Open-Weight Programmiermodell erklärt

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

GLM-5.3 ist ein großes Sprachmodell, das am 14. August 2026 von Zhipu AI veröffentlicht wurde, dem chinesischen Labor, das international als Z.ai tätig ist. Es handelt sich um ein Post-Training-Upgrade des Basismodells GLM-5, das gezielt auf Kodierungs- und Agentenaufgaben ausgerichtet ist, und Zhipu plant, seine offenen Gewichte etwa zwei Wochen nach dem Start auf Hugging Face zu veröffentlichen. Bei Zhipus internen Evaluierungen verbesserte sich die Kodierungsfähigkeit um 50 % gegenüber GLM-5.2.

Diese Kombination ist der Grund, warum die Veröffentlichung von Bedeutung ist: Ein Labor, das Seeking Alpha als „chinesischen OpenAI-Herausforderer“ bezeichnet, liefert ein Kodierungsmodell, von dem es sagt, dass es „nahe an Claude Fable 5 heranreicht“, und gibt dann die Gewichte preis. Es erscheint einen Tag nach der neuesten Veröffentlichung von DeepSeek, die wir in unserem DeepSeek V4 Pro API-Leitfaden behandelt haben, sodass das Rennen um offene Modelle in China nun in wöchentlichem Rhythmus abläuft.

Dieser Artikel erklärt, was GLM-5.3 ist, was die Benchmarks aussagen (und welche von Zhipus eigenen Tests stammen), wie der Plan für offene Gewichte funktioniert und wie Sie Ihre erste Anfrage senden. Sie können diese Anfrage in Apidog testen, ohne Code schreiben zu müssen.

button

TL;DR

Was GLM-5.3 ist

GLM-5.3 ist die dritte Punktversion in der GLM-5-Familie und die am stärksten fokussierte. Zhipu hat die Grundlage nicht neu trainiert. Die offiziellen Dokumente beschreiben das GLM-5-Basismodell als ein Mixture-of-Experts-Modell mit 744 Mrd. Gesamtparametern, etwa 40 Mrd. aktivierten Parametern pro Forward Pass und einem Kontextfenster von 200K Token; diese Spezifikationen bleiben unverändert. Was sich geändert hat, ist alles darüber hinaus: Die Verbesserungen stammen vollständig aus skaliertem Post-Training, das auf dieselben Basisgewichte angewendet wurde.

Dieses Detail ist wichtiger, als es klingt. Wenn ein Labor ein Modell so stark verbessert, ohne die Basis zu berühren, ist die Post-Training-Pipeline selbst das Produkt. Zhipu beansprucht eine 50%ige Verbesserung der Kodierungsfähigkeit gegenüber GLM-5.2, und die Zielarbeitslasten sind spezifisch: Terminal-gesteuerte Agentenaufgaben, langfristige Softwareentwicklung und Sicherheitsanalyse. Dies ist kein allgemeines Chat-Upgrade.

Die praktische Zusammenfassung: GLM-5.3 ist das Modell, das Sie evaluieren sollten, wenn Sie ein starkes autonomes Kodierungsverhalten zu Open-Model-Konditionen wünschen, mit der Option, es auf Ihrer eigenen Hardware auszuführen, sobald die Gewichte freigegeben werden.

GLM-5.3 Benchmarks: die Zahlen und ihre Quellen

Die Berichterstattung zum Start von BigGo Finance und Pandaily meldete die folgenden Ergebnisse. Nehmen Sie die Spalte „Quelle“ ernst: Einige Zahlen stammen von öffentlichen Ranglisten, andere von Zhipus eigenen Evaluierungsläufen, und das sind nicht dieselben Arten von Nachweisen.

Benchmark GLM-5.3 Ergebnis Kontext Quelle
Terminal-Bench 3.0 28.3 (von 4.6) 6,2-facher Sprung; Erster unter Open-Source-Modellen Startbericht
Agents’ Last Exam Erster unter Open-Source-Modellen Ergebnis zum Start nicht bekannt gegeben Startbericht
CyberGym 84.5% Leicht über Claude Mythos 5 und GPT-5.6 Sol Startbericht
ExploitBench 54.4% Hinter Frontier-Modellen Startbericht
SWE-Marathon Ungefähr 2x GLM-5.2 Langfristige Softwareentwicklung Zhipu intern
Kodierungsfähigkeit (aggregiert) +50% vs. GLM-5.2 Zhipus Hauptaussage Zhipu intern

Zwei Lesarten sind fair. Die großzügige: ein Sprung von 4,6 auf 28,3 bei Terminal-Bench 3.0 ist kein Rauschen. Terminal-Benchmarks messen, ob ein Modell Shell-Befehle verketten, Ausgaben lesen und sich über viele Schritte hinweg von Fehlern erholen kann, und GLM-5.2 war dort schwach. Der Aufstieg von fast ganz unten zum ersten Platz unter den offenen Modellen in einer einzigen Punktversion ändert, welches Modell Sie in Agenten-Pipelines verwenden.

Die skeptische: Die beiden am häufigsten zitierten Behauptungen, der 50%ige Kodierungszuwachs und der verdoppelte SWE-Marathon-Score, sind interne Zhipu-Zahlen ohne öffentliche Reproduzierbarkeit. Das macht sie nicht falsch, aber sie bleiben unbestätigt, bis die Gewichte veröffentlicht werden und unabhängige Evaluatoren die Suiten erneut ausführen.

Was „Annäherung an Claude Fable 5“ in der Praxis bedeutet

Zhipus eigene Formulierung besagt, dass die Kodierungs- und Agentenfähigkeiten von GLM-5.3 „nahe an Claude Fable 5 heranreichen“. Dieser Ausdruck ist sorgfältig gewählt.

Wo die Behauptung zutrifft: Auf der Agenten- und Terminalseite liegen die gemeldeten Zahlen nahe an der Leistung von Spitzenmodellen. Der erste Platz unter Open-Source-Modellen bei Terminal-Bench 3.0 und Agents’ Last Exam bedeutet, dass GLM-5.3 jeden offenen Konkurrenten bei den Aufgaben überholt hat, die für autonome Kodierungsagenten wichtig sind. Das CyberGym-Ergebnis von 84,5 % übertrifft sogar Claude Mythos 5 und GPT-5.6 Sol leicht, obwohl der Unterschied klein genug ist, dass er durch Schwankungen zwischen den Läufen erklärt werden könnte.

Wo es nicht zutrifft: ExploitBench liegt mit 54,4 % immer noch deutlich hinter den Spitzenmodellen. Die Exploit-Entwicklung erfordert tiefgehendes, mehrstufiges Denken unter Mehrdeutigkeit, und die dortige Lücke deutet darauf hin, dass die Spitzenmodelle bei den schwierigsten, denkintensiven Aufgaben immer noch einen Vorteil haben. „Annäherung“ ist das ehrliche Wort. Es ist nicht „Übereinstimmung“, und Zhipu hat, zu seiner Ehre, auch nicht „Übereinstimmung“ gesagt.

Die praktische Übersetzung für Ihren Stack: GLM-5.3 ist es wert, direkt für Terminal-Agenten, CI-Automatisierung und Kodierungsaufgaben im Repository-Maßstab verglichen zu werden. Für die schwierigsten Denkprobleme behalten geschlossene Spitzenmodelle wahrscheinlich vorerst die Führung. Wenn Sie ein Gefühl dafür bekommen möchten, wie sich Spitzenmodelle genau nach diesen Achsen unterscheiden, beschreibt unser Vergleich von Grok 4.6 vs. GPT-5.6 vs. Claude Fable 5 dieselben Benchmark-Kategorien mit ausgearbeiteten Beispielen.

Der Open-Weights-Plan: ~28. August auf Hugging Face

Das Veröffentlichungsdetail mit der längsten Haltbarkeit ist kein Benchmark. Zhipu hat zugesagt, die offenen Gewichte von GLM-5.3 etwa zwei Wochen nach dem Start zu veröffentlichen, was die Veröffentlichung um den 28. August 2026 auf der zai-org Hugging Face Organisation ansiedelt, wo die früheren offenen Veröffentlichungen des Unternehmens zu finden sind.

Die zweiwöchige Lücke ist beabsichtigt. Zhipu sagt, es habe für diese Veröffentlichung sein bisher umfangreichstes Risikobewertungssystem aufgebaut, und die Sicherheits-Benchmarks erklären warum: Ein Modell, das bei CyberGym 84,5 % erreicht, verfügt über erhebliche offensive Sicherheitsfähigkeiten, und die öffentliche Freigabe dieser Gewichte ist eine andere Entscheidung als deren Bereitstellung hinter einer überwachten API. Das Überprüfungsfenster ist der Preis der offenen Veröffentlichung.

Was die Veröffentlichung für Sie bedeutet, hängt von Ihrer Hardware ab. Die Inferenz mit voller Präzision auf einem 744B-Parameter-MoE ist selbst mit nur ~40B aktiven Parametern pro Token Server-Klasse, daher werden die meisten Teams auf quantisierte Community-Varianten warten. Wenn Sie es lokal ausführen möchten, behandelt unser Leitfaden zum Self-Hosting von GLM-5.3 die Dimensionierung, Serving-Stacks und den Aufbau einer Baseline gegenüber der gehosteten API, bevor die Gewichte eintreffen.

Wie GLM-5.3 in die Open-Model-Landschaft passt

Der offensichtliche Vergleich ist DeepSeek. Beide Labore sind chinesisch, beide veröffentlichen offene Gewichte, beide preisen aggressiv und beide wurden innerhalb von 24 Stunden voneinander ausgeliefert. Der Unterschied liegt im Fokus: DeepSeeks V4 Pro-Linie ist ein generalistisches Flaggschiff, während GLM-5.3 eine spezialisierte Wette darauf ist, dass Kodierungsagenten die Arbeitslast sind, die es zu gewinnen gilt. Wenn Ihr Traffic hauptsächlich aus agentischer Kodierung besteht, ist diese Spezialisierung das Argument, GLM-5.3 zuerst zu testen.

Die Wirtschaftlichkeit prägt den Rest des Bildes. DeepSeeks jüngste Preiserhöhung, die wir in unserem Leitfaden zur API-Kostenoptimierung von DeepSeek analysiert haben, zeigte, wie schnell sich die API-Preise für offene Modelle ändern können, und drängte mehr Teams zum Self-Hosting als Absicherung. Ein Open-Weight-GLM-5.3, das Terminal-Bench anführt, bietet diesen Teams eine weitere glaubwürdige Option. Zhipu hatte zum Start keine 5.3-spezifischen API-Preise veröffentlicht; als Referenz listete die offizielle Preisgestaltungsseite GLM-5.2 zum Zeitpunkt dieser Erstellung mit 1,4 $ pro 1 Mio. Eingabe-Tokens und 4,4 $ pro 1 Mio. Ausgabe-Tokens auf, erwarten Sie also, dass die 5.3-Zahl in diesem Bereich liegen wird, und überprüfen Sie die Seite, bevor Sie budgetieren.

Der Kontext des offenen Ökosystems ist ebenfalls wichtig. Sobald quantisierte Varianten existieren, gehört GLM-5.3 zu den Modellen, die Sie ohne jegliche API-Abhängigkeit ausführen können. Unser Überblick über die besten lokalen LLMs im Jahr 2026 behandelt, wo die aktuellen offenen Marktführer stehen; ein Terminal-Bench-führender Neuzugang wird diese Liste neu ordnen.

GLM Coding Plan Quoten wurden zurückgesetzt

Ein Detail am Starttag, das bestehende Benutzer direkt betrifft: Zhipu hat die GLM Coding Plan Quoten für alle Benutzer am 14. August zurückgesetzt. Wenn Sie den Coding Plan über Z.ai abonnieren, begann Ihr Kontingent am Veröffentlichungstag von Neuem, eine offene Einladung, dieses Kontingent für das Testen von 5.3 zu nutzen.

Der Coding Plan ist Zhipus Pauschalangebot für Kodierungswerkzeuge, das sich vom Pay-per-Token-API-Zugriff unterscheidet, und das Zurücksetzen gilt nur für den Plan, nicht für die API-Abrechnung. Benutzer auf dem chinesischen Festland erhalten das gleiche Ökosystem über open.bigmodel.cn, mit eigenen Plänen und Abrechnungen.

Die API in fünf Minuten testen

Die API von Z.ai ist OpenAI-kompatibel, daher wird das Anfragemuster vertraut aussehen, wenn Sie bereits eine große LLM-API aufgerufen haben. Der internationale Endpunkt ist https://api.z.ai/api/paas/v4/chat/completions; das chinesische Festland verwendet https://open.bigmodel.cn/api/paas/v4/chat/completions. Die Authentifizierung erfolgt über einen Bearer-Token. Eine Einschränkung: Beim Start listeten die offiziellen Dokumente immer noch glm-5 als dokumentierte Modell-ID auf, sodass die untenstehende glm-5.3-ID der GLM-5-Familienkonvention folgt. Bestätigen Sie die genaue Zeichenfolge auf der Modell-Dokumentationsseite, bevor Sie etwas ausliefern.

export GLM_API_KEY="your-key-from-z.ai"

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      {
        "role": "user",
        "content": "Write a bash script that finds the five largest files in a git repo, excluding the .git directory."
      }
    ],
    "temperature": 0.6,
    "max_tokens": 1024
  }'

Die Antwort folgt dem OpenAI-Schema: ein choices-Array mit dem Nachrichteninhalts sowie ein usage-Block mit Token-Zählungen.

Eine schnellere Schleife als das Bearbeiten von cURL-Strings: Importieren Sie die Anfrage in Apidog, speichern Sie GLM_API_KEY als Umgebungsvariable und erstellen Sie zwei Umgebungen, eine für den Z.ai-Endpunkt und eine für bigmodel.cn. Das Wechseln von Regionen oder Modell-IDs wird zu einem Dropdown-Menü anstelle einer Bearbeitung, und gespeicherte Antworten werden zu einer Regressions-Baseline für den Tag, an dem die offenen Gewichte veröffentlicht werden.

Für die vollständige Anleitung, einschließlich Python- und Node.js-Clients, Streaming und Fehlerbehandlung, siehe den vollständigen GLM-5.3 API-Schnellstart.

FAQ

Ist GLM-5.3 Open Source?

Noch nicht, aber es wird Open Weight sein. Zhipu hat zugesagt, die Gewichte um den 28. August 2026 auf Hugging Face zu veröffentlichen, etwa zwei Wochen nach dem API-Start, nach einer Risikobewertung, die das Unternehmen als die bisher umfangreichste beschreibt. Bis dahin ist der einzige Zugriff über die gehostete API möglich.

Wie unterscheidet sich GLM-5.3 von GLM-5.2?

Das Basismodell ist identisch. Jede Verbesserung stammt aus skaliertem Post-Training: Zhipu meldet eine 50%ige Verbesserung der Kodierungsfähigkeit bei internen Evaluierungen, einen Sprung bei Terminal-Bench 3.0 von 4,6 auf 28,3 und einen etwa verdoppelten SWE-Marathon-Score. Kontextfenster, Parameteranzahl und Architektur sind gegenüber der GLM-5-Familienbaseline unverändert.

Was kostet GLM-5.3?

Zhipu hatte zum Start keine 5.3-spezifischen API-Preise veröffentlicht. Die offizielle Preisgestaltungsseite listete GLM-5.2 zum Zeitpunkt dieser Erstellung mit 1,4 $ pro 1 Mio. Eingabe-Tokens und 4,4 $ pro 1 Mio. Ausgabe-Tokens auf, was der beste verfügbare Anhaltspunkt ist. Überprüfen Sie die aktuelle Preisgestaltungsseite, bevor Sie ein Budget festlegen, und wenn die Kosten Ihre Haupteinschränkung sind, behandelt unser Leitfaden zur API-Kostenoptimierung nach der DeepSeek-Preiserhöhung Taktiken, die für jede Pro-Token-API gelten.

Kann ich GLM-5.3 auf meiner eigenen Hardware ausführen?

Nach der Veröffentlichung der Gewichte, ja, mit Einschränkungen. Die GLM-5-Familie ist ein 744 Mrd. Parameter großes Mixture-of-Experts-Modell mit etwa 40 Mrd. aktiven Parametern pro Forward Pass, daher benötigt die Inferenz mit voller Präzision Server-Hardware mit mehreren GPUs. Quantisierte Community-Builds werden die Hürde senken; siehe den Leitfaden zur Vorbereitung des Self-Hostings für eine realistische Dimensionierung.

Ist GLM-5.3 besser als Claude oder GPT für die Kodierung?

Bei den gemeldeten Agenten- und Terminal-Benchmarks ist es wettbewerbsfähig, belegt den ersten Platz unter den offenen Modellen bei Terminal-Bench 3.0 und übertrifft Claude Mythos 5 und GPT-5.6 Sol bei CyberGym. Bei ExploitBench liegt es mit 54,4 % hinter den Spitzenmodellen. Die ehrliche Antwort ist arbeitslastabhängig: Führen Sie Ihr eigenes Evaluierungsset gegen beide aus, bevor Sie den Produktions-Traffic umstellen, genauso wie Sie jede API testen würden, bevor Sie sie übernehmen.

Wo GLM-5.3 in Ihren Stack passt

GLM-5.3 ist eine spezialisierte Veröffentlichung mit einem klaren Angebot: Leistung von Kodierungsagenten nahe an der Spitze, offene Gewichte in zwei Wochen und eine OpenAI-kompatible API, auf die Sie heute bestehenden Code richten können. Die Benchmark-Ergebnisse sind bei Terminal- und Agentenaufgaben stark, ehrlich in Bezug auf die ExploitBench-Lücke und teilweise unbestätigt, bis unabhängige Läufe nach dem 28. August vorliegen. Das ist genug Signal, um eine Evaluierung zu rechtfertigen, aber noch nicht genug, um eine Migration zu rechtfertigen.

Der kostengünstige Einstieg: Senden Sie die obige cURL-Anfrage, speichern Sie die Antwort und erstellen Sie eine kleine Prompt-Suite für Ihre realen Arbeitslasten. Laden Sie Apidog herunter, um diese Suite zu organisieren, halten Sie die Z.ai- und bigmodel.cn-Endpunkte als umschaltbare Umgebungen bereit und verwandeln Sie die heutigen explorativen Aufrufe in die Regressions-Baseline, die Sie benötigen werden, wenn die offenen Gewichte eintreffen und Sie Ihre eigene Bereitstellung mit der gehosteten API vergleichen.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen