Zhipu AI, das chinesische Labor, das international als Z.ai firmiert, veröffentlichte GLM-5.3 am 14. August 2026, und die Zahlen zur Codierungsleistung sprechen für sich. Interne Bewertungen zeigen eine 50-prozentige Verbesserung der Codierungsfähigkeit gegenüber GLM-5.2, der Terminal-Bench 3.0-Score sprang von 4,6 auf 28,3, und Zhipu beschreibt die Codierungs- und Agentenfähigkeiten des Modells als „nahezu Claude Fable 5“, so der Veröffentlichungsbericht von BigGo. Offene Gewichte folgen in etwa zwei Wochen. Für die vollständige Aufschlüsselung der Funktionen und die Benchmark-Tabelle lesen Sie, was GLM-5.3 ist; dieser Artikel ist der praktische API-Schnellstart.
Folgendes werden Sie tun: einen API-Schlüssel besorgen, einen ersten Aufruf in cURL tätigen, diesen über das OpenAI SDK nach Python und Node.js portieren, Token streamen, die wichtigen Parameter einstellen und die gesamte Schleife in Apidog integrieren, damit Sie die Anforderungsform festlegen können, bevor Sie Anwendungscode schreiben. Die gute Nachricht vorab: Die API von Z.ai ist OpenAI-kompatibel. Wenn Sie zuvor bereits einen OpenAI-ähnlichen Endpunkt aufgerufen haben, kennen Sie das meiste davon bereits.
Ein Hinweis vor dem Code. GLM-5.3 wurde heute veröffentlicht, und Zhipus Dokumentation ändert sich an Einführungstagen schnell. Alles, was ich bei der Überprüfung direkt aus den offiziellen Dokumenten entnommen habe, wird als verifiziert dargestellt; alles, was die Dokumente noch nicht erfasst hatten, wird als GLM-5-Familienkonvention gekennzeichnet, mit einem Link, damit Sie den aktuellen Stand selbst bestätigen können.
Kurz gesagt
- GLM-5.3 am 14. August 2026 veröffentlicht. Interne Bewertungen von Zhipu melden eine 50-prozentige Verbesserung der Codierungsleistung gegenüber GLM-5.2 und einen Terminal-Bench 3.0-Sprung von 4,6 auf 28,3. Es rangiert an erster Stelle unter den Open-Source-Modellen auf Terminal-Bench 3.0 und Agents’ Last Exam.
- Die API ist OpenAI-kompatibel. Internationaler Endpunkt:
POST https://api.z.ai/api/paas/v4/chat/completionsmit HeaderAuthorization: Bearer $GLM_API_KEY. Festlandchina:https://open.bigmodel.cn/api/paas/v4/chat/completions. - Zum Zeitpunkt des Verfassens listete die GLM-5-Dokumentationsseite
glm-5als Modell-ID auf. Zhipus Preisgestaltungsseite listetglm-5.2undglm-5.1als separate Modelle, daher ist zu erwarten, dassglm-5.3der gleichen Konvention mit Punkten folgt. Bestätigen Sie dies vor dem Hardcodieren. - Zhipu hatte zum Start keine 5.3-spezifischen API-Preise veröffentlicht. Zum Vergleich: Die offizielle Preisgestaltungsseite listete GLM-5.2 mit 1,40 $ pro 1 Mio. Eingabe-Token und 4,40 $ pro 1 Mio. Ausgabe-Token, und GLM-5 mit 1,00 $ und 3,20 $.
- Offene Gewichte erscheinen auf Hugging Face um den 28. August 2026. Die Kontingente des GLM Coding Plan wurden für alle Benutzer am 14. August zurückgesetzt.
- Zuerst in Apidog testen: eine Umgebung pro regionalem Endpunkt, die Modell-ID hinter einer Variable und gespeicherte Antworten als Fixtures, damit die Prompt-Iteration keine Token berechnet.
Warum GLM-5.3 wichtig ist
Das Basismodell hat sich nicht geändert. Jeder Fortschritt in dieser Version resultiert aus skaliertem Post-Training auf GLM-5, was die Größe der Sprünge ungewöhnlich macht. Terminal-Bench 3.0 stieg von 4,6 auf 28,3, eine 6,2-fache Bewegung, die GLM von irrelevant auf den ersten Platz unter den Open-Source-Modellen in diesem Benchmark und bei Agents’ Last Exam brachte. SWE-Marathon hat sich gegenüber GLM-5.2 ungefähr verdoppelt. Auf der Sicherheitsseite erreichte CyberGym 84,5 %, leicht über Claude Mythos 5 und GPT-5.6 Sol, während ExploitBench bei 54,4 % lag und damit immer noch hinter den Spitzenmodellen zurückblieb. Hinweis zur Quelle: Die Behauptung einer 50-prozentigen Codierungsverbesserung und mehrere dieser Scores stammen aus Zhipus eigenen Bewertungen, daher sind sie als Anbieterbericht zu behandeln, bis Dritte sie reproduzieren.

Die zugrundeliegende Architektur ist die GLM-5-Familien-Baseline: ein Mixture-of-Experts-Design mit insgesamt 744B Parametern, etwa 40B aktiv pro Forward-Pass und einem 200K Token-Kontextfenster, gemäß der Dokumentation von Z.ai. Dies sind Familienspezifikationen, keine 5.3-spezifischen Behauptungen.
Zwei weitere Gründe, warum diese Veröffentlichung für API-Benutzer wichtig ist. Erstens, Zhipu gibt an, die offenen Gewichte von GLM-5.3 etwa zwei Wochen nach der Veröffentlichung, um den 28. August herum, zusammen mit dem bisher umfangreichsten Risikobewertungssystem freizugeben, so die Berichterstattung von Pandaily zur Einführung. Wenn Self-Hosting auf Ihrer Roadmap steht, dient die API, die Sie heute einrichten, als Ihre Regressions-Baseline; unser GLM-5.3 Self-Hosting Vorbereitungsleitfaden behandelt dieses Thema ausführlich. Zweitens, Seeking Alpha bezeichnet Zhipu als den „chinesischen OpenAI-Herausforderer“, und Open-Weight-Veröffentlichungen auf diesem Leistungsniveau neigen dazu, die Preise auf dem gesamten Markt zu beeinflussen.
Einen API-Schlüssel erhalten
Es gibt zwei Plattformen, regional aufgeteilt, und diese Aufteilung zieht sich durch den gesamten Rest dieses Leitfadens.
Z.ai (international). Registrieren Sie sich unter z.ai, öffnen Sie die API-Konsole und erstellen Sie einen Schlüssel. Die Dokumentation finden Sie unter docs.z.ai. Dies ist der Pfad für alle außerhalb des chinesischen Festlandes, und es ist der Endpunkt, auf den der Rest dieses Artikels standardmäßig verweist.
Bigmodel.cn (Festlandchina). Zhipus inländische Plattform ist open.bigmodel.cn. Gleiche API-Struktur, gleiches Authentifizierungsschema, anderer Host und separate Abrechnung. Wenn Ihr Traffic vom chinesischen Festland stammt, verwenden Sie diese; Latenz und Compliance sprechen dafür.
Welche Plattform Sie auch wählen, exportieren Sie den Schlüssel einmal und halten Sie ihn aus Ihrem Code fern:
export GLM_API_KEY="your-key-from-the-console"
Wenn Sie den GLM Coding Plan nutzen und nicht die Pay-as-you-go-API-Abrechnung, beachten Sie, dass die Kontingente für alle Benutzer am 14. August zurückgesetzt wurden, sodass Sie die 5.3-Ära mit einem sauberen Guthaben beginnen.
Endpunkt und Authentifizierung
Der Chat-Completions-Endpunkt, zum Zeitpunkt des Verfassens gegen die GLM-5-Dokumentation verifiziert:
POST https://api.z.ai/api/paas/v4/chat/completions
Festlandchina tauscht den Host:
POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Die Authentifizierung erfolgt über einen Header: Authorization: Bearer $GLM_API_KEY. Keine Signatur, kein Session-Handshake.
OpenAI-kompatibel bedeutet genau das, was Sie sich erhoffen. Der Anfragetext hat die Form des Modells plus Nachrichtenarray, die Antwort kommt mit choices, message, finish_reason und usage zurück, und die offiziellen OpenAI SDKs funktionieren unverändert, sobald Sie die base_url auf Z.ai zeigen. Jeder Code, den Sie für einen anderen OpenAI-kompatiblen Anbieter geschrieben haben, lässt sich mit einem Host- und Modellwechsel übertragen; das Muster ist dasselbe, das wir für die API von DeepSeek V4 Pro durchgegangen sind.
Ein ehrlicher Vorbehalt zur Modell-ID. Als ich am Starttag die Dokumentation abrief, listete die GLM-5-Seite glm-5 als Modell-String auf und war noch nicht für 5.3 aktualisiert worden. Zhipus Preisgestaltungsseite listet glm-5.2 und glm-5.1 als unterschiedliche Modelle auf, daher besagt die Familienkonvention, dass die neue ID glm-5.3 ist. Die Beispiele unten verwenden es, aber überprüfen Sie die Dokumentation, bevor Sie es in der Produktion festlegen. Wenn glm-5.3 in Ihrer Region einen 404-Fehler zurückgibt, greifen Sie auf glm-5 zurück, und Sie sind immer noch in derselben Familie.
Ihre erste Anfrage in cURL
Ein vollständiger, funktionierender Aufruf:
curl "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "system",
"content": "You are a code reviewer. Flag issues as blocking or non-blocking."
},
{
"role": "user",
"content": "Review this shell script for safety:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
}
],
"temperature": 0.3,
"max_tokens": 1024
}'
Die Antwort hat die Standard-OpenAI-Form: ein choices-Array, in dem choices[0].message.content die Antwort enthält, und ein usage-Block mit prompt_tokens und completion_tokens. Angesichts des Terminal-Bench-Scores sind Shell- und Terminal-nahe Überprüfungs-Prompts wie dieser genau dort, wo 5.3 sich am meisten verbessert haben soll, daher ist dies ein passender Smoke-Test.
Die Dokumentation beschreibt auch einen thinking-Parameter, der den Denkmodus des Modells umschaltet:
"thinking": { "type": "enabled" }
Aktivieren Sie ihn für mehrstufige Codierungs- und Agentenaufgaben; überspringen Sie ihn für kurze Extraktionsaufrufe, bei denen Reasoning-Token verschwendet werden.
Python Schnellstart
Kein neues SDK zu lernen. Installieren Sie das OpenAI-Paket und ändern Sie die Basis-URL:
pip install --upgrade openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GLM_API_KEY"],
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[
{
"role": "system",
"content": "You are a code reviewer. Flag issues as blocking or non-blocking.",
},
{
"role": "user",
"content": (
"Review this Flask route for security issues:\n\n"
"@app.route('/user/<id>')\n"
"def get_user(id):\n"
" return db.execute(f'SELECT * FROM users WHERE id = {id}')"
),
},
],
temperature=0.3,
max_tokens=2048,
)
print(response.choices[0].message.content)
print("input tokens:", response.usage.prompt_tokens)
print("output tokens:", response.usage.completion_tokens)
Protokollieren Sie diesen usage-Block vom ersten Tag an. Da zum Start keine 5.3-spezifischen Preise veröffentlicht wurden, sind Ihre Token-Anzahlen die einzige Möglichkeit, abzuschätzen, wie Ihre Rechnung aussehen wird, sobald die offiziellen Zahlen erscheinen.
Node.js Schnellstart
Dasselbe Vorgehen mit dem openai npm-Paket:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.GLM_API_KEY,
baseURL: "https://api.z.ai/api/paas/v4",
});
const response = await client.chat.completions.create({
model: "glm-5.3",
messages: [
{
role: "system",
content: "You are a terminal automation agent. Return each step as a shell command with a one-line rationale.",
},
{
role: "user",
content: "A Node service on port 3000 stopped responding after a deploy. Give me a diagnosis sequence.",
},
],
temperature: 0.3,
max_tokens: 2048,
});
console.log(response.choices[0].message.content);
Wenn Ihre Codebasis bereits mit OpenAI kommuniziert, benötigen Sie keinen parallelen Client. Instanziieren Sie eine zweite OpenAI-Instanz mit der Z.ai baseURL und leiten Sie Anfragen pro Aufgabe weiter. Das macht den A/B-Vergleich zwischen GLM-5.3 und Ihrem aktuellen Modell zu einer Routing-Entscheidung anstelle einer Neuentwicklung.
Streaming
Die Dokumentation bestätigt Streaming-Unterstützung durch das Standard-stream-Flag. In Python:
stream = client.chat.completions.create(
model="glm-5.3",
messages=[
{"role": "user", "content": "Explain the N+1 query problem with a concrete ORM example."}
],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
Über rohes HTTP setzen Sie "stream": true im Body und parsen Server-Sent Events; jede data:-Zeile enthält ein Delta im OpenAI-Chunk-Format. Zwei praktische Hinweise: Die Token-Nutzung wird bei oder nach dem letzten Chunk gemeldet, sodass die Abrechnung erst nach dem Schließen des Streams genau ist. Und wenn Sie thinking aktivieren, erwarten Sie eine längere Pause vor dem ersten sichtbaren Token bei komplexen Prompts; das Modell verwendet Token zum Nachdenken, bevor es antwortet, was der Kompromiss ist, auf den Sie sich eingelassen haben.
Wichtige Parameter
| Parameter | Type | Was es tut |
|---|---|---|
max_tokens |
integer | Feste Obergrenze für die Ausgabelänge. Ihr wichtigster Kostenhebel. |
temperature |
number | Verwenden Sie 0,2 bis 0,4 für Code und Extraktion, 0,7+ für offenes Schreiben. |
thinking |
object | {"type": "enabled"} schaltet den Denkmodus für mehrstufige Aufgaben ein. |
stream |
boolean | Server-sent Events anstelle eines einzelnen Antwortkörpers. |
messages |
array | Standardmäßige OpenAI-Rollen: system, user, assistant. |
Zu den Kosten: Zhipu hatte zum Start keine 5.3-spezifischen API-Preise veröffentlicht, widerstehen Sie also jeder Pro-Token-Angabe, die Sie auf Reseller-Seiten sehen. Die offizielle Preisgestaltungsseite ist die Quelle der Wahrheit; zum Zeitpunkt dieses Schreibens listete sie GLM-5.2 mit 1,40 $ Eingabe und 4,40 $ Ausgabe pro 1 Mio. Token, und GLM-5 mit 1,00 $ und 3,20 $, was den plausiblen Bereich für 5.3 eingrenzt. Zwischengespeicherte Eingaben bei den kostenpflichtigen GLM-Modellen sind um 80 bis 85 % rabattiert, gestalten Sie daher wiederholte System-Prompts so, dass sie den Cache treffen. Wenn Sie ein Anbieter jemals mit einer Preisänderung überrascht hat, wissen Sie, warum diese Disziplin wichtig ist; unser DeepSeek-Preiserhöhungs-Postmortem behandelt die direkt übertragbaren Kostenkontrollmuster.
GLM-5.3 in Apidog testen, bevor Sie Anwendungscode schreiben
Die Prompt-Iteration innerhalb eines Skripts ist eine langsame Schleife: bearbeiten, neu ausführen, scrollen, wiederholen, und jeder Zyklus berechnet Token. Da die API von Z.ai OpenAI-kompatibel ist, kann ein API-Client die gesamte Explorationsphase übernehmen.
Die Einrichtung in Apidog:
- Erstellen Sie ein Projekt und fügen Sie die Chat-Completions-Anfrage hinzu. Importieren Sie eine OpenAI-kompatible Spezifikation oder definieren Sie den einzelnen
POST /chat/completions-Endpunkt manuell; der Body hat die bekannte Formmodelplusmessages. - Erstellen Sie zwei Umgebungen:
zai-internationalundbigmodel-mainland. Legen Sie die Basis-URL in jeder fest (https://api.z.ai/api/paas/v4undhttps://open.bigmodel.cn/api/paas/v4) und binden SieAuthorization: Bearer {{GLM_API_KEY}}auf Umgebungsebene. Der Wechsel zwischen Regionen wird zu einem Dropdown-Klick, und der Schlüssel landet niemals in einer gespeicherten Anfrage. - Legen Sie die Modell-ID hinter einer Variable ab, die auf
glm-5.3gesetzt ist. In der Startwoche ist dies wichtiger als sonst: Wenn sich die ID ändert, während sich die Dokumentation einpendelt, oder Sie einen A/B-Vergleich mitglm-5.2durchführen möchten, ändern Sie eine Variable, anstatt jede gespeicherte Anfrage zu bearbeiten. - Testen Sie den
thinking-Schalter nebeneinander. Duplizieren Sie die Anfrage, aktivieren Sie die Argumentation in einer Kopie und vergleichen Sie Latenz, Ausgabequalität undusagebeim selben Prompt. Dies ist der schnellste Weg, um zu entscheiden, welche Ihrer Workloads Reasoning-Token verdienen. - Rufen Sie den Streaming-Endpunkt auf. SSE-Chunks werden live gerendert, sodass Sie die Zeit bis zum ersten Token so sehen, wie Ihre Benutzer sie sehen werden.
- Speichern Sie gute Antworten als Beispiele. Spätere Ausführungen treffen auf das Fixture statt auf die Live-API, was der größte Token-Sparer während der Entwicklung ist.
Von dort aus verketten Sie gespeicherte Anfragen zu Testszenarien mit Assertions für finish_reason, Antwortschema und Token-Anzahlen, und Sie haben Smoke-Tests in eine Regressionstest-Suite verwandelt. Derselbe Workflow, verallgemeinert auf jede API, findet sich in unserem API-Testleitfaden für QA-Ingenieure.
Fehlerbehandlung und Ratenbegrenzungen
Erwarten Sie standardmäßige OpenAI-Fehler: ein error-Objekt mit message, type und code. Die üblichen Verdächtigen sind 401 für einen fehlenden oder widerrufenen Schlüssel, 400 für einen fehlerhaften Body oder eine unbekannte Modell-ID, 429 für Ratenbegrenzungen und 5xx für vorübergehende Serverfehler.
Drei Gewohnheiten für eine API am Starttag:
- Wickeln Sie jeden Aufruf in eine Retry-Hilfsfunktion ein mit jittered exponentiellem Backoff bei 429 und 5xx. Neue Modellstarts konzentrieren den Traffic, und die Kapazität am ersten Tag ist der Zeitpunkt, an dem Sie auf 429er stoßen werden.
- Erfinden Sie keine Ratenbegrenzungswerte. Zhipu veröffentlicht Details zu Parallelität und Stufen in der offiziellen Dokumentation; lesen Sie dort die aktuellen Werte, anstatt einem Blog-Beitrag, einschließlich diesem, zu vertrauen, um auf dem neuesten Stand zu bleiben.
- Fixieren Sie die Modell-ID hinter der Konfiguration. Wenn eine 5.3-Verhaltensänderung einen Prompt bricht, sollte das Zurückrollen auf
glm-5.2eine Konfigurationsänderung sein, kein Deployment. Der Debugging-Workflow, den wir für Groks API entwickelt haben, gilt hier unverändert, da beide den OpenAI-Dialekt sprechen.
Häufig gestellte Fragen
Was ist die Modell-ID für die GLM-5.3 API?
Erwarten Sie glm-5.3, gemäß der Familienkonvention, die uns glm-5.2 und glm-5.1 auf Zhipus Preisgestaltungsseite liefert. Zum Zeitpunkt des Verfassens listete die Dokumentation auf der Modellseite immer noch glm-5 auf, bestätigen Sie dies also unter docs.z.ai, bevor Sie es festlegen, und halten Sie die ID in der Konfiguration, damit eine Korrektur günstig ist.
Funktioniert die GLM-5.3 API mit dem OpenAI SDK?
Ja. Die API ist OpenAI-kompatibel, daher funktionieren die offiziellen openai-Pakete für Python und Node.js, sobald Sie base_url auf https://api.z.ai/api/paas/v4 (oder das entsprechende bigmodel.cn-Äquivalent) setzen und Ihren Z.ai-Schlüssel übergeben. Anfrage- und Antwortstrukturen entsprechen dem Chat-Completions-Standard, einschließlich Streaming.
Wie viel kostet die GLM-5.3 API?
Zhipu hatte zum Start am 14. August 2026 keine 5.3-spezifischen Preise veröffentlicht. Die offizielle Preisgestaltungsseite listete GLM-5.2 mit 1,40 $ pro 1 Mio. Eingabe-Token und 4,40 $ pro 1 Mio. Ausgabe-Token auf, was Ihr bester Referenzpunkt ist, bis die 5.3-Zeile erscheint. Ignorieren Sie Preisschätzungen von Resellern.
Wie vergleicht sich GLM-5.3 mit Claude und GPT?
Zhipus eigene Bewertungen stufen die Codierungs- und Agentenfähigkeiten als „nahezu Claude Fable 5“ ein, wobei CyberGym mit 84,5 % leicht über Claude Mythos 5 und GPT-5.6 Sol liegt, ExploitBench jedoch mit 54,4 % immer noch hinter den Spitzenmodellen zurückbleibt. Betrachten Sie Anbieterzahlen als Behauptungen, bis sie unabhängig reproduziert werden; wie wir Spitzenmodelle miteinander vergleichen, sehen Sie in unserem Vergleich Grok 4.6 vs GPT-5.6 vs Claude Fable 5.
Kann ich GLM-5.3 lokal ausführen, anstatt die API zu verwenden?
Noch nicht. Zhipu gibt an, dass die offenen Gewichte etwa zwei Wochen nach der Veröffentlichung, um den 28. August 2026, auf seiner Hugging Face-Organisation erscheinen werden. Das 744B-Parameter MoE-Design bedeutet, dass lokales Servieren Server-Klasse-Arbeit ist, keine Laptop-Arbeit; verwenden Sie jetzt die gehostete API und bauen Sie die Baseline auf, mit der Sie eine selbst gehostete Bereitstellung vergleichen werden.
Wo GLM-5.3 in Ihren Stack passt
GLM-5.3 ist eine Nachmittagsbewertung wert, wenn Sie Agenten-Loops oder Codierungs-Workloads ausführen, und die OpenAI-kompatible Oberfläche macht diesen Nachmittag günstig. Die Terminal-Bench- und SWE-Marathon-Sprünge sind vom Anbieter gemeldet, aber eine 6,2-fache Bewegung ist groß genug, um sich selbst zu überprüfen, und die zweiwöchige Frist bis zu den offenen Gewichten bedeutet, dass Anfragen, die Sie heute speichern, später zur Regressions-Baseline für eine selbst gehostete Bereitstellung werden.
Die sinnvolle Reihenfolge: einen Schlüssel besorgen, den cURL-Aufruf ausführen und die Anfrage in einen API-Client verschieben, bevor Sie Anwendungscode anfassen. Laden Sie Apidog herunter, um die beiden regionalen Umgebungen einzurichten, die Modell-ID hinter einer Variable zu parken und thinking mit und ohne bei Ihren echten Prompts zu vergleichen. Sobald die Antworten richtig aussehen, ist die Python- oder Node-Portierung eine Basis-URL und eine Umgebungsvariable, denn das Wire-Format war nie der schwierige Teil.
