Wie benutzt man die GLM-5.3 API?

GLM-5.3 API-Schnellstart: Besorgen Sie sich einen Z.ai- oder bigmodel.cn-Schlüssel, rufen Sie den OpenAI-kompatiblen Endpunkt in cURL, Python und Node.js auf, streamen Sie Token und testen Sie in Apidog.

Ashley Innocent

Ashley Innocent

16 August 2026

Wie benutzt man die GLM-5.3 API?

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Zhipu AI, das chinesische Labor, das international als Z.ai firmiert, veröffentlichte GLM-5.3 am 14. August 2026, und die Zahlen zur Codierungsleistung sprechen für sich. Interne Bewertungen zeigen eine 50-prozentige Verbesserung der Codierungsfähigkeit gegenüber GLM-5.2, der Terminal-Bench 3.0-Score sprang von 4,6 auf 28,3, und Zhipu beschreibt die Codierungs- und Agentenfähigkeiten des Modells als „nahezu Claude Fable 5“, so der Veröffentlichungsbericht von BigGo. Offene Gewichte folgen in etwa zwei Wochen. Für die vollständige Aufschlüsselung der Funktionen und die Benchmark-Tabelle lesen Sie, was GLM-5.3 ist; dieser Artikel ist der praktische API-Schnellstart.

Folgendes werden Sie tun: einen API-Schlüssel besorgen, einen ersten Aufruf in cURL tätigen, diesen über das OpenAI SDK nach Python und Node.js portieren, Token streamen, die wichtigen Parameter einstellen und die gesamte Schleife in Apidog integrieren, damit Sie die Anforderungsform festlegen können, bevor Sie Anwendungscode schreiben. Die gute Nachricht vorab: Die API von Z.ai ist OpenAI-kompatibel. Wenn Sie zuvor bereits einen OpenAI-ähnlichen Endpunkt aufgerufen haben, kennen Sie das meiste davon bereits.

Ein Hinweis vor dem Code. GLM-5.3 wurde heute veröffentlicht, und Zhipus Dokumentation ändert sich an Einführungstagen schnell. Alles, was ich bei der Überprüfung direkt aus den offiziellen Dokumenten entnommen habe, wird als verifiziert dargestellt; alles, was die Dokumente noch nicht erfasst hatten, wird als GLM-5-Familienkonvention gekennzeichnet, mit einem Link, damit Sie den aktuellen Stand selbst bestätigen können.

Kurz gesagt

Warum GLM-5.3 wichtig ist

Das Basismodell hat sich nicht geändert. Jeder Fortschritt in dieser Version resultiert aus skaliertem Post-Training auf GLM-5, was die Größe der Sprünge ungewöhnlich macht. Terminal-Bench 3.0 stieg von 4,6 auf 28,3, eine 6,2-fache Bewegung, die GLM von irrelevant auf den ersten Platz unter den Open-Source-Modellen in diesem Benchmark und bei Agents’ Last Exam brachte. SWE-Marathon hat sich gegenüber GLM-5.2 ungefähr verdoppelt. Auf der Sicherheitsseite erreichte CyberGym 84,5 %, leicht über Claude Mythos 5 und GPT-5.6 Sol, während ExploitBench bei 54,4 % lag und damit immer noch hinter den Spitzenmodellen zurückblieb. Hinweis zur Quelle: Die Behauptung einer 50-prozentigen Codierungsverbesserung und mehrere dieser Scores stammen aus Zhipus eigenen Bewertungen, daher sind sie als Anbieterbericht zu behandeln, bis Dritte sie reproduzieren.

Die zugrundeliegende Architektur ist die GLM-5-Familien-Baseline: ein Mixture-of-Experts-Design mit insgesamt 744B Parametern, etwa 40B aktiv pro Forward-Pass und einem 200K Token-Kontextfenster, gemäß der Dokumentation von Z.ai. Dies sind Familienspezifikationen, keine 5.3-spezifischen Behauptungen.

Zwei weitere Gründe, warum diese Veröffentlichung für API-Benutzer wichtig ist. Erstens, Zhipu gibt an, die offenen Gewichte von GLM-5.3 etwa zwei Wochen nach der Veröffentlichung, um den 28. August herum, zusammen mit dem bisher umfangreichsten Risikobewertungssystem freizugeben, so die Berichterstattung von Pandaily zur Einführung. Wenn Self-Hosting auf Ihrer Roadmap steht, dient die API, die Sie heute einrichten, als Ihre Regressions-Baseline; unser GLM-5.3 Self-Hosting Vorbereitungsleitfaden behandelt dieses Thema ausführlich. Zweitens, Seeking Alpha bezeichnet Zhipu als den „chinesischen OpenAI-Herausforderer“, und Open-Weight-Veröffentlichungen auf diesem Leistungsniveau neigen dazu, die Preise auf dem gesamten Markt zu beeinflussen.

Einen API-Schlüssel erhalten

Es gibt zwei Plattformen, regional aufgeteilt, und diese Aufteilung zieht sich durch den gesamten Rest dieses Leitfadens.

Z.ai (international). Registrieren Sie sich unter z.ai, öffnen Sie die API-Konsole und erstellen Sie einen Schlüssel. Die Dokumentation finden Sie unter docs.z.ai. Dies ist der Pfad für alle außerhalb des chinesischen Festlandes, und es ist der Endpunkt, auf den der Rest dieses Artikels standardmäßig verweist.

Bigmodel.cn (Festlandchina). Zhipus inländische Plattform ist open.bigmodel.cn. Gleiche API-Struktur, gleiches Authentifizierungsschema, anderer Host und separate Abrechnung. Wenn Ihr Traffic vom chinesischen Festland stammt, verwenden Sie diese; Latenz und Compliance sprechen dafür.

Welche Plattform Sie auch wählen, exportieren Sie den Schlüssel einmal und halten Sie ihn aus Ihrem Code fern:

export GLM_API_KEY="your-key-from-the-console"

Wenn Sie den GLM Coding Plan nutzen und nicht die Pay-as-you-go-API-Abrechnung, beachten Sie, dass die Kontingente für alle Benutzer am 14. August zurückgesetzt wurden, sodass Sie die 5.3-Ära mit einem sauberen Guthaben beginnen.

Endpunkt und Authentifizierung

Der Chat-Completions-Endpunkt, zum Zeitpunkt des Verfassens gegen die GLM-5-Dokumentation verifiziert:

POST https://api.z.ai/api/paas/v4/chat/completions

Festlandchina tauscht den Host:

POST https://open.bigmodel.cn/api/paas/v4/chat/completions

Die Authentifizierung erfolgt über einen Header: Authorization: Bearer $GLM_API_KEY. Keine Signatur, kein Session-Handshake.

OpenAI-kompatibel bedeutet genau das, was Sie sich erhoffen. Der Anfragetext hat die Form des Modells plus Nachrichtenarray, die Antwort kommt mit choices, message, finish_reason und usage zurück, und die offiziellen OpenAI SDKs funktionieren unverändert, sobald Sie die base_url auf Z.ai zeigen. Jeder Code, den Sie für einen anderen OpenAI-kompatiblen Anbieter geschrieben haben, lässt sich mit einem Host- und Modellwechsel übertragen; das Muster ist dasselbe, das wir für die API von DeepSeek V4 Pro durchgegangen sind.

Ein ehrlicher Vorbehalt zur Modell-ID. Als ich am Starttag die Dokumentation abrief, listete die GLM-5-Seite glm-5 als Modell-String auf und war noch nicht für 5.3 aktualisiert worden. Zhipus Preisgestaltungsseite listet glm-5.2 und glm-5.1 als unterschiedliche Modelle auf, daher besagt die Familienkonvention, dass die neue ID glm-5.3 ist. Die Beispiele unten verwenden es, aber überprüfen Sie die Dokumentation, bevor Sie es in der Produktion festlegen. Wenn glm-5.3 in Ihrer Region einen 404-Fehler zurückgibt, greifen Sie auf glm-5 zurück, und Sie sind immer noch in derselben Familie.

Ihre erste Anfrage in cURL

Ein vollständiger, funktionierender Aufruf:

curl "https://api.z.ai/api/paas/v4/chat/completions" \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      {
        "role": "system",
        "content": "You are a code reviewer. Flag issues as blocking or non-blocking."
      },
      {
        "role": "user",
        "content": "Review this shell script for safety:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
      }
    ],
    "temperature": 0.3,
    "max_tokens": 1024
  }'

Die Antwort hat die Standard-OpenAI-Form: ein choices-Array, in dem choices[0].message.content die Antwort enthält, und ein usage-Block mit prompt_tokens und completion_tokens. Angesichts des Terminal-Bench-Scores sind Shell- und Terminal-nahe Überprüfungs-Prompts wie dieser genau dort, wo 5.3 sich am meisten verbessert haben soll, daher ist dies ein passender Smoke-Test.

Die Dokumentation beschreibt auch einen thinking-Parameter, der den Denkmodus des Modells umschaltet:

"thinking": { "type": "enabled" }

Aktivieren Sie ihn für mehrstufige Codierungs- und Agentenaufgaben; überspringen Sie ihn für kurze Extraktionsaufrufe, bei denen Reasoning-Token verschwendet werden.

Python Schnellstart

Kein neues SDK zu lernen. Installieren Sie das OpenAI-Paket und ändern Sie die Basis-URL:

pip install --upgrade openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GLM_API_KEY"],
    base_url="https://api.z.ai/api/paas/v4",
)

response = client.chat.completions.create(
    model="glm-5.3",
    messages=[
        {
            "role": "system",
            "content": "You are a code reviewer. Flag issues as blocking or non-blocking.",
        },
        {
            "role": "user",
            "content": (
                "Review this Flask route for security issues:\n\n"
                "@app.route('/user/<id>')\n"
                "def get_user(id):\n"
                "    return db.execute(f'SELECT * FROM users WHERE id = {id}')"
            ),
        },
    ],
    temperature=0.3,
    max_tokens=2048,
)

print(response.choices[0].message.content)
print("input tokens:", response.usage.prompt_tokens)
print("output tokens:", response.usage.completion_tokens)

Protokollieren Sie diesen usage-Block vom ersten Tag an. Da zum Start keine 5.3-spezifischen Preise veröffentlicht wurden, sind Ihre Token-Anzahlen die einzige Möglichkeit, abzuschätzen, wie Ihre Rechnung aussehen wird, sobald die offiziellen Zahlen erscheinen.

Node.js Schnellstart

Dasselbe Vorgehen mit dem openai npm-Paket:

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.GLM_API_KEY,
  baseURL: "https://api.z.ai/api/paas/v4",
});

const response = await client.chat.completions.create({
  model: "glm-5.3",
  messages: [
    {
      role: "system",
      content: "You are a terminal automation agent. Return each step as a shell command with a one-line rationale.",
    },
    {
      role: "user",
      content: "A Node service on port 3000 stopped responding after a deploy. Give me a diagnosis sequence.",
    },
  ],
  temperature: 0.3,
  max_tokens: 2048,
});

console.log(response.choices[0].message.content);

Wenn Ihre Codebasis bereits mit OpenAI kommuniziert, benötigen Sie keinen parallelen Client. Instanziieren Sie eine zweite OpenAI-Instanz mit der Z.ai baseURL und leiten Sie Anfragen pro Aufgabe weiter. Das macht den A/B-Vergleich zwischen GLM-5.3 und Ihrem aktuellen Modell zu einer Routing-Entscheidung anstelle einer Neuentwicklung.

Streaming

Die Dokumentation bestätigt Streaming-Unterstützung durch das Standard-stream-Flag. In Python:

stream = client.chat.completions.create(
    model="glm-5.3",
    messages=[
        {"role": "user", "content": "Explain the N+1 query problem with a concrete ORM example."}
    ],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)

Über rohes HTTP setzen Sie "stream": true im Body und parsen Server-Sent Events; jede data:-Zeile enthält ein Delta im OpenAI-Chunk-Format. Zwei praktische Hinweise: Die Token-Nutzung wird bei oder nach dem letzten Chunk gemeldet, sodass die Abrechnung erst nach dem Schließen des Streams genau ist. Und wenn Sie thinking aktivieren, erwarten Sie eine längere Pause vor dem ersten sichtbaren Token bei komplexen Prompts; das Modell verwendet Token zum Nachdenken, bevor es antwortet, was der Kompromiss ist, auf den Sie sich eingelassen haben.

Wichtige Parameter

Parameter Type Was es tut
max_tokens integer Feste Obergrenze für die Ausgabelänge. Ihr wichtigster Kostenhebel.
temperature number Verwenden Sie 0,2 bis 0,4 für Code und Extraktion, 0,7+ für offenes Schreiben.
thinking object {"type": "enabled"} schaltet den Denkmodus für mehrstufige Aufgaben ein.
stream boolean Server-sent Events anstelle eines einzelnen Antwortkörpers.
messages array Standardmäßige OpenAI-Rollen: system, user, assistant.

Zu den Kosten: Zhipu hatte zum Start keine 5.3-spezifischen API-Preise veröffentlicht, widerstehen Sie also jeder Pro-Token-Angabe, die Sie auf Reseller-Seiten sehen. Die offizielle Preisgestaltungsseite ist die Quelle der Wahrheit; zum Zeitpunkt dieses Schreibens listete sie GLM-5.2 mit 1,40 $ Eingabe und 4,40 $ Ausgabe pro 1 Mio. Token, und GLM-5 mit 1,00 $ und 3,20 $, was den plausiblen Bereich für 5.3 eingrenzt. Zwischengespeicherte Eingaben bei den kostenpflichtigen GLM-Modellen sind um 80 bis 85 % rabattiert, gestalten Sie daher wiederholte System-Prompts so, dass sie den Cache treffen. Wenn Sie ein Anbieter jemals mit einer Preisänderung überrascht hat, wissen Sie, warum diese Disziplin wichtig ist; unser DeepSeek-Preiserhöhungs-Postmortem behandelt die direkt übertragbaren Kostenkontrollmuster.

GLM-5.3 in Apidog testen, bevor Sie Anwendungscode schreiben

Die Prompt-Iteration innerhalb eines Skripts ist eine langsame Schleife: bearbeiten, neu ausführen, scrollen, wiederholen, und jeder Zyklus berechnet Token. Da die API von Z.ai OpenAI-kompatibel ist, kann ein API-Client die gesamte Explorationsphase übernehmen.

Die Einrichtung in Apidog:

  1. Erstellen Sie ein Projekt und fügen Sie die Chat-Completions-Anfrage hinzu. Importieren Sie eine OpenAI-kompatible Spezifikation oder definieren Sie den einzelnen POST /chat/completions-Endpunkt manuell; der Body hat die bekannte Form model plus messages.
  2. Erstellen Sie zwei Umgebungen: zai-international und bigmodel-mainland. Legen Sie die Basis-URL in jeder fest (https://api.z.ai/api/paas/v4 und https://open.bigmodel.cn/api/paas/v4) und binden Sie Authorization: Bearer {{GLM_API_KEY}} auf Umgebungsebene. Der Wechsel zwischen Regionen wird zu einem Dropdown-Klick, und der Schlüssel landet niemals in einer gespeicherten Anfrage.
  3. Legen Sie die Modell-ID hinter einer Variable ab, die auf glm-5.3 gesetzt ist. In der Startwoche ist dies wichtiger als sonst: Wenn sich die ID ändert, während sich die Dokumentation einpendelt, oder Sie einen A/B-Vergleich mit glm-5.2 durchführen möchten, ändern Sie eine Variable, anstatt jede gespeicherte Anfrage zu bearbeiten.
  4. Testen Sie den thinking-Schalter nebeneinander. Duplizieren Sie die Anfrage, aktivieren Sie die Argumentation in einer Kopie und vergleichen Sie Latenz, Ausgabequalität und usage beim selben Prompt. Dies ist der schnellste Weg, um zu entscheiden, welche Ihrer Workloads Reasoning-Token verdienen.
  5. Rufen Sie den Streaming-Endpunkt auf. SSE-Chunks werden live gerendert, sodass Sie die Zeit bis zum ersten Token so sehen, wie Ihre Benutzer sie sehen werden.
  6. Speichern Sie gute Antworten als Beispiele. Spätere Ausführungen treffen auf das Fixture statt auf die Live-API, was der größte Token-Sparer während der Entwicklung ist.

Von dort aus verketten Sie gespeicherte Anfragen zu Testszenarien mit Assertions für finish_reason, Antwortschema und Token-Anzahlen, und Sie haben Smoke-Tests in eine Regressionstest-Suite verwandelt. Derselbe Workflow, verallgemeinert auf jede API, findet sich in unserem API-Testleitfaden für QA-Ingenieure.

Fehlerbehandlung und Ratenbegrenzungen

Erwarten Sie standardmäßige OpenAI-Fehler: ein error-Objekt mit message, type und code. Die üblichen Verdächtigen sind 401 für einen fehlenden oder widerrufenen Schlüssel, 400 für einen fehlerhaften Body oder eine unbekannte Modell-ID, 429 für Ratenbegrenzungen und 5xx für vorübergehende Serverfehler.

Drei Gewohnheiten für eine API am Starttag:

Häufig gestellte Fragen

Was ist die Modell-ID für die GLM-5.3 API?

Erwarten Sie glm-5.3, gemäß der Familienkonvention, die uns glm-5.2 und glm-5.1 auf Zhipus Preisgestaltungsseite liefert. Zum Zeitpunkt des Verfassens listete die Dokumentation auf der Modellseite immer noch glm-5 auf, bestätigen Sie dies also unter docs.z.ai, bevor Sie es festlegen, und halten Sie die ID in der Konfiguration, damit eine Korrektur günstig ist.

Funktioniert die GLM-5.3 API mit dem OpenAI SDK?

Ja. Die API ist OpenAI-kompatibel, daher funktionieren die offiziellen openai-Pakete für Python und Node.js, sobald Sie base_url auf https://api.z.ai/api/paas/v4 (oder das entsprechende bigmodel.cn-Äquivalent) setzen und Ihren Z.ai-Schlüssel übergeben. Anfrage- und Antwortstrukturen entsprechen dem Chat-Completions-Standard, einschließlich Streaming.

Wie viel kostet die GLM-5.3 API?

Zhipu hatte zum Start am 14. August 2026 keine 5.3-spezifischen Preise veröffentlicht. Die offizielle Preisgestaltungsseite listete GLM-5.2 mit 1,40 $ pro 1 Mio. Eingabe-Token und 4,40 $ pro 1 Mio. Ausgabe-Token auf, was Ihr bester Referenzpunkt ist, bis die 5.3-Zeile erscheint. Ignorieren Sie Preisschätzungen von Resellern.

Wie vergleicht sich GLM-5.3 mit Claude und GPT?

Zhipus eigene Bewertungen stufen die Codierungs- und Agentenfähigkeiten als „nahezu Claude Fable 5“ ein, wobei CyberGym mit 84,5 % leicht über Claude Mythos 5 und GPT-5.6 Sol liegt, ExploitBench jedoch mit 54,4 % immer noch hinter den Spitzenmodellen zurückbleibt. Betrachten Sie Anbieterzahlen als Behauptungen, bis sie unabhängig reproduziert werden; wie wir Spitzenmodelle miteinander vergleichen, sehen Sie in unserem Vergleich Grok 4.6 vs GPT-5.6 vs Claude Fable 5.

Kann ich GLM-5.3 lokal ausführen, anstatt die API zu verwenden?

Noch nicht. Zhipu gibt an, dass die offenen Gewichte etwa zwei Wochen nach der Veröffentlichung, um den 28. August 2026, auf seiner Hugging Face-Organisation erscheinen werden. Das 744B-Parameter MoE-Design bedeutet, dass lokales Servieren Server-Klasse-Arbeit ist, keine Laptop-Arbeit; verwenden Sie jetzt die gehostete API und bauen Sie die Baseline auf, mit der Sie eine selbst gehostete Bereitstellung vergleichen werden.

Wo GLM-5.3 in Ihren Stack passt

GLM-5.3 ist eine Nachmittagsbewertung wert, wenn Sie Agenten-Loops oder Codierungs-Workloads ausführen, und die OpenAI-kompatible Oberfläche macht diesen Nachmittag günstig. Die Terminal-Bench- und SWE-Marathon-Sprünge sind vom Anbieter gemeldet, aber eine 6,2-fache Bewegung ist groß genug, um sich selbst zu überprüfen, und die zweiwöchige Frist bis zu den offenen Gewichten bedeutet, dass Anfragen, die Sie heute speichern, später zur Regressions-Baseline für eine selbst gehostete Bereitstellung werden.

Die sinnvolle Reihenfolge: einen Schlüssel besorgen, den cURL-Aufruf ausführen und die Anfrage in einen API-Client verschieben, bevor Sie Anwendungscode anfassen. Laden Sie Apidog herunter, um die beiden regionalen Umgebungen einzurichten, die Modell-ID hinter einer Variable zu parken und thinking mit und ohne bei Ihren echten Prompts zu vergleichen. Sobald die Antworten richtig aussehen, ist die Python- oder Node-Portierung eine Basis-URL und eine Umgebungsvariable, denn das Wire-Format war nie der schwierige Teil.

Schaltfläche

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen