Zhipu AI hat GLM-5.3 am 14. August 2026 veröffentlicht, und in der Berichterstattung über den Start findet sich die für Infrastrukturteams wichtigste Zeile: Die offenen Gewichte kommen etwa zwei Wochen später, um den 28. August, in Zhipus Hugging Face Organisation. Diese Lücke ist ein Geschenk. Sie gibt Ihnen Zeit, die Hardware zu bemessen, einen Serving-Stack auszuwählen und eine Regressions-Baseline gegen die gehostete API zu erfassen, bevor ein einzelner Safetensors-Shard öffentlich wird.
Das Modell ist die Vorarbeit wert. Zhipus interne Bewertungen attestieren der Codierungsfähigkeit eine 50%ige Verbesserung gegenüber GLM-5.2, Terminal-Bench 3.0 sprang von 4.6 auf 28.3, und das Unternehmen beschreibt die Agentenleistung als "nahezu Claude Fable 5", laut Startberichten. Die vollständige Benchmark-Geschichte, einschließlich der Punkte, an denen es noch hinter den Spitzenmodellen zurückbleibt, finden Sie in unserem GLM-5.3 Erklärer. Dieser Artikel konzentriert sich auf eine Frage: Was muss am Tag der Veröffentlichung vorhanden sein, damit Sie GLM-5.3 selbst bereitstellen können?
Zur Klarstellung: Die Gewichte sind heute noch nicht herunterladbar. Alles Weitere bezieht sich auf das Veröffentlichungsfenster, und alles, was Zhipu nicht bestätigt hat, ist als Erwartung und nicht als Tatsache gekennzeichnet. Was Sie jetzt tun können, ist, eine Baseline zu erstellen, und das läuft über Apidog: Erfassen Sie diese Woche Schnappschüsse von gehosteten API-Antworten und spielen Sie dieselbe Sammlung später gegen Ihren lokalen Endpunkt ab.
TL;DR
- GLM-5.3 wurde am 14. August 2026 ausgeliefert. Zhipu gibt an, dass die offenen Gewichte etwa zwei Wochen später, um den 28. August, nach der bisher umfangreichsten Risikoprüfung folgen werden. Erwarteter Speicherort: huggingface.co/zai-org.
- Architektur der GLM-5-Familie (gemäß Z.ai-Dokumentation): Mixture of Experts, 744 Mrd. Gesamtparameter, etwa 40 Mrd. aktiv pro Durchlauf, 200K Kontext. Das Basismodell ist in 5.3 unverändert; alle Verbesserungen stammen aus skaliertem Post-Training.
- Arithmetik bei 744 Mrd. Parametern: Gewichte allein benötigen bei BF16 fast 1,5 TB, bei FP8 etwa die Hälfte davon, vor dem KV-Cache. Das Self-Hosting mit voller Präzision ist das Terrain von Multi-GPU-Servern.
- Jede frühere GLM-5-Version wurde auf Hugging Face als gepaarte BF16- und FP8-Repositories veröffentlicht, erwarten Sie also GLM-5.3 und GLM-5.3-FP8 am ersten Tag, wobei Community-GGUF-Quants Tage bis Wochen später folgen.
- vLLM und SGLang sind die realistischen Serving-Stacks für den ersten Tag. Beide stellen OpenAI-kompatible Endpunkte bereit, sodass Client-Code, der für die gehostete API von Z.ai geschrieben wurde, mit einer Änderung der
base_urlumgestellt werden kann. - Erstellen Sie jetzt Ihre gehostete vs. lokale Regressions-Baseline in Apidog: eine Sammlung, zwei Umgebungen, Zusicherungen zu Form und Inhalt.
Was Zhipu wann veröffentlicht
Zhipu (international als Z.ai vermarktet) verband die Einführung der GLM-5.3 API mit dem Versprechen, die Gewichte nach zwei Wochen offenzulegen: Das Modell wird um den 28. August 2026 auf Hugging Face verfügbar sein. Die Verzögerung ist nicht willkürlich. Zhipu gibt an, für diese Veröffentlichung sein bisher umfangreichstes Risikoprüfungssystem entwickelt zu haben, bemerkenswert angesichts der 84,5 % des Modells auf CyberGym, etwas über Claude Mythos 5 und GPT-5.6 Sol. Seeking Alpha deutet die Veröffentlichung als Zhipus Versuch, die Führung bei offenen Modellen zu behaupten, die es das ganze Jahr über mit DeepSeek geteilt hat.
Zwei Details der Veröffentlichung sind für Self-Hoster wichtig:
- Das Basismodell ist unverändert. GLM-5.3 ist die GLM-5-Basis mit skaliertem Post-Training. Die Architektur, die Ihr Serving-Stack benötigt, ist dieselbe, die vLLM und SGLang bereits für GLM-5 und GLM-5.2 verwenden. Es werden keine neuen Aufmerksamkeitsvarianten oder Tokenizer-Überraschungen erwartet.
- Das Veröffentlichungsmuster ist etabliert. Zhipus Hugging Face Organisation hostet GLM-5, GLM-5.1 und GLM-5.2, jeweils mit einem zugehörigen FP8-Repo. GLM-5.2 allein verzeichnet 2,69 Millionen Downloads. Erwarten Sie dieselbe Struktur für 5.3: eine BF16 Safetensors-Veröffentlichung plus eine offizielle FP8-Variante.
Die Lizenzbedingungen für 5.3 wurden in der Startberichterstattung nicht bestätigt. Überprüfen Sie die Modellkarte, sobald das Repo erscheint, bevor Sie es in ein kommerzielles Produkt integrieren.
Was 744 Mrd. insgesamt, 40 Mrd. aktiv für Ihre Hardware bedeutet
Die GLM-5-Familie ist ein Mixture-of-Experts-Design: 744 Milliarden Gesamtparameter, etwa 40 Milliarden aktiv pro Vorwärtsdurchlauf, 200K Kontext, gemäß Z.ai-Dokumentation (Hugging Face Repositories listen leicht höhere Gesamtzahlen auf, die Embeddings einschließen). Dies sind Familienspezifikationen, keine 5.3-spezifischen Angaben, aber da das Basismodell unverändert ist, sind dies die richtigen Planungszahlen.
Die MoE-Aufteilung erzeugt eine Asymmetrie zwischen Speicher und Rechenleistung:
- Die Rechenleistung verhält sich wie ein dichtes 40B-Modell. Pro Token werden nur die gerouteten Experten aktiviert, sodass der Durchsatz pro GPU, sobald das Modell passt, wesentlich besser ist, als es ein dichtes 744B-Modell vermuten lassen würde.
- Der Speicher verhält sich wie ein 744B-Modell. Jeder Experte muss an einem adressierbaren Ort existieren. Bei 2 Bytes pro Parameter (BF16) sind 744 Mrd. etwa 1,5 TB Gewichte; bei 1 Byte (FP8) etwa 744 GB. Dies ist eine Berechnung auf Basis der veröffentlichten Zahl, keine getestete Konfiguration, und schließt den KV-Cache nicht ein.
Die praktischen Stufen, ohne Anspruch auf genaue GPU-Anzahlen:
| Präzision | Gewichtsbedarf (Berechnung) | Realistischer Einsatzort |
|---|---|---|
| BF16 | ~1.5 TB | Multi-Node-Cluster oder die größten Single-Server-GPU-Konfigurationen |
| FP8 (official) | ~745 GB | High-End Multi-GPU-Server, Single-Node |
| INT4-Klasse Community Quants | Bereich von ~370-400 GB | Kleinere Multi-GPU-Systeme; auf Qualitätsberichte warten |
Wenn Ihr Budget eine einzelne Consumer-GPU ist, sind die vollen Gewichte von GLM-5.3 nicht Ihr Ziel, und das ist in Ordnung. Mieten Sie GPU-Stunden für die Evaluierung, warten Sie auf aggressive Community-Quants oder behalten Sie das große Modell auf der gehosteten API, während Sie kleinere Open-Source-Modelle lokal ausführen. Unser Leitfaden zu den besten lokalen LLMs im Jahr 2026 behandelt, was heute in Budgets für Single-GPU und Workstations passt.
Behandeln Sie das 200K-Kontextfenster auch als Speicherentscheidung: Der KV-Cache wächst mit dem Kontext und der Batch-Größe. Begrenzen Sie daher den bereitgestellten Kontext pro Bereitstellungsebene vor dem Veröffentlichungstag, anstatt den Standardwert des Modelllimits zu verwenden.
Wählen Sie Ihren Serving-Stack, bevor die Gewichte verfügbar sind
Drei Familien von Serving-Software sind hier wichtig, und sie werden nicht alle gleichzeitig bereit sein.
vLLM ist die Standardantwort in diesem Maßstab: Unterstützung für die GLM-5-Familie seit der ursprünglichen Veröffentlichung, MoE-Routing, Tensor- und Experten-Parallelität über GPUs und Knoten hinweg sowie ein nativer OpenAI-kompatibler Server. Ein Startbefehl wird, sobald das Repo existiert, so aussehen:
vllm serve zai-org/GLM-5.3-FP8 \
--tensor-parallel-size 8 \
--max-model-len 65536 \
--served-model-name glm-5.3
Betrachten Sie die Flags als Vorlage: Der Repository-Name folgt Zhipus Namensmuster, und die Parallelitätseinstellungen hängen von Ihrer GPU-Anzahl und dem Speicher ab.
SGLang ist die Hauptalternative, mit starker MoE-Leistung und Radix-Tree-Prefix-Caching, das sich für Agenten-Workloads auszahlt, die lange gemeinsam genutzte Prompts erneut senden. Es stellt auch einen OpenAI-kompatiblen Endpunkt bereit, sodass ein späterer Wechsel zwischen den beiden den Client-Code nicht beeinflusst.
Die llama.cpp-Familie (llama.cpp, Ollama, LM Studio) benötigt GGUF-Konvertierungen, die Tage oder Wochen nach einem Safetensors-Drop aus der Community stammen. Dieser Weg bringt das Modell schließlich auf kleinere Hardware, und die Qualitätsstufen sollten Sie anhand Ihrer eigenen Baseline überprüfen, anstatt sie blind zu akzeptieren.
Installieren Sie diese Woche Ihren Stack und führen Sie einen Trockenlauf mit den öffentlichen Gewichten von GLM-5.2 durch, falls Sie die Hardware haben, oder mit einem kleineren MoE-Modell, falls nicht. Das Debuggen von CUDA-Treibern am 28. August ist ein vermeidbarer Fehlerfall.
Nutzen Sie die gehostete API heute als Ihre Baseline
Hier ist der Vorbereitungsschritt, den die meisten Teams überspringen: Bevor Sie ein Modell selbst hosten, zeichnen Sie auf, was die Referenzimplementierung produziert. Zhipus gehostete API ist diese Referenz, und sie ist jetzt live. Wenn Ihre lokale Bereitstellung anders antwortet, zeigt Ihnen eine gespeicherte Baseline, ob die Abweichung von Ihrer Quantisierungsentscheidung, einem Serving-Stack-Fehler oder normaler Stichprobenvarianz herrührt.
Die gehostete API ist OpenAI-kompatibel: https://api.z.ai/api/paas/v4/chat/completions international, https://open.bigmodel.cn/api/paas/v4/chat/completions für Festlandchina, Authentifizierung: Authorization: Bearer <key>. Die Z.ai-Dokumentation listet heute glm-5; glm-5.3 folgt der Familienkonvention, bestätigen Sie also den genauen String in den offiziellen Dokumenten. Die vollständige Einrichtung für beide Regionen finden Sie in unserem GLM-5.3 API Quickstart.
Erfassen Sie Baselines bei Temperatur 0 mit festen Prompts:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"temperature": 0,
"messages": [
{"role": "user", "content": "Write a Python function that parses RFC 3339 timestamps and returns UTC datetimes. Include error handling for invalid input."}
]
}' > baseline-rfc3339.json
Erstellen Sie 20 bis 50 solcher Baselines, die Ihre realen Workloads abdecken: Code-Generierungsaufgaben, Agenten-Tool-Call-Muster, Langkontext-Zusammenfassungen. Temperatur 0 wird die Ausgaben nicht perfekt reproduzierbar machen, aber sie reduziert die Varianz ausreichend, sodass ein quantisierungsbedingter Qualitätsverlust auffällt.
Erstellen Sie das Regressionstest-Framework in Apidog
Rohe cURL-Skripte funktionieren, bis Sie zwei Endpunkte, drei Quantisierungsstufen und einen Teamkollegen haben, der fragt, welche Konfiguration bestanden hat. Ein strukturiertes Framework skaliert besser, und dies ist ein Standard-API-Regressionsproblem, dieselbe Disziplin, die in unserem API-Testleitfaden für QA-Ingenieure behandelt wird.
Die Einrichtung in Apidog:
- Eine Sammlung, jeder Baseline-Prompt. Erstellen Sie eine Anfrage pro Baseline-Fall für den Chat-Completions-Pfad. Das OpenAI-kompatible Schema bedeutet, dass Sie eine OpenAI-Stil-Spezifikation importieren und die Anforderungsform kostenlos validieren lassen können.
- Zwei Umgebungen:
hostedundlocal.hostedsetzt die Basis-URL aufhttps://api.z.ai/api/paas/v4mit IhremGLM_API_KEY;localverweist aufhttp://localhost:8000/v1(vLLMs Standard) mit einem Platzhalter-Schlüssel. Jede Anfrage verweist auf{{base_url}}, sodass der Wechsel des Ziels ein einziger Dropdown-Vorgang ist. - Zusicherungen zuerst auf die Form, dann auf den Inhalt. Bestätigen Sie HTTP 200, einen nicht leeren
choices[0].message.contentund einen sinnvollenusage-Block. Fügen Sie für Code-Baselines Inhaltsprüfungen hinzu, die Wortlautabweichungen überstehen: Die Antwort enthältdef, erwähntdatetime, enthält eintry-Muster. - Speichern Sie gehostete Antworten als Beispiele. Diese werden zu Ihren Referenz-Fixtures. Am Veröffentlichungstag führen Sie die Sammlung erneut gegen
localaus und vergleichen sie. - Führen Sie es über die CLI aus. Apidogs Runner führt die Sammlung headless aus, sodass der Vergleich zu einem skriptfähigen Schritt wird, den Sie pro Quantisierungsstufe, Serving-Stack oder Konfigurationsänderung erneut ausführen können.
Die Ausgabe, die Sie bis zum 28. August wünschen, ist eine Ein-Befehl-Antwort auf die Frage „Verhält sich meine Bereitstellung wie das gehostete Modell?“, mit einem Bestanden/Nicht Bestanden pro Prompt statt nur Eindrücken.
Ihr Client-Code ändert sich nicht
Der Vorteil der OpenAI-kompatiblen Konvention: Anwendungen, die für die gehostete API geschrieben wurden, können mit einer Konfigurationsänderung, nicht mit einer Neufassung, zu Ihrem selbst gehosteten Endpunkt verschoben werden. Eine Umgebungsvariable steuert das Ziel:
import os
from openai import OpenAI
# Hosted: GLM_BASE_URL=https://api.z.ai/api/paas/v4
# Local: GLM_BASE_URL=http://localhost:8000/v1
client = OpenAI(
base_url=os.environ["GLM_BASE_URL"],
api_key=os.environ.get("GLM_API_KEY", "local-serving"),
)
response = client.chat.completions.create(
model="glm-5.3",
temperature=0,
messages=[
{"role": "user", "content": "Refactor this function to remove the nested loops: ..."},
],
)
print(response.choices[0].message.content)
vLLM und SGLang akzeptieren jeden Modellnamen, den Sie zur Servicezeit registriert haben, so dass --served-model-name glm-5.3 den Modellstring sogar identisch zur gehosteten ID hält. Streaming, Tool-Aufrufe und der JSON-Modus nutzen dieselbe Oberfläche, aber testen Sie Tool-Aufrufe speziell auf Regression: hier weichen lokale Stacks am häufigsten vom gehosteten Verhalten ab.
Kostenrahmen: gehostete API versus eigene GPUs
Zhipu hatte bei der Markteinführung keine 5.3-spezifischen API-Preise veröffentlicht; überprüfen Sie die offizielle Preisgestaltungsseite für aktuelle Zahlen, bevor Sie Kosten modellieren. Der Vergleich ist hier also strukturell, nicht pro Token.
Das Selbst-Hosting eines 744B-Klasse MoE bedeutet, für GPU-Kapazität zu zahlen, unabhängig davon, ob Tokens fließen. Dies rechnet sich in drei Situationen: eine so hohe kontinuierliche Auslastung, dass die Pro-Token-Gebühren die amortisierten Hardware- oder Mietkosten übersteigen würden, Daten-Governance, die Prompts innerhalb Ihres Netzwerks hält, und Latenz- oder Verfügbarkeitskontrolle, die eine geteilte API nicht garantieren kann. Darunter gewinnt das Hosting beim Preis, und das Mieten von GPU-Stunden für die Evaluierung schlägt den Kauf von Hardware für ein unvalidiertes Modell.
Es gibt auch ein Absicherungsargument. Anbieterpreise können sich ändern; DeepSeeks Preiserhöhung im Jahr 2026 traf Teams, die ihre Unit Economics auf den Einführungspreisen aufgebaut hatten, wie wir in unserer Analyse der DeepSeek API-Preiserhöhung behandelt haben. Offene Gewichte begrenzen dieses Risiko: Wenn sich die Hosting-Preise ändern, ist Ihr selbst gehosteter Weg bereits bewiesen.
Checkliste für den Veröffentlichungstag
Alles oben Genannte lässt sich auf diese Liste komprimieren. Die Punkte 1 bis 6 sind heute machbar.
- Bestätigen Sie Ihre Ziel-Präzisionsstufe (BF16, FP8 oder Warten auf Quants) anhand der Hardware, auf die Sie zugreifen können, unter Verwendung der oben genannten arithmetischen Bereiche.
- Installieren Sie vLLM oder SGLang und führen Sie einen Trockenlauf damit durch, unter Verwendung der öffentlichen Gewichte von GLM-5.2 oder eines anderen MoE-Modells.
- Erstellen Sie einen Z.ai API-Schlüssel und bestätigen Sie die genaue 5.3 Modell-ID anhand der Live-Dokumentation.
- Erfassen Sie 20 bis 50 Temperatur-0-Baseline-Antworten von der gehosteten API.
- Erstellen Sie die Apidog-Sammlung mit
hostedundlocalUmgebungen sowie Form-Assertions. - Legen Sie Ihre maximale bereitgestellte Kontextlänge pro Bereitstellungsstufe fest.
- Zur Veröffentlichung: Beobachten Sie huggingface.co/zai-org nach den Repositories
GLM-5.3undGLM-5.3-FP8und lesen Sie die Modellkartenlizenz, bevor Sie kommerziell bereitstellen. - Gewichte herunterladen, Server starten, die lokale Umgebung darauf zeigen lassen und die Sammlung ausführen.
- Vergleichen Sie lokal mit gehosteten Fixtures. Untersuchen Sie Fehler auf Inhaltsebene, bevor Sie den Traffic skalieren.
- Erst dann beginnen Sie mit dem Tuning: Quantisierungsstufe, Parallelitäts-Layout, Prefix-Caching, Kontextlimits.
FAQ
Kann ich GLM-5.3-Gewichte jetzt herunterladen?
Nein. Stand 14. August 2026 ist nur die gehostete API live. Zhipu gibt an, dass die offenen Gewichte etwa zwei Wochen nach der Veröffentlichung, um den 28. August, verfügbar sein werden. Das erwartete Ziel ist die zai-org Hugging Face-Seite, auf der GLM-5, 5.1 und 5.2 bereits zu finden sind.
Läuft GLM-5.3 auf einer einzelnen Consumer-GPU?
Nicht mit vollen Gewichten. Die 744 Milliarden Gesamtparameter der Familie entsprechen bei FP8 etwa 744 GB vor dem KV-Cache, weit jenseits jeder einzelnen Karte, und selbst INT4-Klasse-Quants landen im Multi-GPU-Bereich. Für Single-GPU-Budgets führen Sie kleinere Open-Modelle lokal aus und belassen GLM-5.3 auf der gehosteten API; unsere Übersicht über lokale LLMs listet auf, was passt.
Welches Serving-Framework sollte ich für GLM-5.3 verwenden?
vLLM ist die sicherste Standardoption: bewährte GLM-5-Familienunterstützung, MoE-bewusste Parallelisierung und ein OpenAI-kompatibler Server. SGLang ist eine starke Alternative, wenn Ihr Workload lange gemeinsam genutzte Präfixe erneut sendet, wie es bei Agentenschleifen der Fall ist. Der Weg über llama.cpp und Ollama öffnet sich später, sobald Community-GGUF-Konvertierungen verfügbar sind.
Wird mein bestehender OpenAI SDK-Code mit einem selbst gehosteten GLM-5.3 funktionieren?
Ja, das ist der Sinn der OpenAI-kompatiblen Konvention auf beiden Seiten. Richten Sie die base_url des SDK auf Ihren vLLM- oder SGLang-Server statt auf https://api.z.ai/api/paas/v4 und behalten Sie dieselbe Anforderungsform bei. Testen Sie insbesondere Tool-Calling und Streaming; das sind die Bereiche, in denen lokale Stacks gelegentlich vom gehosteten Verhalten abweichen.
Warum sich mit der gehosteten API beschäftigen, wenn ich selbst hosten möchte?
Weil es Ihre Referenzimplementierung ist. Ohne gehostete Baselines können Sie nicht feststellen, ob eine seltsame lokale Ausgabe bedeutet, dass Ihre Quantisierung zu aggressiv ist oder das Modell sich überall so verhält. Erfassen Sie jetzt Baselines über den gehosteten Endpunkt, verwenden Sie die Einrichtung in unserem GLM-5.3 API Quickstart, und der Veröffentlichungstag wird zu einer Vergleichsübung statt zu Rätselraten.
Wo GLM-5.3 in Ihrem Stack passt
GLM-5.3 ist die bisher stärkste Ankündigung offener Gewichte für die Codierung in diesem Jahr: Erster unter den offenen Modellen auf Terminal-Bench 3.0 und Agents' Last Exam, ein CyberGym-Score über zwei Frontier-Modellen und Gewichte, die nach einem öffentlichen Zeitplan eintreffen. Die Teams, die in der ersten Woche Wert daraus ziehen, werden nicht diejenigen mit den größten GPU-Budgets sein. Es werden diejenigen sein, die das zweiwöchige Fenster für die undankbare Arbeit genutzt haben: Stack installiert, Präzisionsstufe gewählt, Baselines erfasst, Framework bereit.
Beginnen Sie mit der obigen Checkliste. Erfassen Sie diese Woche Ihre gehosteten Baselines, und laden Sie Apidog herunter, um sie zu speichern: eine Sammlung, eine hosted und eine local Umgebung und Zusicherungen, die „Funktioniert meine Bereitstellung?“ in einen Bestanden/Nicht Bestanden-Bericht verwandeln, den Sie jedes Mal neu ausführen können, wenn Sie eine Quantisierungsstufe oder ein Serving-Flag ändern.
