GLM-5.3 Self-Hosting: Bereit für die Open-Weights Freigabe

GLM-5.3 Open Weights erscheinen um den 28. August. Vorbereitungsleitfaden: Hardware-Dimensionierung für das 744B MoE, vLLM- und SGLang-Einrichtung sowie eine Vergleichs-Baseline für gehostete vs. lokale Regression in Apidog.

Ashley Innocent

Ashley Innocent

16 August 2026

GLM-5.3 Self-Hosting: Bereit für die Open-Weights Freigabe

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Zhipu AI hat GLM-5.3 am 14. August 2026 veröffentlicht, und in der Berichterstattung über den Start findet sich die für Infrastrukturteams wichtigste Zeile: Die offenen Gewichte kommen etwa zwei Wochen später, um den 28. August, in Zhipus Hugging Face Organisation. Diese Lücke ist ein Geschenk. Sie gibt Ihnen Zeit, die Hardware zu bemessen, einen Serving-Stack auszuwählen und eine Regressions-Baseline gegen die gehostete API zu erfassen, bevor ein einzelner Safetensors-Shard öffentlich wird.

Das Modell ist die Vorarbeit wert. Zhipus interne Bewertungen attestieren der Codierungsfähigkeit eine 50%ige Verbesserung gegenüber GLM-5.2, Terminal-Bench 3.0 sprang von 4.6 auf 28.3, und das Unternehmen beschreibt die Agentenleistung als "nahezu Claude Fable 5", laut Startberichten. Die vollständige Benchmark-Geschichte, einschließlich der Punkte, an denen es noch hinter den Spitzenmodellen zurückbleibt, finden Sie in unserem GLM-5.3 Erklärer. Dieser Artikel konzentriert sich auf eine Frage: Was muss am Tag der Veröffentlichung vorhanden sein, damit Sie GLM-5.3 selbst bereitstellen können?

Zur Klarstellung: Die Gewichte sind heute noch nicht herunterladbar. Alles Weitere bezieht sich auf das Veröffentlichungsfenster, und alles, was Zhipu nicht bestätigt hat, ist als Erwartung und nicht als Tatsache gekennzeichnet. Was Sie jetzt tun können, ist, eine Baseline zu erstellen, und das läuft über Apidog: Erfassen Sie diese Woche Schnappschüsse von gehosteten API-Antworten und spielen Sie dieselbe Sammlung später gegen Ihren lokalen Endpunkt ab.

Button

TL;DR

Was Zhipu wann veröffentlicht

Zhipu (international als Z.ai vermarktet) verband die Einführung der GLM-5.3 API mit dem Versprechen, die Gewichte nach zwei Wochen offenzulegen: Das Modell wird um den 28. August 2026 auf Hugging Face verfügbar sein. Die Verzögerung ist nicht willkürlich. Zhipu gibt an, für diese Veröffentlichung sein bisher umfangreichstes Risikoprüfungssystem entwickelt zu haben, bemerkenswert angesichts der 84,5 % des Modells auf CyberGym, etwas über Claude Mythos 5 und GPT-5.6 Sol. Seeking Alpha deutet die Veröffentlichung als Zhipus Versuch, die Führung bei offenen Modellen zu behaupten, die es das ganze Jahr über mit DeepSeek geteilt hat.

Zwei Details der Veröffentlichung sind für Self-Hoster wichtig:

  1. Das Basismodell ist unverändert. GLM-5.3 ist die GLM-5-Basis mit skaliertem Post-Training. Die Architektur, die Ihr Serving-Stack benötigt, ist dieselbe, die vLLM und SGLang bereits für GLM-5 und GLM-5.2 verwenden. Es werden keine neuen Aufmerksamkeitsvarianten oder Tokenizer-Überraschungen erwartet.
  2. Das Veröffentlichungsmuster ist etabliert. Zhipus Hugging Face Organisation hostet GLM-5, GLM-5.1 und GLM-5.2, jeweils mit einem zugehörigen FP8-Repo. GLM-5.2 allein verzeichnet 2,69 Millionen Downloads. Erwarten Sie dieselbe Struktur für 5.3: eine BF16 Safetensors-Veröffentlichung plus eine offizielle FP8-Variante.

Die Lizenzbedingungen für 5.3 wurden in der Startberichterstattung nicht bestätigt. Überprüfen Sie die Modellkarte, sobald das Repo erscheint, bevor Sie es in ein kommerzielles Produkt integrieren.

Was 744 Mrd. insgesamt, 40 Mrd. aktiv für Ihre Hardware bedeutet

Die GLM-5-Familie ist ein Mixture-of-Experts-Design: 744 Milliarden Gesamtparameter, etwa 40 Milliarden aktiv pro Vorwärtsdurchlauf, 200K Kontext, gemäß Z.ai-Dokumentation (Hugging Face Repositories listen leicht höhere Gesamtzahlen auf, die Embeddings einschließen). Dies sind Familienspezifikationen, keine 5.3-spezifischen Angaben, aber da das Basismodell unverändert ist, sind dies die richtigen Planungszahlen.

Die MoE-Aufteilung erzeugt eine Asymmetrie zwischen Speicher und Rechenleistung:

Die praktischen Stufen, ohne Anspruch auf genaue GPU-Anzahlen:

Präzision Gewichtsbedarf (Berechnung) Realistischer Einsatzort
BF16 ~1.5 TB Multi-Node-Cluster oder die größten Single-Server-GPU-Konfigurationen
FP8 (official) ~745 GB High-End Multi-GPU-Server, Single-Node
INT4-Klasse Community Quants Bereich von ~370-400 GB Kleinere Multi-GPU-Systeme; auf Qualitätsberichte warten

Wenn Ihr Budget eine einzelne Consumer-GPU ist, sind die vollen Gewichte von GLM-5.3 nicht Ihr Ziel, und das ist in Ordnung. Mieten Sie GPU-Stunden für die Evaluierung, warten Sie auf aggressive Community-Quants oder behalten Sie das große Modell auf der gehosteten API, während Sie kleinere Open-Source-Modelle lokal ausführen. Unser Leitfaden zu den besten lokalen LLMs im Jahr 2026 behandelt, was heute in Budgets für Single-GPU und Workstations passt.

Behandeln Sie das 200K-Kontextfenster auch als Speicherentscheidung: Der KV-Cache wächst mit dem Kontext und der Batch-Größe. Begrenzen Sie daher den bereitgestellten Kontext pro Bereitstellungsebene vor dem Veröffentlichungstag, anstatt den Standardwert des Modelllimits zu verwenden.

Wählen Sie Ihren Serving-Stack, bevor die Gewichte verfügbar sind

Drei Familien von Serving-Software sind hier wichtig, und sie werden nicht alle gleichzeitig bereit sein.

vLLM ist die Standardantwort in diesem Maßstab: Unterstützung für die GLM-5-Familie seit der ursprünglichen Veröffentlichung, MoE-Routing, Tensor- und Experten-Parallelität über GPUs und Knoten hinweg sowie ein nativer OpenAI-kompatibler Server. Ein Startbefehl wird, sobald das Repo existiert, so aussehen:

vllm serve zai-org/GLM-5.3-FP8 \
  --tensor-parallel-size 8 \
  --max-model-len 65536 \
  --served-model-name glm-5.3

Betrachten Sie die Flags als Vorlage: Der Repository-Name folgt Zhipus Namensmuster, und die Parallelitätseinstellungen hängen von Ihrer GPU-Anzahl und dem Speicher ab.

SGLang ist die Hauptalternative, mit starker MoE-Leistung und Radix-Tree-Prefix-Caching, das sich für Agenten-Workloads auszahlt, die lange gemeinsam genutzte Prompts erneut senden. Es stellt auch einen OpenAI-kompatiblen Endpunkt bereit, sodass ein späterer Wechsel zwischen den beiden den Client-Code nicht beeinflusst.

Die llama.cpp-Familie (llama.cpp, Ollama, LM Studio) benötigt GGUF-Konvertierungen, die Tage oder Wochen nach einem Safetensors-Drop aus der Community stammen. Dieser Weg bringt das Modell schließlich auf kleinere Hardware, und die Qualitätsstufen sollten Sie anhand Ihrer eigenen Baseline überprüfen, anstatt sie blind zu akzeptieren.

Installieren Sie diese Woche Ihren Stack und führen Sie einen Trockenlauf mit den öffentlichen Gewichten von GLM-5.2 durch, falls Sie die Hardware haben, oder mit einem kleineren MoE-Modell, falls nicht. Das Debuggen von CUDA-Treibern am 28. August ist ein vermeidbarer Fehlerfall.

Nutzen Sie die gehostete API heute als Ihre Baseline

Hier ist der Vorbereitungsschritt, den die meisten Teams überspringen: Bevor Sie ein Modell selbst hosten, zeichnen Sie auf, was die Referenzimplementierung produziert. Zhipus gehostete API ist diese Referenz, und sie ist jetzt live. Wenn Ihre lokale Bereitstellung anders antwortet, zeigt Ihnen eine gespeicherte Baseline, ob die Abweichung von Ihrer Quantisierungsentscheidung, einem Serving-Stack-Fehler oder normaler Stichprobenvarianz herrührt.

Die gehostete API ist OpenAI-kompatibel: https://api.z.ai/api/paas/v4/chat/completions international, https://open.bigmodel.cn/api/paas/v4/chat/completions für Festlandchina, Authentifizierung: Authorization: Bearer <key>. Die Z.ai-Dokumentation listet heute glm-5; glm-5.3 folgt der Familienkonvention, bestätigen Sie also den genauen String in den offiziellen Dokumenten. Die vollständige Einrichtung für beide Regionen finden Sie in unserem GLM-5.3 API Quickstart.

Erfassen Sie Baselines bei Temperatur 0 mit festen Prompts:

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "temperature": 0,
    "messages": [
      {"role": "user", "content": "Write a Python function that parses RFC 3339 timestamps and returns UTC datetimes. Include error handling for invalid input."}
    ]
  }' > baseline-rfc3339.json

Erstellen Sie 20 bis 50 solcher Baselines, die Ihre realen Workloads abdecken: Code-Generierungsaufgaben, Agenten-Tool-Call-Muster, Langkontext-Zusammenfassungen. Temperatur 0 wird die Ausgaben nicht perfekt reproduzierbar machen, aber sie reduziert die Varianz ausreichend, sodass ein quantisierungsbedingter Qualitätsverlust auffällt.

Erstellen Sie das Regressionstest-Framework in Apidog

Rohe cURL-Skripte funktionieren, bis Sie zwei Endpunkte, drei Quantisierungsstufen und einen Teamkollegen haben, der fragt, welche Konfiguration bestanden hat. Ein strukturiertes Framework skaliert besser, und dies ist ein Standard-API-Regressionsproblem, dieselbe Disziplin, die in unserem API-Testleitfaden für QA-Ingenieure behandelt wird.

Die Einrichtung in Apidog:

  1. Eine Sammlung, jeder Baseline-Prompt. Erstellen Sie eine Anfrage pro Baseline-Fall für den Chat-Completions-Pfad. Das OpenAI-kompatible Schema bedeutet, dass Sie eine OpenAI-Stil-Spezifikation importieren und die Anforderungsform kostenlos validieren lassen können.
  2. Zwei Umgebungen: hosted und local. hosted setzt die Basis-URL auf https://api.z.ai/api/paas/v4 mit Ihrem GLM_API_KEY; local verweist auf http://localhost:8000/v1 (vLLMs Standard) mit einem Platzhalter-Schlüssel. Jede Anfrage verweist auf {{base_url}}, sodass der Wechsel des Ziels ein einziger Dropdown-Vorgang ist.
  3. Zusicherungen zuerst auf die Form, dann auf den Inhalt. Bestätigen Sie HTTP 200, einen nicht leeren choices[0].message.content und einen sinnvollen usage-Block. Fügen Sie für Code-Baselines Inhaltsprüfungen hinzu, die Wortlautabweichungen überstehen: Die Antwort enthält def, erwähnt datetime, enthält ein try-Muster.
  4. Speichern Sie gehostete Antworten als Beispiele. Diese werden zu Ihren Referenz-Fixtures. Am Veröffentlichungstag führen Sie die Sammlung erneut gegen local aus und vergleichen sie.
  5. Führen Sie es über die CLI aus. Apidogs Runner führt die Sammlung headless aus, sodass der Vergleich zu einem skriptfähigen Schritt wird, den Sie pro Quantisierungsstufe, Serving-Stack oder Konfigurationsänderung erneut ausführen können.

Die Ausgabe, die Sie bis zum 28. August wünschen, ist eine Ein-Befehl-Antwort auf die Frage „Verhält sich meine Bereitstellung wie das gehostete Modell?“, mit einem Bestanden/Nicht Bestanden pro Prompt statt nur Eindrücken.

Ihr Client-Code ändert sich nicht

Der Vorteil der OpenAI-kompatiblen Konvention: Anwendungen, die für die gehostete API geschrieben wurden, können mit einer Konfigurationsänderung, nicht mit einer Neufassung, zu Ihrem selbst gehosteten Endpunkt verschoben werden. Eine Umgebungsvariable steuert das Ziel:

import os
from openai import OpenAI

# Hosted:  GLM_BASE_URL=https://api.z.ai/api/paas/v4
# Local:   GLM_BASE_URL=http://localhost:8000/v1
client = OpenAI(
    base_url=os.environ["GLM_BASE_URL"],
    api_key=os.environ.get("GLM_API_KEY", "local-serving"),
)

response = client.chat.completions.create(
    model="glm-5.3",
    temperature=0,
    messages=[
        {"role": "user", "content": "Refactor this function to remove the nested loops: ..."},
    ],
)
print(response.choices[0].message.content)

vLLM und SGLang akzeptieren jeden Modellnamen, den Sie zur Servicezeit registriert haben, so dass --served-model-name glm-5.3 den Modellstring sogar identisch zur gehosteten ID hält. Streaming, Tool-Aufrufe und der JSON-Modus nutzen dieselbe Oberfläche, aber testen Sie Tool-Aufrufe speziell auf Regression: hier weichen lokale Stacks am häufigsten vom gehosteten Verhalten ab.

Kostenrahmen: gehostete API versus eigene GPUs

Zhipu hatte bei der Markteinführung keine 5.3-spezifischen API-Preise veröffentlicht; überprüfen Sie die offizielle Preisgestaltungsseite für aktuelle Zahlen, bevor Sie Kosten modellieren. Der Vergleich ist hier also strukturell, nicht pro Token.

Das Selbst-Hosting eines 744B-Klasse MoE bedeutet, für GPU-Kapazität zu zahlen, unabhängig davon, ob Tokens fließen. Dies rechnet sich in drei Situationen: eine so hohe kontinuierliche Auslastung, dass die Pro-Token-Gebühren die amortisierten Hardware- oder Mietkosten übersteigen würden, Daten-Governance, die Prompts innerhalb Ihres Netzwerks hält, und Latenz- oder Verfügbarkeitskontrolle, die eine geteilte API nicht garantieren kann. Darunter gewinnt das Hosting beim Preis, und das Mieten von GPU-Stunden für die Evaluierung schlägt den Kauf von Hardware für ein unvalidiertes Modell.

Es gibt auch ein Absicherungsargument. Anbieterpreise können sich ändern; DeepSeeks Preiserhöhung im Jahr 2026 traf Teams, die ihre Unit Economics auf den Einführungspreisen aufgebaut hatten, wie wir in unserer Analyse der DeepSeek API-Preiserhöhung behandelt haben. Offene Gewichte begrenzen dieses Risiko: Wenn sich die Hosting-Preise ändern, ist Ihr selbst gehosteter Weg bereits bewiesen.

Checkliste für den Veröffentlichungstag

Alles oben Genannte lässt sich auf diese Liste komprimieren. Die Punkte 1 bis 6 sind heute machbar.

  1. Bestätigen Sie Ihre Ziel-Präzisionsstufe (BF16, FP8 oder Warten auf Quants) anhand der Hardware, auf die Sie zugreifen können, unter Verwendung der oben genannten arithmetischen Bereiche.
  2. Installieren Sie vLLM oder SGLang und führen Sie einen Trockenlauf damit durch, unter Verwendung der öffentlichen Gewichte von GLM-5.2 oder eines anderen MoE-Modells.
  3. Erstellen Sie einen Z.ai API-Schlüssel und bestätigen Sie die genaue 5.3 Modell-ID anhand der Live-Dokumentation.
  4. Erfassen Sie 20 bis 50 Temperatur-0-Baseline-Antworten von der gehosteten API.
  5. Erstellen Sie die Apidog-Sammlung mit hosted und local Umgebungen sowie Form-Assertions.
  6. Legen Sie Ihre maximale bereitgestellte Kontextlänge pro Bereitstellungsstufe fest.
  7. Zur Veröffentlichung: Beobachten Sie huggingface.co/zai-org nach den Repositories GLM-5.3 und GLM-5.3-FP8 und lesen Sie die Modellkartenlizenz, bevor Sie kommerziell bereitstellen.
  8. Gewichte herunterladen, Server starten, die lokale Umgebung darauf zeigen lassen und die Sammlung ausführen.
  9. Vergleichen Sie lokal mit gehosteten Fixtures. Untersuchen Sie Fehler auf Inhaltsebene, bevor Sie den Traffic skalieren.
  10. Erst dann beginnen Sie mit dem Tuning: Quantisierungsstufe, Parallelitäts-Layout, Prefix-Caching, Kontextlimits.

FAQ

Kann ich GLM-5.3-Gewichte jetzt herunterladen?

Nein. Stand 14. August 2026 ist nur die gehostete API live. Zhipu gibt an, dass die offenen Gewichte etwa zwei Wochen nach der Veröffentlichung, um den 28. August, verfügbar sein werden. Das erwartete Ziel ist die zai-org Hugging Face-Seite, auf der GLM-5, 5.1 und 5.2 bereits zu finden sind.

Läuft GLM-5.3 auf einer einzelnen Consumer-GPU?

Nicht mit vollen Gewichten. Die 744 Milliarden Gesamtparameter der Familie entsprechen bei FP8 etwa 744 GB vor dem KV-Cache, weit jenseits jeder einzelnen Karte, und selbst INT4-Klasse-Quants landen im Multi-GPU-Bereich. Für Single-GPU-Budgets führen Sie kleinere Open-Modelle lokal aus und belassen GLM-5.3 auf der gehosteten API; unsere Übersicht über lokale LLMs listet auf, was passt.

Welches Serving-Framework sollte ich für GLM-5.3 verwenden?

vLLM ist die sicherste Standardoption: bewährte GLM-5-Familienunterstützung, MoE-bewusste Parallelisierung und ein OpenAI-kompatibler Server. SGLang ist eine starke Alternative, wenn Ihr Workload lange gemeinsam genutzte Präfixe erneut sendet, wie es bei Agentenschleifen der Fall ist. Der Weg über llama.cpp und Ollama öffnet sich später, sobald Community-GGUF-Konvertierungen verfügbar sind.

Wird mein bestehender OpenAI SDK-Code mit einem selbst gehosteten GLM-5.3 funktionieren?

Ja, das ist der Sinn der OpenAI-kompatiblen Konvention auf beiden Seiten. Richten Sie die base_url des SDK auf Ihren vLLM- oder SGLang-Server statt auf https://api.z.ai/api/paas/v4 und behalten Sie dieselbe Anforderungsform bei. Testen Sie insbesondere Tool-Calling und Streaming; das sind die Bereiche, in denen lokale Stacks gelegentlich vom gehosteten Verhalten abweichen.

Warum sich mit der gehosteten API beschäftigen, wenn ich selbst hosten möchte?

Weil es Ihre Referenzimplementierung ist. Ohne gehostete Baselines können Sie nicht feststellen, ob eine seltsame lokale Ausgabe bedeutet, dass Ihre Quantisierung zu aggressiv ist oder das Modell sich überall so verhält. Erfassen Sie jetzt Baselines über den gehosteten Endpunkt, verwenden Sie die Einrichtung in unserem GLM-5.3 API Quickstart, und der Veröffentlichungstag wird zu einer Vergleichsübung statt zu Rätselraten.

Wo GLM-5.3 in Ihrem Stack passt

GLM-5.3 ist die bisher stärkste Ankündigung offener Gewichte für die Codierung in diesem Jahr: Erster unter den offenen Modellen auf Terminal-Bench 3.0 und Agents' Last Exam, ein CyberGym-Score über zwei Frontier-Modellen und Gewichte, die nach einem öffentlichen Zeitplan eintreffen. Die Teams, die in der ersten Woche Wert daraus ziehen, werden nicht diejenigen mit den größten GPU-Budgets sein. Es werden diejenigen sein, die das zweiwöchige Fenster für die undankbare Arbeit genutzt haben: Stack installiert, Präzisionsstufe gewählt, Baselines erfasst, Framework bereit.

Beginnen Sie mit der obigen Checkliste. Erfassen Sie diese Woche Ihre gehosteten Baselines, und laden Sie Apidog herunter, um sie zu speichern: eine Sammlung, eine hosted und eine local Umgebung und Zusicherungen, die „Funktioniert meine Bereitstellung?“ in einen Bestanden/Nicht Bestanden-Bericht verwandeln, den Sie jedes Mal neu ausführen können, wenn Sie eine Quantisierungsstufe oder ein Serving-Flag ändern.

Button

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen