GLM-5.2 ist eines der wenigen Modelle der Spitzenklasse, die Sie tatsächlich auf Ihrer eigenen Hardware ausführen können. Es wird als offene Gewichte unter einer MIT-Lizenz und ohne regionale Beschränkungen geliefert, daher ist die „uneingeschränkte Nutzung“ kein Hack. Es ist ein unterstützter Weg. Der Trick besteht darin, zu wissen, auf welche Beschränkung Sie tatsächlich stoßen, da die Lösung für jede einzelne anders ist.
TL;DR
- GLM-5.2 (Z.ai / Zhipu AI) verwendet offene Gewichte, hat ungefähr 753B Parameter (MoE), ist MIT-lizenziert, bietet einen 1M Token-Kontext und ist nicht regional gesperrt.
- Die meisten „Einschränkungen“ stammen von der Benutzeroberfläche des Verbraucher-Chats oder der Instruktionsabstimmung des Modells, nicht von einer harten Lizenzbeschränkung.
- Der Zugriff über die rohe API gibt Ihnen die Kontrolle über den System-Prompt und ermöglicht es Ihnen, das „Denken“ (thinking) zu deaktivieren. Eigenes Hosting gibt Ihnen die volle Kontrolle über den Stack.
- Von der Community bereinigte (abliterated) Builds entfernen integrierte Ablehnungen, das gleiche Muster, das für DeepSeek R1 und QwQ verwendet wird. Die Verfügbarkeit für 5.2 ändert sich wöchentlich, prüfen Sie dies daher auf Hugging Face.
- Sie tragen weiterhin die Verantwortung für Moderation und rechtliche Aspekte, sobald Sie selbst hosten. Weniger Leitplanken bedeuten mehr Verantwortung, nicht weniger.
Zuerst: Wissen Sie, auf welche Einschränkung Sie stoßen
„Einschränkungen“ ist ein dehnbarer Begriff. Für GLM-5.2 bedeutet es normalerweise eines von vier verschiedenen Dingen, und jedes hat seine eigene Lösung.
- Ablehnungen durch Instruktionsabstimmung. Das veröffentlichte Chat-Modell ist darauf abgestimmt, einige Anfragen abzulehnen. Dieses Verhalten ist in den Gewichten verankert.
- Produktfilter in der Chat-App. Die Web-Benutzeroberfläche für Endverbraucher kann eine eigene Moderationsschicht zusätzlich zum Modell hinzufügen. Die API verhält sich oft anders als die App.
- Plan- und Ratenbegrenzungen. Kostenlose Tarife und Coding Plan-Tarife begrenzen Anfragen, Kontext oder Ausgabe. Das ist ein Kontingent, keine Inhaltsregel.
- Overhead für Denkvorgänge und Sicherheitsrouting. Erweiterte Schlussfolgerungen und Sicherheitsrouting erhöhen die Latenz und können den Ton beeinflussen.
Die Region ist bewusst nicht auf dieser Liste. Die GLM-5.2-Gewichte sind MIT-lizenziert und unterliegen keinen regionalen Beschränkungen, sodass der Zugang nicht wie bei einigen ausschließlich gehosteten Modellen länderspezifisch gesperrt ist.
Hebel 1: Nutzen Sie die Roh-API, nicht die Chat-App
Die schnellste Änderung mit dem größten Nutzen ist, das Verbraucher-Chatfenster nicht mehr zu verwenden und die API direkt aufzurufen. Der Endpunkt ist OpenAI-kompatibel, sodass Sie Ihren eigenen System-Prompt beibehalten, Ihre eigene Temperatur einstellen und die Denkphase deaktivieren können.
- Basis-URL:
https://api.z.ai/api/paas/v4/ - Endpunkt:
POST /chat/completions - Modell-ID:
glm-5.2
Ein minimaler curl-Aufruf mit deaktiviertem „Denken“:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"thinking": { "type": "disabled" },
"temperature": 0.7,
"messages": [
{ "role": "system", "content": "Sie sind ein direkter, ungefilterter technischer Assistent. Antworten Sie prägnant." },
{ "role": "user", "content": "Explain how abliteration changes a model." }
]
}'
Der gleiche Aufruf mit dem OpenAI Python SDK, nur auf z.ai umgeleitet:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_ZAI_KEY",
base_url="https://api.z.ai/api/paas/v4/",
)
resp = client.chat.completions.create(
model="glm-5.2",
temperature=0.7,
extra_body={"thinking": {"type": "disabled"}},
messages=[
{"role": "system", "content": "Sie sind ein direkter, ungefilterter technischer Assistent."},
{"role": "user", "content": "Explain how abliteration changes a model."},
],
)
print(resp.choices[0].message.content)
Zwei Dinge sind hier wichtig. Ihr System-Prompt gehört Ihnen, sodass Sie Ton und Umfang direkt steuern, anstatt die Standardeinstellungen der App zu übernehmen. Und thinking: {"type": "disabled"} überspringt den Denkprozess, wenn Sie eine rohe, schnelle Ausgabe wünschen. Für den vollständigen Parametersatz siehe den GLM-5.2 API-Leitfaden.
Die Preise ändern sich, überprüfen Sie diese daher live, bevor Sie Ihr Budget planen: Zum Zeitpunkt des Verfassens dieses Artikels listen sekundäre Quellen etwa 1,40 $ pro 1M Eingabe-Tokens und 4,40 $ pro 1M Ausgabe auf. Bestätigen Sie die aktuellen Zahlen in der GLM-5.2 Preisübersicht, und wenn die Kosten die eigentliche Einschränkung sind, lesen Sie, wie man GLM-5.2 kostenlos nutzen kann.
Hebel 2: Die offenen Gewichte selbst hosten
Dies ist die eigentliche Antwort auf „keine Einschränkungen“. Da die Gewichte MIT-lizenziert sind, können Sie GLM-5.2 selbst herunterladen und bereitstellen. Wenn das Modell auf Ihrem Computer läuft, gibt es keinen UI-Filter des Anbieters und keine externen Ratenbegrenzungen. Sie legen den System-Prompt fest, Sie legen die Richtlinie fest.
Der einfachste Weg ist Ollama:
ollama run glm-5.2
Hardware-Realitätscheck: GLM-5.2 ist ein MoE-Modell mit ungefähr 753B Parametern, daher benötigen die vollständigen Gewichte erheblichen VRAM. Für die meisten Leute bedeutet das einen quantisierten Build, eine gemietete Multi-GPU-Box oder eine kleinere GLM-Variante. Wenn Ihre Hardware bescheiden ist, läuft GLM-4.7-Flash lokal mit weitaus weniger Ressourcen und ist ein guter Ersatz, während Sie die Pipeline aufbauen. Der allgemeine Leitfaden zum lokalen Ausführen von GLM und die Ollama-Einrichtungserklärung decken den Rest ab.
Sobald es lokal läuft, stellt Ollama seinen eigenen OpenAI-kompatiblen Endpunkt unter http://localhost:11434/v1 bereit, sodass der gleiche Code aus Hebel 1 funktioniert, indem nur die Basis-URL geändert wird.
Hebel 3: Von der Community bereitgestellte unzensierte (bereinigte) Builds
Die Instruktionsabstimmung ist der Ort, an dem Ablehnungen entstehen. Die Open-Source-Community entfernt dieses Verhalten durch einen Prozess namens Abliterierung (Bereinigung), der die interne Anweisung unterdrückt, die eine Ablehnung auslöst, ohne ein vollständiges Retraining. Die gleiche Technik ermöglicht unzensierte Builds anderer offener Modelle, einschließlich QwQ und DeepSeek R1.
Da die GLM-5.2-Gewichte offen und MIT-lizenziert sind, gilt diese Technik auch hier. Ein fertiger, bereinigter (abliterated) GLM-5.2-Build ist möglicherweise noch nicht garantiert verfügbar, und die Verfügbarkeit ändert sich häufig, suchen Sie daher auf Hugging Face nach einer aktuellen Version, anstatt davon auszugehen, dass sie existiert. Wenn kein 5.2-Build verfügbar ist, ist der Workflow identisch mit den Anleitungen für QwQ und DeepSeek R1: Laden Sie die bereinigten Gewichte herunter, laden Sie sie in Ollama oder vLLM und stellen Sie sie bereit.
Dies ist der vollständigste Weg, integrierte Ablehnungen zu entfernen, und es ist auch derjenige, der Ihnen die größte Verantwortung auferlegt. Lesen Sie den Abschnitt zur Verantwortung, bevor Sie es in Betrieb nehmen.
Hebel 4: Wählen Sie einen Anbieter, der es Ihnen ermöglicht, Richtlinien festzulegen
Wenn Sie Ihre eigene Box nicht betreiben möchten, ist ein Routing-Anbieter der Mittelweg. GLM-5.2 ist auf OpenRouter als z-ai/glm-5.2 und in der Ollama-Bibliothek gelistet. Ein Router ermöglicht es Ihnen, Ihre eigenen Moderationseinstellungen anzuwenden und den zugrunde liegenden Host zu wechseln, ohne Ihre App neu schreiben zu müssen, was den Consumer-UI-Filter umgeht und gleichzeitig einen verwalteten Endpunkt beibehält.
Dieser Artikel steht neben der umfassenderen Übersicht über LLMs ohne Einschränkungen, falls Sie GLM-5.2 vor einer Festlegung mit anderen offenen Optionen vergleichen möchten.
Testen Sie jede Einrichtung in Apidog, bevor Sie sie bereitstellen
Welchen Hebel Sie auch wählen, Sie erhalten einen OpenAI-kompatiblen Endpunkt. Bestätigen Sie, dass er sich wie erwartet verhält, bevor Sie ihn in ein Produkt integrieren. Apidog ist eine saubere Möglichkeit dazu, da Sie die rohe Streaming-Antwort und nicht nur den endgültigen Text überprüfen können.

- Erstellen Sie eine neue Anfrage in Apidog, die auf Ihren Endpunkt zeigt (
https://api.z.ai/api/paas/v4/chat/completionsfür die gehostete API oderhttp://localhost:11434/v1/chat/completionsfür einen lokalen Build). - Fügen Sie den Header
Authorization: Bearer <key>für die gehostete API hinzu. Lokales Ollama benötigt keinen Schlüssel. - Senden Sie einen
chat/completions-Body mitmodel: glm-5.2, Ihrersystem-Nachricht undstream: true. - Beobachten Sie den SSE-Stream. Sie können die „Denken“-Deltas und die Inhalts-Deltas separat sehen, sowie das
usage-Objekt mit Token-Zählungen. - Schalten Sie „Denken“ ein und aus und vergleichen Sie die beiden Antworten nebeneinander.
So überprüfen Sie, ob Ihr System-Prompt tatsächlich wirksam wurde und dass das Modell so reagiert, wie es Ihre gewählte Einrichtung verspricht, anstatt es erst in der Produktion herauszufinden.
Ein Wort zur Verantwortung
Das Entfernen von Produktfiltern und das Ausführen unzensierter Gewichte ist legitim. Es ist üblich für Forschung, Red-Teaming und den Aufbau einer eigenen Moderation, anstatt die eines anderen zu übernehmen. Aber sobald Sie selbst hosten, liegt die Moderation bei Ihnen, ebenso wie das rechtliche Risiko. Weniger Leitplanken bedeuten, dass Sie für das Ergebnis verantwortlich sind. Beachten Sie drei Dinge:
- Sie sind weiterhin an das Gesetz und die Bedingungen jeder Plattform gebunden, auf der Sie bereitstellen.
- Wenn Sie dies anderen Menschen zur Verfügung stellen, fügen Sie eine Moderationsschicht hinzu, die auf Ihre Benutzer zugeschnitten ist.
- „Ohne Einschränkungen“ bezieht sich auf die Kontrolle und das Reduzieren von falsch-positiven Ablehnungen, nicht auf eine Lizenz zur Generierung schädlicher oder illegaler Inhalte.
FAQ
Ist GLM-5.2 wirklich Open Source?
Die Gewichte werden unter einer MIT-Lizenz veröffentlicht, einer der freizügigsten verfügbaren Lizenzen. Sie können sie ausführen, modifizieren und selbst hosten, auch für kommerzielle Zwecke, vorbehaltlich der Lizenzbedingungen. Eine vollständige Identität und Spezifikationen finden Sie unter Was ist GLM-5.2.
Zensiert die GLM-5.2 API Antworten?
Das Instruktionsmodell beinhaltet eine Ausrichtung aus seiner Abstimmung, sodass es einige Prompts ablehnen kann. Die API gibt Ihnen die Kontrolle über den System-Prompt und ermöglicht es Ihnen, das „Denken“ zu deaktivieren, was die meisten Probleme mit Tonfall und übermäßigen Ablehnungen löst. Um integrierte Ablehnungen vollständig zu entfernen, hosten Sie einen bereinigten (abliterated) Build selbst.
Kann ich GLM-5.2 auf einem Laptop ausführen?
Nicht das vollständige 753B-Modell. Verwenden Sie einen quantisierten Build, eine gemietete GPU-Box oder eine kleinere GLM-Variante wie GLM-4.7-Flash für lokale Tests, und verweisen Sie dann denselben Code auf das größere Modell, wenn Sie es benötigen.
Ist GLM-5.2 regional gesperrt?
Nein. Die Gewichte sind MIT-lizenziert und unterliegen keinen regionalen Beschränkungen. Die Verfügbarkeit der gehosteten API kann je nach Anbieter variieren, aber das Selbst-Hosting steht jedem offen.
