Wie man GLM-5.2 uneingeschränkt nutzt

GLM-5.2 verfügt über MIT-lizenzierte offene Gewichte, weshalb die uneingeschränkte Nutzung ein unterstützter Weg ist: direkte API-Steuerung, Selbst-Hosting, unzensierte Builds und wie man jedes davon in Apidog testet.

Ashley Innocent

Ashley Innocent

7 July 2026

Wie man GLM-5.2 uneingeschränkt nutzt

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

GLM-5.2 ist eines der wenigen Modelle der Spitzenklasse, die Sie tatsächlich auf Ihrer eigenen Hardware ausführen können. Es wird als offene Gewichte unter einer MIT-Lizenz und ohne regionale Beschränkungen geliefert, daher ist die „uneingeschränkte Nutzung“ kein Hack. Es ist ein unterstützter Weg. Der Trick besteht darin, zu wissen, auf welche Beschränkung Sie tatsächlich stoßen, da die Lösung für jede einzelne anders ist.

Schaltfläche

TL;DR

Zuerst: Wissen Sie, auf welche Einschränkung Sie stoßen

„Einschränkungen“ ist ein dehnbarer Begriff. Für GLM-5.2 bedeutet es normalerweise eines von vier verschiedenen Dingen, und jedes hat seine eigene Lösung.

  1. Ablehnungen durch Instruktionsabstimmung. Das veröffentlichte Chat-Modell ist darauf abgestimmt, einige Anfragen abzulehnen. Dieses Verhalten ist in den Gewichten verankert.
  2. Produktfilter in der Chat-App. Die Web-Benutzeroberfläche für Endverbraucher kann eine eigene Moderationsschicht zusätzlich zum Modell hinzufügen. Die API verhält sich oft anders als die App.
  3. Plan- und Ratenbegrenzungen. Kostenlose Tarife und Coding Plan-Tarife begrenzen Anfragen, Kontext oder Ausgabe. Das ist ein Kontingent, keine Inhaltsregel.
  4. Overhead für Denkvorgänge und Sicherheitsrouting. Erweiterte Schlussfolgerungen und Sicherheitsrouting erhöhen die Latenz und können den Ton beeinflussen.

Die Region ist bewusst nicht auf dieser Liste. Die GLM-5.2-Gewichte sind MIT-lizenziert und unterliegen keinen regionalen Beschränkungen, sodass der Zugang nicht wie bei einigen ausschließlich gehosteten Modellen länderspezifisch gesperrt ist.

Hebel 1: Nutzen Sie die Roh-API, nicht die Chat-App

Die schnellste Änderung mit dem größten Nutzen ist, das Verbraucher-Chatfenster nicht mehr zu verwenden und die API direkt aufzurufen. Der Endpunkt ist OpenAI-kompatibel, sodass Sie Ihren eigenen System-Prompt beibehalten, Ihre eigene Temperatur einstellen und die Denkphase deaktivieren können.

Ein minimaler curl-Aufruf mit deaktiviertem „Denken“:

curl https://api.z.ai/api/paas/v4/chat/completions \
 -H "Authorization: Bearer $ZAI_API_KEY" \
 -H "Content-Type: application/json" \
 -d '{
 "model": "glm-5.2",
 "thinking": { "type": "disabled" },
 "temperature": 0.7,
 "messages": [
 { "role": "system", "content": "Sie sind ein direkter, ungefilterter technischer Assistent. Antworten Sie prägnant." },
 { "role": "user", "content": "Explain how abliteration changes a model." }
 ]
 }'

Der gleiche Aufruf mit dem OpenAI Python SDK, nur auf z.ai umgeleitet:

from openai import OpenAI

client = OpenAI(
 api_key="YOUR_ZAI_KEY",
 base_url="https://api.z.ai/api/paas/v4/",
)

resp = client.chat.completions.create(
 model="glm-5.2",
 temperature=0.7,
 extra_body={"thinking": {"type": "disabled"}},
 messages=[
 {"role": "system", "content": "Sie sind ein direkter, ungefilterter technischer Assistent."},
 {"role": "user", "content": "Explain how abliteration changes a model."},
 ],
)
print(resp.choices[0].message.content)

Zwei Dinge sind hier wichtig. Ihr System-Prompt gehört Ihnen, sodass Sie Ton und Umfang direkt steuern, anstatt die Standardeinstellungen der App zu übernehmen. Und thinking: {"type": "disabled"} überspringt den Denkprozess, wenn Sie eine rohe, schnelle Ausgabe wünschen. Für den vollständigen Parametersatz siehe den GLM-5.2 API-Leitfaden.

Die Preise ändern sich, überprüfen Sie diese daher live, bevor Sie Ihr Budget planen: Zum Zeitpunkt des Verfassens dieses Artikels listen sekundäre Quellen etwa 1,40 $ pro 1M Eingabe-Tokens und 4,40 $ pro 1M Ausgabe auf. Bestätigen Sie die aktuellen Zahlen in der GLM-5.2 Preisübersicht, und wenn die Kosten die eigentliche Einschränkung sind, lesen Sie, wie man GLM-5.2 kostenlos nutzen kann.

Hebel 2: Die offenen Gewichte selbst hosten

Dies ist die eigentliche Antwort auf „keine Einschränkungen“. Da die Gewichte MIT-lizenziert sind, können Sie GLM-5.2 selbst herunterladen und bereitstellen. Wenn das Modell auf Ihrem Computer läuft, gibt es keinen UI-Filter des Anbieters und keine externen Ratenbegrenzungen. Sie legen den System-Prompt fest, Sie legen die Richtlinie fest.

Der einfachste Weg ist Ollama:

ollama run glm-5.2

Hardware-Realitätscheck: GLM-5.2 ist ein MoE-Modell mit ungefähr 753B Parametern, daher benötigen die vollständigen Gewichte erheblichen VRAM. Für die meisten Leute bedeutet das einen quantisierten Build, eine gemietete Multi-GPU-Box oder eine kleinere GLM-Variante. Wenn Ihre Hardware bescheiden ist, läuft GLM-4.7-Flash lokal mit weitaus weniger Ressourcen und ist ein guter Ersatz, während Sie die Pipeline aufbauen. Der allgemeine Leitfaden zum lokalen Ausführen von GLM und die Ollama-Einrichtungserklärung decken den Rest ab.

Sobald es lokal läuft, stellt Ollama seinen eigenen OpenAI-kompatiblen Endpunkt unter http://localhost:11434/v1 bereit, sodass der gleiche Code aus Hebel 1 funktioniert, indem nur die Basis-URL geändert wird.

Hebel 3: Von der Community bereitgestellte unzensierte (bereinigte) Builds

Die Instruktionsabstimmung ist der Ort, an dem Ablehnungen entstehen. Die Open-Source-Community entfernt dieses Verhalten durch einen Prozess namens Abliterierung (Bereinigung), der die interne Anweisung unterdrückt, die eine Ablehnung auslöst, ohne ein vollständiges Retraining. Die gleiche Technik ermöglicht unzensierte Builds anderer offener Modelle, einschließlich QwQ und DeepSeek R1.

Da die GLM-5.2-Gewichte offen und MIT-lizenziert sind, gilt diese Technik auch hier. Ein fertiger, bereinigter (abliterated) GLM-5.2-Build ist möglicherweise noch nicht garantiert verfügbar, und die Verfügbarkeit ändert sich häufig, suchen Sie daher auf Hugging Face nach einer aktuellen Version, anstatt davon auszugehen, dass sie existiert. Wenn kein 5.2-Build verfügbar ist, ist der Workflow identisch mit den Anleitungen für QwQ und DeepSeek R1: Laden Sie die bereinigten Gewichte herunter, laden Sie sie in Ollama oder vLLM und stellen Sie sie bereit.

Dies ist der vollständigste Weg, integrierte Ablehnungen zu entfernen, und es ist auch derjenige, der Ihnen die größte Verantwortung auferlegt. Lesen Sie den Abschnitt zur Verantwortung, bevor Sie es in Betrieb nehmen.

Hebel 4: Wählen Sie einen Anbieter, der es Ihnen ermöglicht, Richtlinien festzulegen

Wenn Sie Ihre eigene Box nicht betreiben möchten, ist ein Routing-Anbieter der Mittelweg. GLM-5.2 ist auf OpenRouter als z-ai/glm-5.2 und in der Ollama-Bibliothek gelistet. Ein Router ermöglicht es Ihnen, Ihre eigenen Moderationseinstellungen anzuwenden und den zugrunde liegenden Host zu wechseln, ohne Ihre App neu schreiben zu müssen, was den Consumer-UI-Filter umgeht und gleichzeitig einen verwalteten Endpunkt beibehält.

Dieser Artikel steht neben der umfassenderen Übersicht über LLMs ohne Einschränkungen, falls Sie GLM-5.2 vor einer Festlegung mit anderen offenen Optionen vergleichen möchten.

Testen Sie jede Einrichtung in Apidog, bevor Sie sie bereitstellen

Welchen Hebel Sie auch wählen, Sie erhalten einen OpenAI-kompatiblen Endpunkt. Bestätigen Sie, dass er sich wie erwartet verhält, bevor Sie ihn in ein Produkt integrieren. Apidog ist eine saubere Möglichkeit dazu, da Sie die rohe Streaming-Antwort und nicht nur den endgültigen Text überprüfen können.

  1. Erstellen Sie eine neue Anfrage in Apidog, die auf Ihren Endpunkt zeigt (https://api.z.ai/api/paas/v4/chat/completions für die gehostete API oder http://localhost:11434/v1/chat/completions für einen lokalen Build).
  2. Fügen Sie den Header Authorization: Bearer <key> für die gehostete API hinzu. Lokales Ollama benötigt keinen Schlüssel.
  3. Senden Sie einen chat/completions-Body mit model: glm-5.2, Ihrer system-Nachricht und stream: true.
  4. Beobachten Sie den SSE-Stream. Sie können die „Denken“-Deltas und die Inhalts-Deltas separat sehen, sowie das usage-Objekt mit Token-Zählungen.
  5. Schalten Sie „Denken“ ein und aus und vergleichen Sie die beiden Antworten nebeneinander.

So überprüfen Sie, ob Ihr System-Prompt tatsächlich wirksam wurde und dass das Modell so reagiert, wie es Ihre gewählte Einrichtung verspricht, anstatt es erst in der Produktion herauszufinden.

Ein Wort zur Verantwortung

Das Entfernen von Produktfiltern und das Ausführen unzensierter Gewichte ist legitim. Es ist üblich für Forschung, Red-Teaming und den Aufbau einer eigenen Moderation, anstatt die eines anderen zu übernehmen. Aber sobald Sie selbst hosten, liegt die Moderation bei Ihnen, ebenso wie das rechtliche Risiko. Weniger Leitplanken bedeuten, dass Sie für das Ergebnis verantwortlich sind. Beachten Sie drei Dinge:

FAQ

Ist GLM-5.2 wirklich Open Source?

Die Gewichte werden unter einer MIT-Lizenz veröffentlicht, einer der freizügigsten verfügbaren Lizenzen. Sie können sie ausführen, modifizieren und selbst hosten, auch für kommerzielle Zwecke, vorbehaltlich der Lizenzbedingungen. Eine vollständige Identität und Spezifikationen finden Sie unter Was ist GLM-5.2.

Zensiert die GLM-5.2 API Antworten?

Das Instruktionsmodell beinhaltet eine Ausrichtung aus seiner Abstimmung, sodass es einige Prompts ablehnen kann. Die API gibt Ihnen die Kontrolle über den System-Prompt und ermöglicht es Ihnen, das „Denken“ zu deaktivieren, was die meisten Probleme mit Tonfall und übermäßigen Ablehnungen löst. Um integrierte Ablehnungen vollständig zu entfernen, hosten Sie einen bereinigten (abliterated) Build selbst.

Kann ich GLM-5.2 auf einem Laptop ausführen?

Nicht das vollständige 753B-Modell. Verwenden Sie einen quantisierten Build, eine gemietete GPU-Box oder eine kleinere GLM-Variante wie GLM-4.7-Flash für lokale Tests, und verweisen Sie dann denselben Code auf das größere Modell, wenn Sie es benötigen.

Ist GLM-5.2 regional gesperrt?

Nein. Die Gewichte sind MIT-lizenziert und unterliegen keinen regionalen Beschränkungen. Die Verfügbarkeit der gehosteten API kann je nach Anbieter variieren, aber das Selbst-Hosting steht jedem offen.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen