Wie man GLM-5.3-Flash in Claude Code und Cline verwendet

Integrieren Sie GLM-5.3-Flash in Claude Code und Cline: Basis-URLs, Umgebungsvariablen, den Cline-Kontext-Fix und warum das 3x Coding Plan-Kontingent der eigentliche Reiz ist.

INEZA Felin-Michel

INEZA Felin-Michel

27 August 2026

Wie man GLM-5.3-Flash in Claude Code und Cline verwendet

Apidog fĂĽr Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Wenn Sie bereits den GLM Coding Plan abonniert haben, gibt es einen speziellen Grund, sich fĂĽr GLM-5.3-Flash zu interessieren: Es soll angeblich die **dreifache nutzbare Quote** von GLM-5.3 im selben Plan bieten. Das ist das ganze Argument. Dreimal so viele Anfragen, im Austausch fĂĽr ein Modell, das im Artificial Analysis Intelligence Index 57 statt 60 Punkte erzielt.

Für routinemäßige Codierungsarbeiten ist dieser Tausch einfach. Dieser Leitfaden behandelt die Integration von Flash in Claude Code und Cline, wann GLM-5.3 weiterhin verwendet werden sollte und die Konfigurationsdetails, die häufig Probleme verursachen.

Button

Was Sie zuerst brauchen

Überprüfen Sie den Quotenmultiplikator und die Planstufen auf z.ai, bevor Sie Ihre Planung darauf ausrichten. Die Planbedingungen ändern sich häufiger als die Modellspezifikationen, und die 3x-Angabe stammt aus der eigenen Dokumentation von Z.ai.

Claude Code

Z.ai stellt einen Anthropic-kompatiblen Endpunkt zur Verfügung, was bedeutet, dass Claude Code mit GLM-Modellen kommunizieren kann, indem zwei Umgebungsvariablen geändert werden.

Der schnelle Weg

Z.ai liefert einen Helfer, der die Konfiguration fĂĽr Sie schreibt:

npx @z_ai/coding-helper

Er fragt nach Ihrem SchlĂĽssel und richtet die Konfiguration ein. Wenn es funktioniert, springen Sie zum untenstehenden Abschnitt zur Modellauswahl.

Der manuelle Weg

Legen Sie die Basis-URL und den Token in Ihrem Shell-Profil fest:

export ANTHROPIC_BASE_URL="https://api.z.ai/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="your-z-ai-key"

Starten Sie dann Claude Code wie gewohnt. Es leitet Anfragen an Z.ai statt an Anthropic weiter.

Zwei Dinge gehen hier häufiger schief als alles andere:

ANTHROPIC_API_KEY ist nicht dieselbe Variable wie ANTHROPIC_AUTH_TOKEN. Falls Sie einen alten Anthropic-SchlĂĽssel exportiert haben, heben Sie die Einstellung auf. Wenn beide gesetzt sind, fĂĽhrt dies zu Authentifizierungsfehlern, die eher nach einem falschen SchlĂĽssel als nach einem Konflikt aussehen.

Die Umgebung muss den Prozess erreichen. Wenn Sie diese in .zshrc festlegen und Claude Code von einem Editor oder einem Launcher starten, der Ihr Shell-Profil nicht lädt, wird es diese nicht sehen. Testen Sie mit echo $ANTHROPIC_BASE_URL im selben Kontext, aus dem Sie starten.

Modellauswahl

Nach der Verbindung wählen Sie glm-5.3-flash als Modell aus. Wenn Ihr Setup eine Einstellungsdatei verwendet, kommt die Modell-ID dorthin:

{
  "model": "glm-5.3-flash"
}

Arbeiten mit langem Kontext profitieren von einer Erhöhung des Timeouts, da ein 1M-Token-Fenster bedeutet, dass Anfragen legitim eine Weile dauern können:

export API_TIMEOUT_MS=3000000

Dieser Wert stammt aus dem GLM-5.2-Setup und sollte mit Ihrer eigenen Erfahrung abgeglichen werden. Unser GLM-5.2-Harness-Leitfaden behandelt die vorherige Generation, falls Sie eine bestehende Konfiguration migrieren.

Cline

Cline verbindet sich über seinen OpenAI-kompatiblen Anbieter und nicht über einen Anthropic-förmigen.

  1. Öffnen Sie die Cline-Einstellungen und wählen Sie OpenAI Compatible als API-Anbieter.
  2. Setzen Sie die Basis-URL auf https://api.z.ai/api/coding/paas/v4.
  3. FĂĽgen Sie Ihren Z.ai API-SchlĂĽssel ein.
  4. Wählen Sie Benutzerdefiniertes Modell und geben Sie glm-5.3-flash ein.

Beachten Sie die Basis-URL. Der Coding-Plan-Endpunkt (/api/coding/paas/v4) unterscheidet sich vom Standard-API-Endpunkt (/api/paas/v4), der für direkte API-Aufrufe in unserem API-Leitfaden verwendet wird. Beide URLs kursieren in Dokumentationen und Community-Beiträgen, und die Verwendung der Standard-URL mit einem Coding-Plan-Schlüssel ist eine häufige Ursache für verwirrende Autorisierungsfehler. Überprüfen Sie beide anhand der aktuellen Z.ai-Dokumentation, da sich diese Pfade bereits verschoben haben.

Die Einstellung fĂĽr das Kontextfenster

Cline leitet das Kontextfenster fĂĽr benutzerdefinierte Modelle nicht immer korrekt ab. Wenn Sie mit groĂźen Codebasen arbeiten und eine vorzeitige KĂĽrzung feststellen, stellen Sie das Kontextfenster manuell auf 1.000.000 ein.

Dies betraf auch Benutzer von GLM-5.2. Das Symptom ist, dass Cline Dateikontext früher als erwartet verwirft, während das Modell selbst perfekt in der Lage ist, ihn zu halten.

Warum Flash fĂĽr agentische Codierung

Der Benchmark-Fall, unter Verwendung der Startzahlen von Z.ai:

Benchmark GLM-5.3-Flash GLM-5.2
Terminal-Bench 2.1 84.3 nicht direkt vergleichbar
DeepSWE 63.4 46.2
AutomationBench 48.8 26.2

Der Terminal-Bench-Wert wurde mit Claude Code 2.1.207 bewertet, was ihn direkt relevant für die Harness macht, die die meisten Leser hier verwenden. Betrachten Sie diese als Herstellerangaben, bis unabhängige Reproduktionen vorliegen.

Die unabhängige Messung von Artificial Analysis ist ein Intelligence Index von 57 gegenüber 60 für GLM-5.3.

Es gibt eine wirklich neue Sache für ein Coding-Harness: native Bildeingabe. Flash akzeptiert Screenshots als Inhaltsblöcke in derselben Anfrage wie Ihr Code. Für die Frontend-Arbeit bedeutet das, einen Screenshot eines fehlerhaften Layouts in die Konversation einzufügen und das Modell über das Rendering nachdenken zu lassen, anstatt über Ihre Beschreibung des Renderings. Die eigene Positionierung von Z.ai spricht vom Beobachten von Schnittstellen und Rendering-Ergebnissen. Unser Vision-Leitfaden behandelt, was dieser Pfad leisten kann.

Der Geschwindigkeitskompromiss, klar dargelegt

GLM-5.3-Flash generiert etwa 49 Tokens pro Sekunde. GLM-5.3 schafft etwa 86. In einem Coding-Harness, das lange Datei-Umschreibungen streamt, werden Sie das spĂĽren.

Die Zeit bis zum ersten Token ist mit 1,52 gegenĂĽber 1,57 Sekunden praktisch identisch, sodass das Modell genauso schnell zu antworten beginnt. Der Unterschied zeigt sich bei langen Ausgaben.

Dies ist das ehrliche Gegengewicht zum Quoten-Argument. Dreimal so hohe Quote, etwa die Hälfte der Generierungsgeschwindigkeit. Bei kurzen Bearbeitungen, Tool-Aufrufen und iterativer Arbeit gewinnt die Quote. Für „schreibe diese 800-zeilige Datei neu“ ist das Warten real.

Eine praktische Routing-Strategie

Anstatt eines auszuwählen, verwenden Sie beide:

Das Umschalten ist eine Änderung der Modell-ID in Ihren Harness-Einstellungen, so dass eine Eskalation ein paar Sekunden kostet. Wenn Sie den Coding Plan nutzen, behalten Sie so den Großteil Ihres Volumens beim 3x-Quoten-Modell und reservieren die teure Quote für Arbeiten, die sie benötigen.

Z.ai weist auch darauf hin, dass Anrufe außerhalb der Spitzenzeiten nur die Hälfte der Standardpunkte verbrauchen, so dass die Planung von Batch- oder Hintergrund-Agentenarbeiten außerhalb der Spitzenzeiten den Plan weiter ausdehnt.

Fehlerbehebung

Die Fehler bei diesem Setup lassen sich in einige Kategorien einteilen.

Andere Harnesses

Die gleichen zwei Verbindungstypen decken die meisten Tools ab. Alles Anthropic-Kompatible (Claude Code, einige Agenten-Frameworks) verwendet https://api.z.ai/api/anthropic mit ANTHROPIC_AUTH_TOKEN. Alles OpenAI-Kompatible (Cline, Roo, Kilo, OpenCode, Codex, Cursors benutzerdefinierte Modelloption) verwendet https://api.z.ai/api/coding/paas/v4 mit dem SchlĂĽssel im Standard-API-SchlĂĽsselfeld und glm-5.3-flash als benutzerdefinierte Modell-ID.

Unsere früheren Leitfäden behandeln das Muster bei früheren Modellen: GLM-5.1 mit Claude Code und Claude Code und Cursor mit GLM-4.7.

Verbindung ĂĽberprĂĽfen

Bevor Sie einer Harness-Konfiguration vertrauen, bestätigen Sie, dass der Endpunkt eigenständig funktioniert. Ein direkter Aufruf schließt das Harness als Ursache für Probleme aus:

curl https://api.z.ai/api/coding/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{"role": "user", "content": "reply with OK"}]
  }'

Wenn dies eine Vervollständigung zurückgibt und Ihr Harness immer noch fehlschlägt, liegt das Problem an der Konfiguration, nicht an den Anmeldeinformationen.

Für mehr als einen einmaligen Check ist Apidog ein besserer Ort für diese Aufrufe als die Shell-Historie. Speichern Sie den Coding-Endpunkt und den Standard-Endpunkt nebeneinander mit dem als Umgebungsvariable gespeicherten Schlüssel, und wenn ein Harness Autorisierungsfehler ausgibt, können Sie mit einem Klick erkennen, ob der Endpunkt oder das Tool schuld ist. Diese Unterscheidung macht den Großteil der Debugging-Zeit bei diesen Setups aus.

Häufig gestellte Fragen (FAQ)

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen