Qwen 3.8 API verwenden: Eine Anleitung

Besorgen Sie sich einen Qwen 3.8 API-Schlüssel, rufen Sie qwen3.8-max über das OpenAI- oder Anthropic-Protokoll auf, streamen Sie die Begründungsausgabe und testen Sie jeden Endpunkt in Apidog.

Ashley Innocent

Ashley Innocent

3 August 2026

Qwen 3.8 API verwenden: Eine Anleitung

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Alibaba hat Qwen 3.8-Max Anfang August 2026 veröffentlicht, und die API ist bereits in Model Studio verfügbar. Das Modell bietet insgesamt 2.4T Parameter (95B aktiv), ein 1M-Token-Kontextfenster und einen pauschalen Preis von 2 $ Eingabe / 6 $ Ausgabe pro Million Tokens. Wenn Sie den vollständigen Hintergrund zum Modell selbst wünschen, beginnen Sie mit unserer Qwen 3.8-Erläuterung. Diese Anleitung behandelt die praktische Seite: einen Schlüssel erhalten, eine Region auswählen, Ihren ersten Aufruf tätigen und das Modell in Ihre Tools integrieren.

Ein Detail unterscheidet diese API von den meisten Modellveröffentlichungen. Qwen 3.8 wird am ersten Tag mit zwei Protokollen ausgeliefert: einem OpenAI-kompatiblen Endpunkt und einem Anthropic-kompatiblen Endpunkt. Ihr vorhandener OpenAI SDK-Code funktioniert. Ihr Claude Code-Setup funktioniert ebenfalls, mit drei Umgebungsvariablen. Dieses Dual-Protokoll-Design macht dies auch zu einer unterhaltsamen API, die man in Apidog ausprobieren kann, wo Sie denselben Prompt an beide Protokollformen senden und beobachten können, wie jede zurückstreamt. Dazu mehr weiter unten.

Button

Hier ist die vollständige Anleitung.

Was Sie vor dem Start benötigen

Eine Kurzübersicht, damit Sie nichts überrascht:

Punkt Wert
Modell-ID qwen3.8-max
Kontextfenster 1.000.000 Tokens
Maximale Ausgabe 65.536 Tokens
Eingabetypen Text und Bilder
Preise 2 $ Eingabe / 6 $ Ausgabe pro 1M Tokens, pauschal über den gesamten Kontext
Argumentationskontrolle reasoning_effort: xhigh (Standard), medium, low
Protokolle OpenAI Chat-Vervollständigungen + Antworten, Anthropic Messages
Wichtige Umgebungsvariable DASHSCOPE_API_KEY
Übersichtstabelle der Qwen 3.8-Max Spezifikationen

All dies stammt aus dem offiziellen Qwen 3.8-Release-Beitrag und den Alibaba Cloud Model Studio-Dokumenten. Ein Hinweis zu den Gewichten: Alibaba versprach offene Gewichte auf Hugging Face und ModelScope für nächste Woche, aber Anfang August 2026 sind sie noch nicht herunterladbar. Alles in dieser Anleitung läuft über die gehostete API.

Schritt 1: API-Schlüssel von QwenCloud erhalten

Gehen Sie zu home.qwencloud.com und melden Sie sich an oder erstellen Sie ein Konto. Sobald Sie in der Konsole sind, erstellen Sie einen API-Schlüssel. Alibabas Plattform verwendet intern immer noch den Namen DashScope, daher lautet die Umgebungsvariablenkonvention DASHSCOPE_API_KEY:

export DASHSCOPE_API_KEY="sk-Ihr-Schlüssel-hier"

Speichern Sie ihn in Ihrem Shell-Profil oder einer .env-Datei, nicht in Ihrem Quellcode. Jeder Code-Ausschnitt in dieser Anleitung liest den Schlüssel aus dieser Variable.

Wenn Sie das Modell testen möchten, bevor Sie echtes Geld investieren, gibt es ein kostenloses Kontingent: 1 Million Tokens, gültig für 90 Tage, nur in der Region Singapur verfügbar. Das reicht für einen ernsthaften Evaluierungslauf.

Schritt 2: Eine regionale Basis-URL auswählen

Model Studio bietet die OpenAI-kompatible API aus drei Regionen an. Wählen Sie diejenige aus, die Ihren Servern am nächsten liegt:

Region Basis-URL
Peking https://dashscope.aliyuncs.com/compatible-mode/v1
Singapur https://dashscope-intl.aliyuncs.com/compatible-mode/v1
USA (Virginia) https://dashscope-us.aliyuncs.com/compatible-mode/v1

Der Singapur-Endpunkt (dashscope-intl) ist die Standardwahl für die meisten internationalen Benutzer, und hier befindet sich auch das kostenlose Kontingent. Die Model Studio-Modellliste bestätigt, dass qwen3.8-max für die Textgenerierung sowie das Bild- und Videoverständnis verfügbar ist, und es steht ab dem Update vom 3. August an der Spitze der Tabelle der empfohlenen Modelle.

Die folgenden Beispiele verwenden Singapur. Ersetzen Sie die Basis-URL, wenn Sie näher an Peking oder Virginia sind.

Schritt 3: Ihren ersten Aufruf tätigen

Der Endpunkt spricht das OpenAI Chat-Vervollständigungsformat, sodass das offizielle openai Python SDK unverändert funktioniert. Richten Sie es auf die DashScope-Basis-URL aus:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "system", "content": "You are a precise technical assistant."},
        {"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
    ],
)

print(completion.choices[0].message.content)

Derselbe Aufruf in cURL:

curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {"role": "user", "content": "Explain idempotency in REST APIs in two sentences."}
    ]
  }'

Wenn Sie zuvor einen OpenAI-kompatiblen Anbieter verwendet haben, wird Ihnen hier nichts Neues begegnen. Das ist der Punkt. Die Migration von einem anderen Modell ist ein Austausch der Basis-URL und eine Änderung der Modell-ID. Wenn Sie von der vorherigen Generation kommen, ist der Arbeitsablauf identisch mit dem in unserer Anleitung zur Qwen 3.7 Plus API, nur mit einer neuen Modell-ID und besseren Zahlen dahinter.

Schritt 4: Antworten streamen und die Argumentation lesen

Qwen 3.8-Max ist ein Argumentationsmodell und denkt standardmäßig. Im Streaming-Modus kommt das Denken als reasoning_content-Deltas an, bevor die endgültige Antwort als reguläre content-Deltas eintrifft. Handhaben Sie beides:

stream = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "user", "content": "Design a rate limiting strategy for a public API."}
    ],
    stream=True,
)

thinking_done = False
for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)
    if reasoning:
        print(reasoning, end="", flush=True)
    elif delta.content:
        if not thinking_done:
            print("\n--- Antwort ---")
            thinking_done = True
        print(delta.content, end="", flush=True)

Zwei Dinge, die Sie über den Denk-Stream wissen sollten. Erstens werden Denk-Tokens als Ausgabe-Tokens zum gleichen Preis wie alles andere abgerechnet, sodass lange Argumentationsketten auf Ihrer Rechnung erscheinen. Zweitens argumentiert das Modell bei der Standard-Anstrengungsstufe sehr stark, was gut für die Korrektheit, aber langsam für Chat-Benutzeroberflächen ist. Das bringt uns zu den Kontrollen.

Schritt 5: `reasoning_effort` und die Denk-Flags einstellen

Die API bietet drei offizielle Stufen von reasoning_effort: xhigh (der Standard), medium und low. Höherer Aufwand bedeutet mehr Denk-Tokens, bessere Ergebnisse bei schwierigen Problemen und höhere Latenz sowie Kosten. Geringerer Aufwand ist die richtige Wahl für Klassifizierung, Extraktion und einfachen Chat.

Zwei verwandte Flags steuern das Denkverhalten selbst: enable_thinking schaltet den Argumentationsprozess ein oder aus, und preserve_thinking (standardmäßig aktiviert) behält den Argumentationskontext über Gesprächsrunden bei. Übergeben Sie diese über extra_body, wenn Sie das OpenAI SDK verwenden, da es sich um DashScope-Erweiterungen handelt:

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Classify this ticket: 'Login page 500s on Safari.'"}],
    extra_body={
        "reasoning_effort": "low",
        "enable_thinking": True,
    },
)

Die Abrechnung ist identisch, ob das Denken aktiviert oder deaktiviert ist, pro Token. Der Hebel, der Ihre Kosten beeinflusst, ist die Anzahl der Denk-Tokens, die das Modell generiert, was reasoning_effort direkt steuert. Eine sinnvolle Standardeinstellung: xhigh für agentische Codierung und Analyse, low für Endpunkte mit hohem Volumen in der Produktion, medium, wenn Sie sich nicht sicher sind. Messen Sie Ihre eigene Arbeitslast, anstatt sich auf die Standardeinstellungen anderer zu verlassen, einschließlich der von Alibaba.

Der Anthropic-kompatible Endpunkt

Dies ist der ungewöhnliche Teil. Neben der OpenAI-kompatiblen API liefert Qwen 3.8 einen Anthropic-Protokoll-Endpunkt:

https://dashscope-intl.aliyuncs.com/apps/anthropic

Er spricht das Anthropic Messages-Format, was bedeutet, dass jedes für Claudes API entwickelte Tool ohne Codeänderungen mit Qwen 3.8-Max kommunizieren kann. Der Hauptanwendungsfall ist Claude Code. Alibaba hat eine offizielle Konfiguration veröffentlicht, und diese besteht aus drei Umgebungsvariablen:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=$DASHSCOPE_API_KEY
export ANTHROPIC_MODEL=qwen3.8-max

Starten Sie claude nach dem Festlegen dieser Variablen, und Claude Code führt seinen vollständigen agentischen Schleifendurchlauf gegen Qwen 3.8-Max aus. Hier gibt es ein Detail, das eine Pause wert ist: Alibaba führte die meisten seiner eigenen Codierungs-Benchmarks mit dem Claude Code Harness durch. Der Anthropic-Endpunkt ist kein Kompatibilitäts-Nebenprodukt; es ist die Konfiguration, die der Anbieter selbst zur Erstellung der Codierungszahlen verwendet hat. Wenn agentisches Codieren Ihr Anwendungsfall ist, geht unsere Qwen 3.8-Codierungsanalyse diese Benchmark-Zeilen und die anderen unterstützten Harnesses durch (Codex, Qoder, Qwen Code und OpenClaw haben ebenfalls offizielle Konfigurationen).

Warum ist ein Dual-Protokoll über Claude Code hinaus wichtig? Weil Ihr Team wahrscheinlich Code und Tools über beide Ökosysteme hinweg aufgeteilt hat. Eine API, die beide Formate beantwortet, bedeutet, dass Sie eine Migration in beide Richtungen testen können, ohne zuerst Clients neu schreiben zu müssen.

Was es kostet

Kurzversion: 2 $ pro Million Eingabe-Tokens, 6 $ pro Million Ausgabe-Tokens, eine feste Stufe von 0 bis 1M Kontext. Kein Aufpreis für langen Kontext, was unter 1M-Kontext-Modellen selten ist. Kontext-Caching reduziert wiederholte Eingaben bei Cache-Hits auf 10% des Eingabepreises, wobei explizite Cache-Erstellung mit 125% berechnet wird. Die offizielle Preisseite enthält die aktuellen Zahlen.

Vergleich der Qwen 3.8-Max und Qwen 3.7-Max Preise

Zum Vergleich: Dieser Einführungspreis unterbietet den Listenpreis von Qwen 3.7-Max von 2,5 $/7,5 $. Beachten Sie jedoch den Abrechnungshinweis aus dem Streaming-Abschnitt: Denk-Tokens zählen als Ausgabe, und die Standard-Anstrengungsstufe ist xhigh, sodass die tatsächlichen Rechnungen höher ausfallen als eine naive Sticker-Berechnung. Für durchgerechnete Kostenbeispiele und das Kleingedruckte zum kostenlosen Kontingent siehe die vollständige Qwen 3.8-Preisaufschlüsselung.

Die Qwen 3.8 API in Apidog testen und debuggen

Eine Dual-Protokoll-, Drei-Regionen-, Streaming-Argumentations-API ist genau die Art von Oberfläche, bei der sich eine richtige API-Workbench bewährt. Hier ist ein praktisches Setup in Apidog:

Apidog Schnittstelle, die das Testen der Qwen 3.8 API zeigt

Den OpenAI-kompatiblen Spezifikator importieren. Erstellen Sie ein Projekt und fügen Sie den Chat-Vervollständigungs-Endpunkt (POST /chat/completions) mit dem Anfrage-Body-Schema hinzu. Da die API dem OpenAI-Format folgt, können Sie eine bestehende OpenAI-Spezifikation importieren und nichts außer der Server-URL ändern. Fügen Sie den Anthropic Messages-Endpunkt als zweite API im selben Projekt hinzu, sodass beide Protokollformen nebeneinander existieren.

Die Regionen als Umgebungen modellieren. Erstellen Sie drei Apidog-Umgebungen (Peking, Singapur, USA-Virginia), jede mit einer base_url-Variable, die auf die entsprechende kompatible-Modus-URL gesetzt ist, und einem gemeinsamen DASHSCOPE_API_KEY-Geheimnis. Das Wechseln der Regionen wird zu einem Dropdown-Klick anstelle einer Bearbeitung jeder Anfrage. Dies ist auch der saubere Weg, die Latenz von Ihrem Standort zu jeder Region zu überprüfen, bevor Sie eine davon in die Produktion übernehmen.

Den SSE-Stream inspizieren. Senden Sie eine Anfrage mit "stream": true und beobachten Sie die rohen Server-Sent Events in der Antwortansicht. Sie werden zuerst die reasoning_content-Deltas sehen, dann die content-Deltas. Wenn Ihr Streaming-Parser in der Produktion fehlerhaft ist, ist der Vergleich seiner Ausgabe mit der rohen Ereignissequenz in Apidog der schnellste Weg, um herauszufinden, ob der Fehler bei Ihnen oder dem Anbieter liegt.

Modelle nebeneinander vergleichen. Duplizieren Sie eine Anfrage, ändern Sie die Modell-ID auf qwen3.7-max und führen Sie beide mit demselben Prompt aus. Derselbe Trick funktioniert bei verschiedenen Anbietern: Behalten Sie eine Kimi K3 API-Anfrage im selben Projekt und A/B-testen Sie die beiden Open-Weight-Flaggschiffe für Ihre tatsächliche Arbeitslast, wobei die Antwortzeiten und Token-Anzahl für jeden Lauf protokolliert werden. Anbieter-Benchmark-Tabellen sind ein Ausgangspunkt; Ihre eigenen Prompts sind der eigentliche Test.

Laden Sie Apidog kostenlos herunter, um mitzumachen; das gesamte Setup oben dauert etwa zehn Minuten.

FAQ

Gibt es eine kostenlose Möglichkeit, die Qwen 3.8 API auszuprobieren? Ja. Neue Model Studio-Konten erhalten ein kostenloses 1M-Token-Kontingent für qwen3.8-max, gültig für 90 Tage, nur in der Region Singapur. Das ist das gesamte Angebot, leiten Sie also Ihren Evaluierungsverkehr über dashscope-intl, um es zu nutzen.

Kann ich Qwen 3.8 lokal ausführen, anstatt die API zu nutzen? Noch nicht. Alibaba versprach offene Gewichte auf Hugging Face und ModelScope für nächste Woche, aber Anfang August 2026 sind sie nicht herunterladbar. Und mit 2.4 Billionen Gesamtparametern wird das Selbst-Hosting selbst in quantisierter Form ein Multi-Node-Projekt sein. Vorerst ist die gehostete API die einzige Möglichkeit, das Modell auszuführen.

Unterstützt der Anthropic-Endpunkt dieselben Funktionen wie der OpenAI-Endpunkt? Der Anthropic-Endpunkt spricht das Anthropic Messages-Protokoll und existiert hauptsächlich, um Tools aus diesem Ökosystem zu betreiben, wobei Claude Code die offiziell dokumentierte Integration ist. Für direkten Anwendungscode ist der OpenAI-kompatible Endpunkt der besser dokumentierte Pfad, mit reasoning_effort, enable_thinking und Streaming-reasoning_content, die alle oben behandelt wurden.

Wie schneidet qwen3.8-max im Vergleich zu Qwen3-Coder für Codierungsarbeiten ab? Es sind unterschiedliche Tools. Qwen3-Coder ist eine spezialisierte Codierungsmodellreihe; qwen3.8-max ist das allgemeine Flaggschiff, das zufällig starke agentische Codierungszahlen auf Alibabas eigener Tabelle liefert (86,6 auf Terminal Bench 2.1, laut vom Anbieter durchgeführten Benchmarks). Wenn Sie zwischen ihnen wählen, testen Sie beide über dieselbe API-Oberfläche: Die Aufrufe sind identisch, außer für die Modell-ID.

Zusammenfassung

Die Qwen 3.8 API ist eine der einfacheren Flaggschiff-Starts zur Adaption. Ihr OpenAI SDK-Code funktioniert nach einem Austausch der Basis-URL, Ihr Claude Code-Setup funktioniert nach drei Umgebungsvariablen, und die pauschalen 2$/6$-Preise bedeuten, dass Sie keine Tabelle benötigen, um Kosten über den 1M-Kontext vorherzusagen. Die Hauptpunkte, auf die man tatsächlich achten sollte: Denk-Tokens werden als Ausgabe mit xhigh Standardaufwand abgerechnet, und die regionale Aufteilung des kostenlosen Kontingents.

Beginnen Sie mit dem kostenlosen Singapur-Kontingent, streamen Sie einige Anfragen, um zu sehen, wie sich die Argumentations-Deltas verhalten, und testen Sie Ihre eigenen Prompts damit, bevor Sie einer Benchmark-Tabelle vertrauen, auch der von Alibaba. Das Einrichten des Ganzen als Projekt in Apidog, mit Regionen als Umgebungen und beiden Protokollen als gespeicherte Anfragen, verwandelt diese Evaluierung von einem Nachmittag mit Ad-hoc-cURL in etwas, das Ihr ganzes Team erneut ausführen kann, wenn das nächste Modell erscheint.

Button

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen