Alibaba veröffentlichte Qwen 3.8-Max Anfang August 2026, und die Preisfrage hat endlich eine echte Antwort. Während des Vorschauzeitraums im Juli kursierte die Geschichte einer „10 % Vorschaupreise“-Aktion. Diese Geschichte ist vorbei. Bei allgemeiner Verfügbarkeit listet die offizielle Model Studio Preisgestaltungsseite qwen3.8-max für 2 $ pro 1 Million Eingabetoken und 6 $ pro 1 Million Ausgabetoken auf, eine feste Stufe, die das gesamte 1-Millionen-Token-Kontextfenster abdeckt.
Diese feste Stufe ist der interessante Teil. Die meisten Spitzenmodelle verlangen pro Token mehr, sobald Ihre Eingabeaufforderung eine Kontextschwelle überschreitet. Qwen 3.8-Max tut dies nicht: Egal, ob Sie 5.000 Token oder 900.000 senden, der Preis bleibt bei 2 $/6 $.
Dieser Artikel beleuchtet das Gesamtbild: das Flat-Tier-Design, Vergleiche mit Qwen 3.7-Max, Kimi K3, Claude Opus 5 und GPT-5.6 Terra, die Caching-Rabatte, das Kleingedruckte zur kostenlosen Quote und durchgerechnete Kostenbeispiele mit echter Mathematik. Für einen breiteren Überblick über das Modell beginnen Sie mit was Qwen 3.8 ist und warum es wichtig ist, und kommen Sie dann für die Zahlen zurück.
Zuerst ein Hinweis: Listenpreise geben Ihnen nur eine Schätzung. Qwen 3.8-Max wird standardmäßig mit Argumentation auf xhigh-Aufwand ausgeliefert, und Denk-Token werden als Ausgabe abgerechnet. Der zuverlässige Weg, Kosten zu prognostizieren, besteht darin, echte Anfragen zu senden und die Token-Nutzung zu messen. Apidog zeigt während des Tests die vollständige Token-Aufschlüsselung jeder Antwort an, was die Kostenschätzung zu einer einfachen Rechenaufgabe macht. Mehr dazu weiter unten.
Die GA-Zahl: 2 $ Eingabe, 6 $ Ausgabe, eine Stufe
Hier ist die offizielle Preisliste für qwen3.8-max, überprüft anhand der Model Studio Preisgestaltungsseite vom 3. August 2026:
| Element | Preis (pro 1 Million Token) |
|---|---|
| Eingabe | 2,00 $ |
| Ausgabe (inkl. Denk-Token) | 6,00 $ |
| Gecachte Eingabe (Cache-Hit) | 10 % des Eingabepreises |
| Explizite Cache-Erstellung | 125 % des Eingabepreises |
| Kontextstufe | Einzelne Stufe, 0 bis 1 Million Token |
| Denken vs. Nicht-Denken | Wird gleich abgerechnet |
Drei Details sind erwähnenswert: Das 1-Millionen-Kontextfenster wird vollständig von einem einzigen Preis abgedeckt, ohne Aufschlag für lange Prompts. Denk- und Nicht-Denk-Modi kosten die gleichen Preise, obwohl Denk-Token als Ausgabe zählen (siehe den Abschnitt zur Ehrlichkeit weiter unten). Und die maximale Ausgabe beträgt 65.536 Token pro Anfrage, sodass eine einzelne Antwort höchstens etwa 0,39 $ an Ausgabe kostet.
Die offizielle Qwen 3.8 Ankündigung positioniert das Modell als Alibabas leistungsfähigstes bisher: 2,4 Billionen Gesamtparameter mit 95 Milliarden aktiv, ein 1-Millionen-Token-Kontextfenster, multimodale Eingabe. Dies für 2 $/6 $ zu bekommen, unterbietet die meisten Spitzenmodelle, einschließlich Alibabas eigenem früheren Flaggschiff.
Warum eine Pauschalpreisgestaltung über 1 Million Token ungewöhnlich ist
Gestaffelte Kontextpreise sind die Branchennorm: ein Tarif unterhalb einer Kontextschwelle, ein höherer Tarif darüber, da lange Kontexte teurer zu bedienen sind.
Alibaba selbst macht dies. Auf derselben Model Studio Preisgestaltungsseite werden Modelle wie qwen3-max und qwen3-coder-plus in Kontextlängenstufen bepreist, wobei der Pro-Token-Satz mit zunehmender Eingabe steigt. Qwen 3.8-Max weicht in Alibabas eigenem Katalog von diesem Muster ab: Seine Preistabelle zeigt eine Zeile, „0
Warum das wichtig ist: Bei gestaffelter Preisgestaltung tragen Workloads mit langem Kontext einen versteckten Multiplikator. Eine RAG-Pipeline, die gelegentlich 300.000 Token an Dokumenten in einen Prompt stopft, kann bei diesen Anfragen das Mehrfache ihres typischen Preises kosten. Bei Qwen 3.8-Max kostet das marginale Token immer dasselbe, sodass die Budgetierung linear ist: Token mal Rate, fertig. Für die Analyse langer Dokumente, große Codebasis-Agenten oder intensive Retrieval-Pipelines ist diese Vorhersagbarkeit genauso viel wert wie der niedrige Tarif selbst.
Günstiger als Qwen 3.7-Max zum Listenpreis
- Qwen 3.7-Max Listenpreis: 2,5 $ Eingabe / 7,5 $ Ausgabe pro 1 Million Token
- Qwen 3.8-Max: 2 $ Eingabe / 6 $ Ausgabe pro 1 Million Token
Das ist eine Senkung um 20 % auf beiden Seiten, während das Modell ein größeres Kontextfenster, multimodale Eingabe und bessere Benchmark-Ergebnisse erhielt.
Eine Komplikation: Qwen 3.7-Max läuft derzeit mit einer 50%-Aktion, die den Preis auf **1,25 $/3,75 $** senkt. Zu Aktionspreisen ist das ältere Flaggschiff günstiger als das neue. Wenn Ihr Workload den 1-Millionen-Kontext von Qwen 3.8 oder dessen multimodale und agentische Vorteile nicht benötigt, ist das reduzierte 3.7-Max ein legitimes Preis-Leistungs-Verhältnis, solange die Aktion läuft; bauen Sie Ihr Kostenmodell jedoch nicht um eine Aktion herum auf. Weiter unten auf der Leiter bleibt Qwen 3.7-Plus das Budget-Arbeitstier für 0,4 $/1,6 $, mit einer eigenen 20%-Aktion.
Der Abschnitt zur Ehrlichkeit: Denk-Token werden als Ausgabe abgerechnet
Dies ist der Teil, den die meisten Preisübersichten überspringen und der Sie am ehesten auf einer Rechnung überraschen wird.
Qwen 3.8-Max unterstützt einen Parameter reasoning_effort mit drei Stufen: xhigh, medium und low. Die Standardeinstellung ist xhigh, die aggressivste Einstellung. Im Denkmodus generiert das Modell interne Denk-Token vor seiner endgültigen Antwort, und **diese Denk-Token werden zum Ausgabepreis von 6 $ abgerechnet**, genau wie sichtbarer Text.
Die Konsequenz: Bei Standardeinstellungen kosten rechenintensive Anfragen mehr, als eine naive Schätzung „Prompt-Token plus Antwort-Token“ vorhersagt. Eine Antwort, die 800 Token sichtbarer Antwort zeigt, kann bei einem schwierigen Problem mehrere Tausend Denk-Token verbraucht haben.
Drei Abhilfemaßnahmen: Reduzieren Sie reasoning_effort auf medium oder low für Aufgaben, die keine tiefe Argumentation erfordern (Klassifizierung, Extraktion, Formatierung); messen Sie die tatsächliche Nutzung pro Aufgabentyp, bevor Sie die monatlichen Ausgaben prognostizieren, da das usage-Objekt in jeder Antwort tatsächliche Zählungen einschließlich Argumentation meldet; und achten Sie speziell auf Ausgabetoken, da die Ausgabe hier das Dreifache der Eingabe kostet und das Denken die Ausgabe erhöht.
Kontext-Caching: 10 % Treffer, 125 % Erstellung
Wenn Ihre Anwendung denselben Prompt-Präfix wiederholt sendet (ein langer System-Prompt, ein stabiles Dokument, Tool-Definitionen), ändert Kontext-Caching die Wirtschaftlichkeit erheblich:
- **Cache-Treffer werden mit 10 % des Eingabepreises abgerechnet.** Gecachte Eingabetoken kosten 0,20 $ pro 1 Million statt 2 $.
- **Explizite Cache-Erstellung wird mit 125 % des Eingabepreises abgerechnet.** Das Schreiben von Token in den Cache kostet 2,50 $ pro 1 Million, ein einmaliger Aufschlag von 25 % gegenüber der normalen Eingabe.
Die Break-Even-Rechnung ist einfach. Die Erstellung kostet einmalig zusätzlich 25 %; jeder weitere Treffer spart 90 %. Wenn ein Präfix sogar zweimal wiederverwendet wird, amortisiert sich das Caching bereits. Für hochfrequente Agenten oder Chat-Anwendungen mit einem umfangreichen System-Prompt summieren sich die Einsparungen schnell (durchgerechnetes Beispiel unten).
Kleingedrucktes zur kostenlosen Quote: 1 Million Token, Singapur, 90 Tage
Model Studio bietet eine kostenlose Quote für qwen3.8-max, und das Kleingedruckte ist wichtig:
- **Größe: 1 Million Token.** Ausreichend für eine echte Evaluierung, nicht für die Produktion.
- **Region: Nur Singapur.** Richten Sie Ihren Client auf
https://dashscope-intl.aliyuncs.com/compatible-mode/v1; die Quote gilt nicht für Peking oder US-Virginia. - **Dauer: 90 Tage** ab Aktivierung. Nicht genutztes Kontingent verfällt.
Denk-Token werden wie jede andere Ausgabe von dieser Quote abgezogen, sodass ein paar Dutzend schwieriger Denkaufgaben bei xhigh 1 Million Token schneller aufbrauchen können, als Sie erwarten würden. Wenn kostenloser Zugang Ihr Hauptziel ist, haben wir alle kostenlosen Wege, einschließlich Qwen Chat, unter wie man Qwen 3.8 kostenlos nutzt zusammengetragen.
Wie sich die Preise von Qwen 3.8 vergleichen
Hier ist die aktuelle Übersicht, basierend auf Listenpreisen pro 1 Million Token. Aktionspreise sind gekennzeichnet, da Aktionen ablaufen.
| Modell | Eingabe | Ausgabe | Hinweise |
|---|---|---|---|
| Qwen 3.8-Max | 2,00 $ | 6,00 $ | Pauschal über 1 Million Kontext; Cache-Treffer 10 % |
| Qwen 3.7-Max | 2,50 $ | 7,50 $ | Derzeit 50 % Rabatt: 1,25 $/3,75 $ (Aktion) |
| Qwen 3.7-Plus | 0,40 $ | 1,60 $ | Derzeit 20 % Rabatt (Aktion) |
| Kimi K3 | 3,00 $ | 15,00 $ | Cache-Treffer 0,30 $ |
| Claude Opus 5 | 5,00 $ | 25,00 $ | |
| GPT-5.6 Terra | 2,00 $ | 12,00 $ |
Die Tabelle lesen:
- **Gegen Kimi K3**, seinen engsten Open-Weight-Rivalen, kostet Qwen 3.8-Max ein Drittel weniger bei der Eingabe und 60 % weniger bei der Ausgabe, und seine Cache-Trefferquote (0,20 $) unterbietet die von K3 (0,30 $). Für ausgabelastige Agentenarbeit dominiert diese Ausgabelücke. Siehe den Kimi K3 API-Leitfaden für die K3-Seite.
- **Gegen Claude Opus 5** ist Qwen 60 % günstiger bei der Eingabe und 76 % günstiger bei der Ausgabe.
- **Gegen GPT-5.6 Terra** ist die Eingabe mit 2 $ identisch, aber Qwens Ausgabe ist halb so teuer. Für die Generierung langer Texte und rechenintensive Aufgaben ist das die Zahl, die Ihre Rechnung beeinflusst.
Preis ist nicht gleich Qualität, und Anbieter-Benchmark-Tabellen sind Anbieter-Benchmark-Tabellen. Aber auf reiner Preislistenebene ist Qwen 3.8-Max das günstigste Flaggschiff der Spitzenklasse in dieser Aufstellung.
Durchgerechnete Beispiele: Was reale Aufgaben kosten
Listenpreise bedeuten wenig ohne aufgabenbezogene Mathematik. Drei Szenarien, berechnet mit 2 $/6 $:
Beispiel 1: Eine 50.000-Token-Agentensitzung
Ein Agentenlauf verbraucht 38.000 Eingabetoken (Anweisungen, Tool-Schemata, Tool-Ergebnisse) und produziert 12.000 Ausgabetoken:
- Eingabe: 38.000 × 2 $ / 1.000.000 = **0,076 $**
- Ausgabe: 12.000 × 6 $ / 1.000.000 = **0,072 $**
- **Gesamt: ca. 0,15 $ pro Sitzung**
Fügen Sie nun die Standardeinstellung xhigh-Argumentation hinzu. Angenommen, das Modell verbraucht 8.000 Denk-Token während des Laufs. Die Ausgabe beträgt dann 20.000 Token: 20.000 × 6 $ / 1.000.000 = 0,12 $, und die Sitzung beläuft sich auf **etwa 0,20 $**. Das ist eine Steigerung von 33 % allein durch die Argumentation, weshalb Sie messen sollten, bevor Sie budgetieren.
Beispiel 2: Analyse langer Dokumente mit 800.000 Token
Sie laden 800.000 Token an Dokumenten in den Kontext und bitten um eine strukturierte Zusammenfassung von 5.000 Token:
- Eingabe: 800.000 × 2 $ / 1.000.000 = **1,60 $**
- Ausgabe: 5.000 × 6 $ / 1.000.000 = **0,03 $**
- **Gesamt: ca. 1,63 $ pro Lauf**
Die feste Stufe leistet hier die Arbeit. Jedes dieser 800.000 Token kostet den gleichen Preis von 2 $/1 Million wie die ersten Tausend. Bei einem gestaffelten Modell ist dies genau die Art von Anfrage, die die teure Preisklasse auslöst.
Beispiel 3: Ein gecachter 100.000-Token-System-Prompt, 50 Aufrufe pro Tag
Ihre Anwendung lädt bei jedem Aufruf, 50 Mal am Tag, 100.000 Token an System-Prompt, Produktdokumenten und Tool-Definitionen vor.
Ohne Caching: 100.000 × 2 $ / 1.000.000 = 0,20 $ pro Aufruf, also **10,00 $ pro Tag** allein für das Präfix.
Mit explizitem Caching: Die Erstellung kostet einmalig 100.000 × 2,50 $ / 1.000.000 = 0,25 $, dann 49 Cache-Treffer zu je 100.000 × 0,20 $ / 1.000.000 = 0,02 $, also 0,98 $. **Gesamt pro Tag: ca. 1,23 $**, eine Ersparnis von 88 %. Über einen Monat sind das etwa 300 $ im Vergleich zu unter 40 $.
Kosten anhand gemessener Nutzung schätzen, nicht raten
Alle drei Beispiele basieren auf angenommenen Token-Anzahlen. Ihre tatsächlichen Zahlen werden abweichen, und mit Denk-Token im Spiel werden sie auf Weisen abweichen, die Sie allein aus der Prompt-Länge nicht vorhersagen können. Die Lösung ist zu messen.
Ein praktischer Workflow: Besorgen Sie sich Ihren API-Schlüssel, richten Sie den Endpunkt ein (der Qwen 3.8 API-Leitfaden deckt alle drei regionalen Basis-URLs und sowohl die OpenAI-kompatiblen als auch die Anthropic-kompatiblen Protokolle ab) und senden Sie repräsentative Anfragen für jeden Aufgabentyp in Ihrer Anwendung. Jede Antwort liefert ein usage-Objekt mit genauen Eingabe-, Ausgabe- und Denk-Token-Zählungen.
Speichern Sie in Apidog die drei regionalen Basis-URLs als Umgebungen, senden Sie dieselbe Anfrage an jede reasoning_effort-Stufe und lesen Sie die Token-Nutzung direkt aus dem Antwortinspektor ab. Führen Sie zehn repräsentative Anfragen pro Aufgabentyp aus, mitteln Sie die Zählungen, multiplizieren Sie mit 2 $/6 $, und Sie haben ein Kostenmodell, das auf gemessenen Daten basiert. Sie können auch denselben Prompt A/B-testen gegen qwen3.7-max oder Kimi K3 im selben Arbeitsbereich, um zu sehen, ob das günstigere Modell bei Ihrer Arbeitslast standhält. Laden Sie Apidog kostenlos herunter, und Sie können innerhalb einer Stunde echte Kosten pro Aufgabe erhalten.
Fazit
Qwen 3.8-Max für 2 $/6 $ ist eine aggressive Preisgestaltung für ein Flaggschiff der Spitzenklasse: unter dem Listenpreis seines Vorgängers, die Hälfte der Ausgaberate von GPT-5.6 Terra, ein Bruchteil von Opus 5 und pauschal über einen vollen 1-Millionen-Token-Kontext, wo ein Großteil des Marktes gestaffelt ist. Hinzu kommen 10 % Cache-Treffer, und die Wirtschaftlichkeit für Workloads mit langem Kontext und hoher Wiederholung sieht wirklich stark aus.
Zwei Vorbehalte: Die Standardeinstellung xhigh-Argumentation erhöht die Abrechnung der Ausgabe über naive Schätzungen hinaus, und die damit verbundenen Angebote (3.7-Max mit 50 % Rabatt, die kostenlose Quote für Singapur) sind zeitlich begrenzt. Messen Sie Ihre tatsächliche Token-Nutzung, stellen Sie reasoning_effort bewusst ein, und die Preisliste hält nur wenige Überraschungen bereit.
Häufig gestellte Fragen
Kostet Qwen 3.8 mehr für lange Prompts?
Nein. Die offizielle Preisgestaltung listet eine einzige Stufe auf, die 0 bis 1 Million Token abdeckt, sodass ein 900.000-Token-Prompt zum gleichen Preis von 2 $ pro 1 Million Eingabetoken abgerechnet wird wie ein kurzer. Dies unterscheidet sich von gestaffelten Modellen, einschließlich einiger in Alibabas eigenem Katalog auf der Model Studio Modellliste, wo die Preise mit der Kontextlänge steigen.
Kosten Denk-Token bei Qwen 3.8 zusätzlich?
Es gibt keinen separaten Denk-Tarif: Denk- und Nicht-Denk-Modi werden zum gleichen Preis von 2 $/6 $ abgerechnet. Aber Denk-Token zählen als Ausgabetoken zu 6 $ pro 1 Million, und reasoning_effort ist standardmäßig auf xhigh eingestellt. Rechenintensive Anfragen kosten daher mehr, als die sichtbare Antwort vermuten lässt. Reduzieren Sie den Aufwand für einfache Aufgaben und überprüfen Sie das usage-Objekt in jeder Antwort, um zu sehen, wofür Sie tatsächlich bezahlen.
Gibt es eine kostenlose Möglichkeit, Qwen 3.8 auszuprobieren?
Ja. Model Studio beinhaltet eine kostenlose Quote von 1 Million Token, gültig für 90 Tage, nur am Endpunkt der Region Singapur. Qwen Chat bietet auch kostenlosen Zugang im Browser. Beide Wege, plus das Kleingedruckte, sind unter wie man Qwen 3.8 kostenlos nutzt beschrieben.
Ist der alte „10 % Vorschaupreis“ noch verfügbar?
Nein. Das war eine Promotion aus der Vorschauphase, die in der Presseberichterstattung vom Juli 2026 erwähnt wurde; die allgemeine Verfügbarkeit ersetzte sie durch die Standard-Preisliste von 2 $/6 $. Betrachten Sie die Model Studio Preisgestaltungsseite als die Quelle der Wahrheit.
