Zwei Wochen lang hatte die Geschichte von Qwen 3.8 ein Loch. Die Pressevorpremieren im Juli versprachen ein Modell der Spitzenklasse, lieferten aber keine Bewertungen, sodass jede frühe Berichterstattung auf bloßem Gefühl basierte. Das änderte sich am 3. August 2026. Alibabas offizieller Release-Beitrag für Qwen 3.8-Max enthält eine vollständige Benchmark-Tabelle gegen Claude Opus 4.8, Fable 5, GPT-5.6 Sol und seinen eigenen Vorgänger Qwen3.7-Max, sowie eine separate multimodale Tabelle gegen Gemini 3.1 Pro und GPT-5.6 Sol.
Diese Tabelle ist es wert, genau gelesen zu werden. Sie enthält echte Erfolge, ehrliche Misserfolge und Kleingedrucktes, das die meisten Berichte völlig übergehen werden. Dieser Beitrag geht auf alle drei Punkte ein und bietet Ihnen dann eine praktische Möglichkeit, Anbieter-Tabellen ganz und gar nicht mehr zu vertrauen: Führen Sie Ihre eigene Evaluierung gegen die API durch. Wenn Sie zuerst die vollständige Modellübersicht (Parameter, Preise, Zugriff) wünschen, beginnen Sie mit unserem Qwen 3.8-Max Erklärer und kehren Sie dann hierher zurück.
Eine einleitende Anmerkung vor den Zahlen. Jede der untenstehenden Bewertungen stammt aus Alibabas eigener veröffentlichter Tabelle, wobei die Leaderboard-Daten in den Fußnoten auf den 3. August 2026 datiert sind. Zum Zeitpunkt des Verfassens dieses Artikels gab es keine unabhängigen Evaluierungen. Beachten Sie dies für jede folgende Zeile.
Die Tabelle, auf einen Blick
Hier sind die wichtigsten Zeilen des Textmodells, wie sie von Alibaba veröffentlicht wurden. Höher ist bei all diesen besser.
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (Humanity’s Last Exam) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
Quelle: Alibabas vom Anbieter erstellte Tabelle. Was „vom Anbieter erstellt“ in der Praxis bedeutet, erläutern wir weiter unten, da es hier mehr als sonst ins Gewicht fällt.

Wo Qwen 3.8-Max gewinnt
PaperBench: seine beste Flaggschiff-Reihe
PaperBench, das testet, ob ein Modell Forschungsergebnisse reproduzieren kann, ist Qwen 3.8-Max’s stärkste Leistung an der Spitze: 93,0, vor GPT-5.6 Sol mit 90,5, Fable 5 mit 88,8 und Opus 4.8 mit 80,3. Es ist auch ein erstaunlicher Sprung von Qwen3.7-Max’s 64,8. Ein Generationensprung von 28 Punkten bei einem Benchmark verdient eine genaue Prüfung, aber wenn er sich bei unabhängigen Tests bewährt, sagt er etwas Echtes über die langfristige Forschungsfähigkeit des Modells aus.
IFBench: Anweisungsbefolgung mit großem Vorsprung
Auf IFBench erreicht Qwen 3.8-Max 82,8. Der nächste Nicht-Qwen-Konkurrent in der Tabelle ist GPT-5.6 Sol mit 72,7, gefolgt von Fable 5 mit 63,5 und Opus 4.8 mit 62,2. Das ist eine Lücke von 10 bis 20 Punkten, was bei einem so gesättigten Benchmark ungewöhnlich ist. Interessanterweise führte Qwen3.7-Max diese Reihe bereits mit 79,1 an, sodass die Anweisungsbefolgung eher eine dauerhafte Stärke von Qwen zu sein scheint als ein einmaliger Erfolg.
Terminal Bench 2.1: knapp an Claude vorbei
Bei Alibabas Durchführung von Terminal Bench 2.1 erzielt Qwen 3.8-Max 86,6 Punkte gegenüber 84,6 für Opus 4.8 und Fable 5. GPT-5.6 Sol führt die Reihe immer noch mit 88,8 an, sodass dies ein zweiter Platz und kein klarer Sieg ist. Aber beide Anthropic-Flaggschiffe bei einem agentenbasierten Terminal-Benchmark zu schlagen, ist genau das Ergebnis, das Alibaba mit diesem Launch erzielen wollte, und der Zwei-Punkte-Vorsprung vor Claude ist die Zahl, die überall zitiert werden wird.
Der multimodale Erfolg
Die separate multimodale Tabelle zeigt Qwen 3.8-Max insgesamt am stärksten. Alibaba meldet MathVision mit 95,2, LogicVista mit 91,9 und OSWorld-Verified mit 86,1, und das Modell führt fast jede OCR-Zeile in der Tabelle an. Weder Opus 4.8 noch Fable 5 konkurrieren hier direkt (sie sind in diesem Vergleich textorientiert), weshalb die multimodale Tabelle teilweise wie ein klarer Sieg aussieht. Gegen Gemini 3.1 Pro und GPT-5.6 Sol sind die Zeilen für visuelle Argumentation und Dokumentenintelligenz die klarsten Unterscheidungsmerkmale des Modells.
Wenn man es gegen die andere große Open-Weight-Veröffentlichung des Sommers abwägt, ist die multimodale Lücke auch der schärfste Kontrast: Kimi K3 ist nur textbasiert. Unser Vergleich von Qwen 3.8 vs Kimi K3 behandelt dieses Matchup vollständig.
Wo es verliert, ehrlich dargestellt
Alibaba hat die Verluste in der Tabelle belassen, was Respekt verdient. Drei stechen hervor.
HLE: 43.6, weit hinter Fable 5. Bei Humanity’s Last Exam, dem breitgefächerten Wissens-Benchmark der Spitzenklasse, erzielt Qwen 3.8-Max 43,6 Punkte. Fable 5 liegt bei 53,3, GPT-5.6 Sol bei 47,2 und Opus 4.8 bei 45,7. Das ist der letzte Platz unter den vier Flaggschiffen, fast 10 Punkte hinter dem Spitzenreiter. Es schlägt Qwen3.7-Max’s 41,4, aber nur knapp. HLE widersteht spezifischem Benchmark-Tuning besser als die meisten Evaluierungen, was diese Zeile stark gewichten lässt.
SWE-bench Pro: 67.7 vs Fable 5’s 80.0. Beim anspruchsvolleren Software-Engineering-Benchmark liegt Qwen 3.8-Max im Mittelfeld: vor GPT-5.6 Sol (64,6), knapp hinter Opus 4.8 (69,2) und volle 12 Punkte hinter Fable 5. Die generationenübergreifende Verbesserung gegenüber Qwen3.7-Max (60,6) ist real, aber „schlägt Claude auf Terminal Bench“ und „liegt auf SWE-bench Pro deutlich hinter Fable 5“ sind beides gleichzeitig wahr, und die zweite Behauptung wird in weitaus weniger Schlagzeilen erscheinen.
DeepSWE und die schwierigeren agentenbasierten Zeilen. DeepSWE ist eine weitere Zeile, in der Qwen 3.8-Max in Alibabas eigener Tabelle hinter der Spitze zurückbleibt. Das Muster im gesamten Coding-Bereich ist konsistent: wettbewerbsfähig bei terminalgesteuerten agentenbasierten Aufgaben, aber zurückliegend bei den tiefgreifendsten Software-Engineering-Evaluierungen.
Die ehrliche Zusammenfassung: Qwen 3.8-Max schlägt Opus 4.8 in mehreren agentenbasierten Zeilen, liegt bei den meisten Kernaufgaben der Codierung hinter Fable 5 zurück und gewinnt stark bei multimodaler und Dokumentenintelligenz. Das ist ein wirklich starkes Ergebnis für ein Modell, das mit 2 $ Input und 6 $ Output pro Million Tokens bepreist ist (siehe die offizielle Preisseite), aber es ist nicht der umfassende Spitzensieg, den ein oberflächliches Durchlesen der Launch-Berichterstattung vermuten lassen könnte.
Das Kleingedruckte, das die meisten Berichte übergehen werden
Dies ist der Abschnitt, der das Lesen eines Benchmark-Beitrags statt einer Schlagzeile rechtfertigt. Vier Details aus Alibabas eigener Veröffentlichung ändern, wie Sie die Tabelle lesen sollten.
1. Jede Zahl ist vom Anbieter erstellt. Alibaba hat sein eigenes Modell und die Modelle seiner Konkurrenten evaluiert. Das ist gängige Praxis bei Starttabellen und auch der übliche Grund, warum Starttabellen später überarbeitet werden. Anbieter wählen die Benchmark-Versionen, die Prompting-Strategien, die Sampling-Einstellungen und die Wiederholungsrichtlinien. Nichts davon ist Betrug. Alles davon ist ein Daumen auf der Waage.
2. Die meisten Coding-Zeilen liefen auf dem Claude Code Harness. Dies ist das wirklich interessante Detail. Alibaba führte die meisten seiner Coding-Benchmarks mit Claude Code, Anthropic’s eigenem Agent-Harness, durch, der über seine Anthropic-kompatible API auf Qwen 3.8-Max zeigte. Einerseits ist das ein Fair-Play-Zug: Es evaluiert jedes Modell innerhalb desselben weit verbreiteten Tools. Andererseits bedeutet es, dass „Qwens Coding-Scores“ eigentlich „Qwen innerhalb von Anthropic’s Harness“-Scores sind, und die Wahl des Harness kann agentenbasierte Ergebnisse um mehrere Punkte beeinflussen. Es sagt auch etwas darüber aus, wo Alibaba erwartet, dass dieses Modell in der Praxis eingesetzt wird.
3. Mehrere Benchmarks sind Qwen-interne Entwicklungen. QwenSWEBench, QwenQoderBench, CoWorkBench und RecreationBench wurden alle vom Qwen-Team entwickelt. Interne Benchmarks sind nicht wertlos; sie untersuchen oft Fähigkeiten, die öffentliche Evaluierungen übersehen. Aber ein starkes Ergebnis eines Modells bei einem vom Hersteller selbst entwickelten Benchmark ist eine andere Art von Beweis als ein starkes Ergebnis bei SWE-bench Pro, und die Tabelle präsentiert beide nebeneinander ohne visuellen Unterschied. Wenn Sie eine Zahl aus dieser Tabelle zitieren, prüfen Sie zuerst, zu welcher Kategorie sie gehört.
4. Die Fußnote zu Fable 5. Alibabas eigene Tabelle enthält eine Fußnote, die besagt: „Fable5-Ergebnisse können Fallbacks beinhalten.“ Das ist ein stillschweigendes Eingeständnis, dass die Zahlen mindestens eines Konkurrenten möglicherweise nicht das sauber laufende Modell widerspiegeln. Unabhängig von der technischen Ursache bedeutet dies, dass die Spalte Fable 5, das Modell, dem Qwen 3.8-Max am häufigsten hinterherhinkt, von den Verfassern mit einem Sternchen versehen ist.
Nichts davon ist einzigartig für Alibaba. Anthropic, OpenAI und Google veröffentlichen alle selbst erstellte Tabellen mit ihren eigenen methodischen Entscheidungen. Wir haben dasselbe Muster in unserer Kimi K3 Benchmarks-Aufschlüsselung festgestellt, und es galt auch dort. Der Punkt ist nicht, dass Alibaba betrogen hat. Der Punkt ist, dass eine Anbietertabelle eine Behauptung ist, keine Messung.
Worauf zu achten ist und wie die nächste Tabelle zu lesen ist
Mit Stand vom 3. August 2026 existieren keine unabhängigen Evaluierungen von Qwen 3.8-Max. Artificial Analysis hatte zum Zeitpunkt des Verfassens dieses Artikels keine Zahlen veröffentlicht, und keines der Community-Leaderboards hatte das Modell bewertet. Das wird sich innerhalb weniger Tage ändern, und die Unterschiede zwischen Alibabas Tabelle und den unabhängigen Läufen werden die wahre Geschichte sein. Wir werden diesen Beitrag aktualisieren, sobald sie vorliegen.
Bis dahin finden Sie hier eine kurze Checkliste zur Beurteilung jeder Anbieter-Benchmark-Tabelle, diese hier eingeschlossen:
- Wer hat die Evaluierung durchgeführt? Selbst gemeldete Zahlen für Wettbewerber verdienen mehr Skepsis als selbst gemeldete Zahlen für das eigene Modell des Anbieters.
- Welches Harness und welche Einstellungen? Agentenbasierte Benchmarks sind Harness-sensitiv. Eine Tabelle, die ihr Harness benennt (wie Alibaba es getan hat), ist nützlicher als eine, die es nicht tut, aber die Wahl beeinflusst dennoch die Ergebnisse.
- Welche Benchmarks hat der Anbieter selbst entwickelt? Interne Evaluierungen messen etwas, aber nicht dasselbe wie öffentliche.
- Lesen Sie die Fußnoten. „Kann Fallbacks beinhalten“ leistet viel Arbeit in kleiner Schrift.
- Prüfen Sie, was fehlt. Zeilen, die ein Anbieter nicht veröffentlicht hat, sind oft genauso aufschlussreich wie jene, die er veröffentlicht hat. Frühere Anbieter-Tabellen haben Benchmarks, bei denen das Modell schlecht abschnitt, stillschweigend weggelassen; vergleichen Sie mit wie die letzte Generation bei verschiedenen Anbietern abschnitt, um zu erkennen, welche Zeilen verschwunden sind.
- Warten Sie auf die zweite Quelle. Eine Woche Geduld bringt Ihnen in der Regel unabhängige Zahlen.
Führen Sie stattdessen Ihre eigene Evaluierung durch
Die Checkliste hilft Ihnen, Tabellen zu lesen. Der bessere Schritt ist, sie weniger zu benötigen. Qwen 3.8-Max ist jetzt auf Alibaba Cloud Model Studio verfügbar (Modell-ID qwen3.8-max, auf der offiziellen Modellseite gelistet) mit einer OpenAI-kompatiblen und einer Anthropic-kompatiblen API, und ein Benchmark, der Ihre tatsächlichen Prompts verwendet, schlägt jede öffentliche Evaluierung, die das nicht tut.
Eine praktische Einrichtung in Apidog sieht so aus. Erstellen Sie eine Anfrage an den Model Studio Chat-Completions-Endpunkt mit qwen3.8-max und eine zweite identische Anfrage an Ihr aktuelles Basismodell, sei es Qwen3.7-Max, Kimi K3 oder ein Claude- oder GPT-Endpunkt. Speichern Sie 20 bis 30 Ihrer realen Produktions-Prompts als Testszenario, fügen Sie Assertions für die Antworteigenschaften hinzu, die Ihnen tatsächlich wichtig sind (gültiges JSON, erforderliche Felder vorhanden, Latenz unter Ihrem Schwellenwert), und führen Sie beide Szenarien nacheinander aus. Apidogs Testberichte liefern Ihnen Pass-Raten und Antwortzeiten pro Modell, nebeneinander, für Ihre Arbeitslast statt der von Alibaba.
Zwei Qwen-spezifische Dinge, die Sie dabei überprüfen sollten: Das Modell verwendet standardmäßig reasoning_effort: xhigh, messen Sie also Kosten und Latenz auf dem Anstrengungsniveau, das Sie wirklich liefern würden, und wenn Sie den Anthropic-kompatiblen Endpunkt verwenden möchten, testen Sie diese Protokollform separat, da dies diejenige ist, durch die die meisten von Alibabas eigenen Coding-Benchmarks liefen. Laden Sie Apidog herunter, richten Sie beide Endpunkte als Umgebungen ein, und Sie erhalten eigene Zahlen, bevor die unabhängigen Leaderboards ihre veröffentlichen.
Häufig gestellte Fragen
Sind die Qwen 3.8 Benchmark-Zahlen unabhängig verifiziert?
Nein. Stand 3. August 2026 stammen alle veröffentlichten Zahlen aus Alibabas eigener Tabelle. Artificial Analysis und die Community-Bestenlisten hatten Qwen 3.8-Max zum Zeitpunkt des Verfassens noch nicht bewertet. Betrachten Sie die Tabelle als Behauptung des Anbieters, bis unabhängige Ergebnisse vorliegen.
Was ist Qwen 3.8-Max’s bestes Benchmark-Ergebnis?
PaperBench, mit 93,0, ist seine beste Flaggschiff-Tabellenzeile: vor GPT-5.6 Sol (90,5), Fable 5 (88,8) und Opus 4.8 (80,3). In der multimodalen Tabelle sind MathVision (95,2) und die OCR-Zeilen die insgesamt stärksten Ergebnisse.
Wo verliert Qwen 3.8-Max deutlich?
Bei HLE erzielt es 43,6 Punkte, den letzten Platz unter den vier Flaggschiffen und weit hinter Fable 5 mit 53,3. Bei SWE-bench Pro erreicht es 67,7 Punkte gegenüber Fable 5’s 80,0, und es liegt auch bei DeepSWE zurück. Tiefe Software-Engineering-Evaluierungen und breite Wissensprüfungen sind die schwächsten Bereiche in Alibabas eigener Tabelle.
Wie viel besser ist Qwen 3.8 als Qwen 3.7-Max bei Benchmarks?
Die generationenübergreifenden Gewinne in Alibabas Tabelle sind groß: Terminal Bench 2.1 stieg von 74,5 auf 86,6, SWE-bench Pro von 60,6 auf 67,7 und PaperBench von 64,8 auf 93,0. Ob das Upgrade für Ihre Arbeitslast lohnenswert ist, hängt auch vom Preis und der Modalität ab; unser Vergleich von Qwen 3.8 vs Qwen 3.7 führt Sie durch die vollständige Entscheidung.
