Der Juli 2026 entwickelte sich zu einem Monat mit zwei führenden Anbietern für Open-Weight-Frontier-Modelle, und beide kamen aus China. Moonshot AI lieferte Kimi K3 am 16. Juli aus. Drei Tage später stellte Alibaba Qwen 3.8-Max vor und machte es Anfang August allgemein verfügbar. Beide sind Mixture-of-Experts-Modelle mit Billionen von Parametern. Beide versprechen (oder liefern) offene Gewichte. Beide lassen sich in Agent-Harnesses im Claude Code-Stil integrieren. Und beide unterbieten die Preise der US-amerikanischen Frontier-Labs.
Die oberflächliche Ähnlichkeit verbirgt echte Unterschiede: in dem, was Sie heute herunterladen können, in dem, was die Modelle sehen können, und in dem, was ein Monat intensiver Nutzung kostet. Dieser Vergleich beleuchtet jede Achse, die Sie am 3. August 2026 überprüfen können. Für eine vollständige Spezifikationsanalyse von Alibabas neuem Flaggschiff, beginnen Sie mit unserem Qwen 3.8-Max Erklärer und kehren Sie dann hierher zurück.
Ein Hinweis zur Ehrlichkeit, bevor wir beginnen: Es gibt noch keinen unabhängigen direkten Benchmark dieser beiden Modelle. Jede Zahl in diesem Artikel stammt aus der eigenen Tabelle eines Anbieters, und wir kennzeichnen, von welchem Anbieter jede Zahl stammt. Betrachten Sie den Benchmark-Abschnitt als indikativ, nicht als endgültig.
Der Zeitplan: Wer was wann ausgeliefert hat
Die Reihenfolge der Veröffentlichung ist hier wichtiger als sonst, denn „offene Gewichte“ bedeutet für jedes Modell derzeit etwas anderes.
Kimi K3 wurde am 16. Juli 2026 eingeführt. Moonshot versprach zum Start offene Gewichte und lieferte diese 11 Tage später: Die Gewichte wurden am 27. Juli als 594 GB MXFP4-Release auf Hugging Face veröffentlicht. Stand heute können Sie K3 herunterladen, weiter quantisieren und auf Ihrer eigenen Hardware ausführen. Das ist kein Versprechen. Es ist geschehen.
Qwen 3.8-Max wurde am 19. Juli als Vorschau vorgestellt und erreichte Anfang August die allgemeine Verfügbarkeit im Alibaba Cloud Model Studio, gemäß dem offiziellen Qwen-Release-Post. Die Gewichte werden für Hugging Face und ModelScope „nächste Woche“ versprochen, was sie um den 10. August herum ansiedelt. Stand 3. August 2026 sind sie nicht herunterladbar. K3s eigene 11-Tage-Lücke zwischen Start und Gewichten zeigt, dass dieser Verlauf normal ist, aber heute ist nur eines dieser Modelle in der Praxis offen.
Wenn Selbsthosting Ihr entscheidender Faktor ist, könnte diese einzelne Tatsache den Vergleich frühzeitig beenden.
Parameter: zwei MoE-Modelle im Billionenbereich, eines schlanker
Beide Modelle sind sparse Mixture-of-Experts-Designs, was bedeutet, dass die angegebene Parameteranzahl und die Pro-Token-Berechnungskosten sehr unterschiedliche Zahlen sind.
| Spezifikation | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Gesamtparameter | 2,4 T | 2,8 T |
| Aktive Parameter pro Token | 95 Mrd. | 104 Mrd. |
| Aktivierungsverhältnis | ~4% | ~3,7% |
| Architektur-Basis | Qwen 3.5 Basis, MoE | MoE |
| Open-Weight-Format | Versprochen (~10. Aug.) | MXFP4, 594 GB auf Hugging Face |
Qwen 3.8-Max ist in beiden Aspekten das kleinere Modell: 400 Mrd. weniger Gesamtparameter und 9 Mrd. weniger aktive Parameter als K3. Keine der Lücken ist dramatisch, und die Anzahl der aktiven Parameter lässt sich nicht linear in Leistungsfähigkeit übersetzen. Worauf sie sich jedoch auswirkt, sind die Bereitstellungskosten. Ein Modell, das 95 Mrd. Parameter pro Token aktiviert, ist im großen Maßstab günstiger zu betreiben als eines, das 104 Mrd. aktiviert, alles andere gleichbleibend, und dieser Unterschied zeigt sich in den unten aufgeführten API-Preisen.
Für Selbsthoster ist die relevantere Zahl K3s 594 GB Download in MXFP4-Präzision. Das ist Multi-Node-Gebiet, noch bevor man den KV-Cache bei langem Kontext berücksichtigt. Erwarten Sie, dass Qwen 3.8-Max mit insgesamt 2,4 T in einer ähnlichen Gewichtsklasse landen wird, wenn seine Dateien erscheinen. Die meisten Teams werden gehostete Endpunkte für beide Modelle verwenden und das Selbsthosting für Compliance- oder Forschungsfälle reservieren.
Offenheit heute: Live-Gewichte vs. ein veraltetes Versprechen
Diese Achse verdient einen eigenen Abschnitt, da das Marketing auf beiden Seiten von „offen“ spricht, während die Fakten unterschiedlich sind.
Die Gewichte von Kimi K3 sind öffentlich. Sie können das Repo überprüfen, die Lizenz einsehen und die Dateien sofort herunterladen. Das ermöglicht alles, was echte Offenheit mit sich bringt: Hosting durch Dritte, Community-Quantisierungen, Fine-Tuning und die Gewissheit, dass das von Ihnen getestete Modell nicht heimlich ausgetauscht werden kann.
Qwen 3.8-Max wäre das erste Qwen-Max-Klasse-Modell, das jemals mit offenen Gewichten veröffentlicht wird, eine echte strategische Verschiebung bei Alibaba, nachdem alle früheren Modelle der Max-Stufe nur über API zugänglich waren. Aber ein Erstes ist nur dann ein Erstes, wenn es passiert. Solange das Hugging Face Repo nicht live ist, ist Qwen 3.8-Max ein API-Modell mit einer angehängten Ankündigung.
Bewerten Sie diese Achse heute für K3, mit einem Bleistiftvermerk zur erneuten Überprüfung um den 10. August. Wenn Alibaba liefert, wird die Achse unentschieden, und der Vergleich verschiebt sich auf Lizenzbedingungen und Quantisierungsqualität.
Modalität: Qwen sieht Bilder, K3 liest Text
Hier verläuft die Lücke in die andere Richtung, und sie ist nicht gering.
Qwen 3.8-Max akzeptiert Text- und Bildeingaben, gemäß den offiziellen Modellkonfigurationen ("input_modalities": ["text", "image"]). Alibabas Launch-Post geht weiter und demonstriert das Verständnis langer Dokumente über PDFs mit mehr als 200 Seiten und die 100-stündige Videokompetenz mittels Speicherdiagrammen; betrachten Sie diese als Blog-Demos, nicht als dokumentierte API-Eingabetypen. Die Bildeingabe ist jedoch real und heute in der API verfügbar. Alibabas Anbieter-Benchmarks stützen sich darauf: Die multimodale Tabelle (MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1, starke OCR-Zeilen) ist der Bereich, in dem Qwen 3.8-Max seine einseitigsten Zahlen veröffentlicht.
Kimi K3 ist ein Textmodell. Wenn Ihre Arbeitslast Screenshots, gescannte Dokumente, UI-Verständnis oder jede vision-nahe Agentenaufgabe umfasst, benötigt K3 ein separates Visionsmodell, das an die Pipeline angeschraubt wird, mit all dem Klebecode und der zusätzlichen Latenz, die dies impliziert.
Für rein textbasierte Codierung und Agentenarbeit ist diese Achse irrelevant. Für Dokumentenintelligenz und Computer-Use-Agenten ist sie entscheidend.
Kontext, Ausgabe und die API-Oberfläche
Qwen 3.8-Max liefert ein 1.000.000-Token-Kontextfenster als eine einzige, flache Stufe, mit einer maximalen Ausgabe von 65.536 Tokens. Die Argumentation wird durch einen reasoning_effort-Parameter gesteuert (standardmäßig xhigh, mit medium und low), und die Denk-Ausgabe wird standardmäßig beibehalten. Bemerkenswert ist, dass Denk- und Nicht-Denk-Modi zum gleichen Satz abgerechnet werden.
Der Zugriff erfolgt über das Alibaba Cloud Model Studio mit drei regionalen Basis-URLs (Peking, Singapur, US-Virginia) und, ungewöhnlicherweise, zwei Protokollformen auf einer Plattform: einem OpenAI-kompatiblen Endpunkt und einem Anthropic-kompatiblen Endpunkt. Diese Dual-Protokoll-Oberfläche ist der Grund, warum Qwen 3.8-Max mit nichts weiter als ANTHROPIC_BASE_URL und ANTHROPIC_MODEL=qwen3.8-max in Claude Code integriert werden kann. Die vollständige Aufstellung und regionale Verfügbarkeit sind auf der Model Studio Modelle-Seite dokumentiert; wenn Sie über Regionen hinweg arbeiten, ermöglichen Tools wie Apidog Ihnen, jede Basis-URL als Umgebung zu speichern und ohne Bearbeitung von Anfragen zwischen ihnen zu wechseln.
Kimi K3 spricht ebenfalls das Anthropic-Protokoll und passt in Claude Code-ähnliche Harnesses, genau deshalb konkurrieren diese beiden Modelle um denselben Platz: den „Richten Sie Ihr bestehendes Agenten-Harness auf ein günstigeres Frontier-Modell aus“-Platz. Für K3s Endpunktdetails und aktuelle Grenzen, siehe unseren Kimi K3 Erklärer, anstatt Zahlen zu vertrauen, die sich seit dem Start möglicherweise geändert haben.
Preisgestaltung: Pauschal und einfach vs. günstig rein, teuer raus
Hier sind die veröffentlichten Tarife pro Million Tokens:
| Tarif | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Eingabe | 2,00 $ | 3,00 $ |
| Ausgabe | 6,00 $ | 15,00 $ |
| Cache-Hit-Eingabe | 0,20 $ (10% der Eingabe) | 0,30 $ |
| Staffelung | Pauschal über den gesamten 1M Kontext | Gemäß Moonshots veröffentlichtem Zeitplan |
Qwen 3.8-Max kostet 2 $ für die Eingabe und 6 $ für die Ausgabe, pauschal von Token Null bis Token eine Million, denkend oder nicht, gemäß der offiziellen Model Studio Preisgestaltungsseite. Die explizite Cache-Erstellung wird mit 125% der Eingabe abgerechnet, Cache-Hits mit 10%. Es gibt auch ein kostenloses Kontingent: 1 Million Tokens, nur in der Region Singapur, 90 Tage gültig.
K3s Tarife betragen 0,30 $ pro Million bei Cache-Hits, 3 $ pro Million Eingabe und 15 $ pro Million Ausgabe.
Der Vergleich ist keine einzelne Zahl. Bei eingabeintensiven Arbeitslasten mit guter Cache-Disziplin (lange System-Prompts, wiederholter Dokumentkontext) liegen die beiden Modelle näher beieinander, als es der Aufkleber vermuten lässt: 0,20 $ vs. 0,30 $ pro gecachtem Megatoken ist eine geringe Lücke. Bei ausgabeintensiven Arbeitslasten ist die Lücke groß: K3s Ausgaberate von 15 $ ist 2,5-mal höher als Qwens 6 $. Agenten-Loops, die viel Argumentation und Code generieren, sind ausgabelastig, was Qwen 3.8-Max auf dem Papier begünstigt.
Eine Vorsichtsmaßnahme, die speziell für Qwen gilt: reasoning_effort ist standardmäßig auf xhigh eingestellt, und Denk-Tokens werden als Ausgabe abgerechnet. Echte Rechnungen werden über dem liegen, was eine naive Schätzung der Token-Ein- und -Ausgabe vorhersagt. Unsere Qwen 3.8 Preisaufschlüsselung geht Beispiele für Kosten pro Aufgabe durch, wenn Sie dies modellieren möchten, bevor Sie sich festlegen.
Benchmarks: zwei Anbieter-Tabellen, kein Schiedsrichter
Hier gehen die meisten Vergleiche dieser beiden Modelle schief, daher sollten wir präzise sein, was existiert.
Was existiert: Alibaba veröffentlichte eine Benchmark-Tabelle für Qwen 3.8-Max im Vergleich zu Claude Opus 4.8, Fable 5, GPT-5.6 Sol und Qwen 3.7-Max. Moonshot veröffentlichte seine eigene Starttabelle für Kimi K3 gegen eine ähnliche Frontier-Besetzung. Beide wurden vom jeweiligen Anbieter durchgeführt.
Was nicht existiert: jede unabhängige Bewertung, die Qwen 3.8-Max und Kimi K3 in derselben Tabelle unter demselben Harness platziert. Zum Zeitpunkt des Schreibens waren keine Zahlen von Artificial Analysis für Qwen 3.8-Max verfügbar. Die beiden Anbieter haben die Modelle des jeweils anderen nicht gebenchmarkt.
Mit diesem Rahmen, hier ist, was jede Seite auf ihrem eigenen Lauf beansprucht.
Aus Alibabas Tabelle (Alibabas Durchführung, größtenteils über das Claude Code Harness ausgeführt, ein Detail, das Alibaba selbst offenlegt):
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 |
| HLE | 43.6 | 45.7 | 53.3 | 47.2 |
Alibabas eigene Zahlen zeigen deutliche Verluste: Qwen 3.8-Max liegt bei SWE-bench Pro weit hinter Fable 5 zurück und hinter allen anderen bei HLE. Seine herausragenden Reihen sind PaperBench, Anweisungsbefolgung (IFBench 82.8) und der multimodale Sweep. Mehrere andere Schlagzeilen-Ergebnisse verwenden Alibabas interne Benchmarks (QwenSWEBench, CoWorkBench und andere), die nicht mit denen anderer verglichen werden können.
Von Moonshots Seite zeigte K3s Starttabelle, dass es Claude Opus 4.8 in den Schlagzeilen-Benchmark-Reihen von Moonshot übertraf, während es Fable 5 und GPT-5.6 Sol insgesamt hinter sich ließ. Wir haben diese Behauptungen und ihre Vorbehalte in unserem Kimi K3 vs. Claude Opus 4.8 Vergleich behandelt.
Kann man die beiden Tabellen, wo Benchmarks überlappen, aneinanderreihen? Man kann, und die Leute werden es tun, aber unterschiedliche Harnesses, Gerüststrukturen und Sampling-Einstellungen machen Vergleiche über Tabellen hinweg bestenfalls indikativ. Die ehrliche Zusammenfassung: Beide Anbieter zeigen, dass ihr Modell auf Agentenaufgaben wettbewerbsfähig und selektiv der US-Frontier überlegen ist. Keine der Tabellen entscheidet, welches der beiden stärker ist. Für das Kleingedruckte zu Alibabas Zahlen, siehe unsere Qwen 3.8 Benchmarks-Analyse.
Führen Sie Ihren eigenen direkten Vergleich in Apidog durch
Da kein Schiedsrichter existiert, ist der nützlichste Benchmark derjenige, den Sie mit Ihrer eigenen Arbeitslast durchführen. Beide Modelle stellen OpenAI-kompatible Chat-Completions-Endpunkte bereit, was einen direkten Vergleich in Apidog unkompliziert macht.
Richten Sie zwei Umgebungen ein: eine mit der DashScope-Basis-URL und qwen3.8-max, die andere mit Moonshots Endpunkt und der K3-Modell-ID, jeweils mit eigener API-Schlüssel-Variable. Speichern Sie eine Anfrage mit Ihrem echten Prompt (eine tatsächliche Aufgabe aus Ihrem Produkt, kein Rätsel) und wechseln Sie zwischen den Umgebungen, um dieselbe Nutzlast an beide Modelle zu senden. Apidogs Antwortansicht zeigt Ihnen Status, Latenz und den vollständigen Text nebeneinander, und sein SSE-Debugging zeigt, wie jedes Modell Denk-Inhalte streamt, was wichtig ist, wenn Ihre Benutzeroberfläche Denk-Tokens rendert. Fügen Sie ein paar Assertions hinzu (Antwortschema, Latenz-Obergrenze, erforderliche Schlüsselwörter in der Ausgabe) und Sie haben aus einem „Vibe Check“ einen wiederholbaren Test gemacht, den Sie erneut ausführen können, wenn einer der Anbieter ein Update liefert. Laden Sie Apidog kostenlos herunter, um den Vergleich durchzuführen; zehn Prompts durch beide Endpunkte werden Ihnen mehr sagen als jede Anbieter-Tabelle.
Die Scorecard
| Achse | Gewinner heute | Einschränkung |
|---|---|---|
| Gesamt-/aktive Parameter | Qwen 3.8-Max (schlanker: 2,4T/95 Mrd. vs. 2,8T/104 Mrd.) | Kleiner ist an sich weder besser noch schlechter; es signalisiert hauptsächlich die Bereitstellungskosten |
| Offene Gewichte, heute | Kimi K3 (live auf Hugging Face, 594 GB MXFP4) | Qwens Gewichte sollen ~10. Aug. erscheinen; erneut prüfen, diese Achse könnte bald unentschieden sein |
| Modalität | Qwen 3.8-Max (Text- + Bildeingabe) | Video-/Langdokument-Behauptungen sind Blog-Demos, keine dokumentierten API-Eingabetypen |
| Kontextfenster | Qwen 3.8-Max (1M Pauschalstufe, 65.536 maximale Ausgabe) | Überprüfen Sie K3s aktuelle Limits anhand von Moonshots Dokumentation für Ihren Anwendungsfall |
| Preis | Qwen 3.8-Max (2 $/6 $ pauschal vs. 3 $/15 $) | Standardmäßige xhigh-Denkprozesse erhöhen Qwens tatsächliche Ausgaberechnungen |
| Benchmarks | Keine Aussage möglich | Beide Tabellen sind Anbieter-geführt; es existiert kein unabhängiger direkter Vergleich |
| Harness-Ökosystem | Unentschieden | Beide passen in Claude Code-ähnliche Harnesses über Anthropic-Protokoll-Endpunkte |
| Erfüllung der Versprechen | Kimi K3 | Gewichte wurden 11 Tage nach dem Start ausgeliefert; Qwens Versprechen ist noch offen |
Welches wann
Wählen Sie Kimi K3, wenn Sie diese Woche Gewichte auf Ihrer eigenen Hardware benötigen, Ihre Compliance-Haltung ein Modell erfordert, das Sie festlegen und prüfen können, oder Ihre Arbeitslast rein textbasiert und eingabeintensiv genug ist, dass die Cache-Preise dominieren.
Wählen Sie Qwen 3.8-Max, wenn Ihre Arbeitslast Bilder oder Dokumente betrifft, Sie viele Ausgabe-Tokens generieren (Agenten-Loops, Codegenerierung) oder Sie einen 1M-Token-Kontext ohne gestaffelte Preisüberraschungen wünschen.
Warten Sie eine Woche, wenn offene Gewichte Ihr einziger Grund sind, eines der Modelle in Betracht zu ziehen. Wenn Qwens Gewichte wie versprochen um den 10. August erscheinen, setzt sich die Offenheitsachse zurück, und die Entscheidung hängt von Modalität, Preis und Ihren eigenen Evaluationsergebnissen ab.
Die wahre Geschichte ist, dass Entwickler jetzt innerhalb von drei Wochen voneinander zwei glaubwürdige, günstige, Harness-kompatible Frontier-Optionen aus China haben. Egal, zu welcher Sie tendieren, führen Sie Ihre eigenen Prompts über beide Endpunkte aus, bevor Sie eine Roadmap auf die Tabelle eines der Anbieter festlegen.
FAQ
Ist Kimi K3 offener als Qwen 3.8-Max?
Heute, ja, ganz klar: K3s Gewichte sind seit dem 27. Juli 2026 (594 GB, MXFP4) auf Hugging Face verfügbar, während die Gewichte von Qwen 3.8-Max für etwa den 10. August versprochen sind und noch nicht heruntergeladen werden können. Wenn Alibaba liefert, werden beide Open-Weight-Frontier-Modelle sein, und die wesentlichen Unterschiede verschieben sich auf Lizenzbedingungen und Community-Support. Bis dahin kann nur K3 selbst gehostet werden; unser lokaler K3-Leitfaden erklärt, was dafür nötig ist.
Welches Modell ist besser beim Codieren, Qwen 3.8-Max oder Kimi K3?
Das kann noch niemand ehrlich beantworten. Beide Anbieter veröffentlichen starke Zahlen für agentisches Codieren, aber jeder führte seine eigenen Evaluierungen unter eigenen Bedingungen durch, und es gibt keinen unabhängigen direkten Vergleich. Alibabas eigene Tabelle zeigt sogar, dass Qwen 3.8-Max bei SWE-bench Pro gegen Fable 5 verliert, daher geben Anbieter-Tabellen Verluste zu; sie sind nur nicht zwischen Anbietern vergleichbar. Führen Sie beide Modelle für Aufgaben aus Ihrem eigenen Repository aus, bevor Sie sich entscheiden.
Kann ich beide Modelle in Claude Code verwenden?
Ja. Beide stellen Anthropic-kompatible Endpunkte bereit. Für Qwen 3.8-Max setzen Sie ANTHROPIC_BASE_URL auf den DashScope Anthropic Endpunkt und ANTHROPIC_MODEL=qwen3.8-max unter Verwendung der Konfiguration aus Alibabas Release-Post. K3 unterstützt dasselbe Muster über Moonshots Endpunkt. Diese gemeinsame Harness-Kompatibilität macht A/B-Tests der beiden so günstig einzurichten.
Welches ist günstiger für eine typische Agenten-Arbeitslast?
Zum Listenpreis, Qwen 3.8-Max: 2 $/6 $ pro Million Tokens gegenüber K3s 3 $/15 $, und Agenten-Loops neigen zu Ausgabe-Tokens, wo der Unterschied 2,5-fach ist. Zwei Einschränkungen: K3s 0,30 $-Cache-Hit-Rate hält eingabeintensive, gut gecachte Arbeitslasten wettbewerbsfähig, und Qwens standardmäßige xhigh-Denkaufwand berechnet das Denken als Ausgabe, sodass seine realen Kosten über naiven Schätzungen liegen. Modellieren Sie Ihren eigenen Token-Mix, bevor Sie annehmen, dass die Aufkleberpreise die ganze Geschichte erzählen.
