Qwen 3.8 für Programmierung: 16 Tage autonomer Betrieb und Claude Code Integration

Qwen 3.8-Max zum Codieren: Alibabas 16-tägiger autonomer Lauf, Benchmark-Ergebnisse und offizielle Konfigurationen für Claude Code, Codex, Qoder, Qwen Code und OpenClaw.

Ashley Innocent

Ashley Innocent

3 August 2026

Qwen 3.8 für Programmierung: 16 Tage autonomer Betrieb und Claude Code Integration

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Die meisten Modelleinführungen bewerben ihre Programmierfähigkeiten auf die gleiche Weise: Hier ist unser HumanEval-Score, hier ist ein Code-Snippet, in dem das Modell eine binäre Suche schreibt. Alibaba wählte mit Qwen 3.8-Max einen anderen Weg. Die Behauptung ist nicht „es schreibt gute Funktionen.“ Die Behauptung ist, dass es ein Softwareprojekt wochenlang eigenständig betreiben kann: Probleme öffnen, Pull-Requests zusammenführen und Funktionen bereitstellen, ohne dass ein Mensch eingreifen muss.

Das ist eine kühne Behauptung, die einer genauen Prüfung bedarf. Dieser Artikel beleuchtet die drei Code-Showcases, die Alibaba zum Start veröffentlichte (alles Anbieter-Demos, eine mit einem öffentlichen Repository, das Sie prüfen können), die dahinterliegenden Programmier-Benchmark-Zahlen und dann den Teil, den Sie heute umsetzen können: wie man tatsächlich mit qwen3.8-max in Claude Code, Codex, Qoder, Qwen Code und OpenClaw programmiert und wie man die API-Ausgabe des generierten Codes testet.

Wenn Sie neu beim Modell selbst sind, beginnen Sie mit der Übersicht über was Qwen 3.8 ist: 2,4 Billionen Gesamtparameter, 95 Milliarden aktiv, ein 1M-Token-Kontextfenster und offene Gewichte, die für die Woche nach dem Start versprochen wurden. Hier konzentrieren wir uns auf die Programmiergeschichte. Alles unten spiegelt den Stand der Dinge vom 3. August 2026 wider.

button

Was Alibaba tatsächlich behauptet

Die Rahmung im offiziellen Qwen 3.8 Release-Post ist Autonomie über Code-Snippets. Alibaba positioniert Qwen 3.8-Max als ein Modell, das eine langfristige Engineering-Aufgabe im Kopf behalten kann: die Arbeit planen, sie über Tage hinweg ausführen, sich von eigenen Fehlern erholen und am Ende etwas Überprüfbares liefern.

Drei Dinge machen diese Behauptung interessanter als das übliche Marketing am Starttag:

  1. Die Demos sind lang. Sechzehn Tage sind ein anderes Regime als ein 20-minütiger Agent-Benchmark. Fehlerbehebung, Kontextmanagement und Drift spielen in diesem Maßstab eine viel größere Rolle.
  2. Eine Demo ist öffentlich. Sie können das Repository durchsuchen, die Commits lesen und die Codequalität selbst beurteilen. Die meisten Anbieter-Showcases bieten das nicht.
  3. Das Testgerüst ist das eines Konkurrenten. Alibaba führte die meisten seiner Programmier-Benchmarks mit dem Claude Code Testgerüst durch und veröffentlichte eine offizielle Konfiguration, damit Sie dasselbe tun können. Mehr dazu weiter unten.

Standard-Vorbehalt, und er gilt für den gesamten Artikel: Jede hier genannte Zahl stammt aus Alibabas eigenen Startmaterialien. Es gibt noch keine unabhängige Verifizierung (Stand: Anfang August 2026). Behandeln Sie die Showcases als Demos, nicht als Prüfungen.

Die drei Coding-Showcases

oh-my-cli: 16 Tage autonome Entwicklung

Die Hauptdemo. Alibaba ließ Qwen 3.8-Max ein Kommandozeilen-Tool bauen und ließ es unbeaufsichtigt laufen. Bis zum 30. Juli lief die Entwicklung seit 16 Tagen und produzierte 265 Commits, 127 Pull-Requests und 151 Issues, die alle vom Modell selbst geöffnet, bearbeitet und geschlossen wurden.

Das Repository ist öffentlich unter qwen-code-dev-bot/oh-my-cli, was der nützlichste Teil des gesamten Showcases ist. Sie müssen der Commit-Anzahl nicht blind vertrauen. Sie können die PR-Beschreibungen lesen, überprüfen, ob die Issues echte Fehler oder Fleißarbeit sind, und sehen, ob der Code hält. Sechzehn Tage Output von einem Modell ohne menschliche Überprüfung ist ein wirklich seltenes Artefakt, was auch immer Sie über die Qualität schlussfolgern mögen.

Worauf Sie bei der Prüfung achten sollten: ob PRs die referenzierten Issues tatsächlich beheben, ob das Modell künstliche Aufgaben erstellt, um sie zu schließen, und wie es mit eigenen Regressionen umgeht. Diese Muster sagen mehr über die langfristige Zuverlässigkeit aus als jede einzelne Benchmark-Punktzahl.

Der Paper-Reproduktionslauf: Forschungscode, kein Anwendungscode

Die zweite Demo zielt auf eine schwierigere Art des Codierens ab: die Reproduktion eines Machine-Learning-Forschungspapiers von Grund auf neu. Laut Alibabas Zahlen dauerte der Lauf etwa 125 Stunden, produzierte rund 7.600 Zeilen Code und führte dabei 33 GPU-Trainingsrunden durch.

Das Ergebnis: Das Modell reproduzierte 6 der Ergebnisse des Papers und ging dann noch einen Schritt weiter und übertraf das gemeldete Ergebnis des Papers um 2,7 Punkte bei AIME24. Forschung zu reproduzieren ist bekanntermaßen eine gnadenlose Arbeit. Umgebungen brechen zusammen, Hyperparameter verstecken sich in Fußnoten, und ein einziger stiller Fehler macht einen Trainingslauf, von dem man Stunden später erfährt, ungültig. Ein Modell, das 33 Trainingsrunden durchstehen und mit übereinstimmenden Zahlen herauskommen kann, leistet mehr als Autovervollständigung.

Diese Demo passt zu Qwen 3.8-Max' stärkster Benchmark-Reihe, PaperBench, die unten behandelt wird.

Der Tianchi-Wettbewerb: 24 Stunden gegen menschliche Teams

Der dritte Showcase stellte das Modell in einen Live-Datenwissenschafts-Wettbewerb auf Alibabas Tianchi-Plattform mit einem Zeitlimit von 24 Stunden. Das Modell reichte in diesem Zeitfenster 45 Beiträge ein, verbesserte seinen Ansatz jedes Mal und erreichte eine Endgenauigkeit von 0,853. Damit lag es vor 458 der 526 teilnehmenden menschlichen Teams.

Bemerkenswert ist die Form dieses Ergebnisses: Das Modell hat nicht gewonnen. Es schlug 87 % des Feldes, was beeindruckend und ehrlich zugleich ist. Es zeigt auch eine Fähigkeit, die die anderen beiden Demos nicht zeigen: schnelle Iteration unter Zeitdruck, wobei die Punktzahl jedes Beitrags den nächsten Versuch speist.

Ein weiterer Vorbehalt, der hier besonders stark zum Tragen kommt: Tianchi ist Alibabas eigene Plattform. Die Demo ist real, aber der Anbieter kontrollierte den Veranstaltungsort.

Die Programmier-Benchmarks hinter den Demos

Alibaba veröffentlichte zum Start eine vollständige Benchmark-Tabelle. Hier sind die programmierrelevanten Zeilen, mit den ehrlichen Teilen. Alle Zahlen stammen aus Alibabas eigenen Läufen.

Benchmark Qwen 3.8-Max Bester Rivale (laut Alibabas Tabelle)
Terminal Bench 2.1 86.6 88.8 (GPT-5.6 Sol)
SWE-bench Pro 67.7 80.0 (Fable 5)
PaperBench 93.0 90.5 (GPT-5.6 Sol)

Drei Erkenntnisse:

Nun das Kleingedruckte, das die meisten Berichte übersehen werden: Alibaba führte die meisten dieser Code-Benchmarks auf dem Claude Code Harness durch, einschließlich Läufen für Konkurrenzmodelle, und die Fußnoten der Tabelle weisen darauf hin, dass die Ergebnisse von Fable 5 Fallbacks beinhalten könnten. Die Wahl des Harnesses beeinflusst die Agentic-Benchmark-Scores erheblich, daher ist eine vom Anbieter durchgeführte Tabelle auf einem bestimmten Harness ein Datenpunkt, kein Urteil.

Das Detail zu Claude Code funktioniert jedoch in beide Richtungen. Es bedeutet, dass Alibaba für den Harness optimiert hat, den Sie möglicherweise bereits verwenden, und sie haben die Konfiguration veröffentlicht, um dies zu beweisen.

So programmieren Sie heute tatsächlich mit Qwen 3.8

Hier ist die praktische Hälfte. Qwen 3.8-Max ist GA auf Alibaba Cloud Model Studio, und Alibaba veröffentlichte zum Start offizielle Konfigurationen für fünf Codierungs-Tools. Für alle benötigen Sie einen DashScope API-Schlüssel (von home.qwencloud.com). Die Preise betragen 2 $ pro Million Input-Token und 6 $ pro Million Output-Token, pauschal über den gesamten 1M Kontext, gemäß der offiziellen Model Studio Preisliste.

Claude Code

Das Modell wird mit einem Anthropic-kompatiblen API-Endpunkt geliefert, sodass die Verbindung von Claude Code dazu drei Umgebungsvariablen erfordert:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max

Starten Sie Claude Code wie gewohnt, und es leitet jede Anfrage an Qwen 3.8-Max statt an Claude weiter. Da Alibaba seine Programmier-Benchmarks mit genau diesem Harness durchgeführt hat, ist dies die Konfiguration mit der geringsten Abweichung zwischen dem, was gemessen wurde, und dem, was Sie erleben werden.

Codex

Codex benötigt einen Provider-Eintrag in seiner Konfiguration. Der Entwurf aus den offiziellen Dokumenten:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000

Dies verwendet den OpenAI-kompatiblen Endpunkt anstelle des Anthropic-Endpunkts. Dasselbe Modell, derselbe Schlüssel, aber ein anderes Protokollformat.

Qoder, Qwen Code und OpenClaw

Die restlichen drei sind schneller zusammenzufassen:

Alle fünf Konfigurationen finden Sie im Launch-Post, also holen Sie sich dort die exakte aktuelle Version, anstatt sich auf einen Blog-Snapshot zu verlassen.

Den Denkaufwand bewusst einstellen

Qwen 3.8-Max unterstützt einen Parameter reasoning_effort mit drei Stufen: xhigh (die Standardeinstellung), medium und low. Für das Codieren ist diese Einstellung wichtiger als die meisten anderen Schalter:

Denken Sie daran, dass Denk-Token als Output-Token zu 6 $ pro Million abgerechnet werden, und xhigh die Standardeinstellung ist. Eine lange agentische Sitzung mit vollem Aufwand kostet echtes Geld; eine mechanische Bearbeitung bei xhigh kostet es ohne Nutzen.

Wenn Qwen 3.8-Max ein größeres Modell ist, als Ihre Aufgabe erfordert, existiert die frühere Qwen3 Coder-Linie immer noch für dedizierte Codierungsarbeiten, und Qwen3 Coder Flash deckt das schnelle und günstige Ende ab. Für den anderen Open-Weight-Schwergewichtler in diesem Bereich, sehen Sie, wie Kimi K3 Codierungsarbeiten handhabt.

Testen, was das Modell baut: Der Apidog-Schritt

Hier ist die Lücke in jeder autonomen Codierungs-Demo, einschließlich der von Alibaba: Das Modell schreibt Code, der APIs aufruft, und niemand spricht über die Überprüfung dieser Aufrufe. Ein Agent kann 7.600 Zeilen produzieren, die sauber kompilieren, und trotzdem den falschen Endpunkt treffen, einen 429-Fehler falsch behandeln oder einen Anfragekörper versenden, der die Validierung in der Produktion fehlschlägt.

Zwei Gewohnheiten schließen diese Lücke.

Testen Sie die Endpunkte, die Ihr generierter Code aufruft. Wenn Qwen 3.8-Max einen Dienst gerüstet oder einen API-Client schreibt, importieren Sie die relevante Spezifikation in Apidog und testen Sie die Endpunkte direkt: Authentifizierungsflüsse, Fehlerantworten, Edge-Case-Payloads. Es ist viel billiger, eine falsche Annahme in einem Testlauf zu finden als in einem Stack-Trace zwei Tage nach Beginn einer autonomen Sitzung. Wenn Sie die API des Modells selbst bewerten, bevor Sie sich darauf festlegen, deckt der Qwen 3.8 API-Leitfaden die Einrichtung des dualen OpenAI- und Anthropic-Protokolls detailliert ab, und Apidog ist ein bequemer Ort, um beide Protokollformen nebeneinander zu untersuchen, einschließlich der Streaming-Antworten und Reasoning-Deltas.

Mock-APIs, damit Agentenläufe nicht die Produktion treffen. Dies wird umso wichtiger, je länger Ihre Läufe dauern. Eine 16-tägige autonome Sitzung, die Live-Aufrufe an die Produktionsinfrastruktur tätigt, ist eine wirklich schlechte Idee: Ratenbegrenzungen, Datenmutationen, Überraschungsrechnungen. Mock-Server in Apidog geben dem Agenten realistische Antworten, ohne echte Systeme zu berühren. Zeigen Sie den generierten Code während des Laufs auf die Mock-URL, tauschen Sie die reale Basis-URL ein, wenn ein Mensch die Ausgabe überprüft hat. Laden Sie Apidog kostenlos herunter, um einen Mock in wenigen Minuten einzurichten; es ist die günstigste Versicherung, die ein unbeaufsichtigter Agentenlauf haben kann.

Das Muster verallgemeinert sich: Je mehr Autonomie Sie einem Codierungsmodell geben, desto mehr wird die API-Schicht zu Ihrer Kontrollfläche. Sie können nicht jeden Commit in Echtzeit überprüfen, aber Sie können steuern, womit der Code kommunizieren darf.

FAQs

Ist Qwen 3.8 gut zum Codieren?

Nach Alibabas eigenen Zahlen ist es stark bei agentenhafter und forschungsartiger Programmierung (Terminal Bench 2.1 mit 86.6, PaperBench mit 93.0) und im Mittelfeld bei der Fehlerbehebung im Repository-Maßstab (SWE-bench Pro mit 67.7 gegenüber Fable 5s 80.0). Alle Zahlen sind vom Anbieter durchgeführt, ohne unabhängige Überprüfung. Die ehrliche Lesart: ausgezeichnet für langfristige autonome Arbeit, nicht der Anführer für klassische Problembehebung.

Kann ich Qwen 3.8 in Claude Code verwenden?

Ja, offiziell. Setzen Sie ANTHROPIC_BASE_URL auf https://dashscope-intl.aliyuncs.com/apps/anthropic, ANTHROPIC_AUTH_TOKEN auf Ihren DashScope-Schlüssel und ANTHROPIC_MODEL auf qwen3.8-max. Alibaba hat diese Konfiguration selbst veröffentlicht und die meisten seiner Programmier-Benchmarks auf dem Claude Code Harness durchgeführt.

Wie viel kostet das Codieren mit Qwen 3.8?

2 $ pro Million Input-Token und 6 $ pro Million Output-Token, pauschal über den 1M-Kontext. Denk-Token werden als Output abgerechnet, und der Standard-Reasoning-Effort xhigh produziert viele davon, also planen Sie für agentische Sitzungen über dem angegebenen Preis. Die vollständige Kostenberechnung und Vergleiche finden Sie in der Qwen 3.8 Benchmarks-Aufschlüsselung und den dort verlinkten Preisinformationen.

War der 16-tägige oh-my-cli-Lauf wirklich autonom?

Das ist Alibabas Behauptung, und im Gegensatz zu den meisten Anbieter-Demos können Sie das Artefakt überprüfen: Das Repository ist öffentlich unter qwen-code-dev-bot/oh-my-cli mit 265 Commits, 127 PRs und 151 Issues (Stand 30. Juli 2026). Ob die Codequalität die Einordnung rechtfertigt, ist ein Urteil, das Sie selbst fällen können, indem Sie es lesen, was genau diesen Showcase glaubwürdiger macht als einen Screenshot.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen