La plupart des lancements de modèles présentent leurs capacités de codage de la même manière : voici notre score HumanEval, voici un extrait du modèle écrivant une recherche binaire. Alibaba a pris une voie différente avec Qwen 3.8-Max. La revendication n'est pas « il écrit de bonnes fonctions ». La revendication est qu'il peut gérer un projet logiciel seul pendant des semaines : ouvrir des problèmes, fusionner des requêtes de tirage et livrer des fonctionnalités sans intervention humaine.
C'est une présentation audacieuse, et elle mérite d'être examinée. Cet article passe en revue les trois démonstrations de codage qu'Alibaba a publiées au lancement (toutes des démos de fournisseurs, l'une avec un dépôt public que vous pouvez auditer), les chiffres de référence du codage qui les sous-tendent, puis la partie sur laquelle vous pouvez agir aujourd'hui : comment coder réellement avec qwen3.8-max dans Claude Code, Codex, Qoder, Qwen Code et OpenClaw, et comment tester la sortie API produite par votre code généré.
Si vous débutez avec le modèle lui-même, commencez par l'aperçu de ce qu'est Qwen 3.8 : 2,4 T de paramètres totaux, 95 milliards actifs, une fenêtre contextuelle de 1 million de jetons et des poids ouverts promis pour la semaine suivant le lancement. Ici, nous nous concentrerons sur l'aspect codage. Tout ce qui suit reflète l'état des choses au 3 août 2026.
Ce qu'Alibaba revendique réellement
Le cadrage dans le billet de blog officiel de Qwen 3.8 est l'autonomie sur les extraits. Alibaba positionne Qwen 3.8-Max comme un modèle capable de gérer une tâche d'ingénierie à long terme : planifier le travail, l'exécuter sur plusieurs jours, se remettre de ses propres erreurs et livrer quelque chose d'examinable à la fin.

Trois éléments rendent cette affirmation plus intéressante que le marketing habituel du jour de lancement :
- Les démos sont longues. Seize jours, c'est un régime différent d'un benchmark d'agent de 20 minutes. La récupération d'erreurs, la gestion du contexte et la dérive comptent bien davantage à cette échelle.
- Une démo est publique. Vous pouvez parcourir le dépôt, lire les commits et juger vous-même de la qualité du code. La plupart des vitrines de fournisseurs n'offrent pas cela.
- L'environnement de test est celui d'un concurrent. Alibaba a exécuté la plupart de ses benchmarks de codage avec l'environnement de test Claude Code et a publié une configuration officielle pour que vous puissiez faire de même. Plus de détails ci-dessous.
Mise en garde habituelle, et elle s'applique à l'ensemble de cet article : chaque chiffre ici provient des propres documents de lancement d'Alibaba. Aucune vérification indépendante n'existe encore début août 2026. Traitez les démonstrations comme des démos, et non comme des audits.
Les trois démonstrations de codage
oh-my-cli : 16 jours de développement autonome
La démo phare. Alibaba a laissé Qwen 3.8-Max développer un outil en ligne de commande et l'a laissé fonctionner sans surveillance. Au 30 juillet, l'exécution durait depuis 16 jours et avait produit 265 commits, 127 requêtes de tirage et 151 problèmes, tous ouverts, traités et fermés par le modèle lui-même.
Le dépôt est public à qwen-code-dev-bot/oh-my-cli, ce qui est la partie la plus utile de toute la démonstration. Vous n'avez pas à prendre le nombre de commits pour argent comptant. Vous pouvez lire les descriptions des PR, vérifier si les problèmes sont de véritables bugs ou un travail inutile, et voir si le code tient la route. Seize jours de production d'un modèle sans révision humaine est un artefact véritablement rare, quelle que soit votre conclusion finale sur la qualité.
Ce qu'il faut rechercher lorsque vous l'auditez : si les PR corrigent réellement les problèmes auxquels elles font référence, si le modèle crée du travail artificiel à clôturer, et comment il gère ses propres régressions. Ces schémas vous en disent plus sur la fiabilité à long terme que n'importe quel score de benchmark unique.
L'exécution de reproduction d'article : code de recherche, pas code d'application
La deuxième démo cible une classe de codage plus difficile : reproduire un article de recherche en apprentissage automatique à partir de zéro. Selon les chiffres d'Alibaba, l'exécution a pris environ 125 heures, a produit environ 7 600 lignes de code et a exécuté 33 cycles d'entraînement GPU en cours de route.

Le résultat : le modèle a reproduit 6 des découvertes de l'article, puis est allé plus loin en battant le résultat rapporté par l'article de 2,7 points sur AIME24. Reproduire la recherche est un travail notoirement impitoyable. Les environnements se cassent, les hyperparamètres se cachent dans les notes de bas de page, et un seul bug silencieux invalide une exécution d'entraînement que vous découvrez des heures plus tard. Un modèle capable de traverser 33 cycles d'entraînement et d'en ressortir avec des chiffres correspondants fait quelque chose qui dépasse l'auto-complétion.
Cette démo s'associe à la ligne de benchmark la plus solide de Qwen 3.8-Max, PaperBench, abordée ci-dessous.
Le concours Tianchi : 24 heures contre des équipes humaines
La troisième démonstration a placé le modèle dans une compétition de science des données en direct sur la plateforme Tianchi d'Alibaba, avec une limite de 24 heures. Le modèle a effectué 45 soumissions dans cette fenêtre, itérant sur son approche à chaque fois, et a terminé avec une précision finale de 0,853. Cela l'a placé devant 458 des 526 équipes humaines en compétition.

Il est intéressant de noter la forme de ce résultat : le modèle n'a pas gagné. Il a battu 87 % des participants, ce qui est impressionnant et honnête à la fois. Cela montre également une capacité que les deux autres démos n'ont pas : une itération rapide sous pression, où le score de chaque soumission alimente la tentative suivante.
Une mise en garde supplémentaire qui s'applique avec une force particulière ici : Tianchi est la propre plateforme d'Alibaba. La démo est réelle, mais le fournisseur contrôlait le lieu.
Les benchmarks de codage derrière les démos
Alibaba a publié un tableau de benchmarks complet au lancement. Voici les lignes pertinentes pour le codage, avec les parties honnêtes conservées. Tous les chiffres proviennent des propres exécutions d'Alibaba.
| Benchmark | Qwen 3.8-Max | Meilleur rival (selon le tableau d'Alibaba) |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0 (Fable 5) |
| PaperBench | 93.0 | 90.5 (GPT-5.6 Sol) |
Trois points à retenir :
- Terminal Bench 2.1 (86.6) place Qwen 3.8-Max devant Claude Opus 4.8 et Fable 5 (tous deux à 84.6 dans le tableau d'Alibaba) pour le travail agentique piloté par terminal. C'est le chiffre qui étaye la démo oh-my-cli.
- SWE-bench Pro (67.7) est la perte, et elle n'est pas négligeable. Fable 5 obtient un score de 80.0 sur le même tableau. Pour la correction de bugs à l'échelle d'un dépôt, le benchmark qui correspond le plus directement à « corriger ce problème dans ma base de code », Qwen 3.8-Max est en retard de plus de 12 points par rapport au leader. Alibaba a tout de même publié ce chiffre, ce qui est à son honneur.
- PaperBench (93.0) est la meilleure ligne phare du modèle, battant tout dans l'ensemble de comparaison. Il soutient directement la démo de reproduction d'article.
Maintenant, les petits caractères que la plupart des articles ignoreront : Alibaba a exécuté la plupart de ces benchmarks de codage sur l'environnement de test Claude Code, y compris les exécutions pour les modèles rivaux, et les notes de bas de page du tableau indiquent que les résultats de Fable 5 peuvent impliquer des mécanismes de repli. Le choix de l'environnement de test affecte matériellement les scores des benchmarks agentiques, donc un tableau fourni par un fournisseur sur un environnement de test particulier est un point de donnée, pas un verdict.
Le détail concernant Claude Code est cependant à double tranchant. Cela signifie qu'Alibaba a optimisé pour l'environnement de test que vous utilisez peut-être déjà, et ils ont publié la configuration pour le prouver.
Comment coder réellement avec Qwen 3.8 aujourd'hui
Voici la partie pratique. Qwen 3.8-Max est généralement disponible sur Alibaba Cloud Model Studio, et Alibaba a publié des configurations officielles pour cinq outils de codage au lancement. Vous avez besoin d'une clé API DashScope (de home.qwencloud.com) pour tous. La tarification est de 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, forfaitaire sur l'ensemble du contexte de 1 million, selon la page de tarification officielle de Model Studio.
Claude Code
Le modèle est livré avec un point d'accès API compatible Anthropic, donc le pointer vers Claude Code nécessite trois variables d'environnement :
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Démarrez Claude Code normalement et il acheminera chaque requête vers Qwen 3.8-Max au lieu de Claude. Étant donné qu'Alibaba a exécuté ses benchmarks de codage sur cet environnement de test exact, c'est la configuration avec le moins d'écart entre ce qui a été mesuré et ce que vous expérimenterez.
Codex
Codex nécessite une entrée de fournisseur dans sa configuration. L'ébauche des documents officiels :
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Ceci utilise le point d'accès compatible OpenAI plutôt que celui d'Anthropic. Même modèle, même clé, forme de protocole différente.
Qoder, Qwen Code et OpenClaw
Les trois restants sont plus rapides à résumer :
- Qoder CLI : L'outil de codage agentique d'Alibaba. Sélectionnez
qwen3.8-maxcomme modèle ; c'est une intégration de première partie, donc la configuration est une valeur de configuration. - Qwen Code : L'interface de ligne de commande open-source de l'équipe Qwen. Définissez
DASHSCOPE_API_KEYet choisissez le modèle. Si vous l'avez utilisé avec des modèles de codage Qwen antérieurs, rien d'autre ne change. - OpenClaw : La configuration officielle définit l'ID du modèle et un
maxTokensde 65 536, ce qui correspond également à la longueur maximale de sortie du modèle.
Les cinq configurations se trouvent dans le billet de lancement, alors prenez la version exacte et actuelle là-bas plutôt que de vous fier à une capture d'écran de blog.
Définir l'effort de raisonnement délibérément
Qwen 3.8-Max prend en charge un paramètre reasoning_effort avec trois niveaux : xhigh (par défaut), medium et low. Pour le codage, ce réglage est plus important que la plupart des autres options :
- Maintenez
xhighpour le travail agentique : refactorisations multi-fichiers, sessions de débogage, tout ce où le modèle planifie avant d'éditer. Les exécutions de démonstration représentent ce mode. - Passez à
lowpour les modifications rapides : renommage, ajouts de docstrings, modifications mécaniques où un raisonnement approfondi gaspille du temps et des jetons.
N'oubliez pas que les jetons de réflexion sont facturés comme des jetons de sortie à 6 $ par million, et que xhigh est le paramètre par défaut. Une longue session agentique à plein effort coûte de l'argent réel ; une modification mécanique à xhigh coûte cher sans aucun bénéfice.
Si Qwen 3.8-Max est un modèle plus puissant que ce dont votre tâche a besoin, la ligne précédente Qwen3 Coder existe toujours pour les travaux de codage dédiés, et Qwen3 Coder Flash couvre l'extrémité rapide et économique. Pour l'autre poids lourd open-weight dans cet espace, voyez comment Kimi K3 gère le travail de codage.
Tester ce que le modèle construit : l'étape Apidog
Voici la lacune de chaque démo de codage autonome, y compris celle d'Alibaba : le modèle écrit du code qui appelle des API, et personne ne parle de vérifier ces appels. Un agent peut produire 7 600 lignes qui compilent proprement et pourtant atteindre le mauvais point d'accès, mal gérer un 429, ou envoyer un corps de requête qui échoue à la validation en production.
Deux habitudes comblent cette lacune.
Testez les points d'accès appelés par votre code généré. Lorsque Qwen 3.8-Max échafaude un service ou écrit un client API, importez la spécification pertinente dans Apidog et exercez directement les points d'accès : flux d'authentification, réponses d'erreur, charges utiles de cas limites. Il est beaucoup moins coûteux de trouver une hypothèse erronée lors d'une exécution de test que dans une trace de pile deux jours après le début d'une session autonome. Si vous évaluez l'API du modèle avant de vous y engager, le guide API Qwen 3.8 couvre en détail la configuration du double protocole OpenAI et Anthropic, et Apidog est un endroit pratique pour inspecter les deux formes de protocole côte à côte, y compris les réponses de streaming et les deltas de raisonnement.
Simulez des API afin que les exécutions de l'agent n'affectent pas la production. Cela devient d'autant plus important que vos exécutions sont longues. Une session autonome de 16 jours effectuant des appels en direct contre l'infrastructure de production est une très mauvaise idée : limites de débit, mutations de données, factures surprises. Les serveurs de maquette dans Apidog donnent à l'agent des réponses réalistes sans toucher aux systèmes réels. Pointez le code généré vers l'URL de la maquette pendant l'exécution, remplacez-la par la véritable URL de base une fois qu'un humain a examiné la sortie. Téléchargez Apidog gratuitement pour configurer une maquette en quelques minutes ; c'est l'assurance la moins chère qu'une exécution d'agent sans surveillance puisse avoir.
Le schéma se généralise : plus vous donnez d'autonomie à un modèle de codage, plus la couche API devient votre surface de contrôle. Vous ne pouvez pas réviser chaque commit en temps réel, mais vous pouvez contrôler ce à quoi le code est autorisé à communiquer.
FAQ
Qwen 3.8 est-il bon pour le codage ?
Selon les propres chiffres d'Alibaba, il est fort en codage agentique et de style recherche (Terminal Bench 2.1 à 86.6, PaperBench à 93.0) et dans la moyenne pour la correction de bugs à l'échelle d'un dépôt (SWE-bench Pro à 67.7 contre 80.0 pour Fable 5). Tous les chiffres proviennent d'exécutions de fournisseurs sans vérification indépendante à ce jour. La lecture honnête : excellent pour le travail autonome à long terme, pas le leader pour la résolution de problèmes classiques.
Puis-je utiliser Qwen 3.8 dans Claude Code ?
Oui, officiellement. Définissez ANTHROPIC_BASE_URL sur https://dashscope-intl.aliyuncs.com/apps/anthropic, ANTHROPIC_AUTH_TOKEN sur votre clé DashScope, et ANTHROPIC_MODEL sur qwen3.8-max. Alibaba a publié cette configuration elle-même et a exécuté la plupart de ses benchmarks de codage sur l'environnement de test Claude Code.
Combien coûte le codage avec Qwen 3.8 ?
2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, forfaitaire sur le contexte de 1M. Les jetons de réflexion sont facturés comme des jetons de sortie, et l'effort de raisonnement par défaut xhigh en produit beaucoup, alors prévoyez un budget supérieur au prix affiché pour les sessions agentiques. Le calcul complet des coûts et les comparaisons se trouvent dans l'analyse des benchmarks de Qwen 3.8 et la couverture tarifaire qui y est liée.
L'exécution de 16 jours d'oh-my-cli était-elle vraiment autonome ?
C'est l'affirmation d'Alibaba, et contrairement à la plupart des démos de fournisseurs, vous pouvez vérifier l'artefact : le dépôt est public à qwen-code-dev-bot/oh-my-cli avec 265 commits, 127 PRs et 151 problèmes au 30 juillet 2026. Que la qualité du code justifie le cadrage est un jugement que vous pouvez faire vous-même en le lisant, ce qui est exactement ce qui rend cette démonstration plus crédible qu'une capture d'écran.
