Pendant deux semaines, l'histoire de Qwen 3.8 a eu un vide. Les aperçus de presse de juillet promettaient un modèle de pointe mais n'ont livré aucun score, de sorte que chaque premier article reposait sur des impressions. Cela a changé le 3 août 2026. Le billet de blog officiel d'Alibaba pour Qwen 3.8-Max inclut un tableau de référence complet comparant Claude Opus 4.8, Fable 5, GPT-5.6 Sol, et son propre prédécesseur Qwen3.7-Max, ainsi qu'un tableau multimodal distinct comparant Gemini 3.1 Pro et GPT-5.6 Sol.
Ce tableau mérite d'être lu attentivement. Il contient de véritables victoires, des défaites honnêtes et des petits caractères que la plupart des articles ignoreront entièrement. Cet article passe en revue ces trois points, puis vous propose un moyen pratique de ne plus faire confiance du tout aux tableaux de fournisseurs : exécutez votre propre évaluation contre l'API. Si vous souhaitez d'abord un aperçu complet du modèle (paramètres, tarifs, accès), commencez par notre explication de Qwen 3.8-Max et revenez ensuite.
Une note de cadrage avant les chiffres. Chaque score ci-dessous provient du tableau publié par Alibaba lui-même, les données du classement figurant dans les notes de bas de page datant du 3 août 2026. Aucune évaluation indépendante n'existait au moment de la rédaction. Gardez cela à l'esprit pour chaque ligne qui suit.
Le tableau, en un coup d'œil
Voici les principales lignes du tableau des modèles de texte telles qu'Alibaba les a publiées. Un score plus élevé est meilleur pour toutes.
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (Humanity’s Last Exam) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
Source : Tableau géré par le fournisseur, Alibaba. Nous expliquerons ce que « géré par le fournisseur » signifie en pratique plus loin, car cela est plus important ici que d'habitude.

Où Qwen 3.8-Max gagne
PaperBench : sa meilleure ligne phare
PaperBench, qui teste la capacité d'un modèle à reproduire les résultats d'articles de recherche, est la performance la plus solide de Qwen 3.8-Max face aux modèles de pointe : 93,0, devant les 90,5 de GPT-5.6 Sol, les 88,8 de Fable 5 et les 80,3 d'Opus 4.8. C'est également un bond spectaculaire par rapport aux 64,8 de Qwen3.7-Max. Un bond générationnel de 28 points sur n'importe quel benchmark mérite un examen minutieux, mais s'il est confirmé par des tests indépendants, cela en dit long sur la capacité de recherche à long terme du modèle.
IFBench : respect des instructions avec une large avance
Sur IFBench, Qwen 3.8-Max affiche 82,8. Le concurrent non-Qwen le plus proche dans le tableau est GPT-5.6 Sol à 72,7, avec Fable 5 à 63,5 et Opus 4.8 à 62,2. C'est un écart de 10 à 20 points, ce qui est inhabituel sur un benchmark aussi saturé. Fait intéressant, Qwen3.7-Max menait déjà cette ligne à 79,1, donc le respect des instructions semble être une force durable de Qwen plutôt qu'un coup de chance.
Terminal Bench 2.1 : devancer Claude de peu
Lors de l'exécution du Terminal Bench 2.1 par Alibaba, Qwen 3.8-Max obtient un score de 86,6 contre 84,6 pour Opus 4.8 et Fable 5. GPT-5.6 Sol mène toujours la ligne à 88,8, il s'agit donc d'une deuxième place, pas d'une victoire écrasante. Mais battre les deux fleurons d'Anthropic sur un benchmark terminal agentique est exactement le type de résultat qu'Alibaba souhaitait de ce lancement, et la marge de deux points sur Claude est le chiffre que vous verrez cité partout.
La domination multimodale
Le tableau multimodal distinct est l'endroit où Qwen 3.8-Max semble le plus fort dans l'ensemble. Alibaba rapporte MathVision à 95,2, LogicVista à 91,9 et OSWorld-Verified à 86,1, et le modèle domine presque toutes les lignes OCR du tableau. Ni Opus 4.8 ni Fable 5 ne sont directement en compétition ici (ils sont axés sur le texte dans cette comparaison), ce qui explique en partie pourquoi le tableau multimodal ressemble à une domination totale. Face à Gemini 3.1 Pro et GPT-5.6 Sol, les lignes de raisonnement visuel et d'intelligence documentaire sont le différenciateur le plus clair du modèle.
Si vous le comparez à l'autre grande sortie open-weight de l'été, l'écart multimodal est aussi le contraste le plus marqué : Kimi K3 est uniquement textuel. Notre comparaison Qwen 3.8 vs Kimi K3 couvre cet affrontement en détail.
Où il perd, en toute honnêteté
Alibaba a laissé les pertes dans le tableau, ce qui mérite d'être souligné. Trois se distinguent.
HLE : 43,6, loin derrière Fable 5. Sur l'Examen Final de l'Humanité (Humanity’s Last Exam), le benchmark de connaissances générales de pointe, Qwen 3.8-Max obtient un score de 43,6. Fable 5 est à 53,3, GPT-5.6 Sol à 47,2 et Opus 4.8 à 45,7. C'est la dernière place parmi les quatre modèles phares, près de 10 points derrière le leader. Il bat les 41,4 de Qwen3.7-Max, mais de peu. HLE résiste mieux que la plupart des évaluations au réglage spécifique aux benchmarks, ce qui rend cette ligne particulièrement pertinente.
SWE-bench Pro : 67,7 contre 80,0 pour Fable 5. Sur le benchmark d'ingénierie logicielle plus difficile, Qwen 3.8-Max se situe en milieu de peloton : devant GPT-5.6 Sol (64,6), juste derrière Opus 4.8 (69,2), et 12 points complets derrière Fable 5. L'amélioration générationnelle par rapport à Qwen3.7-Max (60,6) est réelle, mais « bat Claude sur Terminal Bench » et « est largement devancé par Fable 5 sur SWE-bench Pro » sont tous deux vrais simultanément, et la seconde affirmation apparaîtra dans beaucoup moins de titres.
DeepSWE et les lignes agentiques plus difficiles. DeepSWE est une autre ligne où Qwen 3.8-Max est à la traîne par rapport aux modèles de pointe dans le tableau d'Alibaba. Le modèle est cohérent dans la section de codage : compétitif sur les tâches agentiques pilotées par terminal, mais en retrait sur les évaluations d'ingénierie logicielle les plus approfondies.
En résumé honnête : Qwen 3.8-Max bat Opus 4.8 sur plusieurs lignes agentiques, est à la traîne par rapport à Fable 5 sur la plupart des tâches de codage essentielles, et remporte de grandes victoires en multimodal et en intelligence documentaire. C'est un résultat réellement solide pour un modèle au prix de 2 $ en entrée et 6 $ en sortie par million de jetons (voir la page de tarification officielle), mais ce n'est pas la victoire généralisée sur le front que pourrait suggérer un rapide survol de la couverture du lancement.
Les petits caractères que la plupart des articles ignoreront
C'est la section qui justifie de lire un article sur les benchmarks plutôt qu'un simple titre. Quatre détails de la publication d'Alibaba modifient la façon dont vous devriez lire le tableau.
1. Chaque chiffre est géré par le fournisseur. Alibaba a évalué son propre modèle et ceux de ses concurrents. C'est une pratique courante pour les tableaux de lancement, et c'est aussi la raison habituelle pour laquelle les tableaux de lancement sont ensuite révisés. Les fournisseurs choisissent les versions de benchmark, les stratégies de prompting, les paramètres d'échantillonnage et les politiques de réessai. Rien de tout cela n'est une fraude. Tout cela est un coup de pouce.
2. La plupart des lignes de codage ont été exécutées sur le harnais Claude Code. C'est le détail vraiment intéressant. Alibaba a exécuté la plupart de ses benchmarks de codage avec Claude Code, le propre harnais d'agent d'Anthropic, pointé vers Qwen 3.8-Max via son API compatible Anthropic. D'une part, c'est une approche équitable : elle évalue chaque modèle à l'intérieur du même outil largement utilisé. D'autre part, cela signifie que les « scores de codage de Qwen » sont en réalité des scores de « Qwen à l'intérieur du harnais d'Anthropic », et le choix du harnais peut faire varier les résultats agentiques de plusieurs points. Cela vous donne également une indication de l'endroit où Alibaba s'attend à ce que ce modèle soit utilisé en pratique.
3. Plusieurs benchmarks sont internes à Qwen. QwenSWEBench, QwenQoderBench, CoWorkBench et RecreationBench ont tous été développés par l'équipe Qwen. Les benchmarks internes ne sont pas sans valeur ; ils sondent souvent des capacités que les évaluations publiques manquent. Mais un score élevé d'un modèle sur le propre benchmark de son créateur est un type de preuve différent d'un score élevé sur SWE-bench Pro, et le tableau présente les deux côte à côte sans distinction visuelle. Lorsque vous citez un chiffre de ce tableau, vérifiez d'abord à quelle catégorie il appartient.
4. La note de bas de page concernant Fable 5. Le propre tableau d'Alibaba contient une note de bas de page indiquant que « les résultats de Fable5 peuvent impliquer des replis. » C'est un aveu discret que les chiffres d'au moins un concurrent pourraient ne pas refléter le fonctionnement propre du modèle. Quelle que soit la cause technique, cela signifie que la colonne Fable 5, le modèle que Qwen 3.8-Max suit le plus souvent, est accompagnée d'un astérisque de la part de ceux qui l'ont publiée.
Rien de tout cela n'est propre à Alibaba. Anthropic, OpenAI et Google publient tous des tableaux autogérés avec leurs propres choix méthodologiques. Nous avons signalé le même schéma dans notre analyse des benchmarks de Kimi K3, et cela s'y appliquait également. Le but n'est pas de dire qu'Alibaba a triché. Le but est qu'un tableau de fournisseur est une affirmation, pas une mesure.
Ce qu'il faut surveiller et comment lire le prochain tableau
Au 3 août 2026, aucune évaluation indépendante de Qwen 3.8-Max n'existe. Artificial Analysis n'avait pas publié de chiffres au moment de la rédaction, et aucun des classements communautaires n'avait noté le modèle. Cela changera d'ici quelques jours, et les écarts entre le tableau d'Alibaba et les exécutions indépendantes seront la véritable histoire. Nous mettrons à jour cet article lorsqu'ils seront disponibles.
En attendant, voici une courte liste de contrôle pour juger n'importe quel tableau de benchmarks de fournisseur, celui-ci inclus :
- Qui a effectué l'évaluation ? Les chiffres autodéclarés pour les concurrents méritent plus de scepticisme que les chiffres autodéclarés pour le propre modèle du fournisseur.
- Quel harnais et quels paramètres ? Les benchmarks agentiques sont sensibles au harnais. Un tableau qui nomme son harnais (comme l'a fait Alibaba) est plus utile qu'un tableau qui ne le fait pas, mais le choix influence toujours les résultats.
- Quels benchmarks le fournisseur a-t-il construits ? Les évaluations internes mesurent quelque chose, mais pas la même chose que les évaluations publiques.
- Lisez les notes de bas de page. « Peut impliquer des replis » est une information très importante sous une petite police.
- Vérifiez ce qui manque. Les lignes qu'un fournisseur n'a pas publiées sont souvent aussi instructives que celles qu'il a publiées. Les tableaux de fournisseurs précédents ont discrètement supprimé des benchmarks où le modèle sous-performait ; comparez avec la performance de la génération précédente chez les différents fournisseurs pour repérer les lignes qui ont disparu.
- Attendez la deuxième source. Une semaine de patience vous permet généralement d'obtenir des chiffres indépendants.
Exécutez votre propre évaluation à la place
La liste de contrôle vous aide à lire les tableaux. La meilleure approche est d'en avoir moins besoin. Qwen 3.8-Max est désormais disponible sur Alibaba Cloud Model Studio (ID de modèle qwen3.8-max, listé sur la page officielle des modèles) avec une API compatible OpenAI et une API compatible Anthropic, et un benchmark qui utilise vos propres invites réelles est supérieur à toute évaluation publique qui ne le fait pas.
Une configuration pratique dans Apidog ressemble à ceci. Créez une requête vers le point de terminaison de complétion de chat de Model Studio avec qwen3.8-max et une deuxième requête identique vers votre modèle de référence actuel, qu'il s'agisse de Qwen3.7-Max, Kimi K3, ou un point de terminaison Claude ou GPT. Enregistrez 20 à 30 de vos invites de production réelles en tant que scénario de test, ajoutez des assertions pour les propriétés de réponse qui vous intéressent réellement (JSON valide, champs requis présents, latence inférieure à votre seuil), et exécutez les deux scénarios consécutivement. Les rapports de test d'Apidog vous donnent les taux de réussite et les temps de réponse par modèle, côte à côte, sur votre charge de travail plutôt que celle d'Alibaba.
Deux points spécifiques à Qwen à vérifier pendant que vous y êtes : le modèle est par défaut à reasoning_effort: xhigh, donc mesurez le coût et la latence au niveau d'effort que vous utiliseriez réellement, et si vous prévoyez d'utiliser le point de terminaison compatible Anthropic, testez cette forme de protocole séparément, car c'est celle par laquelle la plupart des benchmarks de codage d'Alibaba sont passés. Téléchargez Apidog gratuitement, configurez les deux points de terminaison comme environnements, et vous aurez des chiffres de première main avant que les classements indépendants ne publient les leurs.
Foire aux questions
Les chiffres des benchmarks de Qwen 3.8 sont-ils vérifiés de manière indépendante ?
Non. Au 3 août 2026, tous les chiffres publiés proviennent du propre tableau d'Alibaba. Artificial Analysis et les classements communautaires n'avaient pas encore noté Qwen 3.8-Max au moment de la rédaction. Considérez le tableau comme l'affirmation du fournisseur jusqu'à ce que des exécutions indépendantes soient disponibles.
Quel est le meilleur résultat de benchmark de Qwen 3.8-Max ?
PaperBench, à 93,0, est sa meilleure ligne dans le tableau des modèles phares : devant GPT-5.6 Sol (90,5), Fable 5 (88,8) et Opus 4.8 (80,3). Dans le tableau multimodal, MathVision (95,2) et les lignes OCR sont ses résultats les plus solides dans l'ensemble.
Où Qwen 3.8-Max perd-il clairement ?
Sur HLE, il obtient 43,6, dernier parmi les quatre modèles phares et loin derrière les 53,3 de Fable 5. Sur SWE-bench Pro, il affiche 67,7 contre 80,0 pour Fable 5, et il est également à la traîne sur DeepSWE. Les évaluations approfondies d'ingénierie logicielle et les examens de connaissances générales sont ses points faibles dans le propre tableau d'Alibaba.
Dans quelle mesure Qwen 3.8 est-il meilleur que Qwen 3.7-Max sur les benchmarks ?
Les gains générationnels dans le tableau d'Alibaba sont importants : Terminal Bench 2.1 est passé de 74,5 à 86,6, SWE-bench Pro de 60,6 à 67,7 et PaperBench de 64,8 à 93,0. Savoir si la mise à niveau en vaut la peine pour votre charge de travail dépend également du prix et de la modalité ; notre comparaison Qwen 3.8 vs Qwen 3.7 explique la décision complète.
