Qwen 3.8 contre Kimi K3 : Les deux géants open-source chinois comparés

Qwen 3.8-Max contre Kimi K3 : paramètres, poids ouverts, modalité, tarification et support des frameworks comparés, avec une analyse honnête des benchmarks réalisés par les fournisseurs.

INEZA Felin-Michel

INEZA Felin-Michel

3 August 2026

Qwen 3.8 contre Kimi K3 : Les deux géants open-source chinois comparés

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Juillet 2026 est devenu un mois à deux vitesses pour les modèles frontaliers à poids ouverts, et les deux acteurs venaient de Chine. Moonshot AI a lancé Kimi K3 le 16 juillet. Trois jours plus tard, Alibaba a présenté en avant-première Qwen 3.8-Max, avant de le rendre généralement disponible début août. Les deux sont des modèles mixture-of-experts (MoE) de mille milliards de paramètres. Les deux promettent (ou livrent) des poids ouverts. Les deux s'intègrent dans des harnais d'agents de style Claude Code. Et les deux sous-cotent les laboratoires frontaliers américains sur les prix.

La similarité de surface cache de réelles différences : dans ce que vous pouvez télécharger aujourd'hui, dans ce que les modèles peuvent voir, et dans le coût d'un mois d'utilisation intensive. Cette comparaison passe en revue chaque axe vérifiable à la date du 3 août 2026. Pour une analyse complète des spécifications du nouveau fleuron d'Alibaba, commencez par notre explication de Qwen 3.8-Max et revenez.

bouton

Une note d'honnêteté avant de commencer : il n'existe pas encore de comparatif direct indépendant entre ces deux modèles. Chaque chiffre de cet article provient du tableau propre à un fournisseur, et nous indiquons de qui provient chaque chiffre. Considérez la section des benchmarks comme indicative, non définitive.

La chronologie : qui a livré quoi, et quand

L'ordre de sortie est plus important que d'habitude ici, car les « poids ouverts » signifient quelque chose de différent pour chaque modèle actuellement.

Kimi K3 a été lancé le 16 juillet 2026. Moonshot avait promis des poids ouverts au lancement, et les a livrés 11 jours plus tard : les poids sont apparus sur Hugging Face le 27 juillet sous forme de version MXFP4 de 594 Go. À ce jour, vous pouvez télécharger K3, le quantifier davantage et l'exécuter sur votre propre matériel. Ce n'est pas une promesse. C'est arrivé.

Qwen 3.8-Max a été présenté en avant-première le 19 juillet et a atteint la disponibilité générale sur Alibaba Cloud Model Studio début août, selon l'annonce officielle de Qwen. Les poids sont promis pour Hugging Face et ModelScope « la semaine prochaine », ce qui les situerait autour du 10 août. Au 3 août 2026, ils ne sont pas téléchargeables. Le délai de 11 jours de K3 entre le lancement et la disponibilité des poids montre que cette trajectoire est normale, mais aujourd'hui, un seul de ces modèles est réellement ouvert.

Si l'auto-hébergement est votre facteur décisif, ce seul fait pourrait mettre fin à la comparaison prématurément.

Paramètres : deux modèles MoE à l'échelle du billion, l'un plus léger

Les deux modèles sont des architectures « mixture-of-experts » (MoE) clairsemées, ce qui signifie que le nombre de paramètres annoncé et le coût de calcul par token sont des chiffres très différents.

Spécification Qwen 3.8-Max Kimi K3
Paramètres totaux 2.4T 2.8T
Paramètres actifs par token 95B 104B
Taux d'activation ~4% ~3.7%
Base d'architecture Fondation Qwen 3.5, MoE MoE
Format poids ouverts Promis (vers le 10 août) MXFP4, 594 Go sur Hugging Face

Qwen 3.8-Max est le modèle le plus petit sur les deux points : 400 milliards de paramètres totaux en moins et 9 milliards de paramètres actifs en moins que K3. Aucun des écarts n'est dramatique, et le nombre de paramètres actifs ne se traduit pas linéairement en capacités. Ce qu'ils traduisent, c'est le coût de service. Un modèle activant 95 milliards de paramètres par token est moins cher à exécuter à l'échelle qu'un modèle en activant 104 milliards, toutes choses égales par ailleurs, et cette différence se reflète dans la tarification de l'API ci-dessous.

Pour les auto-hébergeurs, le chiffre le plus pertinent est le téléchargement de 594 Go de K3 en précision MXFP4. C'est un territoire multi-nœuds avant même de prendre en compte le cache KV dans un contexte long. Attendez-vous à ce que Qwen 3.8-Max, avec 2,4 billions de paramètres au total, se situe dans une catégorie de poids similaire lorsque ses fichiers apparaîtront. La plupart des équipes utiliseront des points de terminaison hébergés pour les deux modèles et réserveront l'auto-hébergement pour les cas de conformité ou de recherche.

Ouverture aujourd'hui : poids disponibles vs une promesse datée

Cet axe mérite sa propre section car le marketing des deux côtés parle de « ouvert » alors que les faits diffèrent.

Les poids de Kimi K3 sont publics. Vous pouvez vérifier le dépôt, consulter la licence et télécharger les fichiers dès maintenant. Cela offre tout ce que l'ouverture réelle permet : hébergement par des tiers, quantifications communautaires, fine-tuning, et l'assurance que le modèle que vous avez benchmarké ne peut pas être remplacé discrètement.

Qwen 3.8-Max serait le premier modèle de classe Qwen-Max jamais publié avec des poids ouverts, un véritable changement dans la stratégie d'Alibaba après avoir gardé tous les modèles de niveau Max précédents uniquement via API. Mais une première n'est une première qu'une fois qu'elle a eu lieu. Tant que le dépôt Hugging Face n'est pas actif, Qwen 3.8-Max est un modèle API avec une annonce jointe.

Attribuez cet axe à K3 aujourd'hui, avec une note au crayon pour vérifier à nouveau vers le 10 août. Si Alibaba tient sa promesse, l'axe devient un match nul et la comparaison se déplace vers les termes de la licence et la qualité de la quantification.

Modalité : Qwen voit les images, K3 lit le texte

Ici, l'écart est dans l'autre sens, et il n'est pas minime.

Qwen 3.8-Max accepte les entrées texte et image, selon les configurations officielles du modèle ("input_modalities": ["text", "image"]). L'annonce de lancement d'Alibaba va plus loin, démontrant la compréhension de documents longs sur des PDF de plus de 200 pages et la compréhension vidéo de 100 heures via des graphes de mémoire ; considérez-les comme des démonstrations de blog, pas des types d'entrée API documentés. L'entrée d'image, cependant, est réelle et disponible dans l'API aujourd'hui. Les benchmarks du fournisseur Alibaba s'appuient sur cela : le tableau multimodal (MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1, lignes OCR robustes) est l'endroit où Qwen 3.8-Max affiche ses chiffres les plus unilatéraux.

Kimi K3 est un modèle de texte. Si votre charge de travail implique des captures d'écran, des documents scannés, la compréhension d'interface utilisateur, ou toute tâche d'agent liée à la vision, K3 a besoin d'un modèle de vision séparé greffé sur le pipeline, avec tout le code de liaison et la latence supplémentaire que cela implique.

Pour le codage et le travail d'agent basés uniquement sur le texte, cet axe est non pertinent. Pour l'intelligence documentaire et les agents d'utilisation informatique, il est décisif.

Contexte, sortie et surface de l'API

Qwen 3.8-Max offre une fenêtre contextuelle de 1 000 000 de tokens sous une seule et même couche tarifaire, avec une sortie maximale de 65 536 tokens. Le raisonnement est contrôlé par un paramètre reasoning_effort (xhigh par défaut, avec medium et low), et la sortie de la réflexion est préservée par défaut. Il est à noter que les modes de réflexion et de non-réflexion sont facturés au même tarif.

L'accès se fait via Alibaba Cloud Model Studio avec trois URL de base régionales (Pékin, Singapour, US-Virginie) et, fait inhabituel, deux formes de protocole sur une seule plateforme : un point de terminaison compatible OpenAI et un point de terminaison compatible Anthropic. Cette surface à double protocole explique pourquoi Qwen 3.8-Max s'intègre à Claude Code avec rien de plus que ANTHROPIC_BASE_URL et ANTHROPIC_MODEL=qwen3.8-max. La gamme complète et la disponibilité régionale sont documentées sur la page des modèles de Model Studio ; si vous travaillez sur plusieurs régions, des outils comme Apidog vous permettent de stocker chaque URL de base comme un environnement et de basculer entre eux sans modifier les requêtes.

Kimi K3 prend également en charge le protocole Anthropic et s'insère dans les harnais de style Claude Code, ce qui est précisément la raison pour laquelle ces deux modèles se disputent la même place : celle de « pointer votre harnais d'agent existant vers un modèle frontalier moins cher ». Pour les détails du point de terminaison de K3 et les limites actuelles, consultez notre explication de Kimi K3 plutôt que de vous fier à des chiffres qui pourraient avoir changé depuis le lancement.

Tarification : plate et simple vs entrée bon marché, sortie chère

Voici les tarifs publiés, par million de tokens :

Tarif Qwen 3.8-Max Kimi K3
Entrée $2.00 $3.00
Sortie $6.00 $15.00
Entrée avec cache $0.20 (10% de l'entrée) $0.30
Nivellement Forfait sur tout le contexte de 1M Selon le calendrier publié par Moonshot

Qwen 3.8-Max coûte 2 $ en entrée et 6 $ en sortie, forfaitaire du token zéro au millionième token, que ce soit en mode réflexion ou non, selon la page de tarification officielle de Model Studio. La création explicite de cache est facturée à 125 % de l'entrée, les accès au cache à 10 %. Il existe également un quota gratuit : 1M de tokens, région de Singapour uniquement, valable 90 jours.

Les tarifs de K3 sont de 0,30 $ par million pour les accès au cache, 3 $ par million en entrée et 15 $ par million en sortie.

La comparaison ne se résume pas à un seul chiffre. Pour les charges de travail intensives en entrée avec une bonne discipline de cache (prompts système longs, contexte de document répété), les deux modèles sont plus proches que ne le suggère le prix affiché : 0,20 $ contre 0,30 $ par mégatoken mis en cache est un faible écart. Pour les charges de travail intensives en sortie, l'écart est important : le taux de sortie de 15 $ de K3 est 2,5 fois supérieur à celui de 6 $ de Qwen. Les boucles d'agent qui génèrent beaucoup de raisonnement et de code sont orientées vers une sortie importante, ce qui favorise Qwen 3.8-Max sur le papier.

Une mise en garde qui s'applique spécifiquement à Qwen : le paramètre reasoning_effort est par défaut sur xhigh, et les tokens de réflexion sont facturés comme de la sortie. Les factures réelles seront supérieures à ce que prédit une estimation naïve tokens-en-entrée/tokens-en-sortie. Notre analyse de la tarification de Qwen 3.8 explore des exemples de coûts par tâche si vous souhaitez modéliser cela avant de vous engager.

Benchmarks : deux tableaux de fournisseurs, pas d'arbitre

C'est là que la plupart des comparaisons de ces deux modèles se trompent, alors soyons précis sur ce qui existe.

Ce qui existe : Alibaba a publié un tableau de benchmarks pour Qwen 3.8-Max comparé à Claude Opus 4.8, Fable 5, GPT-5.6 Sol et Qwen 3.7-Max. Moonshot a publié son propre tableau de lancement pour Kimi K3 par rapport à une gamme similaire de modèles frontaliers. Les deux sont exécutés par le fournisseur.

Ce qui n'existe pas : toute évaluation indépendante qui place Qwen 3.8-Max et Kimi K3 dans le même tableau sous le même harnais. Aucun chiffre d'Artificial Analysis pour Qwen 3.8-Max n'était disponible au moment de la rédaction. Les deux fournisseurs n'ont pas comparé les modèles de l'autre.

Dans ce cadre, voici ce que chaque partie revendique sur sa propre exécution.

D'après le tableau d'Alibaba (exécution d'Alibaba, largement réalisée via le harnais Claude Code, un détail qu'Alibaba elle-même divulgue) :

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86.6 84.6 84.6 88.8
SWE-bench Pro 67.7 69.2 80.0 64.6
PaperBench 93.0 80.3 88.8 90.5
GPQA Diamond 92.6 92.0 92.6 94.1
HLE 43.6 45.7 53.3 47.2

Les propres chiffres d'Alibaba incluent des défaites claires : Qwen 3.8-Max est nettement à la traîne de Fable 5 sur SWE-bench Pro et de tous les modèles listés sur HLE. Ses points forts sont PaperBench, la compréhension des instructions (IFBench 82.8) et la série multimodale. Plusieurs autres résultats phares utilisent les benchmarks internes d'Alibaba (QwenSWEBench, CoWorkBench et autres), qui ne peuvent être recoupés avec personne.

Du côté de Moonshot, le tableau de lancement de K3 a montré qu'il battait Claude Opus 4.8 sur les principales lignes de benchmark de Moonshot tout en étant globalement à la traîne de Fable 5 et GPT-5.6 Sol. Nous avons abordé ces affirmations, et leurs mises en garde, dans notre comparaison Kimi K3 vs Claude Opus 4.8.

Pouvez-vous aligner les deux tableaux là où les benchmarks se chevauchent ? Oui, et les gens le feront, mais des harnais, échafaudages et paramètres d'échantillonnage différents rendent les lectures croisées de tableaux au mieux indicatives. Le résumé honnête : les deux fournisseurs montrent leur modèle compétitif avec, et sélectivement en avance sur, la frontière américaine sur les tâches agentiques. Aucun des tableaux ne détermine lequel des deux est le plus fort. Pour les détails des chiffres d'Alibaba, consultez notre analyse des benchmarks de Qwen 3.8.

Exécutez votre propre comparatif direct dans Apidog

Puisqu'il n'y a pas d'arbitre, le benchmark le plus utile est celui que vous exécutez sur votre propre charge de travail. Les deux modèles exposent des points de terminaison de complétion de chat compatibles OpenAI, ce qui rend un test côte à côte simple dans Apidog.

Configurez deux environnements, l'un contenant l'URL de base de DashScope et qwen3.8-max, l'autre contenant le point de terminaison de Moonshot et l'ID du modèle K3, chacun avec sa propre variable de clé API. Enregistrez une requête avec votre prompt réel (une tâche réelle de votre produit, pas une énigme) et basculez entre les environnements pour envoyer la même charge utile aux deux modèles. La vue de réponse d'Apidog vous donne le statut, la latence et le corps complet côte à côte, et son débogage SSE montre comment chaque modèle diffuse le contenu de raisonnement, ce qui est important si votre interface utilisateur affiche les tokens de pensée. Ajoutez quelques assertions (schéma de réponse, plafond de latence, mots-clés requis dans la sortie) et vous avez transformé un test d'ambiance en un test reproductible que vous pouvez réexécuter lorsqu'un fournisseur publie une mise à jour. Téléchargez Apidog gratuitement pour effectuer la comparaison ; dix prompts via les deux points de terminaison vous en diront plus que le tableau de n'importe quel fournisseur.

Le tableau de bord

Axe Vainqueur aujourd'hui Mise en garde
Paramètres totaux/actifs Qwen 3.8-Max (plus léger : 2.4T/95B vs 2.8T/104B) Plus petit n'est ni meilleur ni pire en soi ; cela indique principalement le coût de service
Poids ouverts, aujourd'hui Kimi K3 (disponible sur Hugging Face, 594 Go MXFP4) Les poids de Qwen sont prévus vers le 10 août ; à vérifier, cet axe pourrait bientôt être égalité
Modalité Qwen 3.8-Max (entrée texte + image) Les affirmations vidéo/documents longs sont des démos de blog, pas des types d'entrée API documentés
Fenêtre contextuelle Qwen 3.8-Max (niveau forfaitaire 1M, sortie maximale 65 536) Vérifiez les limites actuelles de K3 par rapport à la documentation de Moonshot pour votre cas d'utilisation
Prix Qwen 3.8-Max (2$/6$ forfaitaire vs 3$/15$) Le paramètre de réflexion « xhigh » par défaut gonfle les factures de sortie réelles de Qwen
Benchmarks Impossible de se prononcer Les deux tableaux sont réalisés par les fournisseurs ; il n'existe pas de comparatif direct indépendant
Écosystème de harnais Égalité Les deux s'intègrent dans les harnais de style Claude Code via des points de terminaison de protocole Anthropic
Historique des promesses Kimi K3 Poids livrés 11 jours après le lancement ; la promesse de Qwen est toujours en suspens

Lequel choisir et quand

Choisissez Kimi K3 si vous avez besoin de poids sur votre propre matériel cette semaine, si votre position de conformité exige un modèle que vous pouvez épingler et auditer, ou si votre charge de travail est purement textuelle et suffisamment intensive en entrée pour que la tarification du cache domine.

Choisissez Qwen 3.8-Max si votre charge de travail implique des images ou des documents, si vous générez beaucoup de tokens de sortie (boucles d'agent, génération de code), ou si vous voulez un contexte de 1M de tokens sans surprises de tarification par paliers.

Attendez une semaine si les poids ouverts sont la seule raison pour laquelle vous considérez l'un ou l'autre modèle. Si les poids de Qwen sont livrés comme promis vers le 10 août, l'axe de l'ouverture se réinitialise et la décision se résume à la modalité, au prix et à vos propres résultats d'évaluation.

La véritable histoire est que les développeurs disposent désormais de deux options frontalières chinoises crédibles, bon marché et compatibles avec les harnais, à trois semaines d'intervalle. Quelle que soit votre préférence, exécutez vos propres prompts via les deux points de terminaison avant d'engager une feuille de route basée sur le tableau de l'un ou l'autre fournisseur.

bouton

FAQ

Kimi K3 est-il plus ouvert que Qwen 3.8-Max ?

Aujourd'hui, oui, c'est un fait : les poids de K3 sont sur Hugging Face depuis le 27 juillet 2026 (594 Go, MXFP4), tandis que les poids de Qwen 3.8-Max sont promis pour le 10 août environ et ne sont pas encore téléchargeables. Si Alibaba tient sa promesse, les deux seront des modèles frontaliers à poids ouverts et les différences significatives se déplaceront vers les termes de licence et le support communautaire. D'ici là, seul K3 peut être auto-hébergé ; notre guide local K3 explique ce que cela implique.

Quel modèle est le meilleur pour le codage, Qwen 3.8-Max ou Kimi K3 ?

Personne ne peut répondre honnêtement à cette question pour l'instant. Les deux fournisseurs publient de solides chiffres de codage agentique, mais chacun a effectué ses propres évaluations dans ses propres conditions, et il n'existe pas de comparatif direct indépendant. Le propre tableau d'Alibaba montre même que Qwen 3.8-Max perd face à Fable 5 sur SWE-bench Pro, de sorte que les tableaux des fournisseurs admettent des défaites ; ils ne sont tout simplement pas comparables entre fournisseurs. Exécutez les deux modèles sur des tâches de votre propre dépôt avant de décider.

Puis-je utiliser les deux modèles dans Claude Code ?

Oui. Les deux exposent des points de terminaison compatibles Anthropic. Pour Qwen 3.8-Max, définissez ANTHROPIC_BASE_URL sur le point de terminaison Anthropic de DashScope et ANTHROPIC_MODEL=qwen3.8-max en utilisant la configuration de l'annonce de publication d'Alibaba. K3 prend en charge le même modèle via le point de terminaison de Moonshot. Cette compatibilité de harnais partagée rend les tests A/B des deux si faciles à mettre en place.

Lequel est le moins cher pour une charge de travail d'agent typique ?

Au prix affiché, Qwen 3.8-Max : 2$/6$ par million de tokens contre 3$/15$ pour K3, et les boucles d'agent sont orientées vers les tokens de sortie, où l'écart est de 2,5 fois. Deux nuances : le taux de 0,30$ de K3 pour les accès au cache maintient les charges de travail intensives en entrée et bien mises en cache compétitives, et le paramètre de réflexion « xhigh » par défaut de Qwen facture la réflexion comme de la sortie, de sorte que ses coûts réels dépassent les estimations naïves. Modélisez votre propre mix de tokens avant de supposer que les prix affichés racontent toute l'histoire.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API