Tarification Qwen 3.8 expliquée : 2$ entrée / 6$ sortie pour 1M de contexte

Tarification de Qwen 3.8 à la disponibilité générale : 2 $ pour l'entrée / 6 $ pour la sortie par million de jetons, tarif uniforme sur l'ensemble du contexte d'un million de jetons. Remises pour le cache, conditions générales du quota gratuit et calculs de coûts détaillés.

INEZA Felin-Michel

INEZA Felin-Michel

3 August 2026

Tarification Qwen 3.8 expliquée : 2$ entrée / 6$ sortie pour 1M de contexte

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Alibaba a lancé Qwen 3.8-Max début août 2026, et la question des prix a enfin une réponse concrète. Pendant la période d'aperçu de juillet, l'histoire qui circulait était une promotion de « prix d'aperçu à 10 % ». Cette histoire est terminée. Lors de la disponibilité générale, la page officielle des tarifs de Model Studio indique que qwen3.8-max coûte **2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie**, un seul niveau tarifaire couvrant l'intégralité de la fenêtre contextuelle de 1 million de jetons.

Ce niveau tarifaire unique est la partie intéressante. La plupart des modèles de pointe facturent plus par jeton une fois que votre prompt dépasse un seuil de contexte. Qwen 3.8-Max ne le fait pas : que vous envoyiez 5 000 jetons ou 900 000, le tarif reste de 2 $/6 $.

Cet article couvre l'ensemble du tableau : la conception du niveau tarifaire unique, les comparaisons avec Qwen 3.7-Max, Kimi K3, Claude Opus 5 et GPT-5.6 Terra, les remises pour la mise en cache, les petits caractères du quota gratuit, et des exemples de coûts calculés avec des chiffres réels. Pour un aperçu plus large du modèle, commencez par ce qu'est Qwen 3.8 et pourquoi il est important, puis revenez pour les chiffres.

Une première remarque : les prix affichés ne vous donnent qu'une estimation. Qwen 3.8-Max est livré avec un niveau d'effort de raisonnement xhigh par défaut, et les jetons de réflexion sont facturés comme des jetons de sortie. Le moyen fiable de projeter les coûts est d'envoyer de vraies requêtes et de mesurer l'utilisation des jetons. Apidog affiche la ventilation complète des jetons de chaque réponse pendant vos tests, ce qui transforme l'estimation des coûts en un calcul arithmétique. Plus d'informations ci-dessous.

Le chiffre de la disponibilité générale (GA) : 2 $ en entrée, 6 $ en sortie, un seul niveau

Voici la grille tarifaire officielle de qwen3.8-max, vérifiée sur la page des tarifs de Model Studio au 3 août 2026 :

Élément Prix (par million de jetons)
Entrée 2,00 $
Sortie (y compris les jetons de réflexion) 6,00 $
Entrée en cache (accès au cache) 10 % du tarif d'entrée
Création explicite de cache 125 % du tarif d'entrée
Niveau de contexte Niveau unique, de 0 à 1 million de jetons
Réflexion vs non-réflexion Facturés de la même manière

Trois détails méritent d'être soulignés : la fenêtre contextuelle de 1 million est entièrement couverte par un seul prix, sans supplément pour les prompts longs. Les modes de réflexion et de non-réflexion coûtent les mêmes tarifs, bien que les jetons de réflexion soient comptabilisés comme des jetons de sortie (voir la section « honnêteté » ci-dessous). Et la sortie maximale est de 65 536 jetons par requête, donc une seule réponse est facturée au maximum environ 0,39 $ en sortie.

L'annonce officielle de Qwen 3.8 positionne le modèle comme le plus performant d'Alibaba à ce jour : 2,4 T de paramètres totaux avec 95 B actifs, une fenêtre contextuelle de 1 million de jetons, une entrée multimodale. Obtenir cela à 2 $/6 $ est inférieur à la plupart des modèles de pointe, y compris le précédent fleuron d'Alibaba.

Pourquoi la tarification fixe sur 1 million de jetons est inhabituelle

La tarification contextuelle échelonnée est la norme de l'industrie : un tarif en dessous d'un seuil de contexte, un tarif plus élevé au-dessus, car les contextes longs coûtent plus cher à servir.

Alibaba le fait elle-même. Sur la même page de tarification de Model Studio, des modèles comme qwen3-max et qwen3-coder-plus sont tarifés par niveaux de longueur de contexte, avec un tarif par jeton qui augmente à mesure que l'entrée s'allonge. Qwen 3.8-Max rompt avec ce modèle au sein du catalogue d'Alibaba : sa grille tarifaire affiche une seule ligne, « 0<Jetons≤1M », et c'est tout.

Pourquoi c'est important : avec la tarification échelonnée, les charges de travail à contexte long comportent un multiplicateur caché. Un pipeline RAG qui insère occasionnellement 300 000 jetons de documents dans un prompt peut coûter plusieurs fois son tarif typique pour ces requêtes. Avec Qwen 3.8-Max, le jeton marginal coûte toujours le même prix, de sorte que la budgétisation est linéaire : jetons multipliés par le tarif, terminé. Pour l'analyse de documents longs, les agents de bases de code volumineuses ou les pipelines de récupération lourds, cette prévisibilité vaut autant que le faible tarif lui-même.

Moins cher que Qwen 3.7-Max au prix catalogue

Qwen 3.8-Max a été lancé en dessous du prix catalogue de son prédécesseur, ce qui est rare pour un saut de génération de produit phare :

C'est une réduction de 20 % des deux côtés, tandis que le modèle a gagné une fenêtre contextuelle plus grande, une entrée multimodale et de meilleurs scores de référence.

Une complication : Qwen 3.7-Max bénéficie actuellement d'une promotion de 50 %, ce qui le ramène à 1,25 $/3,75 $. Aux tarifs promotionnels, l'ancien fleuron est moins cher que le nouveau. Si votre charge de travail n'a pas besoin du contexte de 1 million de jetons de Qwen 3.8 ou de ses avancées multimodales et agentiques, le 3.7-Max à prix réduit est une option de valeur légitime tant que la promotion dure ; mais ne concevez pas votre modèle de coûts autour d'une promotion. Plus bas dans l'échelle, Qwen 3.7-Plus reste le cheval de bataille économique à 0,4 $/1,6 $, avec une promotion de 20 % qui lui est propre.

La section honnêteté : les jetons de réflexion sont facturés en sortie

C'est la partie que la plupart des analyses tarifaires omettent, et celle qui risque le plus de vous surprendre sur une facture.

Qwen 3.8-Max prend en charge un paramètre reasoning_effort avec trois niveaux : xhigh, medium et low. Le réglage par défaut est xhigh, le plus agressif. En mode de réflexion, le modèle génère des jetons de raisonnement internes avant sa réponse finale, et **ces jetons de raisonnement sont facturés au tarif de sortie de 6 $**, comme le texte visible.

La conséquence : avec les réglages par défaut, les requêtes nécessitant beaucoup de raisonnement coûtent plus cher que ce que prédirait une estimation naïve « jetons de prompt plus jetons de réponse ». Une réponse affichant 800 jetons de texte visible peut avoir consommé plusieurs milliers de jetons de réflexion sur un problème difficile.

Trois atténuations : baissez le reasoning_effort à medium ou low pour les tâches qui ne nécessitent pas de raisonnement approfondi (classification, extraction, formatage) ; mesurez l'utilisation réelle par type de tâche avant de projeter les dépenses mensuelles, car l'objet usage dans chaque réponse rapporte les comptes réels, y compris le raisonnement ; et surveillez spécifiquement les jetons de sortie, car la sortie coûte 3 fois l'entrée ici et la réflexion augmente la sortie.

Mise en cache du contexte : 10 % d'accès, 125 % de création

Si votre application renvoie le même préfixe de prompt à plusieurs reprises (un long prompt système, un document stable, des définitions d'outils), la mise en cache du contexte modifie considérablement l'économie :

Le calcul du seuil de rentabilité est simple. La création coûte 25 % de plus une fois ; chaque accès ultérieur économise 90 %. Si un préfixe est réutilisé ne serait-ce que deux fois, la mise en cache est déjà rentabilisée. Pour les agents à haute fréquence ou les applications de chat avec un prompt système lourd, les économies s'accumulent rapidement (exemple calculé ci-dessous).

Petits caractères du quota gratuit : 1 million de jetons, Singapour, 90 jours

Model Studio offre un quota gratuit pour qwen3.8-max, et les petits caractères sont importants :

Les jetons de réflexion sont déduits de ce quota comme toute autre sortie, donc quelques dizaines de tâches de raisonnement difficiles à xhigh peuvent épuiser 1 million de jetons plus rapidement que prévu. Si l'accès gratuit est votre objectif principal, nous avons rassemblé toutes les voies sans frais, y compris Qwen Chat, dans comment utiliser Qwen 3.8 gratuitement.

Comment se compare la tarification de Qwen 3.8

Voici le paysage actuel, en utilisant les prix catalogue par million de jetons. Les tarifs promotionnels sont signalés, car les promotions expirent.

Modèle Entrée Sortie Notes
Qwen 3.8-Max 2,00 $ 6,00 $ Tarif fixe sur 1M de contexte ; accès au cache 10 %
Qwen 3.7-Max 2,50 $ 7,50 $ Actuellement 50 % de réduction : 1,25 $/3,75 $ (promo)
Qwen 3.7-Plus 0,40 $ 1,60 $ Actuellement 20 % de réduction (promo)
Kimi K3 3,00 $ 15,00 $ Accès au cache 0,30 $
Claude Opus 5 5,00 $ 25,00 $
GPT-5.6 Terra 2,00 $ 12,00 $

En lisant le tableau :

Le prix n'est pas la qualité, et les tableaux de référence des fournisseurs sont des tableaux de référence des fournisseurs. Mais au niveau de la grille tarifaire pure, Qwen 3.8-Max est le fleuron de classe frontière le moins cher de cette gamme.

Exemples concrets : ce que coûtent les tâches réelles

Les prix affichés ont peu de sens sans calcul adapté à la tâche. Trois scénarios, calculés à 2 $/6 $ :

Exemple 1 : une session d'agent de 50 000 jetons

L'exécution d'un agent consomme 38 000 jetons d'entrée (instructions, schémas d'outils, résultats d'outils) et produit 12 000 jetons de sortie :

Maintenant, ajoutons le raisonnement xhigh par défaut. Supposons que le modèle utilise 8 000 jetons de réflexion au cours de l'exécution. La sortie devient 20 000 jetons : 20 000 × 6 $ / 1 000 000 = 0,12 $, et la session totalise environ 0,20 $. C'est une augmentation de 33 % due au seul raisonnement, c'est précisément pourquoi il faut mesurer avant de budgétiser.

Exemple 2 : analyse de document long de 800 000 jetons

Vous chargez 800 000 jetons de documents dans le contexte et demandez un résumé structuré de 5 000 jetons :

Le niveau tarifaire unique fait le travail ici. Chacun de ces 800 000 jetons coûte le même tarif de 2 $/1 million que les mille premiers. Sur un modèle échelonné, c'est précisément le type de requête qui déclenche la tranche de prix la plus chère.

Exemple 3 : un prompt système de 100 000 jetons mis en cache, 50 appels par jour

Votre application charge 100 000 jetons de prompt système, de documentation produit et de définitions d'outils à chaque appel, 50 fois par jour.

Sans mise en cache : 100 000 × 2 $ / 1 000 000 = 0,20 $ par appel, soit 10,00 $ par jour pour le préfixe seul.

Avec mise en cache explicite : la création coûte 100 000 × 2,50 $ / 1 000 000 = 0,25 $ une fois, puis 49 accès au cache à 100 000 × 0,20 $ / 1 000 000 = 0,02 $ chacun, soit 0,98 $. Total journalier : environ 1,23 $, soit une économie de 88 %. Sur un mois, cela représente environ 300 $ contre moins de 40 $.

Estimez les coûts à partir de l'utilisation mesurée, pas des suppositions

Les trois exemples reposent sur des nombres de jetons supposés. Vos chiffres réels seront différents, et avec les jetons de raisonnement en jeu, ils différeront d'une manière que vous ne pouvez pas prédire uniquement à partir de la longueur du prompt. La solution est de mesurer.

Un flux de travail pratique : prenez votre clé API, configurez le point de terminaison (le guide API de Qwen 3.8 couvre les trois URL de base régionales et les protocoles compatibles OpenAI et Anthropic), et envoyez des requêtes représentatives pour chaque type de tâche dans votre application. Chaque réponse renvoie un objet usage avec les comptes exacts des jetons d'entrée, de sortie et de raisonnement.

Dans Apidog, enregistrez les trois URL de base régionales comme environnements, envoyez la même requête à chaque niveau de reasoning_effort, et lisez l'utilisation des jetons directement depuis l'inspecteur de réponse. Exécutez dix requêtes représentatives par type de tâche, faites la moyenne des comptes, multipliez par 2 $/6 $, et vous aurez un modèle de coût basé sur des données mesurées. Vous pouvez également faire des tests A/B du même prompt contre qwen3.7-max ou Kimi K3 dans le même espace de travail pour voir si le modèle moins cher est performant pour votre charge de travail. Téléchargez Apidog gratuitement et vous pourrez obtenir des chiffres de coûts réels par tâche en moins d'une heure.

En résumé

Qwen 3.8-Max à 2 $/6 $ représente une tarification agressive pour un fleuron de classe frontière : en dessous du prix catalogue de son prédécesseur, la moitié du taux de sortie de GPT-5.6 Terra, une fraction d'Opus 5, et un tarif fixe sur un contexte complet de 1 million de jetons là où une grande partie du marché applique des niveaux tarifaires. Ajoutez les accès au cache à 10 % et l'économie pour les charges de travail à contexte long et à haute répétition semble véritablement solide.

Deux mises en garde : le raisonnement xhigh par défaut gonfle la facturation des sorties au-delà des estimations naïves, et les éléments qui l'entourent (3.7-Max avec 50 % de réduction, le quota gratuit de Singapour) sont limités dans le temps. Mesurez votre utilisation réelle des jetons, définissez reasoning_effort délibérément, et la grille tarifaire ne vous réservera que peu de surprises.

button

Foire aux questions

Qwen 3.8 coûte-t-il plus cher pour les prompts longs ?

Non. La tarification officielle liste un seul niveau couvrant de 0 à 1 million de jetons, donc un prompt de 900 000 jetons est facturé au même tarif d'entrée de 2 $ par million que un court. Cela diffère des modèles à niveaux, y compris certains du catalogue d'Alibaba sur la liste des modèles de Model Studio, où les tarifs augmentent avec la longueur du contexte.

Les jetons de réflexion coûtent-ils un supplément sur Qwen 3.8 ?

Il n'y a pas de tarif distinct pour la réflexion : les modes de réflexion et de non-réflexion sont facturés au même tarif de 2 $/6 $. Mais les jetons de réflexion sont comptabilisés comme des jetons de sortie à 6 $ par million, et reasoning_effort est par défaut xhigh. Les requêtes nécessitant beaucoup de raisonnement coûtent donc plus cher que ce que la réponse visible ne le suggère. Réduisez le niveau d'effort pour les tâches simples et vérifiez l'objet usage dans chaque réponse pour voir ce que vous payez réellement.

Y a-t-il un moyen gratuit d'essayer Qwen 3.8 ?

Oui. Model Studio inclut un quota gratuit de 1 million de jetons, valable 90 jours, uniquement sur le point de terminaison de la région de Singapour. Qwen Chat offre également un accès gratuit dans le navigateur. Ces deux options, ainsi que les petits caractères, sont couvertes dans comment utiliser Qwen 3.8 gratuitement.

L'ancien « prix d'aperçu à 10 % » est-il toujours disponible ?

Non. Il s'agissait d'une promotion de la période d'aperçu rapportée dans la couverture médiatique de juillet 2026 ; la disponibilité générale l'a remplacée par la grille tarifaire standard de 2 $/6 $. Considérez la page des tarifs de Model Studio comme la source de vérité.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API