Alibaba a lancé Qwen 3.8-Max début août 2026, et l'API est déjà disponible sur Model Studio. Le modèle offre un total de 2,4T paramètres (95 milliards actifs), une fenêtre de contexte d'un million de tokens, et un prix fixe de 2 $ en entrée / 6 $ en sortie par million de tokens. Si vous souhaitez en savoir plus sur le modèle lui-même, commencez par notre explication de Qwen 3.8. Ce guide couvre l'aspect pratique : obtenir une clé, choisir une région, faire votre premier appel et intégrer le modèle dans vos outils.
Un détail distingue cette API de la plupart des lancements de modèles. Qwen 3.8 est livré avec deux protocoles dès le premier jour : un point d'accès compatible OpenAI et un point d'accès compatible Anthropic. Votre code SDK OpenAI existant fonctionne. Votre configuration Claude Code fonctionne également, avec trois variables d'environnement. Cette conception à double protocole en fait également une API amusante à explorer dans Apidog, où vous pouvez envoyer la même invite aux deux formes de protocole et observer comment chacune est diffusée. Plus de détails ci-dessous.
Voici la marche à suivre complète.
Ce dont vous avez besoin avant de commencer
Une référence rapide pour que rien ci-dessous ne vous surprenne :
| Élément | Valeur |
|---|---|
| ID du modèle | qwen3.8-max |
| Fenêtre de contexte | 1 000 000 tokens |
| Sortie maximale | 65 536 tokens |
| Types d'entrée | Texte et images |
| Tarification | 2 $ en entrée / 6 $ en sortie par million de tokens, tarif unique sur l'ensemble du contexte |
| Contrôle du raisonnement | reasoning_effort: xhigh (par défaut), medium, low |
| Protocoles | Complétions de chat OpenAI + réponses, Messages Anthropic |
| Variable d'environnement de la clé | DASHSCOPE_API_KEY |

Tout cela provient de l'annonce officielle de Qwen 3.8 et de la documentation d'Alibaba Cloud Model Studio. Une note sur les poids : Alibaba a promis des poids ouverts sur Hugging Face et ModelScope pour la semaine prochaine, mais début août 2026, ils ne sont pas encore téléchargeables. Tout ce qui est décrit dans ce guide s'exécute sur l'API hébergée.
Étape 1 : Obtenir une clé API de QwenCloud
Rendez-vous sur home.qwencloud.com et connectez-vous ou créez un compte. Une fois dans la console, créez une clé API. La plateforme d'Alibaba utilise toujours le nom DashScope en interne, donc la convention de la variable d'environnement est DASHSCOPE_API_KEY :
export DASHSCOPE_API_KEY="sk-your-key-here"
Placez-la dans votre profil shell ou un fichier .env, pas dans votre code source. Chaque extrait de ce guide lit la clé à partir de cette variable.
Si vous souhaitez tester le modèle avant d'engager de l'argent réel, il existe un quota gratuit : 1 million de tokens, valable 90 jours, disponible uniquement dans la région de Singapour. C'est suffisant pour une évaluation sérieuse.
Étape 2 : Choisir une URL de base régionale
Model Studio héberge l'API compatible OpenAI depuis trois régions. Choisissez celle la plus proche de vos serveurs :
| Région | URL de base |
|---|---|
| Beijing | https://dashscope.aliyuncs.com/compatible-mode/v1 |
| Singapour | https://dashscope-intl.aliyuncs.com/compatible-mode/v1 |
| États-Unis (Virginie) | https://dashscope-us.aliyuncs.com/compatible-mode/v1 |
Le point d'accès de Singapour (dashscope-intl) est le choix par défaut pour la plupart des utilisateurs internationaux, et c'est là que se trouve le quota gratuit. La liste des modèles de Model Studio confirme que qwen3.8-max est disponible pour la génération de texte ainsi que la compréhension d'images et de vidéos, et il figure en haut du tableau des modèles recommandés selon la mise à jour du 3 août.
Les exemples ci-dessous utilisent Singapour. Changez l'URL de base si vous êtes plus proche de Pékin ou de Virginie.
Étape 3 : Effectuer votre premier appel
Le point d'accès utilise le format de complétion de chat d'OpenAI, donc le SDK Python officiel openai fonctionne tel quel. Dirigez-le vers l'URL de base de DashScope :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "system", "content": "You are a precise technical assistant."},
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
],
)
print(completion.choices[0].message.content)
Le même appel en cURL :
curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."}
]
}'
Si vous avez déjà utilisé un fournisseur compatible OpenAI, rien ici ne vous semblera nouveau. C'est tout l'intérêt. La migration d'un autre modèle se résume à un échange d'URL de base et un changement d'ID de modèle. Si vous venez de la génération précédente, le flux de travail est identique à celui de notre guide de l'API Qwen 3.7 Plus, simplement avec un nouvel ID de modèle et de meilleures performances.
Étape 4 : Diffuser les réponses et lire le raisonnement
Qwen 3.8-Max est un modèle de raisonnement, et il réfléchit par défaut. En mode streaming, la réflexion arrive sous forme de deltas reasoning_content avant que la réponse finale n'arrive sous forme de deltas content réguliers. Gérez les deux :
stream = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "user", "content": "Design a rate limiting strategy for a public API."}
],
stream=True,
)
thinking_done = False
for chunk in stream:
delta = chunk.choices[0].delta
reasoning = getattr(delta, "reasoning_content", None)
if reasoning:
print(reasoning, end="", flush=True)
elif delta.content:
if not thinking_done:
print("\n--- answer ---")
thinking_done = True
print(delta.content, end="", flush=True)
Deux choses à savoir sur le flux de réflexion. Premièrement, les tokens de réflexion sont facturés comme des tokens de sortie au même tarif que tout le reste, donc les longues chaînes de raisonnement apparaîtront sur votre facture. Deuxièmement, au niveau d'effort par défaut, le modèle raisonne intensément, ce qui est excellent pour la justesse mais lent pour les interfaces de chat. Cela nous amène aux contrôles.
Étape 5 : Ajuster reasoning_effort et les drapeaux de réflexion
L'API expose trois niveaux officiels de reasoning_effort : xhigh (par défaut), medium et low. Un effort plus élevé signifie plus de tokens de réflexion, de meilleurs résultats sur les problèmes difficiles, et une latence ainsi qu'un coût plus élevés. Un effort moindre est le bon choix pour la classification, l'extraction et le chat simple.
Deux drapeaux connexes contrôlent le comportement de réflexion lui-même : enable_thinking active ou désactive le processus de raisonnement, et preserve_thinking (activé par défaut) conserve le contexte de raisonnement entre les tours. Passez-les via extra_body lorsque vous utilisez le SDK OpenAI, car ce sont des extensions DashScope :
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Classify this ticket: 'Login page 500s on Safari.'"}],
extra_body={
"reasoning_effort": "low",
"enable_thinking": True,
},
)
La facturation est identique, que la réflexion soit activée ou désactivée, par token. Le levier qui modifie vos coûts est le nombre de tokens de réflexion générés par le modèle, ce que reasoning_effort contrôle directement. Un réglage par défaut judicieux : xhigh pour le codage et l'analyse agencés, low pour les points d'accès de production à volume élevé, medium lorsque vous n'êtes pas sûr. Évaluez votre propre charge de travail plutôt que de vous fier aux valeurs par défaut de quiconque, y compris celles d'Alibaba.
Le point d'accès compatible Anthropic
C'est la partie inhabituelle. En plus de l'API compatible OpenAI, Qwen 3.8 propose un point d'accès de protocole Anthropic :
https://dashscope-intl.aliyuncs.com/apps/anthropic
Il utilise le format Anthropic Messages, ce qui signifie que tout outil conçu pour l'API de Claude peut communiquer avec Qwen 3.8-Max sans modifications de code. Le cas d'utilisation principal est Claude Code. Alibaba a publié une configuration officielle, qui se compose de trois variables d'environnement :
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=$DASHSCOPE_API_KEY
export ANTHROPIC_MODEL=qwen3.8-max
Lancez claude après avoir défini ces variables, et Claude Code exécutera sa boucle agencée complète avec Qwen 3.8-Max. Il y a un détail sur lequel il convient de s'arrêter ici : Alibaba a exécuté la plupart de ses propres benchmarks de codage avec le harnais Claude Code. Le point d'accès Anthropic n'est pas une réflexion après coup sur la compatibilité ; c'est la configuration que le fournisseur lui-même a utilisée pour produire les chiffres de codage. Si le codage agencé est votre cas d'utilisation, notre analyse de Qwen 3.8 pour le codage examine ces lignes de benchmark et les autres harnais pris en charge (Codex, Qoder, Qwen Code et OpenClaw ont également tous des configurations officielles).
Pourquoi un double protocole est-il important au-delà de Claude Code ? Parce que votre équipe a probablement du code et des outils répartis sur les deux écosystèmes. Une seule API qui répond aux deux formats signifie que vous pouvez tester une migration dans les deux sens sans avoir à réécrire les clients au préalable.
Ce qu'il en coûte
En bref : 2 $ par million de tokens en entrée, 6 $ par million de tokens en sortie, un tarif unique de 0 à 1 million de contextes. Pas de supplément pour les contextes longs, ce qui est rare parmi les modèles de 1 million de contextes. La mise en cache du contexte réduit les entrées répétées à 10 % du prix d'entrée en cas de succès du cache, la création explicite de cache étant facturée à 125 %. La page de tarification officielle contient les chiffres actuels.

À titre de comparaison, ce prix de lancement est inférieur au prix catalogue de Qwen 3.7-Max de 2,5 $ / 7,5 $. Rappelez-vous cependant la note de facturation de la section streaming : les tokens de réflexion comptent comme des tokens de sortie, et le niveau d'effort par défaut est xhigh, de sorte que les factures réelles sont plus élevées qu'un calcul d'autocollant naïf. Pour des exemples de coûts détaillés et les petits caractères du quota gratuit, consultez la ventilation complète des prix de Qwen 3.8.
Tester et déboguer l'API Qwen 3.8 dans Apidog
Une API de raisonnement en streaming, à double protocole et triple région, est précisément le type de surface où un banc d'essai API approprié prend tout son sens. Voici une configuration pratique dans Apidog :

Importez la spécification compatible OpenAI. Créez un projet et ajoutez le point d'accès de complétion de chat (POST /chat/completions) avec le schéma du corps de la requête. Étant donné que l'API suit le format OpenAI, vous pouvez importer une spécification OpenAI existante et ne modifier que l'URL du serveur. Ajoutez le point d'accès Anthropic Messages comme deuxième API dans le même projet afin que les deux formes de protocole coexistent.
Modélisez les régions comme des environnements. Créez trois environnements Apidog (Pékin, Singapour, États-Unis-Virginie), chacun avec une variable base_url définie sur l'URL du mode compatible correspondante et un secret DASHSCOPE_API_KEY partagé. Changer de région devient un simple clic dans un menu déroulant au lieu d'une modification de chaque requête. C'est aussi un moyen propre de vérifier la latence depuis votre emplacement par rapport à chaque région avant d'en choisir une pour la production.
Inspectez le flux SSE. Envoyez une requête avec "stream": true et observez les événements bruts envoyés par le serveur dans la vue de réponse. Vous verrez les deltas reasoning_content arriver en premier, puis les deltas content. Lorsque votre parseur de streaming se comporte mal en production, comparer sa sortie avec la séquence d'événements bruts dans Apidog est le moyen le plus rapide de savoir si le bogue provient de votre côté ou de celui du fournisseur.
Comparez les modèles côte à côte. Dupliquez une requête, changez l'ID du modèle en qwen3.7-max, et exécutez les deux avec la même invite. La même astuce fonctionne avec plusieurs fournisseurs : conservez une requête API Kimi K3 dans le même projet et effectuez des tests A/B entre les deux modèles phares open-weight sur votre charge de travail réelle, avec les temps de réponse et le nombre de tokens enregistrés pour chaque exécution. Les tableaux de benchmark des fournisseurs sont un point de départ ; vos propres invites sont le véritable test.
Téléchargez Apidog gratuitement pour suivre ; l'ensemble de la configuration ci-dessus prend environ dix minutes.
FAQ
Existe-t-il un moyen gratuit d'essayer l'API Qwen 3.8 ? Oui. Les nouveaux comptes Model Studio bénéficient d'un quota gratuit de 1 million de tokens pour qwen3.8-max, valable 90 jours, uniquement dans la région de Singapour. C'est toute l'offre, alors dirigez votre trafic d'évaluation via dashscope-intl pour l'utiliser.
Puis-je exécuter Qwen 3.8 localement au lieu d'utiliser l'API ? Pas encore. Alibaba a promis des poids ouverts sur Hugging Face et ModelScope pour la semaine prochaine, mais début août 2026, ils ne sont pas téléchargeables. Et avec un total de 2,4 T paramètres, l'auto-hébergement sera un projet multi-nœuds, même quantifié. Pour l'instant, l'API hébergée est le seul moyen d'exécuter le modèle.
Le point d'accès Anthropic prend-il en charge les mêmes fonctionnalités que celui d'OpenAI ? Le point d'accès Anthropic utilise le protocole Anthropic Messages et existe principalement pour alimenter les outils de cet écosystème, avec Claude Code comme intégration officiellement documentée. Pour le code d'application direct, le point d'accès compatible OpenAI est le chemin le mieux documenté, avec reasoning_effort, enable_thinking et le streaming reasoning_content tous couverts ci-dessus.
Comment qwen3.8-max se compare-t-il à Qwen3-Coder pour le travail de codage ? Ce sont des outils différents. Qwen3-Coder est une ligne de modèles de codage spécialisée ; qwen3.8-max est le modèle phare généraliste qui affiche de solides performances de codage agencé dans le tableau d'Alibaba (86,6 sur Terminal Bench 2.1, selon les benchmarks exécutés par le fournisseur). Si vous devez choisir entre eux, testez les deux via la même interface API : les appels sont identiques à l'exception de l'ID du modèle.
Conclusion
L'API Qwen 3.8 est l'un des lancements phares les plus faciles à adopter. Votre code SDK OpenAI fonctionne après un échange d'URL de base, votre configuration Claude Code fonctionne après trois variables d'environnement, et le prix forfaitaire de 2 $/6 $ signifie que vous n'avez pas besoin d'un tableur pour prévoir les coûts sur le contexte de 1 million. Les points principaux à surveiller : les tokens de réflexion facturés comme sortie avec un effort par défaut 'xhigh', et la répartition régionale du quota gratuit.
Commencez avec le quota gratuit de Singapour, diffusez quelques requêtes pour voir comment se comportent les deltas de raisonnement, et utilisez vos propres invites avant de faire confiance à un tableau de benchmark, y compris celui d'Alibaba. Configurer le tout comme un projet dans Apidog, avec les régions comme environnements et les deux protocoles comme requêtes sauvegardées, transforme cette évaluation d'un après-midi de cURL ad-hoc en quelque chose que toute votre équipe pourra réexécuter lors du prochain modèle.
