Cómo usar la API de Qwen 3.8

Obtén una clave API de Qwen 3.8, llama a qwen3.8-max a través del protocolo OpenAI o Anthropic, transmite la salida del razonamiento y prueba cada endpoint en Apidog.

Ashley Innocent

Ashley Innocent

3 August 2026

Cómo usar la API de Qwen 3.8

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Alibaba lanzó Qwen 3.8-Max a principios de agosto de 2026, y la API ya está disponible en Model Studio. El modelo cuenta con un total de 2.4 billones de parámetros (95 mil millones activos), una ventana de contexto de 1 millón de tokens, y un precio fijo de $2 por millón de tokens de entrada / $6 por millón de tokens de salida. Si desea conocer el contexto completo del modelo, comience con nuestra explicación de Qwen 3.8. Esta guía cubre el lado práctico: obtener una clave, elegir una región, realizar su primera llamada y conectar el modelo a sus herramientas.

Un detalle distingue esta API de la mayoría de los lanzamientos de modelos. Qwen 3.8 se envía con dos protocolos desde el primer día: un endpoint compatible con OpenAI y un endpoint compatible con Anthropic. Su código existente del SDK de OpenAI funciona. Su configuración de Claude Code también funciona, con tres variables de entorno. Ese diseño de doble protocolo también hace que esta sea una API divertida para probar en Apidog, donde puede enviar la misma instrucción a ambas formas de protocolo y observar cómo cada una devuelve la transmisión. Más sobre esto a continuación.

botón

Aquí está el recorrido completo.

Qué necesita antes de empezar

Una referencia rápida para que nada de lo siguiente le sorprenda:

Elemento Valor
ID del modelo qwen3.8-max
Ventana de contexto 1.000.000 tokens
Salida máxima 65.536 tokens
Tipos de entrada Texto e imágenes
Precios $2 entrada / $6 salida por 1M de tokens, plano en todo el contexto
Control de razonamiento reasoning_effort: xhigh (predeterminado), medium, low
Protocolos Completaciones de chat de OpenAI + respuestas, Mensajes de Anthropic
Variable de entorno de la clave DASHSCOPE_API_KEY

Todo esto proviene de la publicación oficial de lanzamiento de Qwen 3.8 y la documentación de Alibaba Cloud Model Studio. Una nota sobre los pesos: Alibaba prometió pesos abiertos en Hugging Face y ModelScope para la próxima semana, pero a principios de agosto de 2026 aún no son descargables. Todo en esta guía se ejecuta contra la API alojada.

Paso 1: obtenga una clave API de QwenCloud

Diríjase a home.qwencloud.com e inicie sesión o cree una cuenta. Una vez en la consola, cree una clave API. La plataforma de Alibaba todavía usa el nombre DashScope internamente, por lo que la convención de la variable de entorno es DASHSCOPE_API_KEY:

export DASHSCOPE_API_KEY="sk-your-key-here"

Guárdela en su perfil de shell o en un archivo .env, no en su código fuente. Cada fragmento de esta guía lee la clave de esa variable.

Si desea probar el modelo antes de invertir dinero real, hay una cuota gratuita: 1 millón de tokens, válida por 90 días, disponible solo en la región de Singapur. Eso es suficiente para una evaluación seria.

Paso 2: elija una URL base regional

Model Studio sirve la API compatible con OpenAI desde tres regiones. Elija la que esté más cerca de sus servidores:

Región URL Base
Pekín https://dashscope.aliyuncs.com/compatible-mode/v1
Singapur https://dashscope-intl.aliyuncs.com/compatible-mode/v1
EE. UU. (Virginia) https://dashscope-us.aliyuncs.com/compatible-mode/v1

El endpoint de Singapur (dashscope-intl) es la opción predeterminada para la mayoría de los usuarios internacionales, y es donde reside la cuota gratuita. La lista de modelos de Model Studio confirma que qwen3.8-max está disponible para generación de texto, además de comprensión de imágenes y video, y se encuentra en la parte superior de la tabla de modelos recomendados a partir de la actualización del 3 de agosto.

Los ejemplos siguientes utilizan Singapur. Cambie la URL base si está más cerca de Pekín o Virginia.

Paso 3: realice su primera llamada

El endpoint utiliza el formato de completaciones de chat de OpenAI, por lo que el SDK oficial de Python openai funciona tal cual. Apúntelo a la URL base de DashScope:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "system", "content": "You are a precise technical assistant."},
        {"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
    ],
)

print(completion.choices[0].message.content)

La misma llamada en cURL:

curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {"role": "user", "content": "Explain idempotency in REST APIs in two sentences."}
    ]
  }'

Si ya ha utilizado algún proveedor compatible con OpenAI, nada de esto le resultará nuevo. Ese es el objetivo. La migración de un modelo a otro es un cambio de URL base y un cambio de ID de modelo. Si viene de la generación anterior, el flujo de trabajo es idéntico al de nuestra guía de la API de Qwen 3.7 Plus, solo con un nuevo ID de modelo y mejores cifras.

Paso 4: transmitir respuestas y leer el razonamiento

Qwen 3.8-Max es un modelo de razonamiento y, por defecto, "piensa". En el modo de transmisión, el "pensamiento" llega como deltas de reasoning_content antes de que la respuesta final llegue como deltas de content regulares. Maneje ambos:

stream = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "user", "content": "Design a rate limiting strategy for a public API."}
    ],
    stream=True,
)

thinking_done = False
for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)
    if reasoning:
        print(reasoning, end="", flush=True)
    elif delta.content:
        if not thinking_done:
            print("\n--- answer ---")
            thinking_done = True
        print(delta.content, end="", flush=True)

Dos cosas que debe saber sobre la transmisión de "pensamiento". Primero, los tokens de "pensamiento" se facturan como tokens de salida a la misma tarifa que todo lo demás, por lo que las largas cadenas de razonamiento aparecerán en su factura. Segundo, en el nivel de esfuerzo predeterminado, el modelo razona intensamente, lo cual es excelente para la corrección pero lento para las interfaces de usuario de chat. Eso nos lleva a los controles.

Paso 5: ajustar reasoning_effort y los indicadores de "pensamiento"

La API expone tres niveles oficiales de reasoning_effort: xhigh (el predeterminado), medium y low. Un mayor esfuerzo significa más tokens de "pensamiento", mejores resultados en problemas difíciles y mayor latencia además de costo. Un menor esfuerzo es la opción correcta para clasificación, extracción y chat simple.

Dos indicadores relacionados controlan el comportamiento de "pensamiento" en sí: enable_thinking activa o desactiva el proceso de razonamiento, y preserve_thinking (activado por defecto) mantiene el contexto de razonamiento entre turnos. Páselos a través de extra_body cuando use el SDK de OpenAI, ya que son extensiones de DashScope:

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Classify this ticket: 'Login page 500s on Safari.'"}],
    extra_body={
        "reasoning_effort": "low",
        "enable_thinking": True,
    },
)

La facturación es idéntica, ya sea que el "pensamiento" esté activado o desactivado, por token. La palanca que cambia sus costos es la cantidad de tokens de "pensamiento" que genera el modelo, lo cual reasoning_effort controla directamente. Un valor predeterminado sensato: xhigh para codificación y análisis agentivos, low para endpoints de producción de alto volumen, medium cuando no esté seguro. Evalúe su propia carga de trabajo en lugar de confiar en los valores predeterminados de nadie, incluidos los de Alibaba.

El endpoint compatible con Anthropic

Esta es la parte inusual. Junto con la API compatible con OpenAI, Qwen 3.8 incluye un endpoint de protocolo Anthropic:

https://dashscope-intl.aliyuncs.com/apps/anthropic

Utiliza el formato de Mensajes de Anthropic, lo que significa que cualquier herramienta creada para la API de Claude puede comunicarse con Qwen 3.8-Max sin cambios en el código. El caso de uso principal es Claude Code. Alibaba publicó una configuración oficial, y son tres variables de entorno:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=$DASHSCOPE_API_KEY
export ANTHROPIC_MODEL=qwen3.8-max

Lance claude después de configurar esas variables, y Claude Code ejecutará su bucle agentivo completo contra Qwen 3.8-Max. Hay un detalle que vale la pena destacar aquí: Alibaba ejecutó la mayoría de sus propias pruebas de rendimiento de codificación con el arnés de Claude Code. El endpoint de Anthropic no es una consideración de compatibilidad posterior; es la configuración que el propio proveedor utilizó para producir los números de codificación. Si la codificación agentiva es su caso de uso, nuestro análisis de Qwen 3.8 para codificación repasa esas filas de referencia y los otros arneses compatibles (Codex, Qoder, Qwen Code y OpenClaw también tienen configuraciones oficiales).

¿Por qué es importante el protocolo dual más allá de Claude Code? Porque su equipo probablemente tiene código y herramientas divididos en ambos ecosistemas. Una API que responde a ambos formatos significa que puede probar una migración en cualquier dirección sin tener que reescribir los clientes primero.

Cuánto cuesta

Versión corta: $2 por millón de tokens de entrada, $6 por millón de tokens de salida, una tarifa plana desde 0 hasta 1 millón de contexto. Sin recargo por contexto largo, lo cual es raro entre los modelos con 1 millón de contexto. El almacenamiento en caché de contexto reduce la entrada repetida al 10% del precio de entrada en los aciertos de caché, con la creación explícita de caché facturada al 125%. La página oficial de precios tiene las cifras actuales.

En comparación, ese precio de lanzamiento es inferior al precio de lista de Qwen 3.7-Max de $2.5/$7.5. Sin embargo, recuerde la nota de facturación de la sección de streaming: los tokens de "pensamiento" cuentan como salida, y el nivel de esfuerzo predeterminado es xhigh, por lo que las facturas reales son más altas que un cálculo ingenuo. Para ejemplos de costos y la letra pequeña de la cuota gratuita, consulte el desglose completo de precios de Qwen 3.8.

Pruebe y depure la API de Qwen 3.8 en Apidog

Una API de razonamiento con protocolo dual, tres regiones y transmisión es exactamente el tipo de superficie donde un banco de trabajo de API adecuado justifica su existencia. Aquí tiene una configuración práctica en Apidog:

Importe la especificación compatible con OpenAI. Cree un proyecto y agregue el endpoint de completaciones de chat (POST /chat/completions) con el esquema del cuerpo de la solicitud. Dado que la API sigue el formato de OpenAI, puede importar una especificación de OpenAI existente y no cambiar nada más que la URL del servidor. Agregue el endpoint de Mensajes de Anthropic como una segunda API en el mismo proyecto para que ambas formas de protocolo coexistan.

Modele las regiones como entornos. Cree tres entornos de Apidog (Pekín, Singapur, EE. UU.-Virginia), cada uno con una variable base_url configurada con la URL de modo compatible correspondiente y un secreto DASHSCOPE_API_KEY compartido. Cambiar de región se convierte en un clic en un menú desplegable en lugar de una edición en cada solicitud. Esta es también la forma limpia de verificar la latencia desde su ubicación frente a cada región antes de implementar una en producción.

Inspeccione la transmisión SSE. Envíe una solicitud con "stream": true y observe los eventos sin procesar enviados por el servidor en la vista de respuesta. Verá que los deltas de reasoning_content llegan primero, luego los deltas de content. Cuando su analizador de transmisión se comporta mal en producción, comparar su salida con la secuencia de eventos sin procesar en Apidog es la forma más rápida de averiguar si el error es suyo o del proveedor.

Compare modelos lado a lado. Duplique una solicitud, cambie el ID del modelo a qwen3.7-max y ejecute ambas con la misma instrucción. El mismo truco funciona entre proveedores: mantenga una solicitud de API de Kimi K3 en el mismo proyecto y realice pruebas A/B con los dos modelos insignia de pesos abiertos en su carga de trabajo real, con los tiempos de respuesta y los recuentos de tokens registrados para cada ejecución. Las tablas de referencia del proveedor son un punto de partida; sus propias instrucciones son la verdadera prueba.

Descargue Apidog de forma gratuita para seguir esta guía; toda la configuración anterior toma aproximadamente diez minutos.

Preguntas frecuentes

¿Existe una forma gratuita de probar la API de Qwen 3.8? Sí. Las nuevas cuentas de Model Studio obtienen una cuota gratuita de 1 millón de tokens para qwen3.8-max, válida por 90 días, solo en la región de Singapur. Esa es toda la oferta, así que dirija su tráfico de evaluación a través de dashscope-intl para usarla.

¿Puedo ejecutar Qwen 3.8 localmente en lugar de usar la API? Todavía no. Alibaba prometió pesos abiertos en Hugging Face y ModelScope para la próxima semana, pero a principios de agosto de 2026 aún no son descargables. Y con 2.4 billones de parámetros totales, el autoalojamiento será un proyecto multinodo incluso cuantizado. Por ahora, la API alojada es la única forma de ejecutar el modelo.

¿El endpoint de Anthropic es compatible con las mismas características que el de OpenAI? El endpoint de Anthropic utiliza el protocolo de Mensajes de Anthropic y existe principalmente para alimentar herramientas de ese ecosistema, con Claude Code como la integración oficialmente documentada. Para código de aplicación directo, el endpoint compatible con OpenAI es el camino mejor documentado, con reasoning_effort, enable_thinking y reasoning_content en streaming, todo cubierto anteriormente.

¿Cómo se compara qwen3.8-max con Qwen3-Coder para el trabajo de codificación? Son herramientas diferentes. Qwen3-Coder es una línea de modelos de codificación especializada; qwen3.8-max es el modelo insignia general que, casualmente, arroja buenos resultados de codificación agentiva en la propia tabla de Alibaba (86.6 en Terminal Bench 2.1, según las pruebas de rendimiento realizadas por el proveedor). Si está eligiendo entre ellos, pruebe ambos a través de la misma superficie de API: las llamadas son idénticas excepto por el ID del modelo.

Conclusión

La API de Qwen 3.8 es uno de los lanzamientos insignia más fáciles de adoptar. Su código del SDK de OpenAI funciona después de un cambio de URL base, su configuración de Claude Code funciona después de tres variables de entorno, y el precio fijo de $2/$6 significa que no necesita una hoja de cálculo para predecir los costos en el contexto de 1 millón de tokens. Las principales cosas a tener en cuenta: los tokens de "pensamiento" facturados como salida con un esfuerzo predeterminado xhigh, y la división regional de la cuota gratuita.

Comience con la cuota gratuita de Singapur, transmita algunas solicitudes para ver cómo se comportan los deltas de razonamiento y pruebe sus propias instrucciones antes de confiar en cualquier tabla de rendimiento, incluida la de Alibaba. Configurar todo como un proyecto en Apidog, con las regiones como entornos y ambos protocolos como solicitudes guardadas, convierte esa evaluación de una tarde de cURL ad-hoc en algo que todo su equipo puede volver a ejecutar cuando se lance el próximo modelo.

botón

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs