Qwen 3.8 para Programación: 16 Días de Ejecuciones Autónomas y Conexión con Claude

Qwen 3.8-Max para codificación: la ejecución autónoma de 16 días de Alibaba, resultados de benchmark y configuraciones oficiales para Claude Code, Codex, Qoder, Qwen Code y OpenClaw.

Ashley Innocent

Ashley Innocent

3 August 2026

Qwen 3.8 para Programación: 16 Días de Ejecuciones Autónomas y Conexión con Claude

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

La mayoría de los lanzamientos de modelos presentan la capacidad de codificación de la misma manera: aquí está nuestra puntuación HumanEval, aquí hay un fragmento del modelo escribiendo una búsqueda binaria. Alibaba tomó una ruta diferente con Qwen 3.8-Max. La afirmación no es "escribe buenas funciones". La afirmación es que puede ejecutar un proyecto de software por sí mismo durante semanas: abriendo incidencias, fusionando solicitudes de extracción y entregando funcionalidades sin intervención humana.

Esa es una propuesta audaz y merece un escrutinio. Este artículo repasa los tres ejemplos de codificación que Alibaba publicó en el lanzamiento (todas demostraciones del proveedor, una con un repositorio público que puedes auditar), los números de los benchmarks de codificación que los respaldan, y luego la parte en la que puedes actuar hoy: cómo codificar realmente con qwen3.8-max en Claude Code, Codex, Qoder, Qwen Code y OpenClaw, y cómo probar la salida de la API que produce tu código generado.

Si eres nuevo en el modelo, comienza con la descripción general de qué es Qwen 3.8: 2.4T de parámetros totales, 95B activos, una ventana de contexto de 1M de tokens y pesos abiertos prometidos para la semana posterior al lanzamiento. Aquí nos centraremos en la historia de la codificación. Todo lo que sigue refleja el estado de las cosas al 3 de agosto de 2026.

botón

Lo que Alibaba realmente está afirmando

El encuadre en la publicación oficial de lanzamiento de Qwen 3.8 es la autonomía sobre los fragmentos. Alibaba posiciona a Qwen 3.8-Max como un modelo que puede mantener una tarea de ingeniería a largo plazo en su cabeza: planificar el trabajo, ejecutarlo durante días, recuperarse de sus propios errores y entregar algo revisable al final.

Tres cosas hacen que esta afirmación sea más interesante que el marketing habitual del día de lanzamiento:

  1. Las demos son largas. Dieciséis días es un régimen diferente a un benchmark de agente de 20 minutos. La recuperación de errores, la gestión de contexto y la deriva importan mucho más a esa escala.
  2. Una demo es pública. Puedes explorar el repositorio, leer los commits y juzgar la calidad del código tú mismo. La mayoría de las demostraciones de proveedores no ofrecen eso.
  3. El arnés es de un competidor. Alibaba ejecutó la mayoría de sus benchmarks de codificación con el arnés de Claude Code, y publicó una configuración oficial para que puedas hacer lo mismo. Más sobre esto a continuación.

Advertencia estándar, y se aplica a todo este artículo: cada número aquí proviene de los propios materiales de lanzamiento de Alibaba. A principios de agosto de 2026, aún no existe verificación independiente. Trata las demostraciones como tales, no como auditorías.

Las tres demostraciones de codificación

oh-my-cli: 16 días de desarrollo autónomo

La demostración principal. Alibaba dejó que Qwen 3.8-Max se encargara de construir una herramienta de línea de comandos y la dejó funcionar sin supervisión. Al 30 de julio, la ejecución llevaba 16 días y había producido 265 commits, 127 pull requests y 151 incidencias, todas abiertas, trabajadas y cerradas por el propio modelo.

El repositorio es público en qwen-code-dev-bot/oh-my-cli, que es la parte más útil de toda la demostración. No tienes que creer a ciegas en el número de commits. Puedes leer las descripciones de los PR, comprobar si las incidencias son errores reales o trabajo superfluo, y ver si el código se mantiene. Dieciséis días de salida de un modelo sin revisión humana es un artefacto genuinamente raro, sea cual sea tu conclusión final sobre la calidad.

Qué buscar al auditarlo: si los PR realmente solucionan las incidencias a las que hacen referencia, si el modelo crea trabajo artificial para cerrar, y cómo maneja sus propias regresiones. Esos patrones te dicen más sobre la fiabilidad a largo plazo que cualquier puntuación de benchmark individual.

La ejecución de reproducción de paper: código de investigación, no código de aplicación

La segunda demostración apunta a una clase de codificación más difícil: reproducir un artículo de investigación de aprendizaje automático desde cero. Según los números de Alibaba, la ejecución tomó aproximadamente 125 horas, produjo alrededor de 7,600 líneas de código y ejecutó 33 rondas de entrenamiento de GPU en el camino.

El resultado: el modelo reprodujo 6 de los hallazgos del artículo, luego fue un paso más allá y superó el resultado reportado por el artículo en 2.7 puntos en AIME24. Reproducir investigación es un trabajo notoriamente implacable. Los entornos se rompen, los hiperparámetros se esconden en notas a pie de página, y un solo error silencioso invalida una ejecución de entrenamiento de la que te enteras horas después. Un modelo que puede superar 33 rondas de entrenamiento y obtener números coincidentes está haciendo algo más allá del autocompletado.

Esta demostración se empareja con la fila de benchmark más fuerte de Qwen 3.8-Max, PaperBench, cubierta a continuación.

El concurso Tianchi: 24 horas contra equipos humanos

La tercera demostración puso al modelo en una competencia en vivo de ciencia de datos en la plataforma Tianchi de Alibaba con un límite de 24 horas. El modelo realizó 45 envíos en esa ventana, iterando en su enfoque cada vez, y terminó con una precisión final de 0.853. Eso lo colocó por delante de 458 de los 526 equipos humanos que competían.

Cabe destacar la forma de este resultado: el modelo no ganó. Superó al 87% de los participantes, lo cual es impresionante y honesto al mismo tiempo. También muestra una capacidad que las otras dos demostraciones no tienen: iteración rápida bajo un plazo, donde la puntuación de cada envío alimenta el siguiente intento.

Una advertencia más que se aplica con mayor fuerza aquí: Tianchi es la propia plataforma de Alibaba. La demostración es real, pero el proveedor controlaba el entorno.

Los benchmarks de codificación detrás de las demos

Alibaba publicó una tabla completa de benchmarks en el lanzamiento. Aquí están las filas relevantes para la codificación, con las partes honestas incluidas. Todos los números son ejecuciones propias de Alibaba.

Benchmark Qwen 3.8-Max Mejor rival (según la tabla de Alibaba)
Terminal Bench 2.1 86.6 88.8 (GPT-5.6 Sol)
SWE-bench Pro 67.7 80.0 (Fable 5)
PaperBench 93.0 90.5 (GPT-5.6 Sol)

Tres conclusiones:

Ahora la letra pequeña que la mayoría de la cobertura omitirá: Alibaba ejecutó la mayoría de estos benchmarks de codificación en el arnés de Claude Code, incluyendo ejecuciones para modelos rivales, y las notas a pie de página de la tabla señalan que los resultados de Fable 5 pueden implicar alternativas. La elección del arnés afecta materialmente las puntuaciones de los benchmarks de agentes, por lo que una tabla ejecutada por el proveedor en un arnés particular es un punto de datos, no un veredicto.

El detalle de Claude Code tiene sus dos caras, sin embargo. Significa que Alibaba optimizó para el arnés que quizás ya estés usando, y publicaron la configuración para probarlo.

Cómo codificar realmente con Qwen 3.8 hoy

Aquí está la parte práctica. Qwen 3.8-Max está disponible generalmente en Alibaba Cloud Model Studio, y Alibaba publicó configuraciones oficiales para cinco herramientas de codificación en el lanzamiento. Necesitas una clave API de DashScope (de home.qwencloud.com) para todas ellas. El precio es de $2 por millón de tokens de entrada y $6 por millón de salida, plano en todo el contexto de 1M, según la página oficial de precios de Model Studio.

Claude Code

El modelo viene con un endpoint de API compatible con Anthropic, por lo que apuntar Claude Code a él requiere tres variables de entorno:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max

Inicia Claude Code de forma normal y enrutará cada solicitud a Qwen 3.8-Max en lugar de a Claude. Dado que Alibaba ejecutó sus benchmarks de codificación en este mismo arnés, esta es la configuración con la menor diferencia entre lo que se midió y lo que experimentarás.

Codex

Codex necesita una entrada de proveedor en su configuración. El esquema de la documentación oficial:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000

Esto utiliza el endpoint compatible con OpenAI en lugar del de Anthropic. Mismo modelo, misma clave, diferente forma de protocolo.

Qoder, Qwen Code y OpenClaw

Los tres restantes se resumen más rápidamente:

Las cinco configuraciones están en la publicación de lanzamiento, así que obtén la versión actual exacta allí en lugar de fijarte en una instantánea del blog.

Establece el esfuerzo de razonamiento deliberadamente

Qwen 3.8-Max admite un parámetro reasoning_effort con tres niveles: xhigh (el predeterminado), medium y low. Para la codificación, esta configuración importa más que la mayoría de los ajustes:

Recuerda que los tokens de pensamiento se facturan como tokens de salida a $6 por millón, y xhigh es el predeterminado. Una sesión de agente larga con todo el esfuerzo cuesta dinero real; una edición mecánica en xhigh lo cuesta sin ningún beneficio.

Si Qwen 3.8-Max es más modelo de lo que tu tarea necesita, la línea anterior Qwen3 Coder todavía existe para el trabajo de codificación dedicado, y Qwen3 Coder Flash cubre el extremo rápido y económico. Para el otro peso pesado de código abierto en este espacio, mira cómo Kimi K3 maneja el trabajo de codificación.

Probando lo que construye el modelo: el paso de Apidog

Aquí está la laguna en cada demostración de codificación autónoma, incluida la de Alibaba: el modelo escribe código que llama a APIs, y nadie habla de verificar esas llamadas. Un agente puede producir 7,600 líneas que compilan limpiamente y aun así llamar al endpoint incorrecto, manejar mal un 429, o enviar un cuerpo de solicitud que falla la validación en producción.

Dos hábitos cierran esa brecha.

Prueba los endpoints a los que llama tu código generado. Cuando Qwen 3.8-Max genera un servicio o escribe un cliente API, importa la especificación relevante en Apidog y ejercita los endpoints directamente: flujos de autenticación, respuestas de error, payloads de casos extremos. Es mucho más económico encontrar una suposición errónea en una ejecución de prueba que en un stack trace dos días después de una sesión autónoma. Si estás evaluando la propia API del modelo antes de comprometerte con ella, la guía de la API de Qwen 3.8 cubre la configuración de protocolo dual OpenAI y Anthropic en detalle, y Apidog es un lugar conveniente para inspeccionar ambas formas de protocolo lado a lado, incluyendo las respuestas de streaming y las deltas de razonamiento.

Simula APIs para que las ejecuciones del agente no afecten la producción. Esto importa más cuanto más largas sean tus ejecuciones. Una sesión autónoma de 16 días realizando llamadas en vivo contra la infraestructura de producción es una muy mala idea: límites de velocidad, mutaciones de datos, facturas sorpresa. Los servidores simulados en Apidog dan al agente respuestas realistas sin tocar sistemas reales. Apunta el código generado a la URL simulada durante la ejecución, cambia a la URL base real cuando un humano haya revisado la salida. Descarga Apidog gratis para configurar una simulación en unos minutos; es el seguro más económico que puede tener una ejecución de agente sin supervisión.

El patrón se generaliza: cuanta más autonomía le das a un modelo de codificación, más la capa API se convierte en tu superficie de control. No puedes revisar cada commit en tiempo real, pero puedes controlar con qué se le permite comunicarse al código.

Preguntas frecuentes

¿Es Qwen 3.8 bueno para codificar?

Según los propios números de Alibaba, es fuerte en codificación de estilo de agente y de investigación (Terminal Bench 2.1 con 86.6, PaperBench con 93.0) y de nivel medio en la corrección de errores a escala de repositorio (SWE-bench Pro con 67.7 frente a 80.0 de Fable 5). Todos los números son ejecutados por el proveedor sin verificación independiente aún. La lectura honesta: excelente para el trabajo autónomo a largo plazo, no el líder para la solución clásica de incidencias.

¿Puedo usar Qwen 3.8 en Claude Code?

Sí, oficialmente. Establece ANTHROPIC_BASE_URL a https://dashscope-intl.aliyuncs.com/apps/anthropic, ANTHROPIC_AUTH_TOKEN a tu clave DashScope, y ANTHROPIC_MODEL a qwen3.8-max. Alibaba publicó esta configuración y ejecutó la mayoría de sus benchmarks de codificación en el arnés de Claude Code.

¿Cuánto cuesta codificar con Qwen 3.8?

$2 por millón de tokens de entrada y $6 por millón de salida, tarifa plana en todo el contexto de 1M. Los tokens de pensamiento se facturan como salida, y el esfuerzo de razonamiento xhigh predeterminado produce muchos de ellos, así que presupuesta por encima del precio indicado para las sesiones de agente. Las matemáticas completas de costos y las comparaciones están en el desglose de benchmarks de Qwen 3.8 y la cobertura de precios vinculada allí.

¿Fue realmente autónoma la ejecución de 16 días de oh-my-cli?

Esa es la afirmación de Alibaba, y a diferencia de la mayoría de las demostraciones de proveedores, puedes verificar el artefacto: el repositorio es público en qwen-code-dev-bot/oh-my-cli con 265 commits, 127 PRs y 151 incidencias a 30 de julio de 2026. Si la calidad del código justifica el encuadre es un juicio que puedes hacer tú mismo leyéndolo, que es exactamente lo que hace que esta demostración sea más creíble que una captura de pantalla.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs