Qwen 3.8 Benchmarks: Qué revela la tabla de Alibaba y qué oculta

Evaluaciones de Qwen 3.8-Max, una lectura honesta: PaperBench 93.0 y victorias multimodales, pérdidas en HLE y SWE-bench Pro, y la letra pequeña que la mayoría de la cobertura omite.

INEZA Felin-Michel

INEZA Felin-Michel

3 August 2026

Qwen 3.8 Benchmarks: Qué revela la tabla de Alibaba y qué oculta

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Durante dos semanas, la historia de Qwen 3.8 tuvo un vacío. Las vistas previas para la prensa de julio prometían un modelo de clase fronteriza pero no se publicaron puntuaciones, por lo que cada artículo inicial se basó en impresiones. Eso cambió el 3 de agosto de 2026. La publicación oficial de lanzamiento de Alibaba para Qwen 3.8-Max incluye una tabla completa de benchmarks contra Claude Opus 4.8, Fable 5, GPT-5.6 Sol y su predecesor Qwen3.7-Max, además de una tabla multimodal separada contra Gemini 3.1 Pro y GPT-5.6 Sol.

Esa tabla merece una lectura atenta. Contiene victorias genuinas, pérdidas honestas y letra pequeña que la mayoría de la cobertura omitirá por completo. Esta publicación analiza los tres puntos, luego le ofrece una forma práctica de dejar de confiar en las tablas de los proveedores por completo: ejecutar su propia evaluación contra la API. Si desea primero un resumen completo del modelo (parámetros, precios, acceso), comience con nuestro explicador de Qwen 3.8-Max y luego regrese.

Una nota de encuadre antes de los números. Cada puntuación a continuación proviene de la tabla publicada por Alibaba, con datos de la tabla de clasificación que las notas a pie de página fechan el 3 de agosto de 2026. No existían evaluaciones independientes en el momento de la redacción. Tenga eso en cuenta para cada fila que sigue.

La tabla, de un vistazo

Aquí están las filas principales del modelo de texto tal como las publicó Alibaba. Una puntuación más alta es mejor en todos estos.

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (Humanity’s Last Exam) 43.6 45.7 53.3 47.2 41.4

Fuente: Tabla de Alibaba gestionada por el proveedor. Más adelante veremos qué significa "gestionada por el proveedor" en la práctica, porque aquí importa más de lo habitual.

Dónde gana Qwen 3.8-Max

PaperBench: su mejor fila insignia

PaperBench, que prueba si un modelo puede reproducir los resultados de un artículo de investigación, es el mejor desempeño de Qwen 3.8-Max frente a la frontera: 93.0, por delante de los 90.5 de GPT-5.6 Sol, los 88.8 de Fable 5 y los 80.3 de Opus 4.8. También es un salto asombroso desde los 64.8 de Qwen3.7-Max. Un salto generacional de 28 puntos en cualquier benchmark merece un escrutinio, pero si se mantiene bajo pruebas independientes, dice algo real sobre la capacidad de investigación a largo plazo del modelo.

IFBench: seguimiento de instrucciones por un amplio margen

En IFBench, Qwen 3.8-Max obtiene 82.8. El competidor no-Qwen más cercano en la tabla es GPT-5.6 Sol con 72.7, con Fable 5 en 63.5 y Opus 4.8 en 62.2. Esa es una brecha de 10 a 20 puntos, lo cual es inusual en un benchmark tan saturado. Curiosamente, Qwen3.7-Max ya lideraba esta fila con 79.1, por lo que el seguimiento de instrucciones parece ser una fortaleza duradera de Qwen en lugar de algo aislado.

Terminal Bench 2.1: superando a Claude

En la ejecución de Terminal Bench 2.1 de Alibaba, Qwen 3.8-Max obtiene 86.6 frente a 84.6 tanto para Opus 4.8 como para Fable 5. GPT-5.6 Sol sigue liderando la fila con 88.8, por lo que este es un segundo lugar, no una barrida. Pero vencer a ambos modelos insignia de Anthropic en un benchmark de terminal de agente es exactamente el tipo de resultado que Alibaba quería de este lanzamiento, y el margen de dos puntos sobre Claude es el número que verá citado en todas partes.

La barrida multimodal

La tabla multimodal separada es donde Qwen 3.8-Max se ve más fuerte en general. Alibaba reporta MathVision en 95.2, LogicVista en 91.9 y OSWorld-Verified en 86.1, y el modelo lidera casi todas las filas de OCR en la tabla. Ni Opus 4.8 ni Fable 5 compiten directamente aquí (están centrados en texto en esta comparación), lo que explica en parte por qué la tabla multimodal se lee como una barrida. Frente a Gemini 3.1 Pro y GPT-5.6 Sol, las filas de razonamiento visual e inteligencia documental son el diferenciador más claro del modelo.

Si lo compara con el otro gran lanzamiento de peso abierto del verano, la brecha multimodal también es el contraste más marcado: Kimi K3 es solo texto. Nuestra comparación de Qwen 3.8 vs Kimi K3 cubre ese enfrentamiento por completo.

Donde pierde, con honestidad

Alibaba dejó las pérdidas en la tabla, lo que merece cierto reconocimiento. Destacan tres.

HLE: 43.6, muy por detrás de Fable 5. En Humanity’s Last Exam, el benchmark de frontera de conocimiento amplio, Qwen 3.8-Max obtiene 43.6. Fable 5 se sitúa en 53.3, GPT-5.6 Sol en 47.2 y Opus 4.8 en 45.7. Es el último lugar entre los cuatro buques insignia, casi 10 puntos por detrás del líder. Supera los 41.4 de Qwen3.7-Max, pero apenas. HLE resiste la optimización específica de los benchmarks mejor que la mayoría de las evaluaciones, lo que hace que esta fila valga la pena ponderarla mucho.

SWE-bench Pro: 67.7 vs 80.0 de Fable 5. En el benchmark de ingeniería de software más difícil, Qwen 3.8-Max se sitúa en la mitad de la tabla: por delante de GPT-5.6 Sol (64.6), justo por detrás de Opus 4.8 (69.2), y 12 puntos completos por detrás de Fable 5. La mejora generacional con respecto a Qwen3.7-Max (60.6) es real, pero "vence a Claude en Terminal Bench" y "va muy por detrás de Fable 5 en SWE-bench Pro" son ambas verdades a la vez, y la segunda afirmación aparecerá en muchos menos titulares.

DeepSWE y las filas agénticas más difíciles. DeepSWE es otra fila donde Qwen 3.8-Max va a la zaga de la frontera en la propia tabla de Alibaba. El patrón en toda la sección de codificación es consistente: competitivo en tareas agénticas impulsadas por terminales, rezagado en las evaluaciones de ingeniería de software más profundas.

El resumen honesto: Qwen 3.8-Max supera a Opus 4.8 en varias filas agénticas, va a la zaga de Fable 5 en la mayoría del trabajo de codificación central, y gana a lo grande en inteligencia multimodal y documental. Ese es un resultado genuinamente fuerte para un modelo con un precio de $2 de entrada y $6 de salida por millón de tokens (ver la página oficial de precios), pero no es la victoria fronteriza generalizada que una lectura superficial de la cobertura del lanzamiento podría sugerir.

La letra pequeña que la mayoría de la cobertura omitirá

Esta es la sección que justifica leer una publicación de benchmarks en lugar de un titular. Cuatro detalles de la propia publicación de Alibaba cambian la forma en que debe leer la tabla.

1. Cada número es ejecutado por el proveedor. Alibaba evaluó su propio modelo y los modelos de sus competidores. Esa es una práctica estándar para las tablas de lanzamiento, y también es la razón estándar por la que las tablas de lanzamiento se revisan más tarde. Los proveedores eligen las versiones de los benchmarks, las estrategias de prompt, la configuración de muestreo y las políticas de reintentos. Nada de eso es fraude. Todo ello es una inclinación en la balanza.

2. La mayoría de las filas de codificación se ejecutaron en el arnés de Claude Code. Este es el detalle genuinamente interesante. Alibaba ejecutó la mayoría de sus benchmarks de codificación con Claude Code, el propio arnés de agente de Anthropic, apuntando a Qwen 3.8-Max a través de su API compatible con Anthropic. Por un lado, es un movimiento de juego limpio: evalúa cada modelo dentro de la misma herramienta ampliamente utilizada. Por otro lado, significa que las "puntuaciones de codificación de Qwen" son realmente puntuaciones de "Qwen dentro del arnés de Anthropic", y la elección del arnés puede influir en los resultados agénticos en varios puntos. También le dice algo sobre dónde espera Alibaba que funcione este modelo en la práctica.

3. Varios benchmarks son internos de Qwen. QwenSWEBench, QwenQoderBench, CoWorkBench y RecreationBench fueron construidos por el equipo de Qwen. Los benchmarks internos no carecen de valor; a menudo exploran capacidades que las evaluaciones públicas pasan por alto. Pero una puntuación alta de un modelo en el propio benchmark de su creador es un tipo diferente de evidencia que una puntuación alta en SWE-bench Pro, y la tabla presenta ambos lado a lado sin distinción visual. Cuando cite un número de esta tabla, verifique primero a qué categoría pertenece.

4. La nota a pie de página sobre Fable 5. La propia tabla de Alibaba contiene una nota a pie de página que dice "Los resultados de Fable5 pueden implicar retrocesos". Esa es una admisión silenciosa de que los números de al menos un competidor pueden no reflejar el modelo funcionando limpiamente. Cualquiera que sea la causa técnica, significa que la columna de Fable 5, el modelo al que Qwen 3.8-Max más a menudo sigue, viene con un asterisco de las personas que la publicaron.

Nada de esto es exclusivo de Alibaba. Anthropic, OpenAI y Google publican tablas propias con sus propias elecciones metodológicas. Señalamos el mismo patrón en nuestro desglose de benchmarks de Kimi K3, y también se aplicó allí. El punto no es que Alibaba hiciera trampa. El punto es que la tabla de un proveedor es una afirmación, no una medición.

Qué observar y cómo leer la siguiente tabla

A partir del 3 de agosto de 2026, no existen evaluaciones independientes de Qwen 3.8-Max. Artificial Analysis no había publicado números en el momento de escribir esto, y ninguna de las tablas de clasificación de la comunidad había calificado el modelo. Eso cambiará en cuestión de días, y las diferencias entre la tabla de Alibaba y las ejecuciones independientes serán la verdadera historia. Actualizaremos esta publicación cuando se publiquen.

Hasta entonces, aquí hay una breve lista de verificación para juzgar cualquier tabla de benchmarks de proveedores, incluida esta:

  1. ¿Quién realizó la evaluación? Los números autoinformados para los competidores merecen más escepticismo que los números autoinformados para el propio modelo del proveedor.
  2. ¿Qué arnés y configuración? Los benchmarks agénticos son sensibles al arnés. Una tabla que nombra su arnés (como hizo Alibaba) es más útil que una que no lo hace, pero la elección sigue influyendo en los resultados.
  3. ¿Qué benchmarks construyó el proveedor? Las evaluaciones internas miden algo, pero no lo mismo que las públicas.
  4. Lea las notas a pie de página. "Puede implicar retrocesos" dice mucho en letra pequeña.
  5. Verifique lo que falta. Las filas que un proveedor no publicó suelen ser tan informativas como las que sí lo hizo. Las tablas de proveedores anteriores han omitido discretamente benchmarks en los que el modelo tuvo un rendimiento inferior; compare con cómo se comparó la última generación entre proveedores para detectar qué filas desaparecieron.
  6. Espere la segunda fuente. Una semana de paciencia suele permitir obtener números independientes.

Ejecute su propia evaluación en su lugar

La lista de verificación le ayuda a leer tablas. El mejor movimiento es necesitarlas menos. Qwen 3.8-Max ya está disponible en Alibaba Cloud Model Studio (ID de modelo qwen3.8-max, listado en la página oficial de modelos) con una API compatible con OpenAI y otra compatible con Anthropic, y un benchmark que utiliza sus prompts reales supera cualquier evaluación pública que no lo haga.

Una configuración práctica en Apidog se vería así. Cree una solicitud contra el endpoint de chat-completions de Model Studio con qwen3.8-max y una segunda solicitud idéntica contra su modelo de referencia actual, ya sea Qwen3.7-Max, Kimi K3, o un endpoint de Claude o GPT. Guarde de 20 a 30 de sus prompts de producción reales como un escenario de prueba, agregue aserciones para las propiedades de respuesta que realmente le interesan (JSON válido, campos requeridos presentes, latencia por debajo de su umbral) y ejecute ambos escenarios consecutivamente. Los informes de prueba de Apidog le dan tasas de aprobación y tiempos de respuesta por modelo, lado a lado, en su carga de trabajo en lugar de la de Alibaba.

Dos cosas específicas de Qwen que debe verificar mientras lo hace: el modelo por defecto es `reasoning_effort: xhigh`, así que mida el costo y la latencia al nivel de esfuerzo que realmente enviaría, y si planea usar el endpoint compatible con Anthropic, pruebe esa forma de protocolo por separado, porque es por la que pasaron la mayoría de los propios benchmarks de codificación de Alibaba. Descargue Apidog gratis, conecte ambos endpoints como entornos, y tendrá números propios antes de que las tablas de clasificación independientes publiquen los suyos.

Preguntas frecuentes

¿Se han verificado de forma independiente los números de benchmark de Qwen 3.8?

No. A 3 de agosto de 2026, todos los números publicados provienen de la propia tabla de Alibaba. Artificial Analysis y las tablas de clasificación de la comunidad aún no habían calificado a Qwen 3.8-Max en el momento de la redacción. Trate la tabla como la afirmación del proveedor hasta que se publiquen ejecuciones independientes.

¿Cuál es el mejor resultado de benchmark de Qwen 3.8-Max?

PaperBench, con 93.0, es su mejor fila en la tabla insignia: por delante de GPT-5.6 Sol (90.5), Fable 5 (88.8) y Opus 4.8 (80.3). En la tabla multimodal, MathVision (95.2) y las filas de OCR son sus resultados más fuertes en general.

¿Dónde pierde claramente Qwen 3.8-Max?

En HLE obtiene 43.6, el último entre los cuatro modelos insignia y muy por detrás de los 53.3 de Fable 5. En SWE-bench Pro obtiene 67.7 frente a los 80.0 de Fable 5, y también se queda atrás en DeepSWE. Las evaluaciones de ingeniería de software profunda y los exámenes de conocimiento amplio son sus áreas más débiles en la propia tabla de Alibaba.

¿Cuánto mejor es Qwen 3.8 que Qwen 3.7-Max en los benchmarks?

Las ganancias generacionales en la tabla de Alibaba son grandes: Terminal Bench 2.1 pasó de 74.5 a 86.6, SWE-bench Pro de 60.6 a 67.7, y PaperBench de 64.8 a 93.0. Si la actualización vale la pena para su carga de trabajo depende también del precio y la modalidad; nuestra comparación de Qwen 3.8 vs Qwen 3.7 detalla la decisión completa.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs