Julio de 2026 se convirtió en un mes de dos caballos para los modelos de frontera de peso abierto, y ambos caballos vinieron de China. Moonshot AI lanzó Kimi K3 el 16 de julio. Tres días después, Alibaba presentó Qwen 3.8-Max, y luego lo puso a disposición general a principios de agosto. Ambos son modelos de mezcla de expertos de un billón de parámetros. Ambos prometen (o entregan) pesos abiertos. Ambos se conectan a arneses de agente estilo Claude Code. Y ambos superan a los laboratorios de frontera de EE. UU. en precio.
La similitud superficial esconde diferencias reales: en lo que puedes descargar hoy, en lo que los modelos pueden ver, y en lo que cuesta un mes de uso intensivo. Esta comparación recorre cada eje que puedes verificar a partir del 3 de agosto de 2026. Para un desglose completo de las especificaciones del nuevo buque insignia de Alibaba, comienza con nuestra explicación de Qwen 3.8-Max y regresa.
Una nota de honestidad antes de empezar: todavía no existe una comparativa independiente directa de estos dos modelos. Cada número en este artículo proviene de la propia tabla de un proveedor, e indicamos de quién es cada ejecución de número. Trata la sección de comparativas como indicativa, no como definitiva.
La cronología: quién lanzó qué y cuándo
El orden de lanzamiento importa más de lo habitual aquí, porque «pesos abiertos» significa algo diferente para cada modelo en este momento.
Kimi K3 se lanzó el 16 de julio de 2026. Moonshot prometió pesos abiertos en el lanzamiento y los entregó 11 días después: los pesos llegaron a Hugging Face el 27 de julio como una versión MXFP4 de 594 GB. A día de hoy, puedes descargar K3, cuantificarlo aún más y ejecutarlo en tu propio hardware. Eso no es una promesa. Sucedió.
Qwen 3.8-Max se previsualizó el 19 de julio y alcanzó la disponibilidad general en Alibaba Cloud Model Studio a principios de agosto, según la publicación oficial de lanzamiento de Qwen. Los pesos están prometidos para Hugging Face y ModelScope «la próxima semana», lo que los sitúa alrededor del 10 de agosto. A 3 de agosto de 2026, no son descargables. La propia brecha de 11 días de K3 entre el lanzamiento y los pesos muestra que este patrón es normal, pero hoy solo uno de estos modelos está abierto en la práctica.
Si el autoalojamiento es tu factor decisivo, ese único hecho puede terminar la comparación prematuramente.
Parámetros: dos modelos MoE a escala de billones, uno más ligero
Ambos modelos son diseños de mezcla de expertos dispersos, lo que significa que el recuento de parámetros principal y el costo de computación por token son números muy diferentes.
| Especificación | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Parámetros totales | 2.4T | 2.8T |
| Parámetros activos por token | 95B | 104B |
| Tasa de activación | ~4% | ~3.7% |
| Base de la arquitectura | Base Qwen 3.5, MoE | MoE |
| Formato de peso abierto | Prometido (~10 de agosto) | MXFP4, 594 GB en Hugging Face |
Qwen 3.8-Max es el modelo más pequeño en ambos aspectos: 400B parámetros totales menos y 9B parámetros activos menos que K3. Ninguna de las diferencias es dramática, y los recuentos de parámetros activos no se traducen linealmente en capacidad. En lo que sí se traducen es en el costo de servicio. Un modelo que activa 95B parámetros por token es más barato de ejecutar a escala que uno que activa 104B, si todo lo demás es igual, y esa diferencia se refleja en los precios de la API a continuación.
Para quienes lo autoalojan, el número más relevante es la descarga de 594 GB de K3 en precisión MXFP4. Eso es territorio multinodo incluso antes de considerar la caché KV en contexto largo. Espera que Qwen 3.8-Max, con 2.4T en total, caiga en una clase de peso similar cuando aparezcan sus archivos. La mayoría de los equipos utilizarán puntos finales alojados para ambos modelos y reservarán el autoalojamiento para casos de cumplimiento o investigación.
Apertura hoy: pesos en vivo vs una promesa anticuada
Este eje merece su propia sección porque el marketing de ambos lados dice «abierto» mientras que los hechos difieren.
Los pesos de Kimi K3 son públicos. Puedes verificar el repositorio, comprobar la licencia y descargar los archivos ahora mismo. Eso trae todo lo que la verdadera apertura permite: alojamiento de terceros, cuantizaciones comunitarias, ajuste fino y la seguridad de que el modelo que probaste no puede ser reemplazado silenciosamente sin tu conocimiento.
Qwen 3.8-Max sería el primer modelo de clase Qwen-Max lanzado con pesos abiertos, un cambio genuino en la estrategia de Alibaba después de mantener todos los modelos anteriores de nivel Max solo a través de API. Pero una primicia es solo una primicia una vez que sucede. Hasta que el repositorio de Hugging Face esté activo, Qwen 3.8-Max es un modelo API con un anuncio adjunto.
Otorga puntos a K3 en este eje hoy, con una nota a lápiz para volver a verificar alrededor del 10 de agosto. Si Alibaba cumple, el eje se convierte en un empate y la comparación se traslada a los términos de la licencia y la calidad de la cuantificación.
Modalidad: Qwen ve imágenes, K3 lee texto
Aquí la brecha va en la otra dirección, y no es pequeña.
Qwen 3.8-Max acepta entrada de texto e imagen, según las configuraciones oficiales del modelo ("input_modalities": ["text", "image"]). La publicación de lanzamiento de Alibaba va más allá, demostrando la comprensión de documentos largos en PDFs de más de 200 páginas y la comprensión de videos de 100 horas a través de gráficos de memoria; trata esos como demostraciones de blog, no como tipos de entrada de API documentados. Sin embargo, la entrada de imagen es real y está en la API hoy. Los puntos de referencia del proveedor de Alibaba se inclinan hacia ella: la tabla multimodal (MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1, filas de OCR potentes) es donde Qwen 3.8-Max publica sus números más unilaterales.
Kimi K3 es un modelo de texto. Si tu carga de trabajo implica capturas de pantalla, documentos escaneados, comprensión de la interfaz de usuario o cualquier tarea de agente relacionada con la visión, K3 necesita un modelo de visión separado atornillado a la tubería, con todo el código de pegamento y la latencia adicional que eso implica.
Para la codificación y el trabajo de agente solo con texto, este eje es irrelevante. Para la inteligencia documental y los agentes de uso de computadora, es decisivo.
Contexto, salida y la superficie de la API
Qwen 3.8-Max ofrece una ventana de contexto de 1,000,000 de tokens como un único nivel plano, con una salida máxima de 65,536 tokens. El razonamiento se controla mediante un parámetro reasoning_effort (xhigh por defecto, con medium y low), y la salida de pensamiento se conserva por defecto. Es de destacar que los modos de pensamiento y no pensamiento se facturan a la misma tarifa.
El acceso se realiza a través de Alibaba Cloud Model Studio con tres URL base regionales (Beijing, Singapur, US-Virginia) y, de forma inusual, dos tipos de protocolo en una sola plataforma: un endpoint compatible con OpenAI y un endpoint compatible con Anthropic. Esa superficie de doble protocolo es la razón por la que Qwen 3.8-Max se integra en Claude Code con nada más que ANTHROPIC_BASE_URL y ANTHROPIC_MODEL=qwen3.8-max. La gama completa y la disponibilidad regional están documentadas en la página de modelos de Model Studio; si trabajas entre regiones, herramientas como Apidog te permiten almacenar cada URL base como un entorno y cambiar entre ellas sin editar las solicitudes.
Kimi K3 también habla el protocolo Anthropic y se integra en arneses estilo Claude Code, que es exactamente la razón por la que estos dos modelos compiten por el mismo puesto: el puesto de «apuntar tu arnés de agente existente a un modelo de frontera más barato». Para obtener detalles del endpoint de K3 y los límites actuales, consulta nuestra explicación de Kimi K3 en lugar de confiar en números que pueden haber cambiado desde el lanzamiento.
Precios: plano y simple vs entrada barata, salida cara
Aquí están las tarifas publicadas, por millón de tokens:
| Tarifa | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Entrada | $2.00 | $3.00 |
| Salida | $6.00 | $15.00 |
| Entrada por acierto de caché | $0.20 (10% de la entrada) | $0.30 |
| Niveles | Plano en todo el contexto de 1M | Según el calendario publicado de Moonshot |
Qwen 3.8-Max cuesta $2 de entrada y $6 de salida, tarifa plana desde el token cero hasta el millón de tokens, pensando o no, según la página oficial de precios de Model Studio. La creación explícita de caché se factura al 125% de la entrada, los aciertos de caché al 10%. También hay una cuota gratuita: 1M de tokens, solo en la región de Singapur, válida por 90 días.
Las tarifas de K3 son $0.30 por millón en aciertos de caché, $3 por millón de entrada y $15 por millón de salida.
La comparación no es un solo número. En cargas de trabajo con mucha entrada y buena disciplina de caché (prompts de sistema largos, contexto de documento repetido), los dos modelos se acercan más de lo que sugiere el precio de lista: $0.20 vs $0.30 por megatoken en caché es una brecha estrecha. En cargas de trabajo con mucha salida, la brecha es amplia: la tarifa de salida de $15 de K3 es 2.5 veces la de $6 de Qwen. Los bucles de agente que generan mucho razonamiento y código se inclinan hacia una salida pesada, lo que favorece a Qwen 3.8-Max en teoría.
Una advertencia que se aplica específicamente a Qwen: reasoning_effort por defecto es xhigh, y los tokens de pensamiento se facturan como salida. Las facturas reales serán superiores a lo que predice una estimación ingenua de tokens de entrada y salida. Nuestro desglose de precios de Qwen 3.8 ofrece ejemplos de costo por tarea si deseas modelar esto antes de comprometerte.
Comparativas: dos tablas de proveedores, sin árbitro
Aquí es donde la mayoría de las comparaciones de estos dos modelos fallan, así que seamos precisos sobre lo que existe.
Lo que existe: Alibaba publicó una tabla de comparativas para Qwen 3.8-Max frente a Claude Opus 4.8, Fable 5, GPT-5.6 Sol y Qwen 3.7-Max. Moonshot publicó su propia tabla de lanzamiento para Kimi K3 frente a una línea de modelos de frontera similar. Ambas son ejecuciones de proveedores.
Lo que no existe: ninguna evaluación independiente que coloque a Qwen 3.8-Max y Kimi K3 en la misma tabla bajo el mismo arnés. No se disponía de números de Artificial Analysis para Qwen 3.8-Max en el momento de la redacción. Los dos proveedores no compararon los modelos del otro.
Con ese marco, aquí está lo que cada lado afirma en su propia ejecución.
De la tabla de Alibaba (ejecución de Alibaba, en gran parte a través del arnés de Claude Code, un detalle que la propia Alibaba divulga):
| Referencia | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 |
| HLE | 43.6 | 45.7 | 53.3 | 47.2 |
Los propios números de Alibaba incluyen claras pérdidas: Qwen 3.8-Max queda muy por debajo de Fable 5 en SWE-bench Pro y de todos los listados en HLE. Sus filas destacadas son PaperBench, el seguimiento de instrucciones (IFBench 82.8) y el barrido multimodal. Varios otros resultados principales utilizan las comparativas internas de Alibaba (QwenSWEBench, CoWorkBench y otros), que no se pueden contrastar con nadie.
Por parte de Moonshot, la tabla de lanzamiento de K3 mostraba que superaba a Claude Opus 4.8 en las filas de comparativas destacadas de Moonshot, mientras que quedaba por detrás de Fable 5 y GPT-5.6 Sol en general. Cubrimos esas afirmaciones y sus advertencias en nuestra comparación de Kimi K3 vs Claude Opus 4.8.
¿Puedes alinear las dos tablas donde las comparativas se superponen? Puedes, y la gente lo hará, pero diferentes arneses, andamiajes y configuraciones de muestreo hacen que las lecturas entre tablas sean, en el mejor de los casos, indicativas. El resumen honesto: ambos proveedores muestran su modelo competitivo con, y selectivamente por delante de, la frontera de EE. UU. en tareas agénticas. Ninguna tabla decide cuál de los dos es más fuerte. Para la letra pequeña sobre los números de Alibaba, consulta nuestro análisis de comparativas de Qwen 3.8.
Ejecuta tu propia comparativa directa en Apidog
Dado que no existe un árbitro, la comparativa más útil es la que ejecutas con tu propia carga de trabajo. Ambos modelos exponen endpoints de finalización de chat compatibles con OpenAI, lo que facilita una prueba lado a lado en Apidog.
Configura dos entornos, uno con la URL base de DashScope y qwen3.8-max, el otro con el endpoint de Moonshot y el ID del modelo K3, cada uno con su propia variable de clave API. Guarda una solicitud con tu prompt real (una tarea real de tu producto, no un acertijo) y alterna entre entornos para enviar la misma carga útil a ambos modelos. La vista de respuesta de Apidog te ofrece el estado, la latencia y el cuerpo completo lado a lado, y su depuración SSE muestra cómo cada modelo transmite contenido de razonamiento, lo cual es importante si tu interfaz de usuario renderiza tokens de pensamiento. Añade un par de aserciones (esquema de respuesta, límite de latencia, palabras clave requeridas en la salida) y habrás convertido una comprobación de ambiente en una prueba repetible que puedes volver a ejecutar cuando cualquiera de los proveedores lance una actualización. Descarga Apidog gratis para ejecutar la comparación; diez prompts a través de ambos endpoints te dirán más que la tabla de cualquier proveedor.
El marcador
| Eje | Ganador hoy | Advertencia |
|---|---|---|
| Parámetros totales/activos | Qwen 3.8-Max (más ligero: 2.4T/95B vs 2.8T/104B) | Más pequeño no es mejor ni peor por sí mismo; principalmente indica el costo de servicio |
| Pesos abiertos, hoy | Kimi K3 (en vivo en Hugging Face, 594 GB MXFP4) | Los pesos de Qwen se esperan para ~10 de agosto; vuelve a verificar, este eje puede empatar pronto |
| Modalidad | Qwen 3.8-Max (entrada de texto + imagen) | Las afirmaciones de video/documentos largos son demostraciones de blog, no tipos de entrada de API documentados |
| Ventana de contexto | Qwen 3.8-Max (nivel plano de 1M, salida máxima de 65,536) | Verifica los límites actuales de K3 con la documentación de Moonshot para tu caso de uso |
| Precio | Qwen 3.8-Max ($2/$6 plano vs $3/$15) | El valor predeterminado de pensamiento xhigh infla las facturas de salida reales de Qwen |
| Comparativas | No es posible determinar un ganador | Ambas tablas son de proveedores; no existe una comparativa directa independiente |
| Ecosistema de arneses | Empate | Ambos se integran en arneses estilo Claude Code a través de endpoints de protocolo Anthropic |
| Historial de promesas | Kimi K3 | Pesos enviados 11 días después del lanzamiento; la promesa de Qwen aún está abierta |
Cuál elegir y cuándo
Elige Kimi K3 si necesitas pesos en tu propio hardware esta semana, tu postura de cumplimiento requiere un modelo que puedas fijar y auditar, o tu carga de trabajo es puramente textual y con una entrada lo suficientemente pesada como para que el precio de la caché sea dominante.
Elige Qwen 3.8-Max si tu carga de trabajo implica imágenes o documentos, generas muchos tokens de salida (bucles de agente, generación de código), o quieres un contexto de 1M de tokens sin sorpresas de precios escalonados.
Espera una semana si los pesos abiertos son tu única razón para considerar cualquiera de los modelos. Si los pesos de Qwen llegan como prometido alrededor del 10 de agosto, el eje de apertura se restablece y la decisión se reduce a la modalidad, el precio y tus propios resultados de evaluación.
La verdadera historia es que los desarrolladores ahora tienen dos opciones de frontera creíbles, baratas y compatibles con arneses de China, con tres semanas de diferencia entre sí. Sea cual sea tu inclinación, ejecuta tus propios prompts a través de ambos endpoints antes de comprometer una hoja de ruta con la tabla de cualquiera de los proveedores.
Preguntas frecuentes
¿Es Kimi K3 más abierto que Qwen 3.8-Max?
Hoy, sí, como una simple cuestión de hecho: los pesos de K3 han estado en Hugging Face desde el 27 de julio de 2026 (594 GB, MXFP4), mientras que los pesos de Qwen 3.8-Max están prometidos para alrededor del 10 de agosto y aún no son descargables. Si Alibaba cumple, ambos serán modelos de frontera de peso abierto y las diferencias significativas se trasladarán a los términos de la licencia y el soporte comunitario. Hasta entonces, solo K3 puede ser autoalojado; nuestra guía local de K3 explica lo que eso implica.
¿Qué modelo es mejor para codificar, Qwen 3.8-Max o Kimi K3?
Nadie puede responder eso honestamente todavía. Ambos proveedores publican sólidos números de codificación agéntica, pero cada uno realizó sus propias evaluaciones bajo sus propias condiciones, y no existe una comparativa directa independiente. La propia tabla de Alibaba incluso muestra que Qwen 3.8-Max pierde frente a Fable 5 en SWE-bench Pro, por lo que las tablas de los proveedores sí admiten pérdidas; simplemente no son comparables entre proveedores. Ejecuta ambos modelos en tareas de tu propio repositorio antes de decidir.
¿Puedo usar ambos modelos en Claude Code?
Sí. Ambos exponen endpoints compatibles con Anthropic. Para Qwen 3.8-Max, establece ANTHROPIC_BASE_URL al endpoint Anthropic de DashScope y ANTHROPIC_MODEL=qwen3.8-max usando la configuración de la publicación de lanzamiento de Alibaba. K3 soporta el mismo patrón a través del endpoint de Moonshot. Esa compatibilidad de arnés compartida es lo que hace que la prueba A/B de ambos sea tan económica de configurar.
¿Cuál es más barato para una carga de trabajo típica de agente?
Según el precio de lista, Qwen 3.8-Max: $2/$6 por millón de tokens frente a los $3/$15 de K3, y los bucles de agente se inclinan hacia los tokens de salida, donde la diferencia es de 2.5x. Dos salvedades: la tasa de acierto de caché de K3 de $0.30 mantiene competitivas las cargas de trabajo intensivas en entrada y bien almacenadas en caché, y el esfuerzo de razonamiento xhigh predeterminado de Qwen factura el pensamiento como salida, por lo que sus costos reales superan las estimaciones ingenuas. Modela tu propia mezcla de tokens antes de asumir que los precios de etiqueta cuentan toda la historia.
