Kimi K3 vs Kimi K2.7 Código: Qué Cambió Realmente

Comparación de Kimi K3 vs Kimi K2.7 Código: el salto en escala, la nueva arquitectura de atención, contexto de 1M, cambios en los precios y una guía clara para decidir si migrar o quedarse.

INEZA Felin-Michel

INEZA Felin-Michel

17 July 2026

Kimi K3 vs Kimi K2.7 Código: Qué Cambió Realmente

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Si ya trabajas con Kimi, el lanzamiento de Kimi K3 el 16 de julio de 2026 plantea una pregunta práctica: ¿es esta la actualización a la que te cambias, o un modelo más grande y caro que puedes omitir por ahora? Kimi K2.7 Code es la versión enfocada en codificación de la línea K2, y muchos equipos lo integraron en sus agentes y CI el trimestre pasado. K3 es un animal diferente: el nuevo buque insignia de Moonshot, construido a una escala mucho mayor, con un nuevo diseño de atención y una ventana de contexto de 1 millón de tokens. Este artículo desglosa lo que realmente cambió, qué es marketing y cómo decidir si migrar.

No somos neutrales aquí: escribimos las guías de ambos modelos, por lo que esta es la nota de actualización honesta que le daríamos a un colega. Dado que ambos exponen una API compatible con OpenAI, puedes ejecutar la misma solicitud a través de kimi-k3 y kimi-k2-7-code lado a lado en Apidog y leer la diferencia en las salidas, la latencia y el gasto de tokens antes de reescribir cualquier código de producción. Primero, el veredicto.

button

TL;DR: el veredicto de un vistazo

Dos tipos diferentes de modelos

Antes de comparar especificaciones, entiende esto: K2.7 Code y K3 fueron construidos para hacer trabajos diferentes.

Kimi K2.7 Code es el miembro de la línea K2 enfocado en codificación (K2, K2 Thinking, K2.5, K2.6, luego K2.7 Code), que alcanzó aproximadamente la clase de 1 billón de parámetros. Esa línea se orientó fuertemente hacia la generación, edición y tareas de desarrollo agénticas de código: si tu trabajo era "escribir y corregir código a través de una API", era una opción ajustada y rentable. Para el recuento exacto de parámetros, contexto y precios de K2.7 Code, consulta nuestro explicador qué es Kimi K2.7 Code.

K3 no es una versión de codificación. Es el nuevo buque insignia, el modelo general más capaz de Moonshot, con la codificación como una fuerte capacidad dentro de un conjunto más amplio. Así que no estás comparando un codificador antiguo contra uno nuevo; estás comparando un especialista contra un generalista que también es bueno en código, y eso impulsa la mayor parte de la decisión de migración.

Lo que realmente cambió, generación a generación

Esto es lo que cambió, sin el marketing.

Escala: aproximadamente el triple de parámetros totales

K3 es un modelo de mezcla de expertos con 2.8 billones de parámetros. La línea K2 que produjo K2.7 Code se encontraba en la clase de ~1 billón de parámetros, por lo que K3 triplica aproximadamente el total de parámetros. Una advertencia: Moonshot no publicó el recuento de parámetros activos de K3. Los modelos MoE solo ejecutan una fracción de sus pesos por token, por lo que "2.8 billones totales" no es el número que establece el costo de inferencia. No leas 2.8 billones como "2.8 billones de parámetros se activan en cada solicitud". Lo que Moonshot sí publicó es el patrón de activación, cubierto a continuación.

Una nueva arquitectura de atención, no una escalada

Esta parte es genuinamente nueva en lugar de simplemente más grande. K3 se basa en tres componentes principales:

Moonshot reporta una mejora de aproximadamente 2.5x en la eficiencia de escala en comparación con Kimi K2: más capacidad por unidad de cómputo, no solo más cómputo. K2.7 Code, un modelo de generación K2, no incorpora este rediseño, por lo que la brecha no es solo "más grande" sino "construida de manera diferente".

Contexto: hasta 1 millón de tokens

K3 soporta una ventana de contexto de 1,048,576 tokens. Para un flujo de trabajo de codificación, eso es la diferencia entre alimentar a un agente con un puñado de archivos y entregarle una gran parte de un repositorio real, sus pruebas y sus registros de una sola vez. Si alcanzaste los límites de contexto con K2.7 Code en tareas de repositorios grandes, este es el único cambio que probablemente más importará en el día a día.

Posicionamiento: de especialista a generalista buque insignia

K2.7 Code fue una versión de codificación; K3 es el modelo "más capaz" buque insignia que también es bueno en codificación agéntica de largo alcance. Moonshot señala ejecuciones autónomas en problemas difíciles y de varios pasos, incluyendo una única ejecución de 48 horas en una tarea de diseño de chips. Si esas anécdotas se corresponden con tu carga de trabajo es algo que debes probar, no dar por sentado. Pero la intención es clara: K3 está diseñado para agentes que se ejecutan durante mucho tiempo y mantienen el estado, donde el contexto de 1 millón y el nuevo diseño de atención dan sus frutos.

Precios: tarifas de buque insignia

K3 lista $0.30 por millón de tokens para entrada con acierto de caché, $3 por millón para entrada con fallo de caché y $15 por millón para salida. La diferencia de 10x en la entrada es la parte interesante. En cargas de trabajo con una alta tasa de aciertos de caché, como la codificación agéntica que reutiliza un gran prompt del sistema y el contexto del repositorio en muchas llamadas, el costo efectivo de entrada se acerca mucho más a $0.30 que a $3; en llamadas únicas con contexto nuevo, pagas los $3 de la etiqueta. La salida a $15/M es de nivel de buque insignia sin palanca de descuento. Para ver el cálculo completo de caché, consulta nuestra guía de precios de Kimi K3, y confirma las tarifas de K2.7 Code antes de asumir que K3 es estrictamente más caro por tarea.

Kimi K3 vs Kimi K2.7 Code: uno al lado del otro

Dimensión Kimi K2.7 Code Kimi K3
Posicionamiento Versión centrada en codificación de la línea K2 Modelo general "más capaz" buque insignia, fuerte en codificación agéntica
Generación Linaje K2 (K2 a K2.6 a K2.7 Code) Nueva generación K3
Parámetros totales Clase ~1 billón (línea K2) 2.8 billones totales (MoE)
Parámetros activos Confirmar vs. nuestra publicación de K2.7 Code No publicado; 16 de 896 expertos activos
Diseño de atención Atención de generación K2 Kimi Delta Attention + Attention Residuals
Framework MoE MoE de generación K2 Stable LatentMoE (16/896 expertos)
Ventana de contexto Confirmar vs. nuestra publicación de K2.7 Code 1,048,576 tokens (1M)
ID del modelo kimi-k2-7-code kimi-k3
Compatibilidad API Compatible con OpenAI-SDK Compatible con OpenAI-SDK
Precios listados Confirmar vs. nuestra publicación de K2.7 Code $0.30/$3 entrada (acierto/fallo de caché), $15 salida por M
Pesos abiertos Ver nuestra cobertura de K2.7 Code Esperado alrededor del 27 de julio de 2026
Señal independiente Ver nuestra cobertura de K2.7 Code Índice de Inteligencia de Artificial Analysis 57, #4/189
Mejor ajuste Codificación estrecha a un costo conocido Trabajo general + codificación de contexto grande y largo alcance

Una nota sobre las celdas marcadas con “confirmar”: estamos deliberadamente no inventando números exactos para K2.7 Code. Donde necesites una especificación precisa de K2.7, nuestra publicación qué es Kimi K2.7 Code y la guía API de Kimi K2.7 Code son las fuentes de confianza. La redacción comparativa de K3 mantiene la comparación honesta.

Dónde se sitúa realmente K3 frente a la frontera

Sería fácil leer "buque insignia de 2.8 billones" como "el nuevo mejor modelo", así que aquí está la parte que los proveedores suelen suavizar. El propio blog de lanzamiento de Moonshot dice que K3 todavía está por detrás de Claude Fable 5 y GPT-5.6 Sol. Es competitivo en benchmarks específicos y superior en algunos, pero no reclama la corona general.

La lectura independiente lo respalda. Artificial Analysis sitúa el Índice de Inteligencia de K3 en 57, clasificado como el número 4 de 189 modelos, con una salida de alrededor de 62 tokens por segundo, en el lado más lento para su nivel de precio. En los benchmarks de codificación que Moonshot publica, la imagen es mixta en lugar de dominante: en DeepSWE reporta K3 en 67.5 frente a los 70.0 de Fable 5, y en Terminal-Bench 2.1 reporta K3 en 88.3 frente a los 84.6 de Fable 5. K3 gana en algunos y pierde en otros frente a la frontera, un resultado fuerte para un modelo de pesos abiertos y no una razón para exagerar su venta. Lee el conjunto completo de afirmaciones de Moonshot en la publicación oficial de lanzamiento de Kimi K3; desglosamos la brecha entre el proveedor y el análisis independiente en nuestro desglose de benchmarks de Kimi K3.

Para tu decisión de migración, "superar a tu propio predecesor" es una afirmación diferente de "vence a todos los modelos cerrados". Ambas son ciertas a la vez.

¿Deberías migrar o quedarte en K2.7 Code?

Ejecuta tu carga de trabajo a través de estas preguntas en orden.

Migra a K3 si alguna de estas es cierta

Quédate en K2.7 Code si alguna de estas es cierta

Escenarios del mundo real

Algunos perfiles concretos, ya que los consejos abstractos solo llegan hasta cierto punto.

Un bot de corrección de código CI en un repositorio de tamaño mediano. Si ya pasa las pruebas y sigue siendo económico con K2.7 Code, es probable que no necesites K3. Tarea estrecha, el contexto encaja, el costo por ejecución importa. Mantente así; revisa solo si las tasas de fallo aumentan.

Un agente de refactorización autónomo en un monorepo grande. El territorio de K3: el contexto de 1 millón carga más del código base, pruebas y registros a la vez, y el diseño de largo alcance está construido para ejecuciones que tocan muchos archivos en muchos pasos. Vale la pena una prueba real.

Para una configuración práctica, nuestra guía de codificación con Kimi K3 y la guía de API de Kimi K3 cubren la selección del modelo y el inicio rápido compatible con OpenAI; si todavía estás en la línea anterior, el explicador de K2.6 completa el linaje.

Cómo hacer pruebas A/B de los dos antes de comprometerte

La forma más limpia de decidir es ejecutar la misma solicitud a través de ambos modelos y leer la diferencia. Dado que ambos son compatibles con el SDK de OpenAI, eso es poco trabajo.

Apuntaremos una solicitud al endpoint de Moonshot con el modelo configurado en kimi-k2-7-code, y una segunda solicitud idéntica con kimi-k3. Mantén todo lo demás fijo: el mismo prompt del sistema, mensaje del usuario, temperatura y herramientas. Luego compara las tres cosas que impulsan tu decisión:

  1. Calidad de la salida en tus prompts reales, juzgada de la misma manera que juzgas la salida de producción, no por intuición.
  2. Latencia, ya que K3 es el modelo más lento según su número de velocidad independiente, lo que puede compensar una ganancia de calidad en aplicaciones interactivas.
  3. Gasto de tokens, incluyendo cómo tu tasa de aciertos de caché cambia el costo efectivo de entrada entre los dos.

Apidog simplifica este flujo de trabajo lado a lado. Guarda ambas solicitudes en un proyecto, cambia el ID del modelo como una variable de entorno, observa las respuestas de streaming de eventos enviados por el servidor en tiempo real, inspecciona las cargas útiles de las llamadas a herramientas y ve el uso de tokens por llamada. Duplica la solicitud, cambia un campo y tendrás un A/B controlado sin código de arnés desechable. Descarga Apidog para configurarlo, y si trabajas en un editor, la integración de Apidog dentro de VS Code lo mantiene junto a tu código. Es una forma gratuita de decidir con evidencia, no con marketing.

La conclusión

K3 es un verdadero salto generacional respecto a K2.7 Code, no un simple cambio de nombre. Triplica aproximadamente los parámetros totales a 2.8 billones, presenta una nueva arquitectura de atención (Kimi Delta Attention, Attention Residuals, Stable LatentMoE), extiende el contexto a 1 millón de tokens y redefine el producto de especialista en codificación a generalista buque insignia. También cuesta más según el precio de lista, y por propia admisión de Moonshot, todavía está por detrás de Fable 5 y GPT-5.6 Sol, por lo que la actualización no es automática. Si necesitas el contexto, el razonamiento general o el comportamiento de agente de largo alcance, cámbiate. Si K2.7 Code ya supera tus expectativas a un precio que te gusta, quedarse es defendible. Ejecuta ambos con tus propios prompts, lee la diferencia y deja que la evidencia decida.

button

Preguntas frecuentes

¿Cuál es mejor para codificar? K2.7 Code fue ajustado específicamente para codificación y es una opción fuerte y rentable para tareas de código específicas. K3 es un generalista buque insignia, también bueno en codificación agéntica de largo alcance, con un contexto mucho más grande. Para trabajos de agente de múltiples pasos en repositorios grandes, K3 tiene la ventaja estructural; para codificación específica que K2.7 maneja bien, K2.7 Code puede ser la inversión más inteligente.

¿Es Kimi K3 más caro que K2.7 Code? K3 lista $0.30/M para entrada con acierto de caché, $3/M para entrada con fallo de caché y $15/M para salida, lo cual es de nivel de buque insignia. Si cuesta más por tarea depende de tu tasa de aciertos de caché y la verbosidad de la salida, así que compara el costo efectivo en tu propia carga de trabajo. Ambos modelos son compatibles con el SDK de OpenAI, por lo que el cambio es principalmente un cambio de ID de modelo más una nueva prueba de prompt.

¿Es Kimi K3 de código abierto? No el día del lanzamiento. Moonshot dijo que se esperan los pesos completos del modelo alrededor del 27 de julio de 2026. Hasta que lleguen, K3 es solo por API y aplicación. Considera cualquier plan de autoalojamiento como condicionado a esa publicación.

¿Es K3 mejor que Claude Fable 5 o GPT-5.6 Sol? Según el propio blog de Moonshot, no. K3 está por detrás de ambos en general, aunque es competitivo o superior en benchmarks específicos. De forma independiente, Artificial Analysis lo sitúa en el Índice de Inteligencia 57, clasificado como el número 4 de 189. Es un fuerte contendiente de pesos abiertos, no el líder absoluto de la frontera.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs