Kimi K3 vs Kimi K2.7 Code : Qu'est-ce qui a vraiment changé ?

Comparaison Kimi K3 et Kimi K2.7 Code : le bond en échelle, la nouvelle architecture d'attention, un contexte d'1 million, les évolutions tarifaires et un guide de décision clair pour la migration ou le maintien.

INEZA Felin-Michel

INEZA Felin-Michel

17 July 2026

Kimi K3 vs Kimi K2.7 Code : Qu'est-ce qui a vraiment changé ?

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Si vous utilisez déjà Kimi, le lancement de Kimi K3 le 16 juillet 2026 soulève une question pratique : est-ce la mise à niveau vers laquelle vous passez, ou un modèle plus grand et plus cher que vous pouvez ignorer pour l'instant ? Kimi K2.7 Code est la version axée sur le codage de la gamme K2, et de nombreuses équipes l'ont intégrée à leurs agents et à leur CI le trimestre dernier. K3 est un animal différent : le nouveau fleuron de Moonshot, construit à une échelle beaucoup plus grande, avec un nouveau design d'attention et une fenêtre contextuelle de 1M de tokens. Cet article décortique ce qui a réellement changé, ce qui relève du marketing, et comment décider de migrer ou non.

Nous ne sommes pas neutres ici : nous avons écrit les guides sur les deux modèles, il s'agit donc de la note de mise à niveau honnête que nous donnerions à un collègue. Étant donné que les deux modèles exposent une API compatible OpenAI, vous pouvez exécuter la même requête via kimi-k3 et kimi-k2-7-code côte à côte dans Apidog et lire la différence dans les sorties, la latence et les dépenses de tokens avant de réécrire le moindre code de production. D'abord, le verdict.

bouton

TL;DR : le verdict en un coup d'œil

Deux types de modèles différents

Avant de comparer les spécifications, comprenez ceci : K2.7 Code et K3 ont été conçus pour des tâches différentes.

Kimi K2.7 Code est le membre axé sur le codage de la lignée K2 (K2, K2 Thinking, K2.5, K2.6, puis K2.7 Code), qui culminait autour de la classe des 1 T de paramètres. Il a orienté cette lignée résolument vers la génération de code, l'édition et les tâches de développeur agentiques : si votre travail consistait à "écrire et corriger du code via une API", c'était un choix optimisé et économiquement judicieux. Pour les nombres de paramètres exacts de K2.7 Code, le contexte et les prix, consultez notre explication qu'est-ce que Kimi K2.7 Code.

K3 n'est pas une version de codage. C'est le nouveau fleuron, le modèle général le plus performant de Moonshot, avec le codage comme une capacité forte parmi un ensemble plus large. Vous ne comparez donc pas un ancien codeur à un nouveau codeur ; vous comparez un spécialiste à un généraliste qui est également bon en code, et c'est ce qui motive la plupart des décisions de migration.

Ce qui a réellement changé, de génération en génération

Voici ce qui a évolué, débarrassé du marketing.

Échelle : environ trois fois le total des paramètres

K3 est un modèle mélange d'experts de 2,8 T de paramètres. La gamme K2 qui a produit K2.7 Code se situait dans la classe des ~1 T de paramètres, donc K3 multiplie par trois le total des paramètres. Une mise en garde : Moonshot n'a pas publié le nombre de paramètres actifs de K3. Les modèles MoE n'exécutent qu'une fraction de leurs poids par token, donc "2,8 T au total" n'est pas le nombre qui détermine le coût d'inférence. Ne lisez pas 2,8 T comme "2,8 T de paramètres sont activés à chaque requête". Ce que Moonshot a publié est le modèle d'activation, couvert ensuite.

Une nouvelle architecture d'attention, pas une simple mise à l'échelle

Cette partie est réellement nouvelle plutôt que simplement plus grande. K3 est construit sur trois éléments nommés :

Moonshot rapporte une amélioration d'environ 2,5x de l'efficacité de la mise à l'échelle par rapport à Kimi K2 : plus de capacité par unité de calcul, pas seulement plus de calcul. K2.7 Code, un modèle de génération K2, n'intègre pas cette refonte, l'écart n'est donc pas seulement "plus grand" mais "construit différemment".

Contexte : jusqu'à 1M de tokens

K3 prend en charge une fenêtre contextuelle de 1 048 576 tokens. Pour un flux de travail de codage, c'est la différence entre alimenter un agent avec une poignée de fichiers et lui remettre une grande partie d'un véritable dépôt, ses tests et ses journaux en une seule fois. Si vous rencontriez des limites de contexte avec K2.7 Code sur des tâches impliquant de grands dépôts, c'est le changement le plus susceptible d'avoir un impact quotidien.

Positionnement : du spécialiste au généraliste phare

K2.7 Code était une version axée sur le codage ; K3 est le modèle phare « le plus performant », qui est également excellent pour le codage agentique à long terme. Moonshot fait référence à des exécutions autonomes sur des problèmes complexes en plusieurs étapes, y compris une exécution unique de 48 heures sur une tâche de conception de puce. Que ces anecdotes correspondent à votre charge de travail est quelque chose que vous devez tester, et non prendre pour acquis. Mais l'intention est claire : K3 est destiné aux agents qui s'exécutent longtemps et maintiennent leur état, là où le contexte de 1M et le nouveau design d'attention portent leurs fruits.

Tarification : tarifs phares

K3 est tarifé à 0,30 $ par million de tokens pour l'entrée avec cache, 3 $ par million pour l'entrée sans cache, et 15 $ par million pour la sortie. L'écart de 10x sur l'entrée est la partie intéressante. Pour les charges de travail avec un taux élevé de succès du cache, comme le codage agentique qui réutilise une grande invite système et un contexte de dépôt sur de nombreux appels, le coût d'entrée effectif se rapproche beaucoup plus de 0,30 $ que de 3 $ ; pour les appels uniques avec un nouveau contexte, vous payez le prix affiché de 3 $. La sortie à 15 $/M est de niveau phare sans levier de réduction. Pour le calcul complet du cache, consultez notre guide de tarification Kimi K3, et confirmez les tarifs de K2.7 Code avant de supposer que K3 est strictement plus cher par tâche.

Kimi K3 vs Kimi K2.7 Code : côte à côte

Dimension Kimi K2.7 Code Kimi K3
Positionnement Version axée sur le codage de la gamme K2 Modèle général phare "le plus performant", excellent pour le codage agentique
Génération Lignée K2 (K2 à K2.6 à K2.7 Code) Nouvelle génération K3
Paramètres totaux Classe ~1T (ligne K2) 2,8T au total (MoE)
Paramètres actifs Confirmer vs notre article K2.7 Code Non publié ; 16 experts sur 896 actifs
Conception de l'attention Attention de génération K2 Kimi Delta Attention + Attention Residuals
Cadre MoE MoE de génération K2 Stable LatentMoE (16/896 experts)
Fenêtre contextuelle Confirmer vs notre article K2.7 Code 1 048 576 tokens (1M)
ID du modèle kimi-k2-7-code kimi-k3
Compatibilité API Compatible OpenAI-SDK Compatible OpenAI-SDK
Tarification affichée Confirmer vs notre article K2.7 Code 0,30 $/3 $ en entrée (cache-hit/miss), 15 $ en sortie par M
Poids ouverts Voir notre couverture de K2.7 Code Attendu vers le 27 juillet 2026
Signal indépendant Voir notre couverture de K2.7 Code Artificial Analysis Intelligence Index 57, #4/189
Meilleure adaptation Codage ciblé à un coût connu Contexte large, long terme, travail général + codage

Une note sur les cellules marquées "confirmer" : nous n'inventons délibérément pas de chiffres exacts pour K2.7 Code. Lorsque vous avez besoin d'une spécification précise de K2.7, notre article qu'est-ce que Kimi K2.7 Code et notre guide API Kimi K2.7 Code sont les sources fiables. La formulation comparative de K3 maintient l'honnêteté de la comparaison.

Où K3 se situe réellement par rapport à la frontière

Il serait facile de lire "fleuve 2,8T" comme "nouveau meilleur modèle", voici donc la partie que les fournisseurs adoucissent habituellement. Le propre blog de lancement de Moonshot indique que K3 est à la traîne par rapport à Claude Fable 5 et GPT-5.6 Sol. Il est compétitif sur des benchmarks spécifiques et en avance sur certains, mais ne revendique pas la couronne globale.

La lecture indépendante le confirme. Artificial Analysis place l'indice d'intelligence de K3 à 57, classé #4 sur 189 modèles, avec une sortie d'environ 62 tokens par seconde, ce qui est plutôt lent pour sa catégorie de prix. Sur les benchmarks de codage publiés par Moonshot, le tableau est mitigé plutôt que dominant : sur DeepSWE, il rapporte K3 à 67,5 contre 70,0 pour Fable 5, et sur Terminal-Bench 2.1, il rapporte K3 à 88,3 contre 84,6 pour Fable 5. K3 gagne certains matchs et en perd d'autres contre la frontière, un excellent résultat pour un modèle à poids ouverts et non une raison de le survendre. Lisez l'ensemble des affirmations de Moonshot sur le post de lancement officiel de Kimi K3 ; nous décortiquons l'écart entre le fournisseur et l'indépendant dans notre analyse des benchmarks Kimi K3.

Pour votre décision de migration, "une amélioration par rapport à son propre prédécesseur" est une affirmation différente de "surpasse tous les modèles fermés". Les deux sont vrais à la fois.

Faut-il migrer ou rester sur K2.7 Code ?

Exécutez votre charge de travail en répondant à ces questions dans l'ordre.

Migrez vers K3 si l'une des conditions suivantes est vraie

Restez sur K2.7 Code si l'une des conditions suivantes est vraie

Scénarios réels

Quelques profils concrets, car les conseils abstraits n'ont qu'une portée limitée.

Un bot de correction de code CI sur un dépôt de taille moyenne. S'il réussit déjà les tests et reste bon marché sur K2.7 Code, vous n'avez probablement pas besoin de K3. Tâche étroite, contexte adapté, coût par exécution important. Restez où vous êtes ; réévaluez uniquement si les taux d'échec augmentent.

Un agent de refactoring autonome sur un grand monorepo. Le terrain de jeu de K3 : le contexte de 1M charge plus de code, de tests et de logs à la fois, et la conception à long terme est conçue pour des exécutions qui touchent de nombreux fichiers sur de nombreuses étapes. Vaut un véritable essai.

Pour une configuration pratique, notre guide sur le codage avec Kimi K3 et notre guide API Kimi K3 couvrent la sélection du modèle et le démarrage rapide compatible OpenAI ; si vous utilisez toujours l'ancienne ligne, l'explication de K2.6 complète l'historique.

Comment A/B tester les deux avant de vous engager

La meilleure façon de décider est d'exécuter la même requête via les deux modèles et de lire la différence. Puisque les deux sont compatibles avec le SDK OpenAI, c'est peu de travail.

Dirigez une requête vers le point de terminaison Moonshot avec le modèle défini sur kimi-k2-7-code, et une seconde requête identique avec kimi-k3. Gardez tout le reste fixe : même invite système, message utilisateur, température et outils. Comparez ensuite les trois éléments qui motivent votre décision :

  1. Qualité de la sortie sur vos invites réelles, jugée comme vous jugez une sortie de production, pas au feeling.
  2. Latence, puisque K3 est le modèle le plus lent selon sa vitesse indépendante, ce qui peut l'emporter sur un gain de qualité dans les applications interactives.
  3. Dépense en tokens, y compris la façon dont votre taux de succès du cache modifie le coût d'entrée effectif entre les deux.

Apidog facilite ce flux de travail côte à côte. Enregistrez les deux requêtes dans un seul projet, échangez l'ID du modèle en tant que variable d'environnement, observez les réponses de streaming d'événements envoyés par le serveur en temps réel, inspectez les charges utiles d'appels d'outils et consultez l'utilisation des tokens par appel. Dupliquez la requête, modifiez un champ, et vous avez un A/B contrôlé sans code de test jetable. Téléchargez Apidog pour le configurer, et si vous travaillez dans un éditeur, l'intégration Apidog dans VS Code le garde à côté de votre code. C'est un moyen gratuit de décider sur la base de preuves, et non du marketing.

En résumé

K3 représente un véritable saut générationnel par rapport à K2.7 Code, et non un simple changement de nom. Il triple environ le total des paramètres à 2,8 T, intègre une nouvelle architecture d'attention (Kimi Delta Attention, Attention Residuals, Stable LatentMoE), étend le contexte à 1M de tokens, et transforme le produit d'un spécialiste du codage en un généraliste phare. Il coûte également plus cher au prix affiché, et de l'aveu même de Moonshot, il est toujours derrière Fable 5 et GPT-5.6 Sol, donc la mise à niveau n'est pas automatique. Si vous avez besoin du contexte, du raisonnement général ou du comportement d'agent à long terme, migrez. Si K2.7 Code répond déjà à vos exigences à un prix qui vous convient, rester est défendable. Exécutez les deux sur vos propres requêtes, lisez les différences et laissez les preuves guider votre choix.

bouton

Foire aux questions

Lequel est le meilleur pour le codage ? K2.7 Code a été spécialement conçu pour le codage et constitue un excellent choix, rentable, pour les tâches de code ciblées. K3 est un généraliste phare, également doué pour le codage agentique à long terme, avec un contexte beaucoup plus large. Pour les tâches d'agent multi-étapes sur de grands dépôts, K3 a un avantage structurel ; pour le codage ciblé que K2.7 gère bien, K2.7 Code peut être le choix le plus judicieux en termes de coûts.

Kimi K3 est-il plus cher que K2.7 Code ? K3 est tarifé à 0,30 $/M en entrée avec cache, 3 $/M en entrée sans cache et 15 $/M en sortie, ce qui le positionne comme un produit phare. Le fait qu'il coûte plus cher par tâche dépend de votre taux de succès du cache et de la verbosité de la sortie. Il faut donc comparer le coût effectif sur votre propre charge de travail. Les deux modèles sont compatibles avec le SDK OpenAI, donc le passage de l'un à l'autre se résume principalement à un changement d'ID de modèle et à un nouveau test d'invite.

Kimi K3 est-il open source ? Pas le jour du lancement. Moonshot a déclaré que les poids complets du modèle sont attendus vers le 27 juillet 2026. En attendant, K3 est uniquement accessible via API et applications. Traitez tout plan d'auto-hébergement comme étant conditionné à cette sortie.

K3 est-il meilleur que Claude Fable 5 ou GPT-5.6 Sol ? D'après le propre blog de Moonshot, non. K3 est globalement en deçà des deux, bien qu'il soit compétitif ou en avance sur des benchmarks spécifiques. Indépendamment, Artificial Analysis le classe à l'indice d'intelligence 57, classé #4 sur 189. C'est un solide concurrent à poids ouverts, pas le leader incontesté de la frontière.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API