Si vous utilisez déjà Kimi, le lancement de Kimi K3 le 16 juillet 2026 soulève une question pratique : est-ce la mise à niveau vers laquelle vous passez, ou un modèle plus grand et plus cher que vous pouvez ignorer pour l'instant ? Kimi K2.7 Code est la version axée sur le codage de la gamme K2, et de nombreuses équipes l'ont intégrée à leurs agents et à leur CI le trimestre dernier. K3 est un animal différent : le nouveau fleuron de Moonshot, construit à une échelle beaucoup plus grande, avec un nouveau design d'attention et une fenêtre contextuelle de 1M de tokens. Cet article décortique ce qui a réellement changé, ce qui relève du marketing, et comment décider de migrer ou non.
Nous ne sommes pas neutres ici : nous avons écrit les guides sur les deux modèles, il s'agit donc de la note de mise à niveau honnête que nous donnerions à un collègue. Étant donné que les deux modèles exposent une API compatible OpenAI, vous pouvez exécuter la même requête via kimi-k3 et kimi-k2-7-code côte à côte dans Apidog et lire la différence dans les sorties, la latence et les dépenses de tokens avant de réécrire le moindre code de production. D'abord, le verdict.
bouton
TL;DR : le verdict en un coup d'œil
- K3 est le modèle le plus grand et le plus général. Un modèle mélange d'experts de 2,8 T de paramètres, environ trois fois la taille de la gamme K2 d'environ 1 T de paramètres dont est issu K2.7 Code. K2.7 Code était un spécialiste du codage ; K3 est le fleuron "le plus performant" de Moonshot, également excellent pour le codage agentique à long terme.
- Le contexte a bondi à 1M de tokens. K3 gère 1 048 576 tokens, ce qui change la signification de "donnez-lui tout le dépôt".
- L'architecture est nouvelle, pas seulement mise à l'échelle. Kimi Delta Attention, Attention Residuals et un framework Stable LatentMoE (16 experts sur 896 actifs) constituent la véritable histoire d'ingénierie.
- Les prix ont augmenté. K3 coûte 0,30 $/M en entrée avec cache, 3 $/M en entrée sans cache et 15 $/M en sortie. Le calcul du coût d'entrée faible n'est rentable que si votre taux de réussite du cache est élevé.
- Plafond honnête : Le propre blog de Moonshot indique que K3 est toujours derrière Claude Fable 5 et GPT-5.6 Sol. C'est un niveau de pointe pour un modèle ouvert, pas le leader incontesté.
- Migrez si vous avez besoin d'un contexte plus large, d'un raisonnement général plus fort ou d'exécutions d'agents à long terme. Restez sur K2.7 Code si votre charge de travail est un codage ciblé à un prix qui vous convient et que K2.7 satisfait déjà vos exigences de qualité.
Deux types de modèles différents
Avant de comparer les spécifications, comprenez ceci : K2.7 Code et K3 ont été conçus pour des tâches différentes.
Kimi K2.7 Code est le membre axé sur le codage de la lignée K2 (K2, K2 Thinking, K2.5, K2.6, puis K2.7 Code), qui culminait autour de la classe des 1 T de paramètres. Il a orienté cette lignée résolument vers la génération de code, l'édition et les tâches de développeur agentiques : si votre travail consistait à "écrire et corriger du code via une API", c'était un choix optimisé et économiquement judicieux. Pour les nombres de paramètres exacts de K2.7 Code, le contexte et les prix, consultez notre explication qu'est-ce que Kimi K2.7 Code.
K3 n'est pas une version de codage. C'est le nouveau fleuron, le modèle général le plus performant de Moonshot, avec le codage comme une capacité forte parmi un ensemble plus large. Vous ne comparez donc pas un ancien codeur à un nouveau codeur ; vous comparez un spécialiste à un généraliste qui est également bon en code, et c'est ce qui motive la plupart des décisions de migration.
Ce qui a réellement changé, de génération en génération
Voici ce qui a évolué, débarrassé du marketing.
Échelle : environ trois fois le total des paramètres
K3 est un modèle mélange d'experts de 2,8 T de paramètres. La gamme K2 qui a produit K2.7 Code se situait dans la classe des ~1 T de paramètres, donc K3 multiplie par trois le total des paramètres. Une mise en garde : Moonshot n'a pas publié le nombre de paramètres actifs de K3. Les modèles MoE n'exécutent qu'une fraction de leurs poids par token, donc "2,8 T au total" n'est pas le nombre qui détermine le coût d'inférence. Ne lisez pas 2,8 T comme "2,8 T de paramètres sont activés à chaque requête". Ce que Moonshot a publié est le modèle d'activation, couvert ensuite.
Une nouvelle architecture d'attention, pas une simple mise à l'échelle
Cette partie est réellement nouvelle plutôt que simplement plus grande. K3 est construit sur trois éléments nommés :
- Kimi Delta Attention, un mécanisme d'attention linéaire hybride. L'attention linéaire s'adapte mieux à la longueur de séquence que l'attention quadratique standard, ce qui explique en partie comment une fenêtre de 1M de tokens devient pratique.
- Attention Residuals, que Moonshot décrit comme un remplacement direct des connexions résiduelles standard.
- Stable LatentMoE, le cadre de mélange d'experts qui active 16 experts sur 896 par token.
Moonshot rapporte une amélioration d'environ 2,5x de l'efficacité de la mise à l'échelle par rapport à Kimi K2 : plus de capacité par unité de calcul, pas seulement plus de calcul. K2.7 Code, un modèle de génération K2, n'intègre pas cette refonte, l'écart n'est donc pas seulement "plus grand" mais "construit différemment".
Contexte : jusqu'à 1M de tokens
K3 prend en charge une fenêtre contextuelle de 1 048 576 tokens. Pour un flux de travail de codage, c'est la différence entre alimenter un agent avec une poignée de fichiers et lui remettre une grande partie d'un véritable dépôt, ses tests et ses journaux en une seule fois. Si vous rencontriez des limites de contexte avec K2.7 Code sur des tâches impliquant de grands dépôts, c'est le changement le plus susceptible d'avoir un impact quotidien.
Positionnement : du spécialiste au généraliste phare
K2.7 Code était une version axée sur le codage ; K3 est le modèle phare « le plus performant », qui est également excellent pour le codage agentique à long terme. Moonshot fait référence à des exécutions autonomes sur des problèmes complexes en plusieurs étapes, y compris une exécution unique de 48 heures sur une tâche de conception de puce. Que ces anecdotes correspondent à votre charge de travail est quelque chose que vous devez tester, et non prendre pour acquis. Mais l'intention est claire : K3 est destiné aux agents qui s'exécutent longtemps et maintiennent leur état, là où le contexte de 1M et le nouveau design d'attention portent leurs fruits.
Tarification : tarifs phares
K3 est tarifé à 0,30 $ par million de tokens pour l'entrée avec cache, 3 $ par million pour l'entrée sans cache, et 15 $ par million pour la sortie. L'écart de 10x sur l'entrée est la partie intéressante. Pour les charges de travail avec un taux élevé de succès du cache, comme le codage agentique qui réutilise une grande invite système et un contexte de dépôt sur de nombreux appels, le coût d'entrée effectif se rapproche beaucoup plus de 0,30 $ que de 3 $ ; pour les appels uniques avec un nouveau contexte, vous payez le prix affiché de 3 $. La sortie à 15 $/M est de niveau phare sans levier de réduction. Pour le calcul complet du cache, consultez notre guide de tarification Kimi K3, et confirmez les tarifs de K2.7 Code avant de supposer que K3 est strictement plus cher par tâche.
Kimi K3 vs Kimi K2.7 Code : côte à côte
| Dimension | Kimi K2.7 Code | Kimi K3 |
|---|---|---|
| Positionnement | Version axée sur le codage de la gamme K2 | Modèle général phare "le plus performant", excellent pour le codage agentique |
| Génération | Lignée K2 (K2 à K2.6 à K2.7 Code) | Nouvelle génération K3 |
| Paramètres totaux | Classe ~1T (ligne K2) | 2,8T au total (MoE) |
| Paramètres actifs | Confirmer vs notre article K2.7 Code | Non publié ; 16 experts sur 896 actifs |
| Conception de l'attention | Attention de génération K2 | Kimi Delta Attention + Attention Residuals |
| Cadre MoE | MoE de génération K2 | Stable LatentMoE (16/896 experts) |
| Fenêtre contextuelle | Confirmer vs notre article K2.7 Code | 1 048 576 tokens (1M) |
| ID du modèle | kimi-k2-7-code |
kimi-k3 |
| Compatibilité API | Compatible OpenAI-SDK | Compatible OpenAI-SDK |
| Tarification affichée | Confirmer vs notre article K2.7 Code | 0,30 $/3 $ en entrée (cache-hit/miss), 15 $ en sortie par M |
| Poids ouverts | Voir notre couverture de K2.7 Code | Attendu vers le 27 juillet 2026 |
| Signal indépendant | Voir notre couverture de K2.7 Code | Artificial Analysis Intelligence Index 57, #4/189 |
| Meilleure adaptation | Codage ciblé à un coût connu | Contexte large, long terme, travail général + codage |
Une note sur les cellules marquées "confirmer" : nous n'inventons délibérément pas de chiffres exacts pour K2.7 Code. Lorsque vous avez besoin d'une spécification précise de K2.7, notre article qu'est-ce que Kimi K2.7 Code et notre guide API Kimi K2.7 Code sont les sources fiables. La formulation comparative de K3 maintient l'honnêteté de la comparaison.
Où K3 se situe réellement par rapport à la frontière
Il serait facile de lire "fleuve 2,8T" comme "nouveau meilleur modèle", voici donc la partie que les fournisseurs adoucissent habituellement. Le propre blog de lancement de Moonshot indique que K3 est à la traîne par rapport à Claude Fable 5 et GPT-5.6 Sol. Il est compétitif sur des benchmarks spécifiques et en avance sur certains, mais ne revendique pas la couronne globale.
La lecture indépendante le confirme. Artificial Analysis place l'indice d'intelligence de K3 à 57, classé #4 sur 189 modèles, avec une sortie d'environ 62 tokens par seconde, ce qui est plutôt lent pour sa catégorie de prix. Sur les benchmarks de codage publiés par Moonshot, le tableau est mitigé plutôt que dominant : sur DeepSWE, il rapporte K3 à 67,5 contre 70,0 pour Fable 5, et sur Terminal-Bench 2.1, il rapporte K3 à 88,3 contre 84,6 pour Fable 5. K3 gagne certains matchs et en perd d'autres contre la frontière, un excellent résultat pour un modèle à poids ouverts et non une raison de le survendre. Lisez l'ensemble des affirmations de Moonshot sur le post de lancement officiel de Kimi K3 ; nous décortiquons l'écart entre le fournisseur et l'indépendant dans notre analyse des benchmarks Kimi K3.
Pour votre décision de migration, "une amélioration par rapport à son propre prédécesseur" est une affirmation différente de "surpasse tous les modèles fermés". Les deux sont vrais à la fois.
Faut-il migrer ou rester sur K2.7 Code ?
Exécutez votre charge de travail en répondant à ces questions dans l'ordre.
Migrez vers K3 si l'une des conditions suivantes est vraie
- Vous atteignez les limites de contexte. Si K2.7 Code tronque les tâches sur les grands dépôts, les refactorisations de services entiers ou les longues transcriptions d'agents, la fenêtre de 1M est la raison la plus claire de migrer. La marge de manœuvre brute est irremplaçable.
- Vos tâches sont à long terme et agentiques. Les exécutions en plusieurs étapes qui maintiennent l'état à travers de nombreux appels d'outils sont la cible de la conception de K3. Si votre agent perd le fil sur de longues tâches, testez si K3 le maintient mieux.
- Vous avez besoin d'un raisonnement général, pas seulement de code. Si votre produit mélange du code avec de la planification ou de l'analyse, un spécialiste du codage peut être le mauvais outil.
- Votre taux de succès du cache est élevé. Réutiliser une grande invite système et un contexte partagé sur de nombreux appels permet au coût d'entrée avec cache de 0,30 $ de K3 d'adoucir le prix phare, ramenant le coût effectif plus près de vos dépenses K2.7.
Restez sur K2.7 Code si l'une des conditions suivantes est vraie
- Votre charge de travail est un codage ciblé et K2.7 atteint déjà la barre de qualité. Si la qualité est satisfaisante et que vous livrez, un modèle phare plus grand peut être un coût dont vous n'avez pas besoin. "Suffisamment bon et moins cher" est une réponse légitime.
- Vous êtes sensible aux coûts avec une faible réutilisation du cache. Les appels ponctuels avec un contexte frais paient les 3 $ d'entrée en cache-miss de K3 et les 15 $ de sortie, donc sans un taux de cache-hit élevé, le calcul du fleuron est plus difficile à justifier.
- La latence est plus importante que l'intelligence maximale. Les ~62 tokens/sec de K3 sont inférieurs à la médiane de sa catégorie de prix. Si votre application est limitée par la latence, évaluez cela avant de supposer que le modèle plus grand sera plus rapide.
- Les poids ouverts régissent votre plan. Les poids de K3 sont attendus vers le 27 juillet 2026, donc toute exigence d'auto-hébergement doit être vérifiée par rapport à la version réelle sur Hugging Face de Moonshot, et non supposée déjà livrée.
Scénarios réels
Quelques profils concrets, car les conseils abstraits n'ont qu'une portée limitée.
Un bot de correction de code CI sur un dépôt de taille moyenne. S'il réussit déjà les tests et reste bon marché sur K2.7 Code, vous n'avez probablement pas besoin de K3. Tâche étroite, contexte adapté, coût par exécution important. Restez où vous êtes ; réévaluez uniquement si les taux d'échec augmentent.
Un agent de refactoring autonome sur un grand monorepo. Le terrain de jeu de K3 : le contexte de 1M charge plus de code, de tests et de logs à la fois, et la conception à long terme est conçue pour des exécutions qui touchent de nombreux fichiers sur de nombreuses étapes. Vaut un véritable essai.
Pour une configuration pratique, notre guide sur le codage avec Kimi K3 et notre guide API Kimi K3 couvrent la sélection du modèle et le démarrage rapide compatible OpenAI ; si vous utilisez toujours l'ancienne ligne, l'explication de K2.6 complète l'historique.
Comment A/B tester les deux avant de vous engager
La meilleure façon de décider est d'exécuter la même requête via les deux modèles et de lire la différence. Puisque les deux sont compatibles avec le SDK OpenAI, c'est peu de travail.
Dirigez une requête vers le point de terminaison Moonshot avec le modèle défini sur kimi-k2-7-code, et une seconde requête identique avec kimi-k3. Gardez tout le reste fixe : même invite système, message utilisateur, température et outils. Comparez ensuite les trois éléments qui motivent votre décision :
- Qualité de la sortie sur vos invites réelles, jugée comme vous jugez une sortie de production, pas au feeling.
- Latence, puisque K3 est le modèle le plus lent selon sa vitesse indépendante, ce qui peut l'emporter sur un gain de qualité dans les applications interactives.
- Dépense en tokens, y compris la façon dont votre taux de succès du cache modifie le coût d'entrée effectif entre les deux.
Apidog facilite ce flux de travail côte à côte. Enregistrez les deux requêtes dans un seul projet, échangez l'ID du modèle en tant que variable d'environnement, observez les réponses de streaming d'événements envoyés par le serveur en temps réel, inspectez les charges utiles d'appels d'outils et consultez l'utilisation des tokens par appel. Dupliquez la requête, modifiez un champ, et vous avez un A/B contrôlé sans code de test jetable. Téléchargez Apidog pour le configurer, et si vous travaillez dans un éditeur, l'intégration Apidog dans VS Code le garde à côté de votre code. C'est un moyen gratuit de décider sur la base de preuves, et non du marketing.

En résumé
K3 représente un véritable saut générationnel par rapport à K2.7 Code, et non un simple changement de nom. Il triple environ le total des paramètres à 2,8 T, intègre une nouvelle architecture d'attention (Kimi Delta Attention, Attention Residuals, Stable LatentMoE), étend le contexte à 1M de tokens, et transforme le produit d'un spécialiste du codage en un généraliste phare. Il coûte également plus cher au prix affiché, et de l'aveu même de Moonshot, il est toujours derrière Fable 5 et GPT-5.6 Sol, donc la mise à niveau n'est pas automatique. Si vous avez besoin du contexte, du raisonnement général ou du comportement d'agent à long terme, migrez. Si K2.7 Code répond déjà à vos exigences à un prix qui vous convient, rester est défendable. Exécutez les deux sur vos propres requêtes, lisez les différences et laissez les preuves guider votre choix.
bouton
Foire aux questions
Lequel est le meilleur pour le codage ? K2.7 Code a été spécialement conçu pour le codage et constitue un excellent choix, rentable, pour les tâches de code ciblées. K3 est un généraliste phare, également doué pour le codage agentique à long terme, avec un contexte beaucoup plus large. Pour les tâches d'agent multi-étapes sur de grands dépôts, K3 a un avantage structurel ; pour le codage ciblé que K2.7 gère bien, K2.7 Code peut être le choix le plus judicieux en termes de coûts.
Kimi K3 est-il plus cher que K2.7 Code ? K3 est tarifé à 0,30 $/M en entrée avec cache, 3 $/M en entrée sans cache et 15 $/M en sortie, ce qui le positionne comme un produit phare. Le fait qu'il coûte plus cher par tâche dépend de votre taux de succès du cache et de la verbosité de la sortie. Il faut donc comparer le coût effectif sur votre propre charge de travail. Les deux modèles sont compatibles avec le SDK OpenAI, donc le passage de l'un à l'autre se résume principalement à un changement d'ID de modèle et à un nouveau test d'invite.
Kimi K3 est-il open source ? Pas le jour du lancement. Moonshot a déclaré que les poids complets du modèle sont attendus vers le 27 juillet 2026. En attendant, K3 est uniquement accessible via API et applications. Traitez tout plan d'auto-hébergement comme étant conditionné à cette sortie.
K3 est-il meilleur que Claude Fable 5 ou GPT-5.6 Sol ? D'après le propre blog de Moonshot, non. K3 est globalement en deçà des deux, bien qu'il soit compétitif ou en avance sur des benchmarks spécifiques. Indépendamment, Artificial Analysis le classe à l'indice d'intelligence 57, classé #4 sur 189. C'est un solide concurrent à poids ouverts, pas le leader incontesté de la frontière.
