Kimi K3 x Kimi K2.7 Código: O Que Realmente Mudou

Kimi K3 vs Kimi K2.7 Code comparados: o salto na escala, a nova arquitetura de atenção, 1 milhão de contexto, as mudanças nos preços e um guia claro para a decisão de migrar ou permanecer.

INEZA Felin-Michel

INEZA Felin-Michel

17 julho 2026

Kimi K3 x Kimi K2.7 Código: O Que Realmente Mudou

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Se você já usa o Kimi, o lançamento do Kimi K3 em 16 de julho de 2026 levanta uma questão prática: esta é a atualização para a qual você deve migrar, ou um modelo maior e mais caro que você pode pular por enquanto? O Kimi K2.7 Code é a versão focada em codificação da linha K2, e muitas equipes o integraram em seus agentes e CI no último trimestre. O K3 é um animal diferente: o novo carro-chefe da Moonshot, construído em uma escala muito maior, com um novo design de atenção e uma janela de contexto de 1 milhão de tokens. Este artigo detalha o que realmente mudou, o que é marketing e como decidir se deve migrar.

Não somos neutros aqui: escrevemos os guias para ambos os modelos, então esta é a nota de atualização honesta que daríamos a um colega. Como ambos expõem uma API compatível com OpenAI, você pode executar a mesma solicitação através de kimi-k3 e kimi-k2-7-code lado a lado no Apidog e ler a diferença nas saídas, latência e gasto de tokens antes de reescrever qualquer código de produção. Primeiro, o veredito.

botão

TL;DR: o veredito em um piscar de olhos

Dois tipos diferentes de modelo

Antes de comparar as especificações, entenda isto: K2.7 Code e K3 foram construídos para fazer trabalhos diferentes.

O Kimi K2.7 Code é o membro da linhagem K2 focado em codificação (K2, K2 Thinking, K2.5, K2.6 e depois K2.7 Code), que atingiu o auge na classe de ~1T de parâmetros. Ele direcionou essa linhagem fortemente para geração e edição de código, e tarefas de desenvolvimento agêntico: se seu trabalho era “escrever e corrigir código através de uma API”, era uma escolha ajustada e economicamente sensata. Para contagens exatas de parâmetros, contexto e preços do K2.7 Code, consulte nosso explicador o que é Kimi K2.7 Code.

O K3 não é uma versão de codificação. É o novo carro-chefe, o modelo geral mais capaz da Moonshot, com a codificação sendo uma forte capacidade dentro de um conjunto mais amplo. Então, você não está comparando um codificador antigo contra um novo codificador; você está comparando um especialista contra um generalista que também é bom em código, e isso impulsiona a maior parte da decisão de migração.

O que realmente mudou, de geração para geração

Aqui está o que mudou, com o marketing removido.

Escala: aproximadamente o triplo do total de parâmetros

O K3 é um modelo de mistura de especialistas com 2.8T de parâmetros. A linha K2 que produziu o K2.7 Code situava-se na classe de ~1T de parâmetros, então o K3 triplica aproximadamente o total de parâmetros. Uma ressalva: a Moonshot não publicou a contagem de parâmetros ativos do K3. Modelos MoE executam apenas uma fração de seus pesos por token, então "2.8T total" não é o número que define o custo de inferência. Não leia 2.8T como "2.8T parâmetros disparam a cada solicitação." O que a Moonshot publicou é o padrão de ativação, abordado a seguir.

Uma nova arquitetura de atenção, não apenas uma escalonada

Esta parte é genuinamente nova, em vez de apenas maior. O K3 é construído sobre três pilares principais:

A Moonshot relata uma melhoria de aproximadamente 2,5x na eficiência de escalonamento em relação ao Kimi K2: mais capacidade por unidade de computação, não apenas mais computação. O K2.7 Code, um modelo da geração K2, não possui este redesenho, então a diferença não é apenas “maior”, mas “construída de forma diferente”.

Contexto: até 1M de tokens

O K3 suporta uma janela de contexto de 1.048.576 tokens. Para um fluxo de trabalho de codificação, isso é a diferença entre alimentar um agente com um punhado de arquivos e entregar-lhe uma grande parte de um repositório real, seus testes e seus logs de uma só vez. Se você atingir limites de contexto com o K2.7 Code em tarefas de repositórios grandes, esta é a única mudança mais provável de fazer diferença no dia a dia.

Posicionamento: de especialista a generalista carro-chefe

O K2.7 Code era uma versão para codificação; o K3 é o modelo carro-chefe “mais capaz” que também é bom em codificação agêntica de longo prazo. A Moonshot aponta para execuções autônomas em problemas difíceis e multi-etapas, incluindo uma única execução de 48 horas em uma tarefa de design de chip. Se essas anedotas se aplicam à sua carga de trabalho é algo que você testa, não que assume por fé. Mas a intenção é clara: o K3 é voltado para agentes que executam por longos períodos e mantêm estado, onde o contexto de 1M e o novo design de atenção compensam.

Preço: taxas de carro-chefe

O K3 lista $0,30 por milhão de tokens para entrada com acerto de cache, $3 por milhão para entrada com erro de cache e $15 por milhão para saída. A diferença de 10x na entrada é a parte interessante. Em cargas de trabalho com alta taxa de acerto de cache, como codificação agêntica que reutiliza um grande prompt de sistema e contexto de repositório em muitas chamadas, o custo de entrada efetivo fica muito mais próximo de $0,30 do que de $3; em chamadas únicas com contexto novo, você paga o preço de $3. A saída a $15/M é de nível carro-chefe sem alavanca de desconto. Para a matemática completa do cache, consulte nosso guia de preços do Kimi K3, e confirme as taxas do K2.7 Code antes de assumir que o K3 é estritamente mais caro por tarefa.

Kimi K3 vs Kimi K2.7 Code: lado a lado

Dimensão Kimi K2.7 Code Kimi K3
Posicionamento Versão focada em codificação da linha K2 Modelo geral carro-chefe “mais capaz”, forte em codificação agêntica
Geração Linhagem K2 (K2 a K2.6 a K2.7 Code) Nova geração K3
Total de parâmetros ~1T (linha K2) 2.8T total (MoE)
Parâmetros ativos Confirmar vs nosso post sobre K2.7 Code Não publicado; 16 de 896 especialistas ativos
Design de atenção Atenção de geração K2 Kimi Delta Attention + Attention Residuals
Framework MoE MoE de geração K2 Stable LatentMoE (16/896 especialistas)
Janela de contexto Confirmar vs nosso post sobre K2.7 Code 1.048.576 tokens (1M)
ID do Modelo kimi-k2-7-code kimi-k3
Compatibilidade API Compatível com OpenAI-SDK Compatível com OpenAI-SDK
Preço listado Confirmar vs nosso post sobre K2.7 Code $0,30/$3 entrada (acerto/erro de cache), $15 saída por M
Pesos abertos Ver nossa cobertura do K2.7 Code Esperado por volta de 27 de julho de 2026
Sinal independente Ver nossa cobertura do K2.7 Code Índice de Inteligência Artificial Analysis 57, #4/189
Melhor ajuste Codificação específica a um custo conhecido Trabalho de grande contexto, longo prazo, geral + codificação

Uma nota sobre as células marcadas como “confirmar”: estamos deliberadamente não inventando números exatos do K2.7 Code. Onde você precisar de uma especificação precisa do K2.7, nosso post o que é Kimi K2.7 Code e o guia da API do Kimi K2.7 Code são as fontes a serem confiadas. A formulação comparativa do K3 mantém a comparação honesta.

Onde o K3 realmente se posiciona em relação à fronteira

Seria fácil ler “carro-chefe de 2.8T” como “o novo melhor modelo”, então aqui está a parte que os fornecedores geralmente suavizam. O próprio blog de lançamento da Moonshot diz que o K3 ainda está atrás de Claude Fable 5 e GPT-5.6 Sol. É competitivo em benchmarks específicos e à frente em alguns, mas não reivindica a coroa geral.

A leitura independente corrobora isso. A Artificial Analysis coloca o Índice de Inteligência do K3 em 57, classificado como #4 de 189 modelos, com saída em torno de 62 tokens por segundo, no lado mais lento para sua faixa de preço. Nos benchmarks de codificação publicados pela Moonshot, o cenário é misto, em vez de dominante: no DeepSWE, ele relata o K3 em 67,5 contra 70,0 do Fable 5, e no Terminal-Bench 2.1, ele relata o K3 em 88,3 contra 84,6 do Fable 5. O K3 ganha algumas e perde outras contra a fronteira, um resultado forte para um modelo de peso aberto e não uma razão para exagerar. Leia o conjunto completo de reivindicações da Moonshot no post oficial de lançamento do Kimi K3; nós desvendamos a lacuna entre fornecedor e independente em nossa análise de benchmarks do Kimi K3.

Para sua decisão de migração, “melhorar em relação ao seu próprio predecessor” é uma afirmação diferente de “supera todos os modelos fechados”. Ambas são verdadeiras simultaneamente.

Você deve migrar ou permanecer no K2.7 Code?

Avalie sua carga de trabalho através destas perguntas em ordem.

Migre para o K3 se alguma destas for verdadeira

Mantenha-se no K2.7 Code se alguma destas for verdadeira

Cenários do mundo real

Alguns perfis concretos, já que conselhos abstratos só chegam até certo ponto.

Um bot de correção de código CI em um repositório de tamanho médio. Se ele já passa nos testes e permanece barato no K2.7 Code, você provavelmente não precisa do K3. Tarefa específica, contexto se encaixa, custo por execução importa. Mantenha-se; revise apenas se as taxas de falha aumentarem.

Um agente de refatoração autônomo em um monorepo grande. O território do K3: o contexto de 1M carrega mais do código-base, testes e logs de uma vez, e o design de longo prazo é construído para execuções que tocam muitos arquivos em várias etapas. Vale a pena um teste real.

Para uma configuração prática, nosso passo a passo de codificação com Kimi K3 e o guia da API do Kimi K3 cobrem a seleção do modelo e o início rápido compatível com OpenAI; se você ainda está na linha antiga, o explicador do K2.6 preenche a linhagem.

Como fazer um teste A/B dos dois antes de se comprometer

A maneira mais clara de decidir é executar a mesma solicitação através de ambos os modelos e ler a diferença. Como ambos são compatíveis com o OpenAI-SDK, isso é pouco trabalho.

Direcione uma solicitação para o endpoint Moonshot com o modelo definido para kimi-k2-7-code, e uma segunda solicitação idêntica com kimi-k3. Mantenha todo o resto fixo: mesmo prompt de sistema, mensagem do usuário, temperatura e ferramentas. Em seguida, compare as três coisas que impulsionam sua decisão:

  1. Qualidade da saída em seus prompts reais, julgada da maneira como você julga a saída de produção, e não por intuição.
  2. Latência, já que o K3 é o modelo mais lento, de acordo com seu número de velocidade independente, o que pode superar um ganho de qualidade em aplicativos interativos.
  3. Gasto de tokens, incluindo como sua taxa de acerto de cache altera o custo de entrada efetivo entre os dois.

O Apidog torna este fluxo de trabalho lado a lado simples. Salve ambas as solicitações em um projeto, troque o ID do modelo como uma variável de ambiente, observe as respostas de streaming de eventos enviados pelo servidor em tempo real, inspecione os payloads de chamadas de ferramentas e veja o uso de tokens por chamada. Duplique a solicitação, altere um campo e você terá um A/B controlado sem código de suporte descartável. Baixe o Apidog para configurá-lo, e se você trabalha em um editor, a integração do Apidog dentro do VS Code o mantém ao lado do seu código. É uma maneira gratuita de decidir com base em evidências, não em marketing.

A linha de fundo

O K3 é um verdadeiro salto geracional em relação ao K2.7 Code, não uma renomeação. Ele triplica aproximadamente o total de parâmetros para 2.8T, apresenta uma nova arquitetura de atenção (Kimi Delta Attention, Attention Residuals, Stable LatentMoE), estende o contexto para 1M de tokens e reformula o produto de especialista em codificação para generalista carro-chefe. Ele também custa mais no preço de tabela e, por própria admissão da Moonshot, ainda está atrás de Fable 5 e GPT-5.6 Sol, então a atualização não é automática. Se você precisa do contexto, raciocínio geral ou comportamento de agente de longo prazo, migre. Se o K2.7 Code já atende aos seus requisitos a um preço que você gosta, permanecer é defensável. Execute ambos com seus próprios prompts, leia a diferença e deixe a evidência decidir.

botão

Perguntas frequentes

Qual é melhor para codificação? O K2.7 Code foi ajustado especificamente para codificação e é uma escolha forte e econômica para tarefas de código específicas. O K3 é um generalista carro-chefe, também bom em codificação agêntica de longo prazo, com um contexto muito maior. Para trabalho de agente multi-etapas em repositórios grandes, o K3 tem a vantagem estrutural; para codificação específica que o K2.7 lida bem, o K2.7 Code pode ser o gasto mais inteligente.

O Kimi K3 é mais caro que o K2.7 Code? O K3 lista $0,30/M para entrada com acerto de cache, $3/M para entrada com erro de cache e $15/M para saída, o que é de nível carro-chefe. Se custa mais por tarefa depende da sua taxa de acerto de cache e verbosidade da saída, então compare o custo efetivo na sua própria carga de trabalho. Ambos os modelos são compatíveis com o OpenAI-SDK, então a mudança é principalmente uma alteração de ID de modelo mais um re-teste de prompt.

O Kimi K3 é de código aberto? Não no dia do lançamento. A Moonshot disse que os pesos completos do modelo são esperados por volta de 27 de julho de 2026. Até que sejam lançados, o K3 é apenas para API e aplicativos. Considere qualquer plano de auto-hospedagem como dependente desse lançamento.

O K3 é melhor que Claude Fable 5 ou GPT-5.6 Sol? Pelo próprio blog da Moonshot, não. O K3 está atrás de ambos no geral, embora seja competitivo ou à frente em benchmarks específicos. Independentemente, a Artificial Analysis o coloca no Índice de Inteligência 57, classificado como #4 de 189. É um forte concorrente de pesos abertos, não o líder absoluto da fronteira.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs