Se você já usa o Kimi, o lançamento do Kimi K3 em 16 de julho de 2026 levanta uma questão prática: esta é a atualização para a qual você deve migrar, ou um modelo maior e mais caro que você pode pular por enquanto? O Kimi K2.7 Code é a versão focada em codificação da linha K2, e muitas equipes o integraram em seus agentes e CI no último trimestre. O K3 é um animal diferente: o novo carro-chefe da Moonshot, construído em uma escala muito maior, com um novo design de atenção e uma janela de contexto de 1 milhão de tokens. Este artigo detalha o que realmente mudou, o que é marketing e como decidir se deve migrar.
Não somos neutros aqui: escrevemos os guias para ambos os modelos, então esta é a nota de atualização honesta que daríamos a um colega. Como ambos expõem uma API compatível com OpenAI, você pode executar a mesma solicitação através de kimi-k3 e kimi-k2-7-code lado a lado no Apidog e ler a diferença nas saídas, latência e gasto de tokens antes de reescrever qualquer código de produção. Primeiro, o veredito.
TL;DR: o veredito em um piscar de olhos
- K3 é o modelo maior e mais geral. Um modelo de mistura de especialistas com 2.8T de parâmetros, aproximadamente o triplo da linha K2 de ~1T da qual o K2.7 Code veio. O K2.7 Code era um especialista em codificação; o K3 é o carro-chefe "mais capaz" da Moonshot, que também é forte em codificação agêntica de longo prazo.
- O contexto saltou para 1M de tokens. O K3 lida com 1.048.576 tokens, mudando o que "dar-lhe o repositório inteiro" realmente significa.
- A arquitetura é nova, não apenas escalonada. Kimi Delta Attention, Attention Residuals e uma estrutura Stable LatentMoE (16 de 896 especialistas ativos) são a verdadeira história de engenharia.
- O preço subiu. O K3 custa $0.30/M de entrada com acerto de cache, $3/M de entrada com erro de cache e $15/M de saída. A matemática de entrada barata só compensa se sua taxa de acerto de cache for alta.
- Teto honesto: O próprio blog da Moonshot diz que o K3 ainda está atrás de Claude Fable 5 e GPT-5.6 Sol. É de nível fronteiriço para um modelo aberto, não o líder absoluto.
- Migre se você precisar de um contexto maior, raciocínio geral mais forte ou execuções de agentes de longo prazo. Mantenha-se no K2.7 Code se sua carga de trabalho for de codificação específica a um preço que você goste e o K2.7 já atenda aos seus requisitos de qualidade.
Dois tipos diferentes de modelo
Antes de comparar as especificações, entenda isto: K2.7 Code e K3 foram construídos para fazer trabalhos diferentes.
O Kimi K2.7 Code é o membro da linhagem K2 focado em codificação (K2, K2 Thinking, K2.5, K2.6 e depois K2.7 Code), que atingiu o auge na classe de ~1T de parâmetros. Ele direcionou essa linhagem fortemente para geração e edição de código, e tarefas de desenvolvimento agêntico: se seu trabalho era “escrever e corrigir código através de uma API”, era uma escolha ajustada e economicamente sensata. Para contagens exatas de parâmetros, contexto e preços do K2.7 Code, consulte nosso explicador o que é Kimi K2.7 Code.
O K3 não é uma versão de codificação. É o novo carro-chefe, o modelo geral mais capaz da Moonshot, com a codificação sendo uma forte capacidade dentro de um conjunto mais amplo. Então, você não está comparando um codificador antigo contra um novo codificador; você está comparando um especialista contra um generalista que também é bom em código, e isso impulsiona a maior parte da decisão de migração.
O que realmente mudou, de geração para geração
Aqui está o que mudou, com o marketing removido.
Escala: aproximadamente o triplo do total de parâmetros
O K3 é um modelo de mistura de especialistas com 2.8T de parâmetros. A linha K2 que produziu o K2.7 Code situava-se na classe de ~1T de parâmetros, então o K3 triplica aproximadamente o total de parâmetros. Uma ressalva: a Moonshot não publicou a contagem de parâmetros ativos do K3. Modelos MoE executam apenas uma fração de seus pesos por token, então "2.8T total" não é o número que define o custo de inferência. Não leia 2.8T como "2.8T parâmetros disparam a cada solicitação." O que a Moonshot publicou é o padrão de ativação, abordado a seguir.
Uma nova arquitetura de atenção, não apenas uma escalonada
Esta parte é genuinamente nova, em vez de apenas maior. O K3 é construído sobre três pilares principais:
- Kimi Delta Attention, um mecanismo de atenção linear híbrido. A atenção linear escala melhor com o comprimento da sequência do que a atenção quadrática padrão, o que é parte de como uma janela de 1M de tokens se torna prática.
- Attention Residuals, que a Moonshot descreve como uma substituição direta para as conexões residuais padrão.
- Stable LatentMoE, a estrutura de mistura de especialistas que ativa 16 de 896 especialistas por token.
A Moonshot relata uma melhoria de aproximadamente 2,5x na eficiência de escalonamento em relação ao Kimi K2: mais capacidade por unidade de computação, não apenas mais computação. O K2.7 Code, um modelo da geração K2, não possui este redesenho, então a diferença não é apenas “maior”, mas “construída de forma diferente”.
Contexto: até 1M de tokens
O K3 suporta uma janela de contexto de 1.048.576 tokens. Para um fluxo de trabalho de codificação, isso é a diferença entre alimentar um agente com um punhado de arquivos e entregar-lhe uma grande parte de um repositório real, seus testes e seus logs de uma só vez. Se você atingir limites de contexto com o K2.7 Code em tarefas de repositórios grandes, esta é a única mudança mais provável de fazer diferença no dia a dia.
Posicionamento: de especialista a generalista carro-chefe
O K2.7 Code era uma versão para codificação; o K3 é o modelo carro-chefe “mais capaz” que também é bom em codificação agêntica de longo prazo. A Moonshot aponta para execuções autônomas em problemas difíceis e multi-etapas, incluindo uma única execução de 48 horas em uma tarefa de design de chip. Se essas anedotas se aplicam à sua carga de trabalho é algo que você testa, não que assume por fé. Mas a intenção é clara: o K3 é voltado para agentes que executam por longos períodos e mantêm estado, onde o contexto de 1M e o novo design de atenção compensam.
Preço: taxas de carro-chefe
O K3 lista $0,30 por milhão de tokens para entrada com acerto de cache, $3 por milhão para entrada com erro de cache e $15 por milhão para saída. A diferença de 10x na entrada é a parte interessante. Em cargas de trabalho com alta taxa de acerto de cache, como codificação agêntica que reutiliza um grande prompt de sistema e contexto de repositório em muitas chamadas, o custo de entrada efetivo fica muito mais próximo de $0,30 do que de $3; em chamadas únicas com contexto novo, você paga o preço de $3. A saída a $15/M é de nível carro-chefe sem alavanca de desconto. Para a matemática completa do cache, consulte nosso guia de preços do Kimi K3, e confirme as taxas do K2.7 Code antes de assumir que o K3 é estritamente mais caro por tarefa.
Kimi K3 vs Kimi K2.7 Code: lado a lado
| Dimensão | Kimi K2.7 Code | Kimi K3 |
|---|---|---|
| Posicionamento | Versão focada em codificação da linha K2 | Modelo geral carro-chefe “mais capaz”, forte em codificação agêntica |
| Geração | Linhagem K2 (K2 a K2.6 a K2.7 Code) | Nova geração K3 |
| Total de parâmetros | ~1T (linha K2) | 2.8T total (MoE) |
| Parâmetros ativos | Confirmar vs nosso post sobre K2.7 Code | Não publicado; 16 de 896 especialistas ativos |
| Design de atenção | Atenção de geração K2 | Kimi Delta Attention + Attention Residuals |
| Framework MoE | MoE de geração K2 | Stable LatentMoE (16/896 especialistas) |
| Janela de contexto | Confirmar vs nosso post sobre K2.7 Code | 1.048.576 tokens (1M) |
| ID do Modelo | kimi-k2-7-code |
kimi-k3 |
| Compatibilidade API | Compatível com OpenAI-SDK | Compatível com OpenAI-SDK |
| Preço listado | Confirmar vs nosso post sobre K2.7 Code | $0,30/$3 entrada (acerto/erro de cache), $15 saída por M |
| Pesos abertos | Ver nossa cobertura do K2.7 Code | Esperado por volta de 27 de julho de 2026 |
| Sinal independente | Ver nossa cobertura do K2.7 Code | Índice de Inteligência Artificial Analysis 57, #4/189 |
| Melhor ajuste | Codificação específica a um custo conhecido | Trabalho de grande contexto, longo prazo, geral + codificação |
Uma nota sobre as células marcadas como “confirmar”: estamos deliberadamente não inventando números exatos do K2.7 Code. Onde você precisar de uma especificação precisa do K2.7, nosso post o que é Kimi K2.7 Code e o guia da API do Kimi K2.7 Code são as fontes a serem confiadas. A formulação comparativa do K3 mantém a comparação honesta.
Onde o K3 realmente se posiciona em relação à fronteira
Seria fácil ler “carro-chefe de 2.8T” como “o novo melhor modelo”, então aqui está a parte que os fornecedores geralmente suavizam. O próprio blog de lançamento da Moonshot diz que o K3 ainda está atrás de Claude Fable 5 e GPT-5.6 Sol. É competitivo em benchmarks específicos e à frente em alguns, mas não reivindica a coroa geral.
A leitura independente corrobora isso. A Artificial Analysis coloca o Índice de Inteligência do K3 em 57, classificado como #4 de 189 modelos, com saída em torno de 62 tokens por segundo, no lado mais lento para sua faixa de preço. Nos benchmarks de codificação publicados pela Moonshot, o cenário é misto, em vez de dominante: no DeepSWE, ele relata o K3 em 67,5 contra 70,0 do Fable 5, e no Terminal-Bench 2.1, ele relata o K3 em 88,3 contra 84,6 do Fable 5. O K3 ganha algumas e perde outras contra a fronteira, um resultado forte para um modelo de peso aberto e não uma razão para exagerar. Leia o conjunto completo de reivindicações da Moonshot no post oficial de lançamento do Kimi K3; nós desvendamos a lacuna entre fornecedor e independente em nossa análise de benchmarks do Kimi K3.
Para sua decisão de migração, “melhorar em relação ao seu próprio predecessor” é uma afirmação diferente de “supera todos os modelos fechados”. Ambas são verdadeiras simultaneamente.
Você deve migrar ou permanecer no K2.7 Code?
Avalie sua carga de trabalho através destas perguntas em ordem.
Migre para o K3 se alguma destas for verdadeira
- Você atinge limites de contexto. Se o K2.7 Code trunca em tarefas de repositórios grandes, refatorações de serviço completo ou transcrições longas de agentes, a janela de 1M é a razão mais clara para migrar. A margem bruta não tem substituto.
- Suas tarefas são de longo prazo e agênticas. Execuções multi-etapas que mantêm estado em várias chamadas de ferramentas são o que o design do K3 visa. Se seu agente perde o fio da meada em trabalhos longos, teste se o K3 o mantém melhor.
- Você precisa de raciocínio generalista, não apenas código. Se seu produto mistura código com planejamento ou análise, um especialista em codificação pode ser a ferramenta errada.
- Sua taxa de acerto de cache é alta. Reutilizar um grande prompt de sistema e contexto compartilhado em muitas chamadas permite que a entrada de $0,30 com acerto de cache do K3 suavize o preço do carro-chefe, aproximando o custo efetivo do seu gasto com K2.7.
Mantenha-se no K2.7 Code se alguma destas for verdadeira
- Sua carga de trabalho é de codificação específica e o K2.7 já atende aos requisitos. Se a qualidade está boa e você está entregando, um carro-chefe maior pode ser um custo desnecessário. “Bom o suficiente e mais barato” é uma resposta legítima.
- Você é sensível a custos com baixa reutilização de cache. Chamadas únicas com contexto novo pagam a entrada de $3 com erro de cache e a saída de $15 do K3, então sem uma alta taxa de acerto de cache, a matemática do carro-chefe é mais difícil de justificar.
- A latência importa mais do que a inteligência máxima. Os ~62 tokens/seg do K3 estão abaixo da mediana de sua faixa de preço. Se seu aplicativo é limitado pela latência, faça um benchmark antes de assumir que o modelo maior parece mais rápido.
- Pesos abertos restringem seu plano. Os pesos do K3 são esperados por volta de 27 de julho de 2026, então qualquer requisito de auto-hospedagem deve ser verificado contra o lançamento real no Hugging Face da Moonshot, não assumido como já enviado.
Cenários do mundo real
Alguns perfis concretos, já que conselhos abstratos só chegam até certo ponto.
Um bot de correção de código CI em um repositório de tamanho médio. Se ele já passa nos testes e permanece barato no K2.7 Code, você provavelmente não precisa do K3. Tarefa específica, contexto se encaixa, custo por execução importa. Mantenha-se; revise apenas se as taxas de falha aumentarem.
Um agente de refatoração autônomo em um monorepo grande. O território do K3: o contexto de 1M carrega mais do código-base, testes e logs de uma vez, e o design de longo prazo é construído para execuções que tocam muitos arquivos em várias etapas. Vale a pena um teste real.
Para uma configuração prática, nosso passo a passo de codificação com Kimi K3 e o guia da API do Kimi K3 cobrem a seleção do modelo e o início rápido compatível com OpenAI; se você ainda está na linha antiga, o explicador do K2.6 preenche a linhagem.
Como fazer um teste A/B dos dois antes de se comprometer
A maneira mais clara de decidir é executar a mesma solicitação através de ambos os modelos e ler a diferença. Como ambos são compatíveis com o OpenAI-SDK, isso é pouco trabalho.
Direcione uma solicitação para o endpoint Moonshot com o modelo definido para kimi-k2-7-code, e uma segunda solicitação idêntica com kimi-k3. Mantenha todo o resto fixo: mesmo prompt de sistema, mensagem do usuário, temperatura e ferramentas. Em seguida, compare as três coisas que impulsionam sua decisão:
- Qualidade da saída em seus prompts reais, julgada da maneira como você julga a saída de produção, e não por intuição.
- Latência, já que o K3 é o modelo mais lento, de acordo com seu número de velocidade independente, o que pode superar um ganho de qualidade em aplicativos interativos.
- Gasto de tokens, incluindo como sua taxa de acerto de cache altera o custo de entrada efetivo entre os dois.
O Apidog torna este fluxo de trabalho lado a lado simples. Salve ambas as solicitações em um projeto, troque o ID do modelo como uma variável de ambiente, observe as respostas de streaming de eventos enviados pelo servidor em tempo real, inspecione os payloads de chamadas de ferramentas e veja o uso de tokens por chamada. Duplique a solicitação, altere um campo e você terá um A/B controlado sem código de suporte descartável. Baixe o Apidog para configurá-lo, e se você trabalha em um editor, a integração do Apidog dentro do VS Code o mantém ao lado do seu código. É uma maneira gratuita de decidir com base em evidências, não em marketing.

A linha de fundo
O K3 é um verdadeiro salto geracional em relação ao K2.7 Code, não uma renomeação. Ele triplica aproximadamente o total de parâmetros para 2.8T, apresenta uma nova arquitetura de atenção (Kimi Delta Attention, Attention Residuals, Stable LatentMoE), estende o contexto para 1M de tokens e reformula o produto de especialista em codificação para generalista carro-chefe. Ele também custa mais no preço de tabela e, por própria admissão da Moonshot, ainda está atrás de Fable 5 e GPT-5.6 Sol, então a atualização não é automática. Se você precisa do contexto, raciocínio geral ou comportamento de agente de longo prazo, migre. Se o K2.7 Code já atende aos seus requisitos a um preço que você gosta, permanecer é defensável. Execute ambos com seus próprios prompts, leia a diferença e deixe a evidência decidir.
Perguntas frequentes
Qual é melhor para codificação? O K2.7 Code foi ajustado especificamente para codificação e é uma escolha forte e econômica para tarefas de código específicas. O K3 é um generalista carro-chefe, também bom em codificação agêntica de longo prazo, com um contexto muito maior. Para trabalho de agente multi-etapas em repositórios grandes, o K3 tem a vantagem estrutural; para codificação específica que o K2.7 lida bem, o K2.7 Code pode ser o gasto mais inteligente.
O Kimi K3 é mais caro que o K2.7 Code? O K3 lista $0,30/M para entrada com acerto de cache, $3/M para entrada com erro de cache e $15/M para saída, o que é de nível carro-chefe. Se custa mais por tarefa depende da sua taxa de acerto de cache e verbosidade da saída, então compare o custo efetivo na sua própria carga de trabalho. Ambos os modelos são compatíveis com o OpenAI-SDK, então a mudança é principalmente uma alteração de ID de modelo mais um re-teste de prompt.
O Kimi K3 é de código aberto? Não no dia do lançamento. A Moonshot disse que os pesos completos do modelo são esperados por volta de 27 de julho de 2026. Até que sejam lançados, o K3 é apenas para API e aplicativos. Considere qualquer plano de auto-hospedagem como dependente desse lançamento.
O K3 é melhor que Claude Fable 5 ou GPT-5.6 Sol? Pelo próprio blog da Moonshot, não. O K3 está atrás de ambos no geral, embora seja competitivo ou à frente em benchmarks específicos. Independentemente, a Artificial Analysis o coloca no Índice de Inteligência 57, classificado como #4 de 189. É um forte concorrente de pesos abertos, não o líder absoluto da fronteira.
