Qwen 3.8 vs Kimi K3: Os Dois Gigantes de Pesos Abertos da China, Comparados

Qwen 3.8-Max vs Kimi K3: parâmetros, pesos abertos, modalidade, preço e suporte a harness comparados, com uma análise honesta sobre os benchmarks conduzidos pelos fornecedores.

INEZA Felin-Michel

INEZA Felin-Michel

3 agosto 2026

Qwen 3.8 vs Kimi K3: Os Dois Gigantes de Pesos Abertos da China, Comparados

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Julho de 2026 se tornou um mês de dois cavalos para modelos de fronteira de peso aberto, e ambos os cavalos vieram da China. A Moonshot AI lançou o Kimi K3 em 16 de julho. Três dias depois, a Alibaba fez uma prévia do Qwen 3.8-Max, tornando-o então geralmente disponível no início de agosto. Ambos são modelos de mistura de especialistas com parâmetros na casa do trilhão. Ambos prometem (ou entregam) pesos abertos. Ambos se conectam a *harnesses* de agentes estilo Claude Code. E ambos superam os laboratórios de fronteira dos EUA em preço.

A similaridade superficial esconde diferenças reais: no que você pode baixar hoje, no que os modelos podem ver e no custo de um mês de uso intenso. Esta comparação examina cada eixo que você pode verificar a partir de 3 de agosto de 2026. Para a análise completa das especificações do novo carro-chefe da Alibaba, comece com nosso explicador do Qwen 3.8-Max e retorne.

botão

Uma nota de honestidade antes de começarmos: ainda não há um *benchmark* independente direto entre esses dois modelos. Cada número neste artigo vem da própria tabela de um fornecedor, e rotulamos de quem é a execução de cada número. Trate a seção de *benchmark* como indicativa, não definitiva.

A linha do tempo: quem lançou o quê e quando

A ordem de lançamento importa mais do que o normal aqui, porque "pesos abertos" significa algo diferente para cada modelo neste momento.

O Kimi K3 foi lançado em 16 de julho de 2026. A Moonshot prometeu pesos abertos no lançamento e os entregou 11 dias depois: os pesos chegaram ao Hugging Face em 27 de julho como um lançamento MXFP4 de 594 GB. A partir de hoje, você pode baixar o K3, quantificá-lo ainda mais e executá-lo em seu próprio hardware. Isso não é uma promessa. Aconteceu.

O Qwen 3.8-Max foi pré-visualizado em 19 de julho e atingiu a disponibilidade geral no Alibaba Cloud Model Studio no início de agosto, de acordo com a publicação oficial de lançamento do Qwen. Os pesos são prometidos para o Hugging Face e ModelScope "na próxima semana", o que os coloca por volta de 10 de agosto. Em 3 de agosto de 2026, eles não estão disponíveis para download. A própria lacuna de 11 dias do K3 entre o lançamento e os pesos mostra que este arco é normal, mas hoje apenas um desses modelos é aberto na prática.

Se a auto-hospedagem for seu fator decisivo, esse único fato pode encerrar a comparação precocemente.

Parâmetros: dois modelos MoE em escala de trilhões, um mais enxuto

Ambos os modelos são designs esparsos de mistura de especialistas, o que significa que a contagem de parâmetros principal e o custo de computação por *token* são números muito diferentes.

Especificação Qwen 3.8-Max Kimi K3
Parâmetros totais 2.4T 2.8T
Parâmetros ativos por token 95B 104B
Taxa de ativação ~4% ~3.7%
Base da arquitetura Fundação Qwen 3.5, MoE MoE
Formato de pesos abertos Prometido (~10 de agosto) MXFP4, 594 GB no Hugging Face

O Qwen 3.8-Max é o modelo menor em ambos os aspectos: 400B de parâmetros totais a menos e 9B de parâmetros ativos a menos que o K3. Nenhuma das lacunas é dramática, e a contagem de parâmetros ativos não se traduz linearmente em capacidade. O que elas traduzem é o custo de serviço. Um modelo que ativa 95B de parâmetros por *token* é mais barato de executar em escala do que um que ativa 104B, tudo o mais constante, e essa diferença aparece no preço da API abaixo.

Para auto-hospedeiros, o número mais relevante é o download de 594 GB do K3 em precisão MXFP4. Isso é território de múltiplos nós, mesmo antes de você considerar o cache KV em contexto longo. Espere que o Qwen 3.8-Max, com 2.4T totais, se enquadre em uma classe de peso similar quando seus arquivos aparecerem. A maioria das equipes usará *endpoints* hospedados para ambos os modelos e reservará a auto-hospedagem para casos de conformidade ou pesquisa.

Abertura hoje: pesos ao vivo vs uma promessa antiga

Este eixo merece sua própria seção porque o *marketing* de ambos os lados diz "aberto", enquanto os fatos diferem.

Os pesos do Kimi K3 são públicos. Você pode verificar o repositório, a licença e baixar os arquivos agora mesmo. Isso traz tudo o que a verdadeira abertura permite: hospedagem por terceiros, quantizações da comunidade, *fine-tuning* e a garantia de que o modelo que você testou não pode ser silenciosamente substituído sem o seu conhecimento.

O Qwen 3.8-Max seria o primeiro modelo da classe Qwen-Max lançado com pesos abertos, uma verdadeira mudança na estratégia da Alibaba após manter todos os modelos de nível Max anteriores apenas por API. Mas um "primeiro" só é um "primeiro" depois que acontece. Até que o repositório do Hugging Face esteja ativo, o Qwen 3.8-Max é um modelo de API com um anúncio anexo.

Pontue este eixo para o K3 hoje, com uma observação para verificar novamente por volta de 10 de agosto. Se a Alibaba cumprir, o eixo se torna um empate e a comparação muda para os termos da licença e a qualidade da quantização.

Modalidade: Qwen vê imagens, K3 lê texto

Aqui a lacuna é inversa, e não está nem perto.

O Qwen 3.8-Max aceita entrada de texto e imagem, de acordo com as configurações oficiais do modelo ("input_modalities": ["text", "image"]). A publicação de lançamento da Alibaba vai além, demonstrando compreensão de documentos longos em PDFs de mais de 200 páginas e compreensão de vídeo de 100 horas via gráficos de memória; trate-os como demos de blog, não como tipos de entrada de API documentados. A entrada de imagem, no entanto, é real e está na API hoje. Os *benchmarks* do fornecedor da Alibaba se apoiam nisso: a tabela multimodal (MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1, fortes linhas de OCR) é onde o Qwen 3.8-Max apresenta seus números mais unilaterais.

O Kimi K3 é um modelo de texto. Se sua carga de trabalho envolve capturas de tela, documentos digitalizados, compreensão de UI ou qualquer tarefa de agente adjacente à visão, o K3 precisa de um modelo de visão separado acoplado ao *pipeline*, com todo o código de conexão e latência extra que isso implica.

Para codificação e trabalho de agente somente com texto, este eixo é irrelevante. Para inteligência documental e agentes de uso de computador, é decisivo.

Contexto, saída e superfície da API

O Qwen 3.8-Max oferece uma janela de contexto de 1.000.000 de *tokens* como um único nível fixo, com saída máxima de 65.536 *tokens*. O raciocínio é controlado por um parâmetro reasoning_effort (xhigh por padrão, com médio e baixo), e a saída de pensamento é preservada por padrão. Notavelmente, os modos de pensamento e não-pensamento são faturados à mesma taxa.

O acesso é feito através do Alibaba Cloud Model Studio com três URLs base regionais (Pequim, Cingapura, EUA-Virgínia) e, incomumente, dois formatos de protocolo em uma plataforma: um *endpoint* compatível com OpenAI e um *endpoint* compatível com Anthropic. Essa superfície de protocolo dupla é o motivo pelo qual o Qwen 3.8-Max se encaixa no Claude Code com nada mais do que ANTHROPIC_BASE_URL e ANTHROPIC_MODEL=qwen3.8-max. A linha completa e a disponibilidade regional estão documentadas na página de modelos do Model Studio; se você trabalha entre regiões, ferramentas como o Apidog permitem que você armazene cada URL base como um ambiente e alterne entre eles sem editar as requisições.

O Kimi K3 também se comunica via protocolo Anthropic e se encaixa em *harnesses* estilo Claude Code, que é exatamente o motivo pelo qual esses dois modelos competem pela mesma posição: a posição de "apontar seu *harness* de agente existente para um modelo de fronteira mais barato". Para detalhes do *endpoint* do K3 e limites atuais, consulte nosso explicador do Kimi K3 em vez de confiar em números que podem ter mudado desde o lançamento.

Preços: fixo e simples vs entrada barata, saída cara

Aqui estão as taxas publicadas, por milhão de *tokens*:

Taxa Qwen 3.8-Max Kimi K3
Entrada $2.00 $3.00
Saída $6.00 $15.00
Entrada com acerto de cache $0.20 (10% da entrada) $0.30
Nivelamento Fixo em todo o contexto de 1M De acordo com o cronograma publicado da Moonshot

O Qwen 3.8-Max custa US$ 2 de entrada e US$ 6 de saída, fixo do *token* zero ao *token* um milhão, pensando ou não, de acordo com a página oficial de preços do Model Studio. A criação explícita de *cache* é cobrada em 125% da entrada, e os acertos de *cache* em 10%. Há também uma cota gratuita: 1M de *tokens*, apenas na região de Cingapura, válida por 90 dias.

As taxas do K3 são de US$ 0,30 por milhão para acertos de *cache*, US$ 3 por milhão de entrada e US$ 15 por milhão de saída.

A comparação não se resume a um único número. Em cargas de trabalho com muita entrada e boa disciplina de *cache* (*prompts* de sistema longos, contexto de documento repetido), os dois modelos se aproximam mais do que o preço sugere: US$ 0,20 vs US$ 0,30 por megatoken em cache é uma lacuna estreita. Em cargas de trabalho com muita saída, a lacuna é ampla: a taxa de saída de US$ 15 do K3 é 2,5 vezes a de US$ 6 do Qwen. Laços de agente que geram muito raciocínio e código tendem a ter muita saída, o que favorece o Qwen 3.8-Max no papel.

Uma ressalva que se aplica especificamente ao Qwen: o reasoning_effort é padrão *xhigh*, e os *tokens* de pensamento são cobrados como saída. As faturas reais serão maiores do que uma estimativa ingênua de *tokens* de entrada/saída prevê. Nossa análise de preços do Qwen 3.8 detalha exemplos de custo por tarefa, caso você queira modelar isso antes de se comprometer.

Benchmarks: duas tabelas de fornecedores, sem árbitro

É aqui que a maioria das comparações desses dois modelos erra, então vamos ser precisos sobre o que existe.

O que existe: A Alibaba publicou uma tabela de *benchmark* para o Qwen 3.8-Max contra o Claude Opus 4.8, Fable 5, GPT-5.6 Sol e Qwen 3.7-Max. A Moonshot publicou sua própria tabela de lançamento para o Kimi K3 contra uma linha de modelos de fronteira semelhante. Ambos são executados por fornecedores.

O que não existe: qualquer avaliação independente que coloque o Qwen 3.8-Max e o Kimi K3 na mesma tabela sob o mesmo *harness*. Nenhum número da Artificial Analysis para o Qwen 3.8-Max estava disponível no momento da redação. Os dois fornecedores não fizeram *benchmark* dos modelos um do outro.

Com essa estrutura, aqui está o que cada lado afirma em sua própria execução.

Da tabela da Alibaba (execução da Alibaba, em grande parte realizada através do *harness* Claude Code, um detalhe que a própria Alibaba divulga):

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86.6 84.6 84.6 88.8
SWE-bench Pro 67.7 69.2 80.0 64.6
PaperBench 93.0 80.3 88.8 90.5
GPQA Diamond 92.6 92.0 92.6 94.1
HLE 43.6 45.7 53.3 47.2

Os próprios números da Alibaba incluem perdas claras: o Qwen 3.8-Max fica muito atrás do Fable 5 no SWE-bench Pro e de todos os listados no HLE. Suas linhas de destaque são PaperBench, o seguimento de instruções (IFBench 82.8) e a varredura multimodal. Vários outros resultados de destaque usam *benchmarks* internos da Alibaba (QwenSWEBench, CoWorkBench e outros), que não podem ser comparados com ninguém.

Do lado da Moonshot, a tabela de lançamento do K3 mostrou que ele superou o Claude Opus 4.8 em todas as linhas principais de *benchmark* da Moonshot, enquanto ficou atrás do Fable 5 e do GPT-5.6 Sol no geral. Cobrimos essas alegações, e suas ressalvas, em nossa comparação Kimi K3 vs Claude Opus 4.8.

Você pode alinhar as duas tabelas onde os *benchmarks* se sobrepõem? Você pode, e as pessoas o farão, mas diferentes *harnesses*, *scaffolding* e configurações de amostragem tornam as leituras entre tabelas indicativas, na melhor das hipóteses. O resumo honesto: ambos os fornecedores mostram seu modelo competitivo com, e seletivamente à frente, da fronteira dos EUA em tarefas de agente. Nenhuma das tabelas determina qual dos dois é mais forte. Para os detalhes sobre os números da Alibaba, veja nossa análise de benchmarks do Qwen 3.8.

Execute seu próprio confronto direto no Apidog

Como não há árbitro, o *benchmark* mais útil é aquele que você executa em sua própria carga de trabalho. Ambos os modelos expõem *endpoints* de conclusão de chat compatíveis com OpenAI, o que torna um teste lado a lado simples no Apidog.

Configure dois ambientes, um contendo a URL base do DashScope e o qwen3.8-max, o outro contendo o *endpoint* da Moonshot e o ID do modelo K3, cada um com sua própria variável de chave de API. Salve uma requisição com seu *prompt* real (uma tarefa real do seu produto, não uma charada) e alterne entre os ambientes para enviar a mesma carga útil para ambos os modelos. A visualização de resposta do Apidog mostra o status, a latência e o corpo completo lado a lado, e sua depuração SSE mostra como cada modelo transmite o conteúdo de raciocínio, o que é importante se sua UI renderiza *tokens* de pensamento. Adicione algumas asserções (esquema de resposta, limite de latência, palavras-chave necessárias na saída) e você transformou uma verificação de "vibe" em um teste repetível que pode ser executado novamente quando qualquer fornecedor lançar uma atualização. Baixe o Apidog gratuitamente para executar a comparação; dez *prompts* através de ambos os *endpoints* lhe dirão mais do que a tabela de qualquer um dos fornecedores.

O placar

Eixo Vencedor hoje Observação
Parâmetros totais/ativos Qwen 3.8-Max (mais enxuto: 2.4T/95B vs 2.8T/104B) Menor não é melhor nem pior por si só; principalmente indica custo de serviço
Pesos abertos, hoje Kimi K3 (ao vivo no Hugging Face, 594 GB MXFP4) Os pesos do Qwen devem sair por volta de 10 de agosto; verifique novamente, este eixo pode empatar em breve
Modalidade Qwen 3.8-Max (entrada de texto + imagem) As alegações de vídeo/documentos longos são demos de blog, não tipos de entrada de API documentados
Janela de contexto Qwen 3.8-Max (nível fixo de 1M, 65.536 saída máxima) Verifique os limites atuais do K3 contra a documentação da Moonshot para seu caso de uso
Preço Qwen 3.8-Max (US$ 2/US$ 6 fixo vs US$ 3/US$ 15) O padrão de pensamento xhigh inflaciona as faturas reais de saída do Qwen
Benchmarks Não é possível determinar Ambas as tabelas são executadas por fornecedores; não existe um confronto direto independente
Ecossistema de Harness Empate Ambos se encaixam em *harnesses* estilo Claude Code via *endpoints* de protocolo Anthropic
Histórico de promessas Kimi K3 Pesos enviados 11 dias após o lançamento; a promessa do Qwen ainda está em aberto

Qual escolher e quando

Escolha o Kimi K3 se você precisa dos pesos em seu próprio hardware esta semana, sua postura de conformidade exige um modelo que você possa fixar e auditar, ou sua carga de trabalho é puramente textual e com muita entrada, de modo que o preço do *cache* domine.

Escolha o Qwen 3.8-Max se sua carga de trabalho envolve imagens ou documentos, você gera muitos *tokens* de saída (laços de agente, geração de código) ou se você quer um contexto de 1M de *tokens* sem surpresas de preço em níveis.

Espere uma semana se pesos abertos são sua única razão para considerar qualquer um dos modelos. Se os pesos do Qwen forem lançados conforme prometido por volta de 10 de agosto, o eixo da abertura é redefinido e a decisão se resume à modalidade, preço e seus próprios resultados de avaliação.

A verdadeira história é que os desenvolvedores agora têm duas opções de fronteira credíveis, baratas e compatíveis com *harness* da China, com um intervalo de três semanas entre si. Seja qual for a sua preferência, execute seus próprios *prompts* através de ambos os *endpoints* antes de comprometer um roteiro com a tabela de qualquer um dos fornecedores.

botão

FAQ

O Kimi K3 é mais aberto que o Qwen 3.8-Max?

Hoje, sim, como um simples fato: os pesos do K3 estão no Hugging Face desde 27 de julho de 2026 (594 GB, MXFP4), enquanto os pesos do Qwen 3.8-Max são prometidos para cerca de 10 de agosto e ainda não estão disponíveis para download. Se a Alibaba cumprir, ambos serão modelos de fronteira de peso aberto e as diferenças significativas se deslocarão para os termos de licença e suporte da comunidade. Até então, apenas o K3 pode ser auto-hospedado; nosso guia local do K3 explica o que isso implica.

Qual modelo é melhor para codificação, Qwen 3.8-Max ou Kimi K3?

Ninguém pode responder a isso honestamente ainda. Ambos os fornecedores publicam números fortes de codificação para agentes, mas cada um executou suas próprias avaliações sob suas próprias condições, e não existe um confronto direto independente. A própria tabela da Alibaba até mostra o Qwen 3.8-Max perdendo para o Fable 5 no SWE-bench Pro, então as tabelas dos fornecedores admitem perdas; elas apenas não são comparáveis entre fornecedores. Execute ambos os modelos em tarefas do seu próprio repositório antes de decidir.

Posso usar ambos os modelos no Claude Code?

Sim. Ambos expõem *endpoints* compatíveis com Anthropic. Para o Qwen 3.8-Max, defina ANTHROPIC_BASE_URL para o *endpoint* Anthropic do DashScope e ANTHROPIC_MODEL=qwen3.8-max usando a configuração da publicação de lançamento da Alibaba. O K3 suporta o mesmo padrão através do *endpoint* da Moonshot. Essa compatibilidade de *harness* compartilhada é o que torna o teste A/B entre os dois tão barato de configurar.

Qual é mais barato para uma carga de trabalho de agente típica?

Pelo preço de tabela, o Qwen 3.8-Max: US$ 2/US$ 6 por milhão de *tokens* contra US$ 3/US$ 15 do K3, e os laços de agente tendem a ter mais *tokens* de saída, onde a diferença é de 2,5x. Duas ressalvas: a taxa de acerto de *cache* de US$ 0,30 do K3 mantém cargas de trabalho com muita entrada e bem armazenadas em *cache* competitivas, e o esforço de raciocínio padrão *xhigh* do Qwen cobra os pensamentos como saída, então seus custos reais podem ser maiores do que as estimativas ingênuas. Modele sua própria mistura de *tokens* antes de presumir que os preços de tabela contam toda a história.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs