Por duas semanas, a história do Qwen 3.8 teve uma lacuna. As prévias para a imprensa em julho prometeram um modelo de classe de fronteira, mas não entregaram pontuações, então cada artigo inicial se baseou em impressões. Isso mudou em 3 de agosto de 2026. A publicação oficial de lançamento da Alibaba para o Qwen 3.8-Max inclui uma tabela de benchmark completa contra Claude Opus 4.8, Fable 5, GPT-5.6 Sol e seu próprio predecessor Qwen3.7-Max, além de uma tabela multimodal separada contra Gemini 3.1 Pro e GPT-5.6 Sol.
Essa tabela merece ser lida com atenção. Ela contém vitórias genuínas, perdas honestas e letras miúdas que a maioria das coberturas ignorará completamente. Este post aborda os três pontos, e então oferece uma maneira prática de parar de confiar totalmente nas tabelas de fornecedores: execute sua própria avaliação contra a API. Se você quiser o resumo completo do modelo primeiro (parâmetros, preços, acesso), comece com nosso explicador do Qwen 3.8-Max e volte.
Uma observação antes dos números. Cada pontuação abaixo vem da própria tabela publicada pela Alibaba, com dados de leaderboard que as notas de rodapé datam de 3 de agosto de 2026. Nenhuma avaliação independente existia no momento da redação. Mantenha isso em mente para cada linha que se segue.
A tabela, em um relance
Aqui estão as linhas principais do modelo de texto, conforme publicadas pela Alibaba. Mais alto é melhor em todas elas.
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (Humanity’s Last Exam) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
Fonte: Tabela executada pelo fornecedor da Alibaba. Abordaremos o que "executada pelo fornecedor" significa na prática mais adiante, porque aqui isso importa mais do que o usual.

Onde Qwen 3.8-Max vence
PaperBench: sua melhor linha carro-chefe
PaperBench, que testa se um modelo consegue reproduzir resultados de artigos de pesquisa, é o desempenho mais forte do Qwen 3.8-Max contra a fronteira: 93.0, à frente do GPT-5.6 Sol (90.5), Fable 5 (88.8) e Opus 4.8 (80.3). É também um salto impressionante em relação aos 64.8 do Qwen3.7-Max. Um salto geracional de 28 pontos em qualquer benchmark merece escrutínio, mas se ele se mantiver sob testes independentes, isso diz algo real sobre a capacidade de pesquisa de longo prazo do modelo.
IFBench: seguimento de instruções por uma ampla margem
No IFBench, o Qwen 3.8-Max atinge 82.8. O concorrente não-Qwen mais próximo na tabela é o GPT-5.6 Sol com 72.7, com Fable 5 em 63.5 e Opus 4.8 em 62.2. Isso representa uma diferença de 10 a 20 pontos, o que é incomum em um benchmark tão saturado. Curiosamente, o Qwen3.7-Max já liderava esta linha com 79.1, então o seguimento de instruções parece ser uma força duradoura do Qwen, e não um evento isolado.
Terminal Bench 2.1: superando Claude por pouco
Na execução do Terminal Bench 2.1 pela Alibaba, o Qwen 3.8-Max pontua 86.6 contra 84.6 para Opus 4.8 e Fable 5. O GPT-5.6 Sol ainda lidera a linha com 88.8, então este é um segundo lugar, não uma vitória esmagadora. Mas superar ambos os carros-chefes da Anthropic em um benchmark de terminal agentivo é exatamente o tipo de resultado que a Alibaba desejava com este lançamento, e a margem de dois pontos sobre o Claude é o número que você verá citado em todos os lugares.
A varredura multimodal
A tabela multimodal separada é onde o Qwen 3.8-Max parece mais forte no geral. A Alibaba reporta MathVision em 95.2, LogicVista em 91.9 e OSWorld-Verified em 86.1, e o modelo lidera quase todas as linhas de OCR na tabela. Nem Opus 4.8 nem Fable 5 competem diretamente aqui (eles são focados em texto nesta comparação), o que é em parte o motivo pelo qual a tabela multimodal é lida como uma varredura. Contra Gemini 3.1 Pro e GPT-5.6 Sol, as linhas de raciocínio visual e inteligência de documentos são o diferencial mais claro do modelo.
Se você estiver comparando-o com o outro grande lançamento de peso aberto do verão, a lacuna multimodal é também o contraste mais nítido: o Kimi K3 é apenas de texto. Nossa comparação Qwen 3.8 vs Kimi K3 aborda esse confronto em detalhes.
Onde ele perde, mantendo a honestidade
A Alibaba deixou as perdas na tabela, o que merece algum crédito. Três se destacam.
HLE: 43.6, bem atrás de Fable 5. No Último Exame da Humanidade (HLE), o benchmark de conhecimento geral de fronteira, o Qwen 3.8-Max pontua 43.6. Fable 5 está em 53.3, GPT-5.6 Sol em 47.2 e Opus 4.8 em 45.7. Isso é o último lugar entre os quatro carros-chefes, quase 10 pontos atrás do líder. Ele supera os 41.4 do Qwen3.7-Max, mas por pouco. O HLE resiste melhor à otimização específica para benchmarks do que a maioria das avaliações, o que torna esta linha digna de ser fortemente considerada.
SWE-bench Pro: 67.7 vs 80.0 de Fable 5. No benchmark de engenharia de software mais difícil, o Qwen 3.8-Max fica no meio do pelotão: à frente do GPT-5.6 Sol (64.6), logo atrás do Opus 4.8 (69.2) e uns bons 12 pontos atrás do Fable 5. A melhoria geracional em relação ao Qwen3.7-Max (60.6) é real, mas "supera Claude no Terminal Bench" e "fica muito atrás de Fable 5 no SWE-bench Pro" são ambas verdadeiras ao mesmo tempo, e a segunda afirmação aparecerá em muito menos manchetes.
DeepSWE e as linhas agentivas mais difíceis. DeepSWE é outra linha onde o Qwen 3.8-Max fica atrás da fronteira na própria tabela da Alibaba. O padrão na seção de codificação é consistente: competitivo em tarefas agentivas orientadas por terminal, atrás nas avaliações mais profundas de engenharia de software.
O resumo honesto: o Qwen 3.8-Max supera o Opus 4.8 em várias linhas agentivas, fica atrás do Fable 5 na maioria dos trabalhos de codificação essenciais e obtém grandes vitórias em multimodalidade e inteligência de documentos. Este é um resultado genuinamente forte para um modelo precificado em $2 de entrada e $6 de saída por milhão de tokens (veja a página oficial de preços), mas não é a vitória generalizada na fronteira que uma leitura rápida da cobertura de lançamento poderia sugerir.
As letras miúdas que a maioria das coberturas ignorará
Esta é a seção que justifica a leitura de um post sobre benchmarks em vez de uma manchete. Quatro detalhes da própria publicação da Alibaba mudam a forma como você deve ler a tabela.
1. Cada número é executado pelo fornecedor. A Alibaba avaliou seu próprio modelo e os modelos de seus concorrentes. Isso é uma prática padrão para tabelas de lançamento, e é também a razão padrão pela qual as tabelas de lançamento são posteriormente revisadas. Os fornecedores escolhem as versões dos benchmarks, as estratégias de prompt, as configurações de amostragem e as políticas de repetição. Nada disso é fraude. Tudo isso é uma forma de influenciar o resultado.
2. A maioria das linhas de codificação foi executada no harness Claude Code. Este é o detalhe genuinamente interessante. A Alibaba executou a maioria dos seus benchmarks de codificação com o Claude Code, o próprio harness de agente da Anthropic, apontado para o Qwen 3.8-Max através da sua API compatível com Anthropic. Por um lado, isso é uma jogada justa: ele avalia cada modelo dentro da mesma ferramenta amplamente utilizada. Por outro lado, significa que as "pontuações de codificação do Qwen" são, na verdade, pontuações de "Qwen dentro do harness da Anthropic", e a escolha do harness pode variar os resultados agentivos em vários pontos. Isso também lhe diz algo sobre onde a Alibaba espera que este modelo seja executado na prática.
3. Vários benchmarks são internos do Qwen. QwenSWEBench, QwenQoderBench, CoWorkBench e RecreationBench foram todos construídos pela equipe Qwen. Benchmarks internos não são inúteis; eles frequentemente investigam capacidades que as avaliações públicas perdem. Mas uma pontuação forte de um modelo no benchmark do seu próprio criador é um tipo diferente de evidência do que uma pontuação forte no SWE-bench Pro, e a tabela apresenta ambos lado a lado sem distinção visual. Ao citar um número desta tabela, verifique primeiro a qual categoria ele pertence.
4. A nota de rodapé sobre Fable 5. A própria tabela da Alibaba traz uma nota de rodapé dizendo "Os resultados do Fable5 podem envolver fallbacks." Essa é uma admissão silenciosa de que os números de pelo menos um concorrente podem não refletir o modelo funcionando perfeitamente. Seja qual for a causa técnica, significa que a coluna do Fable 5, o modelo que o Qwen 3.8-Max mais frequentemente fica atrás, vem com um asterisco das pessoas que a publicaram.
Nada disso é exclusivo da Alibaba. Anthropic, OpenAI e Google publicam tabelas autogerenciadas com suas próprias escolhas metodológicas. Sinalizamos o mesmo padrão em nossa análise dos benchmarks do Kimi K3, e ele se aplicou lá também. O ponto não é que a Alibaba trapaceou. O ponto é que uma tabela de fornecedor é uma afirmação, não uma medição.
O que observar e como ler a próxima tabela
Em 3 de agosto de 2026, não existem avaliações independentes do Qwen 3.8-Max. A Artificial Analysis não havia publicado números no momento da redação, e nenhuma das tabelas de classificação da comunidade havia pontuado o modelo. Isso mudará em poucos dias, e as diferenças entre a tabela da Alibaba e as execuções independentes serão a verdadeira história. Atualizaremos este post quando elas chegarem.
Até lá, aqui está uma breve lista de verificação para julgar qualquer tabela de benchmark de fornecedor, incluindo esta:
- Quem executou a avaliação? Números auto-relatados para concorrentes merecem mais ceticismo do que números auto-relatados para o próprio modelo do fornecedor.
- Qual harness e configurações? Benchmarks agentivos são sensíveis ao harness. Uma tabela que nomeia seu harness (como a Alibaba fez) é mais útil do que uma que não o faz, mas a escolha ainda molda os resultados.
- Quais benchmarks o fornecedor construiu? Avaliações internas medem algo, mas não o mesmo algo que as públicas.
- Leia as notas de rodapé. "Pode envolver fallbacks" está fazendo muito trabalho em uma fonte pequena.
- Verifique o que está faltando. Linhas que um fornecedor não publicou são frequentemente tão informativas quanto as que publicou. Tabelas de fornecedores anteriores silenciosamente omitiram benchmarks onde o modelo teve desempenho inferior; compare com como a última geração se saiu entre os fornecedores para identificar quais linhas desapareceram.
- Aguarde a segunda fonte. Uma semana de paciência geralmente lhe rende números independentes.
Execute sua própria avaliação, em vez disso
A lista de verificação ajuda você a ler tabelas. O melhor movimento é precisar menos delas. O Qwen 3.8-Max está disponível agora no Alibaba Cloud Model Studio (ID do modelo qwen3.8-max, listado na página oficial de modelos) com uma API compatível com OpenAI e uma compatível com Anthropic, e um benchmark que usa seus prompts reais supera qualquer avaliação pública que não o faça.
Uma configuração prática no Apidog se parece com isto. Crie uma requisição para o endpoint de chat-completions do Model Studio com qwen3.8-max e uma segunda requisição idêntica para o seu modelo de base atual, seja Qwen3.7-Max, Kimi K3, ou um endpoint Claude ou GPT. Salve de 20 a 30 dos seus prompts de produção reais como um cenário de teste, adicione asserções para as propriedades de resposta que você realmente se importa (JSON válido, campos obrigatórios presentes, latência abaixo do seu limite) e execute ambos os cenários consecutivamente. Os relatórios de teste do Apidog fornecem as taxas de aprovação e os tempos de resposta por modelo, lado a lado, em sua carga de trabalho em vez da da Alibaba.
Duas coisas específicas do Qwen para verificar enquanto estiver nisso: o modelo assume como padrão reasoning_effort: xhigh, então meça o custo e a latência no nível de esforço que você realmente usaria em produção, e se você planeja usar o endpoint compatível com Anthropic, teste o formato desse protocolo separadamente, pois é por ele que a maioria dos benchmarks de codificação da própria Alibaba foram executados. Baixe o Apidog gratuitamente, configure ambos os endpoints como ambientes, e você terá números de primeira mão antes que as tabelas de classificação independentes publiquem os seus.
Perguntas frequentes
Os números de benchmark do Qwen 3.8 são verificados independentemente?
Não. Em 3 de agosto de 2026, cada número publicado vem da própria tabela da Alibaba. A Artificial Analysis e as tabelas de classificação da comunidade ainda não haviam pontuado o Qwen 3.8-Max no momento da redação. Trate a tabela como uma afirmação do fornecedor até que as execuções independentes sejam publicadas.
Qual é o melhor resultado de benchmark do Qwen 3.8-Max?
PaperBench, com 93.0, é sua melhor linha na tabela principal: à frente do GPT-5.6 Sol (90.5), Fable 5 (88.8) e Opus 4.8 (80.3). Na tabela multimodal, MathVision (95.2) e as linhas de OCR são seus resultados mais fortes no geral.
Onde o Qwen 3.8-Max claramente perde?
No HLE, ele pontua 43.6, o último entre os quatro carros-chefes e bem atrás dos 53.3 do Fable 5. No SWE-bench Pro, ele registra 67.7 contra 80.0 do Fable 5, e também fica atrás no DeepSWE. Avaliações aprofundadas de engenharia de software e exames de conhecimento geral são suas áreas mais fracas na própria tabela da Alibaba.
Quão melhor é o Qwen 3.8 em relação ao Qwen 3.7-Max nos benchmarks?
Os ganhos geracionais na tabela da Alibaba são grandes: o Terminal Bench 2.1 passou de 74.5 para 86.6, o SWE-bench Pro de 60.6 para 67.7, e o PaperBench de 64.8 para 93.0. Se a atualização vale a pena para sua carga de trabalho depende também do preço e da modalidade; nossa comparação Qwen 3.8 vs Qwen 3.7 detalha a decisão completa.
