Qwen 3.8 para Codificação: 16 Dias de Execuções Autônomas e a Conexão com o Código Claude

Qwen 3.8-Max para programação: Período de execução autônoma de 16 dias da Alibaba, resultados de benchmark e configurações oficiais para Claude Code, Codex, Qoder, Qwen Code e OpenClaw.

Ashley Innocent

Ashley Innocent

3 agosto 2026

Qwen 3.8 para Codificação: 16 Dias de Execuções Autônomas e a Conexão com o Código Claude

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

A maioria dos lançamentos de modelos apresenta a capacidade de codificação da mesma forma: aqui está nossa pontuação HumanEval, aqui está um trecho do modelo escrevendo uma busca binária. A Alibaba adotou uma rota diferente com o Qwen 3.8-Max. A afirmação não é "ele escreve boas funções". A afirmação é que ele pode gerenciar um projeto de software por conta própria por semanas: abrindo issues, mesclando pull requests e entregando recursos sem intervenção humana.

Essa é uma proposta audaciosa, e merece escrutínio. Este artigo detalha as três demonstrações de codificação que a Alibaba publicou no lançamento (todas demos de fornecedor, uma com um repositório público que você pode auditar), os números de benchmark de codificação por trás delas, e então a parte em que você pode agir hoje: como realmente codificar com qwen3.8-max no Claude Code, Codex, Qoder, Qwen Code e OpenClaw, e como testar a saída da API que o seu código gerado produz.

Se você é novo no modelo em si, comece com a visão geral de o que é o Qwen 3.8: 2,4T de parâmetros totais, 95B ativos, uma janela de contexto de 1M de tokens, e pesos abertos prometidos para a semana após o lançamento. Aqui, nos concentraremos na história da codificação. Tudo abaixo reflete o estado das coisas em 3 de agosto de 2026.

button

O que a Alibaba realmente está afirmando

A abordagem na publicação oficial de lançamento do Qwen 3.8 é a autonomia sobre os trechos de código. A Alibaba posiciona o Qwen 3.8-Max como um modelo que pode manter uma tarefa de engenharia de longo prazo em mente: planejar o trabalho, executá-lo por dias, se recuperar de seus próprios erros e entregar algo revisável no final.

Três coisas tornam essa afirmação mais interessante do que o marketing usual de lançamento:

  1. As demos são longas. Dezesseis dias é um regime diferente de um benchmark de agente de 20 minutos. A recuperação de erros, o gerenciamento de contexto e a deriva importam muito mais nessa escala.
  2. Uma demo é pública. Você pode navegar pelo repositório, ler os commits e julgar a qualidade do código por si mesmo. A maioria das demonstrações de fornecedores não oferece isso.
  3. O harness é de um concorrente. A Alibaba executou a maioria de seus benchmarks de codificação com o harness Claude Code e publicou uma configuração oficial para que você possa fazer o mesmo. Mais sobre isso abaixo.

Ressalva padrão, e que se aplica a este artigo inteiro: todos os números aqui vêm dos próprios materiais de lançamento da Alibaba. Nenhuma verificação independente existe ainda em meados de agosto de 2026. Trate as demonstrações como exemplos, não como auditorias.

As três demonstrações de codificação

oh-my-cli: 16 dias de desenvolvimento autônomo

A principal demonstração. A Alibaba liberou o Qwen 3.8-Max para construir uma ferramenta de linha de comando e o deixou rodar sem supervisão. Em 30 de julho, a execução durava 16 dias e havia produzido 265 commits, 127 pull requests e 151 issues, todos abertos, trabalhados e fechados pelo próprio modelo.

O repositório é público em qwen-code-dev-bot/oh-my-cli, o que é a parte mais útil de toda a demonstração. Você não precisa confiar na contagem de commits. Você pode ler as descrições dos PRs, verificar se os issues são bugs reais ou trabalho sem sentido, e ver se o código se sustenta. Dezesseis dias de produção de um modelo sem revisão humana é um artefato genuinamente raro, não importa o que você conclua sobre a qualidade.

O que procurar ao auditar: se os PRs realmente corrigem os issues que referenciam, se o modelo cria trabalho artificial para fechar, e como ele lida com suas próprias regressões. Esses padrões dizem mais sobre a confiabilidade de longo prazo do que qualquer pontuação de benchmark.

A execução de reprodução de artigo: código de pesquisa, não código de aplicativo

A segunda demonstração foca em uma classe de codificação mais difícil: reproduzir um artigo de pesquisa de aprendizado de máquina do zero. De acordo com os números da Alibaba, a execução levou aproximadamente 125 horas, produziu cerca de 7.600 linhas de código e executou 33 rodadas de treinamento de GPU ao longo do processo.

O resultado: o modelo reproduziu 6 das descobertas do artigo, e então foi um passo além e superou o resultado relatado do artigo em 2,7 pontos no AIME24. Reproduzir pesquisas é um trabalho notoriamente implacável. Ambientes quebram, hiperparâmetros se escondem em notas de rodapé, e um único bug silencioso invalida uma execução de treinamento que você só descobre horas depois. Um modelo que consegue passar por 33 rodadas de treinamento e sair com números correspondentes está fazendo algo além do preenchimento automático.

Esta demonstração seS complementa com a linha de benchmark mais forte do Qwen 3.8-Max, o PaperBench, abordado abaixo.

A competição Tianchi: 24 horas contra equipes humanas

A terceira demonstração colocou o modelo em uma competição de ciência de dados ao vivo na plataforma Tianchi da Alibaba, com um limite de 24 horas. O modelo fez 45 submissões nessa janela, iterando em sua abordagem a cada vez, e terminou com uma precisão final de 0,853. Isso o colocou à frente de 458 das 526 equipes humanas competindo.

Vale ressaltar a forma deste resultado: o modelo não venceu. Ele superou 87% do campo, o que é impressionante e honesto ao mesmo tempo. Também mostra uma capacidade que as outras duas demos não mostram: iteração rápida sob um prazo, onde a pontuação de cada submissão alimenta a próxima tentativa.

Mais uma ressalva que se aplica com força extra aqui: Tianchi é a própria plataforma da Alibaba. A demo é real, mas o fornecedor controlou o local.

Os benchmarks de codificação por trás das demonstrações

A Alibaba publicou uma tabela completa de benchmarks no lançamento. Aqui estão as linhas relevantes para codificação, com as partes honestas incluídas. Todos os números são das próprias execuções da Alibaba.

Benchmark Qwen 3.8-Max Melhor rival (conforme tabela da Alibaba)
Terminal Bench 2.1 86.6 88.8 (GPT-5.6 Sol)
SWE-bench Pro 67.7 80.0 (Fable 5)
PaperBench 93.0 90.5 (GPT-5.6 Sol)

Três pontos a serem observados:

Agora a letra miúda que a maioria das coberturas vai pular: a Alibaba executou a maioria desses benchmarks de codificação no harness Claude Code, incluindo execuções para modelos rivais, e as notas de rodapé da tabela indicam que os resultados do Fable 5 podem envolver fallbacks. A escolha do harness afeta materialmente as pontuações do benchmark agentic, então uma tabela executada por um fornecedor em um harness específico é apenas um ponto de dados, não um veredicto.

O detalhe do Claude Code funciona para os dois lados, no entanto. Isso significa que a Alibaba otimizou para o harness que você já pode estar usando, e eles publicaram a configuração para provar isso.

Como realmente codificar com Qwen 3.8 hoje

Aqui está a parte prática. O Qwen 3.8-Max está disponível no Alibaba Cloud Model Studio, e a Alibaba publicou configurações oficiais para cinco ferramentas de codificação no lançamento. Você precisa de uma chave de API do DashScope (de home.qwencloud.com) para todas elas. O preço é de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída, fixo em todo o contexto de 1M, de acordo com a página oficial de preços do Model Studio.

Claude Code

O modelo é fornecido com um endpoint de API compatível com Anthropic, então apontar o Claude Code para ele requer três variáveis de ambiente:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max

Inicie o Claude Code normalmente e ele roteará todas as requisições para o Qwen 3.8-Max em vez do Claude. Dado que a Alibaba executou seus benchmarks de codificação exatamente nesse harness, esta é a configuração com a menor diferença entre o que foi medido e o que você experimentará.

Codex

O Codex precisa de uma entrada de provedor em sua configuração. O rascunho da documentação oficial:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000

Isso usa o endpoint compatível com OpenAI em vez do Anthropic. Mesmo modelo, mesma chave, formato de protocolo diferente.

Qoder, Qwen Code e OpenClaw

Os três restantes são mais rápidos de resumir:

Todas as cinco configurações estão na postagem de lançamento, então pegue a versão exata e atual lá em vez de fixar em um instantâneo do blog.

Defina o esforço de raciocínio deliberadamente

O Qwen 3.8-Max suporta um parâmetro reasoning_effort com três níveis: xhigh (o padrão), medium e low. Para codificação, essa configuração importa mais do que a maioria dos botões:

Lembre-se de que os tokens de pensamento são cobrados como tokens de saída a US$ 6 por milhão, e xhigh é o padrão. Uma longa sessão de agente com esforço total custa dinheiro de verdade; uma edição mecânica em xhigh custa sem nenhum benefício.

Se o Qwen 3.8-Max for mais modelo do que sua tarefa precisa, a linha anterior Qwen3 Coder ainda existe para trabalhos de codificação dedicados, e o Qwen3 Coder Flash cobre a parte rápida e barata. Para o outro peso pesado de código aberto neste espaço, veja como o Kimi K3 lida com o trabalho de codificação.

Testando o que o modelo constrói: a etapa Apidog

Aqui está a lacuna em toda demonstração de codificação autônoma, incluindo a da Alibaba: o modelo escreve código que chama APIs, e ninguém fala sobre verificar essas chamadas. Um agente pode produzir 7.600 linhas que compilam perfeitamente e ainda assim atingir o endpoint errado, lidar mal com um 429 ou enviar um corpo de requisição que falha na validação em produção.

Dois hábitos preenchem essa lacuna.

Teste os endpoints que seu código gerado chama. Quando o Qwen 3.8-Max estrutura um serviço ou escreve um cliente de API, importe a especificação relevante para o Apidog e exercite os endpoints diretamente: fluxos de autenticação, respostas de erro, payloads de casos extremos. É muito mais barato encontrar uma suposição errada em um teste do que em um rastreamento de pilha dois dias depois em uma sessão autônoma. Se você está avaliando a própria API do modelo antes de se comprometer com ela, o guia da API do Qwen 3.8 cobre a configuração de protocolo duplo OpenAI e Anthropic em detalhes, e o Apidog é um local conveniente para inspecionar ambos os formatos de protocolo lado a lado, incluindo as respostas de streaming e as deltas de raciocínio.

Simule APIs para que as execuções do agente não atinjam a produção. Este ponto se torna mais importante quanto mais longas forem suas execuções. Uma sessão autônoma de 16 dias fazendo chamadas ao vivo contra a infraestrutura de produção é uma ideia genuinamente ruim: limites de taxa, mutações de dados, contas surpresa. Servidores mock no Apidog fornecem ao agente respostas realistas sem tocar em sistemas reais. Aponte o código gerado para a URL mock durante a execução, troque pela URL base real quando um humano tiver revisado a saída. Baixe o Apidog gratuitamente para configurar um mock em poucos minutos; é o seguro mais barato que uma execução de agente não supervisionada pode ter.

O padrão generaliza: quanto mais autonomia você dá a um modelo de codificação, mais a camada da API se torna sua superfície de controle. Você não pode revisar cada commit em tempo real, mas pode controlar com o que o código pode se comunicar.

Perguntas Frequentes

O Qwen 3.8 é bom para codificação?

Pelos próprios números da Alibaba, ele é forte em codificação de estilo agente e de pesquisa (Terminal Bench 2.1 com 86.6, PaperBench com 93.0) e mediano na correção de bugs em escala de repositório (SWE-bench Pro com 67.7 contra 80.0 do Fable 5). Todos os números são de execução do fornecedor sem verificação independente ainda. A leitura honesta: excelente para trabalho autônomo de longo prazo, não o líder para correção clássica de problemas.

Posso usar o Qwen 3.8 no Claude Code?

Sim, oficialmente. Defina ANTHROPIC_BASE_URL para https://dashscope-intl.aliyuncs.com/apps/anthropic, ANTHROPIC_AUTH_TOKEN para sua chave DashScope e ANTHROPIC_MODEL para qwen3.8-max. A Alibaba publicou esta configuração e executou a maioria de seus benchmarks de codificação no harness Claude Code.

Quanto custa codificar com o Qwen 3.8?

US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída, fixo em todo o contexto de 1M. Os tokens de pensamento são cobrados como saída, e o esforço de raciocínio xhigh padrão produz muitos deles, então orce acima do preço de tabela para sessões de agente. O cálculo completo dos custos e comparações estão na análise dos benchmarks do Qwen 3.8 e na cobertura de preços vinculada lá.

A execução de 16 dias do oh-my-cli foi realmente autônoma?

Essa é a afirmação da Alibaba, e ao contrário da maioria das demos de fornecedores, você pode verificar o artefato: o repositório é público em qwen-code-dev-bot/oh-my-cli com 265 commits, 127 PRs e 151 issues em 30 de julho de 2026. Se a qualidade do código justifica o enquadramento é um julgamento que você pode fazer por si mesmo lendo-o, o que é exatamente o que torna esta demonstração mais credível do que uma captura de tela.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs