Qwen 3.8: Preços Explicados – $2 Input / $6 Output para 1M de Contexto

Preços do Qwen 3.8 no GA: $2 de entrada / $6 de saída por 1 milhão de tokens, fixo em todo o contexto de 1 milhão. Descontos de cache, letras miúdas de cota gratuita e cálculos de custo detalhados.

INEZA Felin-Michel

INEZA Felin-Michel

3 agosto 2026

Qwen 3.8: Preços Explicados – $2 Input / $6 Output para 1M de Contexto

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

A Alibaba lançou o Qwen 3.8-Max no início de agosto de 2026, e a questão do preço finalmente tem uma resposta real. Durante a janela de pré-visualização de julho, a história que circulava era uma promoção de "preço de pré-visualização de 10%". Essa história acabou. Na disponibilidade geral, a página oficial de preços do Model Studio lista o qwen3.8-max a $2 por 1 milhão de tokens de entrada e $6 por 1 milhão de tokens de saída, uma única faixa de preço cobrindo toda a janela de contexto de 1 milhão de tokens.

Essa faixa de preço única é a parte interessante. A maioria dos modelos de ponta cobra mais por token assim que seu prompt ultrapassa um limite de contexto. O Qwen 3.8-Max não: envie 5.000 tokens ou 900.000, a taxa permanece $2/$6.

Este artigo cobre o panorama completo: o design da faixa de preço única, comparações com Qwen 3.7-Max, Kimi K3, Claude Opus 5 e GPT-5.6 Terra, os descontos de cache, as letras miúdas da cota gratuita e exemplos de custos calculados com matemática real. Para uma visão geral mais ampla do modelo, comece com o que é o Qwen 3.8 e por que ele é importante, depois volte para os números.

Uma observação primeiro: os preços de tabela fornecem apenas uma estimativa. O Qwen 3.8-Max vem com raciocínio com esforço xhigh por padrão, e os tokens de pensamento são cobrados como saída. A maneira confiável de projetar custos é enviar solicitações reais e medir o uso de tokens. O Apidog mostra o detalhamento completo dos tokens de cada resposta enquanto você testa, o que transforma a estimativa de custos em aritmética. Mais sobre isso abaixo.

O número GA: $2 de entrada, $6 de saída, uma única faixa

Aqui está a tabela de preços oficial para qwen3.8-max, verificada na página de preços do Model Studio em 3 de agosto de 2026:

Item Preço (por 1 milhão de tokens)
Entrada $2.00
Saída (incluindo tokens de pensamento) $6.00
Entrada em cache (cache hit) 10% da taxa de entrada
Criação explícita de cache 125% da taxa de entrada
Nível de contexto Nível único, 0 a 1 milhão de tokens
Pensamento vs. não-pensamento Cobrado da mesma forma

Três detalhes que merecem destaque: a janela de contexto de 1 milhão de tokens é totalmente coberta por um único preço, sem sobretaxa para prompts longos. Os modos de pensamento e não-pensamento custam as mesmas taxas, embora os tokens de pensamento contem como saída (veja a seção de honestidade abaixo). E a saída máxima é de 65.536 tokens por solicitação, então uma única resposta custa no máximo cerca de $0.39 em saída.

O anúncio oficial do Qwen 3.8 posiciona o modelo como o mais capaz da Alibaba até agora: 2.4T de parâmetros totais com 95B ativos, uma janela de contexto de 1 milhão de tokens, entrada multimodal. Obter isso por $2/$6 supera a maioria dos modelos de ponta, incluindo o carro-chefe anterior da própria Alibaba.

Por que o preço único para 1 milhão de tokens é incomum

O preço por níveis de contexto é a norma da indústria: uma taxa abaixo de um limite de contexto, uma taxa mais alta acima dele, porque contextos longos custam mais para serem atendidos.

A própria Alibaba faz isso. Na mesma página de preços do Model Studio, modelos como qwen3-max e qwen3-coder-plus são precificados em níveis de comprimento de contexto, com a taxa por token aumentando à medida que a entrada cresce. O Qwen 3.8-Max rompe com esse padrão dentro do próprio catálogo da Alibaba: sua tabela de preços mostra uma única linha, "0<Token≤1M", e só isso.

Por que isso importa: com preços em níveis, as cargas de trabalho de contexto longo carregam um multiplicador oculto. Um pipeline RAG que ocasionalmente insere 300K tokens de documentos em um prompt pode custar várias vezes sua taxa típica nessas solicitações. Com o Qwen 3.8-Max, o token marginal sempre custa o mesmo, então o orçamento é linear: tokens vezes taxa, pronto. Para análise de documentos longos, agentes de grandes bases de código ou pipelines de recuperação pesados, essa previsibilidade vale tanto quanto a própria taxa baixa.

Mais barato que o Qwen 3.7-Max no preço de tabela

O Qwen 3.8-Max foi lançado abaixo do preço de tabela de seu antecessor, o que é raro para um salto de geração de carro-chefe:

Isso representa um corte de 20% em ambos os lados, enquanto o modelo ganhou uma janela de contexto maior, entrada multimodal e melhores pontuações de benchmark.

Uma complicação: o Qwen 3.7-Max está atualmente com uma promoção de 50%, o que o reduz para $1.25/$3.75. Nas taxas promocionais, o carro-chefe mais antigo é mais barato que o novo. Se sua carga de trabalho não precisa do contexto de 1 milhão de tokens do Qwen 3.8 ou de seus ganhos multimodais e agênticos, o 3.7-Max com desconto é uma aposta de valor legítima enquanto a promoção durar; apenas não estruture seu modelo de custo em torno de uma promoção. Mais abaixo na hierarquia, o Qwen 3.7-Plus continua sendo o cavalo de batalha econômico a $0.4/$1.6, com uma promoção de 20% própria.

A seção da honestidade: tokens de pensamento são cobrados como saída

Esta é a parte que a maioria dos artigos sobre preços omite, e a parte mais provável de surpreendê-lo em uma fatura.

O Qwen 3.8-Max suporta um parâmetro reasoning_effort com três níveis: xhigh, medium e low. O padrão é xhigh, a configuração mais agressiva. No modo de pensamento, o modelo gera tokens de raciocínio internos antes de sua resposta final, e esses tokens de raciocínio são cobrados pela taxa de saída de $6, o mesmo que o texto visível.

A consequência: nas configurações padrão, as solicitações que exigem muito raciocínio custam mais do que uma estimativa ingênua de "tokens de prompt mais tokens de resposta" prevê. Uma resposta mostrando 800 tokens de resposta visível pode ter consumido vários milhares de tokens de pensamento em um problema difícil.

Três mitigações: reduza o reasoning_effort para medium ou low para tarefas que não precisam de raciocínio profundo (classificação, extração, formatação); meça o uso real por tipo de tarefa antes de projetar o gasto mensal, já que o objeto usage em cada resposta relata contagens reais, incluindo o raciocínio; e observe os tokens de saída especificamente, porque a saída custa 3x a entrada aqui e o pensamento infla a saída.

Cache de contexto: 10% para hits, 125% para criação

Se seu aplicativo reenvia o mesmo prefixo de prompt repetidamente (um prompt de sistema longo, um documento estável, definições de ferramentas), o cache de contexto altera significativamente a economia:

A matemática do ponto de equilíbrio é simples. A criação custa um extra de 25% uma vez; cada hit subsequente economiza 90%. Se um prefixo for reutilizado mesmo duas vezes, o cache já se paga. Para agentes de alta frequência ou aplicativos de chat com um prompt de sistema pesado, as economias se acumulam rapidamente (exemplo calculado abaixo).

Letras miúdas da cota gratuita: 1 milhão de tokens, Singapura, 90 dias

O Model Studio oferece uma cota gratuita para qwen3.8-max, e as letras miúdas importam:

Tokens de pensamento são retirados dessa cota como qualquer outra saída, então algumas dezenas de tarefas de raciocínio difíceis em xhigh podem esgotar 1 milhão de tokens mais rápido do que você esperaria. Se o acesso gratuito é seu objetivo principal, coletamos todas as rotas sem custo, incluindo o Qwen Chat, em como usar o Qwen 3.8 gratuitamente.

Como o preço do Qwen 3.8 se compara

Aqui está o cenário atual, usando preços de tabela por 1 milhão de tokens. As taxas promocionais são sinalizadas, pois as promoções expiram.

Modelo Entrada Saída Observações
Qwen 3.8-Max $2.00 $6.00 Preço fixo em 1M de contexto; cache hits 10%
Qwen 3.7-Max $2.50 $7.50 Atualmente com 50% de desconto: $1.25/$3.75 (promoção)
Qwen 3.7-Plus $0.40 $1.60 Atualmente com 20% de desconto (promoção)
Kimi K3 $3.00 $15.00 Cache hits $0.30
Claude Opus 5 $5.00 $25.00
GPT-5.6 Terra $2.00 $12.00

Lendo a tabela:

Preço não é qualidade, e tabelas de benchmark de fornecedores são tabelas de benchmark de fornecedores. Mas em nível de tabela de preços pura, o Qwen 3.8-Max é o carro-chefe de ponta mais barato nesta linha.

Exemplos práticos: quanto custam tarefas reais

As taxas de tabela significam pouco sem a matemática ajustada à tarefa. Três cenários, calculados a $2/$6:

Exemplo 1: uma sessão de agente de 50 mil tokens

Uma execução de agente consome 38.000 tokens de entrada (instruções, esquemas de ferramentas, resultados de ferramentas) e produz 12.000 tokens de saída:

Agora adicione o raciocínio padrão xhigh. Suponha que o modelo gaste 8.000 tokens de pensamento durante a execução. A saída se torna 20.000 tokens: 20.000 × $6 / 1.000.000 = $0.12, e o total da sessão é de cerca de $0.20. Isso é um aumento de 33% apenas devido ao raciocínio, o que é exatamente o motivo pelo qual você deve medir antes de orçar.

Exemplo 2: análise de documento longo com 800 mil tokens

Você carrega 800.000 tokens de documentos no contexto e pede um resumo estruturado de 5.000 tokens:

A faixa de preço única está fazendo a diferença aqui. Cada um desses 800 mil tokens custa a mesma taxa de $2/1M que os primeiros mil. Em um modelo em camadas, este é precisamente o tipo de solicitação que aciona a faixa mais cara.

Exemplo 3: um prompt de sistema em cache de 100 mil tokens, 50 chamadas por dia

Seu aplicativo pré-carrega 100.000 tokens de prompt de sistema, documentos de produto e definições de ferramentas em cada chamada, 50 vezes por dia.

Sem cache: 100.000 × $2 / 1.000.000 = $0.20 por chamada, portanto $10.00 por dia apenas no prefixo.

Com cache explícito: a criação custa 100.000 × $2.50 / 1.000.000 = $0.25 uma vez, então 49 hits de cache a 100.000 × $0.20 / 1.000.000 = $0.02 cada, ou $0.98. Total diário: cerca de $1.23, uma economia de 88%. Ao longo de um mês, isso é aproximadamente $300 versus menos de $40.

Estime custos a partir do uso medido, não de suposições

Todos os três exemplos se baseiam em contagens de tokens assumidas. Seus números reais serão diferentes, e com tokens de raciocínio em jogo, eles serão diferentes de maneiras que você não pode prever apenas pelo comprimento do prompt. A solução é medir.

Um fluxo de trabalho prático: pegue sua chave de API, configure o endpoint (o guia da API Qwen 3.8 cobre todas as três URLs base regionais e os protocolos compatíveis com OpenAI e Anthropic), e envie solicitações representativas para cada tipo de tarefa em seu aplicativo. Cada resposta retorna um objeto usage com contagens exatas de tokens de entrada, saída e raciocínio.

No Apidog, salve as três URLs base regionais como ambientes, dispare a mesma solicitação em cada nível de reasoning_effort e leia o uso de tokens diretamente no inspetor de resposta. Execute dez solicitações representativas por tipo de tarefa, faça a média das contagens, multiplique por $2/$6, e você terá um modelo de custo construído com base em dados medidos. Você também pode fazer um teste A/B do mesmo prompt contra qwen3.7-max ou Kimi K3 no mesmo espaço de trabalho para ver se o modelo mais barato se mantém em sua carga de trabalho. Baixe o Apidog gratuitamente e você poderá ter números de custo reais por tarefa em uma hora.

Conclusão

O Qwen 3.8-Max a $2/$6 é um preço agressivo para um carro-chefe de classe de ponta: abaixo do preço de tabela de seu predecessor, metade da taxa de saída do GPT-5.6 Terra, uma fração do Opus 5, e preço único em um contexto completo de 1 milhão de tokens onde grande parte do mercado cobra em níveis. Adicione 10% de hits de cache e a economia para cargas de trabalho de contexto longo e alta repetição parece genuinamente forte.

Duas ressalvas: o raciocínio xhigh padrão inflaciona a cobrança de saída acima das estimativas ingênuas, e as âncoras ao redor (3.7-Max com 50% de desconto, a cota gratuita de Singapura) são limitadas no tempo. Meça seu uso real de tokens, defina reasoning_effort deliberadamente, e a tabela de preços terá poucas surpresas.

button

Perguntas frequentes

O Qwen 3.8 custa mais para prompts longos?

Não. A precificação oficial lista uma única faixa cobrindo de 0 a 1 milhão de tokens, então um prompt de 900 mil tokens é cobrado na mesma taxa de entrada de $2 por 1 milhão de tokens que um prompt curto. Isso difere de modelos em níveis, incluindo alguns no próprio catálogo da Alibaba na lista de modelos do Model Studio, onde as taxas aumentam com o comprimento do contexto.

Tokens de pensamento custam extra no Qwen 3.8?

Não há uma taxa de pensamento separada: os modos de pensamento e não-pensamento são cobrados na mesma taxa de $2/$6. Mas os tokens de pensamento contam como tokens de saída a $6 por 1 milhão, e reasoning_effort o padrão é xhigh. Solicitações com uso intenso de raciocínio, portanto, custam mais do que a resposta visível sugere. Reduza o nível de esforço para tarefas simples e verifique o objeto usage em cada resposta para ver o que você está realmente pagando.

Existe uma maneira gratuita de experimentar o Qwen 3.8?

Sim. O Model Studio inclui uma cota gratuita de 1 milhão de tokens, válida por 90 dias, apenas no endpoint da região de Singapura. O Qwen Chat também oferece acesso gratuito no navegador. Ambas as rotas, além das letras miúdas, são cobertas em como usar o Qwen 3.8 gratuitamente.

O antigo "preço de pré-visualização de 10%" ainda está disponível?

Não. Essa foi uma promoção da era de pré-visualização relatada na cobertura da imprensa de julho de 2026; a disponibilidade geral a substituiu pela tabela de preços padrão de $2/$6. Considere a página de preços do Model Studio como a fonte da verdade.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs