Qwen-Image-2.1 vs Qwen Image 3.0: pesos abertos ou API hospedada?

Qwen-Image-2.1 (pesos abertos, licença de pesquisa, transparência nativa) vs Qwen Image 3.0 (API hospedada, $0,03 por imagem, texto denso): licença, custo, capacidades e uma tabela de decisão.

Medy Evrard

28 setembro 2026

Qwen-Image-2.1 vs Qwen Image 3.0: pesos abertos ou API hospedada?

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

A Alibaba agora distribui duas linhas de imagem Qwen que não compartilham uma sequência de versão. O Qwen-Image-2.1, lançado em 20 de setembro de 2026, é o modelo de pesos abertos: 7B de parâmetros no gerador, saída transparente nativa, edição com até 10 referências, para download em Hugging Face. O Qwen Image 3.0 e 3.0 Pro, anunciados em 22 de julho e disponíveis na API desde 4 de agosto de 2026, são modelos hospedados com preço por imagem e sem pesos publicados. O número diz "3.0 é mais recente", mas a verdade é que eles respondem a perguntas diferentes: você quer rodar o modelo ou alugá-lo?

Esta página compara os dois lado a lado em termos de licença, custo, capacidades e operações, e termina com uma tabela de decisão. Para o tour de recursos do 2.1, veja O que é Qwen-Image-2.1; para o código, o guia de como usar. Seja qual for a sua escolha, ambos acabam como um endpoint HTTP que seu aplicativo chama, e Apidog pode manter ambos por trás de uma única coleção, de modo que a troca é uma alteração de configuração.

Comparativo

Qwen-Image-2.1 Qwen Image 3.0 / 3.0 Pro
Lançamento 20 de setembro de 2026 Anunciado em 22 de julho de 2026; API em 4 de agosto de 2026
Distribuição Pesos abertos (Hugging Face, ModelScope) Apenas API hospedada; sem pesos publicados [VERIFICAR]
Licença / termos Licença de Pesquisa Qwen; uso comercial requer licença separada Termos de serviço padrão da API
Preço Seu tempo de GPU qwen-image-3.0: US$ 0,03 por imagem (1K ou 2K). qwen-image-3.0-pro: US$ 0,04 em 1K, US$ 0,075 em 2K. Imagens de entrada US$ 0,003 cada [VERIFICAR]
Tamanho do gerador 7B (32 camadas DiT de fluxo único) + codificador Qwen3-VL 8B Não divulgado
Resolução máxima Padrão 2048 x 2048; até 2752 x 1536 2048 x 2048
Saída transparente Geração e edição RGBA nativa Não anunciado
Imagens de referência Até 10 Imagens de entrada suportadas (preço por imagem); limite não publicado [VERIFICAR]
Edição local Círculos, anotações pintadas, máscara separada Não anunciado no material de lançamento
Renderização de texto Tipografia, estilo e layout aprimorados Recurso principal: texto fino em torno de 10 px, 12 idiomas (auto-relatado)
Saídas por chamada Uma (você faz o loop) Até 6
Comprimento do prompt Não especificado Cerca de 4,5K tokens no Pro (afirmação oficial)
Reescrita de prompt Modelos PE-T2I / PE-I2I separados que você executa por conta própria Gerenciado no lado do servidor
Onde experimentar HF Space, Qwen Chat, ComfyUI Console Model Studio, Qwen Chat

As fontes para a coluna 3.0 são o anúncio de julho da Alibaba e a documentação QwenCloud, conforme resumido por LLM Stats; verifique novamente a tabela de preços no Model Studio antes de orçar, pois o preço por imagem é específico da região.

A licença é o primeiro filtro

Para a maioria das equipes, esta linha encerra a comparação. A licença 2.1 afirma que você "não deve usar os Materiais para qualquer finalidade comercial sem obter uma licença comercial separada." Isso é diferente dos termos da Apache 2.0 sob os quais o Qwen-Image original foi lançado, e significa que um recurso voltado para o cliente, construído sobre o 2.1, precisa de um e-mail para a equipe comercial da Qwen e um acordo assinado antes do lançamento.

Qwen Image 3.0 é uma API paga com termos comerciais padrão. Você paga por imagem e pode lançar seu produto.

Então: pesquisa, avaliação, ferramentas internas ou um projeto onde você está disposto a negociar uma licença, o 2.1 está na mesa. Um recurso de produto a ser lançado neste trimestre sem orçamento legal, o 3.0 é o padrão.

Custo: uma conta de GPU vs três centavos por imagem

O nível padrão 3.0 custa US$ 0,03 por imagem em qualquer resolução, então 10.000 imagens por mês custam US$ 300, mais US$ 0,003 por imagem de entrada em edições. O Pro dobra em 2K.

A auto-hospedagem do 2.1 não tem preço por imagem, mas a aritmética só é favorável em volume e com uma GPU que você deixaria ociosa. A Qwen não publica números de throughput, então meça os seus próprios: com 40 passos e 2048 x 2048 em uma única GPU de data center, conte as imagens por hora, divida o custo horário e compare com US$ 0,03. A edição com muitas referências é onde a reutilização do cache KV do 2.1 ajuda, já que as imagens de referência são codificadas uma vez por solicitação, em vez de por passo. Se sua GPU é compartilhada com outras cargas de trabalho, lembre-se que a geração de imagens a ocupará durante picos.

Uma regra geral: para algumas milhares de imagens por mês, a API é mais barata se você considerar o tempo de engenharia. Acima de dezenas de milhares por mês com carga constante e um acordo de licenciamento em vigor, a auto-hospedagem compensa. Entre esses dois, depende se você já utiliza GPUs.

Capacidades: transparência vs texto denso

Os dois modelos foram construídos para tarefas diferentes.

Escolha o 2.1 quando a saída precisar de um canal alfa. Adesivos, recortes de produtos, ativos de UI, composições em camadas, extração de um sujeito de uma foto como RGBA: o 2.1 faz isso nativamente no mesmo modelo, incluindo a edição de uma camada transparente sem perder sua transparência. O material de lançamento do 3.0 não menciona saída alfa. Fazê-lo no 3.0 significa uma etapa separada de remoção de fundo com os artefatos de halo que a acompanham.

Escolha o 2.1 quando a edição for a carga de trabalho. Dez imagens de referência, seleção de região por círculo, pintura ou máscara, e trabalho de fidelidade em rostos e produtos são o foco do lançamento do 2.1. A publicação de lançamento mostra fotos de grupo a partir de seis retratos, roupas a partir de cinco fotos de produtos e um cômodo mobiliado a partir de dez fotos de móveis.

Escolha o 3.0 quando a imagem for principalmente texto. Dashboards, wireframes, pôsteres e layouts tipo slides com texto fino em muitos idiomas são para o que o 3.0 foi otimizado. O 2.1 também melhorou a tipografia, mas a afirmação publicada do 3.0 de "texto de 10 px em 12 idiomas" é mais forte, e seu orçamento de prompt de 4,5K tokens no Pro se adapta a especificações de layout longas.

Escolha o 3.0 quando precisar de vários candidatos por chamada. Até seis saídas por solicitação é um recurso de fluxo de trabalho que o 2.1 não possui; com o 2.1, você itera sobre as seeds.

Nenhuma página do fornecedor apresenta uma tabela de benchmark com números. A publicação do 2.1 mostra um gráfico Qwen-Image-Bench; as alegações do 3.0 são auto-relatadas. Trate ambos como sugestões para sua própria avaliação, o que a seção Apidog torna repetível.

Operações: o que você possui

Auto-hospedar o 2.1 significa possuir: downloads e atualizações do modelo, uma GPU com memória suficiente (a Qwen não publica uma tabela de VRAM; o README oferece offload de CPU e aponta para vLLM-Omni com FP8, SGLang e LightX2V), um wrapper de serviço, enfileiramento sob carga de pico e os dois modelos opcionais de reescrita de prompt, se você quiser que prompts de uma linha funcionem. Em troca, você obtém localidade de dados, sem limites de taxa além dos seus próprios, e uma versão de modelo fixa que ninguém altera por você.

Usar o 3.0 significa possuir: uma conta Alibaba Cloud e escolha de região, chaves de API, gerenciamento de limites de taxa e o risco de que o modelo hospedado altere seu comportamento entre seu teste e a produção. Em troca, você obtém infraestrutura zero e uma fatura por imagem.

Os guias da API Nano Banana 2 e API gpt-image-2.5 abordam os mesmos trade-offs de hospedagem para Google e OpenAI, caso você esteja comparando entre fornecedores em vez de dentro da Qwen.

Tabela de decisão

Sua situação Escolha
Lançar um recurso comercial neste trimestre, sem orçamento legal 3.0
Precisa de PNGs transparentes ou edição RGBA 2.1 (com licença se comercial)
Edição com muitas imagens de referência 2.1
Layouts com muito texto em vários idiomas 3.0
Pesquisa, avaliação, ferramentas internas 2.1
Abaixo de algumas milhares de imagens por mês 3.0
Dezenas de milhares por mês, GPUs já em funcionamento, licença assinada 2.1
Dados não podem sair da sua rede 2.1
Quer seis candidatos por solicitação 3.0

Execute ambos por trás de uma única coleção

A resposta prática para muitas equipes é usar ambos: 2.1 para o pipeline de ativos transparentes e ferramentas internas, 3.0 para layouts de texto voltados para o cliente. Isso funciona perfeitamente se os dois estiverem sob um único contrato.

No Apidog, defina um endpoint POST /v1/images uma vez, com prompt, aspect, transparent, seed e um campo de arquivo references, e configure dois ambientes: base_url apontando para seu wrapper 2.1 (o guia de como usar tem uma versão FastAPI de 40 linhas) e um segundo apontando para um adaptador para o endpoint 3.0 do Model Studio. Então:

Baixe o Apidog e importe o endpoint para começar a comparar.

FAQ

O Qwen Image 3.0 é de código aberto? Nenhum peso público foi lançado para o 3.0 ou 3.0 Pro; são modelos de API hospedados [VERIFICAR]. Qwen-Image-2.1 é o lançamento de pesos abertos.

Posso usar o Qwen-Image-2.1 comercialmente? Somente com uma licença comercial separada da Qwen. A Licença de Pesquisa Qwen padrão exclui o uso comercial.

Qual é mais barato? Em baixo volume, o 3.0 a US$ 0,03 por imagem. Em alto volume, constante, em hardware que você já opera, o 2.1, depois de ter garantido uma licença e medido seu próprio throughput.

O 3.0 gera imagens transparentes? Não é anunciado. A saída RGBA nativa é um recurso do 2.1; veja O que é Qwen-Image-2.1.

Posso experimentar um deles gratuitamente? O 2.1 tem um Hugging Face Space e acesso ao Qwen Chat; o guia de nível gratuito lista as opções. O 3.0 está disponível no Qwen Chat e através da cota de teste do Model Studio, que varia por região.

Para onde ir a seguir

2.1 e 3.0 são uma ramificação, não um caminho de atualização. A licença decide a primeira pergunta, a carga de trabalho decide a segunda e o volume decide a terceira. Seja qual for a sua escolha, coloque-a por trás de um contrato que você testará: o guia de como usar constrói o lado 2.1, e a mesma coleção Apidog pode ser a interface do lado 3.0 no dia em que você precisar.

button

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs