O que é Qwen-Image-2.1? O modelo de imagem aberto 7B com transparência nativa

Qwen-Image-2.1 explicado: Lançamento de pesos abertos em 20 de setembro, geração e edição unificadas de 7B, saída RGBA nativa, 10 imagens de referência e a licença de pesquisa que limita o uso comercial.

Ashley Innocent

Ashley Innocent

21 setembro 2026

O que é Qwen-Image-2.1? O modelo de imagem aberto 7B com transparência nativa

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

A equipe Qwen da Alibaba lançou o Qwen-Image-2.1 como código aberto em 20 de setembro de 2026. É um modelo que realiza geração de texto para imagem e edição de imagem, com 7 bilhões de parâmetros em seu componente de geração visual, e pode gerar PNGs transparentes diretamente de um prompt, em vez de simular a transparência com uma passagem de remoção de fundo. A publicação de lançamento lista quatro mudanças: uma arquitetura mais leve e rápida, transparência nativa, edição com até 10 imagens de referência e melhor tipografia e detalhes de retratos. Os pesos estão no Hugging Face e ModelScope, e o código está no GitHub.

Uma linha na ficha do modelo importa mais do que qualquer recurso: a licença é a Qwen Research License, não a Apache 2.0. O uso comercial requer um acordo separado. Se você está avaliando o 2.1 para um produto, leia essa seção antes dos benchmarks. Se você deseja executá-lo, o guia de como usar o Qwen-Image-2.1 contém o código diffusers e um wrapper HTTP que você pode testar no Apidog. Se você está comparando-o com a API hospedada Qwen Image 3.0, a comparação entre 2.1 e 3.0 é a página de decisão.

Qwen-Image-2.1 em resumo

Item Detalhe (publicação de lançamento, ficha do modelo, README do GitHub)
Data de lançamento 20 de setembro de 2026
O que ele faz Geração de texto para imagem e edição de imagem em um único modelo, incluindo saída transparente (RGBA)
Gerador visual 32 camadas DiT de fluxo único, 7B parâmetros
Codificador de texto Qwen3-VL 8B
VAE Autoencoder RGBA de 64 canais, compressão espacial 16x
Saída padrão 2048 x 2048; sete proporções de aspecto até 2752 x 1536
Imagens de referência Até 10 por edição
Edição local Círculos, anotações pintadas ou uma imagem de máscara separada
Modelos complementares Modelos de reescrita de prompt Qwen-Image-2.1-PE-T2I e PE-I2I (fine-tunes de Qwen3.5-VL 9B)
Licença Qwen Research License Agreement; o uso comercial requer uma licença separada
Experimente Hugging Face Space, Qwen Chat, ComfyUI (suporte nativo desde o dia do lançamento)

Onde ele se posiciona na linha Qwen-Image

O Qwen-Image original foi lançado em agosto de 2025 como um modelo MMDiT de 20B conhecido pela renderização de texto, com o Qwen-Image-Edit como um modelo de edição separado. Ao longo do final de 2025, a linha se dividiu ainda mais: a atualização 2512 para realismo, o Edit-2511 para consistência de múltiplas pessoas e o Qwen-Image-Layered em dezembro para camadas transparentes. O Qwen-Image-2.0 em fevereiro de 2026 unificou a geração e edição em um único modelo de 7B com saída nativa de 2K.

A versão 2.1 mantém o tamanho e o design unificado do 2.0 e incorpora a transparência do modelo Layered, de modo que um único checkpoint agora cobre o que antes exigia três. Ele também ganha um novo caminho de inferência (mais sobre isso abaixo) e uma interface de edição construída em torno de máscaras e múltiplas referências. Em paralelo, a Alibaba mantém uma linha hospedada: Qwen Image 3.0 e 3.0 Pro lançados em julho de 2026 como modelos de API sem pesos publicados. Portanto, a nomenclatura é um fork, não uma sequência. O 2.1 é o modelo aberto que você baixa; o 3.0 é o modelo que você aluga.

O que há de novo na 2.1

Uma arquitetura mais leve e um caminho de edição mais rápido

O gerador visual possui 32 camadas DiT de Fluxo Único com 7B de parâmetros, emparelhado com o codificador Qwen3-VL de 8B e um VAE que suporta um canal alfa nativamente. A engenharia interessante está na atenção. Qwen a chama de granularidade mista: tokens de texto (o prefixo do sistema e sua instrução de edição) usam uma máscara causal em nível de token, enquanto a geração de imagem usa uma máscara em nível de chunk. Como as imagens de entrada e a instrução são estáticas entre os passos de denoising, o modelo calcula seu cache de chave-valor uma vez no primeiro passo e o reutiliza. O benefício declarado da Qwen é menor latência e memória ao editar com várias imagens de referência, que é exatamente a carga de trabalho que ficou mais pesada com o limite de 10 imagens.

O agendador é de flow matching com passos discretos de Euler, e o código de referência executa 40 passos por padrão.

Transparência nativa no mesmo modelo

Esta é a manchete. Você pede uma imagem transparente no prompt e o modelo retorna RGBA. A frase recomendada no README é literal: comece com “This is an RGBA image with transparency” (Esta é uma imagem RGBA com transparência) e diga que o fundo é transparente. A publicação de lançamento mostra objetos únicos, composições de múltiplos elementos e três casos de edição em entradas transparentes: mudança da expressão de um objeto mantendo o canal alfa, substituição de texto dentro de uma camada transparente e extração de um objeto de uma foto RGB comum como um recorte RGBA.

Para equipes de produto, isso substitui um pipeline de dois modelos (gerar, depois mascarar) por uma única chamada. Também remove os artefatos de halo que os removedores de fundo deixam ao redor de cabelos e vidros, porque o canal alfa é gerado, e não inferido posteriormente. Se as bordas se mantêm em 2K em seus próprios ativos é algo a ser testado, e não presumido; o guia da camada gratuita mostra onde executar esses testes sem uma GPU.

Edição com até 10 referências e controle real de região

Três recursos de edição se destacam nos exemplos de lançamento:

O mesmo caminho de edição lida com panoramas a partir de uma selfie, infográficos a partir de uma foto de produto e storyboards a partir de uma ficha de personagem de três vistas. Edições locais sequenciais podem ser encadeadas em curtas animações, o que a publicação demonstra com um clipe de capivara.

Tipografia e qualidade de retrato

A Qwen tem liderado a renderização de texto de código aberto desde o primeiro Qwen-Image, e o 2.1 a estende para estilo de fonte, layout e como o texto se posiciona na composição, em vez de apenas a ortografia. A iluminação de retrato e os detalhes finos também recebem um tratamento especial. A publicação de lançamento apoia isso com um gráfico Qwen-Image-Bench comparando modelos abertos e fechados; o gráfico é uma imagem e a publicação não apresenta números, então não citamos nenhum aqui.

A licença: pesos abertos, termos de pesquisa

O Qwen-Image original era Apache 2.0. O Qwen-Image-2.1 é lançado sob o Qwen Research License Agreement, e o texto da licença é curto e claro sobre o ponto que importa:

Os modelos complementares de reescrita de prompt são lançados sob os mesmos termos. Para um projeto de hobby, um artigo de pesquisa ou uma avaliação interna, isso está ok. Para um recurso SaaS, isso significa uma conversa com a Alibaba primeiro, ou usar a API hospedada 3.0, que vem com termos comerciais comuns e um preço por imagem.

Os dois modelos de reescrita de prompt

Junto com o gerador, a Qwen publicou Qwen-Image-2.1-PE-T2I e Qwen-Image-2.1-PE-I2I. O PE-T2I é um Qwen3.5-VL 9B ajustado que recebe uma breve solicitação em qualquer idioma e retorna JSON com um prompt detalhado em inglês e uma proporção de aspecto recomendada. O PE-I2I é a contraparte de edição [VERIFICAR]. Eles são opcionais, e é assim que o Space de demonstração obtém prompts longos e estruturados a partir de entradas de uma única linha. Se você está construindo uma API em torno do 2.1, este é o passo de “aprimoramento de prompt” que produtos como o ChatGPT Images fazem de forma invisível.

O que o lançamento não disse

Colocando-o por trás de uma API e testando-o

A maioria das equipes não chamará um pipeline de diffusers do código da aplicação. Elas o encapsularão em um serviço HTTP em uma caixa de GPU e farão chamadas para ele. Uma vez que é um endpoint, é uma API como qualquer outra, e o Apidog é onde você a projeta e testa: defina o esquema da solicitação (prompt, imagens de referência opcionais, proporção de aspecto, uma flag de transparência), envie chamadas reais, afirme que a resposta é um PNG com um canal alfa e transforme os casos bem-sucedidos em um conjunto de testes de regressão que você executa novamente após cada atualização do modelo. Você também pode simular o endpoint para que a equipe de frontend construa contra um contrato estável enquanto a GPU está ocupada. O guia de como usar detalha esse wrapper e os testes do Apidog passo a passo.

Baixe o Apidog para acompanhar.

FAQ

O Qwen-Image-2.1 é gratuito para uso comercial? Não, não sem uma licença comercial separada da Qwen. Os pesos são gratuitos para baixar e usar para fins de pesquisa e não comerciais. Consulte a seção de licença acima e o guia da camada gratuita para as formas sem custo de experimentá-lo.

Como o 2.1 difere do Qwen-Image-2.0? Mesmo tamanho de 7B e design unificado de geração mais edição. Novidades no 2.1: saída e edição RGBA nativas, até 10 imagens de referência, edições locais orientadas por máscaras e anotações, um caminho de atenção de granularidade mista com reutilização de cache KV para edição de múltiplas imagens mais rápida, e tipografia e detalhes de retratos aprimorados.

É o mesmo que Qwen Image 3.0? Não. O 3.0 e o 3.0 Pro são modelos de API hospedados lançados em julho de 2026 sem pesos abertos; o 2.1 é o modelo de pesos abertos. A comparação aborda as diferenças de preço e capacidade.

Qual hardware ele precisa? A Qwen não publicou os requisitos de VRAM. O código de referência carrega o pipeline em bfloat16 em um dispositivo CUDA e oferece offload de CPU; stacks de serviço da comunidade adicionam FP8. Espere uma GPU de data center ou de alto desempenho para consumidor para saída 2K em 40 passos.

Ele pode editar imagens transparentes, não apenas gerá-las? Sim. Os exemplos de lançamento mostram a mudança da expressão de um objeto e a substituição de texto dentro de uma camada transparente, mantendo o canal alfa, e a extração de um objeto RGBA de uma foto RGB.

Para onde ir em seguida

O Qwen-Image-2.1 é um poderoso modelo de edição de código aberto com um recurso que ninguém mais oferece em um único checkpoint, a transparência nativa, e uma restrição que decide se você pode usá-lo: a licença de pesquisa. Execute-o localmente com o guia de como usar, experimente-o sem uma GPU através das opções gratuitas e compare a API hospedada 3.0 antes de se comprometer. Qualquer que você escolha, coloque o endpoint em teste no Apidog para que uma troca de modelo nunca quebre seu produto silenciosamente.

botão

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs