Qwen-Image-2.1 là gì? Mô hình hình ảnh mã nguồn mở 7B với khả năng trong suốt gốc

Qwen-Image-2.1 giải thích: Phát hành mã nguồn mở vào ngày 20 tháng 9, khả năng tạo và chỉnh sửa thống nhất 7B, đầu ra RGBA gốc, 10 hình ảnh tham chiếu và giấy phép nghiên cứu giới hạn sử dụng thương mại.

Ashley Innocent

Ashley Innocent

21 tháng 9 2026

Qwen-Image-2.1 là gì? Mô hình hình ảnh mã nguồn mở 7B với khả năng trong suốt gốc

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Đội ngũ Qwen của Alibaba đã phát hành mã nguồn mở Qwen-Image-2.1 vào ngày 20 tháng 9 năm 2026. Đây là một mô hình thực hiện việc tạo ảnh từ văn bản và chỉnh sửa ảnh, với 7 tỷ tham số trong thành phần tạo hình ảnh của nó, và nó có thể xuất trực tiếp các tệp PNG trong suốt từ một lời nhắc thay vì giả lập chúng bằng cách loại bỏ nền. Bài đăng ra mắt liệt kê bốn thay đổi: kiến trúc nhẹ hơn, nhanh hơn, hỗ trợ trong suốt tự nhiên, chỉnh sửa với tối đa 10 ảnh tham chiếu, và cải thiện chi tiết kiểu chữ cũng như chân dung. Trọng số có sẵn trên Hugging Face và ModelScope, và mã nguồn có trên GitHub.

Một dòng trong thẻ mô hình quan trọng hơn bất kỳ tính năng nào khác: giấy phép là Giấy phép Nghiên cứu Qwen, không phải Apache 2.0. Việc sử dụng thương mại cần có một thỏa thuận riêng. Nếu bạn đang đánh giá 2.1 cho một sản phẩm, hãy đọc phần đó trước khi xem các điểm chuẩn. Nếu bạn muốn chạy nó, hướng dẫn cách sử dụng Qwen-Image-2.1 có mã diffusers và một trình bao bọc HTTP mà bạn có thể thử nghiệm trong Apidog. Nếu bạn đang cân nhắc nó so với API Qwen Image 3.0 được lưu trữ, so sánh 2.1 và 3.0 là trang quyết định.

Qwen-Image-2.1: Tổng quan

Mục Chi tiết (bài đăng ra mắt, thẻ mô hình, README của GitHub)
Ngày phát hành 20 tháng 9, 2026
Chức năng Tạo ảnh từ văn bản và chỉnh sửa ảnh trong một mô hình duy nhất, bao gồm xuất ảnh trong suốt (RGBA)
Bộ tạo hình ảnh 32 lớp DiT Dòng Đơn (Single-Stream DiT), 7B tham số
Bộ mã hóa văn bản Qwen3-VL 8B
VAE Bộ tự mã hóa RGBA 64 kênh, nén không gian 16x
Đầu ra mặc định 2048 x 2048; bảy tỷ lệ khung hình lên tới 2752 x 1536
Ảnh tham chiếu Lên tới 10 ảnh cho mỗi lần chỉnh sửa
Chỉnh sửa cục bộ Các vòng tròn, chú thích vẽ tay, hoặc một ảnh mặt nạ riêng biệt
Các mô hình đồng hành Mô hình viết lại lời nhắc Qwen-Image-2.1-PE-T2I và PE-I2I (các tinh chỉnh của Qwen3.5-VL 9B)
Giấy phép Thỏa thuận Giấy phép Nghiên cứu Qwen; sử dụng thương mại cần giấy phép riêng
Thử nghiệm Hugging Face Space, Qwen Chat, ComfyUI (hỗ trợ gốc từ ngày ra mắt)

Vị trí của nó trong dòng sản phẩm Qwen-Image

Qwen-Image gốc được ra mắt vào tháng 8 năm 2025 dưới dạng mô hình MMDiT 20B nổi tiếng về khả năng kết xuất văn bản, với Qwen-Image-Edit là một mô hình chỉnh sửa riêng biệt. Đến cuối năm 2025, dòng sản phẩm này tiếp tục phân tách: bản làm mới 2512 cho chủ nghĩa hiện thực, Edit-2511 cho tính nhất quán đa người, và Qwen-Image-Layered vào tháng 12 cho các lớp trong suốt. Qwen-Image-2.0 vào tháng 2 năm 2026 đã hợp nhất việc tạo và chỉnh sửa thành một mô hình 7B duy nhất với đầu ra 2K tự nhiên.

Phiên bản 2.1 giữ nguyên kích thước và thiết kế hợp nhất của 2.0 và tích hợp khả năng trong suốt của mô hình Layered, vì vậy một checkpoint giờ đây bao gồm những gì trước đây cần đến ba. Nó cũng có một đường dẫn suy luận mới (chi tiết hơn bên dưới) và giao diện chỉnh sửa được xây dựng xung quanh mặt nạ và nhiều tham chiếu. Song song đó, Alibaba vận hành một dòng sản phẩm được lưu trữ: Qwen Image 3.0 và 3.0 Pro ra mắt vào tháng 7 năm 2026 dưới dạng các mô hình API không có trọng số công bố. Vì vậy, việc đặt tên là một nhánh, không phải một chuỗi. 2.1 là mô hình mã nguồn mở bạn tải xuống; 3.0 là mô hình bạn thuê.

Có gì mới trong 2.1

Kiến trúc nhẹ hơn và đường dẫn chỉnh sửa nhanh hơn

Bộ tạo hình ảnh là 32 lớp DiT dòng đơn với 7 tỷ tham số, kết hợp với bộ mã hóa Qwen3-VL 8B và một VAE mang kênh alpha nguyên bản. Kỹ thuật thú vị nằm ở cơ chế attention. Qwen gọi đó là đa hạt (mixed-granularity): các token văn bản (tiền tố hệ thống và hướng dẫn chỉnh sửa của bạn) sử dụng mặt nạ nhân quả cấp token, trong khi việc tạo hình ảnh sử dụng mặt nạ cấp khối. Vì hình ảnh đầu vào và hướng dẫn tĩnh trong các bước khử nhiễu, mô hình tính toán bộ nhớ cache key-value của chúng một lần ở bước đầu tiên và tái sử dụng nó. Lợi ích mà Qwen đưa ra là độ trễ và bộ nhớ thấp hơn khi chỉnh sửa với nhiều hình ảnh tham chiếu, đây chính xác là khối lượng công việc trở nên nặng hơn với giới hạn 10 hình ảnh.

Trình lập lịch trình là khớp dòng (flow matching) với các bước rời rạc Euler, và mã tham chiếu chạy 40 bước theo mặc định.

Tính năng trong suốt tự nhiên trong cùng một mô hình

Đây là tiêu đề chính. Bạn yêu cầu một hình ảnh trong suốt trong lời nhắc và mô hình trả về RGBA. Cách diễn đạt được khuyến nghị từ README là nghĩa đen: bắt đầu với "Đây là một hình ảnh RGBA có độ trong suốt" và nói rằng nền là trong suốt. Bài đăng ra mắt cho thấy các đối tượng đơn lẻ, các bố cục đa yếu tố và ba trường hợp chỉnh sửa trên đầu vào trong suốt: thay đổi biểu cảm của đối tượng trong khi vẫn giữ kênh alpha, thay thế văn bản bên trong một lớp trong suốt và trích xuất một đối tượng từ một bức ảnh RGB thông thường dưới dạng ảnh cắt RGBA.

Đối với các nhóm sản phẩm, điều này thay thế một quy trình hai mô hình (tạo, sau đó tạo mặt nạ) bằng một lần gọi duy nhất. Nó cũng loại bỏ các hiện tượng quầng sáng mà các công cụ xóa nền để lại xung quanh tóc và kính, vì kênh alpha được tạo ra chứ không phải suy luận sau đó. Việc các cạnh có giữ được ở độ phân giải 2K trên tài sản của riêng bạn hay không là điều cần kiểm tra chứ không nên giả định; hướng dẫn cấp miễn phí cho biết nơi để chạy các thử nghiệm đó mà không cần GPU.

Chỉnh sửa với tối đa 10 hình ảnh tham chiếu và kiểm soát vùng thực tế

Ba tính năng chỉnh sửa nổi bật trong các ví dụ ra mắt:

Cùng một đường dẫn chỉnh sửa xử lý ảnh toàn cảnh từ một bức ảnh tự sướng, đồ họa thông tin từ một bức ảnh sản phẩm, và bảng phân cảnh từ một bảng nhân vật ba góc nhìn. Các chỉnh sửa cục bộ tuần tự có thể được xâu chuỗi thành các hoạt ảnh ngắn, được bài đăng minh họa bằng một clip capybara.

Chất lượng chữ in và chân dung

Qwen đã dẫn đầu về kết xuất văn bản mã nguồn mở kể từ Qwen-Image đầu tiên, và 2.1 mở rộng khả năng này sang kiểu chữ, bố cục và cách văn bản nằm trong bố cục thay vì chỉ chính tả. Ánh sáng chân dung và các chi tiết nhỏ cũng được cải thiện. Bài đăng ra mắt sao lưu điều này bằng biểu đồ Qwen-Image-Bench so sánh với các mô hình mã nguồn mở và độc quyền; biểu đồ là một hình ảnh và bài đăng không in số liệu, vì vậy chúng tôi không trích dẫn bất kỳ số liệu nào ở đây.

Giấy phép: trọng số mở, điều khoản nghiên cứu

Qwen-Image gốc là Apache 2.0. Qwen-Image-2.1 được phát hành theo Thỏa thuận Giấy phép Nghiên cứu Qwen, và văn bản giấy phép ngắn gọn và rõ ràng về điểm quan trọng:

Các mô hình đồng hành viết lại lời nhắc cũng tuân thủ các điều khoản tương tự. Đối với một dự án sở thích, một bài nghiên cứu, hoặc một đánh giá nội bộ, điều này là ổn. Đối với một tính năng SaaS, điều này có nghĩa là phải trao đổi với Alibaba trước, hoặc sử dụng API 3.0 được lưu trữ, đi kèm với các điều khoản thương mại thông thường và giá mỗi hình ảnh.

Hai mô hình viết lại lời nhắc

Cùng với bộ tạo, Qwen đã xuất bản Qwen-Image-2.1-PE-T2I và Qwen-Image-2.1-PE-I2I. PE-T2I là một Qwen3.5-VL 9B đã được tinh chỉnh, nhận một yêu cầu ngắn bằng bất kỳ ngôn ngữ nào và trả về JSON với một lời nhắc tiếng Anh chi tiết và tỷ lệ khung hình được đề xuất. PE-I2I là phiên bản chỉnh sửa tương ứng [XÁC MINH]. Chúng là tùy chọn, và chúng là cách mà Space demo nhận được các lời nhắc dài, có cấu trúc từ các đầu vào một dòng. Nếu bạn đang xây dựng một API xung quanh 2.1, đây là bước "cải thiện lời nhắc" mà các sản phẩm như ChatGPT Images thực hiện một cách vô hình.

Những điều bản ra mắt không đề cập

Đặt nó sau API và thử nghiệm nó

Hầu hết các nhóm sẽ không gọi một pipeline diffusers từ mã ứng dụng. Họ sẽ đóng gói nó trong một dịch vụ HTTP trên một máy chủ GPU và gọi dịch vụ đó. Một khi nó là một điểm cuối, nó là một API giống như bất kỳ API nào khác, và Apidog là nơi bạn thiết kế và thử nghiệm nó: xác định lược đồ yêu cầu (lời nhắc, hình ảnh tham chiếu tùy chọn, tỷ lệ khung hình, cờ trong suốt), gửi các lệnh gọi thực tế, khẳng định rằng phản hồi là một tệp PNG có kênh alpha, và biến các trường hợp tốt thành một bộ kiểm thử hồi quy mà bạn chạy lại sau mỗi lần cập nhật mô hình. Bạn cũng có thể tạo mock endpoint để nhóm giao diện người dùng xây dựng dựa trên một hợp đồng ổn định trong khi GPU bận rộn. Hướng dẫn cách sử dụng sẽ hướng dẫn chi tiết về trình bao bọc đó và các bài kiểm thử Apidog từng bước.

Tải Apidog để làm theo.

Câu hỏi thường gặp

Qwen-Image-2.1 có được sử dụng miễn phí cho mục đích thương mại không? Không, nếu không có giấy phép thương mại riêng biệt từ Qwen. Trọng số được tải xuống và sử dụng miễn phí cho mục đích nghiên cứu và phi thương mại. Xem phần giấy phép ở trên và hướng dẫn cấp miễn phí để biết các cách thử nghiệm không tốn phí.

2.1 khác gì so với Qwen-Image-2.0? Cùng kích thước 7B và thiết kế hợp nhất tạo ảnh-cộng-chỉnh sửa. Mới trong 2.1: đầu ra RGBA tự nhiên và chỉnh sửa, lên đến 10 hình ảnh tham chiếu, chỉnh sửa cục bộ dựa trên mặt nạ và chú thích, đường dẫn attention đa cấp với việc tái sử dụng bộ nhớ cache KV để chỉnh sửa nhiều hình ảnh nhanh hơn, và cải thiện chi tiết kiểu chữ và chân dung.

Nó có giống Qwen Image 3.0 không? Không. 3.0 và 3.0 Pro là các mô hình API được lưu trữ ra mắt vào tháng 7 năm 2026 mà không có trọng số công khai; 2.1 là mô hình có trọng số công khai. So sánh bao gồm sự khác biệt về giá cả và khả năng.

Nó cần phần cứng gì? Qwen chưa công bố yêu cầu về VRAM. Mã tham chiếu tải pipeline trong bfloat16 trên một thiết bị CUDA và cung cấp khả năng tắt CPU; các stack phục vụ của cộng đồng bổ sung FP8. Hãy mong đợi một trung tâm dữ liệu hoặc GPU cao cấp dành cho người tiêu dùng để có đầu ra 2K ở 40 bước.

Nó có thể chỉnh sửa hình ảnh trong suốt, không chỉ tạo chúng không? Có. Các ví dụ ra mắt thay đổi biểu cảm của đối tượng và thay thế văn bản bên trong một lớp trong suốt trong khi vẫn giữ kênh alpha, và trích xuất một đối tượng RGBA từ một bức ảnh RGB.

Nơi để tiếp tục

Qwen-Image-2.1 là một mô hình chỉnh sửa mã nguồn mở mạnh mẽ với một tính năng mà không mô hình nào khác cung cấp trong một checkpoint duy nhất, đó là khả năng trong suốt tự nhiên, và một ràng buộc quyết định liệu bạn có thể sử dụng nó hay không, đó là giấy phép nghiên cứu. Chạy nó cục bộ với hướng dẫn cách sử dụng, thử nó mà không cần GPU thông qua các tùy chọn miễn phí, và so sánh API 3.0 được lưu trữ trước khi bạn cam kết. Dù bạn chọn cái nào, hãy đặt điểm cuối dưới thử nghiệm trong Apidog để việc thay đổi mô hình không bao giờ âm thầm phá vỡ sản phẩm của bạn.

Tải Apidog

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API