Mô Hình Qwen Mới Nhất: Đột Phá AI Đa Phương Thức?

Ashley Innocent

Ashley Innocent

23 tháng 9 2025

Mô Hình Qwen Mới Nhất: Đột Phá AI Đa Phương Thức?

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Qwen, sáng kiến mô hình nền tảng mở từ Alibaba, liên tục thúc đẩy ranh giới của trí tuệ nhân tạo thông qua các lần lặp và phát hành nhanh chóng. Các nhà phát triển và nhà nghiên cứu háo hức mong đợi mỗi bản cập nhật, vì các mô hình Qwen thường đặt ra các tiêu chuẩn mới về hiệu suất và tính linh hoạt. Gần đây, Qwen đã ra mắt ba mô hình sáng tạo: Qwen-Image-Edit-2509, Qwen3-TTS-Flash và Qwen3-Omni. Các bản phát hành này lần lượt nâng cao khả năng chỉnh sửa hình ảnh, tổng hợp văn bản thành giọng nói và xử lý đa phương thức.

💡
Vì các mô hình này cung cấp các API mạnh mẽ để tích hợp, các nhà phát triển được hưởng lợi từ các công cụ giúp đơn giản hóa việc kiểm thử và triển khai. Ví dụ, Apidog giúp hợp lý hóa các tương tác API, cho phép thử nghiệm liền mạch với các điểm cuối của Qwen. Tải xuống Apidog miễn phí để tối ưu hóa quy trình làm việc của bạn khi xây dựng ứng dụng xoay quanh các mô hình tiên tiến này.
nút

Hơn nữa, các mô hình này xuất hiện vào một thời điểm then chốt trong sự phát triển AI, nơi tích hợp đa phương thức trở nên thiết yếu cho các ứng dụng thực tế. Qwen-Image-Edit-2509 đáp ứng nhu cầu thao tác hình ảnh chính xác, trong khi Qwen3-TTS-Flash giải quyết các vấn đề độ trễ trong tạo giọng nói. Trong khi đó, Qwen3-Omni hợp nhất các đầu vào đa dạng vào một khuôn khổ gắn kết. Cùng nhau, chúng thể hiện cam kết của Qwen đối với AI hiệu suất cao, dễ tiếp cận. Tuy nhiên, để hiểu được nền tảng kỹ thuật của chúng đòi hỏi phải xem xét kỹ lưỡng hơn. Bài viết này phân tích từng mô hình, làm nổi bật các tính năng, kiến trúc, điểm chuẩn và tác động tiềm năng.

Qwen-Image-Edit-2509: Nâng cao độ chính xác chỉnh sửa hình ảnh

Qwen-Image-Edit-2509 đại diện cho một bước tiến đáng kể trong thao tác hình ảnh được điều khiển bởi AI. Các kỹ sư tại Qwen đã xây dựng lại mô hình này để phục vụ các nhà sáng tạo, nhà thiết kế và nhà phát triển, những người yêu cầu kiểm soát chi tiết nội dung hình ảnh. Không giống như các phiên bản trước, phiên bản này hỗ trợ chỉnh sửa nhiều hình ảnh, cho phép người dùng kết hợp các yếu tố như một người với một sản phẩm hoặc một cảnh một cách dễ dàng. Do đó, nó loại bỏ các hiện vật phổ biến như các pha trộn không khớp, tạo ra các đầu ra mạch lạc.

Mô hình này nổi bật về tính nhất quán của hình ảnh đơn. Nó bảo toàn nhận dạng khuôn mặt trên các tư thế, kiểu dáng và bộ lọc, điều này chứng tỏ vô giá cho các ứng dụng trong quảng cáo và cá nhân hóa. Đối với hình ảnh sản phẩm, Qwen-Image-Edit-2509 duy trì tính toàn vẹn của đối tượng, đảm bảo rằng các chỉnh sửa không làm biến dạng các thuộc tính chính. Ngoài ra, nó xử lý các yếu tố văn bản một cách toàn diện, cho phép sửa đổi nội dung, phông chữ, màu sắc và thậm chí cả kết cấu. Tính linh hoạt này bắt nguồn từ các cơ chế ControlNet tích hợp, kết hợp bản đồ độ sâu, phát hiện cạnh và các điểm chính để hướng dẫn chính xác.

Về mặt kỹ thuật, Qwen-Image-Edit-2509 được xây dựng dựa trên kiến trúc Qwen-Image cơ bản nhưng kết hợp các kỹ thuật huấn luyện tiên tiến. Các nhà phát triển đã huấn luyện nó bằng cách sử dụng các phương pháp nối hình ảnh để tạo điều kiện cho đầu vào đa hình ảnh. Ví dụ, việc kết hợp "người + người" hoặc "người + cảnh" tận dụng các luồng dữ liệu nối tiếp, nâng cao khả năng của mô hình trong việc hợp nhất các hình ảnh khác nhau. Hơn nữa, kiến trúc tích hợp các quy trình dựa trên khuếch tán, trong đó nhiễu được loại bỏ dần dần để tạo ra các hình ảnh tinh chỉnh. Phương pháp này, phổ biến trong các biến thể khuếch tán ổn định, cho phép tạo ra hình ảnh có điều kiện dựa trên lời nhắc của người dùng.

Về mặt điểm chuẩn, Qwen-Image-Edit-2509 thể hiện hiệu suất vượt trội trong các chỉ số nhất quán. Các đánh giá nội bộ cho thấy nó vượt trội hơn các đối thủ cạnh tranh trong việc bảo toàn khuôn mặt, với điểm tương đồng vượt quá 95% trên các chỉnh sửa đa dạng. Các điểm chuẩn về tính nhất quán của sản phẩm cho thấy sự biến dạng tối thiểu, làm cho nó trở nên lý tưởng cho thương mại điện tử. Tuy nhiên, dữ liệu định lượng từ các nguồn bên ngoài vẫn còn hạn chế do nó mới được phát hành gần đây. Tuy nhiên, các bản demo của người dùng trên các nền tảng như Hugging Face làm nổi bật ưu thế của nó so với các mô hình như Stable Diffusion XL trong việc pha trộn nhiều yếu tố.

Các ứng dụng của Qwen-Image-Edit-2509 rất phong phú. Các nhà tiếp thị sử dụng nó để tạo quảng cáo tùy chỉnh bằng cách chỉnh sửa vị trí sản phẩm một cách liền mạch. Các nhà thiết kế sử dụng nó để tạo mẫu nhanh, thay đổi cảnh mà không cần chỉnh sửa thủ công. Hơn nữa, trong trò chơi, nó tạo điều kiện tạo tài sản động. Một ví dụ minh họa liên quan đến việc thay đổi trang phục của một người: một hình ảnh đầu vào của một người phụ nữ trong trang phục thường ngày, kết hợp với một tham chiếu váy đen, tạo ra một đầu ra trong đó chiếc váy vừa vặn tự nhiên, bảo toàn tư thế và ánh sáng. Khả năng này, như được thể hiện trong các bản demo trực quan, nhấn mạnh tính hữu ích thực tế của nó.

Chuyển sang triển khai, các nhà phát triển truy cập Qwen-Image-Edit-2509 thông qua kho lưu trữ GitHubkhông gian Hugging Face. Việc cài đặt thường bao gồm sao chép kho lưu trữ và thiết lập các phụ thuộc như PyTorch. Một đoạn mã sử dụng cơ bản có thể trông như sau:

import torch
from qwen_image_edit import QwenImageEdit

model = QwenImageEdit.from_pretrained("Qwen/Qwen-Image-Edit-2509")
input_image = load_image("person.jpg")
reference_image = load_image("dress.jpg")
output = model.edit_multi(input_image, reference_image, prompt="Apply the black dress to the person")
output.save("edited.jpg")

Mã như vậy cho phép lặp lại nhanh chóng. Tuy nhiên, người dùng phải xem xét các yêu cầu tính toán, vì suy luận đòi hỏi tăng tốc GPU để đạt tốc độ tối ưu.

Mặc dù có những điểm mạnh, Qwen-Image-Edit-2509 vẫn đối mặt với những thách thức. Các chỉnh sửa độ phân giải cao có thể tiêu tốn bộ nhớ đáng kể, và các lời nhắc phức tạp đôi khi dẫn đến sự không nhất quán. Tuy nhiên, những đóng góp liên tục của cộng đồng thông qua các kênh mã nguồn mở giúp giảm thiểu những vấn đề này. Nhìn chung, mô hình này định nghĩa lại việc chỉnh sửa hình ảnh bằng cách kết hợp độ chính xác với khả năng tiếp cận.

Qwen3-TTS-Flash: Tăng tốc tổng hợp văn bản thành giọng nói

Qwen3-TTS-Flash nổi lên như một cường quốc trong công nghệ chuyển văn bản thành giọng nói (TTS), ưu tiên tốc độ và sự tự nhiên. Các kỹ sư của Qwen đã thiết kế nó để cung cấp giọng nói giống con người với độ trễ tối thiểu, giải quyết các nút thắt cổ chai trong các ứng dụng thời gian thực. Cụ thể, nó đạt được độ trễ gói đầu tiên chỉ 97ms trong môi trường đơn luồng, cho phép tương tác trôi chảy trong chatbot và trợ lý ảo.

Mô hình hỗ trợ khả năng đa ngôn ngữ và đa phương ngữ, bao gồm 10 ngôn ngữ với 17 giọng nói biểu cảm. Nó nổi trội về độ ổn định tiếng Trung và tiếng Anh, đạt hiệu suất hàng đầu (SOTA) trên các điểm chuẩn như bộ thử nghiệm Seed-TTS-Eval. Tại đây, nó vượt qua các mô hình như SeedTTS, MiniMax và GPT-4o-Audio-Preview về các chỉ số ổn định. Hơn nữa, trong các đánh giá đa ngôn ngữ trên bộ thử nghiệm MiniMax TTS, Qwen3-TTS-Flash ghi nhận Tỷ lệ Lỗi Từ (WER) thấp nhất cho tiếng Trung, tiếng Anh, tiếng Ý và tiếng Pháp.

Hỗ trợ phương ngữ là điểm khác biệt của Qwen3-TTS-Flash. Nó xử lý chín phương ngữ tiếng Trung, bao gồm tiếng Quảng Đông, tiếng Mân Nam, tiếng Tứ Xuyên, tiếng Bắc Kinh, tiếng Nam Kinh, tiếng Thiên Tân và tiếng Thiểm Tây. Tính năng này cho phép tạo ra giọng nói mang sắc thái văn hóa, điều cần thiết ở các thị trường đa dạng. Ngoài ra, mô hình tự động điều chỉnh tông giọng, dựa trên dữ liệu huấn luyện quy mô lớn để khớp với cảm xúc đầu vào. Xử lý văn bản mạnh mẽ còn tăng cường độ tin cậy, vì nó trích xuất thông tin chính từ các định dạng phức tạp như ngày tháng, số và từ viết tắt.

Về mặt kiến trúc, Qwen3-TTS-Flash sử dụng khung mã hóa-giải mã dựa trên transformer, được tối ưu hóa cho suy luận độ trễ thấp. Nó sử dụng các biểu diễn đa mã sách (multi-codebook) để mô hình hóa giọng nói phong phú hơn, cải thiện tính biểu cảm. Việc huấn luyện liên quan đến các tập dữ liệu khổng lồ bao gồm 119 ngôn ngữ cho văn bản và 19 ngôn ngữ cho hiểu lời nói, mặc dù đầu ra tập trung vào 10 ngôn ngữ. Thiết lập này cho phép tạo ra giọng nói đa ngôn ngữ, trong đó đầu vào bằng một ngôn ngữ tạo ra đầu ra bằng một ngôn ngữ khác một cách liền mạch.

Các điểm chuẩn minh họa khả năng của nó. Trong các bài kiểm tra độ ổn định, Qwen3-TTS-Flash đạt điểm cao hơn về độ tương đồng âm sắc và độ tự nhiên so với ElevenLabs và GPT-4o. Ví dụ:

Điểm chuẩn Qwen3-TTS-Flash MiniMax GPT-4o-Audio-Preview
Độ ổn định tiếng Trung SOTA Thấp hơn Thấp hơn
WER tiếng Anh Thấp nhất Cao hơn Cao hơn
Độ tương đồng âm sắc đa ngôn ngữ SOTA Thấp hơn Thấp hơn

Những kết quả này xuất phát từ các đánh giá nghiêm ngặt, định vị nó là một nhà lãnh đạo trong TTS.

Trong các bản demo, Qwen3-TTS-Flash tạo ra giọng nói biểu cảm, chẳng hạn như mô tả "honey lavender latte" với sự nhiệt tình hoặc xử lý các cuộc đối thoại bằng phương ngữ. Các bản ghi video cho thấy khả năng xử lý đầu vào ngôn ngữ hỗn hợp của nó, như "Hôm nay tôi thực sự rất vui. Tôi biết cô gái đó đến từ Trung Quốc," được thể hiện bằng giọng có trọng âm. Các ứng dụng bao gồm hệ thống phản hồi giọng nói tương tác (IVR), NPC trong trò chơi và tạo nội dung, nơi độ trễ thấp làm tăng gấp đôi hiệu quả.

Việc triển khai yêu cầu truy cập mô hình thông qua API hoặc các bản demo của Hugging Face. Một ví dụ gọi Python:

from qwen_tts import QwenTTSFlash

model = QwenTTSFlash.from_pretrained("Qwen/Qwen3-TTS-Flash")
audio = model.synthesize(text="Hello, world!", voice="expressive_english", dialect="sichuanese")
audio.save("output.wav")

Sự đơn giản này đẩy nhanh quá trình phát triển. Tuy nhiên, độ chính xác của phương ngữ có thể thay đổi với các đầu vào hiếm, đòi hỏi phải tinh chỉnh.

Qwen3-TTS-Flash biến đổi TTS bằng cách cân bằng tốc độ, chất lượng và sự đa dạng, làm cho nó trở nên không thể thiếu đối với các hệ thống AI hiện đại.

Giới thiệu Qwen3-Omni: Cường quốc đa phương thức hợp nhất

Giới thiệu Qwen3-Omni đánh dấu một cột mốc quan trọng trong AI đa phương thức, khi Qwen tích hợp văn bản, hình ảnh, âm thanh và video vào một mô hình đầu cuối duy nhất. Sự hợp nhất tự nhiên này tránh được sự đánh đổi giữa các phương thức, cho phép suy luận đa phương thức sâu hơn. Mô hình xử lý 119 ngôn ngữ cho văn bản, 19 ngôn ngữ cho đầu vào giọng nói và 10 ngôn ngữ cho đầu ra giọng nói, với độ trễ đáng kinh ngạc là 211ms cho các phản hồi.

Các tính năng chính bao gồm hiệu suất SOTA trên 22 trong số 36 điểm chuẩn âm thanh và âm thanh-hình ảnh, lời nhắc hệ thống có thể tùy chỉnh, gọi công cụ tích hợp và mô hình chú thích mã nguồn mở với tỷ lệ ảo giác thấp. Qwen đã mã nguồn mở các biến thể như Qwen3-Omni-30B-A3B-Instruct để tuân thủ hướng dẫn và Qwen3-Omni-30B-A3B-Thinking để tăng cường khả năng suy luận.

Kiến trúc được xây dựng dựa trên khung Thinker-Talker từ Qwen2.5-Omni, với các nâng cấp như thay thế bộ mã hóa âm thanh Whisper bằng Bộ chuyển đổi âm thanh (AuT) để biểu diễn tốt hơn. Xử lý giọng nói đa mã sách làm phong phú đầu ra giọng nói, trong khi ngữ cảnh mở rộng hỗ trợ hơn 30 phút âm thanh. Điều này cho phép suy luận đa phương thức hoàn chỉnh, trong đó đầu vào video cung cấp thông tin cho phản hồi âm thanh.

Các điểm chuẩn xác nhận sự thống trị của nó. Nó đạt SOTA tổng thể trên 32 điểm chuẩn, xuất sắc trong việc hiểu và tạo âm thanh. Ví dụ, trong các tác vụ âm thanh-hình ảnh, nó vượt trội hơn các mô hình như GPT-4o về độ trễ và độ chính xác. Bảng so sánh:

Các số liệu này làm nổi bật hiệu quả của nó trong các kịch bản thực tế.

Các ứng dụng bao gồm trò chuyện bằng giọng nói, phân tích video và các tác nhân đa phương thức. Ví dụ, nó phân tích một đoạn video và tạo ra các bản tóm tắt bằng lời nói, lý tưởng cho các công cụ hỗ trợ tiếp cận. Các bản demo trên Qwen Chat giới thiệu các tương tác bằng giọng nói và video, nơi người dùng truy vấn hình ảnh hoặc âm thanh bằng lời nói.

Từ GitHub, README mô tả nó có khả năng tạo giọng nói thời gian thực từ nhiều đầu vào khác nhau. Thiết lập bao gồm:

from qwen_omni import Qwen3Omni

model = Qwen3Omni.from_pretrained("Qwen/Qwen3-Omni-30B-A3B-Instruct")
response = model.process(inputs={"text": "Describe this", "image": "img.jpg", "audio": "clip.wav"})
print(response.text)
response.audio.save("reply.wav")

Cách tiếp cận mô-đun này tạo điều kiện thuận lợi cho việc tùy chỉnh. Các thách thức bao gồm nhu cầu tính toán cao cho xử lý video, nhưng các tối ưu hóa như lượng tử hóa sẽ giúp ích.

Giới thiệu Qwen3-Omni củng cố các phương thức, thúc đẩy các hệ sinh thái AI đổi mới.

Sự hiệp lực giữa các mô hình mới của Qwen và những hàm ý trong tương lai

Qwen-Image-Edit-2509, Qwen3-TTS-Flash và Qwen3-Omni bổ sung cho nhau, cho phép các quy trình làm việc đầu cuối. Ví dụ, chỉnh sửa hình ảnh bằng Qwen-Image-Edit-2509, mô tả nó qua Qwen3-Omni và phát âm đầu ra bằng Qwen3-TTS-Flash. Sự tích hợp này khuếch đại tiện ích trong việc tạo nội dung và tự động hóa.

Hơn nữa, bản chất mã nguồn mở của chúng mời gọi những cải tiến từ cộng đồng. Các nhà phát triển sử dụng Apidog có thể kiểm thử API một cách hiệu quả, đảm bảo tích hợp mạnh mẽ.

Tuy nhiên, các cân nhắc về đạo đức nảy sinh, chẳng hạn như việc lạm dụng trong deepfake. Qwen giảm thiểu điều này thông qua các biện pháp bảo vệ.

Tóm lại, các bản phát hành của Qwen định nghĩa lại bối cảnh AI. Bằng cách thúc đẩy các biên giới kỹ thuật, chúng trao quyền cho người dùng đạt được nhiều hơn. Khi việc áp dụng tăng lên, các mô hình này sẽ thúc đẩy làn sóng đổi mới tiếp theo.

nút

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API