ตอนนี้ Alibaba ได้ออกโมเดลรูปภาพ Qwen สองสายที่ไม่ใช้ลำดับเวอร์ชันร่วมกัน Qwen-Image-2.1 ซึ่งเปิดตัวเมื่อวันที่ 20 กันยายน 2026 เป็นโมเดลแบบโอเพนซอร์ส (เปิดเผยน้ำหนักโมเดล): มีพารามิเตอร์ 7B ในตัวสร้าง, ผลลัพธ์แบบโปร่งใสในตัว, การแก้ไขด้วยภาพอ้างอิงสูงสุด 10 ภาพ, สามารถดาวน์โหลดได้จาก Hugging Face Qwen Image 3.0 และ 3.0 Pro ซึ่งประกาศเมื่อวันที่ 22 กรกฎาคม และพร้อมใช้งานบน API ตั้งแต่วันที่ 4 สิงหาคม 2026 เป็นโมเดลที่โฮสต์ไว้พร้อมการคิดราคาต่อภาพและไม่มีน้ำหนักโมเดลที่เผยแพร่ ตัวเลขระบุว่า "3.0 ใหม่กว่า" แต่การมองอย่างตรงไปตรงมาคือโมเดลเหล่านี้ตอบโจทย์ที่แตกต่างกัน: คุณต้องการรันโมเดลเองหรือเช่าใช้?
หน้านี้จะเปรียบเทียบทั้งสองโมเดลในด้านใบอนุญาต ค่าใช้จ่าย ความสามารถ และการดำเนินงาน และปิดท้ายด้วยตารางตัดสินใจ สำหรับการสาธิตคุณสมบัติ 2.1 โปรดดูที่ What is Qwen-Image-2.1; สำหรับโค้ด โปรดดูที่ คู่มือวิธีการใช้งาน ไม่ว่าคุณจะเลือกตัวใด ทั้งสองตัวจะทำงานเป็นปลายทาง HTTP ที่แอปของคุณเรียกใช้ และ Apidog สามารถรองรับทั้งสองตัวไว้ภายใต้คอลเลกชันเดียว ทำให้การสลับเปลี่ยนทำได้เพียงแค่เปลี่ยนการตั้งค่า
เปรียบเทียบเคียงข้างกัน
| Qwen-Image-2.1 | Qwen Image 3.0 / 3.0 Pro | |
|---|---|---|
| เปิดตัว | 20 กันยายน 2026 | ประกาศ 22 กรกฎาคม 2026; API 4 สิงหาคม 2026 |
| การจัดจำหน่าย | น้ำหนักโมเดลแบบโอเพนซอร์ส (Hugging Face, ModelScope) | API แบบโฮสต์เท่านั้น; ไม่มีน้ำหนักโมเดลที่เผยแพร่ [ตรวจสอบ] |
| ใบอนุญาต / เงื่อนไข | Qwen Research License; การใช้งานเชิงพาณิชย์ต้องมีใบอนุญาตแยกต่างหาก | เงื่อนไขการให้บริการ API มาตรฐาน |
| ราคา | เวลาใช้งาน GPU ของคุณ | qwen-image-3.0: $0.03 ต่อภาพ (1K หรือ 2K) qwen-image-3.0-pro: $0.04 ที่ 1K, $0.075 ที่ 2K ภาพนำเข้า $0.003 ต่อภาพ [ตรวจสอบ] |
| ขนาดตัวสร้าง | 7B (32 Single-Stream DiT layers) + Qwen3-VL 8B encoder | ไม่เปิดเผย |
| ความละเอียดสูงสุด | 2048 x 2048 ค่าเริ่มต้น; สูงสุด 2752 x 1536 | 2048 x 2048 |
| เอาต์พุตโปร่งใส | การสร้างและแก้ไข RGBA ในตัว | ไม่ได้มีการโฆษณาไว้ |
| ภาพอ้างอิง | สูงสุด 10 ภาพ | รองรับภาพนำเข้า (คิดราคาต่อภาพ); ไม่ได้ระบุขีดจำกัด [ตรวจสอบ] |
| การแก้ไขภายใน | วงกลม, คำอธิบายประกอบที่วาด, มาสก์แยก | ไม่ได้มีการโฆษณาในเอกสารเปิดตัว |
| การแสดงผลข้อความ | การปรับปรุงการจัดเรียงตัวอักษร, สไตล์, และเค้าโครง | คุณสมบัติเด่น: ข้อความละเอียดประมาณ 10 px, 12 ภาษา (รายงานโดยผู้พัฒนาเอง) |
| เอาต์พุตต่อการเรียกใช้ | หนึ่งภาพ (คุณต้องวนซ้ำเอง) | สูงสุด 6 ภาพ |
| ความยาวพร้อมท์ | ไม่ได้ระบุ | ประมาณ 4.5K โทเค็นสำหรับรุ่น Pro (คำกล่าวอ้างอย่างเป็นทางการ) |
| การเขียนพร้อมท์ใหม่ | โมเดล PE-T2I / PE-I2I แยกต่างหากที่คุณต้องรันเอง | จัดการที่ฝั่งเซิร์ฟเวอร์ |
| สามารถทดลองได้ที่ | HF Space, Qwen Chat, ComfyUI | คอนโซล Model Studio, Qwen Chat |
แหล่งข้อมูลสำหรับคอลัมน์ 3.0 มาจากการประกาศของ Alibaba ในเดือนกรกฎาคม และเอกสาร QwenCloud ที่สรุปโดย LLM Stats; โปรดตรวจสอบตารางราคาใน Model Studio อีกครั้งก่อนตั้งงบประมาณ เนื่องจากราคาภาพแตกต่างกันไปตามภูมิภาค
ใบอนุญาตคือตัวกรองแรก
สำหรับทีมส่วนใหญ่ แถวนี้จะจบการเปรียบเทียบ ใบอนุญาต ของ 2.1 ระบุว่าคุณ "จะต้องไม่ใช้วัสดุเพื่อวัตถุประสงค์เชิงพาณิชย์ใด ๆ โดยไม่ได้รับใบอนุญาตเชิงพาณิชย์แยกต่างหาก" ซึ่งแตกต่างจากเงื่อนไข Apache 2.0 ที่ Qwen-Image รุ่นเดิมใช้ และหมายความว่าคุณสมบัติที่ผู้ใช้เห็นซึ่งสร้างขึ้นบน 2.1 จำเป็นต้องส่งอีเมลถึงทีมธุรกิจของ Qwen และมีการลงนามข้อตกลงก่อนเปิดตัว
Qwen Image 3.0 เป็น API แบบเสียเงินพร้อมเงื่อนไขเชิงพาณิชย์มาตรฐาน คุณจ่ายต่อภาพและสามารถนำไปใช้งานได้ทันที
ดังนั้น: สำหรับการวิจัย การประเมิน เครื่องมือภายใน หรือโครงการที่คุณยินดีเจรจาขอใบอนุญาต 2.1 ก็อยู่ในตัวเลือก หากเป็นคุณสมบัติผลิตภัณฑ์ที่จะเปิดตัวในไตรมาสนี้โดยไม่มีงบประมาณทางกฎหมาย 3.0 คือตัวเลือกเริ่มต้น
ค่าใช้จ่าย: ค่า GPU เทียบกับสามเซ็นต์ต่อภาพ
ระดับมาตรฐานของ 3.0 คือ $0.03 ต่อภาพไม่ว่าจะความละเอียดใด ดังนั้น 10,000 ภาพต่อเดือนจะเท่ากับ $300 บวกกับ $0.003 ต่อภาพนำเข้าสำหรับการแก้ไข รุ่น Pro มีราคาเป็นสองเท่าที่ 2K
การโฮสต์ 2.1 เองไม่มีราคาต่อภาพ แต่การคำนวณจะคุ้มค่าเมื่อใช้ปริมาณมากและมี GPU ที่ปกติแล้วคุณจะปล่อยทิ้งไว้โดยไม่ได้ใช้งาน Qwen ไม่ได้เผยแพร่ตัวเลขปริมาณงาน ดังนั้นคุณต้องวัดเอง: ที่ 40 ขั้นตอนและความละเอียด 2048 x 2048 บน GPU ระดับดาต้าเซ็นเตอร์ตัวเดียว ให้คำนวณจำนวนภาพต่อชั่วโมง หารด้วยอัตราค่าใช้จ่ายต่อชั่วโมง และเปรียบเทียบกับ $0.03 การแก้ไขด้วยภาพอ้างอิงจำนวนมากคือจุดที่การใช้ KV แคชซ้ำของ 2.1 ช่วยได้ เนื่องจากภาพอ้างอิงจะถูกเข้ารหัสครั้งเดียวต่อคำขอ แทนที่จะเป็นต่อขั้นตอน หาก GPU ของคุณถูกใช้งานร่วมกับเวิร์คโหลดอื่น ๆ โปรดจำไว้ว่าการสร้างภาพจะใช้ทรัพยากรมากในช่วงที่มีการใช้งานหนาแน่น
หลักการคร่าวๆ: หากใช้ภาพต่ำกว่าไม่กี่พันภาพต่อเดือน API จะถูกกว่าเมื่อนับรวมเวลาของวิศวกร หากใช้ภาพมากกว่าหลายหมื่นภาพต่อเดือนพร้อมโหลดที่สม่ำเสมอและมีข้อตกลงใบอนุญาต การโฮสต์เองจะดีกว่า ระหว่างนั้นขึ้นอยู่กับว่าคุณมี GPU ทำงานอยู่แล้วหรือไม่
ความสามารถ: ความโปร่งใสเทียบกับข้อความหนาแน่น
โมเดลทั้งสองถูกสร้างมาเพื่อวัตถุประสงค์ที่แตกต่างกัน
เลือก 2.1 เมื่อเอาต์พุตต้องการช่องอัลฟ่า สติกเกอร์, การตัดภาพผลิตภัณฑ์, ทรัพยากร UI, การจัดองค์ประกอบแบบเลเยอร์, การแยกวัตถุจากภาพถ่ายเป็น RGBA: 2.1 ทำได้โดยตรงในโมเดลเดียวกัน รวมถึงการแก้ไขเลเยอร์โปร่งใสโดยไม่สูญเสียความโปร่งใส เอกสารเปิดตัวของ 3.0 ไม่ได้กล่าวถึงเอาต์พุตอัลฟ่า การทำเช่นนั้นบน 3.0 หมายถึงขั้นตอนการลบพื้นหลังแยกต่างหากพร้อมสิ่งแปลกปลอมที่มักเกิดขึ้น
เลือก 2.1 เมื่อการแก้ไขคือภาระงานหลัก ภาพอ้างอิงสิบภาพ, การเลือกพื้นที่ด้วยวงกลม, การระบายสี, หรือมาสก์, และการทำงานที่ต้องการความละเอียดสูงสำหรับใบหน้าและผลิตภัณฑ์เป็นจุดศูนย์กลางของการเปิดตัว 2.1 โพสต์เปิดตัวแสดงภาพหมู่จากภาพบุคคลหกภาพ, ชุดเสื้อผ้าจากภาพผลิตภัณฑ์ห้าภาพ, และห้องที่ตกแต่งจากภาพเฟอร์นิเจอร์สิบภาพ
เลือก 3.0 เมื่อภาพส่วนใหญ่เป็นข้อความ แดชบอร์ด, ไวร์เฟรม, โปสเตอร์, และเค้าโครงที่คล้ายสไลด์ที่มีข้อความละเอียดในหลายภาษาคือสิ่งที่ 3.0 ได้รับการปรับแต่งมาเพื่อ 2.1 ก็มีการปรับปรุงการจัดเรียงตัวอักษรด้วย แต่ "ข้อความ 10 px ใน 12 ภาษา" ของ 3.0 เป็นคำกล่าวอ้างที่เผยแพร่ที่แข็งแกร่งกว่า และงบประมาณพร้อมท์ 4.5K โทเค็นในรุ่น Pro เหมาะสำหรับข้อกำหนดเค้าโครงที่ยาว
เลือก 3.0 เมื่อคุณต้องการตัวเลือกหลายภาพต่อการเรียกใช้หนึ่งครั้ง เอาต์พุตสูงสุดหกภาพต่อคำขอเป็นคุณสมบัติการทำงานที่ 2.1 ไม่มี; สำหรับ 2.1 คุณต้องวนซ้ำบน seed
ไม่มีหน้าผู้ขายรายใดแสดงตารางเกณฑ์มาตรฐานพร้อมตัวเลข โพสต์ 2.1 แสดงแผนภูมิ Qwen-Image-Bench; คำกล่าวอ้างของ 3.0 รายงานโดยผู้พัฒนาเอง ถือว่าทั้งสองเป็นแนวทางสำหรับการประเมินของคุณเอง ซึ่งส่วน Apidog ทำให้สามารถทำซ้ำได้
การดำเนินงาน: สิ่งที่คุณเป็นเจ้าของ
การโฮสต์ 2.1 เองหมายถึงการเป็นเจ้าของ: การดาวน์โหลดและอัปเดตโมเดล, GPU ที่มีหน่วยความจำเพียงพอ (Qwen ไม่ได้เผยแพร่ตาราง VRAM; ไฟล์ README มีข้อเสนอการออฟโหลด CPU และชี้ไปที่ vLLM-Omni พร้อม FP8, SGLang และ LightX2V), ตัวหุ้มสำหรับให้บริการ, การจัดคิวภายใต้ภาระงานสูงสุด, และโมเดลการเขียนพร้อมท์ใหม่เสริมสองตัว หากคุณต้องการให้พร้อมท์บรรทัดเดียวทำงานได้ ในทางกลับกัน คุณจะได้ข้อมูลที่อยู่ใกล้เคียง, ไม่มีข้อจำกัดอัตราการเรียกใช้ยกเว้นของคุณเอง, และเวอร์ชันโมเดลที่คงที่ซึ่งไม่มีใครเปลี่ยนแปลงได้
การใช้ 3.0 หมายถึงการเป็นเจ้าของ: บัญชี Alibaba Cloud และการเลือกภูมิภาค, คีย์ API, การจัดการข้อจำกัดอัตราการเรียกใช้, และความเสี่ยงที่โมเดลที่โฮสต์ไว้อาจเปลี่ยนแปลงพฤติกรรมระหว่างการทดสอบและการผลิตของคุณ ในทางกลับกัน คุณจะได้โครงสร้างพื้นฐานเป็นศูนย์และใบแจ้งหนี้ต่อภาพ
คู่มือ Nano Banana 2 API และ gpt-image-2.5 API อธิบายข้อแลกเปลี่ยนของการโฮสต์แบบเดียวกันสำหรับ Google และ OpenAI หากคุณกำลังเปรียบเทียบข้ามผู้ขายแทนที่จะเปรียบเทียบภายใน Qwen
ตารางตัดสินใจ
| สถานการณ์ของคุณ | เลือก |
|---|---|
| เปิดตัวคุณสมบัติเชิงพาณิชย์ในไตรมาสนี้ ไม่มีงบประมาณทางกฎหมาย | 3.0 |
| ต้องการ PNGs แบบโปร่งใส หรือการแก้ไข RGBA | 2.1 (พร้อมใบอนุญาตหากใช้งานเชิงพาณิชย์) |
| การแก้ไขด้วยภาพอ้างอิงจำนวนมาก | 2.1 |
| เค้าโครงที่มีข้อความเป็นหลักในหลายภาษา | 3.0 |
| การวิจัย, การประเมิน, เครื่องมือภายใน | 2.1 |
| ต่ำกว่าไม่กี่พันภาพต่อเดือน | 3.0 |
| หลายหมื่นภาพต่อเดือน, GPU ทำงานอยู่แล้ว, ใบอนุญาตได้รับการลงนาม | 2.1 |
| ข้อมูลไม่สามารถออกจากเครือข่ายของคุณได้ | 2.1 |
| ต้องการตัวเลือกหกภาพต่อคำขอหนึ่งครั้ง | 3.0 |
รันทั้งสองโมเดลภายใต้คอลเลกชันเดียว
คำตอบที่เป็นประโยชน์สำหรับหลายทีมคือทั้งสองอย่าง: 2.1 สำหรับไปป์ไลน์สินทรัพย์โปร่งใสและเครื่องมือภายใน, 3.0 สำหรับเค้าโครงข้อความที่ผู้ใช้เห็น ซึ่งจะทำงานได้อย่างราบรื่นหากทั้งสองอยู่ภายใต้สัญญาเดียว
ใน Apidog ให้กำหนดปลายทาง POST /v1/images เพียงครั้งเดียว พร้อมด้วยฟิลด์ prompt, aspect, transparent, seed, และฟิลด์ไฟล์ references จากนั้นตั้งค่าสภาพแวดล้อมสองแบบ: base_url ชี้ไปที่ wrapper 2.1 ของคุณ (คู่มือวิธีการใช้งาน มีเวอร์ชัน FastAPI 40 บรรทัด) และตัวที่สองชี้ไปที่อะแดปเตอร์สำหรับปลายทาง 3.0 ของ Model Studio จากนั้น:
- ส่งชุดพร้อมท์เดียวกันไปยังทั้งสองพร้อมด้วย seed ที่กำหนดและบันทึกการตอบกลับเป็นกรณีทดสอบ
- ตรวจสอบความแตกต่าง:
Content-Type, ขนาดการตอบกลับขั้นต่ำ, และสำหรับ 2.1 คือส่วนหัวX-Image-Mode: RGBAเมื่อร้องขอความโปร่งใส - บันทึกเวลาตอบกลับต่อคำขอ; Apidog จะแสดงผลทุกครั้งที่รัน ซึ่งเป็นตัวเลขปริมาณงานที่ Qwen ไม่ได้เผยแพร่
- รันสถานการณ์จำลองรายสัปดาห์ เมื่อพฤติกรรมของโมเดล 3.0 ที่โฮสต์ไว้เปลี่ยนไป หรือคุณเปลี่ยน 2.1 เป็นเวอร์ชัน quantized ความแตกต่างจะปรากฏในรายงาน ไม่ใช่ในตั๋วสนับสนุน
- Mock ปลายทางเพื่อให้ frontend สร้างขึ้นตามสัญญาในขณะที่การเลือกโมเดลยังคงเปิดกว้าง
ดาวน์โหลด Apidog และนำเข้าปลายทางเพื่อเริ่มเปรียบเทียบ
คำถามที่พบบ่อย
Qwen Image 3.0 เป็นโอเพนซอร์สหรือไม่? ไม่มีน้ำหนักโมเดลสาธารณะถูกปล่อยออกมาสำหรับ 3.0 หรือ 3.0 Pro; เป็นโมเดล API แบบโฮสต์ [ตรวจสอบ] Qwen-Image-2.1 เป็นเวอร์ชันที่เปิดเผยน้ำหนักโมเดล
ฉันสามารถใช้ Qwen-Image-2.1 ในเชิงพาณิชย์ได้หรือไม่? เฉพาะเมื่อมีใบอนุญาตเชิงพาณิชย์แยกต่างหากจาก Qwen ใบอนุญาต Qwen Research License เริ่มต้นไม่รวมการใช้งานเชิงพาณิชย์
อันไหนถูกกว่ากัน? ที่ปริมาณน้อย, 3.0 ราคา $0.03 ต่อภาพ ที่ปริมาณมากและสม่ำเสมอในฮาร์ดแวร์ที่คุณใช้งานอยู่แล้ว, 2.1, หลังจากที่คุณได้รับใบอนุญาตและวัดปริมาณงานของคุณเอง
3.0 สร้างภาพโปร่งใสได้หรือไม่? ไม่ได้มีการโฆษณาเอาไว้ การสร้างเอาต์พุต RGBA โดยตรงเป็นคุณสมบัติของ 2.1; ดู What is Qwen-Image-2.1
ฉันสามารถทดลองใช้ตัวใดตัวหนึ่งได้ฟรีหรือไม่? 2.1 มี Hugging Face Space และการเข้าถึง Qwen Chat; คู่มือการใช้งานฟรี มีตัวเลือกต่างๆ ระบุไว้ 3.0 มีให้ใช้งานใน Qwen Chat และผ่านโควต้าทดลองใช้ของ Model Studio ซึ่งแตกต่างกันไปในแต่ละภูมิภาค
จะไปที่ไหนต่อ
2.1 และ 3.0 เป็นการแยกสาย (fork) ไม่ใช่เส้นทางการอัปเกรด ใบอนุญาตจะตัดสินคำถามแรก, ภาระงานจะตัดสินคำถามที่สอง, และปริมาณจะตัดสินคำถามที่สาม ไม่ว่าคุณจะเลือกตัวใดก็ตาม ให้วางไว้หลังสัญญาที่คุณทดสอบ: คู่มือวิธีการใช้งาน จะสร้างฝั่ง 2.1 และคอลเลกชัน Apidog เดียวกันสามารถใช้กับฝั่ง 3.0 ได้ในวันที่คุณต้องการ
