เดือนกรกฎาคม 2026 กลายเป็นเดือนที่มีการแข่งขันกันระหว่างสองโมเดลแนวหน้าแบบเปิดน้ำหนัก (open-weight frontier models) และทั้งสองโมเดลก็มาจากประเทศจีน Moonshot AI ได้เปิดตัว Kimi K3 เมื่อวันที่ 16 กรกฎาคม สามวันต่อมา Alibaba ได้เปิดตัว Qwen 3.8-Max รุ่นพรีวิว จากนั้นจึงเปิดให้ใช้งานทั่วไปในช่วงต้นเดือนสิงหาคม ทั้งสองเป็นโมเดลแบบ mixture-of-experts ที่มีพารามิเตอร์ระดับล้านล้านตัว ทั้งสองโมเดลให้คำมั่น (หรือส่งมอบ) น้ำหนักแบบเปิด ทั้งสองสามารถเชื่อมต่อกับระบบควบคุมเอเจนต์สไตล์ Claude Code ได้ และทั้งสองก็ทำราคาได้ต่ำกว่าห้องแล็บแนวหน้าของสหรัฐอเมริกา
ความคล้ายคลึงภายนอกซ่อนความแตกต่างที่แท้จริงไว้: ในสิ่งที่คุณสามารถดาวน์โหลดได้ในวันนี้ ในสิ่งที่โมเดลสามารถมองเห็นได้ และในค่าใช้จ่ายของการใช้งานหนักตลอดหนึ่งเดือน การเปรียบเทียบนี้จะพิจารณาในทุกแง่มุมที่คุณสามารถตรวจสอบได้ ณ วันที่ 3 สิงหาคม 2026 สำหรับรายละเอียดสเปกฉบับเต็มของโมเดลเรือธงใหม่ของ Alibaba โปรดเริ่มต้นด้วย คำอธิบาย Qwen 3.8-Max ของเรา แล้วค่อยกลับมาที่นี่
ข้อควรทราบอย่างซื่อสัตย์ก่อนที่เราจะเริ่มต้น: ยังไม่มีการเปรียบเทียบประสิทธิภาพแบบตัวต่อตัวที่เป็นอิสระของสองโมเดลนี้ ตัวเลขทุกตัวในบทความนี้มาจากตารางของแต่ละผู้ให้บริการ และเราจะระบุว่าเป็นข้อมูลจากการทดสอบของใคร โปรดถือว่าส่วนของการเปรียบเทียบนี้เป็นเพียงตัวบ่งชี้ ไม่ใช่ข้อสรุปที่แน่นอน
ไทม์ไลน์: ใครเปิดตัวอะไร เมื่อไหร่
ลำดับการเปิดตัวมีความสำคัญมากกว่าปกติในที่นี้ เพราะ "น้ำหนักแบบเปิด" มีความหมายที่แตกต่างกันสำหรับแต่ละโมเดลในตอนนี้
Kimi K3 เปิดตัวเมื่อวันที่ 16 กรกฎาคม 2026 Moonshot สัญญาว่าจะเปิดน้ำหนัก ณ วันเปิดตัว และส่งมอบให้ในอีก 11 วันต่อมา: น้ำหนักได้ถูกเผยแพร่บน Hugging Face เมื่อวันที่ 27 กรกฎาคม ในรูปแบบ MXFP4 ขนาด 594 GB ณ วันนี้ คุณสามารถดาวน์โหลด K3, ควอนไทซ์เพิ่มเติม และเรียกใช้บนฮาร์ดแวร์ของคุณเองได้ นี่ไม่ใช่คำสัญญา แต่มันเกิดขึ้นแล้ว
Qwen 3.8-Max ได้รับการเปิดตัวพรีวิวเมื่อวันที่ 19 กรกฎาคม และเปิดให้ใช้งานทั่วไปบน Alibaba Cloud Model Studio ในช่วงต้นเดือนสิงหาคม ตาม โพสต์เปิดตัว Qwen อย่างเป็นทางการ น้ำหนักถูกสัญญาว่าจะเผยแพร่บน Hugging Face และ ModelScope "ในสัปดาห์หน้า" ซึ่งจะอยู่ประมาณวันที่ 10 สิงหาคม ณ วันที่ 3 สิงหาคม 2026 ยังไม่สามารถดาวน์โหลดได้ การที่ K3 มีช่องว่าง 11 วันระหว่างการเปิดตัวและน้ำหนักแสดงให้เห็นว่าเส้นทางนี้เป็นเรื่องปกติ แต่ในวันนี้มีเพียงโมเดลเดียวเท่านั้นที่เปิดใช้งานได้จริง
หากการโฮสต์ด้วยตนเองเป็นปัจจัยตัดสินของคุณ ข้อเท็จจริงเพียงข้อเดียวนี้อาจทำให้การเปรียบเทียบสิ้นสุดลงเร็วกว่ากำหนด
พารามิเตอร์: สองโมเดล MoE ระดับล้านล้านตัว หนึ่งตัวมีความกระชับกว่า
ทั้งสองโมเดลได้รับการออกแบบในลักษณะ mixture-of-experts แบบบางเบา (sparse) ซึ่งหมายความว่าจำนวนพารามิเตอร์หลักและต้นทุนการประมวลผลต่อโทเค็นเป็นตัวเลขที่แตกต่างกันมาก
| รายละเอียด | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| จำนวนพารามิเตอร์ทั้งหมด | 2.4 ล้านล้าน | 2.8 ล้านล้าน |
| พารามิเตอร์ที่ใช้งานต่อโทเค็น | 95 พันล้าน | 104 พันล้าน |
| อัตราส่วนการเปิดใช้งาน | ~4% | ~3.7% |
| สถาปัตยกรรมพื้นฐาน | พื้นฐาน Qwen 3.5, MoE | MoE |
| รูปแบบน้ำหนักแบบเปิด | สัญญาไว้ (ประมาณ 10 ส.ค.) | MXFP4, 594 GB บน Hugging Face |
Qwen 3.8-Max เป็นโมเดลที่มีขนาดเล็กกว่าในทั้งสองด้าน: มีพารามิเตอร์รวมน้อยกว่า 400 พันล้าน และพารามิเตอร์ที่ใช้งานน้อยกว่า K3 ถึง 9 พันล้าน ความแตกต่างทั้งสองไม่ได้มากมายนัก และจำนวนพารามิเตอร์ที่ใช้งานไม่ได้แปรผันเป็นความสามารถเชิงเส้นตรง สิ่งที่พวกมันแปรผันคือต้นทุนการให้บริการ โมเดลที่เปิดใช้งานพารามิเตอร์ 95 พันล้านต่อโทเค็นมีค่าใช้จ่ายในการรันในระดับที่ถูกกว่าโมเดลที่เปิดใช้งาน 104 พันล้าน หากปัจจัยอื่น ๆ เท่ากัน และความแตกต่างนั้นแสดงให้เห็นในราคา API ด้านล่าง
สำหรับผู้ที่โฮสต์ด้วยตนเอง ตัวเลขที่เกี่ยวข้องมากกว่าคือไฟล์ดาวน์โหลด K3 ขนาด 594 GB ที่ความแม่นยำ MXFP4 นั่นเป็นขนาดที่ต้องใช้หลายโหนด แม้กระทั่งก่อนที่คุณจะพิจารณาเรื่อง KV cache สำหรับบริบทที่ยาว คาดว่า Qwen 3.8-Max ซึ่งมีพารามิเตอร์รวม 2.4 ล้านล้าน จะมีขนาดไฟล์ใกล้เคียงกันเมื่อเปิดให้ดาวน์โหลด ทีมส่วนใหญ่จะใช้ Hosted Endpoints สำหรับทั้งสองโมเดล และสำรองการโฮสต์ด้วยตนเองไว้สำหรับกรณีการปฏิบัติตามข้อกำหนดหรือการวิจัยเท่านั้น
ความเปิดเผยในวันนี้: น้ำหนักที่ใช้งานได้จริง กับคำสัญญาที่กำหนดวัน
แง่มุมนี้สมควรมีส่วนของตัวเอง เพราะการตลาดของทั้งสองฝ่ายระบุว่า "เปิด" แต่ข้อเท็จจริงกลับแตกต่างกัน
น้ำหนักของ Kimi K3 เป็นสาธารณะ คุณสามารถตรวจสอบ repo, ตรวจสอบใบอนุญาต และดึงไฟล์ได้ทันที ซึ่งนำมาซึ่งทุกสิ่งที่ความเปิดเผยที่แท้จริงเอื้ออำนวย: การโฮสต์โดยบุคคลที่สาม, การควอนไทซ์โดยชุมชน, การปรับแต่ง (fine-tuning) และความมั่นใจว่าโมเดลที่คุณใช้ในการเปรียบเทียบจะไม่ถูกเปลี่ยนออกไปโดยที่คุณไม่รู้ตัว
Qwen 3.8-Max จะเป็นโมเดลคลาส Qwen-Max รุ่นแรกที่เปิดตัวพร้อมน้ำหนักแบบเปิด ซึ่งเป็นการเปลี่ยนแปลงกลยุทธ์ที่แท้จริงของ Alibaba หลังจากที่โมเดลระดับ Max รุ่นก่อนหน้าทั้งหมดเป็นแบบ API-only แต่ "ครั้งแรก" จะเป็นครั้งแรกก็ต่อเมื่อมันเกิดขึ้นแล้วเท่านั้น จนกว่า repo บน Hugging Face จะเปิดใช้งาน Qwen 3.8-Max ก็ยังคงเป็นโมเดล API ที่มีเพียงการประกาศแนบมาด้วย
สำหรับแง่มุมนี้ ณ วันนี้ K3 ได้คะแนนนำไปก่อน โดยมีหมายเหตุเล็ก ๆ ให้ตรวจสอบอีกครั้งประมาณวันที่ 10 สิงหาคม หาก Alibaba ส่งมอบตามที่สัญญาไว้ แง่มุมนี้ก็จะเสมอกัน และการเปรียบเทียบจะเปลี่ยนไปที่เงื่อนไขใบอนุญาตและคุณภาพของการควอนไทซ์
รูปแบบ: Qwen เห็นภาพ, K3 อ่านข้อความ
ในที่นี้ ความแตกต่างกลับไปในทิศทางตรงกันข้าม และไม่ใช่ความแตกต่างเล็กน้อยเลย
Qwen 3.8-Max รองรับอินพุตทั้งข้อความและรูปภาพ ตามการกำหนดค่าโมเดลอย่างเป็นทางการ ("input_modalities": ["text", "image"]) โพสต์เปิดตัวของ Alibaba ยังแสดงให้เห็นถึงความเข้าใจเอกสารขนาดยาวข้ามไฟล์ PDF กว่า 200 หน้า และความเข้าใจวิดีโอ 100 ชั่วโมงผ่านกราฟหน่วยความจำ; ให้ถือว่าสิ่งเหล่านั้นเป็นเพียงการสาธิตในบล็อก ไม่ใช่ประเภทอินพุต API ที่มีเอกสารกำกับ อย่างไรก็ตาม อินพุตรูปภาพนั้นเป็นของจริงและมีอยู่ใน API ณ วันนี้ การเปรียบเทียบจากผู้ให้บริการของ Alibaba เน้นย้ำในส่วนนี้: ตารางมัลติโมดัล (MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1, แถว OCR ที่แข็งแกร่ง) คือจุดที่ Qwen 3.8-Max ทำตัวเลขได้โดดเด่นที่สุด
Kimi K3 เป็นโมเดลข้อความ หากเวิร์คโหลดของคุณเกี่ยวข้องกับการจับภาพหน้าจอ, เอกสารที่สแกน, การทำความเข้าใจ UI หรือภารกิจของเอเจนต์ที่เกี่ยวข้องกับวิทัศน์ K3 จำเป็นต้องมีโมเดลวิทัศน์แยกต่างหากที่เชื่อมต่อเข้ากับไปป์ไลน์ พร้อมด้วยโค้ดเชื่อมต่อและเวลาแฝงพิเศษทั้งหมดที่เกี่ยวข้อง
สำหรับงานเขียนโค้ดและงานเอเจนต์ที่ใช้ข้อความเท่านั้น แง่มุมนี้ไม่เกี่ยวข้อง แต่สำหรับระบบอัจฉริยะเอกสารและเอเจนต์ที่ใช้งานคอมพิวเตอร์ มันเป็นปัจจัยชี้ขาด
บริบท, ผลลัพธ์ และพื้นผิว API
Qwen 3.8-Max มาพร้อมกับหน้าต่างบริบท (context window) ขนาด 1,000,000 โทเค็นในระดับเดียว โดยมีผลลัพธ์สูงสุดที่ 65,536 โทเค็น การให้เหตุผลถูกควบคุมโดยพารามิเตอร์ reasoning_effort (ค่าเริ่มต้นคือ xhigh โดยมี medium และ low ให้เลือก) และผลลัพธ์การคิดจะถูกเก็บรักษาไว้เป็นค่าเริ่มต้น ที่น่าสังเกตคือ โหมดการคิดและไม่คิดจะถูกเรียกเก็บเงินในอัตราเดียวกัน
การเข้าถึงจะทำผ่าน Alibaba Cloud Model Studio ซึ่งมี URL พื้นฐานตามภูมิภาคสามแห่ง (ปักกิ่ง, สิงคโปร์, สหรัฐอเมริกา-เวอร์จิเนีย) และที่น่าสนใจคือมีรูปแบบโปรโตคอลสองแบบบนแพลตฟอร์มเดียว: endpoint ที่เข้ากันได้กับ OpenAI และ endpoint ที่เข้ากันได้กับ Anthropic พื้นผิวโปรโตคอลคู่แบบนี้คือเหตุผลที่ Qwen 3.8-Max สามารถใช้งานร่วมกับ Claude Code ได้อย่างง่ายดาย เพียงแค่ตั้งค่า ANTHROPIC_BASE_URL และ ANTHROPIC_MODEL=qwen3.8-max รายชื่อโมเดลทั้งหมดและการให้บริการตามภูมิภาคมีระบุอยู่ใน หน้าโมเดลของ Model Studio; หากคุณทำงานข้ามภูมิภาค เครื่องมืออย่าง Apidog ช่วยให้คุณสามารถจัดเก็บ URL พื้นฐานแต่ละรายการเป็นสภาพแวดล้อม และสลับไปมาระหว่างกันได้โดยไม่ต้องแก้ไขคำขอ
Kimi K3 ก็รองรับโปรโตคอล Anthropic และสามารถทำงานร่วมกับระบบควบคุมสไตล์ Claude Code ได้เช่นกัน ซึ่งเป็นเหตุผลว่าทำไมโมเดลทั้งสองนี้จึงแข่งขันกันเพื่อตำแหน่งเดียวกัน: ตำแหน่ง "เชื่อมต่อระบบควบคุมเอเจนต์ที่มีอยู่ของคุณเข้ากับโมเดลแนวหน้าที่ราคาถูกกว่า" สำหรับรายละเอียด endpoint และขีดจำกัดปัจจุบันของ K3 โปรดดู คำอธิบาย Kimi K3 ของเรา แทนที่จะเชื่อตัวเลขที่อาจมีการเปลี่ยนแปลงไปตั้งแต่การเปิดตัว
ราคา: คงที่และเรียบง่าย เทียบกับ เข้าถูก ออกแพง
นี่คืออัตราที่เผยแพร่ต่อหนึ่งล้านโทเค็น:
| อัตรา | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| อินพุต | $2.00 | $3.00 |
| เอาต์พุต | $6.00 | $15.00 |
| อินพุตจากแคช | $0.20 (10% ของอินพุต) | $0.30 |
| การจัดระดับราคา | คงที่ตลอดบริบท 1 ล้านโทเค็นเต็ม | ตามตารางราคาที่ Moonshot เผยแพร่ |
Qwen 3.8-Max มีค่าใช้จ่าย $2 สำหรับอินพุต และ $6 สำหรับเอาต์พุต คงที่ตั้งแต่โทเค็นแรกถึงหนึ่งล้านโทเค็น ไม่ว่าจะอยู่ในโหมดการคิดหรือไม่ก็ตาม ตาม หน้าราคาอย่างเป็นทางการของ Model Studio การสร้างแคชแบบระบุจะคิดเงินที่ 125% ของอินพุต ส่วนการเรียกใช้จากแคชจะคิดที่ 10% นอกจากนี้ยังมีโควต้าฟรี: 1 ล้านโทเค็น, เฉพาะภูมิภาคสิงคโปร์, มีอายุ 90 วัน
อัตราของ K3 คือ $0.30 ต่อล้านโทเค็นสำหรับการเรียกใช้จากแคช, $3 ต่อล้านโทเค็นสำหรับอินพุต และ $15 ต่อล้านโทเค็นสำหรับเอาต์พุต
การเปรียบเทียบนี้ไม่ใช่แค่ตัวเลขเดียว สำหรับเวิร์คโหลดที่เน้นอินพุตและมีการจัดการแคชที่ดี (prompts ระบบที่ยาว, บริบทเอกสารที่ซ้ำซ้อน) โมเดลทั้งสองมีราคาใกล้เคียงกันมากกว่าที่ป้ายราคาแสดง: $0.20 เทียบกับ $0.30 ต่อเมกะโทเค็นจากแคชเป็นช่องว่างที่แคบ สำหรับเวิร์คโหลดที่เน้นเอาต์พุต ช่องว่างนั้นกว้าง: อัตราเอาต์พุต $15 ของ K3 สูงกว่า Qwen $6 ถึง 2.5 เท่า ลูปเอเจนต์ที่สร้างการให้เหตุผลและโค้ดจำนวนมากมักจะเน้นเอาต์พุต ซึ่งตามทฤษฎีแล้ว Qwen 3.8-Max จะได้เปรียบกว่า
ข้อควรระวังหนึ่งที่ใช้กับ Qwen โดยเฉพาะ: reasoning_effort มีค่าเริ่มต้นเป็น xhigh และโทเค็นการคิดจะถูกเรียกเก็บเงินเป็นเอาต์พุต ใบแจ้งหนี้จริงจะสูงกว่าที่การประมาณการโทเค็นเข้า-โทเค็นออกแบบง่าย ๆ คาดการณ์ไว้ การวิเคราะห์ราคา Qwen 3.8 ของเราจะแสดงตัวอย่างค่าใช้จ่ายต่อภารกิจ หากคุณต้องการสร้างแบบจำลองก่อนที่จะตัดสินใจ
เกณฑ์มาตรฐาน: สองตารางจากผู้ให้บริการ ไม่มีกรรมการตัดสิน
นี่คือจุดที่การเปรียบเทียบโมเดลทั้งสองนี้มักจะผิดพลาด ดังนั้นเรามาทำความเข้าใจให้ชัดเจนว่ามีอะไรบ้าง
สิ่งที่มีอยู่: Alibaba ได้เผยแพร่ตารางเกณฑ์มาตรฐานสำหรับ Qwen 3.8-Max เทียบกับ Claude Opus 4.8, Fable 5, GPT-5.6 Sol และ Qwen 3.7-Max Moonshot ได้เผยแพร่ตารางเปิดตัวของ Kimi K3 เทียบกับโมเดลแนวหน้าในทำนองเดียวกัน ทั้งสองเป็นการดำเนินการโดยผู้ให้บริการเอง
สิ่งไม่มีอยู่: การประเมินผลที่เป็นอิสระใดๆ ที่นำ Qwen 3.8-Max และ Kimi K3 มาไว้ในตารางเดียวกันภายใต้เงื่อนไขการทดสอบเดียวกัน ไม่มีตัวเลขการวิเคราะห์จาก Artificial Analysis สำหรับ Qwen 3.8-Max ณ เวลาที่เขียนบทความนี้ ผู้ให้บริการทั้งสองไม่ได้ทำการเปรียบเทียบโมเดลของอีกฝ่าย
ด้วยกรอบดังกล่าว นี่คือสิ่งที่แต่ละฝ่ายอ้างจากการทดสอบของตนเอง
จากตารางของ Alibaba (การทดสอบของ Alibaba ซึ่งส่วนใหญ่ดำเนินการผ่านระบบ Claude Code harness ซึ่งเป็นรายละเอียดที่ Alibaba เปิดเผยเอง):
| เกณฑ์มาตรฐาน | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 |
| HLE | 43.6 | 45.7 | 53.3 | 47.2 |
ตัวเลขของ Alibaba เองแสดงให้เห็นถึงความพ่ายแพ้ที่ชัดเจน: Qwen 3.8-Max ตามหลัง Fable 5 อย่างมากใน SWE-bench Pro และตามหลังทุกโมเดลที่ระบุไว้ใน HLE แถวที่โดดเด่นคือ PaperBench, การทำตามคำสั่ง (IFBench 82.8) และการทดสอบมัลติโมดัล ผลลัพธ์สำคัญอื่น ๆ อีกหลายรายการใช้เกณฑ์มาตรฐานภายในของ Alibaba (QwenSWEBench, CoWorkBench และอื่น ๆ) ซึ่งไม่สามารถอ้างอิงข้ามกับใครได้
จากฝั่ง Moonshot ตารางเปิดตัวของ K3 แสดงให้เห็นว่ามันเอาชนะ Claude Opus 4.8 ได้ในแถวเกณฑ์มาตรฐานสำคัญของ Moonshot ในขณะที่ยังคงตามหลัง Fable 5 และ GPT-5.6 Sol โดยรวม เราได้ครอบคลุมข้ออ้างเหล่านั้นและข้อควรระวังของพวกมันใน การเปรียบเทียบ Kimi K3 vs Claude Opus 4.8 ของเรา
คุณสามารถนำตารางทั้งสองมาเปรียบเทียบกันในส่วนที่เกณฑ์มาตรฐานทับซ้อนกันได้หรือไม่? คุณทำได้ และผู้คนก็จะทำเช่นนั้น แต่ระบบควบคุม, โครงสร้าง และการตั้งค่าการสุ่มตัวอย่างที่แตกต่างกันทำให้การอ่านข้ามตารางเป็นเพียงการบ่งชี้เท่านั้น สรุปอย่างตรงไปตรงมาคือ: ผู้ให้บริการทั้งสองแสดงให้เห็นว่าโมเดลของตนสามารถแข่งขันได้ และเหนือกว่าโมเดลแนวหน้าของสหรัฐอเมริกาในงานที่เกี่ยวข้องกับเอเจนต์ได้เป็นบางกรณี แต่ไม่มีตารางใดที่ยืนยันได้ว่าโมเดลใดแข็งแกร่งกว่ากัน สำหรับรายละเอียดปลีกย่อยเกี่ยวกับตัวเลขของ Alibaba โปรดดู การวิเคราะห์เกณฑ์มาตรฐาน Qwen 3.8 ของเรา
ทดลองเปรียบเทียบด้วยตัวคุณเองใน Apidog
เนื่องจากไม่มีกรรมการตัดสิน เกณฑ์มาตรฐานที่มีประโยชน์ที่สุดคือสิ่งที่คุณใช้ทดสอบกับเวิร์คโหลดของคุณเอง โมเดลทั้งสองมี endpoint สำหรับ chat-completions ที่เข้ากันได้กับ OpenAI ซึ่งทำให้การทดสอบเปรียบเทียบทำได้ง่ายใน Apidog
ตั้งค่าสภาพแวดล้อมสองชุด โดยชุดหนึ่งเก็บ URL พื้นฐานของ DashScope และ qwen3.8-max ส่วนอีกชุดเก็บ endpoint ของ Moonshot และ ID โมเดล K3 โดยแต่ละชุดมีตัวแปรคีย์ API ของตนเอง บันทึกคำขอหนึ่งชุดพร้อม prompt จริงของคุณ (งานจริงจากผลิตภัณฑ์ของคุณ ไม่ใช่ปริศนา) แล้วสลับไปมาระหว่างสภาพแวดล้อมเพื่อส่งเพย์โหลดเดียวกันไปยังโมเดลทั้งสอง มุมมองการตอบสนองของ Apidog จะแสดงสถานะ, เวลาแฝง และเนื้อหาฉบับเต็มเคียงข้างกัน และการดีบัก SSE จะแสดงให้เห็นว่าแต่ละโมเดลสตรีมเนื้อหาการให้เหตุผลอย่างไร ซึ่งสำคัญหาก UI ของคุณแสดงโทเค็นการคิด เพิ่มการยืนยัน (assertions) สักสองสามข้อ (เช่น response schema, ขีดจำกัดเวลาแฝง, คำหลักที่จำเป็นในเอาต์พุต) และคุณก็ได้เปลี่ยนการตรวจสอบความรู้สึกเป็นการทดสอบที่ทำซ้ำได้ ซึ่งคุณสามารถเรียกใช้ซ้ำได้เมื่อผู้ให้บริการรายใดรายหนึ่งออกการอัปเดต ดาวน์โหลด Apidog ฟรีเพื่อทำการเปรียบเทียบ; การส่ง prompts สิบครั้งผ่าน endpoint ทั้งสองจะบอกคุณได้มากกว่าตารางของผู้ให้บริการรายใดรายหนึ่ง
ตารางสรุปคะแนน
| แง่มุม | ผู้ชนะวันนี้ | ข้อควรระวัง |
|---|---|---|
| พารามิเตอร์รวม/ที่ใช้งาน | Qwen 3.8-Max (กระชับกว่า: 2.4T/95B เทียบกับ 2.8T/104B) | เล็กกว่าไม่ได้หมายความว่าดีกว่าหรือแย่กว่าในตัวมันเอง ส่วนใหญ่บ่งบอกถึงค่าใช้จ่ายในการให้บริการ |
| น้ำหนักแบบเปิด, วันนี้ | Kimi K3 (พร้อมใช้งานบน Hugging Face, 594 GB MXFP4) | น้ำหนักของ Qwen จะออกประมาณวันที่ 10 ส.ค.; ตรวจสอบอีกครั้ง, แง่มุมนี้อาจเสมอกันในไม่ช้า |
| รูปแบบข้อมูล | Qwen 3.8-Max (อินพุตข้อความ + รูปภาพ) | การอ้างสิทธิ์วิดีโอ/เอกสารยาวเป็นการสาธิตในบล็อก ไม่ใช่ประเภทอินพุต API ที่มีเอกสารกำกับ |
| หน้าต่างบริบท | Qwen 3.8-Max (ระดับเดียว 1 ล้านโทเค็น, เอาต์พุตสูงสุด 65,536) | ตรวจสอบขีดจำกัดปัจจุบันของ K3 จากเอกสารของ Moonshot สำหรับกรณีการใช้งานของคุณ |
| ราคา | Qwen 3.8-Max ($2/$6 คงที่ เทียบกับ $3/$15) | ค่าเริ่มต้น xhigh thinking ทำให้ค่าใช้จ่ายเอาต์พุตจริงของ Qwen สูงขึ้น |
| เกณฑ์มาตรฐาน | ไม่สามารถตัดสินได้ | ทั้งสองตารางจัดทำโดยผู้ให้บริการ; ไม่มีการเปรียบเทียบแบบตัวต่อตัวที่เป็นอิสระ |
| ระบบนิเวศของ Harness | เสมอ | ทั้งสองสามารถเชื่อมต่อกับระบบควบคุมสไตล์ Claude Code ผ่าน endpoint โปรโตคอล Anthropic |
| ประวัติการรักษาคำมั่นสัญญา | Kimi K3 | น้ำหนักถูกเผยแพร่ 11 วันหลังการเปิดตัว; คำสัญญาของ Qwen ยังคงเปิดกว้าง |
เลือกโมเดลไหน เมื่อไหร่
เลือก Kimi K3 หากคุณต้องการน้ำหนักโมเดลบนฮาร์ดแวร์ของคุณเองในสัปดาห์นี้, นโยบายการปฏิบัติตามข้อกำหนดของคุณต้องการโมเดลที่คุณสามารถตรึงและตรวจสอบได้ หรือเวิร์คโหลดของคุณเป็นข้อความล้วนและเน้นอินพุตมากพอที่ราคาแคชจะมีความสำคัญ
เลือก Qwen 3.8-Max หากเวิร์คโหลดของคุณเกี่ยวข้องกับรูปภาพหรือเอกสาร, คุณสร้างโทเค็นเอาต์พุตจำนวนมาก (ลูปเอเจนต์, การสร้างโค้ด) หรือคุณต้องการบริบท 1 ล้านโทเค็นโดยไม่มีราคาแบบแบ่งชั้นที่อาจสร้างความประหลาดใจ
รออีกหนึ่งสัปดาห์หากน้ำหนักแบบเปิดคือเหตุผลทั้งหมดที่คุณสนใจโมเดลใดโมเดลหนึ่ง หากน้ำหนักของ Qwen ถูกเผยแพร่ตามที่สัญญาไว้ประมาณวันที่ 10 สิงหาคม แง่มุมของความเปิดเผยก็จะกลับมาตั้งต้นใหม่ และการตัดสินใจจะขึ้นอยู่กับรูปแบบข้อมูล, ราคา และผลการประเมินของคุณเอง
เรื่องจริงคือ ตอนนี้นักพัฒนาได้มีทางเลือกโมเดลแนวหน้าที่น่าเชื่อถือ, ราคาถูก และเข้ากันได้กับระบบควบคุมจากประเทศจีนถึงสองตัว ภายในระยะเวลาห่างกันเพียงสามสัปดาห์ ไม่ว่าคุณจะเอนเอียงไปทางไหน โปรดลองใช้ prompts ของคุณเองผ่าน endpoint ทั้งสองก่อนที่จะตัดสินใจยึดถือตารางของผู้ให้บริการรายใดรายหนึ่ง
คำถามที่พบบ่อย
Kimi K3 เปิดกว้างกว่า Qwen 3.8-Max หรือไม่?
ในวันนี้ ใช่ ตามข้อเท็จจริงที่ชัดเจน: น้ำหนักของ K3 อยู่บน Hugging Face มาตั้งแต่วันที่ 27 กรกฎาคม 2026 (594 GB, MXFP4) ในขณะที่น้ำหนักของ Qwen 3.8-Max ถูกสัญญาไว้ว่าจะมาถึงประมาณวันที่ 10 สิงหาคม และยังไม่สามารถดาวน์โหลดได้ หาก Alibaba ส่งมอบตามที่สัญญาไว้ ทั้งสองก็จะกลายเป็นโมเดลแนวหน้าแบบเปิดน้ำหนัก และความแตกต่างที่มีนัยสำคัญจะเปลี่ยนไปที่เงื่อนไขใบอนุญาตและการสนับสนุนจากชุมชน จนกว่าจะถึงเวลานั้น มีเพียง K3 เท่านั้นที่สามารถโฮสต์ด้วยตนเองได้; คู่มือการติดตั้ง K3 บนเครื่องของคุณ ของเราอธิบายสิ่งที่คุณต้องทำ
โมเดลไหนดีกว่าในการเขียนโค้ด ระหว่าง Qwen 3.8-Max กับ Kimi K3?
ยังไม่มีใครสามารถตอบได้อย่างซื่อสัตย์ในตอนนี้ ผู้ให้บริการทั้งสองเผยแพร่ตัวเลขการเขียนโค้ดที่แข็งแกร่ง แต่ละรายทำการประเมินภายใต้เงื่อนไขของตนเอง และยังไม่มีการเปรียบเทียบแบบตัวต่อตัวที่เป็นอิสระ ตารางของ Alibaba เองยังแสดงให้เห็นว่า Qwen 3.8-Max แพ้ Fable 5 ใน SWE-bench Pro ดังนั้นตารางของผู้ให้บริการก็ยอมรับความพ่ายแพ้; เพียงแต่ว่ามันไม่สามารถเปรียบเทียบข้ามผู้ให้บริการได้ ลองรันโมเดลทั้งสองกับงานจาก repo ของคุณเองก่อนตัดสินใจ
ฉันสามารถใช้ทั้งสองโมเดลใน Claude Code ได้หรือไม่?
ได้ โมเดลทั้งสองมี endpoint ที่เข้ากันได้กับ Anthropic สำหรับ Qwen 3.8-Max ให้ตั้งค่า ANTHROPIC_BASE_URL เป็น DashScope Anthropic endpoint และ ANTHROPIC_MODEL=qwen3.8-max โดยใช้การกำหนดค่าจากโพสต์เปิดตัวของ Alibaba K3 ก็รองรับรูปแบบเดียวกันผ่าน endpoint ของ Moonshot ความเข้ากันได้ของระบบควบคุมที่ใช้ร่วมกันนี้เองที่ทำให้การทดสอบ A/B ระหว่างสองโมเดลนี้ทำได้ง่ายและประหยัดค่าใช้จ่าย
สำหรับเวิร์คโหลดเอเจนต์ทั่วไป โมเดลไหนราคาถูกกว่ากัน?
ตามราคาที่ระบุ Qwen 3.8-Max ถูกกว่า: $2/$6 ต่อล้านโทเค็น เทียบกับ K3 ที่ $3/$15 และลูปของเอเจนต์มักจะเน้นโทเค็นเอาต์พุต ซึ่งความแตกต่างอยู่ที่ 2.5 เท่า มีสองข้อควรพิจารณาเพิ่มเติม: อัตรา $0.30 ของ K3 สำหรับการเรียกใช้จากแคช ทำให้อินพุตที่มีน้ำหนักมากและมีการแคชที่ดีสามารถแข่งขันได้ และค่าเริ่มต้น xhigh reasoning effort ของ Qwen จะคิดเงินโทเค็นการคิดเป็นเอาต์พุต ดังนั้นค่าใช้จ่ายจริงจึงสูงกว่าการประมาณการแบบง่าย ๆ ให้ลองสร้างแบบจำลองการใช้งานโทเค็นของคุณเองก่อนที่จะสรุปว่าราคาที่ระบุนั้นเป็นเรื่องทั้งหมด
