Qwen 3.8 ผลทดสอบ: ตาราง Alibaba เผยอะไร และอะไรที่ไม่ได้บอก

การวัดประสิทธิภาพของ Qwen 3.8-Max อ่านอย่างตรงไปตรงมา: PaperBench ได้ 93.0 และชนะด้านมัลติโมดอล, แพ้ใน HLE และ SWE-bench Pro, และข้อความตัวเล็ก ๆ ที่รายงานส่วนใหญ่ละเลย

INEZA Felin-Michel

INEZA Felin-Michel

3 August 2026

Qwen 3.8 ผลทดสอบ: ตาราง Alibaba เผยอะไร และอะไรที่ไม่ได้บอก

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

เป็นเวลาสองสัปดาห์แล้วที่เรื่องราวของ Qwen 3.8 ยังไม่สมบูรณ์ การพรีวิวสำหรับสื่อในเดือนกรกฎาคมสัญญาว่าจะเป็นโมเดลระดับแนวหน้าแต่ยังไม่มีคะแนนออกมา ดังนั้นบทความช่วงแรก ๆ จึงอิงตามความรู้สึก นั่นเปลี่ยนไปเมื่อวันที่ 3 สิงหาคม 2026 โพสต์ประกาศอย่างเป็นทางการของ Alibaba สำหรับ Qwen 3.8-Max ได้รวมตารางเปรียบเทียบมาตรฐานฉบับเต็มกับ Claude Opus 4.8, Fable 5, GPT-5.6 Sol และ Qwen3.7-Max ซึ่งเป็นรุ่นก่อนหน้าของตัวเอง รวมถึงตารางมัลติโมดัลแยกต่างหากที่เปรียบเทียบกับ Gemini 3.1 Pro และ GPT-5.6 Sol

ตารางนั้นคุ้มค่าแก่การอ่านอย่างละเอียด มันประกอบด้วยชัยชนะที่แท้จริง ความพ่ายแพ้ที่ตรงไปตรงมา และรายละเอียดปลีกย่อยที่สื่อส่วนใหญ่จะข้ามไปโดยสิ้นเชิง โพสต์นี้จะพาคุณสำรวจทั้งสามสิ่งนี้ จากนั้นจะให้วิธีปฏิบัติจริงในการเลิกเชื่อถือตารางของผู้ผลิตโดยสิ้นเชิง: คือการทดสอบประเมินผลด้วยตัวคุณเองผ่าน API หากคุณต้องการข้อมูลสรุปโมเดลทั้งหมดก่อน (พารามิเตอร์, ราคา, การเข้าถึง) โปรดเริ่มจาก คำอธิบาย Qwen 3.8-Max ของเราแล้วค่อยกลับมา

ข้อสังเกตเบื้องต้นก่อนที่จะไปดูตัวเลข คะแนนทั้งหมดด้านล่างมาจากตารางที่ Alibaba เผยแพร่เอง โดยมีข้อมูลกระดานผู้นำที่เชิงอ้างอิงระบุวันที่ 3 สิงหาคม 2026 ในขณะที่เขียนนี้ยังไม่มีการประเมินอิสระ โปรดจำไว้ในแต่ละแถวต่อจากนี้

ตารางแบบสรุป

นี่คือแถวของโมเดลข้อความหลักตามที่ Alibaba เผยแพร่ ยิ่งสูงยิ่งดีในทุกรายการ

เกณฑ์มาตรฐาน Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (Humanity’s Last Exam) 43.6 45.7 53.3 47.2 41.4

ที่มา: ตารางที่จัดทำโดยผู้ผลิตของ Alibaba เราจะมาดูว่า "จัดทำโดยผู้ผลิต" หมายถึงอะไรในทางปฏิบัติในภายหลัง เพราะมันมีความสำคัญมากกว่าปกติในที่นี้

Qwen 3.8-Max มีชัยชนะที่ไหนบ้าง

PaperBench: แถวเรือธงที่ดีที่สุด

PaperBench ซึ่งทดสอบว่าโมเดลสามารถสร้างผลลัพธ์จากเอกสารงานวิจัยได้หรือไม่ เป็นผลงานที่แข็งแกร่งที่สุดของ Qwen 3.8-Max เมื่อเทียบกับคู่แข่งระดับแนวหน้า: ได้ 93.0 นำหน้า GPT-5.6 Sol ที่ 90.5, Fable 5 ที่ 88.8 และ Opus 4.8 ที่ 80.3 นอกจากนี้ยังเป็นการก้าวกระโดดอย่างน่าตกใจจาก Qwen3.7-Max ที่ได้ 64.8 การก้าวกระโดด 28 คะแนนในเกณฑ์มาตรฐานใดๆ ก็ตามสมควรได้รับการพิจารณาอย่างถี่ถ้วน แต่ถ้าหากยืนยันได้จากการทดสอบอิสระ ก็ถือว่าเป็นการบ่งบอกถึงความสามารถในการวิจัยระยะยาวของโมเดลได้อย่างแท้จริง

IFBench: การปฏิบัติตามคำสั่งที่เหนือกว่าอย่างมาก

ใน IFBench, Qwen 3.8-Max ทำคะแนนได้ 82.8 คู่แข่งที่ไม่ใช่ Qwen ที่ใกล้ที่สุดในตารางคือ GPT-5.6 Sol ที่ 72.7, ตามมาด้วย Fable 5 ที่ 63.5 และ Opus 4.8 ที่ 62.2 นั่นคือช่องว่าง 10 ถึง 20 คะแนน ซึ่งเป็นเรื่องผิดปกติสำหรับเกณฑ์มาตรฐานที่มีการแข่งขันสูงเช่นนี้ ที่น่าสนใจคือ Qwen3.7-Max เคยนำในแถวนี้ที่ 79.1 มาก่อน ดังนั้นการปฏิบัติตามคำสั่งดูเหมือนจะเป็นจุดแข็งที่ยั่งยืนของ Qwen มากกว่าที่จะเป็นเพียงครั้งเดียว

Terminal Bench 2.1: เบียดแซง Claude

ในการทดสอบ Terminal Bench 2.1 ของ Alibaba, Qwen 3.8-Max ทำคะแนนได้ 86.6 เทียบกับ 84.6 สำหรับทั้ง Opus 4.8 และ Fable 5 GPT-5.6 Sol ยังคงเป็นผู้นำในแถวนี้ที่ 88.8 ดังนั้นนี่คืออันดับที่สอง ไม่ใช่การกวาดเรียบ แต่การเอาชนะโมเดลเรือธงทั้งสองของ Anthropic ในเกณฑ์มาตรฐานเทอร์มินัลแบบ Agentic นั้นเป็นผลลัพธ์ที่ Alibaba ต้องการจากการเปิดตัวครั้งนี้ และส่วนต่างสองคะแนนที่เหนือกว่า Claude คือตัวเลขที่คุณจะเห็นถูกอ้างถึงทุกที่

ชัยชนะด้านมัลติโมดัล

ตารางมัลติโมดัลแยกต่างหากเป็นที่ที่ Qwen 3.8-Max ดูแข็งแกร่งที่สุดโดยรวม Alibaba รายงาน MathVision ที่ 95.2, LogicVista ที่ 91.9 และ OSWorld-Verified ที่ 86.1 และโมเดลนี้เป็นผู้นำเกือบทุกแถว OCR ในตาราง ทั้ง Opus 4.8 และ Fable 5 ไม่ได้แข่งขันโดยตรงที่นี่ (ในการเปรียบเทียบนี้เน้นข้อความเป็นหลัก) ซึ่งเป็นส่วนหนึ่งที่ทำให้ตารางมัลติโมดัลดูเหมือนเป็นการกวาดเรียบ เมื่อเทียบกับ Gemini 3.1 Pro และ GPT-5.6 Sol แถวการให้เหตุผลด้วยภาพและความสามารถด้านเอกสารเป็นจุดที่ทำให้โมเดลนี้แตกต่างอย่างชัดเจนที่สุด

หากคุณกำลังเปรียบเทียบกับโมเดลแบบ open-weight ที่สำคัญอีกตัวที่เปิดตัวในช่วงฤดูร้อน ช่องว่างด้านมัลติโมดัลก็เป็นความแตกต่างที่ชัดเจนที่สุดเช่นกัน: Kimi K3 เป็นโมเดลที่เน้นข้อความเท่านั้น การเปรียบเทียบ Qwen 3.8 กับ Kimi K3 ของเราครอบคลุมการจับคู่นั้นไว้อย่างสมบูรณ์

จุดที่พ่ายแพ้, รายงานอย่างตรงไปตรงมา

Alibaba ได้แสดงผลการพ่ายแพ้ไว้ในตาราง ซึ่งสมควรได้รับการชื่นชม มีสามจุดที่โดดเด่น

HLE: 43.6, ตามหลัง Fable 5 อย่างมาก ใน Humanity’s Last Exam ซึ่งเป็นเกณฑ์มาตรฐานความรู้ทั่วไประดับแนวหน้า Qwen 3.8-Max ทำคะแนนได้ 43.6 Fable 5 อยู่ที่ 53.3, GPT-5.6 Sol ที่ 47.2 และ Opus 4.8 ที่ 45.7 นั่นคืออันดับสุดท้ายในบรรดาสี่โมเดลเรือธง ตามหลังผู้นำเกือบ 10 คะแนน มันเอาชนะ Qwen3.7-Max ที่ 41.4 ได้เพียงเล็กน้อย HLE ต้านทานการปรับแต่งเฉพาะเกณฑ์มาตรฐานได้ดีกว่าการประเมินส่วนใหญ่ ซึ่งทำให้แถวนี้มีน้ำหนักความสำคัญอย่างมาก

SWE-bench Pro: 67.7 เทียบกับ Fable 5 ที่ 80.0 ในเกณฑ์มาตรฐานด้านวิศวกรรมซอฟต์แวร์ที่ยากขึ้น Qwen 3.8-Max อยู่กลางกลุ่ม: นำหน้า GPT-5.6 Sol (64.6), ตามหลัง Opus 4.8 (69.2) เพียงเล็กน้อย และตามหลัง Fable 5 ถึง 12 คะแนนเต็ม การพัฒนาข้ามรุ่นจาก Qwen3.7-Max (60.6) นั้นเป็นของจริง แต่ "เอาชนะ Claude บน Terminal Bench" และ "ตามหลัง Fable 5 อย่างมากบน SWE-bench Pro" ทั้งสองอย่างนี้เป็นจริงพร้อมกัน และข้ออ้างที่สองจะปรากฏในพาดหัวข่าวน้อยกว่ามาก

DeepSWE และแถว Agentic ที่ยากขึ้น DeepSWE เป็นอีกแถวที่ Qwen 3.8-Max ตามหลังโมเดลแนวหน้าในตารางของ Alibaba เอง รูปแบบในส่วนการเขียนโค้ดนั้นสอดคล้องกัน: แข่งขันได้ในงาน Agentic ที่ขับเคลื่อนด้วยเทอร์มินัล แต่ตามหลังในการประเมินวิศวกรรมซอฟต์แวร์ที่ลึกที่สุด

สรุปอย่างตรงไปตรงมา: Qwen 3.8-Max เอาชนะ Opus 4.8 ได้ในหลายแถวของ Agentic, ตามหลัง Fable 5 ในงานการเขียนโค้ดหลักส่วนใหญ่ และชนะอย่างขาดลอยในด้านมัลติโมดัลและความสามารถด้านเอกสาร นั่นเป็นผลลัพธ์ที่แข็งแกร่งอย่างแท้จริงสำหรับโมเดลที่มีราคา $2 สำหรับอินพุตและ $6 สำหรับเอาต์พุตต่อหนึ่งล้านโทเค็น (ดูที่ หน้าการกำหนดราคาอย่างเป็นทางการ) แต่นี่ไม่ใช่ชัยชนะระดับแนวหน้าครอบคลุมทุกด้านตามที่การอ่านข่าวเปิดตัวแบบผ่านๆ อาจจะแนะนำ

รายละเอียดปลีกย่อยที่สื่อส่วนใหญ่จะข้ามไป

นี่คือส่วนที่อธิบายว่าทำไมคุณควรอ่านโพสต์เกณฑ์มาตรฐานแทนพาดหัวข่าว มีสี่รายละเอียดจากการเผยแพร่ของ Alibaba เองที่เปลี่ยนวิธีการอ่านตารางของคุณ

1. ทุกตัวเลขมาจากการทดสอบโดยผู้ผลิต (vendor-run) Alibaba ประเมินโมเดลของตนเองและโมเดลของคู่แข่ง นั่นเป็นแนวปฏิบัติมาตรฐานสำหรับตารางเปิดตัว และยังเป็นเหตุผลมาตรฐานที่ทำให้ตารางเปิดตัวถูกปรับแก้ในภายหลัง ผู้ผลิตเป็นผู้เลือกเวอร์ชันของเกณฑ์มาตรฐาน กลยุทธ์การพร้อมท์ การตั้งค่าการสุ่มตัวอย่าง และนโยบายการลองใหม่ ไม่มีสิ่งใดเป็นการฉ้อโกง แต่ทั้งหมดนี้เป็นการโน้มเอียงผลลัพธ์

2. แถวการเขียนโค้ดส่วนใหญ่รันบน Claude Code harness นี่คือรายละเอียดที่น่าสนใจอย่างแท้จริง Alibaba รันเกณฑ์มาตรฐานการเขียนโค้ดส่วนใหญ่ด้วย Claude Code ซึ่งเป็น Agent harness ของ Anthropic เอง โดยมุ่งเป้าไปที่ Qwen 3.8-Max ผ่าน API ที่เข้ากันได้กับ Anthropic ในแง่หนึ่ง นั่นเป็นการเล่นอย่างยุติธรรม: มันประเมินทุกโมเดลภายในเครื่องมือที่ใช้กันอย่างแพร่หลายเดียวกัน ในอีกแง่หนึ่ง มันหมายความว่า "คะแนนการเขียนโค้ดของ Qwen" แท้จริงแล้วคือคะแนน "Qwen ภายใน Agent harness ของ Anthropic" และการเลือก harness สามารถทำให้ผลลัพธ์ของ Agentic แกว่งไปมาได้หลายจุด นอกจากนี้ยังบอกคุณบางอย่างเกี่ยวกับที่ที่ Alibaba คาดการณ์ว่าโมเดลนี้จะถูกนำไปใช้งานจริง

3. เกณฑ์มาตรฐานหลายรายการเป็นของ Qwen เอง QwenSWEBench, QwenQoderBench, CoWorkBench และ RecreationBench ทั้งหมดนี้สร้างโดยทีม Qwen เกณฑ์มาตรฐานภายในองค์กรไม่ได้ไร้ค่า; พวกเขามักจะสำรวจความสามารถที่การประเมินสาธารณะอาจมองข้ามไป แต่คะแนนที่แข็งแกร่งของโมเดลบนเกณฑ์มาตรฐานของผู้สร้างเองนั้นเป็นหลักฐานคนละชนิดกับคะแนนที่แข็งแกร่งบน SWE-bench Pro และตารางนำเสนอทั้งสองอย่างเคียงข้างกันโดยไม่มีความแตกต่างทางสายตา เมื่อคุณอ้างอิงตัวเลขจากตารางนี้ โปรดตรวจสอบก่อนว่ามันอยู่ในหมวดหมู่ใด

4. เชิงอรรถเกี่ยวกับ Fable 5 ตารางของ Alibaba เองมีเชิงอรรถระบุว่า "ผลลัพธ์ Fable5 อาจเกี่ยวข้องกับการสำรองข้อมูล (fallbacks)" นั่นเป็นการยอมรับอย่างเงียบๆ ว่าตัวเลขของคู่แข่งอย่างน้อยหนึ่งรายอาจไม่ได้สะท้อนการทำงานของโมเดลอย่างบริสุทธิ์ ไม่ว่าสาเหตุทางเทคนิคจะเป็นอย่างไร นั่นหมายความว่าคอลัมน์ Fable 5 ซึ่งเป็นโมเดลที่ Qwen 3.8-Max มักจะตามหลังมาพร้อมกับเครื่องหมายดอกจันจากผู้เผยแพร่

ไม่มีสิ่งใดในนี้ที่เฉพาะเจาะจงกับ Alibaba Anthropic, OpenAI และ Google ล้วนเผยแพร่ตารางที่รันด้วยตนเองพร้อมทางเลือกด้านระเบียบวิธีของตนเอง เราได้ชี้ให้เห็นรูปแบบเดียวกันนี้ใน การวิเคราะห์เกณฑ์มาตรฐาน Kimi K3 ของเรา และมันก็ใช้ได้กับกรณีนั้นเช่นกัน ประเด็นไม่ใช่ว่า Alibaba โกง ประเด็นคือตารางของผู้ผลิตเป็นเพียงข้ออ้าง ไม่ใช่การวัดผล

สิ่งที่ต้องจับตาดู และวิธีอ่านตารางถัดไป

ณ วันที่ 3 สิงหาคม 2026 ยังไม่มีการประเมินอิสระสำหรับ Qwen 3.8-Max ทาง Artificial Analysis ยังไม่ได้เผยแพร่ตัวเลขในขณะที่เขียน และไม่มีกระดานผู้นำของชุมชนใดให้คะแนนโมเดลนี้ นั่นจะเปลี่ยนไปในอีกไม่กี่วันข้างหน้า และความแตกต่างระหว่างตารางของ Alibaba กับการทดสอบอิสระจะเป็นเรื่องราวที่แท้จริง เราจะอัปเดตโพสต์นี้เมื่อข้อมูลเหล่านั้นออกมา

จนกว่าจะถึงตอนนั้น นี่คือรายการตรวจสอบสั้นๆ สำหรับการตัดสินตารางเกณฑ์มาตรฐานของผู้ผลิตใดๆ รวมถึงตารางนี้ด้วย:

  1. ใครเป็นผู้ดำเนินการประเมิน? ตัวเลขที่รายงานด้วยตนเองสำหรับคู่แข่งควรได้รับความกังขามากกว่าตัวเลขที่รายงานด้วยตนเองสำหรับโมเดลของผู้ผลิตเอง
  2. ใช้ harness และการตั้งค่าใด? เกณฑ์มาตรฐานแบบ Agentic มีความอ่อนไหวต่อ harness ตารางที่ระบุชื่อ harness (เช่นที่ Alibaba ทำ) จะมีประโยชน์มากกว่าตารางที่ไม่ระบุ แต่การเลือกก็ยังคงกำหนดผลลัพธ์
  3. ผู้ผลิตสร้างเกณฑ์มาตรฐานใดบ้าง? การประเมินภายในองค์กรวัดสิ่งบางอย่าง แต่ไม่ใช่สิ่งเดียวกันกับการประเมินสาธารณะ
  4. อ่านเชิงอรรถ "อาจเกี่ยวข้องกับการสำรองข้อมูล (fallbacks)" มีความหมายที่สำคัญมากในตัวอักษรขนาดเล็ก
  5. ตรวจสอบสิ่งที่ขาดหายไป แถวที่ผู้ผลิตไม่ได้เผยแพร่มักให้ข้อมูลได้มากพอๆ กับแถวที่เผยแพร่ ตารางของผู้ผลิตในอดีตเคยละทิ้งเกณฑ์มาตรฐานที่โมเดลมีประสิทธิภาพต่ำอย่างเงียบๆ; เปรียบเทียบกับ การเปรียบเทียบรุ่นก่อนหน้าของผู้ผลิตต่างๆ เพื่อดูว่าแถวใดหายไป
  6. รอแหล่งข้อมูลที่สอง โดยปกติแล้วความอดทนหนึ่งสัปดาห์จะช่วยให้คุณได้ตัวเลขที่เป็นอิสระ

ดำเนินการประเมินผลของคุณเองดีกว่า

รายการตรวจสอบช่วยให้คุณอ่านตารางได้ แต่สิ่งที่ดีกว่าคือการพึ่งพามันให้น้อยลง Qwen 3.8-Max พร้อมใช้งานแล้วบน Alibaba Cloud Model Studio (รหัสโมเดล qwen3.8-max ระบุไว้ใน หน้ารายการโมเดลอย่างเป็นทางการ) พร้อมทั้ง API ที่เข้ากันได้กับ OpenAI และ Anthropic และเกณฑ์มาตรฐานที่ใช้พร้อมท์จริงของคุณจะดีกว่าการประเมินสาธารณะใดๆ ที่ไม่ใช้พร้อมท์จริง

การตั้งค่าที่ใช้งานได้จริงใน Apidog จะเป็นดังนี้ สร้างคำขอหนึ่งรายการไปยัง Model Studio chat-completions endpoint โดยใช้ qwen3.8-max และคำขอที่สองที่เหมือนกันไปยังโมเดลพื้นฐานปัจจุบันของคุณ ไม่ว่าจะเป็น Qwen3.7-Max, Kimi K3 หรือ Claude หรือ GPT endpoint บันทึก 20 ถึง 30 พร้อมท์การใช้งานจริงของคุณเป็นสถานการณ์ทดสอบ เพิ่มการยืนยันคุณสมบัติการตอบสนองที่คุณสนใจจริงๆ (JSON ที่ถูกต้อง, มีฟิลด์ที่จำเป็น, เวลาแฝงต่ำกว่าเกณฑ์ของคุณ) และรันทั้งสองสถานการณ์ต่อเนื่องกัน รายงานการทดสอบของ Apidog จะให้คุณเห็นอัตราการผ่านและเวลาตอบสนองต่อโมเดล เคียงข้างกัน โดยอิงตามปริมาณงานของคุณเองแทนที่จะเป็นของ Alibaba

สองสิ่งเฉพาะของ Qwen ที่ควรตรวจสอบในขณะที่คุณดำเนินการ: โมเดลตั้งค่าเริ่มต้นเป็น reasoning_effort: xhigh ดังนั้นควรวัดต้นทุนและเวลาแฝงในระดับความพยายามที่คุณต้องการใช้งานจริง และหากคุณวางแผนที่จะใช้ Anthropic-compatible endpoint ให้ทดสอบรูปแบบโปรโตคอลนั้นแยกต่างหาก เนื่องจากเป็นโปรโตคอลที่เกณฑ์มาตรฐานการเขียนโค้ดส่วนใหญ่ของ Alibaba รันผ่าน ดาวน์โหลด Apidog ฟรี, ตั้งค่าทั้งสอง endpoint เป็นสภาพแวดล้อม และคุณจะได้ตัวเลขโดยตรงก่อนที่กระดานผู้นำอิสระจะเผยแพร่

คำถามที่พบบ่อย

ตัวเลขเกณฑ์มาตรฐานของ Qwen 3.8 ได้รับการยืนยันอย่างเป็นอิสระหรือไม่?

ไม่ ณ วันที่ 3 สิงหาคม 2026 ตัวเลขที่เผยแพร่ทั้งหมดมาจากตารางของ Alibaba เอง Artificial Analysis และกระดานผู้นำชุมชนยังไม่ได้ให้คะแนน Qwen 3.8-Max ในขณะที่เขียนบทความนี้ โปรดถือว่าตารางนี้เป็นข้ออ้างของผู้ผลิตจนกว่าจะมีการทดสอบอิสระ

ผลลัพธ์เกณฑ์มาตรฐานที่ดีที่สุดของ Qwen 3.8-Max คืออะไร?

PaperBench ด้วยคะแนน 93.0 เป็นแถวที่ดีที่สุดในตารางเรือธง: นำหน้า GPT-5.6 Sol (90.5), Fable 5 (88.8) และ Opus 4.8 (80.3) ในตารางมัลติโมดัล, MathVision (95.2) และแถว OCR เป็นผลลัพธ์ที่แข็งแกร่งที่สุดโดยรวม

Qwen 3.8-Max แพ้ในส่วนใดอย่างชัดเจน?

ใน HLE ทำคะแนนได้ 43.6 ซึ่งเป็นอันดับสุดท้ายในบรรดาสี่โมเดลเรือธง และตามหลัง Fable 5 ที่ 53.3 อย่างมาก ใน SWE-bench Pro ทำคะแนนได้ 67.7 เทียบกับ Fable 5 ที่ 80.0 และยังตามหลังใน DeepSWE การประเมินวิศวกรรมซอฟต์แวร์ขั้นสูงและการสอบความรู้ทั่วไปเป็นจุดที่อ่อนแอที่สุดในตารางของ Alibaba เอง

Qwen 3.8 ดีกว่า Qwen 3.7-Max ในเกณฑ์มาตรฐานมากน้อยแค่ไหน?

การเพิ่มขึ้นของรุ่นในตารางของ Alibaba นั้นมีขนาดใหญ่: Terminal Bench 2.1 เพิ่มขึ้นจาก 74.5 เป็น 86.6, SWE-bench Pro จาก 60.6 เป็น 67.7 และ PaperBench จาก 64.8 เป็น 93.0 การอัปเกรดนั้นคุ้มค่าสำหรับปริมาณงานของคุณหรือไม่นั้นขึ้นอยู่กับราคาและรูปแบบเช่นกัน; การเปรียบเทียบ Qwen 3.8 กับ Qwen 3.7 ของเราจะอธิบายการตัดสินใจทั้งหมด

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API