Qwen 3.8 สำหรับการเขียนโปรแกรม: การทำงานต่อเนื่องอัตโนมัติ 16 วัน และความเชื่อมโยงโค้ดกับ Claude

Qwen 3.8-Max สำหรับการเขียนโค้ด: การทำงานแบบอัตโนมัติ 16 วันของ Alibaba, ผลการทดสอบมาตรฐาน, และคอนฟิกอย่างเป็นทางการสำหรับ Claude Code, Codex, Qoder, Qwen Code และ OpenClaw

Ashley Innocent

Ashley Innocent

3 August 2026

Qwen 3.8 สำหรับการเขียนโปรแกรม: การทำงานต่อเนื่องอัตโนมัติ 16 วัน และความเชื่อมโยงโค้ดกับ Claude

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

การเปิดตัวโมเดลส่วนใหญ่จะนำเสนอความสามารถในการเขียนโค้ดในลักษณะเดียวกัน: นี่คือคะแนน HumanEval ของเรา, นี่คือตัวอย่างโมเดลที่เขียนโค้ดค้นหาแบบไบนารี Alibaba ได้เลือกเส้นทางที่แตกต่างออกไปกับ Qwen 3.8-Max ข้ออ้างไม่ใช่ "มันเขียนฟังก์ชันได้ดี" ข้ออ้างคือมันสามารถดำเนินโครงการซอฟต์แวร์ได้ด้วยตัวเองเป็นเวลาหลายสัปดาห์: เปิดปัญหา, ผนวกรวมพูลรีเควสต์, และส่งมอบฟีเจอร์โดยไม่มีมนุษย์เข้ามาเกี่ยวข้อง

นั่นเป็นการนำเสนอที่กล้าหาญและสมควรได้รับการตรวจสอบ บทความนี้จะนำเสนอการสาธิตการเขียนโค้ดสามรายการที่ Alibaba เผยแพร่ในการเปิดตัว (ทั้งหมดเป็นตัวอย่างจากผู้ขาย ซึ่งหนึ่งในนั้นมี repo สาธารณะที่คุณสามารถตรวจสอบได้), ตัวเลขเกณฑ์มาตรฐานการเขียนโค้ดที่อยู่เบื้องหลัง, และส่วนที่คุณสามารถดำเนินการได้ในวันนี้: วิธีการเขียนโค้ดจริง ๆ ด้วย qwen3.8-max ใน Claude Code, Codex, Qoder, Qwen Code และ OpenClaw, และวิธีการทดสอบผลลัพธ์ API ที่โค้ดที่คุณสร้างขึ้นมานั้นผลิตขึ้นมา

หากคุณยังใหม่กับตัวโมเดลเอง โปรดเริ่มต้นด้วยภาพรวมของ Qwen 3.8 คืออะไร: พารามิเตอร์ทั้งหมด 2.4 ล้านล้าน, พารามิเตอร์ที่ใช้งานอยู่ 95 พันล้าน, หน้าต่างบริบท 1 ล้านโทเค็น, และน้ำหนักโมเดลแบบเปิดที่สัญญาว่าจะเปิดตัวในสัปดาห์หลังการเปิดตัว ที่นี่เราจะเน้นไปที่เรื่องราวของการเขียนโค้ด ทุกสิ่งที่อยู่ด้านล่างนี้สะท้อนถึงสถานะ ณ วันที่ 3 สิงหาคม 2026

ปุ่ม

สิ่งที่ Alibaba อ้างจริง ๆ

กรอบแนวคิดใน โพสต์เปิดตัว Qwen 3.8 อย่างเป็นทางการ คือความเป็นอิสระที่เหนือกว่าการเขียนโค้ดสั้น ๆ Alibaba วางตำแหน่ง Qwen 3.8-Max เป็นโมเดลที่สามารถทำงานทางวิศวกรรมที่มีขอบเขตยาวนานได้: วางแผนงาน, ดำเนินการเป็นเวลาหลายวัน, แก้ไขข้อผิดพลาดของตัวเอง, และส่งมอบผลลัพธ์ที่สามารถตรวจสอบได้ในตอนท้าย

สามสิ่งทำให้ข้ออ้างนี้น่าสนใจกว่าการตลาดวันเปิดตัวทั่วไป:

  1. การสาธิตนั้นยาวนาน สิบหกวันนั้นแตกต่างจากเกณฑ์มาตรฐานของเอเจนต์ 20 นาที การกู้คืนข้อผิดพลาด การจัดการบริบท และการเบี่ยงเบนมีความสำคัญมากกว่ามากในระดับนั้น
  2. การสาธิตหนึ่งรายการเป็นสาธารณะ คุณสามารถเรียกดู repo อ่านการคอมมิต และตัดสินคุณภาพโค้ดได้ด้วยตัวเอง การแสดงตัวอย่างของผู้ขายส่วนใหญ่ไม่มีให้
  3. ชุดทดสอบเป็นของคู่แข่ง Alibaba รันเกณฑ์มาตรฐานการเขียนโค้ดส่วนใหญ่ด้วยชุดทดสอบ Claude Code และเผยแพร่การกำหนดค่าอย่างเป็นทางการเพื่อให้คุณสามารถทำเช่นเดียวกันได้ รายละเอียดเพิ่มเติมอยู่ด้านล่าง

คำเตือนมาตรฐานและใช้กับบทความทั้งหมดนี้: ตัวเลขทุกตัวที่นี่มาจากเอกสารเปิดตัวของ Alibaba เอง ยังไม่มีการยืนยันอิสระ ณ ต้นเดือนสิงหาคม 2026 โปรดถือว่าการแสดงตัวอย่างเป็นเพียงการสาธิต ไม่ใช่การตรวจสอบ

การสาธิตการเขียนโค้ดทั้งสาม

oh-my-cli: การพัฒนาอิสระ 16 วัน

การสาธิตที่เป็นข่าวหลัก Alibaba ปล่อย Qwen 3.8-Max ให้สร้างเครื่องมือ command-line และปล่อยให้มันทำงานโดยไม่ได้รับการดูแล จนถึงวันที่ 30 กรกฎาคม การรันได้ดำเนินมาเป็นเวลา 16 วันและสร้าง 265 คอมมิต, 127 พูลรีเควสต์, และ 151 ปัญหา ทั้งหมดถูกเปิด ทำงาน และปิดโดยโมเดลเอง

repo เป็นสาธารณะที่ qwen-code-dev-bot/oh-my-cli ซึ่งเป็นส่วนที่มีประโยชน์ที่สุดของการแสดงตัวอย่างทั้งหมด คุณไม่จำเป็นต้องเชื่อจำนวนคอมมิต คุณสามารถอ่านคำอธิบาย PR ตรวจสอบว่าปัญหาเป็นบั๊กจริง ๆ หรือเป็นงานยุ่ง และดูว่าโค้ดมีความสมบูรณ์หรือไม่ ผลลัพธ์ 16 วันจากโมเดลที่ไม่มีการตรวจสอบจากมนุษย์เป็นสิ่งประดิษฐ์ที่หาได้ยากอย่างแท้จริง ไม่ว่าคุณจะสรุปคุณภาพอย่างไรก็ตาม

สิ่งที่ควรพิจารณาเมื่อคุณตรวจสอบ: PRs แก้ไขปัญหาที่อ้างถึงจริงหรือไม่, โมเดลสร้างงานเทียมเพื่อปิดหรือไม่, และจัดการกับการถดถอยของตัวเองอย่างไร รูปแบบเหล่านั้นบอกคุณเพิ่มเติมเกี่ยวกับความน่าเชื่อถือในระยะยาวมากกว่าคะแนนเกณฑ์มาตรฐานเดียวใด ๆ

การจำลองงานวิจัย: โค้ดวิจัย ไม่ใช่โค้ดแอปพลิเคชัน

การสาธิตที่สองมุ่งเป้าไปที่การเขียนโค้ดที่ยากขึ้น: การจำลองงานวิจัยด้านการเรียนรู้ของเครื่องตั้งแต่ต้น ตามตัวเลขของ Alibaba การรันใช้เวลาประมาณ 125 ชั่วโมง สร้างโค้ดประมาณ 7,600 บรรทัด และดำเนินการฝึกอบรม GPU 33 รอบตลอดทาง

ผลลัพธ์: โมเดลจำลองผลการวิจัยได้ 6 รายการ จากนั้นไปอีกขั้นโดยเอาชนะผลลัพธ์ที่รายงานในงานวิจัยได้ 2.7 คะแนนบน AIME24 การจำลองงานวิจัยเป็นงานที่ยากมาก สภาพแวดล้อมพังได้, พารามิเตอร์ซ่อนอยู่ในเชิงอรรถ, และบั๊กเงียบตัวเดียวทำให้การรันฝึกอบรมไม่ถูกต้องซึ่งคุณจะรู้ในอีกหลายชั่วโมงต่อมา โมเดลที่สามารถผ่านการฝึกอบรม 33 รอบและได้ตัวเลขที่ตรงกันนั้นกำลังทำอะไรบางอย่างที่เหนือกว่าการเติมข้อความอัตโนมัติ

การสาธิตนี้จับคู่กับแถวเกณฑ์มาตรฐานที่แข็งแกร่งที่สุดของ Qwen 3.8-Max, PaperBench ซึ่งจะกล่าวถึงด้านล่าง

การแข่งขัน Tianchi: 24 ชั่วโมงต่อสู้กับทีมมนุษย์

การสาธิตที่สามนำโมเดลเข้าสู่การแข่งขันวิทยาศาสตร์ข้อมูลสดบนแพลตฟอร์ม Tianchi ของ Alibaba โดยมีขีดจำกัด 24 ชั่วโมง โมเดลส่งผลงาน 45 ครั้งในช่วงเวลานั้น โดยปรับปรุงแนวทางของตัวเองทุกครั้ง และจบด้วยความแม่นยำสุดท้ายที่ 0.853 ซึ่งทำให้มันอยู่เหนือ 458 ใน 526 ทีมมนุษย์ที่เข้าแข่งขัน

ควรสังเกตผลลัพธ์นี้: โมเดลไม่ชนะ มันเอาชนะ 87% ของสนาม ซึ่งน่าประทับใจและซื่อสัตย์ในเวลาเดียวกัน นอกจากนี้ยังแสดงให้เห็นถึงความสามารถที่การสาธิตอื่น ๆ สองรายการไม่มี: การทำซ้ำอย่างรวดเร็วภายใต้กำหนดเวลา โดยที่คะแนนของการส่งแต่ละครั้งจะป้อนข้อมูลสำหรับการพยายามครั้งต่อไป

คำเตือนอีกข้อที่ใช้กับที่นี่เป็นพิเศษ: Tianchi เป็นแพลตฟอร์มของ Alibaba เอง การสาธิตเป็นของจริง แต่ผู้ขายควบคุมสถานที่

เกณฑ์มาตรฐานการเขียนโค้ดที่อยู่เบื้องหลังการสาธิต

Alibaba ได้เผยแพร่ตารางเกณฑ์มาตรฐานฉบับเต็มในการเปิดตัว นี่คือแถวที่เกี่ยวข้องกับการเขียนโค้ด พร้อมส่วนที่ซื่อสัตย์ที่เหลืออยู่ ตัวเลขทั้งหมดเป็นการรันของ Alibaba เอง

เกณฑ์มาตรฐาน Qwen 3.8-Max คู่แข่งที่ดีที่สุด (ตามตารางของ Alibaba)
Terminal Bench 2.1 86.6 88.8 (GPT-5.6 Sol)
SWE-bench Pro 67.7 80.0 (Fable 5)
PaperBench 93.0 90.5 (GPT-5.6 Sol)

สามประเด็นสำคัญ:

ตอนนี้เป็นรายละเอียดปลีกย่อยที่การรายงานส่วนใหญ่จะข้ามไป: Alibaba รันเกณฑ์มาตรฐานการเขียนโค้ดส่วนใหญ่เหล่านี้บนชุดทดสอบ Claude Code รวมถึงการรันสำหรับโมเดลคู่แข่ง และเชิงอรรถของตารางระบุว่าผลลัพธ์ของ Fable 5 อาจเกี่ยวข้องกับการสำรองข้อมูล การเลือกชุดทดสอบมีผลกระทบอย่างมากต่อคะแนนเกณฑ์มาตรฐานของเอเจนต์ ดังนั้นตารางที่ผู้ขายรันบนชุดทดสอบใดชุดทดสอบหนึ่งจึงเป็นเพียงข้อมูลจุดเดียว ไม่ใช่คำตัดสิน

รายละเอียดของ Claude Code มีผลกระทบสองทางเช่นกัน นั่นหมายความว่า Alibaba ได้ปรับแต่งสำหรับชุดทดสอบที่คุณอาจใช้อยู่แล้ว และพวกเขาได้เผยแพร่การกำหนดค่าเพื่อพิสูจน์สิ่งนั้น

วิธีเขียนโค้ดกับ Qwen 3.8 ในวันนี้

มาถึงส่วนที่เป็นการปฏิบัติ Qwen 3.8-Max พร้อมให้บริการทั่วไปบน Alibaba Cloud Model Studio และ Alibaba ได้เผยแพร่การกำหนดค่าอย่างเป็นทางการสำหรับเครื่องมือเขียนโค้ดห้าชนิดในการเปิดตัว คุณต้องมี DashScope API key (จาก home.qwencloud.com) สำหรับทุกเครื่องมือ ราคาอยู่ที่ 2 ดอลลาร์ต่อล้านโทเค็นอินพุต และ 6 ดอลลาร์ต่อล้านโทเค็นเอาต์พุต คงที่ตลอดหน้าต่างบริบท 1M ตาม หน้าการกำหนดราคา Model Studio อย่างเป็นทางการ

Claude Code

โมเดลนี้มาพร้อมกับ API endpoint ที่เข้ากันได้กับ Anthropic ดังนั้นการชี้ Claude Code ไปยังมันต้องใช้ตัวแปรสภาพแวดล้อมสามตัว:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max

เริ่ม Claude Code ตามปกติ และมันจะส่งคำขอทั้งหมดไปยัง Qwen 3.8-Max แทนที่จะเป็น Claude เนื่องจาก Alibaba ได้รันเกณฑ์มาตรฐานการเขียนโค้ดบนชุดทดสอบนี้พอดี นี่คือการกำหนดค่าที่มีความแตกต่างน้อยที่สุดระหว่างสิ่งที่วัดได้และสิ่งที่คุณจะได้สัมผัส

Codex

Codex ต้องการรายการผู้ให้บริการในการกำหนดค่า ภาพร่างจากเอกสารทางการ:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000

นี่ใช้ endpoint ที่เข้ากันได้กับ OpenAI แทนที่จะเป็น Anthropic โมเดลเดียวกัน, คีย์เดียวกัน, แต่รูปทรงของโปรโตคอลแตกต่างกัน

Qoder, Qwen Code, และ OpenClaw

สามรายการที่เหลือสรุปได้เร็วขึ้น:

การกำหนดค่าทั้งห้ารายการอยู่ในโพสต์เปิดตัว ดังนั้นโปรดรับเวอร์ชันปัจจุบันที่แน่นอนจากที่นั่นแทนที่จะปักหมุดไว้ที่ภาพรวมของบล็อก

กำหนดความพยายามในการใช้เหตุผลอย่างตั้งใจ

Qwen 3.8-Max รองรับพารามิเตอร์ reasoning_effort ที่มีสามระดับ: xhigh (ค่าเริ่มต้น), medium, และ low สำหรับการเขียนโค้ด การตั้งค่านี้มีความสำคัญมากกว่าการปรับแต่งส่วนใหญ่:

จำไว้ว่าโทเค็นสำหรับการคิดจะถูกคิดค่าใช้จ่ายเป็นโทเค็นเอาต์พุตที่ 6 ดอลลาร์ต่อล้านโทเค็น และ xhigh เป็นค่าเริ่มต้น เซสชันเอเจนต์ที่ยาวนานที่ใช้ความพยายามสูงสุดมีค่าใช้จ่ายจริง การแก้ไขเชิงกลที่ xhigh มีค่าใช้จ่ายโดยไม่มีประโยชน์

หาก Qwen 3.8-Max เป็นโมเดลที่เกินความต้องการของงานของคุณ ไลน์ Qwen3 Coder รุ่นก่อนหน้ายังคงมีอยู่สำหรับงานเขียนโค้ดโดยเฉพาะ และ Qwen3 Coder Flash ครอบคลุมส่วนที่รวดเร็วและราคาถูก สำหรับโมเดลโอเพนเวทอื่น ๆ ที่มีน้ำหนักมากในพื้นที่นี้ โปรดดูว่า Kimi K3 จัดการงานเขียนโค้ดอย่างไร

การทดสอบสิ่งที่โมเดลสร้าง: ขั้นตอน Apidog

นี่คือช่องว่างในการสาธิตการเขียนโค้ดอัตโนมัติทุกครั้ง รวมถึงของ Alibaba: โมเดลเขียนโค้ดที่เรียกใช้ API แต่ไม่มีใครพูดถึงการตรวจสอบการเรียกเหล่านั้น เอเจนต์สามารถสร้างโค้ด 7,600 บรรทัดที่คอมไพล์ได้สะอาด แต่ยังคงเรียกใช้ endpoint ผิด, จัดการ 429 ผิดพลาด, หรือส่ง request body ที่ไม่ผ่านการตรวจสอบในโปรดักชัน

สองนิสัยที่ช่วยปิดช่องว่างนั้น

ทดสอบ endpoint ที่โค้ดที่คุณสร้างขึ้นเรียกใช้ เมื่อ Qwen 3.8-Max สร้างบริการหรือเขียน API client ให้นำสเปกที่เกี่ยวข้องเข้าสู่ Apidog และเรียกใช้ endpoint โดยตรง: การไหลของการยืนยันตัวตน, การตอบสนองข้อผิดพลาด, เพย์โหลดกรณีพิเศษ มันถูกกว่ามากที่จะพบข้อสันนิษฐานที่ผิดพลาดในการทดสอบรันกว่าใน stack trace สองวันหลังจากเริ่มเซสชันอัตโนมัติ หากคุณกำลังประเมิน API ของโมเดลก่อนที่จะใช้งานจริง คู่มือ Qwen 3.8 API ครอบคลุมการตั้งค่าโปรโตคอลคู่ทั้ง OpenAI และ Anthropic โดยละเอียด และ Apidog เป็นสถานที่ที่สะดวกในการตรวจสอบรูปทรงของโปรโตคอลทั้งสองแบบเคียงข้างกัน รวมถึงการตอบสนองแบบสตรีมมิ่งและการเปลี่ยนแปลงเหตุผล

จำลอง API เพื่อไม่ให้การรันของเอเจนต์กระทบโปรดักชัน สิ่งนี้มีความสำคัญมากขึ้นยิ่งการรันของคุณยาวนานขึ้น เซสชันอัตโนมัติ 16 วันที่ทำการเรียกใช้จริงกับโครงสร้างพื้นฐานการผลิตเป็นแนวคิดที่แย่มาก: ข้อจำกัดอัตรา, การเปลี่ยนแปลงข้อมูล, บิลที่ไม่คาดคิด เซิร์ฟเวอร์จำลองใน Apidog ให้การตอบสนองที่สมจริงแก่เอเจนต์โดยไม่แตะต้องระบบจริง ชี้โค้ดที่สร้างขึ้นไปยัง URL จำลองระหว่างการรัน สลับกลับไปใช้ URL พื้นฐานจริงเมื่อมนุษย์ได้ตรวจสอบผลลัพธ์ ดาวน์โหลด Apidog ฟรีเพื่อตั้งค่าการจำลองภายในไม่กี่นาที เป็นประกันที่ถูกที่สุดสำหรับการรันของเอเจนต์ที่ไม่ได้เฝ้าดู

รูปแบบนี้เป็นไปในทิศทางเดียวกัน: ยิ่งคุณให้ความเป็นอิสระแก่โมเดลการเขียนโค้ดมากเท่าไหร่ เลเยอร์ API ก็ยิ่งกลายเป็นพื้นผิวควบคุมของคุณ คุณไม่สามารถตรวจสอบทุกคอมมิตได้แบบเรียลไทม์ แต่คุณสามารถควบคุมได้ว่าโค้ดได้รับอนุญาตให้พูดคุยกับอะไรได้บ้าง

คำถามที่พบบ่อย

Qwen 3.8 ดีสำหรับการเขียนโค้ดหรือไม่?

ตามตัวเลขของ Alibaba เอง มันแข็งแกร่งในการเขียนโค้ดสไตล์เอเจนต์และงานวิจัย (Terminal Bench 2.1 ที่ 86.6, PaperBench ที่ 93.0) และอยู่กลาง ๆ ในการแก้ไขบั๊กขนาด repository (SWE-bench Pro ที่ 67.7 เทียบกับ Fable 5 ที่ 80.0) ตัวเลขทั้งหมดเป็นการรันจากผู้ขายโดยยังไม่มีการยืนยันอิสระ การอ่านอย่างซื่อสัตย์: ยอดเยี่ยมสำหรับงานอัตโนมัติระยะยาว ไม่ใช่ผู้นำสำหรับการแก้ไขปัญหาแบบคลาสสิก

ฉันสามารถใช้ Qwen 3.8 ใน Claude Code ได้หรือไม่?

ใช่ อย่างเป็นทางการ ตั้งค่า ANTHROPIC_BASE_URL เป็น https://dashscope-intl.aliyuncs.com/apps/anthropic, ANTHROPIC_AUTH_TOKEN เป็น DashScope key ของคุณ, และ ANTHROPIC_MODEL เป็น qwen3.8-max Alibaba ได้เผยแพร่การกำหนดค่านี้เองและรันเกณฑ์มาตรฐานการเขียนโค้ดส่วนใหญ่บนชุดทดสอบ Claude Code

การเขียนโค้ดกับ Qwen 3.8 มีค่าใช้จ่ายเท่าไหร่?

2 ดอลลาร์ต่อล้านโทเค็นอินพุต และ 6 ดอลลาร์ต่อล้านโทเค็นเอาต์พุต คงที่ตลอดบริบท 1M โทเค็นสำหรับการคิดจะถูกคิดค่าใช้จ่ายเป็นเอาต์พุต และค่าเริ่มต้น xhigh ในความพยายามในการใช้เหตุผลจะสร้างโทเค็นจำนวนมาก ดังนั้นโปรดตั้งงบประมาณที่สูงกว่าราคาที่ระบุสำหรับการทำงานแบบเอเจนต์ การคำนวณต้นทุนทั้งหมดและการเปรียบเทียบอยู่ใน การวิเคราะห์เกณฑ์มาตรฐาน Qwen 3.8 และข้อมูลราคาที่เชื่อมโยงอยู่

การรัน oh-my-cli 16 วันนั้นเป็นไปอย่างอิสระจริงหรือ?

นั่นคือสิ่งที่ Alibaba อ้าง และไม่เหมือนกับการสาธิตของผู้ขายส่วนใหญ่ คุณสามารถตรวจสอบสิ่งประดิษฐ์ได้: repo เป็นสาธารณะที่ qwen-code-dev-bot/oh-my-cli พร้อม 265 คอมมิต, 127 PRs, และ 151 ปัญหา ณ วันที่ 30 กรกฎาคม 2026 คุณภาพของโค้ดนั้นสมเหตุสมผลกับกรอบแนวคิดหรือไม่เป็นการตัดสินที่คุณสามารถทำได้ด้วยตัวเองโดยการอ่าน ซึ่งเป็นสิ่งที่ทำให้การแสดงตัวอย่างนี้น่าเชื่อถือกว่าภาพหน้าจอ

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API