สรุปโดยย่อ: OrcaRouter ได้เผยแพร่น้ำหนักโมเดลที่ถูกปรับแก้ (abliterated weights) สำหรับ GLM-5.3-Flash ซึ่งเป็นโมเดล Mixture-of-Experts ขนาด 320 พันล้านพารามิเตอร์ โดยมี 18 พันล้านพารามิเตอร์ที่ทำงานอยู่ โดยแบ่งเป็นการเผยแพร่ 2 ครั้ง: รูปแบบ block-FP8 ดั้งเดิมเมื่อวันที่ 29 สิงหาคม 2026 และเวอร์ชัน NVFP4 สำหรับ GPU ของ NVIDIA เมื่อวันที่ 31 สิงหาคม ตอนนี้มีการแปลงเป็นรูปแบบ GGUF และ MLX แล้วด้วย อัตราการปฏิเสธที่ผู้ขายรายงานลดลงอย่างมาก ตัวอย่างเช่น MaliciousInstruct ลดลงจาก 96% เหลือ 11% แต่ไม่ถึงศูนย์ ข้ออ้างที่น่าสนใจที่สุดไม่ใช่เรื่องการปลดแบนเลย: OrcaRouter ระบุว่าการจัดแนว (alignment) บางส่วนของ GLM-5.3-Flash ไม่ได้ถูกควบคุมด้วยทิศทางการปฏิเสธเชิงเส้นเดี่ยว ซึ่งจะทำให้การฝึกความปลอดภัยของ Z.ai มีโครงสร้างที่ลึกซึ้งกว่าโมเดลที่เทคนิคนี้มักจะมุ่งเป้า
การปรับแก้ (Abliteration) กลายเป็นเรื่องปกติไปแล้ว ผู้คนนำโมเดลแบบเปิดน้ำหนัก (open-weights model) ระบุทิศทางภายในที่เกี่ยวข้องกับการปฏิเสธ ลบออก แล้วอัปโหลดผลลัพธ์ การเผยแพร่เหล่านี้ส่วนใหญ่ไม่มีอะไรโดดเด่น และการรายงานข่าวส่วนใหญ่ก็มักจะเต็มไปด้วยความตื่นเต้นหรือการตำหนิ
กรณีนี้ควรค่าแก่การอ่านอย่างละเอียด ด้วยเหตุผลที่ไม่ได้เกี่ยวข้องกับสิ่งที่โมเดลจะพูดต่อไปนี้เลย บันทึกการเผยแพร่ประกอบด้วยผลลัพธ์เชิงลบเกี่ยวกับวิธีการแสดงการจัดแนวภายในโมเดล open-weights รุ่นใหม่ และผลลัพธ์เชิงลบในการตีความนั้นหายากและมีประโยชน์มากกว่าการมีจุดตรวจสอบที่ถูกปลดแบนอีกครั้ง
สิ่งที่ถูกเผยแพร่จริง ๆ คืออะไร
มีการประกาศสองครั้ง ห่างกันสองวัน และมีการเปิดตัวรูปแบบอื่น ๆ อย่างเงียบ ๆ ตั้งแต่นั้นเป็นต้นมา
OrcaRouter ได้เผยแพร่น้ำหนักโมเดลที่ถูกปลดแบนสำหรับ GLM-5.3-Flash ด้วยความแม่นยำ block-FP8 ดั้งเดิม ซึ่งหมายความว่าจะไม่มีขั้นตอนการปรับปริมาณใหม่ระหว่างโมเดลพื้นฐานกับโมเดลที่ถูกแก้ไข โมเดลมี 320 พันล้านพารามิเตอร์ โดยมี 18 พันล้านพารามิเตอร์ที่ทำงานอยู่ ซึ่งตรงกับสถาปัตยกรรมของโมเดลพื้นฐาน ซึ่งเราได้กล่าวถึงในหัวข้อ GLM-5.3-Flash คืออะไร และ เปรียบเทียบกับ GLM-5.3 อย่างไร โพสต์ดังกล่าวมีผู้เข้าชมเกิน 2 ล้านครั้งแล้ว

31 สิงหาคม 2026: NVFP4 เวอร์ชันที่สองที่มุ่งเป้าไปที่รูปแบบจุดลอยตัว 4 บิตของ NVIDIA โดยเน้นที่ขนาดที่เล็กลงและการอนุมานที่เร็วขึ้น มีผู้เข้าชมประมาณ 75,000 ครั้ง ซึ่งแสดงให้เห็นว่าการเผยแพร่รูปแบบนี้เป็นที่สนใจของผู้ชมที่เฉพาะเจาะจงมากกว่าต้นฉบับมาก
ตั้งแต่นั้นมา: GGUF และ MLX การประกาศทั้งสองครั้งระบุว่าจะมีการนำรูปแบบควอนไทซ์อื่น ๆ มาใช้ เมื่อตรวจสอบองค์กร Hugging Face ในวันที่ 1 กันยายน 2026 พบว่ามีทั้ง GLM-5.3-Flash-Uncensored-GGUF และ GLM-5.3-Flash-Uncensored-MLX ซึ่งหมายความว่าได้มีการรองรับแพลตฟอร์ม llama.cpp และ Apple Silicon แล้ว ยอดดาวน์โหลดของสองรูปแบบนี้ยังเป็นศูนย์เมื่อเราตรวจสอบ ในขณะที่เวอร์ชัน NVFP4 มียอดดาวน์โหลด 5 ครั้ง เทียบกับ 1,541 ครั้งสำหรับเวอร์ชัน FP8 ดั้งเดิม ความสนใจอยู่ที่การประกาศ ยังไม่ใช่ที่ตัวผลงาน

ข้อควรทราบสำหรับบริบท: นี่คือสายผลิตภัณฑ์ ไม่ใช่เพียงครั้งเดียว องค์กรเดียวกันนี้เป็นโฮสต์ของโมเดล Qwen3.8-27B ที่ถูกปรับแก้ ซึ่งมียอดดาวน์โหลดเกิน 300,000 ครั้งสำหรับเวอร์ชัน FP8 เพียงอย่างเดียว, Qwen3.8-Flash-Next และ Gemma-4-26B การเผยแพร่ GLM นี้เป็นรายการใหม่ล่าสุดในแคตตาล็อกที่มีอยู่แล้ว
น้ำหนักโมเดลนี้อยู่ภายใต้ใบอนุญาต MIT และระบุว่า zai-org/GLM-5.3-Flash เป็นโมเดลพื้นฐาน การ์ดโมเดลระบุว่าเป็นโมเดลที่ถูกปรับแก้, วิทัศน์-ภาษา, MoE และสามารถเรียกใช้ฟังก์ชันได้ ดังนั้นความสามารถแบบมัลติโมดอลและเครื่องมือของโมเดลพื้นฐานจึงยังคงอยู่
ความหมายของ “ไม่มี LoRA, ไม่มีพรอมต์เจลเบรก”
การใช้ถ้อยคำในประกาศนี้มีความสำคัญและควรพิจารณาให้ละเอียด เนื่องจากมันแตกต่างจากสองสิ่งที่คนส่วนใหญ่มักจะนึกถึง
พรอมต์เจลเบรก (jailbreak prompt) คือการจัดการโมเดลในขณะอนุมาน การฝึกความปลอดภัยยังคงอยู่ คุณเพียงแค่พูดหลบเลี่ยงมัน มันเปราะบาง ถูกแก้ไขได้ และทำให้คุณต้องเสียบริบทในการร้องขอทุกครั้ง
อะแดปเตอร์ LoRA (LoRA adapter) คือชุดน้ำหนักเพิ่มเติมขนาดเล็กที่ถูกซ้อนทับเมื่อโหลด โมเดลพื้นฐานไม่เปลี่ยนแปลงและอะแดปเตอร์สามารถถอดออกได้ มันคือการปรับเปลี่ยนที่คุณแนบเข้าไป
การปรับแก้ (Abliteration) คือการระบุทิศทางการกระตุ้นภายในที่สอดคล้องกับพฤติกรรมการปฏิเสธและแก้ไขออกจากน้ำหนักโมเดลโดยตรง ไม่มีอะไรต้องแนบและไม่มีอะไรต้องถอดออก พฤติกรรมการปฏิเสธได้หายไปจากตัวผลงาน ไม่ได้ถูกระงับในขณะรันไทม์
ความแตกต่างนี้มีความสำคัญในทางปฏิบัติ คุณไม่สามารถตรวจสอบโมเดลที่ถูกปรับแก้โดยการตรวจสอบอะแดปเตอร์หรือสแกนพรอมต์ได้ เพราะการเปลี่ยนแปลงอยู่ในน้ำหนักโมเดล หากคุณกำลังรันโมเดลแบบเปิดในสภาพแวดล้อมใดก็ตามที่แหล่งที่มามีความสำคัญ การตรวจสอบสายผลิตภัณฑ์ของโมเดลพื้นฐานเทียบกับจุดตรวจสอบจริงกลายเป็นคำถามสำคัญในห่วงโซ่อุปทาน ตอนนี้ มุมมองทั่วไปของเราในการจำกัดสิ่งที่โมเดลได้รับอนุญาตให้ทำอยู่ในหัวข้อ การป้องกันเอไอเอเจนต์
ตัวเลขการปฏิเสธ
นี่คือตัวเลขที่ OrcaRouter รายงานเอง ทั้งก่อนและหลัง และยังไม่มีการจำลองที่เป็นอิสระในขณะที่เขียนบทความนี้ โปรดพิจารณาว่าเป็นตัวเลขที่ผู้ขายรายงาน
| Benchmark | Base refusal | After abliteration |
|---|---|---|
| MaliciousInstruct | 96% | 11% |
| JailbreakBench | 93% | 12% |
| AdvBench | 97% | 15% |
| HarmBench | 93% | 18% |
| XSTest benign over-refusal | 2.4% | 0.4% |
ควรอ่านบรรทัดสุดท้ายแตกต่างจากสี่บรรทัดแรก XSTest วัดการปฏิเสธเกินจริง (over-refusal) ซึ่งหมายถึงการที่โมเดลปฏิเสธคำขอที่ไม่เป็นอันตรายซึ่งมีลักษณะที่คล้ายคลึงกับสิ่งที่อาจเป็นอันตราย นั่นคือข้อผิดพลาดที่นักพัฒนาพบเจอในสถานการณ์จริง: โมเดลปฏิเสธที่จะช่วยดีบักขั้นตอนการเข้าสู่ระบบเพราะมีคำว่า "รหัสผ่าน" ปรากฏอยู่ หรือปฏิเสธที่จะเขียนเครื่องสแกนเครือข่ายสำหรับโครงสร้างพื้นฐานของคุณเอง การลดลงจาก 2.4% เหลือ 0.4% คือบรรทัดที่มีคุณค่าในชีวิตประจำวันอย่างแท้จริง และเป็นสิ่งที่ไม่ค่อยมีใครพูดถึง
สี่บรรทัดแรกคือสิ่งที่ทำให้สิ่งนี้เป็นผลงานวิจัยมากกว่าเครื่องมือเพื่อเพิ่มประสิทธิภาพ และเป็นเหตุผลว่าทำไมใบอนุญาตและกฎหมายท้องถิ่นของคุณจึงมีความสำคัญมากกว่าปกติในที่นี้
สิ่งที่คุณจะได้รับจริง ๆ
การรายงานข่าวส่วนใหญ่เกี่ยวกับโมเดลที่ถูกปรับแก้ (abliterated models) มักจะถกเถียงกันว่าควรมีอยู่หรือไม่ และไม่เคยกล่าวถึงเหตุผลว่าทำไมวิศวกรที่ทำงานอยู่จะเลือกใช้โมเดลเหล่านี้ มีข้อดีที่แท้จริงสี่ประการ และไม่ใช่สิ่งที่ตัวเลขพาดหัวข่าวแนะนำ
มันหยุดปฏิเสธงานที่ไม่เคยเป็นอันตราย นี่คือข้อดีที่สำคัญที่สุด และเป็นบรรทัด XSTest: การปฏิเสธเกินจริงที่ไม่เป็นอันตรายลดลงจาก 2.4% เหลือ 0.4% การปฏิเสธเกินจริงคือภาระที่นักพัฒนาทุกคนต้องจ่ายอยู่แล้วสำหรับโมเดลที่ได้รับการปรับแต่งด้านความปลอดภัย โมเดลที่ไม่ยอมช่วยคุณแก้ไขปัญหาการรีเซ็ตรหัสผ่านเพราะเห็นคำว่า "รหัสผ่าน" โมเดลที่ปฏิเสธการเขียนเครื่องสแกนพอร์ตสำหรับโครงสร้างพื้นฐานที่คุณเป็นเจ้าของ โมเดลที่ปฏิเสธการสรุปรายงานภัยคุกคามเพราะรายงานอธิบายถึงภัยคุกคาม ไม่มีสิ่งใดเป็นผลดีด้านความปลอดภัยเลย มันคือการที่โมเดลไม่สามารถแยกแยะหัวข้อกับเจตนาได้ และคุณต้องจ่ายค่าเสียหายจากการลองใหม่, การปรับคำสั่งใหม่ และงานที่ถูกละทิ้ง การลดอัตรานั้นลงถึงหกเท่าคือข้อดีที่น่าจะปรากฏให้เห็นในสัปดาห์ของคุณมากที่สุด
ไม่มีค่าใช้จ่ายต่อการร้องขอ และไม่มีอะไรให้ต้องกังวลว่าจะพัง ทางเลือกที่คนส่วนใหญ่ใช้ในปัจจุบันคือการใช้ prompt engineering เพื่อหลีกเลี่ยงการปฏิเสธ ซึ่งจะเพิ่มภาระด้านบริบทในการเรียกใช้ทุกครั้ง ทำให้ได้ผลลัพธ์ที่ไม่สอดคล้องกัน และจะหยุดทำงานเมื่อผู้ให้บริการแก้ไข การปรับเปลี่ยนระดับน้ำหนักโมเดลไม่มีคุณสมบัติเหล่านั้น พฤติกรรมเป็นคุณสมบัติของผลงาน ดังนั้นมันจึงเสถียรกับการร้องขอหลายครั้งและไม่เปลี่ยนแปลงอย่างเงียบ ๆ ในวันอังคาร
น้ำหนักที่เปิดเผย (Open weights) หมายถึงการติดตั้งใช้งานเป็นของคุณเอง ได้รับอนุญาตแบบ MIT, สามารถโฮสต์เองได้ และสามารถปักหมุดไปยังจุดตรวจสอบที่แน่นอนได้ พรอมต์และเอกสารของคุณจะยังคงอยู่ในโครงสร้างพื้นฐานของคุณ แทนที่จะส่งผ่านผู้จำหน่าย คุณจะไม่ได้รับผลกระทบจากการที่ผู้ให้บริการกระชับตัวกรองในช่วงกลางไตรมาสและทำให้เวิร์กโฟลว์ที่คุณเผยแพร่หยุดชะงัก สำหรับสภาพแวดล้อมที่มีการควบคุม การควบคุมนี้มักจะเป็นประเด็นสำคัญ และข้อโต้แย้งเดียวกันนี้ก็ใช้ได้กับน้ำหนักโมเดลที่ไม่ได้แก้ไข ซึ่งเป็นเหตุผลที่เราเขียน การโฮสต์ GLM-5.3 open weights ด้วยตนเอง
ความสามารถยังคงอยู่ การ์ดโมเดลยังคงระบุถึงความสามารถด้านวิทัศน์-ภาษา และการเรียกใช้ฟังก์ชัน ดังนั้นนี่ไม่ใช่การสร้างแบบตัดทอนเฉพาะข้อความ เส้นทางมัลติโมดอลและเครื่องมือของโมเดลพื้นฐานยังคงอยู่ ซึ่งมีความสำคัญหากคุณวางแผนที่จะใช้มันสำหรับงานที่มีลักษณะเป็นเอเจนต์มากกว่าสำหรับการแชท
ตอนนี้มาดูข้อจำกัดที่แท้จริงของทั้งหมดนี้ ข้อดีเหล่านี้ไม่ใช่การปรับปรุงความสามารถ การปรับแก้ (Abliteration) คือการแก้ไขพฤติกรรม งานวิจัยที่ตีพิมพ์เกี่ยวกับเทคนิคนี้โดยทั่วไปพบว่ามีค่าใช้จ่ายด้านคุณภาพบางอย่าง และไม่มีการประกาศใด ๆ รายงานว่าประสิทธิภาพด้านการให้เหตุผล การเขียนโค้ด หรือวิทัศน์มีการเปลี่ยนแปลงหรือไม่ คุณกำลังแลกการลดการปฏิเสธที่วัดได้กับความเสี่ยงที่ไม่สามารถวัดได้ของการเสื่อมประสิทธิภาพ และการตัดสินใจในการกรองทุกอย่างที่โมเดลพื้นฐานเคยทำ ตอนนี้เป็นหน้าที่ของคุณ ซึ่งเป็นค่าใช้จ่ายด้านบุคลากรและการตรวจสอบจริง ๆ แทนที่จะเป็นค่าใช้จ่ายที่ประหยัดได้
ส่วนที่น่าสนใจจริง ๆ
สิ่งที่ถูกซ่อนอยู่ท้ายประกาศคือสิ่งที่ควรค่าแก่การอ่าน
การปฏิเสธไม่ได้ลดลงเป็นศูนย์โดยสม่ำเสมอ ในสี่เกณฑ์มาตรฐานความเสียหาย มันอยู่ที่ระหว่าง 11% ถึง 18% ไม่ใช่ 0% ถึง 2% การตีความที่ OrcaRouter ระบุไว้คือ การจัดแนว (alignment) บางส่วนของ GLM-5.3-Flash ไม่ได้ถูกควบคุมโดยทิศทางการปฏิเสธเชิงเส้นเดี่ยว และ Z.ai อาจสร้างกลไกการปฏิเสธที่ลึกซึ้งกว่าที่เทคนิคนี้มักจะพบมาก
นี่คือข้อกล่าวอ้างเกี่ยวกับโครงสร้างภายในของโมเดล และหากข้อกล่าวอ้างนี้ถูกต้อง มันจะมีความสำคัญมากกว่าการเผยแพร่โมเดลเอง
โมเดลความคิดมาตรฐานสำหรับการปรับแก้ (abliteration) คือการปฏิเสธส่วนใหญ่เป็นทิศทางเดียวในพื้นที่กระตุ้น ค้นหามัน ลบออก และพฤติกรรมก็จะพังลง มันทำงานได้ดีพอในหลายโมเดลจนผู้คนถือว่ามันเป็นเรื่องที่ตกลงกันแล้ว โมเดลที่กระบวนการนั้นทำให้คุณลดจาก 96% เหลือ 11% แต่ติดอยู่ที่นั่น เป็นหลักฐานว่าโมเดลความคิดไม่สมบูรณ์ อย่างน้อยก็สำหรับโมเดลนี้ และการจัดแนวบางอย่างยังคงอยู่ในรูปแบบที่เทคนิคไม่สามารถเข้าถึงได้
สองข้อควรระวังที่ซื่อสัตย์ ประการแรก นี่คือการตีความผลลัพธ์ของห้องปฏิบัติการเดียว และคำอธิบายทางเลือกก็คือการใช้งานของพวกเขาทำให้ประสิทธิภาพลดลง ประการที่สอง อัตราการปฏิเสธที่เหลือ 11% ถึง 18% ไม่ใช่คุณสมบัติความปลอดภัยที่ใครควรพึ่งพา โมเดลที่ปฏิเสธคำขอที่เป็นอันตราย 15% ไม่ใช่โมเดลที่ปลอดภัย; มันเป็นโมเดลที่ไม่น่าเชื่อถือ
ถึงกระนั้น "เทคนิคของเราถึงขีดจำกัด และเราคิดว่าเหตุผลคือสถาปัตยกรรม" เป็นเรื่องที่ห้องปฏิบัติการมักจะไม่ได้กล่าวถึงในโพสต์เปิดตัว การที่ OrcaRouter นำเสนอการเผยแพร่ในฐานะผลงานเพื่อศึกษาว่าการจัดแนวถูกนำเสนออย่างไร แทนที่จะเป็นเพียงการลดความสามารถลง ถือเป็นแนวทางที่ดีกว่าในการเผยแพร่งานนี้
ข้ออ้างที่ควรตรวจสอบ
มีสองประเด็นในบทความนี้ที่ควรได้รับการพิจารณาอย่างถี่ถ้วน และการชี้ให้เห็นประเด็นเหล่านี้ไม่ได้เป็นการลดทอนคุณค่าของการเผยแพร่
“ความฉลาดระดับ Claude Opus 4.8” โพสต์ติดตามผลอธิบายว่าการเผยแพร่นี้เป็นการติดอาวุธให้ผู้ป้องกันด้วยความฉลาดในระดับนั้น ไม่มีการเปรียบเทียบกับเกณฑ์มาตรฐานประกอบข้ออ้างนี้ และเป็นการเปรียบเทียบกับเวอร์ชันของโมเดลที่ไม่ใช่รุ่น Opus ปัจจุบัน ให้ถือว่าเป็นกลยุทธ์ทางการตลาด หากความสามารถที่เท่าเทียมกันมีความสำคัญต่อกรณีการใช้งานของคุณ ให้ทำการประเมินด้วยตนเอง
อัตราการปฏิเสธเป็นตัวชี้วัดความสามารถ การปฏิเสธต่ำไม่ได้หมายถึงความสามารถสูง การปรับแก้ (Abliteration) เป็นการแก้ไขพฤติกรรม และงานวิจัยที่ตีพิมพ์เกี่ยวกับเทคนิคนี้โดยทั่วไปพบว่าประสิทธิภาพโดยรวมลดลงเป็นค่าใช้จ่าย ไม่มีสิ่งใดในการประกาศทั้งสองกล่าวถึงว่าประสิทธิภาพด้านการให้เหตุผล การเขียนโค้ด หรือวิทัศน์มีการเปลี่ยนแปลงเมื่อเทียบกับโมเดลพื้นฐานหรือไม่ และนั่นคือตัวเลขที่ผู้อ่านส่วนใหญ่ต้องการทราบจริง ๆ การครอบคลุมเกณฑ์มาตรฐานและราคาของโมเดลที่ไม่ได้แก้ไขของเราอยู่ในหัวข้อ ราคาของ GLM-5.3-Flash และ คู่มือ API ของ GLM-5.3-Flash
การเรียกใช้และการประมวลผลฮาร์ดแวร์
โมเดลขนาด 320 พันล้านพารามิเตอร์ไม่ใช่โมเดลที่เหมาะกับแล็ปท็อป แม้จะมี 18 พันล้านพารามิเตอร์ที่ทำงานอยู่ รูปแบบที่มีอยู่ในปัจจุบันจะกำหนดว่าใครสามารถเรียกใช้มันได้อย่างเป็นจริง:
- Block-FP8 ซึ่งเป็นเวอร์ชันแรกที่เผยแพร่ มุ่งเป้าไปที่ GPU ในศูนย์ข้อมูลและเป็นผลงานอ้างอิง
- NVFP4 แลกเปลี่ยนความแม่นยำกับขนาดที่เล็กลงบนฮาร์ดแวร์ NVIDIA ซึ่งเป็นแนวทางปฏิบัติสำหรับการติดตั้งใช้งานแบบโหนดเดียว
- GGUF เปิดเส้นทาง llama.cpp ซึ่งเป็นที่ที่การควอนไทซ์มีความเข้มข้นเพียงพอสำหรับเวิร์คสเตชันระดับสูง
- MLX มุ่งเป้าไปที่ Apple Silicon ซึ่งสำหรับโมเดลขนาดนี้หมายถึงการกำหนดค่าหน่วยความจำรวมขนาดใหญ่มาก
หากคุณโฮสต์เองแทนที่จะเรียกใช้ปลายทางแบบโฮสต์ บทแนะนำของเราสำหรับโมเดลพื้นฐานสามารถนำมาใช้ได้โดยตรง: การรัน GLM-5.3-Flash บนเครื่องของคุณ และ การโฮสต์ GLM-5.3 open weights ด้วยตนเอง สำหรับบริบทที่กว้างขึ้นเกี่ยวกับหมวดหมู่นี้ เราได้จัดทำ การสำรวจ LLM ที่ไม่ถูกเซ็นเซอร์ และบทความเกี่ยวกับ LLM ที่ไม่มีข้อจำกัด และ การเผยแพร่ DeepSeek R1 ที่ถูกปรับแก้ เป็นการเปรียบเทียบก่อนหน้าซึ่งใกล้เคียงที่สุด
การประเมินนี้คือปัญหาการทดสอบ API
นี่คือส่วนที่ใช้งานได้จริง และเป็นส่วนที่การรายงานข่าวส่วนใหญ่ข้ามไปโดยสิ้นเชิง
หากคุณกำลังทำงานจริงกับโมเดลเช่นนี้ ซึ่งหมายถึงการวิจัยด้านความปลอดภัย, การฝึกซ้อมของทีมแดงและทีมน้ำเงิน, หรือการประเมินเชิงป้องกันว่าตัวกรองของคุณสามารถจับอะไรได้บ้าง งานจริงคือการรันชุดคำขอขนาดใหญ่ที่ทำซ้ำได้กับปลายทาง (endpoint) และยืนยันผลลัพธ์ที่ได้กลับมา นั่นคือการทดสอบ API มันไม่ใช่วิธีการใหม่ เพียงเพราะเนื้อหาการตอบกลับมีผลลัพธ์ของโมเดล
ปัญหาเฉพาะที่คุณจะเจอ:
- คุณต้องมีชุดการทดสอบเดียวกันสำหรับเป้าหมายหลายรายการ เช่น FP8 เทียบกับ NVFP4 เทียบกับ GGUF เทียบกับโมเดลพื้นฐานที่ไม่ได้แก้ไข เทียบกับปลายทางที่โฮสต์ไว้ คำขอเดียวกัน, URL พื้นฐานที่แตกต่างกัน, ผลลัพธ์ที่คุณสามารถเปรียบเทียบได้ หากไม่เป็นเช่นนั้น คุณจะไม่สามารถระบุได้ว่าการเปลี่ยนแปลงพฤติกรรมเกิดจากการควอนไทเซชันหรือจากการสุ่มตัวอย่าง
- คุณต้องการการยืนยัน ไม่ใช่เพียงแค่การมองเห็นด้วยตาเปล่า อัตราการปฏิเสธคือเปอร์เซ็นต์ของพรอมต์หลายร้อยรายการ การอ่านบันทึกการสนทนาไม่สามารถทำได้ในขนาดใหญ่และไม่สามารถทำซ้ำได้
- คุณต้องการให้มันรันอีกครั้งในเดือนหน้า น้ำหนักโมเดลมีการอัปเดต การควอนไทเซชันถูกเผยแพร่ใหม่ และตัวเลขที่คุณวัดได้เพียงครั้งเดียวไม่สามารถอ้างอิงในภายหลังได้ การรัน regression เป็นจุดประสงค์ทั้งหมด
- ความไม่แน่นอนเป็นส่วนที่ยากที่สุด พรอมต์เดียวกันให้ผลลัพธ์ที่แตกต่างกัน การยืนยันของคุณต้องตรวจสอบการจำแนกประเภทของการตอบกลับแทนที่จะเป็นการเปรียบเทียบสตริง และชุดการทดสอบของคุณต้องมีตัวอย่างเพียงพอเพื่อให้ค่าอัตรามีความหมาย เราได้เขียนเกี่ยวกับปัญหานี้โดยตรงในหัวข้อ การทดสอบเอไอเอเจนต์ที่ไม่กำหนดผลลัพธ์
- การเรียกใช้เครื่องมือต้องมีการตรวจสอบของตนเอง การ์ดโมเดลระบุความสามารถในการเรียกใช้ฟังก์ชัน และโมเดลที่ถูกปรับแก้ (abliterated model) ที่จะเรียกใช้เครื่องมือที่ไม่ควรทำนั้นมีความเสี่ยงที่แตกต่างจากโมเดลที่สร้างเพียงข้อความ นั่นเป็นคำถามเกี่ยวกับโครงสร้างและสัญญา ก่อนที่จะเป็นคำถามด้านความปลอดภัย
นี่คือสิ่งที่แพลตฟอร์ม API มีไว้สำหรับ ใน Apidog คุณกำหนด endpoint เพียงครั้งเดียว เก็บชุด prompt เป็น collection ที่บันทึกไว้ ยืนยันผลลัพธ์จาก response fields สลับ base URL ระหว่างผู้ให้บริการหรือการทำ quantizations ผ่าน environment variables และรันทุกอย่างใน CI เพื่อให้ตัวเลขสามารถทำซ้ำได้แทนที่จะเป็นเพียงเรื่องเล่า เราได้สาธิตกลไกนี้กับโมเดลที่ไม่ได้แก้ไขใน การทดสอบ GLM-5.3-Flash API ด้วย Apidog และการตั้งค่าเดียวกันนี้สามารถใช้กับ endpoint ที่รองรับ OpenAI ได้ทุกแห่ง

หลักการทั่วไปนี้ใช้ได้ดีเกินกว่าโมเดลนี้: เมื่อพฤติกรรมของโมเดลกลายเป็นสิ่งที่คุณต้องวัดและปกป้อง คุณต้องมีระเบียบวินัยเช่นเดียวกับที่คุณใช้กับสัญญา API อื่นๆ ดาวน์โหลด Apidog หากการประเมินของคุณในปัจจุบันอยู่ในโน้ตบุ๊กที่ไม่มีใครสามารถรันซ้ำได้ บทความที่เกี่ยวข้อง: ความน่าเชื่อถือของ AI agent ในการผลิต
งานของทีมแดงต้องการบันทึกการตรวจสอบ ไม่ใช่เพียงแค่เทอร์มินัล
ปัญหาในทางปฏิบัติข้อที่สองคือปัญหาด้านองค์กร และสำหรับงานประเภทนี้ มันไม่ใช่ทางเลือก
การทดสอบเกณฑ์มาตรฐานที่อาจเป็นอันตรายต่อโมเดลที่ถูกปรับแก้ (abliterated model) เป็นกิจกรรมที่ต้องได้รับการอนุมัติก่อนที่จะดำเนินการ และสามารถระบุที่มาได้ภายหลัง ใครเป็นผู้ดำเนินการ กับจุดตรวจสอบใด ได้รับการอนุมัติจากใคร ภายใต้ขอบเขตใด หากบันทึกนั้นอยู่ในประวัติเชลล์ของนักวิจัยคนเดียว คุณจะไม่มีโครงการวิจัย แต่คุณจะมีภาระผูกพัน
Sharkly ถูกสร้างขึ้นมาเพื่องานที่ต้องบันทึกไว้ได้นานกว่าช่วงเวลาใช้งาน และกรณีการใช้งานนี้เข้ากันได้อย่างผิดปกติ:
- งานใน Backlog จะไม่เริ่มต้นการรันทันที การประเมินที่ละเอียดอ่อนจะถูกเตรียมการ กำหนดขอบเขต และอนุมัติก่อนที่จะมีการดำเนินการใด ๆ ประตูนี้เป็นคุณสมบัติที่มีค่าที่สุดในที่นี้
- งานคือบันทึก ไม่ใช่พรอมต์ ความคืบหน้า การเรียกใช้เครื่องมือ และผลลัพธ์จะถูกส่งกลับมา และผลลัพธ์ของเอเจนต์จะถูกจัดเก็บเป็นความคิดเห็นที่คุณสามารถตอบกลับได้ หกเดือนต่อมาก็จะมีคำตอบว่าอะไรถูกรันและเพราะเหตุใด
- Crew คือหัวหน้าเอเจนต์บวกกับเอเจนต์และผู้คนอื่นๆ โดยรันแบบหัวหน้าเป็นอันดับแรก การทำงานของทีมแดงที่มีผู้ตรวจสอบอยู่ในวงจรเป็นรูปแบบปกติ ไม่ใช่ข้อยกเว้น
- การดำเนินการนั้นนำมาเอง (bring your own) คุณเชื่อมต่อคอมพิวเตอร์ ซึ่งอาจเป็นแล็ปท็อป เซิร์ฟเวอร์ หรือคอนเทนเนอร์ และ Sharkly ใช้ Runtime ที่ติดตั้งอยู่แล้ว สำหรับโมเดล 320B นี่มีความสำคัญอย่างเป็นรูปธรรม: น้ำหนักโมเดลอยู่ในกล่อง GPU เฉพาะ และการระบุอย่างชัดเจนว่าเครื่องใดรันการประเมินที่ละเอียดอ่อนคือการควบคุม ไม่ใช่ภาระเพิ่มเติม
- โครงสร้างที่ทีมเข้าใจอยู่แล้ว: Spaces, Projects, Sprints และ Tasks พร้อมกับการซิงค์กับ Jira

โมเดลที่ไม่ถูกเซ็นเซอร์เป็นเครื่องมือวิจัย การใช้เครื่องมือวิจัยโดยไม่มีการบันทึกคือสิ่งที่ทำให้องค์กรไม่สามารถอธิบายสิ่งที่เกิดขึ้นได้ในที่สุด
ความเป็นจริงทางกฎหมายและความปลอดภัย
สั้น ๆ และควรระบุให้ชัดเจน
ใบอนุญาต MIT ที่กำหนดบนน้ำหนักโมเดลนั้นควบคุมตัวน้ำหนักโมเดลเอง มันไม่ได้อนุญาตให้คุณทำสิ่งผิดกฎหมายด้วยผลลัพธ์ที่ได้ และมันไม่ได้โอนความรับผิดชอบไปจากคุณ กฎหมายท้องถิ่น, นโยบายของนายจ้างของคุณ, และเงื่อนไขแพลตฟอร์มใด ๆ ที่คุณดำเนินการภายใต้ทั้งหมดนี้ยังคงมีผลใช้บังคับ และไม่มีใครสนใจว่าโมเดลไม่ได้ปฏิเสธ
การใช้งานที่สมเหตุสมผลคือสิ่งที่การเผยแพร่ระบุไว้: การวิจัยด้านความปลอดภัย, งานด้านการตีความ, การฝึกซ้อมของทีมแดงและทีมน้ำเงิน, และการศึกษา mechanism การปฏิเสธ การปรับปรุงการปฏิเสธเกินจริงของ XSTest ก็เป็นข้อโต้แย้งที่ถูกต้องในชีวิตประจำวันเช่นกัน สำหรับทีมที่ปัญหาจริงคือโมเดลที่ไม่ยอมช่วยงานวิศวกรรมความปลอดภัยทั่วไป
หากคุณกำลังติดตั้งใช้งานโมเดลใดๆ ให้กับผู้ใช้งานปลายทาง จุดตรวจสอบที่ไม่ถูกเซ็นเซอร์จะย้ายภาระการกรองทั้งหมดไปยังระบบของคุณเอง นั่นคือการตัดสินใจออกแบบที่มีผลกระทบต่อบุคลากรและการตรวจสอบ ไม่ใช่แค่ธงการตั้งค่าเท่านั้น
คำถามที่พบบ่อย
GLM-5.3-Flash-Uncensored เป็นโมเดลเดียวกับ GLM-5.3-Flash หรือไม่? สถาปัตยกรรมเดียวกันและน้ำหนักพื้นฐานเดียวกัน 320 พันล้านพารามิเตอร์โดยมี 18 พันล้านพารามิเตอร์ที่ทำงานอยู่ โดยมีการแก้ไขพฤติกรรมการปฏิเสธออกไป รายละเอียดของโมเดลพื้นฐานอยู่ในหัวข้อ GLM-5.3-Flash คืออะไร
ตัวเลขการประเมินได้รับการตรวจสอบโดยอิสระหรือไม่? ไม่ ตัวเลขทุกตัวในการประกาศเป็นผลลัพธ์ที่ OrcaRouter รายงานเอง และไม่มีการจำลองโดยบุคคลที่สามในขณะที่เราเขียนบทความนี้ เกณฑ์มาตรฐานที่ระบุนั้นเป็นของจริงและสาธารณะ ดังนั้นการจำลองจึงเป็นไปได้หากคุณมีฮาร์ดแวร์
ฉันควรใช้รูปแบบใด? FP8 คือผลงานอ้างอิงและเป็นรูปแบบที่ใช้ในการประเมินผล NVFP4 คือเส้นทางปฏิบัติสำหรับ NVIDIA แบบโหนดเดียว GGUF และ MLX มีอยู่แล้วและเป็นเส้นทางสำหรับเวิร์คสเตชันและการตั้งค่า Apple Silicon คาดว่าพฤติกรรมจะเปลี่ยนแปลงไปกับการควอนไทซ์ ซึ่งเป็นเหตุผลว่าทำไมคุณถึงต้องการชุดการทดสอบที่สามารถทำซ้ำได้ แทนที่จะเป็นการตรวจสอบแบบผิวเผิน
การปรับแก้ (abliteration) ส่งผลกระทบต่อประสิทธิภาพโดยรวมหรือไม่? งานที่เผยแพร่เกี่ยวกับเทคนิคนี้โดยทั่วไปพบว่ามีประสิทธิภาพลดลงบ้าง และไม่มีประกาศใดๆ กล่าวถึงเรื่องนี้สำหรับโมเดลนี้ หากความสามารถมีความสำคัญต่อคุณ ให้ทำการทดสอบเปรียบเทียบกับโมเดลพื้นฐานด้วยตนเอง แทนที่จะสันนิษฐานว่ามีความเท่าเทียมกัน
ทำไมการปฏิเสธจึงหยุดที่ 11 ถึง 18 เปอร์เซ็นต์ แทนที่จะเป็นศูนย์? นั่นคือคำถามที่เปิดกว้างและเป็นสิ่งที่น่าสนใจที่สุดในการเผยแพร่ OrcaRouter แสดงมุมมองว่าการจัดแนว (alignment) บางส่วนไม่ได้ถูกควบคุมโดยทิศทางการปฏิเสธเชิงเส้นเดี่ยว คำอธิบายที่แตกต่างกันคือการใช้งานที่ไม่สมบูรณ์ ไม่ว่าในกรณีใด อย่าถือว่าอัตราที่เหลืออยู่เป็นคุณสมบัติความปลอดภัย
ฉันสามารถใช้สิ่งนี้ในเชิงพาณิชย์ได้หรือไม่? น้ำหนักโมเดลได้รับอนุญาตแบบ MIT ซึ่งเป็นแบบอนุญาตที่ยืดหยุ่น นี่คือคำตอบด้านการอนุญาตใช้งาน ไม่ใช่คำตอบด้านกฎหมายหรือนโยบายสำหรับการติดตั้งใช้งานเฉพาะของคุณ โปรดสอบถามทีมกฎหมายของคุณ โดยเฉพาะอย่างยิ่งหากผลลัพธ์ไปถึงผู้ใช้งานปลายทาง
สรุป
มีการเผยแพร่สองรูปแบบในสามวัน มีผู้เข้าชม 2 ล้านครั้งในครั้งแรก และมีแคตตาล็อกของโมเดลที่ถูกปรับแก้อยู่เบื้องหลัง การปลดแบนนั้นเป็นเรื่องปกติในตอนนี้
ส่วนที่ควรเก็บไว้คือผลลัพธ์เชิงลบ เทคนิคที่มักจะทำให้การปฏิเสธในโมเดลเปิดส่วนใหญ่ลดลงอย่างน่าเชื่อถือได้ ทำให้ GLM-5.3-Flash ลดลงจาก 96% เหลือ 11% และหยุดนิ่ง และห้องปฏิบัติการที่ทำสิ่งนี้ก็ประกาศต่อสาธารณะ แทนที่จะปัดเศษขึ้น หากสิ่งนี้ยังคงอยู่ภายใต้การจำลองอิสระ มันก็บอกอะไรบางอย่างที่เป็นจริงเกี่ยวกับวิธีที่ Z.ai ฝึกโมเดลนี้ และมันเป็นผลงานที่ดีกว่าจุดตรวจสอบ
หากคุณจะทำงานกับมัน ให้ทำส่วนที่น่าเบื่ออย่างถูกต้อง วัดพฤติกรรมด้วยชุดคำขอที่สามารถทำซ้ำได้ซึ่งคุณสามารถชี้ไปยังปลายทางใดก็ได้และรันซ้ำในเดือนหน้า ซึ่งเป็นสิ่งที่ Apidog มีไว้เพื่อสิ่งนั้น เก็บประวัติว่าใครรันอะไรกับน้ำหนักโมเดลใดและใครอนุมัติ ซึ่งเป็นสิ่งที่ Sharkly มีไว้เพื่อสิ่งนั้น
โมเดลที่ไม่ถูกเซ็นเซอร์ไม่ได้ลบภาระผูกพันในการรู้ว่าคุณรันอะไร มันกลับเพิ่มภาระผูกพันนั้นขึ้นไปอีก
