ราคา GLM-5.3-Flash: เท่าไหร่ก่อนและหลังโปรโมชั่นเปิดตัว

GLM-5.3-Flash ลดครึ่งราคาจนถึงวันที่ 9 กันยายน 2026 อัตราค่าบริการตามรายการ, ตัวอย่างการคำนวณต้นทุน, และกลไกการปรับอินพุตที่แคชและความพยายามในการประมวลผล

Medy Evrard

27 August 2026

ราคา GLM-5.3-Flash: เท่าไหร่ก่อนและหลังโปรโมชั่นเปิดตัว

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

GLM-5.3-Flash ลดราคาครึ่งหนึ่งอยู่ในขณะนี้ โปรโมชั่นจะสิ้นสุดในวันที่ 9 กันยายน 2026 และเมื่อถึงเวลานั้น การคาดการณ์ค่าใช้จ่ายทั้งหมดที่อ้างอิงจากอัตราปัจจุบันจะเพิ่มขึ้นเป็นสองเท่า

บทความนี้ครอบคลุมถึงค่าใช้จ่ายของโมเดลในปัจจุบัน ค่าใช้จ่ายหลังจากนั้น การเปรียบเทียบกับทางเลือกอื่น และวิธีพิจารณาว่าความแตกต่างนั้นสำคัญต่อปริมาณงานของคุณจริงหรือไม่ ตัวเลขทั้งหมดได้รับการตรวจสอบเมื่อวันที่ 27 สิงหาคม 2026 และหน้าการกำหนดราคาอาจมีการเปลี่ยนแปลง ดังนั้นโปรดยืนยันกับผู้ให้บริการของคุณก่อนที่จะกำหนดงบประมาณ

ตารางราคา

ราคาเปิดตัว (ถึง 9 ก.ย. 2026) ราคาปกติ (หลังจากนั้น)
อินพุต $0.075 / 1 ล้านโทเค็น $0.15 / 1 ล้านโทเค็น
เอาต์พุต $0.25 / 1 ล้านโทเค็น $0.50 / 1 ล้านโทเค็น
อินพุตที่แคชไว้ $0.015 / 1 ล้านโทเค็น $0.03 / 1 ล้านโทเค็น

Artificial Analysis ได้เผยแพร่ตัวเลขรวมโดยเฉลี่ยที่ $0.10 ต่อล้านโทเค็น โดยใช้อัตราส่วน cache-hit ต่ออินพุตต่อเอาต์พุตที่ 7:2:1 ซึ่งเป็นตัวเลขเดี่ยวที่มีประโยชน์สำหรับการเปรียบเทียบราคา แม้ว่าอัตราส่วนของคุณเองจะเป็นตัวกำหนดค่าใช้จ่ายของคุณ

ค่าใช้จ่ายจริง

อัตราต่อล้านโทเค็นที่เป็นนามธรรมนั้นยากที่จะทำความเข้าใจ ดังนั้นนี่คือปริมาณงานสามแบบที่เป็นรูปธรรมที่ ราคาปกติ ซึ่งเป็นตัวเลขที่สำคัญสำหรับการวางแผนหลังวันที่ 9 กันยายน

ระบบคัดแยกคำขอสนับสนุน (support classifier) ตั๋ว 100,000 ใบต่อเดือน โดยประมาณ 800 อินพุตโทเค็นและ 100 เอาต์พุตโทเค็นต่อใบ นั่นคือ 80 ล้านอินพุตและ 10 ล้านเอาต์พุตโทเค็น: $12.00 สำหรับอินพุตบวก $5.00 สำหรับเอาต์พุต รวมเป็น $17 ต่อเดือน หากตั้งค่า reasoning_effort เป็น low ด้านเอาต์พุตจะลดลงอีก

ผู้ช่วยเขียนโค้ด (coding assistant) 500 เซสชันต่อวัน โดยประมาณ 15,000 อินพุตโทเค็น (ส่วนใหญ่เป็นบริบทไฟล์ที่ซ้ำกัน) และ 2,000 เอาต์พุตโทเค็นต่อเซสชัน รายเดือนจะเป็น 225 ล้านอินพุตและ 30 ล้านเอาต์พุต หากไม่มีการแคช: $33.75 บวก $15.00 รวมเป็น $48.75 หาก 70% ของอินพุตถูกแคช: อินพุตจะลดลงเหลือประมาณ $14.85 ทำให้ค่าใช้จ่ายรวมอยู่ที่ ประมาณ $30

ไปป์ไลน์เอกสารพร้อมรูปภาพ 10,000 เอกสารต่อเดือน โดยประมาณ 40,000 โทเค็นต่อเอกสาร รวมถึงเนื้อหารูปภาพ และ 1,500 เอาต์พุตโทเค็น นั่นคือ 400 ล้านอินพุตและ 15 ล้านเอาต์พุต: $60.00 บวก $7.50 หรือ $67.50 ต่อเดือน สำหรับงานที่ต้องการการมองเห็น

ตัวเลขเหล่านี้ไม่ใช่จำนวนมาก นั่นคือจุดประสงค์ของโมเดลนี้

อินพุตที่แคชไว้คือปัจจัยที่สำคัญที่สุด

ที่ $0.03 ต่อล้านโทเค็น เทียบกับ $0.15 สำหรับอินพุตใหม่ โทเค็นที่แคชไว้มีค่าใช้จ่ายเพียง หนึ่งในห้า ของโทเค็นที่ไม่ได้แคช ปริมาณงานใดๆ ที่มีคำนำหน้าที่เสถียร, ระบบพร้อมท์, เอกสารที่ถูกสอบถามซ้ำๆ, โค้ดเบสในบริบท ควรถูกจัดโครงสร้างเพื่อให้คำนำหน้านั้นคงเดิมตลอดการเรียกใช้

ข้อผิดพลาดที่ทำลายอัตราการเรียกใช้แคชอย่างเงียบๆ คือการวางตัวแปรใดๆ ไว้ใกล้ส่วนหน้าของพร้อมท์ การประทับเวลา, รหัสคำขอ, หรือชื่อผู้ใช้ในระบบพร้อมท์จะทำให้ทุกอย่างที่ตามมาไม่ถูกต้อง วางเนื้อหาที่เสถียรก่อนและเนื้อหาตัวแปรไว้สุดท้าย

Z.ai ยังระบุว่าพื้นที่เก็บข้อมูลอินพุตที่แคชไว้ฟรีในช่วงเวลาจำกัด โปรดพิจารณาว่านี่เป็นโปรโมชั่นและตรวจสอบเงื่อนไขปัจจุบัน แทนที่จะสร้างสถาปัตยกรรมที่ขึ้นอยู่กับมัน

ปัจจัยที่สองคือความพยายามในการให้เหตุผล

reasoning_effort ในโมเดลนี้ตั้งค่าเริ่มต้นเป็น `max` ซึ่งเป็นการตั้งค่าที่แพงที่สุด และเป็นสิ่งที่คุณจะได้รับหากคุณไม่เคยแตะพารามิเตอร์นี้เลย

มีสามโหมดคือ low, high, และ max โทเค็นการให้เหตุผลจะถูกคิดค่าใช้จ่ายเป็นเอาต์พุต ดังนั้นงานที่ไม่ต้องการการพิจารณาจะต้องจ่ายอัตราเอาต์พุตสำหรับการคิดที่ไม่มีใครอ่าน สำหรับการจำแนกประเภท การสกัด การกำหนดเส้นทาง และการจัดรูปแบบ การใช้ low สามารถลดค่าใช้จ่ายด้านเอาต์พุตได้อย่างมาก

การตั้งค่านี้ครอบคลุมอยู่ใน คู่มือ API ของเรา เป็นการเปลี่ยนแปลงเพียงบรรทัดเดียวและเป็นสิ่งแรกที่ควรลองหากบิลของคุณดูสูงกว่าที่การคำนวณข้างต้นแนะนำ

การเปรียบเทียบ

เทียบกับรุ่นน้องของตัวเองที่ราคาปกติ:

โมเดล เฉลี่ยต่อ 1 ล้าน
GLM-5.3-Flash $0.10
GLM-5.3 $0.90

ความแตกต่างประมาณเก้าเท่าสำหรับความแตกต่างสามคะแนนใน Artificial Analysis Intelligence Index ที่ 57 เทียบกับ 60 การเปรียบเทียบฉบับเต็มของเรา ครอบคลุมถึงเวลาที่การแลกเปลี่ยนนั้นผิด และคำตอบสั้นๆ คือ: เมื่อคุณสตรีมการตอบสนองที่ยาวนานให้กับมนุษย์ที่กำลังรอ เพราะ GLM-5.3 สร้างได้เกือบสองเท่า

เมื่อเทียบกับ GLM-5.2 การกล่าวอ้างของ Z.ai คือราคาประมาณ หนึ่งในสิบ ควบคู่ไปกับตัวเลขค่าใช้จ่ายต่อภารกิจที่ $0.045 รายละเอียดราคา GLM-5.2 ของเรา มีตารางราคาเก่าหากคุณกำลังวางแผนการย้ายข้อมูล

เมื่อเทียบกับระดับ multimodal ราคาถูกจากผู้จำหน่ายรายอื่น GLM-5.3-Flash มีราคาที่แข่งขันได้และไม่ธรรมดาตรงที่ได้รับอนุญาตแบบ MIT ซึ่งหมายความว่าตัวเลือกการโฮสต์เองยังคงเปิดอยู่ บทความราคา Gemini 3.7 Flash ของเรา ครอบคลุมการเปรียบเทียบที่ใกล้เคียงที่สุดจากฝั่ง Google

ราคาของตัวแทนจำหน่ายแตกต่างกัน บางครั้งก็มาก

โมเดลนี้มีให้ใช้งานผ่าน Z.ai โดยตรง รวมถึง OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten และ io.net

ผู้ให้บริการเหล่านี้ไม่ได้คิดค่าบริการเท่ากันทั้งหมด ตัวอย่างเช่น AIHubMix มีอัตราที่ระบุไว้ประมาณ $0.113 สำหรับอินพุต และ $0.394 สำหรับเอาต์พุต ซึ่งอยู่ระหว่างราคาโปรโมชั่นและราคาปกติของ Z.ai ผู้ให้บริการบางรายจะส่งต่อส่วนลดการเปิดตัว ในขณะที่บางรายไม่ทำ

หากคุณกำลังส่งผ่านตัวรวบรวมข้อมูล ให้ตรวจสอบอัตราปัจจุบันของมันแทนที่จะสมมติว่ามันสะท้อนราคาของ Z.ai ความสะดวกสบายของเกตเวย์แบบรวมอาจมาพร้อมกับส่วนต่างกำไร และที่ระดับราคาแบบนี้ การบวกเพิ่มเป็นเปอร์เซ็นต์เล็กน้อยมักถูกมองข้ามได้ง่ายและยอมรับได้

เมื่อการโฮสต์เองเริ่มคุ้มค่า

น้ำหนักโมเดลได้รับอนุญาตแบบ MIT ดังนั้นการรันด้วยตัวเองจึงเป็นทางเลือกที่เป็นไปได้ และการคำนวณจุดคุ้มทุนสำหรับการโฮสต์เองก็ยากขึ้นเมื่อราคา API ลดลงต่ำขนาดนี้

โดยประมาณ: การให้บริการแบบ full-precision ต้องการโหนด 8x H200-class ซึ่งมีค่าใช้จ่ายประมาณ $24 ถึง $48 ต่อวันบนบริการคลาวด์ที่เช่ามา เรียกได้ว่าเป็นค่าใช้จ่ายคงที่ $1,000 ต่อเดือน ที่เกิดขึ้นไม่ว่าโหนดจะยุ่งหรือไม่ก็ตาม

ที่ราคา API ปกติ $1,000 สามารถซื้อโทเค็นอินพุตได้ประมาณ 6.7 พันล้านโทเค็น คุณจะต้องมีปริมาณการใช้งานที่มหาศาลและต่อเนื่องก่อนที่ค่าใช้จ่ายคงที่ของโหนดจะคุ้มค่ากว่า สำหรับทีมส่วนใหญ่ คำตอบที่ซื่อสัตย์คือ การโฮสต์ GLM-5.3-Flash ด้วยตัวเองนั้นเกี่ยวกับความควบคุม, การเก็บข้อมูลในประเทศ หรือการอนุญาตใช้งานมากกว่าเรื่องค่าใช้จ่าย

ข้อยกเว้นคือระดับ quantized การควอนไทซ์แบบ GGUF มีอยู่ และการรันโมเดลที่ควอนไทซ์บนฮาร์ดแวร์ที่คุณเป็นเจ้าของอยู่แล้วจะเปลี่ยนการคำนวณทั้งหมด เพราะต้นทุนส่วนเพิ่มคือค่าไฟฟ้า คู่มือการรันในเครื่องของเรา ครอบคลุมสิ่งที่ฮาร์ดแวร์แต่ละระดับสามารถทำได้จริง

ทางเลือกแผนการเขียนโค้ด

หากการใช้งานของคุณเป็นนักพัฒนาที่ทำงานใน Claude Code หรือ Cline แทนที่จะเป็นแอปพลิเคชันที่เรียกใช้ API การกำหนดราคาต่อโทเค็นอาจไม่เหมาะสมทั้งหมด แผนการเขียนโค้ด GLM เริ่มต้นที่ประมาณ $18 ต่อเดือน ซึ่งรวม GLM-5.3-Flash และมีรายงานว่าให้ โควตาการใช้งานที่มากกว่าถึงสามเท่า ของ GLM-5.3 เอกสารของ Z.ai ยังระบุด้วยว่าการเรียกใช้ในช่วงนอกเวลาทำการจะใช้คะแนนเพียงครึ่งเดียวของคะแนนมาตรฐาน

สำหรับนักพัฒนาคนเดียวที่เขียนโค้ดทุกวัน แผนแบบคงที่มักจะถูกกว่าและคาดการณ์ได้ง่ายกว่าการเข้าถึง API แบบคิดตามมิเตอร์ คู่มือการตั้งค่า harness ของเรา ครอบคลุมวิธีการเชื่อมต่อ และ การเปรียบเทียบแผนการเขียนโค้ดของเรา จะนำแผน GLM มาเทียบกับทางเลือกอื่น

จับตาดูด้านเอาต์พุต

ราคาอินพุตได้รับความสนใจเนื่องจากตัวเลขมีปริมาณมากกว่า แต่เอาต์พุตคือส่วนที่งบประมาณพังทลายลงจริง ๆ ด้วยสองเหตุผล

เอาต์พุตมีค่าใช้จ่าย มากกว่าสามเท่า ของอินพุตต่อโทเค็น ที่ $0.50 เทียบกับ $0.15 และโทเค็นการให้เหตุผลจะถูกเรียกเก็บเป็นเอาต์พุต โมเดลที่ตั้งค่าเป็น max reasoning effort สามารถสร้างโทเค็นได้มากกว่าที่ปรากฏในคำตอบสุดท้ายหลายเท่า ซึ่งทั้งหมดจะถูกเรียกเก็บในอัตราเอาต์พุต

การรวมกันนั้นหมายความว่าแอปพลิเคชันที่มีพร้อมท์ปานกลางและโมเดลที่ช่างพูดอาจจบลงด้วยการครอบงำด้วยเอาต์พุต แม้ว่าจะดูเหมือนมีการป้อนข้อมูลจำนวนมากบนกระดาษ ตัวเลขเฉลี่ย $0.10 ต่อล้านโทเค็นสมมติอัตราส่วน 7:2:1 ซึ่งปริมาณงานจริงหลายอย่างไม่ตรงกัน

วิธีแก้ไขคือการวัดผลแทนการประมาณค่า การตอบกลับการเสร็จสิ้นทุกครั้งจะมีวัตถุ usage ที่มีจำนวนโทเค็นสำหรับการเรียกใช้นั้นๆ บันทึก, รวบรวม และเปรียบเทียบอัตราส่วนจริงกับข้อสมมติที่คุณตั้งงบประมาณไว้ หากเอาต์พุตทำงานเกินประมาณ 15% ของโทเค็นทั้งหมดของคุณ reasoning_effort คือสิ่งแรกที่ควรตรวจสอบ และความยาวพร้อมท์คือสิ่งถัดไป

สิ่งที่ต้องทำก่อนวันที่ 9 กันยายน

สามสิ่งที่ควรทำในขณะที่ส่วนลดยังมีอยู่:

  1. วัดอัตราส่วนโทเค็นจริงของคุณ อัตราเฉลี่ยสมมติ 7:2:1 หากของคุณเน้นเอาต์พุต ค่าใช้จ่ายที่มีประสิทธิภาพของคุณจะใกล้เคียงกับอัตราเอาต์พุต $0.50 มากกว่าตัวเลขเฉลี่ย $0.10
  2. ตรวจสอบอัตราการเรียกใช้แคชของคุณ ด้วยความแตกต่างของราคา 5 เท่าระหว่างอินพุตที่แคชและอินพุตใหม่ นี่คือจุดที่เงินอยู่
  3. เรียกใช้โมเดลต้นทุนของคุณใหม่ที่ราคาปกติ ทุกอย่างจะเพิ่มขึ้นเป็นสองเท่าในวันที่ 10 กันยายน หากปริมาณงานสามารถทำได้ที่อัตราโปรโมชั่นเท่านั้น คุณมีปัญหาที่ต้องแก้ไขตอนนี้แทนที่จะเป็นในอีกสองสัปดาห์

การติดตามการใช้โทเค็นจริงหมายถึงการบันทึกการตอบกลับจริง เนื่องจากวัตถุ usage ในแต่ละการเสร็จสิ้นจะแสดงจำนวนโทเค็นอินพุต เอาต์พุต และแคชที่คุณต้องการ การเรียกใช้การเรียกใช้ตัวแทนของคุณเป็นชุดที่บันทึกไว้ใน Apidog โดยมีรหัสโมเดลเป็นตัวแปรสภาพแวดล้อม จะช่วยให้คุณได้ตัวเลขเหล่านั้นต่อคำขอ และให้คุณสามารถเรียกใช้ชุดเดียวกันซ้ำกับ GLM-5.3 เพื่อเปรียบเทียบค่าใช้จ่ายแทนที่จะเป็นการตลาด

button

คำถามที่พบบ่อย

GLM-5.3-Flash ฟรีหรือไม่? ไม่ใช่ มันเคยฟรีประมาณหนึ่งสัปดาห์ในขณะที่รันแบบไม่ระบุชื่อเป็น “ox-alpha” ก่อนเปิดตัว แต่สิ่งนั้นสิ้นสุดลงเมื่อมีการประกาศ ส่วนลด 50% ในปัจจุบันไม่เหมือนกับฟรี

ส่วนลดจะสิ้นสุดลงเมื่อใด? 9 กันยายน 2026 ราคาปกติจะเริ่มใช้ตั้งแต่นั้นเป็นต้นไป

ทำไมเว็บไซต์ต่าง ๆ ถึงเสนอราคาที่แตกต่างกัน? บางเว็บไซต์เสนอราคาโปรโมชั่น บางเว็บไซต์เสนอราคาปกติ และตัวแทนจำหน่ายก็กำหนดส่วนต่างกำไรของตนเอง ตรวจสอบผู้ให้บริการที่คุณเรียกใช้จริงเสมอ

การป้อนข้อมูลรูปภาพมีค่าใช้จ่ายเพิ่มเติมหรือไม่? รูปภาพจะใช้โทเค็นบริบทและถูกเรียกเก็บเป็นอินพุต ไม่มีค่าใช้จ่ายเพิ่มเติมสำหรับรูปภาพแยกต่างหาก แต่รูปภาพความละเอียดสูงจะใช้โทเค็นจำนวนมากอย่างมีนัยสำคัญ

การโฮสต์เองถูกกว่าหรือไม่? ถูกกว่าในกรณีที่มีปริมาณการใช้งานที่มากและต่อเนื่อง หรือบนฮาร์ดแวร์ที่คุณเป็นเจ้าของอยู่แล้วโดยใช้ build แบบ quantized ที่ราคา $0.15 ต่อล้านโทเค็นอินพุต การเช่าโหนด 8x H200 เป็นเรื่องยากที่จะอ้างเหตุผลด้วยค่าใช้จ่ายเพียงอย่างเดียว

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API