เอเจนต์ของคุณส่งโทเค็นพรอมต์ระบบ คำจำกัดความเครื่องมือ และเอกสารนโยบายจำนวน 40,000 โทเค็นชุดเดิมซ้ำทุกครั้งที่เรียกใช้งาน ด้วยราคาอินพุตของ Claude Opus 5.5 ที่ $4 ต่อล้านโทเค็น คำนำหน้านั้นมีค่าใช้จ่าย $0.16 ทุกครั้งที่ส่งออกไป ไม่ว่าจะมีไบต์เดียวที่เปลี่ยนแปลงไปจากการเรียกใช้งานครั้งล่าสุดหรือไม่ก็ตาม
การแคชพรอมต์คือทางออก และ Anthropic ได้กำหนดราคาอย่างจริงจังสำหรับ Opus 5.5 การอ่านจากแคชมีค่าใช้จ่าย $0.20 ต่อล้านโทเค็น เทียบกับ $4.00 สำหรับอินพุตใหม่ ซึ่งเป็นการลดราคา 95% แต่การเขียนแคชมีค่าใช้จ่าย $5.00 ต่อล้านโทเค็น ซึ่งแพงกว่าการส่งโทเค็นแบบไม่แคช ดังนั้นการแคชจึงไม่ใช่เงินฟรี เป็นการเดิมพันว่าคุณจะนำคำนำหน้ากลับมาใช้ซ้ำ และการเดิมพันนี้มีจุดคุ้มทุนที่แม่นยำซึ่งแทบไม่มีใครคำนวณก่อนที่จะเปิดใช้งาน
บทความนี้จะคำนวณเลขดังกล่าวให้เห็น คำตอบสั้นๆ คือ: สำหรับคำนำหน้าเดียว คุณจะคุ้มทุนหลังจากเรียกใช้งาน 1.26 ครั้ง และในสภาวะคงที่ คุณจะคุ้มทุนที่อัตราแคชฮิตประมาณ 21% หากต่ำกว่านั้น การแคชจะทำให้คุณเสียเงิน
ขนาดของปัญหานี้ควรกล่าวถึงก่อน OpenAI เปิดเผยในการเปิดตัวของตนเองว่า นักวิจัยโดยเฉลี่ยใช้เงินกว่า $600 ต่อวันไปกับเอเจนต์โค้ดดิ้ง โดยกลุ่ม 90 เปอร์เซ็นต์แรกใช้เงินมากกว่า $7,000 ต่อวัน ที่ปริมาณขนาดนั้น ความแตกต่างของอัตราฮิต 20 เปอร์เซ็นต์พอยต์ก็เทียบเท่ากับเงินเดือน สำหรับภาพรวมราคาที่กว้างขึ้นในการเปิดตัวทั้งสามครั้งในเดือนกันยายน โปรดดูที่ การวิเคราะห์สงครามราคาโมเดลเดือนกันยายน 2026 ของเรา
อัตราสามแบบที่เป็นตัวตัดสินทุกสิ่ง
| ประเภทโทเค็น | อัตรา Claude Opus 5.5 ต่อล้าน | เทียบกับอินพุตใหม่ |
|---|---|---|
| อินพุตใหม่ | $4.00 | ราคาตั้งต้น |
| การเขียนแคช | $5.00 | พรีเมียม $1.00 |
| การอ่านจากแคช | $0.20 | ประหยัด $3.80 |
| เอาต์พุต | $20.00 | การแคชไม่เกี่ยวข้อง |
ข้อเท็จจริงสองประการที่เห็นได้ชัดจากตารางนั้น การเขียนคำนำหน้าลงในแคชมีค่าใช้จ่ายเพิ่มขึ้น $1.00 ต่อล้านโทเค็น เมื่อเทียบกับการไม่แคชเลย การอ่านคำนำหน้านั้นในภายหลังแต่ละครั้งช่วยให้คุณประหยัด $3.80 ต่อล้านโทเค็น ราคาเอาต์พุตไม่เปลี่ยนแปลง ดังนั้นเอเจนต์ที่สร้างคำตอบยาวๆ จากพรอมต์สั้นๆ จึงได้รับประโยชน์เพียงเล็กน้อยในที่นี้ ในขณะที่เอเจนต์ที่อ่านบริบทขนาดใหญ่ที่เสถียรและส่งคืนคำตัดสินสั้นๆ จะได้รับประโยชน์อย่างมาก
รายละเอียดสเปกทั้งหมด รวมถึงหน้าต่างบริบท 1,000,000 โทเค็น และเอาต์พุตสูงสุด 128,000 โทเค็น อยู่ในบทความ Claude Opus 5.5 คืออะไร
จุดคุ้มทุนอยู่ที่ 1.26 ครั้ง ไม่ใช่สองครั้ง
สมมติคำนำหน้าที่มีหนึ่งล้านโทเค็นพอดี และมีการเรียกใช้งาน N ครั้งที่ใช้คำนำหน้านั้นร่วมกัน โดยมีการเขียนหนึ่งครั้ง และการอ่าน N ลบหนึ่งครั้ง
uncached: N * $4.00
cached: $5.00 + (N - 1) * $0.20
4.00N = 5.00 + 0.20(N - 1)
3.80N = 4.80
N = 1.26
คุณต้องเรียกใช้งาน 1.26 ครั้งเพื่อคืนทุนค่าพรีเมียมการเขียน เนื่องจากจำนวนการเรียกใช้งานเป็นจำนวนเต็ม นั่นหมายความว่า: หากคำนำหน้าถูกอ่านกลับมาแม้เพียงครั้งเดียว การแคชนั้นก็ถูกต้องแล้ว การเรียกใช้งานสองครั้งจะทำให้คุณนำหน้าไปแล้ว 35%
| จำนวนครั้งที่เรียกใช้ร่วมกันจากการเขียนหนึ่งครั้ง | ค่าใช้จ่ายไม่แคชต่อคำนำหน้า 1M | ค่าใช้จ่ายแคช | ประหยัด |
|---|---|---|---|
| 1 | $4.00 | $5.00 | แย่ลง 25% |
| 2 | $8.00 | $5.20 | 35% |
| 5 | $20.00 | $5.80 | 71% |
| 10 | $40.00 | $6.80 | 83% |
| 100 | $400.00 | $24.80 | 94% |
ตารางนั้นสมมติว่ามีการเขียนหนึ่งครั้งและการนำกลับมาใช้ซ้ำได้อย่างสมบูรณ์แบบหลังจากนั้น ระบบจริงมีความซับซ้อนกว่า ซึ่งเป็นที่มาของการคำนวณครั้งที่สอง
ในสภาวะคงที่ ตัวเลขเดียวที่สำคัญคืออัตราฮิต
ตลอดวันที่มีปริมาณการใช้งาน คุณไม่ได้เขียนเพียงครั้งเดียว แคชหมดอายุ คำนำหน้าถูกแก้ไข ผู้ใช้ใหม่เข้ามา ให้ h เป็นสัดส่วนของโทเค็นคำนำหน้าของคุณที่ถูกให้บริการจากแคช การพลาด (miss) จะถูกเรียกเก็บเงินเป็นการเขียน ส่วนการฮิต (hit) จะถูกเรียกเก็บเงินเป็นการอ่าน:
effective cost per 1M prefix tokens = $5.00 * (1 - h) + $0.20 * h
= $5.00 - $4.80h
break-even against $4.00 uncached: h = 1.00 / 4.80 = 20.8%
ยี่สิบเอ็ดเปอร์เซ็นต์คือตัวเลขที่ต้องจำ หากโทเค็นคำนำหน้าของคุณน้อยกว่าหนึ่งในห้าโดยประมาณถูกให้บริการจากแคช การเปิดใช้งานการแคชจะทำให้ค่าใช้จ่ายของคุณแย่ลง
| อัตราแคชฮิต | ค่าใช้จ่ายที่แท้จริงต่อคำนำหน้า 1M | เทียบกับ $4.00 แบบไม่แคช |
|---|---|---|
| 0% | $5.00 | แย่ลง 25% |
| 20.8% | $4.00 | จุดคุ้มทุน |
| 50% | $2.60 | ถูกลง 35% |
| 75% | $1.40 | ถูกลง 65% |
| 90% | $0.68 | ถูกลง 83% |
| 95% | $0.44 | ถูกลง 89% |
| 99% | $0.25 | ถูกลง 94% |
| 100% | $0.20 | ถูกลง 95% |
ตารางทั้งสองเป็นสมการเดียวกันที่มองจากมุมที่ต่างกัน เนื่องจากมีการเขียนหนึ่งครั้งต่อการเรียกใช้งาน N ครั้ง ซึ่งเท่ากับอัตราฮิตที่ (N-1)/N การเรียกใช้งานสิบครั้งต่อการเขียนหนึ่งครั้งคืออัตราฮิต 90% และทั้งสองตารางระบุ 83%
รูปแบบคำขอสามแบบที่นำมาวิเคราะห์
รูปแบบที่ 1: เอเจนต์ความถี่สูง, คำนำหน้าขนาดเล็ก
เอเจนต์คัดกรองการสนับสนุนที่มีคำนำหน้า 40,000 โทเค็น, การโต้ตอบของผู้ใช้แบบแปรผัน 800 โทเค็น, เอาต์พุต 600 โทเค็น, มีการเรียกใช้งาน 10,000 ครั้งต่อวัน สมมติว่ามีการเขียนเกิดขึ้น 3% ของการเรียกใช้งาน ดังนั้นอัตราฮิตคือ 97%
| ไม่แคช | แคช | |
|---|---|---|
| คำนำหน้า, 400M โทเค็น/วัน | $1,600.00 | $137.60 |
| การโต้ตอบแบบแปรผัน, 8M โทเค็น/วัน | $32.00 | $32.00 |
| อินพุตทั้งหมดต่อวัน | $1,632.00 | $169.60 |
นั่นคือส่วนลด 89.6% จากค่าอินพุต คิดเป็นประมาณ $1,462 ต่อวัน หรือ $43,800 ต่อเดือน ส่วนเอาต์พุตยังคงอยู่ที่ $120 ต่อวันไม่ว่าจะด้วยวิธีใด สังเกตว่าคำนำหน้ามีเพียง 40,000 โทเค็น การแคชคุ้มค่าในที่นี้เนื่องจากความถี่ ไม่ใช่ขนาด
รูปแบบที่ 2: การประมวลผลครั้งเดียวผ่านบริบท 1M
อินพุตหนึ่งล้านโทเค็น, เอาต์พุตหนึ่งคำตอบ, ไม่มีการนำกลับมาใช้ซ้ำ การเรียกใช้งานแบบไม่แคชมีค่าใช้จ่าย $4.00 สำหรับอินพุต การแคชมีค่าใช้จ่าย $5.00 เพราะคุณจ่ายเพื่อเขียนคำนำหน้าที่ไม่มีใครอ่าน หากประมวลผลเอกสาร 500 ฉบับต่อวันด้วยรูปแบบนั้น การแคชจะทำให้คุณเสียค่าใช้จ่ายเพิ่มขึ้น $500 ต่อวันโดยเปล่าประโยชน์
นี่คือรูปแบบที่ผู้คนมักเข้าใจผิดมากที่สุด เนื่องจากบริบทมีขนาดใหญ่มาก และสัญชาตญาณก็คือบริบทขนาดใหญ่มักจะต้องการการแคชอย่างชัดเจน ขนาดไม่เกี่ยวข้อง การนำกลับมาใช้ซ้ำคือตัวแปรทั้งหมด
รูปแบบที่ 3: เซสชันเอเจนต์แบบยาวบนหน้าต่าง 1M
ตอนนี้ลองใช้บริบทหนึ่งล้านโทเค็นเดียวกัน และให้เอเจนต์อ่านซ้ำตลอด 200 รอบ ซึ่งเป็นลักษณะของ ลูปงาน 18 ชั่วโมง
| ค่าใช้จ่าย | |
|---|---|
| ไม่แคช, 200 x $4.00 | $800.00 |
| แคช, เขียน 1 ครั้ง + อ่าน 199 ครั้ง | $44.80 |
| แคช, เขียน 5 ครั้ง + อ่าน 195 ครั้ง | $64.00 |
แม้ว่าแคชจะเย็นลงสี่ครั้งกลางเซสชันและคุณต้องจ่ายค่าเขียนเต็มห้าครั้ง คุณก็ยังคงประหยัดได้ 92% เมื่อเทียบกับบิลที่ไม่แคช เซสชันแบบยาวคือจุดที่อัตรา $0.20 สร้างชื่อเสียงให้ตัวเอง
ข้อผิดพลาดราคาแพง: การแคชส่วนที่เปลี่ยนแปลง
ลองพิจารณาเอกสาร 5,000 ฉบับ แต่ละฉบับมี 60,000 โทเค็น สรุปครั้งละหนึ่งฉบับโดยมีส่วนหัวคำสั่ง 6,000 โทเค็นที่ใช้ร่วมกัน
| กลยุทธ์ | ค่าใช้จ่ายอินพุต |
|---|---|
| ไม่มีการแคชเลย | $1,320 |
| แคชคำขอทั้งหมด รวมถึงเอกสารแต่ละฉบับ | $1,650 |
| แคชเฉพาะส่วนหัว 6,000 โทเค็น | $1,206 |
การแคชขอบเขตที่ผิดนั้นแย่กว่าการไม่แคช 25% การแคชขอบเขตที่ถูกต้องดีกว่า 9% คุณสมบัติเดียวกัน อัตราเดียวกัน ส่วนต่าง $444 ที่ถูกตัดสินทั้งหมดโดยจุดที่คำนำหน้าแคชสิ้นสุดลง
กฎที่ได้จากเรื่องนี้คือ: แคชลำดับไบต์นำหน้าที่ยาวที่สุดที่เหมือนกันในทุกการเรียกใช้งาน และไม่เกินไปแม้แต่ไบต์เดียว หากมีการประทับเวลา, รหัสคำขอ หรือเอกสารต่อคำขออยู่ในคำนำหน้าแคชของคุณ อัตราฮิตของคุณจะลดลงเหลือศูนย์ และทุกการเรียกใช้งานจะถูกเรียกเก็บเงินที่ $5.00 แทนที่จะเป็น $4.00 กลไกทั่วไปของการจับคู่คำนำหน้าจะครอบคลุมอยู่ใน คู่มือพื้นฐานการแคชพรอมต์ ของเรา
95% คือเส้นกำกับ ไม่ใช่ส่วนลดที่คุณได้รับจริง
ตัวเลขพาดหัวคือการอ่านจากแคชมีค่าใช้จ่าย 5% ของอินพุตใหม่ คุณจะไม่มีทางจ่ายจริง 5% เพราะคุณได้จ่ายค่าเขียนอย่างน้อยหนึ่งครั้งเสมอ ที่ 100 การเรียกใช้งานต่อการเขียนหนึ่งครั้ง คุณจะอยู่ที่ 94% ที่ 10 การเรียกใช้งานต่อการเขียนหนึ่งครั้ง คุณจะอยู่ที่ 83% ที่ 2 การเรียกใช้งาน คุณจะอยู่ที่ 35%
ประมาณการจากตารางอัตราฮิต ไม่ใช่จากพาดหัวข่าว ทีมการเงินที่ประมาณการส่วนลด 95% และพบว่าได้ส่วนลดเพียง 83% จะสรุปว่าฟีเจอร์นี้เสีย ทั้งที่มันทำงานตามราคาที่กำหนดไว้ทุกประการ
สิ่งที่เอกสารเปิดตัวไม่ได้บอกคุณ
สามปัจจัยสำหรับการคำนวณนี้ไม่ได้อยู่ในเอกสารเปิดตัว Opus 5.5 ของ Anthropic และการคาดเดาปัจจัยเหล่านี้จะเป็นวิธีที่เร็วที่สุดที่จะทำให้งบประมาณผิดพลาด:
- อายุการใช้งานของแคช ระยะเวลาที่คำนำหน้าที่ถูกเขียนยังคง "อุ่น" (พร้อมใช้งาน) จะกำหนดอัตราฮิตในสภาวะคงที่ของคุณโดยตรง ทุกตัวอย่างที่คำนวณไว้ข้างต้นถือว่า h เป็นค่าคงที่ตามสมมติฐาน ไม่ใช่การรับประกันจากแพลตฟอร์ม
- ความยาวขั้นต่ำของคำนำหน้าที่สามารถแคชได้ แพลตฟอร์มมักจะปฏิเสธที่จะแคชคำนำหน้าสั้นๆ หากของคุณต่ำกว่าเกณฑ์ อัตราฮิตที่มีประสิทธิภาพของคุณจะเป็นศูนย์ ไม่ว่าไบต์จะเสถียรเพียงใดก็ตาม
- ขอบเขตของแคช การที่คำนำหน้าที่ "อุ่น" ถูกแชร์ข้ามคีย์ API, พื้นที่ทำงาน หรือภูมิภาค จะเปลี่ยนจำนวนการเขียนในการปรับใช้แบบหลายผู้เช่าอย่างมีนัยสำคัญ
ตรวจสอบทั้งสามประการในหน้ากำหนดราคาของผู้ให้บริการก่อนที่จะตกลงตัวเลขใดๆ อัตราในบทความนี้มีการเปิดเผยต่อสาธารณะ แต่สามประการนี้ไม่มี
ทดสอบว่าแคชกำลังฮิตจริงหรือไม่
รูปแบบความล้มเหลวนี้เงียบ ไม่มีข้อผิดพลาดเกิดขึ้นเมื่อคำนำหน้า "เย็นลง" มีคนเพิ่ม Debug ID เข้าไปในข้อความระบบ อัตราฮิตลดลงจาก 97% เหลือ 0 และสัญญาณเดียวที่บ่งบอกคือรายการในใบแจ้งหนี้สามสัปดาห์ต่อมา
"usage": {
"input_tokens": 812,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 40960,
"output_tokens": 604
}
ในการเรียกใช้งานครั้งแรก cache_creation_input_tokens จะมีคำนำหน้าอยู่ ในการเรียกใช้งานแต่ละครั้งหลังจากนั้น ฟิลด์นั้นควรเป็น 0 และ cache_read_input_tokens ควรมีปริมาณเท่ากัน บันทึกคำขอหนึ่งครั้งใน Apidog เรียกใช้งานสองครั้ง และสังเกตว่าฟิลด์ใดมีการเปลี่ยนแปลง
จากนั้นให้เปลี่ยนการสังเกตนั้นเป็นการยืนยัน (assertion) เพื่อไม่ให้เกิดการถดถอยอย่างเงียบๆ สถานการณ์ทดสอบ Apidog ที่ส่งคำขอสองครั้งและยืนยันว่า cache_read_input_tokens > 40000 ในการตอบกลับครั้งที่สองจะล้มเหลวใน CI ทันทีที่เพื่อนร่วมทีมทำให้คำนำหน้าไม่เป็นดีเทอร์มินิสติก นั่นคือการทดสอบเพียงบรรทัดเดียวที่คั่นกลางระหว่างคุณกับการเพิ่มขึ้น 25 เท่าของค่าใช้จ่ายคำนำหน้า และเป็นสิ่งที่มีผลตอบแทนสูงสุดเพียงสิ่งเดียวในบทความนี้
จุดยืนของ GPT-6 ในการคำนวณแบบเดียวกัน
GPT-6 Sol แสดงรายการอินพุตที่ $2.00 ต่อล้านโทเค็น พร้อมส่วนลด 90% สำหรับการอ่านจากแคช ซึ่งทำให้การอ่านจากแคชมีราคา $0.20 ต่อล้านโทเค็น ซึ่งเป็นตัวเลขเดียวกับ Opus 5.5 ส่วน GPT-6 Luna ที่ $0.10 ต่อล้านอินพุต จะมีราคาอยู่ที่ $0.01 ต่อล้านโทเค็นที่แคชไว้
ความแตกต่างคือสิ่งที่เราสามารถคำนวณได้ เอกสารเปิดตัวของ OpenAI ไม่ได้ระบุอัตราการเขียนแคช ดังนั้นอัตราการใช้ซ้ำที่คุ้มทุนสำหรับ GPT-6 จึงไม่สามารถหาได้ด้วยวิธีเดียวกับ Opus 5.5 การที่ Anthropic เผยแพร่ราคาเขียนที่ $5.00 อย่างชัดเจนคือสิ่งที่ทำให้ตัวเลข 21% สามารถคำนวณได้ ส่วนการเปิดตัวฟีเจอร์แคชอื่นๆ ของ OpenAI รวมถึงการเปลี่ยนแปลงที่ช่วยรักษาแคชและเครื่องมือวินิจฉัยใหม่ๆ อยู่ใน บทความเกี่ยวกับการแคชพรอมต์ของ GPT-6 ของเรา
สรุป
การแคชพรอมต์บน Claude Opus 5.5 เป็นคำถามทางคณิตศาสตร์ข้อหนึ่ง: โทเค็นคำนำหน้าของคุณมากกว่าหนึ่งในห้าจะกลับมา "อุ่น" (พร้อมใช้งาน) หรือไม่? ถ้าใช่ ให้เปิดใช้งานและคาดหวังส่วนลด 83% ถึง 94% จากค่าอินพุต แทนที่จะเป็น 95% ตามที่โฆษณาไว้ หากปริมาณงานของคุณคือการประมวลผลเอกสารที่ไม่ซ้ำกันเพียงครั้งเดียว ให้ปิดใช้งานและประหยัดค่าพรีเมียมการเขียน $1.00 ต่อล้านโทเค็น และไม่ว่าคุณจะเลือกแบบใด ให้ทำการยืนยัน cache_read_input_tokens ใน CI เนื่องจากความถดถอยของแคชไม่เคยประกาศตัวเอง
