Gemini 3.8 Flash มีค่าใช้จ่าย $0.75 ต่อล้านโทเค็นขาเข้า และ $3.75 ต่อล้านโทเค็นขาออก ซึ่งเป็นอัตราแนะนำเดียวกันกับที่ Google กำหนดไว้สำหรับ 3.7 Flash อัตรานี้จะใช้ได้จนถึงวันที่ 31 ธันวาคม 2026 ในวันที่ 1 มกราคม 2027 อัตราจะเพิ่มขึ้นเป็นสองเท่าเป็น $1.50 และ $7.50 และอัตราที่เพิ่มขึ้นเป็นสองเท่านี้จะใช้กับ 3.6 Flash และ 3.7 Flash ในวันเดียวกัน ไม่มีอะไรเปลี่ยนแปลงเกี่ยวกับราคาต่อโทเค็นในการเปิดตัวครั้งนี้
สิ่งที่เปลี่ยนแปลงคือจำนวนโทเค็นที่โมเดลใช้ Google กล่าวว่า 3.8 Flash “ทำงานหนักขึ้น”: โดยใช้ขั้นตอนการให้เหตุผลมากขึ้น เรียกใช้เครื่องมือซ้ำๆ และ “สามารถใช้โทเค็นมากขึ้นกับงานที่ใช้เวลานานและซับซ้อนตามการออกแบบ” Artificial Analysis ได้วัดผลกระทบอย่างเป็นอิสระ: การรัน Intelligence Index มีค่าใช้จ่าย $0.58 ต่องานบน 3.8 Flash ในโหมดการคิดระดับสูง เทียบกับ $0.40 บน 3.7 Flash โดยมีโทเค็นขาออกเพิ่มขึ้นประมาณ 30% ต่องาน ราคาตามป้ายเท่าเดิม แต่บิลสูงขึ้น
คู่มือนี้จะอธิบายทุกบรรทัดใน หน้าการกำหนดราคา Gemini API อย่างเป็นทางการ พร้อมยกตัวอย่างงาน 1,000 งานต่อวันในแต่ละระดับการคิด และเปรียบเทียบอัตรากับ Flash-Lite, Claude Sonnet 5 และ GPT-5.6 Luna สำหรับภาพรวมโมเดลเบื้องต้น โปรดเริ่มจาก Gemini 3.8 Flash คืออะไร
ราคา Gemini 3.8 Flash โดยสรุป
ราคาทั้งหมดเป็นต่อ 1 ล้านโทเค็นในระดับแบบชำระเงิน
| อัตรา | อัตราแนะนำ (ถึง 31 ธันวาคม 2026) | อัตรามาตรฐาน (ตั้งแต่วันที่ 1 มกราคม 2027) |
|---|---|---|
| ขาเข้า (ข้อความ, รูปภาพ, วิดีโอ, เสียง, PDF) | $0.75 | $1.50 |
| ขาออก (รวมโทเค็นการคิด) | $3.75 | $7.50 |
| การอ่านแคชบริบท | $0.075 | $0.15 |
| การจัดเก็บแคช (ต่อ 1 ล้านโทเค็นต่อชั่วโมง) | $0.50 | $1.00 |
| อินพุต Batch API (ลด 50%) | $0.375 | $0.75 |
| เอาต์พุต Batch API (ลด 50%) | $1.875 | $3.75 |
| Google Search grounding | 5,000 คำขอฟรี/เดือน แชร์ข้าม Gemini 3.x หลังจากนั้น $14 ต่อ 1,000 คำขอ | เช่นเดิม |
| ระดับฟรี | $0, มีการจำกัดอัตรา, ข้อมูลจะถูกใช้เพื่อปรับปรุงผลิตภัณฑ์ของ Google | เช่นเดิม |
มีสามรายละเอียดที่สำคัญกว่าตัวเลขพาดหัวข่าว การกำหนดราคาขาออกครอบคลุมโทเค็นการคิด ดังนั้นการให้เหตุผลภายในจะมีค่าใช้จ่าย $3.75 ไม่ใช่ $0.75 อัตราแนะนำมีวันสิ้นสุดที่แน่นอน และอัตราของ 3.7 Flash และ 3.6 Flash ก็จะเพิ่มขึ้นเป็นสองเท่าในวันที่ 1 มกราคมเช่นกัน ดังนั้น Flash รุ่นเก่ากว่าก็ไม่สามารถช่วยให้คุณรอดพ้นจากการขึ้นราคาได้ รายละเอียดการกำหนดราคา 3.7 Flash ครอบคลุมอัตราเดียวกันบนโมเดลที่ใช้โทเค็นน้อยกว่าต่องาน
โทเค็นการคิดคือโทเค็นขาออก
Gemini 3.8 Flash จะให้เหตุผลก่อนที่จะตอบ และโทเค็นทุกส่วนของการให้เหตุผลนั้นจะถูกนับเป็นเอาต์พุต API จะรายงานจำนวนเป็น usageMetadata.thoughtsTokenCount ในการตอบกลับ generateContent ซึ่งแยกต่างหากจาก candidatesTokenCount (คำตอบที่มองเห็นได้) และ promptTokenCount (อินพุตของคุณ) ทั้งสองส่วนของเอาต์พุตมีค่าใช้จ่ายเท่ากันที่ $3.75
คุณสามารถควบคุมปริมาณได้ด้วย thinking_level: low, medium หรือ high สำหรับ 3.8 Flash ค่าเริ่มต้นคือ medium ไม่ใช่ high เหมือนใน Gemini 3 Pro ค่า minimal ถูกยกเลิกและจะคืนข้อผิดพลาดในการตรวจสอบ ดังนั้นการตั้งค่าใดๆ ที่มาจากโมเดลรุ่นก่อนหน้าจะต้องถูกแมปค่าเป็น low เอกสารเกี่ยวกับการคิด ของ Google อธิบายระดับต่างๆ ว่าเป็นความพยายามสัมพัทธ์ ไม่ใช่การกำหนดงบประมาณโทเค็น ดังนั้นคุณจึงไม่สามารถจำกัดโทเค็นการคิดได้โดยตรงเหมือนที่ thinking_budget แบบจำนวนเต็มเก่าเคยอนุญาตไว้ สิ่งที่แต่ละระดับส่งผลต่อความหน่วงและค่าใช้จ่ายอยู่ใน คู่มือระดับการคิดของ 3.8 Flash
ตัวอย่างสั้นๆ ด้วยขนาดสมมติแต่สมจริง สมมติว่าคำขอส่งโทเค็นขาเข้า 10,000 โทเค็น และได้รับโทเค็นขาออกที่มองเห็นได้ 2,000 โทเค็น พร้อมด้วยโทเค็นการคิด 6,000 โทเค็น ด้วยอัตราแนะนำ:
- ขาเข้า: 10,000 x $0.75 / 1,000,000 = $0.0075
- ขาออก: (2,000 + 6,000) x $3.75 / 1,000,000 = $0.03
- รวม: $0.0375 ต่อคำขอ
การคิดเป็น 75% ของค่าใช้จ่ายขาออก และ 60% ของคำขอทั้งหมด ตั้งแต่วันที่ 1 มกราคม คำขอเดียวกันนี้จะมีค่าใช้จ่าย $0.015 + $0.06 = $0.075 คำกล่าวที่ว่า “ราคาเท่ากับ 3.7” เป็นความจริงแต่ไม่สมบูรณ์: อัตราคงที่ แต่จำนวนโทเค็นเปลี่ยนแปลงไป
เหตุใดต้นทุนต่องานจึงเพิ่มขึ้น ในขณะที่ราคาไม่ได้เพิ่มขึ้น
ประกาศเปิดตัว ของ Google พูดถึงการแลกเปลี่ยนโดยตรง: ในงานที่ซับซ้อน โมเดลจะ “ดำเนินการขั้นตอนการให้เหตุผลเพิ่มเติม และเรียกใช้เครื่องมือซ้ำๆ” เพื่อตรวจสอบการทำงานของมันไปพร้อมกัน ขั้นตอนที่มากขึ้นหมายถึงโทเค็นการคิดที่มากขึ้น และในวงจรเอเจนต์ หมายถึงการเรียกใช้เครื่องมือที่มากขึ้น คำแนะนำในการลดผลกระทบจาก Google: ลด thinking_level หรือใช้งาน 3.7 Flash ต่อไป
Artificial Analysis ได้ให้ตัวเลขไว้ Intelligence Index ของพวกเขาวิ่งเก้าการประเมิน; 3.8 Flash ที่ระดับสูงได้คะแนน 59 เทียบกับ 56 สำหรับ 3.7 Flash ที่ระดับสูง โดยใช้โทเค็นขาออกประมาณ 48,000 โทเค็นต่องานโดยเฉลี่ย เพิ่มขึ้น 30% จาก 3.7 Flash ต้นทุนในการรันดัชนีต่องาน:
| การกำหนดค่า | ต้นทุนต่องาน (AA, อัตราแนะนำ) | เวลาต่องาน |
|---|---|---|
| Gemini 3.8 Flash, สูง | $0.58 | 2.5 นาที |
| Gemini 3.8 Flash, ปานกลาง | $0.41 | ยังไม่เผยแพร่ |
| Gemini 3.8 Flash, ต่ำ | $0.24 | 0.8 นาที |
| Gemini 3.7 Flash, สูง | $0.40 | 2.2 นาที |
อ่านตารางได้สองวิธี เมื่อเทียบกับรุ่นก่อนหน้า 3.8 Flash ที่ระดับสูงมีค่าใช้จ่ายสูงขึ้น 45% ต่องาน ($0.58 / $0.40 = 1.45) เพื่อเพิ่มคะแนนดัชนีสามจุด เมื่อเทียบกับตัวเอง การลดระดับจากสูงเป็นปานกลางจะช่วยลดต้นทุนต่องานได้ 29% ($0.41 / $0.58 = 0.71) และระดับต่ำจะลดลง 59% ($0.24 / $0.58 = 0.41) ระดับปานกลางบน 3.8 Flash มีค่าใช้จ่ายใกล้เคียงกับระดับสูงบน 3.7 Flash ซึ่งเป็นจุดอ้างอิงที่มีประโยชน์ในการตัดสินใจว่าจะอัปเกรดหรือไม่ การเปรียบเทียบ 3.8 Flash vs 3.7 Flash จะช่วยให้ตัดสินใจได้ตามปริมาณงาน
Artificial Analysis ยังระบุราคาแบบผสมที่ $0.58 ต่อล้านโทเค็นในอัตราส่วนอินพุตต่อเอาต์พุต 3:1 การที่ราคาตรงกับต้นทุนระดับสูงต่องานเป็นเรื่องบังเอิญ หนึ่งคืออัตราต่อโทเค็น อีกหนึ่งขึ้นอยู่กับจำนวนโทเค็นที่โมเดลเลือกใช้
ล็อคอัตราแนะนำก่อนวันที่ 31 ธันวาคม
คำว่า “ล็อคอัตรา” ต้องการความหมายที่แม่นยำ เพราะอัตราแนะนำไม่ใช่สัญญา Google จะเรียกเก็บเงินตามอัตราที่มีผลบังคับใช้เมื่อมีการใช้โทเค็น ดังนั้นคุณจึงไม่สามารถชำระค่าใช้จ่ายล่วงหน้าในปี 2027 ในราคาปี 2026 ได้ และการเปลี่ยนไปใช้ 3.7 หรือ 3.6 Flash ก็ไม่ช่วยอะไร สิ่งที่คุณทำได้คือย้ายงานที่ไม่เร่งด่วนเข้าสู่ช่วงเวลานี้:
- รัน backfills และประมวลผลเอกสารแบบครั้งเดียวตอนนี้ ผ่าน Batch API การทำ backfill 100 ล้านโทเค็น (อินพุต 75M, เอาต์พุต 25M) มีค่าใช้จ่าย 75 x $0.375 + 25 x $1.875 = $28.13 + $46.88 = $74.99 ในรูปแบบแบทช์ในปีนี้ และจะเพิ่มเป็นสองเท่าคือ $149.98 ในเดือนมกราคม
- สร้างชุดการประเมินและจำนวนโทเค็นพื้นฐานของคุณก่อนที่ราคาจะเปลี่ยนแปลง เพื่อให้บิลเดือนมกราคมมีตัวแปรที่เปลี่ยนแปลงเพียงหนึ่งเดียว ไม่ใช่สองตัว
- ตัดสินใจระดับการคิดต่อเส้นทางในไตรมาสนี้ ทุกเส้นทางที่ตั้งค่าเป็น
mediumโดยค่าเริ่มต้นคือเส้นทางที่คุณยังไม่ได้ตรวจสอบต้นทุน เส้นทางที่ผ่านการประเมินที่lowควรตั้งค่าเป็นlowก่อนเดือนมกราคม
หากราคาเป็นปัจจัยในการตัดสินใจเลือกผู้ให้บริการ บทสรุปผู้ให้บริการ LLM API ที่ถูกที่สุดของเรา จะแสดงภาพรวมทั้งหมด; การเปรียบเทียบ Fable 5.1 และ GPT-5.6 Sol ครอบคลุมระดับพรีเมียม
เปรียบเทียบกับ Flash-Lite, Sonnet 5 และ GPT-5.6 Luna อย่างไร
อัตราต่อโทเค็น, ต่อ 1 ล้านโทเค็น:
| โมเดล | ขาเข้า | ขาออก | หมายเหตุ |
|---|---|---|---|
| Gemini 3.8 Flash (แนะนำ) | $0.75 | $3.75 | การคิดจะถูกเรียกเก็บเป็นเอาต์พุต; การอ่านแคช $0.075 |
| Gemini 3.8 Flash (ตั้งแต่วันที่ 1 ม.ค.) | $1.50 | $7.50 | การอ่านแคช $0.15 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | ประมาณ 350 โทเค็น/วินาที |
| Claude Sonnet 5 | $2 | $10 | ถาวร; การขึ้นราคา 1 กันยายนถูกยกเลิก |
| GPT-5.6 Luna | $1 | $6 |
ด้วยอัตราแนะนำ อินพุตของ 3.8 Flash มีราคาเป็น 2.5 เท่าของ Flash-Lite และเอาต์พุตเป็น 1.5 เท่า เมื่อเทียบกับ Sonnet 5, 3.8 Flash ถูกกว่าประมาณ 2.7 เท่าทั้งอินพุต ($2 / $0.75) และเอาต์พุต ($10 / $3.75) เมื่อเทียบกับ Luna ก็ถูกกว่าเช่นกัน: $0.75 เทียบกับ $1 สำหรับอินพุต, $3.75 เทียบกับ $6 สำหรับเอาต์พุต
ภาพรวมจะกลับกันในวันที่ 1 มกราคม ที่ราคา $1.50 และ $7.50, 3.8 Flash จะมีราคาแพงกว่า Luna ทั้งสองด้าน และช่องว่างกับ Sonnet 5 จะแคบลงเหลือประมาณ 1.3 เท่า ($2 / $1.50 และ $10 / $7.50) Flash-Lite ยังคงถูกกว่าตลอดเวลา หากอัตราแนะนำคือเหตุผลที่คุณเลือก 3.8 Flash ให้กำหนดการประเมินใหม่ในเดือนมกราคมไว้ในปฏิทินของคุณตอนนี้
การเปรียบเทียบต่อโทเค็นเป็นเพียงครึ่งหนึ่งเท่านั้น โมเดลที่ใช้โทเค็นน้อยกว่าต่อคำตอบอาจมีค่าใช้จ่ายต่องานน้อยกว่าในอัตราที่สูงกว่า และวิธีเดียวที่จะทราบได้คือการรันชุดงานเดียวกันผ่านแต่ละตัวเลือกและอ่านจำนวนการใช้งานกลับมา คู่มือ Gemini 3.8 Flash API แสดงวิธีการอ่าน usageMetadata จากทั้ง Interactions API และ generateContent รุ่นเก่า
ตรวจจับการถดถอยของต้นทุนด้วยการยืนยันโทเค็นของ Apidog
โหมดความล้มเหลวของ 3.8 Flash ไม่ใช่คำตอบที่ผิด แต่เป็นคำตอบที่ถูกต้องที่ใช้โทเค็นเพิ่มขึ้น 40% อย่างเงียบๆ หลังจากการปรับเปลี่ยนพรอมต์หรือการเปลี่ยนแปลงระดับการคิด และไม่มีใครสังเกตเห็นจนกว่าจะถึงใบแจ้งหนี้ Apidog แก้ปัญหานั้นโดยถือว่าจำนวนโทเค็นเป็นฟิลด์ที่ใช้ยืนยันได้ เช่นเดียวกับรหัสสถานะ

- จัดเก็บคีย์เป็นตัวแปรสภาพแวดล้อม สร้าง
GEMINI_API_KEYในสภาพแวดล้อมของ Apidog และอ้างอิงเป็น{{GEMINI_API_KEY}}ในเฮดเดอร์x-goog-api-keyเพื่อให้คีย์ไม่ถูกจัดเก็บอยู่ในคำขอที่บันทึกไว้ - ส่งพรอมต์อ้างอิง (golden prompt) บันทึก
POSTไปยังhttps://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContentพร้อมกับพรอมต์ที่เป็นตัวแทนและthinkingConfig.thinkingLevelที่ระบุอย่างชัดเจน หนึ่งรายการต่อเส้นทางผลิตภัณฑ์ - ยืนยันฟิลด์การใช้งาน เพิ่มสคริปต์หลังการประมวลผลที่อ่าน
usageMetadataและทำให้การทดสอบล้มเหลวหากโทเค็นเกินขีดจำกัดที่ตั้งไว้จากค่าพื้นฐานของคุณ:
const usage = pm.response.json().usageMetadata;
pm.test("thinking tokens within budget", () => {
pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("visible output within budget", () => {
pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("request cost within budget", () => {
const cost = usage.promptTokenCount * 0.75 / 1e6
+ (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
pm.expect(cost).to.be.below(0.05);
});
- กำหนดเวลา ใส่คำขอลงในสถานการณ์การทดสอบและรันตามตารางเวลา เพื่อให้การเพิ่มขึ้นของปริมาณโทเค็นปรากฏเป็นการรันที่ล้มเหลวในวันเดียวกัน; คู่มือของเราเกี่ยวกับการกำหนดเวลาทดสอบ API ใน Apidog ครอบคลุมการตั้งค่า อัปเดตค่าคงที่อัตราสองค่าในวันที่ 1 มกราคม และการยืนยันต้นทุนจะยังคงติดตามบิลต่อไป
สถานการณ์เดียวกันนี้ยังใช้เป็นการแข่งขันของผู้ให้บริการ: ชี้สำเนาไปยัง Flash-Lite, Sonnet 5 หรือ Luna และเปรียบเทียบฟิลด์การใช้งานแบบเคียงข้างกัน ดาวน์โหลด Apidog เพื่อสร้างสถานการณ์แรก; แผนฟรีครอบคลุมเวิร์กโฟลว์นี้
คำถามที่พบบ่อย
Gemini 3.8 Flash มีค่าใช้จ่ายมากกว่า 3.7 Flash หรือไม่? เมื่อเทียบเป็นต่อโทเค็น ไม่เท่ากัน ทั้งสองมีค่าใช้จ่าย $0.75 สำหรับอินพุต และ $3.75 สำหรับเอาต์พุต จนถึงวันที่ 31 ธันวาคม จากนั้นจะเพิ่มเป็น $1.50 และ $7.50 แต่เมื่อเทียบเป็นต่องาน ใช่: Artificial Analysis วัดได้ $0.58 ต่องานดัชนีบน 3.8 Flash ในโหมดสูง เทียบกับ $0.40 บน 3.7 Flash เนื่องจาก 3.8 Flash สร้างโทเค็นเอาต์พุตเพิ่มขึ้นประมาณ 30%
โทเค็นการคิดถูกเรียกเก็บเงินแยกต่างหากหรือไม่? ไม่ พวกเขาถูกเรียกเก็บเงินเป็นโทเค็นเอาต์พุตที่ $3.75 ต่อล้าน (อัตราแนะนำ) และปรากฏใน usageMetadata.thoughtsTokenCount คุณควบคุมมันทางอ้อมผ่าน thinking_level; ไม่มีงบประมาณโทเค็นที่กำหนดตายตัวใน 3.8 Flash และ minimal จะคืนข้อผิดพลาด
มีระดับฟรีสำหรับ Gemini 3.8 Flash หรือไม่? มี ระดับฟรีของ AI Studio ไม่คิดค่าใช้จ่ายสำหรับอินพุตหรือเอาต์พุต โดยมีข้อจำกัดอัตราที่แสดงใน AI Studio และ Google ใช้ข้อมูลระดับฟรีเพื่อปรับปรุงผลิตภัณฑ์ของตน แอป Gemini สำหรับผู้ใช้ทั่วไปให้บริการ 3.8 Flash เฉพาะสำหรับสมาชิก AI Pro และ Ultra เท่านั้น รายละเอียดอยู่ใน คู่มือการใช้งานฟรี
จะเกิดอะไรขึ้นกับค่าใช้จ่ายของฉันในวันที่ 1 มกราคม 2027? อัตราอินพุต เอาต์พุต การอ่านแคช การจัดเก็บแคช และแบทช์จะเพิ่มขึ้นเป็นสองเท่าทั้งหมด หากการใช้โทเค็นต่องานยังคงเท่าเดิม บิลของคุณก็จะเพิ่มขึ้นเป็นสองเท่าเช่นกัน อัตราของ 3.6 Flash และ 3.7 Flash จะเพิ่มขึ้นเป็นสองเท่าในวันเดียวกัน
ระดับการคิดแบบใดที่ช่วยลดต้นทุนได้? เริ่มจากข้อมูลของ Artificial Analysis: ต่ำ $0.24, ปานกลาง $0.41, สูง $0.58 ต่องานดัชนี รันการประเมินของคุณเองในแต่ละระดับ เลือกใช้ระดับที่ต่ำที่สุดที่ผ่าน และยืนยันจำนวนโทเค็นเพื่อให้การตั้งค่าไม่คลาดเคลื่อน
สิ่งที่ควรทำในสัปดาห์นี้
Gemini 3.8 Flash มีราคาเท่ากับ 3.7 Flash และใช้โทเค็นเหมือนโมเดลที่ใหญ่กว่า ให้ถือว่าระดับการคิดเป็นการตั้งค่าต้นทุนและกำหนดต่อเส้นทาง ย้ายงานที่เหมาะกับแบทช์เข้าสู่ช่วงอัตราแนะนำก่อนวันที่ 31 ธันวาคม กำหนดค่าพื้นฐานการใช้โทเค็นของคุณตอนนี้และยืนยันค่าเหล่านั้น เพื่อให้การเพิ่มขึ้นเป็นสองเท่าในเดือนมกราคมเป็นการเปลี่ยนแปลงที่คุณได้คำนึงถึงแล้ว
