ราคา Gemini 3.8 Flash: อัตราช่วงแนะนำ, โทเค็นประมวลผล และต้นทุนจริงต่องาน

ราคา Gemini 3.8 Flash: อัตราเริ่มต้น $0.75/$3.75 จะเพิ่มเป็นสองเท่าในวันที่ 1 มกราคม 2027, โทเค็นประมวลผลถูกคิดค่าบริการเป็นเอาต์พุต, การแคช, การประมวลผลแบบแบตช์, และสาเหตุที่ต้นทุนต่อภารกิจเพิ่มขึ้นเป็น $0.58

Ashley Goolam

Ashley Goolam

3 September 2026

ราคา Gemini 3.8 Flash: อัตราช่วงแนะนำ, โทเค็นประมวลผล และต้นทุนจริงต่องาน

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

Gemini 3.8 Flash มีค่าใช้จ่าย $0.75 ต่อล้านโทเค็นขาเข้า และ $3.75 ต่อล้านโทเค็นขาออก ซึ่งเป็นอัตราแนะนำเดียวกันกับที่ Google กำหนดไว้สำหรับ 3.7 Flash อัตรานี้จะใช้ได้จนถึงวันที่ 31 ธันวาคม 2026 ในวันที่ 1 มกราคม 2027 อัตราจะเพิ่มขึ้นเป็นสองเท่าเป็น $1.50 และ $7.50 และอัตราที่เพิ่มขึ้นเป็นสองเท่านี้จะใช้กับ 3.6 Flash และ 3.7 Flash ในวันเดียวกัน ไม่มีอะไรเปลี่ยนแปลงเกี่ยวกับราคาต่อโทเค็นในการเปิดตัวครั้งนี้

สิ่งที่เปลี่ยนแปลงคือจำนวนโทเค็นที่โมเดลใช้ Google กล่าวว่า 3.8 Flash “ทำงานหนักขึ้น”: โดยใช้ขั้นตอนการให้เหตุผลมากขึ้น เรียกใช้เครื่องมือซ้ำๆ และ “สามารถใช้โทเค็นมากขึ้นกับงานที่ใช้เวลานานและซับซ้อนตามการออกแบบ” Artificial Analysis ได้วัดผลกระทบอย่างเป็นอิสระ: การรัน Intelligence Index มีค่าใช้จ่าย $0.58 ต่องานบน 3.8 Flash ในโหมดการคิดระดับสูง เทียบกับ $0.40 บน 3.7 Flash โดยมีโทเค็นขาออกเพิ่มขึ้นประมาณ 30% ต่องาน ราคาตามป้ายเท่าเดิม แต่บิลสูงขึ้น

คู่มือนี้จะอธิบายทุกบรรทัดใน หน้าการกำหนดราคา Gemini API อย่างเป็นทางการ พร้อมยกตัวอย่างงาน 1,000 งานต่อวันในแต่ละระดับการคิด และเปรียบเทียบอัตรากับ Flash-Lite, Claude Sonnet 5 และ GPT-5.6 Luna สำหรับภาพรวมโมเดลเบื้องต้น โปรดเริ่มจาก Gemini 3.8 Flash คืออะไร

ราคา Gemini 3.8 Flash โดยสรุป

ราคาทั้งหมดเป็นต่อ 1 ล้านโทเค็นในระดับแบบชำระเงิน

อัตรา อัตราแนะนำ (ถึง 31 ธันวาคม 2026) อัตรามาตรฐาน (ตั้งแต่วันที่ 1 มกราคม 2027)
ขาเข้า (ข้อความ, รูปภาพ, วิดีโอ, เสียง, PDF) $0.75 $1.50
ขาออก (รวมโทเค็นการคิด) $3.75 $7.50
การอ่านแคชบริบท $0.075 $0.15
การจัดเก็บแคช (ต่อ 1 ล้านโทเค็นต่อชั่วโมง) $0.50 $1.00
อินพุต Batch API (ลด 50%) $0.375 $0.75
เอาต์พุต Batch API (ลด 50%) $1.875 $3.75
Google Search grounding 5,000 คำขอฟรี/เดือน แชร์ข้าม Gemini 3.x หลังจากนั้น $14 ต่อ 1,000 คำขอ เช่นเดิม
ระดับฟรี $0, มีการจำกัดอัตรา, ข้อมูลจะถูกใช้เพื่อปรับปรุงผลิตภัณฑ์ของ Google เช่นเดิม

มีสามรายละเอียดที่สำคัญกว่าตัวเลขพาดหัวข่าว การกำหนดราคาขาออกครอบคลุมโทเค็นการคิด ดังนั้นการให้เหตุผลภายในจะมีค่าใช้จ่าย $3.75 ไม่ใช่ $0.75 อัตราแนะนำมีวันสิ้นสุดที่แน่นอน และอัตราของ 3.7 Flash และ 3.6 Flash ก็จะเพิ่มขึ้นเป็นสองเท่าในวันที่ 1 มกราคมเช่นกัน ดังนั้น Flash รุ่นเก่ากว่าก็ไม่สามารถช่วยให้คุณรอดพ้นจากการขึ้นราคาได้ รายละเอียดการกำหนดราคา 3.7 Flash ครอบคลุมอัตราเดียวกันบนโมเดลที่ใช้โทเค็นน้อยกว่าต่องาน

โทเค็นการคิดคือโทเค็นขาออก

Gemini 3.8 Flash จะให้เหตุผลก่อนที่จะตอบ และโทเค็นทุกส่วนของการให้เหตุผลนั้นจะถูกนับเป็นเอาต์พุต API จะรายงานจำนวนเป็น usageMetadata.thoughtsTokenCount ในการตอบกลับ generateContent ซึ่งแยกต่างหากจาก candidatesTokenCount (คำตอบที่มองเห็นได้) และ promptTokenCount (อินพุตของคุณ) ทั้งสองส่วนของเอาต์พุตมีค่าใช้จ่ายเท่ากันที่ $3.75

คุณสามารถควบคุมปริมาณได้ด้วย thinking_level: low, medium หรือ high สำหรับ 3.8 Flash ค่าเริ่มต้นคือ medium ไม่ใช่ high เหมือนใน Gemini 3 Pro ค่า minimal ถูกยกเลิกและจะคืนข้อผิดพลาดในการตรวจสอบ ดังนั้นการตั้งค่าใดๆ ที่มาจากโมเดลรุ่นก่อนหน้าจะต้องถูกแมปค่าเป็น low เอกสารเกี่ยวกับการคิด ของ Google อธิบายระดับต่างๆ ว่าเป็นความพยายามสัมพัทธ์ ไม่ใช่การกำหนดงบประมาณโทเค็น ดังนั้นคุณจึงไม่สามารถจำกัดโทเค็นการคิดได้โดยตรงเหมือนที่ thinking_budget แบบจำนวนเต็มเก่าเคยอนุญาตไว้ สิ่งที่แต่ละระดับส่งผลต่อความหน่วงและค่าใช้จ่ายอยู่ใน คู่มือระดับการคิดของ 3.8 Flash

ตัวอย่างสั้นๆ ด้วยขนาดสมมติแต่สมจริง สมมติว่าคำขอส่งโทเค็นขาเข้า 10,000 โทเค็น และได้รับโทเค็นขาออกที่มองเห็นได้ 2,000 โทเค็น พร้อมด้วยโทเค็นการคิด 6,000 โทเค็น ด้วยอัตราแนะนำ:

การคิดเป็น 75% ของค่าใช้จ่ายขาออก และ 60% ของคำขอทั้งหมด ตั้งแต่วันที่ 1 มกราคม คำขอเดียวกันนี้จะมีค่าใช้จ่าย $0.015 + $0.06 = $0.075 คำกล่าวที่ว่า “ราคาเท่ากับ 3.7” เป็นความจริงแต่ไม่สมบูรณ์: อัตราคงที่ แต่จำนวนโทเค็นเปลี่ยนแปลงไป

เหตุใดต้นทุนต่องานจึงเพิ่มขึ้น ในขณะที่ราคาไม่ได้เพิ่มขึ้น

ประกาศเปิดตัว ของ Google พูดถึงการแลกเปลี่ยนโดยตรง: ในงานที่ซับซ้อน โมเดลจะ “ดำเนินการขั้นตอนการให้เหตุผลเพิ่มเติม และเรียกใช้เครื่องมือซ้ำๆ” เพื่อตรวจสอบการทำงานของมันไปพร้อมกัน ขั้นตอนที่มากขึ้นหมายถึงโทเค็นการคิดที่มากขึ้น และในวงจรเอเจนต์ หมายถึงการเรียกใช้เครื่องมือที่มากขึ้น คำแนะนำในการลดผลกระทบจาก Google: ลด thinking_level หรือใช้งาน 3.7 Flash ต่อไป

Artificial Analysis ได้ให้ตัวเลขไว้ Intelligence Index ของพวกเขาวิ่งเก้าการประเมิน; 3.8 Flash ที่ระดับสูงได้คะแนน 59 เทียบกับ 56 สำหรับ 3.7 Flash ที่ระดับสูง โดยใช้โทเค็นขาออกประมาณ 48,000 โทเค็นต่องานโดยเฉลี่ย เพิ่มขึ้น 30% จาก 3.7 Flash ต้นทุนในการรันดัชนีต่องาน:

การกำหนดค่า ต้นทุนต่องาน (AA, อัตราแนะนำ) เวลาต่องาน
Gemini 3.8 Flash, สูง $0.58 2.5 นาที
Gemini 3.8 Flash, ปานกลาง $0.41 ยังไม่เผยแพร่
Gemini 3.8 Flash, ต่ำ $0.24 0.8 นาที
Gemini 3.7 Flash, สูง $0.40 2.2 นาที

อ่านตารางได้สองวิธี เมื่อเทียบกับรุ่นก่อนหน้า 3.8 Flash ที่ระดับสูงมีค่าใช้จ่ายสูงขึ้น 45% ต่องาน ($0.58 / $0.40 = 1.45) เพื่อเพิ่มคะแนนดัชนีสามจุด เมื่อเทียบกับตัวเอง การลดระดับจากสูงเป็นปานกลางจะช่วยลดต้นทุนต่องานได้ 29% ($0.41 / $0.58 = 0.71) และระดับต่ำจะลดลง 59% ($0.24 / $0.58 = 0.41) ระดับปานกลางบน 3.8 Flash มีค่าใช้จ่ายใกล้เคียงกับระดับสูงบน 3.7 Flash ซึ่งเป็นจุดอ้างอิงที่มีประโยชน์ในการตัดสินใจว่าจะอัปเกรดหรือไม่ การเปรียบเทียบ 3.8 Flash vs 3.7 Flash จะช่วยให้ตัดสินใจได้ตามปริมาณงาน

Artificial Analysis ยังระบุราคาแบบผสมที่ $0.58 ต่อล้านโทเค็นในอัตราส่วนอินพุตต่อเอาต์พุต 3:1 การที่ราคาตรงกับต้นทุนระดับสูงต่องานเป็นเรื่องบังเอิญ หนึ่งคืออัตราต่อโทเค็น อีกหนึ่งขึ้นอยู่กับจำนวนโทเค็นที่โมเดลเลือกใช้

ล็อคอัตราแนะนำก่อนวันที่ 31 ธันวาคม

คำว่า “ล็อคอัตรา” ต้องการความหมายที่แม่นยำ เพราะอัตราแนะนำไม่ใช่สัญญา Google จะเรียกเก็บเงินตามอัตราที่มีผลบังคับใช้เมื่อมีการใช้โทเค็น ดังนั้นคุณจึงไม่สามารถชำระค่าใช้จ่ายล่วงหน้าในปี 2027 ในราคาปี 2026 ได้ และการเปลี่ยนไปใช้ 3.7 หรือ 3.6 Flash ก็ไม่ช่วยอะไร สิ่งที่คุณทำได้คือย้ายงานที่ไม่เร่งด่วนเข้าสู่ช่วงเวลานี้:

หากราคาเป็นปัจจัยในการตัดสินใจเลือกผู้ให้บริการ บทสรุปผู้ให้บริการ LLM API ที่ถูกที่สุดของเรา จะแสดงภาพรวมทั้งหมด; การเปรียบเทียบ Fable 5.1 และ GPT-5.6 Sol ครอบคลุมระดับพรีเมียม

เปรียบเทียบกับ Flash-Lite, Sonnet 5 และ GPT-5.6 Luna อย่างไร

อัตราต่อโทเค็น, ต่อ 1 ล้านโทเค็น:

โมเดล ขาเข้า ขาออก หมายเหตุ
Gemini 3.8 Flash (แนะนำ) $0.75 $3.75 การคิดจะถูกเรียกเก็บเป็นเอาต์พุต; การอ่านแคช $0.075
Gemini 3.8 Flash (ตั้งแต่วันที่ 1 ม.ค.) $1.50 $7.50 การอ่านแคช $0.15
Gemini 3.5 Flash-Lite $0.30 $2.50 ประมาณ 350 โทเค็น/วินาที
Claude Sonnet 5 $2 $10 ถาวร; การขึ้นราคา 1 กันยายนถูกยกเลิก
GPT-5.6 Luna $1 $6

ด้วยอัตราแนะนำ อินพุตของ 3.8 Flash มีราคาเป็น 2.5 เท่าของ Flash-Lite และเอาต์พุตเป็น 1.5 เท่า เมื่อเทียบกับ Sonnet 5, 3.8 Flash ถูกกว่าประมาณ 2.7 เท่าทั้งอินพุต ($2 / $0.75) และเอาต์พุต ($10 / $3.75) เมื่อเทียบกับ Luna ก็ถูกกว่าเช่นกัน: $0.75 เทียบกับ $1 สำหรับอินพุต, $3.75 เทียบกับ $6 สำหรับเอาต์พุต

ภาพรวมจะกลับกันในวันที่ 1 มกราคม ที่ราคา $1.50 และ $7.50, 3.8 Flash จะมีราคาแพงกว่า Luna ทั้งสองด้าน และช่องว่างกับ Sonnet 5 จะแคบลงเหลือประมาณ 1.3 เท่า ($2 / $1.50 และ $10 / $7.50) Flash-Lite ยังคงถูกกว่าตลอดเวลา หากอัตราแนะนำคือเหตุผลที่คุณเลือก 3.8 Flash ให้กำหนดการประเมินใหม่ในเดือนมกราคมไว้ในปฏิทินของคุณตอนนี้

การเปรียบเทียบต่อโทเค็นเป็นเพียงครึ่งหนึ่งเท่านั้น โมเดลที่ใช้โทเค็นน้อยกว่าต่อคำตอบอาจมีค่าใช้จ่ายต่องานน้อยกว่าในอัตราที่สูงกว่า และวิธีเดียวที่จะทราบได้คือการรันชุดงานเดียวกันผ่านแต่ละตัวเลือกและอ่านจำนวนการใช้งานกลับมา คู่มือ Gemini 3.8 Flash API แสดงวิธีการอ่าน usageMetadata จากทั้ง Interactions API และ generateContent รุ่นเก่า

ตรวจจับการถดถอยของต้นทุนด้วยการยืนยันโทเค็นของ Apidog

โหมดความล้มเหลวของ 3.8 Flash ไม่ใช่คำตอบที่ผิด แต่เป็นคำตอบที่ถูกต้องที่ใช้โทเค็นเพิ่มขึ้น 40% อย่างเงียบๆ หลังจากการปรับเปลี่ยนพรอมต์หรือการเปลี่ยนแปลงระดับการคิด และไม่มีใครสังเกตเห็นจนกว่าจะถึงใบแจ้งหนี้ Apidog แก้ปัญหานั้นโดยถือว่าจำนวนโทเค็นเป็นฟิลด์ที่ใช้ยืนยันได้ เช่นเดียวกับรหัสสถานะ

  1. จัดเก็บคีย์เป็นตัวแปรสภาพแวดล้อม สร้าง GEMINI_API_KEY ในสภาพแวดล้อมของ Apidog และอ้างอิงเป็น {{GEMINI_API_KEY}} ในเฮดเดอร์ x-goog-api-key เพื่อให้คีย์ไม่ถูกจัดเก็บอยู่ในคำขอที่บันทึกไว้
  2. ส่งพรอมต์อ้างอิง (golden prompt) บันทึก POST ไปยัง https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent พร้อมกับพรอมต์ที่เป็นตัวแทนและ thinkingConfig.thinkingLevel ที่ระบุอย่างชัดเจน หนึ่งรายการต่อเส้นทางผลิตภัณฑ์
  3. ยืนยันฟิลด์การใช้งาน เพิ่มสคริปต์หลังการประมวลผลที่อ่าน usageMetadata และทำให้การทดสอบล้มเหลวหากโทเค็นเกินขีดจำกัดที่ตั้งไว้จากค่าพื้นฐานของคุณ:
const usage = pm.response.json().usageMetadata;
pm.test("thinking tokens within budget", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("visible output within budget", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("request cost within budget", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
  pm.expect(cost).to.be.below(0.05);
});
  1. กำหนดเวลา ใส่คำขอลงในสถานการณ์การทดสอบและรันตามตารางเวลา เพื่อให้การเพิ่มขึ้นของปริมาณโทเค็นปรากฏเป็นการรันที่ล้มเหลวในวันเดียวกัน; คู่มือของเราเกี่ยวกับการกำหนดเวลาทดสอบ API ใน Apidog ครอบคลุมการตั้งค่า อัปเดตค่าคงที่อัตราสองค่าในวันที่ 1 มกราคม และการยืนยันต้นทุนจะยังคงติดตามบิลต่อไป

สถานการณ์เดียวกันนี้ยังใช้เป็นการแข่งขันของผู้ให้บริการ: ชี้สำเนาไปยัง Flash-Lite, Sonnet 5 หรือ Luna และเปรียบเทียบฟิลด์การใช้งานแบบเคียงข้างกัน ดาวน์โหลด Apidog เพื่อสร้างสถานการณ์แรก; แผนฟรีครอบคลุมเวิร์กโฟลว์นี้

คำถามที่พบบ่อย

Gemini 3.8 Flash มีค่าใช้จ่ายมากกว่า 3.7 Flash หรือไม่? เมื่อเทียบเป็นต่อโทเค็น ไม่เท่ากัน ทั้งสองมีค่าใช้จ่าย $0.75 สำหรับอินพุต และ $3.75 สำหรับเอาต์พุต จนถึงวันที่ 31 ธันวาคม จากนั้นจะเพิ่มเป็น $1.50 และ $7.50 แต่เมื่อเทียบเป็นต่องาน ใช่: Artificial Analysis วัดได้ $0.58 ต่องานดัชนีบน 3.8 Flash ในโหมดสูง เทียบกับ $0.40 บน 3.7 Flash เนื่องจาก 3.8 Flash สร้างโทเค็นเอาต์พุตเพิ่มขึ้นประมาณ 30%

โทเค็นการคิดถูกเรียกเก็บเงินแยกต่างหากหรือไม่? ไม่ พวกเขาถูกเรียกเก็บเงินเป็นโทเค็นเอาต์พุตที่ $3.75 ต่อล้าน (อัตราแนะนำ) และปรากฏใน usageMetadata.thoughtsTokenCount คุณควบคุมมันทางอ้อมผ่าน thinking_level; ไม่มีงบประมาณโทเค็นที่กำหนดตายตัวใน 3.8 Flash และ minimal จะคืนข้อผิดพลาด

มีระดับฟรีสำหรับ Gemini 3.8 Flash หรือไม่? มี ระดับฟรีของ AI Studio ไม่คิดค่าใช้จ่ายสำหรับอินพุตหรือเอาต์พุต โดยมีข้อจำกัดอัตราที่แสดงใน AI Studio และ Google ใช้ข้อมูลระดับฟรีเพื่อปรับปรุงผลิตภัณฑ์ของตน แอป Gemini สำหรับผู้ใช้ทั่วไปให้บริการ 3.8 Flash เฉพาะสำหรับสมาชิก AI Pro และ Ultra เท่านั้น รายละเอียดอยู่ใน คู่มือการใช้งานฟรี

จะเกิดอะไรขึ้นกับค่าใช้จ่ายของฉันในวันที่ 1 มกราคม 2027? อัตราอินพุต เอาต์พุต การอ่านแคช การจัดเก็บแคช และแบทช์จะเพิ่มขึ้นเป็นสองเท่าทั้งหมด หากการใช้โทเค็นต่องานยังคงเท่าเดิม บิลของคุณก็จะเพิ่มขึ้นเป็นสองเท่าเช่นกัน อัตราของ 3.6 Flash และ 3.7 Flash จะเพิ่มขึ้นเป็นสองเท่าในวันเดียวกัน

ระดับการคิดแบบใดที่ช่วยลดต้นทุนได้? เริ่มจากข้อมูลของ Artificial Analysis: ต่ำ $0.24, ปานกลาง $0.41, สูง $0.58 ต่องานดัชนี รันการประเมินของคุณเองในแต่ละระดับ เลือกใช้ระดับที่ต่ำที่สุดที่ผ่าน และยืนยันจำนวนโทเค็นเพื่อให้การตั้งค่าไม่คลาดเคลื่อน

สิ่งที่ควรทำในสัปดาห์นี้

Gemini 3.8 Flash มีราคาเท่ากับ 3.7 Flash และใช้โทเค็นเหมือนโมเดลที่ใหญ่กว่า ให้ถือว่าระดับการคิดเป็นการตั้งค่าต้นทุนและกำหนดต่อเส้นทาง ย้ายงานที่เหมาะกับแบทช์เข้าสู่ช่วงอัตราแนะนำก่อนวันที่ 31 ธันวาคม กำหนดค่าพื้นฐานการใช้โทเค็นของคุณตอนนี้และยืนยันค่าเหล่านั้น เพื่อให้การเพิ่มขึ้นเป็นสองเท่าในเดือนมกราคมเป็นการเปลี่ยนแปลงที่คุณได้คำนึงถึงแล้ว

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API