Giá Gemini 3.8 Flash: Ưu đãi ban đầu, token suy nghĩ và chi phí thực tế mỗi tác vụ

Giá Gemini 3.8 Flash: mức giá giới thiệu 0,75 USD/3,75 USD sẽ tăng gấp đôi vào ngày 1 tháng 1 năm 2027, các token suy nghĩ được tính phí như đầu ra, bộ nhớ đệm, xử lý hàng loạt và lý do chi phí cho mỗi tác vụ tăng lên 0,58 USD.

Ashley Goolam

Ashley Goolam

3 tháng 9 2026

Giá Gemini 3.8 Flash: Ưu đãi ban đầu, token suy nghĩ và chi phí thực tế mỗi tác vụ

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Gemini 3.8 Flash có giá 0,75 đô la cho mỗi triệu token đầu vào và 3,75 đô la cho mỗi triệu token đầu ra, mức giá giới thiệu tương tự mà Google đã đặt cho 3.7 Flash. Mức giá này kéo dài đến ngày 31 tháng 12 năm 2026. Vào ngày 1 tháng 1 năm 2027, giá sẽ tăng gấp đôi lên 1,50 đô la và 7,50 đô la, và mức tăng gấp đôi tương tự cũng áp dụng cho 3.6 Flash và 3.7 Flash vào cùng ngày. Không có gì thay đổi về giá mỗi token trong bản phát hành này.

Điều thay đổi là số lượng token mà mô hình sử dụng. Google cho biết 3.8 Flash "làm việc chăm chỉ hơn": nó thực hiện nhiều bước suy luận hơn, gọi công cụ lặp đi lặp lại và "có thể sử dụng nhiều token hơn cho các tác vụ phức tạp và kéo dài hơn, theo thiết kế". Artificial Analysis đã đo lường hiệu ứng này một cách độc lập: chạy Intelligence Index của họ tốn 0,58 đô la cho mỗi tác vụ trên 3.8 Flash ở mức độ suy nghĩ cao so với 0,40 đô la trên 3.7 Flash, với khoảng 30% nhiều token đầu ra hơn cho mỗi tác vụ. Giá niêm yết giống nhau, hóa đơn cao hơn.

Hướng dẫn này sẽ đi qua từng dòng trên trang giá API Gemini chính thức, thực hiện ví dụ 1.000 tác vụ mỗi ngày ở mỗi cấp độ suy nghĩ và so sánh tỷ lệ với Flash-Lite, Claude Sonnet 5 và GPT-5.6 Luna. Để có cái nhìn tổng quan về mô hình trước tiên, hãy bắt đầu với Gemini 3.8 Flash là gì.

Tổng quan về giá Gemini 3.8 Flash

Tất cả giá đều tính trên 1 triệu token ở bậc trả phí.

Mức giá Giới thiệu (đến hết 31 tháng 12 năm 2026) Tiêu chuẩn (từ 1 tháng 1 năm 2027)
Đầu vào (văn bản, hình ảnh, video, âm thanh, PDF) $0.75 $1.50
Đầu ra (bao gồm token suy nghĩ) $3.75 $7.50
Đọc bộ nhớ đệm ngữ cảnh $0.075 $0.15
Lưu trữ bộ nhớ đệm (mỗi 1M token mỗi giờ) $0.50 $1.00
Đầu vào API hàng loạt (giảm 50%) $0.375 $0.75
Đầu ra API hàng loạt (giảm 50%) $1.875 $3.75
Google Search grounding 5.000 yêu cầu miễn phí/tháng được chia sẻ trên Gemini 3.x, sau đó 14 đô la cho mỗi 1.000 Tương tự
Tầng miễn phí $0, có giới hạn tỷ lệ, dữ liệu được sử dụng để cải thiện sản phẩm của Google Tương tự

Ba chi tiết quan trọng hơn các con số tiêu đề. Giá đầu ra bao gồm các token suy nghĩ, vì vậy suy luận nội bộ được tính phí ở mức 3,75 đô la, không phải 0,75 đô la. Mức giá giới thiệu có ngày kết thúc cố định. Và các dòng 3.7 Flash và 3.6 Flash cũng tăng gấp đôi vào ngày 1 tháng 1, vì vậy Flash cũ hơn không giúp bạn tránh được sự gia tăng. Phân tích giá 3.7 Flash bao gồm các mức giá tương tự trên một mô hình sử dụng ít token hơn cho mỗi tác vụ.

Token suy nghĩ là token đầu ra

Gemini 3.8 Flash suy luận trước khi đưa ra câu trả lời, và mỗi token của quá trình suy luận đó đều được tính phí như đầu ra. API báo cáo số lượng dưới dạng usageMetadata.thoughtsTokenCount trong phản hồi generateContent, tách biệt với candidatesTokenCount (câu trả lời hiển thị) và promptTokenCount (đầu vào của bạn). Cả hai nhóm đầu ra đều được tính phí ở mức 3,75 đô la.

Bạn điều chỉnh số lượng bằng thinking_level: low, medium hoặc high. Trên 3.8 Flash, mặc định là medium, không phải high như trên Gemini 3 Pro. minimal đã bị loại bỏ và trả về lỗi xác thực, vì vậy bất kỳ cấu hình nào được chuyển từ các mô hình trước đó cần phải ánh xạ giá trị đó sang low. Tài liệu suy nghĩ của Google mô tả các cấp độ này như là nỗ lực tương đối, không phải ngân sách token, vì vậy bạn không thể giới hạn trực tiếp các token suy nghĩ theo cách mà thinking_budget số nguyên cũ cho phép. Những gì mỗi cấp độ ảnh hưởng đến độ trễ và chi phí được mô tả trong hướng dẫn cấp độ suy nghĩ 3.8 Flash.

Một minh họa nhanh với các kích thước được tạo ra nhưng thực tế. Giả sử một yêu cầu gửi 10.000 token đầu vào và nhận lại 2.000 token đầu ra hiển thị cộng với 6.000 token suy nghĩ. Ở mức giá giới thiệu:

Suy nghĩ chiếm 75% phí đầu ra và 60% tổng yêu cầu. Từ ngày 1 tháng 1, cùng một yêu cầu sẽ tốn 0,015 đô la + 0,06 đô la = 0,075 đô la. "Giá giống 3.7" là đúng và không đầy đủ: tỷ lệ giữ nguyên, số lượng token đã thay đổi.

Tại sao chi phí mỗi tác vụ tăng trong khi giá không đổi

Bài đăng ra mắt của Google nói rõ về sự đánh đổi: trên các tác vụ phức tạp, mô hình "thực hiện thêm các bước suy luận và gọi các công cụ lặp đi lặp lại", xác minh công việc của nó trong quá trình. Nhiều bước hơn có nghĩa là nhiều token suy nghĩ hơn và, trong các vòng lặp tác nhân, nhiều lượt gọi công cụ hơn. Lời khuyên giảm thiểu của Google: hạ thinking_level, hoặc ở lại 3.7 Flash.

Artificial Analysis đã đưa ra các con số. Intelligence Index của họ chạy chín lần đánh giá; 3.8 Flash ở mức cao đạt 59 so với 56 của 3.7 Flash ở mức cao, sử dụng trung bình khoảng 48.000 token đầu ra cho mỗi tác vụ, tăng 30% so với 3.7 Flash. Chi phí để chạy chỉ mục cho mỗi tác vụ:

Cấu hình Chi phí mỗi tác vụ (AA, giá giới thiệu) Thời gian mỗi tác vụ
Gemini 3.8 Flash, cao $0.58 2.5 phút
Gemini 3.8 Flash, trung bình $0.41 chưa công bố
Gemini 3.8 Flash, thấp $0.24 0.8 phút
Gemini 3.7 Flash, cao $0.40 2.2 phút

Đọc bảng theo hai cách. So với phiên bản tiền nhiệm, 3.8 Flash ở mức cao tốn thêm 45% chi phí mỗi tác vụ (0,58 đô la / 0,40 đô la = 1,45) để tăng ba điểm chỉ số. So với chính nó, giảm từ cao xuống trung bình cắt giảm chi phí mỗi tác vụ 29% (0,41 đô la / 0,58 đô la = 0,71), và thấp cắt giảm 59% (0,24 đô la / 0,58 đô la = 0,41). Trung bình trên 3.8 Flash nằm trong vòng một xu so với cao trên 3.7 Flash, một điểm neo hữu ích khi quyết định có nên nâng cấp hay không. So sánh 3.8 Flash vs 3.7 Flash phân tích quyết định đó theo khối lượng công việc.

Artificial Analysis cũng liệt kê mức giá tổng hợp 0,58 đô la cho mỗi triệu token với tỷ lệ đầu vào trên đầu ra là 3:1. Việc nó khớp với chi phí cao cấp cho mỗi tác vụ chỉ là ngẫu nhiên; một là tỷ lệ mỗi token, cái kia phụ thuộc vào số lượng token mà mô hình chọn sử dụng.

Cố định mức giá giới thiệu trước ngày 31 tháng 12

"Cố định" cần một ý nghĩa chính xác, vì mức giá giới thiệu không phải là hợp đồng. Google tính phí sử dụng theo tỷ lệ hiện hành khi token được tiêu thụ, vì vậy bạn không thể trả trước mức sử dụng năm 2027 với giá năm 2026, và việc chuyển sang 3.7 hoặc 3.6 Flash cũng không giúp ích gì. Điều bạn có thể làm là chuyển công việc không bắt buộc vào khoảng thời gian này:

Nếu giá là yếu tố quyết định giữa các nhà cung cấp, tổng hợp các nhà cung cấp API LLM rẻ nhất của chúng tôi sẽ trình bày toàn bộ lĩnh vực; so sánh Fable 5.1 và GPT-5.6 Sol bao gồm các bậc cao cấp.

So sánh với Flash-Lite, Sonnet 5 và GPT-5.6 Luna

Tỷ lệ mỗi token, trên 1 triệu token:

Mô hình Đầu vào Đầu ra Ghi chú
Gemini 3.8 Flash (giới thiệu) $0.75 $3.75 Suy nghĩ được tính phí như đầu ra; đọc bộ nhớ đệm $0.075
Gemini 3.8 Flash (từ 1 tháng 1) $1.50 $7.50 Đọc bộ nhớ đệm $0.15
Gemini 3.5 Flash-Lite $0.30 $2.50 Khoảng 350 tok/s
Claude Sonnet 5 $2 $10 Vĩnh viễn; việc tăng giá ngày 1 tháng 9 đã bị hủy
GPT-5.6 Luna $1 $6

Ở mức giá giới thiệu, đầu vào của 3.8 Flash đắt gấp 2,5 lần Flash-Lite và đầu ra đắt gấp 1,5 lần. So với Sonnet 5, 3.8 Flash rẻ hơn khoảng 2,7 lần cho cả đầu vào ($2 / $0,75) và đầu ra ($10 / $3,75). So với Luna, nó cũng rẻ hơn: $0,75 so với $1 cho đầu vào, $3,75 so với $6 cho đầu ra.

Bức tranh sẽ đảo ngược vào ngày 1 tháng 1. Với giá 1,50 đô la và 7,50 đô la, 3.8 Flash trở nên đắt hơn Luna ở cả hai phía, và khoảng cách đến Sonnet 5 thu hẹp còn khoảng 1,3 lần ($2 / $1,50 và $10 / $7,50). Flash-Lite vẫn rẻ hơn trong suốt thời gian đó. Nếu mức giá giới thiệu là lý do bạn chọn 3.8 Flash, hãy đánh dấu việc đánh giá lại vào tháng Giêng trên lịch của bạn ngay bây giờ.

So sánh mỗi token chỉ là một nửa câu chuyện. Một mô hình sử dụng ít token hơn cho mỗi câu trả lời có thể có chi phí mỗi tác vụ thấp hơn ở mức giá cao hơn, và cách duy nhất để biết là chạy cùng một bộ tác vụ qua từng ứng cử viên và đọc lại số lượng sử dụng. Hướng dẫn API 3.8 Flash cho biết cách đọc usageMetadata từ cả API Interactions và generateContent cũ.

Phát hiện sự tăng chi phí với các khẳng định token của Apidog

Lỗi trên 3.8 Flash không phải là một câu trả lời sai. Đó là một câu trả lời đúng nhưng lại âm thầm sử dụng thêm 40% token sau khi điều chỉnh lời nhắc hoặc thay đổi cấp độ suy nghĩ, và không ai nhận ra cho đến khi nhận được hóa đơn. Apidog khắc phục điều đó bằng cách coi số lượng token là một trường để khẳng định, giống như mã trạng thái.

  1. Lưu khóa dưới dạng biến môi trường. Tạo GEMINI_API_KEY trong môi trường Apidog và tham chiếu nó dưới dạng {{GEMINI_API_KEY}} trong tiêu đề x-goog-api-key, để khóa không bao giờ nằm trong yêu cầu đã lưu.
  2. Gửi một lời nhắc vàng. Lưu một POST tới https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent với một lời nhắc đại diện và thinkingConfig.thinkingLevel rõ ràng, một cho mỗi tuyến sản xuất.
  3. Khẳng định trên các trường sử dụng. Thêm một tập lệnh hậu xử lý đọc usageMetadata và làm cho kiểm tra thất bại nếu số token vượt quá giới hạn được đặt từ mức cơ sở của bạn:
const usage = pm.response.json().usageMetadata;
pm.test("thinking tokens within budget", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("visible output within budget", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("request cost within budget", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
  pm.expect(cost).to.be.below(0.05);
});
  1. Lên lịch. Đặt các yêu cầu vào một kịch bản kiểm tra và chạy nó theo lịch trình, để việc tăng sử dụng token hiển thị là một lần chạy thất bại ngay trong ngày; hướng dẫn của chúng tôi về cách lên lịch kiểm tra API trong Apidog bao gồm thiết lập này. Cập nhật hai hằng số tỷ lệ vào ngày 1 tháng 1 và khẳng định chi phí sẽ tiếp tục theo dõi hóa đơn.

Kịch bản tương tự cũng có thể dùng để so sánh các nhà cung cấp: hướng một bản sao đến Flash-Lite, Sonnet 5 hoặc Luna và so sánh các trường sử dụng cạnh nhau. Tải xuống Apidog để xây dựng kịch bản đầu tiên; gói miễn phí bao gồm quy trình làm việc này.

Câu hỏi thường gặp

Gemini 3.8 Flash có đắt hơn 3.7 Flash không? Mỗi token, không. Cả hai đều có giá 0,75 đô la đầu vào và 3,75 đô la đầu ra đến hết ngày 31 tháng 12, sau đó là 1,50 đô la và 7,50 đô la. Mỗi tác vụ, có: Artificial Analysis đo được 0,58 đô la mỗi tác vụ chỉ mục trên 3.8 Flash ở mức cao so với 0,40 đô la trên 3.7 Flash, vì 3.8 Flash tạo ra nhiều hơn khoảng 30% token đầu ra.

Các token suy nghĩ có được tính phí riêng không? Không. Chúng được tính phí như token đầu ra ở mức 3,75 đô la mỗi triệu (giới thiệu) và hiển thị trong usageMetadata.thoughtsTokenCount. Bạn kiểm soát chúng một cách gián tiếp thông qua thinking_level; không có ngân sách token cứng trên 3.8 Flash, và minimal sẽ trả về lỗi.

Có tầng miễn phí cho Gemini 3.8 Flash không? Có. Tầng miễn phí AI Studio không tính phí đầu vào hoặc đầu ra, với giới hạn tỷ lệ hiển thị trong AI Studio, và Google sử dụng dữ liệu tầng miễn phí để cải thiện sản phẩm của mình. Ứng dụng Gemini dành cho người tiêu dùng chỉ phục vụ 3.8 Flash cho người đăng ký AI Pro và Ultra. Chi tiết có trong hướng dẫn sử dụng miễn phí.

Điều gì sẽ xảy ra với chi phí của tôi vào ngày 1 tháng 1 năm 2027? Tỷ lệ đầu vào, đầu ra, đọc bộ nhớ đệm, lưu trữ bộ nhớ đệm và hàng loạt đều tăng gấp đôi. Nếu mức sử dụng token cho mỗi tác vụ vẫn giữ nguyên, hóa đơn của bạn cũng tăng gấp đôi. Các dòng 3.6 và 3.7 Flash cũng tăng gấp đôi vào cùng ngày.

Cấp độ suy nghĩ nào giúp giữ chi phí thấp? Bắt đầu từ mức chênh lệch của Artificial Analysis: thấp 0,24 đô la, trung bình 0,41 đô la, cao 0,58 đô la cho mỗi tác vụ chỉ mục. Tự chạy các đánh giá của riêng bạn ở mỗi cấp độ, giữ cấp độ thấp nhất đáp ứng yêu cầu và khẳng định số lượng token để cài đặt không bị trôi đi.

Những việc cần làm trong tuần này

Gemini 3.8 Flash có giá như 3.7 Flash và sử dụng token như một mô hình lớn hơn. Hãy coi cấp độ suy nghĩ là một cài đặt chi phí và đặt nó cho từng lộ trình. Chuyển công việc có thể xử lý theo lô vào khoảng thời gian giới thiệu trước ngày 31 tháng 12. Định mức sử dụng token của bạn ngay bây giờ và khẳng định nó, để việc tăng gấp đôi vào tháng Giêng là một thay đổi mà bạn đã tính toán trước.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API