Gemini 3.8 Flash đi kèm ba cấp độ tư duy: low, medium và high. Cài đặt này kiểm soát mức độ suy luận nội bộ mà mô hình thực hiện trước khi trả lời, và trên mô hình này, nó ảnh hưởng đồng thời đến ba yếu tố: độ trễ (latency), số lượng token đầu ra (output tokens), và hóa đơn của bạn. Google đã thiết kế 3.8 Flash để “làm việc chăm chỉ hơn” với các tác vụ phức tạp, vì vậy cấp độ bạn chọn quan trọng hơn so với 3.7 Flash. Nếu bạn mới làm quen với mô hình, tổng quan về Gemini 3.8 Flash sẽ giới thiệu về việc ra mắt. Hướng dẫn này chỉ tập trung vào các cấp độ.
Hai chi tiết thường khiến các nhóm gặp khó khăn trong giờ đầu tiên. Cấp độ mặc định trên 3.8 Flash là medium, không phải high (Gemini 3 Pro mặc định là high, đây là nguồn gốc của sự nhầm lẫn). Và minimal, vốn vẫn được các cấu hình viết cho Gemini 3.7 Flash gửi đi, không còn được chấp nhận: yêu cầu sẽ không vượt qua kiểm tra hợp lệ trước khi một token nào được tạo ra. Google tài liệu hóa cả hai vấn đề này trên trang Có gì mới trong Gemini 3.8 Flash.
Dưới đây: mỗi cấp độ làm gì, chi phí mỗi tác vụ là bao nhiêu, cách đặt nó trong cả hai dạng API, một chiến lược theo từng tuyến đường, và một bài kiểm tra có thể lặp lại cho thấy sự chênh lệch về token và độ trễ trước khi bạn triển khai.
Các cấp độ tư duy trong nháy mắt
| Cấp độ | Hướng dẫn của Google | Chi phí mỗi tác vụ (AA) | Thời gian mỗi tác vụ (AA) | Sử dụng khi |
|---|---|---|---|---|
low |
Giảm thiểu độ trễ và chi phí; tuân thủ hướng dẫn đơn giản, trò chuyện, các tuyến đường có thông lượng cao | $0.24 | 0.8 phút | độ trễ hiển thị cho người dùng quan trọng; tìm kiếm bản ghi; phân loại |
medium (mặc định) |
Mặc định cho mã phức tạp và công việc tác nhân | $0.41 | chưa được công bố | hầu hết các tuyến đường; hỏi đáp video tổng quát |
high |
Độ sâu suy luận tối đa cho các vấn đề đa bước khó nhất | $0.58 | 2.5 phút | Hỏi đáp hình ảnh chuyên sâu; video dài hơn 60 phút; các bước lập kế hoạch ảnh hưởng đến mọi thứ sau đó |
minimal |
Không được hỗ trợ trên 3.8 Flash | Không áp dụng | Không áp dụng | không bao giờ; hãy ánh xạ nó sang low |
Các cột chi phí và thời gian là số liệu trung bình của Artificial Analysis từ việc chạy Intelligence Index của họ ở mỗi cấp độ, với giá mỗi token giới thiệu của Google. Đây là các số liệu độc lập, không phải của Google, và chúng đo lường khối lượng công việc chuẩn, không phải các prompt của bạn. Hãy sử dụng chúng để tham khảo tỷ lệ, sau đó đo lường các tuyến đường của riêng bạn.
Mỗi cấp độ làm gì
Mỗi phản hồi của 3.8 Flash có thể bao gồm các thinking token (token tư duy): suy luận mà mô hình tạo ra trước câu trả lời hiển thị. Bạn phải trả tiền cho chúng dưới dạng output token (token đầu ra) (3.75 USD mỗi triệu token với giá giới thiệu đến ngày 31/12/2026, 7.50 USD từ ngày 01/01/2027), và API báo cáo chúng riêng biệt dưới dạng usageMetadata.thoughtsTokenCount. Cấp độ tư duy cho mô hình biết cần thực hiện bao nhiêu suy luận.
lowgiữ cho quá trình tư duy ngắn gọn. Token đầu tiên đến nhanh nhất và hóa đơn đầu ra giữ ở mức thấp. Google định vị nó cho các công việc nhạy cảm về độ trễ: tuân thủ hướng dẫn đơn giản, trò chuyện và các điểm cuối có thông lượng cao.mediumlà điểm cân bằng và là mặc định. Google coi nó là cài đặt cho mã phức tạp và các tác vụ tác nhân, vốn là phần lớn những gì mọi người chạy một mô hình lớp Flash.highyêu cầu mô hình suy luận sâu nhất có thể. Google dành nó cho các vấn đề đa bước khó nhất.
Điều làm cho điều này khác biệt trên 3.8 Flash là hành vi mặc định mới của mô hình. Trên các tác vụ phức tạp, nó “thực hiện các bước suy luận bổ sung và gọi công cụ lặp đi lặp lại” và “xác minh công việc của mình trong quá trình thực hiện”. Google nói rõ rằng nó “có thể sử dụng nhiều token hơn cho các tác vụ phức tạp và chạy lâu hơn, theo thiết kế” và rằng “mô hình có thể sử dụng nhiều token hơn để tối đa hóa hiệu suất, đặc biệt ở các cấp độ nỗ lực cao hơn”. Cấp độ tư duy là giới hạn đối với hành vi đó. Giảm cấp độ là gợi ý đầu tiên của Google khi lượng token sử dụng tăng lên; gợi ý thứ hai là tiếp tục sử dụng 3.7 Flash, vốn vẫn được hỗ trợ đầy đủ.
Một hạn chế cần ghi nhớ: thinking_level là một enum (kiểu liệt kê), không phải là một ngân sách. Số nguyên thinking_budget từ các mô hình trước đã bị loại bỏ trên Gemini 3, vì vậy bạn không thể yêu cầu “tối đa 2.000 thinking token”. Bạn chọn một cấp độ và sau đó xác minh chi phí của nó trên các prompt của bạn, đó là lý do tại sao bài kiểm tra ở cuối hướng dẫn này lại quan trọng.
Mặc định là medium, không phải high
Nếu bỏ qua trường này, 3.8 Flash sẽ chạy ở cấp độ medium. Điều này ảnh hưởng đến hai nhóm người dùng.
Các nhóm đã thử nghiệm trên Gemini 3 Pro mong đợi high là mặc định và nhận được câu trả lời ở độ sâu trung bình mà không nhận ra. Các nhóm đã loại bỏ thinking_budget trong quá trình nâng cấp 3.7 Flash và không thay thế nó bằng một cấp độ sẽ kết thúc ở cấp độ medium ở mọi nơi, bao gồm cả các tuyến trò chuyện lẽ ra phải ở cấp độ low.
Cách khắc phục cho cả hai trường hợp là như nhau: đặt thinking_level một cách rõ ràng trên mỗi yêu cầu, theo từng tuyến đường, trong cấu hình, không phải trong mã. Các cài đặt mặc định thuộc quyền thay đổi của Google; hồ sơ chi phí của bạn không nên thay đổi khi họ làm vậy.
Tại sao minimal bị loại bỏ và cách khắc phục lỗi
minimal đã hoạt động trên Gemini 3.7 Flash. Trên 3.8 Flash, nó không còn nằm trong tập hợp được hỗ trợ, và trang mô hình chỉ liệt kê các cấp độ tư duy là low, medium và high. Gửi yêu cầu qua REST và yêu cầu sẽ bị từ chối trước khi mô hình chạy với lỗi 400 INVALID_ARGUMENT cùng thông báo “Thinking level MINIMAL is not supported for this model. Please retry with other thinking level.” (đã xác minh bằng một cuộc gọi trực tiếp vào ngày 3 tháng 9 năm 2026). Các SDK bọc lỗi đó trong lớp ngoại lệ riêng của chúng, vì vậy hãy khớp với trạng thái 400 hoặc mã INVALID_ARGUMENT, chứ không phải chuỗi thông báo.
Trước đây:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "minimal" }
}
Sau đây:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "low" }
}
Hướng dẫn di chuyển của Google là một ánh xạ trực tiếp: minimal trở thành low. Có hai cám dỗ cần tránh khi bạn đang cấu hình. Đừng tìm đến thinking_budget để có mức sàn thấp hơn; nó không được hỗ trợ trên các mô hình Gemini 3. Và đừng giảm temperature để "làm dịu mô hình"; Google khuyên nên giữ nó ở giá trị mặc định 1.0 trên tất cả các mô hình Gemini 3 vì việc giảm nó có thể gây lặp lại hoặc làm giảm chất lượng đầu ra. Danh sách kiểm tra đầy đủ, bao gồm chữ ký tư duy và yêu cầu call_id trên các phản hồi hàm, nằm trong hướng dẫn di chuyển từ 3.7 sang 3.8 Flash.
Vì lỗi xảy ra tại thời điểm xác thực, một yêu cầu kiểm tra được lên lịch ở mỗi cấp độ sẽ phát hiện miễn phí một cấu hình quay trở lại minimal.
Chi phí mỗi cấp độ cho mỗi tác vụ
Giá mỗi token không thay đổi theo cấp độ. Trang giá của Google liệt kê mỗi cuộc gọi 3.8 Flash có giá 0.75 USD đầu vào và 3.75 USD đầu ra mỗi triệu token ở mức giá giới thiệu, tăng gấp đôi lên 1.50 USD và 7.50 USD vào ngày 01/01/2027. Sự chênh lệch giữa các cấp độ hoàn toàn là do số lượng token, đây là điều mà Artificial Analysis đã đo lường.
| Mô hình và cấp độ | Chi phí mỗi tác vụ | Thời gian mỗi tác vụ |
|---|---|---|
Gemini 3.8 Flash low |
$0.24 | 0.8 phút |
Gemini 3.8 Flash medium |
$0.41 | chưa được công bố |
Gemini 3.8 Flash high |
$0.58 | 2.5 phút |
Gemini 3.7 Flash high |
$0.40 | 2.2 phút |
Nguồn: Artificial Analysis, các lần chạy Intelligence Index với giá giới thiệu. Ba tỷ lệ được rút ra từ bảng.
low chạy với chi phí khoảng 41% so với high và khoảng một phần ba thời gian thực tế của nó. Đây là đòn bẩy đơn lớn nhất bạn có trên mô hình này.
medium trên 3.8 Flash có chi phí tương đương với high trên 3.7 Flash (0.41 USD so với 0.40 USD). Nếu bạn hài lòng với 3.7 Flash ở cấp độ high, thì 3.8 Flash ở cấp độ medium là dòng ngân sách tương đương.
high trên 3.8 Flash có chi phí mỗi tác vụ cao hơn 45% so với high trên 3.7 Flash, với giá mỗi token giống hệt nhau, bởi vì mô hình phát ra nhiều hơn khoảng 30% output token (trung bình 48k mỗi tác vụ index). Đó chính là thiết kế "làm việc chăm chỉ hơn" thể hiện trên hóa đơn. Liệu các token bổ sung có đáng giá hay không phụ thuộc vào khối lượng công việc; so sánh 3.8 Flash vs 3.7 Flash sẽ đi sâu vào nơi mà sự cải thiện chất lượng đã đạt được.
Một lưu ý về chất lượng: Điểm Intelligence Index 59 của AA cho 3.8 Flash là kết quả từ cấp độ high. Họ không công bố điểm index ở cấp độ medium hoặc low, vì vậy đừng cho rằng đường cong chất lượng tuyến tính với chi phí. Hãy tự kiểm tra đánh giá của riêng bạn ở mỗi cấp độ trước khi bạn giảm cấp độ cho một tuyến đường. Để xem ví dụ minh họa về 1.000 tác vụ mỗi ngày ở mỗi cấp độ và ngưỡng giá ngày 31 tháng 12, hãy xem giá Gemini 3.8 Flash.
Đặt thinking_level trong Interactions API
Interactions API là giao diện chính của Google cho Gemini 3.x. Cấp độ nằm trong generation_config dưới dạng chuỗi snake_case:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Giải thích bộ nhớ đệm HTTP trong 3 câu.","generation_config":{"thinking_level":"low"}}'
Trong Python:
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Giải thích bộ nhớ đệm HTTP trong 3 câu.",
generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
Đây là một trường cấp yêu cầu, vì vậy hãy đặt nó trên mọi cuộc gọi, bao gồm cả các lượt tiếp theo chuyển previous_interaction_id. Phản hồi trả về dưới dạng danh sách các bước thực thi (suy nghĩ, gọi công cụ) kết thúc bằng model_output, và SDK hiển thị văn bản cuối cùng dưới dạng output_text. Để xem hướng dẫn đầy đủ về cuộc gọi đầu tiên, bao gồm trạng thái đa lượt và truyền trực tuyến (streaming), hãy xem cách sử dụng Gemini 3.8 Flash API.
Đặt nó trong generateContent cũ
Hầu hết mã Gemini hiện có vẫn gọi generateContent. Google gọi nó là cũ (legacy) nhưng cho biết nó vẫn được hỗ trợ đầy đủ mà không có ngày ngừng hoạt động, vì vậy không cần phải vội vàng. Trường này được lồng sâu hơn một cấp và sử dụng camelCased:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' -X POST \
-d '{"contents":[{"parts":[{"text":"Giải thích bộ nhớ đệm HTTP trong 3 câu."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
Trong Python:
from google.genai import types
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Giải thích bộ nhớ đệm HTTP trong 3 câu.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.usage_metadata.thoughts_token_count)
includeThoughts: true thêm tóm tắt suy nghĩ vào phản hồi dưới dạng các phần được gắn cờ thought: true: hữu ích khi hiệu chỉnh cấp độ, nhưng sẽ gây nhiễu sau khi bạn hoàn thành. Con số bạn quan tâm là usageMetadata.thoughtsTokenCount, số lượng chính xác được tính phí dưới dạng đầu ra và là trường mà các bài kiểm tra của bạn nên theo dõi.
Chiến lược theo từng tuyến đường
Coi cấp độ là một quyết định định tuyến, không phải một cài đặt toàn cầu. Một cách phân chia khả thi:
- Trò chuyện, tự động hoàn thành và bất kỳ thứ gì mà người dùng đang chờ:
low. Đây là nơi có độ trễ token đầu tiên. - Phân loại, trích xuất và tìm kiếm bản ghi:
low, với quá trình đánh giá của riêng bạn chạy một lần để xác nhận độ chính xác. Ví dụ video của Google đặt tìm kiếm bản ghi ở cấp độlow. - Các tác nhân mã hóa và vòng lặp công cụ:
medium, mặc định. Nâng một bước lập kế hoạch đơn lẻ lênhighnếu đầu ra của nó ảnh hưởng đến mọi bước sau đó, sau đó quay lại. Trên 3.8 Flash, các vòng lặp công cụ đã chạy nhiều lượt hơn theo thiết kế, vì vậyhightrên toàn bộ vòng lặp sẽ tăng chi phí nhanh chóng. - Quy trình làm việc nặng tài liệu, dài hạn:
high, và đưa chúng qua Batch API với giảm giá 50% khi chúng không tương tác. - Video: Tài liệu của Google đưa ra ba ví dụ.
highcho QA hình ảnh chuyên sâu hoặc video dài hơn 60 phút,mediumcho QA video tổng quát,lowcho tìm kiếm bản ghi.
Nếu low trên 3.8 Flash vẫn là cấp độ mô hình cao hơn mức một tuyến đường cần, thì dòng Flash-Lite tồn tại cho công việc đó; hướng dẫn Gemini 3.1 Flash-Lite trước đây của chúng tôi đề cập đến sự đánh đổi, và Gemini 3.5 Flash-Lite là phiên bản hiện tại với 0.30 USD đầu vào và 2.50 USD đầu ra.
Giữ cấp độ trong cấu hình theo từng tuyến đường và giữ gemini-3.7-flash đằng sau một cờ. Nếu số lượng token của một tuyến đường tăng vọt sau khi nâng cấp, bạn có thể giảm cấp độ hoặc mô hình mà không cần triển khai lại.
Kiểm tra cả ba cấp độ song song trong Apidog
Đọc bảng của AA cho bạn biết các tỷ lệ. Chỉ các prompt của bạn mới cho bạn biết các con số cụ thể. Dưới đây là một kịch bản kiểm tra trong Apidog gửi một prompt vàng ở mỗi cấp độ và xác nhận kết quả trả về. Nó hoạt động với cả hai dạng API; điểm cuối cũ được hiển thị vì usageMetadata là một trường cấp cao nhất ở đó.
- Lưu khóa API dưới dạng biến môi trường. Tạo
GEMINI_API_KEYtrong môi trường Apidog và tham chiếu nó dưới dạng{{GEMINI_API_KEY}}trong tiêu đềx-goog-api-key. Thêm một biến thứ hai,THINKING_LEVEL, để một yêu cầu đã lưu có thể phục vụ cả ba bước. - Lưu một yêu cầu. Gửi POST đến
/v1beta/models/gemini-3.8-flash:generateContentvới prompt vàng của bạn và"thinkingConfig": {"thinkingLevel": "{{THINKING_LEVEL}}"}. - Xây dựng kịch bản kiểm tra ba bước. Nhập cùng một yêu cầu ba lần và ghi đè
THINKING_LEVELthànhlow,mediumvàhightrong mỗi bước. - Xác nhận các trường thay đổi. Ở mỗi bước: trạng thái là 200 và
usageMetadata.thoughtsTokenCounttồn tại. Ở bướclow, xác nhậnthoughtsTokenCountvà thời gian phản hồi vẫn nằm dưới giới hạn mà tuyến đường có thể chịu đựng (đặt mức cơ sở sau lần chạy đầu tiên của bạn). Một script xử lý sau có thể lưu trữ số lượng của mỗi bước vào một biến để bướchighcó thể xác nhận rằng nó suy luận ít nhất bằnglow. Nếu thứ tự đó thay đổi, mô hình hoặc cài đặt mặc định đã thay đổi dưới sự kiểm soát của bạn. - Thêm bước bảo vệ. Gửi
thinkingLevel: "minimal"và xác nhận rằng phản hồi không phải là 200. Khi bạn sau này thay đổi ID mô hình, bước này cho bạn biết liệu mô hình mới có vẫn từ chối nó hay không. - Lên lịch. Chạy kịch bản hàng ngày để một sự thoái lui cấu hình hoặc một thay đổi hành vi âm thầm xuất hiện dưới dạng một lần chạy thất bại, không phải một hóa đơn bất ngờ. Cơ chế được giải thích trong cách lên lịch kiểm tra API trong Apidog.
Đối với các phản hồi được truyền trực tuyến, kịch bản tương tự áp dụng với kết xuất SSE; cách kiểm tra API LLM truyền trực tuyến qua SSE bao gồm phần thiết lập. Tải xuống Apidog để làm theo; gói miễn phí bao gồm toàn bộ kịch bản này.
Câu hỏi thường gặp
Cấp độ tư duy có làm thay đổi giá mỗi token không?
Không. Giá đầu vào là 0.75 USD và đầu ra là 3.75 USD cho mỗi triệu token trên 3.8 Flash ở mức giá giới thiệu, bất kể cấp độ. Cấp độ thay đổi số lượng token đầu ra mà mô hình tạo ra trong quá trình tư duy, và những token đó được tính phí theo giá đầu ra. Phân tích giá bao gồm caching, batch và mức tăng vào ngày 1 tháng 1.
Tôi có thể đặt ngân sách thinking token chính xác thay thế không?
Không, trên các mô hình Gemini 3. thinking_budget đã được thay thế bằng enum thinking_level, và 3.8 Flash chỉ chấp nhận low, medium và high. Nếu bạn cần một giới hạn trên, hãy thực thi nó trong các bài kiểm tra và cảnh báo thay vì trong yêu cầu.
Điểm 59 của Artificial Analysis sử dụng cấp độ nào?
high. AA đã chạy Intelligence Index ở cấp độ high để có điểm số chính và cũng đã công bố chi phí và thời gian ở cấp độ low và medium, nhưng không phải điểm index ở các cấp độ đó. Hãy coi các cấp độ thấp hơn là chưa được kiểm tra trên điểm chuẩn đó cho đến khi bạn tự chạy đánh giá của mình.
Tôi có nên giảm temperature để giảm tư duy không?
Không. Hướng dẫn của Google cho tất cả các mô hình Gemini 3 là giữ temperature ở giá trị mặc định là 1.0. Việc giảm nó có thể gây ra vòng lặp hoặc làm giảm chất lượng đầu ra. Hãy sử dụng thinking_level để kiểm soát độ sâu suy luận.
Nếu ngay cả cấp độ low cũng quá chậm hoặc quá đắt thì sao?
Hãy giữ Gemini 3.7 Flash, mà Google cho biết vẫn được hỗ trợ đầy đủ và không có ngày ngừng hoạt động, hoặc chuyển tuyến đường sang mô hình Flash-Lite. So sánh 3.8 và 3.7 Flash cho thấy ở đâu các token bổ sung mang lại chất lượng đáng kể và ở đâu chúng không.
Chọn cấp độ theo từng tuyến đường, sau đó đo lường
Ba cấp độ, một kiểu liệt kê (enum), và một mô hình mặc định suy luận nhiều hơn người tiền nhiệm. Đặt thinking_level một cách rõ ràng trên mỗi tuyến đường, ánh xạ bất kỳ minimal còn sót lại nào thành low, và theo dõi usageMetadata.thoughtsTokenCount tại mỗi cấp độ. Các số liệu của AA cho mỗi tác vụ (0.24 USD, 0.41 USD, 0.58 USD) cho bạn hình dạng của đường cong; một kịch bản ba bước trong Apidog sẽ cung cấp cho bạn các con số của riêng bạn trước khi sự thay đổi giá vào ngày 31 tháng 12 khiến chúng trở nên quan trọng gấp đôi.
