Gemini 3.8 Flash là mô hình cấp Flash mới nhất của Google, được phát hành vào ngày 2 tháng 9 năm 2026, cùng với một phiên bản song sinh bảo mật có giới hạn truy cập tên là Gemini 3.8 Flash Cyber. Đây là bản phát hành Flash thứ ba trong sáu tuần, sau Gemini 3.6 Flash vào ngày 21 tháng 7 và 3.7 Flash vào ngày 13 tháng 8, với cùng mức giá giới thiệu như 3.7 Flash: 0,75 đô la cho mỗi triệu token đầu vào và 3,75 đô la cho mỗi triệu token đầu ra cho đến ngày 31 tháng 12 năm 2026. Google gọi đây là “mô hình Flash thông minh nhất của chúng tôi, được thiết kế cho kỹ thuật phần mềm dài hạn, tác nhân tự động và quy trình công việc phức tạp của doanh nghiệp.”
Thay đổi đáng chú ý nhất không phải là giá mới hay cửa sổ ngữ cảnh lớn hơn. Đó là hành vi. Google đã thiết kế 3.8 Flash để “làm việc chăm chỉ hơn” trong các tác vụ khó: nó thực hiện các bước suy luận nhỏ hơn, tự kiểm tra công việc trong quá trình và gọi các công cụ một cách lặp đi lặp lại. Điều này mang lại những cải tiến đáng kể trên các điểm chuẩn về tác nhân, và có nghĩa là mô hình sẽ sử dụng nhiều token hơn cho mỗi tác vụ, theo thiết kế. Artificial Analysis đã đo được lượng token đầu ra nhiều hơn khoảng 30% so với 3.7 Flash. Nếu bạn lập ngân sách theo token, giá không đổi. Nếu bạn lập ngân sách theo tác vụ, chi phí sẽ tăng lên.
Hướng dẫn này bao gồm toàn bộ đợt ra mắt: thông số kỹ thuật, sự đánh đổi "làm việc chăm chỉ hơn", điểm chuẩn, giá cả, khả năng truy cập, phiên bản song sinh Cyber và những gì mô hình không thể làm. Mọi yêu cầu ở đây đều là HTTP thuần túy với JSON, vì vậy bạn có thể xây dựng và kiểm tra chúng trong Apidog trước khi chúng đến mã ứng dụng. Bài đăng ra mắt của Google và trang mô hình là các nguồn chính.
Tổng quan Gemini 3.8 Flash
| Thông số | Giá trị |
|---|---|
| ID mô hình API | gemini-3.8-flash (ổn định, không có hậu tố xem trước) |
| Ngày phát hành | Ngày 2 tháng 9 năm 2026 |
| Dựa trên | Gemini 3.7 Flash (theo thẻ mô hình DeepMind) |
| Cửa sổ ngữ cảnh | 1.048.576 token đầu vào |
| Đầu ra tối đa | 65.536 token |
| Các phương thức đầu vào | Văn bản, hình ảnh, video, âm thanh, PDF |
| Các phương thức đầu ra | Chỉ văn bản |
| Cấp độ suy nghĩ | low, medium (mặc định), high; minimal trả về lỗi |
| Giá giới thiệu (đến 31 tháng 12 năm 2026) | 0,75 đô la đầu vào / 3,75 đô la đầu ra cho mỗi triệu token; suy nghĩ được tính phí như đầu ra |
| Giá tiêu chuẩn (từ 1 tháng 1 năm 2027) | 1,50 đô la đầu vào / 7,50 đô la đầu ra cho mỗi triệu token |
| Bộ nhớ đệm ngữ cảnh | 0,075 đô la cho mỗi triệu token được lưu vào bộ đệm (giới thiệu), 0,15 đô la tiêu chuẩn |
| API hàng loạt | Giảm giá 50%: 0,375 đô la / 1,875 đô la giới thiệu |
| Giới hạn kiến thức | Tháng 3 năm 2026 |
| Khả dụng cho nhà phát triển | Gemini API, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise |
| Khả dụng cho người dùng | Ứng dụng Gemini (người đăng ký AI Pro và Ultra), Chế độ AI trong Tìm kiếm, Gemini trong Google Trang tính |
| Trạng thái 3.7 Flash | Vẫn được hỗ trợ đầy đủ; không có ngày ngừng hỗ trợ |
Ba hàng dưới đây đáng để xem xét kỹ hơn. Mức độ suy nghĩ mặc định là medium, không phải high như trên Gemini 3 Pro, vì vậy một lời nhắc được điều chỉnh trên Pro sẽ suy luận ít hơn ở đây trừ khi bạn đặt mức độ. Mức minimal trả về lỗi xác thực thay vì tự động ánh xạ sang low; hướng dẫn về cấp độ suy nghĩ sẽ giải thích cách khắc phục. Và giới hạn kiến thức tháng 3 năm 2026 đi kèm với một cảnh báo trên thẻ mô hình: trong một số lĩnh vực, kiến thức có thể bị giới hạn đến tháng 1 năm 2025.
Gemini 3.8 Flash là gì
Flash là cấp độ "ngựa kéo" của Google: mô hình được thiết kế để xử lý hầu hết lưu lượng sản xuất trong khi Pro xử lý các vấn đề khó nhất. Google gọi 3.8 Flash là “mô hình chủ lực thông minh nhất của chúng tôi từ trước đến nay,” và thẻ mô hình DeepMind mô tả nó dựa trên 3.7 Flash chứ không phải là một mô hình cơ sở mới. Vì vậy, cách nhìn nhận khách quan là đây là một sự tinh chỉnh của mô hình được phát hành ba tuần trước đó, được điều chỉnh cho kỹ thuật phần mềm dài hạn và công việc của tác nhân.

Nhịp độ phát hành là bất thường. 3.6 Flash ra mắt vào ngày 21 tháng 7 với giá 1,50 đô la / 7,50 đô la, 3.7 Flash vào ngày 13 tháng 8 với mức giá giới thiệu 0,75 đô la / 3,75 đô la, và 3.8 Flash vào ngày 2 tháng 9 với cùng mức giá. Cách diễn đạt của Google là “bản phát hành Flash thứ ba trong sáu tuần”; Artificial Analysis tính toán có một mô hình Flash thứ tư trong vòng chưa đầy bốn tháng vì số liệu của họ bao gồm 3.5 Flash-Lite. Đối với bất kỳ ai đang duy trì cấu hình mô hình, bài viết về những điểm mới của 3.7 Flash đã ba tuần tuổi và đã mô tả thế hệ trước. Không có Gemini 3.8 Pro, Gemini 4, hay Flash-Lite mới nào được phát hành cùng đợt này, và Google chưa cho biết khi nào bản cập nhật Pro sẽ ra mắt.
Thiết kế “làm việc chăm chỉ hơn” và chi phí cho bạn
Mô tả của Google về sự thay đổi là rất cụ thể. Trên các tác vụ phức tạp, 3.8 Flash “thực hiện các bước suy luận bổ sung và gọi các công cụ một cách lặp đi lặp lại.” Nó thực hiện “các bước suy luận nhỏ hơn” và “tự kiểm tra công việc trong quá trình.” Google nói thẳng về hậu quả: mô hình “có thể sử dụng nhiều token hơn cho các tác vụ phức tạp và chạy lâu hơn, theo thiết kế,” đặc biệt ở các cấp độ nỗ lực cao hơn.
Artificial Analysis đã đo lường điều đó trong bài viết độc lập của họ. Khi chạy Chỉ số thông minh của họ, 3.8 Flash ở mức suy luận cao trung bình 48.000 token đầu ra cho mỗi tác vụ, tăng 30% so với 3.7 Flash. Giá mỗi token không thay đổi, vì vậy chi phí mỗi tác vụ tăng từ 0,40 đô la trên 3.7 Flash cao lên 0,58 đô la trên 3.8 Flash cao. Thời gian cho mỗi tác vụ cũng tăng: 2,5 phút so với 2,2 phút.
Báo cáo tương tự cũng chỉ ra đòn bẩy bạn có. Ở mức medium, chi phí mỗi tác vụ giảm xuống 0,41 đô la, gần bằng 3.7 Flash ở mức cao. Ở mức low, chi phí giảm xuống 0,24 đô la với 0,8 phút cho mỗi tác vụ. Vì vậy, cấp độ suy nghĩ giờ đây là một quyết định định tuyến, chứ không phải là một cài đặt toàn cục: các điểm cuối nhạy cảm với độ trễ ở mức low, các vòng lặp tác nhân phải hoàn thành công việc ở mức medium hoặc high. Bảng phân tích giá tính toán cho 1.000 tác vụ tác nhân mỗi ngày ở mỗi cấp độ.
Tốc độ không thay đổi. Logan Kilpatrick của Google mô tả 3.8 Flash là “giá tương đương 3.7, tốc độ tương đương,” và Artificial Analysis đã đo được 302,1 token đầu ra mỗi giây ở mức suy luận cao. Thời gian phản hồi token đầu tiên là 13,30 giây trong lần chạy đó cho thấy mô hình đang suy nghĩ trước khi trả lời, không phải do đường truyền mạng chậm.
Các điểm chuẩn nói gì
Google đã công bố ba bảng điểm chuẩn dưới dạng văn bản trên trang DeepMind Flash. Đây là các số liệu do Google thực hiện.
| Điểm chuẩn | 3.8 Flash | 3.7 Flash | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|---|---|---|---|
| Vals Finance Agent v2 | 61.4% | 59.0% | 58.6% | 53.8% | 54.4% | 53.9% |
| Harvey Legal Agent Benchmark | 10.0% | 8.8% | 6.7% | 2.5% | 0.8% | 5.0% |
| HLE-Verified | 54.9% | 53.6% | 54.4% | 54.5% | 51.1% | 31.0% |
Mức tăng so với 3.7 Flash là 2,4, 1,2 và 1,3 điểm. Khá khiêm tốn, nhưng các hàng về tài chính và pháp lý cho thấy một mô hình Flash có giá thấp hơn lại vượt trội hơn Opus 5 và GPT-5.6 Sol, vốn có chi phí mỗi token cao gấp nhiều lần. Claude Fable 5.1, được phát hành một ngày trước đó, không xuất hiện trong các bảng của Google; bảng so sánh ba chiều sử dụng các hàng Opus 5 và Sonnet 5 của Anthropic làm các mục được công bố gần nhất.
Google đưa ra ba tuyên bố khác mà không có số liệu bằng văn bản. Trên DeepSWE v1.1, 3.8 Flash “vượt trội hơn hầu hết các mô hình tiên tiến lớn hơn” với “một phần nhỏ chi phí”; tỷ lệ phần trăm chỉ xuất hiện trong các bảng hình ảnh của thẻ mô hình, vì vậy chúng tôi không in ra (3.7 Flash đạt 65,3%). Trong các quy trình công việc dài hạn, nặng về tài liệu, một đánh giá nội bộ cho thấy nó “hoàn thành nhiều hơn gấp ba lần số tác vụ so với Gemini 3.7 Flash.” Về việc tấn công prompt Gray Swan, Google báo cáo một “bước nhảy vọt đáng kể” nhưng không có con số cụ thể. Kết quả SWE-Bench Pro, Terminal-bench và OSWorld không được công bố bằng văn bản cho 3.8 Flash.
Quan điểm độc lập cũng thống nhất. Artificial Analysis chấm điểm 3.8 Flash (cao) là 59 trên Chỉ số thông minh của họ, tăng từ 56 cho 3.7 Flash và 52 cho 3.6 Flash. Con số này ngang bằng với GPT-5.6 Sol (rất cao) và Grok 4.6 (trung bình), và cao hơn GPT-5.6 Terra (tối đa), Claude Fable 5.1 (trung bình) và Muse Spark 1.2 (rất cao), tất cả đều ở mức 57. Trong đánh giá sử dụng công cụ τ³-Banking của họ, 3.8 Flash đạt 45%, cao hơn 3.7 Flash 12 điểm. So sánh 3.8 Flash với 3.7 Flash cân nhắc những lợi ích đó với chi phí token theo khối lượng công việc.
Giá: cùng mỗi token, nhiều hơn mỗi tác vụ
Trang giá liệt kê 3.8 Flash trên cùng các hàng với 3.6 và 3.7 Flash, và tất cả ba phiên bản sẽ tăng gấp đôi giá vào ngày 1 tháng 1 năm 2027.
| Mục | Đến 31 tháng 12 năm 2026 | Từ 1 tháng 1 năm 2027 |
|---|---|---|
| Đầu vào | 0,75 đô la / 1 triệu | 1,50 đô la / 1 triệu |
| Đầu ra (bao gồm suy nghĩ) | 3,75 đô la / 1 triệu | 7,50 đô la / 1 triệu |
| Đầu vào được lưu vào bộ đệm | 0,075 đô la / 1 triệu | 0,15 đô la / 1 triệu |
| Lưu trữ bộ đệm | 0,50 đô la / 1 triệu token / giờ | 1,00 đô la / 1 triệu token / giờ |
| Đầu vào / đầu ra hàng loạt | 0,375 đô la / 1,875 đô la | 0,75 đô la / 3,75 đô la |
Hai chi tiết khiến mọi người dễ nhầm lẫn. Token suy nghĩ là token đầu ra: được tính phí theo tỷ lệ đầu ra và được báo cáo riêng trong usageMetadata.thoughtsTokenCount, vì vậy một câu trả lời ngắn ở cấp độ high có thể tốn kém hơn một câu trả lời dài ở cấp độ low. Và tính năng gắn kết với Google Search có một công cụ đo riêng: 5.000 yêu cầu miễn phí mỗi tháng được chia sẻ trên tất cả các mô hình Gemini 3.x, sau đó là 14 đô la cho mỗi 1.000 yêu cầu.
Một tầng miễn phí với giới hạn tốc độ tồn tại trong AI Studio và API, với Google lưu ý rằng dữ liệu tầng miễn phí “được sử dụng để cải thiện sản phẩm của chúng tôi.” Giới hạn tốc độ theo từng mô hình được hiển thị trong AI Studio chứ không phải trong tài liệu. Tầng 1 được mở khóa bằng cách liên kết tài khoản thanh toán, Tầng 2 sau 100 đô la chi tiêu và ba ngày, Tầng 3 sau 1.000 đô la và 30 ngày. Hướng dẫn truy cập miễn phí trình bày những gì bạn có thể và không thể nhận được với đường dẫn miễn phí, và hướng dẫn API hàng loạt trình bày về mức giảm giá 50% cho các công việc có thể chờ đợi.
Cách gọi nó
Google hiện coi Interactions API là đường dẫn chính cho Gemini 3.x. generateContent được “coi là cũ” nhưng “vẫn được hỗ trợ đầy đủ” mà không có ngày ngừng hoạt động, và hầu hết mã hiện có vẫn sử dụng nó. Một yêu cầu Interactions tối thiểu:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'
Các cuộc hội thoại đa lượt truyền previous_interaction_id và cho phép máy chủ giữ trạng thái. Gọi hàm khai báo công cụ với lược đồ JSON, nhận một bước function_call và mong đợi một function_result mang cả call_id và name, những trường này là bắt buộc trên 3.8 Flash (generateContent cũ gọi trường này là id). Hướng dẫn chi tiết API trình bày cả hai điểm cuối trong REST và Python, và hướng dẫn gọi hàm trình bày các vòng lặp công cụ lặp lại mà thiết kế “làm việc chăm chỉ hơn” tạo ra và cách giới hạn chúng.
Nếu bạn đang chuyển từ 3.7 Flash, các thay đổi nhỏ nhưng có thể gây lỗi: suy nghĩ minimal bị từ chối, thinking_budget được thay bằng thinking_level, candidate_count không được hỗ trợ, và Google nói nên giữ temperature ở mức mặc định 1.0 vì việc giảm nó “có thể gây ra lỗi lặp hoặc hiệu suất kém.” Hướng dẫn di chuyển biến các ghi chú về điểm mới của Google thành danh sách kiểm tra với JSON trước và sau.
Những gì Gemini 3.8 Flash không thể làm
Trang mô hình nêu rõ ràng. Không được hỗ trợ: tạo âm thanh, Live API và tạo hình ảnh. Đầu ra chỉ là văn bản, mặc dù đầu vào chấp nhận văn bản, hình ảnh, video, âm thanh và PDF. Phân đoạn hình ảnh cũng không được hỗ trợ trên các mô hình Gemini 3. Nếu sản phẩm của bạn cần đầu ra giọng nói hoặc hình ảnh theo thời gian thực, mô hình này là lớp suy luận và gọi công cụ, chứ không phải toàn bộ hệ thống. Đối với văn bản thông lượng cao, giá rẻ mà không yêu cầu suy luận nặng, Gemini 3.5 Flash-Lite vẫn nằm trong danh sách giá ở mức 0,30 đô la / 2,50 đô la. Các mục còn lại trong danh sách kiểm tra đều được hỗ trợ, bao gồm gọi hàm, đầu ra có cấu trúc, lưu bộ đệm ngữ cảnh, thực thi mã, gắn kết với Tìm kiếm và Bản đồ, API hàng loạt và sử dụng máy tính ở dạng xem trước.
Gemini 3.8 Flash Cyber: phiên bản song sinh có giới hạn truy cập
Gemini 3.8 Flash Cyber được phát hành cùng ngày, và bạn không thể đăng ký sử dụng. Quyền truy cập chỉ thông qua Chương trình Fairwind mới, dành cho “các cơ quan chính phủ đáng tin cậy, nhà điều hành cơ sở hạ tầng quan trọng và nhà bảo trì phần mềm,” với các cuộc kiểm tra lý lịch và các yêu cầu như MFA chống lừa đảo. Không có API công khai, không có giá công khai và không tự lưu trữ. Nó thay thế phiên bản thử nghiệm giới hạn 3.5 Flash Cyber.
Các tuyên bố của Google rất lớn: tỷ lệ thành công phát hiện lỗ hổng trong thế giới thực trên 70% trên 20 ngôn ngữ lập trình, và một báo cáo của đội bảo mật Chrome cho biết “2,6 lần vá lỗi chính xác hơn cho các lỗ hổng trong Chrome so với các mô hình thương mại tốt nhất có kích thước lớn hơn nhiều.” Cả hai đều do Google báo cáo. Bài giải thích về Cyber bao gồm điều kiện đủ, nghĩa vụ và ý nghĩa của nó đối với nhiều nhóm sẽ không bao giờ có quyền truy cập.
Kiểm tra yêu cầu Gemini 3.8 Flash trong Apidog
Vì câu chuyện chi phí là theo tác vụ chứ không phải theo token, bài kiểm tra hữu ích không phải là “cuộc gọi có thành công không” mà là “nó đã đốt bao nhiêu token.” Apidog xử lý điều đó như một bài kiểm tra API thông thường. Lưu GEMINI_API_KEY làm biến môi trường, lưu các yêu cầu Interactions và generateContent dưới dạng điểm cuối, và xác nhận trạng thái 200, các trường JSON mà ứng dụng của bạn đọc, và giới hạn trên usageMetadata.thoughtsTokenCount. Chạy cùng một lời nhắc ở mức low, medium và high trong một kịch bản kiểm tra và bạn sẽ nhận được mức phân bổ token theo cấp độ cho các lời nhắc của riêng bạn thay vì mức trung bình của Artificial Analysis.
Phản hồi dạng luồng (streaming responses) được hiển thị dưới dạng SSE, điều này hữu ích khi gỡ lỗi tóm tắt suy nghĩ với includeThoughts: true; hướng dẫn kiểm tra SSE sẽ giải thích điều đó. Lập lịch kịch bản hàng ngày và một lỗi hồi quy token sẽ làm thất bại một xác nhận trước khi nó xuất hiện trên hóa đơn. Tải xuống Apidog để thiết lập trên gói miễn phí.
Câu hỏi thường gặp
Gemini 3.8 Flash là một mô hình mới hay bản cập nhật cho 3.7 Flash? Thẻ mô hình DeepMind nói rằng nó dựa trên Gemini 3.7 Flash. Hãy coi nó như một phiên bản kế nhiệm được tinh chỉnh: cùng giá, tốc độ và cửa sổ ngữ cảnh, với nhiều bước suy luận và gọi công cụ hơn trên các tác vụ khó. 3.7 Flash vẫn được hỗ trợ đầy đủ, không có ngày ngừng hỗ trợ.
Tại sao Gemini 3.8 Flash sử dụng nhiều token hơn 3.7 Flash? Theo thiết kế. Google cho biết nó “có thể sử dụng nhiều token hơn cho các tác vụ phức tạp và chạy lâu hơn,” và Artificial Analysis đã đo được lượng token đầu ra nhiều hơn 30% trên chỉ số của họ. Hạ thấp thinking_level xuống medium hoặc low trên các tuyến không cần suy luận bổ sung; hướng dẫn về cấp độ suy nghĩ có bảng chi phí theo từng cấp độ.
Cửa sổ ngữ cảnh của Gemini 3.8 Flash là bao nhiêu? 1.048.576 token đầu vào và 65.536 token đầu ra, với bộ nhớ đệm ngữ cảnh có giá 0,075 đô la cho mỗi triệu token được lưu vào bộ đệm cho đến ngày 31 tháng 12 năm 2026.
Tôi có thể sử dụng Gemini 3.8 Flash trong ứng dụng Gemini miễn phí không? Thông tin ra mắt liệt kê ứng dụng Gemini dành cho người đăng ký Google AI Pro và Ultra, không phải tầng ứng dụng miễn phí. Các nhà phát triển có một tầng miễn phí giới hạn tốc độ trong AI Studio và API.
Gemini 3.8 Flash so sánh với Claude Fable 5.1 như thế nào? Artificial Analysis chấm điểm chúng lần lượt là 59 và 57. Về giá, Claude Fable 5.1 có giá 10 đô la / 50 đô la cho mỗi triệu token, khoảng 13 lần so với mức giá giới thiệu của 3.8 Flash cho cả đầu vào và đầu ra. Khoảng cách thu hẹp lại khi bạn tính token trên mỗi tác vụ.
Bước tiếp theo
Gemini 3.8 Flash là một mô hình chủ lực có khả năng suy nghĩ lâu hơn, và sự đánh đổi là rõ ràng: tăng thêm vài điểm trên các điểm chuẩn tác nhân và 12 điểm về sử dụng công cụ, đổi lại bằng việc sử dụng nhiều hơn khoảng 30% token đầu ra ở cấp độ suy luận cao. Nếu các tác nhân của bạn đang gặp khó khăn với 3.7 Flash, bản nâng cấp này có chi phí mỗi token tương tự. Nếu lưu lượng truy cập của bạn là cuộc trò chuyện bị giới hạn bởi độ trễ, hãy đặt ở mức low hoặc tiếp tục sử dụng 3.7 Flash, vốn vẫn được hỗ trợ. Bắt đầu với hướng dẫn chi tiết API, gửi yêu cầu đầu tiên của bạn từ Apidog với xác nhận số lượng token đính kèm, và hãy để các con số, chứ không phải bài đăng ra mắt, quyết định cấp độ suy nghĩ cho mỗi tuyến.
