Gemini 3.6 Flash là gì?

Gemini 3.6 Flash là mô hình chủ lực mới của Google, sẽ được phát hành rộng rãi vào ngày 21 tháng 7 năm 2026. Nó rẻ hơn và sử dụng token hiệu quả hơn so với 3.5 Flash. Thông số kỹ thuật, điểm chuẩn, giá cả và cách truy cập.

Ashley Innocent

Ashley Innocent

22 tháng 7 2026

Gemini 3.6 Flash là gì?

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Gemini 3.6 Flash là mô hình chủ lực mới của Google. Nó được phát hành rộng rãi vào ngày 21 tháng 7 năm 2026, rẻ hơn và hiệu quả về token hơn so với Gemini 3.5 Flash mà nó thay thế. Nếu bạn gửi lưu lượng API lớn và muốn chất lượng ổn định mà không phải trả giá cao cấp, đây là cấp độ mà Google đã tạo ra dành cho bạn.

Hướng dẫn này bao gồm mô hình là gì, những thay đổi so với phiên bản trước, thông số kỹ thuật đầy đủ, cách nó đạt điểm trong các bài kiểm tra hiệu năng, chi phí và cách truy cập. Bạn cũng sẽ biết cách tự gửi và kiểm tra hồi quy các lệnh gọi API, để các con số trên trang của Google khớp với những gì bạn thực sự nhận được.

button

Gemini 3.6 Flash là gì?

Gemini 3.6 Flash là mô hình thông lượng cao, cấp trung trong gia đình Gemini của Google. "Mô hình chủ lực" là từ đúng để mô tả nó. Mô hình này được điều chỉnh cho các công việc hàng ngày chiếm phần lớn lưu lượng truy cập sản xuất: tóm tắt, trích xuất, phân loại, trò chuyện và gọi công cụ đa bước. Nó nhanh, giá cả phải chăng, và có thể đọc văn bản, hình ảnh, video, âm thanh và PDF trong một lần gọi duy nhất.

Google đã phát hành nó cùng với hai mô hình khác vào ngày 21 tháng 7 năm 2026. Hai mô hình còn lại là Gemini 3.5 Flash-Lite, một phiên bản rẻ hơn và nhanh hơn dành cho các công việc có khối lượng lớn, và Gemini 3.5 Flash Cyber, một mô hình bảo mật được kiểm soát mà chỉ các chính phủ và đối tác tin cậy mới có thể truy cập. Bạn có thể đọc phân tích đầy đủ về cấp độ giá rẻ trong bài giải thích Gemini 3.5 Flash-Lite là gì của chúng tôi, và mô hình bảo mật được kiểm soát trong bài Gemini 3.5 Flash Cyber là gì.

Đây là phần khiến mọi người bối rối: việc đánh số phiên bản bị lẫn lộn. Mô hình chủ lực đã nhảy lên 3.6, nhưng Flash-Lite và Flash Cyber vẫn ở phiên bản 3.5. Vì vậy, "các mô hình Flash mới" không phải tất cả đều có cùng số phiên bản. Khi bạn chọn một ID mô hình, hãy đọc kỹ. gemini-3.6-flashgemini-3.5-flash-lite là các cấp độ khác nhau, không phải lỗi đánh máy.

Google đã công bố thông tin trên blog của Google, và thẻ mô hình có trên trang DeepMind Flash.

Có gì mới so với Gemini 3.5 Flash?

Thay đổi đáng chú ý nhất là hiệu quả. Gemini 3.6 Flash sử dụng ít hơn khoảng 17% token đầu ra so với 3.5 Flash để hoàn thành cùng một công việc. Ít token hơn có nghĩa là chi phí thấp hơn và phản hồi nhanh hơn, vì token đầu ra là thứ bạn phải trả nhiều nhất và mất nhiều thời gian nhất để truyền tải.

Google cũng đã giảm giá đầu ra. Với 3.5 Flash, bạn phải trả 9,00 USD cho mỗi triệu token đầu ra. Với 3.6 Flash, bạn trả 7,50 USD. Cộng thêm mức giảm giá này vào khoản tiết kiệm token, và chi phí hiệu quả cho mỗi tác vụ giảm nhiều hơn so với những gì con số niêm yết cho thấy.

Mô hình này cũng tốt hơn trong việc viết mã và sử dụng máy tính, đồng thời nó đưa ra câu trả lời với ít bước suy luận và ít lệnh gọi công cụ hơn trong các quy trình làm việc đa bước. Điều này quan trọng đối với các tác nhân (agents). Mỗi vòng lặp suy luận và lệnh gọi công cụ bổ sung sẽ tăng độ trễ và chi phí, vì vậy việc cắt giảm chúng giúp các tác nhân hoạt động rẻ hơn và nhanh hơn từ đầu đến cuối.

Nếu bạn đang cân nhắc chuyển đổi lưu lượng truy cập hiện có, chúng tôi sẽ phân tích các đánh đổi trong bài Gemini 3.6 Flash so với 3.5 Flash.

Thông số kỹ thuật của Gemini 3.6 Flash

Thuộc tính Gemini 3.6 Flash
ID mô hình gemini-3.6-flash
Cửa sổ ngữ cảnh đầu vào 1M token
Đầu ra tối đa 64k token
Các hình thức đầu vào Văn bản, hình ảnh, video, âm thanh, PDF
Đầu ra Chỉ văn bản
Giá đầu vào 1,50 USD cho mỗi 1M token
Giá đầu ra 7,50 USD cho mỗi 1M token (bao gồm token suy nghĩ)
Cấp miễn phí Có, qua Google AI Studio (có giới hạn tốc độ)
Ra mắt 21 tháng 7 năm 2026

Hai con số đáng được lưu ý. Cửa sổ ngữ cảnh đầu vào 1M có nghĩa là bạn có thể cung cấp cho mô hình các tài liệu lớn, bản ghi dài hoặc toàn bộ cơ sở mã trong một yêu cầu duy nhất. Giới hạn đầu ra tối đa 64k là mức trần cho một phản hồi duy nhất, vì vậy nếu bạn cần tạo nội dung dài bằng sách, bạn sẽ phải chia nhỏ công việc thành nhiều lần gọi.

Hiệu suất của nó

Các điểm chuẩn là đại diện, không phải lời hứa, nhưng chúng cho bạn biết mô hình mạnh ở điểm nào. Dưới đây là cách Gemini 3.6 Flash đạt điểm trên các bộ kiểm tra công khai mà Google đã báo cáo.

Về khả năng lập trình, nó đạt 58,7% trên SWE-Bench Pro, một bài kiểm tra xem liệu một mô hình có thể giải quyết các vấn đề GitHub thực tế trong các kho lưu trữ sản phẩm hay không. Nó đạt 49% trên DeepSWE v1.1, một điểm chuẩn kỹ thuật phần mềm khác. Trên Terminal-bench 2.1, đo lường việc chạy lệnh trong một terminal thực, nó đạt 78,0%.

Việc sử dụng máy tính là nơi thể hiện rõ nhất sự cải tiến. Trên OSWorld-Verified, một bài kiểm tra đánh giá khả năng mô hình điều khiển máy tính để bàn và các ứng dụng của nó, 3.6 Flash đạt 83,0%, tăng từ 78,4% của 3.5 Flash. Đây là một bước tiến đáng kể cho bất kỳ ai xây dựng các tác nhân (agents) có khả năng tương tác với các giao diện thực.

Về chất lượng tổng thể, nó đạt GDPVal-AA v2 Elo là 1421. GDPVal đo lường hiệu suất trong các tác vụ chuyên nghiệp trong thế giới thực, và điểm Elo đánh giá các mô hình đối đầu theo cách xếp hạng cờ vua, vì vậy số càng cao có nghĩa là nó thắng nhiều trận đấu hơn.

Ngữ cảnh dài là một bức tranh hỗn hợp, và đáng để trung thực về nó. Ở 128k token, mô hình đạt trung bình 91,8% về khả năng truy xuất, đây là một con số mạnh mẽ. Khi đẩy đến cửa sổ 1M token đầy đủ với truy xuất điểm, độ chính xác giảm xuống 54,0%. Nói một cách đơn giản, mô hình vẫn sắc bén với các đầu vào lớn, nhưng đừng cho rằng khả năng nhớ lại hoàn hảo khi bạn lấp đầy toàn bộ cửa sổ ngữ cảnh. Hãy kiểm tra khả năng truy xuất của riêng bạn ở độ dài bạn thực sự sử dụng.

Tổng quan về giá

Gemini 3.6 Flash có giá 1,50 USD cho mỗi triệu token đầu vào và 7,50 USD cho mỗi triệu token đầu ra. Giá đầu ra bao gồm các token suy nghĩ, vì vậy các suy luận mà bạn không bao giờ thấy trong câu trả lời cuối cùng vẫn được tính vào hóa đơn. Bộ nhớ đệm ngữ cảnh có giá 0,15 USD cho mỗi triệu token cộng với 1,00 USD cho mỗi triệu token mỗi giờ lưu trữ, điều này hữu ích khi bạn gửi cùng một lời nhắc lớn lặp đi lặp lại.

Có một cấp độ miễn phí thông qua Google AI Studio. Nó có giới hạn tốc độ và Google có thể sử dụng dữ liệu cấp độ miễn phí để cải thiện sản phẩm của mình, vì vậy nó dành cho việc tạo mẫu chứ không phải sản xuất. Chúng tôi đề cập đến các giới hạn và chi tiết trong bài cách sử dụng Gemini 3.6 Flash miễn phí, và phân tích chi phí đầy đủ với các ví dụ trong bài giá của Gemini 3.6 Flash. Các con số của Google có trên trang giá API Gemini.

Cách truy cập Gemini 3.6 Flash

Bạn có một vài cách truy cập:

Đối với hầu hết các nhà phát triển, API là con đường quan trọng. Chúng tôi có hướng dẫn từng bước trong bài cách sử dụng API Gemini 3.6 Flash, và nếu bạn đến từ một bản phát hành cũ hơn, hướng dẫn API Google Gemini 3 của chúng tôi vẫn bao gồm cấu trúc yêu cầu và xác thực. Tài liệu tham khảo chính thức có tại ai.google.dev.

Vị trí của nó trong danh mục sản phẩm của Google

Hãy xem bản cập nhật Flash như một thang bậc về chi phí và chất lượng. Gemini 3.5 Flash-Lite nằm dưới 3.6 Flash: nó rẻ hơn, với 0,30 USD đầu vào và 2,50 USD đầu ra cho mỗi triệu token, và nó nhanh, khoảng 350 token đầu ra mỗi giây. Hãy chọn Flash-Lite cho các công việc khối lượng lớn, nhạy cảm với độ trễ mà bạn không cần chất lượng đầy đủ của mô hình chủ lực. Hãy chọn 3.6 Flash khi nhiệm vụ khó hơn hoặc đầu ra cần độ tin cậy cao hơn.

Bây giờ là những lưu ý chân thật. Gemini 3.5 Pro chưa ra mắt. Google cho biết họ vẫn đang thử nghiệm với các đối tác, vì vậy không có mô hình Pro công khai nào trong đợt này, và hầu hết các tin tức đều nhấn mạnh vào khoảng trống đó. Google cũng đã hé lộ một đợt đào tạo trước Gemini 4 và gọi đó là tham vọng nhất của họ từ trước đến nay, nhưng hé lộ không có nghĩa là đã phát hành. Cả hai đều không phải là thứ bạn có thể sử dụng hôm nay. Nếu bạn cần một mô hình flagship tiên tiến ngay bây giờ, 3.6 Flash không phải là nó. Nó là một mô hình cấp trung nhanh chóng được xây dựng để rẻ và nhanh ở quy mô lớn, và đó chính xác là những gì nó mang lại.

Đối với thế hệ trước, bài giải thích Gemini 3.5 là gì của chúng tôi cung cấp cho bạn cơ sở mà các mô hình này cải thiện.

Kiểm tra Gemini 3.6 Flash trong Apidog

Các trang mô hình đưa ra những con số tốt nhất. Cách duy nhất để biết 3.6 Flash trả về gì cho lời nhắc của bạn, ở độ dài ngữ cảnh của bạn, là gửi lệnh gọi và kiểm tra phản hồi. Đó là lúc một máy khách API phát huy tác dụng.

Apidog là một máy khách API và nền tảng kiểm thử, và nó xử lý điểm cuối Gemini giống như bất kỳ lệnh gọi REST nào khác. Dưới đây là một thiết lập gọn gàng:

  1. Tạo một yêu cầu POST đến điểm cuối API Gemini và đặt mô hình là gemini-3.6-flash.
  2. Lưu khóa API của bạn vào một biến môi trường Apidog thay vì dán nó vào URL. Sau đó, bạn có thể chuyển đổi giữa khóa thử nghiệm và khóa sản xuất mà không cần chỉnh sửa yêu cầu.
  3. Gửi lệnh gọi và đọc phản hồi. Thêm các xác nhận về mã trạng thái và các trường JSON mà bạn quan tâm, để một tải trọng xấu hoặc thay đổi lược đồ sẽ thất bại rõ ràng thay vì lọt qua.
  4. Lưu nó dưới dạng kiểm thử hồi quy và lên lịch chạy để bạn có thể phát hiện khi hình dạng phản hồi hoặc độ trễ thay đổi sau khi cập nhật mô hình.

Hãy rõ ràng về những gì điều này làm và không làm. Apidog không chạy mô hình và nó không phải là một framework AI. Nó là công cụ bạn sử dụng để xây dựng yêu cầu, gửi nó và giữ phản hồi theo một tiêu chuẩn bạn đặt ra. Khi Google phát hành bản cập nhật Flash tiếp theo, các bài kiểm thử đã lưu của bạn sẽ cho bạn biết trong vài phút liệu có bất kỳ thứ gì bạn phụ thuộc vào đã thay đổi hay không. Tải xuống Apidog nếu bạn muốn thiết lập yêu cầu đầu tiên đó.

Câu hỏi thường gặp

Gemini 3.6 Flash có miễn phí không? Có một cấp độ miễn phí thông qua Google AI Studio, nhưng nó có giới hạn tốc độ và dành cho việc tạo mẫu. Google có thể sử dụng dữ liệu cấp độ miễn phí để cải thiện sản phẩm của mình. Đối với lưu lượng sản xuất, bạn trả tiền theo token: 1,50 USD cho mỗi triệu token đầu vào, 7,50 USD cho mỗi triệu token đầu ra.

Gemini 3.6 Flash có tốt hơn 3.5 Flash không? Đối với hầu hết các công việc, có. Nó sử dụng ít hơn khoảng 17% token đầu ra, giá đầu ra giảm từ 9,00 USD xuống còn 7,50 USD cho mỗi triệu, và nó mạnh hơn trong việc viết mã và sử dụng máy tính, bao gồm cả việc tăng lên 83,0% trên OSWorld-Verified từ 78,4%. Nó thay thế 3.5 Flash trở thành mô hình chủ lực mặc định.

Gemini 3.5 Pro đã ra mắt chưa? Chưa. Google cho biết họ vẫn đang thử nghiệm 3.5 Pro với các đối tác, vì vậy không có mô hình Pro công khai nào trong bản phát hành này. Một đợt đào tạo trước Gemini 4 đã được hé lộ nhưng chưa được phát hành.

ID mô hình là gì? Đó là gemini-3.6-flash. Đừng nhầm lẫn nó với gemini-3.5-flash-lite, là cấp Flash-Lite rẻ hơn với số phiên bản khác.

Gemini 3.6 Flash không thể làm gì? Nó chỉ xuất ra văn bản, vì vậy nó sẽ không tạo hình ảnh, âm thanh hoặc video mặc dù nó có thể đọc chúng làm đầu vào. Khả năng nhớ lại của nó giảm xuống gần cuối cửa sổ 1M token, khoảng 54,0% khi truy xuất điểm ở độ dài đầy đủ. Và nó là một mô hình chủ lực cấp trung, không phải một flagship tiên tiến, vì vậy hãy chọn cấp độ phù hợp cho những lập luận thực sự khó khăn.

Gemini 3.6 Flash là mô hình mà hầu hết lưu lượng API Gemini nên chạy ngay bây giờ: rẻ hơn, hiệu quả về token hơn và tốt hơn trong công việc tác nhân so với phiên bản mà nó thay thế. Hãy xác nhận các phần bạn phụ thuộc bằng một vài bài kiểm thử API đã lưu trước khi bạn di chuyển ở quy mô lớn. Khi Flash-Lite, Cyber, hoặc cuối cùng là Pro và Gemini 4 ra mắt, bạn sẽ biết chính xác những gì đã thay đổi trong các phản hồi của mình.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API