Gemini 3.6 Flash so với 3.5 Flash: Có gì mới và có nên nâng cấp?

Gemini 3.6 Flash so với 3.5 Flash: chi phí đầu vào vẫn 1,50 đô la, đầu ra giảm còn 7,50 đô la, ít hơn 17% token đầu ra, điểm sử dụng máy tính cao hơn. Điều gì đã thay đổi và bạn có nên nâng cấp không?

Ashley Innocent

Ashley Innocent

22 tháng 7 2026

Gemini 3.6 Flash so với 3.5 Flash: Có gì mới và có nên nâng cấp?

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Google đã làm mới cấp Flash của mình vào ngày 21 tháng 7 năm 2026, và mô hình chủ lực đã tăng lên phiên bản Gemini 3.6 Flash. Nếu bạn đang chạy 3.5 Flash trong môi trường sản xuất, đây là tóm tắt: 3.6 Flash là một giải pháp thay thế trực tiếp, hiệu quả hơn về token và rẻ hơn, hầu hết các nhóm nên nâng cấp. Cùng họ mô hình, cùng ngữ cảnh 1M token, cùng giá đầu vào. Chi phí đầu ra ít hơn mỗi token và mô hình tạo ra ít token đầu ra hơn để hoàn thành cùng một công việc. Để biết toàn bộ thông tin chi tiết về mô hình mới, hãy xem Gemini 3.6 Flash là gì.

button

Câu trả lời ngắn gọn

Nâng cấp. Gemini 3.6 Flash vẫn giữ giá đầu vào 1,50 USD trên mỗi triệu token, giảm giá đầu ra từ 9,00 USD xuống còn 7,50 USD trên mỗi triệu, và tạo ra ít hơn khoảng 17% token đầu ra so với 3.5 Flash trên cùng các tác vụ. Nó cũng đạt điểm cao hơn trong các tiêu chuẩn sử dụng máy tính (83.0 so với 78.4 trên OSWorld-Verified) và yêu cầu ít bước suy luận hơn trong các quy trình làm việc đa bước. Lý do duy nhất để giữ lại: bạn đã ghim và xác thực 3.5 Flash trong môi trường sản xuất và chưa thể chạy lại các đánh giá của mình.

Gemini 3.6 Flash so với 3.5 Flash: So sánh trực tiếp

Đây là so sánh quan trọng, trực tiếp từ các con số ra mắt của Google. Chi tiết có trên bài đăng trên blog của Google và trang mô hình DeepMind Flash.

Thuộc tính Gemini 3.6 Flash Gemini 3.5 Flash
ID Mô hình gemini-3.6-flash gemini-3.5-flash
Giá đầu vào (mỗi 1M token) 1,50 USD 1,50 USD
Giá đầu ra (mỗi 1M token) 7,50 USD 9,00 USD
Hiệu quả token đầu ra Ít hơn ~17% token đầu ra cơ sở
Sử dụng máy tính (OSWorld-Verified) 83,0 78,4
Cửa sổ ngữ cảnh 1M token đầu vào 1M token đầu vào

Giá đầu vào không thay đổi. Cửa sổ ngữ cảnh không thay đổi. Các thay đổi nằm ở phía đầu ra của sổ cái và ở mức độ hiệu quả của mô hình trong việc đưa ra câu trả lời.

Những gì thực sự được cải thiện

Bốn điều đã thay đổi, và đó là những lý do để di chuyển.

Ít token đầu ra hơn. Gemini 3.6 Flash tạo ra ít hơn khoảng 17% token đầu ra so với 3.5 Flash cho cùng một công việc. Token đầu ra bao gồm các token suy nghĩ, vì vậy một bộ suy luận hiệu quả hơn sẽ viết ít hơn để đạt được cùng một câu trả lời. Bạn phải trả tiền cho mỗi token đầu ra, vì vậy đây là một dòng chi phí trực tiếp, không phải là một chỉ số phù phiếm.

Giá đầu ra thấp hơn. Google đã giảm giá đầu ra từ 9,00 USD xuống còn 7,50 USD trên mỗi triệu token. Đó là mức giảm giá 17% trên mỗi token, cộng thêm việc giảm số lượng token đã nêu ở trên.

Sử dụng máy tính tốt hơn. Trên OSWorld-Verified, tiêu chuẩn để điều khiển giao diện máy tính thực, 3.6 Flash đạt 83.0 so với 78.4 của 3.5 Flash. Nếu bạn đang xây dựng các agent nhấp qua giao diện người dùng, điền biểu mẫu hoặc vận hành công cụ, sự khác biệt đó thể hiện ở việc ít bước thất bại hơn.

Ít bước suy luận và lệnh gọi công cụ hơn. Trong các quy trình làm việc agent đa bước, 3.6 Flash đạt được mục tiêu với ít bước suy luận và ít lệnh gọi công cụ hơn. Mỗi lệnh gọi công cụ được tránh là một chuyến đi khứ hồi mà bạn không phải trả tiền và không phải chờ đợi, vì vậy điều này càng tăng thêm lợi ích tiết kiệm token cho bất kỳ thứ gì liên quan đến agent. Độ chính xác mã hóa cũng được cải thiện, điều này quan trọng nếu mô hình đang chỉnh sửa tệp hoặc tạo các khác biệt mà một token sai có thể làm hỏng bản dựng.

Không có điều nào trong số này thay đổi hình dạng của API. Nó vẫn là cùng định dạng yêu cầu, cùng các phương thức đầu vào (văn bản, hình ảnh, video, âm thanh, PDF), cùng văn bản đầu ra.

Ý nghĩa đối với hóa đơn của bạn

Hai hiệu ứng chi phí cộng dồn. Bạn nhận được giá thấp hơn cho mỗi token đầu ra VÀ ít token đầu ra phải trả tiền hơn. Chúng nhân lên, chứ không chỉ cộng lại.

Đây là một ví dụ minh họa. Giả sử một công việc hàng ngày tạo ra 10 triệu token đầu ra trên 3.5 Flash:

Đó là mức giảm khoảng 31% ở phía đầu ra của khối lượng công việc đó, và bạn không thay đổi bất kỳ prompt nào. Chi phí đầu vào của bạn không đổi vì giá đầu vào giống hệt nhau là 1,50 USD trên mỗi triệu và các prompt của bạn không thay đổi. Đối với các khối lượng công việc agent với nhiều lệnh gọi công cụ, mức giảm có thể lớn hơn, vì ít chuyến đi khứ hồi hơn cũng cắt giảm tổng số token trong suốt quá trình chạy.

Con số thực tế của bạn phụ thuộc vào tỷ lệ đầu vào-đầu ra của bạn. Các công việc đọc nhiều và viết ít (phân loại, trích xuất) sẽ thấy tổng thay đổi nhỏ hơn vì mức tiết kiệm tập trung vào đầu ra. Các công việc viết nhiều (soạn thảo, tạo mã, theo dõi agent dài) sẽ thấy lợi ích lớn nhất. Để biết chi tiết đầy đủ về tỷ lệ, bộ nhớ đệm và chi tiết token suy nghĩ, hãy xem giá Gemini 3.6 Flash và tài liệu giá API Gemini chính thức.

Có lý do nào để duy trì 3.5 Flash không?

Có, một lý do nhỏ. Hãy thành thật với bản thân về trường hợp bạn đang ở.

Lý do chính đáng để ghim 3.5 Flash là bạn đã xác thực nó trong môi trường sản xuất và hiện tại bạn không thể kiểm tra lại. Có thể bạn có một bộ đánh giá bị khóa liên quan đến việc ký duyệt tuân thủ. Có thể bạn có các đầu ra đã được điều chỉnh prompt mà một bộ phân tích hạ nguồn phụ thuộc vào, và cửa sổ kiểm tra hồi quy không mở trong sprint này. Việc thay đổi mô hình làm thay đổi đầu ra theo những cách tinh vi, và "rẻ hơn" không đáng để hệ thống bị lỗi âm thầm mà bạn không thể xác thực lại hôm nay. Trong trường hợp đó, hãy giữ nguyên gemini-3.5-flash cho đến khi bạn có một khoảng thời gian kiểm tra, sau đó di chuyển một cách có chủ đích.

Để rõ ràng: 3.5 Flash sẽ không biến mất vào ngày 3.6 ra mắt. Nó vẫn có sẵn thông qua API, và việc ghim nó là một lựa chọn ngắn hạn hợp lệ. Đây là vấn đề "khi nào", chứ không phải "nếu". Đối với hầu hết các nhóm không bị khóa xác thực cứng, cả tiền bạc và chất lượng đều cho thấy nên nâng cấp ngay bây giờ.

Cách di chuyển

Phần kỹ thuật chỉ cần một dòng. Trong lệnh gọi API của bạn, hãy đổi ID mô hình:

Đó là toàn bộ thay đổi mã. Phần thân yêu cầu, xác thực và các điểm cuối vẫn giữ nguyên, vì vậy không có gì khác trong tích hợp của bạn thay đổi. Để xem hướng dẫn chi tiết từng yêu cầu, hãy xem cách sử dụng API Gemini 3.6 Flash và tài liệu API Gemini.

Công việc thực sự là xác minh, chứ không phải thay đổi. Trước khi bạn đưa ID mô hình mới vào môi trường sản xuất:

  1. Chạy lại bộ đánh giá của bạn với 3.6 Flash và so sánh điểm chất lượng với cơ sở 3.5 Flash của bạn.
  2. Chạy lại các kiểm thử hồi quy của bạn, vì hình dạng đầu ra và cách diễn đạt có thể thay đổi giữa các phiên bản.
  3. Kiểm tra bất kỳ thứ gì phân tích đầu ra mô hình theo cấu trúc chính xác (khóa JSON, biểu thức chính quy, xác thực lược đồ hạ nguồn).
  4. Theo dõi độ trễ và số lượng token trên một mẫu lưu lượng truy cập thực trước khi triển khai hoàn toàn.

Nếu đầu ra của bạn cung cấp cho một dịch vụ khác, hãy coi việc thay đổi này giống như bất kỳ nâng cấp phụ thuộc nào khác: thay đổi nó đằng sau một cờ, so sánh, sau đó đẩy lên.

Kiểm tra hồi quy việc thay đổi trong Apidog

Đây là nơi Apidog thể hiện vai trò của mình trong quá trình di chuyển. Apidog là một ứng dụng khách API và nền tảng kiểm thử, vì vậy đây là nơi tự nhiên để chứng minh 3.6 Flash hoạt động tốt trước khi bạn tin tưởng nó trong môi trường sản xuất. Nó không chạy mô hình; nó gửi các yêu cầu và kiểm tra các phản hồi.

Một cách rõ ràng để A/B hai mô hình:

  1. Lưu yêu cầu Gemini hiện có của bạn. Xây dựng lệnh gọi POST tới API Gemini trong Apidog, với khóa API của bạn được lưu trữ trong một biến môi trường để nó không bao giờ nằm trong phần thân yêu cầu.
  2. Nhân bản nó. Chỉ thay đổi chính xác một thứ: ID mô hình, từ gemini-3.5-flash sang gemini-3.6-flash. Mọi thứ khác vẫn giữ nguyên để bạn so sánh một cách công bằng.
  3. Thêm các khẳng định (assertions). Khẳng định trên mã trạng thái và các trường JSON mà ứng dụng của bạn thực sự đọc, để một thay đổi về hình dạng sẽ báo lỗi rõ ràng thay vì rò rỉ xuống hạ nguồn.
  4. So sánh phản hồi và độ trễ. Chạy cả hai, đặt các đầu ra cạnh nhau và kiểm tra xem phản hồi của 3.6 có vẫn vượt qua mọi khẳng định mà phản hồi của 3.5 đã làm không. Ghi lại thời gian phản hồi và mức sử dụng token trên mỗi cái.
  5. Giữ các khẳng định luôn "xanh" theo thời gian. Lưu cả hai dưới dạng một kịch bản kiểm thử và lên lịch nó như một kiểm thử hồi quy để một thay đổi mô hình hoặc prompt trong tương lai không thể âm thầm phá vỡ hợp đồng.

Đó là quy trình làm việc trung thực: nhân bản yêu cầu, chỉ thay đổi ID mô hình và để các khẳng định cho bạn biết liệu việc thay đổi có an toàn hay không. Tải xuống Apidog nếu bạn muốn chạy so sánh với các lệnh gọi Gemini của riêng mình.

Câu hỏi thường gặp

Gemini 3.6 Flash có phải là một giải pháp thay thế trực tiếp cho 3.5 Flash không? Về mặt kỹ thuật, có. Bạn thay đổi ID mô hình từ gemini-3.5-flash sang gemini-3.6-flash và phần còn lại của yêu cầu vẫn giữ nguyên. Bạn vẫn nên chạy lại các đánh giá và kiểm thử hồi quy trước khi đưa vào sản xuất, vì cách diễn đạt và cấu trúc đầu ra có thể thay đổi giữa các phiên bản.

Giá đầu vào có thay đổi không? Không. Đầu vào vẫn ở mức 1,50 USD trên mỗi triệu token trên cả hai mô hình. Chỉ có giá đầu ra thay đổi, từ 9,00 USD xuống 7,50 USD trên mỗi triệu.

Tại sao mô hình là 3.6 nhưng các biến thể Lite và Cyber lại là 3.5? Google chỉ nâng cấp mô hình Flash chủ lực lên 3.6 trong lần làm mới này. Flash-Lite và Flash Cyber được phát hành dưới dạng phiên bản 3.5. Các số phiên bản không đồng bộ trên toàn cấp, vì vậy hãy đọc ID mô hình, không chỉ số họ.

Hóa đơn của tôi chắc chắn sẽ giảm 31% chứ? Không, con số đó chỉ là một ví dụ minh họa cho khối lượng công việc nặng về đầu ra. Mức tiết kiệm thực tế của bạn phụ thuộc vào tỷ lệ token đầu vào-đầu ra của bạn. Các công việc nặng về đầu ra tiết kiệm được nhiều nhất; các công việc nặng về đọc ít tiết kiệm hơn vì phần giảm giá chỉ áp dụng cho đầu ra.

3.5 Flash còn sử dụng được không? Có. Nó vẫn có sẵn thông qua API. Nếu bạn đã xác thực nó và chưa thể kiểm tra lại, việc ghim nó là một lựa chọn ngắn hạn hợp lý. Hãy lên kế hoạch di chuyển cho cửa sổ kiểm tra tiếp theo của bạn.

Đối với thế hệ trước mà mô hình này thay thế, hãy xem Gemini 3.5 là gì.

Đối với hầu hết các nhóm, phép tính và các tiêu chuẩn đều đồng ý: đổi ID mô hình sang gemini-3.6-flash, chạy các đánh giá và một lượt kiểm thử hồi quy nhanh trong Apidog, và sử dụng mô hình rẻ hơn, hiệu quả hơn. Chỉ giữ 3.5 Flash khi một khóa xác thực buộc bạn phải làm vậy, và di chuyển ngay khi cửa sổ đó mở ra.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API