Giá Gemini 3.6 Flash: chi phí thực tế năm 2026

Giải thích giá Gemini 3.6 Flash: 1,50 USD cho 1 triệu token đầu vào, 7,50 USD cho 1 triệu token đầu ra (bao gồm token suy nghĩ), chi phí bộ nhớ đệm, gói miễn phí và một ví dụ minh họa chi phí hàng tháng chi tiết.

Ashley Innocent

Ashley Innocent

22 tháng 7 2026

Giá Gemini 3.6 Flash: chi phí thực tế năm 2026

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Gemini 3.6 Flash có giá 1,50 đô la cho mỗi 1M token đầu vào và 7,50 đô la cho mỗi 1M token đầu ra. Con số đó rẻ hơn so với mô hình mà nó thay thế. Google đã phát hành bản cập nhật vào ngày 21 tháng 7 năm 2026, và đối với bất kỳ ai đang theo dõi hóa đơn API thì điểm nhấn rất đơn giản: gói Flash chủ lực đã nhanh hơn và rẻ hơn cùng một lúc.

Hướng dẫn này sẽ phân tích mọi con số bạn cần để lập ngân sách: tỷ lệ mỗi token, những gì bộ nhớ đệm ngữ cảnh bổ sung, những gì gói miễn phí bao gồm, và một ví dụ minh họa để bạn có thể dự đoán chi tiêu hàng tháng trước khi viết một dòng mã nào. Mọi số liệu ở đây đều đến từ tài liệu về giá API của Gemini của chính Google và thông báo ra mắt. Nếu bạn muốn có tổng quan đầy đủ về mô hình trước tiên, hãy đọc Gemini 3.6 Flash là gì.

Một lưu ý về cách đặt tên trước khi đi vào các con số. Phiên bản chủ lực đã tăng lên 3.6, nhưng gói Flash-Lite rẻ hơn vẫn ở mức 3.5. Cùng một lần ra mắt, nhưng phiên bản lại hỗn hợp. Hiểu rõ điều này và bảng giá sẽ mạch lạc.

Tổng quan về giá Gemini 3.6 Flash

Mục Chi phí
Đầu vào $1,50 cho mỗi 1M token
Đầu ra (bao gồm token suy nghĩ) $7,50 cho mỗi 1M token
Bộ nhớ đệm ngữ cảnh, đọc đầu vào đã lưu vào bộ đệm $0,15 cho mỗi 1M token
Bộ nhớ đệm ngữ cảnh, lưu trữ $1,00 cho mỗi 1M token mỗi giờ
Gói miễn phí Có, qua Google AI Studio (giới hạn tỷ lệ)

Hai điều cần lưu ý ngay lập tức. Giá đầu ra bao gồm token suy nghĩ, vì vậy quá trình suy luận mà mô hình thực hiện trước khi đưa ra câu trả lời được tính phí theo tỷ lệ đầu ra 7,50 đô la, không phải trên một dòng riêng biệt. Và bộ nhớ đệm ngữ cảnh có hai phần: tỷ lệ đọc rẻ cho đầu vào đã lưu vào bộ đệm, cộng với phí lưu trữ hàng giờ miễn là bạn duy trì bộ đệm hoạt động. Lưu vào bộ đệm giúp tiết kiệm tiền cho ngữ cảnh lặp lại, nhưng nó không miễn phí, vì vậy việc tiết kiệm chỉ xuất hiện khi bạn tái sử dụng cùng một tiền tố lời nhắc nhiều lần.

So sánh với Gemini 3.5 Flash

Tỷ lệ đầu ra đã giảm từ 9,00 đô la cho mỗi 1M token trên 3.5 Flash xuống còn 7,50 đô la trên 3.6 Flash. Riêng điều đó đã rẻ hơn khoảng 17% cho mỗi token đầu ra.

Câu chuyện lớn hơn là những gì Google báo cáo trên trang mô hình DeepMind Flash: 3.6 Flash tạo ra ít hơn khoảng 17% token đầu ra cho cùng một tác vụ. Nó suy luận trong ít bước hơn và thực hiện ít lệnh gọi công cụ hơn trên các tác vụ đa bước. Vì vậy, bạn đang trả một tỷ lệ thấp hơn trên một số lượng token nhỏ hơn. Hai yếu tố này cộng hưởng, điều mà chúng tôi sẽ chỉ ra bằng phép tính thực tế dưới đây.

Nếu bạn vẫn đang lập ngân sách dựa trên mô hình cũ, phân tích giá Gemini 3.5 Flash đáng để đọc so sánh song song. Để so sánh đầy đủ tính năng và hiệu suất, hãy xem Gemini 3.6 Flash vs 3.5 Flash. Tóm lại cho túi tiền của bạn: 3.6 Flash có chi phí vận hành ít hơn so với mô hình mà nó thay thế, và khoảng cách này mở rộng đối với các khối lượng công việc tác nhân, dài hơn, nơi việc tiết kiệm token được cộng dồn.

Gói miễn phí mang lại gì cho bạn

Có một gói miễn phí thực sự, có sẵn thông qua Google AI Studio. Bạn có thể gọi Gemini 3.6 Flash mà không cần thẻ tín dụng và tạo mẫu miễn phí.

Hãy thành thật với bản thân về các giới hạn. Gói miễn phí bị giới hạn tỷ lệ, vì vậy nó được xây dựng để tạo mẫu và thử nghiệm nhẹ nhàng, không phải cho lưu lượng truy cập sản xuất. Và Google có thể sử dụng dữ liệu từ gói miễn phí để cải thiện sản phẩm của mình. Điều đó có nghĩa là gói miễn phí không phải là nơi thích hợp cho dữ liệu nhạy cảm, độc quyền hoặc của khách hàng. Khi bạn chuyển sang bất kỳ điều gì thực tế, hãy chuyển sang khóa trả phí nơi các điều khoản sử dụng dữ liệu đó không áp dụng.

Để biết hướng dẫn chi tiết về những gì gói miễn phí cho phép và cách thiết lập, hãy xem cách sử dụng Gemini 3.6 Flash miễn phí. Không có tùy chọn "miễn phí không giới hạn" ở đây, vì vậy hãy lên kế hoạch chuyển sang sử dụng trả phí sau khi bạn triển khai sản phẩm.

Ví dụ về chi phí thực tế

Giả sử bạn chạy một tác nhân đọc nhiều và viết ít: 2M token đầu vào và 500k token đầu ra mỗi ngày. Đó là một hình dạng thực tế cho một trợ lý nặng về truy xuất thông tin, kéo tài liệu và trả về các câu trả lời ngắn gọn.

Dưới đây là hóa đơn hàng ngày trên Gemini 3.6 Flash:

Bây giờ là hiệu ứng cộng dồn. Giả sử cùng một tác vụ trên 3.5 Flash tạo ra 600k token đầu ra. Trên 3.6 Flash, việc giảm 17% đưa con số đó xuống khoảng 500k, đó là con số chúng ta đã lập ngân sách ở trên. Chỉ so sánh dòng đầu ra:

Đó là ít hơn 1,65 đô la mỗi ngày, hoặc khoảng 49,50 đô la một tháng, chỉ riêng phần đầu ra. Hóa đơn đầu ra giảm khoảng 31%, mặc dù việc giảm giá và giảm token mỗi loại chỉ khoảng 17%. Token rẻ hơn nhân với số token ít hơn chính là nơi tiết kiệm thực sự.

Flash-Lite thậm chí còn rẻ hơn

Nếu tác vụ của bạn đơn giản, có một gói thấp hơn gói chủ lực. Gemini 3.5 Flash-Lite có chi phí 0,30 đô la cho mỗi 1M token đầu vào và 2,50 đô la cho mỗi 1M token đầu ra, với bộ nhớ đệm là 0,03 đô la cho mỗi 1M cộng với phí lưu trữ 1,00 đô la cho mỗi 1M mỗi giờ. Nó cũng chạy nhanh, khoảng 350 token đầu ra mỗi giây.

Chạy cùng khối lượng công việc 2M đầu vào và 500k đầu ra trên Flash-Lite và hóa đơn hàng ngày khoảng 1,85 đô la, xấp xỉ 55,50 đô la một tháng. Con số đó rẻ hơn khoảng 70% so với 3.6 Flash với số lượng token giống hệt nhau.

Vấn đề là chất lượng. Flash-Lite được điều chỉnh cho các tác vụ khối lượng lớn, độ phức tạp thấp: phân loại, trích xuất, định tuyến, phản hồi có cấu trúc ngắn gọn. Nó không phải là một phiên bản yếu hơn của cùng một thứ; nó là một điểm khác trên đường cong chi phí, chất lượng và độ trễ. Hãy sử dụng nó khi tác vụ đơn giản và khối lượng lớn, và dành 3.6 Flash cho các suy luận khó hơn. Để có cái nhìn đầy đủ, hãy đọc Gemini 3.5 Flash-Lite là gì, sau đó Gemini 3.5 Flash-Lite vs 3.6 Flash để chọn gói phù hợp cho từng tuyến.

Cách kiểm soát và đo lường chi phí của bạn

Bốn đòn bẩy giúp giảm hóa đơn:

  1. Lưu trữ ngữ cảnh lặp lại vào bộ đệm. Nếu mỗi yêu cầu chia sẻ một lời nhắc hệ thống dài hoặc cùng một tài liệu tham khảo, bộ nhớ đệm ngữ cảnh sẽ tính phí 0,15 đô la cho mỗi 1M khi đọc từ bộ đệm thay vì 1,50 đô la. Chỉ cần nhớ phí lưu trữ 1,00 đô la cho mỗi 1M mỗi giờ, vì vậy việc lưu vào bộ đệm có lợi khi bạn thường xuyên tái sử dụng tiền tố trong vòng một giờ, chứ không phải chỉ một lần.
  2. Cắt gọn lời nhắc. Đầu ra có giá gấp năm lần đầu vào, nhưng đầu vào cồng kềnh vẫn tăng lên theo quy mô. Cắt bỏ những phần rập khuôn, và giới hạn tối đa token đầu ra để một phản hồi quá mức không thể làm bạn bất ngờ.
  3. Định tuyến các tác vụ đơn giản đến Flash-Lite. Gửi các tác vụ phân loại và trích xuất đến gói rẻ hơn và dành 3.6 Flash cho các suy luận đa bước. Định tuyến hỗn hợp thường tốt hơn việc chọn một mô hình cho mọi thứ.
  4. Đo lường mức sử dụng token thực tế. Ước tính có thể sai. `usageMetadata` trong mỗi phản hồi của Gemini cho bạn biết chính xác số lượng token đầu vào, đầu ra và suy nghĩ mà một lệnh gọi đã tiêu thụ, và đó là con số dựa trên hóa đơn của bạn.

Điểm cuối cùng đó là nơi một client API chứng tỏ giá trị của nó. Trong Apidog bạn có thể xây dựng yêu cầu `POST` tới Gemini API, lưu khóa của bạn trong một biến môi trường và gửi các lệnh gọi thực tế với các lời nhắc thực tế của bạn. Đọc các trường `usageMetadata` trực tiếp từ phản hồi để xem số lượng token thực tế cho mỗi yêu cầu, sau đó thêm các xác nhận để một thay đổi lời nhắc làm tăng gấp đôi token đầu ra sẽ làm kiểm thử thất bại thay vì lặng lẽ tăng gấp đôi hóa đơn của bạn. Bạn thậm chí có thể lên lịch chạy các kiểm thử API đó định kỳ và phát hiện sớm các sai sót về chi phí. Muốn thực hành theo? Tải Apidog và gửi một yêu cầu tới điểm cuối Gemini trước khi bạn đưa nó vào sản xuất.

Câu hỏi thường gặp (FAQ)

Gemini 3.6 Flash có giá bao nhiêu cho mỗi 1 triệu token? 1,50 đô la cho đầu vào và 7,50 đô la cho đầu ra. Đọc từ bộ nhớ đệm ngữ cảnh có giá 0,15 đô la cho mỗi 1 triệu, với phí lưu trữ 1,00 đô la cho mỗi 1 triệu mỗi giờ.

Giá đầu ra có bao gồm token suy nghĩ không? Có. Quá trình suy luận mà mô hình thực hiện trước khi đưa ra câu trả lời được tính phí theo tỷ lệ đầu ra 7,50 đô la. Không có phí riêng cho token suy nghĩ, nhưng chúng được tính vào tổng đầu ra của bạn, vì vậy càng nhiều suy luận có nghĩa là hóa đơn càng lớn.

Có thực sự có gói miễn phí không? Có, thông qua Google AI Studio, và nó bị giới hạn tỷ lệ. Nó được thiết kế để tạo mẫu và thử nghiệm, không phải để sản xuất. Google có thể sử dụng dữ liệu từ gói miễn phí để cải thiện sản phẩm của mình, vì vậy hãy giữ dữ liệu nhạy cảm trên một khóa trả phí.

Gemini 3.6 Flash có rẻ hơn 3.5 Flash không? Có. Tỷ lệ đầu ra đã giảm từ 9,00 đô la xuống còn 7,50 đô la, và 3.6 Flash sử dụng ít hơn khoảng 17% token đầu ra cho cùng một tác vụ. Cả hai hiệu ứng này đều cộng dồn, vì vậy hóa đơn đầu ra thực tế có thể giảm khoảng 31%.

Khi nào tôi nên sử dụng Flash-Lite thay thế? Khi tác vụ đơn giản và khối lượng lớn. Với 0,30 đô la đầu vào và 2,50 đô la đầu ra, Flash-Lite rẻ hơn khoảng 70% cho cùng số lượng token, và nó nhanh, nhưng 3.6 Flash xử lý suy luận khó hơn tốt hơn.

Gemini 3.6 Flash là một bản cập nhật giá hiếm hoi khi con số giảm và mô hình trở nên tốt hơn cùng một lúc. Hãy lập ngân sách với 1,50 đô la đầu vào và 7,50 đô la đầu ra, nhớ rằng token suy nghĩ được tính theo tỷ lệ đầu ra, và dựa vào bộ nhớ đệm cùng định tuyến Flash-Lite để cắt giảm phần còn lại. Để có bối cảnh lịch sử về cách chi phí API của Gemini đã thay đổi qua các bản phát hành, phân tích chi phí API Gemini 3.0 là một điểm tham chiếu hữu ích. Sau đó, hãy đo lường các lệnh gọi của riêng bạn trong Apidog để số lượng token bạn dự kiến chính là số lượng bạn thực sự phải trả tiền.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API