Google đã phát hành Gemini 3.7 Flash vào ngày 13 tháng 8 năm 2026, ba tuần sau 3.6 Flash, và gọi đây là “mẫu mô hình chủ lực thông minh nhất của chúng tôi”. Đối với bất kỳ ai đang theo dõi hóa đơn API, chi tiết quan trọng nhất nằm trong bảng giá, chứ không phải các điểm chuẩn: mức giá ưu đãi $0.75 cho mỗi triệu token đầu vào và $3.75 cho mỗi triệu token đầu ra sẽ hết hạn vào ngày 31 tháng 12 năm 2026. Từ ngày 1 tháng 1 năm 2027, cả hai mức giá này sẽ tăng gấp đôi.
Đó là mức tăng gấp đôi theo lịch trình cho mọi tác vụ bạn xây dựng trên mô hình này. Một chatbot hiện có giá 790 đô la mỗi tháng sẽ có giá 1.575 đô la mỗi tháng vào tháng Giêng mà không cần thay đổi mã, lưu lượng truy cập hoặc lời nhắc của bạn. Vì vậy, khi lập ngân sách cho dự án 3.7 Flash, hãy tính toán cho cả hai mức giá, không chỉ mức giá niêm yết ban đầu.
Hướng dẫn này sẽ trình bày về hai mức giá, cách tính toán token cho ba tác vụ thực tế, so sánh giá với các API mô hình khác và cách cắt giảm chi phí trước khi mức giá tăng gấp đôi. Nếu bạn chưa gửi yêu cầu đầu tiên, hướng dẫn nhanh về API Gemini 3.7 Flash sẽ hướng dẫn cách cài đặt. Sau khi bạn thực hiện các cuộc gọi, Apidog sẽ hiển thị số lượng token usageMetadata trong mỗi phản hồi, do đó mỗi ước tính dưới đây sẽ trở thành một con số bạn có thể kiểm tra với lưu lượng truy cập thực tế.
Tóm tắt
- Giá ưu đãi: $0.75 cho 1 triệu token đầu vào và $3.75 cho 1 triệu token đầu ra, có hiệu lực đến hết ngày 31 tháng 12 năm 2026.
- Giá tiêu chuẩn từ ngày 1 tháng 1 năm 2027: $1.50 đầu vào và $7.50 đầu ra. Chính xác gấp đôi.
- Giá giới thiệu bằng một nửa so với giá của Gemini 3.6 Flash khi ra mắt.
- Mô hình chấp nhận đầu vào là văn bản, hình ảnh, video, âm thanh và PDF trong cửa sổ ngữ cảnh 1 triệu token, với giới hạn đầu ra là 64k token.
- Ví dụ thực tế: một chatbot phục vụ 10.000 yêu cầu mỗi ngày tiêu tốn khoảng $26 mỗi ngày theo giá ưu đãi và $52.50 mỗi ngày theo giá tiêu chuẩn.
- Bộ nhớ đệm ngữ cảnh, giới hạn đầu ra, xử lý theo lô và chuyển hướng lưu lượng truy cập nhẹ đến một mô hình nhỏ hơn là những đòn bẩy chính để cắt giảm chi phí.
Hai mức giá
Gemini 3.7 Flash ra mắt với mức giảm giá có thời hạn thay vì giá cố định. Dưới đây là bức tranh toàn cảnh về API Gemini:
| Mức giá | Thời gian | Đầu vào (mỗi 1 triệu token) | Đầu ra (mỗi 1 triệu token) |
|---|---|---|---|
| Giới thiệu | 13 tháng 8 năm 2026 đến 31 tháng 12 năm 2026 | $0.75 | $3.75 |
| Tiêu chuẩn | Từ ngày 1 tháng 1 năm 2027 | $1.50 | $7.50 |
Có hai điều nổi bật. Thứ nhất, mức giá ưu đãi bằng một nửa so với giá của Gemini 3.6 Flash khi ra mắt, điều này khiến bốn tháng rưỡi tới là khoảng thời gian rẻ nhất mà dòng mô hình này từng có. Nếu bạn đang cân nhắc nâng cấp từ 3.6, hướng dẫn di chuyển từ 3.6 sang 3.7 Flash sẽ bao gồm việc chuyển đổi; việc giảm giá này tự nó đã đủ để bù đắp chi phí kiểm thử hồi quy.
Thứ hai, token đầu ra có giá gấp 5 lần token đầu vào ở cả hai mức giá. Tỷ lệ này định hình mọi quyết định tối ưu hóa sau này trong hướng dẫn này: cắt bớt một lời nhắc hệ thống dài dòng sẽ tiết kiệm được vài xu, trong khi giới hạn đầu ra vượt quá mức sẽ tiết kiệm được nhiều đô la.
Các mức giá trên áp dụng cho Gemini API được tính phí thông qua khóa AI Studio. Vertex AI hoạt động thông qua hệ thống thanh toán của Google Cloud với các SKU riêng và các tính năng như bộ nhớ đệm ngữ cảnh và xử lý theo lô có các khoản mục riêng, vì vậy hãy xác nhận các con số hiện tại trên trang giá chính thức trước khi bạn cam kết ngân sách.
Chi phí cho một tác vụ thực tế
Giá mỗi triệu token không có ý nghĩa gì cho đến khi bạn nhân chúng với lưu lượng truy cập. Dưới đây là ba cấu hình tác vụ với các giả định đã nêu, để bạn có thể thay thế bằng số liệu của riêng mình.
Tác vụ 1: chatbot hỗ trợ khách hàng
Giả sử 10.000 yêu cầu mỗi ngày. Mỗi yêu cầu chứa khoảng 2.000 token đầu vào (lời nhắc hệ thống, một cửa sổ lịch sử ngắn, tin nhắn người dùng) và trả về khoảng 300 token đầu ra.
| Mục | Token hàng ngày | Chi phí ưu đãi/ngày | Chi phí tiêu chuẩn/ngày |
|---|---|---|---|
| Đầu vào | 20M | $15.00 | $30.00 |
| Đầu ra | 3M | $11.25 | $22.50 |
| Tổng cộng | 23M | $26.25 | $52.50 |
Đó là khoảng 788 đô la mỗi tháng theo giá ưu đãi và 1.575 đô la mỗi tháng theo giá tiêu chuẩn trong một tháng 30 ngày. Mỗi lượt trò chuyện, bạn đang trả khoảng một phần tư xu ngày hôm nay.
Tác vụ 2: xử lý tài liệu PDF
Gemini 3.7 Flash đọc PDF nguyên bản, và điểm chuẩn GDP.pdf của nó đã tăng từ 22.0% lên 34.0% so với 3.6 Flash, vì vậy trích xuất tài liệu là một tác vụ mà Google mong đợi bạn chạy ở đây. Giả sử 500 tài liệu mỗi ngày, mỗi tài liệu trung bình 40.000 token đầu vào (một hợp đồng hoặc báo cáo dài), tạo ra một bản tóm tắt có cấu trúc 1.000 token.
| Mục | Token hàng ngày | Chi phí ưu đãi/ngày | Chi phí tiêu chuẩn/ngày |
|---|---|---|---|
| Đầu vào | 20M | $15.00 | $30.00 |
| Đầu ra | 0.5M | $1.88 | $3.75 |
| Tổng cộng | 20.5M | $16.88 | $33.75 |
Khoảng $506 mỗi tháng hiện tại, $1.013 từ tháng Giêng. Lưu ý hình dạng: đầu vào chiếm ưu thế vì tài liệu dài và tóm tắt ngắn. Việc lưu vào bộ nhớ đệm và xử lý theo lô ảnh hưởng mạnh nhất đến tác vụ này.
Tác vụ 3: vòng lặp tác nhân
Các tác nhân nhân lên các cuộc gọi. Giả sử 200 tác vụ mỗi ngày, mỗi tác vụ trung bình 12 cuộc gọi mô hình, trong đó mỗi cuộc gọi mang 8.000 token đầu vào (ngữ cảnh đang phát triển cộng với kết quả công cụ) và trả về 400 token đầu ra.
| Mục | Token hàng ngày | Chi phí ưu đãi/ngày | Chi phí tiêu chuẩn/ngày |
|---|---|---|---|
| Đầu vào | 19.2M | $14.40 | $28.80 |
| Đầu ra | 0.96M | $3.60 | $7.20 |
| Tổng cộng | 20.16M | $18.00 | $36.00 |
Đó là $540 mỗi tháng theo giá ưu đãi, $1.080 theo giá tiêu chuẩn. Bài học từ việc tính phí tác nhân: ngữ cảnh phát triển theo từng bước, vì vậy số lượng cuộc gọi và độ dài ngữ cảnh tăng lên. Một tác vụ tăng từ 12 cuộc gọi lên 20 sẽ khiến bạn tốn thêm 67%, và không có gì trong bảng giá cảnh báo bạn về điều đó.
Một con số nữa đáng ghi nhớ: giới hạn đầu ra 64k giới hạn trường hợp xấu nhất của bạn cho mỗi cuộc gọi vào khoảng $0.24 hôm nay và $0.48 vào năm tới. Một vòng lặp thử lại tối đa hóa đầu ra trong mỗi lần thử sẽ nhanh chóng trở nên đắt đỏ, nhưng nó không thể đắt đỏ vô hạn.
So sánh giá của 3.7 Flash
So sánh chính xác giá mỗi token giữa các nhà cung cấp sẽ lỗi thời trong vài tuần, vì vậy hãy coi đây là định vị, chứ không phải bảng giá.
Gemini 3.7 Flash nằm trong phân khúc mô hình chủ lực: rẻ hơn nhiều so với các mô hình tiên phong như dòng Pro của Gemini, các mô hình lớn hơn của Claude, hoặc phân khúc cao cấp của OpenAI, đồng thời đạt điểm chuẩn (65.3% trên DeepSWE v1.1, 1588 WebDev Arena Elo) trùng lặp với những gì các mô hình cao cấp đã đạt được cách đây không lâu. Google đặt cược rằng hầu hết lưu lượng truy cập sản xuất không cần một mô hình tiên phong, và mức giảm giá giới thiệu là lời mời bốn tháng để kiểm tra tuyên bố đó trên tác vụ của riêng bạn.
Bối cảnh cạnh tranh cũng quan trọng. Các nhà cung cấp cấp độ ngân sách đã di chuyển giá theo hướng khác; DeepSeek đã tăng giá API của mình và thúc đẩy các nhóm suy nghĩ lại về ngân sách token, một câu chuyện được đề cập trong hướng dẫn tối ưu hóa chi phí và tăng giá của DeepSeek. Bài học này trực tiếp áp dụng cho Gemini: bất kỳ mức giá nào bạn dựa vào để tạo lợi nhuận đều có thể thay đổi, và Google đã cho bạn biết ngày và số lượng. Đó là một cảnh báo nhiều hơn hầu hết các nhà cung cấp đưa ra.
Nếu lưu lượng truy cập của bạn là không ổn định hoặc mang tính thử nghiệm, hãy nhớ rằng việc tăng gấp đôi chỉ ảnh hưởng đến các tác vụ liên tục. Một nguyên mẫu có giá $3 trong thời gian giới thiệu sẽ có giá $6 sau này. Không ai quan tâm. Một quy trình có giá 10.000 đô la mỗi tháng trở thành 20.000 đô la là một khoản mục mà đội tài chính của bạn sẽ hỏi vào tháng Hai.
Năm cách cắt giảm chi phí token
Tỷ lệ giá đầu ra so với đầu vào gấp 5 lần và việc tăng gấp đôi vào tháng Giêng đều chỉ ra cùng một bộ đòn bẩy.
Giới hạn token đầu ra cho mỗi điểm cuối. Đặt maxOutputTokens trong generationConfig thành giá trị nhỏ nhất mà mỗi điểm cuối cần. Một phản hồi hỗ trợ hiếm khi cần hơn 500 token; để giới hạn mặc định là 64k có nghĩa là một lần tạo nhầm lẫn có thể tốn gấp 100 lần so với bình thường. Đây là thay đổi mang lại hiệu quả cao nhất vì token đầu ra có hệ số nhân 5x.
Lưu trữ ngữ cảnh tĩnh của bạn vào bộ đệm. Nếu mỗi yêu cầu gửi lại cùng một lời nhắc hệ thống và tài liệu chính sách gồm 3.000 token, bạn sẽ phải trả toàn bộ giá đầu vào cho các byte giống hệt nhau hàng nghìn lần mỗi ngày. Bộ nhớ đệm ngữ cảnh tính phí các token lặp lại với mức giảm giá; hãy kiểm tra tài liệu API Gemini để biết cài đặt và mức giá lưu trữ hiện tại. Đối với chatbot ở trên, việc lưu trữ một tiền tố tĩnh 1.500 token vào bộ đệm sẽ cắt giảm chi phí đầu vào gần một nửa.
Xử lý hàng loạt các tác vụ không tương tác. Quy trình tài liệu không cần phản hồi dưới một giây. Xử lý theo lô đánh đổi độ trễ để lấy mức giá giảm, và các lần chạy tài liệu qua đêm chính xác là hình dạng lưu lượng truy cập mà nó tồn tại.
Chọn kích thước mô hình phù hợp cho mỗi tuyến đường. Không phải mọi cuộc gọi đều cần 3.7 Flash. Các tác vụ phân loại, định tuyến và trích xuất ngắn thường hoạt động tốt trên mô hình cấp Flash-Lite với chi phí chỉ bằng một phần nhỏ. Giữ 3.7 Flash cho các cuộc gọi sử dụng những gì bạn đang trả tiền: lập kế hoạch đa bước, gỡ lỗi, chuỗi gọi công cụ.
Tạo nguyên mẫu trên tầng miễn phí. Hạn mức miễn phí của AI Studio đủ để cố định các lời nhắc và lược đồ phản hồi trước khi một token tính phí nào được sử dụng. Hướng dẫn truy cập API Gemini miễn phí bao gồm phạm vi của gói miễn phí và các giới hạn của nó.
Theo dõi chi phí cho mỗi điểm cuối với Apidog
Ước tính giúp bạn có ngân sách; đo lường theo từng yêu cầu giúp bạn duy trì trong giới hạn đó. Mỗi phản hồi của Gemini bao gồm một khối usageMetadata với số lượng token đầu vào và đầu ra, điều này có nghĩa là lớp kiểm thử API của bạn có thể đóng vai trò như một công cụ đo lường chi phí.
Trong Apidog, quy trình làm việc trông như sau:
- Lưu một yêu cầu cho mỗi điểm cuối sản xuất (lượt trò chuyện, tóm tắt tài liệu, bước tác nhân) vào một bộ sưu tập, với khóa API được liên kết với biến môi trường
GEMINI_API_KEY. - Xây dựng một kịch bản kiểm thử gửi từng yêu cầu với các tải trọng thực tế và trích xuất
usageMetadata.promptTokenCountvàusageMetadata.candidatesTokenCounttừ phản hồi. - Thêm các xác nhận (assertions) về các số lượng đó. Nếu một chỉnh sửa lời nhắc đẩy điểm cuối trò chuyện vượt quá, chẳng hạn, 2.500 token đầu vào, kịch bản sẽ thất bại trước khi thay đổi được triển khai và lặng lẽ tăng hóa đơn của bạn lên 25%.
- Chạy lại kịch bản trên mỗi lần thay đổi lời nhắc hoặc lược đồ. Số lượng token suy giảm theo cùng một cách mà độ trễ suy giảm; sự khác biệt là việc suy giảm token đến dưới dạng hóa đơn.
Nhân các số lượng đã đo được với mức giá theo từng cấp trong hướng dẫn này và bạn sẽ có các con số chi phí cho mỗi điểm cuối dựa trên các phản hồi thực tế thay vì phỏng đoán. Các nhóm đã chạy các bộ API dựa trên xác nhận sẽ nhận ra mẫu này; hướng dẫn kiểm thử API cho kỹ sư QA bao gồm cách cấu trúc các kịch bản như thế này trên toàn bộ dịch vụ.
Câu hỏi thường gặp
Khi nào giá Gemini 3.7 Flash tăng gấp đôi?
Vào ngày 1 tháng 1 năm 2027. Mức giá ưu đãi $0.75 cho 1 triệu token đầu vào và $3.75 cho 1 triệu token đầu ra kéo dài đến hết ngày 31 tháng 12 năm 2026, sau đó chuyển sang mức giá tiêu chuẩn $1.50 và $7.50. Google đã công bố cả hai mức giá khi ra mắt, vì vậy việc tăng giá đã được lên kế hoạch, không phải là suy đoán.
Gemini 3.7 Flash có rẻ hơn Gemini 3.6 Flash không?
Khi ra mắt, có. Giá giới thiệu của 3.7 Flash bằng một nửa so với giá ra mắt của 3.6 Flash, trong khi các điểm chuẩn đều được cải thiện (DeepSWE v1.1 tăng từ 49.0% lên 65.3%). Các bảng thông số kỹ thuật và điểm chuẩn đầy đủ có trong hướng dẫn nhanh Gemini 3.7 Flash nếu bạn muốn so sánh.
Giá ưu đãi có áp dụng trên Vertex AI không?
Các mức giá trong hướng dẫn này là mức giá API Gemini được tính phí thông qua khóa AI Studio. Vertex AI tính phí thông qua Google Cloud với các SKU và điều khoản doanh nghiệp riêng. Nếu bạn chạy lưu lượng truy cập sản xuất trên Vertex, hãy xác nhận các con số hiện tại trong bảng điều khiển thanh toán GCP của bạn và trang giá chính thức thay vì giả định sự ngang bằng.
Những gì được tính vào hóa đơn token đầu vào?
Mọi thứ bạn gửi: văn bản, hình ảnh, video, âm thanh và các trang PDF đều chuyển đổi thành token và được tính phí theo mức đầu vào. Các tài liệu dài và các yêu cầu có nhiều phương tiện là nơi chi phí đầu vào gây bất ngờ cho mọi người, đó là lý do tại sao ví dụ về quy trình ở trên giả định 40.000 token cho mỗi tài liệu. Khối usageMetadata trong mỗi phản hồi sẽ cho bạn biết số lượng chính xác sau khi thực hiện.
Làm thế nào để ước tính token trước khi gửi yêu cầu?
Sử dụng điểm cuối countTokens của API để đo tải trọng mà không tạo ra bất cứ thứ gì, hoặc gửi một vài yêu cầu đại diện và đọc usageMetadata từ các phản hồi. Dù bằng cách nào, hãy đo lường bằng tải trọng thực tế. Trực giác về bộ mã hóa token từ các nhà cung cấp khác không chuyển đổi tốt giữa các dòng mô hình.
Vị trí của 3.7 Flash trong ngăn xếp của bạn
Gemini 3.7 Flash với giá ưu đãi là mức giá rẻ nhất mà một mô hình có khả năng như vậy từng có, và Google đã cho bạn biết chính xác ngày mà điều đó không còn đúng nữa. Cách làm hợp lý: chuyển lưu lượng truy cập chủ lực của bạn sang nó ngay bây giờ, đo lường mức tiêu thụ token thực tế cho mỗi điểm cuối trong khi ưu đãi còn hiệu lực, và sử dụng dữ liệu bốn tháng đó để quyết định những gì sẽ tiếp tục sử dụng 3.7 Flash, những gì sẽ chuyển sang mô hình nhẹ hơn, và hóa đơn với mức giá tiêu chuẩn sẽ trông như thế nào trước khi nó đến.
Nửa phần đo lường của kế hoạch đó cần công cụ. Tải xuống Apidog để giữ các yêu cầu Gemini, môi trường, xác nhận token và kiểm tra chi phí của bạn trong một không gian làm việc, để hóa đơn tháng Giêng là một con số bạn đã dự đoán thay vì một con số bạn phát hiện.
