Cách sử dụng Gemini 3.8 Flash miễn phí?

Gemini 3.8 Flash miễn phí trong Google AI Studio và trên gói miễn phí của Gemini API. Cách nhận khóa, thực hiện cuộc gọi đầu tiên và những gì gói miễn phí sẽ không cung cấp cho bạn.

Ashley Innocent

Ashley Innocent

3 tháng 9 2026

Cách sử dụng Gemini 3.8 Flash miễn phí?

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Gemini 3.8 Flash đã ra mắt vào ngày 2 tháng 9 năm 2026, và không giống như hầu hết các lần ra mắt công nghệ tiên phong khác trong năm nay, nó đi kèm với một lộ trình miễn phí thực sự. Bạn có thể trò chuyện với nó trong Google AI Studio mà không mất phí, và bạn có thể gọi nó từ Gemini API ở cấp miễn phí với một khóa chỉ mất khoảng một phút để tạo. Bài đăng ra mắt của Google gọi nó là "mô hình Flash thông minh nhất của chúng tôi," và cấp miễn phí cung cấp cho bạn cùng một ID mô hình (gemini-3.8-flash) mà khách hàng trả phí sử dụng, không phải một phiên bản rút gọn.

Có ba điểm cần lưu ý, và hướng dẫn này sẽ đề cập tất cả. Cấp miễn phí bị giới hạn tốc độ. Google cho biết dữ liệu ở cấp miễn phí được sử dụng để cải thiện sản phẩm của họ. Và ứng dụng Gemini không bao gồm 3.8 Flash trong gói miễn phí; bạn cần đăng ký Google AI Pro hoặc Ultra để sử dụng. Nếu bạn muốn xem bảng thông số kỹ thuật đầy đủ trước, hãy bắt đầu với Gemini 3.8 Flash là gì. Nếu bạn muốn chạy một yêu cầu trong năm phút tới, hãy tiếp tục đọc.

Tổng quan về quyền truy cập miễn phí

Nền tảng Chi phí Bao gồm Gemini 3.8 Flash? Điểm cần lưu ý
Google AI Studio (môi trường web) $0 Giới hạn tốc độ; dữ liệu được sử dụng để cải thiện sản phẩm
Cấp miễn phí Gemini API $0 Giới hạn tương tự, hiển thị trên trang giới hạn tốc độ của AI Studio
Ứng dụng Gemini, gói miễn phí $0 Không 3.8 Flash yêu cầu đăng ký Google AI Pro hoặc Ultra
Chế độ AI trong Google Search $0 Có (người tiêu dùng) Không có API, không kiểm soát mức độ tư duy
Gemini trong Google Sheets Phụ thuộc vào gói Có (người tiêu dùng) Không có API
Google Search grounding 5.000 yêu cầu/tháng miễn phí Chia sẻ trên Gemini 3.x Sau đó $14 cho mỗi 1.000 yêu cầu
Batch API Giảm 50% giá trả phí Không miễn phí; là đường dẫn trả phí rẻ nhất
Gemini 3.8 Flash Cyber Không bán Không Chỉ dành cho Chương trình Fairwind, không có API công khai ở bất kỳ mức giá nào

Bước 1: Mở AI Studio và chọn gemini-3.8-flash

Truy cập Google AI Studio và đăng nhập bằng tài khoản Google. Không cần tài khoản thanh toán, không cần thẻ tín dụng. Trong bộ chọn mô hình, chọn gemini-3.8-flash; đây là ID ổn định không có hậu tố xem trước. Các cài đặt chạy cho phép bạn điều chỉnh mức độ tư duy, mà trên 3.8 Flash có ba giá trị: low (thấp), medium (trung bình) và high (cao). Trung bình là mặc định. Không có mức minimal trên mô hình này, và nếu bạn gửi nó qua API, bạn sẽ nhận được lỗi xác thực thay vì một sự thay thế im lặng. Hướng dẫn về mức độ tư duy giải thích chi phí của mỗi mức về token và thời gian.

Hai cài đặt quan trọng cho việc sử dụng miễn phí. Thứ nhất, giữ nguyên nhiệt độ (temperature). Hướng dẫn của Google cho mọi mô hình Gemini 3 là giữ nó ở mức mặc định 1.0, vì việc giảm nó có thể gây ra vòng lặp hoặc đầu ra kém chất lượng. Thứ hai, bắt đầu ở mức low khi bạn đang khám phá. 3.8 Flash được thiết kế để "làm việc chăm chỉ hơn" trong các tác vụ phức tạp, thực hiện các bước suy luận nhỏ hơn và gọi công cụ lặp lại, và Google nói rằng nó "có thể sử dụng nhiều token hơn cho các tác vụ chạy lâu hơn và phức tạp, theo thiết kế." Trên một cấp độ được đo bằng token mỗi phút, khả năng tiêu thụ này sẽ làm hết hạn ngạch của bạn nhanh hơn so với 3.7 Flash. Mức thấp giúp các thử nghiệm ít tốn kém hơn.

Bước 2: Lấy khóa API miễn phí

Trong AI Studio, mở trang khóa API và tạo khóa trong một dự án mới hoặc dự án hiện có. Khóa miễn phí và hoạt động ngay lập tức với cấp miễn phí. Trang giá liệt kê đầu vào và đầu ra của 3.8 Flash là "Miễn phí" ở cấp đó, với các mức giá trả phí đi kèm. Hướng dẫn tạo khóa Gemini API của chúng tôi có ảnh chụp màn hình nếu bạn chưa từng thực hiện.

Lưu khóa dưới dạng biến môi trường và tránh để nó trong mã hoặc lịch sử shell của bạn:

export GEMINI_API_KEY="dán-khóa-của-bạn-vào-đây"

Hãy coi khóa như một mật khẩu. Cấp miễn phí không có liên kết thanh toán, vì vậy một khóa bị rò rỉ không thể gây ra hóa đơn, nhưng nó có thể làm hết hạn ngạch hàng ngày của bạn trước khi bạn kịp sử dụng.

Bước 3: Thực hiện cuộc gọi miễn phí đầu tiên của bạn

Gemini 3.x hiện chạy chủ yếu trên Interactions API. Một yêu cầu, không cần SDK:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Giải thích bộ nhớ đệm HTTP trong 3 câu.","generation_config":{"thinking_level":"low"}}'

Phản hồi là một danh sách các bước thực thi (suy nghĩ của mô hình, các cuộc gọi công cụ nếu có) kết thúc bằng bước model_output với văn bản. Nếu bạn có mã hiện có trên generateContent, nó vẫn hoạt động; Google gọi nó là cũ nhưng "được hỗ trợ đầy đủ" mà không có ngày ngừng hoạt động, và generationConfig.thinkingConfig.thinkingLevel là nơi đặt mức độ trên điểm cuối đó. Cả hai dạng, cùng với các tương đương Python và đa lượt với previous_interaction_id, đều có trong hướng dẫn API Gemini 3.8 Flash.

Nếu bạn nhận được lỗi 429, bạn đã đạt giới hạn tốc độ của cấp miễn phí. Hãy đợi, hoặc đọc tiếp đến Cấp 1.

Chi phí của cấp miễn phí đối với bạn

Không mất tiền. Nhưng ba điều khác.

Giới hạn tốc độ. Cấp miễn phí giới hạn số yêu cầu mỗi phút, số token mỗi phút và số yêu cầu mỗi ngày cho mỗi mô hình. Google chỉ công bố các con số chính xác trên trang giới hạn tốc độ của AI Studio, không có trong văn bản tài liệu, và chúng thay đổi mà không có mục nhật ký thay đổi. Hãy kiểm tra trang đó thay vì tin tưởng bất kỳ con số nào bạn đọc trên một blog, bao gồm cả blog này. Tài liệu giới hạn tốc độ giải thích cách các cấp hoạt động.

Dữ liệu của bạn. Google tuyên bố rằng các lời nhắc và đầu ra ở cấp miễn phí được sử dụng để cải thiện sản phẩm của họ. Điều này tốt cho một lời nhắc điểm chuẩn hoặc một ứng dụng thử nghiệm. Nó không tốt cho hồ sơ khách hàng, mã nguồn chưa phát hành hoặc bất cứ điều gì thuộc NDA. Các cấp trả phí có các điều khoản khác; nếu bạn cần chúng, hãy liên kết thanh toán trước khi bạn gửi yêu cầu nhạy cảm, không phải sau đó.

Khả năng tiêu thụ Token. Artificial Analysis đã đo 3.8 Flash ở mức cao sử dụng khoảng 48k token đầu ra cho mỗi tác vụ trên chỉ mục của họ, nhiều hơn 30% so với 3.7 Flash. Token suy nghĩ được tính vào cùng giới hạn token mỗi phút như đầu ra hiển thị. Một mô hình suy luận mạnh mẽ hơn là một mô hình tiêu tốn hạn ngạch miễn phí của bạn nhanh hơn, đó là lý do thực tế để mặc định sử dụng low hoặc medium cho đến khi bạn đã trả tiền để có thêm giới hạn.

Ứng dụng Gemini không phải là một lộ trình miễn phí

Đây là nơi hầu hết các tìm kiếm "Gemini 3.8 Flash miễn phí" đi sai hướng. Về phía người tiêu dùng, 3.8 Flash có sẵn trong ứng dụng Gemini cho các thuê bao Google AI Pro và Ultra. Gói ứng dụng miễn phí không có nó, theo tin tức ra mắt. Nếu bạn mở ứng dụng mà không có gói đăng ký và thấy một mô hình Flash, đó không phải là 3.8.

Các nền tảng người tiêu dùng mà bạn có thể gặp 3.8 Flash mà không mất thêm phí là Chế độ AI trong Google Search và Gemini trong Google Sheets. Cả hai đều hữu ích để đọc câu trả lời của nó. Cả hai đều không cung cấp cho bạn khả năng kiểm soát mức độ tư duy, số lượng token hoặc API, vì vậy đối với bất cứ điều gì bạn gọi là phát triển, AI Studio và cấp API miễn phí là con đường miễn phí thực sự.

Grounding miễn phí: 5.000 yêu cầu Google Search mỗi tháng

Tính năng Google Search grounding, cho phép mô hình kéo kết quả web hiện tại vào câu trả lời của nó, đi kèm với 5.000 yêu cầu miễn phí mỗi tháng được chia sẻ trên tất cả các mô hình Gemini 3.x. Sau đó, nó có giá 14 đô la cho mỗi 1.000 yêu cầu. Hạn ngạch là một nhóm hàng tháng, không phải cho mỗi mô hình, vì vậy một thử nghiệm 3 Pro được grounding và một thử nghiệm 3.8 Flash được grounding đều sử dụng chung 5.000 yêu cầu đó. Đối với một nguyên mẫu cần dữ liệu mới, đây là một khoản trợ cấp hào phóng; đối với một tính năng sản xuất, bạn sẽ cần một dòng ngân sách.

Khi hết miễn phí: các con đường trả phí rẻ nhất

Bạn sẽ biết khoảnh khắc đó. Một lỗi 429 xuất hiện giữa buổi demo, hoặc giới hạn hàng ngày kết thúc vào lúc 3 giờ chiều. Bốn bước trả phí, từ rẻ nhất trước.

Liên kết tài khoản thanh toán (Cấp 1). Gắn thanh toán vào dự án của bạn trong AI Studio sẽ đưa bạn lên Cấp 1, điều này làm tăng giới hạn tốc độ và đặt giới hạn chi tiêu 250 đô la. Cấp 2 mở ra sau khi chi tiêu 100 đô la cộng thêm ba ngày, với giới hạn 2.000 đô la; Cấp 3 sau 1.000 đô la và 30 ngày. Bạn không phải chi tiêu bất cứ điều gì để mở khóa Cấp 1; việc liên kết thanh toán sẽ tự động thực hiện.

Trả mức giá giới thiệu. Đến hết ngày 31 tháng 12 năm 2026, 3.8 Flash có giá 0,75 đô la cho mỗi triệu token đầu vào và 3,75 đô la cho mỗi triệu token đầu ra, với token suy nghĩ được tính là đầu ra. Từ ngày 1 tháng 1 năm 2027, cả hai sẽ tăng gấp đôi lên 1,50 đô la và 7,50 đô la. Một nghìn yêu cầu với 2.000 token đầu vào và 500 token đầu ra mỗi yêu cầu sẽ có giá khoảng 3,38 đô la theo giá giới thiệu. Bảng phân tích giá tính toán chi phí cho mỗi tác vụ, bao gồm cả lý do tại sao giá mỗi token rẻ hơn không có nghĩa là tác vụ này rẻ hơn trên mô hình này.

Xử lý hàng loạt bất cứ thứ gì có thể đợi. Batch API giảm một nửa mức giá: 0,375 đô la đầu vào và 1,875 đô la đầu ra cho mỗi triệu đến cuối năm. Vẫn một nghìn yêu cầu, khoảng 1,69 đô la. Tài khoản Cấp 1 có thể có tối đa 3 triệu token được xếp vào hàng đợi cùng một lúc. Các đánh giá, điền lại dữ liệu (backfill) và các công việc hàng đêm thuộc về đây; hướng dẫn chế độ batch của Gemini của chúng tôi bao gồm cấu trúc yêu cầu.

Bộ nhớ đệm cho tiền tố ổn định. Việc lưu bộ nhớ đệm ngữ cảnh có giá 0,075 đô la cho mỗi triệu token được lưu vào bộ nhớ đệm theo mức giá giới thiệu, bằng một phần mười so với đầu vào mới. Một lời nhắc hệ thống dài hoặc một tài liệu bạn gửi lại trong mỗi lượt là nơi đầu tiên cần xem xét.

Những gì miễn phí sẽ không mang lại cho bạn

Một danh sách trung thực, vì kết quả tìm kiếm cho chủ đề này đầy rẫy những thông tin không trung thực.

Tận dụng tối đa hạn ngạch miễn phí với Apidog

Một cấp miễn phí sẽ phát huy hiệu quả nếu bạn có kỷ luật. Mỗi yêu cầu bạn gõ lại bằng tay, mỗi lỗi 429 bạn vô tình gây ra, và mỗi cuộc gọi tư duy cao không cần thiết đều là hạn ngạch bạn không thể lấy lại được. Apidog giúp việc tuân thủ kỷ luật trở nên dễ dàng.

Lưu GEMINI_API_KEY dưới dạng biến môi trường trong một môi trường Apidog, để khóa không bao giờ xuất hiện trong nội dung yêu cầu hoặc bộ sưu tập được chia sẻ. Lưu lệnh gọi Interactions và lệnh gọi generateContent cũ dưới dạng các yêu cầu được đặt tên với lời nhắc, mô hình và thinking_level đã được điền, và chuyển đổi các cấp độ bằng một biến thay vì chỉnh sửa JSON. Thêm một xác nhận về mã trạng thái để lỗi 429 hiển thị dưới dạng thử nghiệm thất bại thay vì phản hồi trống gây khó hiểu, và một xác nhận về usageMetadata.thoughtsTokenCount trên điểm cuối cũ để bạn có thể thấy bao nhiêu hạn ngạch của mình đã được sử dụng cho việc suy nghĩ.

Sau đó, lên lịch một kiểm tra cơ bản nhỏ: một yêu cầu low mỗi ngày. Nó cho bạn biết khi hành vi của mô hình hoặc giới hạn miễn phí thay đổi trước khi người dùng của bạn nhận ra. Tải Apidog để thiết lập, và xem cách lên lịch kiểm tra API trong Apidog để biết các tùy chọn thời gian.

Câu hỏi thường gặp

Gemini 3.8 Flash có miễn phí không? Có, thông qua Google AI Studio và cấp miễn phí Gemini API, với giới hạn tốc độ và dữ liệu của bạn được sử dụng để cải thiện sản phẩm của Google. Mô hình này là gemini-3.8-flash giống như các cấp trả phí sử dụng.

Tôi có thể sử dụng Gemini 3.8 Flash trong ứng dụng Gemini miễn phí không? Không. Ứng dụng cung cấp 3.8 Flash cho các thuê bao Google AI Pro và Ultra. Chế độ AI trong Google Search và Gemini trong Sheets là các nền tảng người tiêu dùng mà bạn có thể sử dụng nó mà không cần đăng ký.

Giới hạn tốc độ của cấp miễn phí cho Gemini 3.8 Flash là gì? Google hiển thị chúng cho mỗi mô hình trên trang giới hạn tốc độ của AI Studio thay vì trong văn bản tài liệu, và chúng thay đổi. Hãy kiểm tra trang đó cho dự án của bạn. Khi bạn cần nhiều hơn, việc liên kết tài khoản thanh toán sẽ đưa bạn lên Cấp 1 mà không yêu cầu chi tiêu.

Cấp miễn phí có bao gồm tư duy không? Có. Cả ba cấp độ (low, medium, high) đều hoạt động trên cấp miễn phí, và medium là mặc định. minimal sẽ trả về lỗi trên 3.8 Flash. Vì token tư duy được tính vào giới hạn token của bạn, low sẽ kéo dài hạn ngạch miễn phí lâu nhất; xem so sánh các cấp độ tư duy để biết chi phí đo lường cho mỗi cấp độ.

Gemini 3.8 Flash Cyber có miễn phí không? Nó không có sẵn bên ngoài Chương trình Fairwind. Các nhà phát triển thông thường có thể sử dụng 3.8 Flash và chạy các kiểm tra bảo mật API của riêng họ với nó.

Bắt đầu miễn phí, sau đó quyết định

Cấp miễn phí là một môi trường đánh giá thực sự cho Gemini 3.8 Flash, không phải là một phiên bản dùng thử. Hãy tạo một khóa, giữ mức độ tư duy ở low, tránh đưa dữ liệu nhạy cảm vào, và đọc trang giới hạn tốc độ thay vì đoán. Khi một lỗi 429 bắt đầu làm mất thời gian của bạn, hãy liên kết thanh toán để lên Cấp 1 và sử dụng chế độ batch cho bất cứ điều gì không đồng bộ; với 0,375 đô la cho mỗi triệu token đầu vào đến hết tháng 12, tháng trả phí đầu tiên có thể sẽ tốn ít hơn ly cà phê bạn uống khi chờ cấp miễn phí được đặt lại.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API