Bạn gọi Gemini 3.6 Flash với ID mô hình gemini-3.6-flash thông qua API Gemini của Google. Đó là cốt lõi của nó. Google đã phát hành bản cập nhật Flash vào ngày 21 tháng 7 năm 2026, và 3.6 Flash là cấp độ "ngựa chiến": đầu ra rẻ hơn so với 3.5 Flash, cửa sổ ngữ cảnh 1M token, và có thể nhận đầu vào là văn bản, hình ảnh, video, âm thanh, và PDF. Hướng dẫn này sẽ đưa bạn từ con số 0 đến một yêu cầu đã được kiểm thử. Bạn sẽ lấy khóa API, thực hiện cuộc gọi đầu tiên bằng curl và Python, tìm hiểu các tham số quan trọng, và thiết lập một bài kiểm thử hồi quy để cuộc gọi tiếp tục hoạt động sau khi bạn triển khai.

Những gì bạn cần trước khi bắt đầu
Ba điều sau đây, và không có điều nào tốn tiền để bắt đầu.
- Một tài khoản Google. Đó là cách bạn đăng nhập để lấy khóa.
- Một khóa API Gemini. Nó miễn phí từ Google AI Studio, và phần tiếp theo sẽ đề cập đến nó.
- Một cách để gửi yêu cầu HTTP. curl hoạt động từ bất kỳ thiết bị đầu cuối nào. Python hoạt động nếu bạn muốn viết mã. Bạn cũng có thể sử dụng một ứng dụng client API như Apidog nếu bạn muốn có giao diện người dùng cho toàn bộ quá trình. Chúng tôi sẽ trình bày cả ba cách.
Không cần thiết lập thanh toán trước. Gói miễn phí chạy qua AI Studio và bị giới hạn tốc độ, vì vậy bạn có thể thử nghiệm mà không cần cung cấp thẻ. Thông tin chi tiết hơn về các giới hạn đó ở bên dưới.
Lấy khóa API Gemini
Truy cập Google AI Studio và đăng nhập bằng tài khoản Google của bạn. Nhấp vào “Get API key” (Lấy khóa API), sau đó “Create API key” (Tạo khóa API). Sao chép chuỗi được cung cấp và lưu trữ nó ở nơi an toàn. Hãy coi nó như một mật khẩu: bất kỳ ai có khóa đều có thể sử dụng vào tài khoản của bạn.

Không dán khóa vào mã phía client và không commit nó vào kho lưu trữ. Thay vào đó, hãy đặt nó làm biến môi trường:
export GEMINI_API_KEY="your_key_here"
SDK Python chính thức tự đọc biến đó, giúp giữ bí mật khỏi các tệp mã nguồn của bạn. Để biết các bước thiết lập chuẩn, hãy xem tài liệu API Gemini của Google.
Thực hiện cuộc gọi API đầu tiên của bạn
Điểm cuối REST là một yêu cầu POST đến phương thức generateContent của mô hình. Dưới đây là ví dụ trong curl:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: YOUR_API_KEY" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"contents": [
{
"parts": [
{"text": "Giải thích cách thức hoạt động của API"}
]
}
]
}'
Khóa được đặt trong tiêu đề x-goog-api-key. Phần thân là một mảng contents; mỗi mục có một mảng parts; mỗi phần ở đây là một chuỗi text. Cấu trúc lồng nhau này có vẻ phức tạp cho một lời nhắc duy nhất, nhưng nó có cùng hình dạng cho phép bạn kết hợp văn bản với hình ảnh và tệp trong một yêu cầu sau này.
Ưu tiên Python? Cài đặt SDK bằng pip install google-genai, sau đó:
from google import genai
client = genai.Client() # reads GEMINI_API_KEY from the environment
resp = client.models.generate_content(
model="gemini-3.6-flash",
contents="Giải thích cách thức hoạt động của API",
)
print(resp.text)
Client tự động lấy GEMINI_API_KEY, vì vậy không có khóa nào nằm trong mã của bạn. resp.text chứa câu trả lời được tạo ra. Đó là một cuộc gọi hoạt động chỉ trong năm dòng.
Về cơ bản, API trả về JSON. Văn bản được tạo ra nằm ở candidates[0].content.parts[0].text. Điều này đáng được lưu ý ngay bây giờ, vì đó chính là trường bạn sẽ xác nhận khi biến cuộc gọi này thành một bài kiểm thử sau này trong hướng dẫn.
Các tham số chính đáng biết
Yêu cầu cơ bản hoạt động, nhưng một vài cài đặt sẽ thay đổi những gì bạn nhận được.
- Hướng dẫn hệ thống. Đặt một tính cách hoặc một bộ quy tắc áp dụng cho toàn bộ cuộc trò chuyện, tách biệt khỏi lời nhắc của người dùng. Sử dụng nó cho các yêu cầu như “Chỉ trả lời bằng JSON” hoặc “Bạn là người đánh giá mã ngắn gọn.” Nó điều chỉnh giọng điệu và định dạng đáng tin cậy hơn nhiều so với việc nhồi nhét hướng dẫn vào mỗi tin nhắn.
- Token đầu ra tối đa. Giới hạn độ dài của phản hồi. 3.6 Flash có thể tạo ra tới 64k token đầu ra, vì vậy hãy tăng giới hạn cho các lần tạo dài và giảm nó khi bạn muốn kiểm soát chi phí và độ trễ.
- Đầu vào đa phương thức. Mô hình đọc văn bản, hình ảnh, video, âm thanh và PDF trong cùng một cuộc gọi. Bạn thêm chúng dưới dạng các mục bổ sung trong mảng
partscùng với văn bản của bạn. Đầu ra chỉ là văn bản, vì vậy hãy coi đó là nhiều loại đầu vào, nhưng chỉ có chữ viết ra. Cửa sổ ngữ cảnh chứa tới 1M token đầu vào, đủ chỗ cho một tệp PDF dài hoặc một bản ghi video đầy đủ. - Tư duy và suy luận. 3.6 Flash suy luận trước khi trả lời các lời nhắc khó. Đó là điều cải thiện công việc đa bước, và đó là lý do tại sao giá đầu ra bao gồm các token tư duy (thông tin chi tiết hơn ở phần tiếp theo). Bạn có thể điều chỉnh mức độ suy luận khi bạn muốn đánh đổi độ sâu lấy tốc độ.
Danh sách tham số đầy đủ nằm trong tài liệu API Gemini. Đừng đoán tên trường; tài liệu là nguồn thông tin chính xác, và chúng được cập nhật khi API thay đổi.
Giá cả và gói miễn phí
Gemini 3.6 Flash có giá 1,50 đô la cho mỗi 1 triệu token đầu vào và 7,50 đô la cho mỗi 1 triệu token đầu ra. Tỷ lệ đầu ra này đã giảm so với mức 9,00 đô la mà 3.5 Flash tính phí, và 3.6 Flash cũng có xu hướng tạo ra ít hơn khoảng 17% token đầu ra cho cùng một tác vụ, vì vậy khoản tiết kiệm sẽ tăng lên. Một chi tiết cần lưu ý: giá đầu ra bao gồm các token tư duy. Suy luận nội bộ của mô hình được tính theo tỷ lệ đầu ra, vì vậy một lời nhắc kích hoạt suy luận nặng có thể tốn kém hơn độ dài câu trả lời hiển thị. Hãy lên kế hoạch cho điều đó. Chúng tôi phân tích chi tiết về tính toán này trong hướng dẫn giá Gemini 3.6 Flash của chúng tôi.
Gói miễn phí chạy qua AI Studio và nó có thật, nhưng bị giới hạn tốc độ: giới hạn số lượng yêu cầu mỗi phút và mỗi ngày, và Google có thể sử dụng dữ liệu từ gói miễn phí để cải thiện sản phẩm của mình. Nó được xây dựng cho việc thử nghiệm nguyên mẫu, không phải cho lưu lượng sản xuất. Đối với việc học và thử nghiệm, nó là quá đủ. Để xem nó có thể dùng được đến đâu, hãy đọc cách sử dụng Gemini 3.6 Flash miễn phí. Khi bạn vượt quá giới hạn, bạn sẽ kích hoạt thanh toán và cùng một khóa vẫn hoạt động, không cần thay đổi mã.
Kiểm thử và gỡ lỗi API Gemini trong Apidog
curl chứng minh rằng cuộc gọi hoạt động một lần. Nó sẽ không cho bạn biết khi Google thay đổi một trường phản hồi, khi khóa của bạn hết hạn, hoặc khi một lần triển khai âm thầm làm hỏng yêu cầu. Để làm được điều đó, bạn cần một bài kiểm thử đã lưu, có thể lặp lại. Đây là lúc Apidog thể hiện giá trị của mình trong quy trình làm việc.
Apidog là một ứng dụng client API và nền tảng kiểm thử. Đây là quy trình cho cuộc gọi Gemini, từ đầu đến cuối:
- Tạo yêu cầu. Thêm một yêu cầu POST mới với URL
https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent. Dán phần thân JSON từ trước đó vào phần thân yêu cầu. - Lưu khóa vào biến môi trường. Thêm một biến có tên
GEMINI_API_KEYvào môi trường Apidog, sau đó tham chiếu nó trong tiêu đềx-goog-api-keydưới dạng{{GEMINI_API_KEY}}. Bí mật sẽ không nằm trong yêu cầu được chia sẻ, và bạn có thể hoán đổi khóa cho mỗi môi trường (dev, staging, prod) mà không cần chạm vào bản thân cuộc gọi. - Thêm các xác nhận. Sau khi yêu cầu chạy, xác nhận phản hồi JSON: trạng thái là 200, và
candidates[0].content.parts[0].texttồn tại và không trống. Giờ đây, một lần chạy thành công có nghĩa là API thực sự đã trả lời, chứ không chỉ là nó đã trả về một cái gì đó. - Lưu và lên lịch. Giữ yêu cầu trong một bộ sưu tập và lên lịch nó như một bài kiểm thử hồi quy. Chạy nó theo thời gian hoặc trong CI, và bạn sẽ biết ngay khi cuộc gọi Gemini ngừng hoạt động như mong muốn, trước khi người dùng của bạn phát hiện ra.
Tải xuống Apidog và bạn có thể chạy bài kiểm thử này trong vài phút. Đó là sự phù hợp chân thực ở đây: Apidog không chạy mô hình, nó đảm bảo rằng API mà ứng dụng của bạn phụ thuộc vào vẫn phản hồi theo cách mà ứng dụng của bạn mong đợi.
Các lỗi thường gặp và cách khắc phục
Ba lỗi sau đây bao gồm hầu hết những gì bạn sẽ gặp phải trong giai đoạn đầu.
- 401 Unauthorized (khóa không hợp lệ). Khóa bị sai, bị thu hồi hoặc thiếu trong tiêu đề. Kiểm tra xem
x-goog-api-keychứa đúng chuỗi từ AI Studio và biến môi trường của bạn đã được giải quyết đúng cách. Một khoảng trắng thừa hoặc một{{GEMINI_API_KEY}}chưa được mở rộng thường là nguyên nhân. - 429 Too Many Requests (giới hạn tốc độ). Bạn đã đạt đến giới hạn mỗi phút hoặc mỗi ngày của gói miễn phí. Giảm tốc độ yêu cầu, thêm tính năng thử lại với khoảng chờ, hoặc bật thanh toán để tăng giới hạn. Các vòng lặp kiểm thử chặt chẽ sẽ gây ra lỗi này nhanh chóng.
- 404 Not Found (không tìm thấy mô hình). Đây gần như luôn là lỗi chính tả trong ID mô hình. Nó phải là
gemini-3.6-flash, chính xác. Không phảigemini-3.5-flash, không phảigemini-flash-3.6. Gói Lite trong cùng bản phát hành này làgemini-3.5-flash-lite, một mô hình khác trên dòng 3.5, vì vậy đừng nhầm lẫn giữa chúng.
Câu hỏi thường gặp
- ID mô hình chính xác cho Gemini 3.6 Flash là gì? Đó là
gemini-3.6-flash. Sử dụng nó làm tên mô hình trong SDK và trong đường dẫn URL REST ngay trước:generateContent. - API Gemini 3.6 Flash có miễn phí sử dụng không? Có một gói miễn phí thông qua AI Studio, và nó bị giới hạn tốc độ. Nó tốt cho việc tạo nguyên mẫu và học hỏi. Lưu lượng sản xuất cần bật thanh toán. Để biết chi tiết, hãy xem cách sử dụng miễn phí.
- Tôi có thể gửi gì cho mô hình? Văn bản, hình ảnh, video, âm thanh và PDF, với cửa sổ ngữ cảnh lên đến 1 triệu token. Đầu ra chỉ là văn bản.
- Tại sao hóa đơn của tôi cao hơn so với phản hồi hiển thị? Giá đầu ra 7,50 đô la cho mỗi 1 triệu token bao gồm các token tư duy của mô hình. Các lời nhắc yêu cầu suy luận nhiều sẽ được tính phí cao hơn độ dài câu trả lời hiển thị trên màn hình.
- Đây có phải là phiên bản giống như API Gemini 3.5 Flash cũ hơn không? Cấu trúc cuộc gọi giống nhau, vì vậy nếu bạn đã sử dụng API Gemini 3.5, bạn chỉ cần hoán đổi ID mô hình là xong. 3.6 Flash giảm giá đầu ra và sử dụng ít token đầu ra hơn cho cùng một công việc.
- Tôi có thể sử dụng cùng một khóa trong curl, Python và Apidog không? Có. Một khóa từ AI Studio hoạt động trên tất cả các công cụ này. Hãy giữ nó trong một biến môi trường ở mỗi công cụ thay vì mã hóa cứng, và bạn có thể xoay vòng hoặc thu hồi nó ở một nơi duy nhất.
Tiếp theo bạn nên làm gì
Bạn đã có khóa API, một cuộc gọi hoạt động trong curl và Python, các tham số quan trọng, và một bài kiểm thử hồi quy đã lưu để theo dõi điểm cuối. Hãy bắt đầu với gói miễn phí, giữ khóa của bạn trong một biến môi trường, và dựa vào tài liệu chính thức cho bất kỳ điều gì ngoài những kiến thức cơ bản. Khi cuộc gọi trở thành thứ mà ứng dụng của bạn phụ thuộc vào, hãy gói nó trong một bài kiểm thử của Apidog để một thay đổi API âm thầm không bao giờ đến tay người dùng của bạn trước.
