Gemini 3.7 Flash là mẫu mô hình AI chủ lực mới nhất của Google, được phát hành vào ngày 13 tháng 8 năm 2026, ba tuần sau Gemini 3.6 Flash. Nó giữ nguyên cửa sổ ngữ cảnh 1 triệu token và đầu vào đa phương thức của phiên bản tiền nhiệm, đồng thời đạt được những cải tiến lớn về điểm chuẩn mã hóa và tác nhân, và ra mắt với giá API giới thiệu là 0,75 USD cho mỗi 1 triệu token đầu vào. Google gọi đây là “mô hình AI chủ lực thông minh nhất của chúng tôi.”
Khoảng cách ba tuần giữa các bản phát hành này là một câu chuyện đáng chú ý. Google đang tung ra các bản cập nhật Flash với tốc độ nhanh chóng trong khi Gemini 3.5 Pro vẫn bị trì hoãn, điều này có nghĩa là các cải tiến kỹ thuật thú vị hiện đang xuất hiện trước tiên trên các mô hình tầm trung. Sự khác biệt về điểm chuẩn đã chứng minh điều đó: DeepSWE tăng 16 điểm, AutomationBench gần như tăng gấp đôi, và giá giới thiệu giảm một nửa so với giá ra mắt của 3.6 Flash.
Bài viết này đề cập đến tất cả những thay đổi: bảng điểm chuẩn đầy đủ mà Google đã công bố rải rác, các khung thời gian định giá bạn cần lưu ý, mọi nơi bạn có thể truy cập mô hình này ngay hôm nay và một yêu cầu cURL hoạt động bạn có thể thực hiện trong năm phút. Nếu bạn muốn tìm hiểu sâu hơn về điểm cuối, hướng dẫn bắt đầu nhanh API Gemini 3.7 Flash kết hợp với bài giải thích này, và Apidog cung cấp cho bạn không gian làm việc để kiểm tra mô hình mới với các câu lệnh hiện có của bạn trước khi bạn quyết định chuyển đổi.
TL;DR (Tóm tắt)
- Gemini 3.7 Flash ra mắt vào ngày 13 tháng 8 năm 2026, ba tuần sau 3.6 Flash. ID mô hình:
gemini-3.7-flash. - Điểm chuẩn về mã hóa và tác nhân đã tăng vọt: DeepSWE v1.1 từ 49,0% lên 65,3%, AutomationBench từ 17,0% lên 30,4%, WebDev Arena Elo từ 1538 lên 1588.
- Giá API giới thiệu là 0,75 USD cho mỗi 1 triệu token đầu vào và 3,75 USD cho mỗi 1 triệu token đầu ra, bằng một nửa giá ra mắt của 3.6 Flash. Mức giá tiêu chuẩn (1,50 USD / 7,50 USD) sẽ bắt đầu từ ngày 1 tháng 1 năm 2027.
- Thông số kỹ thuật giữ nguyên: cửa sổ ngữ cảnh đầu vào 1 triệu token, giới hạn đầu ra 64 nghìn, đầu vào đa phương thức (văn bản, hình ảnh, video, âm thanh, PDF), gọi hàm, tìm kiếm như một công cụ và sử dụng máy tính.
- Hiện có sẵn trong Gemini API, AI Studio, ứng dụng Gemini, Gemini Spark, Google Antigravity, Android Studio và Gemini Enterprise, tại hơn 160 quốc gia.
- Gemini 3.5 Pro vẫn bị trì hoãn; Google đang tung ra các cải tiến Flash trước mô hình chủ lực tiếp theo của mình.
Gemini 3.7 Flash là gì
Flash là tầng giữa của dòng Gemini: rẻ hơn và nhanh hơn Pro, thông minh hơn Flash-Lite, và được điều chỉnh cho các khối lượng công việc lớn tạo nên phần lớn lưu lượng truy cập AI sản xuất. Gemini 3.7 Flash là bản phát hành Flash thứ ba trong dòng 3.x, và cách Google định vị đã thay đổi theo đó. Thông báo chính thức đặt nó làm mô hình mã hóa và tác nhân trước tiên, mô hình trò chuyện thứ hai.

Bảng thông số kỹ thuật được kế thừa từ 3.6 Flash:
- Ngữ cảnh: Cửa sổ đầu vào 1 triệu token, giới hạn đầu ra 64 nghìn token.
- Phương thức đầu vào: văn bản, hình ảnh, video, âm thanh và PDF. Đầu ra là văn bản.
- Công cụ: gọi hàm, tìm kiếm như một công cụ và sử dụng máy tính.
- An toàn: các biện pháp bảo vệ CBRN và an ninh mạng cập nhật được phát hành cùng phiên bản.
Điều thay đổi là hành vi, chứ không phải kiến trúc. Google cho biết 3.7 Flash gỡ lỗi tốt hơn, tạo ra mã sẵn sàng triển khai chính xác ngay lần đầu tiên thường xuyên hơn, tự điều chỉnh khi gặp trở ngại, đặt câu hỏi làm rõ khi ý định không rõ ràng và tuân thủ hướng dẫn với độ chính xác cao hơn. Đó là những tuyên bố. Các điểm chuẩn dưới đây là bằng chứng.
Cải tiến điểm chuẩn: 3.6 so với 3.7
Google đã công bố những con số này trên một bài đăng blog và thẻ mô hình. Dưới đây là chúng trong một bảng, với những thay đổi quan trọng:
| Điểm chuẩn | Gemini 3.6 Flash | Gemini 3.7 Flash | Thay đổi |
|---|---|---|---|
| DeepSWE v1.1 (mã hóa tác nhân) | 49.0% | 65.3% | +16,3 điểm |
| FrontierCode 1.1 Main | 34.4% | 43.6% | +9,2 điểm |
| WebDev Arena (Elo) | 1538 | 1588 | +50 Elo |
| GDP.pdf (lý luận tài liệu) | 22.0% | 34.0% | +12,0 điểm |
| AutomationBench (tác vụ tác nhân) | 17.0% | 30.4% | +13,4 điểm |
Hai điểm số độc lập làm rõ thêm bức tranh: 90,7% trên Harvey LAB-AA, một điểm chuẩn lý luận pháp lý, và 97,0% trên 128k-needle truy xuất ngữ cảnh dài. Con số thứ hai quan trọng nếu bạn cung cấp cho mô hình các tài liệu dài; chất lượng truy xuất ở độ sâu là nơi nhiều mô hình âm thầm sụp đổ.
Mô hình trên bảng là nhất quán. Những bước nhảy vọt lớn nhất nằm ở các điểm chuẩn tác nhân, những điểm đo lường công việc nhiều bước hơn là các câu trả lời đơn lẻ. AutomationBench chuyển từ 17,0% lên 30,4% là loại khác biệt làm thay đổi các tác vụ bạn có thể giao cho một mô hình tầm trung. Thông tin về lần ra mắt này đã nêu bật mức tăng của DeepSWE là kết quả đáng chú ý, và có lý do: một bước nhảy 16 điểm về mã hóa tác nhân trong ba tuần là điều bất thường đối với bất kỳ dòng mô hình nào. Để hiểu ngữ cảnh về cách các khác biệt điểm chuẩn chuyển đổi giữa các mô hình cạnh tranh, so sánh Grok 4.6 với GPT 5.6 và Claude cho thấy những khoảng cách tương tự diễn ra trong các khối lượng công việc thực tế.
Cải tiến về mã hóa và tác nhân
Bảng điểm chuẩn cho bạn biết điều gì đã được cải thiện. Ghi chú phát hành của Google cho bạn biết cách nó thể hiện trong thực tế, và các tuyên bố đủ cụ thể để kiểm tra:
- Gỡ lỗi. Mô hình tốt hơn trong việc định vị nguyên nhân gây lỗi thay vì chỉ vá các triệu chứng. Mức tăng của DeepSWE là con số hỗ trợ ở đây, vì điểm chuẩn đó đánh giá việc sửa lỗi đa tệp trong các kho lưu trữ thực tế.
- Mã có thể triển khai ngay từ lần đầu. Google tuyên bố nhiều mã được tạo ra chạy mà không cần vòng điều chỉnh. Cải thiện 9,2 điểm của FrontierCode là thước đo công khai gần nhất.
- Xử lý trở ngại. Khi một lệnh gọi công cụ thất bại hoặc một tệp bị thiếu, 3.7 Flash điều chỉnh kế hoạch thay vì lặp lại. Đây là hành vi mà AutomationBench nhấn mạnh.
- Làm rõ ý định. Mô hình đặt câu hỏi khi yêu cầu không rõ ràng thay vì đoán. Trong một quy trình tác nhân, một lượt làm rõ rẻ hơn một câu trả lời sai dài 5.000 token.
- Độ chính xác của hướng dẫn. Các yêu cầu định dạng đầu ra, giới hạn độ dài và ràng buộc phủ định được tuân thủ đáng tin cậy hơn trong các cuộc hội thoại dài.
Bộ công cụ cũng quan trọng như điểm số thô. Gọi hàm và tìm kiếm như một công cụ được kế thừa từ 3.6, và hỗ trợ sử dụng máy tính có nghĩa là mô hình có thể điều khiển trình duyệt khi không có API cho tác vụ. Khả năng cuối cùng đó nằm ở một vị trí kỳ lạ đối với các nhà phát triển: mạnh mẽ, nhưng chậm hơn và ít xác định hơn so với một điểm cuối có cấu trúc. Phân tích sử dụng máy tính so với API có cấu trúc đề cập đến khi nào mỗi phương pháp phát huy tác dụng.
Giá cả: giảm một nửa đến ngày 31 tháng 12 năm 2026
Gemini 3.7 Flash ra mắt với lịch trình giá hai giai đoạn trên Gemini API:
| Giai đoạn | Đầu vào (mỗi 1 triệu token) | Đầu ra (mỗi 1 triệu token) |
|---|---|---|
| Đến ngày 31 tháng 12 năm 2026 | 0,75 USD | 3,75 USD |
| Từ ngày 1 tháng 1 năm 2027 | 1,50 USD | 7,50 USD |
Mức giá giới thiệu bằng một nửa chi phí của Gemini 3.6 Flash khi ra mắt, điều này làm cho bốn tháng rưỡi tiếp theo trở thành khung thời gian rẻ nhất mà dòng mô hình này từng có. Vấn đề là giá sẽ tăng gấp đôi vào ngày 1 tháng 1. Nếu bạn xây dựng ngân sách dựa trên 0,75 USD cho mỗi token đầu vào, ngân sách đó sẽ bị phá vỡ trong năm tháng trừ khi bạn lên kế hoạch ngay từ bây giờ.
Hai điểm chính cần lưu ý. Thứ nhất, hãy xác minh mức giá hiện tại trên trang giá chính thức trước khi bạn triển khai bất cứ điều gì; các khung thời gian giới thiệu đã từng thay đổi trước đây. Thứ hai, hãy lập mô hình chi phí năm 2027 của bạn theo mức giá tiêu chuẩn, không phải mức giá khuyến mãi. Các ví dụ chi tiết, bao gồm tính toán token cho chatbot, quy trình tài liệu và vòng lặp tác nhân, có trong phân tích giá Gemini 3.7 Flash.
Nơi bạn có thể sử dụng nó ngay hôm nay
Google đã triển khai 3.7 Flash trên toàn bộ phạm vi của mình ngay trong ngày đầu tiên, tại hơn 160 quốc gia:
- Gemini API. Con đường dành cho nhà phát triển. Lấy khóa từ AI Studio và gọi trực tiếp
gemini-3.7-flash. - Google AI Studio. Sân chơi trên trình duyệt để kiểm tra câu lệnh trước khi bạn viết mã.
- Ứng dụng Gemini. Ứng dụng trò chuyện dành cho người dùng đã sử dụng mô hình mới ngay khi ra mắt.
- Gemini Spark. Dành cho người đăng ký AI Pro và Ultra.
- Google Antigravity. Môi trường phát triển tác nhân của Google chạy trên đó.
- Android Studio. Tích hợp IDE nhận được mô hình để hỗ trợ mã hóa.
- Gemini Enterprise. Giải pháp được quản lý dành cho các tổ chức có yêu cầu tuân thủ.
Đối với quyền truy cập API ở quy mô lớn, bạn cũng có thể sử dụng đường dẫn Vertex AI trên aiplatform.googleapis.com với OAuth, IAM và ghi nhật ký kiểm tra. Cùng một mô hình, cùng một lược đồ yêu cầu, nhưng đảm bảo xác thực và lưu trữ khác nhau.
Tại sao Google phát hành Flash trước Gemini 3.5 Pro
Thứ tự phát hành này là bất thường. Các mô hình chủ lực thường dẫn đầu và các tầng rẻ hơn theo sau. Google đã đảo ngược điều đó: 3.6 Flash vào cuối tháng 7, 3.7 Flash ba tuần sau, và Gemini 3.5 Pro vẫn chưa có ngày ra mắt. Axios báo cáo rằng Google đang cố ý phát hành các bản cập nhật Flash trước mô hình chủ lực tiếp theo của mình trong khi Pro vẫn bị trì hoãn.
Nếu xem đây là chiến lược thay vì chậm trễ lịch trình, động thái này có lý. Hầu hết lưu lượng truy cập sản xuất chạy trên các mô hình tầm trung vì đó là nơi chi phí mỗi token đáp ứng chất lượng chấp nhận được. Việc cải thiện Flash sẽ cải thiện mô hình mà hầu hết khách hàng sử dụng hàng ngày. Nó cũng giữ cho Google trong cuộc trò chuyện về chu kỳ phát hành trong một giai đoạn mà mọi phòng thí nghiệm lớn đều đang phát hành nhanh chóng, mà không cần đốt cháy thông báo về mô hình chủ lực.
Đối với các nhà phát triển, hậu quả thực tế là tầng Flash không còn là điểm yếu cuối cùng. Khả năng tác nhân đang xuất hiện ở đây trước tiên. Nếu bạn trì hoãn việc di chuyển khối lượng công việc từ 3.6 vì bạn đang chờ Pro, hướng dẫn di chuyển từ 3.6 sang 3.7 Flash sẽ bao gồm việc hoán đổi, đối với hầu hết các cơ sở mã chỉ là một thay đổi ID mô hình một dòng cộng với một lần kiểm tra hồi quy.
Cách dùng thử API trong năm phút
Bạn cần một khóa API từ AI Studio. Tạo một khóa, xuất nó và gửi yêu cầu đầu tiên của bạn:
export GEMINI_API_KEY="AIza..."
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [{ "text": "Review this function for bugs: def dedupe(items): return list(set(items))" }]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 1024
}
}'
Phản hồi trả về dưới dạng một mảng candidates với văn bản được tạo trong content.parts, cộng với một khối usageMetadata báo cáo chính xác số lượng token đầu vào và đầu ra. Hãy theo dõi khối đó ngay từ ngày đầu tiên; đó là đồng hồ đo chi phí của bạn. Đối với phát trực tiếp (streaming), hãy thay :generateContent bằng :streamGenerateContent?alt=sse và API sẽ trả về các sự kiện được gửi từ máy chủ.
Khi lệnh gọi đầu tiên hoạt động, hãy chuyển việc thử nghiệm ra khỏi thiết bị đầu cuối của bạn. Trong Apidog, hãy nhập thông số kỹ thuật API Ngôn ngữ Sáng tạo, liên kết GEMINI_API_KEY với tiêu đề x-goog-api-key dưới dạng biến môi trường, và lưu ID mô hình dưới dạng biến đường dẫn. Giờ đây, bạn có thể chạy lại cùng một câu lệnh với gemini-3.6-flash và gemini-3.7-flash song song, xem các luồng SSE hiển thị trực tiếp và lưu các phản hồi làm ví dụ để kiểm tra hồi quy không tốn token. Đó là cách nhanh nhất để xác minh tuyên bố "tuân thủ hướng dẫn tốt hơn" của Google đối với các câu lệnh của riêng bạn thay vì chỉ tin vào lời bài đăng ra mắt.
Câu hỏi thường gặp
Gemini 3.7 Flash có miễn phí sử dụng không?
Gemini API có một tầng miễn phí thông qua AI Studio với hạn mức hàng ngày, đủ để tạo mẫu. Việc sử dụng có trả phí bắt đầu với mức giá giới thiệu là 0,75 USD cho mỗi 1 triệu token đầu vào đến hết ngày 31 tháng 12 năm 2026. Nếu bạn muốn kéo dài hạn mức miễn phí hơn nữa, hướng dẫn về truy cập API Gemini miễn phí sẽ đề cập đến các giới hạn và cách làm việc trong chúng.
Sự khác biệt giữa Gemini 3.6 Flash và 3.7 Flash là gì?
Thông số kỹ thuật giống nhau, hành vi tốt hơn. Cửa sổ ngữ cảnh, giới hạn đầu ra, phương thức và hỗ trợ công cụ không thay đổi. Các cải tiến nằm ở điểm chuẩn mã hóa và tác nhân: DeepSWE tăng 16,3 điểm, AutomationBench tăng 13,4 điểm, WebDev Arena tăng 50 Elo. Google cũng tuyên bố gỡ lỗi, tuân thủ hướng dẫn và lập kế hoạch nhiều bước tốt hơn.
Gemini 3.7 Flash có thay thế Gemini 3.5 Pro không?
Không. Pro vẫn là tầng chủ lực cho các tác vụ lý luận khó nhất, và Gemini 3.5 Pro vẫn đang được phát triển. Flash 3.7 là mô hình mà Google khuyến nghị cho các công việc sản xuất có khối lượng lớn, nơi chi phí và độ trễ quan trọng như chất lượng.
Điều gì xảy ra với giá vào ngày 1 tháng 1 năm 2027?
Mức giá giới thiệu kết thúc và giá tiêu chuẩn sẽ được áp dụng: 1,50 USD cho mỗi 1 triệu token đầu vào và 7,50 USD cho mỗi 1 triệu token đầu ra, gấp đôi mức giá ra mắt. Hãy lập ngân sách dựa trên mức giá tiêu chuẩn cho bất kỳ khối lượng công việc nào kéo dài qua năm 2026.
Gemini 3.7 Flash có thể xử lý hình ảnh và PDF không?
Có. Các phương thức đầu vào bao gồm văn bản, hình ảnh, video, âm thanh và PDF trong cùng một mảng contents. Đầu ra chỉ là văn bản. Điểm chuẩn GDP.pdf là 34,0%, tăng từ 22,0%, là bằng chứng của Google cho thấy khả năng hiểu tài liệu đã cải thiện cùng với những tiến bộ về mã hóa.
Vị trí của 3.7 Flash trong ngăn xếp công nghệ của bạn
Gemini 3.7 Flash là một mô hình tầm trung với điểm chuẩn cấp tác nhân và giảm giá trong bốn tháng. Sự kết hợp này làm cho quyết định không phải là về việc có nên đánh giá nó hay không mà là về việc đánh giá nhanh đến mức nào. Những cải tiến về khả năng tác nhân là những con số thực trên các điểm chuẩn công khai, các thông số kỹ thuật khớp với những gì bạn đang chạy hôm nay trên 3.6, và giá giới thiệu có nghĩa là việc thử nghiệm nó ngay bây giờ chỉ tốn một nửa so với cùng một đánh giá sẽ tốn vào tháng Giêng.
Trình tự hợp lý: chạy bộ câu lệnh hiện có của bạn với gemini-3.7-flash, so sánh đầu ra và mức sử dụng token với mô hình hiện tại của bạn, và để kết quả chọn ra người chiến thắng. Tải Apidog để chạy so sánh đó trong một không gian làm việc; lưu các phản hồi 3.6 của bạn làm ví dụ, phát lại cùng các yêu cầu đó với 3.7, và bạn sẽ biết trong vòng một buổi chiều liệu câu chuyện điểm chuẩn có phù hợp với khối lượng công việc của bạn hay không.
