Google đã phát hành Gemini 3.7 Flash vào ngày 13 tháng 8 năm 2026, ba tuần sau 3.6 Flash, và gọi nó là “mẫu mô hình hiệu năng cao thông minh nhất của chúng tôi”. Sự chênh lệch trong điểm chuẩn đã củng cố niềm tin này. DeepSWE tăng từ 49,0% lên 65,3%, AutomationBench tăng từ 17,0% lên 30,4%, và giá giới thiệu 0,75 đô la cho mỗi 1 triệu token đầu vào chỉ bằng một nửa so với giá ra mắt của 3.6 Flash.
Sự kết hợp đó đặt ra một câu hỏi mà mọi nhóm API đều phải đối mặt trong quý này: liệu một mô hình Gemini nhanh và rẻ có thể xử lý các tác vụ mà bạn từng chuyển đến Claude hoặc GPT không? Bài so sánh này tập trung vào những gì bạn có thể xác minh: cửa sổ ngữ cảnh, phương thức, hỗ trợ công cụ, cấu trúc giá và các lược đồ yêu cầu bạn sẽ tích hợp; ở những nơi số liệu của đối thủ không thể so sánh, bài viết sẽ nêu rõ. Và bởi vì câu trả lời chân thật cho câu hỏi “bạn nên sử dụng API nào” là “cái nào phù hợp nhất với khối lượng công việc của bạn”, phần cuối cùng sẽ chỉ ra cách chạy cả ba song song trong Apidog trước khi bạn đưa ra quyết định cuối cùng.
Nếu bạn quyết định chọn Gemini và muốn biết các bước thiết lập, hướng dẫn bắt đầu nhanh với API Gemini 3.7 Flash sẽ bao gồm các khóa, điểm cuối và yêu cầu đầu tiên.
TÓM TẮT
- Gemini 3.7 Flash: Ngữ cảnh 1 triệu token, giới hạn đầu ra 64 nghìn, đầu vào gốc qua văn bản, hình ảnh, video, âm thanh và PDF, cộng với gọi hàm (function calling), tìm kiếm như một công cụ và sử dụng máy tính.
- Giá giới thiệu: 0,75 đô la cho mỗi 1 triệu token đầu vào và 3,75 đô la cho mỗi 1 triệu token đầu ra đến hết ngày 31 tháng 12 năm 2026, sẽ tăng gấp đôi lên 1,50 đô la và 7,50 đô la vào ngày 1 tháng 1 năm 2027.
- Cải thiện mã hóa so với 3.6 Flash: DeepSWE v1.1 từ 49,0% lên 65,3%, FrontierCode 1.1 Main từ 34,4% lên 43,6%, AutomationBench từ 17,0% lên 30,4%.
- Claude Fable 5 và GPT-5.6 Sol vẫn dẫn đầu về chiều sâu mã hóa tiên tiến và tính nhất quán của tác nhân, với giá mỗi token cao gấp nhiều lần.
- Ba nhà cung cấp sử dụng các lược đồ yêu cầu không tương thích: Google
contents, Anthropic Messages, OpenAImessages. - Các điểm chuẩn dự đoán mức trung bình, không phải khối lượng công việc của bạn; hãy chạy thử nghiệm với 20 lời nhắc trên cả ba API trước khi quyết định.
Cách đọc bài so sánh này
Đây không phải là một cuộc đối đầu giữa các mô hình tiên tiến nhất. Claude Fable 5 và GPT-5.6 Sol là những mô hình chủ lực được định giá cho khả năng tối đa; Gemini 3.7 Flash là một mô hình hiệu năng cao được định giá cho số lượng lớn. Google đang phát hành nó trong khi mô hình chủ lực của mình vẫn đang chờ đợi: Axios báo cáo rằng Gemini 3.5 Pro vẫn bị trì hoãn, với các bản cập nhật Flash ra mắt trước.
Tuy nhiên, việc so sánh vẫn đáng giá: điểm ra mắt của 3.7 Flash hiện đã chồng lấn lên phạm vi mà các mô hình tiên phong đạt được vài tuần trước, và điều đó thay đổi cách tính toán định tuyến ngay cả khi các mô hình chủ lực vẫn dẫn trước.
Hai lưu ý áp dụng xuyên suốt. Thứ nhất, mọi con số ở đây đều là số liệu do nhà cung cấp báo cáo trong tuần ra mắt; hãy coi chúng là định hướng cho đến khi có các đánh giá độc lập. Thứ hai, các biến thể điểm chuẩn rất quan trọng. Google báo cáo FrontierCode 1.1 Main, trong khi các số liệu được công bố cho Claude và GPT khi ra mắt lại đến từ Extended split, vì vậy các cột đó không bao giờ được chia sẻ trong cùng một bảng ở đây.
Thông số kỹ thuật so sánh
Bảng thông số kỹ thuật là nơi Gemini 3.7 Flash thể hiện giá trị của mình so với các mô hình đắt tiền hơn nhiều. Chi tiết kỹ thuật đầy đủ có trên trang mô hình Gemini Flash.
| Gemini 3.7 Flash | Claude Fable 5 | GPT-5.6 Sol | |
|---|---|---|---|
| Nhà phát triển | Anthropic | OpenAI | |
| Cửa sổ ngữ cảnh | 1M token | 1M token | 1.05M token |
| Giới hạn đầu ra | 64k token | Xem tài liệu nhà cung cấp | Xem tài liệu nhà cung cấp |
| Phương thức đầu vào | Văn bản, hình ảnh, video, âm thanh, PDF | Văn bản, hình ảnh | Văn bản, hình ảnh |
| Đầu ra | Văn bản | Văn bản | Văn bản |
| Hỗ trợ công cụ | Gọi hàm, tìm kiếm như một công cụ, sử dụng máy tính | Gọi hàm, sử dụng công cụ | Gọi hàm, công cụ tích hợp |
| Lược đồ yêu cầu | Google contents + generationConfig |
Anthropic Messages | OpenAI messages |
| Xác thực | Tiêu đề x-goog-api-key |
Tiêu đề x-api-key + version |
Mã thông báo Bearer |
| Giá (mỗi 1 triệu token) | 0,75$ vào / 3,75$ ra (giới thiệu); 1,50$ / 7,50$ từ T1/2027 | Bậc tiên phong cao cấp | Bậc tiên phong cao cấp |
| Định vị | Mô hình hiệu năng cao cho khối lượng lớn | Tác vụ tác nhân dài hạn | Chiều sâu mã hóa quy mô kho lưu trữ |
Các cửa sổ ngữ cảnh hiện đã thực sự ngang bằng, vì vậy hàng đó không còn quyết định bất cứ điều gì nữa. Các hàng về phương thức và giá là nơi ba mô hình này khác biệt, và các phần tiếp theo sẽ làm rõ cả hai.
Tác vụ mã hóa và tác nhân
Các tuyên bố chính của Google về 3.7 Flash tập trung vào nhà phát triển: tốt hơn trong việc gỡ lỗi, có khả năng tạo ra mã có thể triển khai ngay lần đầu tiên, và cẩn thận hơn trong lập kế hoạch nhiều bước và gọi công cụ. Các số liệu cải thiện qua từng thế hệ, được xác nhận trong bài đưa tin ra mắt của 9to5Google, hỗ trợ các tuyên bố này.
| Điểm chuẩn | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|
| DeepSWE v1.1 (sửa lỗi quy mô repo) | 49,0% | 65,3% |
| FrontierCode 1.1 Main | 34,4% | 43,6% |
| WebDev Arena (Elo) | 1538 | 1588 |
| GDP.pdf (lý luận tài liệu) | 22,0% | 34,0% |
| AutomationBench (tác vụ tác nhân) | 17,0% | 30,4% |
Sự nhảy vọt của AutomationBench là điều mà các nhà xây dựng tác nhân nên chú ý. Gần như tăng gấp đôi điểm chuẩn tác nhân trong ba tuần cho thấy tuyên bố “suy nghĩ cẩn thận hơn về các lệnh gọi công cụ” không chỉ là tiếp thị.
Điều đó so với Claude và GPT như thế nào? Trên DeepSWE v1.1, bậc tiên phong đạt 73,0% cho GPT-5.6 Sol Max khi ra mắt, với Grok 4.6 đạt 65,9%; bài so sánh Grok 4.6 vs GPT-5.6 Sol vs Claude Fable 5 của chúng tôi đã đi sâu vào các kết quả đó. Sol Max vẫn giữ vị trí dẫn đầu thực sự về sửa lỗi quy mô kho lưu trữ, và thế mạnh của Claude Fable 5 là tính nhất quán trong các đánh giá mã hóa và tác nhân, nơi nó hiếm khi xếp dưới vị trí thứ hai. Gemini 3.7 Flash chưa thu hẹp được khoảng cách đó. Nó đã đạt đến tầm với với chi phí chỉ bằng một phần nhỏ, đây là một đề xuất giá trị khác so với “điểm tốt nhất sẽ thắng.”
Hai con số chuyên biệt làm rõ thêm bức tranh: 90,7% trên Harvey LAB-AA cho lý luận pháp lý và 97,0% trên khả năng truy xuất 128k-needle, điểm số giúp cửa sổ ngữ cảnh 1 triệu token đáng tin cậy trong thực tế.
Đầu vào đa phương thức
Đây là điểm khác biệt cấu trúc rõ ràng nhất giữa ba API. Gemini 3.7 Flash chấp nhận văn bản, hình ảnh, video, âm thanh và PDF trong cùng một mảng contents thông qua một điểm cuối duy nhất. Claude và GPT xử lý tốt văn bản và hình ảnh, nhưng các khối lượng công việc video và âm thanh thường phải trải qua các bước chuyển mã hoặc tiền xử lý riêng biệt trước khi văn bản đến được mô hình.
Nếu sản phẩm của bạn liên quan đến tài liệu, sự tăng trưởng của GDP.pdf từ 22,0% lên 34,0% là một tín hiệu quan trọng: điểm chuẩn đó đo lường khả năng lý luận trên các tệp PDF thực tế với bảng biểu, bản quét và bố cục bị lỗi. Việc đưa trực tiếp một hợp đồng hoặc hóa đơn vào mô hình mà không cần đường dẫn OCR sẽ loại bỏ toàn bộ một giai đoạn dễ xảy ra lỗi khỏi kiến trúc của bạn.
Quy tắc thực tế: đối với trò chuyện văn bản và hình ảnh, phương thức không quá khác biệt. Đối với các khung video, bản ghi cuộc gọi hoặc chồng tài liệu, Gemini là mô hình duy nhất trong ba mô hình mà đường dẫn đầu vào được gom gọn vào một lệnh gọi API duy nhất.
Triết lý định giá
Ba nhà cung cấp đang áp dụng các chiến lược định giá khác nhau, và sự khác biệt này cho bạn biết mỗi mô hình dành cho đối tượng nào.
Google định giá 3.7 Flash để chiếm thị phần. Mức giá giới thiệu 0,75 đô la cho mỗi 1 triệu token đầu vào và 3,75 đô la cho mỗi 1 triệu token đầu ra sẽ duy trì đến hết ngày 31 tháng 12 năm 2026, và mức này chỉ bằng một nửa so với chi phí của 3.6 Flash khi ra mắt. Vào ngày 1 tháng 1 năm 2027, mức giá tiêu chuẩn sẽ áp dụng là 1,50 đô la và 7,50 đô la, tăng gấp đôi rõ rệt. Hạn chót đó là một yếu tố thúc đẩy: Google muốn lưu lượng truy cập của bạn cam kết trước khi giá thay đổi. Chi tiết về cách tính toán token, với các ví dụ minh họa cho chatbot và vòng lặp tác nhân, có trong phân tích giá Gemini 3.7 Flash của chúng tôi.
Anthropic và OpenAI định giá các mô hình chủ lực của họ như những khả năng cao cấp. Mức giá thay đổi theo cấp độ và thường xuyên thay đổi, nhưng cấu trúc thì nhất quán: token đầu ra của các mô hình tiên tiến có giá cao gấp nhiều lần so với Flash, và cả hai nhà cung cấp đều bán sự cao cấp dựa trên số lần chạy lỗi ít hơn, chứ không phải token rẻ hơn. Anthropic thêm một tham số nỗ lực (effort parameter) để cân bằng chi phí với khả năng trong cùng một mô hình; OpenAI thì phân cấp theo kích thước mô hình.
Triết lý nào thắng cuộc phụ thuộc vào kinh tế học thất bại của bạn. Một mô hình rẻ tiền mà thất bại trong một tác vụ sẽ tạo ra công việc sửa chữa tốn kém hơn số token tiết kiệm được; một mô hình cao cấp chỉ đáng giá khi nó ngăn chặn những thất bại đó. Hãy so sánh chi phí cho mỗi tác vụ hoàn thành, không phải chi phí cho mỗi token, và xem xét lại giá sau ngày 1 tháng 1 năm 2027 khi giá của Gemini tăng gấp đôi.
Tính tiện dụng của API
Sự khác biệt về lược đồ là cái giá bạn phải trả khi chuyển đổi nhà cung cấp hoặc định tuyến giữa chúng. Dưới đây là cùng một yêu cầu một lượt trong cả ba dạng.
API Gemini của Google gói các lượt trong contents với parts, và cài đặt tạo sinh nằm trong generationConfig:
{
"contents": [
{ "role": "user", "parts": [{ "text": "Tóm tắt nhật ký thay đổi này." }] }
],
"generationConfig": { "temperature": 0.3, "maxOutputTokens": 1024 }
}
API Messages của Anthropic đặt mô hình và tham số max_tokens bắt buộc ở cấp cao nhất, với lời nhắc hệ thống là một trường riêng:
{
"model": "claude-fable-5",
"max_tokens": 1024,
"system": "Bạn tóm tắt nhật ký thay đổi thành ba gạch đầu dòng.",
"messages": [{ "role": "user", "content": "Tóm tắt nhật ký thay đổi này." }]
}
OpenAI đưa lời nhắc hệ thống vào ngay trong mảng messages:
{
"model": "gpt-5.6-sol",
"messages": [
{ "role": "system", "content": "Bạn tóm tắt nhật ký thay đổi thành ba gạch đầu dòng." },
{ "role": "user", "content": "Tóm tắt nhật ký thay đổi này." }
]
}
Trường hợp văn bản có vẻ đủ gần để có thể giải quyết bằng một bộ chuyển đổi. Sử dụng công cụ là nơi sự trừu tượng bị rò rỉ: Google khai báo các hàm trong một mảng tools với functionDeclarations và kiểm soát việc gọi hàm thông qua toolConfig, Anthropic sử dụng lược đồ công cụ riêng của mình với các khối phản hồi khác nhau, và OpenAI lại có định dạng hàm riêng của mình. Các dạng khối phát trực tuyến cũng khác nhau, mặc dù cả ba đều sử dụng sự kiện do máy chủ gửi (server-sent events). Các cổng và điểm cuối tương thích chuẩn hóa dạng trò chuyện cơ bản, nhưng các phần đa phương thức và lệnh gọi công cụ hiếm khi được dịch sạch sẽ; chúng tôi đã ghi nhận vấn đề tương tự giữa các nhà cung cấp trong bài so sánh định dạng API cho DeepSeek V4 Pro.
Lời khuyên tích hợp không mấy hào nhoáng: giữ một lớp nhà cung cấp mỏng giữa sản phẩm của bạn và mô hình. Các nhóm làm được điều này sẽ chuyển đổi nhà cung cấp trong vài ngày thay vì hàng quý.
Khi nào nên chọn từng loại
Các điểm chuẩn và lược đồ được tóm tắt thành danh sách quyết định:
- Chọn Gemini 3.7 Flash cho lưu lượng tác nhân khối lượng lớn, đường dẫn đa phương thức thu nạp video, âm thanh hoặc PDF, và bất kỳ khối lượng công việc nào mà chi phí mỗi cuộc gọi giới hạn lợi nhuận của sản phẩm. Đây cũng là môi trường thử nghiệm rõ ràng cho các thử nghiệm sử dụng máy tính; phân tích của chúng tôi về sử dụng máy tính so với API có cấu trúc đề cập khi nào khả năng đó phát huy giá trị.
- Chọn Claude Fable 5 cho công việc tự chủ dài hạn: các phiên tác nhân kéo dài nhiều giờ, các tác vụ mà một bước sai lệch có thể làm mất một giờ tiến độ, và các khối lượng công việc đòi hỏi sự cân bằng chi phí-khả năng của tham số nỗ lực.
- Chọn GPT-5.6 Sol cho các tác nhân mã hóa quy mô kho lưu trữ hoạt động trên các cơ sở mã lớn hiện có với sự giám sát tối thiểu, và cho các nhóm muốn có hệ sinh thái bên thứ ba sâu rộng nhất xung quanh API.
- Chọn một bộ định tuyến nếu bạn có thể. Mô hình mà hầu hết các nhóm sản xuất đều hướng tới: một mô hình mặc định giá rẻ xử lý phần lớn lưu lượng, và 10% khó nhất sẽ được chuyển lên một mô hình tiên tiến. Các số liệu ra mắt của Gemini 3.7 Flash làm cho nó trở thành một lựa chọn mặc định đáng tin cậy trong kiến trúc đó, điều mà 3.6 Flash không làm được.
Kiểm tra cả ba nhà cung cấp trong một không gian làm việc Apidog
So sánh quan trọng nhất là so sánh bạn thực hiện trên các lời nhắc của riêng mình. Apidog lưu trữ các bộ sưu tập cho Google, Anthropic và OpenAI trong một dự án duy nhất, vì vậy cuộc thử nghiệm chỉ mất một buổi chiều thay vì một cuộc chạy nước rút:
- Tạo ba môi trường, mỗi môi trường cho một nhà cung cấp, mỗi môi trường mang URL cơ sở và tiêu đề xác thực riêng:
x-goog-api-keycho Gemini,x-api-keycho Anthropic, mã thông báo Bearer cho OpenAI. Việc chuyển đổi nhà cung cấp trở thành một lựa chọn trong menu thả xuống, không phải thay đổi mã. - Thu thập 20 lời nhắc thực tế từ sản phẩm của bạn. Bao gồm lời nhắc hệ thống của bạn, định nghĩa công cụ nếu bạn sử dụng gọi hàm, và ít nhất năm trường hợp khó đã biết.
- Thêm các xác nhận cho những gì bạn quan tâm: tính hợp lệ của phản hồi, số lượng token từ khối sử dụng của mỗi nhà cung cấp, ngưỡng độ trễ. Đối với các khối lượng công việc gọi công cụ, hãy xác nhận rằng JSON gọi công cụ được phân tích cú pháp và khớp với lược đồ của bạn; các mô hình thường thất bại ở đó nhiều hơn so với văn xuôi.
- Chạy mỗi bộ ba lần cho mỗi mô hình. Đầu ra của LLM thay đổi; ba lần chạy sẽ làm lộ rõ sự khác biệt mà một bản demo duy nhất che giấu. So sánh tỷ lệ thành công và chi phí cho mỗi tác vụ thành công.
- Giữ lại bộ thử nghiệm. Các bản phát hành mô hình hiện cách nhau vài tuần; 3.7 Flash ra mắt sau 3.6 ba tuần. Các nhóm có sẵn một bộ công cụ sẽ quyết định lại trong một buổi chiều thay vì bằng giai thoại.
Câu hỏi thường gặp
Gemini 3.7 Flash có tốt hơn Claude hay GPT để mã hóa không?
Không ở mức cao nhất. GPT-5.6 Sol Max đạt 73,0% trên DeepSWE v1.1 so với 65,3% của 3.7 Flash, và Claude Fable 5 dẫn đầu về tính nhất quán trên các điểm chuẩn mã hóa và tác nhân. Điều thay đổi là tỷ lệ giá trên điểm số: 3.7 Flash đạt được các điểm số từng nằm trong vùng tiên phong vài tuần trước trong khi tính phí ở mức mô hình hiệu năng cao.
Gemini 3.7 Flash rẻ hơn Claude hay GPT bao nhiêu?
Đến hết ngày 31 tháng 12 năm 2026, Gemini 3.7 Flash có giá 0,75 đô la cho mỗi 1 triệu token đầu vào và 3,75 đô la cho mỗi 1 triệu token đầu ra. Các mô hình Claude và GPT tiên tiến tính phí cao hơn nhiều lần cho mỗi token; hãy kiểm tra các trang giá trực tiếp trước khi bạn tính toán chi phí. Hãy nhớ rằng giá giới thiệu sẽ tăng gấp đôi vào ngày 1 tháng 1 năm 2027.
Tôi có thể gọi Gemini 3.7 Flash thông qua OpenAI SDK không?
Google cung cấp một điểm cuối tương thích với OpenAI để xử lý dạng trò chuyện cơ bản, vì vậy việc thay đổi base_url sẽ hoạt động cho đầu vào văn bản, đầu ra văn bản. Các phần đa phương thức và lệnh gọi công cụ không được ánh xạ một cách rõ ràng, vì vậy hãy sử dụng lược đồ contents gốc cho bất cứ điều gì ngoài trò chuyện đơn thuần. Hướng dẫn gọi hàm cho Gemini 3.7 Flash trình bày định dạng công cụ gốc từ đầu đến cuối.
Gemini 3.7 Flash có hỗ trợ sử dụng máy tính và tìm kiếm căn cứ không?
Có. Nó được trang bị tính năng gọi hàm (function calling), tìm kiếm như một công cụ (search as a tool), và sử dụng máy tính (computer use), cùng với các rào chắn an toàn CBRN và an ninh mạng được cập nhật. Sự cải thiện của AutomationBench từ 17,0% lên 30,4% là thước đo gần nhất được công bố cho thấy vòng lặp tác nhân đã tốt hơn bao nhiêu.
Gemini 3.7 Flash có sẵn ở đâu?
API Gemini với khóa AI Studio, Google AI Studio, ứng dụng Gemini, Gemini Spark cho người đăng ký AI Pro và Ultra, Google Antigravity, Android Studio và Gemini Enterprise, trên hơn 160 quốc gia. Các nhóm GCP sản xuất có thể gọi nó thông qua Vertex AI bằng OAuth thay vì khóa API.
3.7 Flash phù hợp ở đâu trong ngăn xếp của bạn
Điều rút ra sai lầm từ bài so sánh này là “Gemini đã bắt kịp các mô hình tiên tiến”. Thực tế không phải vậy; Sol vẫn sở hữu chiều sâu mã hóa quy mô kho lưu trữ và Fable 5 vẫn sở hữu độ tin cậy dài hạn. Điều rút ra đúng đắn là mặt bằng đã thay đổi: giá của mô hình hiệu năng cao giờ đây có thể mang lại điểm số mà cách đây một quý chỉ có giá cao cấp mới đạt được, điều này thiết lập lại mặc định trong bất kỳ kiến trúc định tuyến nào. Các mô hình Flash-class xử lý phần lớn công việc, các mô hình chủ lực xử lý các trường hợp leo thang.
Quyết định có thể đo lường được, vì vậy hãy đo lường nó. Kết nối cả ba nhà cung cấp vào một không gian làm việc, chạy các lời nhắc thực tế của bạn với các xác nhận, và để chi phí cho mỗi tác vụ hoàn thành chọn ra người thắng cuộc. Tải xuống Apidog miễn phí, thiết lập ba môi trường, và bạn sẽ có bằng chứng cấp nhà cung cấp trước khi cửa sổ giá giới thiệu đóng lại.

