Ba API tiên phong đã được phát hành hoặc điều chỉnh giá trong vòng một tuần, và chúng nằm trong ba phân khúc giá khác nhau. Google đã phát hành Gemini 3.8 Flash vào ngày 2 tháng 9 năm 2026 với giá 0,75 đô la cho mỗi triệu token đầu vào và 3,75 đô la cho mỗi triệu token đầu ra. Anthropic đã phát hành Claude Fable 5.1 một ngày trước đó với giá 10 đô la và 50 đô la. GPT-5.6 Sol của OpenAI nằm giữa chúng với giá 5 đô la và 30 đô la. Trên chỉ số Intelligence Index độc lập của Artificial Analysis, ba mẫu này đạt điểm 59, 57 và 59. Đó là toàn bộ so sánh trong một câu: một mô hình có giá khoảng một phần mười ba so với phân khúc cao cấp đang đạt điểm ngang bằng với nó trên một chỉ số kiểm tra cả ba theo cùng một cách.
Vấn đề nằm ở từ “chỉ số”. Các bài kiểm tra hiệu năng đếm số câu trả lời trên mỗi tác vụ. Hóa đơn của bạn đếm số token trên mỗi tác vụ, và Gemini 3.8 Flash được xây dựng để tiêu tốn nhiều token hơn. Hướng dẫn này so sánh ba mẫu này về thông số kỹ thuật, trên các bảng kiểm tra hiệu năng của Google (nơi Fable 5.1 bị thiếu, và chúng tôi sẽ giải thích lý do), trên các số liệu độc lập của Artificial Analysis, và về phép tính giá. Sau đó, nó đưa ra một quy tắc đơn giản về việc API nào phù hợp với khối lượng công việc nào. Bài viết chuyên sâu về Gemini 3.8 Flash trình bày về mô hình này theo cách riêng của nó, và bài đăng ra mắt của Google là nguồn chính cho mọi tuyên bố của Google dưới đây.
Một lưu ý về thời gian. Bài so sánh Gemini 3.7 Flash vs Claude vs GPT của chúng tôi từ tháng 8 đã so sánh với Claude Fable 5, chứ không phải 5.1. Anthropic đã thay thế mô hình đó vào ngày 1 tháng 9, vì vậy đây là một sự kết hợp mới, chứ không phải là cập nhật.
Thông số kỹ thuật tổng quan
| Gemini 3.8 Flash | Claude Fable 5.1 | GPT-5.6 Sol | |
|---|---|---|---|
| Nhà cung cấp | Anthropic | OpenAI | |
| Cửa sổ ngữ cảnh | 1,048,576 token | 1M token | 1M token |
| Đầu ra tối đa | 65,536 token | 128K token | 128K token |
| Giá đầu vào (mỗi 1 triệu) | 0,75 đô la giới thiệu, 1,50 đô la từ ngày 1 tháng 1 năm 2027 | 10 đô la | 5 đô la |
| Giá đầu ra (mỗi 1 triệu) | 3,75 đô la giới thiệu, 7,50 đô la từ ngày 1 tháng 1 năm 2027 | 50 đô la | 30 đô la |
| Đọc bộ nhớ đệm (mỗi 1 triệu) | 0,075 đô la giới thiệu, 0,15 đô la từ ngày 1 tháng 1 | 0,25 đô la | 0,50 đô la |
| Cắt giảm kiến thức | Tháng 3 năm 2026 | Tháng 6 năm 2026 | Không được liệt kê ở đây |
| Kiểm soát suy luận | thinking_level thấp / trung bình / cao (trung bình là mặc định) |
Suy luận mở rộng, luôn bật | Mức độ nỗ lực lên đến xhigh |
| Chỉ số Artificial Analysis | 59 (cao) | 57 (trung bình) | 59 (xhigh) |
Hai điều nổi bật trước bất kỳ bài kiểm tra hiệu năng nào. Gemini 3.8 Flash có dung lượng đầu ra tối đa bằng một nửa so với hai mẫu còn lại, 65.536 token so với 128K, điều này quan trọng hơn đối với các tài liệu dài một lần chạy hơn là các vòng lặp tác tử phát ra các bước ngắn. Và giá giới thiệu của nó hết hạn vào ngày 31 tháng 12 năm 2026: từ ngày 1 tháng 1, cả hai mức giá Gemini đều tăng gấp đôi, điều này làm thay đổi mọi tỷ lệ trong bài viết này. Hướng dẫn định giá Gemini 3.8 Flash trình bày chi tiết về việc tăng gấp đôi, bộ nhớ đệm, xử lý hàng loạt và tỷ lệ nền tảng.
Con số độc lập: 59, 57, 59
Artificial Analysis chạy cùng chín đánh giá trên mọi mô hình và công bố một điểm số Intelligence Index. Gemini 3.8 Flash ở cấp độ suy luận cao đạt 59 điểm, tăng từ 56 điểm cho 3.7 Flash và 52 điểm cho 3.6 Flash. GPT-5.6 Sol ở mức nỗ lực xhigh cũng đạt 59 điểm. Claude Fable 5.1 ở mức nỗ lực trung bình đạt 57 điểm, bằng với GPT-5.6 Terra ở mức tối đa và Muse Spark 1.2 ở mức xhigh. Grok 4.6 ở mức trung bình là mô hình còn lại đạt 59 điểm.
Hãy đọc các nhãn cấp độ suy luận trước khi đọc các con số. Fable 5.1 được thử nghiệm ở mức trung bình, không phải cài đặt cao nhất của nó, và Sol ở mức xhigh, cài đặt cao nhất của nó. Khoảng cách hai điểm ở các mức độ nỗ lực khác nhau không phải là một xếp hạng, và Artificial Analysis liệt kê như vậy có lý do. Tuyên bố có thể bảo vệ được hẹp hơn: ở các cài đặt đã thử nghiệm, Gemini 3.8 Flash ngang bằng với hai mô hình cao cấp trên chỉ số này, và nó là mô hình rẻ nhất ở mức 59 với một khoảng cách lớn.
Cùng bài viết đó đã đo lường chi phí của điểm số đó. Gemini 3.8 Flash ở mức cao đã sử dụng trung bình 48.000 token đầu ra mỗi tác vụ, nhiều hơn 30 phần trăm so với 3.7 Flash, và chi phí API là 0,58 đô la mỗi tác vụ. Thời gian cho mỗi tác vụ là 2,5 phút, tốc độ đầu ra khoảng 300 token mỗi giây, và thời gian đến token đầu tiên là 13,3 giây trên lần chạy suy luận cao vì mô hình suy nghĩ trước khi viết. Trên τ³-Banking, đánh giá sử dụng công cụ, nó đạt 45 phần trăm, cao hơn 12 điểm so với 3.7 Flash. Hãy ghi nhớ những con số đó khi giá mỗi token có vẻ quá tốt.
Các bảng kiểm tra hiệu năng của Google và những gì còn thiếu
Trang Flash của Google công bố ba hàng so sánh giữa các nhà cung cấp dưới dạng văn bản. Claude Fable 5.1 không có trong đó. Các bảng của Google thay vào đó hiển thị Opus 5 và Sonnet 5 của Anthropic, và Fable 5.1 mới được công bố một ngày khi các bảng này được đưa lên. Vì vậy, cột Anthropic dưới đây là Opus 5 (5 đô la / 25 đô la) và Sonnet 5 (2 đô la / 10 đô la), không phải mô hình 10 đô la / 50 đô la mà bài viết này đang nói đến. Hãy coi đó là phương tiện đại diện tốt nhất có sẵn, không phải là sự đối chiếu trực tiếp.
| Điểm chuẩn (Google thực hiện) | Gemini 3.8 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|
| HLE-Verified | 54.9% | 54.4% | 31.0% | 54.5% | 51.1% |
| Vals Finance Agent v2 | 61.4% | 58.6% | 53.9% | 53.8% | 54.4% |
| Harvey Legal Agent Benchmark | 10.0% | 6.7% | 5.0% | 2.5% | 0.8% |
HLE-Verified là một trận hòa ba chiều: 54.9, 54.4 và 54.5 nằm trong khoảng nửa điểm so với nhau, với Sonnet 5 tụt lại khá xa. Vals Finance Agent v2 là nơi 3.8 Flash vượt lên, 2.8 điểm so với Opus 5 và 7.6 điểm so với Sol trên một tác vụ tài chính tác tử đa bước. Harvey Legal là trường hợp đặc biệt: mọi mô hình đều đạt dưới 11 phần trăm, vì vậy thứ tự quan trọng hơn khoảng cách.
Những gì Google không công bố dưới dạng văn bản cũng quan trọng không kém. Không có số liệu SWE-Bench Pro, Terminal-bench hoặc OSWorld cho 3.8 Flash, và kết quả DeepSWE v1.1 chỉ xuất hiện dưới dạng tuyên bố rằng mô hình "vượt trội hơn hầu hết các mô hình tiên phong lớn hơn" với "một phần nhỏ chi phí", với con số trong một bảng hình ảnh, không phải văn bản. Để so sánh về mã hóa và sử dụng máy tính, bạn phải xem các thử nghiệm riêng của từng nhà cung cấp, chúng không trùng lặp. Các của Anthropic có trong phân tích điểm chuẩn Claude Fable 5.1; của OpenAI có trong điểm chuẩn GPT-5.6 Sol. Không nhà cung cấp nào chạy mô hình của đối thủ, vì vậy Artificial Analysis vẫn là nguồn so sánh trực tiếp duy nhất.
Khoảng cách giá, từng dòng
Với mức giá giới thiệu, phép tính rất đơn giản. Đầu vào 10 đô la của Fable 5.1 gấp 13,3 lần 0,75 đô la của Gemini 3.8 Flash, và đầu ra 50 đô la của nó gấp 13,3 lần 3,75 đô la. Đầu vào 5 đô la của GPT-5.6 Sol gấp 6,7 lần, và đầu ra 30 đô la của nó gấp 8 lần. Đọc bộ nhớ đệm thu hẹp khoảng cách: 0,075 đô la trên 3.8 Flash, 0,25 đô la trên Fable 5.1 (3,3 lần), và 0,50 đô la trên Sol (6,7 lần). Đọc bộ nhớ đệm của Fable 5.1 bằng một nửa của Sol, đây là trường hợp duy nhất mà mô hình đắt nhất không phải là đắt nhất.
Một ví dụ minh họa làm cho nó cụ thể. Hãy lấy một lần chạy tiêu thụ 1 triệu token đầu vào và 200.000 token đầu ra, tất cả đều không được lưu vào bộ nhớ đệm.
- Gemini 3.8 Flash: 0,75 đô la + 0,75 đô la = 1,50 đô la
- GPT-5.6 Sol: 5,00 đô la + 6,00 đô la = 11,00 đô la
- Claude Fable 5.1: 10,00 đô la + 10,00 đô la = 20,00 đô la
Từ ngày 1 tháng 1 năm 2027, cùng một lần chạy Gemini đó có giá 3,00 đô la, và khoảng cách rút ngắn xuống còn 3,7 lần đối với Sol và 6,7 lần đối với Fable 5.1. Việc tăng gấp đôi cũng áp dụng cho 3.6 Flash và 3.7 Flash, vì vậy không có Gemini Flash rẻ hơn để chuyển sang. Trang định giá của Anthropic liệt kê các mức giá của Fable 5.1, và hướng dẫn định giá Claude Fable 5.1 của chúng tôi và hướng dẫn định giá GPT-5.6 bao gồm các cấp độ xử lý hàng loạt và bộ nhớ đệm cho từng loại.
Chi phí mỗi tác vụ, không phải mỗi token
Đây là lưu ý làm mất đi phiên bản đơn giản của phép tính đó. Google cho biết Gemini 3.8 Flash "có thể sử dụng nhiều token hơn cho các tác vụ phức tạp và chạy lâu hơn, theo thiết kế". Với các vấn đề khó, nó thực hiện các bước suy luận nhỏ hơn, kiểm tra công việc của mình và gọi các công cụ lặp đi lặp lại. Artificial Analysis đã đo lường hiệu ứng: 48.000 token đầu ra mỗi tác vụ ở mức cao, tăng 30 phần trăm so với 3.7 Flash, vì vậy chi phí để chạy chỉ số của nó đã tăng từ 0,40 đô la mỗi tác vụ trên 3.7 Flash lên 0,58 đô la trên 3.8 Flash với giá mỗi token không đổi. Ở mức trung bình là 0,41 đô la mỗi tác vụ và ở mức thấp là 0,24 đô la.
Hai hệ quả sau đây. Đầu tiên, khoảng cách 13,3 lần mỗi token không phải là khoảng cách hóa đơn 13,3 lần nếu mô hình cao cấp hoàn thành với ít token hơn hoặc ít lượt sử dụng công cụ hơn. Artificial Analysis chưa công bố số liệu mỗi tác vụ tương đương cho Fable 5.1 hoặc Sol trong văn bản chúng tôi có, vì vậy hãy tự đo lường trên các lời nhắc của riêng bạn trước khi tin tưởng vào bất kỳ hướng nào của hệ số nhân. Thứ hai, trên Gemini, cấp độ suy luận là đòn bẩy chi phí. Việc giảm một tuyến đường từ cao xuống thấp đã cắt giảm chi phí mỗi tác vụ hơn một nửa trên bộ dữ liệu của Artificial Analysis, và hướng dẫn các cấp độ suy luận cho thấy cách đặt nó cho mỗi điểm cuối. So sánh 3.8 Flash vs 3.7 Flash đề cập đến trường hợp mô hình cũ hơn, với chi phí mỗi tác vụ thấp hơn 31 phần trăm, vẫn là lựa chọn tốt hơn.
Khi nào nên chọn từng loại
Chọn Gemini 3.8 Flash cho khối lượng lớn và tác tử với chi phí hợp lý
Nếu bạn chạy hàng nghìn tác vụ tác tử mỗi ngày, 3.8 Flash là lựa chọn mặc định. Nó sánh ngang với các mô hình cao cấp trên chỉ số độc lập, dẫn đầu các hàng tác tử tài chính và pháp lý của Google, và chi phí mỗi token chỉ là một phần nhỏ ngay cả sau khi tăng gấp đôi vào tháng 1. Nó cũng chấp nhận đầu vào video, âm thanh và PDF một cách tự nhiên, cung cấp Batch giảm giá 50 phần trăm, bao gồm 5.000 yêu cầu nền tảng Google Search miễn phí mỗi tháng, và có một cấp độ miễn phí để tạo mẫu. Những đánh đổi: đầu ra chỉ là văn bản, không có Live API, giới hạn đầu ra 65.536 token, và một lượng token tiêu thụ bạn nên dự trù ở mức trung bình hoặc cao.
Chọn Claude Fable 5.1 cho suy luận khó nhất với tầm nhìn dài hạn
Fable 5.1 là mô hình để nâng cấp lên, không phải để bắt đầu. Trường hợp của nó là công việc mà một câu trả lời sai tốn kém hơn cả token: các tác tử nghiên cứu kéo dài nhiều giờ, các phiên terminal dài, các chuỗi suy luận mà các đánh giá của một mô hình rẻ hơn không đạt yêu cầu. Đầu ra 128K và mức đọc bộ nhớ đệm 0,25 đô la của nó phù hợp với các vòng lặp tác tử nặng tiền tố tái sử dụng cùng một ngữ cảnh lớn trong mỗi lượt; trên những trường hợp đó, dòng bộ nhớ đệm làm cho hệ số nhân hiệu quả nhỏ hơn nhiều so với 13,3 lần. Xem Claude Fable 5.1 là gì để biết bảng thông số kỹ thuật riêng của mô hình.
Chọn GPT-5.6 Sol cho các lần chạy tác tử trong hệ sinh thái OpenAI
Sol đạt 59 điểm ở mức xhigh, ngang bằng với 3.8 Flash trên HLE-Verified, và đi kèm với đầu ra 128K với giá 5 đô la / 30 đô la. Nếu các tác tử, đánh giá và công cụ của bạn đã nằm trong ngăn xếp của OpenAI, Sol là cấp độ cao cấp không yêu cầu nhà cung cấp thứ hai. Nó có chi phí đọc bộ nhớ đệm đắt nhất trong ba loại, vì vậy nó phù hợp hơn với các lần chạy ngữ cảnh mới hơn là các phiên được lưu vào bộ nhớ đệm dài. Bài so sánh Grok 4.6 vs GPT-5.6 vs Claude Fable 5 cho thấy Sol đã thể hiện như thế nào so với flagship trước đây của Anthropic.
Thử nghiệm cả ba trong một không gian làm việc Apidog
Mọi lập luận trên đều kết thúc theo cùng một cách: hãy tự đo lường nó trên các lời nhắc của riêng bạn. Apidog là một ứng dụng khách API và nền tảng thử nghiệm, vì vậy nó không chạy bất kỳ mô hình nào trong số này, nhưng đó là một cách nhanh chóng để gửi cùng một yêu cầu đến cả ba nhà cung cấp và so sánh kết quả trả về.
Cài đặt bao gồm một dự án với ba môi trường. Mỗi môi trường chứa một URL cơ sở và một biến khóa: https://generativelanguage.googleapis.com với GEMINI_API_KEY, URL cơ sở của Anthropic với khóa Claude của bạn, và URL cơ sở của OpenAI với khóa OpenAI của bạn. Các khóa nằm trong biến môi trường, không bao giờ trong phần thân yêu cầu hoặc bộ sưu tập được chia sẻ.
Sau đó, xây dựng một kịch bản thử nghiệm với ba bước yêu cầu mang cùng một lời nhắc. Bước Gemini gửi yêu cầu POST đến /v1beta/interactions với "model": "gemini-3.8-flash" và "thinking_level": "medium"; hai bước còn lại gửi đến điểm cuối trò chuyện hoặc tin nhắn của nhà cung cấp của họ. Trên mỗi bước, hãy thêm các xác nhận quan trọng cho việc so sánh: HTTP 200, một đường dẫn JSON xác nhận câu trả lời có mặt, và một giới hạn trên trường sử dụng token để một lần chạy đột nhiên tiêu tốn gấp đôi số token suy nghĩ sẽ thất bại rõ ràng. Trên Gemini, trường đó là usageMetadata.thoughtsTokenCount cho điểm cuối cũ; hãy xác nhận trên khối sử dụng tương đương cho hai loại còn lại.
Chạy kịch bản chống lại một bộ lời nhắc vàng, sau đó lên lịch để nó chạy hàng ngày. Khi nhà cung cấp thay đổi mặc định hoặc một mô hình bắt đầu tiêu tốn nhiều token hơn, xác nhận thất bại sẽ cho bạn biết trước khi hóa đơn được gửi. Hướng dẫn thử nghiệm API tác tử AI bao gồm phiên bản đa lượt của mẫu này, và lên lịch kiểm thử API trong Apidog bao gồm việc chạy định kỳ. Tải xuống Apidog để thiết lập ba môi trường.
Câu hỏi thường gặp
Gemini 3.8 Flash có tốt hơn Claude Fable 5.1 không?
Trên chỉ số của Artificial Analysis, 3.8 Flash ở mức cao đạt 59 điểm và Fable 5.1 ở mức trung bình đạt 57 điểm, vì vậy chúng gần bằng nhau ở các cài đặt đã thử nghiệm. Các bảng của Google không bao gồm Fable 5.1, và các điểm chuẩn của Anthropic không bao gồm 3.8 Flash, vì vậy không có cuộc đối đầu trực tiếp rộng hơn. Mỗi token, Flash rẻ hơn 13,3 lần ở mức giá giới thiệu.
Trong ba loại, loại nào rẻ nhất cho khối lượng công việc tác tử?
Gemini 3.8 Flash rẻ hơn rất nhiều mỗi token, với giá 0,75 đô la / 3,75 đô la cho đến ngày 31 tháng 12 năm 2026. Mỗi tác vụ, Artificial Analysis đo được 0,58 đô la ở mức cao, 0,41 đô la ở mức trung bình và 0,24 đô la ở mức thấp, vì mô hình tiêu tốn khoảng 30 phần trăm token đầu ra nhiều hơn 3.7 Flash. Hãy đo lường chi phí mỗi tác vụ hoàn thành, không phải mỗi token, trước khi cam kết.
Cả ba có cửa sổ ngữ cảnh 1 triệu không?
Có. Gemini 3.8 Flash chấp nhận 1.048.576 token đầu vào, và Fable 5.1 cùng GPT-5.6 Sol đều liệt kê 1 triệu. Đầu ra tối đa khác nhau: 65.536 token trên 3.8 Flash so với 128K trên hai loại còn lại.
Tại sao Claude Fable 5.1 không có trong các bảng kiểm tra hiệu năng của Google?
Các hàng được Google công bố liệt kê Claude Opus 5 và Claude Sonnet 5 là các mục của Anthropic. Fable 5.1 được phát hành vào ngày 1 tháng 9, một ngày trước 3.8 Flash, vì vậy nó không được bao gồm. Để biết số liệu do Anthropic tự chạy của Fable 5.1, hãy xem so sánh Claude Fable 5.1 vs Opus 5.
Lợi thế giá của Gemini có tồn tại sau năm 2027 không?
Một phần. Từ ngày 1 tháng 1 năm 2027, Gemini 3.8 Flash chuyển sang mức giá 1,50 đô la / 7,50 đô la, điều này khiến Fable 5.1 gấp 6,7 lần trên cả hai dòng và Sol gấp 3,3 lần về đầu vào và 4 lần về đầu ra. Vẫn rẻ hơn, nhưng khoảng cách chỉ còn một nửa.
Nên gọi cái nào trước
Bắt đầu với Gemini 3.8 Flash cho bất kỳ tác vụ nào bạn chạy với khối lượng lớn, đặt thinking_level cho mỗi tuyến, và theo dõi token mỗi tác vụ, chứ không phải giá niêm yết. Nâng cấp lên Claude Fable 5.1 khi các đánh giá của bạn trên các mô hình rẻ hơn không đạt yêu cầu và ngữ cảnh được lưu vào bộ nhớ đệm qua các lượt. Sử dụng GPT-5.6 Sol khi phần còn lại của ngăn xếp của bạn là OpenAI và bạn muốn một cấp độ cao cấp mà không cần nhà cung cấp thứ hai. Dù bạn chọn loại nào, hãy chạy cùng một lời nhắc qua cả ba trong một kịch bản thử nghiệm trước; tỷ lệ giá là công khai, nhưng tỷ lệ chi phí mỗi tác vụ trên các lời nhắc của bạn là do bạn tự đo lường.
