Google merilis Gemini 3.8 Flash pada 2 September 2026, tiga minggu setelah Gemini 3.7 Flash dan enam minggu setelah 3.6 Flash. Harga perkenalan yang sama (masukan $0,75, keluaran $3,75 per juta token hingga 31 Desember), konteks 1 juta token yang sama, dan, menurut kerangka kerja Google sendiri, kecepatan yang kurang lebih sama. Yang berubah adalah cara model bekerja: ia mengambil langkah penalaran yang lebih kecil, memverifikasi keluarannya sendiri, dan memanggil alat secara berulang. Ini membuatnya mendapatkan skor lebih tinggi pada setiap tolok ukur yang dipublikasikan. Ini juga membuat setiap tugas memakan lebih banyak token.
Jadi, pertanyaan peningkatan bukanlah "apakah 3.8 Flash lebih baik?". Di atas kertas, memang begitu. Pertanyaannya adalah apakah kualitas ekstra sepadan dengan token ekstra pada beban kerja Anda, dan apakah dua perubahan yang bersifat merusak memengaruhi kode Anda. Perbandingan ini membahas apa yang tetap sama, apa yang meningkat, berapa biayanya bagi Anda, dan matriks keputusan berdasarkan beban kerja. Sumbernya adalah postingan peluncuran Google, halaman Apa yang baru di Gemini 3.8 Flash, dan pengujian independen dari Artificial Analysis. Untuk lembar spesifikasi lengkap, mulailah dengan apa itu Gemini 3.8 Flash.
Satu hal lagi di awal: Google mengatakan "Gemini 3.7 Flash tetap didukung penuh" dan belum menerbitkan tanggal penghentian. Tidak ada yang memaksa Anda.
Perbandingan
| Gemini 3.8 Flash | Gemini 3.7 Flash | |
|---|---|---|
| ID Model | gemini-3.8-flash |
gemini-3.7-flash |
| Dirilis | 2 September 2026 | 13 Agustus 2026 |
| Dasar | “Berdasarkan Gemini 3.7 Flash” (kartu model) | t/a |
| Konteks / keluaran maks | 1.048.576 / 65.536 token | Sama |
| Harga masukan (perkenalan, hingga 31 Des) | $0,75 per juta | $0,75 per juta |
| Harga keluaran (perkenalan, hingga 31 Des) | $3,75 per juta, termasuk pemikiran | $3,75 per juta, termasuk pemikiran |
| Harga standar (mulai 1 Jan 2027) | $1,50 / $7,50 | $1,50 / $7,50 |
| Pembacaan cache konteks | $0,075 per juta (perkenalan) | Sama |
| Batch | Diskon 50%, tingkatan token antrean yang sama | Sama |
| Tingkat pemikiran | low, medium (default), high |
low, medium, high |
Tingkat pemikiran minimal |
Kesalahan validasi | Diterima (catatan migrasi Google: petakan ke low) |
| Batas pengetahuan | Maret 2026 | Tidak disebutkan lagi di dokumen 3.8 |
| Kecepatan keluaran (Artificial Analysis) | ~300 token/detik (302,1 terukur, tinggi) | “Kecepatan kurang lebih sama” menurut Google |
| Indeks Kecerdasan Artificial Analysis | 59 (tinggi) | 56 (tinggi) |
| Status dukungan | Saat ini | “Tetap didukung penuh”, tanpa tanggal penghentian |
Apa yang identik
Harga, pertama. Kedua model berada pada baris yang sama di halaman harga Google: $0,75 untuk masukan dan $3,75 untuk keluaran hingga 31 Desember, berlipat ganda menjadi $1,50 dan $7,50 pada 1 Januari 2027. Caching, diskon batch, dan 5.000 permintaan grounding Google Search gratis per bulan (dibagikan di setiap model Gemini 3.x) semuanya tetap berlaku. Jika Anda menginginkan rincian per baris, referensi spesifikasi dan harga 3.7 Flash masih berlaku untuk 3.8 Flash secara baris per baris.
Batas konteks dan keluaran tidak berubah yaitu 1.048.576 token masukan dan 65.536 token keluaran. Modalitasnya juga sama: teks, gambar, video, audio, dan PDF sebagai masukan; teks sebagai keluaran. Tidak ada model yang melakukan pembuatan audio, pembuatan gambar, atau Live API.
Kecepatan hampir seri. Logan Kilpatrick dari Google menjelaskan 3.8 Flash sebagai "harga yang sama dengan 3.7, kecepatannya kurang lebih sama." Artificial Analysis mengukur 302,1 token keluaran per detik pada uji coba penalaran tingginya. Itu adalah throughput setelah model mulai menulis; waktu hingga token pertama pada uji coba yang sama adalah 13,30 detik, karena pada tingkat high model berpikir sebelum berbicara.
Permukaan API juga sama. Interactions API adalah jalur utama Google untuk Gemini 3.x sekarang, dan titik akhir generateContent lama "tetap didukung penuh" tanpa tanggal penghentian. Kode yang ditulis untuk 3.7 Flash pada salah satu titik akhir berjalan melawan gemini-3.8-flash setelah pertukaran string model, dengan pengecualian yang tercakup dalam perubahan yang bersifat merusak.
Apa yang meningkat
Judul utama Google untuk 3.8 Flash adalah "model Flash kami yang paling cerdas," dibangun untuk "rekayasa perangkat lunak berjangka panjang, agen otonom, dan alur kerja perusahaan yang kompleks." Perubahan desain di balik klaim tersebut: pada tugas-tugas yang sulit, model "menjalankan langkah-langkah penalaran tambahan, dan memanggil alat secara berulang," mengambil "langkah-langkah penalaran yang lebih kecil" dan memverifikasi "pekerjaannya sepanjang jalan." Berikut adalah apa yang dihasilkannya pada tolok ukur yang telah diterbitkan Google dan Artificial Analysis dalam bentuk teks.
Tabel Google sendiri. Google menerbitkan tiga perbandingan numerik terhadap 3.7 Flash di halaman DeepMind Flash. Ini adalah hasil uji vendor.
| Tolok Ukur (Uji Google) | 3.8 Flash | 3.7 Flash | Delta |
|---|---|---|---|
| Agen Keuangan Vals v2 | 61,4% | 59,0% | +2.4 |
| HLE-Terverifikasi | 54,9% | 53,6% | +1.3 |
| Tolok Ukur Agen Hukum Harvey | 10,0% | 8,8% | +1.2 |
Peningkatan yang moderat dan konsisten, dan di setiap baris 3.8 Flash juga mengungguli model yang lebih besar dalam tabel Google (Claude Opus 5 sebesar 58,6% pada Vals Finance, 54,4% pada HLE-Verified); perbandingan tiga arah dengan Claude Fable 5.1 dan GPT-5.6 Sol membawa alur ini lebih jauh. Itu adalah model berharga Flash yang mengungguli model yang harganya beberapa kali lipat lebih mahal per token, itulah poin yang ingin disampaikan Google kepada Anda.
Artificial Analysis, secara independen. Ulasan Artificial Analysis menempatkan 3.8 Flash pada 59 di Indeks Kecerdasannya pada tingkat high, naik dari 56 untuk 3.7 Flash dan 52 untuk 3.6 Flash. Itu adalah tiga poin per rilis, dan itu menyamai 3.8 Flash dengan GPT-5.6 Sol pada xhigh dan Grok 4.6 pada medium, satu poin di atas Claude Fable 5.1 pada medium. Pada τ³-Banking, evaluasi penggunaan alatnya, 3.8 Flash mencetak 45%, lonjakan 12 poin dibandingkan 3.7 Flash. Jika Anda menjalankan agen dengan panggilan alat sungguhan, baris itu lebih penting daripada indeks.
Pekerjaan agen yang padat dokumen. Google mengatakan 3.8 Flash "menyelesaikan lebih dari tiga kali lipat tugas dibandingkan Gemini 3.7 Flash" pada alur kerja yang berjalan lama dan padat dokumen. Evaluasi internal, tidak ada alat uji publik, jadi anggaplah itu sebagai arahan. Namun, ini sesuai dengan desain model: lebih banyak langkah verifikasi paling membantu di mana satu kesalahan dapat menggagalkan pekerjaan 40 langkah.
Pengkodean, dengan celah dalam catatan. Pada DeepSWE v1.1, 3.7 Flash mencetak 65,3%, naik dari 49,0% pada 3.6 Flash. Google mengatakan 3.8 Flash "mengungguli sebagian besar model frontier yang lebih besar" dengan "sebagian kecil biaya," tetapi persentase pasti 3.8 hanya muncul di tabel gambar kartu model, bukan dalam teks, jadi kami tidak akan mencetak angka. Angka SWE-Bench Pro, Terminal-bench, dan OSWorld untuk 3.8 Flash tidak dipublikasikan dalam teks sama sekali. Jika tolok ukur tersebut mendorong keputusan Anda, tunggu uji coba pihak ketiga.
Keamanan dan resistensi injeksi. Google melaporkan "lompatan signifikan" pada pengujian injeksi prompt Gray Swan tanpa angka. Kartu model menunjukkan perbedaan kecil versus 3.7 Flash: keamanan multibahasa +5,4 poin, keamanan teks-ke-teks -0,4, penolakan tidak beralasan +1,1. Bacalah yang terakhir itu sebagai sedikit peningkatan dalam penolakan berlebihan.
Berapa biayanya bagi Anda
Harga per token tidak berubah. Biaya per tugas yang berubah. Ini adalah pertukaran yang secara terbuka dinyatakan Google: model "dapat menggunakan lebih banyak token pada tugas yang berjalan lebih lama dan kompleks, berdasarkan desain," dan "mungkin menggunakan lebih banyak token untuk memaksimalkan kinerja, terutama pada tingkat usaha yang lebih tinggi."
Artificial Analysis mengkuantifikasinya. Menjalankan indeksnya, 3.8 Flash rata-rata menghasilkan 48.000 token keluaran per tugas, 30% lebih banyak dari 3.7 Flash. Dengan harga per token yang identik, itu berubah menjadi tagihan yang lebih tinggi per tugas yang diselesaikan:
| Konfigurasi (Artificial Analysis) | Biaya per tugas | Waktu per tugas |
|---|---|---|
Gemini 3.7 Flash, high |
$0,40 | 2,2 menit |
Gemini 3.8 Flash, low |
$0,24 | 0,8 menit |
Gemini 3.8 Flash, medium |
$0,41 | tidak diterbitkan |
Gemini 3.8 Flash, high |
$0,58 | 2,5 menit |
Tiga hal yang dapat disimpulkan dari tabel tersebut. Pertama, 3.8 Flash pada tingkat high biayanya sekitar 45% lebih mahal per tugas dibandingkan 3.7 Flash pada tingkat high, dan memakan waktu 14% lebih lama. Kedua, 3.8 Flash pada tingkat medium, yang merupakan default, berada dalam selisih satu sen dari 3.7 Flash pada tingkat high, sehingga peningkatan "anggaran yang sama" tersedia jika kualitas medium memenuhi standar Anda. Ketiga, 3.8 Flash pada tingkat low adalah baris termurah dan tercepat di tabel, yang menjadikannya pilihan yang jelas untuk rute yang sensitif terhadap latensi di mana 3.7 Flash sebelumnya berjalan pada tingkat high karena kebiasaan.
Rincian harga 3.8 Flash mengintegrasikan hal ini ke dalam volume harian. Versi singkatnya: jika Anda membayar per tugas, peningkatannya tidak gratis, dan tingkat pemikiran adalah tombol yang Anda gunakan untuk memutuskan seberapa besar peningkatan yang Anda dapatkan.
Perubahan yang bersifat merusak secara singkat
Dua perubahan langsung memengaruhi kode 3.7 Flash yang sudah ada.
thinking_level: "minimal" mengembalikan kesalahan validasi. 3.8 Flash hanya menerima low, medium, dan high. Jika konfigurasi 3.7 menggunakan minimal, petakan ke low. Panduan tingkat pemikiran mencakup apa yang dilakukan setiap tingkat serta biaya dan latensi masing-masing.
Respons fungsi harus menyertakan call_id dan name. Setiap function_result pada Interactions API membutuhkan kedua bidang ini, dan setiap functionResponse pada generateContent lama membutuhkan id yang cocok ditambah name. Kode yang mengembalikan hasil hanya dengan kunci nama akan gagal pada giliran kedua dari perulangan alat.
Selain itu, panduan migrasi 3.7 ke 3.8 Flash membahas aturan Gemini 3 yang patut diperiksa kembali saat bermigrasi: pertahankan temperature pada default 1.0 (Google memperingatkan nilai yang lebih rendah "dapat menyebabkan perulangan atau penurunan kinerja"), gunakan thinking_level alih-alih integer thinking_budget, hilangkan candidate_count, dan teruskan tanda tangan pemikiran kembali persis seperti yang diterima. Tidak ada di antaranya yang baru untuk 3.8, tetapi basis kode 3.7 yang melewatkannya akan menampilkan masalah sekarang.
Matriks keputusan berdasarkan beban kerja
| Beban Kerja | Rekomendasi | Mengapa |
|---|---|---|
| Agen multi-langkah dengan panggilan alat | Tingkatkan, medium atau high |
+12 pada τ³-Banking; perulangan alat iteratif adalah inti dari 3.8 |
| Ekstraksi dan tinjauan dokumen panjang | Tingkatkan | Klaim Google tentang penyelesaian tugas 3x menargetkan bentuk ini |
| Pengkodean agen dalam alat uji | Tingkatkan, lalu ukur | Angka teks DeepSWE tidak dipublikasikan; verifikasi di repo Anda sebelum berkomitmen |
| Agen keuangan, hukum, dan penelitian | Tingkatkan | Ketiga tabel Google yang dipublikasikan semuanya menguntungkan 3.8 |
| Klasifikasi, ekstraksi, obrolan volume tinggi | Tetap pada 3.7, atau 3.8 pada low |
Biaya per tugas adalah metrik di sini; low lebih murah daripada 3.7 pada high |
| Titik akhir yang sensitif terhadap latensi dan menghadap pengguna | 3.8 pada low |
0,8 menit per tugas pada alat uji AA dibandingkan 2,2 untuk 3.7 pada high |
Apa pun yang menggunakan pemikiran minimal |
Migrasi terlebih dahulu | Kesalahan validasi sampai Anda memetakannya ke low |
| Pipeline batch dengan harga hingga sen terakhir | Tetap pada 3.7 hingga diuji ulang | Harga per token sama, tetapi +30% token keluaran mengubah tagihan batch |
Polanya: semakin sulit dan panjang tugasnya, semakin banyak token yang dihasilkan desain "bekerja lebih keras" 3.8 Flash. Semakin pendek dan berulang tugasnya, semakin sedikit yang dilakukannya, dan semakin penting tingkat pemikiran (atau tetap bertahan).
Jalankan kedua model dengan skenario pengujian yang sama di Apidog
Angka per tugas di atas berasal dari alat uji Artificial Analysis, bukan milik Anda. Sebelum Anda menukar string model dalam produksi, jalankan prompt Anda sendiri melalui kedua model dan bandingkan jumlah tokennya. Apidog membuatnya menjadi pekerjaan sepuluh menit.
Atur GEMINI_API_KEY sebagai variabel lingkungan dalam lingkungan Apidog dan tambahkan satu permintaan POST ke https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent dengan x-goog-api-key membaca dari variabel tersebut. Jadikan model sebagai variabel skenario juga. Tubuh permintaannya sama untuk kedua proses:
{
"contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}
Buat skenario pengujian dengan dua langkah: permintaan dengan model diatur ke gemini-3.7-flash, kemudian permintaan yang sama dengan gemini-3.8-flash. Pada setiap langkah, tambahkan pernyataan pada usageMetadata.candidatesTokenCount dan usageMetadata.thoughtsTokenCount dengan batas yang mencerminkan anggaran Anda, ditambah pernyataan jalur JSON pada bidang apa pun yang dibaca aplikasi Anda. Jalankan skenario terhadap kumpulan data sepuluh atau dua puluh prompt emas. Laporan pengujian menunjukkan respons setiap langkah dan hasil pernyataan secara bersamaan, sehingga Anda membaca jumlah token kedua model dari satu proses dan angka +30% menjadi angka Anda sendiri, bukan dari tolok ukur.
Setelah angka terlihat benar, jadwalkan skenario sehingga peningkatan jumlah token pemikiran yang tidak terdeteksi setelah pembaruan model akan menggagalkan pengujian alih-alih muncul di tagihan. Unduh Apidog untuk mengaturnya; paket gratis mencakup alur kerja ini.
FAQ
Apakah Gemini 3.8 Flash lebih cepat dari 3.7 Flash?
Tidak. Deskripsi Google sendiri adalah "~kecepatan yang sama," dan Artificial Analysis mengukur sekitar 300 token keluaran per detik pada tingkat high. Karena 3.8 Flash beralasan dalam lebih banyak langkah, waktu sesungguhnya per tugas meningkat pada alat ujinya (2,5 menit dibandingkan 2,2 pada tingkat high). Menurunkan ke low menurunkannya menjadi 0,8 menit.
Apakah Gemini 3.8 Flash lebih mahal dari 3.7 Flash?
Tidak per token. Keduanya adalah $0,75 masukan dan $3,75 keluaran hingga 31 Desember, kemudian $1,50 dan $7,50. Per tugas, ya: Artificial Analysis mengukur $0,58 pada tingkat high dibandingkan $0,40 untuk 3.7 Flash pada tingkat high, karena 3.8 Flash menulis sekitar 30% lebih banyak token keluaran.
Apakah Google akan menghentikan Gemini 3.7 Flash?
Google mengatakan 3.7 Flash "tetap didukung penuh" dan belum menerbitkan tanggal penghentian. Anda dapat tetap menggunakannya. Postingan tentang apa yang baru di 3.7 Flash masih menjadi referensi untuk model tersebut.
Apa yang akan rusak jika saya beralih ke 3.8 Flash?
Dua hal: thinking_level: "minimal" sekarang mengembalikan kesalahan 400 INVALID_ARGUMENT, dan setiap respons fungsi harus menyertakan id panggilan (call_id pada Interactions API, id pada generateContent lama) dan name. Semua hal lain pada Gemini 3 API tidak berubah.
Bagaimana perbandingan lompatan ini dengan 3.6 ke 3.7?
3.7 Flash adalah langkah yang lebih besar: DeepSWE naik dari 49,0% menjadi 65,3%, dan indeks Artificial Analysis dari 52 menjadi 56. Langkah 3.8 adalah +3 pada indeks dan perombakan cara model membelanjakan token. Untuk generasi sebelumnya, lihat 3.6 Flash vs 3.5 Flash, yang mencakup potongan harga yang memulai rangkaian rilis ini.
Versi singkat
Tingkatkan jika beban kerja Anda bersifat agen, banyak menggunakan alat, atau padat dokumen. Di situlah Google dan Artificial Analysis sama-sama menunjukkan peningkatan, dan di mana token ekstra membeli tugas yang diselesaikan. Tetap pada 3.7 Flash, atau pindah ke 3.8 pada tingkat low, jika Anda menjalankan panggilan pendek dan berulang di mana biaya per tugas adalah angka yang Anda laporkan. Bagaimanapun, perbaiki minimal dan periksa respons fungsi Anda terlebih dahulu, lalu ukur jumlah token pada prompt Anda sendiri sebelum Anda mempercayai alat uji siapa pun, termasuk milik kami.
