Gemini 3.8 Flash adalah model tingkat Flash terbaru Google, yang dirilis pada 2 September 2026, bersamaan dengan kembaran keamanan berpagar bernama Gemini 3.8 Flash Cyber. Ini adalah rilis Flash ketiga dalam enam minggu, setelah Gemini 3.6 Flash pada 21 Juli dan 3.7 Flash pada 13 Agustus, dengan harga perkenalan yang sama dengan 3.7 Flash: $0,75 per juta token input dan $3,75 per juta token output hingga 31 Desember 2026. Google menyebutnya “model Flash kami yang paling cerdas, direkayasa untuk rekayasa perangkat lunak jangka panjang, agen otonom, dan alur kerja perusahaan yang kompleks.”
Perubahan utamanya bukanlah harga baru atau jendela konteks yang lebih besar. Ini adalah perilaku. Google merancang 3.8 Flash untuk "bekerja lebih keras" pada tugas-tugas sulit: ia mengambil langkah penalaran yang lebih kecil, memverifikasi pekerjaannya selama proses berlangsung, dan memanggil alat secara berulang. Itu memberikan keuntungan yang terukur pada tolok ukur keagenan, dan itu berarti model tersebut menghabiskan lebih banyak token per tugas, sesuai desain. Artificial Analysis mengukur sekitar 30% lebih banyak token output daripada 3.7 Flash. Jika Anda menganggarkan berdasarkan token, harganya tetap. Jika Anda menganggarkan berdasarkan tugas, tagihannya naik.
Panduan ini mencakup seluruh peluncuran: spesifikasi, pertukaran "bekerja lebih keras", tolok ukur, harga, ketersediaan, kembaran Cyber, dan apa yang tidak dapat dilakukan model. Setiap permintaan di sini adalah HTTP biasa dengan JSON, sehingga Anda dapat membangun dan memeriksanya di Apidog sebelum mencapai kode aplikasi. Kiriman peluncuran Google dan halaman model adalah sumber utama.
Sekilas Gemini 3.8 Flash
| Spesifikasi | Nilai |
|---|---|
| ID model API | gemini-3.8-flash (stabil, tanpa sufiks pratinjau) |
| Dirilis | 2 September 2026 |
| Berdasarkan | Gemini 3.7 Flash (menurut kartu model DeepMind) |
| Jendela konteks | 1.048.576 token input |
| Output maks | 65.536 token |
| Modalitas input | Teks, gambar, video, audio, PDF |
| Modalitas output | Hanya teks |
| Tingkat pemikiran | low, medium (default), high; minimal mengembalikan error |
| Harga perkenalan (hingga 31 Des 2026) | $0,75 input / $3,75 output per juta token; pemikiran ditagih sebagai output |
| Harga standar (mulai 1 Jan 2027) | $1,50 input / $7,50 output per juta token |
| Penyimpanan konteks (caching) | $0,075 per juta token yang disimpan (intro), $0,15 standar |
| API Batch | Diskon 50%: $0,375 / $1,875 intro |
| Batas pengetahuan | Maret 2026 |
| Ketersediaan pengembang | Gemini API, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise |
| Ketersediaan konsumen | Aplikasi Gemini (pelanggan AI Pro dan Ultra), Mode AI di Penelusuran, Gemini di Google Spreadsheet |
| Status 3.7 Flash | Tetap didukung penuh; tidak ada tanggal penghentian |
Tiga baris patut diperhatikan. Tingkat pemikiran default adalah medium, bukan high seperti pada Gemini 3 Pro, sehingga prompt yang disesuaikan pada Pro bernalar lebih rendah di sini kecuali Anda mengatur tingkatnya. Tingkat minimal mengembalikan error validasi daripada secara diam-diam memetakan ke low; panduan tingkat pemikiran mencakup perbaikannya. Dan batas waktu Maret 2026 membawa peringatan kartu model: di beberapa domain, pengetahuan mungkin terbatas hingga Januari 2025.
Apa itu Gemini 3.8 Flash
Flash adalah tingkat pekerja keras Google: model yang dimaksudkan untuk menjalankan sebagian besar traffic produksi sementara Pro menangani masalah-masalah tersulit. Google menyebut 3.8 Flash sebagai "model pekerja keras paling cerdas yang pernah ada," dan kartu model DeepMind menggambarkannya sebagai berbasis 3.7 Flash daripada model dasar baru. Jadi, kerangka kerja yang jujur adalah penyempurnaan dari model yang dirilis tiga minggu sebelumnya, disesuaikan untuk rekayasa perangkat lunak yang berjalan lama dan pekerjaan agen.

Frekuensinya tidak biasa. 3.6 Flash dirilis pada 21 Juli dengan harga $1,50 / $7,50, 3.7 Flash pada 13 Agustus dengan harga perkenalan $0,75 / $3,75, dan 3.8 Flash pada 2 September dengan harga yang sama. Frasa Google adalah "rilis Flash ketiga dalam enam minggu"; Artificial Analysis menghitung model Flash keempat dalam waktu kurang dari empat bulan karena perhitungan mereka mencakup 3.5 Flash-Lite. Bagi siapa pun yang memelihara konfigurasi model, kiriman "Apa yang baru di 3.7 Flash" berusia tiga minggu dan sudah menggambarkan generasi sebelumnya. Tidak ada Gemini 3.8 Pro, Gemini 4, atau Flash-Lite baru yang dikirimkan dengan rilis ini, dan Google belum mengatakan kapan pembaruan Pro akan datang.
Desain "bekerja lebih keras" dan apa yang harus Anda bayar
Deskripsi perubahan dari Google sangat spesifik. Pada tugas-tugas kompleks, 3.8 Flash "menjalankan langkah penalaran tambahan, dan memanggil alat secara berulang." Ia mengambil "langkah penalaran yang lebih kecil" dan "memverifikasi pekerjaannya selama proses berlangsung." Google secara langsung menyatakan konsekuensinya: model "dapat menggunakan lebih banyak token pada tugas yang berjalan lebih lama dan kompleks, sesuai desain," terutama pada tingkat upaya yang lebih tinggi.
Artificial Analysis mengukur hal tersebut dalam tulisan independen mereka. Menjalankan Indeks Kecerdasan mereka, 3.8 Flash pada penalaran tinggi rata-rata 48.000 token output per tugas, naik 30% dari 3.7 Flash. Harga per token tidak bergerak, sehingga biaya per tugas naik dari $0,40 pada 3.7 Flash tinggi menjadi $0,58 pada 3.8 Flash tinggi. Waktu per tugas juga naik: 2,5 menit versus 2,2 menit.
Laporan yang sama menunjukkan tuas yang Anda miliki. Pada medium, biaya per tugas turun menjadi $0,41, mendekati 3.7 Flash pada tingkat tinggi. Pada low, turun menjadi $0,24 dengan 0,8 menit per tugas. Jadi, tingkat pemikiran sekarang adalah keputusan perutean, bukan pengaturan global: titik akhir yang sensitif terhadap latensi pada low, loop agen yang harus menyelesaikan pekerjaan pada medium atau high. Rincian harga membahas 1.000 tugas agen per hari di setiap tingkat.
Kecepatannya tidak berubah. Logan Kilpatrick dari Google menggambarkan 3.8 Flash sebagai "harga yang sama dengan 3.7, kecepatannya kurang lebih sama," dan Artificial Analysis mengukur 302,1 token output per detik pada penalaran tinggi. Waktu-ke-token-pertama mereka sebesar 13,30 detik pada uji coba tersebut adalah model yang berpikir sebelum menjawab, bukan jalur jaringan yang lambat.
Apa yang dikatakan tolok ukur
Google menerbitkan tiga tabel tolok ukur dalam bentuk teks di halaman DeepMind Flash. Ini adalah angka-angka yang dijalankan Google.
| Tolok ukur | 3.8 Flash | 3.7 Flash | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|---|---|---|---|
| Agen Keuangan Vals v2 | 61,4% | 59,0% | 58,6% | 53,8% | 54,4% | 53,9% |
| Tolok Ukur Agen Hukum Harvey | 10,0% | 8,8% | 6,7% | 2,5% | 0,8% | 5,0% |
| HLE-Terverifikasi | 54,9% | 53,6% | 54,4% | 54,5% | 51,1% | 31,0% |
Peningkatan dibandingkan 3.7 Flash adalah 2,4, 1,2, dan 1,3 poin. Kecil, tetapi baris keuangan dan hukum menempatkan model harga Flash di atas Opus 5 dan GPT-5.6 Sol, yang harganya beberapa kali lebih mahal per token. Claude Fable 5.1, yang dikirimkan sehari sebelumnya, tidak muncul di tabel Google; perbandingan tiga arah menggunakan baris Opus 5 dan Sonnet 5 Anthropic sebagai entri terdekat yang diterbitkan.
Google membuat tiga klaim lagi tanpa angka dalam bentuk teks. Pada DeepSWE v1.1, 3.8 Flash "mengungguli sebagian besar model perbatasan yang lebih besar" dengan "sebagian kecil dari biayanya"; persentasenya hanya muncul di tabel gambar kartu model, jadi kami tidak mencetak satu pun (3.7 Flash mencetak 65,3%). Pada alur kerja jangka panjang yang sarat dokumen, evaluasi internal menunjukkan bahwa ia "menyelesaikan lebih dari tiga kali lebih banyak tugas daripada Gemini 3.7 Flash." Pada injeksi prompt Gray Swan, Google melaporkan "lompatan signifikan" tanpa angka. Hasil SWE-Bench Pro, Terminal-bench, dan OSWorld tidak dipublikasikan dalam teks untuk 3.8 Flash.
Pandangan independen sejalan. Artificial Analysis mencetak 3.8 Flash (tinggi) pada 59 pada Indeks Kecerdasan mereka, naik dari 56 untuk 3.7 Flash dan 52 untuk 3.6 Flash. Itu menyamai GPT-5.6 Sol (xhigh) dan Grok 4.6 (medium), dan berada di atas GPT-5.6 Terra (max), Claude Fable 5.1 (medium), dan Muse Spark 1.2 (xhigh), semuanya pada 57. Pada evaluasi penggunaan alat τ³-Banking mereka, 3.8 Flash mencetak 45%, 12 poin di atas 3.7 Flash. Perbandingan 3.8 vs 3.7 Flash menimbang keuntungan tersebut terhadap biaya token per beban kerja.
Harga: sama per token, lebih banyak per tugas
Halaman harga mencantumkan 3.8 Flash pada baris yang sama dengan 3.6 dan 3.7 Flash, dan ketiganya berlipat ganda pada 1 Januari 2027.
| Item | Hingga 31 Des 2026 | Mulai 1 Jan 2027 |
|---|---|---|
| Input | $0,75 / 1 Juta | $1,50 / 1 Juta |
| Output (termasuk pemikiran) | $3,75 / 1 Juta | $7,50 / 1 Juta |
| Input yang disimpan (cached) | $0,075 / 1 Juta | $0,15 / 1 Juta |
| Penyimpanan cache | $0,50 / 1 Juta token / jam | $1,00 / 1 Juta token / jam |
| Input / output batch | $0,375 / $1,875 | $0,75 / $3,75 |
Dua detail yang membingungkan banyak orang. Token pemikiran adalah token output: ditagih dengan tarif output dan dilaporkan secara terpisah di usageMetadata.thoughtsTokenCount, sehingga jawaban singkat pada tingkat high dapat lebih mahal daripada jawaban panjang pada tingkat low. Dan penyelarasan Google Search memiliki meteran tersendiri: 5.000 permintaan gratis per bulan yang dibagikan di semua model Gemini 3.x, kemudian $14 per 1.000 permintaan.
Tingkat gratis dengan batasan tarif tersedia di AI Studio dan API, dengan Google mencatat data tingkat gratis "digunakan untuk meningkatkan produk kami." Batas tarif per model ditunjukkan di AI Studio daripada di dokumen. Tingkat 1 terbuka dengan menautkan akun penagihan, Tingkat 2 setelah $100 pembelanjaan dan tiga hari, Tingkat 3 setelah $1.000 dan 30 hari. Panduan akses gratis mencakup apa yang jalur gratis berikan dan tidak berikan kepada Anda, dan panduan API Batch mencakup diskon 50% untuk pekerjaan yang dapat ditunda.
Cara memanggilnya
Google sekarang memperlakukan API Interaksi sebagai jalur utama untuk Gemini 3.x. generateContent "dianggap sebagai warisan" tetapi "tetap didukung penuh" tanpa tanggal penghentian, dan sebagian besar kode yang ada masih menggunakannya. Permintaan Interaksi minimal:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Jelaskan caching HTTP dalam 3 kalimat.","generation_config":{"thinking_level":"medium"}}'
Percakapan multi-giliran meneruskan previous_interaction_id dan membiarkan server menyimpan status. Pemanggilan fungsi mendeklarasikan alat dengan skema JSON, menerima langkah function_call, dan mengharapkan function_result yang membawa call_id dan name, yang diperlukan pada 3.8 Flash (generateContent lama mengeja bidang id). Panduan API menunjukkan kedua titik akhir dalam REST dan Python, dan panduan pemanggilan fungsi mencakup loop alat berulang yang dihasilkan oleh desain "bekerja lebih keras" dan cara membatasinya.
Jika Anda beralih dari 3.7 Flash, perubahannya kecil tetapi menyebabkan error: pemikiran minimal ditolak, thinking_budget digantikan oleh thinking_level, candidate_count tidak didukung, dan Google mengatakan untuk membiarkan temperature pada default 1.0 karena menurunkannya "dapat menyebabkan perulangan atau kinerja yang menurun." Panduan migrasi mengubah catatan "apa yang baru" Google menjadi daftar periksa dengan JSON sebelum dan sesudah.
Apa yang tidak dapat dilakukan Gemini 3.8 Flash
Halaman model eksplisit. Tidak didukung: pembuatan audio, API Langsung, dan pembuatan gambar. Output hanya teks, meskipun input menerima teks, gambar, video, audio, dan PDF. Segmentasi gambar juga tidak didukung pada model Gemini 3. Jika produk Anda membutuhkan output suara atau gambar waktu nyata, model ini adalah lapisan penalaran dan pemanggilan alat, bukan keseluruhan tumpukan. Untuk teks berthroughput tinggi yang murah tanpa penalaran berat, Gemini 3.5 Flash-Lite tetap ada di daftar harga seharga $0,30 / $2,50. Sisa daftar periksa didukung, termasuk pemanggilan fungsi, output terstruktur, penyimpanan konteks, eksekusi kode, penyelarasan Penelusuran dan Peta, API Batch, dan penggunaan Komputer dalam pratinjau.
Gemini 3.8 Flash Cyber: kembaran berpagar
Gemini 3.8 Flash Cyber dikirimkan pada hari yang sama, dan Anda tidak dapat mendaftar untuk itu. Akses hanya melalui Program Fairwind yang baru, terbuka untuk "otoritas pemerintah tepercaya, operator infrastruktur penting, dan pemelihara perangkat lunak," dengan pemeriksaan latar belakang dan persyaratan seperti MFA anti-phishing. Tidak ada API publik, tidak ada harga publik, dan tidak ada hosting mandiri. Ini menggantikan uji coba terbatas 3.5 Flash Cyber.
Klaim Google besar: tingkat keberhasilan penemuan kerentanan di dunia nyata di atas 70% di 20 bahasa pemrograman, dan laporan tim keamanan Chrome tentang "2,6 kali lebih banyak patch yang benar untuk kerentanan di Chrome daripada model komersial terbaik yang jauh lebih besar." Keduanya dilaporkan oleh Google. Penjelasan Cyber mencakup kelayakan, kewajiban, dan apa artinya bagi banyak tim yang tidak akan pernah mendapatkan akses.
Menguji permintaan Gemini 3.8 Flash di Apidog
Karena narasi biaya adalah per tugas daripada per token, uji coba yang berguna bukanlah "apakah panggilan berhasil" tetapi "berapa banyak token yang terbakar." Apidog menanganinya sebagai uji coba API biasa. Simpan GEMINI_API_KEY sebagai variabel lingkungan, simpan permintaan Interaksi dan generateContent sebagai titik akhir, dan tegaskan pada status 200, bidang JSON yang dibaca aplikasi Anda, dan batas atas pada usageMetadata.thoughtsTokenCount. Jalankan prompt yang sama pada low, medium, dan high dalam satu skenario uji dan Anda akan mendapatkan penyebaran token per tingkat untuk prompt Anda sendiri alih-alih rata-rata Artificial Analysis.
Respons streaming dirender sebagai SSE, yang membantu saat men-debug ringkasan pemikiran dengan includeThoughts: true; panduan pengujian SSE membahasnya. Jadwalkan skenario harian dan regresi token menggagalkan penegasan sebelum muncul di faktur. Unduh Apidog untuk mengaturnya pada paket gratis.
Pertanyaan yang Sering Diajukan
Apakah Gemini 3.8 Flash model baru atau pembaruan untuk 3.7 Flash? Kartu model DeepMind mengatakan bahwa itu didasarkan pada Gemini 3.7 Flash. Anggaplah itu sebagai penerus yang disempurnakan: harga, kecepatan, dan jendela konteks yang sama, dengan lebih banyak langkah penalaran dan pemanggilan alat pada tugas-tugas sulit. 3.7 Flash tetap didukung penuh, tanpa tanggal penghentian.
Mengapa Gemini 3.8 Flash menggunakan lebih banyak token daripada 3.7 Flash? Sesuai desain. Google mengatakan bahwa ia "dapat menggunakan lebih banyak token pada tugas yang berjalan lebih lama dan kompleks," dan Artificial Analysis mengukur 30% lebih banyak token output pada indeks mereka. Turunkan thinking_level ke medium atau low pada rute yang tidak memerlukan penalaran tambahan; panduan tingkat pemikiran memiliki tabel biaya per tingkat.
Berapa jendela konteks Gemini 3.8 Flash? 1.048.576 token input dan 65.536 token output, dengan penyimpanan konteks seharga $0,075 per juta token yang disimpan hingga 31 Desember 2026.
Dapatkah saya menggunakan Gemini 3.8 Flash di aplikasi Gemini gratis? Liputan peluncuran mencantumkan aplikasi Gemini untuk pelanggan Google AI Pro dan Ultra, bukan tingkat aplikasi gratis. Pengembang mendapatkan tingkat gratis dengan batasan tarif di AI Studio dan API.
Bagaimana Gemini 3.8 Flash dibandingkan dengan Claude Fable 5.1? Artificial Analysis memberi skor 59 dan 57. Untuk harga, Claude Fable 5.1 berharga $10 / $50 per juta token, sekitar 13 kali tarif perkenalan 3.8 Flash pada input dan output. Kesenjangan menyempit setelah Anda menghitung token per tugas.
Ke mana selanjutnya
Gemini 3.8 Flash adalah pekerja keras yang berpikir lebih lama, dan pertukaran ini eksplisit: beberapa poin lebih banyak pada tolok ukur keagenan dan 12 poin pada penggunaan alat, dibayar dengan sekitar 30% lebih banyak token output pada penalaran tinggi. Jika agen Anda mengalami kendala pada 3.7 Flash, peningkatan biayanya sama per token. Jika traffic Anda adalah obrolan yang dibatasi latensi, atur low atau tetap gunakan 3.7 Flash, yang masih didukung. Mulailah dengan panduan API, kirim permintaan pertama Anda dari Apidog dengan penegasan jumlah token terlampir, dan biarkan angka, bukan kiriman peluncuran, yang memutuskan tingkat pemikiran untuk setiap rute.
