Apa Itu Gemini 3.5 Flash-Lite?

Gemini 3.5 Flash-Lite adalah tingkatan Gemini paling murah dan tercepat dari Google: $0,30 per input, ~350 token/detik. Dapatkan spesifikasi, harga, benchmark, dan cara mengujinya.

Ashley Innocent

Ashley Innocent

22 July 2026

Apa Itu Gemini 3.5 Flash-Lite?

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Google memperbarui tingkat Flash-nya pada 21 Juli 2026, dan Gemini 3.5 Flash-Lite adalah varian hematnya. Ini adalah Gemini termurah dan tercepat yang dapat Anda gunakan saat ini, dibangun untuk pekerjaan bervolume tinggi dan sensitif terhadap latensi: klasifikasi, ekstraksi, balasan obrolan singkat, dan jawaban pengambilan sederhana di mana throughput dan biaya lebih penting daripada penalaran mendalam. Jika Anda meluncurkan jutaan permintaan kecil setiap hari, inilah tingkat yang Google inginkan di jalur panas Anda.

Pembaruan ini merilis tiga model sekaligus, dan penamaannya membingungkan banyak orang, jadi mari kita jelaskan dengan cepat dan kemudian membahas spesifikasi, harga, tolok ukur, dan cara menguji titik akhir itu sendiri.

button

Apa itu Gemini 3.5 Flash-Lite?

Gemini 3.5 Flash-Lite adalah model terkecil dan termurah dalam keluarga Gemini Google. Ini dioptimalkan untuk kecepatan dan volume, bukan untuk penalaran yang paling sulit. Google mencatatnya sekitar 350 token keluaran per detik, sehingga respons terasa hampir instan bahkan di bawah beban. Anda memanggilnya melalui Gemini API dengan ID model gemini-3.5-flash-lite.

Bayangkan ini sebagai tingkatan yang Anda tujukan untuk pekerjaan yang membosankan, berulang, dan berfrekuensi tinggi. Menandai tiket dukungan. Mengambil bidang dari dokumen. Menjawab pertanyaan singkat dari potongan teks yang diambil. Mendukung widget obrolan yang perlu membalas sebelum pengguna menyadari adanya penundaan. Dalam setiap kasus tersebut, Anda mengirim banyak permintaan dan Anda ingin setiap permintaan murah dan cepat. Flash-Lite adalah jawaban Google untuk jenis beban kerja tersebut.

Ini diluncurkan sebagai bagian dari pembaruan Flash tiga model: Gemini 3.6 Flash yang baru, Gemini 3.5 Flash-Lite ini, dan model keamanan berbatas yang disebut Gemini 3.5 Flash Cyber. Anda dapat membaca ringkasan Google di blog Google dan detail model di halaman DeepMind Flash. Flash-Lite berada di urutan terbawah dalam tumpukan tersebut dalam hal harga dan di urutan teratas dalam hal kecepatan murni.

Tunggu, mengapa 3.5 dan bukan 3.6?

Inilah bagian yang membingungkan. Model utama yang baru adalah Gemini 3.6 Flash. Namun Flash-Lite tetap pada versi 3.5, begitu pula model keamanan Cyber yang berbatas. Jadi, satu peluncuran, satu hari, tiga model, dua nomor versi. Itu bukan salah ketik dari Google atau kesalahan dalam artikel ini. Google merilis versi campuran: Flash unggulan melompat ke 3.6, sementara varian Lite dan Cyber mempertahankan label 3.5.

Mengapa Google melakukan ini? Nomor versi melacak model, bukan acara peluncuran. Model utama mendapat peningkatan generasi yang lebih besar, sehingga mendapatkan tag 3.6. Flash-Lite juga merupakan model baru, tetapi Google memilih untuk tetap menyelaraskannya dengan lini 3.5. Membingungkan untuk dilacak, tetapi begitulah labelnya.

Satu lagi sumber kebingungan yang perlu diatasi sekarang. Gemini 3.5 Flash-Lite bukanlah Gemini 3.1 Flash-Lite yang lebih lama dari generasi sebelumnya. Nama “Flash-Lite” yang sama, model berbeda, nomor berbeda. Jika Anda membangun di atas 3.1 Flash-Lite sebelumnya, ini adalah pengganti yang lebih baru dan lebih cepat, bukan sekadar penggantian nama dari apa yang sudah Anda miliki. Periksa ID model sebelum Anda berasumsi: gemini-3.5-flash-lite adalah yang baru.

Spesifikasi dan harga

Berikut adalah biaya Flash-Lite dan bagaimana kinerjanya. Semua harga adalah per juta token melalui Gemini API.

Atribut Nilai
ID Model gemini-3.5-flash-lite
Harga Input $0.30 / 1M token
Harga Output $2.50 / 1M token
Kecepatan ~350 token keluaran/detik
Tingkat Gratis Ya (Google AI Studio, terbatas laju)
Penyimpanan Konteks $0.03 / 1M token + $1.00 / 1M/jam penyimpanan

Harga input $0,30 dan output $2,50 ini adalah tarif termurah yang dipublikasikan dalam jajaran Gemini saat ini. Sebagai perbandingan, model utama 3.6 Flash berharga $1,50 untuk input dan $7,50 untuk output, jadi Flash-Lite kira-kira seperlima dari biaya input dan sepertiga dari biaya output. Ketika Anda memproses jutaan panggilan singkat, selisih harga itulah intinya. Anda dapat mengonfirmasi angka saat ini di dokumen harga Gemini API, karena Google memperbarui halaman tersebut secara langsung.

Penyimpanan konteks semakin mengurangi biaya untuk prompt yang Anda kirim berulang kali, seperti prompt sistem tetap atau dokumen referensi yang panjang. Anda membayar tarif kecil untuk menyimpan token ditambah biaya penyimpanan per jam, dan input yang disimpan jauh lebih murah untuk setiap penggunaan kembali.

Seberapa baik kinerjanya?

Angka utamanya: Gemini 3.5 Flash-Lite mencetak 54% pada Terminal-Bench 2.1, naik dari 31% pada pendahulunya. Itu adalah lonjakan nyata untuk model kelas Lite, dan itu berarti tingkatan kecil sekarang benar-benar berguna untuk tugas-tugas yang dulu sulit ditangani.

Di mana ia unggul: klasifikasi, ekstraksi, respons obrolan, dan jawaban dengan augmented retrieval sederhana. Itulah pekerjaan di mana model cepat dan murah sangat berguna. Mengurutkan input ke dalam kategori, menarik data terstruktur dari teks yang tidak teratur, menjawab pertanyaan singkat berdasarkan bagian teks yang diambil, menjaga asisten ringan tetap responsif. Flash-Lite menangani semua itu dengan baik dan cepat.

Sekarang batasan jujurnya. Flash-Lite mengorbankan kualitas demi biaya dan kecepatan. Ini bukan model untuk pengodean agen yang paling sulit, rantai alat multi-langkah yang panjang, atau masalah penalaran mendalam. Ketika suatu tugas perlu merencanakan banyak langkah, memanggil alat secara berurutan dengan andal, atau menalar melalui basis kode yang rumit, Anda akan membutuhkan Gemini 3.6 Flash atau model yang lebih besar sebagai gantinya. Memilih Flash-Lite untuk pekerjaan itu menghemat uang hingga jawaban yang salah justru merugikan Anda lebih dari yang Anda hemat. Sesuaikan tingkatan dengan tugas.

Di mana Google menggunakan Flash-Lite

Google tidak hanya menjual Flash-Lite kepada pengembang. Mereka mengintegrasikan model ini ke dalam Google Search. Itu adalah sinyal yang berguna: ketika Google menempatkan model di depan lalu lintas skala Search, mereka bertaruh bahwa model tersebut cukup cepat dan cukup murah untuk berjalan pada sejumlah besar kueri tanpa mengalami masalah latensi atau anggaran.

Bagi Anda, itu adalah bukti. Sifat yang sama yang membuat Flash-Lite cocok untuk Search, throughput tinggi dan biaya rendah per panggilan, persis seperti yang membuatnya cocok untuk titik akhir produksi yang sibuk. Jika ia dapat melayani lalu lintas Search, ia dapat melayani pipeline klasifikasi Anda.

Flash-Lite vs Gemini 3.6 Flash: mana yang harus Anda pilih?

Singkatnya: pilih Flash-Lite ketika pekerjaannya sederhana, bervolume tinggi, dan sensitif terhadap kecepatan. Pilih 3.6 Flash ketika pekerjaan membutuhkan penalaran yang lebih kuat, pengodean, atau pekerjaan agen multi-langkah.

Flash-Lite unggul dalam harga dan latensi. Ini adalah Gemini termurah dan berjalan sekitar 350 token per detik, jadi ini adalah pilihan standar yang tepat untuk klasifikasi, ekstraksi, obrolan singkat, dan RAG sederhana dalam skala besar. Gemini 3.6 Flash lebih mahal per token tetapi bernalar lebih kuat, mengkode lebih baik, dan bertahan dalam alur kerja agen di mana Flash-Lite akan tersandung. Harga 3.6 Flash mencerminkan hal itu: Anda membayar untuk kemampuan tambahan.

Pola praktisnya adalah mengarahkan berdasarkan kesulitan. Kirim panggilan yang mudah dan sering ke Flash-Lite dan eskalasikan yang sulit ke 3.6 Flash. Anda mendapatkan throughput murah pada sebagian besar lalu lintas dan penalaran yang lebih kuat hanya di mana ia sepadan dengan biayanya. Untuk perbandingan lengkap mengenai kecepatan, harga, dan kualitas, lihat Gemini 3.5 Flash-Lite vs 3.6 Flash.

Cara mengakses dan mengujinya

Flash-Lite berjalan di Gemini API. Cara tercepat untuk memulai adalah Google AI Studio: dapatkan kunci API, dan tingkat gratis memungkinkan Anda mencoba model sebelum Anda menyiapkan penagihan. Perhatikan bahwa tingkat gratis terbatas laju, dan Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya, jadi simpan input sensitif pada kunci berbayar. Referensi lengkap terdapat di dokumen Gemini API. Atur model ke gemini-3.5-flash-lite dan Anda memanggil tingkat termurah.

Setelah permintaan Anda berfungsi, Anda ingin mempertahankannya tetap berfungsi. Harga, batas laju, dan bentuk respons bergeser seiring Google memperbarui API, dan model Lite yang cepat namun terkadang salah membutuhkan asersi untuk mendeteksi perubahan. Di situlah klien API membantu. Dengan Apidog Anda dapat membangun permintaan POST ke titik akhir Gemini, menyimpan kunci API Anda sebagai variabel lingkungan sehingga tidak pernah ada dalam isi permintaan, dan menambahkan asersi pada kode status dan bidang JSON yang Anda andalkan.

Dari sana Anda dapat mengubah permintaan itu menjadi tes regresi yang disimpan dan menjadwalkannya untuk berjalan sehingga Anda dapat mendeteksi respons yang rusak atau perubahan harga sebelum pengguna Anda melakukannya. Apidog tidak menjalankan model atau menggantikan Gemini API; ini adalah klien yang Anda gunakan untuk memanggil, memvalidasi, dan memantau titik akhir. Unduh Apidog jika Anda ingin menguji titik akhir gemini-3.5-flash-lite bersama dengan sisa tumpukan API Anda.

button

FAQ

Apakah Gemini 3.5 Flash-Lite sama dengan Gemini 3.6 Flash? Tidak. Keduanya adalah dua model berbeda dari pembaruan 21 Juli 2026 yang sama. Flash-Lite adalah tingkatan termurah dan tercepat untuk pekerjaan sederhana bervolume tinggi. 3.6 Flash adalah model utama yang lebih mahal dengan penalaran dan pengodean yang lebih kuat.

Mengapa 3.5 dan bukan 3.6? Versi campuran. Google meningkatkan Flash utama ke 3.6, tetapi mempertahankan Flash-Lite dan model Cyber berbatas pada label 3.5 dalam peluncuran yang sama. Nomor tersebut melacak lini model, bukan tanggal peluncuran.

Apakah ini Gemini 3.1 Flash-Lite yang lama? Tidak. Gemini 3.5 Flash-Lite adalah model yang lebih baru. 3.1 Flash-Lite yang lebih lama adalah generasi sebelumnya. Nama keluarga yang sama, model dan versi yang berbeda, jadi periksa ID model gemini-3.5-flash-lite untuk memastikan Anda menggunakan yang baru.

Apakah Gemini 3.5 Flash-Lite gratis? Ada tingkat gratis melalui Google AI Studio, dan itu terbatas laju. Ini baik untuk pengujian dan penggunaan ringan. Untuk volume produksi, Anda beralih ke kunci API berbayar, dan Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya.

Untuk apa Flash-Lite paling baik? Klasifikasi, ekstraksi, balasan obrolan singkat, dan jawaban augmented retrieval sederhana dengan volume tinggi. Ini bukan pilihan untuk pengodean agen yang sulit atau penalaran multi-langkah yang panjang, di mana 3.6 Flash lebih cocok.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.