Ini keputusannya di awal. Pilih Gemini 3.5 Flash-Lite ketika Anda menjalankan tugas sederhana dalam volume tinggi dan paling peduli pada biaya dan kecepatan: klasifikasi, ekstraksi, balasan obrolan singkat, jawaban RAG, pelengkapan otomatis. Pilih Gemini 3.6 Flash ketika kualitas lebih penting daripada biaya: agen multi-langkah, penggunaan alat, coding, penggunaan komputer, dan jawaban di mana hasil yang salah akan mahal.
Kedua model diluncurkan dalam penyegaran tingkat Flash Google pada 21 Juli 2026. Keduanya menerima hingga 1 juta token masukan. Mereka berada pada titik yang berbeda pada kurva yang sama, jadi pertanyaannya sebenarnya bukan model mana yang "lebih baik." Ini tentang kompromi mana yang sesuai dengan pekerjaan yang ada di hadapan Anda.
Satu keanehan penamaan yang perlu dijelaskan terlebih dahulu: model utama melompat ke 3.6, tetapi tingkat Lite tetap di 3.5. Jadi Anda membandingkan model 3.5 dengan model 3.6, dan itu wajar, bukan kesalahan ketik. Lebih lanjut tentang ini di FAQ.
Jawaban singkatnya
Secara default, gunakan Flash-Lite untuk tugas sederhana apa pun yang Anda jalankan jutaan kali, dan gunakan 3.6 Flash saat tugas tersebut membutuhkan penalaran, alat, atau kode. Jika Anda tidak dapat memutuskan, mulailah dengan Flash-Lite, perhatikan di mana jawabannya kurang memuaskan, dan naikkan hanya panggilan tersebut ke 3.6 Flash. Anda jarang membutuhkan satu model untuk seluruh aplikasi.
Harga dan kecepatan berdampingan
| Atribut | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash |
|---|---|---|
| ID Model | gemini-3.5-flash-lite |
gemini-3.6-flash |
| Harga Input | $0.30 / 1 juta token | $1.50 / 1 juta token |
| Harga Output | $2.50 / 1 juta token | $7.50 / 1 juta token |
| Throughput | ~350 token output/detik | Tidak dipublikasikan secara terpisah |
| Jendela Konteks | 1 juta token | 1 juta token |
| Tingkat Gratis | Ya (dengan batas laju) | Ya (dengan batas laju) |
Flash-Lite lebih murah per token. Input 5 kali lebih murah; output 3 kali lebih murah. Google mempublikasikan angka throughput sekitar 350 token output per detik untuk Flash-Lite, yang membuatnya terasa instan di kotak obrolan atau kolom pelengkapan otomatis. Google tidak mempublikasikan angka token per detik terpisah untuk 3.6 Flash, tetapi 3.6 Flash menghasilkan sekitar 17% lebih sedikit token output daripada 3.5 Flash yang digantikannya, sehingga menyelesaikan pekerjaan multi-langkah lebih cepat dari yang disarankan oleh harga aslinya. Anda dapat mengkonfirmasi tarif saat ini di halaman harga Gemini API dan dalam rincian harga Gemini 3.6 Flash kami.
Kualitas dan benchmark
Perbedaan harga memberi Anda ruang gerak pada tugas-tugas sulit. Pada Terminal-Bench 2.1, yang mengukur pekerjaan terminal agen, Flash-Lite mencetak 54 dan 3.6 Flash mencetak 78.0. Selisih 24 poin itulah keseluruhan ceritanya: pada pekerjaan multi-langkah yang digerakkan oleh alat, 3.6 Flash adalah model yang lebih kuat dengan selisih yang jelas.

3.6 Flash juga melaporkan 83.0 pada OSWorld-Verified, benchmark penggunaan komputer yang mengukur pengoperasian browser atau desktop sungguhan. Flash-Lite tidak menargetkan keterampilan itu. Jika beban kerja Anda melibatkan klik di sekitar layar, itu adalah pekerjaan 3.6 Flash. Khusus untuk coding, 3.6 Flash mencatat 58.7% pada SWE-Bench Pro dan 49% pada DeepSWE v1.1, jenis skor yang menempatkannya di wilayah coding-agen sesungguhnya. Flash-Lite tidak ditujukan untuk pekerjaan tersebut.
Penting untuk bersikap adil terhadap Flash-Lite di sini. Skor 54-nya pada Terminal-Bench 2.1 naik dari 31 pada generasi Lite sebelumnya, jadi tingkat yang lebih murah ini menjadi jauh lebih mampu pada putaran ini. Ini bukan model yang lemah. Ini adalah model yang disesuaikan untuk pekerjaan yang berbeda: penalaran yang cepat, murah, dan cukup baik pada tugas-tugas yang tidak bercabang. Halaman model Flash Google sendiri dan pengumuman peluncurannya membingkai keduanya dengan cara yang sama: satu tingkat untuk volume, satu tingkat untuk kedalaman.
Model mana untuk pekerjaan mana
Gunakan ini sebagai matriks awal, lalu sesuaikan dengan evaluasi Anda sendiri.
| Tugas | Paling Sesuai |
|---|---|
| Klasifikasi atau ekstraksi volume tinggi | Flash-Lite |
| Asisten obrolan dan balasan singkat | Flash-Lite |
| Jawaban RAG atas konteks yang diambil | Flash-Lite |
| UX bergaya pelengkapan otomatis, kritis latensi | Flash-Lite |
| Skala pencarian, pipeline setiap permintaan | Flash-Lite |
| Agen multi-langkah | 3.6 Flash |
| Penggunaan alat dan rantai panggilan fungsi | 3.6 Flash |
| Pengodean dan tinjauan kode | 3.6 Flash |
| Penggunaan komputer (browser atau desktop) | 3.6 Flash |
| Jawaban berisiko tinggi di mana kesalahan merugikan uang | 3.6 Flash |
Polanya sederhana. Flash-Lite unggul di mana tugasnya sempit dan volumenya besar. 3.6 Flash unggul di mana tugas bercabang dan biaya kesalahan tinggi. Model yang menandai tiket dukungan berdasarkan kategori sepuluh juta kali sehari cocok untuk Flash-Lite. Model yang membaca jejak tumpukan, mengedit tiga file, dan membuka permintaan tarik cocok untuk 3.6 Flash. Jika Anda membandingkan ini dengan 3.5 Flash yang lebih lama alih-alih Flash-Lite, perbandingan 3.6 Flash vs 3.5 Flash kami mencakup jalur pembaruan tersebut.
Perbandingan biaya pada beban kerja yang sama
Angka-angka membuat kompromi menjadi konkret. Katakanlah pekerjaan harian mengirimkan 10 juta token input dan menghasilkan 2 juta token output, bentuk tipikal untuk pipeline ringkasan batch atau ekstraksi.
| Model | Input (10 juta) | Output (2 juta) | Total harian |
|---|---|---|---|
| Flash-Lite | $3.00 | $5.00 | $8.00 |
| 3.6 Flash | $15.00 | $15.00 | $30.00 |
Dengan campuran tersebut, 3.6 Flash berharga 3,75 kali lebih mahal: $8.00 berbanding $30.00 per hari, atau kira-kira $240 berbanding $900 per bulan untuk volume yang sama.
Namun, kelipatannya tidak tetap. Karena Flash-Lite 5 kali lebih murah pada input dan 3 kali lebih murah pada output, penghematan Anda yang sebenarnya berada di antara 3x dan 5x tergantung pada bentuk lalu lintas Anda. Pekerjaan yang padat input (konteks RAG yang panjang, dokumen besar, klasifikasi input besar) cenderung ke arah 5x, dan itulah beban kerja yang tepat untuk Flash-Lite. Generasi yang padat output cenderung ke arah 3x.
Jadi pertanyaan sebenarnya bukan hanya “bisakah 3.6 Flash melakukan ini?” Ini adalah “apakah peningkatan kualitas sepadan dengan membayar 3 hingga 4 kali lebih banyak per panggilan, pada volume saya?” Untuk pipeline skala Pencarian, jawabannya biasanya tidak. Untuk agen yang mengedit kode atau mengajukan tiket, jawabannya biasanya ya.
Cara A/B keduanya di Apidog
Anda tidak perlu menebak tingkat mana yang cukup baik. Gemini API adalah endpoint REST biasa, sehingga Anda dapat mengirimkan prompt yang sama ke kedua model dan membandingkan responsnya secara langsung. Apidog adalah klien API yang dibuat khusus untuk jenis pemeriksaan berdampingan seperti ini.

Berikut alur kerja yang membutuhkan waktu beberapa menit:
- Buat permintaan POST ke endpoint Gemini API dan simpan kunci API Anda dalam variabel lingkungan Apidog, sehingga kunci tersebut tidak pernah berada di badan permintaan atau dalam kontrol versi.
- Kirim sekali dengan model diatur ke
gemini-3.5-flash-lite. Catat respons dan latensi yang dilaporkan Apidog. - Duplikasi permintaan dan ubah satu hal: ID model menjadi
gemini-3.6-flash. Prompt yang sama, parameter yang sama, jadi satu-satunya variabel adalah modelnya. - Bandingkan kedua respons berdasarkan kualitas, dan bandingkan waktu yang dicatat Apidog untuk setiap panggilan.
- Tambahkan penegasan pada respons (kode status, bidang JSON yang diharapkan, konten yang diperlukan) sehingga “cukup baik” ditentukan oleh pemeriksaan, bukan dengan pengamatan sekilas.
Setelah permintaan ada, simpan dan ubah menjadi tes yang dapat diulang. Anda dapat menjadwalkan tes API di Apidog untuk menjalankan kembali prompt yang sama secara berkala, yang mendeteksi pergeseran kualitas atau latensi ketika Google memperbarui salah satu model. Perjelas batasnya: Apidog mengirimkan permintaan dan memeriksa penegasan Anda, tetapi tidak menjalankan model, dan tidak akan memberi tahu Anda jawaban mana yang lebih cerdas. Penilaian itu tetap ada pada Anda. Untuk mengikuti, unduh Apidog dan arahkan permintaan ke endpoint Gemini.
FAQ
Apakah Flash-Lite hanya versi yang lebih buruk dari 3.6 Flash? Tidak. Ini adalah titik yang berbeda pada kurva biaya, kualitas, dan kecepatan. Flash-Lite lebih murah dan lebih cepat dengan batas bawah pada penalaran yang sulit; 3.6 Flash lebih mahal dan penalaran lebih baik. Pada tugas-tugas sederhana bervolume tinggi, Flash-Lite seringkali merupakan jawaban yang tepat justru karena lebih murah dan lebih cepat, bukan karena sebaliknya.
Mengapa yang satu disebut 3.5 dan yang lain 3.6? Versi yang campur aduk. Dalam penyegaran ini Google memindahkan model Flash utama ke 3.6 tetapi menjaga tingkat Lite di 3.5 (rilis yang sama juga menyertakan model keamanan siber 3.5 Flash). Keluarga yang sama, nomor versi yang berbeda. Jangan menganggap 3.5 pada Flash-Lite sebagai “lama dan ditinggalkan.”
Apakah mereka berbagi jendela konteks yang sama? Ya. Keduanya menerima hingga 1 juta token input, jadi prompt konteks panjang bukan alasan untuk memilih satu di atas yang lain. Pilih berdasarkan kualitas penalaran, harga, dan kecepatan sebagai gantinya.
Bisakah saya menggunakan keduanya dalam satu aplikasi? Itu adalah pola yang direkomendasikan. Arahkan panggilan murah, sederhana, bervolume tinggi ke Flash-Lite dan eskalasi yang sulit ke 3.6 Flash. Karena bentuk API-nya identik, pergantian hanyalah perubahan satu kolom, itulah yang membuat A/B Apidog di atas begitu cepat dijalankan.
Apakah mereka gratis untuk dicoba? Keduanya memiliki tingkat gratis di Google AI Studio, dengan batas laju, dan Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya. Itu baik untuk pengujian; baca ketentuan sebelum Anda mengirimkan sesuatu yang sensitif.
Kesimpulan
Gunakan Flash-Lite sebagai default Anda untuk pekerjaan murah, cepat, dan sederhana dalam skala besar, dan tingkatkan panggilan yang sulit, bercabang, atau padat kode ke 3.6 Flash di mana celah 24 poin Terminal-Bench sepadan dengan harga 3x hingga 4x lipatnya. Jangan memilih secara abstrak: kirimkan prompt Anda yang sebenarnya ke keduanya, ukur kualitas dan latensi, dan biarkan angka-angka yang memutuskan. Apidog menjadikan perbandingan itu pekerjaan dua permintaan.
