Gemini 3.6 Flash vs 3.5 Flash: Perbedaan, Fitur Baru, dan Perlukah Upgrade?

Gemini 3.6 Flash vs 3.5 Flash: masukan $1,50 yang sama, keluaran dipangkas menjadi $7,50, 17% lebih sedikit token keluaran, skor penggunaan komputer lebih tinggi. Apa yang berubah dan haruskah Anda melakukan upgrade?

Ashley Innocent

Ashley Innocent

22 July 2026

Gemini 3.6 Flash vs 3.5 Flash: Perbedaan, Fitur Baru, dan Perlukah Upgrade?

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Google menyegarkan tingkatan Flash-nya pada 21 Juli 2026, dan model andalannya melompat satu versi ke Gemini 3.6 Flash. Jika Anda menjalankan 3.5 Flash dalam produksi, berikut versi singkatnya: 3.6 Flash adalah pengganti langsung yang lebih murah dan lebih efisien dalam penggunaan token, dan sebagian besar tim harus melakukan peningkatan. Keluarga model yang sama, konteks 1M-token yang sama, harga input yang sama. Biaya output lebih murah per token, dan model menulis lebih sedikit token output untuk menyelesaikan pekerjaan yang sama. Untuk penjelasan lengkap tentang model baru ini, lihat apa itu Gemini 3.6 Flash.

button

Jawaban singkat

Lakukan peningkatan. Gemini 3.6 Flash mempertahankan harga input $1.50 per juta, memotong harga output dari $9.00 menjadi $7.50 per juta, dan menghasilkan sekitar 17% lebih sedikit token output dibandingkan 3.5 Flash untuk tugas yang sama. Ini juga mencetak skor lebih tinggi pada tolok ukur penggunaan komputer (83.0 vs 78.4 pada OSWorld-Verified) dan membutuhkan langkah penalaran yang lebih sedikit pada alur kerja multi-langkah. Satu-satunya alasan untuk menunda: Anda telah mengunci dan memvalidasi 3.5 Flash dalam produksi dan belum bisa menjalankan evaluasi Anda lagi.

Gemini 3.6 Flash vs 3.5 Flash secara berdampingan

Berikut adalah perbandingan yang penting, langsung dari angka peluncuran Google. Detailnya ada di postingan blog Google dan halaman model DeepMind Flash.

Atribut Gemini 3.6 Flash Gemini 3.5 Flash
ID Model gemini-3.6-flash gemini-3.5-flash
Harga input (per 1 Juta token) $1.50 $1.50
Harga output (per 1 Juta token) $7.50 $9.00
Efisiensi token output ~17% lebih sedikit token output dasar
Penggunaan komputer (OSWorld-Verified) 83.0 78.4
Jendela konteks 1 Juta token input 1 Juta token input

Harga input tidak berubah. Jendela konteks tidak berubah. Perubahan ada pada sisi output dan seberapa efisien model mencapai jawaban.

Apa yang sebenarnya meningkat

Empat hal berubah, dan itulah alasan untuk bermigrasi.

Lebih sedikit token output. Gemini 3.6 Flash menghasilkan sekitar 17% lebih sedikit token output dibandingkan 3.5 Flash untuk pekerjaan yang sama. Token output termasuk token berpikir, jadi pemikir yang lebih efisien menulis lebih sedikit untuk mencapai jawaban yang sama. Anda membayar untuk setiap token output, jadi ini adalah garis biaya langsung, bukan metrik kesombongan.

Harga output lebih rendah. Google memotong harga output dari $9.00 menjadi $7.50 per juta token. Itu adalah pemotongan harga 17% pada tarif per token, di atas pengurangan jumlah token di atas.

Penggunaan komputer yang lebih baik. Pada OSWorld-Verified, tolok ukur untuk menggerakkan antarmuka komputer nyata, 3.6 Flash mencetak skor 83.0 berbanding 78.4 untuk 3.5 Flash. Jika Anda membangun agen yang mengklik UI, mengisi formulir, atau mengoperasikan alat, celah itu muncul sebagai langkah yang gagal lebih sedikit.

Langkah penalaran dan panggilan alat yang lebih sedikit. Pada alur kerja agen multi-langkah, 3.6 Flash mencapai tujuan dengan langkah penalaran dan panggilan alat yang lebih sedikit. Setiap panggilan alat yang dihindari adalah perjalanan pulang pergi yang tidak Anda bayar dan tidak Anda tunggu, jadi ini menggabungkan dengan penghematan token pada apa pun yang bersifat agen. Akurasi pengkodean juga meningkat, yang penting jika model mengedit file atau menghasilkan perbedaan di mana satu token yang salah merusak pembangunan.

Tidak ada yang mengubah bentuk API. Format permintaan yang sama, modalitas yang sama (teks, gambar, video, audio, PDF), teks keluar yang sama.

Apa artinya bagi tagihan Anda

Kedua efek biaya saling bertumpuk. Anda mendapatkan harga yang lebih rendah per token output DAN lebih sedikit token output yang harus dibayar. Keduanya berlipat ganda, bukan hanya bertambah.

Berikut adalah contoh ilustratif. Katakanlah pekerjaan harian menghasilkan 10 juta token output pada 3.5 Flash:

Itu kira-kira diskon 31% dari sisi output beban kerja itu, dan Anda tidak mengubah satu pun prompt. Biaya input Anda tetap datar karena harga input identik pada $1.50 per juta dan prompt Anda tidak berubah. Pada beban kerja agen dengan banyak panggilan alat, penurunan bisa lebih besar, karena lebih sedikit perjalanan pulang pergi juga mengurangi total token di seluruh jalannya proses.

Angka sebenarnya Anda tergantung pada rasio input-ke-output Anda. Pekerjaan yang banyak membaca dan sedikit menulis (klasifikasi, ekstraksi) melihat perubahan total yang lebih kecil karena penghematan terkonsentrasi pada output. Pekerjaan yang banyak menulis (penyusunan, pembuatan kode, jejak agen yang panjang) melihat keuntungan terbesar. Untuk rincian lengkap tarif, caching, dan detail token berpikir, lihat harga Gemini 3.6 Flash dan dokumen harga Gemini API resmi.

Apakah ada alasan untuk tetap menggunakan 3.5 Flash?

Ya, ada satu alasan kecil. Jujurlah pada diri sendiri tentang kasus mana yang Anda alami.

Alasan yang sah untuk mengunci 3.5 Flash adalah Anda sudah memvalidasinya dalam produksi dan Anda belum dapat menguji ulang saat ini. Mungkin Anda memiliki rangkaian evaluasi yang terkunci yang terkait dengan persetujuan kepatuhan. Mungkin Anda memiliki output yang disetel dengan prompt yang bergantung pada parser hilir, dan jendela regresi tidak terbuka pada sprint ini. Pertukaran model mengubah output dengan cara yang halus, dan "lebih murah" tidak sepadan dengan kerusakan diam-diam dalam sistem yang tidak dapat Anda validasi ulang hari ini. Dalam kasus itu, tetap gunakan gemini-3.5-flash sampai Anda memiliki jendela pengujian, lalu bermigrasi dengan sengaja.

Agar jelas: 3.5 Flash tidak akan hilang pada hari 3.6 dikirimkan. Ini masih tersedia melalui API, dan menguncinya adalah panggilan jangka pendek yang valid. Ini adalah "kapan," bukan "jika." Bagi sebagian besar tim tanpa kunci validasi yang ketat, uang dan kualitas sama-sama mengarah pada peningkatan sekarang.

Cara bermigrasi

Bagian mekanisnya hanya satu baris. Dalam panggilan API Anda, tukar ID model:

Itulah seluruh perubahan kode. Badan permintaan, otentikasi, dan titik akhir adalah sama, jadi tidak ada yang lain dalam integrasi Anda yang bergerak. Untuk penelusuran lengkap permintaan demi permintaan, lihat cara menggunakan Gemini 3.6 Flash API dan dokumen Gemini API.

Pekerjaan sebenarnya adalah verifikasi, bukan pertukaran. Sebelum Anda mengirim ID model baru ke produksi:

  1. Jalankan kembali rangkaian evaluasi Anda terhadap 3.6 Flash dan bandingkan skor kualitas dengan dasar 3.5 Flash Anda.
  2. Jalankan kembali pengujian regresi Anda, karena bentuk dan frasa output dapat bergeser antar versi.
  3. Periksa apa pun yang mengurai output model berdasarkan struktur yang tepat (kunci JSON, regex, validasi skema hilir).
  4. Amati latensi dan jumlah token pada sampel lalu lintas nyata sebelum meluncurkan sepenuhnya.

Jika output Anda mengalirkan layanan lain, perlakukan pertukaran seperti peningkatan dependensi lainnya: ubah di belakang sebuah flag, bandingkan, lalu promosikan.

Uji regresi pertukaran di Apidog

Di sinilah Apidog mendapatkan tempatnya dalam migrasi. Apidog adalah klien API dan platform pengujian, jadi ini adalah tempat alami untuk membuktikan bahwa 3.6 Flash berperilaku baik sebelum Anda memercayainya dalam produksi. Ini tidak menjalankan model; ini mengirimkan permintaan dan memeriksa respons.

Cara bersih untuk A/B kedua model:

  1. Simpan permintaan Gemini Anda yang sudah ada. Buat panggilan POST ke Gemini API di Apidog, dengan kunci API Anda disimpan dalam variabel lingkungan sehingga tidak pernah berada di badan permintaan.
  2. Duplikat. Ubah tepat satu hal: ID model, dari gemini-3.5-flash menjadi gemini-3.6-flash. Segala sesuatu yang lain tetap identik sehingga Anda membandingkan hal yang sama.
  3. Tambahkan penegasan (assertions). Tegaskan kode status dan bidang JSON yang sebenarnya dibaca aplikasi Anda, sehingga perubahan bentuk gagal dengan keras alih-alih bocor ke hilir.
  4. Bandingkan respons dan latensi. Luncurkan keduanya, letakkan output berdampingan, dan periksa apakah respons 3.6 masih melewati setiap penegasan yang dilakukan respons 3.5. Perhatikan waktu respons dan penggunaan token pada masing-masing.
  5. Pertahankan penegasan tetap hijau seiring waktu. Simpan keduanya sebagai skenario pengujian dan jadwalkan sebagai pengujian regresi sehingga perubahan model atau prompt di masa mendatang tidak dapat secara diam-diam melanggar kontrak.

Itulah alur kerja yang jujur: duplikasikan permintaan, ubah hanya ID model, dan biarkan penegasan memberi tahu Anda apakah pertukaran itu aman. Unduh Apidog jika Anda ingin menjalankan perbandingan terhadap panggilan Gemini Anda sendiri.

FAQ

Apakah Gemini 3.6 Flash adalah pengganti langsung untuk 3.5 Flash? Secara mekanis, ya. Anda mengubah ID model dari gemini-3.5-flash menjadi gemini-3.6-flash dan sisa permintaan tetap sama. Anda tetap harus menjalankan kembali evaluasi dan pengujian regresi Anda sebelum produksi, karena frasa dan struktur output dapat bergeser antar versi.

Apakah harga input berubah? Tidak. Input tetap pada $1.50 per juta token pada kedua model. Hanya harga output yang berubah, dari $9.00 menjadi $7.50 per juta.

Mengapa modelnya 3.6 tetapi varian Lite dan Cyber adalah 3.5? Google hanya menaikkan model Flash andalannya ke 3.6 dalam penyegaran ini. Flash-Lite dan Flash Cyber dikirim sebagai versi 3.5. Nomor versi tidak sinkron di seluruh tingkatan, jadi baca ID model, bukan hanya nomor keluarga.

Apakah tagihan saya pasti akan turun 31%? Tidak, angka tersebut adalah contoh ilustratif untuk beban kerja yang mengutamakan output. Penghematan aktual Anda tergantung pada rasio token input-ke-output Anda. Pekerjaan yang banyak output paling banyak menghemat; pekerjaan yang banyak membaca lebih sedikit menghemat karena diskon berlaku pada output.

Apakah 3.5 Flash masih dapat digunakan? Ya. Ini tetap tersedia melalui API. Jika Anda telah memvalidasinya dan belum dapat menguji ulang, menguncinya adalah pilihan jangka pendek yang masuk akal. Rencanakan migrasi untuk jendela pengujian Anda berikutnya.

Untuk generasi sebelumnya yang digantikan model ini, lihat apa itu Gemini 3.5.

Bagi sebagian besar tim, perhitungan dan tolok ukur setuju: tukar ID model ke gemini-3.6-flash, jalankan evaluasi Anda dan uji regresi singkat di Apidog, dan ambil model yang lebih murah dan efisien. Pertahankan 3.5 Flash hanya jika kunci validasi memaksa Anda, dan bermigrasi saat jendela itu terbuka.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.