Gemini 3.6 Flash berbiaya $1.50 per 1 juta token masukan dan $7.50 per 1 juta token keluaran. Itu lebih murah daripada model yang digantikannya. Google merilis pembaruan ini pada 21 Juli 2026, dan bagi siapa pun yang memperhatikan tagihan API, intinya sederhana: tingkat Flash yang menjadi tulang punggung menjadi lebih cepat dan lebih murah pada saat yang bersamaan.
Panduan ini merinci setiap angka yang perlu Anda anggarkan: tarif per-token, apa yang ditambahkan oleh cache konteks, apa yang dicakup oleh tingkat gratis, dan contoh yang sudah dikerjakan sehingga Anda dapat memprediksi pengeluaran bulanan sebelum Anda menulis sebaris kode pun. Setiap angka di sini berasal dari dokumen harga API Gemini milik Google sendiri dan pengumuman peluncuran. Jika Anda ingin gambaran umum model lengkap terlebih dahulu, bacalah apa itu Gemini 3.6 Flash.
Satu catatan penamaan sebelum angka-angka. Model tulang punggung melompat ke versi 3.6, tetapi tingkat Flash-Lite yang lebih murah tetap di 3.5. Peluncuran yang sama, versi yang berbeda. Ingat itu, dan harganya akan cocok dengan rapi.
Harga Gemini 3.6 Flash Sekilas
| Item | Biaya |
|---|---|
| Masukan | $1.50 per 1 juta token |
| Keluaran (termasuk token berpikir) | $7.50 per 1 juta token |
| Penyimpanan konteks, pembacaan masukan dari cache | $0.15 per 1 juta token |
| Penyimpanan konteks, penyimpanan | $1.00 per 1 juta token per jam |
| Tingkat gratis | Ya, melalui Google AI Studio (dibatasi kecepatan) |
Dua hal yang perlu diperhatikan segera. Harga keluaran mencakup token berpikir, jadi penalaran yang dilakukan model sebelum menjawab ditagih dengan tarif keluaran $7.50, bukan pada baris terpisah. Dan penyimpanan konteks memiliki dua bagian: tarif baca yang murah untuk masukan yang di-cache, ditambah biaya penyimpanan per jam selama Anda menjaga cache tetap aktif. Penyimpanan cache menghemat uang untuk konteks berulang, tetapi tidak gratis, jadi penghematan hanya muncul ketika Anda sering menggunakan kembali awalan prompt yang sama.
Perbandingannya dengan Gemini 3.5 Flash
Tarif keluaran turun dari $9.00 per 1 juta token pada 3.5 Flash menjadi $7.50 pada 3.6 Flash. Itu saja sudah sekitar 17% lebih murah per token keluaran.
Cerita yang lebih besar adalah apa yang dilaporkan Google di halaman model DeepMind Flash: 3.6 Flash menghasilkan sekitar 17% lebih sedikit token keluaran untuk tugas yang sama. Ia bernalar dalam langkah yang lebih sedikit dan melakukan panggilan alat yang lebih sedikit pada pekerjaan multi-langkah. Jadi, Anda membayar tarif yang lebih rendah untuk jumlah token yang lebih kecil. Kedua tuas ini saling berlipat ganda, yang akan kami tunjukkan dengan aritmatika nyata di bawah.
Jika Anda masih menganggarkan terhadap model lama, rincian harga Gemini 3.5 Flash layak dibaca secara berdampingan. Untuk perbandingan fitur dan benchmark lengkap, lihat Gemini 3.6 Flash vs 3.5 Flash. Versi singkat untuk dompet Anda: 3.6 Flash membutuhkan biaya lebih sedikit untuk dijalankan daripada model yang digantikannya, dan perbedaan semakin melebar pada beban kerja agen yang lebih panjang di mana penghematan token bertambah.
Apa yang Anda dapatkan dari tingkat gratis
Ada tingkat gratis yang nyata, tersedia melalui Google AI Studio. Anda dapat memanggil Gemini 3.6 Flash tanpa kartu kredit dan membuat prototipe secara gratis.
Jujurlah pada diri sendiri tentang batasannya. Tingkat gratis dibatasi kecepatannya, jadi dirancang untuk pembuatan prototipe dan pengujian ringan, bukan lalu lintas produksi. Dan Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya. Itu berarti tingkat gratis bukanlah tempat yang tepat untuk data sensitif, kepemilikan, atau pelanggan. Ketika Anda beralih ke sesuatu yang nyata, beralihlah ke kunci berbayar di mana ketentuan penggunaan data tersebut tidak berlaku.
Untuk panduan lengkap tentang apa yang diizinkan oleh tingkat gratis dan cara mengaturnya, lihat cara menggunakan Gemini 3.6 Flash secara gratis. Tidak ada opsi "gratis tanpa batas" di sini, jadi rencanakan untuk beralih ke penggunaan berbayar setelah Anda meluncurkan.
Contoh biaya yang sudah dikerjakan
Katakanlah Anda menjalankan agen yang banyak membaca dan sedikit menulis: 2 juta token masukan dan 500 ribu token keluaran per hari. Itu adalah bentuk yang realistis untuk asisten yang banyak mengambil data yang menarik dokumen dan mengembalikan jawaban singkat.
Berikut adalah tagihan harian pada Gemini 3.6 Flash:
- Masukan: 2 juta token dikalikan $1.50 per 1 juta = $3.00
- Keluaran: 500 ribu token dikalikan $7.50 per 1 juta = $3.75
- Total harian: $6.75
- Bulanan (30 hari): sekitar $202.50
Sekarang efek berlipat ganda. Misalkan tugas yang sama pada 3.5 Flash mengeluarkan 600 ribu token keluaran. Pada 3.6 Flash, pengurangan 17% menurunkannya menjadi sekitar 500 ribu, yang telah kita anggarkan di atas. Bandingkan saja baris keluaran:
- Keluaran 3.5 Flash: 600 ribu dikalikan $9.00 per 1 juta = $5.40 per hari
- Keluaran 3.6 Flash: 500 ribu dikalikan $7.50 per 1 juta = $3.75 per hari
Itu $1.65 lebih murah per hari, atau sekitar $49.50 per bulan, hanya di sisi keluaran. Tagihan keluaran turun sekitar 31%, meskipun pemotongan harga dan pengurangan token masing-masing hanya sekitar 17%. Token yang lebih murah dikalikan token yang lebih sedikit adalah tempat penghematan nyata berada.
Flash-Lite bahkan lebih murah
Jika tugas Anda sederhana, ada tingkat di bawah model tulang punggung. Gemini 3.5 Flash-Lite berbiaya $0.30 per 1 juta token masukan dan $2.50 per 1 juta token keluaran, dengan cache seharga $0.03 per 1 juta ditambah biaya penyimpanan yang sama yaitu $1.00 per 1 juta per jam. Ia juga berjalan cepat, sekitar 350 token keluaran per detik.
Jalankan beban kerja 2 juta masukan dan 500 ribu keluaran yang sama pada Flash-Lite dan tagihan harian sekitar $1.85, kira-kira $55.50 per bulan. Itu sekitar 70% lebih murah daripada 3.6 Flash untuk jumlah token yang identik.
Kendalanya adalah kualitas. Flash-Lite disetel untuk pekerjaan bervolume tinggi, berkompleksitas rendah: klasifikasi, ekstraksi, perutean, balasan terstruktur singkat. Ini bukan versi yang lebih lemah dari hal yang sama; ini adalah titik yang berbeda pada kurva biaya, kualitas, dan latensi. Gunakanlah ketika tugasnya sederhana dan volumenya tinggi, dan simpan 3.6 Flash untuk penalaran yang lebih sulit. Untuk gambaran lengkapnya, bacalah apa itu Gemini 3.5 Flash-Lite, lalu Gemini 3.5 Flash-Lite vs 3.6 Flash untuk memilih tingkat yang tepat per rute.
Cara mengontrol dan mengukur biaya Anda
Empat tuas ini menjaga tagihan tetap rendah:
- Cache konteks berulang. Jika setiap permintaan berbagi prompt sistem yang panjang atau dokumen referensi yang sama, cache konteks mengenakan biaya $0.15 per 1 juta untuk pembacaan dari cache alih-alih $1.50. Ingat saja biaya penyimpanan $1.00 per 1 juta per jam, jadi caching menguntungkan jika Anda sering menggunakan kembali awalan dalam satu jam, bukan hanya sekali.
- Pangkas prompt. Keluaran lima kali lipat harga masukan, tetapi masukan yang berlebihan masih akan bertambah seiring skala. Hilangkan bagian yang tidak perlu, dan batasi token keluaran maksimum agar respons yang tidak terkendali tidak mengejutkan Anda.
- Arahkan tugas sederhana ke Flash-Lite. Kirim klasifikasi dan ekstraksi ke tingkat yang lebih murah dan cadangkan 3.6 Flash untuk penalaran multi-langkah. Perutean campuran seringkali lebih baik daripada memilih satu model untuk semuanya.
- Ukur penggunaan token nyata. Estimasi bisa salah.
usageMetadatadi setiap respons Gemini memberi tahu Anda dengan tepat berapa banyak token masukan, keluaran, dan berpikir yang digunakan dalam sebuah panggilan, dan itulah angka yang menjadi dasar faktur Anda.
Poin terakhir itulah di mana klien API menunjukkan nilainya. Di Apidog Anda dapat membuat permintaan POST ke API Gemini, menyimpan kunci Anda dalam variabel lingkungan, dan mengirim panggilan nyata terhadap prompt Anda yang sesungguhnya. Baca bidang usageMetadata langsung dari respons untuk melihat jumlah token aktual per permintaan, lalu tambahkan pernyataan agar perubahan prompt yang menggandakan token keluaran gagal dalam pengujian alih-alih secara diam-diam menggandakan tagihan Anda. Anda bahkan dapat menjadwalkan pengujian API tersebut untuk berjalan secara teratur dan mendeteksi regresi biaya sejak dini. Ingin mengikuti? Unduh Apidog dan arahkan permintaan ke endpoint Gemini sebelum Anda menyambungkannya ke produksi.
FAQ
Berapa biaya Gemini 3.6 Flash per 1 juta token? $1.50 untuk masukan dan $7.50 untuk keluaran. Pembacaan cache konteks berbiaya $0.15 per 1 juta, dengan biaya penyimpanan $1.00 per 1 juta per jam.
Apakah harga keluaran termasuk token berpikir? Ya. Penalaran yang dilakukan model sebelum menjawab ditagih dengan tarif keluaran $7.50. Tidak ada biaya terpisah untuk token berpikir, tetapi itu dihitung ke total keluaran Anda, jadi lebih banyak penalaran berarti tagihan yang lebih besar.
Apakah benar ada tingkat gratis? Ya, melalui Google AI Studio, dan dibatasi kecepatannya. Ini dimaksudkan untuk pembuatan prototipe dan pengujian, bukan produksi. Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya, jadi simpan data sensitif pada kunci berbayar.
Apakah Gemini 3.6 Flash lebih murah dari 3.5 Flash? Ya. Tarif keluaran turun dari $9.00 menjadi $7.50, dan 3.6 Flash menggunakan sekitar 17% lebih sedikit token keluaran untuk tugas yang sama. Kedua efek tersebut saling bertambah, sehingga tagihan keluaran di dunia nyata bisa turun sekitar 31%.
Kapan sebaiknya saya menggunakan Flash-Lite? Ketika tugasnya sederhana dan volumenya tinggi. Dengan $0.30 untuk masukan dan $2.50 untuk keluaran, Flash-Lite kira-kira 70% lebih murah untuk jumlah token yang sama, dan cepat, tetapi 3.6 Flash menangani penalaran yang lebih sulit dengan lebih baik.
Gemini 3.6 Flash adalah pembaruan harga yang langka di mana angkanya turun dan modelnya menjadi lebih baik pada saat yang bersamaan. Anggarkan $1.50 untuk masukan dan $7.50 untuk keluaran, ingat bahwa token berpikir termasuk dalam tarif keluaran, dan andalkan caching ditambah perutean Flash-Lite untuk mengurangi sisanya. Untuk konteks historis tentang bagaimana biaya API Gemini bergerak di seluruh rilis, rincian biaya API Gemini 3.0 adalah acuan yang berguna. Kemudian ukur panggilan Anda sendiri di Apidog agar jumlah token yang Anda rencanakan adalah yang benar-benar Anda bayar.
