Gemini 3.8 Flash berharga $0.75 per juta token masukan dan $3.75 per juta token keluaran, tarif perkenalan yang sama yang ditetapkan Google untuk 3.7 Flash. Tarif tersebut berlaku hingga 31 Desember 2026. Pada 1 Januari 2027, tarif tersebut berlipat ganda menjadi $1.50 dan $7.50, dan penggandaan yang sama juga berlaku untuk 3.6 Flash dan 3.7 Flash pada hari yang sama. Tidak ada perubahan harga per token dengan rilis ini.
Yang berubah adalah berapa banyak token yang digunakan model. Google mengatakan 3.8 Flash "bekerja lebih keras": ia melakukan lebih banyak langkah penalaran, memanggil alat secara iteratif, dan "dapat menggunakan lebih banyak token pada tugas yang berjalan lebih lama dan kompleks, sesuai desain". Artificial Analysis mengukur efeknya secara independen: menjalankan Intelligence Index-nya membutuhkan biaya $0.58 per tugas pada 3.8 Flash dengan tingkat pemikiran tinggi versus $0.40 pada 3.7 Flash, dengan sekitar 30% lebih banyak token keluaran per tugas. Harga eceran sama, tagihan lebih tinggi.
Panduan ini menjelaskan setiap baris di halaman harga API Gemini resmi, menyajikan contoh 1.000 tugas sehari pada setiap tingkat pemikiran, dan membandingkan tarif dengan Flash-Lite, Claude Sonnet 5, dan GPT-5.6 Luna. Untuk tinjauan umum model, mulailah dengan apa itu Gemini 3.8 Flash.
Sekilas Harga Gemini 3.8 Flash
Semua harga adalah per 1 juta token pada tingkat berbayar.
| Tarif | Perkenalan (hingga 31 Des 2026) | Standar (mulai 1 Jan 2027) |
|---|---|---|
| Masukan (teks, gambar, video, audio, PDF) | $0.75 | $1.50 |
| Keluaran (termasuk token pemikiran) | $3.75 | $7.50 |
| Pembacaan cache konteks | $0.075 | $0.15 |
| Penyimpanan cache (per 1 Juta token per jam) | $0.50 | $1.00 |
| Masukan Batch API (diskon 50%) | $0.375 | $0.75 |
| Keluaran Batch API (diskon 50%) | $1.875 | $3.75 |
| Penelusuran Google | 5.000 permintaan gratis/bulan yang dibagi di seluruh Gemini 3.x, lalu $14 per 1.000 | Sama |
| Tingkat gratis | $0, terbatas kecepatan, data digunakan untuk meningkatkan produk Google | Sama |
Tiga detail lebih penting daripada angka-angka utama. Harga keluaran mencakup token pemikiran, sehingga penalaran internal dikenakan biaya $3.75, bukan $0.75. Tarif perkenalan memiliki tanggal berakhir yang pasti. Dan baris 3.7 Flash dan 3.6 Flash memiliki penggandaan pada 1 Januari yang identik, sehingga Flash yang lebih lama tidak akan melindungi Anda dari peningkatan tersebut. Rincian harga 3.7 Flash mencakup tarif yang sama pada model yang menggunakan lebih sedikit token per tugas.
Token pemikiran adalah token keluaran
Gemini 3.8 Flash melakukan penalaran sebelum memberikan jawaban, dan setiap token dari penalaran tersebut diukur sebagai keluaran. API melaporkan jumlahnya sebagai usageMetadata.thoughtsTokenCount pada respons generateContent, terpisah dari candidatesTokenCount (jawaban yang terlihat) dan promptTokenCount (masukan Anda). Kedua kategori keluaran tersebut dikenakan biaya yang sama yaitu $3.75.
Anda mengarahkan jumlahnya dengan thinking_level: low, medium, atau high. Pada 3.8 Flash, default-nya adalah medium, bukan high seperti pada Gemini 3 Pro. minimal sudah tidak ada dan mengembalikan kesalahan validasi, jadi konfigurasi apa pun yang dibawa dari model sebelumnya perlu nilai tersebut dipetakan ke low. Dokumentasi pemikiran Google menggambarkan level-level tersebut sebagai usaha relatif, bukan anggaran token, sehingga Anda tidak dapat membatasi token pemikiran secara langsung seperti yang diizinkan oleh thinking_budget bilangan bulat lama. Apa yang dilakukan setiap level terhadap latensi dan biaya ada di panduan level pemikiran 3.8 Flash.
Ilustrasi singkat dengan ukuran yang dibuat-buat tetapi realistis. Misalkan sebuah permintaan mengirim 10.000 token masukan dan mendapatkan kembali 2.000 token keluaran yang terlihat ditambah 6.000 token pemikiran. Dengan tarif perkenalan:
- Masukan: 10.000 x $0.75 / 1.000.000 = $0.0075
- Keluaran: (2.000 + 6.000) x $3.75 / 1.000.000 = $0.03
- Total: $0.0375 per permintaan
Pemikiran menyumbang 75% dari biaya keluaran dan 60% dari seluruh permintaan. Mulai 1 Januari, permintaan yang sama berharga $0.015 + $0.06 = $0.075. Pernyataan "harga sama dengan 3.7" benar tetapi tidak lengkap: tarif tetap sama, tetapi jumlah token yang digunakan berubah.
Mengapa biaya per tugas naik sementara harganya tidak
Pos peluncuran Google secara langsung menjelaskan tentang pertukaran ini: pada tugas-tugas kompleks, model "menjalankan langkah-langkah penalaran tambahan, dan memanggil alat secara iteratif", memverifikasi pekerjaannya. Lebih banyak langkah berarti lebih banyak token pemikiran dan, dalam loop agen, lebih banyak giliran panggilan alat. Saran mitigasi Google: turunkan thinking_level, atau tetap gunakan 3.7 Flash.
Artificial Analysis menyajikan angka-angkanya. Intelligence Index-nya menjalankan sembilan evaluasi; 3.8 Flash pada level tinggi mencetak 59 berbanding 56 untuk 3.7 Flash pada level tinggi, menggunakan sekitar 48.000 token keluaran per tugas rata-rata, naik 30% dari 3.7 Flash. Biaya untuk menjalankan indeks per tugas:
| Konfigurasi | Biaya per tugas (AA, tarif perkenalan) | Waktu per tugas |
|---|---|---|
| Gemini 3.8 Flash, tinggi | $0.58 | 2.5 menit |
| Gemini 3.8 Flash, sedang | $0.41 | tidak dipublikasikan |
| Gemini 3.8 Flash, rendah | $0.24 | 0.8 menit |
| Gemini 3.7 Flash, tinggi | $0.40 | 2.2 menit |
Baca tabel ini dengan dua cara. Dibandingkan pendahulunya, 3.8 Flash pada level tinggi membutuhkan biaya 45% lebih banyak per tugas ($0.58 / $0.40 = 1.45) untuk kenaikan indeks tiga poin. Dibandingkan dengan dirinya sendiri, menurunkan dari tinggi ke sedang memangkas biaya per tugas sebesar 29% ($0.41 / $0.58 = 0.71), dan rendah memangkasnya sebesar 59% ($0.24 / $0.58 = 0.41). Level sedang pada 3.8 Flash berada dalam selisih satu sen dari level tinggi pada 3.7 Flash, sebuah patokan yang berguna saat memutuskan apakah akan melakukan peningkatan sama sekali. Perbandingan 3.8 Flash vs 3.7 Flash menjelaskan keputusan tersebut berdasarkan beban kerja.
Artificial Analysis juga mencantumkan harga gabungan $0.58 per juta token dengan rasio masukan-ke-keluaran 3:1. Bahwa itu cocok dengan biaya tingkat tinggi per tugas adalah kebetulan; yang satu adalah tarif per token, yang lain tergantung pada berapa banyak token yang dipilih model untuk digunakan.
Kunci tarif perkenalan sebelum 31 Desember
"Kunci" memerlukan makna yang tepat, karena tarif perkenalan bukanlah kontrak. Google menagih penggunaan pada tarif yang berlaku saat token dikonsumsi, sehingga Anda tidak dapat membayar di muka penggunaan tahun 2027 dengan harga tahun 2026, dan beralih ke 3.7 atau 3.6 Flash tidak akan membantu. Yang bisa Anda lakukan adalah menggeser pekerjaan diskresioner ke dalam jendela waktu tersebut:
- Jalankan pengisian ulang dan pemrosesan dokumen sekali jalan sekarang melalui Batch API. Pengisian ulang 100 juta token (75 juta masukan, 25 juta keluaran) berharga 75 x $0.375 + 25 x $1.875 = $28.13 + $46.88 = $74.99 dalam batch tahun ini, dan dua kali lipatnya, $149.98, pada bulan Januari.
- Buat set evaluasi dan hitungan token dasar Anda sebelum harga berubah, sehingga tagihan Januari hanya memiliki satu variabel yang bergerak, bukan dua.
- Putuskan tingkat pemikiran per rute pada kuartal ini. Setiap rute yang secara default tetap pada
mediumadalah rute yang biayanya belum Anda periksa. Rute yang lolos evaluasi padalowharus berada padalowsebelum Januari.
Jika harga adalah faktor penentu di antara penyedia, rangkuman penyedia API LLM termurah kami menjelaskan seluruh bidang; perbandingan Fable 5.1 dan GPT-5.6 Sol mencakup tingkatan premium.
Bagaimana perbandingannya dengan Flash-Lite, Sonnet 5, dan GPT-5.6 Luna
Tarif per token, per 1 juta token:
| Model | Masukan | Keluaran | Catatan |
|---|---|---|---|
| Gemini 3.8 Flash (perkenalan) | $0.75 | $3.75 | Pemikiran ditagih sebagai keluaran; pembacaan cache $0.075 |
| Gemini 3.8 Flash (mulai 1 Jan) | $1.50 | $7.50 | Pembacaan cache $0.15 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | Sekitar 350 tok/dtk |
| Claude Sonnet 5 | $2 | $10 | Permanen; kenaikan 1 Sep dibatalkan |
| GPT-5.6 Luna | $1 | $6 |
Pada tarif perkenalan, masukan 3.8 Flash adalah 2.5x Flash-Lite dan keluarannya adalah 1.5x. Dibandingkan Sonnet 5, 3.8 Flash sekitar 2.7x lebih murah baik pada masukan ($2 / $0.75) maupun keluaran ($10 / $3.75). Dibandingkan Luna juga lebih murah: $0.75 vs $1 pada masukan, $3.75 vs $6 pada keluaran.
Gambaran berubah pada 1 Januari. Dengan harga $1.50 dan $7.50, 3.8 Flash menjadi lebih mahal daripada Luna di kedua sisi, dan selisih dengan Sonnet 5 menyempit menjadi sekitar 1.3x ($2 / $1.50 dan $10 / $7.50). Flash-Lite tetap lebih murah sepanjang waktu. Jika tarif perkenalan adalah alasan Anda memilih 3.8 Flash, catat evaluasi ulang Januari di kalender Anda sekarang.
Perbandingan per token hanyalah separuhnya. Model yang menggunakan lebih sedikit token per jawaban dapat berharga lebih rendah per tugas pada tarif yang lebih tinggi, dan satu-satunya cara untuk mengetahuinya adalah dengan menjalankan set tugas yang sama melalui setiap kandidat dan membaca kembali jumlah penggunaannya. Panduan API 3.8 Flash menunjukkan cara membaca usageMetadata dari Interactions API dan generateContent lama.
Tangkap regresi biaya dengan pernyataan token Apidog
Mode kegagalan dengan 3.8 Flash bukanlah jawaban yang salah. Ini adalah jawaban yang benar tetapi diam-diam menggunakan 40% lebih banyak token setelah penyesuaian prompt atau perubahan tingkat pemikiran, dan tidak ada yang menyadarinya sampai tagihan datang. Apidog memperbaikinya dengan memperlakukan jumlah token sebagai bidang untuk ditegaskan, seperti kode status.

- Simpan kunci sebagai variabel lingkungan. Buat
GEMINI_API_KEYdi lingkungan Apidog dan referensikan sebagai{{GEMINI_API_KEY}}di headerx-goog-api-key, sehingga kunci tidak pernah tersimpan dalam permintaan yang disimpan. - Kirim prompt emas. Simpan permintaan
POSTkehttps://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContentdengan prompt yang representatif danthinkingConfig.thinkingLevelyang eksplisit, satu per rute produksi. - Tegaskan pada bidang penggunaan. Tambahkan skrip pasca-pemrosesan yang membaca
usageMetadatadan menggagalkan pengujian jika token melebihi batas atas yang ditetapkan dari baseline Anda:
const usage = pm.response.json().usageMetadata;
pm.test("token pemikiran dalam anggaran", () => {
pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("keluaran terlihat dalam anggaran", () => {
pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("biaya permintaan dalam anggaran", () => {
const cost = usage.promptTokenCount * 0.75 / 1e6
+ (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
pm.expect(cost).to.be.below(0.05);
});
- Jadwalkan. Masukkan permintaan ke dalam skenario pengujian dan jalankan sesuai jadwal, sehingga lonjakan penggunaan token muncul sebagai kegagalan pada hari yang sama; panduan kami tentang penjadwalan pengujian API di Apidog mencakup penyiapan. Perbarui dua konstanta tarif pada 1 Januari dan penegasan biaya akan terus melacak tagihan.
Skenario yang sama juga berfungsi sebagai perbandingan penyedia: arahkan salinan ke Flash-Lite, Sonnet 5, atau Luna dan bandingkan bidang penggunaan secara berdampingan. Unduh Apidog untuk membangun skenario pertama; paket gratis mencakup alur kerja ini.
FAQ
Apakah Gemini 3.8 Flash berharga lebih mahal dari 3.7 Flash? Per token, tidak. Keduanya $0.75 masukan dan $3.75 keluaran hingga 31 Desember, lalu $1.50 dan $7.50. Per tugas, ya: Artificial Analysis mengukur $0.58 per tugas indeks pada 3.8 Flash di tingkat tinggi versus $0.40 pada 3.7 Flash, karena 3.8 Flash menghasilkan sekitar 30% lebih banyak token keluaran.
Apakah token pemikiran ditagih terpisah? Tidak. Token tersebut ditagih sebagai token keluaran dengan harga $3.75 per juta (perkenalan) dan muncul di usageMetadata.thoughtsTokenCount. Anda mengendalikannya secara tidak langsung melalui thinking_level; tidak ada anggaran token tetap pada 3.8 Flash, dan minimal mengembalikan kesalahan.
Apakah ada tingkat gratis untuk Gemini 3.8 Flash? Ya. Tingkat gratis AI Studio tidak mengenakan biaya untuk masukan atau keluaran, dengan batas kecepatan yang ditunjukkan di AI Studio, dan Google menggunakan data tingkat gratis untuk meningkatkan produknya. Aplikasi Gemini untuk konsumen hanya melayani 3.8 Flash kepada pelanggan AI Pro dan Ultra. Detailnya ada di panduan penggunaan gratis.
Apa yang terjadi pada biaya saya pada 1 Januari 2027? Tarif masukan, keluaran, pembacaan cache, penyimpanan cache, dan batch semuanya berlipat ganda. Jika penggunaan token per tugas tetap sama, tagihan Anda juga berlipat ganda. Baris 3.6 dan 3.7 Flash berlipat ganda pada tanggal yang sama.
Tingkat pemikiran mana yang menekan biaya? Mulailah dari sebaran Artificial Analysis: rendah $0.24, sedang $0.41, tinggi $0.58 per tugas indeks. Jalankan evaluasi Anda sendiri di setiap level, pertahankan yang terendah yang lolos, dan tegaskan pada jumlah token agar pengaturan tidak bergeser.
Apa yang harus dilakukan minggu ini
Gemini 3.8 Flash diberi harga seperti 3.7 Flash dan menghabiskan token seperti model yang lebih besar. Perlakukan tingkat pemikiran sebagai pengaturan biaya dan atur per rute. Pindahkan pekerjaan yang ramah batch ke jendela perkenalan sebelum 31 Desember. Tetapkan baseline penggunaan token Anda sekarang dan tegaskan, sehingga penggandaan Januari adalah perubahan yang sudah Anda perhitungkan.
