Penjelasan Harga Gemini 3.7 Flash: Amankan Tarif Sebelum Naik Dua Kali Lipat

Harga Gemini 3.7 Flash: $0.75/$3.75 per 1 juta token hingga 31 Desember 2026, setelah itu tarif berlipat ganda. Lihat contoh perhitungan biaya dan lima cara untuk mengurangi pengeluaran token Anda.

Ashley Innocent

Ashley Innocent

14 August 2026

Penjelasan Harga Gemini 3.7 Flash: Amankan Tarif Sebelum Naik Dua Kali Lipat

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Google merilis Gemini 3.7 Flash pada 13 Agustus 2026, tiga minggu setelah 3.6 Flash, dan menyebutnya “model pekerja keras kami yang paling cerdas”. Bagi siapa pun yang memperhatikan tagihan API, detail terpenting ada di tabel harga, bukan di tolok ukur: tarif pengantar sebesar $0.75 per juta token input dan $3.75 per juta token output berakhir pada 31 Desember 2026. Mulai 1 Januari 2027, kedua tarif tersebut akan berlipat ganda.

Itu adalah kenaikan 2x yang terjadwal untuk setiap beban kerja yang Anda bangun di model ini. Chatbot yang saat ini berharga $790 per bulan akan berharga $1.575 per bulan pada bulan Januari tanpa perubahan pada kode, lalu lintas, atau prompt Anda. Jadi, saat Anda menganggarkan proyek 3.7 Flash, pertimbangkan kedua tingkatan, bukan harga awal.

Panduan ini menjelaskan dua tingkatan harga, perhitungan token untuk tiga beban kerja nyata, perbandingan harga dengan API model lainnya, dan cara memangkas pengeluaran sebelum kenaikan harga terjadi. Jika Anda belum mengirim permintaan pertama, panduan memulai cepat API Gemini 3.7 Flash mencakup penyiapan. Setelah Anda melakukan panggilan, Apidog menampilkan jumlah token usageMetadata di setiap respons, sehingga setiap perkiraan di bawah ini menjadi angka yang dapat Anda periksa terhadap lalu lintas langsung.

button

TL;DR

Dua tingkatan harga

Gemini 3.7 Flash diluncurkan dengan diskon waktu terbatas alih-alih harga permanen. Berikut adalah gambaran lengkap untuk Gemini API:

Tingkatan Jendela Waktu Input (per 1 Juta token) Output (per 1 Juta token)
Pengantar 13 Agustus 2026 hingga 31 Desember 2026 $0.75 $3.75
Standar Mulai 1 Januari 2027 $1.50 $7.50

Dua hal menonjol. Pertama, tarif pengantar adalah setengah dari biaya Gemini 3.6 Flash saat diluncurkan, yang menjadikan empat setengah bulan ke depan sebagai jendela waktu termurah yang pernah ada untuk keluarga model ini. Jika Anda mempertimbangkan peningkatan dari 3.6, panduan migrasi 3.6 ke 3.7 Flash mencakup proses pertukaran; pemotongan harga saja sudah menutupi biaya pengujian regresi.

Kedua, token output berharga 5 kali token input pada kedua tingkatan. Rasio tersebut membentuk setiap keputusan optimasi di kemudian hari dalam panduan ini: memangkas prompt sistem yang terlalu panjang menghemat beberapa sen, sementara membatasi output yang tidak terkendali menghemat banyak dolar.

Tarif di atas mencakup Gemini API yang ditagih melalui kunci AI Studio. Vertex AI berjalan melalui penagihan Google Cloud dengan SKU-nya sendiri, dan fitur-fitur seperti penyimpanan cache konteks dan pemrosesan batch memiliki item barisnya sendiri, jadi konfirmasikan angka saat ini di halaman harga resmi sebelum Anda menetapkan anggaran.

Berapa biaya beban kerja nyata

Harga per juta token tidak berarti apa-apa sampai Anda mengalikannya dengan lalu lintas. Berikut adalah tiga profil beban kerja dengan asumsi yang disebutkan, sehingga Anda dapat mengganti dengan angka Anda sendiri.

Beban Kerja 1: chatbot dukungan pelanggan

Asumsikan 10.000 permintaan per hari. Setiap permintaan membawa sekitar 2.000 token input (prompt sistem, jendela riwayat singkat, pesan pengguna) dan mengembalikan sekitar 300 token output.

Item Token harian Biaya pengantar/hari Biaya standar/hari
Input 20 Juta $15.00 $30.00
Output 3 Juta $11.25 $22.50
Total 23 Juta $26.25 $52.50

Itu sekitar $788 per bulan dengan tarif pengantar dan $1.575 per bulan dengan tarif standar selama bulan 30 hari. Per giliran percakapan, Anda membayar sekitar seperempat sen hari ini.

Beban Kerja 2: pipeline dokumen PDF

Gemini 3.7 Flash membaca PDF secara native, dan skor tolok ukur GDP.pdf-nya meningkat dari 22.0% menjadi 34.0% dibandingkan 3.6 Flash, sehingga ekstraksi dokumen adalah beban kerja yang Google harapkan Anda jalankan di sini. Asumsikan 500 dokumen per hari, masing-masing rata-rata 40.000 token input (kontrak atau laporan panjang), menghasilkan ringkasan terstruktur 1.000 token.

Item Token harian Biaya pengantar/hari Biaya standar/hari
Input 20 Juta $15.00 $30.00
Output 0.5 Juta $1.88 $3.75
Total 20.5 Juta $16.88 $33.75

Sekitar $506 per bulan sekarang, $1.013 mulai Januari. Perhatikan polanya: input mendominasi karena dokumennya panjang dan ringkasannya pendek. Caching dan batching paling berdampak pada beban kerja ini.

Beban Kerja 3: loop agen

Agen melipatgandakan panggilan. Asumsikan 200 tugas per hari, masing-masing rata-rata 12 panggilan model, di mana setiap panggilan membawa 8.000 token input (konteks yang berkembang ditambah hasil alat) dan mengembalikan 400 token output.

Item Token harian Biaya pengantar/hari Biaya standar/hari
Input 19.2 Juta $14.40 $28.80
Output 0.96 Juta $3.60 $7.20
Total 20.16 Juta $18.00 $36.00

Itu $540 per bulan dengan tarif pengantar, $1.080 dengan tarif standar. Pelajaran dari penagihan agen: konteks tumbuh di setiap langkah, jadi jumlah panggilan dan panjang konteks berlipat ganda. Sebuah tugas yang membengkak dari 12 panggilan menjadi 20 akan memakan biaya 67% lebih mahal, dan tidak ada dalam tabel harga yang memperingatkan Anda.

Satu lagi angka yang patut diingat: batas output 64 ribu membatasi kasus terburuk per panggilan Anda sekitar $0.24 hari ini dan $0.48 tahun depan. Loop coba lagi yang memaksimalkan output di setiap percobaan akan menjadi mahal dengan cepat, tetapi tidak bisa menjadi mahal tanpa batas.

Perbandingan harga 3.7 Flash

Perbandingan per-token yang tepat di seluruh penyedia menjadi usang dalam hitungan minggu, jadi anggap ini sebagai posisi, bukan daftar harga.

Gemini 3.7 Flash berada di tingkatan pekerja keras: jauh lebih murah daripada model perintis seperti lini Pro milik Gemini sendiri, model yang lebih besar milik Claude, atau tingkatan unggulan OpenAI, sambil membawa skor tolok ukur (65.3% pada DeepSWE v1.1, Elo Arena WebDev 1588) yang tumpang tindih dengan apa yang dicatat oleh model unggulan belum lama ini. Taruhan Google adalah bahwa sebagian besar lalu lintas produksi tidak memerlukan model perintis, dan diskon pengantar adalah undangan empat bulan untuk menguji klaim tersebut pada beban kerja Anda sendiri.

Latar belakang persaingan juga penting. Penyedia tingkat anggaran telah menggerakkan harga ke arah lain; DeepSeek menaikkan tarif API-nya dan mendorong tim untuk memikirkan kembali anggaran token, sebuah kisah yang dibahas dalam panduan peningkatan harga dan optimasi biaya DeepSeek. Pelajarannya berlaku langsung untuk Gemini: harga apa pun yang Anda bangun marginnya dapat berubah, dan Google telah memberi tahu Anda tanggal dan jumlahnya. Itu adalah peringatan lebih dari yang diberikan sebagian besar penyedia.

Jika lalu lintas Anda bersifat sporadis atau eksperimental, ingatlah bahwa kenaikan harga hanya berdampak pada beban kerja yang berkelanjutan. Sebuah prototipe yang berharga $3 selama jendela pengantar akan berharga $6 nanti. Tidak ada yang peduli. Sebuah pipeline $10.000 per bulan yang menjadi $20.000 adalah item pengeluaran yang akan ditanyakan oleh tim keuangan Anda pada bulan Februari.

Lima cara memangkas pengeluaran token

Rasio harga output-ke-input 5x dan kenaikan harga bulan Januari menunjuk pada serangkaian tuas yang sama.

Lacak pengeluaran per endpoint dengan Apidog

Perkiraan memberi Anda anggaran; pengukuran per-permintaan menjaga Anda tetap dalam anggaran tersebut. Setiap respons Gemini menyertakan blok usageMetadata dengan jumlah token prompt dan output, yang berarti lapisan pengujian API Anda dapat berfungsi ganda sebagai pengukur biaya.

Di Apidog, alur kerjanya terlihat seperti ini:

  1. Simpan satu permintaan per endpoint produksi (giliran chat, ringkasan dokumen, langkah agen) dalam koleksi, dengan kunci API terikat ke variabel lingkungan GEMINI_API_KEY.
  2. Bangun skenario pengujian yang memicu setiap permintaan terhadap payload realistis dan mengekstrak usageMetadata.promptTokenCount dan usageMetadata.candidatesTokenCount dari respons.
  3. Tambahkan pernyataan pada hitungan tersebut. Jika pengeditan prompt mendorong endpoint chat melewati, katakanlah, 2.500 token input, skenario akan gagal sebelum perubahan diterapkan dan secara diam-diam menaikkan tagihan Anda sebesar 25%.
  4. Jalankan kembali skenario pada setiap perubahan prompt atau skema. Jumlah token mengalami regresi dengan cara yang sama seperti latensi; perbedaannya adalah regresi token tiba sebagai tagihan.

Kalikan jumlah yang terukur dengan harga tingkatan dalam panduan ini dan Anda akan memiliki angka biaya per-endpoint yang didasarkan pada respons nyata, bukan tebakan. Tim yang sudah menjalankan suite API berbasis pernyataan akan mengenali polanya; panduan pengujian API untuk insinyur QA mencakup cara menyusun skenario seperti ini di seluruh layanan.

FAQ

Kapan harga Gemini 3.7 Flash naik dua kali lipat?

Pada 1 Januari 2027. Tarif pengantar sebesar $0.75 per 1 juta token input dan $3.75 per 1 juta token output berlaku hingga 31 Desember 2026, kemudian beralih ke tarif standar $1.50 dan $7.50. Google menerbitkan kedua tingkatan ini saat peluncuran, jadi kenaikannya sudah terjadwal, bukan spekulatif.

Apakah Gemini 3.7 Flash lebih murah dari Gemini 3.6 Flash?

Saat peluncuran, ya. Harga pengantar 3.7 Flash adalah setengah dari harga peluncuran 3.6 Flash, sementara tolok ukur meningkat secara keseluruhan (DeepSWE v1.1 naik dari 49.0% menjadi 65.3%). Spesifikasi lengkap dan tabel tolok ukur tersedia di referensi cepat Gemini 3.7 Flash jika Anda ingin perbandingan berdampingan.

Apakah harga pengantar berlaku di Vertex AI?

Tarif dalam panduan ini adalah tarif Gemini API yang ditagih melalui kunci AI Studio. Vertex AI menagih melalui Google Cloud dengan SKU dan ketentuan perusahaan sendiri. Jika Anda menjalankan lalu lintas produksi di Vertex, konfirmasikan angka saat ini di konsol penagihan GCP Anda dan halaman harga resmi daripada berasumsi kesamaan.

Apa saja yang dihitung dalam tagihan token input?

Semua yang Anda kirim: teks, gambar, video, audio, dan halaman PDF semuanya diubah menjadi token dan ditagih dengan tarif input. Dokumen panjang dan permintaan yang banyak media adalah tempat biaya input mengejutkan orang, itulah sebabnya contoh pipeline di atas mengasumsikan 40.000 token per dokumen. Blok usageMetadata di setiap respons memberi tahu Anda jumlah pastinya setelah fakta.

Bagaimana cara memperkirakan token sebelum mengirim permintaan?

Gunakan endpoint countTokens API untuk mengukur payload tanpa menghasilkan apa pun, atau kirim beberapa permintaan representatif dan baca usageMetadata dari respons. Bagaimanapun, ukur dengan payload nyata. Intuisi tokenizer dari penyedia lain tidak terlalu relevan di berbagai keluarga model.

Posisi 3.7 Flash dalam stack Anda

Gemini 3.7 Flash dengan harga pengantar adalah model paling murah yang pernah ada dengan kemampuan seperti ini, dan Google telah memberi tahu Anda tanggal pasti kapan hal itu tidak lagi berlaku. Langkah rasional: pindahkan lalu lintas beban kerja Anda ke sana sekarang, ukur konsumsi token nyata per endpoint saat diskon berlaku, dan gunakan data empat bulan tersebut untuk memutuskan apa yang tetap menggunakan 3.7 Flash, apa yang beralih ke model yang lebih ringan, dan seperti apa perkiraan tagihan tarif standar sebelum tiba.

Bagian pengukuran dari rencana itu membutuhkan alat. Unduh Apidog untuk menyimpan permintaan Gemini, lingkungan, pernyataan token, dan pemeriksaan biaya Anda dalam satu ruang kerja, sehingga tagihan Januari adalah angka yang Anda perkirakan, bukan yang Anda temukan.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.