Google merilis Gemini 3.7 Flash pada 13 Agustus 2026, tiga minggu setelah 3.6 Flash, dan menyebutnya “model pekerja keras kami yang paling cerdas”. Bagi siapa pun yang memperhatikan tagihan API, detail terpenting ada di tabel harga, bukan di tolok ukur: tarif pengantar sebesar $0.75 per juta token input dan $3.75 per juta token output berakhir pada 31 Desember 2026. Mulai 1 Januari 2027, kedua tarif tersebut akan berlipat ganda.
Itu adalah kenaikan 2x yang terjadwal untuk setiap beban kerja yang Anda bangun di model ini. Chatbot yang saat ini berharga $790 per bulan akan berharga $1.575 per bulan pada bulan Januari tanpa perubahan pada kode, lalu lintas, atau prompt Anda. Jadi, saat Anda menganggarkan proyek 3.7 Flash, pertimbangkan kedua tingkatan, bukan harga awal.
Panduan ini menjelaskan dua tingkatan harga, perhitungan token untuk tiga beban kerja nyata, perbandingan harga dengan API model lainnya, dan cara memangkas pengeluaran sebelum kenaikan harga terjadi. Jika Anda belum mengirim permintaan pertama, panduan memulai cepat API Gemini 3.7 Flash mencakup penyiapan. Setelah Anda melakukan panggilan, Apidog menampilkan jumlah token usageMetadata di setiap respons, sehingga setiap perkiraan di bawah ini menjadi angka yang dapat Anda periksa terhadap lalu lintas langsung.
TL;DR
- Tarif pengantar: $0.75 per 1 juta token input dan $3.75 per 1 juta token output, berlaku hingga 31 Desember 2026.
- Tarif standar mulai 1 Januari 2027: input $1.50 dan output $7.50. Tepat dua kali lipat.
- Harga pengantar adalah setengah dari biaya Gemini 3.6 Flash saat diluncurkan.
- Model ini menerima input teks, gambar, video, audio, dan PDF di seluruh jendela konteks 1 juta token, dengan batas output 64 ribu token.
- Contoh kasus: chatbot yang melayani 10.000 permintaan per hari menghabiskan sekitar $26 per hari dengan tarif pengantar dan $52.50 per hari dengan tarif standar.
- Penyimpanan cache konteks, batas output, pemrosesan batch, dan perutean lalu lintas ringan ke model yang lebih kecil adalah tuas utama untuk memangkas pengeluaran.
Dua tingkatan harga
Gemini 3.7 Flash diluncurkan dengan diskon waktu terbatas alih-alih harga permanen. Berikut adalah gambaran lengkap untuk Gemini API:
| Tingkatan | Jendela Waktu | Input (per 1 Juta token) | Output (per 1 Juta token) |
|---|---|---|---|
| Pengantar | 13 Agustus 2026 hingga 31 Desember 2026 | $0.75 | $3.75 |
| Standar | Mulai 1 Januari 2027 | $1.50 | $7.50 |
Dua hal menonjol. Pertama, tarif pengantar adalah setengah dari biaya Gemini 3.6 Flash saat diluncurkan, yang menjadikan empat setengah bulan ke depan sebagai jendela waktu termurah yang pernah ada untuk keluarga model ini. Jika Anda mempertimbangkan peningkatan dari 3.6, panduan migrasi 3.6 ke 3.7 Flash mencakup proses pertukaran; pemotongan harga saja sudah menutupi biaya pengujian regresi.
Kedua, token output berharga 5 kali token input pada kedua tingkatan. Rasio tersebut membentuk setiap keputusan optimasi di kemudian hari dalam panduan ini: memangkas prompt sistem yang terlalu panjang menghemat beberapa sen, sementara membatasi output yang tidak terkendali menghemat banyak dolar.
Tarif di atas mencakup Gemini API yang ditagih melalui kunci AI Studio. Vertex AI berjalan melalui penagihan Google Cloud dengan SKU-nya sendiri, dan fitur-fitur seperti penyimpanan cache konteks dan pemrosesan batch memiliki item barisnya sendiri, jadi konfirmasikan angka saat ini di halaman harga resmi sebelum Anda menetapkan anggaran.
Berapa biaya beban kerja nyata
Harga per juta token tidak berarti apa-apa sampai Anda mengalikannya dengan lalu lintas. Berikut adalah tiga profil beban kerja dengan asumsi yang disebutkan, sehingga Anda dapat mengganti dengan angka Anda sendiri.
Beban Kerja 1: chatbot dukungan pelanggan
Asumsikan 10.000 permintaan per hari. Setiap permintaan membawa sekitar 2.000 token input (prompt sistem, jendela riwayat singkat, pesan pengguna) dan mengembalikan sekitar 300 token output.
| Item | Token harian | Biaya pengantar/hari | Biaya standar/hari |
|---|---|---|---|
| Input | 20 Juta | $15.00 | $30.00 |
| Output | 3 Juta | $11.25 | $22.50 |
| Total | 23 Juta | $26.25 | $52.50 |
Itu sekitar $788 per bulan dengan tarif pengantar dan $1.575 per bulan dengan tarif standar selama bulan 30 hari. Per giliran percakapan, Anda membayar sekitar seperempat sen hari ini.
Beban Kerja 2: pipeline dokumen PDF
Gemini 3.7 Flash membaca PDF secara native, dan skor tolok ukur GDP.pdf-nya meningkat dari 22.0% menjadi 34.0% dibandingkan 3.6 Flash, sehingga ekstraksi dokumen adalah beban kerja yang Google harapkan Anda jalankan di sini. Asumsikan 500 dokumen per hari, masing-masing rata-rata 40.000 token input (kontrak atau laporan panjang), menghasilkan ringkasan terstruktur 1.000 token.
| Item | Token harian | Biaya pengantar/hari | Biaya standar/hari |
|---|---|---|---|
| Input | 20 Juta | $15.00 | $30.00 |
| Output | 0.5 Juta | $1.88 | $3.75 |
| Total | 20.5 Juta | $16.88 | $33.75 |
Sekitar $506 per bulan sekarang, $1.013 mulai Januari. Perhatikan polanya: input mendominasi karena dokumennya panjang dan ringkasannya pendek. Caching dan batching paling berdampak pada beban kerja ini.
Beban Kerja 3: loop agen
Agen melipatgandakan panggilan. Asumsikan 200 tugas per hari, masing-masing rata-rata 12 panggilan model, di mana setiap panggilan membawa 8.000 token input (konteks yang berkembang ditambah hasil alat) dan mengembalikan 400 token output.
| Item | Token harian | Biaya pengantar/hari | Biaya standar/hari |
|---|---|---|---|
| Input | 19.2 Juta | $14.40 | $28.80 |
| Output | 0.96 Juta | $3.60 | $7.20 |
| Total | 20.16 Juta | $18.00 | $36.00 |
Itu $540 per bulan dengan tarif pengantar, $1.080 dengan tarif standar. Pelajaran dari penagihan agen: konteks tumbuh di setiap langkah, jadi jumlah panggilan dan panjang konteks berlipat ganda. Sebuah tugas yang membengkak dari 12 panggilan menjadi 20 akan memakan biaya 67% lebih mahal, dan tidak ada dalam tabel harga yang memperingatkan Anda.
Satu lagi angka yang patut diingat: batas output 64 ribu membatasi kasus terburuk per panggilan Anda sekitar $0.24 hari ini dan $0.48 tahun depan. Loop coba lagi yang memaksimalkan output di setiap percobaan akan menjadi mahal dengan cepat, tetapi tidak bisa menjadi mahal tanpa batas.
Perbandingan harga 3.7 Flash
Perbandingan per-token yang tepat di seluruh penyedia menjadi usang dalam hitungan minggu, jadi anggap ini sebagai posisi, bukan daftar harga.
Gemini 3.7 Flash berada di tingkatan pekerja keras: jauh lebih murah daripada model perintis seperti lini Pro milik Gemini sendiri, model yang lebih besar milik Claude, atau tingkatan unggulan OpenAI, sambil membawa skor tolok ukur (65.3% pada DeepSWE v1.1, Elo Arena WebDev 1588) yang tumpang tindih dengan apa yang dicatat oleh model unggulan belum lama ini. Taruhan Google adalah bahwa sebagian besar lalu lintas produksi tidak memerlukan model perintis, dan diskon pengantar adalah undangan empat bulan untuk menguji klaim tersebut pada beban kerja Anda sendiri.
Latar belakang persaingan juga penting. Penyedia tingkat anggaran telah menggerakkan harga ke arah lain; DeepSeek menaikkan tarif API-nya dan mendorong tim untuk memikirkan kembali anggaran token, sebuah kisah yang dibahas dalam panduan peningkatan harga dan optimasi biaya DeepSeek. Pelajarannya berlaku langsung untuk Gemini: harga apa pun yang Anda bangun marginnya dapat berubah, dan Google telah memberi tahu Anda tanggal dan jumlahnya. Itu adalah peringatan lebih dari yang diberikan sebagian besar penyedia.
Jika lalu lintas Anda bersifat sporadis atau eksperimental, ingatlah bahwa kenaikan harga hanya berdampak pada beban kerja yang berkelanjutan. Sebuah prototipe yang berharga $3 selama jendela pengantar akan berharga $6 nanti. Tidak ada yang peduli. Sebuah pipeline $10.000 per bulan yang menjadi $20.000 adalah item pengeluaran yang akan ditanyakan oleh tim keuangan Anda pada bulan Februari.
Lima cara memangkas pengeluaran token
Rasio harga output-ke-input 5x dan kenaikan harga bulan Januari menunjuk pada serangkaian tuas yang sama.
- Batasi token output per endpoint. Atur
maxOutputTokensdigenerationConfigke nilai terkecil yang dibutuhkan setiap endpoint. Balasan dukungan jarang membutuhkan lebih dari 500 token; membiarkan batas pada default 64 ribu berarti satu generasi yang membingungkan dapat berharga 100x dari yang normal. Ini adalah perubahan dengan pengembalian tertinggi karena token output membawa pengganda 5x. - Cache konteks statis Anda. Jika setiap permintaan mengirim ulang prompt sistem dan dokumen kebijakan 3.000 token yang sama, Anda membayar harga input penuh untuk byte yang identik ribuan kali sehari. Penyimpanan cache konteks menagih token berulang dengan tarif diskon; periksa dokumen API Gemini untuk pengaturan dan tarif caching saat ini. Untuk chatbot di atas, caching awalan statis 1.500 token memangkas tagihan input hampir setengahnya.
- Batch pekerjaan non-interaktif. Pipeline dokumen tidak memerlukan respons di bawah satu detik. Pemrosesan batch menukarkan latensi dengan tarif diskon, dan eksekusi dokumen semalaman adalah bentuk lalu lintas yang tepat untuk itu.
- Sesuaikan ukuran model per rute. Tidak setiap panggilan membutuhkan 3.7 Flash. Tugas klasifikasi, perutean, dan ekstraksi singkat seringkali berjalan dengan baik pada model tingkat Flash-Lite dengan sebagian kecil biayanya. Pertahankan 3.7 Flash untuk panggilan yang menggunakan apa yang Anda bayar: perencanaan multi-langkah, debugging, rantai panggilan alat.
- Prototipe di tingkatan gratis. Kuota gratis AI Studio cukup untuk mengunci prompt dan skema respons sebelum satu pun token yang ditagih bergerak. Panduan akses API Gemini gratis mencakup sejauh mana jalur gratis membentang dan di mana batas-batasnya berada.
Lacak pengeluaran per endpoint dengan Apidog
Perkiraan memberi Anda anggaran; pengukuran per-permintaan menjaga Anda tetap dalam anggaran tersebut. Setiap respons Gemini menyertakan blok usageMetadata dengan jumlah token prompt dan output, yang berarti lapisan pengujian API Anda dapat berfungsi ganda sebagai pengukur biaya.
Di Apidog, alur kerjanya terlihat seperti ini:
- Simpan satu permintaan per endpoint produksi (giliran chat, ringkasan dokumen, langkah agen) dalam koleksi, dengan kunci API terikat ke variabel lingkungan
GEMINI_API_KEY. - Bangun skenario pengujian yang memicu setiap permintaan terhadap payload realistis dan mengekstrak
usageMetadata.promptTokenCountdanusageMetadata.candidatesTokenCountdari respons. - Tambahkan pernyataan pada hitungan tersebut. Jika pengeditan prompt mendorong endpoint chat melewati, katakanlah, 2.500 token input, skenario akan gagal sebelum perubahan diterapkan dan secara diam-diam menaikkan tagihan Anda sebesar 25%.
- Jalankan kembali skenario pada setiap perubahan prompt atau skema. Jumlah token mengalami regresi dengan cara yang sama seperti latensi; perbedaannya adalah regresi token tiba sebagai tagihan.
Kalikan jumlah yang terukur dengan harga tingkatan dalam panduan ini dan Anda akan memiliki angka biaya per-endpoint yang didasarkan pada respons nyata, bukan tebakan. Tim yang sudah menjalankan suite API berbasis pernyataan akan mengenali polanya; panduan pengujian API untuk insinyur QA mencakup cara menyusun skenario seperti ini di seluruh layanan.
FAQ
Kapan harga Gemini 3.7 Flash naik dua kali lipat?
Pada 1 Januari 2027. Tarif pengantar sebesar $0.75 per 1 juta token input dan $3.75 per 1 juta token output berlaku hingga 31 Desember 2026, kemudian beralih ke tarif standar $1.50 dan $7.50. Google menerbitkan kedua tingkatan ini saat peluncuran, jadi kenaikannya sudah terjadwal, bukan spekulatif.
Apakah Gemini 3.7 Flash lebih murah dari Gemini 3.6 Flash?
Saat peluncuran, ya. Harga pengantar 3.7 Flash adalah setengah dari harga peluncuran 3.6 Flash, sementara tolok ukur meningkat secara keseluruhan (DeepSWE v1.1 naik dari 49.0% menjadi 65.3%). Spesifikasi lengkap dan tabel tolok ukur tersedia di referensi cepat Gemini 3.7 Flash jika Anda ingin perbandingan berdampingan.
Apakah harga pengantar berlaku di Vertex AI?
Tarif dalam panduan ini adalah tarif Gemini API yang ditagih melalui kunci AI Studio. Vertex AI menagih melalui Google Cloud dengan SKU dan ketentuan perusahaan sendiri. Jika Anda menjalankan lalu lintas produksi di Vertex, konfirmasikan angka saat ini di konsol penagihan GCP Anda dan halaman harga resmi daripada berasumsi kesamaan.
Apa saja yang dihitung dalam tagihan token input?
Semua yang Anda kirim: teks, gambar, video, audio, dan halaman PDF semuanya diubah menjadi token dan ditagih dengan tarif input. Dokumen panjang dan permintaan yang banyak media adalah tempat biaya input mengejutkan orang, itulah sebabnya contoh pipeline di atas mengasumsikan 40.000 token per dokumen. Blok usageMetadata di setiap respons memberi tahu Anda jumlah pastinya setelah fakta.
Bagaimana cara memperkirakan token sebelum mengirim permintaan?
Gunakan endpoint countTokens API untuk mengukur payload tanpa menghasilkan apa pun, atau kirim beberapa permintaan representatif dan baca usageMetadata dari respons. Bagaimanapun, ukur dengan payload nyata. Intuisi tokenizer dari penyedia lain tidak terlalu relevan di berbagai keluarga model.
Posisi 3.7 Flash dalam stack Anda
Gemini 3.7 Flash dengan harga pengantar adalah model paling murah yang pernah ada dengan kemampuan seperti ini, dan Google telah memberi tahu Anda tanggal pasti kapan hal itu tidak lagi berlaku. Langkah rasional: pindahkan lalu lintas beban kerja Anda ke sana sekarang, ukur konsumsi token nyata per endpoint saat diskon berlaku, dan gunakan data empat bulan tersebut untuk memutuskan apa yang tetap menggunakan 3.7 Flash, apa yang beralih ke model yang lebih ringan, dan seperti apa perkiraan tagihan tarif standar sebelum tiba.
Bagian pengukuran dari rencana itu membutuhkan alat. Unduh Apidog untuk menyimpan permintaan Gemini, lingkungan, pernyataan token, dan pemeriksaan biaya Anda dalam satu ruang kerja, sehingga tagihan Januari adalah angka yang Anda perkirakan, bukan yang Anda temukan.
