Google merilis Gemini 3.7 Flash pada 13 Agustus 2026, tiga minggu setelah 3.6 Flash, dan menyebutnya “model pekerja keras kami yang paling cerdas”. Delta benchmark mendukung keyakinan ini. DeepSWE melonjak dari 49,0% menjadi 65,3%, AutomationBench naik dari 17,0% menjadi 30,4%, dan harga perkenalan $0,75 per 1 juta token input adalah setengah dari biaya 3.6 Flash saat diluncurkan.
Kombinasi tersebut memunculkan pertanyaan yang dihadapi setiap tim API pada kuartal ini: apakah model Gemini yang cepat dan murah kini dapat menangani beban kerja yang sebelumnya Anda arahkan ke Claude atau GPT? Perbandingan ini berpegang pada apa yang dapat Anda verifikasi: jendela konteks, modalitas, dukungan alat, struktur harga, dan skema permintaan yang akan Anda integrasikan; jika angka pesaing tidak sebanding, akan disebutkan demikian. Dan karena jawaban jujur untuk “API mana yang harus Anda gunakan” adalah “yang paling unggul untuk beban kerja Anda”, bagian terakhir menunjukkan cara menjalankan ketiganya secara berdampingan di Apidog sebelum Anda memutuskan.
Jika Anda akhirnya memilih Gemini dan menginginkan langkah-langkah penyiapan, panduan singkat Gemini 3.7 Flash API mencakup kunci, endpoint, dan permintaan pertama.
Ringkasan
- Gemini 3.7 Flash: Konteks 1 juta token, batas keluaran 64 ribu token, input native untuk teks, gambar, video, audio, dan PDF, ditambah pemanggilan fungsi, pencarian sebagai alat, dan penggunaan komputer.
- Harga perkenalan: $0,75 per 1 juta token input dan $3,75 per 1 juta token output hingga 31 Desember 2026, berlipat ganda menjadi $1,50 dan $7,50 pada 1 Januari 2027.
- Peningkatan pengkodean dibandingkan 3.6 Flash: DeepSWE v1.1 49,0% menjadi 65,3%, FrontierCode 1.1 Main 34,4% menjadi 43,6%, AutomationBench 17,0% menjadi 30,4%.
- Claude Fable 5 dan GPT-5.6 Sol masih memimpin dalam kedalaman pengkodean terdepan dan konsistensi agen, dengan harga per token beberapa kali lipat.
- Tiga penyedia menggunakan skema permintaan yang tidak kompatibel: Google
contents, Anthropic Messages, OpenAImessages. - Benchmark memprediksi rata-rata, bukan beban kerja Anda; lakukan perbandingan 20 prompt di ketiga API sebelum memutuskan.
Cara membaca perbandingan ini
Ini bukan pertarungan antara model terdepan (frontier) dengan model terdepan. Claude Fable 5 dan GPT-5.6 Sol adalah model unggulan yang dihargai untuk kemampuan maksimal; Gemini 3.7 Flash adalah model pekerja keras yang dihargai untuk volume. Google merilisnya sementara model unggulannya menunggu: Axios melaporkan bahwa Gemini 3.5 Pro masih tertunda, dengan pembaruan Flash diluncurkan lebih dulu.
Perbandingan ini masih layak dilakukan: skor peluncuran 3.7 Flash kini tumpang tindih dengan rentang tempat model terdepan berada beberapa minggu yang lalu, dan itu mengubah perhitungan perutean meskipun model unggulan tetap di depan.
Dua peringatan berlaku di seluruh perbandingan ini. Pertama, setiap angka di sini adalah angka yang dilaporkan vendor pada minggu peluncuran; perlakukan angka tersebut sebagai petunjuk arah hingga evaluasi independen tersedia. Kedua, varian benchmark itu penting. Google melaporkan FrontierCode 1.1 Main, sementara angka yang dipublikasikan untuk Claude dan GPT pada peluncuran mereka berasal dari Extended split, sehingga kolom-kolom tersebut tidak pernah berbagi tabel di sini.
Spesifikasi berdampingan
Lembar spesifikasi adalah tempat Gemini 3.7 Flash bersaing dengan model yang harganya jauh lebih mahal. Detail teknis lengkap tersedia di halaman model Gemini Flash.
| Gemini 3.7 Flash | Claude Fable 5 | GPT-5.6 Sol | |
|---|---|---|---|
| Pengembang | Anthropic | OpenAI | |
| Jendela konteks | 1 Juta token | 1 Juta token | 1.05 Juta token |
| Batas keluaran | 64 ribu token | Lihat dokumen penyedia | Lihat dokumen penyedia |
| Modalitas input | Teks, gambar, video, audio, PDF | Teks, gambar | Teks, gambar |
| Keluaran | Teks | Teks | Teks |
| Dukungan alat | Pemanggilan fungsi, pencarian sebagai alat, penggunaan komputer | Pemanggilan fungsi, penggunaan alat | Pemanggilan fungsi, alat bawaan |
| Skema permintaan | Google contents + generationConfig |
Anthropic Messages | OpenAI messages |
| Otentikasi | Header x-goog-api-key |
Header x-api-key + versi |
Token Bearer |
| Harga (per 1 juta token) | $0.75 masuk / $3.75 keluar intro; $1.50 / $7.50 mulai Jan 2027 | Tingkat premium terdepan | Tingkat premium terdepan |
| Posisi | Pekerja keras volume tinggi | Pekerjaan agen jangka panjang | Kedalaman pengkodean skala repositori |
Jendela konteks kini secara efektif setara, sehingga baris itu tidak lagi menjadi penentu. Baris modalitas dan harga adalah tempat ketiga model ini berbeda, dan bagian selanjutnya akan menguraikan keduanya.
Tugas pengkodean dan agen
Klaim utama Google untuk 3.7 Flash berorientasi pengembang: lebih baik dalam debugging, lebih mampu menghasilkan kode yang dapat di-deploy pada percobaan pertama, dan lebih cermat dalam perencanaan multi-langkah serta pemanggilan alat. Angka generasi-ke-generasi, yang dikonfirmasi dalam liputan peluncuran 9to5Google, mendukung klaim tersebut.
| Benchmark | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|
| DeepSWE v1.1 (perbaikan skala repo) | 49.0% | 65.3% |
| FrontierCode 1.1 Main | 34.4% | 43.6% |
| WebDev Arena (Elo) | 1538 | 1588 |
| GDP.pdf (penalaran dokumen) | 22.0% | 34.0% |
| AutomationBench (tugas agen) | 17.0% | 30.4% |
Lonjakan AutomationBench adalah hal yang harus diperhatikan oleh para pengembang agen. Hampir menggandakan benchmark agen dalam tiga minggu menunjukkan bahwa klaim “berpikir lebih cermat dalam pemanggilan alat” lebih dari sekadar pemasaran.
Bagaimana perbandingannya dengan Claude dan GPT? Pada DeepSWE v1.1, tingkatan frontier mencatat 73,0% untuk GPT-5.6 Sol Max pada peluncurannya, dengan Grok 4.6 sebesar 65,9%; perbandingan Grok 4.6 vs GPT-5.6 Sol vs Claude Fable 5 kami membahas hasil tersebut secara mendalam. Sol Max mempertahankan keunggulan nyata dalam perbaikan bug skala repositori, dan kekuatan Claude Fable 5 adalah konsistensi di seluruh evaluasi pengkodean dan agen, di mana ia jarang lebih buruk dari posisi kedua. Gemini 3.7 Flash belum menutup celah itu. Model ini telah mendekati dengan biaya yang jauh lebih rendah, yang merupakan proposisi nilai yang berbeda dari “skor terbaik menang.”
Dua angka spesialis melengkapi gambaran ini: 90,7% pada Harvey LAB-AA untuk penalaran hukum, dan 97,0% pada pengambilan 128k-needle, skor yang membuat jendela 1 juta token dapat dipercaya dalam praktik.
Input multimodal
Ini adalah perbedaan struktural paling jelas antara ketiga API. Gemini 3.7 Flash menerima teks, gambar, video, audio, dan PDF dalam array contents yang sama terhadap satu endpoint. Claude dan GPT menangani teks dan gambar dengan baik, tetapi beban kerja video dan audio biasanya dialihkan melalui langkah transkripsi atau pra-pemrosesan terpisah sebelum teks mencapai model.
Jika produk Anda berhubungan dengan dokumen, lonjakan GDP.pdf dari 22,0% menjadi 34,0% adalah sinyal yang relevan: benchmark tersebut mengukur penalaran atas PDF dunia nyata dengan tabel, pindaian, dan tata letak yang rusak. Memasukkan kontrak atau faktur langsung ke dalam model tanpa pipa OCR menghilangkan seluruh tahap yang rentan kegagalan dari arsitektur Anda.
Aturan praktisnya: untuk obrolan teks dan gambar, modalitas tidak banyak berbeda. Untuk bingkai video, rekaman panggilan, atau tumpukan dokumen, Gemini adalah satu-satunya dari ketiganya di mana pipeline input menyatu menjadi satu panggilan API.
Filosofi harga
Ketiga vendor menjalankan strategi harga yang berbeda, dan perbedaannya memberi tahu Anda untuk siapa setiap model ditujukan.
Google memberi harga 3.7 Flash untuk akuisisi pasar. Tarif perkenalan $0,75 per 1 juta input dan $3,75 per 1 juta token output berlaku hingga 31 Desember 2026, dan ini adalah setengah dari biaya 3.6 Flash saat diluncurkan. Pada 1 Januari 2027, tarif standar berlaku sebesar $1,50 dan $7,50, yaitu 2 kali lipat. Batas waktu itu adalah fungsi pemaksa: Google ingin lalu lintas Anda berkomitmen sebelum harga diatur ulang. Perhitungan token lengkap, dengan contoh-contoh untuk chatbot dan loop agen, ada di penjelasan harga Gemini 3.7 Flash kami.
Anthropic dan OpenAI memberi harga model unggulan mereka sebagai kemampuan premium. Tarif bervariasi berdasarkan tingkatan dan sering berubah, tetapi bentuknya konsisten: token output frontier berharga beberapa kali lipat dari yang dikenakan Flash, dan kedua vendor menjual premium tersebut berdasarkan lebih sedikit kegagalan, bukan token yang lebih murah. Anthropic menambahkan parameter upaya yang menukar biaya dengan kemampuan dalam satu model; OpenAI menata tingkat berdasarkan ukuran model.
Filosofi mana yang unggul tergantung pada ekonomi kegagalan Anda. Model murah yang gagal dalam suatu tugas menciptakan pekerjaan perbaikan yang biayanya lebih besar daripada token yang dihemat; model premium mendapatkan tarifnya hanya ketika mencegah kegagalan tersebut. Bandingkan biaya per tugas yang diselesaikan, bukan biaya per token, dan hargai ulang setelah 1 Januari 2027 saat tarif Gemini berlipat ganda.
Ergonomi API
Perbedaan skema adalah pajak yang Anda bayar ketika Anda beralih penyedia atau merutekan di antara mereka. Berikut adalah permintaan satu giliran yang sama dalam ketiga bentuk.
API Gemini Google membungkus giliran dalam contents dengan parts, dan pengaturan generasi berada di generationConfig:
{
"contents": [
{ "role": "user", "parts": [{ "text": "Summarize this changelog." }] }
],
"generationConfig": { "temperature": 0.3, "maxOutputTokens": 1024 }
}
API Pesan Anthropic menempatkan model dan max_tokens yang diperlukan di tingkat atas, dengan prompt sistem sebagai bidangnya sendiri:
{
"model": "claude-fable-5",
"max_tokens": 1024,
"system": "You summarize changelogs in three bullets.",
"messages": [{ "role": "user", "content": "Summarize this changelog." }]
}
OpenAI melipat prompt sistem ke dalam array messages itu sendiri:
{
"model": "gpt-5.6-sol",
"messages": [
{ "role": "system", "content": "You summarize changelogs in three bullets." },
{ "role": "user", "content": "Summarize this changelog." }
]
}
Kasus teks terlihat cukup dekat untuk diatasi dengan adaptor. Penggunaan alat adalah tempat kebocoran abstraksi terjadi: Google mendeklarasikan fungsi dalam array tools dengan functionDeclarations dan mengontrol pemanggilan melalui toolConfig, Anthropic menggunakan skema alatnya sendiri dengan blok respons yang berbeda, dan OpenAI memiliki format fungsinya sendiri lagi. Bentuk potongan streaming juga berbeda, meskipun ketiganya menggunakan server-sent events. Gateway dan endpoint kompatibilitas menormalkan bentuk obrolan dasar, tetapi bagian multimodal dan pemanggilan alat jarang berhasil diterjemahkan dengan bersih; kami mendokumentasikan masalah yang sama di seluruh vendor dalam perbandingan format API untuk DeepSeek V4 Pro.
Saran integrasinya tidak glamor: pertahankan lapisan penyedia yang tipis antara produk Anda dan model. Tim yang melakukannya dapat beralih penyedia dalam hitungan hari, bukan kuartal.
Kapan harus memilih masing-masing
Benchmark dan skema diringkas dalam daftar keputusan:
- Pilih Gemini 3.7 Flash untuk lalu lintas agen volume tinggi, pipeline multimodal yang menyerap video, audio, atau PDF, dan beban kerja apa pun di mana biaya per panggilan membatasi margin produk. Ini juga merupakan kotak pasir yang jelas untuk eksperimen penggunaan komputer; uraian kami tentang penggunaan komputer versus API terstruktur membahas kapan kemampuan itu bermanfaat.
- Pilih Claude Fable 5 untuk pekerjaan otonom jangka panjang: sesi agen multi-jam, tugas di mana satu langkah yang melenceng membuang satu jam kemajuan, dan beban kerja yang menghargai dial biaya-kemampuan parameter upaya.
- Pilih GPT-5.6 Sol untuk agen pengkodean skala repositori yang beroperasi di seluruh basis kode besar yang ada dengan pengawasan minimal, dan untuk tim yang menginginkan ekosistem pihak ketiga terdalam di sekitar API.
- Pilih router jika Anda bisa. Pola yang paling banyak diikuti tim produksi: model default murah menangani sebagian besar lalu lintas, dan 10% yang paling sulit diskalakan ke model frontier. Angka peluncuran Gemini 3.7 Flash menjadikannya default yang kredibel dalam arsitektur tersebut, yang tidak berlaku untuk 3.6 Flash.
Uji ketiga penyedia dalam satu ruang kerja Apidog
Perbandingan yang penting adalah yang Anda jalankan dengan prompt Anda sendiri. Apidog menyimpan koleksi untuk Google, Anthropic, dan OpenAI dalam satu proyek, sehingga pengujian perbandingan hanya membutuhkan satu sore, bukan sprint:
- Buat tiga lingkungan, satu untuk setiap penyedia, masing-masing membawa URL dasar dan header otentikasi sendiri:
x-goog-api-keyuntuk Gemini,x-api-keyuntuk Anthropic, token Bearer untuk OpenAI. Beralih penyedia menjadi pilihan drop-down, bukan perubahan kode. - Kumpulkan 20 prompt nyata dari produk Anda. Sertakan prompt sistem Anda, definisi alat Anda jika Anda menggunakan pemanggilan fungsi, dan setidaknya lima kasus yang diketahui sulit.
- Tambahkan pernyataan (assertion) untuk hal yang Anda pedulikan: validitas respons, jumlah token dari blok penggunaan setiap penyedia, ambang batas latensi. Untuk beban kerja pemanggilan alat, pastikan JSON pemanggilan alat diuraikan dan sesuai dengan skema Anda; model lebih sering gagal di sana daripada dalam prosa.
- Jalankan setiap suite tiga kali per model. Output LLM bervariasi; tiga kali menjalankan akan menunjukkan varians yang disembunyikan oleh satu demo. Bandingkan tingkat keberhasilan dan biaya per tugas yang berhasil.
- Simpan suite tersebut. Rilis model sekarang berjarak beberapa minggu; 3.7 Flash mengikuti 3.6 dalam tiga minggu. Tim dengan kerangka kerja yang sudah ada akan memutuskan ulang dalam satu sore daripada berdasarkan anekdot.
FAQ
Apakah Gemini 3.7 Flash lebih baik dari Claude atau GPT untuk pengkodean?
Tidak pada tingkat teratas. GPT-5.6 Sol Max mencatat 73,0% pada DeepSWE v1.1 dibandingkan 65,3% milik 3.7 Flash, dan Claude Fable 5 memimpin dalam konsistensi di seluruh benchmark pengkodean dan agen. Yang berubah adalah rasio harga-ke-skor: 3.7 Flash mencapai skor yang berada di wilayah frontier beberapa minggu yang lalu, sambil membebankan tarif model pekerja keras.
Seberapa jauh lebih murah Gemini 3.7 Flash dibandingkan Claude atau GPT?
Hingga 31 Desember 2026, Gemini 3.7 Flash berharga $0,75 per 1 juta token input dan $3,75 per 1 juta token output. Model Claude dan GPT frontier mengenakan biaya beberapa kali lipat lebih banyak per token; periksa halaman harga langsung sebelum Anda memodelkan biaya. Ingatlah bahwa tarif perkenalan akan berlipat ganda pada 1 Januari 2027.
Bisakah saya memanggil Gemini 3.7 Flash melalui OpenAI SDK?
Google menyediakan endpoint yang kompatibel dengan OpenAI yang menangani bentuk obrolan dasar, sehingga penukaran base_url berfungsi untuk teks masuk, teks keluar. Bagian multimodal dan pemanggilan alat tidak dipetakan dengan bersih, jadi gunakan skema contents native untuk apa pun di luar obrolan biasa. Tutorial pemanggilan fungsi untuk Gemini 3.7 Flash menunjukkan format alat native secara menyeluruh.
Apakah Gemini 3.7 Flash mendukung penggunaan komputer dan search grounding?
Ya. Ini dilengkapi dengan pemanggilan fungsi, pencarian sebagai alat, dan penggunaan komputer, ditambah guardrail keamanan CBRN dan cyber yang diperbarui. Peningkatan AutomationBench dari 17,0% menjadi 30,4% adalah proxy yang paling dekat yang dipublikasikan untuk seberapa baik loop agen tersebut.
Di mana Gemini 3.7 Flash tersedia?
Gemini API dengan kunci AI Studio, Google AI Studio, aplikasi Gemini, Gemini Spark untuk pelanggan AI Pro dan Ultra, Google Antigravity, Android Studio, dan Gemini Enterprise, di lebih dari 160 negara. Tim produksi GCP dapat memanggilnya melalui Vertex AI dengan OAuth alih-alih kunci API.
Di mana 3.7 Flash cocok dalam tumpukan teknologi Anda
Kesimpulan yang salah dari perbandingan ini adalah “Gemini mengejar model frontier.” Itu tidak benar; Sol masih memiliki kedalaman pengkodean skala repo dan Fable 5 masih memiliki keandalan jangka panjang. Kesimpulan yang benar adalah bahwa standarnya bergeser: harga model pekerja keras kini membeli skor yang membenarkan tarif premium seperempat tahun yang lalu, yang mengatur ulang default dalam arsitektur router apa pun. Model kelas Flash menangani sebagian besar, model unggulan menangani eskalasi.
Keputusan dapat diukur, jadi ukurlah. Sambungkan ketiga penyedia ke satu ruang kerja, jalankan prompt Anda yang sebenarnya dengan pernyataan (assertion), dan biarkan biaya per tugas yang diselesaikan memilih pemenangnya. Unduh Apidog secara gratis, siapkan ketiga lingkungan, dan Anda akan memiliki bukti tingkat penyedia sebelum jendela harga perkenalan ditutup.

