Gemini 3.8 Flash tersedia hari ini: model stabil dengan tingkat gratis, dihargai $0,75 untuk masukan dan $3,75 untuk keluaran per 1 juta token hingga 31-12-2026, kemudian $1,50 dan $7,50, dengan batas keluaran 64K. Gemini 4 Argon tidak. Posting peluncuran Google menghargainya $2 dan $10 selama periode perkenalan yang tidak disebutkan durasinya, kemudian $4 dan $20. Google menyatakan batas keluarannya adalah 1 juta token, dan saat ini hanya tersedia untuk pembela Program Fairwind. Jika Anda perlu meluncurkan kuartal ini, luncurkan dengan Flash dan siapkan Argon agar dapat diaktifkan hanya dengan satu perubahan konfigurasi.
Posting ini membandingkan keduanya berdasarkan spesifikasi, baris benchmark yang dibagikan oleh kedua posting peluncuran, skor siber, dan biaya panggilan yang identik, kemudian memberikan aturan keputusan. Sebagai latar belakang, lihat apa itu Gemini 4 Argon dan apa itu Gemini 3.8 Flash. Bagian terakhir menunjukkan pengaturan Apidog yang membuat peralihan ini menjadi variabel tunggal.
tombol
Perbandingan: apa yang bisa Anda panggil hari ini
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| Ketersediaan | Stabil di Gemini API, AI Studio, Antigravity, dan Gemini Enterprise | Subset mitra Program Fairwind, sebagai model terkelola di Gemini Enterprise |
| ID Model | gemini-3.8-flash |
Tidak dipublikasikan |
| Harga per 1 Juta token (masuk / keluar) | $0,75 / $3,75 hingga 31-12-2026, kemudian $1,50 / $7,50 | $2 / $10 perkenalan (tanggal berakhir tidak disebutkan), kemudian $4 / $20 |
| Input cache per 1 Juta | $0,075, kemudian $0,15 | $0,10 perkenalan, kemudian $0,20 (diskon 95% dari input) |
| Batas keluaran | 65.536 token | 1 Juta token (batas yang dinyatakan Google) |
| Jendela masukan | 1.048.576 token | Tidak dipublikasikan |
| Tingkat pemikiran | rendah, sedang (default), tinggi; minimal mengembalikan HTTP 400 |
Tidak didokumentasikan |
| Tingkat API gratis | Ya, terbatas laju | Tidak ada yang diumumkan |
| Akses konsumen | Aplikasi Gemini di AI Pro dan Ultra, Mode AI di Search | Belum; pelanggan AI Ultra adalah gelombang pertama, tidak ada tanggal |
Beberapa sel memerlukan konteks. Google belum mempublikasikan jendela masukan Argon, meskipun evaluasi konteks panjangnya menggunakan prompt hingga 1 juta token. Google menyatakan batas keluaran Argon adalah 1 juta token; setidaknya satu evaluator pihak ketiga, Vals AI, mencantumkan keluaran maksimum 262K untuk konfigurasi yang diujinya. Evaluasi Argon berjalan dengan "pengaturan pemikiran tertinggi," jadi tingkat tinggi kemungkinan ada, tetapi Google belum menamai tingkat atau defaultnya. Tingkat Flash ada di dokumen pemikiran Google dan di panduan tingkat pemikiran 3.8 Flash kami.
Tingkat gratis Flash memiliki batasan laju, dan Google menyatakan data tingkat gratis "digunakan untuk meningkatkan produk kami." Google belum mengumumkan cara gratis apa pun untuk menggunakan Argon; penjelasan akses gratis Argon kami mencakup apa yang dapat Anda gunakan sebagai gantinya.
Baris benchmark yang dibagikan oleh kedua posting peluncuran dalam teks
Tabel peluncuran Google untuk kedua model membagikan dua baris dalam teks. Ini adalah angka yang dilaporkan Google, dan metodologi Argon mengaitkan kedua baris tersebut dengan Vals AI.
| Benchmark | Gemini 3.8 Flash (tabel 2 Sep) | Gemini 4 Argon (tabel 30 Sep) |
|---|---|---|
| Vals Finance Agent v2 | 61,4% | 65,4% |
| Harvey Legal Agent Benchmark | 10,0% | 19,6% |
Google mempublikasikan tabel ini sebulan terpisah, terhadap kumpulan pesaing yang berbeda, jadi bacalah celahnya sebagai petunjuk arah daripada tes terkontrol. Meskipun demikian, baris hukum menonjol: 19,6% Argon hampir dua kali lipat dari 10,0% Flash. Celah keuangan adalah 4 poin.
Segala sesuatu yang lain di tabel Argon tidak memiliki padanan 3.8 Flash dalam teks. Tabel 3.8 Flash Google melaporkan HLE-Verified, yang tidak ada di Argon, dan skor DeepSWE Flash hanya muncul dalam gambar kartu model. Di papan peringkat Teks Arena, peringkat pihak ketiga, Argon (Tinggi) berada di #1 pada voting awal, sedangkan Gemini 3.8 Flash (Tinggi) berada di #11. Tabel Argon lengkap 19 baris, dengan siapa yang mengukur setiap baris, ada di rincian benchmark Argon kami.
Siber: Argon vs 3.8 Flash Siber
Halaman siber DeepMind membandingkan Argon dengan Gemini 3.8 Flash Siber, saudara siber Flash yang dibatasi Fairwind:
| Evaluasi Siber | Gemini 4 Argon | Gemini 3.8 Flash Siber |
|---|---|---|
| Penemuan kerentanan dunia nyata | 85,8% | 71,0% |
| Wiz Penetration Test Benchmark | 70,9% | 58,2% |
Kedua model memiliki batasan. Gemini 3.8 Flash Siber tersedia secara umum di belakang daftar izin di Gemini Enterprise Agent Platform, dan Argon hanya untuk Fairwind. Jika Anda bukan mitra Fairwind, tidak ada angka yang mengubah apa yang bisa Anda panggil hari ini. Model 3.8 Flash umum adalah yang dapat Anda bangun.
Biaya panggilan yang sama pada keduanya
Ambil satu panggilan dengan 100.000 token masukan dan 8.000 token keluaran. Model Gemini saat ini, termasuk 3.8 Flash, menagih token pemikiran sebagai keluaran, jadi 8.000 itu termasuk token pemikiran. Google belum mengatakan bagaimana Argon menagihnya; baris Argon mengasumsikan ia mengikuti model Gemini saat ini.
| Model dan periode | Biaya masukan | Biaya keluaran | Total per panggilan |
|---|---|---|---|
| 3.8 Flash, perkenalan | 0,1 Juta x $0,75 = $0,075 | 0,008 Juta x $3,75 = $0,030 | $0,105 |
| 3.8 Flash, mulai 01-01-2027 | 0,1 Juta x $1,50 = $0,150 | 0,008 Juta x $7,50 = $0,060 | $0,210 |
| Argon, perkenalan | 0,1 Juta x $2 = $0,200 | 0,008 Juta x $10 = $0,080 | $0,280 |
| Argon, standar | 0,1 Juta x $4 = $0,400 | 0,008 Juta x $20 = $0,160 | $0,560 |
Tarif per token Argon adalah 8/3 (sekitar 2,67 kali) tarif Flash, baik pada harga perkenalan maupun harga standar. Dengan 1.000 panggilan ini per hari, itu berarti $105 per hari dengan Flash versus $280 dengan Argon pada tarif perkenalan.
Tiga hal yang merusak rasio yang rapi:
- Jumlah token tidak akan cocok. Prompt yang sama menghasilkan jumlah keluaran dan token pemikiran yang berbeda pada model yang berbeda. Evaluasi Argon yang dipublikasikan berjalan pada pengaturan pemikiran tertinggi, dan pada 3.8 Flash Google memperingatkan bahwa tingkat upaya yang lebih tinggi dapat menggunakan lebih banyak token.
- Keluaran panjang mengubah perhitungan. Jawaban 200.000 token tidak muat dalam batas 65.536 token Flash, jadi Anda harus memecahnya menjadi beberapa panggilan. Di bawah batas yang dinyatakan Argon, itu adalah satu respons: 0,2 Juta x $10 = $2,00 pada tarif perkenalan, atau $4,00 pada standar. Jawaban penuh 1 juta token berharga $10 perkenalan atau $20 standar.
- Hanya satu tanggal berakhir perkenalan yang diketahui. Harga perkenalan Flash berakhir 31-12-2026. Google belum mengatakan kapan harga perkenalan Argon berakhir.
Flash juga memiliki Batch dengan diskon 50% ($0,375 dan $1,875 hingga 31 Desember), sesuai halaman harga Gemini API. Google belum mempublikasikan harga Batch untuk Argon. Panduan harga Argon kami dan panduan harga 3.8 Flash membahas lebih dalam.
Haruskah Anda menunggu Argon atau meluncurkan dengan Flash?
Luncurkan dengan 3.8 Flash sekarang saat
- Anda terikat biaya. Flash berharga 3/8 dari Argon per token, dan Batch membagi dua itu.
- Anda menjalankan volume tinggi. Klasifikasi, ekstraksi, perutean, dan obrolan dalam skala besar bertambah cepat dengan $10 per 1 juta token keluaran.
- Anda membutuhkannya hari ini. Flash memiliki ID model stabil, tingkat gratis untuk prototyping, dan jadwal harga yang dipublikasikan.
- Respons Anda muat dalam 65.536 token. Sebagian besar beban kerja API demikian.
Rencanakan untuk Argon saat
- Pekerjaan memiliki horizon panjang. Google menyatakan Argon "dibangun untuk mempertahankan penalaran mendalam di seluruh alur kerja yang kompleks dan berhorizon panjang."
- Anda membutuhkan keluaran di atas 64K. Penulisan ulang modul penuh, laporan panjang, dan migrasi besar adalah alasan untuk batas keluaran 1 juta.
- Anda menjalankan agen hukum atau keuangan. Itu adalah dua baris tempat Google mempublikasikan kedua model, dan Argon memimpin keduanya.
- Anda adalah pembela yang memenuhi syarat Fairwind. Argon adalah model yang sekarang menjadi pemimpin program.
Anda tidak perlu memilih sekali. Arahkan sebagian besar lalu lintas ke Flash dan kirim permintaan yang sulit ke Argon saat sudah tersedia, dengan keduanya berada di belakang konfigurasi yang sama.
Satu permintaan tersimpan, dua model
Begini polanya. Simpan nama model dalam variabel lingkungan, jalankan permintaan nyata Anda terhadap 3.8 Flash sekarang, dan tukar variabelnya pada hari ID model Argon tersedia. Google belum mempublikasikan ID tersebut, jadi jangan menebaknya.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize this contract clause in 3 bullets."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"medium"},"maxOutputTokens":8192}}'
Setiap respons generateContent diakhiri dengan usageMetadata. Di Apidog, simpan GEMINI_API_KEY dan GEMINI_MODEL dalam lingkungan, simpan permintaan ini, dan tambahkan pernyataan: status 200, bidang yang dibaca aplikasi Anda, dan batas atas pada usageMetadata.thoughtsTokenCount yang disesuaikan dengan batas biaya Anda. Pertahankan maxOutputTokens agar jawaban panjang tidak menghabiskan anggaran Anda. Tambahkan ke skenario pengujian, jalankan di Flash, dan simpan laporannya sebagai dasar.
Dua peringatan untuk hari peluncuran. Google menyatakan "semua model baru" akan diluncurkan di Interactions API dan belum mengatakan apakah Argon mendukung generateContent, jadi simpan versi Interactions (POST https://generativelanguage.googleapis.com/v1beta/interactions dengan generation_config.thinking_level) di samping yang ini. Dan nama tingkat pemikiran Argon tidak didokumentasikan, jadi medium mungkin tidak berlaku. Ketika Argon tersedia, ubah satu variabel, jalankan kembali, dan bandingkan keluaran serta usageMetadata secara berdampingan.
FAQ
Apakah Gemini 4 Argon lebih baik dari Gemini 3.8 Flash? Pada dua baris yang dibagikan oleh kedua tabel peluncuran dalam teks, ya: 65,4% vs 61,4% pada Vals Finance Agent v2 dan 19,6% vs 10,0% pada Harvey's Legal Agent Benchmark. Ini juga berharga sekitar 2,67 kali lebih mahal per token, dan Anda belum bisa memanggilnya.
Haruskah saya menunggu Gemini 4 Argon? Tidak jika Anda perlu meluncurkan. Google belum memberikan tanggal rilis, hanya "sesegera mungkin," dimulai dengan pelanggan API berbayar dan pelanggan AI Ultra.
Gemini 3.8 Flash atau Argon untuk proyek baru? Mulai dengan 3.8 Flash dengan model dalam variabel. Pindahkan permintaan yang membutuhkan keluaran panjang atau kedalaman hukum dan keuangan ke Argon setelah Anda mengujinya dengan prompt Anda sendiri.
Apakah ada cara gratis untuk menggunakan Argon? Tidak. Google belum mengumumkan tingkat gratis; lihat penjelasan akses gratis Argon kami untuk model Gemini gratis yang dapat Anda gunakan hari ini.
Apakah Argon menggantikan Gemini 3.8 Flash? Google belum mengatakannya. Google menyebut Argon sebagai model perbatasan barunya, dan Reuters melaporkan bahwa ukurannya lebih besar dari lini Pro sebelumnya, jadi ini adalah tingkat yang berbeda dari Flash.
Langkah selanjutnya
Siapkan permintaan hari ini, jalankan di 3.8 Flash, dan simpan laporannya. Ketika Argon diluncurkan, Anda akan tahu dalam beberapa menit apakah harganya sepadan dengan lalu lintas Anda. Unduh Apidog untuk membangun perbandingan.
tombol
