Gemini 3.8 Flash hadir dengan tiga tingkat berpikir: low, medium, dan high. Pengaturan ini mengontrol seberapa banyak penalaran internal yang dilakukan model sebelum menjawab, dan pada model ini, pengaturan tersebut sekaligus memengaruhi tiga hal: latensi, token keluaran, dan tagihan Anda. Google membangun 3.8 Flash untuk “bekerja lebih keras” pada tugas-tugas kompleks sesuai desainnya, jadi tingkat yang Anda pilih lebih penting daripada di 3.7 Flash. Jika Anda baru mengenal model ini, ikhtisar Gemini 3.8 Flash membahas peluncurannya. Panduan ini hanya tentang pengaturan tingkat tersebut.
Ada dua detail yang sering membingungkan tim di awal. Tingkat default pada 3.8 Flash adalah medium, bukan high (Gemini 3 Pro secara default high, dari sinilah kebingungan berasal). Dan minimal, yang masih dikirimkan oleh konfigurasi yang ditulis untuk Gemini 3.7 Flash, tidak lagi diterima: permintaan akan gagal validasi sebelum satu token pun dihasilkan. Google mendokumentasikan keduanya di halaman Apa yang baru di Gemini 3.8 Flash.
Di bawah ini: apa yang dilakukan setiap tingkat, berapa biayanya per tugas, cara mengaturnya dalam kedua bentuk API, strategi per rute, dan uji coba berulang yang menunjukkan perbedaan token dan latensi sebelum Anda mengimplementasikannya.
Tingkat berpikir sekilas
| Tingkat | Panduan Google | Biaya per tugas (AA) | Waktu per tugas (AA) | Gunakan saat |
|---|---|---|---|---|
low |
Meminimalkan latensi dan biaya; mengikuti instruksi sederhana, chat, rute dengan throughput tinggi | $0.24 | 0.8 menit | latensi yang dihadapi pengguna penting; pencarian transkrip; klasifikasi |
medium (default) |
Default untuk kode kompleks dan pekerjaan agenik | $0.41 | tidak dipublikasikan dalam teks | sebagian besar rute; Tanya Jawab video umum |
high |
Kedalaman penalaran maksimum untuk masalah multi-langkah tersulit | $0.58 | 2.5 menit | Tanya Jawab visual padat; video berdurasi 60+ menit; langkah perencanaan yang menentukan segalanya setelahnya |
minimal |
Tidak didukung di 3.8 Flash | n/a | n/a | jangan pernah; petakan ke low |
Kolom biaya dan waktu adalah rata-rata Artificial Analysis dari menjalankan Intelligence Index mereka di setiap tingkat, dengan harga per-token pengantar Google. Angka-angka ini adalah angka independen, bukan milik Google, dan mengukur beban kerja benchmark, bukan prompt Anda. Gunakanlah sebagai rasio, lalu ukur rute Anda sendiri.
Apa yang dilakukan setiap tingkat
Setiap respons 3.8 Flash dapat menyertakan token berpikir: penalaran yang dihasilkan model sebelum jawaban yang terlihat. Anda membayarnya sebagai token keluaran ($3.75 per juta dengan tarif perkenalan hingga 31-12-2026, $7.50 mulai 01-01-2027), dan API melaporkannya secara terpisah sebagai usageMetadata.thoughtsTokenCount. Tingkat berpikir memberi tahu model seberapa banyak penalaran yang harus dilakukan.
lowmenjaga pemikiran tetap singkat. Token pertama tiba paling cepat dan tagihan keluaran tetap kecil. Google menempatkannya untuk pekerjaan yang sensitif terhadap latensi: mengikuti instruksi sederhana, chat, dan endpoint throughput tinggi.mediumadalah titik keseimbangan dan default. Google menyebutnya sebagai pengaturan untuk kode kompleks dan tugas-tugas agenik, yang merupakan sebagian besar alasan orang menjalankan model kelas Flash.highmemberi tahu model untuk bernalar sedalam mungkin. Google mencadangkannya untuk masalah multi-langkah tersulit.
Apa yang membuat ini berbeda pada 3.8 Flash adalah perilaku default baru model ini. Pada tugas-tugas kompleks, ia “menjalankan langkah-langkah penalaran tambahan, dan memanggil alat secara berulang” serta “memverifikasi pekerjaannya di sepanjang jalan”. Google secara terang-terangan menyatakan bahwa model ini “dapat menggunakan lebih banyak token pada tugas yang berjalan lebih lama dan kompleks, sesuai desain” dan bahwa “model mungkin menggunakan lebih banyak token untuk memaksimalkan kinerja, terutama pada tingkat usaha yang lebih tinggi”. Tingkat berpikir adalah pengatur perilaku tersebut. Menurunkannya adalah saran pertama Google ketika penggunaan token meningkat; yang kedua adalah tetap menggunakan 3.7 Flash, yang tetap didukung penuh.
Satu batasan yang perlu diingat: thinking_level adalah enum, bukan anggaran. Bilangan bulat thinking_budget dari model sebelumnya sudah tidak ada di Gemini 3, jadi Anda tidak bisa meminta “maksimal 2.000 token berpikir”. Anda memilih sebuah tingkat dan kemudian memverifikasi berapa biayanya pada prompt Anda, itulah sebabnya mengapa pengujian di akhir panduan ini penting.
Defaultnya adalah medium, bukan high
Lewati kolom tersebut dan 3.8 Flash akan berjalan pada tingkat medium. Ini memengaruhi dua kelompok.
Tim yang membuat prototipe pada Gemini 3 Pro mengharapkan high secara default dan mendapatkan jawaban kedalaman menengah tanpa menyadarinya. Tim yang menghapus thinking_budget selama peningkatan 3.7 Flash dan tidak menggantinya dengan sebuah tingkat berakhir pada `medium` di mana-mana, termasuk rute chat yang seharusnya pada low.
Perbaikan untuk keduanya sama: atur thinking_level secara eksplisit pada setiap permintaan, per rute, dalam konfigurasi, bukan dalam kode. Pengaturan default dapat diubah oleh Google; profil biaya Anda tidak boleh berubah ketika mereka melakukannya.
Mengapa minimal sudah tidak ada dan cara memperbaiki kesalahannya
minimal berfungsi pada Gemini 3.7 Flash. Pada 3.8 Flash, minimal tidak ada dalam daftar yang didukung, dan halaman model hanya mencantumkan tingkat berpikir sebagai low, medium, dan high. Kirim melalui REST dan permintaan akan ditolak sebelum model berjalan dengan 400 INVALID_ARGUMENT dengan pesan “Thinking level MINIMAL is not supported for this model. Please retry with other thinking level.” (diverifikasi dengan panggilan langsung pada 3 September 2026). SDK membungkusnya dalam kelas pengecualian mereka sendiri, jadi cocokkan berdasarkan status 400 atau kode INVALID_ARGUMENT, bukan string pesan.
Sebelum:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "minimal" }
}
Setelah:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "low" }
}
Panduan migrasi Google adalah pemetaan langsung: minimal menjadi low. Ada dua godaan yang harus dihindari saat Anda berada dalam konfigurasi tersebut. Jangan mencari thinking_budget untuk mendapatkan batasan yang lebih kecil; itu tidak didukung pada model Gemini 3. Dan jangan menurunkan temperature untuk “menenangkan model”; Google menyarankan untuk membiarkannya pada default 1.0 di semua model Gemini 3 karena menurunkannya dapat menyebabkan pengulangan atau keluaran yang terdegradasi. Daftar periksa lengkap, termasuk tanda tangan pemikiran dan persyaratan call_id pada respons fungsi, ada di panduan migrasi 3.7 ke 3.8 Flash.
Karena kesalahan muncul pada waktu validasi, permintaan uji terjadwal di setiap tingkat akan menangkap konfigurasi yang kembali ke minimal secara gratis.
Berapa biaya setiap tingkat per tugas
Harga per-token tidak berubah dengan tingkat. Halaman harga Google mencantumkan setiap panggilan 3.8 Flash seharga $0.75 masukan dan $3.75 keluaran per juta token pada tarif pengantar, yang akan berlipat ganda menjadi $1.50 dan $7.50 pada 01-01-2027. Perbedaan antar tingkat murni berdasarkan jumlah token, seperti yang diukur oleh Artificial Analysis.
| Model dan tingkat | Biaya per tugas | Waktu per tugas |
|---|---|---|
Gemini 3.8 Flash low |
$0.24 | 0.8 menit |
Gemini 3.8 Flash medium |
$0.41 | tidak dipublikasikan dalam teks |
Gemini 3.8 Flash high |
$0.58 | 2.5 menit |
Gemini 3.7 Flash high |
$0.40 | 2.2 menit |
Sumber: Artificial Analysis, Intelligence Index berjalan pada harga perkenalan. Tiga rasio dapat diambil dari tabel.
low berjalan sekitar 41% dari biaya high dan sekitar sepertiga dari waktu sebenarnya. Itu adalah pengungkit tunggal terbesar yang Anda miliki pada model ini.
medium pada 3.8 Flash biayanya kira-kira sama dengan high pada 3.7 Flash ($0.41 vs $0.40). Jika Anda puas dengan 3.7 Flash pada high, maka 3.8 Flash pada medium adalah garis anggaran yang setara.
high pada 3.8 Flash berbiaya 45% lebih mahal per tugas daripada high pada 3.7 Flash, dengan harga per-token yang identik, karena model mengeluarkan sekitar 30% lebih banyak token keluaran (rata-rata 48k per tugas indeks). Itu adalah desain "bekerja lebih keras" yang terlihat pada tagihan. Apakah token tambahan itu sepadan tergantung pada beban kerja; perbandingan 3.8 Flash vs 3.7 Flash menjelaskan di mana peningkatan kualitas diperoleh.
Satu peringatan tentang kualitas: Skor Intelligence Index AA sebesar 59 untuk 3.8 Flash adalah hasil dari high. Mereka tidak memublikasikan skor indeks pada tingkat medium atau low dalam teks, jadi jangan berasumsi bahwa kurva kualitas linier dengan biaya. Uji evaluasi Anda sendiri di setiap tingkat sebelum Anda menurunkan rute. Untuk contoh terperinci 1.000 tugas sehari di setiap tingkat dan batas harga 31 Desember, lihat harga Gemini 3.8 Flash.
Mengatur thinking_level di Interactions API
Interactions API adalah antarmuka utama Google untuk Gemini 3.x. Tingkat tersebut berada di generation_config sebagai string snake_case:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
Dalam Python:
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Explain HTTP caching in 3 sentences.",
generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
Ini adalah kolom tingkat permintaan, jadi aturlah pada setiap panggilan, termasuk giliran berikutnya yang melewati previous_interaction_id. Respons akan kembali sebagai daftar langkah eksekusi (pemikiran, panggilan alat) yang berakhir di model_output, dan SDK mengekspos teks akhir sebagai output_text. Untuk panduan panggilan pertama yang lengkap, termasuk status multi-giliran dan streaming, lihat cara menggunakan Gemini 3.8 Flash API.
Mengaturnya di generateContent lama
Sebagian besar kode Gemini yang ada masih memanggil generateContent. Google menyebutnya warisan (legacy) tetapi mengatakan bahwa ini tetap didukung penuh tanpa tanggal penghentian, jadi tidak perlu terburu-buru. Kolom ini bersarang satu tingkat lebih dalam dan menggunakan camelCase:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' -X POST \
-d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
Dalam Python:
from google.genai import types
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Explain HTTP caching in 3 sentences.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.usage_metadata.thoughts_token_count)
includeThoughts: true menambahkan ringkasan pemikiran ke respons sebagai bagian yang ditandai thought: true: berguna saat mengkalibrasi tingkat, menjadi gangguan setelah Anda selesai. Angka yang Anda pedulikan adalah usageMetadata.thoughtsTokenCount, jumlah persis yang ditagih sebagai keluaran dan kolom yang harus diawasi oleh pengujian Anda.
Strategi per rute
Perlakukan tingkat sebagai keputusan routing, bukan pengaturan global. Pembagian yang dapat diterapkan:
- Obrolan, pelengkapan otomatis, dan apa pun yang ditunggu seseorang:
low. Di sinilah latensi token pertama berada. - Klasifikasi, ekstraksi, dan pencarian transkrip:
low, dengan menjalankan evaluasi Anda sendiri sekali untuk memastikan akurasi tetap terjaga. Contoh video Google sendiri menempatkan pencarian transkrip padalow. - Agen pengkodean dan loop alat:
medium, defaultnya. Tingkatkan satu langkah perencanaan kehighjika keluarannya menentukan setiap langkah selanjutnya, lalu turunkan kembali. Pada 3.8 Flash, loop alat sudah berjalan lebih banyak giliran sesuai desain, jadihighdi seluruh loop akan cepat menumpuk. - Alur kerja yang berat dokumen, berjangka panjang:
high, dan masukkan ke Batch API dengan diskon 50% saat tidak interaktif. - Video: Dokumen Google memberikan tiga contoh.
highuntuk Tanya Jawab visual padat atau video lebih dari 60 menit,mediumuntuk Tanya Jawab video umum,lowuntuk mencari transkrip.
Jika low pada 3.8 Flash masih merupakan model yang terlalu banyak dari yang dibutuhkan suatu rute, jalur Flash-Lite ada untuk tugas itu; panduan Gemini 3.1 Flash-Lite kami sebelumnya membahas komprominya, dan Gemini 3.5 Flash-Lite adalah entri saat ini dengan $0.30 masukan dan $2.50 keluaran.
Simpan tingkat dalam konfigurasi per rute dan simpan gemini-3.7-flash di balik tanda (flag). Jika jumlah token suatu rute melonjak setelah pembaruan, Anda dapat menurunkan tingkat atau model tanpa perlu melakukan deployment.
Uji ketiga tingkat secara berdampingan di Apidog
Membaca tabel AA memberi tahu Anda rasio. Hanya prompt Anda yang memberi tahu Anda angkanya. Berikut adalah skenario pengujian di Apidog yang mengirimkan satu prompt "emas" di setiap tingkat dan menegaskan apa yang kembali. Ini bekerja pada salah satu bentuk API; endpoint lama ditampilkan karena usageMetadata adalah kolom tingkat teratas di sana.
- Simpan kunci sebagai variabel lingkungan. Buat
GEMINI_API_KEYdi lingkungan Apidog dan referensikan sebagai{{GEMINI_API_KEY}}di headerx-goog-api-key. Tambahkan variabel kedua,THINKING_LEVEL, agar satu permintaan tersimpan melayani ketiga langkah. - Simpan satu permintaan. POST ke
/v1beta/models/gemini-3.8-flash:generateContentdengan prompt emas Anda dan"thinkingConfig": {"thinkingLevel": "{{THINKING_LEVEL}}"}. - Buat skenario pengujian tiga langkah. Impor permintaan yang sama tiga kali dan ganti
THINKING_LEVELmenjadilow,medium, danhighdi setiap langkah. - Tegaskan pada kolom yang berubah. Pada setiap langkah: status adalah 200 dan
usageMetadata.thoughtsTokenCountada. Pada langkahlow, tegaskan bahwathoughtsTokenCountdan waktu respons tetap di bawah batas yang dapat ditoleransi rute tersebut (tetapkan baseline setelah eksekusi pertama Anda). Skrip pasca-pemrosesan dapat menyimpan jumlah setiap langkah dalam variabel sehingga langkahhighdapat menegaskan bahwa ia bernalar setidaknya sebanyaklow. Jika urutan itu pernah terbalik, berarti model atau default telah berubah di bawah Anda. - Tambahkan langkah pengamanan. Kirim
thinkingLevel: "minimal"dan tegaskan bahwa responsnya bukan 200. Saat Anda nanti menukar ID model, langkah ini memberi tahu Anda apakah model baru masih menolaknya. - Jadwalkan. Jalankan skenario setiap hari agar regresi konfigurasi atau perubahan perilaku yang diam-diam muncul sebagai eksekusi merah, bukan tagihan kejutan. Mekanismenya ada di cara menjadwalkan tes API di Apidog.
Untuk respons yang di-stream, skenario yang sama berlaku dengan rendering SSE; cara menguji API LLM yang melakukan streaming melalui SSE mencakup pengaturannya. Unduh Apidog untuk mengikuti; paket gratis mencakup seluruh skenario ini.
FAQ
Apakah tingkat berpikir mengubah harga per token?
Tidak. Masukan adalah $0.75 dan keluaran adalah $3.75 per juta token pada 3.8 Flash dengan tarif pengantar terlepas dari tingkatnya. Tingkat tersebut mengubah berapa banyak token keluaran yang dihasilkan model sebagai pemikiran, dan token tersebut ditagih dengan harga keluaran. Rincian harga mencakup caching, batch, dan kenaikan pada 1 Januari.
Bisakah saya mengatur anggaran token berpikir yang tepat sebagai gantinya?
Tidak pada model Gemini 3. thinking_budget digantikan oleh enum thinking_level, dan 3.8 Flash hanya menerima low, medium, dan high. Jika Anda memerlukan batas atas, terapkan dalam pengujian dan peringatan, bukan dalam permintaan.
Tingkat mana yang digunakan skor Artificial Analysis 59?
high. AA menjalankan Intelligence Index pada tingkat high untuk skor utama dan memublikasikan biaya dan waktu pada tingkat low dan medium juga, tetapi tidak skor indeks pada tingkat tersebut. Perlakukan tingkat yang lebih rendah sebagai belum teruji pada benchmark tersebut hingga Anda menjalankan evaluasi Anda sendiri.
Haruskah saya menurunkan temperature untuk mengurangi pemikiran?
Tidak. Panduan Google untuk semua model Gemini 3 adalah untuk menjaga temperature pada default 1.0. Menurunkannya dapat menyebabkan pengulangan atau keluaran yang terdegradasi. Gunakan thinking_level untuk mengontrol kedalaman penalaran.
Bagaimana jika bahkan tingkat low terlalu lambat atau terlalu mahal?
Tetap gunakan Gemini 3.7 Flash, yang menurut Google tetap didukung penuh tanpa tanggal penghentian, atau pindahkan rute ke model Flash-Lite. Perbandingan 3.8 vs 3.7 Flash menunjukkan di mana token tambahan membeli kualitas yang terukur dan di mana tidak.
Pilih tingkat per rute, lalu ukur
Tiga tingkat, satu enum, dan model yang bernalar lebih banyak dari pendahulunya secara default. Atur thinking_level secara eksplisit pada setiap rute, petakan minimal yang tersisa ke low, dan awasi usageMetadata.thoughtsTokenCount di mana setiap tingkat bekerja. Angka per-tugas AA ($0.24, $0.41, $0.58) memberi Anda bentuk kurva; skenario tiga langkah di Apidog memberi Anda angka Anda sendiri sebelum perubahan harga 31 Desember membuatnya dua kali lebih penting.
