Google merilis Gemini 3.8 Flash pada 2 September 2026, dan ID model API-nya adalah string biasa gemini-3.8-flash, tanpa sufiks pratinjau. Ini mempertahankan harga pengantar 3.7 Flash sebesar $0,75 per juta token input dan $3,75 per juta token output hingga 31 Desember 2026, dan Google mendeskripsikannya sebagai model yang "bekerja lebih keras": ia melakukan lebih banyak langkah penalaran dan memanggil alat lebih sering untuk tugas-tugas kompleks, yang akan terlihat pada tagihan token Anda.
Panduan ini mencakup jalur lengkap menuju integrasi yang berfungsi: mendapatkan kunci di AI Studio, mengirim permintaan pertama melalui Interactions API (API utama Google untuk Gemini 3.x sekarang), setara generateContent lama yang masih digunakan sebagian besar kode yang ada, di mana thinking_level berada di masing-masing, streaming, dan cara membaca thoughtsTokenCount agar biaya berpikir tidak pernah mengejutkan Anda. Setiap panggilan adalah HTTP biasa dengan JSON, jadi Anda dapat membangun dan memeriksa setiap panggilan di Apidog sebelum masuk ke kode aplikasi.
Untuk gambaran umum model, tolok ukur, dan apa yang berubah, mulailah dengan apa itu Gemini 3.8 Flash. Posting peluncuran Google memiliki kerangka resmi.
Sekilas API Gemini 3.8 Flash
| Item | Nilai |
|---|---|
| ID Model | gemini-3.8-flash |
| Endpoint utama | POST /v1beta/interactions |
| Endpoint lama | POST /v1beta/models/gemini-3.8-flash:generateContent |
| Header Auth | x-goog-api-key |
| Kontek / output | 1.048.576 token input / 65.536 token output |
| Input | Teks, gambar, video, audio, PDF (hanya output teks) |
| Tingkat berpikir | low, medium (default), high; minimal mengembalikan kesalahan |
| Harga (pengantar hingga 31 Des 2026) | $0,75 / $3,75 per 1 juta token; $1,50 / $7,50 mulai 1 Jan 2027 |
Dua detail menonjol sebelum Anda menulis kode. Tingkat berpikir default adalah medium, bukan high seperti pada Gemini 3 Pro. Dan token berpikir ditagih dengan tarif output pada halaman harga resmi, jadi tingkat yang Anda pilih adalah keputusan biaya dan juga kualitas. Perincian harga membahas angka per tugas.
Langkah 1: Dapatkan kunci API di AI Studio
Buka Google AI Studio, masuk dengan akun Google, dan buat kunci API dari halaman kunci. Kunci tersebut berfungsi di tingkat gratis secara langsung, dengan batasan laju dan peringatan bahwa Google mengatakan data tingkat gratis "digunakan untuk meningkatkan produk kami". Tautkan akun penagihan untuk pindah ke Tingkat 1 untuk batasan produksi.
Ekspor kunci alih-alih menempelkannya ke kode:
export GEMINI_API_KEY="AIza..."
SDK Python resmi membaca GEMINI_API_KEY dari lingkungan, jadi genai.Client() tidak memerlukan argumen. Instal dengan pip install google-genai.
Langkah 2: Panggilan pertama Anda dengan Interactions API
Google sekarang memperlakukan Interactions API sebagai cara utama untuk memanggil model Gemini 3.x. Permintaan adalah satu objek JSON: model, input, dan generation_config opsional tempat thinking_level berada.
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"input": "Jelaskan caching HTTP dalam 3 kalimat.",
"generation_config": {"thinking_level": "medium"}
}'
Responsnya adalah daftar langkah eksekusi alih-alih satu pesan. Pikiran model dan panggilan alat muncul sebagai langkah-langkah, dan langkah terakhir adalah model_output, yang berisi teks. Dalam Python, SDK meratakan ini untuk Anda:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Jelaskan caching HTTP dalam 3 kalimat.",
generation_config={"thinking_level": "medium"},
)
print(interaction.output_text)
Biarkan temperature, top_p, dan top_k kosong. Pedoman Google untuk setiap model Gemini 3 adalah menjaga suhu pada defaultnya 1.0, karena menurunkannya "dapat menyebabkan perulangan atau penurunan kinerja". Jika Anda menyalin konfigurasi dari model yang lebih lama, itu adalah baris pertama yang harus dihapus.
Langkah 3: Multi-giliran dengan previous_interaction_id
Interactions API mempertahankan status percakapan di server secara default. Untuk melanjutkan percakapan, kirim id respons sebelumnya sebagai previous_interaction_id bersama dengan hanya input pengguna baru. Anda tidak mengirim ulang riwayat.
follow_up = client.interactions.create(
model="gemini-3.8-flash",
input="Sekarang berikan satu contoh header Cache-Control.",
previous_interaction_id=interaction.id,
)
print(follow_up.output_text)
Jika aturan kepatuhan Anda melarang penyimpanan sisi server, atur store: false. Imbalannya adalah Anda kemudian mengelola status sendiri, termasuk mengirim blok pemikiran model dan tanda tangan pemikiran persis seperti yang Anda terima pada setiap giliran. Itu adalah aturan yang sama yang menyebabkan masalah penggunaan alat, dibahas dalam panduan pemanggilan fungsi untuk 3.8 Flash.
Langkah 4: Jalur generateContent lama
Sebagian besar kode Gemini yang ada dalam produksi masih memanggil generateContent. Google menyebutnya lama, tetapi "tetap didukung sepenuhnya" tanpa tanggal penghentian, jadi Anda tidak perlu menulis ulang apa pun hari ini. Panduan API Gemini 3.7 Flash kami hanya mencakup jalur ini; bentuknya identik untuk 3.8 Flash, dan pengaturan berpikir berada di tempat yang berbeda daripada di Interactions.
Dalam generateContent, tingkatnya berada di bawah generationConfig.thinkingConfig.thinkingLevel, dalam camelCase:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{"parts": [{"text": "Jelaskan caching HTTP dalam 3 kalimat."}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "low"}}
}'
Setara Python menggunakan objek konfigurasi berjenis:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Jelaskan caching HTTP dalam 3 kalimat.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.text)
Jika Anda berasal dari konfigurasi yang menggunakan thinking_budget sebagai bilangan bulat, gantilah dengan enum string. candidate_count juga sudah tidak ada di Gemini 3 dan yang lebih baru. Daftar periksa lengkap, dengan JSON sebelum dan sesudah untuk setiap perubahan, ada di panduan migrasi 3.7 ke 3.8 Flash.
Berikut adalah set kekhawatiran yang sama secara berdampingan, sehingga Anda dapat menerjemahkan antara kedua API tanpa membaca ulang kedua dokumen:
| Kekhawatiran | Interactions API | Legacy generateContent |
|---|---|---|
| Tingkat berpikir | generation_config.thinking_level |
generationConfig.thinkingConfig.thinkingLevel |
| Status percakapan | previous_interaction_id (sisi server) |
Kirim ulang array contents lengkap |
| Hasil alat | function_result dengan call_id + name |
functionResponse dengan id + name (nilai yang sama, nama bidang berbeda) |
| Teks akhir | Langkah model_output (output_text di SDK) |
candidates[0].content.parts[].text |
| Tanda tangan pemikiran | Ditangani untuk Anda kecuali store: false |
Sampaikan kembali setiap bagian persis seperti yang diterima |
Langkah 5: Streaming dan membaca biaya berpikir
Untuk antarmuka obrolan, tukar nama metode untuk streamGenerateContent dan tambahkan ?alt=sse untuk mendapatkan kejadian yang dikirim server (server-sent events), satu potongan candidates parsial per kejadian:
curl -N "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:streamGenerateContent?alt=sse" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Sebutkan tiga header caching HTTP."}]}]}'
Streaming atau tidak, setiap respons generateContent diakhiri dengan objek usageMetadata. Bacalah pada setiap panggilan:
"usageMetadata": {
"promptTokenCount": 12,
"candidatesTokenCount": 84,
"thoughtsTokenCount": 310,
"totalTokenCount": 406
}
thoughtsTokenCount adalah angka yang perlu diperhatikan pada 3.8 Flash. Token berpikir ditagih sebagai token output sebesar $3,75 per juta selama periode pengenalan, dan Google menyatakan model tersebut "mungkin menggunakan lebih banyak token untuk memaksimalkan kinerja, terutama pada tingkat upaya yang lebih tinggi". Artificial Analysis mengukur sekitar 48 ribu token output per tugas pada uji indeksnya di tingkat high, 30% lebih banyak dari 3.7 Flash, yang mendorong biaya per tugas dari $0,40 menjadi $0,58 dengan harga per token yang tidak berubah. Uji mereka pada tingkat medium dan low menghasilkan biaya $0,41 dan $0,24 per tugas. Panduan tingkat berpikir mengubah angka-angka tersebut menjadi strategi per rute.
Untuk melihat apa yang dipikirkan model, tambahkan "includeThoughts": true di dalam thinkingConfig. Ringkasan pemikiran akan kembali sebagai bagian yang ditandai dengan "thought": true; lewati ini saat Anda menyusun jawaban yang terlihat.
Kesalahan yang akan Anda temui di jam pertama
thinking_level: "minimal" gagal validasi. Gemini 3.8 Flash hanya mendukung low, medium, dan high. Mengirim minimal mengembalikan 400 INVALID_ARGUMENT dengan pesan “Thinking level MINIMAL is not supported for this model. Please retry with other thinking level.” (diverifikasi dengan panggilan langsung pada 3 September 2026), dan perbaikannya adalah perubahan satu kata menjadi low. Konfigurasi 3.x yang lebih lama dan potongan kode yang disalin adalah sumber yang biasa.
429 berarti Anda mencapai batas tingkatan Anda, bukan bug. Halaman batasan laju menjelaskan tingkatan: tingkatan gratis dibatasi lajunya, Tingkat 1 terbuka saat Anda menautkan akun penagihan, Tingkat 2 memerlukan $100 pengeluaran ditambah tiga hari, dan Tingkat 3 memerlukan $1.000 ditambah 30 hari. Angka permintaan per menit dan token per menit per model hanya ditampilkan di halaman batasan laju AI Studio untuk akun Anda, jadi periksalah di sana daripada memercayai angka dari postingan blog. Pada 429, mundur dan coba lagi; pada 429 yang berulang pada volume rendah, tingkatkan tingkatan. Untuk pekerjaan offline, Batch API adalah perbaikan yang lebih baik: ia berjalan dengan diskon 50% ($0,375 / $1,875 per juta token selama periode pengenalan) dan memiliki batas token antrean sendiri yaitu 3 juta pada Tingkat 1, 400 juta pada Tingkat 2, dan 1 miliar pada Tingkat 3. Panduan mode batch Gemini menunjukkan bentuk permintaan.
call_id hilang pada hasil fungsi. Jika Anda menggunakan alat, setiap function_result (Interactions) harus membawa call_id dan name pada 3.8 Flash, dan setiap functionResponse lama harus membawa id yang cocok ditambah name. Mengabaikan salah satunya akan menggagalkan giliran.
Uji kedua endpoint di Apidog sebelum dirilis
Setelah kedua permintaan berfungsi dari terminal, pindahkan ke tempat di mana seluruh tim dapat menjalankannya. Unduh Apidog, buat proyek, dan tambahkan dua endpoint di atas sebagai permintaan tersimpan. Empat kebiasaan yang menguntungkan:
- Jauhkan kunci dari permintaan. Tambahkan
GEMINI_API_KEYsebagai variabel lingkungan dan referensikan sebagai{{GEMINI_API_KEY}}di headerx-goog-api-key. Permintaan yang disimpan tidak pernah berisi rahasia, dan beralih antara kunci tingkat gratis dan kunci berbayar adalah satu perubahan lingkungan. - Asertif pada status dan penggunaan token. Tambahkan asersi bahwa statusnya adalah 200, kemudian asersi jalur JSON bahwa
usageMetadata.thoughtsTokenCounttetap di bawah batas yang Anda pilih per perintah. Batas ini adalah alarm regresi biaya Anda: jika pembaruan perintah atau perubahan model senyap mendorong token berpikir naik, pengujian akan gagal sebelum tagihan. Panduan pengujian SSE mencakup varian streaming, yang dirender Apidog sebagai aliran kejadian yang digabungkan daripada potongan mentah. - Kirim perintah yang sama di ketiga tingkatan. Duplikasi permintaan dengan
low,medium, danhigh, dan bandingkanthoughtsTokenCountdan waktu respons secara berdampingan. Itu memberi Anda angka riil untuk perintah Anda alih-alih rata-rata indeks. - Jadwalkan. Ubah permintaan menjadi skenario pengujian dan jalankan sesuai jadwal, sehingga perubahan batasan laju, perubahan validasi seperti penghapusan
minimal, atau lonjakan token muncul dalam laporan, bukan dalam produksi. Cara menjadwalkan pengujian API di Apidog menjelaskan penyiapan.
Apidog tidak menjalankan model atau mengganti SDK. Ini memberi Anda versi panggilan HTTP yang disimpan, dapat dibagikan, dan dapat diasertifkan, yang merupakan bagian yang dilewati sebagian besar tim hingga ada sesuatu yang rusak.
FAQ
Endpoint mana yang harus digunakan proyek baru? Interactions API. Google menyebut generateContent lama, dan masih didukung sepenuhnya, tetapi fitur baru mendarat di Interactions terlebih dahulu dan status sisi server membuat kode multi-giliran lebih pendek. Pertahankan generateContent untuk layanan yang ada hingga Anda memiliki alasan untuk bermigrasi.
Apakah saya memerlukan akun berbayar untuk memanggil Gemini 3.8 Flash? Tidak. Kunci AI Studio gratis berfungsi, dengan batasan laju dan ketentuan penggunaan data Google. Panduan penggunaan gratis mencantumkan apa yang akan dan tidak akan diberikan oleh tingkat gratis kepada Anda, termasuk fakta bahwa aplikasi Gemini memerlukan paket AI Pro atau Ultra untuk 3.8 Flash.
Apakah 3.8 Flash lebih lambat dari 3.7 Flash? Per token, tidak. Logan Kilpatrick dari Google mengatakan kecepatannya kurang lebih sama, dan Artificial Analysis mengukur sekitar 300 token output per detik. Per tugas memang membutuhkan waktu lebih lama pada tingkat high (2,5 menit berbanding 2,2 dalam uji mereka) karena menghasilkan lebih banyak token.
Bisakah saya tetap memanggil Gemini 3.7 Flash? Ya. Google mengatakan 3.7 Flash "tetap didukung sepenuhnya" dan belum menerbitkan tanggal penghentian. Jika pengeluaran token tambahan pada 3.8 Flash tidak memberikan keuntungan apa pun pada beban kerja Anda, tetap menggunakan yang lama adalah pilihan yang valid.
Apakah 3.8 Flash mendukung Live API atau pembuatan gambar? Tidak. Ini hanya mengeluarkan teks. Pembuatan audio, pembuatan gambar, dan Live API tidak didukung pada model ini.
Ke mana selanjutnya
Anda sekarang memiliki dua jalur panggilan yang berfungsi, pola multi-giliran, dan pemeriksaan penggunaan token. Dari sini, sambungkan alat dengan panduan pemanggilan fungsi, putuskan tingkat per rute Anda dengan postingan tingkat berpikir, dan jika Anda masih memutuskan apakah akan pindah sama sekali, perbandingan 3.8 vs 3.7 Flash menjelaskan pertukarannya. Pertahankan skenario Apidog berjalan sehingga pergeseran biaya muncul sebagai pengujian yang gagal.
