Google meluncurkan dua model speech-to-speech baru pada 15 September 2026, dan utas Hacker News menembus 337 poin dalam sehari. Itu adalah reaksi besar untuk peluncuran API suara, dan sebagian besar diskusi bukan tentang video demo. Itu adalah para pengembang yang menanyakan pertanyaan yang sama: berapa biaya untuk membangun dengan ini, dan bagaimana cara benar-benar terhubung dengannya?
Ini adalah panduan tersebut. gemini-3.8-live dan gemini-3.8-live-extended-thinking kini sedang diluncurkan di Gemini API dan Google AI Studio, dengan akses Gemini Enterprise dan Search Live dalam pratinjau pribadi. Kedua model menerima token input dan output gratis di samping tingkatan berbayar dengan tarif per-token dan per-menit, yang cukup tidak biasa untuk model audio langsung sehingga layak untuk membahas sesi WebSocket itu sendiri, bukan hanya halaman harga. Kami sudah membandingkan asisten suara konsumen di GPT-Live vs Gemini Live; tulisan ini adalah jalur pengembang ke dalam API di balik salah satu sisi perbandingan tersebut.
Apa yang sebenarnya diluncurkan pada 15 September
Pengumuman Google mencakup dua model. gemini-3.8-live adalah model speech-to-speech standar. gemini-3.8-live-extended-thinking menambahkan lapisan penalaran yang berjalan saat model berbicara, dijelaskan di bawah. Keduanya mendukung 97 bahasa dengan peralihan otomatis di tengah percakapan, yang berarti penelepon dapat memulai kalimat dalam bahasa Inggris dan menyelesaikannya dalam bahasa Spanyol tanpa penanda bahasa manual.

Ketersediaan saat peluncuran: Gemini API dan Google AI Studio (akses umum), ditambah Gemini Enterprise dan Search Live (pratinjau pribadi, jadi sebagian besar pengembang yang membaca ini akan memulai di API atau AI Studio). Token gratis berlaku untuk kedua model baik pada input maupun output, yang membuat prototipe nyata dapat dicapai sebelum Anda menyentuh kartu kredit.
Satu detail yang belum dipublikasikan Google: batas laju tingkatan gratis untuk kedua model Live. Halaman batas laju adalah sumber kebenaran setelah mencantumkannya; perlakukan angka apa pun yang Anda lihat di tempat lain sebagai tidak terkonfirmasi sampai Anda memeriksanya sendiri di sana.
Akses Search Live dan Gemini Enterprise yang hanya pratinjau pribadi, daripada terbuka seperti API, adalah sinyal yang patut dibaca: Google merasa nyaman membiarkan pengembang membangun ini dengan cara yang berdekatan dengan produksi sebelum berkomitmen model yang sama untuk pencarian konsumen atau langganan enterprise berbayar. Itu normal untuk peluncuran model suara, dan itu berarti antarmuka API adalah titik awal yang stabil saat ini, bukan pratinjau yang disederhanakan dari pengalaman konsumen yang lebih baik yang akan datang nanti.
Dapatkan kunci API gratis dan buka sesi
Kunci API Gemini berasal dari Google AI Studio, terikat dengan akun Google, dan berfungsi dengan model Live pada hari yang sama saat diluncurkan karena tidak ada langkah persetujuan terpisah untuk tingkatan gratis. Setelah Anda memiliki kunci, titik koneksi adalah WebSocket, bukan endpoint REST, yang merupakan penyesuaian pertama jika Anda terbiasa dengan panggilan generateContent:
wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent
URL tersebut berasal dari ulasan langsung Simon Willison dari hari peluncuran, diterbitkan bersama dengan pembacaan cermatnya yang biasa tentang API baru. Dia juga menandai sesuatu yang patut diketahui sebelum Anda membangun UI di sekitarnya: Anda dapat menginterupsi model di tengah respons seperti Anda menginterupsi orang yang berbicara, dan transkrip yang kembali dapat mencakup ucapan yang mulai dihasilkan model tetapi tidak pernah selesai diputar, karena pemutaran terputus oleh interupsi Anda. Tangani itu sebagai status yang berbeda di klien Anda daripada berasumsi setiap baris transkrip didengar sepenuhnya.
Sesi dua arah melalui soket tersebut mengikuti bentuk yang digunakan setiap API streaming berbasis WebSocket: pesan pengaturan terlebih dahulu, mengidentifikasi model dan konfigurasi generasinya, kemudian aliran pesan konten yang membawa potongan audio atau teks ke kedua arah, dengan server mendorong kembali segmen respons parsial dan final saat siap. Skema pesan yang tepat adalah tanggung jawab Google untuk mendokumentasikannya dengan cermat, dan dapat berubah antara pratinjau dan ketersediaan umum, jadi verifikasi nama bidang terhadap dokumen Gemini API langsung dan referensi untuk SDK Anda sebelum Anda berkomitmen pada klien produksi. Yang stabil adalah polanya: sambungkan, kirim pengaturan, streaming konten, baca respons streaming, dan harapkan interupsi menjadi peristiwa normal daripada kasus kesalahan.
Secara praktis, itu berarti sesi kerja pertama Anda harus menargetkan loop sekecil mungkin: buka soket, kirim satu pesan pengaturan yang menamai model yang Anda inginkan (`gemini-3.8-live` atau `gemini-3.8-live-extended-thinking`), kirim giliran audio atau teks singkat tunggal, dan konfirmasikan Anda mendapatkan respons streaming kembali sebelum menambahkan logika percobaan ulang, penanganan koneksi ulang, atau UI. Bangun jalur interupsi kedua, setelah jalur yang berhasil berfungsi, karena mengujinya dengan baik berarti sengaja berbicara di atas model di tengah respons dan memeriksa bahwa klien Anda dengan benar menandai transkrip yang terpotong daripada memperlakukannya sebagai giliran yang selesai.
Pemikiran diperpanjang: saat penalaran terjadi secara verbal
Model `gemini-3.8-live` biasa merespons secara langsung. `gemini-3.8-live-extended-thinking` melakukan sesuatu yang berbeda: Google mengatakan itu “bernalar dan berbicara secara bersamaan,” menjaga apa yang disebutnya “aliran percakapan tanpa henti” dengan mengisi waktu penalaran dengan isyarat verbal, frasa seperti “Biar saya cek itu” alih-alih keheningan saat model bekerja.
Itu penting untuk satu kelas aplikasi tertentu: agen suara yang memanggil alat atau mengakses API eksternal di tengah percakapan. Model pemikiran-ekstended “menjalankan alat dan panggilan API di latar belakang sambil melanjutkan percakapan,” dan pemanggilan fungsi didukung pada kedua model. Bayangkan agen pemesanan yang perlu memeriksa ketersediaan terhadap API kalender: alih-alih diam selama dua detik saat pencarian berjalan, model dapat mengakui permintaan secara verbal dan menjaga percakapan tetap berjalan sementara panggilan selesai di belakangnya.
Pilih pemikiran diperpanjang ketika sesi Anda mencakup panggilan alat, pencarian multi-langkah, atau jawaban yang membutuhkan penalaran berat di mana jeda hening akan terasa terputus. Pilih model biasa untuk pertukaran yang lebih pendek, latensi rendah di mana overhead penalaran tidak diperlukan. Keduanya memiliki biaya yang sama per token, jadi pilihannya adalah tentang perilaku, bukan anggaran. Jika agen Anda mengandalkan pemanggilan fungsi secara khusus, panduan pemanggilan fungsi kami untuk Gemini 3.8 Flash mencakup bentuk permintaan yang digunakan Google di seluruh keluarga Gemini 3.8 saat ini, meskipun konfirmasikan payload pemanggilan fungsi khusus Live terhadap dokumen Live API sebelum meluncurkan, karena API teks dan ucapan tidak dijamin berbagi skema.
Biaya, dihitung
Kedua model Live memiliki harga standar yang sama:
| Jenis | Tarif |
|---|---|
| Input Teks | $0.75 per 1 Juta token |
| Input Audio | $3.00 per 1 Juta token, atau $0.005 per menit |
| Input Gambar/Video | $1.00 per 1 Juta token, atau $0.002 per menit |
| Output Teks | $4.50 per 1 Juta token |
| Output Audio | $12.00 per 1 Juta token, atau $0.018 per menit |
Token pemikiran ditagih sebagai output, sama seperti setiap model Gemini 3.x lainnya, jadi penalaran latar belakang pemikiran diperpanjang muncul pada baris output daripada sebagai biaya terpisah.
Contoh perhitungan: panggilan suara 10 menit, audio masuk dan audio keluar sepanjang waktu, pada tingkatan standar berbayar. Input Audio: 10 menit x $0.005 = $0.05. Output Audio: 10 menit x $0.018 = $0.18. Total: $0.23 untuk percakapan bolak-balik penuh selama 10 menit, sebelum token teks atau panggilan alat ditambahkan di atasnya. Jalankan panggilan yang sama pada tingkatan gratis selama pembuatan prototipe dan biaya token adalah nol, tunduk pada batas laju apa pun yang pada akhirnya diterbitkan Google untuknya.
Model `gemini-3.1-flash-live-preview` pada halaman harga yang sama memiliki tarif identik dengan kedua model Live baru, yang patut diperiksa jika Anda sudah memiliki integrasi Live pada model yang lebih lama itu; keputusan harga bukanlah alasan untuk menunda migrasi.
Apa yang dikatakan pengembang, sejauh ini
Diskusi di Hacker News tidak sepenuhnya positif. Keluhan yang berulang: pelanggan berbayar Google Workspace dan Google AI Plus belum memiliki akses konsumen ke pengalaman Live yang baru, meskipun mereka adalah pelanggan berbayar, sementara akses API dan AI Studio terbuka. Satu laporan dari utas tersebut menggambarkan loop agen di mana model menciptakan persyaratan tambahan yang bukan bagian dari tugas asli, mode kegagalan yang patut diuji secara khusus jika Anda mengintegrasikan Live ke dalam agen otonom daripada asisten suara yang melibatkan manusia. Jika Anda membangun sesuatu yang lebih dekat ke loop otonom daripada asisten yang diawasi, tambahkan pemeriksaan eksplisit yang membandingkan apa yang diklaim model dibutuhkan dengan definisi tugas yang Anda berikan kepadanya, daripada mempercayai persyaratan yang dinyatakan model secara langsung. Perlakukan kedua poin ini sebagai sinyal hari pertama dari satu utas, bukan laporan cacat terverifikasi, dan uji ulang terhadap kasus penggunaan Anda sendiri sebelum Anda menggeneralisasikannya.

Lihat protokol mentah sebelum Anda menulis kode klien
Sebelum berkomitmen pada pustaka klien, ada baiknya untuk mengamati bingkai aktual yang berjalan di jaringan. Apidog dapat membuka koneksi WebSocket ke endpoint `BidiGenerateContent`, mengirim pesan pengaturan JSON dan pesan konten berikutnya secara manual, dan menunjukkan bingkai yang di-streaming kembali secara real-time, yang merupakan cara tercepat untuk memahami pola pengaturan-lalu-streaming sebelum Anda menulis satu baris kode SDK pun di sekitarnya. Apidog tidak merekam audio mikrofon untuk Anda; Anda menyediakan payload audio atau teks sendiri dan menggunakan koneksi untuk memeriksa apa yang dikirim kembali oleh server, mengonfirmasi pesan pengaturan Anda diterima, dan mengamati bagaimana interupsi berperilaku sebelum Anda membangun penanganan kesalahan untuk itu dalam produksi. Referensi protokol lengkap untuk membangun dan menguji API WebSocket dengan cara ini ada di docs.apidog.com. Unduh Apidog untuk mencoba koneksi sendiri sebelum pembangunan klien pertama Anda.
Sebagai perbandingan, penjelasan kami tentang WebSocket vs WebRTC mencakup mengapa Google memilih WebSocket untuk aliran dua arah ini daripada jalur WebRTC yang digunakan beberapa API suara pesaing, dan apa arti pertukaran itu khusus untuk klien browser.
FAQ
Apakah Gemini 3.8 Live API gratis? Ya, untuk kedua model, token input dan output gratis di tingkatan gratis. Tarif standar berbayar berlaku setelah Anda melewati batas laju apa pun yang ditetapkan Google, dan batas tingkatan gratis itu belum dipublikasikan, jadi periksa halaman batas laju secara langsung.
Apa perbedaan antara kedua model baru ini? `gemini-3.8-live` menjawab secara langsung. `gemini-3.8-live-extended-thinking` bernalar sambil berbicara, menggunakan pengisi verbal untuk menutupi panggilan alat latar belakang dan pencarian multi-langkah, dengan harga token yang sama.
Apakah saya memerlukan WebRTC untuk menggunakan ini? Tidak. API ini berbasis WebSocket, terhubung ke endpoint `BidiGenerateContent` daripada koneksi peer WebRTC.
Bisakah saya menguji ini tanpa menulis klien? Ya. Buka WebSocket di Apidog, kirim pesan pengaturan dan konten secara manual, dan baca respons streaming sebelum membangun klien nyata di sekitarnya.
