Google, Gemini 3.8 Flash'ı 3.7 Flash'tan üç hafta sonra, 2 Eylül 2026'da, aynı başlangıç fiyatıyla ve yaklaşık aynı hızla piyasaya sürdü. Model kimliği gemini-3.8-flash olup, önizleme eki yok ve model kartı onu "Gemini 3.7 Flash'a dayalı" olarak tanımlıyor. Bu nedenle çoğu ekip tek satırlık bir değişiklik bekliyor. Basit bir sohbet istemi için öyle. Ancak düşünme parametrelerini ayarlayan, örneklemeyi ayarlayan veya bir araç döngüsü çalıştıran herhangi bir şey için kontrol edilmesi gereken dokuz madde var ve bunlardan ikisi 3.7 Flash'ın hiç vermediği hataları döndürüyor.
Bu rehber, Google'ın Gemini 3.8 Flash'taki Yenilikler sayfası ve Gemini 3 geliştirici rehberinden derlenmiş bu kontrol listesidir. Her öğe, her iki API şekli için de (Google'ın artık birincil yol olarak kabul ettiği Etkileşimler API'si ve çoğu 3.7 Flash kodunun hala kullandığı eski generateContent uç noktası) öncesi ve sonrası parçacıklar içerir. Her parça Apidog'a yapıştırılabilir ve üretime geçmeden önce canlı uç noktaya gönderilebilir. Önce model genel bakışını isterseniz, Gemini 3.8 Flash nedir ile başlayın.
Listeden önce bir çerçeve notu. Google, 3.8 Flash'ın tasarıma göre "daha çok çalıştığını" söylüyor: karmaşık görevlerde daha küçük akıl yürütme adımları atıyor, işini doğruluyor ve araçları yinelemeli olarak çağırıyor. Kazanımlarının çoğunun kaynağı bu ve aynı zamanda bir geçişin sadece bir yapılandırma farkı değil, aynı zamanda bir token bütçesi incelemesi gerektirmesinin de nedeni bu.
Ne değişir ve ne değişmez
| Alan | 3.7 Flash | 3.8 Flash |
|---|---|---|
| Model Kimliği | gemini-3.7-flash |
gemini-3.8-flash |
| Bağlam / Çıkış | 1,048,576 / 65,536 | Aynı |
| Fiyat (31 Aralık 2026'ya kadar tanıtım) | 1M başına 0,75 $ / 3,75 $ | Aynı, ardından 1 Ocak 2027'den itibaren her ikisi için 1,50 $ / 7,50 $ |
| Düşünme Seviyeleri | düşük, orta, yüksek | Aynı; minimal bir doğrulama hatası döndürür; varsayılan medium'dur |
| Görev başına Token | temel | Ortalama %30 daha fazla çıkış tokeni (Artificial Analysis) |
| Fonksiyon Sonuçları | call_id + name |
Her ikisi de gerekli, zorunlu |
| Destek Durumu | "tamamen desteklenmeye devam ediyor", sona erme tarihi yok | Mevcut |
Fiyatlandırma satırlarının kaynağı: Google'ın Gemini API fiyatlandırma sayfası, burada 3.6, 3.7 ve 3.8 Flash satırları aynıdır.
Adım 0: Hiç geçiş yapıp yapmayacağınıza karar verin
Hiçbir şey geçişi zorunlu kılmıyor. Google'ın lansman yazısı, "Gemini 3.7 Flash'ın tamamen desteklenmeye devam ettiğini" belirtiyor ve herhangi bir sona erme tarihi yayınlanmadı. Token başına fiyatlandırma değişmedi, bu nedenle tek maliyet farkı kullanımdır. Artificial Analysis, 3.8 Flash'ın yüksek düşünme seviyesinde, endekslerinde görev başına yaklaşık 48 bin çıkış tokeni kullandığını, bunun 3.7 Flash'tan %30 daha fazla olduğunu ve aynı oranlarda görev başına maliyeti 0,40 $'dan 0,58 $'a çıkardığını ölçtü. Endeks puanları 56'dan 59'a yükseldi ve τ³-Banking'deki araç kullanım doğruluğu 12 puan artarak %45'e ulaştı.
Dolayısıyla takas, görev başına daha fazla token karşılığında görev başına daha fazla yetenektir. İş yükünüz kısa, gecikmeye duyarlı veya zaten 3.7 Flash üzerinde değerlendirmeleri geçiyorsa, mevcut durumda kalabilirsiniz. Tam 3.8 Flash vs 3.7 Flash karşılaştırması, iş yüküne göre bir karar matrisine sahiptir. Geçiş yapıyorsanız, okumaya devam edin.
Adım 1: Her iki şekilde de model kimliğini değiştirin
Etkileşimler API'si (Google'ın Gemini 3.x için birincil API'si):
{"model": "gemini-3.7-flash", "input": "..."}
{"model": "gemini-3.8-flash", "input": "..."}
Eski generateContent (hala destekleniyor, sona erme tarihi yok):
POST /v1beta/models/gemini-3.7-flash:generateContent
POST /v1beta/models/gemini-3.8-flash:generateContent
Python SDK, her iki yol:
client.interactions.create(model="gemini-3.8-flash", input=..., generation_config={"thinking_level": "medium"})
client.models.generate_content(model="gemini-3.8-flash", contents=..., config=types.GenerateContentConfig(thinking_config=types.ThinkingConfig(thinking_level="low")))
Etkileşimler API'sini hiç kullanmadıysanız, 3.8 Flash API rehberi her iki şekli de uçtan uca kapsar; eski 3.7 Flash API rehberi yalnızca generateContent'ı kapsadığından, bu rehber her ikisini de gösterir.
Dokuz maddelik geçiş kontrol listesi
Bunları sırasıyla uygulayın. 1'den 4'e kadar olan maddeler hemen ortaya çıkan yapılandırma değişiklikleridir. 5 ve 6 numaralı maddeler araç döngülerini ve çoklu adım durumunu etkiler. 7'den 9'a kadar olan maddeler ise yalnızca testlerde yakalayabileceğiniz planlama ve medya değişiklikleridir.
1. thinking_level: "minimal" değerini "low" ile eşleyin
Bu, ilk bozulan şeydir. 3.8 Flash low, medium ve high kabul eder. minimal göndermek bir doğrulama hatası döndürür. Hiçbir şey göndermediğinizde varsayılan değer medium'dur. Gemini 3 Pro varsayılan olarak high kullanır, bu yüzden bir Pro yapılandırmasını kopyalayıp eşleştiğini varsaymayın.
Önce (3.7 Flash, Etkileşimler):
{"generation_config": {"thinking_level": "minimal"}}
Sonra (3.8 Flash):
{"generation_config": {"thinking_level": "low"}}
Eski şekil, sonra:
{"generationConfig": {"thinkingConfig": {"thinkingLevel": "low"}}}
Google'ın düşünme dokümantasyonu, low'u gecikme ayarı ve medium'u karmaşık kod ve ajanik çalışmalar için varsayılan olarak tanımlar. Rota başına hangi seviyenin kullanılacağı ayrı bir makaledir; geçiş amaçları için low, minimal'in doğrudan yerine geçer.
2. temperature, top_p ve top_k'yi kaldırın
Google'ın her Gemini 3 modeli için tavsiyesi, sıcaklığı varsayılan 1.0 değerinde tutmaktır. Düşürmek "döngüye girmeye veya performansın düşmesine neden olabilir". Birçok 3.7 Flash yapılandırması, önceki nesillerden kalma bir temperature: 0.2 taşır. Örnekleme anahtarlarını ayarlamak yerine silin.
Önce:
{"generationConfig": {"temperature": 0.2, "topP": 0.9, "topK": 40}}
Sonra:
{"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}}
Tekrarlanabilir JSON elde etmek için düşük bir sıcaklık kullandıysanız, bunun yerine yapılandırılmış çıktıları kullanın. Bunlar 3.8 Flash'ta desteklenir ve örneklemeye dokunmadan şema şeklinde bir yanıt almanızı sağlar.
3. thinking_budget yerine thinking_level kullanın
thinking_budget bir tam sayı token limitiydi. thinking_level bir dize numaralandırmasıdır. Aralarında aritmetik bir eşleşme yoktur, bu nedenle niyete göre seviyeyi seçin: gecikmeye duyarlı rotalar low alır, varsayılan rotalar medium alır, en zor çok adımlı rotalar high alır.
Önce:
{"generationConfig": {"thinkingConfig": {"thinkingBudget": 4096}}}
Sonra:
{"generationConfig": {"thinkingConfig": {"thinkingLevel": "low"}}}
Düşünme tokenleri hala çıkış tokenleri olarak faturalandırılır ve usageMetadata.thoughtsTokenCount'ta raporlanır, bu nedenle maliyet kontrolü sabit bir limitten bir seviye seçimine ve testlerinizdeki bir doğrulamaya (aşağıdaki regresyon bölümüne bakın) kayar.
4. candidate_count'ı kaldırın
Gemini 3 ve sonrası birden fazla aday desteklemez. Anahtarı ve candidates[1] veya sonrasını indeksleyen herhangi bir kodu bırakın.
Önce:
{"generationConfig": {"candidateCount": 2}}
Sonra:
{"generationConfig": {}}
En iyisini seçmek için birkaç adayı örneklediyseniz, 3.8 Flash'taki yerine koyma, doğrulamayı tek bir yanıtta yapan daha yüksek bir düşünme seviyesidir.
5. Her fonksiyon sonucuna call_id ve name ekleyin
Bu ikinci ciddi kırılamadır. 3.8 Flash'ta, geri gönderdiğiniz her fonksiyon sonucu hem çağrının id'sini hem de fonksiyon name'ini taşımalıdır. Google'ın Gemini 3 rehberi, "tüm FunctionResponse nesnelerinin call_id ve name içermesini sağlayın" der. Yalnızca adı yankılayan kod, araç-sonuç aşamasında başarısız olacaktır.
Etkileşimler API'si, sonra:
{
"previous_interaction_id": "<id from the function_call step>",
"input": [{
"type": "function_result",
"name": "get_weather",
"call_id": "<id from the function_call step>",
"result": [{"type": "text", "text": "{\"temp_c\": 24}"}]
}]
}
Modelin function_call adımı size id, name ve arguments verir; ilk ikisini doğrudan geri kopyalayın. Eski şekilde, functionResponse bölümü aynı değeri, name ve response ile birlikte id olarak yazılmış bir alanda (modelin functionCall bölümündeki id ile eşleşen) taşır. Google'ın fonksiyon çağırma referansı, kanonik örnekleri içerir ve 3.8 Flash fonksiyon çağırma rehberi, 3.8 Flash'ın neden 3.7 Flash'tan daha fazla kez araç çağırdığı da dahil olmak üzere tüm iki aşamalı döngüyü adım adım açıklar.
6. Düşünce imzalarını alındığı gibi geri iletin
Gemini 3 modelleri düşünce imzalarını yanıt bölümlerine ekler. Bir sonraki adımı kendiniz oluşturduğunuzda, yalnızca metin değil, tüm bölüm türleri için her bir bölümü, imzalar dahil, değişmeden döndürün. Bunları kaldırmak veya yeniden serileştirmek, bir sonraki adımda modelin sürekliliğini bozar.
Etkileşimler API'si, sunucunun durumu korumasına izin verdiğinizde bu işi ortadan kaldırır: previous_interaction_id'yi geçirin ve Google geçmişi tutar. Durumsuz bir çağrı için store: false ayarlarsanız, geçmişe tekrar sahip olursunuz ve düşünce bloklarını ve imzalarını kendiniz geri göndermelisiniz. Eski generateContent'te her zaman geçmişe sahipsinizdir, bu nedenle son yanıttaki kesilmiş bir kopyadan contents'i yeniden oluşturan herhangi bir kodu denetleyin.
7. Rota başına daha fazla token bütçeleyin
Bu madde yakalanacak bir hata içermediği için gözden kaçırılıyor. Artificial Analysis'ten gelen %30 daha fazla çıkış tokeni rakamı, yüksek düşünme seviyesinde kendi endekslerinin bir ortalamasıdır. Google'ın kendi ifadesi ise modelin "daha uzun süreli ve karmaşık görevlerde, tasarıma göre daha fazla token kullanabileceği" ve kullanımın "özellikle daha yüksek çaba seviyelerinde" arttığıdır.
Küresel olarak değil, rota başına planlayın:
- Gecikmeye duyarlı uç noktalar:
low. AA, düşük seviyede görev başına 0,8 dakika, yüksek seviyede ise 2,5 dakika ölçtü ve görev başına maliyet 0,24 $ iken 0,58 $ idi. - Varsayılan rotalar: Aynı endekste görev başına yaklaşık 0,41 $ ile
medium. - Ajan döngüleri: görev başına daha fazla araç çağırma dönüşü bekleyin, bu nedenle döngüyü yalnızca tokenlarla değil, dönüş sayısıyla sınırlayın.
Ayrıca 65.536 çıkış tokeni tavanını da gözden geçirin. 40 bin tokeni düşünmeyle birlikte döndüren bir 3.7 Flash istemi, artık limite daha yakın çalışabilir. Faturalamayı modelliyorsanız, 3.8 Flash fiyatlandırma dökümü, görev başına sayıları üç seviyenin hepsinde çalışır.
8. PDF'lere karşı videolarda media_resolution_high'ı test edin
3.8 Flash metin, resim, video, ses ve PDF girişi kabul eder. Medya çözünürlüğü ayarı, her medya girişinin kaç token tükettiğini değiştirir ve maliyet medya türüne göre değişir, bu nedenle bir PDF sayfasında ucuz olan aynı ayar uzun bir videoda pahalı olabilir. Ölçüm yapmadan 3.7 Flash'tan genel bir yüksek çözünürlüklü ayarı taşımayın. Her çözünürlükte temsili bir PDF ve temsili bir video gönderin ve aralarındaki usageMetadata.promptTokenCount'ı karşılaştırın.
9. Tüm görüntü segmentasyon çağrılarını bırakın
Görüntü segmentasyonu Gemini 3 modellerinde desteklenmez. Eğer 3.7 Flash döneminden kalma bir işlem hattı hala eski bir Gemini modeli üzerinden segmentasyon yapıyorsa, bu yol bu geçişten ayrıdır; eğer bir istem 3.8 Flash'tan segmentasyon maskeleri isteseydi, kullanılabilir çıktı döndürmek yerine başarısız olmasını bekleyin. Görüntü oluşturma, ses oluşturma ve Canlı API de 3.8 Flash'ta desteklenmemektedir, model sayfasına göre.
Apidog'da regresyon planını oluşturun
İki kritik değişikliği ve bir token kullanım kaymasını içeren bir geçiş, tek seferlik bir curl değil, tekrarlanabilir bir karşılaştırma gerektirir. İşte Apidog'da kullandığımız kurulum, çünkü Apidog bir API istemcisi ve test çalıştırıcısıdır: istekleri gönderir, yanıtları kontrol eder ve çalıştırmayı planlar. Modeli çalıştırmaz.
Ortam ve değişkenler. Bir Gemini ortamı oluşturun ve GEMINI_API_KEY'i gizli bir değişken olarak, bir de MODEL değişkeni olarak saklayın. generateContent isteğinin URL'sinde ve Etkileşimler isteğinin model alanında {{MODEL}} kullanın, böylece aynı kaydedilmiş istek her iki modele karşı çalışır.
Altın istemler. Gerçek rotalarınızı temsil eden 10 ila 20 istemi kaydedin: kısa bir sohbet dönüşü, yapılandırılmış çıktı çıkarma, alaycı bir araçla iki aşamalı bir fonksiyon çağrısı, bir PDF ve bir video girişi. Her biri bir test senaryosundaki bir istektir.
Doğrulamalar. İstek başına üç tane ekleyin:
- Durum 200'dür ve yanıt gövdesi bir JSON şemasıyla eşleşir. Yapılandırılmış çıktı rotaları için, alt akışta ayrıştırdığınız alanlar üzerinde doğrulama yapın.
usageMetadata.thoughtsTokenCount, rota başına belirlediğiniz bir tavanın altında kalır (örneğin,lowbir rotada 8.000). Bu, sessizcemedium'a geri dönen bir yapılandırmayı yakalayan koruyucudur.usageMetadata.totalTokenCount, 7. maddedeki rotanın bütçesinin altında kalır.
Yan yana. Senaryoyu çoğaltın, birinde MODEL'i gemini-3.7-flash olarak, diğerinde gemini-3.8-flash olarak ayarlayın ve her ikisini de çalıştırın. Apidog'un test raporları, doğrulama başına geçme/kalma durumunu ve yanıt gövdelerini gösterir, böylece istem başına token farkı, günlüklerden yeniden oluşturulmak yerine tek bir görünümde görülebilir. Fonksiyon çağrısı senaryosu için, geri gönderdiğiniz call_id'nin önceki adımın function_call'ındaki id'ye eşit olduğuna dair bir doğrulama ekleyin.
Planlayın. 3.8 Flash senaryosunu planlı bir çalıştırmaya dönüştürün, böylece token tavanları dağıtım penceresi boyunca günlük olarak kontrol edilir. Planlı API testleri rehberi kurulumu kapsar. Uygulamada takip etmek isterseniz, Apidog'u İndirin ve yukarıdaki curl parçacıklarını içe aktarın.
Geri alma: 3.7 Flash'ı bir yapılandırma bayrağının arkasında tutun
3.7 Flash tamamen desteklenmeye devam ettiğinden ve 3.8 Flash'ın fiyatını paylaştığından, geri alma ucuzdur: model kimliğini kod yerine yapılandırmada tutun.
{"gemini_model": "gemini-3.8-flash", "gemini_fallback_model": "gemini-3.7-flash"}
Üç kural bayrağı güvenli hale getirir:
- Geçiş yapılan istek şeklini her iki modelde de tutun. 1'den 6'ya kadar olan maddeler (
minimalyok, örnekleme anahtarları yok,thinking_budgetdeğilthinking_level,candidate_countyok,call_id+name, imzalar korunmuş) 3.7 Flash'ta da geçerlidir, bu nedenle çevrilmiş bir bayrak asla ikinci bir kod yolu gerektirmez. - Rota başına dağıtım yapın. Önce
lowseviyeli gecikme rotalarını çevirin, çünkü token farkları en küçüktür; ajan döngülerini en sona bırakın, yan yana senaryo birkaç gün geçtikten sonra. - Yalnızca hataları değil, tokenları da izleyin. 3.8 Flash'ta bir geri alma tetikleyicisi, bir 4xx'ten ziyade maliyet veya gecikme regresyonu olma olasılığı daha yüksektir, bu nedenle token tavanı doğrulamalarını uyarı sisteminize bağlayın.
Sıkça Sorulan Sorular
Gemini 3.8 Flash, 3.7 Flash'tan daha mı pahalı? Token başına değil. Her ikisi de 31 Aralık 2026'ya kadar 1M başına 0,75 $ giriş / 3,75 $ çıkış ve her ikisi de 1 Ocak 2027'de 1,50 $ / 7,50 $'a yükseliyor. Görev başına, 3.8 Flash tasarıma göre daha fazla token kullanır; Artificial Analysis, yüksek düşünme seviyesinde kendi endekslerinde yaklaşık %30 daha fazla çıkış tokeni ölçtü.
thinking_level: "minimal"'ı yerinde bırakırsam ne olur? İstek, 3.8 Flash'ta bir doğrulama hatasıyla başarısız olur. Yerine low ile değiştirin. Düşünme seviyeleri rehberi, kalan her seviyenin ne işe yaradığını ve farkın nasıl ölçüleceğini açıklar.
3.8 Flash'ı kullanmak için Etkileşimler API'sine geçmem gerekiyor mu? Hayır. generateContent eski olarak tanımlansa da, sona erme tarihi olmaksızın tamamen desteklenmeye devam ediyor ve 3.8 Flash üzerinde çalışıyor. Etkileşimler API'si, 6. maddedeki düşünce-imza defter tutma işlemini ortadan kaldıran previous_interaction_id aracılığıyla sunucu tarafı konuşma durumu ekler.
3.7 Flash kullanımdan kaldırılıyor mu? Google, "tamamen desteklenmeye devam ettiğini" söylüyor ve bir kullanımdan kaldırma tarihi yayınlamadı. Bu da yapılandırma bayrağı geri almasını mümkün kılıyor.
3.7 Flash için ayarladığım sıcaklığı koruyabilir miyim? Google'ın tüm Gemini 3 modelleri için tavsiyesi sıcaklığı 1.0'da bırakmaktır. Eğer 3.7 Flash'ta zaten bunu geçersiz kılıyorsanız, bu geçiş bunu kaldırma ve değerlendirmelerinizi kontrol etme zamanıdır; yapılandırılmış çıktılar, deterministik şekillere giden desteklenen yoldur.
Aşamalı olarak yayınlayın
Geçişin kendisi küçüktür: bir kimlik değişikliği, dört yapılandırma silme veya yeniden adlandırma, iki araç döngüsü alanı ve bir imza denetimi. Zaman alan kısım, token bütçesinin rota başına ne kadar tutulduğunu kanıtlamaktır ve bu bir test sorunudur. Altın istemleri kaydedin, şema ve token tavanları üzerinde doğrulama yapın, sayılar yerleşene kadar 3.7 ve 3.8 Flash'ı yan yana çalıştırın, ardından bayrağı her seferinde bir rotayı çevirin. Eğer bir rota gerilerse, bayrak onu kod değişikliği olmadan 3.7 Flash'a geri gönderir ve geliştirilmiş rotaları korursunuz.
