Google, Gemini 3.7 Flash'tan üç hafta ve 3.6 Flash'tan altı hafta sonra, 2 Eylül 2026'da Gemini 3.8 Flash'ı piyasaya sürdü. Aynı giriş fiyatı (31 Aralık'a kadar milyon token başına 0,75 $ giriş, 3,75 $ çıkış), aynı 1M token bağlamı ve Google'ın kendi ifadesine göre yaklaşık olarak aynı hız. Değişen şey modelin nasıl çalıştığı: daha küçük muhakeme adımları atıyor, kendi çıktısını doğruluyor ve araçları döngüler halinde çağırıyor. Bu da ona yayınlanan her benchmark'ta daha yüksek puan kazandırıyor. Ayrıca her görevin daha fazla token'a mal olmasına neden oluyor.
Dolayısıyla yükseltme sorusu "3.8 Flash daha mı iyi?" değil. Kağıt üzerinde öyle. Soru, ekstra kalitenin iş yükünüzde ekstra token'ların maliyetini karşılayıp karşılamadığı ve iki köklü değişikliğin kodunuza dokunup dokunmadığı. Bu karşılaştırma, nelerin aynı kaldığını, nelerin iyileştiğini, size neye mal olduğunu ve iş yüküne göre bir karar matrisini ele alıyor. Kaynaklar Google'ın lansman yazısı, Gemini 3.8 Flash'taki Yenilikler sayfası ve Artificial Analysis'in bağımsız testleri. Tam özellik sayfası için Gemini 3.8 Flash nedir ile başlayın.
Başka bir şey daha baştan söyleyelim: Google, "Gemini 3.7 Flash tamamen desteklenmeye devam ediyor" diyor ve bir sonlandırma tarihi yayınlamadı. Kimse sizi zorlamıyor.
Karşılaştırma
| Gemini 3.8 Flash | Gemini 3.7 Flash | |
|---|---|---|
| Model Kimliği | gemini-3.8-flash |
gemini-3.7-flash |
| Yayınlandı | 2 Eylül 2026 | 13 Ağustos 2026 |
| Temel | "Gemini 3.7 Flash tabanlıdır" (model kartı) | yok |
| Bağlam / maks. çıktı | 1.048.576 / 65.536 token | Aynı |
| Giriş fiyatı (giriş, 31 Aralık'a kadar) | Milyon başına 0,75 $ | Milyon başına 0,75 $ |
| Çıkış fiyatı (giriş, 31 Aralık'a kadar) | Milyon başına 3,75 $, düşünme dahil | Milyon başına 3,75 $, düşünme dahil |
| Standart fiyat (1 Ocak 2027'den itibaren) | 1,50 $ / 7,50 $ | 1,50 $ / 7,50 $ |
| Bağlam önbellek okuma | Milyon başına 0,075 $ (giriş) | Aynı |
| Toplu işleme | %50 indirim, aynı sıraya alınmış token katmanları | Aynı |
| Düşünme seviyeleri | low, medium (varsayılan), high |
low, medium, high |
minimal düşünme seviyesi |
Doğrulama hatası | Kabul edildi (Google'ın geçiş notu: low ile eşleyin) |
| Bilgi kesme tarihi | Mart 2026 | 3.8 belgelerinde yeniden belirtilmedi |
| Çıkış hızı (Artificial Analysis) | ~300 token/sn (302,1 ölçülen, yüksek) | Google'a göre "Yaklaşık aynı hız" |
| Artificial Analysis Akıl Endeksi | 59 (yüksek) | 56 (yüksek) |
| Destek durumu | Mevcut | "Tamamen desteklenmeye devam ediyor", son kullanma tarihi yok |
Aynı kalanlar
Öncelikle fiyat. Her iki model de Google'ın fiyatlandırma sayfasının aynı satırlarında yer alıyor: 31 Aralık'a kadar giriş 0,75 $, çıkış 3,75 $, 1 Ocak 2027'de ise 1,50 $ ve 7,50 $ olarak iki katına çıkacak. Önbellekleme, toplu indirimler ve aylık 5.000 ücretsiz Google Search temel istemi (her Gemini 3.x modelinde paylaşılır) hepsi korunuyor. Satır bazında detaylı döküm istiyorsanız, 3.7 Flash özellik ve fiyatlandırma referansı 3.8 Flash için de satır satır geçerlidir.
Bağlam ve çıktı limitleri 1.048.576 giriş token'ı ve 65.536 çıktı token'ı olarak değişmedi. Modaliteler de aynı: metin, görüntü, video, ses ve PDF girişi; metin çıkışı. Her iki model de ses üretimi, görüntü üretimi veya Live API'yi yapmıyor.
Hız neredeyse aynı. Google'dan Logan Kilpatrick, 3.8 Flash'ı "3.7 ile aynı fiyata, yaklaşık aynı hızda" olarak tanımladı. Artificial Analysis, yüksek muhakeme testinde saniyede 302.1 çıktı token'ı ölçtü. Bu, model yazmaya başladıktan sonraki verimdir; aynı testteki ilk token'a kadar geçen süre 13.30 saniyeydi, çünkü high seviyesinde model konuşmadan önce düşünüyor.
API yüzeyi de aynı. Interactions API artık Google'ın Gemini 3.x için birincil yolu ve eski generateContent uç noktası "tamamen desteklenmeye devam ediyor" ve sonlandırma tarihi yok. Her iki uç noktada da 3.7 Flash için yazılan kod, model dizesi değişimi sonrası gemini-3.8-flash üzerinde çalışır, köklü değişiklikler kapsamında belirtilen istisnalar dışında.
Neler iyileşti
Google'ın 3.8 Flash için başlığı "en akıllı Flash modelimiz", "uzun vadeli yazılım mühendisliği, otonom ajanlar ve karmaşık kurumsal iş akışları" için tasarlandı. Bu iddiaların arkasındaki tasarım değişikliği: zor görevlerde model "ekstra muhakeme adımları yürütüyor ve araçları tekrarlayarak çağırıyor", "daha küçük muhakeme adımları" atıyor ve "çalışmasını yol boyunca doğruluyor". İşte Google ve Artificial Analysis'in metin olarak yayınladığı benchmark'larda bunun ortaya çıkardığı sonuçlar.
Google'ın kendi tabloları. Google, DeepMind Flash sayfasında 3.7 Flash ile karşılaştıran üç sayısal karşılaştırma yayınladı. Bunlar satıcı tarafından yürütülen testlerdir.
| Benchmark (Google tarafından yürütülen) | 3.8 Flash | 3.7 Flash | Fark |
|---|---|---|---|
| Vals Finans Ajanı v2 | %61,4 | %59,0 | +2,4 |
| HLE-Doğrulanmış | %54,9 | %53,6 | +1,3 |
| Harvey Yasal Ajan Benchmark | %10,0 | %8,8 | +1,2 |
Mütevazı, tutarlı kazançlar ve her satırda 3.8 Flash, Google'ın tablosundaki daha büyük modelleri de geride bırakıyor (Claude Opus 5 Vals Finance'te %58,6, HLE-Verified'da %54,4); Claude Fable 5.1 ve GPT-5.6 Sol ile üç yönlü karşılaştırma bu konuyu daha da ileri taşıyor. Bu, Flash fiyatlı bir modelin token başına birkaç kat daha pahalı olan modelleri geride bırakmasıdır, Google'ın size vermek istediği mesaj budur.
Artificial Analysis, bağımsız olarak. Artificial Analysis yazısı, 3.8 Flash'ı high seviyesinde Akıl Endeksi'nde 59 olarak gösteriyor; bu, 3.7 Flash için 56 ve 3.6 Flash için 52'den bir artış. Bu, sürüm başına üç puanlık bir artıştır ve 3.8 Flash'ı xhigh seviyesindeki GPT-5.6 Sol ve medium seviyesindeki Grok 4.6 ile aynı seviyeye getiriyor, medium seviyesindeki Claude Fable 5.1'in bir puan üzerinde. τ³-Banking'de, araç kullanım değerlendirmesinde, 3.8 Flash %45 puan aldı, bu 3.7 Flash'a göre 12 puanlık bir sıçrama. Gerçek araç çağrıları ile ajanlar çalıştırıyorsanız, bu satır indeksden daha önemlidir.
Belge yoğun ajan çalışması. Google, 3.8 Flash'ın uzun süreli, belge yoğun iş akışlarında "Gemini 3.7 Flash'tan üç kat daha fazla görevi tamamladığını" belirtiyor. Dahili değerlendirme, halka açık bir test sistemi yok, bu yüzden bunu yönlendirici olarak ele alın. Ancak modelin tasarımıyla örtüşüyor: daha fazla doğrulama adımı, tek bir hatanın 40 adımlık bir işi raydan çıkardığı yerlerde en çok yardımcı olur.
Kodlama, kayıtta bir boşluk ile. DeepSWE v1.1'de, 3.7 Flash %65,3 puan aldı, bu 3.6 Flash'ın %49,0'ından bir artış. Google, 3.8 Flash'ın orada "maliyetinin çok altında" "çoğu daha büyük öncü modelden daha iyi performans gösterdiğini" belirtiyor, ancak kesin 3.8 yüzdesi sadece model kartının görüntü tablolarında yer alıyor, metinde değil, bu yüzden bir sayı yazmayacağız. 3.8 Flash için SWE-Bench Pro, Terminal-bench ve OSWorld rakamları hiç metin olarak yayınlanmadı. Bu benchmark'lar kararınızı yönlendiriyorsa, üçüncü taraf testlerini bekleyin.
Güvenlik ve enjeksiyon direnci. Google, bir sayı vermeden Gray Swan prompt-injection testinde "önemli bir sıçrama" bildirdi. Model kartı, 3.7 Flash'a kıyasla küçük farklar gösteriyor: çok dilli güvenlik +5,4 puan, metinden metne güvenlik -0,4, haksız red +1,1. Sonuncuyu aşırı redde hafif bir artış olarak okuyun.
Size neye mal olur
Token başına fiyatlar değişmedi. Görev başına maliyet değişti. Bu, Google'ın açıkça belirttiği ödünleşimdir: model "tasarım gereği, daha uzun süreli ve karmaşık görevlerde daha fazla token kullanabilir" ve "özellikle daha yüksek efor seviyelerinde performansı maksimize etmek için daha fazla token kullanabilir."
Artificial Analysis bunu nicelleştirdi. Endeksini çalıştıran 3.8 Flash, görev başına ortalama 48.000 çıktı token'ı kullandı, bu 3.7 Flash'tan %30 daha fazla. Aynı token başına fiyatlandırmada, bu tamamlanan görev başına daha yüksek bir faturaya dönüşüyor:
| Konfigürasyon (Artificial Analysis) | Görev başına maliyet | Görev başına süre |
|---|---|---|
Gemini 3.7 Flash, high |
0,40 $ | 2,2 dk |
Gemini 3.8 Flash, low |
0,24 $ | 0,8 dk |
Gemini 3.8 Flash, medium |
0,41 $ | yayınlanmadı |
Gemini 3.8 Flash, high |
0,58 $ | 2,5 dk |
Bu tablodan üç şey çıkıyor. Birincisi, high seviyesindeki 3.8 Flash, high seviyesindeki 3.7 Flash'a göre görev başına yaklaşık %45 daha pahalıya mal oluyor ve %14 daha uzun gerçek zaman alıyor. İkincisi, varsayılan olan medium seviyesindeki 3.8 Flash, high seviyesindeki 3.7 Flash'ın bir sent kadar yakınında yer alıyor, bu nedenle medium kalitesi barınızı karşılıyorsa "aynı bütçeyle" bir yükseltme mümkün. Üçüncüsü, low seviyesindeki 3.8 Flash, tablodaki en ucuz ve en hızlı satırdır, bu da onu 3.7 Flash'ın alışkanlıktan high seviyesinde çalıştığı, gecikmeye duyarlı rotalar için bariz bir seçim haline getiriyor.
3.8 Flash fiyatlandırma dökümü bunu günlük hacimlere dönüştürüyor. Kısa versiyonu: görev başına ödüyorsanız, yükseltme ücretsiz değil ve düşünme seviyesi, satın alacağınız iyileşmenin miktarını belirlemek için kullandığınız bir ayardır.
Kısa ve öz köklü değişiklikler
İki değişiklik, mevcut 3.7 Flash kodunu doğrudan etkiliyor.
thinking_level: "minimal" bir doğrulama hatası döndürür. 3.8 Flash yalnızca low, medium ve high seviyelerini kabul eder. Eğer 3.7 konfigürasyonu minimal içeriyorsa, bunu low ile eşleyin. Düşünme seviyeleri kılavuzu her seviyenin ne yaptığını, maliyetini ve gecikmesini kapsar.
Fonksiyon yanıtları call_id ve name içermelidir. Interactions API'deki her function_result'ın her iki alanı da içermesi gerekir ve eski generateContent üzerindeki her functionResponse'ın eşleşen id ve name'i içermesi gerekir. Yalnızca adıyla anahtarlanmış sonuçlar döndüren kod, bir araç döngüsünün ikinci turunda başarısız olacaktır.
Bunların ötesinde, 3.7'den 3.8 Flash'a geçiş kılavuzu, geçiş sırasında yeniden kontrol etmeye değer Gemini 3 kurallarını ele alıyor: temperature'yi varsayılan 1.0'da tutun (Google, daha düşük değerlerin "döngüye veya performans düşüşüne neden olabileceği" konusunda uyarıyor), bir tamsayı thinking_budget yerine thinking_level kullanın, candidate_count'ı bırakın ve düşünce imzalarını tam olarak alındığı gibi geri geçirin. Bunların hiçbiri 3.8 için yeni değil, ancak bunları atlayan bir 3.7 kod tabanı sorunları şimdi yüzeye çıkaracaktır.
İş yüküne göre karar matrisi
| İş yükü | Öneri | Neden |
|---|---|---|
| Araç çağrıları olan çok adımlı ajanlar | Yükseltme, medium veya high |
τ³-Banking'de +12; iteratif araç döngüleri 3.8'in tüm amacıdır |
| Uzun belge çıkarma ve inceleme | Yükseltme | Google'ın 3 kat görev tamamlama iddiası tam olarak bu şekli hedefliyor |
| Bir test ortamında ajansal kodlama | Yükseltme, sonra ölçüm yapın | DeepSWE metin sayısı yayınlanmadı; taahhütte bulunmadan önce kendi deponuzda doğrulayın |
| Finans, hukuk ve araştırma ajanları | Yükseltme | Yayınlanan üç Google tablosu da 3.8'in lehine hareket ediyor |
| Yüksek hacimli sınıflandırma, çıkarma, sohbet | 3.7'de kalın veya low seviyesinde 3.8'e geçin |
Burada metrik görev başına maliyettir; low, high seviyesindeki 3.7'den daha ucuzdur |
| Gecikmeye duyarlı kullanıcıya dönük uç noktalar | low seviyesinde 3.8 |
AA'nın test ortamında görev başına 0,8 dk, high seviyesindeki 3.7 için 2,2 dk'ya karşı |
minimal düşünme kullanan herhangi bir şey |
Önce geçiş yapın | Bunu low ile eşleyene kadar doğrulama hatası verir |
| Kuruşuna kadar fiyatlandırılan toplu iş akışları | Yeniden benchmark yapılana kadar 3.7'de kalın | Token başına aynı fiyat, ancak +%30 çıktı token'ı toplu iş faturasını değiştirir |
Desen: görev ne kadar zor ve uzun olursa, 3.8 Flash'ın "daha çok çalışan" tasarımı token'larını o kadar çok hak eder. Görev ne kadar kısa ve tekrarlayıcı olursa, o kadar az iş yapar ve düşünme seviyesi (veya olduğu yerde kalmak) o kadar önemli olur.
Her iki modeli de Apidog'da aynı test senaryosunda çalıştırın
Yukarıdaki görev başına sayılar Artificial Analysis'in test ortamından geliyor, sizin değil. Üretimde model dizesini değiştirmeden önce, kendi istemlerinizi her iki modelde de çalıştırın ve token sayılarını karşılaştırın. Apidog bunu on dakikalık bir iş haline getirir.
Bir Apidog ortamında GEMINI_API_KEY'yi bir ortam değişkeni olarak ayarlayın ve x-goog-api-key değişkeninden okuyacak şekilde https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent adresine bir POST isteği ekleyin. model'i de bir senaryo değişkeni yapın. Gövde her iki çalıştırma için de aynıdır:
{
"contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}
İki adımlı bir test senaryosu oluşturun: model'in gemini-3.7-flash olarak ayarlandığı istek, ardından gemini-3.8-flash ile aynı istek. Her adımda, bütçenizi yansıtan bir tavanla usageMetadata.candidatesTokenCount ve usageMetadata.thoughtsTokenCount üzerinde onaylar, ayrıca uygulamanızın okuduğu herhangi bir alanda bir JSON-path onayı ekleyin. Senaryoyu on veya yirmi altın istemden oluşan bir veri kümesine karşı çalıştırın. Test raporu, her adımın yanıtını ve onay sonuçlarını birlikte gösterir, böylece her iki modelin token sayılarını tek bir çalıştırmadan okursunuz ve +%30 rakamı bir benchmark'ın değil, sizin numaranız haline gelir.
Sayılar doğru göründüğünde, bir model güncellemesinden sonra düşünme token'larındaki sessiz bir artışın bir faturada görünmek yerine bir testi başarısız etmesi için senaryoyu planlayın. Kurmak için Apidog'u indirin; ücretsiz plan bu iş akışını kapsar.
S.S.S.
Gemini 3.8 Flash, 3.7 Flash'tan daha mı hızlı?
Hayır. Google'ın kendi tanımı "~aynı hızda" ve Artificial Analysis high seviyesinde saniyede yaklaşık 300 çıktı token'ı ölçtü. 3.8 Flash daha fazla adımda muhakeme yaptığı için, görev başına geçen gerçek zaman test ortamında arttı (high seviyesinde 2.2 dakikaya karşı 2.5 dakika). low seviyesine düşürmek bunu 0.8 dakikaya indiriyor.
Gemini 3.8 Flash, 3.7 Flash'tan daha mı pahalı?
Token başına değil. Her ikisi de 31 Aralık'a kadar 0,75 $ giriş ve 3,75 $ çıkış, ardından 1,50 $ ve 7,50 $ olacak. Görev başına evet: Artificial Analysis, high seviyesindeki 3.8 Flash'ın görev başına 0,58 $ olduğunu, high seviyesindeki 3.7 Flash için 0,40 $'a karşı ölçtü, çünkü 3.8 Flash yaklaşık %30 daha fazla çıktı token'ı yazıyor.
Google, Gemini 3.7 Flash'ı kapatacak mı?
Google, 3.7 Flash'ın "tamamen desteklenmeye devam ettiğini" belirtiyor ve bir sonlandırma tarihi yayınlamadı. Üzerinde kalabilirsiniz. 3.7 Flash'taki yenilikler yazısı hala bu model için referanstır.
3.8 Flash'a geçtiğimde ne bozulur?
İki şey: thinking_level: "minimal" artık bir 400 INVALID_ARGUMENT hatası döndürüyor ve her fonksiyon yanıtı hem çağrı kimliğini (Interactions API'de call_id, eski generateContent'de id) hem de name'i içermelidir. Gemini 3 API'deki diğer her şey değişmedi.
Bu sıçrama 3.6'dan 3.7'ye kıyasla nasıl?
3.7 Flash daha büyük bir adımdı: DeepSWE %49,0'dan %65,3'e, Artificial Analysis endeksi ise 52'den 56'ya çıktı. 3.8 adımı endekste +3 ve modelin token'ları harcama şeklinin yeniden tasarlanmasıdır. Önceki nesil için, bu yayın serisini başlatan fiyat indirimini kapsayan 3.6 Flash vs 3.5 Flash'a bakın.
Kısa versiyon
İş yükünüz ajansal, araç yoğun veya belge yoğunsa yükseltme yapın. Hem Google hem de Artificial Analysis'in kazanımlar gösterdiği ve ekstra token'ların tamamlanmış görevleri satın aldığı yer burasıdır. Görev başına maliyetin raporladığınız sayı olduğu kısa, tekrarlayan çağrılar yapıyorsanız 3.7 Flash'ta kalın veya low seviyesinde 3.8'e geçin. Her iki durumda da, minimal'i düzeltin ve fonksiyon yanıtlarınızı kontrol edin, ardından bizimki de dahil olmak üzere kimsenin test ortamına güvenmeden önce kendi istemlerinizdeki token sayılarını ölçün.
