Gemini 3.8 Flash, milyon giriş tokenı başına 0,75 dolar ve milyon çıkış tokenı başına 3,75 dolar maliyetle, Google'ın 3.7 Flash için belirlediği aynı tanıtım fiyatına sahip. Bu fiyat 31 Aralık 2026'ya kadar geçerlidir. 1 Ocak 2027'de 1,50 dolar ve 7,50 dolara iki katına çıkacak ve aynı artış 3.6 Flash ve 3.7 Flash'ı da aynı gün etkileyecek. Bu sürümle birlikte token başına fiyatta hiçbir değişiklik olmadı.
Değişen şey, modelin ne kadar token harcadığıdır. Google, 3.8 Flash'ın "daha çok çalıştığını" söylüyor: daha fazla muhakeme adımı atıyor, araçları yinelemeli olarak çağırıyor ve "tasarım gereği, daha uzun süren ve karmaşık görevlerde daha fazla token kullanabiliyor". Artificial Analysis bu etkiyi bağımsız olarak ölçtü: Zeka Endeksi'ni 3.8 Flash'ta yüksek düşünme seviyesinde çalıştırmanın görev başına maliyeti 0,58 dolar iken, 3.7 Flash'ta 0,40 dolardı ve görev başına yaklaşık %30 daha fazla çıkış tokenı vardı. Aynı etiket fiyatı, daha yüksek fatura.
Bu kılavuz, resmi Gemini API fiyatlandırma sayfasındaki her satırı inceler, her düşünme seviyesinde günde 1.000 görevlik bir örnek üzerinde çalışır ve oranı Flash-Lite, Claude Sonnet 5 ve GPT-5.6 Luna ile karşılaştırır. Model genel bakışı için önce Gemini 3.8 Flash nedir ile başlayın.
Gemini 3.8 Flash fiyatlandırmasına hızlı bir bakış
Tüm fiyatlar, ücretli katmanda 1 milyon token başına geçerlidir.
| Oran | Giriş (31 Aralık 2026'ya kadar) | Standart (1 Ocak 2027'den itibaren) |
|---|---|---|
| Giriş (metin, resim, video, ses, PDF) | $0.75 | $1.50 |
| Çıkış (düşünme tokenları dahil) | $3.75 | $7.50 |
| Bağlam önbellek okuma | $0.075 | $0.15 |
| Önbellek depolama (saatte 1 milyon token başına) | $0.50 | $1.00 |
| Toplu API girişi (%50 indirimli) | $0.375 | $0.75 |
| Toplu API çıkışı (%50 indirimli) | $1.875 | $3.75 |
| Google Arama tabanlaması | Gemini 3.x genelinde paylaşılan ayda 5.000 ücretsiz istek, ardından 1.000 istek başına 14 dolar | Aynı |
| Ücretsiz katman | 0 dolar, oran sınırlı, veriler Google ürünlerini geliştirmek için kullanılır | Aynı |
Üç detay, manşet rakamlarından daha önemlidir. Çıkış fiyatlandırması düşünme tokenlarını kapsar, bu nedenle dahili muhakeme 0,75 dolar değil, 3,75 dolar olarak faturalandırılır. Tanıtım oranının kesin bir bitiş tarihi vardır. Ve 3.7 Flash ve 3.6 Flash satırları aynı 1 Ocak ikiye katlanmasını içerir, bu nedenle daha eski bir Flash sizi bu artıştan korumaz. 3.7 Flash fiyatlandırma dökümü, görev başına daha az token harcayan bir modelde aynı oranları kapsar.
Düşünme tokenları, çıkış tokenlarıdır
Gemini 3.8 Flash, cevap vermeden önce muhakeme yapar ve bu muhakemenin her tokenı çıkış olarak ölçülür. API, generateContent yanıtında bu sayıyı usageMetadata.thoughtsTokenCount olarak bildirir; bu, candidatesTokenCount (görünür cevap) ve promptTokenCount (girdiniz) değerlerinden ayrıdır. Her iki çıkış paketi de aynı 3,75 dolardan faturalandırılır.
Miktarı thinking_level ile yönlendirirsiniz: low (düşük), medium (orta) veya high (yüksek). 3.8 Flash'ta varsayılan, Gemini 3 Pro'daki gibi high değil, medium'dur. minimal kaldırılmıştır ve doğrulama hatası döndürür, bu nedenle önceki modellerden aktarılan herhangi bir yapılandırmanın bu değeri low ile eşleştirmesi gerekir. Google'ın düşünme dokümantasyonu, seviyeleri bir token bütçesi olarak değil, göreceli çaba olarak tanımlar, bu nedenle eski tamsayı thinking_budget'ın izin verdiği şekilde düşünme tokenlarını doğrudan sınırlayamazsınız. Her seviyenin gecikme süresi ve maliyet üzerindeki etkisi 3.8 Flash düşünme seviyeleri kılavuzunda yer almaktadır.
Hayali ama gerçekçi boyutlarla hızlı bir örnek. Diyelim ki bir istek 10.000 giriş tokenı gönderiyor ve 2.000 görünür çıkış tokenı artı 6.000 düşünme tokenı geri alıyor. Tanıtım fiyatlarıyla:
- Giriş: 10.000 x 0,75 dolar / 1.000.000 = 0,0075 dolar
- Çıkış: (2.000 + 6.000) x 3,75 dolar / 1.000.000 = 0,03 dolar
- Toplam: İstek başına 0,0375 dolar
Düşünme, çıkış ücretinin %75'ini ve tüm isteğin %60'ını oluşturur. 1 Ocak'tan itibaren aynı istek 0,015 dolar + 0,06 dolar = 0,075 dolara mal olacak. "3.7 ile aynı fiyat" doğru ama eksiktir: oran aynı kaldı, ancak token sayısı değişti.
Fiyat değişmezken görev başına maliyet neden arttı?
Google'ın lansman yazısı, takas hakkında doğrudan bilgi veriyor: karmaşık görevlerde model "ek muhakeme adımları yürütür ve araçları yinelemeli olarak çağırır", bu süreçte çalışmasını doğrular. Daha fazla adım, daha fazla düşünme tokenı ve ajan döngülerinde daha fazla araç çağırma dönüşü anlamına gelir. Google'ın hafifletme tavsiyesi: thinking_level'i düşürün veya 3.7 Flash'ta kalın.
Artificial Analysis bunu rakamlarla ortaya koydu. Zeka Endeksi dokuz değerlendirme çalıştırır; 3.8 Flash yüksek seviyede 59 puan alırken, 3.7 Flash yüksek seviyede 56 puan aldı ve görev başına ortalama yaklaşık 48.000 çıkış tokenı kullandı, bu da 3.7 Flash'a göre %30 artış demek. Endeksi görev başına çalıştırmanın maliyeti:
| Yapılandırma | Görev başına maliyet (AA, tanıtım fiyatları) | Görev başına süre |
|---|---|---|
| Gemini 3.8 Flash, yüksek | $0.58 | 2.5 dak |
| Gemini 3.8 Flash, orta | $0.41 | yayınlanmadı |
| Gemini 3.8 Flash, düşük | $0.24 | 0.8 dak |
| Gemini 3.7 Flash, yüksek | $0.40 | 2.2 dak |
Tabloyu iki şekilde okuyun. Selefine karşı, 3.8 Flash yüksek seviyede üç puanlık bir endeks kazanımı için görev başına %45 daha fazla maliyetlidir (0,58 dolar / 0,40 dolar = 1,45). Kendi içinde, yüksekten orta seviyeye düşmek görev başına maliyeti %29 azaltır (0,41 dolar / 0,58 dolar = 0,71) ve düşük seviye bunu %59 azaltır (0,24 dolar / 0,58 dolar = 0,41). 3.8 Flash'ta orta seviye, 3.7 Flash'taki yüksek seviyenin bir sent yakınına gelir ki bu, yükseltme yapılıp yapılmayacağına karar verirken faydalı bir kıyas noktasıdır. 3.8 Flash ve 3.7 Flash karşılaştırması bu kararı iş yüküne göre detaylandırır.
Artificial Analysis ayrıca 3:1 giriş-çıkış oranında milyon token başına 0,58 dolarlık karma bir fiyat listeler. Bunun yüksek seviyeli görev başına maliyetle eşleşmesi bir tesadüftür; biri token başına oran, diğeri ise modelin ne kadar token harcamayı seçtiğine bağlıdır.
31 Aralık'tan önce tanıtım oranını sabitleyin
"Sabitlemek" kesin bir anlam gerektirir, çünkü tanıtım oranı bir sözleşme değildir. Google, tokenlar tüketildiğinde geçerli olan oran üzerinden kullanım faturalandırır, bu nedenle 2027 kullanımını 2026 fiyatlarıyla önceden ödeyemezsiniz ve 3.7 veya 3.6 Flash'a geçmek de yardımcı olmaz. Yapabileceğiniz şey, isteğe bağlı işleri bu pencereye kaydırmaktır:
- Şimdi Batch API aracılığıyla geri doldurmaları ve tek seferlik belge işlemeyi çalıştırın. 100 milyon tokenlık bir geri doldurma (75M giriş, 25M çıkış) bu yıl toplu olarak 75 x 0,375 dolar + 25 x 1,875 dolar = 28,13 dolar + 46,88 dolar = 74,99 dolara mal olurken, Ocak ayında bunun iki katı, 149,98 dolar olacaktır.
- Fiyat değişikliklerinden önce değerlendirme setinizi ve temel token sayılarınızı oluşturun, böylece Ocak faturasında iki değil, tek bir değişken hareket etsin.
- Bu çeyrekte her rota için düşünme seviyesini belirleyin. Varsayılan olarak
medium(orta) bırakılan her rota, maliyetini incelemediğiniz bir rotadır.low(düşük) seviyede değerlendirmeleri geçen rotalar, Ocak ayından öncelowseviyesinde olmalıdır.
Fiyat, sağlayıcılar arasında belirleyici faktörse, en ucuz LLM API sağlayıcıları özetimiz tüm alanı ortaya koyar; Fable 5.1 ve GPT-5.6 Sol karşılaştırması premium katmanları kapsar.
Flash-Lite, Sonnet 5 ve GPT-5.6 Luna ile nasıl karşılaştırılır
Token başına oranlar, 1 milyon token başına:
| Model | Giriş | Çıkış | Notlar |
|---|---|---|---|
| Gemini 3.8 Flash (tanıtım) | $0.75 | $3.75 | Düşünme çıkış olarak faturalandırılır; önbellek okuma 0,075 dolar |
| Gemini 3.8 Flash (1 Ocak'tan itibaren) | $1.50 | $7.50 | Önbellek okuma 0,15 dolar |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | Yaklaşık 350 token/sn |
| Claude Sonnet 5 | $2 | $10 | Kalıcı; 1 Eylül zammı iptal edildi |
| GPT-5.6 Luna | $1 | $6 |
Tanıtım fiyatlarıyla, 3.8 Flash girişi Flash-Lite'ın 2,5 katı ve çıkışı 1,5 katıdır. Sonnet 5'e kıyasla, 3.8 Flash hem girişte (2 dolar / 0,75 dolar) hem de çıkışta (10 dolar / 3,75 dolar) yaklaşık 2,7 kat daha ucuzdur. Luna'ya kıyasla da daha ucuzdur: girişte 0,75 dolara karşılık 1 dolar, çıkışta 3,75 dolara karşılık 6 dolar.
1 Ocak'ta tablo değişiyor. 1,50 dolar ve 7,50 dolarlık fiyatlarla 3.8 Flash, her iki tarafta da Luna'dan daha pahalı hale geliyor ve Sonnet 5 ile arasındaki fark yaklaşık 1,3 katına düşüyor (2 dolar / 1,50 dolar ve 10 dolar / 7,50 dolar). Flash-Lite ise her zaman daha ucuz kalıyor. Eğer 3.8 Flash'ı seçmenizin nedeni tanıtım oranıysa, Ocak ayındaki yeniden değerlendirmeyi şimdi takviminize ekleyin.
Token başına karşılaştırma hikayenin sadece yarısıdır. Cevap başına daha az token harcayan bir model, daha yüksek bir oranda görev başına daha az maliyetli olabilir ve bunu bilmenin tek yolu, aynı görev setini her aday üzerinde çalıştırmak ve kullanım sayılarını geri okumaktır. 3.8 Flash API kılavuzu, usageMetadata'yı hem Etkileşim API'sinden hem de eski generateContent'ten nasıl okuyacağınızı gösterir.
Apidog token iddialarıyla maliyet regresyonlarını yakalayın
3.8 Flash ile hata modu yanlış cevap değildir. Bu, bir istem ayarı veya düşünme seviyesi değişikliğinden sonra sessizce %40 daha fazla token kullanan doğru bir cevaptır ve fatura gelene kadar kimse fark etmez. Apidog, token sayısını bir durum kodu gibi iddia edilecek bir alan olarak ele alarak bunu düzeltir.

- Anahtarı bir ortam değişkeni olarak saklayın. Apidog ortamında
GEMINI_API_KEYoluşturun ve anahtarın hiçbir zaman kaydedilmiş bir istekte bulunmaması için bunux-goog-api-keybaşlığında{{GEMINI_API_KEY}}olarak referans gösterin. - Altın bir istem gönderin. Üretim rotası başına bir tane olmak üzere temsili bir istem ve açık bir
thinkingConfig.thinkingLevelilehttps://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContentadresine birPOSTisteği kaydedin. - Kullanım alanlarını iddia edin.
usageMetadata'yı okuyan ve tokenlar temel seviyenizden belirlenen bir tavanı aşarsa testi başarısız kılan bir son işlemci betiği ekleyin:
const usage = pm.response.json().usageMetadata;
pm.test("thinking tokens within budget", () => {
pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("visible output within budget", () => {
pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("request cost within budget", () => {
const cost = usage.promptTokenCount * 0.75 / 1e6
+ (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
pm.expect(cost).to.be.below(0.05);
});
- Planlayın. İstekleri bir test senaryosuna yerleştirin ve programlı olarak çalıştırın, böylece token kullanımındaki bir sıçrama aynı gün başarısız bir çalışma olarak görünür; Apidog'da API testlerini planlama kılavuzumuz kurulumu kapsar. 1 Ocak'ta iki oran sabitini güncelleyin ve maliyet iddiası faturayı takip etmeye devam edecektir.
Aynı senaryo, sağlayıcıların birbiriyle rekabet ettiği bir yarışma görevi de görür: Flash-Lite, Sonnet 5 veya Luna'ya bir kopyasını yönlendirin ve kullanım alanlarını yan yana karşılaştırın. İlk senaryoyu oluşturmak için Apidog'u indirin; ücretsiz plan bu iş akışını kapsar.
SSS
Gemini 3.8 Flash, 3.7 Flash'tan daha mı pahalı? Token başına, hayır. Her ikisi de 31 Aralık'a kadar 0,75 dolar giriş ve 3,75 dolar çıkış, ardından 1,50 dolar ve 7,50 dolar. Görev başına, evet: Artificial Analysis, 3.8 Flash'ın yüksek seviyede index görevi başına 0,58 dolar, 3.7 Flash'ın ise 0,40 dolar olduğunu ölçtü, çünkü 3.8 Flash yaklaşık %30 daha fazla çıkış tokenı üretiyor.
Düşünme tokenları ayrı mı faturalandırılıyor? Hayır. Milyon başına 3,75 dolar (tanıtım) çıkış tokenı olarak faturalandırılırlar ve usageMetadata.thoughtsTokenCount içinde görünürler. Bunları dolaylı olarak thinking_level aracılığıyla kontrol edersiniz; 3.8 Flash'ta sabit bir token bütçesi yoktur ve minimal bir hata döndürür.
Gemini 3.8 Flash için ücretsiz bir katman var mı? Evet. AI Studio ücretsiz katmanı, AI Studio'da gösterilen oran limitleri ile giriş veya çıkış için ücret almaz ve Google, ücretsiz katman verilerini ürünlerini iyileştirmek için kullanır. Tüketici Gemini uygulaması, 3.8 Flash'ı yalnızca AI Pro ve Ultra abonelerine sunar. Detaylar ücretsiz kullanım kılavuzunda.
1 Ocak 2027'de maliyetlerime ne olacak? Giriş, çıkış, önbellek okuma, önbellek depolama ve toplu işlem oranları iki katına çıkar. Görev başına token kullanımı aynı kalırsa, faturanız da iki katına çıkar. 3.6 ve 3.7 Flash satırları da aynı tarihte iki katına çıkar.
Hangi düşünme seviyesi maliyetleri düşük tutar? Artificial Analysis'ın dağılımından başlayın: index görevi başına düşük 0,24 dolar, orta 0,41 dolar, yüksek 0,58 dolar. Her seviyede kendi değerlendirmelerinizi çalıştırın, geçen en düşük seviyeyi koruyun ve ayarın kaymamasını sağlamak için token sayılarını iddia edin.
Bu hafta ne yapmalı
Gemini 3.8 Flash, 3.7 Flash gibi fiyatlandırılır ve daha büyük bir model gibi token harcar. Düşünme seviyesini bir maliyet ayarı olarak ele alın ve her rota için bunu ayarlayın. Toplu işlere uygun çalışmaları 31 Aralık'tan önce tanıtım penceresine taşıyın. Token kullanımınızı şimdi temel alın ve bunu iddia edin, böylece Ocak ayındaki ikiye katlanma, fiyatlandırdığınız bir değişiklik olur.
