Gemini 3.8 Flash Fiyatlandırması: Başlangıç Ücretleri, Düşünme Belirteçleri ve Görev Başına Gerçek Maliyet

Gemini 3.8 Flash fiyatlandırması: 0,75 dolar / 3,75 dolar giriş fiyatları 1 Ocak 2027'de ikiye katlanacak, düşünme tokenları çıktı olarak faturalandırılıyor, önbelleğe alma, toplu işlem ve görev başına maliyetin neden 0,58 dolara yükseldiği.

Ashley Goolam

Ashley Goolam

3 September 2026

Gemini 3.8 Flash Fiyatlandırması: Başlangıç Ücretleri, Düşünme Belirteçleri ve Görev Başına Gerçek Maliyet

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Gemini 3.8 Flash, milyon giriş tokenı başına 0,75 dolar ve milyon çıkış tokenı başına 3,75 dolar maliyetle, Google'ın 3.7 Flash için belirlediği aynı tanıtım fiyatına sahip. Bu fiyat 31 Aralık 2026'ya kadar geçerlidir. 1 Ocak 2027'de 1,50 dolar ve 7,50 dolara iki katına çıkacak ve aynı artış 3.6 Flash ve 3.7 Flash'ı da aynı gün etkileyecek. Bu sürümle birlikte token başına fiyatta hiçbir değişiklik olmadı.

Değişen şey, modelin ne kadar token harcadığıdır. Google, 3.8 Flash'ın "daha çok çalıştığını" söylüyor: daha fazla muhakeme adımı atıyor, araçları yinelemeli olarak çağırıyor ve "tasarım gereği, daha uzun süren ve karmaşık görevlerde daha fazla token kullanabiliyor". Artificial Analysis bu etkiyi bağımsız olarak ölçtü: Zeka Endeksi'ni 3.8 Flash'ta yüksek düşünme seviyesinde çalıştırmanın görev başına maliyeti 0,58 dolar iken, 3.7 Flash'ta 0,40 dolardı ve görev başına yaklaşık %30 daha fazla çıkış tokenı vardı. Aynı etiket fiyatı, daha yüksek fatura.

Bu kılavuz, resmi Gemini API fiyatlandırma sayfasındaki her satırı inceler, her düşünme seviyesinde günde 1.000 görevlik bir örnek üzerinde çalışır ve oranı Flash-Lite, Claude Sonnet 5 ve GPT-5.6 Luna ile karşılaştırır. Model genel bakışı için önce Gemini 3.8 Flash nedir ile başlayın.

Gemini 3.8 Flash fiyatlandırmasına hızlı bir bakış

Tüm fiyatlar, ücretli katmanda 1 milyon token başına geçerlidir.

Oran Giriş (31 Aralık 2026'ya kadar) Standart (1 Ocak 2027'den itibaren)
Giriş (metin, resim, video, ses, PDF) $0.75 $1.50
Çıkış (düşünme tokenları dahil) $3.75 $7.50
Bağlam önbellek okuma $0.075 $0.15
Önbellek depolama (saatte 1 milyon token başına) $0.50 $1.00
Toplu API girişi (%50 indirimli) $0.375 $0.75
Toplu API çıkışı (%50 indirimli) $1.875 $3.75
Google Arama tabanlaması Gemini 3.x genelinde paylaşılan ayda 5.000 ücretsiz istek, ardından 1.000 istek başına 14 dolar Aynı
Ücretsiz katman 0 dolar, oran sınırlı, veriler Google ürünlerini geliştirmek için kullanılır Aynı

Üç detay, manşet rakamlarından daha önemlidir. Çıkış fiyatlandırması düşünme tokenlarını kapsar, bu nedenle dahili muhakeme 0,75 dolar değil, 3,75 dolar olarak faturalandırılır. Tanıtım oranının kesin bir bitiş tarihi vardır. Ve 3.7 Flash ve 3.6 Flash satırları aynı 1 Ocak ikiye katlanmasını içerir, bu nedenle daha eski bir Flash sizi bu artıştan korumaz. 3.7 Flash fiyatlandırma dökümü, görev başına daha az token harcayan bir modelde aynı oranları kapsar.

Düşünme tokenları, çıkış tokenlarıdır

Gemini 3.8 Flash, cevap vermeden önce muhakeme yapar ve bu muhakemenin her tokenı çıkış olarak ölçülür. API, generateContent yanıtında bu sayıyı usageMetadata.thoughtsTokenCount olarak bildirir; bu, candidatesTokenCount (görünür cevap) ve promptTokenCount (girdiniz) değerlerinden ayrıdır. Her iki çıkış paketi de aynı 3,75 dolardan faturalandırılır.

Miktarı thinking_level ile yönlendirirsiniz: low (düşük), medium (orta) veya high (yüksek). 3.8 Flash'ta varsayılan, Gemini 3 Pro'daki gibi high değil, medium'dur. minimal kaldırılmıştır ve doğrulama hatası döndürür, bu nedenle önceki modellerden aktarılan herhangi bir yapılandırmanın bu değeri low ile eşleştirmesi gerekir. Google'ın düşünme dokümantasyonu, seviyeleri bir token bütçesi olarak değil, göreceli çaba olarak tanımlar, bu nedenle eski tamsayı thinking_budget'ın izin verdiği şekilde düşünme tokenlarını doğrudan sınırlayamazsınız. Her seviyenin gecikme süresi ve maliyet üzerindeki etkisi 3.8 Flash düşünme seviyeleri kılavuzunda yer almaktadır.

Hayali ama gerçekçi boyutlarla hızlı bir örnek. Diyelim ki bir istek 10.000 giriş tokenı gönderiyor ve 2.000 görünür çıkış tokenı artı 6.000 düşünme tokenı geri alıyor. Tanıtım fiyatlarıyla:

Düşünme, çıkış ücretinin %75'ini ve tüm isteğin %60'ını oluşturur. 1 Ocak'tan itibaren aynı istek 0,015 dolar + 0,06 dolar = 0,075 dolara mal olacak. "3.7 ile aynı fiyat" doğru ama eksiktir: oran aynı kaldı, ancak token sayısı değişti.

Fiyat değişmezken görev başına maliyet neden arttı?

Google'ın lansman yazısı, takas hakkında doğrudan bilgi veriyor: karmaşık görevlerde model "ek muhakeme adımları yürütür ve araçları yinelemeli olarak çağırır", bu süreçte çalışmasını doğrular. Daha fazla adım, daha fazla düşünme tokenı ve ajan döngülerinde daha fazla araç çağırma dönüşü anlamına gelir. Google'ın hafifletme tavsiyesi: thinking_level'i düşürün veya 3.7 Flash'ta kalın.

Artificial Analysis bunu rakamlarla ortaya koydu. Zeka Endeksi dokuz değerlendirme çalıştırır; 3.8 Flash yüksek seviyede 59 puan alırken, 3.7 Flash yüksek seviyede 56 puan aldı ve görev başına ortalama yaklaşık 48.000 çıkış tokenı kullandı, bu da 3.7 Flash'a göre %30 artış demek. Endeksi görev başına çalıştırmanın maliyeti:

Yapılandırma Görev başına maliyet (AA, tanıtım fiyatları) Görev başına süre
Gemini 3.8 Flash, yüksek $0.58 2.5 dak
Gemini 3.8 Flash, orta $0.41 yayınlanmadı
Gemini 3.8 Flash, düşük $0.24 0.8 dak
Gemini 3.7 Flash, yüksek $0.40 2.2 dak

Tabloyu iki şekilde okuyun. Selefine karşı, 3.8 Flash yüksek seviyede üç puanlık bir endeks kazanımı için görev başına %45 daha fazla maliyetlidir (0,58 dolar / 0,40 dolar = 1,45). Kendi içinde, yüksekten orta seviyeye düşmek görev başına maliyeti %29 azaltır (0,41 dolar / 0,58 dolar = 0,71) ve düşük seviye bunu %59 azaltır (0,24 dolar / 0,58 dolar = 0,41). 3.8 Flash'ta orta seviye, 3.7 Flash'taki yüksek seviyenin bir sent yakınına gelir ki bu, yükseltme yapılıp yapılmayacağına karar verirken faydalı bir kıyas noktasıdır. 3.8 Flash ve 3.7 Flash karşılaştırması bu kararı iş yüküne göre detaylandırır.

Artificial Analysis ayrıca 3:1 giriş-çıkış oranında milyon token başına 0,58 dolarlık karma bir fiyat listeler. Bunun yüksek seviyeli görev başına maliyetle eşleşmesi bir tesadüftür; biri token başına oran, diğeri ise modelin ne kadar token harcamayı seçtiğine bağlıdır.

31 Aralık'tan önce tanıtım oranını sabitleyin

"Sabitlemek" kesin bir anlam gerektirir, çünkü tanıtım oranı bir sözleşme değildir. Google, tokenlar tüketildiğinde geçerli olan oran üzerinden kullanım faturalandırır, bu nedenle 2027 kullanımını 2026 fiyatlarıyla önceden ödeyemezsiniz ve 3.7 veya 3.6 Flash'a geçmek de yardımcı olmaz. Yapabileceğiniz şey, isteğe bağlı işleri bu pencereye kaydırmaktır:

Fiyat, sağlayıcılar arasında belirleyici faktörse, en ucuz LLM API sağlayıcıları özetimiz tüm alanı ortaya koyar; Fable 5.1 ve GPT-5.6 Sol karşılaştırması premium katmanları kapsar.

Flash-Lite, Sonnet 5 ve GPT-5.6 Luna ile nasıl karşılaştırılır

Token başına oranlar, 1 milyon token başına:

Model Giriş Çıkış Notlar
Gemini 3.8 Flash (tanıtım) $0.75 $3.75 Düşünme çıkış olarak faturalandırılır; önbellek okuma 0,075 dolar
Gemini 3.8 Flash (1 Ocak'tan itibaren) $1.50 $7.50 Önbellek okuma 0,15 dolar
Gemini 3.5 Flash-Lite $0.30 $2.50 Yaklaşık 350 token/sn
Claude Sonnet 5 $2 $10 Kalıcı; 1 Eylül zammı iptal edildi
GPT-5.6 Luna $1 $6

Tanıtım fiyatlarıyla, 3.8 Flash girişi Flash-Lite'ın 2,5 katı ve çıkışı 1,5 katıdır. Sonnet 5'e kıyasla, 3.8 Flash hem girişte (2 dolar / 0,75 dolar) hem de çıkışta (10 dolar / 3,75 dolar) yaklaşık 2,7 kat daha ucuzdur. Luna'ya kıyasla da daha ucuzdur: girişte 0,75 dolara karşılık 1 dolar, çıkışta 3,75 dolara karşılık 6 dolar.

1 Ocak'ta tablo değişiyor. 1,50 dolar ve 7,50 dolarlık fiyatlarla 3.8 Flash, her iki tarafta da Luna'dan daha pahalı hale geliyor ve Sonnet 5 ile arasındaki fark yaklaşık 1,3 katına düşüyor (2 dolar / 1,50 dolar ve 10 dolar / 7,50 dolar). Flash-Lite ise her zaman daha ucuz kalıyor. Eğer 3.8 Flash'ı seçmenizin nedeni tanıtım oranıysa, Ocak ayındaki yeniden değerlendirmeyi şimdi takviminize ekleyin.

Token başına karşılaştırma hikayenin sadece yarısıdır. Cevap başına daha az token harcayan bir model, daha yüksek bir oranda görev başına daha az maliyetli olabilir ve bunu bilmenin tek yolu, aynı görev setini her aday üzerinde çalıştırmak ve kullanım sayılarını geri okumaktır. 3.8 Flash API kılavuzu, usageMetadata'yı hem Etkileşim API'sinden hem de eski generateContent'ten nasıl okuyacağınızı gösterir.

Apidog token iddialarıyla maliyet regresyonlarını yakalayın

3.8 Flash ile hata modu yanlış cevap değildir. Bu, bir istem ayarı veya düşünme seviyesi değişikliğinden sonra sessizce %40 daha fazla token kullanan doğru bir cevaptır ve fatura gelene kadar kimse fark etmez. Apidog, token sayısını bir durum kodu gibi iddia edilecek bir alan olarak ele alarak bunu düzeltir.

  1. Anahtarı bir ortam değişkeni olarak saklayın. Apidog ortamında GEMINI_API_KEY oluşturun ve anahtarın hiçbir zaman kaydedilmiş bir istekte bulunmaması için bunu x-goog-api-key başlığında {{GEMINI_API_KEY}} olarak referans gösterin.
  2. Altın bir istem gönderin. Üretim rotası başına bir tane olmak üzere temsili bir istem ve açık bir thinkingConfig.thinkingLevel ile https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent adresine bir POST isteği kaydedin.
  3. Kullanım alanlarını iddia edin. usageMetadata'yı okuyan ve tokenlar temel seviyenizden belirlenen bir tavanı aşarsa testi başarısız kılan bir son işlemci betiği ekleyin:
const usage = pm.response.json().usageMetadata;
pm.test("thinking tokens within budget", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("visible output within budget", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("request cost within budget", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
  pm.expect(cost).to.be.below(0.05);
});
  1. Planlayın. İstekleri bir test senaryosuna yerleştirin ve programlı olarak çalıştırın, böylece token kullanımındaki bir sıçrama aynı gün başarısız bir çalışma olarak görünür; Apidog'da API testlerini planlama kılavuzumuz kurulumu kapsar. 1 Ocak'ta iki oran sabitini güncelleyin ve maliyet iddiası faturayı takip etmeye devam edecektir.

Aynı senaryo, sağlayıcıların birbiriyle rekabet ettiği bir yarışma görevi de görür: Flash-Lite, Sonnet 5 veya Luna'ya bir kopyasını yönlendirin ve kullanım alanlarını yan yana karşılaştırın. İlk senaryoyu oluşturmak için Apidog'u indirin; ücretsiz plan bu iş akışını kapsar.

SSS

Gemini 3.8 Flash, 3.7 Flash'tan daha mı pahalı? Token başına, hayır. Her ikisi de 31 Aralık'a kadar 0,75 dolar giriş ve 3,75 dolar çıkış, ardından 1,50 dolar ve 7,50 dolar. Görev başına, evet: Artificial Analysis, 3.8 Flash'ın yüksek seviyede index görevi başına 0,58 dolar, 3.7 Flash'ın ise 0,40 dolar olduğunu ölçtü, çünkü 3.8 Flash yaklaşık %30 daha fazla çıkış tokenı üretiyor.

Düşünme tokenları ayrı mı faturalandırılıyor? Hayır. Milyon başına 3,75 dolar (tanıtım) çıkış tokenı olarak faturalandırılırlar ve usageMetadata.thoughtsTokenCount içinde görünürler. Bunları dolaylı olarak thinking_level aracılığıyla kontrol edersiniz; 3.8 Flash'ta sabit bir token bütçesi yoktur ve minimal bir hata döndürür.

Gemini 3.8 Flash için ücretsiz bir katman var mı? Evet. AI Studio ücretsiz katmanı, AI Studio'da gösterilen oran limitleri ile giriş veya çıkış için ücret almaz ve Google, ücretsiz katman verilerini ürünlerini iyileştirmek için kullanır. Tüketici Gemini uygulaması, 3.8 Flash'ı yalnızca AI Pro ve Ultra abonelerine sunar. Detaylar ücretsiz kullanım kılavuzunda.

1 Ocak 2027'de maliyetlerime ne olacak? Giriş, çıkış, önbellek okuma, önbellek depolama ve toplu işlem oranları iki katına çıkar. Görev başına token kullanımı aynı kalırsa, faturanız da iki katına çıkar. 3.6 ve 3.7 Flash satırları da aynı tarihte iki katına çıkar.

Hangi düşünme seviyesi maliyetleri düşük tutar? Artificial Analysis'ın dağılımından başlayın: index görevi başına düşük 0,24 dolar, orta 0,41 dolar, yüksek 0,58 dolar. Her seviyede kendi değerlendirmelerinizi çalıştırın, geçen en düşük seviyeyi koruyun ve ayarın kaymamasını sağlamak için token sayılarını iddia edin.

Bu hafta ne yapmalı

Gemini 3.8 Flash, 3.7 Flash gibi fiyatlandırılır ve daha büyük bir model gibi token harcar. Düşünme seviyesini bir maliyet ayarı olarak ele alın ve her rota için bunu ayarlayın. Toplu işlere uygun çalışmaları 31 Aralık'tan önce tanıtım penceresine taşıyın. Token kullanımınızı şimdi temel alın ve bunu iddia edin, böylece Ocak ayındaki ikiye katlanma, fiyatlandırdığınız bir değişiklik olur.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin