Gemini 3.8 Flash Düşünme Düzeyleri: Düşük, Orta, Yüksek Karşılaştırması ve Minimal Neden Yok?

Gemini 3.8 Flash düşünme seviyeleri açıklandı: düşük, orta ve yüksek seviyelerin ne işe yaradığı, neden artık minimum hata olduğu, seviye başına maliyet ve gecikme rakamları ve her birinin nasıl ayarlanacağı.

Ashley Goolam

Ashley Goolam

3 September 2026

Gemini 3.8 Flash Düşünme Düzeyleri: Düşük, Orta, Yüksek Karşılaştırması ve Minimal Neden Yok?

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Gemini 3.8 Flash, üç düşünme seviyesiyle birlikte gelir: low (düşük), medium (orta) ve high (yüksek). Bu ayar, modelin yanıt vermeden önce ne kadar dahili akıl yürütme yapacağını kontrol eder ve bu modelde aynı anda üç sayıyı etkiler: gecikme, çıktı tokenleri ve faturanız. Google, 3.8 Flash'ı karmaşık görevlerde "daha çok çalışmak" üzere tasarladı, bu nedenle seçtiğiniz seviye, 3.7 Flash'taki seviyeden daha önemlidir. Modele yeni başlıyorsanız, Gemini 3.8 Flash genel bakış lansmanı kapsar. Bu kılavuz sadece bu ayarla ilgilidir.

İlk saatte iki ayrıntı ekipleri yanıltır. 3.8 Flash'ın varsayılan seviyesi medium'dur, high değil (Gemini 3 Pro varsayılan olarak high kullanır, karışıklık buradan gelir). Ve 3.7 Flash için yazılan yapılandırmaların hala gönderdiği minimal artık kabul edilmemektedir: istek, tek bir token bile üretilmeden önce doğrulama hatası verir. Google, her ikisini de Gemini 3.8 Flash'taki yenilikler sayfasında belgeler.

Aşağıda: her seviyenin ne yaptığı, görev başına maliyeti, her iki API biçiminde nasıl ayarlanacağı, rota başına bir strateji ve yayına almadan önce token ve gecikme farkını gösteren tekrarlanabilir bir test bulunmaktadır.

Düşünme seviyelerine bir bakış

Seviye Google'ın rehberliği Görev başına maliyet (AA) Görev başına süre (AA) Ne zaman tercih edilmeli
low Gecikme ve maliyeti minimize eder; basit talimat takibi, sohbet, yüksek verimli rotalar $0.24 0.8 dak kullanıcıya yönelik gecikme önemli olduğunda; transkript araması; sınıflandırma
medium (varsayılan) Karmaşık kod ve ajan bazlı işler için varsayılan $0.41 metinde yayınlanmadı çoğu rota; genel video Soru-Cevap
high En zor çok adımlı problemler için maksimum akıl yürütme derinliği $0.58 2.5 dak yoğun görsel Soru-Cevap; 60+ dakikalık video; sonraki her şeyi engelleyen planlama adımları
minimal 3.8 Flash'ta desteklenmiyor yok yok asla; bunu low ile eşleştirin

Maliyet ve süre sütunları, Google'ın tanıtım token başına fiyatlarıyla, her seviyede Intelligence Index'lerini çalıştıran Artificial Analysis ortalamalarıdır. Bunlar Google'ın sayıları değil, bağımsız sayılardır ve sizin istemleriniz değil, bir karşılaştırma iş yükünü ölçerler. Bunları oranlar için kullanın, ardından kendi rotalarınızı ölçün.

Her seviye ne yapar

Her 3.8 Flash yanıtı, modelin görünür yanıttan önce ürettiği akıl yürütmeyi içeren düşünme tokenlerini içerebilir. Bunları çıktı tokenleri olarak ödersiniz (2026-12-31'e kadar tanıtım fiyatı 1 milyon token başına 3.75 dolar, 2027-01-01'den itibaren 7.50 dolar) ve API bunları ayrı olarak usageMetadata.thoughtsTokenCount olarak rapor eder. Düşünme seviyesi, modele ne kadar akıl yürütme yapacağını söyler.

3.8 Flash'ta bunu farklı kılan, modelin yeni varsayılan davranışıdır. Karmaşık görevlerde "ekstra akıl yürütme adımları yürütür ve araçları iteratif olarak çağırır" ve "işini yol boyunca doğrular". Google açıkça "daha uzun süren ve karmaşık görevlerde tasarım gereği daha fazla token kullanabileceğini" ve "modelin özellikle daha yüksek çaba seviyelerinde performansı maksimize etmek için daha fazla token kullanabileceğini" belirtir. Düşünme seviyesi, bu davranışın gaz koludur. Token kullanımı arttığında Google'ın ilk önerisi bunu düşürmektir; ikincisi ise tamamen desteklenmeye devam eden 3.7 Flash'ta kalmaktır.

İçselleştirilmesi gereken bir kısıtlama: thinking_level bir enum'dur, bir bütçe değildir. Önceki modellerdeki tam sayı thinking_budget Gemini 3'te kaldırılmıştır, bu yüzden "en fazla 2.000 düşünme tokeni" isteyemezsiniz. Bir seviye seçer ve ardından istemlerinizde ne kadara mal olduğunu doğrularsınız, bu yüzden bu kılavuzun sonundaki test önemlidir.

Varsayılan medium'dur, high değil

Alanı atlarsanız 3.8 Flash medium'da çalışır. Bu, iki grubu etkiler.

Gemini 3 Pro'da prototip geliştiren ekipler, varsayılan olarak high bekler ve fark etmeden orta derinlikte yanıtlar alırlar. 3.7 Flash yükseltmesi sırasında thinking_budget'ı çıkaran ve yerine bir seviye koymayan ekipler, low olması gereken sohbet rotaları da dahil olmak üzere her yerde medium'da kalırlar.

Her ikisi için de çözüm aynıdır: thinking_level'ı her istekte, rota başına, kodda değil yapılandırmada açıkça ayarlayın. Varsayılanlar Google'ın değiştirebileceği şeylerdir; onlar değiştiğinde maliyet profiliniz değişmemelidir.

Minimal neden kaldırıldı ve hata nasıl düzeltilir

minimal Gemini 3.7 Flash'ta çalışıyordu. 3.8 Flash'ta desteklenen kümede yer almamaktadır ve model sayfası düşünme seviyelerini yalnızca düşük, orta ve yüksek olarak listeler. Bunu REST üzerinden gönderirseniz, istek model çalışmadan önce "Thinking level MINIMAL is not supported for this model. Please retry with other thinking level." (Bu model için MINIMAL düşünme seviyesi desteklenmiyor. Lütfen başka bir düşünme seviyesiyle tekrar deneyin.) mesajıyla birlikte 400 INVALID_ARGUMENT hatasıyla reddedilir (3 Eylül 2026'da canlı bir çağrıyla doğrulandı). SDK'lar bunu kendi istisna sınıflarına sarar, bu yüzden mesaj dizesine değil, 400 durum koduna veya INVALID_ARGUMENT koduna göre eşleştirme yapın.

Önce:

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "minimal" }
}

Sonra:

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "low" }
}

Google'ın geçiş rehberliği doğrudan bir eşleşmedir: minimal, low olur. Bu yapılandırmadayken kaçınmanız gereken iki cazibe var. Daha küçük bir taban elde etmek için thinking_budget'a ulaşmayın; Gemini 3 modellerinde desteklenmiyor. Ve modeli "sakinleştirmek" için temperature'ı düşürmeyin; Google, tüm Gemini 3 modellerinde varsayılan 1.0'da bırakılmasını söyler, çünkü bunu düşürmek döngülere veya bozulmuş çıktıya neden olabilir. Düşünce imzaları ve işlev yanıtlarındaki call_id gereksinimi dahil olmak üzere tüm kontrol listesi 3.7'den 3.8 Flash'a geçiş kılavuzunda yer almaktadır.

Hata doğrulama anında tetiklendiği için, her seviyede planlanmış bir test isteği, bir yapılandırmanın minimal'e gerilemesini ücretsiz olarak yakalar.

Her seviyenin görev başına maliyeti nedir

Token başına fiyatlandırma seviyeyle değişmez. Google'ın fiyatlandırma sayfası, tüm 3.8 Flash çağrılarını tanıtım fiyatıyla milyon token başına 0.75 dolar girdi ve 3.75 dolar çıktı olarak listeler, bu oranlar 2027-01-01'de 1.50 dolar ve 7.50 dolara iki katına çıkar. Seviyeler arasındaki fark tamamen token sayısından kaynaklanır, ki Artificial Analysis'in ölçtüğü de budur.

Model ve seviye Görev başına maliyet Görev başına süre
Gemini 3.8 Flash low $0.24 0.8 dak
Gemini 3.8 Flash medium $0.41 metinde yayınlanmadı
Gemini 3.8 Flash high $0.58 2.5 dak
Gemini 3.7 Flash high $0.40 2.2 dak

Kaynak: Artificial Analysis, Intelligence Index tanıtım fiyatlarıyla çalışır. Tablodan üç oran ortaya çıkar.

low, high'ın maliyetinin yaklaşık %41'i ve gerçek süresinin yaklaşık üçte biri kadardır. Bu, bu modelde sahip olduğunuz en büyük tek kaldıraçtır.

3.8 Flash'taki medium, 3.7 Flash'taki high ile yaklaşık aynı maliyete sahiptir (0.41 dolar ve 0.40 dolar). Eğer 3.7 Flash'taki high'dan memnunsanız, 3.8 Flash'taki medium benzer bir bütçe çizgisi sunar.

3.8 Flash'taki high, 3.7 Flash'taki high'dan görev başına %45 daha pahalıdır, aynı token başına fiyatlarla, çünkü model yaklaşık %30 daha fazla çıktı tokeni üretir (indeks görevi başına ortalama 48k). Bu, "daha çok çalışır" tasarımının faturada kendini göstermesidir. Ekstra tokenlerin kendilerini karşılayıp karşılamadığı iş yüküne bağlıdır; 3.8 Flash vs 3.7 Flash karşılaştırması kalite kazanımlarının nerede olduğunu gösterir.

Kalite konusunda bir uyarı: AA'nın 3.8 Flash için 59'luk Intelligence Index puanı bir high çalışmasıdır. medium veya low seviyelerinde indeks puanlarını metinde yayınlamadılar, bu nedenle kalite eğrisinin maliyetle doğrusal olduğunu varsaymayın. Bir rotayı düşürmeden önce her seviyede kendi değerlendirmelerinizi test edin. Her seviyede günde 1.000 görev için örnek çalışma ve 31 Aralık fiyat eşiği için Gemini 3.8 Flash fiyatlandırmasına bakın.

Etkileşimler API'sinde thinking_level ayarlama

Etkileşimler API'si, Gemini 3.x için Google'ın birincil arayüzüdür. Seviye, generation_config içinde snake_case bir dize olarak yer alır:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'

Python'da:

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="HTTP önbelleklemesini 3 cümlede açıklayın.",
    generation_config={"thinking_level": "low"},
)
print(interaction.output_text)

Bu, istek düzeyinde bir alandır, bu nedenle previous_interaction_id geçiren takip dönüşleri de dahil olmak üzere her çağrıda ayarlayın. Yanıt, model_output ile biten bir dizi yürütme adımı (düşünceler, araç çağrıları) olarak geri döner ve SDK, son metni output_text olarak gösterir. Çoklu dönüş durumu ve akış dahil olmak üzere tam ilk çağrı rehberliği için Gemini 3.8 Flash API'sini nasıl kullanacağınıza bakın.

Bunu eski generateContent'te ayarlama

Mevcut Gemini kodlarının çoğu hala generateContent'i çağırır. Google bunu eski olarak adlandırsa da, tam olarak desteklenmeye devam ettiğini ve son kullanma tarihi olmadığını söylüyor, bu yüzden acele etmeye gerek yok. Alan bir seviye daha derine yuvalanmış ve camelCase'dir:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' -X POST \
  -d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
       "generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'

Python'da:

from google.genai import types

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="HTTP önbelleklemesini 3 cümlede açıklayın.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="low")
    ),
)
print(response.usage_metadata.thoughts_token_count)

includeThoughts: true, yanıtınıza thought: true olarak işaretlenmiş düşünce özetleri ekler: bir seviyeyi kalibre ederken faydalıdır, işiniz bittiğinde gürültüdür. Sizin için önemli olan sayı, çıktı olarak faturalandırılan tam sayım olan ve testlerinizin izlemesi gereken usageMetadata.thoughtsTokenCount'tur.

Rota başına bir strateji

Seviyeyi küresel bir ayar değil, bir yönlendirme kararı olarak ele alın. İşleyebilir bir ayrım:

Eğer 3.8 Flash'ta low bile bir rotanın ihtiyacından fazla modelse, bu iş için Flash-Lite serisi mevcuttur; daha önceki Gemini 3.1 Flash-Lite kılavuzumuz takasları kapsar ve Gemini 3.5 Flash-Lite, 0.30 dolar girdi ve 2.50 dolar çıktı ile mevcut giriş seviyesidir.

Seviyeyi rota başına yapılandırmada tutun ve gemini-3.7-flash'i bir bayrak arkasında saklayın. Yükseltmeden sonra bir rotanın token sayısı artarsa, seviyeyi veya modeli yeniden dağıtım yapmadan düşürebilirsiniz.

Üç seviyeyi de Apidog'da yan yana test edin

AA'nın tablosunu okumak size oranları söyler. Sadece kendi istemleriniz size sayıları söyler. İşte Apidog'da her seviyede bir altın istem gönderen ve geri dönenleri doğrulayan bir test senaryosu. Her iki API biçimine karşı da çalışır; eski uç nokta gösterilmiştir çünkü usageMetadata orada üst düzey bir alandır.

  1. Anahtarı bir ortam değişkeni olarak saklayın. Bir Apidog ortamında GEMINI_API_KEY oluşturun ve x-goog-api-key başlığında {{GEMINI_API_KEY}} olarak referans gösterin. İkinci bir değişken olan THINKING_LEVEL'ı ekleyin, böylece kaydedilmiş bir istek üç adımı da besler.
  2. Bir isteği kaydedin. Altın isteminizle /v1beta/models/gemini-3.8-flash:generateContent adresine POST yapın ve "thinkingConfig": {"thinkingLevel": "{{THINKING_LEVEL}}"} kullanın.
  3. Üç adımlı bir test senaryosu oluşturun. Aynı isteği üç kez içe aktarın ve her adımda THINKING_LEVELlow, medium ve high olarak geçersiz kılın.
  4. Değişen alanları doğrulayın. Her adımda: durum 200'dür ve usageMetadata.thoughtsTokenCount mevcuttur. low adımında, thoughtsTokenCount ve yanıt süresinin rotanın tolere edebileceği tavanın altında kaldığını doğrulayın (temel çizgiyi ilk çalıştırmanızdan sonra ayarlayın). Bir post-processor betiği, her adımın sayımını bir değişkende saklayabilir, böylece high adımı en az low kadar akıl yürüttüğünü doğrulayabilir. Eğer bu sıralama değişirse, model veya varsayılan sizin bilginiz dışında değişmiş demektir.
  5. Bir koruma adımı ekleyin. thinkingLevel: "minimal" gönderin ve yanıtın 200 olmadığını doğrulayın. Model kimliklerini daha sonra değiştirdiğinizde, bu adım yeni modelin hala reddedip reddetmediğini size söyler.
  6. Planlayın. Yapılandırma gerilemesi veya sessiz bir davranış değişikliğinin sürpriz bir fatura değil, kırmızı bir çalışma olarak görünmesi için senaryoyu günlük olarak çalıştırın. Mekanikler, Apidog'da API testleri nasıl planlanır bölümünde açıklanmıştır.

Akışlı yanıtlar için, aynı senaryo SSE renderlama ile geçerlidir; SSE üzerinden akış yapan LLM API'leri nasıl test edilir kurulumu kapsar. Takip etmek için Apidog'u indirin; ücretsiz plan bu senaryonun tamamını kapsar.

Sıkça Sorulan Sorular

Düşünme seviyesi token başına fiyatı değiştirir mi?

Hayır. 3.8 Flash'ta, tanıtım fiyatıyla, seviyeden bağımsız olarak, girdi milyon token başına 0.75 dolar ve çıktı 3.75 dolardır. Seviye, modelin düşünme olarak kaç çıktı tokeni ürettiğini değiştirir ve bunlar çıktı fiyatından faturalandırılır. Fiyatlandırma dökümü önbellekleme, toplu işleme ve 1 Ocak zammını kapsar.

Bunun yerine tam bir düşünme token bütçesi belirleyebilir miyim?

Gemini 3 modellerinde hayır. thinking_budget, thinking_level enum'u ile değiştirildi ve 3.8 Flash yalnızca low, medium ve high kabul eder. Bir tavan belirlemeniz gerekiyorsa, bunu istekte değil, testlerde ve uyarılarda uygulayın.

Artificial Analysis'in 59'luk puanı hangi seviyeyi kullanır?

high. AA, başlık puanı için Intelligence Index'i high seviyesinde çalıştırdı ve low ve medium seviyelerinde de maliyet ve süreyi yayınladı, ancak bu seviyelerde indeks puanlarını yayınlamadı. Kendi değerlendirmelerinizi yapana kadar daha düşük seviyeleri bu kıyaslamada test edilmemiş olarak kabul edin.

Düşünmeyi azaltmak için temperature'ı düşürmeli miyim?

Hayır. Google'ın tüm Gemini 3 modelleri için rehberliği, temperature'ı varsayılan 1.0 değerinde tutmaktır. Bunu düşürmek döngülere veya bozulmuş çıktıya neden olabilir. Akıl yürütme derinliğini kontrol etmek için thinking_level'ı kullanın.

Ya low bile çok yavaş veya çok pahalıysa?

Google'ın tam olarak desteklenmeye devam ettiğini ve kullanımdan kaldırma tarihi olmadığını söylediği Gemini 3.7 Flash'ta kalın veya rotayı bir Flash-Lite modeline taşıyın. 3.8 vs 3.7 Flash karşılaştırması, ekstra tokenlerin nerede ölçülebilir kalite sağladığını ve nerede sağlamadığını gösterir.

Rota başına seviyeyi seçin, sonra ölçün

Üç seviye, bir enum ve varsayılan olarak önceki modelinden daha fazla akıl yürüten bir model. Her rotada thinking_level'ı açıkça ayarlayın, kalan minimal'i low ile eşleştirin ve her seviyenin nereye oturduğunu usageMetadata.thoughtsTokenCount üzerinden izleyin. AA'nın görev başına rakamları (0.24$, 0.41$, 0.58$) size eğrinin şeklini verir; Apidog'daki üç adımlı bir senaryo, 31 Aralık fiyat değişikliği onları iki kat önemli hale getirmeden önce size kendi rakamlarınızı verir.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin