Gemini 4 Argon’un öne çıkan özelliği olan 1 milyon jeton, bağlam penceresi değil, çıktı sınırıdır. Google, tek bir Argon yanıtının yaklaşık 16 katı önceki 64K sınırına kıyasla 1 milyon jetona ulaşabileceğini ve Argon’un giriş penceresini henüz yayımlamadığını belirtiyor. Henüz çağrılabilecek bir şey de yok: Argon bugün yalnızca Fairwind Programı savunucularına sunuluyor; Google erişimi açtıktan sonra ücretli API müşterileri de erişebilecek (bkz. yayın tarihi ve erişim kılavuzu).
Bu kadar uzun bir yanıt, çoğu API yığınının güvendiği üç varsayımı bozar: bir çağrının saniyeler içinde tamamlanması, gövdenin belleğe sığması ve bir isteğin küçük, öngörülebilir bir maliyeti olması. Bu kılavuz, erişim sağlanmadan önce tam kapasiteli bir yanıtın maliyetini, akışını, zaman aşımlarını, çıktı sınırlarını, depolamayı ve tüm bunları Apidog'da nasıl test edeceğinizi kapsar. Modelin genel görünümü için Gemini 4 Argon nedir bölümüne bakın; istek yapıları için Gemini 4 Argon API kılavuzuna bakın.
1M çıktı jetonu 1M bağlam penceresi değildir
Argon için sıralanan bazı sayfalar 1M sayısını bir bağlam penceresi olarak tanımlarken, bir başlık ise bunu "16 kat daha büyük bir bağlam penceresi" olarak adlandırıyor. Bu durum yanlış bir yorumdur. Google’ın lansman yazısı, modelin çıktı jetonu limitini "sektör lideri 1M jetona" genişlettiğini belirtiyor. Bu 64K, Google’ın önceki en iyi Pro modeli olan Gemini 3.1 Pro Preview üzerindeki 65.536 jetonluk çıktı sınırıyla eşleşmektedir.
Giriş, Google'ın henüz açıklamadığı ayrı bir sayıdır. Değerlendirme metodolojisinde açıklanan uzun bağlam değerlendirmesi, 256K ile 1M jeton arasında istemler kullandı. Bu bir karşılaştırma alt kümesidir, bir özellik değildir. Çıktı tarafında da bir uyarı var: Vals AI, test ettiği Argon yapılandırması için 262K maksimum çıktı listeliyor. Google modelin limitinin 1M olduğunu söylüyor; en az bir üçüncü taraf değerlendirici, kullandığı uç noktada daha düşük bir sınır gördü.
| Model | Yanıt başına maksimum çıktı | Giriş veya bağlam penceresi |
|---|---|---|
| Gemini 4 Argon | 1M (Google'ın belirttiği sınır) | Yayınlanmadı |
| Gemini 3.1 Pro Preview | 65,536 | 1,048,576 |
| Gemini 3.8 Flash | 65,536 | 1,048,576 |
| GPT-6 Astra | 128,000 | 1,050,000 (922K maksimum giriş) |
| Claude Opus 5.5 | 128K (Beta başlığıyla Batch üzerinde 300K) | 1M |
Her rakip, senkron çıktıyı 128K ile sınırlıyor, bu nedenle Argon'un belirtilen limiti onlarınkinin yaklaşık 8 katıdır. Google'ın nedeni, muhakeme derinliğidir: yeterli boş alanla model, "tek bir yörüngede yüz binlerce jeton üretebilir" ve zor sorunları tek seferde çözebilir. Diğer satıcıların uzun çalışmalarla nasıl başa çıktığını görmek için Claude Opus 5.5'in 18 saatlik görevlerine ve GPT-6 Astra API kılavuzuna bakın.

Maksimum kapasiteli bir yanıtın maliyeti nedir
Önce tavan fiyatı belirleyelim. Argon'un tanıtım döneminde çıktı, 1M jeton başına 10 dolar, sonrasında ise 20 dolar olarak faturalandırılır, bu nedenle tam uzunlukta bir yanıtın maliyeti şöyledir:
- Giriş dönemi: 1.000.000 x 10$/1M = 10.00$ çıktı maliyeti
- Standart dönem: 1.000.000 x 20$/1M = 20.00$ çıktı maliyeti
Giriş maliyeti ayrıca eklenir. 200.000 jetonluk bir istem, giriş dönemi fiyatlarıyla 200.000 x 2$/1M = 0.40$ veya standart fiyatlarla 0.80$ ekler, bu nedenle tek bir tam kapasiteli çağrı 10.40$ veya 20.80$ tutar. Bu türden 100 çağrı yapan bir gece işi, giriş dönemi fiyatlarıyla 1.040$ maliyetlidir.
Düşünce jetonları bu durumu daha karmaşık hale getirir. Mevcut Gemini modellerinde, düşünce jetonları çıktı olarak faturalandırılır; Google, Argon'un bu kurala uyup uymadığını veya düşünce jetonlarının 1M sınırına dahil olup olmadığını belirtmemiştir. Her iki durumda da, kısa görünen bir yanıt bile büyük bir çıktı faturasına yol açabilir. Gemini 4 Argon fiyatlandırma kılavuzu, %95 indirimli önbelleğe alınmış giriş dahil olmak üzere daha fazla senaryoyu içermektedir.
Akış neden zorunludur
Akışsız bir çağrı, yanıtın tamamı bitene kadar hiçbir şey döndürmez. Yüz binlerce jetonda bu, uzun ve sessiz bir bağlantı anlamına gelir ve yığınınızdaki boşta kalma zaman aşımları, ilk bayt gelmeden onu kapatabilir.
Bunun yerine akış kullanın. generateContent üzerinde, yöntemi :streamGenerateContent?alt=sse ile değiştirin ve Google, olay başına bir kısmi aday yığını içeren sunucu tarafından gönderilen olaylar (SSE) gönderir. Her olayı gelir gelmez okuyun ve yazın; önce gövdeyi toplamayın. Bu, bugün Gemini 3.8 Flash üzerinde çalışır, model bir değişkende bulunur çünkü Google Argon'un model kimliğini yayınlamamıştır (kurulum Gemini 3.8 Flash API kılavuzumuzda yer almaktadır):
import json, os, requests
MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
URL = ("https://generativelanguage.googleapis.com/v1beta/models/"
f"{MODEL}:streamGenerateContent?alt=sse")
body = {
"contents": [{"parts": [{"text": "Write a test plan for every endpoint in a payments API."}]}],
"generationConfig": {"maxOutputTokens": 60000},
}
usage = None
with requests.post(URL, json=body, stream=True, timeout=(10, 120),
headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]}) as r, \
open("response.txt", "a", encoding="utf-8") as out:
r.raise_for_status()
for line in r.iter_lines(decode_unicode=True):
if not line or not line.startswith("data:"):
continue
event = json.loads(line[5:])
for cand in event.get("candidates", []):
for part in cand.get("content", {}).get("parts", []):
out.write(part.get("text", ""))
out.flush()
usage = event.get("usageMetadata", usage)
print(usage)
timeout=(10, 120), 10 saniyelik bir bağlantı zaman aşımı ve 120 saniyelik bir okuma zaman aşımı ayarlar. requests'ta okuma zaman aşımı, toplam süre değil, baytlar arasındaki en uzun boşluktur, bu nedenle sürekli gönderim yapan bir akış gerektiği kadar çalışabilir. Her parça gelir gelmez diske kaydedilir. 3.8 Flash'ta her olay, çalışan bir usageMetadata taşır, bu nedenle son olay, günlüğe kaydetmek ve faturalandırmak için size nihai jeton sayılarını verir.
Her atlamada zaman aşımları
İstemciniz bir atlama noktasıdır. Uzun bir akış aynı zamanda bir ters proxy, bir API ağ geçidi, bir yük dengeleyici ve belki de sunucusuz bir çalışma zamanı üzerinden geçer ve bunlardan herhangi biri yanıtı erken sonlandırabilir:
| Atlama noktası | Neyi kontrol etmeli | Yanlış olduğunda semptom |
|---|---|---|
| HTTP istemcisi | Okuma veya boşta kalma zaman aşımı, ayrıca toplam istek zaman aşımı | Sadece uzun yanıtlarda akış ortasında istisnalar |
| Ters proxy | Okuma zaman aşımı ve text/event-stream için yanıt ara belleğe alma |
Olaylar ani akışlar halinde gelir veya akış kesilir |
| API ağ geçidi | Maksimum istek süresi | İstekler her çalıştırmada aynı geçen sürede başarısız olur |
| Yük dengeleyici | Boşta kalma zaman aşımı | İlk olaydan önceki uzun duraklamalar sırasında düşmeler |
| Sunucusuz fonksiyon | Maksimum yürütme süresi | Model hala yazarken fonksiyon sona erer |
Sabit bir kesme noktası olup olmadığını kontrol edin. Uzun yanıtlar her zaman aynı sürede başarısız oluyorsa, bazı atlama noktalarında akışın düzeltemeyeceği katı bir süre limiti vardır ve bu işin istek yolundan çıkarılması gerekir.
Uzun işleri arka planda çalıştırın
En uzun işler için, işi canlı bir bağlantıdan ayırın. Etkileşimler API'si, uzun süreli görevler için background=true kullanarak arka plan yürütmeyi destekler. Arka plan çalıştırmaları depolanmış etkileşimlere bağlıdır: belgeler, store=false değerinin arka plan yürütmeyle uyumsuz olduğunu belirtir, bu nedenle bu istekler için depolamayı açık bırakın. Tamamlanmış bir arka plan etkileşimini almak için Google'ın belgelerini takip edin; yoklama uç noktalarını tahmin etmeyin. Google, yeni modellerin Etkileşimler API'sinde piyasaya sürüldüğünü söylediğinden, Argon'un uzun işlerinin orada çalışmasını planlayın.
Çıktıyı bilinçli olarak sınırlayın
1M sınırı bir tavan olup, bir hedef değildir. generateContent üzerinde, generationConfig.maxOutputTokens her yanıtı sınırlar; akış örneği 60.000 olarak ayarlanmıştır. 3.8 Flash'ta, düşünce jetonları bu sınıra dahil edilir: 2.000 ile sınırladığımız test çalışmamızda 1.340 düşünce jetonu ve 656 görünür jeton döndürülmüştür. Etkileşimler API'si için, birine güvenmeden önce Google'ın belgelerindeki çıktı-sınırı alanını doğrulayın. Ardından, çağrı başına kabul edeceğiniz maliyetten sınırı seçin:
| Çıktı sınırı | En kötü durum çıktı maliyeti, standart (20$/1M) | Giriş dönemi (10$/1M) |
|---|---|---|
| 64.000 | 64.000 x 20$/1M = 1.28$ | 0.64$ |
| 128.000 | 2.56$ | 1.28$ |
| 500.000 | 10.00$ | 5.00$ |
| 1.000.000 | 20.00$ | 10.00$ |
Sınıra ulaşan bir yanıt erken durur, bu nedenle onu eksik olarak değerlendirin. Son olayın finishReason değerini kontrol edin: MAX_TOKENS, sınırın onu kestiği anlamına gelir. Daha sonra ya bir takip turunda devam edin ya da o iş için sınırı yükseltin.
Büyük çıktıları ara belleğe almadan depolayın ve ayrıştırın
Bir milyon jeton, yanıt başına megabaytlarca metin demektir. Birkaç kural, bunun bir çalışanı çökertmesini önler:
- Bellekte tek bir dize oluşturmak yerine, parçaları geldikçe bir dosyaya veya çok parçalı bir nesne yüklemesine yazın.
- Bağlantı kesilirse kısmi dosyayı saklayın. Baştan körü körüne bir yeniden deneme, çıktıyı yeniden oluşturur ve faturalandırır.
- Yapıya ihtiyacınız olduğunda JSON Lines isteyin, böylece her satır, tek bir dev belge kapanmasını beklemeden kendi başına ayrıştırılır.
- Tüm gövdeleri değil,
usageMetadatave bayt sayısını kaydedin. - 800K jetonluk bir yanıt ulaşmadan önce veritabanınızdaki ve kuyruğunuzdaki sütun ve mesaj boyutu limitlerini kontrol edin.
Erişim açılmadan önce Apidog'da test edin
Tüm bunları bir vekil üzerinde prova edebilirsiniz. Apidog'u indirin ve üç kontrol noktasını uygulayın.
- Akışı izleyin. 3.8 Flash'a karşı
GEMINI_API_KEYveGEMINI_MODELortam değişkenleri olarak akış isteğini gönderin. Apidog,text/event-streamyanıtlarını ayrıştırır ve her olayı, geldiği gibi Zaman Çizelgesi görünümünde gösterir, böylece yığın boyutlarını, boşlukları ve nihaiusageMetadata'yı görebilirsiniz. - Çok daha uzun sahte bir yanıt akışı yapın. Gerçek 3.8 Flash çıktısı 65.536 jetonla sınırlıdır, bu nedenle aynı olay şeklinde çok daha fazlasını akıtan yerel bir taklit çalıştırın:
# long_stream_mock.py: Gemini-shaped SSE for parser and timeout tests (fake data)
import json, time
from http.server import BaseHTTPRequestHandler, ThreadingHTTPServer
EVENTS, DELAY, CHUNK = 20000, 0.005, "lorem ipsum " * 40
class Handler(BaseHTTPRequestHandler):
def do_POST(self):
self.rfile.read(int(self.headers.get("Content-Length", 0)))
self.send_response(200)
self.send_header("Content-Type", "text/event-stream")
self.end_headers()
for i in range(EVENTS):
event = {"candidates": [{"content": {"parts": [{"text": CHUNK}]}}]}
if i == EVENTS - 1: # fake counts sized like a near-max reply
event["usageMetadata"] = {"promptTokenCount": 1200,
"candidatesTokenCount": 950000, "thoughtsTokenCount": 40000,
"totalTokenCount": 991200}
self.wfile.write(f"data: {json.dumps(event)}\n\n".encode())
self.wfile.flush()
time.sleep(DELAY)
ThreadingHTTPServer(("127.0.0.1", 8787), Handler).serve_forever()
Bir "taklit" ortamın temel URL'sini http://127.0.0.1:8787 adresine yönlendirin ve aynı akış isteğini bu ortam üzerinden gönderin. Akış yaklaşık iki dakika (testimizde 128 saniye) sürer ve 9.6 milyon karakter metin taşır; bu, arabelleğe alma yapan bir ayrıştırıcıyı, olayları tutan bir proxy'yi veya çok kısa ayarlanmış bir zaman aşımını ortaya çıkarmak için yeterlidir.
- Jeton sayılarını doğrulayın. Akışsız bir generateContent isteğinde,
usageMetadata'dakicandidatesTokenCountartıthoughtsTokenCount'un kendi sınırınızda veya altında kaldığını ve hesaplanan maliyetin Argon fiyatlarında tavanınızın altında kaldığını doğrulayın. Argon API kılavuzunda hazır bir maliyet betiği bulunmaktadır.
SSS
- 1M, Gemini 4 Argon’un bağlam penceresi midir? Hayır. 1M, yanıt başına çıktı sınırıdır, 64K'dan artırılmıştır. Google, Argon'un giriş penceresini yayınlamadı.
- 1M jetonluk bir Argon yanıtının maliyeti ne kadardır? Giriş fiyatlarıyla 10$, standart fiyatlarla 20$ çıktı maliyeti, ayrıca giriş maliyeti eklenir. Daha fazla senaryo için Gemini 4 Argon fiyatlandırmasına bakın.
- Bugün 1M jetonluk bir yanıt oluşturabilir miyim? Kuruluşunuz Fairwind grubunda Argon erişimine sahip değilse hayır. Gemini 3.8 Flash ve 3.1 Pro Preview, çıktıyı 65.536 jetonla sınırlıyor ve Vals AI, test ettiği Argon yapılandırması için 262K maksimum çıktı listeliyor.
- Uzun Argon yanıtlarını akışla mı aktarmak zorundayım? Google, Argon için akış rehberliği yayınlamadı, ancak dakikalarca süren akışsız bir çağrı, yığınınızdaki her boşta kalma zaman aşımına maruz kalır. Akış kullanın veya Etkileşimler API'sinde arka plan yürütmeyi kullanın.
- Argon'un çıktı sınırı GPT-6 Astra ve Claude Opus 5.5 ile karşılaştırıldığında nasıldır? Her ikisi de senkron çıktıyı 128K ile sınırlıyor; Anthropic, beta başlığıyla Batch üzerinde 300K'ya izin veriyor. Argon'un belirtilen 1M'si bunun yaklaşık 8 katıdır.
Sıradaki adımınız
Şimdi Gemini istemcinize, 3.8 Flash üzerinde, akış ve bir çıktı sınırı ekleyin ve yığınınızdaki hiçbir şey onu kesene kadar uzun taklit akışına karşı çalıştırın. Argon'un kimliği piyasaya çıktığında, GEMINI_MODEL'i değiştirin ve aynı testleri Apidog'da yeniden çalıştırın.
