Her arka uç ekibinin, bir dil modeliyle açıkça daha iyi olacak ve kimsenin henüz hayata geçiremediği bir iş listesi vardır. Günde beş milyon destek olayını sınıflandırmak. On iki milyon satırlık bir kataloğu zenginleştirmek. Her gelen webhook'u kuyruğa girmeden önce puanlamak. Sebebi her zaman aynıdır: talep başına maliyeti gerçek talep sayınızla çarptığınızda, bu sayı artık bir yuvarlama hatası olmaktan çıkar.
22 Eylül 2026'da duyurulan GPT-6 Luna, milyon giriş jetonu başına 0,10 dolar ve milyon çıkış jetonu başına 0,50 dolar maliyetle, 1.000.000 jetonluk bir bağlam penceresine sahip olup, önbelleğe alınmış giriş okumalarına %90 indirim uygulamaktadır. Bu, rafa kaldırılan birçok işi uygulanabilir kılacak kadar ucuzdur ve insanları aritmetik yapmaktan alıkoyacak kadar da ucuzdur; bu da beş haneli bir faturayı nasıl açıklamak zorunda kalacağınızın göstergesidir.
Düğme
İşte aritmetik: üç gerçekçi iş yükü şekli, her biri için milyon istek başına maliyet ve etiket fiyatından çok önce faturanızı belirleyen üç değişken.
Çalıştığınız Oranlar
| Model | API Kimliği | 1M Başına Giriş | 1M Başına Önbelleğe Alınmış Okuma | 1M Başına Çıkış | Bağlam |
|---|---|---|---|---|---|
| GPT-6 Luna | gpt-6-luna |
$0.10 | $0.01 | $0.50 | 1,000,000 |
| GPT-6 Sol | gpt-6-sol |
$2.00 | $0.20 | $10.00 | 872,000 |
| GPT-6 Astra | n/a | $10.00 | n/a | $50.00 | n/a |
| Claude Opus 5.5 | claude-opus-5-5 |
$4.00 | $0.20 (yazma $5.00) | $20.00 | 1,000,000 |
Sol ve Luna için önbelleğe alınmış okuma sütunu, ayrı olarak yayınlanmış bir sayı değil, giriş oranına uygulanan %90'lık indirimdir. Anthropic, önbelleğe alınmış okuma oranını doğrudan yayınlar ve ayrıca önbelleğe yazmak için milyon başına 5,00 dolar ücret alır; bu, hacimli işlerde önemlidir: yüksek ön ek değişikliği olan bir iş yükü bu yazma maliyetini tekrar tekrar öder.

Rakamları vermeden önce bir düzeltme. OpenAI, Sol ve Luna'yı GPT-5.6'nın promosyonel fiyatlandırmasından %50 daha ucuz olarak tanımlıyor. Promosyonel, OpenAI'ın kendi kelimesidir ve gerçek bir işlevi vardır: karşılaştırma, GPT-5.6'nın piyasaya sürüldüğü oranla değil, indirimli bir oranla yapılır. Lansman haberlerimizde belgelenen GPT-5.6 Luna'nın liste fiyatı olan 1 dolar giriş ve 6 dolar çıkışa kıyasla, GPT-6 Luna girişte %90, çıkışta %92 indirimlidir.
İş Yükü A: yüksek QPS sınıflandırması
Çoğu ekibin ilk başvurduğu şekil: sabit bir sistem istemi, araç şemaları ve bir taksonomi, ayrıca küçük bir değişken yük ve kısa, yapılandırılmış bir sonuç döndürme. 1.500 jetonluk sabit ön ek, 500 jetonluk değişken yük, 120 çıkış jetonu ve günde 5.000.000 istek varsayalım.
| Model | 1M soğuk istek başına maliyet | 1M önbellekli ön ek isteği başına maliyet |
|---|---|---|
| GPT-6 Luna | $260 | $125 |
| GPT-6 Sol | $5,200 | $2,500 |
| Claude Opus 5.5 | $10,400 | $4,700 |
| GPT-6 Astra | $26,000 | yayınlanmadı |
| GPT-5.6 Luna, liste fiyatı | $2,720 | uygulanmaz |
Günde 5.000.000 istekte, Luna'da sıcak ön ek ile bu, ayda yaklaşık 18.750 dolar olmak üzere 625 dolardır. Aynı trafik Sol'da önbelleğe alma olmadan günde 26.000 dolar, Astra'da ise 130.000 dolardır.
Bu tablodan iki şey çıkar. Önbelleğe alma indirimi, iş yükünde hiçbir şey değişmemesine rağmen bu faturayı %52 oranında düşürüyor; tek fark, baştaki 1.500 jetonun çağrılar arasında bayt olarak aynı kalıp kalmadığıdır. Ve hacimde katman farkı bir yüzde değil, bir büyüklük sırasıdır. Burada Sol yerine Luna'yı seçmek, bir kırpma değil, yirmi kat daha büyük bir karardır.
İş Yükü B: büyük bağlam alımı
Burada Luna'nın 1.000.000 jetonluk penceresi bir teknik özellik satırı olmaktan çıkıyor. Çağrılar arasında sabit tutulan 200.000 jetonluk bir bilgi paketi, 2.000 jetonluk bir sorgu, 600 çıkış jetonu ve günde 50.000 istek varsayalım.
| Soğuk | Ön ek önbelleğe alınmış | |
|---|---|---|
| GPT-6 Luna, istek başına | $0.0205 | $0.0025 |
| GPT-6 Luna, günlük | $1,025 | $125 |
| GPT-6 Sol, istek başına | $0.410 | $0.050 |
| GPT-6 Sol, günlük | $20,500 | $2,500 |
Burada önbelleğe alma, İş Yükü A'daki %52'ye karşılık Luna faturasından %88 indirim sağlıyor. Bu farkın tüm amacı şudur: indirim, sabit ön ekin yeni jetonlara oranıyla ölçeklenir. Günde 50.000 kez yeniden okunan 200.000 jetonluk bir ön ek, istem önbelleğe almanın en çok işe yaradığı şekildir.
Luna'nın penceresi Sol'un 872.000 jetonundan da daha büyüktür, bu nedenle 900.000 jetonluk bir yük daha pahalı modele sığmazken, daha ucuz olana sığar. Bu durum, GPT-6 Luna'nın aslında ne olduğu makalesinde ayrıntılı olarak ele alınan, "yük büyüdüğünde daha büyük bir modele yükselt" şeklindeki alışılagelmiş yönlendirme kuralını tersine çevirir.
İş Yükü C: tek seferlik geriye dönük doldurma
Toplu işler, yeni fiyatlandırmanın sadece ucuz olanı değil, aynı zamanda mümkün olanı da değiştirdiği yerlerdir. 12.000.000 kayıt zenginleştirme geçişi varsayalım: 900 jetonluk sabit talimat, kayıt başına 300 jeton, 250 çıkış jetonu.
| GPT-6 Luna | GPT-6 Sol | |
|---|---|---|
| Giriş, soğuk | $1,440 | $28,800 |
| Çıkış | $1,500 | $30,000 |
| Toplam, soğuk | $2,940 | $58,800 |
| Toplam, ön ek önbelleğe alınmış | $1,968 | hesaplanmadı |
On iki milyon kayıtlık bir geriye dönük doldurma, 3.000 doların altında veya talimat ön eki sıcak kalırsa 2.000 doların altında. Bu, bir ekibin tek bir mesajla onay alabileceği bir sayıdır. Sol'daki aynı iş için bir bütçe görüşmesi gerekir.
Buradaki oranı fark edin. Çıkış artık faturanın yarısını oluşturuyor ve bu da doğrudan maliyetinizi gerçekten belirleyen şeye yol açıyor.
Faturayı belirleyen üç değişken
1. Çıkış jetonları, çünkü girişe göre beş kat faturalandırılırlar
Luna'nın çıkış oranı, giriş oranının 5 katıdır. Önbelleğe alınmış ön ek ile İş Yükü A'da, giriş milyon istek başına 65 dolara mal olurken, 120 çıkış jetonu 60 dolara mal oluyor. Yanıt formatını 400 jetona gevşettiğinizde çıkış 200 dolara fırlar ve toplam maliyet milyon istek başına 125 dolardan 265 dolara çıkar. Bir öğleden sonra seçilen bir yanıt şeması, faturayı iki kattan fazla artırdı.
Çözüm sıkıcı ama etkili: çıktıyı kısıtlayın. Bir cümle yerine bir numaralandırma (enum) döndürün. Bir açıklama yerine bir puan döndürün ve açıklamayı yalnızca bir insanın inceleyeceği küçük vakalar için alın. Şekli bir JSON şemasıyla sabitleyin, böylece model boşluk dolduramaz:
{
"model": "gpt-6-luna",
"response_format": {
"type": "json_schema",
"json_schema": {
"name": "triage",
"strict": true,
"schema": {
"type": "object",
"properties": {
"category": { "enum": ["billing", "outage", "how_to", "abuse"] },
"severity": { "type": "integer", "minimum": 1, "maximum": 4 }
},
"required": ["category", "severity"],
"additionalProperties": false
}
}
}
}
Bu şekil üzerine inşa etmeden önce parametre adlarını OpenAI'ın mevcut model referansına göre doğrulayın. `gpt-6-luna` model kimliği, lansman materyalinden onaylanan kısımdır.
2. Önbellek isabet oranı, çünkü alacağınız tek ücretsiz %50 ila %88'dir
Yukarıdakilerin hepsi ön ekin bayt olarak aynı kaldığını varsayar. Üretimde genellikle kalmaz, çünkü birisi sistem istemine bir istek kimliği enjekte eder veya araç dizisini anahtar sırası süreçler arasında karışan bir sözlükten oluşturur. İki klasik önbellek katili artık bu listeden çıktı: GPT-6 ile, akıl yürütme çabasını veya araç kullanılabilirliğini değiştirmek artık önbelleği geçersiz kılmaz ve açık kesme noktaları önbelleğe alınmış ön ekin nerede biteceğine karar vermenizi sağlar. Bir İstem Önbelleğe Alma Kontrol Paneli ve bir tanı aracı, isabet oranını varsaymak yerine ölçtüğünüz bir şey haline getirir ve GitHub, milyarlarca istekte %50'den fazla daha az istem jetonunun yeni işleme ihtiyaç duyduğunu bildiriyor. Mekanizmalar GPT-6 istem önbelleğe alma rehberimizde ele alınmıştır.
Yüksek hacimli durumlarda, isabet oranını bir üretim SLI'ı olarak ele alın. Sizi %95 isabetten %40'a sessizce düşüren bir ön ek yeniden yapılandırması, İş Yükü A'ya günde yaklaşık 400 dolara mal olur ve hiçbir hata, uyarı veya başarısız test üretmez.
3. Yeniden denemeler, çünkü çoğalırlar
İş Yükü A'da %5'lik bir yeniden deneme oranı günde yaklaşık 31 dolar ekler. Kabul edilebilir. Aynı %5'lik oran İş Yükü B'de, yeniden denemeler önbelleği kaçırırsa günde 50 dolara, isabet ederse 6 dolara mal olur ve fark tamamen yeniden denemenizin istemi sıfırdan yeniden oluşturup oluşturmadığına bağlıdır. Bir ön eki yeniden oluşturan yeniden denemeler, satın alabileceğiniz en pahalı esnekliktir. Tam istek gövdesini yeniden kullanın.
Yüksek QPS'deki gecikme tuzağı
Ucuz hızlı değildir ve yüksek QPS'de bu sorun yaratır. Artificial Analysis'ten üçüncü taraf ölçümlerine göre GPT-6 Luna, ilk jeton süresi 124.23 saniye olmak üzere saniyede 153.9 çıkış jetonu hızına sahipken, GPT-6 Sol 102.15 saniyeye sahiptir. İki uyarı geçerlidir ve ikisi de önemlidir: bunlar satıcı tarafından yayınlanmış değil, üçüncü taraf rakamlarıdır ve mevcut en yavaş yapılandırma olan maksimum muhakeme varyantlarında ölçülmüştür.
Yine de yön önemlidir. İlk jetona iki dakika, varsayılan bir HTTP istemci zaman aşımını patlatacak, bir yük dengeleyiciyi boşta bırakacak ve çoğu sunucusuz çalışma zamanında yürütme tavanını aşacaktır. Yüksek QPS senkron yolları, akışla düşük çabalı işlere aittir; yüksek çaba ise hiçbir şeyin bir soketi beklemediği toplu işlere ve kuyruk çalışanlarına aittir. Zaman aşımlarını, gönderdiğiniz çaba düzeyindeki ölçülen gecikmeye göre boyutlandırın, fiyata göre değil.
Kalite tabanı nerede duruyor
Luna, ailenin en akıllı modeli değil ve OpenAI da bunu iddia etmiyor. OpenAI'ın kendi ifadesiyle Astra, “genel olarak en iyi modelimiz olmaya devam ediyor”. OpenAI'ın yayınladığı bilgiler: Luna, maksimum çabada DeepSWE 1.1'de %66.6 puan alıyor; bu, orta çabadaki Claude Opus 5 ve Claude Fable 5 ile karşılaştırılabilir düzeyde olup, Opus 5'ten görev başına %93, Fable 5'ten ise %96 daha düşük maliyetlidir. Yüksek çabadaki AutomationBench 1.0.6'da, selefini 5.4 puan geride bırakarak görev başına %58 daha düşük maliyetle geçiyor. Maksimum çabadaki OSWorld 2.0 çevrimdışında, GPT-5.6 Sol'u orta düzeyde onda bir maliyetle geçiyor.
Bunlar, aynı gün piyasaya sürülen Opus 5.5'e değil, Claude Opus 5'e göre ölçülen satıcı rakamlarıdır, bu yüzden bunları yönlendirici olarak ele alın. Operasyonel okuma şudur: Luna, iyi tanımlanmış, doğrulanabilir işler için çıtayı aşan en ucuz modeldir ve "doğrulanabilir" anahtar kelimedir.
Maliyet modelini taahhüt etmeden önce kanıtlayın
E-tablo aritmetiği bir hipotezdir. Bunu gerçek trafik üzerinde test edin: üretim yüklerinden 500 istekli bir örnek alın, bunu Luna ve Sol'a iki ortam olarak karşı çalıştırın ve jeton sayılarını, gecikmeyi ve şema uygunluğunu kaydedin.
Apidog'da bu, model kimliği bir ortam değişkeni olarak belirlenmiş, gerçek yüklerden oluşan bir veri dosyasına karşı bir test senaryosu olarak çalıştırılan tek bir kaydedilmiş uç noktadır. Üç doğrulama ekleyin ve bu test paketi, bir doğruluk kontrolü olmaktan çok bir maliyet koruma mekanizması haline gelir: yanıtın JSON şemanızla eşleştiğini doğrulayın, `usage.completion_tokens` değerinin istek başına çıkış bütçenizin altında kaldığını doğrulayın ve `usage.prompt_tokens_details.cached_tokens` değerinin sıfır olmadığını doğrulayın; böylece önbellek isabet oranınızı öldüren bir ön ek yeniden düzenlemesi, bir sonraki ayın faturasında görünmek yerine CI'da başarısız olur. Bu kullanım alanı adlarını doğrulamadan önce mevcut API referansına göre teyit edin.
Kimsenin yazmadığı ama herkesin ihtiyaç duyduğu son doğrulama budur. Yüksek hacimli bir LLM iş yükünün başarısızlık modu neredeyse hiçbir zaman bir kesinti değildir. Yeşil bir gösterge tablosunun arkasındaki 4 kat faturadır.
Luna'nın fiyatlandırmasının GPT-6 Sol ve Claude Opus 5.5 ile hafta boyunca nasıl konumlandığını görmek için Eylül 2026 Yapay Zeka modeli fiyat savaşının analizimize bakın.
Kısa versiyon
Yüksek hacimli, iyi tanımlanmış, programatik olarak doğrulanabilir işleri Luna'ya yönlendirin ve isteminizin sabit kısmını bayt olarak aynı tutun. Çıkış jetonlarını sınırlayın, çünkü girişe göre beş kat faturalandırılırlar. Önbellek isabet oranını bir üretim metriği olarak ölçün. Kendi trafiğinizde ilk jeton süresini ölçene kadar yüksek çabayı senkron yollardan uzak tutun. Bunu yaparsanız, aritmetik çalışmadığı için asla hayata geçirilemeyen işler bu hafta tekrar maliyetlendirmeye değer hale gelir.
