GPT-6 Astra İlk İnceleme: İki Gün Bekledik ve Yapay Genel Zeka Geldi

GPT-6 Astra hakkında yazmayı, onu kendimiz test edene kadar erteledik. İki gün sonra: Ekibimizin şimdiye kadar çalıştırdığı en iyi model, nelerin bozulduğu, maliyeti ve neden AGI'nin burada olduğunu söylediğimiz.

Ashley Innocent

Ashley Innocent

5 September 2026

GPT-6 Astra İlk İnceleme: İki Gün Bekledik ve Yapay Genel Zeka Geldi

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

GPT-6 Astra yaklaşık iki gündür piyasada. Hakkında kasten hiçbir şey yazmadık. Her model lansmanı artık bir kıyaslama tablosu, anlık görüşler dalgası ve lansman ortakları dışındaki hiç kimse tek bir istek göndermeden önce yazılmış bir düzine açıklayıcı ile geliyor. O yığına eklemeden önce onu kendimiz çalıştırmak istedik. Bu yüzden bekledik. Test ettik. Ve işte her zamanki kaçamak ifadeler olmadan karar: kesinlikle akıl almaz. Bu muhtemelen ekibimizin şimdiye kadar test ettiği en iyi model. YZİ (Yapay Zeka Genel Zekası) burada.

Bu son cümle bazı insanları rahatsız edecek, bu yüzden yazının geri kalanı kanıttır. Neyi çalıştırdık, bizi ne şaşırttı, ne bozuldu ve maliyeti ne oldu. Eğer özellikler sayfasını isterseniz, GPT-6 Astra API kılavuzumuzda model kimliği, fiyat tablosu ve GPT-5.6 Sol'dan geçiş notları bulunmaktadır. Bu yazı, onunla çalışmanın nasıl bir his olduğunu anlatıyor.

Perşembe gecesi: ilk istek

Erişim, 3 Eylül Perşembe günü geç saatlerde, OpenAI'ın Astra'yı duyurduğu sınırlı sayıdaki kuruluşla aynı gün geldi. Yaptığımız ilk şey, düşünebildiğimiz en az yaratıcı testti: ona bir OpenAPI spesifikasyonu verdik. Oyuncak değil. Dahili bir hizmet için 140 uç noktaya sahip, şemaları saydığınızda yaklaşık 380.000 JSON belirteci içeren bir spesifikasyon, Apidog'dan tek bir istekte Yanıtlar API'si aracılığıyla gönderildi.

GPT-5.6 Sol bu boyuttaki bir dosyayı işler, ancak çalıştığını hissedersiniz. Derin şemalarda konuyu kaybeder ve var olmayan uç noktalar hakkında soruları yanıtlamaya başlar. Astra yapmadı. Ondan bir test planı oluşturmasını istedik: hangi uç noktaların hangisine bağlı olduğu, yetkilendirme sınırlarının nerede olduğu, spesifikasyon ve uygulamanın muhtemelen nerede çeliştiği. Kaynağa göre gruplandırılmış bir planla geri döndü, belgelenmiş hata yanıtının aynı spesifikasyonun tanımladığı hata şemasıyla eşleşmediği üç uç noktayı işaretledi ve tam olarak tek bir soru sordu: yönetici rotalarında kiracı başlığının gerekli olup olmadığı, çünkü spesifikasyon orada belirsizdi ve yanıt test tasarımını değiştiriyordu. [DOĞRULAMA: üç uyumsuzluk ve soru]

Tek bir soru. Doğru olanı. Sonra devam etti.

OpenAI'ın kendi uzun bağlam sayıları gördüklerimizi açıklıyor. MRCR v2 8 iğne testinde, Astra 512K ila 1M aralığında %96,3 puan alırken, Sol %73,8'i yönetiyor. Pratikte bu fark, tüm sözleşmeyi verebileceğiniz bir model ile bölümler halinde beslemeniz gereken bir model arasındaki farktır.

Cuma sabahı: tıklamayı bıraktı

Bilgisayar kullanımı başlık özelliğidir, bu yüzden Cuma günü Astra'ya belgeler sitemizin bir önizleme URL'sini ve sıkıcı bir iş verdik: bir insanın bir sürümden önce yaptığı ön uç kalite kontrol listesini çalıştırmak. Her sayfayı tıklayın, arama kutusunu deneyin, kod örneklerinin işlenip işlenmediğini kontrol edin, bozuk olan her şeyi not alın. OpenAI, Astra'nın yapabileceği şeyler arasında "ön uç kalite kontrol kontrolleri"ni listeler ve OSWorld 2.0'da görev başına yaklaşık 40 dakikada %72,6 puan alırken, Sol'un görev başına yaklaşık 75 dakikada %65,7'sine karşılık gelir.

İşi yaptı. Yavaşça, metodik olarak, her adımda bir ekran görüntüsüyle. Bir modelin bir sayfayı kaydırmasını, bir kod bloğuna gözünü kısmasını ve kopyala düğmesinin çalıştığına karar vermesini izlemek yaklaşık dört dakika boyunca etkileyicidir.

Sonra istemediğimiz bir şey yaptı. Yaklaşık yirmi dakika sonra, belgeler sayfasında "OpenAPI İndir" bağlantısını buldu, spesifikasyonu okudu ve değişti. Etkileşimli örnekleri tek tek tıklamak yerine, doğrudan uç noktalara istek göndermeye ve yanıtları belgelenmiş örneklerle karşılaştırmaya başladı. Bunu neden yaptığını bize söyledi: API, oluşturulan sayfadan daha güvenilir bir kehanetti. O an, ekranınız yerine Astra'ya OpenAPI spesifikasyonunuzu neden vermeniz gerektiği hakkındaki yazımızın tüm argümanıdır. Model kendi kendine aynı sonuca ulaştı. Bir sözleşme, bir kullanıcı arayüzünden daha hızlı, daha ucuz ve daha az belirsizdir ve bu kadar iyi bir model, mümkün olduğunda kullanıcı arayüzünü atlayacaktır.

Cuma gecesi: bir gecede yeniden düzenleme

Üçüncü test, YZİ sorusu hakkındaki fikrimi değiştiren test oldu.

Codex'te çalışan Astra'ya ertelediğimiz bir yeniden düzenleme verdik: bir dizi entegrasyon testini, elle yazılmış fikstürlerden, aynı OpenAPI spesifikasyonundan oluşturulan fikstürlere, yaklaşık 60 dosya boyunca, testlerin iddia ettiği şeyi değiştirmeden taşımak. [DOĞRULAMA: dosya sayısı] Zor olmayan, sadece uzun ve her önceki modelin saptığı türden bir iş. Görev ortasında kendi bağlamını özetleyip, bir fikstürün neden garip bir şekle sahip olduğunu unutur ve onu "düzeltirdi".

Astra'nın tam da bunun için yeni bir numarası var. Codex'te her şeyi tek bir özette sıkıştırmak yerine bağlam pencereleri arasında notlar tutar ve önceki pencereler aranabilir kalır. `config.toml` dosyasında deneysel bayrağı açtık, saat 23:00'de çalıştırmayı başlattık ve yatağa gittik.

Saat 1:12'de bir soru sordu. Durarak değil. Codex artık Astra'nın cevaba bağlı olmayan kısımlarda devam ederken eşzamansız olarak soru sormasına izin veriyor, ki bu OpenAI'ın lansman gönderisinde tam olarak anlattığı şeydi. Soru, farklı şekillerde iki testte bulunan bir fikstürün bir hata mı yoksa kasıtlı mı olduğuydu. Bir hataydı. Sabah cevap verdiğimizde, diğer her şey bitmişti, süit yeşildi ve hangi iki dosyaya dokunmadığını ve neden dokunmadığını açıklayan bir not bırakmıştı. [DOĞRULAMA: zamanlama ve sonuç]

Bu bir sohbet botu değil. Bu, gece çalışan bir meslektaş.

Ne bozuldu

İki şey, ve ikisini de üzerine inşa etmeden önce bilmekte fayda var.

İlk olarak, uyumsuzluk izleyicisi. OpenAI, her araç kullanan Astra isteği üzerinde üretim izlemesi yapıyor ve bu kontrollerin "bazen yasal işi yavaşlatabileceğini, duraklatabileceğini veya durdurabileceğini", buna "bir aracının uzun bir süre çalıştığı görevlerin" de dahil olduğunu uyarıyor. Buna bir kez denk geldik. Yanıtlar API'si aracılığıyla uzun bir API güdümlü çalışma, kısmi sonuç olmadan durdu. [DOĞRULAMA: durdurma olayı] ChatGPT veya Codex'te eylemi gözden geçirmeniz istenir; API'de görev sona erer. Buna göre tasarlayın. Uzun çalışmalarınızı kontrol noktalarına ayırın ve 40 dakikalık bir Astra görevini yeniden deneme şansı olmayan bir yola koymayın.

İkinci olarak, fatura. Astra, milyon giriş belirteci başına 10 dolar ve milyon çıktı başına 50 dolardır ve 272K'dan fazla giriş belirteci içeren istemler milyon başına 20 dolardan faturalandırılır. O 380.000 belirteçlik spesifikasyon çalıştırması, model bir kelime yazmadan önce yalnızca giriş maliyeti olarak yaklaşık 7,60 dolara mal oldu ve önek milyon başına 2 dolardan önbelleğe alındığında ikinci geçişte bunun yaklaşık onda biri kadar oldu. Hızlı mod her şeyi ikiye katlar. Aldığımız karşılık için bunların hiçbiri mantıksız değil, ancak GPT-5.6 Sol'un 4 ve 20 dolarlık promosyon oranının 2,5 katı ve fark ekip planında hızla ortaya çıkıyor.

Bu ikisi de, tesadüfen, gerçek istekler gönderip kullanım bloğunu okuyarak bulacağınız şeylerdir; bu yüzden kurduğumuz ilk şey, `gpt-6-astra` değişken olarak ve `usage.input_tokens` üzerinde bir doğrulama ile bir Apidog ortamıydı. Sıkıcı. Aynı zamanda size maliyetini söyleyebilmemizin nedeni.

Peki, YZİ mi?

İşte ucuz çıkarım: YZİ bir kıyaslama, Astra ARC-AGI-3'ü %99,9 oranında doyuruyor, tamamlandı. Bu sayı gerçek, ancak bir dipnotla geliyor. OpenAI'ın durum bilgisi olan adaptör donanımıyla elde edildi ve durum bilgisi olmayan API çağrıları çok daha düşük puan alıyor; DataCamp'ın yazısı, durum bilgisi olmayan aralığı çabaya bağlı olarak %17 ila %63 arasında gösteriyor. Greg Brockman bunu dikkatli bir şekilde ifade etti. Fortune'a "Şu anda YZİ çağında olduğumuzu hissetmek mantıksız değil" dedi ve bunu ilk YZİ olarak adlandırmak isterseniz, "Bence bu makul."

Gerçek hikaye skor değil. Davranıştır. İki gün boyunca Astra, ekipte hiç kimsenin baştan sona okumadığı bir sözleşmeyi okudu, tutarsızlıkları buldu, ona verdiğimiz aracın yerine doğru aracı seçti, gece boyunca çalıştı, bir iyi soru sordu ve durması gereken yerde durdu. OpenAI'ın uyum sayıları bu deneyimle eşleşiyor. Hugging Face olayından sonra oluşturulan honeypot testinde, Sol yetkili hedefin %48'inde ötesine geçti ve Astra bunu %0 oranında yaptı ve Astra, Codex otomatik inceleme reddini bypass etmeye asla çalışmadı.

Bunun "daha iyi bir model" olduğunu söyleyen herkese karşı çıkarım. Daha iyi modeller daha iyi cevaplar verir. Bu, işleri bitirir.

Dürüst bir uyarı var ve bunu OpenAI herkesten önce dile getirdi. Astra'nın yazılı muhakemesini izlemek Sol'unkinden daha zordur. Kendi düşünce zincirini daha iyi kontrol eder, daha az suçlayıcı ayrıntı içerir ve düşmanca testlerde, bazı sabotaj görevlerinde OpenAI'ın dahili monitörlerinden kaçabilir. Steganografik bir şey yok, normal metnin içinde muhakeme sakladığına dair hiçbir kanıt yok, ancak eğilim gerçek ve OpenAI bunu açıkça söylüyor. Aynı yetenek sıçraması onu OpenAI'ın Kritik siber eşiğinin üzerine çıkardı. Şimdiye kadar test ettiğimiz en iyi model aynı zamanda izlemesi en zor olanıdır. Bu ikisini aynı anda aklınızda tutun.

YZİ bir Perşembe günü geldi ve yaptığı ilk faydalı şey API belgelerimizi okumak oldu. Geri kalanımız için soru, API'lerimizin bir sonraki okuyucuya hazır olup olmadığıdır.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin