GPT-6 Sol Latensi: 102 Detik hingga Token Pertama

GPT-6 Sol mengukur 102,15 detik ke token pertama pada 115,2 tok/detik dalam mode penalaran maksimal. Mengapa model yang murah bukanlah model yang cepat, cara mengukur TTFT dengan benar, dan empat perubahan desain yang mencegah panggilan 100 detik merusak API Anda.

Emmanuel Mumba

Emmanuel Mumba

23 September 2026

GPT-6 Sol Latensi: 102 Detik hingga Token Pertama

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Anda menukar gpt-6-astra dengan gpt-6-sol karena harga token turun dari $10 dan $50 per juta menjadi $2 dan $10. Faktur terlihat bagus. Kemudian waktu respons p95 Anda melampaui dua menit, penyeimbang beban Anda mulai mengembalikan batas waktu gateway, dan dukungan pelanggan penuh dengan orang-orang yang bertanya mengapa halaman macet.

Tidak ada yang rusak. Anda mengubah bentuk beban kerja, bukan hanya harganya.

Artificial Analysis mengukur GPT-6 Sol pada 115.2 token keluaran per detik dengan waktu hingga token pertama 102.15 detik. GPT-6 Luna mengukur 153.9 token keluaran per detik pada 124.23 detik hingga token pertama. Kedua angka ini membawa peringatan berat, yang merupakan paruh pertama artikel ini. Paruh kedua adalah apa yang harus dilakukan tentangnya: cara mengukur latensi token pertama secara jujur pada beban kerja Anda sendiri, dan empat perubahan desain yang mencegah model 100 detik menjatuhkan API Anda bersamanya.

Untuk konteks yang lebih luas dari tiga peluncuran teknologi mutakhir dalam dua hari, lihat perang harga model September 2026.

tombol

Angka tersebut, dan segala sesuatu yang salah dengan mengutipnya

Baca kolom peringatan sebelum kolom angka.

Pengukuran GPT-6 Sol GPT-6 Luna Peringatan
Waktu hingga token pertama 102.15s 124.23s Pihak ketiga, varian penalaran “maks”
Kecepatan keluaran 115.2 tok/s 153.9 tok/s Pihak ketiga, varian penalaran “maks”
Harga masukan per juta $2 $0.10 OpenAI
Harga keluaran per juta $10 $0.50 OpenAI
Jendela konteks 872,000 1,000,000 OpenAI

Tiga hal yang kolom tersebut sampaikan kepada Anda.

Ini adalah angka-angka dari Artificial Analysis, bukan OpenAI. OpenAI menerbitkan harga, konteks, ketersediaan, dan sejumlah skor benchmark saat peluncuran. Ia tidak menerbitkan angka latensi dalam materi yang kami baca. Jadi 102.15 detik adalah pihak ketiga yang menjalankan alat pengujiannya sendiri di jaringannya sendiri, dan Anda harus memperlakukannya sebagai panduan daripada sebagai spesifikasi. Tandai di dokumen Anda sendiri seperti yang kami tandai di sini.

Mereka menggambarkan varian penalaran “maks”. Label upaya muncul di seluruh tabel benchmark kedua vendor saat peluncuran: rendah, sedang, tinggi, xhigh, maks. Maks adalah puncak dari tangga itu, dan upaya penalaran adalah pengungkit terbesar untuk latensi token pertama. Pengukuran konfigurasi paling lambat bukanlah pengukuran konfigurasi yang akan Anda jalankan dalam produksi.

Ini adalah pengukuran titik akhir satu penyedia pada satu waktu. Kapasitas penyajian, perutean, dan kedalaman antrean bergerak. Angka minggu peluncuran yang diambil saat lonjakan lalu lintas adalah skenario terburuk yang menyamar sebagai konstanta.

Yang bertahan dari ketiga peringatan ini adalah arahnya, dan arahnya adalah inti dari artikel ini. Model murah bukanlah model cepat. Sol berharga seperlima dari Astra per token dan Luna berharga seperdua puluh dari Sol, dan tidak satu pun dari diskon tersebut memberi Anda byte pertama yang lebih cepat. Pada pengukuran ini, model termurah dalam keluarga adalah yang paling lambat untuk memulai.

Waktu hingga token pertama adalah nama yang salah untuk apa yang Anda ukur

Pada model non-penalaran, waktu hingga token pertama kira-kira adalah jaringan ditambah antrean ditambah prefill. Ini berskala dengan panjang prompt dan berakhir dalam ratusan milidetik.

Pada model penalaran, ini adalah kuantitas yang berbeda dengan label yang sama. Model melakukan pemikirannya sebelum mengeluarkan apa pun yang Anda minta, sehingga celah sebelum token terlihat pertama berisi seluruh fase penalaran. Fase itu tidak memiliki hubungan dengan panjang prompt Anda. Ini memiliki hubungan dengan seberapa sulit model memutuskan masalah tersebut.

Dua konsekuensi mengikuti, dan keduanya menggigit dalam produksi.

Yang pertama adalah bahwa tingkat token yang cepat tidak menyelamatkan Anda. Sol mengeluarkan 115.2 token per detik setelah dimulai, yang cepat. Itu tidak terlalu penting, karena hampir seluruh waktu jam dinding dihabiskan sebelum token pertama.

Panjang keluaran Waktu hingga token pertama Waktu generasi Total Bagian waktu yang dihabiskan menunggu
500 token 102.15s 4.3s 106.5s 96%
2,000 token 102.15s 17.4s 119.5s 85%
8,000 token 102.15s 69.4s 171.6s 60%

Waktu generasi adalah panjang keluaran dibagi 115.2 token per detik, jadi tabel itu adalah perhitungan aritmatika dari dua angka yang diukur daripada pengukuran baru. Mempersingkat respons Anda hampir tidak mengubah total. Memangkas jawaban panjang dari 2.000 token menjadi 500 menghemat tiga belas detik dari panggilan dua menit.

Konsekuensi kedua adalah bahwa peringkat berbalik tergantung pada panjang respons. Luna memiliki tingkat token yang lebih cepat dan permulaan yang lebih lambat. Jalankan kedua garis itu satu sama lain dan mereka berpotongan pada sekitar 10.100 token keluaran: di bawah itu, Sol selesai lebih dulu meskipun menghasilkan lebih lambat, dan di atas itu tingkat Luna akhirnya membayar untuk penantiannya yang lebih lama. Hampir tidak ada yang Anda sajikan kepada pengguna adalah respons 10.000 token, jadi untuk sebagian besar beban kerja, model yang memulai lebih lambat hanyalah model yang lebih lambat.

Apa yang rusak lebih dulu

Kegagalan jarang terjadi pada panggilan model itu sendiri. Ini adalah segala sesuatu di sekitarnya yang diatur untuk API yang cepat.

Batas waktu idle (Idle timeouts). Penyeimbang beban, proxy terbalik, gateway API, dan platform tanpa server semuanya membatasi berapa lama koneksi dapat terdiam tanpa aliran byte. Banyak dari pengaturan default tersebut berada jauh di bawah dua menit. Jangan percaya angka yang Anda baca di postingan blog, termasuk yang ini: pergi dan baca konfigurasi Anda sendiri. Perbaikan biasanya satu arahan, seperti proxy_read_timeout pada nginx, ditambah pengaturan yang cocok pada setiap hop di depannya, termasuk batas waktu SDK klien itu sendiri.

Upaya ulang (Retries). Kebijakan upaya ulang yang masuk akal pada 300 milidetik berbahaya pada 100 detik. Tiga percobaan dengan backoff kini menjadi permintaan lima menit, dan ledakan upaya ulang selama periode lambat menempatkan lebih banyak pekerjaan bersamaan pada titik akhir yang persis sama yang sudah berjuang. Batasi percobaan, pertahankan pemutus sirkuit, dan buat setiap panggilan idempoten sehingga upaya ulang tidak dapat menggandakan tagihan atau menggandakan penulisan.

Konkurensi, yang sering dilewatkan orang. Hukum Little mengatakan jumlah permintaan yang sedang berjalan sama dengan laju kedatangan dikalikan waktu dalam sistem. Pada satu permintaan per detik dan panggilan 120 detik, Anda membutuhkan 120 permintaan bersamaan yang sedang berjalan hanya untuk mengimbangi. Koneksi-koneksi tersebut menempati soket, thread, atau pemanggilan fungsi selama dua menit masing-masing, dan tidak ada yang muncul di tagihan token. Model yang murah per panggilan masih bisa mahal per detik kapasitas yang dipertahankan.

Antarmuka pengguna. Tidak ada spinner yang bertahan 102 detik. Jika fase penalaran berada di jalur permintaan sinkron Anda, perbaikannya bersifat arsitektural, bukan kosmetik.

Cara mengukurnya pada beban kerja Anda sendiri

Angka vendor dan pihak ketiga adalah hipotesis awal. Prompt Anda, wilayah Anda, pengaturan upaya Anda, dan pola lalu lintas Anda yang menentukan angka sebenarnya.

Mulailah dengan tampilan tingkat transportasi, yang hanya membutuhkan satu perintah:

curl -N -s -o /dev/null \
  -w 'dns=%{time_namelookup} connect=%{time_connect} first_byte=%{time_starttransfer} total=%{time_total}\n' \
  https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"gpt-6-sol","input":"Summarise this OpenAPI operation.","stream":true}'

Kemudian baca first_byte dengan kecurigaan. Pada titik akhir streaming, byte pertama biasanya adalah peristiwa pembukaan aliran, bukan token konten, jadi time_starttransfer mengukur kapan server mulai berbicara daripada kapan model mulai menjawab. Celah itu persis yang ingin Anda ukur, itulah mengapa alat pengujian yang naif melaporkan angka yang menyenangkan.

Mengukur waktu delta konten pertama adalah pengukuran yang penting:

import time
from openai import OpenAI

client = OpenAI(timeout=600)

t0 = time.perf_counter()
first_content = None

with client.responses.stream(
    model="gpt-6-sol",
    input=PROMPT,
    reasoning={"effort": "low"},
) as stream:
    for event in stream:
        if event.type == "response.output_text.delta" and first_content is None:
            first_content = time.perf_counter() - t0
    total = time.perf_counter() - t0

print(f"ttft={first_content:.2f}s total={total:.2f}s")

Nama bidang dan peristiwa dalam cuplikan ini berasal dari bentuk API OpenAI saat ini daripada dari pengumuman peluncuran GPT-6, jadi periksalah dengan referensi sebelum Anda menerapkannya. Disiplin pengukuranlah yang dibawa: catat waktu hingga token konten pertama dan total waktu sebagai metrik terpisah, simpan per model dan per tingkat upaya, dan laporkan p95 daripada rata-rata. Latensi token pertama pada model penalaran memiliki "ekor panjang", dan rata-rata menyembunyikan permintaan yang justru kehabisan waktu.

Jalankan itu sebagai pemeriksaan terjadwal daripada sekali jalan. Simpan permintaan streaming di Apidog, assert pada waktu respons, dan jalankan skenario sesuai jadwal di CI sehingga regresi dari sisi penyedia atau perubahan tingkat upaya muncul sebagai tes yang gagal alih-alih sebagai tiket dukungan. Proyek yang sama memberikan cara bagi pekerjaan frontend untuk menghindari penantian: arahkan klien ke mock Apidog dari titik akhir Anda sendiri sehingga tidak ada yang terblokir selama dua menit per iterasi saat integrasi sebenarnya masih dibangun. Jika Anda menginginkan dasar-dasar di balik metrik, panduan kami tentang latensi API mencakup kosakata.

Empat perubahan yang benar-benar membantu

Pisahkan panggilan penalaran dari jalur sinkron. Terima permintaan, kembalikan 202 Accepted dengan ID pekerjaan segera, dan kirimkan hasilnya melalui polling atau webhook. Ini adalah satu-satunya perubahan yang membuat setiap masalah lain menjadi lebih kecil, karena 102 detik berhenti hidup di dalam permintaan HTTP yang ditunggu oleh sesuatu di hulu.

Rute berdasarkan upaya, bukan model. Angka-angka yang diukur menggambarkan penalaran maksimal. Sebagian besar lalu lintas tidak membutuhkannya. Klasifikasikan tugas terlebih dahulu, kirim mayoritas rutin dengan upaya rendah, dan cadangkan pengaturan yang mahal untuk kasus-kasus yang memang layak. Benchmark peluncuran OpenAI sendiri dilaporkan per tingkat upaya untuk alasan ini, sehingga pengaturan tersebut adalah keputusan desain kelas satu daripada detail penyetelan.

Streaming, dan tunjukkan penantiannya secara jujur. Jika ada manusia yang mengamati, streaming responsnya dan katakan apa yang sedang terjadi. Status kemajuan yang mencerminkan kenyataan lebih baik daripada spinner yang menyiratkan ada sesuatu yang salah.

Anggarkan waktu jam dinding secara terpisah dari token. Biaya per tugas dan latensi per tugas adalah sumbu independen, dan peluncuran di bulan September menggeser salah satunya dengan kuat. Pertahankan anggaran latensi per titik akhir di samping anggaran biaya, dan perlakukan regresi pada salah satunya sebagai penghambat rilis.

Satu hal yang tidak boleh diasumsikan: rilis caching prompt GPT-6 memotong harga pembacaan input cache sebesar 90% dan meningkatkan tingkat hit, dan itu adalah penghematan yang nyata. Tidak ada vendor yang menerbitkan klaim latensi untuk itu, jadi perlakukan setiap peningkatan token pertama dari caching sebagai sesuatu yang harus diukur daripada sesuatu yang harus direncanakan.

Model murah bukanlah model cepat

GPT-6 Sol dengan harga $2 dan $10 per juta token adalah pergerakan harga yang tulus, dan hasil benchmark di baliknya sangat kuat. Tidak ada satu pun dari itu yang membuatnya cepat dimulai. Pada satu-satunya pengukuran latensi publik yang tersedia, model yang menghemat 80% dari harga token Astra membutuhkan lebih dari satu setengah menit sebelum mengeluarkan kata, dan saudaranya yang lebih murah membutuhkan waktu lebih lama lagi.

Harga ada di faktur. Latensi ada di arsitektur Anda. Ukur yang kedua sendiri, dengan alat pengujian yang mengukur waktu token konten pertama daripada byte pertama, sebelum Anda mempromosikan model yang lebih murah ke jalur permintaan yang dibangun untuk yang lebih cepat.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.