Jika Anda memindahkan beban kerja agen ke GPT-6 Astra pada awal September, Anda kini memiliki tiga minggu tagihan dan Anda sudah mengetahui bentuk masalahnya. Astra menagih $10 per juta token input dan $50 per juta token output. Sebuah loop yang berjalan lama dengan system prompt yang besar dan skema alat yang terpasang akan menghabiskan biaya lebih cepat dari perkiraan spreadsheet mana pun.
Pada 22 September, OpenAI meluncurkan GPT-6 Sol dengan harga $2 dan $10. Keluarga model yang sama, antarmuka API yang sama, seperlima harga pada setiap item tagihan.
Inilah migrasinya. Apa yang berubah dalam kode Anda, hampir tidak ada. Apa yang berubah dalam tagihan Anda, segalanya. Dan bagian yang sebagian besar liputan hari peluncuran lewatkan: OpenAI masih mengatakan Astra adalah model yang lebih baik, dan perbandingan langsung antara keduanya yang dipublikasikan tidak seperti yang terlihat.
TL;DR
gpt-6-astrakegpt-6-solhanyalah pertukaran string model untuk sebagian besar pemanggil. Jendela konteks, output maksimum, endpoint, alat bawaan, fitur yang didukung, dan tingkatan batas tarif adalah identik.- Setiap tarif turun tepat 5x: input $10 menjadi $2, input cache $1 menjadi $0.20, penulisan cache $12.50 menjadi $2.50, output $50 menjadi $10. Tagihan Anda dibagi lima terlepas dari campuran token.
- Sol menambahkan upaya penalaran
none. Ini juga membatasi pemanggilan fungsi Chat Completions kereasoning_effort: "none", satu-satunya perubahan yang dapat merusak integrasi yang berfungsi. - Batas pengetahuan Sol adalah 20 April 2026. Batas pengetahuan Astra adalah 30 April 2026.
- OpenAI mengatakan Astra "terus menjadi model terbaik kami secara keseluruhan." Benchmark Sol-versus-Astra yang dipublikasikan menjalankan Astra pada
lowdibandingkan Sol padaxhigh, jadi ini mengukur efisiensi biaya, bukan batas kemampuan.
Tabel harga
Kedua set tarif berasal dari halaman model OpenAI, gpt-6-astra dan gpt-6-sol, dibaca pada 23 September 2026.
| Metrik, per 1 Juta token | GPT-6 Astra | GPT-6 Sol | Perubahan |
|---|---|---|---|
| Input | $10 | $2 | 5x lebih murah |
| Input cache | $1 | $0.20 | 5x lebih murah |
| Penulisan cache | $12.50 | $2.50 | 5x lebih murah |
| Output | $50 | $10 | 5x lebih murah |
Pengubah tagihan cocok pada kedua model. Prompt lebih dari 272K token input akan dikenakan biaya 2x tarif input dan cache serta 1.5x output untuk seluruh permintaan. Batch dan Flex adalah setengah harga. Mode cepat adalah dua kali lipat, dan di Astra tidak ada SLA latensi.

Karena keempat tarif turun dengan faktor yang sama, Anda tidak perlu memodelkan campuran token Anda untuk memprediksi penghematan. Ambil contoh beban kerja agen yang konkret: 10.000 permintaan per hari, masing-masing dengan prefiks cache 30.000 token, 10.000 token input baru, dan 3.000 token output.
| Komponen | Token harian | Astra | Sol |
|---|---|---|---|
| Input cache | 300M | $300 | $60 |
| Input baru | 100M | $1,000 | $200 |
| Output | 30M | $1,500 | $300 |
| Total | $2,800 | $560 |
Geser campuran ke arah output, geser ke arah cache, jalankan pada konteks 272K dan bayar pengali prompt panjang: rasionya tetap lima.
Sebagai gambaran mengapa hal itu penting, OpenAI melaporkan bahwa rata-rata peneliti mereka sendiri menghabiskan lebih dari $600 sehari untuk agen pengkodean, dengan persentil ke-90 sebesar $7.000 sehari. Bagi angka-angka itu dengan lima dan jumlah eksperimen yang mampu dilakukan oleh sebuah tim berubah. Konteks yang lebih luas untuk kedua peluncuran ada di analisis perang harga model kami September 2026.
Satu kualifikasi yang perlu diingat: OpenAI menjelaskan Sol sebagai 50% lebih murah daripada GPT-5.6, dan perbandingannya adalah terhadap harga promosi GPT-5.6, yang merupakan kata OpenAI sendiri. Terhadap tarif daftar GPT-5.6 yang kami dokumentasikan saat itu di postingan harga GPT-5.6 kami, penurunannya lebih besar. Terhadap Astra, ini adalah penurunan langsung 5x.
Apa yang tetap persis sama
Bagian ini yang membuat migrasi murah.
| GPT-6 Astra | GPT-6 Sol | |
|---|---|---|
| ID Model | gpt-6-astra |
gpt-6-sol |
| Jendela konteks | 1.050.000 | 1.050.000 |
| Token input maksimum | 922.000 | 922.000 |
| Token output maksimum | 128.000 | 128.000 |
| Modalitas | teks, gambar masuk; teks keluar | teks, gambar masuk; teks keluar |
| Endpoint | Chat Completions, Responses, Batch | Chat Completions, Responses, Batch |
| Tidak didukung | Realtime, Asisten, fine-tuning, embedding, audio | sama |
| Alat bawaan | pencarian web, pencarian file, pembuatan gambar, juru bahasa kode, shell host, penerapan patch, keterampilan, penggunaan komputer, MCP, pencarian alat | daftar yang sama |
| Fitur | streaming, output terstruktur, pemanggilan fungsi, pencarian file, input gambar, pencarian web, prompt caching | daftar yang sama |
| Batas tarif Tier 5 | 15.000 RPM, 40M TPM | 15.000 RPM, 40M TPM |
| Snapshot | gpt-6-astra |
gpt-6-sol |
Jendela konteks adalah intinya. Sol bukanlah model konteks yang lebih pendek: ia membawa jendela 1.050.000 token yang sama dan batas input 922.000 token yang sama dengan Astra. Tidak ada yang perlu diubah dari strategi pemotongan, anggaran pengambilan, atau pemadatan Anda.
Apa yang sebenarnya berubah dalam kode Anda
Empat hal, dalam urutan kemungkinan masalah yang akan muncul.
1. Pemanggilan fungsi Chat Completions. Pada Astra, Chat Completions berfungsi dan pemanggilan alat memerlukan API Responses. Pada Sol, Chat Completions mendukung pemanggilan fungsi hanya ketika reasoning_effort adalah "none". Jika Anda memanggil alat melalui Chat Completions dengan upaya lain, permintaan itu berhenti melakukan apa yang sebelumnya dilakukannya. Panduan GPT-6 milik OpenAI menyarankan untuk menggunakan Responses untuk penalaran dengan alat. Jika Anda sudah menggunakan Responses, hal ini tidak merugikan Anda.
2. Tingkat upaya none. Astra mendukung low hingga max. Sol mendukung semua itu ditambah none, yang merupakan tuas yang membuatnya layak untuk pekerjaan klasifikasi dan ekstraksi di mana token penalaran murni adalah overhead. Default pada keduanya adalah medium.
3. Batas pengetahuan. Astra dilatih hingga 30 April 2026, Sol hingga 20 April 2026. Sepuluh hari itu kecil, tetapi jika sebuah prompt mengasumsikan pengetahuan dari akhir April, uji asumsinya.
4. Parameter yang tidak didukung. Kapan pun upaya penalaran bukan none, temperature, top_p, dan top_logprobs harus tidak ada, dan Chat Completions juga menghilangkan logprobs. Astra memberlakukan aturan yang sama, jadi integrasi Astra yang bersih sudah mematuhinya. Ini hanya penting jika Anda beralih ke reasoning_effort: "none" di Sol dan berpikir untuk mengembalikan temperature.
Berikut adalah sebelum dan sesudah untuk panggilan Responses yang umum. Perbedaannya hanya satu baris.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
- model="gpt-6-astra",
+ model="gpt-6-sol",
reasoning={"effort": "xhigh"},
tools=[{"type": "function", "name": "run_api_test", "parameters": {...}}],
input=[
{"role": "developer", "content": "You are a senior API engineer. Bias towards action."},
{"role": "user", "content": "Read this OpenAPI operation and propose three negative test cases."},
],
)
Perhatikan tingkat upaya dalam contoh itu. Pindah ke Sol dan mempertahankan upaya yang sama bukanlah migrasi yang menarik. Pindah ke Sol dan menaikkan upaya naik, karena Anda memiliki anggaran lima kali lipat untuk dihabiskan pada token penalaran untuk uang yang sama.
Apa yang Anda korbankan
Jujur tentang bagian ini, karena angka peluncuran mudah disalahpahami.
OpenAI mengatakan Astra masih merupakan model yang lebih baik. Postingan peluncuran menyatakan bahwa Astra "terus menjadi model terbaik kami secara keseluruhan." Itu adalah pernyataan vendor sendiri tentang rilis barunya, dan itu adalah kalimat yang perlu dikutip kepada siapa pun yang mengatakan bahwa Sol menggantikan Astra.
Perbandingan langsung yang dipublikasikan bukanlah perbandingan kemampuan. Pada AutomationBench 1.0.6, Sol pada xhigh mencetak 33.2% dengan $0.27 per tugas, dan Astra pada low mencetak 30.3% dengan biaya 3.9 kali lipat per tugas dari Sol. Perhatikan tingkat usahanya. Sol diatur sepenuhnya ke atas, Astra diatur sepenuhnya ke bawah. Apa yang ditunjukkan oleh pasangan itu adalah bahwa batas atas Sol melampaui batas bawah Astra dengan sekitar seperempat biaya per tugas, yang merupakan hasil nyata dan berguna. Ini tidak mengatakan apa-apa tentang Sol pada xhigh dibandingkan Astra pada max. Tidak ada angka yang dipublikasikan yang mencakup perbandingan itu. Jika beban kerja Anda adalah salah satu di mana Astra dengan upaya tinggi adalah hal yang akhirnya membuatnya berhasil, Sol adalah uji coba, bukan pengganti.
Latensi pada tingkat tertinggi. Artificial Analysis mengukur varian penalaran maksimum GPT-6 Sol pada 115.2 token output per detik dengan waktu hingga token pertama 102.15 detik. Angka itu adalah pihak ketiga, bukan dari OpenAI, dan itu secara khusus menjelaskan varian max, jadi tidak memberi tahu Anda apa yang dilakukan medium atau none. Anggap itu sebagai peringatan bahwa model murah tidak secara otomatis menjadi model cepat pada upaya tinggi, dan ukur tingkat upaya Anda sendiri daripada mewarisi angkanya.
Ketersediaan. Sol mencapai ChatGPT Work dan Codex untuk pengguna Plus, Pro, Business, Enterprise, dan Edu, dan belum ada di Chat. API sudah siap; antarmuka Chat belum.
Untuk apa yang dilakukan Astra yang membenarkan untuk tetap menyimpannya di suatu tempat dalam tumpukan, uji coba langsung dua hari kami, tulisan penggunaan komputer, dan penjelasan ambang batas siber kritis semuanya berlaku, dan lembar spesifikasi lengkap ada di panduan API GPT-6 Astra kami.
Putuskan dengan permintaan Anda sendiri, bukan dengan benchmark
AutomationBench tidak menjalankan prompt Anda. Satu-satunya perbandingan yang menyelesaikan migrasi adalah kumpulan permintaan yang sama, dikirim ke kedua ID model, dinilai berdasarkan kriteria Anda sendiri. Siapkan sekali dan itu akan membayar sendiri pada setiap peluncuran di masa mendatang. Di Apidog, letakkan ID model dalam variabel lingkungan, simpan permintaan sekali, dan ganti lingkungan untuk menargetkannya kembali:
{
"model": "{{MODEL_ID}}",
"reasoning": { "effort": "xhigh" },
"input": [
{ "role": "user", "content": "{{TEST_PROMPT}}" }
]
}
Buat skenario pengujian dari 20 atau 30 prompt produksi nyata, tambahkan pernyataan untuk bentuk respons yang bergantung pada parser Anda (output_text ada, argumen panggilan alat valid terhadap Skema JSON Anda, tidak ada pemotongan pada max_output_tokens), lalu jalankan dua kali, sekali per lingkungan. Apidog merekam badan dan waktu yang berlalu untuk setiap permintaan, sehingga Anda mendapatkan kebenaran dan latensi secara berdampingan tanpa menulis harness. Blok usage pada setiap respons memberi Anda jumlah token untuk menilai perbandingan dengan benar.
Dua pernyataan yang patut ditambahkan untuk migrasi ini secara khusus: periksa apakah panggilan alat masih datang jika Anda menggunakan Chat Completions, dan nilai berdasarkan prompt terlama Anda daripada yang rata-rata, karena risiko latensi berada pada upaya tinggi pada input panjang.
Daftar periksa migrasi
- Pastikan Anda menggunakan Responses API di mana pun Anda memanggil alat. Jika Anda memanggil alat melalui Chat Completions, pindahkan sebelum Anda mengganti model.
- Ganti
gpt-6-astradengangpt-6-soldan biarkan semuanya tetap seperti semula untuk dijalankan pertama kali. - Jalankan kembali set regresi Anda terhadap kedua ID dan bandingkan outputnya, bukan hanya kode statusnya.
- Coba naikkan satu tingkat upaya penalaran di Sol. Anda sekarang memiliki anggaran untuk itu.
- Periksa kembali setiap prompt yang bergantung pada pengetahuan dari akhir April 2026.
- Simpan jalur Astra di balik sebuah flag untuk tugas-tugas di mana batas atas adalah yang Anda bayar.
Intinya
Astra ke Sol adalah migrasi langka di mana permukaan API tidak bergerak, jendela konteks tidak menyusut, dan harga turun dengan faktor tetap pada setiap meteran. Pekerjaan bukan pada kode. Ini adalah pada dua puluh prompt yang Anda jalankan melalui kedua model untuk mencari tahu apakah tugas tersulit Anda menggunakan kapasitas Astra atau hanya membayarnya.
Lakukan perbandingan itu sebelum Anda mengaktifkan flag, dan tetap perhatikan kalimat OpenAI sendiri saat Anda membaca hasilnya: Astra masih merupakan model terbaik mereka. Sol adalah model yang mampu Anda biarkan berjalan.
