Benchmark GPT-5.6 Sol: Apakah Benar Layak Ditunggu?

Tolok ukur GPT-5.6 Sol diungkap: skor Terminal-Bench, Agent's Last Exam, dan ExploitBench dibandingkan GPT-5.5, ditambah putusan jujur apakah menunggu atau melanjutkan.

Ashley Innocent

Ashley Innocent

26 June 2026

Benchmark GPT-5.6 Sol: Apakah Benar Layak Ditunggu?

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

OpenAI mengumumkan GPT-5.6 Sol pada 26 Juni 2026 dengan sejumlah angka tolok ukur yang terlihat seperti rekor bersih. Terminal-Bench yang terdepan, satu-satunya model yang melewati 50% di Agent’s Last Exam dalam mode kode, evaluasi siber yang menyamai pesaing teratas pada sepertiga token. Hal yang perlu Anda baca terlebih dahulu: Anda tidak dapat menjalankan semua itu. Sol dikirimkan sebagai pratinjau terbatas yang diatur pemerintah melalui OpenAI API dan Codex saja, dibatasi untuk sekitar 20 mitra yang namanya disetujui secara individual oleh pemerintah AS. Ini tidak ada di ChatGPT, dan tidak ada yang perlu didaftarkan hari ini.

Jadi tolok ukur ini bukan saran pembelian. Mereka menjawab satu pertanyaan, dan hanya satu: apakah GPT-5.6 Sol layak ditunggu, atau haruskah Anda melanjutkan dengan model yang sudah bisa Anda gunakan? Itulah yang dijelaskan dalam tulisan ini. Kami akan menguraikan apa yang diukur oleh setiap tolok ukur utama, menempatkan setiap angka di samping GPT-5.5 dan Claude Mythos 5 yang sudah Anda miliki, dan diakhiri dengan putusan jujur apakah harus menunggu atau melanjutkan. Setiap angka di sini berasal dari kerangka kerja OpenAI sendiri dan liputan sekunder awal, bukan dari pengujian yang kami jalankan.

tombol

Inti

Baca ini sebelum Anda membaca skornya

Tolok ukur memberi tahu Anda apa yang bisa dilakukan model. Mereka tidak memberi tahu Anda apakah Anda bisa menggunakannya. Untuk GPT-5.6 Sol, itu adalah dua fakta yang berbeda, dan yang kedua mendominasi saat ini.

Peluncurannya dibatasi oleh administrasi AS di bawah perintah eksekutif 2 Juni 2026 yang menetapkan tolok ukur dan penilaian untuk model AI baru. OpenAI menyetujui sebagai langkah sementara. Dalam kata-katanya, yang dikutip oleh MacRumors, "Kami mengambil langkah jangka pendek ini karena kami percaya ini adalah jalan terkuat menuju ketersediaan yang lebih luas dalam beberapa minggu mendatang." OpenAI mengatakan ketersediaan umum di ChatGPT, Codex, dan API akan datang dalam beberapa minggu mendatang. Sampai saat itu, skor-skor tersebut adalah pratinjau dari sesuatu yang tidak dapat Anda beli.

Pembingkaian itu penting untuk bagaimana Anda membaca sisa artikel ini. Keunggulan Terminal-Bench 4 poin signifikan jika Anda dapat menerapkannya. Itu adalah alasan untuk terus mengamati, bukan untuk menghentikan peta jalan Anda, jika Anda tidak bisa. Jika Anda ingin gambaran lengkap tentang Sol itu apa dan mengapa terkunci, penjelasan GPT-5.6 Sol kami mencakup keluarga dan batasan tersebut. Pengidentifikasi model API yang tepat belum dipublikasikan, jadi tidak ada yang bisa dihubungkan meskipun Anda mau.

Terminal-Bench 2.1: angka utama

Terminal-Bench mengukur seberapa baik model menyelesaikan tugas nyata di terminal: mengedit file, menjalankan perintah, merantai alat, pulih dari kesalahan. Ini adalah proksi publik terdekat untuk "bisakah ini melakukan pekerjaan pengkodean agentik dari ujung ke ujung" daripada menjawab satu prompt. Itulah mengapa OpenAI mengunggulkannya.

Menurut OpenAI dan liputan awal, pada Terminal-Bench 2.1 konfigurasi "ultra" baru, Sol Ultra, mencetak sekitar 91,91%, dengan Sol standar sekitar 88,8%. Basis yang sudah Anda miliki untuk konteks: Claude Mythos 5 sekitar 88% dan GPT-5.5 sekitar 83,4%. Jika angka-angka itu bertahan, mode standar Sol secara kasar setara dengan Mythos 5, dan Sol Ultra unggul beberapa poin dari yang lain.

Bagian "ultra" berperan besar dalam skor teratas itu. Menurut pengumuman OpenAI, mode ultra "melampaui satu agen dengan memanfaatkan subagen untuk mempercepat pekerjaan kompleks." Jadi 91,91% itu bukan satu model yang berpikir lebih keras; itu adalah satu model yang menghasilkan pembantu. Itu adalah perubahan kemampuan yang sebenarnya, dan itu juga berarti angka utama tidak dapat dipetakan secara bersih ke satu panggilan GPT-5.5. Untuk perbandingan langsung pada model yang dapat Anda jalankan hari ini, perbandingan Claude Opus 4.8 vs GPT-5.5 vs Gemini 3.5 kami adalah referensi yang lebih baik selama Sol tetap terkunci.

Agent’s Last Exam: klaim "satu-satunya model di atas 50%"

Agent’s Last Exam adalah tolok ukur agentik yang sulit yang dibangun untuk menahan saturasi: tugas multi-langkah di mana model harus merencanakan, menggunakan alat, dan menindaklanjuti tanpa manusia mengarahkannya kembali ke jalur. Mode kode adalah segmen yang secara khusus menekankan pekerjaan perangkat lunak.

Menurut liputan awal, GPT-5.6 Sol mencetak sekitar 50,9% dalam mode kode dan digambarkan sebagai satu-satunya model di atas 50%. Pembingkaian itu adalah intinya. Pada tolok ukur di mana sebagian besar model frontier berada di angka 40-an, melewati setengah adalah jenis lompatan yang ingin dijadikan jangkar peluncuran oleh OpenAI.

Bacalah dengan kehati-hatian yang sama seperti angka Terminal-Bench. 50,9% adalah klaim dari pelaporan sekunder, bukan angka yang kami ukur, dan "satu-satunya model di atas 50%" adalah gambaran sesaat yang akan didorong oleh laboratorium lain dalam beberapa minggu. Pembacaan yang jujur: jika pekerjaan Anda benar-benar agentik, pengkodean jangka panjang di mana model harus mendorong tugas hingga selesai, ini adalah tolok ukur yang mendukung menunggu. Jika pekerjaan Anda adalah pengkodean permintaan-dan-respons yang lebih pendek, celah di atas model yang sudah Anda jalankan lebih kecil dari yang disiratkan oleh judul berita.

ExploitBench: efisiensi di atas skor mentah

Tolok ukur ketiga adalah yang paling menarik untuk panggilan tunggu-atau-lanjut, karena ini sebenarnya bukan tentang skor yang lebih besar. ExploitBench (dan ExploitGym yang terkait) mengukur kemampuan keamanan siber. Sol disetel untuk menemukan kerentanan perangkat lunak dan menulis perbaikan sambil menahan upaya untuk membuat rantai eksploitasi penuh. Ini adalah postur defensif, bukan model peretasan ofensif, dan OpenAI menyebutnya sebagai "tumpukan keamanan paling tangguh hingga saat ini."

Menurut liputan awal, pada ExploitBench Sol bersaing dengan Anthropic's Mythos Preview sambil menggunakan sekitar sepertiga token output. Pola yang sama muncul di sisi ilmu pengetahuan: pada GeneBench v1, OpenAI melaporkan peningkatan dibandingkan GPT-5.5 menggunakan lebih sedikit token.

Kisah token adalah kisah dengan konsekuensi anggaran yang nyata. Jika Sol mencapai standar kualitas yang serupa dengan sepertiga token output, biaya efektif per tugas yang diselesaikan turun jauh di bawah apa yang disarankan oleh daftar harga $5 input / $30 output per juta token di atas kertas. Itulah argumen efisiensi untuk menunggu: bukan karena Sol lebih pintar pada setiap prompt, tetapi karena Sol mungkin mencapai jawaban yang sama dengan biaya lebih murah pada beban kerja yang disetel untuknya. Kartu sistem keamanan penerapan OpenAI adalah tempat kerangka kerja keamanan dan siber didokumentasikan, dan layak dibaca sebelum Anda menganggap angka siber apa pun sebagai penopang.

Cara membaca skor ini terhadap dasar Anda

Gabungkan ketiga tolok ukur dan sebuah bentuk muncul. Kasus Sol paling kuat pada pekerjaan yang panjang, agentik, dan banyak alat: tugas terminal, pengkodean multi-langkah, pembersihan keamanan defensif. Pada hal-hal tersebut, Sol mengklaim beberapa poin keunggulan di atas Mythos 5 dan celah yang lebih lebar di atas GPT-5.5, ditambah keunggulan efisiensi token.

Apa yang tidak ditunjukkan oleh tolok ukur sama pentingnya. Tidak ada batasan token output maksimum yang dipublikasikan, tidak ada batas pengetahuan yang disebutkan, tidak ada daftar modalitas yang dikonfirmasi. Jendela konteks dilaporkan sekitar 1,5M token oleh satu media dan "tidak disebutkan" oleh yang lain, jadi anggap saja belum dikonfirmasi.

Putusan: tunggu atau lanjutkan

Ini adalah penilaian jujurnya.

Tunggu jika: beban kerja inti Anda adalah pengkodean agentik, sesi terminal panjang, atau keamanan defensif, dan Anda bisa menahan beberapa minggu. Keunggulan Terminal-Bench, hasil Agent’s Last Exam, dan efisiensi token ExploitBench semuanya menunjukkan profil yang persis sama. Jika beberapa poin persentase pada tugas-tugas tersebut mengubah ekonomi Anda, Sol layak diamati dengan cermat. Tunggu ketersediaan umum dan, yang lebih penting, untuk tolok ukur independen yang mengkonfirmasi atau menepis angka-angka peluncuran.

Jangan repot-repot menunggu jika: Anda membutuhkan model dalam produksi sekarang, atau pekerjaan Anda adalah pengkodean permintaan-dan-respons yang lebih pendek, obrolan, ringkasan, atau klasifikasi. Anda tidak bisa mendapatkan Sol hari ini, ID model bahkan belum dipublikasikan, dan alternatif yang bisa Anda jalankan sekarang mengisi sebagian besar celah pada pekerjaan sehari-hari. Menunggu model terkunci untuk dikirimkan sebelum Anda memperbaiki masalah yang Anda miliki hari ini adalah pilihan yang salah. Langkah yang lebih cerdas adalah memilih model frontier yang benar-benar dapat Anda gunakan; ringkasan model frontier yang dapat Anda gunakan hari ini cocok dengan setiap model untuk pekerjaan yang digembar-gemborkan Sol.

Satu catatan jujur lagi: bahkan ketika GA tiba, gelombang pertama akan menjadi GPT-5.6 di seluruh jajaran tier, termasuk Terra dan Luna, bukan hanya Sol. Terra diposisikan kira-kira 2x lebih murah daripada GPT-5.5 dengan kinerja serupa, yang merupakan tier yang akan digunakan sebagian besar tim. Jadi "menunggu Sol" mungkin berarti menunggu untuk memilih tier yang tepat, dan itu adalah keputusan yang lebih tenang daripada yang disiratkan oleh judul berita tolok ukur.

Di mana Apidog cocok saat Anda menunggu

Anda belum bisa menguji Sol. Anda dapat menguji semua yang ingin Anda gunakan sementara itu. Mythos 5, GPT-5.5, Gemini, dan sisanya semuanya mengekspos API yang kompatibel dengan OpenAI atau HTTP standar, dan Anda dapat menggerakkannya, menegaskan responsnya, dan membandingkan perilaku di Apidog hari ini. Siapkan permintaan, arahkan ke endpoint setiap model, dan Anda memiliki alat uji yang dapat diulang untuk keputusan yang dibahas artikel ini.

Alat uji itu juga kesiapan hari pertama Anda untuk Sol. Pada hari akses pratinjau Anda tiba, atau GA dibuka, Anda menukar endpoint dan ID model dan menjalankan skenario yang sama yang sudah Anda buat. Tidak ada alat baru, tidak ada keributan. Unduh Apidog untuk membangun tes-tes tersebut terhadap model yang dapat Anda gunakan sekarang, sehingga Anda siap saat yang terkunci dibuka.

Kesimpulan

Tolok ukur GPT-5.6 Sol kuat, secara sempit pada pekerjaan agentik dan keamanan yang disetel untuknya, dan itu masih hanya klaim di bawah batasan pemerintah yang tidak dapat Anda lewati hari ini. Tunggu jika profil frontier itu adalah pekerjaan Anda dan Anda bisa menahan beberapa minggu. Jika tidak, lanjutkan dengan model yang dapat Anda kirimkan sekarang dan tinjau kembali ketika Sol mendapatkan angka independen dan endpoint publik.

Bangun alat evaluasi Anda terhadap model yang dapat Anda gunakan hari ini di Apidog, sehingga Anda siap untuk menguji Sol pada hari akses Anda tiba.

tombol

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.