OpenAI mengubur bagian paling menarik dari peluncuran GPT-5.6 Sol di balik berita tentang batasan pemerintah. Bersamaan dengan keluarga model baru ini, OpenAI meluncurkan dua kontrol penalaran baru: upaya penalaran "maks" yang memberikan Sol waktu paling banyak untuk berpikir, dan mode "ultra" yang, menurut OpenAI, "melampaui satu agen dengan memanfaatkan subagen untuk mempercepat pekerjaan kompleks." Yang kedua ini merupakan perubahan nyata dalam cara kerja panggilan model tunggal.
Pertama, realitas aksesnya. GPT-5.6 Sol saat ini dalam pratinjau terbatas melalui OpenAI API dan Codex saja. Belum tersedia di ChatGPT, dan dibatasi untuk sekitar 20 mitra yang namanya disetujui secara individual oleh pemerintah AS. Jadi, Anda tidak dapat mengaktifkan mode ultra hari ini kecuali Anda salah satunya. Artikel ini ditujukan bagi para pengembang yang ingin memahami perubahan apa yang dibawa oleh subagen dalam satu panggilan model terhadap desain agen, latensi, dan biaya, sehingga Anda dapat memutuskan apakah layak untuk ditunggu. OpenAI mengatakan ketersediaan umum di ChatGPT, Codex, dan API akan hadir dalam beberapa minggu mendatang.
Intinya:
- Upaya penalaran "maks" adalah versi yang lebih mendalam dari pengaturan yang sudah ada: waktu berpikir lebih banyak, satu agen, satu rangkaian pekerjaan.
- Mode "ultra" adalah hal baru: model ini memunculkan subagennya sendiri untuk memecah pekerjaan kompleks, menurut OpenAI.
- Anda belum bisa menggunakan keduanya. GPT-5.6 adalah pratinjau yang dibatasi pemerintah, hanya API dan Codex, bukan di ChatGPT.
- Output Sol dihargai $30 per 1 juta token, jadi mode ultra yang menyebar ke subagen tidak murah. Simpan untuk pekerjaan yang sulit dan dapat diparalelkan.
- Ini adalah ide orkestrator multi-agen yang sama yang dikirimkan oleh lab lain, sekarang terlipat di dalam satu panggilan model. Untuk menguji pola orkestrasi hari ini, Anda harus menggunakan model yang dapat Anda akses.
Apa yang dilakukan upaya penalaran "maks"
OpenAI sudah memungkinkan Anda menyetel seberapa keras model penalaran bekerja melalui pengaturan upaya penalaran. GPT-5.6 menambahkan tingkatan teratas baru yang disebut "maks". Setelah diatur, Sol mendapatkan waktu paling banyak untuk menalar secara mendalam sebelum memberikan jawaban.
Anggap "maks" seperti memutar kenop yang sudah Anda kenal. Model masih berjalan sebagai agen tunggal dan masih menghasilkan satu rantai penalaran. Anda membayar lebih banyak untuk penalaran tersebut, dalam token dan waktu nyata, untuk mendapatkan sedikit akurasi terakhir pada masalah yang sulit. Pertukaran ini sudah familiar: pemikiran yang lebih mendalam lebih mahal dan memakan waktu lebih lama, dan sebagian besar prompt tidak membutuhkannya. Maks adalah pengaturan yang tepat ketika satu pertanyaan sulit membutuhkan pertimbangan ekstra, seperti refactor yang halus atau rencana yang banyak melibatkan matematika. Ini tidak mengubah bentuk pekerjaan. Ini mengubah berapa lama satu pekerja menghabiskan waktu untuk itu.
Apa yang diubah mode "ultra"
Ultra adalah hal yang berbeda. Menurut OpenAI, mode ultra "melampaui satu agen dengan memanfaatkan subagen untuk mempercepat pekerjaan kompleks." Alih-alih satu model yang memecahkan masalah dalam satu rantai tunggal, model ini mengorkestrasi beberapa subagen yang menangani bagian-bagian tugas, lalu menyatukan kembali pekerjaan mereka.
Jika Anda pernah membangun sistem agen secara manual, Anda sudah melakukan ini dengan cara yang sulit. Anda menulis sebuah orkestrator. Ia menguraikan tugas menjadi subtugas, menyebarkannya ke panggilan model terpisah, kemudian mengumpulkan hasilnya dan menghasilkan jawaban akhir. Anda mengelola prompt, status, percobaan ulang, dan kode penghubung di antara setiap langkah.
Mode ultra menarik pola tersebut ke dalam panggilan model. Anda bertanya sekali. Model memutuskan bagaimana membagi pekerjaan, menjalankan subagen, dan mengembalikan hasilnya. Orkestrasi yang dulunya Anda miliki sekarang terjadi di balik satu panggilan API. Itu adalah bagian yang benar-benar baru. Untuk konteks keluarga yang lebih luas, ikhtisar GPT-5.6 Sol mencakup tingkatan, penamaan, dan mengapa keseluruhan ini dikunci di balik pratinjau pemerintah.
Apa yang diubah untuk desain agen
Pindahkan orkestrasi ke dalam model dan tiga hal berubah dalam cara Anda membangun.
- Kode penghubung yang lebih sedikit. Logika dekomposisi, fan-out, dan penggabungan yang dulunya ada di aplikasi Anda dapat berkurang. Anda menjelaskan tujuannya dan membiarkan model menangani pemecahannya. Itu berarti lebih sedikit area permukaan untuk dipelihara dan lebih sedikit tempat di mana orkestrasi Anda dapat melenceng dari perilaku model.
- Kontrol yang lebih sedikit. Sisi lainnya adalah Anda kehilangan visibilitas. Ketika Anda memiliki orkestrator, Anda melihat setiap subtugas, hasil menengah, dan percobaan ulang, dan Anda dapat mencatatnya atau mengintervensi. Dengan subagen di dalam satu panggilan, mekanisme itu menjadi tidak transparan. Anda melihat input dan output akhir, bukan percabangan di antaranya. Untuk alur kerja yang membutuhkan jejak audit, orkestrator buatan tangan masih unggul.
- Mode kegagalan yang berbeda. Sebuah agen tunggal gagal dengan cara yang biasanya dapat Anda lacak. Sebuah model yang menjalankan subagen internal gagal dengan cara yang lebih sulit untuk diatribusikan. Apakah satu subagen melenceng? Apakah langkah penggabungan menjatuhkan sesuatu? Anda tidak akan selalu bisa mengetahuinya dari luar, yang penting saat Anda men-debug agen produksi.
Ini adalah ketegangan yang sama yang melintasi setiap sistem multi-agen, yang kini dipindahkan. Untuk melihat bagaimana orkestrator khusus membingkainya, Fugu Ultra versus Fable 5 versus Mythos membahas model yang dibangun secara eksplisit sebagai orkestrator multi-agen, sebuah kontras yang berguna dengan OpenAI yang melipat ide tersebut ke dalam satu model.
Latensi dan biaya: mengapa ultra tidak gratis
Subagen bekerja secara paralel, jadi untuk tugas yang tepat, ultra dapat menyelesaikan lebih cepat daripada satu agen yang bekerja lambat melalui setiap langkah secara berurutan. Itu adalah daya tarik "mempercepat pekerjaan kompleks".
Sisi biaya adalah tempat Anda harus jujur. Sol adalah tingkatan unggulan, dan outputnya dihargai $30 per 1 juta token, dengan input $5 per 1 juta (Terra dan Luna adalah tingkatan yang lebih murah dalam keluarga yang sama). Sekarang bayangkan ultra memunculkan beberapa subagen, masing-masing menghasilkan penalaran dan token outputnya sendiri. Token-token tersebut bertambah di setiap subagen, sehingga satu panggilan ultra dapat menghabiskan jauh lebih banyak daripada satu panggilan maks pada prompt yang sama. Ultra menukar token dengan kecepatan dan kedalaman pada pekerjaan yang sulit dan dapat diparalelkan. Jika tugas Anda tidak terurai menjadi bagian-bagian independen, Anda membayar subagen yang saling menunggu atau menduplikasi upaya. Itulah kasus berlebihan.
Caching prompt meringankan tagihan. GPT-5.6 mendukung breakpoint cache eksplisit dengan masa pakai cache minimum 30 menit. Penulisan cache dikenakan biaya 1,25x tarif input tanpa cache, dan pembacaan cache mendapatkan diskon input-cache 90%. Jika subagen Anda berbagi konteks umum yang besar, seperti prompt sistem yang besar atau basis kode tetap, menyimpan cache sekali dan membacanya dengan murah di seluruh panggilan dapat menghemat banyak uang. Ini tidak mengubah biaya token output, di mana ultra menghabiskan sebagian besar.
Di mana ultra membantu, dan di mana itu berlebihan
Gunakan ultra ketika tugas terpecah menjadi bagian-bagian independen yang mendapat manfaat dari pekerjaan paralel dan di mana akurasi membenarkan pengeluaran. Bayangkan perubahan codebase besar yang menyentuh banyak file sekaligus, tugas penelitian yang menyebar ke beberapa sumber, atau pekerjaan agen yang kompleks dengan cabang paralel. Ini adalah pekerjaan yang diposisikan OpenAI untuk Sol, termasuk pekerjaan pengkodean dan sains.
Lewati ultra ketika tugas bersifat sekuensial, kecil, atau sensitif terhadap latensi dengan anggaran terbatas: jawaban singkat, pengeditan satu file, klasifikasi cepat. Untuk kasus-kasus tersebut, ultra akan memunculkan subagen yang tidak memiliki apa pun untuk diparalelkan, dan upaya penalaran maks atau bahkan upaya default adalah pilihan yang jujur.
Berikut adalah cara terus terang untuk memutuskan. Jika Anda tidak dapat membagi tugas di antara beberapa kontraktor manusia yang bekerja pada waktu yang sama, model mungkin juga tidak dapat memperoleh banyak nilai dari subagen. Pekerjaan sekuensial tetap sekuensial tidak peduli berapa banyak agen yang Anda gunakan.
Bagaimana ini sesuai dengan tren multi-agen yang lebih luas
OpenAI bukanlah yang pertama dengan gagasan bahwa beberapa agen terkoordinasi mengalahkan satu agen. Laboratorium lain telah mengirimkan model dan kerangka kerja di mana pengontrol mendelegasikan ke spesialis dan menyatukan hasilnya. Yang baru adalah kemasannya: OpenAI menawarkan pola itu sebagai mode pada satu model daripada sistem terpisah yang Anda rakit.
Itu adalah taruhan tentang arah pengembangan agen. Jika orkestrasi dalam model menjadi cukup baik, banyak lapisan orkestrasi buatan tangan akan menjadi berlebihan untuk kasus-kasus umum. Jika tetap tidak transparan dan sulit di-debug, tim yang membutuhkan kontrol akan terus membangun sendiri. Keduanya bisa benar sekaligus, dengan ultra menangani kasus-kasus yang mudah dan orkestrasi kustom mengelola yang membutuhkan jejak audit. Analisis benchmark GPT-5.6 Sol membahas apakah angka-angka mendukung klaim orkestrasi, dibingkai di sekitar satu-satunya keputusan yang bisa Anda buat saat ini: menunggu atau melanjutkan.
Apa yang bisa Anda lakukan hari ini
Anda tidak dapat menjalankan mode ultra, jadi langkah praktisnya adalah membangun dan menguji pola orkestrasi pada model yang dapat Anda panggil. Model frontier yang tersedia saat ini, seperti Claude Mythos 5, Claude Fable 5, GPT-5.5, Gemini 3.5 Pro, GLM-5.2, dan Fugu Ultra, semuanya mengekspos endpoint chat yang kompatibel dengan OpenAI atau standar yang dapat Anda gunakan hari ini.
Di situlah Apidog cocok. Anda dapat mengirim permintaan ke API model mana pun ini, mengatur parameter seperti upaya penalaran di mana model mendukungnya, menegaskan responsnya, dan menyimpan panggilan sebagai skenario pengujian yang dapat digunakan kembali. Ketika akses pratinjau GPT-5.6 Anda tiba, pengaturan yang sama sudah siap: tukar endpoint dan pengenal model, dan Anda menguji Sol pada hari Anda masuk. Anda tidak menguji Sol hari ini, karena tidak ada seorang pun di luar mitra yang disetujui yang bisa. Anda mempersiapkan alat pengujian Anda agar hari pertama tidak kacau.

Kesimpulan
Mode ultra adalah bagian paling futuristik dari peluncuran GPT-5.6: orkestrasi yang dulunya ada dalam kode Anda, kini dipindahkan ke dalam satu panggilan model. Ini juga sesuatu yang belum bisa Anda sentuh, dan ketika Anda bisa, itu tidak akan murah, jadi disiplinnya adalah mencocokkan pengaturan dengan pekerjaannya. Gunakan maks ketika satu pekerja perlu berpikir lebih keras. Gunakan ultra hanya ketika tugas benar-benar terpecah menjadi bagian-bagian paralel yang sepadan dengan biaya token.
Ingin alat pengujian Anda siap saat Sol dibuka? Unduh Apidog dan mulailah menguji API model frontier yang dapat Anda panggil hari ini.
