GPT-5.6 dari OpenAI mencapai ketersediaan umum pada 9 Juli 2026, setelah pratinjau terbatas selama dua minggu, dan tingkat Sol andalannya hadir dengan angka peluncuran yang mengklaim mahkota agentic. Claude Fable 5 dari Anthropic telah mengusung panji "model paling cakap" di sisi lain sejak awal Juni. Jika Anda memilih model andalan untuk pekerjaan nyata pada kuartal ini, Anda sekarang memiliki dua jawaban yang kredibel dan tumpukan berita utama yang saling bertentangan.
Inilah bagian yang paling banyak disembunyikan oleh perbandingan: tidak ada model yang memenangkan segalanya, dan angka dari vendor sendiri mengatakannya. Menurut laporan peluncuran OpenAI, Sol memimpin tolok ukur agentic yang luas dengan selisih yang lebar. Laporan yang sama menunjukkan Claude Fable 5 unggul dalam SWE-Bench Pro hampir 16 poin. Perbandingan apa pun yang menobatkan satu pemenang keseluruhan berarti mencoba menjual sesuatu kepada Anda.
Jadi yang ini tidak akan. Di bawah ini adalah pembagian tolok ukur dengan setiap angka yang diatribusikan, apa arti pembagian tersebut untuk pekerjaan yang Anda lakukan, harga di kedua sisi, perbedaan permukaan API, dan panduan keputusan. Kami telah membahas apa itu GPT-5.6 Sol dalam penjelasan terpisah, dan pengumuman resmi GPT-5.6 adalah sumber utama untuk klaim OpenAI.
Keputusan di awal
| Pekerjaan yang harus dilakukan | Pilihan yang lebih kuat hari ini | Buktinya |
|---|---|---|
| Menjalankan tugas agentic yang luas | GPT-5.6 Sol | Agents’ Last Exam ~53 vs GPT-5.5’s 46.9, menurut OpenAI |
| Rekayasa perangkat lunak yang mendalam | Claude Fable 5 | SWE-Bench Pro 80.3% vs Sol’s 64.6%, menurut bagan OpenAI sendiri |
| Pekerjaan agen berbasis terminal | GPT-5.6 Sol, tipis | Terminal-Bench 2.1: 88.8%, 91.9% dengan ultra, menurut OpenAI |
| Harga label terendah per token | GPT-5.6 Sol | $5 / $30 per 1 Juta token vs $10 / $50 yang dipublikasikan Fable 5 |
| Eksekusi multi-agen paralel bawaan | GPT-5.6 | Pengaturan ultra menjalankan empat agen secara paralel secara default |
| Satu model yang memenangkan segalanya | Tidak ada | Model itu tidak ada saat ini |
Satu peringatan yang berlaku untuk seluruh tabel: setiap angka tolok ukur dilaporkan oleh vendor, diterbitkan saat peluncuran, dan belum direproduksi secara independen. Bacalah ini sebagai peta klaim, bukan peringkat yang pasti. Satu-satunya tolok ukur yang menyelesaikan apa pun adalah beban kerja Anda sendiri, dan kami akan menunjukkan cara menjalankannya secara berdampingan di Apidog menjelang akhir.
Pembagian tolok ukur, menurut OpenAI
Tiga angka mendefinisikan perbandingan ini, dan ketiganya berasal dari materi peluncuran OpenAI. Sumber itu berlaku dua arah, jadi perhatikan itu.
| Tolok Ukur | GPT-5.6 Sol | Claude Fable 5 | Sumber |
|---|---|---|---|
| Agents’ Last Exam | ~53 (laporan berkisar 52.7 hingga 53.6) | Kira-kira 13 poin di belakang Sol | OpenAI, hari peluncuran |
| SWE-Bench Pro | 64.6% | 80.3% | OpenAI, hari peluncuran |
| Terminal-Bench 2.1 | 88.8% (91.9% dengan ultra) | Tidak disebutkan dalam bagan OpenAI | OpenAI, hari peluncuran |
Pada Agents’ Last Exam, OpenAI melaporkan Sol di sekitar 53, naik dari 46.9 GPT-5.5 dan sekitar 13 poin lebih unggul dari Claude Fable 5. Itu adalah lompatan generasi nyata pada tolok ukur yang dibangun di sekitar tugas agentic yang panjang dan multi-langkah, dan itu adalah angka yang OpenAI tampilkan pertama kali.
Pada SWE-Bench Pro, gambarannya terbalik. Bagan perbandingan OpenAI sendiri menunjukkan Claude Fable 5 di 80.3% berbanding 64.6% milik Sol. Patut diacungi jempol: mempublikasikan kerugian 15.7 poin dalam materi peluncuran Anda sendiri adalah hal yang tidak biasa, dan itu membuat sisa bagan lebih mudah untuk dianggap serius. Ini juga sesuai dengan apa yang diukur oleh SWE-Bench Pro, yaitu menyelesaikan masalah rekayasa perangkat lunak yang sulit dan nyata dari repositori ujung ke ujung.
Terminal-Bench 2.1 melengkapi kasus Sol. OpenAI melaporkan 88.8% untuk Sol standar dan 91.9% ketika ultra menyebarkan pekerjaan ke empat agen paralel. Perhatikan bahwa angka ultra adalah mode eksekusi yang berbeda dengan pengeluaran token yang sengaja lebih tinggi, bukan model yang sama berpikir lebih keras.
Dua pemeriksaan kejujuran sebelum Anda mempertimbangkan semua ini. Pertama, ini adalah klaim hari peluncuran dari vendor yang paling banyak diuntungkan; belum ada orang di luar OpenAI yang mereproduksinya, dan pilihan alat evaluasi dapat menggeser skor beberapa poin. Kedua, tolok ukur tunggal banyak mengkompresi. Tulisan Simon Willison di hari pertama adalah bacaan independen yang berguna tentang rilis ini, dan rincian tolok ukur GPT-5.6 Sol kami menjelaskan secara rinci apa yang diukur oleh setiap pengujian.
Apa arti pembagian ini
Pola dalam ketiga angka tersebut tidak acak. Ini menggambarkan dua spesialisasi yang berbeda.
Keunggulan Sol adalah cakupannya. Agents’ Last Exam dan Terminal-Bench sama-sama menghargai model yang dapat merencanakan banyak langkah, mengatur alat, pulih dari kesalahan, dan menyelesaikan berbagai tugas. Jika beban kerja Anda terlihat seperti kumpulan agen yang menangani tiket, menjalankan penelitian, otomatisasi operasi, atau pipeline berbasis terminal, angka OpenAI menunjukkan Sol adalah pilihan yang lebih kuat.
Keunggulan Fable 5 adalah kedalamannya. SWE-Bench Pro adalah proksi publik terdekat untuk "dapatkah model ini melakukan rekayasa perangkat lunak yang sulit dan nyata dalam basis kode yang ada tanpa campur tangan manusia setelahnya." Keunggulan 15.7 poin di sana, yang diakui oleh pesaing, bukanlah kebisingan bahkan setelah batas kesalahan yang besar. Jika beban kerja Anda adalah refactor skala repositori, debugging yang rumit, atau eksekusi rekayasa proyek tunggal yang panjang, itulah angka yang harus menjadi patokan default Anda.
Yang berarti pertanyaan yang benar bukanlah "model mana yang lebih baik." Melainkan "pekerjaan mana dari kedua ini yang lebih mirip pekerjaan saya." Memilih berdasarkan agregat papan peringkat mengoptimalkan untuk beban kerja yang tidak Anda miliki.
Perbandingan harga
OpenAI mempublikasikan harga GA yang jelas di ketiga tingkatan GPT-5.6. Harga Fable 5 Anthropic di bawah ini adalah yang dipublikasikan saat peluncuran; konfirmasikan tarif saat ini di halaman harga Anthropic sebelum Anda membuat anggaran, karena ketentuan akses bergeser ke kredit penggunaan untuk pelanggan pada bulan Juli.
| Model | Input per 1 Juta token | Output per 1 Juta token |
|---|---|---|
| gpt-5.6-sol (alias gpt-5.6 mengarah ke sini) | $5.00 | $30.00 |
| gpt-5.6-terra | $2.50 | $15.00 |
| gpt-5.6-luna | $1.00 | $6.00 |
| claude-fable-5 | $10.00 (dipublikasikan; verifikasi) | $50.00 (dipublikasikan; verifikasi) |
Pada daftar harga, Sol berharga setengah dari Fable 5 per token di kedua arah. Itu adalah selisih yang berarti, tetapi harga label adalah prediktor yang lemah untuk biaya suatu tugas. Kedua model melakukan tokenisasi secara berbeda, menghasilkan panjang output yang berbeda untuk prompt yang sama, dan membakar jumlah penalaran yang berbeda untuk mencapai jawaban. Model yang lebih murah per token dan lebih banyak bicara per tugas bisa jadi seimbang.
Caching semakin mempersempit celah di kedua sisi. GPT-5.6 mendukung breakpoint cache eksplisit dengan penulisan cache yang ditagih 1.25x tarif input tanpa cache, pembacaan cache yang mempertahankan diskon 90%, dan masa pakai cache minimum 30 menit. Caching prompt Fable 5 juga mendiskon cache hit sebesar 90%, yang dua kali lebih penting pada tarif dasar yang lebih tinggi. Rincian harga Claude Fable 5 kami mencakup di mana penghematan tersebut muncul dalam praktiknya. Bagaimanapun, angka yang harus dilacak adalah biaya per tugas yang diselesaikan, bukan biaya per juta token.
Di mana permukaan API berbeda
Kedua perusahaan kini mengirimkan lebih dari sekadar endpoint penyelesaian obrolan, dan bentuknya cukup berbeda untuk memengaruhi pilihan.
Permukaan GPT-5.6, menurut dokumen pengembang OpenAI, berpusat pada kontrol dan orkestrasi di dalam Responses API:
- Enam tingkat upaya penalaran, dari nol hingga maksimal, sehingga Anda dapat menyetel kedalaman per permintaan.
- Mode Pro sebagai pengaturan (reasoning.mode: “pro”) pada ketiga model untuk beban kerja yang mengutamakan kualitas. Ini adalah kenop, bukan model terpisah.
- Ultra, pengaturan multi-agen yang menjalankan empat agen secara paralel secara default. Ini mengorbankan pengeluaran token yang lebih tinggi untuk hasil waktu nyata yang lebih cepat, dan tersedia di ChatGPT Work pada paket Pro dan Enterprise plus Codex dari Plus ke atas.
- Panggilan alat terprogram, di mana model menulis JavaScript yang mengatur panggilan alat Anda di dalam runtime V8 yang terisolasi tanpa akses jaringan.
- Penalaran yang dipertahankan di seluruh giliran, eksekusi multi-agen dalam beta, dan pengaturan detail visi yang mempertahankan dimensi gambar asli.
Claude Fable 5 berada di puncak keluarga Claude 5, diperkenalkan bersama Claude Mythos 5 dalam pengumuman Anthropic. Permukaan yang dipublikasikan mencakup jendela konteks 1 juta token sebagai default, hingga 128K token output per permintaan, dan parameter fallback sisi server yang dapat mengalihkan permintaan yang ditolak keamanan ke Claude Opus 4.8 di dalam panggilan API yang sama. Anthropic menawarkan model ini untuk penalaran yang menuntut dan pekerjaan agentic jangka panjang, dan ia memiliki tumpukan agentic sendiri di sekitar Claude Code dan alur kerja sub-agen. Penjelasan Claude Fable 5 kami mencakup lembar spesifikasi lengkap.
Jendela konteks hampir setara: 1 juta token Fable 5 dikonfirmasi, dan cakupan dokumentasi awal juga melaporkan GPT-5.6 di 1 juta token, meskipun halaman spesifikasi OpenAI harus menjadi sumber kebenaran Anda di sana. Perbedaan yang lebih besar adalah filosofi. OpenAI mengekspos primitif orkestrasi (paralelisme, panggilan alat terprogram, dial upaya) sebagai fitur API kelas satu. Anthropic mengirimkan mesin model tunggal yang mendalam dengan infrastruktur keandalan di sekitarnya. Tidak ada pendekatan yang salah; keduanya memetakan ke pembagian luas-versus-kedalaman yang sama yang ditunjukkan oleh tolok ukur.
Panduan keputusan praktis
Singkirkan kebisingan peluncuran dan pilihan menyempit menjadi beberapa pertanyaan.
Pilih GPT-5.6 Sol sebagai default Anda ketika:
- Beban kerja Anda adalah kumpulan agen, orkestrasi alat, atau banyak tugas bervariasi yang berjalan tanpa pengawasan.
- Anda menginginkan paralelisme dan kontrol upaya per permintaan sebagai primitif API daripada sesuatu yang Anda bangun sendiri.
- Tekanan anggaran token nyata dan daftar harga $5 / $30, ditambah Terra dan Luna sebagai penurunan, sesuai dengan ekonomi unit Anda.
Pilih Claude Fable 5 sebagai default Anda ketika:
- Pekerjaannya adalah rekayasa perangkat lunak yang sulit di repositori nyata, di mana celah SWE-Bench Pro menunjukkan keunggulannya.
- Anda menjalankan sesi tugas tunggal yang panjang dan mendalam serta lebih peduli pada kemampuan puncak per tugas daripada throughput armada.
- Anda sudah berinvestasi dalam toolchain Claude dan perilaku fallback serta caching-nya.
Jalankan keduanya jika Anda bisa. Ini adalah API HTTP dengan SDK yang matang, dan perutean berdasarkan jenis tugas (Sol untuk alur yang berat orkestrasi, Fable 5 untuk yang berat rekayasa) adalah arsitektur normal pada tahun 2026, bukan yang eksotis.
Uji keduanya terhadap beban kerja Anda sendiri
Tolok ukur vendor memberi Anda daftar pendek dua pilihan. Prompt Anda sendiri yang harus membuat keputusan akhir, dan ini membutuhkan waktu sore, bukan sprint.
Kedua model dapat dijangkau melalui HTTP biasa: GPT-5.6 melalui Responses API OpenAI dan Fable 5 melalui Messages API Anthropic. Di Apidog, simpan setiap model sebagai lingkungannya sendiri dengan URL dasar, header otentikasi, dan ID model sebagai variabel. Kemudian bangun satu koleksi permintaan dengan 10 hingga 20 prompt yang ditarik dari beban kerja nyata Anda, tiket, perbedaan, dan rantai panggilan alat yang Anda tangani setiap minggu, dan jalankan set tersebut terhadap setiap lingkungan.
Bandingkan dua hal per prompt. Pertama, kualitas respons, dinilai oleh siapa pun yang memiliki beban kerja tersebut. Kedua, bidang penggunaan di setiap badan respons, karena jumlah token dikalikan daftar harga memberi Anda biaya sebenarnya per tugas, di sinilah asumsi "Sol setengah harga" diuji terhadap output Fable 5 yang lebih ringkas atau lebih panjang pada data Anda. Jika agen Anda akan mengkoordinasikan alat internal, tiru endpoint alat tersebut terlebih dahulu sehingga kedua model merencanakan respons yang identik dan stabil. Satu jam bukti berdampingan mengalahkan bagan peluncuran apa pun.
FAQ
Apakah GPT-5.6 Sol lebih baik dari Claude Fable 5?
Pada beberapa pekerjaan, menurut angka peluncuran OpenAI. Sol memimpin Agents’ Last Exam sekitar 13 poin, sementara Fable 5 memimpin SWE-Bench Pro sebesar 15.7 poin pada bagan yang sama. Tidak ada satu pemenang tunggal yang jujur. Cocokkan model dengan pekerjaan: menjalankan tugas agentic yang luas lebih mendukung Sol, rekayasa perangkat lunak yang mendalam lebih mendukung Fable 5.
Model mana yang lebih murah untuk dijalankan?
Daftar harga Sol adalah setengah dari harga Fable 5 yang dipublikasikan: $5 / $30 per 1 Juta token berbanding $10 / $50 (verifikasi tarif Anthropic saat ini sebelum membuat anggaran). Biaya sebenarnya tergantung pada tokenisasi, panjang output, dan caching, jadi ukur biaya per tugas yang diselesaikan pada prompt Anda sendiri sebelum menganggap selisih 2x itu sebagai pasti.
Bisakah saya menggunakan kedua model dalam satu produk?
Ya, dan banyak tim melakukannya. Keduanya adalah API HTTP standar, jadi Anda dapat mengarahkan alur yang berat orkestrasi ke Sol dan alur yang berat rekayasa ke Fable 5 di balik satu antarmuka. Panduan kami tentang cara menggunakan API Claude Fable 5 mencakup sisi Anthropic, termasuk otentikasi dan bentuk permintaan.
Apakah angka tolok ukur ini diverifikasi secara independen?
Tidak. Setiap angka dalam artikel ini dilaporkan oleh vendor dari materi peluncuran OpenAI pada 9 Juli, termasuk hasil SWE-Bench Pro di mana Fable 5 menang. Reproduksi independen biasanya muncul dalam beberapa minggu setelah rilis GA. Sampai saat itu, perlakukan semuanya sebagai klaim dan berikan bobot lebih tinggi pada pengujian Anda sendiri.
Perbandingan yang penting adalah milik Anda
Putusan terbagi adalah temuan, bukan alasan. Bagan peluncuran OpenAI sendiri memberikan mahkota cakupan agentic kepada Sol dan mahkota rekayasa perangkat lunak kepada Fable 5, dan kedua perusahaan mengirimkan produk andalan yang nyata dan dapat digunakan dalam beberapa minggu satu sama lain. Memilih berdasarkan agregat papan peringkat mengabaikan satu variabel yang menentukan hasil Anda: seperti apa beban kerja Anda.
Jadi jalankan pengujian. Ambil 15 prompt nyata dari pekerjaan minggu lalu, unduh Apidog, siapkan kedua API sebagai lingkungan, dan bandingkan kualitas serta biaya per tugas pada data Anda sendiri. Anda akan memiliki jawaban yang dapat dipertahankan sebelum reproduksi tolok ukur independen pertama dikirimkan.
