Anthropic meluncurkan Claude Fable 5.1 pada 1 September 2026, dengan tabel perbandingan yang membandingkannya dengan Fable 5, Opus 5, dan GPT-5.6 Sol di sembilan pengujian. Berita utama yang diterbitkan setiap media adalah Terminal-Bench-Science, di mana Fable 5.1 mencetak 52,6% dibandingkan 24,7% milik Fable 5. Angka yang lebih sedikit diberitakan media adalah CursorBench, di mana selisihnya dengan Opus 5 adalah 3,4 poin pada model yang biayanya dua kali lipat.
Panduan ini mengumpulkan setiap angka yang diterbitkan di satu tempat dengan atribusi, menjelaskan apa yang diukur setiap benchmark, memisahkan selisih besar dari yang kecil, dan kemudian membahas bagian yang dilewati liputan peluncuran: ini semua adalah hasil yang dijalankan oleh vendor, Mythos 5.1 mengungguli Fable 5.1 pada satu pengujian pengodean agentic di mana keduanya diterbitkan, dan respons yang tepat terhadap tabel peluncuran adalah menjalankan evaluasi Anda sendiri. Sumber utama adalah postingan peluncuran Anthropic; konteks model ada di apa itu Claude Fable 5.1.
Tabel lengkap
| Benchmark | Apa yang diukur | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Penelitian ilmiah agentic di terminal | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Pengodean agentic di terminal | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Pekerjaan pengetahuan bernilai ekonomi (Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (partial credit) | Penggunaan komputer untuk tugas desktop nyata | 77.9% | 72.9% | 75.4% | tidak dilaporkan |
| OSWorld 2.0 (strict) | Sama, hanya penyelesaian tugas penuh | 41.7% | 36.1% | 39.6% | tidak dilaporkan |
| Humanity’s Last Exam (no tools) | Pertanyaan penalaran tingkat ahli | 60.9% | 57.8% | 56.6% | tidak dilaporkan |
| Humanity’s Last Exam (with tools) | Sama, dengan pencarian dan kode | 65.0% | 63.8% | 63.6% | tidak dilaporkan |
| AutomationBench | Alur kerja bisnis end-to-end | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Tugas pengodean gaya IDE | 73.4% | 70.5% | 70.0% | 67.2% |
Anthropic juga menerbitkan satu angka Mythos 5.1: 60,9% pada Terminal-Bench 4.0. VentureBeat juga melaporkan hasil Browserbase 82% untuk Fable 5.1 dibandingkan 74% untuk Opus 5 dan 57% untuk Fable 5 pada tugas agen peramban yang paling sulit; angka tersebut berasal dari liputan pers daripada postingan peluncuran, jadi pertimbangkan sesuai dengan itu.
Selisih besar
Terminal-Bench-Science 0.1: 52,6% vs 24,7% (Fable 5) dan 29,0% (Opus 5). Ini adalah hasilnya. Fable 5.1 lebih dari dua kali lipat pendahulunya dan hampir dua kali lipat Opus 5 pada benchmark yang menempatkan model di terminal dengan alat ilmiah dan memintanya untuk melakukan penelitian multi-langkah. Ini adalah bukti paling jelas bahwa fokus Anthropic yang dinyatakan pada "pemecahan masalah jangka panjang" menghasilkan sesuatu yang terukur. Ini juga merupakan benchmark versi 0.1, yang berarti kumpulan tugas masih baru dan skor kemungkinan akan berubah seiring waktu.

AutomationBench: 31,4% vs 17,1% (Fable 5) dan 26,9% (Opus 5). Benchmark alur kerja bisnis end-to-end di seluruh aplikasi, di mana angka absolutnya rendah untuk semua orang. Fable 5.1 hampir dua kali lipat Fable 5 di sini dan memimpin Opus 5 dengan 4,5 poin. Jika produk Anda mengotomatisasi tugas bisnis multi-aplikasi, ini adalah baris yang perlu diperhatikan.
Terminal-Bench 4.0: 55,8% vs 42,0% (Fable 5). Lompatan 13,8 poin dibandingkan Fable 5 pada pengodean agentic, yang merupakan angka yang diutamakan oleh postingan peluncuran Anthropic di bagian pengodean. Terhadap Opus 5, keunggulannya adalah 3,5 poin. Opus 5 telah melampaui Fable 5 pada benchmark ini pada bulan Juli, jadi keunggulan tingkatan Fable atas tingkatan Opus pada pengodean agentic telah kembali, tetapi lebih sempit daripada di bulan Juni. Rincian benchmark Opus 5 memiliki angka bulan Juli.

GDPval-AA v2: 1853 vs 1723 (Fable 5). Peningkatan 130-Elo dibandingkan Fable 5 pada tugas-tugas pekerjaan pengetahuan, dan benchmark yang ditunjuk Anthropic untuk klaim dokumen, spreadsheet, dan slide-nya. Terhadap Opus 5, selisihnya adalah 29 Elo, yang kecil.
Selisih kecil
CursorBench 3.2.0: 73,4% vs 70,5% (Fable 5) dan 70,0% (Opus 5). Tugas pengodean gaya IDE. Tiga poin lebih tinggi dari model mana pun. Ini adalah benchmark yang paling penting bagi populasi pengembang terbesar, dan di sinilah keunggulan Fable 5.1 paling tipis. Jika beban kerja Anda adalah "bantu saya di editor saya," tabel peluncuran tidak membenarkan harga 2x dengan sendirinya.

OSWorld 2.0: 77,9% / 41,7% vs 75,4% / 39,6% (Opus 5). Penggunaan komputer. Dua poin lebih tinggi dari Opus 5 pada kedua penilaian, lima lebih tinggi dari Fable 5. Nyata, tidak dramatis. Perhatikan skor ketat: kurang dari setengah tugas diselesaikan sepenuhnya pada model mana pun. Penggunaan komputer masih merupakan area terlemah di garis depan.
Humanity’s Last Exam: 60,9% / 65,0% vs 56,6% / 63,6% (Opus 5). Tanpa alat, keunggulan 4,3 poin dibandingkan Opus 5, yang merupakan celah terbesar dari celah kecil. Dengan alat, menyusut menjadi 1,4 poin, karena pencarian dan eksekusi kode menyamakan kedudukan. Angka tanpa alat adalah ukuran penalaran mentah yang lebih baik; angka dengan alat lebih dekat dengan bagaimana model digunakan.

Fable 5.1 vs GPT-5.6 Sol
Anthropic menerbitkan empat baris dengan kolom GPT-5.6 Sol, dan Fable 5.1 memimpin keempatnya: Terminal-Bench-Science dengan 30,2 poin, Terminal-Bench 4.0 dengan 18,5, AutomationBench dengan 11,8, dan CursorBench dengan 6,2. GDPval-AA menunjukkan 1853 versus 1711. Dua peringatan. Ini adalah pengujian Anthropic terhadap model pesaing, dan lima baris tanpa kolom GPT-5.6 Sol tidak ada karena alasan yang tidak disebutkan Anthropic. Perbandingan GPT-5.6 Sol vs Fable 5 kami mencakup pertandingan sebelumnya; berdasarkan angka-angka ini Fable 5.1 memperlebar setiap celah yang dimiliki Fable 5.
Apa yang dilewati liputan peluncuran
Setiap angka dijalankan oleh vendor. Anthropic menjalankan semuanya, termasuk kolom pesaing, dan tidak ada lab independen yang mereproduksi salah satu dari mereka saat peluncuran. Riwayat benchmark Anthropic umumnya bertahan, tetapi celah CursorBench dan OSWorld cukup kecil sehingga harness atau pilihan penilaian yang berbeda dapat mengubahnya.
Mythos 5.1 adalah batas sebenarnya. Kartu sistem dan postingan peluncuran Anthropic menyatakan bahwa Fable 5.1 dan Mythos 5.1 adalah "model yang sama tetapi dengan tingkat perlindungan yang berbeda," dan mereka menerbitkan Mythos 5.1 sebesar 60,9% pada Terminal-Bench 4.0 dibandingkan 55,8% milik Fable 5.1. Selisih lima poin itu adalah biaya perlindungan pada pengodean agentic, dan itu berarti "model yang paling mampu yang dirilis secara luas oleh Anthropic" memiliki saudara yang lebih baik yang dikenal di atasnya. Perbandingan Mythos 5.1 vs Fable 5.1 membahas siapa yang dapat mengaksesnya.
Upaya tidak disebutkan. Dokumentasi upaya Anthropic menyatakan bahwa keuntungan Fable 5.1 terbesar pada `xhigh` dan `max`. Postingan peluncuran tidak menyebutkan tingkat upaya mana yang menghasilkan setiap skor, atau tingkat upaya apa yang dijalankan model perbandingan. Karena upaya adalah pengungkit kualitas utama pada model-model ini, kelalaian itu penting ketika Anda mencoba mereproduksi suatu angka.
Multibahasa datar. Anthropic menyatakan bahwa kinerja multibahasa setara dengan Fable 5, tidak ada peningkatan. Jika beban kerja Anda bukan bahasa Inggris, tabel peluncuran melebih-lebihkan keuntungannya.
Angka perlindungan adalah jenis benchmark yang berbeda. Anthropic melaporkan 85% lebih sedikit positif palsu biologi pada permintaan jinak dan sekitar 60% lebih sedikit intervensi siber per sesi Kode Claude dibandingkan Fable 5. Angka-angka ini diukur pada lalu lintas Anthropic sendiri dan tidak dapat direproduksi secara eksternal, tetapi bagi pengguna Fable 5 yang mengalami penolakan, angka-angka ini mungkin lebih penting daripada baris kemampuan mana pun.
Apa yang harus Anda uji sendiri
Tabel peluncuran memberi tahu Anda di mana harus mencari. Evaluasi Anda memberi tahu Anda apakah akan bergerak. Empat pengujian yang memetakan ke baris di atas:
- Tugas agen jangka panjang dari produk Anda sendiri, dijalankan hingga selesai pada Fable 5.1 pada `high`, Opus 5 pada `xhigh`, dan Fable 5 pada `high`. Ini adalah analog Terminal-Bench-Science dan AutomationBench, dan di sinilah harga 2x itu terbayar atau tidak.
- Sepuluh prompt pengodean tersulit Anda pada upaya yang sama pada Fable 5.1 dan Opus 5. Jika hasilnya seri, Anda telah mereproduksi cerita CursorBench dan Opus 5 adalah jawabannya.
- Sapu upaya pada Fable 5.1 saja, dari `low` hingga `max`, pada tugas rutin. Klaim Anthropic adalah bahwa `medium` cocok dengan Fable 5 dan `low` bersaing dengan Opus 5 pada biaya per tugas. Periksa itu.
- Hitungan penolakan pada prompt keamanan jinak atau ilmu kehidupan Anda, Fable 5 versus Fable 5.1. Itu adalah klaim 60% dan 85%, dan itu yang bisa Anda verifikasi dalam sehari.
Buat keempatnya sebagai permintaan di Apidog dengan `model` dan `effort` sebagai variabel lingkungan, tambahkan asersi pada `stop_reason` dan pada keberadaan string yang diharapkan dalam jawaban, dan jalankan koleksi per model. Riwayat eksekusi memberi Anda tabel evaluasi yang dapat direproduksi tanpa infrastruktur baru. Unduh Apidog untuk mengaturnya; panduan API memiliki bentuk permintaannya.

Bagaimana benchmark memetakan ke keputusan
- Agen jangka panjang, penelitian, otomasi: selisihnya besar dan konsisten. Fable 5.1 adalah modelnya, dan rincian harga menunjukkan bahwa pembacaan cache yang lebih murah mempersempit celah biaya pada beban kerja ini.
- Pengodean IDE, Tanya Jawab pengetahuan, penalaran berbasis alat: selisih dengan Opus 5 adalah satu hingga empat poin. Aturan Anthropic sendiri berlaku: tetap gunakan Opus 5 kecuali jika gagal dalam evaluasi Anda pada upaya yang lebih tinggi. Perbandingan Fable 5.1 vs Opus 5 membahasnya.
- Berasal dari Fable 5: setiap baris meningkat, harganya tidak, dan tingkat positif palsu menurun. Perbandingan Fable 5.1 vs Fable 5 mencakup biaya migrasi.
FAQ
Apa hasil benchmark terbaik Claude Fable 5.1? Terminal-Bench-Science 0.1 pada 52,6%, lebih dari dua kali lipat 24,7% milik Fable 5 dan di atas 29,0% milik Opus 5 dan 22,4% milik GPT-5.6 Sol. Semua angka adalah milik Anthropic.
Bagaimana Fable 5.1 dibandingkan dengan Opus 5 dalam pengodean? 55,8% vs 52,3% pada Terminal-Bench 4.0 dan 73,4% vs 70,0% pada CursorBench 3.2.0, berdasarkan angka Anthropic. Keunggulan yang nyata tetapi sempit sekitar tiga poin.
Apakah Fable 5.1 lebih baik dari GPT-5.6 Sol? Pada empat benchmark di mana Anthropic menerbitkan keduanya, ya, dengan 6 hingga 30 poin. Anthropic menjalankan angka GPT-5.6 Sol sendiri, dan lima dari sembilan barisnya tidak memiliki entri GPT-5.6 Sol.
Apakah benchmark Fable 5.1 diverifikasi secara independen? Tidak pada saat peluncuran. Setiap angka dijalankan oleh Anthropic. Perlakukan mereka sebagai klaim untuk diuji pada beban kerja Anda sendiri.
Bagaimana skor Mythos 5.1? Anthropic menerbitkan satu angka: 60,9% pada Terminal-Bench 4.0, lima poin di atas 55,8% milik Fable 5.1. Keduanya adalah model yang sama dengan perlindungan yang berbeda.
Tingkat upaya mana yang menghasilkan skor ini? Anthropic tidak menyebutkannya. Pedoman mereka adalah bahwa keuntungan Fable 5.1 terbesar pada `xhigh` dan `max`, jadi asumsikan upaya tinggi dan harapkan pengaturan yang lebih rendah akan menghasilkan skor yang lebih rendah.
