Claude Opus 5 Parameter Upaya: Pertukaran Biaya dan Kapabilitas

Parameter upaya Claude Opus 5 dijelaskan: kelima levelnya, mengapa secara default disetel tinggi, apa yang diubah oleh rekalsibrasi, interaksi max_tokens, dan error 400 saat pemikiran dinonaktifkan.

INEZA Felin-Michel

INEZA Felin-Michel

25 July 2026

Claude Opus 5 Parameter Upaya: Pertukaran Biaya dan Kapabilitas

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Setiap tulisan utama tentang peluncuran Claude Opus 5 pada 24 Juli 2026 menyebutkan fitur yang sama. Fortune menyebutnya sebagai cara untuk beralih antara biaya dan kemampuan. CNBC, Bloomberg, dan TechCrunch semuanya menunjuk pada fitur tersebut. Tidak ada dari mereka yang menjelaskan apa itu, apa saja levelnya, apa yang terjadi ketika Anda mengubahnya, atau apa dampaknya terhadap tagihan Anda.

Ini adalah parameter permintaan yang disebut effort, memiliki lima level di Opus 5, dan secara default adalah high. Itulah keseluruhan fitur. Yang membuatnya layak menjadi artikel adalah Anthropic mengkalibrasi ulang level untuk model ini, yang berarti pengaturan yang Anda sesuaikan di Opus 4.8 sekarang salah, dan satu kombinasi pengaturan tertentu mengembalikan error 400 yang akan muncul di banyak log migrasi minggu ini.

💡
Jika Anda ingin mencoba level-level ini terhadap endpoint sungguhan saat membaca, Apidog adalah cara mudah untuk mengirimkan permintaan yang sama dengan lima pengaturan berbeda dan membandingkan hasilnya.
tombol

Apa sebenarnya parameter effort itu

Effort berada di objek output_config pada permintaan API Pesan:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "output_config": { "effort": "high" },
  "messages": [
    { "role": "user", "content": "Refactor this module and explain the tradeoffs." }
  ]
}

Ini mengontrol seberapa banyak penalaran internal yang dilakukan model sebelum menjawab. Opus 5 menjalankan *adaptive thinking* secara default, dan effort adalah pengatur yang menentukan seberapa besar anggaran pemikiran itu dihabiskan. Effort yang lebih tinggi berarti lebih banyak token penalaran, lebih banyak biaya, dan lebih banyak latensi. Effort yang lebih rendah berarti lebih sedikit dari ketiganya.

Antarmuka pengguna memaparkan ide yang sama sebagai selektor effort daripada bidang JSON mentah, dari sinilah muncul pandangan pers tentang pengalih biaya-versus-kemampuan. Di bawahnya adalah parameter ini. Jika Anda membangun di atas API, parameter adalah hal yang sebenarnya Anda kontrol, jadi itulah yang dibahas di sisa artikel ini. Bentuk permintaan lengkap ada di panduan API Claude Opus 5 kami, dan referensi parameter ada di gambaran umum model Anthropic.

Satu hal yang bukan effort: kontrol verbositas. Panduan prompt Anthropic untuk Opus 5 secara eksplisit menyatakan bahwa menurunkan effort mengurangi pemikiran, bukan panjang respons yang terlihat. Opus 5 sudah menulis jawaban default yang lebih panjang dan hasil yang lebih panjang daripada Opus 4.8. Jika Anda menginginkan output yang lebih pendek, mintalah output yang lebih pendek di prompt. Menurunkan ke low tidak akan melakukannya untuk Anda.

Lima level

Level Apa yang dilakukannya Kecocokan tipikal
low Penalaran minimal sebelum menjawab Klasifikasi volume tinggi, ekstraksi, routing, ringkasan singkat
medium Penalaran sedang Tanya Jawab berdasarkan konteks yang diambil, edit satu file, transformasi terstruktur
high Default. Penalaran substansial Pekerjaan tujuan umum ketika Anda belum mengukur apapun
xhigh Penalaran yang diperpanjang Pengodean dan loop agentic. Titik awal yang direkomendasikan Anthropic untuk keduanya
max Anggaran penalaran maksimum Masalah *one-shot* yang sulit di mana jawaban yang salah lebih mahal daripada token

Dua hal tentang tabel ini mudah terlewatkan.

Defaultnya adalah high, bukan low dan bukan xhigh. Jika Anda mengirim permintaan tanpa output_config sama sekali, Anda akan mendapatkan high. Itu penting untuk prakiraan biaya: permintaan yang tidak tersentuh di Opus 5 melakukan pekerjaan penalaran yang nyata dan menagih Anda untuk itu, sedangkan permintaan yang sama yang tidak tersentuh di Opus 4.8 tidak melakukan pemikiran sama sekali. Perubahan itu adalah salah satu dari dua perubahan yang merusak dalam migrasi Opus 4.8 ke Opus 5, dan kemungkinan besar akan mengejutkan tim keuangan.

Dan xhigh adalah rekomendasi untuk pekerjaan pengodean dan *agentic*, bukan max. Anthropic memposisikan xhigh sebagai tempat Anda memulai untuk beban kerja tersebut. max ada di atasnya, tetapi memulai di sana berarti membayar untuk ruang kepala yang mungkin tidak dapat Anda ukur manfaatnya. Mulailah di xhigh, lalu turunkan.

Apa yang diubah oleh kalibrasi ulang

Berikut adalah bagian yang membuat memindahkan pengaturan antar model menjadi ide yang buruk.

Anthropic mengkalibrasi ulang arti setiap level effort di Opus 5. Label medium di Opus 5 tidak menggambarkan jumlah penalaran yang sama dengan medium di Opus 4.8. Panduan Anthropic adalah untuk melakukan *effort sweep* yang baru di Opus 5 daripada memindahkan konfigurasi 4.8 Anda.

Konsekuensi praktisnya lebih menarik daripada peringatannya. Pada model Opus sebelumnya, low dan medium sebagian besar bersifat teoretis untuk pekerjaan serius: mereka murah, dan juga terlihat lebih buruk, sehingga tim memarkir semuanya di high atau di atasnya dan membayarnya. Di Opus 5, level yang lebih rendah secara signifikan lebih kuat dari sebelumnya, yang merupakan pertama kalinya low dan medium benar-benar dapat digunakan pada model tingkat Opus untuk tugas produksi.

Itu adalah pengungkit biaya sebenarnya dalam peluncuran, dan itulah yang diringkas oleh liputan pers menjadi kata "toggle". Opus 5 berharga $5 per juta token input dan $25 per juta token output, sama dengan Opus 4.8. Token penalaran masuk ke sisi output dari tagihan itu. Jadi perbedaan antara menjalankan *pipeline* klasifikasi pada `high` dan menjalankannya pada `low` bukanlah kesalahan pembulatan, itu adalah sebagian besar pengeluaran output Anda pada beban kerja di mana penalaran tambahan tidak pernah memberi Anda akurasi sejak awal. Rincian harga Opus 5 kami memiliki daftar tarif lengkap, termasuk diskon batch 50% dan minimum cache 512 token, keduanya bersinergi dengan pengaturan effort yang lebih rendah.

Jika Anda mencari penghematan di seluruh ekosistem Claude daripada hanya satu endpoint, pengungkit dalam memotong tagihan API Claude Anda berlaku di sini juga, dengan effort sekarang ditambahkan ke daftar.

Interaksi xhigh dan max dengan max_tokens

max_tokens membatasi token pemikiran dan token respons secara bersamaan. Ini adalah batas keras di seluruh sisi output permintaan, bukan hanya teks yang terlihat.

Tingkatkan effort dan Anda meningkatkan seberapa banyak batasan itu dihabiskan model untuk penalaran sebelum mulai menulis. Dorong effort ke `xhigh` atau `max` sambil membiarkan `max_tokens` pada nilai yang Anda tentukan untuk model yang tidak berpikir, dan model dapat menghabiskan anggaran penalaran dan memotong sebelum menyelesaikan jawaban. Anda mendapatkan respons terpotong tanpa ada yang salah secara jelas dalam permintaan.

Solusinya adalah memberinya ruang. Panduan Anthropic adalah memulai pada max_tokens: 64000 ketika Anda menjalankan `xhigh` atau `max` di Opus 5:

{
  "model": "claude-opus-5",
  "max_tokens": 64000,
  "output_config": { "effort": "xhigh" },
  "messages": [
    { "role": "user", "content": "Fix the failing integration test and explain the root cause." }
  ]
}

max_tokens yang tinggi adalah batas, bukan pembelian. Anda ditagih untuk token yang benar-benar dihasilkan, jadi mengatur 64000 tidak berarti membayar 64000. Itu berarti model tidak dipaksa untuk berhenti di tengah pemikiran.

Kesalahan 400 yang belum ada yang menuliskannya

Yang satu ini akan menghasilkan tiket dukungan.

Menonaktifkan pemikiran dan meminta effort tinggi adalah instruksi yang bertentangan, dan Opus 5 menolak kombinasi tersebut secara langsung. Mengirim thinking: {type: "disabled"} bersama dengan effort `xhigh` atau `max` mengembalikan **400**, diterapkan per permintaan:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "thinking": { "type": "disabled" },
  "output_config": { "effort": "xhigh" }
}

Permintaan itu gagal. Menonaktifkan pemikiran membatasi Anda pada effort `high`. Jadi kombinasi yang valid adalah:

Jalur migrasi yang menghasilkan error ini dapat diprediksi: sebuah tim memindahkan thinking: {type: "disabled"} dari konfigurasi Opus 4.8 di mana itu tidak berbahaya, kemudian secara terpisah menaikkan effort ke `xhigh` karena itu adalah rekomendasi pengodean. Kedua editan itu terlihat masuk akal secara terpisah. Bersama-sama, mereka menghasilkan 400.

Saran Anthropic sendiri adalah untuk tidak menonaktifkan pemikiran di Opus 5 sama sekali. Dengan pemikiran mati, dua mode kegagalan sesekali muncul: model menulis panggilan alat sebagai teks biasa yang tidak pernah dieksekusi, dan tag XML internal bocor ke output yang terlihat. Dalam loop agentic, teks yang bocor kemudian merusak giliran berikutnya. Cara yang direkomendasikan untuk mengontrol biaya di Opus 5 adalah tingkat effort yang lebih rendah, bukan pemikiran yang dinonaktifkan. Kami membahas lebih dalam kedua artefak tersebut di panduan prompt Opus 5.

Cara menjalankan *effort sweep* pada evaluasi Anda sendiri

Anthropic menyuruh Anda untuk melakukan *re-sweep*. Berikut adalah prosedur yang dapat dilakukan dalam satu sore.

1. Bekukan satu set tugas. Ambil 30 hingga 50 prompt nyata dari log produksi, bukan contoh sintetis. Sertakan kasus sulit yang benar-benar Anda khawatirkan. Perbedaan effort menghilang pada tugas-tugas mudah, itulah mengapa kumpulan sampel yang bersih tidak akan memberi tahu Anda apa pun.

2. Tuliskan kriteria kelulusan sebelum Anda melihat output apa pun. Tes lulus, JSON memvalidasi terhadap skema, bidang yang diekstrak sesuai dengan kebenaran dasar, penilai manusia mengatakan ya atau tidak. Jika kriteria Anda adalah *vibe*, *sweep* Anda menghasilkan *vibe*.

3. Jalankan setiap prompt di setiap level. Lima level kali 40 prompt adalah 200 panggilan. Di Opus 5 itu cukup murah untuk tidak perlu dipikirkan, dan Anda dapat mengirimkannya melalui API Batch dengan setengah harga karena tidak ada yang sensitif terhadap latensi.

4. Catat tiga angka per *run*, bukan satu: lulus atau gagal, usage.output_tokens, dan latensi *wall-clock*. Blok usage dalam respons adalah tempat sinyal biaya sebenarnya berada, karena menghitung token penalaran yang Anda kira-kira.

5. Pilih level termurah yang memenuhi standar Anda, lalu konfirmasikan pada *holdout set* yang tidak Anda sesuaikan. Tim yang melewatkan *holdout* cenderung mengirimkan pengaturan yang disesuaikan dengan 40 prompt spesifik.

6. Jalankan lagi pada model berikutnya. Seluruh alasan *sweep* ini ada adalah karena level dikalibrasi ulang antara 4.8 dan 5. Asumsikan itu terjadi lagi.

Membandingkan level secara berdampingan di Apidog

Bagian mekanis dari sebuah *sweep* adalah mengirimkan satu *request body* lima kali dengan satu bidang diubah dan menyelaraskan apa yang kembali. Itu adalah jumlah *copy-paste curl* yang cukup banyak, dan itulah bagian yang Apidog rapikan.

Pengaturan yang berfungsi:

  1. Buat permintaan ke endpoint Anthropic Messages dan simpan kunci Anda sebagai variabel lingkungan daripada menempelkannya ke *body*. Kunci tetap terpisah dari apa pun yang Anda bagikan dengan tim.
  2. Simpan permintaan yang berfungsi ke dalam koleksi, lalu duplikasikan lima kali dan hanya ubah output_config.effort di setiap salinan.
  3. Periksa objek usage pada setiap respons sehingga Anda dapat melihat token output per level secara langsung, ditambah cache_read_input_tokens ketika Anda memeriksa apakah *caching* Anda berjalan.
  4. Aktifkan *streaming* dan baca event SSE jika Anda ingin melihat ke mana latensi sebenarnya pergi pada `xhigh` versus `low`.
  5. Tambahkan pernyataan bahwa stop_reason ada dan bukan max_tokens, sehingga respons `xhigh` yang terpotong gagal dengan keras dalam koleksi Anda alih-alih diam-diam terlihat seperti jawaban singkat.

Pernyataan terakhir itulah yang layak diatur terlebih dahulu, karena pemotongan pada effort tinggi adalah satu-satunya hal yang paling mungkin salah. Unduh Apidog jika Anda ingin membangun koleksi perbandingan saat membaca. Tidak ada yang memerlukan ini; hanya saja ini lebih baik daripada mempertahankan lima skrip *shell*.

Batas yang jujur

Effort membuat Opus 5 lebih murah untuk dijalankan dengan baik. Ini tidak menjadikan Opus 5 sebagai yang teratas dalam tumpukan Claude.

Angka peluncuran Anthropic sendiri untuk Opus 5 sangat kuat: lebih dari dua kali lipat skor Frontier-Bench v0.1 Opus 4.8, kira-kira 3x model terbaik berikutnya pada ARC-AGI 3, dan dalam 0.5% dari Fable 5 pada CursorBench 3.2 dengan harga setengahnya. Semua itu adalah angka yang dijalankan vendor, diterbitkan oleh Anthropic, dan tidak ada yang direproduksi secara independen hingga 25 Juli 2026. Perlakukan mereka sebagai klaim dengan sumber, bukan sebagai pengukuran netral, dan lihat rincian *benchmark* Opus 5 kami untuk peringatan pada setiap angka.

Di atas Opus 5, Fable 5 masih merupakan model Anthropic yang paling mampu yang dirilis secara luas, dengan $10 per juta input dan $50 per juta output. Dan Opus 5 masih tertinggal dari Mythos 5 dalam eksploitasi keamanan siber dan penelitian biologi otonom, yang secara langsung dinyatakan oleh Anthropic. Menjalankan Opus 5 pada `max` tidak menutup salah satu celah tersebut. Ringkasan jujurnya adalah kemampuan kelas *frontier* dengan setengah harga *frontier*, dengan batas atas yang disebutkan di atasnya. Apakah perbedaan harga sepadan untuk beban kerja Anda adalah pertanyaan yang kami bahas di Opus 5 vs Fable 5.

tombol

FAQ

Berapa level *effort* default pada Claude Opus 5? high. Permintaan tanpa bidang output_config berjalan pada *effort* `high` dengan *adaptive thinking* aktif.

Apa saja lima level *effort* itu? low, medium, high, xhigh, dan max. Anthropic merekomendasikan untuk memulai di `xhigh` untuk pekerjaan pengodean dan *agentic*, dan kemudian menurunkannya berdasarkan evaluasi Anda sendiri.

Mengapa permintaan saya mengembalikan 400 ketika saya mengatur *effort* ke `xhigh`? Hampir pasti karena Anda juga mengirim thinking: {type: "disabled"}. Menonaktifkan pemikiran membatasi *effort* pada `high`, dan kombinasi tersebut ditolak per permintaan. Hapus blok *disabled-thinking* atau turunkan *effort* ke `high` atau di bawahnya.

Bisakah saya menggunakan kembali pengaturan *effort* Opus 4.8 saya di Opus 5? Tidak. Level-levelnya dikalibrasi ulang, jadi label yang sama berarti jumlah penalaran yang berbeda. Anthropic meminta Anda untuk menjalankan *sweep* yang baru. Daftar lengkap apa yang berubah ada di panduan migrasi.

Apakah menurunkan *effort* membuat respons lebih pendek? Tidak. *Effort* mengontrol penalaran, bukan panjang yang terlihat, dan respons default Opus 5 berjalan lebih panjang dari Opus 4.8. Minta keringkasan secara eksplisit jika Anda menginginkan output yang lebih pendek.

Berapa `max_tokens` yang harus saya gunakan pada `xhigh` atau `max`? Mulai dari 64000. `max_tokens` membatasi pemikiran dan respons secara bersamaan, jadi anggaran yang diukur untuk model yang tidak berpikir akan terpotong. Anda hanya ditagih untuk token yang dihasilkan, jadi batas atas yang tinggi tidak dikenakan biaya apa pun.

Untuk lembar spesifikasi lengkap, matriks ketersediaan, dan konteks harga seputar semua ini, mulailah dengan apa itu Claude Opus 5.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.