Panduan Prompt Claude Opus 5: Jangan Minta Periksa Ulang Lagi

Panduan prompting Claude Opus 5: hapus instruksi verifikasi Anda, dorong untuk keringkasan, batasi subagen, batasi cakupan, dan hindari mode kegagalan yang menghambat pemikiran.

INEZA Felin-Michel

INEZA Felin-Michel

25 July 2026

Panduan Prompt Claude Opus 5: Jangan Minta Periksa Ulang Lagi

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Sebagian besar panduan migrasi memberi tahu Anda apa yang rusak dalam kode Anda. Yang ini adalah tentang apa yang rusak dalam prompt Anda.

Claude Opus 5 diluncurkan pada 24 Juli 2026, dan Anthropic merilis panduan prompt khusus bersamanya. Panduan tersebut mendokumentasikan sesuatu yang patut diperhatikan: beberapa instruksi yang membuat Opus 4.8 lebih baik justru membuat Opus 5 lebih buruk. Bukan lebih buruk secara halus. Terukur lebih mahal, terukur lebih bertele-tele, dan dalam satu kasus benar-benar rusak.

Alasannya sederhana. Opus 5 sudah melakukan, dengan sendirinya, beberapa hal yang dulu harus Anda minta. Ketika prompt lama Anda tetap meminta, instruksi tersebut bercampur dengan perilaku yang sudah dimiliki model. Anda mendapatkan dua kali verifikasi, bukan dua kali akurasi.

tombol

Panduan ini membahas setiap pergeseran perilaku yang didokumentasikan dengan cuplikan prompt yang dapat Anda salin-tempel ke dalam prompt sistem Anda hari ini. Ini juga mencakup dua mode kegagalan yang muncul saat Anda menonaktifkan pemikiran, yaitu satu-satunya tempat di mana prompt Opus 5 dapat menghasilkan output yang terlihat baik dan secara diam-diam merusak loop agen. Jika Anda masih mengerjakan perubahan tingkat kode, panduan migrasi Opus 4.8 ke Opus 5 mencakup hal-hal tersebut secara terpisah. Dan jika Anda ingin melihat perubahan perilaku ini dalam payload permintaan dan respons yang sebenarnya, Apidog adalah cara mudah untuk mengirim prompt yang sama dengan pengaturan berbeda dan membedakan hasilnya.

Ringkasan singkat

Opus 5 lebih banyak memverifikasi, lebih banyak menulis, lebih banyak mendelegasikan, dan lebih banyak menjelaskan dirinya sendiri dibandingkan Opus 4.8. Prompt Opus 4.8 Anda disesuaikan untuk mendorong model ke arah perilaku tersebut. Sekarang, prompt tersebut mendorong lebih dari itu.

Jadi, pekerjaannya adalah pengurangan. Anda lebih banyak menghapus instruksi, bukan menambahkannya. Penambahan yang Anda lakukan adalah batasan: jadilah lebih singkat, tetap dalam cakupan, jangan membuat pembantu.

1. Hapus instruksi verifikasi Anda

Ini adalah yang paling penting, dan ini adalah alasan di balik judul.

Anthropic menyatakan bahwa Opus 5 memverifikasi pekerjaannya sendiri tanpa diminta. Ia membaca ulang apa yang ditulisnya, memeriksa aritmetikanya, menjalankan ulang tes, dan mencari kasus ekstrem yang tidak Anda sebutkan. Itu adalah perilaku persis yang semua orang masukkan secara manual ke Opus 4.8 dengan baris seperti “periksa ulang pekerjaan Anda sebelum merespons” atau “verifikasi setiap langkah.”

Teruskan baris-baris itu dan Anda akan mendapatkan verifikasi berlebihan. Model menjalankan verifikasi yang seharusnya sudah dijalankan, ditambah yang Anda minta, dan Anda membayar untuk setiap tokennya. Pada proses agen yang panjang, ini adalah tagihan nyata, bukan kesalahan pembulatan.

Solusinya adalah penghapusan. Cari pola-pola ini di prompt sistem Anda dan hapus:

Double-check your work before responding.
Verify each step before moving to the next one.
Review your answer for errors, then revise it.
Check your reasoning carefully.
Make sure the output is correct before returning it.

Jika Anda memiliki langkah yang benar-benar berisiko tinggi di mana Anda menginginkan verifikasi eksplisit, batasi hanya pada langkah tersebut daripada menjadikannya aturan global:

Do not add general verification passes; you already verify by default.
The only exception: after writing the migration SQL, run it against the
schema dump once and report any mismatch. Do not re-verify anything else.

Bentuk itu penting. Instruksi global "verifikasi semuanya" pada Opus 5 adalah pengali biaya. Satu pengecualian yang dibatasi adalah sebuah kontrol.

Jika Anda melacak pengeluaran API dalam migrasi ini, pengungkit cache dan batch dalam perincian harga Opus 5 selaras dengan ini, dan panduan kami untuk memotong tagihan API Claude mencakup pengungkit umum.

2. Minta keringkasan secara eksplisit, karena usaha tidak akan menyelesaikannya

Respons default Opus 5 berjalan lebih panjang daripada Opus 4.8. Begitu juga dengan hasil tertulisnya: laporan, ringkasan, dokumen desain, dan README yang dihasilkan saat Anda meminta dokumen.

Inilah bagian yang sering membuat orang bingung. Menurunkan parameter effort tidak akan memperbaikinya. Effort mengontrol seberapa banyak model berpikir. Itu tidak mengontrol seberapa banyak model menulis. Turun dari xhigh ke medium dan Anda memotong token pemikiran sementara respons yang terlihat tetap sepanjang sebelumnya. Jika Anda mengira effort adalah pengatur verbositas, tagihan Anda tidak akan bergerak seperti yang Anda harapkan. Panduan parameter effort Opus 5 mencakup apa yang sebenarnya diubah oleh setiap level.

Panjang adalah masalah prompt, jadi selesaikan di prompt. Spesifikkan batas atas daripada mengatakan “singkat saja”, yang model tafsirkan secara longgar:

Response format: at most 150 words unless I ask for more.
No preamble, no restatement of my question, no summary at the end.
Lead with the answer, then the reasoning if it is needed.

Untuk hasil tertulis, batasi pada artefak dan sebutkan apa yang harus dihilangkan:

Write the migration doc at 800 words maximum.
Include: the breaking changes, the fix for each, and a rollback step.
Exclude: background on the old system, a glossary, and a conclusion section.
If a section would exceed its share, cut examples before cutting steps.

Untuk pekerjaan yang padat kode, batasan yang setara adalah tentang komentar, bukan kode:

Return the diff and nothing else.
No explanation of what you changed unless the change is non-obvious,
in which case one sentence above the hunk.

3. Batasi delegasi subagen

Opus 5 lebih mudah mendelegasikan ke subagen daripada Opus 4.8. Diberikan tugas multi-bagian dan kerangka kerja yang mendukung pembentukan, ia akan menyebar.

Itu seringkali merupakan keputusan yang tepat. Itu juga merupakan keputusan biaya yang dibuat model atas nama Anda, dan setiap subagen membawa konteksnya sendiri dan tagihan tokennya sendiri. Untuk beban kerja yang sensitif terhadap biaya atau latensi, berikan batasan angka daripada menyerahkannya pada penilaian model:

Do not spawn subagents for this task. Handle it in this conversation.

Atau, ketika penyebaran benar-benar berguna tetapi harus dibatasi:

You may delegate to at most 2 subagents, and only for independent
file-level work that can run in parallel.
Do research, planning, and final synthesis yourself in this thread.

Pola yang harus dihindari adalah delegasi demi delegasi: subagen yang dibuat untuk membaca satu file, atau untuk membuat keputusan yang sudah memiliki konteks di thread utama. Jika Anda membangun dengan subagen secara sengaja, panduan kami untuk membuat subagen Kode Claude mencakup sisi kerangka kerja untuk membatasinya.

4. Batasi cakupan secara eksplisit pada tugas-tugas sempit

Opus 5 memperluas cakupan tugas. Minta untuk memperbaiki tes yang gagal dan ia mungkin juga melakukan refaktor helper yang dipanggil oleh tes, memperbarui tanda tipe, dan menambahkan dua kasus uji lagi. Minta untuk mengganti nama variabel dan ia mungkin merapikan fungsi di sekitarnya.

Terkadang ini adalah fitur. Pada tugas yang sempit dan bedah, itu bukan: refaktor yang tidak diminta berarti perbedaan yang lebih besar untuk dibaca oleh peninjau dan jangkauan dampak yang lebih besar untuk perubahan yang seharusnya hanya satu baris.

Nyatakan batasan sebagai batasan, dan sebutkan apa yang dilarang:

Scope: change only the retry-count constant in src/client/http.ts.
Do not refactor surrounding code, do not rename anything, do not add
tests, do not update docs. If you believe another change is required,
stop and tell me instead of making it.

Klausul terakhir itu adalah bagian yang berguna. Tanpa itu, model tidak memiliki cara yang sah untuk mengangkat masalah nyata, sehingga ia akan tetap melakukan perubahan atau mengabaikan pengamatan. Dengan itu, Anda mendapatkan kekhawatiran yang ditandai dan perbedaan yang tidak berubah.

5. Harapkan lebih banyak narasi koreksi, dan matikan jika Anda tidak menginginkannya

Opus 5 menarasikan koreksinya lebih banyak daripada Opus 4.8. Ketika ia berubah pikiran di tengah respons, ia memberi tahu Anda: ia menandai bahwa pendekatan sebelumnya salah, menjelaskan alasannya, dan menjelaskan perubahannya.

Untuk pekerjaan interaktif ini berguna. Untuk sebuah pipeline di mana responsnya memberi makan parser, UI, atau model lain, narasi itu adalah gangguan yang berada di bidang yang seharusnya berisi jawaban.

Instruksinya singkat:

Do not narrate corrections or changes of approach.
Return only the final answer. If you revised your thinking, that
revision belongs in your reasoning, not in the response.

Jika Anda mengarahkan respons ke penyimpanan terstruktur, pasangkan itu dengan output terstruktur agar bentuknya dipaksakan daripada diminta.

Mode kegagalan saat pemikiran dinonaktifkan

Segala sesuatu di atas adalah masalah penyetelan. Bagian ini adalah masalah kebenaran.

Anthropic mendokumentasikan dua artefak yang kadang-kadang muncul di Opus 5 ketika pemikiran dinonaktifkan melalui thinking: {type: "disabled"}. Keduanya penting untuk diketahui sebelum Anda meluncurkan agen.

Panggilan alat ditulis sebagai teks biasa. Model mengeluarkan sesuatu yang terlihat seperti panggilan alat, tetapi sebagai teks dalam badan respons daripada sebagai blok tool_use terstruktur. Tidak ada yang dieksekusi. Dalam obrolan satu giliran Anda akan menyadarinya. Dalam loop agen, Anda sering tidak: loop tidak melihat panggilan alat, sehingga tidak mengambil tindakan, dan teks yang bocor tetap ada dalam riwayat percakapan. Giliran berikutnya kemudian membaca teks itu seolah-olah panggilan telah terjadi. Kegagalan ini menumpuk di setiap giliran, dan pada saat output terlihat salah, penyebabnya sudah beberapa giliran yang lalu.

Tag XML internal dalam output yang terlihat. Tag seperti <thinking> muncul dalam respons yang dilihat pengguna. Secara kosmetik buruk dengan sendirinya, dan lebih buruk jika Anda merender respons sebagai HTML atau menguraikannya untuk struktur.

Bagian yang tidak intuitif: menyebutkan tag dalam prompt Anda membuat kebocoran menjadi lebih buruk, bukan lebih baik. Instruksi seperti “jangan pernah mengeluarkan tag <thinking>” menempatkan urutan token dalam konteks dan meningkatkan kemungkinan kemunculannya. Jangan tulis instruksi itu.

Mitigasi yang direkomendasikan Anthropic sendiri sama sekali bukan prompt. Ini adalah untuk tetap mengaktifkan pemikiran dan mengontrol biaya dengan tingkat `effort` yang lebih rendah sebagai gantinya:

{
  "model": "claude-opus-5",
  "max_tokens": 4096,
  "output_config": { "effort": "low" },
  "messages": [
    { "role": "user", "content": "..." }
  ]
}

Itu akan memberi Anda ujung murah dari rentang tanpa artefak `disabled-thinking`. Ini juga menghindari jebakan terkait: pada Opus 5, menggabungkan thinking: {type: "disabled"} dengan `effort xhigh` atau `max` mengembalikan kode 400, karena penonaktifan pemikiran dibatasi pada `high` effort. Perhatikan juga bahwa pemikiran sekarang aktif secara default, jadi permintaan yang hanya menghilangkan bidang thinking akan berjalan dengan pemikiran adaptif daripada tanpa pemikiran, seperti yang akan terjadi pada Opus 4.8.

Jika Anda memiliki persyaratan mutlak untuk menonaktifkan pemikiran, tambahkan pemeriksaan defensif dalam loop Anda daripada instruksi prompt: tolak setiap giliran asisten yang badan teksnya berisi string berbentuk panggilan yang tidak dieksekusi sebelum menambahkannya ke riwayat. Gagal secara tegas daripada membiarkan panggilan hantu masuk ke transkrip.

Uji perubahannya alih-alih menebak

Perubahan prompt sulit dievaluasi dengan membacanya. Perilaku di sini (panjang respons, verifikasi, jumlah subagen) muncul sebagai jumlah token dan struktur payload, yang berarti cara jujur untuk memeriksa pekerjaan Anda adalah dengan mengirimkan permintaan dan membandingkannya.

Itu mudah diatur di Apidog, yang merupakan platform pengembangan dan pengujian API all-in-one:

  1. Buat satu permintaan terhadap endpoint Anthropic Messages dengan "model": "claude-opus-5", dan simpan kunci API Anda sebagai variabel lingkungan daripada menempelkannya ke dalam badan.
  2. Simpan prompt sistem Opus 4.8 lama Anda dan versi Opus 5 yang dipangkas sebagai dua permintaan tersimpan terhadap input yang sama.
  3. Bandingkan blok usage pada setiap respons. Token output memberi tahu Anda apakah batasan keringkasan berhasil; token input dan bidang cache memberi tahu Anda apakah editan prompt Anda merusak prefiks cache.
  4. Duplikasi permintaan di seluruh tingkat `effort` untuk melihat sendiri bahwa token pemikiran berkurang sementara panjang yang terlihat tetap.
  5. Periksa respons streaming untuk mengkonfirmasi panggilan alat tiba sebagai blok tool_use terstruktur dan bukan sebagai teks.

Langkah kelima adalah yang menangkap kegagalan panggilan alat teks biasa sebelum mencapai produksi. Unduh Apidog jika Anda ingin menjalankannya secara berdampingan, dan lihat panduan API Opus 5 untuk bentuk permintaan lengkap.

Batas atas yang jujur

Penting untuk dikatakan secara gamblang, karena panduan prompt cenderung terbaca seolah model adalah satu-satunya yang akan Anda butuhkan: Opus 5 bukanlah puncak tumpukan Claude. Fable 5 tetap mempertahankan sebutan “yang paling mampu dirilis secara luas”, dan Opus 5 masih tertinggal dari Mythos 5 dalam eksploitasi keamanan siber dan penelitian biologi otonom. Anthropic menyatakan kedua hal ini dalam postingan peluncurannya sendiri. Pembingkaian yang akurat adalah kemampuan kelas garis depan dengan setengah harga garis depan, dengan batas atas yang disebutkan di atasnya.

Klaim benchmark peluncuran (Frontier-Bench, ARC-AGI 3, OSWorld 2.0, CursorBench) semuanya adalah angka Anthropic sendiri dan belum direproduksi secara independen pada 25 Juli 2026. Perlakukan mereka sebagai laporan vendor, dan jalankan evaluasi Anda sendiri pada prompt yang benar-benar Anda gunakan.

Merangkai semuanya

Prompt sistem Opus 5 yang dipangkas untuk tugas agen yang sensitif biaya terlihat kira-kira seperti ini:

Do not add verification passes; you verify by default.
Responses: 150 words maximum, no preamble, no closing summary.
Do not spawn subagents. Handle this in one thread.
Stay strictly within the task I state. If another change seems
required, stop and tell me rather than making it.
Do not narrate corrections or changes of approach.

Enam baris, lima di antaranya adalah batasan dan tidak ada yang meminta model untuk berusaha lebih keras. Itulah pergeserannya. Pada Opus 4.8 Anda memberikan prompt untuk menaikkan batas bawah. Pada Opus 5 Anda memberikan prompt untuk menetapkan batas atas.

Mulailah dari sana, lalu lakukan penyapuan `effort` pada evaluasi Anda sendiri daripada membawa pengaturan 4.8 Anda, karena levelnya telah dikalibrasi ulang. Untuk mekanisme parameter lihat panduan parameter effort, untuk alur kerja sisi editor lihat menggunakan Opus 5 di Claude Code, dan untuk gambaran model lengkap mulailah dari apa itu Claude Opus 5. Ikhtisar model Anthropic memiliki tabel spesifikasi saat ini.

FAQ

Haruskah saya benar-benar menghapus “periksa ulang pekerjaan Anda” dari prompt saya? Ya. Panduan prompt Anthropic mengatakan bahwa Opus 5 memverifikasi tanpa diminta, dan instruksi verifikasi yang terbawa akan menyebabkan verifikasi berlebihan. Hapus aturan global. Jika satu langkah spesifik benar-benar memerlukan pemeriksaan eksplisit, batasi instruksi hanya pada langkah tersebut.

Mengapa Opus 5 begitu bertele-tele bahkan pada `effort` rendah? Karena `effort` mengontrol pemikiran, bukan panjang output yang terlihat. Menurunkan `effort` memotong token penalaran sementara respons tetap kira-kira sama panjangnya. Tetapkan batasan kata atau format dalam prompt itu sendiri.

Bagaimana cara menghentikan Opus 5 membuat subagen? Katakan secara langsung: “Jangan membuat subagen; tangani ini dalam percakapan ini.” Jika beberapa penyebaran berguna, berikan batas numerik dan batasi hanya untuk pekerjaan paralel independen.

Mengapa saya melihat tag <thinking> di output saya? Artefak itu kadang-kadang muncul ketika pemikiran dinonaktifkan. Jangan menambahkan instruksi prompt yang menyebutkan tag, karena itu membuat kebocoran lebih mungkin terjadi. Solusi yang direkomendasikan Anthropic adalah tetap mengaktifkan pemikiran dan menggunakan tingkat `effort` yang lebih rendah untuk mengontrol biaya.

Apa yang terjadi jika panggilan alat kembali sebagai teks biasa? Tidak ada yang dieksekusi, dan teks yang bocor tetap ada dalam riwayat percakapan di mana giliran berikutnya memperlakukannya sebagai tindakan yang selesai. Validasi giliran asisten sebelum menambahkannya ke riwayat, dan lebih memilih untuk menjaga pemikiran tetap aktif daripada menonaktifkannya.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.