Claude Opus 5 dirilis pada 24 Juli 2026, dan Anthropic kini mengarahkan developer ke sana terlebih dahulu: dokumentasi menyatakan bahwa jika Anda tidak yakin model mana yang akan digunakan, mulailah dengan Claude Opus 5. ID model API adalah string persis claude-opus-5, tanpa sufiks tanggal.
Panduan ini membahas seluruh proses: mendapatkan kunci, mengirim permintaan pertama, streaming, penggunaan alat, pemikiran adaptif, parameter effort, dan membaca objek usage untuk mengonfirmasi bahwa cache prompt Anda berfungsi. Setiap permintaan di sini adalah HTTP biasa dengan JSON masuk dan JSON keluar, sehingga Anda dapat membangun dan men-debugnya di Apidog sebelum Anda mengintegrasikannya ke dalam kode aplikasi.
Dua perubahan dari Opus 4.8 akan memengaruhi Anda pada panggilan pertama, jadi perubahan tersebut dibahas sebelum yang lainnya. Jika Anda memigrasikan layanan yang sudah ada daripada memulai dari awal, bacalah panduan migrasi Opus 4.8 ke Opus 5 secara lengkap bersama dengan panduan ini.
Sebelum panggilan pertama Anda: dua perubahan yang memutus
1. Pemikiran diaktifkan secara default. Pada Opus 4.8, permintaan tanpa bidang thinking berjalan tanpa pemikiran sama sekali. Pada Opus 5, permintaan yang sama berjalan dengan pemikiran adaptif. max_tokens masih merupakan batas keras pada token pemikiran ditambah token respons secara bersamaan, jadi badan permintaan yang Anda salin dari integrasi 4.8 yang berfungsi kini dapat terpotong di tengah jawaban. Jika max_tokens Anda disetel secara ketat berdasarkan panjang output yang diharapkan, tingkatkan.
2. Menonaktifkan pemikiran membatasi tingkat upaya Anda. Mengirim thinking: {"type": "disabled"} bersama dengan upaya xhigh atau max akan mengembalikan 400. Anthropic memberlakukan ini per permintaan, sehingga gagal segera daripada menurun secara diam-diam. Solusinya adalah memilih salah satu: biarkan pemikiran aktif dan turunkan upaya untuk mengontrol biaya, atau biarkan pemikiran dinonaktifkan dan batasi upaya pada high.
Saran Anthropic sendiri adalah opsi pertama. Dengan pemikiran dinonaktifkan, Opus 5 kadang-kadang menulis panggilan alat sebagai teks biasa (tidak pernah dieksekusi, dan teks yang bocor mencemari giliran berikutnya dalam sebuah agen) dan kadang-kadang membocorkan tag <thinking> ke dalam output yang terlihat. Membiarkan pemikiran aktif dan mengurangi upaya menghindari keduanya.
Kedua perubahan didokumentasikan dalam panduan migrasi model Anthropic.
Langkah 1: Dapatkan kunci API
Masuk ke Platform Developer Claude, buka bagian kunci API dari pengaturan organisasi Anda, dan buat kunci. Salin sekali; Anda tidak dapat membacanya kembali nanti.
Simpan dalam variabel lingkungan daripada menempelkannya ke dalam kode:
export ANTHROPIC_API_KEY="sk-ant-..."
Jika Anda menguji di klien GUI, letakkan kunci di variabel lingkungan di sana juga. Di Apidog itu berarti membuat lingkungan (Lokal, Staging, Produksi) dengan variabel ANTHROPIC_API_KEY, kemudian mereferensikan {{ANTHROPIC_API_KEY}} di header. Permintaan yang disimpan tetap dapat dibagikan dengan tim dan rahasia tidak pernah mendarat dalam ekspor koleksi.

Anda juga perlu menambahkan kredit penagihan sebelum permintaan berhasil. Tarif untuk Opus 5 adalah $5 per juta token input dan $25 per juta token output, sama seperti Opus 4.8, dan rincian harga lengkap mencakup tarif caching, batch, dan mode cepat.
Langkah 2: Kirim permintaan pertama Anda
Endpointnya adalah POST https://api.anthropic.com/v1/messages. Tiga header yang penting: kunci Anda, versi API, dan tipe konten.
curl https://api.anthropic.com/v1/messages \
--header "x-api-key: $ANTHROPIC_API_KEY" \
--header "anthropic-version: 2023-06-01" \
--header "content-type: application/json" \
--data '{
"model": "claude-opus-5",
"max_tokens": 4096,
"messages": [
{"role": "user", "content": "Jelaskan perbedaan antara 429 dan 529 dari perspektif API."}
]
}'
Perhatikan nilai max_tokens. 4096 adalah peningkatan yang disengaja dari 1024 yang Anda lihat di sebagian besar cuplikan pemula, karena token pemikiran sekarang berasal dari anggaran yang sama.
Setara Python melalui SDK resmi:
import os
from anthropic import Anthropic
client = Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])
message = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
messages=[
{"role": "user", "content": "Jelaskan perbedaan antara 429 dan 529 dari perspektif API."}
],
)
for block in message.content:
if block.type == "text":
print(block.text)
Loop di atas message.content bukanlah dekorasi. Respons content adalah array blok yang diketik, dan dengan pemikiran aktif Anda sekarang akan melihat blok thinking sebelum blok text. Kode yang mengasumsikan content[0].text adalah jawabannya akan rusak pada Opus 5. Ini adalah kegagalan pembaruan tunggal yang paling umum, dan mudah terlewatkan karena permintaan masih mengembalikan 200.
Beberapa spesifikasi yang perlu Anda perhatikan saat membangun: Opus 5 memiliki jendela konteks 1 juta token sebagai default dan maksimum (tanpa header beta, tanpa premi harga konteks panjang), output maksimum 128 ribu pada Messages API, dan pemotongan pengetahuan Mei 2026. Ikhtisar model memiliki tabel lengkap, dan penjelasan Opus 5 kami mencakup sisa lembar spesifikasi.
Langkah 3: Bekerja dengan pemikiran adaptif
Pemikiran adaptif berarti model memutuskan seberapa banyak penalaran internal yang layak diterima suatu permintaan. Anda tidak menetapkan anggaran token. Anda mengarahkannya dengan upaya, yang dibahas pada langkah berikutnya.
Apa yang perlu Anda tangani dalam kode:
- Parse blok berdasarkan jenis. Filter pada
block.type == "text"untuk jawaban yang terlihat danblock.type == "thinking"jika Anda ingin mencatat penalaran. - Kirim blok pemikiran kembali tanpa perubahan. Dalam loop multi-giliran dan penggunaan alat, tambahkan array konten lengkap asisten ke riwayat pesan Anda daripada merekonstruksinya dari teks. Menghapus blok di tengah percakapan akan menurunkan loop.
- Anggaran
max_tokensuntuk keduanya. Pemikiran ditambah respons berbagi batas. Pemotongan muncul sebagaistop_reason: "max_tokens", jadi pastikan pada bidang tersebut dalam pengujian Anda.
Untuk mematikan pemikiran sepenuhnya:
{
"model": "claude-opus-5",
"max_tokens": 4096,
"thinking": {"type": "disabled"},
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "Kembalikan hanya kode status HTTP."}]
}
Upaya dibatasi pada high dalam permintaan tersebut dengan sengaja. Naikkan ke xhigh dan Anda akan mendapatkan 400 yang dijelaskan di atas.
Langkah 4: Kendalikan biaya dengan output_config.effort
Bidang effort berada di bawah output_config dan dapat berupa low, medium, high, xhigh, atau max. Defaultnya adalah high. Ini adalah parameter yang digambarkan dalam cakupan utama sebagai sakelar antara biaya dan kemampuan; pada API itu adalah satu string dalam badan permintaan Anda.
curl https://api.anthropic.com/v1/messages \
--header "x-api-key: $ANTHROPIC_API_KEY" \
--header "anthropic-version: 2023-06-01" \
--header "content-type: application/json" \
--data '{
"model": "claude-opus-5",
"max_tokens": 65536,
"output_config": {"effort": "xhigh"},
"messages": [
{"role": "user", "content": "Refaktor handler ini untuk mengalirkan respons dan menjaga tekanan balik."}
]
}'
Tiga hal yang perlu diketahui sebelum Anda menyetelnya.
Level dikalibrasi ulang. Anthropic secara eksplisit menyatakan untuk tidak membawa pengaturan upaya Opus 4.8 Anda. low dan medium secara signifikan lebih kuat pada Opus 5 daripada pada model Opus sebelumnya, yang berarti beban kerja yang sebelumnya Anda jalankan pada high sekarang mungkin baik-baik saja dengan lebih murah. Lakukan penyaringan ulang baru terhadap evaluasi Anda sendiri daripada mempercayai pemetaan.
xhigh masih merupakan titik awal yang direkomendasikan untuk pekerjaan pengkodean dan agen. Ini juga di mana max_tokens paling penting. Beri ruang; 64k adalah batas awal yang masuk akal untuk giliran agen yang panjang, itulah sebabnya cuplikan di atas menggunakan 65536.
Upaya yang lebih rendah memotong pemikiran, bukan panjang yang terlihat. Respons default Opus 5 dan hasil yang ditulis lebih panjang dari Opus 4.8. Jika Anda menginginkan output yang lebih pendek, mintalah di prompt. Menurunkan ke low tidak akan melakukannya untuk Anda. Uraian parameter upaya membahas metodologi penyaringan lengkap.
Langkah 5: Alirkan responsnya
Tambahkan "stream": true dan endpoint mengembalikan peristiwa yang dikirim server alih-alih satu badan JSON.
with client.messages.stream(
model="claude-opus-5",
max_tokens=4096,
messages=[{"role": "user", "content": "Buat draf kebijakan coba lagi untuk upstream yang tidak stabil."}],
) as stream:
for text in stream.text_stream:
print(text, end="", flush=True)
final = stream.get_final_message()
print("\n\nusage:", final.usage)
Urutan SSE mentah adalah message_start, kemudian content_block_start / content_block_delta / content_block_stop per blok, kemudian message_delta membawa stop_reason dan jumlah token output akhir, kemudian message_stop.
Dengan pemikiran aktif, Anda akan mendapatkan dua blok konten yang mengalir secara berurutan: blok pemikiran yang deltanya tiba sebagai thinking_delta, kemudian blok teks dengan text_delta. Antarmuka pengguna yang merender setiap delta ke buffer yang sama akan mencetak penalaran model kepada pengguna Anda. Pisahkan mereka dari awal.
Streaming juga merupakan tempat klien GUI mendapatkan tempatnya, karena membaca SSE mentah di terminal itu menyedihkan. Apidog merender aliran peristiwa saat tiba, sehingga Anda dapat mengamati batas blok dan mengonfirmasi asumsi penguraian Anda sebelum menulis satu baris kode penangan.
Langkah 6: Tambahkan penggunaan alat
Definisi alat masuk ke dalam array tools. Model membalas dengan stop_reason: "tool_use" dan blok konten tool_use; Anda mengeksekusi alat dan mengirim hasilnya kembali sebagai blok tool_result dalam pesan pengguna baru.
tools = [
{
"name": "get_order_status",
"description": "Mencari status pesanan pelanggan saat ini berdasarkan ID.",
"input_schema": {
"type": "object",
"properties": {
"order_id": {"type": "string", "description": "ID pesanan, mis. A-10293"}
},
"required": ["order_id"],
},
}
]
message = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
tools=tools,
messages=[{"role": "user", "content": "Bagaimana status pesanan A-10293?"}],
)
if message.stop_reason == "tool_use":
call = next(b for b in message.content if b.type == "tool_use")
result = get_order_status(**call.input)
follow_up = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
tools=tools,
messages=[
{"role": "user", "content": "Bagaimana status pesanan A-10293?"},
{"role": "assistant", "content": message.content},
{"role": "user", "content": [
{"type": "tool_result", "tool_use_id": call.id, "content": result}
]},
],
)
Meneruskan message.content secara langsung sebagai giliran asisten adalah apa yang menjaga blok pemikiran. Jangan membangun kembali giliran itu secara manual.
Dua detail Opus 5 yang penting untuk agen. Overhead prompt sistem penggunaan alat lebih rendah daripada Opus 4.8: 286 token dengan tool_choice diatur ke auto atau none, dibandingkan 290 pada 4.8 dan 675 pada Opus 4.7. Kecil per permintaan, nyata di seluruh jutaan giliran agen. Dan ada header beta, mid-conversation-tool-changes-2026-07-01, yang memungkinkan Anda menambahkan atau menghapus alat antar giliran tanpa membatalkan cache prompt.
Opus 5 juga mendelegasikan ke subagen lebih mudah daripada 4.8. Pada beban kerja yang sensitif biaya, atur cakupan itu secara eksplisit di prompt sistem Anda daripada menemukannya di faktur.
Langkah 7: Baca objek usage untuk cache hits
Setiap respons membawa objek usage. Ini adalah satu-satunya cara jujur untuk mengonfirmasi bahwa caching prompt Anda berfungsi.
"usage": {
"input_tokens": 84,
"cache_creation_input_tokens": 6421,
"cache_read_input_tokens": 0,
"output_tokens": 913
}
Untuk menyimpan blok di cache, tandai dengan cache_control:
{
"model": "claude-opus-5",
"max_tokens": 4096,
"system": [
{
"type": "text",
"text": "<instruksi panjang dan stabil serta materi referensi Anda>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "Pertanyaan satu."}]
}
Panggilan pertama: cache_creation_input_tokens tidak nol dan cache_read_input_tokens adalah 0. Panggilan kedua dengan prefiks yang sama: ini berubah. Jika tidak pernah berubah, prefiks Anda tidak identik byte atau di bawah minimum.
Minimum itu adalah kabar baik di Opus 5. Caching prompt sekarang dimulai pada 512 token, turun dari 1.024 pada Opus 4.8. Prompt yang sebelumnya terlalu pendek untuk di-cache kini di-cache tanpa perubahan kode sama sekali, dan pembacaan cache ditagih $0,50 per juta token dibandingkan dengan tarif input dasar $5. Pastikan pada cache_read_input_tokens di rangkaian pengujian Anda sehingga pengeditan prompt yang secara diam-diam merusak cache muncul sebagai pengujian yang gagal daripada tagihan. Untuk lebih banyak pengungkit, lihat panduan kami tentang memotong tagihan API Claude Anda.
Uji dan debug seluruh alur di Apidog
Semua hal di atas adalah permintaan HTTP dengan header otentikasi, badan JSON, aliran SSE, dan respons yang perlu Anda pastikan. Apidog adalah platform pengembangan API lengkap, dan ini adalah jenis endpoint yang ditanganinya: ia mengirim permintaan, menyimpan kunci, merender aliran, dan menguji respons. Ia tidak menjalankan inferensi atau model rute; panggilan masih ditujukan ke Anthropic.

Pengaturan yang menghasilkan keuntungan pada hari pertama:
- Buat permintaan.
POST https://api.anthropic.com/v1/messagesdengan tiga header, dan kunci diambil dari variabel lingkungan daripada ditempelkan langsung. - Simpan ke koleksi. Tim Anda menggunakan kembali satu bentuk permintaan yang diketahui baik daripada setiap orang membangunnya kembali dari cuplikan blog.
- Fork per tingkat upaya. Duplikasi permintaan dengan
output_config.effortdiatur kelow,medium,high, danxhigh, kirim prompt yang sama ke masing-masing, dan bandingkan kualitas output, latensi, dan jumlah token secara berdampingan. Ini adalah penyaringan upaya yang diminta Anthropic untuk Anda jalankan, dilakukan tanpa menulis kode bantu. - Tonton aliran SSE. Aktifkan
"stream": truedan baca peristiwa saat tiba untuk mengonfirmasi Anda menangani blok pemikiran dan blok teks secara terpisah. - Periksa payload panggilan alat. Ketika
stop_reasonkembali sebagaitool_use, objekinputyang persis diproduksi model ada di sana, yang merupakan cara Anda mengetahuiinput_schemaAnda terlalu longgar. - Pastikan respons. Tambahkan pemeriksaan bahwa
stop_reasonbukanmax_tokens(indikator pemotongan Anda) dan bahwacache_read_input_tokensdi atas nol pada panggilan berulang (indikator caching Anda).
Unduh Apidog jika Anda ingin mengikuti. Pola koleksi yang sama bekerja pada model Claude apa pun, sehingga Anda dapat mengarahkannya ke Sonnet 5 atau permintaan Opus 4.8 yang ada dan membedakan perilakunya.
Kesalahan dan jebakan yang benar-benar akan Anda temui
- 400 pada
thinking: disabledditambah upayaxhighataumax. Sudah dibahas di atas. Turunkan upaya kehighatau aktifkan kembali pemikiran. - 400 pada parameter sampling.
temperature,top_p, dantop_kpada nilai non-default masih mengembalikan 400, tidak berubah dari Opus 4.8. Arahkan melalui prompt sistem sebagai gantinya. - Jawaban terpotong.
stop_reason: "max_tokens"dengan pemikiran aktif berarti batas menelan respons Anda. Tingkatkanmax_tokens. - Priority Tier tidak didukung pada Opus 5. Opus 4.8 menyediakannya. Jika perencanaan kapasitas perusahaan Anda bergantung padanya, itu adalah penghalang nyata yang perlu diselesaikan sebelum Anda mengalihkan lalu lintas.
- Pesan sistem di tengah percakapan sekarang berfungsi. Entri
role: "system"di dalammessagesditerima pada Opus 5, di mana Opus 4.8 mengembalikan 400. Berguna, dan perlu diketahui agar Anda tidak terus mencari cara untuk mengatasinya. - Verifikasi berlebihan. Opus 5 memverifikasi pekerjaannya sendiri tanpa diminta. Jika Anda membawa instruksi "periksa ulang jawaban Anda sebelum merespons" dari 4.8, hapuslah. Itu sekarang tidak memberi Anda apa-apa dan memakan token pemikiran.
Batas jujur
Opus 5 bukanlah puncak tumpukan Claude, dan perlu dikatakan dengan jelas. Fable 5 masih memegang sebutan "paling mampu dirilis secara luas" dari Anthropic, dengan $10 per juta input dan $50 per juta output. Opus 5 juga tertinggal dari Mythos 5 dalam eksploitasi keamanan siber dan penelitian biologi otonom, yang dinyatakan sendiri oleh Anthropic.
Klaim benchmark peluncuran (kira-kira dua kali lipat Opus 4.8 pada Frontier-Bench v0.1, sekitar 3x model terbaik berikutnya pada ARC-AGI 3, dalam 0,5% dari Fable 5 pada CursorBench 3.2) semuanya adalah angka Anthropic sendiri dan belum direproduksi secara independen pada 25 Juli 2026. Bacalah sebagai hasil yang dijalankan vendor, lalu jalankan evaluasi Anda sendiri. Perbandingan Opus 5 versus Fable 5 membahas di mana celah harga layak dan di mana tidak, dan posting peluncuran Anthropic adalah sumber utama untuk klaim itu sendiri.
FAQ
Apa ID model untuk Claude Opus 5? claude-opus-5, persis, tanpa sufiks tanggal. Di Amazon Bedrock itu anthropic.claude-opus-5; Google Cloud dan Claude Platform di AWS menggunakan ID pihak pertama.
Mengapa permintaan Opus 4.8 saya yang berfungsi mulai terpotong pada Opus 5? Pemikiran sekarang aktif secara default. max_tokens membatasi token pemikiran dan token respons secara bersamaan, jadi anggaran yang sesuai untuk jawaban Anda pada 4.8 mungkin tidak sesuai untuk penalaran ditambah jawaban pada Opus 5. Tingkatkan max_tokens dan periksa stop_reason: "max_tokens".
Mengapa saya mendapatkan 400 ketika saya menonaktifkan pemikiran? Anda hampir pasti memasangkan thinking: {"type": "disabled"} dengan output_config.effort diatur ke xhigh atau max. Kombinasi itu ditolak per permintaan. Batasi upaya pada high, atau biarkan pemikiran aktif dan turunkan upaya sebagai gantinya.
Apakah saya memerlukan header beta untuk jendela konteks 1 juta? Tidak. Pada Opus 5, 1 juta token adalah default dan maksimum, tanpa header beta dan tanpa premi harga konteks panjang. Anda memerlukan header beta output-300k-2026-03-24 untuk mencapai output 300k pada Batch API; Messages API membatasi output pada 128k.
Bisakah saya menggunakan kembali pengaturan upaya Opus 4.8 saya? Anthropic mengatakan tidak. Tingkat dikalibrasi ulang, dan low serta medium secara signifikan lebih kuat pada Opus 5. Jalankan penyaringan ulang baru terhadap set evaluasi Anda sendiri.
Apakah Apidog menjalankan modelnya? Tidak. Apidog mengirim, memeriksa, dan menguji permintaan HTTP; inferensi terjadi di pihak Anthropic. Ia menangani kunci, streaming, payload panggilan alat, dan pernyataan respons di sekitar panggilan.
