Jika Anda sedang membangun model terbaru Anthropic dan bertanya-tanya tentang batas laju Claude Fable 5, inilah jawaban jujur di awal: Anthropic tidak merilis sistem batas laju terpisah khusus Fable-5 saat peluncuran. Fable 5 (ID model `claude-fable-5`, dengan harga $10 per juta token masukan dan $50 per juta token keluaran, diluncurkan pada 9 Juni 2026) menggunakan standar yang sama API Pesan dan menggunakan batas laju API berbasis tingkatan standar organisasi Anda. Batas tersebut meningkat seiring penggunaan akun dan riwayat pengeluaran Anda, batas tersebut diberlakukan per organisasi dan per kelas model, dan jumlah persis yang Anda dapatkan tergantung pada tingkatan penggunaan Anda. Kerangka ini penting, karena jika Anda mencoba merencanakan kapasitas untuk agen Fable 5, Anda merencanakan berdasarkan sistem tingkatan Anthropic, bukan berdasarkan angka ajaib yang tercetak pada pengumuman peluncuran. Jika Anda baru mengenal model itu sendiri, gambaran umum Claude Fable 5 adalah bacaan pelengkap yang baik. button TL;DR Claude Fable 5 menggunakan batas laju berbasis tingkatan standar Anthropic: permintaan per menit (RPM) ditambah token masukan per menit (ITPM) dan token keluaran per menit (OTPM), diberlakukan per organisasi dan per kelas model. Batas meningkat seiring pengeluaran kumulatif Anda menaikkan Anda ke tingkatan penggunaan (1 hingga 4). Selalu konfirmasi angka Anda yang sebenarnya di Konsol Anthropic, dan tangani 429 dengan membaca header `retry-after`nya. Bagaimana batas laju Anthropic bekerja Anthropic tidak menetapkan satu "batas API" global. Mereka menjalankan sistem tingkatan penggunaan, dan tingkatan Anda menentukan seberapa banyak throughput yang Anda dapatkan. Ada dua konsep terkait: batas pengeluaran (berapa banyak yang dapat Anda ditagih per bulan kalender) dan batas laju (seberapa cepat Anda dapat memanggil API). Artikel ini tentang yang kedua, tetapi keduanya saling terkait, karena tingkatan Andalah yang memajukan keduanya.

Jenis batas Untuk API Pesan, batas laju diukur dalam tiga dimensi, masing-masing diberlakukan per menit dan per kelas model: * Permintaan per menit (RPM). Berapa banyak panggilan API terpisah yang dapat Anda mulai setiap menit. * Token masukan per menit (ITPM). Berapa banyak token masukan yang dapat Anda kirim setiap menit. Pada sebagian besar model saat ini, hanya token masukan yang tidak di-cache yang dihitung di sini. Token yang dibaca dari cache prompt tidak dihitung terhadap ITPM, itulah sebabnya caching dapat meningkatkan throughput efektif Anda jauh di atas angka mentah. * Token keluaran per menit (OTPM). Berapa banyak token yang dapat dihasilkan model untuk Anda setiap menit. Ini dievaluasi secara real time saat token mengalir keluar, dan batas `max_tokens` Anda tidak mengurangi ini sebelumnya. Mengatur `max_tokens` yang tinggi tidak, dengan sendirinya, memakan OTPM; hanya token yang benar-benar dihasilkan yang dihitung. Anthropic menerapkan ini dengan algoritma token-bucket. Daripada mereset kuota penuh Anda di awal setiap menit, kapasitas Anda diisi ulang terus menerus hingga maksimum Anda. Konsekuensi praktisnya adalah bahwa batas seperti "50 RPM" dapat berperilaku seperti kira-kira satu permintaan per detik, sehingga ledakan panggilan yang ketat dapat memicu batas bahkan ketika rata-rata per menit Anda terlihat baik-baik saja. Lalu lintas yang mulus dan stabil mendapatkan lebih banyak dari angka yang sama daripada lalu lintas yang bergejolak. Per organisasi, per kelas model Dua detail lagi membentuk bagaimana angka-angka tersebut berlaku untuk Anda. Pertama, batas ditetapkan pada tingkat organisasi, bukan per kunci API, sehingga setiap kunci di organisasi Anda mengambil dari kumpulan yang sama (Anda dapat mengukir batas per-ruang kerja yang lebih kecil jika Anda ingin melindungi satu ruang kerja dari yang lain). Kedua, batas diterapkan per kelas model. Itu berarti lalu lintas Fable 5 dan, katakanlah, lalu lintas Opus diukur terhadap wadah terpisah mereka sendiri. Anda dapat menjalankan kelas model yang berbeda hingga batas masing-masing pada saat yang sama tanpa satu pun mengganggu yang lain. Bagaimana tingkatan maju Tingkatan maju secara otomatis saat pembelian kredit kumulatif Anda melewati ambang batas. Menurut tingkatan yang diterbitkan Anthropic (verifikasi status Anda sendiri di Konsol), strukturnya terlihat seperti ini: Tingkat 1 terbuka dengan pembelian kredit $5, Tingkat 2 pada kumulatif $40, Tingkat 3 pada kumulatif $200, dan Tingkat 4 pada kumulatif $400, dengan batas pengeluaran bulanan meningkat di setiap langkah. Anda naik saat Anda melewati ambang batas; Anda tidak perlu mengajukan tiket. Di atas Tingkat 4, batas yang lebih tinggi melalui penjualan atau faktur bulanan. Untuk melihat lebih dalam bagaimana pembelian tersebut diterjemahkan menjadi biaya pada model spesifik ini, rincian harga Claude Fable 5 sangat cocok dengan bagian ini. Apa artinya ini khusus untuk Claude Fable 5 Inilah bagian yang paling ingin orang-orang pastikan. Fable 5 tidak mendapatkan kerangka batas yang eksotis dan spesifik model. Ini masuk ke dalam tabel tingkatan standar sebagai kelas modelnya sendiri, jadi pertanyaan "berapa batas Fable 5 saya?" akan diselesaikan menjadi "tingkat apa organisasi saya, dan apa yang dikatakan baris Fable 5 untuk tingkat itu?". Menurut tingkatan batas laju yang diterbitkan Anthropic (sekali lagi, konfirmasikan milik Anda di Konsol, karena pengaturan khusus dan perusahaan berbeda), baris Fable 5 skalanya kira-kira seperti ini: * Tingkat 1: 50 RPM, 100.000 ITPM, 20.000 OTPM. * Tingkat 2: 1.000 RPM, 500.000 ITPM, 100.000 OTPM. * Tingkat 3: 2.000 RPM, 1.500.000 ITPM, 300.000 OTPM. * Tingkat 4: 4.000 RPM, 4.000.000 ITPM, 800.000 OTPM. Perlakukan angka-angka tersebut sebagai bentuk sistem, bukan kontrak. Anthropic memperbarui tabel, Tingkat Prioritas dan kesepakatan perusahaan mengubah gambaran, dan Konsol Anda adalah sumber kebenaran. Jika ada angka di sini yang tidak sesuai dengan apa yang ditunjukkan akun Anda, percayai akun Anda. Dimensi yang paling menggigit pada Fable 5 adalah OTPM. Fable 5 dibangun untuk pekerjaan jutaan token, cakrawala panjang, jenis pekerjaan di mana seorang agen bekerja keras melalui tugas besar dan mengeluarkan banyak output di sepanjang jalan. Generasi yang panjang tidak mengonsumsi satu bongkahan besar OTPM di awal; itu mengurangi anggaran output Anda secara bertahap saat mengalir. Jadi satu pekerjaan Fable 5 yang ambisius dapat mendekati batas OTPM Anda untuk jangka waktu yang berkelanjutan, dan jika Anda memicu beberapa pekerjaan seperti itu secara bersamaan, OTPM biasanya merupakan tembok pertama yang Anda temui, bukan RPM. Dua kebiasaan muncul dari itu: ukuran `max_tokens` yang tepat sehingga generasi yang tidak terkendali tidak dapat membengkak, dan streaming output panjang sehingga Anda tidak menahan koneksi terbuka menunggu respons besar yang tidak di-stream (yang juga membantu Anda menghindari batas waktu permintaan). Jika Anda sedang menghubungkan model untuk pertama kalinya, panduan API Claude Fable 5 menjelaskan bentuk permintaan yang berlaku untuk batas-batas ini. Membaca dan memeriksa batas Anda Jangan pernah menebak batas Anda dari postingan blog, termasuk yang ini. Ada dua cara yang dapat diandalkan untuk melihat angka sebenarnya. Yang pertama adalah Konsol Anthropic. Halaman Batas di bawah pengaturan menunjukkan tingkatan organisasi Anda saat ini dan batas laju per model yang berlaku, dan halaman Penggunaan memetakan laju token masukan dan token keluaran aktual Anda dari waktu ke waktu terhadap batas Anda, termasuk tingkat hit cache Anda. Grafik tersebut adalah cara tercepat untuk menjawab "apakah saya punya ruang kepala, atau apakah saya akan menabrak tembok?" sebelum Anda meningkatkan lalu lintas. Yang kedua adalah header respons pada setiap panggilan API. Anthropic mengembalikan serangkaian header `anthropic-ratelimit-*` yang memberi tahu Anda dengan tepat posisi Anda saat itu: * `anthropic-ratelimit-requests-limit` dan `anthropic-ratelimit-requests-remaining` untuk RPM. * `anthropic-ratelimit-input-tokens-limit` dan `anthropic-ratelimit-input-tokens-remaining` untuk ITPM. * `anthropic-ratelimit-output-tokens-limit` dan `anthropic-ratelimit-output-tokens-remaining` untuk OTPM. * Header `*-reset` yang sesuai untuk masing-masing, dalam format RFC 3339, memberi tahu Anda kapan bucket tersebut terisi penuh. Header token yang tersisa dibulatkan ke ribuan terdekat, dan header token gabungan melaporkan batas mana pun yang paling ketat saat ini (misalnya, batas tingkat ruang kerja jika Anda telah mengaturnya). Membaca `*-remaining` pada setiap respons memungkinkan klien Anda membatasi dirinya sendiri sebelum pernah mendapatkan 429, yang merupakan perbedaan antara tekanan balik yang anggun dan aliran kesalahan. Menangani 429 secara anggun Respons 429 berarti Anda mencapai salah satu batas. Isi memberi tahu Anda yang mana, dan, yang terpenting, respons membawa header `retry-after` dengan jumlah detik untuk menunggu sebelum mencoba lagi. Mencoba lagi lebih awal dari `retry-after` akan gagal lagi, jadi patuhilah. Kabar baiknya adalah SDK resmi sudah melakukan hal yang benar. SDK Anthropic secara otomatis mencoba kembali respons 429 dan 5xx dengan backoff eksponensial (dua percobaan ulang secara default), membaca `retry-after` untuk mengatur waktu setiap upaya. Untuk sebagian besar aplikasi, perilaku bawaan itu sudah cukup, dan Anda tidak boleh membuat loop percobaan ulang sendiri kecuali Anda membutuhkan sesuatu yang tidak diberikan SDK kepada Anda. Berikut adalah panggilan dasar dengan Fable 5: ```python import anthropic client = anthropic.Anthropic() # membaca ANTHROPIC_API_KEY dari lingkungan # Tingkatkan max_retries di atas default 2 untuk beban kerja batch yang rentan 429. resilient = client.with_options(max_retries=5) message = resilient.messages.create( model="claude-fable-5", max_tokens=4096, messages=[ {"role": "user", "content": "Draft a release summary for our June changelog."} ], ) print(message.content[0].text) ``` Jika Anda memang membutuhkan kontrol eksplisit, misalnya untuk menampilkan status "kami sibuk, mencoba lagi" di UI Anda sendiri, Anda dapat menangkap pengecualian yang diketik dan membaca header itu sendiri: ```python import anthropic client = anthropic.Anthropic() try: message = client.messages.create( model="claude-fable-5", max_tokens=4096, messages=[{"role": "user", "content": "Summarize this incident report."}], ) except anthropic.RateLimitError as exc: wait_seconds = int(exc.response.headers.get("retry-after", "60")) print(f"Batas laju tercapai. Mundur selama {wait_seconds} detik sebelum mencoba lagi.") ``` Di luar percobaan ulang, perbaikan yang tahan lama untuk tekanan berkelanjutan adalah mengantrekan. Jika lalu lintas Anda bergejolak, masukkan permintaan ke dalam antrean dan kosongkan dengan laju yang dapat diserap oleh tingkatan Anda, menggunakan header `anthropic-ratelimit-*-remaining` untuk mengatur kecepatan pengosongan. Itu mengubah tembok 429 menjadi pipa yang mulus, sedikit lebih lambat, yang hampir selalu Anda inginkan. Disiplin pembatasan dan antrean yang sama muncul saat Anda menguji API yang dibatasi laju, dan pola dalam menguji API ChatGPT dengan Apidog berpindah langsung ke pekerjaan Claude. Meningkatkan batas Anda dan mengurangi tekanan Ketika Anda terus-menerus menabrak batas, Anda memiliki dua tuas: dapatkan lebih banyak ruang kepala, atau butuh lebih sedikit ruang kepala. Untuk mendapatkan lebih banyak ruang kepala, majukan tingkatan Anda. Karena tingkatan bergerak dengan pembelian kredit kumulatif, penggunaan riil yang stabil secara otomatis menarik Anda naik ke tabel, dan setiap langkah secara signifikan meningkatkan RPM, ITPM, dan OTPM. Jika Anda perlu melompat di depan jadwal otomatis, atau Anda membutuhkan batas khusus atau perusahaan, hubungi penjualan melalui halaman Batas di Konsol; Tingkat Prioritas dan faktur bulanan ada tepatnya untuk beban kerja berkomitmen dan bervolume tinggi. Untuk membutuhkan lebih sedikit ruang kepala, serang throughput token itu sendiri: * Gunakan API Batch untuk pekerjaan yang tidak sensitif terhadap latensi. Ini memproses permintaan API Pesan secara asinkron dengan biaya sekitar 50 persen dari biaya standar, dan memiliki kumpulan batas laju terpisah sendiri, sehingga menjaga pekerjaan massal agar tidak bersaing dengan lalu lintas langsung dan interaktif Anda. * Aktifkan prompt caching untuk konteks yang berulang. Karena token masukan yang di-cache umumnya tidak dihitung terhadap ITPM, caching prompt sistem, set alat, atau dokumen referensi yang besar di seluruh batch Fable 5 dapat melipatgandakan throughput masukan efektif Anda tanpa menyentuh tingkatan Anda. Perhatikan tingkat hit cache Anda di halaman Penggunaan untuk mengonfirmasi bahwa itu berjalan. * Ukuran `max_tokens` yang tepat. Tidak ada penalti OTPM untuk batas yang tinggi, tetapi `max_tokens` yang murah hati memang memungkinkan satu respons berjalan panjang dan mengurangi OTPM lebih lama. Atur ke apa yang sebenarnya dibutuhkan tugas. * Streaming output panjang. Streaming melindungi Anda dari batas waktu permintaan pada generasi besar dan memungkinkan Anda melihat output terakumulasi secara real time, yang secara alami berpasangan dengan membaca header OTPM. Teknik-teknik ini saling melengkapi. Pipa Fable 5 yang di-cache, di-batch, dan di-stream dengan baik dapat melakukan lebih banyak pekerjaan dalam tingkatan yang sama daripada yang sederhana. Untuk beban kerja gaya agen secara khusus, panduan agen Claude Fable 5 menunjukkan bagaimana tuas-tuas ini cocok dengan loop yang berjalan lama. Dan jika Anda membandingkan kelas model untuk pekerjaan yang sensitif terhadap throughput, panduan API Claude Opus 4.8 dan catatan harga Opus 4.8 adalah titik referensi yang berguna, karena setiap kelas model memiliki bucket batasnya sendiri yang terpisah. Pantau penggunaan Fable 5 Anda dengan Apidog Cara terbersih untuk memahami batas Anda yang sebenarnya adalah dengan melihatnya pada permintaan langsung, dan klien API membuatnya konkret. Dengan Apidog, Anda dapat membangun permintaan Fable 5 terhadap API Pesan, mengirimkannya, dan memeriksa respons lengkap, termasuk header `anthropic-ratelimit-*` dan objek `usage` yang melaporkan jumlah token masukan, keluaran, dan yang di-cache untuk panggilan tersebut. Melihat angka-angka itu berdampingan, permintaan demi permintaan, memberi tahu Anda seberapa dekat Anda berjalan ke ITPM dan OTPM, dan seberapa banyak caching benar-benar menghemat Anda, tanpa menunggu 429 untuk mengetahuinya.

Sebuah loop praktis saat Anda membangun: kirim prompt Fable 5 yang representatif di Apidog, baca nilai `anthropic-ratelimit-output-tokens-remaining` dan `usage.output_tokens` dari respons, dan perhatikan seberapa cepat generasi panjang mengurangi hitungan yang tersisa. Kemudian tambahkan prompt sistem yang di-cache, kirim lagi, dan konfirmasikan `usage.cache_read_input_tokens` meningkat sementara konsumsi ITPM Anda hampir tidak bergerak. Perbandingan dua permintaan itu mengubah tabel tingkatan abstrak menjadi pemahaman tentang ruang kepala Anda sendiri. Anda juga dapat menyimpan permintaan, mengubah `max_tokens`, dan melihat bagaimana konsumsi OTPM melacak output aktual daripada batas Anda, yang merupakan cara tercepat untuk meyakinkan diri sendiri bahwa `max_tokens` yang tinggi aman. Unduh Apidog jika Anda ingin menjalankan eksperimen itu dengan kunci Anda sendiri, dan perhatikan header respons saat Anda menyetel laju permintaan Anda. Tim yang sudah terstandardisasi pada Apidog untuk desain dan pengujian API dapat menggabungkan pemantauan Fable 5 ke dalam ruang kerja yang sama yang mereka gunakan untuk segala hal lainnya.
