Claude Sonnet 5.5 vs Sonnet 5: Perbedaan, Dampak Perubahan, dan Cara Mengatasi Sebelum Beralih

Sonnet 5.5 lawan Sonnet 5: harga yang sama $2/$10, skor jauh lebih tinggi, dan lima perubahan besar yang mengembalikan kode 400. Kesalahan persis dan perbaikan JSON sebelum/sesudah.

Medy Evrard

29 September 2026

Claude Sonnet 5.5 vs Sonnet 5: Perbedaan, Dampak Perubahan, dan Cara Mengatasi Sebelum Beralih

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Claude Sonnet 5.5 (claude-sonnet-5-5, dirilis 28 September 2026) biayanya sama dengan Sonnet 5, $2 per juta token masukan dan $10 per juta keluaran, dan menggunakan tokenizer yang sama. Ini jauh lebih kuat, dan Anthropic mengatakan 30%+ lebih cepat. Pada tabel peluncuran, Terminal-Bench 4.0 naik dari 10.3% menjadi 70.6%, CursorBench 4.0 dari 34.1% menjadi 55.5%, dan OSWorld 2.1 dari 57.0% menjadi 80.1%. Namun, ada kendala pada API. Lima bentuk permintaan yang berfungsi di Sonnet 5 kini mengembalikan kode 400, dan satu perubahan mengubah bentuk respons tanpa kesalahan. Kesimpulan: tingkatkan, tetapi perbaiki enam hal tersebut terlebih dahulu.

Di bawah: setiap perubahan yang merusak dengan kesalahan persisnya dan JSON sebelum/sesudah, kemudian daftar periksa. Untuk spesifikasi, lihat apa itu Claude Sonnet 5.5; untuk lompatan sebelumnya, Claude Sonnet 5 vs Sonnet 4.6. Apidog menjaga permintaan lama dan baru berdampingan saat Anda menguji.

Sonnet 5 vs Sonnet 5.5 sekilas

Claude Sonnet 5 Claude Sonnet 5.5
Harga per MTok (masukan / keluaran / baca cache) $2 / $10 / $0.20 $2 / $10 / $0.20
Konteks dan keluaran Konteks 1M Konteks 1M, keluaran 128K
thinking.type yang diterima adaptive, disabled adaptive, between_tools
display default omitted omitted
Upaya low hingga max Level yang sama, dikalibrasi ulang; API default high
Prompt minimum yang dapat di-cache 1,024 token 512 token
Upaya per pesan, pesan sistem pertengahan percakapan Tidak Ya
tool_choice paksa Didukung Error 400
Pengaman siber gaya Opus Tidak Ya; siber berisiko tinggi kembali ke Sonnet 5
Blok pemikiran Tidak ada pemeriksaan percakapan Terikat pada model, percakapan, dan akun
Terminal-Bench 4.0 10.3% 70.6%
CursorBench 4.0 34.1% 55.5%
FrontierCode 1.1 (Utama) 42.4% 46.2% (maks), 52.1% (xhigh)
GDPval-AA v2.1 (Elo) 1449 1844
OSWorld 2.1 (parsial) 57.0% 80.1%
HLE (dengan alat) 54.9% 64.5%
Pensiun Masih berfungsi sebagai cadangan siber Tidak lebih cepat dari 28 September 2027

Anthropic menjalankan Terminal-Bench, HLE, dan OSWorld; Cursor menjalankan CursorBench, Cognition FrontierCode, dan Artificial Analysis GDPval-AA. Tes Terminal-Bench sendiri dari Artificial Analysis memberikan 63.6% berbanding 14.1%, sehingga kesenjangan tetap ada. FrontierCode memiliki dua angka 5.5 karena pada level maks, ia lebih sering menyebarkan subagen peninjau, dan benchmark memberi sanksi untuk editan di luar cakupan. Lihat benchmark Claude Sonnet 5.5.

Lima perubahan yang merusak

Masing-masing mengembalikan 400 invalid_request_error untuk kode yang berjalan dengan baik di Sonnet 5.

1. thinking: disabled tidak ada lagi; kirim between_tools

Sonnet 5.5 menolak thinking: {"type": "disabled"}:

"thinking.type.disabled" is not supported for this model. Use "thinking.type.between_tools" for the lowest thinking setting, or "thinking.type.adaptive" and "output_config.effort" to control thinking behavior.

Kirim between_tools, pengaturan terendah. Ini melewati pemikiran awal; catatan kemajuan antara panggilan alat masih tiba sebagai blok thinking, yang Anda teruskan kembali tanpa perubahan. Ini hanya berfungsi pada upaya low, medium atau high, tidak mengambil bidang lain (display, budget_tokens atau block_binding mengembalikan 400), dan mengunci upaya untuk percakapan.

// Before (claude-sonnet-5)
{"model": "claude-sonnet-5", "max_tokens": 16000,
 "thinking": {"type": "disabled"},
 "output_config": {"effort": "xhigh"}}

// After (claude-sonnet-5-5)
{"model": "claude-sonnet-5-5", "max_tokens": 16000,
 "thinking": {"type": "between_tools"},
 "output_config": {"effort": "high"}}

Jika Anda membutuhkan xhigh atau max, hilangkan thinking agar pemikiran adaptif berjalan.

2. tool_choice paksa mengembalikan 400

tool_choice berupa any atau tool gagal, termasuk pada endpoint penghitungan token:

tool_choice: type "tool" and "any" are not supported for this model.

Kirim auto, tandai alat strict: true (setiap objek membutuhkan additionalProperties: false), dan sebutkan di prompt kapan harus menggunakannya. Model sekarang dapat membalas dalam teks, jadi tangani giliran tanpa panggilan alat.

// Before (claude-sonnet-5)
"tool_choice": {"type": "tool", "name": "get_weather"}

// After (claude-sonnet-5-5)
"tools": [{"name": "get_weather",
  "input_schema": {"type": "object",
    "properties": {"location": {"type": "string"}},
    "required": ["location"], "additionalProperties": false},
  "strict": true}],
"tool_choice": {"type": "auto"},
"messages": [{"role": "user",
  "content": "What's the weather in Paris? Use the get_weather tool."}]

Batasnya adalah 20 alat ketat per permintaan. Di Amazon Bedrock, alat ketat tidak tersedia untuk Sonnet 5.5: kirim auto tanpa strict dan validasi masukan dalam kode Anda.

3. Blok pemikiran terikat pada model, percakapan, dan akun

Setiap blok pemikiran Sonnet 5.5 ditandatangani di atas segala sesuatu sebelumnya: system, tools, dan pesan-pesan sebelumnya. Untuk akun yang dibuat pada atau setelah 31 Agustus 2026 (00:00 UTC), memutar ulang blok setelah pengeditan mengembalikan 400 pada Claude API, Bedrock, dan Google Cloud:

messages.1.content.0: Invalid `signature` in `thinking` block. The block is bound to a different conversation. Remove the block, or set `thinking.block_binding.prefix_mismatch_behavior` to "drop_block".

Akun lama tidak menerapkan ini secara default, sehingga eksekusi bersih pada kunci lama tidak membuktikan apa-apa. Jaga percakapan bersifat append-only dan ubah instruksi atau alat dengan pesan sistem pertengahan percakapan. Jika Anda harus mengedit, kirim anthropic-beta: thinking-binding-controls-2026-08-01 dan hilangkan blok yang tidak cocok:

"thinking": {"type": "adaptive",
  "block_binding": {"prefix_mismatch_behavior": "drop_block"}}

Itu hanya berfungsi dengan pemikiran adaptif; dengan between_tools, lepaskan blok pemikiran dari giliran yang diedit. Sonnet 5.5 membaca blok dari Sonnet 5, Opus 4.8, Haiku 4.5, dan yang lebih lama; ia menghilangkan blok Opus 5, Opus 5.5, Fable, dan Mythos, serta blok Sonnet 5.5 dari akun lain, tanpa menyebabkan permintaan gagal. Tidak ada model lain yang membaca bloknya. Lihat pemikiran yang dipertahankan Claude Fable 5.1.

4. computer_20251124 gagal di Claude API dan Google Cloud

Di sana, penggunaan komputer membutuhkan set alat baru. Kesalahannya dimulai:

'claude-sonnet-5-5' does not support tool types: computer_20251124.
// Before (claude-sonnet-5)
"tools": [{"type": "computer_20251124", ...}]

// After (claude-sonnet-5-5, Claude API and Google Cloud)
"tools": [{"type": "computer_toolset_20260801"}]

Buang header beta penggunaan komputer lama dan perbarui loop Anda untuk blok tool_use anggota, tindakan yang dikelompokkan, dan toolset_name pada hasil. Bedrock masih menerima computer_20251124; computer_20250124 gagal di mana pun.

5. Beberapa pasangan penasihat ditolak

Dengan alat penasihat (beta), eksekutor Sonnet 5.5 hanya menerima Opus 5, Opus 5.5, Sonnet 5.5, Fable 5, Fable 5.1, Mythos 5 atau Mythos 5.1 sebagai penasihat. Penasihat Sonnet 5, Opus 4.8, dan Opus 4.7 kini mengembalikan 400. Saran juga tiba terenkripsi sebagai blok advisor_redacted_result, jadi kode yang mengurai teks saran tidak mendapatkan apa-apa.

Perubahan senyap: teks antar panggilan alat berpindah ke blok pemikiran

Yang ini tidak menyebabkan kegagalan apa pun. Pada Sonnet 5, catatan antar panggilan alat kembali sebagai text. Pada Sonnet 5.5, apa pun yang lebih panjang dari satu atau dua kalimat tiba sebagai blok thinking pembaruan kemajuan, kosong di bawah default display: "omitted". UI agen yang mengalirkan catatan tersebut menjadi hening, tanpa kesalahan. Tiga perbaikan:

// Header: anthropic-beta: thinking-display-updates-2026-08-18
"thinking": {"type": "adaptive", "display": "updates"}

Perubahan perilaku tanpa perubahan kode

Ini tidak menggagalkan permintaan, tetapi mengubah keluaran dan biaya. Panduan prompting memiliki perbaikan.

Biaya per tugas: harga sama, lebih sedikit dolar per hasil

Posting peluncuran Anthropic mengatakan Sonnet 5.5 “biayanya hingga 30% lebih murah per tugas daripada pendahulunya” dalam pengujiannya. Harga identik, jadi penghematan berasal dari token dan langkah yang lebih sedikit. Grafik per-upayanya menunjukkan upaya yang lebih rendah pada 5.5 mengalahkan kinerja terbaik Sonnet 5:

Benchmark (grafik Anthropic) Sonnet 5.5 Sonnet 5, kinerja terbaik
Terminal-Bench 4.0 28.8% pada medium, $0.83 10.3% pada max, $11.62
FrontierCode 1.1 49.4% pada high, $0.42 42.7% pada xhigh, $10.07
CursorBench 4.0 35.8% pada low, $0.50 34.1% pada max, $7.17

Biaya CursorBench adalah perkiraan Anthropic pada harga daftar. Sisi lain adalah max: menurut tulisan OfficeChai tentang data Artificial Analysis, Sonnet 5.5 pada max menggunakan sekitar 193.000 token keluaran per tugas indeks, dan biaya per tugas berjalan sekitar 50% di atas Sonnet 5. Penghematan ada pada high dan di bawahnya; lihat harga Claude Sonnet 5.5.

Daftar periksa migrasi

Tukar claude-sonnet-5 dengan claude-sonnet-5-5, lalu jalankan enam pemeriksaan dari panduan migrasi Anthropic:

  1. Ganti disabled dengan between_tools, pada upaya high atau di bawahnya.
  2. Ganti tool_choice paksa dengan auto, strict: true dan baris prompt (di Bedrock, validasi dalam kode).
  3. Jaga riwayat bersifat append-only; gunakan pesan sistem pertengahan percakapan untuk perubahan.
  4. Pindahkan penggunaan komputer ke computer_toolset_20260801 pada Claude API dan Google Cloud.
  5. Pilih penasihat yang didukung, dan berhenti mengurai teks saran.
  6. Atur thinking.display jika UI Anda menampilkan teks antar panggilan alat.

Kemudian jalankan ulang penyaringan upaya Anda. Claude Code dapat mengotomatiskan migrasi:

/claude-api migrate this project to claude-sonnet-5-5

Ekuivalen Opus adalah Migrasi Claude Opus 5.5 vs Opus 5.

Ubah migrasi menjadi tes regresi di Apidog

Di Apidog, simpan tiga permintaan ke https://api.anthropic.com/v1/messages dalam satu proyek, semuanya pada lingkungan yang sama:

  1. Dasar: body Sonnet 5 Anda saat ini.
  2. Body lama, model baru: hanya model yang diubah menjadi claude-sonnet-5-5. Tegaskan status 400 dan pesan kesalahan yang menyebutkan between_tools atau tool_choice.
  3. Dimigrasikan: body yang diperbaiki. Tegaskan status 200, stop_reason yang bukan refusal atau max_tokens, dan blok tool_use untuk permintaan alat.

Simpan ANTHROPIC_API_KEY di lingkungan dan referensikan sebagai {{ANTHROPIC_API_KEY}} di header x-api-key. Bandingkan usage.output_tokens di seluruh tingkat upaya untuk angka biaya-per-tugas Anda sendiri. Disimpan sebagai skenario pengujian, regresi ke disabled menggagalkan eksekusi alih-alih produksi. Dasar-dasar permintaan: cara menggunakan Claude Sonnet 5.5 API.

FAQ

Apakah Claude Sonnet 5.5 lebih mahal daripada Sonnet 5? Tidak. Keduanya berharga $2/$10 per juta token dengan pembacaan cache $0.20, dan tokenizernya sama.

Mengapa saya mendapatkan "thinking.type.disabled is not supported" di Sonnet 5.5? disabled telah dihapus. Kirim thinking: {"type": "between_tools"} pada upaya low, medium atau high, tanpa bidang thinking lainnya.

Apakah percakapan Sonnet 5 dapat ditransfer ke Sonnet 5.5? Ya. Sonnet 5.5 membaca blok pemikiran Sonnet 5. Kembali ke Sonnet 5 akan menghilangkannya: tidak ada model lain yang membaca blok Sonnet 5.5.

Haruskah saya memindahkan semuanya ke Sonnet 5.5? Untuk sebagian besar beban kerja, ya. Perhatikan pekerjaan terkait siber, yang mungkin kembali ke Sonnet 5, dan panggilan alat Bedrock, yang kehilangan mode ketat. Panduan Claude Sonnet 5 kami mencakup model yang Anda tinggalkan.

Langkah Anda berikutnya

Simpan permintaan Sonnet 5 Anda dan kembarannya 5.5 secara berdampingan, konfirmasi 400, perbaiki, dan alihkan lalu lintas setelah perbaikan berhasil. Unduh Apidog untuk membangun tes tersebut.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.