Moonshot AI merilis Kimi K3 pada 16 Juli 2026, dan liputan peluncurannya membingkai ini sebagai tantangan langsung bagi Anthropic. TechCrunch melaporkan bahwa K3 diharapkan dapat mempersempit kesenjangan dengan model sumber tertutup, mengutip sumber yang mengatakan bahwa K3 bisa menandingi atau bahkan melampaui Claude Opus 4.8. Artikel ini membandingkan keduanya dimensi per dimensi, dengan angka yang dapat kami verifikasi dan yang tidak dapat diverifikasi ditandai dengan jelas.
Versi singkatnya: K3 unggul dalam harga, jendela konteks, dan keterbukaan; Opus 4.8 menawarkan jaminan dari vendor terkelola yang matang. Karena keduanya menggunakan format OpenAI SDK, Anda dapat menjalankan permintaan yang sama melalui masing-masing dan membandingkan hasil, latensi, dan biaya dalam alat seperti Apidog.
TL;DR dan keputusan sekilas
Kimi K3 adalah model mixture-of-experts berparameter 2,8 triliun dengan jendela konteks 1 juta token, harga input murah, dan bobot terbuka yang akan tiba sekitar 27 Juli 2026. Claude Opus 4.8 adalah model proprietary tertutup dalam lini Opus Anthropic, dengan harga lebih tinggi, reputasi penalaran dan agen yang kuat. Penilaian independen dari Artificial Analysis menempatkan K3 pada Intelligence Index 57, peringkat #4 dari 189 model, terbaik di kelasnya di antara bobot terbuka.
Berikut adalah bacaan singkatnya:
- Pilih Kimi K3 untuk jendela konteks yang sangat besar, biaya rendah pada volume tinggi, atau kemampuan untuk menghosting sendiri dan menyempurnakan bobot terbuka.
- Pilih Claude Opus 4.8 untuk hubungan vendor yang matang, dukungan terkelola dan SLA, serta rekam jejak produksi yang panjang dalam pekerjaan agen yang sulit, jika Anda bersedia membayar premium.
- Persaingannya ketat, belum final. Belum ada tabel benchmark K3 versus Opus 4.8 yang independen dan sebanding, jadi perlakukan setiap judul "satu mengalahkan yang lain secara keseluruhan" dengan hati-hati.
Catatan pembingkaian. Model teratas Anthropic yang tersedia secara umum saat ini adalah Claude Fable 5; Opus 4.8 adalah tingkatan kuat di bawah batas itu, bukan yang utama. Blog peluncuran Moonshot mengatakan K3 “masih tertinggal dari model proprietary paling kuat, Claude Fable 5 dan GPT 5.6 Sol,” menyebutkan Fable 5 dan Sol, bukan Opus. Jadi cerita jujurnya bukanlah “model terbuka menggulingkan Anthropic.” Ini adalah “model terbuka mempersempit kesenjangan, unggul dalam harga, konteks, dan keterbukaan, dan hanya tertinggal di tingkat kualitas paling atas.”
Peluncuran, dan mengapa perbandingan ini ada
K3 adalah langkah terbesar Moonshot dalam tangga bobot terbuka, dan dengan total 2,8 triliun parameter, ini adalah model bobot terbuka terbesar dari Tiongkok hingga saat ini. Arsitekturnya mengandalkan Kimi Delta Attention, Attention Residuals, dan desain yang disebut Moonshot sebagai Stable LatentMoE, yang mengaktifkan 16 dari 896 ahli per token. Moonshot belum menerbitkan jumlah parameter aktif, jadi kami tidak akan memperkirakannya. Penjelasan utama tentang apa itu Kimi K3 mencakup arsitektur dan akses secara lengkap.
Perbandingan ini ada karena perusahaan terus bertanya apakah model tertutup yang mahal sepadan ketika model bobot terbuka mendekati kualitas dan berjalan di perangkat keras Anda sendiri. Pembingkaiannya menjadi "K3 vs Opus 4.8" daripada "K3 vs Fable 5" karena Opus 4.8 adalah tingkatan di mana penantang terbuka memiliki peluang yang masuk akal. Laporan TechCrunch memiliki konteks pasar.
Kimi K3 dan Claude Opus 4.8 sekilas
Berikut adalah perbandingan dimensi yang mengubah keputusan pembelian. Jika suatu angka tidak dikonfirmasi secara publik, sel akan menyatakan demikian.
| Dimensi | Kimi K3 | Claude Opus 4.8 |
|---|---|---|
| Vendor | Moonshot AI | Anthropic |
| Diluncurkan | 16 Juli 2026 | Bagian dari lini Claude Opus 4 |
| Tipe model | MoE 2.8T-param (Stable LatentMoE, 16 dari 896 ahli aktif) | Proprietary, arsitektur tidak diungkapkan |
| ID/akses model | kimi-k3, kompatibel OpenAI SDK |
Claude API (keluarga claude-opus-4-8) |
| Jendela konteks | 1.048.576 token (1M) | Besar, tetapi di bawah jendela 1M K3 |
| Harga input | $0.30 / Juta cache hit, $3.00 / Juta cache miss | $5.00 / Juta |
| Harga output | $15.00 / Juta | $25.00 / Juta |
| Kecepatan output | ~62 token/detik (Artificial Analysis) | Tidak dikutip di sini; lihat Artificial Analysis |
| Skor independen | Intelligence Index 57, #4 dari 189 (Artificial Analysis) | Tingkatan proprietary teratas (lihat Artificial Analysis) |
| Bobot | Bobot terbuka, sekitar 27 Juli 2026 | Tertutup |
| Posisi kualitas | Terbaik di antara yang terbuka; tertinggal dari Fable 5 dan GPT 5.6 Sol (Moonshot) | Tingkatan proprietary kuat di bawah batas Fable 5 Anthropic |
Sebagian besar sel mendukung K3 dalam hal ekonomi dan akses. Kualitas adalah baris yang diperdebatkan, dan kita akan membahasnya selanjutnya.
Intelijen dan kualitas: di mana tingkatan teratas masih bertahan
Kualitas adalah dimensi yang paling sulit ditentukan, karena belum ada benchmark independen bersama yang menjalankan K3 dan Opus 4.8 secara langsung. Sinyal independen paling bersih adalah Artificial Analysis, yang Intelligence Index-nya menempatkan K3 di atau dekat batas dalam campuran evaluasi penalaran, pengkodean, dan pengetahuan, serta model bobot terbuka teratas di papan itu. Juga dicatat bahwa K3 berjalan lebih lambat dari rata-rata dan bersifat verbose (bertele-tele).
Bobot penyeimbang berasal dari Moonshot itu sendiri. Blog peluncurannya jujur: kinerja keseluruhan K3 “masih tertinggal dari model proprietary paling kuat, Claude Fable 5 dan GPT 5.6 Sol.” Kalimat itu menyebutkan Fable 5 dan Sol, bukan Opus 4.8. Jadi pengakuan Moonshot sendiri menempatkan K3 di belakang Fable 5 dan Sol, dan tidak mengatakan apa-apa tentang K3 kalah dari Opus 4.8.
Tabel benchmark vendor mendukung hal itu. Berdasarkan angka peluncuran Moonshot, pada pengaturan penalaran maksimum, K3 mengungguli Opus 4.8 di setiap benchmark yang terdaftar:
| Benchmark | Kimi K3 | Claude Opus 4.8 |
|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 84.6 |
| DeepSWE | 67.5 | 59.0 |
| BrowseComp | 91.2 | 84.3 |
| Automation Bench | 30.8 | 27.2 |
| SpreadsheetBench 2 | 34.8 | 31.6 |
Ini adalah angka yang dijalankan vendor, bukan perbandingan langsung independen: laboratorium menerbitkan suite di mana ia terlihat bagus. Tapi ini adalah angka yang diterbitkan Moonshot yang sebenarnya, dan mereka menunjukkan K3 unggul dari Opus 4.8 di semua lini, termasuk pada DeepSWE, metrik pengkodean agen tersulit dalam set tersebut. Untuk tampilan berlabel sumber, lihat rincian benchmark Kimi K3, dan untuk pesaing perbatasan yang benar-benar memimpin K3, Kimi K3 vs GPT-5.6 Sol. Kesimpulan jujurnya: berdasarkan angka yang kami miliki, K3 setidaknya setara dengan Opus 4.8 dan unggul dalam suite Moonshot sendiri. Keunggulan sebenarnya Opus 4.8 bukanlah skor benchmark; melainkan kematangan alat Anthropic, rekam jejak keandalan, dan jaminan vendor terkelola.
Harga: kesenjangan terluas
Biaya adalah titik di mana keduanya paling berbeda, dan angkanya telah diterbitkan. Kimi K3 membebankan $0.30 per juta token untuk input cache-hit, $3.00 untuk input cache-miss, dan $15.00 untuk output. Claude Opus 4.8 membebankan $5.00 untuk input dan $25.00 untuk output. Jadi K3 secara dramatis lebih murah pada input yang di-cache ($0.30 vs $5.00), masih kurang dari setengah harga pada cache miss ($3.00 vs $5.00), dan 40% lebih murah pada output ($15.00 vs $25.00).
Untuk beban kerja yang banyak mengulang konteks, seperti chatbot yang mengirim ulang prompt sistem dan dokumen yang sama, harga cache-hit K3 menghasilkan penghematan besar, dan untuk generasi volume tinggi, selisih output saja dapat mengubah tagihan bulanan. Untuk memodelkan lalu lintas Anda sendiri, panduan harga Kimi K3 menjelaskan setiap tingkatan, dan postingan harga Claude Opus 4.8 melakukan hal yang sama di pihak Anthropic.
Satu peringatan: lebih murah per token tidak selalu berarti lebih murah per tugas. Model yang verbose dapat menghilangkan sebagian keunggulan per-tokennya dengan menghasilkan lebih banyak token, dan Artificial Analysis menandai K3 sebagai verbose, jadi ukur total biaya pada prompt nyata, bukan daftar harga.
Jendela konteks: ruang untuk bekerja
Konteks adalah kemenangan K3 yang jelas di atas kertas. Kimi K3 memiliki jendela token 1.048.576, cukup untuk menampung basis kode yang sangat besar, set dokumen yang panjang, atau riwayat multi-putaran yang diperpanjang dalam satu permintaan tanpa chunking yang agresif. Claude Opus 4.8 juga menawarkan jendela besar, tetapi di bawah batas 1M K3.
Jika beban kerja Anda benar-benar berkonteks panjang (seluruh repositori, satu set kontrak sepanjang buku, korpus penelitian yang panjang dalam satu prompt), K3 memberikan lebih banyak ruang sebelum Anda membangun mesin pengambilan. Tetapi jendela yang lebih besar adalah kemampuan, bukan jaminan kualitas di seluruh rentang, jadi validasi bahwa jawaban tetap akurat jauh ke dalam prompt satu juta token sebelum Anda mengandalkannya.
Keterbukaan: bobot terbuka versus tertutup
Keterbukaan mengubah apa yang diizinkan untuk Anda lakukan dengan model, dan tidak ada jumlah harga atau benchmarking yang dapat menggantikannya. Bobot Kimi K3 akan dirilis sekitar 27 Juli 2026, membuka opsi yang tidak dapat dilakukan model tertutup: self-hosting untuk residensi data atau lingkungan air-gapped, fine-tuning pada data Anda sendiri, dan kebebasan dari batasan tarif atau roadmap vendor tunggal. Untuk industri yang diatur, “bobot berjalan di perangkat keras kami” dapat menjadi faktor penentu terlepas dari skor benchmark.
Claude Opus 4.8 bersifat tertutup. Anda mengaksesnya melalui API Anthropic dan mendapatkan layanan terkelola: hosting yang konsisten, hubungan dukungan, kebijakan yang diterbitkan, dan tidak ada infrastruktur untuk dijalankan. Dokumentasi API Anthropic mencakup keluarga model tersebut. K3 memberikan Anda kendali dan tanggung jawab; Opus memberikan Anda kenyamanan dan vendor untuk diandalkan.
Kecepatan dan latensi
Kecepatan lebih bernuansa daripada satu angka. Artificial Analysis mengukur K3 kira-kira 62 token output per detik, di bawah median ~73 untuk tingkatan harganya, meskipun waktu hingga token pertama adalah ~1.99 detik yang cepat. Jadi K3 terasa responsif di awal balasan tetapi menghasilkan isinya secara perlahan, dan output yang verbose membuat penyelesaian yang panjang terasa lebih lambat. Kami tidak memiliki angka independen yang cocok untuk Opus 4.8, jadi uji benchmark keduanya pada prompt Anda sendiri jika throughput pada output panjang penting.
Matriks keputusan berdasarkan beban kerja
Daripada menobatkan satu pemenang, sesuaikan model dengan pekerjaan.
| Beban Kerja | Lebih cocok | Mengapa |
|---|---|---|
| Tugas berkonteks sangat panjang (repositori utuh, set dokumen besar) | Kimi K3 | Jendela 1M token mengurangi pekerjaan chunking dan pengambilan |
| Generasi volume tinggi, sensitif biaya | Kimi K3 | Tarif input dan output lebih rendah, harga cache-hit yang kuat |
| Self-hosting, residensi data, atau fine-tuning | Kimi K3 | Bobot terbuka sekitar 27 Juli 2026 |
| Batas kualitas penalaran dan agen tersulit | Uji keduanya | Diperdebatkan: Benchmark peluncuran Moonshot sendiri menempatkan K3 di depan Opus 4.8, tetapi itu dijalankan vendor dan Opus memiliki rekam jejak produksi yang lebih panjang pada agen yang kompleks |
| Keandalan dan dukungan penting misi | Claude Opus 4.8 | Layanan komersial terkelola dengan SLA, dukungan, dan kebijakan yang diterbitkan |
| Aplikasi interaktif yang sensitif latensi | Uji keduanya | K3 memiliki waktu ke token pertama yang cepat tetapi generasi lebih lambat, lebih verbose |
| Prototipe dan proyek sampingan dengan anggaran terbatas | Kimi K3 | Jalur termurah menuju kualitas hampir batas |
K3 menguasai ekonomi, konteks, dan kontrol, dan berdasarkan benchmark Moonshot sendiri, ia menandingi atau mengalahkan Opus 4.8 dalam kualitas juga. Yang dimiliki Opus 4.8 adalah kenyamanan vendor terkelola. Kebanyakan tim akan menemukan beberapa beban kerja mengarah ke satu arah dan beberapa ke arah lain, jadi pertahankan keduanya dalam jangkauan daripada menstandardisasi pada satu.
Kasus penggunaan dunia nyata
Startup yang membangun produk analisis dokumen. Kontrak panjang, volume kueri tinggi, margin ketat. Konteks 1M K3 dan harga rendah sangat cocok, dan bobot terbuka memberikan jalur self-hosting jika residensi data menjadi persyaratan di kemudian hari.
Perusahaan yang mengotomatiskan alur kerja agen multi-langkah. Keandalan itu penting dan kesalahan mahal. Benchmark Moonshot menempatkan K3 di depan, tetapi rekam jejak produksi Opus 4.8 yang lebih panjang adalah apa yang dibayar mahal oleh beberapa tim sampai angka-angka itu direproduksi.
Bank yang diatur yang tidak dapat mengirim data ke API pihak ketiga. Perdebatan benchmark tidak relevan: bobot terbuka K3 berjalan di dalam lingkungan bank sendiri, sementara Opus 4.8 sebagai layanan API tertutup mungkin sama sekali tidak dapat dipertimbangkan.
Menguji keduanya dengan permintaan yang sama di Apidog
Perbandingan di atas kertas hanya akan membawa Anda sejauh itu. Karena Kimi K3 kompatibel dengan OpenAI SDK dan Claude Opus 4.8 dapat diakses melalui API-nya sendiri, Anda dapat mengatur keduanya sebagai permintaan di Apidog dan mengirim payload yang sama ke masing-masing.

Buat satu permintaan untuk endpoint K3 dan satu untuk Opus, simpan kunci dan URL dasar Anda sebagai variabel lingkungan, lalu kirim prompt yang sama ke keduanya. Apidog menampilkan badan respons, status, dan waktu untuk setiap panggilan, sehingga Anda dapat membandingkan kualitas jawaban, latensi, dan biaya token pada input yang identik, dan menyimpannya sebagai koleksi memberi Anda perangkat yang dapat diulang untuk dijalankan kembali setiap kali salah satu model diperbarui. Anda dapat melakukan pemeriksaan ini dengan Apidog di dalam VS Code, dan pendekatan ini juga berfungsi sebagai pengujian API tanpa Postman. Unduh Apidog untuk mengaturnya sendiri. Tujuannya: mengganti “model mana yang lebih baik secara umum” dengan “model mana yang lebih baik untuk prompt ini, dengan biaya ini, dengan latensi ini.”
Kesimpulan
Kimi K3 mengalahkan Claude Opus 4.8 secara meyakinkan dalam harga, jendela konteks, dan keterbukaan, dan pada benchmark peluncuran Moonshot sendiri, ia juga mengungguli Opus 4.8 dalam kualitas, meskipun angka-angka tersebut dijalankan vendor dan belum direproduksi secara independen. Yang dipertahankan Opus 4.8 adalah sisi jaminan: vendor terkelola, kebijakan yang diterbitkan, dan rekam jejak keandalan yang terbukti dalam pekerjaan agen yang sulit. Jika beban kerja Anda berkonteks panjang, sensitif biaya, atau membutuhkan self-hosting, K3 adalah pilihan pragmatis; jika Anda menginginkan hubungan komersial dan rekam jejak yang terbukti, Opus 4.8 layak mendapatkan harga premiumnya. Karena belum ada perbandingan langsung independen, uji keduanya pada prompt Anda sendiri sebelum Anda berkomitmen.
Pertanyaan yang sering diajukan
Apakah Kimi K3 lebih baik dari Claude Opus 4.8? Persaingannya ketat, dan berdasarkan angka yang kami miliki, K3 terlihat setidaknya setara. Ia unggul dalam harga, konteks, dan keterbukaan, dan pada benchmark peluncuran Moonshot sendiri, ia mengungguli Opus 4.8 di setiap tugas yang terdaftar, meskipun angka-angka tersebut dijalankan vendor dan belum direproduksi secara independen. Moonshot mengatakan K3 tertinggal dari model proprietary teratas, tetapi ia menyebut Fable 5 dan GPT-5.6 Sol, bukan Opus 4.8, jadi keunggulan sebenarnya Opus 4.8 adalah rekam jejak dan dukungan terkelolanya, bukan keunggulan benchmark.
Seberapa murah Kimi K3? K3 membebankan $0.30 per juta token untuk input cache-hit, $3.00 untuk input cache-miss, dan $15.00 untuk output. Opus 4.8 membebankan $5.00 untuk input dan $25.00 untuk output. Jadi K3 jauh lebih murah pada input yang di-cache, kurang dari setengah harga pada cache miss, dan sekitar 40% lebih murah pada output. Penghematan sebenarnya bergantung pada seberapa banyak input Anda yang dapat di-cache.
Apakah ada benchmark independen yang membandingkan Kimi K3 dan Opus 4.8 secara langsung? Belum ada. Artificial Analysis menyediakan skor Intelligence Index independen untuk model individual, dan Moonshot menerbitkan angka benchmark-nya sendiri, tetapi belum ada tabel K3-versus-Opus-4.8 yang sebanding dan dibagikan. Perlakukan kemenangan yang dilaporkan vendor, termasuk angka “pertama dalam empat dari delapan benchmark otomatisasi”, sebagai laporan mandiri sampai direproduksi secara independen.
Apakah Kimi K3 adalah pesaing Opus 4.8 atau Claude Fable 5? K3 bersaing di seluruh bidang. Liputan peluncuran membingkainya melawan Opus 4.8 karena itu adalah tingkatan yang dapat dicapai secara masuk akal oleh penantang terbuka. Batas saat ini Anthropic adalah Claude Fable 5, yang diakui Moonshot masih tertinggal oleh K3, jadi K3 paling baik dipahami sebagai model yang mendekati bidang proprietary daripada mendudukinya.
