Qwen 3.8 vs Kimi K3: Perbandingan Dua Raksasa Model AI Terbuka Tiongkok

Qwen 3.8-Max vs Kimi K3: parameter, bobot terbuka, modalitas, harga, dan dukungan harness dibandingkan, dengan tinjauan jujur terhadap tolok ukur yang dijalankan vendor.

INEZA Felin-Michel

INEZA Felin-Michel

3 August 2026

Qwen 3.8 vs Kimi K3: Perbandingan Dua Raksasa Model AI Terbuka Tiongkok

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Juli 2026 menjadi bulan persaingan dua kuda untuk model *frontier* berbobot terbuka, dan kedua kuda tersebut berasal dari Tiongkok. Moonshot AI meluncurkan Kimi K3 pada 16 Juli. Tiga hari kemudian, Alibaba memperkenalkan pratinjau Qwen 3.8-Max, lalu menyediakannya secara umum pada awal Agustus. Keduanya adalah model *mixture-of-experts* triliun-parameter. Keduanya menjanjikan (atau menyediakan) bobot terbuka. Keduanya dapat diintegrasikan ke dalam *harness* agen bergaya Claude Code. Dan keduanya mengungguli laboratorium *frontier* AS dalam hal harga.

Kemiripan di permukaan menyembunyikan perbedaan nyata: dalam hal yang dapat Anda unduh hari ini, dalam hal yang dapat dilihat oleh model, dan dalam hal biaya penggunaan berat selama sebulan. Perbandingan ini akan mengulas setiap aspek yang dapat Anda verifikasi per 3 Agustus 2026. Untuk rincian spesifikasi lengkap dari model unggulan baru Alibaba, mulailah dengan penjelasan Qwen 3.8-Max kami dan kembali lagi.

tombol

Satu catatan kejujuran sebelum kita mulai: belum ada *benchmark head-to-head* independen dari kedua model ini. Setiap angka dalam artikel ini berasal dari tabel vendor itu sendiri, dan kami menandai siapa yang menjalankan setiap angka tersebut. Anggap bagian *benchmark* ini sebagai indikasi, bukan sebagai hasil akhir.

Linimasa: siapa yang meluncurkan apa, dan kapan

Urutan rilis lebih penting dari biasanya di sini, karena “bobot terbuka” memiliki arti yang berbeda untuk setiap model saat ini.

Kimi K3 diluncurkan pada 16 Juli 2026. Moonshot menjanjikan bobot terbuka saat peluncuran, dan menepatinya 11 hari kemudian: bobot tersebut tiba di Hugging Face pada 27 Juli sebagai rilis MXFP4 berukuran 594 GB. Sampai hari ini, Anda dapat mengunduh K3, mengkuantisasi lebih lanjut, dan menjalankannya di perangkat keras Anda sendiri. Itu bukan janji. Itu terjadi.

Qwen 3.8-Max diperkenalkan dalam pratinjau pada 19 Juli dan mencapai ketersediaan umum di Alibaba Cloud Model Studio pada awal Agustus, sesuai postingan rilis resmi Qwen. Bobotnya dijanjikan untuk Hugging Face dan ModelScope “minggu depan,” yang berarti sekitar 10 Agustus. Per 3 Agustus 2026, bobot tersebut belum dapat diunduh. Jeda 11 hari K3 sendiri antara peluncuran dan bobot menunjukkan bahwa pola ini normal, namun hari ini hanya salah satu dari model ini yang terbuka dalam praktiknya.

Jika *self-hosting* adalah faktor penentu Anda, fakta tunggal tersebut mungkin mengakhiri perbandingan lebih awal.

Parameter: dua model MoE skala triliun, satu lebih ramping

Kedua model ini adalah desain *sparse mixture-of-experts*, yang berarti jumlah parameter utama dan biaya komputasi per token adalah angka yang sangat berbeda.

Spesifikasi Qwen 3.8-Max Kimi K3
Total parameter 2.4T 2.8T
Parameter aktif per token 95B 104B
Rasio aktivasi ~4% ~3.7%
Basis arsitektur Qwen 3.5 foundation, MoE MoE
Format bobot terbuka Dijanjikan (~10 Agustus) MXFP4, 594 GB di Hugging Face

Qwen 3.8-Max adalah model yang lebih kecil dalam kedua aspek: 400B lebih sedikit total parameter dan 9B lebih sedikit parameter aktif dibandingkan K3. Kedua celah tersebut tidak dramatis, dan jumlah parameter aktif tidak secara linear berarti kemampuan. Yang mereka terjemahkan adalah biaya layanan. Model yang mengaktifkan 95B parameter per token lebih murah untuk dijalankan dalam skala besar daripada yang mengaktifkan 104B, jika semua hal lain sama, dan perbedaan itu terlihat pada harga API di bawah ini.

Untuk *self-hoster*, angka yang lebih relevan adalah unduhan K3 sebesar 594 GB pada presisi MXFP4. Itu adalah wilayah *multi-node* bahkan sebelum Anda memperhitungkan *KV cache* pada konteks panjang. Harapkan Qwen 3.8-Max, dengan total 2.4T, akan berada dalam kelas berat yang serupa ketika file-nya muncul. Sebagian besar tim akan menggunakan *hosted endpoints* untuk kedua model dan mencadangkan *self-hosting* untuk kasus kepatuhan atau penelitian.

Keterbukaan hari ini: bobot langsung vs janji lama

Aspek ini pantas mendapatkan bagian tersendiri karena pemasaran di kedua belah pihak mengatakan “terbuka” sementara faktanya berbeda.

Bobot Kimi K3 bersifat publik. Anda dapat memverifikasi *repo*, memeriksa lisensi, dan mengunduh file-nya sekarang. Itu membawa segala hal yang dimungkinkan oleh keterbukaan sejati: *hosting* pihak ketiga, kuantisasi komunitas, *fine-tuning*, dan jaminan bahwa model yang Anda *benchmark* tidak dapat diam-diam diganti tanpa sepengetahuan Anda.

Qwen 3.8-Max akan menjadi model kelas Qwen-Max pertama yang dirilis dengan bobot terbuka, sebuah perubahan strategi yang tulus dari Alibaba setelah menjaga setiap model tingkat Max sebelumnya hanya melalui API. Namun sebuah 'pertama' hanya terjadi sekali setelah itu benar-benar terjadi. Hingga *repo* Hugging Face tayang, Qwen 3.8-Max adalah model API dengan pengumuman terlampir.

Nilai aspek ini untuk K3 hari ini, dengan catatan pensil untuk memeriksa ulang sekitar 10 Agustus. Jika Alibaba menepati janjinya, aspek ini menjadi seri dan perbandingan beralih ke ketentuan lisensi dan kualitas kuantisasi.

Modalitas: Qwen melihat gambar, K3 membaca teks

Di sini celah tersebut bergerak ke arah yang berlawanan, dan tidak dekat.

Qwen 3.8-Max menerima input teks dan gambar, sesuai konfigurasi model resmi ("input_modalities": ["text", "image"]). Postingan peluncuran Alibaba lebih jauh lagi, mendemonstrasikan pemahaman dokumen panjang melalui PDF lebih dari 200 halaman dan pemahaman video 100 jam melalui grafik memori; perlakukan itu sebagai demo blog, bukan tipe input API yang terdokumentasi. Input gambar, bagaimanapun, adalah nyata dan ada di API hari ini. *Benchmark* vendor Alibaba mengandalkannya: tabel multimodal (MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1, baris OCR kuat) adalah tempat Qwen 3.8-Max menunjukkan angka paling dominannya.

Kimi K3 adalah model teks. Jika beban kerja Anda melibatkan tangkapan layar, dokumen yang dipindai, pemahaman UI, atau tugas agen terkait visi apa pun, K3 membutuhkan model visi terpisah yang ditambahkan ke *pipeline*, dengan semua kode penghubung dan latensi ekstra yang tersirat.

Untuk pengkodean dan pekerjaan agen berbasis teks saja, aspek ini tidak relevan. Untuk *document intelligence* dan agen penggunaan komputer, ini sangat menentukan.

Konteks, output, dan permukaan API

Qwen 3.8-Max menghadirkan *context window* 1.000.000 token sebagai satu tingkat datar tunggal, dengan *output* maksimum 65.536 token. Penalaran dikontrol oleh parameter reasoning_effort (xhigh secara *default*, dengan *medium* dan *low*), dan *output* pemikiran dipertahankan secara *default*. Yang perlu dicatat, mode berpikir dan non-berpikir ditagih dengan tarif yang sama.

Akses berjalan melalui Alibaba Cloud Model Studio dengan tiga URL dasar regional (Beijing, Singapura, US-Virginia) dan, luar biasanya, dua bentuk protokol pada satu platform: *endpoint* yang kompatibel dengan OpenAI dan *endpoint* yang kompatibel dengan Anthropic. Permukaan dual-protokol itulah mengapa Qwen 3.8-Max dapat langsung digunakan di Claude Code hanya dengan ANTHROPIC_BASE_URL dan ANTHROPIC_MODEL=qwen3.8-max. Daftar lengkap dan ketersediaan regional didokumentasikan di halaman model Model Studio; jika Anda bekerja lintas wilayah, alat seperti Apidog memungkinkan Anda menyimpan setiap URL dasar sebagai lingkungan dan beralih di antaranya tanpa mengedit permintaan.

Kimi K3 juga menggunakan protokol Anthropic dan dapat diintegrasikan ke dalam *harness* bergaya Claude Code, itulah mengapa kedua model ini bersaing untuk tempat yang sama: tempat “arahkan *harness* agen Anda yang ada ke model *frontier* yang lebih murah.” Untuk detail *endpoint* dan batas K3 saat ini, lihat penjelasan Kimi K3 kami daripada mempercayai angka yang mungkin telah berubah sejak peluncuran.

Harga: datar dan sederhana vs murah masuk, mahal keluar

Berikut adalah tarif yang dipublikasikan, per juta token:

Tarif Qwen 3.8-Max Kimi K3
Input $2.00 $3.00
Output $6.00 $15.00
Input kena cache $0.20 (10% dari input) $0.30
Tingkatan harga Datar di seluruh konteks 1M Sesuai jadwal yang diterbitkan Moonshot

Qwen 3.8-Max berharga $2 masuk dan $6 keluar, datar dari token nol hingga satu juta token, baik berpikir atau tidak, sesuai halaman harga resmi Model Studio. Pembuatan *cache* eksplisit ditagih 125% dari *input*, *cache hit* 10%. Ada juga kuota gratis: 1M token, hanya wilayah Singapura, berlaku 90 hari.

Tarif K3 adalah $0,30 per juta untuk *cache hit*, $3 per juta *input*, dan $15 per juta *output*.

Perbandingan ini bukan satu angka tunggal. Pada beban kerja yang banyak *input* dengan disiplin *cache* yang baik (*prompt* sistem yang panjang, konteks dokumen yang berulang), kedua model tersebut memiliki jarak yang lebih dekat daripada yang ditunjukkan oleh harga stiker: $0,20 vs $0,30 per *megatoken* yang di-*cache* adalah celah yang sempit. Pada beban kerja yang banyak *output*, celahnya lebar: tarif *output* $15 K3 adalah 2,5 kali lipat dari $6 Qwen. *Agent loops* yang menghasilkan banyak penalaran dan kode cenderung banyak *output*, yang menguntungkan Qwen 3.8-Max di atas kertas.

Satu peringatan yang berlaku khusus untuk Qwen: reasoning_effort secara *default* adalah xhigh, dan token pemikiran ditagih sebagai *output*. Tagihan nyata akan lebih tinggi dari yang diprediksi oleh perkiraan *tokens-in-tokens-out* yang naif. Analisis harga Qwen 3.8 kami menjelaskan contoh biaya per tugas jika Anda ingin memodelkan ini sebelum berkomitmen.

Benchmark: dua tabel vendor, tanpa wasit

Di sinilah sebagian besar perbandingan kedua model ini salah, jadi mari kita bersikap presisi tentang apa yang ada.

Apa yang ada: Alibaba menerbitkan tabel *benchmark* untuk Qwen 3.8-Max melawan Claude Opus 4.8, Fable 5, GPT-5.6 Sol, dan Qwen 3.7-Max. Moonshot menerbitkan tabel peluncurannya sendiri untuk Kimi K3 melawan jajaran *frontier* serupa. Keduanya dijalankan oleh vendor.

Apa yang tidak ada: evaluasi independen apa pun yang menempatkan Qwen 3.8-Max dan Kimi K3 dalam tabel yang sama di bawah *harness* yang sama. Tidak ada angka Artificial Analysis untuk Qwen 3.8-Max yang tersedia pada saat penulisan. Kedua vendor tidak saling mem-*benchmark* model masing-masing.

Dengan kerangka itu, inilah yang diklaim oleh masing-masing pihak dalam uji coba mereka sendiri.

Dari tabel Alibaba (uji coba Alibaba, sebagian besar dieksekusi melalui *harness* Claude Code, detail yang diungkapkan oleh Alibaba sendiri):

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86.6 84.6 84.6 88.8
SWE-bench Pro 67.7 69.2 80.0 64.6
PaperBench 93.0 80.3 88.8 90.5
GPQA Diamond 92.6 92.0 92.6 94.1
HLE 43.6 45.7 53.3 47.2

Angka Alibaba sendiri mencakup kekalahan yang jelas: Qwen 3.8-Max tertinggal jauh dari Fable 5 di SWE-bench Pro dan tertinggal dari semua yang terdaftar di HLE. Baris yang menonjol adalah PaperBench, *instruction following* (IFBench 82.8), dan *multimodal sweep*. Beberapa hasil utama lainnya menggunakan *benchmark in-house* Alibaba (QwenSWEBench, CoWorkBench, dan lainnya), yang tidak dapat diperiksa silang dengan siapa pun.

Dari sisi Moonshot, tabel peluncuran K3 menunjukkan ia mengalahkan Claude Opus 4.8 di seluruh baris *benchmark* utama Moonshot sementara tertinggal dari Fable 5 dan GPT-5.6 Sol secara keseluruhan. Kami membahas klaim tersebut, dan peringatannya, dalam perbandingan Kimi K3 vs Claude Opus 4.8 kami.

Bisakah Anda menyelaraskan kedua tabel di mana *benchmark* tumpang tindih? Anda bisa, dan orang-orang akan melakukannya, tetapi *harness*, *scaffolding*, dan pengaturan pengambilan sampel yang berbeda membuat pembacaan lintas tabel paling-paling hanya bersifat indikatif. Ringkasan jujurnya: kedua vendor menunjukkan model mereka kompetitif dengan, dan secara selektif unggul dari, *frontier* AS pada tugas-tugas agensi. Tidak ada tabel yang menetapkan mana dari keduanya yang lebih kuat. Untuk detail angka Alibaba, lihat analisis *benchmark* Qwen 3.8 kami.

Jalankan *head-to-head* Anda sendiri di Apidog

Karena tidak ada wasit, *benchmark* yang paling berguna adalah yang Anda jalankan pada beban kerja Anda sendiri. Kedua model mengekspos *endpoint chat-completions* yang kompatibel dengan OpenAI, yang membuat pengujian *side-by-side* mudah di Apidog.

Siapkan dua lingkungan, satu memegang URL dasar DashScope dan qwen3.8-max, yang lain memegang *endpoint* Moonshot dan ID model K3, masing-masing dengan variabel kunci API-nya sendiri. Simpan satu permintaan dengan *prompt* Anda yang sebenarnya (tugas nyata dari produk Anda, bukan teka-teki) dan beralih di antara lingkungan untuk mengirim *payload* yang sama ke kedua model. Tampilan respons Apidog memberi Anda status, latensi, dan seluruh isi secara *side-by-side*, dan *debugging* SSE-nya menunjukkan bagaimana setiap model mengalirkan konten penalaran, yang penting jika UI Anda merender token pemikiran. Tambahkan beberapa *assertion* (*response schema*, batas latensi, kata kunci yang diperlukan dalam *output*) dan Anda telah mengubah pemeriksaan suasana hati menjadi pengujian berulang yang dapat Anda jalankan kembali saat salah satu vendor mengirimkan pembaruan. Unduh Apidog secara gratis untuk menjalankan perbandingan; sepuluh *prompt* melalui kedua *endpoint* akan memberi tahu Anda lebih banyak daripada tabel vendor mana pun.

Kartu skor

Aspek Pemenang hari ini Catatan
Total/parameter aktif Qwen 3.8-Max (lebih ramping: 2.4T/95B vs 2.8T/104B) Lebih kecil tidak berarti lebih baik atau lebih buruk; ini terutama menandakan biaya layanan
Bobot terbuka, hari ini Kimi K3 (tersedia di Hugging Face, 594 GB MXFP4) Bobot Qwen akan tersedia ~10 Agustus; periksa kembali, aspek ini mungkin segera seri
Modalitas Qwen 3.8-Max (input teks + gambar) Klaim video/dokumen panjang adalah demo blog, bukan tipe input API yang terdokumentasi
Jendela konteks Qwen 3.8-Max (1M tingkat datar, 65.536 output maksimum) Verifikasi batas K3 saat ini terhadap dokumen Moonshot untuk kasus penggunaan Anda
Harga Qwen 3.8-Max ($2/$6 datar vs $3/$15) Nilai default xhigh untuk berpikir akan meningkatkan tagihan output riil Qwen
Benchmark Tidak dapat ditentukan Kedua tabel dijalankan oleh vendor; tidak ada head-to-head independen yang ada
Ekosistem harness Seri Keduanya dapat diintegrasikan ke dalam harness bergaya Claude Code melalui endpoint protokol Anthropic
Catatan janji Kimi K3 Bobot dikirim 11 hari setelah peluncuran; janji Qwen masih terbuka

Pilih yang mana kapan

Pilih Kimi K3 jika Anda membutuhkan bobot di perangkat keras Anda sendiri minggu ini, posisi kepatuhan Anda memerlukan model yang dapat Anda kunci dan audit, atau beban kerja Anda murni teks dan cukup berat inputnya sehingga harga *cache* mendominasi.

Pilih Qwen 3.8-Max jika beban kerja Anda melibatkan gambar atau dokumen, Anda menghasilkan banyak token *output* (*agent loops*, pembuatan kode), atau Anda menginginkan konteks 1M token tanpa kejutan harga berjenjang.

Tunggu seminggu jika bobot terbuka adalah alasan utama Anda melihat salah satu model. Jika bobot Qwen tiba sesuai janji sekitar 10 Agustus, aspek keterbukaan akan diatur ulang dan keputusan bergantung pada modalitas, harga, dan hasil evaluasi Anda sendiri.

Kisah sebenarnya adalah bahwa para pengembang kini memiliki dua pilihan *frontier* yang kredibel, murah, dan kompatibel dengan *harness* dari Tiongkok dalam waktu tiga minggu satu sama lain. Mana pun yang Anda pilih, jalankan *prompt* Anda sendiri melalui kedua *endpoint* sebelum Anda berkomitmen pada *roadmap* berdasarkan tabel vendor mana pun.

tombol

FAQ

Apakah Kimi K3 lebih terbuka daripada Qwen 3.8-Max?

Hari ini, ya, sebagai fakta yang jelas: bobot K3 telah tersedia di Hugging Face sejak 27 Juli 2026 (594 GB, MXFP4), sedangkan bobot Qwen 3.8-Max dijanjikan sekitar 10 Agustus dan belum dapat diunduh. Jika Alibaba menepati janjinya, keduanya akan menjadi model *frontier* berbobot terbuka dan perbedaan yang berarti akan beralih ke ketentuan lisensi dan dukungan komunitas. Sampai saat itu, hanya K3 yang dapat di-*self-host*; panduan K3 lokal kami menjelaskan apa saja yang diperlukan.

Model mana yang lebih baik dalam pengkodean, Qwen 3.8-Max atau Kimi K3?

Belum ada yang bisa menjawab itu dengan jujur. Kedua vendor mempublikasikan angka *agentic-coding* yang kuat, tetapi masing-masing menjalankan evaluasinya sendiri di bawah kondisi mereka sendiri, dan tidak ada *head-to-head* independen yang ada. Tabel Alibaba sendiri bahkan menunjukkan Qwen 3.8-Max kalah dari Fable 5 di SWE-bench Pro, jadi tabel vendor memang mengakui kekalahan; hanya saja mereka tidak sebanding antar vendor. Jalankan kedua model pada tugas-tugas dari *repo* Anda sendiri sebelum memutuskan.

Bisakah saya menggunakan kedua model di Claude Code?

Ya. Keduanya mengekspos *endpoint* yang kompatibel dengan Anthropic. Untuk Qwen 3.8-Max, atur ANTHROPIC_BASE_URL ke *endpoint* Anthropic DashScope dan ANTHROPIC_MODEL=qwen3.8-max menggunakan konfigurasi dari postingan rilis Alibaba. K3 mendukung pola yang sama melalui *endpoint* Moonshot. Kompatibilitas *harness* bersama itulah yang membuat pengujian A/B keduanya sangat murah untuk diatur.

Mana yang lebih murah untuk beban kerja agen yang tipikal?

Berdasarkan harga daftar, Qwen 3.8-Max: $2/$6 per juta token dibandingkan K3 yang $3/$15, dan *agent loops* cenderung ke token *output*, di mana perbedaannya 2,5x. Dua kualifikasi: tarif *cache-hit* $0,30 K3 membuat beban kerja yang banyak *input* dan di-*cache* dengan baik tetap kompetitif, dan upaya penalaran *xhigh default* Qwen menagih pemikiran sebagai *output*, sehingga biaya riilnya lebih tinggi dari perkiraan naif. Modelkan campuran token Anda sendiri sebelum berasumsi bahwa harga stiker menceritakan seluruh kisahnya.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.