Cara Menjalankan Kimi K3 Lokal (dan Kapan Sebaiknya Tidak)

Bobot terbuka Kimi K3 telah tersedia: 594 GB MXFP4, 2.8T parameter. Apa yang dibutuhkan untuk self-host dengan vLLM atau llama.cpp, pemeriksaan realitas M1 Max, dan cara menguji endpoint lokal Anda.

Ashley Innocent

Ashley Innocent

29 July 2026

Cara Menjalankan Kimi K3 Lokal (dan Kapan Sebaiknya Tidak)

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Moonshot AI merilis bobot terbuka untuk Kimi K3 pada 27 Juli, dan penghitung unduhan di Hugging Face sudah mendekati 100.000. Penawaran ini jelas: model dengan 2,8 triliun parameter yang mengalahkan Claude Opus 4.8 di setiap benchmark yang diterbitkan Moonshot, dan sekarang Anda bisa meng-host-nya sendiri.

Kendalanya juga jelas setelah Anda melihat angkanya. Inferensi presisi penuh membutuhkan disk sebesar 1,57 TB. Bahkan bobot MXFP4 yang dirilis berukuran 594 GB. Ini adalah model yang bisa Anda miliki, tetapi "lokal" memiliki arti yang berbeda pada skala ini dibandingkan dengan Llama 8B.

Panduan ini mencakup apa saja yang diperlukan untuk menjalankan K3 di perangkat keras Anda sendiri, apa yang telah berhasil dilakukan komunitas di mesin konsumen, dan cara menyambungkan titik akhir K3 yang di-host sendiri ke alur kerja API Anda dengan Apidog setelah berjalan.

tombol

Apa yang Anda unduh

Pertama, bentuk dari model ini. Jika Anda ingin latar belakang lengkapnya, mulailah dengan Apa Itu Kimi K3?; versi singkatnya:

Bobot dilindungi oleh Lisensi Kimi K3 di repositori Hugging Face. Terima lisensinya, lalu tarik dengan huggingface-cli. Pada koneksi 1 Gbps, alokasikan sekitar 80 hingga 90 menit untuk 594 GB.

Opsi 1: Penyajian kelas pusat data dengan vLLM atau SGLang

Moonshot merekomendasikan tiga mesin: vLLM, SGLang, dan TokenSpeed. Kontribusi KDA prefill-cache mereka dikirimkan di vLLM bersama dengan bobot, jadi vLLM adalah jalur termudah:

vllm serve moonshotai/Kimi-K3 \
  --tensor-parallel-size 8 \
  --max-model-len 131072

Catatan dari lapangan:

Ini "lokal" dalam artian kedaulatan data: infrastruktur Anda, log Anda, kisah kepatuhan Anda. Ini tidak lokal dalam artian laptop, dan tidak ada kuantisasi yang mengubahnya untuk penggunaan interaktif.

Opsi 2: Kuantisasi GGUF pada workstation besar

Unsloth menerbitkan konversi GGUF untuk pengguna llama.cpp, dan kuantisasi dinamis mereka adalah satu-satunya cara realistis untuk mengecilkan K3 di bawah rilis resmi:

Kuantisasi Ukuran Artinya
UD-IQ1_M ~345 GB Batas bawah. Kuantisasi dinamis 1-bit agresif.
UD-IQ1_S ~650 GB Titik keseimbangan yang direkomendasikan Unsloth.
UD-Q4_K_XL ~1.55 TB Mendekati presisi penuh.
UD-Q8_K_XL ~1.6 TB Secara efektif tanpa kehilangan.

Aturan kerjanya: RAM Anda ditambah VRAM kira-kira harus sama dengan ukuran kuantisasi. Jika kurang, llama.cpp masih akan berjalan melalui offloading, tetapi setiap gigabyte yang hilang akan mengurangi kecepatan. Mac Studio yang terhubung ke mesin 128 GB, atau DGX Station, berada di batas bawah praktis.

Pemanggilan llama.cpp minimal, termasuk proyektor visi:

./llama.cpp/llama-cli \
    --model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_M-00001-of-00015.gguf \
    --mmproj unsloth/Kimi-K3-GGUF/mmproj-F16.gguf \
    --temp 1.0 \
    --top-p 0.95

Jika perangkat keras Anda tidak memenuhi persyaratan di atas, jangan paksakan. Daftar LLM lokal terbaik tahun 2026 memiliki model terbuka yang muat dalam 24 hingga 128 GB dan menjawab secara real time; K3 pada 1-bit dengan RAM yang tidak memadai tidak akan.

Eksperimen M1 Max: ya, tapi 16 detik per token

Sebuah thread Hacker News minggu ini mendokumentasikan K3 berjalan pada M1 Max 64 GB dengan streaming bobot dari SSD 2 TB alih-alih menyimpannya di memori. Angka-angka menjelaskan mengapa itu berhasil dan mengapa Anda tidak akan menggunakannya:

Sebagai bukti bahwa MoE sparsity plus mmap dapat menjalankan model 2.8T di laptop, ini adalah hasil yang sangat menarik. Sebagai cara untuk menggunakan K3, ini bukanlah cara yang tepat. Jika Anda ingin jawaban K3 di MacBook, tingkat gratis atau API yang di-host akan melayani Anda lebih baik.

Menyambungkan K3 lokal Anda ke alur kerja API

Baik Anda menyajikan melalui vLLM atau mode server llama.cpp, Anda akan mendapatkan hal yang sama: titik akhir HTTP yang kompatibel dengan OpenAI di localhost. Dari sini, ini adalah API seperti lainnya, dan alur kerja yang sama yang kami gunakan untuk menguji LLM lokal sebagai API berlaku:

  1. Arahkan Apidog ke titik akhir. Buat lingkungan dengan base_url diatur ke http://localhost:8000/v1 (default vLLM) dan tukar dengan titik akhir yang di-host Moonshot nanti. Permintaan yang sama, dua backend, satu variabel.
  2. Periksa aliran pemikiran. K3 hanya berpikir, jadi respons membawa konten penalaran sebelum jawaban. Tampilan debugging SSE Apidog menampilkan aliran saat tiba, yang membuatnya jauh lebih mudah untuk melihat apa yang diubah oleh tingkat upaya penalaran.
  3. Tegaskan struktur, bukan nuansa. Tambahkan pengujian otomatis yang memvalidasi skema respons, anggaran latensi, dan bidang penggunaan token, sehingga pertukaran kuantisasi atau peningkatan mesin yang menurunkan output muncul dalam pengujian yang gagal alih-alih laporan pengguna.
  4. Mengejek K3 saat GPU sibuk. Model 594 GB membutuhkan waktu untuk dimuat. Rekam respons nyata sekali, lalu biarkan server mock mengembalikannya sehingga pekerjaan frontend tidak pernah menunggu kotak inferensi. Unduh Apidog untuk mengatur ini secara gratis; alat mock dan pengujian keduanya bekerja dengan server yang kompatibel dengan OpenAI.

Format permintaan itu sendiri cocok dengan apa yang kami bahas dalam panduan API Kimi K3, jadi pengujian yang ditulis terhadap API yang di-host akan langsung ditransfer ke deployment lokal Anda.

Jadi, haruskah Anda menjalankannya secara lokal?

Tabel keputusan singkat:

Situasi Anda Rekomendasi
Node 8+ GPU, kebutuhan kedaulatan data atau kepatuhan Ya. vLLM dengan paralelisme tensor, bobot MXFP4.
Workstation dengan RAM/VRAM 350 GB+ Bisa dilakukan. GGUF 1-bit Unsloth, ekspektasi yang disesuaikan.
Mac atau PC 64 hingga 128 GB Tidak. Anda akan mendapatkan detik-per-token, bukan token-per-detik.
Hanya ingin K3 di produk Anda Gunakan API yang di-host; ini kompatibel dengan OpenAI dan Anthropic.

Ringkasan jujurnya: Bobot terbuka K3 penting karena Anda *dapat* mengaudit, menyetel, dan meng-host sendiri model kelas frontier, bukan karena kebanyakan orang harus melakukannya. Bagi tim dengan perangkat keras yang memadai, jalur vLLM berfungsi hari ini dan berkinerja baik. Untuk yang lain, rilis terbuka masih memberikan keuntungan secara tidak langsung, melalui akses host yang lebih murah dan penyedia pihak ketiga yang bersaing untuk menyediakannya.

Di sisi mana pun Anda berada di tabel itu, titik akhir adalah tempat model bertemu dengan kode Anda. Ujilah seperti halnya: pemeriksaan skema, inspeksi streaming, dan mock yang menjaga pengembangan tetap berjalan saat model berpikir.

tombol

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.