Kimi K3 Yerelde Nasıl Çalıştırılır (ve Hangi Durumlarda Kaçınılmalı)

Kimi K3'ün açık ağırlıkları yayında: 594 GB MXFP4, 2.8T parametre. vLLM veya llama.cpp ile kendi kendine barındırmak için neler gerektiği, M1 Max gerçeklik kontrolü ve yerel uç noktanızı nasıl test edeceğiniz.

Ashley Innocent

Ashley Innocent

29 July 2026

Kimi K3 Yerelde Nasıl Çalıştırılır (ve Hangi Durumlarda Kaçınılmalı)

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Moonshot AI, Kimi K3'ün açık ağırlıklarını 27 Temmuz'da yayınladı ve Hugging Face'teki indirme sayacı şimdiden 100.000'e yaklaştı. Vaat açık: Moonshot'un yayınladığı her kıyaslamada Claude Opus 4.8'i yenen 2.8 trilyon parametreli bir model ve artık onu kendiniz barındırabilirsiniz.

Sayıları incelediğinizde sorun da açıkça ortaya çıkıyor. Tam hassasiyetli çıkarım için 1.57 TB disk alanı gerekiyor. Yayınlanan MXFP4 ağırlıkları bile 594 GB'lık bir indirme. Bu, sahip olabileceğiniz bir model, ancak bu ölçekte "yerel" kavramı, 8B Llama için olduğundan farklı bir anlama geliyor.

Bu kılavuz, K3'ü kendi donanımınızda çalıştırmak için nelerin gerektiğini, topluluğun tüketici makinelerinde neleri başardığını ve bir kez hizmet vermeye başladığında kendi barındırdığınız K3 uç noktasını Apidog ile API iş akışınıza nasıl bağlayacağınızı kapsıyor.

button

Ne indiriyorsunuz?

İlk olarak, şeyin şekli. Tam geçmişi öğrenmek isterseniz, Kimi K3 Nedir? ile başlayın; kısa versiyonu:

Ağırlıklar, Hugging Face deposundaki Kimi K3 Lisansı'nın arkasında kilitlenmiştir. Lisansı kabul edin, ardından huggingface-cli ile çekin. 1 Gbps bağlantıda, 594 GB için yaklaşık 80 ila 90 dakika ayırın.

Seçenek 1: vLLM veya SGLang ile veri merkezi sınıfı hizmet sunumu

Moonshot üç motor önermektedir: vLLM, SGLang ve TokenSpeed. KDA önden doldurma önbelleği (prefill-cache) katkıları, ağırlıklarla birlikte vLLM'de yer aldı, bu nedenle vLLM en az dirençli yoldur:

vllm serve moonshotai/Kimi-K3 \
  --tensor-parallel-size 8 \
  --max-model-len 131072

Alandan notlar:

Bu, veri egemenliği anlamında "yerel"dir: sizin altyapınız, sizin günlükleriniz, sizin uyumluluk hikayeniz. Dizüstü bilgisayar anlamında yerel değildir ve hiçbir niceleme miktarı, etkileşimli kullanım için bunu değiştirmez.

Seçenek 2: Büyük bir iş istasyonunda GGUF nicelemeleri

Unsloth, llama.cpp kullanıcıları için GGUF dönüşümleri yayınladı ve dinamik nicelemeleri, K3'ü resmi sürümün altına düşürmenin tek gerçekçi yoludur:

Niceleme Boyut Ne anlama geliyor
UD-IQ1_M ~345 GB Taban. Agresif 1-bit dinamik niceleme.
UD-IQ1_S ~650 GB Unsloth'un önerdiği denge noktası.
UD-Q4_K_XL ~1.55 TB Tama yakın hassasiyet.
UD-Q8_K_XL ~1.6 TB Etkili bir şekilde kayıpsız.

Çalışma kuralı: RAM'iniz artı VRAM'iniz kabaca niceleme boyutuna eşit olmalıdır. Yetersiz kalırsa llama.cpp yine de offloading ile çalışır, ancak eksik her gigabayt size hız kaybı yaşatır. 128 GB'lık bir makineye bağlı bir Mac Studio veya bir DGX İstasyonu, pratik alt sınırda yer alır.

Görsel projektör (vision projector) dahil olmak üzere minimal bir llama.cpp çağrısı:

./llama.cpp/llama-cli \
    --model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_M-00001-of-00015.gguf \
    --mmproj unsloth/Kimi-K3-GGUF/mmproj-F16.gguf \
    --temp 1.0 \
    --top-p 0.95

Donanımınız bunun altındaysa zorlamayın. 2026'nın en iyi yerel LLM'leri listesinde 24 ila 128 GB'a sığan ve gerçek zamanlı yanıt veren açık modeller bulunuyor; yetersiz RAM'de 1-bit K3 bunu yapmayacaktır.

M1 Max deneyi: evet, ama token başına 16 saniye

Bu hafta bir Hacker News başlığı, K3'ün 64 GB M1 Max üzerinde, ağırlıkları bellekte tutmak yerine 2 TB SSD'den akışla aktararak çalıştığını belgeledi. Sayılar, hem neden çalıştığını hem de neden kullanmayacağınızı açıklıyor:

MoE seyrekliğinin (MoE sparsity) ve mmap'in bir dizüstü bilgisayarda 2.8T'lik bir modeli çalıştırabileceğinin bir kanıtı olarak, gerçekten eğlenceli bir sonuçtur. K3'ü kullanmanın bir yolu olarak ise değil. Bir MacBook'ta K3 yanıtları istiyorsanız, ücretsiz katmanlar veya barındırılan API size daha iyi hizmet verecektir.

Yerel K3'ünüzü bir API iş akışına bağlama

İster vLLM ister llama.cpp'nin sunucu modu aracılığıyla hizmet verin, aynı sonuca ulaşırsınız: localhost üzerinde OpenAI uyumlu bir HTTP uç noktası. Buradan sonra bu, diğer herhangi bir API gibidir ve yerel LLM'leri API olarak test etmek için kullandığımız iş akışı geçerlidir:

  1. Apidog'u uç noktaya yönlendirin. base_urlhttp://localhost:8000/v1 (vLLM'nin varsayılanı) olarak ayarlayan bir ortam oluşturun ve daha sonra Moonshot'un barındırılan uç noktasına karşı değiştirin. Aynı istekler, iki arka uç, bir değişken.
  2. Düşünme akışını inceleyin. K3 sadece düşünmeye odaklıdır, bu nedenle yanıtlar yanıttan önce muhakeme içeriği taşır. Apidog'un SSE hata ayıklama görünümü, akışı geldiği gibi işler, bu da muhakeme-çaba seviyelerinin neyi değiştirdiğini görmeyi çok daha kolay hale getirir.
  3. Yapıyı doğrulayın, hisleri değil. Yanıt şemasını, gecikme bütçelerini ve token kullanım alanlarını doğrulayan otomatik testler ekleyin, böylece çıktı kalitesini düşüren bir niceleme değişimi veya motor yükseltmesi, bir kullanıcı raporu yerine başarısız bir testle ortaya çıkar.
  4. GPU'lar meşgulken K3'ü taklit edin. 594 GB'lık bir modelin yüklenmesi zaman alır. Gerçek yanıtları bir kez kaydedin, ardından bir taklit sunucunun bunları döndürmesine izin verin, böylece ön uç çalışması çıkarım kutusunu asla beklemez. Bunu ücretsiz kurmak için Apidog'u indirin; taklit ve test araçları her iki şekilde de OpenAI uyumlu herhangi bir sunucuya karşı çalışır.

İstek formatı, Kimi K3 API kılavuzunda ele aldığımızla aynıdır, bu nedenle barındırılan API'ye karşı yazılan testler doğrudan yerel dağıtımınıza aktarılır.

Peki, yerel olarak çalıştırmalı mısınız?

Hızlı bir karar tablosu:

Durumunuz Öneri
8+ GPU düğümü, veri egemenliği veya uyumluluk ihtiyacı Evet. Tensor paralelliği ile vLLM, MXFP4 ağırlıkları.
350 GB+ RAM/VRAM'li iş istasyonu Çalıştırılabilir. Unsloth 1-bit GGUF'ler, beklentileri düşürmüş olarak.
64 ila 128 GB Mac veya PC Hayır. Token başına saniye alırsınız, saniye başına token değil.
Sadece ürününüzde K3 kullanmak istiyorsanız Barındırılan API'yi kullanın; OpenAI ve Anthropic uyumludur.

Dürüst özet: K3'ün açık ağırlıkları önemlidir, çünkü bir sınır sınıfı modeli denetleyebilir, ince ayar yapabilir ve kendi barındırabilirsiniz, çoğu insanın bunu yapması gerektiği için değil. Donanıma sahip ekipler için vLLM yolu bugün çalışır ve iyi performans gösterir. Diğer herkes için, açık sürüm dolaylı olarak, daha ucuz barındırılan erişim ve onu sunmak için rekabet eden üçüncü taraf sağlayıcılar aracılığıyla hala karşılığını verir.

Bu tablonun hangi tarafına düşerseniz düşün, uç nokta modelin kodunuzla buluştuğu yerdir. Onu bir model gibi test edin: şema kontrolleri, akış incelemesi ve model düşünürken geliştirmeyi devam ettiren taklitler.

button

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin