Moonshot AI, Kimi K3'ün açık ağırlıklarını 27 Temmuz'da yayınladı ve Hugging Face'teki indirme sayacı şimdiden 100.000'e yaklaştı. Vaat açık: Moonshot'un yayınladığı her kıyaslamada Claude Opus 4.8'i yenen 2.8 trilyon parametreli bir model ve artık onu kendiniz barındırabilirsiniz.
Sayıları incelediğinizde sorun da açıkça ortaya çıkıyor. Tam hassasiyetli çıkarım için 1.57 TB disk alanı gerekiyor. Yayınlanan MXFP4 ağırlıkları bile 594 GB'lık bir indirme. Bu, sahip olabileceğiniz bir model, ancak bu ölçekte "yerel" kavramı, 8B Llama için olduğundan farklı bir anlama geliyor.
Bu kılavuz, K3'ü kendi donanımınızda çalıştırmak için nelerin gerektiğini, topluluğun tüketici makinelerinde neleri başardığını ve bir kez hizmet vermeye başladığında kendi barındırdığınız K3 uç noktasını Apidog ile API iş akışınıza nasıl bağlayacağınızı kapsıyor.
Ne indiriyorsunuz?
İlk olarak, şeyin şekli. Tam geçmişi öğrenmek isterseniz, Kimi K3 Nedir? ile başlayın; kısa versiyonu:
- Toplam 2.8T parametre, token başına 104B aktif. K3, 896 uzmana sahip bir Uzman Karışımı (Mixture-of-Experts) modelidir. Her token 16 seçilmiş uzman ve 2 paylaşılan uzman üzerinden yönlendirilir, bu nedenle token başına hesaplama, ana sayının küçük bir kısmıdır.
- 93 katman: 69 Kimi Delta Dikkat (KDA) katmanı ve 24 Gated MLA katmanı. KDA tasarımı, 1 milyon tokenlık bağlam penceresinin hiç kullanılabilir olmasının nedenidir.
- 401M parametreli MoonViT-V2 kodlayıcı aracılığıyla doğal görme. Yayınlanan ağırlıklar metin, görsel ve video girişini işler.
- MXFP4 ağırlıkları, MXFP8 aktivasyonları. Moonshot, niceleme farkındalıklı eğitim (quantization-aware training) yaptı, bu nedenle 4-bitlik sürüm, sonradan düşünülmüş değil, amaçlanan hizmet biçimidir. Bu aynı zamanda ağırlıkların bunun ötesinde kötü sıkıştığı anlamına gelir; düşük bit baş payı (low-bit headroom) zaten harcanmıştır.
- Sadece düşünme. K3, düşük, yüksek ve maksimum çaba seviyeleriyle her zaman yanıtlamadan önce mantık yürütür. Anında mod yoktur.
Ağırlıklar, Hugging Face deposundaki Kimi K3 Lisansı'nın arkasında kilitlenmiştir. Lisansı kabul edin, ardından huggingface-cli ile çekin. 1 Gbps bağlantıda, 594 GB için yaklaşık 80 ila 90 dakika ayırın.
Seçenek 1: vLLM veya SGLang ile veri merkezi sınıfı hizmet sunumu
Moonshot üç motor önermektedir: vLLM, SGLang ve TokenSpeed. KDA önden doldurma önbelleği (prefill-cache) katkıları, ağırlıklarla birlikte vLLM'de yer aldı, bu nedenle vLLM en az dirençli yoldur:
vllm serve moonshotai/Kimi-K3 \
--tensor-parallel-size 8 \
--max-model-len 131072
Alandan notlar:
- Donanım. Moonshot, H20 kümelerinde değerlendirme yaptı. Gerçekçi olarak, taban olarak tensor paralelliği olan 8 GPU'lu bir düğüme ihtiyacınız var. B200 sınıfı donanımda, saniyede 100 tokenden fazla verim elde edilebilir.
- Bağlam. Model 1.048.576 tokene kadar destekler, ancak tam bağlamda KV önbelleği tek başına yaklaşık 27 GB'tır. 131K ile başlayın ve yalnızca iş yükünüz gerektiriyorsa yükseltin.
- Örnekleme. Moonshot'un varsayılanları sıcaklık 1.0 ve top-p 0.95'tir. Agentic iş yükleri için, sıcaklığı 1.0'da tutun ve top-p'yi 1.0'a getirin.
Bu, veri egemenliği anlamında "yerel"dir: sizin altyapınız, sizin günlükleriniz, sizin uyumluluk hikayeniz. Dizüstü bilgisayar anlamında yerel değildir ve hiçbir niceleme miktarı, etkileşimli kullanım için bunu değiştirmez.
Seçenek 2: Büyük bir iş istasyonunda GGUF nicelemeleri
Unsloth, llama.cpp kullanıcıları için GGUF dönüşümleri yayınladı ve dinamik nicelemeleri, K3'ü resmi sürümün altına düşürmenin tek gerçekçi yoludur:
| Niceleme | Boyut | Ne anlama geliyor |
|---|---|---|
| UD-IQ1_M | ~345 GB | Taban. Agresif 1-bit dinamik niceleme. |
| UD-IQ1_S | ~650 GB | Unsloth'un önerdiği denge noktası. |
| UD-Q4_K_XL | ~1.55 TB | Tama yakın hassasiyet. |
| UD-Q8_K_XL | ~1.6 TB | Etkili bir şekilde kayıpsız. |
Çalışma kuralı: RAM'iniz artı VRAM'iniz kabaca niceleme boyutuna eşit olmalıdır. Yetersiz kalırsa llama.cpp yine de offloading ile çalışır, ancak eksik her gigabayt size hız kaybı yaşatır. 128 GB'lık bir makineye bağlı bir Mac Studio veya bir DGX İstasyonu, pratik alt sınırda yer alır.
Görsel projektör (vision projector) dahil olmak üzere minimal bir llama.cpp çağrısı:
./llama.cpp/llama-cli \
--model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_M-00001-of-00015.gguf \
--mmproj unsloth/Kimi-K3-GGUF/mmproj-F16.gguf \
--temp 1.0 \
--top-p 0.95
Donanımınız bunun altındaysa zorlamayın. 2026'nın en iyi yerel LLM'leri listesinde 24 ila 128 GB'a sığan ve gerçek zamanlı yanıt veren açık modeller bulunuyor; yetersiz RAM'de 1-bit K3 bunu yapmayacaktır.
M1 Max deneyi: evet, ama token başına 16 saniye
Bu hafta bir Hacker News başlığı, K3'ün 64 GB M1 Max üzerinde, ağırlıkları bellekte tutmak yerine 2 TB SSD'den akışla aktararak çalıştığını belgeledi. Sayılar, hem neden çalıştığını hem de neden kullanmayacağınızı açıklıyor:
- K3, her token'ın dokunduğu yaklaşık 115 GB yoğun parametre ve token başına yaklaşık 25 GB yönlendirilmiş uzman ağırlığı taşır. Sadece yoğun kısım makinenin RAM'ini aşar, bu nedenle SSD yavaş çekim hafıza haline gelir.
- Sonuç: token başına yaklaşık 16 saniye. Bazı yapılandırmalar token başına bir dakikadan fazla bildirdi. Bu, saatte bir paragraf demektir.
- Disk aktarım hızı her şeydir. M1 dönemi SSD'ler, mevcut Apple silikonundan çok daha yavaş okur ve uzmanları ağ üzerinden aktarmak daha da yavaştır.
MoE seyrekliğinin (MoE sparsity) ve mmap'in bir dizüstü bilgisayarda 2.8T'lik bir modeli çalıştırabileceğinin bir kanıtı olarak, gerçekten eğlenceli bir sonuçtur. K3'ü kullanmanın bir yolu olarak ise değil. Bir MacBook'ta K3 yanıtları istiyorsanız, ücretsiz katmanlar veya barındırılan API size daha iyi hizmet verecektir.
Yerel K3'ünüzü bir API iş akışına bağlama
İster vLLM ister llama.cpp'nin sunucu modu aracılığıyla hizmet verin, aynı sonuca ulaşırsınız: localhost üzerinde OpenAI uyumlu bir HTTP uç noktası. Buradan sonra bu, diğer herhangi bir API gibidir ve yerel LLM'leri API olarak test etmek için kullandığımız iş akışı geçerlidir:
- Apidog'u uç noktaya yönlendirin.
base_url'ıhttp://localhost:8000/v1(vLLM'nin varsayılanı) olarak ayarlayan bir ortam oluşturun ve daha sonra Moonshot'un barındırılan uç noktasına karşı değiştirin. Aynı istekler, iki arka uç, bir değişken. - Düşünme akışını inceleyin. K3 sadece düşünmeye odaklıdır, bu nedenle yanıtlar yanıttan önce muhakeme içeriği taşır. Apidog'un SSE hata ayıklama görünümü, akışı geldiği gibi işler, bu da muhakeme-çaba seviyelerinin neyi değiştirdiğini görmeyi çok daha kolay hale getirir.
- Yapıyı doğrulayın, hisleri değil. Yanıt şemasını, gecikme bütçelerini ve token kullanım alanlarını doğrulayan otomatik testler ekleyin, böylece çıktı kalitesini düşüren bir niceleme değişimi veya motor yükseltmesi, bir kullanıcı raporu yerine başarısız bir testle ortaya çıkar.
- GPU'lar meşgulken K3'ü taklit edin. 594 GB'lık bir modelin yüklenmesi zaman alır. Gerçek yanıtları bir kez kaydedin, ardından bir taklit sunucunun bunları döndürmesine izin verin, böylece ön uç çalışması çıkarım kutusunu asla beklemez. Bunu ücretsiz kurmak için Apidog'u indirin; taklit ve test araçları her iki şekilde de OpenAI uyumlu herhangi bir sunucuya karşı çalışır.
İstek formatı, Kimi K3 API kılavuzunda ele aldığımızla aynıdır, bu nedenle barındırılan API'ye karşı yazılan testler doğrudan yerel dağıtımınıza aktarılır.
Peki, yerel olarak çalıştırmalı mısınız?
Hızlı bir karar tablosu:
| Durumunuz | Öneri |
|---|---|
| 8+ GPU düğümü, veri egemenliği veya uyumluluk ihtiyacı | Evet. Tensor paralelliği ile vLLM, MXFP4 ağırlıkları. |
| 350 GB+ RAM/VRAM'li iş istasyonu | Çalıştırılabilir. Unsloth 1-bit GGUF'ler, beklentileri düşürmüş olarak. |
| 64 ila 128 GB Mac veya PC | Hayır. Token başına saniye alırsınız, saniye başına token değil. |
| Sadece ürününüzde K3 kullanmak istiyorsanız | Barındırılan API'yi kullanın; OpenAI ve Anthropic uyumludur. |
Dürüst özet: K3'ün açık ağırlıkları önemlidir, çünkü bir sınır sınıfı modeli denetleyebilir, ince ayar yapabilir ve kendi barındırabilirsiniz, çoğu insanın bunu yapması gerektiği için değil. Donanıma sahip ekipler için vLLM yolu bugün çalışır ve iyi performans gösterir. Diğer herkes için, açık sürüm dolaylı olarak, daha ucuz barındırılan erişim ve onu sunmak için rekabet eden üçüncü taraf sağlayıcılar aracılığıyla hala karşılığını verir.
Bu tablonun hangi tarafına düşerseniz düşün, uç nokta modelin kodunuzla buluştuğu yerdir. Onu bir model gibi test edin: şema kontrolleri, akış incelemesi ve model düşünürken geliştirmeyi devam ettiren taklitler.
