Moonshot AI는 7월 27일 Kimi K3의 오픈 웨이트를 공개했으며, Hugging Face의 다운로드 카운터는 이미 10만 건에 육박하고 있습니다. Moonshot이 공개한 모든 벤치마크에서 Claude Opus 4.8을 능가한 2.8조 개의 파라미터 모델을 이제 직접 호스팅할 수 있다는 점은 분명한 강점입니다.
하지만 숫자를 보면 단점도 분명합니다. 풀 정밀도 추론에는 1.57TB의 디스크 공간이 필요합니다. 공개된 MXFP4 웨이트조차도 594GB를 다운로드해야 합니다. 이 모델은 소유할 수 있지만, 8B Llama와는 달리 이 규모에서는 "로컬"의 의미가 달라집니다.
이 가이드에서는 K3를 자체 하드웨어에서 실행하는 데 필요한 사항, 커뮤니티가 소비자 기기에서 달성한 결과, 그리고 일단 K3 엔드포인트가 제공되면 Apidog를 사용하여 자체 호스팅 K3 엔드포인트를 API 워크플로우에 연결하는 방법을 다룹니다.
다운로드하는 내용
먼저, 모델의 형태에 대해 설명합니다. 자세한 배경 지식을 원하시면 Kimi K3란 무엇인가?를 참조하세요. 요약하면 다음과 같습니다.
- 총 2.8T 파라미터, 토큰당 104B 활성화. K3는 896개의 전문가(Expert)를 가진 MoE(Mixture-of-Experts) 모델입니다. 각 토큰은 16개의 선택된 전문가와 2개의 공유된 전문가를 거치므로, 토큰당 계산량은 전체 파라미터 수보다 적습니다.
- 93개 레이어: 69개의 Kimi Delta Attention (KDA) 레이어와 24개의 Gated MLA 레이어. KDA 디자인 덕분에 100만 토큰 컨텍스트 창을 실제로 사용할 수 있습니다.
- 401M 파라미터의 MoonViT-V2 인코더를 통한 네이티브 비전. 공개된 웨이트는 텍스트, 이미지, 비디오 입력을 처리합니다.
- MXFP4 웨이트, MXFP8 활성화. Moonshot은 양자화 인식 학습(quantization-aware training)을 수행했으므로, 4비트 릴리스는 의도된 서비스 형식이며 나중에 추가된 것이 아닙니다. 이는 웨이트가 그 이상으로 압축되기 어렵다는 것을 의미합니다. 저비트 헤드룸은 이미 소진되었습니다.
- 사고 전용(Thinking-only). K3는 항상 답변 전에 추론하며, 낮은, 중간, 최대 노력 수준을 가집니다. 즉시 모드는 없습니다.
웨이트는 Hugging Face 리포지토리에서 Kimi K3 라이선스 뒤에 게이트되어 있습니다. 라이선스에 동의한 다음 huggingface-cli로 다운로드합니다. 1Gbps 연결의 경우 594GB를 다운로드하는 데 약 80~90분 정도 소요됩니다.
옵션 1: vLLM 또는 SGLang을 사용한 데이터센터급 서비스
Moonshot은 vLLM, SGLang, TokenSpeed 세 가지 엔진을 권장합니다. KDA 프리필 캐시 기여는 웨이트와 함께 vLLM에 포함되었으므로, vLLM이 가장 쉬운 방법입니다.
vllm serve moonshotai/Kimi-K3 \
--tensor-parallel-size 8 \
--max-model-len 131072
현장에서의 참고 사항:
- 하드웨어. Moonshot은 H20 클러스터에서 평가했습니다. 현실적으로 텐서 병렬 처리가 가능한 8-GPU 노드가 최소 사양입니다. B200급 하드웨어에서는 초당 100토큰 이상의 처리량을 달성할 수 있습니다.
- 컨텍스트. 이 모델은 최대 1,048,576토큰을 지원하지만, 전체 컨텍스트의 KV 캐시만으로 약 27GB입니다. 131K부터 시작하여 워크로드가 필요한 경우에만 늘리세요.
- 샘플링. Moonshot의 기본값은 temperature 1.0 및 top-p 0.95입니다. 에이전트 워크로드의 경우 temperature를 1.0으로 유지하고 top-p를 1.0으로 이동합니다.
이는 데이터 주권적 의미에서 "로컬"입니다: 귀하의 인프라, 귀하의 로그, 귀하의 규정 준수 스토리. 노트북 의미의 로컬은 아니며, 어떤 양자화도 대화형 사용에 대한 이러한 사실을 바꾸지 않습니다.
옵션 2: 대형 워크스테이션에서 GGUF 양자화 사용
Unsloth는 llama.cpp 사용자를 위한 GGUF 변환을 공개했습니다. 이들의 동적 양자화는 K3를 공식 릴리스보다 줄일 수 있는 유일한 현실적인 방법입니다.
| 양자화(Quant) | 크기(Size) | 의미(What it means) |
|---|---|---|
| UD-IQ1_M | ~345 GB | 최소 사양. 공격적인 1비트 동적 양자화. |
| UD-IQ1_S | ~650 GB | Unsloth가 권장하는 균형점. |
| UD-Q4_K_XL | ~1.55 TB | 거의 풀 정밀도. |
| UD-Q8_K_XL | ~1.6 TB | 실질적으로 손실 없음. |
작동 규칙: RAM과 VRAM을 합친 크기가 양자화 크기와 대략 같아야 합니다. 부족하더라도 llama.cpp는 오프로딩을 통해 실행되지만, 부족한 기가바이트당 속도가 저하됩니다. 128GB 머신에 연결된 Mac Studio 또는 DGX Station이 현실적인 최저 사양입니다.
비전 프로젝터를 포함한 최소한의 llama.cpp 호출:
./llama.cpp/llama-cli \
--model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_M-00001-of-00015.gguf \
--mmproj unsloth/Kimi-K3-GGUF/mmproj-F16.gguf \
--temp 1.0 \
--top-p 0.95
하드웨어 사양이 이보다 낮다면 무리하게 사용하지 마세요. 2026년 최고의 로컬 LLM 목록에는 24~128GB에 적합하며 실시간으로 응답하는 오픈 모델들이 있습니다. 충분하지 않은 RAM에서 1비트 K3는 그렇지 않을 것입니다.
M1 Max 실험: 가능하지만 토큰당 16초
이번 주 Hacker News 스레드에서 64GB M1 Max에서 K3가 메모리에 웨이트를 보관하는 대신 2TB SSD에서 스트리밍하여 실행되는 것이 문서화되었습니다. 이 수치들은 작동하는 이유와 사용하지 않을 이유를 모두 설명합니다.
- K3는 약 115GB의 밀집 파라미터를 가지고 있으며, 모든 토큰이 이를 사용합니다. 또한 토큰당 약 25GB의 라우팅된 전문가(expert) 웨이트가 있습니다. 밀집 부분만으로도 기기의 RAM을 초과하므로 SSD는 느린 메모리가 됩니다.
- 결과: 토큰당 약 16초. 일부 구성에서는 토큰당 1분 이상이 보고되었습니다. 이는 시간당 한 문단에 해당합니다.
- 디스크 처리량이 전체 게임입니다. M1 시대의 SSD는 현재 Apple Silicon보다 훨씬 느리게 읽고, 네트워크를 통한 전문가 스트리밍은 훨씬 더 느립니다.
MoE 희소성과 mmap을 통해 2.8T 모델을 노트북에서 실행할 수 있다는 증명으로서, 이는 정말 재미있는 결과입니다. K3를 사용하는 방법으로서는 그렇지 않습니다. MacBook에서 K3 답변을 원한다면 무료 계층이나 호스팅된 API가 더 나은 서비스를 제공할 것입니다.
로컬 K3를 API 워크플로우에 연결하기
vLLM 또는 llama.cpp의 서버 모드를 통해 서비스를 제공하든, 결과는 동일하게 OpenAI 호환 HTTP 엔드포인트가 localhost에 생성됩니다. 여기서부터는 다른 API와 마찬가지이며, API로 로컬 LLM 테스트에 사용하는 동일한 워크플로우가 적용됩니다.
- Apidog를 엔드포인트에 연결합니다. `base_url`을 `http://localhost:8000/v1` (vLLM의 기본값)으로 설정한 환경을 생성하고 나중에 Moonshot의 호스팅된 엔드포인트와 전환합니다. 동일한 요청, 두 개의 백엔드, 하나의 변수.
- 사고 스트림을 검사합니다. K3는 사고 전용이므로, 응답은 답변 전에 추론 내용을 포함합니다. Apidog의 SSE 디버깅 뷰는 스트림을 도착하는 대로 렌더링하여 추론 노력 수준의 변화를 훨씬 쉽게 파악할 수 있도록 합니다.
- 느낌이 아닌 구조를 단언합니다. 응답 스키마, 지연 시간 예산, 토큰 사용 필드를 검증하는 자동화된 테스트를 추가하여, 출력 품질을 저하시키는 양자화 스왑 또는 엔진 업그레이드가 사용자 보고서 대신 실패하는 테스트로 나타나도록 합니다.
- GPU가 사용 중일 때 K3를 모의(Mock)합니다. 594GB 모델은 로드하는 데 시간이 걸립니다. 실제 응답을 한 번 기록한 다음, 모의 서버가 이를 반환하도록 하여 프론트엔드 작업이 추론 박스를 기다리지 않도록 합니다. Apidog를 다운로드하여 무료로 설정하세요. 모의 및 테스트 도구는 모든 OpenAI 호환 서버에서 작동합니다.
요청 형식 자체는 Kimi K3 API 가이드에서 다룬 내용과 일치하므로, 호스팅된 API에 대해 작성된 테스트는 로컬 배포로 직접 전송됩니다.
그래서 로컬에서 실행해야 할까요?
빠른 결정표:
| 상황 | 권장 사항 |
|---|---|
| 8개 이상 GPU 노드, 데이터 주권 또는 규정 준수 필요 | 네. 텐서 병렬 처리 및 MXFP4 웨이트를 사용하는 vLLM. |
| 350GB 이상의 RAM/VRAM을 갖춘 워크스테이션 | 실행 가능합니다. Unsloth 1비트 GGUF, 기대치를 낮추세요. |
| 64~128GB Mac 또는 PC | 아니요. 토큰당 몇 초가 걸릴 것이지, 초당 몇 토큰이 나오지 않습니다. |
| 단순히 제품에 K3를 사용하고 싶음 | 호스팅된 API를 사용하세요. OpenAI 및 Anthropic과 호환됩니다. |
솔직한 요약: K3의 오픈 웨이트가 중요한 이유는 대부분의 사람들이 그래야 하기 때문이 아니라, 프론티어급 모델을 감사하고, 미세 조정하며, 자체 호스팅할 수 있기 때문입니다. 하드웨어를 갖춘 팀의 경우 vLLM 경로가 현재 작동하며 성능이 좋습니다. 다른 모든 사람들에게는 오픈 릴리스가 더 저렴한 호스팅 액세스와 이를 제공하기 위해 경쟁하는 타사 공급업체를 통해 간접적으로 여전히 이점을 제공합니다.
이 표의 어느 쪽에 속하든, 엔드포인트는 모델이 코드와 만나는 지점입니다. 모델이 생각하는 동안 개발을 계속 진행할 수 있도록 스키마 확인, 스트리밍 검사, 모의 테스트를 사용하여 테스트하세요.
