Kimi K3 로컬 실행법 (피해야 할 때)

Kimi K3의 오픈 가중치(594GB MXFP4, 2.8조 매개변수)가 공개되었습니다. vLLM 또는 llama.cpp로 셀프 호스팅하는 방법, M1 Max의 실제 성능 점검, 그리고 로컬 엔드포인트를 테스트하는 방법을 다룹니다.

Ashley Innocent

Ashley Innocent

29 July 2026

Kimi K3 로컬 실행법 (피해야 할 때)

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Moonshot AI는 7월 27일 Kimi K3의 오픈 웨이트를 공개했으며, Hugging Face의 다운로드 카운터는 이미 10만 건에 육박하고 있습니다. Moonshot이 공개한 모든 벤치마크에서 Claude Opus 4.8을 능가한 2.8조 개의 파라미터 모델을 이제 직접 호스팅할 수 있다는 점은 분명한 강점입니다.

하지만 숫자를 보면 단점도 분명합니다. 풀 정밀도 추론에는 1.57TB의 디스크 공간이 필요합니다. 공개된 MXFP4 웨이트조차도 594GB를 다운로드해야 합니다. 이 모델은 소유할 수 있지만, 8B Llama와는 달리 이 규모에서는 "로컬"의 의미가 달라집니다.

이 가이드에서는 K3를 자체 하드웨어에서 실행하는 데 필요한 사항, 커뮤니티가 소비자 기기에서 달성한 결과, 그리고 일단 K3 엔드포인트가 제공되면 Apidog를 사용하여 자체 호스팅 K3 엔드포인트를 API 워크플로우에 연결하는 방법을 다룹니다.

버튼

다운로드하는 내용

먼저, 모델의 형태에 대해 설명합니다. 자세한 배경 지식을 원하시면 Kimi K3란 무엇인가?를 참조하세요. 요약하면 다음과 같습니다.

웨이트는 Hugging Face 리포지토리에서 Kimi K3 라이선스 뒤에 게이트되어 있습니다. 라이선스에 동의한 다음 huggingface-cli로 다운로드합니다. 1Gbps 연결의 경우 594GB를 다운로드하는 데 약 80~90분 정도 소요됩니다.

옵션 1: vLLM 또는 SGLang을 사용한 데이터센터급 서비스

Moonshot은 vLLM, SGLang, TokenSpeed 세 가지 엔진을 권장합니다. KDA 프리필 캐시 기여는 웨이트와 함께 vLLM에 포함되었으므로, vLLM이 가장 쉬운 방법입니다.

vllm serve moonshotai/Kimi-K3 \
  --tensor-parallel-size 8 \
  --max-model-len 131072

현장에서의 참고 사항:

이는 데이터 주권적 의미에서 "로컬"입니다: 귀하의 인프라, 귀하의 로그, 귀하의 규정 준수 스토리. 노트북 의미의 로컬은 아니며, 어떤 양자화도 대화형 사용에 대한 이러한 사실을 바꾸지 않습니다.

옵션 2: 대형 워크스테이션에서 GGUF 양자화 사용

Unsloth는 llama.cpp 사용자를 위한 GGUF 변환을 공개했습니다. 이들의 동적 양자화는 K3를 공식 릴리스보다 줄일 수 있는 유일한 현실적인 방법입니다.

양자화(Quant) 크기(Size) 의미(What it means)
UD-IQ1_M ~345 GB 최소 사양. 공격적인 1비트 동적 양자화.
UD-IQ1_S ~650 GB Unsloth가 권장하는 균형점.
UD-Q4_K_XL ~1.55 TB 거의 풀 정밀도.
UD-Q8_K_XL ~1.6 TB 실질적으로 손실 없음.

작동 규칙: RAM과 VRAM을 합친 크기가 양자화 크기와 대략 같아야 합니다. 부족하더라도 llama.cpp는 오프로딩을 통해 실행되지만, 부족한 기가바이트당 속도가 저하됩니다. 128GB 머신에 연결된 Mac Studio 또는 DGX Station이 현실적인 최저 사양입니다.

비전 프로젝터를 포함한 최소한의 llama.cpp 호출:

./llama.cpp/llama-cli \
    --model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_M-00001-of-00015.gguf \
    --mmproj unsloth/Kimi-K3-GGUF/mmproj-F16.gguf \
    --temp 1.0 \
    --top-p 0.95

하드웨어 사양이 이보다 낮다면 무리하게 사용하지 마세요. 2026년 최고의 로컬 LLM 목록에는 24~128GB에 적합하며 실시간으로 응답하는 오픈 모델들이 있습니다. 충분하지 않은 RAM에서 1비트 K3는 그렇지 않을 것입니다.

M1 Max 실험: 가능하지만 토큰당 16초

이번 주 Hacker News 스레드에서 64GB M1 Max에서 K3가 메모리에 웨이트를 보관하는 대신 2TB SSD에서 스트리밍하여 실행되는 것이 문서화되었습니다. 이 수치들은 작동하는 이유와 사용하지 않을 이유를 모두 설명합니다.

MoE 희소성과 mmap을 통해 2.8T 모델을 노트북에서 실행할 수 있다는 증명으로서, 이는 정말 재미있는 결과입니다. K3를 사용하는 방법으로서는 그렇지 않습니다. MacBook에서 K3 답변을 원한다면 무료 계층이나 호스팅된 API가 더 나은 서비스를 제공할 것입니다.

로컬 K3를 API 워크플로우에 연결하기

vLLM 또는 llama.cpp의 서버 모드를 통해 서비스를 제공하든, 결과는 동일하게 OpenAI 호환 HTTP 엔드포인트가 localhost에 생성됩니다. 여기서부터는 다른 API와 마찬가지이며, API로 로컬 LLM 테스트에 사용하는 동일한 워크플로우가 적용됩니다.

  1. Apidog를 엔드포인트에 연결합니다. `base_url`을 `http://localhost:8000/v1` (vLLM의 기본값)으로 설정한 환경을 생성하고 나중에 Moonshot의 호스팅된 엔드포인트와 전환합니다. 동일한 요청, 두 개의 백엔드, 하나의 변수.
  2. 사고 스트림을 검사합니다. K3는 사고 전용이므로, 응답은 답변 전에 추론 내용을 포함합니다. Apidog의 SSE 디버깅 뷰는 스트림을 도착하는 대로 렌더링하여 추론 노력 수준의 변화를 훨씬 쉽게 파악할 수 있도록 합니다.
  3. 느낌이 아닌 구조를 단언합니다. 응답 스키마, 지연 시간 예산, 토큰 사용 필드를 검증하는 자동화된 테스트를 추가하여, 출력 품질을 저하시키는 양자화 스왑 또는 엔진 업그레이드가 사용자 보고서 대신 실패하는 테스트로 나타나도록 합니다.
  4. GPU가 사용 중일 때 K3를 모의(Mock)합니다. 594GB 모델은 로드하는 데 시간이 걸립니다. 실제 응답을 한 번 기록한 다음, 모의 서버가 이를 반환하도록 하여 프론트엔드 작업이 추론 박스를 기다리지 않도록 합니다. Apidog를 다운로드하여 무료로 설정하세요. 모의 및 테스트 도구는 모든 OpenAI 호환 서버에서 작동합니다.

요청 형식 자체는 Kimi K3 API 가이드에서 다룬 내용과 일치하므로, 호스팅된 API에 대해 작성된 테스트는 로컬 배포로 직접 전송됩니다.

그래서 로컬에서 실행해야 할까요?

빠른 결정표:

상황 권장 사항
8개 이상 GPU 노드, 데이터 주권 또는 규정 준수 필요 네. 텐서 병렬 처리 및 MXFP4 웨이트를 사용하는 vLLM.
350GB 이상의 RAM/VRAM을 갖춘 워크스테이션 실행 가능합니다. Unsloth 1비트 GGUF, 기대치를 낮추세요.
64~128GB Mac 또는 PC 아니요. 토큰당 몇 초가 걸릴 것이지, 초당 몇 토큰이 나오지 않습니다.
단순히 제품에 K3를 사용하고 싶음 호스팅된 API를 사용하세요. OpenAI 및 Anthropic과 호환됩니다.

솔직한 요약: K3의 오픈 웨이트가 중요한 이유는 대부분의 사람들이 그래야 하기 때문이 아니라, 프론티어급 모델을 감사하고, 미세 조정하며, 자체 호스팅할 수 있기 때문입니다. 하드웨어를 갖춘 팀의 경우 vLLM 경로가 현재 작동하며 성능이 좋습니다. 다른 모든 사람들에게는 오픈 릴리스가 더 저렴한 호스팅 액세스와 이를 제공하기 위해 경쟁하는 타사 공급업체를 통해 간접적으로 여전히 이점을 제공합니다.

이 표의 어느 쪽에 속하든, 엔드포인트는 모델이 코드와 만나는 지점입니다. 모델이 생각하는 동안 개발을 계속 진행할 수 있도록 스키마 확인, 스트리밍 검사, 모의 테스트를 사용하여 테스트하세요.

버튼

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요