Moonshot의 Kimi K2.7 Code는 코딩에 최적화된, 오픈 웨이트를 가진 조 단위 매개변수 모델입니다. 이 조합은 만료되는 체험판이 아닌, 모델을 사용할 수 있는 진정한 무료 경로를 제공한다는 것을 의미합니다. 브라우저에서 대화하거나, 시작 할당량으로 에이전트를 실행하거나, 웨이트를 다운로드하여 토큰당 비용 없이 직접 호스팅할 수 있습니다.
다음은 설정 없이도 바로 사용할 수 있는 방법부터 완전한 자체 호스팅에 이르기까지, 각 방법의 솔직한 장단점과 함께 실제로 작동하는 방식들입니다.
요약
- 무료 채팅: Kimi 웹 앱과 모바일 앱을 무료로 사용할 수 있습니다.
- 무료 에이전트 할당량: Kimi Code CLI는 비용 없이 실행할 수 있는 시작 플랜을 제공합니다.
- 무료 웨이트: Hugging Face에서 모델을 다운로드하여 자체 호스팅할 수 있습니다. 하드웨어 비용만 지불하면 됩니다.
- 가장 저렴한 호스팅: 무료 티어를 넘어선다면, API는 백만 토큰당 $0.95/$4.00입니다.

방법 1: Kimi 웹 앱에서 채팅
모델을 무료로 사용하는 가장 빠른 방법은 브라우저를 이용하는 것입니다. Kimi 웹 앱으로 이동하여 로그인하고 대화를 시작하세요. 설정이나 키 없이 코딩 질문, 디버깅 지원, 빠른 프로토타입 제작을 위해 K2.7 Code 모델을 사용할 수 있습니다.
다음과 같은 경우에 적합한 선택입니다:
- 스택 트레이스를 붙여넣고 무엇이 문제인지 물어볼 때
- 함수를 작성하거나 검토할 때
- 두 가지 접근 방식을 비교하여 하나를 선택하기 전에
제한 사항은 이것이 에이전트가 아닌 채팅 상자라는 것입니다. 파일에 접근하거나 명령을 실행하지 않습니다. 이를 위해서는 아래 CLI가 필요합니다.
방법 2: 모바일용 Kimi 앱
Moonshot은 동일한 무료 채팅 접근을 제공하는 모바일 앱을 출시했습니다. 코드를 읽거나, 자리에서 떨어져 질문하거나, 나중에 에이전트가 구현할 아이디어를 기록하기에 편리합니다. 동일한 모델, 동일한 무료 비용, 더 작은 화면입니다.
방법 3: Kimi Code 에이전트를 무료 할당량으로 실행
Kimi Code CLI는 Moonshot의 터미널 코딩 에이전트입니다. 한 줄로 설치되며 비용 없이 사용할 수 있는 시작 할당량을 포함합니다:
curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
`kimi`를 실행하고, `/login`으로 로그인한 후, `/usage`로 남은 할당량을 확인하세요. 무료 티어는 실제 작업을 위해 에이전트를 테스트하기에 충분합니다. 저장소를 탐색하거나, 함수를 작성하거나, 테스트를 실행하게 할 수 있습니다. 할당량은 7일 주기로 새로 고침되므로, 한도에 도달한 후에도 다시 사용할 수 있습니다.
이것은 단순히 질문에 답하는 것이 아니라, 코드베이스에서 실제 작업을 수행하는 무료 경로입니다. 실제 작업에 할당량을 사용하기 전에 에이전트가 프로젝트를 학습하도록 먼저 `/init`을 사용하세요.
방법 4: 웨이트를 다운로드하여 자체 호스팅
모델이 오픈 소스이기 때문에 이것은 영원히 무료인 경로입니다. K2.7 Code는 수정된 MIT 라이선스 하에 제공되므로, Hugging Face에서 다운로드하여 자신의 하드웨어에서 실행할 수 있습니다. 토큰당 요금은 없으며, 유일한 비용은 장비입니다.
문제는 크기입니다. 조 단위 매개변수 모델이므로, 전체 웨이트는 상당한 GPU 메모리를 필요로 합니다. 이를 실용적으로 만드는 두 가지 방법:
- 하드웨어가 있다면 vLLM, SGLang 또는 KTransformers로 서비스하세요. Moonshot은 이 엔진들을 권장합니다.
- 더 작은 설정을 위해서는 양자화된 빌드를 사용하세요. 커뮤니티 양자화(예: Unsloth 릴리스)는 메모리 공간을 줄여 더 적은 GPU에서도 실행되도록 하며, 약간의 품질 저하가 있을 수 있습니다.
이전에 Kimi 모델을 자체 호스팅한 경험이 있다면, 그 과정은 저희 Kimi K2.5 로컬 실행 가이드와 유사합니다. 엔진 명령어는 동일하며, 모델 이름만 변경됩니다. 자체 호스팅은 데이터가 자신의 하드웨어에 보관되어야 하거나, 호스팅된 토큰 비용이 너무 많이 발생할 정도로 충분한 볼륨을 운영할 때 선택하는 방법입니다.
방법 5: 무료가 아닌 저렴한 방식 (무료 티어를 넘어설 경우)
무료 할당량이 소진되고 자체 호스팅을 원치 않을 경우, 호스팅된 API가 대안입니다. 무료는 아니지만 저렴합니다. 입력 토큰 백만 개당 $0.95, 출력 토큰 백만 개당 $4.00이며, 캐시 히트 시 백만 개당 $0.19입니다. 대부분의 사이드 프로젝트에서는 몇 센트의 실제 사용료가 발생합니다. 전체 설정은 저희 Kimi K2.7 Code API 가이드에 있습니다.
어떤 무료 경로를 선택해야 할까요?
| 원하는 경우… | 사용 |
|---|---|
| 코딩 질문을 빠르게 할 때 | Kimi 웹 앱 |
| 에이전트가 파일을 편집하고 명령을 실행하게 할 때 | Kimi Code CLI 무료 할당량 |
| 토큰당 비용을 모두 피하고 데이터를 비공개로 유지할 때 | 오픈 웨이트를 자체 호스팅 |
| 무료 제한을 넘어 저렴하게 확장할 때 | 호스팅된 API |
대부분의 사람들은 웹 앱으로 시작하고, 에이전트를 원할 때 CLI로 이동하며, 프라이버시나 볼륨이 요구할 때만 자체 호스팅합니다.
구축하는 것을 테스트하는 방법에 대한 참고 사항
모델의 API를 호출하는 프로토타입을 무료 할당량으로 사용하는 경우, 해당 엔드포인트를 신뢰하기 전에 유효성을 검사하세요. Apidog를 사용하면 테스트 요청을 보내고, 응답 및 토큰 사용량을 확인하고, 나중에 다시 실행할 검사로 저장할 수 있습니다. 무료로 시작할 수 있으며 Moonshot의 엔드포인트를 포함한 모든 OpenAI 호환 엔드포인트에서 작동합니다. 진행하면서 테스트하고 싶다면 Apidog를 다운로드하세요.
자주 묻는 질문
Kimi K2.7 Code는 정말 무료인가요? 웹 및 모바일 채팅은 무료이며, CLI에는 무료 할당량이 있고, 오픈 웨이트는 무료로 다운로드할 수 있습니다. 호스팅된 API 토큰 또는 자신의 하드웨어에 대해서만 비용을 지불합니다.
무료 채팅에 API 키가 필요한가요? 아닙니다. 웹 앱과 모바일 앱은 계정 로그인만으로 작동합니다.
제 컴퓨터에서 무료로 실행할 수 있나요? 네. Hugging Face에서 웨이트를 다운로드하여 vLLM, SGLang 또는 KTransformers로 서비스하세요. GPU가 제한적이라면 양자화된 빌드를 사용하세요.
자체 호스팅을 위해 얼마나 많은 하드웨어가 필요한가요? 조 단위 매개변수 모델이므로 전체 웨이트는 상당한 GPU 메모리를 필요로 합니다. 양자화된 커뮤니티 빌드는 요구 사항을 낮추지만 약간의 품질 저하가 있습니다.
무료 CLI 할당량이 소진되면 어떻게 되나요? 할당량은 7일 주기로 새로 고침됩니다. 그 전에 더 필요하다면, 토큰당 지불 API를 사용하거나 자체 호스팅으로 전환하세요.
API에 무료 티어가 있나요? 새 계정에는 시작 크레딧이 포함될 수 있지만, 지속적인 API 사용은 토큰당 지불 방식입니다. 백만 토큰당 $0.95/$4.00로 저렴합니다.
요약
Kimi K2.7 Code는 웨이트가 공개되어 있기 때문에 대부분의 코딩 모델보다 더 많은 진정한 무료 경로를 제공합니다. 즉각적인 채팅을 위해서는 Kimi 웹 앱에서 시작하고, 파일에 접근하는 에이전트가 필요할 때는 Kimi Code CLI 무료 할당량으로 전환하며, 토큰당 비용이 전혀 없거나 완전한 프라이버시가 필요할 때는 다운로드한 웨이트를 자체 호스팅하세요. 무료 티어를 넘어 확장해야 할 경우, 호스팅된 API는 여전히 저렴합니다. 작업에 맞는 경로를 선택하고 구축을 시작하세요.
