2026년 7월은 오픈 웨이트 프론티어 모델들에게 '두 마리의 말'이 경쟁하는 달이 되었고, 두 말 모두 중국에서 나왔습니다. 문샷 AI는 7월 16일에 Kimi K3를 출시했습니다. 사흘 후, 알리바바는 Qwen 3.8-Max를 미리 공개했고, 8월 초에 일반에 공개했습니다. 둘 다 조(trillion)-파라미터 MoE(mixture-of-experts) 모델입니다. 둘 다 오픈 웨이트를 약속(또는 제공)합니다. 둘 다 Claude Code 스타일의 에이전트 하네스에 연결됩니다. 그리고 둘 다 가격 면에서 미국 프론티어 연구소들을 압도합니다.
겉보기에는 유사하지만 실제 차이점이 있습니다. 오늘 다운로드할 수 있는 것, 모델이 볼 수 있는 것, 그리고 한 달간의 집중적인 사용 비용에서 말이죠. 이 비교는 2026년 8월 3일 현재 확인할 수 있는 모든 기준을 살펴봅니다. 알리바바의 새로운 주력 모델에 대한 전체 사양 분석은 Qwen 3.8-Max 설명서에서 시작하여 돌아오세요.
시작하기 전에 솔직히 말씀드리자면, 이 두 모델에 대한 독립적인 직접 비교 벤치마크는 아직 없습니다. 이 기사의 모든 수치는 특정 공급업체의 자체 표에서 가져온 것이며, 각 수치가 누구의 결과인지 명시합니다. 벤치마크 섹션은 확정된 것이 아니라 참고용으로만 간주하십시오.
타임라인: 누가 무엇을 언제 출시했는가
여기서 출시 순서가 평소보다 더 중요합니다. "오픈 웨이트"가 현재 각 모델에 대해 다른 의미를 가지기 때문입니다.
Kimi K3는 2026년 7월 16일에 출시되었습니다. 문샷은 출시 시점에 오픈 웨이트를 약속했고, 11일 후 이를 제공했습니다. 웨이트는 7월 27일에 594GB MXFP4 릴리스로 Hugging Face에 공개되었습니다. 오늘 기준으로 K3를 다운로드하여 추가 양자화하고 자체 하드웨어에서 실행할 수 있습니다. 이것은 약속이 아닙니다. 이미 일어난 일입니다.
Qwen 3.8-Max는 7월 19일에 미리 공개되었고, 공식 Qwen 출시 게시물에 따르면 8월 초에 알리바바 클라우드 모델 스튜디오에서 일반에 공개되었습니다. 웨이트는 "다음 주"에 Hugging Face와 ModelScope에 공개될 예정이며, 이는 대략 8월 10일경입니다. 2026년 8월 3일 현재 다운로드할 수 없습니다. K3의 자체 출시와 웨이트 공개 사이의 11일 간격은 이러한 흐름이 정상임을 보여주지만, 현재 실제로 오픈된 모델은 이 중 하나뿐입니다.
자체 호스팅이 결정적인 요인이라면, 이 하나의 사실만으로도 비교를 일찍 끝낼 수 있습니다.
매개변수: 두 개의 조(trillion) 단위 MoE 모델, 하나는 더 가볍다
두 모델 모두 희소 MoE(mixture-of-experts) 디자인으로, 총 매개변수 수와 토큰당 컴퓨팅 비용이 매우 다릅니다.
| 사양 | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| 총 매개변수 | 2.4T | 2.8T |
| 토큰당 활성 매개변수 | 95B | 104B |
| 활성화 비율 | ~4% | ~3.7% |
| 아키텍처 기반 | Qwen 3.5 기반, MoE | MoE |
| 오픈 웨이트 형식 | 약속됨 (~8월 10일) | MXFP4, Hugging Face에서 594 GB |
Qwen 3.8-Max는 총 매개변수와 활성 매개변수 모두에서 K3보다 작은 모델입니다. 총 매개변수는 400B 적고, 활성 매개변수는 9B 적습니다. 두 격차 모두 극적이지 않으며, 활성 매개변수 수가 능력으로 선형적으로 변환되지는 않습니다. 하지만 이는 서비스 비용으로 변환됩니다. 토큰당 95B 매개변수를 활성화하는 모델은 다른 모든 조건이 동일할 때 104B를 활성화하는 모델보다 대규모로 실행하기 더 저렴하며, 이러한 차이는 아래 API 가격 책정에서 나타납니다.
자체 호스팅 사용자에게 더 관련 있는 숫자는 K3의 MXFP4 정밀도에서 594GB 다운로드 크기입니다. 이는 긴 컨텍스트에서 KV 캐시를 고려하기도 전에 이미 멀티 노드 영역입니다. Qwen 3.8-Max는 총 2.4T이므로, 파일이 공개될 때 유사한 용량을 가질 것으로 예상됩니다. 대부분의 팀은 두 모델 모두 호스팅된 엔드포인트를 사용할 것이며, 자체 호스팅은 규정 준수 또는 연구 사례로만 제한할 것입니다.
오늘의 개방성: 실제 웨이트 vs. 지난 약속
이 축은 자체 섹션으로 다룰 가치가 있습니다. 양측 모두 "오픈"이라고 홍보하지만 실제 사실은 다르기 때문입니다.
Kimi K3의 웨이트는 공개되어 있습니다. 지금 바로 저장소를 확인하고, 라이선스를 검토하고, 파일을 다운로드할 수 있습니다. 이는 제3자 호스팅, 커뮤니티 양자화, 미세 조정, 그리고 벤치마크한 모델이 사용자 몰래 변경되지 않을 것이라는 확신과 같은 진정한 개방성이 제공하는 모든 것을 의미합니다.
Qwen 3.8-Max는 역대 최초로 오픈 웨이트로 출시되는 Qwen-Max급 모델이 될 것이며, 이전 Max-티어 모델들을 API 전용으로 유지했던 알리바바의 전략에 있어 진정한 변화입니다. 그러나 '최초'는 실제로 발생해야만 최초입니다. Hugging Face 저장소가 활성화될 때까지 Qwen 3.8-Max는 발표가 첨부된 API 모델입니다.
오늘 기준으로 이 축은 K3의 승리이며, 8월 10일경에 다시 확인해야 한다는 주석을 달아둡니다. 알리바바가 약속을 이행하면 이 축은 동점이 되고, 비교는 라이선스 조건 및 양자화 품질로 옮겨갑니다.
모달리티: Qwen은 이미지를 보고, K3는 텍스트를 읽는다
여기서 격차는 반대 방향으로, 그리 가깝지 않습니다.
공식 모델 구성("input_modalities": ["text", "image"])에 따르면 Qwen 3.8-Max는 텍스트 및 이미지 입력을 받습니다. 알리바바의 출시 게시물은 더 나아가, 200페이지가 넘는 PDF 문서의 장문 이해와 메모리 그래프를 통한 100시간 분량의 비디오 이해를 시연합니다. 이들은 문서화된 API 입력 유형이 아닌 블로그 데모로 간주하십시오. 그러나 이미지 입력은 실제이며 오늘날 API에 존재합니다. 알리바바의 공급업체 벤치마크는 이를 활용합니다. 멀티모달 표(MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1, 강력한 OCR 항목)는 Qwen 3.8-Max가 가장 일방적인 수치를 게시하는 부분입니다.
Kimi K3는 텍스트 모델입니다. 워크로드에 스크린샷, 스캔한 문서, UI 이해 또는 시각 관련 에이전트 작업이 포함된 경우, K3는 별도의 비전 모델이 파이프라인에 연결되어야 하며, 이는 모든 연결 코드와 추가 지연 시간을 의미합니다.
텍스트 전용 코딩 및 에이전트 작업의 경우 이 축은 무관합니다. 문서 지능 및 컴퓨터 사용 에이전트의 경우 결정적입니다.
컨텍스트, 출력 및 API 표면
Qwen 3.8-Max는 단일 평면 계층으로 1,000,000 토큰 컨텍스트 창을 제공하며, 최대 출력은 65,536 토큰입니다. 추론은 reasoning_effort 매개변수(기본값 xhigh, medium 및 low도 있음)에 의해 제어되며, 사고 출력은 기본적으로 보존됩니다. 주목할 점은 사고 모드와 비사고 모드가 동일한 요금으로 청구된다는 것입니다.
액세스는 알리바바 클라우드 모델 스튜디오를 통해 이루어지며, 세 개의 지역 기본 URL(베이징, 싱가포르, 미국-버지니아)과, 특이하게도 한 플랫폼에 두 가지 프로토콜 형태가 있습니다: OpenAI 호환 엔드포인트와 Anthropic 호환 엔드포인트입니다. 이 이중 프로토콜 표면 덕분에 Qwen 3.8-Max는 ANTHROPIC_BASE_URL 및 ANTHROPIC_MODEL=qwen3.8-max만 있으면 Claude Code에 쉽게 통합됩니다. 전체 라인업 및 지역별 가용성은 모델 스튜디오 모델 페이지에 문서화되어 있습니다. 여러 지역에서 작업하는 경우 Apidog와 같은 도구를 사용하면 각 기본 URL을 환경으로 저장하고 요청을 편집하지 않고도 전환할 수 있습니다.
Kimi K3 역시 Anthropic 프로토콜을 사용하며 Claude Code 스타일 하네스에 삽입될 수 있는데, 이것이 바로 이 두 모델이 "기존 에이전트 하네스를 더 저렴한 프론티어 모델로 지정"이라는 동일한 자리에서 경쟁하는 이유입니다. K3의 엔드포인트 세부 정보 및 현재 제한 사항은 출시 이후 변경되었을 수 있는 수치에 의존하기보다는 Kimi K3 설명서를 참조하십시오.
가격: 평면적이고 단순함 vs. 저렴한 입력, 비싼 출력
100만 토큰당 게시된 요금은 다음과 같습니다.
| 요금 | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| 입력 | $2.00 | $3.00 |
| 출력 | $6.00 | $15.00 |
| 캐시 적중 입력 | $0.20 (입력의 10%) | $0.30 |
| 티어링 | 전체 1M 컨텍스트에 걸쳐 평면적 | Moonshot의 게시된 일정에 따름 |
Qwen 3.8-Max는 공식 모델 스튜디오 가격 페이지에 따라, 토큰 0부터 100만까지, 사고 여부와 상관없이 입력 $2, 출력 $6로 평면적입니다. 명시적 캐시 생성은 입력의 125%, 캐시 적중은 10%로 청구됩니다. 또한 무료 할당량도 있습니다: 100만 토큰, 싱가포르 지역만 해당, 90일 유효.
K3의 요율은 캐시 적중 시 100만 토큰당 $0.30, 입력 100만 토큰당 $3, 출력 100만 토큰당 $15입니다.
비교는 하나의 숫자로 이루어지지 않습니다. 캐시 관리가 잘된 입력 중심 워크로드(긴 시스템 프롬프트, 반복되는 문서 컨텍스트)에서는 두 모델이 표시된 가격보다 더 가깝습니다. 캐시된 메가토큰당 $0.20 vs $0.30은 좁은 격차입니다. 출력 중심 워크로드에서는 격차가 큽니다. K3의 $15 출력 요율은 Qwen의 $6의 2.5배입니다. 많은 추론과 코드를 생성하는 에이전트 루프는 출력 중심이므로, 이론상 Qwen 3.8-Max에 유리합니다.
Qwen에 특별히 적용되는 한 가지 주의 사항: reasoning_effort는 기본적으로 xhigh이며, 사고 토큰은 출력으로 청구됩니다. 실제 청구서는 순진한 토큰 입력-토큰 출력 예상보다 높게 나올 것입니다. 저희의 Qwen 3.8 가격 분석은 커밋하기 전에 이를 모델링하고 싶다면 작업당 비용 예시를 통해 설명합니다.
벤치마크: 두 공급업체 표, 심판 없음
이것이 이 두 모델의 대부분의 비교가 잘못되는 지점이므로, 존재하는 것에 대해 정확하게 설명합시다.
존재하는 것: 알리바바는 Qwen 3.8-Max와 Claude Opus 4.8, Fable 5, GPT-5.6 Sol, Qwen 3.7-Max에 대한 벤치마크 표를 게시했습니다. 문샷은 Kimi K3와 유사한 프론티어 라인업에 대한 자체 출시 표를 게시했습니다. 둘 다 공급업체가 실행한 것입니다.
존재하지 않는 것: Qwen 3.8-Max와 Kimi K3를 동일한 하네스에서 동일한 표에 넣은 독립적인 평가. 작성 시점에 Qwen 3.8-Max에 대한 인공지능 분석 수치는 없었습니다. 두 공급업체는 서로의 모델을 벤치마크하지 않았습니다.
이러한 틀 안에서, 각 측이 자체 실행에서 주장하는 내용은 다음과 같습니다.
알리바바의 표에서 (알리바바가 실행, 주로 Claude Code 하네스를 통해 실행되었으며, 알리바바 스스로가 밝힌 세부 사항):
| 벤치마크 | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 |
| HLE | 43.6 | 45.7 | 53.3 | 47.2 |
알리바바 자체 수치에는 명확한 패배도 포함되어 있습니다. Qwen 3.8-Max는 SWE-bench Pro에서 Fable 5에게 크게 뒤지고, HLE에서는 나열된 모든 모델에게 뒤집니다. 뛰어난 항목은 PaperBench, 명령 수행(IFBench 82.8), 그리고 멀티모달 스윕입니다. 다른 여러 주요 결과는 알리바바의 자체 벤치마크(QwenSWEBench, CoWorkBench 등)를 사용하며, 이는 다른 어떤 모델과도 교차 참조할 수 없습니다.
문샷 측에서 K3의 출시 표는 문샷의 주요 벤치마크 항목에서 Claude Opus 4.8을 능가하는 반면, 전체적으로 Fable 5와 GPT-5.6 Sol에는 뒤지는 것을 보여주었습니다. 우리는 Kimi K3 vs Claude Opus 4.8 비교에서 이러한 주장과 그 한계점을 다루었습니다.
벤치마크가 겹치는 두 표를 나란히 비교할 수 있을까요? 할 수는 있고, 사람들은 그렇게 할 것이지만, 다른 하네스, 스캐폴딩, 샘플링 설정은 교차 표 해석을 기껏해야 참고용으로 만듭니다. 솔직한 요약: 두 공급업체 모두 에이전트 작업에서 자사 모델이 미국 프론티어 모델과 경쟁하며 선택적으로 우수함을 보여줍니다. 어떤 표도 둘 중 어느 쪽이 더 강한지 확정하지 않습니다. 알리바바 수치에 대한 자세한 내용은 Qwen 3.8 벤치마크 분석을 참조하십시오.
Apidog에서 직접 일대일 비교 실행
심판이 없으므로, 가장 유용한 벤치마크는 사용자 자신의 워크로드에서 실행하는 것입니다. 두 모델 모두 OpenAI 호환 채팅-완성 엔드포인트를 노출하여 Apidog에서 나란히 테스트하기가 간단합니다.
DashScope 기본 URL과 qwen3.8-max를 포함하는 환경 하나, Moonshot의 엔드포인트와 K3 모델 ID를 포함하는 환경 하나, 각각 고유의 API 키 변수를 사용하여 두 개의 환경을 설정합니다. 실제 프롬프트(수수께끼가 아닌 제품의 실제 작업)를 사용하여 요청 하나를 저장하고, 환경을 전환하여 동일한 페이로드를 두 모델에 보냅니다. Apidog의 응답 보기는 상태, 지연 시간, 전체 본문을 나란히 보여주며, SSE 디버깅은 각 모델이 추론 콘텐츠를 스트리밍하는 방식을 보여주므로, UI가 사고 토큰을 렌더링하는 경우 중요합니다. 몇 가지 어설션(응답 스키마, 지연 시간 상한, 출력에 필요한 키워드)을 추가하면, 분위기 확인이 반복 가능한 테스트로 바뀌며, 어느 공급업체가 업데이트를 출시할 때마다 다시 실행할 수 있습니다. Apidog 다운로드하여 무료로 비교를 실행하십시오. 두 엔드포인트를 통해 10개의 프롬프트를 보내면 어느 공급업체의 표보다 더 많은 것을 알 수 있을 것입니다.
스코어카드
| 기준 | 오늘의 승자 | 주의사항 |
|---|---|---|
| 총/활성 매개변수 | Qwen 3.8-Max (더 가벼움: 2.4T/95B vs 2.8T/104B) | 작은 것이 그 자체로 좋거나 나쁜 것은 아니며, 주로 서비스 비용을 나타냅니다. |
| 오픈 웨이트, 오늘 | Kimi K3 (Hugging Face에서 실시간, 594 GB MXFP4) | Qwen의 웨이트는 ~8월 10일 예정; 다시 확인해야 합니다. 이 축은 곧 동점이 될 수 있습니다. |
| 모달리티 | Qwen 3.8-Max (텍스트 + 이미지 입력) | 비디오/장문 문서 주장은 블로그 데모이며, 문서화된 API 입력 유형이 아닙니다. |
| 컨텍스트 창 | Qwen 3.8-Max (1M 평면 계층, 65,536 최대 출력) | 사용 사례에 대해 Moonshot 문서에서 K3의 현재 제한 사항을 확인하십시오. |
| 가격 | Qwen 3.8-Max ($2/$6 평면 vs $3/$15) | xhigh 사고 기본값은 Qwen의 실제 출력 비용을 부풀립니다. |
| 벤치마크 | 판정 불가 | 두 표 모두 공급업체 실행; 독립적인 일대일 비교는 존재하지 않습니다. |
| 하네스 생태계 | 동점 | 둘 다 Anthropic 프로토콜 엔드포인트를 통해 Claude Code 스타일 하네스에 드롭됩니다. |
| 약속 이행 실적 | Kimi K3 | 출시 11일 후 웨이트 배송; Qwen의 약속은 아직 유효합니다. |
어느 것을 언제
Kimi K3를 선택해야 하는 경우: 이번 주에 자체 하드웨어에서 웨이트가 필요하거나, 규정 준수 요건상 고정 및 감사 가능한 모델이 필요하거나, 워크로드가 순수 텍스트이며 캐시 가격이 지배적일 만큼 입력 중심인 경우.
Qwen 3.8-Max를 선택해야 하는 경우: 워크로드가 이미지 또는 문서를 처리하거나, 많은 출력 토큰을 생성하거나(에이전트 루프, 코드 생성), 티어링 가격 변동 없이 100만 토큰 컨텍스트를 원하는 경우.
일주일 기다려야 하는 경우: 오픈 웨이트가 두 모델 중 하나를 고려하는 유일한 이유인 경우. Qwen의 웨이트가 8월 10일경에 약속대로 공개된다면, 개방성 기준은 재설정되고 결정은 모달리티, 가격, 그리고 자체 평가 결과에 따라 달라질 것입니다.
진정한 이야기는 이제 개발자들이 3주 간격으로 중국에서 나온 두 가지 신뢰할 수 있고 저렴하며 하네스와 호환되는 프론티어 옵션을 갖게 되었다는 것입니다. 어느 쪽에 마음이 끌리든, 어떤 공급업체의 표에 로드맵을 확정하기 전에 두 엔드포인트 모두에서 자신의 프롬프트를 실행해 보십시오.
자주 묻는 질문 (FAQ)
Kimi K3가 Qwen 3.8-Max보다 더 오픈되어 있나요?
오늘날, 그렇습니다. 명백한 사실입니다. K3의 웨이트는 2026년 7월 27일부터 Hugging Face에 공개되어 있으며(594GB, MXFP4), Qwen 3.8-Max의 웨이트는 8월 10일경에 공개될 예정이며 아직 다운로드할 수 없습니다. 알리바바가 약속을 이행한다면, 둘 다 오픈 웨이트 프론티어 모델이 될 것이며, 의미 있는 차이점은 라이선스 조건과 커뮤니티 지원으로 옮겨갈 것입니다. 그때까지는 K3만 자체 호스팅이 가능합니다. 저희의 로컬 K3 가이드는 필요한 사항을 설명합니다.
Qwen 3.8-Max와 Kimi K3 중 어떤 모델이 코딩에 더 능숙한가요?
아무도 아직 정직하게 답할 수 없습니다. 두 공급업체 모두 강력한 에이전트 코딩 수치를 발표했지만, 각자 자체 조건에서 자체 평가를 실행했으며, 독립적인 직접 비교는 존재하지 않습니다. 알리바바 자체 표조차도 Qwen 3.8-Max가 SWE-bench Pro에서 Fable 5에 패배하는 것을 보여주므로, 공급업체 표는 손실을 인정합니다. 다만, 공급업체 간 비교는 불가능합니다. 결정하기 전에 자신의 저장소에서 작업으로 두 모델을 모두 실행해 보십시오.
Claude Code에서 두 모델을 모두 사용할 수 있나요?
네. 둘 다 Anthropic 호환 엔드포인트를 노출합니다. Qwen 3.8-Max의 경우, 알리바바의 출시 게시물에서 제공된 구성에 따라 ANTHROPIC_BASE_URL을 DashScope Anthropic 엔드포인트로 설정하고 ANTHROPIC_MODEL=qwen3.8-max로 설정하십시오. K3도 Moonshot의 엔드포인트를 통해 동일한 패턴을 지원합니다. 이러한 공유 하네스 호환성 덕분에 두 모델을 A/B 테스트하는 설정 비용이 저렴합니다.
일반적인 에이전트 워크로드에 어떤 것이 더 저렴한가요?
정가 기준으로 Qwen 3.8-Max가 더 저렴합니다. K3의 100만 토큰당 $3/$15에 비해 $2/$6이며, 에이전트 루프는 출력 토큰에 치우쳐 있어 격차가 2.5배입니다. 두 가지 주의 사항이 있습니다. K3의 $0.30 캐시 적중 요금은 입력 중심의 캐시가 잘된 워크로드에서 경쟁력을 유지하며, Qwen의 기본 xhigh 추론 노력은 사고를 출력으로 청구하므로 실제 비용은 순진한 예상보다 높게 나옵니다. 정가가 모든 것을 말해준다고 가정하기 전에 자신의 토큰 혼합을 모델링하십시오.
