Qwen 3.8 요금제 설명: 1M 컨텍스트 기준 입력 $2 / 출력 $6

큐웬 3.8 정식 출시(GA) 가격: 입력 100만 토큰당 2달러 / 출력 100만 토큰당 6달러이며, 전체 100만 토큰 컨텍스트에 걸쳐 동일한 요금이 적용됩니다. 캐시 할인, 무료 할당량에 대한 세부 조건, 그리고 실제 비용 계산법.

INEZA Felin-Michel

INEZA Felin-Michel

3 August 2026

Qwen 3.8 요금제 설명: 1M 컨텍스트 기준 입력 $2 / 출력 $6

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

알리바바는 2026년 8월 초에 Qwen 3.8-Max를 출시했으며, 가격 책정 질문에 마침내 실제 답이 나왔습니다. 7월 미리 보기 기간 동안 유포된 이야기는 "10% 미리 보기 가격" 프로모션이었습니다. 그 이야기는 끝났습니다. 정식 출시 시점에는 공식 Model Studio 가격 페이지에 `qwen3.8-max`가 **100만 입력 토큰당 $2, 100만 출력 토큰당 $6**로 표시되어 있으며, 전체 100만 토큰 컨텍스트 창을 포함하는 단일 고정 계층입니다.

이 고정 계층이 흥미로운 부분입니다. 대부분의 최첨단 모델은 프롬프트가 컨텍스트 임계값을 넘으면 토큰당 요금을 더 많이 부과합니다. Qwen 3.8-Max는 그렇지 않습니다. 5,000토큰을 보내든 900,000토큰을 보내든 요금은 $2/$6로 유지됩니다.

이 글에서는 전체적인 내용을 다룹니다: 고정 계층 설계, Qwen 3.7-Max, Kimi K3, Claude Opus 5 및 GPT-5.6 Terra와의 비교, 캐싱 할인, 무료 할당량 세부 정보, 그리고 실제 계산을 통한 비용 예시. 더 넓은 모델 개요를 보려면 Qwen 3.8이 무엇이며 왜 중요한지부터 시작한 다음, 숫자를 확인하기 위해 다시 돌아오세요.

먼저 한 가지 참고 사항: 정가만으로는 추정치만 얻을 수 있습니다. Qwen 3.8-Max는 기본적으로 `xhigh` 노력으로 추론 기능을 제공하며, 사고 토큰은 출력으로 청구됩니다. 비용을 예측하는 신뢰할 수 있는 방법은 실제 요청을 보내고 토큰 사용량을 측정하는 것입니다. Apidog는 테스트 중에 모든 응답의 전체 토큰 분석을 보여주어, 비용 추정을 산술 계산으로 바꿉니다. 자세한 내용은 아래에서 확인하세요.

정식 출시(GA) 가격: 입력 $2, 출력 $6, 단일 계층

2026년 8월 3일 기준 Model Studio 가격 페이지를 통해 확인된 `qwen3.8-max`의 공식 요금표는 다음과 같습니다:

항목 가격 (100만 토큰당)
입력 $2.00
출력 (사고 토큰 포함) $6.00
캐시된 입력 (캐시 적중) 입력 요금의 10%
명시적 캐시 생성 입력 요금의 125%
컨텍스트 계층 단일 계층, 0 ~ 100만 토큰
사고 토큰 vs 비사고 토큰 동일하게 청구됨

주목할 만한 세 가지 세부 사항: 100만 토큰 컨텍스트 창은 추가 장문 프롬프트 할증료 없이 단일 가격으로 완전히 커버됩니다. 사고 모드와 비사고 모드는 동일한 요금이 부과되지만, 사고 토큰은 출력으로 계산됩니다(아래 정직 섹션 참조). 그리고 최대 출력은 요청당 65,536토큰이므로, 단일 응답은 출력에서 최대 약 $0.39가 청구됩니다.

공식 Qwen 3.8 발표는 이 모델을 알리바바의 가장 강력한 모델로 소개합니다: 총 2.4조 파라미터 중 950억 개 활성, 100만 토큰 컨텍스트 창, 멀티모달 입력. 이를 $2/$6에 제공하는 것은 알리바바 자체의 이전 플래그십을 포함하여 대부분의 최첨단 계층을 능가하는 가격입니다.

100만 토큰에 걸친 고정 요금제가 이례적인 이유

계층형 컨텍스트 가격 책정은 업계의 표준입니다: 컨텍스트 임계값 미만에서는 한 요금, 그 이상에서는 더 높은 요금으로, 긴 컨텍스트는 제공하는 데 더 많은 비용이 들기 때문입니다.

알리바바도 자체적으로 이를 따릅니다. 동일한 Model Studio 가격 페이지에서 qwen3-max 및 qwen3-coder-plus와 같은 모델은 컨텍스트 길이 계층으로 가격이 책정되어 입력이 증가함에 따라 토큰당 요금이 상승합니다. Qwen 3.8-Max는 알리바바 자체 카탈로그 내에서 이러한 패턴을 벗어납니다: 해당 가격표는 "0<토큰≤1M"이라는 단일 행만을 보여줍니다.

이것이 중요한 이유: 계층형 가격 책정에서는 긴 컨텍스트 워크로드가 숨겨진 승수를 가집니다. 때때로 30만 토큰의 문서를 프롬프트에 넣는 RAG 파이프라인은 해당 요청에 대해 일반적인 요금의 몇 배가 들 수 있습니다. Qwen 3.8-Max에서는 한계 토큰 비용이 항상 동일하므로 예산 책정이 선형적입니다: 토큰 수 x 요금, 끝. 장문 문서 분석, 대규모 코드베이스 에이전트 또는 강력한 검색 파이프라인의 경우, 이러한 예측 가능성은 낮은 요금 자체만큼 가치가 있습니다.

정가 기준으로 Qwen 3.7-Max보다 저렴함

Qwen 3.8-Max는 이전 모델의 정가보다 낮은 가격으로 출시되었는데, 이는 플래그십 세대 전환에서 흔치 않은 일입니다:

이는 모델이 더 큰 컨텍스트 창, 멀티모달 입력 및 더 나은 벤치마크 점수를 얻었음에도 불구하고 양쪽에서 20% 인하된 가격입니다.

한 가지 복잡한 점: Qwen 3.7-Max는 현재 50% 할인 프로모션을 진행 중이며, 이로 인해 **$1.25/$3.75**까지 내려갑니다. 프로모션 요금으로는 구형 플래그십이 신형보다 저렴합니다. 워크로드가 Qwen 3.8의 100만 컨텍스트 또는 멀티모달 및 에이전트 개선 사항을 필요로 하지 않는다면, 할인된 3.7-Max는 프로모션 기간 동안 합리적인 가치 플레이가 될 수 있습니다. 다만, 프로모션에 맞춰 비용 모델을 설계하지 마십시오. 그 아래 단계에서 Qwen 3.7-Plus는 자체 20% 프로모션과 함께 $0.4/$1.6으로 예산 작업용 모델로 남아 있습니다.

솔직한 섹션: 사고 토큰은 출력으로 청구됩니다

이것은 대부분의 가격 책정 글에서 건너뛰는 부분이며, 청구서에서 가장 놀라게 할 가능성이 있는 부분입니다.

Qwen 3.8-Max는 `xhigh`, `medium`, `low` 세 가지 수준의 `reasoning_effort` 매개변수를 지원합니다. 기본값은 가장 적극적인 설정인 `xhigh`입니다. 사고 모드에서 모델은 최종 답변 전에 내부 추론 토큰을 생성하며, **이러한 추론 토큰은 보이는 텍스트와 동일하게 $6 출력 요금으로 청구됩니다.**

결과: 기본 설정에서 추론이 많은 요청은 순진한 "프롬프트 토큰 + 답변 토큰" 예상보다 비용이 더 많이 듭니다. 800토큰의 보이는 답변을 표시하는 응답은 어려운 문제에 대해 수천 개의 사고 토큰을 소비했을 수 있습니다.

세 가지 완화책: 깊은 추론이 필요하지 않은 작업(분류, 추출, 서식 지정)의 경우 `reasoning_effort`를 `medium` 또는 `low`로 낮추십시오. 모든 응답의 `usage` 객체가 추론을 포함한 실제 사용량을 보고하므로 월별 지출을 예상하기 전에 작업 유형별 실제 사용량을 측정하십시오. 그리고 특히 출력 토큰을 주시하십시오. 여기서는 출력이 입력의 3배가 들고, 사고 토큰이 출력을 부풀리기 때문입니다.

컨텍스트 캐싱: 적중 시 10%, 생성 시 125%

애플리케이션이 동일한 프롬프트 접두사를 반복적으로 재전송하는 경우(긴 시스템 프롬프트, 안정적인 문서, 도구 정의), 컨텍스트 캐싱은 경제성을 크게 변화시킵니다:

손익분기점 계산은 간단합니다. 생성 비용은 한 번에 25%가 추가로 들지만, 그 후 매번 적중 시 90%가 절약됩니다. 접두사가 두 번만 재사용되더라도 캐싱은 이미 그 자체로 이익을 줍니다. 시스템 프롬프트가 무거운 고빈도 에이전트 또는 채팅 애플리케이션의 경우, 절약 효과는 빠르게 증폭됩니다(아래 예시 참조).

무료 할당량 세부 정보: 100만 토큰, 싱가포르, 90일

Model Studio는 `qwen3.8-max`에 대한 무료 할당량을 제공하며, 세부 정보가 중요합니다:

사고 토큰은 다른 출력과 마찬가지로 이 할당량에서 소진되므로, `xhigh` 난이도의 몇십 가지 어려운 추론 작업으로도 예상보다 빠르게 100만 토큰을 소진할 수 있습니다. 무료 액세스가 주요 목표라면, Qwen Chat을 포함한 모든 무료 경로를 Qwen 3.8을 무료로 사용하는 방법에서 모아두었습니다.

Qwen 3.8 가격 비교

다음은 100만 토큰당 정가를 사용한 현재 상황입니다. 프로모션 요금은 프로모션 기간이 만료되므로 플래그가 지정됩니다.

모델 입력 출력 참고 사항
Qwen 3.8-Max $2.00 $6.00 100만 컨텍스트에 걸쳐 고정; 캐시 적중 10%
Qwen 3.7-Max $2.50 $7.50 현재 50% 할인: $1.25/$3.75 (프로모션)
Qwen 3.7-Plus $0.40 $1.60 현재 20% 할인 (프로모션)
Kimi K3 $3.00 $15.00 캐시 적중 $0.30
Claude Opus 5 $5.00 $25.00
GPT-5.6 Terra $2.00 $12.00

표를 읽어보면:

가격이 품질을 의미하지는 않으며, 공급업체 벤치마크 표는 공급업체 벤치마크 표일 뿐입니다. 하지만 순수 요금표 수준에서 Qwen 3.8-Max는 이 라인업에서 가장 저렴한 최첨단 플래그십입니다.

작업 예시: 실제 작업 비용은 얼마인가

정가는 작업 형태의 계산 없이는 의미가 거의 없습니다. $2/$6로 계산된 세 가지 시나리오:

예시 1: 5만 토큰 에이전트 세션

에이전트 실행은 38,000개의 입력 토큰(지시, 도구 스키마, 도구 결과)을 소비하고 12,000개의 출력 토큰을 생성합니다:

이제 기본 `xhigh` 추론을 추가합니다. 모델이 실행 중에 8,000개의 사고 토큰을 소비한다고 가정해 봅시다. 출력은 20,000 토큰이 됩니다: 20,000 × $6 / 1,000,000 = $0.12, 그리고 세션 총액은 **약 $0.20**입니다. 이는 추론만으로 33% 증가한 것으로, 예산을 책정하기 전에 측정해야 하는 정확한 이유입니다.

예시 2: 80만 토큰 장문 문서 분석

800,000개의 문서 토큰을 컨텍스트에 로드하고 5,000개 토큰의 구조화된 요약을 요청합니다:

여기서 고정 계층이 제 역할을 합니다. 80만 토큰 각각은 처음 천 개와 동일한 100만 토큰당 $2 요금이 부과됩니다. 계층형 모델에서는 이것이 바로 비싼 구간을 유발하는 요청 형태입니다.

예시 3: 캐시된 10만 토큰 시스템 프롬프트, 하루 50회 호출

귀하의 애플리케이션은 매일 50회 호출마다 100,000개의 시스템 프롬프트, 제품 문서 및 도구 정의 토큰을 미리 로드합니다.

캐싱 없음: 100,000 × $2 / 1,000,000 = 호출당 $0.20, 따라서 접두사만으로 **하루 $10.00**.

명시적 캐싱 사용: 생성 비용은 100,000 × $2.50 / 1,000,000 = 한 번에 $0.25, 그 다음 49번의 캐시 적중은 100,000 × $0.20 / 1,000,000 = 각각 $0.02, 즉 $0.98입니다. **일일 총액: 약 $1.23**, 88% 절약. 한 달 동안은 약 $300 대 $40 미만입니다.

측정된 사용량으로 비용 추정, 추측이 아닌

세 가지 예시 모두 가정된 토큰 수에 기반합니다. 실제 숫자는 다를 것이며, 추론 토큰이 개입되면 프롬프트 길이만으로는 예측할 수 없는 방식으로 달라질 것입니다. 해결책은 측정하는 것입니다.

실용적인 워크플로우: API 키를 가져와 엔드포인트를 설정하고(Qwen 3.8 API 가이드는 세 가지 지역 기본 URL과 OpenAI 호환 및 Anthropic 호환 프로토콜을 모두 다룹니다), 애플리케이션의 각 작업 유형에 대한 대표적인 요청을 보냅니다. 모든 응답은 정확한 입력, 출력 및 추론 토큰 수를 포함하는 `usage` 객체를 반환합니다.

Apidog에서 세 가지 지역 기본 URL을 환경으로 저장하고, 각 `reasoning_effort` 수준에서 동일한 요청을 실행한 다음, 응답 검사기에서 직접 토큰 사용량을 읽으십시오. 작업 유형별로 대표적인 요청 10개를 실행하고, 평균 사용량을 계산하여 $2/$6를 곱하면 측정된 데이터에 기반한 비용 모델을 얻을 수 있습니다. 또한 동일한 작업 공간에서 `qwen3.7-max` 또는 Kimi K3에 대해 동일한 프롬프트를 A/B 테스트하여 더 저렴한 모델이 워크로드에 적합한지 확인할 수 있습니다. Apidog를 무료로 다운로드하면 한 시간 이내에 실제 작업별 비용 수치를 얻을 수 있습니다.

결론

$2/$6의 Qwen 3.8-Max는 최첨단 플래그십 모델에 대한 공격적인 가격 책정입니다: 이전 모델의 정가보다 낮고, GPT-5.6 Terra 출력 요금의 절반이며, Opus 5의 일부에 불과하고, 시장 대부분이 계층을 나누는 전체 100만 토큰 컨텍스트에 걸쳐 고정 요금입니다. 여기에 10% 캐시 적중률을 추가하면 긴 컨텍스트, 고반복 워크로드에 대한 경제성이 진정으로 강력해 보입니다.

두 가지 주의 사항: 기본 `xhigh` 추론은 순진한 예상치보다 출력 요금을 부풀리며, 그 주변의 기준(3.7-Max 50% 할인, 싱가포르 무료 할당량)은 시간 제한적입니다. 실제 토큰 사용량을 측정하고, `reasoning_effort`를 신중하게 설정하면 요금표가 주는 놀라움은 거의 없을 것입니다.

button

자주 묻는 질문

Qwen 3.8은 긴 프롬프트에 더 많은 비용이 드나요?

아니요. 공식 가격은 0부터 100만 토큰까지를 포함하는 단일 계층을 나열하므로, 90만 토큰 프롬프트는 짧은 프롬프트와 동일한 100만 입력 토큰당 $2 요금으로 청구됩니다. 이는 Model Studio 모델 목록에 있는 알리바바 자체 카탈로그의 일부를 포함하여 컨텍스트 길이에 따라 요금이 증가하는 계층형 모델과는 다릅니다.

Qwen 3.8에서 사고 토큰에 추가 비용이 드나요?

별도의 사고 토큰 요금은 없습니다: 사고 모드와 비사고 모드는 동일하게 $2/$6로 청구됩니다. 하지만 사고 토큰은 100만 토큰당 $6의 출력 토큰으로 계산되며, `reasoning_effort`는 기본적으로 `xhigh`입니다. 따라서 추론이 많은 요청은 보이는 답변이 제시하는 것보다 비용이 더 많이 듭니다. 간단한 작업의 경우 노력 수준을 낮추고, 각 응답의 `usage` 객체를 확인하여 실제로 지불하는 비용이 무엇인지 확인하십시오.

Qwen 3.8을 무료로 사용해 볼 수 있는 방법이 있나요?

네. Model Studio는 싱가포르 지역 엔드포인트에서만 유효하며 90일 동안 사용할 수 있는 100만 토큰의 무료 할당량을 포함합니다. Qwen Chat 또한 브라우저에서 무료 액세스를 제공합니다. 두 가지 경로와 세부 정보는 Qwen 3.8을 무료로 사용하는 방법에 설명되어 있습니다.

이전의 "10% 미리 보기 가격"이 아직 유효한가요?

아니요. 그것은 2026년 7월 언론 보도에서 언급된 미리 보기 기간 프로모션이었습니다. 정식 출시되면서 표준 $2/$6 요금표로 대체되었습니다. Model Studio 가격 페이지를 진실의 근원으로 간주하십시오.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요