2주 동안 Qwen 3.8 이야기는 공백이 있었습니다. 7월 언론 시사회에서는 최첨단 모델을 약속했지만 점수를 공개하지 않아 모든 초기 기사는 분위기에 의존했습니다. 이는 2026년 8월 3일에 바뀌었습니다. 알리바바의 Qwen 3.8-Max 공식 출시 게시물에는 Claude Opus 4.8, Fable 5, GPT-5.6 Sol, 그리고 이전 버전인 Qwen3.7-Max와의 전체 벤치마크 표가 포함되어 있으며, Gemini 3.1 Pro 및 GPT-5.6 Sol에 대한 별도의 멀티모달 표도 있습니다.
이 표는 자세히 살펴볼 가치가 있습니다. 여기에는 진정한 승리, 솔직한 패배, 그리고 대부분의 보도에서 완전히 건너뛸 미세한 내용이 담겨 있습니다. 이 게시물은 이 세 가지를 모두 설명한 다음, 공급업체 표를 더 이상 신뢰하지 않는 실용적인 방법을 제공합니다: API를 사용하여 직접 평가를 실행하는 것입니다. 전체 모델 개요(매개변수, 가격, 접근 방식)를 먼저 원하시면, 저희 Qwen 3.8-Max 설명을 먼저 읽고 다시 오세요.
숫자 전에 한 가지 맥락을 짚고 넘어가겠습니다. 아래의 모든 점수는 알리바바가 자체 발표한 표에서 가져왔으며, 리더보드 데이터는 2026년 8월 3일자로 되어 있습니다. 작성 시점에는 독립적인 평가가 존재하지 않았습니다. 이어지는 모든 행에 대해 이 점을 명심하십시오.
표, 한눈에 보기
다음은 알리바바가 발표한 주요 텍스트-모델 행입니다. 이 모든 항목에서 숫자가 높을수록 좋습니다.
| 벤치마크 | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| 터미널 벤치 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (인류의 마지막 시험) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
출처: 알리바바의 공급업체 운영 표. "공급업체 운영"이 실제로 무엇을 의미하는지는 아래에서 자세히 설명하겠습니다. 여기서는 평소보다 더 중요하기 때문입니다.

Qwen 3.8-Max가 승리한 지점
PaperBench: 최고의 플래그십 행
모델이 연구 논문 결과를 재현할 수 있는지 테스트하는 PaperBench에서 Qwen 3.8-Max는 93.0점으로 GPT-5.6 Sol의 90.5, Fable 5의 88.8, Opus 4.8의 80.3을 제치고 최전선에서 가장 강력한 성능을 보여주었습니다. 또한 Qwen3.7-Max의 64.8에서 엄청난 도약을 했습니다. 어떤 벤치마크에서든 28점의 세대 간 도약은 면밀한 조사를 받을 가치가 있지만, 독립적인 테스트에서 유지된다면 모델의 장기적인 연구 능력에 대해 중요한 점을 시사합니다.
IFBench: 압도적인 지시 따르기 능력
IFBench에서 Qwen 3.8-Max는 82.8점을 기록했습니다. 표에서 Qwen이 아닌 가장 가까운 경쟁자는 GPT-5.6 Sol이 72.7점, Fable 5가 63.5점, Opus 4.8이 62.2점입니다. 이는 이 정도로 포화된 벤치마크에서 이례적인 10~20점 차이입니다. 흥미롭게도 Qwen3.7-Max는 이미 79.1점으로 이 행에서 선두를 달리고 있었으므로, 지시 따르기는 일시적인 것이 아니라 Qwen의 꾸준한 강점인 것으로 보입니다.
터미널 벤치 2.1: 클로드를 근소하게 앞서다
알리바바의 터미널 벤치 2.1 실행에서 Qwen 3.8-Max는 Opus 4.8과 Fable 5가 모두 84.6점인 반면 86.6점을 기록했습니다. GPT-5.6 Sol은 88.8점으로 여전히 선두를 달리고 있어, 이는 2위이지 압도적인 승리는 아닙니다. 하지만 에이전트 터미널 벤치마크에서 Anthropic의 두 플래그십을 모두 이긴 것은 알리바바가 이번 출시에서 원했던 결과이며, 클로드에 대한 2점 차이는 어디에서나 인용될 숫자입니다.
멀티모달 압승
별도의 멀티모달 표에서 Qwen 3.8-Max는 전반적으로 가장 강력한 모습을 보입니다. 알리바바는 MathVision에서 95.2점, LogicVista에서 91.9점, OSWorld-Verified에서 86.1점을 기록했으며, 이 모델은 표의 거의 모든 OCR 행에서 선두를 달리고 있습니다. Opus 4.8과 Fable 5는 여기에서 직접 경쟁하지 않으며(이 비교에서는 텍스트에 중점을 둡니다), 이것이 멀티모달 표가 압도적인 승리처럼 보이는 부분적인 이유입니다. Gemini 3.1 Pro 및 GPT-5.6 Sol에 비해 시각적 추론 및 문서 인텔리전스 행은 이 모델의 가장 명확한 차별화 요소입니다.
만약 이번 여름의 다른 큰 오픈소스 모델 출시와 비교하고 있다면, 멀티모달 격차는 가장 뚜렷한 대비를 이룹니다: Kimi K3는 텍스트 전용입니다. 저희 Qwen 3.8 vs Kimi K3 비교에서 이 대결을 자세히 다룹니다.
패배한 지점, 솔직하게
알리바바는 패배 항목도 표에 남겨두었으며, 이는 칭찬할 만합니다. 세 가지가 눈에 띕니다.
HLE: 43.6점, Fable 5에 한참 뒤쳐짐. 광범위한 지식 프론티어 벤치마크인 Humanity’s Last Exam에서 Qwen 3.8-Max는 43.6점을 기록했습니다. Fable 5는 53.3점, GPT-5.6 Sol은 47.2점, Opus 4.8은 45.7점입니다. 이는 4대 플래그십 중 최하위이며, 선두보다 거의 10점 뒤쳐집니다. Qwen3.7-Max의 41.4점보다는 높지만, 간신히 앞설 뿐입니다. HLE는 대부분의 평가보다 벤치마크 특정 튜닝에 강하게 저항하므로, 이 행은 중요하게 고려할 가치가 있습니다.
SWE-bench Pro: 67.7점 대 Fable 5의 80.0점. 더 어려운 소프트웨어 공학 벤치마크에서 Qwen 3.8-Max는 중간 정도의 점수를 기록했습니다: GPT-5.6 Sol(64.6점)보다는 앞서지만, Opus 4.8(69.2점)보다는 약간 뒤쳐지고, Fable 5에는 무려 12점이나 뒤쳐집니다. Qwen3.7-Max(60.6점)에 대한 세대 간 개선은 분명하지만, "터미널 벤치에서 클로드를 이겼다"와 "SWE-bench Pro에서 Fable 5에 크게 뒤쳐진다"는 두 가지 모두 사실이며, 두 번째 주장은 헤드라인에 훨씬 덜 나타날 것입니다.
DeepSWE 및 더 어려운 에이전트 행. DeepSWE는 Qwen 3.8-Max가 알리바바 자체 표에서 프론티어에 뒤쳐지는 또 다른 행입니다. 코딩 섹션 전반에 걸친 패턴은 일관적입니다: 터미널 기반 에이전트 작업에서는 경쟁력이 있지만, 가장 심층적인 소프트웨어 공학 평가에서는 뒤쳐집니다.
솔직한 요약: Qwen 3.8-Max는 여러 에이전트 행에서 Opus 4.8을 이기고, 대부분의 핵심 코딩 작업에서 Fable 5에 뒤쳐지며, 멀티모달 및 문서 인텔리전스에서 큰 승리를 거둡니다. 이는 백만 토큰당 입력 2달러, 출력 6달러로 책정된 모델(공식 가격 페이지 참조)에게는 정말 강력한 결과이지만, 출시 보도를 대충 훑어보면 알 수 있듯이 전반적으로 최첨단 승리는 아닙니다.
대부분의 보도에서 건너뛸 미세한 내용
이 섹션은 헤드라인 대신 벤치마크 게시물을 읽는 것을 정당화합니다. 알리바바 자체 출판물의 네 가지 세부 사항은 표를 읽는 방식을 바꿉니다.
1. 모든 숫자는 공급업체에서 실행됩니다. 알리바바는 자체 모델과 경쟁사 모델을 평가했습니다. 이는 출시 표의 표준 관행이며, 나중에 출시 표가 수정되는 표준 이유이기도 합니다. 공급업체는 벤치마크 버전, 프롬프트 전략, 샘플링 설정, 재시도 정책을 선택합니다. 이 모든 것이 사기는 아닙니다. 이 모든 것이 저울에 영향을 미칩니다.
2. 대부분의 코딩 행은 Claude Code 하네스를 사용했습니다. 이것은 정말 흥미로운 세부 사항입니다. 알리바바는 대부분의 코딩 벤치마크를 Anthropic의 자체 에이전트 하네스인 Claude Code를 사용하여 Qwen 3.8-Max의 Anthropic 호환 API를 통해 실행했습니다. 한편으로는 이는 공정한 플레이입니다: 동일한 널리 사용되는 도구 내에서 모든 모델을 평가합니다. 다른 한편으로는 "Qwen의 코딩 점수"가 실제로 "Anthropic의 하네스 내 Qwen" 점수이며, 하네스 선택은 에이전트 결과에 몇 점 차이를 줄 수 있음을 의미합니다. 또한 알리바바가 이 모델이 실제로 어디에서 실행될 것으로 예상하는지에 대해서도 알려줍니다.
3. 여러 벤치마크는 Qwen 자체 개발입니다. QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench는 모두 Qwen 팀이 만들었습니다. 자체 개발 벤치마크가 무가치한 것은 아닙니다. 종종 공개 평가에서 놓치는 기능을 탐색합니다. 그러나 모델이 자체 개발 벤치마크에서 높은 점수를 받는 것은 SWE-bench Pro에서 높은 점수를 받는 것과는 다른 종류의 증거이며, 표는 시각적인 구분 없이 둘을 나란히 제시합니다. 이 표에서 숫자를 인용할 때, 먼저 어떤 범주에 속하는지 확인하십시오.
4. Fable 5에 대한 각주. 알리바바 자체 표에는 "Fable5 결과는 폴백을 포함할 수 있습니다"라는 각주가 있습니다. 이는 적어도 한 경쟁사의 숫자가 모델이 깨끗하게 실행되는 것을 반영하지 않을 수 있다는 조용한 인정입니다. 기술적인 원인이 무엇이든, 이는 Qwen 3.8-Max가 가장 자주 뒤쳐지는 모델인 Fable 5 열에 게시한 사람들이 달아 놓은 별표가 붙어 있다는 것을 의미합니다.
이 중 어느 것도 알리바바에만 해당되는 것은 아닙니다. Anthropic, OpenAI, Google 모두 자체적인 방법론적 선택을 포함하는 자체 실행 표를 게시합니다. 저희는 Kimi K3 벤치마크 분석에서도 동일한 패턴을 지적했으며, 거기에도 적용되었습니다. 요점은 알리바바가 속였다는 것이 아닙니다. 요점은 공급업체 표는 측정치가 아니라 주장이라는 것입니다.
무엇을 지켜봐야 하며, 다음 표를 읽는 방법
2026년 8월 3일 현재, Qwen 3.8-Max에 대한 독립적인 평가는 존재하지 않습니다. 작성 시점에는 Artificial Analysis가 숫자를 발표하지 않았으며, 어떤 커뮤니티 리더보드도 이 모델의 점수를 매기지 않았습니다. 이는 며칠 내로 바뀔 것이며, 알리바바 표와 독립적인 실행 간의 차이가 진짜 이야기가 될 것입니다. 독립적인 결과가 나오면 이 게시물을 업데이트할 예정입니다.
그때까지, 모든 공급업체 벤치마크 표(이 표 포함)를 판단하기 위한 간단한 체크리스트는 다음과 같습니다:
- 누가 평가를 실행했는가? 경쟁사에 대한 자체 보고 숫자는 공급업체 자체 모델에 대한 자체 보고 숫자보다 더 많은 회의론을 가질 가치가 있습니다.
- 어떤 하네스와 설정인가? 에이전트 벤치마크는 하네스에 민감합니다. 하네스 이름을 명시한 표(알리바바처럼)는 그렇지 않은 표보다 유용하지만, 선택은 여전히 결과에 영향을 미칩니다.
- 공급업체가 어떤 벤치마크를 만들었는가? 자체 개발 평가는 어떤 것을 측정하지만, 공개 평가와는 다른 것을 측정합니다.
- 각주를 읽어라. "폴백을 포함할 수 있습니다"는 작은 글씨로 많은 작업을 합니다.
- 빠진 것을 확인하라. 공급업체가 게시하지 않은 행은 게시한 행만큼이나 정보를 제공할 때가 많습니다. 과거 공급업체 표는 모델 성능이 좋지 않은 벤치마크를 조용히 삭제했습니다. 지난 세대가 공급업체별로 어떻게 쌓였는지와 비교하여 어떤 행이 사라졌는지 확인하십시오.
- 두 번째 출처를 기다려라. 일주일의 인내심은 보통 독립적인 숫자를 얻을 수 있게 해줍니다.
대신 직접 평가를 실행하십시오
체크리스트는 표를 읽는 데 도움이 됩니다. 더 좋은 방법은 표에 덜 의존하는 것입니다. Qwen 3.8-Max는 현재 알리바바 클라우드 모델 스튜디오(공식 모델 페이지에 등록된 모델 ID qwen3.8-max)에서 OpenAI 호환 및 Anthropic 호환 API와 함께 사용할 수 있으며, 실제 프롬프트를 사용하는 벤치마크는 공개 평가보다 항상 우수합니다.
Apidog에서 실용적인 설정은 다음과 같습니다. qwen3.8-max를 사용하여 모델 스튜디오 채팅-완성 엔드포인트에 대한 요청 하나를 만들고, 현재 기준 모델(Qwen3.7-Max, Kimi K3, Claude 또는 GPT 엔드포인트 등)에 대해 동일한 요청을 하나 더 만듭니다. 실제 프로덕션 프롬프트 20~30개를 테스트 시나리오로 저장하고, 실제로 신경 쓰는 응답 속성(유효한 JSON, 필수 필드 존재, 임계값 이하의 지연 시간)에 대한 어설션을 추가한 다음, 두 시나리오를 연속으로 실행합니다. Apidog의 테스트 보고서는 알리바바의 작업 부하 대신 사용자의 작업 부하에 대한 모델별 통과율과 응답 시간을 나란히 제공합니다.
진행 중에 확인해야 할 Qwen 관련 두 가지 사항: 모델 기본값은 reasoning_effort: xhigh이므로, 실제로 배포할 노력 수준에서 비용과 지연 시간을 측정하십시오. Anthropic 호환 엔드포인트를 사용할 계획이라면 해당 프로토콜 형태를 별도로 테스트하십시오. 알리바바 자체 코딩 벤치마크의 대부분이 이 프로토콜을 통해 실행되었기 때문입니다. Apidog를 무료로 다운로드하고, 두 엔드포인트를 환경으로 설정하면 독립적인 리더보드가 게시되기 전에 자체적인 1차 데이터를 얻을 수 있습니다.
자주 묻는 질문
Qwen 3.8 벤치마크 숫자는 독립적으로 검증되었습니까?
아니요. 2026년 8월 3일 현재, 모든 발표된 숫자는 알리바바 자체 표에서 가져온 것입니다. 작성 시점에는 Artificial Analysis와 커뮤니티 리더보드가 아직 Qwen 3.8-Max의 점수를 매기지 않았습니다. 독립적인 결과가 나올 때까지 이 표를 공급업체의 주장으로 간주하십시오.
Qwen 3.8-Max의 최고의 벤치마크 결과는 무엇입니까?
PaperBench는 93.0점으로 최고의 플래그십 표 행입니다: GPT-5.6 Sol(90.5), Fable 5(88.8), Opus 4.8(80.3)보다 앞섭니다. 멀티모달 표에서는 MathVision(95.2)과 OCR 행이 전반적으로 가장 강력한 결과입니다.
Qwen 3.8-Max는 어디에서 명백히 패배합니까?
HLE에서 43.6점을 기록하여 4대 플래그십 중 최하위이며 Fable 5의 53.3점에 한참 뒤쳐집니다. SWE-bench Pro에서는 67.7점을 기록하여 Fable 5의 80.0점에 비해 뒤쳐지며, DeepSWE에서도 뒤쳐집니다. 알리바바 자체 표에서 심층 소프트웨어 공학 평가와 광범위한 지식 시험은 가장 약한 영역입니다.
Qwen 3.8은 벤치마크에서 Qwen 3.7-Max보다 얼마나 더 좋습니까?
알리바바 표에서 세대 간 향상은 큽니다: 터미널 벤치 2.1은 74.5에서 86.6으로, SWE-bench Pro는 60.6에서 67.7로, PaperBench는 64.8에서 93.0으로 증가했습니다. 업그레이드가 사용자의 작업 부하에 가치가 있는지는 가격과 양식에도 달려 있습니다. 저희 Qwen 3.8 vs Qwen 3.7 비교에서 전체 결정 사항을 설명합니다.
