대부분의 모델 출시는 코딩 능력을 동일한 방식으로 설명합니다. 예를 들어, HumanEval 점수는 이렇고, 이 모델이 이진 탐색을 작성하는 스니펫입니다. 알리바바는 Qwen 3.8-Max로 다른 길을 택했습니다. 주장은 "좋은 함수를 작성한다"가 아닙니다. 주장은 몇 주 동안 소프트웨어 프로젝트를 스스로 운영할 수 있다는 것입니다. 문제를 열고, 풀 리퀘스트를 병합하고, 사람의 개입 없이 기능을 배포하는 것입니다.
이는 대담한 주장이며, 면밀한 조사가 필요합니다. 이 기사는 알리바바가 출시 시점에 발표한 세 가지 코딩 쇼케이스(모두 벤더 데모이며, 하나는 감사할 수 있는 공개 저장소를 포함), 그 뒤에 있는 코딩 벤치마크 수치, 그리고 오늘날 실천할 수 있는 부분: Claude Code, Codex, Qoder, Qwen Code, OpenClaw에서 qwen3.8-max로 실제로 코딩하는 방법, 그리고 생성된 코드가 생성하는 API 출력을 테스트하는 방법을 안내합니다.
모델 자체에 대해 처음이라면 Qwen 3.8이 무엇인지에 대한 개요부터 시작하세요. 총 2.4T 매개변수, 활성 95B, 1M 토큰 컨텍스트 창, 그리고 출시 후 일주일 내에 오픈 웨이트가 약속되었습니다. 여기서는 코딩 스토리에 집중하겠습니다. 아래의 모든 내용은 2026년 8월 3일 기준의 상황을 반영합니다.
알리바바의 실제 주장
공식 Qwen 3.8 출시 게시물의 프레임은 스니펫을 넘어선 자율성입니다. 알리바바는 Qwen 3.8-Max를 장기적인 엔지니어링 작업을 머릿속에 담고, 작업을 계획하고, 며칠에 걸쳐 실행하고, 자체 실수를 복구하며, 마지막에 검토 가능한 것을 제공할 수 있는 모델로 포지셔닝합니다.

다음 세 가지는 이 주장을 일반적인 출시일 마케팅보다 더 흥미롭게 만듭니다.
- 데모가 길다. 16일은 20분짜리 에이전트 벤치마크와는 다른 영역입니다. 이 규모에서는 오류 복구, 컨텍스트 관리, 드리프트가 훨씬 더 중요합니다.
- 하나의 데모가 공개되어 있다. 저장소를 탐색하고, 커밋을 읽고, 코드 품질을 스스로 판단할 수 있습니다. 대부분의 벤더 쇼케이스는 이를 제공하지 않습니다.
- 하네스가 경쟁사의 것이다. 알리바바는 대부분의 코딩 벤치마크를 Claude Code 하네스를 사용하여 실행했으며, 동일하게 할 수 있도록 공식 설정을 게시했습니다. 이에 대해서는 아래에서 자세히 설명합니다.
표준 주의사항이며 이 기사 전체에 적용됩니다. 여기에 있는 모든 수치는 알리바바 자체의 출시 자료에서 가져온 것입니다. 2026년 8월 초 현재 독립적인 검증은 아직 없습니다. 쇼케이스를 감사가 아닌 데모로 취급하세요.
세 가지 코딩 쇼케이스
oh-my-cli: 16일간의 자율 개발
헤드라인 데모입니다. 알리바바는 Qwen 3.8-Max를 명령줄 도구 구축에 투입하고 무인으로 실행하도록 했습니다. 7월 30일 기준으로, 이 실행은 16일 동안 진행되었으며, 265개의 커밋, 127개의 풀 리퀘스트, 151개의 이슈를 생성했는데, 이 모든 것이 모델 자체에 의해 열리고, 작업되고, 닫혔습니다.
저장소는 qwen-code-dev-bot/oh-my-cli에 공개되어 있으며, 이는 전체 쇼케이스에서 가장 유용한 부분입니다. 커밋 수를 믿을 필요가 없습니다. PR 설명을 읽고, 이슈가 실제 버그인지 아니면 불필요한 작업인지 확인하고, 코드가 잘 작동하는지 볼 수 있습니다. 사람의 검토 없이 모델이 16일 동안 생성한 결과물은 그 품질에 대해 어떤 결론을 내리든 진정으로 희귀한 아티팩트입니다.
감사할 때 찾아야 할 것: PR이 참조하는 문제를 실제로 해결하는지, 모델이 마감하기 위해 인위적인 작업을 생성하는지, 그리고 자체 회귀를 어떻게 처리하는지. 이러한 패턴은 단일 벤치마크 점수보다 장기적인 신뢰성에 대해 더 많은 것을 알려줍니다.
논문 재현 실행: 앱 코드가 아닌 연구 코드
두 번째 데모는 더 어려운 종류의 코딩인 머신러닝 연구 논문을 처음부터 재현하는 것을 목표로 합니다. 알리바바의 수치에 따르면, 이 실행은 약 125시간이 걸렸고, 약 7,600줄의 코드를 생성했으며, 그 과정에서 33번의 GPU 훈련 라운드를 실행했습니다.

결과: 모델은 논문의 6가지 발견을 재현했고, 한 단계 더 나아가 AIME24에서 논문의 보고된 결과보다 2.7점 더 높은 점수를 기록했습니다. 연구 재현은 악명 높게도 어려운 작업입니다. 환경이 깨지고, 하이퍼파라미터가 각주에 숨어 있으며, 단 하나의 사소한 버그라도 몇 시간 후에 알게 되는 훈련 실행을 무효화할 수 있습니다. 33번의 훈련 라운드를 거쳐 일치하는 수치를 내놓을 수 있는 모델은 자동 완성 그 이상을 하고 있는 것입니다.
이 데모는 Qwen 3.8-Max의 가장 강력한 벤치마크 항목인 PaperBench와 연결됩니다(아래 설명).
톈츠 대회: 인간 팀과의 24시간 대결
세 번째 쇼케이스는 모델을 알리바바의 톈츠 플랫폼에서 24시간 제한으로 라이브 데이터 과학 경쟁에 참여시켰습니다. 모델은 그 시간 내에 45번의 제출을 했고, 매번 접근 방식을 반복하며 최종 정확도 0.853으로 마쳤습니다. 이는 경쟁에 참여한 526개 인간 팀 중 458개 팀보다 높은 순위였습니다.

이 결과의 형태에 주목할 만한 점: 모델은 우승하지 못했습니다. 하지만 참가자의 87%를 능가했는데, 이는 인상적이면서도 정직한 결과입니다. 또한 다른 두 데모에서는 볼 수 없는 능력인 마감 기한 내에서의 빠른 반복, 즉 각 제출 점수가 다음 시도에 영향을 미치는 능력을 보여줍니다.
여기에 특히 강하게 적용되는 또 다른 주의사항: 톈츠는 알리바바 자체 플랫폼입니다. 데모는 실제지만, 벤더가 장소를 통제했습니다.
데모 뒤의 코딩 벤치마크
알리바바는 출시 시점에 전체 벤치마크 표를 공개했습니다. 여기에 코딩 관련 항목들을 정직하게 남겨두었습니다. 모든 수치는 알리바바 자체 실행 결과입니다.
| 벤치마크 | Qwen 3.8-Max | 최고의 경쟁자 (알리바바 표 기준) |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0 (Fable 5) |
| PaperBench | 93.0 | 90.5 (GPT-5.6 Sol) |
세 가지 시사점:
- Terminal Bench 2.1 (86.6)은 터미널 기반 에이전트 작업에서 Qwen 3.8-Max가 Claude Opus 4.8 및 Fable 5(알리바바 표에서 모두 84.6)보다 앞서 있음을 보여줍니다. 이 수치는 oh-my-cli 데모를 뒷받침합니다.
- SWE-bench Pro (67.7)는 손실이며, 크게 차이가 납니다. Fable 5는 동일한 표에서 80.0점을 기록합니다. "내 코드베이스의 이 문제를 해결하라"에 가장 직접적으로 매핑되는 벤치마크인 저장소 규모 버그 수정에서 Qwen 3.8-Max는 선두 주자보다 12점 이상 뒤처집니다. 알리바바는 이 수치를 공개했지만, 이는 그들의 신뢰성을 높여줍니다.
- PaperBench (93.0)는 모델의 단일 최고 주력 항목으로, 비교 세트의 모든 것을 능가합니다. 이는 논문 재현 데모를 직접적으로 뒷받침합니다.
이제 대부분의 보도에서 건너뛸 미세한 부분입니다. 알리바바는 경쟁 모델 실행을 포함하여 이러한 코딩 벤치마크의 대부분을 Claude Code 하네스에서 실행했으며, 표의 각주는 Fable 5 결과에 폴백이 포함될 수 있다고 명시합니다. 하네스 선택은 에이전트 벤치마크 점수에 상당한 영향을 미치므로, 특정 하네스에서 벤더가 실행한 표는 하나의 데이터 포인트일 뿐이며, 최종 판결이 아닙니다.
하지만 Claude Code 세부 사항은 양날의 검입니다. 이는 알리바바가 이미 사용하고 있을 수도 있는 하네스에 최적화했다는 것을 의미하며, 그들은 이를 증명하기 위해 설정을 게시했습니다.
오늘날 Qwen 3.8로 실제로 코딩하는 방법
여기 실용적인 부분이 있습니다. Qwen 3.8-Max는 알리바바 클라우드 모델 스튜디오에서 GA(General Availability) 상태이며, 알리바바는 출시 시점에 5가지 코딩 도구에 대한 공식 설정을 게시했습니다. 이 모든 것을 위해서는 DashScope API 키(home.qwencloud.com에서)가 필요합니다. 가격은 공식 모델 스튜디오 가격 페이지에 따라 1M 컨텍스트 전체에 걸쳐 입력 토큰 백만 개당 2달러, 출력 토큰 백만 개당 6달러로 고정됩니다.
Claude Code
이 모델은 Anthropic 호환 API 엔드포인트를 제공하므로, Claude Code에서 이를 가리키려면 세 가지 환경 변수가 필요합니다.
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
평소처럼 Claude Code를 시작하면 모든 요청이 Claude 대신 Qwen 3.8-Max로 라우팅됩니다. 알리바바가 이 정확한 하네스에서 코딩 벤치마크를 실행했다는 점을 감안할 때, 이것은 측정된 것과 경험할 것 사이의 차이가 가장 적은 설정입니다.
Codex
Codex는 설정에 공급자 항목이 필요합니다. 공식 문서의 개요:
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
이것은 Anthropic 엔드포인트가 아닌 OpenAI 호환 엔드포인트를 사용합니다. 동일한 모델, 동일한 키, 다른 프로토콜 형태입니다.
Qoder, Qwen Code, OpenClaw
나머지 세 가지는 더 빠르게 요약할 수 있습니다.
- Qoder CLI: 알리바바 자체의 에이전트 코딩 도구. 모델로
qwen3.8-max를 선택하세요. 이는 자체 통합이므로 설정은 구성 값입니다. - Qwen Code: Qwen 팀의 오픈 소스 CLI.
DASHSCOPE_API_KEY를 설정하고 모델을 선택하세요. 이전 Qwen 코딩 모델과 함께 사용했다면 다른 변경 사항은 없습니다. - OpenClaw: 공식 설정은 모델 ID와 65,536의
maxTokens를 설정하는데, 이는 모델의 최대 출력 길이의 출처이기도 합니다.
모든 다섯 가지 설정은 출시 게시물에 있으므로, 블로그 스냅샷에 고정하기보다 정확한 최신 버전을 거기서 가져오세요.
추론 노력 수준을 신중하게 설정하십시오
Qwen 3.8-Max는 세 가지 수준의 reasoning_effort 매개변수(xhigh(기본값), medium, low)를 지원합니다. 코딩의 경우 이 설정은 대부분의 다른 조절 장치보다 더 중요합니다.
- 에이전트 작업에는
xhigh를 유지: 다중 파일 리팩토링, 디버깅 세션, 모델이 편집하기 전에 계획하는 모든 작업. 쇼케이스 실행은 이 모드를 나타냅니다. - 빠른 편집에는
low로 낮춤: 이름 변경, 독스트링 통과, 깊은 추론이 시간과 토큰을 낭비하는 기계적인 변경.
생각하는 토큰은 출력 토큰으로 백만 개당 6달러로 청구되며, xhigh가 기본값임을 기억하세요. 전체 노력으로 진행되는 긴 에이전트 세션은 실제 비용이 발생합니다. xhigh로 기계적인 편집을 하는 것은 이점 없이 비용을 발생시킵니다.
Qwen 3.8-Max가 작업에 필요한 것보다 더 강력한 모델이라면, 전용 코딩 작업을 위한 이전 Qwen3 Coder 라인이 여전히 존재하며, Qwen3 Coder Flash는 빠르고 저렴한 부분을 담당합니다. 이 분야의 다른 오픈 웨이트 강자들에 대해서는 Kimi K3가 코딩 작업을 어떻게 처리하는지를 참조하세요.
모델이 구축한 것을 테스트하기: Apidog 단계
알리바바의 데모를 포함하여 모든 자율 코딩 데모에는 다음과 같은 간극이 있습니다. 모델은 API를 호출하는 코드를 작성하지만, 아무도 해당 호출을 검증하는 것에 대해 이야기하지 않습니다. 에이전트는 깔끔하게 컴파일되는 7,600줄의 코드를 생성할 수 있지만, 여전히 잘못된 엔드포인트를 호출하거나, 429 오류를 잘못 처리하거나, 프로덕션에서 유효성 검사에 실패하는 요청 본문을 전송할 수 있습니다.
두 가지 습관이 이 간극을 좁힙니다.
생성된 코드가 호출하는 엔드포인트를 테스트하세요. Qwen 3.8-Max가 서비스를 스캐폴딩하거나 API 클라이언트를 작성할 때, 관련 사양을 Apidog으로 가져와서 엔드포인트를 직접 연습하세요. 인증 흐름, 오류 응답, 엣지 케이스 페이로드 등을요. 자율 세션에 돌입한 지 이틀 만에 스택 추적에서 잘못된 가정을 찾는 것보다 테스트 실행에서 찾는 것이 훨씬 저렴합니다. 모델의 API를 사용하기 전에 평가하고 있다면, Qwen 3.8 API 가이드는 듀얼 OpenAI 및 Anthropic 프로토콜 설정을 자세히 다루고 있으며, Apidog은 스트리밍 응답과 추론 델타를 포함하여 두 프로토콜 형태를 나란히 검사하기에 편리한 곳입니다.
에이전트 실행이 프로덕션에 영향을 미치지 않도록 API를 모의(Mock)하세요. 이 부분은 실행 시간이 길어질수록 더 중요합니다. 프로덕션 인프라에 라이브 호출을 하는 16일간의 자율 세션은 진정으로 나쁜 아이디어입니다. 속도 제한, 데이터 변형, 예상치 못한 요금 등이 발생할 수 있습니다. Apidog의 모의 서버는 실제 시스템에 영향을 주지 않고 에이전트에 현실적인 응답을 제공합니다. 실행 중에 생성된 코드를 모의 URL로 지정하고, 사람이 출력을 검토한 후 실제 기본 URL로 교체하세요. 몇 분 안에 모의를 설정하려면 Apidog을 무료로 다운로드하세요. 이는 무인 에이전트 실행이 가질 수 있는 가장 저렴한 보험입니다.
패턴은 일반화됩니다. 코딩 모델에 더 많은 자율성을 부여할수록 API 계층이 제어 표면이 됩니다. 모든 커밋을 실시간으로 검토할 수는 없지만, 코드가 통신할 수 있는 대상을 제어할 수 있습니다.
자주 묻는 질문
Qwen 3.8은 코딩에 적합한가요?
알리바바 자체 수치에 따르면, 에이전트 및 연구 스타일 코딩(Terminal Bench 2.1에서 86.6, PaperBench에서 93.0)에 강하며, 저장소 규모 버그 수정(SWE-bench Pro에서 67.7 대 Fable 5의 80.0)에서는 중간 수준입니다. 모든 수치는 벤더가 실행한 것이며 아직 독립적인 검증은 없습니다. 정직한 해석: 장기적인 자율 작업에는 탁월하지만, 고전적인 문제 해결에는 선두 주자가 아닙니다.
Claude Code에서 Qwen 3.8을 사용할 수 있나요?
네, 공식적으로 가능합니다. ANTHROPIC_BASE_URL을 https://dashscope-intl.aliyuncs.com/apps/anthropic으로, ANTHROPIC_AUTH_TOKEN을 DashScope 키로, ANTHROPIC_MODEL을 qwen3.8-max로 설정하세요. 알리바바는 이 설정을 직접 게시했으며, 대부분의 코딩 벤치마크를 Claude Code 하네스에서 실행했습니다.
Qwen 3.8로 코딩하는 데 비용은 얼마나 드나요?
1M 컨텍스트 전체에 걸쳐 입력 토큰 백만 개당 2달러, 출력 토큰 백만 개당 6달러로 고정됩니다. 생각하는 토큰은 출력으로 청구되며, 기본 xhigh 추론 노력은 많은 토큰을 생성하므로, 에이전트 세션의 경우 정가보다 예산을 더 많이 책정해야 합니다. 전체 비용 계산 및 비교는 Qwen 3.8 벤치마크 분석과 거기에 연결된 가격 책정 관련 내용에서 확인할 수 있습니다.
16일간의 oh-my-cli 실행은 정말 자율적이었나요?
그것은 알리바바의 주장이며, 대부분의 벤더 데모와 달리 아티팩트를 확인할 수 있습니다. 저장소는 qwen-code-dev-bot/oh-my-cli에 공개되어 있으며, 2026년 7월 30일 기준으로 265개의 커밋, 127개의 PR, 151개의 이슈가 있습니다. 코드 품질이 프레임을 정당화하는지는 직접 읽고 판단할 수 있으며, 이것이 이 쇼케이스를 스크린샷보다 더 신뢰할 수 있게 만드는 이유입니다.
