강력한 AI 에이전트를 매일 실행하면 클라우드 요금이 많이 발생합니다. Qwen3.5는 최첨단 멀티모달 추론 기능을 로컬에서 제공합니다. 이를 OpenClaw와 결합하여 영구적인 에이전트 워크플로를 구축하고, Ollama와 결합하여 간단한 로컬 서빙을 할 수 있습니다. 그 결과 구독 없이도 24시간 내내 사용자 기기에서 작동하는 완전한 AI 에이전트를 만들 수 있습니다.
작은 선택이 중요합니다. 올바른 모델 태그를 선택하고, 정확한 기본 URL을 설정해야 합니다. 이러한 결정은 속도와 안정성에 큰 차이를 만듭니다. 이 가이드는 사용자가 완전히 제어하는 프로덕션 준비 스택을 완성할 수 있도록 정확한 단계를 보여줍니다.
Qwen3.5가 로컬 에이전트 작업에 완벽한 이유
Alibaba는 2026년 초에 최초의 네이티브 비전-언어 모델 제품군인 Qwen3.5 를 출시했습니다. 397B-A17B 플래그십 모델은 하이브리드 아키텍처를 사용합니다. 게이티드 델타 네트워크(Gated Delta Networks)와 스파스 Mixture-of-Experts를 결합하여 토큰당 170억 개의 파라미터만 활성화됩니다. 훨씬 적은 메모리로 강력한 성능을 얻을 수 있습니다.

Ollama는 오늘 바로 가져올 수 있는 다음과 같은 실용적인 태그를 호스팅합니다:
- qwen3.5:35b — 24GB VRAM, 256K 컨텍스트, 전체 텍스트 및 이미지 지원
- qwen3.5:122b — 더 심층적인 추론을 위해 81GB 필요
qwen3.5를 로컬에서 실행하고 데이터를 비공개로 유지할 수 있습니다. 이 모델은 TAU2-Bench에서 86.7점, MMMU에서 85.0점을 기록했습니다. 따라서 텍스트, 스크린샷, 도구 호출이 혼합된 에이전트 작업에 신뢰할 수 있습니다.
OpenClaw가 Qwen3.5를 실제 에이전트로 만드는 방법
OpenClaw는 항상 켜져 있는 에이전트 런타임으로 작동합니다. WhatsApp, Telegram, Slack, Discord 또는 Signal에 한 번 연결하면 에이전트가 지속적으로 수신 대기합니다. 메시지를 보내면 OpenClaw가 이를 qwen3.5로 라우팅하고, 도구를 호출하며, Playwright로 브라우저를 제어하고, 파일을 편집하고, 캘린더를 업데이트하며, 사전 대응적으로 답변합니다.

세션 간에 메모리를 저장합니다. 에이전트는 사용자의 프로젝트와 선호도를 영원히 기억합니다. 커뮤니티 스킬을 설치하거나 qwen3.5가 필요에 따라 새로운 스킬을 작성하도록 할 수 있습니다. 따라서 OpenClaw는 잠들지 않는 개인 디지털 비서가 됩니다.
Ollama가 통합을 간단하게 만드는 이유
Ollama는 모델을 로컬에서 서비스하고 11434 포트에 OpenAI 호환 엔드포인트를 노출합니다. OpenClaw를 http://localhost:11434/v1로 지정하고 모델을 qwen3.5:35b로 설정합니다. Ollama는 양자화, GPU 오프로드 및 컨텍스트 관리를 자동으로 처리합니다.
일반 사용자 하드웨어에서도 빠른 토큰 생성을 달성할 수 있습니다. qwen3.5가 긴 에이전트 대화에 필요한 전체 256K 컨텍스트 창을 유지할 수 있습니다. 동시에 클라우드 비용과 데이터 유출을 피할 수 있습니다.
필수 구성 요소
시작하기 전에 머신을 준비해야 합니다. macOS 14 이상, Ubuntu 22.04/24.04 또는 WSL2가 설치된 Windows 11을 사용하세요. 35B 모델의 경우 최소 24GB VRAM 또는 Apple Silicon의 경우 32GB 통합 메모리가 필요합니다. 30GB의 여유 디스크 공간을 확보하세요. Node.js 22 이상과 Ollama 0.17 이상을 설치하세요.
나중에 하나의 명령으로 GPU를 확인할 수 있습니다. 이러한 요구 사항을 충족하는 하드웨어는 빠른 성능을 제공합니다. 메모리가 부족한 경우 더 작은 양자화 모델로 전환할 수 있습니다.
Ollama 설치 및 Qwen3.5 풀링
Ollama를 설치하는 것으로 시작합니다. macOS에서는 다음을 실행합니다:
brew install ollama
brew services start ollama
Linux에서는 다음을 실행합니다:
curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
`ollama list`로 서비스가 실행 중인지 확인합니다. 다음으로 모델을 풀링합니다:
ollama pull qwen3.5:35b
다운로드는 10분에서 30분 내에 완료됩니다. 기본 추론을 테스트합니다:
ollama run qwen3.5:35b
REPL 내에서 프롬프트를 입력합니다. Qwen3.5가 정확하게 답변합니다. `/bye`를 입력하여 종료합니다.
OpenClaw에 필요하므로 OpenAI 호환 엔드포인트를 즉시 확인합니다:
curl http://localhost:11434/v1/models
응답에 qwen3.5:35b가 나열됩니다. 브릿지가 작동하는 것을 알 수 있습니다.
Qwen3.5와 함께 OpenClaw 실행
하나의 Ollama 명령으로 모든 것을 설치하고 시작합니다:
ollama launch openclaw --model qwen3.5:35b
Ollama는 누락된 구성 요소를 설치하고, 게이트웨이를 시작하며, TUI 위자드를 엽니다. 메시징 채널을 연결하고, 모델 제공자를 확인하고, 설정을 저장합니다. 게이트웨이는 8080 포트에서 실행됩니다.
Telegram에서 봇에게 "내 다운로드 폴더의 파일 목록을 보여줘."라고 메시지를 보내 테스트합니다. OpenClaw는 qwen3.5를 사용하여 결과를 반환합니다.
수동으로 구성할 수도 있습니다. `~/.openclaw/openclaw.json`을 편집하여 Ollama 제공자 기본 URL을 설정합니다. `openclaw start`로 다시 시작합니다. 두 방법 모두 동일한 결과를 제공합니다.
Apidog로 전체 스택 테스트
Apidog를 열고 “Qwen3.5 OpenClaw 로컬 스택”이라는 새 프로젝트를 생성합니다. 기본 URL을 `http://localhost:11434/v1`로 설정합니다.

`/chat/completions`에 POST 요청을 추가합니다. 다음 헤더를 포함합니다:
- Content-Type: application/json
- Authorization: Bearer ollama
다음 바디를 사용합니다:
{
"model": "qwen3.5:35b",
"messages": [
{"role": "system", "content": "You are a helpful agent."},
{"role": "user", "content": "Plan steps to organize my Downloads folder by file type."}
],
"temperature": 0.7,
"max_tokens": 2048
}
요청을 보냅니다. Apidog는 실시간으로 스트리밍 토큰을 표시합니다. 상태 코드 200에 대한 시각적 어설션을 추가합니다. 요청을 테스트 시나리오로 저장합니다. 설정을 변경한 후 시나리오를 다시 실행합니다. 따라서 문제를 즉시 파악할 수 있습니다.
`http://localhost:8080/v1`에 있는 OpenClaw의 게이트웨이를 위한 두 번째 컬렉션을 생성합니다. 종단 간 메시지 라우팅을 테스트합니다. Apidog의 스키마 유효성 검사는 도구 호출 형식이 OpenClaw가 예상하는 것과 일치하는지 확인합니다.
Apidog에서 엔드포인트 설계 및 문서화
Apidog의 시각적 디자이너를 사용하여 채팅 완료 스키마를 모델링합니다. 공식 OpenAI 사양을 가져옵니다. qwen3.5 매개변수에 맞게 사용자 정의합니다. 대화형 문서를 자동으로 생성합니다. 팀원과 함께 작업하는 경우 Apidog 워크스페이스를 통해 문서를 공유합니다.

Apidog 내에서 모의 응답(mock responses)을 생성할 수도 있습니다. OpenClaw 전체 설정을 마치기 전에 도구 호출을 시뮬레이션할 수 있습니다. 따라서 더 빠르게 개발하고 엣지 케이스를 안전하게 테스트할 수 있습니다.
더 나은 성능을 위한 고급 구성
더 가벼운 양자화가 필요할 때 사용자 지정 Modelfile을 생성합니다:
FROM qwen3.5:35b
PARAMETER num_gpu 999
PARAMETER num_ctx 131072
`ollama create qwen3.5:35b-q4 -f Modelfile`로 빌드합니다. OpenClaw 구성을 업데이트하여 새 태그를 사용합니다.
채팅 메시지에서 base64 이미지를 전송하여 비전 기능을 활성화합니다. Qwen3.5는 OpenClaw가 브라우저 작업 중에 캡처하는 스크린샷을 처리합니다. 따라서 시각적 이해가 필요한 양식을 자동화할 수 있습니다.
추가 스킬을 설치합니다:
openclaw skill install @community/calendar
openclaw skill install @community/github
각 스킬은 JSON 스키마를 등록합니다. Qwen3.5는 자동으로 이를 호출하는 방법을 학습합니다. OpenClaw 대시보드 내에서 사용량을 모니터링할 수 있습니다.
오늘 바로 실행할 수 있는 실제 워크플로
코드 검토를 위해 이 스택을 사용합니다. OpenClaw에 "내 리포지토리의 PR을 검토하고 리팩토링을 제안해줘."라고 메시지를 보냅니다. 에이전트는 리포지토리를 복제하고 코드를 분석하며 패치를 생성합니다.
개인 작업을 자동화합니다. "내 받은 편지함에서 항공권 확인 메일을 확인하고 캘린더에 추가해줘."라고 작성합니다. OpenClaw는 이메일을 파싱하고 캘린더를 업데이트합니다.
연구 도우미를 만듭니다. PDF 스크린샷을 보내고 요약과 추가 질문을 요청합니다. Qwen3.5는 텍스트를 정확하게 추출합니다. OpenClaw는 며칠 동안 컨텍스트를 유지합니다.
여러 에이전트를 실행합니다. 별도의 OpenClaw 워크스페이스를 시작합니다. 하나는 일반 작업을 위해 qwen3.5:35b를 사용하고, 다른 하나는 전문 코더 모델을 사용합니다. 게이트웨이는 메시지를 올바르게 라우팅합니다.
속도 및 메모리 사용량 최적화
모든 GPU 레이어를 사용하려면 `OLLAMA_NUM_GPU=999`를 설정합니다. `nvidia-smi`로 모니터링합니다. Apple Silicon에서는 플래시 어텐션을 활성화합니다.
qwen3.5가 자동으로 실행하는 주기적인 요약 프롬프트를 사용하여 컨텍스트 비대화를 줄입니다. 초당 토큰 속도를 비교합니다. 35B 모델은 4090급 GPU에서 초당 45~60토큰에 도달합니다. 하드웨어에 맞는 변형을 선택합니다.
Apidog의 성능 테스트를 사용하여 100개 요청에 대한 지연 시간을 측정합니다. 목표 응답 시간에 도달할 때까지 온도와 max_tokens를 조정합니다.
일반적인 문제 신속하게 해결
"model not found" 메시지가 표시됩니다. `ollama list`를 실행하고 구성 파일의 태그를 수정합니다.
높은 지연 시간을 경험합니다. `journalctl -u ollama`로 로그를 확인하고 GPU 레이어를 늘립니다. Apidog를 사용하여 동일한 요청을 다시 테스트하고 개선 사항을 확인합니다.
도구 호출 파싱에 실패합니다. Apidog 테스트 시나리오 내에서 온도를 0.7로 고정하고 다시 실행합니다.
OpenClaw가 메시징 앱과의 연결이 끊어졌습니다. `openclaw configure --section channels`를 실행하여 토큰을 새로 고칩니다.
Ollama에서 호출 제한에 도달했습니다. 동시성 설정을 늘리고 Apidog에서 다시 테스트합니다.
모든 문제에 대해 Apidog의 오류 검사 창을 사용합니다. 시각적 스택 트레이스와 응답 비교는 문제 해결 속도를 크게 높여줍니다.
설정 보안 유지
OpenClaw를 전용 사용자 계정으로 실행합니다. 도구 실행을 위해 샌드박싱을 활성화합니다. 11434 또는 8080 포트를 공개적으로 노출하지 마세요. 이동 중에는 SSH 터널 또는 Tailscale을 통해 접근합니다.
모든 스킬 소스를 설치하기 전에 검토합니다. OpenClaw 설정에서 메모리 암호화를 켭니다. `~/.openclaw` 폴더를 정기적으로 백업합니다.
따라서 데이터가 네트워크를 벗어나지 않으므로 대부분의 클라우드 서비스보다 안전한 시스템을 운영할 수 있습니다.
향후 업데이트 계획
Alibaba는 더 작은 Qwen3.5 변형을 정기적으로 출시합니다. Ollama는 이를 빠르게 추가합니다. `ollama pull qwen3.5:35b --force`로 업데이트를 풀링합니다.
OpenClaw의 스킬 라이브러리는 매주 증가합니다. GitHub 알림을 확인하여 최신 정보를 유지하세요.
각 업데이트 후 Apidog 테스트 프로세스를 반복합니다. 테스트 컬렉션을 유지하고 모델 태그만 변경하면 됩니다. 따라서 추가 작업 없이 안정성을 유지할 수 있습니다.
결론
이제 Ollama를 사용하여 qwen3.5를 OpenClaw와 함께 무료로 실행할 수 있습니다. 하드웨어에서 전체 스택을 제어할 수 있습니다. 강력한 추론, 비전 지원, 영구 메모리 및 사전 예방적 자동화를 얻을 수 있습니다.
명확한 단계를 따랐습니다. Apidog로 모든 계층을 테스트했습니다. 성능을 최적화하고 환경을 안전하게 보호했습니다. 작은 구성 선택으로 유능한 개인 AI 에이전트를 만들었습니다.
지금 터미널을 여세요. 시작 명령을 실행하세요. 메시징 앱을 연결하세요. 첫 번째 작업을 보내세요. 완전히 로컬에서 작동하는 에이전트가 얼마나 강력한지 느끼게 될 것입니다.
Apidog를 다운로드하여 향후 업데이트를 따라가고 엔드포인트를 효율적으로 계속 테스트하세요. 오늘 더 스마트한 워크플로를 구축하는 데 필요한 모든 것을 이미 갖추고 있습니다.

