Grok 4.6은 xAI의 최첨단 언어 모델로, 2026년 8월 12일에 출시되었습니다. Grok 4.5를 기반으로 하며 장기 실행 에이전트, 에이전트 코딩, 대화형 또는 시각적 작업에 중점을 둡니다. 500,000 토큰 컨텍스트 창을 제공하며, 가격은 백만 입력 토큰당 2달러, 백만 출력 토큰당 6달러입니다. Artificial Analysis Intelligence Index에서 61점을 받아 OpenAI의 GPT-5.6 Sol과 동등하며 Anthropic의 Claude Fable 5보다 1점 낮은 점수를 기록하여 현재 지능 최전선에서 가장 저렴한 모델입니다.
이것이 한 단락으로 요약한 답변입니다. 이 게시물의 나머지 부분에서는 Grok 4.5에서 실제로 무엇이 변경되었는지, 벤치마크 수치가 무엇을 의미하는지, 오늘날 이 모델을 어디에서 사용할 수 있는지, 그리고 LLM API를 기반으로 구축하는 개발자에게 무엇을 의미하는지에 대해 다룹니다. 마지막 부분이 해당한다면, Apidog는 클라이언트를 먼저 작성하지 않고도 Grok 4.6을 시험해 볼 수 있도록 LLM API 호출을 설계, 테스트 및 모의할 수 있는 무료 작업 공간을 제공합니다.
요약 (TL;DR)
- 출시일: 2026년 8월 12일, xAI.
- 초점: 장기적 에이전트, 다단계 코딩, 대화형 및 시각적 작업. xAI는 모델이 진행하기 전에 자체적으로 작업을 더 자주 테스트하고 검증한다고 말합니다.
- 사양: 500K 컨텍스트 창, 지식 마감일 2026년 2월 1일.
- 가격: 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러. 더 빠른 변형은 2배의 비용. 첫째 주에는 Grok Build 및 Cursor에서 2배의 사용량이 제공됩니다.
- 벤치마크: Intelligence Index 61 (GPT-5.6 Sol과 동점), DeepSWE (54 → 65.9) 및 APEX-Agents (47.1 → 57.5)에서 4.5 대비 큰 폭 상승.
- 사용처: xAI API, Grok Build, Cursor, OpenRouter, Vercel, Cloudflare.
Grok 4.6 한눈에 보기
| 사양 | Grok 4.6 |
|---|---|
| 개발사 | xAI |
| 출시일 | 2026년 8월 12일 |
| 컨텍스트 창 | 500,000 토큰 |
| 지식 마감일 | 2026년 2월 1일 |
| 입력 / 출력 가격 | 100만 토큰당 $2 / $6 |
| 고속 변형 | 2배 가격 |
| Intelligence Index | 61 (GPT-5.6 Sol: 61, Claude Fable 5: 62) |
| 사용처 | xAI API, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
Grok 4.5와 비교하여 실제로 새로운 점
Grok 4.6은 아키텍처 공개가 아니라, 훈련에 대한 이야기입니다. xAI에 따르면, 이 모델은 Grok 4.5보다 더 긴 보충 훈련 과정을 거쳤으며, 세 가지 주요 요소가 중요한 역할을 했습니다.
- 추론 및 고급 기술 개념을 목표로 모델이 생성한 선별된 데이터.
- xAI가 실제 개발 세션을 통해 훈련을 시작하면서 이어진 코딩 중심 학습을 계속한 고품질 엔지니어링 데이터셋.
- 추론 및 도메인 특정 영역에 걸쳐 미세 조정 궤적을 재생성한 개선된 최적화 도구 및 훈련 레시피.
개발자들이 인지할 행동 변화는 자기 검증입니다. 긴 에이전트 실행 중에 Grok 4.6은 검증되지 않은 가설에 따라 무작정 진행하기보다, 다음 단계로 넘어가기 전에 자체 작업을 확인하고, 방금 작성한 테스트를 실행하고, 방금 편집한 파일을 다시 읽습니다. xAI는 또한 대화형 및 시각적 프로젝트(대시보드, 소규모 앱, UI 작업)에서 첫 시도 결과가 더 향상되어 첫 실행에 더 가깝게 사용할 수 있게 되었다고 보고합니다.
Grok 4.5의 훈련 방식에 관심이 있었다면, 커서 세션 훈련이 개발자에게 의미하는 바에 대한 저희 분석에서 이 모델이 기반으로 하는 계보를 다룹니다.
중요한 차이를 보이는 벤치마크
제조업체의 출시 수치는 회의적인 시각으로 볼 필요가 있지만, 4.5에서 4.6으로의 차이는 의미 있을 만큼 충분히 큽니다. 경쟁사의 현황을 포함한 내용은 다음과 같습니다.

세 가지 핵심 사항:
- 에이전트 격차가 좁혀졌습니다. APEX-Agents에서 10.4점 상승하여 Grok은 "확실히 뒤처짐"에서 Fable 5 Max와 1.7점 이내로 좁혀졌으며, GPT-5.6 Sol Max(56.7%)를 약간 앞섰습니다.
- 저장소 규모 코딩이 가장 많이 개선되었습니다. DeepSWE가 거의 12점 상승한 것은 다중 파일 변경에서 헤매는 모델과 경쟁할 수 있는 모델의 차이를 보여주지만, Sol Max는 여전히 해당 벤치마크에서 크게 앞서고 있습니다.
- 독립적인 수치가 이러한 스토리를 뒷받침합니다. Artificial Analysis는 에이전트 평가에서 작업당 평균 비용이 0.84달러로 최첨단 모델 중 가장 낮았으며, 전문 지식 작업의 GDPval-AA v2에서 1753 Elo 점수를 측정했습니다.
xAI의 벤치마크 발표를 해석하는 방법과 지난 세대에도 적용되었던 주의사항에 대한 배경 정보는 Grok 4.5 벤치마크 분석을 참조하세요.
가격: 최전선의 가치 전략
Grok 4.6은 Grok 4.5의 가격 정책을 유지했습니다. 백만 입력 토큰당 2달러, 백만 출력 토큰당 6달러입니다. 현재 벤치마크에서 경쟁하는 모델들과 비교하면, 이는 현저한 가격 차이입니다:
| 모델 | 출력 가격 / 100만 토큰 |
|---|---|
| Grok 4.6 | $6 |
| Claude Opus 4.8 | $25 |
| GPT-5.6 Sol | $30 |
이는 복합 지능 지수에서 동등한 모델인 GPT-5.6 Sol과 비교했을 때 출력 측면에서 5배의 차이입니다. 저렴한 토큰이 자동으로 저렴한 작업을 의미하지는 않습니다. 검토와 수정이 필요한 약한 실행은 토큰 비용보다 더 많은 비용이 들 수 있지만, 독립적인 작업당 비용 데이터는 이 효율성이 단순히 낮은 가격표가 아니라 실제임을 시사합니다.
2배 가격($4/$12)의 더 빠른 변형은 지연 시간에 민감한 대화형 사용을 목표로 합니다. 그리고 8월 19일까지 Grok Build 및 Cursor 사용자는 모델 테스트를 위해 2배의 사용량을 제공받습니다.
오늘 Grok 4.6을 사용할 수 있는 곳
- console.x.ai를 통한 xAI API, OpenAI와 호환됩니다. 저희 Grok 4.5 API 가이드가 직접 적용되며, 모델 이름만 변경하면 됩니다.
- 모델 옵션으로 제공되는 Cursor; Cursor는 xAI와 함께 자체 출시 노트를 게시했습니다.
- xAI의 자체 에이전트 작업 공간인 Grok Build, 출시 주간 2배 사용량 보너스와 함께 제공됩니다.
- OpenRouter, Vercel, Cloudflare (단일 게이트웨이를 통해 여러 모델을 라우팅하는 팀용); OpenRouter에는
x-ai/grok-4.6으로 등재되어 있습니다.
여기서는 별도의 소비자 출시를 설명할 필요가 없습니다. 이것은 개발자 우선 출시이며, 이를 평가하는 가장 빠른 방법은 API 또는 이미 이 모델을 포함하고 있는 IDE를 통하는 것입니다.
제한 사항 및 열린 질문
출시 주간 평가는 주요 수치와 함께 주의사항을 알려드립니다:
- 벤치마크는 대부분 공급업체에서 보고한 것입니다. Artificial Analysis는 대체로 일치하는 독립적인 점수를 발표했지만, 특정 코딩 수치(DeepSWE, FrontierCode, CursorBench)는 xAI 자체 출시 표에서 가져온 것입니다. Grok 4.5의 출시 수치는 독립 테스트에서 부분적으로만 유지되었으므로, 여기에서도 평균으로의 회귀를 가정해야 합니다.
- 컨텍스트 창은 최전선에서 가장 작습니다. 500K 토큰은 대부분의 실제 워크로드를 처리할 수 있지만, GPT-5.6 Sol은 1.05M을, Claude Fable 5는 1M을 제공합니다. 단일 호출로 전체 모노레포 또는 방대한 문서 세트를 처리하는 경우 이 격차는 중요합니다.
- Sol은 여전히 가장 어려운 부분에서 앞서고 있습니다. DeepSWE에서 7점 뒤처진다는 것은 대규모 기존 코드베이스에 걸쳐 완전히 자율적인 작업이 GPT-5.6 Sol Max에서 여전히 더 강력하다는 의미이며, 이는 가장 경제적으로 가치 있는 에이전트 워크로드입니다.
- 생태계 성숙도가 뒤처집니다. xAI 플랫폼의 배치 처리, 프롬프트 캐싱 계층 및 사용 제어는 OpenAI 및 Anthropic의 해당 기능보다 역사가 짧습니다. OpenAI 호환성이 대부분의 문제를 해결하지만 전부는 아닙니다.
이러한 제한 사항 중 어느 것도 부적격 요인은 아닙니다. 이는 Grok 4.6이 어떤 위치에 적합한지를 정의합니다. 즉, 명성 때문에 기본적으로 채택하는 모델이 아니라 신중하게 평가해야 할 가격 대비 성능 옵션입니다.
API 개발자에게 의미하는 바
전략적 해석: 이제 최전선에 진정한 가격 경쟁자가 나타났습니다. 이번 출시 전까지 GPT-5.6 Sol 수준의 출력을 얻으려면 백만 출력 토큰당 25~30달러를 지불해야 했습니다. Grok 4.6은 6달러로 이를 제공하며, 이는 특히 에이전트 루프 계산을 변화시킵니다. 작업당 40번의 모델 호출을 하는 에이전트는 출력 가격의 5배 차이를 즉시 느끼게 될 것입니다.
실질적으로 OpenAI 호환 API는 평가에 많은 시간이 아닌 오후 한나절이 걸린다는 의미입니다. 기존 클라이언트를 https://api.x.ai/v1로 지정하고 실제 워크로드를 실행하여 비교해 보세요. Apidog에서 이 비교를 설정하면 GPT-5.6, Claude, Grok 4.6 요청을 한 프로젝트에서 나란히 유지하고, 제공업체별 환경과 세 모델 모두의 출력 품질, 토큰 사용량 및 지연 시간을 확인하는 어설션을 통해 프로덕션 워크로드를 투입하기 전에 유용한 증거를 확보할 수 있습니다.
이 모델의 에이전트 중심 접근 방식은 도구 호출의 정확성에 대한 중요성을 높입니다. Grok 통합에 함수 호출이 포함된 경우, 모델이 작성하는 텍스트뿐만 아니라 생성하는 페이로드도 테스트해야 합니다.
자주 묻는 질문 (FAQ)
Grok 4.6을 한 문장으로 설명하면? 2026년 8월에 xAI가 출시한 최첨단 모델로, 장기 실행 에이전트 및 코딩에 최적화되었으며, 500K 컨텍스트 창과 최전선급 벤치마크 점수를 경쟁사 출력 가격의 약 5분의 1로 제공합니다.
Grok 4.6이 GPT-5.6보다 좋은가요? Artificial Analysis Intelligence Index에서 61점으로 동점입니다. GPT-5.6 Sol Max는 저장소 규모 코딩(DeepSWE)에서 앞서며, Grok 4.6은 APEX-Agents에서 약간 우위를 보이고 출력 토큰당 비용이 약 5배 저렴합니다.
Grok 4.5와 4.6의 차이점은 무엇인가요? 동일한 가격, 동일한 API, 의미 있게 개선된 모델: DeepSWE에서 +11.9점, APEX-Agents에서 +10.4점 향상되었으며, 긴 작업 중 자체 검증하는 새로운 경향을 보입니다.
Grok 4.6을 무료로 사용해 볼 수 있나요? Grok Build와 Cursor는 출시 주간 동안 2배 사용량을 포함하며, Grok 4.5를 무료로 사용하는 가이드에 있는 방법들은 4.6에도 대부분 적용됩니다.
