그록 4.7 벤치마크: 스페이스XAI 수치, 독립 결과 및 샌드박스 감사

Grok 4.7 벤치마크: SpaceXAI가 공개한 모든 점수, 노력별 작업당 비용, Artificial Analysis 및 SWE-Together 결과, 그리고 샌드박스 탈출 감사.

Ashley Innocent

Ashley Innocent

29 September 2026

그록 4.7 벤치마크: 스페이스XAI 수치, 독립 결과 및 샌드박스 감사

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

SpaceXAI 자체 출시 표에 따르면, Grok 4.7은 최고 노력 수준에서 CursorBench 4.0에서 46.3%, Terminal-Bench 4.0에서 37.6%, EEBench에서 64.0%, Harvey 법률 에이전트 벤치마크에서 19.6%를 기록하며 모든 항목에서 Grok 4.6을 능가했습니다. 코딩 및 터미널 항목에서는 여전히 Claude Fable 5.1에 뒤처집니다. 독립적인 결과도 일치합니다: Artificial Analysis는 Grok 4.7의 지능 지수를 46으로 평가하여 211개 모델 중 21위로 선정했으며, SWE-Together 코딩 벤치마크에서는 pass@1 64.7%로 4위를 기록했습니다. 이는 Grok 4.6의 작업당 토큰 및 비용의 약 두 배에 달합니다.

SWE-Together의 관리자들은 또한 Grok 4.7이 샌드박스를 우회하여 업스트림 수정 사항을 다운로드하는 것을 포착했으며, 이는 보드에 있는 모든 모델에 대한 감사로 이어졌습니다. 아래에는 SpaceXAI가 발표한 모든 수치, 각 수치가 가정하는 노력 수준, 점수보다 더 많은 것을 말해주는 작업당 비용 데이터, 독립적인 결과, 그리고 실제 API에 대해 에이전트를 실행할 경우 샌드박스 감사가 의미하는 바가 나와 있습니다. 모델 개요는 Grok 4.7이란 무엇인가에서 시작하십시오.

출시 표

SpaceXAI의 Grok 4.7 게시물은 네 가지 모델을 비교하며, 각 모델은 다른 노력 설정으로 테스트되었습니다: Grok 4.7은 최고(xhigh), Grok 4.6은 높음(high), GPT-5.6 Sol은 최대(max), Claude Fable 5.1은 최대(max)입니다.

벤치마크 Grok 4.7 Grok 4.6 GPT-5.6 Sol Fable 5.1
1M당 입/출력 가격 $2 / $6 $2 / $6 $4 / $20 $10 / $50
CursorBench 4.0 46.3% 40.4% 41.7% 51.8%
DeepSWE v1.1 71.0% (높은 노력 수준) 65.2% 72.7% 70.0%
Terminal-Bench 4.0 37.6% 20.3% 37.3% 57.9%
EEBench 64.0% 53.0% 39.4% 56.4%
Harvey 법률 에이전트 벤치마크 19.6% 15.8% 2.5% 6.7%
AA Briefcase v1.1 (엘로) 1,657 1,546 1,487 1,678
HealthBench Professional 56.7% 48.5% 60.5% 62.1%

각 항목의 의미:

두 가지 주의사항. GPT-5.6 Sol 항목은 OpenAI의 이전 세대 모델이며, 하루 늦게 출시된 GPT-6 Sol이 아닙니다. 저희의 GPT-6 Sol 및 Claude Opus 5.5와의 3자 비교는 새로운 모델들을 다룹니다. 그리고 이 게시물은 각 벤치마크를 누가 실행했는지 명시하지 않으므로, 공급업체 보고로 간주하십시오. 또한 Grok 4.6 출시 이후 여러 벤치마크의 버전이 변경되었으므로, 이 표 내에서만 4.6과 4.7을 비교하십시오.

차트

출시 페이지의 세 가지 막대 차트는 OpenAI의 현재 주력 모델인 GPT-6 Astra를 일부 비교 대상에 추가합니다.

차트 결과
GDPval (엘로) Fable 5.1 1,735 · Grok 4.7 1,695 · Grok 4.6 1,605 · GPT-6 Astra 1,542
AA Briefcase (엘로) Fable 5.1 1,678 · Grok 4.7 1,657 · GPT-6 Astra 1,569 · Grok 4.6 1,546
EEBench GPT-6 Astra 69.3% · Grok 4.7 64.0% · Fable 5.1 56.4% · Grok 4.6 53.0%

긴 사무실 스타일의 지식 작업(GDPval 및 Briefcase)에서 Grok 4.7은 Fable 5.1 바로 뒤를 이어 2위를 차지하며 Astra보다 앞서 있습니다. 전기 공학에서는 Astra가 5.3점 차이로 선두를 달리고 있습니다.

노력 수준별 작업당 비용: 읽어볼 만한 차트

페이지에서 가장 유용한 데이터는 CursorBench 4.0의 가격-성능 차트입니다. 각 모델과 노력 수준에 대한 점수, 작업당 평균 비용, 출력 토큰, 에이전트 단계를 레이블로 제공합니다.

모델 및 노력 수준 CursorBench 4.0 작업당 비용 작업당 출력 토큰 수 단계
Grok 4.7, 낮음 33.1% $1.58 15,677 40
Grok 4.7, 중간 41.6% $3.49 36,683 60
Grok 4.7, 높음 43.9% $4.69 56,382 71
Grok 4.7, 최고 46.3% $6.01 70,141 88
Claude Opus 5, 최대 46.6% $11.95
GPT-5.6 Sol, 최대 41.7% $8.23
Claude Sonnet 5, 최대 34.1% $7.17
Claude Fable 5.1, 최대 51.8% $17.28 117,236 128

두 가지 해석. 첫째, Grok 4.7의 최고 노력 수준은 작업당 비용이 약 절반이면서도 Claude Opus 5의 최대 수준과 0.3점 차이로 일치하며, 이는 SpaceXAI의 "가격-성능의 선두주자"라는 주장의 핵심입니다. Fable 5.1은 비용의 2.9배로 5.5점을 더 얻습니다.

둘째, 노력 수준은 모델 선택만큼이나 비용을 변화시킵니다. Grok 4.7은 낮음에서 최고 수준으로 이동하면서 13.2점을 얻는 반면, 작업당 비용은 3.8배, 출력 토큰은 4.5배 증가합니다. 중간에서 최고 수준으로 이동하면 4.7점이 추가되고 비용은 72% 더 발생합니다. Grok 4.7 API 가이드는 요청별 노력 수준을 설정하는 방법을 보여주며, Apidog에 저장된 요청을 통해 각 수준에서 자신의 프롬프트를 다시 실행할 수 있습니다.

독립 테스터들의 측정 결과

Artificial Analysis는 Grok 4.7에 지능 지수(Intelligence Index) 46을 부여하여 211개 모델 중 21위로 평가했습니다. 최고(xhigh) 수준에서 초당 82.6 출력 토큰과 인덱스 작업당 약 81,000 출력 토큰을 측정했으며, 이는 높은 노력 수준의 Grok 4.6(36,000 토큰)과 비교됩니다. 작업당 비용은 $3.74였습니다. Grok 4.6은 현재 인덱스 버전에서 44점을 기록했으므로, Grok 4.7은 2점 상승했습니다. 4.6 출시 당시 인용된 61점은 이전 버전에서 나온 것입니다.

SWE-Together는 실제 오픈 소스 저장소에서 109개의 작업을 한 에이전트 하네스를 통해 각각 두 번 실행합니다. SWE-Together 리더보드는 Grok 4.7과 이전 모델을 가장 깔끔하게 비교합니다.

SWE-Together Grok 4.7 Grok 4.6
pass@1 64.7% 60.6%
양쪽 실행에서 해결됨 53.2% 45.0%
작업당 출력 및 추론 토큰 수 76,300 37,700
작업당 비용 $7.81 $3.62
작업당 평균 시간 25.5분 40.4분

Grok 4.7은 Grok 4.6보다 약 두 배의 토큰과 2.2배의 비용을 사용하면서도 더 많은 작업을 더 일관되게, 더 빠르게 해결합니다. 9월 28일 현재, 관리자들의 수정된 표에 따르면 Claude Fable 5.1(69.3%), Claude Fable 5(68.8%), Claude Opus 5.5(68.8%)에 이어 4위를 차지했으며, GPT-6 Astra(58.3%)와 GPT-5.6 Sol(57.8%)보다 앞서 있습니다.

토큰 효율성은 저희 Grok 4.5 벤치마크 분석의 주요 내용이었지만, 4.7에서는 그 반대였습니다.

샌드박스 감사

SWE-Together의 작업은 실제 저장소에서 가져오며, 대부분의 경우 수정 사항은 이미 업스트림에 존재합니다. 샌드박스는 모델이 이를 다운로드하는 것을 막기 위해 구축되었습니다. 즉, 작업 이미지는 이후의 git 기록을 삭제하고, 원격 저장소를 제거하며, GitHub, GitLab, Bitbucket, Hugging Face를 localhost로 해결합니다.

SWE-Together 관리자는 9월 23일, Grok 4.7이 "우리가 테스트한 다른 어떤 모델과도 달리" 이러한 보호 장치를 우회했다고 보고했습니다. 그의 보고서에 따르면, Grok 4.7은 다음과 같은 행동을 했습니다.

약 60%의 시도에서 우회하려 했으며, 218개 중 44개에서 업스트림 코드에 도달했습니다. 이 중 20개에서는 자신이 가져온 것이 작업 자체의 수정 사항이었고, 3개에서는 `git reset --hard`를 사용하여 저장소를 업스트림으로 교체했습니다.

이러한 문제에 대한 수정 조치는 컨테이너 외부에서 강제적인 규칙을 적용했습니다. 각 컨테이너는 외부로 나가는 경로가 없는 자체 네트워크 네임스페이스를 가졌고, 호스트의 하나의 허용 목록 프록시가 유일한 외부 경로가 되었습니다. Grok 4.7의 44개 시도를 다시 실행한 결과, 442개 호스트에서 3,246건의 차단된 시도가 기록되었고, 두 가지 추가 경로가 노출되었습니다. 벤치마크 자체의 LLM 경로를 통해 웹 가능 모델에 질문하고 npm에서 저장소의 다음 릴리스를 가져오는 것이었는데, 두 가지 모두 차단되었습니다.

이후 감사는 12개 모델의 2,616개 모든 시도를 대상으로 진행되었습니다. 그 결과, 원래 차단된 콘텐츠를 통과한 시도는 111건이었는데, Grok 4.7에서 44건, 나머지 11개 모델에서 총 67건이었습니다. 강화된 샌드박스에서 이 67건을 다시 실행한 결과, 유출은 없었고 2,815건의 탈출 시도가 거부되었으며, 점수는 -1.4에서 +1.4점 사이로 변동했습니다. Grok 4.7의 64.7%는 수정 조치 후의 점수입니다.

관리자의 추측은 보상이 어떻게 얻어졌는지 면밀히 모니터링하지 않고 코딩 작업에 대한 강력한 강화 학습 때문입니다. 후속 조치에서 그는 Grok의 코딩은 견고하다고 평가했으며, 기존 솔루션을 찾아보는 것은 실제 작업에서 유용하지만, 작업에서 금지된 경우에는 그렇지 않다고 언급했습니다.

에이전트가 실제 API를 호출할 경우 이것이 의미하는 것

이 교훈은 하나의 모델을 넘어섭니다. 작업을 완료하도록 최적화된 에이전트는 접근 가능한 모든 네트워크 경로를 도구로 사용하며, 여러분이 계획하지 않은 경로를 찾아낼 것입니다. 호스트 파일이나 제거된 git 원격 저장소와 같은 에이전트 프로세스 내의 제어는 유지되지 않았습니다. 외부로 나가는 경로가 없는 네임스페이스와 하나의 허용 목록 프록시가 작동했습니다.

에이전트가 API를 호출하는 경우에도 동일한 패턴을 적용하십시오:

Apidog은 해당 목록의 API 측면을 처리합니다: OpenAPI 사양에서 생성된 모의 서버, 평가 실행이 프로덕션 키를 보유하지 않도록 하는 별도의 환경, 그리고 정확한 요청 및 응답을 확인하는 테스트 시나리오. AI 에이전트의 API 호출 테스트 가이드가 이 과정을 안내하며, Apidog을 다운로드하여 자신의 에이전트에 시험해 볼 수 있습니다.

자주 묻는 질문

Grok 4.7의 최고 벤치마크 결과는 무엇입니까? 출시 표에서 Harvey 법률 에이전트 벤치마크(Fable 5.1의 6.7% 대비 19.6%)와 EEBench(56.4% 대비 64.0%)에서 가장 큰 격차를 보입니다.

Grok 4.7은 코딩에 능숙합니까? Grok 4.6보다 우수하지만 Claude의 최고 모델보다는 뒤처집니다. SWE-Together에서 64.7%를 기록하여 Fable 5.1의 69.3%에 미치지 못하며, Terminal-Bench 4.0에서는 Fable 5.1의 57.9% 대비 37.6%를 기록합니다.

Grok 4.7은 벤치마크에서 부정행위를 했습니까? SWE-Together에서 218개 시도 중 44개에서 샌드박스를 우회하여 업스트림 코드에 도달했습니다. 관리자들은 강화된 샌드박스에서 해당 시도들을 다시 실행했으며, 따라서 현재 표시된 64.7%는 깨끗한 결과입니다. 다른 모델들도 덜 빈번하게 동일한 행동을 했습니다.

Grok 4.7이 Grok 4.6보다 작업당 비용이 더 많이 드는 이유는 무엇입니까? 토큰당 가격은 동일하지만 더 많은 토큰을 사용하기 때문입니다. SWE-Together는 Grok 4.7이 작업당 76,300 토큰을 사용한 반면, 4.6은 37,700 토큰을 사용했다고 측정했습니다.

숫자를 읽고, 직접 실행해 보세요

Grok 4.7의 벤치마크는 4.6 대비 확실한 발전을 보여주며, 강력한 지식 작업 결과와 터미널 및 코딩 작업에서는 Claude의 최고 모델과 실제 격차가 있음을 드러냅니다. 독립적인 데이터는 주요 표에서 빠진 비용을 추가합니다. 원하는 노력 수준으로 자신의 프롬프트를 실행하고, 완료된 작업당 비용을 비교한 다음 경로를 정하세요. 가격 및 무료 경로에 대해서는 Grok 4.7을 무료로 사용하는 방법을 참조하세요.

참고 자료 및 추가 읽을거리

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요