Grok 4.7을 호출하려면 "model": "grok-4.7"과 xAI 키를 Bearer 토큰으로 포함하여 https://api.x.ai/v1/responses로 POST 요청을 보내십시오. 200,000 토큰 미만의 프롬프트의 경우 백만 입력 토큰당 2달러, 백만 캐시된 입력 토큰당 0.50달러, 백만 출력 토큰당 6달러의 비용이 들며, 500,000 토큰의 컨텍스트 창을 제공합니다. SpaceXAI (이전 xAI)는 2026년 9월 21일에 Grok 4.6과 동일한 가격으로 이를 출시했으므로, 대부분의 기존 통합에서는 한 줄만 변경하면 업그레이드할 수 있습니다.
아래 내용: 첫 번째 요청, 추론 노력과 그것이 요금에 미치는 영향, 암호화된 추론, 캐싱, 스트리밍, 도구, 속도 제한, 그리고 Apidog에서 재사용 가능한 테스트 설정. 모델에 대한 배경 지식을 얻으려면 Grok 4.7이란 무엇이며 무엇이 변경되었는지를 읽어보십시오. 공식 참고 자료는 xAI 문서의 Grok 4.7 페이지입니다.
한눈에 보는 Grok 4.7 API
| 속성 | 값 |
|---|---|
| 모델 ID | grok-4.7 |
| 엔드포인트 | POST https://api.x.ai/v1/responses (Chat Completions는 여전히 레거시 엔드포인트로 작동합니다) |
| 컨텍스트 창 | 500,000 토큰 |
| 출력 제한 | xAI에서 명시된 바 없음 |
| 입력 / 캐시 / 출력, 20만 미만 | 100만 토큰당 $2.00 / $0.50 / $6.00 |
| 입력 / 캐시 / 출력, 20만 이상 | 100만 토큰당 $4.00 / $1.00 / $12.00 |
| 추론 노력 | low, medium, high (기본값), xhigh |
| 입력 | 텍스트 및 이미지 (JPG 또는 PNG, 최대 20 MiB) |
| 도구 | 함수 호출, 웹 검색, X 검색, 코드 실행 |
| 지식 마감 | 2026년 5월 |
| 배치 API | 지원되지 않음 |
1단계: 키를 발급받고 크레딧 충전
console.x.ai에서 계정을 생성하고, 크레딧을 충전(API는 선불)한 다음, 키를 생성하십시오. 저희의 Grok API 키 가이드는 콘솔 화면을 안내합니다. 키는 코드에 노출되지 않도록 하십시오:
export XAI_API_KEY="your-key-here"
2단계: 첫 번째 요청 보내기
Responses API는 xAI 문서의 모든 예시에서 사용하는 주요 엔드포인트입니다.
curl https://api.x.ai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4.7",
"input": "Review this function for bugs: function median(a){a.sort();return a[a.length/2]}"
}'
이 API는 OpenAI SDK와 함께 작동합니다. 클라이언트를 xAI의 기본 URL로 지정하고 responses.create를 호출하십시오:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.XAI_API_KEY,
baseURL: "https://api.x.ai/v1",
});
const response = await client.responses.create({
model: "grok-4.7",
reasoning: { effort: "medium" },
input: [
{ role: "system", content: "You are a senior backend reviewer." },
{ role: "user", content: "Find the bug in: function median(a){a.sort();return a[a.length/2]}" },
],
});
console.log(response.output_text);
다른 클라이언트를 선호하는 경우, xAI의 Python SDK (`xai_sdk`)에서는 동일한 모델이 grok-4.7이고, Vercel AI SDK에서는 xai.responses('grok-4.7'), LiteLLM에서는 xai/grok-4.7입니다. 두 가지 호환성 참고 사항: xAI는 이제 Chat Completions를 레거시 엔드포인트로 분류했으며, Anthropic SDK 호환성은 완전히 사용 중단되었습니다. 새로운 코드는 /v1/responses를 대상으로 해야 합니다.
3단계: 추론 노력 선택
Grok 4.7은 항상 추론합니다. 이를 끌 수는 없지만, Responses API의 reasoning.effort (xAI SDK에서는 reasoning_effort)를 사용하여 얼마나 깊이 추론할지 제어할 수 있습니다: 지연 시간에 민감한 도구 호출에는 low, 분석 및 긴 컨텍스트에는 medium, 어려운 다단계 문제에는 high (기본값), 응답 시간보다 품질이 더 중요할 때는 xhigh를 사용합니다.
이 설정은 요금에 가장 큰 영향을 미 미칩니다. SpaceXAI의 출시 페이지에는 각 노력 수준별 CursorBench 4.0 결과가 게시되어 있으며, 그 차이는 상당합니다:
| 노력 | CursorBench 4.0 | 작업당 평균 비용 | 작업당 평균 출력 토큰 |
|---|---|---|---|
| low | 33.1% | $1.58 | 15,677 |
| medium | 41.6% | $3.49 | 36,683 |
| high | 43.9% | $4.69 | 56,382 |
| xhigh | 46.3% | $6.01 | 70,141 |
low에서 xhigh로 전환하면 13.2점을 얻을 수 있으며, 모델이 약 4.5배 더 많은 출력 토큰을 작성하므로 작업당 비용이 약 3.8배 증가합니다. medium에서 시작하고, 추가 품질이 중요하다고 자체 테스트에서 입증될 때만 경로를 상향 조정하십시오.
한 가지 더 제약 사항: 추론 모델은 presencePenalty, frequencyPenalty, stop을 거부합니다. 이전 래퍼가 여전히 이들 중 하나를 보내는 경우, 요청은 오류를 반환합니다.
4단계: 다중 턴 호출에서 암호화된 추론 처리
이것은 가장 놀랄 만한 동작 변경입니다. Responses API에서 grok-4.7은 include 목록에 요청하지 않았더라도 항상 reasoning.encrypted_content를 반환합니다. 추론 내용을 읽을 수는 없지만, 다음 단계로 전달할 수 있습니다.
다중 턴 대화의 경우, 이전 응답의 추론 항목을 다음 요청의 input에 변경 없이 다시 전달하십시오. 이렇게 하면 모델의 추론이 턴 전체에서 유지됩니다. 해당 항목을 편집, 자르거나 재정렬하지 마십시오. 만약 코드가 다음 턴을 구성하기 전에 output 배열을 message 항목으로 필터링한다면, Grok 4.7이 기대하는 컨텍스트를 버리게 됩니다. Chat Completions의 동작은 변경되지 않았습니다.
5단계: 캐싱을 활용하기
캐시된 입력은 신규 입력 100만 토큰당 2달러에 비해 0.50달러로, 75% 할인됩니다. 단점은: 캐시 적중이 되려면 요청이 이미 접두사를 가지고 있는 서버에 도달해야 한다는 것입니다. SpaceXAI는 Responses API 호출 시 prompt_cache_key를 설정할 것을 "강력히 권장"합니다 (또는 Chat Completions의 경우 x-grok-conv-id 헤더). 이는 대화의 요청을 동일한 서버로 라우팅하며, 이를 사용하지 않으면 xAI는 캐시가 없는 서버에서 종종 전체 입력 요금을 지불하게 될 것이라고 경고합니다.
재사용을 위해 프롬프트를 정렬하십시오: 시스템 프롬프트, 도구 스키마, 참조 문서를 먼저, 새 사용자 메시지를 마지막에 배치합니다. 상단 근처에서 변경되는 모든 것은 접두사를 깨뜨리고 할인 혜택도 사라지게 합니다.
6단계: 응답 스트리밍
마지막에 하나의 JSON 본문을 받는 대신 서버 전송 이벤트를 수신하려면 "stream": true를 추가하십시오. 추론은 항상 켜져 있기 때문에, 모델은 첫 번째 응답 토큰이 나오기까지 잠시 생각할 수 있으며, 스트리밍하지 않는 호출은 멈추거나 짧은 HTTP 타임아웃에 걸릴 수 있습니다. Grok 4.7은 추론 요약을 스트리밍하므로 모델이 생각하는 동안 진행 상황을 표시할 수 있습니다.
함수 호출은 예외입니다: xAI 문서에 따르면, 함수 호출은 단일 청크로 전체가 도착합니다. 델타에서 인수를 조합하는 대신 해당 청크가 도착하면 이를 파싱하십시오. SSE를 통해 스트리밍되는 LLM API 테스트 가이드는 Apidog에서 원시 이벤트 시퀀스를 검사하는 방법을 보여줍니다.
7단계: 도구 추가
함수 호출은 Responses API 도구 형식을 사용합니다. 함수를 설명하면 Grok이 function_call 항목을 반환하고, 이를 실행한 다음, 일치하는 call_id와 함께 function_call_output을 다시 보냅니다.
curl https://api.x.ai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4.7",
"input": [{"role": "user", "content": "Has order 10482 shipped yet?"}],
"tools": [{
"type": "function",
"name": "get_order_status",
"description": "Look up the fulfillment status of an order",
"parameters": {
"type": "object",
"properties": { "order_id": {"type": "string"} },
"required": ["order_id"]
}
}]
}'
구조화된 출력도 지원되므로 최종 답변을 JSON 스키마에 따라 유지할 수 있습니다.
서버 측 도구는 xAI 측에서 실행됩니다: {"type": "web_search"}, X 검색, 코드 실행. 이들은 토큰 외에 추가로 요금이 부과됩니다: 웹 검색은 1,000회 호출당 5달러, X 검색은 1,000회 게시물당 5달러, 코드 실행은 1,000회 호출당 5달러이므로, 매 턴마다 검색하는 에이전트는 매 턴마다 해당 요금을 지불합니다. 웹 검색은 allowed_domains와 excluded_domains를 허용합니다 (각각 최대 5개). 검색 도구가 없으면 Grok 4.7은 실시간 데이터를 가지고 있지 않으며, 지식은 2026년 5월에서 멈춥니다.
20만 토큰 가격 절벽을 주의하세요
가격표에 두 줄이 있는 이유가 있습니다. 프롬프트가 200,000 토큰에 도달하면, 전체 요청은 더 높은 요율로 청구됩니다: 입력 4달러, 캐시 1달러, 출력 12달러. 단순히 해당 선을 넘는 토큰만 비용이 더 많이 드는 것이 아닙니다.
4,000토큰 답변을 가진 190,000토큰 프롬프트는 약 0.40달러의 비용이 듭니다. 동일한 답변을 가진 210,000토큰 프롬프트는 약 0.89달러의 비용이 듭니다. 약 10% 더 많은 입력으로 인해 요금이 두 배 이상 증가합니다.
전송하기 전에 토큰 수를 세고, 대화가 한계에 가까워지면 기록을 요약하며, 긴 에이전트 루프에는 xAI의 컨텍스트 압축 기능을 사용하십시오. 500,000 토큰 창의 저렴한 부분은 200,000에서 끝납니다.
속도 제한 및 429 오류
제한은 누적 지출에 따라 조정되며 Grok 4.6과 동일합니다.
| 티어 (누적 지출) | 초당 요청 수 | 분당 토큰 수 |
|---|---|---|
| T0 ($0) | 150 | 5천만 |
| T1 ($50) | 172 | 5천3백만 |
| T2 ($250) | 208 | 6천만 |
| T3 ($1,000) | 312 | 7천4백만 |
| T4 ($5,000) | 500 | 1억 |
캐시된 토큰은 분당 토큰 수에 포함됩니다. 초과하면 HTTP 429 오류가 발생합니다. 엔드포인트를 계속 두드리는 대신 지수 백오프 및 지터로 재시도하십시오. 저희의 속도 제한 초과 오류 가이드는 해당 패턴을 다룹니다.
Grok 4.6에서 마이그레이션
대부분의 통합은 한 가지 변경만 필요합니다: grok-4.6이 grok-4.7로 바뀝니다. 가격, 컨텍스트 창, 속도 제한 및 노력 수준은 동일합니다. 프로덕션 트래픽을 이동하기 전에 세 가지를 다시 테스트하십시오:
- 다중 턴 처리. 암호화된 추론 항목이 변경되지 않고 다시 전달되는지 코드를 확인하십시오.
- 작업당 토큰. 새롭고 더 큰 기본 모델은 동일한 토큰당 요율에서도 작업에 소요되는 토큰 수를 변경합니다. 실제 프롬프트를 측정하십시오.
- 노력 매핑. Cursor 문서에 따르면 노력 수준이 Grok 4.6보다 더 분리되어 있으므로,
medium으로 조정된 경로는 다르게 동작할 수 있습니다.
변경되지 않은 모든 사항에 대해서는 저희의 Grok 4.6 API 가이드가 여전히 유효합니다. 두 가지 참고 사항: https://us.api.x.ai/v1은 10% 프리미엄으로 미국에서 추론을 유지하며, Grok 4.7 Fast (2배 가격)는 Cursor 및 Grok Build에만 있으며 공개 API에는 없습니다.
Apidog에서 Grok 4.7 API 테스트
노력 수준을 비교하거나 업그레이드를 확인할 때, 저장되고 반복 가능한 요청은 셸 기록에 있는 curl 명령보다 훨씬 효과적입니다.
- Apidog에서
base_url을https://api.x.ai/v1로 설정하고XAI_API_KEY를 비밀 변수로 저장하여 환경을 생성하십시오. 필요한 경우 미국 엔드포인트를 위한 두 번째 환경을 추가하십시오. - 요청을 저장하십시오:
Authorization: Bearer {{XAI_API_KEY}}헤더와 본문에 실제 프롬프트를 포함한POST {{base_url}}/responses요청을 저장하십시오. - 어설션 추가: 상태가 200인지,
model이grok-4.7인지,usage가 존재하는지,output에message항목이 포함되어 있는지 확인합니다. 이러한 어설션은 앱에서 처리하기 전에 잘못된 키, 잘못된 모델 ID 또는 변경된 응답 형태를 감지합니다. - 각 노력 수준별로 복제하십시오 (
low,medium,high,xhigh) 그리고 네 가지를 하나의 테스트 시나리오로 실행하십시오. 벤치마크가 아닌, 자신의 프롬프트에 대한 응답 시간과 토큰 사용량을 나란히 확인할 수 있습니다. - 응답 형태가 안정되면 엔드포인트를 모의하십시오, 그러면 크레딧을 소비하지 않고도 프론트엔드 작업이 계속될 수 있습니다.
다음 모델이 출시되면 변수 하나만 변경하고 다시 실행하십시오. 이를 설정하려면 Apidog를 다운로드하십시오.
자주 묻는 질문 (FAQ)
Grok 4.7 모델 ID는 무엇입니까? grok-4.7입니다. 파트너 플랫폼에서는 spacexai/grok-4.7 (Vercel AI Gateway) 및 x-ai/grok-4.7 (OpenRouter)입니다.
Grok 4.7 API 비용은 얼마입니까? 200,000 토큰 미만의 프롬프트의 경우 백만 입력 토큰당 2달러, 캐시된 토큰당 0.50달러, 출력 토큰당 6달러이며, 200,000 토큰 이상에서는 이 두 배입니다. 4.7에는 배치 할인이 없습니다.
추론을 끌 수 있습니까? 아니요. 가장 빠르고 저렴한 응답을 위해 low 노력을 사용하십시오.
무료 Grok 4.7 API가 있습니까? xAI의 API는 선불 크레딧으로 작동합니다. Grok 4.7을 무료로 사용하는 방법에 대한 저희 가이드는 존재하는 무료 경로를 다룹니다.
Grok 4.7은 GPT-6 Sol 및 Claude Opus 5.5와 어떻게 비교됩니까? 세 모델 중 가장 낮은 출력 가격을 가지며, 두 공급업체가 보고하는 코딩 벤치마크에서는 Opus 5.5에 뒤처집니다. 세 모델 비교에서 수치를 확인할 수 있습니다.
저장된 요청 하나로 시작하기
위에 제시된 curl 요청을 보낸 다음, 어설션과 노력 수준 시나리오를 사용하여 Apidog에 저장하십시오. 트래픽을 이동하기 전에 자신의 프롬프트에 대한 작업당 기준 비용을 얻을 수 있습니다. 기본 노력 수준을 선택하려면 다음으로 Grok 4.7 벤치마크 분석을 읽어보십시오.
