Para llamar a Grok 4.7, envía una solicitud POST a https://api.x.ai/v1/responses con "model": "grok-4.7" y tu clave xAI como un token Bearer. Cuesta $2 por millón de tokens de entrada, $0.50 por millón de tokens de entrada en caché y $6 por millón de tokens de salida para prompts de menos de 200,000 tokens, con una ventana de contexto de 500,000 tokens. SpaceXAI (la empresa anteriormente llamada xAI) lo lanzó el 21 de septiembre de 2026 al mismo precio que Grok 4.6, por lo que para la mayoría de las integraciones existentes la actualización es un cambio de una sola línea.
A continuación: la primera solicitud, el esfuerzo de razonamiento y cómo afecta a tu factura, el razonamiento cifrado, el almacenamiento en caché, la transmisión, las herramientas, los límites de tasa y una configuración de prueba reutilizable en Apidog. Para obtener información sobre el modelo, lee qué es Grok 4.7 y qué cambió; la referencia oficial es la página de Grok 4.7 en la documentación de xAI.
API de Grok 4.7 de un vistazo
| Propiedad | Valor |
|---|---|
| ID del modelo | grok-4.7 |
| Endpoint | POST https://api.x.ai/v1/responses (Chat Completions todavía funciona como un endpoint heredado) |
| Ventana de contexto | 500,000 tokens |
| Límite de salida | Ninguno listado por xAI |
| Entrada / caché / salida, menos de 200k | $2.00 / $0.50 / $6.00 por 1M de tokens |
| Entrada / caché / salida, 200k y más | $4.00 / $1.00 / $12.00 por 1M de tokens |
| Esfuerzo de razonamiento | low, medium, high (predeterminado), xhigh |
| Entradas | Texto e imágenes (JPG o PNG, hasta 20 MiB) |
| Herramientas | Llamada a función, búsqueda web, búsqueda X, ejecución de código |
| Fecha límite de conocimiento | Mayo de 2026 |
| API por lotes | No compatible |
Paso 1: obtener una clave y cargar créditos
Crea una cuenta en console.x.ai, cárgala con créditos (la API es de prepago) y genera una clave. Nuestra guía de clave de API de Grok te guía por las pantallas de la consola. Mantén la clave fuera de tu código:
export XAI_API_KEY="your-key-here"
Paso 2: hacer tu primera solicitud
La API de Respuestas es el endpoint principal y el que utilizan todos los ejemplos en la documentación de xAI:
curl https://api.x.ai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4.7",
"input": "Review this function for bugs: function median(a){a.sort();return a[a.length/2]}"
}'
La API funciona con el SDK de OpenAI. Dirige el cliente a la URL base de xAI y llama a responses.create:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.XAI_API_KEY,
baseURL: "https://api.x.ai/v1",
});
const response = await client.responses.create({
model: "grok-4.7",
reasoning: { effort: "medium" },
input: [
{ role: "system", content: "You are a senior backend reviewer." },
{ role: "user", content: "Find the bug in: function median(a){a.sort();return a[a.length/2]}" },
],
});
console.log(response.output_text);
Si prefieres otro cliente, el mismo modelo es grok-4.7 en el SDK de Python de xAI (xai_sdk), xai.responses('grok-4.7') en el SDK de Vercel AI, y xai/grok-4.7 en LiteLLM. Dos notas de compatibilidad: xAI ahora etiqueta Chat Completions como un endpoint heredado, y su compatibilidad con el SDK de Anthropic está completamente deprecada. El nuevo código debería apuntar a /v1/responses.
Paso 3: elige un nivel de esfuerzo de razonamiento
Grok 4.7 siempre razona. No puedes desactivarlo, pero controlas cuánto se esfuerza en pensar con reasoning.effort en la API de Respuestas (reasoning_effort en el SDK de xAI): low para llamadas a herramientas sensibles a la latencia, medium para análisis y contextos largos, high (el predeterminado) para problemas complejos de varios pasos, y xhigh cuando la calidad supera el tiempo de respuesta.
Esta configuración es la mayor palanca en tu factura. La página de lanzamiento de SpaceXAI publica los resultados de CursorBench 4.0 por nivel de esfuerzo, y la diferencia es amplia:
| Esfuerzo | CursorBench 4.0 | Costo promedio por tarea | Tokens de salida promedio por tarea |
|---|---|---|---|
| bajo | 33.1% | $1.58 | 15,677 |
| medio | 41.6% | $3.49 | 36,683 |
| alto | 43.9% | $4.69 | 56,382 |
| xalto | 46.3% | $6.01 | 70,141 |
Pasar de low a xhigh compra 13.2 puntos y cuesta aproximadamente 3.8 veces más por tarea, porque el modelo escribe aproximadamente 4.5 veces más tokens de salida. Comienza en medium, y sube un nivel solo cuando tus propias pruebas demuestren que la calidad extra es importante.
Una restricción más: los modelos de razonamiento rechazan presencePenalty, frequencyPenalty y stop. Si un wrapper antiguo todavía envía alguno de ellos, la solicitud devuelve un error.
Paso 4: manejar el razonamiento cifrado en llamadas de múltiples turnos
Este es el cambio de comportamiento que más probablemente te sorprenderá. En la API de Respuestas, grok-4.7 siempre devuelve reasoning.encrypted_content, incluso cuando tu lista include no lo solicita. No puedes leer el razonamiento, pero puedes transmitirlo.
Para conversaciones de múltiples turnos, pasa los elementos de razonamiento de la respuesta anterior sin cambios en el input de la siguiente solicitud. Esto mantiene intacto el razonamiento del modelo a lo largo de los turnos. No edites, recortes ni reordenes esos elementos. Si tu código filtra el array output para obtener solo elementos message antes de construir el siguiente turno, ahora descartará el contexto que Grok 4.7 espera recibir de vuelta. El comportamiento de Chat Completions no ha cambiado.
Paso 5: haz que el almacenamiento en caché funcione para ti
La entrada en caché cuesta $0.50 por millón de tokens frente a $2 por entrada nueva, un descuento del 75%. El truco: un acierto de caché requiere que tu solicitud llegue a un servidor que ya contenga el prefijo. SpaceXAI "recomienda encarecidamente" establecer prompt_cache_key en las llamadas a la API de Respuestas (o el encabezado x-grok-conv-id en Chat Completions). Esto dirige las solicitudes de una conversación al mismo servidor; sin él, xAI advierte, a menudo pagas el precio completo de entrada en un servidor sin caché.
Ordena el prompt para su reutilización: prompt del sistema, esquemas de herramientas y documentos de referencia primero, el nuevo mensaje del usuario al final. Cualquier cosa que cambie cerca del principio rompe el prefijo y el descuento asociado.
Paso 6: transmitir respuestas
Añade "stream": true para recibir eventos enviados por el servidor en lugar de un único cuerpo JSON al final. Dado que el razonamiento siempre está activado, el modelo puede pensar durante un tiempo antes del primer token de respuesta, y una llamada no transmitida podría parecer colgada o disparar un tiempo de espera HTTP corto. Grok 4.7 transmite resúmenes de razonamiento, para que puedas mostrar el progreso mientras piensa.
Las llamadas a funciones son la excepción: según la documentación de xAI, una llamada a función llega completa en un único fragmento. Analízala cuando llegue ese fragmento en lugar de ensamblar argumentos a partir de deltas. Nuestra guía sobre cómo probar APIs de LLM que transmiten por SSE muestra cómo inspeccionar la secuencia de eventos sin procesar en Apidog.
Paso 7: añadir herramientas
La llamada a función utiliza el formato de herramienta de la API de Respuestas. Describes la función, Grok devuelve un elemento function_call, lo ejecutas y envías de vuelta un function_call_output con el call_id correspondiente:
curl https://api.x.ai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4.7",
"input": [{"role": "user", "content": "Has order 10482 shipped yet?"}],
"tools": [{
"type": "function",
"name": "get_order_status",
"description": "Look up the fulfillment status of an order",
"parameters": {
"type": "object",
"properties": { "order_id": {"type": "string"} },
"required": ["order_id"]
}
}]
}'
También se admiten salidas estructuradas, para que puedas ceñir la respuesta final a un esquema JSON.
Las herramientas del lado del servidor se ejecutan en el lado de xAI: {"type": "web_search"}, búsqueda X y ejecución de código. Se facturan además de los tokens: la búsqueda web cuesta $5 por 1,000 llamadas, la búsqueda X $5 por 1,000 publicaciones y la ejecución de código $5 por 1,000 llamadas, por lo que un agente que busca en cada turno paga esa tarifa en cada turno. La búsqueda web acepta allowed_domains y excluded_domains (hasta cinco de cada). Sin una herramienta de búsqueda, Grok 4.7 no tiene datos en tiempo real; su conocimiento se detiene en mayo de 2026.
Ten cuidado con el salto de precio de 200k
La tabla de precios tiene dos filas por una razón. Una vez que un prompt alcanza los 200,000 tokens, toda la solicitud se factura a una tarifa más alta: $4 de entrada, $1 en caché, $12 de salida. No son solo los tokens por encima del límite los que cuestan más.
Un prompt de 190,000 tokens con una respuesta de 4,000 tokens cuesta aproximadamente $0.40. Un prompt de 210,000 tokens con la misma respuesta cuesta aproximadamente $0.89. Aproximadamente un 10% más de entrada duplica con creces la factura.
Cuenta los tokens antes de enviar, resume el historial a medida que una conversación se acerca al límite y utiliza la compactación de contexto de xAI para bucles de agente largos. La parte económica de la ventana de 500,000 tokens termina en 200,000.
Límites de tasa y 429s
Los límites se ajustan a tu gasto acumulado y coinciden con los de Grok 4.6:
| Nivel (gasto acumulado) | Solicitudes por segundo | Tokens por minuto |
|---|---|---|
| N0 ($0) | 150 | 50M |
| N1 ($50) | 172 | 53M |
| N2 ($250) | 208 | 60M |
| N3 ($1,000) | 312 | 74M |
| N4 ($5,000) | 500 | 100M |
Los tokens en caché cuentan para los tokens por minuto. Si te excedes, obtendrás un HTTP 429. Reintenta con retroceso exponencial y fluctuación en lugar de saturar el endpoint; nuestra guía sobre errores de límite de tasa excedido cubre los patrones.
Migración desde Grok 4.6
La mayoría de las integraciones necesitan un cambio: grok-4.6 se convierte en grok-4.7. El precio, la ventana de contexto, los límites de tasa y los niveles de esfuerzo son idénticos. Vuelve a probar tres cosas antes de mover el tráfico de producción:
- Manejo de múltiples turnos. Confirma que tu código devuelve los elementos de razonamiento cifrado sin cambios.
- Tokens por tarea. Un modelo base nuevo y más grande cambia la cantidad de tokens que requiere una tarea, incluso con la misma tarifa por token. Mide tus prompts reales.
- Mapeo de esfuerzo. La documentación de Cursor dice que los niveles de esfuerzo están más separados que en Grok 4.6, por lo que una ruta ajustada en
mediumpuede comportarse de manera diferente.
Nuestra guía de la API de Grok 4.6 sigue siendo válida para todo lo que no cambió. Dos notas: https://us.api.x.ai/v1 mantiene la inferencia en EE. UU. por una prima del 10%, y Grok 4.7 Fast (2x precio) solo está disponible en Cursor y Grok Build, no en la API pública.
Prueba la API de Grok 4.7 en Apidog
Una solicitud guardada y repetible supera un comando curl en tu historial de shell cuando estás comparando niveles de esfuerzo o verificando una actualización.
- Crea un entorno en Apidog con
base_urlconfigurada comohttps://api.x.ai/v1yXAI_API_KEYalmacenada como una variable secreta. Añade un segundo entorno para el endpoint de EE. UU. si lo necesitas. - Guarda la solicitud:
POST {{base_url}}/responsescon un encabezadoAuthorization: Bearer {{XAI_API_KEY}}y tu prompt real en el cuerpo. - Añade aserciones: el estado es 200,
modeles igual agrok-4.7,usageexiste youtputcontiene un elementomessage. Estas detectan una clave incorrecta, un ID de modelo incorrecto o una forma de respuesta cambiada antes de que lo haga tu aplicación. - Clónala por nivel de esfuerzo (
low,medium,high,xhigh) y ejecuta las cuatro como un único escenario de prueba. Obtendrás el tiempo de respuesta y el uso de tokens uno al lado del otro para tu prompt, no para un benchmark. - Simula el endpoint una vez que la forma de la respuesta sea estable, para que el trabajo de frontend continúe sin gastar créditos.
Cuando se lance el siguiente modelo, cambia una variable y vuelve a ejecutar. Descarga Apidog para configurarlo.
Preguntas frecuentes
¿Cuál es el ID del modelo Grok 4.7? grok-4.7. En plataformas asociadas es spacexai/grok-4.7 (Vercel AI Gateway) y x-ai/grok-4.7 (OpenRouter).
¿Cuánto cuesta la API de Grok 4.7? $2 por millón de tokens de entrada, $0.50 en caché y $6 de salida para prompts de menos de 200,000 tokens, y el doble a partir de 200,000. No hay descuento por lotes para 4.7.
¿Puedo desactivar el razonamiento? No. Utiliza el esfuerzo low para obtener las respuestas más rápidas y económicas.
¿Existe una API de Grok 4.7 gratuita? La API de xAI funciona con créditos prepagados. Nuestra guía sobre cómo usar Grok 4.7 gratis cubre las rutas sin costo que existen.
¿Cómo se compara Grok 4.7 con GPT-6 Sol y Claude Opus 5.5? Tiene el precio de salida más bajo de los tres y está por detrás de Opus 5.5 en los benchmarks de codificación que ambos proveedores reportan. La comparación a tres bandas tiene los números.
Comienza con una solicitud guardada
Envía la solicitud curl anterior y luego guárdala en Apidog con aserciones y un escenario de nivel de esfuerzo. Obtendrás un costo base por tarea en tus propios prompts antes de mover el tráfico. Para elegir un nivel de esfuerzo predeterminado, lee el desglose de benchmarks de Grok 4.7 a continuación.
