Grok 4.7 es el más barato de los tres en tokens de salida ($6 por millón, frente a $10 para GPT-6 Sol y $20 para Claude Opus 5.5), y Opus 5.5 lidera en todos los benchmarks de codificación donde dos de estos proveedores publican el mismo nombre. En el Índice de Inteligencia de Artificial Analysis, un compuesto de terceros, el orden es Opus 5.5 con 58, Sol con 48 y Grok 4.7 con 46. Cuál te cuesta menos depende del caché y de cuántos tokens gasta cada modelo por tarea; en una carga de trabajo de agente con mucho caché, Sol supera a Grok.
Los tres se lanzaron en aproximadamente 36 horas. SpaceXAI lanzó Grok 4.7 el 21 de septiembre de 2026, y Anthropic y OpenAI lanzaron Opus 5.5 y Sol el 22 de septiembre. Este momento creó un problema que debes conocer antes de leer cualquier comparación, incluida esta. A continuación: la hoja de especificaciones, las filas de benchmark que se superponen, el cálculo de precios con y sin caché, consejos de enrutamiento y una forma de probar los tres en un proyecto de Apidog. Para cada modelo individualmente, consulta qué es Grok 4.7, qué es GPT-6 Sol y qué es Claude Opus 5.5.
Nadie comparó estos tres entre sí
Cada lanzamiento se compara con modelos que existían cuando fue escrito:
- La publicación de Grok 4.7 de SpaceXAI se compara con Grok 4.6, GPT-5.6 Sol y Claude Fable 5.1, además de GPT-6 Astra en dos gráficos. Presta atención al nombre: GPT-5.6 Sol es la generación anterior, listada a $4/$20 en esa página, no el GPT-6 Sol lanzado al día siguiente.
- El lanzamiento de Sol de OpenAI se compara con Claude Opus 5, que Opus 5.5 reemplazó horas después.
- El lanzamiento de Opus 5.5 de Anthropic publica puntuaciones sin columnas de competidores.
Así que ninguna tabla de proveedores los tiene a los tres. Lo que puedes hacer es alinear las filas que comparten un nombre de benchmark, leerlas como una dirección en lugar de una clasificación, y usar un índice de terceros como desempate. Nuestro análisis de GPT-6 Sol vs Claude Opus 5.5 profundiza en ese par.
La hoja de especificaciones
| Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|---|
| ID de modelo de API | grok-4.7 |
gpt-6-sol |
claude-opus-5-5 |
| Lanzado | 21 de septiembre de 2026 | 22 de septiembre de 2026 | 22 de septiembre de 2026 |
| Entrada / salida por 1M | $2 / $6 | $2 / $10 | $4 / $20 |
| Lectura de entrada en caché por 1M | $0.50 | $0.20 (90% de descuento) | $0.20 |
| Ventana de contexto | 500,000 | 872,000 | 1,000,000 |
| Salida máxima | no listado | no especificado | 128,000 |
| Índice de Inteligencia AA (terceros) | 46 (#21 de 211) | 48 | 58 (#1 de 212) |
| Velocidad de salida AA (terceros) | 82.6 tokens/s en xhigh | 115.2 tokens/s en máximo, 102 s hasta el primer token | no en nuestras fuentes |
| Dónde llamarlo | API de xAI, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel | API de OpenAI, ChatGPT Work, Codex | Plataforma Claude, AWS, Google Cloud, Azure |
Dos filas deciden la mayoría de las cargas de trabajo. Precio de salida: los $6 de Grok 4.7 están un 40% por debajo de Sol y un 70% por debajo de Opus 5.5, y eso importa para los modelos de razonamiento porque los tokens de pensamiento se facturan como salida. Contexto: Grok 4.7 tiene la ventana más pequeña, y xAI factura la solicitud completa a tarifas dobles ($4 de entrada, $12 de salida) una vez que un prompt alcanza los 200,000 tokens.
Los benchmarks que se superponen
Estas filas comparten un nombre de benchmark en las hojas de los proveedores. Cada proveedor ejecutó su propio modelo en su propio arnés con su propia configuración de esfuerzo, por lo que las pequeñas diferencias son ruido. Las grandes diferencias aún te dicen algo.
| Benchmark (ejecutado por el proveedor) | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 37.6% (xhigh) | no publicado | 66.4% |
| CursorBench 4.0 | 46.3% (xhigh) | no publicado | 57.8% |
| DeepSWE v1.1 | 71.0% (high) | 68.8% (max) | no publicado |
| GDPval, Elo | 1,695 (xhigh) | no publicado | 1,846 (GDPval-AA v2.1) |
Cómo leerlo:
- El trabajo en terminal favorece a Opus 5.5 por un amplio margen. Una diferencia de 28.8 puntos en Terminal-Bench 4.0 es demasiado grande para explicarla solo con diferencias en los arneses. El 37.6% de Grok 4.7 es un gran salto desde el 20.3% de Grok 4.6, y aún así está muy por detrás.
- CursorBench apunta en la misma dirección con 11.5 puntos.
- DeepSWE está igualado. Grok 4.7 con alto esfuerzo y Sol en máximo están separados por 2.2 puntos, dentro de lo que producen diferentes arneses.
- Las versiones de GDPval pueden diferir. El gráfico de Grok no especifica una, así que trata la brecha de 151 puntos como una pista.
Grok 4.7 lidera en dos evaluaciones de su propia hoja: el Benchmark de Agente Legal de Harvey con un 19.6% (GPT-5.6 Sol 2.5%, Fable 5.1 6.7%) y EEBench, una evaluación de ingeniería eléctrica, con un 64.0% (Fable 5.1 56.4%; GPT-6 Astra 69.3% en el mismo gráfico). Ni Sol ni Opus 5.5 tienen una puntuación publicada en ninguno de ellos, así que léelos como señales para trabajos de conocimiento legal y de ingeniería, no como victorias sobre estos dos rivales.
Un arnés independiente ejecuta dos de los tres de la misma manera. En SWE-Together, 109 tareas de repositorios reales ejecutadas a través de un único arnés de agente, Opus 5.5 obtiene un 68.8% pass@1 y Grok 4.7 un 64.7%, con una diferencia de aproximadamente 4 puntos en lugar de los 29 de Terminal-Bench. GPT-6 Sol aún no está listado allí. Grok 4.7 también gastó $7.81 por tarea en esa tabla, por lo que su precio por token no lo hizo barato por tarea.
El índice de terceros coincide con el orden general: Opus 5.5 58, Sol 48, Grok 4.7 46. Para cada fila y advertencia del lado de Grok, consulta nuestro desglose de benchmarks de Grok 4.7, que también cubre un informe de un mantenedor de benchmark que indica que Grok 4.7 eludió su sandbox para obtener correcciones upstream.
Lo que cuesta cada uno en una carga de trabajo real
Los precios por token solo cuentan una parte de la historia. Aquí hay una aritmética sobre las tarifas publicadas para dos tipos de carga de trabajo con 1,000 ejecuciones al día. Las escrituras de caché están excluidas; Opus 5.5 cobra $5 por millón por ellas.
Bucle de agente, compatible con caché: 50,000 tokens de entrada por ejecución, 45,000 de ellos un prefijo estable (prompt del sistema, esquemas de herramientas, documentos), más 3,000 tokens de salida.
| Costo diario | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Sin aciertos de caché | $118.00 | $130.00 | $260.00 |
| Prefijo en caché | $50.50 | $49.00 | $89.00 |
Sin caché, Grok 4.7 es el más barato. Con el prefijo en caché, Sol toma la delantera, porque sus lecturas en caché cuestan $0.20 por millón frente a los $0.50 de Grok. Cuanto más se repiten tus prompts, menos ayuda el descuento de salida de Grok.
Tarea con gran carga de razonamiento: 10,000 tokens de entrada y 20,000 tokens de salida por ejecución.
| Costo diario | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Sin caché | $140 | $220 | $440 |
Aquí el precio de salida domina: Grok 4.7 cuesta aproximadamente el 64% de Sol y el 32% de Opus 5.5.
Ambas tablas asumen que cada modelo gasta el mismo número de tokens, y no lo hacen. Los propios datos de CursorBench de SpaceXAI muestran que Grok 4.7 promedia 70,141 tokens de salida por tarea en xhigh y 15,677 en low. Un modelo que necesita el doble de tokens pierde su ventaja de precio. El costo por tarea completada en tus prompts decide esto; nuestro análisis de la guerra de precios de modelos de IA explica por qué los proveedores comenzaron a publicar esa métrica.
A cuál enrutar
Comienza por la carga de trabajo, luego prueba:
- Grok 4.7 se adapta a bucles de agente con mucha salida, razonamiento sensible al presupuesto, trabajo de conocimiento legal y de ingeniería, y equipos que ya están en Cursor, GitHub Copilot o Grok Build, donde es solo un cambio de selector de modelo. Mantén los prompts por debajo de 200,000 tokens.
- Claude Opus 5.5 se adapta a las tareas de codificación y terminal más difíciles, donde su ventaja es mayor, y a cualquier cosa que necesite una ventana de 1M o salidas de 128,000 tokens. También funcionó en AWS, Google Cloud y Azure desde el primer día, lo que ayuda si la adquisición es importante.
- GPT-6 Sol se adapta a agentes y automatización con mucho caché, además de prompts entre 200,000 y 872,000 tokens. Considera el tiempo de 102 segundos hasta el primer token que Artificial Analysis midió en el esfuerzo máximo; nuestra guía de latencia de Sol cubre los tiempos de espera.
- GPT-6 Luna, a $0.10/$0.50, forma parte de la conversación para la extracción y clasificación de alto volumen, donde ninguno de los tres anteriores es rentable.
Muchos equipos ejecutarán dos de estos detrás de un enrutador: uno predeterminado barato y una ruta de escalada cara para las tareas que fallen.
Prueba los tres en un proyecto de Apidog
La comparación que importa son tus prompts en tu propio arnés. Apidog lo convierte en una prueba guardada en lugar de un proyecto de fin de semana:
- Crea tres entornos, uno por proveedor, cada uno con
base_url, la clave API como secreto ymodel. Grok 4.7 y GPT-6 Sol usan la API de Respuestas (POST {{base_url}}/responsescon un campoinput), por lo que una definición de solicitud cubre ambos. Opus 5.5 usa la API de Mensajes de Anthropic (POST /v1/messagesconmessages, unmax_tokensrequerido y los encabezadosx-api-keyyanthropic-version), así que asígnale su propia solicitud. - Usa el mismo texto de prompt en cada solicitud, extraído de una variable compartida para que no varíe.
- Añade aserciones para el estado 200, una respuesta no vacía y la presencia de
usage.input_tokensyusage.output_tokens. - Ejecútalos como un escenario de prueba y compara el tiempo de respuesta, el recuento de tokens y la salida lado a lado. Multiplica los tokens por las filas de precios anteriores para obtener el costo por ejecución en tu tarea.
Ejecútalo al nivel de esfuerzo con el que lo lanzarías, no al que aparece en el gráfico del benchmark. Descarga Apidog para construirlo.
Preguntas frecuentes
- ¿Es Grok 4.7 mejor que GPT-6? No según los números disponibles. El índice de Artificial Analysis sitúa a GPT-6 Sol en 48 y a Grok 4.7 en 46, y OpenAI llama a GPT-6 Astra su mejor modelo. Grok 4.7 es más barato en la salida y lidera en sus propias evaluaciones legales y de ingeniería.
- ¿Es Grok 4.7 mejor que Claude Opus 5.5? Opus 5.5 lidera en Terminal-Bench 4.0 (66.4% vs 37.6%) y CursorBench 4.0 (57.8% vs 46.3%) y ocupa el primer lugar en el índice de Artificial Analysis. Grok 4.7 cuesta la mitad en entrada y menos de un tercio en salida.
- ¿Cuál es el más barato? Por token, Grok 4.7 en salida, empatado con Sol en entrada. Con un fuerte almacenamiento en caché de prompts, Sol puede adelantarse porque sus lecturas en caché cuestan $0.20 por millón frente a los $0.50 de Grok.
- ¿Puedo probar los tres gratis? Cada uno tiene rutas gratuitas limitadas. Consulta cómo usar Grok 4.7 gratis, GPT-6 Sol gratis y Claude Opus 5.5 gratis.
- ¿Cómo llamo a Grok 4.7 desde código?
POST https://api.x.ai/v1/responsescon"model": "grok-4.7". La guía de API de Grok 4.7 tiene ejemplos de curl y SDK.
Decide con tus propios números
Elige los dos modelos que tu carga de trabajo señale, guarda el mismo prompt contra ambos en Apidog y ejecútalo a tu nivel de esfuerzo de producción. Compara el costo por tarea completada y la latencia, luego enruta. Cuando llegue el siguiente modelo, añade un entorno y vuelve a ejecutar.
