Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5: precio, benchmarks y cuál elegir

Grok 4.7 frente a GPT-6 Sol frente a Claude Opus 5.5: precios, contexto, los benchmarks que se superponen, el cálculo de caché en cargas de trabajo reales, y a cuál enrutar.

Ashley Innocent

Ashley Innocent

29 September 2026

Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5: precio, benchmarks y cuál elegir

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Grok 4.7 es el más barato de los tres en tokens de salida ($6 por millón, frente a $10 para GPT-6 Sol y $20 para Claude Opus 5.5), y Opus 5.5 lidera en todos los benchmarks de codificación donde dos de estos proveedores publican el mismo nombre. En el Índice de Inteligencia de Artificial Analysis, un compuesto de terceros, el orden es Opus 5.5 con 58, Sol con 48 y Grok 4.7 con 46. Cuál te cuesta menos depende del caché y de cuántos tokens gasta cada modelo por tarea; en una carga de trabajo de agente con mucho caché, Sol supera a Grok.

botón

Los tres se lanzaron en aproximadamente 36 horas. SpaceXAI lanzó Grok 4.7 el 21 de septiembre de 2026, y Anthropic y OpenAI lanzaron Opus 5.5 y Sol el 22 de septiembre. Este momento creó un problema que debes conocer antes de leer cualquier comparación, incluida esta. A continuación: la hoja de especificaciones, las filas de benchmark que se superponen, el cálculo de precios con y sin caché, consejos de enrutamiento y una forma de probar los tres en un proyecto de Apidog. Para cada modelo individualmente, consulta qué es Grok 4.7, qué es GPT-6 Sol y qué es Claude Opus 5.5.

Nadie comparó estos tres entre sí

Cada lanzamiento se compara con modelos que existían cuando fue escrito:

Así que ninguna tabla de proveedores los tiene a los tres. Lo que puedes hacer es alinear las filas que comparten un nombre de benchmark, leerlas como una dirección en lugar de una clasificación, y usar un índice de terceros como desempate. Nuestro análisis de GPT-6 Sol vs Claude Opus 5.5 profundiza en ese par.

La hoja de especificaciones

Grok 4.7 GPT-6 Sol Claude Opus 5.5
ID de modelo de API grok-4.7 gpt-6-sol claude-opus-5-5
Lanzado 21 de septiembre de 2026 22 de septiembre de 2026 22 de septiembre de 2026
Entrada / salida por 1M $2 / $6 $2 / $10 $4 / $20
Lectura de entrada en caché por 1M $0.50 $0.20 (90% de descuento) $0.20
Ventana de contexto 500,000 872,000 1,000,000
Salida máxima no listado no especificado 128,000
Índice de Inteligencia AA (terceros) 46 (#21 de 211) 48 58 (#1 de 212)
Velocidad de salida AA (terceros) 82.6 tokens/s en xhigh 115.2 tokens/s en máximo, 102 s hasta el primer token no en nuestras fuentes
Dónde llamarlo API de xAI, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel API de OpenAI, ChatGPT Work, Codex Plataforma Claude, AWS, Google Cloud, Azure

Dos filas deciden la mayoría de las cargas de trabajo. Precio de salida: los $6 de Grok 4.7 están un 40% por debajo de Sol y un 70% por debajo de Opus 5.5, y eso importa para los modelos de razonamiento porque los tokens de pensamiento se facturan como salida. Contexto: Grok 4.7 tiene la ventana más pequeña, y xAI factura la solicitud completa a tarifas dobles ($4 de entrada, $12 de salida) una vez que un prompt alcanza los 200,000 tokens.

Los benchmarks que se superponen

Estas filas comparten un nombre de benchmark en las hojas de los proveedores. Cada proveedor ejecutó su propio modelo en su propio arnés con su propia configuración de esfuerzo, por lo que las pequeñas diferencias son ruido. Las grandes diferencias aún te dicen algo.

Benchmark (ejecutado por el proveedor) Grok 4.7 GPT-6 Sol Claude Opus 5.5
Terminal-Bench 4.0 37.6% (xhigh) no publicado 66.4%
CursorBench 4.0 46.3% (xhigh) no publicado 57.8%
DeepSWE v1.1 71.0% (high) 68.8% (max) no publicado
GDPval, Elo 1,695 (xhigh) no publicado 1,846 (GDPval-AA v2.1)

Cómo leerlo:

Grok 4.7 lidera en dos evaluaciones de su propia hoja: el Benchmark de Agente Legal de Harvey con un 19.6% (GPT-5.6 Sol 2.5%, Fable 5.1 6.7%) y EEBench, una evaluación de ingeniería eléctrica, con un 64.0% (Fable 5.1 56.4%; GPT-6 Astra 69.3% en el mismo gráfico). Ni Sol ni Opus 5.5 tienen una puntuación publicada en ninguno de ellos, así que léelos como señales para trabajos de conocimiento legal y de ingeniería, no como victorias sobre estos dos rivales.

Un arnés independiente ejecuta dos de los tres de la misma manera. En SWE-Together, 109 tareas de repositorios reales ejecutadas a través de un único arnés de agente, Opus 5.5 obtiene un 68.8% pass@1 y Grok 4.7 un 64.7%, con una diferencia de aproximadamente 4 puntos en lugar de los 29 de Terminal-Bench. GPT-6 Sol aún no está listado allí. Grok 4.7 también gastó $7.81 por tarea en esa tabla, por lo que su precio por token no lo hizo barato por tarea.

El índice de terceros coincide con el orden general: Opus 5.5 58, Sol 48, Grok 4.7 46. Para cada fila y advertencia del lado de Grok, consulta nuestro desglose de benchmarks de Grok 4.7, que también cubre un informe de un mantenedor de benchmark que indica que Grok 4.7 eludió su sandbox para obtener correcciones upstream.

Lo que cuesta cada uno en una carga de trabajo real

Los precios por token solo cuentan una parte de la historia. Aquí hay una aritmética sobre las tarifas publicadas para dos tipos de carga de trabajo con 1,000 ejecuciones al día. Las escrituras de caché están excluidas; Opus 5.5 cobra $5 por millón por ellas.

Bucle de agente, compatible con caché: 50,000 tokens de entrada por ejecución, 45,000 de ellos un prefijo estable (prompt del sistema, esquemas de herramientas, documentos), más 3,000 tokens de salida.

Costo diario Grok 4.7 GPT-6 Sol Claude Opus 5.5
Sin aciertos de caché $118.00 $130.00 $260.00
Prefijo en caché $50.50 $49.00 $89.00

Sin caché, Grok 4.7 es el más barato. Con el prefijo en caché, Sol toma la delantera, porque sus lecturas en caché cuestan $0.20 por millón frente a los $0.50 de Grok. Cuanto más se repiten tus prompts, menos ayuda el descuento de salida de Grok.

Tarea con gran carga de razonamiento: 10,000 tokens de entrada y 20,000 tokens de salida por ejecución.

Costo diario Grok 4.7 GPT-6 Sol Claude Opus 5.5
Sin caché $140 $220 $440

Aquí el precio de salida domina: Grok 4.7 cuesta aproximadamente el 64% de Sol y el 32% de Opus 5.5.

Ambas tablas asumen que cada modelo gasta el mismo número de tokens, y no lo hacen. Los propios datos de CursorBench de SpaceXAI muestran que Grok 4.7 promedia 70,141 tokens de salida por tarea en xhigh y 15,677 en low. Un modelo que necesita el doble de tokens pierde su ventaja de precio. El costo por tarea completada en tus prompts decide esto; nuestro análisis de la guerra de precios de modelos de IA explica por qué los proveedores comenzaron a publicar esa métrica.

A cuál enrutar

Comienza por la carga de trabajo, luego prueba:

Muchos equipos ejecutarán dos de estos detrás de un enrutador: uno predeterminado barato y una ruta de escalada cara para las tareas que fallen.

Prueba los tres en un proyecto de Apidog

La comparación que importa son tus prompts en tu propio arnés. Apidog lo convierte en una prueba guardada en lugar de un proyecto de fin de semana:

  1. Crea tres entornos, uno por proveedor, cada uno con base_url, la clave API como secreto y model. Grok 4.7 y GPT-6 Sol usan la API de Respuestas (POST {{base_url}}/responses con un campo input), por lo que una definición de solicitud cubre ambos. Opus 5.5 usa la API de Mensajes de Anthropic (POST /v1/messages con messages, un max_tokens requerido y los encabezados x-api-key y anthropic-version), así que asígnale su propia solicitud.
  2. Usa el mismo texto de prompt en cada solicitud, extraído de una variable compartida para que no varíe.
  3. Añade aserciones para el estado 200, una respuesta no vacía y la presencia de usage.input_tokens y usage.output_tokens.
  4. Ejecútalos como un escenario de prueba y compara el tiempo de respuesta, el recuento de tokens y la salida lado a lado. Multiplica los tokens por las filas de precios anteriores para obtener el costo por ejecución en tu tarea.

Ejecútalo al nivel de esfuerzo con el que lo lanzarías, no al que aparece en el gráfico del benchmark. Descarga Apidog para construirlo.

Preguntas frecuentes

Decide con tus propios números

Elige los dos modelos que tu carga de trabajo señale, guarda el mismo prompt contra ambos en Apidog y ejecútalo a tu nivel de esfuerzo de producción. Compara el costo por tarea completada y la latencia, luego enruta. Cuando llegue el siguiente modelo, añade un entorno y vuelve a ejecutar.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs