Para llamar a la API GPT-6.1 Sol, envía una solicitud POST a https://api.openai.com/v1/responses con "model": "gpt-6.1-sol" y tu clave como token Bearer. Conserva el mismo precio de $2 de entrada y $10 de salida por millón de tokens que GPT-6 Sol, y la entrada en caché baja de $0.20 a $0.10. La migración de gpt-6-sol es principalmente un intercambio de cadenas. El cambio disruptivo es el esfuerzo: GPT-6.1 Sol no acepta none ni minimal, por lo que esas solicitudes se mueven a low, junto con cualquier código que dependiera de none.
OpenAI lanzó GPT-6.1 Sol en el DevDay el 29 de septiembre de 2026. El resumen del DevDay 2026 cubre los otros lanzamientos, y qué es GPT-6.1 Sol cubre los benchmarks en profundidad. Esta guía cubre tu primera solicitud, el nivel de esfuerzo por el que empezar, cada cambio de migración, los niveles Batch, Flex y Fast, y una ejecución de regresión comparativa de ambos IDs de modelo en Apidog antes de cambiar el tráfico de producción.
GPT-6 Sol vs GPT-6.1 Sol: qué cambia en la API
La mayor parte de la especificación es idéntica. Aquí está la diferencia completa de la página del modelo GPT-6.1 Sol, la página del modelo GPT-6 Sol y la guía de migración de GPT-6 de OpenAI:
gpt-6-sol |
gpt-6.1-sol |
Qué hacer | |
|---|---|---|---|
| Entrada / salida por 1M (Estándar) | $2 / $10 | $2 / $10 | Nada |
| Entrada en caché por 1M | $0.20 | $0.10 | Vuelve a calcular la caché |
| Escrituras en caché por 1M | $2.50 | $2.50 | Nada |
| Ventana de contexto / entrada máxima / salida máxima | 1,050,000 / 922,000 / 128,000 | 1,050,000 / 922,000 / 128,000 | Nada |
| Fecha de corte del conocimiento | 20 de abril de 2026 | 30 de abril de 2026 | Vuelve a revisar las evaluaciones sensibles a la fecha |
reasoning.effort |
none, low, medium (predeterminado), high, xhigh, max |
low, medium (predeterminado), high, xhigh, max |
Mueve none a low y reevalúa |
| Llamada a funciones en Chat Completions | Solo con reasoning_effort: "none" |
No compatible | Mueve las llamadas a herramientas a Responses |
| Endpoints | Chat Completions, Responses, Batch | Igual | Nada |
| Límites de tarifa | Nivel 1: 500 RPM / 500K TPM; Nivel 5: 15,000 RPM / 40M TPM | Igual | Nada |
La página de GPT-6 Sol ahora redirige a los lectores a GPT-6.1 Sol como "el modelo Sol más nuevo".
Envía tu primera solicitud a GPT-6.1 Sol
Exporta tu clave como OPENAI_API_KEY, luego llama a la API de Responses:
curl https://api.openai.com/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "gpt-6.1-sol",
"reasoning": {"effort": "medium"},
"input": "List three ways a webhook retry policy can create duplicate orders. One line each."
}'
El SDK de Python lee la misma variable de entorno:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "medium"},
input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)
Cuatro partes de la respuesta importan:
statusescompletedsi tiene éxito. Si el modelo se queda sin presupuesto de salida, obtendrásincompleteconincomplete_details.reasonestablecido enmax_output_tokens, a veces antes de cualquier texto visible. La guía de razonamiento sugiere reservar al menos 25,000 tokens para el razonamiento y la salida mientras experimentas.outputes un array. La respuesta es el elemento contype: "message", cuyo contenido contieneoutput_text. Léelo por tipo, no por índice.usage.output_tokensincluye tokens de razonamiento, facturados a la tarifa de salida.usage.output_tokens_details.reasoning_tokensmuestra cuántos.usage.input_tokens_detailsinformacached_tokensycache_write_tokens. Ahí es donde la caché más barata se hace evidente.
Usa la API de Responses para cualquier cosa con herramientas; GPT-6.1 Sol solo admite Chat Completions para solicitudes sin herramientas. La guía de la API de Responses cubre la forma de la solicitud con más detalle.
Elige un nivel de esfuerzo de razonamiento
El esfuerzo es tu principal control de costo y calidad, y medium es el predeterminado si lo omites. La guía de selección de modelos de OpenAI asocia medium con "trabajo técnico complejo y entregables coordinados que esperas revisar", y xhigh con entregables pulidos y decisiones construidas a partir de evidencia conflictiva. La publicación de lanzamiento de OpenAI añade resultados por configuración. Estos benchmarks son reportados por OpenAI, y la tabla cita las diferencias que OpenAI menciona en su texto:
| Esfuerzo | Empieza aquí para | Lo que OpenAI informa para GPT-6.1 Sol |
|---|---|---|
low |
Chat, extracción, clasificación, cualquier cosa que ejecutaras en none |
En conversaciones marcadas por el usuario, las respuestas con un error factual caen del 11.4% (GPT-6 Sol) al 7.7% |
medium (predeterminado) |
Automatizaciones agénticas y flujos de trabajo de llamada a herramientas | AutomationBench 1.0.6: +2.2 pp sobre Claude Opus 5.5 a aproximadamente un tercio del costo; +4.8 pp sobre GPT-6 Sol en la misma configuración |
high |
Depuración difícil y planificación profunda | Sin afirmación específica de la configuración |
xhigh |
Entregables pulidos y ejecuciones asíncronas largas | Sin afirmación específica de la configuración |
max |
Uso de computadora y tareas de ciencia difíciles | OSWorld 2.0: +7 pp sobre GPT-6 Sol al máximo por menos de la mitad del costo. Terminal-Bench Science 0.1: $5.47 por tarea, vs $23.21 para Opus 5.5 y $23.80 para GPT-6 Astra |
Dos advertencias. El conjunto de factualidad son conversaciones previamente marcadas por errores, no tráfico típico. Y en Terminal-Bench Science, GPT-6 Astra sigue obteniendo la puntuación más alta (68.1%), por lo que OpenAI recomienda Astra para el trabajo científico más difícil.
Para llamadas sensibles a la latencia que usaban none, comienza con low y mide. La guía de razonamiento describe low como un razonamiento eficiente "con un modesto aumento de latencia". Para cambiar el esfuerzo a mitad de la conversación sin romper la caché de prompts, añade un elemento de entrada configuration_update en lugar de cambiar reasoning.effort a nivel de solicitud.
Migrar de gpt-6-sol: cuatro cambios en el código
- Intercambia el ID del modelo. Reemplaza
gpt-6-solporgpt-6.1-sol, y mantenlo en la configuración o en una variable de entorno para que la reversión sea una sola edición. - Rediseña
noneyminimal. Guía de OpenAI: usalowen lugar denone, y comienzaminimalenlowy compara en tareas representativas. En GPT-6 Astra, que tampoco tienenone, enviarlo devuelve HTTP 400, así que corrige esto antes de mover el tráfico. - Elimina los parámetros de muestreo. Cuando el esfuerzo no sea
none, eliminatemperature,top_pytop_logprobs(ylogprobsen Chat Completions). El código que combinabatemperatureconnoneen GPT-6 Sol necesita esto. - Mueve las llamadas a herramientas de Chat Completions a Responses. GPT-6 Sol permitía la llamada a funciones en Chat Completions solo con
reasoning_effort: "none". Esa combinación no tiene equivalente en 6.1 Sol.
Luego, vuelve a ejecutar cualquier cosa que dependa de la actualidad: la fecha de corte se mueve del 20 de abril al 30 de abril de 2026. Si llegaste a Sol desde Astra, la guía de migración de Astra a Sol cubre ese paso anterior.
Precios de Batch, Flex, Fast y entrada en caché
Cada nivel mantiene la estructura de GPT-6 Sol, con la columna de entrada en caché reducida a la mitad. Los precios por 1M de tokens provienen de la página de precios de la API. La página del modelo añade que un prompt de más de 272K tokens de entrada se factura al doble de las tarifas de entrada y caché y 1.5x la salida para la solicitud completa, la misma regla que usa GPT-6 Sol:
| Nivel | Entrada | Entrada en caché | Escrituras en caché | Salida |
|---|---|---|---|---|
| Estándar | $2.00 | $0.10 | $2.50 | $10.00 |
| Por lotes | $1.00 | $0.05 | $1.25 | $5.00 |
| Flex | $1.00 | $0.05 | $1.25 | $5.00 |
| Rápido | $4.00 | $0.20 | $5.00 | $20.00 |
| Estándar, prompt de más de 272K tokens de entrada | $4.00 | $0.20 | $5.00 | $15.00 |
Flex es un service_tier: "flex" por solicitud. Fast es service_tier: "fast", con "priority" aceptado como alias. El modo Fast no está disponible con residencia de datos en la UE. El modo Ultrafast para GPT-6.1 Sol está "próximamente" y actualmente solo está ampliamente disponible para GPT-6 Astra; consulta el modo Ultrafast de OpenAI. Para trabajos nocturnos, la guía de la API Batch de OpenAI explica una ejecución por lotes.
La caché es donde la actualización ahorra dinero. Las lecturas cuestan 0.05x la tasa de entrada en 6.1 Sol frente a 0.1x en GPT-6 Sol, y las escrituras cuestan 1.25x en ambos, según la guía de almacenamiento en caché de prompts. Toma un prompt de sistema de 50,000 tokens reutilizado en 1,000 solicitudes. Una escritura cuesta $0.125 en ambos modelos; las 999 lecturas cuestan $9.99 en GPT-6 Sol y $5.00 en GPT-6.1 Sol. El prefijo mínimo cacheable es de 1,024 tokens visibles, y un prefijo en caché permanece elegible durante al menos 30 minutos después de su última escritura o reutilización. Para la estrategia de punto de interrupción, consulta el almacenamiento en caché de prompts de GPT-6.
Prueba el intercambio en Apidog
No cambies la producción basándote solo en los precios de lista. Envía la misma solicitud guardada a ambos IDs y compara los resultados. En Apidog:
- Crea un entorno con
OPENAI_API_KEY(almacenada como un secreto),MODEL_IDestablecido engpt-6-solyEFFORTestablecido enmedium. - Crea
POST https://api.openai.com/v1/responsescon la cabeceraAuthorization: Bearer {{OPENAI_API_KEY}}y este cuerpo, luego guárdalo:
{
"model": "{{MODEL_ID}}",
"reasoning": {"effort": "{{EFFORT}}"},
"max_output_tokens": 25000,
"input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
}
- Añade aserciones: HTTP 200,
$.statuses igual acompleted,$.output[*].typecontienemessage,$.usage.output_tokenses mayor que 0, y$.usage.output_tokens_details.reasoning_tokensexiste. Luego verifica la forma de la salida de la que depende tu código, como JSON válido con las claves que analizas. - Añade un script de post-procesamiento que convierte el
usageen dólares, usando la división de entrada de la guía de almacenamiento en caché de prompts de OpenAI:
const u = pm.response.json().usage;
const d = u.input_tokens_details || {};
const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");
const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;
const cost = ((u.input_tokens - cached - writes) * 2 + cached * cachedRate
+ writes * 2.5 + u.output_tokens * 10) / 1e6;
console.log(model, "cost per call $", cost.toFixed(5));
- Envía la solicitud, establece
MODEL_IDengpt-6.1-soly vuelve a enviarla. Comparareasoning_tokens,output_tokens, la respuesta y el costo registrado. Si estás reasignando desdenone, ejecuta la línea base ennoney el candidato enlow.
Luego, mueve la solicitud y un puñado de prompts reales a un escenario de prueba y ejecuta el par desde la CLI de Apidog en CI. --env-var anula una variable para una ejecución, por lo que un único escenario cubre ambos modelos:
npm install -g apidog-cli
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6-sol" -r cli,junit
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit
Una aserción fallida detiene el trabajo, y los informes de JUnit te dan ambas ejecuciones una al lado de la otra. Para aserciones sobre salidas que varían de una ejecución a otra, consulta cómo probar agentes de IA no deterministas.
Preguntas frecuentes
¿Es GPT-6.1 Sol más caro que GPT-6 Sol? No. Ambos tienen un precio de $2 de entrada y $10 de salida por 1M de tokens. La entrada en caché de GPT-6.1 Sol es de $0.10 frente a $0.20, por lo que las cargas de trabajo con mucha caché resultan más baratas.
¿Qué debo hacer con reasoning.effort: "none"? GPT-6.1 Sol no soporta ni none ni minimal. Asigna ambos a low, elimina temperature y top_p, y vuelve a ejecutar tus evaluaciones antes de cambiar.
¿Puedo usar GPT-6.1 Sol con Chat Completions? Sí, para solicitudes sin herramientas. La llamada a herramientas requiere la API de Responses.
¿Existe un nivel gratuito de la API de GPT-6.1 Sol? No. Las llamadas a la API se facturan por token desde la primera solicitud. ¿Es GPT-6.1 Sol gratuito? cubre las rutas más económicas.
Siguiente paso
Guarda la primera solicitud, ejecútala en gpt-6-sol con tu esfuerzo actual, luego en gpt-6.1-sol, y compara el usage y la salida en un prompt de tu propio tráfico. Descarga Apidog para mantener ambas ejecuciones como aserciones que puedes volver a ejecutar en CI. ¿Estás considerando Anthropic en su lugar? Consulta GPT-6.1 Sol vs Claude Sonnet 5.5.
