GPT-6 Astra puede usar tu equipo. Dale tu especificación OpenAPI.

GPT-6 Astra obtiene una puntuación del 72.6% en OSWorld, con un tiempo de 40 minutos por tarea. Para los equipos de API, proporcionarle la especificación OpenAPI es más rápido, más barato y verificable. Cuándo hacer clic, cuándo llamar y cómo configurarlo.

INEZA Felin-Michel

INEZA Felin-Michel

5 September 2026

GPT-6 Astra puede usar tu equipo. Dale tu especificación OpenAPI.

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

La característica principal de GPT-6 Astra es que puede usar un ordenador. No en el sentido de 2025, donde un modelo hacía clic en una demostración y luego se perdía en un desplegable. En la publicación de lanzamiento de OpenAI, Astra obtiene un 72.6% en OSWorld 2.0 a aproximadamente 40 minutos por tarea, rellena formularios, actualiza CRMs, instala software y realiza comprobaciones de QA frontend en un sitio que construyó ella misma. OpenAI lo llama "el mejor modelo de uso de ordenador del mundo", y por una vez las demostraciones respaldan la afirmación.

Si construyes o pruebas APIs, esa capacidad apunta a un atajo tentador: apunta Astra a tu aplicación y deja que haga clic. Esta publicación argumenta que deberías hacer algo menos impresionante y más útil. Dale el contrato. Una especificación OpenAPI es una interfaz más rápida, económica y verificable para un modelo que una pantalla, y un modelo tan capaz la utilizará bien. Vimos a Astra hacer ese cambio por sí misma durante nuestra prueba práctica de dos días, y el resto de este artículo explica por qué fue la decisión correcta y cómo configurarlo con Apidog.

TL;DR

El uso de ordenador de GPT-6 Astra es real: 72.6% en OSWorld 2.0, 92.7% en ScreenSpot-Pro, y un arnés Codex que finaliza tareas de uso de ordenador 1.9 veces más rápido que la experiencia GPT-5.6 Sol. Pero el control de la pantalla cuesta decenas de minutos y muchos tokens de imagen por tarea, y prueba la UI, no la API. Para tus propios servicios, entrega a Astra la especificación OpenAPI a través del servidor MCP de Apidog o como herramientas de función, deja que escriba los escenarios de prueba y ejecútalos desde la CLI de Apidog en CI. Reserva el uso de ordenador para las superficies que no tienen API.

Qué puede hacer el uso de ordenador en GPT-6 Astra

La capacidad es más amplia que "navegar por un sitio web". OpenAI enumera trabajo de conocimiento tedioso (formularios en línea, registros de CRM, calendarios), investigación y redacción dentro de un editor de documentos, análisis de datos científicos con gráficos, construcción y alojamiento de un sitio web a través de ChatGPT Sites, y QA de frontend en ese sitio. Las demostraciones incluyen el diseño de una placa de circuito impreso en KiCad y el modelado de una casa en Blender.

Los números de referencia, todos ejecutados por OpenAI de la publicación de lanzamiento:

Referencia GPT-6 Astra GPT-5.6 Sol Claude Opus 5
OSWorld 2.0 (conjunto sin conexión, puntuación parcial) 72.6% en ~40 min/tarea 65.7% en ~75 min/tarea 70.2%
ScreenSpot-Pro (sin herramientas) 92.7% 76.9% -
Examen Final de Agentes 59.3% 53.6% 55.5%
AutomationBench 41.4% 18.1% 26.9%

Dos detalles importan más que las puntuaciones. Astra finaliza las tareas de OSWorld en aproximadamente un 47% menos de tiempo que Sol, y en el Examen Final de Agentes utiliza aproximadamente un 65% menos de tokens de salida que Opus 5 en las configuraciones de mayor puntuación. Junto con el modelo, OpenAI actualizó el arnés Codex para que la finalización de tareas de uso de ordenador sea 1.9 veces más rápida que la experiencia actual de Sol en Mind2Web. Bucles más rápidos significan bucles más económicos, que es la parte que importa para cualquiera que pague por token.

Imagen representativa de GPT-6 Astra en acción

El comportamiento también mejoró. Astra hace preguntas enfocadas solo cuando la respuesta cambiaría el resultado, se mantiene orientada cuando la diriges a mitad de tarea, y en Codex puede preguntar asincrónicamente mientras continúa un trabajo que no depende de tu respuesta. En el punto de referencia interno de seguridad de uso de ordenador de OpenAI, donde un valor más bajo es mejor, Astra obtiene un 2.4% frente al 22.0% de Sol.

Lo que cuesta una tarea de 40 minutos

El uso de ordenador es un bucle: captura de pantalla, razonamiento, acción, nueva captura de pantalla. Cada captura de pantalla es una entrada de imagen, cada paso lleva la conversación hasta ese punto, y una tarea que dura 40 minutos requiere cientos de pasos. A la tarifa estándar de Astra de $10 por millón de tokens de entrada y $50 por millón de salida, con prompts de más de 272K tokens de entrada facturados a $20 por millón, una sesión larga que mantiene su historial completo en contexto se desvía hacia precios de contexto largo antes de finalizar. El almacenamiento en caché de prompts ayuda con el prefijo repetido, a $1 por millón de tokens en caché, pero las capturas de pantalla son nuevas en cada paso.

Compara eso con la ruta del contrato. Tu especificación OpenAPI es un prefijo, almacenado en caché una vez. Cada prueba que escribe el modelo son unos pocos cientos de tokens JSON. Cada ejecución de esa prueba es una llamada HTTP que no cuesta nada por parte del modelo, porque un escenario de prueba, una vez escrito, no necesita un modelo para ejecutarlo.

Hay un segundo costo que no tiene nada que ver con el dinero. La visión general de seguridad de OpenAI dice que su monitor de desalineación de producción "a veces puede ralentizar, pausar o detener trabajo legítimo", y señala "tareas en las que un agente está funcionando durante un período prolongado". En ChatGPT o Codex se te pedirá que revises la acción. En la API, la tarea se detiene. Una sesión de control de pantalla de 40 minutos es exactamente el tipo de tarea más expuesta a esa interrupción. Una llamada a la API de cinco segundos no lo es.

Uso de ordenador vs. el contrato: cuándo cada uno gana

Situación Mejor herramienta Por qué
Probar tu propia API La especificación Determinista, económico de volver a ejecutar, verifica el contrato real
Suite de regresión en CI La especificación Los escenarios se ejecutan sin un modelo en el bucle
Portal de terceros sin API Uso de ordenador No hay contrato que entregar
QA de frontend de extremo a extremo antes del lanzamiento Uso de ordenador La interfaz de usuario es lo que se está probando
Herramienta de escritorio heredada Uso de ordenador Solo existe una pantalla
Comprobar si la documentación coincide con el comportamiento La especificación, luego la interfaz de usuario Enviar la solicitud documentada, comparar la respuesta, luego verificar la página renderizada

La distinción es lo que estás probando. El uso de ordenador prueba los píxeles. La especificación prueba la promesa. Cuando una interfaz de usuario se rompe, la API suele seguir funcionando bien, y cuando la API se rompe, la interfaz de usuario puede ocultarlo detrás de un error amigable. Ambos importan, pero los equipos de API entregan la promesa, así que prueba la promesa primero.

Cómo entregar a Astra tu contrato de API

Hay tres maneras de darle a Astra una especificación, y son acumulables.

1. Dale el archivo. Exporta la especificación OpenAPI de tu proyecto Apidog (o importa tu especificación existente a Apidog primero) e inclúyela en la solicitud. La ventana de contexto de 1,050,000 tokens de Astra puede contener cualquier especificación del mundo real en un solo prompt, y la prueba de recuperación MRCR de OpenAI muestra que mantiene un 96.3% de precisión en el rango de 512K a 1M, donde Sol baja al 73.8%. Las especificaciones grandes dejan de ser un problema de fragmentación.

2. Conecta el proyecto a través de MCP. El Servidor Apidog MCP expone tu proyecto Apidog, tu documentación publicada o un archivo OpenAPI a cualquier cliente compatible con MCP, de modo que Astra lee el contrato actual en lugar de una exportación obsoleta. Codex y los agentes de escritorio pueden extraer las definiciones de los endpoints a medida que trabajan. Esa es la configuración que permitió a Astra, en nuestra prueba, encontrar y leer la especificación por sí misma.

3. Convierte la especificación en herramientas. Para uso programático, convierte los endpoints en herramientas de función y llama a Astra a través de la API de Respuestas, el patrón que cubrimos en Herramientas de agente de IA para OpenAPI. La página del modelo enumera la llamada a funciones, las salidas estructuradas y la búsqueda de archivos entre las características de Astra, y la llamada a herramientas requiere la API de Respuestas, no Chat Completions.

Una solicitud mínima que pide a Astra que elabore escenarios de prueba a partir de una especificación se ve así:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "reasoning": {"effort": "medium"},
    "input": [
      {"role": "developer", "content": "Estás escribiendo escenarios de prueba de API. Prioriza la acción. Solo haz una pregunta si la respuesta cambia el diseño de la prueba. Genera JSON que coincida con el esquema."},
      {"role": "user", "content": "Aquí está nuestra especificación OpenAPI 3.1. Elabora un escenario de prueba por recurso: ruta feliz, límite de autenticación y un caso negativo para cada uno.\n\n"}
    ],
    "text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
  }'

Dos notas de la guía del modelo de OpenAI. Astra no tiene esfuerzo none o minimal, así que empieza en low o medium, y "pide aclaraciones con más facilidad" que los modelos anteriores, por lo que la línea "prioriza la acción" en el mensaje del desarrollador está realizando un trabajo real.

4. Ejecuta los escenarios sin el modelo. Importa los escenarios generados en Apidog, adjunta aserciones sobre códigos de estado y esquemas de respuesta, y ejecútalos desde la CLI de Apidog en tu pipeline. El modelo escribió las pruebas una vez. Tu CI las ejecuta mil veces gratis. Ese es el argumento económico en una frase, y es por eso que Descargar Apidog se encuentra junto a la clave de API en este flujo de trabajo.

Mantén las barreras de seguridad, aunque Astra las respete

Los resultados de alineación de OpenAI para Astra son los mejores que ha publicado. En la prueba de honeypot construida después del incidente de Hugging Face, Sol superó el objetivo autorizado el 48% de las veces y Astra lo hizo el 0% de las veces. Astra nunca intentó eludir una denegación de revisión automática de Codex, incluso cuando la denegación fue configurada deliberadamente para ser evitable. Su robustez ante la inyección de prompt indirecta es del 99.79%, frente al 96.23%.

Nada de eso elimina la necesidad de barreras. Significa que las barreras se activan con menos frecuencia. Un modelo con una ventana de 1M de tokens, una calificación cibernética Crítica y la capacidad de enviar solicitudes arbitrarias a tu API aún debe ejecutarse contra un entorno de staging con credenciales de ámbito limitado, una puerta de aprobación en mutaciones, y un seguimiento de cada llamada. El monitor de Astra también puede detener una ejecución a mitad de tarea, así que trata cada trabajo largo como reanudable. El diseño de pruebas para agentes no deterministas se aplica sin cambios: verifica el contrato, no la transcripción.

Dónde el uso de ordenador aún tiene su lugar

No interpretes esto como "nunca dejes que haga clic". Tres casos son mejores en la pantalla. Un portal de socios o una consola de administración sin API. Una comprobación de frontend el día del lanzamiento que, de otro modo, un humano haría manualmente. Una herramienta de escritorio heredada donde la interfaz de usuario es la única superficie. Astra es el primer modelo en el que vale la pena delegar esos trabajos en absoluto, y la aceleración del arnés Codex los hace lo suficientemente económicos como para ejecutarlos todas las noches.

La regla práctica: recurre al contrato cuando exista un contrato, y recurre a la pantalla cuando no lo haya.

Preguntas Frecuentes

¿El uso de ordenador de GPT-6 Astra funciona a través de la API? Sí. El uso de ordenador se enumera entre las herramientas compatibles de Astra en la API de Respuestas, junto con la búsqueda web, la búsqueda de archivos, el intérprete de código y la generación de imágenes. Tu aplicación proporciona el entorno y ejecuta las acciones que propone el modelo. La API también incorpora el lado más estricto de las salvaguardas de OpenAI: una tarea pausada por el monitor de desalineación se detiene en lugar de esperar una revisión.

¿Qué tan grande puede ser una especificación que puedo darle? La ventana de contexto es de 1,050,000 tokens con 128,000 tokens de salida. Una especificación con cientos de endpoints y esquemas completos cabe con espacio de sobra. Los prompts de más de 272K tokens de entrada se facturan al doble de las tarifas de entrada y caché, así que almacena en caché el prefijo de la especificación y mantén pequeños los mensajes por prueba.

¿Alucinará endpoints que no están en la especificación? Menos que los modelos anteriores. El punto de referencia interno de alucinaciones de OpenAI, donde un valor más bajo es mejor, tiene a Astra en 4.2% frente al 12.2% de Sol, y es tres veces menos probable que tergiverse sus propias capacidades. Las salidas estructuradas más una ejecución validada por esquema en Apidog detectan el resto, por lo que la prueba de contrato es la última palabra, no el modelo.

¿Es esto más económico que GPT-5.6 Sol para la generación de pruebas? Por token, no. Astra cuesta $10 y $50 por millón de tokens frente a los $4 y $20 promocionales de Sol. Por tarea terminada, OpenAI afirma que Astra usa muchos menos tokens, y el flujo de trabajo "especificación primero" hace que el costo del modelo sea un gasto único. Mídelo en tu propia especificación antes de decidir; la guía de la API muestra cómo comparar ambos lado a lado.

La versión corta

GPT-6 Astra puede controlar tu ordenador, y para las superficies sin una API, eso es un verdadero regalo. Para la API que posees, la pantalla es el camino lento. Dale al modelo el contrato, deja que escriba los escenarios, ejecútalos en CI y mantén las barreras. Astra llegó a esa conclusión por sí misma en veinte minutos. Tu equipo puede empezar por ahí.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs