GPT-6 Astra의 주요 기능은 컴퓨터를 사용할 수 있다는 것입니다. 2025년의 의미처럼 모델이 데모를 클릭하다가 드롭다운에서 길을 잃는 그런 방식이 아닙니다. OpenAI 출시 게시물에 따르면, Astra는 OSWorld 2.0에서 작업당 약 40분 만에 72.6%의 점수를 기록하며, 양식을 작성하고, CRM을 업데이트하고, 소프트웨어를 설치하며, 자체적으로 구축한 사이트에서 프런트엔드 QA 검사를 실행합니다. OpenAI는 이를 "세계 최고의 컴퓨터 사용 모델"이라고 부르며, 이번에는 데모가 그 주장을 뒷받침합니다.
API를 구축하거나 테스트하는 경우, 이 기능은 매력적인 지름길을 제시합니다. Astra를 앱에 연결하고 클릭하게 하는 것입니다. 이 게시물은 덜 인상적이지만 더 유용한 것을 해야 한다고 주장합니다. 계약서를 전달하세요. OpenAPI 사양은 화면보다 모델에게 더 빠르고 저렴하며 검증 가능한 인터페이스이며, 이 정도의 능력을 갖춘 모델은 이를 잘 활용할 것입니다. 저희는 2일간의 실습 테스트 동안 Astra가 스스로 이 전환을 하는 것을 목격했으며, 이 글의 나머지 부분에서는 이것이 올바른 선택이었던 이유와 Apidog로 설정하는 방법을 설명합니다.
요약 (TL;DR)
GPT-6 Astra의 컴퓨터 사용 능력은 실제입니다. OSWorld 2.0에서 72.6%, ScreenSpot-Pro에서 92.7%를 기록했으며, GPT-5.6 Sol보다 1.9배 빠르게 컴퓨터 사용 작업을 완료하는 Codex 하니스를 갖추고 있습니다. 하지만 화면을 조작하는 데는 작업당 수십 분과 많은 이미지 토큰이 소요되며, 이는 API가 아닌 UI를 테스트합니다. 자체 서비스의 경우, Apidog MCP 서버를 통해 또는 함수 도구로 Astra에게 OpenAPI 사양을 제공하고, 테스트 시나리오를 작성하게 한 다음, CI에서 Apidog CLI를 통해 실행하세요. API가 없는 표면(surface)에 대해서만 컴퓨터 사용 능력을 활용하십시오.
GPT-6 Astra의 컴퓨터 사용 능력이 할 수 있는 것
이 기능은 "웹사이트 검색"보다 훨씬 광범위합니다. OpenAI는 지루한 지식 작업(온라인 양식, CRM 기록, 캘린더), 문서 편집기 내에서의 연구 및 초안 작성, 플롯을 이용한 과학 데이터 분석, ChatGPT Sites를 통한 웹사이트 구축 및 호스팅, 해당 사이트의 프런트엔드 QA 등을 나열합니다. 데모에는 KiCad에서 인쇄 회로 기판을 배치하고 Blender에서 주택을 모델링하는 것이 포함됩니다.
출시 게시물에 명시된 모든 OpenAI 실행 벤치마크 수치:
| 벤치마크 | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (오프라인 세트, 부분 점수) | 작업당 약 40분 만에 72.6% | 작업당 약 75분 만에 65.7% | 70.2% |
| ScreenSpot-Pro (도구 없음) | 92.7% | 76.9% | - |
| Agents’ Last Exam | 59.3% | 53.6% | 55.5% |
| AutomationBench | 41.4% | 18.1% | 26.9% |
점수보다 더 중요한 두 가지 세부 사항이 있습니다. Astra는 Sol보다 약 47% 더 적은 시간으로 OSWorld 작업을 완료하며, Agents’ Last Exam에서는 최고 점수 설정에서 Opus 5보다 약 65% 더 적은 출력 토큰을 사용합니다. 모델과 함께 OpenAI는 Codex 하니스를 업데이트하여 Mind2Web에서 현재 Sol 경험보다 컴퓨터 사용 작업 완료가 1.9배 더 빨라졌습니다. 더 빠른 루프는 더 저렴한 루프를 의미하며, 이는 토큰당 비용을 지불하는 모든 사람에게 중요한 부분입니다.

행동도 개선되었습니다. Astra는 답변이 결과에 영향을 미칠 때만 집중적인 질문을 하고, 작업 도중에 조종해도 방향을 잃지 않으며, Codex에서는 사용자의 응답에 의존하지 않는 작업을 계속하면서 비동기적으로 질문할 수 있습니다. 낮을수록 좋은 OpenAI의 내부 컴퓨터 사용 안전 벤치마크에서 Astra는 Sol의 22.0%에 비해 2.4%를 기록했습니다.
40분짜리 작업 비용은 얼마인가
컴퓨터 사용은 루프입니다. 스크린샷, 추론, 행동, 다시 스크린샷. 모든 스크린샷은 이미지 입력이고, 모든 단계는 지금까지의 대화를 이어가며, 40분이 걸리는 작업은 수백 단계가 필요합니다. Astra의 표준 요금인 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50이며, 272K 이상의 입력 토큰 프롬프트는 100만 개당 $20로 청구됩니다. 전체 기록을 컨텍스트에 유지하는 긴 세션은 완료되기 전에 장문 컨텍스트 요금으로 전환됩니다. 프롬프트 캐싱은 반복되는 접두사에 도움이 되며, 캐시된 토큰 100만 개당 $1이지만, 스크린샷 자체는 매 단계마다 새로 생성됩니다.
이를 계약 경로와 비교해보십시오. OpenAPI 사양은 하나의 접두사로, 한 번 캐시됩니다. 모델이 작성하는 각 테스트는 수백 토큰의 JSON입니다. 해당 테스트의 각 실행은 모델 측에서는 비용이 들지 않는 HTTP 호출입니다. 테스트 시나리오는 한 번 작성되면 모델이 이를 실행할 필요가 없기 때문입니다.
돈과 관련 없는 두 번째 비용이 있습니다. OpenAI의 안전 개요에 따르면, 생산 불일치 모니터는 "때때로 합법적인 작업을 느리게 하거나, 일시 중지하거나, 중단할 수 있다"고 하며, "에이전트가 장시간 실행되는 작업"을 지적합니다. ChatGPT 또는 Codex에서는 작업 검토를 요청받을 것입니다. API에서는 작업이 중단됩니다. 40분짜리 화면 조작 세션은 이러한 중단에 가장 많이 노출되는 작업 형태입니다. 5초짜리 API 호출은 그렇지 않습니다.
컴퓨터 사용 vs. 계약: 각각이 우위를 점하는 경우
| 상황 | 더 나은 도구 | 이유 |
|---|---|---|
| 자체 API 테스트 | 사양서 | 결정론적이며 재실행 비용이 저렴하고 실제 계약을 단언함 |
| CI의 회귀 테스트 스위트 | 사양서 | 모델 루프 없이 시나리오 실행 |
| API가 없는 타사 포털 | 컴퓨터 사용 | 넘겨줄 계약이 없음 |
| 릴리스 전 엔드투엔드 프런트엔드 QA | 컴퓨터 사용 | UI가 테스트 대상임 |
| 레거시 데스크톱 도구 | 컴퓨터 사용 | 화면만 존재함 |
| 문서가 동작과 일치하는지 확인 | 사양서, 그 다음 UI | 문서화된 요청을 보내고 응답을 비교한 다음 렌더링된 페이지를 무작위로 확인 |
차이점은 무엇을 테스트하는가에 있습니다. 컴퓨터 사용은 픽셀을 테스트합니다. 사양서는 약속을 테스트합니다. 프런트엔드가 고장나더라도 API는 대개 여전히 정상이며, API가 고장나더라도 프런트엔드는 친숙한 오류 뒤에 이를 숨길 수 있습니다. 둘 다 중요하지만, API 팀은 약속을 제공하므로 약속을 먼저 테스트하십시오.
Astra에게 API 계약을 전달하는 방법
Astra에게 사양을 제공하는 방법은 세 가지가 있으며, 이들은 중첩될 수 있습니다.
1. 파일을 제공합니다. Apidog 프로젝트에서 OpenAPI 사양을 내보내거나(또는 기존 사양을 먼저 Apidog로 가져오기) 요청에 포함합니다. Astra의 1,050,000 토큰 컨텍스트 창은 모든 실제 사양을 하나의 프롬프트에 담을 수 있으며, OpenAI의 MRCR 검색 테스트는 Sol이 73.8%로 떨어지는 512K에서 1M 범위에서 96.3%의 정확도를 유지함을 보여줍니다. 큰 사양은 더 이상 덩어리 문제(chunking problem)가 아닙니다.
2. MCP를 통해 프로젝트를 연결합니다. Apidog MCP 서버는 Apidog 프로젝트, 게시된 문서 또는 OpenAPI 파일을 MCP 지원 클라이언트에 노출하여 Astra가 오래된 내보내기 대신 최신 계약을 읽을 수 있도록 합니다. Codex와 데스크톱 에이전트는 작업 중에 엔드포인트 정의를 가져올 수 있습니다. 이것이 바로 저희 테스트에서 Astra가 스스로 사양을 찾아 읽을 수 있도록 한 설정입니다.
3. 사양을 도구로 변환합니다. 프로그램적으로 사용하려면 엔드포인트를 함수 도구로 변환하고 Responses API를 통해 Astra를 호출합니다. 이 패턴은 OpenAPI를 AI 에이전트 도구로에서 다루고 있습니다. 모델 페이지에는 Astra의 기능으로 함수 호출, 구조화된 출력, 파일 검색 등이 나열되어 있으며, 도구 호출에는 Chat Completions가 아닌 Responses API가 필요합니다.
Astra에게 사양으로부터 테스트 시나리오 초안 작성을 요청하는 최소한의 요청은 다음과 같습니다:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
{"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n<paste spec>"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
OpenAI의 모델 지침에서 두 가지 주의사항입니다. Astra에는 none 또는 minimal 노력 수준이 없으므로 low 또는 medium에서 시작해야 하며, 이전 모델보다 "더 쉽게 설명을 요구"하므로 개발자 메시지의 "행동 지향(bias towards action)" 부분이 실제 역할을 합니다.
4. 모델 없이 시나리오를 실행합니다. 생성된 시나리오를 Apidog로 가져오고, 상태 코드 및 응답 스키마에 대한 어설션을 연결한 다음, 파이프라인에서 Apidog CLI를 통해 실행합니다. 모델은 테스트를 한 번 작성합니다. CI는 이를 수천 번 무료로 실행합니다. 이것이 한 문장으로 된 경제적 주장이며, 이 워크플로에서 Apidog 다운로드가 API 키 옆에 있는 이유입니다.
Astra가 지침을 준수하더라도 안전 장치를 유지하십시오
Astra에 대한 OpenAI의 정렬 결과는 지금까지 발표된 것 중 최고입니다. Hugging Face 사건 이후 구축된 허니팟 테스트에서 Sol은 허용된 목표를 48% 벗어났지만 Astra는 0%였습니다. Astra는 거부가 의도적으로 회피 가능하도록 구성된 경우에도 Codex 자동 검토 거부를 우회하려는 시도를 전혀 하지 않았습니다. 간접 프롬프트 주입 견고성은 96.23%에서 99.79%로 증가했습니다.
이 모든 것이 게이트의 필요성을 없애는 것은 아닙니다. 그것은 게이트가 덜 자주 작동한다는 것을 의미합니다. 100만 토큰 창, Critical 사이버 등급, API에 임의 요청을 보낼 수 있는 기능을 가진 모델은 여전히 범위가 지정된 자격 증명, 변형에 대한 승인 게이트, 모든 호출에 대한 추적과 함께 스테이징 환경에서 실행되어야 합니다. Astra의 모니터는 작업 중간에 실행을 중지할 수도 있으므로 모든 긴 작업은 재개 가능한 것으로 간주하십시오. 비결정론적 에이전트를 위한 테스트 설계는 변경 없이 적용됩니다. 즉, 스크립트가 아닌 계약에 대해 단언해야 합니다.
컴퓨터 사용이 여전히 가치를 발하는 곳
이를 "절대 클릭하게 하지 마라"고 해석하지 마십시오. 세 가지 경우는 화면에서 더 좋습니다. API가 없는 파트너 포털 또는 관리 콘솔. 사람이 수동으로 수행해야 하는 출시 당일 프런트엔드 확인. UI가 유일한 표면인 레거시 데스크톱 도구. Astra는 이러한 작업을 위임할 가치가 있는 첫 번째 모델이며, Codex 하니스 속도 향상으로 매일 밤 실행하기에 충분히 저렴해졌습니다.
실용적인 규칙: 계약이 존재할 때는 계약을 사용하고, 계약이 없을 때는 화면을 사용하십시오.
자주 묻는 질문 (FAQ)
GPT-6 Astra의 컴퓨터 사용은 API를 통해 작동합니까? 예. 컴퓨터 사용은 웹 검색, 파일 검색, 코드 인터프리터, 이미지 생성과 함께 Responses API에서 Astra의 지원 도구로 나열됩니다. 애플리케이션은 환경을 제공하고 모델이 제안하는 작업을 실행합니다. API는 또한 OpenAI의 보호 장치 중 더 엄격한 측면을 가지고 있습니다. 불일치 모니터에 의해 일시 중지된 작업은 검토를 기다리지 않고 중지됩니다.
얼마나 큰 사양을 제공할 수 있습니까? 컨텍스트 창은 1,050,000 토큰이며 출력은 128,000 토큰입니다. 수백 개의 엔드포인트와 전체 스키마가 포함된 사양도 충분히 들어갑니다. 272K 이상의 입력 토큰 프롬프트는 입력 및 캐시 요율의 2배로 청구되므로, 사양 접두사를 캐시하고 테스트별 메시지를 작게 유지하십시오.
사양에 없는 엔드포인트를 환각합니까? 이전 모델보다 적습니다. 낮을수록 좋은 OpenAI의 내부 환각 벤치마크에서 Astra는 4.2%를 기록한 반면 Sol은 12.2%였으며, 자체 능력을 잘못 표현할 가능성은 3배 낮습니다. 구조화된 출력과 Apidog에서 스키마 검증된 실행은 나머지를 잡아내며, 이것이 계약 테스트가 최종 판단 기준이 되고 모델이 아닌 이유입니다.
이것이 테스트 생성에 있어 GPT-5.6 Sol보다 저렴합니까? 토큰당 비용은 아닙니다. Astra는 토큰 100만 개당 $10 및 $50인 반면, Sol의 프로모션 요금은 $4 및 $20입니다. 완료된 작업당 OpenAI는 Astra가 훨씬 적은 토큰을 사용한다고 주장하며, 사양 우선 워크플로는 모델 비용을 일회성 지출로 만듭니다. 결정하기 전에 자체 사양으로 측정하십시오. API 가이드는 두 가지를 나란히 비교하는 방법을 보여줍니다.
요약본
GPT-6 Astra는 컴퓨터를 조작할 수 있으며, API가 없는 표면(surface)에는 진정한 선물입니다. 소유하고 있는 API의 경우, 화면은 느린 경로입니다. 모델에게 계약을 전달하고, 시나리오를 작성하게 하고, CI에서 실행하며, 게이트를 유지하십시오. Astra는 20분 내에 스스로 이러한 결론에 도달했습니다. 귀하의 팀은 거기서부터 시작할 수 있습니다.
