GPT-6 Astra 개발자를 위한: API, 가격, 1M 컨텍스트, GPT-5.6 Sol에서 변경해야 할 점

GPT-6 Astra API 가이드: 모델 ID gpt-6-astra, 긴 컨텍스트 포함 10달러/50달러 요금, 배치 및 고속 모드 요금, 105만 컨텍스트, 5단계 노력 수준, 그리고 GPT-5.6 Sol로부터의 주요 변경 사항.

Medy Evrard

5 September 2026

GPT-6 Astra 개발자를 위한: API, 가격, 1M 컨텍스트, GPT-5.6 Sol에서 변경해야 할 점

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

OpenAI는 2026년 9월 3일 GPT-6 Astra를 일부 제한된 조직에 먼저 출시한 후, 그 다음 며칠에 걸쳐 모든 ChatGPT Plus, Pro, Business, Enterprise 사용자, OpenAI API, Microsoft Azure 및 AWS Bedrock에 출시했습니다. 모델 ID는 gpt-6-astra이며, 1,050,000 토큰의 컨텍스트 창을 가지고 있으며, OpenAI는 이를 "현재까지 소프트웨어 엔지니어링을 위한 최고의 모델"이라고 부릅니다. 또한 OpenAI가 사이버 보안 기능에 대해 'Critical' 등급을 부여한 첫 번째 모델로, 이는 API에서 모델의 동작 방식을 결정합니다.

이것은 실용 가이드입니다. 모델 ID와 엔드포인트, 첫 번째 요청, 5가지 추론 노력 수준, 장문 컨텍스트 및 Fast 모드 요금을 포함한 전체 가격표, GPT-5.6 Sol 통합을 깨뜨리는 변경 사항, 그리고 Sol의 프로모션 요금 대비 2.5배 가격이 충분한 가치를 제공하는지 여부를 다룹니다. 아래 수치에 대한 정보원은 OpenAI 모델 페이지입니다. 사용 경험에 대해서는 2일간의 실습 보고서를 읽어보세요. 이 글은 API에 중점을 둡니다.

요약

GPT-6 Astra 한눈에 보기

항목
모델 ID gpt-6-astra
컨텍스트 창 1,050,000 토큰
최대 출력 128,000 토큰
지식 차단일 2026년 4월 30일
모달리티 입력: 텍스트, 이미지. 출력: 텍스트
엔드포인트 Chat Completions, Responses, Batch
지원되지 않음 Realtime, Assistants, fine-tuning
기능 스트리밍, 구조화된 출력, 함수 호출, 파일 검색, 웹 검색, 프롬프트 캐싱, 이미지 입력
내장 도구 컴퓨터 사용, 웹 검색, 파일 검색, 코드 인터프리터, 이미지 생성
추론 노력 low, medium, high, xhigh, max
속도 제한 (Tier 5) 15,000 RPM, 40,000,000 TPM
또한 이용 가능 Microsoft Azure, AWS Bedrock; OpenRouter에서 openai/gpt-6-astra
데이터 처리 적격 API 고객을 위한 Zero Data Retention

Enterprise 작업 공간에서는 Astra가 기본적으로 비활성화되어 있으며, 관리자가 활성화해야 합니다. ChatGPT에서 Astra 사용량은 기존 구독 허용량에 포함되며, Pro, Business 및 Enterprise 플랜 사용자도 GPT-6 Astra Pro를 받습니다.

첫 번째 요청

Responses API는 기본 인터페이스이며 도구 사용에 필수적입니다. 최소한의 Python 호출은 다음과 같습니다:

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input=[
        {"role": "developer", "content": "You are a senior API engineer. Bias towards action. Ask only when the answer would change the result."},
        {"role": "user", "content": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."},
    ],
)

print(response.output_text)
print(response.usage)

동일한 요청을 curl로:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "reasoning": {"effort": "medium"},
    "input": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."
  }'

Chat Completions는 일반 텍스트에 여전히 작동합니다. 엔드포인트와 메시지 형태를 바꾸고, OpenAI 지침에 따라 제거해야 하는 temperature 또는 top_p 필드를 삭제하세요. 함수 호출이나 내장 도구가 필요한 순간, Responses로 전환하세요. 저희의 Responses API 가이드는 요청 형태를 자세히 다룹니다.

개발자 메시지는 이전보다 더 중요해졌습니다. OpenAI의 모델 지침에 따르면 Astra는 이전 모델보다 "더 쉽게 설명을 요청"하며, 행동 지향적인 태도를 취하도록 지시하는 것을 권장합니다. 또한 "기술(skills) 및 기타 첨부 파일에 포함된 지침에 더 민감"하므로, 충돌 시 사용자 지침이 우선함을 명시하세요. 그리고 기본적으로 목록과 테이블을 선호하므로, 산문(prose)을 원하면 요청해야 합니다.

추론 노력: 5단계, "none" 없음

GPT-5.6은 none부터 max까지 6단계의 노력 수준을 제공했습니다. Astra는 low, medium, high, xhigh, max의 5단계를 제공합니다. OpenAI의 마이그레이션 조언은 간단합니다. 현재 none 또는 minimal을 실행하고 있다면, low로 이동하여 평가하십시오. 다른 모든 설정은 현재 설정을 유지합니다.

이러한 제거는 작업 부하의 저렴한 부분을 변화시킵니다. none의 Luna는 GPT-5.6 제품군에서 빠른 고전적 완료 옵션이었으며, Astra에는 이에 상응하는 것이 없습니다. Astra는 모든 설정에서 추론 모델이므로, 기계적인 작업을 GPT-5.6 Terra 또는 Luna로 라우팅하고 Astra를 어려운 호출에 예약하는 것이 여전히 합리적인 패턴입니다.

다른 한편으로, max는 출시 벤치마크가 실행된 곳("평가 점수는 모든 노력에서 최대")이며, Artificial Analysis가 최대 노력 실행에서 첫 토큰까지 7분 이상의 시간을 측정한 곳입니다. 토큰 예산을 짜기 전에 지연 시간 예산을 짜십시오.

GPT-6 Astra 비용

OpenAI의 가격 페이지에 따르면 백만 토큰당:

계층 입력 캐시된 입력 출력
표준 $10.00 $1.00 $50.00
표준, 장문 컨텍스트 (272K 입력 초과) $20.00 $2.00 $75.00
Batch / Flex $5.00 $0.50 $25.00
Batch, 장문 컨텍스트 $10.00 $1.00 $37.50
Fast 모드 $20.00 $2.00 $100.00
Fast 모드, 장문 컨텍스트 $40.00 $4.00 $150.00

캐시 쓰기는 백만 토큰당 $12.50로 청구됩니다. Fast 모드는 "표준 처리 속도의 최대 2배, 표준 가격의 2배"를 제공합니다.

비교를 위해, 현재 GPT-5.6 제품군:

모델 입력 캐시된 입력 출력
GPT-5.6 Sol (최소 2026년 11월 21일까지 프로모션) $4.00 $0.40 $20.00
GPT-5.6 Terra $2.00 $0.20 $12.00
GPT-5.6 Luna $0.20 $0.02 $1.20

Sol의 정가는 $5와 $30입니다. $4와 $20 요금은 8월 21일부터 시행되었으며, OpenAI는 최소 11월 21일까지 유지될 것이라고 말합니다. 이에 비해 Astra는 입력과 출력 모두에서 2.5배입니다. Sol의 정가에 비해서는 2배와 1.67배입니다.

예시를 들어 설명합니다. 200,000 토큰 코드베이스 스냅샷을 한 번 읽고, 30번의 호출에 걸쳐 캐시된 접두사로 재사용하며, 총 60,000 토큰의 출력을 작성하는 에이전트 실행:

비율은 2.5배로 유지됩니다. OpenAI가 주장하는 바와 여러분이 측정해야 할 것은 Astra가 더 적은 호출과 더 적은 출력 토큰으로 작업을 완료한다는 것입니다. Terminal-Bench 4.0에서 높은 요금에도 불구하고 Sol보다 작업당 비용이 약 9% 낮다고 주장하며, Agents' Last Exam에서는 Claude Opus 5보다 약 65% 적은 출력 토큰을 사용한다고 합니다. 이러한 수치가 여러분의 작업 부하에도 적용된다면, 작업당 청구액은 비슷하게 나올 수 있습니다. 그렇지 않다면 2.5배를 지불하게 됩니다.

두 가지 방법으로 청구액을 낮출 수 있습니다. 272K 임계값에 주의해야 합니다. 이 임계값을 넘는 프롬프트는 입력 및 캐시 요금을 두 배로 늘리므로, 도구 출력을 줄이고 정적 접두사를 캐시하십시오. 그리고 대기 가능한 작업의 경우 Batch가 모든 것을 절반으로 줄여줍니다.

GPT-5.6 Sol에서 마이그레이션: 무엇이 문제인가

OpenAI가 게시한 짧은 목록은 문자 그대로 받아들일 가치가 있습니다.

  1. 샘플링 매개변수가 사라졌습니다. temperature, top_p, top_logprobs를 제거하세요. Chat Completions에서는 logprobs도 제거하고, Responses에서는 message.output_text.logprobsinclude에서 제거하세요. OpenAI의 지침은 API가 이를 무시하는 것에 의존하지 말고 삭제하라는 것이므로, 클라이언트 코드를 grep하세요.
  2. 노력 최소값은 low입니다. none 또는 minimal 설정은 모두 low로 변경됩니다.
  3. 캐시 유지 방식이 변경되었습니다. prompt_cache_retention"30m"으로 설정된 prompt_cache_options.ttl로 교체하세요. GPT-5.6을 위해 설정한 명시적 캐싱 모드는 그 외에는 그대로 유지됩니다.
  4. 도구에는 Responses가 필요합니다. Chat Completions는 텍스트에 지원되지만, 함수 호출 및 내장 도구는 Responses API에 있습니다.
  5. 프롬프트는 여러분의 불확실성을 줄이고 모델의 불확실성을 높이기를 원합니다. 행동 지향적인 문구를 추가하고, 사용자 지침이 기술 파일보다 우선한다고 선언하며, UI에서 산문(prose)을 예상하는 경우 산문을 요청하세요.

목록에 구조화된 출력이나 함수 정의에 영향을 미치는 내용은 없으므로, Sol에서 작동했던 스키마는 Astra에서도 작동합니다. 대부분의 팀이 가장 먼저 알아차리는 행동 변화는 질문 방식입니다. 완료까지 실행되었던 Sol 프롬프트는 이제 명확한 질문과 함께 멈출 수 있습니다. 개발자 메시지에서 미리 답변하면 질문을 멈출 것입니다.

Sol보다 2.5배의 가치가 있는가?

에이전트 및 장문 컨텍스트 작업의 경우, 출시 수치는 그렇다고 말합니다. 아래 모든 수치는 각 모델의 최고 노력을 기준으로 OpenAI가 실행한 것입니다:

벤치마크 GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
Terminal-Bench 4.0 57.9% 37.3% 55.8%
DeepSWE v1.1 74.1% 72.7% 67.4%
FrontierCode 1.1 Extended 64.5% 60.6% 63.6%
내부 데이터베이스 마이그레이션 작업 63.9% 42.7% 57.8%
OSWorld 2.0 72.6% 65.7% -
MRCR v2 8-needle, 512K ~ 1M 96.3% 73.8% -
GPQA Diamond 96.0% 94.6% 93.7%
Humanity's Last Exam (도구 포함) 57.2% - 65.0%

Terminal-Bench 및 데이터베이스 마이그레이션 격차는 개발자에게 중요합니다. 에이전트 터미널 작업에서 Sol보다 20점 높고, 장문 컨텍스트 검색 점수는 1M 창을 명목상이 아닌 사용 가능한 수준으로 만듭니다. DeepSWE 격차는 작으며, Claude Fable 5.1은 Humanity's Last Exam에서 거의 8점 앞서 있으므로 완벽한 압승은 아닙니다. Artificial Analysis의 독립 지수에서 Astra는 202개 모델 중 2위를 차지했습니다. 저희의 Fable 5.1 벤치마크 분석은 비교의 다른 측면을 보여줍니다.

Sol이 제 역할을 하는 곳: 노력 수준이 낮고 2.5배 요금이 지배적인 짧고 대량 호출, 그리고 none 스타일의 지연 시간이 필요한 모든 것. Astra가 제값을 하는 곳: 긴 에이전트 실행, 전체 저장소 컨텍스트, 컴퓨터 사용, 그리고 Sol이 표류하거나 포기하는 실패 모드를 보였던 모든 작업.

배포하기 전에 스왑을 테스트하세요

마이그레이션은 오후에 완료할 수 있을 만큼 작고, 측정할 만큼 중요합니다. Apidog에서 모델 ID를 환경 변수로 유지하여 동일하게 저장된 요청이 gpt-5.6-solgpt-6-astra에 대해 한 번의 스위치로 실행되도록 하세요. usage.input_tokens, usage.output_tokens 및 캐시된 토큰 수에 대한 어설션(assertions)을 추가한 다음, 대표적인 작업 세트를 양쪽에 보내고 총계를 비교하세요. 이는 출시 차트 대신 자체 트래픽으로 2.5배 질문에 답하는 것입니다.

같은 프로젝트에 두 가지 추가 확인 사항이 포함되어야 합니다. temperature를 여전히 포함하는 요청을 보내고 반환되는 내용을 기록하여, 프로덕션에서가 아닌 테스트에서 동작을 학습하세요. 그리고 긴 프롬프트가 272K 입력 토큰 미만인지 확인하세요. 이 선을 넘으면 요금이 소리 없이 두 배가 되기 때문입니다. 이 세트를 회귀 테스트로 예약하고, 아직 없다면 Apidog를 다운로드하세요. GPT-5.6 API 가이드는 이전 세대에서 동일한 구성을 보여줍니다.

FAQ

GPT-6 Astra 모델 ID는 무엇인가요? gpt-6-astra, 단일 스냅샷입니다. Azure 및 AWS Bedrock을 통해서도 노출되며, OpenRouter에서는 openai/gpt-6-astra로 제공됩니다.

GPT-6 Astra는 미세 조정(fine-tuning) 또는 실시간(Realtime) API를 지원하나요? 아니요. 모델 페이지에는 Chat Completions, Responses, Batch가 지원된다고 나와 있으며, Realtime, Assistants, fine-tuning은 지원되지 않습니다.

컨텍스트 창과 최대 출력은 얼마인가요? 1,050,000 입력 토큰과 128,000 출력 토큰입니다. 272K 입력 토큰을 초과하는 프롬프트는 장문 컨텍스트 요금으로 청구됩니다.

Sol에서 전환한 후 내 요청이 실패한 이유는 무엇인가요? 아마도 남아 있는 temperature 또는 top_p, none 노력 수준, 또는 prompt_cache_retention 때문일 것입니다. Astra는 이 세 가지를 모두 제거했습니다. 위의 마이그레이션 목록을 참조하세요.

요청이 스스로 중단될 수 있나요? 예. OpenAI는 도구를 사용하는 요청에 대해 불일치 모니터를 실행하며, API에서는 플래그가 지정된 작업이 검토를 위해 일시 중지되지 않고 중단됩니다. 긴 에이전트 실행이 가장 노출되므로, 재개 가능하도록 만드세요. Critical 사이버 임계값 게시물은 해당 동작 뒤에 있는 안전 장치를 설명합니다.

이번 주에 할 일

하나의 에이전트 워크로드를 Responses API를 통해 gpt-6-astra로 옮기고, 샘플링 매개변수를 제거하고, 노력을 medium으로 설정한 다음, 동일한 입력에 대해 Sol과 비교하여 토큰 및 경과 시간을 측정하십시오. 작업당 비용이 동일하거나 더 낮게 나온다면 나머지를 마이그레이션하십시오. 그렇지 않다면, 숫자라도 얻게 될 것이고, 이는 대부분의 팀이 금요일까지 얻게 될 것보다 더 많은 것입니다.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요