만약 9월 초에 에이전트 워크로드를 GPT-6 Astra로 옮기셨다면, 지금쯤 3주치 청구서를 받아보셨을 것이고 문제의 윤곽을 이미 파악하셨을 겁니다. Astra는 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러를 청구합니다. 방대한 시스템 프롬프트와 도구 스키마가 첨부된 장기 실행 루프는 어떤 스프레드시트 예측보다 빠르게 비용을 소진합니다.
9월 22일, OpenAI는 GPT-6 Sol을 2달러와 10달러에 출시했습니다. 같은 모델 제품군, 같은 API 표면, 청구서의 모든 항목에서 5분의 1 가격입니다.
이것이 바로 마이그레이션입니다. 코드에서 바뀌는 것은 거의 없습니다. 청구서에서 바뀌는 것은 전부입니다. 그리고 대부분의 출시 당일 보도에서 놓쳤던 부분: OpenAI는 여전히 Astra가 더 좋은 모델이라고 말하며, 두 모델 간에 공개된 직접 비교는 겉으로 보이는 것과는 다릅니다.
요약
gpt-6-astra에서gpt-6-sol로의 전환은 대부분의 호출자에게 모델 문자열 교체에 불과합니다. 컨텍스트 창, 최대 출력, 엔드포인트, 내장 도구, 지원되는 기능 및 속도 제한 계층은 동일합니다.- 모든 요금은 정확히 5배 인하됩니다: 입력 10달러에서 2달러, 캐시된 입력 1달러에서 0.20달러, 캐시 쓰기 12.50달러에서 2.50달러, 출력 50달러에서 10달러. 토큰 혼합에 관계없이 청구서가 5분의 1로 줄어듭니다.
- Sol은
none추론 노력을 추가합니다. 또한 채팅 완료 함수 호출을reasoning_effort: "none"으로 제한하는데, 이는 작동하는 통합을 중단시킬 수 있는 유일한 변경 사항입니다. - Sol의 지식 컷오프는 2026년 4월 20일입니다. Astra의 지식 컷오프는 2026년 4월 30일입니다.
- OpenAI는 Astra가 "전반적으로 여전히 최고의 모델"이라고 말합니다. 공개된 Sol 대 Astra 벤치마크는 Astra를
low로, Sol을xhigh로 실행하므로, 이는 기능의 한계가 아니라 비용 효율성을 측정합니다.
가격표
두 모델의 요금은 모두 OpenAI의 모델 페이지(gpt-6-astra 및 gpt-6-sol)에서 2026년 9월 23일 기준으로 읽은 것입니다.
| 지표, 100만 토큰당 | GPT-6 아스트라 | GPT-6 솔 | 변화 |
|---|---|---|---|
| 입력 | $10 | $2 | 5배 저렴 |
| 캐시된 입력 | $1 | $0.20 | 5배 저렴 |
| 캐시 쓰기 | $12.50 | $2.50 | 5배 저렴 |
| 출력 | $50 | $10 | 5배 저렴 |
청구 수정자는 두 모델에서 동일합니다. 272K 입력 토큰을 초과하는 프롬프트는 전체 요청에 대해 입력 및 캐시 요금의 2배, 출력의 1.5배로 청구됩니다. 배치(Batch) 및 플렉스(Flex)는 절반 가격입니다. 고속 모드(Fast mode)는 두 배이며, Astra에서는 대기 시간 SLA를 제공하지 않습니다.

네 가지 요금 모두 동일한 비율로 인하되므로, 절감액을 예측하기 위해 토큰 혼합을 모델링할 필요가 없습니다. 구체적인 에이전트 워크로드를 살펴보겠습니다: 하루 10,000개의 요청, 각 요청은 30,000 토큰의 캐시된 접두사, 10,000 토큰의 새 입력, 3,000 토큰의 출력을 가집니다.
| 구성 요소 | 일일 토큰 | 아스트라 | 솔 |
|---|---|---|---|
| 캐시된 입력 | 300M | $300 | $60 |
| 새 입력 | 100M | $1,000 | $200 |
| 출력 | 30M | $1,500 | $300 |
| 총계 | $2,800 | $560 |
혼합을 출력 쪽으로, 캐시 쪽으로 바꾸고, 272K 컨텍스트에서 실행하여 긴 프롬프트 배수를 지불하더라도 비율은 5배로 유지됩니다.
이것이 왜 중요한지에 대한 규모를 보면, OpenAI는 자체 연구원 중 중간값이 코딩 에이전트에 하루 600달러 이상을 지출하며, 상위 10%는 하루 7,000달러를 지출한다고 보고했습니다. 이 금액을 5로 나누면 팀이 감당할 수 있는 실험의 수가 달라집니다. 두 출시의 더 넓은 맥락은 2026년 9월 모델 가격 전쟁 분석에서 확인할 수 있습니다.
하나의 조건이 붙습니다: OpenAI는 Sol이 GPT-5.6보다 50% 저렴하다고 설명하며, 이 비교는 OpenAI가 직접 언급한 GPT-5.6 프로모션 가격과 비교한 것입니다. 당시 저희 GPT-5.6 가격 게시물에서 기록한 GPT-5.6 정가와 비교하면 인하 폭은 더 큽니다. Astra와 비교하면 정확히 5배입니다.
정확히 동일하게 유지되는 것
이 부분이 마이그레이션을 저렴하게 만드는 섹션입니다.
| GPT-6 아스트라 | GPT-6 솔 | |
|---|---|---|
| 모델 ID | gpt-6-astra |
gpt-6-sol |
| 컨텍스트 창 | 1,050,000 | 1,050,000 |
| 최대 입력 토큰 | 922,000 | 922,000 |
| 최대 출력 토큰 | 128,000 | 128,000 |
| 모달리티 | 텍스트, 이미지 입력; 텍스트 출력 | 텍스트, 이미지 입력; 텍스트 출력 |
| 엔드포인트 | 채팅 완료, 응답, 배치 | 채팅 완료, 응답, 배치 |
| 미지원 | 실시간, 어시스턴트, 미세 조정, 임베딩, 오디오 | 동일 |
| 내장 도구 | 웹 검색, 파일 검색, 이미지 생성, 코드 인터프리터, 호스팅 셸, 패치 적용, 스킬, 컴퓨터 사용, MCP, 도구 검색 | 동일 목록 |
| 기능 | 스트리밍, 구조화된 출력, 함수 호출, 파일 검색, 이미지 입력, 웹 검색, 프롬프트 캐싱 | 동일 목록 |
| 계층 5 속도 제한 | 15,000 RPM, 40M TPM | 15,000 RPM, 40M TPM |
| 스냅샷 | gpt-6-astra |
gpt-6-sol |
컨텍스트 창이 핵심입니다. Sol은 더 짧은 컨텍스트 모델이 아닙니다. Astra와 동일한 1,050,000 토큰 창과 동일한 922,000 토큰 입력 한도를 가집니다. 청킹, 검색 예산 또는 압축 전략에 대해 변경할 필요가 전혀 없습니다.
코드에서 실제로 변경되는 것
네 가지 사항이며, 문제가 될 가능성이 있는 순서대로 나열했습니다.
1. 채팅 완료 함수 호출. Astra에서는 채팅 완료가 작동하며 도구 호출에는 응답 API가 필요합니다. Sol에서는 reasoning_effort가 "none"일 때만 채팅 완료가 함수 호출을 지원합니다. 다른 노력으로 채팅 완료를 통해 도구를 호출하고 있었다면 해당 요청은 더 이상 작동하지 않습니다. OpenAI의 GPT-6 가이드 자체도 도구를 이용한 추론에는 응답을 사용하라고 권장합니다. 이미 응답을 사용하고 있다면 이 부분은 비용이 들지 않습니다.
2. none 노력 수준. Astra는 low부터 max까지 지원합니다. Sol은 이 모든 것에 더해 none을 지원하며, 이는 추론 토큰이 순수한 오버헤드가 되는 분류 및 추출 작업에 유용하게 만드는 지렛대입니다. 둘 다 기본값은 medium입니다.
3. 지식 컷오프. Astra는 2026년 4월 30일까지, Sol은 2026년 4월 20일까지 학습되었습니다. 10일은 짧지만, 프롬프트가 4월 말의 지식을 가정한다면 가정을 테스트해 보세요.
4. 미지원 매개변수. 추론 노력이 none이 아닐 때는 temperature, top_p, top_logprobs가 없어야 하며, 채팅 완료도 logprobs를 드롭합니다. Astra도 동일한 규칙을 적용하므로 깨끗한 Astra 통합은 이미 이 규칙을 준수합니다. 이 문제는 Sol에서 reasoning_effort: "none"으로 이동한 후 temperature를 다시 넣는 것을 고려할 때만 발생합니다.
일반적인 응답 호출의 이전과 이후 모습입니다. 차이점은 한 줄입니다.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
- model="gpt-6-astra",
+ model="gpt-6-sol",
reasoning={"effort": "xhigh"},
tools=[{"type": "function", "name": "run_api_test", "parameters": {...}}],
input=[
{"role": "developer", "content": "You are a senior API engineer. Bias towards action."},
{"role": "user", "content": "Read this OpenAPI operation and propose three negative test cases."},
],
)
이 예시에서 노력 수준에 주목하세요. Sol로 이동하여 동일한 노력을 유지하는 것은 흥미로운 마이그레이션이 아닙니다. Sol로 이동하여 노력을 높이는 것이 흥미로운데, 이는 동일한 비용으로 추론 토큰에 5배 더 많은 예산을 사용할 수 있기 때문입니다.
포기하는 것
출시 수치는 오해하기 쉽기 때문에 이 부분에 대해 솔직해져야 합니다.
OpenAI는 Astra가 여전히 더 좋은 모델이라고 말합니다. 출시 게시물에는 Astra가 "전반적으로 여전히 최고의 모델"이라고 명시되어 있습니다. 이는 공급업체 자체의 새로운 릴리스에 대한 자체적인 설명이며, Sol이 Astra를 대체한다고 말하는 누구에게나 인용해야 할 문장입니다.
공개된 직접 비교는 기능 비교가 아닙니다. AutomationBench 1.0.6에서 Sol은 xhigh로 작업당 0.27달러에 33.2%를 기록하고, Astra는 low로 Sol의 작업당 비용의 3.9배에 30.3%를 기록합니다. 노력 수준을 잘 살펴보세요. Sol은 완전히 최대로 설정되어 있고, Astra는 완전히 최저로 설정되어 있습니다. 이 비교가 보여주는 것은 Sol의 최대치가 Astra의 최소치를 작업당 비용의 대략 4분의 1로 넘는다는 것인데, 이는 실제적이고 유용한 결과입니다. xhigh의 Sol과 max의 Astra에 대해서는 아무것도 말해주지 않습니다. 해당 매치업을 다루는 공개된 수치는 없습니다. 만약 귀하의 워크로드가 높은 노력의 Astra가 마침내 작동하게 만들었던 것이라면, Sol은 교체가 아니라 테스트입니다.
최상위 대기 시간. Artificial Analysis는 GPT-6 Sol의 최대 추론 변형이 초당 115.2 출력 토큰을 생성하며 첫 번째 토큰까지 102.15초가 걸린다고 측정했습니다. 이 수치는 OpenAI가 아닌 제3자로부터 나온 것이며, 특히 max 변형을 설명하므로 medium 또는 none이 무엇을 하는지는 알려주지 않습니다. 이는 저렴한 모델이 높은 노력에서 자동으로 빠른 모델이 아닐 수 있다는 경고로 받아들이고, 숫자를 그대로 따르기보다는 자체 노력 수준을 측정해야 합니다.
가용성. Sol은 Plus, Pro, Business, Enterprise 및 Edu 사용자를 위한 ChatGPT Work 및 Codex에 도달했으며, 아직 채팅에는 적용되지 않았습니다. API는 준비되었지만, 채팅 인터페이스는 아닙니다.
Astra를 스택 어딘가에 유지할 가치가 있는 Astra의 기능에 대해서는 이틀간의 실습 테스트, 컴퓨터 사용 보고서 및 임계 사이버 임계점 설명서가 모두 유효하며, 전체 사양서는 GPT-6 Astra API 가이드에 있습니다.
벤치마크가 아닌 자체 요청으로 결정하기
AutomationBench는 귀하의 프롬프트를 실행하지 않습니다. 마이그레이션을 결정하는 유일한 비교는 동일한 요청 세트를 두 모델 ID 모두에 보내고 자체 기준에 따라 점수를 매기는 것입니다. 한 번 설정하면 향후 모든 출시에 대해 그만한 가치를 얻을 수 있습니다. Apidog에서는 모델 ID를 환경 변수에 넣고 요청을 한 번 저장한 다음 환경을 전환하여 대상을 다시 지정합니다:
{
"model": "{{MODEL_ID}}",
"reasoning": { "effort": "xhigh" },
"input": [
{ "role": "user", "content": "{{TEST_PROMPT}}" }
]
}
20~30개의 실제 프로덕션 프롬프트로 테스트 시나리오를 구축하고, 파서가 의존하는 응답 형식에 대한 어설션(output_text 존재 여부, JSON 스키마에 대한 도구 호출 인수 유효성, max_output_tokens에서의 잘림 없음)을 추가한 다음, 각 환경당 한 번씩 두 번 실행합니다. Apidog는 모든 요청의 본문과 경과 시간을 기록하므로, 하네스를 작성할 필요 없이 정확성과 대기 시간을 동시에 얻을 수 있습니다. 각 응답의 usage 블록은 비교를 적절하게 가격 책정하기 위한 토큰 수를 제공합니다.
이 마이그레이션에 특별히 추가할 만한 두 가지 어설션이 있습니다: 채팅 완료를 사용했다면 도구 호출이 여전히 도착하는지 확인하고, 긴 입력에서 높은 노력으로 인해 대기 시간 위험이 있으므로 평균 프롬프트보다는 가장 느린 프롬프트를 기준으로 판단하세요.
마이그레이션 체크리스트
- 도구를 호출하는 모든 곳에서 응답 API를 사용하고 있는지 확인합니다. 채팅 완료를 통해 도구를 호출하는 경우 모델을 전환하기 전에 이동합니다.
gpt-6-astra를gpt-6-sol로 교체하고 첫 실행에서는 다른 모든 것을 그대로 둡니다.- 두 ID 모두에 대해 회귀 세트를 다시 실행하고 상태 코드뿐만 아니라 출력의 차이점을 확인합니다.
- Sol에서 추론 노력을 한 단계 높여봅니다. 이제 예산이 충분합니다.
- 2026년 4월 말의 지식에 의존하는 모든 프롬프트를 다시 확인합니다.
- 최대치가 지불하던 것과 같은 작업에 대해서는 플래그 뒤에 Astra 경로를 유지합니다.
결론
Astra에서 Sol로의 마이그레이션은 API 표면이 움직이지 않고, 컨텍스트 창이 줄어들지 않으며, 모든 측정 단위에서 가격이 고정된 비율로 떨어지는 드문 경우입니다. 작업은 코드에 있는 것이 아닙니다. 가장 어려운 작업이 Astra의 여유 공간을 사용하고 있었는지, 아니면 단지 비용을 지불하고 있었는지 알아내기 위해 두 모델을 통해 실행하는 스무 개의 프롬프트에 있습니다.
플래그를 뒤집기 전에 그 비교를 실행하고, 결과를 읽는 동안 OpenAI의 자체 문장을 염두에 두세요: Astra는 여전히 최고의 모델입니다. Sol은 실행을 계속할 수 있는 모델입니다.
