GPT-5.6 API 활용법: Sol, Terra, Luna

GPT-5.6 API 사용법 알아보기: Sol, Terra, Luna 모델 ID, Python 및 curl을 이용한 첫 요청, 추론 노력, 프롬프트 캐싱 및 비용 테스트.

Ashley Innocent

Ashley Innocent

10 July 2026

GPT-5.6 API 활용법: Sol, Terra, Luna

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

OpenAI는 2026년 7월 9일 GPT-5.6을 일반에 공개했으며, API 접근은 셀프 서비스로 제공됩니다. 오늘 바로 모든 API 계정에서 대기 목록이나 플랜 제한 없이 호출할 수 있습니다. 7월 초까지 진행된 제한된 미리보기는 이제 과거가 되었습니다. 개발자들에게 달라진 점은 출시 자체의 형태입니다. 단일 모델 대신 Sol, Terra, Luna 세 가지 모델을 얻게 되며, 각 모델은 자체 가격 책정 포인트를 가지며, 6가지 추론 노력 수준과 명시적인 프롬프트 캐싱 제어 기능을 제공합니다.

이는 일반적인 모델 교체보다 더 많은 결정이 필요하며, 첫 주에 선택하는 기본값은 계속 유지되는 경향이 있습니다. 이 가이드에서는 모델 ID와 각 모델이 언제 적합한지, Python 및 curl을 사용한 첫 번째 요청, 추론 노력, 캐싱 설정, 새로운 Responses API 인터페이스, 그리고 예상치 못한 문제 없이 GPT-5.5에서 마이그레이션하는 방법을 다룹니다. 플래그십 티어에 대한 전체 배경 지식을 먼저 얻고 싶다면, GPT-5.6 Sol 개요에서 포지셔닝과 벤치마크를 다루고 있으며, 이 글은 실용적인 내용에 중점을 둡니다.

마지막에는 세 가지 티어 모두에 대한 작동하는 호출을 가지게 되며, Apidog에서 자신의 프롬프트로 반복적으로 비교할 수 있는 방법을 알게 될 것입니다. 이를 통해 비용 및 품질 결정은 출시 게시물이 아닌 자신의 데이터에서 비롯됩니다.

요약 (TL;DR)

세 가지 모델 ID와 각각을 선택해야 할 때

GPT-5.6은 OpenAI의 일반적인 명명 방식과 다릅니다. 숫자는 세대를 의미하며, Sol, Terra, Luna는 MarkTechPost의 출시 보도에서 설명하듯이 자체적인 속도로 발전할 내구성 있는 역량 티어입니다. 오늘 표준화하는 티어는 다음 세대에서도 그 의미를 유지합니다.

모델 ID 티어 토큰 100만 개당 입력/출력 이것을 사용해야 할 때
gpt-5.6-sol 플래그십 $5 / $30 심층 추론, 에이전트 오케스트레이션, 어려운 디버깅
gpt-5.6-terra 균형 $2.50 / $15 일상적인 제품 기능, GPT-5.5 등급 작업을 더 낮은 비용으로
gpt-5.6-luna 빠름 $1 / $6 분류, 추출, 라우팅, 1차 초안 작성

Sol은 플래그십 모델입니다. OpenAI는 Agents' Last Exam에서 GPT-5.5의 46.9점과 비교하여 약 53점을 기록했다고 보고했으며, 이는 출시 당일의 주장으로 받아들이고 자신의 작업에서 검증해야 합니다. Terra는 실용적인 선택입니다: OpenAI는 GPT-5.5와 경쟁하면서도 비용은 약 절반이라고 설명합니다. Luna는 깊이보다 단위 경제성을 더 중요하게 생각하는 대용량, 지연 시간에 민감한 작업을 위해 존재합니다.

합리적인 기본값: Terra에서 프로토타입을 만들고, Terra가 측정 가능하게 실패하는 경우에만 Sol로 전환하며, 프롬프트가 안정화되면 대용량 경로를 Luna로 푸시합니다. GPT-5.6 가격 분석은 이러한 요금이 세대와 경쟁사 간에 어떻게 비교되는지 더 자세히 설명합니다.

알아둘 가치가 있는 별칭 하나: 접미사가 없는 gpt-5.6은 Sol로 라우팅됩니다. 프로덕션 코드에서는 명시적인 티어 ID를 고정하여 모든 호출이 정확히 어떤 비용을 지불하는지 알 수 있도록 하세요.

첫 번째 요청

아래 모델 ID는 OpenAI 개발자 문서와 정확히 일치합니다. 결제가 활성화된 OpenAI API 키만 있으면 됩니다. 다른 것은 필요 없습니다.

Chat Completions는 변경 없이 작동하므로, 기존 코드는 모델만 교체하면 됩니다:

from openai import OpenAI

client = OpenAI()

response = client.chat.completions.create(
    model="gpt-5.6-sol",
    messages=[
        {"role": "system", "content": "You are a concise code reviewer."},
        {"role": "user", "content": "Review this for edge cases: def parse_price(raw): return float(raw.strip('$'))"}
    ]
)

print(response.choices[0].message.content)

curl에서의 동일한 호출:

curl https://api.openai.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "messages": [
      {"role": "user", "content": "Explain idempotency keys in one paragraph."}
    ]
  }'

새로운 빌드의 경우, 대신 Responses API를 대상으로 하세요. 모든 GA(General Availability) 추가 기능이 여기에 있으며, 추론 블록을 직접 받습니다:

response = client.responses.create(
    model="gpt-5.6-terra",
    input="Summarize the trade-offs between webhooks and polling.",
    reasoning={"effort": "low"}
)

print(response.output_text)

통합 코드를 한 줄 더 작성하기 전에 세 가지 티어 모두에 대해 동일한 프롬프트를 실행해 보세요. 톤, 길이, 지연 시간의 차이는 읽는 것보다 직접 느끼는 것이 더 쉽습니다.

추론 노력 선택하기

GPT-5.6은 none, low, medium, high, xhigh, max의 여섯 가지 추론 노력 수준을 노출합니다.

none은 추론을 끕니다. 작업이 기계적이고 깊이보다 지연 시간이 더 중요할 때 사용하세요: 재포맷팅, 명확한 스키마에 대한 추출, 템플릿 채우기. none 상태의 Luna는 빠른 고전적인 완성 모델처럼 작동하며, 이 조합에서 $1의 입력 요금이 빛을 발합니다.

max는 다른 극단에 있습니다. 오답이 느린 답변보다 더 큰 비용을 초래하는 문제에 사용하세요: 미묘한 동시성 버그, 아키텍처 검토, 다단계 계획. 더 긴 대기 시간과 더 큰 요금을 예상해야 합니다.

대부분의 워크로드는 중간에 해당합니다. medium에서 시작하여 한 번에 한 단계씩 이동하고, 비용 상승을 감수하기 전에 품질을 측정하세요. 단계를 낮추는 것은 종종 무료입니다: OpenAI의 마이그레이션 지침에 따르면 많은 GPT-5.5 워크로드가 GPT-5.6에서 한 단계 낮은 수준으로도 품질을 유지합니다.

프로 모드는 추론 노력과 별개입니다. reasoning.mode: "pro"로 설정하면 모델은 속도보다 답변 품질을 우선시합니다. 이 모드는 세 가지 티어 모두에서 작동하며, 별도의 모델 ID가 아니라 설정이므로, 프로 전용 슬러그를 찾을 필요가 없습니다. 법률 요약 또는 사건 사후 검토와 같은 품질 우선 워크로드가 이 모드의 주 사용처입니다. 정확한 요청 형태와 제약 조건은 OpenAI의 API 참조를 확인하세요.

프롬프트 캐싱 설정하기

GPT-5.6은 명시적인 캐시 제어를 추가합니다. prompt_cache_options.mode"explicit"으로 설정하면 자동 접두사 감지에 의존하는 대신 캐시될 내용을 결정할 수 있습니다:

response = client.responses.create(
    model="gpt-5.6-luna",
    input=[
        {"role": "system", "content": SUPPORT_PLAYBOOK},
        {"role": "user", "content": ticket_text}
    ],
    prompt_cache_options={"mode": "explicit"}
)

동일한 옵션 객체의 ttl 필드는 캐시된 접두사가 얼마나 오랫동안 활성 상태를 유지할지 설정합니다. 사용자가 요청하는 값에 관계없이 최소 30분입니다. 허용되는 ttl 값과 중단점 배치 규칙은 OpenAI의 API 참조에 있습니다.

경제성은 간단합니다. 캐시 쓰기 비용은 캐시되지 않은 입력 요금의 1.25배로 청구됩니다. 캐시 읽기는 90% 할인이 유지됩니다. 따라서 캐싱은 두 번째 호출부터 이득을 가져다줍니다: 접두사에 대한 두 번의 캐시되지 않은 통과는 토큰 가격의 2.0배가 들지만, 한 번의 쓰기와 한 번의 읽기는 1.35배가 듭니다.

작동 예시. 지원 봇이 모든 Luna 호출에 40,000 토큰의 플레이북을 보낸다고 가정해 봅시다. 캐시되지 않은 경우, 이 접두사는 Luna의 1M 입력 요금 $1를 기준으로 호출당 $0.04의 비용이 듭니다. 명시적 캐싱을 사용하면 첫 번째 호출은 $0.05로 작성되고, ttl 내의 각 읽기는 $0.004가 듭니다. 100번의 호출 버스트 동안 총 $4.00 대신 $0.45가 소요되어, 청구서의 고정 부분에서 약 89%를 절약할 수 있습니다. 최소 30분 수명은 30분 미만의 간격으로 발생하는 버스트 트래픽도 계속 저렴한 읽기를 이용할 수 있음을 의미합니다.

경험 법칙: ttl 내에서 최소 두 번 이상 재사용되는 대규모 정적 접두사를 가진 모든 프롬프트는 명시적 모드로 실행되어야 합니다.

GA 출시 시 Responses API의 새로운 기능

GA 출시와 함께 세 가지 기능이 추가되었으며, 모두 Responses API에 포함됩니다:

또한 원본 이미지 치수를 보존하는 새로운 시각 세부 설정인 originalauto가 있습니다. 이 모든 기능에 대한 요청 형태와 매개변수는 OpenAI의 API 참조에 있으며, 위 메커니즘을 중심으로 설계해야 합니다.

GPT-5.5에서 마이그레이션하기

OpenAI의 지침은 단호합니다: 마이그레이션을 단순히 모델 슬러그 변경이 아니라 튜닝 과정으로 취급하세요. 통합이 GPT-5.5 API 가이드의 워크플로를 따른다면, 세 가지 조정 사항이 중요합니다.

첫째, 현재 추론 노력 수준과 그보다 한 단계 낮은 수준을 테스트하세요. GPT-5.6은 종종 한 단계 낮은 수준에서도 품질을 유지하며, 이는 동일한 트래픽에 대한 직접적인 비용 절감으로 이어집니다.

둘째, 더 짧은 답변을 예상하세요. GPT-5.6은 일반적인 서론이 적고 훨씬 간결한 출력을 작성합니다. 프롬프트에 "간결하게 작성" 또는 "서문 건너뛰기"와 같은 지시어가 있다면, 이를 제거하고 다시 테스트하세요. 이제 너무 많은 간결성 지시가 과도하게 작동할 수 있기 때문입니다. Simon Willison의 출시 당일 보고서는 이 제품군이 실제로 어떻게 작동하는지에 대한 유용한 독립적인 읽을거리입니다.

셋째, 튜닝하는 동안 응답에서 캐시된 토큰 사용량을 주시하고, 프로덕션 트래픽을 전환하기 전에 대표적인 작업 세트를 벤치마킹하세요. GPT-5.5 가격의 절반으로 Terra에서 유사한 출력을 얻는 것이 먼저 확인해야 할 결과입니다.

Apidog에서 API 테스트하기

Curl은 엔드포인트가 작동함을 증명합니다. 세 가지 티어 중에서 선택하려면 반복 가능한 무언가가 필요합니다. Apidog를 다운로드하고 작은 비교 환경을 설정하세요:

  1. OPENAI_API_KEY와 세 가지 변수(MODEL_SOL=gpt-5.6-sol, MODEL_TERRA=gpt-5.6-terra, MODEL_LUNA=gpt-5.6-luna)를 사용하여 환경을 만듭니다.
  2. API에 대한 POST 요청 하나를 만들고 본문에 {{MODEL_SOL}}을 참조한 다음, 이를 두 번 복제하고 다른 변수로 교체합니다.
  3. 동일한 프로덕션 형태의 프롬프트를 세 가지 모두에 보내고 답변을 나란히 읽습니다.
  4. 각 응답의 사용량 블록을 확인합니다. 토큰 수를 각 티어의 요율로 곱하면 다른 사람의 벤치마크가 아닌 자신의 프롬프트에 기반한 요청당 비용 예측을 얻을 수 있습니다.

동일한 환경은 노력 튜닝 중에도 그 가치를 증명합니다. 저장된 요청 중 하나에서 노력 수준을 변경하고, 다시 보내고, 출력 토큰이 어떻게 변하는지 확인하세요. 이 숫자에 토큰당 요금을 곱하면 품질 대 비용 곡선을 시각적으로 한 번에 한 요청씩 확인할 수 있습니다.

자주 묻는 질문 (FAQ)

GPT-5.6 API는 모두에게 제공되나요?

네, 그렇습니다. 2026년 7월 9일부터 모든 OpenAI API 계정에서 세 가지 모델 모두를 셀프 서비스로 호출할 수 있습니다. 출시 전 미리보기 제한은 GA 전에 해제되었으며, API 접근은 ChatGPT 플랜에 의존하지 않습니다. 플랜 티어는 채팅 제품에만 영향을 미치며, 무료 및 Go 사용자에게는 Terra가 제공되고 유료 플랜은 전체 모델 선택기를 잠금 해제합니다.

GPT-5.6의 컨텍스트 윈도우와 지식 차단 시점은 무엇인가요?

초기 문서에 따르면, 이 제품군은 1M 토큰 컨텍스트 윈도우, 128K 최대 출력, 그리고 2026년 2월 16일의 지식 차단 시점을 가집니다. OpenAI의 모델 페이지가 공식 기록 출처입니다. 계정에서 직접 확인하기 전까지는 이들을 보고된 수치로 간주하세요.

프로 모드와 울트라의 차이점은 무엇인가요?

프로 모드는 세 가지 모델 모두에서 작동하며 속도 대신 답변 품질을 높이는 API 설정(reasoning.mode: "pro")입니다. 울트라는 기본적으로 네 개의 에이전트를 병렬로 실행하는 멀티 에이전트 설정이며, 프로 및 엔터프라이즈 플랜의 ChatGPT Work와 플러스 이상의 Codex에서 사용할 수 있습니다. GPT-5.6 울트라 모드 분석은 의도적인 추가 토큰 지출이 언제 가치가 있는지 다룹니다.

Chat Completions 또는 Responses API 위에 구축해야 하나요?

기존 Chat Completions 코드는 모델 ID만 교체하면 계속 작동하므로 강제적인 재작성은 없습니다. 새로운 빌드는 Responses API를 대상으로 해야 합니다. 프로그래밍 방식 도구 호출, 멀티 에이전트, 지속적인 추론 기능이 모두 여기에 포함되어 있으며, OpenAI의 GPT-5.6 문서는 이를 중심으로 합니다.

결론

시작하기 위해 마이그레이션 프로젝트가 필요하지 않습니다. Terra를 선택하고, 제품의 실제 프롬프트 하나를 medium 노력 수준으로 실행한 다음, 한 단계 낮춰 비교하세요. 프롬프트가 큰 정적 접두사를 공유한다면 명시적 캐싱을 연결하세요. 위 예시의 89% 절감은 대규모 시스템 프롬프트가 돌려주는 일반적인 이득입니다. 그런 다음 Sol과 Luna가 스택의 어디에 속할지 결정하세요.

세 가지 티어 비교 환경도 계속 유지하세요. Sol, Terra, Luna는 자체적인 속도로 발전할 것이므로, 다음 릴리스는 연구 프로젝트가 아니라 저장된 요청을 다시 실행하는 작업이 될 것입니다. Apidog는 이러한 요청, 환경, 토큰 수를 한 곳에 보관하여, 미래의 모든 모델 출시를 추측이 아닌 오후의 테스트로 바꿀 수 있습니다.

button

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요