Como usar GPT-6.1 Sol API?

Guia da API GPT-6.1 Sol: sua primeira solicitação gpt-6.1-sol, níveis de esforço, preços Batch/Flex/Fast e as quatro mudanças para migrar do gpt-6-sol.

INEZA Felin-Michel

INEZA Felin-Michel

30 setembro 2026

Como usar GPT-6.1 Sol API?

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Para chamar a API GPT-6.1 Sol, envie uma requisição POST para https://api.openai.com/v1/responses com "model": "gpt-6.1-sol" e sua chave como um token Bearer. Ela tem o mesmo preço de $2 de entrada e $10 de saída por milhão de tokens que a GPT-6 Sol, e a entrada em cache cai de $0,20 para $0,10. Migrar de gpt-6-sol é principalmente uma troca de string. A mudança que quebra a compatibilidade é o nível de esforço: a GPT-6.1 Sol não aceita none ou minimal, então essas requisições devem ir para low, juntamente com qualquer código que dependia de none.

A OpenAI lançou o GPT-6.1 Sol no DevDay em 29 de setembro de 2026. O resumo do DevDay 2026 aborda os outros lançamentos, e o que é o GPT-6.1 Sol detalha os benchmarks. Este guia cobre sua primeira requisição, qual nível de esforço iniciar, cada mudança de migração, os níveis Batch, Flex e Fast, e uma execução de regressão lado a lado de ambos os IDs de modelo no Apidog antes de você mudar o tráfego de produção.

botão

GPT-6 Sol vs GPT-6.1 Sol: o que muda na API

A maior parte da especificação é idêntica. Aqui está a diferença completa da página do modelo GPT-6.1 Sol, da página do modelo GPT-6 Sol e da orientação de migração Usando GPT-6 da OpenAI:

gpt-6-sol gpt-6.1-sol O que fazer
Input / output por 1M (Padrão) $2 / $10 $2 / $10 Nada
Entrada em cache por 1M $0.20 $0.10 Recalcule sua matemática de cache
Escritas de cache por 1M $2.50 $2.50 Nada
Janela de contexto / entrada máxima / saída máxima 1,050,000 / 922,000 / 128,000 1,050,000 / 922,000 / 128,000 Nada
Corte de conhecimento 20 de abril de 2026 30 de abril de 2026 Verifique novamente as avaliações sensíveis à data
reasoning.effort none, low, medium (padrão), high, xhigh, max low, medium (padrão), high, xhigh, max Mova none para low e reavalie
Chamada de função em Chat Completions Somente com reasoning_effort: "none" Não suportado Mova as chamadas de ferramenta para Responses
Endpoints Chat Completions, Responses, Batch O mesmo Nada
Limites de taxa Nível 1: 500 RPM / 500K TPM; Nível 5: 15.000 RPM / 40M TPM O mesmo Nada

A página do GPT-6 Sol agora direciona os leitores para o GPT-6.1 Sol como “o modelo Sol mais recente.”

Envie sua primeira requisição GPT-6.1 Sol

Exporte sua chave como OPENAI_API_KEY, então chame a API Responses:

curl https://api.openai.com/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "model": "gpt-6.1-sol",
    "reasoning": {"effort": "medium"},
    "input": "List three ways a webhook retry policy can create duplicate orders. One line each."
  }'

O SDK Python lê a mesma variável de ambiente:

from openai import OpenAI

client = OpenAI()
response = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "medium"},
    input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)

Quatro partes da resposta importam:

Use a API Responses para qualquer coisa com ferramentas; o GPT-6.1 Sol suporta Chat Completions apenas para requisições sem ferramentas. O guia da API Responses cobre o formato da requisição com mais profundidade.

Escolha um nível de esforço de raciocínio

O esforço é o seu principal seletor de custo e qualidade, e medium é o padrão quando você o omite. O guia de seleção de modelo da OpenAI emparelha medium com “trabalho técnico complexo e entregas coordenadas que você espera revisar,” e xhigh com entregas polidas e decisões construídas a partir de evidências conflitantes. A publicação de lançamento da OpenAI adiciona resultados por configuração. Esses benchmarks são relatados pela OpenAI, e a tabela cita os deltas que a OpenAI declara em seu texto:

Esforço Comece aqui para O que a OpenAI relata para GPT-6.1 Sol
low Chat, extração, classificação, qualquer coisa que você rodou com none Em conversas sinalizadas por usuários, as respostas com erro factual caem de 11,4% (GPT-6 Sol) para 7,7%
medium (padrão) Automações com agentes e fluxos de trabalho de chamada de ferramenta AutomationBench 1.0.6: +2,2 pp sobre Claude Opus 5.5 por aproximadamente um terço do custo; +4,8 pp sobre GPT-6 Sol na mesma configuração
high Depuração difícil e planejamento aprofundado Nenhuma afirmação específica da configuração
xhigh Entregas polidas e execuções assíncronas longas Nenhuma afirmação específica da configuração
max Uso de computador e tarefas de ciência complexas OSWorld 2.0: +7 pp sobre GPT-6 Sol no máximo por menos da metade do custo. Terminal-Bench Science 0.1: $5,47 por tarefa, vs $23,21 para Opus 5.5 e $23,80 para GPT-6 Astra

Duas ressalvas. O conjunto de fatos são conversas previamente sinalizadas por erros, não tráfego típico. E no Terminal-Bench Science, o GPT-6 Astra ainda pontua mais alto (68,1%), então a OpenAI recomenda o Astra para o trabalho científico mais difícil.

Para chamadas sensíveis à latência que usavam none, comece com low e meça. O guia de raciocínio descreve low como raciocínio eficiente “com um aumento modesto de latência.” Para mudar o esforço no meio de uma conversa sem quebrar o cache de prompts, anexe um item de entrada configuration_update em vez de mudar o reasoning.effort no nível da requisição.

Migrar de gpt-6-sol: quatro mudanças no código

  1. Troque o ID do modelo. Substitua gpt-6-sol por gpt-6.1-sol, e mantenha-o em configuração ou em uma variável de ambiente para que o rollback seja uma única edição.
  2. Remapeie none e minimal. Orientação da OpenAI: use low em vez de none, e comece minimal em low e compare em tarefas representativas. No GPT-6 Astra, que também não possui none, enviá-lo retorna HTTP 400, então corrija isso antes de mover o tráfego.
  3. Remova parâmetros de amostragem. Quando o esforço não for none, remova temperature, top_p e top_logprobs (e logprobs em Chat Completions). O código que emparelhava temperature com none no GPT-6 Sol precisa disso.
  4. Mova as chamadas de ferramenta de Chat Completions para Responses. O GPT-6 Sol permitia a chamada de funções em Chat Completions apenas com reasoning_effort: "none". Essa combinação não tem equivalente no 6.1 Sol.

Então, execute novamente tudo o que depende de recenticidade: o corte de conhecimento muda de 20 para 30 de abril de 2026. Se você veio para o Sol do Astra, o guia de migração Astra para Sol cobre essa etapa anterior.

Preços de Batch, Flex, Fast e entrada em cache

Cada nível mantém a estrutura do GPT-6 Sol, com a coluna de entrada em cache pela metade. Os preços por 1M de tokens são da página de preços da API. A página do modelo adiciona que um prompt com mais de 272K tokens de entrada é cobrado em 2x as taxas de entrada e cache e 1,5x a saída para a requisição completa, a mesma regra que o GPT-6 Sol usa:

Nível Entrada Entrada em cache Escritas de cache Saída
Standard $2.00 $0.10 $2.50 $10.00
Batch $1.00 $0.05 $1.25 $5.00
Flex $1.00 $0.05 $1.25 $5.00
Fast $4.00 $0.20 $5.00 $20.00
Padrão, prompt com mais de 272K tokens de entrada $4.00 $0.20 $5.00 $15.00

Flex é um service_tier: "flex" por requisição. Fast é service_tier: "fast", com "priority" aceito como alias. O modo Fast não está disponível com residência de dados na UE. O Ultrafast para GPT-6.1 Sol está “chegando em breve” e está amplamente disponível apenas para GPT-6 Astra hoje; veja modo Ultrafast da OpenAI. Para trabalhos noturnos, o guia da API OpenAI Batch detalha uma execução em lote.

O cache é onde a atualização economiza dinheiro. As leituras custam 0,05x a taxa de entrada no 6.1 Sol versus 0,1x no GPT-6 Sol, e as escritas custam 1,25x em ambos, de acordo com o guia de cache de prompts. Considere um prompt de sistema de 50.000 tokens reutilizado em 1.000 requisições. Uma escrita custa $0,125 em qualquer um dos modelos; as 999 leituras custam $9,99 no GPT-6 Sol e $5,00 no GPT-6.1 Sol. O prefixo mínimo armazenável em cache é de 1.024 tokens visíveis, e um prefixo em cache permanece elegível por pelo menos 30 minutos após sua última escrita ou reutilização. Para estratégia de ponto de interrupção, veja cache de prompts GPT-6.

Teste a troca no Apidog

Não mude a produção apenas com base nos preços de tabela. Envie a mesma requisição salva para ambos os IDs e compare o que retorna. No Apidog:

  1. Crie um ambiente com OPENAI_API_KEY (armazenada como um segredo), MODEL_ID definido como gpt-6-sol e EFFORT definido como medium.
  2. Crie POST https://api.openai.com/v1/responses com o cabeçalho Authorization: Bearer {{OPENAI_API_KEY}} e este corpo, então salve-o:
{
  "model": "{{MODEL_ID}}",
  "reasoning": {"effort": "{{EFFORT}}"},
  "max_output_tokens": 25000,
  "input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
}
  1. Adicione asserções: HTTP 200, $.status igual a completed, $.output[*].type contém message, $.usage.output_tokens é maior que 0, e $.usage.output_tokens_details.reasoning_tokens existe. Em seguida, verifique o formato da saída da qual seu código depende, como JSON válido com as chaves que você analisa.
  2. Adicione um script de pós-processamento que transforma o uso em dólares, usando a divisão de entrada do guia de cache de prompts da OpenAI:
const u = pm.response.json().usage;
const d = u.input_tokens_details || {};
const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");
const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;
const cost = ((u.input_tokens - cached - writes) * 2 + cached * cachedRate
  + writes * 2.5 + u.output_tokens * 10) / 1e6;
console.log(model, "cost per call $", cost.toFixed(5));
  1. Envie, defina MODEL_ID para gpt-6.1-sol e envie novamente. Compare reasoning_tokens, output_tokens, a resposta e o custo registrado. Se você estiver remapeando de none, execute a linha de base em none e o candidato em low.

Em seguida, mova a requisição e um punhado de prompts reais para um cenário de teste e execute o par a partir do Apidog CLI na CI. --env-var sobrescreve uma variável para uma execução, então um único cenário cobre ambos os modelos:

npm install -g apidog-cli
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  --env-var "MODEL_ID=gpt-6-sol" -r cli,junit
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  --env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit

Uma asserção falha o trabalho, e os relatórios JUnit fornecem ambas as execuções lado a lado. Para asserções em saídas que variam de execução para execução, veja testando agentes de IA não determinísticos.

FAQ

O GPT-6.1 Sol é mais caro que o GPT-6 Sol? Não. Ambos são listados por $2 de entrada e $10 de saída por 1M de tokens. A entrada em cache do GPT-6.1 Sol é de $0,10 versus $0,20, então cargas de trabalho com muito cache ficam mais baratas.

O que devo fazer com reasoning.effort: "none"? O GPT-6.1 Sol não suporta none nem minimal. Mapeie ambos para low, remova temperature e top_p, e execute novamente suas avaliações antes de mudar.

Posso usar o GPT-6.1 Sol com Chat Completions? Sim, para requisições sem ferramentas. A chamada de ferramenta requer a API Responses.

Existe um nível gratuito da API GPT-6.1 Sol? Não. As chamadas de API são cobradas por token desde a primeira requisição. O GPT-6.1 Sol é gratuito? cobre as rotas mais baratas.

Próximo passo

Salve a primeira requisição, execute-a no gpt-6-sol com seu esforço atual, depois no gpt-6.1-sol, e compare o uso e a saída em um prompt do seu próprio tráfego. Baixe o Apidog para manter ambas as execuções como asserções que você pode rodar novamente na CI. Pesando a Anthropic em vez disso? Veja GPT-6.1 Sol vs Claude Sonnet 5.5.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs