Para chamar a API GPT-6.1 Sol, envie uma requisição POST para https://api.openai.com/v1/responses com "model": "gpt-6.1-sol" e sua chave como um token Bearer. Ela tem o mesmo preço de $2 de entrada e $10 de saída por milhão de tokens que a GPT-6 Sol, e a entrada em cache cai de $0,20 para $0,10. Migrar de gpt-6-sol é principalmente uma troca de string. A mudança que quebra a compatibilidade é o nível de esforço: a GPT-6.1 Sol não aceita none ou minimal, então essas requisições devem ir para low, juntamente com qualquer código que dependia de none.
A OpenAI lançou o GPT-6.1 Sol no DevDay em 29 de setembro de 2026. O resumo do DevDay 2026 aborda os outros lançamentos, e o que é o GPT-6.1 Sol detalha os benchmarks. Este guia cobre sua primeira requisição, qual nível de esforço iniciar, cada mudança de migração, os níveis Batch, Flex e Fast, e uma execução de regressão lado a lado de ambos os IDs de modelo no Apidog antes de você mudar o tráfego de produção.
GPT-6 Sol vs GPT-6.1 Sol: o que muda na API
A maior parte da especificação é idêntica. Aqui está a diferença completa da página do modelo GPT-6.1 Sol, da página do modelo GPT-6 Sol e da orientação de migração Usando GPT-6 da OpenAI:
gpt-6-sol |
gpt-6.1-sol |
O que fazer | |
|---|---|---|---|
| Input / output por 1M (Padrão) | $2 / $10 | $2 / $10 | Nada |
| Entrada em cache por 1M | $0.20 | $0.10 | Recalcule sua matemática de cache |
| Escritas de cache por 1M | $2.50 | $2.50 | Nada |
| Janela de contexto / entrada máxima / saída máxima | 1,050,000 / 922,000 / 128,000 | 1,050,000 / 922,000 / 128,000 | Nada |
| Corte de conhecimento | 20 de abril de 2026 | 30 de abril de 2026 | Verifique novamente as avaliações sensíveis à data |
reasoning.effort |
none, low, medium (padrão), high, xhigh, max |
low, medium (padrão), high, xhigh, max |
Mova none para low e reavalie |
| Chamada de função em Chat Completions | Somente com reasoning_effort: "none" |
Não suportado | Mova as chamadas de ferramenta para Responses |
| Endpoints | Chat Completions, Responses, Batch | O mesmo | Nada |
| Limites de taxa | Nível 1: 500 RPM / 500K TPM; Nível 5: 15.000 RPM / 40M TPM | O mesmo | Nada |
A página do GPT-6 Sol agora direciona os leitores para o GPT-6.1 Sol como “o modelo Sol mais recente.”
Envie sua primeira requisição GPT-6.1 Sol
Exporte sua chave como OPENAI_API_KEY, então chame a API Responses:
curl https://api.openai.com/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "gpt-6.1-sol",
"reasoning": {"effort": "medium"},
"input": "List three ways a webhook retry policy can create duplicate orders. One line each."
}'
O SDK Python lê a mesma variável de ambiente:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "medium"},
input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)
Quatro partes da resposta importam:
statusécompletedem caso de sucesso. Se o modelo esgotar o orçamento de saída, você receberáincompletecomincomplete_details.reasondefinido comomax_output_tokens, às vezes antes de qualquer texto visível. O guia de raciocínio sugere reservar pelo menos 25.000 tokens para raciocínio e saída enquanto você experimenta.outputé um array. A resposta é o item comtype: "message", cujo conteúdo contémoutput_text. Leia-o por tipo, não por índice.usage.output_tokensinclui tokens de raciocínio, cobrados à taxa de saída.usage.output_tokens_details.reasoning_tokensmostra quantos.usage.input_tokens_detailsinformacached_tokensecache_write_tokens. É aí que o cache mais barato aparece.
Use a API Responses para qualquer coisa com ferramentas; o GPT-6.1 Sol suporta Chat Completions apenas para requisições sem ferramentas. O guia da API Responses cobre o formato da requisição com mais profundidade.
Escolha um nível de esforço de raciocínio
O esforço é o seu principal seletor de custo e qualidade, e medium é o padrão quando você o omite. O guia de seleção de modelo da OpenAI emparelha medium com “trabalho técnico complexo e entregas coordenadas que você espera revisar,” e xhigh com entregas polidas e decisões construídas a partir de evidências conflitantes. A publicação de lançamento da OpenAI adiciona resultados por configuração. Esses benchmarks são relatados pela OpenAI, e a tabela cita os deltas que a OpenAI declara em seu texto:
| Esforço | Comece aqui para | O que a OpenAI relata para GPT-6.1 Sol |
|---|---|---|
low |
Chat, extração, classificação, qualquer coisa que você rodou com none |
Em conversas sinalizadas por usuários, as respostas com erro factual caem de 11,4% (GPT-6 Sol) para 7,7% |
medium (padrão) |
Automações com agentes e fluxos de trabalho de chamada de ferramenta | AutomationBench 1.0.6: +2,2 pp sobre Claude Opus 5.5 por aproximadamente um terço do custo; +4,8 pp sobre GPT-6 Sol na mesma configuração |
high |
Depuração difícil e planejamento aprofundado | Nenhuma afirmação específica da configuração |
xhigh |
Entregas polidas e execuções assíncronas longas | Nenhuma afirmação específica da configuração |
max |
Uso de computador e tarefas de ciência complexas | OSWorld 2.0: +7 pp sobre GPT-6 Sol no máximo por menos da metade do custo. Terminal-Bench Science 0.1: $5,47 por tarefa, vs $23,21 para Opus 5.5 e $23,80 para GPT-6 Astra |
Duas ressalvas. O conjunto de fatos são conversas previamente sinalizadas por erros, não tráfego típico. E no Terminal-Bench Science, o GPT-6 Astra ainda pontua mais alto (68,1%), então a OpenAI recomenda o Astra para o trabalho científico mais difícil.
Para chamadas sensíveis à latência que usavam none, comece com low e meça. O guia de raciocínio descreve low como raciocínio eficiente “com um aumento modesto de latência.” Para mudar o esforço no meio de uma conversa sem quebrar o cache de prompts, anexe um item de entrada configuration_update em vez de mudar o reasoning.effort no nível da requisição.
Migrar de gpt-6-sol: quatro mudanças no código
- Troque o ID do modelo. Substitua
gpt-6-solporgpt-6.1-sol, e mantenha-o em configuração ou em uma variável de ambiente para que o rollback seja uma única edição. - Remapeie
noneeminimal. Orientação da OpenAI: uselowem vez denone, e comeceminimalemlowe compare em tarefas representativas. No GPT-6 Astra, que também não possuinone, enviá-lo retorna HTTP 400, então corrija isso antes de mover o tráfego. - Remova parâmetros de amostragem. Quando o esforço não for
none, removatemperature,top_petop_logprobs(elogprobsem Chat Completions). O código que emparelhavatemperaturecomnoneno GPT-6 Sol precisa disso. - Mova as chamadas de ferramenta de Chat Completions para Responses. O GPT-6 Sol permitia a chamada de funções em Chat Completions apenas com
reasoning_effort: "none". Essa combinação não tem equivalente no 6.1 Sol.
Então, execute novamente tudo o que depende de recenticidade: o corte de conhecimento muda de 20 para 30 de abril de 2026. Se você veio para o Sol do Astra, o guia de migração Astra para Sol cobre essa etapa anterior.
Preços de Batch, Flex, Fast e entrada em cache
Cada nível mantém a estrutura do GPT-6 Sol, com a coluna de entrada em cache pela metade. Os preços por 1M de tokens são da página de preços da API. A página do modelo adiciona que um prompt com mais de 272K tokens de entrada é cobrado em 2x as taxas de entrada e cache e 1,5x a saída para a requisição completa, a mesma regra que o GPT-6 Sol usa:
| Nível | Entrada | Entrada em cache | Escritas de cache | Saída |
|---|---|---|---|---|
| Standard | $2.00 | $0.10 | $2.50 | $10.00 |
| Batch | $1.00 | $0.05 | $1.25 | $5.00 |
| Flex | $1.00 | $0.05 | $1.25 | $5.00 |
| Fast | $4.00 | $0.20 | $5.00 | $20.00 |
| Padrão, prompt com mais de 272K tokens de entrada | $4.00 | $0.20 | $5.00 | $15.00 |
Flex é um service_tier: "flex" por requisição. Fast é service_tier: "fast", com "priority" aceito como alias. O modo Fast não está disponível com residência de dados na UE. O Ultrafast para GPT-6.1 Sol está “chegando em breve” e está amplamente disponível apenas para GPT-6 Astra hoje; veja modo Ultrafast da OpenAI. Para trabalhos noturnos, o guia da API OpenAI Batch detalha uma execução em lote.
O cache é onde a atualização economiza dinheiro. As leituras custam 0,05x a taxa de entrada no 6.1 Sol versus 0,1x no GPT-6 Sol, e as escritas custam 1,25x em ambos, de acordo com o guia de cache de prompts. Considere um prompt de sistema de 50.000 tokens reutilizado em 1.000 requisições. Uma escrita custa $0,125 em qualquer um dos modelos; as 999 leituras custam $9,99 no GPT-6 Sol e $5,00 no GPT-6.1 Sol. O prefixo mínimo armazenável em cache é de 1.024 tokens visíveis, e um prefixo em cache permanece elegível por pelo menos 30 minutos após sua última escrita ou reutilização. Para estratégia de ponto de interrupção, veja cache de prompts GPT-6.
Teste a troca no Apidog
Não mude a produção apenas com base nos preços de tabela. Envie a mesma requisição salva para ambos os IDs e compare o que retorna. No Apidog:
- Crie um ambiente com
OPENAI_API_KEY(armazenada como um segredo),MODEL_IDdefinido comogpt-6-soleEFFORTdefinido comomedium. - Crie
POST https://api.openai.com/v1/responsescom o cabeçalhoAuthorization: Bearer {{OPENAI_API_KEY}}e este corpo, então salve-o:
{
"model": "{{MODEL_ID}}",
"reasoning": {"effort": "{{EFFORT}}"},
"max_output_tokens": 25000,
"input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
}
- Adicione asserções: HTTP 200,
$.statusigual acompleted,$.output[*].typecontémmessage,$.usage.output_tokensé maior que 0, e$.usage.output_tokens_details.reasoning_tokensexiste. Em seguida, verifique o formato da saída da qual seu código depende, como JSON válido com as chaves que você analisa. - Adicione um script de pós-processamento que transforma o uso em dólares, usando a divisão de entrada do guia de cache de prompts da OpenAI:
const u = pm.response.json().usage;
const d = u.input_tokens_details || {};
const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");
const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;
const cost = ((u.input_tokens - cached - writes) * 2 + cached * cachedRate
+ writes * 2.5 + u.output_tokens * 10) / 1e6;
console.log(model, "cost per call $", cost.toFixed(5));
- Envie, defina
MODEL_IDparagpt-6.1-sole envie novamente. Comparereasoning_tokens,output_tokens, a resposta e o custo registrado. Se você estiver remapeando denone, execute a linha de base emnonee o candidato emlow.
Em seguida, mova a requisição e um punhado de prompts reais para um cenário de teste e execute o par a partir do Apidog CLI na CI. --env-var sobrescreve uma variável para uma execução, então um único cenário cobre ambos os modelos:
npm install -g apidog-cli
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6-sol" -r cli,junit
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit
Uma asserção falha o trabalho, e os relatórios JUnit fornecem ambas as execuções lado a lado. Para asserções em saídas que variam de execução para execução, veja testando agentes de IA não determinísticos.
FAQ
O GPT-6.1 Sol é mais caro que o GPT-6 Sol? Não. Ambos são listados por $2 de entrada e $10 de saída por 1M de tokens. A entrada em cache do GPT-6.1 Sol é de $0,10 versus $0,20, então cargas de trabalho com muito cache ficam mais baratas.
O que devo fazer com reasoning.effort: "none"? O GPT-6.1 Sol não suporta none nem minimal. Mapeie ambos para low, remova temperature e top_p, e execute novamente suas avaliações antes de mudar.
Posso usar o GPT-6.1 Sol com Chat Completions? Sim, para requisições sem ferramentas. A chamada de ferramenta requer a API Responses.
Existe um nível gratuito da API GPT-6.1 Sol? Não. As chamadas de API são cobradas por token desde a primeira requisição. O GPT-6.1 Sol é gratuito? cobre as rotas mais baratas.
Próximo passo
Salve a primeira requisição, execute-a no gpt-6-sol com seu esforço atual, depois no gpt-6.1-sol, e compare o uso e a saída em um prompt do seu próprio tráfego. Baixe o Apidog para manter ambas as execuções como asserções que você pode rodar novamente na CI. Pesando a Anthropic em vez disso? Veja GPT-6.1 Sol vs Claude Sonnet 5.5.
