GPT-6.1 Sol e Claude Sonnet 5.5 custam $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída, e foram lançados com um dia de diferença: Sonnet 5.5 em 28 de setembro de 2026, e GPT-6.1 Sol em 29 de setembro. Nenhum dos fornecedores fez benchmark de um contra o outro. A OpenAI comparou o GPT-6.1 Sol com o Claude Opus 5.5 e o Fable 5.1, e a Anthropic comparou o Sonnet 5.5 com o GPT-6 Sol, o Sol anterior. A maneira honesta de escolher é executar ambos nas suas próprias tarefas e comparar o custo por tarefa, não o preço por token.
Abaixo: especificações e preços lado a lado, o que cada fornecedor afirma e contra qual modelo, os números de terceiros (todos no GPT-6 Sol, não 6.1), e um método para você mesmo executar a comparação no Apidog. Para cada modelo individualmente, veja o que é GPT-6.1 Sol e o que é Claude Sonnet 5.5.
GPT-6.1 Sol vs Claude Sonnet 5.5: especificações e preços
Fontes: página de preços da OpenAI, visão geral do Sonnet 5.5 e preços da Anthropic, além da página do modelo GPT-6.1 Sol linkada abaixo.
| GPT-6.1 Sol | Claude Sonnet 5.5 | |
|---|---|---|
| ID do Modelo | gpt-6.1-sol |
claude-sonnet-5-5 (Bedrock: anthropic.claude-sonnet-5-5) |
| Lançado | 29 de setembro de 2026 | 28 de setembro de 2026 |
| Entrada / saída por 1M | $2 / $10 | $2 / $10 |
| Leituras de cache por 1M | $0.10 | $0.20 |
| Escritas de cache por 1M | $2.50 | $2.50 (5 minutos), $4 (1 hora) |
| Lote por 1M | $1 / $5 | $1 / $5 |
| Prompts acima de 272K tokens de entrada | $4 entrada, $0.20 cache, $15 saída para toda a requisição | Sem taxa adicional na janela de 1M |
| Nível mais rápido | Rápido por $4 / $20; Ultrafast "em breve" | Modo rápido não disponível |
| Janela de contexto | 1,050,000 (922,000 entrada máxima) | 1M |
| Saída máxima | 128,000 | 128K (300K em Lote com um cabeçalho beta) |
| Corte de conhecimento | 30 de abril de 2026 | Junho de 2026 |
| Níveis de esforço | low, medium (padrão), high, xhigh, max; sem none |
low, medium, high (padrão da API), xhigh, max; o "pensamento" não pode ser desativado (configuração mais baixa: between_tools) |
| Formato da API | Respostas (com ferramentas), Conclusões de Chat (sem ferramentas), Lote | Mensagens, Lote |
| Outras plataformas | OpenRouter (openai/gpt-6.1-sol) |
Bedrock, Google Cloud, Microsoft Foundry, Claude Platform na AWS |
| Acesso gratuito | Nenhum. Plus, Pro, Business, Enterprise e Edu obtêm no ChatGPT Work e Codex (não no Chat; Enterprise e Edu uma vez que um administrador o habilite, conforme a documentação dos modelos); sem nível de API gratuito | Qualquer um pode conversar com ele em Claude.ai; a API cobra por token |
Duas linhas são as mais importantes para o custo. As leituras de cache do GPT-6.1 Sol custam metade das do Sonnet 5.5, então reutilizar um prompt de sistema longo é mais barato na OpenAI. Acima de 272K tokens de entrada, o equilíbrio se inverte: a página do modelo GPT-6.1 Sol precifica a requisição completa em 2x as taxas de entrada e cache e 1.5x a saída, enquanto o Sonnet 5.5 permanece em $2 e $10. Um prompt de 400.000 tokens com uma resposta de 5.000 tokens custa cerca de $1.68 no GPT-6.1 Sol e $0.85 no Sonnet 5.5, sem cache.
O que cada fornecedor afirma, e contra qual modelo
| OpenAI sobre GPT-6.1 Sol | Anthropic sobre Claude Sonnet 5.5 | |
|---|---|---|
| Comparado com | GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 | Sonnet 5, Opus 5.5, GPT-6 Sol (GPT-5.6 Sol em dois gráficos) |
| Inclui o outro modelo | Não | Não (GPT-6.1 Sol ainda não existia) |
| Manchete | "Inteligência próxima à Astra" a um quinto dos preços padrão de tokens da Astra | 30%+ mais rápido que Sonnet 5, até 30% menos por tarefa |
| Quem realizou os testes | OpenAI (resultados da concorrência de relatórios públicos, conforme nota de rodapé) | Anthropic, mais Cognition, Cursor, Artificial Analysis e Surge AI para benchmarks específicos |
A postagem de lançamento do GPT-6.1 Sol da OpenAI apresenta estes resultados relatados pela OpenAI em seu texto:
- AutomationBench 1.0.6, esforço médio: +2.2 pp em relação ao Opus 5.5 com aproximadamente um terço do custo, e +4.8 pp em relação ao GPT-6 Sol.
- Terminal-Bench Science 0.1, esforço máximo: $5.47 por tarefa, contra $23.21 para o Opus 5.5. O GPT-6 Astra ainda pontua mais alto, com 68.1%.
- OSWorld 2.0 offline, esforço máximo: +7 pp em relação ao GPT-6 Sol por menos da metade do custo.
A postagem de lançamento do Sonnet 5.5 da Anthropic inclui uma coluna do GPT-6 Sol:
- FrontierCode 1.1, executado pela Cognition: Sonnet 5.5 pontua 52.1% em xhigh (46.2% em max) contra 49.3% para GPT-6 Sol. Em esforço alto, a Anthropic afirma que o Sonnet 5.5 iguala a melhor pontuação do GPT-6 Sol por cerca de um quinto do custo.
- GDPval-AA v2.1 e AA-Briefcase v1.1, executados pela Artificial Analysis: 1844 contra 1487, e 1811 contra 1483.
A análise dos benchmarks do Sonnet 5.5 cobre o restante da tabela da Anthropic.
Opus 5.5 aparece em ambos os gráficos, e ambos os fornecedores relatam AutomationBench e Terminal-Bench Science, então é tentador fazer a ponte entre os dois. Os números não se alinham. A OpenAI relata o AutomationBench 1.0.6 com esforço médio em seu próprio ambiente de teste, enquanto a tabela resumida do cartão de sistema da Anthropic executa seus modelos Claude com esforço máximo (Sonnet 5.5 44.7, Opus 5.5 42.5; GPT-6 Sol 32.0). A Anthropic dá ao Sonnet 5.5 59.9% no Terminal-Bench Science, mas o texto da OpenAI não fornece uma pontuação bruta para o GPT-6.1 Sol. E a OpenAI testou o uso de computador no OSWorld 2.0 offline, a Anthropic no OSWorld 2.1. A comparação GPT-6 Sol vs Claude Opus 5.5 encontrou a mesma dificuldade.
O que terceiros mediram (no GPT-6 Sol, não no 6.1)
Cada comparação de terceiros nos resultados de pesquisa emparelha o Sonnet 5.5 com o GPT-6 Sol. A mais completa é da Artificial Analysis, cujo Intelligence Index v4.3.2 agrega 10 avaliações:
| Esforço | Índice Sonnet 5.5 | Sonnet 5.5 custo por tarefa | Índice GPT-6 Sol | GPT-6 Sol custo por tarefa |
|---|---|---|---|---|
| médio | 41 | $0.59 | 40 | $0.25 |
| alto | 47 | $1.08 | 43 | $0.38 |
| xhigh | 52 | $2.74 | 44 | $0.52 |
| máximo | 56 | $7.60 | 48 | $1.05 |
No esforço máximo, a mesma página mede o Sonnet 5.5 em 138 tokens de saída por segundo e o GPT-6 Sol em 76. O Sonnet 5.5 pontua mais alto e custa mais por tarefa em todos os esforços mostrados, apesar dos preços de tabela idênticos; o consumo de tokens é a diferença. O Sonnet 5.5 em alto (47, $1.08) fica ao lado do GPT-6 Sol em máximo (48, $1.05).
Os próprios dados de gráfico da Anthropic têm dois lados. No AA-Briefcase, o GPT-6 Sol custa menos por tarefa em todos os esforços ($0.34 contra $1.64 em médio) enquanto o Sonnet 5.5 pontua mais alto. No FrontierCode, o Sonnet 5.5 em alto atinge 49.4% por $0.42 por tarefa, contra 49.3% do GPT-6 Sol em máximo por $2.07.
Tudo isso é o Sol mais antigo. A OpenAI diz que o GPT-6.1 Sol supera o GPT-6 Sol com o mesmo ou menor esforço em vários benchmarks, então espere que sua linha se mova assim que terceiros o testarem.
Onde cada um é provavelmente mais forte, segundo a própria descrição dos fornecedores
GPT-6.1 Sol. A OpenAI o promove para "codificação complexa, uso de computador e trabalho profissional quando você deseja um desempenho próximo ao Astra com um custo menor". Seus ganhos declarados estão em automação agêntica, uso de computador e tarefas científicas, além de menos erros factuais com baixo esforço. Em relação ao preço, favorece cargas de trabalho intensivas em cache abaixo de 272K tokens de entrada, e é o único dos dois com um nível de velocidade pago (Fast).
Claude Sonnet 5.5. A Anthropic o promove para tarefas cotidianas bem definidas, correção de bugs e documentos, slides e planilhas aprimorados, e afirma que o Opus 5.5 "continua claramente mais forte em trabalhos complexos e abertos" (veja Sonnet 5.5 vs Opus 5.5). Suas forças relatadas são codificação agêntica (70.6% no Terminal-Bench 4.0 no máximo, executado pela Anthropic), trabalho de conhecimento e uso de computador (80.1% parcial no OSWorld 2.1). Em relação ao preço, favorece prompts acima de 272K tokens, e roda em Bedrock, Google Cloud e Microsoft Foundry.
Dois comportamentos distorcem um teste ingênuo. O esforço padrão difere (medium para GPT-6.1 Sol, high para Sonnet 5.5 na API), então compare as configurações correspondentes. E nenhum aceita controles de amostragem: o Sonnet 5.5 retorna 400 em temperature, top_p ou top_k não padrão, e a orientação do GPT-6 da OpenAI diz para diminuir temperature e top_p quando o esforço não for none. Controle a variância com execuções repetidas.
Execute a comparação você mesmo no Apidog
Escolha de 20 a 50 tarefas do seu tráfego real com respostas verificáveis, como um campo JSON ou um rótulo. Em seguida, no Apidog:
- Crie um ambiente com
OPENAI_API_KEYeANTHROPIC_API_KEYcomo segredos, além deEFFORT. - Salve duas requisições que compartilham uma variável
{{prompt}}. Os formatos diferem (referência de Respostas, referência de Mensagens); a comparação de formatos de API explica o porquê:
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json
{"model": "gpt-6.1-sol", "reasoning": {"effort": "{{EFFORT}}"},
"max_output_tokens": 25000, "input": "{{prompt}}"}
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json
{"model": "claude-sonnet-5-5", "max_tokens": 25000,
"output_config": {"effort": "{{EFFORT}}"},
"messages": [{"role": "user", "content": "{{prompt}}"}]}
- Adicione asserções para cada formato, e então uma sobre a própria resposta contra uma coluna
expected:
| Verificação | Respostas OpenAI | Mensagens Anthropic |
|---|---|---|
| Finalizado normalmente | $.status é igual a completed |
$.stop_reason é igual a end_turn |
| Resposta presente | $.output[*].type contém message |
$.content[*].type contém text |
| Tokens de saída, raciocínio incluído | $.usage.output_tokens |
$.usage.output_tokens |
| Leituras de cache | $.usage.input_tokens_details.cached_tokens |
$.usage.cache_read_input_tokens |
| Escritas de cache | $.usage.input_tokens_details.cache_write_tokens |
$.usage.cache_creation_input_tokens |
- Precifique cada resposta em um script pós-processador. O
input_tokensda OpenAI inclui tokens em cache e tokens de escrita de cache, então subtraia-os antes de aplicar a taxa de $2 (cache de prompt da OpenAI). Oinput_tokensda Anthropic conta apenas tokens após o último ponto de interrupção do cache (cache de prompt da Anthropic). Aplique a regra de 272K no lado da OpenAI. - Coloque ambas as requisições em um cenário de teste, mantenha os prompts em uma única linha, sem aspas duplas, em um CSV, e execute-o a partir da CLI do Apidog em cada nível de esforço que você deseja:
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
-d prompts.csv --env-var "EFFORT=medium" -r cli,junit
Divida o gasto total pelo número de tarefas aprovadas: esse é o seu custo por tarefa. Execute pelo menos medium e high em ambos, já que o mesmo nome de esforço não é calibrado da mesma forma entre os fornecedores. Para detalhes da requisição, veja o guia da API GPT-6.1 Sol e como usar a API Claude Sonnet 5.5.
FAQ
O GPT-6.1 Sol é mais barato que o Claude Sonnet 5.5? Mesmo preço de tabela, $2/$10 por 1M. As leituras de cache do GPT-6.1 Sol são mais baratas; o Sonnet 5.5 é mais barato acima de 272K tokens de entrada. O custo real depende dos tokens usados por tarefa.
Qual é melhor em codificação? Não há um benchmark compartilhado. A Anthropic relata o Sonnet 5.5 acima do GPT-6 Sol no FrontierCode; a OpenAI relata o GPT-6.1 Sol superando a melhor pontuação DeepSWE do GPT-6 Sol por 6.4 pp. Teste em seu próprio repositório.
Qual é mais rápido? A Artificial Analysis mediu o Sonnet 5.5 em 138 tokens por segundo e o GPT-6 Sol em 76, ambos com esforço máximo. Ainda não há números de terceiros para o GPT-6.1 Sol.
Algum é gratuito? O GPT-6.1 Sol não tem nível gratuito. O Sonnet 5.5 está disponível nos aplicativos de chat Claude.ai, mas a API cobra por token. Veja como usar o Claude Sonnet 5.5 gratuitamente.
Escolha executando ambos
Pegue dez tarefas do seu backlog, execute ambos os modelos em medium e high, e compare o custo por tarefa aprovada. Baixe o Apidog para manter o par como um cenário que você pode reexecutar quando a Artificial Analysis publicar os números do GPT-6.1 Sol ou qualquer fornecedor lançar um novo snapshot.
