Três APIs de ponta foram lançadas ou tiveram seus preços reajustados com uma semana de diferença entre si, e elas se encaixam em três faixas de preço distintas. O Google lançou o Gemini 3.8 Flash em 2 de setembro de 2026, por US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída. A Anthropic lançou o Claude Fable 5.1 no dia anterior por US$ 10 e US$ 50. O GPT-5.6 Sol da OpenAI se posiciona entre eles por US$ 5 e US$ 30. No Índice de Inteligência independente da Artificial Analysis, os três modelos pontuam 59, 57 e 59. Essa é a comparação completa em uma frase: um modelo com preço de cerca de um treze avos do nível superior está pontuando igual a ele no único índice que testa todos os três da mesma forma.
O segredo está na palavra “índice”. Benchmarks contam respostas por tarefa. Sua fatura conta tokens por tarefa, e o Gemini 3.8 Flash é construído para gastar mais deles. Este guia compara os três lado a lado em especificações, nas próprias tabelas de benchmark do Google (onde o Fable 5.1 está ausente, e explicamos o porquê), nos números independentes da Artificial Analysis e na aritmética de preços. Em seguida, ele oferece uma regra simples para qual API se encaixa em qual carga de trabalho. O pilar do Gemini 3.8 Flash aborda o modelo em seus próprios termos, e a publicação de lançamento do Google é a fonte primária para todas as afirmações do Google abaixo.
Uma nota sobre o cronograma. Nossa comparação Gemini 3.7 Flash vs Claude vs GPT de agosto comparou com o Claude Fable 5, não o 5.1. A Anthropic substituiu esse modelo em 1º de setembro, então esta é uma nova comparação, não uma atualização.
Especificações em resumo
| Gemini 3.8 Flash | Claude Fable 5.1 | GPT-5.6 Sol | |
|---|---|---|---|
| Fornecedor | Anthropic | OpenAI | |
| Janela de contexto | 1.048.576 tokens | 1M tokens | 1M tokens |
| Saída máxima | 65.536 tokens | 128K tokens | 128K tokens |
| Preço de entrada (por 1M) | US$ 0,75 introdutório, US$ 1,50 a partir de 1º de jan de 2027 | US$ 10 | US$ 5 |
| Preço de saída (por 1M) | US$ 3,75 introdutório, US$ 7,50 a partir de 1º de jan de 2027 | US$ 50 | US$ 30 |
| Leitura de cache (por 1M) | US$ 0,075 introdutório, US$ 0,15 a partir de 1º de jan | US$ 0,25 | US$ 0,50 |
| Corte de conhecimento | Março de 2026 | Junho de 2026 | Não listado aqui |
| Controle de raciocínio | thinking_level baixa / média / alta (média é o padrão) |
Raciocínio estendido, sempre ativo | Níveis de esforço até xhigh |
| Artificial Analysis index | 59 (alta) | 57 (média) | 59 (xhigh) |
Duas coisas se destacam antes de qualquer benchmark. O Gemini 3.8 Flash tem metade da saída máxima dos outros dois, 65.536 tokens contra 128K, o que é mais relevante para documentos longos de única vez do que para ciclos de agentes que emitem passos curtos. E seu preço de introdução expira em 31 de dezembro de 2026: a partir de 1º de janeiro, ambas as taxas do Gemini dobram, o que altera todas as proporções neste artigo. O guia de preços do Gemini 3.8 Flash detalha as taxas de duplicação, cache, batch e grounding.
O número independente: 59, 57, 59
A Artificial Analysis executa as mesmas nove avaliações contra todos os modelos e publica uma pontuação de Índice de Inteligência. O Gemini 3.8 Flash, no nível de raciocínio alto, pontua 59, acima dos 56 do 3.7 Flash e 52 do 3.6 Flash. O GPT-5.6 Sol, com esforço xhigh, também pontua 59. O Claude Fable 5.1, com esforço médio, pontua 57, empatado com o GPT-5.6 Terra no máximo e o Muse Spark 1.2 no xhigh. O Grok 4.6, no nível médio, é o outro modelo com 59.
Leia os rótulos dos níveis de raciocínio antes de ler os números. O Fable 5.1 foi testado no nível médio, não em sua configuração mais alta, e o Sol no xhigh, sua configuração mais alta. Uma diferença de dois pontos entre diferentes níveis de esforço não é um ranking, e a Artificial Analysis o lista dessa forma por um motivo. A afirmação defensável é mais restrita: nas configurações testadas, o Gemini 3.8 Flash se iguala aos dois modelos premium neste índice, e é o modelo mais barato com 59 pontos por uma ampla margem.
O mesmo artigo mediu o custo dessa pontuação. O Gemini 3.8 Flash no nível alto usou 48.000 tokens de saída por tarefa em média, 30% a mais que o 3.7 Flash, e US$ 0,58 por tarefa em gasto de API. O tempo por tarefa foi de 2,5 minutos, a velocidade de saída de cerca de 300 tokens por segundo, e o tempo para o primeiro token de 13,3 segundos na execução de alto raciocínio porque o modelo pensa antes de escrever. No τ³-Banking, a avaliação de uso de ferramentas, ele pontuou 45%, 12 pontos acima do 3.7 Flash. Mantenha esses números em mente quando o preço por token parecer bom demais.
Tabelas de benchmark do Google e quem está faltando
A página Flash do Google publica três linhas entre fornecedores em formato de texto. O Claude Fable 5.1 não está nelas. As tabelas do Google trazem o Opus 5 e o Sonnet 5 da Anthropic, e o Fable 5.1 havia sido lançado publicamente um dia antes de as tabelas serem publicadas. Portanto, a coluna da Anthropic abaixo é o Opus 5 (US$ 5 / US$ 25) e o Sonnet 5 (US$ 2 / US$ 10), e não o modelo de US$ 10 / US$ 50 sobre o qual este artigo trata. Considere-o como o melhor proxy disponível, não uma correspondência direta.
| Benchmark (executado pelo Google) | Gemini 3.8 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|
| HLE-Verified | 54,9% | 54,4% | 31,0% | 54,5% | 51,1% |
| Vals Finance Agent v2 | 61,4% | 58,6% | 53,9% | 53,8% | 54,4% |
| Harvey Legal Agent Benchmark | 10,0% | 6,7% | 5,0% | 2,5% | 0,8% |
HLE-Verified é um empate triplo: 54,9, 54,4 e 54,5 estão dentro de meio ponto um do outro, com o Sonnet 5 bem atrás. Vals Finance Agent v2 é onde o 3.8 Flash se destaca, 2,8 pontos acima do Opus 5 e 7,6 acima do Sol em uma tarefa financeira agêntica de várias etapas. Harvey Legal é o caso incomum: todos os modelos pontuam abaixo de 11%, então a ordem diz mais do que as lacunas.
O que o Google não publicou em formato de texto é igualmente importante. Não há dados de SWE-Bench Pro, Terminal-bench ou OSWorld para o 3.8 Flash, e o resultado do DeepSWE v1.1 aparece apenas como uma alegação de que o modelo “supera a maioria dos modelos de fronteira maiores” por “uma fração do custo”, com o número em uma tabela de imagem, não em texto. Para comparações de codificação e uso de computador, é preciso consultar as próprias execuções de cada fornecedor, que não se sobrepõem. As da Anthropic estão no detalhamento dos benchmarks do Claude Fable 5.1; as da OpenAI estão nos benchmarks do GPT-5.6 Sol. Nenhum fornecedor executou o modelo do outro, então a Artificial Analysis continua sendo a única fonte de comparação direta.
A diferença de preço, linha por linha
Nas taxas de introdução, a aritmética é direta. A entrada de US$ 10 do Fable 5.1 é 13,3x a de US$ 0,75 do Gemini 3.8 Flash, e sua saída de US$ 50 é 13,3x os US$ 3,75. A entrada de US$ 5 do GPT-5.6 Sol é 6,7x, e sua saída de US$ 30 é 8x. As leituras de cache diminuem a diferença: US$ 0,075 no 3.8 Flash, US$ 0,25 no Fable 5.1 (3,3x) e US$ 0,50 no Sol (6,7x). A leitura de cache do Fable 5.1 é metade da do Sol, que é a única linha onde o modelo mais caro não é o mais caro.
Um exemplo prático torna isso concreto. Considere uma execução que consome 1 milhão de tokens de entrada e 200.000 tokens de saída, todos sem cache.
- Gemini 3.8 Flash: US$ 0,75 + US$ 0,75 = US$ 1,50
- GPT-5.6 Sol: US$ 5,00 + US$ 6,00 = US$ 11,00
- Claude Fable 5.1: US$ 10,00 + US$ 10,00 = US$ 20,00
A partir de 1º de janeiro de 2027, a mesma execução do Gemini custará US$ 3,00, e as diferenças se comprimem para 3,7x para o Sol e 6,7x para o Fable 5.1. A duplicação também se aplica ao 3.6 Flash e 3.7 Flash, então não há um Gemini Flash mais barato para recorrer. A página de preços da Anthropic lista as taxas do Fable 5.1, e nossos guia de preços do Claude Fable 5.1 e guia de preços do GPT-5.6 cobrem os níveis de batch e cache para cada um.
Custo por tarefa, não por token
Aqui está a ressalva que desfaz a versão simplificada dessa matemática. O Google afirma que o Gemini 3.8 Flash “pode usar mais tokens em tarefas mais longas e complexas, por design”. Em problemas difíceis, ele executa etapas de raciocínio menores, verifica seu trabalho e chama ferramentas iterativamente. A Artificial Analysis mediu o efeito: 48.000 tokens de saída por tarefa no nível alto, um aumento de 30% em relação ao 3.7 Flash, então o custo para executar seu índice subiu de US$ 0,40 por tarefa no 3.7 Flash para US$ 0,58 no 3.8 Flash com preços por token inalterados. No nível médio, o custo é de US$ 0,41 por tarefa e no nível baixo, US$ 0,24.
Duas consequências se seguem. Primeiro, uma diferença de 13,3x por token não é uma diferença de 13,3x na fatura se o modelo premium terminar em menos tokens ou menos ciclos de ferramentas. A Artificial Analysis não publicou um número comparável de custo por tarefa para Fable 5.1 ou Sol no texto que temos, então meça em seus próprios prompts antes de confiar em qualquer direção do multiplicador. Segundo, no Gemini, o nível de raciocínio é a alavanca de custo. Diminuir uma rota de alta para baixa reduziu o custo por tarefa em mais da metade no conjunto da Artificial Analysis, e o guia de níveis de raciocínio mostra como configurá-lo por endpoint. A comparação 3.8 Flash vs 3.7 Flash aborda o caso em que o modelo mais antigo, com 31% menos por tarefa, ainda é a melhor compra.
Quando escolher cada um
Escolha Gemini 3.8 Flash para volume e agentes com custo otimizado
Se você executa milhares de tarefas de agente por dia, o 3.8 Flash é o padrão. Ele se iguala aos modelos premium no índice independente, lidera as linhas de agente financeiro e jurídico do Google e custa uma fração por token mesmo após a duplicação de janeiro. Ele também aceita entradas de vídeo, áudio e PDF nativamente, oferece Batch com 50% de desconto, inclui 5.000 solicitações gratuitas de grounding do Google Search por mês e tem um nível gratuito para prototipagem. As desvantagens: saída apenas em texto, sem Live API, um teto de saída de 65.536 tokens e um apetite por tokens que você deve considerar no orçamento para níveis médio ou alto.
Escolha Claude Fable 5.1 para o raciocínio de longo prazo mais difícil
O Fable 5.1 é o modelo para escalar, não para começar. Seu caso é o trabalho onde uma resposta errada custa mais do que os tokens: agentes de pesquisa de várias horas, longas sessões de terminal, cadeias de raciocínio onde as avaliações de um modelo mais barato ficam aquém. Sua saída de 128K e as leituras de cache de US$ 0,25 são adequadas para ciclos de agentes pesados em prefixos que reutilizam o mesmo grande contexto a cada turno; nesses casos, a linha de cache torna o multiplicador efetivo muito menor que 13,3x. Consulte o que é Claude Fable 5.1 para a folha de especificações do próprio modelo.
Escolha GPT-5.6 Sol para execuções de agentes no ecossistema OpenAI
O Sol pontua 59 no xhigh, empata com o 3.8 Flash no HLE-Verified e vem com 128K de saída por US$ 5 / US$ 30. Se seus agentes, avaliações e ferramentas já estão no stack da OpenAI, o Sol é o nível premium que não exige um segundo fornecedor. Ele tem as leituras de cache mais caras dos três, então se encaixa melhor em execuções de contexto fresco do que em sessões longas com cache. A comparação Grok 4.6 vs GPT-5.6 vs Claude Fable 5 mostra como o Sol se saiu contra o antigo carro-chefe da Anthropic.
Teste os três em um único workspace do Apidog
Todo argumento acima termina da mesma forma: meça em seus próprios prompts. O Apidog é um cliente de API e plataforma de teste, então ele não executa nenhum desses modelos, mas é uma maneira rápida de enviar a mesma solicitação para todos os três provedores e comparar o que retorna.
A configuração é um projeto com três ambientes. Cada ambiente contém uma URL base e uma variável de chave: https://generativelanguage.googleapis.com com GEMINI_API_KEY, a base da Anthropic com sua chave Claude e a base da OpenAI com sua chave OpenAI. As chaves permanecem em variáveis de ambiente, nunca no corpo da solicitação ou na coleção compartilhada.
Em seguida, crie um cenário de teste com três etapas de solicitação que contenham o mesmo prompt. A etapa do Gemini faz POST para /v1beta/interactions com "model": "gemini-3.8-flash" e "thinking_level": "medium"; as outras duas fazem POST para o endpoint de chat ou mensagens de seus respectivos provedores. Em cada etapa, adicione asserções que importam para uma comparação: HTTP 200, um caminho JSON que confirme a presença da resposta e um limite no campo de uso de tokens para que uma execução que de repente gaste o dobro de tokens de pensamento falhe ruidosamente. No Gemini, esse campo é usageMetadata.thoughtsTokenCount para o endpoint legado; faça asserções no bloco de uso equivalente para os outros dois.
Execute o cenário contra um conjunto de prompts de referência e, em seguida, agende-o para ser executado diariamente. Quando um fornecedor altera os padrões ou um modelo começa a gastar mais tokens, a asserção falha o avisará antes que a fatura chegue. O guia de teste de API de agentes de IA aborda a versão multi-turno desse padrão, e o agendamento de testes de API no Apidog aborda a execução recorrente. Baixe o Apidog para configurar os três ambientes.
Perguntas Frequentes (FAQ)
O Gemini 3.8 Flash é melhor que o Claude Fable 5.1?
No índice da Artificial Analysis, o 3.8 Flash no nível alto pontua 59 e o Fable 5.1 no nível médio pontua 57, então eles estão próximos nas configurações testadas. As tabelas do Google não incluem o Fable 5.1, e os benchmarks da Anthropic não incluem o 3.8 Flash, então não há uma comparação direta mais ampla. Por token, o Flash é 13,3x mais barato nas taxas de introdução.
Qual dos três é o mais barato para cargas de trabalho de agente?
O Gemini 3.8 Flash por uma ampla margem por token, a US$ 0,75 / US$ 3,75 até 31 de dezembro de 2026. Por tarefa, a Artificial Analysis mediu US$ 0,58 no nível alto, US$ 0,41 no nível médio e US$ 0,24 no nível baixo, porque o modelo gasta cerca de 30% mais tokens de saída do que o 3.7 Flash. Meça o custo por tarefa concluída, não por token, antes de se comprometer.
Todos os três têm uma janela de contexto de 1M?
Sim. O Gemini 3.8 Flash aceita 1.048.576 tokens de entrada, e o Fable 5.1 e o GPT-5.6 Sol ambos listam 1M. A saída máxima difere: 65.536 tokens no 3.8 Flash contra 128K nos outros dois.
Por que o Claude Fable 5.1 não está nas tabelas de benchmark do Google?
As linhas publicadas do Google listam Claude Opus 5 e Claude Sonnet 5 como as entradas da Anthropic. O Fable 5.1 foi lançado em 1º de setembro, um dia antes do 3.8 Flash, então não foi incluído. Para os próprios números do Fable 5.1 executados pela Anthropic, consulte a comparação Claude Fable 5.1 vs Opus 5.
A vantagem de preço do Gemini sobrevive a 2027?
Parcialmente. A partir de 1º de janeiro de 2027, o Gemini 3.8 Flash passa para US$ 1,50 / US$ 7,50, o que torna o Fable 5.1 6,7x em ambas as linhas e o Sol 3,3x na entrada e 4x na saída. Ainda mais barato, mas metade da diferença.
Qual chamar primeiro
Comece com o Gemini 3.8 Flash para qualquer coisa que você execute em volume, defina o thinking_level por rota e observe os tokens por tarefa, não o preço de tabela. Escale para o Claude Fable 5.1 onde suas avaliações em modelos mais baratos são insuficientes e o contexto é armazenado em cache em várias rodadas. Use o GPT-5.6 Sol quando o restante do seu stack for OpenAI e você quiser um nível premium sem um segundo fornecedor. Seja qual for sua escolha, passe o mesmo prompt pelos três em um cenário de teste primeiro; a proporção de preço é pública, mas a proporção de custo por tarefa em seus prompts é sua para medir.
