A Anthropic lançou o Claude Opus 4.8 em 28 de maio de 2026 e o disponibilizou no mesmo dia através da API Claude, aplicativos Claude, Claude Code e as principais plataformas de nuvem. É o modelo mais capaz da família Claude, construído para raciocínio complexo, codificação agêntica de longo prazo e trabalho de alta autonomia. O ID do modelo da API é claude-opus-4-8.
Se você já desenvolve no Opus 4.7, a atualização é uma simples troca de modelo. A principal mudança não é um novo nível de preço ou uma janela de contexto maior; ambos permanecem os mesmos. É a qualidade. De acordo com o anúncio da Anthropic, o Opus 4.8 é cerca de quatro vezes menos propenso que o 4.7 a deixar uma falha no código passar despercebida, e é mais honesto sobre o que não sabe. Este guia cobre o que mudou, como acessá-lo e se vale a pena a troca.
A versão resumida
Três fatos importam no primeiro dia:
- ID do modelo
claude-opus-4-8: disponível agora na API Claude, AWS, Vertex AI e Microsoft Foundry - Mesmo preço do Opus 4.7: $5 por milhão de tokens de entrada, $25 por milhão de tokens de saída no modo padrão
- Contexto de 1M de tokens, saída de 128K de tokens: inalterado em relação ao 4.7, então seus orçamentos de tokens são mantidos
O que você ganha além disso:
- Um novo parâmetro
effortque troca a exaustividade pela eficiência de tokens em toda a resposta - Pensamento adaptativo, onde o modelo decide o quanto raciocinar por requisição
- Fluxos de trabalho Dinâmicos no Claude Code, que podem iniciar centenas de subagentes paralelos em uma única sessão
- Melhor honestidade, menos defeitos de código passando despercebidos e chamadas de ferramentas mais eficientes
Para os cálculos completos por token e cenários de custo, consulte a análise de preços do Opus 4.8. Para começar a desenvolver, vá para o guia da API do Opus 4.8.
O que há de realmente novo no Opus 4.8
O Opus 4.8 mantém as especificações do 4.7 e melhora o modelo internamente. Os ganhos se agrupam em quatro áreas.
Qualidade do código. O modelo detecta seus próprios erros com mais frequência. A Anthropic relata uma queda de aproximadamente 4x nas falhas que passam despercebidas na revisão em comparação com o 4.7. Para codificação agêntica, isso significa menos bugs silenciosos nos diffs gerados.

Honestidade e alinhamento. O Opus 4.8 sinaliza a incerteza com mais facilidade e faz menos afirmações não suportadas. A Anthropic também relata taxas mais baixas de engano e cooperação com uso indevido do que o 4.7. Se você executa agentes sem supervisão, esse julgamento importa mais do que um ponto de benchmark.
Chamada de ferramentas. O modelo escolhe as ferramentas com mais eficiência e desperdiça menos chamadas, o que reduz tanto a latência quanto o gasto de tokens em loops de agente.
Controle de esforço. Esta é a maior mudança visível na API, e merece uma seção própria.
Controle de esforço: um modelo, cinco marchas
O parâmetro effort permite que você defina o quão avidamente Claude gasta tokens. Ele reside dentro de output_config e aceita cinco níveis: low (baixo), medium (médio), high (alto), xhigh (muito alto) e max (máximo). O padrão é high em todas as interfaces, incluindo a API e o Claude Code.
{
"model": "claude-opus-4-8",
"max_tokens": 4096,
"messages": [{"role": "user", "content": "Refatorar este módulo."}],
"output_config": { "effort": "xhigh" }
}
O detalhe chave: o esforço afeta todos os tokens, não apenas o raciocínio. Isso inclui texto, chamadas de ferramentas e argumentos de funções. Um esforço menor significa que Claude faz menos chamadas de ferramentas e escreve respostas mais concisas. Um esforço maior significa análise mais profunda e trabalho mais completo.
A orientação da Anthropic para o Opus 4.8 é começar em xhigh para tarefas de codificação e agênticas, manter high como o mínimo para a maioria dos trabalhos que exigem muito raciocínio, e diminuir para medium ou low somente depois que suas avaliações confirmarem que o nível mais baixo mantém a qualidade. Detalhes completos estão na documentação de esforço da Anthropic.
O pensamento adaptativo substitui os orçamentos manuais
O Opus 4.8 usa pensamento adaptativo. Você define thinking: {type: "adaptive"} e o modelo decide quando e o quanto raciocinar por requisição. Em high, xhigh e max effort, ele quase sempre pensa profundamente. Em níveis mais baixos, ele pode pular o pensamento em problemas simples.
Uma coisa a saber antes de migrar: o pensamento estendido manual com budget_tokens não é suportado no Opus 4.8 e retorna um erro 400. Se você usava esse padrão de um Opus mais antigo, mude para o pensamento adaptativo mais o parâmetro de esforço. Detalhamos a forma exata da requisição no guia da API do Opus 4.8.
Fluxos de Trabalho Dinâmicos no Claude Code
O recurso mais chamativo é lançado dentro do Claude Code. Os Fluxos de Trabalho Dinâmicos permitem que uma única sessão lance centenas de subagentes paralelos para lidar com tarefas grandes e ramificadas. Sob o capô, isso é o nível de esforço xhigh pareado com mensagens de sistema no meio da conversa, a mesma atualização da API de Mensagens que agora aceita entradas de sistema no meio de uma conversa, em vez de apenas no início.
Essa capacidade no meio da conversa é o que dá a um agente orquestrador permissão permanente para gerar trabalhadores à medida que a tarefa se desenrola. Se você quiser a mecânica e como construir um modo de orquestração semelhante através da API bruta, consulte o mergulho profundo nos Fluxos de Trabalho Dinâmicos do Claude Code. Para entender como o Claude Code estrutura as execuções de agentes, nossa análise da arquitetura do arnés de agente do Claude Code é uma boa introdução.
Destaques do benchmark
Os números de destaque da Anthropic se concentram no trabalho agêntico:
- Supera o GPT-5.5 no benchmark Super-Agent, o conjunto que mede a conclusão de tarefas de ponta a ponta
- Lidera o Legal Agent Benchmark e é o primeiro modelo a ultrapassar 10% no geral
- 84% no Online-Mind2Web, um teste de agente de navegação web
Esses são resultados de agente, não de chat, o que indica o foco do Opus 4.8. Para um confronto direto com outros modelos de ponta, leia Opus 4.8 vs GPT-5.5 vs Gemini 3.5. A comparação anterior Gemini 3.5 vs GPT-5.5 vs Opus 4.7 ainda é válida para a linha de base 4.7.
Opus 4.8 vs Opus 4.7 em um relance
| Atributo | Opus 4.7 | Opus 4.8 |
|---|---|---|
| ID da API | claude-opus-4-7 |
claude-opus-4-8 |
| Preço de entrada | $5 / 1M tokens | $5 / 1M tokens |
| Preço de saída | $25 / 1M tokens | $25 / 1M tokens |
| Janela de contexto | 1M tokens | 1M tokens |
| Saída máxima | 128K tokens | 128K tokens |
| Níveis de esforço | baixo a máximo | baixo a máximo |
| Defeitos de código passados | linha de base | ~4x menos |
| Honestidade / alinhamento | linha de base | melhorado |
| Data limite de conhecimento | Jan 2026 | Jan 2026 |
As especificações são idênticas propositalmente. Você está pagando a mesma taxa por um modelo que comete menos erros, então para a maioria das equipes a migração é de baixo risco. Teste seus esquemas de ferramentas e avaliações após a troca e, em seguida, implemente.
Como acessar o Claude Opus 4.8
Você tem quatro portas de entrada:
- API Claude: use o ID do modelo
claude-opus-4-8contra o endpoint de Mensagens. Comece com o guia da API do Opus 4.8. - Aplicativos Claude: é o modelo padrão de ponta em claude.ai para planos pagos, com acesso limitado no plano gratuito.
- Claude Code: disponível como o modelo principal, com Fluxos de Trabalho Dinâmicos quando você opta pelo modo de alto esforço.
- Plataformas de nuvem: AWS (
anthropic.claude-opus-4-8no Bedrock), Vertex AI (claude-opus-4-8) e Microsoft Foundry, onde a janela de contexto é limitada a 200K tokens.
Se você quiser experimentá-lo sem um plano de API pago primeiro, o guia de como usar o Opus 4.8 gratuitamente cobre os caminhos legítimos de baixo custo.
Quem deve usar o Opus 4.8
O Opus 4.8 é construído para a parte mais difícil do espectro de cargas de trabalho. Procure por ele quando:
- Você está executando longas sessões de codificação agêntica onde um bug silencioso é caro
- Você precisa de um agente para tomar decisões sensatas sem supervisão
- Você está orquestrando o uso de ferramentas em várias etapas e quer menos chamadas desperdiçadas
- A tarefa realmente precisa de raciocínio de ponta, não de uma classificação rápida
Para trabalhos de alto volume, sensíveis à latência ou simples, um modelo menor ou um nível de esforço mais baixo será mais adequado e custará menos. O objetivo do controle de esforço é que você não precisa mais trocar de modelo para trocar de marcha.
Testando o Opus 4.8 antes de implantá-lo
Uma troca de modelo é fácil de escrever e fácil de errar. Fragmentos de streaming, validação de chamadas de ferramentas, o novo formato output_config e as respostas de pensamento adaptativo, tudo isso muda os payloads que seu código precisa analisar. Antes de enviar claude-opus-4-8 para produção, reproduza suas requisições reais contra ele e compare as saídas.

Apidog gerencia toda a superfície da API de Mensagens em um único espaço de trabalho:
- Salve o endpoint do Opus 4.8 como uma requisição, anexe sua
x-api-keye clique em Enviar - Troque
claude-opus-4-7porclaude-opus-4-8na mesma requisição e compare as respostas - Visualize os fragmentos de streaming sendo renderizados inline com os tempos por fragmento
- Adicione asserções que detectam desvio de esquema ao mudar os níveis de
effort - Simule o endpoint para que você possa testar o código downstream sem gastar créditos
Baixe o Apidog, aponte uma requisição para o endpoint de Mensagens e cole o snippet curl do guia da API. A configuração leva cerca de dois minutos.
FAQ
O Claude Opus 4.8 é melhor que o Opus 4.7? Sim, em qualidade. Ele detecta aproximadamente 4x mais defeitos de código, é mais honesto sobre a incerteza e chama ferramentas de forma mais eficiente. Preço, janela de contexto e saída máxima são idênticos, então há pouca razão para permanecer no 4.7.
Quanto custa o Opus 4.8? $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída no modo padrão. O modo rápido custa $10 e $50 para uma saída 2.5x mais rápida. Os cálculos completos estão na análise de preços.
Qual é a janela de contexto para o Opus 4.8? 1M de tokens de entrada e até 128K de tokens de saída na API de Mensagens síncronas. A API de Lote suporta até 300K tokens de saída com um cabeçalho beta. No Microsoft Foundry, a janela de contexto é de 200K tokens.
O Opus 4.8 suporta pensamento estendido? Ele usa pensamento adaptativo (thinking: {type: "adaptive"}), onde o modelo decide o quanto raciocinar. O pensamento manual com budget_tokens não é suportado e retorna um erro 400.
O que é o parâmetro de esforço? Uma configuração dentro de output_config que controla quantos tokens Claude gasta em texto, chamadas de ferramentas e raciocínio. Os níveis variam de low (baixo), medium (médio), high (alto, padrão), xhigh (muito alto) e max (máximo).
Posso usar o Opus 4.8 gratuitamente? Não há um nível de API gratuito, mas você pode experimentá-lo no plano gratuito em claude.ai com limites, ou através de créditos de teste. Consulte o guia de acesso gratuito.
O que são Fluxos de Trabalho Dinâmicos? Um recurso do Claude Code que lança muitos subagentes paralelos em uma única sessão, alimentado por esforço xhigh e mensagens de sistema no meio da conversa. Detalhes no guia de Fluxos de Trabalho Dinâmicos.
