Field Update6 min de leitura

Anthropic lança o Claude Opus 5: inteligência de topo pelo preço de ontem

Aura Research BoardResearch Board
field-updateopus-5anthropicclaudeagentic-aiharness-engineeringcamada-agnosticacusto-por-tarefabreaking-changesD1D8tier-0

Anthropic lança o Claude Opus 5: inteligência de topo pelo preço de ontem

Benchmarks agênticos de topo por uma fração do custo por tarefa, ao mesmo preço do Opus 4.8. Mas o recado do lançamento não está nos números: está no que a Anthropic escolheu otimizar.

Tipo: Field Update · Autor: Aura Research Board · Data: Julho 2026 · Tempo de leitura: ~5 min · Aura Company


Ilustração de ovos de aves formando o número 5, arte do anúncio do Claude Opus 5 Imagem: Anthropic, anúncio do Claude Opus 5.

O Que Mudou

A Anthropic lançou o Claude Opus 5 na sexta, 24 de julho. Antes da leitura, os números, porque eles importam.

  • Frontier-Bench v0.1: supera todos os outros modelos e mais que dobra o Opus 4.8, a um custo por tarefa menor.
  • CursorBench 3.2: fica a 0,5% do pico do Fable 5, o modelo mais caro da casa, pela metade do custo por tarefa.
  • OSWorld 2.0: supera o melhor resultado do Fable 5 por pouco mais de um terço do custo.
  • ARC-AGI 3: pontua três vezes o segundo colocado.
  • O preço não se moveu: US$ 5 por milhão de tokens de entrada e US$ 25 de saída, o mesmo do Opus 4.8.

O padrão se repete em quase todos os cartões: mesma capacidade ou mais, por uma fração do custo por tarefa. A precisão importa, porém. O destaque está em raciocínio e tarefas agênticas, não em "melhor em tudo": o próprio anúncio reconhece limites, como ficar atrás de um concorrente em exploração de vulnerabilidades.

A Nossa Leitura

Inteligência de topo por uma fração do custo confirma o que viemos dizendo: a inteligência virou a camada barata. Capacidade bruta deixou de ser o diferencial e virou pré-requisito.

Mas dois detalhes menos comentados dizem mais que os benchmarks.

Primeiro: o modelo agora pensa por padrão. E se você pedir para ele não pensar nos modos de esforço mais altos, a API devolve erro 400. Um sistema que se recusa a trabalhar sem pensar. Aqui na Aura, aprovamos a postura. É o que cobramos dos nossos Funcionários Digitais desde o primeiro dia: pensa, age, reporta.

Segundo: repare no que foi otimizado. Todos os cartões de destaque são agênticos (Frontier-Bench, CursorBench, OSWorld, AutomationBench da Zapier), e a novidade de API foi trocar ferramentas no meio da execução sem quebrar o cache. Tarefas longas, trabalho agêntico, verificação do próprio trabalho. Nem quem constrói os modelos está mais construindo para conversa.

Não é chat. Nem para eles.

Por Que Importa

O lançamento também trouxe breaking changes na API, e é aí que mora a diferença prática entre duas formas de construir.

  • Quem acoplou a operação ao modelo ganhou um chamado de migração para segunda-feira. Requests sem o campo de thinking passam a rodar com raciocínio adaptativo, e o max_tokens agora inclui os tokens de raciocínio. Quem não revisar os workloads vai ver conta e comportamento mudarem sem aviso.
  • Quem construiu sobre uma camada agnóstica ganhou um upgrade silencioso. O Cérebro, as alçadas e a trilha auditável nem perceberam a troca do modelo por baixo. É o mesmo movimento que já descrevemos: o modelo virou commodity e a engenharia ao redor decide o jogo (ver Harness Engineering).
  • Mais autonomia pede mais governança. Um modelo mais barato por tarefa convida a delegar mais decisão para a máquina. Isso só vira vantagem com verificação, trilha auditável e a pessoa certa no ponto de decisão (ver Governança de Agentes em Produção).

O modelo é de quem o treina. A operação, o conhecimento e o comando têm que ser seus.

O Que Fazer

  1. Meça custo por tarefa, não por token. O ganho do Opus 5 aparece no custo por tarefa concluída, não na etiqueta por milhão de tokens. Instrumente os seus fluxos por tarefa antes de comparar.
  2. Revise seus workloads antes de migrar. Como o max_tokens passou a incluir os tokens de raciocínio, limites calibrados para a versão anterior podem truncar respostas ou inflar custo.
  3. Não desligue o thinking nos modos de esforço mais alto. A chamada agora retorna erro 400. Se o seu fluxo dependia disso, redesenhe.
  4. Valide no seu fluxo real, não no benchmark. "Topo de linha em tarefas agênticas" é claim de fornecedor até rodar na sua tarefa, com os seus dados.
  5. Aumente a governança junto com a autonomia. Quanto mais barato e autônomo o modelo, mais importam os pontos de human-in-the-loop.

Detalhes

  • Preço. US$ 5 por milhão de tokens de entrada e US$ 25 de saída, igual ao Opus 4.8. O modo rápido roda a cerca de 2,5 vezes a velocidade padrão pelo dobro do preço base.
  • Benchmarks. Frontier-Bench v0.1 (supera todos os modelos, mais que dobra o Opus 4.8 a custo por tarefa menor); CursorBench 3.2 (a 0,5% do pico do Fable 5, metade do custo por tarefa); OSWorld 2.0 (supera o Fable 5 por pouco mais de um terço do custo); ARC-AGI 3 (três vezes o segundo colocado); AutomationBench da Zapier (taxa de acerto cerca de 1,5 vez a do segundo colocado, ao mesmo custo por tarefa).
  • Contexto e saída. Janela de 1 milhão de tokens (padrão e máximo) e saída de até 128 mil, conforme a documentação para desenvolvedores.
  • Troca de ferramentas no meio da conversa (beta): dá para mudar quais ferramentas o modelo usa sem invalidar o cache do prompt. Há também fallbacks automáticos em beta na API.
  • Thinking por padrão. O raciocínio vem ligado. Desligá-lo nos modos de esforço mais altos retorna erro 400 (breaking change). Requests sem o campo de thinking passam a rodar com raciocínio adaptativo, e o max_tokens agora inclui os tokens de raciocínio.
  • Segurança. O anúncio reporta a menor pontuação de comportamento desalinhado entre os modelos recentes da casa, e reconhece limites (fica atrás de um concorrente em exploração de vulnerabilidades). Capacidade e risco crescem juntos.

Be the human in the loop.

Anthropic lança o Claude Opus 5: inteligência de topo pelo preço de ontem — Aura Company