Modelos de ponta já conseguem trabalhar por horas em um repositório. O problema é que cada tentativa, chamada de ferramenta e correção aparece na conta e no tempo de espera. O Claude Opus 5.5, apresentado pela Anthropic, tenta melhorar justamente essa parte menos glamourosa: chegar a um resultado útil com menos etapas, menos tokens e menos retrabalho.

A empresa diz que o modelo custa 40% menos para executar trabalhos típicos do que o Opus 5 e gera respostas mais de 30% mais rápido. Na API, o preço é de US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de saída. Leituras de cache caíram para US$ 0,20 por milhão, um detalhe importante em coding agents que carregam repetidamente instruções, ferramentas e contexto do projeto.

A unidade certa é a tarefa, não o token

Uma tabela de preços conta apenas metade da história. Um modelo barato por token pode sair caro se precisar reler o repositório, repetir comandos ou corrigir alterações incompletas. A afirmação mais interessante da Anthropic é que o Opus 5.5 usa menos passos e tokens para concluir trabalhos longos.

Nos testes publicados pela própria empresa, o modelo ficou à frente do Opus 5 em avaliações de coding agêntico, uso de computador e trabalho de conhecimento. Early adopters também relatam migrações e auditorias em bases grandes, algumas executadas por muitas horas. São sinais promissores, mas ainda vêm de um lançamento controlado e de avaliações selecionadas pelo fabricante. O seu repositório continua sendo o benchmark que paga a fatura.

Onde vale experimentar primeiro

O melhor teste não é pedir uma função isolada. Escolha uma tarefa conhecida que atravesse arquivos e exija validação: atualizar uma integração, corrigir um problema com regressão, migrar uma API ou auditar um fluxo com testes existentes. Compare o Opus 5.5 com o modelo atual usando o mesmo objetivo e limites equivalentes.

Meça o tempo até uma mudança revisável, o número de chamadas de ferramenta, os tokens consumidos e o retrabalho humano. Também registre quantas vezes o agente precisou voltar atrás. Em trabalho agêntico, uma solução correta na terceira tentativa pode ser bem menos eficiente do que uma solução um pouco mais cara por chamada, mas correta de primeira.

A Anthropic também destaca maior resistência a prompt injection e menos ações difíceis de reverter. Isso merece teste próprio, especialmente quando o agente acessa documentação externa, executa comandos ou trabalha sem supervisão por longos períodos. Benchmark de segurança não substitui sandbox, permissões mínimas e revisão antes do merge.

Disponibilidade e escolha de modelo

O Opus 5.5 está disponível no Claude, Claude Code e Claude Platform, além de começar a chegar a integrações como o GitHub Copilot. A Anthropic anunciou ainda limites maiores nos planos Pro, Max, Team e Enterprise por assento. Sonnet 5.5 e Haiku 5.5 devem chegar nas próximas semanas.

O lançamento aponta para uma mudança saudável na conversa: capacidade máxima continua importante, mas eficiência por tarefa virou produto. Para equipes, a pergunta prática não é se o Opus 5.5 ganhou mais um benchmark. É se ele entrega uma mudança confiável com menos espera, menos consumo e menos revisão no trabalho que vocês realmente fazem.