Quem usa modelos em uma operação de software conhece a conta: qualidade importa, mas cada tentativa, chamada de ferramenta e token produzido entra no custo e no tempo de espera. Um modelo que conclui a tarefa com menos passos pode melhorar esse equilíbrio mesmo sem reduzir a tarifa da API.

É a tese por trás do Claude Sonnet 5.5, lançado pela Anthropic em 28 de setembro. A empresa afirma que ele gera respostas mais de 30% mais rápido que o Sonnet 5 e custa até 30% menos por tarefa em seus testes. O preço por token, porém, não caiu: permanece em US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de saída. A economia prometida viria principalmente de gastar menos tokens para chegar ao resultado.

Onde os números ajudam, e onde não ajudam

Nos resultados divulgados pela Anthropic, o Sonnet 5.5 obteve 70,6% no Terminal-Bench 4.0, contra 10,3% do Sonnet 5. No CursorBench 4.0, marcou 55,5%, ante 34,1% do antecessor e 57,8% do Opus 5.5. A comparação sugere um avanço relevante em tarefas de programação avaliadas nesses ambientes, mas os números são de testes apresentados pela própria fornecedora, com configurações e níveis de esforço que variam entre as provas. Eles não permitem prometer o mesmo ganho em qualquer repositório.

A própria Anthropic reconhece uma fronteira importante: o Opus 5.5 segue mais forte em trabalho complexo e aberto que exige julgamento sustentado. Para equipes, isso aponta para uma decisão menos vistosa e mais útil do que escolher sempre o modelo com maior pontuação: experimentar o Sonnet em tarefas frequentes e delimitadas, reservando o Opus para as que realmente exigem mais investigação ou revisão.

Medir apenas a tarifa por token esconde parte da conta. O que interessa é o custo de uma tarefa concluída com qualidade suficiente.

A variável chamada esforço

O nível de esforço também muda a comparação. Segundo a Anthropic, Claude Code e seus aplicativos usam Medium por padrão; a Claude Platform usa High. Em níveis menores, o modelo tende a responder mais cedo e consumir menos tokens. Em níveis maiores, trabalha por mais tempo. Assim, uma avaliação honesta precisa registrar o esforço, a quantidade de tentativas, as chamadas de ferramenta e o critério de aceitação do resultado.

O Sonnet 5.5 já está disponível nas plataformas da Anthropic, AWS, Google Cloud e Microsoft Azure, com o identificador claude-sonnet-5-5 na Claude Platform. A empresa informa também que solicitações de cibersegurança de maior risco podem recorrer ao Sonnet 5 como fallback, enquanto desenvolve acesso verificado a capacidades mais avançadas. É uma condição relevante para quem pretende comparar comportamento em diferentes categorias de tarefa.

Na leitura do MnzAI Labs, o lançamento vale um teste controlado em fluxos reais da equipe: selecione um conjunto de bugs, revisões ou documentos com resultado verificável e compare tempo total, tokens, retrabalho e qualidade final. Se o modelo terminar mais rápido, mas exigir correções adicionais, a economia anunciada pode desaparecer. Se cumprir o mesmo padrão com menos iterações, aí a mudança de modelo terá valor concreto.

Fonte: apresentação e resultados do Claude Sonnet 5.5 pela Anthropic, publicada em 28 de setembro de 2026.