Pentests costumam produzir uma fotografia: durante alguns dias, uma equipe procura falhas, valida parte delas e entrega um relatório. O problema é que aplicações, APIs, identidades e infraestrutura continuam mudando depois que o PDF chega. A Palo Alto Networks quer transformar essa fotografia em acompanhamento contínuo com o Unit 42 Continuous Frontier AI Defense, lançado em 22 de setembro.

O serviço combina especialistas da Unit 42 com um orquestrador de múltiplos modelos. Entre eles estão Claude Mythos 5, da Anthropic, GPT-5.6-Cyber, da OpenAI, e modelos open weight. A ideia não é colocar um chatbot para preencher um checklist de segurança. Cada modelo recebe o tipo de teste em que tende a ser mais útil, enquanto o sistema procura exposições, tenta provar se elas são exploráveis e encaminha correções priorizadas.

Do scanner para a validação do ataque

Encontrar uma configuração suspeita é relativamente fácil. Demonstrar que ela pode ser combinada com outras falhas até chegar a uma conta, dado ou sistema crítico é outra história. É justamente aí que a proposta fica interessante para equipes de engenharia.

Segundo a Palo Alto Networks, o serviço cobre aplicações próprias e de terceiros, APIs, infraestrutura em nuvem, repositórios de código, identidades e ativos de rede. Depois de criar uma linha de base, ele volta a testar o ambiente conforme surgem mudanças. Os resultados podem incluir orientação no nível de código e recomendações de virtual patching.

Esse desenho tenta reduzir um problema conhecido: segurança não sofre por falta de alertas. Sofre porque há alertas demais e pouca evidência sobre quais representam um caminho real de ataque. Se a IA apenas aumentar a fila do backlog, terá automatizado a parte errada. O ganho aparece quando descoberta, validação e reteste formam um ciclo curto o bastante para acompanhar o software.

Por que usar mais de um modelo

A Unit 42 afirma que nenhum modelo isolado encontrou mais de 40% das vulnerabilidades em suas avaliações, e que os achados de Mythos 5 e GPT-5.6-Cyber tiveram menos de 10% de sobreposição. São números publicados pelo próprio fornecedor, não um benchmark independente, mas ajudam a explicar a arquitetura: modelos diferentes enxergam partes diferentes do problema.

Para AI Engineering, essa é uma aplicação prática de roteamento. Em vez de eleger um modelo universal, o harness escolhe capacidade, contexto e custo conforme a tarefa. O princípio é parecido com o uso de modelos distintos em um pipeline de desenvolvimento, mas com uma exigência adicional: cada conclusão precisa deixar evidência revisável para o especialista humano.

A empresa também diz utilizar arquitetura de retenção zero para impedir que código e telemetria de clientes sejam retidos ou usados no treinamento de modelos públicos. Ainda assim, uma adoção responsável precisa detalhar onde os testes executam, quais dados atravessam cada provedor, quem pode autorizar ações ofensivas e como credenciais e resultados são isolados.

Os números merecem contexto

No uso interno, a Palo Alto Networks relata ter reproduzido em três semanas mais de um ano de resultados de pentest tradicional, encontrado 3,2 vezes mais vulnerabilidades altas ou críticas por produto e reduzido em 51% o tempo médio de correção. A abordagem teria sido validada em mais de 100 trabalhos com clientes.

É um sinal relevante, mas ainda é evidência do fabricante. Antes de contratar uma operação contínua, a comparação útil deve incluir falsos positivos, tempo humano de validação, taxa de correção aceita pelos times e recorrência após o reteste. Encontrar mais falhas não basta; é preciso reduzir exposição sem paralisar a entrega.

O serviço já está disponível globalmente por assinatura anual. A mudança mais importante, porém, não está no catálogo de modelos. Está em tratar segurança ofensiva como um processo contínuo, conectado ao ritmo do software. Para times que ainda fazem um grande teste por ano e passam os meses seguintes perseguindo o relatório, essa talvez seja a parte mais desconfortável e mais útil do anúncio.