A partir de hoje, 15 de setembro, a Cloudflare começa a aplicar, por padrão, o bloqueio de crawlers de IA "de uso misto" em qualquer página que exiba anúncios — uma mudança anunciada em julho e que agora entra oficialmente em vigor para domínios novos na plataforma, novos sites de clientes existentes e toda a base do plano gratuito.

O problema do crawler "três em um"

Segundo a Cloudflare, boa parte do tráfego de bots de IA hoje vem de crawlers que combinam três funções sob um único user-agent: indexação para busca tradicional, coleta de páginas para agentes de IA em tempo real e coleta de dados para treinar modelos. Essa mistura torna quase impossível, para um site, permitir que seu conteúdo continue aparecendo no Google enquanto bloqueia o uso do mesmo conteúdo para treinar um modelo concorrente — porque, até então, era o mesmo bot fazendo as duas coisas.

A partir de hoje, a Cloudflare separa o tráfego em três categorias — Search, Agent e Training — e, para as contas afetadas, apenas a categoria Search continua liberada por padrão em páginas com anúncios; Agent e Training passam a ser bloqueadas a menos que o site opte explicitamente por liberá-las.

De "pagar por acesso" a "pagar pelo uso"

A mudança também empurra adiante a segunda etapa de um plano que a empresa vinha construindo desde 2025: o programa Pay Per Crawl, que cobrava das empresas de IA por cada página buscada, está evoluindo para o modelo Pay Per Use, em que o pagamento ao site acontece quando o conteúdo é efetivamente usado dentro de uma resposta de IA — não simplesmente quando é buscado. Segundo a Cloudflare, mais da metade do tráfego de crawlers de IA hoje é gasto rebuscando páginas que não mudaram, o que tornava o modelo de cobrança por fetch pouco eficiente tanto para publishers quanto para as empresas de IA. O novo marketplace de Pay Per Use já soma dois parceiros iniciais, Ceramic.ai e You.com.

Por que isso importa para quem constrói produtos de IA

Para times que constroem agentes ou pipelines de busca que dependem de acessar conteúdo de terceiros, a mudança de hoje é um lembrete prático: crawlers que ainda usam um único user-agent para buscar conteúdo por múltiplos motivos vão passar a ser bloqueados por padrão numa fração relevante da web. Separar claramente as identidades de crawler por finalidade — busca, agente, treinamento — deixa de ser boa prática e passa a ser, na prática, um requisito para manter acesso a conteúdo atrás da Cloudflare.