Cloudflare está implementando novas diretrizes para identificação e bloqueio de robôs relacionados a inteligência artificial (IA), e isso pode resultar no bloqueio do Googlebot em sites que visam evitar o treinamento de modelos de IA. Essa atualização, anunciada como parte do segundo Dia da Independência de Conteúdo da empresa, é importante para todas as entidades digitais, como empresas, marcas e agências, pois pode impactar diretamente a visibilidade de suas páginas nos mecanismos de busca.
Com as mudanças, o Cloudflare oferece um controle mais granular sobre o tráfego automatizado. Em vez de um único controle para bloquear robôs de IA, agora os sites podem gerenciá-los com base em três diferentes comportamentos: Search (busca), Agent (agentes) e Training (treinamento).
- Search: Este comportamento consiste na indexação de sites para responder perguntas posteriormente, com ligação ao tráfego de referência.
- Agent: Trata-se de robôs operando em tempo real atuando em nome de um usuário, como o ChatGPT ou navegadores operando no Chrome.
- Training: Refere-se ao rastreamento que coleta conteúdo para treinar ou ajustar modelos de IA.
Cloudflare orienta que os operadores de bots utilizem crawlers separados para cada uma dessas funções, permitindo que os administradores de site entendam a razão da visita e decidam se devem permitir ou bloquear esse tráfego.
A partir de 15 de setembro, duas mudanças padrão entrarão em vigor. Para novos clientes e novos sites de clientes existentes, robôs de Training e Agent serão bloqueados por padrão em páginas com anúncios, enquanto o Search permanecerá permitido. Os usuários gratuitos que não ajustarem suas configurações até essa data também passarão a adotar essas definições padrão.
Uma segunda mudança pode ter um impacto ainda maior. Os crawlers de múltiplos propósitos serão avaliados pelo seu comportamento geral, aplicando a regra mais rigorosa disponível. Por exemplo, se um crawler realiza tanto a função de Search quanto de Training, ele será bloqueado se o site tiver restrições para Training. Isso inclui bots como Googlebot, Applebot e Bingbot, que atuam em ambas as áreas.
Outro ponto relevante é que o Cloudflare está testando um novo sinal de uso de conteúdo que amplia os Content Signals no arquivo robots.txt. Esse sinal possui três classificações, do mais restritivo ao menos restritivo: imediato, referência e completo. Contudo, esses sinais não bloqueiam o acesso automaticamente.
A empresa também atualizou a definição de “verificado” para bots. Agora, um bot verificado não tem acesso garantido em todas as páginas; sua permissão depende da categoria, e bots que replicam conteúdo integralmente não se qualificam para verificação. Foi lançada uma diretório chamado BotBase para usuários de gerenciamento de bots em empresas, permitindo rastreamento e categorização.
Relatos indicam que o treinamento de IA já representa a maior parte dos pedidos de rastreamento na rede do Cloudflare. Observou-se um aumento de 1.700% nas solicitações de agentes de IA ao longo do último ano. Esses dados são baseados no tráfego da rede Cloudflare e não representam a totalidade da web.
É crucial que os sites que utilizam o Cloudflare revisem suas configurações de bloqueio de IA antes de 15 de setembro, para decidirem se mantêm habilitados os crawlers de Search. A regra sobre crawlers combinados afetará principalmente aqueles que já tinham a configuração de “bloquear bots de IA” ativada e não fizeram ajustes desde então. O impacto disso pode ser significativo, pois o bloqueio de funções de treinamento pode inadvertidamente afetar a indexação de pesquisa, dificultando a visibilidade do site nos resultados de busca.
Em suma, a forma como os sites lidam com esses novos parâmetros em suas configurações pode definir seu sucesso em manter a visibilidade online. A diferenciação de bots por comportamento será crucial para garantir que as estratégias de bloqueio de IA não comprometam a descoberta e o tráfego de pesquisa.
Crédito da imagem: divulgação/reprodução

