O acesso de crawlers de inteligência artificial (IA) a sitemaps e feeds RSS pode significar uma mudança significativa na forma como as empresas e sites se posicionam online. Em um recente episódio do podcast Search Off the Record, John Mueller, do Google, destacou que os crawlers de IA em geral não fornecem uma maneira para os proprietários de sites submeterem seus sitemaps. Para esses sites que querem que sua informação seja descoberta, a recomendação de Mueller é adotar uma nomenclatura padrão para os sitemaps e aproveitar a funcionalidade dos feeds RSS.
Sitemaps e Crawlers de IA
Mueller observou que, embora os proprietários de sites que desejam manter seus sitemaps privados possam usar nomes de arquivo não convencionais e não incluir esses sitemaps no arquivo robots.txt, essa estratégia limita a capacidade de outros sistemas de localizá-los. Em última análise, a submissão direta para o Google é uma opção, mas outras plataformas, como Bing, precisam de submissão própria, complicando ainda mais o cenário para os proprietários de sites.
Para aqueles que desejam que seus conteúdos sejam indexados por crawlers de IA, a sugestão é manter o nome padrão do arquivo, chamando-o de sitemap.xml, ou utilizar feeds RSS, que são mais facilmente acessíveis devido à sua inclusão habitual no cabeçalho HTML de uma página.
A Limitação do llms.txt
Em um momento mais técnico, quando questionado sobre o potencial do arquivo llms.txt para substituir um sitemap XML, Mueller foi claro: este arquivo Markdown não oferece o formato estrito necessário para que os sistemas do Google possam utilizá-lo como um sitemap eficaz. “A esperança é maior que a realidade”, ressaltou, vendo o uso de Markdown como uma opção interessante, mas não aconselhada para depender.
Causas de “Couldn’t Fetch” em Sitemaps
Um tópico relevante discutido foi a ocorrência do erro “Couldn’t fetch” no Search Console, mesmo quando um sitemap válido está vinculado no robots.txt. Entre as razões apresentadas por Mueller estão a carga do host e a demanda de rastreamento, que pode levar o Google a não ver necessidade de acessar mais conteúdo de um site. O líder de Search Relations do Google também mencionou que a qualidade percebida do conteúdo é um fator determinante nessa decisão, sugerindo que um bom conteúdo resulta em uma maior demanda de rastreamento.
Importância dos Sitemaps na Era da IA
A conclusão de Mueller enfatiza que um sitemap com um nome não convencional e sem uma entrada no robots.txt permanece oculto de sistemas que não forem submetidos diretamente a ele. Para garantir que os crawlers de IA possam descobrir o conteúdo, é essencial seguir recomendações simples como adotar um nome padrão de sitemap ou utilizar feeds RSS. Os sitemaps devem ser parte de uma estratégia mais ampla que envolve a criação de conteúdo relevante e a manutenção da qualidade.
Perspectivas Futuras
Mueller orienta que, em vez de surfar na incerteza do llms.txt, é mais prudente se concentrar no que já está documentado e testado. Os logs do servidor são uma ferramenta útil para verificar se os crawlers de IA estão acessando seus arquivos, permitindo que os profissionais de marketing digital ajustem suas estratégias conforme necessário.

