Decidir bloquear crawlers de IA é uma decisão comercial que muitos profissionais de busca estão discutindo atualmente. Mas uma vez que você tomou a decisão, qual é a melhor maneira de bloquear esses bots?
Existem duas abordagens principais para bloquear crawlers a considerar: através do robots.txt e no nível do servidor.
As Duas Abordagens
Ambas as abordagens têm seus prós e contras. Vamos começar examinando como elas funcionam e as diferenças entre as duas.
Bloqueando Através Do Robots.txt
Bloquear crawlers de IA usando robots.txt é exatamente o mesmo processo que você usaria para bloquear qualquer tipo de bot.
Cada bot de IA tem seu próprio nome identificador, por exemplo, o GPTBot da OpenAI e o OAI-SearchBot. Para bloqueá-los, você simplesmente precisa adicionar uma regra de desautorização especificando o nome do crawler. Por exemplo, para impedir que o GPTBot rastreie qualquer parte do seu site, você adicionaria:
User-agent: GPTBot
Disallow: /
Se houver apenas certas partes do seu site que você deseja impedir que os bots de IA rastreiem, você pode chamá-las da mesma forma. Por exemplo, para impedir que o GPTBot rastreie suas páginas de produtos, você incluiria a pasta em que essas páginas estão, por exemplo:
User-agent: GPTBot
Disallow: /products/
Bloqueando No Nível do Servidor
Existem algumas maneiras de bloquear bots no nível do servidor: através do próprio servidor, do CDN ou do WAF.
Neste caso, o servidor lerá a solicitação de entrada, como o IP do bot, cabeçalho, etc., e aplicará as regras específicas que você configurou para esse agente (negar, permitir, redirecionar). Por exemplo, você pode especificar que o GPTBot recebe um comando de "negar". Isso impediria o bot de acessar o conteúdo do seu site.
Para a Rede de Distribuição de Conteúdo (CDN), o conceito é o mesmo, mas acontece em uma fase anterior da visita de um bot. A CDN intercepta uma solicitação de conteúdo de um bot antes que ela chegue ao servidor. Isso essencialmente economiza banda do servidor já que o bot nunca interage realmente com ele. Algumas CDNs oferecem essa tecnologia nativamente sem que você precise fazer muito para configurá-la. Por exemplo, o Cloudflare oferece bloqueio pré-configurado com base em se um bot é um crawler de busca, um agente ou usado para treinamento, além de permitir um ajuste mais fino em uma base de bot por bot.
No Firewall de Aplicação Web (WAF), os bots são analisados mais do que a CDN faz. O WAF atua como uma camada de segurança que pode analisar o comportamento da solicitação, não apenas os cabeçalhos usados pelos bots. Isso significa que é capaz de detectar bots que estão falsificando outros user-agents. É a maneira mais competente na maioria das pilhas tecnológicas de identificar crawlers de IA mais sofisticados que estão tentando passar despercebidos nas tentativas de bloqueio. O WAF que sua empresa está usando pode ser parte da sua CDN, por exemplo, o WAF do Cloudflare, ou uma aplicação independente como o WAF da AWS.
Robots.txt: Prós E Contras
O robots.txt é possivelmente a maneira mais acessível para os profissionais de busca controlarem bots. Normalmente, os SEOs têm acesso para alterar o robots.txt de seus domínios, ou podem facilmente solicitar uma atualização rápida pela equipe de desenvolvimento.
No entanto, existem alguns outros benefícios em usar este método.
Prós
O mecanismo de desautorização do robots.txt é oficialmente suportado pelas maiores e mais respeitáveis empresas de IA. Por exemplo, o GPTBot e o OAI-SearchBot da OpenAI, o ClaudeBot, Claude-User e Claude-SearchBot da Anthropic, o Google-Extended do Google e o PerplexityBot da Perplexity.
Esse método permite que você escolha seletivamente quais páginas impedir que os bots visitem, e também ajustar o bloqueio com base em cada crawler.
Contras
Existem algumas desvantagens nesse método, no entanto. O maior risco é que a conformidade com o robots.txt é completamente voluntária e não é monitorada centralmente. Ou seja, embora os criadores de bots de IA possam afirmar que seus bots respeitam o robots.txt, é apenas um conjunto de solicitações, não um bloqueio real. Pense nisso como um sinal de "proibido entrar" na frente de um portão aberto. Não há nada realmente impedindo os bots, apenas a programação deles para respeitar as regras do robots.txt.
O robots.txt pode ser configurado para desautorizar bots de certas páginas muito facilmente se houver controles de robots.txt no CMS do site. Isso significa que partes interessadas não técnicas podem acidentalmente bloquear mais bots do que o esperado com uma regra de desautorização equivocada. Isso pode ser catastrófico se o robots.txt for atualizado para desautorizar todos os bots, por exemplo, implementando:
User-agent: *
Disallow: /
O robots.txt não é atualizado automaticamente quando novos user agents são lançados. Isso significa que alguém precisará adicionar manualmente novas desautorização sempre que você quiser impedir que um novo bot de IA acesse seu site.
Pilha do Servidor: Prós E Contras
Bloquear bots em um nível de servidor, CDN ou WAF tem diferentes prós dependendo da implementação.
Prós
As implementações de CDN e WAF impedirão solicitações de bots antes que elas cheguem ao servidor. Isso economizará banda do servidor, reduzindo a pressão sobre o servidor e economizando custos associados.
O maior benefício para as implementações de pilha de servidor, não importa qual você escolha, é que elas são uma d


