robots.txt para rastreadores de IA: receitas prontas
Três receitas e uma tabela bot a bot para controlar GPTBot, ClaudeBot, PerplexityBot e os demais a partir de um pequeno arquivo de texto.
Para controlar rastreadores de IA, adicione regras User-agent e Disallow no arquivo robots.txt na raiz do seu domínio. Você pode bloquear cada bot de IA, bloquear o treino mas manter a busca de IA, ou permitir tudo. O arquivo é orientativo: bots bem-comportados o respeitam, mas ele não é controle de acesso.
Como o robots.txt controla os rastreadores de IA
Cada empresa de IA opera um ou mais agentes nomeados. Você os mira pelo token de user-agent no robots.txt e então decide o que podem buscar. Há três jogadas que vale conhecer: bloquear um bot por completo, bloquear apenas os rastreadores de treino deixando passar os bots de busca de IA, ou deixar tudo aberto. As receitas abaixo cobrem as três. Cada uma vai em um único arquivo em https://example.com/robots.txt.
Receita 1: bloquear todos os rastreadores de IA
Isto nega cada agente de IA documentado e adiciona os dois tokens de exclusão que regem o uso para treino. Cole como está, ou apare os bots que não lhe interessam:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Um ponto que merece ser dito com clareza: bloquear o GPTBot interrompe o rastreador de treino da OpenAI, não a busca do ChatGPT (isso é o OAI-SearchBot) nem a navegação acionada pelo usuário (isso é o ChatGPT-User). A receita acima cobre as três, por isso cada uma recebe seu próprio bloco.
Receita 2: permitir busca de IA e bloquear treino de IA
Um objetivo comum é permanecer visível nos mecanismos de resposta de IA e ao mesmo tempo manter seu conteúdo fora do treino de modelos. Permita os bots de busca e negue os rastreadores e tokens de treino:
# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Block AI training
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Google-Extended e Applebot-Extended são a chave dessa divisão. São tokens do robots.txt, não rastreadores separados. Negá-los exclui seu conteúdo do treino de IA do Gemini e da Apple, enquanto Googlebot e Applebot seguem indexando você para a busca normal.
Receita 3: permitir tudo (o padrão)
Se você não fizer nada, este é o estado real. Um Disallow vazio deixa cada rastreador buscar qualquer caminho:
User-agent: *
Disallow:
Um arquivo robots.txt inexistente significa o mesmo. Você só precisa de regras explícitas quando quer restringir algo.
Os 11 rastreadores de IA, comparados
| Bot | Empresa | Finalidade | Bloquear para parar… |
|---|---|---|---|
| GPTBot | OpenAI | Rastreia para treinar modelos | Treino com seu conteúdo |
| OAI-SearchBot | OpenAI | Alimenta os resultados de busca do ChatGPT | Aparecer na busca do ChatGPT |
| ChatGPT-User | OpenAI | Navegação e ações acionadas pelo usuário | Buscas acionadas pelo usuário a partir do ChatGPT |
| ClaudeBot | Anthropic | Rastreia para treinar modelos | Treino com seu conteúdo |
| Claude-User | Anthropic | Buscas acionadas pelo usuário | Buscas acionadas pelo usuário a partir do Claude |
| PerplexityBot | Perplexity | Indexa para seu mecanismo de respostas | Indexação no Perplexity |
| Perplexity-User | Perplexity | Buscas acionadas pelo usuário | Buscas acionadas pelo usuário a partir do Perplexity |
| Google-Extended | Token que rege o uso para treino do Gemini/Vertex AI | Uso do conteúdo para treinar Gemini/Vertex AI | |
| Applebot-Extended | Apple | Token que rege o uso para treino de IA da Apple | Uso do conteúdo para treinar a IA da Apple |
| CCBot | Common Crawl | Cria um conjunto de dados público usado para treino de IA | Inclusão no conjunto de dados da Common Crawl |
| Bytespider | ByteDance (TikTok) | Rastreador de IA | Rastreamento de IA da ByteDance |
O que o robots.txt pode e não pode fazer
Poucas regras decidem se o seu arquivo funciona sequer:
- Ele deve ficar na raiz do domínio. Rastreadores leem
https://example.com/robots.txte nada além disso. Um arquivo em uma subpasta é ignorado, e cada subdomínio precisa do seu próprio. - O token não diferencia maiúsculas.
GPTBotegptbotcorrespondem ao mesmo rastreador. Mantenha a grafia documentada por legibilidade, mas não se preocupe com correspondência exata. - Algumas entradas são tokens, não rastreadores.
Google-ExtendedeApplebot-Extendednunca buscam nada. Apenas sinalizam se Google e Apple podem usar conteúdo já rastreado para treino de IA. - É orientativo, não um muro. robots.txt é voluntário. Bots sérios o respeitam; ele não é controle de acesso e não vai parar um rastreador que decida ignorá-lo. Para um bloqueio duro, use regras de firewall, autenticação ou bloqueio na borda por user-agent e IP.
Combine com um arquivo llms.txt
O robots.txt decide quem pode rastrear. Um arquivo llms.txt faz o trabalho oposto: aponta aos sistemas de IA o conteúdo que você quer que leiam e entendam. Os dois trabalham juntos, e você pode criar um com o gerador de llms.txt. Para ver como seu site inteiro aparece aos rastreadores de IA, rode a verificação de prontidão para IA.