Guia

robots.txt para rastreadores de IA: receitas prontas

Três receitas e uma tabela bot a bot para controlar GPTBot, ClaudeBot, PerplexityBot e os demais a partir de um pequeno arquivo de texto.

Por Equipe WebDoctor·22 de julho de 2026·4 min de leitura


Para controlar rastreadores de IA, adicione regras User-agent e Disallow no arquivo robots.txt na raiz do seu domínio. Você pode bloquear cada bot de IA, bloquear o treino mas manter a busca de IA, ou permitir tudo. O arquivo é orientativo: bots bem-comportados o respeitam, mas ele não é controle de acesso.

Como o robots.txt controla os rastreadores de IA

Cada empresa de IA opera um ou mais agentes nomeados. Você os mira pelo token de user-agent no robots.txt e então decide o que podem buscar. Há três jogadas que vale conhecer: bloquear um bot por completo, bloquear apenas os rastreadores de treino deixando passar os bots de busca de IA, ou deixar tudo aberto. As receitas abaixo cobrem as três. Cada uma vai em um único arquivo em https://example.com/robots.txt.

Receita 1: bloquear todos os rastreadores de IA

Isto nega cada agente de IA documentado e adiciona os dois tokens de exclusão que regem o uso para treino. Cole como está, ou apare os bots que não lhe interessam:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Um ponto que merece ser dito com clareza: bloquear o GPTBot interrompe o rastreador de treino da OpenAI, não a busca do ChatGPT (isso é o OAI-SearchBot) nem a navegação acionada pelo usuário (isso é o ChatGPT-User). A receita acima cobre as três, por isso cada uma recebe seu próprio bloco.

Receita 2: permitir busca de IA e bloquear treino de IA

Um objetivo comum é permanecer visível nos mecanismos de resposta de IA e ao mesmo tempo manter seu conteúdo fora do treino de modelos. Permita os bots de busca e negue os rastreadores e tokens de treino:

# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Block AI training
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Google-Extended e Applebot-Extended são a chave dessa divisão. São tokens do robots.txt, não rastreadores separados. Negá-los exclui seu conteúdo do treino de IA do Gemini e da Apple, enquanto Googlebot e Applebot seguem indexando você para a busca normal.

Receita 3: permitir tudo (o padrão)

Se você não fizer nada, este é o estado real. Um Disallow vazio deixa cada rastreador buscar qualquer caminho:

User-agent: *
Disallow:

Um arquivo robots.txt inexistente significa o mesmo. Você só precisa de regras explícitas quando quer restringir algo.

Os 11 rastreadores de IA, comparados

BotEmpresaFinalidadeBloquear para parar…
GPTBotOpenAIRastreia para treinar modelosTreino com seu conteúdo
OAI-SearchBotOpenAIAlimenta os resultados de busca do ChatGPTAparecer na busca do ChatGPT
ChatGPT-UserOpenAINavegação e ações acionadas pelo usuárioBuscas acionadas pelo usuário a partir do ChatGPT
ClaudeBotAnthropicRastreia para treinar modelosTreino com seu conteúdo
Claude-UserAnthropicBuscas acionadas pelo usuárioBuscas acionadas pelo usuário a partir do Claude
PerplexityBotPerplexityIndexa para seu mecanismo de respostasIndexação no Perplexity
Perplexity-UserPerplexityBuscas acionadas pelo usuárioBuscas acionadas pelo usuário a partir do Perplexity
Google-ExtendedGoogleToken que rege o uso para treino do Gemini/Vertex AIUso do conteúdo para treinar Gemini/Vertex AI
Applebot-ExtendedAppleToken que rege o uso para treino de IA da AppleUso do conteúdo para treinar a IA da Apple
CCBotCommon CrawlCria um conjunto de dados público usado para treino de IAInclusão no conjunto de dados da Common Crawl
BytespiderByteDance (TikTok)Rastreador de IARastreamento de IA da ByteDance

O que o robots.txt pode e não pode fazer

Poucas regras decidem se o seu arquivo funciona sequer:

  • Ele deve ficar na raiz do domínio. Rastreadores leem https://example.com/robots.txt e nada além disso. Um arquivo em uma subpasta é ignorado, e cada subdomínio precisa do seu próprio.
  • O token não diferencia maiúsculas. GPTBot e gptbot correspondem ao mesmo rastreador. Mantenha a grafia documentada por legibilidade, mas não se preocupe com correspondência exata.
  • Algumas entradas são tokens, não rastreadores. Google-Extended e Applebot-Extended nunca buscam nada. Apenas sinalizam se Google e Apple podem usar conteúdo já rastreado para treino de IA.
  • É orientativo, não um muro. robots.txt é voluntário. Bots sérios o respeitam; ele não é controle de acesso e não vai parar um rastreador que decida ignorá-lo. Para um bloqueio duro, use regras de firewall, autenticação ou bloqueio na borda por user-agent e IP.

Combine com um arquivo llms.txt

O robots.txt decide quem pode rastrear. Um arquivo llms.txt faz o trabalho oposto: aponta aos sistemas de IA o conteúdo que você quer que leiam e entendam. Os dois trabalham juntos, e você pode criar um com o gerador de llms.txt. Para ver como seu site inteiro aparece aos rastreadores de IA, rode a verificação de prontidão para IA.

robots.txtrastreadores de IA

Frequently asked questions

Bloquear o GPTBot me remove do ChatGPT?
Não. O GPTBot só cuida dos rastreios de treino. Os resultados de busca do ChatGPT vêm do OAI-SearchBot, e a navegação acionada pelo usuário usa o ChatGPT-User. Para ficar fora da busca do ChatGPT, negue também o OAI-SearchBot. Cada agente da OpenAI é um token separado, então bloquear um não bloqueia os outros.
Qual a diferença entre Google-Extended e Googlebot?
O Googlebot rastreia páginas para a indexação de busca normal. O Google-Extended é um token do robots.txt, não um rastreador separado, que controla se seu conteúdo treina o Gemini e o Vertex AI. Negue o Google-Extended para sair do treino de IA enquanto suas páginas seguem indexadas na Busca do Google.
O robots.txt basta para deter a raspagem de IA?
Não. O robots.txt é orientativo. Rastreadores sérios o respeitam, mas ele não é controle de acesso e não pode deter um bot que ignore as regras. Para um bloqueio duro, use controles do servidor como regras de firewall, autenticação ou bloqueio por user-agent e IP na borda.
Onde fica o arquivo robots.txt?
Na raiz do seu domínio, acessível em https://example.com/robots.txt. Um arquivo em subpasta é ignorado, e cada subdomínio e esquema precisa do seu próprio. Os tokens de user-agent não diferenciam maiúsculas, então GPTBot e gptbot correspondem, mas mantenha a grafia documentada por clareza.
Posso bloquear rastreadores de IA e manter a busca normal?
Sim. Rastreadores de busca normais como Googlebot e Applebot são separados dos tokens de treino de IA. Negue o Google-Extended e o Applebot-Extended para sair do treino de IA enquanto Googlebot e Applebot seguem indexando seu site para os resultados de busca habituais.

Fazer uma verificação

Continue lendo