Ferramenta de diagnóstico

Testador de robots.txt

Carregue o robots.txt de um site ou cole o seu, informe uma URL e escolha um rastreador. Você recebe um veredito direto, a linha exata que decidiu e o mesmo teste rodado contra doze grandes rastreadores de uma vez.

Qualquer token de rastreador funciona, então digite o que precisar caso ele não esteja na lista.

As regras coladas são avaliadas inteiramente no seu navegador. Buscar o robots.txt de um domínio passa pelo nosso servidor apenas para baixar esse arquivo público, e nada é armazenado.

Como o robots.txt realmente decide o que vale

Um arquivo robots.txt é um conjunto de grupos. Cada grupo começa com uma ou mais linhas User-agent e reúne as regras Allow e Disallow que valem para esses rastreadores. Um rastreador lê apenas o grupo que corresponde ao seu próprio token de produto, mais o grupo curinga quando nenhum grupo nomeado serve, então regras escritas para o Googlebot não têm efeito nenhum sobre o GPTBot.

Quando várias regras de um grupo combinam com a mesma URL, vence a mais específica: aquela cujo padrão cobre o maior número de caracteres. Se um Allow e um Disallow empatam em tamanho, o Allow vence. Essa ordem vem da RFC 9309, o Protocolo de Exclusão de Robôs padronizado, e é por isso que Disallow: /admin/ junto de Allow: /admin/public/ mantém a pasta pública rastreável.

Os padrões aceitam dois curingas. O asterisco representa qualquer sequência de caracteres e o cifrão prende o padrão ao fim da URL. Os caminhos diferenciam maiúsculas de minúsculas, os nomes de rastreador não, e um robots.txt governa apenas o próprio esquema, host e porta, então o arquivo do subdomínio www não cobre o domínio sem www.

O que o testador mostra

  • O veredito para o rastreador que você escolher, com a regra exata e o número da linha por trás dele
  • A mesma URL testada contra doze rastreadores de uma vez, bots de busca e bots de IA lado a lado
  • Qual grupo foi aplicado, incluindo se era um grupo nomeado ou o curinga
  • Todas as linhas Sitemap declaradas no arquivo
  • Avisos de leitura: regras escritas antes de qualquer linha User-agent, diretivas não suportadas, URLs absolutas em Disallow, Sitemap ausente

Verificador de Prontidão para IA

ChatGPT, Claude e Perplexity conseguem ler e citar seu site? Verifica llms.txt, regras de robots.txt para rastreadores de IA, dados estruturados e metadados.

Verifique a prontidão para IA →

Do blog

Todos os guias →

Frequently asked questions

Bloquear uma página no robots.txt tira ela do Google?
Não. Uma regra Disallow impede o rastreamento, não a indexação. O Google ainda pode listar uma URL bloqueada que encontrou por links, exibindo-a sem descrição. Para manter uma página fora dos resultados, libere o rastreamento e use uma tag meta robots noindex na própria página.
Por que minha regra Disallow não funciona?
Quase sempre porque uma regra mais longa vence. A correspondência é pelo tamanho do padrão, não pela ordem no arquivo, e o Allow ganha no empate. Maiúsculas também contam: /Blog/ e /blog/ são caminhos diferentes. Teste aqui a URL exata e leia a regra que o testador aponta como vencedora.
O crawl-delay é respeitado?
Pelo Google não: ele ignora a diretiva por completo e pede que você ajuste a taxa de rastreamento nas configurações dele. Bing e Yandex historicamente respeitam. Deixar a linha no arquivo não custa nada, mas não conte com ela para controlar o Googlebot.
Posso colocar noindex no robots.txt?
No Google não adianta. O suporte à diretiva noindex não oficial dentro do robots.txt acabou em 1º de setembro de 2019. Use uma tag meta robots noindex ou um cabeçalho HTTP X-Robots-Tag na página que você quer manter fora dos resultados de busca.
Um robots.txt vale para os meus subdomínios?
Não. O arquivo vale para um único esquema, host e porta. Um blog em blog.example.com precisa do próprio robots.txt em blog.example.com/robots.txt, e a versão https de um site é tratada separadamente da versão http.