Outil de diagnostic

Testeur de robots.txt

Chargez le robots.txt d'un site ou collez le vôtre, saisissez une URL et choisissez un robot. Vous obtenez un verdict clair, la ligne exacte qui l'a décidé, et le même test lancé sur douze robots majeurs à la fois.

N'importe quel token de robot fonctionne : saisissez le vôtre si celui qu'il vous faut n'est pas dans la liste.

Les règles collées sont évaluées entièrement dans votre navigateur. Récupérer le robots.txt d'un domaine passe par notre serveur uniquement pour télécharger ce fichier public, et rien n'est conservé.

Comment robots.txt applique réellement ses règles

Un fichier robots.txt est un ensemble de groupes. Chaque groupe commence par une ou plusieurs lignes User-agent et contient les règles Allow et Disallow qui s'appliquent à ces robots. Un robot ne lit que le groupe correspondant à son propre token de produit, plus le groupe générique si aucun groupe nommé ne lui convient : les règles écrites pour Googlebot n'ont donc aucun effet sur GPTBot.

Quand plusieurs règles d'un même groupe correspondent à une URL, la plus spécifique l'emporte : celle dont le motif couvre le plus grand nombre de caractères. À longueur égale entre un Allow et un Disallow, c'est l'Allow qui gagne. Cet ordre vient de la RFC 9309, le protocole d'exclusion des robots normalisé, et c'est pourquoi Disallow: /admin/ associé à Allow: /admin/public/ laisse le dossier public explorable.

Les motifs acceptent deux jokers. L'astérisque remplace n'importe quelle suite de caractères et le signe dollar ancre le motif à la fin de l'URL. Les chemins sont sensibles à la casse, les noms de robots ne le sont pas, et un robots.txt ne régit que son propre schéma, hôte et port : le fichier du sous-domaine www ne couvre donc pas le domaine nu.

Ce que le testeur affiche

  • Le verdict pour le robot que vous choisissez, avec la règle exacte et le numéro de ligne qui le justifient
  • La même URL testée sur douze robots à la fois, robots de recherche et robots IA côte à côte
  • Le groupe qui s'est appliqué, en précisant s'il s'agissait d'un groupe nommé ou du groupe générique
  • Toutes les lignes Sitemap déclarées dans le fichier
  • Les avertissements d'analyse : règles placées avant toute ligne User-agent, directives non prises en charge, URL absolues dans Disallow, Sitemap manquant

Vérificateur de préparation IA

ChatGPT, Claude et Perplexity peuvent-ils lire et citer votre site ? Vérifie llms.txt, les règles robots.txt pour les robots IA, les données structurées et les métadonnées.

Vérifiez votre préparation IA →

Sur le blog

Tous les guides →

Frequently asked questions

Bloquer une page dans robots.txt la retire-t-elle de Google ?
Non. Une règle Disallow empêche l'exploration, pas l'indexation. Google peut toujours afficher une URL bloquée qu'il a trouvée via des liens, mais sans description. Pour garder une page hors des résultats, autorisez l'exploration et posez une balise meta robots noindex sur la page elle-même.
Pourquoi ma règle Disallow ne fonctionne-t-elle pas ?
En général, une règle plus longue la supplante. La correspondance dépend de la longueur du motif, pas de l'ordre dans le fichier, et Allow l'emporte à égalité. La casse compte aussi : /Blog/ et /blog/ sont deux chemins distincts. Testez ici l'URL exacte et lisez la règle que le testeur désigne comme gagnante.
Le crawl-delay est-il respecté ?
Pas par Google, qui ignore complètement la directive et invite les propriétaires de sites à régler la vitesse d'exploration autrement. Bing et Yandex l'ont historiquement prise en compte. La laisser dans votre fichier ne coûte rien, mais ne comptez pas dessus pour contrôler Googlebot.
Puis-je mettre noindex dans robots.txt ?
Cela ne sert à rien chez Google. La prise en charge de la directive noindex non officielle dans robots.txt a pris fin le 1er septembre 2019. Utilisez une balise meta robots noindex ou un en-tête HTTP X-Robots-Tag sur la page à exclure des résultats de recherche.
Un seul robots.txt couvre-t-il mes sous-domaines ?
Non. Le fichier ne s'applique qu'à un schéma, un hôte et un port. Un blog sur blog.example.com a besoin de son propre robots.txt à blog.example.com/robots.txt, et la version https d'un site est traitée séparément de la version http.