Guide

robots.txt pour robots d'IA : recettes prêtes

Trois recettes et un tableau robot par robot pour piloter GPTBot, ClaudeBot, PerplexityBot et les autres depuis un petit fichier texte.

Par La rédaction WebDoctor·22 juillet 2026·4 min de lecture


Pour piloter les robots d'IA, ajoutez des règles User-agent et Disallow dans le fichier robots.txt à la racine de votre domaine. Vous pouvez bloquer chaque robot d'IA, bloquer l'entraînement en gardant la recherche IA, ou tout autoriser. Le fichier est indicatif : les robots corrects le respectent, mais ce n'est pas un contrôle d'accès.

Comment robots.txt pilote les robots d'IA

Chaque entreprise d'IA exploite un ou plusieurs agents nommés. Vous les visez par leur token de user-agent dans robots.txt, puis vous décidez ce qu'ils peuvent récupérer. Trois manœuvres méritent d'être connues : bloquer un robot entièrement, bloquer seulement les crawlers d'entraînement en laissant passer les robots de recherche IA, ou tout laisser ouvert. Les recettes ci-dessous couvrent les trois. Chacune va dans un seul fichier à https://example.com/robots.txt.

Recette 1 : bloquer tous les robots d'IA

Ceci refuse chaque agent d'IA documenté et ajoute les deux tokens d'exclusion qui régissent l'usage pour l'entraînement. Collez-le tel quel ou retirez les robots qui vous importent peu :

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Un point à dire clairement : bloquer GPTBot arrête le crawler d'entraînement d'OpenAI, pas la recherche ChatGPT (c'est OAI-SearchBot) ni la navigation déclenchée par l'utilisateur (c'est ChatGPT-User). La recette ci-dessus couvre les trois, d'où un bloc distinct pour chacun.

Recette 2 : autoriser la recherche IA et bloquer l'entraînement

Un objectif courant : rester visible dans les moteurs de réponse IA tout en gardant votre contenu hors de l'entraînement des modèles. Autorisez les robots de recherche, refusez les crawlers et tokens d'entraînement :

# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Block AI training
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Google-Extended et Applebot-Extended sont la clé de cette séparation. Ce sont des tokens robots.txt, pas des crawlers distincts. Les refuser exclut votre contenu de l'entraînement IA de Gemini et d'Apple, tandis que Googlebot et Applebot continuent de vous indexer pour la recherche normale.

Recette 3 : tout autoriser (le défaut)

Si vous ne faites rien, c'est l'état réel. Un Disallow vide laisse chaque crawler récupérer n'importe quel chemin :

User-agent: *
Disallow:

Un fichier robots.txt absent signifie la même chose. Vous n'avez besoin de règles explicites que pour restreindre quelque chose.

Les 11 robots d'IA comparés

RobotEntrepriseRôleBloquer pour arrêter…
GPTBotOpenAIExplore pour entraîner les modèlesL'entraînement sur votre contenu
OAI-SearchBotOpenAIAlimente les résultats de recherche ChatGPTL'apparition dans la recherche ChatGPT
ChatGPT-UserOpenAINavigation et actions déclenchées par l'utilisateurLes requêtes déclenchées par l'utilisateur depuis ChatGPT
ClaudeBotAnthropicExplore pour entraîner les modèlesL'entraînement sur votre contenu
Claude-UserAnthropicRequêtes déclenchées par l'utilisateurLes requêtes déclenchées par l'utilisateur depuis Claude
PerplexityBotPerplexityIndexe pour son moteur de réponsesL'indexation dans Perplexity
Perplexity-UserPerplexityRequêtes déclenchées par l'utilisateurLes requêtes déclenchées par l'utilisateur depuis Perplexity
Google-ExtendedGoogleToken régissant l'usage pour l'entraînement Gemini/Vertex AIL'usage du contenu pour entraîner Gemini/Vertex AI
Applebot-ExtendedAppleToken régissant l'usage pour l'entraînement IA d'AppleL'usage du contenu pour entraîner l'IA d'Apple
CCBotCommon CrawlConstruit un jeu de données public utilisé pour l'IAL'inclusion dans le jeu de données Common Crawl
BytespiderByteDance (TikTok)Robot d'IAL'exploration IA par ByteDance

Ce que robots.txt peut et ne peut pas faire

Quelques règles décident si votre fichier fonctionne tout court :

  • Il doit être à la racine du domaine. Les crawlers lisent https://example.com/robots.txt et rien d'autre. Un fichier dans un sous-dossier est ignoré, et chaque sous-domaine a besoin du sien.
  • Le token est insensible à la casse. GPTBot et gptbot visent le même crawler. Gardez la casse documentée pour la lisibilité, mais une correspondance exacte n'est pas nécessaire.
  • Certaines entrées sont des tokens, pas des crawlers. Google-Extended et Applebot-Extended ne récupèrent jamais rien. Ils signalent seulement si Google et Apple peuvent utiliser du contenu déjà exploré pour entraîner l'IA.
  • C'est indicatif, pas un mur. robots.txt est volontaire. Les robots sérieux le respectent ; ce n'est pas un contrôle d'accès et cela n'arrêtera pas un crawler qui choisit de l'ignorer. Pour un blocage dur, utilisez des règles de pare-feu, l'authentification ou le blocage en périphérie par user-agent et IP.

Associez-le à un fichier llms.txt

robots.txt décide qui peut explorer. Un fichier llms.txt fait l'inverse : il indique aux systèmes d'IA le contenu que vous voulez qu'ils lisent et comprennent. Les deux fonctionnent ensemble, et vous en créez un avec le générateur de llms.txt. Pour voir comment tout votre site apparaît aux robots d'IA, lancez le test de préparation à l'IA.

robots.txtrobots d'IA

Frequently asked questions

Bloquer GPTBot me retire-t-il de ChatGPT ?
Non. GPTBot ne gère que les explorations d'entraînement. Les résultats de recherche ChatGPT viennent d'OAI-SearchBot, et la navigation déclenchée par l'utilisateur utilise ChatGPT-User. Pour rester hors de la recherche ChatGPT, refusez aussi OAI-SearchBot. Chaque agent OpenAI est un token distinct : en bloquer un ne bloque pas les autres.
Quelle différence entre Google-Extended et Googlebot ?
Googlebot explore les pages pour l'indexation de recherche normale. Google-Extended est un token robots.txt, pas un crawler distinct, qui contrôle si votre contenu entraîne Gemini et Vertex AI. Refusez Google-Extended pour vous exclure de l'entraînement IA tout en restant indexé dans la recherche Google.
robots.txt suffit-il à stopper le scraping IA ?
Non. robots.txt est indicatif. Les crawlers sérieux le respectent, mais ce n'est pas un contrôle d'accès et il ne peut pas arrêter un robot qui ignore les règles. Pour un blocage dur, utilisez des contrôles côté serveur : règles de pare-feu, authentification, ou blocage par user-agent et IP en périphérie.
Où doit se trouver le fichier robots.txt ?
À la racine de votre domaine, accessible à https://example.com/robots.txt. Un fichier dans un sous-dossier est ignoré, et chaque sous-domaine et schéma a besoin du sien. Les tokens de user-agent sont insensibles à la casse, donc GPTBot et gptbot correspondent, mais gardez la casse documentée pour la clarté.
Puis-je bloquer l'IA et garder la recherche normale ?
Oui. Les crawlers de recherche normaux comme Googlebot et Applebot sont distincts des tokens d'entraînement IA. Refusez Google-Extended et Applebot-Extended pour vous exclure de l'entraînement IA pendant que Googlebot et Applebot continuent d'indexer votre site pour les résultats de recherche habituels.

Lancer une vérification

À lire ensuite