robots.txt pour robots d'IA : recettes prêtes
Trois recettes et un tableau robot par robot pour piloter GPTBot, ClaudeBot, PerplexityBot et les autres depuis un petit fichier texte.
Pour piloter les robots d'IA, ajoutez des règles User-agent et Disallow dans le fichier robots.txt à la racine de votre domaine. Vous pouvez bloquer chaque robot d'IA, bloquer l'entraînement en gardant la recherche IA, ou tout autoriser. Le fichier est indicatif : les robots corrects le respectent, mais ce n'est pas un contrôle d'accès.
Comment robots.txt pilote les robots d'IA
Chaque entreprise d'IA exploite un ou plusieurs agents nommés. Vous les visez par leur token de user-agent dans robots.txt, puis vous décidez ce qu'ils peuvent récupérer. Trois manœuvres méritent d'être connues : bloquer un robot entièrement, bloquer seulement les crawlers d'entraînement en laissant passer les robots de recherche IA, ou tout laisser ouvert. Les recettes ci-dessous couvrent les trois. Chacune va dans un seul fichier à https://example.com/robots.txt.
Recette 1 : bloquer tous les robots d'IA
Ceci refuse chaque agent d'IA documenté et ajoute les deux tokens d'exclusion qui régissent l'usage pour l'entraînement. Collez-le tel quel ou retirez les robots qui vous importent peu :
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Un point à dire clairement : bloquer GPTBot arrête le crawler d'entraînement d'OpenAI, pas la recherche ChatGPT (c'est OAI-SearchBot) ni la navigation déclenchée par l'utilisateur (c'est ChatGPT-User). La recette ci-dessus couvre les trois, d'où un bloc distinct pour chacun.
Recette 2 : autoriser la recherche IA et bloquer l'entraînement
Un objectif courant : rester visible dans les moteurs de réponse IA tout en gardant votre contenu hors de l'entraînement des modèles. Autorisez les robots de recherche, refusez les crawlers et tokens d'entraînement :
# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Block AI training
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Google-Extended et Applebot-Extended sont la clé de cette séparation. Ce sont des tokens robots.txt, pas des crawlers distincts. Les refuser exclut votre contenu de l'entraînement IA de Gemini et d'Apple, tandis que Googlebot et Applebot continuent de vous indexer pour la recherche normale.
Recette 3 : tout autoriser (le défaut)
Si vous ne faites rien, c'est l'état réel. Un Disallow vide laisse chaque crawler récupérer n'importe quel chemin :
User-agent: *
Disallow:
Un fichier robots.txt absent signifie la même chose. Vous n'avez besoin de règles explicites que pour restreindre quelque chose.
Les 11 robots d'IA comparés
| Robot | Entreprise | Rôle | Bloquer pour arrêter… |
|---|---|---|---|
| GPTBot | OpenAI | Explore pour entraîner les modèles | L'entraînement sur votre contenu |
| OAI-SearchBot | OpenAI | Alimente les résultats de recherche ChatGPT | L'apparition dans la recherche ChatGPT |
| ChatGPT-User | OpenAI | Navigation et actions déclenchées par l'utilisateur | Les requêtes déclenchées par l'utilisateur depuis ChatGPT |
| ClaudeBot | Anthropic | Explore pour entraîner les modèles | L'entraînement sur votre contenu |
| Claude-User | Anthropic | Requêtes déclenchées par l'utilisateur | Les requêtes déclenchées par l'utilisateur depuis Claude |
| PerplexityBot | Perplexity | Indexe pour son moteur de réponses | L'indexation dans Perplexity |
| Perplexity-User | Perplexity | Requêtes déclenchées par l'utilisateur | Les requêtes déclenchées par l'utilisateur depuis Perplexity |
| Google-Extended | Token régissant l'usage pour l'entraînement Gemini/Vertex AI | L'usage du contenu pour entraîner Gemini/Vertex AI | |
| Applebot-Extended | Apple | Token régissant l'usage pour l'entraînement IA d'Apple | L'usage du contenu pour entraîner l'IA d'Apple |
| CCBot | Common Crawl | Construit un jeu de données public utilisé pour l'IA | L'inclusion dans le jeu de données Common Crawl |
| Bytespider | ByteDance (TikTok) | Robot d'IA | L'exploration IA par ByteDance |
Ce que robots.txt peut et ne peut pas faire
Quelques règles décident si votre fichier fonctionne tout court :
- Il doit être à la racine du domaine. Les crawlers lisent
https://example.com/robots.txtet rien d'autre. Un fichier dans un sous-dossier est ignoré, et chaque sous-domaine a besoin du sien. - Le token est insensible à la casse.
GPTBotetgptbotvisent le même crawler. Gardez la casse documentée pour la lisibilité, mais une correspondance exacte n'est pas nécessaire. - Certaines entrées sont des tokens, pas des crawlers.
Google-ExtendedetApplebot-Extendedne récupèrent jamais rien. Ils signalent seulement si Google et Apple peuvent utiliser du contenu déjà exploré pour entraîner l'IA. - C'est indicatif, pas un mur. robots.txt est volontaire. Les robots sérieux le respectent ; ce n'est pas un contrôle d'accès et cela n'arrêtera pas un crawler qui choisit de l'ignorer. Pour un blocage dur, utilisez des règles de pare-feu, l'authentification ou le blocage en périphérie par user-agent et IP.
Associez-le à un fichier llms.txt
robots.txt décide qui peut explorer. Un fichier llms.txt fait l'inverse : il indique aux systèmes d'IA le contenu que vous voulez qu'ils lisent et comprennent. Les deux fonctionnent ensemble, et vous en créez un avec le générateur de llms.txt. Pour voir comment tout votre site apparaît aux robots d'IA, lancez le test de préparation à l'IA.