robots.txt para rastreadores de IA: recetas listas
Tres recetas y una tabla bot por bot para controlar GPTBot, ClaudeBot, PerplexityBot y los demás desde un pequeño archivo de texto.
Para controlar los rastreadores de IA, añade reglas User-agent y Disallow en el archivo robots.txt de la raíz de tu dominio. Puedes bloquear cada bot de IA, bloquear el entrenamiento pero mantener la búsqueda de IA, o permitir todo. El archivo es orientativo: los bots correctos lo respetan, pero no es un control de acceso.
Cómo controla robots.txt a los rastreadores de IA
Cada empresa de IA opera uno o varios agentes con nombre. Los identificas por su token de user-agent en robots.txt y luego decides qué pueden solicitar. Hay tres jugadas que conviene conocer: bloquear un bot por completo, bloquear solo los rastreadores de entrenamiento dejando pasar los bots de búsqueda de IA, o dejar todo abierto. Las recetas siguientes cubren las tres. Cada una va en un único archivo en https://example.com/robots.txt.
Receta 1: bloquear todos los rastreadores de IA
Esto deniega cada agente de IA documentado y añade los dos tokens de exclusión que rigen el uso para entrenamiento. Pégalo tal cual o recorta los bots que no te importen:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Un matiz que conviene decir con claridad: bloquear GPTBot detiene el rastreador de entrenamiento de OpenAI, no la búsqueda de ChatGPT (eso es OAI-SearchBot) ni la navegación iniciada por el usuario (eso es ChatGPT-User). La receta anterior cubre las tres, por eso cada una recibe su propio bloque.
Receta 2: permitir la búsqueda de IA y bloquear el entrenamiento
Un objetivo habitual es seguir visible en los motores de respuestas de IA y mantener tu contenido fuera del entrenamiento de modelos. Permite los bots de búsqueda y deniega los rastreadores y tokens de entrenamiento:
# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Block AI training
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Google-Extended y Applebot-Extended son la clave de esta separación. Son tokens de robots.txt, no rastreadores aparte. Denegarlos excluye tu contenido del entrenamiento de IA de Gemini y Apple, mientras Googlebot y Applebot te siguen indexando para la búsqueda normal.
Receta 3: permitir todo (lo predeterminado)
Si no haces nada, este es el estado real. Un Disallow vacío deja que cada rastreador solicite cualquier ruta:
User-agent: *
Disallow:
Un archivo robots.txt inexistente significa lo mismo. Solo necesitas reglas explícitas cuando quieres restringir algo.
Los 11 rastreadores de IA, comparados
| Bot | Empresa | Propósito | Bloquear para detener… |
|---|---|---|---|
| GPTBot | OpenAI | Rastrea para entrenar modelos | Entrenamiento con tu contenido |
| OAI-SearchBot | OpenAI | Genera los resultados de búsqueda de ChatGPT | Aparecer en la búsqueda de ChatGPT |
| ChatGPT-User | OpenAI | Navegación y acciones iniciadas por el usuario | Solicitudes iniciadas por el usuario desde ChatGPT |
| ClaudeBot | Anthropic | Rastrea para entrenar modelos | Entrenamiento con tu contenido |
| Claude-User | Anthropic | Solicitudes iniciadas por el usuario | Solicitudes iniciadas por el usuario desde Claude |
| PerplexityBot | Perplexity | Indexa para su motor de respuestas | Indexación en Perplexity |
| Perplexity-User | Perplexity | Solicitudes iniciadas por el usuario | Solicitudes iniciadas por el usuario desde Perplexity |
| Google-Extended | Token que rige el uso para entrenamiento de Gemini/Vertex AI | Uso del contenido para entrenar Gemini/Vertex AI | |
| Applebot-Extended | Apple | Token que rige el uso para entrenamiento de IA de Apple | Uso del contenido para entrenar la IA de Apple |
| CCBot | Common Crawl | Crea un conjunto de datos público usado para entrenar IA | Inclusión en el conjunto de datos de Common Crawl |
| Bytespider | ByteDance (TikTok) | Rastreador de IA | Rastreo de IA de ByteDance |
Lo que robots.txt puede y no puede hacer
Unas pocas reglas deciden si tu archivo funciona siquiera:
- Debe estar en la raíz del dominio. Los rastreadores leen
https://example.com/robots.txty nada más. Un archivo en una subcarpeta se ignora, y cada subdominio necesita el suyo. - El token no distingue mayúsculas.
GPTBotygptbotapuntan al mismo rastreador. Mantén la grafía documentada por legibilidad, pero no te preocupes por una coincidencia exacta. - Algunas entradas son tokens, no rastreadores.
Google-ExtendedyApplebot-Extendednunca solicitan nada. Solo señalan si Google y Apple pueden usar contenido ya rastreado para entrenar IA. - Es orientativo, no un muro. robots.txt es voluntario. Los bots serios lo respetan; no es un control de acceso y no detendrá a un rastreador que decida ignorarlo. Para un bloqueo duro, usa reglas de firewall, autenticación o bloqueo en el edge por user-agent e IP.
Combínalo con un archivo llms.txt
robots.txt decide quién puede rastrear. Un archivo llms.txt hace lo contrario: señala a los sistemas de IA el contenido que quieres que lean y entiendan. Ambos trabajan juntos, y puedes crear uno con el generador de llms.txt. Para ver cómo se ve todo tu sitio ante los rastreadores de IA, ejecuta la comprobación de preparación para IA.