Guía

robots.txt para rastreadores de IA: recetas listas

Tres recetas y una tabla bot por bot para controlar GPTBot, ClaudeBot, PerplexityBot y los demás desde un pequeño archivo de texto.

Por Redacción de WebDoctor·22 de julio de 2026·4 min de lectura


Para controlar los rastreadores de IA, añade reglas User-agent y Disallow en el archivo robots.txt de la raíz de tu dominio. Puedes bloquear cada bot de IA, bloquear el entrenamiento pero mantener la búsqueda de IA, o permitir todo. El archivo es orientativo: los bots correctos lo respetan, pero no es un control de acceso.

Cómo controla robots.txt a los rastreadores de IA

Cada empresa de IA opera uno o varios agentes con nombre. Los identificas por su token de user-agent en robots.txt y luego decides qué pueden solicitar. Hay tres jugadas que conviene conocer: bloquear un bot por completo, bloquear solo los rastreadores de entrenamiento dejando pasar los bots de búsqueda de IA, o dejar todo abierto. Las recetas siguientes cubren las tres. Cada una va en un único archivo en https://example.com/robots.txt.

Receta 1: bloquear todos los rastreadores de IA

Esto deniega cada agente de IA documentado y añade los dos tokens de exclusión que rigen el uso para entrenamiento. Pégalo tal cual o recorta los bots que no te importen:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Un matiz que conviene decir con claridad: bloquear GPTBot detiene el rastreador de entrenamiento de OpenAI, no la búsqueda de ChatGPT (eso es OAI-SearchBot) ni la navegación iniciada por el usuario (eso es ChatGPT-User). La receta anterior cubre las tres, por eso cada una recibe su propio bloque.

Receta 2: permitir la búsqueda de IA y bloquear el entrenamiento

Un objetivo habitual es seguir visible en los motores de respuestas de IA y mantener tu contenido fuera del entrenamiento de modelos. Permite los bots de búsqueda y deniega los rastreadores y tokens de entrenamiento:

# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Block AI training
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Google-Extended y Applebot-Extended son la clave de esta separación. Son tokens de robots.txt, no rastreadores aparte. Denegarlos excluye tu contenido del entrenamiento de IA de Gemini y Apple, mientras Googlebot y Applebot te siguen indexando para la búsqueda normal.

Receta 3: permitir todo (lo predeterminado)

Si no haces nada, este es el estado real. Un Disallow vacío deja que cada rastreador solicite cualquier ruta:

User-agent: *
Disallow:

Un archivo robots.txt inexistente significa lo mismo. Solo necesitas reglas explícitas cuando quieres restringir algo.

Los 11 rastreadores de IA, comparados

BotEmpresaPropósitoBloquear para detener…
GPTBotOpenAIRastrea para entrenar modelosEntrenamiento con tu contenido
OAI-SearchBotOpenAIGenera los resultados de búsqueda de ChatGPTAparecer en la búsqueda de ChatGPT
ChatGPT-UserOpenAINavegación y acciones iniciadas por el usuarioSolicitudes iniciadas por el usuario desde ChatGPT
ClaudeBotAnthropicRastrea para entrenar modelosEntrenamiento con tu contenido
Claude-UserAnthropicSolicitudes iniciadas por el usuarioSolicitudes iniciadas por el usuario desde Claude
PerplexityBotPerplexityIndexa para su motor de respuestasIndexación en Perplexity
Perplexity-UserPerplexitySolicitudes iniciadas por el usuarioSolicitudes iniciadas por el usuario desde Perplexity
Google-ExtendedGoogleToken que rige el uso para entrenamiento de Gemini/Vertex AIUso del contenido para entrenar Gemini/Vertex AI
Applebot-ExtendedAppleToken que rige el uso para entrenamiento de IA de AppleUso del contenido para entrenar la IA de Apple
CCBotCommon CrawlCrea un conjunto de datos público usado para entrenar IAInclusión en el conjunto de datos de Common Crawl
BytespiderByteDance (TikTok)Rastreador de IARastreo de IA de ByteDance

Lo que robots.txt puede y no puede hacer

Unas pocas reglas deciden si tu archivo funciona siquiera:

  • Debe estar en la raíz del dominio. Los rastreadores leen https://example.com/robots.txt y nada más. Un archivo en una subcarpeta se ignora, y cada subdominio necesita el suyo.
  • El token no distingue mayúsculas. GPTBot y gptbot apuntan al mismo rastreador. Mantén la grafía documentada por legibilidad, pero no te preocupes por una coincidencia exacta.
  • Algunas entradas son tokens, no rastreadores. Google-Extended y Applebot-Extended nunca solicitan nada. Solo señalan si Google y Apple pueden usar contenido ya rastreado para entrenar IA.
  • Es orientativo, no un muro. robots.txt es voluntario. Los bots serios lo respetan; no es un control de acceso y no detendrá a un rastreador que decida ignorarlo. Para un bloqueo duro, usa reglas de firewall, autenticación o bloqueo en el edge por user-agent e IP.

Combínalo con un archivo llms.txt

robots.txt decide quién puede rastrear. Un archivo llms.txt hace lo contrario: señala a los sistemas de IA el contenido que quieres que lean y entiendan. Ambos trabajan juntos, y puedes crear uno con el generador de llms.txt. Para ver cómo se ve todo tu sitio ante los rastreadores de IA, ejecuta la comprobación de preparación para IA.

robots.txtrastreadores de IA

Frequently asked questions

¿Bloquear GPTBot me elimina de ChatGPT?
No. GPTBot solo hace rastreos de entrenamiento. Los resultados de búsqueda de ChatGPT vienen de OAI-SearchBot, y la navegación iniciada por el usuario usa ChatGPT-User. Para quedar fuera de la búsqueda de ChatGPT, deniega también OAI-SearchBot. Cada agente de OpenAI es un token distinto, así que bloquear uno no bloquea los demás.
¿Qué diferencia hay entre Google-Extended y Googlebot?
Googlebot rastrea páginas para la indexación de búsqueda normal. Google-Extended es un token de robots.txt, no un rastreador aparte, que controla si tu contenido entrena a Gemini y Vertex AI. Deniega Google-Extended para excluirte del entrenamiento de IA mientras tus páginas siguen indexadas en la búsqueda de Google.
¿Basta robots.txt para frenar el scraping de IA?
No. robots.txt es orientativo. Los rastreadores serios lo respetan, pero no es un control de acceso y no puede detener a un bot que ignore las reglas. Para un bloqueo duro, usa controles del servidor como reglas de firewall, autenticación o bloqueo por user-agent e IP en el edge.
¿Dónde va el archivo robots.txt?
En la raíz de tu dominio, accesible en https://example.com/robots.txt. Un archivo en una subcarpeta se ignora, y cada subdominio y esquema necesita el suyo. Los tokens de user-agent no distinguen mayúsculas, así que GPTBot y gptbot coinciden, pero mantén la grafía documentada por claridad.
¿Puedo bloquear la IA y mantener la búsqueda normal?
Sí. Los rastreadores de búsqueda normales como Googlebot y Applebot están separados de los tokens de entrenamiento de IA. Deniega Google-Extended y Applebot-Extended para excluirte del entrenamiento de IA mientras Googlebot y Applebot siguen indexando tu sitio para los resultados de búsqueda habituales.

Haz una comprobación

Sigue leyendo