Herramienta de diagnóstico

Probador de robots.txt

Carga el robots.txt de un sitio o pega el tuyo, introduce una URL y elige un rastreador. Obtienes un veredicto claro, la línea exacta que lo decide y esa misma prueba contra doce rastreadores importantes a la vez.

Vale cualquier token de rastreador, así que escribe el que necesites si no aparece en la lista.

Las reglas pegadas se evalúan íntegramente en tu navegador. Cargar el robots.txt de un dominio pasa por nuestro servidor solo para descargar ese archivo público, y no se almacena nada.

Cómo funciona de verdad la coincidencia de reglas en robots.txt

Un archivo robots.txt es un conjunto de grupos. Cada grupo empieza con una o varias líneas User-agent y contiene las reglas Allow y Disallow que se aplican a esos rastreadores. Un rastreador solo lee el grupo que coincide con su propio token de producto, más el grupo comodín si ningún grupo con nombre le encaja, así que las reglas escritas para Googlebot no afectan en nada a GPTBot.

Cuando varias reglas de un grupo coinciden con la misma URL, gana la más específica: aquella cuyo patrón cubre más caracteres. Si un Allow y un Disallow empatan en longitud, gana el Allow. Ese orden viene de RFC 9309, el Protocolo de Exclusión de Robots estandarizado, y es la razón por la que Disallow: /admin/ junto a Allow: /admin/public/ deja rastreable la carpeta pública.

Los patrones admiten dos comodines. El asterisco representa cualquier secuencia de caracteres y el signo de dólar ancla el patrón al final de la URL. Las rutas distinguen mayúsculas y minúsculas, los nombres de rastreador no, y un robots.txt solo rige su propio esquema, host y puerto, así que el archivo del subdominio www no cubre el dominio a secas.

Qué te muestra el probador

  • El veredicto para el rastreador que elijas, con la regla exacta y el número de línea que lo respaldan
  • La misma URL probada contra doce rastreadores a la vez, bots de búsqueda y bots de IA en paralelo
  • Qué grupo ha coincidido, indicando si era un grupo con nombre o el comodín
  • Todas las líneas Sitemap declaradas en el archivo
  • Avisos de análisis: reglas escritas antes de cualquier línea User-agent, directivas no admitidas, URLs absolutas en Disallow, Sitemap ausente

Comprobador de preparación para IA

¿Pueden ChatGPT, Claude y Perplexity leer y citar tu sitio? Comprueba llms.txt, las reglas de robots.txt para rastreadores de IA, los datos estructurados y los metadatos.

Comprueba tu preparación para IA →

Del blog

Todas las guías →

Frequently asked questions

¿Bloquear una página en robots.txt la elimina de Google?
No. Una regla Disallow impide el rastreo, no la indexación. Google puede seguir listando una URL bloqueada que encuentre a través de enlaces, mostrándola sin descripción. Para dejar una página fuera de los resultados, permite el rastreo y usa una etiqueta meta robots noindex en la propia página.
¿Por qué no funciona mi regla Disallow?
Casi siempre porque otra regla más larga la gana. La coincidencia se decide por la longitud del patrón, no por el orden en el archivo, y en caso de empate gana Allow. Las mayúsculas también cuentan: /Blog/ y /blog/ son rutas distintas. Prueba aquí la URL exacta y lee la regla que el probador señala como ganadora.
¿Se respeta crawl-delay?
Google no lo hace: ignora la directiva por completo y pide que ajustes la frecuencia de rastreo desde su panel. Bing y Yandex sí la han tenido en cuenta históricamente. Dejarla en tu archivo no cuesta nada, pero no confíes en ella para controlar a Googlebot.
¿Puedo poner noindex en robots.txt?
En Google no sirve de nada. La compatibilidad con la directiva noindex no oficial dentro de robots.txt terminó el 1 de septiembre de 2019. Usa una etiqueta meta robots noindex o una cabecera HTTP X-Robots-Tag en la página que quieras mantener fuera de los resultados.
¿Un solo robots.txt cubre mis subdominios?
No. El archivo se aplica a un único esquema, host y puerto. Un blog en blog.example.com necesita su propio robots.txt en blog.example.com/robots.txt, y la versión https de un sitio se trata aparte de la versión http.