Guía

robots.txt, noindex o canonical: cuál usar en cada caso

Tres herramientas, tres trabajos distintos. Con la equivocada, Google conserva la página que querías quitar o ni siquiera llega a leer tu instrucción.

Por Redacción de WebDoctor·6 de octubre de 2026·5 min de lectura


Usa robots.txt para controlar el rastreo, noindex para dejar una página fuera de los resultados y rel=canonical para elegir una URL dentro de un grupo de duplicados. Resuelven problemas distintos y se estorban entre sí: una página bloqueada en robots.txt puede indexarse igualmente, y Google nunca ve una regla noindex en una página que no puede rastrear.

¿Qué diferencia hay entre robots.txt, noindex y canonical?

Cada uno actúa en una fase distinta. robots.txt decide si un rastreador puede descargar una URL. noindex decide si una página ya descargada puede aparecer en los resultados. La canonical le indica a Google cuál de varias páginas casi idénticas debe representar al grupo. Así los describe la documentación de Google, uno junto a otro.

Disallow en robots.txtnoindexrel=canonical
ControlaEl rastreoLa indexaciónQué duplicado representa al grupo
Dónde vaEn el archivo robots.txt de la raíz del sitioUna metaetiqueta robots o un encabezado HTTP X-Robots-TagUn elemento link en el head o un encabezado HTTP Link
¿Saca la URL de Google?No. Una URL bloqueada puede indexarse si otros sitios enlazan a ellaSí, en cuanto Googlebot rastrea la página y lee la reglaNo. Los duplicados se consolidan, no se eliminan
¿Hace falta rastrear la página?NoSíSí
¿Qué tan firme es?Cada rastreador decide si la respetaGoogle retira la página por completoUna sugerencia, no una regla

¿Cuándo usar robots.txt?

Cuando el problema es el tráfico de rastreo. La introducción a robots.txt de Google dice que el archivo sirve principalmente para evitar que tu sitio se sobrecargue de solicitudes. En páginas web encaja en dos casos: tu servidor no da abasto con el rastreador de Google, o quieres evitar que se rastreen páginas poco importantes o similares. También es la vía documentada para impedir que imágenes, vídeos y audios aparezcan en la Búsqueda de Google.

Lo que no es, según Google, es un mecanismo para mantener una página web fuera de Google. Una página bloqueada puede indexarse si otros sitios enlazan a ella. La URL y el texto ancla de esos enlaces pueden salir en los resultados, solo que sin descripción. Además, las reglas son voluntarias: Googlebot las respeta, otros rastreadores quizá no. Comprueba qué permite de verdad tu archivo con nuestro probador de robots.txt.

¿Cuándo usar noindex?

Cuando una página no debe aparecer en la Búsqueda de Google. Pon <meta name="robots" content="noindex"> en el head, o envía X-Robots-Tag: noindex como encabezado de respuesta para archivos como los PDF. La documentación de noindex de Google explica que, cuando Googlebot rastrea la página y extrae la regla, Google la retira por completo de los resultados, aunque otros sitios la enlacen.

La trampa está en ese primer paso. Google tiene que rastrear la página para ver las metaetiquetas y los encabezados HTTP. Si la página sigue apareciendo después de añadir noindex, la documentación señala dos causas probables: Google aún no la ha vuelto a rastrear, o robots.txt la está bloqueando. La herramienta de inspección de URLs de Search Console permite solicitar un nuevo rastreo. Google también advierte que algunos otros buscadores podrían interpretar noindex de otra forma.

¿Cuándo conviene más una etiqueta canonical?

Cuando el mismo contenido vive en varias URLs y quieres que una de ellas reúna el mérito. La página de Google sobre cómo consolidar URLs duplicadas enumera los motivos: elegir qué URL ve la gente en los resultados, consolidar señales como los enlaces en una URL preferida, simplificar el seguimiento de métricas y no gastar tiempo de rastreo en duplicados.

Una canonical no oculta nada. La página sobre canonicalización de Google la llama una sugerencia, no una regla, y explica que la página canónica se rastrea con más regularidad y los duplicados con menos frecuencia. Un resultado suele apuntar a la canónica, salvo que un duplicado encaje mejor con quien busca. Las redirecciones y rel=canonical son señales fuertes, y la inclusión en el sitemap es una señal débil. Para archivos que no son HTML, envía la canonical como encabezado HTTP Link. Nuestra guía de conflictos de la etiqueta canonical explica qué pasa cuando esas señales no coinciden.

¿Se pueden usar robots.txt y noindex a la vez?

No en la misma URL, si lo que buscas es eliminarla. Google lo dice claramente: si robots.txt bloquea una página, el rastreador nunca verá la regla noindex y la página puede seguir apareciendo en los resultados. Así que, para una URL indexada que no se va, la solución es quitar el Disallow, dejar que Google la rastree y que noindex haga su trabajo.

La página de Google sobre URLs duplicadas cita tres errores más:

  • No uses robots.txt para la canonicalización.
  • No uses noindex para orientar la elección de la canónica dentro de un mismo sitio, porque bloquea la página por completo en la Búsqueda.
  • No uses la herramienta de retirada de URLs para la canonicalización, porque oculta todas las versiones de una URL.

¿Cuál deberías usar?

Parte del resultado que quieres, no de la herramienta que conoces.

  • Tu servidor está sobrecargado o los rastreadores pierden tiempo en páginas poco importantes: robots.txt.
  • Una página no debe aparecer en Google: noindex, con el rastreo abierto. Para cualquier cosa privada, protección con contraseña, que Google cita como la otra opción.
  • El mismo contenido está en varias URLs: rel=canonical en cada duplicado, o una redirección si el duplicado no necesita existir.
  • Imágenes, vídeos o audios que quieres fuera de la Búsqueda de Google: robots.txt.

Si te preocupan los rastreadores de IA, nuestra guía de robots.txt para rastreadores de IA trae reglas listas para copiar por cada bot.

IndexaciónSEO técnico

Frequently asked questions

¿Bloquear una página en robots.txt la elimina de Google?
No. Google dice que robots.txt no es un mecanismo para mantener una página web fuera de Google. Una página bloqueada puede indexarse si otros sitios enlazan a ella, y la URL puede aparecer en los resultados sin descripción. Para dejarla fuera, usa noindex y permite el rastreo.
¿Por qué mi página con noindex sigue en Google?
La documentación de Google da dos motivos probables. O Google no ha vuelto a rastrear la página desde que añadiste la regla, o robots.txt bloquea al rastreador y nunca ve el noindex. Quita cualquier Disallow de esa URL y solicita un nuevo rastreo con la inspección de URLs de Search Console.
¿Debo poner noindex a los duplicados en vez de usar canonical?
Google no lo recomienda. Su guía sobre URLs duplicadas dice que usar noindex para impedir la elección de una canónica dentro de un mismo sitio bloquea la página por completo en la Búsqueda. Una rel=canonical o una redirección consolida los duplicados en una URL preferida y mantiene juntas señales como los enlaces.
¿Google respeta siempre la etiqueta canonical?
No. Google llama a la preferencia canónica una sugerencia, no una regla, y elige la canónica a partir de señales que recoge al indexar. Las redirecciones y rel=canonical son señales fuertes, y la inclusión en el sitemap es débil, así que haz que las tres apunten a la misma URL.

Haz una comprobación

Sigue leyendo