robots.txt, noindex o canonical: cuál usar en cada caso
Tres herramientas, tres trabajos distintos. Con la equivocada, Google conserva la página que querías quitar o ni siquiera llega a leer tu instrucción.
Usa robots.txt para controlar el rastreo, noindex para dejar una página fuera de los resultados y rel=canonical para elegir una URL dentro de un grupo de duplicados. Resuelven problemas distintos y se estorban entre sí: una página bloqueada en robots.txt puede indexarse igualmente, y Google nunca ve una regla noindex en una página que no puede rastrear.
¿Qué diferencia hay entre robots.txt, noindex y canonical?
Cada uno actúa en una fase distinta. robots.txt decide si un rastreador puede descargar una URL. noindex decide si una página ya descargada puede aparecer en los resultados. La canonical le indica a Google cuál de varias páginas casi idénticas debe representar al grupo. Así los describe la documentación de Google, uno junto a otro.
| Disallow en robots.txt | noindex | rel=canonical | |
|---|---|---|---|
| Controla | El rastreo | La indexación | Qué duplicado representa al grupo |
| Dónde va | En el archivo robots.txt de la raíz del sitio | Una metaetiqueta robots o un encabezado HTTP X-Robots-Tag | Un elemento link en el head o un encabezado HTTP Link |
| ¿Saca la URL de Google? | No. Una URL bloqueada puede indexarse si otros sitios enlazan a ella | Sí, en cuanto Googlebot rastrea la página y lee la regla | No. Los duplicados se consolidan, no se eliminan |
| ¿Hace falta rastrear la página? | No | Sí | Sí |
| ¿Qué tan firme es? | Cada rastreador decide si la respeta | Google retira la página por completo | Una sugerencia, no una regla |
¿Cuándo usar robots.txt?
Cuando el problema es el tráfico de rastreo. La introducción a robots.txt de Google dice que el archivo sirve principalmente para evitar que tu sitio se sobrecargue de solicitudes. En páginas web encaja en dos casos: tu servidor no da abasto con el rastreador de Google, o quieres evitar que se rastreen páginas poco importantes o similares. También es la vía documentada para impedir que imágenes, vídeos y audios aparezcan en la Búsqueda de Google.
Lo que no es, según Google, es un mecanismo para mantener una página web fuera de Google. Una página bloqueada puede indexarse si otros sitios enlazan a ella. La URL y el texto ancla de esos enlaces pueden salir en los resultados, solo que sin descripción. Además, las reglas son voluntarias: Googlebot las respeta, otros rastreadores quizá no. Comprueba qué permite de verdad tu archivo con nuestro probador de robots.txt.
¿Cuándo usar noindex?
Cuando una página no debe aparecer en la Búsqueda de Google. Pon <meta name="robots" content="noindex"> en el head, o envía X-Robots-Tag: noindex como encabezado de respuesta para archivos como los PDF. La documentación de noindex de Google explica que, cuando Googlebot rastrea la página y extrae la regla, Google la retira por completo de los resultados, aunque otros sitios la enlacen.
La trampa está en ese primer paso. Google tiene que rastrear la página para ver las metaetiquetas y los encabezados HTTP. Si la página sigue apareciendo después de añadir noindex, la documentación señala dos causas probables: Google aún no la ha vuelto a rastrear, o robots.txt la está bloqueando. La herramienta de inspección de URLs de Search Console permite solicitar un nuevo rastreo. Google también advierte que algunos otros buscadores podrían interpretar noindex de otra forma.
¿Cuándo conviene más una etiqueta canonical?
Cuando el mismo contenido vive en varias URLs y quieres que una de ellas reúna el mérito. La página de Google sobre cómo consolidar URLs duplicadas enumera los motivos: elegir qué URL ve la gente en los resultados, consolidar señales como los enlaces en una URL preferida, simplificar el seguimiento de métricas y no gastar tiempo de rastreo en duplicados.
Una canonical no oculta nada. La página sobre canonicalización de Google la llama una sugerencia, no una regla, y explica que la página canónica se rastrea con más regularidad y los duplicados con menos frecuencia. Un resultado suele apuntar a la canónica, salvo que un duplicado encaje mejor con quien busca. Las redirecciones y rel=canonical son señales fuertes, y la inclusión en el sitemap es una señal débil. Para archivos que no son HTML, envía la canonical como encabezado HTTP Link. Nuestra guía de conflictos de la etiqueta canonical explica qué pasa cuando esas señales no coinciden.
¿Se pueden usar robots.txt y noindex a la vez?
No en la misma URL, si lo que buscas es eliminarla. Google lo dice claramente: si robots.txt bloquea una página, el rastreador nunca verá la regla noindex y la página puede seguir apareciendo en los resultados. Así que, para una URL indexada que no se va, la solución es quitar el Disallow, dejar que Google la rastree y que noindex haga su trabajo.
La página de Google sobre URLs duplicadas cita tres errores más:
- No uses robots.txt para la canonicalización.
- No uses noindex para orientar la elección de la canónica dentro de un mismo sitio, porque bloquea la página por completo en la Búsqueda.
- No uses la herramienta de retirada de URLs para la canonicalización, porque oculta todas las versiones de una URL.
¿Cuál deberías usar?
Parte del resultado que quieres, no de la herramienta que conoces.
- Tu servidor está sobrecargado o los rastreadores pierden tiempo en páginas poco importantes: robots.txt.
- Una página no debe aparecer en Google: noindex, con el rastreo abierto. Para cualquier cosa privada, protección con contraseña, que Google cita como la otra opción.
- El mismo contenido está en varias URLs: rel=canonical en cada duplicado, o una redirección si el duplicado no necesita existir.
- Imágenes, vídeos o audios que quieres fuera de la Búsqueda de Google: robots.txt.
Si te preocupan los rastreadores de IA, nuestra guía de robots.txt para rastreadores de IA trae reglas listas para copiar por cada bot.