Guía

Errores comunes en sitemaps XML y cómo corregirlos

Del espacio de nombres equivocado al «No se ha podido obtener» de Search Console: cada error habitual de sitemap con su síntoma, su causa y su arreglo.

Por Redacción de WebDoctor·16 de julio de 2026·5 min de lectura


Casi todos los errores de sitemap XML se reducen a nueve causas: espacio de nombres incorrecto, caracteres sin escapar, URLs relativas, fechas lastmod mal formateadas, archivos que superan los límites, respuestas HTTP erróneas, URLs en otro host, páginas bloqueadas por robots.txt y fallos de obtención en Search Console. Cada una tiene una solución concreta que puedes aplicar hoy mismo.

1. Espacio de nombres incorrecto o ausente

Es el error más traicionero porque el archivo parece perfecto a simple vista. El elemento raíz <urlset> debe declarar exactamente este atributo:

<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">

Una errata (sitemap/0.9/ con barra final, https en vez de http, el antiguo espacio de nombres 0.84) hace que muchos analizadores rechacen el archivo completo. La solución es copiar la declaración tal cual aparece en el protocolo oficial de sitemaps.org, sin improvisar.

2. Caracteres sin escapar en las URLs

Un sitemap es XML, y en XML los caracteres & < > " ' tienen significado propio. El caso típico es un ampersand en una cadena de consulta:

<!-- Mal: rompe el análisis XML -->
<loc>https://example.com/buscar?talla=m&color=rojo</loc>

<!-- Bien: el ampersand va escapado -->
<loc>https://example.com/buscar?talla=m&amp;color=rojo</loc>

Si generas el sitemap con una librería XML de verdad (y no concatenando cadenas), este error desaparece solo: la librería escapa por ti.

3. URLs relativas o sin esquema

Cada <loc> debe contener una URL absoluta y completa, con esquema incluido: https://example.com/pagina/. Rutas relativas como /pagina/ o URLs sin protocolo como //example.com/pagina/ no son válidas según el protocolo. Revisa la configuración de tu generador: casi todos tienen una opción de «URL base» o «hostname» que resuelve esto de raíz.

4. Fechas lastmod inválidas o en el futuro

El campo <lastmod> exige el formato de fecha W3C: 2026-07-16 a secas o con hora y zona horaria, 2026-07-16T09:30:00+00:00. Formatos locales como 16/07/2026, nombres de mes o marcas de tiempo Unix no sirven.

Las fechas en el futuro son un caso aparte: son XML válido, pero los buscadores desconfían de ellas y acaban ignorando el campo en todo el archivo. Suele deberse a servidores con el reloj mal configurado o a plantillas que escriben la fecha de generación en lugar de la fecha real de modificación.

5. Más de 50.000 URLs o más de 50 MB

El protocolo limita cada archivo a 50.000 URLs y 50 MB sin comprimir. Si superas cualquiera de los dos, hay que dividir: reparte las URLs entre varios archivos (sitemap-1.xml, sitemap-2.xml…) y lístalos en un índice de sitemaps. Lo explicamos paso a paso en la guía de índices de sitemaps. La mayoría de los CMS y generadores modernos dividen automáticamente al llegar al límite; comprueba que el tuyo lo hace antes de acercarte.

6. El sitemap devuelve 404, una redirección o HTML

La URL del sitemap debe responder HTTP 200 con contenido XML. Tres fallos habituales:

  • 404: el archivo no existe en esa ruta, a menudo tras una migración o un cambio de plugin.
  • Redirección: el sitemap redirige (http a https, sin www a con www, o hacia una página de error). Los rastreadores toleran mal las cadenas de redirecciones: enlaza y envía siempre la URL final.
  • HTML disfrazado: el servidor devuelve una página de error o de inicio de sesión con estado 200. El archivo «carga», pero no es XML. Es el clásico origen del error «no es un sitemap válido».

7. URLs en un host distinto

Las URLs listadas deben vivir en el mismo host que sirve el sitemap: misma variante con o sin www y mismo esquema. Un sitemap en https://www.example.com/sitemap.xml que lista URLs de https://example.com/ se ignora en gran parte, salvo que el sitemap esté declarado en el robots.txt de ese otro host. Decide cuál es tu versión canónica y usa solo esa en todo el archivo.

8. Páginas bloqueadas por robots.txt o con noindex

Un sitemap que lista URLs prohibidas en robots.txt o marcadas con noindex envía señales contradictorias: «rastrea esto» y «no rastrees esto» a la vez. Google lo reporta como «Se ha enviado una URL bloqueada por robots.txt». La regla es simple: el sitemap solo debe contener páginas canónicas e indexables. El resto de criterios de inclusión los repasamos en la guía de buenas prácticas de sitemaps.

9. «No se ha podido obtener» en Google Search Console

Este mensaje engloba varios fallos posibles: la URL enviada tiene una errata, el servidor tarda demasiado en responder, un cortafuegos o CDN bloquea al robot de Google, o robots.txt impide el acceso al propio archivo del sitemap. Comprueba primero que la URL abre en una ventana de incógnito, valida el XML y revisa después los registros del servidor buscando las visitas de Googlebot. La documentación de Google sobre sitemaps detalla los requisitos exactos.

Tabla de diagnóstico rápido

SíntomaCausa probableSolución
«No es un sitemap válido» pese a que el archivo abreEspacio de nombres mal escrito o ausenteCopiar la declaración xmlns exacta del protocolo
Error de sintaxis XML en una línea concretaCarácter & < > " ' sin escapar en una URLEscapar las entidades o generar con una librería XML
Los buscadores omiten entradas concretasURLs relativas o sin esquemaConfigurar la URL base absoluta en el generador
Google ignora todos los lastmodFechas mal formateadas o en el futuroFormato W3C y fecha real de modificación
El archivo pesa demasiado o falla al enviarseMás de 50.000 URLs o 50 MBDividir y usar un índice de sitemaps
«No se ha podido obtener» en Search Console404, redirección, bloqueo de robots o timeoutVerificar respuesta HTTP 200 y acceso de Googlebot
«URL enviada bloqueada por robots.txt»El sitemap lista páginas prohibidas al rastreoQuitar esas URLs o corregir el robots.txt
Cobertura muy inferior a las URLs enviadasURLs no canónicas, con noindex o en otro hostListar solo URLs canónicas del mismo host

Comprueba antes de enviar

El orden importa: primero valida el XML, después corrige los problemas por URL y por último reenvía en Search Console. Nuestro validador de sitemaps detecta todos los errores de esta guía en segundos, por URL, archivo o pegando el código, y te dice exactamente qué línea corregir. Un sitemap limpio no garantiza posicionamiento, pero uno roto sí garantiza rastreo desperdiciado.

sitemapsSEO técnicoerrores

Frequently asked questions

¿Cuál es el error de sitemap más común?
El espacio de nombres incorrecto y los ampersands sin escapar en las URLs. Ambos rompen el análisis del archivo completo y ambos se corrigen en un minuto: copiar la declaración xmlns exacta y escribir &amp; en lugar de & dentro de cada URL.
¿Un error en una entrada invalida todo el sitemap?
Depende del error. Un fallo de sintaxis XML o de espacio de nombres invalida el archivo entero. En cambio, una fecha lastmod mal formateada o una URL duplicada solo afectan a esa entrada: los buscadores suelen ignorar el campo o la entrada problemática y procesar el resto.
¿Por qué Search Console dice «No se ha podido obtener»?
Google no consiguió descargar el archivo: la URL tiene una errata, el servidor respondió con error o demasiado despacio, un cortafuegos bloquea a Googlebot o el propio sitemap está prohibido en robots.txt. Verifica que la URL devuelve HTTP 200 con XML y reenvíala.
¿Las fechas lastmod futuras son un error grave?
No invalidan el sitemap, pero salen caras: cuando Google detecta fechas inverosímiles deja de fiarse del campo lastmod en todo el archivo, y pierdes su principal señal para recrawlear contenido actualizado. Corrige el reloj del servidor o la lógica de generación.

Haz una comprobación

Sigue leyendo