Errores comunes en sitemaps XML y cómo corregirlos
Del espacio de nombres equivocado al «No se ha podido obtener» de Search Console: cada error habitual de sitemap con su síntoma, su causa y su arreglo.
Casi todos los errores de sitemap XML se reducen a nueve causas: espacio de nombres incorrecto, caracteres sin escapar, URLs relativas, fechas lastmod mal formateadas, archivos que superan los límites, respuestas HTTP erróneas, URLs en otro host, páginas bloqueadas por robots.txt y fallos de obtención en Search Console. Cada una tiene una solución concreta que puedes aplicar hoy mismo.
1. Espacio de nombres incorrecto o ausente
Es el error más traicionero porque el archivo parece perfecto a simple vista. El elemento raíz <urlset> debe declarar exactamente este atributo:
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
Una errata (sitemap/0.9/ con barra final, https en vez de http, el antiguo espacio de nombres 0.84) hace que muchos analizadores rechacen el archivo completo. La solución es copiar la declaración tal cual aparece en el protocolo oficial de sitemaps.org, sin improvisar.
2. Caracteres sin escapar en las URLs
Un sitemap es XML, y en XML los caracteres & < > " ' tienen significado propio. El caso típico es un ampersand en una cadena de consulta:
<!-- Mal: rompe el análisis XML -->
<loc>https://example.com/buscar?talla=m&color=rojo</loc>
<!-- Bien: el ampersand va escapado -->
<loc>https://example.com/buscar?talla=m&color=rojo</loc>
Si generas el sitemap con una librería XML de verdad (y no concatenando cadenas), este error desaparece solo: la librería escapa por ti.
3. URLs relativas o sin esquema
Cada <loc> debe contener una URL absoluta y completa, con esquema incluido: https://example.com/pagina/. Rutas relativas como /pagina/ o URLs sin protocolo como //example.com/pagina/ no son válidas según el protocolo. Revisa la configuración de tu generador: casi todos tienen una opción de «URL base» o «hostname» que resuelve esto de raíz.
4. Fechas lastmod inválidas o en el futuro
El campo <lastmod> exige el formato de fecha W3C: 2026-07-16 a secas o con hora y zona horaria, 2026-07-16T09:30:00+00:00. Formatos locales como 16/07/2026, nombres de mes o marcas de tiempo Unix no sirven.
Las fechas en el futuro son un caso aparte: son XML válido, pero los buscadores desconfían de ellas y acaban ignorando el campo en todo el archivo. Suele deberse a servidores con el reloj mal configurado o a plantillas que escriben la fecha de generación en lugar de la fecha real de modificación.
5. Más de 50.000 URLs o más de 50 MB
El protocolo limita cada archivo a 50.000 URLs y 50 MB sin comprimir. Si superas cualquiera de los dos, hay que dividir: reparte las URLs entre varios archivos (sitemap-1.xml, sitemap-2.xml…) y lístalos en un índice de sitemaps. Lo explicamos paso a paso en la guía de índices de sitemaps. La mayoría de los CMS y generadores modernos dividen automáticamente al llegar al límite; comprueba que el tuyo lo hace antes de acercarte.
6. El sitemap devuelve 404, una redirección o HTML
La URL del sitemap debe responder HTTP 200 con contenido XML. Tres fallos habituales:
- 404: el archivo no existe en esa ruta, a menudo tras una migración o un cambio de plugin.
- Redirección: el sitemap redirige (http a https, sin www a con www, o hacia una página de error). Los rastreadores toleran mal las cadenas de redirecciones: enlaza y envía siempre la URL final.
- HTML disfrazado: el servidor devuelve una página de error o de inicio de sesión con estado 200. El archivo «carga», pero no es XML. Es el clásico origen del error «no es un sitemap válido».
7. URLs en un host distinto
Las URLs listadas deben vivir en el mismo host que sirve el sitemap: misma variante con o sin www y mismo esquema. Un sitemap en https://www.example.com/sitemap.xml que lista URLs de https://example.com/ se ignora en gran parte, salvo que el sitemap esté declarado en el robots.txt de ese otro host. Decide cuál es tu versión canónica y usa solo esa en todo el archivo.
8. Páginas bloqueadas por robots.txt o con noindex
Un sitemap que lista URLs prohibidas en robots.txt o marcadas con noindex envía señales contradictorias: «rastrea esto» y «no rastrees esto» a la vez. Google lo reporta como «Se ha enviado una URL bloqueada por robots.txt». La regla es simple: el sitemap solo debe contener páginas canónicas e indexables. El resto de criterios de inclusión los repasamos en la guía de buenas prácticas de sitemaps.
9. «No se ha podido obtener» en Google Search Console
Este mensaje engloba varios fallos posibles: la URL enviada tiene una errata, el servidor tarda demasiado en responder, un cortafuegos o CDN bloquea al robot de Google, o robots.txt impide el acceso al propio archivo del sitemap. Comprueba primero que la URL abre en una ventana de incógnito, valida el XML y revisa después los registros del servidor buscando las visitas de Googlebot. La documentación de Google sobre sitemaps detalla los requisitos exactos.
Tabla de diagnóstico rápido
| Síntoma | Causa probable | Solución |
|---|---|---|
| «No es un sitemap válido» pese a que el archivo abre | Espacio de nombres mal escrito o ausente | Copiar la declaración xmlns exacta del protocolo |
| Error de sintaxis XML en una línea concreta | Carácter & < > " ' sin escapar en una URL | Escapar las entidades o generar con una librería XML |
| Los buscadores omiten entradas concretas | URLs relativas o sin esquema | Configurar la URL base absoluta en el generador |
| Google ignora todos los lastmod | Fechas mal formateadas o en el futuro | Formato W3C y fecha real de modificación |
| El archivo pesa demasiado o falla al enviarse | Más de 50.000 URLs o 50 MB | Dividir y usar un índice de sitemaps |
| «No se ha podido obtener» en Search Console | 404, redirección, bloqueo de robots o timeout | Verificar respuesta HTTP 200 y acceso de Googlebot |
| «URL enviada bloqueada por robots.txt» | El sitemap lista páginas prohibidas al rastreo | Quitar esas URLs o corregir el robots.txt |
| Cobertura muy inferior a las URLs enviadas | URLs no canónicas, con noindex o en otro host | Listar solo URLs canónicas del mismo host |
Comprueba antes de enviar
El orden importa: primero valida el XML, después corrige los problemas por URL y por último reenvía en Search Console. Nuestro validador de sitemaps detecta todos los errores de esta guía en segundos, por URL, archivo o pegando el código, y te dice exactamente qué línea corregir. Un sitemap limpio no garantiza posicionamiento, pero uno roto sí garantiza rastreo desperdiciado.