Qué es llms.txt y cuándo conviene tenerlo
Un pequeño archivo markdown en la raíz de tu sitio cuenta a los sistemas de IA qué eres y qué páginas importan. Así funciona exactamente, y así se decide si te compensa.
llms.txt es un archivo de markdown plano que se coloca en la raíz de tu sitio y que explica a los sistemas de IA qué es tu web y qué páginas merecen su atención, en un formato pensado para modelos de lenguaje. Es una propuesta comunitaria nacida en llmstxt.org, no un estándar oficial, pero cuesta un archivo de texto pequeño y varias herramientas de IA ya lo leen.
El problema que resuelve
Cuando un modelo de lenguaje quiere entender tu sitio tiene dos opciones, y las dos son malas. Puede rastrear el HTML crudo y abrirse paso entre menús de navegación, avisos de cookies y scripts hasta dar con la sustancia. O puede tirar de lo que quedó en sus datos de entrenamiento, que con frecuencia está desactualizado. Las ventanas de contexto son limitadas: cada token que se gasta en plantilla y ruido es un token que no se dedica a tu contenido real.
llms.txt es el atajo: un mapa seleccionado y cómodo de leer para un modelo, que dice «esto somos y estas son las páginas que vale la pena leer» en markdown limpio, un formato que los modelos interpretan de forma nativa.
El formato entero cabe en un ejemplo
La especificación se resume en cuatro reglas. Un encabezado # con el nombre del sitio (obligatorio). Una cita opcional con > que resume el sitio en una línea. Prosa opcional. Y secciones ## con enlaces markdown, cada uno con su descripción:
# MiTienda
> Guía de compra de bicicletas urbanas: comparativas,
tallas y mantenimiento para 40 modelos.
## Guías principales
- [Tallas de bicicleta](https://example.com/tallas/): cómo
elegir la talla según altura y tipo de uso
- [Eléctrica o convencional](https://example.com/electrica/):
la comparativa que resuelve la duda más habitual
Una sección llamada ## Optional tiene significado especial: los modelos pueden saltársela cuando el contexto escasea. Coloca las páginas imprescindibles en las secciones anteriores y reserva esa para lo prescindible.
llms.txt frente a robots.txt y sitemap.xml
La confusión más frecuente es pensar que llms.txt sustituye a alguno de los archivos que ya tienes. No sustituye a ninguno; hace un trabajo distinto:
| Archivo | Audiencia | Dice | Formato |
|---|---|---|---|
robots.txt | Todos los rastreadores | «Puedes / no puedes rastrear estas rutas» | Directivas |
sitemap.xml | Rastreadores de buscadores | «Aquí está cada página, sin excepción» | XML |
llms.txt | Modelos de lenguaje | «Esto es lo que importa, seleccionado» | Markdown |
Los tres se complementan: robots.txt controla el acceso, el sitemap persigue la exhaustividad y llms.txt persigue la selección. Existe además un archivo hermano, llms-full.txt, que opcionalmente incluye el texto completo de tus páginas clave para los modelos que prefieren todo en una sola descarga; es útil sobre todo en sitios de documentación, y lo razonable es empezar sin él.
El estado real de adopción, sin humo
Desconfía de quien venda llms.txt como truco de posicionamiento. Google ha dicho que no usa el archivo y ningún buscador importante se ha comprometido públicamente con él. La adopción es real pero desigual: plataformas de documentación como Mintlify lo generan para miles de sitios, empresas como Anthropic o Cloudflare publican el suyo y un número creciente de herramientas de desarrollo con IA lo consulta cuando existe.
El encuadre correcto es el de un seguro barato. Crear el archivo lleva minutos, no perjudica en nada y, si los asistentes de IA siguen creciendo como fuente de tráfico, los sitios con un mapa limpio y legible por máquinas parten con ventaja. Esa asimetría, coste mínimo frente a beneficio plausible, es todo el argumento. Y es suficiente.
¿Qué sitios se benefician más?
No todos los sitios sacan lo mismo del archivo. Donde más rinde es en sitios con contenido de referencia que un asistente puede citar: documentación técnica, guías de compra, comparativas, herramientas con páginas de ayuda, catálogos con fichas bien descritas. Ahí el archivo condensa en unas decenas de líneas lo que al modelo le costaría reconstruir rastreando cientos de páginas. En el extremo contrario, una web de una sola página o una tienda cuyo valor está en el precio del día gana poco: no hay corpus que resumir. La prueba rápida: si alguna vez te han encontrado buscando «cómo se hace X» o «qué diferencia hay entre A y B», tu sitio es exactamente el tipo de fuente que un llms.txt ayuda a citar bien.
Errores comunes
- Volcar todas las URLs. Para eso ya está el sitemap. Un llms.txt con 5.000 enlaces le sirve a un modelo exactamente lo mismo que ningún archivo. Selecciona entre 10 y 30 páginas.
- Ubicación equivocada. El archivo vive en la raíz:
https://tudominio.com/llms.txt. Los subdirectorios no forman parte de la propuesta y las herramientas solo consultan la raíz. - Servir HTML. Algunos alojamientos responden a rutas desconocidas con una página de error y estado 200. La herramienta de IA acaba interpretando tu página de 404 como la descripción de tu sitio. Comprueba qué devuelve la URL en realidad.
- Descripciones vagas. «Recursos útiles» no le dice nada a un modelo. «Políticas de caducidad de 14 marcas de sillas de coche, verificadas contra las páginas del fabricante» es lo que consigue citas precisas.
- Escribirlo una vez y olvidarlo. Los enlaces muertos del archivo mandan a los modelos a errores 404. Regenéralo cuando cambien tus páginas clave.
Cómo añadir el tuyo en cinco minutos
Nuestro generador de llms.txt gratuito lee tu sitemap y los metadatos de tus páginas y monta el archivo por ti; revísalo, corrige lo que suene raro y súbelo junto a robots.txt. Después pasa la comprobación de preparación para IA para confirmar que el archivo es accesible y válido y, de paso, revisar el resto de tu superficie orientada a IA (reglas de robots.txt, datos estructurados) en la misma pasada.