Cómo conseguir que ChatGPT y Perplexity citen tu sitio
Los asistentes de IA solo recomiendan sitios que pueden rastrear, interpretar y contrastar. Son tres problemas distintos, y la mayoría de los sitios falla en al menos uno sin saberlo.
Un sitio está preparado para la IA cuando los motores de respuestas como ChatGPT, Perplexity o los resultados con IA de Google pueden rastrearlo, entenderlo y citarlo. Son tres capas separadas: el acceso, que gobierna robots.txt; la comprensión, que depende de los datos estructurados y los metadatos; y la guía, que aporta llms.txt. Cada capa falla por su cuenta, y la mayoría de los sitios tiene al menos un hueco.
Por qué esto ya es una disciplina propia
Una parte creciente de las preguntas que antes eran búsquedas en Google se responde hoy dentro de un asistente de IA, con un puñado de fuentes citadas al pie. Ser una de esas citas es la nueva primera posición. El SEO clásico sigue contando, porque los motores de respuestas se apoyan en índices de búsqueda para encontrar candidatos, pero el solapamiento es parcial: un sitio puede posicionar bien en los enlaces azules y ser invisible para las respuestas de IA porque bloqueó un rastreador hace dos años, en pleno debate sobre los datos de entrenamiento.
Capa 1: acceso. ¿Quién puede leer tu sitio?
Cada sistema de IA importante rastrea con un agente de usuario identificado, y tu robots.txt decide bot a bot, igual que con los rastreadores de Google. La distinción crítica es para qué sirve cada bot. Bloquear un bot de entrenamiento solo afecta a los pesos de modelos futuros; bloquear un bot de búsqueda te borra hoy mismo de las respuestas de ese motor.
| Rastreador | Operador | Bloquearlo significa |
|---|---|---|
GPTBot, OAI-SearchBot | OpenAI | ChatGPT no puede leerte ni citarte |
ClaudeBot | Anthropic | Claude no puede leerte ni citarte |
PerplexityBot | Perplexity | Desapareces de las respuestas de Perplexity |
Google-Extended | Solo entrenamiento de Gemini; no afecta a AI Overviews | |
CCBot | Common Crawl | Fuera de muchos conjuntos de entrenamiento; sin impacto en búsqueda |
La herida autoinfligida más frecuente: un robots.txt de 2023 que bloquea «todos los bots de IA», añadido en su día como declaración de principios sobre los datos de entrenamiento y todavía vigente ahora que esos mismos agentes de usuario alimentan productos de búsqueda. No hace falta abrirlo todo ni cerrarlo todo: decide bot a bot, según lo que cada uno hace hoy, no según lo que hacía cuando escribiste la regla.
Capa 2: comprensión. ¿Las máquinas entienden lo que dices?
Los motores de respuestas no leen las páginas como las personas. Estas son las señales que interpretan con más fiabilidad:
- Datos estructurados JSON-LD. El marcado de schema.org (Organization, FAQPage, Article, Product) es información legible por máquinas sin ambigüedad, y es lo que se extrae hacia las respuestas con más limpieza. FAQPage es especialmente eficaz porque ya tiene, literalmente, forma de pregunta y respuesta.
- Metadatos honestos. Un title específico, una meta description real, una URL canónica y un único H1 claro por página. Cuando faltan, los fragmentos de IA improvisan con texto arbitrario de la página, y el resultado rara vez te favorece.
- Contenido con forma de respuesta. Las páginas que dan la respuesta en el primer párrafo se citan; las que la entierran bajo 800 palabras de preámbulo se descartan. Las tablas comparativas y las secciones de preguntas frecuentes son extraíbles por construcción.
Una forma sencilla de autoevaluarte: abre tu página más importante y pregúntate qué respondería un extraño que solo pudiera leer el primer párrafo, el title y el H1. Si la respuesta es «no sabría decir de qué va esto», a un motor de respuestas le pasa lo mismo. La buena noticia es que esta capa se corrige con edición, no con ingeniería: reescribir un primer párrafo para que conteste la pregunta del título cuesta diez minutos y es de los cambios con mejor relación esfuerzo-resultado de toda la lista.
Capa 3: guía. ¿Dejaste un mapa?
Un archivo llms.txt ofrece a los modelos un índice seleccionado de tu sitio en markdown: quién eres, qué páginas importan y por qué. Es la capa más nueva y menos estandarizada, y precisamente por eso es la tercera y no la primera: hazla después de resolver el acceso y la comprensión, no en su lugar. Un llms.txt impecable no compensa un GPTBot bloqueado, igual que un cartel bonito no compensa una puerta cerrada. Con un generador lleva minutos y cierra el círculo.
La lista de acciones, en orden
- Pasa la comprobación de preparación para IA sobre tu dominio: puntúa las tres capas en unos diez segundos.
- Desbloquea los rastreadores de búsqueda con IA que quieras que te citen. Es el cambio individual de mayor impacto, y consiste en editar una vez el robots.txt.
- Añade JSON-LD a tus tipos de página clave, empezando por Organization en la portada y FAQPage allí donde de verdad respondas preguntas.
- Rellena los huecos de metadatos que señale la comprobación: titles, descriptions, canónicas.
- Confirma que tu sitemap es válido y está declarado en robots.txt: los motores de respuestas te encuentran a través de los índices de búsqueda.
- Añade llms.txt en último lugar y repite la comprobación hasta que todo salga en verde.
Lo que la preparación para IA no es
No es un truco y no existe la metaetiqueta secreta. Los sistemas construidos para responder preguntas premian lo mismo que el buen SEO técnico premió siempre: páginas accesibles, estructura sin ambigüedad y contenido que de verdad responde algo. La diferencia está en la tolerancia. Un visitante humano perdona una meta description ausente; una cadena de extracción pasa sin más a la siguiente fuente. La preparación para IA es higiene técnica con el margen de error reducido al mínimo.