AI 就绪指南:让 ChatGPT 和 Perplexity 引用你的网站
AI 助手只会推荐它能抓取、能解析、能信任的网站。这是三个彼此独立的问题,而大多数网站至少在其中一处失分而不自知。
当 ChatGPT、Perplexity 和 Google 的 AI 结果这类答案引擎能够抓取、理解并引用你的网站时,它才算「AI 就绪」。这对应三个相互独立的层面:准入,由 robots.txt 控制;理解,靠结构化数据和元数据支撑;引导,由 llms.txt 提供。任何一层都可能单独出问题,而大多数网站至少存在一处缺口。
为什么这成了一门单独的功课
过去发生在搜索框里的提问,正有越来越大的比例直接在 AI 助手内部得到回答,答案旁边只附几个被引用的来源。成为这几个来源之一,就是新形态的「第一名」。传统 SEO 依然重要——答案引擎要靠搜索索引来寻找候选页面——但两者只是部分重叠:一个网站完全可能在传统搜索结果里排名正常,却因为两年前训练数据争议期间屏蔽了某个爬虫,至今在 AI 答案里彻底隐身。
第一层:准入——谁能读你的网站?
每个主流 AI 系统都用具名的 User-Agent 抓取网页,你的 robots.txt 对它们逐个生效。关键是分清每个爬虫的用途:屏蔽训练用爬虫,只影响未来的模型权重;屏蔽搜索用爬虫,则会让你立刻从对应引擎的答案中消失。
| 爬虫 | 运营方 | 屏蔽它意味着 |
|---|---|---|
GPTBot、OAI-SearchBot | OpenAI | ChatGPT 无法读取和引用你 |
ClaudeBot | Anthropic | Claude 无法读取和引用你 |
PerplexityBot | Perplexity | 从 Perplexity 的答案中消失 |
Google-Extended | 仅影响 Gemini 训练;AI 概览不受影响 | |
CCBot | Common Crawl | 退出多个训练数据集;对搜索无影响 |
最常见的自伤是:2023 年为对训练数据表态而添加的「一刀切屏蔽全部 AI 爬虫」规则,至今原封不动地留在 robots.txt 里——而当年那些 User-Agent,如今已经在为搜索类产品服务。正确做法是逐个爬虫做决定,依据是它今天在做什么,而不是当年的印象。
第二层:理解——机器能读懂你的意思吗?
答案引擎读页面的方式和人不一样。它们解析得最可靠的信号有三类:
- JSON-LD 结构化数据。schema.org 标记(Organization、FAQPage、Article、Product)是无歧义的机器可读事实,也是被提取进答案时最干净利落的来源。FAQPage 标记的效果尤其好,因为它本身就是问答形式。
- 诚实的元数据。具体的 title、真实的 meta description、canonical URL,以及每页唯一且明确的 H1。缺了这些,AI 摘要就会退而抓取页面上任意一段文字来充当描述。
- 答案形态的内容。第一段就给出答案的页面会被引用;把答案埋在 800 字铺垫之后的页面会被跳过。对比表格和 FAQ 板块天生就是便于提取的结构。
第三层:引导——你留下地图了吗?
llms.txt 文件用 markdown 给模型一份精选的站点索引。它是三层中最新、标准化程度最低的一层,所以才排在第三而不是第一:应当在准入和理解都做对之后再做它,而不是用它代替前两层。用生成器几分钟就能完成,给整个链条收尾。
先修什么:行动清单
- 对你的域名运行 AI 就绪检测,大约十秒钟即可得到三个层面的完整评分。
- 解除对你希望获得引用的 AI 搜索爬虫的屏蔽。这是单项影响最大的一处改动,而它只是 robots.txt 里的一次编辑。
- 为关键页面类型添加 JSON-LD:先给首页加 Organization,再在真正回答问题的页面加 FAQPage。
- 补齐检测报告标出的元数据缺口:title、description、canonical。
- 确认站点地图有效并已在 robots.txt 中声明——无论是答案引擎背后的搜索索引,还是 Google、百度这样的传统搜索引擎,都要靠它发现你的页面。
- 最后添加 llms.txt,再跑一遍检测,确认所有项目全部转绿。
AI 就绪不是什么
它不是技巧,也不存在什么秘密 meta 标签。为回答问题而构建的系统,奖励的正是优秀的技术 SEO 一直在奖励的东西:可以访问的页面、无歧义的结构、真正回答了问题的内容。区别只在容错率:人类访客不会介意缺一条 meta description,提取管道则直接换下一个来源。AI 就绪,就是把容错率调低之后的技术卫生。