llms.txt 是什么?你的网站需要它吗?
网站根目录下的一个小小 markdown 文件,就能告诉 AI 系统你的网站是什么、哪些页面最重要。本文讲清它的工作原理,以及什么情况下值得添加。
llms.txt 是放在网站根目录下的一个纯 markdown 文件,用专为语言模型设计的格式告诉 AI 系统:这个网站是做什么的、哪些页面最值得读。它来自 llmstxt.org 的社区提案,并不是官方标准,但它的成本只是一个小小的文本文件,而且已有不少 AI 工具会在文件存在时主动读取它。
它解决什么问题
当一个语言模型想要了解你的网站时,摆在它面前的是两条都不好走的路。一条是直接抓取原始 HTML——在导航栏、Cookie 弹窗和脚本代码的包围中费力寻找正文;另一条是依赖训练数据里残留的旧信息,而那往往早已过时。更麻烦的是,模型的上下文窗口是有限的:每一个浪费在模板代码上的 token,都意味着少读一段你真正想让它看到的内容。
llms.txt 就是那条捷径:一份经过人工筛选、对模型友好的站点导读,用干净的 markdown 说清「我们是谁,这些页面值得一读」——而 markdown 恰好是语言模型最擅长解析的格式。
格式:一个例子讲完
整个规范用四条规则就能说完:一个 # 标题写站点名称(必填);一段可选的 > 引用作为一句话简介;可选的说明性文字;然后是若干 ## 小节,每节列出 markdown 链接,链接后附一句可选的描述:
# CellChart
> 纽扣电池型号对照:92 种电池的所有别名、
尺寸与等效型号一站查全。
## 电池系列
- [LR44 等效型号](https://example.com/lr44/):LR44 的
全部叫法,以及可以互换使用的型号
- [CR2032 与 CR2025 对比](https://example.com/cr2032-vs-cr2025/):
最容易被混淆的两种纽扣电池
名为 ## Optional 的小节有特殊含义:上下文空间紧张时,模型可以跳过这一节。所以把必读页面放在前面的小节里,把锦上添花的内容放进 Optional。
llms.txt、robots.txt 与 sitemap.xml 的区别
| 文件 | 面向对象 | 传达的信息 | 格式 |
|---|---|---|---|
robots.txt | 所有爬虫 | 「这些路径允许/禁止抓取」 | 指令 |
sitemap.xml | 搜索引擎爬虫 | 「这是全部页面,一条不落」 | XML |
llms.txt | 语言模型 | 「这些是精选出来的重点页面」 | Markdown |
三个文件互为补充:robots.txt 管准入,sitemap.xml 求全,llms.txt 求精。另外还有一个配套文件 llms-full.txt,可以选择把重点页面的完整正文直接内联进去,供希望一次抓全的模型使用——文档类站点最受益,一般网站起步阶段并不需要它。
诚实地说:现在的采用情况
凡是把 llms.txt 包装成排名捷径来卖的,都可以直接不信。Google 已明确表示不使用这个文件,包括百度在内,也没有任何一家主流搜索引擎公开承诺支持它。但采用确实在发生,只是不均衡:Mintlify 这类文档平台为成千上万个文档站自动生成它,Anthropic、Cloudflare 等公司发布了自己的 llms.txt,会在文件存在时读取它的 AI 开发工具也在持续增多。
所以正确的定位是「便宜的保险」:这个文件几分钟就能做好,不会带来任何副作用;而如果 AI 助手作为流量入口继续增长,提前备好机器可读地图的网站自然占据先手。极小的成本,对上一个说得通的潜在收益——这就是全部论据,而它已经足够。
常见错误
- 把所有 URL 一股脑倒进去。那是站点地图的工作。一个塞了 5,000 条链接的 llms.txt,对模型来说和没有这个文件毫无区别。精选 10 到 30 个页面即可。
- 放错位置。文件必须位于根目录:
https://yourdomain.com/llms.txt。提案不认可子目录,工具也只检查根路径。 - 实际返回的是 HTML。有些主机会把未知路径统统路由到一张返回 200 的错误页,于是 AI 工具把你的 404 页面当成站点简介来解析。务必亲自确认这个地址实际返回什么。
- 描述写得空洞。「实用资源」四个字对模型毫无信息量;「14 个品牌儿童安全座椅的有效期政策,逐一核对厂商页面」这样的描述才能让你被准确引用。
- 写完就忘。文件里的死链会把模型引向 404。重点页面有增删改动后,记得重新生成。
五分钟做一个
用我们免费的 llms.txt 生成器:它读取你的站点地图和页面元数据,自动拼装出文件;人工过一遍,改掉读起来不对劲的描述,再把文件上传到 robots.txt 旁边即可。最后运行一次 AI 就绪检测,确认文件可访问、格式有效,顺带把 robots.txt 规则、结构化数据等整个面向 AI 的表面一并检查一遍。