robots.txt 测试器
抓取某个网站的 robots.txt 或粘贴你自己的规则,输入 URL 并选择爬虫。你会得到明确的判定、决定结果的具体那一行,以及同一次测试在十二个主流爬虫上的对照结果。
任何爬虫标识都可以使用,列表里没有你需要的爬虫时,直接输入即可。
粘贴的规则完全在你的浏览器中匹配。从某个域名抓取 robots.txt 时会经过我们的服务器下载这一个公开文件,不存储任何内容。
robots.txt 的匹配规则究竟如何运作
robots.txt 文件由若干分组构成。每个分组以一行或多行 User-agent 开始,后面是适用于这些爬虫的 Allow 和 Disallow 规则。爬虫只读取与自己产品标识匹配的那一组;只有在没有匹配的具名分组时,才会读取通配分组。所以为 Googlebot 写的规则对 GPTBot 完全不起作用。
当同一分组中有多条规则都能匹配同一个 URL 时,最具体的那条获胜,也就是模式匹配字符数最多的规则。如果 Allow 和 Disallow 长度相同,则 Allow 获胜。这一优先顺序来自标准化的 Robots Exclusion Protocol,即 RFC 9309,这也是 Disallow: /admin/ 加上 Allow: /admin/public/ 后 public 目录仍可被抓取的原因。
模式中支持两种通配符:星号代表任意长度的字符串,美元符号把模式锚定在 URL 末尾。路径区分大小写,爬虫名称不区分;一份 robots.txt 只管辖自己所在的协议、主机和端口,因此 www 子域上的文件并不覆盖不带 www 的域名。
测试器会告诉你什么
- 所选爬虫的判定结果,以及背后那条具体规则和行号
- 同一个 URL 在十二个爬虫上的并排测试,搜索引擎爬虫与 AI 爬虫一目了然
- 命中的是哪个分组,包括它是具名分组还是通配分组
- 文件中声明的每一行 Sitemap
- 解析警告:写在 User-agent 行之前的规则、不受支持的指令、Disallow 中使用的绝对 URL、缺失的 Sitemap
AI 就绪度检测器
ChatGPT、Claude 和 Perplexity 能否读取并引用你的网站?检查 llms.txt、robots.txt 中的 AI 爬虫规则、结构化数据和元数据。
检测 AI 就绪度 →博客精选
毁掉国际化 SEO 的十个 hreflang 错误
几乎所有出问题的 hreflang 配置,都能归到这十个错误上,而且多数是悄无声息地失效。本文讲清每一项该怎么识别、怎么纠正。
robots.txt面向 AI 爬虫的 robots.txt:允许与拒绝配方
用一个小小的文本文件,通过三份配方和逐个爬虫的对照表,控制 GPTBot、ClaudeBot、PerplexityBot 及其余爬虫。
站点地图XML 站点地图常见错误及修复方法
从命名空间写错到 Search Console 的「无法获取」,本文汇总了验证器最常报出的站点地图错误,每一项都给出可以直接照做的修复步骤。