Диагностический инструмент

Тестер robots.txt

Загрузите robots.txt сайта или вставьте свой, укажите URL и выберите краулера. Вы получите понятный вердикт, точную строку, которая его определила, и тот же тест сразу для двенадцати крупных краулеров.

Подходит любой токен краулера, поэтому просто впишите нужный, если его нет в списке.

Вставленные правила сопоставляются целиком в вашем браузере. Загрузка robots.txt с домена идёт через наш сервер и скачивает только этот один публичный файл, при этом ничего не сохраняется.

Как на самом деле работает сопоставление в robots.txt

Файл robots.txt состоит из групп. Каждая группа начинается с одной или нескольких строк User-agent и содержит правила Allow и Disallow для этих краулеров. Краулер читает только ту группу, которая совпадает с его собственным токеном, плюс общую группу, если подходящей именной группы нет. Поэтому правила, написанные для Googlebot, никак не действуют на GPTBot.

Когда на один URL подходит сразу несколько правил из группы, побеждает самое конкретное: то, чей шаблон совпадает с наибольшим числом символов. Если Allow и Disallow одинаковой длины, побеждает Allow. Такой порядок закреплён в RFC 9309, стандартизированном Robots Exclusion Protocol, и именно поэтому связка Disallow: /admin/ и Allow: /admin/public/ оставляет публичную папку открытой для обхода.

В шаблонах поддерживаются два подстановочных знака. Звёздочка означает любую последовательность символов, а знак доллара привязывает шаблон к концу URL. В путях регистр важен, в именах краулеров нет, а один файл robots.txt управляет только своей схемой, своим хостом и своим портом, поэтому файл на поддомене www не распространяется на домен без www.

Что показывает тестер

  • Вердикт для выбранного краулера с точным правилом и номером строки за ним
  • Тот же URL, проверенный сразу по двенадцати краулерам: поисковые и ИИ-боты рядом
  • Какая группа сработала, включая то, была она именной или общей
  • Все строки Sitemap, объявленные в файле
  • Предупреждения парсера: правила до первой строки User-agent, неподдерживаемые директивы, абсолютные URL в Disallow, отсутствующая строка Sitemap

Проверка готовности к ИИ

Могут ли ChatGPT, Claude и Perplexity читать и цитировать ваш сайт? Проверяем llms.txt, правила robots.txt для ИИ-краулеров, структурированные данные и метаданные.

Проверить готовность к ИИ →

Из блога

Все руководства →

Frequently asked questions

Уберёт ли блокировка в robots.txt страницу из Google?
Нет. Правило Disallow запрещает обход, а не индексирование. Google по-прежнему может показать заблокированный URL, найденный по ссылкам, просто без описания. Чтобы страница не попадала в выдачу, разрешите её обход и поставьте на самой странице тег noindex в meta robots.
Почему моё правило Disallow не работает?
Обычно его перебивает более длинное правило. Сопоставление идёт по длине шаблона, а не по порядку строк, и при равной длине побеждает Allow. Регистр тоже важен: пути /Blog/ и /blog/ различаются. Проверьте здесь точный URL и посмотрите, какое правило тестер назовёт победившим.
Учитывается ли crawl-delay?
Google эту директиву полностью игнорирует и предлагает владельцам сайтов настраивать частоту обхода отдельно. Bing и Яндекс исторически её соблюдали. Оставить строку в файле не вредно, но рассчитывать на неё, чтобы притормозить Googlebot, не получится.
Можно ли писать noindex в robots.txt?
На Google это не действует. Поддержка неофициальной директивы noindex в robots.txt прекратилась 1 сентября 2019 года. Используйте тег noindex в meta robots или HTTP-заголовок X-Robots-Tag на той странице, которую нужно убрать из поиска.
Действует ли один robots.txt на мои поддомены?
Нет. Файл относится только к одной схеме, одному хосту и одному порту. Блогу на blog.example.com нужен свой robots.txt по адресу blog.example.com/robots.txt, а https-версия сайта рассматривается отдельно от http-версии.