Руководство

robots.txt для ИИ-краулеров: рецепты разрешить и запретить

Три рецепта и таблица по каждому боту, чтобы управлять GPTBot, ClaudeBot, PerplexityBot и остальными из одного небольшого текстового файла.

Автор: Редакция WebDoctor·22 июля 2026·3 мин чтения


Чтобы управлять ИИ-краулерами, добавьте правила User-agent и Disallow в файл robots.txt в корне вашего домена. Можно заблокировать каждого ИИ-бота, запретить обучение, но сохранить ИИ-поиск, или разрешить всё. Файл носит рекомендательный характер: воспитанные боты его соблюдают, но это не контроль доступа.

Как robots.txt управляет ИИ-краулерами

Каждая ИИ-компания запускает одного или нескольких именованных агентов. Вы нацеливаетесь на них через токен user-agent в robots.txt, а затем решаете, что им можно запрашивать. Стоит знать три приёма: заблокировать бота целиком, заблокировать только обучающих краулеров, пропуская ботов ИИ-поиска, или оставить всё открытым. Рецепты ниже покрывают все три. Каждый из них помещается в один файл по адресу https://example.com/robots.txt.

Рецепт 1: заблокировать всех ИИ-краулеров

Это отклоняет каждого задокументированного ИИ-агента и добавляет два токена отказа, которые управляют использованием для обучения. Вставьте как есть или уберите ботов, которые вам безразличны:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Один момент стоит сказать прямо: блокировка GPTBot останавливает обучающего краулера OpenAI, но не ИИ-поиск ChatGPT (это OAI-SearchBot) и не запуск браузинга пользователем (это ChatGPT-User). Рецепт выше покрывает все три, поэтому у каждого свой блок.

Рецепт 2: разрешить ИИ-поиск, но запретить обучение ИИ

Частая цель — оставаться видимым в ИИ-движках ответов и при этом держать свой контент вне обучения моделей. Разрешите поисковых ботов, отклоните обучающих краулеров и токены обучения:

# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Block AI training
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Google-Extended и Applebot-Extended — ключ к такому разделению. Это токены robots.txt, а не отдельные краулеры. Их запрет исключает ваш контент из обучения ИИ Gemini и Apple, при этом Googlebot и Applebot продолжают индексировать вас для обычного поиска.

Рецепт 3: разрешить всё (по умолчанию)

Если вы ничего не сделаете, это и есть реальное состояние. Пустой Disallow позволяет каждому краулеру запрашивать любой путь:

User-agent: *
Disallow:

Отсутствие файла robots.txt означает то же самое. Явные правила нужны только тогда, когда вы хотите что-то ограничить.

Сравнение 11 ИИ-краулеров

БотКомпанияНазначениеЗаблокировать, чтобы прекратить…
GPTBotOpenAIОбходит сайты для обучения моделейОбучение на вашем контенте
OAI-SearchBotOpenAIФормирует результаты поиска ChatGPTПоявление в поиске ChatGPT
ChatGPT-UserOpenAIБраузинг и действия по запросу пользователяЗапросы пользователя из ChatGPT
ClaudeBotAnthropicОбходит сайты для обучения моделейОбучение на вашем контенте
Claude-UserAnthropicЗапросы по инициативе пользователяЗапросы пользователя из Claude
PerplexityBotPerplexityИндексирует для своего движка ответовИндексацию в Perplexity
Perplexity-UserPerplexityЗапросы по инициативе пользователяЗапросы пользователя из Perplexity
Google-ExtendedGoogleТокен, управляющий использованием для обучения Gemini/Vertex AIИспользование контента для обучения Gemini/Vertex AI
Applebot-ExtendedAppleТокен, управляющий использованием для обучения ИИ AppleИспользование контента для обучения ИИ Apple
CCBotCommon CrawlСтроит открытый набор данных, широко используемый для обучения ИИВключение в набор данных Common Crawl
BytespiderByteDance (TikTok)ИИ-краулерИИ-обход со стороны ByteDance

Что robots.txt может и чего не может

Несколько правил решают, работает ли ваш файл вообще:

  • Он должен лежать в корне домена. Краулеры читают https://example.com/robots.txt и больше нигде. Файл в подпапке игнорируется, и каждому поддомену нужен свой.
  • Токен не зависит от регистра. GPTBot и gptbot соответствуют одному и тому же краулеру. Сохраняйте задокументированное написание ради читаемости, но точное совпадение не важно.
  • Некоторые записи — токены, а не краулеры. Google-Extended и Applebot-Extended ничего не запрашивают. Они лишь сигнализируют, могут ли Google и Apple использовать уже собранный контент для обучения ИИ.
  • Это рекомендация, а не стена. robots.txt соблюдается добровольно. Серьёзные боты его уважают; это не контроль доступа, и он не остановит краулера, решившего его игнорировать. Для жёсткой блокировки используйте правила фаервола, аутентификацию или блокировку на edge по user-agent и IP.

Сочетайте его с файлом llms.txt

robots.txt решает, кому можно обходить сайт. Файл llms.txt делает обратное: он указывает ИИ-системам на контент, который вы хотите, чтобы они прочитали и поняли. Оба работают вместе, и создать его можно с помощью генератора llms.txt. Чтобы увидеть, как весь ваш сайт выглядит для ИИ-краулеров, запустите проверку готовности к ИИ.

robots.txtИИ-краулеры

Frequently asked questions

Уберёт ли меня из ChatGPT блокировка GPTBot?
Нет. GPTBot занимается только обучающими обходами. Результаты поиска ChatGPT берутся из OAI-SearchBot, а браузинг по инициативе пользователя использует ChatGPT-User. Чтобы выйти из поиска ChatGPT, запретите также OAI-SearchBot. Каждый агент OpenAI — отдельный токен, поэтому блокировка одного не блокирует другие.
Чем Google-Extended отличается от Googlebot?
Googlebot обходит страницы для обычной поисковой индексации. Google-Extended — это токен robots.txt, а не отдельный краулер, он управляет тем, обучает ли ваш контент Gemini и Vertex AI. Запретите Google-Extended, чтобы отказаться от обучения ИИ, при этом страницы останутся в поиске Google.
Достаточно ли robots.txt, чтобы остановить сбор данных ИИ?
Нет. robots.txt носит рекомендательный характер. Серьёзные краулеры его соблюдают, но это не контроль доступа, и он не остановит бота, игнорирующего правила. Для жёсткой блокировки используйте серверные средства: правила фаервола, аутентификацию или блокировку по user-agent и IP на edge.
Куда помещать файл robots.txt?
В корень вашего домена, доступным по адресу https://example.com/robots.txt. Файл в подпапке игнорируется, а каждому поддомену и каждой схеме нужен свой. Токены user-agent не зависят от регистра, поэтому GPTBot и gptbot совпадают, но сохраняйте задокументированное написание ради ясности.
Можно ли заблокировать ИИ-краулеров, сохранив обычный поиск?
Да. Обычные поисковые краулеры вроде Googlebot и Applebot отделены от токенов обучения ИИ. Запретите Google-Extended и Applebot-Extended, чтобы отказаться от обучения ИИ, пока Googlebot и Applebot продолжают индексировать сайт для обычной выдачи.

Запустить проверку

Читайте также