robots.txt для ИИ-краулеров: рецепты разрешить и запретить
Три рецепта и таблица по каждому боту, чтобы управлять GPTBot, ClaudeBot, PerplexityBot и остальными из одного небольшого текстового файла.
Чтобы управлять ИИ-краулерами, добавьте правила User-agent и Disallow в файл robots.txt в корне вашего домена. Можно заблокировать каждого ИИ-бота, запретить обучение, но сохранить ИИ-поиск, или разрешить всё. Файл носит рекомендательный характер: воспитанные боты его соблюдают, но это не контроль доступа.
Как robots.txt управляет ИИ-краулерами
Каждая ИИ-компания запускает одного или нескольких именованных агентов. Вы нацеливаетесь на них через токен user-agent в robots.txt, а затем решаете, что им можно запрашивать. Стоит знать три приёма: заблокировать бота целиком, заблокировать только обучающих краулеров, пропуская ботов ИИ-поиска, или оставить всё открытым. Рецепты ниже покрывают все три. Каждый из них помещается в один файл по адресу https://example.com/robots.txt.
Рецепт 1: заблокировать всех ИИ-краулеров
Это отклоняет каждого задокументированного ИИ-агента и добавляет два токена отказа, которые управляют использованием для обучения. Вставьте как есть или уберите ботов, которые вам безразличны:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Один момент стоит сказать прямо: блокировка GPTBot останавливает обучающего краулера OpenAI, но не ИИ-поиск ChatGPT (это OAI-SearchBot) и не запуск браузинга пользователем (это ChatGPT-User). Рецепт выше покрывает все три, поэтому у каждого свой блок.
Рецепт 2: разрешить ИИ-поиск, но запретить обучение ИИ
Частая цель — оставаться видимым в ИИ-движках ответов и при этом держать свой контент вне обучения моделей. Разрешите поисковых ботов, отклоните обучающих краулеров и токены обучения:
# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Block AI training
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Google-Extended и Applebot-Extended — ключ к такому разделению. Это токены robots.txt, а не отдельные краулеры. Их запрет исключает ваш контент из обучения ИИ Gemini и Apple, при этом Googlebot и Applebot продолжают индексировать вас для обычного поиска.
Рецепт 3: разрешить всё (по умолчанию)
Если вы ничего не сделаете, это и есть реальное состояние. Пустой Disallow позволяет каждому краулеру запрашивать любой путь:
User-agent: *
Disallow:
Отсутствие файла robots.txt означает то же самое. Явные правила нужны только тогда, когда вы хотите что-то ограничить.
Сравнение 11 ИИ-краулеров
| Бот | Компания | Назначение | Заблокировать, чтобы прекратить… |
|---|---|---|---|
| GPTBot | OpenAI | Обходит сайты для обучения моделей | Обучение на вашем контенте |
| OAI-SearchBot | OpenAI | Формирует результаты поиска ChatGPT | Появление в поиске ChatGPT |
| ChatGPT-User | OpenAI | Браузинг и действия по запросу пользователя | Запросы пользователя из ChatGPT |
| ClaudeBot | Anthropic | Обходит сайты для обучения моделей | Обучение на вашем контенте |
| Claude-User | Anthropic | Запросы по инициативе пользователя | Запросы пользователя из Claude |
| PerplexityBot | Perplexity | Индексирует для своего движка ответов | Индексацию в Perplexity |
| Perplexity-User | Perplexity | Запросы по инициативе пользователя | Запросы пользователя из Perplexity |
| Google-Extended | Токен, управляющий использованием для обучения Gemini/Vertex AI | Использование контента для обучения Gemini/Vertex AI | |
| Applebot-Extended | Apple | Токен, управляющий использованием для обучения ИИ Apple | Использование контента для обучения ИИ Apple |
| CCBot | Common Crawl | Строит открытый набор данных, широко используемый для обучения ИИ | Включение в набор данных Common Crawl |
| Bytespider | ByteDance (TikTok) | ИИ-краулер | ИИ-обход со стороны ByteDance |
Что robots.txt может и чего не может
Несколько правил решают, работает ли ваш файл вообще:
- Он должен лежать в корне домена. Краулеры читают
https://example.com/robots.txtи больше нигде. Файл в подпапке игнорируется, и каждому поддомену нужен свой. - Токен не зависит от регистра.
GPTBotиgptbotсоответствуют одному и тому же краулеру. Сохраняйте задокументированное написание ради читаемости, но точное совпадение не важно. - Некоторые записи — токены, а не краулеры.
Google-ExtendedиApplebot-Extendedничего не запрашивают. Они лишь сигнализируют, могут ли Google и Apple использовать уже собранный контент для обучения ИИ. - Это рекомендация, а не стена. robots.txt соблюдается добровольно. Серьёзные боты его уважают; это не контроль доступа, и он не остановит краулера, решившего его игнорировать. Для жёсткой блокировки используйте правила фаервола, аутентификацию или блокировку на edge по user-agent и IP.
Сочетайте его с файлом llms.txt
robots.txt решает, кому можно обходить сайт. Файл llms.txt делает обратное: он указывает ИИ-системам на контент, который вы хотите, чтобы они прочитали и поняли. Оба работают вместе, и создать его можно с помощью генератора llms.txt. Чтобы увидеть, как весь ваш сайт выглядит для ИИ-краулеров, запустите проверку готовности к ИИ.