robots.txt für KI-Crawler: Erlauben und Sperren
Drei Rezepte und eine Tabelle Bot für Bot, um GPTBot, ClaudeBot, PerplexityBot und die übrigen aus einer kleinen Textdatei zu steuern.
Um KI-Crawler zu steuern, fügen Sie in der robots.txt-Datei im Wurzelverzeichnis Ihrer Domain User-agent- und Disallow-Regeln hinzu. Sie können jeden KI-Bot sperren, das Training blockieren und die KI-Suche behalten oder alles erlauben. Die Datei ist eine Empfehlung: Seriöse Bots befolgen sie, aber sie ist keine Zugriffskontrolle.
Wie robots.txt KI-Crawler steuert
Jedes KI-Unternehmen betreibt einen oder mehrere benannte Agenten. Sie sprechen sie über ihren User-agent-Token in der robots.txt an und legen dann fest, was sie abrufen dürfen. Drei Vorgehensweisen lohnen sich: einen Bot vollständig sperren, nur die Trainings-Crawler blockieren und die KI-Such-Bots durchlassen oder alles offen lassen. Die folgenden Rezepte decken alle drei ab. Jedes gehört in eine einzige Datei unter https://example.com/robots.txt.
Rezept 1: alle KI-Crawler sperren
Das verweigert jeden dokumentierten KI-Agenten und ergänzt die beiden Opt-out-Tokens, die die Trainingsnutzung regeln. Fügen Sie es unverändert ein oder streichen Sie die Bots, die Ihnen egal sind:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Ein Punkt, der klar gesagt gehört: GPTBot zu sperren stoppt den Trainings-Crawler von OpenAI, nicht die ChatGPT-Suche (das ist OAI-SearchBot) und nicht das nutzerausgelöste Browsing (das ist ChatGPT-User). Das obige Rezept deckt alle drei ab, deshalb bekommt jeder seinen eigenen Block.
Rezept 2: KI-Suche erlauben, KI-Training blockieren
Ein häufiges Ziel ist, in KI-Antwortmaschinen sichtbar zu bleiben und die eigenen Inhalte gleichzeitig aus dem Modelltraining herauszuhalten. Erlauben Sie die Such-Bots, sperren Sie die Trainings-Crawler und die Trainings-Tokens:
# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Block AI training
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Google-Extended und Applebot-Extended sind der Schlüssel zu dieser Trennung. Es sind robots.txt-Tokens, keine eigenen Crawler. Sie zu sperren nimmt Ihre Inhalte vom Gemini- und Apple-KI-Training aus, während Googlebot und Applebot Sie weiter für die normale Suche indexieren.
Rezept 3: alles erlauben (Standard)
Wenn Sie nichts unternehmen, ist das der tatsächliche Zustand. Ein leeres Disallow lässt jeden Crawler jeden Pfad abrufen:
User-agent: *
Disallow:
Eine fehlende robots.txt-Datei bedeutet dasselbe. Explizite Regeln brauchen Sie nur, wenn Sie etwas einschränken wollen.
Die 11 KI-Crawler im Vergleich
| Bot | Unternehmen | Zweck | Sperren, um zu verhindern… |
|---|---|---|---|
| GPTBot | OpenAI | Crawlt zum Modelltraining | Training mit Ihren Inhalten |
| OAI-SearchBot | OpenAI | Liefert ChatGPT-Suchergebnisse | Erscheinen in der ChatGPT-Suche |
| ChatGPT-User | OpenAI | Nutzerausgelöstes Browsing und Aktionen | Nutzerausgelöste Abrufe aus ChatGPT |
| ClaudeBot | Anthropic | Crawlt zum Modelltraining | Training mit Ihren Inhalten |
| Claude-User | Anthropic | Nutzerausgelöste Abrufe | Nutzerausgelöste Abrufe aus Claude |
| PerplexityBot | Perplexity | Indexiert für die Antwortmaschine | Indexierung in Perplexity |
| Perplexity-User | Perplexity | Nutzerausgelöste Abrufe | Nutzerausgelöste Abrufe aus Perplexity |
| Google-Extended | Token für die Gemini-/Vertex-AI-Trainingsnutzung | Nutzung für Gemini-/Vertex-AI-Training | |
| Applebot-Extended | Apple | Token für die Apple-KI-Trainingsnutzung | Nutzung für Apple-KI-Training |
| CCBot | Common Crawl | Baut einen öffentlichen Datensatz für KI-Training | Aufnahme in den Common-Crawl-Datensatz |
| Bytespider | ByteDance (TikTok) | KI-Crawler | KI-Crawling durch ByteDance |
Was robots.txt kann und was nicht
Ein paar Regeln entscheiden, ob Ihre Datei überhaupt wirkt:
- Sie muss im Wurzelverzeichnis liegen. Crawler lesen
https://example.com/robots.txtund sonst nichts. Eine Datei in einem Unterordner wird ignoriert, und jede Subdomain braucht ihre eigene. - Der Token ist nicht case-sensitiv.
GPTBotundgptbottreffen denselben Crawler. Behalten Sie die dokumentierte Schreibweise der Lesbarkeit wegen, aber eine exakte Übereinstimmung ist nicht nötig. - Manche Einträge sind Tokens, keine Crawler.
Google-ExtendedundApplebot-Extendedrufen nie etwas ab. Sie signalisieren nur, ob Google und Apple bereits gecrawlte Inhalte fürs KI-Training nutzen dürfen. - Sie ist eine Empfehlung, keine Mauer. robots.txt ist freiwillig. Seriöse Bots befolgen sie; sie ist keine Zugriffskontrolle und stoppt keinen Crawler, der sie ignoriert. Für harte Sperren nutzen Sie Firewall-Regeln, Authentifizierung oder Edge-Blocking nach User-Agent und IP.
Kombinieren Sie es mit einer llms.txt-Datei
robots.txt entscheidet, wer crawlen darf. Eine llms.txt-Datei erledigt die Gegenaufgabe: Sie weist KI-Systeme auf die Inhalte hin, die sie lesen und verstehen sollen. Beide arbeiten zusammen, und Sie erstellen eine mit dem llms.txt-Generator. Um zu sehen, wie Ihre gesamte Website für KI-Crawler aussieht, starten Sie den KI-Readiness-Check.