Guide

robots.txt für KI-Crawler: Erlauben und Sperren

Drei Rezepte und eine Tabelle Bot für Bot, um GPTBot, ClaudeBot, PerplexityBot und die übrigen aus einer kleinen Textdatei zu steuern.

Von WebDoctor-Redaktion·22. Juli 2026·3 Min. Lesezeit


Um KI-Crawler zu steuern, fügen Sie in der robots.txt-Datei im Wurzelverzeichnis Ihrer Domain User-agent- und Disallow-Regeln hinzu. Sie können jeden KI-Bot sperren, das Training blockieren und die KI-Suche behalten oder alles erlauben. Die Datei ist eine Empfehlung: Seriöse Bots befolgen sie, aber sie ist keine Zugriffskontrolle.

Wie robots.txt KI-Crawler steuert

Jedes KI-Unternehmen betreibt einen oder mehrere benannte Agenten. Sie sprechen sie über ihren User-agent-Token in der robots.txt an und legen dann fest, was sie abrufen dürfen. Drei Vorgehensweisen lohnen sich: einen Bot vollständig sperren, nur die Trainings-Crawler blockieren und die KI-Such-Bots durchlassen oder alles offen lassen. Die folgenden Rezepte decken alle drei ab. Jedes gehört in eine einzige Datei unter https://example.com/robots.txt.

Rezept 1: alle KI-Crawler sperren

Das verweigert jeden dokumentierten KI-Agenten und ergänzt die beiden Opt-out-Tokens, die die Trainingsnutzung regeln. Fügen Sie es unverändert ein oder streichen Sie die Bots, die Ihnen egal sind:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Ein Punkt, der klar gesagt gehört: GPTBot zu sperren stoppt den Trainings-Crawler von OpenAI, nicht die ChatGPT-Suche (das ist OAI-SearchBot) und nicht das nutzerausgelöste Browsing (das ist ChatGPT-User). Das obige Rezept deckt alle drei ab, deshalb bekommt jeder seinen eigenen Block.

Rezept 2: KI-Suche erlauben, KI-Training blockieren

Ein häufiges Ziel ist, in KI-Antwortmaschinen sichtbar zu bleiben und die eigenen Inhalte gleichzeitig aus dem Modelltraining herauszuhalten. Erlauben Sie die Such-Bots, sperren Sie die Trainings-Crawler und die Trainings-Tokens:

# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Block AI training
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Google-Extended und Applebot-Extended sind der Schlüssel zu dieser Trennung. Es sind robots.txt-Tokens, keine eigenen Crawler. Sie zu sperren nimmt Ihre Inhalte vom Gemini- und Apple-KI-Training aus, während Googlebot und Applebot Sie weiter für die normale Suche indexieren.

Rezept 3: alles erlauben (Standard)

Wenn Sie nichts unternehmen, ist das der tatsächliche Zustand. Ein leeres Disallow lässt jeden Crawler jeden Pfad abrufen:

User-agent: *
Disallow:

Eine fehlende robots.txt-Datei bedeutet dasselbe. Explizite Regeln brauchen Sie nur, wenn Sie etwas einschränken wollen.

Die 11 KI-Crawler im Vergleich

BotUnternehmenZweckSperren, um zu verhindern…
GPTBotOpenAICrawlt zum ModelltrainingTraining mit Ihren Inhalten
OAI-SearchBotOpenAILiefert ChatGPT-SuchergebnisseErscheinen in der ChatGPT-Suche
ChatGPT-UserOpenAINutzerausgelöstes Browsing und AktionenNutzerausgelöste Abrufe aus ChatGPT
ClaudeBotAnthropicCrawlt zum ModelltrainingTraining mit Ihren Inhalten
Claude-UserAnthropicNutzerausgelöste AbrufeNutzerausgelöste Abrufe aus Claude
PerplexityBotPerplexityIndexiert für die AntwortmaschineIndexierung in Perplexity
Perplexity-UserPerplexityNutzerausgelöste AbrufeNutzerausgelöste Abrufe aus Perplexity
Google-ExtendedGoogleToken für die Gemini-/Vertex-AI-TrainingsnutzungNutzung für Gemini-/Vertex-AI-Training
Applebot-ExtendedAppleToken für die Apple-KI-TrainingsnutzungNutzung für Apple-KI-Training
CCBotCommon CrawlBaut einen öffentlichen Datensatz für KI-TrainingAufnahme in den Common-Crawl-Datensatz
BytespiderByteDance (TikTok)KI-CrawlerKI-Crawling durch ByteDance

Was robots.txt kann und was nicht

Ein paar Regeln entscheiden, ob Ihre Datei überhaupt wirkt:

  • Sie muss im Wurzelverzeichnis liegen. Crawler lesen https://example.com/robots.txt und sonst nichts. Eine Datei in einem Unterordner wird ignoriert, und jede Subdomain braucht ihre eigene.
  • Der Token ist nicht case-sensitiv. GPTBot und gptbot treffen denselben Crawler. Behalten Sie die dokumentierte Schreibweise der Lesbarkeit wegen, aber eine exakte Übereinstimmung ist nicht nötig.
  • Manche Einträge sind Tokens, keine Crawler. Google-Extended und Applebot-Extended rufen nie etwas ab. Sie signalisieren nur, ob Google und Apple bereits gecrawlte Inhalte fürs KI-Training nutzen dürfen.
  • Sie ist eine Empfehlung, keine Mauer. robots.txt ist freiwillig. Seriöse Bots befolgen sie; sie ist keine Zugriffskontrolle und stoppt keinen Crawler, der sie ignoriert. Für harte Sperren nutzen Sie Firewall-Regeln, Authentifizierung oder Edge-Blocking nach User-Agent und IP.

Kombinieren Sie es mit einer llms.txt-Datei

robots.txt entscheidet, wer crawlen darf. Eine llms.txt-Datei erledigt die Gegenaufgabe: Sie weist KI-Systeme auf die Inhalte hin, die sie lesen und verstehen sollen. Beide arbeiten zusammen, und Sie erstellen eine mit dem llms.txt-Generator. Um zu sehen, wie Ihre gesamte Website für KI-Crawler aussieht, starten Sie den KI-Readiness-Check.

robots.txtKI-Crawler

Frequently asked questions

Werde ich aus ChatGPT entfernt, wenn ich GPTBot sperre?
Nein. GPTBot übernimmt nur Trainings-Crawls. ChatGPT-Suchergebnisse stammen von OAI-SearchBot, und nutzerausgelöstes Browsing nutzt ChatGPT-User. Um aus der ChatGPT-Suche zu bleiben, sperren Sie auch OAI-SearchBot. Jeder OpenAI-Agent ist ein eigener Token, das Sperren eines blockiert die anderen nicht.
Was unterscheidet Google-Extended von Googlebot?
Googlebot crawlt Seiten für die normale Suchindexierung. Google-Extended ist ein robots.txt-Token, kein eigener Crawler, das steuert, ob Ihre Inhalte Gemini und Vertex AI trainieren. Sperren Sie Google-Extended, um sich vom KI-Training abzumelden, während Ihre Seiten in der Google-Suche indexiert bleiben.
Reicht robots.txt, um KI-Scraping zu stoppen?
Nein. robots.txt ist eine Empfehlung. Seriöse Crawler befolgen sie, aber sie ist keine Zugriffskontrolle und stoppt keinen Bot, der die Regeln ignoriert. Für eine harte Sperre nutzen Sie serverseitige Mittel wie Firewall-Regeln, Authentifizierung oder Blockieren nach User-Agent und IP am Edge.
Wohin gehört die robots.txt-Datei?
In das Wurzelverzeichnis Ihrer Domain, erreichbar unter https://example.com/robots.txt. Eine Datei in einem Unterordner wird ignoriert, und jede Subdomain und jedes Schema braucht eine eigene. User-agent-Tokens sind nicht case-sensitiv, GPTBot und gptbot treffen also zu; behalten Sie die dokumentierte Schreibweise der Klarheit wegen.
Kann ich KI-Crawler sperren und die normale Suche behalten?
Ja. Normale Such-Crawler wie Googlebot und Applebot sind von den KI-Trainings-Tokens getrennt. Sperren Sie Google-Extended und Applebot-Extended, um sich vom KI-Training abzumelden, während Googlebot und Applebot Ihre Website weiter für die reguläre Suche indexieren.

Jetzt prüfen

Weiterlesen