Diagnose-Tool

robots.txt-Tester

Laden Sie die robots.txt einer Website oder fügen Sie Ihre eigene ein, geben Sie eine URL ein und wählen Sie einen Crawler. Sie erhalten ein klares Urteil, die Zeile, die es entschieden hat, und denselben Test für zwölf große Crawler auf einmal.

Jedes Crawler-Token funktioniert. Tippen Sie es einfach ein, wenn der gewünschte Crawler nicht in der Liste steht.

Eingefügte Regeln werden vollständig in Ihrem Browser ausgewertet. Beim Laden einer robots.txt von einer Domain holt unser Server nur diese eine öffentliche Datei; gespeichert wird nichts.

So funktioniert das Matching in der robots.txt wirklich

Eine robots.txt besteht aus Gruppen. Jede Gruppe beginnt mit einer oder mehreren User-agent-Zeilen und enthält die Allow- und Disallow-Regeln für diese Crawler. Ein Crawler liest nur die Gruppe, die zu seinem eigenen Produkt-Token passt, und zusätzlich die Sammelgruppe, wenn keine benannte Gruppe zutrifft. Regeln für Googlebot haben deshalb keinerlei Wirkung auf GPTBot.

Passen mehrere Regeln einer Gruppe auf dieselbe URL, gewinnt die spezifischste: die Regel, deren Muster die meisten Zeichen abdeckt. Sind Allow und Disallow gleich lang, gewinnt Allow. Diese Reihenfolge stammt aus RFC 9309, dem standardisierten Robots Exclusion Protocol, und genau deshalb bleibt bei Disallow: /admin/ plus Allow: /admin/public/ der öffentliche Ordner crawlbar.

In Mustern werden zwei Platzhalter unterstützt. Ein Sternchen steht für eine beliebige Folge von Zeichen, ein Dollarzeichen verankert das Muster am Ende der URL. Bei Pfaden zählt die Groß- und Kleinschreibung, bei Crawler-Namen nicht, und eine robots.txt gilt immer nur für ihr eigenes Schema, ihren Host und ihren Port: Die Datei auf der www-Subdomain deckt die Domain ohne www nicht ab.

Was der Tester ausgibt

  • Urteil für den gewählten Crawler, samt der genauen Regel und der Zeilennummer dahinter
  • Dieselbe URL, gegen zwölf Crawler auf einmal getestet: Suchmaschinen-Bots und KI-Bots nebeneinander
  • Welche Gruppe gegriffen hat, inklusive Hinweis, ob es eine benannte Gruppe oder die Sammelgruppe war
  • Jede Sitemap-Zeile, die in der Datei deklariert ist
  • Parser-Warnungen: Regeln vor der ersten User-agent-Zeile, nicht unterstützte Direktiven, absolute URLs in Disallow, fehlende Sitemap

KI-Readiness-Checker

Können ChatGPT, Claude und Perplexity Ihre Website lesen und zitieren? Prüft llms.txt, KI-Crawler-Regeln in der robots.txt, strukturierte Daten und Metadaten.

KI-Readiness prüfen →

Aus dem Blog

Alle Guides →

Frequently asked questions

Entfernt eine Sperre in der robots.txt eine Seite aus Google?
Nein. Eine Disallow-Regel verhindert das Crawlen, nicht das Indexieren. Google kann eine gesperrte URL, die es über Links findet, weiterhin listen, dann allerdings ohne Beschreibung. Damit eine Seite nicht in den Ergebnissen auftaucht, erlauben Sie das Crawlen und setzen ein noindex im meta robots auf der Seite selbst.
Warum greift meine Disallow-Regel nicht?
Meist schlägt sie eine längere Regel. Entscheidend ist die Länge des Musters, nicht die Reihenfolge in der Datei, und bei Gleichstand gewinnt Allow. Auch die Schreibweise zählt: /Blog/ und /blog/ sind verschiedene Pfade. Testen Sie hier die exakte URL und lesen Sie, welche Regel der Tester als Sieger nennt.
Wird crawl-delay beachtet?
Von Google nicht. Google ignoriert die Direktive vollständig und verweist Website-Betreiber stattdessen auf die Einstellungen zur Crawling-Frequenz. Bing und Yandex haben sie in der Vergangenheit berücksichtigt. Die Zeile in der Datei zu lassen kostet nichts, aber verlassen Sie sich nicht darauf, um Googlebot zu bremsen.
Kann ich noindex in die robots.txt schreiben?
Bei Google bewirkt das nichts. Die Unterstützung für die inoffizielle noindex-Direktive in der robots.txt endete am 1. September 2019. Nutzen Sie stattdessen ein noindex im meta robots oder einen X-Robots-Tag-HTTP-Header auf der Seite, die aus der Suche verschwinden soll.
Gilt eine robots.txt auch für meine Subdomains?
Nein. Die Datei gilt nur für ein Schema, einen Host und einen Port. Ein Blog auf blog.example.com braucht seine eigene robots.txt unter blog.example.com/robots.txt, und die https-Version einer Website wird getrennt von der http-Version behandelt.