robots.txt, noindex oder Canonical: Was wann hilft
Drei Werkzeuge, drei verschiedene Aufgaben. Mit dem falschen behält Google die Seite, die verschwinden sollte, oder liest Ihre Anweisung gar nicht erst.
robots.txt steuert das Crawling, noindex hält eine Seite aus den Suchergebnissen heraus, und rel=canonical wählt eine URL aus einer Gruppe von Duplikaten. Die drei lösen verschiedene Probleme und kommen sich in die Quere: Eine per robots.txt gesperrte Seite kann trotzdem indexiert werden, und eine noindex-Regel auf einer Seite, die Google nicht crawlen darf, sieht Google nie.
Was ist der Unterschied zwischen robots.txt, noindex und Canonical?
Jedes greift an einer anderen Stelle. robots.txt entscheidet, ob ein Crawler eine URL abrufen darf. noindex entscheidet, ob eine abgerufene Seite in den Ergebnissen erscheinen darf. Ein Canonical sagt Google, welche von mehreren fast gleichen Seiten die Gruppe vertreten soll. So beschreibt Googles Dokumentation die drei im Vergleich.
| robots.txt Disallow | noindex | rel=canonical | |
|---|---|---|---|
| Steuert | Crawling | Indexierung | Welches Duplikat die Gruppe vertritt |
| Wo es steht | In der robots.txt im Stammverzeichnis | Robots-Meta-Tag oder X-Robots-Tag-HTTP-Header | Link-Element im head oder Link-HTTP-Header |
| Hält die URL aus Google heraus? | Nein. Eine gesperrte URL kann indexiert werden, wenn andere Websites darauf verlinken | Ja, sobald der Googlebot die Seite crawlt und die Regel liest | Nein. Duplikate werden zusammengeführt, nicht entfernt |
| Muss die Seite gecrawlt werden? | Nein | Ja | Ja |
| Wie verbindlich? | Jeder Crawler entscheidet selbst, ob er sich daran hält | Google entfernt die Seite vollständig | Ein Hinweis, keine Regel |
Wann setzen Sie robots.txt ein?
Wenn das Problem der Crawling-Traffic ist. Laut Googles Einführung zu robots.txt dient die Datei vor allem dazu, Ihre Website nicht mit Anfragen zu überlasten. Für Webseiten passt sie in zwei Fällen: Ihr Server kommt mit Googles Crawler nicht hinterher, oder Sie wollen das Crawlen unwichtiger oder ähnlicher Seiten verhindern. Außerdem ist sie der dokumentierte Weg, Bild-, Video- und Audiodateien aus der Google-Suche herauszuhalten.
Was sie laut Google nicht ist: ein Mechanismus, um eine Webseite aus Google herauszuhalten. Eine gesperrte Seite kann trotzdem indexiert werden, wenn andere Websites auf sie verlinken. Die URL und der Ankertext dieser Links können in den Ergebnissen auftauchen, nur ohne Beschreibung. Und die Regeln sind freiwillig: Der Googlebot hält sich daran, andere Crawler vielleicht nicht. Was Ihre Datei tatsächlich erlaubt, zeigt unser robots.txt-Tester.
Wann setzen Sie noindex ein?
Wenn eine Seite nicht in der Google-Suche erscheinen darf. Setzen Sie <meta name="robots" content="noindex"> in den head oder senden Sie X-Robots-Tag: noindex als Antwort-Header, etwa für PDFs. Googles noindex-Dokumentation sagt: Sobald der Googlebot die Seite crawlt und die Regel ausliest, entfernt Google sie vollständig aus den Ergebnissen, egal ob andere Websites darauf verlinken.
Der Haken liegt im ersten Schritt. Google muss die Seite crawlen, um Meta-Tags und HTTP-Header zu sehen. Taucht die Seite nach dem Setzen von noindex weiter auf, nennt die Doku zwei wahrscheinliche Ursachen: Google hat sie noch nicht neu gecrawlt, oder robots.txt blockiert sie. Mit der URL-Prüfung in der Search Console können Sie ein erneutes Crawlen anfordern. Google weist außerdem darauf hin, dass manche anderen Suchmaschinen noindex anders auslegen können.
Wann ist ein Canonical-Tag die bessere Wahl?
Wenn derselbe Inhalt unter mehreren URLs liegt und eine davon die Signale bündeln soll. Googles Seite zum Zusammenführen doppelter URLs nennt die Gründe: festlegen, welche URL Nutzer in den Ergebnissen sehen, Signale wie Links auf einer bevorzugten URL bündeln, die Auswertung von Messwerten vereinfachen und keine Crawling-Zeit für Duplikate verschwenden.
Ein Canonical versteckt nichts. Googles Seite zur Kanonisierung nennt es einen Hinweis, keine Regel, und schreibt, dass die kanonische Seite am regelmäßigsten gecrawlt wird, Duplikate dagegen seltener. Ein Suchergebnis zeigt meist auf die kanonische Seite, außer ein Duplikat passt besser zur suchenden Person. Weiterleitungen und rel=canonical sind beide starke Signale, ein Sitemap-Eintrag ist ein schwaches. Für Nicht-HTML-Dateien senden Sie das Canonical als Link-HTTP-Header. Was passiert, wenn diese Signale sich widersprechen, steht in unserem Leitfaden zu Canonical-Konflikten.
Kann man robots.txt und noindex kombinieren?
Nicht auf derselben URL, wenn das Ziel die Entfernung ist. Google formuliert es eindeutig: Ist eine Seite per robots.txt gesperrt, sieht der Crawler die noindex-Regel nie, und die Seite kann weiter in den Ergebnissen erscheinen. Für eine hartnäckig indexierte URL heißt die Lösung also: Disallow entfernen, Google crawlen lassen und dann wirkt noindex.
Googles Seite zu doppelten URLs nennt drei weitere Fehlgriffe:
- robots.txt nicht zur Kanonisierung verwenden.
- noindex nicht nutzen, um die Canonical-Auswahl innerhalb einer Website zu steuern, denn damit fällt die Seite komplett aus der Suche.
- Das Tool zum Entfernen von URLs nicht zur Kanonisierung verwenden, denn es blendet alle Versionen einer URL aus.
Welches Werkzeug brauchen Sie?
Gehen Sie vom gewünschten Ergebnis aus, nicht vom Werkzeug, das Sie kennen.
- Ihr Server ist überlastet oder Crawler verschwenden Zeit auf unwichtigen Seiten: robots.txt.
- Eine Seite darf nicht in Google erscheinen: noindex, Crawling bleibt offen. Für alles Private ein Passwortschutz, den Google als zweite Möglichkeit nennt.
- Derselbe Inhalt liegt unter mehreren URLs: rel=canonical auf jedem Duplikat, oder eine Weiterleitung, wenn das Duplikat gar nicht existieren muss.
- Bilder, Videos oder Audio sollen nicht in der Google-Suche erscheinen: robots.txt.
Geht es um KI-Crawler, finden Sie in unserem Leitfaden robots.txt für KI-Crawler fertige Regeln für jeden Bot.