Guide

robots.txt, noindex oder Canonical: Was wann hilft

Drei Werkzeuge, drei verschiedene Aufgaben. Mit dem falschen behält Google die Seite, die verschwinden sollte, oder liest Ihre Anweisung gar nicht erst.

Von WebDoctor-Redaktion·6. Oktober 2026·4 Min. Lesezeit


robots.txt steuert das Crawling, noindex hält eine Seite aus den Suchergebnissen heraus, und rel=canonical wählt eine URL aus einer Gruppe von Duplikaten. Die drei lösen verschiedene Probleme und kommen sich in die Quere: Eine per robots.txt gesperrte Seite kann trotzdem indexiert werden, und eine noindex-Regel auf einer Seite, die Google nicht crawlen darf, sieht Google nie.

Was ist der Unterschied zwischen robots.txt, noindex und Canonical?

Jedes greift an einer anderen Stelle. robots.txt entscheidet, ob ein Crawler eine URL abrufen darf. noindex entscheidet, ob eine abgerufene Seite in den Ergebnissen erscheinen darf. Ein Canonical sagt Google, welche von mehreren fast gleichen Seiten die Gruppe vertreten soll. So beschreibt Googles Dokumentation die drei im Vergleich.

robots.txt Disallownoindexrel=canonical
SteuertCrawlingIndexierungWelches Duplikat die Gruppe vertritt
Wo es stehtIn der robots.txt im StammverzeichnisRobots-Meta-Tag oder X-Robots-Tag-HTTP-HeaderLink-Element im head oder Link-HTTP-Header
Hält die URL aus Google heraus?Nein. Eine gesperrte URL kann indexiert werden, wenn andere Websites darauf verlinkenJa, sobald der Googlebot die Seite crawlt und die Regel liestNein. Duplikate werden zusammengeführt, nicht entfernt
Muss die Seite gecrawlt werden?NeinJaJa
Wie verbindlich?Jeder Crawler entscheidet selbst, ob er sich daran hältGoogle entfernt die Seite vollständigEin Hinweis, keine Regel

Wann setzen Sie robots.txt ein?

Wenn das Problem der Crawling-Traffic ist. Laut Googles Einführung zu robots.txt dient die Datei vor allem dazu, Ihre Website nicht mit Anfragen zu überlasten. Für Webseiten passt sie in zwei Fällen: Ihr Server kommt mit Googles Crawler nicht hinterher, oder Sie wollen das Crawlen unwichtiger oder ähnlicher Seiten verhindern. Außerdem ist sie der dokumentierte Weg, Bild-, Video- und Audiodateien aus der Google-Suche herauszuhalten.

Was sie laut Google nicht ist: ein Mechanismus, um eine Webseite aus Google herauszuhalten. Eine gesperrte Seite kann trotzdem indexiert werden, wenn andere Websites auf sie verlinken. Die URL und der Ankertext dieser Links können in den Ergebnissen auftauchen, nur ohne Beschreibung. Und die Regeln sind freiwillig: Der Googlebot hält sich daran, andere Crawler vielleicht nicht. Was Ihre Datei tatsächlich erlaubt, zeigt unser robots.txt-Tester.

Wann setzen Sie noindex ein?

Wenn eine Seite nicht in der Google-Suche erscheinen darf. Setzen Sie <meta name="robots" content="noindex"> in den head oder senden Sie X-Robots-Tag: noindex als Antwort-Header, etwa für PDFs. Googles noindex-Dokumentation sagt: Sobald der Googlebot die Seite crawlt und die Regel ausliest, entfernt Google sie vollständig aus den Ergebnissen, egal ob andere Websites darauf verlinken.

Der Haken liegt im ersten Schritt. Google muss die Seite crawlen, um Meta-Tags und HTTP-Header zu sehen. Taucht die Seite nach dem Setzen von noindex weiter auf, nennt die Doku zwei wahrscheinliche Ursachen: Google hat sie noch nicht neu gecrawlt, oder robots.txt blockiert sie. Mit der URL-Prüfung in der Search Console können Sie ein erneutes Crawlen anfordern. Google weist außerdem darauf hin, dass manche anderen Suchmaschinen noindex anders auslegen können.

Wann ist ein Canonical-Tag die bessere Wahl?

Wenn derselbe Inhalt unter mehreren URLs liegt und eine davon die Signale bündeln soll. Googles Seite zum Zusammenführen doppelter URLs nennt die Gründe: festlegen, welche URL Nutzer in den Ergebnissen sehen, Signale wie Links auf einer bevorzugten URL bündeln, die Auswertung von Messwerten vereinfachen und keine Crawling-Zeit für Duplikate verschwenden.

Ein Canonical versteckt nichts. Googles Seite zur Kanonisierung nennt es einen Hinweis, keine Regel, und schreibt, dass die kanonische Seite am regelmäßigsten gecrawlt wird, Duplikate dagegen seltener. Ein Suchergebnis zeigt meist auf die kanonische Seite, außer ein Duplikat passt besser zur suchenden Person. Weiterleitungen und rel=canonical sind beide starke Signale, ein Sitemap-Eintrag ist ein schwaches. Für Nicht-HTML-Dateien senden Sie das Canonical als Link-HTTP-Header. Was passiert, wenn diese Signale sich widersprechen, steht in unserem Leitfaden zu Canonical-Konflikten.

Kann man robots.txt und noindex kombinieren?

Nicht auf derselben URL, wenn das Ziel die Entfernung ist. Google formuliert es eindeutig: Ist eine Seite per robots.txt gesperrt, sieht der Crawler die noindex-Regel nie, und die Seite kann weiter in den Ergebnissen erscheinen. Für eine hartnäckig indexierte URL heißt die Lösung also: Disallow entfernen, Google crawlen lassen und dann wirkt noindex.

Googles Seite zu doppelten URLs nennt drei weitere Fehlgriffe:

  • robots.txt nicht zur Kanonisierung verwenden.
  • noindex nicht nutzen, um die Canonical-Auswahl innerhalb einer Website zu steuern, denn damit fällt die Seite komplett aus der Suche.
  • Das Tool zum Entfernen von URLs nicht zur Kanonisierung verwenden, denn es blendet alle Versionen einer URL aus.

Welches Werkzeug brauchen Sie?

Gehen Sie vom gewünschten Ergebnis aus, nicht vom Werkzeug, das Sie kennen.

  • Ihr Server ist überlastet oder Crawler verschwenden Zeit auf unwichtigen Seiten: robots.txt.
  • Eine Seite darf nicht in Google erscheinen: noindex, Crawling bleibt offen. Für alles Private ein Passwortschutz, den Google als zweite Möglichkeit nennt.
  • Derselbe Inhalt liegt unter mehreren URLs: rel=canonical auf jedem Duplikat, oder eine Weiterleitung, wenn das Duplikat gar nicht existieren muss.
  • Bilder, Videos oder Audio sollen nicht in der Google-Suche erscheinen: robots.txt.

Geht es um KI-Crawler, finden Sie in unserem Leitfaden robots.txt für KI-Crawler fertige Regeln für jeden Bot.

IndexierungTechnisches SEO

Frequently asked questions

Entfernt eine Sperre in robots.txt eine Seite aus Google?
Nein. Google sagt, robots.txt sei kein Mechanismus, um eine Webseite aus Google herauszuhalten. Eine gesperrte Seite kann trotzdem indexiert werden, wenn andere Websites auf sie verlinken, und die URL kann ohne Beschreibung erscheinen. Nutzen Sie noindex und lassen Sie das Crawling zu.
Warum ist meine Seite trotz noindex noch in Google?
Googles Dokumentation nennt zwei wahrscheinliche Gründe. Entweder hat Google die Seite seit dem Einfügen der Regel nicht neu gecrawlt, oder robots.txt sperrt den Crawler, sodass er noindex nie sieht. Entfernen Sie das Disallow für diese URL und fordern Sie per URL-Prüfung ein erneutes Crawlen an.
Soll ich Duplikate mit noindex statt mit einem Canonical behandeln?
Google empfiehlt das nicht. Laut den Hinweisen zu doppelten URLs blockiert noindex, eingesetzt gegen die Canonical-Auswahl innerhalb einer Website, die Seite komplett für die Suche. rel=canonical oder eine Weiterleitung führt die Duplikate stattdessen auf einer bevorzugten URL zusammen und bündelt Signale wie Links.
Folgt Google immer dem Canonical-Tag?
Nein. Google nennt eine kanonische Präferenz einen Hinweis, keine Regel, und wählt das Canonical selbst aus Signalen, die beim Indexieren gesammelt werden. Weiterleitungen und rel=canonical sind starke Signale, ein Sitemap-Eintrag ist ein schwaches. Lassen Sie also alle drei auf dieselbe URL zeigen.

Jetzt prüfen

Weiterlesen