Was ist robots.txt? die Datei, die den Crawlern im Klartext sagt, wohin sie gehen dürfen
seo · Mar 19, 2026 · 5 min read
robots.txt ist eine reine Textdatei, die sich im Stammverzeichnis Ihrer Domain – `mybusiness.com/robots.txt` – befindet und Suchmaschinen-Crawlern mitteilt, welche Teile der Website sie crawlen dürfen. Es ist die Gästeliste des Türstehers: Der Googlebot kommt an, liest zuerst die Datei und befolgt die Regeln, die er findet.
was in der Datei tatsächlich steht
Die Syntax besteht aus zwei wiederholten Zeilen und nichts weiter:
``` User-agent: Googlebot Disallow: /admin/ ```
„User-agent“ benennt den Crawler („\*“ bedeutet alle), „Disallow“ listet Pfadpräfixe auf, die er überspringen soll. das ist der ganze Wortschatz. Die meisten Websites haben entweder einen leeren Regelsatz – alles durchsuchen – oder eine einzelne Zeile, die einen Admin-Pfad oder eine Suchergebnisseite blockiert.
Die Datei existiert für einen Zweck: Crawler davor bewahren, Besuche auf Seiten zu verschwenden, die für die Suche keinen Wert haben. Eine große Website verwendet sie, um Bots von Facettenfiltern und internen Protokollen fernzuhalten. Eine kleine Website benötigt fast nie diese Komplexität.
was robots.txt nicht kann
Hier leben die Missverständnisse, also die harten Grenzen, ganz klar:
-
Eine Seite wird nicht vor Google ausgeblendet. Eine nicht zugelassene Seite kann immer noch in den Ergebnissen erscheinen – ohne ihren Inhalt –, wenn andere Seiten darauf verlinken. Die einzige Möglichkeit, eine Seite aus dem Index herauszuhalten, ist eine `noindex`-Anweisung auf der Seite selbst, die erfordert, dass der Crawler sie besuchen darf. Blockieren und Nichtindexieren sind Gegensätze, und sie zu verwechseln ist der klassische Fehler.
-
Es handelt sich nicht um Sicherheit. Ein unzulässiger Pfad ist eine veröffentlichte Ankündigung, dass der Pfad existiert. Alles, was privat bleiben muss, braucht eine Authentifizierung, keine Notiz, die Bots auffordert, wegzuschauen.
-
Es handelt sich nicht um ein Ranking-Tool. Durch das Verbot von Seiten wird die „Macht“ nirgendwo konzentriert; Es werden nur Crawl-Besuche entfernt.
was Sie eigentlich tun sollten
-
Schau dir deine einmal an. öffne `yourdomain/robots.txt`. Es ist standardmäßig auf fast jeder Plattform vorhanden. Wenn es nichts Beängstigendes sagt, gibt es nichts zu tun.
-
Stellen Sie sicher, dass CSS oder JS nicht blockiert werden. Eine alte Copy-Paste-Regel, die `/assets/` blockiert, führt dazu, dass Google Ihre Seiten halbblind darstellt, was sich im Stillen negativ auf die Bewertung der Seiten auswirkt. Dies ist die einzige übliche Art und Weise, wie robots.txt einer kleinen Website aktiv Schaden zufügt.
-
Zeigen Sie mit einer `Sitemap:`-Zeile auf Ihre Sitemap – der in do i need an xml sitemap beschriebene Handshake.
-
Sehen Sie sich die Auswirkungen in google search console an, wo Crawl-Anomalien namentlich gemeldet werden.
FAQ: die Fragen, die ich tatsächlich bekomme
Muss ich eine robots.txt erstellen?
wahrscheinlich nicht. Hersteller und Hosts liefern eine vernünftige Standardeinstellung. Erstellen Sie eines an dem Tag, an dem Sie einen bestimmten Grund haben: ein Crawl-lastiges Parameterlabyrinth, ein Staging-Bereich, ein Admin-Pfad, der Störungen in den Crawl-Statistiken verursacht.
Kann ich meine Staging-Site mit robots.txt blockieren?
Sie können das Crawlen blockieren, aber die URL kann trotzdem durchsickern und als leere Shell indiziert werden. Staging-Sites gehören hinter ein Passwort. Das Passwort ist die Lösung; robots.txt ist ein freundlicher Hinweis.
Beeinflusst robots.txt mein Ranking?
Nur indirekt und nur negativ: Das Blockieren von Dingen, die Google benötigt (CSS, JS, Bilder), beeinträchtigt die Darstellung und Auswertung von Seiten. Bei vernünftiger Anwendung ist es für Rankings unsichtbar – das Ziel von how do i get my website on google besteht darin, gut gecrawlt zu werden, nicht weniger.