Ratgeber
robots.txt erklärt: Was sie kann – und was nicht
Redaktion seobox.de2 Min. Lesezeit · Stand:
Die robots.txt ist eine kleine Textdatei im Hauptverzeichnis Ihrer Website. Sie sagt Crawlern, welche Bereiche sie abrufen dürfen. Eine falsche Zeile darin kann eine ganze Website aus Google verschwinden lassen – deshalb lohnt sich ein genauer Blick.
So ist die Datei aufgebaut
Die Datei besteht aus Gruppen. Jede Gruppe beginnt mit einer oder mehreren User-agent-Zeilen und enthält Allow- und Disallow-Regeln:
User-agent: *
Disallow: /intern/
Allow: /intern/presse/
Sitemap: https://www.beispiel.de/sitemap.xmlEin Crawler sucht sich die Gruppe, die am genauesten zu seinem Namen passt, und ignoriert die anderen. Innerhalb der Gruppe gilt die längste passende Regel. Bei Gleichstand gewinnt Allow. Mit * steht man für beliebige Zeichen, mit $ für das Ende der Adresse.
Der wichtigste Unterschied: sperren ist nicht verstecken
Die robots.txt steuert nur das Abrufen, nicht die Aufnahme in den Index. Eine gesperrte Seite kann trotzdem in den Suchergebnissen erscheinen, wenn andere Seiten auf sie verlinken – dann ohne Beschreibung.
Soll eine Seite nicht gefunden werden, braucht sie ein „noindex“ im robots-Meta-Tag. Und genau dafür darf sie nicht gesperrt sein: Sonst liest Google das noindex nie.
Typische Fehler
- „Disallow: /“ aus der Entwicklungsphase bleibt nach dem Start stehen – die ganze Website ist gesperrt.
- CSS- und JavaScript-Dateien werden gesperrt. Dann kann Google die Seite nicht richtig darstellen.
- „Noindex:“ in der robots.txt – das unterstützt Google seit 2019 nicht mehr.
- Die Datei liegt nicht im Hauptverzeichnis oder heißt anders als robots.txt.
KI-Crawler aussperren
Viele Anbieter von KI-Modellen nennen eigene Crawler, die sich an die robots.txt halten, etwa GPTBot, ClaudeBot oder CCBot. Mit Google-Extended legen Sie fest, ob Ihre Inhalte für KI-Modelle von Google verwendet werden dürfen – die normale Google-Suche bleibt davon unberührt.
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /Checkliste
- Die Datei liegt unter /robots.txt.
- Kein „Disallow: /“ für Googlebot oder *.
- CSS und JavaScript sind nicht gesperrt.
- Die Sitemap ist eingetragen.
- Seiten, die nicht in den Index sollen, nutzen noindex statt Sperre.