robots.txt Die robots.txt ist eine Datei im Wurzelverzeichnis, die Crawlern mitteilt, welche Bereiche einer Website sie abrufen dürfen und welche nicht. Sie steuert das Abrufen, nicht die Aufnahme in den Index – eine gesperrte Seite kann trotzdem in Suchergebnissen erscheinen. Seit dem Aufkommen von KI-Systemen steuert sie zusätzlich, welche AI-Crawler zugreifen dürfen.
Kurz-Fakten
Liegt unter /robots.txt, gilt nur für die eigene Domain
Steuert Abruf, nicht Indexierung – dafür ist noindex zuständig
Steuerung erfolgt je benanntem User-Agent
Wird von unseriösen Crawlern schlicht ignoriert
Bedeutung in der Praxis
Wer eine Seite sicher aus dem Index halten will, darf sie nicht per robots.txt sperren, sondern muss sie crawlen lassen und noindex setzen. Andernfalls sieht die Suchmaschine die Anweisung nie.
Zweiter Punkt mit wachsender Bedeutung: In vielen Systemen sind AI-Crawler als Nebenwirkung einer Voreinstellung mitgesperrt. Wer in KI-Antworten vorkommen will, sollte das prüfen – nicht annehmen.
Inhaber von SEO NW in Bertingen, Sachsen-Anhalt. Optimiert seit 2012 Websites für Suchmaschinen und arbeitet seit dem Aufkommen generativer Antwortsysteme an derselben Frage für Sprachmodelle: unter welchen Bedingungen ein Inhalt übernommen und der richtigen Quelle zugeschrieben wird. Schwerpunkt: technisches SEO, strukturierte Daten und Generative Engine Optimization.