Kurz-Fakten

  • Trainings- und Abrufcrawler sind meist getrennt steuerbar
  • Steuerung erfolgt über benannte User-Agents in der robots.txt
  • Ein gesperrter Abrufcrawler bedeutet keine Nennung als Quelle
  • Viele Systeme sperren AI-Crawler versehentlich als Voreinstellung mit

Bedeutung in der Praxis

Die Entscheidung ist eine Abwägung, keine technische Frage: Wer Inhalte nicht in Trainingsdaten sehen möchte, verzichtet auf einen Teil der Sichtbarkeit. Beides gleichzeitig geht nicht.

Wichtig ist vor allem, dass die Entscheidung bewusst fällt. In der Praxis ist der häufigste Befund eine robots.txt, die Abrufcrawler sperrt, ohne dass jemand das gewollt oder gewusst hätte.

Verwandte Begriffe