Autor: Luca Benedetti, Geschäftsführer bei B.I.G. Media Consulting
Datengrundlage: eigene Erhebung „AI-Crawler-Sperren im deutschen Bau- und Industriesektor“, 14.721 Domains, davon 9.169 mit robots.txt, erhoben am 30. und 31. August 2026. Zur Studie →
Genau dieser Fall betrifft 66,9 Prozent der sperrenden Betriebe in unserer Erhebung.
Schritt für Schritt
Adresse aufrufen
Tippen Sie Ihre Domain gefolgt von /robots.txt in die Adresszeile, also zum Beispiel ihre-domain.de/robots.txt. Sie sehen entweder einige Zeilen Text oder eine Fehlermeldung.
Nach der pauschalen Regel suchen
Suchen Sie den Block, der mit User-agent: * beginnt. Der gilt für alle Besucher, für die keine eigene Regel existiert. Steht darunter Disallow: / , ist alles gesperrt. Steht dort Disallow: ohne Pfad oder gar nichts, ist nichts gesperrt.
Nach namentlichen Regeln suchen
Prüfen Sie, ob einer dieser Namen vorkommt: GPTBot, ClaudeBot, PerplexityBot, Google-Extended, OAI-SearchBot, anthropic-ai, CCBot, Bytespider. Taucht keiner auf, wurde über sie nie entschieden. So ist es bei 96,7 Prozent der Betriebe mit robots.txt.
Fehlermeldung einordnen
Erscheint eine 404-Seite, gibt es keine robots.txt. Dann ist technisch nichts verboten, aber auch nichts ausdrücklich erlaubt. In unserer Erhebung traf das auf 14,0 Prozent der Domains zu.
Wie die Regeln zusammenwirken
Ein Crawler hält sich an den Block, der ihn namentlich nennt. Gibt es keinen, gilt der Block für User-agent: *. Eine engere Allow-Regel kann eine weitere Disallow-Regel wieder aufheben. Genau nach dieser Logik haben wir ausgewertet, und genau sie trennt die bewusste von der unbeabsichtigten Sperre.
# gesperrt für alle, auch für Sprachmodelle
User-agent: *
Disallow: /
# bewusst entschieden: nur dieser Crawler ist ausgesperrt
User-agent: GPTBot
Disallow: /Was Sie damit nicht sehen
Die robots.txt ist nur eine von mehreren Stellen, an denen Zugriffe unterbunden werden. Sperren über Firewall-Regeln, Cloudflare-Einstellungen oder serverseitige Filter sind darin nicht sichtbar. Auch unsere Erhebung misst ausschließlich die robots.txt. Die tatsächliche Zahl blockierter Betriebe dürfte höher liegen.
Wenn etwas gesperrt ist, das nicht gesperrt sein soll
Ändern Sie nichts blind. Eine pauschale Disallow-Regel kann einen Grund haben, etwa auf einer Testumgebung. Klären Sie zuerst, wer die Datei ausliefert: das CMS, der Hoster oder Ihre Agentur.
Quellen
- B.I.G. Media Consulting: AI-Crawler-Sperren im deutschen Bau- und Industriesektor, 31. August 2026. 14.721 Domains, Erhebung am 30. und 31. August 2026, Lizenz CC BY 4.0