Autor: Luca Benedetti, Geschäftsführer bei B.I.G. Media Consulting
Datengrundlage: eigene Erhebung „AI-Crawler-Sperren im deutschen Bau- und Industriesektor“, 14.721 Domains, davon 9.169 mit robots.txt, erhoben am 30. und 31. August 2026. Zur Studie →
Die drei Zustände
| Zustand | Domains | Anteil |
|---|---|---|
| robots.txt vorhanden | 9.169 | 62,3 % |
| keine robots.txt (HTTP 404) | 2.057 | 14,0 % |
| nicht erreichbar | 2.973 | 20,2 % |
Fehlt die Datei, gehen Crawler davon aus, dass nichts untersagt ist. Praktisch heißt das: Ihre Inhalte sind abrufbar. Rechtlich und strategisch heißt es wenig. Sie haben keine Aussage getroffen, sondern nur keine.
Warum der Unterschied zählt
Wer nichts sagt, überlässt die Auslegung anderen. Ändert sich die Voreinstellung Ihres Hosters, ändert sich Ihre Sichtbarkeit, ohne dass Sie etwas getan haben. Genau dieser Mechanismus steckt hinter dem Hauptbefund unserer Erhebung: 66,9 Prozent der sperrenden Betriebe haben nie eine Regel zu AI-Crawlern geschrieben, sie sind in eine geraten.
Eine ausdrückliche robots.txt ist auch dann sinnvoll, wenn Sie alles erlauben wollen. Sie dokumentiert eine Entscheidung, statt eine Lücke zu lassen.
Und die nicht erreichbaren Domains?
20,2 Prozent der Domains antworteten auch im zweiten Durchlauf nicht, trotz Wiederholung mit www-Präfix und über HTTP. Darunter sind aufgegebene Domains, aber auch Server, die automatisierte Abrufe grundsätzlich abweisen. Diese Fälle fehlen in der Auswertung und sind in keiner der Sperrquoten enthalten.
Wie wir gemessen haben
Die Stichprobe umfasst 14.721 eindeutige Domains deutscher Betriebe aus Bau, Bauhandwerk, Gebäudetechnik, Baustoff- und Fachhandel, Entsorgung und Industrie. Die Domains stammen aus OpenStreetMap, abgerufen über die Overpass-API; ausgewertet wurden Objekte mit hinterlegtem Website-Feld. Die OSM-Daten stehen unter der ODbL-Lizenz.
Je Domain haben wir die Datei /robots.txt mit eigener Kennung im User-Agent abgerufen. Nicht erreichbare Domains wurden in einem zweiten Durchlauf erneut geprüft, zusätzlich mit www-Präfix und über HTTP. Dadurch ließen sich 1.393 zunächst gescheiterte Abrufe auflösen.
Als Sperre gilt eine Disallow-Regel auf / für den jeweiligen Crawler, sofern keine engere Allow-Regel sie aufhebt. Greift keine eigene Regel, zählt die Regel für User-agent: *. Genau diese Unterscheidung trennt die bewusste von der unbeabsichtigten Sperre. Erhoben wurde am 30. und 31. August 2026; robots.txt-Dateien ändern sich laufend, die Zahlen sind eine Momentaufnahme.
Was die Zahlen nicht zeigen
- 20,2 Prozent der Domains blieben auch im zweiten Durchlauf nicht erreichbar. Darunter sind aufgegebene Domains, aber auch Server, die automatisierte Abrufe abweisen. Diese Fälle fehlen in der Auswertung.
- OpenStreetMap bildet Betriebe ungleichmäßig ab. Regionen und Branchen sind unterschiedlich vollständig erfasst. Die Stichprobe ist deshalb nicht repräsentativ im statistischen Sinn.
- Gebäudetechnik und Bauhandwerk stellen zusammen die Hälfte der Stichprobe. Alle Werte weisen wir deshalb zusätzlich nach Branche aus, statt nur einen Gesamtwert zu nennen.
- Gemessen wurde ausschließlich die robots.txt. Sperren über Firewall-Regeln, Cloudflare-Einstellungen oder serverseitige Filter sind darin nicht sichtbar und kommen zusätzlich hinzu.
Quellen
- B.I.G. Media Consulting: AI-Crawler-Sperren im deutschen Bau- und Industriesektor, 31. August 2026. 14.721 Domains, Erhebung am 30. und 31. August 2026, Lizenz CC BY 4.0