B.I.G. Media Consulting
Home
Projekte
Kontakt

Wenn das CMS für Sie entscheidet

21 Gruppen, 1.061 Seiten, jeweils byte-identische Dateien: Wo hunderte Betriebe dieselbe robots.txt ausliefern, hat eine Voreinstellung entschieden, nicht der Betrieb.

Illustration: Einstellungen mit Schaltern in einem Fenster
AnalyseLesezeit 5 Minuten

Autor: Luca Benedetti, Geschäftsführer bei B.I.G. Media Consulting

Datengrundlage: eigene Erhebung „AI-Crawler-Sperren im deutschen Bau- und Industriesektor“, 14.721 Domains, davon 9.169 mit robots.txt, erhoben am 30. und 31. August 2026. Zur Studie →

In unserer Auswertung von 14.721 deutschen Betrieben fanden wir 21 Gruppen mit jeweils mindestens 15 byte-identischen robots.txt-Dateien, zusammen 1.061 Seiten. Wo hunderte Betriebe exakt dieselbe Datei ausliefern, hat nicht jeder einzeln entschieden, sondern ein CMS- oder Hoster-Standard für sie.

Warum das kein Zufall sein kann

Eine robots.txt ist eine Textdatei mit wenigen Zeilen. Dass zwei Betriebe unabhängig voneinander dieselbe schreiben, ist denkbar. Dass fünfzehn oder mehr Betriebe eine Datei ausliefern, die sich nicht in einem einzigen Byte unterscheidet, ist es nicht. Solche Gruppen entstehen, wenn ein Baukasten, ein Content-Management-System oder ein Hosting-Paket die Datei mitliefert.

Für den Betrieb ist das unsichtbar. Die Datei liegt nicht im Redaktionssystem, sie taucht in keinem Menü auf, und niemand wird bei der Einrichtung gefragt, ob Sprachmodelle die Inhalte lesen dürfen. Die Antwort steht trotzdem fest, sie wurde nur woanders gegeben.

Die Folge: Sperren ohne Absicht

Das erklärt den Hauptbefund unserer Erhebung: 66,9 Prozent der sperrenden Betriebe blockieren AI-Crawler ausschließlich über eine pauschale Regel, ohne je einen beim Namen zu nennen. Und nur 3,3 Prozent aller Betriebe mit robots.txt erwähnen überhaupt einen AI-Crawler. Wo eine Voreinstellung greift, sieht das Ergebnis von außen aus wie eine Haltung, ist aber keine.

Es erklärt auch die Branchenunterschiede. Gebäudetechnik sperrt mit 12,5 Prozent dreimal so häufig wie Industrie und Werke mit 4,2 Prozent. Plausibler als eine unterschiedliche Haltung zu KI ist, dass in den Branchen unterschiedliche Baukästen und Dienstleister verbreitet sind.

Was das praktisch bedeutet

  • Die Frage ist nicht, was Sie entschieden haben, sondern was Ihr System für Sie entschieden hat.
  • Wer seinen Webauftritt von einer Agentur oder über einen Baukasten bekommen hat, sollte die Datei einmal selbst ansehen.
  • Eine bewusste Entscheidung sieht anders aus als eine Voreinstellung: Sie nennt die Crawler beim Namen.

Wie wir gemessen haben

Die Stichprobe umfasst 14.721 eindeutige Domains deutscher Betriebe aus Bau, Bauhandwerk, Gebäudetechnik, Baustoff- und Fachhandel, Entsorgung und Industrie. Die Domains stammen aus OpenStreetMap, abgerufen über die Overpass-API; ausgewertet wurden Objekte mit hinterlegtem Website-Feld. Die OSM-Daten stehen unter der ODbL-Lizenz.

Je Domain haben wir die Datei /robots.txt mit eigener Kennung im User-Agent abgerufen. Nicht erreichbare Domains wurden in einem zweiten Durchlauf erneut geprüft, zusätzlich mit www-Präfix und über HTTP. Dadurch ließen sich 1.393 zunächst gescheiterte Abrufe auflösen.

Als Sperre gilt eine Disallow-Regel auf / für den jeweiligen Crawler, sofern keine engere Allow-Regel sie aufhebt. Greift keine eigene Regel, zählt die Regel für User-agent: *. Genau diese Unterscheidung trennt die bewusste von der unbeabsichtigten Sperre. Erhoben wurde am 30. und 31. August 2026; robots.txt-Dateien ändern sich laufend, die Zahlen sind eine Momentaufnahme.

Was die Zahlen nicht zeigen

  • 20,2 Prozent der Domains blieben auch im zweiten Durchlauf nicht erreichbar. Darunter sind aufgegebene Domains, aber auch Server, die automatisierte Abrufe abweisen. Diese Fälle fehlen in der Auswertung.
  • OpenStreetMap bildet Betriebe ungleichmäßig ab. Regionen und Branchen sind unterschiedlich vollständig erfasst. Die Stichprobe ist deshalb nicht repräsentativ im statistischen Sinn.
  • Gebäudetechnik und Bauhandwerk stellen zusammen die Hälfte der Stichprobe. Alle Werte weisen wir deshalb zusätzlich nach Branche aus, statt nur einen Gesamtwert zu nennen.
  • Gemessen wurde ausschließlich die robots.txt. Sperren über Firewall-Regeln, Cloudflare-Einstellungen oder serverseitige Filter sind darin nicht sichtbar und kommen zusätzlich hinzu.

Quellen

  1. B.I.G. Media Consulting: AI-Crawler-Sperren im deutschen Bau- und Industriesektor, 31. August 2026. 14.721 Domains, Erhebung am 30. und 31. August 2026, Lizenz CC BY 4.0

Ihren Entwurf sehen Sie vor dem Erstgespräch, kostenlos.

Entwurf anfragen