B.I.G. Media Consulting
Home
Projekte
Kontakt

Zwei Drittel der Betriebe, die KI aussperren, wissen es nicht

Wir haben von 14.721 deutschen Bau-, Handwerks-, Handels- und Industriebetrieben die robots.txt ausgewertet. Das Ergebnis: Die meisten Sperren sind keine Entscheidung, sondern eine Nebenwirkung.

Illustration: Datenpunkte werden auf einem Bildschirm ausgewertet
StudieLesezeit 8 Minuten

Autor: Luca Benedetti, Geschäftsführer bei B.I.G. Media Consulting

Datengrundlage: eigene Erhebung „AI-Crawler-Sperren im deutschen Bau- und Industriesektor“, 14.721 Domains, davon 9.169 mit robots.txt, erhoben am 30. und 31. August 2026.

Von 623 Betrieben, die mindestens einen AI-Crawler aussperren, tun das 66,9 Prozent ausschließlich über eine pauschale Regel in der robots.txt, ohne je einen AI-Crawler beim Namen zu nennen. Die Sperre ist ihnen passiert, sie haben sie nicht entschieden. Grundlage ist unsere Auswertung von 14.721 deutschen Bau-, Handwerks-, Handels- und Industriebetrieben vom 30. und 31. August 2026.

Warum das gerade jetzt zählt

Sprachmodelle beantworten Fragen zunehmend selbst, statt nur auf Seiten zu verweisen. Wer dabei nicht als Quelle auftaucht, kommt in der Antwort nicht vor. Laut Bitkom nutzen 58 Prozent der Menschen ab 16 Jahren in Deutschland KI, 34 Prozent mindestens einmal pro Woche (Bitkom e. V., Presseinformation vom 28. April 2026, repräsentative Befragung von 1.003 Personen, KW 8 bis 11 / 2026).

Ob ein Betrieb in diesen Antworten vorkommt, entscheidet sich unter anderem an einer Textdatei, die kaum jemand liest: der robots.txt. Sie liegt im Wurzelverzeichnis jeder Website und regelt, welche automatischen Besucher welche Bereiche abrufen dürfen.

Der Kernbefund

66,9 %

der sperrenden Betriebe blockieren AI-Crawler nur über eine pauschale Regel

3,3 %

aller Betriebe mit robots.txt erwähnen überhaupt einen AI-Crawler

3-fach

Unterschied zwischen Gebäudetechnik (12,5 %) und Industrie (4,2 %)

623 der 9.169 Betriebe mit vorhandener robots.txt sperren mindestens einen AI-Crawler aus, das sind 6,8 Prozent. Entscheidend ist, wie sie es tun: 417 Betriebe (66,9 Prozent) haben keine einzige Regel, die einen AI-Crawler beim Namen nennt. Bei ihnen greift eine allgemeine Disallow-Regel für alle Besucher, und AI-Crawler fallen mit darunter. Nur 206 Betriebe (33,1 Prozent) haben einen AI-Crawler ausdrücklich benannt und damit eine echte Entscheidung getroffen.

Noch deutlicher wird es, wenn man die gesamte Stichprobe betrachtet: Nur 305 von 9.169 Betrieben mit robots.txt (3,3 Prozent) erwähnen überhaupt einen der acht untersuchten AI-Crawler, ob sperrend oder erlaubend. Rund 97 Prozent haben die Frage nie gestellt bekommen.

Wer wie oft gesperrt wird

CrawlergesperrtAnteil
GPTBot5926,5 %
Bytespider5836,4 %
CCBot5546,0 %
ClaudeBot5325,8 %
Google-Extended5205,7 %
anthropic-ai4865,3 %
PerplexityBot4825,3 %
OAI-SearchBot4805,2 %
Basis: 9.169 Betriebe mit vorhandener robots.txt. Mindestens ein AI-Crawler gesperrt: 623 Betriebe (6,8 %).

Die Werte liegen eng beieinander, zwischen 5,2 und 6,5 Prozent. Das ist ein weiteres Indiz dafür, dass hier selten gezielt einzelne Anbieter ausgeschlossen werden. Wer bewusst entscheidet, trifft meist Unterschiede. Wer pauschal sperrt, erwischt alle gleichermaßen.

Die Branchen unterscheiden sich deutlich

BrancheDomainsmit robots.txtsperrtAnteil
Gebäudetechnik3.7392.01525212,5 %
Baustoff- und Fachhandel1.8931.044817,8 %
Entsorgung und Recycling872586447,5 %
Bauhandwerk3.6352.5701204,7 %
Bauunternehmen758530244,5 %
Industrie und Werke3.8242.4241024,2 %
Anteil = sperrt geteilt durch Betriebe mit robots.txt.

Gebäudetechnik sperrt mit 12,5 Prozent dreimal so häufig wie Industrie und Werke mit 4,2 Prozent. Das sagt wenig über die Haltung der Betriebe und viel über ihre Werkzeuge. Dazu gleich mehr.

Der Standard entscheidet, nicht der Betrieb

In der Stichprobe finden sich 21 Gruppen mit jeweils mindestens 15 byte-identischen robots.txt-Dateien, zusammen 1.061 Seiten. Wo hunderte Betriebe exakt dieselbe Datei ausliefern, hat nicht jeder einzeln entschieden, sondern ein CMS- oder Hoster-Standard für sie. Das ist der Mechanismus hinter dem Kernbefund: Die Sperre kommt aus der Voreinstellung, nicht aus einer Abwägung.

Was Betriebe daraus mitnehmen sollten

  • Prüfen Sie, was in Ihrer robots.txt steht. Der Abruf dauert zwei Minuten und braucht kein Werkzeug.
  • Eine pauschale Disallow-Regel ist selten gewollt. Wenn Sie AI-Crawler aussperren wollen, benennen Sie sie. Dann ist es eine Entscheidung.
  • Umgekehrt gilt: Wer gefunden werden will, sollte nicht darauf vertrauen, dass die Voreinstellung des CMS zu den eigenen Zielen passt.
  • Fehlt eine robots.txt ganz, ist damit nichts ausdrücklich erlaubt, es ist nur nichts verboten. Das ist ein Unterschied.

Wie wir gemessen haben

Die Stichprobe umfasst 14.721 eindeutige Domains deutscher Betriebe aus Bau, Bauhandwerk, Gebäudetechnik, Baustoff- und Fachhandel, Entsorgung und Industrie. Die Domains stammen aus OpenStreetMap, abgerufen über die Overpass-API; ausgewertet wurden Objekte mit hinterlegtem Website-Feld. Die OSM-Daten stehen unter der ODbL-Lizenz.

Je Domain haben wir die Datei /robots.txt mit eigener Kennung im User-Agent abgerufen. Nicht erreichbare Domains wurden in einem zweiten Durchlauf erneut geprüft, zusätzlich mit www-Präfix und über HTTP. Dadurch ließen sich 1.393 zunächst gescheiterte Abrufe auflösen.

Als Sperre gilt eine Disallow-Regel auf / für den jeweiligen Crawler, sofern keine engere Allow-Regel sie aufhebt. Greift keine eigene Regel, zählt die Regel für User-agent: *. Genau diese Unterscheidung trennt die bewusste von der unbeabsichtigten Sperre. Erhoben wurde am 30. und 31. August 2026; robots.txt-Dateien ändern sich laufend, die Zahlen sind eine Momentaufnahme.

Was die Zahlen nicht zeigen

  • 20,2 Prozent der Domains blieben auch im zweiten Durchlauf nicht erreichbar. Darunter sind aufgegebene Domains, aber auch Server, die automatisierte Abrufe abweisen. Diese Fälle fehlen in der Auswertung.
  • OpenStreetMap bildet Betriebe ungleichmäßig ab. Regionen und Branchen sind unterschiedlich vollständig erfasst. Die Stichprobe ist deshalb nicht repräsentativ im statistischen Sinn.
  • Gebäudetechnik und Bauhandwerk stellen zusammen die Hälfte der Stichprobe. Alle Werte weisen wir deshalb zusätzlich nach Branche aus, statt nur einen Gesamtwert zu nennen.
  • Gemessen wurde ausschließlich die robots.txt. Sperren über Firewall-Regeln, Cloudflare-Einstellungen oder serverseitige Filter sind darin nicht sichtbar und kommen zusätzlich hinzu.

Quellen

  1. B.I.G. Media Consulting: AI-Crawler-Sperren im deutschen Bau- und Industriesektor, 31. August 2026. 14.721 Domains, Erhebung am 30. und 31. August 2026, Lizenz CC BY 4.0
  2. Bitkom e. V.: Ein Drittel nutzt KI mindestens einmal pro Woche – von Code bis Küche, 28. April 2026. repräsentative Befragung von 1.003 Personen ab 16 Jahren in Deutschland, KW 8 bis 11 / 2026

Ihren Entwurf sehen Sie vor dem Erstgespräch, kostenlos.

Entwurf anfragen