TL;DR Drei Ebenen prüfen, nicht eine: robots.txt, Server-Logs und CDN/WAF. Erst danach ist die Aussage "Crawler kommt oder kommt nicht" belastbar. Die wichtigsten Token: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, PerplexityBot und Google-Extended. Der User-Agent allein ist kein Beweis. Er lässt sich fälschen, deshalb immer gegen offizielle IP-Listen abgleichen. WordPress-Plugin-Konflikte sind die häufigste Ursache, wenn eine Regel nicht wirkt. SEO- und Sicherheitsplugins überschreiben robots.txt. Blockieren ist eine Entscheidung, keine Standardeinstellung. Wer pauschal alles sperrt, verliert KI-Sichtbarkeit.
KI-Crawler auf WordPress prüfen: der dreistufige Weg
Viele Website-Betreiber schauen einmal in die robots.txt, sehen "Disallow" oder "Allow" und sind fertig. Das reicht nicht. Denn eine Regel in der robots.txt sagt nur, was Sie erlauben. Sie sagt nicht, ob der Crawler tatsächlich kommt, ob er durchkommt und ob Ihre vorgelagerte Infrastruktur ihn vielleicht schon abweist.
Deshalb prüfen Sie in drei Stufen:
- robots.txt – was ist erlaubt, was verboten?
- Server-Logs – wer hat wirklich zugegriffen?
- CDN/WAF – blockiert eine vorgelagerte Ebene?
Erst wenn alle drei Ebenen zusammenpassen, haben Sie ein klares Bild. Ein einzelner Blick ins Log täuscht genauso wie eine einzelne robots.txt-Zeile.
Ein zweiter Punkt: Der User-Agent ist nur ein Name, den der Bot selbst angibt. Jeder kann "GPTBot" in den Header schreiben. Für einen echten Nachweis brauchen Sie die IP-Adresse und einen Abgleich mit den offiziellen Listen der Anbieter.
Die wichtigsten Crawler-Token im Überblick
| Crawler | Zweck | Blockieren bedeutet |
|---|---|---|
| GPTBot | Training von OpenAI-Modellen | OpenAI kann Ihre Inhalte nicht zum Training nutzen |
| OAI-SearchBot | Suche und Zitation in ChatGPT | Ihre Seiten erscheinen seltener in ChatGPT-Antworten |
| ChatGPT-User | Abruf durch einen Nutzer in Echtzeit | ChatGPT kann Ihre Seite nicht live öffnen |
| ClaudeBot | Training von Anthropic-Modellen | Anthropic trainiert nicht mit Ihren Inhalten |
| Claude-SearchBot | Suche und Zitation in Claude | Geringere Chance auf Zitation in Claude |
| Claude-User | Abruf durch einen Nutzer | Claude kann Ihre Seite nicht live laden |
| PerplexityBot | Indexierung für Perplexity | Ihre Seiten fehlen im Perplexity-Index |
| Google-Extended | Steuerung des Gemini-Trainings | Gemini trainiert nicht mit Ihren Inhalten, Google Search bleibt unberührt |
Wichtig: Google-Extended ist kein eigener Crawler. Es ist nur ein Token in der robots.txt. Es hat keinen eigenen User-Agent. Wenn Sie es blockieren, stoppen Sie damit das Gemini-Training, aber nicht die Google-Suche und nicht die AI Overviews.
Was Sie vorher bereithalten sollten
Bevor Sie loslegen, sammeln Sie diese Dinge. Sonst hängen Sie mitten in der Prüfung fest.
Checkliste: Zugangsdaten und Ressourcen
- Zugang zum Hosting-Panel oder Dateisystem (SSH oder FTP)
- Zugriff auf die Log-Dateien: bei Apache meist
access.log, bei Nginx ebenfallsaccess.log - Wissen, ob Ihre Seite hinter einem CDN läuft (zum Beispiel Cloudflare-Proxy aktiv)
- Liste Ihrer SEO- und Sicherheitsplugins (Yoast, Rank Math, Wordfence und ähnliche)
- Zugang zur CDN- oder WAF-Konfiguration, falls vorhanden
Typische Fragen, die hier auftauchen: Wo liegen meine Logs? Habe ich SSH oder nur FTP? Läuft meine Seite hinter Cloudflare? Klären Sie das zuerst, dann geht der Rest schneller.
Schritt 1: robots.txt richtig prüfen
Rufen Sie zuerst Ihre robots.txt im Browser auf:
https://ihre-domain.de/robots.txt
Prüfen Sie dann jeden relevanten User-Agent-Token einzeln. Eine pauschale Regel mit * sagt nichts darüber aus, ob ein bestimmter KI-Crawler erlaubt oder verboten ist. Viele Seiten haben eine Wildcard-Regel und zusätzlich spezielle Zeilen für GPTBot oder ClaudeBot.
Achten Sie auf diese Punkte:
- Woher kommt die Datei? Eine physische
robots.txtim Webroot hat Vorrang vor einer virtuellen Ausgabe durch ein Plugin. - Überschreibt ein Plugin? SEO-Plugins wie Yoast oder Rank Math und Sicherheitsplugins wie Wordfence können die robots.txt verwalten oder eigene Regeln einfügen.
- Subdomains separat prüfen. Jede Subdomain braucht ihre eigene robots.txt.
- Änderungen brauchen Zeit. Es kann rund 24 Stunden dauern, bis ein Crawler eine geänderte Regel übernimmt.
Und ein wichtiger Grundsatz: Die robots.txt ist freiwillig. Sie ist eine Bitte, keine technische Sperre. Manche Bots halten sich daran, manche nicht.
Schritt 2: Server-Logs auf KI-Crawler auswerten
Jetzt wird es konkret. Im Log sehen Sie, wer wirklich zugegriffen hat. Das Format ist meist das Combined Log Format mit IP, Zeit, Request, Statuscode und User-Agent.
Apache: nach GPTBot filtern
grep "GPTBot" /var/log/apache2/access.log
Apache: User-Agent und Statuscode zusammen anzeigen
awk -F'"' '/GPTBot/ {print $2, $6}' /var/log/apache2/access.log
Nginx: nach mehreren KI-Bots filtern
grep -E "GPTBot|ClaudeBot|PerplexityBot|OAI-SearchBot" /var/log/nginx/access.log
Nginx: nur Statuscodes 403 und 429 zeigen
awk '$9 ~ /403|429/ {print $0}' /var/log/nginx/access.log
Statuscodes richtig lesen
- 200 – die Seite wurde ausgeliefert. Achtung: Das kann auch ein Cache-Treffer sein, kein echter Crawl.
- 403 – blockiert. Hier greift eine Regel auf Server- oder WAF-Ebene.
- 429 – Rate-Limit. Der Bot wurde gebremst, nicht durch die robots.txt, sondern durch eine Limit-Regel.
- 5xx – Serverfehler. Das ist kein Bot-Block, sondern ein Problem auf Ihrer Seite.
Spoofing erkennen
Ein Log-Eintrag mit "GPTBot" beweist noch nichts. Gleichen Sie die IP-Adresse gegen die offiziellen Listen ab. OpenAI, Google, Apple und Perplexity veröffentlichen JSON-Endpunkte mit ihren IP-Bereichen. Prüfen Sie per Reverse-DNS und Forward-DNS, ob die IP wirklich zum Anbieter gehört.
Achtung Cloudflare-Proxy: warum Ihre Logs täuschen
Das ist die häufigste Fehldiagnose. Wenn Ihre Seite hinter dem Cloudflare-Proxy läuft, sehen Ihre Origin-Logs nicht die echten Crawler-IPs. Sie sehen Cloudflare-IPs. Der Crawler spricht mit Cloudflare, Cloudflare spricht mit Ihrem Server.
Was Sie sehen, hängt von der Ebene ab:
- Origin-Log ohne Proxy-Kontext: nur Cloudflare-IPs, kein Hinweis auf den echten Bot.
- Cloudflare-Logs oder Logpush: die echten Crawler-IPs und User-Agents.
Wenn Sie also im Origin-Log keinen GPTBot finden, heißt das nicht, dass er nicht kommt. Es heißt nur, dass Sie an der falschen Stelle schauen.
Schritt 3: CDN/WAF-Ebene prüfen
Die vorgelagerte Ebene kann blockieren, ohne dass Sie es im Origin-Log sehen. Prüfen Sie deshalb Ihre CDN- und WAF-Einstellungen.
Relevante Punkte:
- Cloudflare AI Crawl Control und Bot Fight Mode. Seit dem 1. Juli 2025 blockiert Cloudflare KI-Crawler standardmäßig, wenn keine Erlaubnis vorliegt. Neue Domains sind davon betroffen.
- WAF-Regeln. Viele Regeln kombinieren User-Agent und IP. Prüfen Sie, ob eine Regel einen Bot aussperrt, den Sie eigentlich zulassen wollen.
- Perplexity und Stealth-Crawling. Cloudflare dokumentiert, dass Perplexity deklarierte Blöcke mit einem getarnten Crawler umgeht. Das ist der praktische Beweis: Die robots.txt allein setzt nichts durch. Für echte Durchsetzung brauchen Sie die Server- oder WAF-Ebene.
Fragen, die Sie sich hier stellen sollten: Blockiert mein CDN ungewollt? Wie sehen meine WAF-Regeln aus? Was mache ich, wenn ein Bot die robots.txt ignoriert?
Ergebnisse richtig einordnen: Training, Suche, Nutzerabruf
Jetzt haben Sie Daten. Bevor Sie etwas blockieren, sortieren Sie die Crawler nach ihrem Zweck. Denn Training, Suche und Nutzerabruf sind drei verschiedene Dinge.
- Training: GPTBot, ClaudeBot, Google-Extended. Diese Bots sammeln Inhalte für Modelltraining.
- Suche: OAI-SearchBot, Claude-SearchBot, PerplexityBot. Diese Bots bauen einen Index auf, damit Ihre Seite in Antworten zitiert werden kann.
- Nutzerabruf: ChatGPT-User, Claude-User. Diese Bots laden eine Seite live, weil ein Nutzer gerade danach fragt.
Das Blockieren von Trainings-Bots ist nicht dasselbe wie das Blockieren von Such-Bots. Wer GPTBot sperrt, verhindert Training, aber nicht die Zitation in ChatGPT. Wer OAI-SearchBot sperrt, nimmt sich selbst aus den Antworten heraus.
Entscheidungshilfe: wann zulassen, wann blockieren
- Zulassen, wenn Sie in KI-Antworten sichtbar sein wollen. Such- und Nutzerabruf-Bots bringen Ihnen Zitationen.
- Blockieren, wenn Sie kein Modelltraining mit Ihren Inhalten wollen. Dann sperren Sie gezielt die Trainings-Bots.
- Beides kombinieren, wenn Sie Sichtbarkeit wollen, aber kein Training. Das ist der häufigste sinnvolle Fall.
- Nicht pauschal alles sperren. Das kostet KI-Sichtbarkeit und bringt selten einen echten Vorteil.
Und die ehrliche Antwort auf eine häufige Frage: Nein, nicht alle KI-Crawler respektieren die robots.txt. Deshalb ist die Prüfung auf allen drei Ebenen so wichtig.
Häufigste Fehler und wie Sie sie beheben
Diese Stolperfallen sehen wir immer wieder. Hier ist die schnelle Lösung.
- Googlebot statt Google-Extended blockiert. Symptom: Ihre Seite verschwindet aus der Google-Suche, aber das Gemini-Training läuft weiter. Fix: Prüfen Sie, welches Token Sie wirklich gesperrt haben. Google-Extended ist der richtige Hebel fürs Training.
- robots.txt-Änderung nicht verifiziert. Symptom: Die Regel wirkt nicht. Fix: Cache leeren, 24 Stunden abwarten, Subdomains separat prüfen.
- Logs ohne Proxy-Kontext gelesen. Symptom: Sie sehen nur Cloudflare-IPs. Fix: Cloudflare-Logs oder Logpush nutzen.
- User-Agent als Beweis genommen. Symptom: Sie halten einen gefälschten Bot für echt. Fix: IP gegen offizielle JSON-Listen abgleichen.
- Plugin überschreibt robots.txt. Symptom: Ihre Regel ist nach dem Speichern wieder weg. Fix: Physische Datei prüfen, Plugin-Einstellungen kontrollieren.
- Alles pauschal blockiert. Symptom: Keine KI-Zitationen mehr. Fix: Nach Zweck trennen und nur Trainings-Bots sperren, wenn gewünscht.
Was Sie als Nächstes tun können
Eine einmalige Prüfung ist ein guter Start, aber kein Dauerzustand. Crawler-Verhalten ändert sich, Plugins werden aktualisiert, CDN-Einstellungen verschieben sich. Deshalb lohnt sich ein regelmäßiger Blick.
Sinnvolle nächste Schritte:
- Monitoring etablieren. Prüfen Sie Ihre Logs in festen Abständen, nicht nur einmal.
- KI-Sichtbarkeit messen statt nur blockieren. Blockieren ist eine Entscheidung, Sichtbarkeit ist das Ziel. Messen Sie, ob Ihre Marke in KI-Antworten auftaucht.
- Semly als Anlaufstelle nutzen. Semly ist eine GEO- und AEO-Plattform für E-Commerce und Marken. Sie hilft, die Sichtbarkeit in KI-Systemen wie ChatGPT, Gemini, Claude, Grok und Google AI zu erhöhen. Die Anbindung an WordPress und WooCommerce ist direkt möglich, und der kostenlose AI-Sichtbarkeitsbericht zeigt Ihnen, wo Sie stehen.
- Leon-Agent nutzen. Der Semly-Agent Leon prüft Ihre robots.txt und llms.txt automatisiert. So sehen Sie sofort, ob Ihre Regeln zu Ihren Zielen passen.
- llms.txt als Ergänzung. Die llms.txt ist eine kuratorische Karte Ihrer wichtigsten Inhalte. Sie ist kein offizieller Standard, aber eine sinnvolle Ergänzung zur robots.txt.
Wann was sinnvoll ist
- Monitoring, wenn Sie wissen wollen, ob und wie KI-Crawler zugreifen.
- Blockade, wenn Sie gezielt Training verhindern wollen.
- Beides, wenn Sie Sichtbarkeit aufbauen und gleichzeitig Ihre Inhalte schützen wollen. Das ist für die meisten Marken der richtige Weg.
FAQ
Wie blockiere ich GPTBot?
Fügen Sie in Ihrer robots.txt einen eigenen Block für den User-Agent GPTBot mit Disallow: / ein. Prüfen Sie danach, ob ein Plugin die Datei überschreibt, und warten Sie rund 24 Stunden, bis die Änderung greift.
Respektieren alle KI-Crawler robots.txt?
Nein. Die robots.txt ist freiwillig. Manche Bots halten sich daran, andere umgehen sie nachweislich. Für echte Durchsetzung brauchen Sie die Server- oder WAF-Ebene.
Was passiert, wenn ich Google-Extended blockiere?
Sie stoppen damit das Gemini-Training mit Ihren Inhalten. Die Google-Suche und die AI Overviews bleiben davon unberührt, weil Google-Extended kein eigener Crawler ist.
Warum sehe ich keine KI-Crawler in meinen Logs?
Meist liegt Ihre Seite hinter einem CDN-Proxy. Dann zeigen die Origin-Logs nur die IPs des CDN. Prüfen Sie die Logs des CDN oder aktivieren Sie Logpush.