So prüfen Sie den Zugriff von KI-Crawlern
Prüfen Sie, ob GPTBot, OAI-SearchBot, ClaudeBot und PerplexityBot Ihre Website abrufen können, erkennen Sie Blockaden und verifizieren Sie jede Korrektur zuverlässig.
Kurzantwort
Prüfen Sie den Zugriff von KI-Crawlern, indem Sie robots.txt kontrollieren, jeden offiziellen User-Agent mit wichtigen URLs testen, den zurückgegebenen Status und das HTML mit einer normalen Browser-Anfrage vergleichen und CDN- oder Firewall-Logs auf Blockaden untersuchen. Eine Allow-Regel in robots.txt reicht nicht aus, wenn der Server eine Sicherheitsabfrage, einen 403-Status, ein leeres HTML-Grundgerüst oder abweichende Inhalte ausliefert.
Wichtigste Erkenntnisse
- Testen Sie Crawler für den Informationsabruf getrennt von Trainings-Crawlern, da sich ihre Aufgaben und Steuerungsmöglichkeiten unterscheiden.
- Prüfen Sie den endgültigen Antwortinhalt, nicht nur robots.txt oder den HTTP-Status.
- Prüfen Sie repräsentative Seitentypen: Startseite, Artikel, Produktseite, Dokumentation und eine tief in der Website-Struktur liegende URL.
- Korrigieren Sie CDN- und Firewall-Regeln, bevor Sie Inhalte überarbeiten: Nicht zugängliche Seiten können nicht als Quellen zitiert werden.
- Wiederholen Sie die Prüfungen nach Deployments und überwachen Sie Server-Logs auf tatsächliche Crawler-Zugriffe.
Was gehört zur Zugriffsprüfung für KI-Crawler?
Eine vollständige Zugriffsprüfung kontrolliert nacheinander vier Ebenen: die deklarierte Zugriffserlaubnis in robots.txt, den Netzwerkzugriff über CDN oder Firewall, die endgültige HTTP-Antwort nach Weiterleitungen und das nutzbare HTML, das ohne JavaScript-Ausführung im Browser verfügbar ist. Wenn eine Ebene funktioniert, ist damit noch nicht belegt, dass auch die nächste funktioniert.
| Ebene | Erfolgskriterium | Häufiger Fehler |
|---|---|---|
| robots.txt | Der betreffende User-Agent ist nicht ausgeschlossen | Eine Wildcard-Regel setzt eine beabsichtigte Freigabe außer Kraft |
| Netzwerkrand (Edge) | Der Bot erreicht denselben Ursprungsserver wie ein Besucher | Der Bot-Schutz liefert 403, 429 oder eine Sicherheitsabfrage |
| HTTP | Nach sinnvollen Weiterleitungen folgt eine kanonische Antwort mit Status 200 | Weiterleitungsschleife, Soft-404 oder eine Sackgasse bei der Sprach- und Regionsauswahl |
| Gerenderter Inhalt | Titel, Antwort, Links und strukturierte Daten sind im initialen HTML vorhanden | Ein leeres App-Grundgerüst ist auf clientseitiges JavaScript angewiesen |
Welche Crawler müssen separat geprüft werden?
Behandeln Sie KI-User-Agents nicht als austauschbar. Für den Informationsabruf im Rahmen der Suche, nutzerinitiierte Abrufe und das Modelltraining können unterschiedliche Crawler und Steuerungsmöglichkeiten zum Einsatz kommen. Legen Sie Ihre Zugriffsregeln nach Verwendungszweck fest und testen Sie anschließend die exakte offizielle User-Agent-Kennung aus der Dokumentation des jeweiligen Anbieters.
- OpenAI: Testen Sie OAI-SearchBot für die Auffindbarkeit in der Suche, ChatGPT-User für nutzerinitiierte Abrufe und GPTBot entsprechend Ihren Vorgaben zur Nutzung für das Modelltraining.
- Anthropic: Prüfen Sie ClaudeBot und alle aktuell dokumentierten Agents für den Informationsabruf separat.
- Perplexity: Testen Sie PerplexityBot und nutzerinitiierte Abrufe anhand der aktuellen Dokumentation.
- Google: Unterscheiden Sie zwischen dem Suchzugriff durch Googlebot und den Google-Extended-Einstellungen für das Training generativer Modelle und Grounding.
Wie führen Sie einen reproduzierbaren Crawler-Test durch?
- Wählen Sie fünf repräsentative URLs aus, darunter eine tiefer liegende Seite, die nicht von der Startseite aus verlinkt ist.
- Rufen Sie robots.txt ab und dokumentieren Sie die Regel, die für den jeweiligen User-Agent gilt.
- Rufen Sie jede URL mit dem offiziellen User-Agent-String ab und erfassen Sie Status, endgültige URL, Inhaltstyp, Antwortgröße und Antwortzeit.
- Prüfen Sie das zurückgegebene HTML auf Canonical-Tag, H1, direkte Antwort, wichtige Links und JSON-LD.
- Vergleichen Sie die Antwort für den Bot mit einer normalen Browser-Antwort und untersuchen Sie relevante Unterschiede.
- Prüfen Sie Edge- und Origin-Logs auf Sicherheitsabfragen, Ratenbegrenzungen und wiederholt fehlgeschlagene Anfragen.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.htmlWie ermitteln Sie die Ursache einer fehlgeschlagenen Crawler-Anfrage?
| Beobachtetes Ergebnis | Wahrscheinliche Ursache | Nächster Prüfschritt |
|---|---|---|
| 403 oder Seite mit Sicherheitsabfrage | CDN-, WAF- oder Bot-Management-Regel | Zugehöriges Edge-Ereignis und Regel-ID prüfen |
| 429 | Gemeinsame Ratenbegrenzung für automatisierten Traffic | Bot-spezifische Limits und Vorgaben für erneute Versuche prüfen |
| 200 mit sehr wenig HTML | Rein clientseitiges Rendering oder blockierter Datenabruf | Initialen Quelltext und Server-Logs prüfen |
| Weiterleitung zur Anmeldung oder Sprach- und Regionsauswahl | Middleware- oder Geolokalisierungsregel | Cookies, Accept-Language und Canonical-Verhalten testen |
| Korrekte Seite, aber kein Schema-Markup | Strukturierte Daten werden erst im Browser eingefügt | Wichtiges Markup in das serverseitig gerenderte HTML verlagern |
Was belegt, dass die Zugriffskorrektur funktioniert?
Eine Korrektur gilt erst dann als bestätigt, wenn der betroffene User-Agent eine kanonische Seite mit Status 200 und derselben inhaltlichen Antwort erhält, die auch ein Besucher sieht. Speichern Sie den Befehl, den Zeitstempel, die Header sowie einen Hash oder einen Auszug des Antwortinhalts. Bestätigen Sie anschließend einen tatsächlichen Zugriff anhand der Server-Logs: Ein synthetischer Test belegt die Zugriffsmöglichkeit, die Logs belegen das tatsächliche Crawling.
- Testen Sie jede betroffene Seitenvorlage erneut, nicht nur die Startseite.
- Stellen Sie sicher, dass robots.txt und Sitemap-Verweise weiterhin konsistent sind.
- Prüfen Sie, ob das Caching noch eine veraltete Antwort mit Zugriffsblockade ausliefert.
- Nehmen Sie die Zugriffsprüfung nach Änderungen an CDN, Firewall oder Rendering in Ihre Release-Checks auf.
Schritt für Schritt
- 1Repräsentative Seiten auswählen
Wählen Sie wichtige URLs für jede Seitenvorlage aus und berücksichtigen Sie mindestens eine tiefer liegende Seite.
- 2Geltende robots-Regeln prüfen
Bewerten Sie jeden offiziellen KI-User-Agent einzeln und berücksichtigen Sie dabei auch Wildcard-Regeln.
- 3Antworten abrufen und vergleichen
Erfassen Sie Weiterleitungen, Status, Header, Größe des Antwortinhalts, sichtbare Inhalte und strukturierte Daten.
- 4Blockaden zurückverfolgen
Ermitteln Sie anhand der Edge- und Origin-Logs die genaue Regel oder Rendering-Abhängigkeit.
- 5Erneut testen und überwachen
Verifizieren Sie die korrigierte Antwort und beobachten Sie langfristig die tatsächlichen Crawler-Zugriffe.
Häufig gestellte Fragen
- Erlaubt eine Freigabe für GPTBot auch den Zugriff durch ChatGPT Search?
- Nicht unbedingt. OpenAI dokumentiert separate Agents für das Training, die Auffindbarkeit in der Suche und nutzerinitiierte Abrufe. Prüfen und konfigurieren Sie jeden aktuell offiziell dokumentierten Agent entsprechend dem Zugriff, den Sie gewähren möchten.
- Warum erhält ein KI-Crawler einen 403-Status, obwohl robots.txt den Zugriff erlaubt?
- robots.txt legt Crawling-Vorgaben fest, umgeht aber weder CDN noch Firewall, Authentifizierung oder Bot-Sicherheitsabfragen. Prüfen Sie das Edge-Ereignis und die Origin-Logs, um festzustellen, welche Ebene den Zugriff verweigert hat.
- Reicht eine Antwort mit Status 200 aus?
- Nein. Eine Antwort mit Status 200 kann eine Sicherheitsabfrage, ein leeres App-Grundgerüst, eine Soft-404-Seite oder eine unvollständige lokalisierte Seite enthalten. Prüfen Sie das zurückgegebene HTML auf die eigentliche Antwort, den Canonical-Tag, Links und strukturierte Daten.
- Wie oft sollte der Crawler-Zugriff geprüft werden?
- Testen Sie erneut, sobald sich Hosting, CDN-Regeln, Rendering, Weiterleitungen, Authentifizierung oder robots.txt ändern. Bei stabilen Websites deckt eine planmäßige monatliche Prüfung in Verbindung mit Log-Monitoring die meisten erneut auftretenden Probleme auf.
- Sollte jeder KI-Crawler zugelassen werden?
- Das hängt von Ihren eigenen Vorgaben ab. Trennen Sie nutzerinitiierte Abrufe und die Auffindbarkeit in der Suche vom Modelltraining. Erlauben oder blockieren Sie dann jeden dokumentierten Agent gezielt, statt eine pauschale Regel für alle zu verwenden.
Sources
Scannen Sie Ihre Website auf KI-Sichtbarkeit
Führen Sie einen kostenlosen GEO- und AEO-Scan durch und erhalten Sie für Ihre Domain generierte llms.txt, robots.txt, Schema- und Content-Optimierungen.
Kostenlosen Scan starten