Come verificare l'accesso dei crawler AI
Verifica se GPTBot, OAI-SearchBot, ClaudeBot e PerplexityBot accedono al tuo sito, individua i blocchi e controlla ogni correzione in sicurezza.
Risposta rapida
Per verificare l'accesso dei crawler AI, controlla robots.txt, testa ogni user agent ufficiale sugli URL più importanti, confronta lo stato HTTP e l'HTML restituiti con quelli di una normale richiesta da browser e cerca eventuali blocchi nei log della CDN o del firewall. Una regola Allow in robots.txt non basta se il server restituisce una verifica anti-bot, un errore 403, una struttura HTML vuota o contenuti diversi.
Punti chiave
- Testa separatamente i crawler per il recupero dei contenuti e quelli per l'addestramento, perché hanno ruoli e controlli diversi.
- Verifica il corpo della risposta finale, non soltanto robots.txt o il codice di stato HTTP.
- Controlla tipologie di pagina rappresentative: homepage, articolo, prodotto, documentazione e un URL situato in profondità nella struttura del sito.
- Correggi le regole della CDN e del firewall prima di riscrivere i contenuti: le pagine inaccessibili non possono ottenere citazioni.
- Ripeti i controlli dopo ogni rilascio e monitora i log del server per rilevare le visite effettive dei crawler.
Che cosa deve verificare un audit dell'accesso dei crawler AI?
Un audit completo dell'accesso verifica quattro livelli, in ordine: le autorizzazioni dichiarate in robots.txt, l'accesso di rete attraverso la CDN o il firewall, la risposta HTTP finale dopo i reindirizzamenti e l'HTML utile disponibile senza eseguire JavaScript nel browser. Superare un livello non dimostra che quello successivo funzioni.
| Livello | Condizione da soddisfare | Problema frequente |
|---|---|---|
| robots.txt | L'accesso non è vietato allo user agent interessato | Una regola con carattere jolly prevale su un'autorizzazione prevista |
| Perimetro di rete | Il bot può raggiungere lo stesso server di origine accessibile a un visitatore | La protezione anti-bot restituisce 403, 429 o una richiesta di verifica |
| HTTP | Un'unica risposta 200 sull'URL canonico dopo reindirizzamenti appropriati | Ciclo di reindirizzamenti, soft 404 o blocco nella selezione di lingua e area geografica |
| Contenuto renderizzato | Titolo, risposta, link e dati strutturati sono presenti nell'HTML iniziale | La struttura vuota dell'applicazione dipende da JavaScript lato client |
Quali crawler vanno verificati separatamente?
Non considerare intercambiabili tutti gli user agent AI. Il recupero dei contenuti per la ricerca, le richieste avviate dagli utenti e l'addestramento dei modelli possono utilizzare crawler e controlli diversi. Definisci la tua politica di accesso in base alla finalità, poi testa l'esatto token dello user agent ufficiale indicato nella documentazione di ciascun fornitore.
- OpenAI: testa OAI-SearchBot per l'individuazione dei contenuti nella ricerca, ChatGPT-User per il recupero avviato dagli utenti e GPTBot in base alla tua politica sull'addestramento.
- Anthropic: verifica separatamente ClaudeBot e gli eventuali agenti di recupero dei contenuti indicati nella documentazione attuale.
- Perplexity: testa PerplexityBot e il recupero dei contenuti avviato dagli utenti seguendo la documentazione attuale.
- Google: distingui l'accesso di Googlebot per la ricerca dai controlli di Google-Extended per l'addestramento generativo e l'ancoraggio delle risposte alle fonti.
Come eseguire un test ripetibile dei crawler?
- Scegli cinque URL rappresentativi, includendo una pagina in profondità nella struttura del sito non collegata dalla homepage.
- Recupera robots.txt e annota la regola applicabile a ciascuno user agent.
- Richiedi ogni URL con la stringa ufficiale dello user agent e registra stato HTTP, URL finale, tipo di contenuto, dimensione della risposta e tempo di risposta.
- Esamina l'HTML restituito per verificare la presenza di canonical, H1, risposta diretta, link principali e JSON-LD.
- Confronta la risposta ricevuta dal bot con quella di un normale browser e indaga sulle differenze significative.
- Controlla i log dell'infrastruttura perimetrale e del server di origine per individuare verifiche anti-bot, limiti alla frequenza delle richieste e richieste fallite ripetutamente.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.htmlCome diagnosticare una richiesta del crawler non riuscita?
| Risultato osservato | Causa probabile | Controllo successivo |
|---|---|---|
| 403 o pagina di verifica anti-bot | Regola della CDN, del WAF o del sistema di gestione dei bot | Esamina l'evento corrispondente sul perimetro di rete e l'ID della regola |
| 429 | Limite alla frequenza delle richieste condiviso da tutto il traffico automatizzato | Rivedi i limiti specifici per i bot e le indicazioni per i nuovi tentativi |
| 200 con HTML di dimensioni minime | Rendering esclusivamente lato client o richiesta di dati bloccata | Esamina il codice sorgente iniziale e i log del server |
| Reindirizzamento al login o al selettore di lingua e area geografica | Middleware o regola di geolocalizzazione | Verifica i cookie, Accept-Language e il comportamento del canonical |
| Pagina corretta ma priva di dati strutturati | Dati strutturati inseriti soltanto nel browser | Sposta il markup essenziale nell'HTML renderizzato dal server |
Che cosa dimostra che la correzione dell'accesso ha funzionato?
Una correzione è verificata solo quando lo user agent interessato riceve una pagina canonica con stato 200 e una risposta sostanzialmente identica a quella visibile al visitatore. Salva il comando, la marca temporale, le intestazioni e un hash o un estratto del corpo della risposta. Poi conferma una visita reale nei log del server: un test sintetico dimostra che l'accesso è possibile, mentre i log dimostrano che la scansione è effettivamente avvenuta.
- Ripeti il test su ogni template interessato, non soltanto sulla homepage.
- Conferma che robots.txt e i riferimenti alle sitemap rimangano coerenti.
- Verifica che la cache non restituisca una vecchia risposta di blocco.
- Inserisci l'audit nei controlli di rilascio dopo modifiche alla CDN, al firewall o al rendering.
Passo dopo passo
- 1Scegli pagine rappresentative
Seleziona gli URL importanti per ciascun template e includi almeno una pagina in profondità nella struttura del sito.
- 2Leggi le regole robots applicabili
Valuta separatamente ciascuno user agent AI ufficiale, includendo le regole con caratteri jolly.
- 3Recupera e confronta le risposte
Registra reindirizzamenti, stato HTTP, intestazioni, dimensione del corpo della risposta, contenuti visibili e dati strutturati.
- 4Individua l'origine di ogni blocco
Usa i log dell'infrastruttura perimetrale e del server di origine per identificare la regola esatta o la dipendenza di rendering.
- 5Ripeti i test e monitora
Verifica la risposta dopo la correzione e monitora nel tempo le visite effettive dei crawler.
Domande frequenti
- Consentire l'accesso a GPTBot significa consentirlo anche a ChatGPT Search?
- Non necessariamente. La documentazione di OpenAI distingue gli agenti per l'addestramento, l'individuazione dei contenuti nella ricerca e il recupero avviato dagli utenti. Verifica e configura ciascun agente ufficiale attuale in base all'accesso che intendi concedere.
- Perché un crawler AI riceve un 403 se robots.txt ne consente l'accesso?
- robots.txt dichiara le preferenze di scansione, ma non aggira CDN, firewall, livelli di autenticazione o verifiche anti-bot. Esamina l'evento sul perimetro di rete e i log del server di origine per identificare il livello che ha negato l'accesso.
- Una risposta 200 è sufficiente?
- No. Una risposta 200 può contenere una pagina di verifica anti-bot, una struttura applicativa vuota, un soft 404 o una pagina localizzata incompleta. Esamina l'HTML restituito per verificare la presenza della risposta effettiva, del canonical, dei link e dei dati strutturati.
- Con quale frequenza va verificato l'accesso dei crawler?
- Ripeti i test dopo modifiche a hosting, regole della CDN, rendering, reindirizzamenti, autenticazione o robots.txt. Per i siti stabili, un controllo mensile programmato, insieme al monitoraggio dei log, permette di individuare la maggior parte delle regressioni.
- Bisogna consentire l'accesso a tutti i crawler AI?
- È una scelta di politica di accesso. Distingui il recupero avviato dagli utenti e l'individuazione dei contenuti nella ricerca dall'addestramento dei modelli, poi autorizza o blocca consapevolmente ciascun agente documentato, anziché applicare un'unica regola indistinta.
Sources
Scansiona il tuo sito per la visibilità AI
Esegui una scansione GEO e AEO gratuita e ricevi correzioni per llms.txt, robots.txt, schema e contenuti generate per il tuo dominio.
Esegui una scansione gratuita