Skip to main content

Come verificare l'accesso dei crawler AI

Verifica se GPTBot, OAI-SearchBot, ClaudeBot e PerplexityBot accedono al tuo sito, individua i blocchi e controlla ogni correzione in sicurezza.

Risposta rapida

Per verificare l'accesso dei crawler AI, controlla robots.txt, testa ogni user agent ufficiale sugli URL più importanti, confronta lo stato HTTP e l'HTML restituiti con quelli di una normale richiesta da browser e cerca eventuali blocchi nei log della CDN o del firewall. Una regola Allow in robots.txt non basta se il server restituisce una verifica anti-bot, un errore 403, una struttura HTML vuota o contenuti diversi.

12 min letturaAggiornato il: 2026-09-22

Punti chiave

  • Testa separatamente i crawler per il recupero dei contenuti e quelli per l'addestramento, perché hanno ruoli e controlli diversi.
  • Verifica il corpo della risposta finale, non soltanto robots.txt o il codice di stato HTTP.
  • Controlla tipologie di pagina rappresentative: homepage, articolo, prodotto, documentazione e un URL situato in profondità nella struttura del sito.
  • Correggi le regole della CDN e del firewall prima di riscrivere i contenuti: le pagine inaccessibili non possono ottenere citazioni.
  • Ripeti i controlli dopo ogni rilascio e monitora i log del server per rilevare le visite effettive dei crawler.

Che cosa deve verificare un audit dell'accesso dei crawler AI?

Un audit completo dell'accesso verifica quattro livelli, in ordine: le autorizzazioni dichiarate in robots.txt, l'accesso di rete attraverso la CDN o il firewall, la risposta HTTP finale dopo i reindirizzamenti e l'HTML utile disponibile senza eseguire JavaScript nel browser. Superare un livello non dimostra che quello successivo funzioni.

LivelloCondizione da soddisfareProblema frequente
robots.txtL'accesso non è vietato allo user agent interessatoUna regola con carattere jolly prevale su un'autorizzazione prevista
Perimetro di reteIl bot può raggiungere lo stesso server di origine accessibile a un visitatoreLa protezione anti-bot restituisce 403, 429 o una richiesta di verifica
HTTPUn'unica risposta 200 sull'URL canonico dopo reindirizzamenti appropriatiCiclo di reindirizzamenti, soft 404 o blocco nella selezione di lingua e area geografica
Contenuto renderizzatoTitolo, risposta, link e dati strutturati sono presenti nell'HTML inizialeLa struttura vuota dell'applicazione dipende da JavaScript lato client

Quali crawler vanno verificati separatamente?

Non considerare intercambiabili tutti gli user agent AI. Il recupero dei contenuti per la ricerca, le richieste avviate dagli utenti e l'addestramento dei modelli possono utilizzare crawler e controlli diversi. Definisci la tua politica di accesso in base alla finalità, poi testa l'esatto token dello user agent ufficiale indicato nella documentazione di ciascun fornitore.

  • OpenAI: testa OAI-SearchBot per l'individuazione dei contenuti nella ricerca, ChatGPT-User per il recupero avviato dagli utenti e GPTBot in base alla tua politica sull'addestramento.
  • Anthropic: verifica separatamente ClaudeBot e gli eventuali agenti di recupero dei contenuti indicati nella documentazione attuale.
  • Perplexity: testa PerplexityBot e il recupero dei contenuti avviato dagli utenti seguendo la documentazione attuale.
  • Google: distingui l'accesso di Googlebot per la ricerca dai controlli di Google-Extended per l'addestramento generativo e l'ancoraggio delle risposte alle fonti.
I nomi dei crawler e le relative politiche cambiano. Fai riferimento alla documentazione aggiornata di ciascun fornitore e indica la data nelle note dell'audit.

Come eseguire un test ripetibile dei crawler?

  1. Scegli cinque URL rappresentativi, includendo una pagina in profondità nella struttura del sito non collegata dalla homepage.
  2. Recupera robots.txt e annota la regola applicabile a ciascuno user agent.
  3. Richiedi ogni URL con la stringa ufficiale dello user agent e registra stato HTTP, URL finale, tipo di contenuto, dimensione della risposta e tempo di risposta.
  4. Esamina l'HTML restituito per verificare la presenza di canonical, H1, risposta diretta, link principali e JSON-LD.
  5. Confronta la risposta ricevuta dal bot con quella di un normale browser e indaga sulle differenze significative.
  6. Controlla i log dell'infrastruttura perimetrale e del server di origine per individuare verifiche anti-bot, limiti alla frequenza delle richieste e richieste fallite ripetutamente.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.html

Come diagnosticare una richiesta del crawler non riuscita?

Risultato osservatoCausa probabileControllo successivo
403 o pagina di verifica anti-botRegola della CDN, del WAF o del sistema di gestione dei botEsamina l'evento corrispondente sul perimetro di rete e l'ID della regola
429Limite alla frequenza delle richieste condiviso da tutto il traffico automatizzatoRivedi i limiti specifici per i bot e le indicazioni per i nuovi tentativi
200 con HTML di dimensioni minimeRendering esclusivamente lato client o richiesta di dati bloccataEsamina il codice sorgente iniziale e i log del server
Reindirizzamento al login o al selettore di lingua e area geograficaMiddleware o regola di geolocalizzazioneVerifica i cookie, Accept-Language e il comportamento del canonical
Pagina corretta ma priva di dati strutturatiDati strutturati inseriti soltanto nel browserSposta il markup essenziale nell'HTML renderizzato dal server

Che cosa dimostra che la correzione dell'accesso ha funzionato?

Una correzione è verificata solo quando lo user agent interessato riceve una pagina canonica con stato 200 e una risposta sostanzialmente identica a quella visibile al visitatore. Salva il comando, la marca temporale, le intestazioni e un hash o un estratto del corpo della risposta. Poi conferma una visita reale nei log del server: un test sintetico dimostra che l'accesso è possibile, mentre i log dimostrano che la scansione è effettivamente avvenuta.

  • Ripeti il test su ogni template interessato, non soltanto sulla homepage.
  • Conferma che robots.txt e i riferimenti alle sitemap rimangano coerenti.
  • Verifica che la cache non restituisca una vecchia risposta di blocco.
  • Inserisci l'audit nei controlli di rilascio dopo modifiche alla CDN, al firewall o al rendering.

Passo dopo passo

  1. 1
    Scegli pagine rappresentative

    Seleziona gli URL importanti per ciascun template e includi almeno una pagina in profondità nella struttura del sito.

  2. 2
    Leggi le regole robots applicabili

    Valuta separatamente ciascuno user agent AI ufficiale, includendo le regole con caratteri jolly.

  3. 3
    Recupera e confronta le risposte

    Registra reindirizzamenti, stato HTTP, intestazioni, dimensione del corpo della risposta, contenuti visibili e dati strutturati.

  4. 4
    Individua l'origine di ogni blocco

    Usa i log dell'infrastruttura perimetrale e del server di origine per identificare la regola esatta o la dipendenza di rendering.

  5. 5
    Ripeti i test e monitora

    Verifica la risposta dopo la correzione e monitora nel tempo le visite effettive dei crawler.

Domande frequenti

Consentire l'accesso a GPTBot significa consentirlo anche a ChatGPT Search?
Non necessariamente. La documentazione di OpenAI distingue gli agenti per l'addestramento, l'individuazione dei contenuti nella ricerca e il recupero avviato dagli utenti. Verifica e configura ciascun agente ufficiale attuale in base all'accesso che intendi concedere.
Perché un crawler AI riceve un 403 se robots.txt ne consente l'accesso?
robots.txt dichiara le preferenze di scansione, ma non aggira CDN, firewall, livelli di autenticazione o verifiche anti-bot. Esamina l'evento sul perimetro di rete e i log del server di origine per identificare il livello che ha negato l'accesso.
Una risposta 200 è sufficiente?
No. Una risposta 200 può contenere una pagina di verifica anti-bot, una struttura applicativa vuota, un soft 404 o una pagina localizzata incompleta. Esamina l'HTML restituito per verificare la presenza della risposta effettiva, del canonical, dei link e dei dati strutturati.
Con quale frequenza va verificato l'accesso dei crawler?
Ripeti i test dopo modifiche a hosting, regole della CDN, rendering, reindirizzamenti, autenticazione o robots.txt. Per i siti stabili, un controllo mensile programmato, insieme al monitoraggio dei log, permette di individuare la maggior parte delle regressioni.
Bisogna consentire l'accesso a tutti i crawler AI?
È una scelta di politica di accesso. Distingui il recupero avviato dagli utenti e l'individuazione dei contenuti nella ricerca dall'addestramento dei modelli, poi autorizza o blocca consapevolmente ciascun agente documentato, anziché applicare un'unica regola indistinta.

Sources

  1. [1]Documentazione sui crawler di OpenAI
  2. [2]Documentazione di Google su robots.txt
  3. [3]Documentazione sui crawler di Anthropic

Scansiona il tuo sito per la visibilità AI

Esegui una scansione GEO e AEO gratuita e ricevi correzioni per llms.txt, robots.txt, schema e contenuti generate per il tuo dominio.

Esegui una scansione gratuita