Como auditar o acesso de rastreadores de IA
Teste se GPTBot, OAI-SearchBot, ClaudeBot e PerplexityBot conseguem acessar seu site, diagnostique bloqueios e valide cada correção com segurança.
Resposta rápida
Para auditar o acesso de rastreadores de IA, verifique o robots.txt, teste cada user agent oficial nas URLs importantes, compare o status e o HTML retornados com os de uma requisição comum de navegador e analise os logs da CDN ou do firewall em busca de bloqueios. Uma regra Allow no robots.txt não basta se o servidor retorna um desafio de segurança, um 403, uma estrutura vazia ou um conteúdo diferente.
Principais pontos
- Teste os rastreadores de busca e recuperação de conteúdo separadamente dos rastreadores de treinamento, pois suas funções e controles são diferentes.
- Verifique o corpo da resposta final, não apenas o robots.txt ou o status HTTP.
- Audite tipos de página representativos: página inicial, artigo, produto, documentação e uma URL em um nível mais profundo do site.
- Corrija as regras da CDN e do firewall antes de reescrever o conteúdo; páginas inacessíveis não conseguem ser citadas.
- Repita as verificações após implantações e monitore os logs do servidor para identificar visitas reais dos rastreadores.
O que uma auditoria de acesso de rastreadores de IA deve testar?
Uma auditoria completa de acesso verifica quatro camadas, nesta ordem: a permissão declarada no robots.txt, o acesso pela rede através da CDN ou do firewall, a resposta HTTP final após os redirecionamentos e o HTML útil disponível sem JavaScript executado no navegador. Passar em uma camada não comprova que a próxima funciona.
| Camada | Critério de aprovação | Falha comum |
|---|---|---|
| robots.txt | O user agent em questão não está bloqueado | Uma regra com curinga se sobrepõe à permissão pretendida |
| Borda da rede | O bot consegue acessar o mesmo servidor de origem que um visitante | A proteção contra bots retorna 403, 429 ou um desafio de segurança |
| HTTP | Uma única resposta 200 para a página canônica após redirecionamentos coerentes | Loop de redirecionamento, soft 404 ou navegação presa na seleção de idioma ou região |
| Conteúdo renderizado | Título, resposta, links e dados estruturados estão presentes no HTML inicial | A estrutura vazia do aplicativo depende de JavaScript no cliente |
Quais rastreadores precisam de verificações separadas?
Não trate todos os user agents de IA como equivalentes. A recuperação de conteúdo para busca, as requisições acionadas por usuários e o treinamento de modelos podem usar rastreadores e controles diferentes. Defina sua política por finalidade e, depois, teste o token exato do user agent oficial documentado por cada provedor.
- OpenAI: teste OAI-SearchBot para descoberta de conteúdo na busca, ChatGPT-User para recuperação de conteúdo acionada por usuários e GPTBot conforme sua política de treinamento.
- Anthropic: avalie separadamente ClaudeBot e quaisquer agentes de recuperação de conteúdo descritos na documentação atual.
- Perplexity: teste PerplexityBot e a recuperação de conteúdo acionada por usuários conforme a documentação atual.
- Google: diferencie o acesso do Googlebot para busca dos controles do Google-Extended para treinamento de IA generativa e fundamentação de respostas.
Como executar um teste de rastreador que possa ser repetido?
- Escolha cinco URLs representativas, incluindo uma página em um nível mais profundo do site que não tenha link na página inicial.
- Consulte o robots.txt e registre a regra aplicável a cada user agent.
- Faça uma requisição a cada URL com a string oficial do user agent e registre o status, a URL final, o tipo de conteúdo, o tamanho e o tempo da resposta.
- Inspecione o HTML retornado em busca da tag canonical, do H1, da resposta direta, dos links principais e do JSON-LD.
- Compare a resposta recebida pelo bot com a de um navegador comum e investigue diferenças relevantes.
- Verifique os logs da borda e do servidor de origem em busca de desafios de segurança, limites de requisições e falhas recorrentes.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.htmlComo diagnosticar uma falha na requisição de um rastreador?
| Resultado observado | Causa provável | Próxima verificação |
|---|---|---|
| 403 ou página de desafio de segurança | Regra da CDN, do WAF ou de gerenciamento de bots | Inspecione o evento correspondente na borda e o ID da regra |
| 429 | Limite de requisições compartilhado por todo o tráfego automatizado | Revise os limites específicos para bots e as orientações para novas tentativas |
| 200 com HTML muito pequeno | Renderização apenas no cliente ou requisição de dados bloqueada | Verifique o código-fonte inicial e os logs do servidor |
| Redirecionamento para login ou seletor de idioma ou região | Middleware ou regra de geolocalização | Teste os cookies, o Accept-Language e o comportamento da tag canonical |
| Página correta, mas sem marcação de dados estruturados | Dados estruturados inseridos apenas no navegador | Mova a marcação essencial para o HTML renderizado no servidor |
O que comprova que a correção de acesso funcionou?
Uma correção só está validada quando o user agent afetado recebe a página canônica com status 200 e uma resposta com o mesmo conteúdo essencial que o visitante vê. Salve o comando, a data e a hora, os cabeçalhos e um hash ou trecho do corpo da resposta. Depois, confirme uma visita real nos logs do servidor: o teste sintético comprova que o acesso é possível, enquanto os logs comprovam que o rastreamento de fato ocorreu.
- Teste novamente todos os modelos de página afetados, não apenas a página inicial.
- Confirme que as referências no robots.txt e no sitemap continuam consistentes.
- Verifique se o cache não está entregando uma resposta antiga de bloqueio.
- Inclua a auditoria nas verificações de lançamento após alterações na CDN, no firewall ou na renderização.
Passo a passo
- 1Escolha páginas representativas
Selecione URLs importantes de cada modelo de página e inclua pelo menos uma página em um nível mais profundo do site.
- 2Leia as regras aplicáveis do robots.txt
Avalie cada user agent oficial de IA de forma independente, incluindo as regras com curingas.
- 3Faça as requisições e compare as respostas
Registre redirecionamentos, status, cabeçalhos, tamanho do corpo da resposta, conteúdo visível e dados estruturados.
- 4Rastreie a origem de cada bloqueio
Use os logs da borda e do servidor de origem para identificar a regra exata ou a dependência de renderização.
- 5Teste novamente e monitore
Valide a resposta corrigida e acompanhe as visitas reais dos rastreadores ao longo do tempo.
Perguntas frequentes
- Permitir o GPTBot também libera o ChatGPT Search?
- Não necessariamente. A OpenAI documenta agentes separados para treinamento, descoberta de conteúdo na busca e recuperação de conteúdo acionada por usuários. Audite e configure cada agente oficial vigente de acordo com o acesso que você pretende conceder.
- Por que um rastreador de IA recebe um 403 mesmo com permissão no robots.txt?
- O robots.txt declara preferências de rastreamento, mas não contorna uma CDN, um firewall, uma camada de autenticação ou um desafio de segurança para bots. Inspecione o evento na borda e os logs do servidor de origem para identificar qual camada negou o acesso.
- Uma resposta 200 é suficiente?
- Não. Uma resposta 200 pode conter uma página de desafio de segurança, uma estrutura vazia de aplicativo, um soft 404 ou uma versão incompleta da página para determinado idioma ou região. Inspecione o HTML retornado para verificar a resposta de fato, a tag canonical, os links e os dados estruturados.
- Com que frequência o acesso dos rastreadores deve ser auditado?
- Refaça os testes após alterações na hospedagem, nas regras da CDN, na renderização, nos redirecionamentos, na autenticação ou no robots.txt. Em sites estáveis, uma verificação mensal programada, combinada com o monitoramento dos logs, detecta a maioria das regressões.
- Todos os rastreadores de IA devem ter acesso permitido?
- Essa é uma decisão de política de acesso. Separe a recuperação de conteúdo acionada por usuários e a descoberta na busca do treinamento de modelos. Depois, permita ou bloqueie cada agente documentado de forma deliberada, em vez de aplicar uma única regra geral.
Sources
Analise seu site para visibilidade em IA
Execute uma análise gratuita de GEO e AEO e receba correções geradas para llms.txt, robots.txt, schema e conteúdo para o seu domínio.
Executar análise gratuita