Skip to main content

Como auditar o acesso de rastreadores de IA

Teste se GPTBot, OAI-SearchBot, ClaudeBot e PerplexityBot conseguem acessar seu site, diagnostique bloqueios e valide cada correção com segurança.

Resposta rápida

Para auditar o acesso de rastreadores de IA, verifique o robots.txt, teste cada user agent oficial nas URLs importantes, compare o status e o HTML retornados com os de uma requisição comum de navegador e analise os logs da CDN ou do firewall em busca de bloqueios. Uma regra Allow no robots.txt não basta se o servidor retorna um desafio de segurança, um 403, uma estrutura vazia ou um conteúdo diferente.

12 min de leituraAtualizado: 2026-09-22

Principais pontos

  • Teste os rastreadores de busca e recuperação de conteúdo separadamente dos rastreadores de treinamento, pois suas funções e controles são diferentes.
  • Verifique o corpo da resposta final, não apenas o robots.txt ou o status HTTP.
  • Audite tipos de página representativos: página inicial, artigo, produto, documentação e uma URL em um nível mais profundo do site.
  • Corrija as regras da CDN e do firewall antes de reescrever o conteúdo; páginas inacessíveis não conseguem ser citadas.
  • Repita as verificações após implantações e monitore os logs do servidor para identificar visitas reais dos rastreadores.

O que uma auditoria de acesso de rastreadores de IA deve testar?

Uma auditoria completa de acesso verifica quatro camadas, nesta ordem: a permissão declarada no robots.txt, o acesso pela rede através da CDN ou do firewall, a resposta HTTP final após os redirecionamentos e o HTML útil disponível sem JavaScript executado no navegador. Passar em uma camada não comprova que a próxima funciona.

CamadaCritério de aprovaçãoFalha comum
robots.txtO user agent em questão não está bloqueadoUma regra com curinga se sobrepõe à permissão pretendida
Borda da redeO bot consegue acessar o mesmo servidor de origem que um visitanteA proteção contra bots retorna 403, 429 ou um desafio de segurança
HTTPUma única resposta 200 para a página canônica após redirecionamentos coerentesLoop de redirecionamento, soft 404 ou navegação presa na seleção de idioma ou região
Conteúdo renderizadoTítulo, resposta, links e dados estruturados estão presentes no HTML inicialA estrutura vazia do aplicativo depende de JavaScript no cliente

Quais rastreadores precisam de verificações separadas?

Não trate todos os user agents de IA como equivalentes. A recuperação de conteúdo para busca, as requisições acionadas por usuários e o treinamento de modelos podem usar rastreadores e controles diferentes. Defina sua política por finalidade e, depois, teste o token exato do user agent oficial documentado por cada provedor.

  • OpenAI: teste OAI-SearchBot para descoberta de conteúdo na busca, ChatGPT-User para recuperação de conteúdo acionada por usuários e GPTBot conforme sua política de treinamento.
  • Anthropic: avalie separadamente ClaudeBot e quaisquer agentes de recuperação de conteúdo descritos na documentação atual.
  • Perplexity: teste PerplexityBot e a recuperação de conteúdo acionada por usuários conforme a documentação atual.
  • Google: diferencie o acesso do Googlebot para busca dos controles do Google-Extended para treinamento de IA generativa e fundamentação de respostas.
Os nomes e as políticas dos rastreadores mudam. Use a documentação atual de cada provedor como referência oficial e registre a data nas anotações da auditoria.

Como executar um teste de rastreador que possa ser repetido?

  1. Escolha cinco URLs representativas, incluindo uma página em um nível mais profundo do site que não tenha link na página inicial.
  2. Consulte o robots.txt e registre a regra aplicável a cada user agent.
  3. Faça uma requisição a cada URL com a string oficial do user agent e registre o status, a URL final, o tipo de conteúdo, o tamanho e o tempo da resposta.
  4. Inspecione o HTML retornado em busca da tag canonical, do H1, da resposta direta, dos links principais e do JSON-LD.
  5. Compare a resposta recebida pelo bot com a de um navegador comum e investigue diferenças relevantes.
  6. Verifique os logs da borda e do servidor de origem em busca de desafios de segurança, limites de requisições e falhas recorrentes.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.html

Como diagnosticar uma falha na requisição de um rastreador?

Resultado observadoCausa provávelPróxima verificação
403 ou página de desafio de segurançaRegra da CDN, do WAF ou de gerenciamento de botsInspecione o evento correspondente na borda e o ID da regra
429Limite de requisições compartilhado por todo o tráfego automatizadoRevise os limites específicos para bots e as orientações para novas tentativas
200 com HTML muito pequenoRenderização apenas no cliente ou requisição de dados bloqueadaVerifique o código-fonte inicial e os logs do servidor
Redirecionamento para login ou seletor de idioma ou regiãoMiddleware ou regra de geolocalizaçãoTeste os cookies, o Accept-Language e o comportamento da tag canonical
Página correta, mas sem marcação de dados estruturadosDados estruturados inseridos apenas no navegadorMova a marcação essencial para o HTML renderizado no servidor

O que comprova que a correção de acesso funcionou?

Uma correção só está validada quando o user agent afetado recebe a página canônica com status 200 e uma resposta com o mesmo conteúdo essencial que o visitante vê. Salve o comando, a data e a hora, os cabeçalhos e um hash ou trecho do corpo da resposta. Depois, confirme uma visita real nos logs do servidor: o teste sintético comprova que o acesso é possível, enquanto os logs comprovam que o rastreamento de fato ocorreu.

  • Teste novamente todos os modelos de página afetados, não apenas a página inicial.
  • Confirme que as referências no robots.txt e no sitemap continuam consistentes.
  • Verifique se o cache não está entregando uma resposta antiga de bloqueio.
  • Inclua a auditoria nas verificações de lançamento após alterações na CDN, no firewall ou na renderização.

Passo a passo

  1. 1
    Escolha páginas representativas

    Selecione URLs importantes de cada modelo de página e inclua pelo menos uma página em um nível mais profundo do site.

  2. 2
    Leia as regras aplicáveis do robots.txt

    Avalie cada user agent oficial de IA de forma independente, incluindo as regras com curingas.

  3. 3
    Faça as requisições e compare as respostas

    Registre redirecionamentos, status, cabeçalhos, tamanho do corpo da resposta, conteúdo visível e dados estruturados.

  4. 4
    Rastreie a origem de cada bloqueio

    Use os logs da borda e do servidor de origem para identificar a regra exata ou a dependência de renderização.

  5. 5
    Teste novamente e monitore

    Valide a resposta corrigida e acompanhe as visitas reais dos rastreadores ao longo do tempo.

Perguntas frequentes

Permitir o GPTBot também libera o ChatGPT Search?
Não necessariamente. A OpenAI documenta agentes separados para treinamento, descoberta de conteúdo na busca e recuperação de conteúdo acionada por usuários. Audite e configure cada agente oficial vigente de acordo com o acesso que você pretende conceder.
Por que um rastreador de IA recebe um 403 mesmo com permissão no robots.txt?
O robots.txt declara preferências de rastreamento, mas não contorna uma CDN, um firewall, uma camada de autenticação ou um desafio de segurança para bots. Inspecione o evento na borda e os logs do servidor de origem para identificar qual camada negou o acesso.
Uma resposta 200 é suficiente?
Não. Uma resposta 200 pode conter uma página de desafio de segurança, uma estrutura vazia de aplicativo, um soft 404 ou uma versão incompleta da página para determinado idioma ou região. Inspecione o HTML retornado para verificar a resposta de fato, a tag canonical, os links e os dados estruturados.
Com que frequência o acesso dos rastreadores deve ser auditado?
Refaça os testes após alterações na hospedagem, nas regras da CDN, na renderização, nos redirecionamentos, na autenticação ou no robots.txt. Em sites estáveis, uma verificação mensal programada, combinada com o monitoramento dos logs, detecta a maioria das regressões.
Todos os rastreadores de IA devem ter acesso permitido?
Essa é uma decisão de política de acesso. Separe a recuperação de conteúdo acionada por usuários e a descoberta na busca do treinamento de modelos. Depois, permita ou bloqueie cada agente documentado de forma deliberada, em vez de aplicar uma única regra geral.

Sources

  1. [1]Documentação dos rastreadores da OpenAI
  2. [2]Documentação do Google sobre robots.txt
  3. [3]Documentação dos rastreadores da Anthropic

Analise seu site para visibilidade em IA

Execute uma análise gratuita de GEO e AEO e receba correções geradas para llms.txt, robots.txt, schema e conteúdo para o seu domínio.

Executar análise gratuita