Cómo auditar el acceso de los rastreadores de IA
Comprueba si GPTBot, OAI-SearchBot, ClaudeBot y PerplexityBot pueden acceder a tu sitio, diagnostica bloqueos y verifica cada corrección de forma segura.
Respuesta rápida
Para auditar el acceso de los rastreadores de IA, revisa robots.txt, prueba cada agente de usuario oficial con las URL importantes, compara el estado y el HTML devueltos con los de una petición de un navegador convencional y revisa los registros de la CDN o del cortafuegos para detectar bloqueos. Una regla Allow en robots.txt no basta si el servidor devuelve una comprobación de seguridad, un 403, una estructura vacía o contenido diferente.
Puntos clave
- Prueba por separado los rastreadores que recuperan información y los destinados al entrenamiento, ya que sus funciones y controles son distintos.
- Verifica el cuerpo de la respuesta final, no solo robots.txt o el código de estado HTTP.
- Audita tipos de página representativos: inicio, artículo, producto, documentación y una URL de un nivel profundo.
- Corrige las reglas de la CDN y del cortafuegos antes de reescribir el contenido: las páginas inaccesibles no pueden obtener citas.
- Repite las comprobaciones después de cada despliegue y supervisa los registros del servidor para detectar visitas reales de los rastreadores.
¿Qué debe comprobar una auditoría de acceso de rastreadores de IA?
Una auditoría de acceso completa comprueba cuatro capas, en este orden: el permiso declarado en robots.txt, el acceso de red a través de la CDN o del cortafuegos, la respuesta HTTP final tras las redirecciones y el HTML útil disponible sin ejecutar JavaScript en el navegador. Superar una capa no demuestra que la siguiente funcione.
| Capa | Criterio de validación | Fallo habitual |
|---|---|---|
| robots.txt | El agente de usuario correspondiente no tiene el acceso prohibido | Una regla con comodín prevalece sobre el permiso que se quería conceder |
| Perímetro de red | El bot puede acceder al mismo servidor de origen que un visitante | La protección contra bots devuelve un 403, un 429 o una comprobación de seguridad |
| HTTP | Una única respuesta 200 de la URL canónica tras una cadena de redirecciones razonable | Bucle de redirecciones, soft 404 o bloqueo en la selección de idioma o región |
| Contenido renderizado | El título, la respuesta, los enlaces y los datos estructurados están presentes en el HTML inicial | La estructura vacía de la aplicación depende de JavaScript del lado del cliente |
¿Qué rastreadores hay que comprobar por separado?
No trates todos los agentes de usuario de IA como si fueran intercambiables. La recuperación de información para búsquedas, las solicitudes iniciadas por usuarios y el entrenamiento de modelos pueden utilizar rastreadores y controles distintos. Define tu política según la finalidad y prueba después el identificador exacto del agente de usuario oficial que figure en la documentación de cada proveedor.
- OpenAI: prueba OAI-SearchBot para el descubrimiento en búsquedas, ChatGPT-User para la recuperación de información solicitada por usuarios y GPTBot según tu política de entrenamiento.
- Anthropic: revisa por separado ClaudeBot y los agentes de recuperación de información que figuren en la documentación vigente.
- Perplexity: prueba PerplexityBot y la recuperación de información solicitada por usuarios según la documentación vigente.
- Google: distingue entre el acceso de Googlebot para búsquedas y los controles de Google-Extended para el entrenamiento generativo y la fundamentación de respuestas.
¿Cómo se realiza una prueba de rastreo reproducible?
- Elige cinco URL representativas e incluye una página de un nivel profundo que no esté enlazada desde la página de inicio.
- Descarga robots.txt y anota la regla que se aplica a cada agente de usuario.
- Solicita cada URL con la cadena oficial del agente de usuario y registra el código de estado, la URL final, el tipo de contenido, el tamaño de la respuesta y el tiempo de respuesta.
- Inspecciona el HTML devuelto para comprobar la etiqueta canonical, el H1, la respuesta directa, los enlaces principales y el JSON-LD.
- Compara la respuesta del bot con la de un navegador convencional e investiga las diferencias relevantes.
- Revisa los registros del perímetro de red y del servidor de origen para detectar comprobaciones de seguridad, límites de frecuencia y peticiones fallidas recurrentes.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.html¿Cómo se diagnostica una petición fallida de un rastreador?
| Resultado observado | Causa probable | Siguiente comprobación |
|---|---|---|
| 403 o página de comprobación de seguridad | Regla de la CDN, del WAF o del sistema de gestión de bots | Inspecciona el evento correspondiente en el perímetro de red y el ID de la regla |
| 429 | Límite de frecuencia compartido por el tráfico automatizado | Revisa los límites específicos para bots y las indicaciones para reintentar la petición |
| 200 con muy poco HTML | Renderizado exclusivamente en el cliente o petición de datos bloqueada | Revisa el código fuente inicial y los registros del servidor |
| Redirección al inicio de sesión o al selector de idioma o región | Regla de middleware o de geolocalización | Prueba las cookies, Accept-Language y el comportamiento de la URL canónica |
| Página correcta, pero sin marcado de datos estructurados | Datos estructurados que se insertan únicamente en el navegador | Traslada el marcado esencial al HTML renderizado en el servidor |
¿Qué demuestra que la corrección de acceso ha funcionado?
Una corrección solo queda verificada cuando el agente de usuario afectado recibe una página canónica con estado 200 y la misma respuesta de fondo que ve un visitante. Guarda el comando, la marca de tiempo, las cabeceras y un hash o un extracto del cuerpo de la respuesta. Después, confirma una visita real en los registros del servidor: una prueba sintética demuestra que el acceso es posible; los registros demuestran que el rastreo se ha producido.
- Vuelve a probar todas las plantillas afectadas, no solo la página de inicio.
- Confirma que robots.txt y las referencias al sitemap siguen siendo coherentes.
- Comprueba que la caché no sirve una respuesta antigua de bloqueo.
- Incluye la auditoría en las comprobaciones de cada despliegue tras cambios en la CDN, el cortafuegos o el renderizado.
Paso a paso
- 1Elige páginas representativas
Selecciona URL importantes de cada plantilla e incluye al menos una página de un nivel profundo.
- 2Revisa las reglas de robots.txt aplicables
Evalúa cada agente de usuario oficial de IA por separado, incluidas las reglas con comodines.
- 3Obtén y compara las respuestas
Registra las redirecciones, el código de estado, las cabeceras, el tamaño del cuerpo, el contenido visible y los datos estructurados.
- 4Localiza el origen de cada bloqueo
Utiliza los registros del perímetro de red y del servidor de origen para identificar la regla exacta o la dependencia de renderizado.
- 5Repite las pruebas y supervisa el acceso
Verifica la respuesta corregida y comprueba a lo largo del tiempo si se producen visitas reales de los rastreadores.
Preguntas frecuentes
- ¿Permitir GPTBot también permite ChatGPT Search?
- No necesariamente. OpenAI documenta agentes distintos para el entrenamiento, el descubrimiento en búsquedas y la recuperación de información solicitada por usuarios. Audita y configura cada agente oficial vigente según el acceso que quieras conceder.
- ¿Por qué recibe un rastreador de IA un 403 si robots.txt le permite el acceso?
- robots.txt declara las preferencias de rastreo, pero no permite eludir una CDN, un cortafuegos, una capa de autenticación ni una comprobación de seguridad para bots. Inspecciona el evento del perímetro de red y los registros del servidor de origen para identificar qué capa denegó el acceso.
- ¿Basta con una respuesta 200?
- No. Un 200 puede contener una página de comprobación de seguridad, una estructura de aplicación vacía, un soft 404 o una página incompleta para un idioma o una región. Inspecciona el HTML devuelto para comprobar que contiene la respuesta real, la etiqueta canonical, los enlaces y los datos estructurados.
- ¿Con qué frecuencia se debe auditar el acceso de los rastreadores?
- Repite las pruebas después de cambiar el alojamiento, las reglas de la CDN, el renderizado, las redirecciones, la autenticación o robots.txt. En sitios estables, una comprobación mensual programada y la supervisión de los registros permiten detectar la mayoría de los fallos que reaparecen.
- ¿Se debe permitir el acceso a todos los rastreadores de IA?
- Es una decisión de política de acceso. Distingue la recuperación de información solicitada por usuarios y el descubrimiento en búsquedas del entrenamiento de modelos. Después, permite o bloquea cada agente documentado de forma deliberada, en lugar de aplicar una única regla general.
Sources
Escanea tu sitio para visibilidad en IA
Haz un escaneo gratuito GEO y AEO y obtén archivos llms.txt, robots.txt, schema y soluciones de contenido generadas para tu dominio.
Realizar un escaneo gratuito