Skip to main content

Cómo auditar el acceso de los rastreadores de IA

Comprueba si GPTBot, OAI-SearchBot, ClaudeBot y PerplexityBot pueden acceder a tu sitio, diagnostica bloqueos y verifica cada corrección de forma segura.

Respuesta rápida

Para auditar el acceso de los rastreadores de IA, revisa robots.txt, prueba cada agente de usuario oficial con las URL importantes, compara el estado y el HTML devueltos con los de una petición de un navegador convencional y revisa los registros de la CDN o del cortafuegos para detectar bloqueos. Una regla Allow en robots.txt no basta si el servidor devuelve una comprobación de seguridad, un 403, una estructura vacía o contenido diferente.

12 min de lecturaActualizado: 2026-09-22

Puntos clave

  • Prueba por separado los rastreadores que recuperan información y los destinados al entrenamiento, ya que sus funciones y controles son distintos.
  • Verifica el cuerpo de la respuesta final, no solo robots.txt o el código de estado HTTP.
  • Audita tipos de página representativos: inicio, artículo, producto, documentación y una URL de un nivel profundo.
  • Corrige las reglas de la CDN y del cortafuegos antes de reescribir el contenido: las páginas inaccesibles no pueden obtener citas.
  • Repite las comprobaciones después de cada despliegue y supervisa los registros del servidor para detectar visitas reales de los rastreadores.

¿Qué debe comprobar una auditoría de acceso de rastreadores de IA?

Una auditoría de acceso completa comprueba cuatro capas, en este orden: el permiso declarado en robots.txt, el acceso de red a través de la CDN o del cortafuegos, la respuesta HTTP final tras las redirecciones y el HTML útil disponible sin ejecutar JavaScript en el navegador. Superar una capa no demuestra que la siguiente funcione.

CapaCriterio de validaciónFallo habitual
robots.txtEl agente de usuario correspondiente no tiene el acceso prohibidoUna regla con comodín prevalece sobre el permiso que se quería conceder
Perímetro de redEl bot puede acceder al mismo servidor de origen que un visitanteLa protección contra bots devuelve un 403, un 429 o una comprobación de seguridad
HTTPUna única respuesta 200 de la URL canónica tras una cadena de redirecciones razonableBucle de redirecciones, soft 404 o bloqueo en la selección de idioma o región
Contenido renderizadoEl título, la respuesta, los enlaces y los datos estructurados están presentes en el HTML inicialLa estructura vacía de la aplicación depende de JavaScript del lado del cliente

¿Qué rastreadores hay que comprobar por separado?

No trates todos los agentes de usuario de IA como si fueran intercambiables. La recuperación de información para búsquedas, las solicitudes iniciadas por usuarios y el entrenamiento de modelos pueden utilizar rastreadores y controles distintos. Define tu política según la finalidad y prueba después el identificador exacto del agente de usuario oficial que figure en la documentación de cada proveedor.

  • OpenAI: prueba OAI-SearchBot para el descubrimiento en búsquedas, ChatGPT-User para la recuperación de información solicitada por usuarios y GPTBot según tu política de entrenamiento.
  • Anthropic: revisa por separado ClaudeBot y los agentes de recuperación de información que figuren en la documentación vigente.
  • Perplexity: prueba PerplexityBot y la recuperación de información solicitada por usuarios según la documentación vigente.
  • Google: distingue entre el acceso de Googlebot para búsquedas y los controles de Google-Extended para el entrenamiento generativo y la fundamentación de respuestas.
Los nombres de los rastreadores y sus políticas cambian. Toma como referencia la documentación vigente de cada proveedor y fecha las notas de tu auditoría.

¿Cómo se realiza una prueba de rastreo reproducible?

  1. Elige cinco URL representativas e incluye una página de un nivel profundo que no esté enlazada desde la página de inicio.
  2. Descarga robots.txt y anota la regla que se aplica a cada agente de usuario.
  3. Solicita cada URL con la cadena oficial del agente de usuario y registra el código de estado, la URL final, el tipo de contenido, el tamaño de la respuesta y el tiempo de respuesta.
  4. Inspecciona el HTML devuelto para comprobar la etiqueta canonical, el H1, la respuesta directa, los enlaces principales y el JSON-LD.
  5. Compara la respuesta del bot con la de un navegador convencional e investiga las diferencias relevantes.
  6. Revisa los registros del perímetro de red y del servidor de origen para detectar comprobaciones de seguridad, límites de frecuencia y peticiones fallidas recurrentes.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.html

¿Cómo se diagnostica una petición fallida de un rastreador?

Resultado observadoCausa probableSiguiente comprobación
403 o página de comprobación de seguridadRegla de la CDN, del WAF o del sistema de gestión de botsInspecciona el evento correspondiente en el perímetro de red y el ID de la regla
429Límite de frecuencia compartido por el tráfico automatizadoRevisa los límites específicos para bots y las indicaciones para reintentar la petición
200 con muy poco HTMLRenderizado exclusivamente en el cliente o petición de datos bloqueadaRevisa el código fuente inicial y los registros del servidor
Redirección al inicio de sesión o al selector de idioma o regiónRegla de middleware o de geolocalizaciónPrueba las cookies, Accept-Language y el comportamiento de la URL canónica
Página correcta, pero sin marcado de datos estructuradosDatos estructurados que se insertan únicamente en el navegadorTraslada el marcado esencial al HTML renderizado en el servidor

¿Qué demuestra que la corrección de acceso ha funcionado?

Una corrección solo queda verificada cuando el agente de usuario afectado recibe una página canónica con estado 200 y la misma respuesta de fondo que ve un visitante. Guarda el comando, la marca de tiempo, las cabeceras y un hash o un extracto del cuerpo de la respuesta. Después, confirma una visita real en los registros del servidor: una prueba sintética demuestra que el acceso es posible; los registros demuestran que el rastreo se ha producido.

  • Vuelve a probar todas las plantillas afectadas, no solo la página de inicio.
  • Confirma que robots.txt y las referencias al sitemap siguen siendo coherentes.
  • Comprueba que la caché no sirve una respuesta antigua de bloqueo.
  • Incluye la auditoría en las comprobaciones de cada despliegue tras cambios en la CDN, el cortafuegos o el renderizado.

Paso a paso

  1. 1
    Elige páginas representativas

    Selecciona URL importantes de cada plantilla e incluye al menos una página de un nivel profundo.

  2. 2
    Revisa las reglas de robots.txt aplicables

    Evalúa cada agente de usuario oficial de IA por separado, incluidas las reglas con comodines.

  3. 3
    Obtén y compara las respuestas

    Registra las redirecciones, el código de estado, las cabeceras, el tamaño del cuerpo, el contenido visible y los datos estructurados.

  4. 4
    Localiza el origen de cada bloqueo

    Utiliza los registros del perímetro de red y del servidor de origen para identificar la regla exacta o la dependencia de renderizado.

  5. 5
    Repite las pruebas y supervisa el acceso

    Verifica la respuesta corregida y comprueba a lo largo del tiempo si se producen visitas reales de los rastreadores.

Preguntas frecuentes

¿Permitir GPTBot también permite ChatGPT Search?
No necesariamente. OpenAI documenta agentes distintos para el entrenamiento, el descubrimiento en búsquedas y la recuperación de información solicitada por usuarios. Audita y configura cada agente oficial vigente según el acceso que quieras conceder.
¿Por qué recibe un rastreador de IA un 403 si robots.txt le permite el acceso?
robots.txt declara las preferencias de rastreo, pero no permite eludir una CDN, un cortafuegos, una capa de autenticación ni una comprobación de seguridad para bots. Inspecciona el evento del perímetro de red y los registros del servidor de origen para identificar qué capa denegó el acceso.
¿Basta con una respuesta 200?
No. Un 200 puede contener una página de comprobación de seguridad, una estructura de aplicación vacía, un soft 404 o una página incompleta para un idioma o una región. Inspecciona el HTML devuelto para comprobar que contiene la respuesta real, la etiqueta canonical, los enlaces y los datos estructurados.
¿Con qué frecuencia se debe auditar el acceso de los rastreadores?
Repite las pruebas después de cambiar el alojamiento, las reglas de la CDN, el renderizado, las redirecciones, la autenticación o robots.txt. En sitios estables, una comprobación mensual programada y la supervisión de los registros permiten detectar la mayoría de los fallos que reaparecen.
¿Se debe permitir el acceso a todos los rastreadores de IA?
Es una decisión de política de acceso. Distingue la recuperación de información solicitada por usuarios y el descubrimiento en búsquedas del entrenamiento de modelos. Después, permite o bloquea cada agente documentado de forma deliberada, en lugar de aplicar una única regla general.

Sources

  1. [1]Documentación de los rastreadores de OpenAI
  2. [2]Documentación de Google sobre robots.txt
  3. [3]Documentación del rastreador de Anthropic

Escanea tu sitio para visibilidad en IA

Haz un escaneo gratuito GEO y AEO y obtén archivos llms.txt, robots.txt, schema y soluciones de contenido generadas para tu dominio.

Realizar un escaneo gratuito