Как проверить доступ ИИ-краулеров к сайту
Проверьте, могут ли GPTBot, OAI-SearchBot, ClaudeBot и PerplexityBot загружать страницы сайта. Найдите причины блокировок и безопасно проверьте исправления.
Краткий ответ
Чтобы проверить доступ ИИ-краулеров, изучите robots.txt, запросите важные URL с каждым официальным User-Agent, сравните статус ответа и HTML с обычным браузерным запросом и проверьте журналы CDN или межсетевого экрана на наличие блокировок. Правила Allow в robots.txt недостаточно, если сервер возвращает проверку на бота, 403, пустую оболочку приложения или другой контент.
Ключевые выводы
- Проверяйте краулеры для поиска и получения информации отдельно от краулеров для обучения моделей: у них разные задачи и механизмы управления доступом.
- Проверяйте тело итогового ответа, а не только robots.txt или HTTP-статус.
- Включите в аудит типовые страницы: главную, статью, карточку товара, документацию и страницу глубоко в структуре сайта.
- Исправьте правила CDN и межсетевого экрана, прежде чем переписывать контент: недоступные страницы не смогут стать источниками цитирования.
- Повторяйте проверки после развёртывания обновлений и отслеживайте реальные посещения краулеров в серверных журналах.
Что нужно проверять при аудите доступа ИИ-краулеров?
Полный аудит доступа последовательно проверяет четыре уровня: разрешения в robots.txt, сетевой доступ через CDN или межсетевой экран, итоговый HTTP-ответ после перенаправлений и содержательный HTML, доступный без выполнения JavaScript в браузере. Успешная проверка одного уровня не гарантирует, что следующий работает корректно.
| Уровень | Условие успешной проверки | Типичная проблема |
|---|---|---|
| robots.txt | Для нужного User-Agent нет запрета на обход | Правило с подстановочным знаком перекрывает запланированное разрешение |
| Пограничная инфраструктура | Боту доступен тот же исходный сервер, что и посетителю | Защита от ботов возвращает 403, 429 или страницу проверки |
| HTTP | После корректных перенаправлений возвращается одна каноническая страница со статусом 200 | Цикл перенаправлений, soft 404 или зацикливание на выборе локали |
| Содержимое страницы | Заголовок, ответ, ссылки и структурированные данные есть в исходном HTML | Пустая оболочка приложения требует выполнения клиентского JavaScript |
Каких краулеров нужно проверять отдельно?
Не считайте все User-Agent ИИ-сервисов взаимозаменяемыми. Для поискового сбора информации, загрузки по запросу пользователя и обучения моделей могут использоваться разные краулеры и механизмы управления доступом. Сначала определите политику для каждой задачи, затем проверяйте точный официальный идентификатор User-Agent из документации провайдера.
- OpenAI: проверяйте OAI-SearchBot для обнаружения страниц в поиске, ChatGPT-User для загрузки по запросу пользователя, а GPTBot — в соответствии с вашей политикой использования данных для обучения.
- Anthropic: отдельно проверяйте ClaudeBot и актуальные агенты для получения информации, указанные в документации.
- Perplexity: проверяйте PerplexityBot и загрузку по запросу пользователя по актуальной документации.
- Google: разграничивайте поисковый доступ Googlebot и настройки Google-Extended, регулирующие обучение генеративных моделей и подкрепление ответов источниками.
Как провести воспроизводимую проверку доступа краулеров?
- Выберите пять типовых URL, включая одну страницу глубоко в структуре сайта, на которую нет ссылки с главной.
- Загрузите robots.txt и запишите правило, применяемое к каждому User-Agent.
- Запросите каждый URL с официальной строкой User-Agent и зафиксируйте статус, конечный URL, тип содержимого, размер ответа и время отклика.
- Проверьте, есть ли в полученном HTML canonical, H1, прямой ответ, основные ссылки и JSON-LD.
- Сравните ответ для бота с обычным браузерным ответом и выясните причины существенных различий.
- Проверьте журналы пограничной инфраструктуры и исходного сервера: ищите проверки на бота, ограничения частоты запросов и повторяющиеся неудачные запросы.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.htmlКак выяснить причину неудачного запроса краулера?
| Результат запроса | Вероятная причина | Что проверить дальше |
|---|---|---|
| 403 или страница проверки | Правило CDN, WAF или системы управления ботами | Найдите соответствующее событие на пограничном уровне и идентификатор сработавшего правила |
| 429 | Общий лимит частоты запросов для автоматизированного трафика | Проверьте отдельные лимиты для ботов и рекомендации по повторным запросам |
| 200 с очень небольшим HTML | Рендеринг только на клиенте или блокировка запроса данных | Посмотрите исходный HTML и серверные журналы |
| Перенаправление на вход или выбор локали | Правило промежуточного обработчика или геолокации | Проверьте влияние cookie и Accept-Language, а также работу canonical |
| Нужная страница без структурированных данных | Структурированные данные добавляются только в браузере | Перенесите критически важную разметку в HTML, формируемый сервером |
Как подтвердить, что проблема с доступом устранена?
Исправление считается подтверждённым, только если затронутый User-Agent получает каноническую страницу со статусом 200 и тем же содержательным ответом, который видит посетитель. Сохраните команду, временную метку, заголовки и хеш или фрагмент тела ответа. Затем подтвердите реальное посещение по серверным журналам: тестовый запрос доказывает возможность доступа, а журналы — факт обхода.
- Повторно проверьте все затронутые шаблоны, а не только главную страницу.
- Убедитесь, что robots.txt и ссылки на файлы Sitemap остаются согласованными.
- Проверьте, не отдаётся ли из кеша устаревший ответ с блокировкой.
- Добавьте аудит в проверки перед выпуском после изменений CDN, межсетевого экрана или рендеринга.
Пошагово
- 1Выберите типовые страницы
Отберите важные URL для каждого шаблона и включите хотя бы одну страницу глубоко в структуре сайта.
- 2Изучите применимые правила robots.txt
Отдельно проверьте правила для каждого официального User-Agent ИИ-сервиса, включая правила с подстановочными знаками.
- 3Получите и сравните ответы
Зафиксируйте перенаправления, статус, заголовки, размер тела ответа, видимое содержимое и структурированные данные.
- 4Найдите источник блокировки
По журналам пограничной инфраструктуры и исходного сервера определите конкретное правило или зависимость рендеринга.
- 5Повторите проверку и настройте мониторинг
Убедитесь, что ответ исправлен, и регулярно отслеживайте реальные посещения краулеров.
Часто задаваемые вопросы
- Открывает ли разрешение для GPTBot доступ и для ChatGPT Search?
- Не обязательно. В документации OpenAI указаны отдельные агенты для обучения, обнаружения страниц в поиске и загрузки по запросу пользователя. Проверяйте и настраивайте каждого актуального официального агента в соответствии с тем доступом, который хотите предоставить.
- Почему ИИ-краулер получает 403, хотя robots.txt разрешает доступ?
- robots.txt задаёт правила обхода, но не позволяет обойти CDN, межсетевой экран, аутентификацию или проверку на бота. Изучите событие на пограничном уровне и журналы исходного сервера, чтобы определить, на каком уровне возник отказ.
- Достаточно ли ответа со статусом 200?
- Нет. Ответ 200 может содержать страницу проверки, пустую оболочку приложения, soft 404 или неполную локализованную страницу. Проверьте, есть ли в полученном HTML сам ответ, canonical, ссылки и структурированные данные.
- Как часто нужно проверять доступ краулеров?
- Повторяйте проверку после изменений хостинга, правил CDN, рендеринга, перенаправлений, аутентификации или robots.txt. Для стабильных сайтов ежемесячная плановая проверка вместе с мониторингом журналов позволяет выявить большинство повторных проблем.
- Нужно ли разрешать доступ всем ИИ-краулерам?
- Это зависит от вашей политики. Разграничьте загрузку по запросу пользователя, обнаружение страниц в поиске и обучение моделей. Затем осознанно разрешайте или запрещайте доступ каждому агенту из документации, а не применяйте одно общее правило ко всем.
Sources
Проверьте ваш сайт на видимость в ИИ-поиске
Запустите бесплатный GEO и AEO скан и получите сгенерированные для вашего домена llms.txt, robots.txt, схемы и исправления контента.
Запустить бесплатный скан