Skip to main content

Как проверить доступ ИИ-краулеров к сайту

Проверьте, могут ли GPTBot, OAI-SearchBot, ClaudeBot и PerplexityBot загружать страницы сайта. Найдите причины блокировок и безопасно проверьте исправления.

Краткий ответ

Чтобы проверить доступ ИИ-краулеров, изучите robots.txt, запросите важные URL с каждым официальным User-Agent, сравните статус ответа и HTML с обычным браузерным запросом и проверьте журналы CDN или межсетевого экрана на наличие блокировок. Правила Allow в robots.txt недостаточно, если сервер возвращает проверку на бота, 403, пустую оболочку приложения или другой контент.

12 мин чтенияОбновлено: 2026-09-22

Ключевые выводы

  • Проверяйте краулеры для поиска и получения информации отдельно от краулеров для обучения моделей: у них разные задачи и механизмы управления доступом.
  • Проверяйте тело итогового ответа, а не только robots.txt или HTTP-статус.
  • Включите в аудит типовые страницы: главную, статью, карточку товара, документацию и страницу глубоко в структуре сайта.
  • Исправьте правила CDN и межсетевого экрана, прежде чем переписывать контент: недоступные страницы не смогут стать источниками цитирования.
  • Повторяйте проверки после развёртывания обновлений и отслеживайте реальные посещения краулеров в серверных журналах.

Что нужно проверять при аудите доступа ИИ-краулеров?

Полный аудит доступа последовательно проверяет четыре уровня: разрешения в robots.txt, сетевой доступ через CDN или межсетевой экран, итоговый HTTP-ответ после перенаправлений и содержательный HTML, доступный без выполнения JavaScript в браузере. Успешная проверка одного уровня не гарантирует, что следующий работает корректно.

УровеньУсловие успешной проверкиТипичная проблема
robots.txtДля нужного User-Agent нет запрета на обходПравило с подстановочным знаком перекрывает запланированное разрешение
Пограничная инфраструктураБоту доступен тот же исходный сервер, что и посетителюЗащита от ботов возвращает 403, 429 или страницу проверки
HTTPПосле корректных перенаправлений возвращается одна каноническая страница со статусом 200Цикл перенаправлений, soft 404 или зацикливание на выборе локали
Содержимое страницыЗаголовок, ответ, ссылки и структурированные данные есть в исходном HTMLПустая оболочка приложения требует выполнения клиентского JavaScript

Каких краулеров нужно проверять отдельно?

Не считайте все User-Agent ИИ-сервисов взаимозаменяемыми. Для поискового сбора информации, загрузки по запросу пользователя и обучения моделей могут использоваться разные краулеры и механизмы управления доступом. Сначала определите политику для каждой задачи, затем проверяйте точный официальный идентификатор User-Agent из документации провайдера.

  • OpenAI: проверяйте OAI-SearchBot для обнаружения страниц в поиске, ChatGPT-User для загрузки по запросу пользователя, а GPTBot — в соответствии с вашей политикой использования данных для обучения.
  • Anthropic: отдельно проверяйте ClaudeBot и актуальные агенты для получения информации, указанные в документации.
  • Perplexity: проверяйте PerplexityBot и загрузку по запросу пользователя по актуальной документации.
  • Google: разграничивайте поисковый доступ Googlebot и настройки Google-Extended, регулирующие обучение генеративных моделей и подкрепление ответов источниками.
Названия краулеров и правила их работы меняются. Опирайтесь на актуальную документацию каждого провайдера и указывайте дату в записях аудита.

Как провести воспроизводимую проверку доступа краулеров?

  1. Выберите пять типовых URL, включая одну страницу глубоко в структуре сайта, на которую нет ссылки с главной.
  2. Загрузите robots.txt и запишите правило, применяемое к каждому User-Agent.
  3. Запросите каждый URL с официальной строкой User-Agent и зафиксируйте статус, конечный URL, тип содержимого, размер ответа и время отклика.
  4. Проверьте, есть ли в полученном HTML canonical, H1, прямой ответ, основные ссылки и JSON-LD.
  5. Сравните ответ для бота с обычным браузерным ответом и выясните причины существенных различий.
  6. Проверьте журналы пограничной инфраструктуры и исходного сервера: ищите проверки на бота, ограничения частоты запросов и повторяющиеся неудачные запросы.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.html

Как выяснить причину неудачного запроса краулера?

Результат запросаВероятная причинаЧто проверить дальше
403 или страница проверкиПравило CDN, WAF или системы управления ботамиНайдите соответствующее событие на пограничном уровне и идентификатор сработавшего правила
429Общий лимит частоты запросов для автоматизированного трафикаПроверьте отдельные лимиты для ботов и рекомендации по повторным запросам
200 с очень небольшим HTMLРендеринг только на клиенте или блокировка запроса данныхПосмотрите исходный HTML и серверные журналы
Перенаправление на вход или выбор локалиПравило промежуточного обработчика или геолокацииПроверьте влияние cookie и Accept-Language, а также работу canonical
Нужная страница без структурированных данныхСтруктурированные данные добавляются только в браузереПеренесите критически важную разметку в HTML, формируемый сервером

Как подтвердить, что проблема с доступом устранена?

Исправление считается подтверждённым, только если затронутый User-Agent получает каноническую страницу со статусом 200 и тем же содержательным ответом, который видит посетитель. Сохраните команду, временную метку, заголовки и хеш или фрагмент тела ответа. Затем подтвердите реальное посещение по серверным журналам: тестовый запрос доказывает возможность доступа, а журналы — факт обхода.

  • Повторно проверьте все затронутые шаблоны, а не только главную страницу.
  • Убедитесь, что robots.txt и ссылки на файлы Sitemap остаются согласованными.
  • Проверьте, не отдаётся ли из кеша устаревший ответ с блокировкой.
  • Добавьте аудит в проверки перед выпуском после изменений CDN, межсетевого экрана или рендеринга.

Пошагово

  1. 1
    Выберите типовые страницы

    Отберите важные URL для каждого шаблона и включите хотя бы одну страницу глубоко в структуре сайта.

  2. 2
    Изучите применимые правила robots.txt

    Отдельно проверьте правила для каждого официального User-Agent ИИ-сервиса, включая правила с подстановочными знаками.

  3. 3
    Получите и сравните ответы

    Зафиксируйте перенаправления, статус, заголовки, размер тела ответа, видимое содержимое и структурированные данные.

  4. 4
    Найдите источник блокировки

    По журналам пограничной инфраструктуры и исходного сервера определите конкретное правило или зависимость рендеринга.

  5. 5
    Повторите проверку и настройте мониторинг

    Убедитесь, что ответ исправлен, и регулярно отслеживайте реальные посещения краулеров.

Часто задаваемые вопросы

Открывает ли разрешение для GPTBot доступ и для ChatGPT Search?
Не обязательно. В документации OpenAI указаны отдельные агенты для обучения, обнаружения страниц в поиске и загрузки по запросу пользователя. Проверяйте и настраивайте каждого актуального официального агента в соответствии с тем доступом, который хотите предоставить.
Почему ИИ-краулер получает 403, хотя robots.txt разрешает доступ?
robots.txt задаёт правила обхода, но не позволяет обойти CDN, межсетевой экран, аутентификацию или проверку на бота. Изучите событие на пограничном уровне и журналы исходного сервера, чтобы определить, на каком уровне возник отказ.
Достаточно ли ответа со статусом 200?
Нет. Ответ 200 может содержать страницу проверки, пустую оболочку приложения, soft 404 или неполную локализованную страницу. Проверьте, есть ли в полученном HTML сам ответ, canonical, ссылки и структурированные данные.
Как часто нужно проверять доступ краулеров?
Повторяйте проверку после изменений хостинга, правил CDN, рендеринга, перенаправлений, аутентификации или robots.txt. Для стабильных сайтов ежемесячная плановая проверка вместе с мониторингом журналов позволяет выявить большинство повторных проблем.
Нужно ли разрешать доступ всем ИИ-краулерам?
Это зависит от вашей политики. Разграничьте загрузку по запросу пользователя, обнаружение страниц в поиске и обучение моделей. Затем осознанно разрешайте или запрещайте доступ каждому агенту из документации, а не применяйте одно общее правило ко всем.

Sources

  1. [1]Документация OpenAI по краулерам
  2. [2]Документация Google по robots.txt
  3. [3]Документация Anthropic по краулерам

Проверьте ваш сайт на видимость в ИИ-поиске

Запустите бесплатный GEO и AEO скан и получите сгенерированные для вашего домена llms.txt, robots.txt, схемы и исправления контента.

Запустить бесплатный скан