Skip to main content

چطور دسترسی خزنده‌های هوش مصنوعی را بررسی کنیم؟

بررسی کنید آیا GPTBot، OAI-SearchBot، ClaudeBot و PerplexityBot می‌توانند سایت شما را دریافت کنند؛ علت مسدودشدن را پیدا کنید و هر اصلاح را با روشی ایمن تأیید کنید.

پاسخ سریع

برای بررسی دسترسی خزنده‌های هوش مصنوعی، ابتدا robots.txt را بررسی کنید، سپس URLهای مهم را با هر یوزر ایجنت رسمی آزمایش کنید، وضعیت پاسخ و HTML دریافتی را با پاسخ یک درخواست عادی مرورگر مقایسه کنید و لاگ‌های CDN یا فایروال را برای یافتن موارد مسدودشدن مرور کنید. اگر سرور چالش امنیتی، خطای 403، پوسته‌ای خالی یا محتوایی متفاوت برگرداند، وجود دستور Allow در robots.txt کافی نیست.

12 دقیقه مطالعهبه‌روزرسانی شده: 2026-09-22

نکات کلیدی

  • خزنده‌های بازیابی محتوا را جدا از خزنده‌های آموزش مدل آزمایش کنید؛ نقش و سازوکارهای کنترل آن‌ها متفاوت است.
  • بدنه پاسخ نهایی را بررسی کنید، نه فقط robots.txt یا کد وضعیت HTTP را.
  • نمونه‌هایی از انواع صفحات را بررسی کنید: صفحه اصلی، مقاله، محصول، مستندات و یک URL در عمق ساختار سایت.
  • پیش از بازنویسی محتوا، قواعد CDN و فایروال را اصلاح کنید؛ صفحات غیرقابل‌دسترسی نمی‌توانند در پاسخ‌ها ارجاع بگیرند.
  • پس از هر استقرار، بررسی‌ها را تکرار کنید و لاگ‌های سرور را برای شناسایی بازدیدهای واقعی خزنده‌ها زیر نظر بگیرید.

در بررسی دسترسی خزنده‌های هوش مصنوعی چه چیزهایی باید آزمایش شوند؟

یک بررسی کامل، 4 لایه را به‌ترتیب ارزیابی می‌کند: مجوز اعلام‌شده در robots.txt، دسترسی شبکه از مسیر CDN یا فایروال، پاسخ نهایی HTTP پس از تغییرمسیرها و HTML مفیدی که بدون اجرای JavaScript در مرورگر در دسترس است. موفقیت در یک لایه به این معنا نیست که لایه بعدی هم درست کار می‌کند.

لایهشرط موفقیتمشکل رایج
robots.txtدسترسی یوزر ایجنت مربوطه ممنوع نشده باشدیک قاعده با نویسه عام، مجوز موردنظر را بی‌اثر می‌کند
لبه شبکهربات مانند بازدیدکننده به همان سرور مبدأ دسترسی داشته باشدسامانه مقابله با ربات، پاسخ 403، 429 یا چالش امنیتی برمی‌گرداند
HTTPپس از تغییرمسیرهای منطقی، یک پاسخ 200 برای صفحه کانونیکال دریافت شودحلقه تغییرمسیر، خطای 404 نرم یا گیرکردن در انتخاب زبان و منطقه
محتوای رندرشدهعنوان، پاسخ، لینک‌ها و داده‌های ساختاریافته در HTML اولیه موجود باشندپوسته خالی برنامه برای نمایش محتوا به JavaScript سمت کاربر وابسته است

کدام خزنده‌ها باید جداگانه بررسی شوند؟

همه یوزر ایجنت‌های هوش مصنوعی را یکسان در نظر نگیرید. بازیابی محتوا برای جستجو، دریافت محتوا به درخواست کاربر و آموزش مدل ممکن است از خزنده‌ها و سازوکارهای کنترل متفاوتی استفاده کنند. ابتدا سیاست خود را بر اساس کاربرد تعیین کنید، سپس دقیقاً همان شناسه رسمی یوزر ایجنت را آزمایش کنید که هر ارائه‌دهنده در مستندات خود معرفی کرده است.

  • OpenAI: برای کشف محتوا در جستجو، OAI-SearchBot را آزمایش کنید؛ برای بازیابی به درخواست کاربر، ChatGPT-User را بررسی کنید؛ و GPTBot را مطابق سیاست خود درباره آموزش مدل ارزیابی کنید.
  • Anthropic: دسترسی ClaudeBot و هر عامل بازیابی دیگری را که در مستندات فعلی معرفی شده است، جداگانه بررسی کنید.
  • Perplexity: دسترسی PerplexityBot و بازیابی به درخواست کاربر را مطابق مستندات فعلی آزمایش کنید.
  • Google: دسترسی Googlebot برای جستجو را از کنترل‌های Google-Extended برای آموزش مدل‌های مولد و متکی‌کردن پاسخ‌ها به منابع تفکیک کنید.
نام خزنده‌ها و سیاست‌های آن‌ها تغییر می‌کند. مستندات به‌روز هر ارائه‌دهنده را مرجع قرار دهید و تاریخ بررسی را در یادداشت‌های خود ثبت کنید.

چطور آزمایشی تکرارپذیر برای خزنده‌ها اجرا کنیم؟

  1. 5 URL نماینده انتخاب کنید؛ یکی از آن‌ها صفحه‌ای در عمق ساختار سایت باشد که از صفحه اصلی به آن لینک داده نشده است.
  2. فایل robots.txt را دریافت کنید و قاعده‌ای را که برای هر یوزر ایجنت اعمال می‌شود، ثبت کنید.
  3. هر URL را با رشته رسمی یوزر ایجنت درخواست کنید و کد وضعیت، URL نهایی، نوع محتوا، حجم پاسخ و زمان پاسخ را ثبت کنید.
  4. در HTML دریافتی، تگ کانونیکال، H1، پاسخ مستقیم، لینک‌های اصلی و JSON-LD را بررسی کنید.
  5. پاسخ دریافتی ربات را با پاسخ یک مرورگر عادی مقایسه کنید و تفاوت‌های معنادار را پیگیری کنید.
  6. لاگ‌های لبه شبکه و سرور مبدأ را برای یافتن چالش‌های امنیتی، محدودیت نرخ درخواست و درخواست‌های ناموفق تکرارشونده بررسی کنید.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.html

چطور علت ناموفق‌بودن درخواست خزنده را پیدا کنیم؟

نتیجه مشاهده‌شدهعلت احتمالیبررسی بعدی
پاسخ 403 یا صفحه چالش امنیتیقاعده‌ای در CDN، WAF یا سامانه مدیریت ربات‌هارویداد متناظر در لبه شبکه و شناسه قاعده را بررسی کنید
429محدودیت نرخ درخواست که بین ترافیک‌های خودکار مشترک استمحدودیت‌های اختصاصی ربات‌ها و راهنمای تلاش مجدد را مرور کنید
پاسخ 200 با HTML بسیار کم‌حجمرندر صرفاً در سمت کاربر یا مسدودشدن درخواست دادهکد منبع اولیه صفحه و لاگ‌های سرور را بررسی کنید
تغییرمسیر به صفحه ورود یا انتخاب زبان و منطقهمیان‌افزار یا قاعده مبتنی بر موقعیت جغرافیاییکوکی‌ها، Accept-Language و رفتار کانونیکال را آزمایش کنید
صفحه درست، اما بدون اسکیماداده‌های ساختاریافته فقط در مرورگر اضافه می‌شوندنشانه‌گذاری‌های ضروری را به HTML رندرشده در سرور منتقل کنید

چه چیزی نشان می‌دهد مشکل دسترسی واقعاً برطرف شده است؟

اصلاح فقط زمانی تأیید می‌شود که یوزر ایجنت دچار مشکل، صفحه کانونیکال را با وضعیت 200 و همان پاسخ محتوایی دریافت کند که بازدیدکننده می‌بیند. دستور اجراشده، زمان دقیق، هدرها و یک هش یا گزیده‌ای از بدنه پاسخ را ذخیره کنید. سپس وقوع یک بازدید واقعی را در لاگ‌های سرور تأیید کنید؛ آزمایش شبیه‌سازی‌شده نشان می‌دهد دسترسی ممکن است، اما لاگ‌ها ثابت می‌کنند خزش واقعاً انجام شده است.

  • همه قالب‌های تحت‌تأثیر را دوباره آزمایش کنید، نه فقط صفحه اصلی را.
  • مطمئن شوید ارجاع‌های robots.txt و نقشه سایت همچنان با هم سازگارند.
  • بررسی کنید کش، پاسخ مسدودشده قدیمی را ارائه نکند.
  • این بررسی را به چک‌لیست انتشار پس از تغییرات CDN، فایروال یا رندر اضافه کنید.

گام به گام

  1. 1
    صفحات نماینده را انتخاب کنید

    از هر قالب، URLهای مهم را انتخاب کنید و دست‌کم 1 صفحه در عمق ساختار سایت را هم در نظر بگیرید.

  2. 2
    قواعد مرتبط robots.txt را بخوانید

    قواعد هر یوزر ایجنت رسمی هوش مصنوعی را مستقل از بقیه بررسی کنید؛ قواعد دارای نویسه عام را هم لحاظ کنید.

  3. 3
    پاسخ‌ها را دریافت و مقایسه کنید

    تغییرمسیرها، کد وضعیت، هدرها، حجم بدنه، محتوای قابل‌مشاهده و داده‌های ساختاریافته را ثبت کنید.

  4. 4
    منشأ هر مورد مسدودشدن را پیدا کنید

    با استفاده از لاگ‌های لبه شبکه و سرور مبدأ، دقیقاً مشخص کنید کدام قاعده یا وابستگی در فرایند رندر عامل مشکل است.

  5. 5
    دوباره آزمایش کنید و زیر نظر بگیرید

    پاسخ اصلاح‌شده را تأیید کنید و در طول زمان، بازدیدهای واقعی خزنده‌ها را زیر نظر بگیرید.

سوالات متداول

آیا اجازه دسترسی به GPTBot به معنای اجازه دسترسی به ChatGPT Search هم هست؟
لزوماً نه. OpenAI برای آموزش مدل، کشف محتوا در جستجو و بازیابی به درخواست کاربر، عامل‌های جداگانه‌ای معرفی کرده است. هر عامل رسمی فعلی را متناسب با دسترسی‌ای که می‌خواهید بدهید، بررسی و پیکربندی کنید.
چرا خزنده هوش مصنوعی با وجود مجوز در robots.txt، خطای 403 می‌گیرد؟
فایل robots.txt ترجیح شما درباره خزش را اعلام می‌کند، اما CDN، فایروال، لایه احراز هویت یا چالش امنیتی ربات‌ها را دور نمی‌زند. رویداد لبه شبکه و لاگ‌های سرور مبدأ را بررسی کنید تا مشخص شود کدام لایه دسترسی را رد کرده است.
آیا دریافت پاسخ 200 کافی است؟
نه. پاسخ 200 ممکن است حاوی صفحه چالش امنیتی، پوسته خالی برنامه، خطای 404 نرم یا نسخه بومی‌سازی‌شده ناقص صفحه باشد. HTML دریافتی را از نظر وجود پاسخ واقعی، تگ کانونیکال، لینک‌ها و داده‌های ساختاریافته بررسی کنید.
دسترسی خزنده‌ها را هر چند وقت یک‌بار باید بررسی کرد؟
پس از تغییر در میزبانی، قواعد CDN، رندر، تغییرمسیرها، احراز هویت یا robots.txt، آزمایش را تکرار کنید. برای سایت‌هایی که تغییرات زیادی ندارند، بررسی زمان‌بندی‌شده ماهانه همراه با پایش لاگ‌ها، بیشتر مشکلاتی را که دوباره ایجاد می‌شوند آشکار می‌کند.
آیا باید به همه خزنده‌های هوش مصنوعی اجازه دسترسی داد؟
این تصمیم به سیاست شما بستگی دارد. بازیابی به درخواست کاربر و کشف محتوا در جستجو را از آموزش مدل جدا کنید؛ سپس به‌جای اعمال یک قاعده کلی، آگاهانه برای هر عامل معرفی‌شده در مستندات، مجوز یا محدودیت دسترسی تعیین کنید.

Sources

  1. [1]مستندات خزنده‌های OpenAI
  2. [2]مستندات robots.txt در Google
  3. [3]مستندات خزنده‌های Anthropic

سایت خود را برای نمایش در هوش مصنوعی اسکن کنید

یک اسکن رایگان GEO و AEO اجرا کنید و فایل‌های llms.txt، robots.txt، طرح‌واره و اصلاحات محتوای مورد نیاز برای دامنه خود را دریافت نمایید.

اسکن رایگان را شروع کنید