كيفية تدقيق وصول زواحف الذكاء الاصطناعي إلى موقعك
اختبر قدرة GPTBot وOAI-SearchBot وClaudeBot وPerplexityBot على جلب صفحات موقعك، وشخّص أسباب الحظر، وتحقّق من كل إصلاح بأمان.
إجابة سريعة
لتدقيق وصول زواحف الذكاء الاصطناعي، افحص robots.txt، واختبر كل وكيل مستخدم رسمي على عناوين URL المهمة، وقارن رمز الحالة ومحتوى HTML المستلَمين باستجابة طلب من متصفح عادي، ثم راجع سجلات شبكة توصيل المحتوى أو جدار الحماية لرصد حالات الحظر. لا تكفي قاعدة Allow في robots.txt إذا كان الخادم يعيد اختبار تحقق، أو رمز 403، أو هيكل صفحة فارغًا، أو محتوى مختلفًا.
نقاط رئيسية
- اختبر زواحف استرجاع المحتوى بمعزل عن زواحف التدريب، فلكل منها وظائف وضوابط مختلفة.
- تحقّق من محتوى الاستجابة النهائية، لا من robots.txt أو رمز حالة HTTP وحدهما.
- دقّق عينة تمثّل أنواع الصفحات: الصفحة الرئيسية، ومقالًا، وصفحة منتج، وصفحة توثيق، وعنوان URL لصفحة داخلية عميقة.
- أصلح قواعد شبكة توصيل المحتوى وجدار الحماية قبل إعادة صياغة المحتوى؛ فالصفحات التي يتعذّر الوصول إليها لا يمكن الاستشهاد بها.
- كرّر الفحوص بعد نشر التحديثات، وراقب سجلات الخادم لرصد زيارات الزواحف الفعلية.
ما الذي ينبغي اختباره عند تدقيق وصول زواحف الذكاء الاصطناعي؟
يفحص التدقيق الشامل للوصول أربع طبقات بالترتيب: الإذن المعلَن في robots.txt، والوصول عبر شبكة توصيل المحتوى أو جدار الحماية، واستجابة HTTP النهائية بعد عمليات إعادة التوجيه، ومحتوى HTML المفيد المتاح دون تشغيل JavaScript في المتصفح. اجتياز إحدى الطبقات لا يثبت أن الطبقة التالية تعمل كما ينبغي.
| الطبقة | شرط الاجتياز | خلل شائع |
|---|---|---|
| robots.txt | عدم منع وكيل المستخدم المعني من الزحف | قاعدة تستخدم حرف البدل تتغلب على قاعدة السماح المقصودة |
| حافة الشبكة | وصول الزاحف إلى الخادم الأصلي نفسه المتاح للزائر | نظام الحماية من الروبوتات يعيد 403 أو 429 أو اختبار تحقق |
| HTTP | الوصول إلى استجابة 200 واحدة للعنوان الأساسي بعد عمليات إعادة توجيه منطقية | حلقة إعادة توجيه، أو خطأ 404 غير صريح، أو تعذّر تجاوز اختيار اللغة والمنطقة |
| المحتوى المعروض | وجود العنوان والإجابة والروابط والبيانات المنظّمة في HTML الأولي | هيكل تطبيق فارغ يعتمد على JavaScript في جانب العميل |
ما الزواحف التي تحتاج إلى فحوص منفصلة؟
لا تتعامل مع جميع وكلاء مستخدم الذكاء الاصطناعي على أنهم يؤدون الدور نفسه. فقد تستخدم عمليات استرجاع المحتوى للبحث، والجلب بطلب من المستخدم، وتدريب النماذج زواحف وضوابط مختلفة. حدّد سياستك بحسب الغرض، ثم اختبر معرّف وكيل المستخدم الرسمي كما ورد حرفيًا في وثائق كل مزوّد.
- OpenAI: اختبر OAI-SearchBot لاكتشاف المحتوى في البحث، وChatGPT-User لاسترجاع المحتوى بطلب من المستخدم، وGPTBot وفق سياستك الخاصة بالتدريب.
- Anthropic: راجع ClaudeBot وأي وكلاء لاسترجاع المحتوى واردين في الوثائق الحالية، كلًّا على حدة.
- Perplexity: اختبر PerplexityBot واسترجاع المحتوى بطلب من المستخدم وفق الوثائق الحالية.
- Google: ميّز بين وصول Googlebot لأغراض البحث وضوابط Google-Extended الخاصة بتدريب النماذج التوليدية وإسناد إجاباتها إلى مصادر.
كيف تجري اختبارًا لوصول الزواحف يمكن تكراره؟
- اختر خمسة عناوين URL تمثّل صفحات الموقع، من بينها صفحة داخلية عميقة لا ترتبط بها الصفحة الرئيسية.
- اجلب robots.txt وسجّل القاعدة المنطبقة على كل وكيل مستخدم.
- اطلب كل عنوان URL باستخدام سلسلة وكيل المستخدم الرسمية، وسجّل رمز الحالة والعنوان النهائي ونوع المحتوى وحجم الاستجابة وزمنها.
- افحص HTML المستلَم للتحقّق من وسم canonical وعنوان H1 والإجابة المباشرة والروابط الرئيسية وJSON-LD.
- قارن استجابة الزاحف باستجابة المتصفح العادي، واستقصِ الفروق المؤثرة.
- راجع سجلات حافة الشبكة والخادم الأصلي لرصد اختبارات التحقق وحدود معدّل الطلبات والطلبات الفاشلة المتكررة.
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.htmlكيف تشخّص أسباب فشل طلب الزاحف؟
| النتيجة المرصودة | السبب المرجّح | الفحص التالي |
|---|---|---|
| 403 أو صفحة اختبار تحقق | قاعدة في شبكة توصيل المحتوى أو جدار حماية تطبيقات الويب أو نظام إدارة الروبوتات | افحص الحدث المطابق في سجلات حافة الشبكة ومعرّف القاعدة |
| 429 | حدّ لمعدّل الطلبات تشترك فيه حركة المرور الآلية | راجع الحدود الخاصة بالزواحف وإرشادات إعادة المحاولة |
| 200 مع محتوى HTML ضئيل جدًا | عرض المحتوى في جانب العميل فقط أو حظر طلب بيانات | افحص المصدر الأولي وسجلات الخادم |
| إعادة توجيه إلى تسجيل الدخول أو اختيار اللغة والمنطقة | برمجية وسيطة أو قاعدة تعتمد على الموقع الجغرافي | اختبر ملفات تعريف الارتباط وAccept-Language وسلوك تحديد العنوان الأساسي |
| الصفحة صحيحة لكن ترميز البيانات المنظّمة غائب | إضافة البيانات المنظّمة داخل المتصفح فقط | انقل الترميز الضروري إلى HTML المُنشأ على الخادم |
ما الذي يثبت نجاح إصلاح مشكلة الوصول؟
لا يُعدّ الإصلاح مؤكّدًا إلا عندما يتلقّى وكيل المستخدم المتأثر صفحة العنوان الأساسي برمز 200، وتتضمن الإجابة الجوهرية نفسها التي يراها الزائر. احفظ الأمر والطابع الزمني والترويسات وبصمة تجزئة لمحتوى الاستجابة أو مقتطفًا منه. ثم تأكّد من تسجيل زيارة فعلية في سجلات الخادم؛ فالاختبار المحاكى يثبت إمكانية الوصول، أما السجلات فتثبت حدوث الزحف فعلًا.
- أعد اختبار كل قالب متأثر، لا الصفحة الرئيسية وحدها.
- تأكّد من بقاء robots.txt وإشارات خرائط الموقع متّسقة.
- تحقّق من أن التخزين المؤقت لا يقدّم استجابة حظر قديمة.
- أدرج التدقيق ضمن فحوص الإصدارات بعد أي تغييرات في شبكة توصيل المحتوى أو جدار الحماية أو آلية عرض المحتوى.
خطوة بخطوة
- 1اختر صفحات تمثّل الموقع
حدّد عناوين URL مهمة من كل قالب، وأدرج صفحة داخلية عميقة واحدة على الأقل.
- 2راجع قواعد robots المنطبقة
قيّم كل وكيل مستخدم رسمي للذكاء الاصطناعي على حدة، بما في ذلك القواعد التي تستخدم حرف البدل.
- 3اجلب الاستجابات وقارن بينها
سجّل عمليات إعادة التوجيه ورمز الحالة والترويسات وحجم محتوى الاستجابة والمحتوى الظاهر والبيانات المنظّمة.
- 4تتبّع مصدر أي حظر
استخدم سجلات حافة الشبكة والخادم الأصلي لتحديد القاعدة المسؤولة بدقة أو الاعتماد البرمجي الذي يتوقف عليه عرض المحتوى.
- 5أعد الاختبار وراقب
تحقّق من صحة الاستجابة بعد الإصلاح، وراقب زيارات الزواحف الفعلية بمرور الوقت.
الأسئلة الشائعة
- هل السماح لـGPTBot يعني السماح أيضًا لـChatGPT Search؟
- ليس بالضرورة. توثّق OpenAI وكلاء منفصلين للتدريب واكتشاف المحتوى في البحث واسترجاعه بطلب من المستخدم. دقّق كل وكيل رسمي معتمد حاليًا واضبط إعداداته بحسب صلاحيات الوصول التي تريد منحها.
- لماذا يتلقّى زاحف الذكاء الاصطناعي رمز 403 رغم أن robots.txt يسمح له بالوصول؟
- يعلن robots.txt تفضيلات الزحف، لكنه لا يتجاوز شبكة توصيل المحتوى أو جدار الحماية أو طبقة المصادقة أو اختبارات التحقق من الروبوتات. افحص الحدث في سجلات حافة الشبكة وسجلات الخادم الأصلي لتحديد الطبقة التي رفضت الطلب.
- هل تكفي استجابة برمز 200؟
- لا. قد تتضمن استجابة 200 صفحة اختبار تحقق، أو هيكل تطبيق فارغًا، أو خطأ 404 غير صريح، أو صفحة غير مكتملة للغة أو منطقة معيّنة. افحص HTML المستلَم للتحقّق من وجود الإجابة الفعلية ووسم canonical والروابط والبيانات المنظّمة.
- كم مرة ينبغي تدقيق وصول الزواحف؟
- أعد الاختبار بعد أي تغييرات في الاستضافة أو قواعد شبكة توصيل المحتوى أو آلية عرض المحتوى أو إعادة التوجيه أو المصادقة أو robots.txt. أما المواقع المستقرة، فيكفيها عادةً فحص شهري مجدول مع مراقبة السجلات لاكتشاف معظم حالات التراجع.
- هل ينبغي السماح لجميع زواحف الذكاء الاصطناعي؟
- هذا قرار تحدّده سياستك. افصل بين استرجاع المحتوى بطلب من المستخدم واكتشافه في البحث من جهة، وتدريب النماذج من جهة أخرى، ثم اسمح لكل وكيل موثّق أو احظره عن قصد، بدلًا من تطبيق قاعدة واحدة على الجميع.
Sources
افحص موقعك لمدى ظهور الذكاء الاصطناعي
احصل على فحص مجاني لتحسين الظهور في محركات البحث التوليدية (GEO) ومحركات البحث التي تقدم إجابات (AEO) مع إصلاحات لملفات llms.txt وrobots.txt والمخطط والمحتوى، مُعدّة خصيصًا لموقعك.
ابدأ فحصًا مجانيًا