AI क्रॉलर की पहुँच का ऑडिट कैसे करें
जाँचें कि GPTBot, OAI-SearchBot, ClaudeBot और PerplexityBot आपकी साइट से पेज फ़ेच कर सकते हैं या नहीं, रुकावटों की वजह पहचानें और हर सुधार को सुरक्षित तरीके से सत्यापित करें।
त्वरित जवाब
AI क्रॉलर की पहुँच का ऑडिट करने के लिए robots.txt जाँचें, हर आधिकारिक यूज़र एजेंट से महत्वपूर्ण URLs फ़ेच करके देखें, मिले स्टेटस और HTML की तुलना सामान्य ब्राउज़र अनुरोध से करें, और ब्लॉक किए गए अनुरोधों के लिए CDN या फ़ायरवॉल लॉग देखें। अगर सर्वर चैलेंज, 403, ऐप का खाली ढाँचा या अलग कॉन्टेंट भेज रहा है, तो robots.txt में Allow नियम होना पर्याप्त नहीं है।
मुख्य बातें
- जानकारी खोजने और फ़ेच करने वाले क्रॉलर की जाँच ट्रेनिंग क्रॉलर से अलग करें, क्योंकि उनकी भूमिकाएँ और नियंत्रण अलग होते हैं।
- सिर्फ़ robots.txt या HTTP स्टेटस नहीं, अंतिम रिस्पॉन्स की बॉडी भी जाँचें।
- हर प्रमुख तरह के पेज का नमूना लेकर ऑडिट करें: होमपेज, लेख, प्रोडक्ट, डॉक्यूमेंटेशन और साइट के अंदरूनी स्तर का एक URL।
- कॉन्टेंट दोबारा लिखने से पहले CDN और फ़ायरवॉल के नियम ठीक करें; जिन पेजों तक क्रॉलर पहुँच ही नहीं सकते, उन्हें स्रोत के रूप में उद्धृत नहीं किया जा सकता।
- डिप्लॉयमेंट के बाद जाँच दोहराएँ और क्रॉलर की वास्तविक विज़िट देखने के लिए सर्वर लॉग पर नज़र रखें।
AI क्रॉलर की पहुँच के ऑडिट में क्या जाँचना चाहिए?
पहुँच के पूरे ऑडिट में क्रम से चार स्तर जाँचे जाते हैं: robots.txt में घोषित अनुमति, CDN या फ़ायरवॉल से होकर नेटवर्क पहुँच, रीडायरेक्ट के बाद मिलने वाला अंतिम HTTP रिस्पॉन्स, और ब्राउज़र में JavaScript चलाए बिना उपलब्ध उपयोगी HTML। एक स्तर पर जाँच सफल होने से यह साबित नहीं होता कि अगला स्तर भी ठीक काम कर रहा है।
| स्तर | जाँच सफल होने की शर्त | आम समस्या |
|---|---|---|
| robots.txt | संबंधित यूज़र एजेंट के लिए क्रॉल करने पर रोक न हो | वाइल्डकार्ड नियम, अनुमति देने के लिए बनाए गए नियम पर हावी हो जाता है |
| नेटवर्क एज | बॉट भी उसी ओरिजिन सर्वर तक पहुँच सके जिस तक विज़िटर पहुँचता है | बॉट सुरक्षा 403, 429 या कोई चैलेंज भेजती है |
| HTTP | उचित रीडायरेक्ट के बाद कैनॉनिकल पेज से एक अंतिम 200 रिस्पॉन्स मिले | रीडायरेक्ट लूप, सॉफ़्ट 404 या भाषा/क्षेत्र चयन में फँस जाना |
| रेंडर किया गया कॉन्टेंट | शुरुआती HTML में शीर्षक, उत्तर, लिंक और स्ट्रक्चर्ड डेटा मौजूद हों | ऐप का खाली ढाँचा कॉन्टेंट दिखाने के लिए क्लाइंट-साइड JavaScript पर निर्भर रहता है |
किन क्रॉलर की अलग-अलग जाँच ज़रूरी है?
सभी AI यूज़र एजेंट को एक जैसा न मानें। सर्च के लिए जानकारी जुटाने, यूज़र के अनुरोध पर पेज फ़ेच करने और मॉडल ट्रेनिंग के लिए अलग-अलग क्रॉलर और नियंत्रण हो सकते हैं। पहले उद्देश्य के आधार पर अपनी नीति तय करें, फिर हर प्रदाता के डॉक्यूमेंटेशन में दिए गए सटीक आधिकारिक यूज़र-एजेंट टोकन से जाँच करें।
- OpenAI: सर्च में पेज खोजने के लिए OAI-SearchBot, यूज़र के अनुरोध पर जानकारी फ़ेच करने के लिए ChatGPT-User, और अपनी ट्रेनिंग नीति के अनुसार GPTBot की जाँच करें।
- Anthropic: ClaudeBot और मौजूदा डॉक्यूमेंटेशन में बताए गए जानकारी फ़ेच करने वाले एजेंट की अलग-अलग समीक्षा करें।
- Perplexity: मौजूदा डॉक्यूमेंटेशन के अनुसार PerplexityBot और यूज़र के अनुरोध पर जानकारी फ़ेच करने की पहुँच जाँचें।
- Google: Googlebot की सर्च पहुँच को जनरेटिव ट्रेनिंग और ग्राउंडिंग के लिए दिए गए Google-Extended नियंत्रणों से अलग समझें।
क्रॉलर की ऐसी जाँच कैसे करें जिसे उसी तरह दोहराया जा सके?
- अलग-अलग तरह के पेजों का प्रतिनिधित्व करने वाले पाँच URLs चुनें। इनमें साइट के अंदरूनी स्तर का ऐसा पेज भी रखें जिसका लिंक होमपेज पर न हो।
- robots.txt फ़ेच करें और हर यूज़र एजेंट पर लागू होने वाला नियम दर्ज करें।
- आधिकारिक यूज़र-एजेंट स्ट्रिंग के साथ हर URL पर अनुरोध भेजें और स्टेटस, अंतिम URL, कॉन्टेंट टाइप, रिस्पॉन्स का आकार और रिस्पॉन्स मिलने में लगा समय दर्ज करें।
- मिले हुए HTML में कैनॉनिकल, H1, सीधा उत्तर, मुख्य लिंक और JSON-LD की जाँच करें।
- बॉट को मिले रिस्पॉन्स की तुलना सामान्य ब्राउज़र को मिले रिस्पॉन्स से करें और महत्वपूर्ण अंतरों की वजह पता लगाएँ।
- चैलेंज, रेट लिमिट और बार-बार विफल होने वाले अनुरोधों के लिए एज और ओरिजिन लॉग जाँचें।
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.htmlक्रॉलर का अनुरोध विफल होने की वजह कैसे पता लगाएँ?
| मिला हुआ परिणाम | संभावित वजह | अगली जाँच |
|---|---|---|
| 403 या चैलेंज पेज | CDN, WAF या बॉट-मैनेजमेंट का नियम | संबंधित एज इवेंट और नियम का ID देखें |
| 429 | ऑटोमेटेड ट्रैफ़िक पर साझा रेट लिमिट | बॉट के लिए तय सीमाएँ और दोबारा अनुरोध भेजने के दिशानिर्देश देखें |
| 200 के साथ बहुत छोटा HTML | सिर्फ़ क्लाइंट-साइड रेंडरिंग या डेटा अनुरोध ब्लॉक होना | शुरुआती सोर्स और सर्वर लॉग देखें |
| लॉगिन या भाषा/क्षेत्र चुनने वाले पेज पर रीडायरेक्ट | मिडलवेयर या जियोलोकेशन नियम | कुकीज़, Accept-Language और कैनॉनिकल के व्यवहार की जाँच करें |
| सही पेज, लेकिन स्कीमा नहीं | स्ट्रक्चर्ड डेटा सिर्फ़ ब्राउज़र में जोड़ा जा रहा है | ज़रूरी मार्कअप को सर्वर पर रेंडर किए गए HTML में शामिल करें |
कैसे साबित करें कि पहुँच की समस्या ठीक हो गई है?
सुधार तभी सत्यापित माना जाएगा जब प्रभावित यूज़र एजेंट को 200 स्टेटस वाला कैनॉनिकल पेज मिले और उसमें वही मूल उत्तर हो जो विज़िटर को दिखता है। कमांड, टाइमस्टैम्प, हेडर और बॉडी का हैश या अंश सहेजें। फिर सर्वर लॉग में वास्तविक विज़िट की पुष्टि करें; कृत्रिम जाँच यह साबित करती है कि पहुँच संभव है, जबकि लॉग यह साबित करते हैं कि क्रॉलिंग वास्तव में हुई है।
- सिर्फ़ होमपेज नहीं, हर प्रभावित टेम्पलेट की दोबारा जाँच करें।
- पुष्टि करें कि robots.txt और साइटमैप के संदर्भ अब भी एक-दूसरे के अनुरूप हैं।
- जाँचें कि कैशिंग की वजह से पुराना, ब्लॉक किया हुआ रिस्पॉन्स तो नहीं मिल रहा है।
- CDN, फ़ायरवॉल या रेंडरिंग में बदलाव के बाद होने वाली रिलीज़ जाँच में यह ऑडिट शामिल करें।
स्टेप बाय स्टेप
- 1हर तरह के पेज का प्रतिनिधि नमूना चुनें
हर टेम्पलेट से महत्वपूर्ण URLs चुनें और साइट के अंदरूनी स्तर का कम-से-कम एक पेज शामिल करें।
- 2लागू होने वाले robots नियम पढ़ें
वाइल्डकार्ड नियमों को ध्यान में रखते हुए हर आधिकारिक AI यूज़र एजेंट का अलग-अलग मूल्यांकन करें।
- 3पेज फ़ेच करें और रिस्पॉन्स की तुलना करें
रीडायरेक्ट, स्टेटस, हेडर, बॉडी का आकार, दिखाई देने वाला कॉन्टेंट और स्ट्रक्चर्ड डेटा दर्ज करें।
- 4हर रुकावट की वजह खोजें
एज और ओरिजिन लॉग से उस सटीक नियम या रेंडरिंग निर्भरता की पहचान करें जो रुकावट पैदा कर रही है।
- 5दोबारा जाँचें और निगरानी रखें
सुधार के बाद मिले रिस्पॉन्स को सत्यापित करें और आगे भी क्रॉलर की वास्तविक विज़िट पर नज़र रखें।
अक्सर पूछे जाने वाले प्रश्न
- क्या GPTBot को अनुमति देने से ChatGPT Search को भी अनुमति मिल जाती है?
- ज़रूरी नहीं। OpenAI के डॉक्यूमेंटेशन में ट्रेनिंग, सर्च में पेज खोजने और यूज़र के अनुरोध पर जानकारी फ़ेच करने के लिए अलग-अलग एजेंट दिए गए हैं। आप जितनी पहुँच देना चाहते हैं, उसके अनुसार हर मौजूदा आधिकारिक एजेंट का ऑडिट करें और उसकी सेटिंग तय करें।
- robots.txt में अनुमति होने पर भी AI क्रॉलर को 403 क्यों मिलता है?
- robots.txt क्रॉलिंग के बारे में आपकी प्राथमिकता बताती है, लेकिन वह CDN, फ़ायरवॉल, प्रमाणीकरण स्तर या बॉट चैलेंज को बायपास नहीं करती। किस स्तर ने पहुँच रोकी, यह पता लगाने के लिए एज इवेंट और ओरिजिन लॉग देखें।
- क्या 200 रिस्पॉन्स मिलना पर्याप्त है?
- नहीं। 200 रिस्पॉन्स में चैलेंज पेज, ऐप का खाली ढाँचा, सॉफ़्ट 404 या भाषा/क्षेत्र के हिसाब से बना अधूरा पेज हो सकता है। मिले हुए HTML में वास्तविक उत्तर, कैनॉनिकल, लिंक और स्ट्रक्चर्ड डेटा जाँचें।
- क्रॉलर की पहुँच का ऑडिट कितनी बार करना चाहिए?
- होस्टिंग, CDN नियमों, रेंडरिंग, रीडायरेक्ट, प्रमाणीकरण या robots.txt में बदलाव के बाद दोबारा जाँच करें। स्थिर साइटों के लिए तय समय पर मासिक जाँच और लॉग की निगरानी से पहुँच में दोबारा आने वाली ज़्यादातर समस्याएँ पकड़ में आ जाती हैं।
- क्या हर AI क्रॉलर को अनुमति देनी चाहिए?
- यह आपकी नीति पर निर्भर करता है। यूज़र के अनुरोध पर जानकारी फ़ेच करने और सर्च में पेज खोजने को मॉडल ट्रेनिंग से अलग रखें। फिर सभी पर एक ही नियम लगाने के बजाय, डॉक्यूमेंटेशन में बताए गए हर एजेंट को सोच-समझकर अनुमति दें या ब्लॉक करें।
Sources
अपनी साइट की AI विज़िबिलिटी स्कैन करें
एक मुफ्त GEO और AEO स्कैन चलाएं और अपने डोमेन के लिए llms.txt, robots.txt, स्कीमा और कंटेंट फिक्स प्राप्त करें।
मुफ्त स्कैन चलाएं