यह टूल क्या करता है
robots.txt जेनरेटर robots.txt फ़ाइल लिखता है, जो क्रॉलर को बताती है कि वे आपकी साइट के कौन-से हिस्से ला सकते हैं। मुख्य नियम समूह के user-agent चुनें, ब्लॉक करने वाले पाथ और अनुमत अपवाद लिखें, चाहें तो crawl-delay और एक या ज़्यादा साइटमैप URL जोड़ें, और फ़ाइल टाइप करते-करते अपडेट होती है।
प्रीसेट आम मामलों को एक क्लिक में संभालते हैं: सब की अनुमति, सब ब्लॉक करें (स्टेजिंग साइट के लिए उपयोगी) और WordPress के लिए शुरुआती सेटअप। एक अलग सेटिंग AI क्रॉलर को या तो सिर्फ़ ट्रेनिंग के लिए या पूरी तरह, AI सर्च और असिस्टेंट एजेंट समेत, ब्लॉक करती है, और आप SEO क्रॉलर जैसे किसी भी दूसरे बॉट को नाम से ब्लॉक कर सकते हैं। पाथ, user-agent नाम और साइटमैप URL जाँचे जाते हैं, इसलिए शुरुआती स्लैश भूल जाने या रिलेटिव साइटमैप देने पर चुपचाप खराब फ़ाइल बनने के बजाय त्रुटि दिखती है।
उपयोग कैसे करें
- किसी प्रीसेट से शुरू करें या सब कुछ अनुमत करने वाला डिफ़ॉल्ट रहने दें।
- ब्लॉक किए गए पाथ में वे फ़ोल्डर या पैटर्न कॉमा से अलग करके लिखें जहाँ क्रॉलर न जाएँ, जैसे
/admin/, /cart/, /*?sort=। इनके अंदर के अपवाद अनुमत पाथ में लिखें। - साइटमैप URL जोड़ें, ताकि सर्च इंजन उसे अलग से जमा किए बिना ढूँढ सकें।
- AI क्रॉलर के साथ क्या करना है चुनें और ब्लॉक करने के लिए दूसरे बॉट जोड़ें।
- फ़ाइल को
robots.txtनाम से डाउनलोड करें और डोमेन की रूट में अपलोड करें, ताकि वहhttps://example.com/robots.txtपर मिले। हर सबडोमेन को अपनी अलग फ़ाइल चाहिए।
उदाहरण
/admin/ को /admin/public/ के अपवाद के साथ ब्लॉक करने, साइटमैप जोड़ने और AI ट्रेनिंग क्रॉलर ब्लॉक करने पर यह बनता है:
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(यहाँ AI समूह छोटा किया गया है; टूल सभी क्रॉलर की सूची देता है।) कई User-agent लाइनें और उनके बाद के नियम मिलकर एक समूह बनाते हैं जो सब पर लागू होता है, और हर क्रॉलर सिर्फ़ उस सबसे विशिष्ट समूह को मानता है जिसमें उसका नाम हो।
सुझाव
*किसी भी अक्षर क्रम से मेल खाता है और$URL के अंत को दर्शाता है, इसलिए/*.pdf$सभी PDF ब्लॉक करता है।- जब Allow और Disallow दोनों मेल खाते हैं, तो Google सबसे लंबा (सबसे विशिष्ट) नियम लागू करता है।
- पेज दिखाने के लिए ज़रूरी CSS और JavaScript फ़ाइलें ब्लॉक न करें, वरना सर्च इंजन आपके पेज का गलत आकलन कर सकते हैं।
- बदलावों पर भरोसा करने से पहले Google Search Console की robots.txt रिपोर्ट में उन्हें जाँचें।
अक्सर पूछे जाने वाले सवाल
› क्या robots.txt में Disallow से पेज Google से हट जाता है?
नहीं। Disallow नियम मानने वाले क्रॉलर को URL लाने से रोकता है, लेकिन अगर दूसरी साइटें उससे लिंक करती हैं तो URL फिर भी (बिना स्निपेट के) इंडेक्स हो सकता है। किसी पेज को सर्च रिज़ल्ट से बाहर रखने के लिए उसे क्रॉल होने दें और noindex वाला robots मेटा टैग या X-Robots-Tag हेडर इस्तेमाल करें।
› टूल कौन-से AI क्रॉलर ब्लॉक करता है?
ट्रेनिंग क्रॉलर ब्लॉक करें विकल्प GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot और मॉडल ट्रेनिंग के लिए डेटा जुटाने वाले दूसरे बॉट जोड़ता है। सभी AI बॉट ब्लॉक करें विकल्प OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot और Perplexity-User जैसे AI सर्च इंडेक्सर और असिस्टेंट एजेंट भी जोड़ता है, जिससे आपके पेज AI जवाबों में उद्धृत होना बंद हो सकते हैं।
› क्या सभी क्रॉलर robots.txt मानते हैं?
भरोसेमंद सर्च इंजन और बड़ी AI कंपनियाँ इसे मानने की बात कहती हैं, लेकिन robots.txt एक परंपरा है, एक्सेस कंट्रोल नहीं। स्क्रेपर इसे अनदेखा कर सकते हैं, इसलिए निजी सामग्री को लॉगिन से सुरक्षित रखें और परेशान करने वाले बॉट के लिए सर्वर नियम या फ़ायरवॉल इस्तेमाल करें।
› क्या Crawl-delay समर्थित है?
Bing, Yandex और कुछ दूसरे क्रॉलर Crawl-delay का पालन करते हैं; Google इसे अनदेखा करता है और आपके सर्वर की प्रतिक्रिया गति के हिसाब से क्रॉल दर अपने आप तय करता है।