परिणाम केवल जानकारी के उद्देश्य से दिए गए हैं और उनमें त्रुटियाँ हो सकती हैं। महत्वपूर्ण जानकारी की स्वतंत्र रूप से पुष्टि करें। इस टूल का उपयोग आपके अपने जोखिम पर है।
यह टूल क्या करता है
Robots.txt जेनरेटर वह robots.txt फ़ाइल बनाता है जो सर्च इंजन क्रॉलरों को बताती है कि वे साइट के किन हिस्सों पर जा सकते हैं। सभी क्रॉलर की अनुमति दें या सभी क्रॉलर को अस्वीकृत करें चुनें, क्रॉलिंग से बाहर रखने वाले पाथ लिखें (हर लाइन में एक, जैसे /admin/), और अपने XML साइटमैप का पूरा URL जोड़ें। नियम हर क्रॉलर पर लागू होते हैं (User-agent: *)।
नतीजे को robots.txt नाम की प्लेन-टेक्स्ट फ़ाइल के रूप में डोमेन के रूट पर अपलोड करें, ताकि वह https://yourdomain.com/robots.txt पर उपलब्ध हो। क्रॉलर सबसे पहले इसी को पढ़ते हैं। ब्लॉक किए गए पाथ सिर्फ़ तब लिखे जाते हैं जब डिफ़ॉल्ट विकल्प अनुमति देने वाला हो, क्योंकि सबको अस्वीकृत करने वाला विकल्प उन्हें पहले से कवर कर लेता है।
कब इस्तेमाल करें
- साइट लॉन्च करते समय क्रॉलरों को उसके साइटमैप तक पहुँचाना।
- क्रॉलरों को एडमिन, कार्ट, सर्च-रिज़ल्ट या इंटरनल API पाथ से दूर रखना।
- स्टेजिंग या टेस्ट साइट की पूरी क्रॉलिंग रोकना।
- फ़िल्टर किए गए या डुप्लिकेट URL पर बर्बाद होने वाला क्रॉल बजट कम करना।
उदाहरण
इनपुट
Allow all
Disallow: /admin/, /cart/
Sitemap: https://example.com/sitemap.xml
आउटपुट
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /cart/
Sitemap: https://example.com/sitemap.xmlइस टूल के बारे में सवाल
क्या Disallow किसी पेज को Google से बाहर रखता है?
भरोसेमंद तरीके से नहीं। यह क्रॉलिंग रोकता है, लेकिन ब्लॉक किया गया URL दूसरी साइटों के लिंक के ज़रिए फिर भी इंडेक्स हो सकता है, बिना विवरण के। किसी पेज को सर्च नतीजों से बाहर रखने के लिए क्रॉलिंग की अनुमति दें और इसकी जगह noindex robots मेटा टैग या हेडर जोड़ें।
क्या robots.txt एक सुरक्षा उपाय है?
नहीं। यह एक सार्वजनिक फ़ाइल है और शिष्ट क्रॉलर अपनी मर्ज़ी से इसका पालन करते हैं। इसमें गुप्त पाथ लिखने से असल में उनका ढिंढोरा पिट जाता है। निजी हिस्सों को ऑथेंटिकेशन से सुरक्षित करें।
AI ट्रेनिंग क्रॉलरों को कैसे ब्लॉक करूँ?
जिस भी क्रॉलर को बाहर रखना हो, उसके लिए एक अलग ग्रुप जोड़ें, जैसे User-agent: GPTBot और उसके बाद Disallow: /। हर कंपनी अपने क्रॉलरों के user-agent नाम डॉक्यूमेंट करती है।
अगर मैं पूरी स्टेजिंग साइट ब्लॉक करूँ और उसी फ़ाइल के साथ लॉन्च कर दूँ तो?
तब लाइव साइट सर्च इंजनों के लिए ब्लॉक रहेगी। हर लॉन्च के दौरान robots.txt ज़रूर जाँचें; पीछे छूटा हुआ Disallow: / ट्रैफ़िक अचानक गिरने की सबसे आम वजहों में से एक है।
क्या यह टूल मुफ़्त है?
हाँ, यह मुफ़्त है। पंजीकरण या ईमेल की ज़रूरत नहीं। परिणाम इसी पेज पर मिलता है।
मेरा परिणाम कहाँ मिलेगा?
इसी पेज पर टूल का उपयोग करें। परिणाम यहीं दिखता है, ईमेल से प्राप्त करने की ज़रूरत नहीं है।