ماذا تفعل هذه الأداة
يكتب مولّد robots.txt ملف robots.txt الذي يخبر الزواحف بأجزاء موقعك التي يمكنها جلبها. اختر user-agent لمجموعة القواعد الرئيسية، واذكر المسارات المراد حظرها والاستثناءات المسموح بها، وأضف إن شئت crawl-delay ورابطًا أو أكثر لخريطة الموقع، فيتحدّث الملف أثناء الكتابة.
تغطي الإعدادات الجاهزة الحالات الشائعة بنقرة: السماح بالكل، وحظر الكل (مفيد لمواقع الاختبار)، ونقطة بداية لـ WordPress. ويحظر إعداد منفصل زواحف الذكاء الاصطناعي إما للتدريب فقط أو كليًا بما في ذلك البحث بالذكاء الاصطناعي ووكلاء المساعدين، ويمكنك حظر أي روبوت آخر بالاسم مثل زواحف تحسين محركات البحث. تُفحص المسارات وأسماء user-agent وروابط خرائط الموقع، فيُبلَّغ عن نسيان الشرطة المائلة في البداية أو استخدام خريطة موقع نسبية بدل إنشاء ملف معطوب بصمت.
طريقة الاستخدام
- ابدأ بإعداد جاهز أو أبقِ الافتراضي الذي يسمح بكل شيء.
- في المسارات المحظورة اذكر المجلدات أو الأنماط التي لا يجوز للزواحف دخولها مفصولة بفواصل، مثل
/admin/, /cart/, /*?sort=. واستخدم المسارات المسموح بها للاستثناءات داخلها. - أضف رابط خريطة الموقع لتجدها محركات البحث دون إرسال منفصل.
- اختر طريقة التعامل مع زواحف الذكاء الاصطناعي وأضف روبوتات أخرى لحظرها.
- نزّل الملف باسم
robots.txtوارفعه إلى جذر النطاق ليُخدَم علىhttps://example.com/robots.txt. يحتاج كل نطاق فرعي إلى ملفه الخاص.
مثال
حظر /admin/ مع استثناء /admin/public/ وإضافة خريطة موقع وحظر زواحف تدريب الذكاء الاصطناعي ينتج:
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(اختُصرت مجموعة الذكاء الاصطناعي هنا، والأداة تذكر جميع الزواحف.) تشكّل عدة أسطر User-agent تليها القواعد مجموعة واحدة تنطبق عليها جميعًا، ويتبع كل زاحف المجموعة الأكثر تحديدًا التي تذكره فقط.
نصائح
- يطابق
*أي سلسلة من الأحرف ويثبّت$نهاية الرابط، لذا يحظر/*.pdf$كل ملفات PDF. - عندما يتطابق Allow وDisallow معًا، يطبّق Google القاعدة الأطول (الأكثر تحديدًا).
- لا تحظر ملفات CSS وJavaScript التي تحتاجها الصفحات للعرض، وإلا فقد تسيء محركات البحث تقييمها.
- اختبر التغييرات بتقرير robots.txt في Google Search Console قبل الاعتماد عليها.
الأسئلة الشائعة
› هل يزيل Disallow في robots.txt الصفحة من Google؟
لا. يمنع Disallow الزواحف الملتزمة من جلب الرابط، لكن الرابط قد يُفهرَس رغم ذلك (دون مقتطف) إذا أشارت إليه مواقع أخرى. لإبقاء الصفحة خارج نتائج البحث، اسمح بزحفها واستخدم وسم robots بقيمة noindex أو ترويسة X-Robots-Tag.
› ما زواحف الذكاء الاصطناعي التي تحظرها الأداة؟
يضيف خيار حظر زواحف التدريب GPTBot وClaudeBot وanthropic-ai وGoogle-Extended وApplebot-Extended وCCBot وBytespider وMeta-ExternalAgent وAmazonbot وروبوتات أخرى تجمع البيانات لتدريب النماذج. ويضيف خيار حظر كل روبوتات الذكاء الاصطناعي أيضًا مفهرسات البحث بالذكاء الاصطناعي ووكلاء المساعدين مثل OAI-SearchBot وChatGPT-User وClaude-SearchBot وClaude-User وPerplexityBot وPerplexity-User، ما قد يمنع الاستشهاد بصفحاتك في إجابات الذكاء الاصطناعي.
› هل تلتزم كل الزواحف بملف robots.txt؟
تقول محركات البحث الموثوقة وكبرى شركات الذكاء الاصطناعي إنها تلتزم به، لكن robots.txt عُرف وليس وسيلة للتحكم في الوصول. يمكن لأدوات الكشط تجاهله، لذا احمِ المحتوى الخاص بالمصادقة واستخدم قواعد الخادم أو جدار حماية مع الروبوتات المسيئة.
› هل يُدعم Crawl-delay؟
تحترم Bing وYandex وبعض الزواحف الأخرى Crawl-delay، أما Google فيتجاهله ويضبط معدل الزحف تلقائيًا وفق سرعة استجابة خادمك.