حظر عناكب الذكاء الاصطناعي: robots.txt أم الخادم؟

أصبحت حظر عناكب الذكاء الاصطناعي واحدة من القرارات الجديدة التي يواجهها أصحاب المواقع في 2026. لم يعد السؤال فقط: هل أسمح لـGooglebot بالزحف؟ بل أصبح عليك التمييز بين عناكب التدريب، وعناكب البحث، والوكلاء الذين يجلبون صفحاتك استجابة لطلب مستخدم، ثم تحديد ما تريد السماح به وما تريد منعه.
المشكلة أن كثيرًا من أصحاب المواقع يضيفون بضعة أسطر إلى robots.txt ويعتقدون أن المحتوى أصبح محميًا بالكامل. هذا غير دقيق. ملف robots.txt يعمل عندما يختار الروبوت احترامه، بينما الحظر على مستوى الخادم أو CDN أو WAF يستطيع منع الطلب نفسه من الوصول إلى المحتوى.
الإجابة السريعة
إذا كان هدفك مجرد إعلان أنك لا تريد روبوتًا موثوقًا بعينه أن يزحف إلى موقعك، فإن robots.txt غالبًا يكفي. أما إذا كان حظر عناكب الذكاء الاصطناعي مطلوبًا فعليًا لمنع الوصول أو تقليل استهلاك موارد الخادم أو التعامل مع Bots لا تلتزم بالتعليمات، فاستخدم WAF أو CDN أو قواعد الخادم. والأفضل في المواقع المهمة هو الجمع بين سياسة واضحة في robots.txt ومراقبة السجلات ثم إضافة حظر تنفيذي عند الحاجة.
ما الفرق بين robots.txt والحظر الفعلي؟
robots.txt عبارة عن ملف نصي في جذر الموقع يخبر برامج الزحف بالمسارات التي تريد السماح لها بالوصول إليها أو منعها منها.
على سبيل المثال، إذا أردت منع GPTBot من الوصول إلى الموقع كله، يمكن استخدام:
User-agent: GPTBot
Disallow: /
هذه التعليمات واضحة، لكن الخادم لا يمنع GPTBot فعليًا من طلب الصفحة. البرنامج نفسه يقرأ robots.txt ثم يقرر الالتزام به.
لذلك يمكن تشبيه robots.txt بلافتة تقول «ممنوع الدخول». الروبوت المسؤول سيقرأ اللافتة ويتوقف، أما روبوت لا يلتزم بالقواعد فيستطيع تجاهلها.
في المقابل، عندما يتم حظر عناكب الذكاء الاصطناعي باستخدام WAF أو CDN أو إعدادات الخادم، فإن الطلب يواجه قاعدة تنفيذية تمنعه من الوصول، حتى لو حاول تجاهل robots.txt.
robots.txt مناسب للعناكب الموثوقة
أكبر شركات الذكاء الاصطناعي توفر تعليمات واضحة للتحكم في عناكبها من خلال robots.txt.
OpenAI تفرق بين أكثر من روبوت. هناك GPTBot المرتبط ببعض استخدامات جمع البيانات، بينما OAI-SearchBot مرتبط بظهور صفحات المواقع في نتائج البحث داخل ChatGPT.
إذا منعت OAI-SearchBot، فقد تقل قدرة محتواك على الظهور داخل إجابات وبحث ChatGPT. لذلك لا ينبغي منع جميع عناكب OpenAI لمجرد أنك لا تريد استخدام المحتوى في التدريب.
وهذه نقطة أساسية عند اتخاذ قرار حظر عناكب الذكاء الاصطناعي: لا تتعامل مع اسم الشركة باعتباره Bot واحدًا له وظيفة واحدة.
OpenAI: GPTBot ليس OAI-SearchBot
OpenAI توضح رسميًا أن المواقع العامة يمكن أن تظهر في ChatGPT Search، وأن السماح لـOAI-SearchBot بالوصول يساعد في اكتشاف المحتوى وعرضه والاستشهاد به.
لذلك إذا كان هدفك هو منع استخدام محتواك في بعض سيناريوهات جمع البيانات مع الإبقاء على فرصة الظهور في ChatGPT Search، يجب ضبط كل User-Agent بشكل منفصل.
ويمكن مراجعة إرشادات OpenAI الرسمية للناشرين وأصحاب المواقع لفهم الفرق بين اكتشاف المحتوى والوصول عبر عناكب OpenAI.
Anthropic تستخدم أكثر من روبوت أيضًا
Anthropic تتبع النهج نفسه تقريبًا. لديها ClaudeBot المرتبط بجمع محتوى قد يستخدم في تطوير النماذج، وClaude-User الذي يمكنه الوصول إلى صفحات عندما يطلب مستخدم Claude ذلك، إلى جانب روبوتات أخرى مرتبطة بالبحث.
وتوضح Anthropic أنها تحترم تعليمات robots.txt، بل وتقول إن حظر IP الخاص بعناكبها ليس دائمًا أفضل وسيلة لإعلان الانسحاب، لأن عناوين IP قد تتغير وقد يمنع الحظر الروبوت من قراءة robots.txt أصلًا.
هذه نقطة مهمة: إذا كان هدفك هو إعلان تفضيل رسمي لشركة ملتزمة بالقواعد، فقد يكون robots.txt أدق من مطاردة عناوين IP المتغيرة.
Google-Extended لا يساوي Googlebot
أخطر خطأ يمكن أن يقع فيه صاحب موقع هو الخلط بين التحكم في استخدام المحتوى لأغراض الذكاء الاصطناعي وبين منع Google Search نفسه.
Google توفر رمز User-Agent باسم Google-Extended يتيح للناشر التحكم في بعض استخدامات المحتوى المتعلقة بنماذج Gemini وعمليات Grounding، دون التأثير في الظهور داخل Google Search التقليدي.
وتؤكد Google أن Google-Extended لا يؤثر في ظهور الموقع في نتائج البحث ولا يستخدم كإشارة ترتيب.
لذلك لا تستخدم قاعدة عامة مثل:
User-agent: *
Disallow: /
وأنت تحاول فقط حظر عناكب الذكاء الاصطناعي، لأن هذه القاعدة قد تمنع عددًا كبيرًا من برامج الزحف المشروعة وليس AI فقط.
متى لا يكون robots.txt كافيًا؟
إذا كنت ترى في سجلات الخادم أن روبوتًا يستمر في طلب الصفحات رغم منعه في robots.txt، أو إذا كانت طلباته تسبب ضغطًا ملحوظًا، فهنا لم يعد الملف كافيًا.
الحل يصبح الانتقال إلى طبقة تستطيع رفض الاتصال فعليًا.
هناك ثلاث طبقات رئيسية:
- الخادم نفسه: مثل قواعد Nginx أو Apache.
- CDN: مثل Cloudflare، حيث يمكن إيقاف الطلب قبل وصوله إلى الخادم.
- WAF: جدار حماية لتطبيقات الويب يستطيع تحليل خصائص وسلوك الطلب بصورة أعمق.
CDN أفضل عندما تريد حماية موارد السيرفر
إذا كان أحد أسباب حظر عناكب الذكاء الاصطناعي هو كثرة الطلبات واستهلاك المعالج أو Bandwidth، فإن الحظر عبر CDN قد يكون أكثر كفاءة من انتظار وصول الطلب إلى السيرفر.
عندما يمنع Cloudflare أو CDN مشابه الروبوت عند الحافة Edge، لا يصل الطلب أصلًا إلى استضافة موقعك.
هذا يقلل استهلاك موارد PHP وقاعدة البيانات والاتصال بالخادم، وهو فرق مهم جدًا في مواقع WordPress الثقيلة أو المواقع التي تعمل على استضافة محدودة.
وسبق أن تناولنا في سوالف أهمية موارد السيرفر في مقال طريقة إدارة السيرفرات باستخدام الذكاء الاصطناعي، وهي زاوية تصبح أكثر أهمية مع زيادة حركة Bots الآلية.
WAF هو الخيار الأقوى ضد الروبوتات المتقدمة
الحظر بالـUser-Agent على مستوى الخادم جيد ضد الروبوتات التي تعرف نفسها بوضوح، لكنه ليس حلًا مثاليًا ضد Bot ينتحل User-Agent متصفح عادي أو روبوت مشهور.
هنا يظهر دور WAF، لأنه يستطيع تحليل عوامل إضافية مثل نمط الطلبات، السرعة، السلوك، الترويسات Headers، وخصائص الاتصال.
لهذا يكون WAF عادة أقوى طبقة عندما يكون الهدف الحقيقي هو حظر عناكب الذكاء الاصطناعي التي تحاول تجاوز القواعد التقليدية.
لكن حتى WAF ليس حلًا سحريًا بنسبة 100%. يمكن لروبوتات متقدمة جدًا محاكاة السلوك البشري أو استخدام شبكات IP واسعة، ولذلك تتحول القضية إلى إدارة مستمرة بدل قاعدة واحدة تنهي المشكلة للأبد.
لا تعتمد على User-Agent وحده
User-Agent عبارة عن نص يرسله العميل إلى الخادم للتعريف بنفسه، ويمكن تزويره بسهولة.
أي برنامج Scraper يستطيع أن يرسل:
User-Agent: Googlebot
دون أن يكون Googlebot الحقيقي.
لذلك إذا كنت ترى نشاطًا كثيفًا أو مشبوهًا، راجع IP وReverse DNS إن كان المزود ينشر آلية تحقق، وراقب السلوك الفعلي بدل الاعتماد على الاسم فقط.
هل تحتاج إلى الحظر على كل الطبقات؟
ليس بالضرورة.
إذا كنت تدير مدونة صغيرة وتريد فقط إبلاغ GPTBot أو ClaudeBot بأنك لا تريد الزحف لأغراض معينة، فـrobots.txt قد يكون كافيًا إذا كانت هذه الشركات تحترم التعليمات.
أما إذا كان لديك محتوى تجاري حساس أو قاعدة بيانات قيّمة أو موقع يعاني من استهلاك مفرط بسبب Crawlers، فقد يكون من الأفضل تطبيق حظر عناكب الذكاء الاصطناعي في robots.txt ثم دعمه بقواعد على Cloudflare أو WAF.
المهم هو ألا تضيف تعقيدًا غير ضروري. كل طبقة حظر تحتاج إلى صيانة، وقد تسبب False Positives تمنع روبوتًا تحتاج إليه فعلًا.
مقارنة سريعة بين طرق حظر عناكب الذكاء الاصطناعي
| الطريقة | قوة المنع | سهولة الإدارة | توفير موارد السيرفر |
|---|---|---|---|
| robots.txt | يعتمد على التزام الروبوت | سهل جدًا | محدود |
| قواعد الخادم | قوي للأنماط المعروفة | يحتاج خبرة تقنية | متوسط |
| CDN | قوي | متوسط | مرتفع |
| WAF | الأقوى عادة | أكثر تعقيدًا | مرتفع |
الحظر قد يقلل ظهورك داخل محركات الإجابة
من السهل النظر إلى AI Crawlers على أنها مجرد مستهلك لمحتوى الموقع، لكن الصورة ليست بهذه البساطة.
بعض العناكب لها دور في اكتشاف صفحات يمكن أن تظهر لاحقًا كمصادر داخل محركات الإجابة. منعها يعني أنك قد تحصل على حماية أكبر للمحتوى، لكنك قد تخسر فرصة الظهور أمام مستخدمين جدد.
وقد شرحنا هذه المعضلة بالتفصيل في سوالف في مقال لماذا يزور الذكاء الاصطناعي موقعك ولا تحصل على زيارات؟.
ولهذا فإن قرار حظر عناكب الذكاء الاصطناعي أصبح قرارًا تجاريًا بقدر ما هو قرار تقني.
حدد أولًا ماذا تريد أن تمنع
قبل تعديل أي ملف، اسأل نفسك:
- هل أريد منع التدريب فقط؟
- هل أريد منع ظهور المحتوى في محركات AI؟
- هل المشكلة هي استهلاك السيرفر؟
- هل أرى Scrapers لا تلتزم بـrobots.txt؟
- هل لدي قسم حساس فقط أريد حمايته؟
الإجابة تغير طريقة التنفيذ بالكامل.
مثلًا، قد تسمح لـOAI-SearchBot من أجل الظهور في ChatGPT Search، وتمنع GPTBot إذا كانت سياستك لا تريد استخدام المحتوى في أغراض أخرى. وقد تسمح لـGooglebot بصورة طبيعية بينما تضبط Google-Extended بصورة مختلفة.
المنع الجزئي أفضل من Disallow شامل في كثير من الحالات
إذا كان لديك قسم مدفوع أو أرشيف خاص أو صفحات ذات قيمة عالية، فقد لا تحتاج إلى منع الموقع كله.
يمكنك تقييد مسار محدد:
User-agent: GPTBot
Disallow: /premium/
Disallow: /research/
بهذه الطريقة يبقى باقي الموقع متاحًا للزحف بينما تحمي الأجزاء التي اخترتها.
لكن تذكر أن robots.txt نفسه ملف عام يستطيع أي شخص قراءته، لذلك لا تستخدمه لإخفاء مسارات سرية أو بيانات حساسة. المحتوى السري يجب أن يكون خلف مصادقة حقيقية.
robots.txt ليس أداة خصوصية
Google تكرر منذ سنوات أن robots.txt مخصص أساسًا لإدارة الزحف وليس لحماية المحتوى.
حتى في البحث التقليدي، URL ممنوع من الزحف قد يظل معروفًا لمحرك البحث إذا كانت هناك روابط خارجية تشير إليه.
لذلك إذا كانت لديك معلومات لا تريد لأي طرف عام الوصول إليها، الحل هو Authentication أو صلاحيات وصول أو إزالة المحتوى من الويب العام، وليس مجرد حظر عناكب الذكاء الاصطناعي.
راقب السجلات قبل وبعد أي قرار
من أفضل الخطوات العملية مراجعة Access Logs أو تقارير Cloudflare قبل تنفيذ الحظر.
اعرف أولًا:
- أي Bots تزور الموقع فعلًا.
- عدد الطلبات التي ترسلها.
- المسارات التي تزحف إليها.
- حجم البيانات المستهلكة.
- هل تحترم robots.txt أم لا.
بعدها نفذ التغيير ثم قارن الأرقام.
بدون هذه البيانات قد تقضي وقتًا في منع روبوت لا يزور موقعك أصلًا، بينما يظل Scraper آخر هو المستهلك الحقيقي للموارد.
ماذا أنصح للمواقع العادية؟
في أغلب المواقع التحريرية، لا أرى أن الحظر الكامل لكل AI Bot هو الخيار الأفضل تلقائيًا.
ابدأ بتحديد سياستك تجاه كل خدمة. اسمح للعناكب التي تساعدك في الظهور إذا كان هذا يتماشى مع هدف الموقع، وامنع العناكب الخاصة بالاستخدامات التي لا تريدها.
استخدم robots.txt مع الشركات المعروفة التي تعلن التزامها به، ثم راقب سجلات الخادم.
إذا ظهر ضغط فعلي على الموارد أو تجاهل للتعليمات، انتقل إلى Cloudflare أو WAF بدل إضافة المزيد والمزيد من أسطر robots.txt.
ماذا أنصح للمواقع التي تعاني من Bot Traffic مرتفع؟
في هذه الحالة تكون الأولوية مختلفة. إذا كانت الطلبات الآلية تستهلك Bandwidth وCPU أو تتسبب في بطء الموقع، فإن انتظار وصولها إلى WordPress ثم منعها ليس مثاليًا.
استخدم CDN/WAF لتصفية الطلبات قبل وصولها إلى التطبيق.
ثم احتفظ بـrobots.txt أيضًا، لأنه يوضح سياستك للعناكب المسؤولة وقد يقلل عدد المحاولات أصلًا.
الجمع بين الاثنين يجعل حظر عناكب الذكاء الاصطناعي أكثر كفاءة: robots.txt للإعلان عن السياسة، والـWAF لتنفيذها عندما لا تكفي الاستجابة الطوعية.
الخلاصة في حظر عناكب الذكاء الاصطناعي: robots.txt للسياسة وWAF للتنفيذ
لا توجد إجابة واحدة تصلح لكل موقع. robots.txt بسيط، واضح، ومدعوم من شركات كبيرة مثل OpenAI وAnthropic وGoogle، لكنه يعتمد على التزام الروبوت.
الحظر على مستوى الخادم أو CDN أو WAF أقوى لأنه يمنع الوصول فعليًا، لكنه يحتاج إلى إدارة تقنية أكبر وقد يؤدي إلى أخطاء إذا تم تطبيقه بصورة واسعة.
لذلك أفضل استراتيجية لـحظر عناكب الذكاء الاصطناعي تبدأ بفهم كل User-Agent ووظيفته، ثم استخدام robots.txt للعناكب الموثوقة، ومراقبة السجلات، وتصعيد الحظر إلى CDN أو WAF فقط عندما يكون لديك سبب حقيقي.
لا تمنع كل شيء لأن AI جديد، ولا تسمح لكل شيء لأنك تريد الظهور. تعامل مع كل روبوت باعتباره قناة مستقلة لها فائدة وتكلفة، واتخذ القرار بناءً على قيمة المحتوى وموارد السيرفر واستراتيجية موقعك.
لا يسمح بنقل هذا المحتوى من سوالف دون الاشارة برابط مباشر





