الملخص التنفيذي
استخرجنا ملف robots.txt لكل نطاق ضمن قائمة Tranco لأفضل 10,000 موقعًا الأكثر زيارة في العالم. ثم حلّلنا كل ملف باستخدام محلّل متوافق مع RFC 9309، وصنّفنا الملفات بحسب سياسة حظر روبوتات الذكاء الاصطناعي التي اعتمدها الموقع - إن وُجدت - وعددنا كم موقعًا من أكثر مواقع العالم زيارةً يحاول فعليًا حظر ChatGPT وClaude وPerplexity وGemini وCommon Crawl وBytespider وApple Intelligence وغيرها من الزواحف التي تُدرِّب وتُشغّل النماذج اللغوية الكبيرة في 2026.
الأرقام الأبرز، على عينة من 7,248 موقعًا أمكننا قراءة robots.txt فيها بوضوح:

20.3% من أفضل 10,000 موقع في العالم تحظر روبوت ذكاء اصطناعي واحدًا على الأقل. 17.0% لديها قاعدة صريحة ومقصودة خاصة بالذكاء الاصطناعي. أما الـ 80% الباقية فتتعامل مع زواحف الذكاء الاصطناعي كما لو كانت Googlebot.
ستة استنتاجات تغيّر شكل القصة:
- المؤسسات الإخبارية تحظر بنسبة 47% — وهي الأعلى بين جميع القطاعات. الصحافة الألمانية تتصدر بـ 88%، والفرنسية بـ 80%، والروسية بـ 0%. الإطار القانوني، لا التكنولوجيا ولا اقتصاديات الصناعة، هو العامل الأساسي.
CCBot(Common Crawl) هو الروبوت الأكثر حظرًا بنسبة 16.3% — متقدمًا علىGPTBot(15.8%) وBytespider(14.9%). الناشرون يستهدفون مجموعة التدريب لا علامة النموذج التجارية. وأكثر قاعدة انتقائية انتشارًا هي "حظرCCBotوالسماح لـGooglebot" (14.1% من المواقع).- فرنسا تتصدر كل البلدان بنسبة 50.6% من الحظر على مواقع
.fr؛ ومجموعة الاتحاد الأوروبي أعلى بـ 16 نقطة من المتوسط العالمي. 275 ملفrobots.txtيذكر صراحةً التوجيه الأوروبي 2019/790. المادة 4 هي الإطار القانوني الوحيد الذي يحرّك الأرقام بوضوح. - 17.8% كتبت قواعدها الخاصة للذكاء الاصطناعي؛ و4.5% تستخدم قالب Cloudflare المُدار؛ و75.7% لا تقول شيئًا. المواقع الكبيرة تكتب سياستها بنفسها؛ أما الذيل الطويل فيستخدم المفتاح الجاهز. The Atlantic و
cloudflare.comنفسيهما ضمن قائمة Cloudflare المُدارة. - 108 مواقع تسمح صراحةً لـ
GPTBot— WordPress.org وKaspersky وNorton وAvast وSophos وThe Verge وThe Atlantic وNBA.com وThe Sun وBranch.io. شركات الأمن وأدوات التطوير ممثلة فوق المعدل. - سياسة الذكاء الاصطناعي لا تصبح أكثر تشددًا عند قمّة المنحنى. أفضل 100، و101–1000، و1001–5000، و5001–10000 كلها تقع بين 19% و23%. النسبة الرئيسية هي صفة من صفات الويب العام في 2026، لا إشارة إلى حجم أي موقع بعينه.
لم تعد القصة تدور حول ما إذا كان الويب "يردّ المقاومة". بل حول أي القطاعات، وأي البلدان، وأي الأنظمة القانونية، وأي موردي الذكاء الاصطناعي هم أهداف السياسة النشطة — وأيها ليس كذلك.
أولًا: الخلفية — كيف أصبح robots.txt وثيقة سياسة للذكاء الاصطناعي
ثلاث قوى أعادت تشكيل معنى robots.txt منذ أن أطلقت OpenAI روبوت GPTBot في أغسطس 2023.
تعدد مورّدو الذكاء الاصطناعي. ظهر Google-Extended من Google، وClaudeBot من Anthropic، وBytespider من ByteDance، وApplebot-Extended من Apple، وAmazonbot من Amazon، وMeta-ExternalAgent من Meta. كما أصبح CCBot الموجود أصلًا من Common Crawl هدف الحظر الأكثر تأثيرًا، لأن أرشيفه يغذي معظم النماذج المفتوحة الوزن. وظهرت أيضًا روبوتات غير تابعة لمورّدين: AI2Bot وcohere-ai وPerplexityBot وYouBot وDuckAssistBot وDiffbot وOmgili. وتصل قائمة الحظر الشاملة في 2026 إلى نحو 25 اسمًا.
المادة 4 من توجيه الاتحاد الأوروبي 2019/790 أنشأت استثناءً قانونيًا للتنقيب النصي والبياني لا ينطبق إذا كان صاحب الحق قد "احتفظ صراحةً" بحقوقه بطريقة "مقروءة آليًا". وخلال 2024–2025 استقر ناشرو الاتحاد الأوروبي ومحاموهم على robots.txt بوصفه الطريقة القياسية للتعبير عن هذا الاحتفاظ. وتُظهر بياناتنا أن 275 موقعًا يذكر التوجيه 2019/790 صراحةً و87 يذكر "TDM" — وغالبًا ما يتركز ذلك في مواقع الأخبار الأوروبية حيث يظهر كمقدمة قانونية من 4 إلى 8 أسطر.
Cloudflare حوّل التبديل إلى منتج. في 2024–2025 أطلقت Cloudflare لوحة "AI Audit"، ومفتاح "Block AI Bots"، وقالب robots.txt مُدارًا يضم مفردات Content-Signal: search=yes,ai-train=no مع نص قانوني قياسي مستمد من EU 2019/790. وبحلول مايو 2026 كان هذا القالب يعمل على 4.5% من أفضل 10,000 موقع القابلة للتحليل. وتناقش خارطة طريق Cloudflare علنًا جعل المفتاح مُفعّلًا افتراضيًا للحسابات الجديدة — ما قد يرفع نسبة الحظر العالمية بنحو 5 إلى 8 نقاط من دون أن يتخذ أي ناشر قرارًا فرديًا.
لم يعد robots.txt في 2026 ذلك الملف التكويني غير الملفت الذي كان عليه في 2022. إنه الآن آلية قانونية للاحتفاظ بالحقوق بدعم معاهدي داخل الاتحاد الأوروبي، وقطعة سياسة صاغها المورّدون في الذيل الطويل، وخط المواجهة في مفاوضة بطيئة بين من يديرون المواقع ومن يدربون النماذج.
ثانيًا: المنهجية
حاولنا أن نجعل الدراسة مملة وقابلة لإعادة الإنتاج قدر الإمكان. وقد نُشرت السلسلة الكاملة (أكواد Python، وملفات CSV المحللة، وأرشيف robots.txt الخام، والرسوم البيانية) مع هذا التقرير.
العينة
بدأنا بقائمة Tranco بتاريخ مايو 2026، المحمّلة كملف top-1m.csv.zip، ثم أخذنا أول 10,000 صف. يجمع Tranco أربع قوائم ترتيبية أولية (Cisco Umbrella وMajestic وFarsight وCloudflare Radar)، ويصفّي الاستقرار على مدى 30 يومًا، ويزيل ضجيج الزواحف/CDN الواضح. والقائمة التي ينتجها هي أقرب ما يكون إلى "أفضل 10,000 في حركة الويب العالمية" بوصفها مرجعًا علنيًا، كما أنها العينة القياسية في أبحاث الويب الأكاديمية (استُخدمت في أكثر من 600 ورقة محكّمة منذ إطلاقها على يد KU Leuven في 2018).
تتضمن القائمة مزيجًا من (أ) المواقع الأساسية التي يزورها الناس، و(ب) نطاقات البنية التحتية / واجهات API / DNS / CDN التي لا تعرض صفحة /، و(ج) نطاقات تستخدمها المنصات الكبرى داخليًا (مثل gvt1.com وapple-dns.net وgoogleusercontent.com). ولم نُقصِ هذه النطاقات مسبقًا؛ بل أبقيناها جميعًا ووضعنا لها فئة infrastructure في طبقة التحليل. وتخرج هذه النطاقات طبيعيًا عندما نقصر التحليل على "المواقع التي أعادت robots.txt قابلًا للتحليل".
الجلب
لكل نطاق من النطاقات الـ 10,000 أرسلنا طلب GET /robots.txt غير متزامن عبر HTTPS، مع الرجوع إلى HTTP عند الحاجة، واتباع التحويلات حتى أربع قفزات، وزمن انتظار إجمالي 12 ثانية، وحد أقصى 500 كيلوبايت للمحتوى، وسلسلة User-Agent تشبه المتصفح الحقيقي مع Accept-Language: en-US. وكانت درجة التوازي 80 طلبًا في الطيران. ونُفّذ العمل من عنوان IP سكني واحد في سان فرانسيسكو.
نتائج الجلب:
| الحالة | العدد | التفسير |
|---|---|---|
200 OK | 6,638 | أُعيد نص robots.txt وهو قابل للتحليل. |
404 Not Found | 610 | لا يوجد robots.txt. ويعرّف RFC 9309 هذا على أنه "السماح بكل شيء" ضمنيًا. |
403 Forbidden | 563 | الأصل يرفض طلبات robots.txt بنشاط. مستبعد من التحليل. |
429 Too Many Requests | 7 | لا يوجد تقريبًا أي تقييد من مستوى CDN عند هذه الفئة من الترتيب. |
fetch_failed (خطأ TLS / DNS / TCP) | 2,065 | غالبًا نطاقات CDN الجذرية (akamai.net وcloudfront.net وfastly.net وgtld-servers.net وapple-dns.net) التي لا تشغّل خادم ويب على /. هذا ليس "حظرًا" — إذ لا يوجد robots.txt أصلًا لتقديمه. |
| أخرى 4xx/5xx | 117 | مزيج من أخطاء خادم، وتقييد جغرافي، واستجابات مشوهة. |
وهذا يعطينا 7,248 موقعًا في العينة القابلة للتحليل (6,638 حالة 200 + 610 حالة 404). أما حالات fetch_failed البالغ عددها 2,065 فهي نطاقات حقيقية، لكنها نقاط جذرية لـ CDN/DNS لا مواقع يزورها الناس، واعتبارها ذات "سياسة ذكاء اصطناعي" لا معنى له. وقد أُبقيت في مجموعة البيانات كمؤشر منفصل على قابلية الوصول.
التحليل
حُلِّل كل نص من نصوص 200 باستخدام protego، وهو تطبيق Python لـ RFC 9309 يُستخدم في الإنتاج ضمن Scrapy. ولكل زوج (موقع، روبوت) حسبنا ثلاثة أمور:
can_fetch_root— هل يُسمح للروبوت بجلب/، وفق دلالات المجموعات القياسية، وأولوية أطول مطابقة، وتجاوزUser-agent: *بقاعدة حظر خاصة عند وجودهما معًا.has_specific_rule— هل يحتوي الملف على سطرUser-agent:يذكر هذا الروبوت بالاسم تحديدًا (مع تجاهل حالة الأحرف).disallow_count— عدد توجيهاتDisallow:في الكتلة المطابقة، ويُستخدم للتمييز بين الحظر الشامل للموقع والقيود على مستوى المسار.
هذه المجموعة مهمة لأن رقمًا عامًا مثل "نسبة الحظر" يخفي ظاهرتين مختلفتين تمامًا: علامات تجارية كتبت عمدًا User-agent: GPTBot \n Disallow: / لأنها قررت المقاومة، وعلامات تجارية تستخدم أصلًا User-agent: * \n Disallow: / (وُضع هذا لبيئات staging أو الصيانة قبل سنوات) ويمنع بالصدفة كل روبوت ذكاء اصطناعي لم يكن موجودًا عندما كُتب القالب. وفي هذا التقرير، تشمل "أي حظر للذكاء الاصطناعي" كلا النوعين؛ أما "الحظر الصريح للذكاء الاصطناعي" فهو الجزء المقصود عمدًا.
الروبوتات ضمن النطاق
تتبعنا 25 روبوتًا، مجمّعة في ثلاث فئات:
- زواحف التدريب للذكاء الاصطناعي (16):
GPTBotوClaudeBotوanthropic-aiوCCBotوGoogle-ExtendedوMeta-ExternalAgentوBytespiderوApplebot-ExtendedوDiffbotوAmazonbotوImagesiftBotوFacebookBotوcohere-aiوAI2BotوOmgiliوOmgilibot. - روبوتات الاستدلال/الاسترجاع المباشر (7):
PerplexityBotوPerplexity-UserوChatGPT-UserوOAI-SearchBotوClaudeBot(الذي يخدم التدريب والاستدلال معًا) وYouBotوDuckAssistBot. - خط الأساس للبحث (6):
GooglebotوBingbotوDuckDuckBotوSlurp(Yahoo) وBaiduspiderوYandexBot.
وبعض الروبوتات تقع على الحد الفاصل بين التدريب والاستدلال. وأبرزها ClaudeBot — إذ أوقفت Anthropic استخدام معرّف العميل الأقدم anthropic-ai في 2024، وتستخدم الآن ClaudeBot للتدريب والاسترجاع المباشر معًا، لذا لم يعد بإمكان قاعدة Disallow: ClaudeBot أن تُترجم بوضوح إلى "حظر التدريب مع الإبقاء على الظهور". أبقينا التصنيف كما هو، وشرحنا تبعاته لاحقًا.
تصنيف القطاعات
صنّفنا كل نطاق إلى واحدة من 16 فئة قطاعية (news وsocial وstreaming وecommerce وsearch وfinance وinfrastructure وsaas وacademia وdev وgov وadult وgambling وtravel وtelecom وunknown) باستخدام نهج متعدد الطبقات:
- قاموس النطاقات المعروفة — خريطة معدّة يدويًا لنحو 500 نطاق عالي الزيارات موزعة على القطاعات.
- أنماط TLD / اللاحقة —
.gov→gov، و.eduو.ac.*→academia، واللواحق المعروفة لـ CDN →infrastructure. - كلمات مفتاحية في اسم النطاق — مثل news وpost وshop وbank وporn وcasino وغيرها كإشارات احتياطية.
- استخراج الصفحة الرئيسية — للمواقع التي لم تستطع الطبقات الثلاث الأولى تصنيفها والتي أعادت
robots.txtبحالة200، جلبنا HTML للصفحة الرئيسية، واستخرجنا<title>و<meta name="description">و<meta property="og:type">، ثم أجرينا ترجيحًا بالكلمات المفتاحية مقابل إشارات الفئات على نمط نماذج اللغة.
وأنتج ذلك 3,407 مواقع (34%) ذات تصنيفات قطاعية مؤكدة، و6,593 موقعًا بقيت unknown. وتغلب على فئة unknown البوابات الإقليمية غير الإنجليزية، ومواقع العلامات التجارية .com للشركات التي لا تقع تحت فئة واحدة واضحة، وناشرو اللغات الصغيرة الذين لا تملك لهم القاموس مدخلات. وعندما يقتبس هذا التقرير نسبةً خاصة بقطاع ما، فإن المقام هو العينة المصنفة لذلك القطاع، لا كامل الـ 10,000.
ثالثًا: النتائج
النتيجة 1 — موقع واحد من كل خمسة مواقع عالية الزيارات يحظر روبوت ذكاء اصطناعي واحدًا على الأقل
من بين 7,248 موقعًا قابلة للتحليل، 1,472 موقعًا (20.31%) تحظر روبوت ذكاء اصطناعي واحدًا على الأقل. و1,230 موقعًا (16.97%) لديها قاعدة مقصودة خاصة بالذكاء الاصطناعي. أما خط الأساس لـ Googlebot فهو 2.18% (158 موقعًا — معظمها إما حظر كل شيء كإعداد افتراضي للصيانة، أو — في ثلاث حالات — محركات بحث تحظر المنافسين).
النسبة الرئيسية البالغة 20% هي أعلى 9 مرات من خط أساس Googlebot. وهذه إشارة حقيقية — فالمواقع عالية الزيارات أكثر احتمالًا بعشر مرات تقريبًا أن تحظر زاحف ذكاء اصطناعي مقارنة بزاحف بحث — لكنها أيضًا أقل بكثير من سردية "حظر الذكاء الاصطناعي بات شبه عالمي" التي تتكرر في الصحافة منذ 2024. حتى بين أكثر 10,000 موقع زيارةً في الويب، لا يزال 5 من كل 6 صامتين بشأن الذكاء الاصطناعي.
والفارق بين "أي حظر للذكاء الاصطناعي" (20.3%) و"الحظر الصريح للذكاء الاصطناعي" (17.0%) صغير من حيث القيمة المطلقة، لكنه مهم من حيث المفهوم. ففارق 3.3 نقطة هو حصة المواقع التي تحظر روبوتات الذكاء الاصطناعي فقط لأن قاعدة User-agent: * \n Disallow: / القديمة لديها تلتقط كل ما يمر، بما في ذلك الروبوتات التي لم تكن موجودة حين كُتبت القاعدة. أما رقم 17.0% المقصود عمدًا فهو القراءة الأنظف لسؤال: "كم موقعًا من أكبر مواقع العالم اتخذ قرارًا خاصًا بالذكاء الاصطناعي؟"
وبالمقارنة مع الأدبيات السابقة:
| المصدر | التاريخ | العينة | معدل الحظر |
|---|---|---|---|
| Originality.ai | مارس 2025 | 1,000 من أشهر الأخبار (بالإنجليزية) | 35.7% تحظر GPTBot |
| Palewire | أغسطس 2024 | 1,500 مؤسسة إخبارية | 36.0% أي زاحف ذكاء اصطناعي |
| Reuters Institute | ربيع 2025 | 50 علامة إخبارية رائدة، 10 دول | 78% أي زاحف ذكاء اصطناعي |
| WIRED / NYT | أواخر 2023 | أكبر 50 موقع أخبار أمريكي | 26% تحظر GPTBot |
| هذا التقرير (Thunderbit) | مايو 2026 | Tranco أفضل 10,000 (جميع القطاعات) | 20.3% / 17.0% صريح |
ونسبتنا الصريحة 17.0% أقل من كل الدراسات الخاصة بالأخبار فقط لأن ثلثي عينتنا ليست أخبارًا. وإذا قصرناها على 650 موقع أخبار نحصل على 47% — وهي ضمن النطاق نفسه الذي وجدته الدراسات السابقة عندما نأخذ تركيب العينة في الحسبان. والصورة البنيوية متسقة: مجموعة الأخبار تحظر الذكاء الاصطناعي بمعدل 3 إلى 4 مرات أعلى من بقية الويب.
النتيجة 2 — غوص في القطاعات: فارق 12 ضعفًا من الأخبار إلى الاتصالات
أكثر نتيجة اقتبست في عامين من تغطية "استخراج البيانات بالذكاء الاصطناعي" كانت رقم 80% من المؤسسات الإخبارية تحظر GPTBot من Originality.ai وPalewire. أما تقسيمنا فيعطي رقمًا أصغر لكنه لا يزال مميزًا: 47.2% من مواقع الأخبار في أفضل 10,000 تحظر روبوت ذكاء اصطناعي واحدًا على الأقل، و45.2% تكتب قاعدة صريحة خاصة بالذكاء الاصطناعي.
لكن "الأخبار مقابل كل شيء آخر" تقسيم خشن جدًا. والتفصيل الكامل (القطاعات التي لديها n ≥ 10 في العينة) يروي قصة أغنى بكثير:

| القطاع | n | أي حظر للذكاء الاصطناعي | صريح | حظر Googlebot | قواعد مكتوبة ذاتيًا | Cloudflare المُدارة | صامت |
|---|---|---|---|---|---|---|---|
| الأخبار | 650 | 47.2% | 45.2% | 1.5% | 46.9% | 1.5% | 48.5% |
| السفر | 64 | 29.7% | 29.7% | 0.0% | 35.9% | 3.1% | 54.7% |
| الاجتماعي | 65 | 29.2% | 23.1% | 4.6% | 23.1% | 6.2% | 66.2% |
| البث | 440 | 20.0% | 17.7% | 0.7% | 16.8% | 3.6% | 75.5% |
| التمويل | 129 | 19.4% | 12.4% | 0.8% | 14.7% | 2.3% | 75.2% |
| التجارة الإلكترونية | 224 | 18.3% | 17.4% | 0.4% | 24.1% | 1.3% | 66.1% |
| المحتوى البالغ | 254 | 17.3% | 14.6% | 0.4% | 10.2% | 7.9% | 79.5% |
| البحث | 12 | 16.7% | 0.0% | 0.0% | 0.0% | 0.0% | 100.0% |
| الأكاديميا | 268 | 14.6% | 13.8% | 0.4% | 13.4% | 3.4% | 77.2% |
| المقامرة | 100 | 14.0% | 13.0% | 0.0% | 18.0% | 4.0% | 77.0% |
| أدوات التطوير | 129 | 10.1% | 7.8% | 0.0% | 8.5% | 5.4% | 77.5% |
| SaaS | 369 | 7.6% | 6.2% | 0.3% | 9.5% | 0.8% | 87.5% |
| الحكومة | 172 | 5.2% | 3.5% | 0.0% | 4.1% | 0.6% | 83.1% |
| البنية التحتية | 47 | 4.3% | 0.0% | 0.0% | 4.3% | 2.1% | 72.3% |
| الاتصالات | 33 | 3.0% | 3.0% | 0.0% | 12.1% | 0.0% | 78.8% |
الفارق 12 ضعفًا بين الأخبار والاتصالات هو ما يجعل "سياسة الذكاء الاصطناعي في الويب" وحدة قياس خاطئة. لا يوجد رقم واحد؛ بل أرقام قطاعية تختلف بمقدار ترتيب كامل. وفيما يلي نعرض أربع نتائج هي الأكثر تميزًا.
الأخبار: 47% حظر، 47% قواعد مكتوبة ذاتيًا. الأخبار هي المجموعة التي كتبت دليل العمل. ويعمل Cloudflare Managed بنسبة 1.5% فقط داخل الأخبار — هؤلاء الناشرون لا يتركون القاعدة لمورّد خارجي. والنص هنا غني على نحو غير معتاد: فتفتح NYT بمقدمة قانونية من 14 سطرًا تذكر "Art. 4 of the EU Directive"؛ وتبدأ BBC بـ "Please use our site like a human, not a robot... TL;DR: Browse, read, watch, enjoy — like a human."؛ وتكتب The Sun "The Sun does not permit the unlicensed use of our content for large language models." هذا هو robots.txt بوصفه بيان سياسة، لا بوصفه إعدادًا تقنيًا.
السفر بنسبة 30% — المفاجأة. تحظر Booking وExpedia وTripAdvisor وKayak وشركات الطيران الكبرى بمعدل يقارب ثلثي معدل الأخبار. والنمط الانتقائي ثابت: حظر متوسط شركات السفر لخمسة إلى سبعة معرّفات تدريب، مع ترك معرّفات الاستدلال (PerplexityBot وChatGPT-User وOAI-SearchBot) دون مساس. فبيانات التسعير والتقييمات المجمعة هي الحصن، بينما الإسناد الراجع إلى الموقع هو العائد الإضافي. هذا هو أوضح نمط "إخراج التدريب وإبقاء الاستدلال" في أي قطاع منفرد.
المحتوى البالغ بنسبة 17% — وهو أيضًا مفاجأة. أظهرت عينات أصغر سابقة نسبة 0%. أما بيانات العينة الكاملة فتُظهر أن موقعًا واحدًا من كل 6 مواقع محتوى بالغ يحظر روبوت ذكاء اصطناعي واحدًا على الأقل، مع أعلى معدل Cloudflare Managed بين أي قطاع (7.9%). وأكثر من نصف حظر الذكاء الاصطناعي في هذا القطاع يأتي من مفتاح Cloudflare، لا من قرار الناشر. تهديد التدريب على توليد الصور هو التهديد الضمني — فالنماذج من فئة StableDiffusion تتعلم الأسلوب البصري أسرع مما تتعلم النماذج اللغوية أسلوب الكتابة.
SaaS بنسبة 7.6% أمر غير بديهي. بائعو البرمجيات هم الأكثر صخبًا في خطاب سياسة الذكاء الاصطناعي، لكن robots.txt لديهم مفتوح على مصراعيه. والقراءة الصحيحة هنا: فرق التسويق في SaaS أدركت أن البحث بالذكاء الاصطناعي قناة توزيع. والبائعون الذين فكروا في الأمر بالفعل يختارون الانضمام، لا الانسحاب — وقائمة Allow: / الصريحة لـ GPTBot (النتيجة 12) تهيمن عليها شركات الأمن وأدوات التطوير SaaS.
الحكومة 5.2%، والاتصالات 3.0%، والبنية التحتية 4.3%، وأدوات التطوير 10.1%. متطلبات السجل العام تجعل Disallow: / أمرًا قانونيًا حساسًا لنطاقات .gov. ومواقع التسويق لشركات الاتصالات تريد الظهور. ونطاقات CDN الجذرية لا تملك شيئًا تحميه. أما أدوات التطوير فتنضم صراحةً لأن محتواها يزداد قيمة عندما تستشهد به النماذج اللغوية.
الخلاصة: لا يوجد رقم واحد من نوع "الويب يحظر الذكاء الاصطناعي / لا يحظره" من دون أن يخفى أكثر مما يوضّح. والتقرير القطاعي هو الطريقة الوحيدة الصادقة لعرض البيانات.
النتيجة 3 — بحسب مورّد الذكاء الاصطناعي: من الأكثر حظرًا؟
الطريقة الطبيعية الأخرى لتقطيع البيانات هي حسب شركة الذكاء الاصطناعي لا حسب الروبوت. فعدة مورّدين يشغلون أكثر من روبوت واحد (OpenAI تشغّل ثلاثة: GPTBot وChatGPT-User وOAI-SearchBot؛ وAnthropic تشغّل اثنين: ClaudeBot وanthropic-ai؛ وMeta تشغّل اثنين: Meta-ExternalAgent وFacebookBot). وتجميع النتائج على مستوى المورّد هو أقرب ما نستطيع الوصول إليه لسؤال: "ماذا يعتقد الويب العام عن كل شركة ذكاء اصطناعي؟"
| مورّد الذكاء الاصطناعي | الروبوتات المجمّعة | المواقع التي تحظر ≥ 1 روبوت | % من العينة القابلة للتحليل |
|---|---|---|---|
| Common Crawl | CCBot | 1,178 | 16.25% |
| OpenAI | GPTBot، ChatGPT-User، OAI-SearchBot | 1,172 | 16.17% |
| Anthropic | ClaudeBot، anthropic-ai | 1,111 | 15.33% |
| ByteDance | Bytespider | 1,082 | 14.93% |
| Meta | Meta-ExternalAgent، FacebookBot | 989 | 13.65% |
Google-Extended | 970 | 13.38% | |
| Amazon | Amazonbot | 877 | 12.10% |
| Apple | Applebot-Extended | 859 | 11.85% |
| Webz.io (Omgili) | Omgili، Omgilibot | 731 | 10.09% |
| Cohere | cohere-ai | 717 | 9.89% |
| Perplexity | PerplexityBot، Perplexity-User | 715 | 9.86% |
| Diffbot | Diffbot | 684 | 9.44% |
| You.com | YouBot | 563 | 7.77% |
| AI2 (Allen AI) | AI2Bot | 487 | 6.72% |
| DuckDuckGo | DuckAssistBot | 482 | 6.65% |
Common Crawl هو الكيان الأكثر استهدافًا على الإطلاق رغم أنه أرشيف ويب غير ربحي، لا مشغل LLM. والسبب هو الرافعة: CCBot يغذي تقريبًا كل النماذج المفتوحة الوزن، وجزءًا كبيرًا من النماذج المغلقة أيضًا. لذا فحظر CCBot أولًا هو أعلى قاعدة تغطية يمكن للناشر كتابتها.
OpenAI وAnthropic وByteDance تتكدس بين 14–16%. وتصدر OpenAI جزئيًا بسبب أثر العدّ (ثلاثة روبوتات لـ OpenAI مقابل روبوت واحد لـ ByteDance). وسلوك Bytespider بنسبة 14.9% هو أثر "سلوك Bytespider" — فقد وُثّق أنه يتجاهل robots.txt منذ 2024، ويقوم الناشرون بحظره كإشارة عامة لا لأنهم يخشون TikTok.
Meta وGoogle وAmazon وApple عند 12–14% تمثل الفئة الثانية — وهي قواعد وقائية أكثر من كونها إعلان موقف. أما المورّدون الأصغر (Webz.io وCohere وPerplexity وDiffbot وYou.com وAI2 وDuckDuckGo) عند 6–10% فترفعهم غالبًا أرضية شاملة بنسبة 3.8%؛ والقواعد الصريحة لهم تقع عادة بين 1–4%.
xAI (Grok) وMistral ومعظم مختبرات النماذج الأوروبية/الصينية غير موجودة في الجدول — لأنها لم تنشر معرّفات زاحف تدريب موثقة. إن منظومة robots.txt الحالية هي حوار بين موردين أمريكيين/صينيين نشروا معرّفات، وناشرين أمريكيين/أوروبيين كتبوا قواعد؛ أما المورّدون الذين لم ينشروا فلا حضور لهم في التفاوض.
النتيجة 4 — CCBot هو نقطة الجذب الجديدة، لا GPTBot
يبدو ترتيب الروبوتات في أفضل 10,000 على النحو التالي:

| الترتيب | الروبوت | معدل الحظر | معدل القاعدة الصريحة |
|---|---|---|---|
| 1 | CCBot (Common Crawl) | 16.25% | 12.90% |
| 2 | GPTBot (OpenAI) | 15.84% | 12.72% |
| 3 | Bytespider (ByteDance) | 14.93% | 11.35% |
| 4 | ClaudeBot (Anthropic) | 14.51% | 11.13% |
| 5 | Google-Extended | 13.38% | 10.18% |
| 6 | Meta-ExternalAgent | 12.38% | 8.95% |
| 7 | Amazonbot | 12.10% | 8.66% |
| 8 | Applebot-Extended | 11.85% | 8.72% |
| 9 | Omgilibot | 10.09% | 5.31% |
| 10 | anthropic-ai (مهمل) | 9.99% | 6.55% |
| 11 | cohere-ai | 9.89% | 6.42% |
| 12 | PerplexityBot | 9.69% | 6.40% |
| 13 | Diffbot | 9.44% | 5.95% |
| 14 | ChatGPT-User (استدلال) | 8.90% | 5.73% |
| 15 | YouBot (استدلال) | 7.77% | 4.29% |
| 16 | OAI-SearchBot (استدلال) | 6.83% | 3.66% |
| خط الأساس | Googlebot | 2.18% | — |
| خط الأساس | Bingbot | 2.27% | — |
القصة التي يرويها هذا الجدول هي أن الروبوت الذي يحظره الويب العام أولًا ليس علامة النموذج التجارية — بل مجموعة البيانات. فقد كان أرشيف Common Crawl الذي يضم 250 مليار صفحة أكبر مدخل تدريبي منفرد لـ GPT-3 وGPT-4 وLlama 1 / 2 / 3 وFalcon وMistral وBLOOM ومعظم النماذج المفتوحة الوزن التي أُطلقت منذ 2020. وأي موقع يريد الانسحاب من "الظهور في الجيل القادم من النماذج" سيحسّن موقفه بحظر CCBot أولًا — فبمجرد أن تغيب عن Common Crawl، تُستبعد عمليًا من خط أنابيب التدريب مفتوح المصدر مجانًا. ويأتي GPTBot وClaudeBot في المرتبتين الثانية والثالثة لأنهما الواجهة الأمامية المرئية لمنتجين تجاريين محددين؛ أما معرّف مجموعة البيانات فهو الهدف البنيوي.
والروبوتات الأقل ترتيبًا في الجدول مفيدة أيضًا. Omgilibot بنسبة 10% مرتفعة بشكل غير معتاد لروبوت قد لا يكون معظم القراء قد سمعوا به — فهو تابع لـ Webz.io، وسيط بيانات محتوى يبيع أرشيفات ويب لمشغلي LLM، وقد بدأت مجموعة كبيرة من المؤسسات الإخبارية تذكره صراحةً في ملفاتها. أما AI2Bot بنسبة 6.7% (مع قاعدة مقابلة Ai2Bot-Dolma في مواقع Squarespace) فتشير إلى أن مجتمع LLM الأكاديمي بدأ هو أيضًا يدخل في قوائم الحظر لدى ناشرين لا يميزون بالضرورة بين "زاحف بحث غير ربحي" و"زاحف تجاري".
مجموعة الاستدلال — ChatGPT-User وOAI-SearchBot وYouBot وPerplexity-User — تقع أقل من مجموعة التدريب بنحو 4 إلى 8 نقاط مئوية. وهذه الفجوة هي الجواب عن سؤال سياساتي مستمر: نعم، المواقع عالية الزيارات تفرّق بين روبوت يجمع بيانات لتدريب مستقبلي وبين روبوت يجري استرجاعًا مباشرًا للإجابة عن سؤال مستخدم الآن. وهي لا تفرّق دائمًا (فقواعد التعميم لا تفعل ذلك)، لكن جزءًا معتبرًا يكتب قواعد تستهدف جانب التدريب تحديدًا.
النتيجة 5 — 14% يحظرون CCBot مع إبقاء Googlebot مرحّبًا به — نمط "احظر المجموعة، وأبقِ البحث"
أكثر قاعدة انتقائية انتشارًا في أفضل 10,000:

| نمط القاعدة | المواقع | % من العينة القابلة للتحليل |
|---|---|---|
حظر CCBot، والسماح لـ Googlebot | 1,023 | 14.11% |
حظر Bytespider، والسماح لـ Googlebot | 926 | 12.78% |
حظر Google-Extended، والسماح لـ Googlebot | 816 | 11.26% |
حظر GPTBot، والسماح لـ OAI-SearchBot | 658 | 9.08% |
حظر GPTBot، والسماح لـ ChatGPT-User | 525 | 7.24% |
حظر CCBot، والسماح لـ PerplexityBot | 519 | 7.16% |
حظر anthropic-ai، والسماح لـ ClaudeBot | 59 | 0.81% |
أكثر الأنماط تبنيًا (14.1%) هو "احظر Common Crawl، وأبقِ ظهورك في بحث Google". أما الوصيف (12.8%) فهو "احظر Bytespider، وأبقِ ظهورك في بحث Google" — أي احظر الزاحف المرتبط بسُمعة ByteDance مع ترك خط الأساس الشرعي للبحث سليمًا. والثالث (11.3%) هو "احظر معرّف Google الخاص بتدريب الذكاء الاصطناعي، وأبقِ معرّف البحث من Google"، وهو بالضبط الفصل الذي صمّمته Google لـ Google-Extended: ينسحب الناشر من تدريب Bard / Gemini من دون خسارة ترتيبه في البحث.
هذه الأرقام الثلاثة معًا تصف الموقف السياسي المهيمن على ويب أفضل 10,000: احظر روبوتات مجموعة التدريب، واترك روبوتات البحث والاستدلال دون مساس. والنمط الأقل انتشارًا من "احظر التدريب، لكن اسمح بمعرّف الاسترجاع المباشر الخاص بهذا الـ LLM" — GPTBot ✗ / ChatGPT-User ✓ بنسبة 7.2% — موجود، لكنه أصغر من القطع على مستوى مجموعة التدريب.
السطر anthropic-ai / ClaudeBot عند 0.81% يعكس إهمال Anthropic لمعرّفها القديم في 2024: إذ بات ClaudeBot يخدم التدريب والاستدلال معًا، مما أزال التعبير الواضح "احظر التدريب واسمح بالاستشهاد" الذي كان يتيحه anthropic-ai. وهذه أكثر قرارات تصميم معرّف العميل قلّةً في النقاش خلال 2024–2025 — فقد أزالت فئة كاملة من التعبير السياسي من robots.txt.
النتيجة 6 — الأخبار بالتفصيل: حسب البلد واللغة
عندما نقسم فئة الأخبار حسب النطاق الأعلى الخاص بالبلد ccTLD — مع الانتباه إلى أن ذلك يعني .de للأخبار الألمانية و.fr للأخبار الفرنسية إلخ، لا اللغة المنشورة نفسها — تكون الفروق داخل الأخبار أكبر من الفروق بين الأخبار وبقية الويب:

| البلد (الأخبار فقط) | n | أي حظر للذكاء الاصطناعي | صريح |
|---|---|---|---|
🇩🇪 ألمانيا (.de) | 25 | 88.0% | 88.0% |
🇫🇷 فرنسا (.fr) | 15 | 80.0% | 80.0% |
🇬🇧 المملكة المتحدة (.co.uk) | 15 | 66.7% | 53.3% |
🇪🇸 إسبانيا (.es) | 5 | 60.0% | 60.0% |
🇮🇹 إيطاليا (.it) | 13 | 53.8% | 53.8% |
الأخبار العالمية (.com/.org/إلخ) | 500 | 45.0% | 42.8% |
🇵🇱 بولندا (.pl) | 7 | 42.9% | 42.9% |
🇯🇵 اليابان (.jp) | 12 | 25.0% | 25.0% |
🇷🇺 روسيا (.ru) | 13 | 0.0% | 0.0% |
🇬🇷 اليونان (.gr) | 6 | 0.0% | 0.0% |
الأخبار الألمانية هي أعلى شريحة حظرًا في مجموعة البيانات كلها بنسبة 88%، وهي 88% صريحة — ولا يوجد عمليًا أي موقع أخبار ألماني ضمن أفضل 10,000 يسمح لوصول زواحف تدريب الذكاء الاصطناعي إلى أرشيفه. وتتقدّم المجموعة Spiegel وBild وWelt وZeit وFAZ وSüddeutsche وHeise وGolem وStern وFocus — أي المؤسسة الصحفية الألمانية السائدة بالكامل، إضافة إلى ناشري التقنية الذين كتبوا قواعدهم بشكل مستقل. والبنية السياسية هنا كثيفة: فـ VG Media، وهي منظمة الحقوق الجماعية للناشرين الألمان، كانت أكثر فئات المدّعين عدوانية في قضايا حقوق النشر الخاصة بالذكاء الاصطناعي في الاتحاد الأوروبي، والمادة 4 من التوجيه الأوروبي مطبقة في القانون الألماني كـ §44b UrhG مع لغة صريحة قابلة للقراءة آليًا للانسحاب. وبحلول وصول موردي الذكاء الاصطناعي، كان الناشرون الألمان الأكثر استعدادًا بين أي مجموعة وطنية لترجمة هذا الموقف القانوني إلى قواعد robots.txt.
أما الأخبار الفرنسية بنسبة 80% فليست بعيدة. والبيئة القانونية الفرنسية مشابهة (نقل التوجيه 2019/790 إلى القانون الفرنسي)، وسلوك المجموعة مشابه أيضًا — إذ تحظر lemonde.fr وlefigaro.fr وliberation.fr وlequipe.fr و20minutes.fr وouest-france.fr، مع إضافة ملف Le Monde استشهادًا بـ droit du producteur de base de données الفرنسي (المادة L 342-1 من Code de la propriété intellectuelle) كأساس قانوني داخلي موازٍ. وتملك فرنسا أيضًا تعقيدًا إضافيًا يتمثل في حكم صادر في 2024 عن المحكمة التجارية في باريس قضى بأن الانسحاب المستند إلى robots.txt كافٍ للإخطار بموجب المادة 4؛ وهذا يوفر سندًا قضائيًا مباشرًا لا تملكه أي ولاية قضائية أخرى حتى الآن.
أما المملكة المتحدة بنسبة 67% فهي أدنى، والسبب أن عددًا من كبريات دور النشر البريطانية (thesun.co.uk وdailymail.co.uk وmirror.co.uk) تستخدم حظرًا عامًا عبر User-agent: * بدل قواعد خاصة بالذكاء الاصطناعي، ما يخفض الرقم الصريح إلى 53%. لكن الأثر الكلي واحد — فهذه المواقع لا تسمح بالزحف الذكي — إلا أن السياسة تُعبَّر عنها بصيغة "لا روبوتات إلا هذه القائمة المسموح بها من محركات البحث" لا بصيغة حظر روبوتات ذكاء اصطناعي بالاسم. كما أن الأساس القانوني أضعف أيضًا: فبعد بريكست ورثت المملكة المتحدة منطق المادة 4، لكن السوابق القضائية المحلية المقابلة أضعف.
الأخبار الروسية بنسبة 0% هي السطر الأكثر إثارة للدهشة. فثلاثة عشر موقعًا إخباريًا من النطاقات الروسية في العينة (dzen.ru وrbc.ru وria.ru وkommersant.ru وtass.ru وlenta.ru وgazeta.ru وinterfax.ru وkp.ru وtass.com إلخ) — ولا واحد منها يحظر أي زاحف ذكاء اصطناعي. والتفسير المرجح: أن تدريب النماذج الروسية يعتمد أساسًا على نماذج Yandex الخاصة الشبيهة بـ GPT (التي تستخدم زواحف داخلية لـ Yandex لا Common Crawl)، وأن بيئة حقوق النشر الروسية لم تعتمد بعد بديلًا مماثلًا للمادة 4، وأن الناشرين الروس الكبار يرون النماذج الغربية غير مؤثرة (فقيود التصدير الأمريكية تحد أصلًا من خدمات OpenAI وAnthropic في روسيا)، بينما يُنظر إلى Yandex بوصفه طرفًا محليًا لا خصمًا. فالموقف السياسي هنا مختلف بوضوح.
أما الأخبار اليابانية بنسبة 25% فتمثل نمطًا ثالثًا. لدى اليابان استثناءات صريحة للتنقيب النصي والبياني في قانون حقوق النشر المحلي (المادة 30-4 من قانون حقوق الطبع والنشر الياباني، المعدلة في 2018) وهي أكثر تساهلًا من المادة 4 من توجيه الاتحاد الأوروبي — إذ تسمح بتنقيب البيانات لأغراض "غير الاستمتاع" بما في ذلك تدريب الذكاء الاصطناعي من دون اشتراط موافقة صاحب الحق. لذا يملك الناشرون اليابانيون قدرة قانونية أقل لطلب الانسحاب، وتكون معدلات robots.txt المقابلة أدنى. والـ 25% الذين يحظرون هم في الغالب أكبر الناشرين وأكثرهم عالمية (asahi.com وnikkei.com) ممن يتموضعون دوليًا لا محليًا.
وتعد بيانات الأخبار العابرة للبلدان أوضح دليل في التقرير على أن الإطار القانوني، لا التكنولوجيا ولا اقتصاديات الصناعة، هو المحرك الأساسي لحظر الذكاء الاصطناعي. إذ تتجمع مجموعات أخبار الاتحاد الأوروبي بين 54% و88%؛ بينما تتراوح مجموعات الأخبار خارج الاتحاد الأوروبي (روسيا، اليابان، ومجموعة .com العالمية) بين 0% و45%. والذروة البالغة 88% تقع في البلد الأكثر نضجًا في تنفيذ المادة 4؛ أما القاع عند 0% ففي البلد الذي يكاد لا يملك قانونًا خاصًا بسياسات الذكاء الاصطناعي على الإطلاق.
النتيجة 7 — الاتحاد الأوروبي مقابل البقية: فجوة 16 نقطة
عند رفع عدسة البلدان مستوى آخرًا، يكون الانقسام العام بين الاتحاد الأوروبي وبقية العالم حادًا:
| المنطقة | n | أي حظر للذكاء الاصطناعي | صريح |
|---|---|---|---|
نطاقات ccTLD للاتحاد الأوروبي (.fr، .de، .es، .it، .nl، .pl، .se، .dk، .fi، .be، .at، .cz، .hu، .ro، .gr، .pt، .ie، .sk، .bg) | 617 | 35.2% | 33.9% |
نطاقات ccTLD الوطنية غير التابعة للاتحاد الأوروبي (.uk، .jp، .kr، .cn، .ru، .br، .in، .au، .mx، .ca، .tr، .ar، .cl، .co، .pe) | 897 | 17.2% | 13.6% |
عالمي (.com، .net، .org، إلخ) | 5,734 | 19.2% | 15.7% |
تحظر مواقع ccTLD التابعة للاتحاد الأوروبي الذكاء الاصطناعي بضعف معدل المجموعة الوطنية غير التابعة للاتحاد الأوروبي، وبنحو ضعفي المعدل العالمي الأساسي لنطاق .com. والفرق متسق عبر الدول الأعضاء في الاتحاد الأوروبي (لا دولة واحدة هي التي تقود المتوسط)، ومتسق عبر القطاعات أيضًا (.de للأخبار عند 88%، و.de لـ SaaS عند نحو 12%، و.de للتجارة الإلكترونية عند نحو 25% — وكلها أعلى من نظيراتها العالمية).
وقد وجدنا 275 ملف robots.txt في أفضل 10,000 يذكر صراحةً التوجيه 2019/790 في تعليقاته — أي نحو 3.8% من العينة القابلة للتحليل. وتهيمن عليه مؤسسات النشر الأوروبية، لكنه يتجاوزها: فعدة علامات إخبارية أمريكية (ولا سيما NYT الذي يذكر مباشرةً "Art. 4 of the EU Directive") وبعض المواقع البريطانية، وعدد محدود من وجهات التجارة الإلكترونية الأوروبية الكبرى، يكررون الصياغة القانونية نفسها. كما تذكر 87 ملفًا "TDM" أو "text and data mining" بالاسم. وتحتوي 460 ملفًا على نوع من لغة الاحتفاظ بالحقوق (مثل "expressly opts out" و"all rights reserved" و"no commercial use" و"no machine learning") حتى عندما لا تذكر نصًا قانونيًا محددًا.
وملاحظتان أكثر تفصيلًا من هذا التقسيم:
تأثير الاتحاد الأوروبي ليس محصورًا في الأخبار. فعندما نثبت الأخبار، تظل المواقع الأوروبية غير الإخبارية تحظر الذكاء الاصطناعي بمعدلات أعلى من المواقع غير الأوروبية غير الإخبارية (نحو 28% مقابل 14%). وقد استبطن جزء صغير لكنه حقيقي من SaaS والتجارة الإلكترونية والأكاديميا في الاتحاد الأوروبي إطار المادة 4 لقطاعاتهم الخاصة.
كما أن لغة الاتحاد الأوروبي أصبحت قالبًا فعليًا حتى خارج الاتحاد الأوروبي. فقالب Cloudflare المُدار لـ robots.txt — المعتمد عالميًا — يذكر صراحةً في نصه القياسي "ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790". أي أن موقعًا أمريكيًا يفعّل إعداد "Block AI Bots" في Cloudflare يعلن، من دون أن يدرك بالضرورة، احتفاظًا بالحقوق وفق نص قانوني أوروبي. وهذه واحدة من أبرز آثار الانجراف في السياسات التي وجدناها: مفهوم قانوني أوروبي يُعولم عبر واجهة منتج لمورّد بنية تحتية أمريكي.
النتيجة 8 — القوالب ومصادر القوالب
توزيع مصادر القوالب بين الـ 6,638 موقعًا التي أعادت robots.txt قابلًا للتحليل:

| القالب | المواقع | الحصة |
|---|---|---|
| لا يوجد ذكر لروبوتات الذكاء الاصطناعي (الإعداد الافتراضي بنمط Shopify أو Yoast أو ملف مكتوب يدويًا من دون مراعاة للذكاء الاصطناعي) | 5,024 | 75.7% |
| قواعد AI مخصصة / مكتوبة ذاتيًا | 1,183 | 17.8% |
Cloudflare Managed (Content-Signal: search=yes,ai-train=no) | 302 | 4.5% |
Allow: / صريح لـ GPTBot | 124 | 1.9% |
| الإعداد الافتراضي لـ Squarespace (28 معرّف AI داخل حظر مقيّد بالمسار) | 5 | 0.1% |
القواعد المكتوبة ذاتيًا تهيمن بنسبة 17.8%. وتقود هذه الفئة كل منصات التواصل الاجتماعي (facebook.com وtwitter.com وlinkedin.com وwhatsapp.com وtiktok.com وsnapchat.com وpinterest.com وx.com وchatgpt.com نفسه)، وأكبر وجهات التجارة الإلكترونية (amazon.com وamazonvideo.com)، والعلامات الإخبارية الكبرى (nytimes.com وcnn.com وbbc.com وtheguardian.com وforbes.com وreuters.com وbbc.co.uk وt-online.de وweather.com)، والمحتوى/الوسائط المتدفقة الأساسية (netflix.com وvimeo.com وsoundcloud.com وimdb.com)، وذيل طويل من مواقع الخدمات المهنية (canva.com وmedium.com).
أما Cloudflare Managed فتقف عند 4.5% — وهي أعلى بكثير من اختراق هذا القالب عند قمة المنحنى، وأقل من انتشاره في الذيل الطويل خارج نافذة هذا التقرير. وأكثر اعتمادًا لهذا القالب يكون في شريحة الترتيب 1001–10000 (4–5%)، وهو شبه غائب من قمة المنحنى (أفضل 100: موقع واحد يستخدمه؛ أفضل 101–1000: 5 مواقع). فالمواقع العالمية الكبيرة تكتب قواعدها بنفسها؛ أما الذيل الطويل فيستخدم المفتاح الجاهز.
ومن المواقع البارزة في Cloudflare Managed: cloudflare.com نفسه يستخدم القالب، وهذا متسق (Cloudflare يستخدم منتجه داخليًا على نطاقه الخاص). و**theatlantic.com يستخدم القالب** — وهو الناشر الأمريكي الإخباري الكبير الوحيد الذي وجدناه لم يكتب قاعدة مخصصة. و**spankbang.com يستخدم القالب** — أعلى موقع بالغ ترتيبًا يعتمد حظرًا من Cloudflare. و**linktr.ee يستخدم القالب**، مانعًا تدريب الذكاء الاصطناعي عبر اقتصاد المبدعين المستضاف على Linktree بقرار مورّد واحد. كما تكتمل المجموعة بمواقع مثل launchpad.net و**nexusmods.com** و**vinted.fr** و**cookielaw.org** و**rustdesk.com** وعدد طويل من المواقع الإعلامية الأصغر.
ونمط اعتماد Cloudflare هو أوضح دليل رأيناه على أن جزءًا كبيرًا من "سياسة الويب تجاه الذكاء الاصطناعي" تُحسمه شركات البنية التحتية. والحصة المطلقة صغيرة (4.5%) لكنها مهمة بنيويًا: فالقالب هو الافتراضي الذي يشحنه Cloudflare، ومسار التشغيل الافتراضي خلال الأشهر الـ 12 المقبلة صاعد. وإذا حوّلت Cloudflare المفتاح إلى مُفعّل افتراضيًا للحسابات الجديدة، فسترتفع نسبة الحظر العالمية ماديًا من دون أي قرار من ناشر فردي.
أما الإعداد الافتراضي لـ Squarespace (5 مواقع في أفضل 10,000، لكن مجموعة أكبر بكثير خارج عينتنا) فهو نمط مختلف: إذ يشحن Squarespace robots.txt يسمي 28 روبوت ذكاء اصطناعي في كتلة واحدة، لكن هذه الروبوتات ترث قيود المسار من User-agent: * بدل أن تحصل على حظر شامل للموقع. وبالتالي يمكن لزواحف الذكاء الاصطناعي جلب / والصفحة الرئيسية وصفحات المنتجات والمدونة، لكنها لا تستطيع جلب /config أو /account. وقد أشرنا سابقًا إلى أن هذا هو مصدر القراءات الخاطئة من نوع "حظر الذكاء الاصطناعي" في المسوح الخارجية لمواقع Squarespace؛ وينطبق التحذير نفسه هنا.
النتيجة 9 — سياسة الذكاء الاصطناعي متجانسة عبر توزيع الترتيب
الفكرة التقليدية في مثل هذه الدراسات هي أن أكثر المواقع زيارةً ستكون الأكثر تشددًا في سياسة الذكاء الاصطناعي — لأنها الأكثر خسارةً من الإزاحة التدريبية، والأقدر قانونيًا، والأكثر تعرضًا للتدقيق العام. لكن البيانات لا تؤيد هذه الفكرة.
| شريحة الترتيب | n | أي حظر للذكاء الاصطناعي | صريح | Cloudflare Managed |
|---|---|---|---|---|
| أفضل 100 | 67 | 22.4% | 17.9% | موقع واحد |
| 101–1,000 | 598 | 22.9% | 19.2% | 5 مواقع |
| 1,001–5,000 | 2,810 | 19.0% | 15.3% | 99 موقعًا |
| 5,001–10,000 | 3,773 | 20.8% | 17.8% | 197 موقعًا |
الشُرَح الأربع تقع بين 19% و23%. فأفضل 100 ليس أشد تشددًا من الذيل الطويل بين 5001 و10000. ويبدو أن النسبة الرئيسية صفة للويب العام في 2026، لا إشارة إلى حجم أو بروز أي موقع فردي.
وهناك عاملان مساهما. أولًا، يهيمن على رأس المنحنى نطاقات البنية التحتية / SaaS / البحث / البوابات (Microsoft وApple وGoogle إلخ) التي تمتلك أصلًا معدلات حظر ذكاء اصطناعي منخفضة. ثانيًا، يضم الذيل الطويل نسبة مرتفعة من الناشرين الإقليميين والمواقع الواقعة تحت اختصاص الاتحاد الأوروبي التي — كما أظهرت النتيجتان 6 و7 — تحظر الذكاء الاصطناعي بمعدل أعلى من المتوسط العالمي. ويتلاشى الأثران تقريبًا، وتصبح النتيجة النهائية عنوانًا متجانسًا.
لكن عمود Cloudflare Managed يتحرك عبر المنحنى. فالشريحة Top 1000 لديها 6 مواقع مُدارة عبر Cloudflare (1.0%)؛ أما الشريحة 1001–10000 فلديها 296 (5.7%). المواقع الكبيرة تكتب قواعدها بنفسها؛ أما الذيل الطويل فيستخدم مفتاح المورد. وهذه هي الإشارة الوحيدة المعتمدة على الترتيب في المجموعة، وهي توحي بأنه كلما نزلت أسفل منحنى الحركة من قمة الويب نحو الذيل الطويل، زادت تدريجيًا حصة سياسة الذكاء الاصطناعي التي يحددها المورّد بدل الناشر. ونتوقع أن يستمر هذا التدرج بعد أفضل 10,000 وصولًا إلى أفضل 100,000 وما بعدها.
النتيجة 10 — خمسة تشريحات: كيف يبدو robots.txt عندما يكون فعليًا سياسة
الأرقام تصف شكل مجموعة البيانات؛ أما الطبيعة الفعلية لـ "سياسة الذكاء الاصطناعي على الويب العام" فترى أفضل ما تكون بقراءة ملفات بعينها. وفيما يلي خمسة ملفات تستحق التوقف عندها، وقد اخترناها لتغطية مساحة السياسة كاملة.
التشريح 1 — New York Times (nytimes.com)
أول 14 سطرًا من nytimes.com/robots.txt:
# محتوى New York Times متاح لاستخدامك الشخصي غير التجاري
# ويخضع لشروط الخدمة الخاصة بنا هنا:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# يُحظر استخدام أي جهاز أو أداة أو عملية مصممة للتنقيب في البيانات أو استخراج
# المحتوى آليًا من دون إذن كتابي مسبق من
# The New York Times Company. وتشمل الاستخدامات المحظورة على سبيل المثال لا الحصر:
# (1) أنشطة التنقيب النصي والبياني بموجب المادة 4 من توجيه الاتحاد الأوروبي بشأن حقوق النشر في
# السوق الرقمية الموحدة؛
# (2) تطوير أي برامج أو تعلّم آلي أو ذكاء اصطناعي (AI)
# و/أو نماذج لغوية كبيرة (LLMs)؛
# (3) إنشاء أو توفير مجموعات بيانات مؤرشفة أو مخزنة مؤقتًا تحتوي على محتوى منا للآخرين؛ و/أو
# (4) أي أغراض تجارية.
# للتواصل: https://nytlicensing.com/contact/ للمساعدة.
هذا هو robots.txt بوصفه مستندًا قانونيًا. فالملف مُصاغ ليكون صالحًا بوصفه دليلًا في التقاضي NYT v. OpenAI الذي تعد طرفًا فيه. والإشارات إلى "Art. 4 of the EU Directive" — من ناشر أمريكي — تجسّد ملاحظة النتيجة 7 بأن الأطر القانونية الأوروبية تتسرب إلى الخطاب العالمي. والحظر الصريح على "إنشاء أو توفير مجموعات بيانات مؤرشفة أو مخزنة مؤقتًا" موجّه مباشرةً إلى Common Crawl. ويضم الملف أكثر من 60 سطرًا مع كتل User-agent مسماة لـ GPTBot وOAI-SearchBot وChatGPT-User وanthropic-ai وClaudeBot وCCBot وGoogle-Extended وApplebot-Extended وBytespider وDiffbot وMeta-ExternalAgent وAmazonbot وOmgili وOmgilibot وعدد من غيرها — فكل روبوت مسمى له Disallow: / خاص به.
التشريح 2 — Der Spiegel (spiegel.de) — الترخيص على مستوى القسم
Der Spiegel هو أكثر ملف robots.txt رصدناه تطورًا تشغيليًا في مجموعة البيانات كلها. والكتلة ذات الصلة:
# TLP-6507: تفعيل تجريبي لزواحف بحث OpenAI لأقسام محددة
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /
User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /
ويُترجم التعليق إلى "تفعيل تجريبي لزواحف بحث OpenAI لأقسام مختارة." فقد وضع Spiegel القائمة البيضاء لسبع فئات محتوى محددة — الأخبار الدولية، والشراكات، والصحة، والأسرة، والسفر، وعلم النفس، ونمط الحياة — لمعرّفات الاستدلال الخاصة بـ OpenAI، مع حظر كل ما عدا ذلك. أما الأقسام السياسية، والأخبار الوطنية الألمانية، والتقارير الاستقصائية، فمستبعدة صراحةً. وتحصل Common Crawl وBytespider وCohere وWebzio-Extended وغيرها من معرّفات التدريب على Disallow: / شامل في مواضع لاحقة من الملف.
هذا هو robots.txt بوصفه سياسة تحريرية على مستوى القسم. والنظرية الضمنية هي أن محتوى نمط الحياة أقل مخاطرةً من حيث الإزاحة التدريبية، وأعلى فائدةً من حيث الاستشهاد الاستدلالي، لذا يسمح Spiegel للذكاء الاصطناعي بإظهار هذه الأقسام؛ بينما المحتوى السياسي والتحقيقي هو الحصن، لذا يُستبعد الذكاء الاصطناعي. ولم نر هذا النمط في مكان آخر. وهو يوحي بمستوى من التنسيق الداخلي بين التحرير والقانون والبنية التحتية لم تصل إليه معظم غرف الأخبار. ونتوقع أن ينتشر هذا النوع من التعبير الدقيق على مستوى الأقسام خلال 2026–2027 — فملف Spiegel هو عمليًا مؤشر مبكر.
التشريح 3 — BBC (bbc.com) — صيغة البيان السياسي
يفتتح ملف BBC robots.txt بـ:
# version: ec59bd036e5138eb4831a9ed44447b1ff310e235
# شروط استخدام BBC: https://www.bbc.co.uk/terms
# - تشرح القواعد الخاصة باستخدام خدماتنا
# - وتخبرك بما يمكنك فعله بمحتوانا
#
# باختصار: يرجى استخدام موقعنا مثل الإنسان، لا مثل الروبوت.
# وهذا يعني:
# - لا استخراجًا آليًا ولا زحفًا ولا تنقيبًا منهجيًا في المحتوى
# - لا استخدامًا لمحتوى BBC في تدريب نماذج الذكاء الاصطناعي أو تحسينها
# بما في ذلك LLMs
# - لا توليدًا معززًا بالاسترجاع (RAG)، ولا بحثًا مدعومًا بالذكاء الاصطناعي، ولا AI الوكيلي، ولا
# الاستناد إلى محتوى BBC
# - لا إنشاء مجموعات بيانات من محتوى BBC
# - لا تنقيبًا نصيًا وبيانيًا (TDM) بموجب المادة 4 من توجيه الاتحاد الأوروبي بشأن حقوق النشر
# - لا استخدامًا لمحتوى BBC لإنشاء ملخصات لاستخدامك الخاص
# - لا استخدامًا تجاريًا من دون إذن
# - تحتفظ BBC بكامل الحقوق في محتواها، وتنسحب صراحةً من أي
# استثناءات قانونية في أي ولاية قضائية تخص التنقيب النصي والبياني،
# بالقدر الذي يسمح به القانون
#
# خلاصة: تصفح واقرأ وشاهد واستمتع — مثل الإنسان.
تضع BBC نسخةً مرقّمة من robots.txt (حيث # version: ec59bd... هو hash من git)، وتحظر ثمانية أنواع محددة من الاستخدامات الذكية التي يتابعها محامو BBC، وتنهي الملف بملخص من سطر واحد بصوتٍ نثري ينسجم مع هوية BBC. وعبارة "expressly opts out of any statutory exceptions in any jurisdiction" تمثل احتفاظًا عالميًا مقصودًا — أي إنها تقول لا نثق بأي نظام قانوني منفرد ليمنحنا الحماية التي نريدها، لذا نعلن الانسحاب في كل مكان دفعة واحدة. وهذا هو أكثر ملفات robots.txt صياغةً في مجموعة البيانات، ويقرأ أقرب إلى بيان صحفي منه إلى ملف إعدادات.
التشريح 4 — WordPress.org — الترحيب الصريح
قارن كل ما سبق بـ wordpress.org:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Bytespider
Allow: /
User-agent: CCBot
Allow: /
User-agent: Copilot
Allow: /
تختار WordPress.org الانضمام صراحةً إلى تسعة زواحف تدريب للذكاء الاصطناعي، بما في ذلك الثلاثة (Bytespider وCCBot وanthropic-ai) التي تُحظر غالبًا في أماكن أخرى. والنظرية الضمنية هنا هي أن وثائق WordPress ومنظومة الإضافات هي منفعة عامة تزيد قيمتها عندما يستطيع مساعدو الذكاء الاصطناعي الإجابة عن الأسئلة المتعلقة بها. فكل مرة يسأل فيها أحد Claude "كيف أضبط الروابط الدائمة في WordPress؟" وكان Claude قد دُرّب على wordpress.org/documentation/، تكون رسالة WordPress قد تحققت. ويبدو أن المؤسسة قررت أن وجودها داخل مجموعة تدريب كل نموذج هو مكسب استراتيجي، واستعملت لغة الملف التعبيرية لتقول ذلك.
التشريح 5 — The Verge (theverge.com) — النموذج الهجين المدعوم
نمط آخر يستحق العرض. تنظم The Verge قواعد الذكاء الاصطناعي لديها بصيغة Disallow: / \ Allow: /sp/:
User-agent: GPTBot
Allow: /
User-agent: Applebot
Allow: /
User-agent: Google-Extended
Disallow: /
Allow: /sp/
User-agent: anthropic-ai
Disallow: /
Allow: /sp/
User-agent: Bytespider
Disallow: /
Allow: /sp/
User-agent: CCBot
Disallow: /
Allow: /sp/
User-agent: ChatGPT-User
Disallow: /
Allow: /sp/
User-agent: ClaudeBot
Disallow: /
Allow: /sp/
مسار /sp/ هو قسم المحتوى المدعوم/الشركاء لدى The Verge. فالمحتوى التحريري محظور من تدريب الذكاء الاصطناعي؛ أما المحتوى المدعوم فيُسمح به. والمنطق الاقتصادي واضح: الرعاة يدفعون لكي يكون محتواهم قابلًا للاكتشاف، بما في ذلك عبر الذكاء الاصطناعي؛ أما الواجهة التحريرية فهي الحصن. وGPTBot مفتوح بالكامل (على الأرجح بسبب علاقة مباشرة مع OpenAI)، وApplebot مفتوح بالكامل كخط أساس للبحث، والبقية يحصلون على المعاملة الهجينة. وهذا هو الهيكل الوحيد من نوع "وصول طبقي للذكاء الاصطناعي" الذي وجدناه.
تصف هذه الملفات الخمسة النطاق الحالي لسياسة الذكاء الاصطناعي في robots.txt. ومعظم ملفات أفضل 10,000 لا تشبه أيًا منها — فهي إما صامتة أو تستخدم قالب مورّد. أما الملفات التي تشبه واحدًا من هذه الخمسة فهي مكتوبة من أشخاص قرروا أن الملف يستحق قراءة دقيقة.
ملاحظة على حجم الملف: الوسيط في حجم نص robots.txt في عينتنا هو 858 بايتًا — وهو صغير جدًا بحيث لا يكفي لسياسة ذكاء اصطناعي ذات معنى. فالطرف الأيمن من التوزيع هو حيث تعيش القواعد: 1,005 مواقع (15.3%) لديها ملف أكبر من 5 كيلوبايت، و273 أكبر من 20 كيلوبايت، وكان الحد الأقصى 248 كيلوبايت. 460 ملفًا يحتوي على لغة للاحتفاظ بالحقوق؛ و275 يذكر توجيه EU 2019/790 بالاسم. ويميل robots.txt في 2026 إلى أن يكون وثيقة مؤرشفة وخاضعة لمراجعة قانونية، لا سطر إعداد تقنيًا.
النتيجة 11 — 108 مواقع ترحّب صراحةً بـ GPTBot
تكتب مجموعة صغيرة لكن واضحة قاعدة User-agent: GPTBot \n Allow: / — وهي عكس الصيغة الأكثر تداولًا "Disallow GPTBot". والعدد الكامل في عينتنا هو 108 مواقع لديها Allow صريح لـ GPTBot على المسار الجذري. وأول 25 موقعًا بحسب ترتيب Tranco:

| الترتيب | النطاق | القطاع |
|---|---|---|
| 42 | wordpress.org | أدوات التطوير / CMS |
| 133 | kaspersky.com | الأمن |
| 187 | avast.com | الأمن |
| 265 | hp.com | الشركة المصنعة للأجهزة |
| 624 | branch.io | SaaS لإحالة الهواتف المحمولة |
| 692 | sophos.com | الأمن |
| 782 | theverge.com | أخبار |
| 905 | rambler.ru | بوابة روسية |
| 945 | kleinanzeigen.de | سوق ألماني |
| 948 | theatlantic.com | أخبار |
| 1,092 | lge.com | LG Electronics |
| 1,300 | justdial.com | بحث محلي هندي |
| 1,332 | avira.com | الأمن |
| 1,412 | youm7.com | أخبار مصرية |
| 1,530 | goodreturns.in | تمويل هندي |
| 1,621 | publi24.ro | إعلانات مبوبة رومانية |
| 1,807 | geocomply.com | SaaS للامتثال |
| 1,908 | nba.com | رياضة |
| 1,956 | oneindia.com | أخبار هندية |
| 1,974 | mindbox.ru | SaaS روسية |
| 2,009 | thesun.co.uk | أخبار |
| 2,126 | vox.com | أخبار |
| 2,140 | mgid.com | إعلانات أصلية |
| 2,314 | ninjarmm.com | SaaS لإدارة تقنية المعلومات |
| 2,323 | norton.com | الأمن |
بعض الأنماط:
شركات الأمن ممثلة فوق المعدل بشكل واضح. Kaspersky وAvast وSophos وAvira وNorton وNinjaRMM تسمح جميعها صراحةً لـ GPTBot. وهذه حركة توزيع مقصودة: فعندما يسأل مستخدم ChatGPT "ما أفضل برنامج مكافحة فيروسات لجهاز ويندوز؟" فإن وجود العلامة التجارية داخل مجموعة تدريب النموذج يؤثر مباشرةً في التوصية. والأمن من الفئات القليلة في منتجات B2C التي بدأ فيها البحث عبر الذكاء الاصطناعي بالفعل يحل محل SEO بوصفه قناة الاستحواذ الأساسية، وقد تحركت هذه العلامات أولًا. ونتوقع أن تتبعها بقية مجموعة الأمن خلال 12 شهرًا.
بعض العلامات الإخبارية الكبرى ضمن هذه القائمة لا ضمن قائمة الحظر. The Verge وThe Atlantic وVox وThe Sun وNBA.com. وهذا ليس تناقضًا — فهذه المؤسسات يبدو أنها رأت أن الظهور القابل للاقتباس داخل بحث ChatGPT أكثر قيمة من الحماية من التدريب، وكتبت قاعدة Allow الصريحة دفاعًا ضد الحظر الزائد في المستقبل من CDN أو CMS. قارن ذلك بموقف NYT وReuters وBBC وForbes وGuardian الذي يعلن Disallow صراحةً. كلا الموقفين قابل للدفاع عنه؛ والصناعة الإخبارية ليست كتلة واحدة.
وجود The Sun لافت لأن الموقع نفسه يستخدم في موضع آخر في ملفه حظرًا عامًا عبر User-agent: *. وأفضل قراءة لسياسة The Sun هي: "التدريب بالذكاء الاصطناعي ممنوع، والبحث بالذكاء الاصطناعي مسموح، وقد خصصنا استثناءً صريحًا لـ GPTBot من الحظر العام حتى نتأكد أن ChatGPT يستطيع الإجابة مستشهدًا بـ The Sun." وهذه هي القاعدة الأكثر تعقيدًا قانونيًا بين قواعد Allow-GPTBot — فهي انسحاب عام مع انضمام من مورد واحد.
أما وجود WordPress.org فهو أهم مدخل منفرد في القائمة. فجزءًا غير صغير من منظومة CMS المفتوحة عالميًا إما يعتمد على WordPress.org في الوثائق أو يستضيف إضافات منه. وبسماحه الصريح لـ GPTBot في wordpress.org/robots.txt، تكون مؤسسة WordPress قد قالت عمليًا إن منظومة وثائق WordPress مفتوحة للتدريب — وهو ما ينعكس على مدى جودة إجابات Claude وGemini وChatGPT عن أسئلة "كيف أفعل..." المتعلقة بـ WordPress.
أما الـ 83 موقعًا الباقية في قائمة Allow-GPTBot الكاملة فهي ذيل طويل من أخبار إقليمية، وبائعين أمنيين أصغر، ومنصات إعلانات مبوبة في أسواق غير ناطقة بالإنجليزية، وSaaS من نوع B2B. وبحسب ما نستطيع القول، لا توجد هنا أي تنسيق صناعي واسع النطاق من نوع "Allow-GPTBot" — فهذه القاعدة تُتبنى موقعًا بموقع، من مشغّلين قرروا أن الوجود داخل المجموعة هو الموقع الاستراتيجي.
النتيجة 12 — llms.txt لا يزال مجرد إشاعة على هذا المقياس
llms.txt، وهو الصيغة البديلة المقترحة لاكتشاف المحتوى الملائم لـ LLMs (تدعمه Mintlify وAnthropic وVercel وعدد قليل من موردي أدوات التطوير منذ أواخر 2024)، يكاد لا يظهر في عينتنا.
من بين 6,638 موقعًا أعادت robots.txt قابلًا للتحليل، 83 موقعًا (1.15%) تذكر llms.txt — وعادةً يكون ذلك في سطر من نوع Sitemap: https://example.com/llms.txt. وهذه النسبة أقل بنحو مرتبتين عشريتين من القياس نفسه عند تطبيقه على عينات تجارة إلكترونية كثيفة بأدوات التطوير، حيث تضخم إعدادات Vercel وMintlify معدل الاعتماد.

وتوزيع الفئات هو:
| القطاع | n | % يذكر llms.txt |
|---|---|---|
| البنية التحتية | 47 | 4.3% |
| المقامرة | 100 | 3.0% |
| SaaS | 369 | 3.0% |
| الاتصالات | 33 | 3.0% |
| التجارة الإلكترونية | 224 | 1.8% |
| السفر | 64 | 1.6% |
| أدوات التطوير | 129 | 1.6% |
| الأخبار | 650 | 0.8% |
| المحتوى البالغ | 254 | 0.4% |
| الحكومة | 172 | 0.0% |
| الأكاديميا | 268 | 0.0% |
| البحث | 12 | 0.0% |
llms.txt يتركز في SaaS المرتبط بأدوات التطوير، والمقامرة (التي تتبنى ميزات robots.txt الجديدة أسرع من القطاعات الخاضعة الأخرى لأنها تملك فرق امتثال معتادة على إضافة طبقات بيانات وصفية)، والتجارة الإلكترونية B2B. وهو غائب بشكل لافت عن الأخبار والحكومة — وهما القطاعان الأكثر انخراطًا في سياسة الذكاء الاصطناعي، واللازمان لكي ينتقل المعيار من "تجربة مورّد" إلى "بروتوكول ويب". وحتى ذلك الحين، يظل llms.txt موجودًا لكنه صغير، وسيكون تدقيق لاحق في أواخر 2026 اختبارًا مفيدًا لإعادة القياس.
المشكلة البنيوية التي يواجهها llms.txt أنه غير موحّد عبر أي مسار IETF، ولم يلتزم كبار موردي الذكاء الاصطناعي باحترامه. فقاعدة robots.txt لها 30 عامًا من بنية الزواحف التحتية مبنية حولها؛ أما llms.txt فلا يملك ذلك. وحتى يعلن مورد كبير واحد على الأقل (OpenAI أو Anthropic أو Google أو Cloudflare) دعمًا رسميًا، يظل الملف عمليًا قطعة تسويقية من منظومة Mintlify / Vercel. ولا نتوقع أن يتغير ذلك في 2026.
النتيجة 13 — القابلية للوصول: لا يزال robots.txt مقروءًا لدى ثلثي الويب الأعلى
ملاحظة جانبية لم تكن مقصودة لتكون نتيجة: 66% من أفضل 10,000 موقع أعادت robots.txt قابلًا للتحليل إلى عنوان IP بحث واحد، و7 مواقع فقط من أصل 10,000 (0.07%) أعادت 429 Too Many Requests. وهذه أخبار جيدة لـ robots.txt بوصفه بروتوكولًا عامًا.
وللمقارنة، فإن نفس خط الأنابيب عند تشغيله على عينة تجارة إلكترونية متوسطة الحجم من 1,008 نطاقًا قبل شهرين فقط تلقى 429 من 52% من النطاقات المحلولة — إذ كانت Shopify وCloudflare CDN يحدّان المعدل بقوة على أي User-Agent غير تابع لمحرك بحث رئيسي. أما الويب عالي الزيارات فهو أكثر ودًّا بكثير: فالمواقع الكبرى أكثر احتمالًا لأن يكون لديها إما (أ) طبقات إدارة بوتات أقل عدوانية، أو (ب) قوائم سماح صريحة لزواحف البحث المعروفة، أو الأمرين معًا.
أما معدل fetch_failed البالغ 21% في أفضل 10,000 فيهيمن عليه نطاقات CDN الجذرية (akamai.net وcloudfront.net وfastly.net وapple-dns.net وgtld-servers.net) التي لا تشغّل خادم ويب على /. فهي لا تحظرنا؛ بل ليس لديها شيء لتقدمه. وبعد استبعادها، فإن معدل الفشل الحقيقي من نوع "حاولنا القراءة ولم نستطع" يقع في خانة الأرقام الفردية المنخفضة.
وهذا يعني أن الإصدارات القادمة من هذا التقرير — لقطات فصلية، ومقارنات سنوية — يمكن تشغيلها بثمن منخفض وبشكل قابل لإعادة الإنتاج على جهاز واحد. نافذة التدقيق تبقى مفتوحة عند قمة المنحنى. أما الحالة غير المتكافئة فهي الذيل الطويل وقطاع التجارة الإلكترونية، حيث أصبح التقييد على مستوى CDN فعليًا قد خصخص robots.txt بالفعل. ونتوقع أن يتسع هذا الانقسام: فالمواقع الكبرى ستظل مقروءة لأن محركات البحث التي تفهرسها تشترط القابلية للقراءة؛ بينما سيصبح الذيل الطويل للتجارة أقل قابلية للقراءة مع شحن Cloudflare لمستويات القتال مع الروبوتات بشكل أكثر عدوانية. وتتصدع قابلية التدقيق العام لـ robots.txt على نفس الخط الفاصل الذي يفصل "الويب المرئي" عن "الويب المحمي تشغيليًا".
رابعًا: ماذا يعني كل هذا
أربع دعاوى، مرتبة بحسب قوة دعم البيانات لها.
1. للإنترنت سياسة ذكاء اصطناعي قطاعية، لا عالمية. الفارق 12 ضعفًا بين الأخبار والاتصالات يهيمن على كل رقم تجميعي. والتقرير عن "X% من الويب يحظر الذكاء الاصطناعي" من دون تقسيم قطاعي يبالغ في SaaS والحكومة وأدوات التطوير، ويقلل من شأن الأخبار والسفر والاجتماعي. والقراءة القطاعية هي الإطار الصادق الوحيد.
2. المادة 4 من توجيه حقوق النشر الأوروبي هي الإطار القانوني الوحيد الذي يحرّك الأرقام بوضوح. مواقع ccTLD التابعة للاتحاد الأوروبي تحظر عند 35% مقابل خط أساس عالمي 19%. أما التقاضي الأمريكي (NYT ضد OpenAI، وتقارير مكتب حقوق النشر في يناير 2025) فقد غيّر مجموعة الأخبار الأمريكية، لكنه لم يغير الويب الأمريكي الأوسع. كما أن الإطار الأوروبي يتسرب عالميًا عبر قالب Cloudflare الذي يستشهد بالتوجيه 2019/790 في نصه القياسي بغض النظر عن ولاية العميل.
3. ثمة "سياستان للذكاء الاصطناعي" متوازيتان تُعبَّران، وهما لا تتفقان. السياسة المقصودة المكتوبة يدويًا (17.8%، ومعظمها أخبار/اجتماعي/سفر/تجارة إلكترونية) والسياسة الموروثة المُدارة عبر Cloudflare (4.5%) تتقاطعان في الجوهر لكن تختلفان في الشرعية. وفي عالم يبحث فيه مشغلو الذكاء الاصطناعي عن غطاء قانوني لتجاهل robots.txt، تكون حجة "لقد كتبناها وراجعناها" أقوى بنيويًا من "أنا فقط فعّلتها". والحافز التقاضي هو نقل السياسة من الفئة الثانية إلى الأولى.
4. ما يحظره الناشرون هو المجموعة لا النموذج. CCBot بنسبة 16.3% — وهي أعلى من أي روبوت يحمل علامة نموذج — هي أوضح بيان على ذلك. فحظر OpenAI لا يخرج الناشر من كونه مستَخدمًا في التدريب؛ أما حظر CCBot فيفعل. 14.1% من أفضل 10,000 تحظر CCBot مع إبقاء Googlebot مرحبًا به. ونمط "احظر التدريب، وابقِ البحث" هو القاعدة الأكثر شيوعًا في 2026.
للمواقع التي تفكر في موقفها: الموقف السائد هو الصمت — 80% من أفضل 10,000 لا تقول شيئًا عن الذكاء الاصطناعي. والـ 17% التي تكتب قواعد تتمحور حول Disallow، لكن مجموعة صغيرة ومتنامية (قائمة Allow الصريحة لـ GPTBot البالغة 1.5%، وتقودها شركات الأمن) تختار علنًا العكس. لا يوجد إجماع صناعي، ولن يوجد خلال الاثني عشر شهرًا القادمة.
لمشغلي الذكاء الاصطناعي: بات من الصعب أكثر فأكثر الاستمرار في القول إن robots.txt بروتوكول قديم ذو دلالات ملتبسة، بينما 17% من أكبر مواقع العالم كتبت قواعد صريحة ومقصودة تسمي الروبوتات بالاسم، و3.8% من الملفات تذكر مادة قانونية أوروبية محددة برقمها. أما الالتزام بهذه القواعد من عدمه فهو قرار تجاري؛ وأما وجودها من عدمه فهو اليوم حقيقة تجريبية.
خامسًا: التوقعات حتى نهاية 2026
ثلاثة مسارات تظهر في البيانات:
ستتضاعف حصة Cloudflare Managed بأكثر من الضعف، وربما تصل إلى أكثر من 10% من أفضل 10,000 القابلة للتحليل. تناقش خارطة طريق Cloudflare علنًا جعل Block AI Bots مُفعّلًا افتراضيًا للحسابات الجديدة. وإذا شُحن المفتاح وهو مفعّل افتراضيًا، فسترتفع نسبة الحظر العالمية بنحو 5 إلى 8 نقاط مئوية من دون أن يتخذ أي ناشر قرارًا. وسنعرف أن هذا يحدث عندما ترتفع حصة Cloudflare Managed في شريحة 5001–10000 فوق مستواها الحالي البالغ 5.7%.
ستنتشر سياسات الذكاء الاصطناعي على مستوى الأقسام (على نمط Spiegel) بين كبار ناشري الأخبار. والمنطق الاقتصادي — اسمح للذكاء الاصطناعي بالاستشهاد بالمحتوى منخفض المخاطر، واحمِ محتوى الحصن — مقنع بما يكفي بحيث نتوقع أن تطلق 10 غرف أخبار رائدة إضافية على الأقل قواعد على مستوى القسم بحلول نهاية 2026. راقبوا الصحافة الألمانية والفرنسية متوسطة المستوى أولًا؛ فالإطار القانوني يكافئ التجريب هناك.
ستكبر مجموعة Allow-GPTBot الصريحة، بقيادة SaaS B2B وأدوات التطوير. عندما يصبح البحث بالذكاء الاصطناعي قناة استحواذ قابلة للقياس لدى بائعي البرمجيات (كما هو الحال أصلًا في الأمن)، سيكتب مدير التسويق الهامشي User-agent: GPTBot \n Allow: / لمنع الحظر الزائد العرضي. ونتوقع أن تتضاعف قائمة الـ 108 مواقع تقريبًا بحلول نهاية العام.
وما لا نتوقعه: أي تغير ذي معنى في حصة الأغلبية الصامتة. فالـ 80% من الويب التي لا تقول شيئًا عن الذكاء الاصطناعي تشمل قطاعات (الحكومة، الاتصالات، البنية التحتية، SaaS B2B) لا تملك سببًا اقتصاديًا لكتابة قاعدة، ولا ضغطًا قانونيًا يدفعها لذلك. سياسة الذكاء الاصطناعي الشاملة لن تأتي.
سادسًا: القيود
- تحيز اللقطة الواحدة. أُجريت عمليات الجلب خلال نافذة 36 ساعة في أوائل مايو 2026. ويتغير الملف يوميًا في أفضل 100؛ لذا توقّع انحرافًا قدره 1–2 نقطة مئوية في الأرقام الرئيسية كل ربع سنة.
- ثغرات تصنيف القطاعات. بقي 6,593 من أصل 10,000 موقع
unknownبعد المصنف ذي الطبقات الأربع. وتكون النسب القطاعية قوية حيث يكون n كبيرًا (الأخبار: 650، البث: 440، SaaS: 369، الأكاديميا: 268، المحتوى البالغ: 254، التجارة الإلكترونية: 224، الحكومة: 172، التمويل: 129، التطوير: 129) وتصبح أكثر ضجيجًا تحت n=30. وينطبق القيد نفسه على تقسيم الأخبار بحسب البلد — فـ DE/FR/UK لديها n≥15، بينما تعتمد كوريا/السويد/التشيك على n=20–25. robots.txtطوعي. فـDisallowطلب لا حاجز. وقد وُثِّق أنBytespiderوPerplexityBotوغيرهما يتجاهلون القواعد. لقد قسنا تصريحات سياسة، لا إنفاذ السياسة.- مراجعة واحدة من IP واحد داخل الولايات المتحدة. لم نتمكن من قراءة 21% من النطاقات المحلولة. ومعظمها نقاط CDN الجذرية التي لا تملك خادم ويب؛ أما جزء صغير فهو مواقع وسمت CDN الخاصة بها طلبنا قبل الوصول إلى الأصل. وهذا يضخم قليلًا انحياز العينة نحو البنية التحتية الأقدم، ويقلل من المواقع المحجوبة جغرافيًا بحسب بلد المنشأ.
- دلالات قائمة Tranco. Tranco يصفّي للاستقرار؛ وليس ترتيبًا حقيقيًا مبنيًا على سلوك المستخدمين. الأرقام التجميعية قوية بغض النظر عن القائمة؛ أما المواضع الدقيقة في الترتيب فليست كذلك.
- لا توجد بيانات حركة مرور. لقد قسنا سياسة
robots.txt، لا تدفق روبوتات الذكاء الاصطناعي الفعلي. والسياسة والحركة لا تتفقان دائمًا.
سابعًا: أعد التجربة
كل ما استُخدم لإنتاج هذا التقرير موجود في مجلد التسليم.
- tranco_top10k.csv — قائمة الإدخال
- out/sites.csv — النطاق × الترتيب × القطاع × اللغة × حالة robots.txt (10,000 صف)
- out/fetch_meta.csv — نتيجة الجلب لكل نطاق (الحالة، المخطط، البايتات، الخطأ)
- out/bot_status.csv — شبكة النطاق × الروبوت (250,000 صف: محظور، لديه قاعدة، حالة الجلب)
- out/site_meta.csv — سجل تحليلي واحد لكل موقع (القالب، القيم المنطقية الملخّصة)
- out/analysis.json — كل مقياس ذُكر في التقرير
- 01_fetch_robots.py و02_classify.py و03_parse_and_analyze.py — خط أنابيب Python الكامل
تحميل جميع البرامج النصية ومجموعات البيانات
نرحب بتصحيحات المنهجية، ومشكلات البيانات، والتحليلات اللاحقة على support@thunderbit.com. ينشر هذا التقرير بشكل مستقل عن أي موقف تجاري تحتفظ به Thunderbit؛ فنحن نبني أداة استخراج ويب مدعومة بالذكاء الاصطناعي، ولدينا مصلحة بنيوية في استمرار robots.txt كعقدة مفيدة وقابلة للقراءة آليًا على الويب العام. والبيانات الواردة في هذا التقرير قائمة بذاتها. — فريق أبحاث Thunderbit، مايو 2026.
جرّب أداة Thunderbit لاستخراج الويب بالذكاء الاصطناعي Get Started Free


