कार्यकारी सारांश
हमने दुनिया की सबसे ज़्यादा ट्रैफ़िक वाली वेबसाइटों की Tranco टॉप 10,000 सूची में मौजूद हर डोमेन की robots.txt फ़ाइल निकाली। फिर हमने हर फ़ाइल को RFC 9309–अनुरूप पार्सर से पार्स किया, यह वर्गीकृत किया कि साइट ने किस AI bot नीति (यदि कोई) को अपनाया है, और गिना कि दुनिया की सबसे ज़्यादा देखी जाने वाली कितनी साइटें वास्तव में ChatGPT, Claude, Perplexity, Gemini, Common Crawl, Bytespider, Apple Intelligence, और 2026 में बड़े भाषा मॉडलों को प्रशिक्षित और सर्व करने वाले अन्य crawlers को ब्लॉक करने की कोशिश करती हैं।
साफ़-सुथरे तरीके से पढ़ी जा सकने वाली robots.txt वाली 7,248 साइटों के नमूने में मुख्य आँकड़े ये रहे:

दुनिया की टॉप 10,000 साइटों में से 20.3% कम-से-कम एक AI crawler को ब्लॉक करती हैं। 17.0% ने जानबूझकर एक स्पष्ट, AI-विशिष्ट नियम लिखा है। बाकी 80% AI crawlers के लिए Googlebot जितनी ही खुली हैं।
कहानी की दिशा बदल देने वाले छह निष्कर्ष:
- समाचार संगठनों में 47% blocking है — किसी भी सेक्टर में सबसे ज़्यादा। जर्मन समाचार 88% पर सबसे आगे, फ्रांसीसी 80% पर, रूसी 0% पर। असली चालक तकनीक या उद्योग-अर्थशास्त्र नहीं, बल्कि कानूनी व्यवस्था है।
CCBot(Common Crawl) 16.3% के साथ सबसे ज़्यादा ब्लॉक किया जाने वाला bot है —GPTBot(15.8%) औरBytespider(14.9%) से भी आगे। प्रकाशक model brand नहीं, बल्कि training corpus को टारगेट करते हैं। सबसे ज़्यादा अपनाया गया चयनात्मक नियम है "CCBotब्लॉक करो,Googlebotको अनुमति दो" (साइटों का 14.1%)।.frसाइटों पर AI-blocking में फ़्रांस 50.6% के साथ सबसे आगे है; EU समूह वैश्विक आधार-रेखा से 16 अंक ऊपर है। 275robots.txtफ़ाइलों में EU Directive 2019/790 का स्पष्ट उल्लेख है। Article 4 ही अकेली कानूनी व्यवस्था है जो साफ़ तौर पर आँकड़े बदल रही है।- 17.8% ने अपने AI नियम खुद लिखे; 4.5% Cloudflare के vendor template पर हैं; 75.7% ने कुछ नहीं कहा। बड़ी साइटें नियम खुद लिखती हैं; लंबी पूँछ वाला हिस्सा toggle का उपयोग करता है। The Atlantic और
cloudflare.comखुद भी Cloudflare Managed सूची में हैं। - 108 साइटें
GPTBotको स्पष्ट रूप से Allow करती हैं — WordPress.org, Kaspersky, Norton, Avast, Sophos, The Verge, The Atlantic, NBA.com, The Sun, Branch.io। सुरक्षा और dev tooling का प्रतिनिधित्व अनुपात से ज़्यादा है। - AI policy, curve के शीर्ष पर जाकर ज़्यादा आक्रामक नहीं होती। Top 100, 101–1000, 1001–5000, 5001–10000 सब 19% और 23% के बीच हैं। मुख्य दर 2026 के सार्वजनिक वेब की विशेषता है, न कि किसी एक साइट के आकार का संकेत।
अब कहानी इस बारे में नहीं रही कि वेब "वापस लड़" रहा है या नहीं। सवाल यह है कि कौन-से उद्योग, कौन-से देश, कौन-सी कानूनी व्यवस्थाएँ, और कौन-से AI vendors सक्रिय नीति के लक्ष्य हैं — और कौन नहीं।
I. पृष्ठभूमि: robots.txt कैसे AI policy artifact बन गया
OpenAI के GPTBot को अगस्त 2023 में लॉन्च करने के बाद से तीन ताकतों ने robots.txt का अर्थ बदल दिया है।
AI vendors की संख्या बढ़ी। Google का Google-Extended, Anthropic का ClaudeBot, ByteDance का Bytespider, Apple का Applebot-Extended, Amazon का Amazonbot, Meta का Meta-ExternalAgent — सब इसके बाद आए। Common Crawl का मौजूदा CCBot सबसे अधिक प्रभाव वाला block target बन गया क्योंकि उसका archive अधिकांश open-weight models को feed करता है। Vendor के बाहर के bots भी आए: AI2Bot, cohere-ai, PerplexityBot, YouBot, DuckAssistBot, Diffbot, Omgili। 2026 की एक व्यापक block list में लगभग 25 नाम आते हैं।
EU Copyright Directive 2019/790 का Article 4 एक statutory text-and-data-mining exception बनाता है, जो तब लागू नहीं होता जब अधिकारधारी ने अपने अधिकारों को "machine-readable" तरीके से "स्पष्ट रूप से आरक्षित" कर दिया हो। 2024–2025 के दौरान EU के प्रकाशकों और उनके वकीलों ने यह आरक्षण दर्ज करने का मानक तरीका robots.txt को मान लिया। हमारे डेटा से पता चलता है कि 275 साइटें Directive 2019/790 का स्पष्ट उल्लेख करती हैं और 87 "TDM" का नाम लेती हैं — यह सब यूरोपीय समाचार साइटों पर केंद्रित है, जहाँ यह 4–8 पंक्तियों की कानूनी भूमिका के रूप में बैठता है।
Cloudflare ने toggle को उत्पाद बनाया। 2024–2025 में Cloudflare ने "AI Audit" dashboard, "Block AI Bots" toggle, और एक Managed robots.txt template जारी किया जिसमें Content-Signal: search=yes,ai-train=no की शब्दावली और EU 2019/790 का boilerplate शामिल था। मई 2026 तक यह template parse हो सकने वाले top 10k में 4.5% पर चल रहा था। Cloudflare की roadmap सार्वजनिक रूप से नए खातों के लिए toggle को default-on बनाने पर चर्चा करती है — जो किसी भी व्यक्तिगत publisher के निर्णय के बिना global block rate को 5–8 points तक हिला देगा।
2026 में robots.txt अब 2022 वाली नीरस configuration file नहीं रही। यह EU में संधि-समर्थित copyright-reservation mechanism है, लंबी पूँछ में vendor-आकार की नीति-सामग्री है, और websites चलाने वाले लोगों तथा models प्रशिक्षित करने वाले लोगों के बीच धीमी बातचीत की अग्रिम पंक्ति है।
II. कार्यप्रणाली
हमने इसे जितना हो सके उतना नीरस और पुनरुत्पादनीय बनाने की कोशिश की। पूरी pipeline (Python scripts, parsed CSVs, raw robots.txt archive, charts) इस report के साथ प्रकाशित है।
नमूना
हमने मई 2026 के Tranco list से शुरुआत की, जिसे top-1m.csv.zip के रूप में डाउनलोड किया गया, और पहले 10,000 rows लिए। Tranco चार upstream rankings (Cisco Umbrella, Majestic, Farsight, और Cloudflare Radar) को एकत्र करता है, 30-दिन की अवधि में स्थिरता के लिए फ़िल्टर करता है, और स्पष्ट crawler/CDN noise हटाता है। इसका बनाया हुआ list खुले इंटरनेट में उपलब्ध "global web traffic top-10k" का सबसे नज़दीकी canonical रूप है, और यह academic web research के लिए मानक sample है (KU Leuven द्वारा 2018 में लॉन्च किए जाने के बाद से 600+ peer-reviewed papers में उपयोग हुआ है)।
इस सूची में (a) वे मुख्य वेबसाइटें शामिल हैं जिन्हें लोग देखते हैं, (b) infrastructure / API / DNS / CDN apex domains शामिल हैं जो कोई / नहीं सर्व करते, और (c) बड़े platforms द्वारा आंतरिक रूप से उपयोग किए जाने वाले domains शामिल हैं (जैसे gvt1.com, apple-dns.net, googleusercontent.com)। इन्हें पहले से फ़िल्टर करने के बजाय हमने सबको रखा और analysis layer में infrastructure category दी। जब हम "ऐसी साइटें जिनकी parseable robots.txt वापस आई" तक सीमित करते हैं, तब ये स्वाभाविक रूप से बाहर हो जाती हैं।
फ़ेचिंग
10,000 domains में से हर एक के लिए हमने HTTPS पर asynchronous GET /robots.txt किया, HTTP fallback के साथ, चार hops तक redirects फॉलो किए, 12-second total timeout, 500 KB body cap, और Accept-Language: en-US के साथ एक real-browser User-Agent string इस्तेमाल की। concurrency 80 requests in flight पर रखी गई। यह काम San Francisco के एक residential IP से चला।
फ़ेच का परिणाम:
| स्थिति | संख्या | अर्थ |
|---|---|---|
200 OK | 6,638 | robots.txt body मिली और parse हो सकी। |
404 Not Found | 610 | कोई robots.txt मौजूद नहीं है। RFC 9309 इसे implicit "सब कुछ अनुमति" मानता है। |
403 Forbidden | 563 | origin सक्रिय रूप से robots.txt requests को अस्वीकार करता है। विश्लेषण से बाहर। |
429 Too Many Requests | 7 | इस rank tier पर CDN-level throttling लगभग नहीं के बराबर है। |
fetch_failed (TLS / DNS / TCP त्रुटि) | 2,065 | अधिकतर CDN apex domains (akamai.net, cloudfront.net, fastly.net, gtld-servers.net, apple-dns.net) जो / पर webserver नहीं चलाते। "ब्लॉक" नहीं — वहाँ देने के लिए robots.txt है ही नहीं। |
| अन्य 4xx/5xx | 117 | मिश्रित — server errors, geofencing, malformed responses. |
इससे विश्लेषण योग्य नमूने में 7,248 साइटें मिलती हैं (6,638 200 + 610 404)। 2,065 fetch_failed वास्तविक domains हैं, लेकिन वे CDN/DNS apex points हैं, websites नहीं, और उन्हें "AI policy" वाला मानना तर्कसंगत नहीं है। वे dataset में अलग accessibility statistic के रूप में रहते हैं।
पार्सिंग
हर 200 body को protego से पार्स किया गया, जो RFC 9309 का Python implementation है और उत्पादन में Scrapy द्वारा उपयोग होता है। हर (site, bot) जोड़ी के लिए हमने तीन चीज़ें निकालीं:
can_fetch_root— क्या bot को/fetch करने की अनुमति है, मानक के group-of-records semantics, longest-match precedence, और जब दोनों मौजूद हों तब विशिष्ट bot block द्वाराUser-agent: *के override के साथ।has_specific_rule— क्या फ़ाइल में इस exact bot का नाम लेने वालीUser-agent:line है (case-insensitive)।disallow_count— matching block में कितनीDisallow:directives हैं, ताकि पूरे साइट पर प्रतिबंध और path-स्तरीय सीमाओं में अंतर किया जा सके।
यह संयोजन इसलिए ज़रूरी है क्योंकि ऊपर से दिखने वाली "block rate" दो बिलकुल अलग घटनाओं को छिपा देती है: ऐसी brands जिन्होंने जानबूझकर User-agent: GPTBot \n Disallow: / लिखा क्योंकि वे जवाब देना चाहते थे, और ऐसी brands जिनका generic User-agent: * \n Disallow: / block (सालों पहले staging या maintenance के लिए सेट किया गया) संयोग से हर AI bot को भी रोक देता है जो उनके template में मौजूद नहीं था। इस report में "कोई भी AI block" संख्या दोनों प्रकारों को शामिल करती है; "स्पष्ट AI block" संख्या जानबूझकर लिखे गए subset को।
दायरे में bots
हमने 25 bots ट्रैक किए, तीन श्रेणियों में:
- AI training crawlers (16):
GPTBot,ClaudeBot,anthropic-ai,CCBot,Google-Extended,Meta-ExternalAgent,Bytespider,Applebot-Extended,Diffbot,Amazonbot,ImagesiftBot,FacebookBot,cohere-ai,AI2Bot,Omgili,Omgilibot. - AI inference / live retrieval bots (7):
PerplexityBot,Perplexity-User,ChatGPT-User,OAI-SearchBot,ClaudeBot(जो training और inference दोनों करता है),YouBot,DuckAssistBot. - Search baseline (6):
Googlebot,Bingbot,DuckDuckBot,Slurp(Yahoo),Baiduspider,YandexBot.
कुछ bots training/inference की रेखा के दोनों ओर आते हैं। ClaudeBot सबसे प्रमुख है — Anthropic ने पुराने anthropic-ai UA को 2024 में बंद कर दिया और अब training और live retrieval दोनों के लिए ClaudeBot इस्तेमाल करता है, इसलिए Disallow: ClaudeBot नियम अब "training ब्लॉक करो लेकिन visibility रखो" का साफ़ मतलब नहीं देता। हमने assignment जस-का-तस रखा है और बाद में इसके परिणाम को स्पष्ट किया है।
उद्योग वर्गीकरण
हमने हर domain को 16 industry buckets (news, social, streaming, ecommerce, search, finance, infrastructure, saas, academia, dev, gov, adult, gambling, travel, telecom, unknown) में एक layered approach से वर्गीकृत किया:
- ज्ञात-domain dictionary — लगभग 500 उच्च-ट्रैफ़िक domains का उद्योगों से हाथ से बनाया गया मानचित्र।
- TLD / suffix patterns —
.gov→gov,.eduऔर.ac.*→academia, पहचाने गए CDN suffixes →infrastructure. - Domain-name keywords — news, post, shop, bank, porn, casino आदि fallback संकेत के रूप में।
- Homepage scrape — जिन sites को पहली तीन परतें वर्गीकृत नहीं कर सकीं और जिन्होंने
robots.txtमें200लौटाया, उनकी homepage HTML ली,<title>,<meta name="description">,<meta property="og:type">निकाला, और language-model-style category cues के विरुद्ध keyword scoring चलाई।
इससे 3,407 साइटें (34%) confident industry tags के साथ मिलीं और 6,593 unknown रहीं। unknown bucket में गैर-अंग्रेज़ी regional portals, ऐसे corporate .com brand sites जो किसी एक bucket में फिट नहीं होते, और छोटे-language-market के पारंपरिक प्रकाशक प्रमुख हैं जिनके लिए हमारे पास dictionary entries नहीं थीं। जहाँ इस report में per-industry प्रतिशत उद्धृत है, वहाँ denominator उस उद्योग का classified sample है, न कि पूरा 10,000।
III. निष्कर्ष
निष्कर्ष 1 — शीर्ष-ट्रैफ़िक साइटों में से पाँच में से एक कम-से-कम एक AI bot को ब्लॉक करती है
7,248 विश्लेषण योग्य साइटों में से 1,472 (20.31%) कम-से-कम एक AI bot को ब्लॉक करती हैं। 1,230 (16.97%) के पास जानबूझकर लिखा गया AI-विशिष्ट नियम है। Googlebot baseline 2.18% है (158 साइटें — जिनमें से अधिकतर ने या तो maintenance default के रूप में सब कुछ ब्लॉक किया, या तीन मामलों में, प्रतिस्पर्धियों को ब्लॉक करने वाले search engines हैं)।
मुख्य 20% संख्या Googlebot baseline से 9 गुना है। यह असली संकेत है — शीर्ष-ट्रैफ़िक साइटों के AI crawler को ब्लॉक करने की संभावना search crawler की तुलना में एक order of magnitude अधिक है — लेकिन यह "AI blocking सार्वभौमिक रूप से अपनाया जा रहा है" वाली कहानी से काफी छोटी भी है, जो 2024 से प्रेस में चल रही है। वेब की सबसे ज़्यादा देखी जाने वाली 10,000 साइटों में भी 6 में से 5 majority AI पर चुप है।
"कोई भी AI block" (20.3%) और "स्पष्ट AI block" (17.0%) के बीच का अंतर पूर्ण रूप से छोटा है, पर वैचारिक रूप से महत्वपूर्ण है। 3.3-point का gap उन साइटों का हिस्सा है जो सिर्फ़ इसलिए AI bots को ब्लॉक करती हैं क्योंकि उनका मौजूदा User-agent: * \n Disallow: / नियम हर चीज़ को पकड़ लेता है, जिसमें वे bots भी हैं जो नियम लिखे जाने के समय अस्तित्व में नहीं थे। 17.0% का जानबूझकर लिखा गया आँकड़ा यह समझने का साफ़ तरीका है कि "दुनिया की सबसे बड़ी कितनी वेबसाइटों ने AI-विशिष्ट निर्णय लिया है।"
पिछले literature की तुलना में:
| स्रोत | तारीख | नमूना | ब्लॉक दर |
|---|---|---|---|
| Originality.ai | मार्च 2025 | 1,000 सबसे लोकप्रिय समाचार (अंग्रेज़ी) | 35.7% ने GPTBot ब्लॉक किया |
| Palewire | अगस्त 2024 | 1,500 समाचार संगठन | 36.0% कोई भी AI crawler |
| Reuters Institute | वसंत 2025 | 50 अग्रणी समाचार ब्रांड, 10 देश | 78% कोई भी AI crawler |
| WIRED / NYT | 2023 के अंत में | शीर्ष 50 अमेरिकी समाचार | 26% ने GPTBot ब्लॉक किया |
| यह report (Thunderbit) | मई 2026 | Tranco top 10,000 (सभी सेक्टर) | 20.3% / 17.0% स्पष्ट |
हमारा 17.0% explicit आँकड़ा हर news-only अध्ययन से कम है क्योंकि हमारे sample का दो-तिहाई हिस्सा news नहीं है। 650 news sites तक सीमित करने पर हमें 47% मिलता है — sample composition को ध्यान में रखने पर यह पिछले अध्ययनों की ही सीमा में है। संरचनात्मक तस्वीर समान है: समाचार समूह web के बाकी हिस्से की तुलना में AI को 3–4 गुना अधिक ब्लॉक करता है।
निष्कर्ष 2 — उद्योग-स्तरीय गहराई: news से telecom तक 12× का फैलाव
दो साल की "AI scraping" कवरेज में सबसे ज़्यादा उद्धृत निष्कर्ष रहा है Originality.ai और Palewire का 80% news outlets block GPTBot आँकड़ा। हमारा कट थोड़ा छोटा, लेकिन फिर भी विशिष्ट है: टॉप 10,000 में 47.2% news sites कम-से-कम एक AI bot को ब्लॉक करती हैं, और 45.2% स्पष्ट AI नियम लिखती हैं।
लेकिन "news बनाम बाकी सब" बहुत मोटा वर्गीकरण है। पूरा breakdown (नमूने में जिन industries का n ≥ 10 है) कहीं अधिक समृद्ध कहानी बताता है:

| उद्योग | n | कोई भी AI block | स्पष्ट | Googlebot blocked | DIY नियम | Cloudflare Managed | Silent |
|---|---|---|---|---|---|---|---|
| समाचार | 650 | 47.2% | 45.2% | 1.5% | 46.9% | 1.5% | 48.5% |
| यात्रा | 64 | 29.7% | 29.7% | 0.0% | 35.9% | 3.1% | 54.7% |
| सामाजिक | 65 | 29.2% | 23.1% | 4.6% | 23.1% | 6.2% | 66.2% |
| स्ट्रीमिंग | 440 | 20.0% | 17.7% | 0.7% | 16.8% | 3.6% | 75.5% |
| वित्त | 129 | 19.4% | 12.4% | 0.8% | 14.7% | 2.3% | 75.2% |
| ई-कॉमर्स | 224 | 18.3% | 17.4% | 0.4% | 24.1% | 1.3% | 66.1% |
| वयस्क | 254 | 17.3% | 14.6% | 0.4% | 10.2% | 7.9% | 79.5% |
| खोज | 12 | 16.7% | 0.0% | 0.0% | 0.0% | 0.0% | 100.0% |
| अकादमिया | 268 | 14.6% | 13.8% | 0.4% | 13.4% | 3.4% | 77.2% |
| जुआ | 100 | 14.0% | 13.0% | 0.0% | 18.0% | 4.0% | 77.0% |
| dev tools | 129 | 10.1% | 7.8% | 0.0% | 8.5% | 5.4% | 77.5% |
| SaaS | 369 | 7.6% | 6.2% | 0.3% | 9.5% | 0.8% | 87.5% |
| सरकार | 172 | 5.2% | 3.5% | 0.0% | 4.1% | 0.6% | 83.1% |
| Infrastructure | 47 | 4.3% | 0.0% | 0.0% | 4.3% | 2.1% | 72.3% |
| दूरसंचार | 33 | 3.0% | 3.0% | 0.0% | 12.1% | 0.0% | 78.8% |
News और telecom के बीच 12× का फैलाव यही दिखाता है कि "web's AI policy" विश्लेषण की गलत इकाई है। एक नंबर नहीं है; sectoral numbers हैं जो order of magnitude से अलग हैं। नीचे हम चार सबसे विशिष्ट निष्कर्षों पर चलते हैं।
News: 47% blocking, 47% DIY. News वही समूह है जिसने playbook लिखा। news में Cloudflare Managed केवल 1.5% पर चलता है — ये प्रकाशक नियम किसी और को नहीं सौंपते। टेक्स्ट असामान्य रूप से समृद्ध है: NYT 14-पंक्ति के कानूनी preamble से शुरू होता है जिसमें "Art. 4 of the EU Directive" का हवाला है; BBC का आरंभ "Please use our site like a human, not a robot... TL;DR: Browse, read, watch, enjoy — like a human." से होता है; The Sun लिखता है "The Sun does not permit the unlicensed use of our content for large language models." यह robots.txt एक policy statement के रूप में है, configuration के रूप में नहीं।
Travel में 30% — आश्चर्य। Booking, Expedia, TripAdvisor, Kayak, और बड़े airlines news दर के लगभग दो-तिहाई पर ब्लॉक करते हैं। चयनात्मक pattern सुसंगत है: औसत travel blocker 5–7 training UAs को disallow करता है लेकिन inference UAs (PerplexityBot, ChatGPT-User, OAI-SearchBot) को छूता नहीं। एकत्रित pricing और review data moat है; साइट की ओर citations upside हैं। किसी भी एक उद्योग में यह सबसे साफ़ "training बाहर, inference अंदर" pattern है।
Adult में 17% — एक और आश्चर्य। पहले के छोटे नमूनों में 0% दिखा था। पूरे sample के डेटा में 6 में से 1 adult site कम-से-कम एक AI bot को disallow करती है, और किसी भी sector में सबसे ऊँची Cloudflare Managed दर (7.9%) यहीं है। adult sites के AI blocks का आधे से ज़्यादा हिस्सा Cloudflare toggle से आता है, publisher के निर्णय से नहीं। image-generation training छिपा हुआ ख़तरा है — StableDiffusion-श्रेणी के models visual style को text models के writing style सीखने से तेज़ सीख लेते हैं।
SaaS में 7.6% counterintuitive है। Software vendors AI-policy discourse में सबसे मुखर segment हैं, लेकिन उनकी robots.txt काफ़ी खुली है। सही व्याख्या: SaaS marketing teams ने AI search को वितरण चैनल के रूप में सही पहचाना है। जिन्होंने वास्तव में इस पर सोचा है वे opt out नहीं, opt in कर रहे हैं — explicit-Allow-GPTBot सूची (निष्कर्ष 12) में सुरक्षा और dev-tooling SaaS का प्रभुत्व है।
सरकार 5.2%, telecom 3.0%, infrastructure 4.3%, dev 10.1%. सार्वजनिक-रिकॉर्ड अनिवार्यताएँ .gov के लिए Disallow: / को कानूनी रूप से जटिल बनाती हैं। Telecom marketing sites खोजयोग्यता चाहती हैं। CDN apex domains के पास बचाने लायक कुछ नहीं है। Dev tooling स्पष्ट रूप से opt in करती है (उसका content तब मूल्यवान होता है जब LLMs उसका हवाला दें)।
निष्कर्ष: ऐसा कोई एकल "web AI को block कर रहा है / नहीं कर रहा है" आँकड़ा नहीं है जो कही गई बात से ज़्यादा न खो दे। डेटा पर ईमानदार चर्चा का एकमात्र तरीका sector-level reporting है।
निष्कर्ष 3 — प्रति AI vendor: किसे सबसे ज़्यादा ब्लॉक किया जा रहा है?
डेटा को देखने का दूसरा स्वाभाविक तरीका bot के बजाय AI company के हिसाब से है। कई vendors के कई bots हैं (OpenAI के तीन: GPTBot, ChatGPT-User, OAI-SearchBot; Anthropic के दो: ClaudeBot, anthropic-ai; Meta के दो: Meta-ExternalAgent, FacebookBot)। vendor स्तर पर जोड़ना हमें इस सवाल के सबसे करीब ले जाता है कि "सार्वजनिक web हर AI company के बारे में क्या सोचता है?"
| AI vendor | एकत्रित bots | ≥1 bot ब्लॉक करने वाली साइटें | विश्लेषण योग्य का % |
|---|---|---|---|
| Common Crawl | CCBot | 1,178 | 16.25% |
| OpenAI | GPTBot, ChatGPT-User, OAI-SearchBot | 1,172 | 16.17% |
| Anthropic | ClaudeBot, anthropic-ai | 1,111 | 15.33% |
| ByteDance | Bytespider | 1,082 | 14.93% |
| Meta | Meta-ExternalAgent, FacebookBot | 989 | 13.65% |
Google-Extended | 970 | 13.38% | |
| Amazon | Amazonbot | 877 | 12.10% |
| Apple | Applebot-Extended | 859 | 11.85% |
| Webz.io (Omgili) | Omgili, Omgilibot | 731 | 10.09% |
| Cohere | cohere-ai | 717 | 9.89% |
| Perplexity | PerplexityBot, Perplexity-User | 715 | 9.86% |
| Diffbot | Diffbot | 684 | 9.44% |
| You.com | YouBot | 563 | 7.77% |
| AI2 (Allen AI) | AI2Bot | 487 | 6.72% |
| DuckDuckGo | DuckAssistBot | 482 | 6.65% |
Common Crawl अकेला सबसे ज़्यादा निशाना बनाया गया entity है जबकि वह non-profit web archive है, LLM operator नहीं। वजह है leverage: CCBot लगभग हर open-weight model और closed ones के एक बड़े हिस्से को feed करता है। पहले CCBot को ब्लॉक करना वह highest-coverage नियम है जो कोई publisher लिख सकता है।
OpenAI, Anthropic, ByteDance 14–16% पर clustered हैं। OpenAI की lead आंशिक रूप से counting artifact है (ByteDance के एक bot के मुक़ाबले OpenAI के तीन bots)। Bytespider का 14.9% "Bytespider व्यवहार" प्रभाव है — 2024 से उसके robots.txt न मानने का दस्तावेज़ीकरण है, और प्रकाशक उसे TikTok से डरकर नहीं, बल्कि सार्वजनिक संकेत के रूप में ब्लॉक करते हैं।
Meta, Google, Amazon, Apple 12–14% दूसरे tier में हैं — यह एक statement से अधिक defensive लेखन है। छोटे vendors (Webz.io, Cohere, Perplexity, Diffbot, You.com, AI2, DuckDuckGo) 6–10% पर हैं, और इनमें से ज़्यादातर 3.8% के catch-all floor से ऊपर खिंचते हैं; इनके लिए स्पष्ट नियम 1–4% के दायरे में हैं।
xAI (Grok), Mistral, और अधिकांश यूरोपीय/चीनी model labs तालिका में नहीं हैं — उन्होंने documented training-crawler UAs प्रकाशित नहीं किए। मौजूदा robots.txt ecosystem उन US/Chinese vendors के बीच संवाद है जिन्होंने UAs शिप किए और उन US/EU publishers के बीच जिन्होंने नियम लिखे; जिन्होंने शिप नहीं किया वे बातचीत में दिखाई ही नहीं देते।
निष्कर्ष 4 — CCBot नया lightning rod है, GPTBot नहीं
टॉप-10k पर bot की क्रमबद्धता कुछ ऐसी दिखती है:

| क्रम | Bot | ब्लॉक दर | स्पष्ट-नियम दर |
|---|---|---|---|
| 1 | CCBot (Common Crawl) | 16.25% | 12.90% |
| 2 | GPTBot (OpenAI) | 15.84% | 12.72% |
| 3 | Bytespider (ByteDance) | 14.93% | 11.35% |
| 4 | ClaudeBot (Anthropic) | 14.51% | 11.13% |
| 5 | Google-Extended | 13.38% | 10.18% |
| 6 | Meta-ExternalAgent | 12.38% | 8.95% |
| 7 | Amazonbot | 12.10% | 8.66% |
| 8 | Applebot-Extended | 11.85% | 8.72% |
| 9 | Omgilibot | 10.09% | 5.31% |
| 10 | anthropic-ai (deprecated) | 9.99% | 6.55% |
| 11 | cohere-ai | 9.89% | 6.42% |
| 12 | PerplexityBot | 9.69% | 6.40% |
| 13 | Diffbot | 9.44% | 5.95% |
| 14 | ChatGPT-User (inference) | 8.90% | 5.73% |
| 15 | YouBot (inference) | 7.77% | 4.29% |
| 16 | OAI-SearchBot (inference) | 6.83% | 3.66% |
| baseline | Googlebot | 2.18% | — |
| baseline | Bingbot | 2.27% | — |
यह तालिका जो कहानी बताती है, वह यह है कि सार्वजनिक web सबसे पहले model brand नहीं, बल्कि corpus को ब्लॉक करता है। Common Crawl का 250-बिलियन-पेज archive GPT-3, GPT-4, Llama 1 / 2 / 3, Falcon, Mistral, BLOOM, और 2020 के बाद जारी अधिकांश open-weight models के लिए अकेला सबसे बड़ा training input रहा है। जो site "अगले frontier model में शामिल नहीं होना" चाहती है, वह पहले CCBot को disallow करके optimize करती है — एक बार आप Common Crawl में नहीं हैं, तो आप practically मुफ्त में open-source training pipeline से बाहर हैं। GPTBot और ClaudeBot दूसरे और तीसरे स्थान पर आते हैं क्योंकि वे दो विशिष्ट commercial products के visible front-end हैं; corpus-level UA ही संरचनात्मक लक्ष्य है।
तालिका में नीचे के AI bots भी उपयोगी संकेत देते हैं। Omgilibot का 10% पर होना असामान्य रूप से ऊँचा है, जबकि बहुत से पाठकों ने इसका नाम शायद नहीं सुना होगा — यह Webz.io द्वारा चलाया जाता है, जो LLM operators को web archives बेचने वाला content-data broker है, और समाचार संगठनों का एक बड़ा समूह अब अपनी फ़ाइलों में इसे साफ़-साफ़ नाम देता है। AI2Bot का 6.7% (और Squarespace sites पर संबंधित Ai2Bot-Dolma नियम) यह सुझाता है कि academic LLM community भी publishers द्वारा फ़्लैग की जा रही है, जो ज़रूरी नहीं कि "गैर-लाभकारी research crawler" और "commercial crawler" में अंतर करें।
Inference समूह — ChatGPT-User, OAI-SearchBot, YouBot, Perplexity-User — training समूह से 4–8 percentage points नीचे है। यह अंतर एक लंबे समय से चल रहे policy प्रश्न का उत्तर है: हाँ, शीर्ष-ट्रैफ़िक साइटें उस bot में अंतर करती हैं जो भविष्य के model training के लिए data इकट्ठा कर रहा है और उस bot में जो अभी-की-अभी user के सवाल का उत्तर देने के लिए live retrieval कर रहा है। वे हमेशा यह अंतर नहीं करतीं (catch-all rules नहीं करतीं), लेकिन एक अर्थपूर्ण हिस्सा ऐसे नियम लिखता है जो खास तौर पर training side को target करते हैं।
निष्कर्ष 5 — 14% CCBot को ब्लॉक करते हैं लेकिन Googlebot को खुला रखते हैं — "corpus ब्लॉक करो, search रखो" pattern
टॉप-10k पर सबसे अधिक अपनाया गया चयनात्मक नियम:

| नियम pattern | साइटें | विश्लेषण योग्य का % |
|---|---|---|
CCBot ब्लॉक करो, Googlebot को अनुमति दो | 1,023 | 14.11% |
Bytespider ब्लॉक करो, Googlebot को अनुमति दो | 926 | 12.78% |
Google-Extended ब्लॉक करो, Googlebot को अनुमति दो | 816 | 11.26% |
GPTBot ब्लॉक करो, OAI-SearchBot को अनुमति दो | 658 | 9.08% |
GPTBot ब्लॉक करो, ChatGPT-User को अनुमति दो | 525 | 7.24% |
CCBot ब्लॉक करो, PerplexityBot को अनुमति दो | 519 | 7.16% |
anthropic-ai ब्लॉक करो, ClaudeBot को अनुमति दो | 59 | 0.81% |
सबसे ज़्यादा अपनाया गया pattern (14.1%) है "Common Crawl को ब्लॉक करो, Google search visibility बनाए रखो।" दूसरे स्थान पर (12.8%) है "Bytespider को ब्लॉक करो, Google search visibility बनाए रखो" — यानी ByteDance के reputation-flagged crawler को ब्लॉक करना, जबकि वैध search baseline को वैसे का वैसा छोड़ देना। तीसरे स्थान पर (11.3%) है "Google के अपने AI-training UA को ब्लॉक करो लेकिन Google के search UA को रहने दो," जो वही split है जिसके लिए Google ने Google-Extended बनाया था: publisher Bard / Gemini training से opt out कर सके बिना search ranking खोए।
ये तीनों आँकड़े मिलकर top-10k web पर प्रमुख policy posture बताते हैं: training-corpus bots को disallow करो, search और inference bots को छेड़ो नहीं। "training को disallow करो लेकिन इस LLM के विशिष्ट live-retrieval UA को अनुमति दो" वाला अल्पसंख्यक pattern — GPTBot ✗ / ChatGPT-User ✓ 7.2% पर — मौजूद है, लेकिन corpus-level cuts से छोटा है।
anthropic-ai / ClaudeBot की 0.81% वाली पंक्ति Anthropic के 2024 UA deprecation को दर्शाती है: अब ClaudeBot training और inference दोनों के लिए है, जिससे Claude के लिए वह साफ़ "training ब्लॉक करो, citation रहने दो" अभिव्यक्ति ख़त्म हो गई जो पुराने anthropic-ai UA से संभव थी। यह 2024–2025 का सबसे कम चर्चित UA-design निर्णय है — इसने robots.txt से policy expression की एक पूरी श्रेणी हटा दी।
निष्कर्ष 6 — समाचार विस्तार से: देश और भाषा के अनुसार
जब हम news category को country-code TLD के अनुसार विभाजित करते हैं — यह ध्यान रखते हुए कि इसका मतलब जर्मन news के लिए .de, फ्रांसीसी news के लिए .fr आदि है, न कि परोसी जा रही भाषा — तब news के भीतर का अंतर news और बाकी सब के बीच के अंतर से भी बड़ा निकलता है:

| देश (केवल समाचार) | n | कोई भी AI block | स्पष्ट |
|---|---|---|---|
🇩🇪 जर्मनी (.de) | 25 | 88.0% | 88.0% |
🇫🇷 फ़्रांस (.fr) | 15 | 80.0% | 80.0% |
🇬🇧 यूनाइटेड किंगडम (.co.uk) | 15 | 66.7% | 53.3% |
🇪🇸 स्पेन (.es) | 5 | 60.0% | 60.0% |
🇮🇹 इटली (.it) | 13 | 53.8% | 53.8% |
वैश्विक समाचार (.com/.org/आदि) | 500 | 45.0% | 42.8% |
🇵🇱 पोलैंड (.pl) | 7 | 42.9% | 42.9% |
🇯🇵 जापान (.jp) | 12 | 25.0% | 25.0% |
🇷🇺 रूस (.ru) | 13 | 0.0% | 0.0% |
🇬🇷 ग्रीस (.gr) | 6 | 0.0% | 0.0% |
जर्मन समाचार पूरे dataset में 88% पर सबसे अधिक block करने वाला उप-खंड है, और वह 88% explicit भी है — top 10k में लगभग कोई भी जर्मन news site ऐसा नहीं जो AI training crawlers को अपने archive तक पहुँचने दे। इस समूह का नेतृत्व Spiegel, Bild, Welt, Zeit, FAZ, Süddeutsche, Heise, Golem, Stern, Focus — पूरा मुख्यधारा जर्मन publishing establishment, साथ ही वे tech publishers जो स्वतंत्र रूप से नियम लिखते हैं। इसके पीछे की राजनीतिक संरचना घनी है: VG Media, जर्मन publishers का collective rights संगठन, EU AI-copyright litigation में सबसे आक्रामक plaintiff समूहों में रहा है, और EU Directive का Article 4 जर्मन कानून में §44b UrhG के रूप में machine-readable opt-out भाषा के साथ लागू है। AI vendors के आने तक, जर्मन publishers किसी भी national cohort से अधिक तैयार थे कि इस कानूनी रुख को robots.txt नियमों में बदल दें।
फ़्रांसीसी समाचार 80% पर बस थोड़ा पीछे है। फ्रांसीसी कानूनी माहौल मिलता-जुलता है (Directive 2019/790 फ्रांसीसी कानून में transposed), और cohort का व्यवहार भी समान है — lemonde.fr, lefigaro.fr, liberation.fr, lequipe.fr, 20minutes.fr, ouest-france.fr सब ब्लॉक करते हैं, जबकि Le Monde की फ़ाइल फ्रांसीसी droit du producteur de base de données (Code de la propriété intellectuelle का Article L 342-1) को समान घरेलू कानूनी आधार के रूप में अतिरिक्त रूप से उद्धृत करती है। फ़्रांस में 2024 का एक Paris commercial court ruling भी है जिसमें कहा गया कि robots.txt-आधारित opt-out Article 4 के तहत पर्याप्त सूचना है; इससे सीधे case-law का सहारा मिलता है जो अभी तक किसी अन्य क्षेत्राधिकार में नहीं है।
UK 67% पर है और वजह यह है कि कई बड़े UK publishers (thesun.co.uk, dailymail.co.uk, mirror.co.uk) AI-विशिष्ट नियमों के बजाय User-agent: * deny-all blocks का उपयोग करते हैं, जिससे explicit संख्या 53% तक नीचे आ जाती है। कुल प्रभाव वही है — ये साइटें AI crawling की अनुमति नहीं देतीं — लेकिन नीति "सर्च engines की इस specific allowlist को छोड़कर बाकी सब robots नहीं" के रूप में व्यक्त होती है, named-AI-bot disallow की तरह नहीं। कानूनी ढांचा भी कमज़ोर है: Brexit के बाद UK ने Article 4 logic विरासत में ली, लेकिन संबंधित घरेलू case law कमज़ोर है।
रूसी समाचार 0% पर होना सबसे आश्चर्यजनक पंक्ति है। नमूने में तेरह रूसी-domain news sites (dzen.ru, rbc.ru, ria.ru, kommersant.ru, tass.ru, lenta.ru, gazeta.ru, interfax.ru, kp.ru, tass.com, आदि) — इनमें से कोई भी किसी AI crawler को ब्लॉक नहीं करता। संभावित कारण: रूसी-भाषा LLM training में Yandex के अपने GPT-style models हावी हैं (जो Yandex-internal crawlers का उपयोग करते हैं, Common Crawl का नहीं), रूसी copyright वातावरण ने Article 4 जैसा समकक्ष नहीं अपनाया है, और प्रमुख रूसी प्रकाशक Western LLMs को मुद्दा नहीं मानते (US export controls पहले से रूस में OpenAI/Anthropic सेवाओं को सीमित करते हैं) तथा Yandex को प्रतिद्वंद्वी नहीं, घरेलू हितधारक समझते हैं। policy posture साफ़ तौर पर अलग है।
जापानी समाचार 25% पर तीसरा pattern है। जापान के घरेलू copyright law में text-and-data-mining exceptions स्पष्ट हैं (Japanese Copyright Act का Article 30-4, 2018 में संशोधित) जो EU Directive के Article 4 से अधिक उदार हैं — वे AI training सहित "non-enjoyment" उद्देश्यों के लिए TDM की अनुमति देते हैं, बिना अधिकारधारी की सहमति की आवश्यकता के। Japanese publishers के पास opt-out का कम कानूनी आधार है और इसी कारण robots.txt दरें कम हैं। जो 25% ब्लॉक करते हैं, वे ज़्यादातर सबसे बड़े, सबसे cosmopolitan publishers हैं (asahi.com, nikkei.com) जो घरेलू से अधिक अंतरराष्ट्रीय रूप से स्थित हैं।
देश-दर-देश news data इस report का सबसे साफ़ सबूत है कि असली चालक कानूनी व्यवस्था है, न कि तकनीक या उद्योग-अर्थशास्त्र। EU news cohorts 54% और 88% के बीच cluster करती हैं; non-EU news cohorts (Russia, Japan, global .com cohort) 0% से 45% तक हैं। 88% का शिखर उसी देश में है जहाँ Article 4 का implementation सबसे परिपक्व है; 0% का तल उस देश में है जहाँ AI-policy कानून लगभग नहीं है।
निष्कर्ष 7 — EU बनाम बाकी दुनिया: 16 अंकों का अंतर
देश के lens को एक स्तर ऊपर ले जाएँ तो व्यापक EU-vs-rest विभाजन स्पष्ट है:
| क्षेत्र | n | कोई भी AI block | स्पष्ट |
|---|---|---|---|
EU ccTLDs (.fr, .de, .es, .it, .nl, .pl, .se, .dk, .fi, .be, .at, .cz, .hu, .ro, .gr, .pt, .ie, .sk, .bg) | 617 | 35.2% | 33.9% |
गैर-EU national ccTLDs (.uk, .jp, .kr, .cn, .ru, .br, .in, .au, .mx, .ca, .tr, .ar, .cl, .co, .pe) | 897 | 17.2% | 13.6% |
वैश्विक (.com, .net, .org, आदि) | 5,734 | 19.2% | 15.7% |
EU ccTLD sites AI को गैर-EU national cohort की दर से दोगुना और global .com baseline की दर के लगभग दोगुना ब्लॉक करती हैं। यह अंतर EU सदस्य देशों में सुसंगत है (औसत को कोई एक देश नहीं चलाता) और industries में भी सुसंगत है (.de news 88%, .de SaaS ~12%, .de e-commerce ~25% — सब अपने वैश्विक समकक्षों से ऊपर)।
हमें top-10k में 275 robots.txt फ़ाइलें मिलीं जो टिप्पणियों में Directive 2019/790 का स्पष्ट उल्लेख करती हैं — parseable sample का लगभग 3.8%। यह समूह EU प्रकाशकों से भरा है लेकिन उन्हीं तक सीमित नहीं है: कई US news brands (विशेष रूप से NYT, जो सीधे "Art. 4 of the EU Directive" का उल्लेख करता है), कुछ UK sites, और कुछ बड़े यूरोपीय e-commerce destinations भी इस कानूनी भाषा को दोहराते हैं। 87 फ़ाइलों में "TDM" या "text and data mining" का नाम आता है। 460 फ़ाइलों में किसी न किसी प्रकार की copyright-reservation भाषा है ("expressly opts out," "all rights reserved," "no commercial use," "no machine learning") भले ही वे किसी विशिष्ट statute का उल्लेख न करें।
इस slice से दो और सूक्ष्म अवलोकन:
EU effect सिर्फ़ news तक सीमित नहीं है। जब हम news को स्थिर रखते हैं, तो EU के non-news sites भी non-EU non-news sites की तुलना में AI को ज़्यादा दर पर ब्लॉक करते हैं (लगभग 28% बनाम 14%)। EU SaaS, e-commerce, और academia का एक छोटा लेकिन वास्तविक हिस्सा अपने-अपने क्षेत्रों के लिए Article 4 frame को आत्मसात कर चुका है।
EU-स्वर वाली भाषा EU के बाहर भी एक de facto template बनती जा रही है। Cloudflare Managed robots.txt template — जो वैश्विक रूप से अपनाया गया — अपने boilerplate में स्पष्ट रूप से "ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790" का हवाला देता है। जो US site Cloudflare की "Block AI Bots" setting चालू करती है, वह संभव है जाने बिना ही EU-आधारित statutory reservation of rights जता रही हो। यह उन दिलचस्प policy-drift artifacts में से एक है जो हमें मिले: एक यूरोपीय कानूनी अवधारणा एक US infrastructure provider के product UI के माध्यम से वैश्वीकृत हो रही है।
निष्कर्ष 8 — Templates और template origins
6,638 sites के template-origin breakdown जिन्होंने parseable robots.txt लौटाई:

| टेम्पलेट | साइटें | हिस्सा |
|---|---|---|
| किसी AI bot का उल्लेख नहीं (डिफ़ॉल्ट Shopify-style, Yoast, AI पर विचार किए बिना हाथ से लिखा) | 5,024 | 75.7% |
| कस्टम / DIY AI rules | 1,183 | 17.8% |
Cloudflare Managed (Content-Signal: search=yes,ai-train=no) | 302 | 4.5% |
GPTBot के लिए स्पष्ट Allow: / | 124 | 1.9% |
| Squarespace default (path-restricted block में 28 AI UAs) | 5 | 0.1% |
DIY rules 17.8% पर हावी हैं। self-authored blockers के समूह में हर social-media platform (facebook.com, twitter.com, linkedin.com, whatsapp.com, tiktok.com, snapchat.com, pinterest.com, x.com, chatgpt.com itself), सबसे बड़े e-commerce destinations (amazon.com, amazonvideo.com), प्रमुख news brands (nytimes.com, cnn.com, bbc.com, theguardian.com, forbes.com, reuters.com, bbc.co.uk, t-online.de, weather.com), key streaming / media (netflix.com, vimeo.com, soundcloud.com, imdb.com), और professional-services sites की लंबी पूँछ (canva.com, medium.com) शामिल हैं।
Cloudflare Managed 4.5% पर है — curve के बहुत शीर्ष में इस template की penetration से काफ़ी ज़्यादा, और इस report की window के बाहर लंबी पूँछ में इसकी penetration से कम। यह template rank-1001-to-10000 segment में सबसे ज़्यादा अपनाया गया है (4–5%) और curve के बहुत शीर्ष पर लगभग अनुपस्थित है (Top 100: 1 site इसका उपयोग करती है; Top 101–1000: 5 sites)। बड़ी वैश्विक properties अपने नियम खुद लिखती हैं; लंबी पूँछ toggle का उपयोग करती है।
कुछ विशिष्ट Cloudflare Managed sites उल्लेखनीय हैं। cloudflare.com खुद यह template चलाता है — यह संगत है (Cloudflare अपने ही domain पर अपना product dogfood कर रहा है)। theatlantic.com यह template चलाता है — वही एक प्रमुख अमेरिकी समाचार brand जिसे हमने custom rule लिखते नहीं पाया। spankbang.com यह template चलाता है — Cloudflare-इंजेक्टेड AI block अपनाने वाली सबसे उच्च रैंक की adult site। linktr.ee यह template चलाता है, और एक ही vendor निर्णय में पूरी Linktree-hosted creator economy पर AI training ब्लॉक करता है। launchpad.net, nexusmods.com, vinted.fr, cookielaw.org, rustdesk.com, और छोटी media properties की लंबी सूची Cloudflare Managed cohort को पूरा करती है।
Cloudflare adoption pattern इस बात का सबसे ठोस प्रमाण है कि "web's AI policy" का बड़ा हिस्सा infrastructure providers द्वारा तय किया जा रहा है। absolute share छोटा है (4.5%) लेकिन संरचनात्मक रूप से महत्त्वपूर्ण है: template वही है जो Cloudflare ship करता है, और अगले 12 महीनों में इसका default-on रुझान ऊपर की ओर है। यदि Cloudflare नए खातों के लिए toggle को default-on कर देता है, तो global block rate बिना किसी publisher निर्णय के materially बढ़ जाएगी।
Squarespace default (top-10k में 5 sites, लेकिन हमारे sample के बाहर कहीं बड़ा cohort) एक अलग pattern है: Squarespace एक robots.txt ship करता है जो 28 AI bots को एक ही block में नाम देता है, लेकिन वे bots User-agent: * की path restrictions विरासत में लेते हैं, न कि पूरे sitewide ban में जाते हैं। AI crawlers /, homepage, product pages, blog fetch कर सकते हैं। वे सिर्फ़ /config या /account नहीं fetch कर सकते। हमने पहले इसे Squarespace sites की तीसरे-पक्षीय scans में false-positive "AI block" readings के स्रोत के रूप में चिन्हित किया था; यही सावधानी यहाँ भी लागू होती है।
निष्कर्ष 9 — Rank distribution में AI policy एकसमान है
इस तरह के अध्ययन के लिए सामान्य intuition यह होती है कि सबसे ज़्यादा देखी जाने वाली साइटों की AI policy सबसे आक्रामक होगी — उनके पास training displacement से सबसे ज़्यादा खोने को है, सबसे अधिक कानूनी क्षमता है, सबसे ज़्यादा सार्वजनिक scrutiny है। डेटा इस intuition का समर्थन नहीं करता।
| रैंक bucket | n | कोई भी AI block | स्पष्ट | Cloudflare Managed |
|---|---|---|---|---|
| शीर्ष 100 | 67 | 22.4% | 17.9% | 1 साइट |
| शीर्ष 101–1,000 | 598 | 22.9% | 19.2% | 5 साइटें |
| शीर्ष 1,001–5,000 | 2,810 | 19.0% | 15.3% | 99 साइटें |
| शीर्ष 5,001–10,000 | 3,773 | 20.8% | 17.8% | 197 साइटें |
चारों buckets 19% और 23% के बीच हैं। Top 100, rank-5001-to-10000 लंबी पूँछ से अधिक आक्रामक नहीं है। मुख्य दर 2026 के public web की विशेषता लगती है, न कि किसी एक साइट के आकार या प्रमुखता का संकेत।
दो सहायक कारक हैं। पहला, curve का सिरा infrastructure / SaaS / search / portal domains (Microsoft, Apple, Google, आदि) से भरा है, जिनकी अपनी AI-blocking दरें कम हैं। दूसरा, लंबी पूँछ में regional news publishers और EU-jurisdiction sites का बड़ा हिस्सा है — जैसा कि निष्कर्ष 6 और 7 ने दिखाया — जो global average की तुलना में AI को अधिक आक्रामक रूप से ब्लॉक करते हैं। दोनों प्रभाव लगभग एक-दूसरे को काट देते हैं, और net एक समान headline है।
Cloudflare Managed column curve में स्थान के साथ बदलता है। Top 1000 में 6 Cloudflare-managed sites (1.0%) हैं; Top 1001–10000 में 296 (5.7%) हैं। बड़ी साइटें नियम खुद लिखती हैं; लंबी पूँछ vendor toggle का उपयोग करती है। डेटा में यही एकमात्र अर्थपूर्ण rank-dependent संकेत है, और यह बताता है कि जैसे-जैसे आप web के शीर्ष से लंबी पूँछ की ओर traffic curve पर नीचे जाते हैं, vendor-set बनाम publisher-set AI policy का हिस्सा लगातार बढ़ता जाता है। हमें उम्मीद है कि यह ढाल top 10k से आगे top 100k और उससे भी आगे तक जारी रहेगी।
निष्कर्ष 10 — पाँच anatomy: जब robots.txt वास्तव में policy हो तो वह कैसा दिखता है
आँकड़े dataset का आकार बताते हैं; "public web पर AI policy" की वास्तविक प्रकृति सबसे अच्छी तरह विशिष्ट फ़ाइलों को पढ़कर समझ आती है। यहाँ पाँच उदाहरण हैं, जिन्हें policy-space के अलग-अलग हिस्सों तक फैलने के लिए चुना गया है।
Anatomy 1 — The New York Times (nytimes.com)
nytimes.com/robots.txt की पहली 14 पंक्तियाँ:
# New York Times content is made available for your personal, non-commercial
# use subject to our Terms of Service here:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# Use of any device, tool, or process designed to data mine or scrape the content
# using automated means is prohibited without prior written permission from
# The New York Times Company. Prohibited uses include but are not limited to:
# (1) text and data mining activities under Art. 4 of the EU Directive on Copyright in
# the Digital Single Market;
# (2) the development of any software, machine learning, artificial intelligence (AI),
# and/or large language models (LLMs);
# (3) creating or providing archived or cached data sets containing our content to others; and/or
# (4) any commercial purposes.
# Contact https://nytlicensing.com/contact/ for assistance.
यह robots.txt एक कानूनी exhibit की तरह है। फ़ाइल को इस तरह संरचित किया गया है कि वह NYT v. OpenAI मुकदमे में साक्ष्य के रूप में स्वीकार्य हो। "Art. 4 of the EU Directive" का उल्लेख — एक US publisher द्वारा — निष्कर्ष 7 की उस बात को दिखाता है कि EU statutory frames वैश्विक चर्चा में रिस रहे हैं। "creating or providing archived or cached data sets" पर स्पष्ट प्रतिबंध सीधे Common Crawl को लक्षित करता है। फ़ाइल 60+ पंक्तियों की है, और इसमें GPTBot, OAI-SearchBot, ChatGPT-User, anthropic-ai, ClaudeBot, CCBot, Google-Extended, Applebot-Extended, Bytespider, Diffbot, Meta-ExternalAgent, Amazonbot, Omgili, Omgilibot, और आधा दर्जन अन्य के लिए named User-agent blocks हैं — हर named bot की अपनी Disallow: / है।
Anatomy 2 — Der Spiegel (spiegel.de) — section-level AI permissioning
Der Spiegel हमारे पूरे dataset में सबसे अधिक operationally sophisticated robots.txt है। प्रासंगिक block:
# TLP-6507: Testweise Freischaltung der OpenAI-Suchcrawler fuer ausgewaehlte Bereiche
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /
User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /
इस टिप्पणी का अर्थ है "चयनित सेक्शनों के लिए OpenAI search crawlers को परीक्षण के तौर पर अनुमति देना।" Spiegel ने OpenAI की inference UAs के लिए सात विशिष्ट content categories — अंतरराष्ट्रीय समाचार, साझेदारी, स्वास्थ्य, परिवार, यात्रा, मनोविज्ञान, और जीवनशैली — को whitelist किया है, और बाकी सब ब्लॉक किया है। राजनीतिक सेक्शन, जर्मन राष्ट्रीय समाचार, और investigative reporting स्पष्ट रूप से बाहर हैं। Common Crawl, Bytespider, Cohere, Webzio-Extended, और अन्य training UAs को आगे फ़ाइल में पूर्ण Disallow: / दिया गया है।
यह robots.txt section-level editorial policy के रूप में है। अंतर्निहित सिद्धांत यह है कि lifestyle content में training displacement risk कम और inference citation upside ज़्यादा है, इसलिए Spiegel AI को उन सेक्शनों तक पहुँचने देता है; political और investigative content moat हैं, इसलिए AI बाहर रहती है। हमने यह pattern और कहीं नहीं देखा। इससे संकेत मिलता है कि editorial, legal, और infrastructure teams के बीच ऐसी आंतरिक coordination है जो अधिकांश newsrooms तक नहीं पहुँची। हमें उम्मीद है कि 2026–2027 में इस तरह की granular, section-level policy expression फैलेगी — Spiegel की फ़ाइल वस्तुतः एक leading indicator है।
Anatomy 3 — BBC (bbc.com) — नीति-घोषणा का रूप
BBC robots.txt इस तरह खुलती है:
# version: ec59bd036e5138eb4831a9ed44447b1ff310e235
# The BBC's Terms of Use: https://www.bbc.co.uk/terms
# - Explain the rules for using our services
# - Tell you what you can do with our content
#
# In short: Please use our site like a human, not a robot.
# That means:
# - No scraping, crawling, or systematic extraction of content
# - No use of BBC content for training or fine-tuning AI models, including LLMs
# - No retrieval-augmented generation (RAG), AI-powered search, agentic AI or
# grounding using BBC content
# - No creating datasets from BBC content
# - No text and data mining (TDM) under Article 4 of the EU Directive on Copyright
# - No using BBC content to create summaries for your own use
# - No business use without permission
# - The BBC reserves all rights in its content and expressly opts out of any
# statutory exceptions in any jurisdiction for text and data mining,
# as permitted by law
#
# TL;DR: Browse, read, watch, enjoy - like a human.
BBC ने अपनी robots.txt को version-string किया है (# version: ec59bd... एक git commit hash है), BBC के वकील जिन आठ विशिष्ट AI उपयोगों पर नज़र रख रहे हैं उन्हें निषिद्ध किया है, और ब्रांड की prose voice में एक-पंक्ति सारांश पर समाप्त किया है। "expressly opts out of any statutory exceptions in any jurisdiction" वाक्यांश एक जानबूझकर किया गया वैश्विक आरक्षण है — यह कह रहा है हमें किसी एक कानूनी व्यवस्था पर भरोसा नहीं, इसलिए हम एक साथ हर जगह opt-out जता रहे हैं। यह dataset की सबसे अधिक drafted robots.txt है, और configuration file से अधिक press release जैसी पढ़ी जाती है।
Anatomy 4 — WordPress.org — स्पष्ट स्वागत
ऊपर सबकी तुलना wordpress.org से करें:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Bytespider
Allow: /
User-agent: CCBot
Allow: /
User-agent: Copilot
Allow: /
WordPress.org नौ AI training crawlers को स्पष्ट रूप से opt in करता है, जिनमें तीन (Bytespider, CCBot, anthropic-ai) शामिल हैं जिन्हें अन्यत्र सबसे अधिक ब्लॉक किया जाता है। अंतर्निहित सिद्धांत यह है कि WordPress documentation और plugin ecosystem एक सार्वजनिक भलाई है, जिसका मूल्य तब बढ़ता है जब AI assistants उसके बारे में प्रश्नों के उत्तर दे सकें। हर बार जब कोई Claude से पूछता है "WordPress में permalinks कैसे configure करूँ?" और Claude को wordpress.org/documentation/ पर प्रशिक्षित किया गया होता है, तब WordPress mission को सेवा मिलती है। Foundation ने लगता है निर्णय लिया है कि हर model के training corpus में होना एक रणनीतिक सकारात्मक है, और उन्होंने फ़ाइल की expressive grammar से वही कहा है।
Anatomy 5 — The Verge (theverge.com) — sponsored hybrid
एक और pattern दिखाने लायक है। The Verge अपने AI rules को Disallow: / \ Allow: /sp/ के रूप में संरचित करता है:
User-agent: GPTBot
Allow: /
User-agent: Applebot
Allow: /
User-agent: Google-Extended
Disallow: /
Allow: /sp/
User-agent: anthropic-ai
Disallow: /
Allow: /sp/
User-agent: Bytespider
Disallow: /
Allow: /sp/
User-agent: CCBot
Disallow: /
Allow: /sp/
User-agent: ChatGPT-User
Disallow: /
Allow: /sp/
User-agent: ClaudeBot
Disallow: /
Allow: /sp/
/sp/ path The Verge का sponsored / partner content section है। editorial content AI training से ब्लॉक है; sponsored content अनुमति प्राप्त है। आर्थिक तर्क साफ़ है: sponsors अपने content को discoverable होने के लिए भुगतान करते हैं, AI के माध्यम से भी; editorial flagship ही moat है। GPTBot पूरी तरह खुला है (संभवतः OpenAI के साथ सीधे संबंध के कारण), Applebot search baseline के रूप में पूरी तरह खुला है, और बाकी को hybrid treatment मिलता है। यह अपनी तरह की एकमात्र "tiered AI access" संरचना है जो हमें मिली।
ये पाँच फ़ाइलें robots.txt की AI policy की वर्तमान सीमा बताती हैं। top 10k की अधिकांश फ़ाइलें इनमें से किसी जैसी नहीं हैं — वे या तो चुप हैं या vendor template का उपयोग करती हैं। जो इनमें से किसी जैसी दिखती हैं, वे उन लोगों द्वारा लिखी गई हैं जिन्होंने तय किया है कि फ़ाइल ध्यान से पढ़ने लायक है।
फ़ाइल के पैमाने पर एक नोट: हमारे sample में robots.txt body का median आकार 858 bytes है — इतना छोटा कि अर्थपूर्ण AI policy समेट न सके। नियम वहीं रहते हैं जहाँ दाहिना सिरा है: 1,005 साइटें (15.3%) ऐसी फ़ाइल रखती हैं जो 5 KB से बड़ी है, 273 20 KB से बड़ी हैं, और अधिकतम 248 KB था। 460 फ़ाइलों में copyright-reservation भाषा है; 275 EU 2019/790 का नाम लेकर उल्लेख करती हैं। 2026 में robots.txt बढ़ते हुए versioned, lawyer-reviewed document की तरह है, configuration line की तरह नहीं।
निष्कर्ष 11 — 108 साइटें GPTBot का स्पष्ट स्वागत करती हैं
एक छोटा लेकिन दिखने वाला समूह User-agent: GPTBot \n Allow: / नियम लिखता है — व्यापक रूप से चर्चित "Disallow GPTBot" का उल्टा। हमारे sample में root path पर GPTBot के लिए explicit Allow वाली कुल 108 साइटें हैं। Tranco rank के अनुसार पहली 25:

| क्रम | डोमेन | सेक्टर |
|---|---|---|
| 42 | wordpress.org | Dev tooling / CMS |
| 133 | kaspersky.com | सुरक्षा |
| 187 | avast.com | सुरक्षा |
| 265 | hp.com | Hardware OEM |
| 624 | branch.io | Mobile attribution SaaS |
| 692 | sophos.com | सुरक्षा |
| 782 | theverge.com | समाचार |
| 905 | rambler.ru | रूसी पोर्टल |
| 945 | kleinanzeigen.de | जर्मन marketplace |
| 948 | theatlantic.com | समाचार |
| 1,092 | lge.com | LG Electronics |
| 1,300 | justdial.com | भारतीय local search |
| 1,332 | avira.com | सुरक्षा |
| 1,412 | youm7.com | मिस्री समाचार |
| 1,530 | goodreturns.in | भारतीय वित्त |
| 1,621 | publi24.ro | रोमानियाई classifieds |
| 1,807 | geocomply.com | Compliance SaaS |
| 1,908 | nba.com | खेल |
| 1,956 | oneindia.com | भारतीय समाचार |
| 1,974 | mindbox.ru | रूसी SaaS |
| 2,009 | thesun.co.uk | समाचार |
| 2,126 | vox.com | समाचार |
| 2,140 | mgid.com | Native advertising |
| 2,314 | ninjarmm.com | IT management SaaS |
| 2,323 | norton.com | सुरक्षा |
कुछ पैटर्न:
सुरक्षा कंपनियाँ साफ़ तौर पर अनुपात से अधिक हैं। Kaspersky, Avast, Sophos, Avira, Norton, NinjaRMM सब GPTBot को स्पष्ट रूप से अनुमति देते हैं। यह एक जानबूझकर distribution play है: जब कोई user ChatGPT से पूछता है "मेरी Windows machine के लिए सबसे अच्छा antivirus कौन सा है?", तब model के training corpus में brand का होना सीधे recommendation को प्रभावित करता है। Security कुछ गिने-चुने B2C product categories में से है जहाँ AI search पहले से SEO की जगह primary acquisition channel बन रहा है, और इन brands ने सबसे पहले कदम रखा है। हमें उम्मीद है कि बाकी security cohort अगले 12 महीनों में इसका अनुसरण करेगी।
कुछ बड़े news brands इस सूची में हैं, blocklist पर नहीं। The Verge, The Atlantic, Vox, The Sun, NBA.com। यह विरोधाभास नहीं है — इन publishers ने लगता है कि ChatGPT search के भीतर cite होना training से सुरक्षित होने से ज़्यादा मूल्यवान है, और उन्होंने explicit Allow rule इसलिए लिखा ताकि उनके CDN या CMS द्वारा भविष्य में होने वाली over-blocking से बचाव हो सके। इसे NYT / Reuters / BBC / Forbes / Guardian की स्पष्ट Disallow posture से तुलना करें। दोनों रुख तर्कसंगत हैं; news industry एकसमान नहीं है।
The Sun की उपस्थिति उल्लेखनीय है क्योंकि वही site अपनी फ़ाइल में कहीं और User-agent: * deny-all उपयोग करती है। The Sun की नीति को सबसे अच्छा इस रूप में पढ़ा जा सकता है: "AI training निषिद्ध है, AI search अनुमत है, और हमने GPTBot को deny-all के अपवाद के रूप में स्पष्ट रूप से whitelist किया है ताकि ChatGPT The Sun का हवाला देते हुए प्रश्नों के उत्तर दे सके।" यह GPTBot-Allow नियमों में सबसे कानूनी रूप से परिष्कृत है — एक opt-out और साथ में एक single-vendor opt-in।
WordPress.org की उपस्थिति सूची की सबसे महत्वपूर्ण एकल प्रविष्टि है। वैश्विक open-source CMS ecosystem का एक non-trivial हिस्सा documentation के लिए WordPress.org की ओर देखता है या वहाँ से plugins होस्ट करता है। wordpress.org/robots.txt में GPTBot को स्पष्ट अनुमति देकर WordPress Foundation ने प्रभावी रूप से कहा है कि WordPress documentation ecosystem training के लिए खुला है — जिसका असर इस बात पर पड़ता है कि Claude, Gemini, और ChatGPT WordPress पर "मैं कैसे..." वाले सवालों का जवाब कितनी अच्छी तरह दे सकते हैं।
पूर्ण Allow-GPTBot सूची की बाकी 83 साइटें regional news, छोटे security vendors, non-English बाजारों के classifieds platforms, और B2B SaaS की लंबी पूँछ हैं। जहाँ तक हम बता सकते हैं, कोई उद्योग-व्यापी "Allow-GPTBot" coordination नहीं है — नियम एक-एक साइट करके, उन operators द्वारा अपनाया जा रहा है जिन्होंने तय किया है कि corpus में होना रणनीतिक स्थिति है।
निष्कर्ष 12 — इस पैमाने पर llms.txt बस एक अफ़वाह भर है
llms.txt, LLM-friendly content discovery के लिए प्रस्तावित alternative file format (जिसे Mintlify, Anthropic, Vercel, और कुछ dev-tooling vendors ने late 2024 से आगे बढ़ाया), हमारे sample में लगभग कहीं नहीं दिखता।
6,638 sites में से जिन्होंने parseable robots.txt लौटाई, 83 (1.15%) llms.txt का उल्लेख करती हैं — आम तौर पर Sitemap: https://example.com/llms.txt line के रूप में। यह dev-tooling-heavy commerce samples पर मापे गए उसी metric से दो orders of magnitude कम है, जहाँ Vercel और Mintlify defaults adoption को बढ़ा देते हैं।

श्रेणीवार breakdown:
| उद्योग | n | llms.txt का उल्लेख |
|---|---|---|
| Infrastructure | 47 | 4.3% |
| जुआ | 100 | 3.0% |
| SaaS | 369 | 3.0% |
| दूरसंचार | 33 | 3.0% |
| ई-कॉमर्स | 224 | 1.8% |
| यात्रा | 64 | 1.6% |
| dev tools | 129 | 1.6% |
| समाचार | 650 | 0.8% |
| वयस्क | 254 | 0.4% |
| सरकार | 172 | 0.0% |
| अकादमिया | 268 | 0.0% |
| खोज | 12 | 0.0% |
llms.txt dev-tooling-adjacent SaaS, gambling (जो अन्य regulated industries की तुलना में नए-vocabulary robots.txt features जल्दी अपनाता है क्योंकि उसके पास अतिरिक्त metadata layer करने वाली compliance teams होती हैं), और B2B e-commerce में केंद्रित है। news और government में यह साफ़ तौर पर अनुपस्थित है — यही दो खंड AI policy से सबसे अधिक जुड़े हैं और standard के "vendor experiment" से "web protocol" बनने के लिए जिनकी adoption ज़रूरी होगी। तब तक, llms.txt वास्तविक तो है लेकिन छोटा है, और late 2026 में एक follow-up audit उपयोगी पुनःपरीक्षण होगा।
llms.txt के सामने संरचनात्मक समस्या यह है कि इसे किसी IETF process ने standardize नहीं किया है और प्रमुख AI vendors ने इसे मानने की प्रतिबद्धता नहीं दी है। robots.txt rule के पीछे 30 साल का crawler infrastructure है; llms.txt rule के पीछे कुछ भी नहीं। जब तक कम-से-कम एक बड़ा vendor (OpenAI, Anthropic, Google, Cloudflare) औपचारिक समर्थन घोषित नहीं करता, यह फ़ाइल मूलतः Mintlify / Vercel ecosystem का एक marketing artifact है। हमें 2026 में इसमें बदलाव की उम्मीद नहीं है।
निष्कर्ष 13 — पहुँच: top web के दो-तिहाई हिस्से के लिए robots.txt अभी भी पढ़ने योग्य है
एक सहायक अवलोकन जो निष्कर्ष होना नहीं था: top 10,000 में से 66% साइटों ने एकल research IP को parseable robots.txt लौटाई, और 10,000 में से सिर्फ़ 7 (0.07%) ने 429 Too Many Requests दिया। यह robots.txt-as-public-protocol के लिए अच्छी खबर है।
तुलना के लिए, दो महीने पहले 1,008-domain mid-market commerce sample पर वही pipeline चलाने पर resolved domains के 52% से 429 मिला था — Shopify और Cloudflare CDNs ने किसी भी non-major-search-engine UA पर आक्रामक rate-limiting किया था। top-traffic web कहीं अधिक friendly है: top sites पर या तो (a) कम aggressive bot-management tiers होते हैं, या (b) ज्ञात research crawlers के लिए स्पष्ट allowlists होते हैं, या दोनों।
Top-10k पर 21% fetch_failed दर मुख्यतः CDN apex domains (akamai.net, cloudfront.net, fastly.net, apple-dns.net, gtld-servers.net) से बनी है जो / पर webserver नहीं चलाते। वे हमें ब्लॉक नहीं कर रहे; उनके पास देने के लिए कुछ है ही नहीं। इन्हें हटाने पर वास्तविक "पढ़ने की कोशिश की लेकिन नहीं पढ़ सके" विफलता दर एकल अंकों के निचले हिस्से में आती है।
इसका मतलब है कि इस report के भविष्य के संस्करण — quarterly snapshots, year-over-year comparisons — एक ही machine पर सस्ते और पुनरुत्पादनीय तरीके से चलाए जा सकते हैं। audit window curve के शीर्ष पर खुली रहती है। असमान मामला लंबी पूँछ और commerce segment है, जहाँ CDN-level throttling ने प्रभावी रूप से robots.txt को पहले ही निजी बना दिया है। हमें उम्मीद है कि यह divergence और चौड़ा होगा: शीर्ष साइटें readable बनी रहेंगी क्योंकि search engines उन्हें index करते हैं और readability की माँग करते हैं; लंबी-पूँछ वाला commerce Cloudflare के bot-fight tiers के अधिक आक्रामक होने के साथ कम readable हो जाएगा। robots.txt की सार्वजनिक auditability उसी रेखा पर विभाजित हो रही है जो "visible web" और "operationally-protected web" को अलग करती है।
IV. इसका मतलब क्या है
चार दावे, उस क्रम में जिसमें डेटा उन्हें सबसे मज़बूती से समर्थन देता है।
1. इंटरनेट की AI policy वैश्विक नहीं, उद्योग-विशिष्ट है। News और telecom के बीच 12× का फैलाव हर aggregate number पर हावी है। "वेब का X% AI को block करता है" कहना, अगर sectoral cut नहीं है, तो SaaS/government/dev को ज़्यादा और news/travel/social को कम आँकता है। सेक्टर-दर-सेक्टर framing ही ईमानदार तरीका है।
2. EU Copyright Directive का Article 4 ही एकमात्र कानूनी व्यवस्था है जो आँकड़ों को साफ़ तौर पर बदल रही है। EU ccTLD sites 35% पर ब्लॉक करती हैं, जबकि global baseline 19% है। US litigation (NYT v. OpenAI, Copyright Office की जनवरी 2025 रिपोर्ट) ने US news cohort को बदला है, लेकिन व्यापक US web को नहीं। EU framing Cloudflare के template के माध्यम से globally भी रिस रही है, जो customer jurisdiction की परवाह किए बिना अपने boilerplate में Directive 2019/790 का हवाला देता है।
3. दो समानांतर "AI policies" व्यक्त हो रही हैं और वे एक-दूसरे से सहमत नहीं हैं। जानबूझकर, हाथ से लिखी गई policy (17.8%, अधिकतर news/social/travel/e-commerce) और विरासत में मिली Cloudflare-managed policy (4.5%) substance पर overlap करती हैं लेकिन legitimacy में अलग हैं। ऐसी दुनिया में जहाँ AI operators robots.txt को अनदेखा करने के लिए कानूनी आवरण खोज रहे हैं, "हमने इसे खुद लिखा और समीक्षा की" वाला बचाव "मैंने बस toggle चालू कर दिया" से संरचनात्मक रूप से मज़बूत है। मुकदमेबाज़ी का प्रोत्साहन policy को दूसरी श्रेणी से पहली में ले जाने का होगा।
4. मॉडल नहीं, corpus ही वह चीज़ है जिसे publishers ब्लॉक कर रहे हैं। CCBot 16.3% पर — किसी भी model-brand bot से ऊपर — इसका सबसे साफ़ बयान है। OpenAI को disallow करना publisher को training से बाहर नहीं करता; CCBot को disallow करना करता है। top-10k web का 14.1% CCBot को ब्लॉक करते हुए Googlebot को खुला रखता है। "training ब्लॉक करो, search रखो" pattern 2026 में modal AI rule है।
अपनी policy तय करने वाले sites के लिए: modal posture चुप्पी है — top 10k का 80% AI के बारे में कुछ नहीं कहता। 17% जो नियम लिखते हैं वे Disallow पर केंद्रित हैं, लेकिन एक छोटा, बढ़ता हुआ समूह (explicit-Allow-GPTBot सूची का 1.5%, जिसका नेतृत्व security vendors करते हैं) सार्वजनिक रूप से उल्टा चयन कर रहा है। किसी उद्योग-व्यापी सहमति का कोई संकेत नहीं है, और अगले बारह महीनों में भी होने की संभावना नहीं है।
AI operators के लिए: यह तर्क जारी रखना कि robots.txt एक पुराना protocol है जिसकी semantics अस्पष्ट हैं, अब कठिन होता जा रहा है जब दुनिया की सबसे बड़ी 17% साइटों ने bots का नाम लेकर स्पष्ट, जानबूझकर नियम लिख दिए हैं, और 3.8% फ़ाइलें section number के साथ विशिष्ट EU statute का हवाला देती हैं। उन नियमों का सम्मान करना व्यापार निर्णय है; उनका अस्तित्व अब empirically सिद्ध तथ्य है।
V. 2026 के अंत तक क्या उम्मीद है
डेटासेट में दिखाई देने वाली तीन दिशाएँ:
Cloudflare Managed अपनी हिस्सेदारी से अधिक दोगुना करेगा, और संभावित रूप से parseable top-10k के 10%+ तक पहुँच जाएगा। Cloudflare की roadmap नए खातों के लिए default-on Block AI Bots पर सार्वजनिक रूप से चर्चा करती है। यदि toggle default-on ship हुआ, तो global block rate बिना किसी publisher निर्णय के 5–8 percentage points ऊपर जाएगी। हमें पता चलेगा कि यह हो रहा है जब rank-5001-to-10000 bucket का Cloudflare Managed हिस्सा अपनी मौजूदा 5.7% से ऊपर चढ़ेगा।
Section-level AI policies (Spiegel-style) प्रमुख news flagships में फैलेंगी। आर्थिक तर्क — AI को low-stakes content cite करने दो, moat content की रक्षा करो — पर्याप्त रूप से ठोस है, इसलिए हमें उम्मीद है कि 2026 के अंत तक कम-से-कम 10 और flagship newsrooms section-level rules जारी करेंगे। पहले जर्मन और फ्रांसीसी मध्य-स्तरीय प्रेस पर नज़र रखें; कानूनी ढांचा वहाँ प्रयोग को पुरस्कृत करता है।
explicit-Allow-GPTBot समूह बढ़ेगा, जिसका नेतृत्व B2B SaaS और dev tooling करेंगे। जब AI search software vendors के लिए एक मापने योग्य acquisition channel बन जाएगा (जैसा सुरक्षा के लिए पहले से है), तब अगला CMO accidental over-blocking से बचने के लिए User-agent: GPTBot \n Allow: / लिखेगा। हमें उम्मीद है कि 108-site list साल के अंत तक लगभग दोगुनी हो जाएगी।
जिसकी उम्मीद नहीं है: silent majority share में कोई अर्थपूर्ण बदलाव। web का 80% जो AI के बारे में कुछ नहीं कहता, उसमें ऐसे sectors (gov, telecom, infrastructure, B2B SaaS) शामिल हैं जिनके पास नियम लिखने का आर्थिक कारण नहीं और न ही कानूनी दबाव है। सार्वभौमिक AI policy नहीं आने वाली।
VI. सीमाएँ
- एक snapshot का पक्षपात। फ़ेच early May 2026 में 36-hour window में किए गए। top 100 पर फ़ाइल रोज़ बदलती है; headline numbers में प्रति तिमाही 1–2 percentage-point drift अपेक्षित है।
- उद्योग वर्गीकरण में अंतराल। चार-स्तरीय classifier के बाद 10,000 में से 6,593 sites
unknownरहीं। Per-industry प्रतिशत वहाँ मज़बूत हैं जहाँ n बड़ा है (news: 650, streaming: 440, saas: 369, academia: 268, adult: 254, ecommerce: 224, gov: 172, finance: 129, dev: 129) और n<30 पर अधिक noisy हैं। Country news cut भी इसी तरह सीमित है — DE/FR/UK का n≥15 है, Korea/Sweden/Czechia 20–25 के n पर निर्भर हैं। robots.txtस्वैच्छिक है।Disallowअनुरोध है, बाधा नहीं।Bytespider,PerplexityBot, और अन्य के नियम न मानने का दस्तावेज़ीकरण है। हमने policy declarations मापीं, enforcement नहीं।- एकल-IP, US-आधारित audit। हम 21% resolved domains नहीं पढ़ सके। अधिकतर CDN apex points हैं जिन पर webserver नहीं है; एक छोटा हिस्सा ऐसे sites का है जिनके CDN ने origin तक पहुँचने से पहले हमें फ़्लैग कर दिया। इससे नमूना थोड़ा पुराने infrastructure और country-of-origin geofenced sites की ओर झुकता है।
- Tranco list semantics। Tranco stability के लिए फ़िल्टर करता है; यह वास्तविक user-behavior ranking नहीं है। aggregate numbers सूची-चयन के प्रति मज़बूत हैं; विशिष्ट rank positions नहीं।
- Traffic data नहीं। हमने
robots.txtpolicy मापी, वास्तविक AI bot throughput नहीं। Policy और traffic हमेशा मेल नहीं खाते।
VII. इसे पुनरुत्पादित करें
इस report को बनाने के लिए उपयोग की गई हर चीज़ deliverable folder में है।
- tranco_top10k.csv — input list
- out/sites.csv — domain × rank × industry × language × robots.txt status (10,000 rows)
- out/fetch_meta.csv — हर domain के लिए fetch outcome (status, scheme, bytes, error)
- out/bot_status.csv — domain × bot grid (250,000 rows: blocked, has_rule, fetch_status)
- out/site_meta.csv — हर site के लिए एक analytical record (template, summary booleans)
- out/analysis.json — report में उद्धृत हर metric
- 01_fetch_robots.py, 02_classify.py, 03_parse_and_analyze.py — पूरी Python pipeline
सभी स्क्रिप्ट और डेटासेट डाउनलोड करें
कार्यप्रणाली सुधार, dataset मुद्दे, और follow-up analyses स्वागत योग्य हैं support@thunderbit.com पर। यह report Thunderbit की किसी भी commercial position से स्वतंत्र रूप से प्रकाशित है; हम एक AI-powered web scraper बनाते हैं, और हमारा संरचनात्मक हित है कि robots.txt सार्वजनिक web पर एक अर्थपूर्ण, machine-readable contract बना रहे। इस report का data स्वयं अपनी जगह खड़ा है। — Thunderbit research team, मई 2026.
Thunderbit AI Web Scraper आज़माएँ Get Started Free


