llms.txt का उदय: वेबसाइटें AI को कैसे संकेत दे रही हैं

अंतिम अपडेट:May 8, 2026
llms.txt का उदय: वेबसाइटें AI को कैसे संकेत दे रही हैं
Thunderbit द्वारा संचालित डेटा एक्सट्रैक्शन।

बड़े भाषा मॉडलों के लिए मशीन-पठनीय मार्गदर्शन प्रकाशित करने वाली ज़्यादा ट्रैफ़िक वाली वेबसाइटों का क्रॉल-आधारित अध्ययन, शुरुआती कार्यान्वयन कैसे दिखते हैं, और अपनाने को मापते समय सिर्फ़ HTTP 200 प्रतिक्रियाएँ गिनने से आगे क्यों देखना पड़ता है।

  • डेटासेट: data/llms_probe_results_top_10000.csv
  • ट्रैंको सूची डाउनलोड की गई: 6 मई, 2026
  • दायरा: रूट-स्तर /llms.txt और /llms-full.txt

प्रमुख मीट्रिक्स

llms-txt-adoption-landscape.webp

  • 5.86%: ट्रैंको टॉप 10,000 में वैध llms.txt अपनाने की दर, यानी 586 डोमेन।
  • 1.03%: वैध llms-full.txt अपनाने की दर, यानी 103 डोमेन। हर वैध पूर्ण-फ़ाइल अपनाने वाले के पास एक वैध इंडेक्स फ़ाइल भी थी।
  • 63.51%: /llms.txt के लिए HTTP 200 प्रतिक्रियाओं का वह हिस्सा जो सत्यापन में असफल रहा।
  • 2.74x: यदि अपनाने को सिर्फ़ कच्ची HTTP 200 प्रतिक्रियाओं से मापा जाए, तो अनुमान लगभग इतना ज़्यादा लग जाएगा।

कार्यकारी सारांश

llms.txt अभी भी वेब की एक शुरुआती परंपरा है, लेकिन अब यह हाशिये का प्रयोग नहीं रहा। 6 मई, 2026 को ट्रैंको टॉप 10,000 डोमेन के क्रॉल में इस अध्ययन को 586 वैध llms.txt फ़ाइलें मिलीं, यानी 5.86% की देखी गई अपनाने की दर। इसकी सहायक llms-full.txt फ़ाइल कहीं कम सामान्य थी: 103 डोमेन में वैध पूर्ण फ़ाइल मिली, यानी 1.03% की अपनाने की दर।

सबसे अहम पद्धतिगत निष्कर्ष यह है कि स्टेटस कोड अपनाने का अच्छा संकेतक नहीं हैं। क्रॉलर को /llms.txt के लिए 1,606 HTTP 200 प्रतिक्रियाएँ मिलीं, लेकिन इनमें से केवल 586 सत्यापित हुईं। बाकी 1,020 मामलों में ज़्यादातर गलत दिशा वाले रीडायरेक्ट, सामान्य HTML पेज, खाली बॉडी, या अन्य अमान्य प्रतिक्रियाएँ थीं। जो साधारण क्रॉलर हर 200 प्रतिक्रिया को अपनाना मान लेता है, वह वैध अपनाने का अनुमान लगभग 2.74 गुना बढ़ा देगा।

वैध अपनाने वालों में कार्यान्वयन की गुणवत्ता सिर्फ़ खाली-प्लेसहोल्डर वाली कहानी नहीं है। मध्यिका वैध फ़ाइल लगभग 7.1 KB थी, 61.77% वैध फ़ाइलें 5 KB से बड़ी थीं, 70.82% में छह या अधिक Markdown अनुभाग थे, और 77.47% में 11 या अधिक Markdown लिंक थे। शुरुआती अपनाने वालों में Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog और Cloudinary शामिल हैं।

llms.txt को सबसे अच्छा एक व्याख्यात्मक और नेविगेशनल संकेत के रूप में समझना चाहिए, न कि robots.txt के विकल्प के रूप में। इसकी उपयोगिता सिर्फ़ फ़ाइल के मौजूद होने में नहीं, बल्कि इस बात में है कि क्या वह मशीनों को प्रामाणिक, संक्षिप्त और अद्यतन जानकारी खोजने में मदद करती है।

संदर्भ: वेब में AI-उन्मुख संकेत जुड़ रहे हैं

वेबसाइटें लंबे समय से क्रॉलर वरीयताएँ बताने के लिए robots.txt, URL खोज में मदद के लिए sitemap.xml, और पेजों की व्याख्या में खोज एवं प्लेटफ़ॉर्म प्रणालियों की मदद के लिए संरचित डेटा का उपयोग करती रही हैं। जेनरेटिव AI एक अलग समस्या लाती है। सामग्री प्रशिक्षण, रिट्रीवल, सारांश, एजेंटिक ब्राउज़िंग, कोड सहायता, ग्राहक सहायता और उत्तर निर्माण में इस्तेमाल हो सकती है। इससे दो ज़रूरतें एक साथ पैदा होती हैं: प्रकाशक स्वचालित उपयोग पर अधिक नियंत्रण चाहते हैं, लेकिन वे यह भी चाहते हैं कि जब AI प्रणालियाँ उनकी साइटों से इंटरैक्ट करें, तो उन्हें सही कैनोनिकल जानकारी आसानी से मिले।

मूल llms.txt प्रस्ताव, जिसे 2024 में Jeremy Howard ने प्रस्तुत किया, इस फ़ाइल को वेबसाइट रूट पर रखे जाने वाले Markdown दस्तावेज़ के रूप में परिभाषित करता है, जो अनुमान के समय LLM-अनुकूल जानकारी देता है। प्रस्ताव का तर्क है कि HTML पेजों में अक्सर नेविगेशन, विज्ञापन, स्क्रिप्ट और अन्य शोर होता है, जिससे भाषा मॉडलों के लिए उन्हें प्रोसेस करना कठिन हो जाता है। एक संक्षिप्त Markdown फ़ाइल मॉडलों को सबसे महत्वपूर्ण पेजों, दस्तावेज़ों, API, उदाहरणों, नीतियों और उत्पाद जानकारी की ओर संकेत कर सकती है।

बाहरी वेब अनुसंधान व्यापक पृष्ठभूमि देता है। Data Provenance Initiative के “Consent in Crisis” में robots.txt और सेवा शर्तों में AI-संबंधी प्रतिबंधों की तेज़ वृद्धि का वर्णन है, और यह तर्क दिया गया है कि मौजूदा वेब-सहमति तंत्र बड़े पैमाने पर AI डेटा पुन: उपयोग के लिए डिज़ाइन नहीं किए गए थे। Cloudflare Radar AI Insights ने भी टॉप 10,000 डोमेन स्तर पर AI क्रॉलर और robots.txt पैटर्न को दृश्य बनाया है। उस माहौल में llms.txt AI संकेत देने के रचनात्मक पक्ष पर आता है: “इसे क्रॉल न करो” नहीं, बल्कि “अगर आपको यह साइट समझनी है, तो यहाँ से शुरू करो।”

बाहरी प्रमाण और अपनाने पर बहस

llms.txt को लेकर सार्वजनिक बहस दो दावों में बंटी हुई है। आशावादी दावा है कि यह फ़ाइल AI प्रणालियों को प्रामाणिक सामग्री तक साफ़ और अधिक कुशल रास्ता देती है। संदेहवादी दावा है कि किसी भी प्रमुख LLM प्रदाता ने सार्वजनिक रूप से इसे रैंकिंग, क्रॉलिंग या सिटेशन संकेत के रूप में उपयोग करने की प्रतिबद्धता नहीं की है, इसलिए प्रकाशकों को केवल इस फ़ाइल के कारण ट्रैफ़िक बढ़ने की उम्मीद नहीं करनी चाहिए। इस अपडेट के लिए समीक्षा किए गए तीन बाहरी संदर्भ अधिक सूक्ष्म निष्कर्ष का समर्थन करते हैं: llms.txt उपयोगी अवसंरचना है, लेकिन प्रत्यक्ष ट्रैफ़िक प्रभाव के प्रमाण सीमित और संदर्भ-निर्भर हैं।

बाहरी अपनाने के बेंचमार्क तेज़ी से बदल रहे हैं

Rankability का अपनाने ट्रैकर ने 22 जून, 2025 तक शीर्ष 1,000 वेबसाइटों में 0.3% अपनाने की दर बताई, यानी 1,000 में 3 साइटें। यह domain.com/llms.txt के मासिक स्वचालित स्कैन का वर्णन करता है, जिसमें रीडायरेक्ट और HTML प्रतिक्रियाओं को बाहर रखने वाला सत्यापन शामिल है। पद्धति की दिशा इस अध्ययन के सतर्क सत्यापन दृष्टिकोण से मिलती-जुलती है।

परिणामों में अंतर बड़ा है: इस अध्ययन में 6 मई, 2026 को ट्रैंको टॉप 1,000 में 75 वैध llms.txt फ़ाइलें मिलीं, यानी 7.50%। इन दो संख्याओं को सख्त टाइम-सीरीज़ नहीं माना जाना चाहिए, क्योंकि रैंकिंग स्रोत, कार्यान्वयन विवरण, सत्यापन तर्क और क्रॉल समय अलग हो सकते हैं। फिर भी, यह तुलना संकेत देती है कि मध्य-2025 और मई 2026 के बीच अपनाना काफ़ी बदला, खासकर डेवलपर, SaaS, क्लाउड, सुरक्षा और दस्तावेज़-प्रधान साइटों में।

स्रोतस्नैपशॉटनमूनारिपोर्ट किया गया वैध अपनानाव्याख्या
Rankability22 जून, 2025शीर्ष 1,000 वेबसाइटें0.3%मध्य-2025 में न्यूनतम अपनाने का शुरुआती सार्वजनिक बेंचमार्क।
यह अध्ययन6 मई, 2026ट्रैंको शीर्ष 1,0007.50%बाद के क्रॉल में उच्च-ट्रैफ़िक साइटों पर स्पष्ट अपनाना।
यह अध्ययन6 मई, 2026ट्रैंको शीर्ष 10,0005.86%व्यापक नमूना, जो दिखाता है कि अपनाना मापनीय है लेकिन अभी मुख्यधारा नहीं।

ट्रैफ़िक प्रयोग अब भी मिश्रित हैं

Search Engine Land ने जनवरी 2026 में 10-साइट विश्लेषण प्रकाशित किया, जिसमें कार्यान्वयन से पहले 90 दिन और बाद के 90 दिन तक साइटों को ट्रैक किया गया। लेख में बताया गया कि दो साइटों पर AI ट्रैफ़िक 12.5% और 25% बढ़ा, आठ में कोई मापनीय सुधार नहीं हुआ, और एक 19.7% गिर गया। इसकी मुख्य व्याख्या कारणात्मक सावधानी थी: दो सफल उदाहरणों ने साथ ही नए टेम्पलेट लॉन्च किए, रिसोर्स सेंटर दोबारा बनाए, निकाली जा सकने वाली तुलना तालिकाएँ जोड़ीं, प्रेस कवरेज हासिल की, तकनीकी समस्याएँ ठीक कीं, या नई FAQ-शैली की सामग्री प्रकाशित की। उस दृष्टिकोण में, llms.txt ने मजबूत सामग्री और तकनीकी काम का दस्तावेज़ीकरण किया; यह अकेले वृद्धि का कारण नहीं दिखा।

Renat Alimbekov के निजी ब्लॉग प्रयोग ने छोटे साइट-स्तरीय अवलोकन से अधिक सकारात्मक निष्कर्ष निकाला। इसमें llms.txt और llms-full.txt दोनों जोड़ने के बाद Yandex.Metrica में दो चार-महीने की अवधियों की तुलना की गई। LLM रेफ़रल सत्र 75 से बढ़कर 92 हो गए, यानी 23% की वृद्धि, जबकि उपयोगकर्ता 51 से बढ़कर 64 हुए। Perplexity सत्र 29 से बढ़कर 55 हुए, जबकि ChatGPT सत्र 31 से घटकर 26 रह गए। उसी पोस्ट में यह भी बताया गया है कि कुल रेफ़रल ट्रैफ़िक 160 से 290 सत्रों तक तेज़ी से बढ़ा, इसलिए LLM सत्र हिस्सेदारी 47% से घटकर 32% रह गई।

साक्ष्य का प्रकारदेखा गया परिणाममुख्य सावधानीयह रिपोर्ट पर कैसे असर डालता है
Search Engine Land का 10-साइट पूर्व/पश्चात अध्ययनदो साइटें बढ़ीं, आठ में कोई मापनीय बदलाव नहीं, एक घटी।सकारात्मक मामलों में साथ-साथ सामग्री, PR और तकनीकी बदलाव थे।llms.txt को अवसंरचना के रूप में देखने का समर्थन, न कि अकेले वृद्धि लीवर के रूप में।
Alimbekov का निजी ब्लॉग पूर्व/पश्चात अवलोकनबाद की अवधि में LLM रेफ़रल सत्र 23% बढ़े।कोई नियंत्रण समूह नहीं; कुल रेफ़रल ट्रैफ़िक 81% बढ़ा, और LLM हिस्सा गिरा।तकनीकी ब्लॉगों के लिए, खासकर Perplexity के माध्यम से, संभावित लाभ का संकेत, लेकिन कारण स्पष्ट नहीं।
यह क्रॉल-आधारित अपनाने का अध्ययन586 वैध फ़ाइलें और कई संरचित कार्यान्वयन।उपस्थिति और संरचना मापता है, डाउनस्ट्रीम ट्रैफ़िक प्रभाव नहीं।अपनाने और कार्यान्वयन परिपक्वता दिखाता है, लेकिन अपने आप ROI नहीं।

बहस क्या स्पष्ट करती है

बाहरी प्रमाण इस डेटासेट की व्याख्या को और साफ़ बनाते हैं। एक अच्छी तरह संरचित llms.txt फ़ाइल मशीन-पार्सिंग की बाधा कम कर सकती है, खासकर डेवलपर दस्तावेज़ों, API संदर्भों और नॉलेज-बेस सामग्री के लिए। लेकिन सबसे मज़बूत ट्रैफ़िक मामलों में अब भी ऐसी सामग्री की ज़रूरत दिखती है जो उपयोगी, निकाली जा सकने योग्य, प्रामाणिक और फ़ाइल के बाहर भी खोजी जा सके। इसलिए व्यावहारिक प्रश्न अकेले “क्या llms.txt मायने रखता है?” नहीं है। असली प्रश्न यह है कि क्या यह फ़ाइल एक व्यापक AI-पठनीय सामग्री प्रणाली का हिस्सा है।

अद्यतन व्याख्या: llms.txt को कम-लागत वाली AI-उन्मुख अवसंरचना के रूप में लागू किया जाना चाहिए। इसे बेहतर दस्तावेज़ीकरण, संरचित सामग्री, तकनीकी पहुँच-योग्यता, सिटेशन, लिंक, या ब्रांड प्रामाणिकता के विकल्प के रूप में प्रस्तुत नहीं किया जाना चाहिए।

AI वेब स्क्रैपिंग के लिए Thunderbit आज़माएँ

पद्धति

इस अध्ययन में नमूने के रूप में ट्रैंको टॉप 10,000 डोमेन का उपयोग किया गया। ट्रैंको एक शोध-उन्मुख शीर्ष-साइट रैंकिंग है, जिसे कई पारंपरिक टॉप सूचियों की तुलना में अधिक स्थिर और हेरफेर-प्रतिरोधी बनाने के लिए डिज़ाइन किया गया है। ट्रैंको स्रोत फ़ाइल 6 मई, 2026 को डाउनलोड की गई, और स्रोत का Last-Modified टाइमस्टैम्प 5 मई, 2026 22:17:59 GMT था।

क्रॉलर ने प्रत्येक डोमेन के लिए दो रूट-स्तरीय पाथों की जाँच की:

  • https://example.com/llms.txt, आवश्यकता होने पर HTTP फ़ॉलबैक के साथ।
  • https://example.com/llms-full.txt, आवश्यकता होने पर HTTP फ़ॉलबैक के साथ।

हर जाँच के लिए, क्रॉलर ने स्टेटस कोड, अंतिम URL, फ़ेच विधि, रिस्पॉन्स बाइट्स, सामग्री प्रकार, त्रुटि संदेश, बीता समय, और सत्यापन परिणाम दर्ज किए। सफल रिस्पॉन्स बॉडी की समीक्षा और द्वितीयक विश्लेषण के लिए raw_llms_txt/ के तहत सहेजा गया।

सत्यापन नियम

किसी प्रतिक्रिया को तभी वैध फ़ाइल माना गया जब उसने सफल बॉडी लौटाई हो और वह सामान्य वेब फ़ॉलबैक जैसी न लगे। अंतिम URL पथ को /llms.txt या /llms-full.txt ही रहना था। खाली बॉडी अस्वीकृत की गईं। स्पष्ट HTML दस्तावेज़ और ऐप शेल अस्वीकृत किए गए। कंटेंट टाइप को केवल एक सहायक संकेत माना गया, क्योंकि कुछ वैध टेक्स्ट-जैसी फ़ाइलें असामान्य कंटेंट टाइप के साथ परोसी गई थीं।

अपनाने का परिदृश्य

क्रॉल में ट्रैंको टॉप 10,000 के भीतर 586 वैध llms.txt फ़ाइलें मिलीं। इससे वैध अपनाने की दर 5.86% बनती है। छोटी सहायक llms-full.txt फ़ाइल 103 डोमेन पर मौजूद और वैध थी, यानी नमूने का 1.03%।

मीट्रिकगिनतीटॉप 10,000 का हिस्सा
क्रॉल किए गए डोमेन10,000100.00%
वैध llms.txt फ़ाइलें5865.86%
वैध llms-full.txt फ़ाइलें1031.03%
/llms.txt के लिए HTTP 200 प्रतिक्रियाएँ1,60616.06%
अमान्य के रूप में अस्वीकृत HTTP 200 प्रतिक्रियाएँ1,02010.20%

अपनाना सिर्फ़ शीर्ष-भारी नहीं है

टॉप 1,000 में अपनाना पूरे टॉप 10,000 की तुलना में अधिक था, लेकिन यह केवल सबसे बड़े साइटों तक सीमित नहीं था। टॉप 1,000 की अपनाने दर 7.50% थी। अंतिम 1,000-डोमेन बकेट, यानी रैंक 9,001-10,000, 3.80% तक गिर गई। रैंकिंग का मध्य भाग सक्रिय रहा: 2,001-3,000, 3,001-4,000, 5,001-6,000 और 6,001-7,000 बकेट सभी लगभग 6% पर रहे।

tranco-domain-adoption-rate.webp

शुरुआती अपनाने वाले

सबसे ऊँचे रैंक वाला वैध अपनाने वाला Cloudflare था, ट्रैंको रैंक 4 पर। अन्य उच्च-रैंकिंग अपनाने वालों में Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink और OneSignal शामिल थे।

ये अपनाने वाले यादृच्छिक नहीं हैं। इनके पास आम तौर पर बड़े दस्तावेज़ीकरण क्षेत्र, व्याख्या की ज़रूरत वाले उत्पाद, API या डेवलपर इकोसिस्टम, सपोर्ट सामग्री, प्राइसिंग पेज, सुरक्षा और गोपनीयता सामग्री, और इतना ब्रांड-प्रभाव होता है कि वे इस बात की परवाह करें कि AI प्रणालियाँ उनकी साइटों की व्याख्या कैसे करती हैं।

रैंकडोमेनफ़ाइल आकारदेखा गया पैटर्न
4cloudflare.com4,225 Bसंक्षिप्त उत्पाद, डेवलपर, कंपनी और प्राइसिंग इंडेक्स।
26azure.com47,037 Bडेवलपर टूल, AI, कंप्यूट, स्टोरेज, सुरक्षा, मॉनिटरिंग और वैकल्पिक संसाधन।
28github.com27,108 Bप्रोग्रामेटिक एक्सेस, Copilot, MCP, REST API, Actions, repositories और CLI लिंक।
248stripe.com64,229 BPayments, Connect, Checkout, Billing, Tax, Atlas, Radar और डेवलपर दस्तावेज़।
265salesforce.com1.02 MBविशाल उत्पाद और Agentforce लिंक कैटलॉग, Markdown अनुभाग शीर्षकों के बिना।

टॉप 1,000 अपनाने वाले वर्ग

इस अध्ययन ने ट्रैंको टॉप 1,000 में 75 वैध अपनाने वालों का वर्गीकरण डोमेन संदर्भ, प्रथम शीर्षकों, कच्ची फ़ाइल संरचना और सामग्री कीवर्ड के आधार पर किया। सबसे बड़ा समूह मार्केटिंग, मीडिया और adtech था, 22.67% के साथ। क्लाउड, डेवलपर और इन्फ्रास्ट्रक्चर साइटों का हिस्सा 20.00% था। SaaS, उत्पादकता और ग्राहक-ऑप्स साइटों का हिस्सा 17.33% था। सुरक्षा, पहचान और गोपनीयता साइटों का हिस्सा 12.00% था।

top-1000-adopters-categories.webp

श्रेणीडोमेनटॉप 1,000 अपनाने वालों का हिस्सामध्यिका गुणवत्ता स्कोरमध्यिका लिंक
मार्केटिंग, मीडिया और adtech1722.67%9425
क्लाउड, dev और infrastructure1520.00%9462
SaaS, उत्पादकता और ग्राहक ops1317.33%9446
सुरक्षा, पहचान और गोपनीयता912.00%9878
CMS, होस्टिंग और वेब उपस्थिति79.33%10024

TLD पैटर्न

टॉप-लेवल डोमेन उद्योग-लेबल नहीं होते, लेकिन वे उपयोगी दिशात्मक संकेत देते हैं। नमूने में जिन TLD में कम-से-कम 50 डोमेन थे, उनमें .io की वैध अपनाने दर 14.44% के साथ सबसे ऊँची थी। .com 8.19% पर रहा। .gov, .edu और .net में कम अपनाना बताता है कि शुरुआती अपनाने वाला आधार संस्थागत की तुलना में अधिक वाणिज्यिक और तकनीकी है।

कार्यान्वयन गुणवत्ता

वैध अपनाना समान कार्यान्वयन गुणवत्ता का मतलब नहीं है। कुछ फ़ाइलें संक्षिप्त, सुविभाजित इंडेक्स हैं। कुछ ज़्यादातर गद्य हैं। कुछ कच्ची लिंक कैटलॉग हैं। कुछ लगभग खाली प्लेसहोल्डर हैं। कुछ कई मेगाबाइट के कंटेंट डंप हैं, जो पूर्ण हो सकते हैं, लेकिन फ़ेच और पार्स करने में महँगे हैं।

वैध llms.txt फ़ाइलों में से 362 5 KB से बड़ी थीं, यानी वैध अपनाने वालों का 61.77%। मध्यिका फ़ाइल आकार लगभग 7.1 KB थी। P90 फ़ाइल आकार 156 KB था, P95 356 KB, P99 2.54 MB, और सबसे बड़ी देखी गई फ़ाइल 7.97 MB थी।

सामान्य सामग्री संकेत

वैध फ़ाइलों के कीवर्ड-स्तरीय स्कैन से पता चला कि कई साइटें सिर्फ़ एक घोषणा प्रकाशित नहीं कर रहीं; वे मॉडलों को संचालन-योग्य सामग्री की ओर इंगित कर रही हैं। सपोर्ट या मदद से जुड़े शब्द 70.31% वैध फ़ाइलों में आए। ब्लॉग, गाइड या ट्यूटोरियल शब्द 67.92% में आए। सुरक्षा, गोपनीयता, अनुपालन या शर्तें 61.43% में आईं। प्राइसिंग 53.92% में, दस्तावेज़ीकरण 52.22% में, API शब्द 33.96% में, और चेंजलॉग या रिलीज़ संकेत 27.30% में पाए गए।

गुणवत्ता स्कोरिंग और आर्केटाइप

उपस्थिति से परिपक्वता की ओर बढ़ने के लिए, इस अध्ययन ने एक हल्का कार्यान्वयन स्कोर बनाया। यह स्कोर कंटेंट टाइप, फ़ाइल आकार, Markdown संरचना, लिंक संख्या, विषय कवरेज, और चेतावनी संकेतों को देखता है जैसे शीर्षकों की अनुपस्थिति, Markdown लिंक न होना, असामान्य कंटेंट टाइप, छोटी फ़ाइलें, बहुत बड़ी फ़ाइलें, और लिंक-डंप व्यवहार। यह कोई औपचारिक मानक नहीं है। यह देखे गए कार्यान्वयनों की तुलना के लिए एक शोध-स्कोरिंग मॉडल है।

इस मॉडल का उपयोग करते हुए, 416 वैध फ़ाइलों को मज़बूत संरचित इंडेक्स, 107 को उपयोगी इंडेक्स, 24 को पतला या अनियमित, और 39 को प्रतीकात्मक या कम-उपयोगिता वाले रूप में वर्गीकृत किया गया। एक अलग आर्केटाइप विश्लेषण में 296 संरचित इंडेक्स, 113 अनुभागित-पाठ फ़ाइलें, 63 लिंक कैटलॉग, 52 पतले इंडेक्स, 50 प्रतीकात्मक या प्लेसहोल्डर फ़ाइलें, और 12 विशाल कंटेंट डंप पाए गए।

tranco-crawl-implementation-archetypes.webp

आर्केटाइपडोमेनवैध फ़ाइलों का हिस्सामध्यिका स्कोरमध्यिका फ़ाइल आकारमध्यिका लिंक
संरचित इंडेक्स29650.51%9811,241 B61.5
अनुभागित पाठ11319.28%784,718 B0
लिंक कैटलॉग6310.75%864,160 B23
पतला इंडेक्स528.87%662,814 B0
प्रतीकात्मक या प्लेसहोल्डर508.53%2715 B0
विशाल कंटेंट डंप122.05%742.84 MB7,259.5

शीर्ष अपनाने वालों के कार्यान्वयन अधिक घने हैं

tranco-crawl-ranks-stats.webp

ट्रैंको टॉप 1,000 में 75 वैध अपनाने वालों का मध्यिका गुणवत्ता स्कोर 96, मध्यिका फ़ाइल आकार 9,068 बाइट्स, मध्यिका Markdown लिंक संख्या 52, और मध्यिका अनुभाग संख्या 11 थी। 1,001-10,000 रैंक वाले 511 अपनाने वालों के मध्यिका मान कम थे: स्कोर 90, फ़ाइल आकार 6,506 बाइट्स, 23 Markdown लिंक, और 9 अनुभाग। टॉप 1,000 अपनाने वालों के संरचित इंडेक्स होने की संभावना भी अधिक थी: 69.33%, जबकि बाद वाले समूह में यह 47.75% थी।

झूठी-सकारात्मक समस्या

llms-txt-http-200-outcomes.webp

सबसे बड़ा मापन जोखिम झूठे-सकारात्मक परिणाम हैं। /llms.txt के लिए HTTP 200 लौटाने वाले 1,606 डोमेन में से 1,020 सत्यापन में असफल रहे। सबसे आम अमान्य कारण गलत दिशा वाला रीडायरेक्शन था, 618 मामलों के साथ। 367 प्रतिक्रियाएँ सामान्य HTML दस्तावेज़ थीं। 29 ने खाली बॉडी लौटाई, और 6 अन्य या अस्वीकृत-अश्रेणीबद्ध अमान्य प्रतिक्रियाएँ थीं।

यह इसलिए मायने रखता है क्योंकि कई बड़ी साइटें अज्ञात पथों को लॉगिन पेज, होमपेज, ऐप शेल, क्षेत्रीय पेज, सहमति इंटरफ़ेस, या मार्केटिंग फ़ॉलबैक पर भेज देती हैं। स्टेटस-कोड क्रॉलर के लिए ये प्रतिक्रियाएँ स्वस्थ दिख सकती हैं, लेकिन इनमें कोई वैध llms.txt संकेत नहीं होता।

llms-full.txt: कम और अधिक असमान

सहायक llms-full.txt फ़ाइल llms.txt की तुलना में कहीं कम सामान्य थी। क्रॉल में 103 वैध पूर्ण फ़ाइलें मिलीं, जो वैध llms.txt अपनाने वालों का 17.58% और पूरे टॉप 10,000 नमूने का 1.03% हैं।

पूर्ण-फ़ाइल कार्यान्वयन असमान थे। 103 दोहरी-फ़ाइल अपनाने वालों में से 57 के पास ऐसी llms-full.txt थी जो इंडेक्स फ़ाइल से बड़ी थी, लेकिन 46 में या तो पूर्ण फ़ाइल इंडेक्स फ़ाइल से बड़ी नहीं थी या पूर्ण फ़ाइल 100 बाइट से कम थी। मध्यिका पूर्ण-से-इंडेक्स आकार अनुपात 1.43 था, लेकिन चरम मामले इससे कहीं ऊँचे थे। Supabase की पूर्ण फ़ाइल उसके इंडेक्स फ़ाइल से लगभग 7,139 गुना बड़ी थी। Made-in-China.com की पूर्ण फ़ाइल 89.89 MB थी।

डोमेनllms.txtllms-full.txtअनुपात
made-in-china.com4.49 MB89.89 MB20.0x
sendbird.com281.86 KB11.99 MB42.5x
taboola.com286.78 KB11.73 MB40.9x
supabase.co1.26 KB8.98 MB7,139.3x
neon.tech27.44 KB5.01 MB182.7x

सिफारिश: llms-full.txt तभी प्रकाशित करें जब साइट के पास पहले से एक स्थिर दस्तावेज़ीकरण पाइपलाइन, संस्करण-नियंत्रण अनुशासन, और एक ही मशीन-पठनीय फ़ाइल में बड़ी मात्रा में सामग्री उजागर करने का स्पष्ट कारण हो।

llms.txt, robots.txt, और sitemap.xml

llms.txt को नया robots.txt नहीं माना जाना चाहिए। दोनों रूट-स्तरीय मशीन-पठनीय फ़ाइलें हैं, लेकिन वे अलग बातें बताती हैं। robots.txt क्रॉलर वरीयता और पहुँच-नियंत्रण संकेत है। sitemap.xml URL खोज संकेत है। llms.txt एक व्याख्यात्मक और नेविगेशनल संकेत है।

संकेतमुख्य भूमिकाआम पाठकइस अध्ययन में व्याख्या
robots.txtक्रॉलर वरीयताएँ और पाथ-स्तरीय प्रतिबंध घोषित करना।सर्च क्रॉलर, AI क्रॉलर, आर्काइव क्रॉलर, सामान्य बॉट।शासन और पहुँच संकेत।
sitemap.xmlइंडेक्सिंग प्रणालियों के लिए खोज योग्य URL सूचीबद्ध करना।सर्च इंजन और इंडेक्सिंग पाइपलाइन।खोज संकेत।
llms.txtसंक्षिप्त साइट संदर्भ, महत्वपूर्ण लिंक, दस्तावेज़, API, उदाहरण और नीति संदर्भ देना।LLM अनुप्रयोग, AI एजेंट, डेवलपर टूल, रिट्रीवल सिस्टम।व्याख्या और नेविगेशन संकेत।

सिफारिशें

जो साइटें llms.txt पर विचार कर रही हैं, उनके लिए इस डेटासेट और बाहरी ट्रैफ़िक साक्ष्य में सबसे मज़बूत कार्यान्वयन एक व्यावहारिक पैटर्न सुझाते हैं:

  • रूट पर /llms.txt प्रकाशित करें और इसे बिना लॉगिन, JavaScript निष्पादन, सहमति दीवारों, या गलत दिशा वाले रीडायरेक्ट के उपलब्ध रखें।
  • संभव हो तो इसे text/plain या text/markdown के रूप में सर्व करें।
  • साइट का एक छोटा विवरण देकर शुरू करें, फिर लिंक को उत्पाद, दस्तावेज़, API, प्राइसिंग, चेंजलॉग, उदाहरण, सहायता, नीतियों और कंपनी संसाधनों के अनुसार समूहित करें।
  • व्यापक URL सूचियों की बजाय कैनोनिकल लिंक को प्राथमिकता दें।
  • खाली प्रतीकात्मक फ़ाइलों से बचें; वे अधिकतम एक कमजोर संकेत हैं।
  • जब तक कोई मज़बूत मशीन-उपभोग उपयोग-मामला और विश्वसनीय जनरेशन पाइपलाइन न हो, विशाल असंगठित डंप से बचें।
  • प्रकाशित करने के बाद अंतिम URL, प्रतिक्रिया बॉडी, सामग्री प्रकार, Markdown संरचना, लिंक संख्या और फ़ाइल आकार सत्यापित करें।

टीमों को अपेक्षाएँ भी सावधानी से तय करनी चाहिए। उपलब्ध सार्वजनिक प्रयोग यह साबित नहीं करते कि llms.txt स्वतंत्र रूप से AI रेफ़रल ट्रैफ़िक बढ़ाता है। यदि कोई टीम व्यावसायिक प्रभाव जाँचना चाहती है, तो उसे LLM रेफ़रल, उद्धृत पेज, बॉट अनुरोध, इंडेक्स ताज़गी और सामग्री परिवर्तनों को एक साथ ट्रैक करना चाहिए। एक उपयोगी प्रयोग मिलते-जुलते पेज समूहों की तुलना करेगा, जहाँ संभव हो सामग्री अपडेट स्थिर रखेगा, और Perplexity, ChatGPT, Gemini, Claude, तथा Bing/Copilot जैसे प्लेटफ़ॉर्म-विशिष्ट ट्रैफ़िक को अलग करेगा।

सीमाएँ

यह क्रॉल-आधारित स्नैपशॉट है, स्थायी अंतिम सत्य नहीं। वेबसाइटें किसी भी समय llms.txt फ़ाइलें जोड़, हटा या बदल सकती हैं। कुछ डोमेन स्वचालित अनुरोधों को ब्लॉक कर सकते हैं या भूगोल, TLS कॉन्फ़िगरेशन, रीडायरेक्ट लॉजिक, यूज़र एजेंट, या बॉट-शमन के आधार पर अलग व्यवहार कर सकते हैं। अध्ययन ने केवल रूट-स्तरीय फ़ाइलों का परीक्षण किया और सबडोमेन या गैर-मानक पथों की खोज नहीं की।

गुणवत्ता स्कोर और आर्केटाइप शोध उपकरण हैं, आधिकारिक अनुपालन लेबल नहीं। विषय विश्लेषण कीवर्ड-आधारित है और इसे दिशात्मक समझा जाना चाहिए। अध्ययन यह सिद्ध नहीं करता कि कोई विशिष्ट AI प्लेटफ़ॉर्म वर्तमान में उत्पादन में llms.txt को पढ़ता, मानता या उपयोग करता है।

इस संस्करण में समीक्षा किए गए बाहरी ट्रैफ़िक साक्ष्य की भी सीमाएँ हैं। Search Engine Land का विश्लेषण रैंडमाइज़्ड प्रयोग की तुलना में सावधानी-सूचक बहु-साइट अवलोकन के रूप में अधिक मज़बूत है। Alimbekov का परिणाम एक पारदर्शी साइट-स्तरीय केस स्टडी के रूप में उपयोगी है, लेकिन उसमें नियंत्रण समूह नहीं है और उसमें वह अवधि शामिल है जब कुल रेफ़रल ट्रैफ़िक काफ़ी बढ़ा। ये संदर्भ बहस को ढाँचा देने में मदद करते हैं, लेकिन इस क्रॉल को कारणात्मक ट्रैफ़िक अध्ययन नहीं बना देते।

फ़ाइलें और पुनरुत्पादन क्षमता

फ़ाइलउद्देश्य
crawl_llms_txt.py/llms.txt और /llms-full.txt के लिए क्रॉलर।
analyze_llms_txt.pyमुख्य अपनाने विश्लेषण और चार्ट निर्माण।
deep_analyze_llms_txt.pyरैंक डेसाइल, TLD, विषय संकेत, गुणवत्ता स्कोर, आर्केटाइप और दोहरी-फ़ाइल व्यवहार के लिए द्वितीयक विश्लेषण।
deep_dive_early_quality.pyशुरुआती अपनाने वालों का वर्गीकरण और कार्यान्वयन-गुणवत्ता पर गहरा विश्लेषण।
data/llms_probe_results_top_10000.csvमुख्य क्रॉल परिणाम डेटासेट।
data/deep_analysis_top_10000.jsonद्वितीयक विश्लेषण सारांश।
data/deep_early_quality_analysis.jsonशुरुआती अपनाने वाली श्रेणियाँ, गुणवत्ता समूह तुलना, आर्केटाइप विवरण और केस स्टडीज़।

स्रोत

पद्धति-सुधार, डेटासेट समस्याएँ, और आगे के विश्लेषण support@thunderbit.com पर स्वागत हैं। यह रिपोर्ट Thunderbit की किसी भी व्यावसायिक स्थिति से स्वतंत्र रूप से प्रकाशित की गई है। इस रिपोर्ट का डेटा स्वयं में पर्याप्त है। — The Thunderbit research team, मई 2026.

वेब डेटा स्क्रैप और विश्लेषण करने के लिए Thunderbit आज़माएँ Get Started Free

Shuai Guan
Shuai Guan
Thunderbit के CEO | AI डेटा ऑटोमेशन एक्सपर्ट Shuai Guan Thunderbit के CEO हैं और University of Michigan Engineering के पूर्व छात्र हैं। टेक और SaaS आर्किटेक्चर में लगभग दस वर्षों के अनुभव के आधार पर, वे जटिल AI मॉडल्स को ऐसे व्यावहारिक, बिना कोड वाले डेटा एक्सट्रैक्शन टूल्स में बदलने में माहिर हैं जो रोज़मर्रा के काम में तुरंत उपयोग किए जा सकें। इस ब्लॉग पर वे वेब स्क्रैपिंग और ऑटोमेशन रणनीतियों पर अपने सीधे, आज़माए हुए अनुभव साझा करते हैं, ताकि आप अधिक स्मार्ट और डेटा-आधारित वर्कफ़्लो बना सकें। जब वे डेटा वर्कफ़्लो को बेहतर बनाने में व्यस्त नहीं होते, तो वही बारीकी और पैनी नज़र वे अपनी फोटोग्राफी की रुचि में लगाते हैं।

Thunderbit आज़माएं

लीड्स और अन्य डेटा सिर्फ 2 क्लिक में स्क्रैप करें। AI से संचालित।

Thunderbit पाएं यह मुफ्त है
AI का उपयोग करके डेटा निकालें
डेटा को Google Sheets, Airtable या Notion में आसानी से ट्रांसफर करें
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week