बड़े भाषा मॉडलों के लिए मशीन-पठनीय मार्गदर्शन प्रकाशित करने वाली ज़्यादा ट्रैफ़िक वाली वेबसाइटों का क्रॉल-आधारित अध्ययन, शुरुआती कार्यान्वयन कैसे दिखते हैं, और अपनाने को मापते समय सिर्फ़ HTTP 200 प्रतिक्रियाएँ गिनने से आगे क्यों देखना पड़ता है।
- डेटासेट:
data/llms_probe_results_top_10000.csv - ट्रैंको सूची डाउनलोड की गई: 6 मई, 2026
- दायरा: रूट-स्तर
/llms.txtऔर/llms-full.txt
प्रमुख मीट्रिक्स

- 5.86%: ट्रैंको टॉप 10,000 में वैध
llms.txtअपनाने की दर, यानी 586 डोमेन। - 1.03%: वैध
llms-full.txtअपनाने की दर, यानी 103 डोमेन। हर वैध पूर्ण-फ़ाइल अपनाने वाले के पास एक वैध इंडेक्स फ़ाइल भी थी। - 63.51%:
/llms.txtके लिए HTTP 200 प्रतिक्रियाओं का वह हिस्सा जो सत्यापन में असफल रहा। - 2.74x: यदि अपनाने को सिर्फ़ कच्ची HTTP 200 प्रतिक्रियाओं से मापा जाए, तो अनुमान लगभग इतना ज़्यादा लग जाएगा।
कार्यकारी सारांश
llms.txt अभी भी वेब की एक शुरुआती परंपरा है, लेकिन अब यह हाशिये का प्रयोग नहीं रहा। 6 मई, 2026 को ट्रैंको टॉप 10,000 डोमेन के क्रॉल में इस अध्ययन को 586 वैध llms.txt फ़ाइलें मिलीं, यानी 5.86% की देखी गई अपनाने की दर। इसकी सहायक llms-full.txt फ़ाइल कहीं कम सामान्य थी: 103 डोमेन में वैध पूर्ण फ़ाइल मिली, यानी 1.03% की अपनाने की दर।
सबसे अहम पद्धतिगत निष्कर्ष यह है कि स्टेटस कोड अपनाने का अच्छा संकेतक नहीं हैं। क्रॉलर को /llms.txt के लिए 1,606 HTTP 200 प्रतिक्रियाएँ मिलीं, लेकिन इनमें से केवल 586 सत्यापित हुईं। बाकी 1,020 मामलों में ज़्यादातर गलत दिशा वाले रीडायरेक्ट, सामान्य HTML पेज, खाली बॉडी, या अन्य अमान्य प्रतिक्रियाएँ थीं। जो साधारण क्रॉलर हर 200 प्रतिक्रिया को अपनाना मान लेता है, वह वैध अपनाने का अनुमान लगभग 2.74 गुना बढ़ा देगा।
वैध अपनाने वालों में कार्यान्वयन की गुणवत्ता सिर्फ़ खाली-प्लेसहोल्डर वाली कहानी नहीं है। मध्यिका वैध फ़ाइल लगभग 7.1 KB थी, 61.77% वैध फ़ाइलें 5 KB से बड़ी थीं, 70.82% में छह या अधिक Markdown अनुभाग थे, और 77.47% में 11 या अधिक Markdown लिंक थे। शुरुआती अपनाने वालों में Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog और Cloudinary शामिल हैं।
llms.txtको सबसे अच्छा एक व्याख्यात्मक और नेविगेशनल संकेत के रूप में समझना चाहिए, न किrobots.txtके विकल्प के रूप में। इसकी उपयोगिता सिर्फ़ फ़ाइल के मौजूद होने में नहीं, बल्कि इस बात में है कि क्या वह मशीनों को प्रामाणिक, संक्षिप्त और अद्यतन जानकारी खोजने में मदद करती है।
संदर्भ: वेब में AI-उन्मुख संकेत जुड़ रहे हैं
वेबसाइटें लंबे समय से क्रॉलर वरीयताएँ बताने के लिए robots.txt, URL खोज में मदद के लिए sitemap.xml, और पेजों की व्याख्या में खोज एवं प्लेटफ़ॉर्म प्रणालियों की मदद के लिए संरचित डेटा का उपयोग करती रही हैं। जेनरेटिव AI एक अलग समस्या लाती है। सामग्री प्रशिक्षण, रिट्रीवल, सारांश, एजेंटिक ब्राउज़िंग, कोड सहायता, ग्राहक सहायता और उत्तर निर्माण में इस्तेमाल हो सकती है। इससे दो ज़रूरतें एक साथ पैदा होती हैं: प्रकाशक स्वचालित उपयोग पर अधिक नियंत्रण चाहते हैं, लेकिन वे यह भी चाहते हैं कि जब AI प्रणालियाँ उनकी साइटों से इंटरैक्ट करें, तो उन्हें सही कैनोनिकल जानकारी आसानी से मिले।
मूल llms.txt प्रस्ताव, जिसे 2024 में Jeremy Howard ने प्रस्तुत किया, इस फ़ाइल को वेबसाइट रूट पर रखे जाने वाले Markdown दस्तावेज़ के रूप में परिभाषित करता है, जो अनुमान के समय LLM-अनुकूल जानकारी देता है। प्रस्ताव का तर्क है कि HTML पेजों में अक्सर नेविगेशन, विज्ञापन, स्क्रिप्ट और अन्य शोर होता है, जिससे भाषा मॉडलों के लिए उन्हें प्रोसेस करना कठिन हो जाता है। एक संक्षिप्त Markdown फ़ाइल मॉडलों को सबसे महत्वपूर्ण पेजों, दस्तावेज़ों, API, उदाहरणों, नीतियों और उत्पाद जानकारी की ओर संकेत कर सकती है।
बाहरी वेब अनुसंधान व्यापक पृष्ठभूमि देता है। Data Provenance Initiative के “Consent in Crisis” में robots.txt और सेवा शर्तों में AI-संबंधी प्रतिबंधों की तेज़ वृद्धि का वर्णन है, और यह तर्क दिया गया है कि मौजूदा वेब-सहमति तंत्र बड़े पैमाने पर AI डेटा पुन: उपयोग के लिए डिज़ाइन नहीं किए गए थे। Cloudflare Radar AI Insights ने भी टॉप 10,000 डोमेन स्तर पर AI क्रॉलर और robots.txt पैटर्न को दृश्य बनाया है। उस माहौल में llms.txt AI संकेत देने के रचनात्मक पक्ष पर आता है: “इसे क्रॉल न करो” नहीं, बल्कि “अगर आपको यह साइट समझनी है, तो यहाँ से शुरू करो।”
बाहरी प्रमाण और अपनाने पर बहस
llms.txt को लेकर सार्वजनिक बहस दो दावों में बंटी हुई है। आशावादी दावा है कि यह फ़ाइल AI प्रणालियों को प्रामाणिक सामग्री तक साफ़ और अधिक कुशल रास्ता देती है। संदेहवादी दावा है कि किसी भी प्रमुख LLM प्रदाता ने सार्वजनिक रूप से इसे रैंकिंग, क्रॉलिंग या सिटेशन संकेत के रूप में उपयोग करने की प्रतिबद्धता नहीं की है, इसलिए प्रकाशकों को केवल इस फ़ाइल के कारण ट्रैफ़िक बढ़ने की उम्मीद नहीं करनी चाहिए। इस अपडेट के लिए समीक्षा किए गए तीन बाहरी संदर्भ अधिक सूक्ष्म निष्कर्ष का समर्थन करते हैं: llms.txt उपयोगी अवसंरचना है, लेकिन प्रत्यक्ष ट्रैफ़िक प्रभाव के प्रमाण सीमित और संदर्भ-निर्भर हैं।
बाहरी अपनाने के बेंचमार्क तेज़ी से बदल रहे हैं
Rankability का अपनाने ट्रैकर ने 22 जून, 2025 तक शीर्ष 1,000 वेबसाइटों में 0.3% अपनाने की दर बताई, यानी 1,000 में 3 साइटें। यह domain.com/llms.txt के मासिक स्वचालित स्कैन का वर्णन करता है, जिसमें रीडायरेक्ट और HTML प्रतिक्रियाओं को बाहर रखने वाला सत्यापन शामिल है। पद्धति की दिशा इस अध्ययन के सतर्क सत्यापन दृष्टिकोण से मिलती-जुलती है।
परिणामों में अंतर बड़ा है: इस अध्ययन में 6 मई, 2026 को ट्रैंको टॉप 1,000 में 75 वैध llms.txt फ़ाइलें मिलीं, यानी 7.50%। इन दो संख्याओं को सख्त टाइम-सीरीज़ नहीं माना जाना चाहिए, क्योंकि रैंकिंग स्रोत, कार्यान्वयन विवरण, सत्यापन तर्क और क्रॉल समय अलग हो सकते हैं। फिर भी, यह तुलना संकेत देती है कि मध्य-2025 और मई 2026 के बीच अपनाना काफ़ी बदला, खासकर डेवलपर, SaaS, क्लाउड, सुरक्षा और दस्तावेज़-प्रधान साइटों में।
| स्रोत | स्नैपशॉट | नमूना | रिपोर्ट किया गया वैध अपनाना | व्याख्या |
|---|---|---|---|---|
| Rankability | 22 जून, 2025 | शीर्ष 1,000 वेबसाइटें | 0.3% | मध्य-2025 में न्यूनतम अपनाने का शुरुआती सार्वजनिक बेंचमार्क। |
| यह अध्ययन | 6 मई, 2026 | ट्रैंको शीर्ष 1,000 | 7.50% | बाद के क्रॉल में उच्च-ट्रैफ़िक साइटों पर स्पष्ट अपनाना। |
| यह अध्ययन | 6 मई, 2026 | ट्रैंको शीर्ष 10,000 | 5.86% | व्यापक नमूना, जो दिखाता है कि अपनाना मापनीय है लेकिन अभी मुख्यधारा नहीं। |
ट्रैफ़िक प्रयोग अब भी मिश्रित हैं
Search Engine Land ने जनवरी 2026 में 10-साइट विश्लेषण प्रकाशित किया, जिसमें कार्यान्वयन से पहले 90 दिन और बाद के 90 दिन तक साइटों को ट्रैक किया गया। लेख में बताया गया कि दो साइटों पर AI ट्रैफ़िक 12.5% और 25% बढ़ा, आठ में कोई मापनीय सुधार नहीं हुआ, और एक 19.7% गिर गया। इसकी मुख्य व्याख्या कारणात्मक सावधानी थी: दो सफल उदाहरणों ने साथ ही नए टेम्पलेट लॉन्च किए, रिसोर्स सेंटर दोबारा बनाए, निकाली जा सकने वाली तुलना तालिकाएँ जोड़ीं, प्रेस कवरेज हासिल की, तकनीकी समस्याएँ ठीक कीं, या नई FAQ-शैली की सामग्री प्रकाशित की। उस दृष्टिकोण में, llms.txt ने मजबूत सामग्री और तकनीकी काम का दस्तावेज़ीकरण किया; यह अकेले वृद्धि का कारण नहीं दिखा।
Renat Alimbekov के निजी ब्लॉग प्रयोग ने छोटे साइट-स्तरीय अवलोकन से अधिक सकारात्मक निष्कर्ष निकाला। इसमें llms.txt और llms-full.txt दोनों जोड़ने के बाद Yandex.Metrica में दो चार-महीने की अवधियों की तुलना की गई। LLM रेफ़रल सत्र 75 से बढ़कर 92 हो गए, यानी 23% की वृद्धि, जबकि उपयोगकर्ता 51 से बढ़कर 64 हुए। Perplexity सत्र 29 से बढ़कर 55 हुए, जबकि ChatGPT सत्र 31 से घटकर 26 रह गए। उसी पोस्ट में यह भी बताया गया है कि कुल रेफ़रल ट्रैफ़िक 160 से 290 सत्रों तक तेज़ी से बढ़ा, इसलिए LLM सत्र हिस्सेदारी 47% से घटकर 32% रह गई।
| साक्ष्य का प्रकार | देखा गया परिणाम | मुख्य सावधानी | यह रिपोर्ट पर कैसे असर डालता है |
|---|---|---|---|
| Search Engine Land का 10-साइट पूर्व/पश्चात अध्ययन | दो साइटें बढ़ीं, आठ में कोई मापनीय बदलाव नहीं, एक घटी। | सकारात्मक मामलों में साथ-साथ सामग्री, PR और तकनीकी बदलाव थे। | llms.txt को अवसंरचना के रूप में देखने का समर्थन, न कि अकेले वृद्धि लीवर के रूप में। |
| Alimbekov का निजी ब्लॉग पूर्व/पश्चात अवलोकन | बाद की अवधि में LLM रेफ़रल सत्र 23% बढ़े। | कोई नियंत्रण समूह नहीं; कुल रेफ़रल ट्रैफ़िक 81% बढ़ा, और LLM हिस्सा गिरा। | तकनीकी ब्लॉगों के लिए, खासकर Perplexity के माध्यम से, संभावित लाभ का संकेत, लेकिन कारण स्पष्ट नहीं। |
| यह क्रॉल-आधारित अपनाने का अध्ययन | 586 वैध फ़ाइलें और कई संरचित कार्यान्वयन। | उपस्थिति और संरचना मापता है, डाउनस्ट्रीम ट्रैफ़िक प्रभाव नहीं। | अपनाने और कार्यान्वयन परिपक्वता दिखाता है, लेकिन अपने आप ROI नहीं। |
बहस क्या स्पष्ट करती है
बाहरी प्रमाण इस डेटासेट की व्याख्या को और साफ़ बनाते हैं। एक अच्छी तरह संरचित llms.txt फ़ाइल मशीन-पार्सिंग की बाधा कम कर सकती है, खासकर डेवलपर दस्तावेज़ों, API संदर्भों और नॉलेज-बेस सामग्री के लिए। लेकिन सबसे मज़बूत ट्रैफ़िक मामलों में अब भी ऐसी सामग्री की ज़रूरत दिखती है जो उपयोगी, निकाली जा सकने योग्य, प्रामाणिक और फ़ाइल के बाहर भी खोजी जा सके। इसलिए व्यावहारिक प्रश्न अकेले “क्या llms.txt मायने रखता है?” नहीं है। असली प्रश्न यह है कि क्या यह फ़ाइल एक व्यापक AI-पठनीय सामग्री प्रणाली का हिस्सा है।
अद्यतन व्याख्या:
llms.txtको कम-लागत वाली AI-उन्मुख अवसंरचना के रूप में लागू किया जाना चाहिए। इसे बेहतर दस्तावेज़ीकरण, संरचित सामग्री, तकनीकी पहुँच-योग्यता, सिटेशन, लिंक, या ब्रांड प्रामाणिकता के विकल्प के रूप में प्रस्तुत नहीं किया जाना चाहिए।
AI वेब स्क्रैपिंग के लिए Thunderbit आज़माएँ
पद्धति
इस अध्ययन में नमूने के रूप में ट्रैंको टॉप 10,000 डोमेन का उपयोग किया गया। ट्रैंको एक शोध-उन्मुख शीर्ष-साइट रैंकिंग है, जिसे कई पारंपरिक टॉप सूचियों की तुलना में अधिक स्थिर और हेरफेर-प्रतिरोधी बनाने के लिए डिज़ाइन किया गया है। ट्रैंको स्रोत फ़ाइल 6 मई, 2026 को डाउनलोड की गई, और स्रोत का Last-Modified टाइमस्टैम्प 5 मई, 2026 22:17:59 GMT था।
क्रॉलर ने प्रत्येक डोमेन के लिए दो रूट-स्तरीय पाथों की जाँच की:
https://example.com/llms.txt, आवश्यकता होने पर HTTP फ़ॉलबैक के साथ।https://example.com/llms-full.txt, आवश्यकता होने पर HTTP फ़ॉलबैक के साथ।
हर जाँच के लिए, क्रॉलर ने स्टेटस कोड, अंतिम URL, फ़ेच विधि, रिस्पॉन्स बाइट्स, सामग्री प्रकार, त्रुटि संदेश, बीता समय, और सत्यापन परिणाम दर्ज किए। सफल रिस्पॉन्स बॉडी की समीक्षा और द्वितीयक विश्लेषण के लिए raw_llms_txt/ के तहत सहेजा गया।
सत्यापन नियम
किसी प्रतिक्रिया को तभी वैध फ़ाइल माना गया जब उसने सफल बॉडी लौटाई हो और वह सामान्य वेब फ़ॉलबैक जैसी न लगे। अंतिम URL पथ को /llms.txt या /llms-full.txt ही रहना था। खाली बॉडी अस्वीकृत की गईं। स्पष्ट HTML दस्तावेज़ और ऐप शेल अस्वीकृत किए गए। कंटेंट टाइप को केवल एक सहायक संकेत माना गया, क्योंकि कुछ वैध टेक्स्ट-जैसी फ़ाइलें असामान्य कंटेंट टाइप के साथ परोसी गई थीं।
अपनाने का परिदृश्य
क्रॉल में ट्रैंको टॉप 10,000 के भीतर 586 वैध llms.txt फ़ाइलें मिलीं। इससे वैध अपनाने की दर 5.86% बनती है। छोटी सहायक llms-full.txt फ़ाइल 103 डोमेन पर मौजूद और वैध थी, यानी नमूने का 1.03%।
| मीट्रिक | गिनती | टॉप 10,000 का हिस्सा |
|---|---|---|
| क्रॉल किए गए डोमेन | 10,000 | 100.00% |
| वैध llms.txt फ़ाइलें | 586 | 5.86% |
| वैध llms-full.txt फ़ाइलें | 103 | 1.03% |
| /llms.txt के लिए HTTP 200 प्रतिक्रियाएँ | 1,606 | 16.06% |
| अमान्य के रूप में अस्वीकृत HTTP 200 प्रतिक्रियाएँ | 1,020 | 10.20% |
अपनाना सिर्फ़ शीर्ष-भारी नहीं है
टॉप 1,000 में अपनाना पूरे टॉप 10,000 की तुलना में अधिक था, लेकिन यह केवल सबसे बड़े साइटों तक सीमित नहीं था। टॉप 1,000 की अपनाने दर 7.50% थी। अंतिम 1,000-डोमेन बकेट, यानी रैंक 9,001-10,000, 3.80% तक गिर गई। रैंकिंग का मध्य भाग सक्रिय रहा: 2,001-3,000, 3,001-4,000, 5,001-6,000 और 6,001-7,000 बकेट सभी लगभग 6% पर रहे।

शुरुआती अपनाने वाले
सबसे ऊँचे रैंक वाला वैध अपनाने वाला Cloudflare था, ट्रैंको रैंक 4 पर। अन्य उच्च-रैंकिंग अपनाने वालों में Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink और OneSignal शामिल थे।
ये अपनाने वाले यादृच्छिक नहीं हैं। इनके पास आम तौर पर बड़े दस्तावेज़ीकरण क्षेत्र, व्याख्या की ज़रूरत वाले उत्पाद, API या डेवलपर इकोसिस्टम, सपोर्ट सामग्री, प्राइसिंग पेज, सुरक्षा और गोपनीयता सामग्री, और इतना ब्रांड-प्रभाव होता है कि वे इस बात की परवाह करें कि AI प्रणालियाँ उनकी साइटों की व्याख्या कैसे करती हैं।
| रैंक | डोमेन | फ़ाइल आकार | देखा गया पैटर्न |
|---|---|---|---|
| 4 | cloudflare.com | 4,225 B | संक्षिप्त उत्पाद, डेवलपर, कंपनी और प्राइसिंग इंडेक्स। |
| 26 | azure.com | 47,037 B | डेवलपर टूल, AI, कंप्यूट, स्टोरेज, सुरक्षा, मॉनिटरिंग और वैकल्पिक संसाधन। |
| 28 | github.com | 27,108 B | प्रोग्रामेटिक एक्सेस, Copilot, MCP, REST API, Actions, repositories और CLI लिंक। |
| 248 | stripe.com | 64,229 B | Payments, Connect, Checkout, Billing, Tax, Atlas, Radar और डेवलपर दस्तावेज़। |
| 265 | salesforce.com | 1.02 MB | विशाल उत्पाद और Agentforce लिंक कैटलॉग, Markdown अनुभाग शीर्षकों के बिना। |
टॉप 1,000 अपनाने वाले वर्ग
इस अध्ययन ने ट्रैंको टॉप 1,000 में 75 वैध अपनाने वालों का वर्गीकरण डोमेन संदर्भ, प्रथम शीर्षकों, कच्ची फ़ाइल संरचना और सामग्री कीवर्ड के आधार पर किया। सबसे बड़ा समूह मार्केटिंग, मीडिया और adtech था, 22.67% के साथ। क्लाउड, डेवलपर और इन्फ्रास्ट्रक्चर साइटों का हिस्सा 20.00% था। SaaS, उत्पादकता और ग्राहक-ऑप्स साइटों का हिस्सा 17.33% था। सुरक्षा, पहचान और गोपनीयता साइटों का हिस्सा 12.00% था।

| श्रेणी | डोमेन | टॉप 1,000 अपनाने वालों का हिस्सा | मध्यिका गुणवत्ता स्कोर | मध्यिका लिंक |
|---|---|---|---|---|
| मार्केटिंग, मीडिया और adtech | 17 | 22.67% | 94 | 25 |
| क्लाउड, dev और infrastructure | 15 | 20.00% | 94 | 62 |
| SaaS, उत्पादकता और ग्राहक ops | 13 | 17.33% | 94 | 46 |
| सुरक्षा, पहचान और गोपनीयता | 9 | 12.00% | 98 | 78 |
| CMS, होस्टिंग और वेब उपस्थिति | 7 | 9.33% | 100 | 24 |
TLD पैटर्न
टॉप-लेवल डोमेन उद्योग-लेबल नहीं होते, लेकिन वे उपयोगी दिशात्मक संकेत देते हैं। नमूने में जिन TLD में कम-से-कम 50 डोमेन थे, उनमें .io की वैध अपनाने दर 14.44% के साथ सबसे ऊँची थी। .com 8.19% पर रहा। .gov, .edu और .net में कम अपनाना बताता है कि शुरुआती अपनाने वाला आधार संस्थागत की तुलना में अधिक वाणिज्यिक और तकनीकी है।
कार्यान्वयन गुणवत्ता
वैध अपनाना समान कार्यान्वयन गुणवत्ता का मतलब नहीं है। कुछ फ़ाइलें संक्षिप्त, सुविभाजित इंडेक्स हैं। कुछ ज़्यादातर गद्य हैं। कुछ कच्ची लिंक कैटलॉग हैं। कुछ लगभग खाली प्लेसहोल्डर हैं। कुछ कई मेगाबाइट के कंटेंट डंप हैं, जो पूर्ण हो सकते हैं, लेकिन फ़ेच और पार्स करने में महँगे हैं।
वैध llms.txt फ़ाइलों में से 362 5 KB से बड़ी थीं, यानी वैध अपनाने वालों का 61.77%। मध्यिका फ़ाइल आकार लगभग 7.1 KB थी। P90 फ़ाइल आकार 156 KB था, P95 356 KB, P99 2.54 MB, और सबसे बड़ी देखी गई फ़ाइल 7.97 MB थी।
सामान्य सामग्री संकेत
वैध फ़ाइलों के कीवर्ड-स्तरीय स्कैन से पता चला कि कई साइटें सिर्फ़ एक घोषणा प्रकाशित नहीं कर रहीं; वे मॉडलों को संचालन-योग्य सामग्री की ओर इंगित कर रही हैं। सपोर्ट या मदद से जुड़े शब्द 70.31% वैध फ़ाइलों में आए। ब्लॉग, गाइड या ट्यूटोरियल शब्द 67.92% में आए। सुरक्षा, गोपनीयता, अनुपालन या शर्तें 61.43% में आईं। प्राइसिंग 53.92% में, दस्तावेज़ीकरण 52.22% में, API शब्द 33.96% में, और चेंजलॉग या रिलीज़ संकेत 27.30% में पाए गए।
गुणवत्ता स्कोरिंग और आर्केटाइप
उपस्थिति से परिपक्वता की ओर बढ़ने के लिए, इस अध्ययन ने एक हल्का कार्यान्वयन स्कोर बनाया। यह स्कोर कंटेंट टाइप, फ़ाइल आकार, Markdown संरचना, लिंक संख्या, विषय कवरेज, और चेतावनी संकेतों को देखता है जैसे शीर्षकों की अनुपस्थिति, Markdown लिंक न होना, असामान्य कंटेंट टाइप, छोटी फ़ाइलें, बहुत बड़ी फ़ाइलें, और लिंक-डंप व्यवहार। यह कोई औपचारिक मानक नहीं है। यह देखे गए कार्यान्वयनों की तुलना के लिए एक शोध-स्कोरिंग मॉडल है।
इस मॉडल का उपयोग करते हुए, 416 वैध फ़ाइलों को मज़बूत संरचित इंडेक्स, 107 को उपयोगी इंडेक्स, 24 को पतला या अनियमित, और 39 को प्रतीकात्मक या कम-उपयोगिता वाले रूप में वर्गीकृत किया गया। एक अलग आर्केटाइप विश्लेषण में 296 संरचित इंडेक्स, 113 अनुभागित-पाठ फ़ाइलें, 63 लिंक कैटलॉग, 52 पतले इंडेक्स, 50 प्रतीकात्मक या प्लेसहोल्डर फ़ाइलें, और 12 विशाल कंटेंट डंप पाए गए।

| आर्केटाइप | डोमेन | वैध फ़ाइलों का हिस्सा | मध्यिका स्कोर | मध्यिका फ़ाइल आकार | मध्यिका लिंक |
|---|---|---|---|---|---|
| संरचित इंडेक्स | 296 | 50.51% | 98 | 11,241 B | 61.5 |
| अनुभागित पाठ | 113 | 19.28% | 78 | 4,718 B | 0 |
| लिंक कैटलॉग | 63 | 10.75% | 86 | 4,160 B | 23 |
| पतला इंडेक्स | 52 | 8.87% | 66 | 2,814 B | 0 |
| प्रतीकात्मक या प्लेसहोल्डर | 50 | 8.53% | 27 | 15 B | 0 |
| विशाल कंटेंट डंप | 12 | 2.05% | 74 | 2.84 MB | 7,259.5 |
शीर्ष अपनाने वालों के कार्यान्वयन अधिक घने हैं

ट्रैंको टॉप 1,000 में 75 वैध अपनाने वालों का मध्यिका गुणवत्ता स्कोर 96, मध्यिका फ़ाइल आकार 9,068 बाइट्स, मध्यिका Markdown लिंक संख्या 52, और मध्यिका अनुभाग संख्या 11 थी। 1,001-10,000 रैंक वाले 511 अपनाने वालों के मध्यिका मान कम थे: स्कोर 90, फ़ाइल आकार 6,506 बाइट्स, 23 Markdown लिंक, और 9 अनुभाग। टॉप 1,000 अपनाने वालों के संरचित इंडेक्स होने की संभावना भी अधिक थी: 69.33%, जबकि बाद वाले समूह में यह 47.75% थी।
झूठी-सकारात्मक समस्या

सबसे बड़ा मापन जोखिम झूठे-सकारात्मक परिणाम हैं। /llms.txt के लिए HTTP 200 लौटाने वाले 1,606 डोमेन में से 1,020 सत्यापन में असफल रहे। सबसे आम अमान्य कारण गलत दिशा वाला रीडायरेक्शन था, 618 मामलों के साथ। 367 प्रतिक्रियाएँ सामान्य HTML दस्तावेज़ थीं। 29 ने खाली बॉडी लौटाई, और 6 अन्य या अस्वीकृत-अश्रेणीबद्ध अमान्य प्रतिक्रियाएँ थीं।
यह इसलिए मायने रखता है क्योंकि कई बड़ी साइटें अज्ञात पथों को लॉगिन पेज, होमपेज, ऐप शेल, क्षेत्रीय पेज, सहमति इंटरफ़ेस, या मार्केटिंग फ़ॉलबैक पर भेज देती हैं। स्टेटस-कोड क्रॉलर के लिए ये प्रतिक्रियाएँ स्वस्थ दिख सकती हैं, लेकिन इनमें कोई वैध llms.txt संकेत नहीं होता।
llms-full.txt: कम और अधिक असमान
सहायक llms-full.txt फ़ाइल llms.txt की तुलना में कहीं कम सामान्य थी। क्रॉल में 103 वैध पूर्ण फ़ाइलें मिलीं, जो वैध llms.txt अपनाने वालों का 17.58% और पूरे टॉप 10,000 नमूने का 1.03% हैं।
पूर्ण-फ़ाइल कार्यान्वयन असमान थे। 103 दोहरी-फ़ाइल अपनाने वालों में से 57 के पास ऐसी llms-full.txt थी जो इंडेक्स फ़ाइल से बड़ी थी, लेकिन 46 में या तो पूर्ण फ़ाइल इंडेक्स फ़ाइल से बड़ी नहीं थी या पूर्ण फ़ाइल 100 बाइट से कम थी। मध्यिका पूर्ण-से-इंडेक्स आकार अनुपात 1.43 था, लेकिन चरम मामले इससे कहीं ऊँचे थे। Supabase की पूर्ण फ़ाइल उसके इंडेक्स फ़ाइल से लगभग 7,139 गुना बड़ी थी। Made-in-China.com की पूर्ण फ़ाइल 89.89 MB थी।
| डोमेन | llms.txt | llms-full.txt | अनुपात |
|---|---|---|---|
| made-in-china.com | 4.49 MB | 89.89 MB | 20.0x |
| sendbird.com | 281.86 KB | 11.99 MB | 42.5x |
| taboola.com | 286.78 KB | 11.73 MB | 40.9x |
| supabase.co | 1.26 KB | 8.98 MB | 7,139.3x |
| neon.tech | 27.44 KB | 5.01 MB | 182.7x |
सिफारिश:
llms-full.txtतभी प्रकाशित करें जब साइट के पास पहले से एक स्थिर दस्तावेज़ीकरण पाइपलाइन, संस्करण-नियंत्रण अनुशासन, और एक ही मशीन-पठनीय फ़ाइल में बड़ी मात्रा में सामग्री उजागर करने का स्पष्ट कारण हो।
llms.txt, robots.txt, और sitemap.xml
llms.txt को नया robots.txt नहीं माना जाना चाहिए। दोनों रूट-स्तरीय मशीन-पठनीय फ़ाइलें हैं, लेकिन वे अलग बातें बताती हैं। robots.txt क्रॉलर वरीयता और पहुँच-नियंत्रण संकेत है। sitemap.xml URL खोज संकेत है। llms.txt एक व्याख्यात्मक और नेविगेशनल संकेत है।
| संकेत | मुख्य भूमिका | आम पाठक | इस अध्ययन में व्याख्या |
|---|---|---|---|
robots.txt | क्रॉलर वरीयताएँ और पाथ-स्तरीय प्रतिबंध घोषित करना। | सर्च क्रॉलर, AI क्रॉलर, आर्काइव क्रॉलर, सामान्य बॉट। | शासन और पहुँच संकेत। |
sitemap.xml | इंडेक्सिंग प्रणालियों के लिए खोज योग्य URL सूचीबद्ध करना। | सर्च इंजन और इंडेक्सिंग पाइपलाइन। | खोज संकेत। |
llms.txt | संक्षिप्त साइट संदर्भ, महत्वपूर्ण लिंक, दस्तावेज़, API, उदाहरण और नीति संदर्भ देना। | LLM अनुप्रयोग, AI एजेंट, डेवलपर टूल, रिट्रीवल सिस्टम। | व्याख्या और नेविगेशन संकेत। |
सिफारिशें
जो साइटें llms.txt पर विचार कर रही हैं, उनके लिए इस डेटासेट और बाहरी ट्रैफ़िक साक्ष्य में सबसे मज़बूत कार्यान्वयन एक व्यावहारिक पैटर्न सुझाते हैं:
- रूट पर
/llms.txtप्रकाशित करें और इसे बिना लॉगिन, JavaScript निष्पादन, सहमति दीवारों, या गलत दिशा वाले रीडायरेक्ट के उपलब्ध रखें। - संभव हो तो इसे
text/plainयाtext/markdownके रूप में सर्व करें। - साइट का एक छोटा विवरण देकर शुरू करें, फिर लिंक को उत्पाद, दस्तावेज़, API, प्राइसिंग, चेंजलॉग, उदाहरण, सहायता, नीतियों और कंपनी संसाधनों के अनुसार समूहित करें।
- व्यापक URL सूचियों की बजाय कैनोनिकल लिंक को प्राथमिकता दें।
- खाली प्रतीकात्मक फ़ाइलों से बचें; वे अधिकतम एक कमजोर संकेत हैं।
- जब तक कोई मज़बूत मशीन-उपभोग उपयोग-मामला और विश्वसनीय जनरेशन पाइपलाइन न हो, विशाल असंगठित डंप से बचें।
- प्रकाशित करने के बाद अंतिम URL, प्रतिक्रिया बॉडी, सामग्री प्रकार, Markdown संरचना, लिंक संख्या और फ़ाइल आकार सत्यापित करें।
टीमों को अपेक्षाएँ भी सावधानी से तय करनी चाहिए। उपलब्ध सार्वजनिक प्रयोग यह साबित नहीं करते कि llms.txt स्वतंत्र रूप से AI रेफ़रल ट्रैफ़िक बढ़ाता है। यदि कोई टीम व्यावसायिक प्रभाव जाँचना चाहती है, तो उसे LLM रेफ़रल, उद्धृत पेज, बॉट अनुरोध, इंडेक्स ताज़गी और सामग्री परिवर्तनों को एक साथ ट्रैक करना चाहिए। एक उपयोगी प्रयोग मिलते-जुलते पेज समूहों की तुलना करेगा, जहाँ संभव हो सामग्री अपडेट स्थिर रखेगा, और Perplexity, ChatGPT, Gemini, Claude, तथा Bing/Copilot जैसे प्लेटफ़ॉर्म-विशिष्ट ट्रैफ़िक को अलग करेगा।
सीमाएँ
यह क्रॉल-आधारित स्नैपशॉट है, स्थायी अंतिम सत्य नहीं। वेबसाइटें किसी भी समय llms.txt फ़ाइलें जोड़, हटा या बदल सकती हैं। कुछ डोमेन स्वचालित अनुरोधों को ब्लॉक कर सकते हैं या भूगोल, TLS कॉन्फ़िगरेशन, रीडायरेक्ट लॉजिक, यूज़र एजेंट, या बॉट-शमन के आधार पर अलग व्यवहार कर सकते हैं। अध्ययन ने केवल रूट-स्तरीय फ़ाइलों का परीक्षण किया और सबडोमेन या गैर-मानक पथों की खोज नहीं की।
गुणवत्ता स्कोर और आर्केटाइप शोध उपकरण हैं, आधिकारिक अनुपालन लेबल नहीं। विषय विश्लेषण कीवर्ड-आधारित है और इसे दिशात्मक समझा जाना चाहिए। अध्ययन यह सिद्ध नहीं करता कि कोई विशिष्ट AI प्लेटफ़ॉर्म वर्तमान में उत्पादन में llms.txt को पढ़ता, मानता या उपयोग करता है।
इस संस्करण में समीक्षा किए गए बाहरी ट्रैफ़िक साक्ष्य की भी सीमाएँ हैं। Search Engine Land का विश्लेषण रैंडमाइज़्ड प्रयोग की तुलना में सावधानी-सूचक बहु-साइट अवलोकन के रूप में अधिक मज़बूत है। Alimbekov का परिणाम एक पारदर्शी साइट-स्तरीय केस स्टडी के रूप में उपयोगी है, लेकिन उसमें नियंत्रण समूह नहीं है और उसमें वह अवधि शामिल है जब कुल रेफ़रल ट्रैफ़िक काफ़ी बढ़ा। ये संदर्भ बहस को ढाँचा देने में मदद करते हैं, लेकिन इस क्रॉल को कारणात्मक ट्रैफ़िक अध्ययन नहीं बना देते।
फ़ाइलें और पुनरुत्पादन क्षमता
| फ़ाइल | उद्देश्य |
|---|---|
crawl_llms_txt.py | /llms.txt और /llms-full.txt के लिए क्रॉलर। |
analyze_llms_txt.py | मुख्य अपनाने विश्लेषण और चार्ट निर्माण। |
deep_analyze_llms_txt.py | रैंक डेसाइल, TLD, विषय संकेत, गुणवत्ता स्कोर, आर्केटाइप और दोहरी-फ़ाइल व्यवहार के लिए द्वितीयक विश्लेषण। |
deep_dive_early_quality.py | शुरुआती अपनाने वालों का वर्गीकरण और कार्यान्वयन-गुणवत्ता पर गहरा विश्लेषण। |
data/llms_probe_results_top_10000.csv | मुख्य क्रॉल परिणाम डेटासेट। |
data/deep_analysis_top_10000.json | द्वितीयक विश्लेषण सारांश। |
data/deep_early_quality_analysis.json | शुरुआती अपनाने वाली श्रेणियाँ, गुणवत्ता समूह तुलना, आर्केटाइप विवरण और केस स्टडीज़। |
स्रोत
- The /llms.txt file, Jeremy Howard, 2024.
- HTTP Archive Web Almanac 2024 Methodology.
- Cloudflare Radar: Expanded AI insights.
- Cloudflare Radar AI Insights.
- Consent in Crisis: The Rapid Decline of the AI Data Commons, Data Provenance Initiative.
- Tranco: A Research-Oriented Top Sites Ranking Hardened Against Manipulation.
- Does llms.txt matter?, Search Engine Land, जनवरी 2026.
- The State of llms.txt Adoption, Rankability, जून 2025.
- How LLMS.txt Increased AI Chat Traffic by 23%, Renat Alimbekov.
पद्धति-सुधार, डेटासेट समस्याएँ, और आगे के विश्लेषण support@thunderbit.com पर स्वागत हैं। यह रिपोर्ट Thunderbit की किसी भी व्यावसायिक स्थिति से स्वतंत्र रूप से प्रकाशित की गई है। इस रिपोर्ट का डेटा स्वयं में पर्याप्त है। — The Thunderbit research team, मई 2026.
वेब डेटा स्क्रैप और विश्लेषण करने के लिए Thunderbit आज़माएँ Get Started Free


