Studie založená na crawlování zkoumá, jak vysoce navštěvované weby publikují strojově čitelné pokyny pro velké jazykové modely, jak vypadají rané implementace a proč měření adopce vyžaduje víc než jen počítání odpovědí HTTP 200.
- Dataset:
data/llms_probe_results_top_10000.csv - Stažený seznam Tranco: 6. května 2026
- Rozsah:
/llms.txta/llms-full.txtna úrovni kořene webu
Klíčové metriky

- 5,86 %: Platná adopce
llms.txtnapříč Tranco Top 10 000, tedy 586 domén. - 1,03 %: Platná adopce
llms-full.txt, tedy 103 domén. Každý platný full-file adopter měl zároveň i platný indexový soubor. - 63,51 %: Podíl odpovědí HTTP 200 pro
/llms.txt, které neprošly validací. - 2,74×: Přibližné nadhodnocení, pokud by se adopce měřila jen podle surových odpovědí HTTP 200.
Shrnutí pro vedení
llms.txt je pořád raný webový standard, ale už zdaleka není jen okrajový experiment. V crawl studii 10 000 domén z Tranco ze dne 6. května 2026 bylo nalezeno 586 platných souborů llms.txt, což odpovídá míře adopce 5,86 %. Doprovodný soubor llms-full.txt byl mnohem méně častý: platný full file mělo jen 103 domén, tedy 1,03 %.
Nejdůležitější metodologický závěr je, že status kódy jsou pro měření adopce dost špatný proxy ukazatel. Crawler zaznamenal 1 606 odpovědí HTTP 200 pro /llms.txt, ale jen 586 z nich prošlo validací. Zbývajících 1 020 tvořily hlavně přesměrování mimo cíl, obecné HTML stránky, prázdná těla nebo jiné neplatné odpovědi. Naivní crawler, který by každou odpověď 200 počítal jako adopci, by platnou adopci nadhodnotil zhruba 2,74×.
Mezi platnými adoptery je kvalita implementace vyšší, než by naznačoval čistě placeholderový příběh. Medián platného souboru měl asi 7,1 KB, 61,77 % platných souborů bylo větších než 5 KB, 70,82 % obsahovalo šest a více sekcí Markdownu a 77,47 % obsahovalo 11 a více odkazů v Markdownu. Mezi rané adoptery patří Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog a Cloudinary.
llms.txtje nejlepší chápat jako vysvětlující a navigační signál pro systémy AI, ne jako náhradu zarobots.txt. Hodnotu nemá jen samotná existence souboru, ale to, jestli pomáhá strojům najít autoritativní, stručné a aktuální informace.
Kontext: Web přidává signály pro AI
Weby už dlouho používají robots.txt k vyjádření preferencí pro crawlery, sitemap.xml ke zlepšení objevování URL a strukturovaná data, aby vyhledávačům a platformám usnadnily interpretaci stránek. Generativní AI přináší jiný problém. Obsah může sloužit pro trénování, retrieval, shrnování, agentní procházení, pomoc s kódem, zákaznickou podporu i generování odpovědí. To vytváří dvě současné potřeby: vydavatelé chtějí větší kontrolu nad automatizovaným použitím, ale zároveň chtějí, aby AI systémy při interakci s webem našly správné kanonické informace.
Původní návrh llms.txt, představený Jeremym Howardem v roce 2024, popisuje soubor jako Markdown dokument umístěný do kořene webu, který má poskytovat informace přátelské pro LLM při inferenci. Návrh tvrdí, že HTML stránky často obsahují navigaci, reklamu, skripty a další šum, který modelům ztěžuje zpracování. Stručný Markdown soubor může modely nasměrovat na nejdůležitější stránky, dokumentaci, API, příklady, zásady a produktové informace.
Širší kontext poskytuje externí výzkum webu. Data Provenance Initiative „Consent in Crisis“ popisuje rychlý nárůst omezení souvisejících s AI v robots.txt a podmínkách služby a tvrdí, že stávající mechanismy souhlasu na webu nebyly navrženy pro rozsáhlé znovupoužití dat AI. Cloudflare Radar AI Insights navíc zviditelnil vzorce AI crawlerů a robots.txt na úrovni Top 10 000 domén. V tomto prostředí stojí llms.txt na konstruktivní straně AI signálů: neříká „sem nelez“, ale „jestli chcete tomuto webu porozumět, začněte tady“.
Externí důkazy a debata o adopci
Veřejná debata kolem llms.txt se dělí mezi dvě tvrzení. Optimistický pohled říká, že soubor dává AI systémům čistší a efektivnější cestu k autoritativnímu obsahu. Skeptický pohled tvrdí, že žádný velký poskytovatel LLM se veřejně nezavázal používat ho jako signál pro řazení, crawling nebo citace, takže vydavatelé by od samotného souboru neměli čekat růst návštěvnosti. Tři externí zdroje, které byly pro tuto aktualizaci zkoumány, podporují nuance: llms.txt je užitečná infrastruktura, ale důkazy o přímém dopadu na návštěvnost jsou zatím omezené a závislé na kontextu.
Externí benchmarky adopce se rychle mění
Tracker adopce od Rankability uváděl k 22. červnu 2025 míru adopce 0,3 % napříč top 1 000 weby, tedy 3 z 1 000. Popisuje měsíční automatizované skenování domain.com/llms.txt s validací, která vylučuje přesměrování a HTML odpovědi. Tato metodika je směrově podobná konzervativnímu validačnímu přístupu v této studii.
Rozdíl ve výsledcích je velký: tato studie našla 75 platných souborů llms.txt v Tranco Top 1 000 k 6. květnu 2026, tedy 7,50 %. Tato dvě čísla by neměla být chápána jako přísná časová řada, protože se mohou lišit zdroj žebříčku, detaily implementace, validační logika i čas crawlů. Přesto kontrast naznačuje, že adopce se mezi polovinou roku 2025 a květnem 2026 výrazně změnila, zejména mezi weby zaměřenými na vývojáře, SaaS, cloud, bezpečnost a dokumentaci.
| Zdroj | Snímek | Vzorek | Uvedená platná adopce | Interpretace |
|---|---|---|---|---|
| Rankability | 22. června 2025 | Top 1 000 webů | 0,3 % | Raný veřejný benchmark ukazující minimální adopci v polovině roku 2025. |
| Tato studie | 6. května 2026 | Tranco Top 1 000 | 7,50 % | Pozdější crawl ukazující viditelnou adopci mezi vysoce navštěvovanými weby. |
| Tato studie | 6. května 2026 | Tranco Top 10 000 | 5,86 % | Širší vzorek ukazující, že adopce je měřitelná, ale zatím ne mainstreamová. |
Experimenty s návštěvností zůstávají smíšené
Search Engine Land zveřejnil v lednu 2026 analýzu 10 webů, která sledovala stránky 90 dní před a 90 dní po implementaci. Článek uváděl, že dva weby zaznamenaly nárůst AI návštěvnosti o 12,5 % a 25 %, osm neukázalo měřitelné zlepšení a jeden klesl o 19,7 %. Hlavní interpretací byla opatrnost v kauzalitě: u dvou zdánlivých úspěchů se zároveň spouštěly nové šablony, předělávaly resource centra, přidávaly tabulky pro snadné extrahování, získávalo mediální pokrytí, opravovaly technické problémy nebo publikoval nový FAQ obsah. V tomto rámci llms.txt dokumentoval silnější obsahovou a technickou práci; sám o sobě zřejmě růst nezpůsobil.
Osobní blogový experiment Renata Alimbekova dospěl k pozitivnějšímu závěru na základě menšího pozorování na úrovni webu. Porovnával dvě čtyřměsíční období v Yandex.Metrice po přidání llms.txt i llms-full.txt. Referral session z LLM vzrostly ze 75 na 92, tedy o 23 %, zatímco počet uživatelů stoupl z 51 na 64. Session z Perplexity vzrostly z 29 na 55, zatímco session z ChatGPT klesly ze 31 na 26. Stejný příspěvek zároveň uvádí, že celková referral návštěvnost rostla rychleji, ze 160 na 290 session, takže podíl LLM session klesl z 47 % na 32 %.
| Typ důkazu | Pozorovaný výsledek | Hlavní výhrada | Jak to ovlivňuje tuto zprávu |
|---|---|---|---|
| 10webová před/po studie v Search Engine Land | Dva weby rostly, osm bez měřitelné změny, jeden klesl. | U pozitivních případů probíhaly současně obsahové, PR i technické změny. | Podporuje pohled na llms.txt jako infrastrukturu, ne jako samostatnou růstovou páku. |
| Před/po pozorování na osobním blogu Alimbekova | LLM referral session vzrostly o 23 % v období po nasazení. | Bez kontrolní skupiny; celková referral návštěvnost vzrostla o 81 % a podíl LLM klesl. | Naznačuje možný přínos pro technické blogy, zejména přes Perplexity, ale kauzalita není oddělena. |
| Tato crawl studie adopce | 586 platných souborů a mnoho strukturovaných implementací. | Měří přítomnost a strukturu, ne dopad na návštěvnost. | Ukazuje adopci a vyspělost implementace, nikoli ROI samotné. |
Co debata objasňuje
Externí důkazy zpřesňují interpretaci tohoto datasetu. Dobře strukturovaný soubor llms.txt může snížit tření při strojovém zpracování, zejména u vývojářské dokumentace, API referencí a znalostních bází. Ale nejsilnější případy návštěvnosti stále zřejmě závisí na obsahu, který je užitečný, snadno extrahovatelný, autoritativní a dohledatelný i mimo samotný soubor. Praktická otázka tedy není „záleží na llms.txt?“, ale zda je součástí širšího systému obsahu čitelného pro AI.
Aktualizovaná interpretace:
llms.txtby měl být nasazen jako nízkonákladová infrastruktura pro AI signály. Neměl by být prezentován jako náhrada lepší dokumentace, strukturovaného obsahu, technické přístupnosti, citací, odkazů nebo brandové autority.
Vyzkoušejte Thunderbit pro AI web scraping
Metodika
Tato studie použila jako vzorek domény z Tranco Top 10 000. Tranco je výzkumně orientované pořadí top webů navržené tak, aby bylo stabilnější a odolnější proti manipulaci než mnoho tradičních žebříčků. Zdrojový soubor Tranco byl stažen 6. května 2026, přičemž zdrojový údaj Last-Modified měl čas 5. května 2026 v 22:17:59 GMT.
Crawler testoval pro každou doménu dvě cesty na úrovni kořene:
https://example.com/llms.txt, s HTTP fallbackem, kde bylo potřeba.https://example.com/llms-full.txt, s HTTP fallbackem, kde bylo potřeba.
U každého probe crawler zaznamenal status kód, finální URL, způsob načtení, velikost odpovědi v bajtech, content type, chybovou hlášku, dobu odezvy a výsledek validace. Úspěšná těla odpovědí byla uložena do raw_llms_txt/ pro kontrolu a sekundární analýzu.
Pravidla validace
Odpověď byla započítána jako platný soubor jen tehdy, když vrátila úspěšné tělo a nevypadala jako obecný webový fallback. Finální cesta URL musela zůstat /llms.txt nebo /llms-full.txt. Prázdná těla byla zamítnuta. Zjevné HTML dokumenty a aplikační shell byly zamítnuty. Content type byl brán jako podpůrný důkaz, nikoli jako jediné pravidlo, protože malé množství platných textově podobných souborů bylo servírováno s neobvyklými content typy.
Podoba adopce
Crawl našel 586 platných souborů llms.txt v Tranco Top 10 000. To odpovídá míře platné adopce 5,86 %. Menší doprovodný soubor llms-full.txt byl přítomen a platný na 103 doménách, tedy na 1,03 % vzorku.
| Metrika | Počet | Podíl z Top 10 000 |
|---|---|---|
| Procrawlované domény | 10 000 | 100,00 % |
| Platné soubory llms.txt | 586 | 5,86 % |
| Platné soubory llms-full.txt | 103 | 1,03 % |
| HTTP 200 odpovědi pro /llms.txt | 1 606 | 16,06 % |
| HTTP 200 odpovědi zamítnuté jako neplatné | 1 020 | 10,20 % |
Adopce není jen o největších webech
Adopce byla vyšší v Top 1 000 než v celém Top 10 000, ale nebyla omezená jen na úplně největší weby. Míra adopce v Top 1 000 byla 7,50 %. Poslední bucket po 1 000 doménách, tedy pozice 9 001–10 000, klesl na 3,80 %. Střed žebříčku zůstával aktivní: buckety 2 001–3 000, 3 001–4 000, 5 001–6 000 a 6 001–7 000 se všechny pohybovaly kolem 6 %.

Raní adopteři
Nejvýše umístěným platným adopterem byla Cloudflare na 4. místě v Tranco. Mezi další vysoko umístěné adoptery patřily Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink a OneSignal.
Tito adopteři nejsou náhodní. Mívají rozsáhlou dokumentaci, produktové řady, které vyžadují vysvětlení, API nebo vývojářské ekosystémy, podpůrný obsah, cenové stránky, materiály k bezpečnosti a ochraně soukromí a dostatek brandové autority, aby jim záleželo na tom, jak jejich weby interpretují systémy AI.
| Pořadí | Doména | Velikost souboru | Pozorovaný vzorec |
|---|---|---|---|
| 4 | cloudflare.com | 4 225 B | Stručný index produktů, vývojářů, firmy a cen. |
| 26 | azure.com | 47 037 B | Vývojářské nástroje, AI, výpočetní výkon, úložiště, bezpečnost, monitoring a volitelné zdroje. |
| 28 | github.com | 27 108 B | Programový přístup, Copilot, MCP, REST API, Actions, repozitáře a odkazy na CLI. |
| 248 | stripe.com | 64 229 B | Platby, Connect, Checkout, Billing, Tax, Atlas, Radar a vývojářská dokumentace. |
| 265 | salesforce.com | 1,02 MB | Obrovský katalog produktů a odkazů na Agentforce bez nadpisů sekcí Markdownu. |
Kategorie adopterů v Top 1 000
Tato studie klasifikovala 75 platných adopterů v Tranco Top 1 000 podle kontextu domény, prvních nadpisů, surové struktury souboru a klíčových slov v obsahu. Největší skupinou byly marketing, média a adtech s 22,67 %. Cloudové, vývojářské a infrastrukturní weby tvořily 20,00 %. SaaS, produktivita a customer operations weby tvořily 17,33 %. Bezpečnostní, identitní a privacy weby tvořily 12,00 %.

| Kategorie | Domény | Podíl z adopterů Top 1 000 | Medián kvality | Medián odkazů |
|---|---|---|---|---|
| Marketing, média a adtech | 17 | 22,67 % | 94 | 25 |
| Cloud, dev & infrastruktura | 15 | 20,00 % | 94 | 62 |
| SaaS, produktivita a customer ops | 13 | 17,33 % | 94 | 46 |
| Bezpečnost, identita a soukromí | 9 | 12,00 % | 98 | 78 |
| CMS, hosting a webová prezentace | 7 | 9,33 % | 100 | 24 |
Vzorce TLD
Domény nejvyšší úrovně nejsou průmyslové štítky, ale jsou užitečnými směrovými signály. Mezi TLD s alespoň 50 doménami ve vzorku měla nejvyšší platnou adopci .io s 14,44 %. Následovalo .com s 8,19 %. Nižší adopce u .gov, .edu a .net naznačuje, že raná adopční základna je spíše komerční a technická než institucionální.
Kvalita implementace
Platná adopce neznamená jednotnou kvalitu implementace. Některé soubory jsou stručné a dobře členěné indexy. Některé jsou spíš napsané jako souvislý text. Některé jsou syrové katalogy odkazů. Některé jsou téměř prázdné placeholdery. Některé jsou mnohamegabajtové datové výpisy, které mohou být úplné, ale drahé na stažení a zpracování.
Mezi platnými soubory llms.txt bylo 362 větších než 5 KB, tedy 61,77 % platných adopterů. Medián velikosti souboru byl asi 7,1 KB. Velikost P90 byla 156 KB, P95 byla 356 KB, P99 byla 2,54 MB a největší pozorovaný soubor měl 7,97 MB.
Běžné obsahové signály
Párový keyword scan platných souborů ukázal, že mnoho webů nepublikuje jen prohlášení, ale směruje modely k materiálům, které jsou provozně užitečné. Výrazy support nebo help se objevily v 70,31 % platných souborů. Blog, guide nebo tutorial v 67,92 %. Security, privacy, compliance nebo terms v 61,43 %. Pricing ve 53,92 %, documentation ve 52,22 %, API výrazy ve 33,96 % a changelog nebo release signály v 27,30 %.
Hodnocení kvality a archetypy
Aby se přešlo od přítomnosti k vyspělosti, tato studie vytvořila lehký implementační skóre model. Skóre bere v úvahu typ obsahu, velikost souboru, strukturu Markdownu, počet odkazů, pokrytí témat a varovné signály, jako jsou chybějící nadpisy, žádné Markdown odkazy, neobvyklé content typy, maličké soubory, velmi velké soubory a chování typu link dump. Není to formální standard. Je to výzkumný model hodnocení pro porovnání pozorovaných implementací.
Podle tohoto modelu bylo 416 platných souborů klasifikováno jako silné strukturované indexy, 107 jako použitelné indexy, 24 jako tenké nebo nepravidelné a 39 jako symbolické nebo s nízkou užitnou hodnotou. Samostatná analýza archetypů našla 296 strukturovaných indexů, 113 souborů s členěným textem, 63 katalogů odkazů, 52 tenkých indexů, 50 symbolických nebo placeholder souborů a 12 obrovských obsahových výpisů.

| Archetyp | Domény | Podíl platných souborů | Medián skóre | Medián velikosti souboru | Medián odkazů |
|---|---|---|---|---|---|
| Strukturovaný index | 296 | 50,51 % | 98 | 11 241 B | 61,5 |
| Členěný text | 113 | 19,28 % | 78 | 4 718 B | 0 |
| Katalog odkazů | 63 | 10,75 % | 86 | 4 160 B | 23 |
| Tenký index | 52 | 8,87 % | 66 | 2 814 B | 0 |
| Symbolický nebo placeholder | 50 | 8,53 % | 27 | 15 B | 0 |
| Obrovský datový výpis | 12 | 2,05 % | 74 | 2,84 MB | 7 259,5 |
Největší adopteři mají hustší implementace

75 platných adopterů v Tranco Top 1 000 mělo medián kvality 96, medián velikosti souboru 9 068 bajtů, medián počtu Markdown odkazů 52 a medián počtu sekcí 11. 511 adopterů s pořadím 1 001–10 000 mělo nižší mediány: skóre 90, velikost souboru 6 506 bajtů, 23 Markdown odkazů a 9 sekcí. Adopteři z Top 1 000 byli také častěji strukturované indexy: 69,33 % oproti 47,75 % v pozdější kohortě.
Problém falešně pozitivních výsledků

Největší riziko měření představují falešně pozitivní výsledky. Z 1 606 domén, které vrátily HTTP 200 pro /llms.txt, 1 020 neprošlo validací. Nejběžnějším důvodem neplatnosti bylo přesměrování mimo cíl, v 618 případech. Dalších 367 odpovědí byly obecné HTML dokumenty. Dvacet devět vrátilo prázdné tělo a šest bylo jiných nebo neklasifikovaných neplatných odpovědí.
To je důležité, protože mnoho velkých webů směruje neznámé cesty na přihlašovací stránky, homepage, aplikační shelly, regionální stránky, consent plochy nebo marketingové fallbacky. Tyto odpovědi mohou pro crawler založený na status kódu vypadat zdravě, ale neobsahují žádný platný signál llms.txt.
llms-full.txt: vzácnější a nerovnoměrnější
Doprovodný soubor llms-full.txt byl mnohem méně častý než llms.txt. Crawl našel 103 platných full souborů, což odpovídá 17,58 % platných adopterů llms.txt a 1,03 % celého vzorku Top 10 000.
Implementace full file byla nerovnoměrná. Mezi 103 adoptery s oběma soubory mělo 57 soubor llms-full.txt větší než indexový soubor, ale 46 buď mělo full file ne větší než index, nebo mělo full file menší než 100 bajtů. Medián poměru velikosti full vůči indexu byl 1,43, ale extrémní případy byly mnohem vyšší. Full soubor Supabase byl zhruba 7 139× větší než jeho indexový soubor. Made-in-China.com mělo full file o velikosti 89,89 MB.
| Doména | llms.txt | llms-full.txt | Poměr |
|---|---|---|---|
| made-in-china.com | 4,49 MB | 89,89 MB | 20,0× |
| sendbird.com | 281,86 KB | 11,99 MB | 42,5× |
| taboola.com | 286,78 KB | 11,73 MB | 40,9× |
| supabase.co | 1,26 KB | 8,98 MB | 7 139,3× |
| neon.tech | 27,44 KB | 5,01 MB | 182,7× |
Doporučení: publikujte
llms-full.txtjen tehdy, když web už má stabilní dokumentační pipeline, disciplínu verzování a jasný důvod vystavit velké množství obsahu v jednom strojově čitelném souboru.
llms.txt, robots.txt a sitemap.xml
llms.txt by neměl být chápán jako nové robots.txt. Oba jsou strojově čitelné soubory v kořeni webu, ale komunikují různé věci. robots.txt je signál preferencí crawlerů a řízení přístupu. sitemap.xml je signál pro objevování URL. llms.txt je vysvětlující a navigační signál.
| Signál | Hlavní role | Typický čtenář | Interpretace v této studii |
|---|---|---|---|
robots.txt | Vyjádřit preference crawlerů a omezení na úrovni cest. | Vyhledávací crawlery, AI crawlery, archivační crawlery, generické boty. | Signál správy a přístupu. |
sitemap.xml | Vyjmenovat objevitelné URL pro indexační systémy. | Vyhledávače a indexační pipeline. | Signál objevování. |
llms.txt | Poskytnout stručný kontext webu, důležité odkazy, dokumentaci, API, příklady a odkazy na zásady. | LLM aplikace, AI agenti, vývojářské nástroje, retrieval systémy. | Signál vysvětlení a navigace. |
Doporučení
Pro weby, které o llms.txt uvažují, naznačují nejsilnější implementace v tomto datasetu i externí důkazy o návštěvnosti pragmatický vzorec:
- Publikujte
/llms.txtv kořeni a ponechte jej přístupný bez přihlášení, bez nutnosti spouštět JavaScript, bez consent bariér a bez přesměrování mimo cestu. - Pokud je to možné, servírujte jej jako
text/plainnebotext/markdown. - Začněte krátkým popisem webu a poté odkazy seskupte podle produktu, dokumentace, API, cen, changelogu, příkladů, podpory, zásad a firemních zdrojů.
- Upřednostňujte kanonické odkazy před vyčerpávajícími seznamy URL.
- Vyhněte se prázdným symbolickým souborům; v nejlepším případě představují slabý signál.
- Vyhněte se obrovským nesourodým výpisům, pokud pro ně neexistuje silný případ strojové spotřeby a spolehlivá generovací pipeline.
- Po publikaci ověřte finální URL, tělo odpovědi, content type, strukturu Markdownu, počet odkazů a velikost souboru.
Týmy by také měly nastavovat očekávání opatrně. Dostupné veřejné experimenty neprokazují, že llms.txt samostatně zvyšuje AI referral návštěvnost. Pokud chce tým testovat obchodní dopad, měl by sledovat současně LLM referral, citované stránky, bot requests, čerstvost indexu a změny obsahu. Užitečný experiment by porovnával párované skupiny stránek, pokud možno udržoval aktualizace obsahu konstantní a oddělil platformně specifickou návštěvnost jako Perplexity, ChatGPT, Gemini, Claude a Bing/Copilot.
Omezení
Jde o snapshot založený na crawlování, ne o trvalou skutečnost. Weby mohou soubory llms.txt kdykoli přidat, odebrat nebo změnit. Některé domény mohou blokovat automatizované požadavky nebo se chovat jinak podle geografie, TLS konfigurace, logiky přesměrování, user agenta nebo ochrany proti botům. Studie testovala pouze soubory v kořeni webu a nevyhledávala subdomény ani nestandardní cesty.
Skóre kvality a archetypy jsou výzkumné nástroje, ne oficiální compliance štítky. Analýza témat je založená na klíčových slovech a měla by být čtena jako orientační. Studie neprokazuje, že některá konkrétní AI platforma v současnosti čte, respektuje nebo používá llms.txt v produkci.
Externí důkazy o návštěvnosti, které byly v této verzi zkoumány, mají také omezení. Analýza Search Engine Land je silnější jako opatrné vícesite pozorování než jako randomizovaný experiment. Výsledek Alimbekova je užitečný jako transparentní případová studie na úrovni webu, ale postrádá kontrolní skupinu a zahrnuje období, kdy celková referral návštěvnost výrazně rostla. Tyto reference pomáhají rámovat debatu, ale nepřeměňují tento crawl na kauzální studii návštěvnosti.
Soubory a reprodukovatelnost
| Soubor | Účel |
|---|---|
crawl_llms_txt.py | Crawler pro /llms.txt a /llms-full.txt. |
analyze_llms_txt.py | Hlavní analýza adopce a generování grafů. |
deep_analyze_llms_txt.py | Sekundární analýza pro decily pořadí, TLD, obsahové signály, skóre kvality, archetypy a chování dvojice souborů. |
deep_dive_early_quality.py | Klasifikace raných adopterů a detailní rozbor kvality implementace. |
data/llms_probe_results_top_10000.csv | Hlavní dataset výsledků crawlů. |
data/deep_analysis_top_10000.json | Souhrn sekundární analýzy. |
data/deep_early_quality_analysis.json | Kategorie raných adopterů, srovnání kvalitativních kohort, detaily archetypů a případové studie. |
Zdroje
- Soubor /llms.txt, Jeremy Howard, 2024.
- HTTP Archive Web Almanac 2024 Methodology.
- Cloudflare Radar: Expanded AI insights.
- Cloudflare Radar AI Insights.
- Consent in Crisis: The Rapid Decline of the AI Data Commons, Data Provenance Initiative.
- Tranco: A Research-Oriented Top Sites Ranking Hardened Against Manipulation.
- Does llms.txt matter?, Search Engine Land, leden 2026.
- The State of llms.txt Adoption, Rankability, červen 2025.
- How LLMS.txt Increased AI Chat Traffic by 23%, Renat Alimbekov.
Opravy metodiky, problémy s datasetem a navazující analýzy jsou vítány na adrese support@thunderbit.com. Tato zpráva je publikována nezávisle na jakékoli komerční pozici, kterou Thunderbit zastává. Data v této zprávě stojí sama o sobě. — Výzkumný tým Thunderbit, květen 2026.
Vyzkoušejte Thunderbit pro scraping a analýzu webových dat Get Started Free


