Un studiu bazat pe crawl despre felul în care site-urile cu trafic mare publică îndrumări care pot fi citite de mașini pentru modelele lingvistice mari, cum arată primele implementări și de ce măsurarea adoptării cere mai mult decât numărarea răspunsurilor HTTP 200.
- Set de date:
data/llms_probe_results_top_10000.csv - Lista Tranco descărcată: 6 mai 2026
- Domeniu analizat:
/llms.txtși/llms-full.txtla nivelul rădăcinii
Metrici cheie

- 5,86%: Adoptare validă a
llms.txtîn Top 10.000 Tranco, echivalentul a 586 de domenii. - 1,03%: Adoptare validă a
llms-full.txt, echivalentul a 103 domenii. Fiecare domeniu care a avut un fișier complet valid a avut și un fișier index valid. - 63,51%: Ponderea răspunsurilor HTTP 200 pentru
/llms.txtcare au eșuat la validare. - 2,74x: Supraestimarea aproximativă dacă adoptarea ar fi măsurată doar după răspunsurile brute HTTP 200.
Rezumat executiv
llms.txt este încă o convenție web timpurie, dar nu mai e doar un experiment de nișă. Într-un crawl din 6 mai 2026 asupra celor mai bune 10.000 de domenii din Tranco, studiul a identificat 586 de fișiere llms.txt valide, ceea ce înseamnă o rată de adoptare observată de 5,86%. Fișierul complementar llms-full.txt a fost mult mai rar: 103 domenii aveau un fișier complet valid, adică o rată de adoptare de 1,03%.
Cea mai importantă concluzie metodologică este că status code-urile sunt un indicator slab al adoptării. Crawlerul a observat 1.606 răspunsuri HTTP 200 pentru /llms.txt, dar doar 586 au trecut validarea. Restul de 1.020 au fost, în mare parte, redirecționări către altă destinație, pagini HTML generice, corpuri goale sau alte răspunsuri invalide. Un crawler naiv care ar număra fiecare răspuns 200 ca adoptare ar supraestima adoptarea validă de aproximativ 2,74 ori.
În rândul celor care au adoptat valid, calitatea implementării este mai bună decât ar sugera o simplă poveste despre „placeholder”-uri. Fișierul valid median avea aproximativ 7,1 KB, 61,77% dintre fișierele valide depășeau 5 KB, 70,82% conțineau șase sau mai multe secțiuni Markdown, iar 77,47% conțineau 11 sau mai multe linkuri Markdown. Printre primii adoptatori se numără Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog și Cloudinary.
llms.txteste cel mai bine înțeles ca un semnal explicativ și de navigare pentru sistemele AI, nu ca un înlocuitor pentrurobots.txt. Valoarea lui nu stă doar în faptul că există un fișier, ci în faptul că acel fișier ajută mașinile să găsească informații authoritative, compacte și actuale.
Context: webul adaugă semnale pentru AI
De mult timp, site-urile folosesc robots.txt pentru a-și exprima preferințele față de crawlere, sitemap.xml pentru a îmbunătăți descoperirea URL-urilor și date structurate pentru a ajuta motoarele de căutare și platformele să interpreteze paginile. AI-ul generativ aduce o problemă diferită. Conținutul poate fi folosit pentru antrenare, regăsire, sumarizare, navigare agentică, asistență la cod, suport pentru clienți și generare de răspunsuri. Asta creează două nevoi simultane: editorii vor mai mult control asupra utilizării automate, dar vor și ca sistemele AI să găsească informațiile canonice corecte atunci când interacționează cu site-urile lor.
Propunerea originală llms.txt, introdusă de Jeremy Howard în 2024, prezintă fișierul ca pe un document Markdown plasat la rădăcina site-ului pentru a oferi informații prietenoase pentru LLM la momentul inferenței. Propunerea susține că paginile HTML conțin adesea navigație, publicitate, scripturi și alte zgomote care îngreunează procesarea lor de către modelele lingvistice. Un fișier Markdown concis poate direcționa modelele către cele mai importante pagini, documentații, API-uri, exemple, politici și informații despre produs.
Cercetarea externă pe web oferă contextul mai larg. „Consent in Crisis” a Data Provenance Initiative descrie o creștere rapidă a restricțiilor legate de AI în robots.txt și în termenii de utilizare și susține că mecanismele existente de consimțământ pe web nu au fost concepute pentru reutilizarea datelor AI la scară mare. Cloudflare Radar AI Insights a făcut, de asemenea, vizibile modelele crawlerelor AI și ale robots.txt la nivelul Top 10.000 de domenii. În acest context, llms.txt se află pe partea constructivă a semnalizării către AI: nu „nu crawl-ui acest lucru”, ci „dacă trebuie să înțelegi acest site, începe de aici”.
Dovezi externe și dezbaterea despre adoptare
Dezbaterea publică despre llms.txt e împărțită între două afirmații. Varianta optimistă spune că fișierul le oferă sistemelor AI o cale mai curată și mai eficientă către conținut autoritativ. Varianta sceptică spune că niciun furnizor major de LLM nu s-a angajat public să-l folosească drept semnal de ranking, crawl sau citare, deci editorii nu ar trebui să se aștepte la câștiguri de trafic doar pentru că există fișierul. Cele trei referințe externe analizate pentru această actualizare susțin o concluzie mai nuanțată: llms.txt este infrastructură utilă, dar dovezile pentru un impact direct asupra traficului rămân limitate și dependente de context.
Reperele externe de adoptare se schimbă rapid
Trackerul de adoptare al Rankability a raportat o rată de adoptare de 0,3% în top 1.000 de site-uri la data de 22 iunie 2025, adică 3 din 1.000 de site-uri. Acesta descrie scanări automate lunare ale domain.com/llms.txt, cu validare care exclude redirecționările și răspunsurile HTML. Acea metodologie este, în mare, similară cu abordarea conservatoare de validare din acest studiu.
Diferența de rezultate este mare: acest studiu a găsit 75 de fișiere llms.txt valide în Top 1.000 Tranco la 6 mai 2026, adică 7,50%. Cele două numere nu trebuie tratate ca o serie temporală strictă, deoarece sursa clasamentului, detaliile de implementare, logica de validare și momentul crawl-ului pot diferi. Totuși, contrastul sugerează că adoptarea s-a schimbat semnificativ între mijlocul lui 2025 și mai 2026, mai ales în rândul site-urilor axate pe dezvoltatori, SaaS, cloud, securitate și documentație.
| Sursă | Momentul capturii | Eșantion | Adoptare validă raportată | Interpretare |
|---|---|---|---|---|
| Rankability | 22 iunie 2025 | Top 1.000 de site-uri | 0,3% | Referință publică timpurie care arată o adoptare minimă la mijlocul lui 2025. |
| Acest studiu | 6 mai 2026 | Top 1.000 Tranco | 7,50% | Crawl ulterior care arată o adoptare vizibilă în rândul site-urilor cu trafic mare. |
| Acest studiu | 6 mai 2026 | Top 10.000 Tranco | 5,86% | Eșantion mai amplu care arată că adoptarea poate fi măsurată, dar nu este încă mainstream. |
Experimentele de trafic rămân mixte
Search Engine Land a publicat în ianuarie 2026 o analiză pe 10 site-uri, urmărind site-urile timp de 90 de zile înainte și 90 de zile după implementare. Articolul a raportat că două site-uri au văzut creșteri ale traficului AI de 12,5% și 25%, opt nu au înregistrat nicio îmbunătățire măsurabilă, iar unul a scăzut cu 19,7%. Interpretarea principală a fost una de prudență cauzală: cele două povești de succes aparent au lansat și șabloane noi, au refăcut centrele de resurse, au adăugat tabele de comparație care pot fi extrase, au obținut acoperire media, au rezolvat probleme tehnice sau au publicat conținut nou în format FAQ. În logica asta, llms.txt a documentat un conținut și o muncă tehnică mai bune; nu pare să fi cauzat singur creșterea.
Experimentul de pe blogul personal al lui Renat Alimbekov a ajuns la o concluzie mai pozitivă dintr-o observație mai mică la nivel de site. Acesta a comparat două perioade de câte patru luni în Yandex.Metrica după adăugarea atât a llms.txt, cât și a llms-full.txt. Sesiunile de referință din LLM au crescut de la 75 la 92, o majorare de 23%, iar utilizatorii au crescut de la 51 la 64. Sesiunile din Perplexity au crescut de la 29 la 55, în timp ce sesiunile din ChatGPT au scăzut de la 31 la 26. Același articol notează și că traficul total de referință a crescut mai repede, de la 160 la 290 de sesiuni, astfel încât ponderea sesiunilor LLM a scăzut de la 47% la 32%.
| Tip de evidență | Rezultat observat | Principala rezervă | Cum influențează acest raport |
|---|---|---|---|
| Studiu Search Engine Land înainte/după, pe 10 site-uri | Două site-uri au crescut, opt nu au avut nicio schimbare măsurabilă, unul a scăzut. | Cazurile pozitive au avut simultan schimbări de conținut, PR și tehnice. | Susține tratarea lui llms.txt ca infrastructură, nu ca levier de creștere de sine stătător. |
| Observație înainte/după pe blogul personal al lui Alimbekov | Sesiunile de referință din LLM au crescut cu 23% în perioada de după. | Fără grup de control; traficul total de referință a crescut cu 81%, iar ponderea LLM a scăzut. | Sugerează un potențial avantaj pentru blogurile tehnice, mai ales prin Perplexity, dar cauzalitatea nu este izolată. |
| Acest studiu de crawl, bazat pe adoptare | 586 de fișiere valide și multe implementări structurate. | Măsoară prezența și structura, nu impactul ulterior asupra traficului. | Arată adoptarea și maturitatea implementării, dar nu și ROI-ul de una singură. |
Ce clarifică dezbaterea
Dovezile externe clarifică interpretarea acestui set de date. Un fișier llms.txt bine structurat poate reduce fricțiunea de parsare pentru mașini, mai ales pentru documentația de dezvoltatori, referințele API și conținutul de tip knowledge base. Dar cele mai puternice cazuri de trafic par să depindă în continuare de conținut util, ușor de extras, autoritativ și descoperibil și în afara fișierului. Din acest motiv, întrebarea practică nu este „contează llms.txt?” luat izolat. Întrebarea este dacă fișierul face parte dintr-un sistem mai amplu de conținut care poate fi citit de AI.
Interpretare actualizată:
llms.txtar trebui implementat ca infrastructură ieftină, orientată spre AI. Nu ar trebui poziționat ca înlocuitor pentru documentație mai bună, conținut structurat, accesibilitate tehnică, citări, linkuri sau autoritate de brand.
Încearcă Thunderbit pentru web scraping cu AI
Metodologie
Acest studiu a folosit ca eșantion Top 10.000 de domenii din Tranco. Tranco este un clasament al celor mai vizitate site-uri, orientat spre cercetare, conceput să fie mai stabil și mai rezistent la manipulare decât multe liste tradiționale. Fișierul sursă Tranco a fost descărcat la 6 mai 2026, cu un timestamp Last-Modified al sursei de 5 mai 2026, 22:17:59 GMT.
Crawlerul a verificat două căi de la nivelul rădăcinii pentru fiecare domeniu:
https://example.com/llms.txt, cu fallback HTTP atunci când era nevoie.https://example.com/llms-full.txt, cu fallback HTTP atunci când era nevoie.
Pentru fiecare verificare, crawlerul a înregistrat codul de stare, URL-ul final, metoda de fetch, numărul de bytes al răspunsului, tipul de conținut, mesajul de eroare, timpul scurs și rezultatul validării. Corpurile de răspuns reușite au fost salvate în raw_llms_txt/ pentru revizuire și analiză secundară.
Reguli de validare
Un răspuns a fost considerat fișier valid doar dacă a returnat un corp valid și nu părea o soluție generică de fallback a webului. Calea URL-ului final trebuia să rămână /llms.txt sau /llms-full.txt. Corpurile goale au fost respinse. Documentele HTML evidente și shell-urile de aplicație au fost respinse. Tipul de conținut a fost tratat ca dovadă de susținere, nu ca singură regulă, deoarece un număr mic de fișiere valide, de tip text, au fost livrate cu tipuri de conținut neobișnuite.
Peisajul adoptării
Crawl-ul a găsit 586 de fișiere llms.txt valide în Top 10.000 Tranco. Aceasta oferă o rată de adoptare validă de 5,86%. Fișierul complementar mai mic, llms-full.txt, a fost prezent și valid pe 103 domenii, adică 1,03% din eșantion.
| Metrică | Număr | Pondere din Top 10.000 |
|---|---|---|
| Domenii crawl-uite | 10.000 | 100,00% |
| Fișiere llms.txt valide | 586 | 5,86% |
| Fișiere llms-full.txt valide | 103 | 1,03% |
| Răspunsuri HTTP 200 pentru /llms.txt | 1.606 | 16,06% |
| Răspunsuri HTTP 200 respinse ca invalide | 1.020 | 10,20% |
Adoptarea nu este doar concentrată în partea de sus
Adoptarea a fost mai mare în Top 1.000 decât în întregul Top 10.000, dar nu s-a limitat la cele mai mari site-uri. Rata de adoptare în Top 1.000 a fost de 7,50%. Ultimul interval de 1.000 de domenii, pozițiile 9.001-10.000, a coborât la 3,80%. Mijlocul clasamentului a rămas activ: intervalele 2.001-3.000, 3.001-4.000, 5.001-6.000 și 6.001-7.000 s-au situat toate în jur de 6%.

Primii adoptatori
Cel mai bine clasat adoptator valid a fost Cloudflare, la poziția Tranco 4. Alți adoptatori bine clasați au inclus Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink și OneSignal.
Acești adoptatori nu sunt aleatori. Ei tind să aibă suprafețe mari de documentație, linii de produse care necesită explicații, API-uri sau ecosisteme pentru dezvoltatori, conținut de suport, pagini de prețuri, materiale despre securitate și confidențialitate și suficientă autoritate de brand încât să conteze modul în care sistemele AI le interpretează site-urile.
| Poziție | Domeniu | Mărimea fișierului | Model observat |
|---|---|---|---|
| 4 | cloudflare.com | 4.225 B | Index compact pentru produs, dezvoltatori, companie și prețuri. |
| 26 | azure.com | 47.037 B | Instrumente pentru dezvoltatori, AI, compute, storage, securitate, monitorizare și resurse opționale. |
| 28 | github.com | 27.108 B | Acces programatic, Copilot, MCP, REST API, Actions, repository-uri și linkuri CLI. |
| 248 | stripe.com | 64.229 B | Plăți, Connect, Checkout, Billing, Tax, Atlas, Radar și documentație pentru dezvoltatori. |
| 265 | salesforce.com | 1,02 MB | Catalog uriaș de produse și linkuri Agentforce, fără titluri de secțiuni Markdown. |
Categoriile adoptatorilor din Top 1.000
Acest studiu a clasificat cei 75 de adoptatori valizi din Top 1.000 Tranco folosind contextul domeniului, primele titluri, structura brută a fișierului și cuvintele-cheie din conținut. Cel mai mare grup a fost marketing, media și adtech, cu 22,67%. Site-urile din cloud, dezvoltare și infrastructură au reprezentat 20,00%. Site-urile SaaS, de productivitate și operațiuni pentru clienți au reprezentat 17,33%. Site-urile de securitate, identitate și confidențialitate au reprezentat 12,00%.

| Categorie | Domenii | Pondere din adoptatorii Top 1.000 | Scor median al calității | Linkuri mediane |
|---|---|---|---|---|
| Marketing, media & adtech | 17 | 22,67% | 94 | 25 |
| Cloud, dev & infrastructure | 15 | 20,00% | 94 | 62 |
| SaaS, productivity & customer ops | 13 | 17,33% | 94 | 46 |
| Security, identity & privacy | 9 | 12,00% | 98 | 78 |
| CMS, hosting & web presence | 7 | 9,33% | 100 | 24 |
Modele pentru TLD-uri
Domeniile de nivel superior nu sunt etichete de industrie, dar oferă semnale utile de orientare. Dintre TLD-urile cu cel puțin 50 de domenii în eșantion, .io a avut cea mai mare rată validă de adoptare, 14,44%. .com a urmat cu 8,19%. Adoptarea mai scăzută în rândul .gov, .edu și .net sugerează că baza primilor adoptatori este mai degrabă comercială și tehnică decât instituțională.
Calitatea implementării
Adoptarea validă nu înseamnă calitate uniformă a implementării. Unele fișiere sunt indexuri concise, bine împărțite pe secțiuni. Unele sunt în mare parte proză. Unele sunt cataloage brute de linkuri. Unele sunt placeholder-e aproape goale. Unele sunt dump-uri de conținut de ordinul megabytes, care pot fi complete, dar costisitoare de preluat și parsată.
Dintre fișierele llms.txt valide, 362 aveau peste 5 KB, adică 61,77% dintre adoptatorii valizi. Mărimea mediană a fișierului a fost de aproximativ 7,1 KB. P90 a fost 156 KB, P95 a fost 356 KB, P99 a fost 2,54 MB, iar cel mai mare fișier observat a fost de 7,97 MB.
Semnale de conținut comune
O scanare la nivel de cuvinte-cheie a fișierelor valide a arătat că multe site-uri nu publică doar o declarație, ci direcționează modelele către materiale utile din punct de vedere operațional. Termeni precum support sau help au apărut în 70,31% dintre fișierele valide. Termeni precum blog, guide sau tutorial au apărut în 67,92%. Termeni precum security, privacy, compliance sau terms au apărut în 61,43%. Pricing a apărut în 53,92%, documentation în 52,22%, termenii API în 33,96%, iar semnalele changelog sau release în 27,30%.
Scorarea calității și arhetipurile
Pentru a trece de la prezență la maturitate, acest studiu a creat un scor simplu pentru implementare. Scorul ia în calcul tipul de conținut, mărimea fișierului, structura Markdown, numărul de linkuri, acoperirea tematică și semnalele de avertizare precum lipsa titlurilor, absența linkurilor Markdown, tipuri de conținut neobișnuite, fișiere foarte mici, fișiere foarte mari și comportamentul de tip link-dump. Nu este un standard formal. Este un model de scorare pentru cercetare, menit să compare implementările observate.
Folosind acest model, 416 fișiere valide au fost clasificate drept indexuri structurate puternice, 107 drept indexuri utilizabile, 24 drept subțiri sau neregulate și 39 drept simbolice sau cu utilitate redusă. O analiză separată pe arhetipuri a găsit 296 de indexuri structurate, 113 fișiere text pe secțiuni, 63 de cataloage de linkuri, 52 de indexuri subțiri, 50 de fișiere simbolice sau placeholder și 12 dump-uri masive de conținut.

| Arhetip | Domenii | Pondere din fișierele valide | Scor median | Mărimea mediană a fișierului | Linkuri mediane |
|---|---|---|---|---|---|
| Index structurat | 296 | 50,51% | 98 | 11.241 B | 61,5 |
| Text pe secțiuni | 113 | 19,28% | 78 | 4.718 B | 0 |
| Catalog de linkuri | 63 | 10,75% | 86 | 4.160 B | 23 |
| Index subțire | 52 | 8,87% | 66 | 2.814 B | 0 |
| Simbolic sau placeholder | 50 | 8,53% | 27 | 15 B | 0 |
| Dump masiv de conținut | 12 | 2,05% | 74 | 2,84 MB | 7.259,5 |
Cei mai mari adoptatori au implementări mai dense

Cei 75 de adoptatori valizi din Top 1.000 Tranco au avut un scor median al calității de 96, o mărime mediană a fișierului de 9.068 de bytes, un număr median de 52 de linkuri Markdown și o mediană de 11 secțiuni. Cei 511 adoptatori aflați pe pozițiile 1.001-10.000 au avut mediane mai mici: scor 90, mărime a fișierului de 6.506 bytes, 23 de linkuri Markdown și 9 secțiuni. Adoptatorii din Top 1.000 au fost, de asemenea, mai predispuși să fie indexuri structurate: 69,33% față de 47,75% în cohorta ulterioară.
Problema falselor pozitive

Cel mai mare risc de măsurare îl reprezintă falsele pozitive. Dintre cele 1.606 domenii care au returnat HTTP 200 pentru /llms.txt, 1.020 au eșuat la validare. Cel mai frecvent motiv de invalidare a fost redirecționarea către o altă destinație, cu 618 cazuri. Alte 367 de răspunsuri au fost documente HTML generice. Douăzeci și nouă au returnat un corp gol, iar șase au fost alte răspunsuri invalide sau neclasificate.
Acest lucru contează fiindcă multe site-uri mari direcționează căile necunoscute către pagini de login, homepage-uri, shell-uri de aplicație, pagini regionale, suprafețe de consimțământ sau fallback-uri de marketing. Aceste răspunsuri pot părea sănătoase pentru un crawler bazat pe status code, dar nu conțin niciun semnal valid llms.txt.
llms-full.txt: mai rar și mai neuniform
Fișierul complementar llms-full.txt a fost mult mai puțin frecvent decât llms.txt. Crawl-ul a găsit 103 fișiere complete valide, echivalentul a 17,58% dintre adoptatorii valizi de llms.txt și a 1,03% din întregul eșantion Top 10.000.
Implementările de fișiere complete au fost neuniforme. Dintre cei 103 adoptatori cu două fișiere, 57 aveau un fișier llms-full.txt mai mare decât fișierul index, dar 46 fie aveau un fișier complet nu mai mare decât indexul, fie aveau un fișier complet sub 100 de bytes. Raportul median dintre dimensiunea fișierului complet și cea a indexului a fost de 1,43, însă cazurile extreme au fost mult mai mari. Fișierul complet al Supabase a fost de aproximativ 7.139 de ori mai mare decât fișierul index. Made-in-China.com a avut un fișier complet de 89,89 MB.
| Domeniu | llms.txt | llms-full.txt | Raport |
|---|---|---|---|
| made-in-china.com | 4,49 MB | 89,89 MB | 20,0x |
| sendbird.com | 281,86 KB | 11,99 MB | 42,5x |
| taboola.com | 286,78 KB | 11,73 MB | 40,9x |
| supabase.co | 1,26 KB | 8,98 MB | 7.139,3x |
| neon.tech | 27,44 KB | 5,01 MB | 182,7x |
Recomandare: publicați
llms-full.txtdoar atunci când site-ul are deja un flux stabil de documentație, disciplină de versionare și un motiv clar pentru a expune volume mari de conținut într-un singur fișier care poate fi citit de mașini.
llms.txt, robots.txt și sitemap.xml
llms.txt nu trebuie tratat ca un nou robots.txt. Ambele sunt fișiere citibile de mașini la nivelul rădăcinii, dar transmit lucruri diferite. robots.txt este un semnal de preferință și control al accesului pentru crawlere. sitemap.xml este un semnal de descoperire a URL-urilor. llms.txt este un semnal explicativ și de navigare.
| Semnal | Rol principal | Cititor tipic | Interpretare în acest studiu |
|---|---|---|---|
robots.txt | Declară preferințele pentru crawlere și restricțiile la nivel de cale. | Crawlere de căutare, crawlere AI, crawlere de arhivare, boți generici. | Semnal de guvernanță și acces. |
sitemap.xml | Listează URL-urile descoperibile pentru sistemele de indexare. | Motoare de căutare și fluxuri de indexare. | Semnal de descoperire. |
llms.txt | Oferă context compact despre site, linkuri importante, documentație, API-uri, exemple și referințe la politici. | Aplicații LLM, agenți AI, instrumente pentru dezvoltatori, sisteme de regăsire. | Semnal de explicație și navigare. |
Recomandări
Pentru site-urile care iau în considerare llms.txt, cele mai solide implementări din acest set de date și dovezile externe despre trafic sugerează un model pragmatic:
- Publicați
/llms.txtla rădăcină și păstrați-l accesibil fără login, execuție JavaScript, paywall de consimțământ sau redirecționări în afara căii. - Serviți-l ca
text/plainsautext/markdownatunci când este posibil. - Începeți cu o descriere scurtă a site-ului, apoi grupați linkurile după produs, documentație, API, prețuri, changelog, exemple, suport, politici și resurse despre companie.
- Preferă linkurile canonice în locul listelor exhaustive de URL-uri.
- Evitați fișierele simbolice goale; cel mult, ele reprezintă un semnal slab.
- Evitați dump-urile masive, fără structură, cu excepția cazului în care există un caz de utilizare clar pentru consum automat și un flux de generare fiabil.
- Validați URL-ul final, corpul răspunsului, tipul de conținut, structura Markdown, numărul de linkuri și mărimea fișierului după publicare.
Echipele ar trebui, de asemenea, să stabilească așteptările cu atenție. Experimentele publice disponibile nu demonstrează că llms.txt crește independent traficul de recomandare din AI. Dacă o echipă vrea să testeze impactul asupra afacerii, ar trebui să urmărească împreună referințele LLM, paginile citate, cererile botului, prospețimea indexului și modificările de conținut. Un experiment util ar compara grupuri de pagini potrivite, ar menține actualizările de conținut constante acolo unde este posibil și ar separa traficul specific platformelor precum Perplexity, ChatGPT, Gemini, Claude și Bing/Copilot.
Limitări
Aceasta este o captură bazată pe crawl, nu un adevăr absolut și permanent. Site-urile pot adăuga, elimina sau modifica fișiere llms.txt în orice moment. Unele domenii pot bloca solicitările automate sau pot funcționa diferit în funcție de geografie, configurația TLS, logica de redirecționare, user agent sau mecanismele de protecție împotriva boților. Studiul a testat doar fișierele de la rădăcină și nu a căutat subdomenii sau căi non-standard.
Scorul de calitate și arhetipurile sunt instrumente de cercetare, nu etichete oficiale de conformitate. Analiza tematică se bazează pe cuvinte-cheie și ar trebui citită ca orientare. Studiul nu dovedește că vreo platformă AI specifică citește, respectă sau folosește în prezent llms.txt în producție.
Dovezile externe despre trafic analizate în această versiune au, de asemenea, limitări. Analiza Search Engine Land este mai solidă ca observație de precauție multi-site decât ca experiment randomizat. Rezultatul lui Alimbekov este util ca studiu de caz transparent la nivel de site, dar nu are grup de control și include o perioadă în care traficul total de referință a crescut substanțial. Aceste referințe ajută la încadrarea dezbaterii, dar nu transformă acest crawl într-un studiu cauzal de trafic.
Fișiere și reproductibilitate
| Fișier | Scop |
|---|---|
crawl_llms_txt.py | Crawler pentru /llms.txt și /llms-full.txt. |
analyze_llms_txt.py | Analiza principală a adoptării și generarea graficelor. |
deep_analyze_llms_txt.py | Analiză secundară pentru decile de rank, TLD-uri, semnale tematice, scoruri de calitate, arhetipuri și comportamentul cu două fișiere. |
deep_dive_early_quality.py | Clasificarea primilor adoptatori și analiza aprofundată a calității implementării. |
data/llms_probe_results_top_10000.csv | Setul principal de date cu rezultatele crawl-ului. |
data/deep_analysis_top_10000.json | Rezumatul analizei secundare. |
data/deep_early_quality_analysis.json | Categorii de primii adoptatori, comparația cohortelor de calitate, detalii despre arhetipuri și studii de caz. |
Surse
- Fișierul /llms.txt, Jeremy Howard, 2024.
- Metodologia HTTP Archive Web Almanac 2024.
- Cloudflare Radar: Expanded AI insights.
- Cloudflare Radar AI Insights.
- Consent in Crisis: The Rapid Decline of the AI Data Commons, Data Provenance Initiative.
- Tranco: A Research-Oriented Top Sites Ranking Hardened Against Manipulation.
- Does llms.txt matter?, Search Engine Land, ianuarie 2026.
- The State of llms.txt Adoption, Rankability, iunie 2025.
- How LLMS.txt Increased AI Chat Traffic by 23%, Renat Alimbekov.
Corecții metodologice, probleme de set de date și analize de follow-up sunt binevenite la support@thunderbit.com. Acest raport este publicat independent de orice poziție comercială deținută de Thunderbit. Datele din acest raport stau pe propriile picioare. — Echipa de cercetare Thunderbit, mai 2026.
Încearcă Thunderbit pentru a extrage și analiza date web Get Started Free


