En crawl-basert studie av hvordan nettsteder med høy trafikk publiserer maskinlesbar veiledning for store språkmodeller, hvordan tidlige implementeringer ser ut, og hvorfor måling av adopsjon krever mer enn å telle HTTP 200-svar.
- Datasett:
data/llms_probe_results_top_10000.csv - Tranco-liste lastet ned: 6. mai 2026
- Omfang:
/llms.txtog/llms-full.txtpå rot-nivå
Nøkkeltall

- 5,86 %: Gyldig adopsjon av
llms.txtpå tvers av Tranco Top 10 000, tilsvarende 586 domener. - 1,03 %: Gyldig adopsjon av
llms-full.txt, tilsvarende 103 domener. Alle som hadde en gyldig fullfil, hadde også en gyldig indeksfil. - 63,51 %: Andel HTTP 200-svar for
/llms.txtsom feilet valideringen. - 2,74x: Omtrentlig overestimering dersom adopsjon måles bare ved rå HTTP 200-svar.
Sammendrag for ledelsen
llms.txt er fortsatt en tidlig webkonvensjon, men det er ikke lenger bare et nisjeeksperiment. I en crawl av Tranco Top 10 000-domener 6. mai 2026 fant denne studien 586 gyldige llms.txt-filer, som gir en observert adopsjonsrate på 5,86 %. Den tilhørende llms-full.txt-filen var langt sjeldnere: 103 domener hadde en gyldig fullfil, tilsvarende 1,03 % adopsjon.
Det viktigste metodiske funnet er at statuskoder er en dårlig indikator på adopsjon. Crawleren registrerte 1 606 HTTP 200-svar for /llms.txt, men bare 586 besto valideringen. De resterende 1 020 var stort sett omdirigeringer til feil mål, generiske HTML-sider, tomme responser eller andre ugyldige svar. En naiv crawler som teller hvert 200-svar som adopsjon, ville overvurdere den gyldige adopsjonen med omtrent 2,74 ganger.
Blant de gyldige aktørene er implementeringskvaliteten høyere enn en ren plassholder-fortelling skulle tilsi. Median gyldig fil var rundt 7,1 KB, 61,77 % av de gyldige filene var større enn 5 KB, 70,82 % inneholdt seks eller flere Markdown-seksjoner, og 77,47 % inneholdt 11 eller flere Markdown-lenker. De tidlige aktørene inkluderer Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog og Cloudinary.
llms.txtforstås best som et forklarende og navigasjonsrettet signal for AI-systemer, ikke som en erstatning forrobots.txt. Verdien ligger ikke bare i at filen finnes, men i om den hjelper maskiner med å finne autoritativ, kortfattet og oppdatert informasjon.
Kontekst: Nettet får flere AI-rettede signaler
Nettsteder har lenge brukt robots.txt for å uttrykke crawler-preferanser, sitemap.xml for å forbedre URL-oppdagelse, og strukturert data for å hjelpe søke- og plattformsystemer med å tolke sider. Generativ AI skaper et annet problem. Innhold kan brukes til trening, gjenfinning, oppsummering, agentisk surfing, kodehjelp, kundestøtte og generering av svar. Det skaper to behov samtidig: publisister vil ha mer kontroll over automatisert bruk, men de vil også at AI-systemer skal finne riktig kanonisk informasjon når disse systemene faktisk samhandler med nettstedet deres.
Det opprinnelige llms.txt-forslaget, introdusert av Jeremy Howard i 2024, beskriver filen som et Markdown-dokument plassert i nettstedets rot for å gi LLM-vennlig informasjon ved inferenstidspunktet. Forslaget hevder at HTML-sider ofte inneholder navigasjon, reklame, skript og annen støy som gjør dem vanskeligere for språkmodeller å bearbeide. En kortfattet Markdown-fil kan peke modellene mot de viktigste sidene, dokumentasjonen, API-ene, eksemplene, retningslinjene og produktinformasjonen.
Ekstern webforskning gir den bredere bakgrunnen. Data Provenance Initiatives «Consent in Crisis» beskriver en rask økning i AI-relaterte begrensninger i robots.txt og vilkår for bruk, og argumenterer for at eksisterende samtykkemekanismer på nettet ikke var laget for AI-gjenbruk av data i stor skala. Cloudflare Radar AI Insights har også gjort mønstre for AI-crawlere og robots.txt synlige på nivået Top 10 000 domener. I det miljøet ligger llms.txt på den konstruktive siden av AI-signalisering: ikke «ikke crawl dette», men «hvis du trenger å forstå dette nettstedet, start her».
Ekstern dokumentasjon og debatten om adopsjon
Den offentlige debatten rundt llms.txt er delt mellom to påstander. Den optimistiske påstanden er at filen gir AI-systemer en renere og mer effektiv vei til autoritativt innhold. Den skeptiske påstanden er at ingen store LLM-leverandører offentlig har forpliktet seg til å bruke den som et signal for rangering, crawling eller sitering, så publisister bør ikke forvente trafikkgevinst av filen alene. De tre eksterne kildene som ble gjennomgått for denne oppdateringen, peker mot en mer nyansert konklusjon: llms.txt er nyttig infrastruktur, men bevisene for direkte trafikkpåvirkning er fortsatt begrensede og kontekstavhengige.
Eksterne mål på adopsjon endrer seg raskt
Rankabilitys adopsjonssporer rapporterte en adopsjonsrate på 0,3 % blant de 1 000 største nettstedene per 22. juni 2025, altså 3 av 1 000 nettsteder. Den beskriver månedlig automatisert skanning av domain.com/llms.txt, med validering som utelukker omdirigeringer og HTML-svar. Den metodikken ligner i stor grad denne studiens konservative valideringsmetode.
Forskjellen i resultatene er stor: denne studien fant 75 gyldige llms.txt-filer i Tranco Top 1 000 per 6. mai 2026, altså 7,50 %. De to tallene bør ikke behandles som en streng tidsserie, fordi kilden for rangeringen, implementeringsdetaljer, valideringslogikk og crawl-tidspunkt kan være forskjellige. Likevel tyder kontrasten på at adopsjonen endret seg merkbart mellom midten av 2025 og mai 2026, særlig blant nettsteder med mye utvikler-, SaaS-, sky-, sikkerhets- og dokumentasjonsinnhold.
| Kilde | Snittpunkt | Utvalg | Rapportert gyldig adopsjon | Tolkning |
|---|---|---|---|---|
| Rankability | 22. juni 2025 | Top 1 000 nettsteder | 0,3 % | Tidlig offentlig referanse som viser minimal adopsjon midt i 2025. |
| Denne studien | 6. mai 2026 | Tranco Top 1 000 | 7,50 % | Senere crawl som viser tydelig adopsjon blant nettsteder med høy trafikk. |
| Denne studien | 6. mai 2026 | Tranco Top 10 000 | 5,86 % | Bredere utvalg som viser at adopsjon er målbar, men ikke mainstream. |
Trafikkeksperimenter gir blandede resultater
Search Engine Land publiserte en analyse av 10 nettsteder i januar 2026 som fulgte sider i 90 dager før og 90 dager etter implementering. Artikkelen rapporterte at to nettsteder så AI-trafikken øke med 12,5 % og 25 %, åtte så ingen målbar forbedring, og ett falt med 19,7 %. Hovedtolkningen var kausal forsiktighet: De to tilsynelatende suksesshistoriene lanserte også nye maler, bygde om ressurs-sentre, la til utvinnbare sammenligningstabeller, fikk pressedekning, fikset tekniske problemer eller publiserte nytt FAQ-lignende innhold. I den rammen dokumenterte llms.txt sterkere innholds- og teknisk arbeid; den ser ikke ut til å ha forårsaket veksten alene.
Renat Alimbekovs personlige blogg-eksperiment kom til en mer positiv konklusjon fra en mindre observasjon på sidenivå. Han sammenlignet to firemånedersperioder i Yandex.Metrica etter å ha lagt til både llms.txt og llms-full.txt. LLM-henvisningsøkter økte fra 75 til 92, altså 23 %, mens brukere økte fra 51 til 64. Perplexity-økter økte fra 29 til 55, mens ChatGPT-økter falt fra 31 til 26. Samme innlegg påpeker også at total henvisningstrafikk vokste raskere, fra 160 til 290 økter, slik at LLM-andelen av øktene falt fra 47 % til 32 %.
| Type bevis | Observert resultat | Viktig forbehold | Hvordan det påvirker denne rapporten |
|---|---|---|---|
| Search Engine Lands før/etter-studie av 10 nettsteder | To nettsteder økte, åtte hadde ingen målbar endring, ett falt. | Positive tilfeller hadde samtidige innholds-, PR- og tekniske endringer. | Støtter å behandle llms.txt som infrastruktur, ikke som en selvstendig vekstspak. |
| Alimbekovs før/etter-observasjon på personlig blogg | LLM-henvisningsøkter økte 23 % i perioden etter. | Ingen kontrollgruppe; total henvisningstrafikk økte 81 %, og LLM-andelen falt. | Tyder på mulig oppside for tekniske blogger, særlig via Perplexity, men kausaliteten er ikke isolert. |
| Denne crawl-baserte adopsjonsstudien | 586 gyldige filer og mange strukturerte implementeringer. | Måler tilstedeværelse og struktur, ikke trafikkpåvirkning nedstrøms. | Viser adopsjon og modenhet i implementering, men ikke ROI alene. |
Hva debatten klargjør
De eksterne bevisene skjerper tolkningen av dette datasettet. En godt strukturert llms.txt-fil kan redusere friksjon for maskinell parsing, særlig for utviklerdokumentasjon, API-referanser og kunnskapsbaseinnhold. Men de sterkeste trafikkhistoriene ser fortsatt ut til å avhenge av innhold som er nyttig, utvinnbart, autoritativt og oppdagbart også utenfor filen. Derfor er det praktiske spørsmålet ikke «betyr llms.txt noe?» isolert sett. Det er om filen er del av et bredere AI-lesbart innholdssystem.
Oppdatert tolkning:
llms.txtbør implementeres som rimelig AI-rettet infrastruktur. Den bør ikke presenteres som en erstatning for bedre dokumentasjon, strukturert innhold, teknisk tilgjengelighet, siteringer, lenker eller merkevareautoritet.
Prøv Thunderbit for AI-webskraping
Metodikk
Denne studien brukte Tranco Top 10 000-domener som utvalg. Tranco er en forskningsorientert rangering av toppnettsteder, utformet for å være mer stabil og mindre manipulerbar enn mange tradisjonelle topplister. Tranco-kildefilen ble lastet ned 6. mai 2026, med en Last-Modified-tid for kilden på 5. mai 2026 kl. 22:17:59 GMT.
Crawleren undersøkte to stier på rot-nivå for hvert domene:
https://example.com/llms.txt, med HTTP-fallback ved behov.https://example.com/llms-full.txt, med HTTP-fallback ved behov.
For hvert forsøk registrerte crawleren statuskode, endelig URL, hentemetode, responsbytes, innholdstype, feilmelding, medgått tid og valideringsresultat. Vellykkede responskropper ble lagret under raw_llms_txt/ for gjennomgang og sekundæranalyse.
Valideringsregler
Et svar ble bare regnet som en gyldig fil hvis det returnerte en vellykket kropp og ikke så ut som en generisk nett-fallback. Den endelige URL-stien måtte forbli /llms.txt eller /llms-full.txt. Tomme svar ble avvist. Tydelige HTML-dokumenter og app-shells ble avvist. Innholdstype ble brukt som støttende bevis, ikke som eneste regel, fordi et lite antall gyldige tekstlignende filer ble servert med uvanlige innholdstyper.
Adopsjonsbildet
Crawlen fant 586 gyldige llms.txt-filer i Tranco Top 10 000. Det gir en gyldig adopsjonsrate på 5,86 %. Den mindre følgefilen llms-full.txt var til stede og gyldig på 103 domener, eller 1,03 % av utvalget.
| Måltall | Antall | Andel av Top 10 000 |
|---|---|---|
| Domener crawlet | 10 000 | 100,00 % |
| Gyldige llms.txt-filer | 586 | 5,86 % |
| Gyldige llms-full.txt-filer | 103 | 1,03 % |
| HTTP 200-svar for /llms.txt | 1 606 | 16,06 % |
| HTTP 200-svar avvist som ugyldige | 1 020 | 10,20 % |
Adopsjonen er ikke bare topptung
Adopsjonen var høyere i Top 1 000 enn i hele Top 10 000, men den var ikke begrenset til de aller største nettstedene. Adopsjonsraten i Top 1 000 var 7,50 %. Den siste 1 000-domene-bøtten, rang 9 001–10 000, falt til 3,80 %. Midten av rangeringen var fortsatt aktiv: bøttene 2 001–3 000, 3 001–4 000, 5 001–6 000 og 6 001–7 000 lå alle rundt 6 %.

Tidlige aktører
Den høyest rangerte gyldige aktøren var Cloudflare på Tranco-rang 4. Andre høyt rangerte aktører inkluderte Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink og OneSignal.
Disse aktørene er ikke tilfeldige. De har ofte store dokumentasjonsflater, produktlinjer som krever forklaring, API-er eller utviklerøkosystemer, støtteinnhold, prissider, materiale om sikkerhet og personvern, og nok merkevareautoritet til å bry seg om hvordan AI-systemer tolker nettstedene deres.
| Rang | Domene | Filstørrelse | Observert mønster |
|---|---|---|---|
| 4 | cloudflare.com | 4 225 B | Kompakt indeks for produkter, utviklere, selskap og priser. |
| 26 | azure.com | 47 037 B | Utviklerverktøy, AI, databehandling, lagring, sikkerhet, overvåking og valgfrie ressurser. |
| 28 | github.com | 27 108 B | Programmatisk tilgang, Copilot, MCP, REST API, Actions, repositories og CLI-lenker. |
| 248 | stripe.com | 64 229 B | Betalinger, Connect, Checkout, Billing, Tax, Atlas, Radar og utviklerdokumentasjon. |
| 265 | salesforce.com | 1,02 MB | Massiv produkt- og Agentforce-lenke-katalog uten Markdown-seksjonsoverskrifter. |
Kategorier blant Top 1 000-aktører
Denne studien klassifiserte de 75 gyldige aktørene i Tranco Top 1 000 ved hjelp av domenekontekst, første overskrifter, rå filstruktur og innholdsord. Den største gruppen var markedsføring, medier og adtech med 22,67 %. Nettsteder innen sky, utvikling og infrastruktur utgjorde 20,00 %. SaaS-, produktivitets- og kundedriftsnettsteder utgjorde 17,33 %. Sikkerhet, identitet og personvern utgjorde 12,00 %.

| Kategori | Domener | Andel av Top 1 000-aktører | Median kvalitetsscore | Median lenker |
|---|---|---|---|---|
| Markedsføring, medier og adtech | 17 | 22,67 % | 94 | 25 |
| Sky, utvikling og infrastruktur | 15 | 20,00 % | 94 | 62 |
| SaaS, produktivitet og kundedrift | 13 | 17,33 % | 94 | 46 |
| Sikkerhet, identitet og personvern | 9 | 12,00 % | 98 | 78 |
| CMS, hosting og nett-tilstedeværelse | 7 | 9,33 % | 100 | 24 |
Mønstre etter TLD
Toppnivådomener er ikke bransjeetiketter, men de er nyttige som retningsgivende signaler. Blant TLD-er med minst 50 domener i utvalget hadde .io høyest gyldig adopsjonsrate, på 14,44 %. .com fulgte med 8,19 %. Lavere adopsjon blant .gov, .edu og .net tyder på at den tidlige aktørbasen er mer kommersiell og teknisk enn institusjonell.
Implementeringskvalitet
Gyldig adopsjon betyr ikke jevn implementeringskvalitet. Noen filer er korte, godt inndelte indekser. Noen er mest prosa. Noen er rene lenkekataloger. Noen er nesten tomme plassholdere. Noen er innholdsdumper på flere megabyte som kan være komplette, men dyre å hente og parse.
Blant gyldige llms.txt-filer var 362 større enn 5 KB, altså 61,77 % av de gyldige aktørene. Median filstørrelse var rundt 7,1 KB. P90 filstørrelse var 156 KB, P95 var 356 KB, P99 var 2,54 MB, og den største observerte filen var 7,97 MB.
Vanlige innholdssignaler
Et nøkkelordsøk på gyldige filer viste at mange nettsteder ikke bare publiserer en erklæring; de peker modellene mot operativt nyttig materiale. Ord knyttet til support eller hjelp forekom i 70,31 % av de gyldige filene. Blogg, guide eller tutorial forekom i 67,92 %. Sikkerhet, personvern, samsvar eller vilkår forekom i 61,43 %. Priser forekom i 53,92 %, dokumentasjon i 52,22 %, API-termer i 33,96 %, og signaler om changelog eller utgivelser i 27,30 %.
Kvalitetsscore og arketyper
For å gå fra tilstedeværelse til modenhet utviklet denne studien en lettvekts implementeringsscore. Scoren tar hensyn til innholdstype, filstørrelse, Markdown-struktur, lenketall, temaomfang og varselsignaler som manglende overskrifter, ingen Markdown-lenker, uvanlige innholdstyper, små filer, svært store filer og lenkedump-atferd. Dette er ikke en formell standard. Det er en forskningsmodell for å sammenligne observerte implementeringer.
Med denne modellen ble 416 gyldige filer klassifisert som sterke strukturerte indekser, 107 som brukbare indekser, 24 som tynne eller uregelmessige, og 39 som symbolske eller med lav nytte. En separat arketypeanalyse fant 296 strukturerte indekser, 113 filer med seksjonert tekst, 63 lenkekataloger, 52 tynne indekser, 50 symbolske eller plassholderfiler, og 12 massive innholdsdumper.

| Arketype | Domener | Andel av gyldige filer | Median score | Median filstørrelse | Median lenker |
|---|---|---|---|---|---|
| Strukturert indeks | 296 | 50,51 % | 98 | 11 241 B | 61,5 |
| Seksjonert tekst | 113 | 19,28 % | 78 | 4 718 B | 0 |
| Lenkekatalog | 63 | 10,75 % | 86 | 4 160 B | 23 |
| Tynn indeks | 52 | 8,87 % | 66 | 2 814 B | 0 |
| Symbolsk eller plassholder | 50 | 8,53 % | 27 | 15 B | 0 |
| Massiv innholdsdump | 12 | 2,05 % | 74 | 2,84 MB | 7 259,5 |
De største aktørene har tettere implementeringer

De 75 gyldige aktørene i Tranco Top 1 000 hadde en median kvalitetsscore på 96, median filstørrelse på 9 068 byte, median antall Markdown-lenker på 52 og median antall seksjoner på 11. De 511 aktørene rangert 1 001–10 000 hadde lavere medianer: score 90, filstørrelse 6 506 byte, 23 Markdown-lenker og 9 seksjoner. Top 1 000-aktørene var også mer tilbøyelige til å være strukturerte indekser: 69,33 % mot 47,75 % i den senere kohorten.
Problemet med falske positiver

Den største målerisikoen er falske positiver. Av de 1 606 domenene som returnerte HTTP 200 for /llms.txt, feilet 1 020 valideringen. Den vanligste ugyldige årsaken var omdirigering til feil mål, med 618 tilfeller. Ytterligere 367 svar var generiske HTML-dokumenter. 29 returnerte en tom kropp, og 6 var andre eller ukategoriserte ugyldige svar.
Dette betyr noe fordi mange store nettsteder sender ukjente stier til innloggingssider, forsider, app-shells, regionale sider, samtykkeflater eller markedsførings-fallbacks. Slike svar kan se sunne ut for en statuskode-crawler, men inneholder ingen gyldig llms.txt-signal.
llms-full.txt: Sjeldnere og mer ujevnt
Den tilhørende llms-full.txt-filen var langt sjeldnere enn llms.txt. Crawlen fant 103 gyldige fullfiler, tilsvarende 17,58 % av de gyldige llms.txt-aktørene og 1,03 % av hele Top 10 000-utvalget.
Fullfil-implementeringene var ujevne. Blant de 103 aktørene med begge filer hadde 57 en llms-full.txt-fil som var større enn indeksfilen, men 46 hadde enten en fullfil som ikke var større enn indeksfilen, eller en fullfil under 100 byte. Median forhold mellom fullfil og indeksfil var 1,43, men ekstreme tilfeller var langt høyere. Supabase sin fullfil var omtrent 7 139 ganger så stor som indeksfilen. Made-in-China.com hadde en fullfil på 89,89 MB.
| Domene | llms.txt | llms-full.txt | Forhold |
|---|---|---|---|
| made-in-china.com | 4,49 MB | 89,89 MB | 20,0x |
| sendbird.com | 281,86 KB | 11,99 MB | 42,5x |
| taboola.com | 286,78 KB | 11,73 MB | 40,9x |
| supabase.co | 1,26 KB | 8,98 MB | 7 139,3x |
| neon.tech | 27,44 KB | 5,01 MB | 182,7x |
Anbefaling: publiser bare
llms-full.txtnår nettstedet allerede har en stabil dokumentasjonspipeline, versjonskontroll og en tydelig grunn til å eksponere store mengder innhold i én maskinlesbar fil.
llms.txt, robots.txt og sitemap.xml
llms.txt bør ikke behandles som en ny robots.txt. Begge er maskinlesbare filer på rot-nivå, men de kommuniserer ulike ting. robots.txt er et signal om crawler-preferanser og tilgangskontroll. sitemap.xml er et signal om URL-oppdagelse. llms.txt er et forklarende og navigasjonsrettet signal.
| Signal | Primær rolle | Typisk leser | Tolkning i denne studien |
|---|---|---|---|
robots.txt | Oppgi crawler-preferanser og restriksjoner på stinivå. | Søkemotor-crawlere, AI-crawlere, arkiv-crawlere, generiske roboter. | Styrings- og tilgangssignal. |
sitemap.xml | Liste over oppdagbare URL-er for indekseringssystemer. | Søkemotorer og indekseringspipeliner. | Oppdagelsessignal. |
llms.txt | Gi kortfattet nettsteds-kontekst, viktige lenker, dokumentasjon, API-er, eksempler og policyreferanser. | LLM-applikasjoner, AI-agenter, utviklerverktøy, gjenfinningssystemer. | Forklarings- og navigasjonssignal. |
Anbefalinger
For nettsteder som vurderer llms.txt, tyder de sterkeste implementeringene i dette datasettet og den eksterne trafikkdokumentasjonen på et pragmatisk mønster:
- Publiser
/llms.txti roten og sørg for at den er tilgjengelig uten innlogging, JavaScript-kjøring, samtykkemurer eller omdirigeringer bort fra stien. - Server den som
text/plainellertext/markdownnår det er mulig. - Start med en kort beskrivelse av nettstedet, og grupper deretter lenker etter produkt, dokumentasjon, API, priser, changelog, eksempler, support, retningslinjer og selskapsressurser.
- Foretrekk kanoniske lenker fremfor uttømmende URL-lister.
- Unngå tomme symbolske filer; de er knapt mer enn et svakt signal.
- Unngå massive, udifferensierte dump-filer med mindre det finnes et sterkt bruksområde for maskinforbruk og en pålitelig genereringspipeline.
- Valider endelig URL, responskropp, innholdstype, Markdown-struktur, lenketall og filstørrelse etter publisering.
Team bør også sette forventninger med forsiktighet. De tilgjengelige offentlige eksperimentene beviser ikke at llms.txt alene øker AI-henvisningstrafikk. Hvis et team vil teste forretningspåvirkning, bør det spore LLM-henvisninger, siterte sider, bot-forespørsler, ferskhet i indekser og innholdsendringer samtidig. Et nyttig eksperiment ville sammenligne matchede sidegrupper, holde innholdsoppdateringer konstante der det er mulig, og skille ut plattformspesifikk trafikk som Perplexity, ChatGPT, Gemini, Claude og Bing/Copilot.
Begrensninger
Dette er et øyeblikksbilde basert på crawl, ikke en permanent sannhetskilde. Nettsteder kan legge til, fjerne eller endre llms.txt-filer når som helst. Noen domener kan blokkere automatiserte forespørsler eller oppføre seg annerledes avhengig av geografi, TLS-konfigurasjon, omdirigeringslogikk, user agent eller bot-mottiltak. Studien testet bare filer på rot-nivå og søkte ikke i underdomener eller ikke-standard stier.
Kvalitetsscoren og arketypene er forskningsverktøy, ikke offisielle samsvarsmerkelapper. Temaanalysen er nøkkelordbasert og bør leses som retningsgivende. Studien beviser ikke at noen spesifikk AI-plattform i dag leser, respekterer eller bruker llms.txt i produksjon.
Den eksterne trafikkdokumentasjonen som ble gjennomgått i denne versjonen har også begrensninger. Search Engine Lands analyse er sterkere som en forsiktig observasjon på tvers av flere nettsteder enn som et randomisert eksperiment. Alimbekovs resultat er nyttig som en åpen og tydelig case-studie på sidenivå, men det mangler en kontrollgruppe og inkluderer en periode der total henvisningstrafikk økte betydelig. Disse referansene hjelper med å ramme inn debatten, men de gjør ikke denne crawlen til en kausal trafikkstudie.
Filer og reproduksjon
| Fil | Formål |
|---|---|
crawl_llms_txt.py | Crawler for /llms.txt og /llms-full.txt. |
analyze_llms_txt.py | Primæranalyse av adopsjon og generering av diagrammer. |
deep_analyze_llms_txt.py | Sekundæranalyse for rang-desiler, TLD-er, temasignaler, kvalitetsscorer, arketyper og oppførsel med to filer. |
deep_dive_early_quality.py | Klassifisering av tidlige aktører og dypdykk i implementeringskvalitet. |
data/llms_probe_results_top_10000.csv | Hoveddatasettet med crawl-resultater. |
data/deep_analysis_top_10000.json | Sammendrag av sekundæranalysen. |
data/deep_early_quality_analysis.json | Kategorier for tidlige aktører, sammenligning av kvalitetskohorter, arketypedetaljer og case-studier. |
Kilder
- The /llms.txt file, Jeremy Howard, 2024.
- HTTP Archive Web Almanac 2024 Methodology.
- Cloudflare Radar: Expanded AI insights.
- Cloudflare Radar AI Insights.
- Consent in Crisis: The Rapid Decline of the AI Data Commons, Data Provenance Initiative.
- Tranco: A Research-Oriented Top Sites Ranking Hardened Against Manipulation.
- Does llms.txt matter?, Search Engine Land, januar 2026.
- The State of llms.txt Adoption, Rankability, juni 2025.
- How LLMS.txt Increased AI Chat Traffic by 23%, Renat Alimbekov.
Korrigeringer av metodikk, datasettproblemer og oppfølgingsanalyser mottas gjerne på support@thunderbit.com. Denne rapporten er publisert uavhengig av enhver kommersiell posisjon Thunderbit måtte ha. Dataene i denne rapporten står på egne ben. — Thunderbit-forskningsteamet, mai 2026.
Prøv Thunderbit for å skrape og analysere webdata Get Started Free


