Fremveksten av llms.txt: Hvordan nettsteder signaliserer til AI

Sist oppdatert May 8, 2026
Fremveksten av llms.txt: Hvordan nettsteder signaliserer til AI
Datainnhenting drevet av Thunderbit.

En crawl-basert studie av hvordan nettsteder med høy trafikk publiserer maskinlesbar veiledning for store språkmodeller, hvordan tidlige implementeringer ser ut, og hvorfor måling av adopsjon krever mer enn å telle HTTP 200-svar.

  • Datasett: data/llms_probe_results_top_10000.csv
  • Tranco-liste lastet ned: 6. mai 2026
  • Omfang: /llms.txt og /llms-full.txt på rot-nivå

Nøkkeltall

llms-txt-adoption-landscape.webp

  • 5,86 %: Gyldig adopsjon av llms.txt på tvers av Tranco Top 10 000, tilsvarende 586 domener.
  • 1,03 %: Gyldig adopsjon av llms-full.txt, tilsvarende 103 domener. Alle som hadde en gyldig fullfil, hadde også en gyldig indeksfil.
  • 63,51 %: Andel HTTP 200-svar for /llms.txt som feilet valideringen.
  • 2,74x: Omtrentlig overestimering dersom adopsjon måles bare ved rå HTTP 200-svar.

Sammendrag for ledelsen

llms.txt er fortsatt en tidlig webkonvensjon, men det er ikke lenger bare et nisjeeksperiment. I en crawl av Tranco Top 10 000-domener 6. mai 2026 fant denne studien 586 gyldige llms.txt-filer, som gir en observert adopsjonsrate på 5,86 %. Den tilhørende llms-full.txt-filen var langt sjeldnere: 103 domener hadde en gyldig fullfil, tilsvarende 1,03 % adopsjon.

Det viktigste metodiske funnet er at statuskoder er en dårlig indikator på adopsjon. Crawleren registrerte 1 606 HTTP 200-svar for /llms.txt, men bare 586 besto valideringen. De resterende 1 020 var stort sett omdirigeringer til feil mål, generiske HTML-sider, tomme responser eller andre ugyldige svar. En naiv crawler som teller hvert 200-svar som adopsjon, ville overvurdere den gyldige adopsjonen med omtrent 2,74 ganger.

Blant de gyldige aktørene er implementeringskvaliteten høyere enn en ren plassholder-fortelling skulle tilsi. Median gyldig fil var rundt 7,1 KB, 61,77 % av de gyldige filene var større enn 5 KB, 70,82 % inneholdt seks eller flere Markdown-seksjoner, og 77,47 % inneholdt 11 eller flere Markdown-lenker. De tidlige aktørene inkluderer Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog og Cloudinary.

llms.txt forstås best som et forklarende og navigasjonsrettet signal for AI-systemer, ikke som en erstatning for robots.txt. Verdien ligger ikke bare i at filen finnes, men i om den hjelper maskiner med å finne autoritativ, kortfattet og oppdatert informasjon.

Kontekst: Nettet får flere AI-rettede signaler

Nettsteder har lenge brukt robots.txt for å uttrykke crawler-preferanser, sitemap.xml for å forbedre URL-oppdagelse, og strukturert data for å hjelpe søke- og plattformsystemer med å tolke sider. Generativ AI skaper et annet problem. Innhold kan brukes til trening, gjenfinning, oppsummering, agentisk surfing, kodehjelp, kundestøtte og generering av svar. Det skaper to behov samtidig: publisister vil ha mer kontroll over automatisert bruk, men de vil også at AI-systemer skal finne riktig kanonisk informasjon når disse systemene faktisk samhandler med nettstedet deres.

Det opprinnelige llms.txt-forslaget, introdusert av Jeremy Howard i 2024, beskriver filen som et Markdown-dokument plassert i nettstedets rot for å gi LLM-vennlig informasjon ved inferenstidspunktet. Forslaget hevder at HTML-sider ofte inneholder navigasjon, reklame, skript og annen støy som gjør dem vanskeligere for språkmodeller å bearbeide. En kortfattet Markdown-fil kan peke modellene mot de viktigste sidene, dokumentasjonen, API-ene, eksemplene, retningslinjene og produktinformasjonen.

Ekstern webforskning gir den bredere bakgrunnen. Data Provenance Initiatives «Consent in Crisis» beskriver en rask økning i AI-relaterte begrensninger i robots.txt og vilkår for bruk, og argumenterer for at eksisterende samtykkemekanismer på nettet ikke var laget for AI-gjenbruk av data i stor skala. Cloudflare Radar AI Insights har også gjort mønstre for AI-crawlere og robots.txt synlige på nivået Top 10 000 domener. I det miljøet ligger llms.txt på den konstruktive siden av AI-signalisering: ikke «ikke crawl dette», men «hvis du trenger å forstå dette nettstedet, start her».

Ekstern dokumentasjon og debatten om adopsjon

Den offentlige debatten rundt llms.txt er delt mellom to påstander. Den optimistiske påstanden er at filen gir AI-systemer en renere og mer effektiv vei til autoritativt innhold. Den skeptiske påstanden er at ingen store LLM-leverandører offentlig har forpliktet seg til å bruke den som et signal for rangering, crawling eller sitering, så publisister bør ikke forvente trafikkgevinst av filen alene. De tre eksterne kildene som ble gjennomgått for denne oppdateringen, peker mot en mer nyansert konklusjon: llms.txt er nyttig infrastruktur, men bevisene for direkte trafikkpåvirkning er fortsatt begrensede og kontekstavhengige.

Eksterne mål på adopsjon endrer seg raskt

Rankabilitys adopsjonssporer rapporterte en adopsjonsrate på 0,3 % blant de 1 000 største nettstedene per 22. juni 2025, altså 3 av 1 000 nettsteder. Den beskriver månedlig automatisert skanning av domain.com/llms.txt, med validering som utelukker omdirigeringer og HTML-svar. Den metodikken ligner i stor grad denne studiens konservative valideringsmetode.

Forskjellen i resultatene er stor: denne studien fant 75 gyldige llms.txt-filer i Tranco Top 1 000 per 6. mai 2026, altså 7,50 %. De to tallene bør ikke behandles som en streng tidsserie, fordi kilden for rangeringen, implementeringsdetaljer, valideringslogikk og crawl-tidspunkt kan være forskjellige. Likevel tyder kontrasten på at adopsjonen endret seg merkbart mellom midten av 2025 og mai 2026, særlig blant nettsteder med mye utvikler-, SaaS-, sky-, sikkerhets- og dokumentasjonsinnhold.

KildeSnittpunktUtvalgRapportert gyldig adopsjonTolkning
Rankability22. juni 2025Top 1 000 nettsteder0,3 %Tidlig offentlig referanse som viser minimal adopsjon midt i 2025.
Denne studien6. mai 2026Tranco Top 1 0007,50 %Senere crawl som viser tydelig adopsjon blant nettsteder med høy trafikk.
Denne studien6. mai 2026Tranco Top 10 0005,86 %Bredere utvalg som viser at adopsjon er målbar, men ikke mainstream.

Trafikkeksperimenter gir blandede resultater

Search Engine Land publiserte en analyse av 10 nettsteder i januar 2026 som fulgte sider i 90 dager før og 90 dager etter implementering. Artikkelen rapporterte at to nettsteder så AI-trafikken øke med 12,5 % og 25 %, åtte så ingen målbar forbedring, og ett falt med 19,7 %. Hovedtolkningen var kausal forsiktighet: De to tilsynelatende suksesshistoriene lanserte også nye maler, bygde om ressurs-sentre, la til utvinnbare sammenligningstabeller, fikk pressedekning, fikset tekniske problemer eller publiserte nytt FAQ-lignende innhold. I den rammen dokumenterte llms.txt sterkere innholds- og teknisk arbeid; den ser ikke ut til å ha forårsaket veksten alene.

Renat Alimbekovs personlige blogg-eksperiment kom til en mer positiv konklusjon fra en mindre observasjon på sidenivå. Han sammenlignet to firemånedersperioder i Yandex.Metrica etter å ha lagt til både llms.txt og llms-full.txt. LLM-henvisningsøkter økte fra 75 til 92, altså 23 %, mens brukere økte fra 51 til 64. Perplexity-økter økte fra 29 til 55, mens ChatGPT-økter falt fra 31 til 26. Samme innlegg påpeker også at total henvisningstrafikk vokste raskere, fra 160 til 290 økter, slik at LLM-andelen av øktene falt fra 47 % til 32 %.

Type bevisObservert resultatViktig forbeholdHvordan det påvirker denne rapporten
Search Engine Lands før/etter-studie av 10 nettstederTo nettsteder økte, åtte hadde ingen målbar endring, ett falt.Positive tilfeller hadde samtidige innholds-, PR- og tekniske endringer.Støtter å behandle llms.txt som infrastruktur, ikke som en selvstendig vekstspak.
Alimbekovs før/etter-observasjon på personlig bloggLLM-henvisningsøkter økte 23 % i perioden etter.Ingen kontrollgruppe; total henvisningstrafikk økte 81 %, og LLM-andelen falt.Tyder på mulig oppside for tekniske blogger, særlig via Perplexity, men kausaliteten er ikke isolert.
Denne crawl-baserte adopsjonsstudien586 gyldige filer og mange strukturerte implementeringer.Måler tilstedeværelse og struktur, ikke trafikkpåvirkning nedstrøms.Viser adopsjon og modenhet i implementering, men ikke ROI alene.

Hva debatten klargjør

De eksterne bevisene skjerper tolkningen av dette datasettet. En godt strukturert llms.txt-fil kan redusere friksjon for maskinell parsing, særlig for utviklerdokumentasjon, API-referanser og kunnskapsbaseinnhold. Men de sterkeste trafikkhistoriene ser fortsatt ut til å avhenge av innhold som er nyttig, utvinnbart, autoritativt og oppdagbart også utenfor filen. Derfor er det praktiske spørsmålet ikke «betyr llms.txt noe?» isolert sett. Det er om filen er del av et bredere AI-lesbart innholdssystem.

Oppdatert tolkning: llms.txt bør implementeres som rimelig AI-rettet infrastruktur. Den bør ikke presenteres som en erstatning for bedre dokumentasjon, strukturert innhold, teknisk tilgjengelighet, siteringer, lenker eller merkevareautoritet.

Prøv Thunderbit for AI-webskraping

Metodikk

Denne studien brukte Tranco Top 10 000-domener som utvalg. Tranco er en forskningsorientert rangering av toppnettsteder, utformet for å være mer stabil og mindre manipulerbar enn mange tradisjonelle topplister. Tranco-kildefilen ble lastet ned 6. mai 2026, med en Last-Modified-tid for kilden på 5. mai 2026 kl. 22:17:59 GMT.

Crawleren undersøkte to stier på rot-nivå for hvert domene:

  • https://example.com/llms.txt, med HTTP-fallback ved behov.
  • https://example.com/llms-full.txt, med HTTP-fallback ved behov.

For hvert forsøk registrerte crawleren statuskode, endelig URL, hentemetode, responsbytes, innholdstype, feilmelding, medgått tid og valideringsresultat. Vellykkede responskropper ble lagret under raw_llms_txt/ for gjennomgang og sekundæranalyse.

Valideringsregler

Et svar ble bare regnet som en gyldig fil hvis det returnerte en vellykket kropp og ikke så ut som en generisk nett-fallback. Den endelige URL-stien måtte forbli /llms.txt eller /llms-full.txt. Tomme svar ble avvist. Tydelige HTML-dokumenter og app-shells ble avvist. Innholdstype ble brukt som støttende bevis, ikke som eneste regel, fordi et lite antall gyldige tekstlignende filer ble servert med uvanlige innholdstyper.

Adopsjonsbildet

Crawlen fant 586 gyldige llms.txt-filer i Tranco Top 10 000. Det gir en gyldig adopsjonsrate på 5,86 %. Den mindre følgefilen llms-full.txt var til stede og gyldig på 103 domener, eller 1,03 % av utvalget.

MåltallAntallAndel av Top 10 000
Domener crawlet10 000100,00 %
Gyldige llms.txt-filer5865,86 %
Gyldige llms-full.txt-filer1031,03 %
HTTP 200-svar for /llms.txt1 60616,06 %
HTTP 200-svar avvist som ugyldige1 02010,20 %

Adopsjonen er ikke bare topptung

Adopsjonen var høyere i Top 1 000 enn i hele Top 10 000, men den var ikke begrenset til de aller største nettstedene. Adopsjonsraten i Top 1 000 var 7,50 %. Den siste 1 000-domene-bøtten, rang 9 001–10 000, falt til 3,80 %. Midten av rangeringen var fortsatt aktiv: bøttene 2 001–3 000, 3 001–4 000, 5 001–6 000 og 6 001–7 000 lå alle rundt 6 %.

tranco-domain-adoption-rate.webp

Tidlige aktører

Den høyest rangerte gyldige aktøren var Cloudflare på Tranco-rang 4. Andre høyt rangerte aktører inkluderte Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink og OneSignal.

Disse aktørene er ikke tilfeldige. De har ofte store dokumentasjonsflater, produktlinjer som krever forklaring, API-er eller utviklerøkosystemer, støtteinnhold, prissider, materiale om sikkerhet og personvern, og nok merkevareautoritet til å bry seg om hvordan AI-systemer tolker nettstedene deres.

RangDomeneFilstørrelseObservert mønster
4cloudflare.com4 225 BKompakt indeks for produkter, utviklere, selskap og priser.
26azure.com47 037 BUtviklerverktøy, AI, databehandling, lagring, sikkerhet, overvåking og valgfrie ressurser.
28github.com27 108 BProgrammatisk tilgang, Copilot, MCP, REST API, Actions, repositories og CLI-lenker.
248stripe.com64 229 BBetalinger, Connect, Checkout, Billing, Tax, Atlas, Radar og utviklerdokumentasjon.
265salesforce.com1,02 MBMassiv produkt- og Agentforce-lenke-katalog uten Markdown-seksjonsoverskrifter.

Kategorier blant Top 1 000-aktører

Denne studien klassifiserte de 75 gyldige aktørene i Tranco Top 1 000 ved hjelp av domenekontekst, første overskrifter, rå filstruktur og innholdsord. Den største gruppen var markedsføring, medier og adtech med 22,67 %. Nettsteder innen sky, utvikling og infrastruktur utgjorde 20,00 %. SaaS-, produktivitets- og kundedriftsnettsteder utgjorde 17,33 %. Sikkerhet, identitet og personvern utgjorde 12,00 %.

top-1000-adopters-categories.webp

KategoriDomenerAndel av Top 1 000-aktørerMedian kvalitetsscoreMedian lenker
Markedsføring, medier og adtech1722,67 %9425
Sky, utvikling og infrastruktur1520,00 %9462
SaaS, produktivitet og kundedrift1317,33 %9446
Sikkerhet, identitet og personvern912,00 %9878
CMS, hosting og nett-tilstedeværelse79,33 %10024

Mønstre etter TLD

Toppnivådomener er ikke bransjeetiketter, men de er nyttige som retningsgivende signaler. Blant TLD-er med minst 50 domener i utvalget hadde .io høyest gyldig adopsjonsrate, på 14,44 %. .com fulgte med 8,19 %. Lavere adopsjon blant .gov, .edu og .net tyder på at den tidlige aktørbasen er mer kommersiell og teknisk enn institusjonell.

Implementeringskvalitet

Gyldig adopsjon betyr ikke jevn implementeringskvalitet. Noen filer er korte, godt inndelte indekser. Noen er mest prosa. Noen er rene lenkekataloger. Noen er nesten tomme plassholdere. Noen er innholdsdumper på flere megabyte som kan være komplette, men dyre å hente og parse.

Blant gyldige llms.txt-filer var 362 større enn 5 KB, altså 61,77 % av de gyldige aktørene. Median filstørrelse var rundt 7,1 KB. P90 filstørrelse var 156 KB, P95 var 356 KB, P99 var 2,54 MB, og den største observerte filen var 7,97 MB.

Vanlige innholdssignaler

Et nøkkelordsøk på gyldige filer viste at mange nettsteder ikke bare publiserer en erklæring; de peker modellene mot operativt nyttig materiale. Ord knyttet til support eller hjelp forekom i 70,31 % av de gyldige filene. Blogg, guide eller tutorial forekom i 67,92 %. Sikkerhet, personvern, samsvar eller vilkår forekom i 61,43 %. Priser forekom i 53,92 %, dokumentasjon i 52,22 %, API-termer i 33,96 %, og signaler om changelog eller utgivelser i 27,30 %.

Kvalitetsscore og arketyper

For å gå fra tilstedeværelse til modenhet utviklet denne studien en lettvekts implementeringsscore. Scoren tar hensyn til innholdstype, filstørrelse, Markdown-struktur, lenketall, temaomfang og varselsignaler som manglende overskrifter, ingen Markdown-lenker, uvanlige innholdstyper, små filer, svært store filer og lenkedump-atferd. Dette er ikke en formell standard. Det er en forskningsmodell for å sammenligne observerte implementeringer.

Med denne modellen ble 416 gyldige filer klassifisert som sterke strukturerte indekser, 107 som brukbare indekser, 24 som tynne eller uregelmessige, og 39 som symbolske eller med lav nytte. En separat arketypeanalyse fant 296 strukturerte indekser, 113 filer med seksjonert tekst, 63 lenkekataloger, 52 tynne indekser, 50 symbolske eller plassholderfiler, og 12 massive innholdsdumper.

tranco-crawl-implementation-archetypes.webp

ArketypeDomenerAndel av gyldige filerMedian scoreMedian filstørrelseMedian lenker
Strukturert indeks29650,51 %9811 241 B61,5
Seksjonert tekst11319,28 %784 718 B0
Lenkekatalog6310,75 %864 160 B23
Tynn indeks528,87 %662 814 B0
Symbolsk eller plassholder508,53 %2715 B0
Massiv innholdsdump122,05 %742,84 MB7 259,5

De største aktørene har tettere implementeringer

tranco-crawl-ranks-stats.webp

De 75 gyldige aktørene i Tranco Top 1 000 hadde en median kvalitetsscore på 96, median filstørrelse på 9 068 byte, median antall Markdown-lenker på 52 og median antall seksjoner på 11. De 511 aktørene rangert 1 001–10 000 hadde lavere medianer: score 90, filstørrelse 6 506 byte, 23 Markdown-lenker og 9 seksjoner. Top 1 000-aktørene var også mer tilbøyelige til å være strukturerte indekser: 69,33 % mot 47,75 % i den senere kohorten.

Problemet med falske positiver

llms-txt-http-200-outcomes.webp

Den største målerisikoen er falske positiver. Av de 1 606 domenene som returnerte HTTP 200 for /llms.txt, feilet 1 020 valideringen. Den vanligste ugyldige årsaken var omdirigering til feil mål, med 618 tilfeller. Ytterligere 367 svar var generiske HTML-dokumenter. 29 returnerte en tom kropp, og 6 var andre eller ukategoriserte ugyldige svar.

Dette betyr noe fordi mange store nettsteder sender ukjente stier til innloggingssider, forsider, app-shells, regionale sider, samtykkeflater eller markedsførings-fallbacks. Slike svar kan se sunne ut for en statuskode-crawler, men inneholder ingen gyldig llms.txt-signal.

llms-full.txt: Sjeldnere og mer ujevnt

Den tilhørende llms-full.txt-filen var langt sjeldnere enn llms.txt. Crawlen fant 103 gyldige fullfiler, tilsvarende 17,58 % av de gyldige llms.txt-aktørene og 1,03 % av hele Top 10 000-utvalget.

Fullfil-implementeringene var ujevne. Blant de 103 aktørene med begge filer hadde 57 en llms-full.txt-fil som var større enn indeksfilen, men 46 hadde enten en fullfil som ikke var større enn indeksfilen, eller en fullfil under 100 byte. Median forhold mellom fullfil og indeksfil var 1,43, men ekstreme tilfeller var langt høyere. Supabase sin fullfil var omtrent 7 139 ganger så stor som indeksfilen. Made-in-China.com hadde en fullfil på 89,89 MB.

Domenellms.txtllms-full.txtForhold
made-in-china.com4,49 MB89,89 MB20,0x
sendbird.com281,86 KB11,99 MB42,5x
taboola.com286,78 KB11,73 MB40,9x
supabase.co1,26 KB8,98 MB7 139,3x
neon.tech27,44 KB5,01 MB182,7x

Anbefaling: publiser bare llms-full.txt når nettstedet allerede har en stabil dokumentasjonspipeline, versjonskontroll og en tydelig grunn til å eksponere store mengder innhold i én maskinlesbar fil.

llms.txt, robots.txt og sitemap.xml

llms.txt bør ikke behandles som en ny robots.txt. Begge er maskinlesbare filer på rot-nivå, men de kommuniserer ulike ting. robots.txt er et signal om crawler-preferanser og tilgangskontroll. sitemap.xml er et signal om URL-oppdagelse. llms.txt er et forklarende og navigasjonsrettet signal.

SignalPrimær rolleTypisk leserTolkning i denne studien
robots.txtOppgi crawler-preferanser og restriksjoner på stinivå.Søkemotor-crawlere, AI-crawlere, arkiv-crawlere, generiske roboter.Styrings- og tilgangssignal.
sitemap.xmlListe over oppdagbare URL-er for indekseringssystemer.Søkemotorer og indekseringspipeliner.Oppdagelsessignal.
llms.txtGi kortfattet nettsteds-kontekst, viktige lenker, dokumentasjon, API-er, eksempler og policyreferanser.LLM-applikasjoner, AI-agenter, utviklerverktøy, gjenfinningssystemer.Forklarings- og navigasjonssignal.

Anbefalinger

For nettsteder som vurderer llms.txt, tyder de sterkeste implementeringene i dette datasettet og den eksterne trafikkdokumentasjonen på et pragmatisk mønster:

  • Publiser /llms.txt i roten og sørg for at den er tilgjengelig uten innlogging, JavaScript-kjøring, samtykkemurer eller omdirigeringer bort fra stien.
  • Server den som text/plain eller text/markdown når det er mulig.
  • Start med en kort beskrivelse av nettstedet, og grupper deretter lenker etter produkt, dokumentasjon, API, priser, changelog, eksempler, support, retningslinjer og selskapsressurser.
  • Foretrekk kanoniske lenker fremfor uttømmende URL-lister.
  • Unngå tomme symbolske filer; de er knapt mer enn et svakt signal.
  • Unngå massive, udifferensierte dump-filer med mindre det finnes et sterkt bruksområde for maskinforbruk og en pålitelig genereringspipeline.
  • Valider endelig URL, responskropp, innholdstype, Markdown-struktur, lenketall og filstørrelse etter publisering.

Team bør også sette forventninger med forsiktighet. De tilgjengelige offentlige eksperimentene beviser ikke at llms.txt alene øker AI-henvisningstrafikk. Hvis et team vil teste forretningspåvirkning, bør det spore LLM-henvisninger, siterte sider, bot-forespørsler, ferskhet i indekser og innholdsendringer samtidig. Et nyttig eksperiment ville sammenligne matchede sidegrupper, holde innholdsoppdateringer konstante der det er mulig, og skille ut plattformspesifikk trafikk som Perplexity, ChatGPT, Gemini, Claude og Bing/Copilot.

Begrensninger

Dette er et øyeblikksbilde basert på crawl, ikke en permanent sannhetskilde. Nettsteder kan legge til, fjerne eller endre llms.txt-filer når som helst. Noen domener kan blokkere automatiserte forespørsler eller oppføre seg annerledes avhengig av geografi, TLS-konfigurasjon, omdirigeringslogikk, user agent eller bot-mottiltak. Studien testet bare filer på rot-nivå og søkte ikke i underdomener eller ikke-standard stier.

Kvalitetsscoren og arketypene er forskningsverktøy, ikke offisielle samsvarsmerkelapper. Temaanalysen er nøkkelordbasert og bør leses som retningsgivende. Studien beviser ikke at noen spesifikk AI-plattform i dag leser, respekterer eller bruker llms.txt i produksjon.

Den eksterne trafikkdokumentasjonen som ble gjennomgått i denne versjonen har også begrensninger. Search Engine Lands analyse er sterkere som en forsiktig observasjon på tvers av flere nettsteder enn som et randomisert eksperiment. Alimbekovs resultat er nyttig som en åpen og tydelig case-studie på sidenivå, men det mangler en kontrollgruppe og inkluderer en periode der total henvisningstrafikk økte betydelig. Disse referansene hjelper med å ramme inn debatten, men de gjør ikke denne crawlen til en kausal trafikkstudie.

Filer og reproduksjon

FilFormål
crawl_llms_txt.pyCrawler for /llms.txt og /llms-full.txt.
analyze_llms_txt.pyPrimæranalyse av adopsjon og generering av diagrammer.
deep_analyze_llms_txt.pySekundæranalyse for rang-desiler, TLD-er, temasignaler, kvalitetsscorer, arketyper og oppførsel med to filer.
deep_dive_early_quality.pyKlassifisering av tidlige aktører og dypdykk i implementeringskvalitet.
data/llms_probe_results_top_10000.csvHoveddatasettet med crawl-resultater.
data/deep_analysis_top_10000.jsonSammendrag av sekundæranalysen.
data/deep_early_quality_analysis.jsonKategorier for tidlige aktører, sammenligning av kvalitetskohorter, arketypedetaljer og case-studier.

Kilder

Korrigeringer av metodikk, datasettproblemer og oppfølgingsanalyser mottas gjerne på support@thunderbit.com. Denne rapporten er publisert uavhengig av enhver kommersiell posisjon Thunderbit måtte ha. Dataene i denne rapporten står på egne ben. — Thunderbit-forskningsteamet, mai 2026.

Prøv Thunderbit for å skrape og analysere webdata Get Started Free

Shuai Guan
Shuai Guan
CEO i Thunderbit | Ekspert på AI-drevet dataautomatisering Shuai Guan er CEO i Thunderbit og utdannet ingeniør fra University of Michigan. Med nærmere ti års erfaring innen teknologi og SaaS-arkitektur, spesialiserer han seg på å gjøre avanserte AI-modeller om til praktiske verktøy for datauttrekk uten koding. På denne bloggen deler han ærlige, velprøvde innsikter om webskraping og automatiseringsstrategier som hjelper deg å bygge smartere, datadrevne arbeidsflyter. Når han ikke optimaliserer dataflyt, bruker han det samme skarpe blikket for detaljer i sin lidenskap for fotografi.

Prøv Thunderbit

Hent leads og andre data med bare 2 klikk. Drevet av AI.

Få Thunderbit Det er gratis
Hent data med AI
Overfør enkelt data til Google Sheets, Airtable eller Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week