Et crawl-baseret studie af, hvordan websites med høj trafik udgiver maskinlæsbar vejledning til store sprogmodeller, hvordan tidlige implementeringer ser ud, og hvorfor man skal mere end bare tælle HTTP 200-svar for at måle udbredelsen.
- Datasæt:
data/llms_probe_results_top_10000.csv - Tranco-liste downloadet: 6. maj 2026
- Omfang:
/llms.txtog/llms-full.txtpå rodeniveau
Nøgletal

- 5,86 %: Gyldig adoption af
llms.txtpå tværs af Tranco Top 10.000, svarende til 586 domæner. - 1,03 %: Gyldig adoption af
llms-full.txt, svarende til 103 domæner. Hver gyldig full-file-adopter havde også en gyldig indeksfil. - 63,51 %: Andel af HTTP 200-svar for
/llms.txt, som ikke bestod valideringen. - 2,74x: Omtrentligt overestimat, hvis adoption kun blev målt ud fra rå HTTP 200-svar.
Resumé
llms.txt er stadig en tidlig webkonvention, men det er ikke længere et nicheeksperiment. I et crawl den 6. maj 2026 af Tranco Top 10.000-domæner fandt dette studie 586 gyldige llms.txt-filer, hvilket svarer til en observeret adoption på 5,86 %. Den tilhørende fil llms-full.txt var langt sjældnere: 103 domæner havde en gyldig full file, svarende til en adoption på 1,03 %.
Det vigtigste metodiske fund er, at statuskoder er et dårligt mål for adoption. Crawleren observerede 1.606 HTTP 200-svar for /llms.txt, men kun 586 bestod valideringen. De resterende 1.020 var for det meste omdirigeringer til forkerte sider, generiske HTML-sider, tomme bodies eller andre ugyldige svar. En naiv crawler, der tæller hvert 200-svar som adoption, ville overvurdere den reelle adoption med omkring 2,74 gange.
Blandt de gyldige brugere er implementeringskvaliteten højere, end en ren placeholder-fortælling antyder. Medianfilen var omkring 7,1 KB, 61,77 % af de gyldige filer var større end 5 KB, 70,82 % indeholdt seks eller flere Markdown-sektioner, og 77,47 % indeholdt 11 eller flere Markdown-links. De tidlige adopters omfatter Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog og Cloudinary.
llms.txtbør bedst forstås som et forklarende og navigationsmæssigt signal til AI-systemer, ikke som en erstatning forrobots.txt. Værdien ligger ikke blot i, at filen findes, men i om den hjælper maskiner med at finde autoritativ, kompakt og aktuel information.
Kontekst: Webben tilføjer AI-rettede signaler
Websites har længe brugt robots.txt til at udtrykke crawler-præferencer, sitemap.xml til at forbedre URL-opdagelse og strukturerede data til at hjælpe søge- og platformssystemer med at fortolke sider. Generativ AI introducerer et andet problem. Indhold kan bruges til træning, retrieval, opsummering, agentisk browsing, kodeassistance, kundesupport og generering af svar. Det skaber to samtidige behov: udgivere vil have mere kontrol over automatiseret brug, men de vil også have, at AI-systemer finder den rigtige kanoniske information, når systemerne faktisk interagerer med deres sites.
Det oprindelige llms.txt-forslag, introduceret af Jeremy Howard i 2024, beskriver filen som et Markdown-dokument placeret i roden af et website for at give LLM-venlig information ved inference-tid. Forslaget argumenterer for, at HTML-sider ofte indeholder navigation, annoncer, scripts og anden støj, som gør dem sværere for sprogmodeller at behandle. En kortfattet Markdown-fil kan pege modeller mod de vigtigste sider, docs, APIs, eksempler, politikker og produktinformation.
Ekstern webforskning giver den bredere baggrund. Data Provenance Initiatives “Consent in Crisis” beskriver en hurtig stigning i AI-relaterede restriktioner i robots.txt og vilkår, og argumenterer for, at eksisterende websamtykkemekanismer ikke blev designet til AI-genbrug af data i stor skala. Cloudflare Radar AI Insights har også gjort mønstre for AI-crawlere og robots.txt synlige på niveauet for Top 10.000-domæner. I det landskab ligger llms.txt på den konstruktive side af AI-signalering: ikke “crawl ikke dette”, men “hvis du skal forstå dette site, så start her”.
Ekstern dokumentation og debatten om adoption
Den offentlige debat om llms.txt er delt mellem to påstande. Den optimistiske påstand er, at filen giver AI-systemer en renere og mere effektiv vej til autoritativt indhold. Den skeptiske påstand er, at ingen større LLM-udbyder offentligt har forpligtet sig til at bruge den som signal for rangering, crawling eller citation, så udgivere bør ikke forvente trafikgevinst alene af filen. De tre eksterne referencer, der er gennemgået til denne opdatering, peger på en mere nuanceret konklusion: llms.txt er nyttig infrastruktur, men evidensen for direkte trafikpåvirkning er stadig begrænset og kontekstafhængig.
Eksterne benchmarks for adoption bevæger sig hurtigt
Rankabilitys adoption tracker rapporterede en adoption på 0,3 % på tværs af de 1.000 største websites pr. 22. juni 2025, eller 3 ud af 1.000 sites. Den beskriver månedlig automatiseret scanning af domain.com/llms.txt, med validering, der udelukker redirects og HTML-svar. Den metode ligner retningen i dette studies mere konservative validering.
Forskellen i resultater er stor: Dette studie fandt 75 gyldige llms.txt-filer i Tranco Top 1.000 den 6. maj 2026, svarende til 7,50 %. De to tal bør ikke behandles som en streng tidsserie, fordi rangkilden, implementeringsdetaljerne, valideringslogikken og crawl-tidspunktet kan være forskellige. Alligevel antyder kontrasten, at adoptionen ændrede sig markant mellem midten af 2025 og maj 2026, især blandt udvikler-, SaaS-, cloud-, sikkerheds- og dokumentationstunge sites.
| Kilde | Snapshot | Sample | Rapporteret gyldig adoption | Fortolkning |
|---|---|---|---|---|
| Rankability | 22. juni 2025 | Top 1.000 websites | 0,3 % | Tidligt offentligt benchmark, der viser minimal adoption i midten af 2025. |
| Dette studie | 6. maj 2026 | Tranco Top 1.000 | 7,50 % | Senere crawl, der viser tydelig adoption blandt sites med høj trafik. |
| Dette studie | 6. maj 2026 | Tranco Top 10.000 | 5,86 % | Bredere sample, der viser, at adoption kan måles, men endnu ikke er mainstream. |
Trafikeksperimenter er stadig blandede
Search Engine Land udgav i januar 2026 en analyse af 10 sites, hvor de blev fulgt i 90 dage før og 90 dage efter implementeringen. Artiklen rapporterede, at to sites så stigninger i AI-trafik på 12,5 % og 25 %, otte så ingen målbar forbedring, og et faldt med 19,7 %. Den vigtigste fortolkning var metodisk forsigtighed: De to tilsyneladende succeser lancerede også nye templates, genopbyggede ressourcecentre, tilføjede udtrækkelige sammenligningstabeller, fik presseomtale, løste tekniske problemer eller publicerede nyt FAQ-lignende indhold. I den ramme dokumenterede llms.txt stærkere indhold og teknisk arbejde; det så ikke ud til i sig selv at have forårsaget væksten.
Renat Alimbekovs personlige blogeksperiment nåede en mere positiv konklusion ud fra en mindre observation på sideniveau. Han sammenlignede to firemånedersperioder i Yandex.Metrica efter tilføjelsen af både llms.txt og llms-full.txt. LLM-henvisningssessioner steg fra 75 til 92, en stigning på 23 %, mens brugere steg fra 51 til 64. Perplexity-sessioner steg fra 29 til 55, mens ChatGPT-sessioner faldt fra 31 til 26. Det samme opslag bemærker også, at den samlede henvisningstrafik voksede hurtigere, fra 160 til 290 sessioner, så andelen af LLM-sessioner faldt fra 47 % til 32 %.
| Type evidens | Observeret resultat | Vigtig forbehold | Hvordan det påvirker denne rapport |
|---|---|---|---|
| Search Engine Land 10-sites før/efter-studie | To sites steg, otte havde ingen målbar ændring, ét faldt. | Positive cases havde samtidige ændringer i indhold, PR og teknik. | Understøtter at se llms.txt som infrastruktur, ikke som en selvstændig vækstmotor. |
| Alimbekovs observation af personlig blog før/efter | LLM-henvisningssessioner steg 23 % i efterperioden. | Ingen kontrolgruppe; den samlede henvisningstrafik steg 81 %, og LLM-andelen faldt. | Peger på mulig upside for tekniske blogs, især via Perplexity, men kausaliteten er ikke isoleret. |
| Dette crawl-baserede adoptionstudie | 586 gyldige filer og mange strukturerede implementeringer. | Måler tilstedeværelse og struktur, ikke downstream trafikpåvirkning. | Viser adoption og implementeringsmodenhed, men ikke ROI i sig selv. |
Hvad debatten gør klart
Den eksterne evidens skærper fortolkningen af dette datasæt. En velstruktureret llms.txt-fil kan reducere friktion i maskinparsing, især for udviklerdokumentation, API-referencer og knowledge-base-indhold. Men de stærkeste trafikcases ser stadig ud til at afhænge af indhold, der er nyttigt, udtrækkeligt, autoritativt og kan opdages uden for filen. Derfor er det praktiske spørgsmål ikke isoleret “betyder llms.txt noget?”. Det er, om filen er en del af et bredere AI-læsbart indholdssystem.
Opdateret fortolkning:
llms.txtbør implementeres som billig AI-rettet infrastruktur. Den bør ikke positioneres som en erstatning for bedre dokumentation, struktureret indhold, teknisk tilgængelighed, henvisninger, links eller brandautoritet.
Prøv Thunderbit til AI-webscraping
Metode
Dette studie brugte Tranco Top 10.000-domæner som sample. Tranco er en forskningsorienteret top-site-rangering, der er designet til at være mere stabil og manipulationsresistent end mange traditionelle top-lister. Tranco-kildefilen blev downloadet den 6. maj 2026 med et Last-Modified-tidsstempel på kilden fra 5. maj 2026 kl. 22:17:59 GMT.
Crawleren testede to stier på rodeniveau for hvert domæne:
https://example.com/llms.txt, med HTTP-fallback når nødvendigt.https://example.com/llms-full.txt, med HTTP-fallback når nødvendigt.
For hver probe registrerede crawleren statuskode, endelig URL, hentemetode, responsbytes, content type, fejlmeddelelse, forløbet tid og valideringsresultat. Succesfulde svarbodies blev gemt under raw_llms_txt/ til gennemgang og sekundær analyse.
Valideringsregler
Et svar blev kun talt som en gyldig fil, hvis det returnerede en succesfuld body og ikke lignede et generisk web-fallback. Den endelige URL-sti skulle forblive /llms.txt eller /llms-full.txt. Tomme bodies blev afvist. Tydelige HTML-dokumenter og app shells blev afvist. Content type blev betragtet som understøttende evidens snarere end som den eneste regel, fordi et lille antal gyldige tekstlignende filer blev serveret med usædvanlige content types.
Adoptionslandskab
Crawlet fandt 586 gyldige llms.txt-filer i Tranco Top 10.000. Det giver en gyldig adoption på 5,86 %. Den mindre tilhørende fil llms-full.txt var til stede og gyldig på 103 domæner, eller 1,03 % af samplet.
| Metrik | Antal | Andel af Top 10.000 |
|---|---|---|
| Crawlede domæner | 10.000 | 100,00 % |
Gyldige llms.txt-filer | 586 | 5,86 % |
Gyldige llms-full.txt-filer | 103 | 1,03 % |
| HTTP 200-svar for /llms.txt | 1.606 | 16,06 % |
| HTTP 200-svar afvist som ugyldige | 1.020 | 10,20 % |
Adoption er ikke kun top-tung
Adoptionen var højere i Top 1.000 end i hele Top 10.000, men den var ikke begrænset til de allerstørste sites. Adoptionsraten i Top 1.000 var 7,50 %. Den sidste bucket på 1.000 domæner, rang 9.001-10.000, faldt til 3,80 %. Midten af ranglisten var stadig aktiv: Bucketsne 2.001-3.000, 3.001-4.000, 5.001-6.000 og 6.001-7.000 lå alle omkring 6 %.

Tidlige adopters
Den højest rangerede gyldige adopter var Cloudflare på Tranco-rang 4. Andre højt rangerede adopters omfattede Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink og OneSignal.
Disse adopters er ikke tilfældige. De har typisk store dokumentationsflader, produktlinjer der kræver forklaring, APIs eller udviklerøkosystemer, supportindhold, prissider, sikkerheds- og privatlivsmateriale samt nok brandautoritet til at være optagede af, hvordan AI-systemer fortolker deres sites.
| Rang | Domæne | Filstørrelse | Observeret mønster |
|---|---|---|---|
| 4 | cloudflare.com | 4.225 B | Kompakt indeks over produkt-, udvikler-, virksomheds- og prisinformation. |
| 26 | azure.com | 47.037 B | Udviklerværktøjer, AI, compute, storage, sikkerhed, overvågning og valgfrie ressourcer. |
| 28 | github.com | 27.108 B | Programmatisk adgang, Copilot, MCP, REST API, Actions, repositories og CLI-links. |
| 248 | stripe.com | 64.229 B | Betalinger, Connect, Checkout, Billing, Tax, Atlas, Radar og udviklerdokumentation. |
| 265 | salesforce.com | 1,02 MB | Massivt produkt- og Agentforce-linkkatalog uden Markdown-sektionsoverskrifter. |
Adopterkategorier i Top 1.000
Dette studie klassificerede de 75 gyldige adopters i Tranco Top 1.000 ved hjælp af domænekontekst, de første overskrifter, rå filstruktur og indholdskeywords. Den største gruppe var marketing, media og adtech med 22,67 %. Cloud-, udvikler- og infrastruktursites udgjorde 20,00 %. SaaS-, produktivitets- og customer-operations-sites udgjorde 17,33 %. Sikkerheds-, identitets- og privacy-sites udgjorde 12,00 %.

| Kategori | Domæner | Andel af Top 1.000 adopters | Median kvalitetsscore | Median links |
|---|---|---|---|---|
| Marketing, media & adtech | 17 | 22,67 % | 94 | 25 |
| Cloud, dev & infrastructure | 15 | 20,00 % | 94 | 62 |
| SaaS, productivity & customer ops | 13 | 17,33 % | 94 | 46 |
| Security, identity & privacy | 9 | 12,00 % | 98 | 78 |
| CMS, hosting & web presence | 7 | 9,33 % | 100 | 24 |
Mønstre for TLD'er
Top-level-domæner er ikke brancheetiketter, men de er nyttige som retningsmæssige signaler. Blandt TLD'er med mindst 50 domæner i samplet havde .io den højeste gyldige adoption på 14,44 %. .com fulgte efter med 8,19 %. Lavere adoption blandt .gov, .edu og .net tyder på, at den tidlige adopterbase er mere kommerciel og teknisk end institutionel.
Implementeringskvalitet
Gyldig adoption betyder ikke ensartet implementeringskvalitet. Nogle filer er korte, velstrukturerede indeks. Nogle er mest prosa. Nogle er rå linkkataloger. Nogle er næsten tomme placeholders. Nogle er content dumps på flere megabyte, som måske er komplette, men dyre at hente og parse.
Blandt gyldige llms.txt-filer var 362 større end 5 KB, svarende til 61,77 % af de gyldige adopters. Medianfilstørrelsen var omkring 7,1 KB. P90-filstørrelsen var 156 KB, P95 var 356 KB, P99 var 2,54 MB, og den største observerede fil var 7,97 MB.
Almindelige indholdssignaler
En keyword-scanning på filniveau af gyldige filer viste, at mange sites ikke blot udgiver en erklæring; de peger modeller mod operationelt nyttigt materiale. Termer for support eller hjælp optrådte i 70,31 % af de gyldige filer. Blog-, guide- eller tutorial-termer optrådte i 67,92 %. Sikkerhed, privacy, compliance eller vilkår optrådte i 61,43 %. Prissætning optrådte i 53,92 %, dokumentation i 52,22 %, API-termer i 33,96 %, og changelog- eller release-signaler i 27,30 %.
Kvalitetsscore og arketyper
For at gå fra tilstedeværelse til modenhed skabte dette studie en letvægts-score for implementering. Scoren tager højde for content type, filstørrelse, Markdown-struktur, linkantal, emnedækning og advarselstegn såsom manglende overskrifter, ingen Markdown-links, usædvanlige content types, meget små filer, meget store filer og link-dump-adfærd. Dette er ikke en formel standard. Det er en forskningsscore til sammenligning af observerede implementeringer.
Med denne model blev 416 gyldige filer klassificeret som stærke strukturerede indeks, 107 som brugbare indeks, 24 som tynde eller uregelmæssige og 39 som symbolske eller med lav nytteværdi. En separat arketypeanalyse fandt 296 strukturerede indeks, 113 sektionerede tekstfiler, 63 linkkataloger, 52 tynde indeks, 50 symbolske eller placeholder-filer og 12 massive content dumps.

| Arketype | Domæner | Andel af gyldige filer | Median score | Median filstørrelse | Median links |
|---|---|---|---|---|---|
| Struktureret indeks | 296 | 50,51 % | 98 | 11.241 B | 61,5 |
| Sektioneret tekst | 113 | 19,28 % | 78 | 4.718 B | 0 |
| Linkkatalog | 63 | 10,75 % | 86 | 4.160 B | 23 |
| Tyndt indeks | 52 | 8,87 % | 66 | 2.814 B | 0 |
| Symbolsk eller placeholder | 50 | 8,53 % | 27 | 15 B | 0 |
| Massivt content dump | 12 | 2,05 % | 74 | 2,84 MB | 7.259,5 |
Topadopters har tættere implementeringer

De 75 gyldige adopters i Tranco Top 1.000 havde en median kvalitetsscore på 96, median filstørrelse på 9.068 bytes, median antal Markdown-links på 52 og median antal sektioner på 11. De 511 adopters rangeret 1.001-10.000 havde lavere medianer: score 90, filstørrelse 6.506 bytes, 23 Markdown-links og 9 sektioner. Top 1.000-adopters var også oftere strukturerede indeks: 69,33 % mod 47,75 % i den senere kohorte.
Problemet med falske positive

Den største målerisiko er falske positive. Af de 1.606 domæner, der returnerede HTTP 200 for /llms.txt, fejlede 1.020 valideringen. Den mest almindelige ugyldige årsag var omdirigering til en forkert side, med 618 tilfælde. Yderligere 367 svar var generiske HTML-dokumenter. 29 returnerede en tom body, og seks var andre eller ukategoriserede ugyldige svar.
Det betyder noget, fordi mange store sites sender ukendte paths videre til login-sider, forsider, app shells, regionale sider, samtykkesider eller marketing-fallbacks. Disse svar kan se sunde ud for en statuskode-crawler, men indeholder intet gyldigt llms.txt-signal.
llms-full.txt: Sjældnere og mere ujævn
Den tilhørende fil llms-full.txt var langt mindre almindelig end llms.txt. Crawlet fandt 103 gyldige full files, svarende til 17,58 % af de gyldige llms.txt-adopters og 1,03 % af hele Top 10.000-samplet.
Implementeringerne af full-file var ujævne. Blandt de 103 dobbeltfil-adopters havde 57 en llms-full.txt-fil, der var større end indeksfilen, men 46 havde enten en full file, der ikke var større end indeksfilen, eller en full file under 100 bytes. Medianforholdet mellem full og index-størrelse var 1,43, men ekstreme tilfælde var meget højere. Supabase's full file var omkring 7.139 gange så stor som dens indeksfil. Made-in-China.com havde en full file på 89,89 MB.
| Domæne | llms.txt | llms-full.txt | Forhold |
|---|---|---|---|
| made-in-china.com | 4,49 MB | 89,89 MB | 20,0x |
| sendbird.com | 281,86 KB | 11,99 MB | 42,5x |
| taboola.com | 286,78 KB | 11,73 MB | 40,9x |
| supabase.co | 1,26 KB | 8,98 MB | 7.139,3x |
| neon.tech | 27,44 KB | 5,01 MB | 182,7x |
Anbefaling: udgiv kun
llms-full.txt, når sitet allerede har en stabil dokumentationspipeline, versionsdisciplin og en klar grund til at eksponere store mængder indhold i en enkelt maskinlæsbar fil.
llms.txt, robots.txt og sitemap.xml
llms.txt bør ikke behandles som en ny robots.txt. De er begge maskinlæsbare filer på rodeniveau, men de kommunikerer forskellige ting. robots.txt er et signal om crawler-præferencer og adgangskontrol. sitemap.xml er et signal om URL-opdagelse. llms.txt er et forklarende og navigationsmæssigt signal.
| Signal | Primær rolle | Typisk læser | Fortolkning i dette studie |
|---|---|---|---|
robots.txt | Angiv crawler-præferencer og restriktioner på stiniveau. | Søgecrawlere, AI-crawlere, arkiveringscrawlere, generiske bots. | Governance- og adgangssignal. |
sitemap.xml | Liste over opdagelige URLs til indekseringssystemer. | Søgemaskiner og indekseringspipelines. | Opdagelsessignal. |
llms.txt | Giv kortfattet site-kontekst, vigtige links, docs, APIs, eksempler og politikreferencer. | LLM-applikationer, AI-agenter, udviklerværktøjer, retrieval-systemer. | Forklarings- og navigationssignal. |
Anbefalinger
For sites, der overvejer llms.txt, peger de stærkeste implementeringer i dette datasæt og den eksterne trafik-evidens på et pragmatisk mønster:
- Udgiv
/llms.txti roden, og sørg for, at det er tilgængeligt uden login, JavaScript-eksekvering, consent walls eller omdirigeringer væk fra stien. - Server det som
text/plainellertext/markdown, når det er muligt. - Start med en kort beskrivelse af sitet, og grupper derefter links efter produkt, dokumentation, API, prissætning, changelog, eksempler, support, politikker og virksomhedsressourcer.
- Foretræk kanoniske links frem for udtømmende URL-lister.
- Undgå tomme symbolske filer; de er højst et svagt signal.
- Undgå massive udifferentierede dumps, medmindre der er et stærkt use case for maskinforbrug og en pålidelig genereringspipeline.
- Valider endelig URL, responsbody, content type, Markdown-struktur, linkantal og filstørrelse efter publicering.
Teams bør også sætte forventningerne omhyggeligt. De tilgængelige offentlige eksperimenter beviser ikke, at llms.txt i sig selv øger AI-henvisningstrafik. Hvis et team vil teste forretningseffekten, bør det spore LLM-henvisninger, citerede sider, bot-requests, indeks-friskhed og indholdsændringer samlet. Et nyttigt eksperiment ville sammenligne matchede sidegrupper, holde indholdsopdateringer konstante hvor det er muligt og adskille platformspecifik trafik som Perplexity, ChatGPT, Gemini, Claude og Bing/Copilot.
Begrænsninger
Dette er et crawl-baseret snapshot, ikke en permanent sandhed. Websites kan tilføje, fjerne eller ændre llms.txt-filer når som helst. Nogle domæner kan blokere automatiserede forespørgsler eller opføre sig forskelligt afhængigt af geografi, TLS-konfiguration, omdirigeringslogik, user agent eller bot-beskyttelse. Studiet testede kun filer på rodeniveau og søgte ikke efter underdomæner eller ikke-standard stier.
Kvalitetsscoren og arketyperne er forskningsværktøjer, ikke officielle compliance-etiketter. Emneanalysen er keyword-baseret og bør læses som retningsgivende. Studiet beviser ikke, at nogen specifik AI-platform i øjeblikket læser, respekterer eller bruger llms.txt i produktion.
Den eksterne trafik-evidens, der er gennemgået i denne version, har også begrænsninger. Search Engine Lands analyse er stærkere som en forsigtig observation på tværs af flere sites end som et randomiseret eksperiment. Alimbekovs resultat er nyttigt som et transparent case study på sideniveau, men det mangler en kontrolgruppe og omfatter en periode, hvor den samlede henvisningstrafik steg markant. Disse referencer hjælper med at rammesætte debatten, men de gør ikke dette crawl til et kausalt trafikstudie.
Filer og reproducerbarhed
| Fil | Formål |
|---|---|
crawl_llms_txt.py | Crawler til /llms.txt og /llms-full.txt. |
analyze_llms_txt.py | Primær adoptionsanalyse og generering af diagrammer. |
deep_analyze_llms_txt.py | Sekundæranalyse af rangdeciler, TLD'er, topicsignaler, kvalitetsscorer, arketyper og dobbeltfil-adfærd. |
deep_dive_early_quality.py | Klassificering af tidlige adopters og dybdegående analyse af implementeringskvalitet. |
data/llms_probe_results_top_10000.csv | Primært crawl-resultatdatasæt. |
data/deep_analysis_top_10000.json | Sammenfatning af sekundæranalyse. |
data/deep_early_quality_analysis.json | Kategorier for tidlige adopters, sammenligning af kvalitetskohorter, arketyper og cases. |
Kilder
- The /llms.txt file, Jeremy Howard, 2024.
- HTTP Archive Web Almanac 2024 Methodology.
- Cloudflare Radar: Expanded AI insights.
- Cloudflare Radar AI Insights.
- Consent in Crisis: The Rapid Decline of the AI Data Commons, Data Provenance Initiative.
- Tranco: A Research-Oriented Top Sites Ranking Hardened Against Manipulation.
- Does llms.txt matter?, Search Engine Land, januar 2026.
- The State of llms.txt Adoption, Rankability, juni 2025.
- How LLMS.txt Increased AI Chat Traffic by 23%, Renat Alimbekov.
Rettelser til metode, datasætproblemer og opfølgende analyser er velkomne på support@thunderbit.com. Denne rapport er udgivet uafhængigt af enhver kommerciel position, Thunderbit måtte have. Dataene i denne rapport står på egne ben. — Thunderbit research-teamet, maj 2026.
Prøv Thunderbit til at scrape og analysere webdata Get Started Free


