Executive Summary
Den tidligere rapport stillede et policy-spørgsmål: hvor mange af verdens mest besøgte websites fortæller AI-crawlere, hvad de må og ikke må?
Denne opfølger stiller det operationelle spørgsmål bagved: hvor pålidelig er robots.txt som den infrastruktur, der nu forventes at bære den policy?
Svaret er ubehageligt. robots.txt virker stadig, fordi den er offentlig, billig, maskinlæsbar og allerede forstået af crawlere. Men den bliver også bedt om at gøre langt mere, end den er bygget til. I 2026 kan den samme simple tekstfil indeholde SEO-crawlkontroller, sitemap-indekser, ældre søgemaskine-udvidelser, AI-træningsfravalg, Cloudflare-injiceret policy-ordforråd, ophavsretsforbehold og juridisk sprog målrettet fremtidige tvister.
Det er konfigurationsgæld.
Datasættet bag denne rapport er det samme Tranco Top 10,000-crawl, som blev brugt i den oprindelige AI-crawlerundersøgelse. Ud af de 10.000 domæner returnerede 6.638 en læsbar robots.txt; yderligere 610 returnerede 404, hvilket efter protokollen behandles som et implicit tillad. Det giver 7.248 analyserbare sites til bot-adgangsbeslutninger og 6.638 konkrete filer til analyse af konfigurationskompleksitet.
Seks fund skiller sig ud:
-
De fleste
robots.txt-filer er små, men højre halen er ekstremt kompleks. Medianfilen er kun 834 bytes og 31 linjer. Men 1.005 filer er på mindst 5 KB, 273 er på mindst 20 KB, og 28 er på mindst 100 KB. Den største fil i stikprøven er 248 KB. -
Hundredvis af store websites kører filer, der ligner produktionskonfiguration mere end policy-noter. Medianfilen har 9
Disallow-direktiver. Men 707 sites har mindst 100Disallow-regler, 13 har mindst 1.000, 240 nævner mindst 50 user agents, og 110 nævner mindst 100 user agents. -
Protokoldrift er ikke teoretisk. Blandt de 6.638 læsbare filer indeholder 685
Crawl-delay, 303 indeholderHost, 200 indeholderClean-param, 9 indeholderRequest-rate, 5 indeholderVisit-time, og 271 indeholder Cloudflare-lignendeContent-Signal-sprog. Det er ikke alt sammen en del af den samme rene standard. Det er opsamlet crawler-folklore. -
Googlebot behandles som en særligt privilegeret aktør. 562 analyserbare domæner blokerer mindst én traditionel søgecrawler. I 404 af de tilfælde er Googlebot tilladt, mens mindst én anden søgecrawler er blokeret. Diskrimination mod AI-crawlere opstod ikke i et neutralt økosystem;
robots.txthavde allerede kodet en søgemaskine-hierarki. -
AI-policy gør gælden mere synlig. 1.377 læsbare filer indeholder AI-policy-sprog; 719 indeholder ophavsret, vilkår, licens eller tilladelsessprog; og 501 indeholder begge dele. Filen er blevet både maskininterface og juridisk artefakt. Det er nyttigt, men skrøbeligt.
-
De mest risikable filer er ikke altid de mest anti-AI-filer. E-handel, rejser, sociale medier, finans, akademia og nyheder producerer alle komplekse filer af forskellige grunde: styring af crawlbudget, ældre stier, brugergenereret indhold, rettighedsforbehold og bot-specifikke undtagelser. AI-regler bliver lagt oven på et allerede rodet fundament.
Hovedkonklusionen: robots.txt er stadig den offentlige webs vigtigste overflade for crawler-policy, men den er et svagt fundament for højrisiko AI-governance, medmindre økosystemet standardiserer crawler-identitet, AI-brugsordforråd og policy-auditabilitet.
Metodologi
Denne rapport genbruger datasættet fra den oprindelige Thunderbit-analyse af AI-crawlerpolitik på Tranco Top 10,000-domænerne.
Inputmaterialet var:
tranco_top10k.csv— den oprindelige Tranco Top 10K-domæneliste.out/fetch_meta.csv— fetch-status, byteantal, scheme, redirect-resultat og fejlmetadata.out/sites.csv— domæne, rang, kategori, sprog ogrobots.txt-status.out/site_meta.csv— én analytisk række pr. site, inklusive skabelonklasse, AI-blokeringsflag, filstørrelse og felter med bot-policy-sammendrag.out/bot_status.csv— én række pr. domæne og crawler, inklusive om botten er blokeret, og om en specifik regel findes.raw_robots/— cachelagrederobots.txt-tekster for de 6.638 sites, der returnerede status200.
Til denne opfølger blev hver læsbar robots.txt-fil scannet for:
- filstørrelse og linjeantal;
- aktive linjer uden kommentarer;
- antal
User-agent-,Disallow-,Allow- ogSitemap-direktiver; - ældre eller ikke-kerne direktiver som
Crawl-delay,Host,Clean-param,Request-rateogVisit-time; - AI-æra-ordforråd, herunder
Content-Signal,llms.txt, AI, LLM, machine learning, TDM og2019/790; - juridisk ordforråd som copyright, terms of service, licens, tilladelse og rettighedsforbehold;
- behandling af søgecrawlere som Googlebot, Bingbot, DuckDuckBot, Slurp, Baiduspider og YandexBot.
Rapporten definerer også en enkel konfigurationsgældsscore til prioritering. Den kombinerer filstørrelse, antal user agents, antal Disallow, antal Allow, antal ikke-standarddirektiver og blandingen af AI-policy- og juridisk sprog. Scoren er ikke ment som et universelt mål for korrekthed. Den er en måde at identificere filer, som sandsynligvis bliver svære at vedligeholde, gennemgå eller ræsonnere om.
Alle afledte tabeller og diagrammer er inkluderet i leveringsmappen.
Fund 1: Medianfilen er enkel; halen er det ikke
Den typiske robots.txt-fil på det store web er stadig lille.

På tværs af de 6.638 læsbare filer:
| Måling | Median | P90 | P95 | P99 | Maks |
|---|---|---|---|---|---|
| Filstørrelse | 834 bytes | 6,7 KB | 15,8 KB | 76,0 KB | 248,3 KB |
| Linjer | 31 | 238 | 332 | 1.008 | 4.998 |
| Aktive linjer | 23 | 198 | 282 | 837 | 4.998 |
User-agent-direktiver | 1 | 21 | 39 | 137 | 823 |
Disallow-direktiver | 9 | 103 | 176 | 422 | 4.997 |
Allow-direktiver | 1 | 17 | 33 | 69 | 890 |
Denne fordeling betyder noget, fordi robots.txt ofte omtales, som om den var en lille erklæring:
User-agent: *
Disallow: /private/
Den mentale model er forkert for en betydelig minoritet af det mest besøgte web.
I dette datasæt:

| Kompleksitetstærskel | Sites |
|---|---|
robots.txt større end eller lig med 5 KB | 1.005 |
| Større end eller lig med 20 KB | 273 |
| Større end eller lig med 100 KB | 28 |
Mindst 50 User-agent-direktiver | 240 |
Mindst 100 User-agent-direktiver | 110 |
Mindst 100 Disallow-direktiver | 707 |
Mindst 1.000 Disallow-direktiver | 13 |
Mindst 100 Allow-direktiver | 40 |
De største og mest komplekse filer er ikke akademiske kuriositeter. De tilhører virkelige, meget trafikerede properties:
| Domæne | Rang | Kategori | Bytes | User-agent | Disallow | Allow |
|---|---|---|---|---|---|---|
linkedin.com | 17 | social | 114.341 | 76 | 4.184 | 281 |
runescape.com | 5.226 | unknown | 113.393 | 1 | 4.997 | 0 |
academia.edu | 832 | academia | 57.384 | 63 | 2.044 | 227 |
etsy.com | 286 | ecommerce | 51.320 | 3 | 1.621 | 120 |
thepaper.cn | 9.395 | news | 56.867 | 1 | 1.496 | 0 |
opentable.com | 4.137 | unknown | 70.494 | 32 | 1.683 | 176 |
alfabank.ru | 2.625 | finance | 73.158 | 2 | 1.566 | 133 |
Disse filer ligner mere produktions-routingtabeller end policy-slogans. De koder års produktlanceringer, ældre stier, blokerede parameter-mønstre, crawler-undtagelser, SEO-eksperimenter, CDN-beslutninger og nu AI-crawlerregler.
Halen er ikke kun en AI-historie. Ud af de 273 filer på eller over 20 KB indeholder 131 AI-policy-sprog, og 142 gør ikke. Ud af de 707 filer med mindst 100 Disallow-direktiver indeholder kun 207 AI-policy-sprog. Med andre ord skabte AI ikke problemet med store filer. Det kom senere, efter at års almindelig webdrift allerede havde fyldt filen med stiregler, sitemap-referencer og crawler-undtagelser.
Det er vigtigt, fordi vedligeholdelse afhænger af form, ikke kun af intention. En lille fil med en direkte AI-blok kan være let at auditere. En 70 KB e-handels- eller rejsefil kan være svær at auditere, selv hvis den intet siger om AI. Risikoen er ikke, at enhver stor fil er forkert. Risikoen er, at den faktiske policy bliver for svær for de ansvarlige at verificere.
Den operationelle risiko er ligetil: efterhånden som robots.txt vokser, bliver det sværere for en publisher, platformingeniør, jurist eller SEO-leder at besvare det grundlæggende spørgsmål: hvad tillader denne fil egentlig?
Det spørgsmål er ikke længere trivielt. Under RFC-lignende parsing kan en crawler matche en mere specifik user-agent-gruppe i stedet for User-agent: *; længere sti-matches kan tilsidesætte kortere; Allow- og Disallow-direktiver påvirker hinanden efter prioritet; og generelle deny-all-regler kan utilsigtet fange nye crawlere, som ikke fandtes, da filen blev skrevet.
For en fil på 30 linjer kan et menneske godt ræsonnere sig frem til det. For en fil på 4.000 linjer med dusinvis af navngivne bots bør ingen forsøge.
Fund 2: robots.txt bærer mere end crawlregler
AI-crawlerdebatten gjorde robots.txt politisk synlig, men den underliggende fil havde allerede samlet ikke-relaterede opgaver op.
En moderne robots.txt på et stort site kan indeholde:
- kontrol af crawler-stier;
- sitemap-opdagelse;
- søgemaskinespecifikke udvidelser;
- hints om crawl-rate;
- hints om host-kanonisering;
- hints om oprydning i URL-parametre;
- CDN-injiceret policy-ordforråd;
- ophavsretsforbehold;
- fravalg af AI-træning;
- juridisk kommentar i almindeligt sprog.
Datasættet viser denne lagdeling tydeligt.
| Signal | Filer | Andel af læsbare filer |
|---|---|---|
Crawl-delay | 685 | 10,3% |
Host | 303 | 4,6% |
Clean-param | 200 | 3,0% |
Content-Signal | 271 | 4,1% |
Request-rate | 9 | 0,1% |
Visit-time | 5 | 0,1% |
Omtale af llms.txt | 83 | 1,3% |
| Copyright-, vilkårs-, licens- eller tilladelsessprog | 719 | 10,8% |
| AI-policy-sprog | 1.377 | 20,7% |
Nogle af disse direktiver er bredt anerkendt af bestemte crawlere. Nogle er ældre konventioner. Nogle er leverandørspecifikke. Nogle er slet ikke rigtige crawlerdirektiver, men juridisk eller produktmæssigt sprog indlejret i kommentarer.
Det er sådan protokoldrift ser ud.
Crawl-delay er et godt eksempel. Mange siteejere kender det, men understøttelsen er ujævn blandt store crawlere. Host og Clean-param har historisk været forbundet med Yandex-adfærd. Content-Signal er en del af Cloudflares AI-æra-policyordforråd. llms.txt er et foreslået, nært beslægtet discovery-format, ikke en universelt respekteret standard. Alligevel optræder alt dette i den samme type fil, ofte side om side med klassiske User-agent- og Disallow-regler.
Tallene viser også, hvordan gamle og nye konventioner nu sameksisterer. Crawl-delay optræder i 685 filer, mere end dobbelt så mange som de 271 filer med Content-Signal. Host optræder i 303 filer og Clean-param i 200, primært som udtryk for søgemaskine-æraens konventioner. llms.txt nævnes, trods megen diskussion i AI-search-miljøer, kun i 83 læsbare filer. Det levende web samler ikke ét ordforråd. Det stabler ordforråd.
Problemet er ikke, at en enkelt udvidelse er forkert. Problemet er, at filen er blevet en uversioneret beholder for flere overlappende governancesystemer.
Det skaber tre slags gæld:
- Semantisk gæld. Forskellige crawlere kan tolke den samme fil forskelligt.
- Ejer-gæld. SEO-, juridiske, infrastruktur-, sikkerheds- og produktteams kan alle have grunde til at redigere filen, men ingen enkelt team ejer måske hele policyen.
- Audit-gæld. Et site kan publicere en policy, der ser bevidst ud, mens kun en parser kan afgøre dens faktiske adfærd.
AI gør dette mere vigtigt, fordi indsatsen har ændret sig. Når et ældre hint om crawl-rate ignoreres, kan resultatet være ekstra trafik. Når et fravalg af AI-træning er tvetydigt, kan resultatet blive bevis i en ophavsretlig eller licensretlig tvist.
Fund 3: Filen er blevet både maskininterface og juridisk artefakt
Den oprindelige AI-crawlerrapport viste, at 17,0 % af de analyserbare sites havde skrevet eksplicitte AI-specifikke regler. Denne opfølger ser på den tekstmæssige byrde, disse policyer tilføjer.

Blandt de 6.638 læsbare robots.txt-filer:
- 1.377 indeholder AI-policy-sprog;
- 719 indeholder copyright-, vilkårs-, licens-, rettigheds- eller tilladelsessprog;
- 271 indeholder
Content-Signal; - 83 nævner
llms.txt.
Overlappet er dér, historien bliver mere interessant:

| Tekstligt mønster | Filer |
|---|---|
| AI-policy-sprog og juridisk/rettighedssprog | 501 |
| AI-policy-sprog uden juridisk/rettighedssprog | 876 |
| Juridisk/rettighedssprog uden AI-policy-sprog | 218 |
Content-Signal med juridisk/rettighedssprog | 242 |
| Eksplicit AI-blokering med juridisk/rettighedssprog | 424 |
Det er en ny type fil.
En traditionel robots.txt-fil er henvendt til crawlere. En robots.txt-fil med juridisk forord er henvendt til mindst fire målgrupper på én gang:
- crawler-udbydere, som har brug for maskinlæsbare direktiver;
- søge- og AI-udbydere, som har brug for policiesignaler;
- jurister, som ønsker et klart forbehold af rettigheder;
- fremtidige revisorer, domstole eller journalister, som måske læser kommentarerne som bevis på intention.
Den fler-målgruppe-design forklarer, hvorfor nogle filer nu læser som policy-dokumenter. Men det svækker også den klare adskillelse mellem, hvad en crawler kan parse, og hvad en jurist vil erklære.
De 876 filer med AI-policy-sprog men uden juridisk ordforråd er hovedsageligt maskin-policyfiler: botnavne, Disallow-blokke og skabelonsprog. De 501 filer med både AI- og juridisk sprog er noget andet. De forsøger samtidig at være crawler-instruktioner og rettighedsforbehold. De 218 filer med juridisk sprog men uden AI-ordforråd viser, at mønsteret ikke begyndte med LLM'er; robots.txt blev allerede brugt som sted til at angive vilkår, tilladelsesgrænser og rettighedskrav.
For eksempel kan en kommentar sige, at machine learning er forbudt, mens den faktiske direktivblok kun afviser en delmængde af kendte user agents. Et site kan hævde rettigheder globalt, men kun nævne få crawlere. En CDN-skabelon kan injicere AI-relateret ordforråd i en fil, hvis operatør aldrig selv har skrevet den juridiske tekst. Et site kan skrive en bred User-agent: *-regel, der utilsigtet blokerer fremtidige crawlere.
Fra et governance-perspektiv er robots.txt blevet attraktiv netop fordi den er offentlig og maskinlæsbar. Men jo mere policy den bærer, jo mere betyder dens begrænsninger:
- Der findes intet autentifikationslag, der beviser, at en specifik policy blev gennemgået af rettighedshaveren snarere end arvet fra infrastrukturen.
- Der er ingen indbygget versionshistorik.
- Der er intet struktureret felt for tilsigtet brug, såsom træning, retrieval, søgeindeksering, opsummering, caching eller model-evaluering.
- Der er intet universelt register over AI-crawler-identiteter.
- Der er ingen håndhævelsesmekanisme.
Det gør ikke filen ubrugelig. Det gør den skrøbelig.
Den bedste fortolkning er, at robots.txt er ved at blive et notice-lag: en offentlig, inspicerbar erklæring om præference og intention. Den er ikke i sig selv et fuldt rettighedsstyringssystem.
Fund 4: Søgning var allerede ulig, før AI ankom
Et af de stærkeste fund i den oprindelige rapport var, at mange udgivere skelner mellem AI-træningscrawlere og søgecrawlere. De blokerer CCBot, GPTBot eller Google-Extended, men bevarer synlighed i Google Search.
Denne opfølger tilføjer et andet punkt: traditionelle søgecrawlere behandles heller ikke lige.
Vi tjekkede seks søgecrawlere:
- Googlebot;
- Bingbot;
- DuckDuckBot;
- Slurp;
- Baiduspider;
- YandexBot.
På tværs af de 7.248 analyserbare sites:
| Behandling af søgecrawlere | Sites |
|---|---|
| Blokerer mindst én søgecrawler | 562 |
| Tillader Googlebot, men blokerer mindst én anden søgecrawler | 404 |
| Blokerer alle seks tjekkede søgecrawlere | 152 |
Antallet af blokerede bots er ikke jævnt fordelt:

| Søgecrawler | Sites, der blokerer den |
|---|---|
| Baiduspider | 424 |
| YandexBot | 393 |
| Slurp | 255 |
| DuckDuckBot | 231 |
| Bingbot | 204 |
| Googlebot | 158 |
Googlebot er den mindst blokerede crawler i dette sæt. Baiduspider og YandexBot bliver blokeret langt oftere, og i de fleste af de tilfælde er Googlebot stadig tilladt. Blandt de 404 sites, der tillader Googlebot, mens de blokerer en anden søgecrawler, blokerer 269 Baiduspider og 240 YandexBot.
Eksemplerne er profilerede:
| Domæne | Blokerede søgecrawlere, mens Googlebot er tilladt |
|---|---|
facebook.com | Baiduspider, YandexBot |
apple.com | Baiduspider |
twitter.com | DuckDuckBot, Slurp, Baiduspider, YandexBot |
netflix.com | DuckDuckBot, Slurp |
x.com | DuckDuckBot, Slurp, Baiduspider, YandexBot |
tiktok.com | Baiduspider |
baidu.com | Bingbot, DuckDuckBot, Slurp, YandexBot |
washingtonpost.com | YandexBot |
wsj.com | YandexBot |
bilibili.com | DuckDuckBot, Slurp, YandexBot |
temu.com | Slurp |
t-mobile.com | Baiduspider, YandexBot |
Det betyder noget for AI-debatten, fordi det viser, at robots.txt ikke var en neutral, universel adgangsprotokol, selv før LLM-crawlere kom til. Det offentlige web havde allerede et hierarki:
- Googlebot bevares ofte, fordi Google-trafik er for værdifuld til at risikere.
- Regionale eller konkurrerende crawlere er lettere at blokere.
- Nogle sites behandler adgang for søgecrawlere som en beslutning fra marked til marked eller fra leverandør til leverandør.
AI-crawlere trådte ind i et økosystem, hvor differentieret adgang allerede var normalen.
Det gør policy-overgangen lettere at forstå. En udgiver, der skriver "blokér Google-Extended, tillad Googlebot", opfinder ikke en ny form for diskrimination. Den anvender et gammelt mønster på en ny type crawler: bevar distribution, begræns ekstraktion.
Det uafklarede spørgsmål er, om det gamle mønster skalerer. Med søgning var der kun en håndfuld økonomisk vigtige crawlere. Med AI er crawler-identiteten fragmenteret på tværs af modeludbydere, retrieval-bots, data brokers, akademiske crawlere, syntetiske browser-agenter og fetchere på infrastrukturniveau. Antallet af navngivne user agents vil fortsætte med at vokse, medmindre økosystemet samler sig om et mindre sæt formålsbaserede signaler.
Sådan vokser konfigurationsgælden.
Fund 5: Kompleksiteten varierer efter sektor, men ikke på samme måde som AI-blokeringsraterne gør
Den oprindelige rapport viste en stor sektorspredning i AI-blokering: nyheder blokerer i høj grad; telekom, offentlig sektor og SaaS blokerer i lav grad.
Konfigurationskompleksitet skærer webbet anderledes.
Blandt udvalgte kategorier med nok læsbare robots.txt-filer til en meningsfuld sammenligning:
| Kategori | n | Median bytes | P90 bytes | Median Disallow | P90 Disallow | Median User-agent | P90 User-agent |
|---|---|---|---|---|---|---|---|
| ecommerce | 215 | 1.738 | 10.388 | 37 | 164 | 3 | 49 |
| travel | 63 | 2.074 | 27.368 | 41 | 779 | 5 | 34 |
| news | 647 | 1.534 | 7.039 | 19 | 114 | 6 | 68 |
| finance | 121 | 1.002 | 8.337 | 17 | 132 | 2 | 23 |
| academia | 253 | 839 | 3.959 | 14 | 75 | 1 | 11 |
| government | 151 | 1.227 | 3.263 | 13 | 46 | 1 | 4 |
| SaaS | 368 | 485 | 12.606 | 4 | 56 | 1 | 10 |
| dev tools | 119 | 273 | 9.255 | 3 | 58 | 1 | 10 |
P90 Disallow by category chart here<<<<<<<<<<<<<<<<<<<<<<<<<
Nyheder er politisk komplekse, fordi de skriver eksplicit AI-regler og juridisk tekst. Men e-handel og rejser er operationelt komplekse, fordi de har store kataloger, facetteret navigation, søgeresultatsider, filtre, brugerkontostier og parameteriserede URL'er.
Den forskel er vigtig.
Rejser er det tydeligste eksempel. Den kategori har kun 63 læsbare filer i dette udsnit, men dens P90 robots.txt er 27,4 KB, og dens P90 Disallow-antal er 779, langt over nyheder. Det betyder ikke, at rejse-sites har en mere udviklet AI-policy. Det betyder, at rejse-sites har flere overflader, som crawler-operatører utilsigtet kan spilde budget på: datesøgninger, tilgængelighedssider, review-pagination, bookingflows, filterkombinationer og lokaliserede inventarstier.
SaaS er den modsatte overraskelse. Medianfilen er kun 485 bytes, men P90-filen springer til 12,6 KB. De fleste SaaS-sites er åbne og lette; et mindre antal bærer lange filkontrolfiler, ofte fordi dokumentation, login-overflader, app-ruter og marketing-sider ligger under samme domæne.
Nyheder ligger operationelt midt i feltet, men politisk helt i toppen. Dens P90 User-agent-antal er 68, højere end e-handel, rejser, finans, akademia, offentlig sektor, SaaS og dev tools i denne tabel. Det er et tegn på bot-specifik politik, ikke bare sti-hygiejne.
En publishers robots.txt kan være kompleks på grund af rettighedspolitik. En markedsplads' fil kan være kompleks på grund af crawlbudget-styring. Et universitets fil kan være kompleks, fordi tusindvis af ældre stier har samlet sig under ét domæne. En social platforms fil kan være kompleks, fordi den i massiv skala skal eksponere nogle flader og undertrykke andre.
AI-politikken lægger sig oven på alt det. Den erstatter ikke de eksisterende grunde til, at en fil er kompleks.
Det hjælper med at forklare, hvorfor AI-æraens robots.txt-governance ikke kan løses med en universel blokliste. De underliggende filer har forskellige opgaver:
- e-handels-sites håndterer dublerede stier og vareflader;
- rejse-sites håndterer lister, kalendere, anmeldelser og dynamiske søgesider;
- nyhedssites håndterer copyright, arkiver og licensposition;
- SaaS- og dev-tooling-sites ønsker ofte AI-synlighed;
- offentlige myndigheder har ofte brug for offentlig adgang, men kan stadig have følsomme systemer, der skal udelukkes;
- sociale platforme håndterer brugergenereret indhold, profilsider og bekymringer om misbrug.
Den samme AI-crawlerregel betyder noget forskelligt i hvert miljø.
Fund 6: Et indeks for konfigurationsgæld identificerer gennemgangsrisiko, ikke moralsk fejl
Denne analyse skabte en enkel konfigurationsgældsscore for at identificere robots.txt-filer, der sandsynligvis er svære at gennemgå.
Scoren vægter:
- filstørrelse;
- antal
User-agent-direktiver; - antal
Disallow-direktiver; - antal
Allow-direktiver; - antal ikke-kerne direktiver;
- tilstedeværelse af AI-policy-sprog;
- blandingen af eksplicit AI-blokering og juridisk eller ophavsretligt sprog.
Det er ikke en korrekthedsscore. En fil med høj kompleksitet kan være fuldstændig tilsigtet. En fil med lav kompleksitet kan stadig være forkert. Pointen er prioritering: hvis en fil er stor, policy-tung, bot-specifik og fuld af undtagelser, fortjener den stærkere gennemgangsdisciplin.

Scoredistributionen er stejl. Medianen for en læsbar fil er 1,74. P90-scoren er 13,29, P95 er 15,00, og P99 er 27,57. Kun 366 filer scorer mindst 15, 80 scorer mindst 25, og 41 scorer mindst 30. Det er den praktiske review-kø: ikke alle sites har brug for et governance-projekt, men den øverste hale har.
Kategoriopdelingen viser også, hvorfor en enkelt "AI-blokering"-etiket er for flad:
| Kategori | Median score | P90 score |
|---|---|---|
| travel | 4,92 | 28,94 |
| search | 2,97 | 24,23 |
| social | 2,25 | 15,00 |
| news | 4,91 | 14,92 |
| finance | 1,67 | 12,61 |
| SaaS | 0,98 | 11,85 |
| ecommerce | 3,88 | 10,87 |
| government | 1,57 | 6,38 |
Rejser og søgning har de højeste P90-scorer, fordi et mindretal af filer bliver meget store og regel-tunge. Nyheder har en af de højeste median-scorer, fordi policy-sprog og bot-specifik behandling er mere almindelige på tværs af hele kategorien. E-handel har et højt medianantal Disallow, men dens P90-gældsscore er lavere end rejser, fordi kompleksiteten er mere koncentreret i stiregler end i blandede policy- og juridiske signaler.
De højest scorende filer i dette datasæt omfatter:
| Domæne | Hvorfor den scorer højt |
|---|---|
linkedin.com | Meget stor fil, tusindvis af stiregler, mange navngivne user agents, eksplicit AI-policy-sprog |
lnkd.in | Samme policy-overflade som LinkedIns shortlink-infrastruktur |
fragrantica.com | Hundredvis af navngivne user-agent-blokke plus AI-policy-sprog |
sovcombank.ru | Hundredvis af user-agent-blokke og juridisk/policy-sprog |
academia.edu | Stor allow/disallow-matrix og eksplicit AI-blokeringspolitik |
opentable.com | Stort sæt af stiregler, mange sitemap-direktiver, AI-relateret policy-overflade |
etsy.com | Stor e-handelsfil til styring af stier med mere end 1.600 Disallow-regler |
runescape.com | Næsten 5.000 Disallow-direktiver under én user-agent-gruppe |
Disse filer bør ikke gøres grin med for at være komplekse. Kompleksitet afspejler ofte reelle forretningsbehov. Men de viser, hvorfor robots.txt-policy fortjener samme ingeniørdisciplin som anden produktionskonfiguration:
- ejerskab skal være eksplicit;
- ændringer skal gennemgås;
- genererede sektioner bør mærkes;
- juridiske kommentarer bør adskilles fra maskindirektiver, hvor det er muligt;
- testcases bør bekræfte forventet bot-adgang for kritiske crawlere;
- versionshistorik bør bevares;
- gamle botnavne bør udfases eller dokumenteres;
- AI-træning, AI-retrieval, søgeindeksering og arkivering bør behandles som separate formål.
Det sidste punkt er det vigtigste. Den nuværende grammatik er user-agent-først: den beder siteejere om at navngive bots. AI-æraens behov er formåls-først: den beder siteejere om at sige, hvilke anvendelser der er tilladt.
Det er ikke det samme.
Det misforhold er grunden til, at længere bloklister ikke vil holde sig godt over tid. En udgiver kan tilføje GPTBot, ClaudeBot, CCBot, Google-Extended, Bytespider, Applebot-Extended og PerplexityBot i dag, men det næste crawlernavn, retrieval-agent eller dataset-mægler kan dukke op i morgen. En formålsbaseret policy ville lade sitet sige "søgeindeksering ja, AI-træning nej, brugerinitieret retrieval måske" uden at gøre robots.txt til en telefonbog over bots.
Hvad det betyder for AI-governance
Den offentlige debat fremstiller ofte robots.txt som enten meningsfuld eller forældet. Dataene peger på et mere praktisk svar:
robots.txt er meningsfuld, men overbelastet.
Den er meningsfuld, fordi store sites bruger den, crawlere kan parse den, og policyvalg er synlige for forskere, journalister, leverandører og domstole. Den oprindelige rapport fandt, at 17,0 % af de analyserbare topsites havde bevidste AI-specifikke regler. Det er ikke symbolsk støj.
Den er overbelastet, fordi filen nu skal udtrykke mere end bot-adgang:
- "Træn ikke på dette indhold."
- "Du må bruge dette indhold til søgeindeksering."
- "Du må bruge dette indhold til live retrieval."
- "Du må ikke oprette cachede datasæt."
- "Dette juridiske forbehold gælder i henhold til EU's regler om tekst- og datamining."
- "Dette CDN-styrede site sender
Content-Signal: ai-train=no." - "Dette site vil have Googlebot, men ikke YandexBot."
- "Dette site har 1.000 ældre URL-stier, der ikke bør crawles."
Grammatikken var ikke designet til så mange opgaver.
Tre ændringer ville reducere gælden:
-
Crawler-identitet har brug for et register. Siteejere bør ikke skulle vedligeholde en stadigt voksende liste af
GPTBot,ClaudeBot,anthropic-ai,CCBot,Google-Extended,Applebot-Extended,Bytespider,OAI-SearchBot,ChatGPT-Userog mange flere. Uden et register vil policy altid halte efter crawler-adfærden. -
AI-brug har brug for struktureret ordforråd. Træning, retrieval, indeksering, opsummering, videresalg af datasæt, modelevaluering og brugerstyret browsing er forskellige anvendelser. At udtrykke dem gennem leverandørspecifikke user-agent-navne er skrøbeligt.
-
Policy har brug for auditabilitet. Webbet har brug for en måde at skelne mellem håndskrevne rettighedsforbehold, arvede CDN-defaults, genererede CMS-skabeloner, gamle ældre regler og utilsigtede catch-all-blokeringer. Skelnen betyder noget for tillid og for retssager.
Intet af dette betyder, at robots.txt skal erstattes fra den ene dag til den anden. Den bedre vej er lagdeling: behold robots.txt som discovery- og kompatibilitetsflade, men standardisér en nærliggende maskinlæsbar policy for AI-specifikke anvendelser.
llms.txt er et forsøg, men adoptionen i dette datasæt er stadig lille: kun 83 læsbare filer nævner det. Content-Signal er mere synligt, fordi Cloudflare kan distribuere det gennem infrastrukturen, og alle 271 Content-Signal-filer i denne scanning matchede også AI-policy-sprog. Men distribution er ikke det samme som konsensus. En holdbar løsning har sandsynligvis brug for standardiseringens kedelige maskineri: klare felter, klar semantik, crawler-forpligtelser og offentlige test-suiter.
Konklusion
Kampen om AI-crawlere har gjort robots.txt til et governance-artefakt. Det er både nyttigt og risikabelt.
Nyttigt, fordi filen er offentlig. Forskere kan auditere den. Udgivere kan ændre den. Crawlere kan respektere den. Domstole kan læse den. Infrastrukturudbydere kan udrulle den i stor skala.
Risikabelt, fordi den bærer for meget.
Medianen for en robots.txt-fil i Tranco Top 10K er stadig lille nok til at forstå. Men det mest trafikerede webs lange hale er fuld af store, gamle, lagdelte, leverandørspecifikke og juridisk ladede filer. Hundredvis af sites vedligeholder nu robots.txt-konfigurationer, der bedst forstås som produktions-policy-systemer snarere end enkle crawler-hints.
Den centrale læring er ikke, at robots.txt er fejlet. Det er, at webbet har forfremmet den uden at refaktorere den.
Hvis AI-adgangspolitik skal afhænge af offentlige maskinlæsbare erklæringer, er næste skridt ikke endnu en længere blokliste. Det er bedre policy-infrastruktur: formålsbaserede tilladelser, stabil crawler-identitet, gennemgåelige skabeloner og auditspor.
Indtil da vil den offentlige webs AI-governance-lag fortsat hvile på en tekstfil, som aldrig var beregnet til at bære så meget vægt.
Noter om reproducerbarhed
Leveringsmappen indeholder:
source_data/analysis.json— oprindelige aggregerede metrics.source_data/site_meta.csv— oprindelig analytisk tabel pr. site.source_data/bot_status.csv— oprindelig tabel for domæne-efter-bot-politik.source_data/fetch_meta.csv— oprindelige fetch-metadata.source_data/sites.csv— oprindelig tabel over domæne/kategori/status.derived_data/robots_complexity_by_site.csv— kompleksitetsmetrics pr. site genereret til denne rapport.derived_data/search_bot_treatment.csv— matrix for behandling af søgecrawlere.derived_data/category_complexity_summary.csv— kategoribaseret oversigt over kompleksitet.derived_data/top_config_debt_sites.csv— top-sites efter prioriteringsscoren beskrevet ovenfor.derived_data/summary_metrics.json— alle hovedmetrics citeret i denne rapport.
Download alle scripts og datasæt
Korrektioner til metodologi, problemer med datasættet og opfølgende analyser er velkomne på support@thunderbit.com. Denne rapport er udgivet uafhængigt af enhver kommerciel position, Thunderbit har; vi bygger en AI-drevet webscraper, og vi har en strukturel interesse i, at robots.txt fortsat er en meningsfuld, maskinlæsbar kontrakt på det offentlige web. Dataene i denne rapport står på egne ben. — Thunderbits forskningsteam, maj 2026.
Prøv Thunderbit til AI-webscraping Get Started Free


