Sammendrag
Den forrige rapporten stilte et policyspørsmål: hvor mange av verdens mest besøkte nettsteder forteller AI-crawlere hva de kan og ikke kan gjøre?
Denne oppfølgeren stiller det operasjonelle spørsmålet bak det hele: hvor pålitelig er robots.txt som infrastrukturen som nå forventes å bære denne policyen?
Svaret er ubehagelig. robots.txt fungerer fortsatt fordi den er offentlig, billig, maskinlesbar og allerede forstått av crawlere. Men den blir også bedt om å gjøre langt mer enn den opprinnelig var laget for. I 2026 kan den samme ren tekst-filen inneholde SEO-kontroller for crawling, sitemap-indekser, gamle søkemotorutvidelser, AI-treningsunntak, Cloudflare-injisert policyvokabular, opphavsrettsforbehold og juridisk språk rettet mot fremtidige tvister.
Det er konfigurasjonsgjeld.
Datasettet bak denne rapporten er det samme Tranco Top 10,000-crawlet som ble brukt i den opprinnelige studien av AI-crawlere. Av de 10 000 domenene returnerte 6 638 en lesbar robots.txt; ytterligere 610 returnerte 404, som etter protokollen regnes som implisitt tillatt. Dette gir 7 248 analyserbare nettsteder for bot-tilgangsbeslutninger og 6 638 konkrete filer for analyse av konfigurasjonskompleksitet.
Seks funn skiller seg ut:
-
De fleste
robots.txt-filer er små, men den lange halen er ekstremt kompleks. Medianfilen er bare 834 byte og 31 linjer. Men 1 005 filer er på minst 5 KB, 273 er på minst 20 KB, og 28 er på minst 100 KB. Den største filen i utvalget er 248 KB. -
Hundrevis av toppnettsteder kjører filer som ligner mer på produksjonskonfigurasjon enn på policy-notater. Medianfilen har 9
Disallow-direktiver. Men 707 nettsteder har minst 100Disallow-regler, 13 har minst 1 000, 240 navngir minst 50 brukeragenter, og 110 navngir minst 100 brukeragenter. -
Protokollavdrift er ikke teoretisk. Blant de 6 638 lesbare filene inneholder 685
Crawl-delay, 303 inneholderHost, 200 inneholderClean-param, 9 inneholderRequest-rate, 5 inneholderVisit-time, og 271 inneholder Cloudflare-lignendeContent-Signal-språk. Dette er ikke alt del av den samme rene standarden. Det er oppsamlet crawler-folklore. -
Googlebot behandles som en særskilt borger. 562 analyserbare domener blokkerer minst én tradisjonell søkecrawler. I 404 av disse tilfellene er Googlebot tillatt, mens minst én annen søkecrawler er blokkert. Diskriminering av AI-crawlere oppstod ikke i et nøytralt økosystem;
robots.txtkodet allerede inn et hierarki mellom søkemotorer. -
AI-policy gjør gjelden mer synlig. 1 377 lesbare filer inneholder AI-policy-språk; 719 inneholder språk om opphavsrett, vilkår, lisensiering eller tillatelse; og 501 inneholder begge deler. Filen har blitt både maskinelt grensesnitt og juridisk artefakt. Det er nyttig, men skjørt.
-
De mest risikable filene er ikke alltid de mest AI-fiendtlige. Nettbutikker, reise, sosiale medier, finans, akademia og nyheter produserer alle komplekse filer av ulike grunner: kontroll av crawl-budsjett, gamle stier, brukergenerert innhold, rettighetsforbehold og botspesifikke unntak. AI-regler blir lagt oppå en base som allerede er rotete.
Hovedkonklusjonen: robots.txt er fortsatt det offentlige webens viktigste overflate for crawler-policy, men den er et svakt fundament for AI-styring med høye konsekvenser med mindre økosystemet standardiserer crawler-identitet, AI-bruksvokabular og sporbarhet i policy.
Metode
Denne rapporten gjenbruker datasettet fra den opprinnelige Thunderbit-analysen av AI-crawlerpolicy på Tranco Top 10,000-domener.
Innsatsmaterialet var:
tranco_top10k.csv— den opprinnelige Tranco Top 10K-domenelisten.out/fetch_meta.csv— hentestatus, byteantall, skjema, omdirigeringsutfall og feilmelladata.out/sites.csv— domene, rang, kategori, språk og status forrobots.txt.out/site_meta.csv— én analytisk rad per nettsted, inkludert malklasse, AI-blokkering-flagger, filstørrelse og oppsummeringsfelt for bot-policy.out/bot_status.csv— én rad per domene og crawler, inkludert om boten er blokkert og om en spesifikk regel finnes.raw_robots/— bufrederobots.txt-tekster for de 6 638 nettstedene som returnerte status200.
For denne oppfølgeren ble hver lesbare robots.txt-fil skannet for:
- filstørrelse og linjetall;
- aktive linjer som ikke er kommentarer;
- antall direktiver for
User-agent,Disallow,AllowogSitemap; - gamle eller ikke-kjerne-direktiver som
Crawl-delay,Host,Clean-param,Request-rateogVisit-time; - AI-tidsalder-vokabular, inkludert
Content-Signal,llms.txt, AI, LLM, machine learning, TDM og2019/790; - juridisk vokabular som opphavsrett, bruksvilkår, lisensiering, tillatelse og språk om rettighetsforbehold;
- behandling av søkecrawlere som Googlebot, Bingbot, DuckDuckBot, Slurp, Baiduspider og YandexBot.
Rapporten definerer også en enkel konfigurasjonsgjeldsscore for prioritering. Den kombinerer filstørrelse, antall brukeragenter, antall Disallow, antall Allow, antall ikke-standarddirektiver og blandingen av AI-policy- og juridisk språk. Scoren er ikke ment som et universelt mål på korrekthet. Den er en måte å identifisere filer som sannsynligvis er vanskelige å vedlikeholde, gjennomgå eller forstå.
Alle avledede tabeller og figurer er inkludert i leveringsmappen.
Funn 1: Medianfilen er enkel; halen er det ikke
Den typiske robots.txt-filen på det store nettet er fortsatt liten.

Blant de 6 638 lesbare filene:
| Metrikk | Median | P90 | P95 | P99 | Maks |
|---|---|---|---|---|---|
| Filstørrelse | 834 byte | 6,7 KB | 15,8 KB | 76,0 KB | 248,3 KB |
| Linjer | 31 | 238 | 332 | 1 008 | 4 998 |
| Aktive linjer | 23 | 198 | 282 | 837 | 4 998 |
User-agent-direktiver | 1 | 21 | 39 | 137 | 823 |
Disallow-direktiver | 9 | 103 | 176 | 422 | 4 997 |
Allow-direktiver | 1 | 17 | 33 | 69 | 890 |
Denne fordelingen betyr noe fordi robots.txt ofte omtales som om den var en liten erklæring:
User-agent: *
Disallow: /private/
Den mentale modellen er feil for en betydelig minoritet av de mest trafikkerte nettstedene.
I dette datasettet:

| Kompleksitetsterskel | Nettsteder |
|---|---|
robots.txt større enn eller lik 5 KB | 1 005 |
| Større enn eller lik 20 KB | 273 |
| Større enn eller lik 100 KB | 28 |
Minst 50 User-agent-direktiver | 240 |
Minst 100 User-agent-direktiver | 110 |
Minst 100 Disallow-direktiver | 707 |
Minst 1 000 Disallow-direktiver | 13 |
Minst 100 Allow-direktiver | 40 |
De største og mest komplekse filene er ikke akademiske kuriositeter. De tilhører reelle, svært trafikkerte tjenester:
| Domene | Rang | Kategori | Byte | User-agent | Disallow | Allow |
|---|---|---|---|---|---|---|
linkedin.com | 17 | sosiale medier | 114 341 | 76 | 4 184 | 281 |
runescape.com | 5 226 | ukjent | 113 393 | 1 | 4 997 | 0 |
academia.edu | 832 | akademia | 57 384 | 63 | 2 044 | 227 |
etsy.com | 286 | netthandel | 51 320 | 3 | 1 621 | 120 |
thepaper.cn | 9 395 | nyheter | 56 867 | 1 | 1 496 | 0 |
opentable.com | 4 137 | ukjent | 70 494 | 32 | 1 683 | 176 |
alfabank.ru | 2 625 | finans | 73 158 | 2 | 1 566 | 133 |
Disse filene ligger nærmere produksjonens rutetabeller enn politiske slagord. De koder inn år med produktlanseringer, gamle stier, blokkerte parameter-mønstre, crawler-unntak, SEO-eksperimenter, CDN-beslutninger og nå AI-crawlerregler.
Halen er ikke bare en AI-historie. Av de 273 filene på eller over 20 KB inneholder 131 AI-policy-språk og 142 gjør det ikke. Av de 707 filene med minst 100 Disallow-direktiver inneholder bare 207 AI-policy-språk. Med andre ord: AI skapte ikke problemet med store filer. Den kom etter at mange års vanlig webdrift allerede hadde fylt filen med sti-regler, sitemap-referanser og crawler-unntak.
Det er viktig fordi vedlikeholdbarhet avhenger av form, ikke bare intensjon. En liten fil med en direkte AI-blokk kan være enkel å revidere. En 70 KB stor nettbutikk- eller reise-fil kan være vanskelig å revidere selv om den ikke sier noe om AI. Risikoen er ikke at alle store filer er feil. Risikoen er at den faktiske policyen blir for vanskelig for de ansvarlige å verifisere.
Den operasjonelle risikoen er enkel: etter hvert som robots.txt vokser, blir det vanskeligere for en utgiver, plattformingeniør, jurist eller SEO-leder å svare på det grunnleggende spørsmålet: hva tillater egentlig denne filen?
Det spørsmålet er ikke lenger trivielt. Under RFC-lignende parsing kan en crawler matche en mer spesifikk brukeragentgruppe i stedet for User-agent: *; lengre sti-matcher kan overstyre kortere; Allow- og Disallow-direktiver påvirker hverandre etter prioritet; og generelle avvis-alle-regler kan ved en feil fange opp nye crawlere som ikke eksisterte da filen ble skrevet.
For en fil på 30 linjer kan et menneske resonere om det. For en fil på 4 000 linjer med dusinvis av navngitte boter, bør ingen gjøre det.
Funn 2: robots.txt bærer mer enn crawl-regler
Debatten om AI-crawlere gjorde robots.txt politisk synlig, men den underliggende filen hadde allerede samlet på seg urelaterte oppgaver.
En moderne robots.txt på et stort nettsted kan inneholde:
- kontroll av crawlerstier;
- oppdagelse av sitemap;
- søkemotorspesifikke utvidelser;
- hint om crawl-rate;
- hint om host-kanonisering;
- hint om opprydding i URL-parametre;
- policyvokabular injisert av CDN;
- tekst om opphavsrettsforbehold;
- AI-treningsunntak;
- juridiske kommentarer i lesbar form.
Datasettet viser dette tydelig.
| Signal | Filer | Andel av lesbare filer |
|---|---|---|
Crawl-delay | 685 | 10,3% |
Host | 303 | 4,6% |
Clean-param | 200 | 3,0% |
Content-Signal | 271 | 4,1% |
Request-rate | 9 | 0,1% |
Visit-time | 5 | 0,1% |
omtale av llms.txt | 83 | 1,3% |
| Opphavsrett, vilkår, lisensiering eller tillatelsesspråk | 719 | 10,8% |
| AI-policy-språk | 1 377 | 20,7% |
Noen av disse direktivene er bredt anerkjent av bestemte crawlere. Noen er gamle konvensjoner. Noen er leverandørspesifikke. Noen er egentlig ikke crawlerdirektiver i det hele tatt, men juridisk eller produktrelatert språk innebygd i kommentarer.
Slik ser protokollavdrift ut.
Crawl-delay er et godt eksempel. Det er kjent for mange nettstedseiere, men støtten er ujevn blant store crawlere. Host og Clean-param har historisk vært knyttet til Yandex-atferd. Content-Signal er del av Cloudflares policyvokabular i AI-tiden. llms.txt er et foreslått nærliggende oppdagelsesformat, ikke en universelt respektert standard. Likevel dukker alt dette opp i samme type fil, ofte ved siden av klassiske User-agent- og Disallow-regler.
Tallene viser også hvordan gamle og nye konvensjoner nå lever side om side. Crawl-delay forekommer i 685 filer, mer enn dobbelt så mange som de 271 filene med Content-Signal. Host forekommer i 303 filer og Clean-param i 200, mest som et ekko av søkemotorenes tidligere praksis. llms.txt, til tross for mye diskusjon i AI-søk-miljøer, nevnes bare i 83 lesbare filer. Nettet samler seg ikke om ett vokabular. Det stabler vokabularer.
Problemet er ikke at noen enkelt utvidelse er feil. Problemet er at filen har blitt en uversjonert beholder for flere overlappende styringssystemer.
Det skaper tre typer gjeld:
- Semantisk gjeld. Ulike crawlere kan tolke den samme filen ulikt.
- Eierskapsgjeld. SEO-, juridikk-, infrastruktur-, sikkerhets- og produktteam kan alle ha grunner til å redigere filen, men ingen enkelt gruppe eier nødvendigvis hele policyen.
- Revisjonsgjeld. Et nettsted kan publisere en policy som ser bevisst ut, mens bare en parser kan avgjøre hvordan den faktisk oppfører seg.
AI gjør dette viktigere fordi innsatsen er høyere. Når et gammelt hint om crawl-rate ignoreres, kan resultatet bli ekstra trafikk. Når et AI-treningsunntak er tvetydig, kan resultatet bli bevis i en opphavsretts- eller lisensstrid.
Funn 3: Filen har blitt både maskinelt grensesnitt og juridisk artefakt
Den opprinnelige AI-crawler-rapporten viste at 17,0 % av de analyserbare nettstedene hadde skrevet eksplisitte AI-spesifikke regler. Denne oppfølgeren ser på den tekstlige byrden disse policyene legger til.

Blant de 6 638 lesbare robots.txt-filene:
- 1 377 inneholder AI-policy-språk;
- 719 inneholder språk om opphavsrett, vilkår, lisensiering, rettigheter eller tillatelse;
- 271 inneholder
Content-Signal; - 83 nevner
llms.txt.
Overlappen er der historien blir mer interessant:

| Tekstmønster | Filer |
|---|---|
| AI-policy-språk og juridisk/rettighetsspråk | 501 |
| AI-policy-språk uten juridisk/rettighetsspråk | 876 |
| Juridisk/rettighetsspråk uten AI-policy-språk | 218 |
Content-Signal med juridisk/rettighetsspråk | 242 |
| Eksplisitt AI-blokk med juridisk/rettighetsspråk | 424 |
Dette er en ny type fil.
En tradisjonell robots.txt er adressert til crawlere. En robots.txt med juridisk forord er adressert til minst fire målgrupper samtidig:
- crawleroperatører, som trenger maskinlesbare direktiver;
- søke- og AI-leverandører, som trenger policy-signaler;
- jurister, som ønsker eksplisitt rettighetsforbehold;
- fremtidige revisorer, domstoler eller journalister, som kan lese kommentarene som bevis på intensjon.
Denne flerbruker-designen forklarer hvorfor noen filer nå leses som policy-dokumenter. Men den svekker også skillet mellom det en crawler kan parse og det en menneskelig jurist ønsker å erklære.
De 876 filene med AI-policy-språk, men uten juridisk vokabular, er stort sett maskinpolicy-filer: botnavn, Disallow-blokker og mal-språk. De 501 filene med både AI- og juridisk språk er noe annet. De prøver å være både crawlerinstruksjoner og rettighetsforbehold samtidig. De 218 filene med juridisk språk, men uten AI-vokabular, viser at dette mønsteret ikke startet med LLM-er; robots.txt ble allerede brukt som et sted å formulere vilkår, tillatelsesgrenser og rettighetskrav.
For eksempel kan en kommentar si at machine learning er forbudt, mens den faktiske direktivblokken bare blokkerer et utvalg kjente brukeragenter. Et nettsted kan hevde rettigheter globalt, men bare navngi noen få crawlere. En CDN-mal kan injisere AI-relatert vokabular i en fil hvis operatør aldri selv skrev den juridiske teksten. Et nettsted kan skrive en bred User-agent: *-regel som utilsiktet blokkerer fremtidige crawlere.
Fra et styringsperspektiv har robots.txt blitt attraktiv nettopp fordi den er offentlig og maskinlesbar. Men jo mer policy den bærer, jo mer betyr begrensningene:
- Det finnes ingen autentiseringslag som beviser at en spesifikk policy ble gjennomgått av rettighetshaveren i stedet for arvet fra infrastrukturen.
- Det finnes ingen innebygd versjonshistorikk.
- Det finnes ikke et strukturert felt for tiltenkt bruk, som trening, gjenfinning, søkeindeksering, oppsummering, caching eller modelevaluering.
- Det finnes ikke et universelt register over AI-crawleridentiteter.
- Det finnes ingen håndhevingsmekanisme.
Dette gjør ikke filen ubrukelig. Det gjør den skjør.
Den beste tolkningen er at robots.txt blir et varslingslag: en offentlig, kontrollerbar erklæring om preferanse og intensjon. Den er ikke, alene, et fullstendig system for rettighetsforvaltning.
Funn 4: Søk var allerede ujevnt før AI kom
Et av de sterkeste funnene i den opprinnelige rapporten var at mange utgivere skiller mellom AI-treningscrawlere og søkecrawlere. De blokkerer CCBot, GPTBot eller Google-Extended samtidig som de bevarer synlighet i Google-søk.
Denne oppfølgeren legger til et annet poeng: tradisjonelle søkecrawlere behandles heller ikke likt.
Vi sjekket seks søkecrawlere:
- Googlebot;
- Bingbot;
- DuckDuckBot;
- Slurp;
- Baiduspider;
- YandexBot.
På tvers av de 7 248 analyserbare nettstedene:
| Behandling av søkecrawlere | Nettsteder |
|---|---|
| Blokkerer minst én søkecrawler | 562 |
| Tillater Googlebot, men blokkerer minst én annen søkecrawler | 404 |
| Blokkerer alle seks kontrollerte søkecrawlere | 152 |
Antallet blokkerte boter er ikke jevnt fordelt:

| Søkecrawler | Nettsteder som blokkerer den |
|---|---|
| Baiduspider | 424 |
| YandexBot | 393 |
| Slurp | 255 |
| DuckDuckBot | 231 |
| Bingbot | 204 |
| Googlebot | 158 |
Googlebot er den minst blokkerte crawleren i dette settet. Baiduspider og YandexBot blokkeres langt oftere, og i de fleste av disse tilfellene er Googlebot fortsatt tillatt. Blant de 404 nettstedene som tillater Googlebot mens de blokkerer en annen søkecrawler, blokkerer 269 Baiduspider og 240 YandexBot.
Eksemplene er profilerte:
| Domene | Blokkerte søkecrawlere mens Googlebot er tillatt |
|---|---|
facebook.com | Baiduspider, YandexBot |
apple.com | Baiduspider |
twitter.com | DuckDuckBot, Slurp, Baiduspider, YandexBot |
netflix.com | DuckDuckBot, Slurp |
x.com | DuckDuckBot, Slurp, Baiduspider, YandexBot |
tiktok.com | Baiduspider |
baidu.com | Bingbot, DuckDuckBot, Slurp, YandexBot |
washingtonpost.com | YandexBot |
wsj.com | YandexBot |
bilibili.com | DuckDuckBot, Slurp, YandexBot |
temu.com | Slurp |
t-mobile.com | Baiduspider, YandexBot |
Dette betyr noe for AI-debatten fordi det viser at robots.txt ikke var en nøytral protokoll for universell tilgang selv før LLM-crawlere kom. Det offentlige nettet hadde allerede et hierarki:
- Googlebot bevares ofte fordi Google-trafikk er for verdifull til å risikere.
- Regionale eller konkurrerende crawlere er lettere å blokkere.
- Noen nettsteder behandler tilgang for søkecrawlere som en beslutning per marked eller per leverandør.
AI-crawlere kom inn i et økosystem der differensiert tilgang allerede var normalen.
Det gjør policyovergangen lettere å forstå. En utgiver som skriver "blokker Google-Extended, tillat Googlebot" finner ikke opp en ny form for diskriminering. Den anvender et gammelt mønster på en ny type crawler: bevar distribusjon, begrens utvinning.
Det uløste spørsmålet er om dette gamle mønsteret skalerer. Med søk var det bare et håndfull økonomisk viktige crawlere. Med AI er crawleridentiteten fragmentert på tvers av modellleverandører, gjenfinningsboter, datameglere, akademiske crawlere, syntetiske nettleseragenter og fetchere på infrastrukturnivå. Antallet navngitte brukeragenter vil fortsette å vokse med mindre økosystemet konsoliderer seg rundt et mindre sett av formålsbaserte signaler.
Slik bygges konfigurasjonsgjeld opp.
Funn 5: Kompleksitet varierer etter sektor, men ikke slik AI-blokkeringsgradene gjør
Den opprinnelige rapporten viste en stor sektorspredning i AI-blokkering: nyheter blokkerer i høy grad; telekom, offentlig sektor og SaaS blokkerer i lav grad.
Konfigurasjonskompleksitet skjærer gjennom nettet på en annen måte.
Blant utvalgte kategorier med nok lesbare robots.txt-filer til meningsfull sammenligning:
| Kategori | n | Median byte | P90 byte | Median Disallow | P90 Disallow | Median User-agent | P90 User-agent |
|---|---|---|---|---|---|---|---|
| netthandel | 215 | 1 738 | 10 388 | 37 | 164 | 3 | 49 |
| reise | 63 | 2 074 | 27 368 | 41 | 779 | 5 | 34 |
| nyheter | 647 | 1 534 | 7 039 | 19 | 114 | 6 | 68 |
| finans | 121 | 1 002 | 8 337 | 17 | 132 | 2 | 23 |
| akademia | 253 | 839 | 3 959 | 14 | 75 | 1 | 11 |
| offentlig sektor | 151 | 1 227 | 3 263 | 13 | 46 | 1 | 4 |
| SaaS | 368 | 485 | 12 606 | 4 | 56 | 1 | 10 |
| utviklerverktøy | 119 | 273 | 9 255 | 3 | 58 | 1 | 10 |
P90 Disallow by category chart here<<<<<<<<<<<<<<<<<<<<<<<<<
Nyheter er politisk komplekst fordi det skriver eksplisitte AI-regler og juridisk tekst. Men netthandel og reise er operasjonelt komplekse fordi de har store kataloger, fasettert navigasjon, resultatsider, filtre, brukerkontostier og parameteriserte URL-er.
Det skillet er viktig.
Reise er det tydeligste eksemplet. Kategorien har bare 63 lesbare filer i dette utsnittet, men P90 robots.txt er 27,4 KB og P90 Disallow-antallet er 779, langt over nyheter. Det betyr ikke at reisesider har en mer utviklet AI-policy. Det betyr at reisesider har flere overflater som crawleroperatører lett kan bruke budsjett på i feil retning: datosesøk, tilgjengelighetssider, sideinndelte anmeldelser, bookingflyter, filterkombinasjoner og lokaliserte lagerstier.
SaaS er den motsatte typen overraskelse. Medianfilen er bare 485 byte, men P90-filen hopper til 12,6 KB. De fleste SaaS-nettsteder er åpne og lette; en mindre gruppe bærer lange sti-kontrollfiler, ofte fordi dokumentasjon, innloggingsflater, app-ruter og markedsføringssider ligger under samme domene.
Nyheter ligger midt på treet operasjonelt, men nær toppen politisk. P90 User-agent-antallet er 68, høyere enn netthandel, reise, finans, akademia, offentlig sektor, SaaS og utviklerverktøy i denne tabellen. Det er et tegn på botspecifikk policy, ikke bare hygiene for stier.
En utgivers robots.txt kan være kompleks på grunn av rettighetspolitikk. En markedsplassfil kan være kompleks på grunn av styring av crawl-budsjett. En universitetsfil kan være kompleks fordi tusenvis av gamle stier har samlet seg under ett domene. En sosial plattforms fil kan være kompleks fordi den må eksponere noen overflater og skjule andre i stor skala.
AI-policy legges oppå alt dette. Den erstatter ikke de eksisterende grunnene til at en fil er kompleks.
Dette bidrar til å forklare hvorfor AI-tidens robots.txt-styring ikke kan løses med en universell blokkeringsliste. De underliggende filene har forskjellige oppgaver:
- netthandelssider håndterer dupliserte stier og vareflater;
- reisesider håndterer oppføringer, kalendere, anmeldelser og dynamiske søkesider;
- nyhetssider håndterer opphavsrett, arkiver og lisensiering;
- SaaS- og utviklerverktøysider ønsker ofte AI-synlighet;
- offentlig sektor trenger ofte offentlig tilgang, men kan fortsatt ha sensitive systemer som må utelates;
- sosiale plattformer håndterer brukergenerert innhold, profilsider og misbruksforebygging.
Den samme AI-crawlerregelen betyr noe forskjellig i hvert miljø.
Funn 6: En konfigurasjonsgjeldsindeks identifiserer revisjonsrisiko, ikke moralsk svikt
Denne analysen laget en enkel konfigurasjonsgjeldsscore for å identifisere robots.txt-filer som sannsynligvis er vanskelige å gjennomgå.
Scoren vekter:
- filstørrelse;
- antall
User-agent-direktiver; - antall
Disallow-direktiver; - antall
Allow-direktiver; - antall ikke-kjerne-direktiver;
- tilstedeværelse av AI-policy-språk;
- blanding av eksplisitt AI-blokkering og juridisk eller opphavsrettslig språk.
Dette er ikke en korrekthetsscore. En fil med høy kompleksitet kan være helt bevisst. En fil med lav kompleksitet kan fortsatt være feil. Poenget er prioritering: hvis en fil er stor, policytung, botspecifikk og full av unntak, fortjener den strengere gjennomgang.

Scorefordelingen er bratt. Den mediane lesbare filen scorer 1,74. P90-scoren er 13,29, P95 er 15,00, og P99 er 27,57. Bare 366 filer scorer minst 15, 80 scorer minst 25, og 41 scorer minst 30. Det er den praktiske gjennomgangskøen: ikke alle nettsteder trenger et styringsprosjekt, men den øvre halen gjør det.
Kategorioversikten viser også hvorfor en enkelt etikett som «AI-blocker» blir for flat:
| Kategori | Median score | P90 score |
|---|---|---|
| reise | 4,92 | 28,94 |
| søk | 2,97 | 24,23 |
| sosiale medier | 2,25 | 15,00 |
| nyheter | 4,91 | 14,92 |
| finans | 1,67 | 12,61 |
| SaaS | 0,98 | 11,85 |
| netthandel | 3,88 | 10,87 |
| offentlig sektor | 1,57 | 6,38 |
Reise og søk har de høyeste P90-scorene fordi et mindretall av filene blir svært store og regeltyngde. Nyheter har en av de høyeste median-scorene fordi policy-språk og botspecifikk behandling er vanligere i hele kategorien. Netthandel har et høyt median-antall Disallow, men P90-gjeldsscoren er lavere enn reise fordi kompleksiteten er mer konsentrert i sti-regler enn i blandede policy-/juridikksignaler.
De høyest scorende filene i dette datasettet inkluderer:
| Domene | Hvorfor scoren er høy |
|---|---|
linkedin.com | Svært stor fil, tusenvis av sti-regler, mange navngitte brukeragenter, eksplisitt AI-policy-språk |
lnkd.in | Samme policyflate som LinkedIns kortlenkeinfrastruktur |
fragrantica.com | Hundrevis av navngitte brukeragent-blokker pluss AI-policy-språk |
sovcombank.ru | Hundrevis av brukeragent-blokker og juridisk/policy-språk |
academia.edu | Stor matrise av allow/disallow og eksplisitt AI-blokkeringspolicy |
opentable.com | Stort sett med sti-regler, mange sitemap-direktiver, AI-relatert policyflate |
etsy.com | Stor fil for kontroll av nettbutikkstier med mer enn 1 600 Disallow-regler |
runescape.com | Nesten 5 000 Disallow-direktiver under én brukeragentgruppe |
Disse filene bør ikke latterliggjøres for å være komplekse. Kompleksitet gjenspeiler ofte reelle forretningsbehov. Men de viser hvorfor robots.txt-policy fortjener samme ingeniørdisiplin som annen produksjonskonfigurasjon:
- eierskap bør være eksplisitt;
- endringer bør gjennomgås;
- genererte seksjoner bør merkes;
- juridiske kommentarer bør skilles fra maskindirektiver når det er mulig;
- testtilfeller bør bekrefte forventet bot-tilgang for kritiske crawlere;
- versjonshistorikk bør bevares;
- gamle botnavn bør fases ut eller dokumenteres;
- AI-trening, AI-gjenfinning, søkeindeksering og arkivering bør behandles som separate formål.
Det siste punktet er det viktigste. Den nåværende grammatikken er brukeragent-først: den ber nettstedseiere navngi boter. AI-tidens behov er formåls-først: den ber nettstedseiere si hvilke bruksformer som er tillatt.
Det er ikke det samme.
Det misforholdet er grunnen til at lengre blokkeringslister ikke vil eldes pent. En utgiver kan legge til GPTBot, ClaudeBot, CCBot, Google-Extended, Bytespider, Applebot-Extended og PerplexityBot i dag, men det neste crawlernavnet, den neste gjenfinningsagenten eller den neste datamegleren kan dukke opp i morgen. En formålsbasert policy ville la nettstedet si «søkeindeksering ja, AI-trening nei, brukerutløst gjenfinning kanskje» uten å gjøre robots.txt om til en adressebok over boter.
Hva dette betyr for AI-styring
Den offentlige debatten rammer ofte inn robots.txt som enten meningsfull eller foreldet. Dataene antyder et mer praktisk svar:
robots.txt er meningsfull, men overbelastet.
Den er meningsfull fordi store nettsteder bruker den, crawlere kan lese den, og policyvalg er synlige for forskere, journalister, leverandører og domstoler. Den opprinnelige rapporten fant at 17,0 % av de analyserbare toppnettstedene hadde bevisste AI-spesifikke regler. Det er ikke symbolsk støy.
Den er overbelastet fordi filen nå må uttrykke mer enn bot-tilgang:
- «Ikke tren på dette innholdet.»
- «Du kan bruke dette innholdet til søkeindeksering.»
- «Du kan bruke dette innholdet til direkte gjenfinning.»
- «Du kan ikke opprette bufrede datasett.»
- «Dette juridiske forbeholdet gjelder etter EUs lov om tekst- og dataminering.»
- «Dette CDN-administrerte nettstedet sender
Content-Signal: ai-train=no.» - «Dette nettstedet vil ha Googlebot, men ikke YandexBot.»
- «Dette nettstedet har 1 000 gamle URL-stier som ikke skal crawles.»
Grammatikken ble ikke designet for så mange oppgaver.
Tre endringer vil redusere gjelden:
-
Crawleridentitet trenger et register. Nettstedseiere bør ikke måtte vedlikeholde en stadig voksende liste over
GPTBot,ClaudeBot,anthropic-ai,CCBot,Google-Extended,Applebot-Extended,Bytespider,OAI-SearchBot,ChatGPT-Userog mange flere. Uten et register vil policy alltid ligge bak crawleratferd. -
AI-bruk trenger strukturert vokabular. Trening, gjenfinning, indeksering, oppsummering, videresalg av datasett, modelevaluering og brukerutløst browsing er forskjellige bruksformer. Å uttrykke dem gjennom leverandørspesifikke brukeragentnavn er skjør.
-
Policy trenger sporbarhet. Weben trenger en måte å skille mellom manuelt skrevne rettighetsforbehold, arvede CDN-standarder, genererte CMS-maler, utdaterte gamle regler og utilsiktede blokker-alle-regler. Skillet betyr noe for tillit og for rettstvister.
Dette betyr ikke at robots.txt skal erstattes over natten. Den bedre veien er lagdeling: behold robots.txt som oppdagelses- og kompatibilitetsflate, men standardiser en nærliggende maskinlesbar policy for AI-spesifikke bruksformer.
llms.txt er ett forsøk, men bruken i dette datasettet er fortsatt liten: bare 83 lesbare filer nevner det. Content-Signal er mer synlig fordi Cloudflare kan distribuere det gjennom infrastrukturen, og alle de 271 Content-Signal-filene i denne skanningen matchet også AI-policy-språk. Likevel er distribusjon ikke det samme som konsensus. En robust løsning trenger sannsynligvis den kjedelige standardiseringsmaskinen: tydelige felt, tydelig semantikk, crawler-forpliktelser og offentlige testsett.
Konklusjon
Kampen om AI-crawlere har gjort robots.txt til et styringsartefakt. Det er både nyttig og risikabelt.
Nyttig, fordi filen er offentlig. Forskere kan revidere den. Utgivere kan endre den. Crawlere kan respektere den. Domstoler kan lese den. Infrastrukturleverandører kan rulle den ut i stor skala.
Risikabelt, fordi den bærer for mye.
Median-robots.txt-filen i Tranco Top 10K er fortsatt liten nok til å forstå. Men den lange halen på det trafikkerte nettet er full av store, gamle, lagdelte, leverandørspesifikke og juridisk ladede filer. Hundrevis av nettsteder vedlikeholder nå robots.txt-konfigurasjoner som er bedre forstått som produksjonspolicy-systemer enn som enkle crawler-hint.
Den sentrale lærdommen er ikke at robots.txt har feilet. Den er at nettet har gitt den mer ansvar uten å omstrukturere den.
Hvis AI-tilgangspolicy skal avhenge av offentlige, maskinlesbare erklæringer, er neste steg ikke enda en lengre blokkeringsliste. Det er bedre policyinfrastruktur: formålsbaserte tillatelser, stabil crawleridentitet, gjennomgåelige maler og revisjonsspor.
Frem til da vil det offentlige nettets AI-styringslag fortsette å hvile på en tekstfil som aldri var ment å bære så mye.
Notater om reproduserbarhet
Leveringsmappen inkluderer:
source_data/analysis.json— opprinnelige aggregerte måltall.source_data/site_meta.csv— opprinnelig analytisk tabell per nettsted.source_data/bot_status.csv— opprinnelig policytabell for domene etter bot.source_data/fetch_meta.csv— opprinnelig hentemetadata.source_data/sites.csv— opprinnelig tabell over domene/kategori/status.derived_data/robots_complexity_by_site.csv— kompleksitetsmålinger per nettsted generert for denne rapporten.derived_data/search_bot_treatment.csv— matrise for behandling av søkecrawlere.derived_data/category_complexity_summary.csv— oppsummering av kompleksitet på kategorinivå.derived_data/top_config_debt_sites.csv— toppnettsteder etter prioriteringsscoren beskrevet ovenfor.derived_data/summary_metrics.json— alle hovedmåltall sitert i denne rapporten.
Last ned alle skript og datasett
Rettelser til metode, problemer med datasett og oppfølgende analyser er velkomne på support@thunderbit.com. Denne rapporten er publisert uavhengig av enhver kommersiell posisjon Thunderbit har; vi bygger en AI-drevet webskraper, og vi har en strukturell interesse i at robots.txt fortsetter å være en meningsfull, maskinlesbar kontrakt på det offentlige nettet. Dataene i denne rapporten står på egne ben. — Thunderbit research team, mai 2026.
Prøv Thunderbit for AI-webskraping Get Started Free


