Exekutiv sammanfattning
Vi hämtade filen robots.txt för varje domän i listan Tranco top 10 000 över världens mest trafikerade webbplatser. Därefter parsade vi varje fil med en RFC 9309-kompatibel parser, klassificerade filen utifrån vilken AI-botpolicy webbplatsen har antagit och räknade hur många av världens mest besökta sajter som faktiskt försöker blockera ChatGPT, Claude, Perplexity, Gemini, Common Crawl, Bytespider, Apple Intelligence och de andra crawlers som tränar och levererar stora språkmodeller år 2026.
De viktigaste siffrorna, baserat på ett urval av 7 248 sajter vars robots.txt vi kunde läsa utan problem:

20,3 % av världens topp 10 000 sajter blockerar minst en AI-crawler. 17,0 % har skrivit en uttrycklig, AI-specifik regel med avsikt. De återstående 80 % lämnar AI-crawlers lika välkomna som Googlebot.
Sex fynd som förändrar berättelsen:
- Nyhetsorganisationer ligger på 47 % blockering — högst av alla sektorer. Tyska nyhetssajter ligger på 88 %, franska på 80 %, ryska på 0 %. Det är den juridiska ramen, inte teknik eller branschens ekonomi, som främst driver utvecklingen.
CCBot(Common Crawl) är den mest blockerade boten med 16,3 % — föreGPTBot(15,8 %) ochBytespider(14,9 %). Utgivare riktar in sig på träningskorpusen, inte modellvarumärket. Den vanligaste selektiva regeln är "blockeraCCBot, tillåtGooglebot" (14,1 % av sajterna).- Frankrike leder alla länder med 50,6 % AI-blockering på
.fr-sajter; EU-klustret ligger 16 procentenheter över det globala basvärdet. 275robots.txt-filer hänvisar uttryckligen till EU-direktiv 2019/790. Artikel 4 är den enda juridiska ram som tydligt flyttar siffrorna. - 17,8 % skrev egna AI-regler; 4,5 % kör Cloudflares leverantörsmall; 75,7 % säger ingenting. Stora sajter skriver själva; den långa svansen använder reglaget. The Atlantic och
cloudflare.comfinns själva på Cloudflares Managed-lista. - 108 sajter tillåter uttryckligen
GPTBot— WordPress.org, Kaspersky, Norton, Avast, Sophos, The Verge, The Atlantic, NBA.com, The Sun, Branch.io. Säkerhets- och utvecklingsverktyg är överrepresenterade. - AI-policy blir inte mer aggressiv ju högre upp i kurvan man kommer. Topp 100, 101–1000, 1001–5000 och 5001–10000 ligger alla mellan 19 % och 23 %. Huvudnivån är en egenskap hos det publika webben 2026, inte en signal om hur stor en enskild sajt är.
Berättelsen handlar inte längre om huruvida webben "slår tillbaka". Den handlar om vilka branscher, vilka länder, vilka juridiska regimer och vilka AI-leverantörer som blir måltavlor för aktiv policy — och vilka som inte blir det.
I. Bakgrund: hur robots.txt blev ett AI-politiskt artefakt
Tre krafter har förändrat vad robots.txt betyder sedan OpenAI lanserade GPTBot i augusti 2023.
AI-leverantörerna blev fler. Googles Google-Extended, Anthropics ClaudeBot, ByteDances Bytespider, Apples Applebot-Extended, Amazons Amazonbot och Metas Meta-ExternalAgent följde efter. Common Crawls redan existerande CCBot blev den enskilt mest effektiva blockmåltavlan eftersom dess arkiv matar de flesta öppna viktsmodeller. Även icke-leverantörsbotar dök upp: AI2Bot, cohere-ai, PerplexityBot, YouBot, DuckAssistBot, Diffbot, Omgili. En heltäckande blocklista för 2026 omfattar runt 25 namn.
Artikel 4 i EU:s upphovsrättsdirektiv 2019/790 skapade ett lagstadgat undantag för text- och datautvinning som inte gäller om rättighetshavaren har "uttryckligen förbehållit" sina rättigheter på ett "maskinläsbart" sätt. Under 2024–2025 enades EU-utgivare och deras jurister om robots.txt som den självklara vägen att uttrycka detta förbehåll. Vårt dataset visar att 275 sajter hänvisar uttryckligen till direktiv 2019/790 och 87 nämner "TDM" — koncentrerat till europeiska nyhetssajter där det ligger som en juridisk inledning på 4–8 rader.
Cloudflare gjorde reglaget till en produkt. Under 2024–2025 lanserade Cloudflare en dashboard för "AI Audit", ett reglage för "Block AI Bots" och en Managed robots.txt-mall med vokabulären Content-Signal: search=yes,ai-train=no plus standardtext för EU 2019/790. I maj 2026 körs mallen på 4,5 % av de tolkbara topp 10k. Cloudflares roadmap talar öppet om att göra reglaget förvalt för nya konton — vilket skulle flytta den globala blockeringsgraden med 5–8 procentenheter utan att någon enskild utgivare fattar ett beslut.
robots.txt år 2026 är inte längre den oansenliga konfigurationsfil den var 2022. Det är en mekanism för upphovsrättsligt förbehåll med stöd i EU-rätten, ett leverantörsformat policyartefakt i den långa svansen och frontlinjen i en långsam förhandling mellan dem som driver webbplatser och dem som tränar modeller.
II. Metod
Vi försökte göra detta så tråkigt och reproducerbart som möjligt. Hela pipelinen (Python-skript, parserade CSV-filer, rått robots.txt-arkiv, diagram) publiceras tillsammans med rapporten.
Urval
Vi utgick från Tranco-listan per maj 2026, nedladdad som top-1m.csv.zip, och tog de första 10 000 raderna. Tranco aggregerar fyra underliggande rankningar (Cisco Umbrella, Majestic, Farsight och Cloudflare Radar), filtrerar för stabilitet över ett 30-dagarsfönster och tar bort uppenbart crawler-/CDN-brus. Listan den producerar är det närmaste man kommer en kanonisk "global topp-10k för webbtrafik" som finns öppet tillgänglig, och den är standardurvalet för akademisk webbforskning (använd i över 600 peer review-granskade artiklar sedan lanseringen av KU Leuven 2018).
Listan innehåller en blandning av (a) primära webbplatser som människor besöker, (b) infrastruktur-/API-/DNS-/CDN-domäner som inte serverar något /, och (c) domäner som används internt av stora plattformar (t.ex. gvt1.com, apple-dns.net, googleusercontent.com). I stället för att förfiltrera dessa behöll vi dem alla och märkte dem med kategorin infrastructure i analyslagret. De faller naturligt bort när vi begränsar oss till "sajter som returnerade en tolkningsbar robots.txt."
Hämtning
För var och en av de 10 000 domänerna skickade vi en asynkron GET /robots.txt över HTTPS, med fallback till HTTP, omdirigeringar följda upp till fyra hopp, total timeout på 12 sekunder, en kroppstak på 500 KB och en User-Agent-sträng från en verklig webbläsare med Accept-Language: en-US. Samtidig körning hölls till 80 förfrågningar i luften. Jobbet kördes från en enda bostads-IP i San Francisco.
Hämtningsutfallet:
| Status | Antal | Tolkning |
|---|---|---|
200 OK | 6 638 | robots.txt-innehåll returnerades och kunde tolkas. |
404 Not Found | 610 | Ingen robots.txt finns. RFC 9309 definierar detta som implicit "tillåt allt." |
403 Forbidden | 563 | Ursprungservern avvisar aktivt förfrågningar om robots.txt. Exkluderad från analysen. |
429 Too Many Requests | 7 | Nästan ingen begränsning på CDN-nivå i detta ranksegment. |
fetch_failed (TLS / DNS / TCP-fel) | 2 065 | Mest CDN-apexdomäner (akamai.net, cloudfront.net, fastly.net, gtld-servers.net, apple-dns.net) som inte kör någon webbserver på /. Inte "blockerade" — de har ingen robots.txt att servera. |
| Övriga 4xx/5xx | 117 | Blandat — serverfel, geografisk begränsning, felaktiga svar. |
Detta ger oss 7 248 sajter i det analyserbara urvalet (6 638 200 + 610 404). De 2 065 fetch_failed är verkliga domäner, men de är CDN-/DNS-apexpunkter, inte sajter människor besöker, och att behandla dem som om de hade en "AI-policy" är inte meningsfullt. De ligger i datasetet som en separat tillgänglighetsstatistik.
Parsering
Varje kropp med 200 parserades med protego, en Python-implementation av RFC 9309 som används i produktion av Scrapy. För varje (sajt, bot)-par beräknade vi tre saker:
can_fetch_root— om boten får hämta/, enligt standardens semantik för regelgrupper, prioritet för längsta matchning och överskrivning avUser-agent: *av en specifik botblockering när båda finns.has_specific_rule— om filen innehåller enUser-agent:-rad som namnger just denna bot (skiftlägesokänsligt).disallow_count— hur mångaDisallow:-direktiv som finns i den matchande blocken, vilket används för att skilja fullständiga blockeringar av hela sajten från begränsningar på sökvägsnivå.
Kombinationen är viktig eftersom en rubriksiffra för "blockeringsgrad" döljer två helt olika fenomen: varumärken som medvetet skrev User-agent: GPTBot \n Disallow: / för att markera motstånd, och varumärken vars generiska User-agent: * \n Disallow: /-block (satt för staging eller underhåll för flera år sedan) råkar förbjuda även alla AI-botar som inte fanns när mallen skrevs. I hela rapporten inkluderar siffran "any AI block" båda typerna; "explicit AI block" är den medvetna delmängden.
Botar i scope
Vi följde 25 botar, grupperade i tre kategorier:
- AI-träningscrawlers (16):
GPTBot,ClaudeBot,anthropic-ai,CCBot,Google-Extended,Meta-ExternalAgent,Bytespider,Applebot-Extended,Diffbot,Amazonbot,ImagesiftBot,FacebookBot,cohere-ai,AI2Bot,Omgili,Omgilibot. - AI-inferens-/live-hämtningsbotar (7):
PerplexityBot,Perplexity-User,ChatGPT-User,OAI-SearchBot,ClaudeBot(som tjänar både träning och inferens),YouBot,DuckAssistBot. - Sökbaslinje (6):
Googlebot,Bingbot,DuckDuckBot,Slurp(Yahoo),Baiduspider,YandexBot.
Några botar ligger i gränslandet mellan träning och inferens. ClaudeBot är den tydligaste — Anthropic fasade ut den äldre UA:n anthropic-ai under 2024 och använder nu ClaudeBot för både träning och live-hämtning, så regeln Disallow: ClaudeBot mappar inte längre rent till "blockera träning men behåll synlighet." Vi har lämnat uppdelningen som den är och pekar på konsekvensen längre fram.
Branschklassificering
Vi klassificerade varje domän i en av 16 branschkategorier (news, social, streaming, ecommerce, search, finance, infrastructure, saas, academia, dev, gov, adult, gambling, travel, telecom, unknown) med en flerskiktsmetod:
- Känd domändictionary — en manuellt kuraterad karta över cirka 500 trafikstarka domäner till branscher.
- TLD-/suffixmönster —
.gov→gov,.eduoch.ac.*→academia, igenkända CDN-suffix →infrastructure. - Nyckelord i domännamn — news, post, shop, bank, porn, casino osv. som reservsignaler.
- Scrape av startsidan — för sajter som de tre första lagren inte kunde klassificera och som returnerade en
robots.txtmed200, hämtade vi startsidans HTML, extraherade<title>,<meta name="description">,<meta property="og:type">och körde en nyckelordsbaserad poängsättning mot kategoriska ledtrådar i språkmodellsstil.
Detta gav 3 407 sajter (34 %) med säkra branschtaggar och 6 593 som blev kvar som unknown. unknown-kategorin domineras av icke-engelska regionala portaler, företagsdomäner på .com som inte passar i någon enskild kategori, samt mindre språkområdespublikationer som vi inte hade ordboksuppslag för. Där rapporten anger en procent per bransch är nämnaren det klassificerade urvalet för den branschen, inte hela 10 000.
III. Resultat
Fynd 1 — En av fem sajter med hög trafik blockerar minst en AI-bot
Bland de 7 248 analyserbara sajterna blockerar 1 472 (20,31 %) minst en AI-bot. 1 230 (16,97 %) har en avsiktlig AI-specifik regel. Baslinjen för Googlebot är 2,18 % (158 sajter — de flesta av dem antingen blockerade allt som en underhållsstandard eller, i tre fall, sökmotorer som blockerar konkurrenter).
Huvudnivån 20 % är 9× Googlebot-baslinjen. Det är en verklig signal — sajter med hög trafik är en storleksordning mer benägna att blockera en AI-crawler än en sökcrawler — men det är också en klart mindre siffra än berättelsen om att "AI-blockering håller på att bli universell" som har cirkulerat i pressen sedan 2024. Även på webben med de 10 000 mest besökta sajterna är majoriteten tyst om AI.
Skillnaden mellan "any AI block" (20,3 %) och "explicit AI block" (17,0 %) är liten i absoluta tal men viktig konceptuellt. Gapet på 3,3 procentenheter motsvarar andelen sajter som bara blockerar AI-botar därför att deras befintliga regel User-agent: * \n Disallow: / fångar allt som passerar, inklusive botar som inte existerade när regeln skrevs. Siffran 17,0 % för avsiktlig blockering ger en renare bild av "hur många av världens största webbplatser som har fattat ett AI-specifikt beslut."
Jämfört med tidigare litteratur:
| Källa | Datum | Urval | Blockeringsgrad |
|---|---|---|---|
| Originality.ai | mars 2025 | 1 000 mest populära nyhetskällor (engelska) | 35,7 % blockerar GPTBot |
| Palewire | aug. 2024 | 1 500 nyhetsorganisationer | 36,0 % någon AI-crawler |
| Reuters Institute | våren 2025 | 50 ledande nyhetsvarumärken, 10 länder | 78 % någon AI-crawler |
| WIRED / NYT | slutet av 2023 | Top 50 amerikanska nyhetskällor | 26 % blockerar GPTBot |
| Denna rapport (Thunderbit) | maj 2026 | Tranco topp 10 000 (alla sektorer) | 20,3 % / 17,0 % explicit |
Vår explicita siffra på 17,0 % är lägre än i alla studier som enbart tittar på nyheter, eftersom två tredjedelar av vårt urval inte är nyheter. Begränsar man sig till de 650 nyhetssajterna får vi 47 % — inom samma intervall som tidigare studier när man justerar för urvalets sammansättning. Den strukturella bilden är konsekvent: nyhetskohorten blockerar AI 3–4 gånger oftare än resten av webben.
Fynd 2 — Branschdjupdykningar: 12× spann från nyheter till telekom
Det mest citerade fyndet i två års bevakning av "AI-scraping" har varit siffran 80 % av nyhetsmedier blockerar GPTBot från Originality.ai och Palewire. Vårt utsnitt ger en mindre men fortfarande tydlig siffra: 47,2 % av nyhetssajterna i topp 10 000 blockerar minst en AI-bot, och 45,2 % har skrivit en explicit AI-regel.
Men "nyheter kontra allt annat" är för grovt. Den fulla fördelningen (branscher med n ≥ 10 i urvalet) berättar en mycket rikare historia:

| Bransch | n | Any AI block | Explicit | Googlebot blockeras | Egna regler | Cloudflare Managed | Tyst |
|---|---|---|---|---|---|---|---|
| Nyheter | 650 | 47,2 % | 45,2 % | 1,5 % | 46,9 % | 1,5 % | 48,5 % |
| Resor | 64 | 29,7 % | 29,7 % | 0,0 % | 35,9 % | 3,1 % | 54,7 % |
| Social | 65 | 29,2 % | 23,1 % | 4,6 % | 23,1 % | 6,2 % | 66,2 % |
| Streaming | 440 | 20,0 % | 17,7 % | 0,7 % | 16,8 % | 3,6 % | 75,5 % |
| Finans | 129 | 19,4 % | 12,4 % | 0,8 % | 14,7 % | 2,3 % | 75,2 % |
| E-handel | 224 | 18,3 % | 17,4 % | 0,4 % | 24,1 % | 1,3 % | 66,1 % |
| Vuxeninnehåll | 254 | 17,3 % | 14,6 % | 0,4 % | 10,2 % | 7,9 % | 79,5 % |
| Sök | 12 | 16,7 % | 0,0 % | 0,0 % | 0,0 % | 0,0 % | 100,0 % |
| Akademi | 268 | 14,6 % | 13,8 % | 0,4 % | 13,4 % | 3,4 % | 77,2 % |
| Spel om pengar | 100 | 14,0 % | 13,0 % | 0,0 % | 18,0 % | 4,0 % | 77,0 % |
| Utvecklingsverktyg | 129 | 10,1 % | 7,8 % | 0,0 % | 8,5 % | 5,4 % | 77,5 % |
| SaaS | 369 | 7,6 % | 6,2 % | 0,3 % | 9,5 % | 0,8 % | 87,5 % |
| Myndigheter | 172 | 5,2 % | 3,5 % | 0,0 % | 4,1 % | 0,6 % | 83,1 % |
| Infrastruktur | 47 | 4,3 % | 0,0 % | 0,0 % | 4,3 % | 2,1 % | 72,3 % |
| Telekom | 33 | 3,0 % | 3,0 % | 0,0 % | 12,1 % | 0,0 % | 78,8 % |
Spannet på 12× mellan nyheter och telekom är vad som gör "webbens AI-policy" till fel analysenhet. Det finns inte en siffra; det finns sektorssiffror som skiljer sig med en storleksordning. Nedan går vi igenom de fyra mest distinkta resultaten.
Nyheter: 47 % blockering, 47 % egna regler. Nyheter är den kohort som skrev spelboken. Cloudflare Managed ligger bara på 1,5 % i nyheter — dessa utgivare lägger inte ut regeln på entreprenad. Texterna är ovanligt rika: NYT öppnar med ett 14 rader långt juridiskt förord som hänvisar till "Art. 4 of the EU Directive"; BBC med "Please use our site like a human, not a robot... TL;DR: Browse, read, watch, enjoy — like a human."; The Sun med "The Sun does not permit the unlicensed use of our content for large language models." Detta är robots.txt som policyuttalande, inte konfiguration.
Resor på 30 % — överraskningen. Booking, Expedia, TripAdvisor, Kayak och de stora flygbolagen blockerar till två tredjedelar av nyhetsnivån. Det selektiva mönstret är konsekvent: den genomsnittliga reseblockeraren förbjuder 5–7 tränings-UA:er men lämnar inferens-UA:er (PerplexityBot, ChatGPT-User, OAI-SearchBot) orörda. Aggregerad pris- och recensionsdata är vallgraven; hänvisningar tillbaka till sajten är uppsidan. Detta är det renaste mönstret för "träning ut, inferens in" i någon enskild bransch.
Vuxeninnehåll på 17 % — också en överraskning. Tidigare mindre urval visade 0 %. Helhetsdata visar att 1 av 6 vuxensajter förbjuder minst en AI-bot, med högst Cloudflare Managed-andel av alla sektorer (7,9 %). Mer än hälften av AI-blocken i vuxensegmentet kommer från Cloudflare-reglaget, inte från ett utgivarbeslut. Bildgenereringsträning är det implicita hotet — modeller i Stable Diffusion-klassen lär sig visuell stil snabbare än textmodeller lär sig skrivstil.
SaaS på 7,6 % är kontraintuitivt. Mjukvaruleverantörer är den högljuddaste gruppen i AI-policydebatten, men deras robots.txt är vidöppen. Den rätta tolkningen: SaaS-marknadsavdelningar har korrekt identifierat AI-sök som en distributionskanal. De leverantörer som faktiskt tänkt igenom detta väljer att vara med snarare än emot — listan över uttryckliga Allow-GPTBot-domäner (Fynd 12) domineras av säkerhets- och utvecklings-SaaS.
Myndigheter 5,2 %, telekom 3,0 %, infrastruktur 4,3 %, utveckling 10,1 %. Krav på offentlig insyn gör Disallow: / juridiskt besvärligt för .gov. Telekoms marknadswebbplatser vill vara sökbara. CDN-apexdomäner har inget att skydda. Utvecklingsverktyg väljer uttryckligen att vara med (deras innehåll blir mer värdefullt när LLM:er citerar det).
Slutsatsen: det finns ingen enda siffra för "webben blockerar/inte blockerar AI" som inte förlorar mer än den förmedlar. Rapportering på sektorsnivå är den enda hederliga ramen för datan.
Fynd 3 — Per AI-leverantör: vem blockeras mest?
Den andra naturliga uppdelningen av datan är efter AI-företag snarare än bot. Flera leverantörer kör flera botar (OpenAI kör tre: GPTBot, ChatGPT-User, OAI-SearchBot; Anthropic kör två: ClaudeBot, anthropic-ai; Meta kör två: Meta-ExternalAgent, FacebookBot). Att aggregera på leverantörsnivå är det närmaste vi kan komma "vad tycker det publika webben om varje AI-bolag?"
| AI-leverantör | Aggregerade botar | Sajter som blockerar ≥ 1 bot | % av analyserbara |
|---|---|---|---|
| Common Crawl | CCBot | 1 178 | 16,25 % |
| OpenAI | GPTBot, ChatGPT-User, OAI-SearchBot | 1 172 | 16,17 % |
| Anthropic | ClaudeBot, anthropic-ai | 1 111 | 15,33 % |
| ByteDance | Bytespider | 1 082 | 14,93 % |
| Meta | Meta-ExternalAgent, FacebookBot | 989 | 13,65 % |
Google-Extended | 970 | 13,38 % | |
| Amazon | Amazonbot | 877 | 12,10 % |
| Apple | Applebot-Extended | 859 | 11,85 % |
| Webz.io (Omgili) | Omgili, Omgilibot | 731 | 10,09 % |
| Cohere | cohere-ai | 717 | 9,89 % |
| Perplexity | PerplexityBot, Perplexity-User | 715 | 9,86 % |
| Diffbot | Diffbot | 684 | 9,44 % |
| You.com | YouBot | 563 | 7,77 % |
| AI2 (Allen AI) | AI2Bot | 487 | 6,72 % |
| DuckDuckGo | DuckAssistBot | 482 | 6,65 % |
Common Crawl är den enskilt mest måltavlade entiteten trots att det är ett ideellt webbarkiv, inte en LLM-operatör. Skälet är hävstång: CCBot matar nästan varje öppen viktsmodell och en betydande andel av de stängda. Att blockera CCBot först är den blockregel med störst täckning en utgivare kan skriva.
OpenAI, Anthropic, ByteDance samlas runt 14–16 %. OpenAIs ledning är delvis en räkneartefakt (tre OpenAI-botar mot en enda bot för ByteDance). Bytespiders 14,9 % är "Bytespider-beteende"-effekten — den har dokumenterats ignorera robots.txt sedan 2024, och utgivare blockerar den som en offentlig signal, inte för att de är rädda för TikTok.
Meta, Google, Amazon, Apple på 12–14 % utgör andra nivån — skrivna defensivt snarare än som ett ställningstagande. Mindre leverantörer (Webz.io, Cohere, Perplexity, Diffbot, You.com, AI2, DuckDuckGo) på 6–10 % dras mest upp av en generell bottennivå på 3,8 %; explicita regler för dem ligger i intervallet 1–4 %.
xAI (Grok), Mistral och de flesta europeiska/kinesiska modell-labb saknas i tabellen — de har inte publicerat dokumenterade UA:er för träningscrawlers. Det nuvarande robots.txt-ekosystemet är en dialog mellan amerikanska/kinesiska leverantörer som har skickat ut UA:er och amerikanska/europeiska utgivare som har skrivit regler; leverantörer som inte skickade ut något förblir osynliga i förhandlingen.
Fynd 4 — CCBot är den nya blixtavledaren, inte GPTBot
Botordningen på topp 10k ser ut så här:

| Rank | Bot | Blockeringsgrad | Grad med explicit regel |
|---|---|---|---|
| 1 | CCBot (Common Crawl) | 16,25 % | 12,90 % |
| 2 | GPTBot (OpenAI) | 15,84 % | 12,72 % |
| 3 | Bytespider (ByteDance) | 14,93 % | 11,35 % |
| 4 | ClaudeBot (Anthropic) | 14,51 % | 11,13 % |
| 5 | Google-Extended | 13,38 % | 10,18 % |
| 6 | Meta-ExternalAgent | 12,38 % | 8,95 % |
| 7 | Amazonbot | 12,10 % | 8,66 % |
| 8 | Applebot-Extended | 11,85 % | 8,72 % |
| 9 | Omgilibot | 10,09 % | 5,31 % |
| 10 | anthropic-ai (utfasad) | 9,99 % | 6,55 % |
| 11 | cohere-ai | 9,89 % | 6,42 % |
| 12 | PerplexityBot | 9,69 % | 6,40 % |
| 13 | Diffbot | 9,44 % | 5,95 % |
| 14 | ChatGPT-User (inferens) | 8,90 % | 5,73 % |
| 15 | YouBot (inferens) | 7,77 % | 4,29 % |
| 16 | OAI-SearchBot (inferens) | 6,83 % | 3,66 % |
| baslinje | Googlebot | 2,18 % | — |
| baslinje | Bingbot | 2,27 % | — |
Berättelsen som tabellen förmedlar är att den bot som det publika webben blockerar först inte är modellvarumärket — det är korpusen. Common Crawls arkiv med 250 miljarder sidor har varit den enskilt största träningsinmatningen till GPT-3, GPT-4, Llama 1 / 2 / 3, Falcon, Mistral, BLOOM och de flesta öppna viktsmodeller som släppts sedan 2020. En sajt som vill välja bort att "ingå i nästa frontier-modell" optimerar genom att först disallowa CCBot — när du inte finns i Common Crawl är du i praktiken utesluten från den öppna träningspipen utan kostnad. GPTBot och ClaudeBot kommer som två och trea eftersom de är det synliga frontend-lagret för två specifika kommersiella produkter; UA:n på korpusnivå är den strukturella måltavlan.
De AI-botar som ligger längre ned i tabellen är också informativa. Omgilibot på 10 % är ovanligt högt för en bot som de flesta läsare inte har hört talas om — den drivs av Webz.io, en innehållsdatamäklare som säljer webarkiv till LLM-operatörer, och en ansenlig grupp nyhetsorganisationer har börjat namnge den explicit i sina filer. AI2Bot på 6,7 % (och en motsvarande Ai2Bot-Dolma-regel på Squarespace-sajter) tyder på att den akademiska LLM-världen också flaggas av utgivare som inte nödvändigtvis skiljer mellan "icke-kommersiell forskningscrawler" och "kommersiell crawler."
Inferensklustret — ChatGPT-User, OAI-SearchBot, YouBot, Perplexity-User — ligger 4–8 procentenheter under träningsklustret. Det gapet är svaret på en långvarig policyfråga: ja, sajter med hög trafik skiljer mellan en bot som samlar data för framtida modellträning och en bot som gör live-hämtning för att besvara en användares fråga just nu. De gör inte alltid den skillnaden (generella regler gör det inte), men en meningsfull andel skriver regler som riktar sig specifikt mot träningssidan.
Fynd 5 — 14 % blockerar CCBot men låter Googlebot vara välkommen — mönstret "blockera korpusen, behåll sök"
Den selektiva regel som har störst spridning på topp 10k:

| Regelmönster | Sajter | % av analyserbara |
|---|---|---|
Blockera CCBot, tillåt Googlebot | 1 023 | 14,11 % |
Blockera Bytespider, tillåt Googlebot | 926 | 12,78 % |
Blockera Google-Extended, tillåt Googlebot | 816 | 11,26 % |
Blockera GPTBot, tillåt OAI-SearchBot | 658 | 9,08 % |
Blockera GPTBot, tillåt ChatGPT-User | 525 | 7,24 % |
Blockera CCBot, tillåt PerplexityBot | 519 | 7,16 % |
Blockera anthropic-ai, tillåt ClaudeBot | 59 | 0,81 % |
Det vanligaste mönstret (14,1 %) är "blockera Common Crawl, behåll synlighet i Google-sök." Tvåan (12,8 %) är "blockera Bytespider, behåll synlighet i Google-sök" — alltså blockera ByteDances reputationsmarkerade crawler men lämna sökbaslinjen intakt. Trea (11,3 %) är "blockera Googles egen AI-tränings-UA men behåll Googles sök-UA", vilket är precis den uppdelning som Google designade Google-Extended för: utgivaren väljer bort Bard/Gemini-träning utan att förlora sökrankning.
Tillsammans beskriver dessa tre siffror den dominerande policyhållningen på topp 10k-webben: förbjud träningskorpus-botar, lämna sök- och inferensbotarna orörda. Minoritetsmönstret "förbjud träning men tillåt denna LLM:s specifika live-hämtnings-UA" — GPTBot ✗ / ChatGPT-User ✓ på 7,2 % — finns, men är mindre än korpusnivåns avgränsningar.
Raden anthropic-ai / ClaudeBot på 0,81 % speglar Anthropics UA-avveckling 2024: ClaudeBot tjänar nu både träning och inferens, vilket tar bort det rena uttrycket "blockera träning, tillåt citering" för Claude som den gamla UA:n anthropic-ai möjliggjorde. Detta är det mest underdiskuterade UA-designbeslutet från 2024–2025 — det tog bort en hel klass av policyuttryck från robots.txt.
Fynd 6 — Nyheter i detalj: per land och språk
När vi delar upp nyhetskategorin efter landsdomän-TLD — med insikten att det betyder .de för tyska nyheter, .fr för franska nyheter osv., inte språket som sajten publicerar på — är variationen inom nyheter större än variationen mellan nyheter och resten:

| Land (endast nyheter) | n | Any AI block | Explicit |
|---|---|---|---|
🇩🇪 Tyskland (.de) | 25 | 88,0 % | 88,0 % |
🇫🇷 Frankrike (.fr) | 15 | 80,0 % | 80,0 % |
🇬🇧 Storbritannien (.co.uk) | 15 | 66,7 % | 53,3 % |
🇪🇸 Spanien (.es) | 5 | 60,0 % | 60,0 % |
🇮🇹 Italien (.it) | 13 | 53,8 % | 53,8 % |
Globala nyheter (.com/.org/etc) | 500 | 45,0 % | 42,8 % |
🇵🇱 Polen (.pl) | 7 | 42,9 % | 42,9 % |
🇯🇵 Japan (.jp) | 12 | 25,0 % | 25,0 % |
🇷🇺 Ryssland (.ru) | 13 | 0,0 % | 0,0 % |
🇬🇷 Grekland (.gr) | 6 | 0,0 % | 0,0 % |
Tyska nyhetssajter är det mest blockerande delsegmentet i hela datasetet med 88 %, och det är 88 % explicit — det finns i praktiken ingen tysk nyhetssajt i topp 10k som låter AI-träningscrawlers nå sitt arkiv. Kohorten leds av Spiegel, Bild, Welt, Zeit, FAZ, Süddeutsche, Heise, Golem, Stern, Focus — hela det tyska mainstream-publiseringsetablissemanget, plus teknikförlag som skrev egna regler. Den politiska infrastrukturen bakom detta är tät: VG Media, tyska utgivares kollektiva rättighetsorganisation, har varit den mest offensiva kärandekohorten i EU:s AI-upphovsrättstvister, och artikel 4 i EU-direktivet implementeras i tysk lag som §44b UrhG med uttryckligt maskinläsbart opt-out-språk. När AI-leverantörerna kom var de tyska utgivarna bättre förberedda än någon annan nationell kohort att översätta denna juridiska hållning till robots.txt-regler.
Franska nyheter på 80 % ligger strax under. Den franska juridiska miljön är liknande (direktiv 2019/790 införlivat i fransk lag), och kohortens beteende är liknande — lemonde.fr, lefigaro.fr, liberation.fr, lequipe.fr, 20minutes.fr, ouest-france.fr blockerar alla, och Le Monde-filen hänvisar dessutom till den franska droit du producteur de base de données (artikel L 342-1 i Code de la propriété intellectuelle) som en parallell inhemsk juridisk grund. Frankrike har dessutom en extra dimension i form av en dom från Paris handelsdomstol 2024 som slog fast att opt-outs baserade på robots.txt utgör tillräcklig underrättelse enligt artikel 4; detta ger direkt prejudikatstöd som ingen annan jurisdiktion ännu har matchat.
Storbritannien på 67 % ligger lägre, och orsaken är att flera stora brittiska utgivare (thesun.co.uk, dailymail.co.uk, mirror.co.uk) använder User-agent: * med blockera-allt-regler i stället för AI-specifika regler, vilket drar ned den explicita siffran till 53 %. Den samlade effekten är densamma — dessa sajter tillåter inte AI-crawling — men policyn uttrycks som "inga robotar utom denna specifika allowlist av sökmotorer" snarare än som namngivna AI-botförbud. Den juridiska ramen är också svagare: efter Brexit ärvde Storbritannien artikel 4-logiken men motsvarande nationell praxis är tunnare.
Ryska nyheter på 0 % är den mest överraskande raden. Tretton ryskspråkiga nyhetssajter i urvalet (dzen.ru, rbc.ru, ria.ru, kommersant.ru, tass.ru, lenta.ru, gazeta.ru, interfax.ru, kp.ru, tass.com, osv.) — ingen av dem blockerar någon AI-crawler. Den sannolika förklaringen: ryskspråkig LLM-träning domineras av Yandex egna GPT-liknande modeller (som använder interna Yandex-crawlers, inte Common Crawl), den ryska upphovsrättsmiljön har inte fått någon motsvarighet till artikel 4, och stora ryska utgivare ser västerländska LLM:er som en icke-fråga (USA:s exportkontroller begränsar redan OpenAI/Anthropic-tjänster i Ryssland) och Yandex som en inhemsk intressent snarare än en motpart. Policyhållningen är helt enkelt annorlunda.
Japanska nyheter på 25 % är ett tredje mönster. Japan har uttryckliga undantag för text- och datautvinning i den nationella upphovsrättslagen (artikel 30-4 i den japanska upphovsrättslagen, ändrad 2018) som är mer tillåtande än artikel 4 i EU-direktivet — de tillåter TDM för syften som inte handlar om "njutning", inklusive AI-träning, utan krav på rättighetshavarens samtycke. Japanska utgivare har mindre juridiskt utrymme för opt-out och motsvarande robots.txt-nivåer är lägre. De 25 % som faktiskt blockerar är mestadels de största, mest internationellt orienterade utgivarna (asahi.com, nikkei.com) som positionerar sig globalt snarare än inrikes.
De gränsöverskridande nyhetsdata är det tydligaste beviset i rapporten på att den juridiska ramen, inte teknik eller branschens ekonomi, är den främsta drivkraften bakom AI-blockering. EU:s nyhetskohorter ligger mellan 54 % och 88 %; nyhetskohorter utanför EU (Ryssland, Japan, den globala .com-kohorten) ligger mellan 0 % och 45 %. Toppnivån 88 % finns i det land som har den mest utvecklade artikel 4-implementeringen; bottennivån 0 % finns i landet med i praktiken ingen AI-politik alls.
Fynd 7 — EU kontra resten: ett gap på 16 procentenheter
Om man lyfter ländernivån ett steg blir skillnaden mellan EU och resten tydlig:
| Region | n | Any AI block | Explicit |
|---|---|---|---|
EU-ccTLD:er (.fr, .de, .es, .it, .nl, .pl, .se, .dk, .fi, .be, .at, .cz, .hu, .ro, .gr, .pt, .ie, .sk, .bg) | 617 | 35,2 % | 33,9 % |
Nationella ccTLD:er utanför EU (.uk, .jp, .kr, .cn, .ru, .br, .in, .au, .mx, .ca, .tr, .ar, .cl, .co, .pe) | 897 | 17,2 % | 13,6 % |
Globalt (.com, .net, .org, etc.) | 5 734 | 19,2 % | 15,7 % |
EU-ccTLD-sajter blockerar AI i dubbelt så hög grad som den nationella kohorten utanför EU och nästan dubbelt så högt som den globala .com-baslinjen. Skillnaden är konsekvent över EU:s medlemsstater (ingen enskild stat driver medelvärdet) och konsekvent över branscher (.de-nyheter på 88 %, .de-SaaS på cirka 12 %, .de-e-handel på cirka 25 % — alla högre än sina globala motsvarigheter).
Vi hittade 275 robots.txt-filer i topp 10k som uttryckligen hänvisar till direktiv 2019/790 i sina kommentarer — ungefär 3,8 % av det tolkningsbara urvalet. Kohorten domineras av EU-utgivare men sträcker sig bortom dem: flera amerikanska nyhetsvarumärken (särskilt NYT, som direkt hänvisar till "Art. 4 of the EU Directive"), vissa brittiska sajter och en handfull större europeiska e-handelsdestinationer återger det juridiska språket. 87 filer nämner "TDM" eller "text and data mining" vid namn. 460 filer innehåller någon form av upphovsrättsförbehållsspråk ("expressly opts out," "all rights reserved," "no commercial use," "no machine learning") även där de inte hänvisar till en specifik lagparagraf.
Två mer finmaskiga observationer från detta snitt:
EU-effekten gäller inte bara nyheter. När vi håller nyheter konstanta blockerar EU:s icke-nyhetssajter fortfarande AI i högre grad än icke-EU:s icke-nyhetssajter (ungefär 28 % mot 14 %). En liten men verklig andel EU-baserad SaaS, e-handel och akademi har internaliserat artikel 4-ramen för sina egna sektorer.
Det EU-färgade språket håller på att bli en de facto-mall även utanför EU. Cloudflares Managed robots.txt-mall — som används globalt — hänvisar uttryckligen till "ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790" i sin standardtext. En amerikansk sajt som slår på Cloudflares inställning "Block AI Bots" hävdar, utan att nödvändigtvis veta om det, ett EU-lagstadgat rättighetsförbehåll. Detta är en av de mer intressanta policyartefakter vi hittat: ett europeiskt juridiskt koncept globaliseras genom en amerikansk infrastrukturs leverantörsgränssnitt.
Fynd 8 — Mallar och mallursprung
Fördelningen av mallursprung för de 6 638 sajter som returnerade en tolkningsbar robots.txt:

| Mall | Sajter | Andel |
|---|---|---|
| Ingen AI-bot nämnd (standard Shopify-lik, Yoast, handskriven utan AI-hänsyn) | 5 024 | 75,7 % |
| Egna / manuella AI-regler | 1 183 | 17,8 % |
Cloudflare Managed (Content-Signal: search=yes,ai-train=no) | 302 | 4,5 % |
Explicit Allow: / för GPTBot | 124 | 1,9 % |
| Squarespace-standard (28 AI-UA:er i det sökvägsbegränsade blocket) | 5 | 0,1 % |
Egna regler dominerar med 17,8 %. Kohorten av självskrivna blockerare leds av varje social medieplattform (facebook.com, twitter.com, linkedin.com, whatsapp.com, tiktok.com, snapchat.com, pinterest.com, x.com, chatgpt.com självt), de största e-handelsdestinationerna (amazon.com, amazonvideo.com), de stora nyhetsvarumärkena (nytimes.com, cnn.com, bbc.com, theguardian.com, forbes.com, reuters.com, bbc.co.uk, t-online.de, weather.com), centrala streaming-/mediabolag (netflix.com, vimeo.com, soundcloud.com, imdb.com) samt en lång svans av tjänstesajter (canva.com, medium.com).
Cloudflare Managed ligger på 4,5 % — betydligt högre än samma mall hade i kurvans allra topp och lägre än dess andel i den långa svansen utanför detta rapports fönster. Mallen används mest i segmentet rank 1001–10 000 (4–5 %) och är i princip frånvarande i själva toppen av kurvan (Top 100: 1 sajt använder den; Top 101–1000: 5 sajter). De stora globala aktörerna skriver egna regler; den långa svansen använder reglaget.
Några specifika Cloudflare Managed-sajter är värda att notera. cloudflare.com kör själv mallen, vilket är logiskt (Cloudflare äter sin egen hundmat på sin egen domän). theatlantic.com kör mallen — det enda stora amerikanska nyhetsvarumärke vi hittade som inte skrev en egen regel. spankbang.com kör mallen — den högst rankade vuxensajten som antagit ett Cloudflare-injicerat AI-block. linktr.ee kör mallen, vilket blockerar AI-träning över hela Linktree-hostade kreatörsekonomin i ett enda leverantörsbeslut. launchpad.net, nexusmods.com, vinted.fr, cookielaw.org, rustdesk.com och en lång lista av mindre medieegendomar rundar av den synliga Cloudflare Managed-kohorten.
Cloudflares antagningsmönster är det mest konkreta bevis vi sett på att en stor del av "webbens AI-policy" avgörs av infrastruktursleverantörer. Den absoluta andelen är liten (4,5 %) men strukturellt viktig: mallen är standarden Cloudflare levererar, och banan för att standardläget ska slås på under nästa 12-månadersperiod är uppåt. Om Cloudflare slår reglaget till förvalt för nya konton flyttas den globala blockeringsgraden materiellt utan att någon enskild utgivare fattar ett beslut.
Squarespace-standard (5 sajter i topp 10k, men en mycket större kohort utanför vårt urval) är ett annat mönster: Squarespace levererar en robots.txt som namnger 28 AI-botar i ett enda block, men dessa botar ärver sökvägsbegränsningarna i User-agent: * snarare än att få ett block över hela sajten. AI-crawlers kan hämta /, startsidan och produktsidorna, bloggen. De kan bara inte hämta /config eller /account. Vi har tidigare flaggat detta som källan till falskt positiva "AI-block" i tredjepartsskanningar av Squarespace-sajter; samma brasklapp gäller här.
Fynd 9 — AI-policy är jämn över rankfördelningen
Den vanliga intuitionen för den här typen av studie är att de mest besökta sajterna skulle ha den mest aggressiva AI-policyn — de har mest att förlora på träningsförskjutning, störst juridisk kapacitet, mest offentlig granskning. Datan stödjer inte den intuitionen.
| Rank-bucket | n | Any AI block | Explicit | Cloudflare Managed |
|---|---|---|---|---|
| Top 100 | 67 | 22,4 % | 17,9 % | 1 sajt |
| Top 101–1 000 | 598 | 22,9 % | 19,2 % | 5 sajter |
| Top 1 001–5 000 | 2 810 | 19,0 % | 15,3 % | 99 sajter |
| Top 5 001–10 000 | 3 773 | 20,8 % | 17,8 % | 197 sajter |
De fyra bucketarna ligger mellan 19 % och 23 %. Top 100 är inte mer aggressiv än långsvansen rank 5001–10 000. Huvudnivån verkar vara en egenskap hos det publika webben 2026, inte en signal om hur stor eller framträdande en enskild sajt är.
Två bidragande faktorer. För det första domineras kurvans topp av infrastruktur-/SaaS-/sök-/portal-domäner (Microsoft, Apple, Google osv.) som i sig har låga AI-blockeringsgrader. För det andra innehåller den långa svansen en hög andel regionala nyhetsutgivare och EU-jurisdiktionssajter som — som Fynd 6 och 7 visade — blockerar AI mer aggressivt än det globala genomsnittet. De två effekterna tar ungefär ut varandra, och nettoresultatet blir en jämn huvudnivå.
Kolumnen Cloudflare Managed förskjuts däremot över kurvan. Top 1000 har 6 Cloudflare-managed sajter (1,0 %); Top 1001–10 000 har 296 (5,7 %). De stora sajterna skriver själva; den långa svansen använder leverantörsreglaget. Detta är den enda meningsfulla rankberoende signalen i datasetet, och den antyder att ju längre ned i trafikkurvan man går från webbsidans topp mot den långa svansen, desto större blir andelen AI-policy som sätts av leverantör snarare än utgivare. Vi förväntar oss att denna gradient fortsätter bortom topp 10k och in i topp 100k och längre.
Fynd 10 — Fem anatomier: hur robots.txt ser ut när det faktiskt är en policy
Siffror beskriver datasetets form; den faktiska karaktären av "AI-policy på det publika webben" blir bäst synlig när man läser enskilda filer. Här är fem som förtjänar uppmärksamhet, valda för att spänna över policyutrymmet.
Anatom 1 — New York Times (nytimes.com)
De första 14 raderna i nytimes.com/robots.txt:
# New York Times content is made available for your personal, non-commercial
# use subject to our Terms of Service here:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# Use of any device, tool, or process designed to data mine or scrape the content
# using automated means is prohibited without prior written permission from
# The New York Times Company. Prohibited uses include but are not limited to:
# (1) text and data mining activities under Art. 4 of the EU Directive on Copyright in
# the Digital Single Market;
# (2) the development of any software, machine learning, artificial intelligence (AI),
# and/or large language models (LLMs);
# (3) creating or providing archived or cached data sets containing our content to others; and/or
# (4) any commercial purposes.
# Contact https://nytlicensing.com/contact/ for assistance.
Detta är robots.txt som juridisk bevisning. Filen är strukturerad för att kunna läggas fram som bevis i den pågående NYT v. OpenAI-tvisten. Hänvisningarna till "Art. 4 of the EU Directive" — från en amerikansk utgivare — illustrerar Fynd 7:s observation att EU:s lagramar läcker in i den globala diskursen. Det uttryckliga förbudet mot "creating or providing archived or cached data sets" riktar sig rakt mot Common Crawl. Filen är över 60 rader lång med namngivna User-agent-block för GPTBot, OAI-SearchBot, ChatGPT-User, anthropic-ai, ClaudeBot, CCBot, Google-Extended, Applebot-Extended, Bytespider, Diffbot, Meta-ExternalAgent, Amazonbot, Omgili, Omgilibot och ett halvdussin andra — varje namngiven bot får sitt eget Disallow: /.
Anatom 2 — Der Spiegel (spiegel.de) — sektionsnivå för AI-tillstånd
Der Spiegel är den mest operativt sofistikerade robots.txt vi fann i hela datasetet. Det relevanta blocket:
# TLP-6507: Testweise Freischaltung der OpenAI-Suchcrawler fuer ausgewaehlte Bereiche
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /
User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /
Kommentaren översätts till "Testvis aktivering av OpenAI:s sökcrawlers för utvalda områden." Spiegel har vitlistat sju specifika innehållskategorier — utrikesnyheter, partnerskap, hälsa, familj, resor, psykologi och livsstil — för OpenAIs inferens-UA:er samtidigt som allt annat blockeras. De politiska sektionerna, tyska inrikesnyheterna och den granskande journalistiken är uttryckligen uteslutna. Common Crawl, Bytespider, Cohere, Webzio-Extended och de andra tränings-UA:erna får fullt Disallow: / längre ned i filen.
Detta är robots.txt som sektionsnivåns redaktionella policy. Den underförstådda teorin är att livsstilsinnehåll har lägre risk för träningsförskjutning och högre uppsida i form av citering i inferens, så Spiegel tillåter AI att exponera dessa sektioner; politik och granskande innehåll är vallgraven, så AI utestängs. Vi har inte sett detta mönster någon annanstans. Det antyder en nivå av intern samordning mellan redaktion, juridik och infrastruktur som de flesta nyhetsredaktioner inte nått ännu. Vi förväntar oss att denna typ av finmaskigt policyuttryck sprids under 2026–2027 — Spiegels fil är i praktiken en ledande indikator.
Anatom 3 — BBC (bbc.com) — policyuttalandets form
BBC:s robots.txt inleds med:
# version: ec59bd036e5138eb4831a9ed44447b1ff310e235
# The BBC's Terms of Use: https://www.bbc.co.uk/terms
# - Explain the rules for using our services
# - Tell you what you can do with our content
#
# In short: Please use our site like a human, not a robot.
# That means:
# - No scraping, crawling, or systematic extraction of content
# - No use of BBC content for training or fine-tuning AI models, including LLMs
# - No retrieval-augmented generation (RAG), AI-powered search, agentic AI or
# grounding using BBC content
# - No creating datasets from BBC content
# - No text and data mining (TDM) under Article 4 of the EU Directive on Copyright
# - No using BBC content to create summaries for your own use
# - No business use without permission
# - The BBC reserves all rights in its content and expressly opts out of any
# statutory exceptions in any jurisdiction for text and data mining,
# as permitted by law
#
# TL;DR: Browse, read, watch, enjoy - like a human.
BBC versionsätter sin robots.txt (strängen # version: ec59bd... är ett git commit-hash), förbjuder de åtta specifika typer av AI-användning som BBC:s jurister följer och avslutar med en enradssammanfattning i det berättande tonfall som BBC:s varumärke bygger på. Formuleringen "expressly opts out of any statutory exceptions in any jurisdiction" är ett medvetet globalt förbehåll — det säger vi litar inte på att någon enskild juridisk regim ger oss det skydd vi vill ha, så vi hävdar opt-out överallt samtidigt. Detta är den mest juristpräglade robots.txt-filen i datasetet, och den läser mer som ett pressmeddelande än en konfigurationsfil.
Anatom 4 — WordPress.org — det explicita välkomnandet
Jämför allt ovan med wordpress.org:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Bytespider
Allow: /
User-agent: CCBot
Allow: /
User-agent: Copilot
Allow: /
WordPress.org väljer uttryckligen att släppa in nio AI-träningscrawlers, inklusive de tre (Bytespider, CCBot, anthropic-ai) som oftast blockeras någon annanstans. Den underförstådda teorin är att WordPress dokumentation och plugin-ekosystem är ett allmännyttigt goda vars värde ökar när AI-assistenter kan svara på frågor om det. Varje gång någon frågar Claude "hur konfigurerar jag permalänkar i WordPress?" och Claude har tränats på wordpress.org/documentation/, har WordPress uppdrag tjänats. Stiftelsen verkar ha bestämt sig för att vara med i varje modells träningskorpus är ett strategiskt plus, och de har använt filens uttrycksfulla grammatik för att säga det.
Anatom 5 — The Verge (theverge.com) — den sponsrade hybriden
Ett sista mönster värt att visa. The Verge strukturerar sina AI-regler som Disallow: / \ Allow: /sp/:
User-agent: GPTBot
Allow: /
User-agent: Applebot
Allow: /
User-agent: Google-Extended
Disallow: /
Allow: /sp/
User-agent: anthropic-ai
Disallow: /
Allow: /sp/
User-agent: Bytespider
Disallow: /
Allow: /sp/
User-agent: CCBot
Disallow: /
Allow: /sp/
User-agent: ChatGPT-User
Disallow: /
Allow: /sp/
User-agent: ClaudeBot
Disallow: /
Allow: /sp/
Sökvägen /sp/ är The Verges avdelning för sponsrat/partnerinnehåll. Redaktionellt innehåll blockeras från AI-träning; sponsrat innehåll tillåts. Den ekonomiska logiken är tydlig: sponsorer betalar för att deras innehåll ska vara upptäckbart, även genom AI; det redaktionella flaggskeppet är vallgraven. GPTBot är fullt öppet (sannolikt som ett direkt samarbete med OpenAI), Applebot är fullt öppet som sökbaslinje, och resten får den hybrida behandlingen. Detta är den enda "tierade AI-åtkomsten" av sitt slag vi fann.
Dessa fem filer beskriver dagens spann av AI-policy i robots.txt. De flesta filer i topp 10k liknar ingen av dem — de är antingen tysta eller använder en leverantörsmall. De som liknar någon av dessa har skrivits av personer som har bestämt att filen är värd att läsa noggrant.
En notering om filstorlek: medianstorleken på robots.txt i vårt urval är 858 byte — för liten för att rymma en meningsfull AI-policy. Det är i den högra svansen reglerna lever: 1 005 sajter (15,3 %) har en fil större än 5 KB, 273 större än 20 KB, och maxvärdet var 248 KB. 460 filer innehåller upphovsrättsreservationsspråk; 275 citerar EU 2019/790 vid namn. En robots.txt år 2026 är i allt högre grad ett versionsstyrt, juristgranskat dokument, inte en konfigurationsrad.
Fynd 11 — 108 sajter välkomnar uttryckligen GPTBot
En liten men synlig kohort skriver regeln User-agent: GPTBot \n Allow: / — motsatsen till det mer omtalade "Disallow GPTBot". Totalt i vårt urval finns 108 sajter med ett uttryckligt Allow för GPTBot på rotvägen. De första 25 efter Tranco-rankning:

| Rank | Domän | Sektor |
|---|---|---|
| 42 | wordpress.org | Utvecklingsverktyg / CMS |
| 133 | kaspersky.com | Säkerhet |
| 187 | avast.com | Säkerhet |
| 265 | hp.com | Hårdvarutillverkare |
| 624 | branch.io | SaaS för mobil attribution |
| 692 | sophos.com | Säkerhet |
| 782 | theverge.com | Nyheter |
| 905 | rambler.ru | Rysk portal |
| 945 | kleinanzeigen.de | Tysk marknadsplats |
| 948 | theatlantic.com | Nyheter |
| 1 092 | lge.com | LG Electronics |
| 1 300 | justdial.com | Lokal sökning i Indien |
| 1 332 | avira.com | Säkerhet |
| 1 412 | youm7.com | Egyptiska nyheter |
| 1 530 | goodreturns.in | Indisk finans |
| 1 621 | publi24.ro | Rumänska annonser |
| 1 807 | geocomply.com | Compliance-SaaS |
| 1 908 | nba.com | Sport |
| 1 956 | oneindia.com | Indiska nyheter |
| 1 974 | mindbox.ru | Rysk SaaS |
| 2 009 | thesun.co.uk | Nyheter |
| 2 126 | vox.com | Nyheter |
| 2 140 | mgid.com | Native advertising |
| 2 314 | ninjarmm.com | IT-hanterings-SaaS |
| 2 323 | norton.com | Säkerhet |
Några mönster:
Säkerhetsföretag är tydligt överrepresenterade. Kaspersky, Avast, Sophos, Avira, Norton och NinjaRMM tillåter alla GPTBot uttryckligen. Det är en medveten distributionsstrategi: när en användare frågar ChatGPT "vilket antivirus är bäst för min Windows-dator?" påverkar det direkt rekommendationen om varumärket finns i modellens träningskorpus. Säkerhet är en av få B2C-produktkategorier där AI-sök redan håller på att ersätta SEO som primär förvärvskanal, och dessa varumärken har rört sig först. Vi förväntar oss att resten av säkerhetskohorten följer efter inom 12 månader.
Några stora nyhetsvarumärken finns på denna lista, inte på blocklistan. The Verge, The Atlantic, Vox, The Sun, NBA.com. Detta är inte en motsägelse — dessa utgivare verkar ha bedömt att det är mer värdefullt att vara citerbar i ChatGPT-sök än att skyddas från träning, och de skrev den explicita Allow-regeln för att skydda mot framtida överblockering via CDN eller CMS. Jämför med hållningen hos NYT / Reuters / BBC / Forbes / Guardian med uttryckligt Disallow. Båda ståndpunkterna är försvarbara; nyhetsbranschen är inte monolitisk.
The Sun-inslaget är anmärkningsvärt eftersom samma sajt använder en User-agent: *-regel som blockerar allt annat i filen. The Suns policy bör bäst läsas som "AI-träning är förbjuden, AI-sök är tillåten, och vi har uttryckligen vitlistat GPTBot som ett undantag från deny-all för att säkerställa att ChatGPT kan svara på frågor som citerar The Sun." Detta är den mest juridiskt sofistikerade av GPTBot-Allow-reglerna — ett opt-out plus ett enda leverantörs-opt-in.
WordPress.orgs närvaro är den enskilt mest betydelsefulla posten på listan. En inte obetydlig del av det globala open-source CMS-ekosystemet länkar antingen till WordPress.org för dokumentation eller hostar plugins därifrån. Genom att uttryckligen tillåta GPTBot i wordpress.org/robots.txt har WordPress Foundation i praktiken sagt att WordPress dokumentationsekosystem är öppet för träning — vilket får följdeffekter för hur väl Claude, Gemini och ChatGPT kan svara på "hur gör jag ..."-frågor om WordPress.
De återstående 83 sajterna i hela Allow-GPTBot-listan utgör en lång svans av regionala nyheter, mindre säkerhetsleverantörer, klassificeringsplattformar på icke-engelska marknader och B2B-SaaS. Så vitt vi kan se finns ingen motsvarande branschomfattande "Allow-GPTBot"-samordning — regeln antas en sajt i taget, av operatörer som har bestämt sig för att vara i korpusen är den strategiska positionen.
Fynd 12 — llms.txt är knappt ens en ryktesspridning i denna skala
llms.txt, det föreslagna alternativa filformatet för LLM-vänlig innehållsupptäckt (drivet av Mintlify, Anthropic, Vercel och ett fåtal utvecklingsverktygsleverantörer sedan slutet av 2024), har synlig spridning nästan ingenstans i vårt urval.
Av de 6 638 sajter som returnerade en tolkbar robots.txt nämner 83 (1,15 %) llms.txt — vanligtvis som raden Sitemap: https://example.com/llms.txt. Det är två tiopotenser lägre än samma mått i handelsurval med mycket utvecklingsverktyg-innehåll där Vercel- och Mintlify-standarder blåser upp adoptionen.

Fördelning per kategori:
| Bransch | n | % som nämner llms.txt |
|---|---|---|
| Infrastruktur | 47 | 4,3 % |
| Spel om pengar | 100 | 3,0 % |
| SaaS | 369 | 3,0 % |
| Telekom | 33 | 3,0 % |
| E-handel | 224 | 1,8 % |
| Resor | 64 | 1,6 % |
| Utvecklingsverktyg | 129 | 1,6 % |
| Nyheter | 650 | 0,8 % |
| Vuxeninnehåll | 254 | 0,4 % |
| Myndigheter | 172 | 0,0 % |
| Akademi | 268 | 0,0 % |
| Sök | 12 | 0,0 % |
llms.txt är koncentrerat till SaaS i anslutning till utvecklingsverktyg, spel om pengar (som antar nya robots.txt-funktioner snabbare än andra reglerade branscher eftersom de har compliance-team som är vana att lägga på extra metadata) samt B2B-e-handel. Det lyser med sin frånvaro i nyheter och myndigheter — de två segment som är mest engagerade i AI-policy och vars adoption skulle krävas för att standarden ska ta steget från "leverantörsexperiment" till "webbprotokoll." Tills dess är llms.txt verkligt men litet, och en uppföljande granskning sent 2026 blir ett användbart omtest.
Det strukturella problem som llms.txt står inför är att det inte standardiseras av någon IETF-process och att de stora AI-leverantörerna inte har bundit sig att respektera det. En robots.txt-regel har 30 års crawler-infrastruktur byggd kring sig; en llms.txt-regel har det inte. Tills minst en stor leverantör (OpenAI, Anthropic, Google, Cloudflare) deklarerar formellt stöd är filen i praktiken ett marknadsföringsartefakt från Mintlify/Vercel-ekosystemet. Vi förväntar oss inte att det förändras under 2026.
Fynd 13 — Tillgänglighet: robots.txt är fortfarande läsbar för två tredjedelar av toppwebben
En sidoobservation som egentligen inte skulle bli ett fynd: 66 % av topp 10 000-sajterna returnerade en tolkningsbar robots.txt till en enda forsknings-IP, och endast 7 av 10 000 (0,07 %) returnerade 429 Too Many Requests. Detta är goda nyheter för robots.txt som offentligt protokoll.
Som jämförelse fick samma pipeline, körd på ett mellanstort handelsurval med 1 008 domäner två månader tidigare, 429 från 52 % av de upplösta domänerna — Shopify- och Cloudflare-CDN:er som aggressivt begränsar alla UA:er som inte är en stor sökmotor. Webben med hög trafik är betydligt vänligare: toppsajter har oftare antingen (a) mindre aggressiva bot-hanteringsnivåer, eller (b) uttryckliga allowlists för kända forskningscrawlers, eller båda.
fetch_failed-graden på 21 % i topp 10k domineras av CDN-apexdomäner (akamai.net, cloudfront.net, fastly.net, apple-dns.net, gtld-servers.net) som inte kör någon webbserver på /. De blockerar oss inte; de har inget att servera. Om dessa exkluderas ligger den faktiska "försökte läsa men kunde inte"-felfrekvensen på ensiffriga låga tal.
Detta betyder att framtida versioner av denna rapport — kvartalsvisa ögonblicksbilder, jämförelser år över år — kan köras billigt och reproducerbart på en enda maskin. Granskningsfönstret förblir öppet i kurvans topp. Det asymmetriska fallet är den långa svansen och handelssegmentet, där CDN-nivåns begränsningar i praktiken redan har privatiserat robots.txt. Vi förväntar oss att denna skillnad växer: toppsajterna förblir läsbara eftersom de indexeras av sökmotorer som kräver läsbarhet; långsvansens handel blir mindre läsbar när Cloudflares bot-fight-nivåer blir mer aggressiva. Den offentliga granskbarheten av robots.txt håller på att delas upp längs samma linje som skiljer "det synliga webben" från "det operativt skyddade webben."
IV. Vad allt detta betyder
Fyra påståenden, i ordning efter hur starkt datan stödjer dem.
1. Internet har en AI-policy per bransch, inte en global policy. Spannet på 12× mellan nyheter och telekom dominerar varje aggregerad siffra. Att rapportera "X % av webben blockerar AI" utan ett sektorsnitt överskattar SaaS/myndigheter/utveckling och underskattar nyheter/resor/socialt. Sektor för sektor är den enda hederliga ramen.
2. Artikel 4 i EU:s upphovsrättsdirektiv är den enda juridiska regim som tydligt flyttar siffrorna. EU-ccTLD-sajter blockerar på 35 % mot det globala basvärdet 19 %. Den amerikanska rättstvisten (NYT mot OpenAI, Copyright Offices rapport i januari 2025) har förändrat den amerikanska nyhetskohorten men inte den bredare amerikanska webben. EU-ramen läcker också globalt genom Cloudflares mall, som citerar direktiv 2019/790 i standardtexten oavsett kundens jurisdiktion.
3. Två parallella "AI-policyer" uttrycks och de överensstämmer inte med varandra. Den avsiktliga, handskrivna policyn (17,8 %, mest nyheter/socialt/resor/e-handel) och den ärvda Cloudflare-hanterade policyn (4,5 %) överlappar i sak men skiljer sig i legitimitet. I en värld där AI-operatörer letar efter juridiskt stöd för att ignorera robots.txt är försvaret "vi skrev och granskade den" strukturellt starkare än "jag slog bara på reglaget." Rättstvistsincitamentet är att flytta policy från den andra kategorin till den första.
4. Det är korpusen, inte modellen, som utgivarna blockerar. CCBot på 16,3 % — högre än någon modellvarumärkesbot — är det tydligaste uttrycket för detta. Att disallowa OpenAI gör inte att en utgivare slipper bli träningsdata; att disallowa CCBot gör det. 14,1 % av topp 10k-webben blockerar CCBot men låter Googlebot vara välkommen. Mönstret "blockera träning, behåll sök" är den normala AI-regeln 2026.
För sajter som överväger sin egen hållning: den vanligaste hållningen är tystnad — 80 % av topp 10k säger ingenting om AI. De 17 % som skriver regler lutar åt Disallow, men en liten, växande kohort (listan med 1,5 % uttrycklig Allow-GPTBot, ledd av säkerhetsleverantörer) väljer offentligt det motsatta. Det finns ingen branschöverenskommelse och det kommer inte att finnas någon under de kommande tolv månaderna.
För AI-operatörer: det blir allt svårare att hävda att robots.txt är ett gammalt protokoll med tvetydig semantik när 17 % av världens största sajter har skrivit tydliga medvetna regler där botar nämns för hand, och 3,8 % av filerna hänvisar till specifika EU-paragrafer. Om dessa regler ska respekteras är ett affärsbeslut; att de finns är nu ett empiriskt faktum.
V. Utsikter: vad vi förväntar oss vid slutet av 2026
Tre utvecklingslinjer syns i datasetet:
Cloudflare Managed kommer att mer än fördubbla sin andel och plausibelt nå över 10 % av den tolkbara topp 10k. Cloudflares roadmap diskuterar öppet standard-på för Block AI Bots för nya konton. Om reglaget levereras som standard-på flyttas den globala blockeringsgraden upp 5–8 procentenheter utan att någon utgivare fattar ett beslut. Vi vet att detta händer när Cloudflare Managed-andelen i bucketen rank 5001–10 000 stiger över dagens 5,7 %.
Sektionsnivåns AI-policyer (Spiegel-stilen) kommer att spridas bland de stora nyhetsflaggskeppen. Den ekonomiska logiken — låt AI citera låg-risk-innehåll, skydda vallgravsinnehållet — är tillräckligt övertygande för att vi ska förvänta oss minst 10 ytterligare flaggskeppsredaktioner med sektionsnivåregler vid slutet av 2026. Håll först koll på den tyska och franska mellanstora pressen; den juridiska ramen belönar experiment där.
Kohorten med explicit Allow-GPTBot kommer att växa, ledd av B2B-SaaS och utvecklingsverktyg. När AI-sök blir en mätbar förvärvskanal för mjukvaruleverantörer (som det redan är för säkerhet) kommer den marginala CMO:n att skriva User-agent: GPTBot \n Allow: / för att skydda mot oavsiktlig överblockering. Vi förväntar oss att listan med 108 sajter ungefär fördubblas till årsskiftet.
Vad vi inte förväntar oss: någon meningsfull förändring i andelen tysta majoriteten. De 80 % av webben som inte säger något om AI omfattar sektorer (myndigheter, telekom, infrastruktur, B2B-SaaS) som saknar ekonomiskt skäl att skriva en regel och ingen juridisk press att göra det. En universell AI-policy är inte på väg.
VI. Begränsningar
- En enda ögonblicksbild. Hämtningarna skedde under ett 36-timmarsfönster i början av maj 2026. Filer ändras dagligen i topp 100; räkna med 1–2 procentenheters förskjutning per kvartal i huvudmåtten.
- Luckor i branschklassificeringen. 6 593 av 10 000 sajter förblev
unknownefter den fyralagda klassificeraren. Procentsatser per bransch är robusta där n är stort (nyheter: 650, streaming: 440, saas: 369, akademi: 268, vuxeninnehåll: 254, e-handel: 224, myndigheter: 172, finans: 129, utveckling: 129) och brusigare under n=30. Likaså är landsnittet för nyheter begränsat — DE/FR/UK har n≥15, medan Korea/Sverige/Tjeckien vilar på n=20–25. robots.txtär frivillig. EttDisallowär en begäran, inte en spärr.Bytespider,PerplexityBotoch andra har dokumenterats ignorera regler. Vi mätte policydeklarationer, inte policyefterlevnad.- En enda IP, USA-baserad granskning. Vi kunde inte läsa 21 % av de upplösta domänerna. De flesta är CDN-apexpunkter utan webbserver; en mindre andel är sajter vars CDN flaggade oss innan vi nådde ursprunget. Detta snedvrider urvalet något mot äldre infrastruktur och mot sajter som geografiskt skyddas efter ursprungsland.
- Tranco-listans semantik. Tranco filtrerar för stabilitet; det är inte en sann användarbeteenderanking. Aggregerade siffror är robusta mot listval; specifika rankpositioner är det inte.
- Ingen trafikdata. Vi mätte
robots.txt-policy, inte faktisk genomströmning för AI-botar. Policy och trafik överensstämmer inte alltid.
VII. Reproducera detta
Allt som användes för att ta fram denna rapport finns i leveransmappen.
- tranco_top10k.csv — inmatningslista
- out/sites.csv — domän × rank × bransch × språk × robots.txt-status (10 000 rader)
- out/fetch_meta.csv — hämtningsutfall per domän (status, schema, bytes, fel)
- out/bot_status.csv — domän × bot-grid (250 000 rader: blocked, has_rule, fetch_status)
- out/site_meta.csv — en analytisk post per sajt (mall, sammanfattande booleska värden)
- out/analysis.json — varje mått som citeras i rapporten
- 01_fetch_robots.py, 02_classify.py, 03_parse_and_analyze.py — hela Python-pipelinen
Ladda ned alla skript och dataset
Rättelser i metodik, datasetproblem och uppföljande analyser välkomnas på support@thunderbit.com. Denna rapport publiceras oberoende av någon kommersiell position Thunderbit har; vi bygger en AI-driven webbscraper, och vi har ett strukturellt intresse av att robots.txt fortsätter vara ett meningsfullt, maskinläsbart kontrakt på det publika webben. Datan i denna rapport står på egna ben. — Thunderbits researchteam, maj 2026.
Testa Thunderbit AI Web Scraper Get Started Free


