Miten johtavat verkkosivustot vetävät rajan tekoälyn hakurobottien edessä

Viimeksi päivitetty May 8, 2026
Miten johtavat verkkosivustot vetävät rajan tekoälyn hakurobottien edessä

Tiivistelmä

Poimimme robots.txt-tiedoston jokaiselta verkkotunnukselta maailman eniten liikennettä saaneiden sivustojen Tranco-top 10 000 -listalla. Parsimme jokaisen RFC 9309 -yhteensopivalla parserilla, luokittelimme tiedoston sen mukaan, millaisen AI-bottipolitiikan sivusto oli ottanut käyttöön, ja laskimme, kuinka moni maailman vierailluimmista sivustoista oikeasti yrittää estää ChatGPT:tä, Claudea, Perplexityä, Geminiä, Common Crawlia, Bytespideriä, Apple Intelligenceä ja muita suuria kielimalleja kouluttavia ja palvelevia indeksoijia vuonna 2026.

Pääluvut otoksesta, jossa robots.txt oli luettavissa siististi 7 248 sivustolta:

ai-crawler-block-statistics.webp

20,3 % maailman top 10 000 -sivustoista estää vähintään yhden AI-indeksoijan. 17,0 %:lla on tarkoituksella kirjoitettu nimenomainen AI-sääntö. Loput 80 % suhtautuvat AI-indeksoijiin yhtä suopeasti kuin Googlebotiin.

Kuusi havaintoa, jotka muuttavat kokonaiskuvaa:

  • Uutissivustot estävät AI-indeksoijia 47 %:ssa tapauksista — korkein osuus kaikista toimialoista. Saksalaisessa uutismediassa osuus on 88 %, ranskalaisessa 80 % ja venäläisessä 0 %. Keskeinen ajuri on oikeusjärjestelmä, ei teknologia tai toimialan talous.
  • CCBot (Common Crawl) on eniten estetty botti, 16,3 % — ennen GPTBotia (15,8 %) ja Bytespideriä (14,9 %). Kustantajat kohdistavat estot koulutuskorrektiin, eivät mallin brändiin. Yleisin valikoiva sääntö on "estä CCBot, salli Googlebot" (14,1 % sivustoista).
  • Ranska johtaa kaikkia maita 50,6 %:n AI-estolla .fr-sivustoilla; EU-ryhmä on 16 prosenttiyksikköä maailman perustason yläpuolella. 275 robots.txt-tiedostoa viittaa nimenomaisesti EU-direktiiviin 2019/790. Artikla 4 on ainoa oikeudellinen kehys, joka näkyvästi muuttaa lukuja.
  • 17,8 % kirjoitti omat AI-sääntönsä; 4,5 % käyttää Cloudflaren toimittajapohjaista mallia; 75,7 % ei sano mitään. Suuret sivustot kirjoittavat säännöt itse; pitkä häntä käyttää kytkintä. The Atlantic ja cloudflare.com itse ovat Cloudflare Managed -listalla.
  • 108 sivustoa sallii GPTBotin nimenomaisesti — WordPress.org, Kaspersky, Norton, Avast, Sophos, The Verge, The Atlantic, NBA.com, The Sun, Branch.io. Turvallisuus- ja kehitystyökalut ovat yliedustettuina.
  • AI-politiikka ei kiristy kärjessä. Top 100, 101–1000, 1001–5000 ja 5001–10000 liikkuvat kaikki 19–23 %:n välillä. Pääluvun taso on julkisen webin ominaisuus vuonna 2026, ei merkki yksittäisen sivuston koosta.

Tarina ei enää koske sitä, "paneeko verkko vastaan". Kyse on siitä, mitkä toimialat, mitkä maat, mitkä oikeusjärjestelmät ja mitkä AI-toimittajat ovat aktiivisen politiikan kohteita — ja mitkä eivät.


I. Tausta: miten robots.txt:stä tuli AI-politiikan artefakti

Kolme voimaa on muovannut robots.txt-tiedoston merkitystä sen jälkeen, kun OpenAI julkaisi GPTBotin elokuussa 2023.

AI-toimittajia tuli lisää. Googlen Google-Extended, Anthropicin ClaudeBot, ByteDancen Bytespider, Applen Applebot-Extended, Amazonin Amazonbot, Metan Meta-ExternalAgent seurasivat kaikki perässä. Common Crawlin olemassa oleva CCBot nousi yksittäiseksi korkeimman vaikuttavuuden estokohteeksi, koska sen arkisto syöttää useimpia avoimen painon malleja. Myös muiden kuin toimittajien botteja ilmestyi: AI2Bot, cohere-ai, PerplexityBot, YouBot, DuckAssistBot, Diffbot, Omgili. Kattava vuoden 2026 estolista sisältää noin 25 nimeä.

EU:n tekijänoikeusdirektiivin 2019/790 artikla 4 loi laissa olevan tekstin- ja tiedonlouhinnan poikkeuksen, jota ei sovelleta, jos oikeudenhaltija on "nimenomaisesti pidättänyt" oikeutensa "koneellisesti luettavalla" tavalla. Koko vuosien 2024–2025 ajan EU:n kustantajat ja heidän lakimiehensä vakiinnuttivat robots.txt-tiedoston kanoniseksi tavaksi ilmaista tämä pidätys. Aineistomme osoittaa, että 275 sivustoa viittaa direktiiviin 2019/790 nimenomaisesti ja 87 mainitsee "TDM":n — painottuen eurooppalaisiin uutissivustoihin, joissa se esiintyy 4–8 rivin mittaisena juridisena alkutekstinä.

Cloudflare tuotteisti kytkimen. Vuosina 2024–2025 Cloudflare julkaisi "AI Audit" -kojelautan, "Block AI Bots" -kytkimen ja hallinnoidun robots.txt-pohjan, jossa käytetään Content-Signal: search=yes,ai-train=no -sanastoa sekä EU 2019/790 -vakiotekstiä. Toukokuuhun 2026 mennessä malli oli käytössä 4,5 %:ssa parsittavista top 10k -sivustoista. Cloudflaren tiekartassa keskustellaan julkisesti siitä, että kytkin olisi uusilla tileillä oletuksena päällä — mikä nostaisi maailmanlaajuista estotasoa 5–8 prosenttiyksikköä ilman, että yksikään kustantaja tekisi erillistä päätöstä.

robots.txt ei vuonna 2026 ole enää sama tylsä asetustiedosto kuin vuonna 2022. Siitä on tullut tekijänoikeuksien pidätysmekanismi EU:n sopimuspohjaisella tuella, toimittajavetoisesti muotoutunut politiikka-artefakti pitkän hännän palveluissa sekä hitaan neuvottelun etulinja sivustoja pyörittävien ja malleja kouluttavien välillä.


II. Menetelmä

Yritimme tehdä tästä mahdollisimman tylsän ja toistettavan. Koko putki (Python-skriptit, parsitut CSV:t, raakakopio robots.txt-arkistosta, kuviot) on julkaistu tämän raportin mukana.

Otos

Lähdimme liikkeelle toukokuun 2026 Tranco-listasta, joka ladattiin nimellä top-1m.csv.zip, ja otimme siitä ensimmäiset 10 000 riviä. Tranco yhdistää neljä alapuolen rankkausta (Cisco Umbrella, Majestic, Farsight ja Cloudflare Radar), suodattaa vakauden 30 päivän ikkunassa ja poistaa ilmeisen crawler-/CDN-kohinan. Sen tuottama lista on lähimpänä avointa kanonista "maailmanlaajuista web-liikenteen top 10k:ta" ja on standardiotanta akateemisessa web-tutkimuksessa (sitä on käytetty yli 600 vertaisarvioidussa artikkelissa sen jälkeen, kun KU Leuven julkaisi sen vuonna 2018).

Listassa on sekoitus (a) varsinaisia sivustoja, joilla ihmiset vierailevat, (b) infrastruktuuri-/API-/DNS-/CDN-juuritunnuksia, jotka eivät palvele /-polkua, sekä (c) suurten alustojen sisäiseen käyttöön tarkoitettuja verkkotunnuksia (esim. gvt1.com, apple-dns.net, googleusercontent.com). Sen sijaan että olisimme suodattaneet nämä pois etukäteen, pidimme ne kaikki mukana ja merkitsimme ne analyysikerroksessa infrastructure-luokalla. Ne putoavat luonnostaan pois, kun rajaamme tarkastelun "sivustoihin, jotka palauttivat parsittavan robots.txt:n".

Haku

Jokaiselle 10 000 verkkotunnukselle lähetimme HTTPS:n yli asynkronisen GET /robots.txt -pyynnön, ja HTTP:tä käytettiin varalla. Uudelleenohjauksia seurattiin neljään hypähdykseen asti, kokonaisaikaraja oli 12 sekuntia, rungon yläraja 500 KB ja User-Agentina käytettiin oikeaa selainta muistuttavaa merkkijonoa, jossa oli Accept-Language: en-US. Samanaikaisia pyyntöjä pidettiin 80:ssa. Ajo suoritettiin yhdestä San Franciscon asuinalueen IP-osoitteesta.

Hakutulos:

TilaMääräTulkinta
200 OK6 638robots.txt-runko palautui ja oli parsittavissa.
404 Not Found610Mitään robots.txt:ää ei ole. RFC 9309 määrittelee tämän implisiittiseksi "salli kaikki" -tilaksi.
403 Forbidden563Alkuperäpalvelin torjuu aktiivisesti robots.txt-pyynnöt. Suljettiin analyysin ulkopuolelle.
429 Too Many Requests7Lähes mitään CDN-tasoista rajoitusta tässä kokoluokassa.
fetch_failed (TLS / DNS / TCP -virhe)2 065Useimmiten CDN-juuritunnuksia (akamai.net, cloudfront.net, fastly.net, gtld-servers.net, apple-dns.net), joilla ei ole webpalvelinta polussa /. Ei "estetty" — niillä ei ole robots.txt:ää tarjottavana.
Muut 4xx/5xx117Sekalainen joukko — palvelinvirheitä, maantieteellisiä estoja, virheellisiä vastauksia.

Tämä antaa meille 7 248 sivustoa analysoitavassa otoksessa (6 638 200 + 610 404). Nuo 2 065 fetch_failed-tapausta ovat aitoja verkkotunnuksia, mutta ne ovat CDN-/DNS-juuripisteitä, eivät sivustoja joilla ihmiset käyvät, eikä niiden käsitteleminen "AI-politiikkaa" omaavina ole järkevää. Ne ovat aineistossa erillisenä saavutettavuusmittarina.

Parsinta

Jokainen 200-runko parsittiin protego-kirjastolla, joka on Scrapyn tuotannossa käyttämä RFC 9309:n Python-toteutus. Kullekin (sivusto, botti) -parille laskettiin kolme asiaa:

  1. can_fetch_root — saako botti hakea /-polun, standardin ryhmäkohtaisilla säännöillä, pisimmän täsmäyksen etusijalla ja User-agent: * -ryhmän ohittamisella, jos mukana on tätä bottia koskeva tarkka esto.
  2. has_specific_rule — sisältääkö tiedosto User-agent:-rivin, joka nimeää juuri tämän botin (kirjainkoolla ei väliä).
  3. disallow_count — kuinka monta Disallow:-määritystä vastaavassa lohkossa on; tätä käytettiin erottamaan koko sivuston laajuiset kiellot polkukohtaisista rajoituksista.

Yhdistelmä on tärkeä, koska ylälinjan "estoprosentti" peittää alleen kaksi täysin erilaista ilmiötä: brändit, jotka tarkoituksella kirjoittivat User-agent: GPTBot \n Disallow: /, koska halusivat vastustaa, sekä brändit, joiden geneerinen User-agent: * \n Disallow: / -esto (tehty alun perin testaus- tai ylläpitotarkoituksiin vuosia sitten) sattuu myös kieltämään kaikki AI-botit, joita ei ollut olemassa silloin kun malli kirjoitettiin. Koko raportissa "mikä tahansa AI-esto" sisältää molemmat; "nimenomainen AI-esto" on tätä harkittua joukkoa.

Tarkastellut botit

Seurasimme 25 bottia, jotka jaettiin kolmeen kategoriaan:

  • AI-koulutusindeksoijat (16): GPTBot, ClaudeBot, anthropic-ai, CCBot, Google-Extended, Meta-ExternalAgent, Bytespider, Applebot-Extended, Diffbot, Amazonbot, ImagesiftBot, FacebookBot, cohere-ai, AI2Bot, Omgili, Omgilibot.
  • AI-päättely- / live-hakubotit (7): PerplexityBot, Perplexity-User, ChatGPT-User, OAI-SearchBot, ClaudeBot (joka palvelee sekä koulutusta että päättelyä), YouBot, DuckAssistBot.
  • Hakuperustan botit (6): Googlebot, Bingbot, DuckDuckBot, Slurp (Yahoo), Baiduspider, YandexBot.

Jotkin botit sijoittuvat koulutus- ja päättelypuolen väliin. ClaudeBot on näkyvin esimerkki — Anthropic poisti vanhemman anthropic-ai-User-Agentin käytöstä vuonna 2024 ja käyttää nyt ClaudeBotia sekä koulutukseen että live-hakuun, joten sääntö Disallow: ClaudeBot ei enää mapitu siististi muotoon "estä koulutus mutta säilytä näkyvyys". Olemme jättäneet luokituksen sellaiseksi kuin se on ja huomauttaneet seurauksesta myöhemmin.

Toimialaluokittelu

Luokittelimme jokaisen verkkotunnuksen yhteen 16 toimialakorista (news, social, streaming, ecommerce, search, finance, infrastructure, saas, academia, dev, gov, adult, gambling, travel, telecom, unknown) kerroksittaisella menetelmällä:

  1. Tunnettu verkkotunnus -sanakirja — käsin koottu kartta noin 500 suuren liikenteen verkkotunnuksesta toimialoihin.
  2. TLD-/päätteiden mallit.govgov, .edu ja .ac.*academia, tunnistetut CDN-päätteet → infrastructure.
  3. Verkkotunnuksen nimen avainsanatnews, post, shop, bank, porn, casino jne. varasignaaleina.
  4. Aloitussivun haku — kohteille, joita kolme ensimmäistä kerrosta eivät pystyneet luokittelemaan ja jotka palauttivat robots.txt-vastauksen 200, haimme etusivun HTML:n, poimimme <title>, <meta name="description">, <meta property="og:type"> ja ajoimme avainsanapisteytyksen kielimallityylisiä toimialavihjeitä vastaan.

Tämä tuotti 3 407 sivustoa (34 %), joilla oli luotettava toimialatagi, ja 6 593, jotka jäivät unknown-luokkaan. unknown-koriin päätyi eniten muunkielisiä alueportaaleja, yritysten .com-brändisivustoja, jotka eivät sovi yksittäiseen kategoriaan, sekä pienten kielialueiden perinteisiä julkaisijoita, joille meillä ei ollut sanakirjamerkintöjä. Aina kun tässä raportissa mainitaan toimialakohtainen prosentti, nimittäjänä on kyseisen toimialan luokiteltu otos, ei koko 10 000.


III. Havainnot

Havainto 1 — Yksi viidestä suuren liikenteen sivustosta estää vähintään yhden AI-botin

7 248 analysoitavan sivuston joukossa 1 472 (20,31 %) estää vähintään yhden AI-botin. 1 230 (16,97 %):lla on harkittu AI-kohtainen sääntö. Googlebotin perustaso on 2,18 % (158 sivustoa — useimmat joko estivät kaiken ylläpitotilan oletuksena tai, kolmessa tapauksessa, olivat hakukoneita, jotka estivät kilpailijoita).

Pääluvun 20 % on 9× Googlebotin perustaso. Se on todellinen signaali — suuren liikenteen sivustot estävät AI-indeksoijan noin kymmenen kertaa todennäköisemmin kuin hakukoneindeksoijan — mutta se on myös selvästi pienempi luku kuin vuoden 2024 alusta jatkunut "AI-estäminen on tulossa kaikkialle" -tarina. Vaikka tarkastellaan webin 10 000 vierailluinta sivustoa, viisi kuudesta vaikenee AI:sta.

Ero "mikä tahansa AI-esto" (20,3 %) ja "nimenomainen AI-esto" (17,0 %) välillä on absoluuttisesti pieni mutta käsitteellisesti tärkeä. 3,3 prosenttiyksikön ero on se osuus sivustoista, jotka estävät AI-botteja vain siksi, että heidän aiempi User-agent: * \n Disallow: / -sääntönsä nappaa kaiken mikä liikkuu ohi, myös botit, joita ei ollut olemassa sääntöä kirjoitettaessa. 17,0 %:n harkittu luku kertoo puhtaammin siitä, "kuinka moni maailman suurimmista sivustoista on tehnyt AI-kohtaisen päätöksen".

Aiempiin tutkimuksiin verrattuna:

LähdePäiväysOtosEstoprosentti
Originality.aimaalis 20251 000 suosituinta uutista (englanti)35,7 % estää GPTBotin
Palewireelo 20241 500 uutisorganisaatiota36,0 % mikä tahansa AI-indeksoija
Reuters Institutekevät 202550 johtavaa uutisbrändiä, 10 maata78 % mikä tahansa AI-indeksoija
WIRED / NYTloppu 202350 suurinta yhdysvaltalaista uutissivustoa26 % estää GPTBotin
Tämä raportti (Thunderbit)touko 2026Tranco-top 10 000 (kaikki sektorit)20,3 % / 17,0 % nimenomainen

17,0 %:n nimenomainen osuus on matalampi kuin missään uutispohjaisessa tutkimuksessa, koska kaksi kolmasosaa otoksestamme ei ole uutisia. Kun rajataan 650 uutissivustoon, saadaan 47 % — samaa suuruusluokkaa kuin aiemmissa tutkimuksissa, kun otoskoostumus otetaan huomioon. Rakenteellinen kuva on johdonmukainen: uutisjoukko estää AI:ta 3–4 kertaa muuta verkkoa useammin.


Havainto 2 — Toimialojen syväluotaus: 12× ero uutisten ja telealan välillä

Kaksi vuotta kestäneen "AI scraping" -keskustelun eniten siteerattu havainto on ollut Originality.ai:n ja Palewiren luku, jonka mukaan 80 % uutistoimijoista estää GPTBotin. Meidän leikkauksemme tuottaa pienemmän mutta yhä erottuvan luvun: 47,2 % top 10 000:n uutissivustoista estää vähintään yhden AI-botin, ja 45,2 % kirjoittaa nimenomaisen AI-säännön.

Mutta "uutiset vs. kaikki muu" on liian karkea luokittelu. Täysi jakauma (toimialat, joissa n ≥ 10) kertoo paljon rikkaamman tarinan:

robots-industry-spread_compressed.webp

ToimialanMikä tahansa AI-estoNimenomainenGooglebot estettyOmat säännötCloudflare ManagedHiljainen
Uutiset65047,2 %45,2 %1,5 %46,9 %1,5 %48,5 %
Matkailu6429,7 %29,7 %0,0 %35,9 %3,1 %54,7 %
Sosiaalinen media6529,2 %23,1 %4,6 %23,1 %6,2 %66,2 %
Striimaus44020,0 %17,7 %0,7 %16,8 %3,6 %75,5 %
Rahoitus12919,4 %12,4 %0,8 %14,7 %2,3 %75,2 %
Verkkokauppa22418,3 %17,4 %0,4 %24,1 %1,3 %66,1 %
Aikuissisältö25417,3 %14,6 %0,4 %10,2 %7,9 %79,5 %
Haku1216,7 %0,0 %0,0 %0,0 %0,0 %100,0 %
Akatemia26814,6 %13,8 %0,4 %13,4 %3,4 %77,2 %
Uhkapelaaminen10014,0 %13,0 %0,0 %18,0 %4,0 %77,0 %
Kehitystyökalut12910,1 %7,8 %0,0 %8,5 %5,4 %77,5 %
SaaS3697,6 %6,2 %0,3 %9,5 %0,8 %87,5 %
Julkishallinto1725,2 %3,5 %0,0 %4,1 %0,6 %83,1 %
Infrastruktuuri474,3 %0,0 %0,0 %4,3 %2,1 %72,3 %
Teleala333,0 %3,0 %0,0 %12,1 %0,0 %78,8 %

12× ero uutisten ja telealan välillä on syy siihen, miksi "webin AI-politiikka" on väärä mittayksikkö. Yhtä lukua ei ole; on toimialakohtaisia lukuja, jotka poikkeavat toisistaan kertaluokkaa. Alla käymme läpi neljä erottuvinta havaintoa.

Uutiset: 47 % estää, 47 % kirjoittaa itse. Uutiset on ryhmä, joka kirjoitti pelikirjan. Cloudflare Managedin osuus on uutisissa vain 1,5 % — nämä kustantajat eivät ulkoista sääntöä. Tekstissä on poikkeuksellisen paljon sisältöä: NYT aloittaa 14 rivin juridisella alkutekstillä, jossa viitataan "Art. 4 of the EU Directive"; BBC aloittaa tekstillä "Please use our site like a human, not a robot... TL;DR: Browse, read, watch, enjoy — like a human."; The Sun tekstillä "The Sun does not permit the unlicensed use of our content for large language models." Tämä on robots.txt-tiedosto politiikkalausumana, ei asetuksena.

Matkailu 30 % — yllätys. Booking, Expedia, TripAdvisor, Kayak ja suuret lentoyhtiöt estävät noin kaksi kolmasosaa uutisalan tasosta. Valikoiva kuvio on johdonmukainen: keskimääräinen matkailualan estäjä kieltää 5–7 koulutus-UAA, mutta jättää päättely-UAt (PerplexityBot, ChatGPT-User, OAI-SearchBot) rauhaan. Yhdistellyt hinnat ja arvostelut ovat vallihauta; lainaukset takaisin sivustolle ovat etu. Tämä on puhtain "koulutus ulos, päättely sisään" -malli missään yksittäisessä toimialassa.

Aikuissisältö 17 % — myös yllätys. Aiemmat pienemmät otokset näyttivät nollaa. Täyden otoksen datassa 1/6 aikuissivustoista estää vähintään yhden AI-botin, ja Cloudflare Managedin osuus on korkein kaikista toimialoista (7,9 %). Yli puolet aikuissivustojen AI-estoista tulee Cloudflaren kytkimestä, ei kustantajan päätöksestä. Kuvageneraation koulutus on implisiittinen uhka — Stable Diffusion -luokan mallit oppivat visuaalisen tyylin nopeammin kuin kielimallit oppivat kirjoitustyylin.

SaaS 7,6 % on vastoin intuitiota. Ohjelmistotoimittajat ovat äänekkäin ryhmä AI-politiikasta puhuttaessa, mutta heidän robots.txt:nsä on pitkälti auki. Oikea tulkinta: SaaS-markkinointitiimit ovat tunnistaneet AI-haun jakelukanavaksi. Ne toimittajat, jotka ovat oikeasti pohtineet asiaa, valitsevat sisään, eivät ulos — nimenomainen Allow-GPTBot-lista (Havainto 12) painottuu turvallisuus- ja kehitystyökalujen SaaS-yrityksiin.

Julkishallinto 5,2 %, teleala 3,0 %, infrastruktuuri 4,3 %, dev 10,1 %. Julkisten asiakirjojen vaatimukset tekevät Disallow: / -linjasta oikeudellisesti hankalan .gov-kohteille. Telealan markkinointisivustot haluavat löydettävyyttä. CDN-juuritunnuksilla ei ole mitään suojattavaa. Kehitystyökalut nimenomaan sallivat, koska niiden sisältö saa arvoa, kun LLM:t osaavat viitata siihen.

Johtopäätös: ei ole olemassa yhtä "verkko estää / ei estä AI:ta" -lukua, joka ei hävittäisi enemmän kuin kertoisi. Toimialatasoinen raportointi on ainoa rehellinen tapa käsitellä aineistoa.


Havainto 3 — AI-toimittajakohtaisesti: ketä estetään eniten?

Toinen luonteva tapa tarkastella dataa on AI-yhtiön eikä botin mukaan. Useat toimittajat pyörittävät useita botteja (OpenAI pyörittää kolmea: GPTBot, ChatGPT-User, OAI-SearchBot; Anthropic kahta: ClaudeBot, anthropic-ai; Meta kahta: Meta-ExternalAgent, FacebookBot). Toimittajatasolle aggregointi on lähin mahdollinen vastaus kysymykseen "mitä julkinen web ajattelee kustakin AI-yhtiöstä?"

AI-toimittajaYhdistetyt botitVähintään yhtä bottia estävät sivustot% analysoitavista
Common CrawlCCBot1 17816,25 %
OpenAIGPTBot, ChatGPT-User, OAI-SearchBot1 17216,17 %
AnthropicClaudeBot, anthropic-ai1 11115,33 %
ByteDanceBytespider1 08214,93 %
MetaMeta-ExternalAgent, FacebookBot98913,65 %
GoogleGoogle-Extended97013,38 %
AmazonAmazonbot87712,10 %
AppleApplebot-Extended85911,85 %
Webz.io (Omgili)Omgili, Omgilibot73110,09 %
Coherecohere-ai7179,89 %
PerplexityPerplexityBot, Perplexity-User7159,86 %
DiffbotDiffbot6849,44 %
You.comYouBot5637,77 %
AI2 (Allen AI)AI2Bot4876,72 %
DuckDuckGoDuckAssistBot4826,65 %

Common Crawl on yksittäisenä kohteena eniten haastettu entiteetti, vaikka kyse on voittoa tavoittelemattomasta verkkoarkistosta, ei LLM-operaattorista. Syy on vipuvaikutus: CCBot syöttää lähes kaikkia avoimen painon malleja ja merkittävää osaa suljetuista. CCBotin estäminen on se sääntö, jolla kustantaja saavuttaa suurimman kattavuuden.

OpenAI, Anthropic ja ByteDance asettuvat 14–16 %:iin. OpenAI:n johtoasema johtuu osin laskentatavasta (kolme OpenAI-bottia vs. yksi botti ByteDancella). Bytespiderin 14,9 % on "Bytespider-käyttäytymisen" vaikutus — sen on dokumentoitu jättävän robots.txt:n huomiotta vuodesta 2024 lähtien, ja kustantajat estävät sitä julkisena signaalina, eivät siksi että pelkäisivät TikTokia.

Meta, Google, Amazon, Apple 12–14 % ovat toinen taso — kirjoitettu varovaisesti ennemmin kuin kannanottona. Pienemmät toimijat (Webz.io, Cohere, Perplexity, Diffbot, You.com, AI2, DuckDuckGo) 6–10 % nostetaan pääosin 3,8 %:n yleisellä lattialla; nimenomaiset säännöt heille ovat 1–4 %:n haarukassa.

xAI (Grok), Mistral ja useimmat eurooppalaiset/kiinalaiset mallilaboratoriot puuttuvat taulukosta — ne eivät ole julkaisseet dokumentoituja koulutusindeksoijan User-Agentteja. Nykyinen robots.txt-ekosysteemi on dialogi niiden yhdysvaltalaisten/kiinalaisten toimittajien välillä, jotka julkaisivat UA:t, ja niiden yhdysvaltalaisten/eurooppalaisten kustantajien välillä, jotka kirjoittivat säännöt; ne, jotka eivät julkaisseet UA:ta, ovat neuvottelussa näkymättömiä.


Havainto 4 — CCBot on uusi salamanisku, ei GPTBot

Bottien järjestys top-10k:ssä näyttää tältä:

most-blocked-ai-crawlers-vendors.webp

SijoitusBottiEstoprosenttiNimenomaisen säännön osuus
1CCBot (Common Crawl)16,25 %12,90 %
2GPTBot (OpenAI)15,84 %12,72 %
3Bytespider (ByteDance)14,93 %11,35 %
4ClaudeBot (Anthropic)14,51 %11,13 %
5Google-Extended13,38 %10,18 %
6Meta-ExternalAgent12,38 %8,95 %
7Amazonbot12,10 %8,66 %
8Applebot-Extended11,85 %8,72 %
9Omgilibot10,09 %5,31 %
10anthropic-ai (poistunut käytöstä)9,99 %6,55 %
11cohere-ai9,89 %6,42 %
12PerplexityBot9,69 %6,40 %
13Diffbot9,44 %5,95 %
14ChatGPT-User (päättely)8,90 %5,73 %
15YouBot (päättely)7,77 %4,29 %
16OAI-SearchBot (päättely)6,83 %3,66 %
perustasoGooglebot2,18 %
perustasoBingbot2,27 %

Taulukon viesti on, että julkinen web estää ensin korpuksen, ei mallibrändiä. Common Crawlin 250 miljardin sivun arkisto on ollut suurin yksittäinen koulutussyöte GPT-3:lle, GPT-4:lle, Llama 1 / 2 / 3:lle, Falconille, Mistralille, BLOOMille ja useimmille vuoden 2020 jälkeen julkaistuille avoimen painon malleille. Sivusto, joka haluaa irtautua siitä, että se on "seuraavan frontier-mallin" datassa, optimoi estämällä ensin CCBotin — kun olet pois Common Crawlista, olet käytännössä poissa avoimen lähdekoodin koulutusputkesta ilmaiseksi. GPTBot ja ClaudeBot tulevat toisena ja kolmantena, koska ne ovat kahden tietyn kaupallisen tuotteen näkyvä etupää; korpustason UA on rakenteellinen kohde.

Taulukon alempien bottien tiedot ovat myös hyödyllisiä. Omgilibot 10 %:ssa on poikkeuksellisen korkea luku botille, josta useimmat lukijat eivät ole kuulleet — sitä ajaa Webz.io, sisältödatan välittäjä, joka myy verkkoarkistoja LLM-operaattoreille, ja merkittävä joukko uutisorganisaatioita on alkanut nimetä sitä tiedostoissaan erikseen. AI2Bot 6,7 %:ssa (ja vastaava Ai2Bot-Dolma-sääntö Squarespace-sivustoilla) viittaa siihen, että myös akateeminen LLM-yhteisö saa merkintöjä kustantajilta, jotka eivät välttämättä erota "ei-kaupallista tutkimusindeksoijaa" "kaupallisesta indeksoijasta".

Päättelyklusteri — ChatGPT-User, OAI-SearchBot, YouBot, Perplexity-User — sijoittuu 4–8 prosenttiyksikköä koulutusklusterin alle. Tämä ero on vastaus pitkään jatkuneeseen politiikkakysymykseen: kyllä, suuren liikenteen sivustot erottavat bottin, joka kerää dataa tulevaa mallikoulutusta varten, ja bottin, joka tekee live-hakua vastatakseen käyttäjän kysymykseen juuri nyt. Ne eivät aina tee erottelua (yleissäännöt eivät), mutta merkittävä osa kirjoittaa säännöt niin, että koulutuspuoli kohdistetaan erikseen.


Havainto 5 — 14 % estää CCBotin mutta pitää Googlebotin tervetulleena — "estä korpus, säilytä haku" -malli

Eniten omaksuttu valikoiva sääntö top-10k:ssa:

website-crawler-blocking-stats.webp

SääntömalliSivustoja% analysoitavista
Estä CCBot, salli Googlebot1 02314,11 %
Estä Bytespider, salli Googlebot92612,78 %
Estä Google-Extended, salli Googlebot81611,26 %
Estä GPTBot, salli OAI-SearchBot6589,08 %
Estä GPTBot, salli ChatGPT-User5257,24 %
Estä CCBot, salli PerplexityBot5197,16 %
Estä anthropic-ai, salli ClaudeBot590,81 %

Eniten omaksuttu malli (14,1 %) on "estä Common Crawl, pidä Google-hakunäkyvyys." Toiseksi yleisin (12,8 %) on "estä Bytespider, pidä Google-hakunäkyvyys" — eli estetään ByteDancen maineen värittämä indeksoija, mutta jätetään oikeutettu hakuperusta koskematta. Kolmanneksi yleisin (11,3 %) on "estä Googlen oma AI-koulutus-UA mutta pidä Googlen haku-UA", mikä on juuri se jako, johon Google suunnitteli Google-Extendedin: kustantaja voi sulkea Bardin/Geminin koulutuksen ulos menettämättä hakunäkyvyyttä.

Nämä kolme lukua yhdessä kuvaavat top-10k-webin hallitsevaa politiikkalinjaa: estä koulutuskorpuksen botit, jätä haku- ja päättelybotit rauhaan. Vähemmistössä oleva malli "estä koulutus mutta salli tämän LLM:n oma live-haku-UA" — GPTBot ✗ / ChatGPT-User ✓ 7,2 %:ssa — kyllä on olemassa, mutta se on pienempi kuin korpustason leikkaukset.

anthropic-ai / ClaudeBot -rivi 0,81 %:ssa heijastaa Anthropicin vuoden 2024 UA:n poistamista käytöstä: ClaudeBot palvelee nyt sekä koulutusta että päättelyä, mikä poistaa Claudea koskevan siistin "estä koulutus, salli viittaus" -ilmaisun, jonka vanha anthropic-ai-UA mahdollisti. Tämä on vuoden 2024–2025 vähiten keskusteltu UA-suunnittelupäätös — se poisti kokonaisen politiikan ilmaisukategorian robots.txt:stä.


Havainto 6 — Uutiset yksityiskohtaisesti: maa ja kieli

Kun jaamme uutiskategorian maakohtaisen TLD:n mukaan — ja muistamme, että tämä tarkoittaa .de-päätteisiä saksalaisia uutisia, .fr-päätteisiä ranskalaisia uutisia jne., ei kielenä tarjottua sisältöä — uutisten sisäinen vaihtelu on suurempaa kuin uutisten ja muun webin välinen vaihtelu:

news-blocking-country-tld.webp

Maa (vain uutiset)nMikä tahansa AI-estoNimenomainen
🇩🇪 Saksa (.de)2588,0 %88,0 %
🇫🇷 Ranska (.fr)1580,0 %80,0 %
🇬🇧 Yhdistynyt kuningaskunta (.co.uk)1566,7 %53,3 %
🇪🇸 Espanja (.es)560,0 %60,0 %
🇮🇹 Italia (.it)1353,8 %53,8 %
Globaali uutinen (.com/.org/jne.)50045,0 %42,8 %
🇵🇱 Puola (.pl)742,9 %42,9 %
🇯🇵 Japani (.jp)1225,0 %25,0 %
🇷🇺 Venäjä (.ru)130,0 %0,0 %
🇬🇷 Kreikka (.gr)60,0 %0,0 %

Saksalainen uutismedia on koko aineiston korkein estäjä, 88 %, ja se on 88 % nimenomainen — käytännössä mikään saksalainen top 10k -uutissivusto ei salli AI-koulutusindeksoijien päästä arkistoonsa. Ryhmää johtavat Spiegel, Bild, Welt, Zeit, FAZ, Süddeutsche, Heise, Golem, Stern, Focus — koko saksalainen valtamedia sekä teknologiajulkaisijat, jotka kirjoittivat säännöt itsenäisesti. Tämän taustalla on tiheä poliittinen infrastruktuuri: VG Media, saksalaisten kustantajien yhteinen oikeuksienvalvontaorganisaatio, on ollut EU:n AI-tekijänoikeusriidoissa aggressiivisin kantajaryhmä, ja EU-direktiivin artikla 4 on toteutettu Saksan laissa §44b UrhG:nä, jossa on nimenomainen koneellisesti luettava opt-out-kieli. Siihen mennessä kun AI-toimittajat saapuivat, saksalaiset kustantajat olivat valmiimpia kuin mikään muu kansallinen ryhmä muuttamaan tämän oikeudellisen lähtökohdan robots.txt-säännöiksi.

Ranskalainen uutismedia 80 % on aivan perässä. Ranskan oikeudellinen ympäristö on samankaltainen (direktiivi 2019/790 on pantu täytäntöön Ranskan lainsäädäntöön), ja myös ryhmän käyttäytyminen on samankaltaista — lemonde.fr, lefigaro.fr, liberation.fr, lequipe.fr, 20minutes.fr, ouest-france.fr estävät kaikki, ja Le Monde -tiedosto viittaa lisäksi Ranskan droit du producteur de base de données -suojaan (tekijänoikeuslain artikla L 342-1) rinnakkaisena kotimaisena oikeusperustana. Ranskassa on lisäksi vuoden 2024 Pariisin kauppaoikeuden ratkaisu, jonka mukaan robots.txt-pohjainen opt-out riittää artiklan 4 mukaiseksi ilmoitukseksi; tämä antaa suoraa oikeuskäytännön tukea, johon mikään muu lainkäyttöalue ei toistaiseksi yllä.

Iso-Britannia 67 %:ssa on alempana, ja syy on se, että useat suuret brittiläiset kustantajat (thesun.co.uk, dailymail.co.uk, mirror.co.uk) käyttävät User-agent: * -tyyppisiä kieltoja, eivät AI-kohtaisia sääntöjä, mikä painaa nimenomaisen luvun 53 %:iin. Kokonaisvaikutus on sama — nämä sivustot eivät salli AI-indeksointia — mutta politiikka ilmaistaan muodossa "ei botteja paitsi tämä tietty hakukoneiden sallittu lista" eikä nimettyinä AI-bottiestoina. Myös oikeudellinen perusta on heikompi: Brexitin jälkeen Iso-Britannia peri artiklan 4 logiikan, mutta vastaava kotimainen oikeuskäytäntö on ohuempi.

Venäläinen uutismedia 0 %:ssa on kaikkein yllättävin rivi. Kolmetoista venäjänkielistä uutissivustoa otoksessa (dzen.ru, rbc.ru, ria.ru, kommersant.ru, tass.ru, lenta.ru, gazeta.ru, interfax.ru, kp.ru, tass.com jne.) — yksikään niistä ei estä mitään AI-indeksoijaa. Todennäköinen selitys: venäjänkielisten LLM:ien koulutusta hallitsevat Yandexin omat GPT-tyyliset mallit (jotka käyttävät Yandexin sisäisiä indeksoijia, eivät Common Crawlia), Venäjän tekijänoikeusympäristö ei ole omaksunut artikla 4:n kaltaista rakennetta, ja suuret venäläiset kustantajat näkevät länsimaalaiset LLM:t lähinnä epäolennaisina (Yhdysvaltojen vientirajoitukset jo muutenkin rajoittavat OpenAI-/Anthropic-palveluja Venäjällä) ja Yandexin kotimaisena sidosryhmänä, ei vastapuolena. Politiikkalinja on siis aidosti erilainen.

Japanilainen uutismedia 25 %:ssa muodostaa kolmannen mallin. Japanin tekijänoikeuslaissa on selvästi tekstin- ja tiedonlouhintaa koskevia poikkeuksia (tekijänoikeuslain artikla 30-4, muutettu 2018), jotka ovat sallivampia kuin EU-direktiivin artikla 4 — ne sallivat TDM:n "ei-nautintotarkoituksiin", mukaan lukien AI-koulutuksen, ilman oikeudenhaltijan suostumusta. Japanilaisilla kustantajilla on vähemmän oikeudellista vipuvoimaa opt-outiin, ja vastaavat robots.txt-luvut ovat matalampia. Ne 25 %, jotka estävät, ovat pääasiassa suurimpia ja kansainvälisimpiä kustantajia (asahi.com, nikkei.com), jotka asemoituvat enemmän globaaleiksi kuin kotimaisiksi.

Maakohtainen uutisaineisto on raportin selkein näyttö siitä, että oikeusjärjestelmä, ei teknologia tai toimialatalous, on AI-estämisen ensisijainen ajuri. EU:n uutisryhmät asettuvat 54–88 %:n välille; EU:n ulkopuoliset uutisryhmät (Venäjä, Japani, globaali .com-ryhmä) vaihtelevat 0–45 %:n välillä. 88 %:n huippu löytyy maasta, jossa artikla 4 on pisimmälle implementoitu; 0 %:n lattia maasta, jossa ei käytännössä ole AI-politiikkaan liittyvää lakia lainkaan.


Havainto 7 — EU vs. muu maailma: 16 prosenttiyksikön ero

Kun nostetaan maataso vielä ylemmäs, EU:n ja muun maailman välinen jako on selvä:

AluenMikä tahansa AI-estoNimenomainen
EU-maa-TLD:t (.fr, .de, .es, .it, .nl, .pl, .se, .dk, .fi, .be, .at, .cz, .hu, .ro, .gr, .pt, .ie, .sk, .bg)61735,2 %33,9 %
EU:n ulkopuoliset kansalliset ccTLD:t (.uk, .jp, .kr, .cn, .ru, .br, .in, .au, .mx, .ca, .tr, .ar, .cl, .co, .pe)89717,2 %13,6 %
Globaali (.com, .net, .org, jne.)5 73419,2 %15,7 %

EU-maa-TLD-sivustot estävät AI:ta kaksinkertaisella vauhdilla EU:n ulkopuoliseen kansalliseen ryhmään verrattuna ja lähes kaksinkertaisella vauhdilla globaaliin .com-perustasoon verrattuna. Ero on johdonmukainen kaikkien EU-jäsenmaiden välillä (yksikään maa ei vedä keskiarvoa yksin) ja johdonmukainen toimialojen välillä (.de-uutiset 88 %, .de-SaaS noin 12 %, .de-verkkokauppa noin 25 % — kaikki korkeampia kuin globaalit vastineensa).

Löysimme top-10k:sta 275 robots.txt-tiedostoa, jotka viittaavat kommentissa nimenomaisesti direktiiviin 2019/790 — noin 3,8 % parsittavasta otoksesta. Ryhmä painottuu EU-kustantajiin, mutta ulottuu myös niiden ulkopuolelle: useat yhdysvaltalaiset uutisbrändit (erityisesti NYT, joka viittaa suoraan "Art. 4 of the EU Directive" -kohtaan), jotkin brittiläiset sivustot ja joukko suurempia eurooppalaisia verkkokauppakohteita toistavat oikeudellisen kielen. 87 tiedostoa mainitsee "TDM" tai "text and data mining" nimeltä. 460 tiedostoa sisältää jonkinlaisen tekijänoikeusvarauksen kielen ("expressly opts out", "all rights reserved", "no commercial use", "no machine learning") silloinkin, kun ne eivät viittaa tiettyyn säädökseen.

Kaksi tarkempaa havaintoa tästä leikkauksesta:

EU-vaikutus ei rajoitu uutisiin. Kun pidämme uutiset vakiona, EU:n muut kuin uutissivustot estävät AI:ta silti korkeammalla tasolla kuin EU:n ulkopuoliset muut kuin uutissivustot (noin 28 % vs. 14 %). Pieni mutta todellinen osa EU:n SaaS-, verkkokauppa- ja akatemiasivuista on omaksunut artikla 4:n kehyksen omiin sektoreihinsa.

EU-tyylinen kieli on muuttumassa käytännön malliksi myös EU:n ulkopuolella. Cloudflare Managed robots.txt -pohja — jota käytetään globaalisti — viittaa nimenomaisesti "ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790" -kohtaan vakiotekstissään. Yhdysvaltalainen sivusto, joka kytkee Cloudflaren "Block AI Bots" -asetuksen päälle, tekee sitä ehkä edes tietämättä EU:n lakisääteisen oikeuksien pidätyksen. Tämä on yksi kiinnostavimmista politiikan siirtymän artefakteista, jonka löysimme: eurooppalainen oikeuskäsite globalisoituu yhdysvaltalaisen infrastruktuuritoimittajan käyttöliittymän kautta.


Havainto 8 — Pohjamallit ja niiden alkuperä

Mallipohjien jakauma 6 638 sivustolle, jotka palauttivat parsittavan robots.txt:n:

robots-txt-ai-bot-analysis.webp

PohjaSivustojaOsuus
Ei AI-bottia mainittu (oletus-Shopify-tyylinen, Yoast, käsin kirjoitettu ilman AI-huomiota)5 02475,7 %
Omat / DIY AI-säännöt1 18317,8 %
Cloudflare Managed (Content-Signal: search=yes,ai-train=no)3024,5 %
Nimenomainen Allow: / GPTBotille1241,9 %
Squarespace-oletus (28 AI-UA:ta polkurajoitetussa blokissa)50,1 %

DIY-säännöt hallitsevat 17,8 %:ssa. Itse kirjoitettujen estäjien joukkoa johtavat kaikki sosiaalisen median alustat (facebook.com, twitter.com, linkedin.com, whatsapp.com, tiktok.com, snapchat.com, pinterest.com, x.com, chatgpt.com itse), suurimmat verkkokauppakohteet (amazon.com, amazonvideo.com), tärkeimmät uutisbrändit (nytimes.com, cnn.com, bbc.com, theguardian.com, forbes.com, reuters.com, bbc.co.uk, t-online.de, weather.com), keskeiset striimaus-/media-alustat (netflix.com, vimeo.com, soundcloud.com, imdb.com) sekä pitkä häntä ammatillisia palveluja (canva.com, medium.com).

Cloudflare Managed on 4,5 % — paljon korkeampi kuin saman mallin läpäisy aivan käyrän kärjessä ja matalampi kuin sen levinneisyys pitkän hännän puolella tämän raportin ikkunan ulkopuolella. Malli on yleisimmin käytössä rankkausalueella 1001–10 000 (4–5 %) ja käytännössä puuttuu aivan kärjestä (Top 100: 1 sivusto käyttää sitä; Top 101–1000: 5 sivustoa). Suuret globaalit kohteet kirjoittavat sääntönsä itse; pitkä häntä käyttää toimittajan kytkintä.

Muutama erityinen Cloudflare Managed -kohde on huomionarvoinen. cloudflare.com itse käyttää mallia, mikä on johdonmukaista (Cloudflare käyttää omaa tuotettaan omalla verkkotunnuksellaan). theatlantic.com käyttää mallia — ainoa suuri yhdysvaltalainen uutisbrändi, josta löysimme, että se ei kirjoittanut omaa sääntöä. spankbang.com käyttää mallia — korkein aikuissivusto, joka otti käyttöön Cloudflare-injektoidun AI-eston. linktr.ee käyttää mallia, estäen AI-koulutuksen koko Linktree-pohjaisessa luovan työn taloudessa yhdellä toimittajapäätöksellä. launchpad.net, nexusmods.com, vinted.fr, cookielaw.org, rustdesk.com ja pitkä lista pienempiä mediakohteita täydentävät näkyvän Cloudflare Managed -ryhmän.

Cloudflaren käyttöönottokuvio on konkreettisin näyttö siitä, että suuri osa "webin AI-politiikasta" päätetään infrastruktuuritoimittajien toimesta. Absoluuttinen osuus on pieni (4,5 %), mutta rakenteellisesti tärkeä: malli on Cloudflaren oletus, ja oletuksena päällä oleva suunta seuraavan 12 kuukauden aikana on ylöspäin. Jos Cloudflare kääntää kytkimen oletuksena päälle uusille tileille, maailmanlaajuinen estoprosentti nousee materiaalisti ilman, että yksikään kustantaja tekee erillistä päätöstä.

Squarespace-oletus (5 sivustoa top-10k:ssa, mutta paljon suurempi joukko otoksemme ulkopuolella) on erilainen malli: Squarespace julkaisee robots.txt:n, jossa nimetään 28 AI-bottia yhdessä blokissa, mutta nämä botit perivät User-agent: * -ryhmän polkurajoitukset sen sijaan, että ne saisivat koko sivuston laajuisen kiellon. AI-indeksoijat voivat hakea /:n, etusivun, tuotesivut ja blogin. Ne eivät vain voi hakea /config- tai /account-polkuja. Olemme aiemmin huomauttaneet tämän olevan virheellisen positiivisen "AI-esto" -tulkinnan lähde kolmansien osapuolten Squarespace-sivustoja koskevissa skannauksissa; sama varoitus pätee tässä.


Havainto 9 — AI-politiikka on tasainen rankkausjakauman läpi

Tämän tyyppisessä tutkimuksessa tavallinen intuitio on, että eniten vierailluilla sivustoilla olisi aggressiivisin AI-politiikka — niillä on eniten menetettävää koulutuksen siirtymästä, eniten oikeudellista kapasiteettia, eniten julkista tarkastelua. Data ei tue tätä intuitiota.

RankkivälinMikä tahansa AI-estoNimenomainenCloudflare Managed
Top 1006722,4 %17,9 %1 sivusto
Top 101–1 00059822,9 %19,2 %5 sivustoa
Top 1 001–5 0002 81019,0 %15,3 %99 sivustoa
Top 5 001–10 0003 77320,8 %17,8 %197 sivustoa

Neljä laatikkoa sijoittuvat 19–23 %:n väliin. Top 100 ei ole aggressiivisempi kuin rankkialue 5001–10 000:n pitkä häntä. Pääluvulta näyttää siltä, että kyse on julkisen webin ominaisuudesta vuonna 2026, ei signaalista siitä, kuinka suuri tai näkyvä yksittäinen sivusto on.

Kaksi myötävaikuttavaa tekijää. Ensinnäkin käyrän kärki koostuu infrastruktuuri-/SaaS-/haku-/portaali-domaineista (Microsoft, Apple, Google jne.), joilla on omasta takaa matalat estotasot. Toiseksi pitkä häntä sisältää paljon alueellisia uutiskustantajia ja EU-oikeusalueen sivustoja, jotka — kuten Havainnot 6 ja 7 osoittivat — estävät AI:ta aggressiivisemmin kuin maailman keskiarvo. Kaksi vaikutusta kumoaa toisensa suunnilleen, ja lopputulos on tasainen pääluku.

Cloudflare Managed -sarakkeessa näkyy kuitenkin muutos käyrän mukana. Top 1000:ssa on 6 Cloudflare-hallittua sivustoa (1,0 %); Top 1001–10000:ssa niitä on 296 (5,7 %). Suuret sivustot kirjoittavat sääntönsä itse; pitkä häntä käyttää toimittajan kytkintä. Tämä on ainoa aineistossa näkyvä rankkiriippuva signaali, ja se viittaa siihen, että kun kuljet liikennekäyrää webin kärjestä kohti pitkää häntää, toimittajan määräämän AI-politiikan osuus nousee tasaisesti. Odotamme tämän gradientin jatkuvan top 10k:n jälkeen top 100k:hon ja pidemmälle.


Havainto 10 — Viisi anatomiaa: miltä robots.txt näyttää, kun se on oikeasti politiikkaa

Numerot kuvaavat aineiston muotoa; todellinen "AI-politiikan julkisessa webissä" luonne näkyy parhaiten yksittäisiä tiedostoja lukemalla. Tässä viisi, joihin kannattaa pysähtyä.

Anatomia 1 — The New York Times (nytimes.com)

nytimes.com/robots.txt-tiedoston ensimmäiset 14 riviä:

# New York Times content is made available for your personal, non-commercial
# use subject to our Terms of Service here:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# Use of any device, tool, or process designed to data mine or scrape the content
# using automated means is prohibited without prior written permission from
# The New York Times Company. Prohibited uses include but are not limited to:
# (1) text and data mining activities under Art. 4 of the EU Directive on Copyright in
# the Digital Single Market;
# (2) the development of any software, machine learning, artificial intelligence (AI),
# and/or large language models (LLMs);
# (3) creating or providing archived or cached data sets containing our content to others; and/or
# (4) any commercial purposes.
# Contact https://nytlicensing.com/contact/ for assistance.

Tämä on robots.txt oikeudellisena todisteena. Tiedosto on rakennettu siten, että se voidaan esittää näyttönä NYT v. OpenAI -riidassa, jonka osapuoli se on. Viittaukset "Art. 4 of the EU Directive" -kohtaan — yhdysvaltalaisen kustantajan kirjoittamana — havainnollistavat Havainnon 7 toteamusta siitä, että EU:n sääntelykehykset valuvat globaaliin keskusteluun. Nimenomainen kielto "creating or providing archived or cached data sets" kohdistuu suoraan Common Crawliin. Tiedosto on yli 60 riviä pitkä ja sisältää nimetyt User-agent-lohkot GPTBotille, OAI-SearchBotille, ChatGPT-Userille, anthropic-ai:lle, ClaudeBotille, CCBotille, Google-Extendedille, Applebot-Extendedille, Bytespiderille, Diffbotille, Meta-ExternalAgentille, Amazonbotille, Omgilille, Omgilibotille ja useille muille — jokaiselle nimetylle botille on oma Disallow: /.

Anatomia 2 — Der Spiegel (spiegel.de) — osiotason AI-sallinta

Der Spiegel on operatiivisesti kehittynein robots.txt, jonka löysimme koko aineistosta. Olennaisen lohkon sisältö:

# TLP-6507: Testweise Freischaltung der OpenAI-Suchcrawler fuer ausgewaehlte Bereiche
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

Kommentti tarkoittaa suunnilleen: "OpenAI:n hakubottien testausluonteinen vapautus valikoiduille alueille." Spiegel on sallinut seitsemän tiettyä sisältökategoriaa — ulkomaanuutiset, kumppanuudet, terveys, perhe, matkailu, psykologia ja tyyli — OpenAI:n päättely-UAlle, mutta estänyt kaiken muun. Politiikkaosastot, Saksan kotimaan uutiset ja tutkiva journalismi on nimenomaisesti suljettu pois. Common Crawl, Bytespider, Cohere, Webzio-Extended ja muut koulutus-UA:t saavat täyden Disallow: / -kiellon alempana tiedostossa.

Tämä on robots.txt osiotason toimituksellisena politiikkana. Implisiittinen teoria on, että lifestyle-sisällön koulutussiirtymän riski on pienempi ja päättelyn kautta saatava viittaushyöty suurempi, joten Spiegel sallii AI:n noutaa näitä osioita; politiikka ja tutkiva sisältö ovat vallihauta, joten AI suljetaan ulos. Emme ole nähneet tätä mallia muualla. Se viittaa sellaiseen sisäiseen koordinointiin toimituksen, lakiosaston ja infrastruktuuritiimin välillä, johon useimmat toimitukset eivät ole vielä päätyneet. Odotamme tämän tyyppisen hienojakoisen, osiotasoisen politiikka-ilmaisun leviävän vuosina 2026–2027 — Spiegelin tiedosto on käytännössä varhainen signaali.

Anatomia 3 — BBC (bbc.com) — politiikkalausuman muoto

BBC:n robots.txt alkaa näin:

# version: ec59bd036e5138eb4831a9ed44447b1ff310e235
# The BBC's Terms of Use: https://www.bbc.co.uk/terms
# - Explain the rules for using our services
# - Tell you what you can do with our content
#
# In short: Please use our site like a human, not a robot.
# That means:
# - No scraping, crawling, or systematic extraction of content
# - No use of BBC content for training or fine-tuning AI models, including LLMs
# - No retrieval-augmented generation (RAG), AI-powered search, agentic AI or
#   grounding using BBC content
# - No creating datasets from BBC content
# - No text and data mining (TDM) under Article 4 of the EU Directive on Copyright
# - No using BBC content to create summaries for your own use
# - No business use without permission
# - The BBC reserves all rights in its content and expressly opts out of any
#   statutory exceptions in any jurisdiction for text and data mining,
#   as permitted by law
#
# TL;DR: Browse, read, watch, enjoy - like a human.

BBC versionoi robots.txt-tiedostonsa (# version: ec59bd... on git-commitin hash), kieltää kahdeksan tarkkaa AI-käyttötapaa, joita BBC:n juristit seuraavat, ja päättää tekstin yhden rivin yhteenvedolla BBC:n brändin hengessä. Fraasi "expressly opts out of any statutory exceptions in any jurisdiction" on tietoinen globaali oikeuksien pidätys — se sanoo: emme luota yhdenkään oikeusjärjestelmän antavan meille haluamaamme suojaa, joten vetoamme opt-outiin kaikkialla yhtä aikaa. Tämä on aineiston eniten muotoiltu robots.txt, ja se lukee enemmän lehdistötiedotteelta kuin asetustiedostolta.

Anatomia 4 — WordPress.org — nimenomainen tervetuloa

Verrattuna edellisiin wordpress.org näyttää tältä:

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: anthropic-ai
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Bytespider
Allow: /

User-agent: CCBot
Allow: /

User-agent: Copilot
Allow: /

WordPress.org sallii nimenomaisesti yhdeksän AI-koulutusindeksoijaa, mukaan lukien kolme (Bytespider, CCBot, anthropic-ai), joita estetään muualla kaikkein useimmin. Implisiittinen teoria on, että WordPressin dokumentaatio- ja lisäosaympäristö on julkinen hyvä, jonka arvo kasvaa, kun AI-avustajat osaavat vastata sitä koskeviin kysymyksiin. Joka kerta kun joku kysyy Claude:lta "miten määritän WordPressin permalinksit?" ja Claude on koulutettu wordpress.org/documentation/-sisällöllä, WordPressin missiota on edistetty. Säätiö näyttää päättäneen, että oleminen jokaisen mallin koulutuskorpuksessa on strategisesti myönteistä, ja he ovat käyttäneet tiedoston ilmaisukykyä sanoakseen sen.

Anatomia 5 — The Verge (theverge.com) — sponsoroitu hybridi

Yksi vielä näytettävä kuvio. The Verge rakentaa AI-sääntönsä muodossa Disallow: / \ Allow: /sp/:

User-agent: GPTBot
Allow: /

User-agent: Applebot
Allow: /

User-agent: Google-Extended
Disallow: /
Allow: /sp/

User-agent: anthropic-ai
Disallow: /
Allow: /sp/

User-agent: Bytespider
Disallow: /
Allow: /sp/

User-agent: CCBot
Disallow: /
Allow: /sp/

User-agent: ChatGPT-User
Disallow: /
Allow: /sp/

User-agent: ClaudeBot
Disallow: /
Allow: /sp/

/sp/-polku on The Vergen sponsoroitu / kumppanisisältöosio. Toimituksellinen sisältö estetään AI-koulutukselta; sponsoroitu sisältö sallitaan. Taloudellinen logiikka on selvä: sponsorit maksavat siitä, että heidän sisältönsä on löydettävissä, myös AI:n kautta; toimituksellinen lippulaiva on vallihauta. GPTBot on täysin auki (oletettavasti suoran OpenAI-suhteen vuoksi), Applebot on täysin auki hakuperustaksi, ja muut saavat hybridi- käsittelyn. Tämä on ainoa löytämämme "portaittainen AI-pääsy" -rakenne.

Nämä viisi tiedostoa kuvaavat nykyisen robots.txt-AI-politiikan vaihtelun. Useimmat top 10k:n tiedostoista eivät muistuta mitään niistä — ne ovat joko hiljaisia tai käyttävät toimittajapohjaa. Ne, jotka näyttävät joltakin näistä, on kirjoitettu ihmisten toimesta, jotka ovat päättäneet, että tiedosto kannattaa lukea huolella.

Huomio tiedoston koosta: aineistomme mediaani robots.txt-rungon koko on 858 tavua — liian pieni merkityksellisen AI-politiikan ilmaisemiseen. Säännöt elävät oikeassa laidassa: 1 005 sivustolla (15,3 %) on yli 5 KB:n tiedosto, 273:lla yli 20 KB:n, ja suurin oli 248 KB. 460 tiedostossa on tekijänoikeusvarausta koskevaa kieltä; 275:ssa viitataan EU 2019/790:een nimeltä. robots.txt on vuonna 2026 yhä useammin versioitu, lakimiehen tarkistama dokumentti, ei yksi asetusrivi.


Havainto 11 — 108 sivustoa toivottaa GPTBotin nimenomaisesti tervetulleeksi

Pieni mutta näkyvä joukko kirjoittaa säännön User-agent: GPTBot \n Allow: / — käänteisen version paljon keskustellusta "Disallow GPTBot" -mallista. Otoksessamme on yhteensä 108 sivustoa, joilla on nimenomainen Allow GPTBotille juuripolulla. Tranco-sijoituksen mukaan ensimmäiset 25:

gptbot-welcoming-sites.webp

SijoitusVerkkotunnusToimiala
42wordpress.orgKehitystyökalut / CMS
133kaspersky.comTietoturva
187avast.comTietoturva
265hp.comLaitteistovalmistaja
624branch.ioMobiilianalytiikan SaaS
692sophos.comTietoturva
782theverge.comUutiset
905rambler.ruVenäläinen portaali
945kleinanzeigen.deSaksalainen markkinapaikka
948theatlantic.comUutiset
1 092lge.comLG Electronics
1 300justdial.comIntialainen paikallishaku
1 332avira.comTietoturva
1 412youm7.comEgyptiläinen uutinen
1 530goodreturns.inIntialainen raha-asiat
1 621publi24.roRomanialaiset ilmoitukset
1 807geocomply.comCompliance SaaS
1 908nba.comUrheilu
1 956oneindia.comIntialainen uutinen
1 974mindbox.ruVenäläinen SaaS
2 009thesun.co.ukUutiset
2 126vox.comUutiset
2 140mgid.comNatiivimainonta
2 314ninjarmm.comIT-hallinnan SaaS
2 323norton.comTietoturva

Muutama kuvio:

Tietoturvayritykset ovat selvästi yliedustettuina. Kaspersky, Avast, Sophos, Avira, Norton, NinjaRMM sallivat kaikki GPTBotin nimenomaisesti. Tämä on tietoinen jakelustrategia: kun käyttäjä kysyy ChatGPT:ltä "mikä on paras virustorjunta Windows-koneelleni?", se että brändi on mallin koulutuskorpuksessa vaikuttaa suoraan suositukseen. Tietoturva on yksi harvoista B2C-tuoteryhmistä, joissa AI-haku on jo korvaamassa SEO:n ensisijaisena hankintakanavana, ja nämä brändit ovat liikkeellä ensimmäisenä. Odotamme muun tietoturvakentän seuraavan 12 kuukauden kuluessa.

Jotkin suuret uutisbrändit ovat tällä listalla, eivät estolistalla. The Verge, The Atlantic, Vox, The Sun, NBA.com. Tämä ei ole ristiriita — nämä kustantajat näyttävät päättäneen, että lainattavuus ChatGPT-haussa on arvokkaampaa kuin koulutukselta suojautuminen, ja he kirjoittivat nimenomaisen Allow-säännön suojautuakseen oman CDN:n tai CMS:n tulevilta ylikielloilta. Vertaa tähän NYT / Reuters / BBC / Forbes / Guardian -linjaa, jossa kielto on nimenomainen. Molemmat linjaukset ovat puolustettavissa; uutisala ei ole monoliitti.

The Sunin läsnäolo on huomionarvoinen, koska sama sivusto käyttää tiedostossa muualla User-agent: * -kielto- kaikkea -sääntöä. The Sunin politiikka on paras lukea muodossa "AI-koulutus on kielletty, AI-haku on sallittu, ja olemme nimenomaisesti poikkeuksena sallineet GPTBotin varmistaaksemme, että ChatGPT voi vastata The Suniin viittaaviin kysymyksiin." Tämä on GPTBot-Allow-sääntöjen oikeudellisesti kehittynein versio — opt-out + yhden toimittajan opt-in.

WordPress.orgin läsnäolo on listan tärkein yksittäinen rivi. Merkittävä osa globaalista avoimen lähdekoodin CMS-ekosysteemistä joko viittaa WordPress.orgiin dokumentaatiota varten tai hostaa sieltä tulevia lisäosia. Sallimalla GPTBotin nimenomaisesti wordpress.org/robots.txt:ssä WordPress-säätiö on käytännössä sanonut, että WordPressin dokumentaatioekosysteemi on avoin koulutukselle — ja sillä on heijastusvaikutuksia siihen, kuinka hyvin Claude, Gemini ja ChatGPT osaavat vastata WordPressiä koskeviin "miten teen..." -kysymyksiin.

Jäljellä olevat 83 sivustoa täydessä Allow-GPTBot-listassa ovat pitkä häntä alueellisia uutisia, pienempiä tietoturvatoimittajia, luokitussivustoja ei-englanninkielisillä markkinoilla ja B2B SaaS:ia. Mitään toimiala-ylittyvää "Allow-GPTBot" -koordinaatiota ei ole, ainakaan mitä voimme nähdä — sääntöä omaksutaan sivusto kerrallaan, niiden operaattoreiden toimesta, jotka ovat päättäneet, että korpuksessa oleminen on strateginen positio.


Havainto 12 — llms.txt on tässä mittakaavassa tuskin edes huhu

llms.txt, ehdotettu vaihtoehtoinen tiedostomuoto LLM-ystävälliseen sisällön löytämiseen (Mintlifen, Anthropicin, Vercelin ja muutaman kehitystyökalutoimittajan ajama vuodesta 2024 loppupuolelta), näkyy aineistossamme lähes olemattomana.

Niistä 6 638 sivustosta, jotka palauttivat parsittavan robots.txt:n, 83 (1,15 %) mainitsee llms.txt:n — tavallisesti rivillä Sitemap: https://example.com/llms.txt. Se on kaksi kertaluokkaa alempi kuin sama mittari kehitystyökalupainotteisissa kauppaotoksissa, joissa Vercelin ja Mintlifen oletukset paisuttavat käyttöä.

llms-txt-robots-adoption-rate.webp

Luokkakohtainen jakauma:

Toimialan% mainitsee llms.txt:n
Infrastruktuuri474,3 %
Uhkapelaaminen1003,0 %
SaaS3693,0 %
Teleala333,0 %
Verkkokauppa2241,8 %
Matkailu641,6 %
Kehitystyökalut1291,6 %
Uutiset6500,8 %
Aikuissisältö2540,4 %
Julkishallinto1720,0 %
Akatemia2680,0 %
Haku120,0 %

llms.txt keskittyy kehitystyökalujen läheiseen SaaS:iin, uhkapelaamiseen (joka omaksuu uudet robots.txt-ominaisuudet muita säänneltyjä toimialoja nopeammin, koska niillä on compliance-tiimit, jotka ovat tottuneet lisäämään metatietoa kerroksittain), sekä B2B-verkkokauppaan. Se puuttuu näkyvästi uutisista ja julkishallinnosta — kahdesta segmentistä, jotka ovat eniten AI-politiikan kanssa tekemisissä ja joiden omaksumista tarvittaisiin, jotta standardi siirtyisi "toimittajakokeilusta" "web-protokollaksi". Siihen asti llms.txt on todellinen mutta pieni, ja loppuvuonna 2026 tehtävä seurantatarkastus on hyödyllinen uusintatesti.

Rakenteellinen ongelma llms.txt:n edessä on se, ettei sitä standardoi mikään IETF-prosessi eikä yksikään suuri AI-toimittaja ole sitoutunut kunnioittamaan sitä. robots.txt-säännön ympärillä on 30 vuoden crawler-infra; llms.txt-säännöllä ei ole mitään. Ennen kuin vähintään yksi suuri toimittaja (OpenAI, Anthropic, Google, Cloudflare) ilmoittaa muodollisen tuen, tiedosto on käytännössä Mintlify-/Vercel-ekosysteemin markkinointiartifakti. Emme odota sen muuttuvan vuonna 2026.


Havainto 13 — Saavutettavuus: robots.txt on yhä luettavissa kahdelle kolmasosalle huippuwebistä

Sivuhuomio, jonka ei ollut tarkoitus olla havainto: 66 % top 10 000 -sivustoista palautti parsittavan robots.txt:n yhdelle tutkimus-IP:lle, ja vain 7 sivustoa 10 000:sta (0,07 %) palautti 429 Too Many Requests. Tämä on hyvä uutinen robots.txt:n julkisen protokollan asemalle.

Vertailun vuoksi sama putki, ajettuna 1 008 verkkotunnuksen keskisuuren kaupan otokseen kaksi kuukautta aiemmin, sai 429-vastauksen 52 %:lta ratkaistuista verkkotunnuksista — Shopify- ja Cloudflare-CDN:t rajoittivat aggressiivisesti kaikkea muuta kuin suurten hakukoneiden User-Agentteja. Top-liikenteen web on paljon ystävällisempi: kärkipään sivustot käyttävät todennäköisemmin joko (a) vähemmän aggressiivisia bottien hallinnan tasoja tai (b) nimenomaisia allowlistoja tunnetuille tutkimusindeksoijille, tai molempia.

Top-10k:n 21 %:n fetch_failed-osuus painottuu CDN-juuritunnuksiin (akamai.net, cloudfront.net, fastly.net, apple-dns.net, gtld-servers.net), joilla ei ole webpalvelinta polussa /. Ne eivät estä meitä; niillä ei ole mitään tarjottavaa. Kun nämä jätetään pois, todellinen "yritettiin lukea mutta ei onnistunut" -virheaste on matala yksinumero.

Tämä tarkoittaa, että tämän raportin tulevat versiot — neljännesvuosittaiset tilannekuvat, vuoden takaiset vertailut — voidaan ajaa halvalla ja toistettavasti yhdellä koneella. Tarkastusikkuna pysyy auki käyrän yläosassa. Epäsymmetrinen tapaus on pitkä häntä ja kauppasegmentti, joissa CDN-tason rajoittaminen on käytännössä jo yksityistänyt robots.txt:n. Odotamme tämän eriytymisen kasvavan: top-sivustot pysyvät luettavina, koska hakukoneet vaativat luettavuutta; pitkän hännän kauppa muuttuu entistä vähemmän luettavaksi, kun Cloudflaren bottitaistelutasot kiristyvät. robots.txt:n julkinen auditointikelpoisuus jakautuu samalle linjalle, joka erottaa "näkyvän webin" "operatiivisesti suojatusta webistä".


IV. Mitä tämä kaikki tarkoittaa

Neljä väitettä, siinä järjestyksessä kuinka vahvasti data tukee niitä.

1. Internetillä on toimialakohtainen, ei globaali, AI-politiikka. 12× ero uutisten ja telealan välillä hallitsee kaikkia aggregaattilukuja. Raportointi muodossa "X % webistä estää AI:n" ilman toimialaleikkausta yliarvioi SaaS/julkishallinto/dev-segmentin ja aliarvioi uutiset/matkailun/sosiaalisen median. Toimialataso on ainoa rehellinen kehys.

2. EU:n tekijänoikeusdirektiivin artikla 4 on ainoa oikeusjärjestelmä, joka näkyvästi liikuttaa lukuja. EU-maa-TLD:t estävät AI:ta 35 %:ssa tapauksista verrattuna globaaliin 19 %:n perustasoon. Yhdysvaltojen oikeusprosessi (NYT v. OpenAI, tekijänoikeusviraston tammikuun 2025 raportti) on muuttanut Yhdysvaltain uutisryhmää mutta ei laajempaa yhdysvaltalaista webiä. EU:n viitekehys vuotaa myös globaalisti Cloudflaren pohjan kautta, joka viittaa direktiiviin 2019/790 vakiotekstissään riippumatta asiakkaan lainkäyttöalueesta.

3. Kaksi rinnakkaista "AI-politiikkaa" on ilmaistuna, eikä ne ole samaa mieltä keskenään. Harkittu, käsin kirjoitettu politiikka (17,8 %, enimmäkseen uutiset/sosiaalinen media/matkailu/verkkokauppa) ja periytynyt Cloudflare-hallittu politiikka (4,5 %) ovat sisällöltään päällekkäisiä mutta legitiimiydeltään erilaisia. Maailmassa, jossa AI-operaattorit etsivät oikeudellista selkänojaa voidakseen sivuuttaa robots.txt:n, "me kirjoitimme ja tarkastimme sen" -puolustus on rakenteellisesti vahvempi kuin "minä vain kytkin sen päälle". Riitelyn kannustin on siirtää politiikka toisesta kategoriasta ensimmäiseen.

4. Korpus, ei malli, on se mitä kustantajat estävät. CCBot 16,3 %:ssa — enemmän kuin mikään mallibrändin botti — on tästä puhtain ilmaus. OpenAI:n estäminen ei vapauta kustantajaa siitä, että se on koulutuksessa mukana; CCBotin estäminen tekee sen. 14,1 % top-10k-webistä estää CCBotin mutta pitää Googlebotin tervetulleena. "Estä koulutus, pidä haku" on vuoden 2026 yleisin AI-sääntö.

Sivustoille, jotka harkitsevat omaa linjaansa: yleisin linja on hiljaisuus — 80 % top 10k:sta ei sano AI:sta mitään. Se 17 %, joka kirjoittaa sääntöjä, painottuu Disallow-linjaan, mutta pieni ja kasvava joukko (1,5 % nimenomaisella Allow-GPTBot-listalla, jota johtavat tietoturvatoimittajat) valitsee julkisesti päinvastaisen lähestymistavan. Toimialakohtaista konsensusta ei ole, eikä sellaista tule seuraavan kahdentoista kuukauden aikana.

AI-operaattoreille: väite, että robots.txt on vanha protokolla, jonka semantiikka on epäselvä, käy yhä vaikeammaksi, kun 17 % maailman suurimmista sivustoista on kirjoittanut nimenomaiset harkitut säännöt, joissa botit nimetään käsin, ja 3,8 % tiedostoista viittaa tiettyyn EU-säädökseen pykälän numerolla. Se, noudatetaanko näitä sääntöjä, on liiketoimintapäätös; se, ovatko ne olemassa, on nyt empiirinen tosiasia.


V. Näkymät: mitä odotamme vuoden 2026 loppuun mennessä

Aineistossa näkyy kolme kehityskulkua:

Cloudflare Managed yli kaksinkertaistaa osuutensa, ja voi hyvinkin yltää yli 10 %:iin parsittavasta top-10k:sta. Cloudflaren tiekartassa keskustellaan julkisesti siitä, että Block AI Bots olisi oletuksena päällä uusilla tileillä. Jos kytkin julkaistaan oletuksena päällä, maailmanlaajuinen estoprosentti nousee 5–8 prosenttiyksikköä ilman, että yksikään kustantaja tekee päätöstä. Tiedämme tämän olevan käynnissä, kun rankkivälin 5001–10 000 Cloudflare Managed -osuus nousee nykyisen 5,7 %:n yläpuolelle.

Osiotason AI-politiikat (Spiegel-tyyppiset) leviävät suurten uutislippulaivojen keskuudessa. Taloudellinen logiikka — anna AI:n lainata matalan riskin sisältöä, suojaa vallihauta-sisältö — on niin vakuuttava, että odotamme vähintään 10 muun lippulaivatoimituksen julkaisevan osiotason sääntöjä vuoden 2026 loppuun mennessä. Seuraa ensin saksalaista ja ranskalaista keskikastia; oikeudellinen kehys palkitsee siellä kokeilun.

Nimenomainen Allow-GPTBot-ryhmä kasvaa, vetäjänä B2B SaaS ja kehitystyökalut. Kun AI-hausta tulee ohjelmistotoimittajille mitattava hankintakanava (kuten se jo on tietoturvassa), yhä useampi CMO kirjoittaa User-agent: GPTBot \n Allow: / suojautuakseen tahattomalta ylikiellolta. Odotamme 108 sivuston listan suunnilleen kaksinkertaistuvan vuoden loppuun mennessä.

Mitä emme odota: merkittävää muutosta hiljaisen enemmistön osuuteen. Se 80 % webistä, joka ei sano AI:sta mitään, sisältää toimialoja (julkishallinto, teleala, infrastruktuuri, B2B SaaS), joilla ei ole taloudellista syytä kirjoittaa sääntöä eikä oikeudellista painetta tehdä sitä. Yleistä AI-politiikkaa ei ole tulossa.


VI. Rajoitukset

  1. Yhden otoksen vinouma. Haku tehtiin 36 tunnin ikkunassa toukokuun 2026 alussa. Tiedosto muuttuu päivittäin top 100:ssa; odota 1–2 prosenttiyksikön vaihtelua kvartaalissa pääluvuissa.
  2. Toimialaluokittelun aukot. 6 593 sivustoa 10 000:sta jäi unknown-luokkaan nelikerroksisen luokittelijan jälkeen. Toimialakohtaiset prosentit ovat luotettavia siellä, missä n on suuri (uutiset: 650, striimaus: 440, saas: 369, akatemia: 268, aikuissisältö: 254, verkkokauppa: 224, julkishallinto: 172, rahoitus: 129, dev: 129) ja meluisampia alle n=30. Myös uutisten maakohtainen leikkaus on rajallinen — DE/FR/UK:ssa n≥15, kun taas Korea/Sweden/Tšekki nojaavat n=20–25:een.
  3. robots.txt on vapaaehtoinen. Disallow on pyyntö, ei este. Bytespider, PerplexityBot ja muut on dokumentoitu sääntöjen sivuuttajiksi. Mittasimme politiikkailmoituksia, emme politiikan täytäntöönpanoa.
  4. Yksittäinen yhdysvaltalainen IP. Emme saaneet lukea 21 % ratkaistuista verkkotunnuksista. Suurin osa on CDN-juuripisteitä ilman webpalvelinta; pieni osa on sivustoja, joiden CDN merkitsi meidät jo ennen alkuperäpalvelinta. Tämä vinouttaa otosta hieman vanhempaa infrastruktuuria kohti ja pois maakohtaisesti geoblokatuista sivustoista.
  5. Tranco-listan semantiikka. Tranco suodattaa vakautta; se ei ole todellinen käyttäytymisrankkaus. Kokonaisluvut kestävät listavalinnan, mutta yksittäiset sijoitukset eivät.
  6. Ei liikennetietoa. Mittasimme robots.txt-politiikkaa, emme todellista AI-bottien läpivirtausta. Politiikka ja liikenne eivät aina ole sama asia.

VII. Toista tämä

Kaikki tämän raportin tuottamiseen käytetty on toimituskansiossa.

  • tranco_top10k.csv — syötelista
  • out/sites.csv — verkkotunnus × sijoitus × toimiala × kieli × robots.txt-tila (10 000 riviä)
  • out/fetch_meta.csv — hakutulos per verkkotunnus (tila, skeema, tavut, virhe)
  • out/bot_status.csv — verkkotunnus × botti -ruudukko (250 000 riviä: estetty, on_sääntö, fetch-tila)
  • out/site_meta.csv — yksi analyyttinen rivi per sivusto (pohja, yhteenvetoboolit)
  • out/analysis.json — kaikki raportissa siteeratut mittarit
  • 01_fetch_robots.py, 02_classify.py, 03_parse_and_analyze.py — koko Python-putki

Lataa kaikki skriptit ja aineistot


Menetelmäkorjaukset, aineisto-ongelmat ja jatkoanalyysit ovat tervetulleita osoitteeseen support@thunderbit.com. Tämä raportti on julkaistu riippumatta Thunderbitin mahdollisesta kaupallisesta asemasta; rakennamme AI-pohjaista web-scraperia, ja meillä on rakenteellinen intressi siihen, että robots.txt säilyy merkityksellisenä, koneellisesti luettavana sopimuksena julkisessa webissä. Tämän raportin data seisoo omilla jaloillaan. — Thunderbitin tutkimustiimi, toukokuu 2026.

Kokeile Thunderbit AI Web Scraperia Get Started Free

Shuai Guan
Shuai Guan
Thunderbitin toimitusjohtaja | AI:n ja tiedon automaation asiantuntija Shuai Guan on Thunderbitin toimitusjohtaja ja Michiganin yliopiston insinööritieteiden alumni. Lähes kymmenen vuoden kokemuksella teknologian ja SaaS-arkkitehtuurin parissa hän on erikoistunut muuttamaan monimutkaiset tekoälymallit käytännöllisiksi, koodittomiksi tiedon poimintatyökaluiksi. Tässä blogissa hän jakaa suodattamattomia, kentällä koeteltuja näkemyksiä verkkosivujen datan keruusta ja automaatiostrategioista, jotta voit rakentaa älykkäämpiä, dataohjautuvia työnkulkuja. Kun hän ei optimoi tietotyönkulkuja, hän hyödyntää samaa tarkkuutta myös valokuvauksen parissa.
Sisällysluettelo

Poimi verkkosivu pelkällä pyynnöllä

Kerro mitä tarvitset selkeällä englannilla. Tai vielä parempaa, älä kerro mitään.

Kokeile Thunderbitiä ilmaista
Poimi dataa AI:n avulla
Siirrä data helposti Google Sheetiin, Airtableen tai Notioniin
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week