Jak největší weby vytyčují hranice pro AI crawlery

Poslední aktualizace May 8, 2026
Jak největší weby vytyčují hranice pro AI crawlery

Shrnutí pro vedení

Stáhli jsme soubor robots.txt pro každou doménu v seznamu Tranco top 10 000 nejnavštěvovanějších webů na světě. Každý soubor jsme pak prošli parserem v souladu s RFC 9309, zařadili podle toho, jakou politiku vůči AI botům daný web zavedl (pokud vůbec nějakou), a spočítali, kolik z nejnavštěvovanějších webů světa se ve skutečnosti snaží blokovat ChatGPT, Claude, Perplexity, Gemini, Common Crawl, Bytespider, Apple Intelligence a další crawlery, které v roce 2026 trénují a obsluhují velké jazykové modely.

Hlavní čísla na vzorku 7 248 webů, jejichž robots.txt jsme dokázali spolehlivě přečíst:

ai-crawler-block-statistics.webp

20,3 % z největších 10 000 webů na světě blokuje alespoň jednoho AI crawlra. 17,0 % má napsané výslovné pravidlo zaměřené na AI. Zbývajících 80 % nechává AI crawlery vítané stejně jako Googlebot.

Šest zjištění, která mění celý příběh:

  • Zpravodajská média blokují v 47 % případů — nejvíc ze všech sektorů. Německá média vedou s 88 %, francouzská s 80 %, ruská s 0 %. Hlavním motorem je právní režim, ne technologie ani ekonomika odvětví.
  • CCBot (Common Crawl) je nejčastěji blokovaný bot s 16,3 % — před GPTBot (15,8 %) a Bytespider (14,9 %). Vydavatelé cílí na trénovací korpus, ne na značku modelu. Nejrozšířenější selektivní pravidlo je „blokovat CCBot, povolit Googlebot“ (14,1 % webů).
  • Francie vede mezi zeměmi s 50,6 % blokování AI na doménách .fr; skupina EU je o 16 bodů nad globálním základem. 275 souborů robots.txt výslovně odkazuje na směrnici EU 2019/790. Článek 4 je jediný právní režim, který na číslech skutečně něco mění.
  • 17,8 % webů si napsalo vlastní AI pravidla; 4,5 % používá vendor šablonu od Cloudflare; 75,7 % mlčí. Velké weby si pravidla píšou samy; dlouhý ocas používá přepínač. The Atlantic i samotný cloudflare.com jsou na seznamu Cloudflare Managed.
  • 108 webů výslovně povoluje GPTBot — WordPress.org, Kaspersky, Norton, Avast, Sophos, The Verge, The Atlantic, NBA.com, The Sun, Branch.io. Nadprůměrně zastoupené jsou bezpečnostní firmy a vývojářské nástroje.
  • AI politika není přísnější na špici. Top 100, 101–1000, 1001–5000 i 5001–10000 se pohybují mezi 19 % a 23 %. Hlavní číslo je vlastností veřejného webu v roce 2026, ne signálem o velikosti jednotlivého webu.

Příběh už není o tom, zda se web „brání“. Jde o to, které obory, které země, které právní režimy a kteří AI vendori jsou cílem aktivní politiky — a kteří ne.


I. Pozadí: jak se robots.txt stal artefaktem AI politiky

Od chvíle, kdy OpenAI v srpnu 2023 nasadilo GPTBot, proměnily význam robots.txt tři síly.

AI vendori se rozmnožili. Objevily se Google-Extended od Googlu, ClaudeBot od Anthropicu, Bytespider od ByteDance, Applebot-Extended od Applu, Amazonbot od Amazonu, Meta-ExternalAgent od Mety. Dříve existující CCBot od Common Crawl se stal nejvýhodnějším cílem pro blokování, protože jeho archiv napájí většinu open-weight modelů. Přibyli i neboti od vendorů: AI2Bot, cohere-ai, PerplexityBot, YouBot, DuckAssistBot, Diffbot, Omgili. Komplexní blokovací seznam pro rok 2026 čítá zhruba 25 názvů.

Článek 4 směrnice EU o autorském právu 2019/790 zavedl zákonnou výjimku pro text a data mining, která neplatí, pokud držitel práv svá práva „výslovně vyhradil“ „strojově čitelným“ způsobem. Během let 2024–2025 se vydavatelé v EU a jejich právníci shodli, že právě robots.txt je kanonický způsob, jak takovou výhradu vyjádřit. Naše data ukazují, že 275 webů explicitně cituje směrnici 2019/790 a 87 zmiňuje „TDM“ — hlavně evropská média, kde to bývá 4–8řádkový právní úvod.

Cloudflare z přepínače udělal produkt. V letech 2024–2025 Cloudflare uvedl dashboard „AI Audit“, přepínač „Block AI Bots“ a šablonu Managed robots.txt s terminologií Content-Signal: search=yes,ai-train=no plus boilerplate k EU 2019/790. V květnu 2026 běží tato šablona na 4,5 % analyzovatelných top 10k. Cloudflare veřejně mluví o tom, že u nových účtů bude přepínač výchozí, což by zvýšilo globální míru blokování o 5–8 bodů, aniž by se kterýkoli jednotlivý vydavatel musel rozhodnout.

robots.txt v roce 2026 už není jen nudný konfigurační soubor jako v roce 2022. V EU je to mechanismus pro výhradu autorských práv s oporou v právu, u dlouhého ocasu vendorově tvarovaný politický artefakt a v první linii pomalého vyjednávání mezi lidmi, kteří spravují weby, a lidmi, kteří trénují modely.


II. Metodika

Snažili jsme se, aby to bylo co nejméně dramatické a co nejlépe reprodukovatelné. Celý pipeline (Python skripty, zpracované CSV, surový archiv robots.txt, grafy) publikujeme spolu s touto zprávou.

Vzorek

Začali jsme se seznamem Tranco z května 2026, staženým jako top-1m.csv.zip, a vzali prvních 10 000 řádků. Tranco agreguje čtyři upstream žebříčky (Cisco Umbrella, Majestic, Farsight a Cloudflare Radar), filtruje stabilitu v 30denním okně a odstraňuje zjevný šum crawlerů/CDN. Výsledný seznam je nejbližší věc kanonickému „globálnímu top 10k webového provozu“, která je veřejně dostupná, a zároveň jde o standardní vzorek pro akademický výzkum webu (používá se ve více než 600 recenzovaných studiích od svého spuštění KU Leuven v roce 2018).

Seznam obsahuje směs (a) primárních webů, které lidé navštěvují, (b) infrastrukturních / API / DNS / CDN apex domén, které neobsluhují žádné /, a (c) domén používaných interně velkými platformami (např. gvt1.com, apple-dns.net, googleusercontent.com). Místo toho, abychom je předem odfiltrovali, nechali jsme je všechny a v analytické vrstvě jim přiřadili kategorii infrastructure. Přirozeně vypadnou, když se omezíme na „weby, které vrátily analyzovatelný robots.txt“.

Sběr dat

Pro každou z 10 000 domén jsme přes HTTPS provedli asynchronní GET /robots.txt, s fallbackem na HTTP, s následováním přesměrování až do čtyř skoků, celkovým timeoutem 12 sekund, limitem těla 500 KB a realistickým browserovým User-Agentem s Accept-Language: en-US. Současně běželo nejvýše 80 požadavků. Úloha běžela z jediné rezidenční IP v San Francisku.

Výsledek sběru:

StavPočetVýznam
200 OK6 638Tělo robots.txt bylo vráceno a šlo analyzovat.
404 Not Found610Žádný robots.txt neexistuje. RFC 9309 to definuje jako implicitní „povolit vše“.
403 Forbidden563Původní server aktivně odmítá požadavky na robots.txt. Z analýzy vyřazeno.
429 Too Many Requests7Na této úrovni téměř žádné CDN rate limiting.
fetch_failed (chyba TLS / DNS / TCP)2 065Hlavně CDN apex domény (akamai.net, cloudfront.net, fastly.net, gtld-servers.net, apple-dns.net), které na / nespouštějí webserver. Nejde o „blokování“ — jen nemají co servírovat.
Ostatní 4xx/5xx117Směs serverových chyb, geofencingu a neplatných odpovědí.

To nám dává 7 248 webů v analyzovatelném vzorku (6 638 200 + 610 404). Těch 2 065 fetch_failed jsou skutečné domény, ale jde o CDN/DNS apex body, ne o weby, které lidé navštěvují, a dávat jim „AI politiku“ nedává smysl. V datech proto zůstávají jako samostatná statistika dostupnosti.

Parsování

Každé tělo s odpovědí 200 jsme parsovali pomocí protego, Python implementace RFC 9309, kterou v produkci používá Scrapy. Pro každou dvojici (web, bot) jsme spočítali tři věci:

  1. can_fetch_root — zda bot smí načíst /, se sémantikou skupin z normy, pravidlem nejdelší shody a předností konkrétního zákazu před User-agent: *, pokud existují obě.
  2. has_specific_rule — zda soubor obsahuje řádek User-agent:, který jmenuje přesně tohoto bota (bez ohledu na velikost písmen).
  3. disallow_count — kolik direktiv Disallow: je ve shodném bloku, používané k rozlišení plného zákazu webu od omezení jen na určité cesty.

Na kombinaci záleží, protože prosté „míra blokování“ skrývá dva úplně odlišné jevy: značky, které záměrně napsaly User-agent: GPTBot \n Disallow: /, protože se rozhodly bránit, a značky, jejichž generický blok User-agent: * \n Disallow: / (nastavený před lety kvůli stagingu nebo údržbě) shodou okolností zakazuje i všem AI botům, kteří v době vzniku šablony ještě neexistovali. V celé zprávě číslo „jakékoli AI blokování“ zahrnuje oba typy; číslo „výslovné AI blokování“ je jen ten záměrný podmnožinový soubor.

Boti ve výzkumu

Sledovali jsme 25 botů ve třech kategoriích:

  • AI trénovací crawlery (16): GPTBot, ClaudeBot, anthropic-ai, CCBot, Google-Extended, Meta-ExternalAgent, Bytespider, Applebot-Extended, Diffbot, Amazonbot, ImagesiftBot, FacebookBot, cohere-ai, AI2Bot, Omgili, Omgilibot.
  • AI inference / live retrieval boti (7): PerplexityBot, Perplexity-User, ChatGPT-User, OAI-SearchBot, ClaudeBot (slouží pro trénink i inference), YouBot, DuckAssistBot.
  • Vyhledávací baseline (6): Googlebot, Bingbot, DuckDuckBot, Slurp (Yahoo), Baiduspider, YandexBot.

Několik botů stojí jednou nohou v tréninku a druhou v inferences. Nejnápadnější je ClaudeBot — Anthropic v roce 2024 ukončil starší UA anthropic-ai a nyní používá ClaudeBot pro trénink i live retrieval, takže pravidlo Disallow: ClaudeBot už neodpovídá čistému „blokovat trénink, ale ponechat citování“. Nechali jsme toto přiřazení tak, jak je, a důsledek zmíníme později.

Klasifikace odvětví

Každou doménu jsme přiřadili do jedné z 16 průmyslových kategorií (news, social, streaming, ecommerce, search, finance, infrastructure, saas, academia, dev, gov, adult, gambling, travel, telecom, unknown) pomocí vrstveného přístupu:

  1. Slovník známých domén — ručně kurátorovaná mapa zhruba 500 vysoce navštěvovaných domén na odvětví.
  2. Vzory TLD / suffixů.govgov, .edu a .ac.*academia, rozpoznané CDN suffixy → infrastructure.
  3. Klíčová slova v názvu doménynews, post, shop, bank, porn, casino atd. jako záložní signály.
  4. Scrape homepage — u webů, které první tři vrstvy neuměly zařadit a které vrátily robots.txt s kódem 200, jsme stáhli HTML homepage, vytáhli <title>, <meta name="description">, <meta property="og:type"> a provedli scoring podle klíčových slov typických pro dané kategorie.

Tím vzniklo 3 407 webů (34 %) s jistým označením odvětví a 6 593 zůstalo unknown. Větev unknown je hlavně z neanglických regionálních portálů, firemních .com značkových webů, které se nevejdou do jedné kategorie, a menších tradičních vydavatelů na lokálních trzích, pro které jsme neměli záznam ve словníku. Kde tato zpráva uvádí procento za odvětví, jde o jmenovatel tvořený klasifikovaným vzorkem daného odvětví, ne o celých 10 000.


III. Zjištění

Zjištění 1 — Jeden z pěti webů s vysokou návštěvností blokuje alespoň jednoho AI bota

Ze 7 248 analyzovatelných webů 1 472 (20,31 %) blokuje alespoň jednoho AI bota. 1 230 (16,97 %) má záměrné pravidlo specifické pro AI. Základní úroveň pro Googlebot je 2,18 % (158 webů — většina z nich buď blokuje úplně všechno jako výchozí režim údržby, nebo ve třech případech jde o vyhledávače blokující konkurenci).

Hlavní číslo 20 % je 9× vyšší než základ pro Googlebot. To je skutečný signál — top weby s vysokou návštěvností mají zhruba o řád vyšší pravděpodobnost, že zablokují AI crawler, než crawler vyhledávačů — ale zároveň je to výrazně méně než vyprávění o tom, že „blokování AI se stává univerzálním“, které se v médiích drží od roku 2024. I mezi 10 000 nejnavštěvovanějšími weby světa zůstává většina 5 z 6 ohledně AI němá.

Rozdíl mezi „jakékoli AI blokování“ (20,3 %) a „výslovné AI blokování“ (17,0 %) je sice v absolutních číslech malý, ale pojmově zásadní. Těch 3,3 bodu představuje podíl webů, které blokují AI boty jen proto, že jejich stávající pravidlo User-agent: * \n Disallow: / zachytí všechno, co kolem projde, včetně botů, které v době napsání pravidla ještě neexistovaly. Číslo 17,0 % je čistší odpověď na otázku „kolik z největších webů světa udělalo AI-specifické rozhodnutí“.

Ve srovnání s předchozí literaturou:

ZdrojDatumVzorekMíra blokování
Originality.aibřezen 20251 000 nejoblíbenějších zpravodajských webů (anglicky)35,7 % blokuje GPTBot
Palewiresrpen 20241 500 zpravodajských organizací36,0 % jakýkoli AI crawler
Reuters Institutejaro 202550 předních zpravodajských značek, 10 zemí78 % jakýkoli AI crawler
WIRED / NYTkonec 202350 největších amerických zpravodajských webů26 % blokuje GPTBot
Tato zpráva (Thunderbit)květen 2026Tranco top 10 000 (všechny sektory)20,3 % / 17,0 % výslovně

Naše explicitní číslo 17,0 % je nižší než v každé studii zaměřené jen na média, protože dvě třetiny našeho vzorku nejsou média. Když se omezíme na 650 zpravodajských webů, dostaneme 47 % — po zohlednění skladby vzorku to spadá do stejného pásma jako předchozí studie. Strukturální obraz je stejný: zpravodajský segment blokuje AI 3–4× častěji než zbytek webu.


Zjištění 2 — Hluboký ponor do odvětví: rozdíl 12× mezi médii a telekomy

Nejčastěji citovaným zjištěním posledních dvou let pokrytí „AI scrapingu“ bylo číslo 80 % zpravodajských webů blokuje GPTBot z Originality.ai a Palewire. Náš výřez dává menší, ale stále výrazný výsledek: 47,2 % zpravodajských webů v top 10 000 blokuje alespoň jednoho AI bota a 45,2 % má výslovné AI pravidlo.

Ale „média vs. všechno ostatní“ je příliš hrubé. Celý rozpad (odvětví s n ≥ 10 ve vzorku) ukazuje mnohem bohatší obrázek:

robots-industry-spread_compressed.webp

OdvětvínJakékoli AI blokováníVýslovnéBlokován GooglebotVlastní pravidlaCloudflare ManagedTicho
Média65047,2 %45,2 %1,5 %46,9 %1,5 %48,5 %
Cestování6429,7 %29,7 %0,0 %35,9 %3,1 %54,7 %
Sociální sítě6529,2 %23,1 %4,6 %23,1 %6,2 %66,2 %
Streamování44020,0 %17,7 %0,7 %16,8 %3,6 %75,5 %
Finance12919,4 %12,4 %0,8 %14,7 %2,3 %75,2 %
E-commerce22418,3 %17,4 %0,4 %24,1 %1,3 %66,1 %
Adult25417,3 %14,6 %0,4 %10,2 %7,9 %79,5 %
Vyhledávání1216,7 %0,0 %0,0 %0,0 %0,0 %100,0 %
Akademická sféra26814,6 %13,8 %0,4 %13,4 %3,4 %77,2 %
Hazard10014,0 %13,0 %0,0 %18,0 %4,0 %77,0 %
Vývojářské nástroje12910,1 %7,8 %0,0 %8,5 %5,4 %77,5 %
SaaS3697,6 %6,2 %0,3 %9,5 %0,8 %87,5 %
Vláda1725,2 %3,5 %0,0 %4,1 %0,6 %83,1 %
Infrastruktura474,3 %0,0 %0,0 %4,3 %2,1 %72,3 %
Telekomunikace333,0 %3,0 %0,0 %12,1 %0,0 %78,8 %

Rozdíl 12× mezi médii a telekomy je přesně důvod, proč je „AI politika webu“ špatná jednotka analýzy. Neexistuje jedno číslo; existují sektorová čísla, která se liší o řád. Níže rozebíráme čtyři nejvýraznější poznatky.

Média: 47 % blokuje, 47 % píše vlastní pravidla. Média jsou segment, který napsal hru. Cloudflare Managed tu běží jen na 1,5 % — tito vydavatelé pravidlo nesvěřují vendorovi. Texty jsou mimořádně bohaté: NYT začíná 14řádkovým právním úvodem s odkazem na „Art. 4 of the EU Directive“; BBC začíná větou „Please use our site like a human, not a robot... TL;DR: Browse, read, watch, enjoy — like a human.“; The Sun pak píše „The Sun does not permit the unlicensed use of our content for large language models.“ Tady je robots.txt politické stanovisko, ne konfigurace.

Cestování s 30 % — překvapení. Booking, Expedia, TripAdvisor, Kayak i hlavní aerolinky blokují zhruba dvakrát méně než média. Selektivní vzorec je konzistentní: průměrný blocker v cestování zakazuje 5–7 trénovacích UA, ale nechává inference UA (PerplexityBot, ChatGPT-User, OAI-SearchBot) bez zásahu. Agregovaná cenová a recenzní data jsou moat; citace zpět na web jsou upside. To je nejčistší vzor „trénink ven, inference dovnitř“ v rámci jediného odvětví.

Adult s 17 % — také překvapení. Dřívější menší vzorky ukazovaly 0 %. Úplná data ale říkají, že jeden z šesti adult webů zakazuje alespoň jednoho AI bota a má nejvyšší podíl Cloudflare Managed ze všech sektorů (7,9 %). Více než polovina AI bloků v tomto segmentu pochází z Cloudflare přepínače, ne z rozhodnutí vydavatele. Implicitní hrozbou je trénink generování obrázků — modely typu Stable Diffusion se učí vizuální styl rychleji, než textové modely učí styl psaní.

SaaS s 7,6 % je proti intuici. Softwaroví vendori jsou v diskusi o AI politice nejhlasitější, ale jejich robots.txt je velmi otevřený. Správný výklad: marketingové týmy SaaS správně pochopily AI vyhledávání jako distribuční kanál. Vendori, kteří se tím opravdu zabývali, se spíš přihlašují než odhlašují — seznam explicitních Allow GPTBot (Zjištění 12) je dominantně tvořen security a developer tooling SaaS.

Vláda 5,2 %, telekomy 3,0 %, infrastruktura 4,3 %, vývojáři 10,1 %. Povinnost zveřejňovat záznamy dělá z Disallow: / u .gov právně ošemetnou věc. Marketingové weby telekomů chtějí být dohledatelné. CDN apex domény nemají co chránit. Vývojářské nástroje se explicitně otevírají (jejich obsah má hodnotu, když ho LLM citují).

Závěr: neexistuje jedno číslo „web AI blokuje / neblokuje“, které by nezkreslovalo víc, než sděluje. Jediný poctivý způsob, jak o datech mluvit, je po sektorech.


Zjištění 3 — Podle AI vendora: kdo je blokován nejvíc?

Druhý přirozený pohled na data je podle AI firmy, ne podle bota. Někteří vendori provozují více botů (OpenAI tři: GPTBot, ChatGPT-User, OAI-SearchBot; Anthropic dva: ClaudeBot, anthropic-ai; Meta dva: Meta-ExternalAgent, FacebookBot). Agregace na úroveň vendora je to nejbližší, co se dá získat k otázce „co si o jednotlivých AI firmách myslí veřejný web“.

AI vendorAgregovaní botiWeby blokující ≥ 1 bota% z analyzovatelných
Common CrawlCCBot1 17816,25 %
OpenAIGPTBot, ChatGPT-User, OAI-SearchBot1 17216,17 %
AnthropicClaudeBot, anthropic-ai1 11115,33 %
ByteDanceBytespider1 08214,93 %
MetaMeta-ExternalAgent, FacebookBot98913,65 %
GoogleGoogle-Extended97013,38 %
AmazonAmazonbot87712,10 %
AppleApplebot-Extended85911,85 %
Webz.io (Omgili)Omgili, Omgilibot73110,09 %
Coherecohere-ai7179,89 %
PerplexityPerplexityBot, Perplexity-User7159,86 %
DiffbotDiffbot6849,44 %
You.comYouBot5637,77 %
AI2 (Allen AI)AI2Bot4876,72 %
DuckDuckGoDuckAssistBot4826,65 %

Common Crawl je nejvíc cílený subjekt, i když je to neziskový webový archiv, ne provozovatel LLM. Důvodem je páka: CCBot napájí téměř všechny open-weight modely a značnou část uzavřených. Blokovat CCBot jako první je pro vydavatele nejúčinnější pravidlo.

OpenAI, Anthropic a ByteDance jsou v pásmu 14–16 %. U OpenAI je náskok částečně artefakt počítání (tři OpenAI boti vs. jeden bot u ByteDance). Chování Bytespider s 14,9 % je efekt „Bytespider chování“ — je zdokumentováno, že od roku 2024 ignoruje robots.txt, a vydavatelé ho blokují jako veřejný signál, ne proto, že by se báli TikToku.

Meta, Google, Amazon, Apple s 12–14 % jsou druhá úroveň — pravidla jsou psaná spíš defenzivně než jako manifest. Menší vendori (Webz.io, Cohere, Perplexity, Diffbot, You.com, AI2, DuckDuckGo) s 6–10 % jsou většinou vytlačeni nahoru díky 3,8% univerzální podlaze; výslovná pravidla pro ně jsou v pásmu 1–4 %.

xAI (Grok), Mistral a většina evropských/čínských modelových laboratoří v tabulce chybí — nezveřejnili dokumentované UA pro trénovací crawlery. Současný ekosystém robots.txt je dialog mezi americkými/čínskými vendory, kteří UA vydali, a americkými/evropskými vydavateli, kteří napsali pravidla; vendori, kteří nic nevydali, jsou z vyjednávání neviditelní.


Zjištění 4 — CCBot je nová blesková tyč, ne GPTBot

Pořadí botů v top 10k vypadá takto:

most-blocked-ai-crawlers-vendors.webp

PořadíBotMíra blokováníMíra výslovných pravidel
1CCBot (Common Crawl)16,25 %12,90 %
2GPTBot (OpenAI)15,84 %12,72 %
3Bytespider (ByteDance)14,93 %11,35 %
4ClaudeBot (Anthropic)14,51 %11,13 %
5Google-Extended13,38 %10,18 %
6Meta-ExternalAgent12,38 %8,95 %
7Amazonbot12,10 %8,66 %
8Applebot-Extended11,85 %8,72 %
9Omgilibot10,09 %5,31 %
10anthropic-ai (zastaralé)9,99 %6,55 %
11cohere-ai9,89 %6,42 %
12PerplexityBot9,69 %6,40 %
13Diffbot9,44 %5,95 %
14ChatGPT-User (inference)8,90 %5,73 %
15YouBot (inference)7,77 %4,29 %
16OAI-SearchBot (inference)6,83 %3,66 %
základGooglebot2,18 %
základBingbot2,27 %

Z této tabulky plyne, že bot, kterého veřejný web blokuje jako první, není značka modelu — je to korpus. Archiv Common Crawl o 250 miliardách stránek byl největším trénovacím vstupem pro GPT-3, GPT-4, Llama 1 / 2 / 3, Falcon, BLOOM a většinu open-weight modelů vydaných od roku 2020. Web, který chce říct „nechci být v dalším frontier modelu“, maximalizuje dopad tím, že jako první zakáže CCBot — jakmile nejste v Common Crawl, jste prakticky zdarma mimo open-source trénovací pipeline. GPTBot a ClaudeBot jsou druhý a třetí, protože představují viditelný front-end dvou konkrétních komerčních produktů; UA na úrovni korpusu je strukturální cíl.

Nižší umístění AI botů v tabulce je také informativní. Omgilibot s 10 % je neobvykle vysoko na bota, o kterém většina čtenářů nikdy neslyšela — provozuje ho Webz.io, broker obsahových dat, který prodává webové archivy provozovatelům LLM, a velká část zpravodajských organizací ho už začala explicitně jmenovat ve svých souborech. AI2Bot s 6,7 % (a odpovídající pravidlo Ai2Bot-Dolma na webech Squarespace) naznačuje, že i akademická LLM komunita začíná být označována vydavateli, kteří nutně nerozlišují mezi „neziskovým výzkumným crawlerem“ a „komerčním crawlerem“.

Inference cluster — ChatGPT-User, OAI-SearchBot, YouBot, Perplexity-User — leží o 4–8 procentních bodů níž než trénovací cluster. Tato mezera je odpovědí na dlouhodobou politickou otázku: ano, velké weby rozlišují mezi botem sbírajícím data pro budoucí trénink modelu a botem, který dělá live retrieval a právě teď odpovídá na uživatelovu otázku. Ne vždy to odlišují správně (catch-all pravidla to nerozlišují), ale významná část webů píše pravidla, která míří přímo na tréninkovou stranu.


Zjištění 5 — 14 % blokuje CCBot, ale ponechává Googlebot vítaný — vzor „blokuj korpus, ponech vyhledávání“

Nejrozšířenější selektivní pravidlo v top 10k:

website-crawler-blocking-stats.webp

Vzorec pravidlaWeby% z analyzovatelných
Blokovat CCBot, povolit Googlebot1 02314,11 %
Blokovat Bytespider, povolit Googlebot92612,78 %
Blokovat Google-Extended, povolit Googlebot81611,26 %
Blokovat GPTBot, povolit OAI-SearchBot6589,08 %
Blokovat GPTBot, povolit ChatGPT-User5257,24 %
Blokovat CCBot, povolit PerplexityBot5197,16 %
Blokovat anthropic-ai, povolit ClaudeBot590,81 %

Nejrozšířenější vzorec (14,1 %) je „blokovat Common Crawl, nechat Google Search viditelnost“. Druhý v pořadí (12,8 %) je „blokovat Bytespider, nechat Google Search viditelnost“ — tedy zablokovat crawler ByteDance označený jako problémový, ale ponechat legitimní vyhledávací základ. Třetí (11,3 %) je „blokovat vlastní AI trénovací UA Googlu a současně ponechat vyhledávací UA Googlu“, což je přesně rozdělení, kvůli němuž Google vytvořil Google-Extended: vydavatel se odhlašuje z tréninku Bardu / Gemini, aniž by ztratil pozice ve vyhledávání.

Tyto tři hodnoty dohromady popisují dominantní politický postoj na top 10k webu: zakázat crawlery trénovacího korpusu, ponechat vyhledávací a inference boty bez omezení. Menšinový vzorec „zakázat trénink, ale povolit konkrétní live-retrieval UA tohoto LLM“ — GPTBot ✗ / ChatGPT-User ✓ s 7,2 % — existuje, ale je menší než zásahy na úrovni korpusu.

Řádek anthropic-ai / ClaudeBot s 0,81 % odráží deprekační změnu UA u Anthropicu v roce 2024: ClaudeBot dnes slouží tréninku i inference, takže mizí čistý způsob, jak u Claude říct „blokovat trénink, povolit citování“, který starý UA anthropic-ai umožňoval. Jde o nejméně diskutované rozhodnutí o designu UA z let 2024–2025 — z robots.txt odstranilo celou kategorii politického vyjádření.


Zjištění 6 — Média podrobně: podle země a jazyka

Když zpravodajskou kategorii rozdělíme podle národní domény nejvyšší úrovně — přičemž je dobré mít na paměti, že to znamená .de pro německá média, .fr pro francouzská atd., nikoli jazyk, který web vysílá — je rozptyl uvnitř médií větší než rozdíl mezi médii a zbytkem webu:

news-blocking-country-tld.webp

Země (jen média)nJakékoli AI blokováníVýslovné
🇩🇪 Německo (.de)2588,0 %88,0 %
🇫🇷 Francie (.fr)1580,0 %80,0 %
🇬🇧 Spojené království (.co.uk)1566,7 %53,3 %
🇪🇸 Španělsko (.es)560,0 %60,0 %
🇮🇹 Itálie (.it)1353,8 %53,8 %
Globální média (.com/.org/atd.)50045,0 %42,8 %
🇵🇱 Polsko (.pl)742,9 %42,9 %
🇯🇵 Japonsko (.jp)1225,0 %25,0 %
🇷🇺 Rusko (.ru)130,0 %0,0 %
🇬🇷 Řecko (.gr)60,0 %0,0 %

Německá média jsou v celém datasetu nejvíc blokující subsegment s 88 %, a je to 88 % výslovně — prakticky žádný německý zpravodajský web v top 10k nepouští AI trénovací crawlery ke svému archivu. Skupinu vedou Spiegel, Bild, Welt, Zeit, FAZ, Süddeutsche, Heise, Golem, Stern, Focus — celý mainstream německého vydavatelského establishmentu, plus technologická média, která napsala pravidla samostatně. Právní infrastruktura pod tím je hustá: VG Media, kolektivní organizace německých vydavatelů, patří mezi nejagresivnější žalující subjekty v evropských sporech o AI a copyright a článek 4 směrnice EU je v německém právu implementován jako §44b UrhG s výslovným strojově čitelným opt-out jazykem. Ve chvíli, kdy přišli AI vendori, byli němečtí vydavatelé z celé země nejlépe připraveni proměnit tento právní postoj v pravidla robots.txt.

Francouzská média s 80 % jsou hned za nimi. Právní prostředí je podobné (směrnice 2019/790 transponovaná do francouzského práva) a chování cohortu je podobné — lemonde.fr, lefigaro.fr, liberation.fr, lequipe.fr, 20minutes.fr, ouest-france.fr blokují, přičemž soubor Le Monde navíc cituje francouzské droit du producteur de base de données (článek L 342-1 Code de la propriété intellectuelle) jako paralelní domácí právní základ. Francie má navíc zvláštnost v podobě rozhodnutí pařížského obchodního soudu z roku 2024, který uznal, že opt-out založený na robots.txt je podle článku 4 dostatečné oznámení; to poskytuje přímou judikatorní oporu, které se zatím žádná jiná jurisdikce nevyrovná.

UK s 67 % je níž, a důvod je ten, že několik velkých britských vydavatelů (thesun.co.uk, dailymail.co.uk, mirror.co.uk) používá místo AI-specifických pravidel blokování typu User-agent: * s odmítnutím všeho, což sráží explicitní číslo na 53 %. Celkový efekt je stejný — tyto weby AI crawling nepovolují — ale politika je vyjádřena jako „žádní roboti kromě konkrétního allowlistu vyhledávačů“ místo pojmenovaných zákazů pro AI boty. Právní opora je také slabší: po Brexitu Spojené království převzalo logiku článku 4, ale odpovídající domácí judikatura je tenká.

Ruská média s 0 % jsou nejpřekvapivější řádek. Třináct ruských zpravodajských webů ve vzorku (dzen.ru, rbc.ru, ria.ru, kommersant.ru, tass.ru, lenta.ru, gazeta.ru, interfax.ru, kp.ru, tass.com atd.) — žádný z nich neblokuje žádného AI crawlra. Pravděpodobné vysvětlení: trénování ruských jazykových LLM dominuje Yandex se svými modely typu GPT (které používají interní crawlery Yandexu, ne Common Crawl), ruské autorské právo nepřijalo ekvivalent článku 4 a hlavní ruští vydavatelé považují západní LLM za nepodstatné téma (americké exportní kontroly už v Rusku omezují služby OpenAI/Anthropic) a Yandex za domácího hráče, ne protivníka. Politický postoj je prostě jiný.

Japonská média s 25 % ukazují třetí vzorec. Japonsko má v domácím autorském právu explicitní výjimky pro text a data mining (článek 30-4 japonského autorského zákona, novelizovaný v roce 2018), které jsou benevolentnější než článek 4 směrnice EU — umožňují TDM pro účely „nepožívání“ včetně tréninku AI bez potřeby souhlasu držitele práv. Japonská média mají menší právní oporu pro opt-out, a proto jsou i sazby robots.txt nižší. Těch 25 %, které blokují, jsou hlavně největší a nejmezinárodnější vydavatelé (asahi.com, nikkei.com), kteří se profilují spíš globálně než čistě domácím trhem.

Mezinárodní zpravodajská data jsou v této zprávě nejčistším důkazem, že hlavním driverem blokování AI je právní režim, ne technologie ani ekonomika odvětví. Segmenty médií v EU se pohybují mezi 54 % a 88 %; mimo EU (Rusko, Japonsko, globální .com cohort) se pohybují mezi 0 % a 45 %. Vrchol 88 % je v zemi s nejrozvinutější implementací článku 4; dno 0 % je v zemi, která v praxi nemá žádný zákon o AI politice.


Zjištění 7 — EU vs. zbytek: rozdíl 16 bodů

Když se podíváme o úroveň výš a porovnáme EU s ostatními, rozdíl je ostrý:

RegionnJakékoli AI blokováníVýslovné
EU ccTLD (.fr, .de, .es, .it, .nl, .pl, .se, .dk, .fi, .be, .at, .cz, .hu, .ro, .gr, .pt, .ie, .sk, .bg)61735,2 %33,9 %
Ne-EU národní ccTLD (.uk, .jp, .kr, .cn, .ru, .br, .in, .au, .mx, .ca, .tr, .ar, .cl, .co, .pe)89717,2 %13,6 %
Globální (.com, .net, .org, atd.)5 73419,2 %15,7 %

Weby na EU ccTLD blokují AI dvojnásobnou rychlostí oproti ne-EU národnímu cohortu a téměř dvojnásobnou oproti globálnímu základu .com. Rozdíl je konzistentní napříč členskými státy EU (neřídí ho jedna země) i napříč odvětvími (.de média na 88 %, .de SaaS kolem 12 %, .de e-commerce kolem 25 % — všechno víc než globální protějšky).

V top 10k jsme našli 275 souborů robots.txt, které v komentářích explicitně citují směrnici 2019/790 — asi 3,8 % analyzovatelného vzorku. Cohortu dominují vydavatelé z EU, ale přesahuje i mimo ni: několik amerických zpravodajských značek (zejména NYT, který přímo cituje „Art. 4 of the EU Directive“), některé britské weby a pár větších evropských e-commerce destinací přebírají právní jazyk doslova. 87 souborů zmiňuje „TDM“ nebo „text and data mining“ jménem. 460 souborů obsahuje nějakou formu právní výhrady autorských práv („expressly opts out“, „all rights reserved“, „no commercial use“, „no machine learning“), i když neodkazují na konkrétní zákon.

Dvě jemnější pozorování z tohoto řezu:

Efekt EU není jen u médií. Když média držíme konstantní, ne-mediální EU weby stále blokují AI ve vyšších mírách než ne-EU ne-mediální weby (zhruba 28 % vs. 14 %). Malá, ale skutečná část EU SaaS, e-commerce a akademické sféry si internalizovala rámec článku 4 i pro své vlastní sektory.

Jazyk ve stylu EU se stává de facto šablonou i mimo EU. Cloudflare Managed šablona robots.txt — nasazená globálně — v boilerplate výslovně cituje „ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790“. Americký web, který zapne nastavení „Block AI Bots“ v Cloudflare, tím bez nutnosti to vědět uplatňuje právní výhradu práv podle práva EU. To je jeden z nejzajímavějších artefaktů driftu politiky, které jsme našli: evropský právní koncept se globalizuje přes produktové rozhraní amerického infrastrukturního poskytovatele.


Zjištění 8 — Šablony a jejich původ

Rozpad šablon u 6 638 webů, které vrátily analyzovatelný robots.txt:

robots-txt-ai-bot-analysis.webp

ŠablonaWebyPodíl
Žádný AI bot nezmíněn (výchozí Shopify styl, Yoast, ručně psané bez ohledu na AI)5 02475,7 %
Vlastní / DIY AI pravidla1 18317,8 %
Cloudflare Managed (Content-Signal: search=yes,ai-train=no)3024,5 %
Výslovné Allow: / pro GPTBot1241,9 %
Výchozí Squarespace (28 AI UA v bloku s omezením na cesty)50,1 %

DIY pravidla dominují s 17,8 %. Skupinu vlastnoručně psaných blockerů vede každá sociální platforma (facebook.com, twitter.com, linkedin.com, whatsapp.com, tiktok.com, snapchat.com, pinterest.com, x.com, chatgpt.com samotný), největší e-commerce destinace (amazon.com, amazonvideo.com), hlavní zpravodajské značky (nytimes.com, cnn.com, bbc.com, theguardian.com, forbes.com, reuters.com, bbc.co.uk, t-online.de, weather.com), klíčová streamovací / mediální weby (netflix.com, vimeo.com, soundcloud.com, imdb.com) a dlouhý ocas profesionálních služeb (canva.com, medium.com).

Cloudflare Managed je na 4,5 % — výrazně víc než proniknutí stejné šablony na samotné špici křivky a méně než její penetrace v dlouhém ocasu mimo okno této studie. Šablona je nejčastější v segmentu ranků 1001–10 000 (4–5 %) a prakticky chybí úplně na vrcholu křivky (Top 100: 1 web; Top 101–1000: 5 webů). Velké globální vlastnosti si píší pravidla samy; dlouhý ocas používá přepínač.

Několik konkrétních Cloudflare Managed webů stojí za zmínku. cloudflare.com sám používá tuto šablonu, což je konzistentní (Cloudflare používá vlastní produkt na vlastním doménovém webu). theatlantic.com tuto šablonu používá — je to jediná velká americká zpravodajská značka, u které jsme nenašli vlastní pravidlo. spankbang.com ji používá — nejvýš postavený adult web, který přijal AI blok vložený Cloudflarem. linktr.ee ji používá, a blokuje tak AI trénink v celé ekonomice tvůrců hostované na Linktree jedním rozhodnutím vendora. launchpad.net, nexusmods.com, vinted.fr, cookielaw.org, rustdesk.com a dlouhý seznam menších mediálních projektů dotvářejí viditelný cohort Cloudflare Managed.

Vzor adopce Cloudflare je nejpřímější důkaz, že velká část „AI politiky webu“ se dnes rozhoduje u infrastrukturních poskytovatelů. Absolutní podíl je malý (4,5 %), ale strukturálně zásadní: šablona je výchozí produkt, který Cloudflare dodává, a trajektorie „zapnuto defaultně“ v příštích 12 měsících míří nahoru. Pokud Cloudflare přepne „Block AI Bots“ u nových účtů na default-on, globální míra blokování se výrazně posune, aniž by o tom musel rozhodnout jediný vydavatel.

Výchozí Squarespace (5 webů v top 10k, ale mnohem větší cohort mimo náš vzorek) je jiný vzor: Squarespace dodává robots.txt, který v jednom bloku jmenuje 28 AI botů, ale ti pak dědí omezení cest z User-agent: * místo celoplošného zákazu. AI crawlery mohou načíst /, homepage, produktové stránky i blog. Jen nemohou načíst /config nebo /account. Už dříve jsme to označili za zdroj falešně pozitivních čtení „AI block“ v třetích stranách skenujících weby Squarespace; totéž platí i tady.


Zjištění 9 — AI politika je napříč žebříčkem téměř stejná

Běžná intuice u podobné studie říká, že nejnavštěvovanější weby budou mít nejagresivnější AI politiku — mají nejvíc co ztratit z tréninkového vytlačení, největší právní kapacity, nejvyšší veřejný dohled. Data to nepotvrzují.

Rank bucketnJakékoli AI blokováníVýslovnéCloudflare Managed
Top 1006722,4 %17,9 %1 web
Top 101–1 00059822,9 %19,2 %5 webů
Top 1 001–5 0002 81019,0 %15,3 %99 webů
Top 5 001–10 0003 77320,8 %17,8 %197 webů

Všechny čtyři buckets se drží mezi 19 % a 23 %. Top 100 není o nic přísnější než dlouhý ocas ranků 5001–10000. Hlavní číslo tedy vypadá jako vlastnost veřejného webu v roce 2026, ne jako signál o tom, jak velký nebo důležitý je konkrétní web.

Přispívají dva faktory. Zaprvé, špici křivky tvoří hlavně infrastrukturní / SaaS / search / portal domény (Microsoft, Apple, Google atd.), které mají samy o sobě nízkou míru blokování AI. Zadruhé, dlouhý ocas obsahuje vysoký podíl regionálních zpravodajských vydavatelů a webů pod jurisdikcí EU, které — jak ukázala Zjištění 6 a 7 — blokují AI agresivněji než globální průměr. Oba efekty se zhruba vyruší a výsledkem je rovnoměrný headline.

Sloupec Cloudflare Managed se napříč křivkou mění. Top 1000 má 6 webů spravovaných Cloudflarem (1,0 %); Top 1001–10000 má 296 (5,7 %). Velké weby si pravidla píší samy; dlouhý ocas používá vendorový přepínač. To je jediný smysluplný rank-dependent signál v datasetu a naznačuje, že jak se pohybujete po křivce návštěvnosti od špičky webu k dlouhému ocasu, roste podíl AI politiky nastavené vendorem místo vydavatelem. Očekáváme, že tento gradient bude pokračovat i pod top 10k do top 100k a dál.


Zjištění 10 — Pět anatomií: jak vypadá robots.txt, když je to skutečně politika

Čísla popisují tvar datasetu; skutečný charakter „AI politiky na veřejném webu“ nejlépe ukážou konkrétní soubory. Tady je pět, které stojí za bližší pohled.

Anatomie 1 — The New York Times (nytimes.com)

Prvních 14 řádků nytimes.com/robots.txt:

# Obsah New York Times je k dispozici pro vaše osobní, nekomerční
# použití podle našich Podmínek služby zde:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# Použití jakéhokoli zařízení, nástroje nebo procesu určeného k dolování dat nebo scrapování obsahu
# automatizovanými prostředky je bez předchozího písemného souhlasu
# The New York Times Company zakázáno. Zakázané použití zahrnuje mimo jiné:
# (1) činnosti text and data mining podle čl. 4 směrnice EU o autorském právu
# na jednotném digitálním trhu;
# (2) vývoj jakéhokoli softwaru, strojového učení, umělé inteligence (AI)
# a/nebo velkých jazykových modelů (LLM);
# (3) vytváření nebo poskytování archivovaných či kešovaných datových sad s naším obsahem třetím stranám; a/nebo
# (4) jakékoli komerční účely.
# Pro pomoc kontaktujte https://nytlicensing.com/contact/.

Tohle je robots.txt jako právní důkaz. Soubor je napsaný tak, aby byl použitelný jako důkaz ve sporu NYT v. OpenAI, jehož je strana. Odkazy na „Art. 4 of the EU Directive“ — a to z pera amerického vydavatele — ilustrují závěr ze Zjištění 7, že rámec EU proniká do globální debaty. Výslovný zákaz „creating or providing archived or cached data sets“ míří přímo na Common Crawl. Soubor má přes 60 řádků a samostatné bloky User-agent pro GPTBot, OAI-SearchBot, ChatGPT-User, anthropic-ai, ClaudeBot, CCBot, Google-Extended, Applebot-Extended, Bytespider, Diffbot, Meta-ExternalAgent, Amazonbot, Omgili, Omgilibot a ještě půl tuctu dalších — každý pojmenovaný bot má svůj vlastní Disallow: /.

Anatomie 2 — Der Spiegel (spiegel.de) — AI povolení po sekcích

Der Spiegel má nejpropracovanější robots.txt, který jsme v celém datasetu našli. Relevantní blok:

# TLP-6507: Testweise Freischaltung der OpenAI-Suchcrawler fuer ausgewaehlte Bereiche
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

Komentář se dá přeložit jako „Testovací uvolnění OpenAI vyhledávacích crawlerů pro vybrané oblasti“. Spiegel whitelistuje sedm konkrétních obsahových kategorií — zahraničí, partnerství, zdraví, rodinu, cestování, psychologii a styl — pro inference UA OpenAI, zatímco všechno ostatní blokuje. Politická sekce, německé domácí zprávy i investigativní žurnalistika jsou výslovně vyloučené. Common Crawl, Bytespider, Cohere, Webzio-Extended a další trénovací UA dostávají dál v souboru plné Disallow: /.

Tohle je robots.txt jako redakční politika po sekcích. Implicitní teorie je, že lifestyle obsah má nižší riziko vytlačení tréninku a vyšší přínos citací v inferences, a Spiegel proto AI tyto sekce povoluje; politický a investigativní obsah je moat, takže AI je vyloučena. Nikde jinde jsme tento vzor neviděli. Znamená to úroveň vnitřní koordinace mezi redakcí, právníky a infrastrukturním týmem, ke které se většina newsroomů ještě nedostala. Očekáváme, že tento typ jemného, sekčního vyjádření politiky se v letech 2026–2027 rozšíří — soubor Spiegelu je v podstatě předstihový indikátor.

Anatomie 3 — BBC (bbc.com) — forma politického prohlášení

robots.txt BBC začíná takto:

# version: ec59bd036e5138eb4831a9ed44447b1ff310e235
# Podmínky použití BBC: https://www.bbc.co.uk/terms
# - Vysvětlují pravidla pro používání našich služeb
# - Říkají vám, co můžete dělat s naším obsahem
#
# Stručně: Používejte náš web jako člověk, ne jako robot.
# To znamená:
# - Žádné scrapování, crawlování ani systematické extrahování obsahu
# - Žádné použití obsahu BBC pro trénink nebo dolaďování AI modelů, včetně LLM
# - Žádné retrieval-augmented generation (RAG), AI vyhledávání, agentní AI nebo
#   grounding pomocí obsahu BBC
# - Žádné vytváření datových sad z obsahu BBC
# - Žádné text and data mining (TDM) podle článku 4 směrnice EU o autorském právu
# - Žádné použití obsahu BBC k vytváření souhrnů pro vlastní potřebu
# - Žádné komerční použití bez povolení
# - BBC si vyhrazuje všechna práva k obsahu a výslovně se odhlašuje od jakýchkoli
#   zákonných výjimek v jakékoli jurisdikci pro text and data mining,
#   v rozsahu povoleném zákonem
#
# TL;DR: Procházejte, čtěte, sledujte, užívejte si — jako člověk.

BBC si svůj robots.txt verzuje (# version: ec59bd... je hash commitu), zakazuje osm konkrétních způsobů použití AI, které její právníci sledují, a končí jednovětým shrnutím ve stylu, na němž je značka BBC postavená. Formulace „expressly opts out of any statutory exceptions in any jurisdiction“ je záměrná globální výhrada — říká se tím nevěříme, že nám kterýkoli jeden právní režim dá ochranu, kterou chceme, takže opt-out uplatňujeme všude najednou. Jde o nejvíc „právnicky napsaný“ robots.txt v datasetu a čte se spíš jako tisková zpráva než jako konfigurace.

Anatomie 4 — WordPress.org — výslovné přivítání

Ve srovnání s výše uvedeným je wordpress.org přesně opačný případ:

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: anthropic-ai
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Bytespider
Allow: /

User-agent: CCBot
Allow: /

User-agent: Copilot
Allow: /

WordPress.org výslovně přihlašuje devět AI trénovacích crawlerů, včetně tří (Bytespider, CCBot, anthropic-ai), které bývají jinde blokovány nejčastěji. Implicitní teorie je, že dokumentace a ekosystém pluginů WordPressu jsou veřejný statek, jehož hodnota roste, když na něj AI asistenti umí odpovídat. Kdykoli se někdo zeptá Claude: „jak nastavím permalinky ve WordPressu?“ a Claude byl trénován na wordpress.org/documentation/, poslání WordPressu tím bylo naplněno. Nadace zřejmě dospěla k závěru, že být v trénovacím korpusu každého modelu je strategické plus, a použila k tomu expresivní gramatiku souboru.

Anatomie 5 — The Verge (theverge.com) — sponzorovaný hybrid

Ještě jeden vzor stojí za ukázku. The Verge staví svá AI pravidla jako Disallow: / \ Allow: /sp/:

User-agent: GPTBot
Allow: /

User-agent: Applebot
Allow: /

User-agent: Google-Extended
Disallow: /
Allow: /sp/

User-agent: anthropic-ai
Disallow: /
Allow: /sp/

User-agent: Bytespider
Disallow: /
Allow: /sp/

User-agent: CCBot
Disallow: /
Allow: /sp/

User-agent: ChatGPT-User
Disallow: /
Allow: /sp/

User-agent: ClaudeBot
Disallow: /
Allow: /sp/

Cesta /sp/ je sekce The Verge pro sponzorovaný / partnerský obsah. Redakční obsah je z AI tréninku blokován; sponzorovaný obsah je povolen. Ekonomická logika je jasná: sponzoři platí za to, aby jejich obsah byl dohledatelný, i přes AI; redakční vlajková loď je moat. GPTBot je plně otevřený (pravděpodobně jako přímý vztah s OpenAI), Applebot je plně otevřený jako vyhledávací baseline a zbytek dostává hybridní režim. To je jediná podoba „vrstveného AI přístupu“, kterou jsme našli.

Těchto pět souborů popisuje současné rozpětí AI politiky v robots.txt. Většina souborů v top 10k nevypadá ani jako jeden z nich — buď mlčí, nebo používá vendorovou šablonu. Ty, které se některému z těchto příkladů podobají, psali lidé, kteří se rozhodli, že soubor stojí za pečlivé přečtení.

Poznámka ke škále souboru: medián těla robots.txt v našem vzorku je 858 bajtů — příliš málo na smysluplnou AI politiku. Skutečná pravidla žijí v pravém ocasu: 1 005 webů (15,3 %) má soubor větší než 5 KB, 273 větší než 20 KB a maximum bylo 248 KB. 460 souborů obsahuje právní výhrady autorských práv; 275 jich jmenuje směrnici EU 2019/790. robots.txt je v roce 2026 stále častěji verzovaný, právníky revidovaný dokument, ne jen jeden řádek konfigurace.


Zjištění 11 — 108 webů výslovně vítá GPTBot

Malá, ale viditelná skupina webů píše pravidlo User-agent: GPTBot \n Allow: / — opak častěji diskutovaného „Disallow GPTBot“. V našem vzorku je celkem 108 webů s výslovným Allow pro GPTBot na root path. Prvních 25 podle ranku Tranco:

gptbot-welcoming-sites.webp

RankDoménaSektor
42wordpress.orgVývojářské nástroje / CMS
133kaspersky.comBezpečnost
187avast.comBezpečnost
265hp.comVýrobce hardwaru
624branch.ioSaaS pro mobilní atribuci
692sophos.comBezpečnost
782theverge.comMédia
905rambler.ruRuský portál
945kleinanzeigen.deNěmecký marketplace
948theatlantic.comMédia
1 092lge.comLG Electronics
1 300justdial.comMístní vyhledávání v Indii
1 332avira.comBezpečnost
1 412youm7.comEgyptská média
1 530goodreturns.inFinance v Indii
1 621publi24.roRumunské inzeráty
1 807geocomply.comCompliance SaaS
1 908nba.comSport
1 956oneindia.comIndická média
1 974mindbox.ruRuské SaaS
2 009thesun.co.ukMédia
2 126vox.comMédia
2 140mgid.comNativní reklama
2 314ninjarmm.comIT management SaaS
2 323norton.comBezpečnost

Několik vzorů:

Bezpečnostní firmy jsou nápadně nadreprezentované. Kaspersky, Avast, Sophos, Avira, Norton, NinjaRMM všechny výslovně povolují GPTBot. Jde o vědomou distribuční strategii: když se uživatel zeptá ChatGPT „jaký antivirus je nejlepší pro můj Windows?“, přítomnost značky v trénovacím korpusu modelu přímo ovlivní doporučení. Bezpečnost je jedna z mála B2C kategorií, kde AI vyhledávání už nahrazuje SEO jako hlavní akviziční kanál, a tyto značky reagují jako první. Očekáváme, že zbytek security segmentu je bude následovat do 12 měsíců.

Některé velké zpravodajské značky jsou na tomto seznamu, ne na blocklistu. The Verge, The Atlantic, Vox, The Sun, NBA.com. To není rozpor — tyto weby zřejmě usoudily, že být citovatelný uvnitř vyhledávání ChatGPT je hodnotnější než být chráněn před tréninkem, a explicitní Allow pravidlo napsaly jako obranu proti budoucímu přeblokování ze strany CDN nebo CMS. Ve srovnání s postojem NYT / Reuters / BBC / Forbes / Guardian v podobě explicitního Disallow. Oba postoje jsou obhajitelné; zpravodajský průmysl není monolit.

Přítomnost The Sun je důležitá, protože tentýž web má jinde v souboru blok typu User-agent: * s odmítnutím všeho. Politiku The Sun lze nejlépe číst jako „AI trénink je zakázán, AI vyhledávání je povoleno a GPTBot jsme výslovně whitelistovali jako výjimku z deny-all, aby ChatGPT uměl odpovídat s citací The Sun.“ To je právně nejpropracovanější z pravidel Allow-GPTBot — jde o opt-out plus jednovendorské přihlášení.

Nejdůležitějším jednotlivým záznamem na seznamu je WordPress.org. Nemalá část globálního open-source CMS ekosystému buď odkazuje na WordPress.org kvůli dokumentaci, nebo z něj hostuje pluginy. Tím, že WordPress.org v robots.txt výslovně povoluje GPTBot, v podstatě říká, že dokumentační ekosystém WordPressu je otevřený pro trénink — a to má přímý dopad na to, jak dobře Claude, Gemini a ChatGPT odpovídají na otázky typu „jak na to...“ kolem WordPressu.

Zbývajících 83 webů ve full seznamu Allow-GPTBot je dlouhý ocas regionálních médií, menších security vendorů, inzertních platforem na neanglických trzích a B2B SaaS. Pokud víme, neexistuje žádná koordinace napříč odvětvím typu „Allow-GPTBot“ — pravidlo se zavádí po jednom webu, u provozovatelů, kteří usoudili, že být v korpusu je strategická pozice.


Zjištění 12 — llms.txt je v tomto měřítku sotva slyšitelná fáma

llms.txt, navrhovaný alternativní formát souboru pro objevování obsahu vhodného pro LLM (prosazovaný Mintlify, Anthropicem, Vercel a několika vendory vývojářských nástrojů od konce roku 2024), má v našem vzorku viditelnou adopci téměř nikde.

Ze 6 638 webů, které vrátily analyzovatelný robots.txt, jich 83 (1,15 %) zmiňuje llms.txt — obvykle jako řádek Sitemap: https://example.com/llms.txt. To je o dva řády méně než stejná metrika měřená na vzorcích obchodu silně orientovaných na developer tooling, kde defaulty od Vercelu a Mintlify uměle navyšují adopci.

llms-txt-robots-adoption-rate.webp

Rozpad podle kategorie:

Odvětvín% zmiňujících llms.txt
Infrastruktura474,3 %
Hazard1003,0 %
SaaS3693,0 %
Telekomunikace333,0 %
E-commerce2241,8 %
Cestování641,6 %
Vývojářské nástroje1291,6 %
Média6500,8 %
Adult2540,4 %
Vláda1720,0 %
Akademická sféra2680,0 %
Vyhledávání120,0 %

llms.txt je soustředěné v SaaS napojeném na vývojářské nástroje, v hazardu (který novější robots.txt vlastnosti přejímá rychleji než jiná regulovaná odvětví, protože má compliance týmy zvyklé vrstvit metadata), a v B2B e-commerce. Nápadně chybí v médiích a ve vládě — tedy ve dvou segmentech, které se AI politikou zabývají nejvíc a jejichž adopce by byla nutná, aby se standard posunul z „vendor experimentu“ na „webový protokol“. Do té doby je llms.txt reálný, ale malý, a následný audit na konci roku 2026 bude užitečným přetestováním.

Strukturální problém llms.txt je v tom, že není standardizovaný žádným IETF procesem a hlavní AI vendori se nezavázali ho respektovat. Pravidlo v robots.txt má za sebou 30 let crawlerové infrastruktury; pravidlo v llms.txt nemá nic. Dokud alespoň jeden velký vendor (OpenAI, Anthropic, Google, Cloudflare) výslovně neoznámí formální podporu, je ten soubor v podstatě marketingový artefakt ekosystému Mintlify / Vercel. Nečekáme, že se to v roce 2026 změní.


Zjištění 13 — Přístupnost: robots.txt je stále čitelný pro dvě třetiny top webu

Vedlejší pozorování, které nemělo být zjištěním: 66 % z top 10 000 webů vrátilo jednomu výzkumnému IP analyzovatelný robots.txt a jen 7 z 10 000 (0,07 %) vrátilo 429 Too Many Requests. To je dobrá zpráva pro robots.txt jako veřejný protokol.

Pro srovnání: stejný pipeline běžící před dvěma měsíci na vzorku 1 008 domén středního e-commerce trhu dostal 429 od 52 % vyřešených domén — Shopify a Cloudflare CDNy agresivně rate-limitovaly jakýkoli UA, který nebyl od velkého vyhledávače. Web s nejvyšší návštěvností je mnohem přívětivější: větší weby častěji mají buď (a) méně agresivní bot-management tiers, nebo (b) explicitní allowlisty známých výzkumných crawlerů, nebo obojí.

Míra fetch_failed 21 % na top 10k je z velké části tvořena CDN apex doménami (akamai.net, cloudfront.net, fastly.net, apple-dns.net, gtld-servers.net), které na / neprovozují webserver. Neblokují nás; nemají co servírovat. Po jejich vyloučení je skutečná míra „zkusili jsme to přečíst a nešlo to“ jen v nízkých jednotkách procent.

To znamená, že budoucí verze této zprávy — čtvrtletní snapshoty, meziroční srovnání — lze spouštět levně a reprodukovatelně na jednom stroji. Auditní okno zůstává otevřené na špici křivky. Asymetrický případ je dlouhý ocas a e-commerce segment, kde CDN-level throttling už robots.txt de facto privatizoval. Očekáváme, že se ten rozdíl bude prohlubovat: top weby zůstanou čitelné, protože je indexují vyhledávače, které čitelnost vyžadují; dlouhý ocas e-commerce bude méně čitelný, protože Cloudflare bude své bot-fight třídy nasazovat agresivněji. Veřejná auditovatelnost robots.txt se štěpí podle stejné linie, která odděluje „viditelný web“ od „operačně chráněného webu“.


IV. Co to všechno znamená

Čtyři tvrzení, seřazená podle toho, jak silně je data podporují.

1. Internet má AI politiku po odvětvích, ne jednu globální. Dvanáctinásobný rozdíl mezi médii a telekomy dominuje všem agregovaným číslům. Hlásit „X % webu blokuje AI“ bez sektorového řezu nadhodnocuje SaaS/vládu/vývojáře a podhodnocuje média/cestování/sociální sítě. Po sektorech je to jediný poctivý rámec.

2. Článek 4 směrnice EU o autorském právu je jediný právní režim, který na číslech skutečně hýbe. Weby na EU ccTLD blokují na 35 % oproti globálnímu základu 19 %. Americké spory (NYT v. OpenAI, lednová 2025 zpráva Copyright Office) posunuly americká média, ale ne širší americký web. Rámec EU navíc prosakuje globálně přes šablonu Cloudflare, která v boilerplate cituje směrnici 2019/790 bez ohledu na jurisdikci zákazníka.

3. Dvě paralelní „AI politiky“ jsou vyjadřovány současně a navzájem si neodpovídají. Záměrná, ručně psaná politika (17,8 %, hlavně média/sociální sítě/cestování/e-commerce) a zděděná politika spravovaná Cloudflarem (4,5 %) se obsahově překrývají, ale liší se v legitimitě. Ve světě, kde AI operátoři hledají právní oporu pro ignorování robots.txt, je obhajoba typu „my jsme to napsali a zkontrolovali“ strukturálně silnější než „jen jsem to zapnul“. Litigační pobídka je přesunout politiku z druhé kategorie do první.

4. Co vydavatelé blokují, není model, ale korpus. CCBot na 16,3 % — víc než kterýkoli bot se značkou modelu — je nejčistší formulací tohoto zjištění. Zakázat OpenAI ještě neznamená dostat se z tréninku; zakázat CCBot ano. 14,1 % top 10k webu blokuje CCBot a současně nechává Googlebot vítaný. Vzor „blokuj trénink, ponech vyhledávání“ je v roce 2026 modalním AI pravidlem.

Pro weby, které zvažují vlastní postoj: mediánový postoj je ticho — 80 % top 10k neříká o AI nic. Těch 17 % webů, které pravidla píší, se soustředí na Disallow, ale malý a rostoucí cohort (seznam 1,5 % výslovných Allow GPTBot, vedený security vendory) veřejně volí opak. Neexistuje shoda napříč odvětvími a v příštích dvanácti měsících ani nevznikne.

Pro AI operátory: stále obtížnější je udržet tvrzení, že robots.txt je zastaralý protokol s nejasnou sémantikou, když 17 % největších webů na světě napsalo výslovná záměrná pravidla s ručně pojmenovanými boty a 3,8 % souborů cituje konkrétní ustanovení práva EU podle čísla článku. Zda tato pravidla budete respektovat, je obchodní rozhodnutí; zda existují, je dnes empirický fakt.


V. Výhled: co čekáme do konce roku 2026

Tři trajektorie viditelné v datech:

Cloudflare Managed víc než zdvojnásobí svůj podíl, pravděpodobně dosáhne 10 %+ z analyzovatelného top 10k. Cloudflare na veřejnosti mluví o default-on Block AI Bots pro nové účty. Pokud se přepínač dodá jako výchozí zapnutý, globální míra blokování se posune o 5–8 procentních bodů, aniž by se některý vydavatel rozhodl. Poznáme to podle toho, že podíl Cloudflare Managed v bucketu ranků 5001–10000 stoupne nad současných 5,7 %.

Sekční AI politiky ve stylu Spiegelu se rozšíří mezi hlavní mediální vlajkové lodě. Ekonomická logika — nechte AI citovat nízkorizikový obsah, chraňte moat obsah — je dost přesvědčivá na to, že čekáme alespoň 10 dalších vlajkových newsroomů se sekčními pravidly do konce roku 2026. Sledujte nejdřív německý a francouzský střední tisk; právní rámec tam experimentování odměňuje.

Cohort explicitních Allow GPTBot poroste, povede ho B2B SaaS a vývojářské nástroje. Jakmile se AI vyhledávání stane měřitelným akvizičním kanálem pro softwarové vendory (což už je u security), průměrný CMO napíše User-agent: GPTBot \n Allow: /, aby se pojistil proti náhodnému přeblokování. Očekáváme, že seznam 108 webů se do konce roku zhruba zdvojnásobí.

Co nečekáme: významnou změnu podílu tiché většiny. Oněch 80 % webu, které o AI neříká nic, zahrnuje sektory (vláda, telekomunikace, infrastruktura, B2B SaaS) bez ekonomického důvodu psát pravidlo a bez právního tlaku to udělat. Univerzální AI politika nepřichází.


VI. Omezení

  1. Bias jednoho snapshotu. Sběr proběhl během 36hodinového okna na začátku května 2026. Soubor se na top 100 mění denně; u hlavních čísel čekejte drift 1–2 procentní body za čtvrtletí.
  2. Díry v klasifikaci odvětví. 6 593 z 10 000 webů zůstalo po čtyřvrstvém klasifikátoru unknown. Procenta podle odvětví jsou robustní tam, kde je n velké (média: 650, streamování: 440, SaaS: 369, akademie: 268, adult: 254, e-commerce: 224, vláda: 172, finance: 129, vývojářské nástroje: 129) a hlučnější pod n=30. Podobně omezený je i výřez podle zemí u médií — DE/FR/UK mají n≥15, Korea/Švédsko/Česko stojí na n=20–25.
  3. robots.txt je dobrovolný. Disallow je požadavek, ne bariéra. Bytespider, PerplexityBot a další jsou zdokumentováni jako ignorující pravidla. Měřili jsme deklarace politiky, ne vynucování politiky.
  4. Audit z jedné americké IP. Nepřečetli jsme 21 % vyřešených domén. Většina jsou CDN apex body bez webserveru; menší část jsou weby, jejichž CDN nás odfiltrovala dřív, než jsme se dostali k originu. To mírně zkresluje vzorek směrem ke starší infrastruktuře a proti geofencovaným webům podle země původu.
  5. Semantika seznamu Tranco. Tranco filtruje podle stability; není to skutečný žebříček uživatelského chování. Agregovaná čísla jsou vůči volbě seznamu robustní, konkrétní pozice v ranku ne.
  6. Žádná traffic data. Měřili jsme politiku robots.txt, ne skutečný tok AI botů. Politika a provoz se ne vždy shodují.

VII. Jak to zopakovat

Všechno použité pro vytvoření této zprávy je v adresáři dodávky.

  • tranco_top10k.csv — vstupní seznam
  • out/sites.csv — doména × rank × odvětví × jazyk × stav robots.txt (10 000 řádků)
  • out/fetch_meta.csv — výsledek fetchování pro každou doménu (status, scheme, bytes, error)
  • out/bot_status.csv — matice doména × bot (250 000 řádků: blocked, has_rule, fetch_status)
  • out/site_meta.csv — jeden analytický záznam na web (template, souhrnné booleany)
  • out/analysis.json — všechny metriky citované ve zprávě
  • 01_fetch_robots.py, 02_classify.py, 03_parse_and_analyze.py — celý Python pipeline

Stáhnout všechny skripty a datové sady


Opravy metodiky, problémy s daty a navazující analýzy vítáme na support@thunderbit.com. Tato zpráva je publikována nezávisle na jakékoli komerční pozici Thunderbitu; vyvíjíme AI web scraper a máme strukturální zájem na tom, aby robots.txt zůstal na veřejném webu smysluplnou, strojově čitelnou smlouvou. Data v této zprávě stojí sama o sobě. — Výzkumný tým Thunderbit, květen 2026.

Vyzkoušejte Thunderbit AI Web Scraper Get Started Free

Shuai Guan
Shuai Guan
CEO ve společnosti Thunderbit | Expert na automatizaci dat s využitím AI Shuai Guan je CEO společnosti Thunderbit a absolvent inženýrského oboru na University of Michigan. Na základě téměř deseti let zkušeností v oblasti technologií a architektury SaaS se zaměřuje na převádění složitých modelů AI do praktických nástrojů pro extrakci dat bez nutnosti programování. Na tomto blogu sdílí nezkreslené a v praxi ověřené poznatky o web scrapingu a automatizačních strategiích, které vám pomohou vytvářet chytřejší datově řízené pracovní postupy. Když zrovna neoptimalizuje datové workflow, věnuje stejný důraz na detail také své vášni pro fotografii.
Obsah

Získej data z webu jen tím, že si o ně řekneš

Řekni, co potřebuješ, obyčejnou angličtinou. Nebo ještě lépe – neříkej nic.

Vyzkoušet Thunderbit zdarma
Získej data pomocí AI
Snadno přenes data do Google Sheets, Airtable nebo Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week