Shrnutí pro vedení
Předchozí zpráva položila otázku ohledně pravidel: kolik z nejnavštěvovanějších webů na světě říká AI crawlerům, co smějí a nesmějí dělat?
Tato navazující zpráva se ptá na provozní otázku, která za tím stojí: jak spolehlivý je robots.txt jako infrastruktura, která má tuto politiku nést?
Odpověď je nepříjemná. robots.txt pořád funguje, protože je veřejný, levný, strojově čitelný a crawlery mu už rozumí. Zároveň se po něm chce mnohem víc, než pro co byl navržen. V roce 2026 může tentýž jednoduchý textový soubor obsahovat SEO pravidla pro crawling, odkazy na sitemapu, starší rozšíření pro vyhledávače, výjimky z trénování AI, slovník zásad vložený Cloudflarem, vyjádření k autorským právům i právní jazyk pro budoucí spory.
To je dluh v konfiguraci.
Dataset pro tuto zprávu je stejný Tranco Top 10,000 crawl jako v původní studii AI crawlerů. Z 10 000 domén vrátilo 6 638 čitelný robots.txt; dalších 610 vrátilo 404, což protokol bere jako implicitní povolení. To dává 7 248 analyzovatelných webů pro rozhodování o přístupu botů a 6 638 konkrétních souborů pro analýzu složitosti konfigurace.
Vyniká šest zjištění:
-
Většina souborů
robots.txtje malá, ale dlouhý ocas je extrémně složitý. Medián souboru má jen 834 bajtů a 31 řádků. Ale 1 005 souborů má alespoň 5 KB, 273 má alespoň 20 KB a 28 má alespoň 100 KB. Největší soubor ve vzorku má 248 KB. -
Stovky top webů provozují soubory, které se blíží spíš produkční konfiguraci než poznámce s politikou. Medián souboru má 9 direktiv
Disallow. Ale 707 webů má alespoň 100 pravidelDisallow, 13 jich má alespoň 1 000, 240 uvádí alespoň 50 user-agentů a 110 uvádí alespoň 100 user-agentů. -
Drift protokolu není teoretický. Mezi 6 638 čitelnými soubory jich 685 obsahuje
Crawl-delay, 303Host, 200Clean-param, 9Request-rate, 5Visit-timea 271 obsahuje jazyk typuContent-Signalve stylu Cloudflare. Nejde o jednu čistou normu. Je to nashromážděný folklór crawlerů. -
Googlebot je považován za zvláštního uživatele. 562 analyzovatelných domén blokuje alespoň jeden tradiční vyhledávací crawler. Ve 404 z těchto případů je Googlebot povolen, zatímco alespoň jeden jiný vyhledávací crawler je blokován. Diskriminace AI crawlerů nevznikla v neutrálním prostředí;
robots.txtuž dřív kódoval hierarchii vyhledávačů. -
AI politika dluh ještě víc zviditelňuje. 1 377 čitelných souborů obsahuje jazyk k AI politice; 719 obsahuje autorská práva, podmínky, licencování nebo jazyk o povolení; a 501 obsahuje obojí. Soubor se stal zároveň rozhraním pro stroje i právním artefaktem. To je užitečné, ale křehké.
-
Nejrizikovější soubory nejsou vždy ty nejvíc proti AI. E-commerce, cestování, sociální sítě, finance, akademická sféra i zpravodajství vytvářejí složité soubory z různých důvodů: řízení crawl budgetu, staré cesty, obsah vytvářený uživateli, vyhrazení práv a výjimky pro konkrétní boty. Na už tak chaotický základ se vrství pravidla pro AI.
Hlavní závěr: robots.txt zůstává nejdůležitějším veřejným povrchem pro crawler policy na webu, ale je slabým základem pro vysoce citlivé řízení AI, pokud ekosystém nezstandardizuje identitu crawlerů, slovník pro využití AI a auditovatelnost pravidel.
Metodologie
Tato zpráva znovu využívá dataset z původní analýzy Thunderbitu o politice AI crawlerů na doménách Tranco Top 10,000.
Vstupní materiály byly:
tranco_top10k.csv— původní seznam 10 tisíc domén Tranco.out/fetch_meta.csv— stav načtení, počet bajtů, schéma, výsledek přesměrování a metadata chyb.out/sites.csv— doména, pořadí, kategorie, jazyk a stavrobots.txt.out/site_meta.csv— jeden analytický řádek na web, včetně třídy šablony, příznaků blokování AI, velikosti souboru a souhrnných polí politiky botů.out/bot_status.csv— jeden řádek na doménu a crawler, včetně toho, zda je daný bot blokován a zda existuje konkrétní pravidlo.raw_robots/— uložené tělorobots.txtpro 6 638 webů, které vrátily stav200.
Pro tuto navazující analýzu byl každý čitelný soubor robots.txt prohledán na:
- velikost souboru a počet řádků;
- aktivní nekomentované řádky;
- počty direktiv
User-agent,Disallow,AllowaSitemap; - starší nebo ne-jádrové direktivy jako
Crawl-delay,Host,Clean-param,Request-rateaVisit-time; - slovník éry AI včetně
Content-Signal,llms.txt, AI, LLM, machine learning, TDM a2019/790; - právní slovník jako copyright, terms of service, licensing, permission a jazyk o vyhrazení práv;
- zacházení s vyhledávacími crawlery Googlebot, Bingbot, DuckDuckBot, Slurp, Baiduspider a YandexBot.
Zpráva také definuje jednoduché skóre dluhu v konfiguraci pro triáž. Kombinuje velikost souboru, počet user-agentů, počet Disallow, počet Allow, počet nestandardních direktiv a směs AI-politiky a právního jazyka. Skóre nemá být univerzálním měřítkem správnosti. Je to způsob, jak identifikovat soubory, které se budou pravděpodobně těžko udržovat, kontrolovat nebo interpretovat.
Všechny odvozené tabulky a grafy jsou součástí dodaného balíčku.
Zjištění 1: Mediánový soubor je jednoduchý; dlouhý ocas ne
Typický soubor robots.txt na velkém webu je pořád malý.

Napříč 6 638 čitelnými soubory:
| Metrika | Medián | P90 | P95 | P99 | Maximum |
|---|---|---|---|---|---|
| Velikost souboru | 834 bajtů | 6,7 KB | 15,8 KB | 76,0 KB | 248,3 KB |
| Řádky | 31 | 238 | 332 | 1 008 | 4 998 |
| Aktivní řádky | 23 | 198 | 282 | 837 | 4 998 |
Direktivy User-agent | 1 | 21 | 39 | 137 | 823 |
Direktivy Disallow | 9 | 103 | 176 | 422 | 4 997 |
Direktivy Allow | 1 | 17 | 33 | 69 | 890 |
Tato distribuce je důležitá, protože se o robots.txt často mluví, jako by šlo o krátké prohlášení:
User-agent: *
Disallow: /private/
Tento mentální model je pro významnou menšinu webu s vysokou návštěvností chybný.
V tomto datasetu:

| Práh složitosti | Weby |
|---|---|
robots.txt větší nebo rovno 5 KB | 1 005 |
| Větší nebo rovno 20 KB | 273 |
| Větší nebo rovno 100 KB | 28 |
Alespoň 50 direktiv User-agent | 240 |
Alespoň 100 direktiv User-agent | 110 |
Alespoň 100 direktiv Disallow | 707 |
Alespoň 1 000 direktiv Disallow | 13 |
Alespoň 100 direktiv Allow | 40 |
Největší a nejsložitější soubory nejsou akademická kuriozita. Patří skutečným, vysoce navštěvovaným webům:
| Doména | Pořadí | Kategorie | Bajtů | User-agent | Disallow | Allow |
|---|---|---|---|---|---|---|
linkedin.com | 17 | social | 114 341 | 76 | 4 184 | 281 |
runescape.com | 5 226 | unknown | 113 393 | 1 | 4 997 | 0 |
academia.edu | 832 | academia | 57 384 | 63 | 2 044 | 227 |
etsy.com | 286 | ecommerce | 51 320 | 3 | 1 621 | 120 |
thepaper.cn | 9 395 | news | 56 867 | 1 | 1 496 | 0 |
opentable.com | 4 137 | unknown | 70 494 | 32 | 1 683 | 176 |
alfabank.ru | 2 625 | finance | 73 158 | 2 | 1 566 | 133 |
Tyto soubory jsou blíž produkčním směrovacím tabulkám než sloganům o politice. Kódují roky produktových launchů, staré cesty, blokované vzory parametrů, výjimky pro crawlery, SEO experimenty, rozhodnutí CDN a teď i pravidla pro AI crawly.
Dlouhý ocas není jen příběh o AI. Z 273 souborů na úrovni 20 KB a výše obsahuje 131 jazyk k AI politice a 142 neobsahuje. Z 707 souborů s alespoň 100 direktivami Disallow obsahuje jazyk k AI politice jen 207. Jinými slovy: AI nevytvořila problém velkých souborů. Přišla až poté, co do nich roky běžného provozu webu přibyly cesty, odkazy na sitemapu a výjimky pro crawlery.
To je důležité, protože udržovatelnost závisí na struktuře, ne jen na záměru. Malý soubor s přímým blokem pro AI může být snadný na kontrolu. 70KB e-commerce nebo cestovatelský soubor může být těžké auditovat, i když o AI vůbec nemluví. Riziko není v tom, že každý velký soubor je chybný. Riziko je v tom, že výsledná politika je příliš složitá na to, aby ji lidé odpovědní za její údržbu dokázali ověřit.
Provozní riziko je jednoduché: jak robots.txt roste, je pro vydavatele, inženýra platformy, právníka nebo SEO leada těžší odpovědět na základní otázku: co tenhle soubor vlastně dovoluje?
To už není triviální otázka. Podle parsování ve stylu RFC může crawler místo User-agent: * najít specifičtější skupinu user-agentů; delší shody cest mohou přebít kratší; direktivy Allow a Disallow spolu interagují podle precedence; a obecná pravidla typu deny-all mohou nechtěně zachytit nové crawlery, které v době vzniku souboru ještě neexistovaly.
Pro třicet řádků to člověk zvládne rozumově zpracovat. Pro 4 000 řádků a desítky pojmenovaných botů už by to dělat neměl nikdo.
Zjištění 2: robots.txt nese víc než pravidla pro crawling
Debata o AI crawlerech zviditelnila robots.txt politicky, ale samotný soubor už dávno přebíral nesouvisející úkoly.
Moderní robots.txt na velkém webu může obsahovat:
- kontrolu cest pro crawlery;
- objevování sitemap;
- rozšíření specifická pro vyhledávače;
- nápovědy k rychlosti crawlování;
- nápovědy ke kanonizaci hostitele;
- nápovědy k úpravě URL parametrů;
- slovník zásad vložený CDN;
- text o vyhrazení autorských práv;
- výjimky z trénování AI;
- právní komentář čitelný pro člověka.
Dataset tohle vrstvení ukazuje jasně.
| Signál | Soubory | Podíl čitelných souborů |
|---|---|---|
Crawl-delay | 685 | 10,3 % |
Host | 303 | 4,6 % |
Clean-param | 200 | 3,0 % |
Content-Signal | 271 | 4,1 % |
Request-rate | 9 | 0,1 % |
Visit-time | 5 | 0,1 % |
Zmínka o llms.txt | 83 | 1,3 % |
| Jazyk o autorských právech, podmínkách, licencování nebo povolení | 719 | 10,8 % |
| Jazyk k AI politice | 1 377 | 20,7 % |
Některé z těchto direktiv jsou široce rozpoznávané konkrétními crawlery. Některé jsou starší konvence. Některé jsou specifické pro dodavatele. A některé nejsou vlastně crawler direktivy vůbec, ale právní nebo produktový jazyk vložený do komentářů.
Tak vypadá drift protokolu.
Crawl-delay je užitečný příklad. Mnoha správcům webů je známý, ale podpora je napříč hlavními crawlery nevyrovnaná. Host a Clean-param byly historicky spojované s chováním Yandexu. Content-Signal je součást slovníku zásad pro éru AI od Cloudflare. llms.txt je navrhovaný související formát pro objevování, ne univerzálně respektovaný standard. A přesto se všechny tyto věci objevují ve stejném typu souboru, často vedle klasických pravidel User-agent a Disallow.
Čísla také ukazují, jak dnes vedle sebe existují starší i novější konvence. Crawl-delay se objevuje v 685 souborech, tedy více než dvakrát častěji než Content-Signal ve 271 souborech. Host se objevuje ve 303 souborech a Clean-param ve 200, což většinou odráží konvence z éry vyhledávání. llms.txt, navzdory intenzivní debatě v kruzích kolem AI vyhledávání, je zmíněn jen ve 83 čitelných souborech. Živý web se nesbližuje na jednom slovníku. Vrství slovníky na sebe.
Problém není v tom, že by bylo cokoli z toho samo o sobě špatně. Problém je, že se soubor stal neversionovaným kontejnerem pro několik překrývajících se systémů řízení.
To vytváří tři typy dluhu:
- Sémantický dluh. Různí crawlery mohou tentýž soubor vykládat odlišně.
- Dluh vlastnictví. SEO, právní, infrastruktura, bezpečnost i produktové týmy mohou mít důvod soubor upravovat, ale nikdo nemusí vlastnit celou politiku.
- Auditní dluh. Web může publikovat politiku, která vypadá záměrně, zatímco skutečné chování dokáže určit jen parser.
AI to činí důležitějším, protože se změnila sázka. Když je ignorována stará nápověda k rychlosti crawlů, výsledkem může být jen více provozu. Když je nejednoznačný opt-out z trénování AI, výsledkem se může stát důkaz v autorskoprávním nebo licenčním sporu.
Zjištění 3: Soubor je zároveň rozhraní pro stroje i právní artefakt
Původní zpráva o AI crawlerech ukázala, že 17,0 % analyzovatelných webů mělo napsaná explicitní pravidla specifická pro AI. Tato navazující analýza se dívá na textovou zátěž, kterou tyto politiky přidávají.

Mezi 6 638 čitelnými soubory robots.txt:
- 1 377 obsahuje jazyk k AI politice;
- 719 obsahuje autorská práva, podmínky, licencování, práva nebo jazyk o povolení;
- 271 obsahuje
Content-Signal; - 83 zmiňuje
llms.txt.
Nejzajímavější je překryv:

| Textový vzor | Soubory |
|---|---|
| Jazyk k AI politice a právní/jazyk o právech | 501 |
| Jazyk k AI politice bez právního/jazyka o právech | 876 |
| Právní/jazyk o právech bez AI jazyka | 218 |
Content-Signal s právním/jazykem o právech | 242 |
| Explicitní blok pro AI s právním/jazykem o právech | 424 |
To je nový typ souboru.
Tradiční robots.txt míří na crawlery. robots.txt s právním úvodem míří nejméně na čtyři publika najednou:
- provozovatele crawlerů, kteří potřebují strojově čitelná direktiva;
- dodavatele vyhledávání a AI, kteří potřebují signály politiky;
- právníky, kteří chtějí explicitní vyhrazení práv;
- budoucí auditory, soudy nebo novináře, kteří mohou komentáře číst jako důkaz záměru.
Právě tento vícepublikový design vysvětluje, proč některé soubory dnes vypadají jako politické dokumenty. Zároveň ale oslabuje čisté oddělení mezi tím, co crawler umí parsovat, a tím, co chce právník prohlásit.
876 souborů s jazykem k AI politice, ale bez právního slovníku, jsou převážně strojové politické soubory: jména botů, bloky Disallow a šablonovitý jazyk. 501 souborů s obojím je jiný typ. Snaží se být zároveň instrukcí pro crawlery i vyhrazením práv. 218 souborů s právním jazykem, ale bez AI slovníku, ukazuje, že tento vzor nezačal až s LLM; robots.txt se už dřív používal k vyjádření podmínek, hranic povolení a nároků na práva.
Například komentář může tvrdit, že je zakázáno machine learning, zatímco skutečný blok direktiv jen zakazuje podmnožinu známých user-agentů. Web může globálně tvrdit vyhrazení práv, ale jmenovat jen několik crawlerů. Šablona CDN může do souboru vložit AI slovník, i když provozovatel nikdy ten právní jazyk ručně nepsal. Web může napsat široké pravidlo User-agent: *, které nechtěně zablokuje budoucí crawlery.
Z pohledu řízení je robots.txt atraktivní právě proto, že je veřejný a strojově čitelný. Ale čím víc politiky nese, tím víc se projevují jeho limity:
- neexistuje autentizační vrstva, která by prokazovala, že konkrétní pravidlo ověřil držitel práv, a ne že bylo převzato z infrastruktury;
- neexistuje nativní historie verzí;
- neexistuje strukturované pole pro zamýšlené použití, jako je trénování, retrieval, indexování, shrnování, caching nebo vyhodnocování modelů;
- neexistuje univerzální registr identity AI crawlerů;
- neexistuje vynucovací mechanismus.
To neznamená, že je soubor zbytečný. Znamená to, že je křehký.
Lepší interpretace je, že robots.txt se stává vrstvou oznámení: veřejným, kontrolovatelným vyjádřením preference a záměru. Sám o sobě to není kompletní systém správy práv.
Zjištění 4: Vyhledávání bylo nerovné už před příchodem AI
Jedním z nejsilnějších zjištění původní zprávy bylo, že mnoho vydavatelů rozlišuje mezi AI trénovacími crawlery a vyhledávacími crawlery. Blokují CCBot, GPTBot nebo Google-Extended, ale zachovávají viditelnost v Google Search.
Tato navazující analýza přidává jiný postřeh: ani tradiční vyhledávací crawlery nejsou považovány za stejné.
Prověřili jsme šest vyhledávacích crawlerů:
- Googlebot;
- Bingbot;
- DuckDuckBot;
- Slurp;
- Baiduspider;
- YandexBot.
Napříč 7 248 analyzovatelnými weby:
| Zacházení s vyhledávacími crawlery | Weby |
|---|---|
| Blokuje alespoň jeden vyhledávací crawler | 562 |
| Povolen Googlebot, ale blokován alespoň jeden jiný vyhledávací crawler | 404 |
| Blokuje všech šest kontrolovaných vyhledávacích crawlerů | 152 |
Počty blokovaných botů nejsou rozloženy rovnoměrně:

| Vyhledávací crawler | Weby, které jej blokují |
|---|---|
| Baiduspider | 424 |
| YandexBot | 393 |
| Slurp | 255 |
| DuckDuckBot | 231 |
| Bingbot | 204 |
| Googlebot | 158 |
Googlebot je v této sadě nejméně blokovaný crawler. Baiduspider a YandexBot jsou blokovány mnohem častěji a ve většině těchto případů je Googlebot stále povolen. Mezi 404 weby, které povolují Googlebot, ale blokují jiný vyhledávací crawler, blokuje 269 Baiduspider a 240 YandexBot.
Příklady jsou vysoce známé:
| Doména | Blokované vyhledávací crawlery při povoleném Googlebotu |
|---|---|
facebook.com | Baiduspider, YandexBot |
apple.com | Baiduspider |
twitter.com | DuckDuckBot, Slurp, Baiduspider, YandexBot |
netflix.com | DuckDuckBot, Slurp |
x.com | DuckDuckBot, Slurp, Baiduspider, YandexBot |
tiktok.com | Baiduspider |
baidu.com | Bingbot, DuckDuckBot, Slurp, YandexBot |
washingtonpost.com | YandexBot |
wsj.com | YandexBot |
bilibili.com | DuckDuckBot, Slurp, YandexBot |
temu.com | Slurp |
t-mobile.com | Baiduspider, YandexBot |
To je pro debatu o AI důležité, protože ukazuje, že robots.txt už před příchodem LLM crawlerů nebyl neutrálním protokolem pro univerzální přístup. Veřejný web už měl hierarchii:
- Googlebot se často zachovává, protože provoz z Google Search je příliš cenný na to, aby se riskoval.
- Regionální nebo konkurenční crawlery se blokují snadněji.
- Některé weby považují přístup vyhledávacích crawlerů za rozhodnutí podle trhu nebo podle dodavatele.
AI crawlery vstoupily do ekosystému, kde byla diferencovaná dostupnost už normální.
To usnadňuje pochopit přechod v politice. Vydavatel, který napíše „blokovat Google-Extended, povolit Googlebot“, nevynalézá nový druh diskriminace. Aplikuje starý vzorec na novou třídu crawleru: zachovat distribuci, omezit extrakci.
Nevyřešenou otázkou je, zda se tento starý vzorec dokáže škálovat. U vyhledávání bylo jen několik ekonomicky důležitých crawlerů. U AI je identita crawlerů roztříštěná napříč dodavateli modelů, retrieval boty, datovými brokery, akademickými crawlery, syntetickými browser agenty a fetchery na úrovni infrastruktury. Počet pojmenovaných user-agentů bude dál růst, dokud se ekosystém nesjednotí na menší sadě signálů podle účelu.
Tak se dluh v konfiguraci skládá.
Zjištění 5: Složitost se liší podle sektoru, ale ne stejným způsobem jako míra blokování AI
Původní zpráva ukázala velký rozdíl mezi sektory v blokování AI: zpravodajství blokuje často; telekom, státní správa a SaaS blokují málo.
Složitost konfigurace dělí web jinak.
U vybraných kategorií s dostatečným počtem čitelných souborů robots.txt pro smysluplné srovnání:
| Kategorie | n | Medián bajtů | P90 bajtů | Medián Disallow | P90 Disallow | Medián User-agent | P90 User-agent |
|---|---|---|---|---|---|---|---|
| ecommerce | 215 | 1 738 | 10 388 | 37 | 164 | 3 | 49 |
| travel | 63 | 2 074 | 27 368 | 41 | 779 | 5 | 34 |
| news | 647 | 1 534 | 7 039 | 19 | 114 | 6 | 68 |
| finance | 121 | 1 002 | 8 337 | 17 | 132 | 2 | 23 |
| academia | 253 | 839 | 3 959 | 14 | 75 | 1 | 11 |
| government | 151 | 1 227 | 3 263 | 13 | 46 | 1 | 4 |
| SaaS | 368 | 485 | 12 606 | 4 | 56 | 1 | 10 |
| dev tools | 119 | 273 | 9 255 | 3 | 58 | 1 | 10 |
Graf P90 Disallow podle kategorie sem<<<<<<<<<<<<<<<<<<<<<<<<<
Zpravodajství je politicky složité, protože píše explicitní pravidla pro AI a právní text. Ale e-commerce a cestování jsou provozně složité, protože mají velké katalogy, faceted navigation, stránky s výsledky hledání, filtry, cesty k uživatelským účtům a parametrizované URL.
Tohle rozlišení je důležité.
Cestování je nejjasnější příklad. V této výseči má jen 63 čitelných souborů, ale jeho P90 robots.txt má 27,4 KB a P90 počet Disallow je 779, což je výrazně víc než u news. To neznamená, že cestovní weby mají vyspělejší AI politiku. Znamená to, že mají více ploch, na kterých operátoři crawlerů mohou zbytečně utrácet crawl budget: vyhledávání podle datumu, stránky s dostupností, stránkování recenzí, rezervační flow, kombinace filtrů a lokalizované cesty k inventáři.
SaaS je opačný typ překvapení. Mediánový soubor má jen 485 bajtů, ale P90 soubor vyskočí na 12,6 KB. Většina SaaS webů je otevřená a lehká; menší část nese dlouhé soubory pro řízení cest, často proto, že dokumentace, přihlašovací povrchy, aplikační trasy a marketingové stránky žijí pod stejnou doménou.
News je provozně uprostřed, ale politicky téměř na vrcholu. Jeho P90 počet User-agent je 68, což je v této tabulce víc než e-commerce, travel, finance, academia, government, SaaS i dev tools. To je známka politiky specifické pro boty, ne jen hygieny cest.
robots.txt vydavatele může být složitý kvůli autorským právům. Soubor tržiště může být složitý kvůli řízení crawl budgetu. Soubor univerzity může být složitý, protože se pod jednou doménou nashromáždily tisíce starých cest. Soubor sociální platformy může být složitý, protože musí odhalit některé plochy a jiné potlačit ve velkém měřítku.
AI politika na to všechno nasedá. Nenahrazuje důvody, proč je soubor složitý.
To vysvětluje, proč se governance robots.txt v éře AI nedá vyřešit univerzálním blacklistem. Základní soubory mají různé úkoly:
- e-commerce weby řídí duplicitní cesty a plochy s inventářem;
- cestovní weby řídí nabídky, kalendáře, recenze a dynamické stránky hledání;
- zpravodajské weby řídí autorská práva, archivy a licenční postoj;
- SaaS a vývojářské nástroje často chtějí AI viditelnost;
- státní správa často potřebuje veřejný přístup, ale může mít citlivé systémy k vyloučení;
- sociální platformy řídí obsah od uživatelů, profily a obavy ze zneužití.
Stejné pravidlo pro AI crawler v každém prostředí znamená něco jiného.
Zjištění 6: Index dluhu v konfiguraci identifikuje riziko kontroly, ne morální selhání
Tato analýza vytvořila jednoduché skóre dluhu v konfiguraci, aby identifikovala soubory robots.txt, které se budou pravděpodobně těžko revidovat.
Skóre váží:
- velikost souboru;
- počet direktiv
User-agent; - počet direktiv
Disallow; - počet direktiv
Allow; - počet ne-jádrových direktiv;
- přítomnost jazyka k AI politice;
- kombinaci explicitního blokování AI a právního nebo autorskoprávního jazyka.
Nejde o skóre správnosti. Vysoce složitý soubor může být naprosto záměrný. Nízkosložitý soubor může být pořád špatně. Cílem je triáž: pokud je soubor velký, těžký na politiku, specifický pro boty a plný výjimek, zaslouží si přísnější kontrolu.

Rozložení skóre je strmé. Medián čitelného souboru má skóre 1,74. P90 je 13,29, P95 15,00 a P99 27,57. Jen 366 souborů má skóre alespoň 15, 80 má alespoň 25 a 41 má alespoň 30. To je praktická fronta k revizi: ne každý web potřebuje governance projekt, ale horní ocas ano.
Pohled podle kategorií také ukazuje, proč je jedno označení „blokátor AI“ příliš ploché:
| Kategorie | Medián skóre | P90 skóre |
|---|---|---|
| travel | 4,92 | 28,94 |
| search | 2,97 | 24,23 |
| social | 2,25 | 15,00 |
| news | 4,91 | 14,92 |
| finance | 1,67 | 12,61 |
| SaaS | 0,98 | 11,85 |
| ecommerce | 3,88 | 10,87 |
| government | 1,57 | 6,38 |
Travel a search mají nejvyšší P90 skóre, protože menšina souborů je velmi velká a pravidlově těžká. News má jedno z nejvyšších mediánových skóre, protože jazyk politiky a zacházení specifické pro boty je napříč kategorií běžnější. E-commerce má vysoký medián počtu Disallow, ale jeho P90 skóre dluhu je nižší než u travel, protože složitost je víc soustředěná v pravidlech cest než ve smíšených signálech politiky a práva.
Nejvýše hodnocené soubory v tomto datasetu zahrnují:
| Doména | Proč má vysoké skóre |
|---|---|
linkedin.com | Velmi velký soubor, tisíce pravidel cest, mnoho pojmenovaných user-agentů, explicitní jazyk AI politiky |
lnkd.in | Stejná politická plocha jako krátké odkazy infrastruktury LinkedIn |
fragrantica.com | Stovky bloků pro pojmenované user-agenty plus jazyk AI politiky |
sovcombank.ru | Stovky bloků pro user-agenty a právní/politický jazyk |
academia.edu | Velká matice allow/disallow a explicitní politika blokování AI |
opentable.com | Velký soubor pravidel cest, mnoho direktiv sitemap a politická plocha související s AI |
etsy.com | Velký e-commerce soubor pro řízení cest s více než 1 600 pravidly Disallow |
runescape.com | Téměř 5 000 direktiv Disallow pod jednou skupinou user-agentů |
Tyto soubory by se neměly zesměšňovat za složitost. Složitost často odráží skutečné obchodní potřeby. Ale ukazují, proč si politika robots.txt zaslouží stejnou engineering disciplínu jako jiná produkční konfigurace:
- vlastnictví má být explicitní;
- změny mají být revidované;
- generované sekce mají být označené;
- právní komentáře mají být pokud možno oddělené od strojových direktiv;
- testovací případy mají ověřovat očekávaný přístup botů pro kritické crawlery;
- historie verzí má být zachována;
- staré názvy botů mají být vyřazeny nebo zdokumentovány;
- trénování AI, retrieval AI, indexování vyhledávání a archivace mají být považovány za oddělené účely.
Poslední bod je nejdůležitější. Současná gramatika je založená na user-agentu: žádá správce webu, aby jmenovali boty. Potřeba v éře AI je založená na účelu: žádá správce webu, aby řekli, jaké využití je povoleno.
To není totéž.
Právě tenhle nesoulad je důvod, proč dlouhé blacklisty nevydrží. Vydavatel může dnes přidat GPTBot, ClaudeBot, CCBot, Google-Extended, Bytespider, Applebot-Extended a PerplexityBot, ale zítra může přijít další jméno crawleru, retrieval agent nebo dataset broker. Politika založená na účelu by webu dovolila říct „indexování vyhledávání ano, trénování AI ne, user-triggered retrieval možná“, aniž by se robots.txt změnil v adresář botů.
Co to znamená pro řízení AI
Veřejná debata často rámuje robots.txt jako buď smysluplný, nebo zastaralý. Data naznačují praktičtější odpověď:
robots.txt je smysluplný, ale přetížený.
Je smysluplný, protože ho používají velké weby, crawlery ho umí parsovat a rozhodnutí v něm jsou viditelná pro výzkumníky, novináře, dodavatele i soudy. Původní zpráva zjistila, že 17,0 % analyzovatelných top webů mělo záměrná pravidla specifická pro AI. To není symbolický šum.
Je přetížený, protože musí vyjádřit víc než přístup botů:
- „Netrenujte na tomhle obsahu.“
- „Tento obsah můžete použít pro indexování ve vyhledávání.“
- „Tento obsah můžete použít pro živý retrieval.“
- „Nesmíte vytvářet cacheovaná data.“
- „Toto právní vyhrazení platí podle práva EU o textu a dolování dat.“
- „Tento web spravovaný přes CDN posílá
Content-Signal: ai-train=no." - „Tento web chce Googlebot, ale ne YandexBot."
- „Tento web má 1 000 starých URL cest, které se nemají crawlvat."
Tahleta gramatika na tolik úkolů nebyla navržená.
Tři změny by ten dluh snížily:
-
Identita crawlerů potřebuje registr. Správci webů by neměli muset udržovat stále rostoucí seznam
GPTBot,ClaudeBot,anthropic-ai,CCBot,Google-Extended,Applebot-Extended,Bytespider,OAI-SearchBot,ChatGPT-Usera desítek dalších. Bez registru bude politika vždy za chováním crawlerů zaostávat. -
Použití AI potřebuje strukturovaný slovník. Trénování, retrieval, indexování, shrnování, prodej datasetů, vyhodnocování modelů a prohlížení spuštěné uživatelem jsou různé účely. Vyjádřit je přes názvy user-agentů specifické pro dodavatele je křehké.
-
Politika musí být auditovatelná. Web potřebuje způsob, jak rozlišit ručně napsané vyhrazení práv od zděděných defaultů CDN, generovaných CMS šablon, zastaralých starých pravidel a nechtěných catch-all bloků. To rozlišení je důležité pro důvěru i pro spor.
To neznamená, že se robots.txt má přes noc nahradit. Lepší cesta je vrstvení: ponechat robots.txt jako povrch pro objevování a kompatibilitu, ale standardizovat navazující strojově čitelnou politiku pro použití specifická pro AI.
llms.txt je jeden pokus, ale adopce v tomto datasetu je stále mizivá: jen 83 čitelných souborů zmiňuje llms.txt. Content-Signal je viditelnější, protože ho může Cloudflare distribuovat přes infrastrukturu, a všech 271 souborů s Content-Signal v tomto průchodu zároveň odpovídalo jazyku k AI politice. Samotná distribuce ale není totéž co shoda. Udržitelný výsledek bude pravděpodobně potřebovat nudnou, ale nutnou standardizaci: jasná pole, jasnou sémantiku, závazky crawlerů a veřejné testovací sady.
Závěr
Bitva o AI crawlery proměnila robots.txt v governance artefakt. To je zároveň užitečné i rizikové.
Užitečné, protože soubor je veřejný. Výzkumníci ho mohou auditovat. Vydavatelé ho mohou měnit. Crawlery ho mohou respektovat. Soudy ho mohou číst. Poskytovatelé infrastruktury ho mohou nasazovat ve velkém měřítku.
Rizikové, protože toho nese příliš.
Mediánový soubor robots.txt v Tranco Top 10K je pořád dost malý na to, aby se dal pochopit. Ale dlouhý ocas webu s vysokou návštěvností je plný velkých, starých, vrstvených, vendor-specific a právně zatížených souborů. Stovky webů dnes spravují konfigurace robots.txt, které je lepší chápat jako produkční systémy politik než jako jednoduché nápovědy pro crawlery.
Hlavní lekce není, že robots.txt selhal. Je to, že ho web povýšil, aniž by ho refaktoroval.
Jestli má politika přístupu pro AI stát na veřejných strojově čitelných prohlášeních, další krok není další delší blacklist. Je to lepší infrastruktura politiky: oprávnění založená na účelu, stabilní identita crawlerů, šablony, které lze kontrolovat, a auditní stopy.
Do té doby bude vrstva řízení AI na veřejném webu dál stát na textovém souboru, který nikdy neměl nést tak velkou zátěž.
Poznámky k reprodukovatelnosti
Dodaná složka obsahuje:
source_data/analysis.json— původní agregované metriky.source_data/site_meta.csv— původní analytickou tabulku po webech.source_data/bot_status.csv— původní tabulku politik po doménách a botech.source_data/fetch_meta.csv— původní metadata načítání.source_data/sites.csv— původní tabulku domén/kategorií/stavu.derived_data/robots_complexity_by_site.csv— metriky složitosti po webech vytvořené pro tuto zprávu.derived_data/search_bot_treatment.csv— matice zacházení s vyhledávacími crawlery.derived_data/category_complexity_summary.csv— souhrn složitosti podle kategorií.derived_data/top_config_debt_sites.csv— nejvyšší weby podle triážního skóre popsaného výše.derived_data/summary_metrics.json— všechny hlavní metriky citované v této zprávě.
Stáhnout všechny skripty a datové sady
Opravy metodologie, problémy v datech i navazující analýzy uvítáme na adrese support@thunderbit.com. Tato zpráva je publikována nezávisle na jakékoli obchodní pozici Thunderbitu; vytváříme AI web scraper a máme strukturální zájem na tom, aby robots.txt dál zůstával smysluplnou, strojově čitelnou dohodou na veřejném webu. Data v této zprávě stojí sama za sebe. — Výzkumný tým Thunderbit, květen 2026.
Vyzkoušejte Thunderbit pro AI web scraping Get Started Free


