Zpráva | Jak se robots.txt proměnil v chaotickou webovou politiku

Poslední aktualizace May 9, 2026
Zpráva | Jak se robots.txt proměnil v chaotickou webovou politiku

Shrnutí pro vedení

Předchozí zpráva položila otázku ohledně pravidel: kolik z nejnavštěvovanějších webů na světě říká AI crawlerům, co smějí a nesmějí dělat?

Tato navazující zpráva se ptá na provozní otázku, která za tím stojí: jak spolehlivý je robots.txt jako infrastruktura, která má tuto politiku nést?

Odpověď je nepříjemná. robots.txt pořád funguje, protože je veřejný, levný, strojově čitelný a crawlery mu už rozumí. Zároveň se po něm chce mnohem víc, než pro co byl navržen. V roce 2026 může tentýž jednoduchý textový soubor obsahovat SEO pravidla pro crawling, odkazy na sitemapu, starší rozšíření pro vyhledávače, výjimky z trénování AI, slovník zásad vložený Cloudflarem, vyjádření k autorským právům i právní jazyk pro budoucí spory.

To je dluh v konfiguraci.

Dataset pro tuto zprávu je stejný Tranco Top 10,000 crawl jako v původní studii AI crawlerů. Z 10 000 domén vrátilo 6 638 čitelný robots.txt; dalších 610 vrátilo 404, což protokol bere jako implicitní povolení. To dává 7 248 analyzovatelných webů pro rozhodování o přístupu botů a 6 638 konkrétních souborů pro analýzu složitosti konfigurace.

Vyniká šest zjištění:

  1. Většina souborů robots.txt je malá, ale dlouhý ocas je extrémně složitý. Medián souboru má jen 834 bajtů a 31 řádků. Ale 1 005 souborů má alespoň 5 KB, 273 má alespoň 20 KB a 28 má alespoň 100 KB. Největší soubor ve vzorku má 248 KB.

  2. Stovky top webů provozují soubory, které se blíží spíš produkční konfiguraci než poznámce s politikou. Medián souboru má 9 direktiv Disallow. Ale 707 webů má alespoň 100 pravidel Disallow, 13 jich má alespoň 1 000, 240 uvádí alespoň 50 user-agentů a 110 uvádí alespoň 100 user-agentů.

  3. Drift protokolu není teoretický. Mezi 6 638 čitelnými soubory jich 685 obsahuje Crawl-delay, 303 Host, 200 Clean-param, 9 Request-rate, 5 Visit-time a 271 obsahuje jazyk typu Content-Signal ve stylu Cloudflare. Nejde o jednu čistou normu. Je to nashromážděný folklór crawlerů.

  4. Googlebot je považován za zvláštního uživatele. 562 analyzovatelných domén blokuje alespoň jeden tradiční vyhledávací crawler. Ve 404 z těchto případů je Googlebot povolen, zatímco alespoň jeden jiný vyhledávací crawler je blokován. Diskriminace AI crawlerů nevznikla v neutrálním prostředí; robots.txt už dřív kódoval hierarchii vyhledávačů.

  5. AI politika dluh ještě víc zviditelňuje. 1 377 čitelných souborů obsahuje jazyk k AI politice; 719 obsahuje autorská práva, podmínky, licencování nebo jazyk o povolení; a 501 obsahuje obojí. Soubor se stal zároveň rozhraním pro stroje i právním artefaktem. To je užitečné, ale křehké.

  6. Nejrizikovější soubory nejsou vždy ty nejvíc proti AI. E-commerce, cestování, sociální sítě, finance, akademická sféra i zpravodajství vytvářejí složité soubory z různých důvodů: řízení crawl budgetu, staré cesty, obsah vytvářený uživateli, vyhrazení práv a výjimky pro konkrétní boty. Na už tak chaotický základ se vrství pravidla pro AI.

Hlavní závěr: robots.txt zůstává nejdůležitějším veřejným povrchem pro crawler policy na webu, ale je slabým základem pro vysoce citlivé řízení AI, pokud ekosystém nezstandardizuje identitu crawlerů, slovník pro využití AI a auditovatelnost pravidel.


Metodologie

Tato zpráva znovu využívá dataset z původní analýzy Thunderbitu o politice AI crawlerů na doménách Tranco Top 10,000.

Vstupní materiály byly:

  • tranco_top10k.csv — původní seznam 10 tisíc domén Tranco.
  • out/fetch_meta.csv — stav načtení, počet bajtů, schéma, výsledek přesměrování a metadata chyb.
  • out/sites.csv — doména, pořadí, kategorie, jazyk a stav robots.txt.
  • out/site_meta.csv — jeden analytický řádek na web, včetně třídy šablony, příznaků blokování AI, velikosti souboru a souhrnných polí politiky botů.
  • out/bot_status.csv — jeden řádek na doménu a crawler, včetně toho, zda je daný bot blokován a zda existuje konkrétní pravidlo.
  • raw_robots/ — uložené tělo robots.txt pro 6 638 webů, které vrátily stav 200.

Pro tuto navazující analýzu byl každý čitelný soubor robots.txt prohledán na:

  • velikost souboru a počet řádků;
  • aktivní nekomentované řádky;
  • počty direktiv User-agent, Disallow, Allow a Sitemap;
  • starší nebo ne-jádrové direktivy jako Crawl-delay, Host, Clean-param, Request-rate a Visit-time;
  • slovník éry AI včetně Content-Signal, llms.txt, AI, LLM, machine learning, TDM a 2019/790;
  • právní slovník jako copyright, terms of service, licensing, permission a jazyk o vyhrazení práv;
  • zacházení s vyhledávacími crawlery Googlebot, Bingbot, DuckDuckBot, Slurp, Baiduspider a YandexBot.

Zpráva také definuje jednoduché skóre dluhu v konfiguraci pro triáž. Kombinuje velikost souboru, počet user-agentů, počet Disallow, počet Allow, počet nestandardních direktiv a směs AI-politiky a právního jazyka. Skóre nemá být univerzálním měřítkem správnosti. Je to způsob, jak identifikovat soubory, které se budou pravděpodobně těžko udržovat, kontrolovat nebo interpretovat.

Všechny odvozené tabulky a grafy jsou součástí dodaného balíčku.


Zjištění 1: Mediánový soubor je jednoduchý; dlouhý ocas ne

Typický soubor robots.txt na velkém webu je pořád malý.

robots-txt-analysis-may-2026.webp

Napříč 6 638 čitelnými soubory:

MetrikaMediánP90P95P99Maximum
Velikost souboru834 bajtů6,7 KB15,8 KB76,0 KB248,3 KB
Řádky312383321 0084 998
Aktivní řádky231982828374 998
Direktivy User-agent12139137823
Direktivy Disallow91031764224 997
Direktivy Allow1173369890

Tato distribuce je důležitá, protože se o robots.txt často mluví, jako by šlo o krátké prohlášení:

User-agent: *
Disallow: /private/

Tento mentální model je pro významnou menšinu webu s vysokou návštěvností chybný.

V tomto datasetu:

robots-txt-complexity-thresholds.webp

Práh složitostiWeby
robots.txt větší nebo rovno 5 KB1 005
Větší nebo rovno 20 KB273
Větší nebo rovno 100 KB28
Alespoň 50 direktiv User-agent240
Alespoň 100 direktiv User-agent110
Alespoň 100 direktiv Disallow707
Alespoň 1 000 direktiv Disallow13
Alespoň 100 direktiv Allow40

Největší a nejsložitější soubory nejsou akademická kuriozita. Patří skutečným, vysoce navštěvovaným webům:

DoménaPořadíKategorieBajtůUser-agentDisallowAllow
linkedin.com17social114 341764 184281
runescape.com5 226unknown113 39314 9970
academia.edu832academia57 384632 044227
etsy.com286ecommerce51 32031 621120
thepaper.cn9 395news56 86711 4960
opentable.com4 137unknown70 494321 683176
alfabank.ru2 625finance73 15821 566133

Tyto soubory jsou blíž produkčním směrovacím tabulkám než sloganům o politice. Kódují roky produktových launchů, staré cesty, blokované vzory parametrů, výjimky pro crawlery, SEO experimenty, rozhodnutí CDN a teď i pravidla pro AI crawly.

Dlouhý ocas není jen příběh o AI. Z 273 souborů na úrovni 20 KB a výše obsahuje 131 jazyk k AI politice a 142 neobsahuje. Z 707 souborů s alespoň 100 direktivami Disallow obsahuje jazyk k AI politice jen 207. Jinými slovy: AI nevytvořila problém velkých souborů. Přišla až poté, co do nich roky běžného provozu webu přibyly cesty, odkazy na sitemapu a výjimky pro crawlery.

To je důležité, protože udržovatelnost závisí na struktuře, ne jen na záměru. Malý soubor s přímým blokem pro AI může být snadný na kontrolu. 70KB e-commerce nebo cestovatelský soubor může být těžké auditovat, i když o AI vůbec nemluví. Riziko není v tom, že každý velký soubor je chybný. Riziko je v tom, že výsledná politika je příliš složitá na to, aby ji lidé odpovědní za její údržbu dokázali ověřit.

Provozní riziko je jednoduché: jak robots.txt roste, je pro vydavatele, inženýra platformy, právníka nebo SEO leada těžší odpovědět na základní otázku: co tenhle soubor vlastně dovoluje?

To už není triviální otázka. Podle parsování ve stylu RFC může crawler místo User-agent: * najít specifičtější skupinu user-agentů; delší shody cest mohou přebít kratší; direktivy Allow a Disallow spolu interagují podle precedence; a obecná pravidla typu deny-all mohou nechtěně zachytit nové crawlery, které v době vzniku souboru ještě neexistovaly.

Pro třicet řádků to člověk zvládne rozumově zpracovat. Pro 4 000 řádků a desítky pojmenovaných botů už by to dělat neměl nikdo.


Zjištění 2: robots.txt nese víc než pravidla pro crawling

Debata o AI crawlerech zviditelnila robots.txt politicky, ale samotný soubor už dávno přebíral nesouvisející úkoly.

Moderní robots.txt na velkém webu může obsahovat:

  • kontrolu cest pro crawlery;
  • objevování sitemap;
  • rozšíření specifická pro vyhledávače;
  • nápovědy k rychlosti crawlování;
  • nápovědy ke kanonizaci hostitele;
  • nápovědy k úpravě URL parametrů;
  • slovník zásad vložený CDN;
  • text o vyhrazení autorských práv;
  • výjimky z trénování AI;
  • právní komentář čitelný pro člověka.

Dataset tohle vrstvení ukazuje jasně.

SignálSouboryPodíl čitelných souborů
Crawl-delay68510,3 %
Host3034,6 %
Clean-param2003,0 %
Content-Signal2714,1 %
Request-rate90,1 %
Visit-time50,1 %
Zmínka o llms.txt831,3 %
Jazyk o autorských právech, podmínkách, licencování nebo povolení71910,8 %
Jazyk k AI politice1 37720,7 %

Některé z těchto direktiv jsou široce rozpoznávané konkrétními crawlery. Některé jsou starší konvence. Některé jsou specifické pro dodavatele. A některé nejsou vlastně crawler direktivy vůbec, ale právní nebo produktový jazyk vložený do komentářů.

Tak vypadá drift protokolu.

Crawl-delay je užitečný příklad. Mnoha správcům webů je známý, ale podpora je napříč hlavními crawlery nevyrovnaná. Host a Clean-param byly historicky spojované s chováním Yandexu. Content-Signal je součást slovníku zásad pro éru AI od Cloudflare. llms.txt je navrhovaný související formát pro objevování, ne univerzálně respektovaný standard. A přesto se všechny tyto věci objevují ve stejném typu souboru, často vedle klasických pravidel User-agent a Disallow.

Čísla také ukazují, jak dnes vedle sebe existují starší i novější konvence. Crawl-delay se objevuje v 685 souborech, tedy více než dvakrát častěji než Content-Signal ve 271 souborech. Host se objevuje ve 303 souborech a Clean-param ve 200, což většinou odráží konvence z éry vyhledávání. llms.txt, navzdory intenzivní debatě v kruzích kolem AI vyhledávání, je zmíněn jen ve 83 čitelných souborech. Živý web se nesbližuje na jednom slovníku. Vrství slovníky na sebe.

Problém není v tom, že by bylo cokoli z toho samo o sobě špatně. Problém je, že se soubor stal neversionovaným kontejnerem pro několik překrývajících se systémů řízení.

To vytváří tři typy dluhu:

  1. Sémantický dluh. Různí crawlery mohou tentýž soubor vykládat odlišně.
  2. Dluh vlastnictví. SEO, právní, infrastruktura, bezpečnost i produktové týmy mohou mít důvod soubor upravovat, ale nikdo nemusí vlastnit celou politiku.
  3. Auditní dluh. Web může publikovat politiku, která vypadá záměrně, zatímco skutečné chování dokáže určit jen parser.

AI to činí důležitějším, protože se změnila sázka. Když je ignorována stará nápověda k rychlosti crawlů, výsledkem může být jen více provozu. Když je nejednoznačný opt-out z trénování AI, výsledkem se může stát důkaz v autorskoprávním nebo licenčním sporu.


Zjištění 3: Soubor je zároveň rozhraní pro stroje i právní artefakt

Původní zpráva o AI crawlerech ukázala, že 17,0 % analyzovatelných webů mělo napsaná explicitní pravidla specifická pro AI. Tato navazující analýza se dívá na textovou zátěž, kterou tyto politiky přidávají.

protocol-drift-signals-chart.webp

Mezi 6 638 čitelnými soubory robots.txt:

  • 1 377 obsahuje jazyk k AI politice;
  • 719 obsahuje autorská práva, podmínky, licencování, práva nebo jazyk o povolení;
  • 271 obsahuje Content-Signal;
  • 83 zmiňuje llms.txt.

Nejzajímavější je překryv:

ai-policy-legal-rights-language-overlap.webp

Textový vzorSoubory
Jazyk k AI politice a právní/jazyk o právech501
Jazyk k AI politice bez právního/jazyka o právech876
Právní/jazyk o právech bez AI jazyka218
Content-Signal s právním/jazykem o právech242
Explicitní blok pro AI s právním/jazykem o právech424

To je nový typ souboru.

Tradiční robots.txt míří na crawlery. robots.txt s právním úvodem míří nejméně na čtyři publika najednou:

  • provozovatele crawlerů, kteří potřebují strojově čitelná direktiva;
  • dodavatele vyhledávání a AI, kteří potřebují signály politiky;
  • právníky, kteří chtějí explicitní vyhrazení práv;
  • budoucí auditory, soudy nebo novináře, kteří mohou komentáře číst jako důkaz záměru.

Právě tento vícepublikový design vysvětluje, proč některé soubory dnes vypadají jako politické dokumenty. Zároveň ale oslabuje čisté oddělení mezi tím, co crawler umí parsovat, a tím, co chce právník prohlásit.

876 souborů s jazykem k AI politice, ale bez právního slovníku, jsou převážně strojové politické soubory: jména botů, bloky Disallow a šablonovitý jazyk. 501 souborů s obojím je jiný typ. Snaží se být zároveň instrukcí pro crawlery i vyhrazením práv. 218 souborů s právním jazykem, ale bez AI slovníku, ukazuje, že tento vzor nezačal až s LLM; robots.txt se už dřív používal k vyjádření podmínek, hranic povolení a nároků na práva.

Například komentář může tvrdit, že je zakázáno machine learning, zatímco skutečný blok direktiv jen zakazuje podmnožinu známých user-agentů. Web může globálně tvrdit vyhrazení práv, ale jmenovat jen několik crawlerů. Šablona CDN může do souboru vložit AI slovník, i když provozovatel nikdy ten právní jazyk ručně nepsal. Web může napsat široké pravidlo User-agent: *, které nechtěně zablokuje budoucí crawlery.

Z pohledu řízení je robots.txt atraktivní právě proto, že je veřejný a strojově čitelný. Ale čím víc politiky nese, tím víc se projevují jeho limity:

  • neexistuje autentizační vrstva, která by prokazovala, že konkrétní pravidlo ověřil držitel práv, a ne že bylo převzato z infrastruktury;
  • neexistuje nativní historie verzí;
  • neexistuje strukturované pole pro zamýšlené použití, jako je trénování, retrieval, indexování, shrnování, caching nebo vyhodnocování modelů;
  • neexistuje univerzální registr identity AI crawlerů;
  • neexistuje vynucovací mechanismus.

To neznamená, že je soubor zbytečný. Znamená to, že je křehký.

Lepší interpretace je, že robots.txt se stává vrstvou oznámení: veřejným, kontrolovatelným vyjádřením preference a záměru. Sám o sobě to není kompletní systém správy práv.


Zjištění 4: Vyhledávání bylo nerovné už před příchodem AI

Jedním z nejsilnějších zjištění původní zprávy bylo, že mnoho vydavatelů rozlišuje mezi AI trénovacími crawlery a vyhledávacími crawlery. Blokují CCBot, GPTBot nebo Google-Extended, ale zachovávají viditelnost v Google Search.

Tato navazující analýza přidává jiný postřeh: ani tradiční vyhledávací crawlery nejsou považovány za stejné.

Prověřili jsme šest vyhledávacích crawlerů:

  • Googlebot;
  • Bingbot;
  • DuckDuckBot;
  • Slurp;
  • Baiduspider;
  • YandexBot.

Napříč 7 248 analyzovatelnými weby:

Zacházení s vyhledávacími crawleryWeby
Blokuje alespoň jeden vyhledávací crawler562
Povolen Googlebot, ale blokován alespoň jeden jiný vyhledávací crawler404
Blokuje všech šest kontrolovaných vyhledávacích crawlerů152

Počty blokovaných botů nejsou rozloženy rovnoměrně:

search-crawler-hierarchy.webp

Vyhledávací crawlerWeby, které jej blokují
Baiduspider424
YandexBot393
Slurp255
DuckDuckBot231
Bingbot204
Googlebot158

Googlebot je v této sadě nejméně blokovaný crawler. Baiduspider a YandexBot jsou blokovány mnohem častěji a ve většině těchto případů je Googlebot stále povolen. Mezi 404 weby, které povolují Googlebot, ale blokují jiný vyhledávací crawler, blokuje 269 Baiduspider a 240 YandexBot.

Příklady jsou vysoce známé:

DoménaBlokované vyhledávací crawlery při povoleném Googlebotu
facebook.comBaiduspider, YandexBot
apple.comBaiduspider
twitter.comDuckDuckBot, Slurp, Baiduspider, YandexBot
netflix.comDuckDuckBot, Slurp
x.comDuckDuckBot, Slurp, Baiduspider, YandexBot
tiktok.comBaiduspider
baidu.comBingbot, DuckDuckBot, Slurp, YandexBot
washingtonpost.comYandexBot
wsj.comYandexBot
bilibili.comDuckDuckBot, Slurp, YandexBot
temu.comSlurp
t-mobile.comBaiduspider, YandexBot

To je pro debatu o AI důležité, protože ukazuje, že robots.txt už před příchodem LLM crawlerů nebyl neutrálním protokolem pro univerzální přístup. Veřejný web už měl hierarchii:

  • Googlebot se často zachovává, protože provoz z Google Search je příliš cenný na to, aby se riskoval.
  • Regionální nebo konkurenční crawlery se blokují snadněji.
  • Některé weby považují přístup vyhledávacích crawlerů za rozhodnutí podle trhu nebo podle dodavatele.

AI crawlery vstoupily do ekosystému, kde byla diferencovaná dostupnost už normální.

To usnadňuje pochopit přechod v politice. Vydavatel, který napíše „blokovat Google-Extended, povolit Googlebot“, nevynalézá nový druh diskriminace. Aplikuje starý vzorec na novou třídu crawleru: zachovat distribuci, omezit extrakci.

Nevyřešenou otázkou je, zda se tento starý vzorec dokáže škálovat. U vyhledávání bylo jen několik ekonomicky důležitých crawlerů. U AI je identita crawlerů roztříštěná napříč dodavateli modelů, retrieval boty, datovými brokery, akademickými crawlery, syntetickými browser agenty a fetchery na úrovni infrastruktury. Počet pojmenovaných user-agentů bude dál růst, dokud se ekosystém nesjednotí na menší sadě signálů podle účelu.

Tak se dluh v konfiguraci skládá.


Zjištění 5: Složitost se liší podle sektoru, ale ne stejným způsobem jako míra blokování AI

Původní zpráva ukázala velký rozdíl mezi sektory v blokování AI: zpravodajství blokuje často; telekom, státní správa a SaaS blokují málo.

Složitost konfigurace dělí web jinak.

U vybraných kategorií s dostatečným počtem čitelných souborů robots.txt pro smysluplné srovnání:

KategorienMedián bajtůP90 bajtůMedián DisallowP90 DisallowMedián User-agentP90 User-agent
ecommerce2151 73810 38837164349
travel632 07427 36841779534
news6471 5347 03919114668
finance1211 0028 33717132223
academia2538393 9591475111
government1511 2273 263134614
SaaS36848512 606456110
dev tools1192739 255358110

Graf P90 Disallow podle kategorie sem<<<<<<<<<<<<<<<<<<<<<<<<<

Zpravodajství je politicky složité, protože píše explicitní pravidla pro AI a právní text. Ale e-commerce a cestování jsou provozně složité, protože mají velké katalogy, faceted navigation, stránky s výsledky hledání, filtry, cesty k uživatelským účtům a parametrizované URL.

Tohle rozlišení je důležité.

Cestování je nejjasnější příklad. V této výseči má jen 63 čitelných souborů, ale jeho P90 robots.txt má 27,4 KB a P90 počet Disallow je 779, což je výrazně víc než u news. To neznamená, že cestovní weby mají vyspělejší AI politiku. Znamená to, že mají více ploch, na kterých operátoři crawlerů mohou zbytečně utrácet crawl budget: vyhledávání podle datumu, stránky s dostupností, stránkování recenzí, rezervační flow, kombinace filtrů a lokalizované cesty k inventáři.

SaaS je opačný typ překvapení. Mediánový soubor má jen 485 bajtů, ale P90 soubor vyskočí na 12,6 KB. Většina SaaS webů je otevřená a lehká; menší část nese dlouhé soubory pro řízení cest, často proto, že dokumentace, přihlašovací povrchy, aplikační trasy a marketingové stránky žijí pod stejnou doménou.

News je provozně uprostřed, ale politicky téměř na vrcholu. Jeho P90 počet User-agent je 68, což je v této tabulce víc než e-commerce, travel, finance, academia, government, SaaS i dev tools. To je známka politiky specifické pro boty, ne jen hygieny cest.

robots.txt vydavatele může být složitý kvůli autorským právům. Soubor tržiště může být složitý kvůli řízení crawl budgetu. Soubor univerzity může být složitý, protože se pod jednou doménou nashromáždily tisíce starých cest. Soubor sociální platformy může být složitý, protože musí odhalit některé plochy a jiné potlačit ve velkém měřítku.

AI politika na to všechno nasedá. Nenahrazuje důvody, proč je soubor složitý.

To vysvětluje, proč se governance robots.txt v éře AI nedá vyřešit univerzálním blacklistem. Základní soubory mají různé úkoly:

  • e-commerce weby řídí duplicitní cesty a plochy s inventářem;
  • cestovní weby řídí nabídky, kalendáře, recenze a dynamické stránky hledání;
  • zpravodajské weby řídí autorská práva, archivy a licenční postoj;
  • SaaS a vývojářské nástroje často chtějí AI viditelnost;
  • státní správa často potřebuje veřejný přístup, ale může mít citlivé systémy k vyloučení;
  • sociální platformy řídí obsah od uživatelů, profily a obavy ze zneužití.

Stejné pravidlo pro AI crawler v každém prostředí znamená něco jiného.


Zjištění 6: Index dluhu v konfiguraci identifikuje riziko kontroly, ne morální selhání

Tato analýza vytvořila jednoduché skóre dluhu v konfiguraci, aby identifikovala soubory robots.txt, které se budou pravděpodobně těžko revidovat.

Skóre váží:

  • velikost souboru;
  • počet direktiv User-agent;
  • počet direktiv Disallow;
  • počet direktiv Allow;
  • počet ne-jádrových direktiv;
  • přítomnost jazyka k AI politice;
  • kombinaci explicitního blokování AI a právního nebo autorskoprávního jazyka.

Nejde o skóre správnosti. Vysoce složitý soubor může být naprosto záměrný. Nízkosložitý soubor může být pořád špatně. Cílem je triáž: pokud je soubor velký, těžký na politiku, specifický pro boty a plný výjimek, zaslouží si přísnější kontrolu.

configuration-debt-review-queue.webp

Rozložení skóre je strmé. Medián čitelného souboru má skóre 1,74. P90 je 13,29, P95 15,00 a P99 27,57. Jen 366 souborů má skóre alespoň 15, 80 má alespoň 25 a 41 má alespoň 30. To je praktická fronta k revizi: ne každý web potřebuje governance projekt, ale horní ocas ano.

Pohled podle kategorií také ukazuje, proč je jedno označení „blokátor AI“ příliš ploché:

KategorieMedián skóreP90 skóre
travel4,9228,94
search2,9724,23
social2,2515,00
news4,9114,92
finance1,6712,61
SaaS0,9811,85
ecommerce3,8810,87
government1,576,38

Travel a search mají nejvyšší P90 skóre, protože menšina souborů je velmi velká a pravidlově těžká. News má jedno z nejvyšších mediánových skóre, protože jazyk politiky a zacházení specifické pro boty je napříč kategorií běžnější. E-commerce má vysoký medián počtu Disallow, ale jeho P90 skóre dluhu je nižší než u travel, protože složitost je víc soustředěná v pravidlech cest než ve smíšených signálech politiky a práva.

Nejvýše hodnocené soubory v tomto datasetu zahrnují:

DoménaProč má vysoké skóre
linkedin.comVelmi velký soubor, tisíce pravidel cest, mnoho pojmenovaných user-agentů, explicitní jazyk AI politiky
lnkd.inStejná politická plocha jako krátké odkazy infrastruktury LinkedIn
fragrantica.comStovky bloků pro pojmenované user-agenty plus jazyk AI politiky
sovcombank.ruStovky bloků pro user-agenty a právní/politický jazyk
academia.eduVelká matice allow/disallow a explicitní politika blokování AI
opentable.comVelký soubor pravidel cest, mnoho direktiv sitemap a politická plocha související s AI
etsy.comVelký e-commerce soubor pro řízení cest s více než 1 600 pravidly Disallow
runescape.comTéměř 5 000 direktiv Disallow pod jednou skupinou user-agentů

Tyto soubory by se neměly zesměšňovat za složitost. Složitost často odráží skutečné obchodní potřeby. Ale ukazují, proč si politika robots.txt zaslouží stejnou engineering disciplínu jako jiná produkční konfigurace:

  • vlastnictví má být explicitní;
  • změny mají být revidované;
  • generované sekce mají být označené;
  • právní komentáře mají být pokud možno oddělené od strojových direktiv;
  • testovací případy mají ověřovat očekávaný přístup botů pro kritické crawlery;
  • historie verzí má být zachována;
  • staré názvy botů mají být vyřazeny nebo zdokumentovány;
  • trénování AI, retrieval AI, indexování vyhledávání a archivace mají být považovány za oddělené účely.

Poslední bod je nejdůležitější. Současná gramatika je založená na user-agentu: žádá správce webu, aby jmenovali boty. Potřeba v éře AI je založená na účelu: žádá správce webu, aby řekli, jaké využití je povoleno.

To není totéž.

Právě tenhle nesoulad je důvod, proč dlouhé blacklisty nevydrží. Vydavatel může dnes přidat GPTBot, ClaudeBot, CCBot, Google-Extended, Bytespider, Applebot-Extended a PerplexityBot, ale zítra může přijít další jméno crawleru, retrieval agent nebo dataset broker. Politika založená na účelu by webu dovolila říct „indexování vyhledávání ano, trénování AI ne, user-triggered retrieval možná“, aniž by se robots.txt změnil v adresář botů.


Co to znamená pro řízení AI

Veřejná debata často rámuje robots.txt jako buď smysluplný, nebo zastaralý. Data naznačují praktičtější odpověď:

robots.txt je smysluplný, ale přetížený.

Je smysluplný, protože ho používají velké weby, crawlery ho umí parsovat a rozhodnutí v něm jsou viditelná pro výzkumníky, novináře, dodavatele i soudy. Původní zpráva zjistila, že 17,0 % analyzovatelných top webů mělo záměrná pravidla specifická pro AI. To není symbolický šum.

Je přetížený, protože musí vyjádřit víc než přístup botů:

  • „Netrenujte na tomhle obsahu.“
  • „Tento obsah můžete použít pro indexování ve vyhledávání.“
  • „Tento obsah můžete použít pro živý retrieval.“
  • „Nesmíte vytvářet cacheovaná data.“
  • „Toto právní vyhrazení platí podle práva EU o textu a dolování dat.“
  • „Tento web spravovaný přes CDN posílá Content-Signal: ai-train=no."
  • „Tento web chce Googlebot, ale ne YandexBot."
  • „Tento web má 1 000 starých URL cest, které se nemají crawlvat."

Tahleta gramatika na tolik úkolů nebyla navržená.

Tři změny by ten dluh snížily:

  1. Identita crawlerů potřebuje registr. Správci webů by neměli muset udržovat stále rostoucí seznam GPTBot, ClaudeBot, anthropic-ai, CCBot, Google-Extended, Applebot-Extended, Bytespider, OAI-SearchBot, ChatGPT-User a desítek dalších. Bez registru bude politika vždy za chováním crawlerů zaostávat.

  2. Použití AI potřebuje strukturovaný slovník. Trénování, retrieval, indexování, shrnování, prodej datasetů, vyhodnocování modelů a prohlížení spuštěné uživatelem jsou různé účely. Vyjádřit je přes názvy user-agentů specifické pro dodavatele je křehké.

  3. Politika musí být auditovatelná. Web potřebuje způsob, jak rozlišit ručně napsané vyhrazení práv od zděděných defaultů CDN, generovaných CMS šablon, zastaralých starých pravidel a nechtěných catch-all bloků. To rozlišení je důležité pro důvěru i pro spor.

To neznamená, že se robots.txt má přes noc nahradit. Lepší cesta je vrstvení: ponechat robots.txt jako povrch pro objevování a kompatibilitu, ale standardizovat navazující strojově čitelnou politiku pro použití specifická pro AI.

llms.txt je jeden pokus, ale adopce v tomto datasetu je stále mizivá: jen 83 čitelných souborů zmiňuje llms.txt. Content-Signal je viditelnější, protože ho může Cloudflare distribuovat přes infrastrukturu, a všech 271 souborů s Content-Signal v tomto průchodu zároveň odpovídalo jazyku k AI politice. Samotná distribuce ale není totéž co shoda. Udržitelný výsledek bude pravděpodobně potřebovat nudnou, ale nutnou standardizaci: jasná pole, jasnou sémantiku, závazky crawlerů a veřejné testovací sady.


Závěr

Bitva o AI crawlery proměnila robots.txt v governance artefakt. To je zároveň užitečné i rizikové.

Užitečné, protože soubor je veřejný. Výzkumníci ho mohou auditovat. Vydavatelé ho mohou měnit. Crawlery ho mohou respektovat. Soudy ho mohou číst. Poskytovatelé infrastruktury ho mohou nasazovat ve velkém měřítku.

Rizikové, protože toho nese příliš.

Mediánový soubor robots.txt v Tranco Top 10K je pořád dost malý na to, aby se dal pochopit. Ale dlouhý ocas webu s vysokou návštěvností je plný velkých, starých, vrstvených, vendor-specific a právně zatížených souborů. Stovky webů dnes spravují konfigurace robots.txt, které je lepší chápat jako produkční systémy politik než jako jednoduché nápovědy pro crawlery.

Hlavní lekce není, že robots.txt selhal. Je to, že ho web povýšil, aniž by ho refaktoroval.

Jestli má politika přístupu pro AI stát na veřejných strojově čitelných prohlášeních, další krok není další delší blacklist. Je to lepší infrastruktura politiky: oprávnění založená na účelu, stabilní identita crawlerů, šablony, které lze kontrolovat, a auditní stopy.

Do té doby bude vrstva řízení AI na veřejném webu dál stát na textovém souboru, který nikdy neměl nést tak velkou zátěž.


Poznámky k reprodukovatelnosti

Dodaná složka obsahuje:

  • source_data/analysis.json — původní agregované metriky.
  • source_data/site_meta.csv — původní analytickou tabulku po webech.
  • source_data/bot_status.csv — původní tabulku politik po doménách a botech.
  • source_data/fetch_meta.csv — původní metadata načítání.
  • source_data/sites.csv — původní tabulku domén/kategorií/stavu.
  • derived_data/robots_complexity_by_site.csv — metriky složitosti po webech vytvořené pro tuto zprávu.
  • derived_data/search_bot_treatment.csv — matice zacházení s vyhledávacími crawlery.
  • derived_data/category_complexity_summary.csv — souhrn složitosti podle kategorií.
  • derived_data/top_config_debt_sites.csv — nejvyšší weby podle triážního skóre popsaného výše.
  • derived_data/summary_metrics.json — všechny hlavní metriky citované v této zprávě.

Stáhnout všechny skripty a datové sady


Opravy metodologie, problémy v datech i navazující analýzy uvítáme na adrese support@thunderbit.com. Tato zpráva je publikována nezávisle na jakékoli obchodní pozici Thunderbitu; vytváříme AI web scraper a máme strukturální zájem na tom, aby robots.txt dál zůstával smysluplnou, strojově čitelnou dohodou na veřejném webu. Data v této zprávě stojí sama za sebe. — Výzkumný tým Thunderbit, květen 2026.

Vyzkoušejte Thunderbit pro AI web scraping Get Started Free

Shuai Guan
Shuai Guan
CEO ve společnosti Thunderbit | Expert na automatizaci dat s využitím AI Shuai Guan je CEO společnosti Thunderbit a absolvent inženýrského oboru na University of Michigan. Na základě téměř deseti let zkušeností v oblasti technologií a architektury SaaS se zaměřuje na převádění složitých modelů AI do praktických nástrojů pro extrakci dat bez nutnosti programování. Na tomto blogu sdílí nezkreslené a v praxi ověřené poznatky o web scrapingu a automatizačních strategiích, které vám pomohou vytvářet chytřejší datově řízené pracovní postupy. Když zrovna neoptimalizuje datové workflow, věnuje stejný důraz na detail také své vášni pro fotografii.
Obsah

Získej data z webu jen tím, že si o ně řekneš

Řekni, co potřebuješ, obyčejnou angličtinou. Nebo ještě lépe – neříkej nic.

Vyzkoušet Thunderbit zdarma
Získej data pomocí AI
Snadno přenes data do Google Sheets, Airtable nebo Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week