Jak czołowe serwisy wytyczają granice dla crawlerów AI

Ostatnia aktualizacja: May 8, 2026
Jak czołowe serwisy wytyczają granice dla crawlerów AI

Streszczenie wykonawcze

Pobraliśmy plik robots.txt z każdej domeny z listy Tranco top 10,000, obejmującej serwisy o największym ruchu na świecie. Następnie przeparsowaliśmy każdy z nich parserem zgodnym z RFC 9309, sklasyfikowaliśmy plik według polityki witryny wobec botów AI i policzyliśmy, ile z najczęściej odwiedzanych stron świata faktycznie próbuje blokować ChatGPT, Claude, Perplexity, Gemini, Common Crawl, Bytespider, Apple Intelligence i inne crawlery, które w 2026 roku trenują i zasilają duże modele językowe.

Najważniejsze liczby, na próbie 7 248 witryn, których robots.txt udało się odczytać bez problemów:

ai-crawler-block-statistics.webp

20,3% najpopularniejszych 10 000 witryn na świecie blokuje co najmniej jednego crawlera AI. 17,0% ma celowo napisany, jawny zapis reguł dotyczących AI. Pozostałe 80% traktuje crawlery AI tak samo życzliwie jak Googlebot.

Sześć wniosków, które zmieniają obraz sytuacji:

  • Organizacje informacyjne blokują w 47% przypadków — to najwyższy wynik spośród wszystkich sektorów. Niemieckie media prowadzą z 88%, francuskie z 80%, rosyjskie z 0%. Głównym czynnikiem jest reżim prawny, nie technologia ani ekonomia branży.
  • CCBot (Common Crawl) jest najczęściej blokowanym botem — 16,3% — przed GPTBot (15,8%) i Bytespider (14,9%). Wydawcy celują w korpus treningowy, a nie w markę modelu. Najczęściej stosowana selektywna reguła to „blokuj CCBot, zezwól Googlebot” (14,1% witryn).
  • Francja prowadzi wśród wszystkich krajów z 50,6% blokad AI na stronach .fr; klaster UE jest o 16 punktów powyżej globalnej średniej. 275 plików robots.txt wprost odwołuje się do dyrektywy UE 2019/790. Artykuł 4 to jedyny reżim prawny, który wyraźnie przesuwa wyniki.
  • 17,8% napisało własne reguły AI; 4,5% korzysta z szablonu dostawcy Cloudflare; 75,7% nie mówi nic. Duże serwisy tworzą politykę samodzielnie, a długi ogon używa przełącznika. The Atlantic oraz samo cloudflare.com znajdują się na liście Cloudflare Managed.
  • 108 witryn wprost zezwala GPTBot — WordPress.org, Kaspersky, Norton, Avast, Sophos, The Verge, The Atlantic, NBA.com, The Sun, Branch.io. Sektor bezpieczeństwa i narzędzi deweloperskich jest nadreprezentowany.
  • Polityka AI nie staje się bardziej agresywna na szczycie rozkładu. Top 100, 101–1000, 1001–5000, 5001–10000 mieszczą się między 19% a 23%. Główny wskaźnik jest cechą publicznego internetu w 2026 roku, a nie sygnałem wielkości pojedynczej witryny.

Nie chodzi już o to, czy sieć „odgryza się” AI. Chodzi o to, które branże, kraje, reżimy prawne i dostawcy AI stają się celem aktywnej polityki — a które nie.


I. Tło: jak robots.txt stał się artefaktem polityki AI

Trzy siły zmieniły znaczenie robots.txt od czasu, gdy OpenAI uruchomiło GPTBot w sierpniu 2023 roku.

Liczba dostawców AI wzrosła. Pojawiły się kolejno Google-Extended od Google, ClaudeBot od Anthropic, Bytespider od ByteDance, Applebot-Extended od Apple, Amazonbot od Amazon i Meta-ExternalAgent od Meta. Istniejący bot CCBot od Common Crawl stał się najcenniejszym celem blokady, ponieważ jego archiwum zasila większość modeli open-weight. Pojawiły się też boty spoza wielkich dostawców: AI2Bot, cohere-ai, PerplexityBot, YouBot, DuckAssistBot, Diffbot, Omgili. Kompleksowa lista blokad z 2026 roku obejmuje około 25 nazw.

Artykuł 4 dyrektywy UE 2019/790 stworzył ustawowe wyłączenie dla eksploracji tekstów i danych, które nie ma zastosowania, jeśli uprawniony „wyraźnie zastrzegł” swoje prawa w sposób „czytelny maszynowo”. W latach 2024–2025 wydawcy z UE i ich prawnicy uznali robots.txt za kanoniczny sposób wyrażenia takiego zastrzeżenia. Nasz zbiór danych pokazuje, że 275 witryn wprost cytuje dyrektywę 2019/790, a 87 wspomina „TDM” — głównie na europejskich serwisach informacyjnych, gdzie przybiera to formę 4–8-wierszowego wstępu prawnego.

Cloudflare zamienił przełącznik w produkt. W latach 2024–2025 Cloudflare wprowadził panel „AI Audit”, przełącznik „Block AI Bots” oraz zarządzany szablon robots.txt z terminologią Content-Signal: search=yes,ai-train=no i standardową formułą odnoszącą się do dyrektywy UE 2019/790. Do maja 2026 szablon działał na 4,5% analizowalnych witryn z top 10k. W publicznie opisywanej roadmapie Cloudflare rozważa ustawienie przełącznika „włączone domyślnie” dla nowych kont — co podniosłoby globalny wskaźnik blokad o 5–8 punktów, bez żadnej indywidualnej decyzji wydawcy.

robots.txt w 2026 roku nie jest już mało istotnym plikiem konfiguracyjnym, jakim był w 2022. To mechanizm zastrzegania praw autorskich z unijnym umocowaniem traktatowym, artefakt polityki kształtowany przez dostawców w długim ogonie i linia frontu powolnych negocjacji między osobami zarządzającymi stronami a tymi, którzy trenują modele.


II. Metodologia

Staraliśmy się, by badanie było jak najbardziej nudne i odtwarzalne. Pełny pipeline (skrypty Pythona, przeparsowane CSV, surowe archiwum robots.txt, wykresy) został opublikowany razem z raportem.

Próba

Zaczęliśmy od listy Tranco z maja 2026 roku, pobranej jako top-1m.csv.zip, i wycięliśmy pierwsze 10 000 wierszy. Tranco agreguje cztery zewnętrzne rankingi (Cisco Umbrella, Majestic, Farsight i Cloudflare Radar), filtruje stabilność w 30-dniowym oknie i usuwa oczywisty szum związany z crawlerami/CDN. Lista, którą tworzy, jest najbliższym odpowiednikiem kanonicznego „globalnego top-10k ruchu w sieci”, jaki istnieje publicznie, i stanowi standardową próbę w akademickich badaniach internetu (wykorzystywaną w ponad 600 recenzowanych publikacjach od startu projektu KU Leuven w 2018 roku).

Lista zawiera mieszankę: (a) głównych witryn odwiedzanych przez ludzi, (b) domen infrastrukturalnych / API / DNS / CDN, które nie serwują nic pod /, oraz (c) domen używanych wewnętrznie przez duże platformy (np. gvt1.com, apple-dns.net, googleusercontent.com). Zamiast je odfiltrowywać, zachowaliśmy wszystkie i oznaczyliśmy je kategorią infrastructure na poziomie analizy. Same wypadają z próby, gdy ograniczamy ją do „witryn, które zwróciły parsowalny robots.txt”.

Pobieranie

Dla każdej z 10 000 domen wysyłaliśmy asynchroniczne GET /robots.txt przez HTTPS, z fallbackiem do HTTP, maksymalnie czterema przekierowaniami, 12-sekundowym limitem czasu całego żądania, limitem ciała 500 KB i rzeczywistym, przeglądarkowym User-Agentem z Accept-Language: en-US. Równoległość utrzymywaliśmy na poziomie 80 żądań jednocześnie. Zadanie uruchomiono z jednego domowego adresu IP w San Francisco.

Wynik pobierania:

StatusLiczbaInterpretacja
200 OK6 638Treść robots.txt została zwrócona i dało się ją przeparsować.
404 Not Found610Plik robots.txt nie istnieje. RFC 9309 definiuje to jako domyślne „zezwól na wszystko”.
403 Forbidden563Serwer aktywnie odrzuca żądania o robots.txt. Wykluczone z analizy.
429 Too Many Requests7Prawie brak ograniczania na poziomie CDN w tym przedziale rankingu.
fetch_failed (błąd TLS / DNS / TCP)2 065Głównie domeny apex CDN (akamai.net, cloudfront.net, fastly.net, gtld-servers.net, apple-dns.net), które nie uruchamiają serwera WWW pod /. To nie „blokada” — po prostu nie mają czego serwować jako robots.txt.
Inne 4xx/5xx117Mieszane — błędy serwera, geofencing, wadliwe odpowiedzi.

Daje nam to 7 248 witryn w próbce możliwej do analizy (6 638 200 + 610 404). Te 2 065 fetch_failed to rzeczywiste domeny, ale są to punkty końcowe CDN/DNS, a nie witryny odwiedzane przez ludzi, więc traktowanie ich jako posiadających „politykę AI” nie ma sensu. W zbiorze danych funkcjonują jako osobna statystyka dostępności.

Parsowanie

Każde ciało odpowiedzi 200 było parsowane przy użyciu protego, implementacji Pythona zgodnej z RFC 9309, używanej produkcyjnie w Scrapy. Dla każdej pary (witryna, bot) wyliczaliśmy trzy rzeczy:

  1. can_fetch_root — czy bot może pobrać /, z semantyką grup rekordów zgodną ze standardem, priorytetem najdłuższego dopasowania i nadpisaniem User-agent: * przez konkretną blokadę bota, jeśli oba występują.
  2. has_specific_rule — czy plik zawiera linię User-agent: nazwującą dokładnie tego bota (bez uwzględniania wielkości liter).
  3. disallow_count — ile dyrektyw Disallow: występuje w dopasowanym bloku, używane do odróżnienia pełnych blokad całej witryny od ograniczeń na poziomie ścieżek.

To rozróżnienie ma znaczenie, bo jedno ogólne „wskaźnik blokady” ukrywa dwa zupełnie różne zjawiska: marki, które celowo napisały User-agent: GPTBot \n Disallow: /, bo chciały się przeciwstawić, oraz marki, których ogólna blokada User-agent: * \n Disallow: / (ustawiona lata temu na potrzeby stagingu albo utrzymania) przypadkiem zakazuje też wszystkim botom AI, które nie istniały, gdy powstawał szablon. W całym raporcie liczba „jakakolwiek blokada AI” obejmuje oba typy; liczba „jawna blokada AI” to podzbiór działań celowych.

Boty objęte analizą

Śledziliśmy 25 botów, pogrupowanych w trzy kategorie:

  • Crawlery treningowe AI (16): GPTBot, ClaudeBot, anthropic-ai, CCBot, Google-Extended, Meta-ExternalAgent, Bytespider, Applebot-Extended, Diffbot, Amazonbot, ImagesiftBot, FacebookBot, cohere-ai, AI2Bot, Omgili, Omgilibot.
  • Boty inferencyjne / do pobierania na żywo (7): PerplexityBot, Perplexity-User, ChatGPT-User, OAI-SearchBot, ClaudeBot (który obsługuje zarówno trening, jak i inferencję), YouBot, DuckAssistBot.
  • Bazowy zestaw wyszukiwarek (6): Googlebot, Bingbot, DuckDuckBot, Slurp (Yahoo), Baiduspider, YandexBot.

Część botów stoi okrakiem między treningiem a inferencją. Najbardziej wyraźny jest ClaudeBot — Anthropic wycofał starszy UA anthropic-ai w 2024 roku i obecnie używa ClaudeBot zarówno do treningu, jak i pobierania na żywo, więc reguła Disallow: ClaudeBot nie mapuje się już czytelnie na „blokuj trening, ale zachowaj widoczność”. Zostawiliśmy tę klasyfikację tak, jak jest, i wracamy do konsekwencji później.

Klasyfikacja branżowa

Każdą domenę przypisaliśmy do jednej z 16 kategorii branżowych (news, social, streaming, ecommerce, search, finance, infrastructure, saas, academia, dev, gov, adult, gambling, travel, telecom, unknown) przy użyciu podejścia warstwowego:

  1. Słownik znanych domen — ręcznie przygotowana mapa ok. 500 wysoko-ruchliwych domen na branże.
  2. Wzorce TLD / sufiksów.govgov, .edu i .ac.*academia, rozpoznane sufiksy CDN → infrastructure.
  3. Słowa kluczowe w nazwie domenynews, post, shop, bank, porn, casino itd. jako sygnały awaryjne.
  4. Scrape strony głównej — dla witryn, których pierwsze trzy warstwy nie potrafiły sklasyfikować i które zwróciły 200 na robots.txt, pobieraliśmy HTML strony głównej, wyciągaliśmy <title>, <meta name="description">, <meta property="og:type"> i uruchamialiśmy scoring słów kluczowych pod kątem cech przypominających kategorie znane z modeli językowych.

W efekcie 3 407 witryn (34%) otrzymało pewne oznaczenie branżowe, a 6 593 pozostały w kategorii unknown. Kosz unknown zdominowały nieanglojęzyczne portale regionalne, marki korporacyjne .com, które nie mieszczą się w jednej kategorii, oraz lokalni wydawcy z mniejszych rynków językowych, których nie mieliśmy w słowniku. Gdy w raporcie podajemy procent dla branży, mianownikiem jest próbka sklasyfikowana dla tej branży, a nie pełne 10 000.


III. Wyniki

Wynik 1 — Jedna na pięć witryn o dużym ruchu blokuje co najmniej jednego bota AI

W całej próbce 7 248 witryn możliwych do analizy 1 472 (20,31%) blokują co najmniej jednego bota AI. 1 230 (16,97%) mają celową, specyficzną dla AI regułę. Bazowy wynik dla Googlebota wynosi 2,18% (158 witryn — większość z nich blokowała wszystko jako domyślne ustawienie konserwacyjne albo, w trzech przypadkach, to wyszukiwarki blokujące konkurencję).

Główny wynik 20% jest 9× wyższy niż bazowy dla Googlebota. To realny sygnał — witryny o największym ruchu są około dziesięć razy bardziej skłonne blokować crawler AI niż crawler wyszukiwarkowy — ale jednocześnie to liczba wyraźnie mniejsza od narracji „blokowanie AI osiąga powszechną adopcję”, która przewija się w prasie od 2024 roku. Nawet wśród 10 000 najczęściej odwiedzanych stron ponad 5/6 milczy na temat AI.

Różnica między „jakakolwiek blokada AI” (20,3%) a „jawna blokada AI” (17,0%) jest niewielka w liczbach bezwzględnych, ale istotna koncepcyjnie. Luka 3,3 punktu to udział witryn, które blokują boty AI tylko dlatego, że ich istniejąca reguła User-agent: * \n Disallow: / łapie wszystko, co się pojawi, w tym boty, które nie istniały, gdy regułę pisano. Liczba 17,0% lepiej oddaje pytanie: „Ile z największych witryn świata podjęło świadomą decyzję dotyczącą AI?”.

Na tle wcześniejszych badań:

ŹródłoDataPróbaWskaźnik blokad
Originality.aimar 20251 000 najpopularniejszych newsów (angielski)35,7% blokuje GPTBot
Palewiresie 20241 500 organizacji informacyjnych36,0% jakiegokolwiek crawlera AI
Reuters Institutewiosna 202550 wiodących marek newsowych, 10 krajów78% jakiegokolwiek crawlera AI
WIRED / NYTkoniec 2023Top 50 amerykańskich newsów26% blokuje GPTBot
Ten raport (Thunderbit)maj 2026Tranco top 10,000 (wszystkie sektory)20,3% / 17,0% jawnie

Nasze 17,0% jawnych blokad jest niższe niż w każdym badaniu skoncentrowanym na newsach, ponieważ dwie trzecie próby nie stanowi prasa. Po ograniczeniu do 650 witryn newsowych dostajemy 47% — w tym samym przedziale co wcześniejsze badania, jeśli uwzględnić skład próby. Obraz strukturalny się zgadza: kohorta newsowa blokuje AI 3–4 razy częściej niż reszta sieci.


Wynik 2 — Głębokie wejście w branże: 12-krotna rozpiętość od newsów do telekomów

Jednym z najczęściej cytowanych wyników w dwóch latach dyskusji o „scrapingu AI” była liczba 80% redakcji blokuje GPTBot z badań Originality.ai i Palewire. Nasze ujęcie daje mniejszą, ale wciąż wyrazistą wartość: 47,2% witryn newsowych w top 10 000 blokuje co najmniej jednego bota AI, a 45,2% zapisuje explicite regułę AI.

Ale „newsy kontra reszta” to zbyt grube cięcie. Pełny rozkład (branże z n ≥ 10 w próbie) pokazuje znacznie bogatszy obraz:

robots-industry-spread_compressed.webp

BranżanJakakolwiek blokada AIJawnaZablokowany GooglebotReguły DIYCloudflare ManagedMilczenie
News65047,2%45,2%1,5%46,9%1,5%48,5%
Travel6429,7%29,7%0,0%35,9%3,1%54,7%
Social6529,2%23,1%4,6%23,1%6,2%66,2%
Streaming44020,0%17,7%0,7%16,8%3,6%75,5%
Finance12919,4%12,4%0,8%14,7%2,3%75,2%
E-commerce22418,3%17,4%0,4%24,1%1,3%66,1%
Adult25417,3%14,6%0,4%10,2%7,9%79,5%
Search1216,7%0,0%0,0%0,0%0,0%100,0%
Academia26814,6%13,8%0,4%13,4%3,4%77,2%
Gambling10014,0%13,0%0,0%18,0%4,0%77,0%
Dev tools12910,1%7,8%0,0%8,5%5,4%77,5%
SaaS3697,6%6,2%0,3%9,5%0,8%87,5%
Government1725,2%3,5%0,0%4,1%0,6%83,1%
Infrastructure474,3%0,0%0,0%4,3%2,1%72,3%
Telecom333,0%3,0%0,0%12,1%0,0%78,8%

12-krotna różnica między newsami a telekomami pokazuje, że „polityka AI w sieci” to zły poziom agregacji. Nie ma jednej liczby; są liczby sektorowe, które różnią się o rząd wielkości. Poniżej omawiamy cztery najbardziej charakterystyczne odkrycia.

News: 47% blokuje, 47% pisze własne reguły. News to grupa, która napisała podręcznik. Cloudflare Managed występuje tylko w 1,5% przypadków w newsach — ci wydawcy nie outsourcują reguły. Treść jest wyjątkowo bogata: NYT otwiera plik 14-wierszowym wstępem prawnym z cytatem „Art. 4 of the EU Directive”; BBC zaczyna od „Please use our site like a human, not a robot... TL;DR: Browse, read, watch, enjoy — like a human.”; The Sun od „The Sun does not permit the unlicensed use of our content for large language models.” To robots.txt jako stanowisko polityczne, nie konfiguracja.

Travel na poziomie 30% — zaskoczenie. Booking, Expedia, TripAdvisor, Kayak i największe linie lotnicze blokują dwa razy rzadziej niż newsy. Wzorzec selektywny jest spójny: przeciętna witryna z travel usuwa dostęp 5–7 UA treningowym, ale zostawia nietknięte UA inferencyjne (PerplexityBot, ChatGPT-User, OAI-SearchBot). Zebrane dane cenowe i recenzje to fosa, a cytowania prowadzące z powrotem na stronę to korzyść. To najczystszy wzorzec „trening out, inferencja in” w dowolnej pojedynczej branży.

Adult na poziomie 17% — również zaskoczenie. Wcześniejsze mniejsze próby pokazywały 0%. Dane z pełnej próby wskazują, że 1 na 6 witryn adult blokuje co najmniej jednego bota AI, przy najwyższym wskaźniku Cloudflare Managed spośród wszystkich sektorów (7,9%). Ponad połowa blokad AI w adult pochodzi z przełącznika Cloudflare, a nie z decyzji wydawcy. Trening modeli generujących obrazy to domyślne zagrożenie — modele klasy Stable Diffusion uczą się stylu wizualnego szybciej niż modele tekstowe uczą się stylu pisania.

SaaS na poziomie 7,6% jest nieintuicyjne. Dostawcy oprogramowania są najgłośniejszym segmentem w dyskursie o polityce AI, ale ich robots.txt jest szeroko otwarty. Prawidłowa interpretacja: zespoły marketingowe SaaS prawidłowo zidentyfikowały wyszukiwanie AI jako kanał dystrybucji. Dostawcy, którzy naprawdę się nad tym zastanowili, nie wycofują się, tylko dołączają — lista jawnego Allow-GPTBot (Wynik 12) jest zdominowana przez SaaS z obszaru bezpieczeństwa i narzędzi deweloperskich.

Government 5,2%, telecom 3,0%, infrastructure 4,3%, dev 10,1%. Obowiązki związane z dostępem do rejestrów publicznych sprawiają, że Disallow: / jest prawnie kłopotliwe dla .gov. Serwisy marketingowe telekomów chcą być widoczne. Domeny apex CDN nie mają czego chronić. Narzędzia deweloperskie wprost zapraszają AI, bo cytowanie ich treści zwiększa jej wartość.

Wniosek: nie istnieje jedna liczba „sieć blokuje / nie blokuje AI”, która nie zniekształcałaby obrazu bardziej, niż go oddaje. Raportowanie na poziomie sektorów to jedyny uczciwy sposób omawiania tych danych.


Wynik 3 — Według dostawcy AI: kto jest blokowany najczęściej?

Innym naturalnym cięciem danych jest podział według firmy AI, a nie według bota. Kilku dostawców utrzymuje wiele botów (OpenAI trzy: GPTBot, ChatGPT-User, OAI-SearchBot; Anthropic dwa: ClaudeBot, anthropic-ai; Meta dwa: Meta-ExternalAgent, FacebookBot). Agregacja do poziomu dostawcy to najbliższe przybliżenie pytania: „Co publiczna sieć myśli o każdej firmie AI?”.

Dostawca AIAgregowane botyWitryny blokujące ≥ 1 bota% analizowalnych
Common CrawlCCBot1 17816,25%
OpenAIGPTBot, ChatGPT-User, OAI-SearchBot1 17216,17%
AnthropicClaudeBot, anthropic-ai1 11115,33%
ByteDanceBytespider1 08214,93%
MetaMeta-ExternalAgent, FacebookBot98913,65%
GoogleGoogle-Extended97013,38%
AmazonAmazonbot87712,10%
AppleApplebot-Extended85911,85%
Webz.io (Omgili)Omgili, Omgilibot73110,09%
Coherecohere-ai7179,89%
PerplexityPerplexityBot, Perplexity-User7159,86%
DiffbotDiffbot6849,44%
You.comYouBot5637,77%
AI2 (Allen AI)AI2Bot4876,72%
DuckDuckGoDuckAssistBot4826,65%

Common Crawl jest pojedynczym, najczęściej obieranym za cel bytem, mimo że to nie operator LLM, tylko archiwum webowe non-profit. Powód to dźwignia: CCBot zasila prawie każdy model open-weight i znaczną część modeli zamkniętych. Zablokowanie CCBot jako pierwsze daje najwyższy możliwy zasięg reguły, jaką może napisać wydawca.

OpenAI, Anthropic i ByteDance grupują się w przedziale 14–16%. Przewaga OpenAI wynika częściowo z artefaktu liczenia (trzy boty OpenAI wobec jednego dla ByteDance). 14,9% dla Bytespider to efekt „zachowania Bytespider” — od 2024 roku udokumentowano ignorowanie robots.txt, więc wydawcy blokują go jako sygnał publiczny, a nie dlatego, że boją się TikToka.

Meta, Google, Amazon, Apple na poziomie 12–14% to druga liga — reguły pisane defensywnie, a nie jako manifest stanowiska. Mniejsi dostawcy (Webz.io, Cohere, Perplexity, Diffbot, You.com, AI2, DuckDuckGo) na poziomie 6–10% są podciągani głównie przez ogólny próg 3,8%; jawne reguły dla nich mieszczą się zazwyczaj w przedziale 1–4%.

xAI (Grok), Mistral i większość europejskich/chińskich laboratoriów modeli nie pojawia się w tabeli — nie opublikowały udokumentowanych UA dla crawlerów treningowych. Dzisiejszy ekosystem robots.txt to dialog między dostawcami z USA/Chin, którzy wypuścili UA, a wydawcami z USA/UE, którzy napisali reguły; ci, którzy nic nie wypuścili, są niewidoczni dla negocjacji.


Wynik 4 — CCBot jest nowym piorunochronem, a nie GPTBot

Układ botów w top-10k wygląda tak:

most-blocked-ai-crawlers-vendors.webp

PozycjaBotWskaźnik blokadyWskaźnik jawnej reguły
1CCBot (Common Crawl)16,25%12,90%
2GPTBot (OpenAI)15,84%12,72%
3Bytespider (ByteDance)14,93%11,35%
4ClaudeBot (Anthropic)14,51%11,13%
5Google-Extended13,38%10,18%
6Meta-ExternalAgent12,38%8,95%
7Amazonbot12,10%8,66%
8Applebot-Extended11,85%8,72%
9Omgilibot10,09%5,31%
10anthropic-ai (wycofany)9,99%6,55%
11cohere-ai9,89%6,42%
12PerplexityBot9,69%6,40%
13Diffbot9,44%5,95%
14ChatGPT-User (inferencja)8,90%5,73%
15YouBot (inferencja)7,77%4,29%
16OAI-SearchBot (inferencja)6,83%3,66%
baselineGooglebot2,18%
baselineBingbot2,27%

Wniosek z tej tabeli jest taki, że pierwszy bot blokowany przez publiczną sieć nie jest marką modelu — tylko korpusem. Archiwum Common Crawl obejmujące 250 miliardów stron było pojedynczym największym źródłem treningowym dla GPT-3, GPT-4, Llama 1 / 2 / 3, Falcon, Mistral, BLOOM i większości modeli open-weight wydanych od 2020 roku. Witryna, która chce zrezygnować z „bycia w następnym modelu granicznym”, optymalizuje działanie przez zablokowanie najpierw CCBot — jeśli nie trafiasz do Common Crawl, jesteś praktycznie wyłączony z darmowego open-source’owego pipeline’u treningowego. GPTBot i ClaudeBot są drugie i trzecie, bo są widocznym front-endem dwóch konkretnych produktów komercyjnych; UA na poziomie korpusu jest celem strukturalnym.

Niżej sklasyfikowane boty AI też są informacyjne. Omgilibot na poziomie 10% jest wyjątkowo wysokim wynikiem jak na bota, o którym większość czytelników prawdopodobnie nigdy nie słyszała — działa w Webz.io, brokerze danych treści sprzedającym archiwa webowe operatorom LLM, a pokaźna grupa organizacji newsowych zaczęła go wprost wymieniać w swoich plikach. AI2Bot na poziomie 6,7% (i odpowiadająca mu reguła Ai2Bot-Dolma na stronach Squarespace) sugeruje, że akademicka społeczność LLM także jest oznaczana przez wydawców, którzy niekoniecznie odróżniają „crawler badawczy non-profit” od „crawlera komercyjnego”.

Kohorta inferencyjna — ChatGPT-User, OAI-SearchBot, YouBot, Perplexity-User — jest o 4–8 punktów procentowych niżej niż kohorta treningowa. Ta luka jest odpowiedzią na długo trwające pytanie regulacyjne: tak, serwisy o największym ruchu rozróżniają bota zbierającego dane do przyszłego treningu modelu i bota wykonującego bieżące pobieranie, by odpowiedzieć na pytanie użytkownika tu i teraz. Nie zawsze robią to konsekwentnie (reguły ogólne tego nie gwarantują), ale znacząca część pisze reguły, które celują konkretnie w stronę treningową.


Wynik 5 — 14% blokuje CCBot, ale zostawia Googlebot w spokoju — wzorzec „blokuj korpus, zostaw wyszukiwanie”

Najczęściej spotykana reguła selektywna w top-10k:

website-crawler-blocking-stats.webp

Wzorzec regułyWitryny% analizowalnych
Blokuj CCBot, zezwól Googlebot1 02314,11%
Blokuj Bytespider, zezwól Googlebot92612,78%
Blokuj Google-Extended, zezwól Googlebot81611,26%
Blokuj GPTBot, zezwól OAI-SearchBot6589,08%
Blokuj GPTBot, zezwól ChatGPT-User5257,24%
Blokuj CCBot, zezwól PerplexityBot5197,16%
Blokuj anthropic-ai, zezwól ClaudeBot590,81%

Najbardziej rozpowszechniony wzorzec (14,1%) to „blokuj Common Crawl, zachowaj widoczność w Google Search”. Drugi (12,8%) to „blokuj Bytespider, zachowaj widoczność w Google Search” — czyli blokada crawlera ByteDance obarczonego reputacyjnym ryzykiem przy jednoczesnym zachowaniu legalnego bazowego wyszukiwania. Trzeci (11,3%) to „blokuj własny UA treningowy Google, ale zostaw UA wyszukiwania Google”, dokładnie to rozdzielenie, dla którego Google zaprojektował Google-Extended: wydawca wyłącza się z treningu Bard/Gemini bez utraty pozycji w wyszukiwarce.

Te trzy liczby razem opisują dominującą postawę polityczną w top-10k: blokuj boty korpusu treningowego, zostaw boty wyszukiwawcze i inferencyjne w spokoju. Mniejszościowy wzorzec „blokuj trening, ale zezwól na konkretny UA pobierający dane na żywo tego modelu” — GPTBot ✗ / ChatGPT-User ✓ na poziomie 7,2% — istnieje, ale jest mniejszy niż cięcia na poziomie korpusu.

Wiersz anthropic-ai / ClaudeBot na poziomie 0,81% odzwierciedla wycofanie UA przez Anthropic w 2024 roku: ClaudeBot obsługuje dziś zarówno trening, jak i inferencję, co usuwa czyste rozróżnienie „blokuj trening, zezwól na cytowanie” dla Claude, które umożliwiał starszy UA anthropic-ai. To najrzadziej omawiana decyzja projektowa dotycząca UA z lat 2024–2025 — usunęła całą klasę ekspresji politycznej z robots.txt.


Wynik 6 — Newsy w szczegółach: według kraju i języka

Gdy rozbijemy kategorię newsów według TLD kraju — pamiętając, że oznacza to .de dla niemieckich newsów, .fr dla francuskich itd., a nie język publikacji — różnice wewnątrz kategorii są większe niż różnice między newsami a resztą:

news-blocking-country-tld.webp

Kraj (tylko newsy)nJakakolwiek blokada AIJawna
🇩🇪 Niemcy (.de)2588,0%88,0%
🇫🇷 Francja (.fr)1580,0%80,0%
🇬🇧 Wielka Brytania (.co.uk)1566,7%53,3%
🇪🇸 Hiszpania (.es)560,0%60,0%
🇮🇹 Włochy (.it)1353,8%53,8%
Globalne newsy (.com/.org/itp.)50045,0%42,8%
🇵🇱 Polska (.pl)742,9%42,9%
🇯🇵 Japonia (.jp)1225,0%25,0%
🇷🇺 Rosja (.ru)130,0%0,0%
🇬🇷 Grecja (.gr)60,0%0,0%

Niemieckie newsy to najwyżej blokujący podsegment w całym zbiorze danych — 88%, i to w 88% jawnie. Praktycznie nie ma niemieckiego serwisu newsowego w top 10k, który pozwalałby botom treningowym AI sięgnąć po archiwum. Grupę prowadzą Spiegel, Bild, Welt, Zeit, FAZ, Süddeutsche, Heise, Golem, Stern, Focus — cały główny niemiecki establishment wydawniczy, plus wydawcy technologiczni, którzy napisali własne reguły. Pod spodem znajduje się gęsta infrastruktura polityczno-prawna: VG Media, niemiecka organizacja zbiorowego zarządzania prawami wydawców, była najbardziej agresywną grupą powodową w unijnych sporach o prawa autorskie wobec AI, a artykuł 4 dyrektywy UE został wdrożony do prawa niemieckiego jako §44b UrhG z jednoznacznym, czytelnym maszynowo językiem opt-out. Gdy przybyli dostawcy AI, niemieccy wydawcy byli najlepiej przygotowani spośród wszystkich krajowych grup, by przełożyć to stanowisko prawne na reguły robots.txt.

Francja z 80% jest niewiele niżej. Francuskie otoczenie prawne jest podobne (transpozycja dyrektywy 2019/790 do prawa francuskiego), a zachowanie kohorty jest zbliżone — lemonde.fr, lefigaro.fr, liberation.fr, lequipe.fr, 20minutes.fr, ouest-france.fr wszystkie blokują, a plik Le Monde dodatkowo powołuje się na francuskie droit du producteur de base de données (artykuł L 342-1 Code de la propriété intellectuelle) jako równoległą podstawę krajową. Francja ma dodatkowy niuans: wyrok paryskiego sądu handlowego z 2024 roku, który uznał, że opt-out oparty na robots.txt stanowi wystarczające powiadomienie w rozumieniu artykułu 4; daje to bezpośrednie wsparcie orzecznicze, którego nie ma jeszcze żadna inna jurysdykcja.

Wielka Brytania z 67% jest niżej, ponieważ kilku dużych brytyjskich wydawców (thesun.co.uk, dailymail.co.uk, mirror.co.uk) używa blokad deny-all User-agent: * zamiast reguł specyficznych dla AI, co obniża wynik jawny do 53%. Skutek końcowy jest ten sam — te strony nie pozwalają na crawl AI — ale polityka wyrażana jest jako „brak robotów poza tym konkretnym allowlistem wyszukiwarek”, a nie jako zakazy dla nazwanych botów AI. Podstawa prawna jest też słabsza: po Brexicie Wielka Brytania odziedziczyła logikę artykułu 4, ale odpowiednie orzecznictwo krajowe jest znacznie skromniejsze.

Rosyjskie newsy z 0% to najbardziej zaskakujący wiersz. Trzynaście rosyjskojęzycznych witryn newsowych w próbie (dzen.ru, rbc.ru, ria.ru, kommersant.ru, tass.ru, lenta.ru, gazeta.ru, interfax.ru, kp.ru, tass.com itd.) — żadna nie blokuje żadnego crawlera AI. Najbardziej prawdopodobne wyjaśnienie: trenowanie rosyjskojęzycznych LLM-ów jest zdominowane przez własne modele Yandexu w stylu GPT (korzystające z wewnętrznych crawlerów Yandexu, nie z Common Crawl), rosyjskie prawo autorskie nie przyjęło odpowiednika artykułu 4, a główni rosyjscy wydawcy traktują zachodnie LLM-y jako nieistotne zjawisko (amerykańskie ograniczenia eksportowe już i tak ograniczają w Rosji usługi OpenAI/Anthropic) oraz Yandex jako lokalnego interesariusza, a nie przeciwnika. Postawa polityczna jest po prostu inna.

Japońskie newsy z 25% pokazują trzeci wzorzec. Japonia ma w krajowym prawie autorskim wyraźne wyjątki dla eksploracji tekstów i danych (artykuł 30-4 ustawy o prawie autorskim, znowelizowany w 2018), które są bardziej liberalne niż artykuł 4 dyrektywy UE — pozwalają na TDM do celów „niezwiązanych z przyjemnością” obejmujących trening AI, bez potrzeby uzyskiwania zgody uprawnionego. Japońscy wydawcy mają mniejszą prawno-regulacyjną motywację do opt-out, stąd niższe wskaźniki robots.txt. Te 25%, które jednak blokują, to głównie najwięksi, najbardziej kosmopolityczni wydawcy (asahi.com, nikkei.com), pozycjonowani międzynarodowo, a nie wyłącznie krajowo.

Dane newsowe w podziale między krajami są najczystszym dowodem w raporcie, że głównym czynnikiem blokowania AI jest reżim prawny, nie technologia ani ekonomia branży. Unijne kohorty newsowe grupują się między 54% a 88%; pozaunijne kohorty newsowe (Rosja, Japonia, globalna kohorta .com) mieszczą się w zakresie 0–45%. Szczyt 88% pojawia się w kraju z najlepiej rozwiniętym wdrożeniem artykułu 4; podłoga 0% — w kraju, który praktycznie nie ma w tym obszarze żadnego prawa AI.


Wynik 7 — UE kontra reszta: luka 16 punktów

Patrząc szerzej niż pojedyncze kraje, różnica UE vs. reszta jest wyraźna:

RegionnJakakolwiek blokada AIJawna
UE ccTLD (.fr, .de, .es, .it, .nl, .pl, .se, .dk, .fi, .be, .at, .cz, .hu, .ro, .gr, .pt, .ie, .sk, .bg)61735,2%33,9%
Narodowe ccTLD spoza UE (.uk, .jp, .kr, .cn, .ru, .br, .in, .au, .mx, .ca, .tr, .ar, .cl, .co, .pe)89717,2%13,6%
Globalne (.com, .net, .org, itd.)5 73419,2%15,7%

Witryny z unijnych ccTLD blokują AI dwa razy częściej niż narodowa kohorta spoza UE i niemal dwa razy częściej niż globalna baza .com. Różnica jest spójna we wszystkich państwach członkowskich UE (żaden pojedynczy kraj nie „robi” średniej) i spójna między branżami (.de newsy na 88%, .de SaaS około 12%, .de e-commerce około 25% — wszędzie wyżej niż odpowiedniki globalne).

W top-10k znaleźliśmy 275 plików robots.txt, które w komentarzach wprost cytują dyrektywę 2019/790 — około 3,8% próbki możliwej do przeparsowania. Kohorta jest zdominowana przez wydawców z UE, ale nie ogranicza się do nich: kilka amerykańskich marek newsowych (zwłaszcza NYT, które cytuje bezpośrednio „Art. 4 of the EU Directive”), część brytyjskich witryn i garść większych europejskich serwisów e-commerce powiela język prawny. 87 plików wymienia z nazwy „TDM” albo „text and data mining”. 460 plików zawiera jakiś rodzaj języka zastrzegającego prawa autorskie („expressly opts out”, „all rights reserved”, „no commercial use”, „no machine learning”), nawet jeśli nie cytują konkretnej ustawy.

Dwie bardziej szczegółowe obserwacje z tego przekroju:

Efekt UE to nie tylko newsy. Gdy utrzymujemy newsy jako stałą, unijne witryny spoza newsów nadal blokują AI częściej niż nieunijne witryny spoza newsów (około 28% vs 14%). Niewielka, ale realna część unijnego SaaS, e-commerce i środowiska akademickiego zaadaptowała ramę artykułu 4 dla własnych sektorów.

Język w stylu UE staje się de facto szablonem także poza UE. Zarządzany szablon robots.txt Cloudflare — używany globalnie — wprost cytuje „ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790” w swojej treści standardowej. Witryna z USA, która włącza ustawienie „Block AI Bots” w Cloudflare, bez koniecznej świadomości prawnej, składa oświadczenie o zastrzeżeniu praw wynikające z unijnego statutu. To jeden z ciekawszych artefaktów dryfu polityki, jakie znaleźliśmy: europejska koncepcja prawna globalizuje się przez interfejs produktu amerykańskiego dostawcy infrastruktury.


Wynik 8 — Szablony i ich pochodzenie

Rozkład szablonów wśród 6 638 witryn, które zwróciły parsowalny robots.txt:

robots-txt-ai-bot-analysis.webp

SzablonWitrynyUdział
Nie wspomniano żadnego bota AI (domyślny styl Shopify, Yoast, ręcznie pisane bez uwzględnienia AI)5 02475,7%
Własne / DIY reguły AI1 18317,8%
Cloudflare Managed (Content-Signal: search=yes,ai-train=no)3024,5%
Jawne Allow: / dla GPTBot1241,9%
Domyślny Squarespace (28 UA AI w bloku ograniczonym ścieżką)50,1%

Reguły DIY dominują z wynikiem 17,8%. Grupę własnoręcznie napisanych blokad prowadzą wszystkie platformy społecznościowe (facebook.com, twitter.com, linkedin.com, whatsapp.com, tiktok.com, snapchat.com, pinterest.com, x.com, samo chatgpt.com), największe destynacje e-commerce (amazon.com, amazonvideo.com), główne marki newsowe (nytimes.com, cnn.com, bbc.com, theguardian.com, forbes.com, reuters.com, bbc.co.uk, t-online.de, weather.com), kluczowe serwisy streamingowe / medialne (netflix.com, vimeo.com, soundcloud.com, imdb.com) oraz długi ogon witryn usług profesjonalnych (canva.com, medium.com).

Cloudflare Managed ma 4,5% — znacznie więcej niż penetracja tego samego szablonu na bardzo wysokim końcu krzywej, i mniej niż jego penetracja w długim ogonie poza zakresem niniejszego badania. Szablon jest najczęściej stosowany w segmencie 1001–10 000 (4–5%) i praktycznie nie występuje na samym szczycie krzywej (Top 100: 1 witryna; Top 101–1000: 5 witryn). Duże globalne serwisy piszą własne reguły; długi ogon używa przełącznika.

Kilka konkretnych witryn Cloudflare Managed zasługuje na uwagę. cloudflare.com samo używa tego szablonu — zgodnie z zasadą dogfoodingu własnego produktu na własnej domenie. theatlantic.com używa tego szablonu — to jedyna duża amerykańska marka newsowa, którą znaleźliśmy bez własnej, niestandardowej reguły. spankbang.com używa tego szablonu — najwyżej notowana witryna adult, która przyjęła wstrzykniętą przez Cloudflare blokadę AI. linktr.ee używa tego szablonu, blokując trening AI w całej gospodarce twórców hostowanej na Linktree jedną decyzją dostawcy. launchpad.net, nexusmods.com, vinted.fr, cookielaw.org, rustdesk.com i długi zestaw mniejszych serwisów medialnych uzupełniają widoczną kohortę Cloudflare Managed.

Wzorzec adopcji Cloudflare jest najkonkretniejszym dowodem, jaki widzieliśmy, że duża część „polityki AI internetu” jest ustalana przez dostawców infrastruktury. Udział bezwzględny jest niewielki (4,5%), ale strukturalnie ważny: to domyślny szablon dostarczany przez Cloudflare, a kierunek „włączone domyślnie” w kolejnych 12 miesiącach jest wzrostowy. Jeśli Cloudflare przełączy blokadę AI na domyślną dla nowych kont, globalny wskaźnik blokad wzrośnie zauważalnie bez żadnej decyzji wydawcy.

Domyślny Squarespace (5 witryn w top-10k, ale znacznie większa kohorta poza naszą próbą) działa inaczej: Squarespace dostarcza robots.txt, który wymienia 28 botów AI w jednym bloku, ale te boty dziedziczą ograniczenia ścieżkowe User-agent: * zamiast otrzymać blokadę całej witryny. Crawlery AI mogą pobrać /, stronę główną, strony produktowe, blog. Nie mogą tylko pobrać /config czy /account. Wcześniej wskazywaliśmy ten wzorzec jako źródło fałszywie dodatnich odczytów „AI block” w zewnętrznych skanach witryn Squarespace; tutaj obowiązuje ta sama uwaga.


Wynik 9 — Polityka AI jest jednolita w całym rozkładzie rankingu

Powszechna intuicja w tego typu badaniach zakłada, że najczęściej odwiedzane witryny będą mieć najbardziej agresywną politykę AI — mają najwięcej do stracenia na zastępowaniu treningu, największe możliwości prawne i największą uwagę publiczną. Dane nie potwierdzają tej intuicji.

Przedział rankingunJakakolwiek blokada AIJawnaCloudflare Managed
Top 1006722,4%17,9%1 witryna
Top 101–1 00059822,9%19,2%5 witryn
Top 1 001–5 0002 81019,0%15,3%99 witryn
Top 5 001–10 0003 77320,8%17,8%197 witryn

Cztery koszyki mieszczą się między 19% a 23%. Top 100 nie jest bardziej agresywny niż długi ogon z pozycji 5001–10 000. Wygląda na to, że główny wskaźnik jest cechą publicznego internetu w 2026 roku, a nie sygnałem wielkości czy rozpoznawalności pojedynczej strony.

Dwa czynniki to tłumaczą. Po pierwsze, szczyt krzywej zdominowany jest przez domeny infrastrukturalne / SaaS / wyszukiwarkowe / portalowe (Microsoft, Apple, Google itd.), które same z siebie mają niskie wskaźniki blokad AI. Po drugie, długi ogon zawiera duży udział regionalnych wydawców newsowych i witryn z jurysdykcji UE, które — jak pokazały Wyniki 6 i 7 — blokują AI agresywniej niż średnia globalna. Te dwa efekty mniej więcej się znoszą i dają jednolity headline.

Kolumna Cloudflare Managed różni się jednak wzdłuż krzywej. W Top 1000 mamy 6 witryn zarządzanych przez Cloudflare (1,0%); w Top 1001–10000 — 296 (5,7%). Duże serwisy tworzą własne reguły; długi ogon korzysta z przełącznika dostawcy. To jedyny istotny sygnał zależny od rankingu w zbiorze danych i sugeruje, że wraz z zejściem w dół krzywej ruchu od szczytu sieci ku długiemu ogonowi udział polityki AI ustalanej przez dostawcę, a nie wydawcę, rośnie systematycznie. Oczekujemy, że ten gradient utrzyma się także poza top 10k, w top 100k i dalej.


Wynik 10 — Pięć anatomii: jak wygląda robots.txt, gdy naprawdę staje się polityką

Liczby opisują kształt zbioru danych; prawdziwy charakter „polityki AI w publicznej sieci” najlepiej widać, czytając konkretne pliki. Oto pięć wartych uwagi przykładów, dobranych tak, by objąć cały zakres polityki.

Anatomia 1 — The New York Times (nytimes.com)

Pierwsze 14 linii nytimes.com/robots.txt:

# Treści New York Times są udostępniane wyłącznie do osobistego, niekomercyjnego
# użytku, zgodnie z naszym Regulaminem:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# Używanie jakiegokolwiek urządzenia, narzędzia lub procesu zaprojektowanego do
# wydobywania danych lub scrapowania treści w sposób zautomatyzowany jest zabronione
# bez uprzedniej pisemnej zgody The New York Times Company. Zakazane użycia obejmują,
# ale nie ograniczają się do:
# (1) działań text and data mining na podstawie art. 4 dyrektywy UE o prawie autorskim
# na jednolitym rynku cyfrowym;
# (2) tworzenia jakiegokolwiek oprogramowania, machine learning, artificial intelligence (AI)
# i/lub large language models (LLMs);
# (3) tworzenia lub udostępniania innym zbiorów danych archiwalnych lub cache’owanych zawierających nasze treści; i/lub
# (4) jakichkolwiek celów komercyjnych.
# W celu uzyskania pomocy skontaktuj się z https://nytlicensing.com/contact/.

To robots.txt jako materiał dowodowy. Plik jest skonstruowany tak, by nadawał się na dowód w sprawie NYT v. OpenAI, której jest częścią. Odwołania do „Art. 4 of the EU Directive” — dokonane przez amerykańskiego wydawcę — pokazują obserwację z Wyniku 7: unijne ramy ustawowe przenikają do globalnego dyskursu. Wprost zakaz „tworzenia lub udostępniania archiwalnych albo cache’owanych zbiorów danych” jest skierowany bezpośrednio przeciw Common Crawl. Plik ma ponad 60 linii z nazwanymi blokami User-agent dla GPTBot, OAI-SearchBot, ChatGPT-User, anthropic-ai, ClaudeBot, CCBot, Google-Extended, Applebot-Extended, Bytespider, Diffbot, Meta-ExternalAgent, Amazonbot, Omgili, Omgilibot i kilkoma innymi — każdy nazwany bot ma własne Disallow: /.

Anatomia 2 — Der Spiegel (spiegel.de) — zezwalanie na poziomie sekcji

Der Spiegel ma najbardziej operacyjnie zaawansowany robots.txt, jaki znaleźliśmy w całym zbiorze danych. Odpowiedni blok:

# TLP-6507: Testowe odblokowanie crawlerów wyszukiwania OpenAI dla wybranych obszarów
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

Komentarz tłumaczy się jako „Testowe udostępnienie crawlerów wyszukiwania OpenAI dla wybranych sekcji”. Spiegel whitelistinguje siedem konkretnych kategorii treści — wiadomości zagraniczne, partnerstwa, zdrowie, rodzina, podróże, psychologię i styl życia — dla inferencyjnych UA OpenAI, blokując wszystko inne. Sekcje polityczne, niemieckie newsy krajowe i materiał śledczy są wprost wyłączone. Common Crawl, Bytespider, Cohere, Webzio-Extended i inne UA treningowe dostają pełne Disallow: / dalej w pliku.

To robots.txt jako sekcyjna polityka redakcyjna. Implicitna teoria brzmi: treści lifestyle mają niższe ryzyko wypierania treningu i większą szansę na korzyść z cytowania w inferencji, więc Spiegel pozwala AI indeksować te sekcje; treści polityczne i śledcze to fosa, więc AI jest wyłączone. Nie widzieliśmy tego wzorca nigdzie indziej. Sugeruje on poziom wewnętrznej koordynacji między redakcją, działem prawnym i infrastrukturą, którego większość newsroomów jeszcze nie osiągnęła. Spodziewamy się, że tego rodzaju granularna polityka sekcyjna rozpowszechni się w latach 2026–2027 — plik Spiegla jest w praktyce wskaźnikiem wyprzedzającym.

Anatomia 3 — BBC (bbc.com) — forma oświadczenia politycznego

robots.txt BBC zaczyna się od:

# version: ec59bd036e5138eb4831a9ed44447b1ff310e235
# Warunki korzystania BBC: https://www.bbc.co.uk/terms
# - Wyjaśniają zasady korzystania z naszych usług
# - Mówią, co możesz zrobić z naszymi treściami
#
# Krótko mówiąc: prosimy korzystać z naszej strony jak człowiek, a nie robot.
# To znaczy:
# - Brak scrapowania, crawlowania ani systematycznego wydobywania treści
# - Brak używania treści BBC do trenowania lub dostrajania modeli AI, w tym LLM-ów
# - Brak retrieval-augmented generation (RAG), wyszukiwania wspieranego AI, agentic AI lub
#   grounding z użyciem treści BBC
# - Brak tworzenia zbiorów danych z treści BBC
# - Brak text and data mining (TDM) na podstawie artykułu 4 dyrektywy UE o prawie autorskim
# - Brak używania treści BBC do tworzenia podsumowań na własny użytek
# - Brak użycia komercyjnego bez zgody
# - BBC zastrzega wszystkie prawa do swoich treści i wyraźnie rezygnuje z wszelkich
#   wyjątków ustawowych w jakiejkolwiek jurysdykcji dotyczących text and data mining,
#   w zakresie dozwolonym przez prawo
#
# TL;DR: Przeglądaj, czytaj, oglądaj, ciesz się — jak człowiek.

BBC wersjonuje swój robots.txt (ciąg # version: ec59bd... to hash commita git), zakazuje ośmiu konkretnych rodzajów użycia AI, które monitorują prawnicy BBC, i kończy jednowierszowym podsumowaniem w prozatorskim tonie, na którym zbudowana jest marka BBC. Fraza „expressly opts out of any statutory exceptions in any jurisdiction” to świadome globalne zastrzeżenie — oznacza: nie ufamy żadnemu pojedynczemu reżimowi prawnemu, żeby dał nam ochronę, jakiej chcemy, więc w jednym ruchu zastrzegamy prawa wszędzie. To najbardziej „dopieszczony” robots.txt w zbiorze danych i bardziej przypomina komunikat prasowy niż plik konfiguracyjny.

Anatomia 4 — WordPress.org — jawne zaproszenie

Dla kontrastu wordpress.org:

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: anthropic-ai
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Bytespider
Allow: /

User-agent: CCBot
Allow: /

User-agent: Copilot
Allow: /

WordPress.org wprost dopuszcza dziewięć crawlerów treningowych AI, w tym trzy (Bytespider, CCBot, anthropic-ai), które gdzie indziej są najczęściej blokowane. Ukryta teoria jest taka, że dokumentacja WordPressa i ekosystem wtyczek to dobro publiczne, którego wartość rośnie, gdy asystenci AI potrafią na jego temat odpowiadać. Za każdym razem, gdy ktoś pyta Claude „jak skonfigurować permalinki w WordPressie?” i Claude był trenowany na wordpress.org/documentation/, misja WordPressa została wzmocniona. Fundacja wygląda na to, że uznała obecność w korpusie treningowym każdego modelu za strategicznie korzystną i użyła ekspresyjnej gramatyki pliku, by to zakomunikować.

Anatomia 5 — The Verge (theverge.com) — hybryda sponsorowana

Jeszcze jeden wzorzec wart pokazania. The Verge zapisuje reguły AI jako Disallow: / \ Allow: /sp/:

User-agent: GPTBot
Allow: /

User-agent: Applebot
Allow: /

User-agent: Google-Extended
Disallow: /
Allow: /sp/

User-agent: anthropic-ai
Disallow: /
Allow: /sp/

User-agent: Bytespider
Disallow: /
Allow: /sp/

User-agent: CCBot
Disallow: /
Allow: /sp/

User-agent: ChatGPT-User
Disallow: /
Allow: /sp/

User-agent: ClaudeBot
Disallow: /
Allow: /sp/

Ścieżka /sp/ to sekcja treści sponsorowanych / partnerskich The Verge. Treści redakcyjne są blokowane przed treningiem AI; treści sponsorowane są dozwolone. Logika ekonomiczna jest przejrzysta: sponsorzy płacą za to, by ich treści były odkrywalne, także przez AI; redakcyjny flagowy serwis pozostaje fosą. GPTBot jest całkowicie otwarty (prawdopodobnie jako bezpośrednia relacja z OpenAI), Applebot jest w pełni otwarty jako baza wyszukiwawcza, a reszta dostaje hybrydowe traktowanie. To jedyny znaleziony przez nas przykład struktury „zróżnicowanego dostępu AI”.

Te pięć plików opisuje obecny zakres polityki AI w robots.txt. Większość plików w top 10k nie wygląda jak żaden z nich — są albo milczące, albo używają szablonu dostawcy. Te, które wyglądają jak któryś z powyższych, zostały napisane przez osoby, które uznały, że plik warto czytać bardzo uważnie.

Uwaga o skali plików: mediana ciała robots.txt w naszej próbie wynosi 858 bajtów — za mało, by zakodować sensowną politykę AI. Reguły siedzą w ogonie: 1 005 witryn (15,3%) ma plik większy niż 5 KB, 273 większe niż 20 KB, a maksimum wyniosło 248 KB. 460 plików zawiera język zastrzegający prawa autorskie; 275 cytuje z nazwy dyrektywę UE 2019/790. robots.txt w 2026 roku coraz częściej jest dokumentem wersjonowanym i przejrzanym przez prawników, a nie pojedynczą linią konfiguracji.


Wynik 11 — 108 witryn wprost zaprasza GPTBot

Niewielka, ale widoczna grupa zapisuje regułę User-agent: GPTBot \n Allow: / — odwrotność częściej omawianego „Disallow GPTBot”. W naszej próbie jest 108 witryn z jawnym Allow dla GPTBot na ścieżce root. Pierwsze 25 według rankingu Tranco:

gptbot-welcoming-sites.webp

PozycjaDomenaSektor
42wordpress.orgNarzędzia deweloperskie / CMS
133kaspersky.comBezpieczeństwo
187avast.comBezpieczeństwo
265hp.comProducent sprzętu OEM
624branch.ioSaaS atrybucji mobilnej
692sophos.comBezpieczeństwo
782theverge.comNews
905rambler.ruRosyjski portal
945kleinanzeigen.deNiemiecki marketplace
948theatlantic.comNews
1 092lge.comLG Electronics
1 300justdial.comLokalne wyszukiwanie w Indiach
1 332avira.comBezpieczeństwo
1 412youm7.comEgipskie newsy
1 530goodreturns.inFinanse w Indiach
1 621publi24.roRumuńskie ogłoszenia
1 807geocomply.comSaaS compliance
1 908nba.comSport
1 956oneindia.comIndyjskie newsy
1 974mindbox.ruRosyjski SaaS
2 009thesun.co.ukNews
2 126vox.comNews
2 140mgid.comReklama natywna
2 314ninjarmm.comSaaS zarządzania IT
2 323norton.comBezpieczeństwo

Kilka wzorców:

Firmy z sektora bezpieczeństwa są wyraźnie nadreprezentowane. Kaspersky, Avast, Sophos, Avira, Norton, NinjaRMM wprost zezwalają GPTBot. To świadoma strategia dystrybucyjna: gdy użytkownik pyta ChatGPT „jaki jest najlepszy program antywirusowy do mojego Windowsa?”, obecność marki w korpusie treningowym bezpośrednio wpływa na rekomendację. Bezpieczeństwo to jedna z nielicznych kategorii B2C, w których wyszukiwanie AI już zastępuje SEO jako główny kanał pozyskania, i te marki reagują jako pierwsze. Spodziewamy się, że reszta sektora bezpieczeństwa pójdzie tym śladem w ciągu 12 miesięcy.

Niektóre duże marki newsowe są na tej liście, a nie na liście blokad. The Verge, The Atlantic, Vox, The Sun, NBA.com. To nie jest sprzeczność — te wydawnictwa najwyraźniej uznały, że możliwość bycia cytowanym w wyszukiwaniu ChatGPT jest cenniejsza niż ochrona przed treningiem, i zapisały jawne Allow, żeby zabezpieczyć się przed przyszłym nadblokowaniem przez CDN lub CMS. Porównaj to ze stanowiskiem NYT / Reuters / BBC / Forbes / Guardian opartym na jawnych Disallow. Obie postawy da się obronić; branża newsowa nie jest monolitem.

Obecność The Sun jest znacząca, ponieważ ta sama witryna używa gdzie indziej w pliku blokady deny-all User-agent: *. Politykę The Sun najlepiej czytać jako „trening AI jest zakazany, wyszukiwanie AI jest dozwolone, a GPTBot został wprost wpisany na whitelistę jako wyjątek od deny-all, aby upewnić się, że ChatGPT może odpowiadać na pytania cytując The Sun”. To najbardziej zaawansowana prawnie z reguł GPTBot-Allow — połączenie opt-out z opt-inem dla jednego dostawcy.

Obecność WordPress.org to pojedynczy wpis o największym znaczeniu. Niebanalna część globalnego open-source’owego ekosystemu CMS odsyła do WordPress.org po dokumentację albo hostuje stamtąd wtyczki. Jawnie zezwalając GPTBot na wordpress.org/robots.txt, WordPress Foundation de facto stwierdziła, że ekosystem dokumentacji WordPressa jest otwarty dla treningu — co ma efekt domina na to, jak dobrze Claude, Gemini i ChatGPT odpowiadają na pytania „jak zrobić..." o WordPressie.

Pozostałe 83 witryny na pełnej liście Allow-GPTBot to długi ogon regionalnych newsów, mniejszych firm security, platform ogłoszeniowych na rynkach nieanglojęzycznych i SaaS B2B. Na ile możemy stwierdzić, nie istnieje żaden branżowy odpowiednik koordynacji „Allow-GPTBot” — reguła jest przyjmowana pojedynczo, przez operatorów, którzy uznali, że bycie w korpusie to strategiczna pozycja.


Wynik 12 — llms.txt to przy tej skali prawie plotka

llms.txt, proponowany alternatywny format pliku do odkrywania treści przyjaznych LLM-om (promowany od końca 2024 roku przez Mintlify, Anthropic, Vercel i kilku dostawców narzędzi deweloperskich), prawie nie ma widocznej adopcji w naszej próbie.

Spośród 6 638 witryn, które zwróciły parsowalny robots.txt, 83 (1,15%) wspominają llms.txt — zwykle jako linię Sitemap: https://example.com/llms.txt. To o dwa rzędy wielkości mniej niż ten sam wskaźnik mierzony na próbkach e-commerce z dużym udziałem narzędzi deweloperskich, gdzie domyślne ustawienia Vercel i Mintlify zawyżają adopcję.

llms-txt-robots-adoption-rate.webp

Rozkład według kategorii:

Branżan% wspominających llms.txt
Infrastructure474,3%
Gambling1003,0%
SaaS3693,0%
Telecom333,0%
E-commerce2241,8%
Travel641,6%
Dev tools1291,6%
News6500,8%
Adult2540,4%
Government1720,0%
Academia2680,0%
Search120,0%

llms.txt koncentruje się w SaaS sąsiadującym z narzędziami deweloperskimi, w hazardzie (który szybciej niż inne regulowane branże przyjmuje nowe elementy języka robots.txt, bo ma zespoły compliance przyzwyczajone do dokładania metadanych) oraz w e-commerce B2B. Wyraźnie brakuje go w newsach i administracji publicznej — dwóch segmentach najmocniej zaangażowanych w politykę AI, których adopcja byłaby potrzebna, by standard awansował z poziomu „eksperyment dostawcy” do poziomu „protokół sieciowy”. Do tego czasu llms.txt istnieje, ale jest mały, a audyt powtórkowy pod koniec 2026 będzie przydatnym testem kontrolnym.

Strukturalny problem llms.txt polega na tym, że nie jest standaryzowany przez żaden proces IETF, a główni dostawcy AI nie zobowiązali się go respektować. Reguła robots.txt ma za sobą 30 lat infrastruktury crawlerów; reguła llms.txt nie ma żadnej. Dopóki przynajmniej jeden duży dostawca (OpenAI, Anthropic, Google, Cloudflare) nie ogłosi formalnego wsparcia, plik pozostaje w praktyce artefaktem marketingowym ekosystemu Mintlify / Vercel. Nie spodziewamy się, by miało się to zmienić w 2026 roku.


Wynik 13 — Dostępność: robots.txt nadal da się odczytać dla dwóch trzecich topowej sieci

Poboczna obserwacja, która nie miała być wynikiem: 66% top 10 000 witryn zwróciło parsowalny robots.txt z pojedynczego badawczego IP, a tylko 7 z 10 000 (0,07%) zwróciło 429 Too Many Requests. To dobra wiadomość dla robots.txt jako publicznego protokołu.

Dla porównania, ten sam pipeline uruchomiony dwa miesiące wcześniej na próbie 1 008 domen z segmentu mid-market commerce otrzymał 429 od 52% rozpoznanych domen — Shopify i sieci CDN Cloudflare agresywnie ograniczały limity dla każdego UA innego niż duże wyszukiwarki. Sieć o najwyższym ruchu jest znacznie bardziej przyjazna: duże strony częściej mają albo (a) mniej agresywne warstwy zarządzania botami, albo (b) jawne allowlisty dla znanych crawlerów badawczych, albo oba naraz.

Wskaźnik fetch_failed na poziomie 21% w top-10k jest zdominowany przez domeny apex CDN (akamai.net, cloudfront.net, fastly.net, apple-dns.net, gtld-servers.net), które nie uruchamiają serwera WWW pod /. One nas nie blokują; po prostu nie mają nic do serwowania. Po ich wykluczeniu rzeczywisty odsetek „próbowaliśmy odczytać, ale się nie dało” jest jednocyfrowy.

To oznacza, że przyszłe iteracje tego raportu — kwartalne migawki, porównania rok do roku — można uruchamiać tanio i powtarzalnie na jednej maszynie. Okno audytu pozostaje otwarte na szczycie krzywej. Asymetryczny przypadek to długi ogon i segment commerce, gdzie ograniczanie na poziomie CDN w praktyce już sprywatyzowało robots.txt. Spodziewamy się, że ta rozbieżność będzie się pogłębiać: duże strony pozostaną czytelne, bo indeksują je wyszukiwarki wymagające czytelności; commerce z długiego ogona będzie stawał się mniej czytelny, gdy warstwy walki z botami Cloudflare będą wdrażane agresywniej. Publiczna audytowalność robots.txt rozszczepia się wzdłuż tej samej linii, która oddziela „widoczną sieć” od „sieci chronionej operacyjnie”.


IV. Co to wszystko oznacza

Cztery tezy, w kolejności od najsilniej wspartych danymi do najsłabszych.

1. Internet ma politykę AI per branża, a nie globalną. 12-krotna różnica między newsami a telekomami dominuje każdy wynik zbiorczy. Raportowanie „X% sieci blokuje AI” bez cięcia sektorowego zawyża SaaS/rząd/dev i zaniża newsy/travel/social. Jedyną uczciwą ramą jest analiza sektor po sektorze.

2. Artykuł 4 dyrektywy UE o prawie autorskim to jedyny reżim prawny, który wyraźnie przesuwa liczby. Witryny z unijnych ccTLD blokują AI na poziomie 35% wobec globalnej bazy 19%. Spory w USA (NYT v. OpenAI, raport Copyright Office ze stycznia 2025) przesunęły kohortę amerykańskich newsów, ale nie szerszą sieć USA. Ramy UE przenikają też globalnie przez szablon Cloudflare, który w swojej treści standardowej cytuje dyrektywę 2019/790 niezależnie od jurysdykcji klienta.

3. Równolegle wyrażane są dwie „polityki AI” i nie są ze sobą zgodne. Celowa, ręcznie pisana polityka (17,8%, głównie news/social/travel/e-commerce) oraz odziedziczona polityka zarządzana przez Cloudflare (4,5%) pokrywają się co do treści, ale różnią się legitymacją. W świecie, w którym operatorzy AI szukają prawnego alibi, by ignorować robots.txt, obrona „sami to napisaliśmy i przejrzeliśmy” jest strukturalnie silniejsza niż „po prostu włączyłem przełącznik”. Motywacja procesowa jest taka, by przesuwać politykę z drugiej kategorii do pierwszej.

4. Blokowany jest korpus, nie model. CCBot na poziomie 16,3% — wyżej niż jakikolwiek bot opatrzony marką modelu — to najczystsze tego potwierdzenie. Zablokowanie OpenAI nie usuwa wydawcy z procesu trenowania; zablokowanie CCBot usuwa. 14,1% top-10k blokuje CCBot, jednocześnie zostawiając Googlebot w spokoju. Wzorzec „blokuj trening, zostaw wyszukiwanie” to w 2026 roku dominująca reguła AI.

Dla witryn rozważających własne stanowisko: domyślną postawą jest milczenie — 80% top 10k nie mówi nic o AI. Te 17%, które piszą reguły, grupują się wokół Disallow, ale mała, rosnąca kohorta (lista jawnego Allow dla GPTBot, 1,5%, prowadzona przez dostawców bezpieczeństwa) publicznie wybiera odwrotność. Nie ma konsensusu branżowego i nie będzie go w ciągu najbliższych dwunastu miesięcy.

Dla operatorów AI: coraz trudniej utrzymywać tezę, że robots.txt to przestarzały protokół o niejednoznacznej semantyce, gdy 17% największych witryn świata napisało wprost, ręcznie, jawne reguły z nazwami botów oraz 3,8% plików cytuje konkretną unijną ustawę z numerem artykułu. Czy tych reguł trzeba przestrzegać, to decyzja biznesowa; to, że istnieją, jest już faktem empirycznym.


V. Perspektywa: czego spodziewamy się do końca 2026 roku

Trzy trajektorie widoczne w danych:

Cloudflare Managed ponad dwukrotnie zwiększy swój udział, prawdopodobnie osiągając 10%+ parsowalnego top-10k. W roadmapie Cloudflare publicznie omawiany jest tryb „Block AI Bots” włączony domyślnie dla nowych kont. Jeśli przełącznik zacznie być domyślnie aktywny, globalny wskaźnik blokad wzrośnie o 5–8 punktów procentowych bez żadnej decyzji wydawcy. Zobaczymy, że to się dzieje, gdy udział Cloudflare Managed w koszyku 5001–10 000 wzrośnie powyżej obecnych 5,7%.

Polityki AI na poziomie sekcji (w stylu Spiegla) rozpowszechnią się wśród dużych redakcji. Logika ekonomiczna — pozwól AI cytować treści niskiego ryzyka, chroń treści-fosę — jest na tyle przekonująca, że spodziewamy się co najmniej 10 kolejnych redakcji flagowych z regułami sekcyjnymi do końca 2026 roku. Najpierw obserwujmy prasę niemiecką i francuską ze średniej półki; tam ramy prawne najbardziej sprzyjają eksperymentom.

Kohorta jawnego Allow-GPTBot urośnie, prowadzona przez B2B SaaS i narzędzia deweloperskie. Gdy wyszukiwanie AI stanie się mierzalnym kanałem pozyskania dla dostawców oprogramowania (tak jak już jest dla bezpieczeństwa), kolejny CMO zapisze User-agent: GPTBot \n Allow: /, by zabezpieczyć się przed przypadkowym nadblokowaniem. Oczekujemy, że lista 108 witryn mniej więcej się podwoi do końca roku.

Czego nie oczekujemy: istotnej zmiany udziału milczącej większości. Te 80% sieci, które nic nie mówi o AI, obejmują sektory (gov, telecom, infrastructure, B2B SaaS) bez ekonomicznego powodu, by pisać regułę, i bez presji prawnej, by to robić. Uniwersalna polityka AI nie nadchodzi.


VI. Ograniczenia

  1. Jedna migawka. Pobieranie trwało 36 godzin na początku maja 2026. Plik zmienia się codziennie w top 100; należy oczekiwać 1–2 punktów procentowych dryfu kwartalnie dla wskaźników headline.
  2. Luki w klasyfikacji branżowej. 6 593 z 10 000 witryn pozostało w kategorii unknown po czterowarstwowym klasyfikatorze. Procenty sektorowe są solidne tam, gdzie n jest duże (news: 650, streaming: 440, saas: 369, academia: 268, adult: 254, ecommerce: 224, gov: 172, finance: 129, dev: 129), a bardziej zaszumione poniżej n=30. Podobnie ograniczone są cięcia krajowe newsów — DE/FR/UK mają n≥15, podczas gdy Korea/Szwecja/Czechy opierają się na n=20–25.
  3. robots.txt jest dobrowolny. Disallow to prośba, nie bariera. Bytespider, PerplexityBot i inne boty były już dokumentowane jako ignorujące reguły. Mierzyliśmy deklaracje polityczne, nie egzekwowanie polityki.
  4. Audyt z jednego IP w USA. Nie udało się odczytać 21% rozpoznanych domen. Większość z nich to apexy CDN bez serwera WWW; niewielka część to witryny, których CDN zablokował nas, zanim dotarliśmy do origin. To lekko przesuwa próbę w stronę starszej infrastruktury i przeciwko witrynom geofencowanym według kraju pochodzenia.
  5. Semantyka listy Tranco. Tranco filtruje stabilność; to nie jest ranking oparty na rzeczywistym zachowaniu użytkowników. Agregaty są odporne na wybór listy; konkretne pozycje w rankingu już nie.
  6. Brak danych o ruchu. Mierzyliśmy politykę robots.txt, a nie rzeczywisty throughput botów AI. Polityka i ruch nie zawsze są zgodne.

VII. Jak odtworzyć badanie

Wszystko użyte do przygotowania tego raportu znajduje się w folderze dostawy.

  • tranco_top10k.csv — lista wejściowa
  • out/sites.csv — domena × pozycja × branża × język × status robots.txt (10 000 wierszy)
  • out/fetch_meta.csv — wynik pobierania dla każdej domeny (status, schemat, bajty, błąd)
  • out/bot_status.csv — siatka domena × bot (250 000 wierszy: zablokowany, ma_regułę, status_pobrania)
  • out/site_meta.csv — jeden rekord analityczny na witrynę (szablon, booleany podsumowujące)
  • out/analysis.json — każda metryka cytowana w raporcie
  • 01_fetch_robots.py, 02_classify.py, 03_parse_and_analyze.py — pełny pipeline Pythona

Pobierz wszystkie skrypty i zestawy danych


Poprawki metodologii, problemy z danymi i analizy follow-up prosimy kierować na support@thunderbit.com. Raport opublikowano niezależnie od jakiejkolwiek komercyjnej pozycji Thunderbit; budujemy AI Web Scraper i mamy strukturalny interes w tym, by robots.txt nadal był znaczącą, czytelną maszynowo umową w publicznej sieci. Dane w tym raporcie bronią się same. — Zespół badawczy Thunderbit, maj 2026.

Wypróbuj Thunderbit AI Web Scraper Get Started Free

Shuai Guan
Shuai Guan
CEO w Thunderbit | Ekspert ds. automatyzacji danych AI Shuai Guan jest CEO Thunderbit oraz absolwentem wydziału inżynierii University of Michigan. Czerpiąc z niemal dekady doświadczenia w branży technologicznej i architekturze SaaS, specjalizuje się w przekuwaniu złożonych modeli AI w praktyczne, niewymagające kodowania narzędzia do استخراج danych. Na tym blogu dzieli się szczerymi, sprawdzonymi w boju spostrzeżeniami na temat web scrapingu i strategii automatyzacji, które pomogą Ci tworzyć mądrzejsze, oparte na danych procesy pracy. Gdy nie optymalizuje przepływów danych, z tą samą dbałością o szczegóły oddaje się swojej pasji do fotografii.
Spis treści

Zbierz dane ze strony, po prostu o to prosząc

Powiedz, czego potrzebujesz, prostym angielskim. A najlepiej: nie mów nic.

Wypróbuj Thunderbit darmowe
Wyodrębniaj dane dzięki AI
Łatwo przenoś dane do Google Sheets, Airtable lub Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week