Cum trasează cele mai bune site-uri linia pentru crawler-ele AI

Ultima actualizare pe May 8, 2026
Cum trasează cele mai bune site-uri linia pentru crawler-ele AI

Rezumat executiv

Am extras fișierul robots.txt pentru fiecare domeniu din lista Tranco top 10.000 a site-urilor cu cel mai mare trafic din lume. Apoi am analizat fiecare fișier cu un parser conform RFC 9309, l-am clasificat după politica de boturi AI adoptată de site (dacă există) și am numărat câte dintre cele mai vizitate site-uri din lume încearcă, de fapt, să blocheze ChatGPT, Claude, Perplexity, Gemini, Common Crawl, Bytespider, Apple Intelligence și ceilalți crawleri care antrenează și alimentează modelele lingvistice mari în 2026.

Cifrele principale, pe un eșantion de 7.248 de site-uri ale căror robots.txt au putut fi citite fără probleme:

ai-crawler-block-statistics.webp

20,3% dintre cele mai mari 10.000 de site-uri din lume blochează cel puțin un crawler AI. 17,0% au scris intenționat o regulă explicită, specifică AI. Restul de 80% lasă crawlerii AI la fel de bine primiți ca Googlebot.

Șase concluzii care schimbă forma poveștii:

  • Organizațiile de presă au o rată de blocare de 47% — cea mai mare dintre toate sectoarele. Presa germană conduce cu 88%, cea franceză cu 80%, iar cea rusă cu 0%. Regimul juridic, nu tehnologia și nici economia industriei, este principalul factor.
  • CCBot (Common Crawl) este botul cel mai blocat, cu 16,3% — înaintea lui GPTBot (15,8%) și Bytespider (14,9%). Editorii țintesc corpusul de antrenare, nu marca modelului. Cea mai adoptată regulă selectivă este „blochează CCBot, permite Googlebot” (14,1% dintre site-uri).
  • Franța conduce toate țările, cu 50,6% blocare AI pe site-urile .fr; clusterul UE este cu 16 puncte peste baza globală. 275 de fișiere robots.txt citesc explicit Directiva UE 2019/790. Articolul 4 este singurul regim juridic care mișcă vizibil cifrele.
  • 17,8% și-au scris propriile reguli AI; 4,5% rulează șablonul vendorizat de Cloudflare; 75,7% nu spun nimic. Site-urile mari își redactează singure regulile; coada lungă folosește comutatorul. The Atlantic și chiar cloudflare.com sunt pe lista Cloudflare Managed.
  • 108 site-uri permit explicit GPTBot — WordPress.org, Kaspersky, Norton, Avast, Sophos, The Verge, The Atlantic, NBA.com, The Sun, Branch.io. Securitatea și instrumentele pentru dezvoltatori sunt supra-reprezentate.
  • Politica AI nu devine mai agresivă la capul distribuției. Top 100, 101–1000, 1001–5000, 5001–10000 stau toate între 19% și 23%. Rata principală este o proprietate a webului public în 2026, nu un semnal despre cât de mare este un site individual.

Povestea nu mai este despre dacă webul „contraatacă”. Este despre ce industrii, ce țări, ce regimuri juridice și ce furnizori AI sunt țintele politicilor active — și care nu sunt.


I. Context: cum a devenit robots.txt un artefact de politică AI

Trei forțe au remodelat ce înseamnă robots.txt de când OpenAI a lansat GPTBot în august 2023.

Furnizorii AI s-au înmulțit. Au urmat Google-Extended de la Google, ClaudeBot de la Anthropic, Bytespider de la ByteDance, Applebot-Extended de la Apple, Amazonbot de la Amazon, Meta-ExternalAgent de la Meta. CCBot, deja existent la Common Crawl, a devenit ținta cu cel mai mare efect de levier, pentru că arhiva lui alimentează cele mai multe modele cu greutăți deschise. Au apărut și boturi non-vendor: AI2Bot, cohere-ai, PerplexityBot, YouBot, DuckAssistBot, Diffbot, Omgili. O listă completă de blocare pentru 2026 ajunge la aproximativ 25 de nume.

Articolul 4 din Directiva UE privind drepturile de autor 2019/790 a creat o excepție legală pentru text and data mining care nu se aplică dacă titularul drepturilor și-a „rezervat în mod expres” drepturile într-o formă „citibilă automat”. Pe parcursul anilor 2024–2025, editorii europeni și avocații lor au ajuns să folosească robots.txt drept modalitatea canonică de a exprima această rezervare. Setul nostru de date arată că 275 de site-uri citează explicit Directiva 2019/790, iar 87 menționează „TDM” — concentrate în presa europeană, unde apare ca un preambul juridic de 4–8 linii.

Cloudflare a transformat comutatorul într-un produs. În 2024–2025, Cloudflare a lansat un panou „AI Audit”, un comutator „Block AI Bots” și un șablon robots.txt administrat, cu vocabularul Content-Signal: search=yes,ai-train=no plus formulări standard despre EU 2019/790. Până în mai 2026, șablonul rulează pe 4,5% din top 10k parseabil. Planul public Cloudflare discută activ ca acest comutator să fie activ implicit pentru conturile noi — ceea ce ar muta rata globală de blocare cu 5–8 puncte fără ca vreun editor individual să ia o decizie.

În 2026, robots.txt nu mai este fișierul de configurare banal din 2022. Este un mecanism de rezervare a drepturilor de autor cu sprijin tratat în UE, un artefact de politică modelat de vendor în coada lungă și linia din față a unei negocieri lente între cei care administrează site-uri și cei care antrenează modele.


II. Metodologie

Am încercat să facem acest demers cât mai plictisitor și reproductibil posibil. Întregul flux (scripturi Python, CSV-uri parsate, arhivă brută robots.txt, grafice) este publicat odată cu acest raport.

Eșantion

Am pornit de la lista Tranco din mai 2026, descărcată ca top-1m.csv.zip, și am extras primele 10.000 de rânduri. Tranco agregă patru clasamente sursă (Cisco Umbrella, Majestic, Farsight și Cloudflare Radar), filtrează stabilitatea pe o fereastră de 30 de zile și elimină zgomotul evident produs de crawlere/CDN-uri. Lista pe care o produce este cel mai apropiat echivalent deschis al unui „top-10k global al traficului web”, iar în cercetarea academică de web este eșantionul standard (folosit în peste 600 de lucrări peer-reviewed de la lansarea sa de către KU Leuven în 2018).

Lista conține un amestec de: (a) site-uri principale pe care oamenii le vizitează, (b) domenii de infrastructură/API/DNS/CDN care nu servesc nimic la /, și (c) domenii folosite intern de platforme mari (de ex. gvt1.com, apple-dns.net, googleusercontent.com). În loc să le filtrăm dinainte, le-am păstrat pe toate și le-am etichetat cu categoria infrastructure în stratul de analiză. Ele ies natural din calcule atunci când restrângem eșantionul la „site-uri care au returnat un robots.txt parseabil”.

Preluare

Pentru fiecare dintre cele 10.000 de domenii am emis un GET /robots.txt asincron prin HTTPS, cu fallback pe HTTP, redirecturi urmărite până la patru hopuri, timeout total de 12 secunde, limită de 500 KB pentru corp și un User-Agent real de browser, cu Accept-Language: en-US. Concurența a fost ținută la 80 de cereri simultane. Jobul a rulat de pe un singur IP rezidențial din San Francisco.

Rezultatul preluării:

StatusNumărInterpretare
200 OK6.638Corpul robots.txt a fost returnat și poate fi analizat.
404 Not Found610Nu există niciun robots.txt. RFC 9309 definește acest caz ca un „allow everything” implicit.
403 Forbidden563Originul respinge activ cererile pentru robots.txt. Excluse din analiză.
429 Too Many Requests7Aproape deloc throttling la nivel CDN în acest segment de rang.
fetch_failed (eroare TLS / DNS / TCP)2.065În principal domenii CDN apex (akamai.net, cloudfront.net, fastly.net, gtld-servers.net, apple-dns.net) care nu rulează un webserver la /. Nu sunt „blocate” — pur și simplu nu au ce robots.txt să servească.
Alte 4xx/5xx117Mix — erori de server, geofencing, răspunsuri malformate.

Asta ne oferă 7.248 de site-uri în eșantionul analizabil (6.638 200 + 610 404). Cele 2.065 fetch_failed sunt domenii reale, dar sunt puncte de CDN/DNS, nu site-uri vizitate de oameni, iar a le trata ca având o „politică AI” nu are sens. Ele rămân în setul de date ca o statistică separată de accesibilitate.

Parsare

Fiecare corp 200 a fost parsat cu protego, o implementare Python a RFC 9309 folosită în producție de Scrapy. Pentru fiecare pereche (site, bot) am calculat trei lucruri:

  1. can_fetch_root — dacă botul are voie să preia /, cu semantica standard a grupurilor de reguli, precedența celei mai lungi potriviri și suprascrierea lui User-agent: * de către un bloc specific botului, atunci când ambele există.
  2. has_specific_rule — dacă fișierul conține o linie User-agent: care numește exact acest bot (fără a ține cont de majuscule/minuscule).
  3. disallow_count — câte directive Disallow: există în blocul relevant, folosite pentru a distinge interdicțiile totale la nivel de site de restricțiile la nivel de cale.

Combinația contează fiindcă o simplă „rată de blocare” ascunde două fenomene foarte diferite: branduri care au scris intenționat User-agent: GPTBot \n Disallow: / pentru că au decis să se opună și branduri al căror bloc generic User-agent: * \n Disallow: / (setat cu ani în urmă pentru staging sau mentenanță) ajunge să interzică și fiecare bot AI care nu exista când a fost scris șablonul. În tot raportul, numărul de „orice blocare AI” le include pe ambele; numărul de „blocare AI explicită” este submulțimea deliberată.

Boturi incluse

Am urmărit 25 de boturi, grupate în trei categorii:

  • Crawleri pentru antrenare AI (16): GPTBot, ClaudeBot, anthropic-ai, CCBot, Google-Extended, Meta-ExternalAgent, Bytespider, Applebot-Extended, Diffbot, Amazonbot, ImagesiftBot, FacebookBot, cohere-ai, AI2Bot, Omgili, Omgilibot.
  • Boturi de inferență AI / recuperare live (7): PerplexityBot, Perplexity-User, ChatGPT-User, OAI-SearchBot, ClaudeBot (care servește și pentru antrenare, și pentru inferență), YouBot, DuckAssistBot.
  • Bazelină de căutare (6): Googlebot, Bingbot, DuckDuckBot, Slurp (Yahoo), Baiduspider, YandexBot.

Câteva boturi stau la granița dintre antrenare și inferență. ClaudeBot este cel mai important — Anthropic a retras în 2024 vechiul UA anthropic-ai și folosește acum ClaudeBot atât pentru antrenare, cât și pentru recuperare live, așa că o regulă Disallow: ClaudeBot nu mai corespunde clar la „blochează antrenarea, dar păstrează vizibilitatea”. Am păstrat această alocare și îi explicăm consecința mai târziu.

Clasificarea industriei

Am clasificat fiecare domeniu în una dintre 16 categorii de industrie (news, social, streaming, ecommerce, search, finance, infrastructure, saas, academia, dev, gov, adult, gambling, travel, telecom, unknown) folosind o abordare pe mai multe straturi:

  1. Dicționar de domenii cunoscute — o hartă curată manual a aproximativ 500 de domenii cu trafic mare către industrii.
  2. Modele TLD / sufix.govgov, .edu și .ac.*academia, sufixe CDN recunoscute → infrastructure.
  3. Cuvinte-cheie în numele domeniuluinews, post, shop, bank, porn, casino etc. ca semnale de rezervă.
  4. Scanare homepage — pentru site-urile pe care primele trei straturi nu le-au putut clasifica și care au returnat un robots.txt 200, am preluat HTML-ul paginii principale, am extras <title>, <meta name="description">, <meta property="og:type"> și am rulat o scorare pe bază de cuvinte-cheie împotriva unor indicii de categorie în stilul modelelor lingvistice.

Rezultatul: 3.407 site-uri (34%) cu etichete industriale sigure și 6.593 lăsate ca unknown. Categoria unknown este dominată de portaluri regionale non-englezești, site-uri de brand corporate .com care nu se potrivesc clar în nicio singură categorie și publisheri tradiționali din piețe lingvistice mici pentru care nu aveam intrări în dicționar. Ori de câte ori raportul citează un procent per industrie, numitorul este eșantionul clasificat pentru acea industrie, nu întregul set de 10.000.


III. Concluzii

Concluzia 1 — Unul din cinci site-uri cu trafic mare blochează cel puțin un bot AI

În cele 7.248 de site-uri analizabile, 1.472 (20,31%) blochează cel puțin un bot AI. 1.230 (16,97%) au o regulă AI specifică și deliberată. Baza de referință pentru Googlebot este 2,18% (158 de site-uri — cele mai multe fie blochează totul ca setare implicită de mentenanță, fie, în trei cazuri, sunt motoare de căutare care își blochează competitorii).

Cele 20 de procente din titlu sunt de 9 ori baza Googlebot. Este un semnal real — site-urile cu trafic mare au o probabilitate cu un ordin de mărime mai mare să blocheze un crawler AI decât un crawler de căutare — dar este și o cifră mult mai mică decât narațiunea „blocarea AI ajunge la adoptare universală” care circulă în presă din 2024. Chiar și printre cele mai vizitate 10.000 de site-uri ale webului, majoritatea de 5 din 6 nu spun nimic despre AI.

Împărțirea dintre „orice blocare AI” (20,3%) și „blocare AI explicită” (17,0%) este mică în termeni absoluți, dar importantă conceptual. Diferența de 3,3 puncte reprezintă partea de site-uri care blochează boturile AI doar fiindcă regula lor existentă User-agent: * \n Disallow: / prinde tot ce trece pe acolo, inclusiv boturi care nu existau când a fost scrisă regula. Cifra de 17,0% este citirea mai curată a întrebării „câte dintre cele mai mari site-uri din lume au luat o decizie AI specifică?”.

Comparat cu literatura anterioară:

SursăDatăEșantionRată de blocare
Originality.aimart. 20251.000 de site-uri de știri cele mai populare (engleză)35,7% blochează GPTBot
Palewireaug. 20241.500 de organizații de presă36,0% orice crawler AI
Reuters Instituteprimăvara 202550 de branduri de știri importante, 10 țări78% orice crawler AI
WIRED / NYTsfârșitul lui 2023Top 50 știri SUA26% blochează GPTBot
Acest raport (Thunderbit)mai 2026Tranco top 10.000 (toate sectoarele)20,3% / 17,0% explicit

Cifra noastră explicită de 17,0% este mai mică decât în toate studiile centrate pe presă, pentru că două treimi din eșantion nu sunt știri. Restrâns la cele 650 de site-uri de știri obținem 47% — în aceeași plajă cu studiile anterioare, odată ce corectezi compoziția eșantionului. Imaginea structurală este consistentă: cohorta de știri blochează AI de 3–4 ori mai des decât restul webului.


Concluzia 2 — Analize detaliate pe industrii: o diferență de 12x de la știri la telecom

Cea mai citată concluzie în doi ani de acoperire despre „AI scraping” a fost cifra de 80% dintre publicațiile de știri blochează GPTBot din Originality.ai și Palewire. Secțiunea noastră produce o valoare mai mică, dar tot distinctivă: 47,2% dintre site-urile de știri din top 10.000 blochează cel puțin un bot AI, iar 45,2% scriu o regulă AI explicită.

Dar „știri vs. tot restul” este prea grosier. Defalcarea completă (industriile cu n ≥ 10 în eșantion) spune o poveste mult mai bogată:

robots-industry-spread_compressed.webp

IndustrienOrice blocare AIExplicitGooglebot blocatReguli DIYCloudflare ManagedSilent
Știri65047,2%45,2%1,5%46,9%1,5%48,5%
Călătorii6429,7%29,7%0,0%35,9%3,1%54,7%
Social6529,2%23,1%4,6%23,1%6,2%66,2%
Streaming44020,0%17,7%0,7%16,8%3,6%75,5%
Finanțe12919,4%12,4%0,8%14,7%2,3%75,2%
E-commerce22418,3%17,4%0,4%24,1%1,3%66,1%
Adult25417,3%14,6%0,4%10,2%7,9%79,5%
Căutare1216,7%0,0%0,0%0,0%0,0%100,0%
Academie26814,6%13,8%0,4%13,4%3,4%77,2%
Gambling10014,0%13,0%0,0%18,0%4,0%77,0%
Instrumente dev12910,1%7,8%0,0%8,5%5,4%77,5%
SaaS3697,6%6,2%0,3%9,5%0,8%87,5%
Guvern1725,2%3,5%0,0%4,1%0,6%83,1%
Infrastructură474,3%0,0%0,0%4,3%2,1%72,3%
Telecom333,0%3,0%0,0%12,1%0,0%78,8%

Diferența de 12x dintre știri și telecom este motivul pentru care „politica AI a webului” este unitatea greșită de analiză. Nu există o singură cifră; există cifre sectoriale care diverg cu un ordin de mărime. Mai jos trecem prin cele patru concluzii cele mai distincte.

Știri: 47% blocare, 47% DIY. Presa este cohorta care a scris playbook-ul. Cloudflare Managed rulează la doar 1,5% în știri — acești editori nu externalizează regula. Textul este neobișnuit de bogat: NYT începe cu un preambul juridic de 14 linii care citează „Art. 4 of the EU Directive”; BBC cu „Please use our site like a human, not a robot... TL;DR: Browse, read, watch, enjoy — like a human.”; The Sun cu „The Sun does not permit the unlicensed use of our content for large language models.” Aici robots.txt este declarație de politică, nu configurare.

Călătorii la 30% — surpriza. Booking, Expedia, TripAdvisor, Kayak și marile companii aeriene blochează la două treimi din rata presei. Modelul selectiv este consistent: blocatorul mediu din turism respinge 5–7 UA-uri de antrenare, dar lasă inferența (PerplexityBot, ChatGPT-User, OAI-SearchBot) neatinsă. Datele agregate de prețuri și recenzii sunt șanțul defensiv; citările către site sunt avantajul. Acesta este cel mai curat model „antrenarea afară, inferența înăuntru” din orice industrie singulară.

Adult la 17% — și asta e o surpriză. Eșantioanele mai mici anterioare arătau 0%. Datele complete indică faptul că una din șase site-uri adult interzice cel puțin un bot AI, cu cea mai mare rată Cloudflare Managed dintre toate sectoarele (7,9%). Mai mult de jumătate din blocările AI din adult provin din comutatorul Cloudflare, nu din decizia editorului. Antrenarea pentru generare de imagini este amenințarea implicită — modelele de tip Stable Diffusion învață stilul vizual mai repede decât modelele de text învață stilul de scriere.

SaaS la 7,6% este contraintuitiv. Furnizorii de software sunt cel mai vocal segment în discursul despre politica AI, dar robots.txt al lor este larg deschis. Interpretarea corectă: echipele de marketing SaaS au identificat corect căutarea AI drept canal de distribuție. Vendorii care chiar s-au gândit la asta aleg să intre, nu să iasă — lista explicită de Allow pentru GPTBot (Concluzia 12) este dominată de companii de securitate și SaaS pentru dezvoltatori.

Guvern 5,2%, telecom 3,0%, infrastructură 4,3%, dev 10,1%. Obligațiile de transparență din registrele publice fac Disallow: / delicat din punct de vedere juridic pentru .gov. Site-urile de marketing ale companiilor de telecomunicații vor să fie descoperite. Domeniile apex ale CDN-urilor nu au nimic de protejat. Instrumentele pentru dezvoltatori aleg explicit să intre (conținutul lor câștigă valoare atunci când LLM-urile îl citează).

Concluzia: nu există o singură cifră „webul blochează/nu blochează AI” care să nu piardă mai mult decât transmite. Raportarea la nivel de sector este singurul mod onest de a discuta datele.


Concluzia 3 — Pe furnizori AI: cine este blocat cel mai mult?

Cealaltă împărțire firească a datelor este după compania AI, nu după bot. Mai mulți vendori rulează mai multe boturi (OpenAI are trei: GPTBot, ChatGPT-User, OAI-SearchBot; Anthropic are două: ClaudeBot, anthropic-ai; Meta are două: Meta-ExternalAgent, FacebookBot). Agregarea la nivel de vendor este cea mai apropiată aproximare pe care o putem face la întrebarea „ce crede webul public despre fiecare companie AI?”.

Vendor AIBoturi agregateSite-uri care blochează ≥ 1 bot% din eșantionul analizabil
Common CrawlCCBot1.17816,25%
OpenAIGPTBot, ChatGPT-User, OAI-SearchBot1.17216,17%
AnthropicClaudeBot, anthropic-ai1.11115,33%
ByteDanceBytespider1.08214,93%
MetaMeta-ExternalAgent, FacebookBot98913,65%
GoogleGoogle-Extended97013,38%
AmazonAmazonbot87712,10%
AppleApplebot-Extended85911,85%
Webz.io (Omgili)Omgili, Omgilibot73110,09%
Coherecohere-ai7179,89%
PerplexityPerplexityBot, Perplexity-User7159,86%
DiffbotDiffbot6849,44%
You.comYouBot5637,77%
AI2 (Allen AI)AI2Bot4876,72%
DuckDuckGoDuckAssistBot4826,65%

Common Crawl este entitatea cea mai țintită, chiar dacă este o arhivă web non-profit, nu un operator de LLM. Motivul este efectul de levier: CCBot alimentează aproape toate modelele cu greutăți deschise și o parte substanțială dintre cele închise. A bloca CCBot prima dată este regula cu cea mai mare acoperire pe care o poate scrie un editor.

OpenAI, Anthropic, ByteDance se grupează între 14–16%. Avansul OpenAI este parțial un artefact de numărare (trei boturi OpenAI față de un singur bot pentru ByteDance). Cele 14,9% ale Bytespider sunt efectul „comportamentului Bytespider” — a fost documentat că ignoră robots.txt din 2024, iar editorii îl blochează ca semnal public, nu fiindcă le-ar fi teamă de TikTok.

Meta, Google, Amazon, Apple la 12–14% reprezintă al doilea nivel — scrise defensiv, nu ca declarație de poziție. Vendorii mici (Webz.io, Cohere, Perplexity, Diffbot, You.com, AI2, DuckDuckGo) la 6–10% sunt împinși în sus mai ales de pragul general de 3,8%; regulile explicite pentru ei sunt în intervalul 1–4%.

xAI (Grok), Mistral și majoritatea laboratoarelor europene/chineze lipsesc din tabel — nu au publicat UAs documentate pentru crawlerii de antrenare. Ecosistemul actual robots.txt este un dialog între vendori din SUA/China care au lansat UAs și editori din SUA/UE care au scris reguli; vendorii care nu au lansat nimic rămân invizibili în negociere.


Concluzia 4 — CCBot este noul paratrăsnet, nu GPTBot

Ordinea boturilor în top-10k arată așa:

most-blocked-ai-crawlers-vendors.webp

RangBotRata de blocareRata regulilor explicite
1CCBot (Common Crawl)16,25%12,90%
2GPTBot (OpenAI)15,84%12,72%
3Bytespider (ByteDance)14,93%11,35%
4ClaudeBot (Anthropic)14,51%11,13%
5Google-Extended13,38%10,18%
6Meta-ExternalAgent12,38%8,95%
7Amazonbot12,10%8,66%
8Applebot-Extended11,85%8,72%
9Omgilibot10,09%5,31%
10anthropic-ai (depreciat)9,99%6,55%
11cohere-ai9,89%6,42%
12PerplexityBot9,69%6,40%
13Diffbot9,44%5,95%
14ChatGPT-User (inferență)8,90%5,73%
15YouBot (inferență)7,77%4,29%
16OAI-SearchBot (inferență)6,83%3,66%
bazăGooglebot2,18%
bazăBingbot2,27%

Povestea din tabel este că botul pe care webul public îl blochează primul nu este marca modelului — ci corpusul. Arhiva Common Crawl de 250 de miliarde de pagini a fost cel mai mare input de antrenare pentru GPT-3, GPT-4, Llama 1 / 2 / 3, Falcon, Mistral, BLOOM și majoritatea modelelor cu greutăți deschise lansate după 2020. Un site care vrea să iasă din „a fi inclus în următorul model frontieră” se optimizează mai bine blocând CCBot primul — odată ce nu mai ești în Common Crawl, ești practic exclus gratuit din pipeline-ul de antrenare open-source. GPTBot și ClaudeBot vin pe locurile doi și trei pentru că sunt fața vizibilă a două produse comerciale specifice; UA-ul de la nivel de corpus este ținta structurală.

Boturile AI mai jos clasate din tabel sunt, de asemenea, informative. Omgilibot la 10% este neobișnuit de sus pentru un bot despre care mulți cititori nu au auzit — este operat de Webz.io, un broker de date de conținut care vinde arhive web operatorilor de LLM, iar un număr mare de organizații de presă au început să-l numească explicit în fișierele lor. AI2Bot la 6,7% (și regula corespunzătoare Ai2Bot-Dolma pe site-urile Squarespace) sugerează că și comunitatea academică de LLM este semnalată de editori care nu disting neapărat între „crawler de cercetare non-profit” și „crawler comercial”.

Clusterul de inferență — ChatGPT-User, OAI-SearchBot, YouBot, Perplexity-User — stă cu 4–8 puncte procentuale sub clusterul de antrenare. Diferența aceasta este răspunsul la o întrebare de politici publice care revine de mult: da, site-urile cu trafic mare disting între un bot care colectează date pentru antrenarea unui model viitor și un bot care face recuperare live pentru a răspunde acum la întrebarea unui utilizator. Nu fac întotdeauna distincția (regulile-covor nu o fac), dar o parte semnificativă scrie reguli care vizează în mod specific partea de antrenare.


Concluzia 5 — 14% blochează CCBot dar păstrează Googlebot binevenit — modelul „blochează corpusul, păstrează căutarea”

Regula selectivă cu cea mai mare adopție în top-10k:

website-crawler-blocking-stats.webp

Model de regulăSite-uri% din eșantionul analizabil
Blochează CCBot, permite Googlebot1.02314,11%
Blochează Bytespider, permite Googlebot92612,78%
Blochează Google-Extended, permite Googlebot81611,26%
Blochează GPTBot, permite OAI-SearchBot6589,08%
Blochează GPTBot, permite ChatGPT-User5257,24%
Blochează CCBot, permite PerplexityBot5197,16%
Blochează anthropic-ai, permite ClaudeBot590,81%

Modelul cel mai adoptat (14,1%) este „blochează Common Crawl, păstrează vizibilitatea în Google Search”. Următorul (12,8%) este „blochează Bytespider, păstrează vizibilitatea în Google Search” — adică blochează crawlerul ByteDance semnalizat negativ, dar lasă baza legitimă de căutare intactă. Al treilea (11,3%) este „blochează UA-ul de antrenare AI al Google, dar păstrează UA-ul de căutare Google”, exact separarea pentru care a fost creat Google-Extended: editorul iese din antrenarea Bard / Gemini fără să piardă poziționarea în căutare.

Aceste trei cifre împreună descriu postura dominantă pe web-ul top-10k: blochează boturile de corpus de antrenare, lasă boturile de căutare și inferență neatinse. Modelul minoritar „blochează antrenarea, dar permite UA-ul specific de recuperare live al acestui LLM” — GPTBot ✗ / ChatGPT-User ✓ la 7,2% — există, dar este mai mic decât tăieturile la nivel de corpus.

Rândul anthropic-ai / ClaudeBot la 0,81% reflectă deprecierea UA-ului Anthropic din 2024: ClaudeBot servește acum și antrenare, și inferență, eliminând expresia curată „blochează antrenarea, permite citarea” pe care o permitea vechiul UA anthropic-ai. Aceasta este cea mai puțin discutată decizie de design UA din 2024–2025 — a scos o clasă întreagă de expresie a politicii din robots.txt.


Concluzia 6 — Presa, în detaliu: pe țări și limbi

Când împărțim categoria de știri după TLD de cod de țară — ținând cont că asta înseamnă .de pentru presa germană, .fr pentru presa franceză etc., nu limba servită — variația din interiorul presei este mai mare decât variația dintre presă și restul:

news-blocking-country-tld.webp

Țară (doar știri)nOrice blocare AIExplicit
🇩🇪 Germania (.de)2588,0%88,0%
🇫🇷 Franța (.fr)1580,0%80,0%
🇬🇧 Regatul Unit (.co.uk)1566,7%53,3%
🇪🇸 Spania (.es)560,0%60,0%
🇮🇹 Italia (.it)1353,8%53,8%
Presă globală (.com/.org/etc)50045,0%42,8%
🇵🇱 Polonia (.pl)742,9%42,9%
🇯🇵 Japonia (.jp)1225,0%25,0%
🇷🇺 Rusia (.ru)130,0%0,0%
🇬🇷 Grecia (.gr)60,0%0,0%

Presa germană este subsegmentul cu cea mai mare rată de blocare din întregul set de date, la 88%, și este 88% explicit — practic nu există niciun site de știri german din top 10k care să lase crawlerii de antrenare AI să ajungă la arhiva lui. Cohorta este condusă de Spiegel, Bild, Welt, Zeit, FAZ, Süddeutsche, Heise, Golem, Stern, Focus — întreaga establishment de presă germană mainstream, plus publisherii tech care și-au scris regulile independent. Infrastructura politică din spate este densă: VG Media, organizația colectivă de drepturi a editorilor germani, a fost cohorta de reclamanți cea mai agresivă în litigiile UE privind drepturile de autor și AI, iar Articolul 4 din Directivă este implementat în dreptul german ca §44b UrhG, cu limbaj explicit de excludere citibil automat. Până la apariția vendorilor AI, editorii germani erau, dintre toate cohortele naționale, cei mai pregătiți să traducă această poziție juridică în reguli robots.txt.

Presa franceză la 80% este imediat sub. Mediul juridic francez este similar (Directiva 2019/790 transpusă în dreptul francez), iar comportamentul cohortelor este similar — lemonde.fr, lefigaro.fr, liberation.fr, lequipe.fr, 20minutes.fr, ouest-france.fr blochează toate, iar fișierul Le Monde citează suplimentar droit du producteur de base de données francez (Articolul L 342-1 din Code de la propriété intellectuelle) ca bază juridică internă paralelă. Franța are și un detaliu suplimentar: o hotărâre din 2024 a tribunalului comercial din Paris a stabilit că excluderile bazate pe robots.txt sunt o notificare suficientă conform Articolului 4; aceasta oferă sprijin direct din jurisprudență pe care nicio altă jurisdicție nu l-a egalat încă.

Regatul Unit la 67% este mai jos, iar motivul este că mai mulți publisheri britanici importanți (thesun.co.uk, dailymail.co.uk, mirror.co.uk) folosesc blocări deny-all cu User-agent: * în loc de reguli AI specifice, ceea ce trage în jos cifra explicită la 53%. Efectul agregat este același — aceste site-uri nu permit crawlerele AI — dar politica este exprimată ca „niciun robot, în afară de această listă precisă de motoare de căutare” și nu ca interdicții numite pe fiecare bot AI. Structura juridică este și ea mai slabă: după Brexit, Regatul Unit a moștenit logica Articolului 4, dar jurisprudența internă corespunzătoare este mai subțire.

Presa rusă la 0% este cel mai surprinzător rând. Treisprezece site-uri de știri cu domenii rusești din eșantion (dzen.ru, rbc.ru, ria.ru, kommersant.ru, tass.ru, lenta.ru, gazeta.ru, interfax.ru, kp.ru, tass.com, etc.) — niciunul nu blochează vreun crawler AI. Explicația probabilă: antrenarea modelelor LLM în limba rusă este dominată de modelele GPT-like proprii ale Yandex (care folosesc crawleri interni Yandex, nu Common Crawl), mediul rus privind drepturile de autor nu a adoptat un echivalent al Articolului 4, iar marii publisheri ruși văd LLM-urile occidentale drept o problemă minoră (controlul la export al SUA limitează deja serviciile OpenAI/Anthropic în Rusia) și Yandex drept un stakeholder intern, nu un adversar. Postura de politică este pur și simplu diferită.

Presa japoneză la 25% reprezintă un al treilea model. Japonia are excepții explicite de text and data mining în legislația internă privind drepturile de autor (Articolul 30-4 din Copyright Act-ul japonez, modificat în 2018), care sunt mai permisive decât Articolul 4 al Directivei UE — ele permit TDM pentru scopuri de „non-enjoyment”, inclusiv antrenare AI, fără a cere consimțământul titularului drepturilor. Publisherii japonezi au mai puțin spațiu legal pentru opt-out, iar ratele corespunzătoare din robots.txt sunt mai mici. Cei 25% care totuși blochează sunt mai ales cei mai mari și mai cosmopoliți publisheri (asahi.com, nikkei.com), poziționați internațional mai degrabă decât domestic.

Datele transversale despre presă pe țări sunt cea mai clară dovadă din raport că regimul juridic, nu tehnologia și nici economia industriei, este principalul factor care determină blocarea AI. Cohortele de presă din UE se grupează între 54% și 88%; cohortele non-UE (Rusia, Japonia, cohorta globală .com) variază între 0% și 45%. Vârful de 88% apare în țara cu implementarea Articolului 4 cea mai dezvoltată; minimul de 0% apare în țara cu practic nicio lege de politică AI.


Concluzia 7 — UE vs restul: un ecart de 16 puncte

Dacă ridicăm lentila de la țări la regiuni, separarea UE vs restul este clară:

RegiunenOrice blocare AIExplicit
ccTLD-uri UE (.fr, .de, .es, .it, .nl, .pl, .se, .dk, .fi, .be, .at, .cz, .hu, .ro, .gr, .pt, .ie, .sk, .bg)61735,2%33,9%
ccTLD-uri naționale non-UE (.uk, .jp, .kr, .cn, .ru, .br, .in, .au, .mx, .ca, .tr, .ar, .cl, .co, .pe)89717,2%13,6%
Global (.com, .net, .org, etc.)5.73419,2%15,7%

Site-urile cu ccTLD din UE blochează AI de două ori mai des decât cohorta națională non-UE și aproape de două ori mai des decât baza globală .com. Diferența este consistentă între statele membre UE (nicio țară singulară nu conduce media) și consistentă între industrii (.de știri la 88%, .de SaaS la ~12%, .de e-commerce la ~25% — toate peste corespondentele globale).

Am găsit 275 de fișiere robots.txt în top-10k care citează explicit Directiva 2019/790 în comentarii — aproximativ 3,8% din eșantionul parseabil. Cohorta este dominată de publisherii UE, dar se extinde și în afara lor: câteva branduri de știri din SUA (notabil NYT, care citează direct „Art. 4 of the EU Directive”), unele site-uri britanice și câțiva mari retaileri europeni reproduc limbajul juridic. 87 de fișiere menționează „TDM” sau „text and data mining” pe nume. 460 de fișiere conțin o formă de limbaj de rezervare a drepturilor de autor („opts out expressly”, „all rights reserved”, „no commercial use”, „no machine learning”), chiar dacă nu citează un statut anume.

Două observații mai fine din această secțiune:

Efectul UE nu este doar în știri. Dacă ținem constantă presa, site-urile non-news din UE blochează AI tot la rate mai mari decât cele non-news din afara UE (aproximativ 28% vs 14%). O parte mică, dar reală, din SaaS-ul UE, e-commerce-ul și academia au interiorizat cadrul Articolului 4 pentru propriile sectoare.

Limbajul cu aromă UE devine un șablon de facto chiar și în afara UE. Șablonul robots.txt administrat de Cloudflare — adoptat global — citează explicit „ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790” în textul lui standard. Un site din SUA care activează opțiunea Cloudflare „Block AI Bots” afirmă, fără să știe neapărat, o rezervare de drepturi statutară de tip UE. Acesta este unul dintre cele mai interesante artefacte de drift politic pe care le-am găsit: un concept juridic european devine globalizat prin interfața unui produs al unui furnizor de infrastructură din SUA.


Concluzia 8 — Șabloane și origini de șabloane

Împărțirea după origine a șablonului pentru cele 6.638 de site-uri care au returnat un robots.txt parseabil:

robots-txt-ai-bot-analysis.webp

ȘablonSite-uriPondere
Niciun bot AI menționat (implicit Shopify-style, Yoast, scris manual fără a lua în calcul AI)5.02475,7%
Reguli AI personalizate / DIY1.18317,8%
Cloudflare Managed (Content-Signal: search=yes,ai-train=no)3024,5%
Allow: / explicit pentru GPTBot1241,9%
Default Squarespace (28 UA-uri AI în blocul cu restricție pe cale)50,1%

Regulile DIY domină cu 17,8%. Cohorta blocatorilor scriși intern este condusă de toate platformele de social media (facebook.com, twitter.com, linkedin.com, whatsapp.com, tiktok.com, snapchat.com, pinterest.com, x.com, chatgpt.com chiar), cele mai mari destinații e-commerce (amazon.com, amazonvideo.com), brandurile mari de știri (nytimes.com, cnn.com, bbc.com, theguardian.com, forbes.com, reuters.com, bbc.co.uk, t-online.de, weather.com), platformele cheie de streaming/media (netflix.com, vimeo.com, soundcloud.com, imdb.com) și o coadă lungă de site-uri de servicii profesionale (canva.com, medium.com).

Cloudflare Managed se situează la 4,5% — mult peste penetrarea aceluiași șablon la capul curbei și mai jos decât penetrarea lui în coada lungă din afara ferestrei acestui raport. Șablonul este adoptat cel mai mult în segmentul rank 1001–10.000 (4–5%) și este practic absent în vârful curbei (Top 100: 1 site îl folosește; Top 101–1000: 5 site-uri). Proprietățile globale mari își scriu singure regulile; coada lungă folosește comutatorul.

Câteva site-uri Cloudflare Managed notabile. cloudflare.com rulează chiar el șablonul — ceea ce este coerent (Cloudflare își folosește propriul produs pe propriul domeniu). theatlantic.com rulează șablonul — singurul brand major de presă din SUA pe care l-am găsit fără regulă personalizată. spankbang.com rulează șablonul — site-ul adult cel mai bine clasat care a adoptat un bloc AI injectat de Cloudflare. linktr.ee rulează șablonul, blocând antrenarea AI pentru întreaga economie de creatori găzduită pe Linktree printr-o singură decizie de vendor. launchpad.net, nexusmods.com, vinted.fr, cookielaw.org, rustdesk.com și o listă lungă de proprietăți media mai mici completează cohorta Cloudflare Managed vizibilă.

Modelul de adopție Cloudflare este cea mai concretă dovadă pe care am văzut-o că o mare parte din „politica AI a webului” este decisă de furnizori de infrastructură. Ponderea absolută este mică (4,5%), dar structural este importantă: șablonul este cel implicit livrat de Cloudflare, iar traiectoria „activ implicit” pentru următoarele 12 luni este ascendentă. Dacă Cloudflare mută comutatorul pe implicit-on pentru conturile noi, rata globală de blocare crește material fără ca vreun editor să ia o decizie.

Default-ul Squarespace (5 site-uri în top-10k, dar o cohortă mult mai mare în afara eșantionului nostru) este un alt model: Squarespace livrează un robots.txt care numește 28 de boturi AI într-un singur bloc, dar aceste boturi moștenesc restricțiile de cale ale User-agent: * în loc să primească o interdicție la nivel de site. Crawlerii AI pot prelua /, pagina principală, paginile de produs, blogul. Doar că nu pot prelua /config sau /account. Am semnalat anterior acest lucru ca sursă de citiri fals-pozitive de tip „AI block” în scanările terțe ale site-urilor Squarespace; aceeași rezervă se aplică și aici.


Concluzia 9 — Politica AI este uniformă pe distribuția de rang

Intuiția clasică pentru un astfel de studiu este că cele mai vizitate site-uri ar avea cea mai agresivă politică AI — au cel mai mult de pierdut din înlocuirea prin antrenare, cea mai multă capacitate juridică, cea mai multă atenție publică. Datele nu susțin această intuiție.

Coș de rangnOrice blocare AIExplicitCloudflare Managed
Top 1006722,4%17,9%1 site
Top 101–1.00059822,9%19,2%5 site-uri
Top 1.001–5.0002.81019,0%15,3%99 site-uri
Top 5.001–10.0003.77320,8%17,8%197 site-uri

Cele patru coșuri stau între 19% și 23%. Top 100 nu este mai agresiv decât coada lungă de la rangurile 5001–10.000. Rata principală pare să fie o proprietate a webului public în 2026, nu un semnal despre cât de mare sau de important este un site individual.

Există doi factori care contribuie. În primul rând, capătul curbei este dominat de domenii de infrastructură / SaaS / căutare / portal (Microsoft, Apple, Google etc.) care, în sine, au rate reduse de blocare AI. În al doilea rând, coada lungă include o pondere mare de publisheri regionali de știri și site-uri aflate în jurisdicția UE care — așa cum au arătat Concluziile 6 și 7 — blochează AI mai agresiv decât media globală. Cele două efecte se anulează aproximativ, iar rezultatul net este un titlu uniform.

Coloana Cloudflare Managed se deplasează însă de-a lungul curbei. Top 1000 are 6 site-uri Cloudflare-managed (1,0%); Top 1001–10.000 are 296 (5,7%). Site-urile mari își scriu singure regulile; coada lungă folosește comutatorul vendorului. Acesta este singurul semnal semnificativ dependent de rang din setul de date și sugerează că pe măsură ce cobori pe curba traficului de la vârful webului spre coada lungă, ponderea politicii AI setate de vendor, nu de editor, crește constant. Ne așteptăm ca acest gradient să continue și dincolo de top 10k, spre top 100k și mai departe.


Concluzia 10 — Cinci anatomii: cum arată robots.txt când chiar este o politică

Cifrele descriu forma setului de date; caracterul real al „politicii AI pe webul public” se vede cel mai bine când citești fișiere specifice. Iată cinci care merită atenție, alese să acopere spațiul politicii.

Anatomia 1 — The New York Times (nytimes.com)

Primele 14 linii din nytimes.com/robots.txt:

# New York Times content is made available for your personal, non-commercial
# use subject to our Terms of Service here:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# Use of any device, tool, or process designed to data mine or scrape the content
# using automated means is prohibited without prior written permission from
# The New York Times Company. Prohibited uses include but are not limited to:
# (1) text and data mining activities under Art
Shuai Guan
Shuai Guan
CEO la Thunderbit | Expert în automatizarea datelor cu AI Shuai Guan este CEO-ul Thunderbit și absolvent al University of Michigan, specializarea Engineering. Cu aproape un deceniu de experiență în tehnologie și arhitecturi SaaS, se concentrează pe transformarea modelelor AI complexe în instrumente practice de extragere a datelor, fără cod. Pe acest blog, împărtășește idei directe, testate în practică, despre web scraping și strategii de automatizare, pentru a te ajuta să construiești fluxuri de lucru mai inteligente, bazate pe date. Când nu optimizează fluxurile de lucru pentru date, aplică aceeași atenție la detalii și pasiunii sale pentru fotografie.
Cuprins

Extrage o pagină web doar cerând

Spune ce ai nevoie în engleză simplă. Sau, și mai bine, nu spune nimic.

Încearcă Thunderbit gratuit
Extrage date folosind AI
Transferă ușor date în Google Sheets, Airtable sau Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week