Ringkasan eksekutif
Kami menarik file robots.txt dari setiap domain dalam daftar Tranco top 10.000 situs dengan trafik tertinggi di dunia. Lalu, kami mem-parse setiap file dengan parser yang patuh pada RFC 9309, mengelompokkan file berdasarkan kebijakan bot AI apa pun yang diadopsi situs, dan menghitung berapa banyak situs yang paling sering dikunjungi di dunia yang benar-benar mencoba memblokir ChatGPT, Claude, Perplexity, Gemini, Common Crawl, Bytespider, Apple Intelligence, dan crawler lain yang melatih serta menjalankan model bahasa besar pada 2026.
Angka utamanya, dari sampel 7.248 situs yang robots.txt-nya bisa kami baca dengan bersih:

20,3% dari 10.000 situs teratas di dunia memblokir setidaknya satu AI crawler. 17,0% memiliki aturan eksplisit khusus AI yang ditulis dengan sengaja. Sisanya, 80%, membiarkan AI crawler selamat datang seperti Googlebot.
Enam temuan yang mengubah arah cerita:
- Organisasi berita berada di angka 47% pemblokiran — tertinggi di antara semua sektor. Berita Jerman memimpin dengan 88%, Prancis 80%, Rusia 0%. Yang paling menentukan bukan teknologi atau ekonomi industri, melainkan rezim hukum.
CCBot(Common Crawl) adalah bot yang paling sering diblokir, 16,3% — di atasGPTBot(15,8%) danBytespider(14,9%). Penerbit menarget corpus pelatihan, bukan merek model. Aturan selektif yang paling banyak diadopsi adalah “blokirCCBot, izinkanGooglebot” (14,1% situs).- Prancis memimpin semua negara dengan 50,6% pemblokiran AI di situs
.fr; klaster Uni Eropa 16 poin di atas baseline global. Sebanyak 275 filerobots.txtsecara eksplisit menyebut Direktif EU 2019/790. Pasal 4 adalah satu-satunya rezim hukum yang tampak benar-benar menggerakkan angka. - 17,8% menulis aturan AI sendiri; 4,5% menjalankan template vendor Cloudflare; 75,7% diam. Situs besar menulis sendiri; ekor panjang memakai toggle. The Atlantic dan
cloudflare.comsendiri ada di daftar Cloudflare Managed. - 108 situs secara eksplisit Allow
GPTBot— WordPress.org, Kaspersky, Norton, Avast, Sophos, The Verge, The Atlantic, NBA.com, The Sun, Branch.io. Keamanan dan tooling pengembang sangat menonjol. - Kebijakan AI tidak makin agresif di puncak kurva. Top 100, 101–1000, 1001–5000, 5001–10000 semuanya berada di kisaran 19%–23%. Angka utama ini adalah ciri web publik pada 2026, bukan sinyal seberapa besar situs individual tertentu.
Kisahnya bukan lagi soal apakah web “melawan balik”. Yang penting adalah industri mana, negara mana, rezim hukum mana, dan vendor AI mana yang menjadi target kebijakan aktif — dan mana yang tidak.
I. Latar belakang: bagaimana robots.txt menjadi artefak kebijakan AI
Tiga kekuatan telah mengubah makna robots.txt sejak OpenAI meluncurkan GPTBot pada Agustus 2023.
Vendor AI berkembang pesat. Muncul Google-Extended dari Google, ClaudeBot dari Anthropic, Bytespider dari ByteDance, Applebot-Extended dari Apple, Amazonbot dari Amazon, Meta-ExternalAgent dari Meta, dan lainnya. CCBot milik Common Crawl yang sudah ada sebelumnya menjadi target pemblokiran paling berdampak karena arsipnya memasok sebagian besar model open-weight. Bot non-vendor juga bermunculan: AI2Bot, cohere-ai, PerplexityBot, YouBot, DuckAssistBot, Diffbot, Omgili. Daftar pemblokiran komprehensif pada 2026 berisi sekitar 25 nama.
Pasal 4 dari Direktif Hak Cipta EU 2019/790 menciptakan pengecualian text-and-data-mining yang tidak berlaku jika pemegang hak “secara tegas telah mencadangkan” hak mereka dengan cara yang “bisa dibaca mesin”. Sepanjang 2024–2025, penerbit EU dan pengacaranya sepakat memakai robots.txt sebagai cara kanonik untuk menyatakan cadangan itu. Dataset kami menunjukkan 275 situs secara eksplisit menyebut Direktif 2019/790 dan 87 menyebut “TDM” — terkonsentrasi pada situs berita Eropa, tempat itu menjadi preambel hukum 4–8 baris.
Cloudflare memproduktkan toggle tersebut. Pada 2024–2025 Cloudflare merilis dashboard “AI Audit”, toggle “Block AI Bots”, dan template robots.txt Managed dengan kosakata Content-Signal: search=yes,ai-train=no plus boilerplate EU 2019/790. Pada Mei 2026, template itu dipakai oleh 4,5% dari top 10k yang bisa diparse. Roadmap Cloudflare secara publik membahas menjadikan toggle itu aktif secara default untuk akun baru — yang akan menggeser tingkat blok global 5–8 poin tanpa keputusan dari penerbit mana pun.
robots.txt pada 2026 bukan lagi file konfigurasi tak menarik seperti pada 2022. Ia adalah mekanisme cadangan hak cipta dengan dukungan traktat di EU, artefak kebijakan yang dibentuk vendor di ekor panjang, dan garis depan negosiasi yang bergerak lambat antara pengelola situs dan pembangun model.
II. Metodologi
Kami mencoba membuatnya sesederhana dan sekonsisten mungkin. Seluruh pipeline (skrip Python, CSV hasil parsing, arsip mentah robots.txt, grafik) dipublikasikan bersama laporan ini.
Sampel
Kami mulai dari daftar Tranco per Mei 2026, diunduh sebagai top-1m.csv.zip, lalu mengambil 10.000 baris pertama. Tranco menggabungkan empat ranking hulu (Cisco Umbrella, Majestic, Farsight, dan Cloudflare Radar), memfilter stabilitas selama jendela 30 hari, dan menghapus noise crawler/CDN yang jelas. Daftar yang dihasilkannya adalah yang paling dekat dengan “top-10k trafik web global” kanonik yang tersedia secara terbuka, dan menjadi sampel standar untuk riset web akademik (dipakai dalam 600+ paper peer-reviewed sejak diluncurkan KU Leuven pada 2018).
Daftar tersebut berisi campuran (a) situs utama yang dikunjungi orang, (b) domain infrastruktur / API / DNS / CDN yang tidak menyajikan /, dan (c) domain yang dipakai internal oleh platform besar (mis. gvt1.com, apple-dns.net, googleusercontent.com). Alih-alih memfilter terlebih dahulu, kami mempertahankan semuanya dan menandainya dengan kategori infrastructure di lapisan analisis. Domain-domain itu secara alami akan keluar ketika kami membatasi ke “situs yang mengembalikan robots.txt yang bisa diparse.”
Pengambilan data
Untuk setiap 10.000 domain, kami menjalankan GET /robots.txt asinkron via HTTPS, dengan fallback ke HTTP, redirect diikuti hingga empat hop, total timeout 12 detik, batas body 500 KB, dan string User-Agent browser nyata dengan Accept-Language: en-US. Konkruensi dijaga di 80 request aktif. Pekerjaan ini dijalankan dari satu IP residensial di San Francisco.
Hasil pengambilan:
| Status | Jumlah | Interpretasi |
|---|---|---|
200 OK | 6.638 | Body robots.txt tersedia dan bisa diparse. |
404 Not Found | 610 | Tidak ada robots.txt. RFC 9309 mendefinisikan ini sebagai “izinkan semuanya” secara implisit. |
403 Forbidden | 563 | Origin secara aktif menolak request robots.txt. Dikeluarkan dari analisis. |
429 Too Many Requests | 7 | Hampir tidak ada throttling di level CDN pada tier ranking ini. |
fetch_failed (error TLS / DNS / TCP) | 2.065 | Mayoritas domain apex CDN (akamai.net, cloudfront.net, fastly.net, gtld-servers.net, apple-dns.net) yang tidak menjalankan webserver di /. Bukan “diblokir” — mereka memang tidak punya robots.txt untuk disajikan. |
| Lain-lain 4xx/5xx | 117 | Campuran — error server, geofencing, respons tidak valid. |
Ini memberi kami 7.248 situs dalam sampel yang bisa dianalisis (6.638 200 + 610 404). Sebanyak 2.065 fetch_failed adalah domain nyata, tetapi itu adalah titik apex CDN/DNS, bukan situs yang dikunjungi orang, dan memperlakukan mereka seolah punya “kebijakan AI” tidak masuk akal. Mereka tetap ada dalam dataset sebagai statistik aksesibilitas terpisah.
Parsing
Setiap body 200 diparse dengan protego, implementasi Python untuk RFC 9309 yang dipakai di produksi oleh Scrapy. Untuk setiap pasangan (situs, bot) kami menghitung tiga hal:
can_fetch_root— apakah bot boleh mengambil/, dengan semantik group-of-records standar, prioritas aturan longest-match, dan overrideUser-agent: *oleh blok bot spesifik ketika keduanya ada.has_specific_rule— apakah file memuat barisUser-agent:yang menyebut bot ini secara tepat (case-insensitive).disallow_count— berapa banyak direktifDisallow:ada di blok yang cocok, dipakai untuk membedakan larangan seluruh situs dari pembatasan tingkat path.
Kombinasi ini penting karena angka “tingkat blok” di garis besar menyembunyikan dua fenomena yang sangat berbeda: merek yang sengaja menulis User-agent: GPTBot \n Disallow: / karena memang ingin menolak, dan merek yang blok generiknya User-agent: * \n Disallow: / (dibuat bertahun-tahun lalu untuk staging atau maintenance) kebetulan juga melarang semua bot AI yang belum ada saat aturan itu ditulis. Sepanjang laporan ini, angka “blok AI apa pun” mencakup keduanya; angka “blok AI eksplisit” adalah subset yang memang disengaja.
Bot dalam cakupan
Kami melacak 25 bot, dikelompokkan ke tiga kategori:
- Crawler pelatihan AI (16):
GPTBot,ClaudeBot,anthropic-ai,CCBot,Google-Extended,Meta-ExternalAgent,Bytespider,Applebot-Extended,Diffbot,Amazonbot,ImagesiftBot,FacebookBot,cohere-ai,AI2Bot,Omgili,Omgilibot. - Bot inferensi / pengambilan langsung AI (7):
PerplexityBot,Perplexity-User,ChatGPT-User,OAI-SearchBot,ClaudeBot(yang melayani pelatihan dan inferensi),YouBot,DuckAssistBot. - Baseline pencarian (6):
Googlebot,Bingbot,DuckDuckBot,Slurp(Yahoo),Baiduspider,YandexBot.
Beberapa bot berada di garis batas antara pelatihan dan inferensi. ClaudeBot adalah yang paling menonjol — Anthropic menghentikan UA anthropic-ai yang lebih lama pada 2024 dan kini memakai ClaudeBot untuk pelatihan sekaligus pengambilan langsung, jadi aturan Disallow: ClaudeBot tidak lagi secara bersih berarti “blokir pelatihan tapi tetap izinkan visibilitas.” Kami membiarkan pembagiannya seperti adanya dan menjelaskan konsekuensinya nanti.
Klasifikasi industri
Kami mengklasifikasikan setiap domain ke dalam salah satu dari 16 bucket industri (news, social, streaming, ecommerce, search, finance, infrastructure, saas, academia, dev, gov, adult, gambling, travel, telecom, unknown) dengan pendekatan berlapis:
- Kamus domain yang sudah dikenal — peta kurasi manual ~500 domain trafik tinggi ke industri.
- Pola TLD / suffix —
.gov→gov,.edudan.ac.*→academia, suffix CDN yang dikenali →infrastructure. - Kata kunci nama domain — news, post, shop, bank, porn, casino dan sejenisnya sebagai sinyal cadangan.
- Scrape homepage — untuk situs yang tidak dapat diklasifikasikan oleh tiga lapisan pertama dan mengembalikan
robots.txt200, kami mengambil HTML homepage, mengekstrak<title>,<meta name="description">,<meta property="og:type">, lalu menjalankan penilaian kata kunci terhadap petunjuk kategori gaya model bahasa.
Hasilnya, 3.407 situs (34%) mendapat tag industri yang meyakinkan dan 6.593 sisanya unknown. Bucket unknown didominasi portal regional non-Inggris, situs brand .com korporat yang tidak cocok ke bucket tunggal, dan penerbit pasar bahasa kecil yang tidak kami miliki entri kamusnya. Jika laporan ini mengutip persentase per industri, penyebutnya adalah sampel yang terklasifikasi untuk industri itu, bukan seluruh 10.000.
III. Temuan
Temuan 1 — Satu dari lima situs bertrafik tinggi memblokir setidaknya satu bot AI
Dari 7.248 situs yang bisa dianalisis, 1.472 (20,31%) memblokir setidaknya satu bot AI. 1.230 (16,97%) memiliki aturan AI yang disengaja. Baseline Googlebot adalah 2,18% (158 situs — sebagian besar memblokir semuanya sebagai default maintenance atau, dalam tiga kasus, adalah mesin pencari yang memblokir kompetitor).
Angka utama 20% itu 9× baseline Googlebot. Itu sinyal yang nyata — situs bertrafik tinggi jauh lebih mungkin memblokir crawler AI dibanding crawler pencarian — tetapi juga jauh lebih kecil daripada narasi “pemblokiran AI sedang menuju adopsi universal” yang beredar di pers sejak 2024. Bahkan pada 10.000 situs paling sering dikunjungi di web, mayoritas 5 dari 6 tetap diam soal AI.
Selisih antara “blok AI apa pun” (20,3%) dan “blok AI eksplisit” (17,0%) kecil secara absolut tetapi penting secara konseptual. Selisih 3,3 poin itu adalah porsi situs yang memblokir bot AI hanya karena aturan lama User-agent: * \n Disallow: / menangkap semuanya yang lewat, termasuk bot yang belum ada ketika aturan itu ditulis. Angka 17,0% yang disengaja adalah bacaan yang lebih bersih untuk pertanyaan “berapa banyak situs terbesar di dunia yang telah membuat keputusan spesifik soal AI.”
Dibandingkan literatur sebelumnya:
| Sumber | Tanggal | Sampel | Tingkat blok |
|---|---|---|---|
| Originality.ai | Mar 2025 | 1.000 berita paling populer (Inggris) | 35,7% memblokir GPTBot |
| Palewire | Agu 2024 | 1.500 organisasi berita | 36,0% crawler AI apa pun |
| Reuters Institute | Musim semi 2025 | 50 brand berita terkemuka, 10 negara | 78% crawler AI apa pun |
| WIRED / NYT | Akhir 2023 | Top 50 berita AS | 26% memblokir GPTBot |
| Laporan ini (Thunderbit) | Mei 2026 | Tranco top 10.000 (semua sektor) | 20,3% / 17,0% eksplisit |
Angka eksplisit kami 17,0% lebih rendah dari semua studi khusus berita karena dua pertiga sampel kami bukan berita. Jika dibatasi ke 650 situs berita, kami mendapat 47% — berada dalam band yang sama dengan studi sebelumnya setelah komposisi sampel diperhitungkan. Gambaran strukturalnya konsisten: kelompok berita memblokir AI pada laju 3–4× dibanding sisa web.
Temuan 2 — Kajian mendalam industri: rentang 12× dari berita ke telecom
Temuan yang paling sering dikutip dalam dua tahun liputan “AI scraping” adalah angka 80% outlet berita memblokir GPTBot dari Originality.ai dan Palewire. Potongan kami menghasilkan angka yang lebih kecil tetapi tetap khas: 47,2% situs berita di top 10.000 memblokir setidaknya satu bot AI, dengan 45,2% menulis aturan AI eksplisit.
Namun, “berita vs sisanya” terlalu kasar. Rincian lengkapnya (industri dengan n ≥ 10 dalam sampel) memberi cerita yang jauh lebih kaya:

| Industri | n | Blok AI apa pun | Eksplisit | Googlebot diblokir | Aturan DIY | Cloudflare Managed | Diam |
|---|---|---|---|---|---|---|---|
| Berita | 650 | 47,2% | 45,2% | 1,5% | 46,9% | 1,5% | 48,5% |
| Travel | 64 | 29,7% | 29,7% | 0,0% | 35,9% | 3,1% | 54,7% |
| Sosial | 65 | 29,2% | 23,1% | 4,6% | 23,1% | 6,2% | 66,2% |
| Streaming | 440 | 20,0% | 17,7% | 0,7% | 16,8% | 3,6% | 75,5% |
| Keuangan | 129 | 19,4% | 12,4% | 0,8% | 14,7% | 2,3% | 75,2% |
| E-commerce | 224 | 18,3% | 17,4% | 0,4% | 24,1% | 1,3% | 66,1% |
| Dewasa | 254 | 17,3% | 14,6% | 0,4% | 10,2% | 7,9% | 79,5% |
| Pencarian | 12 | 16,7% | 0,0% | 0,0% | 0,0% | 0,0% | 100,0% |
| Akademia | 268 | 14,6% | 13,8% | 0,4% | 13,4% | 3,4% | 77,2% |
| Perjudian | 100 | 14,0% | 13,0% | 0,0% | 18,0% | 4,0% | 77,0% |
| Tool pengembang | 129 | 10,1% | 7,8% | 0,0% | 8,5% | 5,4% | 77,5% |
| SaaS | 369 | 7,6% | 6,2% | 0,3% | 9,5% | 0,8% | 87,5% |
| Pemerintah | 172 | 5,2% | 3,5% | 0,0% | 4,1% | 0,6% | 83,1% |
| Infrastruktur | 47 | 4,3% | 0,0% | 0,0% | 4,3% | 2,1% | 72,3% |
| Telecom | 33 | 3,0% | 3,0% | 0,0% | 12,1% | 0,0% | 78,8% |
Rentang 12× antara berita dan telecom adalah alasan mengapa “kebijakan AI web” bukan unit analisis yang tepat. Bukan satu angka; ada angka sektoral yang berbeda hingga satu orde magnitudo. Di bawah ini kami bahas empat temuan paling khas.
Berita: 47% memblokir, 47% DIY. Berita adalah kelompok yang menulis playbook-nya. Cloudflare Managed hanya 1,5% di berita — para penerbit ini tidak menyerahkan aturan. Teksnya sangat kaya: NYT membuka dengan preambel hukum 14 baris yang mengutip “Art. 4 of the EU Directive”; BBC dengan “Please use our site like a human, not a robot... TL;DR: Browse, read, watch, enjoy — like a human.”; The Sun dengan “The Sun does not permit the unlicensed use of our content for large language models.” Ini robots.txt sebagai pernyataan kebijakan, bukan konfigurasi.
Travel di 30% — kejutan. Booking, Expedia, TripAdvisor, Kayak, dan maskapai besar memblokir pada sekitar dua pertiga laju berita. Pola selektifnya konsisten: blocker travel rata-rata melarang 5–7 UA pelatihan tetapi membiarkan UA inferensi (PerplexityBot, ChatGPT-User, OAI-SearchBot) tidak tersentuh. Data harga dan ulasan agregat adalah moat; sitasi kembali ke situs adalah upside. Ini pola “training keluar, inferensi masuk” yang paling bersih di industri mana pun.
Dewasa 17% — juga mengejutkan. Sampel yang lebih kecil sebelumnya menunjukkan 0%. Data full-sample memperlihatkan 1 dari 6 situs dewasa melarang setidaknya satu bot AI, dengan tingkat Cloudflare Managed tertinggi di semua sektor (7,9%). Lebih dari setengah blok AI situs dewasa berasal dari toggle Cloudflare, bukan keputusan penerbit. Pelatihan generasi gambar adalah ancaman implisit — model kelas StableDiffusion belajar gaya visual lebih cepat daripada model teks belajar gaya menulis.
SaaS 7,6% itu kontraintuitif. Vendor software adalah segmen paling vokal dalam diskursus kebijakan AI, tetapi robots.txt mereka justru sangat terbuka. Bacaan yang tepat: tim marketing SaaS sudah benar mengidentifikasi pencarian AI sebagai saluran distribusi. Vendor yang benar-benar memikirkannya justru opt in, bukan opt out — daftar eksplisit Allow-GPTBot (Temuan 12) didominasi SaaS keamanan dan tooling pengembang.
Pemerintah 5,2%, telecom 3,0%, infrastruktur 4,3%, dev 10,1%. Kewajiban catatan publik membuat Disallow: / secara hukum riskan untuk .gov. Situs pemasaran telecom ingin mudah ditemukan. Domain apex CDN tidak punya apa pun yang perlu dilindungi. Tool pengembang justru opt in (kontennya bernilai ketika LLM mengutipnya).
Intinya: tidak ada satu angka “web memblokir/tidak memblokir AI” yang tidak lebih banyak menyesatkan daripada menjelaskan. Pelaporan tingkat sektor adalah satu-satunya cara jujur untuk membahas data.
Temuan 3 — Per vendor AI: siapa yang paling sering diblokir?
Pemisahan data yang lain adalah berdasarkan perusahaan AI, bukan bot. Beberapa vendor menjalankan beberapa bot (OpenAI menjalankan tiga: GPTBot, ChatGPT-User, OAI-SearchBot; Anthropic dua: ClaudeBot, anthropic-ai; Meta dua: Meta-ExternalAgent, FacebookBot). Agregasi di level vendor adalah pendekatan paling dekat untuk menjawab pertanyaan “apa pandangan web publik terhadap tiap perusahaan AI?”
| Vendor AI | Bot yang diagregasi | Situs yang memblokir ≥ 1 bot | % dari yang bisa dianalisis |
|---|---|---|---|
| Common Crawl | CCBot | 1.178 | 16,25% |
| OpenAI | GPTBot, ChatGPT-User, OAI-SearchBot | 1.172 | 16,17% |
| Anthropic | ClaudeBot, anthropic-ai | 1.111 | 15,33% |
| ByteDance | Bytespider | 1.082 | 14,93% |
| Meta | Meta-ExternalAgent, FacebookBot | 989 | 13,65% |
Google-Extended | 970 | 13,38% | |
| Amazon | Amazonbot | 877 | 12,10% |
| Apple | Applebot-Extended | 859 | 11,85% |
| Webz.io (Omgili) | Omgili, Omgilibot | 731 | 10,09% |
| Cohere | cohere-ai | 717 | 9,89% |
| Perplexity | PerplexityBot, Perplexity-User | 715 | 9,86% |
| Diffbot | Diffbot | 684 | 9,44% |
| You.com | YouBot | 563 | 7,77% |
| AI2 (Allen AI) | AI2Bot | 487 | 6,72% |
| DuckDuckGo | DuckAssistBot | 482 | 6,65% |
Common Crawl adalah entitas paling sering ditargetkan meski ia arsip web nirlaba, bukan operator LLM. Alasannya adalah leverage: CCBot memasok hampir semua model open-weight dan porsi besar model tertutup. Memblokir CCBot lebih dulu adalah aturan dengan cakupan tertinggi yang bisa ditulis penerbit.
OpenAI, Anthropic, ByteDance berada di kisaran 14–16%. Keunggulan OpenAI sebagian adalah artefak hitung (tiga bot OpenAI vs satu bot ByteDance). Perilaku Bytespider 14,9% adalah efek “Bytespider” — bot ini telah didokumentasikan mengabaikan robots.txt sejak 2024, dan penerbit memblokirnya sebagai sinyal publik, bukan karena takut pada TikTok.
Meta, Google, Amazon, Apple di 12–14% adalah tier kedua — ditulis defensif, bukan sebagai pernyataan posisi. Vendor kecil (Webz.io, Cohere, Perplexity, Diffbot, You.com, AI2, DuckDuckGo) di 6–10% sebagian besar terdorong oleh lantai serba-guna 3,8%; aturan eksplisit untuk mereka berada di kisaran 1–4%.
xAI (Grok), Mistral, dan sebagian besar lab model Eropa/China tidak muncul di tabel — mereka belum mempublikasikan UA crawler pelatihan yang terdokumentasi. Ekosistem robots.txt saat ini adalah dialog antara vendor AS/China yang merilis UA dan penerbit AS/EU yang menulis aturan; vendor yang tidak merilisnya tidak terlihat dalam negosiasi.
Temuan 4 — CCBot adalah petir penangkal baru, bukan GPTBot
Urutan bot pada top-10k terlihat seperti ini:

| Peringkat | Bot | Tingkat blok | Tingkat aturan eksplisit |
|---|---|---|---|
| 1 | CCBot (Common Crawl) | 16,25% | 12,90% |
| 2 | GPTBot (OpenAI) | 15,84% | 12,72% |
| 3 | Bytespider (ByteDance) | 14,93% | 11,35% |
| 4 | ClaudeBot (Anthropic) | 14,51% | 11,13% |
| 5 | Google-Extended | 13,38% | 10,18% |
| 6 | Meta-ExternalAgent | 12,38% | 8,95% |
| 7 | Amazonbot | 12,10% | 8,66% |
| 8 | Applebot-Extended | 11,85% | 8,72% |
| 9 | Omgilibot | 10,09% | 5,31% |
| 10 | anthropic-ai (deprecated) | 9,99% | 6,55% |
| 11 | cohere-ai | 9,89% | 6,42% |
| 12 | PerplexityBot | 9,69% | 6,40% |
| 13 | Diffbot | 9,44% | 5,95% |
| 14 | ChatGPT-User (inferensi) | 8,90% | 5,73% |
| 15 | YouBot (inferensi) | 7,77% | 4,29% |
| 16 | OAI-SearchBot (inferensi) | 6,83% | 3,66% |
| baseline | Googlebot | 2,18% | — |
| baseline | Bingbot | 2,27% | — |
Cerita yang disampaikan tabel ini adalah bahwa bot yang pertama kali diblokir web publik bukan merek model — melainkan corpus-nya. Arsip 250 miliar halaman milik Common Crawl telah menjadi input pelatihan terbesar untuk GPT-3, GPT-4, Llama 1 / 2 / 3, Falcon, Mistral, BLOOM, dan sebagian besar model open-weight yang dirilis sejak 2020. Situs yang ingin opt out dari “masuk model frontier berikutnya” akan paling efisien dengan melarang CCBot lebih dulu — begitu Anda tidak ada di Common Crawl, Anda praktis dikeluarkan dari pipeline pelatihan open-source secara gratis. GPTBot dan ClaudeBot berada di posisi kedua dan ketiga karena mereka adalah front-end yang terlihat dari dua produk komersial tertentu; UA di level corpus adalah target struktural.
Bot AI berperingkat lebih rendah di tabel juga informatif. Omgilibot di 10% sangat tinggi untuk bot yang mungkin belum pernah didengar banyak pembaca — bot ini dijalankan Webz.io, broker data konten yang menjual arsip web ke operator LLM, dan sejumlah besar organisasi berita sudah mulai menyebutnya secara eksplisit di file mereka. AI2Bot di 6,7% (dan aturan Ai2Bot-Dolma terkait di situs Squarespace) menunjukkan komunitas LLM akademik juga mulai ditandai oleh penerbit yang belum tentu membedakan “crawler riset nirlaba” dari “crawler komersial.”
Klaster inferensi — ChatGPT-User, OAI-SearchBot, YouBot, Perplexity-User — berada 4–8 poin persentase di bawah klaster pelatihan. Selisih itu menjawab pertanyaan kebijakan yang sudah lama ada: ya, situs bertrafik tinggi membedakan bot yang mengumpulkan data untuk pelatihan model masa depan dan bot yang melakukan retrieval langsung untuk menjawab pertanyaan pengguna saat ini. Mereka tidak selalu membuat pembedaan itu (aturan serba-mencakup tidak), tetapi porsi yang bermakna menulis aturan yang secara spesifik menarget sisi pelatihan.
Temuan 5 — 14% memblokir CCBot sambil tetap mengizinkan Googlebot — pola “blok corpus, tetap buka pencarian”
Aturan selektif yang paling banyak diadopsi di top-10k:

| Pola aturan | Situs | % dari yang bisa dianalisis |
|---|---|---|
Blokir CCBot, izinkan Googlebot | 1.023 | 14,11% |
Blokir Bytespider, izinkan Googlebot | 926 | 12,78% |
Blokir Google-Extended, izinkan Googlebot | 816 | 11,26% |
Blokir GPTBot, izinkan OAI-SearchBot | 658 | 9,08% |
Blokir GPTBot, izinkan ChatGPT-User | 525 | 7,24% |
Blokir CCBot, izinkan PerplexityBot | 519 | 7,16% |
Blokir anthropic-ai, izinkan ClaudeBot | 59 | 0,81% |
Pola paling banyak diadopsi (14,1%) adalah “blokir Common Crawl, tetap jaga visibilitas pencarian Google.” Peringkat kedua (12,8%) adalah “blokir Bytespider, tetap jaga visibilitas pencarian Google” — yaitu memblokir crawler ByteDance yang bermasalah reputasi sambil membiarkan baseline pencarian sah tetap utuh. Peringkat ketiga (11,3%) adalah “blokir UA pelatihan AI milik Google sendiri sambil tetap mempertahankan UA pencarian Google”, yang memang persis pemisahan untuk Google-Extended: penerbit opt out dari pelatihan Bard / Gemini tanpa kehilangan ranking pencarian.
Ketiga angka ini bersama-sama menggambarkan posture kebijakan dominan di web top-10k: larang bot corpus pelatihan, biarkan bot pencarian dan inferensi tetap lewat. Pola minoritas “larang pelatihan tetapi izinkan UA retrieval langsung spesifik model LLM ini” — GPTBot ✗ / ChatGPT-User ✓ di 7,2% — memang ada, tetapi lebih kecil daripada pemotongan di level corpus.
Baris anthropic-ai / ClaudeBot di 0,81% mencerminkan penghentian UA Anthropic pada 2024: ClaudeBot kini melayani pelatihan dan inferensi sekaligus, sehingga ekspresi “blokir pelatihan, izinkan sitasi” yang dulu dimungkinkan UA anthropic-ai menjadi hilang. Ini adalah keputusan desain UA yang paling kurang dibahas dari 2024–2025 — keputusan itu menghapus satu kelas penuh ekspresi kebijakan dari robots.txt.
Temuan 6 — Berita secara detail: menurut negara dan bahasa
Ketika kami memotong kategori berita berdasarkan TLD kode-negara — perlu diingat, ini berarti .de untuk berita Jerman, .fr untuk berita Prancis, dan seterusnya, bukan bahasa yang dilayani — variasi di dalam berita lebih besar daripada variasi antara berita dan sisanya:

| Negara (khusus berita) | n | Blok AI apa pun | Eksplisit |
|---|---|---|---|
🇩🇪 Jerman (.de) | 25 | 88,0% | 88,0% |
🇫🇷 Prancis (.fr) | 15 | 80,0% | 80,0% |
🇬🇧 Britania Raya (.co.uk) | 15 | 66,7% | 53,3% |
🇪🇸 Spanyol (.es) | 5 | 60,0% | 60,0% |
🇮🇹 Italia (.it) | 13 | 53,8% | 53,8% |
Berita global (.com/.org/dll.) | 500 | 45,0% | 42,8% |
🇵🇱 Polandia (.pl) | 7 | 42,9% | 42,9% |
🇯🇵 Jepang (.jp) | 12 | 25,0% | 25,0% |
🇷🇺 Rusia (.ru) | 13 | 0,0% | 0,0% |
🇬🇷 Yunani (.gr) | 6 | 0,0% | 0,0% |
Berita Jerman adalah sub-segmen dengan pemblokiran tertinggi di seluruh dataset, 88%, dan itu 88% eksplisit — pada dasarnya tidak ada situs berita Jerman di top 10k yang membiarkan crawler pelatihan AI menjangkau arsipnya. Kelompok ini dipimpin Spiegel, Bild, Welt, Zeit, FAZ, Süddeutsche, Heise, Golem, Stern, Focus — seluruh establishment penerbitan arus utama Jerman, ditambah penerbit teknologi yang menulis aturan secara independen. Infrastruktur politik di bawahnya padat: VG Media, organisasi hak kolektif penerbit Jerman, adalah penggugat paling agresif dalam litigasi hak cipta AI EU, dan Pasal 4 Direktif EU diimplementasikan dalam hukum Jerman sebagai §44b UrhG dengan bahasa opt-out yang eksplisit dan bisa dibaca mesin. Ketika vendor AI datang, penerbit Jerman adalah kelompok nasional yang paling siap menerjemahkan posisi hukum itu ke aturan robots.txt.
Berita Prancis di 80% sedikit di bawahnya. Lingkungan hukum Prancis serupa (Direktif 2019/790 ditransposisikan ke hukum Prancis), dan perilaku kelompoknya juga serupa — lemonde.fr, lefigaro.fr, liberation.fr, lequipe.fr, 20minutes.fr, ouest-france.fr semuanya memblokir, dengan file Le Monde juga menyebut droit du producteur de base de données Prancis (Pasal L 342-1 Code de la propriété intellectuelle) sebagai dasar hukum domestik paralel. Prancis punya kerutan tambahan berupa putusan 2024 dari pengadilan komersial Paris yang menyatakan opt-out berbasis robots.txt sudah cukup sebagai pemberitahuan menurut Pasal 4; ini memberi dukungan yurisprudensi langsung yang belum dimiliki yurisdiksi lain.
Inggris di 67% lebih rendah, dan alasannya adalah beberapa penerbit besar Inggris (thesun.co.uk, dailymail.co.uk, mirror.co.uk) memakai blok deny-all User-agent: * alih-alih aturan spesifik AI, sehingga angka eksplisit turun ke 53%. Efek totalnya sama — situs-situs itu tidak mengizinkan crawling AI — tetapi kebijakannya diekspresikan sebagai “tidak ada bot kecuali daftar izin mesin pencari ini” alih-alih larangan bot AI yang disebut satu per satu. Kerangka hukumnya juga lebih lemah: pasca-Brexit, Inggris mewarisi logika Pasal 4 tetapi yurisprudensi domestik yang relevan lebih tipis.
Berita Rusia 0% adalah baris yang paling mengejutkan. Tiga belas situs berita domain Rusia dalam sampel (dzen.ru, rbc.ru, ria.ru, kommersant.ru, tass.ru, lenta.ru, gazeta.ru, interfax.ru, kp.ru, tass.com, dll.) — tidak satu pun memblokir crawler AI mana pun. Penjelasan yang mungkin: pelatihan LLM berbahasa Rusia didominasi model gaya GPT milik Yandex sendiri (yang memakai crawler internal Yandex, bukan Common Crawl), lingkungan hak cipta Rusia belum mengadopsi padanan Pasal 4, dan penerbit besar Rusia memandang LLM Barat sebagai isu yang tidak relevan (kontrol ekspor AS sudah membatasi layanan OpenAI/Anthropic di Rusia) sementara Yandex dipandang sebagai pemangku kepentingan domestik, bukan lawan. Postur kebijakannya memang berbeda secara mendasar.
Berita Jepang 25% menunjukkan pola ketiga. Jepang memiliki pengecualian text-and-data-mining eksplisit dalam hukum hak cipta domestik (Pasal 30-4 Copyright Act Jepang, diamendemen pada 2018) yang lebih permisif daripada Pasal 4 Direktif EU — memungkinkan TDM untuk tujuan “non-enjoyment”, termasuk pelatihan AI tanpa memerlukan persetujuan pemegang hak. Penerbit Jepang punya daya tawar opt-out yang lebih kecil dan angka robots.txt-nya pun lebih rendah. 25% yang memblokir kebanyakan adalah penerbit terbesar dan paling kosmopolitan (asahi.com, nikkei.com) yang diposisikan internasional, bukan domestik.
Data berita lintas negara adalah bukti paling bersih dalam laporan ini bahwa rezim hukum, bukan teknologi atau ekonomi industri, adalah pendorong utama pemblokiran AI. Kelompok berita EU berkisar 54%–88%; kelompok berita non-EU (Rusia, Jepang, klaster .com global) berkisar dari 0% hingga 45%. Puncak 88% berada di negara dengan implementasi Pasal 4 paling matang; lantai 0% berada di negara dengan hampir tidak ada hukum kebijakan AI sama sekali.
Temuan 7 — EU vs sisanya: selisih 16 poin
Jika kita naikkan lensa negara ke level yang lebih luas, pemisahan EU vs non-EU sangat tajam:
| Wilayah | n | Blok AI apa pun | Eksplisit |
|---|---|---|---|
ccTLD EU (.fr, .de, .es, .it, .nl, .pl, .se, .dk, .fi, .be, .at, .cz, .hu, .ro, .gr, .pt, .ie, .sk, .bg) | 617 | 35,2% | 33,9% |
ccTLD nasional non-EU (.uk, .jp, .kr, .cn, .ru, .br, .in, .au, .mx, .ca, .tr, .ar, .cl, .co, .pe) | 897 | 17,2% | 13,6% |
Global (.com, .net, .org, dll.) | 5.734 | 19,2% | 15,7% |
Situs ccTLD EU memblokir AI dua kali lipat dari klaster nasional non-EU dan hampir dua kali lipat dari baseline .com global. Perbedaan ini konsisten di seluruh negara anggota EU (tidak ada satu negara pun yang mendominasi rata-rata) dan konsisten lintas industri (.de berita 88%, .de SaaS ~12%, .de e-commerce ~25% — semuanya lebih tinggi daripada padanan globalnya).
Kami menemukan 275 file robots.txt di top-10k yang secara eksplisit mengutip Direktif 2019/790 dalam komentar mereka — sekitar 3,8% dari sampel yang bisa diparse. Kelompok ini didominasi penerbit EU tetapi melampauinya: beberapa brand berita AS (terutama NYT, yang mengutip “Art. 4 of the EU Directive” secara langsung), beberapa situs Inggris, dan beberapa destinasi e-commerce Eropa besar juga menyalin bahasa hukumnya. Sebanyak 87 file menyebut “TDM” atau “text and data mining” secara eksplisit. Ada 460 file yang mengandung semacam bahasa cadangan hak cipta (“expressly opts out,” “all rights reserved,” “no commercial use,” “no machine learning”) meski tidak menyebut statute tertentu.
Dua pengamatan yang lebih granular dari irisan ini:
Efek EU bukan hanya di berita. Jika kita menahan berita tetap konstan, situs non-berita EU masih memblokir AI pada tingkat lebih tinggi daripada situs non-berita non-EU (kira-kira 28% vs 14%). Sebagian kecil tetapi nyata dari SaaS, e-commerce, dan akademia EU telah menginternalisasi kerangka Pasal 4 untuk sektor mereka sendiri.
Bahasa beraroma EU sedang menjadi template de facto bahkan di luar EU. Template robots.txt Managed Cloudflare — yang diadopsi global — secara eksplisit mengutip “ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790” dalam boilerplate-nya. Situs AS yang menyalakan pengaturan “Block AI Bots” milik Cloudflare, tanpa harus menyadarinya, sedang menegaskan cadangan hak menurut statute EU. Ini salah satu artefak drift kebijakan paling menarik yang kami temukan: konsep hukum Eropa menjadi global lewat UI produk dari penyedia infrastruktur AS.
Temuan 8 — Template dan asal template
Rincian asal template dari 6.638 situs yang mengembalikan robots.txt yang bisa diparse:

| Template | Situs | Porsi |
|---|---|---|
| Tidak ada bot AI yang disebut (default gaya Shopify, Yoast, atau tulisan tangan tanpa pertimbangan AI) | 5.024 | 75,7% |
| Aturan AI kustom / DIY | 1.183 | 17,8% |
Cloudflare Managed (Content-Signal: search=yes,ai-train=no) | 302 | 4,5% |
Allow: / eksplisit untuk GPTBot | 124 | 1,9% |
| Default Squarespace (28 UA AI di blok yang dibatasi path) | 5 | 0,1% |
Aturan DIY mendominasi di 17,8%. Kelompok pemblokir yang ditulis sendiri dipimpin oleh semua platform media sosial (facebook.com, twitter.com, linkedin.com, whatsapp.com, tiktok.com, snapchat.com, pinterest.com, x.com, chatgpt.com itu sendiri), destinasi e-commerce terbesar (amazon.com, amazonvideo.com), brand berita utama (nytimes.com, cnn.com, bbc.com, theguardian.com, forbes.com, reuters.com, bbc.co.uk, t-online.de, weather.com), media / streaming utama (netflix.com, vimeo.com, soundcloud.com, imdb.com), dan ekor panjang situs jasa profesional (canva.com, medium.com).
Cloudflare Managed berada di 4,5% — jauh lebih tinggi dibanding penetrasi template yang sama di puncak kurva dan lebih rendah dibanding penetrasinya di ekor panjang di luar jendela laporan ini. Template ini paling banyak diadopsi pada segmen peringkat 1001–10.000 (4–5%) dan hampir tidak ada di puncak kurva (Top 100: 1 situs memakainya; Top 101–1000: 5 situs). Properti global besar menulis aturannya sendiri; ekor panjang memakai toggle.
Beberapa situs Cloudflare Managed yang menonjol. cloudflare.com sendiri menjalankan template ini — konsisten, Cloudflare memakai produknya sendiri di domainnya sendiri. theatlantic.com menjalankan template ini — satu-satunya brand berita besar AS yang kami temukan yang tidak menulis aturan kustom. spankbang.com menjalankan template ini — situs dewasa peringkat tertinggi yang mengadopsi blok AI yang disuntikkan Cloudflare. linktr.ee menjalankan template ini, memblokir pelatihan AI di seluruh ekonomi kreator yang di-host Linktree dengan satu keputusan vendor. launchpad.net, nexusmods.com, vinted.fr, cookielaw.org, rustdesk.com, dan daftar panjang properti media kecil melengkapi kelompok Cloudflare Managed yang terlihat.
Pola adopsi Cloudflare adalah bukti paling konkret yang kami lihat bahwa porsi besar dari “kebijakan AI web” sebenarnya diputuskan oleh penyedia infrastruktur. Porsinya memang kecil (4,5%) tetapi secara struktural penting: template itu adalah default yang dikirim Cloudflare, dan arah on-by-default untuk 12 bulan ke depan cenderung naik. Jika Cloudflare mengubah toggle menjadi default-on untuk akun baru, tingkat blok global akan bergerak signifikan tanpa keputusan dari penerbit individual.
Default Squarespace (5 situs di top-10k, tetapi jauh lebih besar di luar sampel kami) adalah pola berbeda: Squarespace mengirim robots.txt yang menyebut 28 bot AI dalam satu blok, tetapi bot-bot itu mewarisi pembatasan path dari User-agent: * alih-alih mendapat larangan seluruh situs. Crawler AI bisa mengambil /, homepage, halaman produk, blog. Mereka hanya tidak bisa mengambil /config atau /account. Kami sebelumnya menandai ini sebagai sumber pembacaan “blok AI” yang salah positif pada pemindaian pihak ketiga terhadap situs Squarespace; peringatan yang sama berlaku di sini.
Temuan 9 — Kebijakan AI seragam di seluruh distribusi peringkat
Intuisi umum untuk studi seperti ini adalah bahwa situs yang paling sering dikunjungi akan punya kebijakan AI paling agresif — mereka paling banyak rugi kalau pelatihan mengalihkan trafik, paling mampu secara legal, dan paling banyak diawasi publik. Data tidak mendukung intuisi itu.
| Kelompok peringkat | n | Blok AI apa pun | Eksplisit | Cloudflare Managed |
|---|---|---|---|---|
| Top 100 | 67 | 22,4% | 17,9% | 1 situs |
| Top 101–1.000 | 598 | 22,9% | 19,2% | 5 situs |
| Top 1.001–5.000 | 2.810 | 19,0% | 15,3% | 99 situs |
| Top 5.001–10.000 | 3.773 | 20,8% | 17,8% | 197 situs |
Empat bucket itu berada di kisaran 19%–23%. Top 100 tidak lebih agresif daripada ekor panjang peringkat 5.001–10.000. Angka utama tampaknya merupakan ciri web publik pada 2026, bukan sinyal seberapa besar atau seberapa menonjol suatu situs individual.
Ada dua faktor yang berkontribusi. Pertama, puncak kurva didominasi domain infrastruktur / SaaS / pencarian / portal (Microsoft, Apple, Google, dll.) yang memang punya tingkat blok AI rendah. Kedua, ekor panjang mencakup porsi tinggi penerbit berita regional dan situs yurisdiksi EU yang — seperti ditunjukkan Temuan 6 dan 7 — memblokir AI lebih agresif dari rata-rata global. Kedua efek itu kira-kira saling mengimbangi, sehingga hasil akhirnya menjadi angka utama yang seragam.
Kolom Cloudflare Managed memang bergeser di sepanjang kurva. Top 1000 punya 6 situs Cloudflare-managed (1,0%); Top 1001–10.000 punya 296 (5,7%). Situs besar menulis aturan sendiri; ekor panjang memakai toggle vendor. Inilah satu-satunya sinyal yang bermakna terkait peringkat dalam dataset, dan itu menyiratkan bahwa seiring Anda turun dari puncak web ke ekor panjang, porsi kebijakan AI yang ditetapkan vendor — bukan penerbit — naik terus. Kami memperkirakan gradien ini akan berlanjut melewati top 10k ke top 100k dan seterusnya.
Temuan 10 — Lima anatomi: seperti apa robots.txt ketika benar-benar menjadi kebijakan
Angka menggambarkan bentuk dataset; karakter nyata dari “kebijakan AI di web publik” paling baik dilihat dengan membaca file tertentu. Berikut lima file yang layak diperhatikan, dipilih agar mencakup seluruh ruang kebijakan.
Anatomi 1 — The New York Times (nytimes.com)
14 baris pertama nytimes.com/robots.txt:
# New York Times content is made available for your personal, non-commercial
# use subject to our Terms of Service here:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# Use of any device, tool, or process designed to data mine or scrape the content
# using automated means is prohibited without prior written permission from
# The New York Times Company. Prohibited uses include but are not limited to:
# (1) text and data mining activities under Art. 4 of the EU Directive on Copyright in
# the Digital Single Market;
# (2) the development of any software, machine learning, artificial intelligence (AI),
# and/or large language models (LLMs);
# (3) creating or providing archived or cached data sets containing our content to others; and/or
# (4) any commercial purposes.
# Contact https://nytlicensing.com/contact/ for assistance.
Ini robots.txt sebagai barang bukti hukum. File ini disusun agar bisa diterima sebagai bukti dalam litigasi NYT v. OpenAI yang diikutinya. Rujukan ke “Art. 4 of the EU Directive” — oleh penerbit AS — menggambarkan pengamatan Temuan 7 bahwa kerangka hukum EU merembes ke wacana global. Larangan eksplisit atas “creating or providing archived or cached data sets” jelas ditujukan ke Common Crawl. File ini panjangnya 60+ baris dengan blok User-agent bernama untuk GPTBot, OAI-SearchBot, ChatGPT-User, anthropic-ai, ClaudeBot, CCBot, Google-Extended, Applebot-Extended, Bytespider, Diffbot, Meta-ExternalAgent, Amazonbot, Omgili, Omgilibot, dan setengah lusin lainnya — setiap bot bernama punya Disallow: / sendiri.
Anatomi 2 — Der Spiegel (spiegel.de) — perizinan AI tingkat bagian
Der Spiegel adalah robots.txt paling canggih secara operasional yang kami temukan di seluruh dataset. Blok yang relevan:
# TLP-6507: Testweise Freischaltung der OpenAI-Suchcrawler fuer ausgewaehlte Bereiche
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /
User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /
Komentarnya berarti “Aktivasi uji coba crawler pencarian OpenAI untuk bagian tertentu.” Spiegel telah memasukkan daftar putih tujuh kategori konten spesifik — berita internasional, kemitraan, kesehatan, keluarga, perjalanan, psikologi, dan gaya hidup — untuk UA inferensi OpenAI sambil memblokir semuanya yang lain. Bagian politik, berita nasional Jerman, dan liputan investigatif secara eksplisit dikecualikan. Common Crawl, Bytespider, Cohere, Webzio-Extended, dan UA pelatihan lainnya diberi Disallow: / penuh lebih jauh di bawah file.
Ini robots.txt sebagai kebijakan editorial tingkat bagian. Teori implisitnya adalah konten gaya hidup memiliki risiko pengalihan pelatihan yang lebih rendah dan upside sitasi inferensi yang lebih tinggi, jadi Spiegel mengizinkan AI menampilkan bagian itu; konten politik dan investigatif adalah moat, jadi AI dikecualikan. Kami belum melihat pola ini di tempat lain. Ini menyiratkan tingkat koordinasi internal antara tim editorial, legal, dan infrastruktur yang belum dicapai kebanyakan newsroom. Kami memperkirakan ekspresi kebijakan granular tingkat bagian seperti ini akan menyebar selama 2026–2027 — file Spiegel pada dasarnya adalah indikator awal.
Anatomi 3 — BBC (bbc.com) — bentuk pernyataan kebijakan
robots.txt BBC dibuka dengan:
# version: ec59bd036e5138eb4831a9ed44447b1ff310e235
# The BBC's Terms of Use: https://www.bbc.co.uk/terms
# - Explain the rules for using our services
# - Tell you what you can do with our content
#
# In short: Please use our site like a human, not a robot.
# That means:
# - No scraping, crawling, or systematic extraction of content
# - No use of BBC content for training or fine-tuning AI models, including LLMs
# - No retrieval-augmented generation (RAG), AI-powered search, agentic AI or
# grounding using BBC content
# - No creating datasets from BBC content
# - No text and data mining (TDM) under Article 4 of the EU Directive on Copyright
# - No using BBC content to create summaries for your own use
# - No business use without permission
# - The BBC reserves all rights in its content and expressly opts out of any
# statutory exceptions in any jurisdiction for text and data mining,
# as permitted by law
#
# TL;DR: Browse, read, watch, enjoy - like a human.
BBC menambahkan versi pada robots.txt-nya (# version: ec59bd... adalah hash commit git), melarang delapan jenis penggunaan AI spesifik yang dilacak tim hukum BBC, dan ditutup dengan ringkasan satu baris dengan suara prosa yang membangun merek BBC. Frasa “expressly opts out of any statutory exceptions in any jurisdiction” adalah cadangan global yang disengaja — artinya kami tidak mempercayai satu rezim hukum pun untuk memberi perlindungan yang kami inginkan, jadi kami menegaskan opt-out di semua tempat sekaligus. Ini adalah robots.txt yang paling banyak disunting di dataset, dan lebih terasa seperti siaran pers daripada file konfigurasi.
Anatomi 4 — WordPress.org — sambutan eksplisit
Bandingkan semua di atas dengan wordpress.org:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Bytespider
Allow: /
User-agent: CCBot
Allow: /
User-agent: Copilot
Allow: /
WordPress.org secara eksplisit opt in ke sembilan crawler pelatihan AI, termasuk tiga (Bytespider, CCBot, anthropic-ai) yang paling sering diblokir di tempat lain. Teori implisitnya adalah dokumentasi dan ekosistem plugin WordPress adalah barang publik yang nilainya meningkat ketika asisten AI bisa menjawab pertanyaan tentangnya. Setiap kali seseorang bertanya ke Claude “bagaimana cara mengonfigurasi permalink di WordPress?” dan Claude sudah dilatih pada wordpress.org/documentation/, misi WordPress telah tercapai. Foundation tampaknya memutuskan bahwa berada di dalam corpus pelatihan semua model adalah keuntungan strategis, dan mereka memakai tata bahasa ekspresif file ini untuk menyatakannya.
Anatomi 5 — The Verge (theverge.com) — hibrida bersponsor
Satu pola lagi yang layak ditunjukkan. The Verge menyusun aturan AI mereka sebagai Disallow: / \ Allow: /sp/:
User-agent: GPTBot
Allow: /
User-agent: Applebot
Allow: /
User-agent: Google-Extended
Disallow: /
Allow: /sp/
User-agent: anthropic-ai
Disallow: /
Allow: /sp/
User-agent: Bytespider
Disallow: /
Allow: /sp/
User-agent: CCBot
Disallow: /
Allow: /sp/
User-agent: ChatGPT-User
Disallow: /
Allow: /sp/
User-agent: ClaudeBot
Disallow: /
Allow: /sp/
Path /sp/ adalah bagian konten bersponsor / partner The Verge. Konten editorial diblokir dari pelatihan AI; konten bersponsor diizinkan. Logika ekonominya jelas: sponsor membayar agar kontennya bisa ditemukan, termasuk melalui AI; flagship editorial adalah moat. GPTBot dibuka penuh (diduga karena hubungan langsung dengan OpenAI), Applebot dibuka penuh sebagai baseline pencarian, dan sisanya mendapat perlakuan hibrida. Ini satu-satunya struktur “tiered AI access” sejenis yang kami temukan.
Kelima file ini menggambarkan rentang kebijakan AI robots.txt saat ini. Sebagian besar file di top 10k tidak mirip satu pun dari ini — mereka diam atau memakai template vendor. Yang mirip salah satunya ditulis oleh orang-orang yang sudah memutuskan file itu layak dibaca dengan cermat.
Catatan tentang skala file: median body robots.txt dalam sampel kami adalah 858 byte — terlalu kecil untuk memuat kebijakan AI yang bermakna. Aturan hidup di ekor kanan: 1.005 situs (15,3%) memiliki file lebih besar dari 5 KB, 273 lebih besar dari 20 KB, dan maksimum mencapai 248 KB. 460 file memuat bahasa cadangan hak cipta; 275 mengutip EU 2019/790 dengan nama. robots.txt pada 2026 makin sering menjadi dokumen versi yang ditinjau pengacara, bukan sekadar baris konfigurasi.
Temuan 11 — 108 situs secara eksplisit menyambut GPTBot
Ada kelompok kecil tetapi terlihat jelas yang menulis aturan User-agent: GPTBot \n Allow: / — kebalikan dari pola “Disallow GPTBot” yang lebih sering dibahas. Total penuh di sampel kami adalah 108 situs dengan Allow eksplisit untuk GPTBot di path root. 25 teratas menurut peringkat Tranco:

| Peringkat | Domain | Sektor |
|---|---|---|
| 42 | wordpress.org | Tool pengembang / CMS |
| 133 | kaspersky.com | Keamanan |
| 187 | avast.com | Keamanan |
| 265 | hp.com | OEM hardware |
| 624 | branch.io | SaaS atribusi mobile |
| 692 | sophos.com | Keamanan |
| 782 | theverge.com | Berita |
| 905 | rambler.ru | Portal Rusia |
| 945 | kleinanzeigen.de | Marketplace Jerman |
| 948 | theatlantic.com | Berita |
| 1.092 | lge.com | LG Electronics |
| 1.300 | justdial.com | Pencarian lokal India |
| 1.332 | avira.com | Keamanan |
| 1.412 | youm7.com | Berita Mesir |
| 1.530 | goodreturns.in | Keuangan India |
| 1.621 | publi24.ro | Iklan baris Rumania |
| 1.807 | geocomply.com | SaaS kepatuhan |
| 1.908 | nba.com | Olahraga |
| 1.956 | oneindia.com | Berita India |
| 1.974 | mindbox.ru | SaaS Rusia |
| 2.009 | thesun.co.uk | Berita |
| 2.126 | vox.com | Berita |
| 2.140 | mgid.com | Iklan native |
| 2.314 | ninjarmm.com | SaaS manajemen TI |
| 2.323 | norton.com | Keamanan |
Beberapa pola:
Perusahaan keamanan sangat menonjol. Kaspersky, Avast, Sophos, Avira, Norton, NinjaRMM semuanya secara eksplisit mengizinkan GPTBot. Ini adalah play distribusi yang disengaja: ketika pengguna bertanya ke ChatGPT “antivirus terbaik untuk Windows saya apa?”, keberadaan brand di corpus pelatihan model langsung memengaruhi rekomendasi. Keamanan adalah salah satu dari sedikit kategori produk B2C di mana pencarian AI sudah mulai menggantikan SEO sebagai saluran akuisisi utama, dan brand-brand ini bergerak lebih dulu. Kami memperkirakan sisa kelompok keamanan akan mengikuti dalam 12 bulan.
Beberapa brand berita besar justru ada di daftar ini, bukan di blocklist. The Verge, The Atlantic, Vox, The Sun, NBA.com. Ini bukan kontradiksi — tampaknya mereka memutuskan bahwa bisa disitasi di dalam pencarian ChatGPT lebih berharga daripada dilindungi dari pelatihan, dan mereka menulis aturan Allow eksplisit untuk melindungi dari pemblokiran berlebihan di masa depan oleh CDN atau CMS mereka. Bandingkan dengan posisi NYT / Reuters / BBC / Forbes / Guardian yang Disallow secara eksplisit. Keduanya masuk akal; industri berita tidak monolitik.
Kehadiran The Sun menonjol karena situs yang sama memakai deny-all User-agent: * di bagian lain file. Kebijakan The Sun paling tepat dibaca sebagai “pelatihan AI dilarang, pencarian AI diizinkan, dan kami secara eksplisit memasukkan GPTBot ke whitelist sebagai pengecualian dari deny-all agar ChatGPT pasti bisa menjawab pertanyaan dengan mengutip The Sun.” Ini adalah aturan GPTBot-Allow yang paling canggih secara hukum — opt-out ditambah opt-in ke satu vendor.
Kehadiran WordPress.org adalah entri tunggal paling penting di daftar ini. Porsi tidak kecil dari ekosistem CMS open-source global either mengarah ke WordPress.org untuk dokumentasi atau meng-host plugin dari sana. Dengan secara eksplisit mengizinkan GPTBot di wordpress.org/robots.txt, WordPress Foundation secara efektif mengatakan ekosistem dokumentasi WordPress terbuka untuk pelatihan — yang punya efek lanjutan pada seberapa baik Claude, Gemini, dan ChatGPT bisa menjawab pertanyaan “bagaimana cara...” tentang WordPress.
83 situs sisanya dalam daftar penuh Allow-GPTBot adalah ekor panjang berita regional, vendor keamanan kecil, platform iklan baris di pasar non-Inggris, dan SaaS B2B. Sejauh yang bisa kami lihat, tidak ada koordinasi industri-wide “Allow-GPTBot” yang setara — aturannya diadopsi satu situs demi satu situs, oleh operator yang memutuskan bahwa berada di dalam corpus adalah posisi strategis.
Temuan 12 — llms.txt nyaris cuma rumor pada skala ini
llms.txt, format file alternatif yang diusulkan untuk penemuan konten ramah LLM (didorong Mintlify, Anthropic, Vercel, dan beberapa vendor dev-tooling sejak akhir 2024), hampir tidak terlihat adopsinya di sampel kami.
Dari 6.638 situs yang mengembalikan robots.txt yang bisa diparse, 83 (1,15%) menyebut llms.txt — biasanya sebagai baris Sitemap: https://example.com/llms.txt. Itu dua orde magnitudo lebih rendah daripada metrik yang sama pada sampel commerce yang berat di dev-tooling, di mana default Vercel dan Mintlify menaikkan adopsi.

Rincian kategorinya:
| Industri | n | % menyebut llms.txt |
|---|---|---|
| Infrastruktur | 47 | 4,3% |
| Perjudian | 100 | 3,0% |
| SaaS | 369 | 3,0% |
| Telecom | 33 | 3,0% |
| E-commerce | 224 | 1,8% |
| Travel | 64 | 1,6% |
| Tool pengembang | 129 | 1,6% |
| Berita | 650 | 0,8% |
| Dewasa | 254 | 0,4% |
| Pemerintah | 172 | 0,0% |
| Akademia | 268 | 0,0% |
| Pencarian | 12 | 0,0% |
llms.txt terkonsentrasi di SaaS yang berdekatan dengan dev-tooling, perjudian (yang mengadopsi fitur robots.txt kosakata baru lebih cepat daripada industri teregulasi lain karena mereka punya tim kepatuhan yang terbiasa menambah metadata), dan e-commerce B2B. Ia sangat absen dari berita dan pemerintah — dua segmen yang paling terlibat dengan kebijakan AI dan yang adopsinya akan diperlukan agar standar ini naik kelas dari “eksperimen vendor” menjadi “protokol web.” Sampai saat itu, llms.txt memang nyata tetapi kecil, dan audit lanjutan pada akhir 2026 akan menjadi uji ulang yang berguna.
Masalah struktural yang dihadapi llms.txt adalah ia tidak distandardisasi melalui proses IETF apa pun dan vendor AI besar belum berkomitmen untuk menghormatinya. Aturan robots.txt punya 30 tahun infrastruktur crawler di sekelilingnya; aturan llms.txt belum punya apa-apa. Sampai setidaknya satu vendor besar (OpenAI, Anthropic, Google, Cloudflare) menyatakan dukungan formal, file ini pada dasarnya adalah artefak pemasaran ekosistem Mintlify / Vercel. Kami tidak berharap itu berubah di 2026.
Temuan 13 — Aksesibilitas: robots.txt masih bisa dibaca oleh dua pertiga web teratas
Pengamatan sampingan yang tadinya bukan dimaksudkan sebagai temuan: 66% dari 10.000 situs teratas mengembalikan robots.txt yang bisa diparse ke satu IP riset, dan hanya 7 dari 10.000 (0,07%) yang mengembalikan 429 Too Many Requests. Ini kabar baik untuk robots.txt sebagai protokol publik.
Sebagai perbandingan, pipeline yang sama dijalankan pada sampel commerce mid-market 1.008 domain dua bulan sebelumnya menerima 429 dari 52% domain yang ter-resolve — CDN Shopify dan Cloudflare sangat agresif membatasi UA non-search-engine utama. Web trafik tertinggi jauh lebih ramah: situs-situs teratas lebih mungkin memiliki (a) tier manajemen bot yang tidak terlalu agresif, atau (b) allowlist eksplisit untuk crawler riset yang dikenal, atau keduanya.
Tingkat fetch_failed 21% pada top-10k didominasi domain apex CDN (akamai.net, cloudfront.net, fastly.net, apple-dns.net, gtld-servers.net) yang tidak menjalankan webserver pada /. Mereka bukan memblokir kami; mereka memang tidak punya apa pun untuk disajikan. Jika domain-domain itu dikeluarkan, tingkat kegagalan “dicoba dibaca tetapi tidak bisa” yang nyata ada di angka satu digit rendah.
Artinya, iterasi laporan ini di masa depan — snapshot triwulanan, perbandingan tahun-ke-tahun — bisa dijalankan murah dan reproduksibel di satu mesin. Jendela audit tetap terbuka di puncak kurva. Kasus yang asimetris adalah ekor panjang dan segmen commerce, tempat throttling level CDN secara efektif sudah memprivatisasi robots.txt. Kami memperkirakan perbedaan ini akan melebar: situs-situs teratas tetap bisa dibaca karena diindeks mesin pencari yang menuntut keterbacaan; commerce ekor panjang akan menjadi lebih sulit dibaca saat tier bot-fight Cloudflare makin agresif. Auditabilitas publik robots.txt sedang terbelah di garis yang sama yang memisahkan “web yang terlihat” dari “web yang dilindungi secara operasional.”
IV. Apa arti semua ini
Empat klaim, menurut kekuatan dukungan data.
1. Internet memiliki kebijakan AI per industri, bukan global. Rentang 12× antara berita dan telecom mendominasi semua angka agregat. Melaporkan “X% web memblokir AI” tanpa pemotongan sektoral melebih-lebihkan SaaS/pemerintah/dev dan meremehkan berita/travel/sosial. Laporan per sektor adalah satu-satunya framing yang jujur.
2. Pasal 4 Direktif Hak Cipta EU adalah satu-satunya rezim hukum yang terlihat menggerakkan angka. Situs ccTLD EU memblokir di 35% vs baseline global 19%. Litigasi AS (NYT v. OpenAI, laporan Copyright Office Januari 2025) telah menggeser kelompok berita AS tetapi belum mengubah web AS yang lebih luas. Framing EU juga merembes secara global lewat template Cloudflare, yang mengutip Direktif 2019/790 dalam boilerplate-nya tanpa peduli yurisdiksi pelanggan.
3. Dua “kebijakan AI” paralel sedang diekspresikan dan keduanya tidak selalu sejalan. Kebijakan yang ditulis tangan secara sengaja (17,8%, kebanyakan berita/sosial/travel/e-commerce) dan kebijakan warisan Cloudflare Managed (4,5%) beririsan secara substansi tetapi berbeda legitimasi. Di dunia ketika operator AI mencari perlindungan hukum untuk mengabaikan robots.txt, pembelaan “kami yang menulis dan meninjaunya” secara struktural lebih kuat daripada “saya cuma menyalakannya.” Insentif litigasi adalah mendorong kebijakan dari kategori kedua ke kategori pertama.
4. Yang diblokir penerbit adalah corpus, bukan model. CCBot di 16,3% — lebih tinggi daripada bot merek model mana pun — adalah pernyataan paling bersih tentang ini. Melarang OpenAI tidak mengeluarkan penerbit dari pelatihan; melarang CCBot melakukannya. 14,1% web top-10k memblokir CCBot sambil tetap mengizinkan Googlebot. Pola “blokir pelatihan, tetap buka pencarian” adalah aturan AI yang paling umum pada 2026.
Bagi situs yang sedang mempertimbangkan posisinya sendiri: posture median adalah diam — 80% web top 10k tidak mengatakan apa-apa soal AI. 17% yang menulis aturan terkonsentrasi pada Disallow, tetapi kelompok kecil yang tumbuh (daftar 1,5% eksplisit Allow-GPTBot, dipimpin vendor keamanan) secara publik memilih kebalikannya. Belum ada konsensus industri dan dalam 12 bulan ke depan pun sepertinya belum akan ada.
Bagi operator AI: terus berargumen bahwa robots.txt adalah protokol lama dengan semantik ambigu makin sulit dipertahankan ketika 17% situs terbesar dunia telah menulis aturan eksplisit yang menyebut bot satu per satu dengan tangan, dan 3,8% file mengutip statute EU spesifik dengan nomor pasal. Apakah aturan itu harus dihormati adalah keputusan bisnis; apakah aturan itu ada sekarang adalah fakta empiris.
V. Prospek: apa yang kami perkirakan pada akhir 2026
Tiga lintasan terlihat di dataset:
Cloudflare Managed akan lebih dari dua kali lipat porsinya, dan secara masuk akal bisa mencapai 10%+ dari top-10k yang bisa diparse. Roadmap Cloudflare secara publik membahas Block AI Bots aktif secara default untuk akun baru. Jika toggle itu dikirim sebagai default-on, tingkat blok global akan naik 5–8 poin persentase tanpa keputusan dari penerbit mana pun. Kita akan tahu ini terjadi saat porsi Cloudflare Managed pada bucket peringkat 5.001–10.000 naik di atas 5,7% saat ini.
Kebijakan AI tingkat bagian (gaya Spiegel) akan menyebar di antara flagship berita besar. Logika ekonominya — biarkan AI mengutip konten berisiko rendah, lindungi konten moat — cukup kuat sehingga kami memperkirakan setidaknya 10 newsroom flagship tambahan akan merilis aturan tingkat bagian pada akhir 2026. Perhatikan dulu pers menengah Jerman dan Prancis; kerangka hukumnya memberi insentif pada eksperimen di sana.
Kelompok eksplisit Allow-GPTBot akan bertambah, dipimpin B2B SaaS dan tooling pengembang. Saat pencarian AI menjadi saluran akuisisi yang terukur untuk vendor software (sebagaimana sudah terjadi di keamanan), CMO marginal akan menulis User-agent: GPTBot \n Allow: / untuk mencegah pemblokiran berlebihan yang tidak disengaja. Kami memperkirakan daftar 108 situs itu kira-kira akan berlipat dua pada akhir tahun.
Yang tidak kami harapkan: perubahan bermakna pada porsi mayoritas diam. 80% web yang tidak mengatakan apa-apa soal AI mencakup sektor (pemerintah, telecom, infrastruktur, SaaS B2B) yang tidak punya alasan ekonomi untuk menulis aturan dan tidak ada tekanan hukum untuk melakukannya. Kebijakan AI universal tidak akan datang.
VI. Keterbatasan
- Bias satu snapshot. Pengambilan data dilakukan dalam jendela 36 jam pada awal Mei 2026. File berubah harian pada Top 100; perkirakan pergeseran 1–2 poin persentase per kuartal pada angka utama.
- Kesenjangan klasifikasi industri. 6.593 dari 10.000 situs tetap
unknownsetelah classifier empat lapis. Persentase per industri kuat ketika n besar (berita: 650, streaming: 440, saas: 369, akademia: 268, dewasa: 254, ecommerce: 224, pemerintah: 172, keuangan: 129, dev: 129) dan lebih berisik di bawah n=30. Potongan berita per negara juga terbatas — DE/FR/UK punya n≥15, Korea/Swedia/Ceko bertumpu pada n=20–25. robots.txtbersifat sukarela.Disallowadalah permintaan, bukan penghalang.Bytespider,PerplexityBot, dan lainnya telah didokumentasikan mengabaikan aturan. Kami mengukur deklarasi kebijakan, bukan penegakan kebijakan.- Audit satu IP berbasis AS. Kami tidak bisa membaca 21% domain yang ter-resolve. Sebagian besar adalah titik apex CDN tanpa webserver; sebagian kecil adalah situs yang CDN-nya menandai kami sebelum mencapai origin. Ini sedikit mem-bias sampel ke infrastruktur yang lebih tua dan melawan situs yang dipagari geofencing berdasarkan negara asal.
- Semantik daftar Tranco. Tranco memfilter stabilitas; itu bukan ranking perilaku pengguna yang sebenarnya. Angka agregat robust terhadap pilihan daftar; posisi peringkat spesifik tidak.
- Tanpa data trafik. Kami mengukur kebijakan
robots.txt, bukan throughput bot AI yang sebenarnya. Kebijakan dan trafik tidak selalu sejalan.
VII. Reproduksi
Semua yang dipakai untuk menghasilkan laporan ini ada di folder deliverable.
- tranco_top10k.csv — daftar input
- out/sites.csv — domain × peringkat × industri × bahasa × status robots.txt (10.000 baris)
- out/fetch_meta.csv — hasil pengambilan per domain (status, scheme, bytes, error)
- out/bot_status.csv — grid domain × bot (250.000 baris: diblokir, punya aturan, status fetch)
- out/site_meta.csv — satu record analitis per situs (template, boolean ringkasan)
- out/analysis.json — setiap metrik yang dikutip dalam laporan
- 01_fetch_robots.py, 02_classify.py, 03_parse_and_analyze.py — pipeline Python lengkap
Perbaikan metodologi, isu dataset, dan analisis lanjutan dipersilakan dikirim ke support@thunderbit.com. Laporan ini diterbitkan secara independen dari posisi komersial apa pun yang dipegang Thunderbit; kami membangun web scraper bertenaga AI, dan kami punya kepentingan struktural agar robots.txt tetap menjadi kontrak yang bermakna dan bisa dibaca mesin di web publik. Data dalam laporan ini berdiri sendiri. — Tim riset Thunderbit, Mei 2026.
Coba Thunderbit AI Web Scraper Get Started Free


