Các website hàng đầu đang vạch ranh giới cho AI crawler như thế nào

Cập nhật lần cuối vào May 8, 2026
Các website hàng đầu đang vạch ranh giới cho AI crawler như thế nào

Tóm tắt điều hành

Chúng tôi đã lấy tệp robots.txt của mọi miền trong danh sách Tranco top 10.000 thuộc nhóm website có lưu lượng truy cập cao nhất thế giới. Sau đó, chúng tôi phân tích từng tệp bằng trình phân tích tuân thủ RFC 9309, phân loại chúng theo chính sách bot AI mà site đã áp dụng (nếu có), rồi đếm xem có bao nhiêu site được truy cập nhiều nhất thế giới thực sự cố chặn ChatGPT, Claude, Perplexity, Gemini, Common Crawl, Bytespider, Apple Intelligence và các trình thu thập khác đang huấn luyện và phục vụ mô hình ngôn ngữ lớn trong năm 2026.

Các con số nổi bật, trên mẫu 7.248 site mà chúng tôi đọc được robots.txt một cách trơn tru:

ai-crawler-block-statistics.webp

20,3% trong top 10.000 site của thế giới chặn ít nhất một trình thu thập AI. 17,0% có một quy tắc AI cụ thể được viết có chủ ý. 80% còn lại để các bot AI được chào đón gần như Googlebot.

Sáu phát hiện làm thay đổi câu chuyện:

  • Các tổ chức tin tức chặn ở mức 47% — cao nhất trong mọi ngành. Tin tức Đức dẫn đầu với 88%, Pháp 80%, Nga 0%. Yếu tố pháp lý, chứ không phải công nghệ hay kinh tế ngành, là động lực chính.
  • CCBot (Common Crawl) là bot bị chặn nhiều nhất với 16,3% — vượt GPTBot (15,8%) và Bytespider (14,9%). Các nhà xuất bản nhắm vào kho ngữ liệu huấn luyện, không phải thương hiệu mô hình. Quy tắc chọn lọc phổ biến nhất là "chặn CCBot, cho phép Googlebot" (14,1% site).
  • Pháp dẫn đầu mọi quốc gia với 50,6% site .fr chặn AI; khối EU cao hơn mức cơ sở toàn cầu 16 điểm. Có 275 tệp robots.txt nêu đích danh Chỉ thị EU 2019/790. Điều 4 là chế độ pháp lý duy nhất đang làm thay đổi con số một cách rõ rệt.
  • 17,8% tự viết quy tắc AI; 4,5% dùng mẫu được quản lý của Cloudflare; 75,7% không nói gì. Các site lớn tự viết; phần đuôi dài dùng công tắc. The Atlantic và chính cloudflare.com nằm trong danh sách Cloudflare Managed.
  • 108 site công khai Allow GPTBot — WordPress.org, Kaspersky, Norton, Avast, Sophos, The Verge, The Atlantic, NBA.com, The Sun, Branch.io. Các công ty bảo mật và công cụ dev xuất hiện nhiều hơn kỳ vọng.
  • Chính sách AI không trở nên gắt hơn ở đầu đường cong. Top 100, 101–1000, 1001–5000, 5001–10000 đều nằm trong khoảng 19% đến 23%. Tỷ lệ nổi bật này là thuộc tính của web công khai năm 2026, không phải tín hiệu về độ lớn của từng site riêng lẻ.

Câu chuyện giờ không còn là web có đang “phản kháng” hay không. Mà là ngành nào, quốc gia nào, chế độ pháp lý nào, và nhà cung cấp AI nào đang trở thành mục tiêu của chính sách chủ động — và ai thì không.


I. Bối cảnh: robots.txt trở thành một hiện vật chính sách AI như thế nào

Ba lực đẩy đã định hình lại ý nghĩa của robots.txt kể từ khi OpenAI phát hành GPTBot vào tháng 8 năm 2023.

Các nhà cung cấp AI tăng lên nhanh chóng. Google-Extended của Google, ClaudeBot của Anthropic, Bytespider của ByteDance, Applebot-Extended của Apple, Amazonbot của Amazon, Meta-ExternalAgent của Meta đều xuất hiện sau đó. CCBot vốn có của Common Crawl trở thành mục tiêu chặn có đòn bẩy lớn nhất vì kho lưu trữ của nó nuôi phần lớn các mô hình open-weight. Các bot không thuộc nhà cung cấp cũng xuất hiện: AI2Bot, cohere-ai, PerplexityBot, YouBot, DuckAssistBot, Diffbot, Omgili. Một danh sách chặn toàn diện năm 2026 có khoảng 25 tên.

Điều 4 của Chỉ thị bản quyền EU 2019/790 tạo ra ngoại lệ khai phá văn bản và dữ liệu theo luật định, nhưng ngoại lệ này không áp dụng nếu chủ sở hữu quyền đã "bảo lưu rõ ràng" quyền của họ theo cách "đọc được bằng máy". Trong suốt 2024–2025, các nhà xuất bản EU và luật sư của họ đã thống nhất dùng robots.txt như cách chuẩn để thể hiện việc bảo lưu đó. Bộ dữ liệu của chúng tôi cho thấy 275 site viện dẫn trực tiếp Chỉ thị 2019/790 và 87 site nhắc đến "TDM" — tập trung ở các trang tin châu Âu, nơi nó xuất hiện như lời dẫn pháp lý dài 4–8 dòng.

Cloudflare đã biến công tắc thành sản phẩm. Trong giai đoạn 2024–2025, Cloudflare phát hành bảng điều khiển "AI Audit", công tắc "Block AI Bots", và mẫu robots.txt được quản lý với từ vựng Content-Signal: search=yes,ai-train=no cùng phần văn bản mẫu của EU 2019/790. Đến tháng 5 năm 2026, mẫu này đã chạy trên 4,5% trong top 10k có thể phân tích. Lộ trình của Cloudflare công khai nói về việc đặt công tắc ở trạng thái bật mặc định cho tài khoản mới — điều này sẽ làm tỷ lệ chặn toàn cầu tăng 5–8 điểm mà không cần bất kỳ nhà xuất bản nào tự quyết định.

robots.txt năm 2026 không còn là tệp cấu hình tẻ nhạt như năm 2022 nữa. Nó là một cơ chế bảo lưu bản quyền có hậu thuẫn điều ước ở EU, là một hiện vật chính sách do nhà cung cấp định hình ở phần đuôi dài, và là tuyến đầu của cuộc thương lượng chậm chạp giữa những người vận hành website và những người huấn luyện mô hình.


II. Phương pháp luận

Chúng tôi cố gắng làm cho mọi thứ càng tẻ nhạt và có thể tái lập càng tốt. Toàn bộ pipeline (script Python, CSV đã phân tích, kho lưu robots.txt thô, biểu đồ) được công bố cùng báo cáo này.

Mẫu

Chúng tôi bắt đầu với danh sách Tranco tính đến tháng 5 năm 2026, tải xuống dưới dạng top-1m.csv.zip, rồi lấy 10.000 dòng đầu tiên. Tranco tổng hợp bốn bảng xếp hạng nguồn (Cisco Umbrella, Majestic, Farsight và Cloudflare Radar), lọc độ ổn định trong cửa sổ 30 ngày, và loại bỏ nhiễu crawler/CDN rõ ràng. Danh sách nó tạo ra là thứ gần nhất với một “top-10k lưu lượng web toàn cầu” mang tính chuẩn mực hiện có trên không gian mở, và là mẫu tiêu chuẩn cho nghiên cứu web học thuật (đã được dùng trong hơn 600 bài báo bình duyệt kể từ khi KU Leuven ra mắt năm 2018).

Danh sách này gồm nhiều loại: (a) website chính mà người dùng truy cập, (b) miền hạ tầng / API / DNS / CDN apex không phục vụ /, và (c) các miền được dùng nội bộ bởi những nền tảng lớn (ví dụ gvt1.com, apple-dns.net, googleusercontent.com). Thay vì lọc trước, chúng tôi giữ tất cả và gắn nhãn chúng là infrastructure ở lớp phân tích. Chúng sẽ tự rơi ra khi ta thu hẹp về "những site trả về robots.txt có thể phân tích được."

Thu thập

Với mỗi trong 10.000 miền, chúng tôi thực hiện một yêu cầu bất đồng bộ GET /robots.txt qua HTTPS, có fallback sang HTTP, theo tối đa bốn bước chuyển hướng, giới hạn thời gian tổng 12 giây, giới hạn thân phản hồi 500 KB, và dùng chuỗi User-Agent giống trình duyệt thật với Accept-Language: en-US. Mức đồng thời được giữ ở 80 yêu cầu đang chạy. Công việc chạy từ một IP dân cư duy nhất tại San Francisco.

Kết quả thu thập:

Trạng tháiSố lượngDiễn giải
200 OK6.638Nội dung robots.txt được trả về và có thể phân tích.
404 Not Found610Không có robots.txt. RFC 9309 định nghĩa đây là mặc định ngầm "cho phép tất cả."
403 Forbidden563Máy chủ gốc chủ động từ chối yêu cầu robots.txt. Loại khỏi phân tích.
429 Too Many Requests7Hầu như không có giới hạn tốc độ ở tầng CDN tại nhóm hạng này.
fetch_failed (lỗi TLS / DNS / TCP)2.065Chủ yếu là các miền CDN apex (akamai.net, cloudfront.net, fastly.net, gtld-servers.net, apple-dns.net) không chạy webserver trên /. Không phải "bị chặn" — họ просто không có robots.txt để phục vụ.
Khác 4xx/5xx117Hỗn hợp — lỗi máy chủ, geofencing, phản hồi lỗi định dạng.

Điều này cho chúng ta 7.248 site trong mẫu có thể phân tích (6.638 200 + 610 404). 2.065 trường hợp fetch_failed là các miền thật, nhưng đó là điểm apex CDN/DNS, không phải site người ta truy cập, và coi chúng là có một “chính sách AI” thì không hợp lý. Chúng nằm trong bộ dữ liệu như một thống kê khả dụng riêng.

Phân tích

Mọi thân phản hồi 200 đều được phân tích bằng protego, một triển khai Python của RFC 9309 được dùng trong sản xuất bởi Scrapy. Với mỗi cặp (site, bot), chúng tôi tính ba thứ:

  1. can_fetch_root — bot có được phép lấy / hay không, theo ngữ nghĩa group-of-records của chuẩn, quy tắc ưu tiên match dài nhất, và việc User-agent: * bị ghi đè bởi một chặn bot cụ thể khi cả hai cùng tồn tại.
  2. has_specific_rule — tệp có chứa dòng User-agent: nêu đích danh bot này hay không (không phân biệt hoa thường).
  3. disallow_count — có bao nhiêu chỉ thị Disallow: trong khối phù hợp, dùng để phân biệt cấm toàn site với hạn chế theo đường dẫn.

Sự kết hợp này quan trọng vì một con số "tỷ lệ chặn" ở đầu báo cáo che mất hai hiện tượng hoàn toàn khác nhau: các thương hiệu cố ý viết User-agent: GPTBot \n Disallow: / vì họ quyết định phản kháng, và các thương hiệu có khối chặn chung User-agent: * \n Disallow: / (đã được thiết lập cho staging hoặc bảo trì nhiều năm trước) vô tình cũng chặn mọi bot AI chưa tồn tại khi quy tắc đó được viết ra. Trong toàn bộ báo cáo này, số "bất kỳ chặn AI nào" bao gồm cả hai kiểu; số "chặn AI cụ thể" là phần cố ý, chọn lọc hơn.

Các bot trong phạm vi

Chúng tôi theo dõi 25 bot, chia làm ba nhóm:

  • Trình thu thập huấn luyện AI (16): GPTBot, ClaudeBot, anthropic-ai, CCBot, Google-Extended, Meta-ExternalAgent, Bytespider, Applebot-Extended, Diffbot, Amazonbot, ImagesiftBot, FacebookBot, cohere-ai, AI2Bot, Omgili, Omgilibot.
  • Bot suy luận / truy xuất trực tiếp AI (7): PerplexityBot, Perplexity-User, ChatGPT-User, OAI-SearchBot, ClaudeBot (dùng cho cả huấn luyện lẫn suy luận), YouBot, DuckAssistBot.
  • Mốc tham chiếu tìm kiếm (6): Googlebot, Bingbot, DuckDuckBot, Slurp (Yahoo), Baiduspider, YandexBot.

Một vài bot nằm giữa ranh giới huấn luyện/suy luận. ClaudeBot là ví dụ nổi bật nhất — Anthropic đã ngừng dùng UA anthropic-ai cũ vào năm 2024 và hiện dùng ClaudeBot cho cả huấn luyện lẫn truy xuất trực tiếp, nên một quy tắc Disallow: ClaudeBot không còn ánh xạ rõ ràng thành "chặn huấn luyện nhưng vẫn cho phép hiển thị." Chúng tôi giữ nguyên cách gán đó và nói rõ hậu quả ở phần sau.

Phân loại ngành

Chúng tôi phân loại mỗi miền vào một trong 16 nhóm ngành (news, social, streaming, ecommerce, search, finance, infrastructure, saas, academia, dev, gov, adult, gambling, travel, telecom, unknown) bằng một cách tiếp cận nhiều lớp:

  1. Từ điển miền đã biết — bản đồ thủ công của khoảng 500 miền lưu lượng cao sang ngành.
  2. Mẫu TLD / hậu tố.govgov, .edu.ac.*academia, các hậu tố CDN đã nhận diện → infrastructure.
  3. Từ khóa trong tên miềnnews, post, shop, bank, porn, casino... làm tín hiệu dự phòng.
  4. Quét trang chủ — với các site mà ba lớp đầu không phân loại được và trả về robots.txt 200, chúng tôi lấy HTML trang chủ, trích xuất <title>, <meta name="description">, <meta property="og:type">, rồi chấm điểm từ khóa theo các tín hiệu phân loại kiểu mô hình ngôn ngữ.

Kết quả là 3.407 site (34%) có nhãn ngành đáng tin cậy và 6.593 site còn lại là unknown. Nhóm unknown chủ yếu là các cổng thông tin khu vực không dùng tiếng Anh, các site thương hiệu .com doanh nghiệp không khớp với một nhóm duy nhất nào, và các nhà xuất bản truyền thống ở thị trường ngôn ngữ nhỏ mà chúng tôi không có mục từ điển. Khi báo cáo trích dẫn tỷ lệ theo ngành, mẫu số là tập đã phân loại của ngành đó, không phải toàn bộ 10.000.


III. Kết quả

Phát hiện 1 — Cứ năm site có lưu lượng lớn thì có một site chặn ít nhất một bot AI

Trong 7.248 site có thể phân tích, 1.472 (20,31%) chặn ít nhất một bot AI. 1.230 (16,97%) có quy tắc AI cụ thể, cố ý. Mốc nền của Googlebot là 2,18% (158 site — đa số là chặn tất cả như mặc định bảo trì hoặc, trong ba trường hợp, là công cụ tìm kiếm chặn đối thủ).

Con số 20% nổi bật này cao gấp 9 lần mốc nền Googlebot. Đó là tín hiệu thực — các site có lưu lượng lớn có xác suất chặn một trình thu thập AI cao hơn một bậc so với trình thu thập tìm kiếm — nhưng cũng nhỏ hơn đáng kể so với câu chuyện “chặn AI đang tiến tới mức phổ cập” đã được truyền thông lặp lại từ năm 2024. Ngay cả trong top 10.000 site được truy cập nhiều nhất của web, đa số 5/6 vẫn im lặng về AI.

Sự tách biệt giữa “bất kỳ chặn AI nào” (20,3%) và “chặn AI cụ thể” (17,0%) là nhỏ về mặt tuyệt đối nhưng quan trọng về mặt khái niệm. Khoảng cách 3,3 điểm là phần các site chỉ chặn bot AI vì quy tắc sẵn có User-agent: * \n Disallow: / của họ bắt mọi thứ đi ngang qua, kể cả những bot chưa tồn tại khi quy tắc được viết. Con số cố ý 17,0% là cách đọc sạch hơn cho câu hỏi “bao nhiêu trong số những website lớn nhất thế giới đã đưa ra quyết định riêng về AI.”

Đặt cạnh các nghiên cứu trước:

NguồnNgàyMẫuTỷ lệ chặn
Originality.aiTh3 20251.000 tin tức phổ biến nhất (tiếng Anh)35,7% chặn GPTBot
PalewireTh8 20241.500 tổ chức tin tức36,0% bất kỳ trình thu thập AI nào
Reuters InstituteXuân 202550 thương hiệu tin tức hàng đầu, 10 quốc gia78% bất kỳ trình thu thập AI nào
WIRED / NYTCuối 202350 trang tin Mỹ hàng đầu26% chặn GPTBot
Báo cáo này (Thunderbit)Th5 2026Tranco top 10.000 (mọi ngành)20,3% / 17,0% cố ý

Con số 17,0% cố ý của chúng tôi thấp hơn mọi nghiên cứu chỉ về tin tức vì hai phần ba mẫu của chúng tôi không phải là tin tức. Nếu chỉ xét 650 site tin tức, chúng tôi có 47% — nằm trong cùng khoảng với các nghiên cứu trước khi tính đến thành phần mẫu. Bức tranh cấu trúc nhất quán: nhóm tin tức chặn AI với tỷ lệ cao gấp 3–4 lần phần còn lại của web.


Phát hiện 2 — Đi sâu theo ngành: chênh lệch 12 lần từ tin tức đến viễn thông

Phát hiện được nhắc nhiều nhất trong hai năm đưa tin về “AI scraping” là con số 80% cơ quan báo chí chặn GPTBot từ Originality.ai và Palewire. Phân tích của chúng tôi cho ra con số nhỏ hơn nhưng vẫn rất khác biệt: 47,2% site tin tức trong top 10.000 chặn ít nhất một bot AI, với 45,2% viết quy tắc AI một cách rõ ràng.

Nhưng “tin tức so với mọi thứ khác” vẫn quá thô. Phân rã đầy đủ (các ngành có n ≥ 10 trong mẫu) cho thấy một câu chuyện giàu sắc thái hơn nhiều:

robots-industry-spread_compressed.webp

NgànhnBất kỳ chặn AICụ thểChặn GooglebotQuy tắc tự viếtCloudflare ManagedIm lặng
Tin tức65047,2%45,2%1,5%46,9%1,5%48,5%
Du lịch6429,7%29,7%0,0%35,9%3,1%54,7%
Mạng xã hội6529,2%23,1%4,6%23,1%6,2%66,2%
Streaming44020,0%17,7%0,7%16,8%3,6%75,5%
Tài chính12919,4%12,4%0,8%14,7%2,3%75,2%
Thương mại điện tử22418,3%17,4%0,4%24,1%1,3%66,1%
Nội dung người lớn25417,3%14,6%0,4%10,2%7,9%79,5%
Tìm kiếm1216,7%0,0%0,0%0,0%0,0%100,0%
Học thuật26814,6%13,8%0,4%13,4%3,4%77,2%
Cờ bạc10014,0%13,0%0,0%18,0%4,0%77,0%
Công cụ dev12910,1%7,8%0,0%8,5%5,4%77,5%
SaaS3697,6%6,2%0,3%9,5%0,8%87,5%
Chính phủ1725,2%3,5%0,0%4,1%0,6%83,1%
Hạ tầng474,3%0,0%0,0%4,3%2,1%72,3%
Viễn thông333,0%3,0%0,0%12,1%0,0%78,8%

Khoảng chênh 12 lần giữa tin tức và viễn thông là lý do khiến “chính sách AI của web” trở thành đơn vị phân tích sai. Không có một con số duy nhất; có những con số theo ngành, và chúng lệch nhau cả một bậc độ lớn. Dưới đây là bốn phát hiện đặc trưng nhất.

Tin tức: 47% chặn, 47% tự viết. Tin tức là nhóm đã viết ra bộ quy tắc mẫu. Cloudflare Managed chỉ chạy ở mức 1,5% trong tin tức — các nhà xuất bản này không thuê ngoài quy tắc. Văn bản ở đây giàu ngữ cảnh bất thường: NYT mở đầu bằng tiền đề pháp lý 14 dòng dẫn chiếu “Art. 4 of the EU Directive”; BBC mở đầu bằng "Please use our site like a human, not a robot... TL;DR: Browse, read, watch, enjoy — like a human."; The Sun viết "The Sun does not permit the unlicensed use of our content for large language models." Đây là robots.txt như tuyên bố chính sách, không phải cấu hình.

Du lịch ở mức 30% — bất ngờ lớn. Booking, Expedia, TripAdvisor, Kayak và các hãng hàng không lớn chặn ở mức bằng hai phần ba tỷ lệ của tin tức. Mẫu chọn lọc nhất quán: trình chặn du lịch trung bình cấm 5–7 UA huấn luyện nhưng để yên các UA suy luận (PerplexityBot, ChatGPT-User, OAI-SearchBot). Dữ liệu giá tổng hợp và đánh giá là con hào bảo vệ; trích dẫn quay ngược về site là lợi thế. Đây là mẫu “chặn huấn luyện, cho phép suy luận” rõ ràng nhất trong bất kỳ ngành đơn lẻ nào.

Nội dung người lớn ở mức 17% — cũng bất ngờ. Các mẫu nhỏ trước đây cho thấy 0%. Dữ liệu toàn mẫu cho thấy cứ 6 site nội dung người lớn thì có 1 site cấm ít nhất một bot AI, với tỷ lệ Cloudflare Managed cao nhất trong mọi ngành (7,9%). Hơn một nửa số chặn AI của site nội dung người lớn đến từ công tắc Cloudflare, không phải từ quyết định của nhà xuất bản. Huấn luyện mô hình tạo ảnh là mối đe dọa ngầm — các mô hình kiểu StableDiffusion học phong cách hình ảnh nhanh hơn nhiều so với mô hình văn bản học phong cách viết.

SaaS ở mức 7,6% là điều trái trực giác. Các nhà cung cấp phần mềm là phân khúc lên tiếng nhiều nhất trong thảo luận về chính sách AI nhưng robots.txt của họ lại rộng mở. Cách hiểu đúng: đội marketing SaaS đã nhận ra tìm kiếm AI là một kênh phân phối. Những nhà cung cấp thực sự suy nghĩ về điều này lại đang chọn tham gia, không phải rút lui — danh sách explicit-Allow-GPTBot (Phát hiện 12) chủ yếu là SaaS bảo mật và công cụ dev.

Chính phủ 5,2%, viễn thông 3,0%, hạ tầng 4,3%, dev 10,1%. Các nghĩa vụ hồ sơ công khiến Disallow: / trở nên nhạy cảm về pháp lý với .gov. Các site marketing viễn thông muốn dễ được khám phá. Miền apex CDN chẳng có gì để bảo vệ. Công cụ dev lại chủ động mở cửa (nội dung của chúng có giá trị hơn khi LLM trích dẫn được).

Kết luận: không có một con số duy nhất kiểu "web đang/không đang chặn AI" nào mà không làm mất nhiều hơn nó truyền tải. Báo cáo theo cấp ngành là cách duy nhất trung thực để nói về dữ liệu.


Phát hiện 3 — Theo từng nhà cung cấp AI: ai đang bị chặn nhiều nhất?

Một lát cắt tự nhiên khác của dữ liệu là theo công ty AI thay vì theo bot. Một số nhà cung cấp vận hành nhiều bot (OpenAI có ba: GPTBot, ChatGPT-User, OAI-SearchBot; Anthropic có hai: ClaudeBot, anthropic-ai; Meta có hai: Meta-ExternalAgent, FacebookBot). Gộp ở cấp nhà cung cấp là cách gần nhất chúng tôi có thể trả lời câu hỏi “web công khai nghĩ gì về từng công ty AI?”

Nhà cung cấp AIBot được gộpSite chặn ≥ 1 bot% trong mẫu phân tích
Common CrawlCCBot1.17816,25%
OpenAIGPTBot, ChatGPT-User, OAI-SearchBot1.17216,17%
AnthropicClaudeBot, anthropic-ai1.11115,33%
ByteDanceBytespider1.08214,93%
MetaMeta-ExternalAgent, FacebookBot98913,65%
GoogleGoogle-Extended97013,38%
AmazonAmazonbot87712,10%
AppleApplebot-Extended85911,85%
Webz.io (Omgili)Omgili, Omgilibot73110,09%
Coherecohere-ai7179,89%
PerplexityPerplexityBot, Perplexity-User7159,86%
DiffbotDiffbot6849,44%
You.comYouBot5637,77%
AI2 (Allen AI)AI2Bot4876,72%
DuckDuckGoDuckAssistBot4826,65%

Common Crawl là thực thể bị nhắm nhiều nhất dù nó là kho lưu trữ web phi lợi nhuận, không phải nhà vận hành LLM. Lý do là đòn bẩy: CCBot cung cấp đầu vào cho hầu hết các mô hình open-weight và một phần đáng kể các mô hình đóng. Chặn CCBot trước tiên là quy tắc phủ rộng nhất mà một nhà xuất bản có thể viết.

OpenAI, Anthropic, ByteDance tụ lại ở mức 14–16%. Lợi thế của OpenAI một phần là do hiệu ứng đếm (ba bot OpenAI so với một bot của ByteDance). Hành vi Bytespider 14,9% là hiệu ứng “Bytespider” — nó đã bị ghi nhận là phớt lờ robots.txt từ năm 2024, và các nhà xuất bản chặn nó như một tín hiệu công khai, chứ không phải vì họ lo TikTok.

Meta, Google, Amazon, Apple ở mức 12–14% là tầng thứ hai — được viết ra với tính phòng thủ hơn là như một tuyên bố lập trường. Các nhà cung cấp nhỏ (Webz.io, Cohere, Perplexity, Diffbot, You.com, AI2, DuckDuckGo) ở mức 6–10% chủ yếu bị kéo lên bởi mức sàn chung 3,8%; các quy tắc cụ thể dành cho họ nằm trong khoảng 1–4%.

xAI (Grok), Mistral và phần lớn các phòng thí nghiệm mô hình ở châu Âu / Trung Quốc không xuất hiện trong bảng — họ chưa công bố UA crawler huấn luyện có tài liệu. Hệ sinh thái robots.txt hiện tại là cuộc đối thoại giữa các nhà cung cấp Mỹ/Trung Quốc đã phát hành UA và các nhà xuất bản Mỹ/EU đã viết quy tắc; nhà cung cấp không phát hành thì trở nên vô hình trong thương lượng.


Phát hiện 4 — CCBot là tâm điểm mới, không phải GPTBot

Thứ tự bot ở top-10k trông như sau:

most-blocked-ai-crawlers-vendors.webp

Xếp hạngBotTỷ lệ chặnTỷ lệ quy tắc cụ thể
1CCBot (Common Crawl)16,25%12,90%
2GPTBot (OpenAI)15,84%12,72%
3Bytespider (ByteDance)14,93%11,35%
4ClaudeBot (Anthropic)14,51%11,13%
5Google-Extended13,38%10,18%
6Meta-ExternalAgent12,38%8,95%
7Amazonbot12,10%8,66%
8Applebot-Extended11,85%8,72%
9Omgilibot10,09%5,31%
10anthropic-ai (đã ngừng)9,99%6,55%
11cohere-ai9,89%6,42%
12PerplexityBot9,69%6,40%
13Diffbot9,44%5,95%
14ChatGPT-User (suy luận)8,90%5,73%
15YouBot (suy luận)7,77%4,29%
16OAI-SearchBot (suy luận)6,83%3,66%
mốc nềnGooglebot2,18%
mốc nềnBingbot2,27%

Câu chuyện mà bảng này kể là bot mà web công khai chặn đầu tiên không phải thương hiệu mô hình — mà là kho ngữ liệu. Kho lưu trữ 250 tỷ trang của Common Crawl là đầu vào huấn luyện lớn nhất của GPT-3, GPT-4, Llama 1 / 2 / 3, Falcon, Mistral, BLOOM, và hầu hết các mô hình open-weight phát hành từ năm 2020. Một site muốn opt out khỏi “việc xuất hiện trong mô hình biên tiếp theo” sẽ tối ưu bằng cách không cho CCBot vào trước tiên — một khi bạn không ở trong Common Crawl, bạn gần như bị loại khỏi pipeline huấn luyện nguồn mở miễn phí. GPTBotClaudeBot đứng thứ hai và ba vì chúng là mặt tiền hữu hình của hai sản phẩm thương mại cụ thể; UA ở cấp kho ngữ liệu mới là mục tiêu mang tính cấu trúc.

Các bot AI xếp hạng thấp hơn trong bảng cũng rất đáng chú ý. Omgilibot ở mức 10% là bất thường cao đối với một bot mà hầu hết độc giả sẽ chưa từng nghe tới — nó do Webz.io vận hành, một nhà môi giới dữ liệu nội dung bán kho lưu trữ web cho các nhà vận hành LLM, và một nhóm đáng kể tổ chức tin tức đã bắt đầu nêu đích danh nó trong tệp của họ. AI2Bot ở mức 6,7% (và quy tắc tương ứng Ai2Bot-Dolma trên các site Squarespace) cho thấy cộng đồng LLM học thuật cũng đang bị gắn cờ bởi các nhà xuất bản vốn không nhất thiết phân biệt giữa “crawler nghiên cứu phi lợi nhuận” và “crawler thương mại.”

Nhóm suy luận — ChatGPT-User, OAI-SearchBot, YouBot, Perplexity-User — thấp hơn nhóm huấn luyện 4–8 điểm phần trăm. Khoảng cách đó là câu trả lời cho một câu hỏi chính sách kéo dài: có, các site có lưu lượng lớn phân biệt giữa bot thu thập dữ liệu cho huấn luyện mô hình tương lai và bot truy xuất trực tiếp để trả lời ngay câu hỏi của người dùng. Họ không phải lúc nào cũng phân biệt rõ (các quy tắc quét chung thì không), nhưng một phần đáng kể đã viết những quy tắc nhắm riêng vào phía huấn luyện.


Phát hiện 5 — 14% chặn CCBot nhưng vẫn để Googlebot được chào đón — mẫu “chặn kho ngữ liệu, giữ tìm kiếm”

Quy tắc chọn lọc được áp dụng nhiều nhất trong top-10k:

website-crawler-blocking-stats.webp

Mẫu quy tắcSite% trong mẫu phân tích
Chặn CCBot, cho phép Googlebot1.02314,11%
Chặn Bytespider, cho phép Googlebot92612,78%
Chặn Google-Extended, cho phép Googlebot81611,26%
Chặn GPTBot, cho phép OAI-SearchBot6589,08%
Chặn GPTBot, cho phép ChatGPT-User5257,24%
Chặn CCBot, cho phép PerplexityBot5197,16%
Chặn anthropic-ai, cho phép ClaudeBot590,81%

Mẫu được chấp nhận nhiều nhất (14,1%) là “chặn Common Crawl, giữ khả năng hiển thị trên Google search.” Á quân (12,8%) là “chặn Bytespider, giữ khả năng hiển thị trên Google search” — tức chặn crawler của ByteDance vốn bị gắn cờ về danh tiếng trong khi vẫn giữ baseline tìm kiếm hợp pháp. Thứ ba (11,3%) là “chặn UA huấn luyện AI của Google nhưng vẫn giữ UA tìm kiếm của Google,” đúng như cách Google thiết kế Google-Extended: nhà xuất bản opt out khỏi huấn luyện Bard / Gemini mà không mất thứ hạng tìm kiếm.

Ba con số này cùng nhau mô tả lập trường chính sách thống trị trên web top-10k: cấm các bot kho ngữ liệu huấn luyện, để yên bot tìm kiếm và bot suy luận. Mẫu thiểu số “cấm huấn luyện nhưng cho phép UA truy xuất trực tiếp cụ thể của LLM này” — GPTBot ✗ / ChatGPT-User ✓ ở mức 7,2% — có tồn tại, nhưng nhỏ hơn các cắt giảm ở cấp kho ngữ liệu.

Dòng anthropic-ai / ClaudeBot ở mức 0,81% phản ánh việc Anthropic ngừng dùng UA năm 2024: ClaudeBot giờ phục vụ cả huấn luyện lẫn suy luận, loại bỏ cách diễn đạt sạch “chặn huấn luyện, cho phép trích dẫn” mà UA anthropic-ai cũ từng cho phép. Đây là quyết định thiết kế UA ít được bàn tới nhất của 2024–2025 — nó đã loại bỏ cả một lớp biểu đạt chính sách khỏi robots.txt.


Phát hiện 6 — Tin tức theo chiều sâu: theo quốc gia và ngôn ngữ

Khi cắt nhóm tin tức theo TLD mã quốc gia — lưu ý rằng điều này có nghĩa .de cho tin tức Đức, .fr cho tin tức Pháp, v.v. chứ không phải ngôn ngữ được phục vụ — thì biến thiên trong nhóm tin tức còn lớn hơn biến thiên giữa tin tức và phần còn lại:

news-blocking-country-tld.webp

Quốc gia (chỉ tin tức)nBất kỳ chặn AICụ thể
🇩🇪 Đức (.de)2588,0%88,0%
🇫🇷 Pháp (.fr)1580,0%80,0%
🇬🇧 Vương quốc Anh (.co.uk)1566,7%53,3%
🇪🇸 Tây Ban Nha (.es)560,0%60,0%
🇮🇹 Ý (.it)1353,8%53,8%
Tin tức toàn cầu (.com/.org/v.v.)50045,0%42,8%
🇵🇱 Ba Lan (.pl)742,9%42,9%
🇯🇵 Nhật Bản (.jp)1225,0%25,0%
🇷🇺 Nga (.ru)130,0%0,0%
🇬🇷 Hy Lạp (.gr)60,0%0,0%

Tin tức Đức là phân khúc chặn cao nhất trong toàn bộ bộ dữ liệu với 88%, và 88% này là explicit — gần như không có trang tin Đức nào trong top 10k cho các trình thu thập huấn luyện AI chạm được vào kho lưu trữ của nó. Nhóm này do Spiegel, Bild, Welt, Zeit, FAZ, Süddeutsche, Heise, Golem, Stern, Focus dẫn đầu — toàn bộ hệ thống xuất bản chính thống của Đức, cộng thêm các nhà xuất bản công nghệ tự viết quy tắc riêng. Hạ tầng chính trị phía sau rất dày: VG Media, tổ chức quyền tập thể của các nhà xuất bản Đức, là nhóm nguyên đơn quyết liệt nhất trong kiện tụng bản quyền AI của EU, và Điều 4 của Chỉ thị EU được triển khai trong luật Đức dưới dạng §44b UrhG với ngôn ngữ opt-out có thể đọc bằng máy. Khi các nhà cung cấp AI xuất hiện, các nhà xuất bản Đức là nhóm chuẩn bị kỹ nhất để chuyển lập trường pháp lý đó thành quy tắc robots.txt.

Tin tức Pháp ở mức 80% đứng ngay sau. Môi trường pháp lý của Pháp tương tự (Chỉ thị 2019/790 được chuyển hóa vào luật Pháp), và hành vi của nhóm cũng tương tự — lemonde.fr, lefigaro.fr, liberation.fr, lequipe.fr, 20minutes.fr, ouest-france.fr đều chặn, trong khi tệp của Le Monde còn dẫn chiếu thêm droit du producteur de base de données của Pháp (Điều L 342-1 của Code de la propriété intellectuelle) như một cơ sở pháp lý nội địa song song. Pháp còn có một điểm khác: phán quyết năm 2024 của tòa thương mại Paris xác nhận opt-out dựa trên robots.txt là thông báo đủ theo Điều 4; điều này cung cấp hậu thuẫn án lệ trực tiếp mà chưa có khu vực pháp lý nào khác đạt được.

Vương quốc Anh ở mức 67% thấp hơn, và lý do là một số nhà xuất bản lớn ở Anh (thesun.co.uk, dailymail.co.uk, mirror.co.uk) dùng các khối cấm toàn bộ User-agent: * thay vì quy tắc AI cụ thể, kéo số explicit xuống còn 53%. Hiệu ứng tổng thể vẫn như nhau — các site này không cho AI crawl — nhưng chính sách được diễn đạt như “không có robot nào trừ danh sách cho phép cụ thể này của các công cụ tìm kiếm” thay vì chặn bot AI theo tên. Nền pháp lý cũng yếu hơn: sau Brexit, Anh kế thừa logic Điều 4 nhưng án lệ nội địa tương ứng mỏng hơn.

Tin tức Nga ở mức 0% là hàng bất ngờ nhất. Mười ba site tin tức miền Nga trong mẫu (dzen.ru, rbc.ru, ria.ru, kommersant.ru, tass.ru, lenta.ru, gazeta.ru, interfax.ru, kp.ru, tass.com, v.v.) — không một site nào chặn bất kỳ crawler AI nào. Giải thích khả dĩ: huấn luyện LLM tiếng Nga bị chi phối bởi các mô hình kiểu GPT của Yandex (dùng crawler nội bộ Yandex, không phải Common Crawl), môi trường bản quyền Nga chưa có một thứ tương đương Điều 4, và các nhà xuất bản lớn của Nga coi các LLM phương Tây là không đáng kể (kiểm soát xuất khẩu của Mỹ vốn đã hạn chế dịch vụ OpenAI/Anthropic ở Nga) còn Yandex là một bên liên quan trong nước hơn là đối thủ. Lập trường chính sách ở đây đơn giản là khác hẳn.

Tin tức Nhật Bản ở mức 25% tạo thành một mẫu thứ ba. Nhật Bản có ngoại lệ khai phá văn bản và dữ liệu rõ ràng trong luật bản quyền nội địa (Điều 30-4 của Luật Bản quyền Nhật, sửa đổi năm 2018) thoáng hơn Điều 4 của Chỉ thị EU — cho phép TDM cho mục đích “không hưởng thụ” bao gồm huấn luyện AI mà không cần sự đồng ý của chủ sở hữu quyền. Nhà xuất bản Nhật có ít đòn bẩy pháp lý hơn để opt out, nên tỷ lệ robots.txt tương ứng thấp hơn. 25% chặn chủ yếu là các nhà xuất bản lớn, có tính quốc tế cao (asahi.com, nikkei.com) và được định vị như toàn cầu hơn là chỉ nội địa.

Dữ liệu tin tức theo quốc gia là bằng chứng sạch nhất trong báo cáo rằng chế độ pháp lý, chứ không phải công nghệ hay kinh tế ngành, là động lực chính của việc chặn AI. Các nhóm tin tức EU tụ ở mức 54% đến 88%; các nhóm tin tức ngoài EU (Nga, Nhật, nhóm .com toàn cầu) dao động từ 0% đến 45%. Đỉnh 88% nằm ở quốc gia có triển khai Điều 4 phát triển nhất; sàn 0% nằm ở quốc gia thực tế không có luật chính sách AI nào.


Phát hiện 7 — EU so với phần còn lại: chênh 16 điểm

Nhìn rộng hơn qua lăng kính quốc gia, sự tách biệt EU so với phần còn lại rất rõ:

Khu vựcnBất kỳ chặn AICụ thể
EU ccTLD (.fr, .de, .es, .it, .nl, .pl, .se, .dk, .fi, .be, .at, .cz, .hu, .ro, .gr, .pt, .ie, .sk, .bg)61735,2%33,9%
ccTLD quốc gia ngoài EU (.uk, .jp, .kr, .cn, .ru, .br, .in, .au, .mx, .ca, .tr, .ar, .cl, .co, .pe)89717,2%13,6%
Toàn cầu (.com, .net, .org, v.v.)5.73419,2%15,7%

Các site EU ccTLD chặn AI gấp đôi nhóm quốc gia ngoài EU và gần gấp đôi mức cơ sở toàn cầu .com. Khác biệt này nhất quán giữa các nước thành viên EU (không có quốc gia đơn lẻ nào kéo trung bình lên) và nhất quán giữa các ngành (.de tin tức ở 88%, .de SaaS khoảng 12%, .de thương mại điện tử khoảng 25% — tất cả đều cao hơn các đối tác toàn cầu).

Chúng tôi tìm thấy 275 tệp robots.txt trong top-10k đích danh nhắc tới Chỉ thị 2019/790 trong phần chú thích — khoảng 3,8% mẫu có thể phân tích. Nhóm này chủ yếu là các nhà xuất bản EU nhưng không chỉ giới hạn ở đó: một số thương hiệu tin tức Mỹ (đáng chú ý là NYT, dẫn chiếu thẳng “Art. 4 of the EU Directive”), một số site Anh, và một vài điểm đến thương mại điện tử lớn ở châu Âu cũng lặp lại ngôn ngữ pháp lý đó. 87 tệp nhắc tới “TDM” hoặc “text and data mining” theo tên. 460 tệp chứa một dạng ngôn ngữ bảo lưu bản quyền nào đó (“từ chối rõ ràng”, “mọi quyền được bảo lưu”, “không dùng cho mục đích thương mại”, “không học máy”) ngay cả khi không dẫn chiếu đạo luật cụ thể.

Hai quan sát chi tiết hơn từ lát cắt này:

Hiệu ứng EU không chỉ nằm ở tin tức. Khi giữ nguyên nhóm tin tức, các site EU không phải tin tức vẫn chặn AI với tỷ lệ cao hơn các site không phải tin tức ngoài EU (xấp xỉ 28% so với 14%). Một phần nhỏ nhưng có thật của SaaS, thương mại điện tử và học thuật ở EU đã nội hóa khung Điều 4 cho ngành của riêng họ.

Ngôn ngữ mang màu sắc EU đang trở thành mẫu mặc định ngay cả ngoài EU. Mẫu robots.txt được Cloudflare Managed sử dụng — triển khai toàn cầu — nêu đích danh "ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790" trong phần văn bản mẫu. Một site ở Mỹ bật cài đặt "Block AI Bots" của Cloudflare lên là, dù có thể không biết, đang khẳng định một sự bảo lưu quyền theo luật định của EU. Đây là một trong những hiện tượng trôi dạt chính sách thú vị nhất mà chúng tôi tìm thấy: một khái niệm pháp lý châu Âu đang được toàn cầu hóa qua giao diện sản phẩm của một nhà cung cấp hạ tầng Mỹ.


Phát hiện 8 — Mẫu và nguồn gốc mẫu

Phân rã nguồn mẫu của 6.638 site trả về robots.txt có thể phân tích được:

robots-txt-ai-bot-analysis.webp

MẫuSiteTỷ trọng
Không nhắc đến bot AI nào (mặc định kiểu Shopify, Yoast, hoặc viết tay không xét AI)5.02475,7%
Quy tắc AI tự viết / DIY1.18317,8%
Cloudflare Managed (Content-Signal: search=yes,ai-train=no)3024,5%
Explicit Allow: / cho GPTBot1241,9%
Mặc định Squarespace (28 UA AI trong khối giới hạn đường dẫn)50,1%

Quy tắc DIY chiếm ưu thế ở mức 17,8%. Nhóm chặn do tự soạn thảo được dẫn đầu bởi mọi nền tảng mạng xã hội (facebook.com, twitter.com, linkedin.com, whatsapp.com, tiktok.com, snapchat.com, pinterest.com, x.com, chính chatgpt.com), các điểm đến thương mại điện tử lớn nhất (amazon.com, amazonvideo.com), các thương hiệu tin tức lớn (nytimes.com, cnn.com, bbc.com, theguardian.com, forbes.com, reuters.com, bbc.co.uk, t-online.de, weather.com), những nền tảng streaming / media chủ chốt (netflix.com, vimeo.com, soundcloud.com, imdb.com), và phần đuôi dài của các site dịch vụ chuyên nghiệp (canva.com, medium.com).

Cloudflare Managed ở mức 4,5% — cao hơn nhiều so với mức thâm nhập của cùng mẫu đó ở phần đầu đường cong, và thấp hơn mức thâm nhập trong phần đuôi dài nằm ngoài cửa sổ của báo cáo này. Mẫu này được dùng nhiều nhất trong phân khúc hạng 1001–10000 (4–5%) và gần như vắng mặt ở phần đầu đường cong (Top 100: 1 site dùng; Top 101–1000: 5 site). Các tài sản toàn cầu lớn tự viết quy tắc; phần đuôi dài dùng công tắc.

Một vài site Cloudflare Managed cụ thể đáng chú ý. cloudflare.com chính nó chạy mẫu này, nhất quán với việc Cloudflare dùng sản phẩm của mình trên miền của chính mình. theatlantic.com chạy mẫu này — thương hiệu tin tức lớn duy nhất ở Mỹ mà chúng tôi tìm thấy không viết quy tắc tùy biến. spankbang.com chạy mẫu này — site người lớn xếp hạng cao nhất áp dụng chặn AI do Cloudflare chèn vào. linktr.ee chạy mẫu này, chặn huấn luyện AI trên toàn bộ nền kinh tế creator do Linktree lưu trữ bằng một quyết định từ phía nhà cung cấp. launchpad.net, nexusmods.com, vinted.fr, cookielaw.org, rustdesk.com, và một danh sách dài các tài sản media nhỏ hơn hoàn thiện nhóm Cloudflare Managed có thể nhìn thấy.

Mẫu áp dụng Cloudflare là bằng chứng cụ thể nhất mà chúng tôi từng thấy rằng một phần lớn “chính sách AI của web” đang được quyết định bởi các nhà cung cấp hạ tầng. Tỷ trọng tuyệt đối thì nhỏ (4,5%) nhưng về mặt cấu trúc lại quan trọng: đây là mẫu mặc định Cloudflare phát hành, và quỹ đạo bật mặc định trong 12 tháng tới là đi lên. Nếu Cloudflare chuyển công tắc sang bật mặc định cho tài khoản mới, tỷ lệ chặn toàn cầu sẽ tăng đáng kể mà không cần bất kỳ nhà xuất bản nào ra quyết định.

Mặc định Squarespace (5 site trong top-10k, nhưng nhiều hơn đáng kể ở ngoài mẫu của chúng tôi) là một kiểu khác: Squarespace phát hành robots.txt nêu 28 bot AI trong một khối duy nhất, nhưng các bot đó kế thừa hạn chế đường dẫn của User-agent: * thay vì nhận cấm toàn site. Trình thu thập AI vẫn có thể lấy /, trang chủ, trang sản phẩm, blog. Chúng chỉ không thể lấy /config hoặc /account. Trước đây chúng tôi đã lưu ý đây là nguồn của các kết quả “chặn AI” dương tính giả trong quét bên thứ ba các site Squarespace; lưu ý đó vẫn áp dụng ở đây.


Phát hiện 9 — Chính sách AI đồng đều trên toàn phân bố hạng

Trực giác thông thường cho kiểu nghiên cứu này là các site được truy cập nhiều nhất sẽ có chính sách AI gắt nhất — họ có nhiều thứ để mất nhất từ việc bị mô hình hóa thay thế, có năng lực pháp lý tốt nhất, và bị giám sát công khai nhất. Dữ liệu không ủng hộ trực giác đó.

Nhóm hạngnBất kỳ chặn AICụ thểCloudflare Managed
Top 1006722,4%17,9%1 site
Top 101–1.00059822,9%19,2%5 site
Top 1.001–5.0002.81019,0%15,3%99 site
Top 5.001–10.0003.77320,8%17,8%197 site

Bốn nhóm này đều nằm giữa 19% và 23%. Top 100 không hề gắt hơn nhóm đuôi dài từ hạng 5001 đến 10000. Tỷ lệ nổi bật này dường như là thuộc tính của web công khai năm 2026, không phải tín hiệu về độ lớn hay mức độ nổi bật của từng site riêng lẻ.

Có hai yếu tố góp phần. Thứ nhất, phần đầu đường cong bị chi phối bởi các miền hạ tầng / SaaS / tìm kiếm / cổng thông tin (Microsoft, Apple, Google, v.v.) vốn có tỷ lệ chặn AI thấp tự thân. Thứ hai, phần đuôi dài bao gồm tỷ lệ cao các nhà xuất bản tin tức khu vực và các site chịu thẩm quyền EU vốn — như Phát hiện 6 và 7 cho thấy — chặn AI mạnh hơn mức trung bình toàn cầu. Hai tác động này gần như triệt tiêu nhau, và kết quả ròng là một headline khá đồng đều.

Cột Cloudflare Managed có dịch chuyển theo đường cong. Top 1000 có 6 site dùng Cloudflare-managed (1,0%); Top 1001–10000 có 296 (5,7%). Các site lớn tự viết quy tắc; phần đuôi dài dùng công tắc của nhà cung cấp. Đây là tín hiệu duy nhất phụ thuộc hạng có ý nghĩa trong bộ dữ liệu, và nó cho thấy khi đi từ đầu web xuống đuôi dài, tỷ trọng chính sách AI do nhà cung cấp đặt thay vì do nhà xuất bản đặt tăng đều. Chúng tôi kỳ vọng độ dốc này sẽ tiếp tục ngoài top 10k vào top 100k và xa hơn nữa.


Phát hiện 10 — Năm cấu trúc: robots.txt trông như thế nào khi nó thực sự là chính sách

Các con số mô tả hình dạng của bộ dữ liệu; bản chất thực của “chính sách AI trên web công khai” được nhìn rõ nhất khi đọc các tệp cụ thể. Dưới đây là năm tệp đáng xem xét, được chọn để bao trùm toàn bộ không gian chính sách.

Cấu trúc 1 — The New York Times (nytimes.com)

14 dòng đầu tiên của nytimes.com/robots.txt:

# New York Times content is made available for your personal, non-commercial
# use subject to our Terms of Service here:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# Use of any device, tool, or process designed to data mine or scrape the content
# using automated means is prohibited without prior written permission from
# The New York Times Company. Prohibited uses include but are not limited to:
# (1) text and data mining activities under Art. 4 of the EU Directive on Copyright in
# the Digital Single Market;
# (2) the development of any software, machine learning, artificial intelligence (AI),
# and/or large language models (LLMs);
# (3) creating or providing archived or cached data sets containing our content to others; and/or
# (4) any commercial purposes.
# Contact https://nytlicensing.com/contact/ for assistance.

Đây là robots.txt như một chứng cứ pháp lý. Tệp được cấu trúc để có thể dùng làm bằng chứng trong vụ kiện NYT v. OpenAI mà nó tham gia. Các tham chiếu đến “Art. 4 of the EU Directive” — do một nhà xuất bản Mỹ viết — minh họa quan sát ở Phát hiện 7 rằng các khung pháp lý EU đang thấm vào diễn ngôn toàn cầu. Lệnh cấm rõ ràng đối với việc “tạo hoặc cung cấp bộ dữ liệu đã lưu trữ hoặc được cache” nhắm thẳng vào Common Crawl. Tệp dài hơn 60 dòng với các khối User-agent được đặt tên cho GPTBot, OAI-SearchBot, ChatGPT-User, anthropic-ai, ClaudeBot, CCBot, Google-Extended, Applebot-Extended, Bytespider, Diffbot, Meta-ExternalAgent, Amazonbot, Omgili, Omgilibot và nửa tá bot khác — mỗi bot được nêu tên đều có Disallow: / riêng.

Cấu trúc 2 — Der Spiegel (spiegel.de) — cho phép AI ở cấp độ từng mục

Der Spiegelrobots.txt tinh vi nhất về mặt vận hành mà chúng tôi tìm thấy trong toàn bộ bộ dữ liệu. Khối liên quan:

# TLP-6507: Testweise Freischaltung der OpenAI-Suchcrawler fuer ausgewaehlte Bereiche
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

Chú thích này dịch là “Bật thử nghiệm các trình thu thập tìm kiếm của OpenAI cho các khu vực được chọn.” Spiegel đã đưa bảy nhóm nội dung cụ thể vào danh sách cho phép — tin tức quốc tế, quan hệ đối tác, sức khỏe, gia đình, du lịch, tâm lý học và phong cách sống — cho các UA suy luận của OpenAI trong khi chặn mọi thứ khác. Các mục chính trị, tin tức quốc gia Đức và bài điều tra đều bị loại trừ rõ ràng. Common Crawl, Bytespider, Cohere, Webzio-Extended và các UA huấn luyện khác đều bị Disallow: / hoàn toàn ở phần sau của tệp.

Đây là robots.txt như một chính sách biên tập ở cấp từng mục. Lý thuyết ngầm là nội dung lifestyle có rủi ro bị thay thế trong huấn luyện thấp hơn và lợi ích trích dẫn khi suy luận cao hơn, nên Spiegel cho AI hiển thị những phần đó; nội dung chính trị và điều tra là con hào bảo vệ, nên AI bị loại trừ. Chúng tôi chưa thấy mẫu này ở nơi khác. Nó cho thấy mức phối hợp nội bộ giữa biên tập, pháp lý và hạ tầng mà phần lớn tòa soạn chưa đạt tới. Chúng tôi kỳ vọng kiểu biểu đạt chính sách chi tiết ở cấp mục sẽ lan rộng trong 2026–2027 — tệp của Spiegel gần như là chỉ báo dẫn đầu.

Cấu trúc 3 — BBC (bbc.com) — dạng tuyên bố chính sách

robots.txt của BBC mở đầu bằng:

# version: ec59bd036e5138eb4831a9ed44447b1ff310e235
# The BBC's Terms of Use: https://www.bbc.co.uk/terms
# - Explain the rules for using our services
# - Tell you what you can do with our content
#
# In short: Please use our site like a human, not a robot.
# That means:
# - No scraping, crawling, or systematic extraction of content
# - No use of BBC content for training or fine-tuning AI models, including LLMs
# - No retrieval-augmented generation (RAG), AI-powered search, agentic AI or
#   grounding using BBC content
# - No creating datasets from BBC content
# - No text and data mining (TDM) under Article 4 of the EU Directive on Copyright
# - No using BBC content to create summaries for your own use
# - No business use without permission
# - The BBC reserves all rights in its content and expressly opts out of any
#   statutory exceptions in any jurisdiction for text and data mining,
#   as permitted by law
#
# TL;DR: Browse, read, watch, enjoy - like a human.

BBC gắn phiên bản cho robots.txt của mình (dòng # version: ec59bd... là hash commit git), cấm tám kiểu dùng AI cụ thể mà luật sư BBC đang theo dõi, và kết thúc bằng một dòng tóm tắt theo giọng văn mà thương hiệu BBC xây dựng. Cụm “expressly opts out of any statutory exceptions in any jurisdiction” là một bảo lưu toàn cầu có chủ ý — nó nói rằng chúng tôi không tin bất kỳ chế độ pháp lý đơn lẻ nào sẽ cho ta mức bảo vệ mình muốn, nên chúng tôi khẳng định opt-out ở mọi nơi cùng lúc. Đây là robots.txt được biên tập kỹ nhất trong bộ dữ liệu, và nó đọc giống thông cáo báo chí hơn là tệp cấu hình.

Cấu trúc 4 — WordPress.org — sự chào đón công khai

So sánh tất cả những điều trên với wordpress.org:

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: anthropic-ai
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Bytespider
Allow: /

User-agent: CCBot
Allow: /

User-agent: Copilot
Allow: /

WordPress.org công khai opt in cho chín trình thu thập huấn luyện AI, bao gồm ba bot (Bytespider, CCBot, anthropic-ai) vốn bị chặn nhiều nhất ở nơi khác. Lý thuyết ngầm là hệ sinh thái tài liệu và plugin của WordPress là một lợi ích công mà giá trị tăng lên khi các trợ lý AI có thể trả lời câu hỏi về nó. Mỗi khi ai đó hỏi Claude “làm thế nào để cấu hình permalink trong WordPress?” và Claude đã được huấn luyện trên wordpress.org/documentation/, sứ mệnh của WordPress đã được phục vụ. Có vẻ Quỹ WordPress đã quyết định rằng việc có mặt trong kho ngữ liệu huấn luyện của mọi mô hình là một lợi thế chiến lược, và họ đã dùng ngữ pháp biểu đạt của tệp để nói rõ điều đó.

Cấu trúc 5 — The Verge (theverge.com) — mô hình lai có tài trợ

Một mẫu khác đáng để nêu. The Verge cấu trúc quy tắc AI của họ thành Disallow: / \ Allow: /sp/:

User-agent: GPTBot
Allow: /

User-agent: Applebot
Allow: /

User-agent: Google-Extended
Disallow: /
Allow: /sp/

User-agent: anthropic-ai
Disallow: /
Allow: /sp/

User-agent: Bytespider
Disallow: /
Allow: /sp/

User-agent: CCBot
Disallow: /
Allow: /sp/

User-agent: ChatGPT-User
Disallow: /
Allow: /sp/

User-agent: ClaudeBot
Disallow: /
Allow: /sp/

Đường dẫn /sp/ là mục nội dung tài trợ / đối tác của The Verge. Nội dung biên tập bị chặn khỏi huấn luyện AI; nội dung tài trợ được cho phép. Logic kinh tế rất rõ: nhà tài trợ trả tiền để nội dung của họ có thể được khám phá, bao gồm cả qua AI; còn mảng biên tập chính là con hào bảo vệ. GPTBot được mở hoàn toàn (nhiều khả năng do quan hệ trực tiếp với OpenAI), Applebot được mở hoàn toàn như một mốc tìm kiếm cơ bản, và phần còn lại nhận xử lý lai. Đây là cấu trúc “quyền truy cập AI theo tầng” duy nhất như vậy mà chúng tôi tìm thấy.

Năm tệp này mô tả phổ hiện tại của chính sách AI trong robots.txt. Phần lớn các tệp trong top 10k không giống bất kỳ tệp nào trong số này — chúng hoặc im lặng, hoặc dùng mẫu của nhà cung cấp. Những tệp trông giống một trong số này được viết bởi những người đã quyết định rằng tệp đó đáng để đọc kỹ.

Một lưu ý về quy mô tệp: thân robots.txt trung vị trong mẫu của chúng tôi là 858 byte — quá nhỏ để mã hóa một chính sách AI có ý nghĩa. Phần đuôi phải là nơi quy tắc thực sự nằm: 1.005 site (15,3%) có tệp lớn hơn 5 KB, 273 site lớn hơn 20 KB, và lớn nhất là 248 KB. 460 tệp chứa ngôn ngữ bảo lưu bản quyền; 275 tệp nêu đích danh EU 2019/790. Năm 2026, robots.txt ngày càng là một tài liệu có phiên bản, được luật sư rà soát, chứ không còn là một dòng cấu hình.


Phát hiện 11 — 108 site công khai chào đón GPTBot

Một nhóm nhỏ nhưng nhìn thấy rõ viết quy tắc User-agent: GPTBot \n Allow: / — đảo ngược của kiểu “Disallow GPTBot” thường được bàn nhiều hơn. Tổng số trong mẫu của chúng tôi là 108 site có explicit Allow cho GPTBot ở đường dẫn gốc. 25 site đầu theo hạng Tranco:

gptbot-welcoming-sites.webp

HạngTên miềnNgành
42wordpress.orgCông cụ dev / CMS
133kaspersky.comBảo mật
187avast.comBảo mật
265hp.comHãng phần cứng
624branch.ioSaaS đo lường phân bổ di động
692sophos.comBảo mật
782theverge.comTin tức
905rambler.ruCổng thông tin Nga
945kleinanzeigen.deThị trường Đức
948theatlantic.comTin tức
1.092lge.comLG Electronics
1.300justdial.comTìm kiếm địa phương Ấn Độ
1.332avira.comBảo mật
1.412youm7.comTin tức Ai Cập
1.530goodreturns.inTài chính Ấn Độ
1.621publi24.roRao vặt Romania
1.807geocomply.comSaaS tuân thủ
1.908nba.comThể thao
1.956oneindia.comTin tức Ấn Độ
1.974mindbox.ruSaaS Nga
2.009thesun.co.ukTin tức
2.126vox.comTin tức
2.140mgid.comQuảng cáo gốc
2.314ninjarmm.comSaaS quản trị CNTT
2.323norton.comBảo mật

Một vài mẫu hình:

Các công ty bảo mật được đại diện quá mức một cách rõ rệt. Kaspersky, Avast, Sophos, Avira, Norton, NinjaRMM đều công khai cho phép GPTBot. Đây là một động thái phân phối có chủ đích: khi người dùng hỏi ChatGPT “đâu là antivirus tốt nhất cho máy Windows của tôi?”, việc thương hiệu có mặt trong kho ngữ liệu huấn luyện của mô hình sẽ ảnh hưởng trực tiếp đến khuyến nghị. Bảo mật là một trong số ít danh mục sản phẩm B2C nơi tìm kiếm AI đang thay thế SEO như kênh thu hút chính, và các thương hiệu này đã đi trước. Chúng tôi dự đoán phần còn lại của nhóm bảo mật sẽ theo sau trong vòng 12 tháng.

Một số thương hiệu tin tức lớn nằm trong danh sách này chứ không phải danh sách chặn. The Verge, The Atlantic, Vox, The Sun, NBA.com. Điều này không mâu thuẫn — các nhà xuất bản này dường như đã quyết định rằng được trích dẫn trong tìm kiếm ChatGPT có giá trị hơn việc được bảo vệ khỏi huấn luyện, và họ viết quy tắc Allow rõ ràng để phòng việc CDN hoặc CMS chặn quá tay trong tương lai. So sánh với lập trường explicit Disallow của NYT / Reuters / BBC / Forbes / Guardian. Cả hai đều có thể bảo vệ được; ngành tin tức không hề đồng nhất.

Sự hiện diện của The Sun rất đáng chú ý vì cùng site này ở nơi khác trong tệp lại dùng khối User-agent: * chặn tất cả. Tốt nhất nên đọc chính sách của The Sun là “huấn luyện AI bị cấm, tìm kiếm AI được phép, và chúng tôi đã chủ động whitelist GPTBot như một ngoại lệ của deny-all để bảo đảm ChatGPT có thể trả lời câu hỏi có trích dẫn The Sun.” Đây là quy tắc GPTBot-Allow tinh vi nhất về mặt pháp lý — một phần opt-out cộng với một phần opt-in dành cho một nhà cung cấp duy nhất.

Sự xuất hiện của WordPress.org là mục đơn lẻ quan trọng nhất trong danh sách. Một phần không nhỏ của hệ sinh thái CMS mã nguồn mở toàn cầu hoặc dẫn về WordPress.org để lấy tài liệu, hoặc chứa plugin từ đó. Bằng cách công khai cho phép GPTBot trong wordpress.org/robots.txt, Quỹ WordPress gần như đã nói rằng hệ sinh thái tài liệu WordPress mở cho việc huấn luyện — và điều này có tác động dây chuyền đến khả năng Claude, Gemini, ChatGPT trả lời các câu hỏi “làm thế nào để...” về WordPress.

83 site còn lại trong danh sách Allow-GPTBot đầy đủ là một đuôi dài gồm tin tức khu vực, nhà cung cấp bảo mật nhỏ hơn, nền tảng rao vặt ở các thị trường không nói tiếng Anh, và SaaS B2B. Theo những gì chúng tôi thấy, không có sự điều phối “Allow-GPTBot” trên quy mô ngành — quy tắc này đang được áp dụng từng site một, bởi các nhà vận hành đã quyết định rằng nằm trong kho ngữ liệu là vị thế chiến lược.


Phát hiện 12 — llms.txt gần như chỉ là tin đồn ở quy mô này

llms.txt, định dạng tệp thay thế đề xuất cho việc khám phá nội dung thân thiện với LLM (được Mintlify, Anthropic, Vercel và một số nhà cung cấp công cụ dev ủng hộ từ cuối 2024), hầu như không xuất hiện trong mẫu của chúng tôi.

Trong số 6.638 site trả về robots.txt có thể phân tích được, 83 site (1,15%) nhắc đến llms.txt — thường là dưới dạng dòng Sitemap: https://example.com/llms.txt. Con số này thấp hơn hai bậc độ lớn so với cùng chỉ số đo trên các mẫu thương mại nặng công cụ dev, nơi mặc định của Vercel và Mintlify làm tăng tỷ lệ chấp nhận.

llms-txt-robots-adoption-rate.webp

Phân rã theo ngành:

Ngànhn% nhắc đến llms.txt
Hạ tầng474,3%
Cờ bạc1003,0%
SaaS3693,0%
Viễn thông333,0%
Thương mại điện tử2241,8%
Du lịch641,6%
Công cụ dev1291,6%
Tin tức6500,8%
Nội dung người lớn2540,4%
Chính phủ1720,0%
Học thuật2680,0%
Tìm kiếm120,0%

llms.txt tập trung ở SaaS liên quan công cụ dev, cờ bạc (ngành này áp dụng các tính năng robots.txt dùng từ vựng mới nhanh hơn các ngành bị quản lý khác vì họ có đội tuân thủ quen với việc thêm metadata), và thương mại điện tử B2B. Nó vắng mặt một cách đáng chú ý ở tin tức và chính phủ — hai nhóm gắn với chính sách AI nhiều nhất và cũng là nơi cần thiết để tiêu chuẩn này thăng hạng từ “thử nghiệm của nhà cung cấp” lên “giao thức web.” Cho đến lúc đó, llms.txt là thứ có thật nhưng còn nhỏ, và một lần kiểm tra tiếp theo vào cuối năm 2026 sẽ rất đáng giá.

Vấn đề cấu trúc mà llms.txt đang đối mặt là nó chưa được tiêu chuẩn hóa bởi bất kỳ quy trình IETF nào và các nhà cung cấp AI lớn cũng chưa cam kết tôn trọng nó. Một quy tắc robots.txt có 30 năm hạ tầng crawler xoay quanh; một quy tắc llms.txt thì không. Cho đến khi ít nhất một nhà cung cấp lớn (OpenAI, Anthropic, Google, Cloudflare) tuyên bố hỗ trợ chính thức, tệp này về cơ bản vẫn là một hiện vật marketing của hệ sinh thái Mintlify / Vercel. Chúng tôi không kỳ vọng điều đó thay đổi trong năm 2026.


Phát hiện 13 — Khả năng tiếp cận: robots.txt vẫn đọc được với hai phần ba web hàng đầu

Một quan sát phụ đáng lẽ không phải là phát hiện: 66% trong top 10.000 site trả về robots.txt có thể phân tích được cho một IP nghiên cứu duy nhất, và chỉ 7 trên 10.000 (0,07%) trả về 429 Too Many Requests. Đây là tin tốt cho robots.txt như một giao thức công khai.

Để so sánh, cùng pipeline đó chạy trên một mẫu thương mại cỡ 1.008 miền hai tháng trước đã nhận 429 từ 52% các miền được phân giải — Shopify và CDN của Cloudflare áp dụng giới hạn tốc độ rất mạnh với mọi UA không phải công cụ tìm kiếm lớn. Web có lưu lượng cao thân thiện hơn nhiều: các site top đầu có xu hướng hoặc (a) ít có tầng quản lý bot khắt khe hơn, hoặc (b) có danh sách cho phép rõ ràng cho crawler nghiên cứu đã biết, hoặc cả hai.

Tỷ lệ fetch_failed 21% trên top-10k chủ yếu đến từ các miền apex CDN (akamai.net, cloudfront.net, fastly.net, apple-dns.net, gtld-servers.net) vốn không chạy webserver trên /. Họ không chặn chúng tôi; họ đơn giản không có gì để phục vụ. Nếu loại trừ nhóm đó, tỷ lệ thất bại thực sự “đã cố đọc nhưng không được” chỉ ở mức thấp một con số.

Điều này có nghĩa những phiên bản tiếp theo của báo cáo này — ảnh chụp hàng quý, so sánh năm qua năm — có thể chạy rẻ và tái lập trên một máy duy nhất. Cửa sổ kiểm tra vẫn mở ở đầu đường cong. Trường hợp bất đối xứng là phần đuôi dài và phân khúc thương mại, nơi giới hạn tốc độ ở tầng CDN gần như đã tư hữu hóa robots.txt. Chúng tôi kỳ vọng khoảng cách này sẽ nới rộng: các site top đầu vẫn đọc được vì chúng được các công cụ tìm kiếm cần khả năng đọc; phần thương mại đuôi dài sẽ ngày càng khó đọc hơn khi các tầng bot-fight của Cloudflare được triển khai mạnh hơn. Khả năng kiểm toán công khai của robots.txt đang phân cực theo cùng đường ranh giới tách “web có thể nhìn thấy” và “web được bảo vệ về mặt vận hành.”


IV. Tất cả điều này có nghĩa gì

Bốn luận điểm, theo thứ tự mức độ dữ liệu ủng hộ.

1. Internet có chính sách AI theo từng ngành, không phải một chính sách AI toàn cầu. Khoảng cách 12 lần giữa tin tức và viễn thông chi phối mọi con số tổng hợp. Báo cáo “X% web chặn AI” mà không tách theo ngành sẽ làm quá lên SaaS/chính phủ/dev và làm giảm tin tức/du lịch/mạng xã hội. Chỉ có cách nhìn theo từng ngành mới là khung trung thực.

2. Điều 4 của Chỉ thị bản quyền EU là chế độ pháp lý duy nhất đang làm các con số thay đổi rõ rệt. Các site EU ccTLD chặn ở mức 35% so với mức cơ sở 19% toàn cầu. Các vụ kiện tại Mỹ (NYT kiện OpenAI, báo cáo tháng 1 năm 2025 của Copyright Office) đã làm thay đổi nhóm tin tức Mỹ nhưng không làm đổi web Mỹ rộng hơn. Khung EU cũng đang rò rỉ ra toàn cầu thông qua mẫu của Cloudflare, vốn dẫn chiếu Chỉ thị 2019/790 trong văn bản mẫu bất kể khu vực pháp lý của khách hàng.

3. Hai “chính sách AI” song song đang được thể hiện và chúng không đồng ý với nhau. Chính sách viết tay, cố ý (17,8%, chủ yếu ở tin tức/mạng xã hội/du lịch/thương mại điện tử) và chính sách kế thừa do Cloudflare quản lý (4,5%) trùng nhau về nội dung nhưng khác nhau về tính chính danh. Trong thế giới mà các nhà vận hành AI đang tìm lý do pháp lý để phớt lờ robots.txt, lập luận “chúng tôi tự viết và đã rà soát nó” mạnh hơn về cấu trúc so với “tôi chỉ bật công tắc lên thôi.” Động lực tố tụng là đẩy chính sách từ nhóm thứ hai sang nhóm thứ nhất.

4. Thứ bị nhà xuất bản chặn là kho ngữ liệu, không phải mô hình. CCBot ở mức 16,3% — cao hơn mọi bot mang thương hiệu mô hình — là tuyên bố rõ nhất cho điều này. Chặn OpenAI không giúp nhà xuất bản thoát khỏi việc bị huấn luyện trên đó; chặn CCBot thì có. 14,1% web top-10k chặn CCBot nhưng vẫn cho Googlebot vào. Mẫu “chặn huấn luyện, giữ tìm kiếm” là quy tắc AI điển hình của năm 2026.

Đối với các site đang cân nhắc lập trường riêng: lập trường phổ biến nhất là im lặng — 80% web top-10k không nói gì về AI. 17% viết quy tắc chủ yếu tập trung vào Disallow, nhưng một nhóm nhỏ đang tăng lên (danh sách explicit-Allow-GPTBot 1,5%, dẫn đầu là các nhà cung cấp bảo mật) đang công khai chọn chiều ngược lại. Không có đồng thuận ngành và cũng sẽ không có trong 12 tháng tới.

Đối với các nhà vận hành AI: việc tiếp tục lập luận rằng robots.txt là giao thức cũ với ngữ nghĩa mơ hồ ngày càng khó đứng vững khi 17% trong số các site lớn nhất thế giới đã viết ra các quy tắc cố ý nêu tên bot một cách rõ ràng, và 3,8% tệp nêu đích danh đạo luật EU theo số điều. Có tôn trọng các quy tắc đó hay không là quyết định kinh doanh; việc chúng tồn tại hay không giờ là sự thật thực nghiệm.


V. Triển vọng: chúng tôi kỳ vọng gì đến cuối năm 2026

Ba quỹ đạo hiện ra trong bộ dữ liệu:

Cloudflare Managed sẽ hơn gấp đôi thị phần, có khả năng chạm trên 10% của top-10k có thể phân tích. Lộ trình của Cloudflare công khai bàn về việc bật mặc định Block AI Bots cho tài khoản mới. Nếu công tắc này được phát hành ở trạng thái bật mặc định, tỷ lệ chặn toàn cầu sẽ tăng 5–8 điểm phần trăm mà không cần nhà xuất bản nào quyết định. Chúng ta sẽ biết điều này đang xảy ra khi tỷ trọng Cloudflare Managed của nhóm hạng 5001–10000 vượt mức hiện tại 5,7%.

Chính sách AI ở cấp từng mục (kiểu Spiegel) sẽ lan sang các cột cờ tin tức lớn. Logic kinh tế — cho AI trích dẫn nội dung ít nhạy cảm, bảo vệ nội dung con hào — đủ thuyết phục để chúng tôi kỳ vọng ít nhất 10 tòa soạn lớn nữa sẽ phát hành quy tắc cấp mục trước khi 2026 kết thúc. Hãy để mắt tới báo chí tầm trung ở Đức và Pháp trước; khung pháp lý ở đó khuyến khích thử nghiệm.

Nhóm explicit-Allow-GPTBot sẽ tăng lên, do SaaS B2B và công cụ dev dẫn dắt. Khi tìm kiếm AI trở thành một kênh thu hút có thể đo đếm đối với các nhà cung cấp phần mềm (như hiện đã là với bảo mật), CMO ở mức biên sẽ viết User-agent: GPTBot \n Allow: / để tránh bị chặn quá tay do vô tình. Chúng tôi kỳ vọng danh sách 108 site sẽ xấp xỉ tăng gấp đôi vào cuối năm.

Điều chúng tôi không kỳ vọng: tỷ trọng im lặng của đa số thay đổi đáng kể. 80% web không nói gì về AI bao gồm các ngành (chính phủ, viễn thông, hạ tầng, SaaS B2B) không có động cơ kinh tế để viết quy tắc và cũng không chịu áp lực pháp lý để làm vậy. Chính sách AI phổ quát sẽ không xuất hiện.


VI. Hạn chế

  1. Sai lệch do chỉ chụp một thời điểm. Việc thu thập diễn ra trong cửa sổ 36 giờ đầu tháng 5 năm 2026. Tệp thay đổi hàng ngày ở top 100; hãy kỳ vọng độ trôi 1–2 điểm phần trăm mỗi quý trên các con số headline.
  2. Khoảng trống phân loại ngành. 6.593 trong 10.000 site vẫn là unknown sau bộ phân loại bốn lớp. Tỷ lệ theo ngành ổn định khi n lớn (tin tức: 650, streaming: 440, saas: 369, academia: 268, adult: 254, ecommerce: 224, gov: 172, finance: 129, dev: 129) và nhiễu hơn khi n < 30. Lát cắt tin tức theo quốc gia cũng có giới hạn tương tự — DE/FR/UK có n≥15, còn Hàn Quốc/Thụy Điển/Séc dựa trên n=20–25.
  3. robots.txt là tự nguyện. Disallow là một yêu cầu, không phải rào chắn. Bytespider, PerplexityBot và các bot khác đã được ghi nhận là phớt lờ quy tắc. Chúng tôi đo tuyên bố chính sách, không phải thực thi chính sách.
  4. Kiểm toán một IP duy nhất, đặt ở Mỹ. Chúng tôi không đọc được 21% các miền được phân giải. Phần lớn là các miền apex CDN không có webserver; một phần nhỏ là các site mà CDN của họ chặn chúng tôi trước khi đến được origin. Điều này làm mẫu hơi thiên về hạ tầng cũ và bất lợi cho các site bị geofence theo quốc gia gốc.
  5. Ngữ nghĩa của danh sách Tranco. Tranco lọc theo độ ổn định; nó không phải bảng xếp hạng hành vi người dùng thực sự. Các con số tổng hợp vẫn vững trước lựa chọn danh sách; nhưng vị trí hạng cụ thể thì không.
  6. Không có dữ liệu lưu lượng. Chúng tôi đo chính sách robots.txt, không đo lưu lượng bot AI thực tế. Chính sách và lưu lượng không phải lúc nào cũng đồng nhất.

VII. Tái tạo báo cáo này

Mọi thứ dùng để tạo báo cáo này đều nằm trong thư mục giao nộp.

  • tranco_top10k.csv — danh sách đầu vào
  • out/sites.csv — miền × hạng × ngành × ngôn ngữ × trạng thái robots.txt (10.000 dòng)
  • out/fetch_meta.csv — kết quả thu thập theo từng miền (trạng thái, scheme, byte, lỗi)
  • out/bot_status.csv — lưới miền × bot (250.000 dòng: bị chặn, có quy tắc, trạng thái thu thập)
  • out/site_meta.csv — một bản ghi phân tích cho mỗi site (mẫu, các cờ boolean tổng hợp)
  • out/analysis.json — mọi chỉ số được trích dẫn trong báo cáo
  • 01_fetch_robots.py, 02_classify.py, 03_parse_and_analyze.py — toàn bộ pipeline Python

Tải xuống toàn bộ script và bộ dữ liệu


Chúng tôi hoan nghênh các chỉnh sửa về phương pháp, vấn đề dữ liệu và phân tích tiếp theo tại support@thunderbit.com. Báo cáo này được công bố độc lập với bất kỳ vị thế thương mại nào Thunderbit đang có; chúng tôi xây dựng một công cụ thu thập dữ liệu web bằng AI, và chúng tôi có lợi ích cấu trúc trong việc robots.txt tiếp tục là một hợp đồng có ý nghĩa, có thể đọc bằng máy trên web công khai. Dữ liệu trong báo cáo này tự đứng vững. — Nhóm nghiên cứu Thunderbit, tháng 5 năm 2026.

Dùng thử Công cụ thu thập dữ liệu web bằng AI của Thunderbit Get Started Free

Shuai Guan
Shuai Guan
CEO tại Thunderbit | Chuyên gia Tự động hóa Dữ liệu AI Shuai Guan là CEO của Thunderbit và là cựu sinh viên ngành Kỹ thuật của University of Michigan. Với gần một thập kỷ kinh nghiệm trong lĩnh vực công nghệ và kiến trúc SaaS, anh chuyên biến các mô hình AI phức tạp thành những công cụ trích xuất dữ liệu thực tiễn, không cần viết mã. Trên blog này, anh chia sẻ những góc nhìn thẳng thắn, đã được kiểm chứng qua thực chiến về web scraping và các chiến lược tự động hóa, giúp bạn xây dựng quy trình làm việc thông minh hơn, dựa trên dữ liệu. Khi không tối ưu hóa quy trình dữ liệu, anh áp dụng sự tỉ mỉ đó vào niềm đam mê nhiếp ảnh.
Mục lục

Cào một trang web chỉ bằng cách hỏi

Nói bạn cần gì bằng tiếng Anh đơn giản. Hoặc tốt hơn, không cần nói gì cả.

Dùng Thunderbit ngay miễn phí
Trích xuất dữ liệu bằng AI
Dễ dàng chuyển dữ liệu sang Google Sheets, Airtable hoặc Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week