執行摘要
想知道網站對 AI 到底是什麼態度,最誠實的地方不是官方聲明,而是一份藏在網址結尾的小檔案:robots.txt。我們把 Tranco 前 10,000 名網域的這份檔案一個個抓回來,用符合 RFC 9309 的解析器逐行讀,統計 2026 年全球最熱門的網站裡,到底有多少真的伸手去攔 ChatGPT、Claude、Perplexity、Gemini、Common Crawl、Bytespider、Apple Intelligence,還有其餘那一票餵養與服務大型語言模型的爬蟲。
其中 7,248 個網站給了我們可讀的檔案。幾個核心數字如下:

全球前 10,000 名網站中,有 20.3% 封鎖至少一個 AI 爬蟲。17.0% 有明確、針對 AI 的刻意規則。其餘 80% 對 AI 爬蟲的態度,和對 Googlebot 一樣開放。
有六個發現,把外界對這件事的印象整個翻了過來:
- 新聞機構的封鎖率達 47% —— 這是所有產業裡最高的。攤到國別更誇張:德國新聞業 88%,法國 80%,俄羅斯 0%。真正在拉動這條曲線的是法規,不是技術問題,也不是產業經濟。
CCBot(Common Crawl)是最常被封鎖的機器人,達 16.3% —— 比GPTBot(15.8%)和Bytespider(14.9%)都高。出版商瞄準的其實是訓練資料的源頭,而不是哪個模型品牌。最典型的選擇性規則就是「封鎖CCBot、放行Googlebot」(14.1% 的網站這麼寫)。- 法國以
.fr網站 50.6% 的 AI 封鎖率領先全球;EU 群組整體比全球基準高出 16 個百分點。 有 275 份robots.txt直接寫出 EU 指令 2019/790。攤開來看,第 4 條是唯一一個明顯讓數字動起來的法律制度。 - 17.8% 是自己動手寫的 AI 規則;4.5% 套用 Cloudflare 的供應商範本;75.7% 什麼都沒提。 大型網站傾向自己寫,長尾網站則直接把開關打開。有趣的是,The Atlantic 和
cloudflare.com本身,都落在 Cloudflare Managed 這一格。 - 有 108 個網站反過來明確 放行
GPTBot—— WordPress.org、Kaspersky、Norton、Avast、Sophos、The Verge、The Atlantic、NBA.com、The Sun、Branch.io 都在其中。資安與開發工具類網站在這份名單上特別密集。 - AI 政策並沒有越往排名前段就越強硬。 前 100 名、101–1000 名、1001–5000 名、5001–10000 名,全都落在 19% 到 23% 這個窄帶內。這個頭條比例,反映的是 2026 年公開網路的整體面貌,跟某個單一大站有多龐大沒什麼關係。
所以,該問的問題已經不是「網路是不是在反擊」了。而是——哪些產業、哪些國家、哪些法規制度,還有哪些 AI 供應商,成了這些積極政策的靶子;又有哪些,被放過了。
I. 背景:robots.txt 怎麼變成了 AI 政策的載體
OpenAI 在 2023 年 8 月推出 GPTBot 之後,有三股力量把 robots.txt 的意義重新改寫了一遍。
AI 供應商一個接一個冒出來。 Google 的 Google-Extended、Anthropic 的 ClaudeBot、ByteDance 的 Bytespider、Apple 的 Applebot-Extended、Amazon 的 Amazonbot、Meta 的 Meta-ExternalAgent 陸續登場。原本就存在的 Common Crawl CCBot,因為它的封存資料餵養了絕大多數開源權重模型,反倒成了最有份量的封鎖目標。除了供應商自家的爬蟲,還有一批第三方的:AI2Bot、cohere-ai、PerplexityBot、YouBot、DuckAssistBot、Diffbot、Omgili。到 2026 年,一份寫得齊全的封鎖清單,大概要點到 25 個名字。
EU 著作權指令 2019/790 第 4 條替文本與資料探勘留了一個法定例外,但有個前提:權利人得用「機器可讀」的方式「明確保留」自己的權利。2024 到 2025 年這兩年,EU 的出版商和律師界慢慢達成共識,把 robots.txt 當成表達這種保留的標準做法。資料也印證了這一點——有 275 個網站在檔案裡直接引用 2019/790 指令,另有 87 個提到「TDM」;這些內容多半集中在歐洲新聞網站,通常是開頭那 4 到 8 行的法律前言。
Cloudflare 則把這個開關做成了產品。 2024 到 2025 年間,Cloudflare 陸續端出「AI Audit」儀表板、「Block AI Bots」切換開關,還有一份帶 Content-Signal: search=yes,ai-train=no 語法、內建 EU 2019/790 範本文字的 Managed robots.txt 範本。到 2026 年 5 月,這份範本已經跑在可解析前 10k 網站的 4.5% 上。而 Cloudflare 的產品路線圖公開講過,打算對新帳號預設開啟這個開關——真要這麼做,全球封鎖率會在沒有任何一家出版商拍板的情況下,硬生生往上抬 5 到 8 個百分點。
到了 2026 年,robots.txt 早已不是 2022 年那個沒人多看一眼的設定檔。在 EU,它是一種有條約背書的著作權保留機制;在長尾網站裡,它是被供應商塑形的政策載體;而在網站經營者與模型訓練者之間,它更是一條正在慢慢談判的前線。
II. 方法論
我們刻意把整件事做得很無聊、可以完整重跑。從 Python 腳本、解析後的 CSV、原始 robots.txt 檔案庫到圖表,全流程都隨這份報告一起公開。
樣本
一切從 2026 年 5 月的 Tranco 清單開始,下載成 top-1m.csv.zip,取最前面 10,000 筆。Tranco 的做法是把四家上游排名(Cisco Umbrella、Majestic、Farsight 與 Cloudflare Radar)攪在一起,拿 30 天視窗把不穩定的項目濾掉,順手再刮掉明顯的爬蟲/CDN 雜訊。這樣做出來的名單,是公開資料裡最接近「全球流量前 10,000」的一份,也是學界慣用的網路研究樣本——KU Leuven 2018 年推出至今,已經有 600 多篇同儕審查論文引過它。
名單裡其實摻了三種網域:(a) 人會真的去點的主站;(b) 不在 / 提供內容的基礎設施/API/DNS/CDN 根網域;(c) 大型平台內部自用的網域(gvt1.com、apple-dns.net、googleusercontent.com 這類)。後兩種我們沒有先剔,全留下來,在分析層打上 infrastructure 標籤——反正等範圍收成「有可解析 robots.txt 的網站」,它們自己就退出去了。
抓取
針對這 10,000 個網域,每一個都以 HTTPS 非同步送出 GET /robots.txt;失敗就退回 HTTP,重新導向最多跟 4 次,總逾時 12 秒,主體封頂 500 KB,並掛上一組真正瀏覽器風格的 User-Agent 加 Accept-Language: en-US。並行數壓在 80 個請求。整批任務跑在舊金山的一個住宅 IP 上。
結果攤開來是這樣:
| 狀態 | 數量 | 解讀 |
|---|---|---|
200 OK | 6,638 | 已回傳且可解析 robots.txt 內容。 |
404 Not Found | 610 | 不存在 robots.txt。RFC 9309 將其定義為隱含「允許一切」。 |
403 Forbidden | 563 | 來源主動拒絕 robots.txt 請求。排除於分析之外。 |
429 Too Many Requests | 7 | 在這個排名區間,幾乎沒有 CDN 層級的限流。 |
fetch_failed(TLS / DNS / TCP 錯誤) | 2,065 | 多半是 CDN 根網域(akamai.net、cloudfront.net、fastly.net、gtld-servers.net、apple-dns.net),它們不會在 / 提供網站。這不代表「被封鎖」——只是根本沒有 robots.txt 可提供。 |
| 其他 4xx/5xx | 117 | 混合狀況——伺服器錯誤、地理封鎖、回應格式異常。 |
加總下來,可分析樣本是 7,248 個(6,638 個 200 再加 610 個 404)。那 2,065 個 fetch_failed 確實都是真網域,但身分是 CDN/DNS 根節點,不是誰會去逛的網站;把它們當成「有 AI 政策」說不過去。這批網域在資料集裡另闢一格,只算可存取性。
解析
所有 200 回應,一律丟給 protego 去解析——這支符合 RFC 9309 的 Python 實作,早就在 Scrapy 的生產環境裡跑著。針對每一組(網站,機器人)配對,我們算三樣東西:
can_fetch_root——這個機器人能不能抓/。判斷時照標準走:群組紀錄語意、最長匹配優先,以及當兩者同時存在時,特定機器人的封鎖會蓋過User-agent: *。has_specific_rule——檔案裡有沒有一行明確點名該機器人的User-agent:(不分大小寫)。disallow_count——匹配區塊裡有幾條Disallow:指令,用來分辨整站封鎖和路徑層級的限制。
這三個一起看很關鍵,因為單看表面的「封鎖率」,會把兩種完全不同的事混為一談。一種是品牌有意識地寫下 User-agent: GPTBot \n Disallow: /,明擺著要反制;另一種則是多年前為了 staging 或維護,順手設下的通用 User-agent: * \n Disallow: /,剛好也把當時還不存在的 AI 機器人一併擋掉了。在這份報告裡,**「任一 AI 封鎖」兩種都算;「明確 AI 封鎖」**則只算刻意寫出來的那個子集。
涵蓋的機器人
我們追了 25 個機器人,分成三類:
- AI 訓練爬蟲(16):
GPTBot、ClaudeBot、anthropic-ai、CCBot、Google-Extended、Meta-ExternalAgent、Bytespider、Applebot-Extended、Diffbot、Amazonbot、ImagesiftBot、FacebookBot、cohere-ai、AI2Bot、Omgili、Omgilibot。 - AI 推理/即時檢索機器人(7):
PerplexityBot、Perplexity-User、ChatGPT-User、OAI-SearchBot、ClaudeBot(訓練與推理都做)、YouBot、DuckAssistBot。 - 搜尋基準(6):
Googlebot、Bingbot、DuckDuckBot、Slurp(Yahoo)、Baiduspider、YandexBot。
分類的難處在於,有些 bot 一腳踏兩條船。ClaudeBot 是最典型的例子:Anthropic 2024 年收掉了舊的 anthropic-ai UA,如今訓練和即時檢索都由 ClaudeBot 一手包辦,Disallow: ClaudeBot 因此再也無法乾淨地表達「只擋訓練、保留可見性」這層意思。我們沿用原本的歸類,相關影響留到後文交代。
產業分類
為了把每個網域對進 16 個產業桶其中之一(news、social、streaming、ecommerce、search、finance、infrastructure、saas、academia、dev、gov、adult、gambling、travel、telecom、unknown),我們讓四道判斷由準到粗依序上場:
- 已知網域字典——手工整理約 500 個高流量網域到產業的對照表。
- TLD/後綴模式——
.gov歸gov、.edu與.ac.*歸academia、認得出來的 CDN 後綴歸infrastructure。 - 網域名稱關鍵字——news、post、shop、bank、porn、casino 這類字眼當備援訊號。
- 首頁抓取——前 3 層分不出來、但
robots.txt回200的網站,我們去抓首頁 HTML,取出<title>、<meta name="description">、<meta property="og:type">,再用關鍵字分數對照語言模型式的類別線索。
跑完之後,3,407 個網站(34%)掛上了明確的產業標籤,另外 6,593 個留在 unknown。落到 unknown 的,多半是非英語的區域入口站、跨界到說不清屬於哪一類的大型企業 .com 品牌,還有字典裡沒收的中小語言市場傳統媒體。凡本文引用某產業的百分比,分母都是該產業已分類的樣本,而非全數 10,000。
III. 發現
發現 1 —— 每五個高流量網站,就有一個擋掉了至少一個 AI 機器人
在 7,248 個可分析的網站裡,1,472 個(20.31%) 封鎖了至少一個 AI 機器人。1,230 個(16.97%) 寫了刻意的 AI 專屬規則。相較之下,Googlebot 的基準只有 2.18%(158 個網站——多半是把一切都關掉的維護預設,或少數幾個搜尋引擎在擋競爭對手)。
20% 是 Googlebot 基準的 9 倍。訊號是真的——高流量網站攔 AI 爬蟲的機率,硬是比攔搜尋爬蟲高出一個數量級——可它同時也遠不如 2024 年起媒體那套「AI 封鎖幾近全面」的口吻。畢竟在全網最熱門的 10,000 個網站裡,仍有五分之四對此不吭一聲。
「任一 AI 封鎖」(20.3%)與「明確 AI 封鎖」(17.0%)中間那 3.3 個百分點,值不大,講究的地方卻在此。它代表的,是那些單純因為舊有的 User-agent: * \n Disallow: / 把所有機器人一律攔下、而非特意衝著 AI 來的網站。要問「全球最大一批網站裡,有多少真的做過 AI 專屬決策」,17.0% 這個刻意值才是更貼切的答案。
跟先前的研究擺在一起看:
| 來源 | 日期 | 樣本 | 封鎖率 |
|---|---|---|---|
| Originality.ai | 2025 年 3 月 | 1,000 個最熱門新聞(英文) | 35.7% 封鎖 GPTBot |
| Palewire | 2024 年 8 月 | 1,500 個新聞機構 | 36.0% 任一 AI 爬蟲 |
| Reuters Institute | 2025 年春季 | 50 個領先新聞品牌,10 個國家 | 78% 任一 AI 爬蟲 |
| WIRED / NYT | 2023 年底 | 美國前 50 大新聞網站 | 26% 封鎖 GPTBot |
| 本報告(Thunderbit) | 2026 年 5 月 | Tranco 前 10,000 名(全產業) | 20.3% / 17.0% 明確 |
我們 17.0% 的明確值,比所有只看新聞的研究都低——原因很單純,我們的樣本有三分之二根本不是新聞。若只抽出 650 個新聞網站來看,數字會跳到 47%;把樣本組成考慮進去之後,其實跟前面那些研究落在同一個區間。結構上的圖像是一致的:新聞這個族群封 AI 的比率,是網路其他角落的 3 到 4 倍。
發現 2 —— 產業深潛:從新聞到電信,落差高達 12 倍
過去兩年,所有「AI 抓取」的報導裡被引用最多的一句,就是 Originality.ai 和 Palewire 那個「80% 的新聞機構封鎖 GPTBot」。我們這次切出來的數字比較小,但依然顯眼:前 10,000 名裡的新聞網站,47.2% 封鎖了至少一個 AI 機器人,45.2% 寫了明確的 AI 規則。
不過「新聞 vs 其他所有」這種二分法太粗。把 n ≥ 10 的產業完整攤開,故事豐富得多:

| 產業 | n | 任一 AI 封鎖 | 明確 | Googlebot 被封鎖 | 自行規則 | Cloudflare Managed | 沉默 |
|---|---|---|---|---|---|---|---|
| 新聞 | 650 | 47.2% | 45.2% | 1.5% | 46.9% | 1.5% | 48.5% |
| 旅遊 | 64 | 29.7% | 29.7% | 0.0% | 35.9% | 3.1% | 54.7% |
| 社群 | 65 | 29.2% | 23.1% | 4.6% | 23.1% | 6.2% | 66.2% |
| 串流 | 440 | 20.0% | 17.7% | 0.7% | 16.8% | 3.6% | 75.5% |
| 金融 | 129 | 19.4% | 12.4% | 0.8% | 14.7% | 2.3% | 75.2% |
| 電商 | 224 | 18.3% | 17.4% | 0.4% | 24.1% | 1.3% | 66.1% |
| 成人 | 254 | 17.3% | 14.6% | 0.4% | 10.2% | 7.9% | 79.5% |
| 搜尋 | 12 | 16.7% | 0.0% | 0.0% | 0.0% | 0.0% | 100.0% |
| 學術 | 268 | 14.6% | 13.8% | 0.4% | 13.4% | 3.4% | 77.2% |
| 博彩 | 100 | 14.0% | 13.0% | 0.0% | 18.0% | 4.0% | 77.0% |
| 開發工具 | 129 | 10.1% | 7.8% | 0.0% | 8.5% | 5.4% | 77.5% |
| SaaS | 369 | 7.6% | 6.2% | 0.3% | 9.5% | 0.8% | 87.5% |
| 政府 | 172 | 5.2% | 3.5% | 0.0% | 4.1% | 0.6% | 83.1% |
| 基礎設施 | 47 | 4.3% | 0.0% | 0.0% | 4.3% | 2.1% | 72.3% |
| 電信 | 33 | 3.0% | 3.0% | 0.0% | 12.1% | 0.0% | 78.8% |
新聞和電信之間那道 12 倍的落差,正好說明了為什麼「網路的 AI 政策」根本不是一個合理的分析單位。沒有哪個單一數字說得清;只有各產業各自的數字,而且彼此差了一個數量級。下面挑四個最有代表性的來拆。
新聞:47% 封鎖,47% 自己動手寫規則。 新聞是最早把劇本寫出來的一群。Cloudflare Managed 在新聞類別只佔 1.5%——這些出版商不會把規則外包出去。它們的文本也特別厚:NYT 開頭是 14 行法律前言,引「EU 指令第 4 條」;BBC 寫的是 「請像人類一樣使用我們的網站,不要像機器人……簡而言之:瀏覽、閱讀、觀看、享受——像人類一樣。」;The Sun 則直白寫道 「The Sun 不允許未授權使用我們內容來供大型語言模型使用。」。這是把 robots.txt 當政策聲明在寫,而不是設定。
旅遊業 30%,這個有點出乎意料。 Booking、Expedia、TripAdvisor、Kayak 加上幾家主要航空公司,封鎖率是新聞業的三分之二。它們的選擇性模式很一致:一個典型的旅遊封鎖者會擋掉 5 到 7 個訓練用 UA,卻留著推理用 UA(PerplexityBot、ChatGPT-User、OAI-SearchBot)。道理不難懂——聚合來的價格與評論資料是護城河,而回流到網站的引用則是收入來源。這是所有產業裡「擋訓練、放推理」這條線切得最乾淨的一個。
成人內容 17%,同樣意外。 早期較小的樣本一度顯示 0%。完整樣本一跑,每 6 個成人網站就有 1 個封了至少一個 AI 機器人,而且 Cloudflare Managed 的比率是全產業最高(7.9%)。成人網站的 AI 封鎖裡,一半以上來自 Cloudflare 的開關,而非出版商自己拍板。影像生成訓練是背後那個沒說出口的威脅——Stable Diffusion 這一級的模型學視覺風格,比文字模型學寫作風格快多了。
SaaS 只有 7.6%,反直覺。 軟體供應商在 AI 政策的討論裡嗓門最大,可它們的 robots.txt 卻很開放。正確的讀法是:SaaS 行銷團隊已經把 AI 搜尋當成一條分發管道看待了。真正想清楚這件事的供應商,做的是 opt in 而不是 opt out——明確放行 GPTBot 的那份名單(見發現 12),主力就是資安與開發工具型的 SaaS。
政府 5.2%、電信 3.0%、基礎設施 4.3%、開發工具 10.1%。 公共紀錄的義務,讓 .gov 上的 Disallow: / 在法律上很尷尬。電信的行銷網站巴不得被搜尋到。CDN 根節點壓根沒有東西要保護。至於開發工具,是明確地選擇加入——因為當 LLM 引用它的內容時,內容本身的價值反而水漲船高。
一句話收尾:不存在哪個「網路有沒有在封 AI」的單一數字,能在不失真的前提下把問題說完整。唯一誠實的講法,就是按產業層級來報。
發現 3 —— 換個切面看 AI 供應商:誰被封得最多?
還有一種很自然的切法,不是看機器人,而是看 AI 公司。有幾家供應商同時養好幾個機器人(OpenAI 有三個:GPTBot、ChatGPT-User、OAI-SearchBot;Anthropic 有兩個:ClaudeBot、anthropic-ai;Meta 也有兩個:Meta-ExternalAgent、FacebookBot)。把這些聚合到供應商層級,最接近「公開網路對每一家 AI 公司到底怎麼看」的答案。
| AI 供應商 | 聚合機器人 | 封鎖至少 1 個機器人的網站 | 可分析樣本占比 |
|---|---|---|---|
| Common Crawl | CCBot | 1,178 | 16.25% |
| OpenAI | GPTBot、ChatGPT-User、OAI-SearchBot | 1,172 | 16.17% |
| Anthropic | ClaudeBot、anthropic-ai | 1,111 | 15.33% |
| ByteDance | Bytespider | 1,082 | 14.93% |
| Meta | Meta-ExternalAgent、FacebookBot | 989 | 13.65% |
Google-Extended | 970 | 13.38% | |
| Amazon | Amazonbot | 877 | 12.10% |
| Apple | Applebot-Extended | 859 | 11.85% |
| Webz.io(Omgili) | Omgili、Omgilibot | 731 | 10.09% |
| Cohere | cohere-ai | 717 | 9.89% |
| Perplexity | PerplexityBot、Perplexity-User | 715 | 9.86% |
| Diffbot | Diffbot | 684 | 9.44% |
| You.com | YouBot | 563 | 7.77% |
| AI2(Allen AI) | AI2Bot | 487 | 6.72% |
| DuckDuckGo | DuckAssistBot | 482 | 6.65% |
Common Crawl 是被針對得最兇的單一實體,儘管它只是個非營利的網路封存庫,根本不經營 LLM。原因在槓桿:CCBot 幾乎替所有開源權重模型、以及相當比例的閉源模型供資料。先封 CCBot,是出版商能寫出來、覆蓋面最廣的一條規則。
OpenAI、Anthropic、ByteDance 擠在 14–16% 這一段。 OpenAI 領先的一部分是計數上的結構造成的(OpenAI 有三個 bot,ByteDance 只有一個)。Bytespider 的 14.9% 則是「Bytespider 自己行為不端」效應——它自 2024 年起就被記錄過無視 robots.txt,出版商封它,比較像是在公開放話,而不是真的擔心 TikTok。
Meta、Google、Amazon、Apple 落在 12–14%,算第二梯隊——這些規則多半是防守性地順手寫上,而非什麼政治表態。小型供應商(Webz.io、Cohere、Perplexity、Diffbot、You.com、AI2、DuckDuckGo)在 6–10%,多半是被 3.8% 那條通用底線抬上去的;真正針對它們的明確規則,大約落在 1–4%。
xAI(Grok)、Mistral,還有大部分歐洲/中國的模型實驗室,都沒進這張表——因為它們根本沒有公開的訓練爬蟲 UA 文件。現有的 robots.txt 生態,其實是一場對話:一邊是美中供應商搶先發佈 UA,一邊是美歐出版商動筆寫規則;而那些沒發佈 UA 的供應商,在這場協商裡是隱形的。
發現 4 —— 踩到雷區的是 CCBot,不是 GPTBot
前 10k 裡,機器人的封鎖排序長這樣:

| 排名 | 機器人 | 封鎖率 | 明確規則率 |
|---|---|---|---|
| 1 | CCBot(Common Crawl) | 16.25% | 12.90% |
| 2 | GPTBot(OpenAI) | 15.84% | 12.72% |
| 3 | Bytespider(ByteDance) | 14.93% | 11.35% |
| 4 | ClaudeBot(Anthropic) | 14.51% | 11.13% |
| 5 | Google-Extended | 13.38% | 10.18% |
| 6 | Meta-ExternalAgent | 12.38% | 8.95% |
| 7 | Amazonbot | 12.10% | 8.66% |
| 8 | Applebot-Extended | 11.85% | 8.72% |
| 9 | Omgilibot | 10.09% | 5.31% |
| 10 | anthropic-ai(已棄用) | 9.99% | 6.55% |
| 11 | cohere-ai | 9.89% | 6.42% |
| 12 | PerplexityBot | 9.69% | 6.40% |
| 13 | Diffbot | 9.44% | 5.95% |
| 14 | ChatGPT-User(推理) | 8.90% | 5.73% |
| 15 | YouBot(推理) | 7.77% | 4.29% |
| 16 | OAI-SearchBot(推理) | 6.83% | 3.66% |
| 基準 | Googlebot | 2.18% | — |
| 基準 | Bingbot | 2.27% | — |
這張表講的其實是一件事:公開網路最先擋的,不是模型品牌,而是資料源頭。 Common Crawl 那個 2500 億頁的封存庫,已經是 GPT-3、GPT-4、Llama 1 / 2 / 3、Falcon、Mistral、BLOOM,以及 2020 年之後大多數開源權重模型的單一最大訓練輸入。一個網站若想退出「成為下一代前沿模型的一部分」,最划算的做法就是先禁掉 CCBot——只要不進 Common Crawl,你幾乎等於免費退出了開源訓練管線。GPTBot 和 ClaudeBot 之所以排在二、三名,是因為它們是兩個商業產品的可見門面;而資料源頭層級的 UA,才是結構性的靶心。
表尾那幾個排名低的 AI 機器人,資訊量也不小。Omgilibot 的 10% 高得反常——對一個多數讀者可能連聽都沒聽過的 bot 來說更是如此。它由 Webz.io 經營,這是一家把網路封存資料賣給 LLM 經營者的內容資料中介商,而不少新聞機構已經在檔案裡直接點了它的名。AI2Bot 的 6.7%(以及 Squarespace 網站上對應的 Ai2Bot-Dolma 規則),則顯示連學術 LLM 圈也開始被標記了——因為出版商未必會去區分「非營利研究爬蟲」和「商業爬蟲」。
推理群組——ChatGPT-User、OAI-SearchBot、YouBot、Perplexity-User——比訓練群組低了 4 到 8 個百分點。這道差距回答了一個懸而未決的政策問題:答案是「會」;高流量網站確實會分辨「為將來訓練模型而抓資料的 bot」和「此刻就為使用者問題即時檢索的 bot」。他們不見得每次都分得清楚(通用規則就不分),但確實有相當一部分網站,特意針對訓練端寫下了規則。
發現 5 —— 14% 封 CCBot、同時留 Googlebot:也就是「擋源頭、留搜尋」
前 10k 裡最常見的一條選擇性規則是:

| 規則模式 | 網站數 | 可分析樣本占比 |
|---|---|---|
封鎖 CCBot、允許 Googlebot | 1,023 | 14.11% |
封鎖 Bytespider、允許 Googlebot | 926 | 12.78% |
封鎖 Google-Extended、允許 Googlebot | 816 | 11.26% |
封鎖 GPTBot、允許 OAI-SearchBot | 658 | 9.08% |
封鎖 GPTBot、允許 ChatGPT-User | 525 | 7.24% |
封鎖 CCBot、允許 PerplexityBot | 519 | 7.16% |
封鎖 anthropic-ai、允許 ClaudeBot | 59 | 0.81% |
最多網站採納的模式(14.1%)是「擋掉 Common Crawl,但保住 Google 搜尋的可見性」。第二名(12.8%)是「擋掉 Bytespider,但保住 Google 搜尋」——也就是把 ByteDance 那個已被貼上風險標籤的爬蟲擋在門外,同時留住合法的搜尋基準。第三名(11.3%)是「擋掉 Google 自家的 AI 訓練 UA,但留著 Google 的搜尋 UA」,這正是 Google 當初設計 Google-Extended 的用意:出版商可以退出 Bard/Gemini 的訓練,卻不必賠上搜尋排名。
這三個數字合起來,就勾勒出前 10k 網路的主流姿態:擋掉抓訓練資料源頭的 bot,留下搜尋和推理的 bot。至於少數那種「擋訓練、但放行該 LLM 特定的即時檢索 UA」的模式——GPTBot ✗ / ChatGPT-User ✓,占 7.2%——確實存在,但規模不如源頭層級的切法。
anthropic-ai / ClaudeBot 這一列只有 0.81%,反映的是 Anthropic 在 2024 年棄用了舊 UA:如今 ClaudeBot 訓練和推理一手包,過去那種靠 anthropic-ai 表達「擋訓練、放引用」的乾淨寫法,就此不復存在。這是 2024 到 2025 年間最少被拿出來討論的 UA 設計決策之一——它等於從 robots.txt 裡抹掉了一整類政策表達方式。
發現 6 —— 新聞的細節:按國家和語言切開來看
當我們把新聞類別按國別頂級網域(country-code TLD)切開時——要提醒一下,這代表的是 .de 的德國新聞、.fr 的法國新聞,而不是網站用什麼語言——會發現產業內部的差異,比新聞和其他產業之間還大:

| 國家(僅新聞) | n | 任一 AI 封鎖 | 明確 |
|---|---|---|---|
🇩🇪 德國(.de) | 25 | 88.0% | 88.0% |
🇫🇷 法國(.fr) | 15 | 80.0% | 80.0% |
🇬🇧 英國(.co.uk) | 15 | 66.7% | 53.3% |
🇪🇸 西班牙(.es) | 5 | 60.0% | 60.0% |
🇮🇹 義大利(.it) | 13 | 53.8% | 53.8% |
全球新聞(.com / .org / 等) | 500 | 45.0% | 42.8% |
🇵🇱 波蘭(.pl) | 7 | 42.9% | 42.9% |
🇯🇵 日本(.jp) | 12 | 25.0% | 25.0% |
🇷🇺 俄羅斯(.ru) | 13 | 0.0% | 0.0% |
🇬🇷 希臘(.gr) | 6 | 0.0% | 0.0% |
德國新聞是整份資料集裡封鎖率最高的子群,達 88%,而且 88% 全是明確規則——白話說,前 10k 裡幾乎沒有哪家德國新聞網站,會放行 AI 訓練爬蟲來抓自己的資料庫。這一群由 Spiegel、Bild、Welt、Zeit、FAZ、Süddeutsche、Heise、Golem、Stern、Focus 領頭——整個德國主流出版界,再加上獨立寫規則的科技媒體。底下的政治基礎很厚:VG Media(德國出版商的集體權利組織)一直是 EU AI 著作權訴訟裡最積極的原告群,而 EU 指令第 4 條在德國法裡以 §44b UrhG 落地,還配了明確的機器可讀 opt-out 語言。等 AI 供應商上門時,德國出版商在所有國家群體裡,都是最有準備把這套法律立場翻成 robots.txt 規則的一群。
法國新聞 80%,緊追在後。 法國的法律環境很像(2019/790 指令已轉入法國法),群體行為也像——lemonde.fr、lefigaro.fr、liberation.fr、lequipe.fr、20minutes.fr、ouest-france.fr 都封了,而 Le Monde 的檔案還多引了一條法國的 droit du producteur de base de données(《智慧財產法典》第 L 342-1 條),當作平行的國內法律依據。法國還多了一個變數:2024 年巴黎商業法院判定,用 robots.txt 做出的 opt-out 足以構成第 4 條下的通知——這給了其他司法管轄區還沒有的直接判例支持。
英國 67% 反而低一些,因為好幾家大型英國出版商(thesun.co.uk、dailymail.co.uk、mirror.co.uk)用的是 User-agent: * 全拒絕封鎖,而不是 AI 專屬規則,把明確數字拉到了 53%。實際效果其實一樣——這些網站就是不讓 AI 抓——只是表述方式變成「除了這份搜尋引擎白名單,其他一律拒絕」,而非點名 AI bot 的 disallow。法律支撐也偏弱:脫歐後,英國雖沿用了第 4 條的邏輯,但對應的國內判例更單薄。
俄羅斯新聞 0%,是最讓人意外的一列。樣本裡的 13 個俄羅斯新聞網站(dzen.ru、rbc.ru、ria.ru、kommersant.ru、tass.ru、lenta.ru、gazeta.ru、interfax.ru、kp.ru、tass.com 等),沒有一個封任何 AI 爬蟲。合理的解釋是這樣:俄語的 LLM 訓練主要由 Yandex 自家的 GPT 類模型主導(用的是 Yandex 內部爬蟲,而不是 Common Crawl);俄羅斯的著作權環境還沒長出相當於第 4 條的法規;而大型俄羅斯出版商乾脆把西方 LLM 當成非議題(美國的出口管制已經讓 OpenAI/Anthropic 在俄羅斯的服務受限),把 Yandex 看成國內的利害關係人,而非對手。政策姿態明顯不一樣。
日本新聞 25%,又是另一幅光景。日本國內著作權法有明確的文本與資料探勘例外(《日本著作權法》第 30-4 條,2018 年修正),寬鬆程度比 EU 指令第 4 條還高——它允許出於「非享受」目的的 TDM,包含 AI 訓練,而且不需要權利人同意。日本出版商在 opt-out 上能抓的法律把手比較少,對應的 robots.txt 比率也就跟著低。那些真的封了的網站,多半是最大、最國際化的出版商(像 asahi.com、nikkei.com),它們的定位本來就偏國際而非國內。
跨國新聞的這批資料,是整份報告裡最清楚的一項證據:真正在主導的是法規制度,不是技術,也不是產業經濟。 EU 新聞群體落在 54% 到 88% 之間;非 EU 新聞群體(俄羅斯、日本、全球 .com 群體)則從 0% 到 45% 不等。88% 的高峰,出現在第 4 條實施得最成熟的國家;0% 的低點,則出現在幾乎沒有 AI 政策法律的地方。
發現 7 —— EU 與其他地區:差了 16 個百分點
把國家視角再往上抽一層,EU 與非 EU 的大致分野就很清楚了:
| 區域 | n | 任一 AI 封鎖 | 明確 |
|---|---|---|---|
EU ccTLD(.fr、.de、.es、.it、.nl、.pl、.se、.dk、.fi、.be、.at、.cz、.hu、.ro、.gr、.pt、.ie、.sk、.bg) | 617 | 35.2% | 33.9% |
非 EU 國家 ccTLD(.uk、.jp、.kr、.cn、.ru、.br、.in、.au、.mx、.ca、.tr、.ar、.cl、.co、.pe) | 897 | 17.2% | 13.6% |
全球(.com、.net、.org 等) | 5,734 | 19.2% | 15.7% |
EU ccTLD 網站封 AI 的比率,是非 EU 國家群體的 兩倍,也差不多是全球 .com 基準的 兩倍。這個差距在 EU 各成員國之間都成立(沒有哪個單一國家在拉高平均),在各產業之間也成立(.de 新聞 88%、.de SaaS 約 12%、.de 電商約 25%——全都比全球同業高)。
我們在前 10k 裡找到 275 份 robots.txt,在註解裡明白引用了 2019/790 指令——約占可解析樣本的 3.8%。這群網站以 EU 出版商為主,但不只他們:幾個美國新聞品牌(尤其是直接寫出「Art. 4 of the EU Directive」的 NYT)、一些英國網站,還有少數較大的歐洲電商,也照抄了這套法律文字。另有 87 份檔案明確提到「TDM」或「text and data mining」。而含有某種著作權保留語句(像「明確退出」、「保留所有權利」、「不得商業使用」、「不得機器學習」)的檔案有 460 份,就算沒引用特定法規也算在內。
這一層切下去,還帶出兩個更細的觀察:
EU 效應不只在新聞。 把新聞固定住之後,EU 的非新聞網站封 AI 的比率,還是比非 EU 的非新聞網站高(大約 28% 對 14%)。EU 的 SaaS、電商與學術界裡,有一小部分但確實存在的網站,已經把第 4 條的框架內化到自己的產業語境裡了。
EU 風格的措辭正在變成事實上的範本,連 EU 以外都是。 全球都在用的 Cloudflare Managed robots.txt 範本,範本文字裡明白引了「ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790」。一個美國網站只要開了 Cloudflare 的「Block AI Bots」,即使自己未必知道,實際上也等於在主張 EU 的法定權利保留。這是我們找到最有意思的政策漂移之一:一個歐洲的法律概念,正透過一家美國基礎設施供應商的產品介面,被推向全球。
發現 8 —— 範本,以及範本從哪來
在 6,638 個回傳可解析 robots.txt 的網站裡,範本來源的分布是這樣:

| 範本 | 網站數 | 占比 |
|---|---|---|
| 未提及任何 AI 機器人(預設 Shopify 風格、Yoast、或完全未考慮 AI 的手寫檔) | 5,024 | 75.7% |
| 自訂 / DIY AI 規則 | 1,183 | 17.8% |
Cloudflare Managed(Content-Signal: search=yes,ai-train=no) | 302 | 4.5% |
明確對 GPTBot 設 Allow: / | 124 | 1.9% |
| Squarespace 預設(路徑受限封鎖中的 28 個 AI UA) | 5 | 0.1% |
DIY 規則以 17.8% 居冠。 自己動手寫封鎖規則的這群,主力是各大社群平台(facebook.com、twitter.com、linkedin.com、whatsapp.com、tiktok.com、snapchat.com、pinterest.com、x.com、以及 chatgpt.com 自己)、最大型的電商(amazon.com、amazonvideo.com)、主流新聞品牌(nytimes.com、cnn.com、bbc.com、theguardian.com、forbes.com、reuters.com、bbc.co.uk、t-online.de、weather.com)、重量級的串流/媒體(netflix.com、vimeo.com、soundcloud.com、imdb.com),還有一長串專業服務網站(canva.com、medium.com)。
Cloudflare Managed 占 4.5%——比它在排名最前段的滲透率高,卻比本報告涵蓋範圍以外那些長尾市場低。這份範本在 rank 1001–10000 段最常見(4–5%),到了曲線最前端幾乎絕跡(前 100 名只有 1 個網站用;101–1000 名 5 個)。大型全球資產自己寫規則;長尾網站則按開關。
有幾個 Cloudflare Managed 的網站值得一提。cloudflare.com 自己就在用這份範本,這很合理(Cloudflare 拿自家產品服務自家網域,典型的 dogfooding)。theatlantic.com 也在用——它是我們找到唯一一個沒有自訂規則的主要美國新聞品牌。spankbang.com 也用——它是採用 Cloudflare 注入式 AI 封鎖的成人網站裡,排名最高的一個。linktr.ee 也用,這意味著 Linktree 上整個創作者經濟的 AI 訓練,被單一供應商一次決策全擋掉了。launchpad.net、nexusmods.com、vinted.fr、cookielaw.org、rustdesk.com,再加一長串較小的媒體資產,共同組成了看得見的 Cloudflare Managed 群體。
Cloudflare 的採用模式,是我們目前握有最具體的證據,說明「網路的 AI 政策」有相當大一塊,其實是基礎設施供應商在決定。絕對占比雖然不大(4.5%),但結構意義很重:這是 Cloudflare 預設就端出來的範本,而未來 12 個月的 on-by-default 趨勢還在往上。要是 Cloudflare 把新帳號的開關改成預設開啟,全球封鎖率就會在沒有任何一家出版商作決定的情況下實質上升。
Squarespace 的預設值(前 10k 裡有 5 個,本樣本之外還更多)則是另一回事:Squarespace 會給一份 robots.txt,在單一區塊裡列出 28 個 AI bot,可是這些 bot 只會繼承 User-agent: * 的路徑限制,並不是整站封鎖。AI 爬蟲照樣能抓 /、首頁、產品頁、部落格;它們只是進不了 /config 或 /account。我們先前就把這當成第三方掃 Squarespace 網站時「AI 封鎖」誤判的來源;這裡一樣適用。
發現 9 —— AI 政策在排名分布上其實相當平均
這類研究的直覺通常是:造訪量越大的網站,AI 政策應該越強硬——畢竟它們最怕被訓練出替代品、法律資源最多、也最受公眾盯著看。可惜資料不買帳。
| 排名區間 | n | 任一 AI 封鎖 | 明確 | Cloudflare Managed |
|---|---|---|---|---|
| 前 100 名 | 67 | 22.4% | 17.9% | 1 個網站 |
| 101–1,000 名 | 598 | 22.9% | 19.2% | 5 個網站 |
| 1,001–5,000 名 | 2,810 | 19.0% | 15.3% | 99 個網站 |
| 5,001–10,000 名 | 3,773 | 20.8% | 17.8% | 197 個網站 |
四個區間全落在 19% 到 23% 之間。前 100 名並沒有比 5001–10000 名那條長尾更強硬。這個頭條比率,看起來比較像是 2026 年公開網路本身的屬性,跟哪個單一網站有多大、多有名關係不大。
背後有兩股力量。第一,排名前段被基礎設施/SaaS/搜尋/入口網站網域主導(Microsoft、Apple、Google 這些),它們自己的 AI 封鎖率本來就低。第二,長尾裡塞了大量區域新聞出版商和 EU 管轄網站,而如發現 6 與 7 所示,它們封 AI 的程度高於全球平均。這兩股力量大致互相抵銷,最後就湊出一條相當平的頭條線。
Cloudflare Managed 這一欄倒是真的隨曲線在動。前 1000 名裡有 6 個 Cloudflare 管理網站(1.0%);1001–10000 名裡有 296 個(5.7%)。大網站自己寫,長尾用供應商開關。這是整份資料集裡唯一真正跟排名掛鉤的訊號,也意味著 當你沿著流量曲線從前段往長尾走時,政策由供應商設定、而非出版商設定的比例會穩定攀升。我們預期這條梯度會一路延伸到前 10 萬,甚至更後面。
發現 10 —— 五份解剖:當 robots.txt 真的是政策時,它長什麼樣
數字勾勒的是資料集的輪廓;至於「公開網路上的 AI 政策」究竟長什麼樣,最好還是回頭去讀幾份具體的檔案。下面這五份最值得一看,橫跨了整條政策光譜。
解剖 1 —— The New York Times(nytimes.com)
nytimes.com/robots.txt 的前 14 行是這樣:
# New York Times content is made available for your personal, non-commercial
# use subject to our Terms of Service here:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# Use of any device, tool, or process designed to data mine or scrape the content
# using automated means is prohibited without prior written permission from
# The New York Times Company. Prohibited uses include but are not limited to:
# (1) text and data mining activities under Art. 4 of the EU Directive on Copyright in
# the Digital Single Market;
# (2) the development of any software, machine learning, artificial intelligence (AI),
# and/or large language models (LLMs);
# (3) creating or providing archived or cached data sets containing our content to others; and/or
# (4) any commercial purposes.
# Contact https://nytlicensing.com/contact/ for assistance.
與其說這是設定,不如說是一份呈堂證物。它的行文結構,明顯是衝著 NYT v. OpenAI 這場官司去的。由一家美國出版商來搬出「EU 指令第 4 條」,正好替發現 7 下了註腳——EU 那套法定框架,已經滲進了全球論述。裡頭那句「禁止建立或提供含有我們內容的封存或快取資料集」,箭頭直指 Common Crawl。整份檔案洋洋灑灑 60 多行,GPTBot、OAI-SearchBot、ChatGPT-User、anthropic-ai、ClaudeBot、CCBot、Google-Extended、Applebot-Extended、Bytespider、Diffbot、Meta-ExternalAgent、Amazonbot、Omgili、Omgilibot 各佔一個 User-agent 區塊,點到的每一個 bot,收尾都是 Disallow: /。
解剖 2 —— Der Spiegel(spiegel.de)——區塊層級的 AI 權限控制
Der Spiegel 的 robots.txt,是我們在整份資料集裡找到營運上最成熟的一份。相關區塊如下:
# TLP-6507: Testweise Freischaltung der OpenAI-Suchcrawler fuer ausgewaehlte Bereiche
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /
User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /
開頭那行德文註解,意思是「針對選定區塊,試行啟用 OpenAI 搜尋爬蟲。」換句話說,Spiegel 只對 OpenAI 的推理 UA 放行七個內容類別——國際新聞、合作、健康、家庭、旅遊、心理、生活風格——其餘全關。政治、德國國內新聞、調查報導這些,一律被劃在門外。而 Common Crawl、Bytespider、Cohere、Webzio-Extended 這批訓練 UA,則在檔案更下方吃一記乾脆的 Disallow: /。
這是把 robots.txt 當成區塊層級的編輯政策在用。它的內在邏輯是:生活風格內容被訓練替代的風險較低,而被引用帶來的推理收益較高,所以 Spiegel 放行這些區塊;政治與調查內容才是護城河,所以把 AI 擋在外面。這種模式我們在別處沒看到過。它意味著編輯、法務和基礎設施團隊之間已經有相當高的內部協調,而大多數新聞編輯部還沒走到這一步。我們預期這種更細粒度、區塊層級的政策表達,會在 2026 到 2027 年擴散開來——Spiegel 這份檔案,幾乎可以當領先指標看。
解剖 3 —— BBC(bbc.com)——政策聲明型
BBC 的 robots.txt 開頭是這樣:
# version: ec59bd036e5138eb4831a9ed44447b1ff310e235
# The BBC's Terms of Use: https://www.bbc.co.uk/terms
# - Explain the rules for using our services
# - Tell you what you can do with our content
#
# In short: Please use our site like a human, not a robot.
# That means:
# - No scraping, crawling, or systematic extraction of content
# - No use of BBC content for training or fine-tuning AI models, including LLMs
# - No retrieval-augmented generation (RAG), AI-powered search, agentic AI or
# grounding using BBC content
# - No creating datasets from BBC content
# - No text and data mining (TDM) under Article 4 of the EU Directive on Copyright
# - No using BBC content to create summaries for your own use
# - No business use without permission
# - The BBC reserves all rights in its content and expressly opts out of any
# statutory exceptions in any jurisdiction for text and data mining,
# as permitted by law
#
# TL;DR: Browse, read, watch, enjoy - like a human.
連版本控管都上了:開頭那行 # version: ec59bd... 其實是一個 git commit hash。內文列出 BBC 法務盯著的八種 AI 用途一一禁止,末了再補一句合乎品牌調性的收尾。至於「明確退出任何司法管轄區中的法定例外」這句,是一記刻意的全球性保留,潛台詞是:沒有哪一套法律制度靠得住,那就在每個地方同時把退出這件事講死。 整份資料集裡,就數這份 robots.txt 最像被逐字打磨過,讀起來根本是新聞稿,不是設定檔。
解剖 4 —— WordPress.org —— 明確歡迎
拿上面幾份對照 wordpress.org:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Bytespider
Allow: /
User-agent: CCBot
Allow: /
User-agent: Copilot
Allow: /
這裡 WordPress.org 一口氣替九個 AI 訓練爬蟲開了門,當中三個(Bytespider、CCBot、anthropic-ai)恰恰是別處被封得最兇的。它的算盤是這樣:WordPress 的文件與外掛生態算一種公共財,AI 助理越能答得出相關問題,這份公共財就越值錢。有人問 Claude「WordPress 的永久連結怎麼設?」,只要 Claude 受過 wordpress.org/documentation/ 的訓練並答對了,WordPress 的使命就又被推進了一步。基金會顯然把「內容進到每一個模型的訓練資料庫」看成戰略上的淨賺,索性用檔案語法把態度攤開來講。
解剖 5 —— The Verge(theverge.com)——贊助內容混合模式
還有一種模式值得攤出來看。The Verge 的 AI 規則是 Disallow: / \ Allow: /sp/:
User-agent: GPTBot
Allow: /
User-agent: Applebot
Allow: /
User-agent: Google-Extended
Disallow: /
Allow: /sp/
User-agent: anthropic-ai
Disallow: /
Allow: /sp/
User-agent: Bytespider
Disallow: /
Allow: /sp/
User-agent: CCBot
Disallow: /
Allow: /sp/
User-agent: ChatGPT-User
Disallow: /
Allow: /sp/
User-agent: ClaudeBot
Disallow: /
Allow: /sp/
關鍵在 /sp/ 這條路徑——它是 The Verge 放贊助/合作內容的地方。編輯內容被關在 AI 訓練門外,贊助內容卻放進來。帳算得很明白:贊助商付了錢要讓內容被看見,連透過 AI 被看見也算在內;而編輯旗艦內容,才是那道護城河。GPTBot 徹底放行(推測背後跟 OpenAI 有直接往來),Applebot 作為搜尋基準也徹底放行,剩下的一律走混合處理。「分層式 AI 存取」這種結構,我們就只在這裡見過一次。
這五份檔案,湊齊了當前 robots.txt AI 政策的整條光譜。前 10k 裡大多數檔案都不長這樣——它們不是沉默,就是套供應商範本。真正長成這副樣子的檔案,都是出自那些認定「這份檔案值得被認真讀」的人之手。
再補一句檔案規模:我們樣本裡 robots.txt 主體的中位數是 858 位元組——小到根本裝不下有意義的 AI 政策。真正扛規則的是右尾:1,005 個網站(15.3%)的檔案超過 5 KB,273 個超過 20 KB,最大的一份是 248 KB。460 份檔案含著作權保留語句;275 份明確引用 EU 2019/790。 到 2026 年,robots.txt 越來越像一份有版本控管、被律師審過的文件,而不是一條設定列。
發現 11 —— 有 108 個網站,反過來 歡迎 GPTBot
有一小群但格外顯眼的網站,會寫下 User-agent: GPTBot \n Allow: /——正好和更常被討論的「Disallow GPTBot」相反。樣本裡共有 108 個網站在根路徑明確對 GPTBot 設 Allow。按 Tranco 排名列出前 25 名:

| 排名 | 網域 | 產業 |
|---|---|---|
| 42 | wordpress.org | 開發工具/CMS |
| 133 | kaspersky.com | 資安 |
| 187 | avast.com | 資安 |
| 265 | hp.com | 硬體 OEM |
| 624 | branch.io | 行動歸因 SaaS |
| 692 | sophos.com | 資安 |
| 782 | theverge.com | 新聞 |
| 905 | rambler.ru | 俄羅斯入口網站 |
| 945 | kleinanzeigen.de | 德國市集 |
| 948 | theatlantic.com | 新聞 |
| 1,092 | lge.com | LG Electronics |
| 1,300 | justdial.com | 印度在地搜尋 |
| 1,332 | avira.com | 資安 |
| 1,412 | youm7.com | 埃及新聞 |
| 1,530 | goodreturns.in | 印度金融 |
| 1,621 | publi24.ro | 羅馬尼亞分類廣告 |
| 1,807 | geocomply.com | 合規 SaaS |
| 1,908 | nba.com | 運動 |
| 1,956 | oneindia.com | 印度新聞 |
| 1,974 | mindbox.ru | 俄羅斯 SaaS |
| 2,009 | thesun.co.uk | 新聞 |
| 2,126 | vox.com | 新聞 |
| 2,140 | mgid.com | 原生廣告 |
| 2,314 | ninjarmm.com | IT 管理 SaaS |
| 2,323 | norton.com | 資安 |
裡面有幾個看得出來的模式:
資安公司明顯偏多。 Kaspersky、Avast、Sophos、Avira、Norton、NinjaRMM 全都明確放行 GPTBot。這是刻意的分發策略:當使用者問 ChatGPT「哪一款防毒最適合我的 Windows 電腦?」時,模型的訓練資料庫裡有沒有你的品牌,會直接左右它的推薦。資安正是少數幾個 AI 搜尋已經開始取代 SEO、成為主要獲客管道的 B2C 品類,而這些品牌搶先動了手。我們預期其餘資安同業會在 12 個月內跟上。
幾個主要新聞品牌出現在這份名單、而不是封鎖名單上。 The Verge、The Atlantic、Vox、The Sun、NBA.com。這並不矛盾——這些出版商似乎盤算過,能在 ChatGPT 搜尋裡被引用,比免於被訓練更值錢,所以特意寫下明確 Allow,免得將來被 CDN 或 CMS 過度封鎖。跟 NYT / Reuters / BBC / Forbes / Guardian 那種明確 Disallow 的立場擺一起,兩邊其實都說得通;新聞業從來就不是鐵板一塊。
The Sun 出現在這裡特別有意思,因為同一個網站在檔案別的地方,還用了 User-agent: * 全拒絕封鎖。最合理的解讀是:AI 訓練一律禁止,但 AI 搜尋放行,而且我們還特地把 GPTBot 白名單化,確保 ChatGPT 引用 The Sun 來回答問題。 這是所有 GPTBot-Allow 規則裡法律技巧最高的一種——它把 opt-out 和單一供應商 opt-in 同時包了進去。
WordPress.org 的出現,是這份名單裡份量最重的一項。 全球開源 CMS 生態,有相當一部分會導向 WordPress.org 找文件,或直接從那裡抓外掛。WordPress Foundation 在 wordpress.org/robots.txt 明確放行 GPTBot,等於公開宣告 WordPress 的文件生態可供訓練——這也會連帶影響 Claude、Gemini、ChatGPT 對「WordPress 怎麼……」這類問題的回答品質。
完整的 Allow-GPTBot 名單裡剩下的 83 個網站,則是區域新聞、較小的資安供應商、非英語市場的分類廣告平台,以及 B2B SaaS 的長尾。就我們所知,並沒有出現產業級別的「Allow-GPTBot」協調——這條規則是一個網站、一個網站地被採納的,全靠那些認定「進到資料源頭」是個戰略位置的經營者,各自決定。
發現 12 —— llms.txt 在這個尺度上,幾乎只是個傳聞
llms.txt 是一種為了讓 LLM 更容易發現友善內容而提出的替代檔案格式(自 2024 年底起,由 Mintlify、Anthropic、Vercel 和少數開發工具供應商推廣),但在我們的樣本裡,幾乎看不到什麼採用。
在 6,638 個回傳可解析 robots.txt 的網站裡,只有 83 個(1.15%)提到 llms.txt——而且通常只是以 Sitemap: https://example.com/llms.txt 的形式出現。這比在開發工具密集的商務樣本裡量到的同一指標低了兩個數量級;後者是被 Vercel 和 Mintlify 的預設值把採用率撐上去的。

按產業攤開來看:
| 產業 | n | 提及 llms.txt 的比例 |
|---|---|---|
| 基礎設施 | 47 | 4.3% |
| 博彩 | 100 | 3.0% |
| SaaS | 369 | 3.0% |
| 電信 | 33 | 3.0% |
| 電商 | 224 | 1.8% |
| 旅遊 | 64 | 1.6% |
| 開發工具 | 129 | 1.6% |
| 新聞 | 650 | 0.8% |
| 成人 | 254 | 0.4% |
| 政府 | 172 | 0.0% |
| 學術 | 268 | 0.0% |
| 搜尋 | 12 | 0.0% |
llms.txt 主要集中在跟開發工具沾親帶故的 SaaS、博彩(這種受監管產業的法遵團隊,習慣一層層堆額外的中繼資料,所以吸收 robots.txt 新詞彙功能的速度也比較快),還有 B2B 電商。它在新聞和政府這兩塊明顯缺席——而這兩個區塊,恰恰是參與 AI 政策最積極、也最需要它們採用,才能讓這個標準從「供應商實驗」升格為「網路協定」的族群。在那之前,llms.txt 就是真實但規模極小;等到 2026 年底再做一次追蹤審計,會是個很好的重測點。
llms.txt 面對的結構性難題是:它沒走過任何 IETF 標準化程序,主要 AI 供應商也沒承諾要遵守。robots.txt 背後有 30 年的爬蟲基礎設施撐著;llms.txt 沒有。除非至少有一家主要供應商(OpenAI、Anthropic、Google、Cloudflare)正式宣佈支援,否則這個檔案本質上就是 Mintlify/Vercel 生態的行銷產物。我們不預期 2026 年會有變化。
發現 13 —— 可存取性:網路前段仍讀得到 robots.txt
有一個原本不打算當成發現的附帶觀察:前 10,000 名網站裡,有 66% 對單一研究 IP 回傳了可解析的 robots.txt,而且 10,000 個網站裡只有 7 個(0.07%)回了 429 Too Many Requests。對 robots.txt 作為一個公開協定來說,這是好消息。
拿來對比:兩個月前,我們對一個 1,008 網域的中型電商樣本跑同一套流程時,52% 的已解析網域回了 429——Shopify 和 Cloudflare CDN 對任何非主要搜尋引擎的 UA,都採取激進限流。可見高流量網路友善得多:前段網站比較可能具備 (a) 沒那麼激進的 bot 管理層,或 (b) 對已知研究爬蟲設了明確白名單,或者兩者兼有。
前 10k 裡 21% 的 fetch_failed,主要來自 CDN 根節點(akamai.net、cloudfront.net、fastly.net、apple-dns.net、gtld-servers.net),它們在 / 根本沒跑 webserver。它們不是在封我們,只是沒東西可給。把這些剔掉之後,真正「試了但讀不到」的比率,只落在低個位數。
這代表這份報告未來的版本——季度快照、年對年比較——都能在單機上以低成本、可重現的方式跑出來。曲線前端的審計窗口還開著。反觀長尾和電商區段就是另一回事,那裡的 CDN 層級限流,幾乎已經把 robots.txt 私有化了。我們預期這種分化只會加劇:前段網站因為要被搜尋引擎索引而必須保持可讀,所以會繼續可讀;長尾電商則會因為 Cloudflare 的 bot fight 等級被越開越高,而變得更難被讀到。robots.txt 的公開可審計性,正沿著「可見網路」和「受營運保護網路」之間的同一條線,開始分岔。
IV. 這一切到底代表什麼
四個主張,按資料支持力度由強到弱排。
1. 網際網路的 AI 政策是按產業劃分的,不是全球統一。 新聞與電信之間那道 12 倍的落差,主導了所有匯總數字。要是只報「X% 的網路封鎖 AI」而不按產業切,就會高估 SaaS/政府/開發工具,低估新聞/旅遊/社群。唯有按產業報告,才是誠實的框架。
2. EU 著作權指令第 4 條,是唯一一個明顯在推動數字變化的法律制度。 EU ccTLD 網站的封鎖率是 35%,全球基準卻只有 19%。美國的訴訟(NYT v. OpenAI、美國著作權局 2025 年 1 月報告)改變了美國新聞群體,但沒動到更廣的美國網路。而 EU 的框架還透過 Cloudflare 的範本向全球滲透——不管客戶在哪個司法管轄區,範本一律引用 2019/790 指令。
3. 有兩套並行的「AI 政策」正在被表達,而且彼此並不一致。 刻意、手寫的政策(17.8%,主力是新聞/社群/旅遊/電商)和繼承而來的 Cloudflare Managed 政策(4.5%),實質上重疊,合法性卻不同。在一個 AI 經營者到處找法律依據好無視 robots.txt 的世界裡,「我自己寫、也審過」這套抗辯,結構上就是比「我只是把它打開」更硬。訴訟帶來的誘因,正是把政策從第二類推向第一類。
4. 出版商封的是資料源頭,不是模型。 CCBot 以 16.3% 排第一,甚至高過任何一個模型品牌的 bot,這一點最說明問題。封 OpenAI,沒法讓出版商退出「已經被訓練過」;封 CCBot 才行。前 10k 網路裡有 14.1% 在封 CCBot 的同時,還放行 Googlebot。到 2026 年,「擋訓練、留搜尋」已經是最典型的一條 AI 規則。
對正在盤算自身立場的網站來說: 最普遍的姿態是沉默——前 10k 裡有 80% 對 AI 什麼都沒說。真正寫了規則的那 17%,幾乎清一色是 Disallow,但有一小群、而且還在擴大的網站(以資安供應商為主的那份 1.5% 明確 Allow GPTBot 名單)正公開往相反方向走。沒有產業共識,未來 12 個月也不會有。
對 AI 經營者來說: 當全世界 17% 的大型網站,已經手寫出明確、刻意、點名 bot 的規則,且 3.8% 的檔案直接引用 EU 法條條號時,再堅稱 robots.txt 只是個語意模糊的老協定,會越來越站不住腳。要不要遵守那些規則,是商業決策;那些規則存不存在,如今已是實證事實。
V. 展望:2026 年底前,我們預期會看到什麼
資料裡看得出三個趨勢。
Cloudflare Managed 的占比會翻倍以上,合理推估能到可解析前 10k 的 10% 以上。 Cloudflare 的路線圖公開談過要對新帳號預設開啟 Block AI Bots。這個開關真要預設開啟,全球封鎖率就會在沒有任何出版商拍板的情況下漲個 5 到 8 個百分點。等 rank 5001–10000 區間的 Cloudflare Managed 占比越過目前的 5.7%,我們就知道這件事正在發生。
區塊層級的 AI 政策(像 Spiegel 那種)會在主要新聞旗艦之間擴散。 那套經濟邏輯——讓 AI 引用低風險內容,護住護城河內容——已經夠有說服力,所以我們預期到 2026 年底,至少還會有 10 家旗艦新聞編輯部推出區塊層級規則。留意德國和法國的中型媒體;那裡的法制最鼓勵這種實驗。
明確 Allow GPTBot 的群體會成長,主力是 B2B SaaS 和開發工具。 當 AI 搜尋變成軟體供應商可以量化的獲客管道時(資安領域現在已經是了),邊際的 CMO 會動筆寫下 User-agent: GPTBot \n Allow: /,免得不小心被過度封鎖。我們預期那份 108 個網站的名單,年底前大概會翻一倍。
我們不預期的是:沉默多數的占比會有什麼明顯變化。那 80% 對 AI 什麼都沒說的網路,涵蓋政府、電信、基礎設施、B2B SaaS 這些產業——它們既沒有寫規則的經濟理由,也沒有寫規則的法律壓力。全面性的 AI 政策,不會到來。
VI. 限制
- 這只是一張快照。 抓取集中在 2026 年 5 月初一段 36 小時的窗口。前 100 名網站的檔案幾乎天天在動,頭條數字每季預估會漂個 1–2 個百分點。
- 產業分類有缺口。 四層分類器跑完,仍有 6,593 個網站落在
unknown。樣本夠厚的產業,百分比很穩(新聞:650、串流:440、SaaS:369、學術:268、成人:254、電商:224、政府:172、金融:129、開發工具:129),可一旦 n < 30,噪音就上來了。國家新聞切分也一樣——DE/FR/UK 有 n ≥ 15,韓國/瑞典/捷克只落在 n=20–25。 robots.txt從來只是自願的。Disallow是一句請求,不是一道牆。Bytespider、PerplexityBot都有無視規則的前科。我們量到的是政策的宣告,不是政策的執行。- 審計只有一個美國 IP。 21% 的已解析網域我們讀不進去。絕大多數是沒跑 webserver 的 CDN 根節點;少數則是 CDN 在我們摸到原站之前就把請求標記掉了。這會讓樣本稍微偏向較舊的基礎設施,也漏掉那些按來源國做地理封鎖的網站。
- Tranco 清單的語意。 Tranco 做的是穩定性篩選,並非嚴格意義上的使用者行為排名。匯總數字對清單怎麼選相對不敏感,但具體的名次位置就不是了。
- 沒有流量資料。 我們量的是
robots.txt上寫的政策,不是 AI bot 實際跑了多少量。政策與流量,未必對得上。
VII. 重現本研究
用來產出這份報告的所有檔案,都放在交付資料夾裡。
- tranco_top10k.csv —— 輸入清單
- out/sites.csv —— 網域 × 排名 × 產業 × 語言 × robots.txt 狀態(10,000 列)
- out/fetch_meta.csv —— 每個網域的抓取結果(狀態、scheme、位元組數、錯誤)
- out/bot_status.csv —— 網域 × bot 矩陣(250,000 列:是否封鎖、是否有規則、抓取狀態)
- out/site_meta.csv —— 每個網站一筆分析紀錄(範本、摘要布林值)
- out/analysis.json —— 報告中引用的所有指標
- 01_fetch_robots.py、02_classify.py、03_parse_and_analyze.py —— 完整 Python 流程
歡迎將方法論修正、資料集問題與後續分析寄至 support@thunderbit.com。本報告獨立於 Thunderbit 所持有的任何商業立場;我們打造的是 AI 驅動的網頁爬蟲,而我們在結構上也有理由希望 robots.txt 在公開網路上持續成為一份有意義、機器可讀的契約。本報告中的資料本身即可成立。—— Thunderbit 研究團隊,2026 年 5 月。
試用 Thunderbit AI Web Scraper Get Started Free


