頂尖網站如何為 AI 爬蟲劃出界線

最後更新於 July 21, 2026
頂尖網站如何為 AI 爬蟲劃出界線

執行摘要

想知道網站對 AI 到底是什麼態度,最誠實的地方不是官方聲明,而是一份藏在網址結尾的小檔案:robots.txt。我們把 Tranco 前 10,000 名網域的這份檔案一個個抓回來,用符合 RFC 9309 的解析器逐行讀,統計 2026 年全球最熱門的網站裡,到底有多少真的伸手去攔 ChatGPT、Claude、Perplexity、Gemini、Common Crawl、Bytespider、Apple Intelligence,還有其餘那一票餵養與服務大型語言模型的爬蟲。

其中 7,248 個網站給了我們可讀的檔案。幾個核心數字如下:

ai-crawler-block-statistics.webp

全球前 10,000 名網站中,有 20.3% 封鎖至少一個 AI 爬蟲。17.0% 有明確、針對 AI 的刻意規則。其餘 80% 對 AI 爬蟲的態度,和對 Googlebot 一樣開放。

有六個發現,把外界對這件事的印象整個翻了過來:

  • 新聞機構的封鎖率達 47% —— 這是所有產業裡最高的。攤到國別更誇張:德國新聞業 88%,法國 80%,俄羅斯 0%。真正在拉動這條曲線的是法規,不是技術問題,也不是產業經濟。
  • CCBot(Common Crawl)是最常被封鎖的機器人,達 16.3% —— 比 GPTBot(15.8%)和 Bytespider(14.9%)都高。出版商瞄準的其實是訓練資料的源頭,而不是哪個模型品牌。最典型的選擇性規則就是「封鎖 CCBot、放行 Googlebot」(14.1% 的網站這麼寫)。
  • 法國以 .fr 網站 50.6% 的 AI 封鎖率領先全球;EU 群組整體比全球基準高出 16 個百分點。 有 275 份 robots.txt 直接寫出 EU 指令 2019/790。攤開來看,第 4 條是唯一一個明顯讓數字動起來的法律制度。
  • 17.8% 是自己動手寫的 AI 規則;4.5% 套用 Cloudflare 的供應商範本;75.7% 什麼都沒提。 大型網站傾向自己寫,長尾網站則直接把開關打開。有趣的是,The Atlanticcloudflare.com 本身,都落在 Cloudflare Managed 這一格。
  • 有 108 個網站反過來明確 放行 GPTBot —— WordPress.org、Kaspersky、Norton、Avast、Sophos、The Verge、The Atlantic、NBA.com、The Sun、Branch.io 都在其中。資安與開發工具類網站在這份名單上特別密集。
  • AI 政策並沒有越往排名前段就越強硬。 前 100 名、101–1000 名、1001–5000 名、5001–10000 名,全都落在 19% 到 23% 這個窄帶內。這個頭條比例,反映的是 2026 年公開網路的整體面貌,跟某個單一大站有多龐大沒什麼關係。

所以,該問的問題已經不是「網路是不是在反擊」了。而是——哪些產業、哪些國家、哪些法規制度,還有哪些 AI 供應商,成了這些積極政策的靶子;又有哪些,被放過了。


I. 背景:robots.txt 怎麼變成了 AI 政策的載體

OpenAI 在 2023 年 8 月推出 GPTBot 之後,有三股力量把 robots.txt 的意義重新改寫了一遍。

AI 供應商一個接一個冒出來。 Google 的 Google-Extended、Anthropic 的 ClaudeBot、ByteDance 的 Bytespider、Apple 的 Applebot-Extended、Amazon 的 Amazonbot、Meta 的 Meta-ExternalAgent 陸續登場。原本就存在的 Common Crawl CCBot,因為它的封存資料餵養了絕大多數開源權重模型,反倒成了最有份量的封鎖目標。除了供應商自家的爬蟲,還有一批第三方的:AI2Botcohere-aiPerplexityBotYouBotDuckAssistBotDiffbotOmgili。到 2026 年,一份寫得齊全的封鎖清單,大概要點到 25 個名字。

EU 著作權指令 2019/790 第 4 條替文本與資料探勘留了一個法定例外,但有個前提:權利人得用「機器可讀」的方式「明確保留」自己的權利。2024 到 2025 年這兩年,EU 的出版商和律師界慢慢達成共識,把 robots.txt 當成表達這種保留的標準做法。資料也印證了這一點——有 275 個網站在檔案裡直接引用 2019/790 指令,另有 87 個提到「TDM」;這些內容多半集中在歐洲新聞網站,通常是開頭那 4 到 8 行的法律前言。

Cloudflare 則把這個開關做成了產品。 2024 到 2025 年間,Cloudflare 陸續端出「AI Audit」儀表板、「Block AI Bots」切換開關,還有一份帶 Content-Signal: search=yes,ai-train=no 語法、內建 EU 2019/790 範本文字的 Managed robots.txt 範本。到 2026 年 5 月,這份範本已經跑在可解析前 10k 網站的 4.5% 上。而 Cloudflare 的產品路線圖公開講過,打算對新帳號預設開啟這個開關——真要這麼做,全球封鎖率會在沒有任何一家出版商拍板的情況下,硬生生往上抬 5 到 8 個百分點。

到了 2026 年,robots.txt 早已不是 2022 年那個沒人多看一眼的設定檔。在 EU,它是一種有條約背書的著作權保留機制;在長尾網站裡,它是被供應商塑形的政策載體;而在網站經營者與模型訓練者之間,它更是一條正在慢慢談判的前線。


II. 方法論

我們刻意把整件事做得很無聊、可以完整重跑。從 Python 腳本、解析後的 CSV、原始 robots.txt 檔案庫到圖表,全流程都隨這份報告一起公開。

樣本

一切從 2026 年 5 月的 Tranco 清單開始,下載成 top-1m.csv.zip,取最前面 10,000 筆。Tranco 的做法是把四家上游排名(Cisco Umbrella、Majestic、Farsight 與 Cloudflare Radar)攪在一起,拿 30 天視窗把不穩定的項目濾掉,順手再刮掉明顯的爬蟲/CDN 雜訊。這樣做出來的名單,是公開資料裡最接近「全球流量前 10,000」的一份,也是學界慣用的網路研究樣本——KU Leuven 2018 年推出至今,已經有 600 多篇同儕審查論文引過它。

名單裡其實摻了三種網域:(a) 人會真的去點的主站;(b) 不在 / 提供內容的基礎設施/API/DNS/CDN 根網域;(c) 大型平台內部自用的網域(gvt1.comapple-dns.netgoogleusercontent.com 這類)。後兩種我們沒有先剔,全留下來,在分析層打上 infrastructure 標籤——反正等範圍收成「有可解析 robots.txt 的網站」,它們自己就退出去了。

抓取

針對這 10,000 個網域,每一個都以 HTTPS 非同步送出 GET /robots.txt;失敗就退回 HTTP,重新導向最多跟 4 次,總逾時 12 秒,主體封頂 500 KB,並掛上一組真正瀏覽器風格的 User-Agent 加 Accept-Language: en-US。並行數壓在 80 個請求。整批任務跑在舊金山的一個住宅 IP 上。

結果攤開來是這樣:

狀態數量解讀
200 OK6,638已回傳且可解析 robots.txt 內容。
404 Not Found610不存在 robots.txt。RFC 9309 將其定義為隱含「允許一切」。
403 Forbidden563來源主動拒絕 robots.txt 請求。排除於分析之外。
429 Too Many Requests7在這個排名區間,幾乎沒有 CDN 層級的限流。
fetch_failed(TLS / DNS / TCP 錯誤)2,065多半是 CDN 根網域(akamai.netcloudfront.netfastly.netgtld-servers.netapple-dns.net),它們不會在 / 提供網站。這不代表「被封鎖」——只是根本沒有 robots.txt 可提供。
其他 4xx/5xx117混合狀況——伺服器錯誤、地理封鎖、回應格式異常。

加總下來,可分析樣本是 7,248 個(6,638 個 200 再加 610 個 404。那 2,065 個 fetch_failed 確實都是真網域,但身分是 CDN/DNS 根節點,不是誰會去逛的網站;把它們當成「有 AI 政策」說不過去。這批網域在資料集裡另闢一格,只算可存取性。

解析

所有 200 回應,一律丟給 protego 去解析——這支符合 RFC 9309 的 Python 實作,早就在 Scrapy 的生產環境裡跑著。針對每一組(網站,機器人)配對,我們算三樣東西:

  1. can_fetch_root——這個機器人能不能抓 /。判斷時照標準走:群組紀錄語意、最長匹配優先,以及當兩者同時存在時,特定機器人的封鎖會蓋過 User-agent: *
  2. has_specific_rule——檔案裡有沒有一行明確點名該機器人的 User-agent:(不分大小寫)。
  3. disallow_count——匹配區塊裡有幾條 Disallow: 指令,用來分辨整站封鎖和路徑層級的限制。

這三個一起看很關鍵,因為單看表面的「封鎖率」,會把兩種完全不同的事混為一談。一種是品牌有意識地寫下 User-agent: GPTBot \n Disallow: /,明擺著要反制;另一種則是多年前為了 staging 或維護,順手設下的通用 User-agent: * \n Disallow: /,剛好也把當時還不存在的 AI 機器人一併擋掉了。在這份報告裡,**「任一 AI 封鎖」兩種都算;「明確 AI 封鎖」**則只算刻意寫出來的那個子集。

涵蓋的機器人

我們追了 25 個機器人,分成三類:

  • AI 訓練爬蟲(16)GPTBotClaudeBotanthropic-aiCCBotGoogle-ExtendedMeta-ExternalAgentBytespiderApplebot-ExtendedDiffbotAmazonbotImagesiftBotFacebookBotcohere-aiAI2BotOmgiliOmgilibot
  • AI 推理/即時檢索機器人(7)PerplexityBotPerplexity-UserChatGPT-UserOAI-SearchBotClaudeBot(訓練與推理都做)、YouBotDuckAssistBot
  • 搜尋基準(6)GooglebotBingbotDuckDuckBotSlurp(Yahoo)、BaiduspiderYandexBot

分類的難處在於,有些 bot 一腳踏兩條船。ClaudeBot 是最典型的例子:Anthropic 2024 年收掉了舊的 anthropic-ai UA,如今訓練和即時檢索都由 ClaudeBot 一手包辦,Disallow: ClaudeBot 因此再也無法乾淨地表達「只擋訓練、保留可見性」這層意思。我們沿用原本的歸類,相關影響留到後文交代。

產業分類

為了把每個網域對進 16 個產業桶其中之一(newssocialstreamingecommercesearchfinanceinfrastructuresaasacademiadevgovadultgamblingtraveltelecomunknown),我們讓四道判斷由準到粗依序上場:

  1. 已知網域字典——手工整理約 500 個高流量網域到產業的對照表。
  2. TLD/後綴模式——.govgov.edu.ac.*academia、認得出來的 CDN 後綴歸 infrastructure
  3. 網域名稱關鍵字——newspostshopbankporncasino 這類字眼當備援訊號。
  4. 首頁抓取——前 3 層分不出來、但 robots.txt200 的網站,我們去抓首頁 HTML,取出 <title><meta name="description"><meta property="og:type">,再用關鍵字分數對照語言模型式的類別線索。

跑完之後,3,407 個網站(34%)掛上了明確的產業標籤,另外 6,593 個留在 unknown。落到 unknown 的,多半是非英語的區域入口站、跨界到說不清屬於哪一類的大型企業 .com 品牌,還有字典裡沒收的中小語言市場傳統媒體。凡本文引用某產業的百分比,分母都是該產業已分類的樣本,而非全數 10,000。


III. 發現

發現 1 —— 每五個高流量網站,就有一個擋掉了至少一個 AI 機器人

在 7,248 個可分析的網站裡,1,472 個(20.31%) 封鎖了至少一個 AI 機器人。1,230 個(16.97%) 寫了刻意的 AI 專屬規則。相較之下,Googlebot 的基準只有 2.18%(158 個網站——多半是把一切都關掉的維護預設,或少數幾個搜尋引擎在擋競爭對手)。

20% 是 Googlebot 基準的 9 倍。訊號是真的——高流量網站攔 AI 爬蟲的機率,硬是比攔搜尋爬蟲高出一個數量級——可它同時也遠不如 2024 年起媒體那套「AI 封鎖幾近全面」的口吻。畢竟在全網最熱門的 10,000 個網站裡,仍有五分之四對此不吭一聲。

「任一 AI 封鎖」(20.3%)與「明確 AI 封鎖」(17.0%)中間那 3.3 個百分點,值不大,講究的地方卻在此。它代表的,是那些單純因為舊有的 User-agent: * \n Disallow: / 把所有機器人一律攔下、而非特意衝著 AI 來的網站。要問「全球最大一批網站裡,有多少真的做過 AI 專屬決策」,17.0% 這個刻意值才是更貼切的答案。

跟先前的研究擺在一起看:

來源日期樣本封鎖率
Originality.ai2025 年 3 月1,000 個最熱門新聞(英文)35.7% 封鎖 GPTBot
Palewire2024 年 8 月1,500 個新聞機構36.0% 任一 AI 爬蟲
Reuters Institute2025 年春季50 個領先新聞品牌,10 個國家78% 任一 AI 爬蟲
WIRED / NYT2023 年底美國前 50 大新聞網站26% 封鎖 GPTBot
本報告(Thunderbit)2026 年 5 月Tranco 前 10,000 名(全產業)20.3% / 17.0% 明確

我們 17.0% 的明確值,比所有只看新聞的研究都低——原因很單純,我們的樣本有三分之二根本不是新聞。若只抽出 650 個新聞網站來看,數字會跳到 47%;把樣本組成考慮進去之後,其實跟前面那些研究落在同一個區間。結構上的圖像是一致的:新聞這個族群封 AI 的比率,是網路其他角落的 3 到 4 倍。


發現 2 —— 產業深潛:從新聞到電信,落差高達 12 倍

過去兩年,所有「AI 抓取」的報導裡被引用最多的一句,就是 Originality.ai 和 Palewire 那個「80% 的新聞機構封鎖 GPTBot」。我們這次切出來的數字比較小,但依然顯眼:前 10,000 名裡的新聞網站,47.2% 封鎖了至少一個 AI 機器人,45.2% 寫了明確的 AI 規則。

不過「新聞 vs 其他所有」這種二分法太粗。把 n ≥ 10 的產業完整攤開,故事豐富得多:

robots-industry-spread_compressed.webp

產業n任一 AI 封鎖明確Googlebot 被封鎖自行規則Cloudflare Managed沉默
新聞65047.2%45.2%1.5%46.9%1.5%48.5%
旅遊6429.7%29.7%0.0%35.9%3.1%54.7%
社群6529.2%23.1%4.6%23.1%6.2%66.2%
串流44020.0%17.7%0.7%16.8%3.6%75.5%
金融12919.4%12.4%0.8%14.7%2.3%75.2%
電商22418.3%17.4%0.4%24.1%1.3%66.1%
成人25417.3%14.6%0.4%10.2%7.9%79.5%
搜尋1216.7%0.0%0.0%0.0%0.0%100.0%
學術26814.6%13.8%0.4%13.4%3.4%77.2%
博彩10014.0%13.0%0.0%18.0%4.0%77.0%
開發工具12910.1%7.8%0.0%8.5%5.4%77.5%
SaaS3697.6%6.2%0.3%9.5%0.8%87.5%
政府1725.2%3.5%0.0%4.1%0.6%83.1%
基礎設施474.3%0.0%0.0%4.3%2.1%72.3%
電信333.0%3.0%0.0%12.1%0.0%78.8%

新聞和電信之間那道 12 倍的落差,正好說明了為什麼「網路的 AI 政策」根本不是一個合理的分析單位。沒有哪個單一數字說得清;只有各產業各自的數字,而且彼此差了一個數量級。下面挑四個最有代表性的來拆。

新聞:47% 封鎖,47% 自己動手寫規則。 新聞是最早把劇本寫出來的一群。Cloudflare Managed 在新聞類別只佔 1.5%——這些出版商不會把規則外包出去。它們的文本也特別厚:NYT 開頭是 14 行法律前言,引「EU 指令第 4 條」;BBC 寫的是 「請像人類一樣使用我們的網站,不要像機器人……簡而言之:瀏覽、閱讀、觀看、享受——像人類一樣。」The Sun 則直白寫道 「The Sun 不允許未授權使用我們內容來供大型語言模型使用。」。這是把 robots.txt 當政策聲明在寫,而不是設定。

旅遊業 30%,這個有點出乎意料。 Booking、Expedia、TripAdvisor、Kayak 加上幾家主要航空公司,封鎖率是新聞業的三分之二。它們的選擇性模式很一致:一個典型的旅遊封鎖者會擋掉 5 到 7 個訓練用 UA,卻留著推理用 UA(PerplexityBotChatGPT-UserOAI-SearchBot)。道理不難懂——聚合來的價格與評論資料是護城河,而回流到網站的引用則是收入來源。這是所有產業裡「擋訓練、放推理」這條線切得最乾淨的一個。

成人內容 17%,同樣意外。 早期較小的樣本一度顯示 0%。完整樣本一跑,每 6 個成人網站就有 1 個封了至少一個 AI 機器人,而且 Cloudflare Managed 的比率是全產業最高(7.9%)。成人網站的 AI 封鎖裡,一半以上來自 Cloudflare 的開關,而非出版商自己拍板。影像生成訓練是背後那個沒說出口的威脅——Stable Diffusion 這一級的模型學視覺風格,比文字模型學寫作風格快多了。

SaaS 只有 7.6%,反直覺。 軟體供應商在 AI 政策的討論裡嗓門最大,可它們的 robots.txt 卻很開放。正確的讀法是:SaaS 行銷團隊已經把 AI 搜尋當成一條分發管道看待了。真正想清楚這件事的供應商,做的是 opt in 而不是 opt out——明確放行 GPTBot 的那份名單(見發現 12),主力就是資安與開發工具型的 SaaS。

政府 5.2%、電信 3.0%、基礎設施 4.3%、開發工具 10.1%。 公共紀錄的義務,讓 .gov 上的 Disallow: / 在法律上很尷尬。電信的行銷網站巴不得被搜尋到。CDN 根節點壓根沒有東西要保護。至於開發工具,是明確地選擇加入——因為當 LLM 引用它的內容時,內容本身的價值反而水漲船高。

一句話收尾:不存在哪個「網路有沒有在封 AI」的單一數字,能在不失真的前提下把問題說完整。唯一誠實的講法,就是按產業層級來報。


發現 3 —— 換個切面看 AI 供應商:誰被封得最多?

還有一種很自然的切法,不是看機器人,而是看 AI 公司。有幾家供應商同時養好幾個機器人(OpenAI 有三個:GPTBotChatGPT-UserOAI-SearchBot;Anthropic 有兩個:ClaudeBotanthropic-ai;Meta 也有兩個:Meta-ExternalAgentFacebookBot)。把這些聚合到供應商層級,最接近「公開網路對每一家 AI 公司到底怎麼看」的答案。

AI 供應商聚合機器人封鎖至少 1 個機器人的網站可分析樣本占比
Common CrawlCCBot1,17816.25%
OpenAIGPTBotChatGPT-UserOAI-SearchBot1,17216.17%
AnthropicClaudeBotanthropic-ai1,11115.33%
ByteDanceBytespider1,08214.93%
MetaMeta-ExternalAgentFacebookBot98913.65%
GoogleGoogle-Extended97013.38%
AmazonAmazonbot87712.10%
AppleApplebot-Extended85911.85%
Webz.io(Omgili)OmgiliOmgilibot73110.09%
Coherecohere-ai7179.89%
PerplexityPerplexityBotPerplexity-User7159.86%
DiffbotDiffbot6849.44%
You.comYouBot5637.77%
AI2(Allen AI)AI2Bot4876.72%
DuckDuckGoDuckAssistBot4826.65%

Common Crawl 是被針對得最兇的單一實體,儘管它只是個非營利的網路封存庫,根本不經營 LLM。原因在槓桿:CCBot 幾乎替所有開源權重模型、以及相當比例的閉源模型供資料。先封 CCBot,是出版商能寫出來、覆蓋面最廣的一條規則。

OpenAI、Anthropic、ByteDance 擠在 14–16% 這一段。 OpenAI 領先的一部分是計數上的結構造成的(OpenAI 有三個 bot,ByteDance 只有一個)。Bytespider 的 14.9% 則是「Bytespider 自己行為不端」效應——它自 2024 年起就被記錄過無視 robots.txt,出版商封它,比較像是在公開放話,而不是真的擔心 TikTok。

Meta、Google、Amazon、Apple 落在 12–14%,算第二梯隊——這些規則多半是防守性地順手寫上,而非什麼政治表態。小型供應商(Webz.io、Cohere、Perplexity、Diffbot、You.com、AI2、DuckDuckGo)在 6–10%,多半是被 3.8% 那條通用底線抬上去的;真正針對它們的明確規則,大約落在 1–4%。

xAI(Grok)、Mistral,還有大部分歐洲/中國的模型實驗室,都沒進這張表——因為它們根本沒有公開的訓練爬蟲 UA 文件。現有的 robots.txt 生態,其實是一場對話:一邊是美中供應商搶先發佈 UA,一邊是美歐出版商動筆寫規則;而那些沒發佈 UA 的供應商,在這場協商裡是隱形的。


發現 4 —— 踩到雷區的是 CCBot,不是 GPTBot

前 10k 裡,機器人的封鎖排序長這樣:

most-blocked-ai-crawlers-vendors.webp

排名機器人封鎖率明確規則率
1CCBot(Common Crawl)16.25%12.90%
2GPTBot(OpenAI)15.84%12.72%
3Bytespider(ByteDance)14.93%11.35%
4ClaudeBot(Anthropic)14.51%11.13%
5Google-Extended13.38%10.18%
6Meta-ExternalAgent12.38%8.95%
7Amazonbot12.10%8.66%
8Applebot-Extended11.85%8.72%
9Omgilibot10.09%5.31%
10anthropic-ai(已棄用)9.99%6.55%
11cohere-ai9.89%6.42%
12PerplexityBot9.69%6.40%
13Diffbot9.44%5.95%
14ChatGPT-User(推理)8.90%5.73%
15YouBot(推理)7.77%4.29%
16OAI-SearchBot(推理)6.83%3.66%
基準Googlebot2.18%
基準Bingbot2.27%

這張表講的其實是一件事:公開網路最先擋的,不是模型品牌,而是資料源頭。 Common Crawl 那個 2500 億頁的封存庫,已經是 GPT-3、GPT-4、Llama 1 / 2 / 3、Falcon、Mistral、BLOOM,以及 2020 年之後大多數開源權重模型的單一最大訓練輸入。一個網站若想退出「成為下一代前沿模型的一部分」,最划算的做法就是先禁掉 CCBot——只要不進 Common Crawl,你幾乎等於免費退出了開源訓練管線。GPTBotClaudeBot 之所以排在二、三名,是因為它們是兩個商業產品的可見門面;而資料源頭層級的 UA,才是結構性的靶心。

表尾那幾個排名低的 AI 機器人,資訊量也不小。Omgilibot 的 10% 高得反常——對一個多數讀者可能連聽都沒聽過的 bot 來說更是如此。它由 Webz.io 經營,這是一家把網路封存資料賣給 LLM 經營者的內容資料中介商,而不少新聞機構已經在檔案裡直接點了它的名。AI2Bot 的 6.7%(以及 Squarespace 網站上對應的 Ai2Bot-Dolma 規則),則顯示連學術 LLM 圈也開始被標記了——因為出版商未必會去區分「非營利研究爬蟲」和「商業爬蟲」。

推理群組——ChatGPT-UserOAI-SearchBotYouBotPerplexity-User——比訓練群組低了 4 到 8 個百分點。這道差距回答了一個懸而未決的政策問題:答案是「會」;高流量網站確實會分辨「為將來訓練模型而抓資料的 bot」和「此刻就為使用者問題即時檢索的 bot」。他們不見得每次都分得清楚(通用規則就不分),但確實有相當一部分網站,特意針對訓練端寫下了規則。


發現 5 —— 14% 封 CCBot、同時留 Googlebot:也就是「擋源頭、留搜尋」

前 10k 裡最常見的一條選擇性規則是:

website-crawler-blocking-stats.webp

規則模式網站數可分析樣本占比
封鎖 CCBot、允許 Googlebot1,02314.11%
封鎖 Bytespider、允許 Googlebot92612.78%
封鎖 Google-Extended、允許 Googlebot81611.26%
封鎖 GPTBot、允許 OAI-SearchBot6589.08%
封鎖 GPTBot、允許 ChatGPT-User5257.24%
封鎖 CCBot、允許 PerplexityBot5197.16%
封鎖 anthropic-ai、允許 ClaudeBot590.81%

最多網站採納的模式(14.1%)是「擋掉 Common Crawl,但保住 Google 搜尋的可見性」。第二名(12.8%)是「擋掉 Bytespider,但保住 Google 搜尋」——也就是把 ByteDance 那個已被貼上風險標籤的爬蟲擋在門外,同時留住合法的搜尋基準。第三名(11.3%)是「擋掉 Google 自家的 AI 訓練 UA,但留著 Google 的搜尋 UA」,這正是 Google 當初設計 Google-Extended 的用意:出版商可以退出 Bard/Gemini 的訓練,卻不必賠上搜尋排名。

這三個數字合起來,就勾勒出前 10k 網路的主流姿態:擋掉抓訓練資料源頭的 bot,留下搜尋和推理的 bot。至於少數那種「擋訓練、但放行該 LLM 特定的即時檢索 UA」的模式——GPTBot ✗ / ChatGPT-User ✓,占 7.2%——確實存在,但規模不如源頭層級的切法。

anthropic-ai / ClaudeBot 這一列只有 0.81%,反映的是 Anthropic 在 2024 年棄用了舊 UA:如今 ClaudeBot 訓練和推理一手包,過去那種靠 anthropic-ai 表達「擋訓練、放引用」的乾淨寫法,就此不復存在。這是 2024 到 2025 年間最少被拿出來討論的 UA 設計決策之一——它等於從 robots.txt 裡抹掉了一整類政策表達方式。


發現 6 —— 新聞的細節:按國家和語言切開來看

當我們把新聞類別按國別頂級網域(country-code TLD)切開時——要提醒一下,這代表的是 .de 的德國新聞、.fr 的法國新聞,而不是網站用什麼語言——會發現產業內部的差異,比新聞和其他產業之間還大:

news-blocking-country-tld.webp

國家(僅新聞)n任一 AI 封鎖明確
🇩🇪 德國(.de2588.0%88.0%
🇫🇷 法國(.fr1580.0%80.0%
🇬🇧 英國(.co.uk1566.7%53.3%
🇪🇸 西班牙(.es560.0%60.0%
🇮🇹 義大利(.it1353.8%53.8%
全球新聞(.com / .org / 等)50045.0%42.8%
🇵🇱 波蘭(.pl742.9%42.9%
🇯🇵 日本(.jp1225.0%25.0%
🇷🇺 俄羅斯(.ru130.0%0.0%
🇬🇷 希臘(.gr60.0%0.0%

德國新聞是整份資料集裡封鎖率最高的子群,達 88%,而且 88% 全是明確規則——白話說,前 10k 裡幾乎沒有哪家德國新聞網站,會放行 AI 訓練爬蟲來抓自己的資料庫。這一群由 SpiegelBildWeltZeitFAZSüddeutscheHeiseGolemSternFocus 領頭——整個德國主流出版界,再加上獨立寫規則的科技媒體。底下的政治基礎很厚:VG Media(德國出版商的集體權利組織)一直是 EU AI 著作權訴訟裡最積極的原告群,而 EU 指令第 4 條在德國法裡以 §44b UrhG 落地,還配了明確的機器可讀 opt-out 語言。等 AI 供應商上門時,德國出版商在所有國家群體裡,都是最有準備把這套法律立場翻成 robots.txt 規則的一群。

法國新聞 80%,緊追在後。 法國的法律環境很像(2019/790 指令已轉入法國法),群體行為也像——lemonde.frlefigaro.frliberation.frlequipe.fr20minutes.frouest-france.fr 都封了,而 Le Monde 的檔案還多引了一條法國的 droit du producteur de base de données(《智慧財產法典》第 L 342-1 條),當作平行的國內法律依據。法國還多了一個變數:2024 年巴黎商業法院判定,用 robots.txt 做出的 opt-out 足以構成第 4 條下的通知——這給了其他司法管轄區還沒有的直接判例支持。

英國 67% 反而低一些,因為好幾家大型英國出版商(thesun.co.ukdailymail.co.ukmirror.co.uk)用的是 User-agent: * 全拒絕封鎖,而不是 AI 專屬規則,把明確數字拉到了 53%。實際效果其實一樣——這些網站就是不讓 AI 抓——只是表述方式變成「除了這份搜尋引擎白名單,其他一律拒絕」,而非點名 AI bot 的 disallow。法律支撐也偏弱:脫歐後,英國雖沿用了第 4 條的邏輯,但對應的國內判例更單薄。

俄羅斯新聞 0%,是最讓人意外的一列。樣本裡的 13 個俄羅斯新聞網站(dzen.rurbc.ruria.rukommersant.rutass.rulenta.rugazeta.ruinterfax.rukp.rutass.com 等),沒有一個封任何 AI 爬蟲。合理的解釋是這樣:俄語的 LLM 訓練主要由 Yandex 自家的 GPT 類模型主導(用的是 Yandex 內部爬蟲,而不是 Common Crawl);俄羅斯的著作權環境還沒長出相當於第 4 條的法規;而大型俄羅斯出版商乾脆把西方 LLM 當成非議題(美國的出口管制已經讓 OpenAI/Anthropic 在俄羅斯的服務受限),把 Yandex 看成國內的利害關係人,而非對手。政策姿態明顯不一樣。

日本新聞 25%,又是另一幅光景。日本國內著作權法有明確的文本與資料探勘例外(《日本著作權法》第 30-4 條,2018 年修正),寬鬆程度比 EU 指令第 4 條還高——它允許出於「非享受」目的的 TDM,包含 AI 訓練,而且不需要權利人同意。日本出版商在 opt-out 上能抓的法律把手比較少,對應的 robots.txt 比率也就跟著低。那些真的封了的網站,多半是最大、最國際化的出版商(像 asahi.comnikkei.com),它們的定位本來就偏國際而非國內。

跨國新聞的這批資料,是整份報告裡最清楚的一項證據:真正在主導的是法規制度,不是技術,也不是產業經濟。 EU 新聞群體落在 54% 到 88% 之間;非 EU 新聞群體(俄羅斯、日本、全球 .com 群體)則從 0% 到 45% 不等。88% 的高峰,出現在第 4 條實施得最成熟的國家;0% 的低點,則出現在幾乎沒有 AI 政策法律的地方。


發現 7 —— EU 與其他地區:差了 16 個百分點

把國家視角再往上抽一層,EU 與非 EU 的大致分野就很清楚了:

區域n任一 AI 封鎖明確
EU ccTLD.fr.de.es.it.nl.pl.se.dk.fi.be.at.cz.hu.ro.gr.pt.ie.sk.bg61735.2%33.9%
非 EU 國家 ccTLD(.uk.jp.kr.cn.ru.br.in.au.mx.ca.tr.ar.cl.co.pe89717.2%13.6%
全球(.com.net.org 等)5,73419.2%15.7%

EU ccTLD 網站封 AI 的比率,是非 EU 國家群體的 兩倍,也差不多是全球 .com 基準的 兩倍。這個差距在 EU 各成員國之間都成立(沒有哪個單一國家在拉高平均),在各產業之間也成立(.de 新聞 88%、.de SaaS 約 12%、.de 電商約 25%——全都比全球同業高)。

我們在前 10k 裡找到 275 份 robots.txt在註解裡明白引用了 2019/790 指令——約占可解析樣本的 3.8%。這群網站以 EU 出版商為主,但不只他們:幾個美國新聞品牌(尤其是直接寫出「Art. 4 of the EU Directive」的 NYT)、一些英國網站,還有少數較大的歐洲電商,也照抄了這套法律文字。另有 87 份檔案明確提到「TDM」或「text and data mining」。而含有某種著作權保留語句(像「明確退出」、「保留所有權利」、「不得商業使用」、「不得機器學習」)的檔案有 460 份,就算沒引用特定法規也算在內。

這一層切下去,還帶出兩個更細的觀察:

EU 效應不只在新聞。 把新聞固定住之後,EU 的非新聞網站封 AI 的比率,還是比非 EU 的非新聞網站高(大約 28% 對 14%)。EU 的 SaaS、電商與學術界裡,有一小部分但確實存在的網站,已經把第 4 條的框架內化到自己的產業語境裡了。

EU 風格的措辭正在變成事實上的範本,連 EU 以外都是。 全球都在用的 Cloudflare Managed robots.txt 範本,範本文字裡明白引了「ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790」。一個美國網站只要開了 Cloudflare 的「Block AI Bots」,即使自己未必知道,實際上也等於在主張 EU 的法定權利保留。這是我們找到最有意思的政策漂移之一:一個歐洲的法律概念,正透過一家美國基礎設施供應商的產品介面,被推向全球。


發現 8 —— 範本,以及範本從哪來

在 6,638 個回傳可解析 robots.txt 的網站裡,範本來源的分布是這樣:

robots-txt-ai-bot-analysis.webp

範本網站數占比
未提及任何 AI 機器人(預設 Shopify 風格、Yoast、或完全未考慮 AI 的手寫檔)5,02475.7%
自訂 / DIY AI 規則1,18317.8%
Cloudflare ManagedContent-Signal: search=yes,ai-train=no3024.5%
明確對 GPTBotAllow: /1241.9%
Squarespace 預設(路徑受限封鎖中的 28 個 AI UA)50.1%

DIY 規則以 17.8% 居冠。 自己動手寫封鎖規則的這群,主力是各大社群平台(facebook.comtwitter.comlinkedin.comwhatsapp.comtiktok.comsnapchat.compinterest.comx.com、以及 chatgpt.com 自己)、最大型的電商(amazon.comamazonvideo.com)、主流新聞品牌(nytimes.comcnn.combbc.comtheguardian.comforbes.comreuters.combbc.co.ukt-online.deweather.com)、重量級的串流/媒體(netflix.comvimeo.comsoundcloud.comimdb.com),還有一長串專業服務網站(canva.commedium.com)。

Cloudflare Managed 占 4.5%——比它在排名最前段的滲透率高,卻比本報告涵蓋範圍以外那些長尾市場低。這份範本在 rank 1001–10000 段最常見(4–5%),到了曲線最前端幾乎絕跡(前 100 名只有 1 個網站用;101–1000 名 5 個)。大型全球資產自己寫規則;長尾網站則按開關。

有幾個 Cloudflare Managed 的網站值得一提。cloudflare.com 自己就在用這份範本,這很合理(Cloudflare 拿自家產品服務自家網域,典型的 dogfooding)。theatlantic.com 也在用——它是我們找到唯一一個沒有自訂規則的主要美國新聞品牌。spankbang.com 也用——它是採用 Cloudflare 注入式 AI 封鎖的成人網站裡,排名最高的一個。linktr.ee 也用,這意味著 Linktree 上整個創作者經濟的 AI 訓練,被單一供應商一次決策全擋掉了。launchpad.netnexusmods.comvinted.frcookielaw.orgrustdesk.com,再加一長串較小的媒體資產,共同組成了看得見的 Cloudflare Managed 群體。

Cloudflare 的採用模式,是我們目前握有最具體的證據,說明「網路的 AI 政策」有相當大一塊,其實是基礎設施供應商在決定。絕對占比雖然不大(4.5%),但結構意義很重:這是 Cloudflare 預設就端出來的範本,而未來 12 個月的 on-by-default 趨勢還在往上。要是 Cloudflare 把新帳號的開關改成預設開啟,全球封鎖率就會在沒有任何一家出版商作決定的情況下實質上升。

Squarespace 的預設值(前 10k 裡有 5 個,本樣本之外還更多)則是另一回事:Squarespace 會給一份 robots.txt,在單一區塊裡列出 28 個 AI bot,可是這些 bot 只會繼承 User-agent: * 的路徑限制,並不是整站封鎖。AI 爬蟲照樣能抓 /、首頁、產品頁、部落格;它們只是進不了 /config/account。我們先前就把這當成第三方掃 Squarespace 網站時「AI 封鎖」誤判的來源;這裡一樣適用。


發現 9 —— AI 政策在排名分布上其實相當平均

這類研究的直覺通常是:造訪量越大的網站,AI 政策應該越強硬——畢竟它們最怕被訓練出替代品、法律資源最多、也最受公眾盯著看。可惜資料不買帳。

排名區間n任一 AI 封鎖明確Cloudflare Managed
前 100 名6722.4%17.9%1 個網站
101–1,000 名59822.9%19.2%5 個網站
1,001–5,000 名2,81019.0%15.3%99 個網站
5,001–10,000 名3,77320.8%17.8%197 個網站

四個區間全落在 19% 到 23% 之間。前 100 名並沒有比 5001–10000 名那條長尾更強硬。這個頭條比率,看起來比較像是 2026 年公開網路本身的屬性,跟哪個單一網站有多大、多有名關係不大。

背後有兩股力量。第一,排名前段被基礎設施/SaaS/搜尋/入口網站網域主導(Microsoft、Apple、Google 這些),它們自己的 AI 封鎖率本來就低。第二,長尾裡塞了大量區域新聞出版商和 EU 管轄網站,而如發現 6 與 7 所示,它們封 AI 的程度高於全球平均。這兩股力量大致互相抵銷,最後就湊出一條相當平的頭條線。

Cloudflare Managed 這一欄倒是真的隨曲線在動。前 1000 名裡有 6 個 Cloudflare 管理網站(1.0%);1001–10000 名裡有 296 個(5.7%)。大網站自己寫,長尾用供應商開關。這是整份資料集裡唯一真正跟排名掛鉤的訊號,也意味著 當你沿著流量曲線從前段往長尾走時,政策由供應商設定、而非出版商設定的比例會穩定攀升。我們預期這條梯度會一路延伸到前 10 萬,甚至更後面。


發現 10 —— 五份解剖:當 robots.txt 真的是政策時,它長什麼樣

數字勾勒的是資料集的輪廓;至於「公開網路上的 AI 政策」究竟長什麼樣,最好還是回頭去讀幾份具體的檔案。下面這五份最值得一看,橫跨了整條政策光譜。

解剖 1 —— The New York Times(nytimes.com

nytimes.com/robots.txt 的前 14 行是這樣:

# New York Times content is made available for your personal, non-commercial
# use subject to our Terms of Service here:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# Use of any device, tool, or process designed to data mine or scrape the content
# using automated means is prohibited without prior written permission from
# The New York Times Company. Prohibited uses include but are not limited to:
# (1) text and data mining activities under Art. 4 of the EU Directive on Copyright in
# the Digital Single Market;
# (2) the development of any software, machine learning, artificial intelligence (AI),
# and/or large language models (LLMs);
# (3) creating or providing archived or cached data sets containing our content to others; and/or
# (4) any commercial purposes.
# Contact https://nytlicensing.com/contact/ for assistance.

與其說這是設定,不如說是一份呈堂證物。它的行文結構,明顯是衝著 NYT v. OpenAI 這場官司去的。由一家美國出版商來搬出「EU 指令第 4 條」,正好替發現 7 下了註腳——EU 那套法定框架,已經滲進了全球論述。裡頭那句「禁止建立或提供含有我們內容的封存或快取資料集」,箭頭直指 Common Crawl。整份檔案洋洋灑灑 60 多行,GPTBotOAI-SearchBotChatGPT-Useranthropic-aiClaudeBotCCBotGoogle-ExtendedApplebot-ExtendedBytespiderDiffbotMeta-ExternalAgentAmazonbotOmgiliOmgilibot 各佔一個 User-agent 區塊,點到的每一個 bot,收尾都是 Disallow: /

解剖 2 —— Der Spiegel(spiegel.de)——區塊層級的 AI 權限控制

Der Spiegelrobots.txt,是我們在整份資料集裡找到營運上最成熟的一份。相關區塊如下:

# TLP-6507: Testweise Freischaltung der OpenAI-Suchcrawler fuer ausgewaehlte Bereiche
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

開頭那行德文註解,意思是「針對選定區塊,試行啟用 OpenAI 搜尋爬蟲。」換句話說,Spiegel 只對 OpenAI 的推理 UA 放行七個內容類別——國際新聞、合作、健康、家庭、旅遊、心理、生活風格——其餘全關。政治、德國國內新聞、調查報導這些,一律被劃在門外。而 Common Crawl、Bytespider、Cohere、Webzio-Extended 這批訓練 UA,則在檔案更下方吃一記乾脆的 Disallow: /

這是把 robots.txt 當成區塊層級的編輯政策在用。它的內在邏輯是:生活風格內容被訓練替代的風險較低,而被引用帶來的推理收益較高,所以 Spiegel 放行這些區塊;政治與調查內容才是護城河,所以把 AI 擋在外面。這種模式我們在別處沒看到過。它意味著編輯、法務和基礎設施團隊之間已經有相當高的內部協調,而大多數新聞編輯部還沒走到這一步。我們預期這種更細粒度、區塊層級的政策表達,會在 2026 到 2027 年擴散開來——Spiegel 這份檔案,幾乎可以當領先指標看。

解剖 3 —— BBC(bbc.com)——政策聲明型

BBC 的 robots.txt 開頭是這樣:

# version: ec59bd036e5138eb4831a9ed44447b1ff310e235
# The BBC's Terms of Use: https://www.bbc.co.uk/terms
# - Explain the rules for using our services
# - Tell you what you can do with our content
#
# In short: Please use our site like a human, not a robot.
# That means:
# - No scraping, crawling, or systematic extraction of content
# - No use of BBC content for training or fine-tuning AI models, including LLMs
# - No retrieval-augmented generation (RAG), AI-powered search, agentic AI or
#   grounding using BBC content
# - No creating datasets from BBC content
# - No text and data mining (TDM) under Article 4 of the EU Directive on Copyright
# - No using BBC content to create summaries for your own use
# - No business use without permission
# - The BBC reserves all rights in its content and expressly opts out of any
#   statutory exceptions in any jurisdiction for text and data mining,
#   as permitted by law
#
# TL;DR: Browse, read, watch, enjoy - like a human.

連版本控管都上了:開頭那行 # version: ec59bd... 其實是一個 git commit hash。內文列出 BBC 法務盯著的八種 AI 用途一一禁止,末了再補一句合乎品牌調性的收尾。至於「明確退出任何司法管轄區中的法定例外」這句,是一記刻意的全球性保留,潛台詞是:沒有哪一套法律制度靠得住,那就在每個地方同時把退出這件事講死。 整份資料集裡,就數這份 robots.txt 最像被逐字打磨過,讀起來根本是新聞稿,不是設定檔。

解剖 4 —— WordPress.org —— 明確歡迎

拿上面幾份對照 wordpress.org

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: anthropic-ai
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Bytespider
Allow: /

User-agent: CCBot
Allow: /

User-agent: Copilot
Allow: /

這裡 WordPress.org 一口氣替九個 AI 訓練爬蟲開了門,當中三個(BytespiderCCBotanthropic-ai)恰恰是別處被封得最兇的。它的算盤是這樣:WordPress 的文件與外掛生態算一種公共財,AI 助理越能答得出相關問題,這份公共財就越值錢。有人問 Claude「WordPress 的永久連結怎麼設?」,只要 Claude 受過 wordpress.org/documentation/ 的訓練並答對了,WordPress 的使命就又被推進了一步。基金會顯然把「內容進到每一個模型的訓練資料庫」看成戰略上的淨賺,索性用檔案語法把態度攤開來講。

解剖 5 —— The Verge(theverge.com)——贊助內容混合模式

還有一種模式值得攤出來看。The Verge 的 AI 規則是 Disallow: / \ Allow: /sp/

User-agent: GPTBot
Allow: /

User-agent: Applebot
Allow: /

User-agent: Google-Extended
Disallow: /
Allow: /sp/

User-agent: anthropic-ai
Disallow: /
Allow: /sp/

User-agent: Bytespider
Disallow: /
Allow: /sp/

User-agent: CCBot
Disallow: /
Allow: /sp/

User-agent: ChatGPT-User
Disallow: /
Allow: /sp/

User-agent: ClaudeBot
Disallow: /
Allow: /sp/

關鍵在 /sp/ 這條路徑——它是 The Verge 放贊助/合作內容的地方。編輯內容被關在 AI 訓練門外,贊助內容卻放進來。帳算得很明白:贊助商付了錢要讓內容被看見,連透過 AI 被看見也算在內;而編輯旗艦內容,才是那道護城河。GPTBot 徹底放行(推測背後跟 OpenAI 有直接往來),Applebot 作為搜尋基準也徹底放行,剩下的一律走混合處理。「分層式 AI 存取」這種結構,我們就只在這裡見過一次。

這五份檔案,湊齊了當前 robots.txt AI 政策的整條光譜。前 10k 裡大多數檔案都不長這樣——它們不是沉默,就是套供應商範本。真正長成這副樣子的檔案,都是出自那些認定「這份檔案值得被認真讀」的人之手。

再補一句檔案規模:我們樣本裡 robots.txt 主體的中位數是 858 位元組——小到根本裝不下有意義的 AI 政策。真正扛規則的是右尾:1,005 個網站(15.3%)的檔案超過 5 KB273 個超過 20 KB,最大的一份是 248 KB。460 份檔案含著作權保留語句;275 份明確引用 EU 2019/790。 到 2026 年,robots.txt 越來越像一份有版本控管、被律師審過的文件,而不是一條設定列。


發現 11 —— 有 108 個網站,反過來 歡迎 GPTBot

有一小群但格外顯眼的網站,會寫下 User-agent: GPTBot \n Allow: /——正好和更常被討論的「Disallow GPTBot」相反。樣本裡共有 108 個網站在根路徑明確對 GPTBot 設 Allow。按 Tranco 排名列出前 25 名:

gptbot-welcoming-sites.webp

排名網域產業
42wordpress.org開發工具/CMS
133kaspersky.com資安
187avast.com資安
265hp.com硬體 OEM
624branch.io行動歸因 SaaS
692sophos.com資安
782theverge.com新聞
905rambler.ru俄羅斯入口網站
945kleinanzeigen.de德國市集
948theatlantic.com新聞
1,092lge.comLG Electronics
1,300justdial.com印度在地搜尋
1,332avira.com資安
1,412youm7.com埃及新聞
1,530goodreturns.in印度金融
1,621publi24.ro羅馬尼亞分類廣告
1,807geocomply.com合規 SaaS
1,908nba.com運動
1,956oneindia.com印度新聞
1,974mindbox.ru俄羅斯 SaaS
2,009thesun.co.uk新聞
2,126vox.com新聞
2,140mgid.com原生廣告
2,314ninjarmm.comIT 管理 SaaS
2,323norton.com資安

裡面有幾個看得出來的模式:

資安公司明顯偏多。 Kaspersky、Avast、Sophos、Avira、Norton、NinjaRMM 全都明確放行 GPTBot。這是刻意的分發策略:當使用者問 ChatGPT「哪一款防毒最適合我的 Windows 電腦?」時,模型的訓練資料庫裡有沒有你的品牌,會直接左右它的推薦。資安正是少數幾個 AI 搜尋已經開始取代 SEO、成為主要獲客管道的 B2C 品類,而這些品牌搶先動了手。我們預期其餘資安同業會在 12 個月內跟上。

幾個主要新聞品牌出現在這份名單、而不是封鎖名單上。 The VergeThe AtlanticVoxThe Sun、NBA.com。這並不矛盾——這些出版商似乎盤算過,能在 ChatGPT 搜尋裡被引用,比免於被訓練更值錢,所以特意寫下明確 Allow,免得將來被 CDN 或 CMS 過度封鎖。跟 NYT / Reuters / BBC / Forbes / Guardian 那種明確 Disallow 的立場擺一起,兩邊其實都說得通;新聞業從來就不是鐵板一塊。

The Sun 出現在這裡特別有意思,因為同一個網站在檔案別的地方,還用了 User-agent: * 全拒絕封鎖。最合理的解讀是:AI 訓練一律禁止,但 AI 搜尋放行,而且我們還特地把 GPTBot 白名單化,確保 ChatGPT 引用 The Sun 來回答問題。 這是所有 GPTBot-Allow 規則裡法律技巧最高的一種——它把 opt-out 和單一供應商 opt-in 同時包了進去。

WordPress.org 的出現,是這份名單裡份量最重的一項。 全球開源 CMS 生態,有相當一部分會導向 WordPress.org 找文件,或直接從那裡抓外掛。WordPress Foundation 在 wordpress.org/robots.txt 明確放行 GPTBot,等於公開宣告 WordPress 的文件生態可供訓練——這也會連帶影響 Claude、Gemini、ChatGPT 對「WordPress 怎麼……」這類問題的回答品質。

完整的 Allow-GPTBot 名單裡剩下的 83 個網站,則是區域新聞、較小的資安供應商、非英語市場的分類廣告平台,以及 B2B SaaS 的長尾。就我們所知,並沒有出現產業級別的「Allow-GPTBot」協調——這條規則是一個網站、一個網站地被採納的,全靠那些認定「進到資料源頭」是個戰略位置的經營者,各自決定。


發現 12 —— llms.txt 在這個尺度上,幾乎只是個傳聞

llms.txt 是一種為了讓 LLM 更容易發現友善內容而提出的替代檔案格式(自 2024 年底起,由 Mintlify、Anthropic、Vercel 和少數開發工具供應商推廣),但在我們的樣本裡,幾乎看不到什麼採用。

在 6,638 個回傳可解析 robots.txt 的網站裡,只有 83 個(1.15%)提到 llms.txt——而且通常只是以 Sitemap: https://example.com/llms.txt 的形式出現。這比在開發工具密集的商務樣本裡量到的同一指標低了兩個數量級;後者是被 Vercel 和 Mintlify 的預設值把採用率撐上去的。

llms-txt-robots-adoption-rate.webp

按產業攤開來看:

產業n提及 llms.txt 的比例
基礎設施474.3%
博彩1003.0%
SaaS3693.0%
電信333.0%
電商2241.8%
旅遊641.6%
開發工具1291.6%
新聞6500.8%
成人2540.4%
政府1720.0%
學術2680.0%
搜尋120.0%

llms.txt 主要集中在跟開發工具沾親帶故的 SaaS、博彩(這種受監管產業的法遵團隊,習慣一層層堆額外的中繼資料,所以吸收 robots.txt 新詞彙功能的速度也比較快),還有 B2B 電商。它在新聞和政府這兩塊明顯缺席——而這兩個區塊,恰恰是參與 AI 政策最積極、也最需要它們採用,才能讓這個標準從「供應商實驗」升格為「網路協定」的族群。在那之前,llms.txt 就是真實但規模極小;等到 2026 年底再做一次追蹤審計,會是個很好的重測點。

llms.txt 面對的結構性難題是:它沒走過任何 IETF 標準化程序,主要 AI 供應商也沒承諾要遵守。robots.txt 背後有 30 年的爬蟲基礎設施撐著;llms.txt 沒有。除非至少有一家主要供應商(OpenAI、Anthropic、Google、Cloudflare)正式宣佈支援,否則這個檔案本質上就是 Mintlify/Vercel 生態的行銷產物。我們不預期 2026 年會有變化。


發現 13 —— 可存取性:網路前段仍讀得到 robots.txt

有一個原本不打算當成發現的附帶觀察:前 10,000 名網站裡,有 66% 對單一研究 IP 回傳了可解析的 robots.txt,而且 10,000 個網站裡只有 7 個(0.07%)回了 429 Too Many Requests。對 robots.txt 作為一個公開協定來說,這是好消息。

拿來對比:兩個月前,我們對一個 1,008 網域的中型電商樣本跑同一套流程時,52% 的已解析網域回了 429——Shopify 和 Cloudflare CDN 對任何非主要搜尋引擎的 UA,都採取激進限流。可見高流量網路友善得多:前段網站比較可能具備 (a) 沒那麼激進的 bot 管理層,或 (b) 對已知研究爬蟲設了明確白名單,或者兩者兼有。

前 10k 裡 21% 的 fetch_failed,主要來自 CDN 根節點(akamai.netcloudfront.netfastly.netapple-dns.netgtld-servers.net),它們在 / 根本沒跑 webserver。它們不是在封我們,只是沒東西可給。把這些剔掉之後,真正「試了但讀不到」的比率,只落在低個位數。

這代表這份報告未來的版本——季度快照、年對年比較——都能在單機上以低成本、可重現的方式跑出來。曲線前端的審計窗口還開著。反觀長尾和電商區段就是另一回事,那裡的 CDN 層級限流,幾乎已經把 robots.txt 私有化了。我們預期這種分化只會加劇:前段網站因為要被搜尋引擎索引而必須保持可讀,所以會繼續可讀;長尾電商則會因為 Cloudflare 的 bot fight 等級被越開越高,而變得更難被讀到。robots.txt 的公開可審計性,正沿著「可見網路」和「受營運保護網路」之間的同一條線,開始分岔。


IV. 這一切到底代表什麼

四個主張,按資料支持力度由強到弱排。

1. 網際網路的 AI 政策是按產業劃分的,不是全球統一。 新聞與電信之間那道 12 倍的落差,主導了所有匯總數字。要是只報「X% 的網路封鎖 AI」而不按產業切,就會高估 SaaS/政府/開發工具,低估新聞/旅遊/社群。唯有按產業報告,才是誠實的框架。

2. EU 著作權指令第 4 條,是唯一一個明顯在推動數字變化的法律制度。 EU ccTLD 網站的封鎖率是 35%,全球基準卻只有 19%。美國的訴訟(NYT v. OpenAI、美國著作權局 2025 年 1 月報告)改變了美國新聞群體,但沒動到更廣的美國網路。而 EU 的框架還透過 Cloudflare 的範本向全球滲透——不管客戶在哪個司法管轄區,範本一律引用 2019/790 指令。

3. 有兩套並行的「AI 政策」正在被表達,而且彼此並不一致。 刻意、手寫的政策(17.8%,主力是新聞/社群/旅遊/電商)和繼承而來的 Cloudflare Managed 政策(4.5%),實質上重疊,合法性卻不同。在一個 AI 經營者到處找法律依據好無視 robots.txt 的世界裡,「我自己寫、也審過」這套抗辯,結構上就是比「我只是把它打開」更硬。訴訟帶來的誘因,正是把政策從第二類推向第一類。

4. 出版商封的是資料源頭,不是模型。 CCBot 以 16.3% 排第一,甚至高過任何一個模型品牌的 bot,這一點最說明問題。封 OpenAI,沒法讓出版商退出「已經被訓練過」;封 CCBot 才行。前 10k 網路裡有 14.1% 在封 CCBot 的同時,還放行 Googlebot。到 2026 年,「擋訓練、留搜尋」已經是最典型的一條 AI 規則。

對正在盤算自身立場的網站來說: 最普遍的姿態是沉默——前 10k 裡有 80% 對 AI 什麼都沒說。真正寫了規則的那 17%,幾乎清一色是 Disallow,但有一小群、而且還在擴大的網站(以資安供應商為主的那份 1.5% 明確 Allow GPTBot 名單)正公開往相反方向走。沒有產業共識,未來 12 個月也不會有。

對 AI 經營者來說: 當全世界 17% 的大型網站,已經手寫出明確、刻意、點名 bot 的規則,且 3.8% 的檔案直接引用 EU 法條條號時,再堅稱 robots.txt 只是個語意模糊的老協定,會越來越站不住腳。要不要遵守那些規則,是商業決策;那些規則存不存在,如今已是實證事實。


V. 展望:2026 年底前,我們預期會看到什麼

資料裡看得出三個趨勢。

Cloudflare Managed 的占比會翻倍以上,合理推估能到可解析前 10k 的 10% 以上。 Cloudflare 的路線圖公開談過要對新帳號預設開啟 Block AI Bots。這個開關真要預設開啟,全球封鎖率就會在沒有任何出版商拍板的情況下漲個 5 到 8 個百分點。等 rank 5001–10000 區間的 Cloudflare Managed 占比越過目前的 5.7%,我們就知道這件事正在發生。

區塊層級的 AI 政策(像 Spiegel 那種)會在主要新聞旗艦之間擴散。 那套經濟邏輯——讓 AI 引用低風險內容,護住護城河內容——已經夠有說服力,所以我們預期到 2026 年底,至少還會有 10 家旗艦新聞編輯部推出區塊層級規則。留意德國和法國的中型媒體;那裡的法制最鼓勵這種實驗。

明確 Allow GPTBot 的群體會成長,主力是 B2B SaaS 和開發工具。 當 AI 搜尋變成軟體供應商可以量化的獲客管道時(資安領域現在已經是了),邊際的 CMO 會動筆寫下 User-agent: GPTBot \n Allow: /,免得不小心被過度封鎖。我們預期那份 108 個網站的名單,年底前大概會翻一倍。

我們預期的是:沉默多數的占比會有什麼明顯變化。那 80% 對 AI 什麼都沒說的網路,涵蓋政府、電信、基礎設施、B2B SaaS 這些產業——它們既沒有寫規則的經濟理由,也沒有寫規則的法律壓力。全面性的 AI 政策,不會到來。


VI. 限制

  1. 這只是一張快照。 抓取集中在 2026 年 5 月初一段 36 小時的窗口。前 100 名網站的檔案幾乎天天在動,頭條數字每季預估會漂個 1–2 個百分點。
  2. 產業分類有缺口。 四層分類器跑完,仍有 6,593 個網站落在 unknown。樣本夠厚的產業,百分比很穩(新聞:650、串流:440、SaaS:369、學術:268、成人:254、電商:224、政府:172、金融:129、開發工具:129),可一旦 n < 30,噪音就上來了。國家新聞切分也一樣——DE/FR/UK 有 n ≥ 15,韓國/瑞典/捷克只落在 n=20–25。
  3. robots.txt 從來只是自願的。 Disallow 是一句請求,不是一道牆。BytespiderPerplexityBot 都有無視規則的前科。我們量到的是政策的宣告,不是政策的執行。
  4. 審計只有一個美國 IP。 21% 的已解析網域我們讀不進去。絕大多數是沒跑 webserver 的 CDN 根節點;少數則是 CDN 在我們摸到原站之前就把請求標記掉了。這會讓樣本稍微偏向較舊的基礎設施,也漏掉那些按來源國做地理封鎖的網站。
  5. Tranco 清單的語意。 Tranco 做的是穩定性篩選,並非嚴格意義上的使用者行為排名。匯總數字對清單怎麼選相對不敏感,但具體的名次位置就不是了。
  6. 沒有流量資料。 我們量的是 robots.txt 上寫的政策,不是 AI bot 實際跑了多少量。政策與流量,未必對得上。

VII. 重現本研究

用來產出這份報告的所有檔案,都放在交付資料夾裡。

  • tranco_top10k.csv —— 輸入清單
  • out/sites.csv —— 網域 × 排名 × 產業 × 語言 × robots.txt 狀態(10,000 列)
  • out/fetch_meta.csv —— 每個網域的抓取結果(狀態、scheme、位元組數、錯誤)
  • out/bot_status.csv —— 網域 × bot 矩陣(250,000 列:是否封鎖、是否有規則、抓取狀態)
  • out/site_meta.csv —— 每個網站一筆分析紀錄(範本、摘要布林值)
  • out/analysis.json —— 報告中引用的所有指標
  • 01_fetch_robots.py、02_classify.py、03_parse_and_analyze.py —— 完整 Python 流程

下載所有腳本與資料集


歡迎將方法論修正、資料集問題與後續分析寄至 support@thunderbit.com本報告獨立於 Thunderbit 所持有的任何商業立場;我們打造的是 AI 驅動的網頁爬蟲,而我們在結構上也有理由希望 robots.txt 在公開網路上持續成為一份有意義、機器可讀的契約。本報告中的資料本身即可成立。—— Thunderbit 研究團隊,2026 年 5 月。

試用 Thunderbit AI Web Scraper Get Started Free

Shuai Guan
Shuai Guan
Thunderbit 執行長|AI 資料自動化專家 Shuai Guan 是 Thunderbit 的執行長,畢業於密西根大學工程學院。憑藉近十年在科技與 SaaS 架構領域的經驗,他專注於把複雜的 AI 模型轉化為實用、免程式碼的資料擷取工具。在這個部落格中,他分享經過實戰驗證、毫無保留的網頁爬取與自動化策略見解,幫助你打造更聰明、以數據驅動的工作流程。當他不在優化資料流程時,也會把同樣的細膩與專注投入到攝影興趣中。
目錄
Thunderbit · AI 網路數據代理

Extract data from any page in 1 click

全球超過 25 萬用戶信賴
提供免費方案
使用 AI 提取數據
輕鬆將數據傳輸到 Google Sheets、Airtable 或 Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week