**簡短答案:**GDPR 並不禁止網頁爬蟲。但當爬蟲蒐集、儲存、整理或再利用可識別個人身分的資訊時,就屬於個人資料處理。別再把「內容是公開的」當成合規理由。
這個界線在 2026 年 7 月尤其不容忽視。歐洲資料保護委員會(EDPB)指出,只要網頁爬蟲涉及個人資料處理作業,GDPR 就可能適用,並強調目的限制與透明度是關鍵問題。其新的網頁爬蟲指引目前仍在諮詢中,但方向已相當明確:技術上抓取頁面,只是合規問題的起點。 EDPB 更新
本指南提供的是實務操作框架,而非法律意見。你可以先用它來做更好的產品與工程決策,再針對高風險情境諮詢隱私法務或 DPO。
先分清楚「能不能抓」和「能不能用」
實務上,三個不同的問題常常會被混在一起:
| 問題 | 你要確認什麼 |
|---|---|
| 存取權限 | 你是否被授權進入網站並蒐集內容? |
| 資料保護 | 若資料可識別個人,是否能依 GDPR 處理? |
| 再利用 | 你能否保留、補充、出售、訓練模型、公開,或用來聯絡當事人? |
通過其中一項,不代表另外兩項也成立。某個頁面即使是公開可見,裡面的資料仍然可能是個人資料。技術上成功抓取,也不代表沒有 GDPR、合約、智慧財產、資料庫權利、消費者保護或行銷法規的風險。

所以,合規應該在開始執行前就當成一個工作流程,而不是事後再補上一段隱私政策文字。
1. 先判斷 GDPR 是否適用
先問兩個問題。
你的資料集是否包含個人資料?
個人資料的範圍比姓名或電子郵件更廣。它包含任何與已識別或可識別個人有關的資訊,例如頭像、能對應到個人的使用者名稱、位置、IP 位址、職業經歷、評論,或是原本看似普通欄位的組合。 EDPB 定義
公司層級資料在某些情境下可能沒有問題;但一筆「商務聯絡人」紀錄,若包含獨資經營者姓名、員工直撥信箱、手機號碼,或可連結到個人檔案,就可能很快變成個人資料。設計時要以真實會拿到的資料集為準,不要只看理想中的資料模型。
你的組織與使用目的是否落在 GDPR 範圍內?
若處理活動與歐盟境內的設立機構相關,GDPR 可能適用。即使組織不在歐盟內,只要你向歐盟境內人士提供商品或服務,或監控其行為,也可能受 GDPR 規範。 歐盟委員會概覽
如果這兩題都回答「是」,就應假設這次爬取需要有完整、可追溯的 GDPR 合規路徑;若答案不明確,不要把不確定性當成通行證,應立即升級處理。
2. 在爬蟲執行前,先寫一頁資料蒐集說明
最簡單、也最有價值的控制措施,就是在蒐集前先把需求說清楚。
你的說明文件應回答以下問題:
- 目的: 這些資料要支援哪個具體決策、服務或分析?
- 對象與欄位: 可能出現哪些類別的人?實際需要哪些欄位?
- 來源與存取: 內容是否公開可得?來源是否透過條款、robots 限制、登入牆或其他技術控制明確反對?
- 用途與接收者: 誰會看到結果?資料會被補充、匯出、分享、用於直接行銷,還是拿去訓練模型?
- 保存期限: 原始資料、工作檔與衍生紀錄何時刪除或審查?
- 權責: 誰是控制者、誰是處理者、誰負責權利請求?
這不是為了增加官僚流程。GDPR 原則本來就要求目的明確,且資料必須適當、相關,並限於必要範圍。 歐盟委員會原則

3. 選定並記錄合法依據,不要想當然
每一項個人資料處理活動都需要合法依據。某些產品可能適合用同意,但對公開網頁資料而言,同意並不是預設答案。對某些非公部門組織而言,合法利益可能是有限範圍爬取的一種可行依據,但前提是有真正的保護措施,且不是自動就成立。
一份站得住腳的合法利益評估,應回答三個問題:
- 這個利益是否合法、具體、真實且正在發生?
- 這次蒐集是否對該目的而言必要?有沒有更少侵入性的方式?
- 當事人的利益、權利或合理期待,是否高於你的利益?
CNIL 指出,對於公開可取得、並透過爬蟲蒐集的資料,通常會從合法利益的角度來檢視,但同時要求額外措施來降低對個人的影響;而且必須逐案分析,不能一概授權。 CNIL 指引
請把分析內容、假設前提與你採取的緩解措施都記錄下來。 「個人檔案是公開的」只是平衡測試的背景,不是測試本身。
4. 把最小化要求做成技術規格
最合規的紀錄,往往就是你的爬蟲從一開始就沒有抓下來的那筆資料。
請把以下防護措施直接納入蒐集工作:
- 欄位白名單。 先定義你需要哪些欄位,不要因為「抓得到」就把所有可見欄位都抓下來。
- 排除敏感類別。 除非法務已設計出特定合法路徑,否則應排除健康、政治、宗教、工會、性生活、生物特徵及其他特別類別訊號。一般文字也可能意外揭露這些資訊。
- 排除高風險來源。 對支援社群、健康論壇、兒少空間,以及任何再利用可能出乎意料或造成傷害的情境,預設加入排除清單。
- 盡快刪除溢出資料。 若抓到與目的無關的個人資料,應隔離並刪除,不要以「以防萬一」為由默默保留。
- 保留資料來源證據。 每個資料集都應保存來源 URL、蒐集日期與相關蒐集設定,以支援正確性、刪除與權利處理。
CNIL 明確建議:應事先決定相關資料類別、過濾不必要或敏感資料、刪除無關資料,並尊重對蒐集的技術或法律反對。 CNIL 防護措施
5. 把透明度當成產品的一部分
從網站蒐集到的資料,通常屬於間接蒐集。這代表第 14 條的透明義務可能適用:你需要說明你是誰、目的為何、資料類別與來源、合法依據、保存期限、接收者、跨境移轉,以及當事人的權利。
歐盟委員會摘要指出,若資料來自其他來源,原則上應在一個月內、首次聯絡時,或首次揭露時提供資訊,以較先發生者為準。雖然也有例外,例如通知不可能或會涉及不相稱的重大成本,但這些都屬條件式例外,應評估並留下紀錄,而不是直接假設可適用。 歐盟委員會義務說明
對於大規模蒐集,一個清楚的公開通知、專屬資料集頁面、獨立聯絡管道,以及容易找到的反對、存取、更正與刪除指引,往往比藏在角落的法律頁更有實際效果。要採用哪種形式,仍取決於處理方式與風險程度。
6. 在上線前先建立刪除與權利處理流程
大規模爬取會讓後續清理成本非常高。請替資料建立識別碼,保留受控的來源到紀錄對應表,並確保你能在原始擷取、資料庫、匯出、索引,以及下游處理系統中,找到並移除或抑制某個人的資料。
至少要先決定:
- 誰接收並驗證權利請求;
- 不需要求額外資訊的前提下,如何定位紀錄;
- 刪除或反對如何傳遞到下游系統;
- 如何避免資料被再次收集;
- 日誌與備份會保存多久,以及例外處理流程是什麼。
如果資料集會進入模型、補強知識圖譜、個人特徵分析或直接行銷,這份計畫就要更嚴謹。資料流轉得越遠,要真正落實權利就越困難。

7. 及早為資料集加上安全保護,並評估高風險情境
GDPR 要求採取與風險相稱的措施,包括防止未授權存取、遺失、毀損與非法處理。隱私保護設計與預設保護,意味著你要在一開始就選好控制措施,而不是等到發生外洩後才補救。 歐盟委員會義務說明
實用的基本控制包括:以角色為基礎的存取權限、傳輸中與靜態加密、機密金鑰管理、稽核日誌、供應商審查、資料匯出控管,以及已測試過的事件應變流程。假名化可以降低風險,但它不等於匿名化,而且通常不能單獨解除 GDPR 義務。
若處理活動可能帶來高風險,應先考慮是否需要 DPIA,尤其是當你結合下列因素時:
- 大規模蒐集或監控;
- 個人特徵分析或會影響當事人的決策;
- 特別類別或高度敏感資料;
- 兒童或其他脆弱族群;
- 合併多個資料集以推導新結論;
- 持續性識別、位置資料,或類似資料經紀商式的再利用;
- AI 訓練,或可能記住、暴露個人資料的模型。
歐盟委員會將系統性、廣泛的自動化評估、大規模敏感資料處理,以及大規模系統性監控,列為需要 DPIA 的情境。 DPIA 指引
網頁爬蟲團隊的上線檢查清單
在執行正式任務前,請確認以下事項都已完成:
- 我們知道這次蒐集是否包含個人資料,以及 GDPR 為何適用或不適用。
- 我們有精確的書面目的,以及必需欄位的白名單。
- 我們已記錄合法依據,若適用也已完成合法利益評估。
- 我們預設排除了敏感與高風險來源或類別。
- 我們已評估來源限制,且沒有繞過存取控制。
- 我們有公開、透明的說明,以及可運作的權利請求與反對管道。
- 我們知道控制者/處理者的角色,且有適當的供應商條款。
- 我們已建立保存、刪除、抑制與下游傳遞程序。
- 我們有相稱的安全控制與事件責任歸屬。
- 我們已完成 DPIA 與跨境移轉評估;若未完成,也有清楚記錄為何不需要。
實務重點
網頁爬蟲的 GDPR 合規,不是去 robots 檔裡找一條神奇的界線,也不是在產品裡貼上一段免責聲明而已。真正的重點是:讓蒐集規模與明確目的相稱、讓當事人能實際看見並控制資料、以及日後能證明你當初為何這樣做。
從小範圍開始。少抓一點。保留來源與時間戳。把刪除機制寫進資料模型。對敏感、大規模、個人特徵分析與 AI 訓練用途,應在資料流向下游前先升級審查。這些習慣能讓爬蟲更可信,也讓你在第一次遇到隱私問題時更好處理。
本文僅提供一般資訊,不構成法律意見。請針對你組織的具體事實、司法管轄區、資料類別與預定用途,尋求合格專業建議。
深入了解


