**简短回答:**GDPR 并不禁止网页抓取。但如果爬虫会收集、存储、整理或复用可识别个人的信息,这就属于个人数据处理。“内容是公开的”并不是合规理由。
这个界限在 2026 年 7 月变得尤其不容忽视。欧洲数据保护委员会(EDPB)表示,只要网页抓取涉及个人数据处理操作,GDPR 就适用,并特别强调了目的限制和透明度问题。其新的网页抓取指南目前仍在征求意见,但方向已经非常明确:技术上把页面抓下来,只是合规问题的起点。 EDPB 更新
本文提供的是可落地的运营框架,不构成法律意见。你可以用它来做更好的产品和工程决策,然后再让隐私法律顾问或 DPO 介入那些真正有风险的场景。
先分清“能抓”与“能用”
很多时候,三个问题会被混在一起:
| 问题 | 关注点 |
|---|---|
| 访问 | 你是否有权限访问该网站并采集内容? |
| 数据保护 | 如果能识别到个人,是否可以依据 GDPR 处理这些数据? |
| 再利用 | 你能否保留、丰富、出售、用于训练、公开,或者据此联系这些人? |
通过其中一个检查,并不代表另外两个也没问题。网页即使对所有人可见,里面的数据仍然可能属于个人数据。一次技术上“成功”的抓取,依然可能引发 GDPR、合同、知识产权、数据库权利、消费者保护或营销法方面的问题。

所以,合规应该在开始前就作为工作流来设计,而不是事后在隐私政策里补一段说明。
1. 先判断 GDPR 是否适用
先问两个问题。
数据集是否包含个人数据?
个人数据的范围远不止姓名或邮箱。它还包括与已识别或可识别个人有关的信息,例如头像、可关联到个人的用户名、地理位置、IP 地址、职业经历、评论,或者这些看似普通字段的组合。 EDPB 定义
有些公司级别的数据可能并不敏感。但如果“商务联系人”记录里包含个体工商户姓名、员工直邮、手机号或关联资料,它很快就会变成个人数据。你要按真实会出现的数据集来设计,而不是按理想化的数据集来设计。
你的组织和用途是否受 GDPR 约束?
如果处理活动与欧盟境内机构相关联,GDPR 可能适用。即便组织不在欧盟,只要其向欧盟个人提供商品或服务,或监测他们的行为,也可能受到 GDPR 约束。 欧盟委员会概览
如果这两个问题的答案都是“是”,那就默认这次抓取需要一条可证明的 GDPR 合规路径。如果答案不明确,不要把“不确定”当成绿灯——应该升级处理。
2. 在爬虫运行前,先写一页纸的采集说明
最简单、也最有价值的控制措施,就是在采集前先把需求说清楚。
这份说明至少要回答:
- 目的: 这份数据具体支撑什么决策、服务或分析?
- 人群与字段: 可能出现哪些类别的人?必须采集哪些具体字段?
- 来源与访问: 内容是否公开可访问?来源是否通过条款、robots 控制、登录墙或其他技术手段限制访问?
- 使用与接收方: 谁能看到结果?数据是否会被丰富、导出、共享、用于直销,或用于模型训练?
- 保留期限: 原始数据、工作文件和衍生记录何时删除或复核?
- 责任归属: 谁是控制者、谁是处理者、谁负责处理权利请求?
这不是为了制造文书负担。GDPR 原则本身就要求目的明确,且数据应当适当、相关,并仅限于必要范围。 欧盟委员会原则说明

3. 明确并记录合法依据,不要想当然
任何个人数据处理活动都需要合法依据。某些产品场景里,用户同意可能合适,但对公开网页数据来说,它并不是默认答案。对部分非政府组织而言,合法利益 可能是一个可行基础,但前提是抓取范围要很克制,并配套真实的保护措施。它并不是自动成立的。
一份站得住脚的合法利益评估,通常要回答三个问题:
- 这个利益是否合法、具体、真实且当前存在?
- 为实现该目的,这次采集是否必要?有没有更少侵入性的方式?
- 个人的利益、权利或合理预期,是否高于你的利益?
法国 CNIL 认为,对通过抓取获得的公开数据,通常应从合法利益角度进行分析,但同时要求采取额外措施,以降低对个人的影响。它也强调要逐案分析,而不是一刀切地放行。 CNIL 指引
请把分析过程、假设前提和所选缓解措施都记录下来。“资料是公开的”只能作为平衡测试的背景,不等于测试本身。
4. 把数据最小化做成技术要求
最合规的数据,往往就是根本没被抓进来的那部分。
建议把以下护栏直接写进采集任务:
- 字段白名单。 先定义你真正需要的字段,不要因为“顺手”就把所有可见字段都抓下来。
- 屏蔽敏感类别。 除非法律顾问已经设计好特定合法路径,否则应排除健康、政治、宗教、工会、性生活、生物特征及其他特殊类别信号。普通文本也可能意外暴露这些信息。
- 排除高风险来源。 默认把支持小组、健康论坛、儿童相关空间,以及其他可能带来意外或伤害的场景列入排除清单。
- 快速删除溢出数据。 如果抓到了无关个人数据,应隔离并删除,而不是“先留着以防万一”。
- 记录来源。 每个数据集都应保存来源 URL、采集日期和相关采集配置。这有助于准确性、删除和权利请求处理。
CNIL 明确建议提前决定相关类别,过滤不必要或敏感数据,删除无关数据,并尊重技术或法律层面的采集反对意见。 CNIL 保护措施
5. 把透明度当成产品的一部分
从网站采集的数据通常属于间接收集。这意味着第 14 条透明度义务可能适用:需要说明你是谁、处理目的、数据类别与来源、合法依据、保留期限、接收方、跨境传输,以及个人权利。
欧盟委员会的摘要指出,如果数据来自其他来源,通常应在一个月内、首次通信时,或首次披露时提供相关信息——以适用者为准。也存在例外,例如通知不可能实现,或会带来不成比例的成本,但这些都附带条件,应经过评估并留痕,而不是默认成立。 欧盟委员会义务说明
对于大规模采集,一个清晰的公开说明、数据集页面、专门联系渠道,以及便于找到的反对、访问、更正和删除指引,往往比一页隐藏的法律声明更有效。合适的呈现方式取决于处理内容和风险等级。
6. 在上线前就建立删除与权利请求流程
大规模抓取会让后期清理变得非常昂贵。你应该给数据设置唯一标识,保留受控的“来源—记录”映射,并确保能够在原始抓取结果、数据库、导出文件、索引以及下游处理系统中定位并移除或屏蔽某人的数据。
至少要提前决定:
- 谁接收并核验权利请求;
- 如何在不要求额外无关信息的前提下定位记录;
- 删除或反对如何传递到下游系统;
- 如何通过屏蔽机制避免再次误抓;
- 日志和备份保留该记录多久,以及例外处理流程是什么。
如果数据集还会用于模型、丰富关系图谱、画像分析或直销,那么这套方案要更严格。数据流转得越远,真正落实个人权利就越难。

7. 保护数据集,并尽早评估高风险场景
GDPR 要求采取与风险相匹配的措施,包括防止未经授权访问、丢失、破坏和非法处理。隐私内建与默认保护意味着这些控制要在一开始就选好,而不是出了事故之后再补。 欧盟委员会义务说明
常见的基础控制包括基于角色的访问权限、传输中和静态加密、密钥管理、审计日志、供应商审查、数据导出控制,以及经过测试的事件响应流程。假名化可以降低风险,但它不等于匿名化,通常也不会单独消除 GDPR 义务。
如果处理活动很可能带来高风险,就应在处理前考虑做 DPIA,尤其是当你同时涉及以下情况时:
- 大规模采集或监测;
- 画像分析或会影响个人的决策;
- 特殊类别或高度私密数据;
- 儿童或其他脆弱群体;
- 组合多个数据集以推导新结论;
- 持续性识别、位置数据,或类似数据经纪商的再利用;
- AI 训练,或可能记忆、暴露个人数据的模型。
欧盟委员会将系统性、广泛的自动化评估、大规模敏感数据处理,以及大规模系统性监测列为需要 DPIA 的情形。 DPIA 指引
网页抓取团队的上线清单
在生产任务运行前,请确认以下事项都已完成:
- 我们已经确认这次采集是否包含个人数据,以及 GDPR 为什么适用或不适用。
- 我们有明确的书面目的和所需字段白名单。
- 我们已经记录合法依据,如有需要,也完成了合法利益评估。
- 我们默认排除了敏感和高风险来源或类别。
- 我们已评估来源限制,不会绕过访问控制。
- 我们有清晰的公开说明,并提供可执行的权利请求和反对渠道。
- 我们清楚控制者/处理者角色,并已签好合适的供应商条款。
- 我们已有保留、删除、屏蔽及向下游传播的流程。
- 我们已有相称的安全控制和事件责任归属。
- 我们已经完成 DPIA 和跨境传输评估;如果认为不需要,也已明确记录原因。
实操结论
网页爬虫的 GDPR 合规,不是去 robots 文件里找一句“万能免死金牌”,也不是往产品里贴一个免责声明那么简单。它的核心是:让采集与明确说明的目的相匹配,让个人能真正看见并掌控自己的数据,并且在以后还能证明你当时为什么这么做。
从小范围开始。少抓一点。保留来源和时间戳。把删除机制写进数据模型。凡是涉及敏感数据、大规模处理、画像分析和 AI 训练的用途,都要在数据流向下游之前先升级审查。这些习惯会让爬虫更可信,也会让它在第一次遇到隐私问题时更容易运营。
本文仅提供一般信息,不构成法律意见。请针对你所在组织的具体事实、适用司法辖区、数据类型和预期用途寻求专业建议。
了解更多


