抓取 LinkedIn 违法吗?相关法律、风险以及最新变化

最后更新于 July 14, 2026
LinkedIn scraping legality decision matrix cover
AI 摘要
抓取 LinkedIn 并不是一个简单的“合法或不合法”问题。对于无需登录的公开资料,在 hiQ 之后,美国的 CFAA 风险可能较低,但这仍然与 LinkedIn 的条款相冲突,并可能带来合同、隐私和执法风险。登录后抓取、使用假账号、访问 Sales Navigator、转售数据,以及大规模处理个人数据,在 GDPR 和州级隐私法下风险都高得多。本指南解释了相关法律、LinkedIn 的执法立场、不同场景下的风险等级,以及更低风险的替代方案,例如官方 API、公开公司网站、商业目录和授权数据供应商。同时也提醒团队在采集数据前,应先咨询法律顾问。

LinkedIn 的会员数量已经超过 13 亿,可以说是全球最丰富的职业数据库。也难怪销售团队、招聘人员和增长黑客都想用程序化方式从里面拿数据。但“抓取 LinkedIn 违法吗?”一直是 B2B 数据圈里最让人头大、也最常被搜的问题之一。

大多数指南给的答案还是那句老话:“要看情况。”我花了很多时间去研究法院文件、LinkedIn 自己的政策、GDPR 执法案例,以及创始人在论坛里分享自己被起诉的经历。到了 2026 年,整体情况其实已经和网上很多文章写的明显不一样了。下面我会按不同场景做一个细拆——包括一张你可以直接收藏的合法性矩阵——同时也会讲更稳妥的做法,帮你拿到需要的业务数据,又不把公司或你的 LinkedIn 账号置于风险之中。

**免责声明:**本文只提供法律信息,不构成法律建议。如果你打算做商业规模的数据采集,请咨询熟悉你所在司法辖区的律师。

什么是 LinkedIn 抓取?为什么这么多团队都在做?

LinkedIn 抓取,指的是使用自动化工具、脚本或浏览器插件,从 LinkedIn 页面提取数据——比如个人资料姓名、职位、公司信息、邮箱、技能、招聘信息,或者人脉关系图。

从技术上说,这就是通过程序化方式,从 LinkedIn 的 HTML 页面或 API 响应里提取结构化数据,不管这些数据是在公开个人主页上,还是藏在登录墙后面。

你可以把它想成:雇了一个动作特别快的实习生,去翻上千个 LinkedIn 资料页,把信息复制到表格里——只不过这个“实习生”其实是软件,而且几分钟就能干完原本要花好几周的活。

LinkedIn 抓取不等于正常使用 LinkedIn。浏览资料、发送好友邀请,或者用 LinkedIn 自带工具导出自己的联系人,都属于平台设计好的正常用途。抓取则涉及 LinkedIn 没有授权的规模化或高速自动化操作。

为什么团队会这么做

常见用途包括:

  • **销售与线索开发:**收集带有姓名、职位、邮箱和公司信息的潜在客户名单。LinkedIn 往往是 B2B 团队最先看的地方,因为数据结构清楚、可搜索,而且都是专业人士自己填写的。
  • **招聘:**通过抓取符合特定技能、地点或经验水平的个人资料来找候选人。
  • **市场研究:**基于汇总后的 LinkedIn 数据分析招聘趋势、公司增长或竞争定位。
  • **竞品分析:**追踪竞争对手的员工规模变化、新入职人员或组织架构。

这种诱惑确实很大。LinkedIn 是职业人士用结构化、可搜索的方式自报职业信息的地方,几乎没有其他公开来源能和它相比。

LinkedIn scraping scenario risk matrix

直接回答:抓取 LinkedIn 违法吗?

简短答案是:这取决于你抓什么、怎么抓,以及你和被抓取对象分别在哪个地方。

  • 在美国,按照 hiQ v. LinkedIn 这个先例,抓取真正公开、无需登录的 LinkedIn 数据,CFAA 风险较低——但这仍然违反 LinkedIn 的服务条款。
  • 如果你是在登录状态下抓取、使用假账号,或者抓取 Sales Navigator 这类付费产品的数据,风险就会明显升高。
  • 在欧盟,不能拿“这是公开数据”当作法律抗辩。无论如何都要满足 GDPR 下的合法依据。
  • LinkedIn 会从多个层面主动识别和打击爬虫,包括账号限制、民事诉讼以及禁令。

我真希望自己一开始研究这个话题时就有下面这张表。

场景合法性矩阵

场景数据类型美国法律状态欧盟法律状态风险等级
抓取公开个人资料(无需登录)公开CFAA 风险较低(依据 hiQ 先例);仍违反 ToS需要 GDPR 下的合法依据⚠️ 中等
登录后抓取私有/受限违反 ToS + 可能触发 CFAA 风险很可能违反 GDPR🔴 高
抓取 Sales Navigator 数据私有/付费ToS + 合同违约违反 GDPR + 合同违约🔴 极高
抓取职位信息(公开)公开CFAA 风险较低需要合法依据⚠️ 低到中等
用于商业转售的抓取公开/私有诉讼风险很高(Mantheos 先例)GDPR + ePrivacy 风险🔴 极高
用于个人/学术项目的抓取公开风险较低需要合法依据;执法优先级较低✅ 低
使用 LinkedIn 官方 API受授权合法(在 API 条款范围内)合法(在 API 条款范围内)✅ 低

这些场景之间的风险差异主要由三点决定:(1) 你有没有绕过登录或访问控制,(2) 数据本身到底是不是公开的,还是被账号权限保护着,(3) 你后面怎么用这些数据(个人研究还是商业转售)。这三个因素都会单独把法律风险抬高。

适用于 LinkedIn 抓取的关键法律

几乎所有和 LinkedIn 抓取相关的争议里,都会提到三套法律框架。

《计算机欺诈和滥用法案》(CFAA)

CFAA 是美国和抓取最相关的主要联邦法律。它最早在 1986 年出台,针对的是计算机黑客行为,禁止在“未经授权”的情况下访问计算机,或者“超出授权访问”。

抓取问题的核心在于:如果网站条款明明写着不能这么做,那么访问一个可公开浏览的网页,算不算“未经授权访问”?

在 2021 年最高法院作出 Van Buren 判决后,答案更偏向于“不算”——至少对真正公开的数据是这样。Van Buren 收窄了 CFAA 的适用范围:就算你滥用了自己本来有权访问的信息,也不一定就构成联邦计算机犯罪。但如果你是在认证门槛后面抓取,比如登录、使用假账号、绕过付费墙,那还是存在实打实的 CFAA 风险,因为你访问系统的方式并没有得到运营方授权。

GDPR 与欧洲数据保护法

欧盟《通用数据保护条例》(GDPR)管的是如何收集、处理和存储欧盟/欧洲经济区居民的个人数据——**不管抓取方在哪里。**如果你人在德州,却在抓取柏林用户的个人资料,GDPR 还是会适用。

LinkedIn 抓取里最重要的几条 GDPR 条款包括:

  • 第 6(1)(f) 条——合法权益:B2B 抓取里最常被拿来引用的合法依据,但你必须做书面平衡测试,证明你的利益没有压过数据主体的隐私权。
  • 第 17 条——删除权:个人可以要求你删除其被抓取的数据。
  • 第 9 条——特殊类别数据:如果抓取过程中不小心碰到种族/民族来源、政治观点、健康状况等信息(LinkedIn 资料里有时会出现),就会适用更严格的规则。
  • 第 14 条——向数据主体提供信息:就算数据是公开的,你也可能需要通知对方你已经收集了其数据。

结论很简单:**“公开可见”并不等于 GDPR 下就合法。**在开始抓取之前,你必须先识别并记录法律基础。

LinkedIn 的服务条款

LinkedIn 的 用户协议 写得很明确。第 8.2 条禁止:

  • 开发、支持或使用软件、脚本、机器人、爬虫、浏览器插件、扩展程序或其他流程,对 LinkedIn 服务进行抓取或复制,包括个人资料和其他数据
  • 绕过或规避安全功能、访问控制或使用限制
  • 使用机器人或未经授权的自动化方式访问服务、添加/下载联系人或发送消息
  • 未经同意复制、使用、展示或分发从 LinkedIn 获取的信息
  • 出租、转让、出售或以其他方式将 LinkedIn 服务或相关数据变现

LinkedIn 关于自动化活动的 帮助页面 和关于 禁止软件 的说明也再次强调:第三方浏览器扩展只要涉及抓取或自动化操作,就属于明确禁止;违规可能导致账号限制或法律行动。

违反 ToS 本质上是合同违约,不一定构成刑事犯罪。但这给了 LinkedIn 很强的民事追责依据,而且正如你接下来会看到的,他们确实会积极出手。

hiQ v. LinkedIn 时间线:到底发生了什么变化

很多文章在这里都写错了。它们把 hiQ v. LinkedIn 说成“抓取 LinkedIn 是合法的”铁证。现实要复杂得多——这个案件最终并没有形成一个绝对明确的先例。

从 2017 年禁令到 2022 年和解

真实时间线如下:

  • **2017 年:**LinkedIn 向 hiQ Labs(一家分析公开 LinkedIn 资料、预测员工流失的公司)发出停止侵权通知。hiQ 提起诉讼。加州北区地方法院发布初步禁令,允许 hiQ 继续抓取公开个人资料。
  • **2019 年:**第九巡回上诉法院维持该禁令,认为抓取公开可得数据很可能不违反 CFAA。
  • **2021 年:**最高法院撤销第九巡回的裁决,并要求其结合 Van Buren v. United States 重新审理,因为后者收窄了 CFAA 的适用范围。
  • 2022 年 4 月:第九巡回再次支持自己的立场,认为 Van Buren 其实强化了它先前的推理——抓取公开数据并不构成 CFAA 里说的“未经授权访问”。
  • **2022 年 11 月:**在地方法院层面,LinkedIn 的违约主张仍然有效。法院指出,LinkedIn 的用户协议 明确禁止抓取。法院还支持了 LinkedIn 关于 hiQ 使用“turkers”创建假账号进行登录后测试的简易判决请求。
  • **2022 年 12 月:**双方达成 私下和解。法律评论称,和解内容包括:对 hiQ 抓取 LinkedIn 的永久禁令、50 万美元判决,以及 hiQ 承认 LinkedIn 因假账号访问而产生的损失足以支持 CFAA 民事索赔。

结论是:hiQ 的确降低了在第九巡回辖区内,对真正公开、无需登录的数据进行抓取时的 CFAA 风险。但它并没有给任何人一项可以随意抓取 LinkedIn 的通用权利。合同索赔仍然成立,假账号访问也受到了处罚。由于最终是和解收场,所以核心问题并没有一个对所有法院都具有约束力的最高法院判例。

论坛里的人常常把这件事说反了——有人说“LinkedIn 赢了”,也有人说“hiQ 赢了”。其实都没有得到一个终局性的司法结论,这个问题仍然有一部分处在开放状态。

LinkedIn v. Mantheos 案

Mantheos 是一个反面案例,清楚展示了什么才叫明显违法的抓取。该公司使用假账号和假信用卡访问 LinkedIn 的付费产品 Sales Navigator,然后把抓到的数据商业化转售。

结果是:LinkedIn 表示 Mantheos 同意 永久删除抓取到的会员资料数据、销毁抓取软件,并停止通过抓取或其他自动化方式访问 LinkedIn 会员资料数据。这个案件涉及假身份、以假名注册的虚拟借记卡、付费的 Sales Navigator 访问,以及商业再分发——这种组合绝不该拿来和浏览公开页面相提并论。

2024–2026 年的新变化

自 hiQ 和解后,法律环境并没有停在原地。下面几个变化很关键:

AI 训练维度。 基于抓取网页数据训练的大语言模型火起来后,隐私审查明显变严。对于 LinkedIn 资料数据,现实中的原则和处理任何个人数据一样:处理前先记录合法依据,尽量少收集;如果涉及大规模画像或自动化决策,要预期更严格审查。

LinkedIn 自身的回应。 LinkedIn 已公开表示,就算抓到的数据是公开可见、并不算“入侵”,它也仍然把数据聚合和转售看作滥用。LinkedIn 还表示会通过 法律行动 和技术手段打击未经授权的抓取。

美国州级隐私法。 除了 CFAA,像加州(CCPA/CPRA)、弗吉尼亚、科罗拉多、康涅狄格等州都已经通过了综合性隐私法。CCPA 赋予加州居民知情、删除,以及拒绝出售/共享其个人信息的权利——这也可能包括从 LinkedIn 资料中抓取的数据。

全球趋势很明确:监管越来越多,执法越来越严,风险越来越高。

美国、欧盟与其他地区:你所在的地方抓取 LinkedIn 违法吗?

很多 LinkedIn 抓取指南最大的漏洞之一,就是默认只有美国法律重要。其实不是这样。数据主体住在哪里,决定了适用哪套隐私制度,而不是你的服务器放在哪里。

司法辖区关键法律抓取公开数据个人可识别信息(PII)处理执法风险
🇺🇸 美国CFAA、CCPA/CPRA、各州隐私法对公开数据的 CFAA 风险较低(hiQ);但 ToS 仍然适用商业使用 PII 存在诉讼风险中等——LinkedIn 会主动起诉
🇪🇺 欧盟 / 欧洲经济区GDPR(第 6 条、第 9 条、第 17 条)需要合法依据(合法权益平衡测试)适用删除权;敏感数据更建议明确同意高——数据保护机构会主动调查抓取
🇬🇧 英国UK GDPR + 2018 年数据保护法与欧盟类似;适用 ICO 指引适用同类 GDPR 义务中到高
🇦🇺 澳大利亚1988 年隐私法、APPs对公开数据限制相对较少商业化处理个人信息受监管低到中等
🇧🇷 巴西LGPD需要合法依据与 GDPR 框架类似中等

美国:CFAA 和州级隐私法

hiQVan Buren 之后,美国的立场是:抓取真正公开、无需登录的 LinkedIn 数据,在第九巡回辖区内大概率不违反 CFAA。但“可能不违反某一部联邦法”离“完全合法且安全”还差得远。LinkedIn 的 ToS 还是照样适用。如果你在商业上处理加州居民数据,CCPA/CPRA 这类州级隐私法还会带来额外义务。而且 LinkedIn 总部就在加州,也已经证明自己会积极打官司。

欧盟和欧洲经济区:GDPR 的严格要求

GDPR 是爬虫最难应对的地方之一。B2B 抓取里最常引用的合法依据是第 6(1)(f) 条下的合法权益,但这要求你做一份书面的合法权益评估(LIA),证明你的利益没有压过数据主体的权利。ICO 的指引 明确指出:合法依据必须在处理开始前确定并记录,处理必须是必要的(而不只是方便的),并且要考虑数据主体的合理预期、影响程度,以及在请求时停止处理的能力。

再加上删除权(第 17 条)、必要时的第 14 条通知义务,以及数据保护机构对 AI 训练抓取越来越关注,面向欧盟用户的 LinkedIn 抓取合规负担相当重。

英国、澳大利亚、巴西及其他地区

英国通过 UK GDPR 和 2018 年数据保护法沿用了类似 GDPR 的框架。澳大利亚的《1988 年隐私法》对公开数据限制相对较少,但仍会监管个人信息的商业处理。巴西的 LGPD 在很多方面也和 GDPR 很像。

全球的大方向都在往更严格的数据保护走。如果你在抓取来自多个国家的 LinkedIn 资料,你可能同时受这些制度约束。

LinkedIn 现实中会怎么阻止抓取

法律理论是一回事,LinkedIn 现实里怎么做又是另一回事。

技术防御手段

LinkedIn 的检测体系是多层级的:

  • **频率限制和搜索上限:**免费账号每天可查看的资料页大约只有 50–80 个。超过这个量,就会被拦住。
  • **验证码挑战:**自动化浏览模式会触发 CAPTCHA,直接打断抓取流程。
  • **机器人检测算法:**LinkedIn 会监控鼠标移动、滚动模式、请求时序和浏览器指纹,以识别非人工行为。
  • **登录墙:**LinkedIn 很多数据只有登录后才能看到,这意味着抓取它就必须登录(并接受 ToS)。
  • **IP 封锁和会话监控:**同一 IP 的重复请求或异常会话模式都会触发封禁。

法律执行动作

LinkedIn 不只靠技术手段。他们的法务团队已经向包括 Proxycurl、Apollo 和 Seamless.AI 在内的公司发过停止侵权通知。Proxycurl 创始人也公开讲过自己的经历,并指出 LinkedIn 在法律战上有“无限预算”——这对任何想靠 LinkedIn 抓取数据创业的人来说都足够敲警钟。

LinkedIn 还提起过民事诉讼(hiQ、Mantheos 等)、推动相关工具从它的生态里下架,并公开表示会继续通过 法律行动 打击爬虫。

被抓到之后会发生什么:后果阶梯

后果是逐级升级的。把这个阶梯搞清楚,才能更现实地评估风险。

第 1 级:轻度拦截

验证码、频率限制、临时搜索受限。这些都是自动化响应——LinkedIn 还没开始人工审查你的账号。恢复方式比较简单:停止自动化行为,等一段时间后再恢复手动使用。

第 2 级:账号限制

限制查看资料页,限制搜索功能。LinkedIn 可能会把账号标记成待审查状态。你可能会看到警告信息。只要停止抓取并禁用出问题的工具,通常还有恢复机会。

第 3 级:账号暂停或永久封禁

一旦永久失去账号,你就会失去所有联系人、发布内容、推荐记录和消息历史——全都没了。我见过招聘论坛里有人说,因为一个浏览器扩展,自己一夜之间损失了 5000 多个联系人,多年的职业人脉就这么没了。

LinkedIn 很少撤销永久封禁。而且如果你被封后又去开新号,这本身也可能违反 ToS。

第 4 级:停止侵权通知

LinkedIn 法务会发正式通知,要求你停止抓取并销毁已经收集的数据。无论大公司还是独立创始人,都收到过这种信。忽视 C&D 通知,通常会进一步升级到诉讼。

第 5 级:民事诉讼

LinkedIn 会提出违约索赔、CFAA 索赔(如果涉及绕过登录或假账号),以及可能的不正当竞争或侵入理论。Mantheos 案的结果包括下架、销毁数据和和解成本。就算你最后赢了,单是律师费也可能轻松到六位数。

第 6 级:监管罚款

如果业务面向欧盟,GDPR 罚款最高可达全球年营业额的 4% 或 2000 万欧元,以较高者为准。只要有一位数据主体投诉自己的资料被抓取,数据保护机构就可能启动调查。而且现在数据保护机构对 AI 训练中的抓取越来越关注,这个风险是在上升,不是在下降。

有一点要直说:**规避检测不是合规策略。**用代理、验证码代解服务,或者绕过限速的技巧,并不会改变法律分析——它只是拖延了技术后果,同时还可能让法律后果更严重,因为这会表明你是有意规避控制措施。

如果你仍然想获取 LinkedIn 数据,可以怎么做

如果你的使用场景确实需要 LinkedIn 数据,而且你决定继续推进,下面这些原则可以降低风险,但不能把风险彻底消掉。

只碰公开数据

只访问无需登录就能看到的数据。不要用假账号、共享凭据,也不要绕过付费墙。一旦你登录,就等于接受了 LinkedIn 的 ToS,并受它完整的执法体系约束。

尊重频率限制和 robots.txt

不要把 LinkedIn 服务器压得过载。把请求频率控制得更低、更接近人工操作。检查 LinkedIn 的 robots.txt 指令并遵守。法院会把你是否遵守 robots.txt 视为判断善意的重要证据。

了解你的 GDPR 义务

如果你处理的是欧盟居民数据:

  • 在开始采集前就记录你的合法依据
  • 如果依赖第 6(1)(f) 条,先做合法权益评估
  • 只收集实现目的所必需的最少字段
  • 及时回应删除权和反对权请求
  • 在需要时提供第 14 条通知
  • 保留处理活动记录

尽可能使用 LinkedIn 官方 API

LinkedIn 的 Marketing API 和 People API 可以为特定数据提供授权访问。使用 API 可以避免违反 ToS 的风险。代价是:访问限制更多、需要审批、调用频率受限,而且可拿到的字段比网页上看到的内容少。对于很多线索开发场景,API 根本给不了团队真正想要的数据,但如果你的需求能覆盖,还是值得先确认一下。

获取你真正需要的业务数据,更安全的替代方案

大多数 LinkedIn 抓取指南都会漏掉这一点:**很多团队其实并不一定需要 LinkedIn 数据本身。**他们需要的是业务联系人信息、公司资料或潜在客户名单。LinkedIn 只是其中一个来源,但它偏偏是法律风险最高的来源。其实还有很多别的来源,能给出类似甚至更好的数据,而且风险低得多。

替代方案你能获得什么法律风险局限
LinkedIn API(Marketing/Sales)授权数据、字段有限✅ 低(合规使用时)审批严格、限速、费用高
公司官网抓取联系信息、团队页面、产品数据✅ 低(公开网站)数据分散在各站点
商业目录 / 公开名录电话、邮箱、地址✅ 低数据新鲜度不一
数据增强 API(Clearbit、ZoomInfo 等)公司画像 + 联系数据✅ 低(责任主要转移给服务商)付费;数据来源伦理各异

直接抓取公司官网

公开的公司网站——联系页面、团队页面、关于我们、新闻稿——通常都比 LinkedIn 风险低得多,而且基本可以放心使用。很多时候,这些网站上的数据还比 LinkedIn 资料更丰富、更及时,因为公司会主动维护自己的官网。

这也是 Thunderbit 能派上用场的地方。我们的 AI 网页爬虫可以从公开网站里提取邮箱、电话和结构化公司数据,只要你的使用场景符合网站条款和适用法律即可。AI Suggest Fields 功能会自动识别页面并推荐列字段,你不需要手动配置;子页面抓取可以继续访问每个团队成员页面或产品页面来补全记录;分页处理则能让你不用写脚本就抓取多页目录。

商业目录和公开名录

黄页、行业目录、商会名录、政府登记信息、活动参会名单——这些都属于公开可获取数据,而且风险远低于 LinkedIn。Thunderbit 的云端抓取可以处理这些来源里的大批量提取;对于开发者工作流,API(POST /extract)和 CLI 也能通过结构化 JSON 输出实现规模化自动提取。

数据增强服务

像 Clearbit 和 ZoomInfo 这样的服务,会通过它们自己的数据来源体系提供公司画像和联系数据。法律风险更多会转移到服务商身上,不过数据来源伦理和准确率会不一样。这些服务都要付费,但对需要稳定、大规模数据的团队来说,往往比冒着法律风险去抓 LinkedIn 更划算。

实际可执行的工作流

如果你的真实目标是搭建潜在客户名单或补全 CRM 记录,那么工作流通常会是这样:

  1. 先从公开目录、行业列表或活动页面确定目标公司。
  2. 使用 Thunderbit 的 Chrome 扩展 直接抓取公司官网上的联系信息、团队资料和产品数据。
  3. 使用 AI Suggest Fields 让 Thunderbit 自动识别正确的列(姓名、职位、邮箱、电话等)。
  4. 直接导出到 Google Sheets、Airtable、Notion 或你的 CRM——基础导出没有付费墙
  5. 如果还需要更多公司画像或意向数据,再用数据供应商做补充增强。

这种做法能让你拿到类似的业务数据,却不用碰 LinkedIn,而且法律风险更低——前提还是要检查每个来源的条款、隐私义务和下游用途。

Safer alternatives to LinkedIn scraping

如果你想更深入了解 AI 驱动的抓取在不同数据源上的工作方式,可以看看我们的指南:无需编程的网页抓取AI 网页抓取

核心要点

  • 在美国,抓取无需登录的公开 LinkedIn 数据,按照 hiQ 之后的判例,CFAA 风险较低,但仍违反 LinkedIn 的服务条款,也存在诉讼风险。
  • **在欧盟,“公开可见”不是合法抗辩理由。**几乎所有 LinkedIn 抓取都需要有记录在案的 GDPR 合法依据,而且执法正在加强。
  • 登录后抓取、使用假账号或转售付费墙后的数据,风险极高,而且在多套法律框架下都很可能违法。
  • LinkedIn 会积极识别并打击爬虫,手段包括账号限制、诉讼、禁令和数据删除义务。
  • **hiQ 案并没有让 LinkedIn 抓取合法化。**它只是降低了某一巡回区内对公开数据的 CFAA 风险,但合同索赔依然成立,而且案件最后和解,没有形成具有普遍约束力的判例。
  • 对业务团队来说,更低风险的方式是通过合规替代方案获取类似数据——比如用 Thunderbit 抓取公开公司网站和目录,在适用场景下使用 LinkedIn 官方 API,或者从合规实践清楚的数据供应商那里授权购买数据。
  • 在抓取 LinkedIn 前,先问自己:“我能不能从法律和平台风险更低的来源拿到这些数据?”很多情况下,答案是可以。

常见问题

抓取公开的 LinkedIn 个人资料合法吗?

在美国,按照第九巡回法院的 hiQ 先例,抓取公开可见、无需登录的 LinkedIn 资料,CFAA 风险较低,但仍然违反 LinkedIn 的服务条款,因此存在违约风险。在欧盟,即使是公开数据,也必须有 GDPR 下的合法依据——“公开可见”不等于“可以随便用”。

LinkedIn 会因为抓取而封我的账号吗?

会。LinkedIn 会通过限速、机器人检测算法和浏览器指纹识别等方式主动识别自动化行为。后果从临时限制到永久封号不等,而且不保证能恢复。有用户反馈,自己一夜之间丢掉了多年积累的联系人和内容。

抓取 LinkedIn Sales Navigator 违法吗?

抓取 Sales Navigator 数据风险极高。这不仅违反 ToS,还可能构成 Sales Navigator 订阅合同违约,因为这些数据本来就在付费墙后。Mantheos 案就涉及使用假账号和假信用卡访问 Sales Navigator,最后以 LinkedIn 获胜、发布永久禁令和和解收场。

如果抓取的是欧盟居民的 LinkedIn 资料,GDPR 还适用吗?

适用,而且与你人在何处无关。对欧盟/欧洲经济区居民个人数据的任何处理,都必须符合 GDPR,包括具备书面的合法依据(例如经过平衡测试的合法权益)、遵守删除权请求,以及按第 14 条向数据主体提供通知。

不抓取 LinkedIn,还有哪些更安全的方式获取业务联系数据?

主要替代方案有:(1) 抓取公司官网上的联系信息、团队页面和产品数据(像 Thunderbit 这类工具会让这件事很简单);(2) 使用商业目录和公开名录;(3) 在适用场景下使用 LinkedIn 官方 API;(4) 向 Clearbit 或 ZoomInfo 这类数据增强服务商授权购买数据。这些方式都能提供相近的业务数据,但法律风险低得多。

了解更多

Ke
Ke
Thunderbit 首席技术官 | 高级数据科学家与机器学习专家 Ke Shen 拥有近十年的机器学习和数据科学经验,毕业于哥伦比亚大学,曾任 Walmart Labs 高级数据科学家。他在 Python、R、Java 和统计学方面拥有深厚且备受同行认可的专业能力,并分享如何将复杂的 AI 算法从理论落地到生产级架构的实战经验。
目录

只要开口,就能抓取网页

用简单英文说出你的需求。或者更简单,什么都不用说。

试用 Thunderbit 免费
使用 AI 提取数据
轻松将数据传输到 Google Sheets、Airtable 或 Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week