LinkedIn hiện có hơn 1,3 tỷ thành viên, biến nền tảng này thành cơ sở dữ liệu nghề nghiệp giá trị bậc nhất trên thế giới. Vì vậy, chuyện các đội sales, tuyển dụng và growth muốn tự động hóa để khai thác nguồn dữ liệu này cũng không có gì lạ. Nhưng câu hỏi "scraping LinkedIn có hợp pháp không?" vẫn là một trong những chủ đề gây rối nhất — và cũng được tìm kiếm nhiều nhất — trong thế giới dữ liệu B2B.
Phần lớn bài viết hướng dẫn vẫn đưa ra cùng một câu trả lời: "tùy trường hợp." Tôi đã dành rất nhiều thời gian để đọc hồ sơ tòa án, chính sách của chính LinkedIn, các vụ thực thi GDPR, và cả những thảo luận trên diễn đàn nơi các nhà sáng lập kể lại việc họ bị kiện. Bức tranh vào năm 2026 rõ ràng đã khác khá nhiều so với những gì đa số bài viết trên internet mô tả. Bài viết này sẽ phân tích cụ thể theo từng tình huống — bao gồm một bảng ma trận pháp lý mà bạn có thể lưu lại để tham khảo — cùng những cách an toàn hơn để lấy dữ liệu kinh doanh bạn cần mà không đẩy công ty của mình (hay tài khoản LinkedIn của bạn) vào thế rủi ro.
Lưu ý: Bài viết này chỉ mang tính cung cấp thông tin pháp lý, không phải tư vấn pháp lý. Nếu bạn định thu thập dữ liệu ở quy mô thương mại, hãy trao đổi với luật sư am hiểu khu vực pháp lý của bạn.
Scraping LinkedIn là gì, và vì sao nhiều đội ngũ lại làm vậy?
Scraping LinkedIn là việc dùng công cụ tự động, script hoặc tiện ích trình duyệt để trích xuất dữ liệu từ các trang LinkedIn — như tên hồ sơ, chức danh, thông tin công ty, email, kỹ năng, tin tuyển dụng hoặc mạng lưới kết nối.
Về mặt kỹ thuật, đây là hành vi lấy dữ liệu có cấu trúc từ HTML hoặc phản hồi API của LinkedIn bằng chương trình, dù dữ liệu đó nằm trên trang hồ sơ công khai hay phía sau lớp đăng nhập.
Hãy hình dung nó như có một thực tập sinh siêu nhanh chạy đi lướt hàng nghìn hồ sơ LinkedIn rồi chép thông tin vào bảng tính — chỉ khác là "thực tập sinh" này là phần mềm, và làm xong trong vài phút thay vì vài tuần.
Scraping LinkedIn không giống với việc dùng LinkedIn theo cách thông thường. Xem hồ sơ, gửi lời mời kết nối hay xuất danh bạ của chính bạn bằng công cụ có sẵn của LinkedIn đều nằm trong mục đích sử dụng của nền tảng. Scraping là hành vi tự động hóa ở quy mô hoặc tốc độ mà LinkedIn không cho phép.
Vì sao các đội ngũ làm điều này
Một số mục đích phổ biến:
- Sales và tạo lead: Xây dựng danh sách khách hàng tiềm năng gồm tên, chức danh, email và thông tin công ty. LinkedIn thường là nơi đầu tiên các đội B2B tìm đến vì dữ liệu có cấu trúc, dễ tìm kiếm và do chính người dùng tự khai báo.
- Tuyển dụng: Tìm ứng viên bằng cách scraping các hồ sơ khớp với kỹ năng, khu vực hoặc mức kinh nghiệm cụ thể.
- Nghiên cứu thị trường: Phân tích xu hướng tuyển dụng, tốc độ tăng trưởng công ty hoặc vị thế cạnh tranh dựa trên dữ liệu tổng hợp từ LinkedIn.
- Phân tích đối thủ: Theo dõi biến động nhân sự, tuyển mới hoặc cấu trúc tổ chức của các công ty cạnh tranh.
Sức hút này là có thật. LinkedIn là nơi giới chuyên nghiệp tự khai báo dữ liệu nghề nghiệp của họ ở định dạng có cấu trúc và dễ tìm kiếm. Hiếm có nguồn công khai nào sánh được.

Câu trả lời ngắn gọn: Scraping LinkedIn có hợp pháp không?
Tóm lại: tùy bạn scrape dữ liệu gì, scrape như thế nào, và bạn (cũng như người mà bạn scrape dữ liệu) đang ở đâu.
- Scrape dữ liệu LinkedIn công khai, không cần đăng nhập có mức rủi ro CFAA thấp hơn tại Mỹ sau tiền lệ hiQ v. LinkedIn — nhưng vẫn vi phạm Điều khoản Dịch vụ của LinkedIn.
- Scrape khi đã đăng nhập, dùng tài khoản giả, hoặc lấy dữ liệu từ các sản phẩm trả phí như Sales Navigator là rủi ro rất cao.
- Tại EU, "dữ liệu công khai" không phải là lý do bào chữa hợp pháp. Bạn vẫn cần có căn cứ xử lý hợp pháp theo GDPR.
- LinkedIn chủ động phát hiện và xử lý các công cụ scraping ở nhiều lớp, từ hạn chế tài khoản đến kiện dân sự và lệnh cấm.
Giá mà tôi có bảng này từ lúc mới nghiên cứu chủ đề này.
Ma trận pháp lý theo tình huống
| Tình huống | Loại dữ liệu | Tình trạng pháp lý (Mỹ) | Tình trạng pháp lý (EU) | Mức rủi ro |
|---|---|---|---|---|
| Scrape hồ sơ công khai (không đăng nhập) | Công khai | Rủi ro CFAA thấp hơn (theo tiền lệ hiQ); vẫn vi phạm ToS | Cần căn cứ hợp pháp theo GDPR | ⚠️ Trung bình |
| Scrape khi đang đăng nhập | Riêng tư / bị chặn | Vi phạm ToS + có thể vi phạm CFAA | Có khả năng vi phạm GDPR | 🔴 Cao |
| Scrape dữ liệu Sales Navigator | Riêng tư / trả phí | Vi phạm ToS + vi phạm hợp đồng | Vi phạm GDPR + vi phạm hợp đồng | 🔴 Rất cao |
| Scrape tin tuyển dụng (công khai) | Công khai | Rủi ro CFAA thấp hơn | Cần căn cứ hợp pháp | ⚠️ Thấp–Trung bình |
| Scrape để bán lại thương mại | Công khai / riêng tư | Rủi ro kiện tụng cao (theo tiền lệ Mantheos) | Rủi ro GDPR + ePrivacy | 🔴 Rất cao |
| Scrape cho dự án cá nhân / học thuật | Công khai | Rủi ro thấp hơn | Cần căn cứ hợp pháp; mức ưu tiên thực thi thấp hơn | ✅ Thấp |
| Dùng API chính thức của LinkedIn | Được cấp quyền | Hợp pháp (trong phạm vi điều khoản API) | Hợp pháp (trong phạm vi điều khoản API) | ✅ Thấp |
Điều gì làm mức rủi ro giữa các tình huống khác nhau? Có ba yếu tố: (1) bạn có vượt qua lớp đăng nhập hay kiểm soát truy cập không, (2) dữ liệu đó thực sự là công khai hay bị chặn sau tài khoản, và (3) bạn dùng dữ liệu đó để làm gì tiếp theo (nghiên cứu cá nhân hay bán lại thương mại). Mỗi yếu tố đều có thể đẩy rủi ro pháp lý lên đáng kể.
Những luật chính áp dụng cho scraping LinkedIn
Có ba khung pháp lý hầu như luôn xuất hiện trong mọi tranh chấp liên quan đến scraping LinkedIn.
Computer Fraud and Abuse Act (CFAA)
CFAA là đạo luật liên bang Mỹ chính thường được nhắc đến trong các vụ scraping. Ban đầu được ban hành năm 1986 để chống tấn công máy tính, luật này cấm truy cập vào hệ thống "không được phép" hoặc "vượt quá phạm vi được phép truy cập."
Câu hỏi đặt ra khi scraping là: việc truy cập một trang web công khai có bị xem là "truy cập trái phép" nếu điều khoản của website nói rằng bạn không được làm vậy không?
Sau phán quyết Van Buren của Tòa Tối cao năm 2021, câu trả lời nghiêng về phía không — ít nhất với dữ liệu thực sự công khai. Van Buren đã thu hẹp phạm vi áp dụng của CFAA: việc dùng sai thông tin mà bạn vẫn được phép truy cập không tự động trở thành tội phạm máy tính cấp liên bang. Tuy nhiên, việc scraping khi đã vượt qua rào cản xác thực — đăng nhập, dùng tài khoản giả, vượt paywall — vẫn mang rủi ro CFAA thực sự, vì khi đó bạn đang truy cập hệ thống theo cách mà bên vận hành không cho phép.
GDPR và các luật bảo vệ dữ liệu ở châu Âu
Quy định Chung về Bảo vệ Dữ liệu của EU (GDPR) kiểm soát cách dữ liệu cá nhân của cư dân EU/EEA được thu thập, xử lý và lưu trữ — bất kể scraper đặt ở đâu. Nếu bạn đang ở Texas mà scrape hồ sơ của người ở Berlin, GDPR vẫn áp dụng với bạn.
Các điều khoản quan trọng liên quan đến scraping LinkedIn gồm:
- Điều 6(1)(f) — Lợi ích hợp pháp: căn cứ pháp lý thường được viện dẫn nhất cho scraping B2B, nhưng đòi hỏi phải có bài kiểm tra cân bằng được ghi nhận, chứng minh lợi ích của bạn không lấn át quyền riêng tư của chủ thể dữ liệu.
- Điều 17 — Quyền được xóa: cá nhân có thể yêu cầu bạn xóa dữ liệu đã scrape của họ.
- Điều 9 — Nhóm dữ liệu nhạy cảm: nếu quá trình scraping vô tình thu thập dữ liệu tiết lộ nguồn gốc chủng tộc/dân tộc, quan điểm chính trị, sức khỏe, v.v. (điều này đôi khi xuất hiện trên hồ sơ LinkedIn), thì các quy tắc nghiêm ngặt hơn sẽ áp dụng.
- Điều 14 — Nghĩa vụ cung cấp thông tin cho chủ thể dữ liệu: bạn có thể phải thông báo cho người dùng rằng dữ liệu của họ đã được thu thập, ngay cả khi đó là dữ liệu công khai.
Kết luận: "hiển thị công khai" không đồng nghĩa với căn cứ xử lý hợp pháp theo GDPR. Bạn phải xác định và ghi nhận cơ sở pháp lý trước khi bắt đầu scraping.
Điều khoản Dịch vụ của LinkedIn
Thỏa thuận Người dùng của LinkedIn rất rõ ràng. Mục 8.2 cấm:
- Phát triển, hỗ trợ hoặc sử dụng phần mềm, script, robot, crawler, plugin trình duyệt, add-on hoặc quy trình khác để scrape hoặc sao chép dịch vụ LinkedIn, bao gồm hồ sơ và các dữ liệu khác
- Vượt qua hoặc lách các tính năng bảo mật, kiểm soát truy cập hoặc giới hạn sử dụng
- Dùng bot hoặc phương thức tự động trái phép để truy cập dịch vụ, thêm/tải danh bạ, hoặc gửi tin nhắn
- Sao chép, sử dụng, hiển thị hoặc phân phối thông tin lấy từ LinkedIn mà không có sự đồng ý
- Cho thuê, cho thuê lại, bán hoặc kiếm tiền từ dịch vụ LinkedIn hay dữ liệu liên quan
Các trang trợ giúp của LinkedIn về hoạt động tự động và phần mềm bị cấm cũng nhấn mạnh rằng các tiện ích trình duyệt bên thứ ba dùng để scrape hoặc tự động hóa hoạt động đều bị cấm rõ ràng, và việc vi phạm có thể dẫn đến hạn chế tài khoản hoặc hành động pháp lý.
Vi phạm ToS là vi phạm hợp đồng — không nhất thiết là hành vi hình sự. Nhưng nó trao cho LinkedIn cơ sở vững chắc để thực thi dân sự, và như ta sẽ thấy, họ sử dụng cơ sở này rất mạnh tay.
Dòng thời gian hiQ v. LinkedIn: Điều gì thực sự đã thay đổi
Phần lớn bài viết giải thích sai chỗ này. Họ trích hiQ v. LinkedIn như bằng chứng rằng "scraping LinkedIn là hợp pháp." Thực tế phức tạp hơn nhiều — vụ việc kết thúc mà không tạo ra một tiền lệ dứt khoát.
Từ lệnh cấm năm 2017 đến thỏa thuận năm 2022
Dòng thời gian thực tế như sau:
- 2017: LinkedIn gửi cho hiQ Labs (một công ty phân tích hồ sơ LinkedIn công khai để dự đoán tỷ lệ nhân viên nghỉ việc) thư yêu cầu chấm dứt. hiQ kiện lại. Tòa quận miền Bắc California ban hành lệnh cấm sơ bộ, cho phép hiQ tiếp tục scrape hồ sơ công khai.
- 2019: Tòa Phúc thẩm Khu vực 9 giữ nguyên lệnh cấm, cho rằng việc scrape dữ liệu công khai có lẽ không vi phạm CFAA.
- 2021: Tòa Tối cao hủy phán quyết của Khu vực 9 và trả hồ sơ về để xem xét lại dưới ánh sáng của Van Buren v. United States, vốn thu hẹp phạm vi CFAA.
- Tháng 4/2022: Khu vực 9 tái khẳng định quan điểm của mình, kết luận rằng Van Buren thực ra còn củng cố lập luận trước đó — scraping dữ liệu công khai không cấu thành "truy cập trái phép" theo CFAA.
- Tháng 11/2022: Ở cấp tòa sơ thẩm, các yêu cầu của LinkedIn về vi phạm hợp đồng vẫn còn hiệu lực. Tòa ghi nhận rằng Thỏa thuận Người dùng của LinkedIn đã cấm rõ việc scraping. Tòa cũng chấp nhận phán quyết rút gọn cho LinkedIn về việc hiQ dùng "turkers" tạo tài khoản giả để kiểm thử QA khi đã đăng nhập.
- Tháng 12/2022: Các bên đạt được thỏa thuận riêng. Phân tích pháp lý cho biết có lệnh cấm vĩnh viễn đối với việc hiQ scrape LinkedIn và phán quyết 500.000 USD, với việc hiQ thừa nhận LinkedIn chịu thiệt hại đủ để cấu thành yêu cầu dân sự theo CFAA dựa trên truy cập bằng tài khoản giả.
Điểm rút ra: hiQ làm giảm rủi ro CFAA khi scrape dữ liệu thực sự công khai, không đăng nhập trong Khu vực 9 của Mỹ. Nhưng nó không tạo ra quyền chung để scrape LinkedIn. Các yêu cầu về hợp đồng vẫn tồn tại. Việc truy cập bằng tài khoản giả bị xử phạt. Và do vụ việc dàn xếp, hiện không có phán quyết ràng buộc từ Tòa Tối cao về câu hỏi cốt lõi.
Người dùng trên diễn đàn thường hiểu sai chuyện này — có người nói "LinkedIn thắng", người khác lại nói "hiQ thắng." Thực tế là không bên nào có một phán quyết tòa án chung cuộc mang tính dứt điểm. Câu hỏi này vẫn còn bỏ ngỏ một phần.
Vụ LinkedIn v. Mantheos
Mantheos là ví dụ đối lập, cho thấy thế nào là scraping rõ ràng bất hợp pháp. Công ty này dùng tài khoản giả và thẻ tín dụng giả để truy cập sản phẩm trả phí Sales Navigator của LinkedIn, sau đó scrape và bán lại dữ liệu cho mục đích thương mại.
Kết quả: LinkedIn cho biết Mantheos đã đồng ý xóa vĩnh viễn dữ liệu hồ sơ thành viên đã scrape, hủy phần mềm scraping và ngừng truy cập dữ liệu hồ sơ thành viên LinkedIn thông qua scraping hoặc các cách tự động khác. Vụ này liên quan đến danh tính giả, thẻ ghi nợ ảo dưới tên giả, truy cập Sales Navigator trả phí, và phân phối lại dữ liệu vì mục đích thương mại — một tổ hợp mà bất kỳ đánh giá rủi ro nào cũng không thể xem là tương đương với việc xem các trang công khai.
Điều gì mới trong giai đoạn 2024–2026
Bức tranh pháp lý không hề đứng yên sau khi hiQ được dàn xếp. Một số diễn biến đáng chú ý:
Yếu tố đào tạo AI. Sự nổi lên của các mô hình ngôn ngữ lớn được huấn luyện trên dữ liệu web đã scrape khiến việc xem xét quyền riêng tư trở nên gắt gao hơn. Với dữ liệu hồ sơ LinkedIn, nguyên tắc thực tế vẫn giống như với mọi dữ liệu cá nhân: phải ghi nhận căn cứ hợp pháp trước khi xử lý, thu thập tối thiểu cần thiết, và chuẩn bị cho việc bị soi xét kỹ hơn khi việc xử lý liên quan đến profiling quy mô lớn hoặc ra quyết định tự động.
Phản ứng từ chính LinkedIn. LinkedIn tuyên bố công khai rằng ngay cả khi dữ liệu scrape là dữ liệu công khai và không phải "xâm nhập", họ vẫn xem việc tổng hợp và bán lại là hành vi sử dụng sai mục đích. Họ cũng cho biết sử dụng biện pháp pháp lý và biện pháp kỹ thuật để chống scraping trái phép.
Luật quyền riêng tư cấp bang tại Mỹ. Ngoài CFAA, các bang như California (CCPA/CPRA), Virginia, Colorado, Connecticut và những nơi khác đã ban hành các luật quyền riêng tư toàn diện. CCPA trao cho cư dân California quyền biết, xóa, và từ chối việc bán/chia sẻ thông tin cá nhân của họ — điều này có thể bao gồm dữ liệu scrape từ hồ sơ LinkedIn.
Xu hướng toàn cầu là rõ ràng: nhiều quy định hơn, thực thi mạnh hơn, rủi ro lớn hơn.
Mỹ vs. EU vs. phần còn lại của thế giới: Scraping LinkedIn có hợp pháp nơi bạn ở không?
Một trong những lỗ hổng lớn nhất của các hướng dẫn scraping LinkedIn là giả định rằng chỉ luật Mỹ mới quan trọng. Thực ra không phải vậy. Nơi chủ thể dữ liệu sinh sống sẽ quyết định chế độ bảo vệ quyền riêng tư nào áp dụng — không phải nơi máy chủ của bạn đặt.
| Khu vực pháp lý | Luật chính | Scraping dữ liệu công khai | Xử lý PII | Rủi ro thực thi |
|---|---|---|---|---|
| 🇺🇸 Hoa Kỳ | CFAA, CCPA/CPRA, luật quyền riêng tư cấp bang | Rủi ro CFAA thấp hơn với dữ liệu công khai (theo hiQ); ToS vẫn áp dụng | Sử dụng thương mại PII có thể dẫn đến kiện tụng | Trung bình — LinkedIn chủ động kiện |
| 🇪🇺 EU / EEA | GDPR (Điều 6, Điều 9, Điều 17) | Cần căn cứ hợp pháp (bài kiểm tra cân bằng lợi ích hợp pháp) | Áp dụng quyền được xóa; với dữ liệu nhạy cảm thì nên có đồng ý rõ ràng | Cao — cơ quan bảo vệ dữ liệu đang tích cực điều tra scraping |
| 🇬🇧 Vương quốc Anh | UK GDPR + Data Protection Act 2018 | Tương tự EU; áp dụng hướng dẫn ICO | Nghĩa vụ tương tự GDPR | Trung bình–Cao |
| 🇦🇺 Úc | Privacy Act 1988, APPs | Ít hạn chế hơn với dữ liệu công khai | Việc xử lý thương mại PII vẫn được điều chỉnh | Thấp–Trung bình |
| 🇧🇷 Brazil | LGPD | Cần căn cứ hợp pháp | Khá tương đồng với khung GDPR | Trung bình |
Hoa Kỳ: CFAA và luật quyền riêng tư cấp bang
Quan điểm của Mỹ sau hiQ và Van Buren: scraping dữ liệu LinkedIn thực sự công khai, không đăng nhập có lẽ không vi phạm CFAA trong Khu vực 9. Nhưng "có lẽ không vi phạm một đạo luật liên bang" vẫn còn rất xa mới tới mức "hợp pháp và an toàn." ToS của LinkedIn vẫn áp dụng. Các luật quyền riêng tư cấp bang như CCPA/CPRA tạo ra nghĩa vụ bổ sung nếu bạn xử lý dữ liệu cư dân California cho mục đích thương mại. Và LinkedIn đặt trụ sở tại California, đồng thời đã chứng minh rằng họ sẵn sàng kiện mạnh tay.
EU và EEA: yêu cầu chặt chẽ của GDPR
GDPR là nơi scraper gặp khó khăn thực sự. Căn cứ pháp lý thường được viện dẫn nhất cho scraping B2B là lợi ích hợp pháp theo Điều 6(1)(f), nhưng điều này đòi hỏi phải có một Bản đánh giá lợi ích hợp pháp (LIA) ghi nhận rằng lợi ích của bạn không lấn át quyền của chủ thể dữ liệu. Hướng dẫn của ICO nêu rõ rằng căn cứ pháp lý phải được xác định và ghi nhận trước khi xử lý bắt đầu, việc xử lý phải là cần thiết (không chỉ tiện), và bạn phải xem xét kỳ vọng hợp lý, tác động, và khả năng ngừng xử lý theo yêu cầu.
Kết hợp với quyền được xóa (Điều 17), nghĩa vụ thông báo theo Điều 14, và việc các cơ quan bảo vệ dữ liệu ngày càng tập trung vào scraping phục vụ đào tạo AI, gánh nặng tuân thủ cho scraping LinkedIn nhắm tới EU là rất lớn.
Anh, Úc, Brazil và các nơi khác
Vương quốc Anh đi theo khung tương tự GDPR thông qua UK GDPR và Data Protection Act 2018. Privacy Act 1988 của Úc ít hạn chế hơn với dữ liệu công khai nhưng vẫn điều chỉnh việc xử lý thông tin cá nhân cho mục đích thương mại. LGPD của Brazil phản ánh GDPR ở nhiều khía cạnh.
Xu hướng toàn cầu đang tiến về phía bảo vệ dữ liệu chặt hơn. Nếu bạn scrape hồ sơ LinkedIn của người ở nhiều quốc gia khác nhau, rất có thể bạn đang đồng thời chịu nhiều chế độ pháp lý cùng lúc.
LinkedIn thực sự làm gì để ngăn scraping
Lý thuyết pháp lý là một chuyện. Cách LinkedIn thực thi ngoài đời lại là chuyện khác.
Các biện pháp kỹ thuật
Hệ thống phát hiện của LinkedIn có nhiều lớp:
- Giới hạn tốc độ và giới hạn tìm kiếm: Tài khoản miễn phí thường chỉ xem được khoảng 50–80 hồ sơ mỗi ngày. Vượt mức đó là chạm rào cản.
- CAPTCHA: Mẫu duyệt tự động sẽ kích hoạt CAPTCHA và làm gián đoạn quy trình scraping.
- Thuật toán phát hiện bot: LinkedIn theo dõi chuyển động chuột, thói quen cuộn trang, thời điểm gửi request và dấu vân tay trình duyệt để phát hiện hành vi không phải con người.
- Rào cản đăng nhập: Phần lớn dữ liệu LinkedIn chỉ hiển thị với người đã xác thực, nghĩa là muốn scrape thì phải đăng nhập (và chấp nhận ToS).
- Chặn IP và giám sát phiên: Nhiều request từ cùng IP hoặc mẫu phiên bất thường sẽ bị chặn.
Các biện pháp pháp lý
LinkedIn không chỉ dựa vào kỹ thuật. Đội pháp lý của họ đã gửi thư yêu cầu chấm dứt cho các công ty như Proxycurl, Apollo và Seamless.AI. Nhà sáng lập Proxycurl từng công khai mô tả trải nghiệm này, lưu ý rằng LinkedIn có "nguồn tiền vô hạn" cho các cuộc chiến pháp lý — một chi tiết đủ để các startup phải dè chừng nếu định xây dựng kinh doanh trên dữ liệu LinkedIn đã scrape.
LinkedIn cũng đã theo đuổi các vụ kiện dân sự (hiQ, Mantheos và các vụ khác), tìm cách gỡ bỏ công cụ khỏi hệ sinh thái của họ, và công khai tuyên bố tiếp tục hành động pháp lý chống lại các scraper.
Thang hậu quả: Điều gì xảy ra nếu bạn bị phát hiện
Hậu quả thường leo thang dần. Hiểu được từng nấc giúp bạn đánh giá rủi ro thực tế hơn.
Mức 1: Phát hiện nhẹ
CAPTCHA, giới hạn tốc độ, tạm thời hạn chế tìm kiếm. Đây là phản ứng tự động — chưa có ai ở LinkedIn kiểm tra tài khoản của bạn. Cách xử lý khá đơn giản: dừng hoạt động tự động, chờ một thời gian, rồi quay lại dùng thủ công.
Mức 2: Hạn chế tài khoản
Giới hạn số hồ sơ có thể xem, hạn chế chức năng tìm kiếm. LinkedIn có thể gắn cờ tài khoản để xem xét. Bạn có thể nhận thông báo cảnh báo. Có thể khắc phục nếu bạn ngừng scraping và tắt công cụ gây ra vấn đề.
Mức 3: Tạm ngưng hoặc khóa vĩnh viễn tài khoản
Mất tài khoản vĩnh viễn đồng nghĩa mất toàn bộ kết nối, nội dung đã đăng, khuyến nghị và lịch sử tin nhắn. Tất cả. Tôi từng thấy các bài đăng trên diễn đàn tuyển dụng kể về việc mất hơn 5.000 kết nối chỉ sau một đêm — bao nhiêu năm xây dựng mạng lưới nghề nghiệp biến mất chỉ vì một tiện ích trình duyệt.
LinkedIn hiếm khi khôi phục khóa vĩnh viễn. Và nếu sau khi bị khóa mà bạn tạo tài khoản mới, điều đó cũng có thể bị xem là vi phạm ToS.
Mức 4: Thư yêu cầu chấm dứt
Đội pháp lý của LinkedIn gửi thông báo chính thức yêu cầu bạn dừng scraping và hủy dữ liệu đã thu thập. Việc này đã xảy ra với cả công ty lớn lẫn nhà sáng lập solo. Bỏ qua thư C&D thường sẽ dẫn đến leo thang sang kiện tụng.
Mức 5: Vụ kiện dân sự
LinkedIn có thể khởi kiện vi phạm hợp đồng, CFAA (nếu có vượt đăng nhập hoặc dùng tài khoản giả), và có thể cả các lý thuyết về cạnh tranh không lành mạnh hoặc xâm nhập trái phép. Vụ Mantheos kết thúc bằng việc gỡ bỏ, hủy dữ liệu và chi phí dàn xếp. Riêng phí luật sư đã có thể lên tới sáu con số, ngay cả khi cuối cùng bạn thắng kiện.
Mức 6: Phạt từ cơ quan quản lý
Với các hoạt động nhắm tới EU, mức phạt GDPR có thể lên tới 4% doanh thu toàn cầu hằng năm hoặc 20 triệu euro, tùy mức nào cao hơn. Điều tra của cơ quan bảo vệ dữ liệu có thể được kích hoạt chỉ từ một khiếu nại của chủ thể dữ liệu bị scrape. Khi các cơ quan này ngày càng chú ý tới scraping phục vụ đào tạo AI, rủi ro này đang tăng lên chứ không giảm đi.
Một điều cần nói thẳng: né bị phát hiện không phải là chiến lược tuân thủ. Dùng proxy, dịch vụ giải CAPTCHA, hay kỹ thuật né giới hạn tốc độ không làm thay đổi phân tích pháp lý — nó chỉ trì hoãn hậu quả kỹ thuật, đồng thời có thể làm tình hình pháp lý xấu hơn (vì nó cho thấy ý định cố tình lách kiểm soát).
Thực hành tốt nhất nếu bạn vẫn muốn thu thập dữ liệu LinkedIn
Nếu trường hợp sử dụng của bạn thực sự cần dữ liệu LinkedIn và bạn quyết định tiếp tục, các nguyên tắc sau sẽ giúp giảm rủi ro. Chúng không loại bỏ hoàn toàn rủi ro.
Chỉ dùng dữ liệu công khai
Chỉ truy cập dữ liệu có thể xem mà không cần đăng nhập. Tuyệt đối không dùng tài khoản giả, thông tin đăng nhập dùng chung, hoặc lách paywall. Khi bạn đăng nhập, bạn đã chấp nhận ToS của LinkedIn và chịu toàn bộ cơ chế thực thi của họ.
Tôn trọng rate limit và robots.txt
Đừng làm quá tải máy chủ LinkedIn. Giữ tần suất request thấp và mang tính người dùng thật. Kiểm tra chỉ dẫn robots.txt của LinkedIn và tuân thủ. Tòa án từng xem việc tuân thủ hay không tuân thủ robots.txt như một bằng chứng cho thiện chí hoặc ác ý.
Nắm rõ nghĩa vụ theo GDPR
Nếu bạn xử lý dữ liệu của cư dân EU:
- Ghi nhận căn cứ pháp lý trước khi bắt đầu thu thập
- Thực hiện Bản đánh giá lợi ích hợp pháp nếu dựa vào Điều 6(1)(f)
- Chỉ thu thập những trường cần thiết tối thiểu cho mục đích đã nêu
- Tôn trọng nhanh chóng các yêu cầu xóa dữ liệu và phản đối xử lý
- Cung cấp thông báo theo Điều 14 khi cần
- Lưu hồ sơ về các hoạt động xử lý
Dùng API chính thức của LinkedIn khi có thể
Marketing API và People API của LinkedIn cung cấp quyền truy cập được cấp phép vào một số dữ liệu nhất định. Dùng API sẽ loại bỏ rủi ro vi phạm ToS. Đổi lại: quyền truy cập bị hạn chế, cần phê duyệt, có giới hạn tốc độ, và chỉ bao phủ tập hợp trường dữ liệu hẹp hơn so với những gì hiển thị trên website. Với nhiều nhu cầu lead generation, API đơn giản là không cung cấp đủ thứ đội ngũ cần — nhưng vẫn đáng kiểm tra xem có phù hợp với bạn không.
Các phương án an toàn hơn để có được dữ liệu kinh doanh bạn thực sự cần
Phần lớn các hướng dẫn về LinkedIn scraping bỏ qua điều này: đa số đội ngũ không cần dữ liệu LinkedIn cụ thể. Họ cần thông tin liên hệ doanh nghiệp, chi tiết công ty, hoặc danh sách lead. LinkedIn chỉ là một nguồn cho dữ liệu đó — nhưng lại là nguồn có rủi ro pháp lý cao nhất. Những nguồn khác có thể cung cấp dữ liệu tương tự hoặc tốt hơn với mức phơi nhiễm thấp hơn nhiều.
| Phương án thay thế | Bạn nhận được gì | Rủi ro pháp lý | Hạn chế |
|---|---|---|---|
| LinkedIn API (Marketing/Sales) | Dữ liệu được cấp phép, số trường hạn chế | ✅ Thấp (nếu tuân thủ) | Phê duyệt chặt, giới hạn tốc độ, tốn kém |
| Scraping website công ty | Thông tin liên hệ, trang đội ngũ, dữ liệu sản phẩm | ✅ Thấp (website công khai) | Dữ liệu phân tán trên nhiều site |
| Danh bạ doanh nghiệp / niêm yết công khai | SĐT, email, địa chỉ | ✅ Thấp | Độ mới của dữ liệu không đồng đều |
| API làm giàu dữ liệu (Clearbit, ZoomInfo, v.v.) | Dữ liệu firmographic + contact | ✅ Thấp (trách nhiệm chuyển sang nhà cung cấp) | Có phí; đạo đức nguồn dữ liệu khác nhau |
Scrape trực tiếp website công ty
Các website công khai của doanh nghiệp — trang liên hệ, trang đội ngũ, trang giới thiệu, thông cáo báo chí — thường an toàn hơn rất nhiều so với LinkedIn. Dữ liệu ở đây thường phong phú và cập nhật hơn hồ sơ LinkedIn, vì chính doanh nghiệp chủ động duy trì website của họ.
Đây là lúc Thunderbit phát huy tác dụng. AI web scraper của chúng tôi có thể trích xuất email, số điện thoại và dữ liệu công ty có cấu trúc từ các website công khai, nơi trường hợp sử dụng của bạn được phép theo điều khoản của site và luật áp dụng. Tính năng AI Suggest Fields đọc trang và tự đề xuất các cột phù hợp, nên bạn không cần cấu hình thủ công. Tính năng scrape trang con cho phép đi vào từng trang thành viên đội ngũ hoặc từng trang sản phẩm để làm giàu dữ liệu, còn xử lý phân trang giúp bạn scrape các thư mục nhiều trang mà không cần viết script.
Danh bạ doanh nghiệp và các niêm yết công khai
Yellow Pages, thư mục ngành, danh sách phòng thương mại, sổ đăng ký của chính phủ, danh sách người tham dự sự kiện — tất cả đều công khai và có rủi ro thấp hơn LinkedIn rất nhiều. Scraping trên cloud của Thunderbit xử lý tốt việc trích xuất khối lượng lớn từ các nguồn này, và với quy trình làm việc dành cho developer, API (POST /extract) cùng CLI có thể tự động hóa quá trình trích xuất ở quy mô lớn với đầu ra JSON có cấu trúc.
Dịch vụ làm giàu dữ liệu
Các dịch vụ như Clearbit và ZoomInfo cung cấp dữ liệu firmographic và contact thông qua nguồn dữ liệu riêng của họ (về mặt nguyên tắc là tuân thủ). Khi đó, rủi ro pháp lý chuyển sang nhà cung cấp, dù vẫn cần cân nhắc tính đạo đức của nguồn dữ liệu và độ chính xác. Đây là các dịch vụ trả phí, nhưng với đội ngũ cần dữ liệu đáng tin cậy ở quy mô lớn, chúng thường tiết kiệm hơn nhiều so với rủi ro pháp lý khi scrape LinkedIn.
Quy trình thực tế
Với các đội ngũ mà mục tiêu thật sự là xây dựng danh sách lead hoặc làm giàu bản ghi CRM, quy trình sẽ như sau:
- Xác định các công ty mục tiêu từ thư mục công khai, danh sách ngành hoặc trang sự kiện.
- Scrape website công ty để lấy thông tin liên hệ, thông tin đội ngũ và dữ liệu sản phẩm bằng tiện ích Chrome của Thunderbit.
- Dùng AI Suggest Fields để Thunderbit tự nhận diện các cột phù hợp (tên, chức danh, email, số điện thoại, v.v.).
- Xuất trực tiếp sang Google Sheets, Airtable, Notion hoặc CRM của bạn — không bị chặn paywall cho các lượt xuất cơ bản.
- Làm giàu dữ liệu bằng nhà cung cấp nếu bạn cần thêm thông tin firmographic hoặc intent.
Cách tiếp cận này giúp bạn có dữ liệu kinh doanh tương tự mà không cần chạm vào LinkedIn và với mức độ rủi ro pháp lý thấp hơn, với điều kiện bạn vẫn kiểm tra điều khoản của từng nguồn, nghĩa vụ bảo mật và cách sử dụng dữ liệu về sau.

Để tìm hiểu sâu hơn về cách scraping hỗ trợ bởi AI hoạt động trên các nguồn dữ liệu khác nhau, hãy xem các hướng dẫn của chúng tôi về web scraping không cần code và AI web scraping.
Những điểm chính cần nhớ
- Scrape dữ liệu LinkedIn công khai mà không đăng nhập có rủi ro CFAA thấp hơn tại Mỹ sau hiQ, nhưng vẫn vi phạm Điều khoản Dịch vụ của LinkedIn và có nguy cơ bị kiện.
- Tại EU, "dữ liệu công khai" không phải là lời bào chữa hợp pháp. Gần như mọi hoạt động scraping LinkedIn đều cần một căn cứ pháp lý theo GDPR được ghi nhận rõ ràng, và việc thực thi đang tăng lên.
- Scrape sau đăng nhập, dùng tài khoản giả, hoặc bán lại dữ liệu bị paywall là rủi ro rất cao và nhiều khả năng là bất hợp pháp theo nhiều khung pháp lý.
- LinkedIn chủ động phát hiện và thực thi chống scraper ở nhiều cấp độ — từ hạn chế tài khoản đến kiện tụng, lệnh cấm và nghĩa vụ xóa dữ liệu.
- Vụ hiQ không hợp pháp hóa việc scraping LinkedIn. Nó chỉ làm giảm rủi ro CFAA đối với dữ liệu công khai trong một khu vực, còn các yêu cầu về hợp đồng vẫn tồn tại và vụ việc đã được dàn xếp mà không tạo tiền lệ ràng buộc.
- Cách tiếp cận ít rủi ro hơn cho doanh nghiệp là lấy dữ liệu tương tự qua các lựa chọn tuân thủ hơn — dùng website công ty công khai và thư mục doanh nghiệp với công cụ như Thunderbit, dùng API chính thức của LinkedIn khi phù hợp, hoặc cấp phép dữ liệu từ các nhà cung cấp có quy trình tuân thủ rõ ràng.
- Trước khi scrape LinkedIn, hãy hỏi: "Tôi có thể lấy dữ liệu này từ một nguồn có rủi ro pháp lý và nền tảng thấp hơn không?" Trong nhiều trường hợp, câu trả lời là có.
Câu hỏi thường gặp
Có hợp pháp khi scrape hồ sơ LinkedIn công khai không?
Tại Mỹ, scrape hồ sơ LinkedIn hiển thị công khai (không cần đăng nhập) có rủi ro CFAA thấp hơn dựa trên tiền lệ hiQ trong Khu vực 9, nhưng vẫn vi phạm Điều khoản Dịch vụ của LinkedIn, dẫn đến rủi ro vi phạm hợp đồng. Tại EU, bạn vẫn cần căn cứ pháp lý theo GDPR ngay cả với dữ liệu công khai — "hiển thị công khai" không đồng nghĩa với "được tự do sử dụng."
LinkedIn có thể khóa tài khoản của tôi vì scraping không?
Có. LinkedIn chủ động phát hiện hoạt động tự động thông qua giới hạn tốc độ, thuật toán phát hiện bot và dấu vân tay trình duyệt. Hậu quả có thể từ hạn chế tạm thời cho đến khóa vĩnh viễn, và không có gì đảm bảo sẽ được khôi phục. Người dùng từng báo cáo mất toàn bộ kết nối và nội dung tích lũy trong nhiều năm chỉ sau một đêm.
Scrape LinkedIn Sales Navigator có hợp pháp không?
Scraping dữ liệu Sales Navigator có mức rủi ro rất cao. Nó vừa vi phạm ToS, vừa có thể vi phạm hợp đồng thuê bao Sales Navigator vì dữ liệu nằm sau tường truy cập trả phí. Vụ Mantheos — liên quan đến tài khoản giả và thẻ tín dụng giả để truy cập Sales Navigator — kết thúc bằng lệnh cấm vĩnh viễn và dàn xếp có lợi cho LinkedIn.
GDPR có áp dụng khi scraping hồ sơ LinkedIn của cư dân EU không?
Có, bất kể scraper đang ở đâu. Mọi hoạt động xử lý dữ liệu cá nhân của cư dân EU/EEA đều phải tuân thủ GDPR, bao gồm việc có căn cứ pháp lý được ghi nhận (như lợi ích hợp pháp với bài kiểm tra cân bằng), tôn trọng yêu cầu xóa dữ liệu và cung cấp thông báo cho chủ thể dữ liệu theo Điều 14.
Có cách nào an toàn hơn để lấy dữ liệu liên hệ doanh nghiệp mà không cần scrape LinkedIn không?
Các lựa chọn chính là: (1) scrape website công ty công khai để lấy thông tin liên hệ, trang đội ngũ và dữ liệu sản phẩm (các công cụ như Thunderbit giúp việc này dễ dàng); (2) dùng danh bạ doanh nghiệp và niêm yết công khai; (3) tận dụng API chính thức của LinkedIn nếu trường hợp sử dụng của bạn đủ điều kiện; và (4) cấp phép dữ liệu từ các nhà cung cấp như Clearbit hoặc ZoomInfo. Những cách này cho dữ liệu kinh doanh tương tự nhưng rủi ro pháp lý thấp hơn đáng kể.
Tìm hiểu thêm


