LinkedIn पर 1.3 अरब से अधिक सदस्य हैं, इसलिए इसे दुनिया का सबसे बड़ा पेशेवर डेटाबेस माना जाता है। ऐसे में हर सेल्स टीम, रिक्रूटर और ग्रोथ हैकर स्वाभाविक रूप से इससे प्रोग्रामेटिक तरीके से डेटा निकालना चाहता है। लेकिन सवाल — "क्या LinkedIn स्क्रैप करना कानूनी है?" — B2B डेटा की दुनिया में अब भी सबसे उलझे हुए और सबसे ज़्यादा खोजे जाने वाले सवालों में से एक है।
अधिकांश गाइड आज भी वही जवाब देते हैं: "यह परिस्थिति पर निर्भर करता है।" मैंने इस विषय पर कोर्ट फाइलिंग, LinkedIn की अपनी नीतियाँ, GDPR से जुड़े प्रवर्तन मामलों, और उन फोरम थ्रेड्स में काफ़ी समय लगाया है जहाँ संस्थापक बताते हैं कि उन पर मुकदमा हुआ। 2026 की तस्वीर इंटरनेट पर मौजूद अधिकतर लेखों से काफ़ी अलग दिखती है। आगे आपको एक साफ़, परिस्थिति-दर-परिस्थिति विश्लेषण मिलेगा — जिसमें एक ऐसी कानूनी मैट्रिक्स भी होगी जिसे आप सेव कर सकते हैं — साथ ही वे सुरक्षित तरीके भी जिनसे आप अपनी कंपनी या LinkedIn खाते को जोखिम में डाले बिना ज़रूरी बिज़नेस डेटा हासिल कर सकें।
अस्वीकरण: यह लेख कानूनी जानकारी है, कानूनी सलाह नहीं। यदि आप बड़े पैमाने पर डेटा संग्रह की योजना बना रहे हैं, तो अपने क्षेत्राधिकार को समझने वाले वकील से बात करें।
LinkedIn स्क्रैपिंग क्या है, और इतनी सारी टीमें ऐसा क्यों करती हैं?
LinkedIn स्क्रैपिंग का मतलब है ऑटोमेटेड टूल, स्क्रिप्ट या ब्राउज़र एक्सटेंशन की मदद से LinkedIn पेजों से डेटा निकालना — जैसे प्रोफ़ाइल नाम, नौकरी के शीर्षक, कंपनी जानकारी, ईमेल, स्किल्स, जॉब पोस्टिंग या कनेक्शन ग्राफ़।
तकनीकी भाषा में, यह LinkedIn के HTML या API रिस्पॉन्स से संरचित डेटा को प्रोग्रामेटिक रूप से प्राप्त करना है — चाहे वह डेटा किसी सार्वजनिक प्रोफ़ाइल पर हो या लॉगिन के पीछे छिपा हो।
इसे ऐसे समझिए जैसे कोई बेहद तेज़ इंटर्न हजारों LinkedIn प्रोफ़ाइलों पर जाकर जानकारी स्प्रेडशीट में भर दे — बस फर्क इतना है कि यह इंटर्न सॉफ़्टवेयर है और हफ़्तों की जगह मिनटों में काम कर देता है।
LinkedIn स्क्रैपिंग, LinkedIn को सामान्य तरीके से इस्तेमाल करने के बराबर नहीं है। प्रोफ़ाइल देखना, कनेक्शन रिक्वेस्ट भेजना या LinkedIn के अपने टूल से अपने कॉन्टैक्ट्स एक्सपोर्ट करना — ये सब प्लेटफ़ॉर्म के तय उपयोग के भीतर आते हैं। स्क्रैपिंग में उस पैमाने या गति पर ऑटोमेशन होता है जिसे LinkedIn अनुमति नहीं देता।
टीमें ऐसा क्यों करती हैं
आम उपयोग के मामले:
- सेल्स और लीड जनरेशन: नाम, पद, ईमेल और कंपनी डेटा के साथ संभावित ग्राहकों की सूची बनाना। B2B टीमें अक्सर सबसे पहले LinkedIn को देखती हैं क्योंकि यहाँ डेटा व्यवस्थित, खोजने योग्य और खुद प्रोफ़ेशनल्स द्वारा दिया गया होता है।
- रिक्रूटिंग: विशिष्ट स्किल्स, लोकेशन या अनुभव स्तर वाले उम्मीदवारों की प्रोफ़ाइल निकालना।
- मार्केट रिसर्च: LinkedIn डेटा को जोड़कर हायरिंग ट्रेंड, कंपनी ग्रोथ या प्रतिस्पर्धी स्थिति का विश्लेषण करना।
- प्रतिद्वंद्वी विश्लेषण: प्रतिस्पर्धी कंपनियों में हेडकाउंट बदलाव, नई भर्तियों या संगठनात्मक ढांचे पर नज़र रखना।
इसमें आकर्षण है ही। LinkedIn वही जगह है जहाँ प्रोफ़ेशनल्स अपनी करियर जानकारी संरचित और खोजने योग्य फ़ॉर्मेट में साझा करते हैं। कोई और सार्वजनिक स्रोत इसकी बराबरी नहीं करता।

त्वरित जवाब: क्या LinkedIn स्क्रैप करना कानूनी है?
संक्षेप में: यह इस पर निर्भर करता है कि आप क्या स्क्रैप करते हैं, कैसे स्क्रैप करते हैं, और आप तथा जिन लोगों का डेटा निकाल रहे हैं, वे कहाँ स्थित हैं।
- बिना लॉगिन किए वास्तव में सार्वजनिक LinkedIn डेटा स्क्रैप करना, अमेरिका में hiQ v. LinkedIn के बाद CFAA जोखिम को कम कर सकता है — लेकिन यह अभी भी LinkedIn की Terms of Service का उल्लंघन है।
- लॉगिन करके, फर्जी अकाउंट का उपयोग करके, या Sales Navigator जैसे पेड प्रोडक्ट्स से डेटा निकालना साफ़ तौर पर उच्च जोखिम वाला है।
- EU में, "यह सार्वजनिक डेटा है" कोई कानूनी बचाव नहीं है। आपको फिर भी GDPR के तहत वैध आधार चाहिए।
- LinkedIn कई स्तरों पर स्क्रैपर्स को पहचानता और उनके खिलाफ कार्रवाई करता है — खाते पर प्रतिबंध से लेकर सिविल मुकदमों और injunction तक।
काश जब मैंने पहली बार इस विषय पर रिसर्च शुरू की थी, तब यह तालिका मौजूद होती।
परिदृश्य-आधारित कानूनी मैट्रिक्स
| परिदृश्य | डेटा प्रकार | अमेरिका में कानूनी स्थिति | EU में कानूनी स्थिति | जोखिम स्तर |
|---|---|---|---|---|
| सार्वजनिक प्रोफ़ाइल स्क्रैप करना (बिना लॉगिन) | सार्वजनिक | CFAA जोखिम कम (hiQ precedent); ToS उल्लंघन | GDPR के तहत वैध आधार आवश्यक | ⚠️ मध्यम |
| लॉगिन करके स्क्रैप करना | निजी/सीमित | ToS उल्लंघन + संभावित CFAA जोखिम | GDPR उल्लंघन की संभावना | 🔴 उच्च |
| Sales Navigator डेटा स्क्रैप करना | निजी/पेड | ToS + अनुबंध उल्लंघन | GDPR उल्लंघन + अनुबंध उल्लंघन | 🔴 बहुत उच्च |
| जॉब पोस्टिंग स्क्रैप करना (सार्वजनिक) | सार्वजनिक | CFAA जोखिम कम | वैध आधार आवश्यक | ⚠️ कम–मध्यम |
| व्यावसायिक पुनर्विक्रय के लिए स्क्रैप करना | सार्वजनिक/निजी | मुकदमे का उच्च जोखिम (Mantheos precedent) | GDPR + ePrivacy जोखिम | 🔴 बहुत उच्च |
| व्यक्तिगत/शैक्षणिक प्रोजेक्ट के लिए स्क्रैप करना | सार्वजनिक | कम जोखिम | वैध आधार आवश्यक; प्रवर्तन प्राथमिकता कम | ✅ कम |
| LinkedIn की आधिकारिक API का उपयोग | अधिकृत | कानूनी (API शर्तों के भीतर) | कानूनी (API शर्तों के भीतर) | ✅ कम |
परिस्थितियों में जोखिम का अंतर किन वजहों से आता है? तीन चीज़ें: (1) क्या आप लॉगिन या एक्सेस कंट्रोल को बायपास कर रहे हैं, (2) क्या डेटा सचमुच सार्वजनिक है या अकाउंट के पीछे बंद है, और (3) आप उस डेटा का आगे क्या करते हैं (व्यक्तिगत रिसर्च बनाम व्यावसायिक पुनर्विक्रय)। ये हर कारक कानूनी जोखिम को अलग-अलग बढ़ाते हैं।
LinkedIn स्क्रैपिंग पर लागू होने वाले प्रमुख कानून
LinkedIn स्क्रैपिंग से जुड़े लगभग हर विवाद में तीन कानूनी ढांचे सामने आते हैं।
Computer Fraud and Abuse Act (CFAA)
स्क्रैपिंग से संबंधित मुख्य अमेरिकी संघीय कानून CFAA है। यह मूल रूप से 1986 में कंप्यूटर हैकिंग को रोकने के लिए बनाया गया था और यह "बिना अनुमति" या "अधिकृत सीमा से बाहर जाकर" कंप्यूटर एक्सेस करने पर रोक लगाता है।
स्क्रैपिंग से जुड़ा सवाल यह है: अगर कोई वेबसाइट कहे कि आप उसकी शर्तों के तहत नहीं देख सकते, तो क्या सार्वजनिक वेब पेज पर जाना भी "unauthorized access" माना जाएगा?
सुप्रीम कोर्ट के 2021 के Van Buren फैसले के बाद जवाब झुकाव के साथ "नहीं" की ओर जाता है — कम से कम उस डेटा के लिए जो वास्तव में सार्वजनिक है। Van Buren ने CFAA की सीमा सीमित कर दी: जिस जानकारी तक आपको सामान्यतः पहुँचने का अधिकार है, उसका दुरुपयोग करना अपने-आप संघीय कंप्यूटर अपराध नहीं बन जाता। लेकिन ऑथेंटिकेशन बैरियर के पीछे स्क्रैपिंग — जैसे लॉगिन करना, फर्जी अकाउंट का उपयोग करना, पेवॉल को पार करना — अभी भी असली CFAA जोखिम पैदा करती है, क्योंकि आप सिस्टम तक ऐसे तरीकों से पहुँच रहे होते हैं जिन्हें ऑपरेटर ने अनुमति नहीं दी।
GDPR और यूरोपीय डेटा संरक्षण कानून
EU का General Data Protection Regulation इस बात को नियंत्रित करता है कि EU/EEA निवासियों का व्यक्तिगत डेटा कैसे एकत्र, संसाधित और संग्रहित किया जाए — इससे फर्क नहीं पड़ता कि स्क्रैपर कहाँ आधारित है। अगर आप टेक्सास में बैठे-बैठे बर्लिन के लोगों की प्रोफ़ाइल स्क्रैप कर रहे हैं, तो GDPR आप पर लागू होगा।
LinkedIn स्क्रैपिंग में अहम लेख:
- Article 6(1)(f) — Legitimate interest: B2B स्क्रैपिंग के लिए सबसे आम तौर पर उद्धृत वैध आधार, लेकिन इसके लिए एक लिखित balancing test चाहिए जो साबित करे कि आपका हित डेटा विषय की गोपनीयता से ऊपर नहीं जाता।
- Article 17 — Right to erasure: व्यक्ति आपसे अपने स्क्रैप किए गए डेटा को हटाने की माँग कर सकते हैं।
- Article 9 — Special categories: अगर आपकी स्क्रैपिंग अनजाने में नस्लीय/जातीय मूल, राजनीतिक विचार, स्वास्थ्य आदि दिखाने वाला डेटा पकड़ लेती है (जो कभी-कभी LinkedIn प्रोफ़ाइल में होता है), तो सख्त नियम लागू होते हैं।
- Article 14 — Data subjects को जानकारी: आपको लोगों को यह बताना पड़ सकता है कि आपने उनका डेटा एकत्र किया है, भले ही वह सार्वजनिक ही क्यों न हो।
निष्कर्ष: GDPR के तहत "सार्वजनिक रूप से दिखाई देना" कोई वैध आधार नहीं है। स्क्रैपिंग शुरू करने से पहले आपको कानूनी आधार पहचानना और दस्तावेज़ित करना होगा।
LinkedIn की Terms of Service
LinkedIn का User Agreement स्पष्ट है। Section 8.2 निम्न कार्यों पर रोक लगाता है:
- ऐसे software, scripts, robots, crawlers, browser plug-ins, add-ons या अन्य प्रक्रियाएँ विकसित, समर्थन या उपयोग करना जो LinkedIn सेवाओं, प्रोफ़ाइलों और अन्य डेटा को scrape या copy करें
- security features, access controls या use limits को बायपास या circumvent करना
- सेवाओं तक पहुँचने, contacts जोड़ने/डाउनलोड करने या संदेश भेजने के लिए bots या अनधिकृत ऑटोमेशन का उपयोग करना
- LinkedIn से प्राप्त जानकारी को बिना सहमति copy, use, display या distribute करना
- LinkedIn सेवाओं या संबंधित डेटा को किराए पर देना, लीज़ पर देना, बेचना या किसी और तरीके से monetise करना
LinkedIn के automated activity और prohibited software पर सहायता पेज भी कहते हैं कि scraping या automation करने वाले third-party browser extensions साफ़ तौर पर प्रतिबंधित हैं, और उल्लंघन से खाते पर प्रतिबंध या कानूनी कार्रवाई हो सकती है।
ToS का उल्लंघन अनुबंध-उल्लंघन है — ज़रूरी नहीं कि आपराधिक अपराध हो। लेकिन इससे LinkedIn को सिविल प्रवर्तन के लिए मज़बूत आधार मिल जाता है, और जैसा हम देखेंगे, वे इसका काफ़ी आक्रामक इस्तेमाल करते हैं।
hiQ v. LinkedIn की टाइमलाइन: असल में क्या बदला?
अधिकांश लेख इस मुद्दे को गलत समझते हैं। वे hiQ v. LinkedIn को इस बात का प्रमाण बताते हैं कि "LinkedIn स्क्रैप करना कानूनी है।" असलियत कहीं अधिक जटिल है — यह मामला एक स्पष्ट precedent तय किए बिना ही समाप्त हो गया।
2017 के injunction से 2022 के settlement तक
असल टाइमलाइन यह है:
- 2017: LinkedIn, hiQ Labs (एक कंपनी जो सार्वजनिक LinkedIn प्रोफ़ाइल का विश्लेषण करके कर्मचारी के नौकरी छोड़ने की संभावना का अनुमान लगाती थी) को cease-and-desist letter भेजता है। hiQ मुकदमा दायर करता है। Northern District of California hiQ को सार्वजनिक प्रोफ़ाइल स्क्रैप करना जारी रखने की अनुमति देते हुए preliminary injunction जारी करता है।
- 2019: Ninth Circuit injunction को बरकरार रखता है और कहता है कि सार्वजनिक रूप से उपलब्ध डेटा स्क्रैप करना संभवतः CFAA का उल्लंघन नहीं करता।
- 2021: Supreme Court Ninth Circuit के फैसले को vacate कर देता है और Van Buren v. United States के प्रकाश में पुनर्विचार के लिए वापस भेजता है, जिसने CFAA की सीमा सीमित की थी।
- अप्रैल 2022: Ninth Circuit फिर से अपना रुख दोहराता है, और निष्कर्ष निकालता है कि Van Buren ने उसके पहले के तर्क को और मज़बूत किया — सार्वजनिक डेटा स्क्रैप करना CFAA के तहत "unauthorized access" नहीं है।
- नवंबर 2022: जिला अदालत स्तर पर LinkedIn के breach-of-contract दावे अभी भी जीवित रहते हैं। अदालत नोट करती है कि LinkedIn के User Agreement में स्क्रैपिंग स्पष्ट रूप से प्रतिबंधित थी। यह उन hiQ turkers के लिए भी LinkedIn के पक्ष में summary judgment देती है जिन्होंने लॉगिन के बाद QA के लिए फर्जी अकाउंट बनाए थे।
- दिसंबर 2022: पक्षों में निजी समझौता हो जाता है। कानूनी टिप्पणियों के अनुसार hiQ को LinkedIn scraping पर स्थायी निषेधाज्ञा और $500,000 का निर्णय स्वीकार करना पड़ा, और hiQ ने यह भी माना कि फर्जी अकाउंट एक्सेस के आधार पर CFAA सिविल दावा लाने के लिए LinkedIn को पर्याप्त नुकसान हुआ था।
निष्कर्ष: hiQ ने Ninth Circuit में वास्तव में सार्वजनिक, लॉग-आउट डेटा की स्क्रैपिंग के लिए CFAA जोखिम कम किया। लेकिन इससे LinkedIn स्क्रैप करने का कोई सार्वभौमिक अधिकार स्थापित नहीं हुआ। अनुबंध-आधारित दावे बने रहे। फर्जी अकाउंट एक्सेस पर दंड हुआ। और settlement के कारण core question पर Supreme Court का बाध्यकारी फैसला मौजूद नहीं है।
फोरम यूज़र्स इसे लगातार गलत बताते हैं — कुछ कहते हैं "LinkedIn जीत गया," कुछ कहते हैं "hiQ जीत गया।" किसी को भी स्पष्ट, अंतिम अदालत-निर्णय नहीं मिला। सवाल अभी भी आंशिक रूप से खुला है।
LinkedIn v. Mantheos मामला
Mantheos एक विपरीत उदाहरण है, जो दिखाता है कि साफ़ तौर पर अवैध स्क्रैपिंग कैसी दिखती है। कंपनी ने फर्जी अकाउंट और फर्जी क्रेडिट कार्ड का उपयोग करके LinkedIn के पेड Sales Navigator उत्पाद तक पहुँच बनाई, फिर डेटा को स्क्रैप करके व्यावसायिक रूप से पुनर्विक्रय किया।
परिणाम: LinkedIn के अनुसार Mantheos ने सहमति दी कि वह स्क्रैप किए गए member profile डेटा को स्थायी रूप से हटा देगा, स्क्रैपिंग सॉफ़्टवेयर नष्ट करेगा, और स्क्रैपिंग या अन्य ऑटोमेटेड तरीकों से LinkedIn member profile डेटा तक पहुँच बंद करेगा। इस मामले में फर्जी पहचान, फर्जी नामों पर वर्चुअल डेबिट कार्ड, पेड Sales Navigator एक्सेस और व्यावसायिक पुनर्वितरण शामिल थे — ऐसा संयोजन जिसे कोई जोखिम समीक्षा सार्वजनिक पेज देखने के बराबर नहीं मानेगी।
2024–2026 में क्या नया है
hiQ के निपट जाने के बाद भी कानूनी परिदृश्य स्थिर नहीं रहा। कुछ बदलाव महत्वपूर्ण हैं:
AI प्रशिक्षण का आयाम। स्क्रैप किए गए वेब डेटा पर प्रशिक्षित large language models के उभरने से गोपनीयता जाँच और तेज़ हो गई है। LinkedIn प्रोफ़ाइल डेटा के लिए व्यावहारिक नियम किसी भी व्यक्तिगत डेटा जैसे ही हैं: प्रसंस्करण से पहले वैध आधार दस्तावेज़ित करें, केवल उतना ही डेटा लें जितना ज़रूरी हो, और बड़े पैमाने पर profiling या automated decision-making होने पर अधिक कड़ी समीक्षा की अपेक्षा रखें।
LinkedIn की अपनी प्रतिक्रिया। LinkedIn ने सार्वजनिक रूप से कहा है कि भले ही स्क्रैप किया गया डेटा सार्वजनिक रूप से दिख रहा हो और उसे "breach" न कहा जाए, फिर भी वह aggregation और resale को दुरुपयोग मानता है। उसने यह भी कहा है कि वह कानूनी कार्रवाई और तकनीकी उपायों का उपयोग अनधिकृत स्क्रैपिंग से निपटने के लिए करता है।
अमेरिकी राज्य-स्तरीय गोपनीयता कानून। CFAA के अलावा, California (CCPA/CPRA), Virginia, Colorado, Connecticut और अन्य राज्यों ने व्यापक गोपनीयता कानून लागू किए हैं। CCPA कैलिफ़ोर्निया निवासियों को उनके व्यक्तिगत डेटा को जानने, हटाने, और बिक्री/शेयरिंग से opt out करने का अधिकार देता है — और इसमें LinkedIn प्रोफ़ाइल से स्क्रैप किया गया डेटा भी शामिल हो सकता है।
वैश्विक रुझान साफ़ है: अधिक विनियमन, अधिक प्रवर्तन, अधिक जोखिम।
अमेरिका बनाम EU बनाम बाकी दुनिया: आपके स्थान पर LinkedIn स्क्रैप करना कानूनी है?
ज़्यादातर LinkedIn स्क्रैपिंग गाइड्स की सबसे बड़ी चूक यह मान लेना है कि केवल अमेरिकी कानून ही मायने रखता है। ऐसा नहीं है। डेटा विषय कहाँ रहते हैं, यह तय करता है कि कौन-सा privacy regime लागू होगा — न कि आपका सर्वर कहाँ है।
| क्षेत्राधिकार | प्रमुख कानून | सार्वजनिक डेटा स्क्रैपिंग | PII हैंडलिंग | प्रवर्तन जोखिम |
|---|---|---|---|---|
| 🇺🇸 संयुक्त राज्य अमेरिका | CFAA, CCPA/CPRA, राज्य गोपनीयता कानून | सार्वजनिक डेटा के लिए CFAA जोखिम कम (hiQ); ToS फिर भी लागू | PII का व्यावसायिक उपयोग मुकदमे का जोखिम लाता है | मध्यम — LinkedIn सक्रिय रूप से मुकदमे करता है |
| 🇪🇺 EU / EEA | GDPR (Art. 6, Art. 9, Art. 17) | वैध आधार आवश्यक (legitimate interest balancing test) | Right to erasure लागू; संवेदनशील डेटा के लिए स्पष्ट सहमति बेहतर | उच्च — DPAs स्क्रैपिंग की सक्रिय जाँच कर रहे हैं |
| 🇬🇧 यूनाइटेड किंगडम | UK GDPR + Data Protection Act 2018 | EU जैसा; ICO guidance लागू | वही GDPR-जैसे दायित्व | मध्यम–उच्च |
| 🇦🇺 ऑस्ट्रेलिया | Privacy Act 1988, APPs | सार्वजनिक डेटा के लिए कम प्रतिबंधित | PII का व्यावसायिक हैंडलिंग विनियमित | कम–मध्यम |
| 🇧🇷 ब्राज़ील | LGPD | वैध आधार आवश्यक | GDPR ढांचे जैसा | मध्यम |
संयुक्त राज्य अमेरिका: CFAA और राज्य गोपनीयता कानून
hiQ और Van Buren के बाद अमेरिकी स्थिति यह है: वास्तव में सार्वजनिक, लॉग-आउट LinkedIn डेटा स्क्रैप करना संभवतः Ninth Circuit में CFAA का उल्लंघन नहीं करता। लेकिन "संभवतः एक संघीय कानून का उल्लंघन नहीं करता" का मतलब "कानूनी और सुरक्षित" होने से बहुत दूर है। LinkedIn की ToS फिर भी लागू होती है। CCPA/CPRA जैसे राज्य गोपनीयता कानून तब अतिरिक्त दायित्व लाते हैं जब आप कैलिफ़ोर्निया निवासियों का डेटा व्यावसायिक रूप से संभालते हैं। और LinkedIn कैलिफ़ोर्निया में मुख्यालय रखता है और मुकदमेबाज़ी में आक्रामक रुख दिखा चुका है।
EU और EEA: GDPR की सख्त आवश्यकताएँ
स्क्रैपर्स के लिए असली मुश्किल GDPR में आती है। B2B स्क्रैपिंग के लिए सबसे आम तौर पर उद्धृत वैध आधार legitimate interest है, Article 6(1)(f) के तहत, लेकिन इसके लिए एक दस्तावेज़ित Legitimate Interest Assessment (LIA) चाहिए जो दिखाए कि आपका हित डेटा विषय के अधिकारों से ऊपर नहीं जाता। ICO की गाइडेंस साफ़ करती है कि वैध आधार को प्रसंस्करण शुरू होने से पहले तय और दस्तावेज़ित करना होगा, प्रसंस्करण ज़रूरी होना चाहिए (सिर्फ सुविधाजनक नहीं), और आपको reasonable expectations, impact, तथा अनुरोध पर प्रसंस्करण रोकने की क्षमता पर विचार करना होगा।
Right to erasure (Article 17), Article 14 के तहत नोटिस देने की बाध्यता, और AI प्रशिक्षण के लिए स्क्रैपिंग पर DPAs का बढ़ता फ़ोकस — ये सब EU-लक्षित LinkedIn स्क्रैपिंग के लिए compliance बोझ को काफ़ी बढ़ा देते हैं।
UK, ऑस्ट्रेलिया, ब्राज़ील और आगे
UK, UK GDPR और Data Protection Act 2018 के ज़रिए GDPR-जैसा ढांचा अपनाता है। ऑस्ट्रेलिया का Privacy Act 1988 सार्वजनिक डेटा के लिए कम सख्त है, लेकिन फिर भी व्यक्तिगत जानकारी के व्यावसायिक उपयोग को विनियमित करता है। ब्राज़ील का LGPD कई मायनों में GDPR से मिलता-जुलता है।
वैश्विक दिशा अधिक कड़े डेटा संरक्षण की ओर है। अगर आप कई देशों के लोगों की LinkedIn प्रोफ़ाइल स्क्रैप कर रहे हैं, तो संभव है कि आप एक साथ कई व्यवस्थाओं के अधीन हों।
LinkedIn स्क्रैपिंग रोकने के लिए वास्तव में क्या करता है
कानूनी सिद्धांत एक बात है। LinkedIn व्यवहार में क्या करता है, यह दूसरी।
तकनीकी सुरक्षा उपाय
LinkedIn की detection प्रणाली बहु-स्तरीय है:
- Rate limiting और search caps: फ्री अकाउंट्स को रोज़ लगभग 50–80 प्रोफ़ाइल व्यूज़ तक सीमित किया जाता है। इससे ज़्यादा करने पर रुकावटें आती हैं।
- CAPTCHA चुनौतियाँ: ऑटोमेटेड ब्राउज़िंग पैटर्न CAPTCHA ट्रिगर करते हैं और scraping workflow तोड़ देते हैं।
- Bot detection algorithms: LinkedIn माउस मूवमेंट, स्क्रॉल पैटर्न, request timing और browser fingerprint का विश्लेषण करके गैर-मानवीय गतिविधि पहचानता है।
- Login walls: LinkedIn का बहुत-सा डेटा केवल authenticated users को दिखता है, यानी उसे स्क्रैप करने के लिए लॉगिन करना पड़ता है (और ToS स्वीकार करनी पड़ती है)।
- IP blocking और session monitoring: एक ही IP से बार-बार request या असामान्य session patterns blocks तक ले जाते हैं।
कानूनी प्रवर्तन कार्रवाइयाँ
LinkedIn सिर्फ तकनीकी उपायों पर निर्भर नहीं करता। उसकी legal team ने Proxycurl, Apollo और Seamless.AI जैसी कंपनियों को cease-and-desist letters भेजे हैं। Proxycurl के संस्थापक ने इस अनुभव को सार्वजनिक रूप से साझा किया है, यह बताते हुए कि LinkedIn के पास कानूनी लड़ाइयों के लिए "असीमित पैसा" है — कोई भी स्टार्टअप जो स्क्रैप किए गए LinkedIn डेटा पर व्यवसाय बनाने की सोच रहा हो, उसके लिए यह चेतावनी काफी है।
LinkedIn ने सिविल मुकदमे भी दायर किए हैं (hiQ, Mantheos और अन्य), अपने इकोसिस्टम से टूल्स को हटाने की कोशिश की है, और सार्वजनिक रूप से कहा है कि वह स्क्रैपर्स के खिलाफ कानूनी कार्रवाई जारी रखेगा।
Consequence Ladder: पकड़े जाने पर क्या होता है
परिणाम धीरे-धीरे गंभीर होते जाते हैं। इस सीढ़ी को समझने से आप जोखिम का बेहतर आकलन कर सकते हैं।
स्तर 1: नरम पहचान
CAPTCHA, rate limiting, अस्थायी search restrictions। ये सभी automated responses हैं — अभी LinkedIn में किसी इंसान ने आपका अकाउंट रिव्यू नहीं किया। रिकवरी आसान है: ऑटोमेटेड गतिविधि बंद करें, कुछ समय रुकें, फिर सामान्य उपयोग शुरू करें।
स्तर 2: अकाउंट प्रतिबंध
सीमित profile views, restricted search functionality। LinkedIn अकाउंट को समीक्षा के लिए चिह्नित कर सकता है। आपको चेतावनी संदेश दिख सकता है। अगर आप स्क्रैपिंग बंद कर दें और offending tool निष्क्रिय कर दें, तो रिकवरी संभव है।
स्तर 3: अकाउंट निलंबन या स्थायी प्रतिबंध
अकाउंट का स्थायी नुकसान मतलब आपकी सारी connections, पोस्ट की गई सामग्री, recommendations और message history सब चली जाएँगी। सब कुछ। मैंने recruiter फोरम पोस्ट्स देखी हैं जहाँ लोग एक रात में 5,000+ connections खोने की बात करते हैं — सिर्फ़ एक browser extension की वजह से वर्षों की पेशेवर नेटवर्किंग समाप्त हो जाती है।
LinkedIn शायद ही कभी स्थायी प्रतिबंध वापस लेता है। और अगर प्रतिबंध के बाद आप नया अकाउंट बनाते हैं, तो वह भी तर्कसंगत रूप से ToS उल्लंघन हो सकता है।
स्तर 4: Cease-and-Desist Letter
LinkedIn की legal team एक औपचारिक नोटिस भेजती है जिसमें स्क्रैपिंग रोकने और एकत्र किए गए डेटा को नष्ट करने की माँग होती है। यह बड़ी कंपनियों और अकेले founders — दोनों के साथ हुआ है। C&D letter को नज़रअंदाज़ करने पर आम तौर पर मामला मुकदमे तक बढ़ जाता है।
स्तर 5: सिविल मुकदमा
LinkedIn breach-of-contract दावे, CFAA दावे (यदि login bypass या fake accounts शामिल हों), और संभवतः unfair competition या trespass जैसे सिद्धांत उठाता है। Mantheos मामला delisting, data destruction और settlement costs पर समाप्त हुआ। केवल legal defense ही, अगर आप अंततः जीत भी जाएँ, छह अंकों तक खर्च करवा सकता है।
स्तर 6: नियामक जुर्माना
EU-फेसिंग ऑपरेशंस के लिए GDPR fines वैश्विक वार्षिक राजस्व के 4% या €20 मिलियन, जो भी अधिक हो, तक पहुँच सकते हैं। एक ही data subject की शिकायत से DPA जाँच शुरू हो सकती है, खासकर अगर उसकी प्रोफ़ाइल स्क्रैप की गई हो। AI प्रशिक्षण के लिए स्क्रैपिंग पर DPAs के बढ़ते फ़ोकस के साथ यह जोखिम कम नहीं, बल्कि बढ़ रहा है।
एक बात साफ़ कहनी चाहिए: पकड़े न जाना कोई compliance strategy नहीं है। Proxy, CAPTCHA-solving services या rate-limit evasion तकनीकों का उपयोग कानूनी विश्लेषण नहीं बदलता — यह बस तकनीकी परिणामों को टालता है, और कभी-कभी कानूनी स्थिति को और मज़बूत कर देता है (क्योंकि यह नियंत्रणों को बायपास करने के इरादे को दिखाता है)।
अगर फिर भी LinkedIn डेटा इकट्ठा करना हो, तो बेहतर अभ्यास
अगर आपके use case के लिए सचमुच LinkedIn डेटा चाहिए और आपने आगे बढ़ने का निर्णय लिया है, तो ये सिद्धांत जोखिम कम करते हैं। ये उसे खत्म नहीं करते।
केवल सार्वजनिक डेटा तक सीमित रहें
सिर्फ वही डेटा एक्सेस करें जो बिना लॉगिन के दिखाई देता हो। फर्जी अकाउंट, साझा credentials या पेवॉल बायपास का उपयोग कभी न करें। जैसे ही आप लॉगिन करते हैं, आपने LinkedIn की ToS स्वीकार कर ली होती है और आप उसके पूरे enforcement ढाँचे के अधीन आ जाते हैं।
Rate limits और robots.txt का सम्मान करें
LinkedIn के सर्वर पर बोझ न डालें। request frequency कम रखें और मानवीय व्यवहार जैसा बनाएँ। LinkedIn के robots.txt निर्देश देखें और उनका पालन करें। अदालतों ने robots.txt के पालन या उल्लंघन को good faith या bad faith के सबूत के रूप में देखा है।
GDPR दायित्वों को समझें
अगर आप EU निवासियों का डेटा संभालते हैं:
- संग्रह शुरू करने से पहले अपना वैध आधार दस्तावेज़ित करें
- यदि Article 6(1)(f) पर निर्भर हैं, तो Legitimate Interest Assessment करें
- अपने बताए गए उद्देश्य के लिए जितना ज़रूरी हो, उतने ही फ़ील्ड एकत्र करें
- right-to-erasure और right-to-object अनुरोधों का शीघ्र पालन करें
- ज़रूरत हो तो Article 14 का नोटिस दें
- processing activities के रिकॉर्ड बनाए रखें
जहाँ संभव हो, LinkedIn की आधिकारिक API का उपयोग करें
LinkedIn की Marketing API और People API कुछ डेटा तक अधिकृत पहुँच देती हैं। API उपयोग से ToS उल्लंघन का जोखिम समाप्त हो जाता है। ट्रेड-ऑफ यह है कि पहुँच सीमित होती है, approval चाहिए, rate limits होते हैं, और वेबसाइट पर दिखाई देने वाले डेटा फ़ील्ड्स की तुलना में उपलब्ध फ़ील्ड कम होते हैं। बहुत-से lead-generation use cases में API वह सब नहीं देती जिसकी टीम को ज़रूरत होती है — लेकिन फिर भी देखना चाहिए कि क्या यह आपके काम की चीज़ कवर करती है।
ज़रूरी बिज़नेस डेटा पाने के सुरक्षित विकल्प
ज़्यादातर LinkedIn स्क्रैपिंग गाइड्स यह बात छोड़ देते हैं: अधिकांश टीमों को खास तौर पर LinkedIn डेटा की ज़रूरत नहीं होती। उन्हें बिज़नेस संपर्क जानकारी, कंपनी विवरण या lead lists चाहिए। LinkedIn उस डेटा के लिए एक स्रोत है, लेकिन कानूनी जोखिम के लिहाज़ से सबसे जोखिमभरा स्रोत भी वही है। अन्य स्रोत समान या बेहतर डेटा बहुत कम जोखिम के साथ दे सकते हैं।
| विकल्प | क्या मिलता है | कानूनी जोखिम | सीमाएँ |
|---|---|---|---|
| LinkedIn API (Marketing/Sales) | अधिकृत डेटा, सीमित फ़ील्ड | ✅ कम (यदि compliant हों) | approval कठिन, rate-limited, महँगा |
| कंपनी वेबसाइट स्क्रैपिंग | कॉन्टैक्ट जानकारी, टीम पेज, उत्पाद डेटा | ✅ कम (सार्वजनिक वेबसाइटें) | डेटा अलग-अलग साइटों में बिखरा हो सकता है |
| बिज़नेस डायरेक्टरी / सार्वजनिक लिस्टिंग | फोन, ईमेल, पते | ✅ कम | डेटा की ताज़गी अलग-अलग |
| Data enrichment APIs (Clearbit, ZoomInfo आदि) | firmographic + contact data | ✅ कम (जिम्मेदारी provider पर जाती है) | पेड; डेटा-सोर्सिंग की नैतिकता अलग हो सकती है |
कंपनी वेबसाइटों से सीधे डेटा स्क्रैप करना
सार्वजनिक कंपनी वेबसाइटें — contact pages, team pages, about pages, press releases — आम तौर पर खुली होती हैं और LinkedIn की तुलना में काफ़ी कम कानूनी जोखिम रखती हैं। यहाँ डेटा अक्सर LinkedIn प्रोफ़ाइलों से अधिक समृद्ध और अधिक अद्यतन होता है, क्योंकि कंपनियाँ अपनी साइट खुद अपडेट करती हैं।
यहीं Thunderbit काम आता है। हमारा AI web scraper सार्वजनिक वेबसाइटों से emails, phone numbers और structured company data निकाल सकता है, जहाँ आपके use case की अनुमति साइट की शर्तें और लागू कानून देते हों। AI Suggest Fields फीचर पेज को पढ़कर अपने-आप columns सुझा देता है, इसलिए आपको कुछ भी मैन्युअल रूप से सेट नहीं करना पड़ता। Subpage scraping से आप हर team member या product page तक जाकर रिकॉर्ड enrich कर सकते हैं, और pagination handling से multi-page directories भी scripts लिखे बिना scrape किए जा सकते हैं।
बिज़नेस डायरेक्टरी और सार्वजनिक लिस्टिंग
Yellow Pages, industry directories, chamber-of-commerce listings, government registries, event attendee lists — ये सभी सार्वजनिक रूप से उपलब्ध हैं, और LinkedIn की तुलना में कम जोखिम वाले हैं। Thunderbit का cloud scraping इन स्रोतों से high-volume extraction संभालता है, और developer workflows के लिए API (POST /extract) और CLI संरचित JSON output के साथ बड़े पैमाने पर extraction को automate कर सकते हैं।
Data enrichment सेवाएँ
Clearbit और ZoomInfo जैसी सेवाएँ अपने (दावा किए गए रूप से compliant) data sourcing के माध्यम से firmographic और contact data देती हैं। कानूनी जोखिम provider की ओर शिफ्ट हो जाता है, हालांकि data sourcing की नैतिकता और सटीकता अलग-अलग हो सकती है। ये पेड सेवाएँ हैं, लेकिन जिन टीमों को बड़े पैमाने पर भरोसेमंद डेटा चाहिए, उनके लिए ये LinkedIn scraping के कानूनी जोखिम से अक्सर अधिक किफायती साबित होती हैं।
व्यावहारिक workflow
जिन टीमों का असली लक्ष्य lead list बनाना या CRM records enrich करना है, उनके लिए workflow कुछ ऐसा दिखता है:
- सार्वजनिक डायरेक्टरी, उद्योग सूचियों या event pages से target companies पहचानें।
- Thunderbit की Chrome extension का उपयोग करके कंपनी वेबसाइटों से contact info, team details और product data scrape करें।
- AI Suggest Fields से Thunderbit को सही columns अपने-आप पहचानने दें (name, title, email, phone आदि)।
- सीधे export करें Google Sheets, Airtable, Notion या अपने CRM में — basic exports के लिए कोई paywall नहीं।
- अगर आपको अतिरिक्त firmographic या intent data चाहिए, तो data provider से enrichment करें।
इस तरीके से आपको LinkedIn को छुए बिना समान बिज़नेस डेटा मिल जाता है और कानूनी जोखिम भी कम रहता है — बशर्ते आप हर source की terms, privacy obligations और downstream use की जाँच करते रहें।

AI-powered scraping अलग-अलग डेटा स्रोतों पर कैसे काम करता है, इस पर गहराई से जानने के लिए हमारे web scraping without coding और AI web scraping गाइड देखें।
मुख्य निष्कर्ष
- बिना लॉगिन किए सार्वजनिक LinkedIn डेटा स्क्रैप करना hiQ के बाद अमेरिका में CFAA जोखिम कम कर सकता है, लेकिन फिर भी LinkedIn की Terms of Service का उल्लंघन है और मुकदमे का जोखिम बना रहता है।
- EU में, "यह सार्वजनिक है" कोई कानूनी बचाव नहीं है। लगभग हर LinkedIn स्क्रैपिंग के लिए दस्तावेज़ित GDPR वैध आधार चाहिए, और प्रवर्तन बढ़ रहा है।
- लॉगिन के पीछे, फर्जी अकाउंट के साथ, या paywalled डेटा को पुनर्विक्रय करना साफ़ तौर पर उच्च जोखिम वाला है और कई ढाँचों के तहत अवैध हो सकता है।
- LinkedIn स्क्रैपर्स का सक्रिय रूप से पता लगाता है और कार्रवाई करता है — अकाउंट प्रतिबंध से लेकर मुकदमों, injunction और डेटा हटाने की बाध्यता तक।
- hiQ मामले ने LinkedIn स्क्रैपिंग को वैध नहीं बनाया। इसने एक सर्किट में सार्वजनिक डेटा के लिए CFAA जोखिम कम किया, लेकिन अनुबंध-आधारित दावे बने रहे और मामला बाध्यकारी precedent के बिना settlement पर समाप्त हुआ।
- कम जोखिम वाला रास्ता बिज़नेस टीमों के लिए यह है कि समान डेटा compliant विकल्पों से लिया जाए — जैसे सार्वजनिक कंपनी वेबसाइटें और डायरेक्टरी, Thunderbit जैसे टूल, जहाँ फिट हो वहाँ LinkedIn की आधिकारिक API, या स्पष्ट compliance practices वाले providers से लाइसेंस किया हुआ डेटा।
- LinkedIn को स्क्रैप करने से पहले पूछें: "क्या यह डेटा मुझे ऐसे स्रोत से मिल सकता है जिसका कानूनी और प्लेटफ़ॉर्म जोखिम कम हो?" कई मामलों में जवाब हाँ होता है।
FAQs
क्या सार्वजनिक LinkedIn प्रोफ़ाइल स्क्रैप करना कानूनी है?
अमेरिका में, बिना लॉगिन किए सार्वजनिक रूप से दिखने वाली LinkedIn प्रोफ़ाइल स्क्रैप करना Ninth Circuit में hiQ precedent के आधार पर CFAA जोखिम को कम कर सकता है, लेकिन यह फिर भी LinkedIn की Terms of Service का उल्लंघन है, जिससे breach-of-contract का जोखिम बनता है। EU में, सार्वजनिक डेटा के लिए भी GDPR का वैध आधार ज़रूरी है — "publicly visible" का मतलब "freely usable" नहीं होता।
क्या LinkedIn स्क्रैपिंग के लिए मेरा अकाउंट बैन कर सकता है?
हाँ। LinkedIn rate limiting, bot detection algorithms और browser fingerprinting के ज़रिए ऑटोमेटेड गतिविधि पहचानता है। परिणाम अस्थायी प्रतिबंध से लेकर स्थायी अकाउंट बैन तक हो सकते हैं, और रिकवरी की कोई गारंटी नहीं होती। उपयोगकर्ताओं ने वर्षों के connections और content को रातोंरात खोने की घटनाएँ बताई हैं।
क्या LinkedIn Sales Navigator को स्क्रैप करना कानूनी है?
Sales Navigator डेटा स्क्रैप करना बहुत उच्च जोखिम वाला है। इसमें ToS उल्लंघन के साथ-साथ Sales Navigator subscription contract के संभावित breach का मुद्दा भी शामिल है, क्योंकि डेटा पेड एक्सेस wall के पीछे है। Mantheos मामला — जिसमें Sales Navigator तक पहुँच के लिए फर्जी अकाउंट और फर्जी क्रेडिट कार्ड का उपयोग हुआ था — LinkedIn के पक्ष में स्थायी injunction और settlement के साथ समाप्त हुआ।
क्या EU निवासियों की LinkedIn प्रोफ़ाइल स्क्रैपिंग पर GDPR लागू होता है?
हाँ, इससे फर्क नहीं पड़ता कि स्क्रैपर कहाँ स्थित है। EU/EEA निवासियों के व्यक्तिगत डेटा के किसी भी प्रसंस्करण को GDPR का पालन करना होगा, जिसमें दस्तावेज़ित वैध आधार (जैसे balancing test के साथ legitimate interest), right-to-erasure अनुरोधों का सम्मान, और Article 14 के तहत सूचना देना शामिल है।
LinkedIn को स्क्रैप किए बिना बिज़नेस कॉन्टैक्ट डेटा पाने के सुरक्षित तरीके क्या हैं?
मुख्य विकल्प हैं: (1) सार्वजनिक कंपनी वेबसाइटों से contact info, team pages और product data स्क्रैप करना (इस काम को Thunderbit जैसे टूल आसान बनाते हैं); (2) बिज़नेस डायरेक्टरी और सार्वजनिक लिस्टिंग का उपयोग; (3) जहाँ आपका use case योग्य हो, LinkedIn की आधिकारिक API का इस्तेमाल; और (4) Clearbit या ZoomInfo जैसे enrichment providers से डेटा लाइसेंस करना। ये रास्ते लगभग वही बिज़नेस डेटा काफी कम कानूनी जोखिम के साथ देते हैं।
और जानें


