मैं SuperPages से लीड्स कैसे स्क्रैप करता हूँ (3 तरीके, स्टेप बाय स्टेप)

अंतिम अपडेट: May 26, 2026
मैं SuperPages से लीड्स कैसे स्क्रैप करता हूँ (3 तरीके, स्टेप बाय स्टेप)
AI सारांश
Automate your lead generation from SuperPages by comparing three methods: AI no-code tools, visual scrapers, and Python scripts. Get tips for 2026.

पिछले हफ्ते, हमारे एक यूज़र ने बताया कि उसने SuperPages से प्लंबर लिस्टिंग्स को स्प्रेडशीट में कॉपी करने में पूरा एक दोपहर लगा दिया — तीन घंटे में सिर्फ़ 47 पंक्तियाँ। कलाई दर्द करने लगी, डेटा में टाइपिंग गलतियाँ थीं, और फिर भी ईमेल्स नहीं मिले। यह कहानी मुझे इसलिए भी अपनी लगी क्योंकि मैं भी ऐसा कर चुका हूँ — और इसी समस्या को हल करने के लिए हमने Thunderbit बनाया था।

SuperPages अमेरिका की पुरानी और भरोसेमंद लोकल बिज़नेस डायरेक्टरीज़ में से एक है, जिसे Thryv ऑपरेट करता है। इसमें बड़े शहरों और कई कैटेगरीज़ की अच्छी कवरेज मिलती है — प्लंबर, डेंटिस्ट, वकील, HVAC टेक्नीशियन, जो चाहें। पुराने तकनीकी दस्तावेज़ इसे 11 मिलियन से ज़्यादा लिस्टिंग्स वाले राष्ट्रीय येलो-पेजेज़ डेटाबेस के रूप में बताते थे, और आज भी साइट पर घनी लोकल कैटेगरीज़ मिलती हैं। असली चुनौती लिस्टिंग्स ढूँढना नहीं है। चुनौती है उन्हें साफ़, समृद्ध और काम की लीड लिस्ट में बदलना — बिना दिमाग़ खराब किए (या पूरा दोपहर गंवाए)।

HubSpot की 2024 Sales Trends रिपोर्ट के मुताबिक, सेल्स रिप्रेज़ेंटेटिव्स दिन में सिर्फ़ लगभग 2 घंटे ही असल में बेचने में लगाते हैं — बाकी समय डेटा एंट्री और रिसर्च जैसे कामों में चला जाता है। और 81% सेल्स प्रोफेशनल्स मानते हैं कि AI उन्हें मैनुअल काम कम करने में मदद कर सकता है। यह गाइड आपको SuperPages से लीड्स स्क्रैप करने के तीन तरीके दिखाती है — ज़ीरो-कोड AI से लेकर Python तक — ताकि आप अपनी स्किल के हिसाब से सही तरीका चुन सकें और फिर से उन कामों पर लौट सकें जो सच में परिणाम लाते हैं।

AI से SuperPages लीड्स स्क्रैप करें Get Started Free

SuperPages क्या है (और सेल्स टीमें इसे लीड्स के लिए क्यों पसंद करती हैं)

SuperPages अमेरिका-केंद्रित एक ऑनलाइन बिज़नेस डायरेक्टरी है, जहाँ लोकल बिज़नेस अपने कॉन्टैक्ट डिटेल्स, कैटेगरी, रेटिंग्स और अन्य जानकारी के साथ सूचीबद्ध होते हैं। इसे पुराने येलो पेजेज़ फ़ोन बुक के डिजिटल रूप की तरह समझें — फर्क बस इतना है कि अब इसे कैटेगरी और लोकेशन के हिसाब से खोजा जा सकता है, और हर लिस्टिंग में डेटा भी ज़्यादा मिलता है।

superpages-directory-services.webp

एक सामान्य SuperPages लिस्टिंग में यह जानकारी हो सकती है:

  • बिज़नेस का नाम
  • फ़ोन नंबर
  • सड़क का पता
  • वेबसाइट URL (अगर उपलब्ध हो)
  • कैटेगरी (जैसे Plumbing, Family Law, HVAC)
  • रेटिंग और रिव्यूज़
  • काम करने का समय (आमतौर पर डिटेल पेज पर)
  • विवरण (डिटेल पेज)

SuperPages के होमपेज पर Home Services, Plumbers, Electricians, Dentists, Legal Services, Auto Repair, Restaurants, और Pet Services जैसी लोकप्रिय कैटेगरीज़ दिखाई जाती हैं — और यही वे सेक्टर हैं जिन्हें सेल्स टीमें, एजेंसियाँ, और लोकल सर्विस विक्रेता आउटबाउंड आउटरीच के लिए टार्गेट करते हैं।

संक्षेप में, अमेरिका में लोकल बिज़नेस प्रोस्पेक्टिंग करने वाले किसी भी व्यक्ति के लिए SuperPages एक बढ़िया स्रोत है। डेटा संरचित है, कवरेज व्यापक है, और कैटेगरीज़ सीधे-सीधे वास्तविक आउटबाउंड कैंपेन से मेल खाती हैं।

SuperPages लीड्स के लिए Thunderbit आज़माएँ

SuperPages को लीड्स के लिए क्यों स्क्रैप करें? (मुख्य उपयोग)

SuperPages को मैन्युअली खोलकर डेटा को स्प्रेडशीट में कॉपी करना एक प्रोडक्टिविटी ब्लैक होल है। स्क्रैपिंग इस काम को ऑटोमेट कर देती है, और आपको घंटों की जगह कुछ ही मिनटों में एक टार्गेटेड, स्ट्रक्चर्ड लिस्ट मिल जाती है। और क्योंकि आप सर्च को खुद नियंत्रित करते हैं (कैटेगरी + शहर + कीवर्ड), आउटपुट अक्सर एक सामान्य खरीदी हुई लीड लिस्ट से ज़्यादा प्रासंगिक होता है।

हमारे यूज़र्स में मुझे सबसे आम ये उपयोग मिलते हैं:

उपयोगकिसे फायदाउदाहरण
लोकल लीड जनरेशनसेल्स टीमें, एजेंसियाँडलास में प्लंबर की सूची बनाकर कोल्ड आउटरीच करना
प्रतियोगी रिसर्चऑपरेशंस, मार्केटिंगकिसी मार्केट में प्रतिस्पर्धियों की रेटिंग और सेवाओं की तुलना करना
मार्केट मैपिंगबिज़नेस डेवलपमेंटनए प्रोडक्ट लॉन्च के लिए किसी ZIP कोड में सभी डेंटिस्ट पहचानना
वेंडर सोर्सिंगप्रोक्योरमेंट, ऑपरेशंसकिसी क्षेत्र में फ़ोन + वेबसाइट जानकारी वाले सप्लायर्स ढूँढना
लोकल SEO प्रोस्पेक्टिंगएजेंसियाँबिना वेबसाइट या कमज़ोर लिस्टिंग डेटा वाले बिज़नेस ढूँढना
टेरिटरी प्लानिंगफ़ील्ड सेल्सशहर, ZIP कोड, या सर्विस एरिया के हिसाब से कॉन्ट्रैक्टर्स को समूहित करना

अमेरिका का B2B लीड जनरेशन मार्केट 2024 में 8.5 बिलियन डॉलर आँका गया था, और 2034 तक 18.2 बिलियन डॉलर तक पहुँचने का अनुमान है — यानी इस तरह के डेटा की मांग कम होने वाली नहीं है। ताज़ा स्क्रैप की गई, कैटेगरी और लोकेशन-विशिष्ट लिस्ट एक सामान्य खरीदी हुई लिस्ट से ज़्यादा टार्गेटेड हो सकती है, लेकिन आउटरीच से पहले इसे वेरिफाई और डेडुप्लिकेट करना ज़रूरी है (इस पर आगे बात करेंगे)।

अंतिम आउटपुट कैसा दिखता है: SuperPages से स्क्रैप किए गए डेटा का नमूना

कैसे करना है, उस पर जाने से पहले मैं आपको दिखाना चाहता हूँ कि अंत में आपको मिलता क्या है। ज़्यादातर गाइड्स यही हिस्सा छोड़ देती हैं — लेकिन अगर आप समय लगा रहे हैं, तो आपको पता होना चाहिए कि परिणाम कैसा दिखेगा।

यह एक नमूना आउटपुट टेबल है (काल्पनिक डेटा, लेकिन वास्तविक जैसा ढाँचा):

बिज़नेस नामफ़ोनपतावेबसाइटकैटेगरीरेटिंगसमयईमेल (समृद्ध)
Sunset Pipe & Drain Co.+1 213-555-01481842 W 7th St, Los Angeles, CA 90057sunsetpipe.examplePlumbing4.6Mon-Fri 7a-6pservice@sunsetpipe.example
Arroyo HVAC Pros+1 626-555-018272 N Fair Oaks Ave, Pasadena, CA 91103arroyohvac.exampleHVAC4.8Mon-Sat 8a-7phello@arroyohvac.example
Wilshire Family Dental+1 323-555-01194100 Wilshire Blvd, Los Angeles, CA 90010wilshiredental.exampleDentists4.4Mon-Thu 9a-5pappointments@wilshiredental.example
Pacific Legal Aid Group+1 310-555-017311845 W Olympic Blvd, Los Angeles, CA 90064Legal Services4.2Mon-Fri 8:30a-5:30pintake@pacificlegal.example
Valley Auto Repair Center+1 818-555-019814422 Ventura Blvd, Sherman Oaks, CA 91423valleyautorepair.exampleAuto Repair4.7Mon-Sat 8a-6pinfo@valleyautorepair.example
Echo Park Pet Grooming+1 213-555-01661511 Sunset Blvd, Los Angeles, CA 90026echoparkpets.examplePet Grooming4.9Tue-Sun 9a-5pbooking@echoparkpets.example

कुछ बातें ध्यान देने योग्य हैं:

  • सर्च रिज़ल्ट पेज से: बिज़नेस नाम, फ़ोन, आंशिक पता, कैटेगरी, रेटिंग, लिस्टिंग URL।
  • बिज़नेस डिटेल पेज (सबपेज) से: पूरा पता, काम करने का समय, विवरण, रिव्यूज़, कभी-कभी वेबसाइट।
  • एनरिचमेंट से: ईमेल (अक्सर सिर्फ़ बिज़नेस की अपनी वेबसाइट या एनरिचमेंट टूल्स से मिलता है)।
  • क्लीनिंग से: फ़ोन को E.164 फ़ॉर्मैट में, स्टैंडर्ड राज्य/ZIP, डेडुप कीज़, स्रोत URL और स्क्रैप की तारीख।

इस तरह का आउटपुट आप सीधे CRM, Google Sheet, या Airtable base में डालकर तुरंत काम शुरू कर सकते हैं।

SuperPages से लीड्स स्क्रैप करने के 3 तरीके: त्वरित तुलना

ai-no-code-visual-python-comparison.webp

हर किसी की तकनीकी सहजता — और धैर्य — एक जैसा नहीं होता। इसलिए यहाँ तीन तरीके साथ-साथ दिए गए हैं, ताकि आप अपनी ज़रूरत के हिसाब से चुन सकें:

मानदंडThunderbit (AI No-Code)Visual Scraper (जैसे Octoparse)Python (Requests + BS4)
सेटअप समय~2 मिनट (एक्सटेंशन इंस्टॉल)~15 मिनट (वर्कफ़्लो बनाना)~30 मिनट (लाइब्रेरी इंस्टॉल, कोड लिखना)
कोडिंग की ज़रूरतनहींनहींहाँ (Python)
पेजिनेशन हैंडलिंगबिल्ट-इन (क्लिक या स्क्रॉल)कॉन्फ़िगरेशन ज़रूरीमैन्युअल कोड
सबपेज एनरिचमेंट1-क्लिक Subpage Scrapingअलग वर्कफ़्लो/लूप चाहिएअलग स्क्रिप्ट
एंटी-ब्लॉकिंगCloud Scraping इसे संभालता हैप्लान/प्रॉक्सी ऐड-ऑन पर निर्भरखुद करना होगा (प्रॉक्सी, हेडर, रेट लिमिट)
एक्सपोर्ट विकल्पExcel, Google Sheets, Airtable, Notion, CSV, JSONCSV, Excel, डेटाबेसजैसा आप कोड करें
किसके लिए बेहतरसेल्स टीमें, एजेंसियाँ, नॉन-डेव्ससेमी-टेक्निकल यूज़र्सपूरा नियंत्रण चाहने वाले डेवलपर्स

मेरी सलाह: अगर आप अगले 2 मिनट में स्क्रैपिंग शुरू करना चाहते हैं, तो Method 1 पर जाएँ। अगर आपको विज़ुअल वर्कफ़्लो पसंद हैं और थोड़ा कॉन्फ़िगरेशन चल जाता है, तो Method 2 आज़माएँ। अगर आपको पूरा नियंत्रण चाहिए और Python आता है, तो Method 3 अपनाएँ।

Method 1: Thunderbit से SuperPages लीड्स स्क्रैप करें (AI, नो-कोड)

यह "मेरे पास SuperPages सर्च है" से "मेरे पास एक लीड लिस्ट है" तक पहुँचने का सबसे तेज़ तरीका है। न कोडिंग, न वर्कफ़्लो बिल्डर, न प्रॉक्सी कॉन्फ़िगरेशन। मैं थोड़ा पक्षपाती हूँ — क्योंकि हमने Thunderbit बनाया है — लेकिन मैं आपको बिल्कुल साफ़ दिखाऊँगा कि क्या होता है, ताकि आप खुद तय कर सकें।

कठिनाई: शुरुआती
समय: पूरी कैटेगरी/शहर स्क्रैपिंग के लिए लगभग 5 मिनट
आपको क्या चाहिए: Chrome ब्राउज़र, Thunderbit Chrome Extension (फ्री टियर काम करता है)

चरण 1: Thunderbit इंस्टॉल करें और SuperPages खोलें

Thunderbit Chrome Extension Download Page पर जाएँ और Thunderbit एक्सटेंशन इंस्टॉल करें। इसमें लगभग एक मिनट लगता है। इंस्टॉल होने के बाद, SuperPages के किसी सर्च रिज़ल्ट पेज पर जाएँ — उदाहरण के लिए superpages.com पर “Plumbers in Los Angeles, CA” खोजें।

आपको ब्राउज़र टूलबार में Thunderbit आइकन और एक साइडबार पैनल तैयार मिलेगा।

चरण 2: डेटा कॉलम अपने आप पहचानने के लिए "AI Suggest Fields" पर क्लिक करें

Thunderbit साइडबार खोलें और "AI Suggest Fields" पर क्लिक करें। Thunderbit का AI पेज को पढ़ता है और जो कुछ मिलता है उसके आधार पर खुद कॉलम सुझाता है — आम तौर पर बिज़नेस नाम, फ़ोन, पता, वेबसाइट, कैटेगरी, रेटिंग, और लिस्टिंग URL।

स्क्रैप करने से पहले आप कॉलम बदल, जोड़ या हटा सकते हैं। अगर आपको "Has Website?" या "Service Area?" जैसा कोई कस्टम कॉलम चाहिए, तो Field AI Prompt में साधारण अंग्रेज़ी में उसका विवरण लिख दीजिए। उदाहरण के लिए, आप कह सकते हैं कि फ़ोन को "+1XXXXXXXXXX" फ़ॉर्मैट में रखें या बिज़नेस को residential vs. commercial के रूप में वर्गीकृत करें।

अब आपको Thunderbit पैनल में अपने कॉन्फ़िगर किए हुए कॉलम्स के साथ एक टेबल प्रीव्यू दिखना चाहिए।

चरण 3: "Scrape" पर क्लिक करें और डेटा भरते देखें

नीले "Scrape" बटन पर क्लिक करें। Thunderbit मौजूदा पेज की सारी लिस्टिंग्स निकालकर आपकी टेबल में एक-एक करके भर देगा। SuperPages के एक सामान्य रिज़ल्ट पेज के लिए यह लगभग 30–45 सेकंड लेता है।

Thunderbit पेजिनेशन को अपने आप संभालता है — यह "Next" बटन या infinite scroll पहचानता है और तब तक चलता रहता है जब तक पेज खत्म न हो जाएँ या आपकी सीमा पूरी न हो जाए। अगर आप बड़े रिज़ल्ट सेट को स्क्रैप कर रहे हैं (जैसे किसी पूरे मेट्रो एरिया के सभी प्लंबर), तो Cloud Scraping मोड चालू करें, जो आपके ब्राउज़र को बाँधे बिना एक बार में 50 पेज तक प्रोसेस कर सकता है।

चरण 4: Subpage Scraping से हर लिस्टिंग को समृद्ध करें

business-profile-verification-process.webp

सर्च रिज़ल्ट पेज आपको बुनियादी जानकारी देता है, लेकिन असली काम की चीज़ें — समय, पूरा विवरण, रिव्यूज़, कभी-कभी ईमेल — हर बिज़नेस के डिटेल पेज पर मिलती हैं। "Scrape Subpages" पर क्लिक करें, और Thunderbit हर लिस्टिंग के डिटेल पेज पर जाकर hours, description, website URL, और वहाँ दिखने वाली कोई भी संपर्क जानकारी निकाल लेता है।

यह एक-क्लिक प्रक्रिया है। कोई अलग वर्कफ़्लो नहीं, कोई कॉन्फ़िगरेशन नहीं। समृद्ध डेटा सीधे आपकी मौजूदा टेबल में जुड़ जाता है।

चरण 5: अपनी लीड्स को Excel, Google Sheets, Airtable, या Notion में एक्सपोर्ट करें

जब डेटा सही लगे, तो Export पर क्लिक करें। Thunderbit आपको अपनी लीड्स सीधे यहाँ भेजने देता है:

  • Google Sheets (CRM तैयारी और शेयरिंग के लिए बढ़िया)
  • Airtable (हल्का-फुल्का पाइपलाइन टेबल)
  • Notion (रिसर्च डेटाबेस)
  • Excel / CSV (CRM इम्पोर्ट)
  • JSON (डेवलपर हैंडऑफ़)

cloud50-data-workflow.webp

सभी एक्सपोर्ट विकल्प मुफ़्त हैं। अगर आप लीड्स को HubSpot या Salesforce में डाल रहे हैं, तो CSV या Google Sheets में एक्सपोर्ट करना अक्सर सबसे तेज़ रास्ता होता है।

प्रो टिप: पूरे राज्य-भर की सर्च के बजाय कैटेगरी + शहर के हिसाब से स्क्रैप करें। “Emergency plumbers Dallas TX” आपको “plumbers Texas” से कहीं ज़्यादा सटीक और काम की लिस्ट देगा। ट्रेसबिलिटी के लिए एक “Source URL” और “Scraped At” कॉलम भी जोड़ें।

Method 2: Visual Scraping Tool से SuperPages स्क्रैप करें (Octoparse उदाहरण)

Octoparse जैसे visual scraping tools बीच का रास्ता देते हैं: कोडिंग नहीं, लेकिन Thunderbit से ज़्यादा सेटअप और कॉन्फ़िगरेशन। Octoparse में सरल उपयोग के मामलों के लिए पहले से तैयार SuperPages टेम्पलेट भी है।

कठिनाई: मध्यम
समय: सेटअप + स्क्रैप के लिए लगभग 20–30 मिनट
आपको क्या चाहिए: Octoparse अकाउंट (फ्री प्लान उपलब्ध, कुछ सीमाओं के साथ)

चरण 1: नया टास्क बनाएँ और SuperPages URL लोड करें

Octoparse खोलें, "New Task" पर क्लिक करें, और अपना SuperPages सर्च URL पेस्ट करें (जैसे "https://www.superpages.com/los-angeles-ca/plumbers"). बिल्ट-इन ब्राउज़र पेज को लोड कर देता है।

चरण 2: डेटा फ़ील्ड्स को Auto-detect करें या खुद चुनें

"Auto-detect" पर क्लिक करें — Octoparse पेज को स्कैन करता है और जिन फ़ील्ड्स को वह प्रासंगिक समझता है उन्हें हाईलाइट करता है। Data Preview पैनल देखें। मेरे अनुभव में auto-detection अक्सर ज़्यादातर फ़ील्ड्स पकड़ लेती है, लेकिन कभी-कभी अतिरिक्त चीज़ें (जैसे ad labels या navigation text) भी ले आती है या कुछ फ़ील्ड्स छूट जाते हैं। इसलिए आपको कुछ फ़ील्ड्स manually जोड़ने या हटाने पड़ सकते हैं।

Octoparse की मदद डॉक्यूमेंटेशन के अनुसार, auto-detection एक बेसिक workflow बनाती है जिसमें pagination और extract-data steps शामिल होते हैं, लेकिन users को missing data manually जोड़ना पड़ सकता है।

चरण 3: वर्कफ़्लो बनाएँ और पेजिनेशन सेट करें

"Create workflow" पर क्लिक करें। Octoparse step-by-step action sequence बनाता है। Pagination step की जाँच करें — सुनिश्चित करें कि यह सही तरीके से "Next" क्लिक करता है या और परिणाम लोड करता है। अगर आपको हर बिज़नेस के detail page से डेटा चाहिए (hours, email, description), तो आपको workflow के अंदर detail-page loop या subpage action जोड़ना होगा। Thunderbit के एक-क्लिक subpage approach की तुलना में यह ज़्यादा जटिल है।

चरण 4: टास्क चलाएँ और डेटा एक्सपोर्ट करें

टास्क को लोकली चलाएँ (छोटे कामों के लिए) या Octoparse के cloud पर चलाएँ (scheduled या बड़े jobs के लिए — cloud एक paid feature है)। जब काम पूरा हो जाए, CSV, Excel, या JSON में एक्सपोर्ट करें।

ध्यान देने योग्य सीमाएँ: Octoparse के फ्री प्लान में 10 tasks, प्रति माह 50,000 rows तक, और सिर्फ़ local extraction शामिल है। Cloud runs, IP rotation, CAPTCHA solving, और कुछ export integrations के लिए paid plan चाहिए (वार्षिक बिलिंग पर लगभग $69/माह से शुरू)।

Method 3: Python से SuperPages स्क्रैप करें (Requests + BeautifulSoup)

यह डेवलपर वाला रास्ता है। पूरा नियंत्रण, पूरी ज़िम्मेदारी। अगर आप Python स्क्रिप्ट्स लिखने और संभालने में सहज हैं, तो इससे आपको सबसे ज़्यादा flexibility मिलेगी — लेकिन सिरदर्द भी सबसे ज़्यादा होंगे।

कठिनाई: उन्नत
समय: लगभग 30–60 मिनट (सेटअप + कोडिंग + डिबगिंग)
आपको क्या चाहिए: Python 3.x, pip, requests, beautifulsoup4, lxml, एक code editor

चरण 1: अपना Python environment सेट करें

python -m venv .venv
source .venv/bin/activate
pip install requests beautifulsoup4 lxml pandas

चरण 2: SuperPages की HTML संरचना की जाँच करें

SuperPages रिज़ल्ट पेज पर Developer Tools (F12) खोलें। बिज़नेस नाम, पता, फ़ोन, वेबसाइट, और detail page लिंक के लिए CSS selectors पहचानें। ध्यान रखें: HTML संरचना बिना चेतावनी बदल सकती है, जिसका मतलब है कि आपके selectors कभी भी टूट सकते हैं।

चरण 3: लिस्टिंग्स स्क्रैपर लिखें और पेजिनेशन संभालें

यह एक सरल उदाहरण है। एक अहम चेतावनी: मेरे परीक्षण में SuperPages पर direct request करने पर Cloudflare का “Attention Required” block page मिला। एक साधारण Requests script बड़े पैमाने पर फेल हो सकती है — आपको browser-session context, rate limiting, retries, या अधिकृत विकल्पों की ज़रूरत पड़ सकती है।

import csv, time
from urllib.parse import urljoin
import requests
from bs4 import BeautifulSoup

BASE_URL = "https://www.superpages.com"
HEADERS = {
    "User-Agent": (
        "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
        "AppleWebKit/537.36 (KHTML, like Gecko) "
        "Chrome/125.0 Safari/537.36"
    )
}

def fetch(url):
    resp = requests.get(url, headers=HEADERS, timeout=20)
    resp.raise_for_status()
    if "Attention Required" in resp.text or "Cloudflare" in resp.text:
        raise RuntimeError("Blocked. Slow down or switch to browser/cloud scraping.")
    return BeautifulSoup(resp.text, "lxml")

def parse_listing(card):
    name_el = card.select_one(".business-name, a.business-name, h2 a, h3 a")
    phone_el = card.select_one(".phones, .phone, [class*=phone]")
    address_el = card.select_one(".street-address, .adr, [class*=address]")
    website_el = card.select_one("a.track-visit-website, a[href*='http']")
    rating_el = card.select_one(".rating, [class*=rating]")
    detail_url = urljoin(BASE_URL, name_el.get("href")) if name_el and name_el.get("href") else ""
    return {
        "business_name": name_el.get_text(" ", strip=True) if name_el else "",
        "phone": phone_el.get_text(" ", strip=True) if phone_el else "",
        "address": address_el.get_text(" ", strip=True) if address_el else "",
        "website": website_el.get("href", "") if website_el else "",
        "rating": rating_el.get_text(" ", strip=True) if rating_el else "",
        "detail_url": detail_url,
    }

def scrape_search(search_url, pages=3):
    all_rows = []
    for page in range(1, pages + 1):
        page_url = f"{search_url}?page={page}"
        soup = fetch(page_url)
        cards = soup.select(".result, .organic, [class*=result]")
        if not cards:
            break
        for card in cards:
            all_rows.append(parse_listing(card))
        time.sleep(5)
    return all_rows

if __name__ == "__main__":
    rows = scrape_search("https://www.superpages.com/los-angeles-ca/plumbers", pages=2)
    with open("superpages_leads.csv", "w", newline="", encoding="utf-8") as f:
        writer = csv.DictWriter(f, fieldnames=sorted({k for row in rows for k in row}))
        writer.writeheader()
        writer.writerows(rows)

चरण 4: एनरिचमेंट के लिए detail pages स्क्रैप करें

हर detail page URL पर जाने और hours, email, description, और reviews निकालने के लिए एक अलग फ़ंक्शन लिखें। इसका मतलब है rate limits, error handling, और संभावित proxies को खुद मैनेज करना — सब आपकी ज़िम्मेदारी।

चरण 5: डेटा को CSV या JSON में सेव करें

Python के csv या json modules का उपयोग करें। आपको खुद deduplication, cleaning, और export logic भी लिखना होगा।

आम समस्याएँ:

  • SuperPages Cloudflare या इसी तरह के anti-bot सिस्टम्स से requests ब्लॉक कर सकता है (मेरे परीक्षण में यह पुष्टि हुई)।
  • ऊपर selectors जानबूझकर broad रखे गए हैं क्योंकि SuperPages का markup बदल सकता है।
  • यह न मानें कि search-result pages में emails होती हैं। लगभग कभी नहीं होतीं।
  • एक production scraper के लिए robots/TOS review, rate limiting, retry/backoff, structured logging, और error capture ज़रूरी हैं।

अगर आप Python scraping पर और गहराई से जाना चाहते हैं, तो web scraping with Python या BeautifulSoup tutorial वाला हमारा गाइड देखें।

रॉ डेटा से असली लीड्स तक: पूरा पाइपलाइन (Scrape → Clean → Verify → CRM)

यहीं ज़्यादातर scraping guides रुक जाती हैं — और असली value यहीं से शुरू होती है। Scraping आपको कच्चा माल देती है। उसे उपयोगी लीड लिस्ट में बदलने के लिए कुछ और चरण चाहिए।

data-pipeline-workflow.webp

पाइपलाइन कुछ ऐसी दिखती है:

SuperPages search → लिस्टिंग्स स्क्रैप करें → detail pages/websites स्क्रैप करें → Google Sheets या CSV में एक्सपोर्ट करें → फ़ोन, पता, कैटेगरी साफ़ करें → डुप्लीकेट हटाएँ → ईमेल/फ़ोन वेरिफ़ाई करें → गायब कॉन्टैक्ट्स एनरिच करें → CRM में इम्पोर्ट करें → नियमों के अनुरूप आउटरीच

डुप्लीकेशन हटाना: डुप्लीकेट लिस्टिंग्स निकालना

SuperPages अक्सर एक ही बिज़नेस को कई कैटेगरीज़ में दिखाता है। अगर आपने एक ही शहर में “plumbers” और “drain cleaning” स्क्रैप किया, तो ओवरलैप मिलेगा।

  • प्राथमिक dedupe key: normalized फ़ोन नंबर + normalized सड़क का पता।
  • द्वितीयक: डोमेन + शहर।
  • अंतिम विकल्प: बिज़नेस नाम + ZIP कोड (franchises के लिए मैन्युअल जाँच करें)।

Google Sheets में exact-row matches के लिए =UNIQUE(A:H) उपयोग करें, या near-duplicates पकड़ने के लिए =LOWER(REGEXREPLACE(B2&C2,"[^a-zA-Z0-9]","")) जैसा helper column बनाएं। Excel में Data > Remove Duplicates का उपयोग करें।

डेटा क्लीनिंग: फ़ोन, पते, और फ़ॉर्मैट को मानकीकृत करना

  • फ़ोन नंबरों को E.164 फ़ॉर्मैट में रखें (US के लिए: +1 के बाद 10 अंक)। यही फ़ॉर्मैट ज़्यादातर CRMs और dialers चाहते हैं। Thunderbit में आप scraping के दौरान auto-format के लिए Field AI Prompt इस्तेमाल कर सकते हैं।
  • पते normalize करें: abbreviations expand करें, missing ZIP codes भरें, और ज़रूरत हो तो street/city/state/ZIP में बाँटें।
  • URLs से HTML artifacts, extra whitespace, और tracking query parameters हटाएँ।
  • ट्रेसबिलिटी के लिए source_directory, source_url, और scraped_at कॉलम जोड़ें।

आउटरीच से पहले ईमेल और फ़ोन वेरिफ़िकेशन

आपने जो ईमेल स्क्रैप किया है, हर पते पर बिना जाँच के cold email न भेजें। वेरिफ़िकेशन sender reputation बचाता है और bounce rate कम रखता है।

  • ईमेल वेरिफ़िकेशन: ZeroBounce (लगभग $39 से 2,000 credits, और 100 free monthly credits) या Bouncer ($8 में 1,000 credits, credits कभी expire नहीं होते) अच्छे विकल्प हैं।
  • फ़ोन validation: Twilio Lookup फ़ॉर्मैटिंग और validation मुफ़्त में देता है; caller ID $0.01/request है।
  • Thunderbit के मुफ्त Email Extractor और Phone Number Extractor वे contact details भी निकाल सकते हैं जो लिस्टिंग पेज पर छूट गए हों।

एनरिचमेंट: जब SuperPages पर ईमेल न मिले तो क्या करें

कई SuperPages लिस्टिंग्स में ईमेल बिल्कुल नहीं दिखता — खासकर search results page पर। ऐसे में ये करें:

  • बिज़नेस वेबसाइट के Contact, About, या footer पेज स्क्रैप करें। Thunderbit का Subpage Scraping या Email Extractor यह बड़े पैमाने पर कर सकता है।
  • Apollo, BetterContact, Icypeas, या Prospeo जैसे enrichment tools इस्तेमाल करें। लेकिन सावधानी: छोटे लोकल बिज़नेस (दो लोगों की plumbing shop, अकेले प्रैक्टिस करने वाला dentist) के लिए बड़े B2B databases अक्सर खाली निकलते हैं। ऐसी जगह website-first extraction बेहतर काम करती है।
  • कई डायरेक्टरीज़ को मिलाएँ। SuperPages, Yellow Pages, और Google Maps को एक ही कैटेगरी/शहर के लिए स्क्रैप करें, फिर merge और deduplicate करें। ओवरलैप से रिकॉर्ड ज़्यादा पूरे हो जाते हैं।

अगर आपने कभी किसी लोकल SMB list को Apollo में डाला हो और ज़्यादातर खाली परिणाम मिले हों, तो आप अकेले नहीं हैं। इसी वजह से इस ऑडियंस के लिए website-first approach महत्वपूर्ण है।

CRM इम्पोर्ट: लीड्स को HubSpot, Salesforce, या Google Sheets में लाना

  • HubSpot: Data Management > Data Integration > Import data > Quick import (contacts only) पर जाएँ। अपनी .csv या .xlsx फ़ाइल अपलोड करें। HubSpot का import guide field mapping समझाता है।
  • Salesforce: Data Import Wizard का उपयोग करें। CSV तैयार करें, source fields को Salesforce fields से map करें, और import चलाएँ।
  • Google Sheets / Airtable / Notion: Thunderbit तीनों में सीधे एक्सपोर्ट करता है — CSV intermediary की ज़रूरत नहीं।

टिप: इम्पोर्ट करने से पहले अपने scraped columns को CRM fields से map कर लें। कुछ मिनट का mapping बाद में घंटों की manual cleanup बचा सकता है।

SuperPages बनाम अन्य लोकल बिज़नेस डायरेक्टरीज़: सबसे अच्छी लीड्स कहाँ मिलेंगी

SuperPages एक मज़बूत शुरुआती बिंदु है, लेकिन यह अकेली डायरेक्टरी नहीं है जिसे स्क्रैप करना चाहिए। तुलना कुछ ऐसी है:

डायरेक्टरीलीड वॉल्यूमउपलब्ध डेटा फ़ील्ड्सडेटा की ताज़गीस्क्रैपिंग कठिनाईसबसे अच्छा उपयोग
SuperPagesबड़ा (US-केंद्रित)नाम, फ़ोन, पता, वेबसाइट, कैटेगरी, रेटिंग्समध्यममध्यमHome services, contractors, SMBs
Yellow Pagesबड़ा (US-केंद्रित)SuperPages जैसी हीमध्यममध्यमसामान्य लोकल बिज़नेस आउटरीच
Google Mapsबहुत बड़ा (वैश्विक)नाम, फ़ोन, पता, वेबसाइट, रिव्यूज़, घंटे, फ़ोटोउच्च (owner-updated)उच्च (आक्रामक anti-bot)सबसे ताज़ा लोकल डेटा
Yelpबड़ा (US-केंद्रित)नाम, फ़ोन, पता, रिव्यूज़, price rangeउच्चउच्चरेस्टोरेंट, रिटेल, सर्विस बिज़नेस
Mantaमध्यमनाम, फ़ोन, पता, revenue estimates, employee countमध्यमकमB2B prospecting (revenue/employee data)
BBBमध्यमनाम, फ़ोन, पता, accreditation, शिकायतेंमध्यमकमभरोसेमंद/जाँचे-परखे बिज़नेस

स्रोत: SuperPages homepage, VLDB SuperPages paper, Google Places API docs, Yelp Places API docs, Manta homepage, BBB guide।

Thunderbit इन सब पर काम करता है — लोकप्रिय साइट्स जैसे Google Maps और SuperPages के लिए Instant Templates सहित — इसलिए आप एक ही workflow को कई स्रोतों पर लागू कर सकते हैं और अपनी लीड लिस्ट्स मिला सकते हैं। मेरे अनुभव में, सबसे अच्छा तरीका अक्सर एक ही कैटेगरी/शहर के लिए दो या तीन डायरेक्टरीज़ स्क्रैप करना और फिर deduplicate करना होता है। ओवरलैप गैप भर देता है और पूरी तस्वीर देता है।

अन्य डायरेक्टरीज़ को स्क्रैप करने के बारे में अधिक जानकारी के लिए हमारे Yellow Pages scrapers, Google Maps scrapers, और Yelp scrapers गाइड देखें।

SuperPages लीड्स स्क्रैप करने के लिए कानूनी और नैतिक सुझाव

data-privacy-compliance-infographic.webp

मैं वकील नहीं हूँ, और यह कानूनी सलाह भी नहीं है — लेकिन इस क्षेत्र में इतना समय बिताया है कि इतना ज़रूर जानता हूँ: compliance को नज़रअंदाज़ करना जल्दी नुकसान कराता है। यहाँ व्यावहारिक बातें हैं।

सार्वजनिक बिज़नेस डेटा बनाम व्यक्तिगत डेटा

बिज़नेस लिस्टिंग्स — कंपनी का नाम, बिज़नेस फ़ोन, बिज़नेस पता, बिज़नेस वेबसाइट — आम तौर पर सार्वजनिक व्यावसायिक डेटा मानी जाती हैं। यह GDPR या CCPA के तहत व्यक्तिगत उपभोक्ता डेटा से अलग है। लेकिन “public” का मतलब यह नहीं कि “कोई नियम लागू नहीं होते।” हमेशा साइट के Terms of Service देखें।

SuperPages के Terms of Use (जुलाई 2019 में अपडेटेड) में एक “Data Mining Prohibited” क्लॉज़ है: Thryv की पूर्व सहमति के बिना users bots, crawlers, spiders, या इसी तरह के टूल्स का उपयोग करके डेटा इकट्ठा या निकाल नहीं सकते। यह लेख तरीके और workflows पर चर्चा करता है, लेकिन स्केल पर स्क्रैपिंग से पहले आपको इन शर्तों की समीक्षा करनी चाहिए और जहाँ ज़रूरी हो अनुमति लेनी चाहिए।

आउटरीच compliance: CAN-SPAM और TCPA की बुनियादी बातें

अगर आप स्क्रैप किए गए ईमेल्स का उपयोग cold outreach के लिए कर रहे हैं, तो FTC की CAN-SPAM guide के अनुसार आपको:

  • झूठे या भ्रामक header का उपयोग नहीं करना चाहिए
  • deceptive subject lines नहीं देने चाहिए
  • ज़रूरत होने पर संदेश को ad के रूप में पहचानना चाहिए
  • एक वैध physical postal address शामिल करना चाहिए
  • स्पष्ट opt-out सुविधा देनी चाहिए और उसे तुरंत मानना चाहिए

अगर आप स्क्रैप किए गए फ़ोन नंबरों पर cold calls कर रहे हैं, तो National Do Not Call Registry जाँचें और TCPA नियमों का पालन करें — खासकर automated calls, prerecorded messages, और SMS के मामले में। FTC ने 2024 में deceptive B2B telemarketing और AI-enabled scam calls से सुरक्षा मजबूत करने के लिए बदलावों की घोषणा की थी।

त्वरित compliance checklist

  • ✅ सिर्फ़ सार्वजनिक रूप से सूचीबद्ध बिज़नेस डेटा स्क्रैप करें
  • ✅ SuperPages की Terms of Use पढ़ें और जहाँ आवश्यक हो अनुमति लें
  • ✅ आउटरीच से पहले कॉन्टैक्ट्स वेरिफ़ाई करें
  • ✅ ईमेल्स में opt-out शामिल करें
  • ✅ robots.txt और rate limits का सम्मान करें
  • ✅ DNC और email suppression lists बनाए रखें
  • ⚠️ व्यक्तिगत/उपभोक्ता डेटा स्क्रैप करने से बचें
  • ⚠️ कानूनी समीक्षा के बिना raw scraped data दोबारा न बेचें

अपना तरीका चुनें और अपनी लीड लिस्ट बनाना शुरू करें

SuperPages से लीड्स स्क्रैप करना सिर्फ़ वेब पेज से पंक्तियाँ निकालना नहीं है। असली value पूरे pipeline में है: scrape, clean, deduplicate, verify, enrich, import, और compliant तरीके से outreach।

त्वरित सारांश:

  • Thunderbit सेल्स टीमें, एजेंसियाँ, और नॉन-डेव्स के लिए सबसे तेज़ रास्ता है। दो क्लिक में स्क्रैप करें, एक क्लिक में subpages से enrich करें, और Google Sheets, Airtable, Notion, या Excel में मुफ़्त एक्सपोर्ट करें। फ्री में आज़माएँ।
  • Octoparse सेमी-टेक्निकल यूज़र्स के लिए एक अच्छा visual workflow tool है, जिन्हें कॉन्फ़िगरेशन पर थोड़ा अधिक नियंत्रण चाहिए।
  • Python डेवलपर्स को पूरा लचीलापन देता है — लेकिन साथ में maintenance, anti-blocking की परेशानियाँ, और built-in enrichment की कमी भी आती है।
  • और याद रखें: यही workflow Yellow Pages, Google Maps, Yelp, Manta, और BBB पर भी लागू होता है। कई स्रोत स्क्रैप करें, merge करें, deduplicate करें, और आपके पास सबसे पूरी लोकल लीड लिस्ट होगी।

अगर आप Thunderbit को काम करते देखना चाहते हैं, तो walkthroughs के लिए हमारा YouTube channel देखें, या अपनी टीम के लिए सही विकल्प देखने हेतु Thunderbit pricing देखें।

अब जाइए और इन डायरेक्टरी पेजों को अपनी पाइपलाइन में बदल दीजिए — और आपकी फ़ोन नंबर हमेशा सही फ़ॉर्मैट में हों, और ईमेल हमेशा वेरिफ़ाइड हों।

FAQs

क्या SuperPages से लीड्स स्क्रैप करना कानूनी है?

सार्वजनिक रूप से उपलब्ध बिज़नेस डायरेक्टरी डेटा को B2B रिसर्च के लिए स्क्रैप करना आम बात है, लेकिन SuperPages की Terms of Use Thryv की पूर्व सहमति के बिना data mining पर रोक लगाती है। हमेशा साइट की शर्तें देखें, जहाँ ज़रूरी हो अनुमति लें, और CAN-SPAM तथा TCPA जैसे आउटरीच नियमों का पालन करें। यह लेख शिक्षा के उद्देश्य से तरीके और workflows बताता है — उनका उपयोग compliant तरीके से करना आपकी ज़िम्मेदारी है।

SuperPages से मुझे कौन-सा डेटा मिल सकता है?

एक सामान्य स्क्रैप में बिज़नेस नाम, फ़ोन, पता, वेबसाइट, कैटेगरी, रेटिंग्स, घंटे, और विवरण मिलते हैं। ईमेल आम तौर पर search results page पर नहीं दिखते — उन्हें पाने के लिए आपको business detail page या कंपनी की अपनी वेबसाइट (subpage scraping या email extractor के जरिए) देखनी पड़ती है।

क्या मैं बिना कोडिंग के SuperPages स्क्रैप कर सकता हूँ?

हाँ। Thunderbit (AI Chrome extension) और Octoparse (visual scraper) जैसे टूल्स आपको एक भी कोड लाइन लिखे बिना SuperPages स्क्रैप करने देते हैं। Thunderbit सबसे तेज़ विकल्प है — एक्सटेंशन इंस्टॉल करें, SuperPages search खोलें, "AI Suggest Fields" पर क्लिक करें, फिर "Scrape"।

SuperPages स्क्रैप करते समय pagination कैसे संभालूँ?

Thunderbit pagination को अपने आप संभालता है — यह "Next" बटन या infinite scroll पहचानता है और आगे बढ़ता रहता है। Octoparse में आपको workflow में pagination step कॉन्फ़िगर करना पड़ता है। Python में आपको manual page-loop logic लिखना पड़ता है (page numbers बढ़ाना, आख़िरी पेज पहचानना)।

SuperPages लिस्टिंग्स से ईमेल कैसे निकालूँ?

ज़्यादातर SuperPages लिस्टिंग्स search results page पर ईमेल नहीं दिखातीं। Thunderbit के Subpage Scraping से हर detail page खोलें, या business की वेबसाइट पर मुफ़्त Email Extractor इस्तेमाल करें। बची हुई gaps के लिए Apollo, BetterContact, या Prospeo जैसे enrichment tools आज़माएँ — लेकिन छोटे लोकल बिज़नेस के लिए अक्सर website-first extraction बड़े B2B databases से बेहतर काम करता है।

SuperPages लीड्स के लिए AI Web Scraper आज़माएँ Get Started Free

और जानें

Shuai Guan
Shuai Guan
Thunderbit के CEO | AI डेटा ऑटोमेशन एक्सपर्ट Shuai Guan Thunderbit के CEO हैं और University of Michigan Engineering के पूर्व छात्र हैं। टेक और SaaS आर्किटेक्चर में लगभग दस वर्षों के अनुभव के आधार पर, वे जटिल AI मॉडल्स को ऐसे व्यावहारिक, बिना कोड वाले डेटा एक्सट्रैक्शन टूल्स में बदलने में माहिर हैं जो रोज़मर्रा के काम में तुरंत उपयोग किए जा सकें। इस ब्लॉग पर वे वेब स्क्रैपिंग और ऑटोमेशन रणनीतियों पर अपने सीधे, आज़माए हुए अनुभव साझा करते हैं, ताकि आप अधिक स्मार्ट और डेटा-आधारित वर्कफ़्लो बना सकें। जब वे डेटा वर्कफ़्लो को बेहतर बनाने में व्यस्त नहीं होते, तो वही बारीकी और पैनी नज़र वे अपनी फोटोग्राफी की रुचि में लगाते हैं।
विषय सूची

बस पूछकर एक वेबपेज स्क्रैप करें

जो चाहिए, उसे आसान अंग्रेज़ी में कहें। या उससे भी बेहतर, कुछ न कहें।

Thunderbit आज़माएँ मुफ़्त है
AI का उपयोग करके डेटा निकालें
डेटा को आसानी से Google Sheets, Airtable, या Notion में ट्रांसफ़र करें
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week