पिछले हफ्ते, हमारे एक यूज़र ने बताया कि उसने SuperPages से प्लंबर लिस्टिंग्स को स्प्रेडशीट में कॉपी करने में पूरा एक दोपहर लगा दिया — तीन घंटे में सिर्फ़ 47 पंक्तियाँ। कलाई दर्द करने लगी, डेटा में टाइपिंग गलतियाँ थीं, और फिर भी ईमेल्स नहीं मिले। यह कहानी मुझे इसलिए भी अपनी लगी क्योंकि मैं भी ऐसा कर चुका हूँ — और इसी समस्या को हल करने के लिए हमने Thunderbit बनाया था।
SuperPages अमेरिका की पुरानी और भरोसेमंद लोकल बिज़नेस डायरेक्टरीज़ में से एक है, जिसे Thryv ऑपरेट करता है। इसमें बड़े शहरों और कई कैटेगरीज़ की अच्छी कवरेज मिलती है — प्लंबर, डेंटिस्ट, वकील, HVAC टेक्नीशियन, जो चाहें। पुराने तकनीकी दस्तावेज़ इसे 11 मिलियन से ज़्यादा लिस्टिंग्स वाले राष्ट्रीय येलो-पेजेज़ डेटाबेस के रूप में बताते थे, और आज भी साइट पर घनी लोकल कैटेगरीज़ मिलती हैं। असली चुनौती लिस्टिंग्स ढूँढना नहीं है। चुनौती है उन्हें साफ़, समृद्ध और काम की लीड लिस्ट में बदलना — बिना दिमाग़ खराब किए (या पूरा दोपहर गंवाए)।
HubSpot की 2024 Sales Trends रिपोर्ट के मुताबिक, सेल्स रिप्रेज़ेंटेटिव्स दिन में सिर्फ़ लगभग 2 घंटे ही असल में बेचने में लगाते हैं — बाकी समय डेटा एंट्री और रिसर्च जैसे कामों में चला जाता है। और 81% सेल्स प्रोफेशनल्स मानते हैं कि AI उन्हें मैनुअल काम कम करने में मदद कर सकता है। यह गाइड आपको SuperPages से लीड्स स्क्रैप करने के तीन तरीके दिखाती है — ज़ीरो-कोड AI से लेकर Python तक — ताकि आप अपनी स्किल के हिसाब से सही तरीका चुन सकें और फिर से उन कामों पर लौट सकें जो सच में परिणाम लाते हैं।
AI से SuperPages लीड्स स्क्रैप करें Get Started Free
SuperPages क्या है (और सेल्स टीमें इसे लीड्स के लिए क्यों पसंद करती हैं)
SuperPages अमेरिका-केंद्रित एक ऑनलाइन बिज़नेस डायरेक्टरी है, जहाँ लोकल बिज़नेस अपने कॉन्टैक्ट डिटेल्स, कैटेगरी, रेटिंग्स और अन्य जानकारी के साथ सूचीबद्ध होते हैं। इसे पुराने येलो पेजेज़ फ़ोन बुक के डिजिटल रूप की तरह समझें — फर्क बस इतना है कि अब इसे कैटेगरी और लोकेशन के हिसाब से खोजा जा सकता है, और हर लिस्टिंग में डेटा भी ज़्यादा मिलता है।

एक सामान्य SuperPages लिस्टिंग में यह जानकारी हो सकती है:
- बिज़नेस का नाम
- फ़ोन नंबर
- सड़क का पता
- वेबसाइट URL (अगर उपलब्ध हो)
- कैटेगरी (जैसे Plumbing, Family Law, HVAC)
- रेटिंग और रिव्यूज़
- काम करने का समय (आमतौर पर डिटेल पेज पर)
- विवरण (डिटेल पेज)
SuperPages के होमपेज पर Home Services, Plumbers, Electricians, Dentists, Legal Services, Auto Repair, Restaurants, और Pet Services जैसी लोकप्रिय कैटेगरीज़ दिखाई जाती हैं — और यही वे सेक्टर हैं जिन्हें सेल्स टीमें, एजेंसियाँ, और लोकल सर्विस विक्रेता आउटबाउंड आउटरीच के लिए टार्गेट करते हैं।
संक्षेप में, अमेरिका में लोकल बिज़नेस प्रोस्पेक्टिंग करने वाले किसी भी व्यक्ति के लिए SuperPages एक बढ़िया स्रोत है। डेटा संरचित है, कवरेज व्यापक है, और कैटेगरीज़ सीधे-सीधे वास्तविक आउटबाउंड कैंपेन से मेल खाती हैं।
SuperPages लीड्स के लिए Thunderbit आज़माएँ
SuperPages को लीड्स के लिए क्यों स्क्रैप करें? (मुख्य उपयोग)
SuperPages को मैन्युअली खोलकर डेटा को स्प्रेडशीट में कॉपी करना एक प्रोडक्टिविटी ब्लैक होल है। स्क्रैपिंग इस काम को ऑटोमेट कर देती है, और आपको घंटों की जगह कुछ ही मिनटों में एक टार्गेटेड, स्ट्रक्चर्ड लिस्ट मिल जाती है। और क्योंकि आप सर्च को खुद नियंत्रित करते हैं (कैटेगरी + शहर + कीवर्ड), आउटपुट अक्सर एक सामान्य खरीदी हुई लीड लिस्ट से ज़्यादा प्रासंगिक होता है।
हमारे यूज़र्स में मुझे सबसे आम ये उपयोग मिलते हैं:
| उपयोग | किसे फायदा | उदाहरण |
|---|---|---|
| लोकल लीड जनरेशन | सेल्स टीमें, एजेंसियाँ | डलास में प्लंबर की सूची बनाकर कोल्ड आउटरीच करना |
| प्रतियोगी रिसर्च | ऑपरेशंस, मार्केटिंग | किसी मार्केट में प्रतिस्पर्धियों की रेटिंग और सेवाओं की तुलना करना |
| मार्केट मैपिंग | बिज़नेस डेवलपमेंट | नए प्रोडक्ट लॉन्च के लिए किसी ZIP कोड में सभी डेंटिस्ट पहचानना |
| वेंडर सोर्सिंग | प्रोक्योरमेंट, ऑपरेशंस | किसी क्षेत्र में फ़ोन + वेबसाइट जानकारी वाले सप्लायर्स ढूँढना |
| लोकल SEO प्रोस्पेक्टिंग | एजेंसियाँ | बिना वेबसाइट या कमज़ोर लिस्टिंग डेटा वाले बिज़नेस ढूँढना |
| टेरिटरी प्लानिंग | फ़ील्ड सेल्स | शहर, ZIP कोड, या सर्विस एरिया के हिसाब से कॉन्ट्रैक्टर्स को समूहित करना |
अमेरिका का B2B लीड जनरेशन मार्केट 2024 में 8.5 बिलियन डॉलर आँका गया था, और 2034 तक 18.2 बिलियन डॉलर तक पहुँचने का अनुमान है — यानी इस तरह के डेटा की मांग कम होने वाली नहीं है। ताज़ा स्क्रैप की गई, कैटेगरी और लोकेशन-विशिष्ट लिस्ट एक सामान्य खरीदी हुई लिस्ट से ज़्यादा टार्गेटेड हो सकती है, लेकिन आउटरीच से पहले इसे वेरिफाई और डेडुप्लिकेट करना ज़रूरी है (इस पर आगे बात करेंगे)।
अंतिम आउटपुट कैसा दिखता है: SuperPages से स्क्रैप किए गए डेटा का नमूना
कैसे करना है, उस पर जाने से पहले मैं आपको दिखाना चाहता हूँ कि अंत में आपको मिलता क्या है। ज़्यादातर गाइड्स यही हिस्सा छोड़ देती हैं — लेकिन अगर आप समय लगा रहे हैं, तो आपको पता होना चाहिए कि परिणाम कैसा दिखेगा।
यह एक नमूना आउटपुट टेबल है (काल्पनिक डेटा, लेकिन वास्तविक जैसा ढाँचा):
| बिज़नेस नाम | फ़ोन | पता | वेबसाइट | कैटेगरी | रेटिंग | समय | ईमेल (समृद्ध) |
|---|---|---|---|---|---|---|---|
| Sunset Pipe & Drain Co. | +1 213-555-0148 | 1842 W 7th St, Los Angeles, CA 90057 | sunsetpipe.example | Plumbing | 4.6 | Mon-Fri 7a-6p | service@sunsetpipe.example |
| Arroyo HVAC Pros | +1 626-555-0182 | 72 N Fair Oaks Ave, Pasadena, CA 91103 | arroyohvac.example | HVAC | 4.8 | Mon-Sat 8a-7p | hello@arroyohvac.example |
| Wilshire Family Dental | +1 323-555-0119 | 4100 Wilshire Blvd, Los Angeles, CA 90010 | wilshiredental.example | Dentists | 4.4 | Mon-Thu 9a-5p | appointments@wilshiredental.example |
| Pacific Legal Aid Group | +1 310-555-0173 | 11845 W Olympic Blvd, Los Angeles, CA 90064 | Legal Services | 4.2 | Mon-Fri 8:30a-5:30p | intake@pacificlegal.example | |
| Valley Auto Repair Center | +1 818-555-0198 | 14422 Ventura Blvd, Sherman Oaks, CA 91423 | valleyautorepair.example | Auto Repair | 4.7 | Mon-Sat 8a-6p | info@valleyautorepair.example |
| Echo Park Pet Grooming | +1 213-555-0166 | 1511 Sunset Blvd, Los Angeles, CA 90026 | echoparkpets.example | Pet Grooming | 4.9 | Tue-Sun 9a-5p | booking@echoparkpets.example |
कुछ बातें ध्यान देने योग्य हैं:
- सर्च रिज़ल्ट पेज से: बिज़नेस नाम, फ़ोन, आंशिक पता, कैटेगरी, रेटिंग, लिस्टिंग URL।
- बिज़नेस डिटेल पेज (सबपेज) से: पूरा पता, काम करने का समय, विवरण, रिव्यूज़, कभी-कभी वेबसाइट।
- एनरिचमेंट से: ईमेल (अक्सर सिर्फ़ बिज़नेस की अपनी वेबसाइट या एनरिचमेंट टूल्स से मिलता है)।
- क्लीनिंग से: फ़ोन को E.164 फ़ॉर्मैट में, स्टैंडर्ड राज्य/ZIP, डेडुप कीज़, स्रोत URL और स्क्रैप की तारीख।
इस तरह का आउटपुट आप सीधे CRM, Google Sheet, या Airtable base में डालकर तुरंत काम शुरू कर सकते हैं।
SuperPages से लीड्स स्क्रैप करने के 3 तरीके: त्वरित तुलना

हर किसी की तकनीकी सहजता — और धैर्य — एक जैसा नहीं होता। इसलिए यहाँ तीन तरीके साथ-साथ दिए गए हैं, ताकि आप अपनी ज़रूरत के हिसाब से चुन सकें:
| मानदंड | Thunderbit (AI No-Code) | Visual Scraper (जैसे Octoparse) | Python (Requests + BS4) |
|---|---|---|---|
| सेटअप समय | ~2 मिनट (एक्सटेंशन इंस्टॉल) | ~15 मिनट (वर्कफ़्लो बनाना) | ~30 मिनट (लाइब्रेरी इंस्टॉल, कोड लिखना) |
| कोडिंग की ज़रूरत | नहीं | नहीं | हाँ (Python) |
| पेजिनेशन हैंडलिंग | बिल्ट-इन (क्लिक या स्क्रॉल) | कॉन्फ़िगरेशन ज़रूरी | मैन्युअल कोड |
| सबपेज एनरिचमेंट | 1-क्लिक Subpage Scraping | अलग वर्कफ़्लो/लूप चाहिए | अलग स्क्रिप्ट |
| एंटी-ब्लॉकिंग | Cloud Scraping इसे संभालता है | प्लान/प्रॉक्सी ऐड-ऑन पर निर्भर | खुद करना होगा (प्रॉक्सी, हेडर, रेट लिमिट) |
| एक्सपोर्ट विकल्प | Excel, Google Sheets, Airtable, Notion, CSV, JSON | CSV, Excel, डेटाबेस | जैसा आप कोड करें |
| किसके लिए बेहतर | सेल्स टीमें, एजेंसियाँ, नॉन-डेव्स | सेमी-टेक्निकल यूज़र्स | पूरा नियंत्रण चाहने वाले डेवलपर्स |
मेरी सलाह: अगर आप अगले 2 मिनट में स्क्रैपिंग शुरू करना चाहते हैं, तो Method 1 पर जाएँ। अगर आपको विज़ुअल वर्कफ़्लो पसंद हैं और थोड़ा कॉन्फ़िगरेशन चल जाता है, तो Method 2 आज़माएँ। अगर आपको पूरा नियंत्रण चाहिए और Python आता है, तो Method 3 अपनाएँ।
Method 1: Thunderbit से SuperPages लीड्स स्क्रैप करें (AI, नो-कोड)
यह "मेरे पास SuperPages सर्च है" से "मेरे पास एक लीड लिस्ट है" तक पहुँचने का सबसे तेज़ तरीका है। न कोडिंग, न वर्कफ़्लो बिल्डर, न प्रॉक्सी कॉन्फ़िगरेशन। मैं थोड़ा पक्षपाती हूँ — क्योंकि हमने Thunderbit बनाया है — लेकिन मैं आपको बिल्कुल साफ़ दिखाऊँगा कि क्या होता है, ताकि आप खुद तय कर सकें।
कठिनाई: शुरुआती
समय: पूरी कैटेगरी/शहर स्क्रैपिंग के लिए लगभग 5 मिनट
आपको क्या चाहिए: Chrome ब्राउज़र, Thunderbit Chrome Extension (फ्री टियर काम करता है)
चरण 1: Thunderbit इंस्टॉल करें और SuperPages खोलें
Thunderbit Chrome Extension Download Page पर जाएँ और Thunderbit एक्सटेंशन इंस्टॉल करें। इसमें लगभग एक मिनट लगता है। इंस्टॉल होने के बाद, SuperPages के किसी सर्च रिज़ल्ट पेज पर जाएँ — उदाहरण के लिए superpages.com पर “Plumbers in Los Angeles, CA” खोजें।
आपको ब्राउज़र टूलबार में Thunderbit आइकन और एक साइडबार पैनल तैयार मिलेगा।
चरण 2: डेटा कॉलम अपने आप पहचानने के लिए "AI Suggest Fields" पर क्लिक करें
Thunderbit साइडबार खोलें और "AI Suggest Fields" पर क्लिक करें। Thunderbit का AI पेज को पढ़ता है और जो कुछ मिलता है उसके आधार पर खुद कॉलम सुझाता है — आम तौर पर बिज़नेस नाम, फ़ोन, पता, वेबसाइट, कैटेगरी, रेटिंग, और लिस्टिंग URL।
स्क्रैप करने से पहले आप कॉलम बदल, जोड़ या हटा सकते हैं। अगर आपको "Has Website?" या "Service Area?" जैसा कोई कस्टम कॉलम चाहिए, तो Field AI Prompt में साधारण अंग्रेज़ी में उसका विवरण लिख दीजिए। उदाहरण के लिए, आप कह सकते हैं कि फ़ोन को "+1XXXXXXXXXX" फ़ॉर्मैट में रखें या बिज़नेस को residential vs. commercial के रूप में वर्गीकृत करें।
अब आपको Thunderbit पैनल में अपने कॉन्फ़िगर किए हुए कॉलम्स के साथ एक टेबल प्रीव्यू दिखना चाहिए।
चरण 3: "Scrape" पर क्लिक करें और डेटा भरते देखें
नीले "Scrape" बटन पर क्लिक करें। Thunderbit मौजूदा पेज की सारी लिस्टिंग्स निकालकर आपकी टेबल में एक-एक करके भर देगा। SuperPages के एक सामान्य रिज़ल्ट पेज के लिए यह लगभग 30–45 सेकंड लेता है।
Thunderbit पेजिनेशन को अपने आप संभालता है — यह "Next" बटन या infinite scroll पहचानता है और तब तक चलता रहता है जब तक पेज खत्म न हो जाएँ या आपकी सीमा पूरी न हो जाए। अगर आप बड़े रिज़ल्ट सेट को स्क्रैप कर रहे हैं (जैसे किसी पूरे मेट्रो एरिया के सभी प्लंबर), तो Cloud Scraping मोड चालू करें, जो आपके ब्राउज़र को बाँधे बिना एक बार में 50 पेज तक प्रोसेस कर सकता है।
चरण 4: Subpage Scraping से हर लिस्टिंग को समृद्ध करें

सर्च रिज़ल्ट पेज आपको बुनियादी जानकारी देता है, लेकिन असली काम की चीज़ें — समय, पूरा विवरण, रिव्यूज़, कभी-कभी ईमेल — हर बिज़नेस के डिटेल पेज पर मिलती हैं। "Scrape Subpages" पर क्लिक करें, और Thunderbit हर लिस्टिंग के डिटेल पेज पर जाकर hours, description, website URL, और वहाँ दिखने वाली कोई भी संपर्क जानकारी निकाल लेता है।
यह एक-क्लिक प्रक्रिया है। कोई अलग वर्कफ़्लो नहीं, कोई कॉन्फ़िगरेशन नहीं। समृद्ध डेटा सीधे आपकी मौजूदा टेबल में जुड़ जाता है।
चरण 5: अपनी लीड्स को Excel, Google Sheets, Airtable, या Notion में एक्सपोर्ट करें
जब डेटा सही लगे, तो Export पर क्लिक करें। Thunderbit आपको अपनी लीड्स सीधे यहाँ भेजने देता है:
- Google Sheets (CRM तैयारी और शेयरिंग के लिए बढ़िया)
- Airtable (हल्का-फुल्का पाइपलाइन टेबल)
- Notion (रिसर्च डेटाबेस)
- Excel / CSV (CRM इम्पोर्ट)
- JSON (डेवलपर हैंडऑफ़)

सभी एक्सपोर्ट विकल्प मुफ़्त हैं। अगर आप लीड्स को HubSpot या Salesforce में डाल रहे हैं, तो CSV या Google Sheets में एक्सपोर्ट करना अक्सर सबसे तेज़ रास्ता होता है।
प्रो टिप: पूरे राज्य-भर की सर्च के बजाय कैटेगरी + शहर के हिसाब से स्क्रैप करें। “Emergency plumbers Dallas TX” आपको “plumbers Texas” से कहीं ज़्यादा सटीक और काम की लिस्ट देगा। ट्रेसबिलिटी के लिए एक “Source URL” और “Scraped At” कॉलम भी जोड़ें।
Method 2: Visual Scraping Tool से SuperPages स्क्रैप करें (Octoparse उदाहरण)
Octoparse जैसे visual scraping tools बीच का रास्ता देते हैं: कोडिंग नहीं, लेकिन Thunderbit से ज़्यादा सेटअप और कॉन्फ़िगरेशन। Octoparse में सरल उपयोग के मामलों के लिए पहले से तैयार SuperPages टेम्पलेट भी है।
कठिनाई: मध्यम
समय: सेटअप + स्क्रैप के लिए लगभग 20–30 मिनट
आपको क्या चाहिए: Octoparse अकाउंट (फ्री प्लान उपलब्ध, कुछ सीमाओं के साथ)
चरण 1: नया टास्क बनाएँ और SuperPages URL लोड करें
Octoparse खोलें, "New Task" पर क्लिक करें, और अपना SuperPages सर्च URL पेस्ट करें (जैसे "https://www.superpages.com/los-angeles-ca/plumbers"). बिल्ट-इन ब्राउज़र पेज को लोड कर देता है।
चरण 2: डेटा फ़ील्ड्स को Auto-detect करें या खुद चुनें
"Auto-detect" पर क्लिक करें — Octoparse पेज को स्कैन करता है और जिन फ़ील्ड्स को वह प्रासंगिक समझता है उन्हें हाईलाइट करता है। Data Preview पैनल देखें। मेरे अनुभव में auto-detection अक्सर ज़्यादातर फ़ील्ड्स पकड़ लेती है, लेकिन कभी-कभी अतिरिक्त चीज़ें (जैसे ad labels या navigation text) भी ले आती है या कुछ फ़ील्ड्स छूट जाते हैं। इसलिए आपको कुछ फ़ील्ड्स manually जोड़ने या हटाने पड़ सकते हैं।
Octoparse की मदद डॉक्यूमेंटेशन के अनुसार, auto-detection एक बेसिक workflow बनाती है जिसमें pagination और extract-data steps शामिल होते हैं, लेकिन users को missing data manually जोड़ना पड़ सकता है।
चरण 3: वर्कफ़्लो बनाएँ और पेजिनेशन सेट करें
"Create workflow" पर क्लिक करें। Octoparse step-by-step action sequence बनाता है। Pagination step की जाँच करें — सुनिश्चित करें कि यह सही तरीके से "Next" क्लिक करता है या और परिणाम लोड करता है। अगर आपको हर बिज़नेस के detail page से डेटा चाहिए (hours, email, description), तो आपको workflow के अंदर detail-page loop या subpage action जोड़ना होगा। Thunderbit के एक-क्लिक subpage approach की तुलना में यह ज़्यादा जटिल है।
चरण 4: टास्क चलाएँ और डेटा एक्सपोर्ट करें
टास्क को लोकली चलाएँ (छोटे कामों के लिए) या Octoparse के cloud पर चलाएँ (scheduled या बड़े jobs के लिए — cloud एक paid feature है)। जब काम पूरा हो जाए, CSV, Excel, या JSON में एक्सपोर्ट करें।
ध्यान देने योग्य सीमाएँ: Octoparse के फ्री प्लान में 10 tasks, प्रति माह 50,000 rows तक, और सिर्फ़ local extraction शामिल है। Cloud runs, IP rotation, CAPTCHA solving, और कुछ export integrations के लिए paid plan चाहिए (वार्षिक बिलिंग पर लगभग $69/माह से शुरू)।
Method 3: Python से SuperPages स्क्रैप करें (Requests + BeautifulSoup)
यह डेवलपर वाला रास्ता है। पूरा नियंत्रण, पूरी ज़िम्मेदारी। अगर आप Python स्क्रिप्ट्स लिखने और संभालने में सहज हैं, तो इससे आपको सबसे ज़्यादा flexibility मिलेगी — लेकिन सिरदर्द भी सबसे ज़्यादा होंगे।
कठिनाई: उन्नत
समय: लगभग 30–60 मिनट (सेटअप + कोडिंग + डिबगिंग)
आपको क्या चाहिए: Python 3.x, pip, requests, beautifulsoup4, lxml, एक code editor
चरण 1: अपना Python environment सेट करें
python -m venv .venv
source .venv/bin/activate
pip install requests beautifulsoup4 lxml pandas
चरण 2: SuperPages की HTML संरचना की जाँच करें
SuperPages रिज़ल्ट पेज पर Developer Tools (F12) खोलें। बिज़नेस नाम, पता, फ़ोन, वेबसाइट, और detail page लिंक के लिए CSS selectors पहचानें। ध्यान रखें: HTML संरचना बिना चेतावनी बदल सकती है, जिसका मतलब है कि आपके selectors कभी भी टूट सकते हैं।
चरण 3: लिस्टिंग्स स्क्रैपर लिखें और पेजिनेशन संभालें
यह एक सरल उदाहरण है। एक अहम चेतावनी: मेरे परीक्षण में SuperPages पर direct request करने पर Cloudflare का “Attention Required” block page मिला। एक साधारण Requests script बड़े पैमाने पर फेल हो सकती है — आपको browser-session context, rate limiting, retries, या अधिकृत विकल्पों की ज़रूरत पड़ सकती है।
import csv, time
from urllib.parse import urljoin
import requests
from bs4 import BeautifulSoup
BASE_URL = "https://www.superpages.com"
HEADERS = {
"User-Agent": (
"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
"AppleWebKit/537.36 (KHTML, like Gecko) "
"Chrome/125.0 Safari/537.36"
)
}
def fetch(url):
resp = requests.get(url, headers=HEADERS, timeout=20)
resp.raise_for_status()
if "Attention Required" in resp.text or "Cloudflare" in resp.text:
raise RuntimeError("Blocked. Slow down or switch to browser/cloud scraping.")
return BeautifulSoup(resp.text, "lxml")
def parse_listing(card):
name_el = card.select_one(".business-name, a.business-name, h2 a, h3 a")
phone_el = card.select_one(".phones, .phone, [class*=phone]")
address_el = card.select_one(".street-address, .adr, [class*=address]")
website_el = card.select_one("a.track-visit-website, a[href*='http']")
rating_el = card.select_one(".rating, [class*=rating]")
detail_url = urljoin(BASE_URL, name_el.get("href")) if name_el and name_el.get("href") else ""
return {
"business_name": name_el.get_text(" ", strip=True) if name_el else "",
"phone": phone_el.get_text(" ", strip=True) if phone_el else "",
"address": address_el.get_text(" ", strip=True) if address_el else "",
"website": website_el.get("href", "") if website_el else "",
"rating": rating_el.get_text(" ", strip=True) if rating_el else "",
"detail_url": detail_url,
}
def scrape_search(search_url, pages=3):
all_rows = []
for page in range(1, pages + 1):
page_url = f"{search_url}?page={page}"
soup = fetch(page_url)
cards = soup.select(".result, .organic, [class*=result]")
if not cards:
break
for card in cards:
all_rows.append(parse_listing(card))
time.sleep(5)
return all_rows
if __name__ == "__main__":
rows = scrape_search("https://www.superpages.com/los-angeles-ca/plumbers", pages=2)
with open("superpages_leads.csv", "w", newline="", encoding="utf-8") as f:
writer = csv.DictWriter(f, fieldnames=sorted({k for row in rows for k in row}))
writer.writeheader()
writer.writerows(rows)
चरण 4: एनरिचमेंट के लिए detail pages स्क्रैप करें
हर detail page URL पर जाने और hours, email, description, और reviews निकालने के लिए एक अलग फ़ंक्शन लिखें। इसका मतलब है rate limits, error handling, और संभावित proxies को खुद मैनेज करना — सब आपकी ज़िम्मेदारी।
चरण 5: डेटा को CSV या JSON में सेव करें
Python के csv या json modules का उपयोग करें। आपको खुद deduplication, cleaning, और export logic भी लिखना होगा।
आम समस्याएँ:
- SuperPages Cloudflare या इसी तरह के anti-bot सिस्टम्स से requests ब्लॉक कर सकता है (मेरे परीक्षण में यह पुष्टि हुई)।
- ऊपर selectors जानबूझकर broad रखे गए हैं क्योंकि SuperPages का markup बदल सकता है।
- यह न मानें कि search-result pages में emails होती हैं। लगभग कभी नहीं होतीं।
- एक production scraper के लिए robots/TOS review, rate limiting, retry/backoff, structured logging, और error capture ज़रूरी हैं।
अगर आप Python scraping पर और गहराई से जाना चाहते हैं, तो web scraping with Python या BeautifulSoup tutorial वाला हमारा गाइड देखें।
रॉ डेटा से असली लीड्स तक: पूरा पाइपलाइन (Scrape → Clean → Verify → CRM)
यहीं ज़्यादातर scraping guides रुक जाती हैं — और असली value यहीं से शुरू होती है। Scraping आपको कच्चा माल देती है। उसे उपयोगी लीड लिस्ट में बदलने के लिए कुछ और चरण चाहिए।

पाइपलाइन कुछ ऐसी दिखती है:
SuperPages search → लिस्टिंग्स स्क्रैप करें → detail pages/websites स्क्रैप करें → Google Sheets या CSV में एक्सपोर्ट करें → फ़ोन, पता, कैटेगरी साफ़ करें → डुप्लीकेट हटाएँ → ईमेल/फ़ोन वेरिफ़ाई करें → गायब कॉन्टैक्ट्स एनरिच करें → CRM में इम्पोर्ट करें → नियमों के अनुरूप आउटरीच
डुप्लीकेशन हटाना: डुप्लीकेट लिस्टिंग्स निकालना
SuperPages अक्सर एक ही बिज़नेस को कई कैटेगरीज़ में दिखाता है। अगर आपने एक ही शहर में “plumbers” और “drain cleaning” स्क्रैप किया, तो ओवरलैप मिलेगा।
- प्राथमिक dedupe key: normalized फ़ोन नंबर + normalized सड़क का पता।
- द्वितीयक: डोमेन + शहर।
- अंतिम विकल्प: बिज़नेस नाम + ZIP कोड (franchises के लिए मैन्युअल जाँच करें)।
Google Sheets में exact-row matches के लिए =UNIQUE(A:H) उपयोग करें, या near-duplicates पकड़ने के लिए =LOWER(REGEXREPLACE(B2&C2,"[^a-zA-Z0-9]","")) जैसा helper column बनाएं। Excel में Data > Remove Duplicates का उपयोग करें।
डेटा क्लीनिंग: फ़ोन, पते, और फ़ॉर्मैट को मानकीकृत करना
- फ़ोन नंबरों को E.164 फ़ॉर्मैट में रखें (US के लिए: +1 के बाद 10 अंक)। यही फ़ॉर्मैट ज़्यादातर CRMs और dialers चाहते हैं। Thunderbit में आप scraping के दौरान auto-format के लिए Field AI Prompt इस्तेमाल कर सकते हैं।
- पते normalize करें: abbreviations expand करें, missing ZIP codes भरें, और ज़रूरत हो तो street/city/state/ZIP में बाँटें।
- URLs से HTML artifacts, extra whitespace, और tracking query parameters हटाएँ।
- ट्रेसबिलिटी के लिए
source_directory,source_url, औरscraped_atकॉलम जोड़ें।
आउटरीच से पहले ईमेल और फ़ोन वेरिफ़िकेशन
आपने जो ईमेल स्क्रैप किया है, हर पते पर बिना जाँच के cold email न भेजें। वेरिफ़िकेशन sender reputation बचाता है और bounce rate कम रखता है।
- ईमेल वेरिफ़िकेशन: ZeroBounce (लगभग $39 से 2,000 credits, और 100 free monthly credits) या Bouncer ($8 में 1,000 credits, credits कभी expire नहीं होते) अच्छे विकल्प हैं।
- फ़ोन validation: Twilio Lookup फ़ॉर्मैटिंग और validation मुफ़्त में देता है; caller ID $0.01/request है।
- Thunderbit के मुफ्त Email Extractor और Phone Number Extractor वे contact details भी निकाल सकते हैं जो लिस्टिंग पेज पर छूट गए हों।
एनरिचमेंट: जब SuperPages पर ईमेल न मिले तो क्या करें
कई SuperPages लिस्टिंग्स में ईमेल बिल्कुल नहीं दिखता — खासकर search results page पर। ऐसे में ये करें:
- बिज़नेस वेबसाइट के Contact, About, या footer पेज स्क्रैप करें। Thunderbit का Subpage Scraping या Email Extractor यह बड़े पैमाने पर कर सकता है।
- Apollo, BetterContact, Icypeas, या Prospeo जैसे enrichment tools इस्तेमाल करें। लेकिन सावधानी: छोटे लोकल बिज़नेस (दो लोगों की plumbing shop, अकेले प्रैक्टिस करने वाला dentist) के लिए बड़े B2B databases अक्सर खाली निकलते हैं। ऐसी जगह website-first extraction बेहतर काम करती है।
- कई डायरेक्टरीज़ को मिलाएँ। SuperPages, Yellow Pages, और Google Maps को एक ही कैटेगरी/शहर के लिए स्क्रैप करें, फिर merge और deduplicate करें। ओवरलैप से रिकॉर्ड ज़्यादा पूरे हो जाते हैं।
अगर आपने कभी किसी लोकल SMB list को Apollo में डाला हो और ज़्यादातर खाली परिणाम मिले हों, तो आप अकेले नहीं हैं। इसी वजह से इस ऑडियंस के लिए website-first approach महत्वपूर्ण है।
CRM इम्पोर्ट: लीड्स को HubSpot, Salesforce, या Google Sheets में लाना
- HubSpot: Data Management > Data Integration > Import data > Quick import (contacts only) पर जाएँ। अपनी
.csvया.xlsxफ़ाइल अपलोड करें। HubSpot का import guide field mapping समझाता है। - Salesforce: Data Import Wizard का उपयोग करें। CSV तैयार करें, source fields को Salesforce fields से map करें, और import चलाएँ।
- Google Sheets / Airtable / Notion: Thunderbit तीनों में सीधे एक्सपोर्ट करता है — CSV intermediary की ज़रूरत नहीं।
टिप: इम्पोर्ट करने से पहले अपने scraped columns को CRM fields से map कर लें। कुछ मिनट का mapping बाद में घंटों की manual cleanup बचा सकता है।
SuperPages बनाम अन्य लोकल बिज़नेस डायरेक्टरीज़: सबसे अच्छी लीड्स कहाँ मिलेंगी
SuperPages एक मज़बूत शुरुआती बिंदु है, लेकिन यह अकेली डायरेक्टरी नहीं है जिसे स्क्रैप करना चाहिए। तुलना कुछ ऐसी है:
| डायरेक्टरी | लीड वॉल्यूम | उपलब्ध डेटा फ़ील्ड्स | डेटा की ताज़गी | स्क्रैपिंग कठिनाई | सबसे अच्छा उपयोग |
|---|---|---|---|---|---|
| SuperPages | बड़ा (US-केंद्रित) | नाम, फ़ोन, पता, वेबसाइट, कैटेगरी, रेटिंग्स | मध्यम | मध्यम | Home services, contractors, SMBs |
| Yellow Pages | बड़ा (US-केंद्रित) | SuperPages जैसी ही | मध्यम | मध्यम | सामान्य लोकल बिज़नेस आउटरीच |
| Google Maps | बहुत बड़ा (वैश्विक) | नाम, फ़ोन, पता, वेबसाइट, रिव्यूज़, घंटे, फ़ोटो | उच्च (owner-updated) | उच्च (आक्रामक anti-bot) | सबसे ताज़ा लोकल डेटा |
| Yelp | बड़ा (US-केंद्रित) | नाम, फ़ोन, पता, रिव्यूज़, price range | उच्च | उच्च | रेस्टोरेंट, रिटेल, सर्विस बिज़नेस |
| Manta | मध्यम | नाम, फ़ोन, पता, revenue estimates, employee count | मध्यम | कम | B2B prospecting (revenue/employee data) |
| BBB | मध्यम | नाम, फ़ोन, पता, accreditation, शिकायतें | मध्यम | कम | भरोसेमंद/जाँचे-परखे बिज़नेस |
स्रोत: SuperPages homepage, VLDB SuperPages paper, Google Places API docs, Yelp Places API docs, Manta homepage, BBB guide।
Thunderbit इन सब पर काम करता है — लोकप्रिय साइट्स जैसे Google Maps और SuperPages के लिए Instant Templates सहित — इसलिए आप एक ही workflow को कई स्रोतों पर लागू कर सकते हैं और अपनी लीड लिस्ट्स मिला सकते हैं। मेरे अनुभव में, सबसे अच्छा तरीका अक्सर एक ही कैटेगरी/शहर के लिए दो या तीन डायरेक्टरीज़ स्क्रैप करना और फिर deduplicate करना होता है। ओवरलैप गैप भर देता है और पूरी तस्वीर देता है।
अन्य डायरेक्टरीज़ को स्क्रैप करने के बारे में अधिक जानकारी के लिए हमारे Yellow Pages scrapers, Google Maps scrapers, और Yelp scrapers गाइड देखें।
SuperPages लीड्स स्क्रैप करने के लिए कानूनी और नैतिक सुझाव

मैं वकील नहीं हूँ, और यह कानूनी सलाह भी नहीं है — लेकिन इस क्षेत्र में इतना समय बिताया है कि इतना ज़रूर जानता हूँ: compliance को नज़रअंदाज़ करना जल्दी नुकसान कराता है। यहाँ व्यावहारिक बातें हैं।
सार्वजनिक बिज़नेस डेटा बनाम व्यक्तिगत डेटा
बिज़नेस लिस्टिंग्स — कंपनी का नाम, बिज़नेस फ़ोन, बिज़नेस पता, बिज़नेस वेबसाइट — आम तौर पर सार्वजनिक व्यावसायिक डेटा मानी जाती हैं। यह GDPR या CCPA के तहत व्यक्तिगत उपभोक्ता डेटा से अलग है। लेकिन “public” का मतलब यह नहीं कि “कोई नियम लागू नहीं होते।” हमेशा साइट के Terms of Service देखें।
SuperPages के Terms of Use (जुलाई 2019 में अपडेटेड) में एक “Data Mining Prohibited” क्लॉज़ है: Thryv की पूर्व सहमति के बिना users bots, crawlers, spiders, या इसी तरह के टूल्स का उपयोग करके डेटा इकट्ठा या निकाल नहीं सकते। यह लेख तरीके और workflows पर चर्चा करता है, लेकिन स्केल पर स्क्रैपिंग से पहले आपको इन शर्तों की समीक्षा करनी चाहिए और जहाँ ज़रूरी हो अनुमति लेनी चाहिए।
आउटरीच compliance: CAN-SPAM और TCPA की बुनियादी बातें
अगर आप स्क्रैप किए गए ईमेल्स का उपयोग cold outreach के लिए कर रहे हैं, तो FTC की CAN-SPAM guide के अनुसार आपको:
- झूठे या भ्रामक header का उपयोग नहीं करना चाहिए
- deceptive subject lines नहीं देने चाहिए
- ज़रूरत होने पर संदेश को ad के रूप में पहचानना चाहिए
- एक वैध physical postal address शामिल करना चाहिए
- स्पष्ट opt-out सुविधा देनी चाहिए और उसे तुरंत मानना चाहिए
अगर आप स्क्रैप किए गए फ़ोन नंबरों पर cold calls कर रहे हैं, तो National Do Not Call Registry जाँचें और TCPA नियमों का पालन करें — खासकर automated calls, prerecorded messages, और SMS के मामले में। FTC ने 2024 में deceptive B2B telemarketing और AI-enabled scam calls से सुरक्षा मजबूत करने के लिए बदलावों की घोषणा की थी।
त्वरित compliance checklist
- ✅ सिर्फ़ सार्वजनिक रूप से सूचीबद्ध बिज़नेस डेटा स्क्रैप करें
- ✅ SuperPages की Terms of Use पढ़ें और जहाँ आवश्यक हो अनुमति लें
- ✅ आउटरीच से पहले कॉन्टैक्ट्स वेरिफ़ाई करें
- ✅ ईमेल्स में opt-out शामिल करें
- ✅ robots.txt और rate limits का सम्मान करें
- ✅ DNC और email suppression lists बनाए रखें
- ⚠️ व्यक्तिगत/उपभोक्ता डेटा स्क्रैप करने से बचें
- ⚠️ कानूनी समीक्षा के बिना raw scraped data दोबारा न बेचें
अपना तरीका चुनें और अपनी लीड लिस्ट बनाना शुरू करें
SuperPages से लीड्स स्क्रैप करना सिर्फ़ वेब पेज से पंक्तियाँ निकालना नहीं है। असली value पूरे pipeline में है: scrape, clean, deduplicate, verify, enrich, import, और compliant तरीके से outreach।
त्वरित सारांश:
- Thunderbit सेल्स टीमें, एजेंसियाँ, और नॉन-डेव्स के लिए सबसे तेज़ रास्ता है। दो क्लिक में स्क्रैप करें, एक क्लिक में subpages से enrich करें, और Google Sheets, Airtable, Notion, या Excel में मुफ़्त एक्सपोर्ट करें। फ्री में आज़माएँ।
- Octoparse सेमी-टेक्निकल यूज़र्स के लिए एक अच्छा visual workflow tool है, जिन्हें कॉन्फ़िगरेशन पर थोड़ा अधिक नियंत्रण चाहिए।
- Python डेवलपर्स को पूरा लचीलापन देता है — लेकिन साथ में maintenance, anti-blocking की परेशानियाँ, और built-in enrichment की कमी भी आती है।
- और याद रखें: यही workflow Yellow Pages, Google Maps, Yelp, Manta, और BBB पर भी लागू होता है। कई स्रोत स्क्रैप करें, merge करें, deduplicate करें, और आपके पास सबसे पूरी लोकल लीड लिस्ट होगी।
अगर आप Thunderbit को काम करते देखना चाहते हैं, तो walkthroughs के लिए हमारा YouTube channel देखें, या अपनी टीम के लिए सही विकल्प देखने हेतु Thunderbit pricing देखें।
अब जाइए और इन डायरेक्टरी पेजों को अपनी पाइपलाइन में बदल दीजिए — और आपकी फ़ोन नंबर हमेशा सही फ़ॉर्मैट में हों, और ईमेल हमेशा वेरिफ़ाइड हों।
FAQs
क्या SuperPages से लीड्स स्क्रैप करना कानूनी है?
सार्वजनिक रूप से उपलब्ध बिज़नेस डायरेक्टरी डेटा को B2B रिसर्च के लिए स्क्रैप करना आम बात है, लेकिन SuperPages की Terms of Use Thryv की पूर्व सहमति के बिना data mining पर रोक लगाती है। हमेशा साइट की शर्तें देखें, जहाँ ज़रूरी हो अनुमति लें, और CAN-SPAM तथा TCPA जैसे आउटरीच नियमों का पालन करें। यह लेख शिक्षा के उद्देश्य से तरीके और workflows बताता है — उनका उपयोग compliant तरीके से करना आपकी ज़िम्मेदारी है।
SuperPages से मुझे कौन-सा डेटा मिल सकता है?
एक सामान्य स्क्रैप में बिज़नेस नाम, फ़ोन, पता, वेबसाइट, कैटेगरी, रेटिंग्स, घंटे, और विवरण मिलते हैं। ईमेल आम तौर पर search results page पर नहीं दिखते — उन्हें पाने के लिए आपको business detail page या कंपनी की अपनी वेबसाइट (subpage scraping या email extractor के जरिए) देखनी पड़ती है।
क्या मैं बिना कोडिंग के SuperPages स्क्रैप कर सकता हूँ?
हाँ। Thunderbit (AI Chrome extension) और Octoparse (visual scraper) जैसे टूल्स आपको एक भी कोड लाइन लिखे बिना SuperPages स्क्रैप करने देते हैं। Thunderbit सबसे तेज़ विकल्प है — एक्सटेंशन इंस्टॉल करें, SuperPages search खोलें, "AI Suggest Fields" पर क्लिक करें, फिर "Scrape"।
SuperPages स्क्रैप करते समय pagination कैसे संभालूँ?
Thunderbit pagination को अपने आप संभालता है — यह "Next" बटन या infinite scroll पहचानता है और आगे बढ़ता रहता है। Octoparse में आपको workflow में pagination step कॉन्फ़िगर करना पड़ता है। Python में आपको manual page-loop logic लिखना पड़ता है (page numbers बढ़ाना, आख़िरी पेज पहचानना)।
SuperPages लिस्टिंग्स से ईमेल कैसे निकालूँ?
ज़्यादातर SuperPages लिस्टिंग्स search results page पर ईमेल नहीं दिखातीं। Thunderbit के Subpage Scraping से हर detail page खोलें, या business की वेबसाइट पर मुफ़्त Email Extractor इस्तेमाल करें। बची हुई gaps के लिए Apollo, BetterContact, या Prospeo जैसे enrichment tools आज़माएँ — लेकिन छोटे लोकल बिज़नेस के लिए अक्सर website-first extraction बड़े B2B databases से बेहतर काम करता है।
SuperPages लीड्स के लिए AI Web Scraper आज़माएँ Get Started Free
और जानें


