Minulý týden mi jeden z našich uživatelů napsal, že strávil celé odpoledne ručním přepisováním seznamů instalatérů ze SuperPages do tabulky — 47 řádků za tři hodiny. Bolí ho zápěstí, v datech měl překlepy a pořád neměl e-maily. Tahle historka mi byla až nepříjemně povědomá, protože jsem si tím taky prošel. A přesně tenhle typ problému jsme s Thunderbit chtěli vyřešit.
SuperPages je jeden z dlouhodobě fungujících amerických lokálních firemních katalogů, který spravuje Thryv. Pokrývá širokou škálu měst a oborů — instalatéry, zubaře, právníky, techniky HVAC a další. Starší technická dokumentace ho popisovala jako celostátní databázi Yellow Pages s více než 11 miliony záznamů a i dnes na webu najdete hutné lokální kategorie. Problém tedy není v tom, že by chyběly záznamy. Problém je dostat je do čistého, obohaceného seznamu leadů, aniž byste přišli o nervy (nebo celé odpoledne).
Podle reportu HubSpot Sales Trends 2024 tráví obchodníci skutečným prodejem jen asi 2 hodiny denně — zbytek spolknou úkoly jako zadávání dat a rešerše. A 81 % sales profesionálů říká, že by jim AI pomohla trávit méně času manuální prací. Tento průvodce ukazuje tři způsoby, jak získat leady ze SuperPages — od AI bez kódu až po Python — abyste si vybrali metodu podle své úrovně a mohli se vrátit k práci, která opravdu přináší výsledky.
Získejte leady ze SuperPages pomocí AI Get Started Free
Co je SuperPages (a proč ho obchodní týmy milují pro získávání leadů)
SuperPages je americký online katalog firem, kde jsou lokální podniky uvedeny s kontakty, kategoriemi, hodnocením a dalšími údaji. Představte si ho jako digitální verzi klasického telefonního seznamu Yellow Pages — jenže dnes se dá vyhledávat podle kategorie i lokality a u každého záznamu bývá mnohem víc dat.

Typický záznam na SuperPages může obsahovat:
- Název firmy
- Telefonní číslo
- Ulici a číslo popisné/orientační
- Webovou adresu (pokud je k dispozici)
- Kategorii (např. instalatérství, rodinné právo, HVAC)
- Hodnocení a recenze
- Otevírací dobu (většinou na detailní stránce)
- Popis (na detailní stránce)
Na domovské stránce SuperPages najdete populární kategorie jako Home Services, Plumbers, Electricians, Dentists, Legal Services, Auto Repair, Restaurants nebo Pet Services — přesně ty segmenty, na které se obchodní týmy, agentury i lokální poskytovatelé služeb zaměřují při outbound oslovení.
Zkrátka: SuperPages je zlatý důl pro každého, kdo hledá lokální firmy v USA. Data jsou strukturovaná, pokrytí je široké a kategorie se dobře hodí pro reálné outbound kampaně.
Vyzkoušejte Thunderbit pro leady ze SuperPages
Proč SuperPages pro leady scrapovat (hlavní use case)
Ruční procházení SuperPages a kopírování dat do tabulky je černá díra na produktivitu. Scraping tenhle proces automatizuje a během minut vám dodá cílený, strukturovaný seznam místo hodin práce. A protože si sami určujete hledání (kategorie + město + klíčové slovo), bývá výstup často relevantnější než obecně koupený seznam leadů.
Tady jsou nejčastější scénáře, které vídám u našich uživatelů:
| Use case | Kdo z toho těží | Příklad |
|---|---|---|
| Lokální generování leadů | Obchodní týmy, agentury | Vytvořit seznam instalatérů v Dallasu pro cold outreach |
| Analýza konkurence | Operations, marketing | Porovnat hodnocení a služby konkurentů na trhu |
| Mapování trhu | Business development | Najít všechny zubaře v PSČ pro uvedení nového produktu |
| Vyhledávání dodavatelů | Nákup, operations | Najít dodavatele v regionu s telefonem i webem |
| Local SEO prospecting | Agentury | Najít firmy bez webu nebo se slabými údaji v profilu |
| Plánování teritoria | Terénní obchod | Roztřídit dodavatele podle města, PSČ nebo servisní oblasti |
Americký trh B2B lead generation byl v roce 2024 odhadován na 8,5 miliardy USD a do roku 2034 má vyrůst na 18,2 miliardy USD — takže poptávka po tomto typu dat rozhodně neklesá. Čerstvě vyexportovaný seznam podle kategorie a lokality může být cílenější než obecně koupený seznam, ale před oslovením ho stejně je potřeba ověřit a deduplikovat (víc o tom níže).
Jak vypadá finální výstup: ukázka nascrapovaných dat ze SuperPages
Než se pustíme do postupu, chci vám ukázat, co vlastně na konci získáte. To je část, kterou většina návodů přeskakuje — ale pokud do toho investujete čas, je fér vědět, jaký bude výsledek.
Tady je ukázková tabulka výstupu (fiktivní data, realistická struktura):
| Název firmy | Telefon | Adresa | Web | Kategorie | Hodnocení | Otevírací doba | E-mail (obohacený) |
|---|---|---|---|---|---|---|---|
| Sunset Pipe & Drain Co. | +1 213-555-0148 | 1842 W 7th St, Los Angeles, CA 90057 | sunsetpipe.example | Plumbing | 4.6 | Po–Pá 7:00–18:00 | service@sunsetpipe.example |
| Arroyo HVAC Pros | +1 626-555-0182 | 72 N Fair Oaks Ave, Pasadena, CA 91103 | arroyohvac.example | HVAC | 4.8 | Po–So 8:00–19:00 | hello@arroyohvac.example |
| Wilshire Family Dental | +1 323-555-0119 | 4100 Wilshire Blvd, Los Angeles, CA 90010 | wilshiredental.example | Dentists | 4.4 | Po–Čt 9:00–17:00 | appointments@wilshiredental.example |
| Pacific Legal Aid Group | +1 310-555-0173 | 11845 W Olympic Blvd, Los Angeles, CA 90064 | Legal Services | 4.2 | Po–Pá 8:30–17:30 | intake@pacificlegal.example | |
| Valley Auto Repair Center | +1 818-555-0198 | 14422 Ventura Blvd, Sherman Oaks, CA 91423 | valleyautorepair.example | Auto Repair | 4.7 | Po–So 8:00–18:00 | info@valleyautorepair.example |
| Echo Park Pet Grooming | +1 213-555-0166 | 1511 Sunset Blvd, Los Angeles, CA 90026 | echoparkpets.example | Pet Grooming | 4.9 | Út–Ne 9:00–17:00 | booking@echoparkpets.example |
Na pár věcí je dobré upozornit:
- Ze stránky s výsledky hledání: název firmy, telefon, částečná adresa, kategorie, hodnocení, URL záznamu.
- Z detailní stránky firmy (podstránka): plná adresa, otevírací doba, popis, recenze, někdy i web.
- Z obohacení: e-mail (často jen na vlastním webu firmy nebo přes nástroje pro enrichment).
- Z čištění dat: telefon ve formátu E.164, normalizované stát/PSČ, deduplikované klíče, zdrojová URL a datum scrapování.
Tohle je typ výstupu, který můžete rovnou nahrát do CRM, Google Sheets nebo Airtable a okamžitě s ním pracovat.
3 způsoby, jak scrapovat SuperPages pro leady: rychlé srovnání

Ne každý má stejnou technickou úroveň — nebo stejnou dávku trpělivosti. Tady jsou tedy tři metody vedle sebe, ať si můžete vybrat tu pravou:
| Kritérium | Thunderbit (AI bez kódu) | Vizuální scraper (např. Octoparse) | Python (Requests + BS4) |
|---|---|---|---|
| Doba nastavení | ~2 min (instalace rozšíření) | ~15 min (vytvoření workflow) | ~30 min (instalace knihoven, psaní kódu) |
| Nutnost programování | Ne | Ne | Ano (Python) |
| Řešení stránkování | Vestavěné (kliknutí nebo scroll) | Je potřeba nastavit | Ruční kód |
| Obohacení podstránek | 1 kliknutí: Scrape Subpages | Samostatný workflow/smyčka | Samostatný skript |
| Ochrana proti blokování | Cloud Scraping to řeší | Záleží na tarifu/proxy doplňku | Vlastní řešení (proxy, hlavičky, limity) |
| Možnosti exportu | Excel, Google Sheets, Airtable, Notion, CSV, JSON | CSV, Excel, databáze | Podle toho, co si naprogramujete |
| Nejvhodnější pro | Obchodní týmy, agentury, neprogramátory | Mírně techničtí uživatelé | Vývojáře, kteří chtějí plnou kontrolu |
Moje doporučení: Pokud chcete začít scrapovat během 2 minut, jděte na Metodu 1. Pokud preferujete vizuální workflow a nevadí vám nějaká konfigurace, zkuste Metodu 2. Pokud chcete plnou kontrolu a umíte Python, přeskočte rovnou na Metodu 3.
Metoda 1: Scraping SuperPages pro leady s Thunderbit (AI, bez kódu)
Tohle je nejrychlejší cesta od „mám vyhledávání na SuperPages“ k „mám seznam leadů“. Žádný kód, žádné workflow buildery, žádné nastavování proxy. Jsem zaujatý — Thunderbit jsme vytvořili my — ale projdu s vámi přesně, co se děje, abyste si mohli udělat vlastní názor.
Obtížnost: Začátečník
Časová náročnost: ~5 minut pro kompletní scrape kategorie/města
Co budete potřebovat: Prohlížeč Chrome, rozšíření Thunderbit pro Chrome (funguje i bezplatný tarif)
Krok 1: Nainstalujte Thunderbit a otevřete SuperPages
Přejděte na stránku pro stažení rozšíření Thunderbit pro Chrome a nainstalujte rozšíření Thunderbit. Zabere to zhruba minutu. Po instalaci přejděte na stránku s výsledky vyhledávání na SuperPages — například vyhledejte „Plumbers in Los Angeles, CA“ na superpages.com.
V liště prohlížeče byste měli vidět ikonu Thunderbit a připravený postranní panel.
Krok 2: Klikněte na „AI Suggest Fields“ pro automatické rozpoznání sloupců
Otevřete postranní panel Thunderbit a klikněte na „AI Suggest Fields“. AI Thunderbitu si stránku přečte a automaticky doporučí sloupce podle toho, co najde — typicky název firmy, telefon, adresu, web, kategorii, hodnocení a URL záznamu.
Sloupce můžete před scrapováním upravit, přidat nebo odebrat. Chcete přidat vlastní sloupec typu „Má web?“ nebo „Servisní oblast?“ Stačí zadat popis běžnou angličtinou do Field AI Prompt. Například můžete sloupci zadat, aby „formátoval telefon jako +1XXXXXXXXXX“ nebo „zařadil firmu jako residential vs. commercial“.
Teď byste měli v panelu Thunderbit vidět náhled tabulky s nastavenými sloupci.
Krok 3: Klikněte na „Scrape“ a sledujte, jak se data plní
Stiskněte modré tlačítko „Scrape“. Thunderbit vytáhne všechny záznamy na aktuální stránce a vyplní tabulku řádek po řádku. U typické stránky s výsledky SuperPages to trvá asi 30–45 sekund.
Thunderbit automaticky řeší stránkování — rozpozná tlačítko „Next“ nebo nekonečný scroll a pokračuje, dokud nedojde na konec nebo nedosáhne vašeho limitu. Pokud scrapujete velký objem výsledků (třeba všechny instalatéry v metropolitní oblasti), přepněte do režimu Cloud Scraping, který zvládne až 50 stránek najednou, aniž by zatížil váš prohlížeč.
Krok 4: Použijte Scrape Subpages pro obohacení každého záznamu

Stránka s výsledky vám dá základní údaje, ale skutečný poklad — otevírací dobu, plný popis, recenze a někdy i e-mail — najdete na detailní stránce každé firmy. Klikněte na „Scrape Subpages“ a Thunderbit navštíví detail každého záznamu a stáhne obohacené sloupce jako otevírací dobu, popis, URL webu a další kontaktní údaje, které jsou tam viditelné.
Tohle je proces na jedno kliknutí. Žádné samostatné workflow, žádná konfigurace. Obohacená data se přidají přímo do vaší existující tabulky.
Krok 5: Exportujte leady do Excelu, Google Sheets, Airtable nebo Notion
Když jste s daty spokojení, klikněte na Export. Thunderbit umožňuje poslat leady přímo do:
- Google Sheets (skvělé pro přípravu CRM a sdílení)
- Airtable (lehké pipeline tabulky)
- Notion (databáze pro rešerši)
- Excel / CSV (import do CRM)
- JSON (předání vývojářům)

Všechny exportní možnosti jsou zdarma. Pokud leady posíláte do HubSpotu nebo Salesforce, bývá nejrychlejší cesta přes CSV nebo Google Sheets.
Tip: Scrapujte podle kategorie + města, ne podle širokého vyhledávání na úrovni celého státu. „Emergency plumbers Dallas TX“ vám dá mnohem užší a akčnější seznam než „plumbers Texas“. Přidejte si sloupce „Source URL“ a „Scraped At“ kvůli dohledatelnosti.
Metoda 2: Scraping SuperPages pomocí vizuálního nástroje (příklad Octoparse)
Vizuální nástroje jako Octoparse jsou něco mezi: nevyžadují kód, ale nastavení je složitější než u Thunderbitu. Octoparse má dokonce předpřipravenou šablonu pro SuperPages pro jednodušší scénáře.
Obtížnost: Střední
Časová náročnost: ~20–30 minut na nastavení + scraping
Co budete potřebovat: Účet v Octoparse (k dispozici je free plán s omezeními)
Krok 1: Vytvořte nový task a načtěte URL SuperPages
Otevřete Octoparse, klikněte na „New Task“ a vložte URL vyhledávání ze SuperPages (např. „https://www.superpages.com/los-angeles-ca/plumbers“). Vestavěný prohlížeč stránku načte.
Krok 2: Automaticky rozpoznejte nebo ručně vyberte data
Klikněte na „Auto-detect“ — Octoparse projde stránku a zvýrazní datová pole, která považuje za relevantní. Zkontrolujte panel Data Preview. Z mojí zkušenosti auto-detekce často zachytí většinu polí, ale někdy přidá i něco navíc (např. reklamní štítky nebo navigační text) nebo naopak něco vynechá. Pravděpodobně budete muset pár polí ručně přidat nebo odebrat.
Podle nápovědy Octoparse vytvoří auto-detekce základní workflow včetně stránkování a kroků pro extrakci dat, ale uživatelé často musí chybějící údaje doplnit ručně.
Krok 3: Sestavte workflow a nastavte stránkování
Klikněte na „Create workflow“. Octoparse vygeneruje sled kroků. Zkontrolujte krok stránkování — ujistěte se, že správně kliká na „Next“ nebo načítá další výsledky. Pokud chcete data z detailní stránky každé firmy (otevírací dobu, e-mail, popis), musíte do workflow přidat smyčku přes detailní stránky nebo akci na podstránkách. Oproti jedním kliknutím v Thunderbitu je to složitější.
Krok 4: Spusťte úlohu a exportujte data
Úlohu spusťte lokálně (pro menší projekty) nebo v cloudu Octoparse (pro plánované či větší běhy — cloud je placená funkce). Po dokončení exportujte data jako CSV, Excel nebo JSON.
Na co si dát pozor: Bezplatný plán Octoparse zahrnuje 10 úloh, až 50 000 řádků měsíčně a pouze lokální extrakci. Cloud běhy, rotace IP, řešení CAPTCHA a některé exportní integrace vyžadují placený tarif (začíná zhruba na 69 USD měsíčně při roční platbě).
Metoda 3: Scraping SuperPages v Pythonu (Requests + BeautifulSoup)
Tohle je vývojářská varianta. Plná kontrola, plná zodpovědnost. Pokud umíte psát a udržovat Python skripty, získáte největší flexibilitu — ale i nejvíc starostí.
Obtížnost: Pokročilá
Časová náročnost: ~30–60 minut (nastavení + kódování + ladění)
Co budete potřebovat: Python 3.x, pip, requests, beautifulsoup4, lxml, editor kódu
Krok 1: Nastavte Python prostředí
python -m venv .venv
source .venv/bin/activate
pip install requests beautifulsoup4 lxml pandas
Krok 2: Prozkoumejte HTML strukturu SuperPages
Na stránce s výsledky SuperPages otevřete vývojářské nástroje (F12). Najděte CSS selektory pro název firmy, adresu, telefon, web a odkaz na detailní stránku. Mějte na paměti, že se HTML struktura může změnit bez varování, takže vaše selektory se mohou kdykoliv rozbít.
Krok 3: Napište scraper seznamu a řešte stránkování
Tady je zjednodušený příklad. Důležité upozornění: Při mém testování vrátil přímý Request na SuperPages blokovací stránku Cloudflare „Attention Required“. Naivní Requests skript může ve větším měřítku selhat — možná budete potřebovat kontext browser session, rate limiting, retry logiku nebo autorizované alternativy.
import csv, time
from urllib.parse import urljoin
import requests
from bs4 import BeautifulSoup
BASE_URL = "https://www.superpages.com"
HEADERS = {
"User-Agent": (
"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
"AppleWebKit/537.36 (KHTML, like Gecko) "
"Chrome/125.0 Safari/537.36"
)
}
def fetch(url):
resp = requests.get(url, headers=HEADERS, timeout=20)
resp.raise_for_status()
if "Attention Required" in resp.text or "Cloudflare" in resp.text:
raise RuntimeError("Blokováno. Zpomalte nebo přejděte na browser/cloud scraping.")
return BeautifulSoup(resp.text, "lxml")
def parse_listing(card):
name_el = card.select_one(".business-name, a.business-name, h2 a, h3 a")
phone_el = card.select_one(".phones, .phone, [class*=phone]")
address_el = card.select_one(".street-address, .adr, [class*=address]")
website_el = card.select_one("a.track-visit-website, a[href*='http']")
rating_el = card.select_one(".rating, [class*=rating]")
detail_url = urljoin(BASE_URL, name_el.get("href")) if name_el and name_el.get("href") else ""
return {
"business_name": name_el.get_text(" ", strip=True) if name_el else "",
"phone": phone_el.get_text(" ", strip=True) if phone_el else "",
"address": address_el.get_text(" ", strip=True) if address_el else "",
"website": website_el.get("href", "") if website_el else "",
"rating": rating_el.get_text(" ", strip=True) if rating_el else "",
"detail_url": detail_url,
}
def scrape_search(search_url, pages=3):
all_rows = []
for page in range(1, pages + 1):
page_url = f"{search_url}?page={page}"
soup = fetch(page_url)
cards = soup.select(".result, .organic, [class*=result]")
if not cards:
break
for card in cards:
all_rows.append(parse_listing(card))
time.sleep(5)
return all_rows
if __name__ == "__main__":
rows = scrape_search("https://www.superpages.com/los-angeles-ca/plumbers", pages=2)
with open("superpages_leads.csv", "w", newline="", encoding="utf-8") as f:
writer = csv.DictWriter(f, fieldnames=sorted({k for row in rows for k in row}))
writer.writeheader()
writer.writerows(rows)
Krok 4: Scrape detailních stránek pro obohacení dat
Napište samostatnou funkci, která navštíví URL každé detailní stránky a vytáhne otevírací dobu, e-mail, popis a recenze. To znamená řízení rate limitů, chyb a případně i proxy — vše na vás.
Krok 5: Uložte data do CSV nebo JSON
Použijte moduly csv nebo json v Pythonu. Budete si také muset sami napsat deduplikaci, čištění a exportní logiku.
Časté problémy:
- SuperPages může requesty blokovat pomocí Cloudflare nebo jiných anti-bot systémů (potvrzeno při mém testování).
- Selektory jsou tady záměrně obecné, protože se markup SuperPages může měnit.
- Nepředpokládejte, že výsledková stránka obsahuje e-maily. Téměř nikdy je neobsahuje.
- Produkční scraper vyžaduje kontrolu robots/TOS, rate limiting, retry/backoff, strukturované logování a zachytávání chyb.
Pokud chcete jít hlouběji do Python scrapingu, podívejte se na naše návody na web scraping v Pythonu nebo na tutoriál k BeautifulSoup.
Od syrových dat ke skutečným leadům: celý pipeline (scrape → vyčištění → ověření → CRM)
Tady většina návodů končí — a právě tady začíná skutečná hodnota. Scraping vám dá surový materiál. Proměnit ho v použitelný seznam leadů vyžaduje ještě několik kroků.

Pipeline vypadá takto:
Vyhledávání na SuperPages → scraping záznamů → scraping detailních stránek / webů → export do Google Sheets nebo CSV → čištění telefonů, adres a kategorií → deduplikace → ověření e-mailů/telefonů → obohacení chybějících kontaktů → import do CRM → compliant outreach
Deduplikace: odstranění duplicitních záznamů
SuperPages často zobrazuje stejnou firmu ve více kategoriích. Pokud scrapujete „plumbers“ i „drain cleaning“ ve stejném městě, budou se záznamy překrývat.
- Primární deduplikace: normalizované telefonní číslo + normalizovaná ulice a adresa.
- Sekundární: doména + město.
- Náhradní varianta: název firmy + PSČ (u franšíz ručně zkontrolujte).
V Google Sheets použijte =UNIQUE(A:H) pro přesné shody řádků nebo si vytvořte pomocný sloupec třeba pomocí =LOWER(REGEXREPLACE(B2&C2,"[^a-zA-Z0-9]","")) pro zachycení téměř duplicit. V Excelu použijte Data > Remove Duplicates.
Čištění dat: standardizace telefonů, adres a formátování
- Telefonní čísla formátujte do E.164 (pro USA: +1 a 10 číslic). To je formát, který očekává většina CRM a dialerů. V Thunderbitu můžete použít Field AI Prompt a nechat formátování proběhnout už při scrapování.
- Normalizujte adresy: rozepište zkratky, doplňte chybějící PSČ a případně rozdělte data do sloupců ulice/město/stát/PSČ.
- Odstraňte HTML artefakty, přebytečné mezery a trackovací parametry z URL.
- Přidejte sloupce
source_directory,source_urlascraped_atpro dohledatelnost.
Ověření e-mailů a telefonů před oslovením
Neposílejte cold email na každou adresu, kterou jste nascrapovali. Ověření chrání reputaci odesílatele a drží bounce rate nízko.
- Ověření e-mailu: ZeroBounce (od cca 39 USD za 2 000 kreditů plus 100 bezplatných kreditů měsíčně) nebo Bouncer (8 USD za 1 000 kreditů, kredity neexpirují) jsou solidní volby.
- Ověření telefonu: Twilio Lookup nabízí formátování a validaci zdarma; caller ID stojí 0,01 USD za požadavek.
- Bezplatný Email Extractor a Phone Number Extractor od Thunderbitu mohou vytáhnout kontakty, které na stránkách záznamu chybí.
Obohacení: jak najít kontakty, když je SuperPages neuvádí
Mnoho záznamů na SuperPages vůbec e-mail nezobrazuje — hlavně na stránce s výsledky hledání. Co s tím:
- Scrape stránky webu firmy typu Kontakt, O nás nebo patičku. Thunderbitův Scrape Subpages nebo Email Extractor to zvládne hromadně.
- Použijte enrichment nástroje jako Apollo, BetterContact, Icypeas nebo Prospeo. Pozor: u malých lokálních firem (instalatér dva lidé, samostatný zubař) bývají velké B2B databáze často prázdné. Lepší bývá extrakce nejdřív z webu firmy.
- Spojte více adresářů. Nascrapujte SuperPages, Yellow Pages a Google Maps pro stejnou kategorii a město, pak data sloučte a deduplikujte. Překryv vám dá kompletnější záznamy.
Jestli jste někdy zkoušeli poslat lokální SMB seznam přes Apollo a dostali většinou prázdná pole, nejste sami. Proto je pro tento typ publika důležitý přístup „nejdřív web firmy“.
Import do CRM: jak dostat leady do HubSpotu, Salesforce nebo Google Sheets
- HubSpot: přejděte na Data Management > Data Integration > Import data > Quick import (contacts only). Nahrajte
.csvnebo.xlsx. Návod HubSpotu vás provede mapováním polí. - Salesforce: použijte Data Import Wizard. Připravte CSV, namapujte zdrojová pole na pole v Salesforce a spusťte import.
- Google Sheets / Airtable / Notion: Thunderbit exportuje přímo do všech tří — bez mezikroku v CSV.
Tip: Před importem si namapujte scrapené sloupce na pole v CRM. Pár minut mapování vám ušetří hodiny ručního čištění později.
SuperPages vs. jiné katalogy lokálních firem: kde najdete nejlepší leady
SuperPages je silný start, ale není to jediný katalog, který stojí za scraping. Takhle si vede v porovnání:
| Adresář | Objem leadů | Dostupná pole | Aktuálnost dat | Obtížnost proti scrapingu | Nejlepší pro |
|---|---|---|---|---|---|
| SuperPages | Velký (zaměření na USA) | Název, telefon, adresa, web, kategorie, hodnocení | Střední | Střední | Domácí služby, řemeslníci, SMB |
| Yellow Pages | Velký (zaměření na USA) | Podobné jako SuperPages | Střední | Střední | Obecné oslovení lokálních firem |
| Google Maps | Velmi velký (globální) | Název, telefon, adresa, web, recenze, otevírací doba, fotky | Vysoká (aktualizuje majitel) | Vysoká (agresivní anti-bot) | Nejaktuálnější lokální data |
| Yelp | Velký (zaměření na USA) | Název, telefon, adresa, recenze, cenová úroveň | Vysoká | Vysoká | Restaurace, retail, servisní firmy |
| Manta | Střední | Název, telefon, adresa, odhady tržeb, počet zaměstnanců | Střední | Nízká | B2B prospecting (data o tržbách/zaměstnancích) |
| BBB | Střední | Název, telefon, adresa, akreditace, stížnosti | Střední | Nízká | Důvěryhodné / prověřené firmy |
Zdroje: domovská stránka SuperPages, VLDB paper o SuperPages, dokumentace Google Places API, dokumentace Yelp Places API, domovská stránka Manta, průvodce BBB.
Thunderbit funguje napříč všemi těmito zdroji — včetně Instant Templates pro oblíbené weby jako Google Maps a SuperPages — takže můžete použít stejný workflow na více zdrojů a pak seznamy leadů sloučit. Z mojí zkušenosti bývá nejlepší nascrapovat dvě až tři databáze pro stejnou kategorii a město a potom deduplikovat. Překryvy doplní mezery a dají vám kompletnější obraz.
Více o scrapingu dalších katalogů najdete v našich průvodcích na Yellow Pages scrapers, Google Maps scrapers a Yelp scrapers.
Právní a etické tipy pro scraping leadů ze SuperPages

Nejsem právník a tohle není právní rada — ale v tomhle oboru jsem strávil dost času na to, abych věděl, že ignorovat compliance je nejrychlejší cesta k problémům. Tady je praktický přehled.
Veřejná firemní data vs. osobní údaje
Firemní záznamy — název společnosti, firemní telefon, firemní adresa, firemní web — jsou obecně považované za veřejná komerční data. To je něco jiného než osobní údaje spotřebitelů podle GDPR nebo CCPA. Ale „veřejné“ neznamená „bez pravidel“. Vždy si zkontrolujte podmínky používání webu.
Podmínky použití SuperPages (aktualizované v červenci 2019) obsahují klauzuli „Data Mining Prohibited“: uživatelé nesmí bez předchozího souhlasu Thryv používat boty, crawlery, spider nástroje ani podobné technologie k získávání nebo extrakci dat. Článek popisuje metody a workflow, ale před scrapováním ve větším měřítku byste si tyto podmínky měli projít a tam, kde je to nutné, získat povolení.
Compliance pro outreach: základy CAN-SPAM a TCPA
Pokud používáte nascrapované e-maily pro cold outreach, doporučení FTC ke CAN-SPAM říká, že musíte:
- Nepoužívat nepravdivé nebo zavádějící hlavičky
- Nepoužívat klamavé předměty e-mailů
- Uvést zprávu jako reklamu, pokud je to vyžadováno
- Připojit platnou fyzickou poštovní adresu
- Nabídnout jasný opt-out a rychle ho respektovat
Pokud používáte nascrapovaná telefonní čísla pro cold calling, zkontrolujte National Do Not Call Registry a dodržujte pravidla TCPA — zejména u automatizovaných hovorů, přednahraných zpráv a SMS. FTC v roce 2024 oznámila změny, které posilují ochranu proti klamavému B2B telemarketingu a podvodným AI hovorům.
Rychlý compliance checklist
- ✅ Scrapujte jen veřejně uvedená firemní data
- ✅ Projděte si Terms of Use SuperPages a tam, kde je to potřeba, získejte povolení
- ✅ Před oslovením kontakty ověřte
- ✅ Do e-mailů přidejte možnost opt-out
- ✅ Respektujte robots.txt a rate limits
- ✅ Veďte seznamy pro DNC a e-mailovou supresi
- ⚠️ Nescrapujte osobní/spotřebitelská data
- ⚠️ Nepřeprodávejte surová nascrapovaná data bez právní kontroly
Vyberte si metodu a začněte budovat svůj seznam leadů
Scraping leadů ze SuperPages není jen o vytahování řádků z webové stránky. Skutečná hodnota přichází až s celým pipeline: scrape, čištění, deduplikace, ověření, obohacení, import a compliant outreach.
Rychlé shrnutí:
- Thunderbit je nejrychlejší cesta pro obchodní týmy, agentury a neprogramátory. Dvě kliknutí na scraping, jedno kliknutí na obohacení přes subpages, bezplatný export do Google Sheets, Airtable, Notion nebo Excelu. Vyzkoušejte zdarma.
- Octoparse je solidní vizuální nástroj pro mírně techničtější uživatele, kteří chtějí větší kontrolu nad konfigurací.
- Python dává vývojářům plnou flexibilitu — ale také údržbu, problémy s blokováním a žádné vestavěné obohacení.
- A nezapomeňte: stejný postup funguje i pro Yellow Pages, Google Maps, Yelp, Manta a BBB. Scrape více zdrojů, spojte je, deduplikujte a získáte co nejúplnější lokální seznam leadů.
Pokud chcete Thunderbit vidět v akci, podívejte se na náš YouTube kanál s návody, nebo si projděte ceny Thunderbitu, abyste zjistili, co sedí vašemu týmu.
Teď z těch katalogových stránek udělejte pipeline — a ať máte telefonní čísla vždy správně naformátovaná a e-maily vždy ověřené.
Často kladené otázky
Je legální scrapovat SuperPages pro leady?
Scraping veřejně dostupných firemních dat pro B2B průzkum je běžná praxe, ale podmínky použití SuperPages zakazují data mining bez předchozího souhlasu Thryv. Vždy si projděte podmínky webu, tam kde je to nutné získejte povolení a dodržujte pravidla pro outreach, jako jsou CAN-SPAM a TCPA. Tento článek popisuje metody a workflow pouze pro vzdělávací účely — odpovědnost za jejich compliant použití je na vás.
Jaká data mohu ze SuperPages získat?
Typický scraping přinese název firmy, telefon, adresu, web, kategorii, hodnocení, otevírací dobu a popisy. E-maily se na stránce s výsledky hledání objevují zřídka — obvykle je potřeba navštívit detailní stránku firmy nebo vlastní web společnosti (pomocí scraping subpages nebo email extractoru), abyste je našli.
Můžu SuperPages scrapovat bez programování?
Ano. Nástroje jako Thunderbit (AI rozšíření pro Chrome) a Octoparse (vizuální scraper) vám umožní scrapovat SuperPages bez napsání jediného řádku kódu. Thunderbit je nejrychlejší volba — nainstalujete rozšíření, otevřete vyhledávání na SuperPages, kliknete na „AI Suggest Fields“ a pak na „Scrape“.
Jak řešit stránkování při scrapování SuperPages?
Thunderbit stránkování řeší automaticky — rozpozná tlačítko „Next“ nebo nekonečný scroll a pokračuje dál. Octoparse vyžaduje nastavení kroku pro stránkování ve workflow. V Pythonu musíte napsat ruční logiku pro procházení stránek (zvyšování čísla stránky, detekce poslední stránky).
Jak získám e-maily ze záznamů na SuperPages?
Většina záznamů na SuperPages e-maily na stránce s výsledky nezobrazuje. Použijte Thunderbit Scrape Subpages pro návštěvu detailní stránky každé firmy, nebo bezplatný Email Extractor na webu dané firmy. Pro zbylé mezery zkuste enrichment nástroje jako Apollo, BetterContact nebo Prospeo — u malých lokálních firem ale často funguje lépe extrakce přímo z webu firmy než velké B2B databáze.
Vyzkoušejte AI web scraper pro leady ze SuperPages Get Started Free
Zjistěte více


