Každých pár měsíců někdo na Redditu napíše nějakou variantu té samé stížnosti: „Proškrábal jsem Yellow Pages a dostal 500 řádků s telefonními čísly a adresami… ale žádné e-maily.“ Je to nejčastější frustrace, kterou vídám v komunitách kolem generování leadů, a po letech vývoje automatizačních nástrojů ve Thunderbit vám můžu říct, že ten problém je strukturální, ne náhodný.
Většina Yellow Pages scraperů vezme jen to, co je vidět na stránce s výsledky vyhledávání — název firmy, telefon, adresu, případně odkaz na web. Ale e-maily? Ty na kartě záznamu skoro nikdy nejsou. Jsou schované na jednotlivých profilových stránkách firem, nebo na Yellow Pages vůbec nejsou.
Pokud tedy váš scraper nenavštěvuje tyhle podstránky, necháváte ty nejcennější kontaktní údaje ležet ladem. Tenhle článek pokrývá 9 nástrojů, které jsem prozkoumal a vyhodnotil čistě podle toho, jestli skutečně umí z Yellow Pages získat e-maily — ne jen telefonní čísla a PSČ. Zahrnu také práci s anti-bot ochranou, ceny a to, jaký nástroj se hodí pro jaký typ uživatele.
Proč většina Yellow Page scraperů selhává při získávání e-mailů
Než se pustíme do nástrojů, je užitečné pochopit, proč tenhle problém vůbec existuje.
Stránky s výsledky na Yellow Pages jsou postavené hlavně kolem telefonních čísel, adres, otevírací doby a odkazů na web. E-mail není standardní pole na kartě výsledku vyhledávání. Současná dokumentace scraperů i příklady použití to potvrzují: e-mail na kartě záznamu obvykle chybí a je potřeba ho dohledat buď na profilové stránce firmy, nebo na jejím vlastním webu.
ParseBird Yellow Pages Scraper od Apify je v tomhle ohledu neobvykle otevřený. Jasně odděluje „listing mode“ od „detail mode“ a uvádí, že výtěžnost e-mailů bývá typicky jen 15–25 % záznamů, i když je zapnutá extrakce z detailních stránek. To znamená, že i v nejlepším případě je získávání e-mailů z Yellow Pages dost omezené — a většina nástrojů se o to ani nepokouší.
Nejčastěji selhávají tři věci:
- Scraper čte jen stránku s výsledky vyhledávání. Žádné návštěvy podstránek, žádný e-mail.
- Scraper sice otevře detailní stránku, ale neumí z ní vyčíst e-mailová pole. Pořád žádný e-mail.
- Firma e-mail na Yellow Pages vůbec nezveřejnila. Žádný nástroj nemůže vytáhnout něco, co neexistuje.
Některé firmy navíc přesměrovávají kontakt přes formuláře nebo tlačítka typu „Email Business“ místo zobrazení samotné e-mailové adresy. Scraper může být technicky „funkční“, a přesto vracet výstup, který je z 95 % jen telefon a adresa.
Poučení: pokud vám jde o získávání e-mailů, klíčová funkce, kterou máte hledat, je scraping podstránek — tedy schopnost navštívit detailní stránku každé firmy a vytáhnout data, která na hlavním záznamu nejsou.
Co hledat v nejlepších Yellow Page scrapech
Všech 9 nástrojů jsem hodnotil podle sedmi kritérií, z nichž každé vychází ze skutečných problémů z Reddit vláken, scraping fór a komunit pro lead gen.
Spolehlivost extrakce e-mailů
To je vlastně důvod, proč tenhle článek existuje. Vrací nástroj opravdu e-mailové adresy, nebo jen názvy a telefonní čísla? Klíčová schopnost je scraping podstránek — návštěva profilové stránky každé firmy, kde se mohou skrývat e-maily, které na kartě záznamu nevidíte.
Anti-bot ochrana a řešení blokací
Yellow Pages používá Cloudflare Bot Management, včetně požadavků na renderování JavaScriptu, browser fingerprintingu, rate limitů a CAPTCHA výzev. Živý požadavek, který jsem testoval 27. dubna 2026, vrátil během několika sekund blokovací stránku Cloudflare. Nástroje, které to neumí řešit nativně, vás nechají koukat na chybové stránky.
Cena a dostupnost free tieru
Více uživatelů na Redditu výslovně hledá „ideálně zdarma nebo levné scrapery“. Je tu jasný rozdíl mezi plně bezplatnými rozšířeními do prohlížeče, cloudovými nástroji se стартovacími kredity a enterprise platformami s individuální cenou.
Podpora stránkování
Yellow Pages zobrazuje přibližně 30 výsledků na stránku a širší dotazy mohou vracet 500–2 000+ výsledků. Scraper bez automatického stránkování zachytí jen zlomek dostupných dat.
Možnosti exportu
Prodejní týmy potřebují výstup připravený pro CRM: CSV, Excel, Google Sheets, Airtable. Některé nástroje vyvážejí jen JSON nebo surové HTML, což znamená další zpracování, než jsou data použitelná.
Potřebná technická úroveň
Publikum je rozdělené. Obchodníci a majitelé agentur chtějí nástroj na dvě kliknutí. Vývojáři chtějí API přístup a flexibilitu v Pythonu. Každý nástroj jsem proto ohodnotil od začátečníka po experta.
Skórování leadů a obohacování dat
Jak to vystihl jeden uživatel Redditu: „surová data bez skórování jsou jen tabulka.“ Nástroje, které během scrapingu umí data označovat, kategorizovat nebo obohacovat, šetří hodiny následného zpracování.
Nejlepší Yellow Page scrapery na první pohled
Úplné srovnání všech 9 nástrojů je níže. Rychlé vysvětlení symbolů: ✅ znamená, že to nástroj zvládá dobře hned po vybalení, ⚠️ znamená, že je to možné, ale vyžaduje to dodatečnou konfiguraci nebo má omezení, a ❌ znamená, že to nástroj nativně nepodporuje.
| Nástroj | Typ | Free tier | E-maily? | Anti-bot | Stránkování | Úroveň dovedností | Formáty exportu | Nejlepší pro |
|---|---|---|---|---|---|---|---|---|
| Thunderbit | Rozšíření do Chromu + cloud | ✅ (6 stránek/měsíc) | ✅ (podstránky + Email Extractor) | ✅ Přepínání cloud/prohlížeč | ✅ Automatické | Začátečník | Excel, CSV, JSON, Sheets, Airtable, Notion | Obchodní a provozní týmy bez technických znalostí |
| Apify YP Scraper | Cloudový actor | ✅ ($5 kreditů) | ⚠️ 15–25 % s detailními stránkami | ✅ Proxy pool | ✅ Vestavěné | Středně pokročilý | JSON, CSV, Excel, XML | Cloudové scrapingové kampaně ve velkém |
| WebScraper.io | Rozšíření do Chromu + cloud | ✅ (bezplatné rozšíření) | ⚠️ Ruční konfigurace | ✅ Cloud plány | ✅ Na selektorech | Středně pokročilý | CSV, XLSX, JSON, Sheets | Uživatelé vizuálních scraperů |
| Instant Data Scraper | Rozšíření do Chromu | ✅ Zcela zdarma | ❌ Nespolehlivé | ❌ Žádná | ⚠️ Ruční | Začátečník | CSV, XLSX | Rychlé jednorázové scrapování |
| Outscraper | API/Cloud | ✅ (500 firem) | ⚠️ Je potřeba obohacení | ✅ Spravované | ✅ Automatické | Začátečník–středně pokročilý | CSV, JSON, XLSX | Levné directory joby |
| Octoparse | Desktopová aplikace + cloud | ✅ (10 úloh, 50 tis./měs.) | ⚠️ Na šabloně | ✅ Vestavěné | ✅ Automatická detekce | Středně pokročilý | CSV, Excel, JSON, DB | Vizuální scraping na desktopu |
| ScrapingBee | API | ✅ (1 000 volání) | ❌ Jen surové HTML | ✅ Spravované proxy | ❌ Ruční | Pokročilý | JSON, HTML | Vývojáři, kteří potřebují renderované HTML |
| Bright Data | Platforma | ❌ Placené (zkušební 1K) | ✅ Datové produkty | ✅ Enterprise úroveň | ✅ Vestavěné | Pokročilý | JSON, CSV, NDJSON, S3 a další | Enterprise scraping ve velkém |
| Python DIY | Kód | ✅ Zdarma (OSS) | ⚠️ Ruční parsování | ❌ Správa vlastními silami | ❌ Ruční | Expert | Jakýkoli | Inženýři s vlastními potřebami |
1. Thunderbit — nejlepší Yellow Page scraper pro netechnické týmy
Vyzkoušet Thunderbit pro scraping Yellow Pages
Thunderbit je AI-powered rozšíření do Chromu, které jsme s týmem postavili právě proto, aby byl web scraping dostupný lidem, kteří nejsou vývojáři. Místo nastavování CSS selektorů nebo psaní kódu kliknete na „AI Suggest Fields“ a AI si přečte stránku, zjistí, jaká data jsou k dispozici, a navrhne vám sloupce. Pak kliknete na „Scrape“. Hotovo — strukturovaná data na dvě kliknutí.
Pro Yellow Pages řeší workflow problém s e-maily přímo. Po scrapingu stránky s výsledky můžete kliknout na Scrape Subpages a Thunderbit navštíví detailní stránku každé firmy, kde najde e-maily, URL webu, otevírací dobu, recenze a další pole, která na hlavní kartě nejsou vidět. Zároveň jsme vytvořili samostatný Email Extractor a Phone Number Extractor, takže je můžete spustit na libovolné stránce jedním kliknutím.
Jak Thunderbit řeší extrakci e-mailů z Yellow Pages
Hlavní rozdíl je právě scraping podstránek. Většina scraperů skončí na stránce s výsledky a vrátí jen to, co je vidět — což u Yellow Pages znamená žádný e-mail. Funkce podstránek v Thunderbit navštíví profil každé firmy a vytáhne data z této hlubší vrstvy. Můžete také použít Field AI Prompt a přidat instrukce jako „vytáhni e-mail z kontaktní sekce“ nebo „označ firmy bez webu“, čímž zlepšíte přesnost extrakce a zároveň přidáte kontext přímo během scrapingu.
Podle současné struktury stránek a dokumentace scraperů je výskyt e-mailů přímo na kartě záznamu na Yellow Pages prakticky nulový. Scrapery detailních stránek, jako je funkce podstránek v Thunderbit, získají e-maily zhruba u 15–25 % firem — což je realistický strop pro získávání e-mailů z Yellow Pages v roce 2026. To není omezení Thunderbit; to je omezení samotných dat na Yellow Pages.
Anti-bot ochrana a stránkování
Thunderbit nabízí dva režimy scrapingu: cloud scraping (který běží přes servery v USA/EU/Asii s automatickou rotací proxy) a browser scraping (který používá vaši lokální relaci v prohlížeči). Pokud cloudový režim zablokuje Cloudflare, můžete jako zálohu přepnout na browser mode — vaše přihlášená relace často obejde ochrany, které blokují headless cloudové požadavky.
Stránkování je plně automatické. Thunderbit zvládá jak tlačítka „Next“, tak nekonečný scroll bez jakékoli konfigurace.
Cena a export
- Free tier: 6 stránek měsíčně
- Bezplatná zkušební verze: 10 stránek
- Starter plan: od cca 9 USD/měsíc při roční fakturaci za 500 kreditů (1 kredit = 1 řádek)
- Export: Excel, CSV, JSON jsou dostupné ve free tieru; integrace Google Sheets, Airtable a Notion u placených plánů
Nejnovější informace najdete na naší stránce s cenami.
Nejlepší pro: Obchodní zástupce, agentury a provozní týmy, které potřebují lead data rychle, bez psaní kódu a správy proxy.
2. Apify Yellow Pages Scraper — nejlepší pro škálovaný cloud scraping
Apify je cloudová scrapingová platforma s marketplace předpřipravených „actorů“ — včetně několika určených přímo pro Yellow Pages. Scrape nastavíte v konzoli Apify (hledaný výraz, lokalita, počet výsledků) a běží v cloudu bez potřeby prohlížeče nebo lokálního počítače.
Actor ParseBird Yellow Pages je nejotevřenější z hlediska extrakce e-mailů, jaký jsem kdy našel. Výslovně odděluje listing mode od detail mode a dokumentuje, že výtěžnost e-mailů je typicky 15–25 % záznamů, pokud jsou zapnuté detailní stránky. Scraping v detailním režimu stojí zhruba 6 USD na 1 000 firem oproti 1 USD na 1 000 v listing režimu — přímý odraz vyšší výpočetní náročnosti navštěvování každé podstránky.
- Proxy pool v ceně s podporou rezidenčních proxy
- Vestavěné stránkování pro více stránek výsledků
- Export: JSON, CSV, Excel, XML, HTML, RSS, JSONL
- Cena: Free plán s 5 USD v kreditech; placené plány za 49, 99 a 499 USD/měsíc
Nejlepší pro: Středně pokročilé až pokročilé uživatele, kteří provozují větší lead-gen kampaně napříč více městy nebo kategoriemi.
3. WebScraper.io — nejlepší pro tvorbu vlastních Yellow Pages sitemap
WebScraper.io nabízí rozšíření do Chromu s vizuálním „Sitemap Wizardem“, který na Yellow Pages automaticky rozpozná strukturu záznamů. Je to nástroj, na kterém stojí jeden z nejvýše hodnocených tutoriálů na scraping Yellow Pages, a má to dobrý důvod — dává vám jemnou kontrolu nad tím, co a jak se scraptuje.
Cena za tuhle kontrolu je konfigurace. Extrakce e-mailů není automatická; musíte ručně nastavit selektory pro e-mailová pole a nakonfigurovat scraper tak, aby sledoval odkazy na detailní stránky firem. Když to nastavíte správně, funguje to. Když ne, dostanete stejný výstup telefon + adresa jako u každého jiného nástroje.
Poznámky na marketplace WebScraper.io jsou také nezvykle upřímné ohledně obrany Yellow Pages: jako konkrétní překážky uvádějí Cloudflare bot management, požadavky na renderování JavaScriptu a browser fingerprinting.
- Stránkování: řeší se přes konfiguraci tlačítka „Next“ na základě selektorů
- Export: CSV, XLSX, JSON; cloudová verze přidává Google Sheets, Dropbox, S3, Azure, API, webhooky
- Cena: bezplatné rozšíření do Chromu; cloud plány od 50 USD/měsíc
Nejlepší pro: Uživatelé, kteří jsou v pohodě s nástroji na výběr selektorů stylem point-and-click a chtějí flexibilitu při úpravě struktury scrapingu.
4. Instant Data Scraper — nejlepší bezplatný Yellow Page scraper (s výhradami)
Instant Data Scraper je odpověď na otázku „co můžu zkusit hned teď zdarma?“ Je to zcela bezplatné rozšíření do Chromu — bez účtu, bez kreditů, bez limitů — které automaticky detekuje tabulková data na webových stránkách. Otevřete stránku s výsledky na Yellow Pages, kliknete na ikonu rozšíření a ono detekuje data ze záznamů.
Problém je ve všem, co nedělá. Scraptuje jen to, co je na stránce vidět, což v praxi znamená žádné návštěvy podstránek a ve většině reálných workflow žádné e-maily. Má nulovou anti-bot ochranu, takže pokud vám Yellow Pages pošle CAPTCHA nebo zablokuje IP, jste na místě. Podpora stránkování je základní — možná budete muset ručně klikat na „Next“ nebo se spolehnout na omezený automatický scroll.
- Export: CSV, XLSX
- Cena: navždy zdarma
Nejlepší pro: Začátečníky, kteří potřebují rychlý a zdarma scrape jedné stránky výsledků a e-maily nepotřebují. Nevhodné pro kampaně zaměřené na e-maily nebo velké lead gen operace.
5. Outscraper — nejlepší spravované API pro Yellow Pages a Google Maps
Outscraper je cloudová/API platforma se spravovanou infrastrukturou pro scraping adresářů jako Yellow Pages a Google Maps. Její hlavní přednost je jednoduchost: nemusíte řešit proxy, anti-bot logiku ani stránkování sami.
Pro Yellow Pages platí, že prvních 500 firem je zdarma, pak je cena zhruba 1 USD na 1 000 firem. Extrakce e-mailů přímo z Yellow Pages je omezená na to, co je na stránce; pro hlubší obohacení e-mailů nabízí Outscraper samostatné enrichment funkce, které lze spojit se základním scrapem.
Tam, kde Outscraper vyniká, je podpora více adresářů. Pokud v jedné kampani scrapujete Yellow Pages i Google Maps, můžete to řídit z jedné platformy.
- Automatické stránkování v ceně
- Export: CSV, JSON, XLSX, API
- Cena: Free tier (500 firem); dál platba za výsledek
Nejlepší pro: Týmy sales ops, které chtějí spolehlivý, nenáročný scraping napříč více adresáři bez správy infrastruktury.
6. Octoparse — nejlepší desktopová aplikace pro vizuální scraping Yellow Pages
Octoparse je desktopová aplikace (Windows/Mac) s vizuálním builderem workflow ve stylu point-and-click. Nabízí předpřipravené šablony pro Yellow Pages a podobné adresářové weby a také vestavěné anti-bot funkce včetně rotace IP, rezidenčních proxy a automatického řešení CAPTCHA.
Extrakce e-mailů závisí na šabloně. Když je šablona nakonfigurovaná tak, aby navštěvovala detailní stránky firem nebo propojené weby, e-maily vytáhnout umí. Šablony ale mohou přestat fungovat, když Yellow Pages upraví rozvržení, a uživatelé hlásí smíšené výsledky podle kategorie a geografické oblasti.
- Free plán: 10 úloh, 50 000 exportů měsíčně
- Automatická detekce stránkování
- Export: CSV, Excel, JSON, HTML, XML, databáze, Google Sheets, API
- Cena: free tier; placené plány pro cloudové spuštění
Nejlepší pro: Středně pokročilé uživatele, kteří preferují desktopovou aplikaci s vizuálním builderem workflow a nevadí jim trochu ladění šablon.
7. ScrapingBee — nejlepší API pro vývojáře, kteří potřebují renderované HTML
ScrapingBee je web scraping služba postavená hlavně kolem API. Zvládá renderování JavaScriptu, rotaci proxy i řešení CAPTCHA — a pak vrátí surové HTML, JSON nebo Markdown. E-maily ani strukturovaná pole ale nativně netahá. To už je váš úkol.
Vlastní tutoriál na Yellow Pages od ScrapingBee ukazuje ruční stránkování přidáním &page=n do URL, což jen potvrzuje, že jde o vývojářský nástroj, ne o click-and-point řešení.
- Free tier: 1 000 API kreditů
- Bez vestavěného stránkování nebo extrakce polí
- Export: JSON, HTML
- Cena: od 49 USD/měsíc
Nejlepší pro: Vývojáře, kteří potřebují spolehlivě renderované HTML s anti-bot ochranou a jsou v pohodě s vlastním parsovacím logikou.
8. Bright Data — nejlepší enterprise platforma pro scraping ve velkém
Bright Data provozuje největší proxy síť v oboru a nabízí kompletní sadu scraping API, browser nástrojů a předpřipravených datasetů. Je navržená pro organizace, které potřebují masivní sběr dat s compliance funkcemi.
Pro Yellow Pages je silnou stránkou infrastruktura — rezidenční proxy, řešení CAPTCHA, obrana proti browser fingerprintingu — a následné doručení dat do JSON, CSV, NDJSON, S3, Snowflake, GCS, Azure a SFTP. Nenašel jsem aktuálně dokumentovanou šablonu přímo pro Yellow Pages, takže jde spíš o enterprise platformu než o vyhrazený produkt na YP e-maily.
- Cena: Web Scraper API začíná 1K request free trialem, poté 2,5 USD za 1K záznamů v pay-as-you-go; při škále 499 USD/měsíc
- Free tier u většiny produktů není
- Vestavěné stránkování pro všechny scraping nástroje
Nejlepší pro: Velké firmy nebo agentury s výrazným datovým rozpočtem, které potřebují škálu, compliance a proxy infrastrukturu.
9. Python DIY (BeautifulSoup + Playwright) — nejlepší pro úplnou kontrolu
Tohle je open-source cesta: BeautifulSoup pro parsování HTML a Playwright pro automatizaci prohlížeče. Bezplatné knihovny, maximální flexibilita, ale také nejvyšší technická náročnost v tomhle seznamu.
Extrakce e-mailů vyžaduje napsat vlastní parsovací logiku, která přejde na detailní stránku každé firmy a najde e-mailová pole. Rotaci proxy, řešení CAPTCHA, rate limiting i stránkování musíte buď sami implementovat, nebo koupit zvlášť. Jak to vystihl jeden uživatel Redditu: „Jakmile jednou zkusíte Playwright, už se nikdy nevrátíte k Selenium“ — ale taky už nikdy nepřestanete ladit nastavení proxy.
- Cena: zdarma (open-source knihovny); infrastruktura je extra
- Export: jakýkoli formát, který si naprogramujete
- Nic vestavěného — vše si stavíte sami
Nejlepší pro: Zkušené vývojáře se specifickými požadavky na scraping, které žádný hotový nástroj neumí, a kteří si bez problému spravují infrastrukturu od začátku do konce.
Co se opravdu stane, když vás Yellow Pages zablokuje (realita anti-bot ochrany)
Chci se u toho na chvíli zastavit, protože je to největší problém podle počtu zmínek v scraping komunitách a většina článků to odbude frází „použijte proxy“.
Když jsem 27. dubna 2026 testoval základní skriptovaný požadavek na URL s výsledky Yellow Pages, odpovědí byla blokovací stránka Cloudflare: „Sorry, you have been blocked. This website is using a security service to protect itself from online attacks.“ Stalo se to při prvním požadavku. Žádné varování, žádné postupné zpomalování — prostě zeď.
Anti-bot stack Yellow Pages zahrnuje Cloudflare Bot Management, požadavky na renderování JavaScriptu, browser fingerprinting, rate limity a reCAPTCHA. Průvodce scrapováním od IPRoyal doplňuje, že symptomy mohou zahrnovat tvrdé blokace, měkké bany, CAPTCHA, přesměrování na splash stránky, sledování relace a rate limity.
Širší kontext to ještě zhoršuje. Zpráva Imperva za rok 2025 ukázala, že automatizovaný provoz tvořil v roce 2024 51 % veškerého internetového provozu a zpráva DataDome za rok 2025 pokrývající téměř 17 000 webů zjistila, že plně chráněná byla jen 2,8 %. Weby jako Yellow Pages, které do ochrany investují, se v chytání scraperů zlepšují, ne zhoršují.
Praktický přehled toho, jak si jednotlivé nástroje vedou:
| Nástroj | Rotace proxy | CAPTCHA handling | Odolnost vůči rate limitům | Fallback při blokaci |
|---|---|---|---|---|
| Thunderbit | ✅ Cloud mode se servery v USA/EU/Asii | ✅ Spravované v cloudu | ✅ Automatické zpomalování | Přepnutí na browser scraping |
| Apify | ✅ Včetně rezidenčních proxy | ✅ Přes infrastrukturu actoru/prohlížeče | ✅ Konfigurovatelné | Opakování s novou proxy |
| WebScraper.io | ✅ Cloud plány + proxy add-on | ✅ Cloud plány | ✅ Silné | Použijte cloudové spuštění |
| Instant Data Scraper | ❌ Žádná | ❌ Žádná | ❌ Slabé | Ruční opakování nebo konec |
| Outscraper | ✅ Spravovaný backend | ⚠️ Omezená dokumentace | ✅ Střední | Zvládá spravovaná služba |
| Octoparse | ✅ Včetně rezidenčních | ✅ Automatické řešení CAPTCHA | ✅ Silné | Cloud šablony + anti-block |
| ScrapingBee | ✅ Spravované proxy | ✅ Vestavěné | ✅ Silné | Úprava kódu, prémiové proxy |
| Bright Data | ✅ Enterprise úroveň | ✅ Vestavěné | ✅ Velmi silné | Kompletní ladění infrastruktury |
| Python DIY | ❌ Jen vlastní správa | ❌ Jen vlastní správa | ❌ Proměnlivé | Cokoli si naprogramujete |
Více než surová data: jak z Yellow Pages scrapů udělat leady připravené pro CRM
Jeden vzorec vídám pořád dokola: někdo sescrapuje 500 záznamů z Yellow Pages, vyexportuje je do tabulky a pak stráví tři hodiny ručním googlováním každé firmy, aby našel e-maily, zkontroloval web a zjistil, které z nich stojí za oslovení. Scraping trval 10 minut. Obohacení dat zabralo celé odpoledne.
Odtud pochází ta poznámka, že „surová data bez skórování jsou jen tabulka.“ Surový export z Yellow Pages vypadá třeba takto:
| Název firmy | Telefon | Adresa | Web | Kategorie |
|---|---|---|---|---|
| Example Plumbing Co. | 555-0199 | 123 Main St | exampleplumbing.com | Instalatéři |
| NoSite HVAC | 555-0112 | 456 Oak Ave | Žádný | HVAC |
Obohacená tabulka leadů — tedy ta, která je opravdu použitelná pro outreach — vypadá takto:
| Název firmy | Telefon | Adresa | Web | Recenze | Má web? | Poznámka k prospectovi | |
|---|---|---|---|---|---|---|---|
| Example Plumbing Co. | 555-0199 | 123 Main St | exampleplumbing.com | info@exampleplumbing.com | 42 | Ano | K dispozici kontaktní stránka |
| NoSite HVAC | 555-0112 | 456 Oak Ave | Žádný | Žádný | 8 | Ne | Možný prospect pro agenturu |
Jak pomocí scrapingu podstránek obohatit leady
Thunderbitův scraping podstránek navštíví detailní stránku každé firmy a přidá pole jako e-mail, URL webu, otevírací dobu, recenze a kategorie. U scrape s 500 záznamy je to rozdíl mezi 10 minutami automatické práce a více než 3 hodinami ručního průzkumu.
Detailní režim scrapingu v Apify dělá něco podobného, ale za vyšší cenu na záznam (zhruba 6 USD na 1 000 firem oproti 1 USD na 1 000 v listing režimu).
Označování a kategorizace leadů během scrapingu
Thunderbitův Field AI Prompt vám umožní přidat instrukce přímo během scrapingu — třeba „označ firmy bez webu“ nebo „kategorizuj podle velikosti firmy“. AI tyto štítky zpracovává už při extrakci dat, takže místo surového výpisu dostanete předkvalifikovaný seznam leadů.
Jedna poznámka z výzkumu, která stojí za zmínku: chybějící web nemusí vždy znamenat, že je firma dobrý prospect. Je to užitečný signál pro agenturní outreach, ale neměl by být jediným kritériem kvalifikace.
Workflow exportu do CRM
Nejběžnější workflow, které od našich uživatelů vídám:
- Thunderbit → Google Sheets nebo Airtable → CRM (přímý export, bez mezikroků)
- Apify → webhook → CRM (vyžaduje trochu konfigurace)
- Outscraper → stažení CSV → import do CRM (ruční, ale jednoduchý)
Pokud se vaše CRM integruje s Google Sheets nebo Airtable, přímý export z Thunderbit úplně eliminuje krok stahování souboru. Více se dozvíte v našem článku o web scrapingu bez kódování.
Nejlepší Yellow Page scraper podle použití: rychlý doporučující průvodce
Ne každý nástroj je vhodný pro každého uživatele. Moje doporučení podle typu uživatele:
Nejlepší pro netechnické obchodníky a majitele agentur: Thunderbit (AI scraping na 2 kliknutí, zdarma Email Extractor, scraping podstránek) a Instant Data Scraper (zdarma, jednoduchý — ale bez e-mailů)
Nejlepší pro škálované lead-gen operace: Apify (cloud actors, joby pro více měst, extrakce e-mailů z detailních stránek) a Outscraper (spravované API, podpora více adresářů)
Nejlepší zcela zdarma: Instant Data Scraper (navždy zcela zdarma) a free tier Thunderbit (6 stránek měsíčně s AI funkcemi)
Nejlepší pro vývojáře: Python DIY s Playwrightem (maximální kontrola) a API ScrapingBee (spravované renderování + proxy)
Nejlepší pro enterprise / velký objem: Bright Data (největší proxy síť, compliance funkce, enterprise ceny)
Také jsme napsali přehled nejlepších AI web scraperů a podrobnější průvodce AI lead generation, pokud chcete jít víc do hloubky.
Yellow Pages vs. Google Maps vs. jiné adresáře: kdy použít co
Většina lidí v lead genu nescrapuje Yellow Pages izolovaně. Tahají data z více adresářů a navzájem je porovnávají. Rychlé srovnání podle současné dostupnosti dat:
| Faktor | Yellow Pages | Google Maps | Facebook Business |
|---|---|---|---|
| Dostupnost e-mailu | Nízká (jen detailní stránky) | Velmi nízká (není standardní pole) | Střední (stránky mohou obsahovat e-mail) |
| Telefonní čísla | ✅ Konzistentně uvedená | ✅ Konzistentně uvedená | ⚠️ Někdy skrytá |
| Recenze/hodnocení | ✅ Dostupné | ✅ Bohatší data | ✅ Dostupné |
| Kategorie/niche | ✅ Silné pro lokální niche | ✅ Široké a bohaté | ⚠️ Nekonzistentní |
| Nejlepší scraper nástroj | Thunderbit, Apify YP actor | Outscraper, Apify Maps actor | Thunderbit (AI Suggest Fields funguje na libovolném webu) |
Yellow Pages je nejsilnější pro pokrytí lokálních kategorií s úzkým zaměřením — pokud potřebujete každého instalatéra v konkrétní metropolitní oblasti, těžko se mu něco vyrovná. Google Maps nabízí bohatší data z recenzí a signály aktuálnosti. Facebook Business Pages někdy oběma předčí v přímé viditelnosti e-mailu, protože majitelé stránek často e-mail zveřejňují.
AI Suggest Fields v Thunderbit funguje na libovolném webu, takže můžete scrapovat Yellow Pages, Google Maps i Facebook pomocí stejného rozšíření. Tahle univerzálnost je důležitá, když stavíte lead list z více zdrojů. Náš průvodce co je web scraping pokrývá základy, pokud s tím začínáte.
Právní a etické aspekty scrapingu Yellow Pages
Tahle část je krátká, ale důležitá.
Data z Yellow Pages jsou veřejně dostupná, ale podmínky služby YP.com výslovně uvádějí, že přístup je určen pro „individuální, nekomerční, informační účely“ a že uživatelé nesmí používat „boty, scrapery, crawlery, spidera“ k extrakci dat. Současná právní situace v USA kolem web scrapingu je složitá — veřejná dostupnost může snížit riziko podle CFAA ve srovnání s přihlášenými stránkami, ale stále platí smluvní právo, pravidla ochrany soukromí (CCPA) i marketingová compliance.
FTC v prosinci 2024 poslala varovné dopisy 21 marketingovým subjektům v oblasti zdravotního pojištění a lead generatorům ohledně toho, jak se v lead-gen workflow používají údaje o spotřebitelích. Poučení: scrapujte zodpovědně, respektujte rate limity, neprodávejte surová data bez pochopení právních hranic a používejte sesbíraná data pro legitimní obchodní účely.
Tento článek má pouze informativní charakter a nepředstavuje právní poradenství.
Závěr
Většina Yellow Pages scraperů e-maily míjí, protože se zastaví na stránce se záznamem. Lepší jsou ty nástroje, které se dostanou na detailní stránky firem, sledují odkazy na weby firem nebo nad základním scrapem spouštějí enrichment workflow. I tak ale dostupnost e-mailů na Yellow Pages končí někde kolem 15–25 % záznamů — takže realistická očekávání jsou stejně důležitá jako výběr správného nástroje.
Pokud jste netechnický tým a potřebujete leady s reálnými kontaktními daty, zkuste free tier Thunderbit — funkce scrapingu podstránek a extrakce e-mailů jsou navržené přesně pro tenhle problém. Pokud provozujete větší kampaně, Apify a Outscraper nabízí solidní cloudovou infrastrukturu. A pokud jste vývojář a chcete plnou kontrolu, Python s Playwrightem a ScrapingBee vás tam dostanou, i když si většinu pipeline budete stavět sami.
Začněte s porovnávací tabulkou výše, vyberte podle své úrovně dovedností a rozpočtu a pamatujte: nejlepší scraper je ten, který vám skutečně přinese data potřebná pro oslovení, ne ten s nejdelším seznamem funkcí.
Můžete také rovnou prozkoumat naše rozšíření Thunderbit pro Chrome, nebo se podívat na návody na našem YouTube kanálu.
Časté dotazy
Dá se z Yellow Pages skutečně scrapeovat e-mail?
Ano, ale většina e-mailů je na detailních (pod)stránkách firem, ne na hlavní kartě záznamu. Současná dokumentace scraperů naznačuje, že jen asi 15–25 % firem zveřejňuje e-mail, který může scraper z detailní stránky získat. Pro nejlepší výsledky potřebujete nástroj se schopností scrapovat podstránky — například Thunderbit nebo detailní režim actorů od Apify.
Jaký je nejlepší bezplatný Yellow Pages scraper?
Instant Data Scraper je zcela zdarma, bez účtu a bez kreditových limitů, ale e-maily neextrahuje spolehlivě a nemá anti-bot ochranu. Thunderbit nabízí free tier (6 stránek měsíčně) s AI scrapováním, přístupem na podstránky a extrakcí e-mailů — je to silnější volba, pokud e-maily ve vašem workflow hrají roli.
Jak se vyhnout blokaci při scrapování Yellow Pages?
Yellow Pages používá Cloudflare Bot Management, CAPTCHA, rate limity a browser fingerprinting. Používejte nástroje s vestavěnou rotací proxy a CAPTCHA handlingem (Thunderbit, Apify, Octoparse, ScrapingBee, Bright Data). Přepínač Thunderbitu z cloudu do prohlížeče je praktický fallback — pokud cloud scraping zablokuje, browser mode využije vaši lokální relaci a obejde část ochran.
Yellow Pages scraper vs. Google Maps scraper — co je lepší na leady?
Záleží na vašich potřebách. Yellow Pages má silnější pokrytí lokálních niche kategorií a konzistentně uvádí telefonní čísla. Google Maps nabízí bohatší data z recenzí a častější aktualizace. Ani jedno není skvělé na e-maily — Facebook Business Pages mívají ve skutečnosti vyšší dostupnost e-mailů. Ideální je kombinovat více adresářů pro co nejúplnější profil leadů.
Je scrapování Yellow Pages legální?
Data z Yellow Pages jsou veřejně dostupná, ale podmínky služby YP.com omezují automatizovaný sběr dat a komerční využití výsledků vyhledávání. Právní prostředí kolem scrapování veřejných dat se vyvíjí. Uživatelé by měli prostudovat podmínky služby webu, dodržovat příslušné předpisy na ochranu soukromí (CCPA, GDPR, kde je relevantní) a se sesbíranými daty zacházet zodpovědně. Tento článek je pouze informativní a nepředstavuje právní poradenství.
Vyzkoušet Thunderbit pro scraping Yellow Pages Get Started Free
Zjistit více


