Как я собираю лиды из SuperPages: 3 способа с пошаговой инструкцией

Последнее обновление: May 26, 2026
Как я собираю лиды из SuperPages: 3 способа с пошаговой инструкцией
Сводка ИИ
Automate your lead generation from SuperPages by comparing three methods: AI no-code tools, visual scrapers, and Python scripts. Get tips for 2026.

На прошлой неделе один из наших пользователей рассказал мне, что провёл весь день, вручную копируя списки сантехников из SuperPages в таблицу — 47 строк за три часа. Запястья ноют, в данных куча опечаток, а нужных email-адресов так и нет. Эта история мне особенно близка: я сам через это проходил. И именно для таких задач мы и создавали Thunderbit.

SuperPages — один из старых американских локальных бизнес-каталогов, которым управляет Thryv. Он хорошо покрывает крупные города и самые разные категории — сантехников, стоматологов, юристов, HVAC-специалистов и многих других. В ранней технической документации его описывали как общенациональную базу данных жёлтых страниц с более чем 11 миллионами записей, и сегодня сайт по-прежнему хранит плотные локальные категории. Проблема тут не в том, чтобы найти компании. Проблема в том, чтобы превратить их в чистый и полезный список лидов, не потеряв ни здравый смысл, ни весь рабочий день.

Согласно отчёту HubSpot Sales Trends 2024, менеджеры по продажам тратят на настоящие продажи всего около 2 часов в день — остальное уходит на ввод данных, исследования и рутинные задачи. И 81% специалистов по продажам считают, что ИИ помог бы им тратить меньше времени на ручную работу. В этом руководстве я покажу три способа собрать лиды из SuperPages — от AI-инструментов без кода до Python — чтобы ты мог выбрать подходящий метод и вернуться к тому, что действительно даёт результат.

Собирайте лиды из SuperPages с помощью ИИ Get Started Free

Что такое SuperPages и почему отделы продаж так любят его для поиска лидов

SuperPages — это ориентированный на США онлайн-каталог компаний, где локальный бизнес размещается с контактами, категориями, рейтингами и другими данными. По сути, это цифровая версия старых бумажных жёлтых страниц — только теперь поиск идёт по категории и локации, а карточки содержат куда больше информации.

superpages-directory-services.webp

Обычная карточка компании в SuperPages может включать:

  • Название компании
  • Номер телефона
  • Адрес
  • URL сайта (если доступен)
  • Категорию (например, сантехника, семейное право, HVAC)
  • Рейтинг и отзывы
  • Часы работы (обычно на странице с деталями)
  • Описание (на странице деталей)

На главной странице SuperPages выделены популярные категории вроде Home Services, Plumbers, Electricians, Dentists, Legal Services, Auto Repair, Restaurants и Pet Services — и именно эти ниши чаще всего ищут команды продаж, агентства и локальные сервисные компании для холодных outreach-кампаний.

Проще говоря, SuperPages — настоящая находка для тех, кто ищет локальные компании в США. Данные структурированы, охват широкий, а категории отлично ложатся на реальные сценарии продаж.

Попробуйте Thunderbit для лидов из SuperPages

Зачем собирать лиды из SuperPages: основные сценарии использования

Ручной просмотр SuperPages и копирование данных в таблицу — это чёрная дыра для продуктивности. Сбор данных автоматизирует этот процесс и даёт тебе целевой, структурированный список за минуты, а не за часы. А поскольку ты сам задаёшь поиск (категория + город + ключевое слово), результат часто оказывается куда релевантнее, чем купленный массовый список лидов.

Вот самые частые сценарии, с которыми я сталкиваюсь у наших пользователей:

СценарийКому это полезноПример
Локальная генерация лидовОтделы продаж, агентстваСобрать список сантехников в Далласе для холодного обзвона
Исследование конкурентовОперации, маркетингСравнить рейтинги и услуги конкурентов на рынке
Картирование рынкаРазвитие бизнесаНайти всех стоматологов в конкретном ZIP-коде для запуска нового продукта
Поиск поставщиковЗакупки, операционные командыНайти поставщиков в регионе с телефоном и сайтом
Локальное SEO и prospectingАгентстваНайти компании без сайта или со слабыми данными в карточке
Планирование территорииПолевые продажиГруппировать подрядчиков по городу, ZIP-коду или зоне обслуживания

Рынок B2B-лидогенерации в США оценивался в 8,5 млрд долларов в 2024 году и, по прогнозам, вырастет до 18,2 млрд долларов к 2034 году — так что спрос на такие данные никуда не денется. Свежий список, собранный по конкретной категории и локации, может оказаться точнее, чем купленный универсальный список, но перед outreach его всё равно нужно проверить и дедуплицировать (об этом ниже).

Как выглядит итоговый результат: пример данных, собранных из SuperPages

Прежде чем переходить к способам, я хочу показать, что именно ты получишь на выходе. Многие гайды этот момент пропускают, а если ты тратишь время, важно понимать, каким будет итог.

Вот пример таблицы с результатом (вымышленные данные, но формат реалистичный):

Название компанииТелефонАдресСайтКатегорияРейтингЧасы работыEmail (обогащённый)
Sunset Pipe & Drain Co.+1 213-555-01481842 W 7th St, Los Angeles, CA 90057sunsetpipe.examplePlumbing4.6Пн–Пт 7:00–18:00service@sunsetpipe.example
Arroyo HVAC Pros+1 626-555-018272 N Fair Oaks Ave, Pasadena, CA 91103arroyohvac.exampleHVAC4.8Пн–Сб 8:00–19:00hello@arroyohvac.example
Wilshire Family Dental+1 323-555-01194100 Wilshire Blvd, Los Angeles, CA 90010wilshiredental.exampleDentists4.4Пн–Чт 9:00–17:00appointments@wilshiredental.example
Pacific Legal Aid Group+1 310-555-017311845 W Olympic Blvd, Los Angeles, CA 90064Legal Services4.2Пн–Пт 8:30–17:30intake@pacificlegal.example
Valley Auto Repair Center+1 818-555-019814422 Ventura Blvd, Sherman Oaks, CA 91423valleyautorepair.exampleAuto Repair4.7Пн–Сб 8:00–18:00info@valleyautorepair.example
Echo Park Pet Grooming+1 213-555-01661511 Sunset Blvd, Los Angeles, CA 90026echoparkpets.examplePet Grooming4.9Вт–Вс 9:00–17:00booking@echoparkpets.example

Что важно учитывать:

  • Со страницы результатов поиска: название компании, телефон, неполный адрес, категория, рейтинг, URL карточки.
  • Со страницы с деталями компании: полный адрес, часы работы, описание, отзывы, иногда сайт.
  • После обогащения данных: email — его часто можно найти только на собственном сайте компании или через инструменты обогащения.
  • После очистки: телефон в формате E.164, нормализованные штат и ZIP-код, ключи дедупликации, источник и дата сбора.

Такой результат можно сразу загрузить в CRM, Google Sheets или Airtable и начать работать без лишней подготовки.

3 способа собрать лиды из SuperPages: краткое сравнение

ai-no-code-visual-python-comparison.webp

У всех разный уровень технической подготовки — и разное терпение. Поэтому вот три метода рядом, чтобы ты мог выбрать подходящий:

КритерийThunderbit (AI без кода)Визуальный скрейпер (например, Octoparse)Python (Requests + BS4)
Время на настройку~2 мин (установка расширения)~15 мин (создание сценария)~30 мин (установка библиотек, написание кода)
Нужен ли кодНетНетДа (Python)
Работа с пагинациейВстроено (клик или прокрутка)Нужна настройкаРучной код
Обогащение подстраницамиВ 1 кликНужен отдельный цикл/сценарийОтдельный скрипт
Защита от блокировокCloud Scraping справляетсяЗависит от тарифа/проксиСамостоятельно (прокси, заголовки, лимиты)
ЭкспортExcel, Google Sheets, Airtable, Notion, CSV, JSONCSV, Excel, база данныхЧто угодно, если напишешь код
Лучше всего подходитОтделам продаж, агентствам, не-разработчикамПолутехническим пользователямРазработчикам, которым нужен полный контроль

Моя рекомендация: если хочешь начать уже через 2 минуты — выбирай Метод 1. Если предпочитаешь визуальные workflow и не боишься настройки — попробуй Метод 2. Если тебе нужен полный контроль и ты уверенно работаешь с Python — переходи к Методу 3.

Метод 1: собираем лиды из SuperPages с Thunderbit (ИИ, без кода)

Это самый быстрый путь от «у меня есть поиск в SuperPages» до «у меня есть список лидов». Без кода, без конструкторов сценариев, без возни с прокси. Я немного предвзят — мы ведь и создали Thunderbit, — но я покажу, как всё работает, чтобы ты мог оценить сам.

Сложность: для новичков
Время: примерно 5 минут на полный сбор по категории и городу
Что нужно: браузер Chrome, расширение Thunderbit для Chrome (бесплатный тариф подходит)

Шаг 1: установи Thunderbit и открой SuperPages

Перейди на страницу загрузки расширения Thunderbit для Chrome и установи расширение Thunderbit. Это занимает около минуты. После установки открой страницу результатов поиска SuperPages — например, выполни поиск «Plumbers in Los Angeles, CA» на superpages.com.

В панели инструментов браузера появится значок Thunderbit, а также боковая панель, готовая к работе.

Шаг 2: нажми «AI Suggest Fields», чтобы автоматически определить столбцы данных

Открой боковую панель Thunderbit и нажми «AI Suggest Fields». ИИ Thunderbit анализирует страницу и автоматически предлагает столбцы на основе того, что находит — обычно это название компании, телефон, адрес, сайт, категория, рейтинг и URL карточки.

Перед началом сбора ты можешь изменить, добавить или удалить столбцы. Хочешь добавить свой столбец вроде «Есть сайт?» или «Зона обслуживания?» — просто опиши его обычным английским текстом через Field AI Prompt. Например, можно задать форматирование телефона как +1XXXXXXXXXX или классификацию на residential vs. commercial.

Теперь ты должен видеть предварительный просмотр таблицы с настроенными столбцами в панели Thunderbit.

Шаг 3: нажми «Scrape» и наблюдай, как заполняются данные

Нажми синюю кнопку «Scrape». Thunderbit извлекает все карточки на текущей странице и построчно заполняет таблицу. Для типичной страницы результатов SuperPages это занимает примерно 30–45 секунд.

Thunderbit автоматически обрабатывает пагинацию — он определяет кнопки «Next» или бесконечную прокрутку и продолжает работу, пока не закончатся страницы или не будет достигнут лимит. Если ты собираешь большой объём данных, например всех сантехников в мегаполисе, переключись в режим Cloud Scraping: он может обработать до 50 страниц одновременно, не нагружая браузер.

Шаг 4: используй Subpage Scraping для обогащения каждой карточки

business-profile-verification-process.webp

На странице результатов есть базовая информация, но настоящая ценность — часы работы, полное описание, отзывы, иногда email — находится на странице деталей каждой компании. Нажми «Scrape Subpages», и Thunderbit откроет страницу каждой карточки, подтягивая обогащённые поля вроде часов работы, описания, URL сайта и любой контактной информации, если она есть.

Это делается в один клик. Без отдельного workflow и без дополнительной настройки. Обогащённые данные сразу добавляются в твою существующую таблицу.

Шаг 5: экспортируй лиды в Excel, Google Sheets, Airtable или Notion

Когда данные тебя устраивают, нажми Export. Thunderbit позволяет отправить лиды напрямую в:

  • Google Sheets — удобно для подготовки к CRM и совместной работы
  • Airtable — для лёгких pipeline-таблиц
  • Notion — для исследовательских баз данных
  • Excel / CSV — для импорта в CRM
  • JSON — для передачи разработчику

cloud50-data-workflow.webp

Все варианты экспорта бесплатны. Если ты загружаешь лиды в HubSpot или Salesforce, чаще всего быстрее всего экспортировать в CSV или Google Sheets.

Совет: собирай данные по категории + городу, а не по слишком широким запросам на уровне штата. «Emergency plumbers Dallas TX» даст куда более точный и полезный список, чем просто «plumbers Texas». Добавь столбцы «Source URL» и «Scraped At» для отслеживаемости.

Метод 2: собираем SuperPages через визуальный инструмент для скрейпинга (пример Octoparse)

Визуальные инструменты вроде Octoparse занимают промежуточное положение: код писать не нужно, но настроек и подготовки тут больше, чем в Thunderbit. У Octoparse даже есть готовый шаблон для SuperPages для более простых задач.

Сложность: средняя
Время: примерно 20–30 минут на настройку и сбор
Что нужно: аккаунт Octoparse (есть бесплатный план с ограничениями)

Шаг 1: создай новую задачу и загрузи URL SuperPages

Открой Octoparse, нажми «New Task» и вставь URL поиска SuperPages, например https://www.superpages.com/los-angeles-ca/plumbers. Встроенный браузер загрузит страницу.

Шаг 2: автоматически определи поля данных или выбери их вручную

Нажми «Auto-detect» — Octoparse просканирует страницу и выделит поля, которые считает релевантными. Проверь панель Data Preview. По моему опыту, автоопределение часто находит большую часть полей, но может захватить лишнее (например, рекламные метки или текст навигации) либо пропустить что-то важное. Скорее всего, придётся вручную добавить или убрать несколько полей.

Согласно справке Octoparse, автоопределение создаёт базовый workflow с пагинацией и шагами извлечения данных, но пользователю нередко нужно вручную добавить недостающие элементы.

Шаг 3: собери workflow и настрой пагинацию

Нажми «Create workflow». Octoparse создаст последовательность шагов. Проверь шаг пагинации — убедись, что он корректно нажимает «Next» или подгружает новые результаты. Если тебе нужны данные со страницы каждой компании (часы работы, email, описание), придётся добавить в workflow отдельный цикл по детальным страницам или действие для подстраниц. Это сложнее, чем однокликовый Subpage Scraping в Thunderbit.

Шаг 4: запусти задачу и экспортируй данные

Запусти задачу локально (для небольших объёмов) или в облаке Octoparse (для запланированных или больших задач — облако платное). Когда процесс завершится, экспортируй данные в CSV, Excel или JSON.

Что важно знать: в бесплатном плане Octoparse есть 10 задач, до 50 000 строк в месяц и только локальное извлечение. Облачные запуски, ротация IP, обход CAPTCHA и некоторые интеграции экспорта доступны только на платном тарифе (примерно от $69 в месяц при годовой оплате).

Метод 3: собираем SuperPages с Python (Requests + BeautifulSoup)

Это путь для разработчиков. Полный контроль — и полная ответственность. Если ты умеешь писать и поддерживать Python-скрипты, этот вариант даёт максимальную гибкость, но вместе с ней и больше всего головной боли.

Сложность: высокая
Время: примерно 30–60 минут на настройку, код и отладку
Что нужно: Python 3.x, pip, requests, beautifulsoup4, lxml, редактор кода

Шаг 1: настрой Python-окружение

python -m venv .venv
source .venv/bin/activate
pip install requests beautifulsoup4 lxml pandas

Шаг 2: изучи HTML-структуру SuperPages

Открой инструменты разработчика (F12) на странице результатов SuperPages. Определи CSS-селекторы для названия компании, адреса, телефона, сайта и ссылки на страницу деталей. Помни: HTML-структура может измениться без предупреждения, а значит, твои селекторы могут сломаться в любой момент.

Шаг 3: напиши скрейпер карточек и обработай пагинацию

Ниже — упрощённый пример. Важная оговорка: в моих тестах прямой запрос к SuperPages вернул страницу блокировки Cloudflare «Attention Required». Наивный Requests-скрипт может не справиться в масштабе — тебе могут понадобиться контекст браузерной сессии, ограничение скорости запросов, повторные попытки или разрешённые альтернативы.

import csv, time
from urllib.parse import urljoin
import requests
from bs4 import BeautifulSoup

BASE_URL = "https://www.superpages.com"
HEADERS = {
    "User-Agent": (
        "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
        "AppleWebKit/537.36 (KHTML, like Gecko) "
        "Chrome/125.0 Safari/537.36"
    )
}

def fetch(url):
    resp = requests.get(url, headers=HEADERS, timeout=20)
    resp.raise_for_status()
    if "Attention Required" in resp.text or "Cloudflare" in resp.text:
        raise RuntimeError("Блокировка. Снизьте скорость или перейдите на браузерный/облачный сбор.")
    return BeautifulSoup(resp.text, "lxml")

def parse_listing(card):
    name_el = card.select_one(".business-name, a.business-name, h2 a, h3 a")
    phone_el = card.select_one(".phones, .phone, [class*=phone]")
    address_el = card.select_one(".street-address, .adr, [class*=address]")
    website_el = card.select_one("a.track-visit-website, a[href*='http']")
    rating_el = card.select_one(".rating, [class*=rating]")
    detail_url = urljoin(BASE_URL, name_el.get("href")) if name_el and name_el.get("href") else ""
    return {
        "business_name": name_el.get_text(" ", strip=True) if name_el else "",
        "phone": phone_el.get_text(" ", strip=True) if phone_el else "",
        "address": address_el.get_text(" ", strip=True) if address_el else "",
        "website": website_el.get("href", "") if website_el else "",
        "rating": rating_el.get_text(" ", strip=True) if rating_el else "",
        "detail_url": detail_url,
    }

def scrape_search(search_url, pages=3):
    all_rows = []
    for page in range(1, pages + 1):
        page_url = f"{search_url}?page={page}"
        soup = fetch(page_url)
        cards = soup.select(".result, .organic, [class*=result]")
        if not cards:
            break
        for card in cards:
            all_rows.append(parse_listing(card))
        time.sleep(5)
    return all_rows

if __name__ == "__main__":
    rows = scrape_search("https://www.superpages.com/los-angeles-ca/plumbers", pages=2)
    with open("superpages_leads.csv", "w", newline="", encoding="utf-8") as f:
        writer = csv.DictWriter(f, fieldnames=sorted({k for row in rows for k in row}))
        writer.writeheader()
        writer.writerows(rows)

Шаг 4: собери данные со страниц деталей для обогащения

Напиши отдельную функцию, которая будет посещать URL страницы каждой компании и извлекать часы работы, email, описание и отзывы. Это значит, что тебе придётся самостоятельно управлять лимитами, обработкой ошибок и, возможно, прокси — всё это ложится на тебя.

Шаг 5: сохрани данные в CSV или JSON

Используй модули csv или json из Python. Тебе также придётся самостоятельно реализовать дедупликацию, очистку и логику экспорта.

Типичные проблемы:

  • SuperPages может блокировать запросы через Cloudflare или похожие антибот-системы (это подтверждено в моих тестах).
  • Селекторы здесь намеренно широкие, потому что разметка SuperPages может меняться.
  • Не стоит рассчитывать, что на страницах результатов поиска есть email — почти никогда их там нет.
  • Продакшн-скрейпер должен учитывать robots/TOS, ограничения частоты запросов, retry/backoff, структурированное логирование и обработку ошибок.

Если хочешь глубже разобраться в Python-скрейпинге, посмотри наше руководство по web scraping with Python или урок по BeautifulSoup.

От сырых данных к реальным лидам: полный процесс (сбор → очистка → проверка → CRM)

Вот где большинство гайдов заканчиваются — и где начинается настоящая ценность. Сбор данных даёт тебе сырьё. Чтобы превратить его в рабочий список лидов, нужно пройти ещё несколько этапов.

data-pipeline-workflow.webp

Процесс выглядит так:

поиск в SuperPages → сбор карточек → сбор страниц деталей/сайтов → экспорт в Google Sheets или CSV → очистка телефонов, адресов и категорий → дедупликация → проверка email/телефонов → обогащение недостающих контактов → импорт в CRM → compliant outreach

Дедупликация: удаляем повторяющиеся карточки

SuperPages часто показывает одну и ту же компанию в нескольких категориях. Если ты собрал «plumbers» и «drain cleaning» в одном городе, пересечения почти неизбежны.

  • Основной ключ дедупликации: нормализованный номер телефона + нормализованный адрес.
  • Вторичный: домен + город.
  • Запасной вариант: название компании + ZIP-код (для франшиз лучше проверять вручную).

В Google Sheets используй =UNIQUE(A:H) для точного совпадения строк или создай вспомогательный столбец вроде =LOWER(REGEXREPLACE(B2&C2,"[^a-zA-Z0-9]","")), чтобы ловить почти дубликаты. В Excel можно использовать Data > Remove Duplicates.

Очистка данных: стандартизируем телефоны, адреса и форматирование

  • Приводи телефоны к формату E.164 (для США: +1 и 10 цифр). Это формат, который ожидают большинство CRM и dialer-систем. В Thunderbit можно использовать Field AI Prompt, чтобы автоматически форматировать данные во время сбора.
  • Нормализуй адреса: разворачивай сокращения, добавляй недостающий ZIP-код, при необходимости разбивай на столбцы street/city/state/ZIP.
  • Удаляй HTML-артефакты, лишние пробелы и tracking-параметры из URL.
  • Добавляй столбцы source_directory, source_url и scraped_at для отслеживаемости.

Проверка email и телефонов перед outreach

Не нужно отправлять холодное письмо на каждый собранный адрес. Проверка защищает репутацию отправителя и снижает bounce rate.

  • Проверка email: ZeroBounce (от ~$39 за 2000 кредитов, плюс 100 бесплатных кредитов в месяц) или Bouncer ($8 за 1000 кредитов, кредиты не сгорают) — хорошие варианты.
  • Проверка телефона: Twilio Lookup предлагает форматирование и валидацию бесплатно; Caller ID стоит $0.01 за запрос.
  • Бесплатные инструменты Thunderbit Email Extractor и Phone Number Extractor могут вытащить контакты, которые не видны на страницах карточек.

Обогащение: как находить контакты, если в SuperPages нет email

Во многих карточках SuperPages email вообще не указан — особенно на странице результатов поиска. Что делать:

  • Собирай страницы Contact, About или footer на сайте компании. В Thunderbit для этого подойдёт Subpage Scraping или Email Extractor в пакетном режиме.
  • Используй инструменты обогащения вроде Apollo, BetterContact, Icypeas или Prospeo. Но есть важное предупреждение: для небольших локальных компаний (например, двухсантехниковая мастерская или частный стоматолог) большие B2B-базы часто оказываются пустыми. Для такой аудитории лучше работает извлечение с сайта компании.
  • Комбинируй несколько каталогов. Собери данные из SuperPages, Yellow Pages и Google Maps по одной и той же категории и городу, а затем объедини и дедуплицируй их. Пересечения дают более полные записи.

Если ты когда-нибудь прогонял список локальных SMB через Apollo и получал в основном пустые поля, ты не один. Именно поэтому подход «сначала сайт» так важен для этой аудитории.

Импорт в CRM: как загрузить лиды в HubSpot, Salesforce или Google Sheets

  • HubSpot: перейди в Data Management > Data Integration > Import data > Quick import (contacts only). Загрузи .csv или .xlsx. В руководстве HubSpot по импорту описано сопоставление полей.
  • Salesforce: используй Data Import Wizard. Подготовь CSV, сопоставь исходные поля с полями Salesforce и запусти импорт.
  • Google Sheets / Airtable / Notion: Thunderbit экспортирует данные напрямую во все три сервиса — без промежуточного CSV.

Совет: заранее сопоставь столбцы со структурой CRM. Несколько минут на маппинг экономят часы ручной очистки позже.

SuperPages против других локальных каталогов: где искать лучшие лиды

SuperPages — сильная отправная точка, но это не единственный каталог, который стоит собирать. Вот как он выглядит на фоне других:

КаталогОбъём лидовДоступные поляСвежесть данныхСложность антискрейпингаЛучше всего для
SuperPagesБольшой (фокус на США)Название, телефон, адрес, сайт, категории, рейтингиСредняяСредняяДомашние услуги, подрядчики, SMB
Yellow PagesБольшой (фокус на США)Похоже на SuperPagesСредняяСредняяОбщий локальный outreach
Google MapsОчень большой (глобальный)Название, телефон, адрес, сайт, отзывы, часы, фотоВысокая (обновляется владельцем)Высокая (жёсткая антибот-защита)Самые актуальные локальные данные
YelpБольшой (фокус на США)Название, телефон, адрес, отзывы, ценовой диапазонВысокаяВысокаяРестораны, розница, сервисный бизнес
MantaСреднийНазвание, телефон, адрес, оценки выручки, число сотрудниковСредняяНизкаяB2B-поиск (выручка/штат)
BBBСреднийНазвание, телефон, адрес, аккредитация, жалобыСредняяНизкаяНадёжные, проверенные компании

Источники: главная страница SuperPages, статья VLDB о SuperPages, документация Google Places API, документация Yelp Places API, главная страница Manta, руководство BBB.

Thunderbit работает со всеми этими источниками — включая готовые Instant Templates для популярных сайтов вроде Google Maps и SuperPages, — так что ты можешь применять один и тот же workflow к нескольким источникам и объединять списки лидов. По моему опыту, лучший подход — собрать данные из двух или трёх каталогов по одной категории и одному городу, а потом дедуплицировать их. Пересечения заполняют пробелы и дают более полную картину.

Подробнее о сборе данных с других каталогов читай в наших материалах про Yellow Pages scrapers, Google Maps scrapers и Yelp scrapers.

Юридические и этические советы по сбору лидов из SuperPages

data-privacy-compliance-infographic.webp

Я не юрист, и это не юридическая консультация — но я достаточно давно работаю в этой сфере, чтобы знать: игнорировать комплаенс — быстрый путь к проблемам. Ниже — практический разбор.

Публичные бизнес-данные и персональные данные

Карточки компаний — название, рабочий телефон, адрес, сайт — обычно считаются публичными коммерческими данными. Это не то же самое, что персональные данные потребителей в рамках GDPR или CCPA. Но «публично» не значит «можно всё». Всегда проверяй Terms of Service сайта.

В Terms of Use SuperPages (обновлены в июле 2019 года) есть пункт «Data Mining Prohibited»: пользователям запрещено использовать боты, краулеры, spiders и подобные инструменты для сбора или извлечения данных без предварительного согласия Thryv. В статье описываются методы и рабочие процессы, но перед массовым скрейпингом тебе стоит изучить эти условия и при необходимости получить разрешение.

Комплаенс для outreach: основы CAN-SPAM и TCPA

Если ты используешь собранные email-адреса для холодных писем, руководство FTC по CAN-SPAM требует:

  • не использовать ложные или вводящие в заблуждение заголовки;
  • не писать обманчивые темы;
  • отмечать сообщение как рекламу, если это требуется;
  • указывать действительный почтовый адрес;
  • предоставлять понятный способ отписки и быстро его выполнять.

Если ты используешь собранные телефоны для холодных звонков, проверь National Do Not Call Registry и соблюдай правила TCPA — особенно в части автоматических звонков, записанных сообщений и SMS. FTC объявила о изменениях 2024 года, усиливающих защиту от вводящего в заблуждение B2B-телемаркетинга и мошеннических звонков с использованием ИИ.

Краткий чек-лист по комплаенсу

  • ✅ Собирай только публично размещённые бизнес-данные
  • ✅ Изучи Terms of Use SuperPages и получи разрешение, если это требуется
  • ✅ Проверяй контакты перед outreach
  • ✅ Добавляй опцию отписки в письмах
  • ✅ Соблюдай robots.txt и лимиты частоты запросов
  • ✅ Веди списки DNC и suppression lists для email
  • ⚠️ Не собирай персональные/потребительские данные
  • ⚠️ Не перепродавай сырые собранные данные без юридической проверки

Выбери свой метод и начни собирать список лидов

Сбор лидов из SuperPages — это не просто вытаскивание строк со страницы. Настоящая ценность появляется на всём пути: сбор, очистка, дедупликация, проверка, обогащение, импорт и только потом compliant outreach.

Коротко подведём итог:

  • Thunderbit — самый быстрый путь для отделов продаж, агентств и не-разработчиков. Два клика для сбора, один клик для обогащения через подстраницы, бесплатный экспорт в Google Sheets, Airtable, Notion или Excel. Попробуй бесплатно.
  • Octoparse — хороший визуальный инструмент для полутехнических пользователей, которым нужен больший контроль над настройками.
  • Python даёт разработчикам полную гибкость, но требует поддержки, решения проблем с блокировками и не имеет встроенного обогащения.
  • И не забывай: тот же подход работает и для Yellow Pages, Google Maps, Yelp, Manta и BBB. Собирай данные из нескольких источников, объединяй, дедуплицируй — и у тебя будет максимально полный локальный список лидов.

Если хочешь увидеть Thunderbit в действии, загляни на наш YouTube channel с пошаговыми демонстрациями или изучи Thunderbit pricing, чтобы понять, что подойдёт твоей команде.

А теперь превращай страницы каталогов в pipeline — и пусть твои телефоны всегда будут в правильном формате, а email-адреса всегда подтверждены.

Частые вопросы

Законно ли собирать данные из SuperPages для поиска лидов?

Сбор публично доступных данных бизнес-каталога для B2B-исследований — распространённая практика, но Terms of Use SuperPages запрещают data mining без предварительного согласия Thryv. Всегда изучай условия сайта, получай разрешение, если это необходимо, и соблюдай правила outreach, такие как CAN-SPAM и TCPA. Эта статья описывает методы и рабочие процессы в образовательных целях — ответственность за корректное использование лежит на тебе.

Какие данные можно получить из SuperPages?

Обычно при сборе ты получаешь название компании, телефон, адрес, сайт, категорию, рейтинг, часы работы и описание. Email на странице результатов поиска почти никогда не отображается — обычно нужно перейти на страницу деталей компании или на её собственный сайт (через subpage scraping или email extractor), чтобы найти его.

Можно ли собирать SuperPages без кода?

Да. Инструменты вроде Thunderbit (ИИ-расширение для Chrome) и Octoparse (визуальный скрейпер) позволяют собирать данные из SuperPages без написания кода. Thunderbit — самый быстрый вариант: установи расширение, открой поиск в SuperPages, нажми «AI Suggest Fields», а затем «Scrape».

Как обрабатывать пагинацию при сборе данных из SuperPages?

Thunderbit обрабатывает пагинацию автоматически — он определяет кнопки «Next» или бесконечную прокрутку и продолжает сбор. В Octoparse нужно отдельно настроить шаг пагинации в workflow. В Python придётся вручную писать логику цикла по страницам (увеличивать номер страницы и определять последнюю страницу).

Как получить email из карточек SuperPages?

Большинство карточек SuperPages не показывают email на странице результатов поиска. Используй Thunderbit Subpage Scraping, чтобы открыть страницу каждой компании, или бесплатный Email Extractor на сайте компании. Для оставшихся пробелов можно попробовать инструменты обогащения вроде Apollo, BetterContact или Prospeo — хотя для небольших локальных компаний чаще лучше работает извлечение данных с собственного сайта.

Попробуйте AI Web Scraper для лидов из SuperPages Get Started Free

Подробнее

Shuai Guan
Shuai Guan
Генеральный директор Thunderbit | Эксперт по автоматизации данных с помощью ИИ Shuai Guan — генеральный директор Thunderbit и выпускник инженерного факультета Мичиганского университета. Опираясь почти на десятилетний опыт в сфере технологий и SaaS-архитектуры, он специализируется на том, чтобы превращать сложные модели ИИ в практичные no-code инструменты для извлечения данных. В этом блоге он делится честными, проверенными в деле инсайтами о веб-скрейпинге и стратегиях автоматизации, чтобы помочь вам выстраивать более умные, data-driven рабочие процессы. Когда он не занимается оптимизацией потоков данных, тот же внимательный подход к деталям он переносит в своё увлечение фотографией.
Содержание

Собирай страницу, просто задав вопрос

Скажи, что тебе нужно, простыми словами. А ещё лучше — ничего не говори.

Попробовать Thunderbit бесплатно
Извлекай данные с помощью ИИ
Легко передавай данные в Google Sheets, Airtable или Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week