У каждого основателя, которого я знаю, в какой-то момент был куплен список из десяти тысяч «проверенных» контактов — и потом он смотрел, как отклик застывает где-то на уровне нуля. Я сам делал так в начале карьеры, и это быстро научило меня одному: куча email-адресов — это ещё не воронка продаж. По-настоящему двигают сделки компании, с которыми вообще есть смысл разговаривать, и понимание, почему именно сейчас им может быть интересно ваше предложение. Это совсем другая задача, чем просто собирать имена в интернете.
Веб-скрейпинг часто продают как способ «получить 10 000 лидов к пятнице», но инструменты, которые реально работают в 2026 году, решают более полезную задачу: находят настоящие аккаунты, подкреплённые реальными доказательствами, в тот самый момент, когда появляется сигнал о покупке. В Thunderbit я много думал о том, как люди собирают данные для продаж, и команды, которые получают лучшие результаты, — это не те, кто выгружает больше всего строк, а те, кто собирает правильные строки и добавляет к ним контекст.
Что на самом деле значит находить B2B-лиды с помощью веб-скрейпинга?
Когда люди слышат «собрать лиды», они обычно представляют себе инструмент, который вытягивает страницу каталога и отдаёт CSV с именами, должностями и email-адресами. Но это не лидогенерация — это сбор контактов. Именно поэтому у многих отделов продаж списки потом массово отскакивают и конвертируются ещё хуже.
Настоящая карточка лида — это не только имя. Нужны данные об аккаунте (название компании и канонический домен), доказательства того, что компания действительно подходит под ваш идеальный профиль клиента, временной сигнал, объясняющий, почему выходить на связь уместно именно сейчас, разрешённый способ контакта, источник данных и статус, который можно проверить позже. Звучит громоздко, но по сути всё сводится к простой последовательности: начать с открытого разрешённого источника, подтвердить личность компании, собрать признаки соответствия, зафиксировать триггер, найти минимально допустимый канал связи, проверить его, удалить дубликаты и потом отправить всё в CRM. Пропустите шаг — и получите то же, что все уже ненавидят: таблицу с незнакомцами.
Почему это важно как никогда раньше
ИИ сделал скрейпинг до смешного простым для старта и до смешного лёгким для плохой масштабной реализации. Несколько лет назад, чтобы собрать парсер, нужно было нанимать разработчика или весь уикенд возиться с XPath-селекторами. Теперь любой может направить AI scraper на страницу и получить структурированные данные за считанные минуты. Для продуктивности это отлично, но есть и обратная сторона: всё больше sales-команд быстрее, чем когда-либо, загружают в CRM неподтверждённые и неподходящие данные, а разбор этого хаоса потом отнимает гораздо больше времени, чем если бы всё было сделано правильно с самого начала.
При этом регуляторная среда никуда не делась только потому, что инструменты стали умнее. Управление комиссара по информации Великобритании прямо указывает, что публично доступные бизнес-контактные данные всё равно могут подпадать под UK GDPR, а возражения против прямого маркетинга нужно уважать даже в B2B-контексте. В США руководство FTC по CAN-SPAM тоже не делает исключений для B2B-писем — каждое коммерческое сообщение всё так же должно содержать корректные заголовки, рабочую ссылку для отказа и обработку отписки в течение 10 рабочих дней. Это не какие-то экзотические юридические тонкости; это базовые правила, по которым вы работаете, хотите вы того или нет.
Перед началом: оцените ситуацию и проверьте условия использования
Скажу прямо: не каждый сайт — честная добыча, как бы хорош ни был ваш скрейпер. В условиях Google Maps прямо запрещены экспорт и массовый сбор данных Maps. Пользовательское соглашение LinkedIn запрещает скрейпинг и несанкционированную автоматизацию. Текущие условия Clutch тоже запрещают ручной и автоматический скрейпинг. Это не какие-то скрытые пункты — это первое, что нужно проверить, прежде чем направлять на сайт любой инструмент. Я отдельно писал об этом в контексте скрейпинга LinkedIn, потому что вопрос всплывает постоянно.
Robots.txt понимать полезно, но считать его юридическим разрешением нельзя. По собственной спецификации IETF это инструкция для обхода, а не система разрешений или механизм контроля доступа. Сайт может разрешать обход в robots.txt и при этом запрещать скрейпинг в условиях использования — и в споре обычно побеждают именно условия. Моё правило простое: если для доступа к данным нужен логин, перед ними стоит CAPTCHA или в правилах прямо написано «no scraping», такой источник лучше пропустить, а не пытаться взломать.
К более безопасным и полезным публичным источникам для B2B-исследований обычно относятся сайты компаний, государственные реестры, каталоги участников и партнёров с разрешением на использование, страницы вакансий и новостные разделы. Например, API SEC EDGAR дают бесплатные публичные JSON-отчёты и XBRL-данные без API-ключа — нужно только придерживаться рекомендаций SEC по лимиту не выше 10 запросов в секунду.
Полный процесс: от сырого скрейпа до лидов, готовых для CRM
Вот последовательность, которую я бы действительно рекомендовал: это уже не столько «скрейпинг», сколько мини-исследование, в центре которого находится скрейпер.
Сначала выберите разрешённый публичный источник и соберите только данные на уровне организации: название компании, домен, URL источника, категорию, локацию и тот сигнал, который вообще привёл вас к этой компании (вакансия, пресс-релиз, список участников мероприятия). Затем для перспективных аккаунтов перейдите на их реальный сайт и подтвердите, чем они занимаются, где находятся и какой публичный канал связи у них есть. Далее валидируйте и обогащайте только те аккаунты, которые уже прошли ваш фильтр качества — не тратьте кредиты на обогащение на компании, которые вы ещё не проверили. После этого удалите дубликаты по данным вашей CRM, прежде чем что-либо импортировать. И в конце отправьте всё туда со статусным полем, чтобы sales-команда понимала, что уже проверено, а на что ещё нужно взглянуть.
Последний пункт важнее, чем многим кажется. Я бы советовал помечать каждую запись чем-то вроде candidate_account, qualified_account, contact_ready, needs_review или rejected. Это звучит чрезмерно, пока ваша SDR-команда не спросит: «Подождите, а кто-нибудь вообще проверил, что эта компания подходит под наш ICP?» — и у вас будет ответ, а не растерянное молчание.

Где искать B2B-аккаунты с сильными сигналами
Самые ценные сигналы не спрятаны — они просто разбросаны по источникам, которые большинство команд не проверяет системно. Страницы вакансий компаний показывают, кого и на какие роли они нанимают, а это неплохой индикатор того, во что они вкладываются. Новостные и пресс-разделы сообщают о раундах финансирования, расширении и запуске продуктов. Страницы партнёров и участников выставок (если скрейпинг разрешён) показывают, кто активен в конкретной экосистеме. Публичная отчётность, особенно у крупных компаний, раскрывает финансовое состояние и стратегические приоритеты куда лучше, чем любой пост в LinkedIn.
Ни один из этих сигналов сам по себе не доказывает намерение купить — вакансия на позицию «VP of Sales» не означает, что компания готова завтра купить ваш продукт. Но если смотреть на всё вместе и сопоставлять с вашими ICP-критериями, это куда более сильный фильтр, чем статичный список, купленный на lead marketplace полгода назад и уже успевший устареть на 20%.
Почему AI-скрейпинг меняет правила игры
Вот здесь всё действительно отличается от того скрейпинга, которым я занимался пять-шесть лет назад. В старой школе нужно было писать селекторы под каждый макет страницы, и как только сайт менял HTML, ваш парсер ломался. Инструменты AI-powered scraping читают страницу больше как человек: они по контексту понимают, что вот это название компании, вот это локация, а вот это должность, а не полагаются на хрупкие CSS-пути.
Именно поэтому инструмент вроде Thunderbit может посмотреть на страницу со списком и с помощью AI Suggest Fields автоматически предложить правильные колонки вместо того, чтобы заставлять вас вручную маппить каждое поле. Можно даже просто написать обычным языком — «нужны название компании, сайт, отрасль и локация» — и ИИ сам поймёт, как это извлечь. Я разговаривал с командами, которые раньше тратили по полдня на каждый сайт, чтобы собрать конфигурацию скрейпера; теперь это пара кликов и этап проверки. Это не потому, что изменились правила комплаенса — они не менялись, — а потому, что технический порог для качественной работы резко снизился. Если хотите глубже разобраться, как это работает в более широком мире AI scraping, посмотрите наш разбор AI web scraping и сравнение с более старым подходом на правилах.
Проблема подстраниц: почему одних страниц-списков недостаточно
Есть одна вещь, на которой спотыкается почти каждый новичок: страница списка — это никогда не вся история. Каталог может дать название компании и ссылку, но реальные доказательства, которые вам нужны — чем занимается компания, где у неё штаб-квартира, какую отрасль она обслуживает, — обычно спрятаны на один клик глубже, на детальной странице компании или на её собственном сайте.
Я видел, как команды выгружали сотни строк из каталога, а потом понимали, что половина «лидов» не содержит того единственного поля, которое действительно важно для квалификации. Именно поэтому subpage scraping существует как отдельная функция, а не как приятный бонус. Хороший скрейпер должен уметь открыть страницу списка, забрать ссылку на детальную страницу каждой компании, затем автоматически перейти по ней и извлечь более глубокие поля, а потом собрать всё в одну чистую строку. Пропустите этот шаг — и вы оцениваете лиды по названию компании и предположению.
Пошагово: как находить B2B-лиды с Thunderbit
Я покажу это так, как делал бы сам — с целевым каталогом и чашкой кофе.
Шаг 1: Установите Thunderbit и откройте нужный каталог
Установите расширение Thunderbit для Chrome и перейдите к разрешённому публичному источнику — списку участников выставки, отраслевому каталогу, доске вакансий, чему угодно, что подходит под ваш ICP. Прежде чем идти дальше, проверьте, разрешают ли условия сайта такой способ использования; это займёт две минуты и избавит от проблем позже.
Шаг 2: Нажмите «AI Suggest Fields»
Вместо того чтобы вручную тыкать по странице и задавать колонки, дайте ИИ посмотреть на структуру страницы и предложить поля вроде названия компании, сайта, локации и категории. Эти поля можно редактировать или добавить свои, используя обычный язык — например, инструкция «вытащи отрасль, которую обслуживает эта компания» вполне подойдёт.
Шаг 3: Запустите скрейпинг
Запустите извлечение и дайте ему пройти по странице списка и по пагинации, если каталог состоит из нескольких страниц. Это «сырой» сбор — только идентификаторы на уровне компании, ничего, что уже можно было бы считать приватным контактом.
Шаг 4: Обогатите данные через subpage scraping
Для строк, которые выглядят перспективно, используйте subpage scraping, чтобы перейти по ссылке каждой компании на её сайт или детальную страницу и извлечь более глубокие поля: чем они занимаются, где находятся и какой публичный канал связи указан. Именно этот шаг превращает голую строку из каталога в реально квалифицированный аккаунт.
Шаг 5: Проверьте и очистите данные
Прежде чем что-либо попадёт в CRM, выборочно проверьте часть записей вручную. Убедитесь, что домены открываются, что причина квалификации действительно подтверждается, а всё неоднозначное помечайте как needs_review, а не додумывайте. Здесь же можно прогнать email через сервис вроде Hunter, если вы нашли законный публичный канал связи, — но помните: «валидный» адрес не означает согласие получать маркетинговые письма.
Шаг 6: Экспортируйте и загрузите в CRM
Thunderbit бесплатно экспортирует данные в CSV, Excel, Google Sheets, Airtable и Notion. Перед импортом в HubSpot или Salesforce приведите компанию к единому ключу — лучше всего использовать домен. Собственные рекомендации HubSpot по импорту советуют для компаний использовать домен, а для контактов — email; правила дублирования Salesforce могут молча заблокировать или пометить импорт, если это пропустить. Небольшая тестовая партия на 20–30 строк перед полным импортом не раз спасала меня от куда более болезненной уборки.
Советы и типичные ошибки
Несколько вещей, которые я бы сказал каждому, кто начинает этот процесс сегодня. Не считайте scraped job title или должность доказательством намерения купить — это намёк, а не зелёный свет. Не думайте, что поле, извлечённое ИИ, автоматически является правильным; выборочно проверяйте данные перед масштабированием любого процесса. Храните именованные контакты и прямые email-адреса отдельно, в более строго управляемой части набора данных, чем исследование на уровне компании, потому что B2B автоматически не отменяет правила приватности для персональных данных. И не позволяйте логике «инструмент технически может это сделать» становиться вашей политикой комплаенса — проверяйте условия источника каждый раз, а не только в первый.
Веб-скрейпинг против покупки базы лидов
Оба подхода нужны, и делать вид, что один из них всегда лучше другого, было бы нечестно.

| Фактор | Веб-скрейпинг (разрешённые источники) | Покупка базы лидов |
|---|---|---|
| Актуальность | Насколько свежи ваши последние данные | Часто устаревает уже через несколько недель |
| Качество сигнала | Высокое — вы контролируете триггер и контекст | Низкое — обычно это только статические firmographic-данные |
| Широта покрытия | Уже, зависит от источника | Шире, более стандартизировано |
| Модель затрат | В основном ваше время + подписка на инструмент | Постоянные затраты за запись или за пользователя |
| Риск комплаенса | Управляемый, если аккуратно выбирать источники и поля | Сильно зависит от практик поставщика |
| Лучше всего подходит для | Таргетированного outbound на основе сигналов | Широкого картирования рынка и ранней оценки TAM |
Если честно, мой взгляд такой: скрейпьте, когда вам важны контекст и время — например, список участников конкретного события, недавно запущенная страница продукта конкурента или компания, которая только что опубликовала три вакансии в sales. Покупайте данные или используйте провайдеров обогащения вроде Apollo, когда вам нужно широкое, стандартизированное покрытие и вы готовы самостоятельно проверять свежесть. Эти подходы не исключают друг друга; многие команды сначала собирают сигналы, а затем обогащают уже квалифицированные аккаунты, вместо того чтобы навсегда выбирать что-то одно.
Реальный сценарий
Допустим, вы продаёте ПО для управления автопарком и хотите находить растущие логистические компании. Скрейпинг публичного реестра перевозчиков у департамента транспорта штата или отраслевого каталога участников даёт вам названия компаний, локации и категории размера автопарка — всё публично и всё разрешено. Затем вы переходите на сайт каждой компании и подтверждаете, что она реально работает, а также берёте её общий контактный номер. Это, возможно, 200 квалифицированных аккаунтов вместо 5 000 неподтверждённых имён, но каждый из них стоит времени SDR, а это и есть настоящая цель.
Скрейпинг для B2B-лидов работает лучше всего тогда, когда вы перестаёте воспринимать его как просто построение списков и начинаете относиться к нему как к исследованию с более удобными инструментами. Я видел, как sales-команды получали больше pipeline с 150 хорошо квалифицированных аккаунтов, чем с 10 000 купленных контактов, просто потому, что outreach был релевантным, а не шаблонным. Если вы думаете, где AI scraping вписывается в вашу общую sales-механику, стоит посмотреть, как ИИ меняет лидогенерацию, и как sales-команды действительно используют ИИ каждый день — там оба материала глубже разбирают процессы, которые идут дальше самого шага скрейпинга.
Построение такого пайплайна требует чуть больше подготовки, чем скачивание списка контактов, это правда. Но компании, с которыми вы в итоге работаете, действительно хотят вас услышать — а это, учитывая мой опыт отправки немалого количества холодных писем в пустоту, стоит тех самых дополнительных тридцати минут подготовки.

FAQ
Законно ли собирать B2B-данные о компаниях из интернета? Это полностью зависит от источника. Публичные сайты компаний, государственные реестры и каталоги, которые прямо разрешают такой сбор, обычно допустимы для исследовательских целей. Сайты вроде LinkedIn и Google Maps прямо запрещают скрейпинг в своих условиях, независимо от того, что технически возможно. Всегда проверяйте условия использования сайта перед скрейпингом и воспринимайте robots.txt как инструкцию для обхода, а не как юридическое разрешение.
В чём разница между «лидом» и «контактом» в этом контексте? Контакт — это просто имя и способ связаться. Лид, если всё сделано правильно, — это запись о компании, подтверждённая доказательствами соответствия вашему идеальному профилю клиента, плюс временной сигнал, объясняющий, почему вы выходите на связь именно сейчас. Массовый сбор контактов без этого контекста и есть причина, почему многие холодные кампании показывают слабый результат.
Могут ли AI scraping-инструменты гарантировать точность данных? Нет, и любой инструмент, который утверждает обратное, должен насторожить. ИИ отлично структурирует неаккуратные страницы, но всё равно может неправильно интерпретировать неоднозначные поля. Выборочная проверка данных перед масштабированием скрейпа — полезная привычка независимо от того, какой инструмент вы используете.
Лучше собирать email-адреса напрямую или потом использовать enrichment-инструмент? Инструменты обогащения обычно надёжнее, когда нужно найти и проверить email-адреса конкретных контактов, чем пытаться вытащить их прямо со страниц, и они, как правило, чётко документируют статус проверки. Мой совет: сначала скрейпьте данные для квалификации на уровне компании, а затем обогащайте только те аккаунты, которые уже прошли ваш фильтр соответствия — так эффективнее и ниже риск по комплаенсу.
Как избежать дублирования лидов при импорте в CRM? Перед импортом используйте домен компании как основной идентификатор, а не название компании — у названий слишком много вариаций, чтобы надёжно удалять дубликаты. И в HubSpot, и в Salesforce есть документация о том, как работают правила сопоставления, а небольшая тестовая партия перед полным импортом поймает большую часть проблем до того, как они превратятся в хаос в вашей воронке.


