리드 확보를 위해 SuperPages를 크롤링하는 방법 (3가지, 단계별 가이드)

최종 업데이트: June 3, 2026
리드 확보를 위해 SuperPages를 크롤링하는 방법 (3가지, 단계별 가이드)
AI 요약
Automate your lead generation from SuperPages by comparing three methods: AI no-code tools, visual scrapers, and Python scripts. Get tips for 2026.

얼마 전 한 사용자가 이런 얘기를 들려줬어요. SuperPages에 올라온 배관 업체 목록을 스프레드시트로 옮기느라 오후를 통째로 날렸다고요. 3시간 동안 복사·붙여넣기만 반복해서 겨우 47행. 손목은 시큰거리고, 데이터엔 오타가 섞였고, 이메일 주소는 끝내 못 구했대요. 저도 비슷한 시절을 보냈던 터라 남 일 같지 않았어요. Thunderbit을 만든 이유가 정확히 이런 상황 때문입니다.

SuperPages는 Thryv가 운영하는 미국의 대표 지역 업체 디렉터리예요. 주요 도시와 업종을 두루 다뤄 배관, 치과, 변호사, HVAC 기사까지 없는 게 없죠. 예전 기술 문서에는 1,100만 개가 넘는 목록을 가진 전국 옐로 페이지 데이터베이스로 소개됐고, 지금도 지역별 카테고리가 촘촘하게 정리돼 있어요. 진짜 문제는 목록을 찾는 게 아니에요. 그 데이터를 깔끔하게 다듬고, 필요한 정보를 보강해서, 오후 시간이나 멘탈을 갈아 넣지 않고 리드 리스트로 바꾸는 일이죠.

HubSpot의 2024 Sales Trends 보고서를 보면, 영업 담당자가 실제 판매에 쓰는 시간은 하루 약 2시간뿐이에요. 나머지는 데이터 입력이나 리서치에 다 빨려 들어가죠. 같은 보고서에서 영업 전문가의 81%는 AI가 수작업 시간을 줄여 줄 수 있다고 답했어요. 이 글에서는 코드 없는 AI 도구부터 Python까지, SuperPages에서 리드를 뽑는 3가지 방법을 소개할게요. 본인 수준에 맞는 방식을 골라서, 진짜 성과를 만드는 일에 다시 집중해 보세요.

AI로 SuperPages 리드 추출하기 Get Started Free

SuperPages란 무엇이며, 영업팀이 리드 발굴에 선호하는 이유

SuperPages는 미국 중심의 온라인 업체 디렉터리예요. 지역 업체가 연락처, 카테고리, 평점과 함께 등록되는 곳이죠. 한마디로 옛날 전화번호부였던 옐로 페이지가 디지털로 진화한 버전이에요. 다만 지금은 지역·카테고리별 검색이 되고, 목록마다 담긴 정보도 훨씬 풍부해요.

superpages-directory-services.webp

일반적인 SuperPages 목록에는 이런 정보가 들어 있어요:

  • 업체명
  • 전화번호
  • 도로명 주소
  • 웹사이트 URL(있을 경우)
  • 카테고리(예: 배관, 가족법, HVAC)
  • 평점 및 리뷰
  • 영업시간(보통 상세 페이지에 표시)
  • 소개 설명(상세 페이지)

SuperPages 홈에서는 Home Services, Plumbers, Electricians, Dentists, Legal Services, Auto Repair, Restaurants, Pet Services 같은 인기 카테고리를 앞세워요. 재밌는 건, 이 분야들이 영업팀과 에이전시, 지역 서비스 업체가 아웃바운드 대상으로 노리는 업종과 정확히 겹친다는 점이에요.

정리하면 SuperPages는 미국 지역 비즈니스를 공략하는 사람에게 보물창고 같은 데이터 소스예요. 구조가 잘 잡혀 있고, 커버 범위도 넓고, 카테고리 구성이 아웃바운드 캠페인에 바로 연결하기 좋게 돼 있어요.

SuperPages 리드를 위해 Thunderbit 사용해 보기

SuperPages를 리드 발굴용으로 크롤링해야 하는 이유

SuperPages를 하나하나 열어 데이터를 옮기는 건 생산성의 블랙홀이에요. 크롤링으로 자동화하면 몇 시간짜리 작업이 몇 분으로 줄어요. 게다가 검색 조건(카테고리 + 도시 + 키워드)을 직접 정할 수 있어, 시중에서 사는 범용 리스트보다 정확하고 관련성도 높죠.

사용자들에게서 자주 보는 대표 활용 사례를 정리하면 이래요:

활용 사례주요 대상예시
지역 리드 발굴영업팀, 에이전시달라스의 배관 업체 리스트를 만들어 콜드 아웃리치에 활용
경쟁사 리서치운영, 마케팅한 시장 내 경쟁사별 평점과 서비스를 비교
시장 매핑사업개발신제품 출시를 위해 특정 우편번호 지역의 모든 치과를 파악
공급업체 소싱구매, 운영전화번호와 웹사이트 정보가 포함된 지역 공급업체 찾기
로컬 SEO 잠재고객 발굴에이전시웹사이트가 없거나 목록 정보가 부실한 업체 찾기
영업 구역 설계현장 영업도시, 우편번호, 서비스 지역별로 업체를 묶어 관리

미국 B2B 리드 생성 시장은 2024년 85억 달러(약 11조 원) 규모로 추정되고, 2034년엔 182억 달러(약 24조 원)까지 커질 거라는 전망이에요. 이런 데이터 수요는 앞으로도 계속 늘어날 가능성이 크다는 뜻이죠. 새로 크롤링한 카테고리·지역별 리스트는 범용 리스트보다 타깃이 분명할 수 있어요. 다만 실제 아웃리치 전엔 반드시 검증과 중복 제거를 거쳐야 해요(뒤에서 자세히 다룰게요).

최종 결과 예시: SuperPages에서 수집한 샘플 데이터

방법을 소개하기 전에, 결과물이 실제로 어떤 모습인지 먼저 보여드릴게요. 많은 가이드가 이걸 건너뛰는데, 시간과 노력을 들이기 전에 완성물의 그림을 아는 게 중요해요.

아래는 예시 출력 테이블이에요(가상 데이터지만 현실적인 형태예요).

업체명전화번호주소웹사이트카테고리평점영업시간이메일(보강)
Sunset Pipe & Drain Co.+1 213-555-01481842 W 7th St, Los Angeles, CA 90057sunsetpipe.examplePlumbing4.6월-금 7:00-18:00service@sunsetpipe.example
Arroyo HVAC Pros+1 626-555-018272 N Fair Oaks Ave, Pasadena, CA 91103arroyohvac.exampleHVAC4.8월-토 8:00-19:00hello@arroyohvac.example
Wilshire Family Dental+1 323-555-01194100 Wilshire Blvd, Los Angeles, CA 90010wilshiredental.exampleDentists4.4월-목 9:00-17:00appointments@wilshiredental.example
Pacific Legal Aid Group+1 310-555-017311845 W Olympic Blvd, Los Angeles, CA 90064Legal Services4.2월-금 8:30-17:30intake@pacificlegal.example
Valley Auto Repair Center+1 818-555-019814422 Ventura Blvd, Sherman Oaks, CA 91423valleyautorepair.exampleAuto Repair4.7월-토 8:00-18:00info@valleyautorepair.example
Echo Park Pet Grooming+1 213-555-01661511 Sunset Blvd, Los Angeles, CA 90026echoparkpets.examplePet Grooming4.9화-일 9:00-17:00booking@echoparkpets.example

짚어 둘 점은 이래요:

  • 검색 결과 페이지에서 가져오는 정보: 업체명, 전화번호, 일부 주소, 카테고리, 평점, 목록 URL
  • 업체 상세 페이지(서브페이지)에서 가져오는 정보: 전체 주소, 영업시간, 소개, 리뷰, 때로는 웹사이트
  • 보강(enrichment)으로 얻는 정보: 이메일(대개 업체 웹사이트나 보강 도구에서만 나옴)
  • 정리(cleaning) 과정에서 더하는 정보: E.164 형식으로 정규화된 전화번호, 표준화된 주/우편번호, 중복 제거 키, 소스 URL, 수집일

이렇게 정리된 결과는 CRM, Google Sheets, Airtable 베이스에 바로 넣어 곧장 쓸 수 있어요.

SuperPages를 리드 발굴용으로 크롤링하는 3가지 방법: 빠른 비교

ai-no-code-visual-python-comparison.webp

기술 수준이나 인내심은 사람마다 달라요. 그래서 3가지 방법을 나란히 비교해 봤어요. 본인에게 맞는 걸 골라 보세요.

기준Thunderbit(AI 노코드)비주얼 스크래퍼(예: Octoparse)Python(Requests + BS4)
설정 시간약 2분(확장 프로그램 설치)약 15분(워크플로우 생성)약 30분(라이브러리 설치, 코드 작성)
코딩 필요 여부없음없음필요(Python)
페이지네이션 처리내장됨(클릭 또는 스크롤)설정 필요수동 코드 작성
서브페이지 보강1클릭 서브페이지 크롤링별도 워크플로우/루프 필요별도 스크립트 필요
차단 회피Cloud Scraping이 처리요금제/프록시 옵션에 따라 다름직접 처리(프록시, 헤더, 속도 제한)
내보내기 옵션Excel, Google Sheets, Airtable, Notion, CSV, JSONCSV, Excel, 데이터베이스직접 구현한 형식
추천 대상영업팀, 에이전시, 비개발자어느 정도 기술이 있는 사용자완전한 제어를 원하는 개발자

제 추천은 간단해요. 2분 만에 바로 시작하고 싶으면 방법 1이에요. 시각적 워크플로우를 선호하고 약간의 설정을 감수할 수 있으면 방법 2가 맞아요. Python을 잘 다루고 완전한 제어가 필요하면 방법 3으로 가세요.

방법 1: Thunderbit로 SuperPages 리드 크롤링하기(AI, 노코드)

이 방법은 "SuperPages 검색 결과를 띄웠다"에서 "리드 리스트를 손에 넣었다"로 가는 가장 빠른 경로예요. 코딩도, 워크플로우 빌더도, 프록시 설정도 없어요. 제가 만든 도구라 편향이 있을 수는 있지만, 실제로 어떻게 돌아가는지 보시면 직접 판단하실 수 있을 거예요.

난이도: 초급
소요 시간: 카테고리/도시 기준 전체 크롤링에 약 5분
준비물: Chrome 브라우저, Thunderbit Chrome 확장 프로그램(무료 플랜 가능)

1단계: Thunderbit를 설치하고 SuperPages를 연다

Thunderbit Chrome Extension 다운로드 페이지에서 확장 프로그램을 설치하세요. 1분이면 끝나요. 설치했으면 SuperPages 검색 결과 페이지로 이동해요. 예를 들어 superpages.com에서 "Plumbers in Los Angeles, CA"를 검색하면 돼요.

브라우저 툴바에 Thunderbit 아이콘이 보이고, 바로 쓸 수 있는 사이드바 패널이 열려 있으면 준비 완료예요.

2단계: "AI Suggest Fields"를 눌러 데이터 컬럼을 자동 인식한다

사이드바를 열고 "AI Suggest Fields"를 클릭하세요. Thunderbit의 AI가 페이지를 읽고, 찾아낸 내용을 바탕으로 컬럼을 자동 추천해요. 보통 업체명, 전화번호, 주소, 웹사이트, 카테고리, 평점, 목록 URL이 잡혀요.

크롤링 전에 컬럼을 조정하거나 추가·삭제할 수 있어요. "웹사이트가 있는가?", "서비스 지역인가?" 같은 사용자 지정 컬럼을 넣고 싶으면 Field AI Prompt에 평범한 영어로 설명만 적으면 돼요. 예를 들어 "전화번호를 +1XXXXXXXXXX 형식으로 맞춰줘"나 "주거용/상업용으로 분류해줘"처럼요.

이제 패널에 설정한 컬럼이 담긴 테이블 미리보기가 보일 거예요.

3단계: "Scrape"를 눌러 데이터를 채운다

파란색 "Scrape" 버튼을 누르세요. Thunderbit이 현재 페이지의 모든 목록을 뽑아 표를 한 행씩 채워요. 일반적인 결과 페이지라면 30~45초쯤 걸려요.

페이지네이션도 알아서 처리해요. "Next" 버튼이나 무한 스크롤을 감지해서, 페이지가 끝나거나 한도에 닿을 때까지 계속 진행하죠. 대도시권의 모든 배관 업체처럼 큰 결과 세트를 크롤링한다면 Cloud Scraping 모드로 바꾸세요. 브라우저를 점유하지 않고 한 번에 최대 50페이지까지 처리해요.

4단계: Subpage Scraping으로 각 목록을 보강한다

business-profile-verification-process.webp

검색 결과에는 기본 정보만 나와요. 진짜 알맹이인 영업시간, 전체 소개, 리뷰, 때로는 이메일은 업체 상세 페이지에 있죠. "Scrape Subpages"를 클릭하면 Thunderbit이 목록마다 상세 페이지를 방문해 영업시간, 설명, 웹사이트 URL, 거기 보이는 모든 연락처를 보강 컬럼으로 가져와요.

이 과정은 클릭 한 번이면 끝나요. 별도 워크플로우도, 복잡한 설정도 없죠. 보강된 데이터는 기존 테이블에 그대로 이어 붙어요.

5단계: 리드를 Excel, Google Sheets, Airtable, Notion으로 내보낸다

데이터가 마음에 들면 Export를 클릭하세요. Thunderbit은 리드를 이렇게 바로 보낼 수 있어요:

  • Google Sheets(CRM 준비 및 공유에 유용)
  • Airtable(가벼운 파이프라인 테이블)
  • Notion(리서치 데이터베이스)
  • Excel / CSV(CRM 가져오기용)
  • JSON(개발자 전달용)

cloud50-data-workflow.webp

내보내기 옵션은 모두 무료예요. HubSpot이나 Salesforce로 리드를 넣는다면 CSV나 Google Sheets가 보통 제일 빨라요.

팁: 넓은 주 단위 검색보다 카테고리 + 도시 기준으로 크롤링하세요. "Texas의 plumbers"보다 "Dallas TX의 emergency plumbers"가 훨씬 정교하고 실행 가능한 리스트를 만들어요. 추적을 위해 "Source URL"과 "Scraped At" 컬럼도 추가해 두면 좋아요.

방법 2: 비주얼 스크래핑 도구로 SuperPages 크롤링하기(Octoparse 예시)

Octoparse 같은 비주얼 도구는 딱 중간 지점이에요. 코딩은 필요 없지만, Thunderbit보다 설정과 구성이 조금 더 많아요. Octoparse엔 간단한 작업용 SuperPages 사전 제작 템플릿도 있어요.

난이도: 중급
소요 시간: 설정 + 크롤링에 약 20~30분
준비물: Octoparse 계정(무료 플랜 제공, 단 제약 있음)

1단계: 새 작업을 만들고 SuperPages URL을 불러온다

Octoparse를 열고 "New Task"를 클릭한 뒤 SuperPages 검색 URL을 붙여넣으세요(예: "https://www.superpages.com/los-angeles-ca/plumbers"). 내장 브라우저가 페이지를 불러와요.

2단계: 데이터 필드를 자동 감지하거나 수동으로 선택한다

"Auto-detect"를 클릭하면 Octoparse가 페이지를 스캔해 관련 있다고 본 데이터 필드를 강조 표시해요. Data Preview 패널을 확인하세요. 제 경험상 자동 감지는 대부분 필드를 잘 잡지만, 광고 라벨이나 내비게이션 텍스트 같은 잡음을 끼워 넣거나 일부 필드를 놓치기도 해요. 그래서 몇 개는 직접 추가하거나 빼야 할 가능성이 커요.

Octoparse 도움말에 따르면, 자동 감지는 페이지네이션과 데이터 추출 단계를 포함한 기본 워크플로우를 만들어 주지만, 빠진 데이터는 사용자가 직접 채워야 할 수 있어요.

3단계: 워크플로우를 만들고 페이지네이션을 설정한다

"Create workflow"를 클릭하세요. Octoparse가 단계별 작업 시퀀스를 자동으로 생성해요. 페이지네이션 단계를 확인해서 "Next"를 제대로 클릭하거나 추가 결과를 올바르게 불러오는지 점검하세요. 각 업체 상세 페이지에서 영업시간, 이메일, 설명 같은 데이터를 가져오려면 워크플로우 안에 상세 페이지 루프나 서브페이지 동작을 넣어야 해요. 이 부분은 Thunderbit의 원클릭 서브페이지 방식보다 복잡해요.

4단계: 작업을 실행하고 데이터를 내보낸다

작업은 로컬에서 돌릴 수도 있고(작업량이 적을 때), Octoparse 클라우드에서 돌릴 수도 있어요(예약 작업이나 대규모 작업용이며 클라우드는 유료 기능이에요). 끝나면 CSV, Excel, JSON으로 내보내세요.

알아두면 좋은 제한이 있어요. Octoparse 무료 플랜은 10개 작업, 월 50,000행, 로컬 추출만 돼요. 클라우드 실행, IP 회전, CAPTCHA 해결, 일부 내보내기 연동은 연간 결제 기준 월 약 69달러(약 9만 5천 원)부터 시작하는 유료 플랜이 필요해요.

방법 3: Python(Requests + BeautifulSoup)으로 SuperPages 크롤링하기

이건 개발자용 경로예요. 제어권은 다 가지지만, 책임도 다 본인 몫이에요. Python 스크립트를 직접 짜고 유지보수할 수 있다면 가장 유연하지만, 그만큼 골치 아픈 일도 따라와요.

난이도: 고급
소요 시간: 약 30~60분(설정 + 코딩 + 디버깅)
준비물: Python 3.x, pip, requests, beautifulsoup4, lxml, 코드 에디터

1단계: Python 환경을 준비한다

python -m venv .venv
source .venv/bin/activate
pip install requests beautifulsoup4 lxml pandas

2단계: SuperPages의 HTML 구조를 확인한다

SuperPages 결과 페이지에서 개발자 도구(F12)를 여세요. 업체명, 주소, 전화번호, 웹사이트, 상세 페이지 링크에 해당하는 CSS 선택자를 찾아야 해요. HTML 구조는 예고 없이 바뀌니까, 지금 맞는 선택자가 언제든 깨질 수 있다는 점은 염두에 두세요.

3단계: 목록 크롤러를 작성하고 페이지네이션을 처리한다

아래는 단순화한 예시예요. 중요한 주의점이 하나 있어요. 제 테스트에서는 SuperPages에 직접 요청했더니 Cloudflare의 "Attention Required" 차단 페이지가 돌아왔어요. 단순 Requests 스크립트는 규모가 커지면 실패할 수 있으니, 브라우저 세션 컨텍스트, 속도 제한, 재시도, 또는 허가된 대안이 필요할 수 있어요.

import csv, time
from urllib.parse import urljoin
import requests
from bs4 import BeautifulSoup

BASE_URL = "https://www.superpages.com"
HEADERS = {
    "User-Agent": (
        "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
        "AppleWebKit/537.36 (KHTML, like Gecko) "
        "Chrome/125.0 Safari/537.36"
    )
}

def fetch(url):
    resp = requests.get(url, headers=HEADERS, timeout=20)
    resp.raise_for_status()
    if "Attention Required" in resp.text or "Cloudflare" in resp.text:
        raise RuntimeError("차단됨. 속도를 낮추거나 브라우저/클라우드 스크래핑으로 전환하세요.")
    return BeautifulSoup(resp.text, "lxml")

def parse_listing(card):
    name_el = card.select_one(".business-name, a.business-name, h2 a, h3 a")
    phone_el = card.select_one(".phones, .phone, [class*=phone]")
    address_el = card.select_one(".street-address, .adr, [class*=address]")
    website_el = card.select_one("a.track-visit-website, a[href*='http']")
    rating_el = card.select_one(".rating, [class*=rating]")
    detail_url = urljoin(BASE_URL, name_el.get("href")) if name_el and name_el.get("href") else ""
    return {
        "business_name": name_el.get_text(" ", strip=True) if name_el else "",
        "phone": phone_el.get_text(" ", strip=True) if phone_el else "",
        "address": address_el.get_text(" ", strip=True) if address_el else "",
        "website": website_el.get("href", "") if website_el else "",
        "rating": rating_el.get_text(" ", strip=True) if rating_el else "",
        "detail_url": detail_url,
    }

def scrape_search(search_url, pages=3):
    all_rows = []
    for page in range(1, pages + 1):
        page_url = f"{search_url}?page={page}"
        soup = fetch(page_url)
        cards = soup.select(".result, .organic, [class*=result]")
        if not cards:
            break
        for card in cards:
            all_rows.append(parse_listing(card))
        time.sleep(5)
    return all_rows

if __name__ == "__main__":
    rows = scrape_search("https://www.superpages.com/los-angeles-ca/plumbers", pages=2)
    with open("superpages_leads.csv", "w", newline="", encoding="utf-8") as f:
        writer = csv.DictWriter(f, fieldnames=sorted({k for row in rows for k in row}))
        writer.writeheader()
        writer.writerows(rows)

4단계: 상세 페이지를 크롤링해 데이터를 보강한다

각 상세 페이지 URL을 방문해 영업시간, 이메일, 설명, 리뷰를 뽑는 별도 함수를 작성하세요. 즉, 속도 제한 관리, 오류 처리, 경우에 따라 프록시까지 전부 직접 다뤄야 해요.

5단계: 데이터를 CSV 또는 JSON으로 저장한다

Python의 csv나 json 모듈을 쓰면 돼요. 중복 제거, 정리, 내보내기 로직도 직접 짜야 해요.

자주 부딪히는 문제는 이래요:

  • SuperPages는 Cloudflare 같은 봇 차단 시스템으로 요청을 막을 수 있어요(테스트에서 확인됨).
  • 여기선 선택자를 넓게 잡았는데, SuperPages 마크업이 바뀔 수 있기 때문이에요.
  • 검색 결과 페이지에 이메일이 있다고 가정하지 마세요. 대부분 없어요.
  • 운영용 크롤러에는 robots/TOS 검토, 속도 제한, 재시도/백오프, 구조화된 로그, 오류 캡처가 필요해요.

Python 크롤링을 더 깊이 배우고 싶다면, 웹 스크래핑 with Python 가이드나 BeautifulSoup 튜토리얼을 참고하세요.

원시 데이터를 진짜 리드로 바꾸는 전체 파이프라인(크롤링 → 정리 → 검증 → CRM)

대부분의 크롤링 가이드는 여기서 멈추는데, 진짜 가치는 지금부터예요. 크롤링은 재료를 모으는 일이고, 이걸 실제로 쓸 수 있는 리드 리스트로 바꾸려면 몇 단계가 더 필요해요.

data-pipeline-workflow.webp

파이프라인은 이렇게 흘러가요:

SuperPages 검색 → 목록 크롤링 → 상세 페이지/웹사이트 크롤링 → Google Sheets 또는 CSV로 내보내기 → 전화번호, 주소, 카테고리 정리 → 중복 제거 → 이메일/전화번호 검증 → 누락 연락처 보강 → CRM 가져오기 → 규정 준수 아웃리치

중복 제거: 중복 목록 없애기

SuperPages에는 같은 업체가 여러 카테고리에 동시에 뜨는 경우가 많아요. 같은 도시에서 "plumbers"와 "drain cleaning"을 함께 크롤링했다면 겹치는 항목이 생기죠.

  • 1차 중복 제거 키: 정규화된 전화번호 + 정규화된 도로명 주소
  • 2차: 도메인 + 도시
  • 최후의 대안: 업체명 + 우편번호(프랜차이즈는 수동 검토)

Google Sheets에서는 완전히 같은 행을 지울 때 =UNIQUE(A:H)를 쓰거나, 근사 중복을 잡으려고 =LOWER(REGEXREPLACE(B2&C2,"[^a-zA-Z0-9]","")) 같은 보조 열을 만들 수 있어요. Excel에서는 데이터 > 중복 항목 제거를 쓰면 돼요.

데이터 정리: 전화번호, 주소, 형식 표준화

  • 전화번호는 E.164 형식으로 맞추세요. 미국이면 +1 뒤에 10자리 숫자예요. 대부분의 CRM과 다이얼러가 이 형식을 기대해요. Thunderbit의 Field AI Prompt를 쓰면 크롤링 중 자동 포맷도 가능해요.
  • 주소를 표준화하세요. 약어를 풀고, 빠진 우편번호를 채우고, 필요하면 거리/도시/주/우편번호로 나눠 두세요.
  • URL에서 HTML 잔여물, 불필요한 공백, 추적 쿼리 파라미터를 제거하세요.
  • 추적을 위해 source_directory, source_url, scraped_at 컬럼을 추가하세요.

아웃리치 전에 이메일과 전화번호 검증하기

크롤링한 이메일 전부에 무작정 콜드 메일을 쏘지 마세요. 검증은 발신자 평판을 지키고 반송률을 낮춰 줘요.

  • 이메일 검증: ZeroBounce(2,000 크레딧 기준 약 39달러(약 5만 4천 원)부터, 매월 100개 무료 크레딧 포함)나 Bouncer(1,000 크레딧에 8달러(약 1만 1천 원), 크레딧 만료 없음)가 괜찮아요.
  • 전화번호 검증: Twilio Lookup은 포맷팅과 검증을 무료로 해 주고, Caller ID는 요청당 0.01달러(약 14원)예요.
  • Thunderbit의 무료 Email Extractor와 Phone Number Extractor를 쓰면 목록 페이지에서 놓친 연락처도 찾을 수 있어요.

보강: SuperPages에 이메일이 없을 때 연락처 찾는 방법

많은 SuperPages 목록엔 이메일이 안 보여요. 특히 검색 결과 페이지엔 거의 없죠. 이럴 땐 이렇게 하세요:

  • 업체 웹사이트의 Contact, About, 또는 푸터 페이지를 크롤링해요. Thunderbit의 Subpage Scraping이나 Email Extractor를 쓰면 대량 처리도 돼요.
  • Apollo, BetterContact, Icypeas, Prospeo 같은 보강 도구를 써요. 다만 직원 2명짜리 배관점이나 1인 치과 같은 작은 지역 업체는 대형 B2B 데이터베이스가 비어 있는 경우가 많아요. 이럴 땐 웹사이트 우선 추출이 더 잘 맞아요.
  • 여러 디렉터리를 함께 쓰세요. SuperPages, Yellow Pages, Google Maps를 같은 카테고리/도시로 크롤링한 뒤 병합하고 중복을 제거해요. 서로 겹치는 부분이 더 완성도 높은 레코드를 만들어 줘요.

지역 SMB 리스트를 Apollo에 넣었다가 죄다 빈칸만 봤던 경험이 있다면, 혼자만 그런 게 아니에요. 그래서 이런 대상엔 웹사이트 우선 방식이 중요해요.

CRM 가져오기: HubSpot, Salesforce, Google Sheets에 리드 넣기

  • HubSpot: Data Management > Data Integration > Import data > Quick import(contacts only)로 가세요. .csv.xlsx 파일을 올리면 돼요. HubSpot 가져오기 가이드에 필드 매핑 방법이 나와 있어요.
  • Salesforce: Data Import Wizard를 쓰세요. CSV를 준비하고, 원본 필드를 Salesforce 필드에 매핑한 뒤 가져오기를 실행해요.
  • Google Sheets / Airtable / Notion: Thunderbit은 세 서비스 모두로 바로 내보낼 수 있어서 CSV를 거칠 필요가 없어요.

팁: 가져오기 전에 크롤링한 컬럼을 CRM 필드와 미리 매핑해 두세요. 몇 분 투자로 나중에 수시간짜리 수작업 정리를 아낄 수 있어요.

SuperPages와 다른 지역 비즈니스 디렉터리 비교: 가장 좋은 리드는 어디에 있나

SuperPages는 좋은 출발점이지만, 크롤링할 가치가 있는 디렉터리가 여기만은 아니에요. 비교하면 이래요:

디렉터리리드 수량사용 가능한 데이터 항목데이터 최신성크롤링 난이도추천 용도
SuperPages많음(미국 중심)이름, 전화, 주소, 웹사이트, 카테고리, 평점보통중간홈 서비스, 시공업체, SMB
Yellow Pages많음(미국 중심)SuperPages와 유사보통중간일반적인 지역 비즈니스 아웃리치
Google Maps매우 많음(글로벌)이름, 전화, 주소, 웹사이트, 리뷰, 영업시간, 사진높음(소유자 업데이트)높음(강한 봇 차단)가장 최신의 지역 데이터
Yelp많음(미국 중심)이름, 전화, 주소, 리뷰, 가격대높음높음음식점, 리테일, 서비스 업종
Manta중간이름, 전화, 주소, 추정 매출, 직원 수보통낮음B2B 잠재고객 발굴(매출/인원 데이터)
BBB중간이름, 전화, 주소, 인증, 민원보통낮음신뢰할 수 있는 검증 업체

출처: SuperPages 홈페이지, VLDB SuperPages 논문, Google Places API 문서, Yelp Places API 문서, Manta 홈페이지, BBB 가이드.

Thunderbit은 이 모든 사이트에서 쓸 수 있고, Google Maps나 SuperPages처럼 인기 사이트엔 바로 쓸 수 있는 템플릿도 있어요. 덕분에 같은 워크플로우를 여러 소스에 적용하고 리드 리스트를 통합할 수 있죠. 제 경험상 가장 좋은 방법은 같은 카테고리/도시로 디렉터리 2~3개를 크롤링한 뒤 중복을 제거하는 거예요. 겹치는 데이터가 빈칸을 메우고 더 완전한 그림을 만들어 줘요.

다른 디렉터리 크롤링이 궁금하다면 Yellow Pages 스크래퍼, Google Maps 스크래퍼, Yelp 스크래퍼 가이드를 참고하세요.

SuperPages 리드 크롤링 시 알아야 할 법적·윤리적 팁

data-privacy-compliance-infographic.webp

저는 변호사가 아니고, 이건 법률 자문이 아니에요. 다만 이 분야에서 오래 일하다 보니, 규정을 무시하는 게 금방 문제를 부르는 지름길이란 건 압니다. 실무에서 꼭 챙길 것만 정리해 드릴게요.

공개 비즈니스 데이터와 개인 데이터

업체명, 비즈니스 전화번호, 비즈니스 주소, 비즈니스 웹사이트 같은 목록 정보는 보통 공개된 상업 데이터로 봐요. GDPR(한국이라면 개인정보보호법(PIPA))이나 CCPA가 다루는 개인 소비자 데이터와는 달라요. 하지만 "공개"가 "아무 규칙도 없음"을 뜻하진 않아요. 사이트 서비스 약관은 늘 확인하세요.

SuperPages 이용 약관(2019년 7월 업데이트)에는 "Data Mining Prohibited" 조항이 있어요. Thryv의 사전 동의 없이 봇, 크롤러, 스파이더 또는 유사 도구로 데이터를 수집·추출해선 안 된다고 명시돼 있죠. 이 글은 방법과 워크플로우를 설명하지만, 대량 크롤링 전엔 해당 약관을 검토하고 필요하면 허가를 받는 게 좋아요.

아웃리치 준수: CAN-SPAM과 TCPA 기본사항

크롤링한 이메일로 콜드 아웃리치를 한다면, FTC의 CAN-SPAM 가이드에 따라 이걸 지키세요:

  • 거짓되거나 오해를 부르는 헤더를 쓰지 말 것
  • 기만적인 제목을 쓰지 말 것
  • 필요한 경우 메시지가 광고임을 표시할 것
  • 유효한 실제 우편 주소를 포함할 것
  • 명확한 수신 거부 방법을 주고, 요청은 즉시 반영할 것

크롤링한 전화번호로 콜드 콜을 한다면 National Do Not Call Registry를 확인하고 TCPA를 준수해야 해요. 특히 자동 통화, 녹음 메시지, SMS 관련 규정에 주의하세요. FTC는 2024년에 기만적인 B2B 텔레마케팅과 AI 기반 사기 전화에 대한 보호를 강화하는 변경을 발표했어요.

간단한 준수 체크리스트

  • ✅ 공개적으로 등록된 비즈니스 데이터만 크롤링하기
  • ✅ SuperPages 이용 약관을 검토하고 필요한 경우 허가 받기
  • ✅ 아웃리치 전에 연락처 검증하기
  • ✅ 이메일에는 수신 거부 옵션 포함하기
  • ✅ robots.txt와 속도 제한을 존중하기
  • ✅ DNC 및 이메일 차단 목록 유지하기
  • ⚠️ 개인/소비자 데이터는 크롤링하지 않기
  • ⚠️ 법률 검토 없이 원본 크롤링 데이터를 재판매하지 않기

자신에게 맞는 방법을 골라 리드 리스트 구축을 시작하세요

SuperPages를 리드용으로 크롤링하는 건 단순히 웹페이지에서 행을 뽑는 일이 아니에요. 진짜 가치는 전체 파이프라인에 있어요. 크롤링하고, 정리하고, 중복을 제거하고, 검증하고, 보강하고, CRM에 넣고, 규정을 지켜 아웃리치하는 과정 전체가 핵심이죠.

짧게 정리하면 이래요:

  • Thunderbit은 영업팀, 에이전시, 비개발자에게 가장 빨라요. 두 번 클릭하면 크롤링되고, 한 번 클릭하면 서브페이지로 보강하며, Google Sheets, Airtable, Notion, Excel로 무료 내보내기가 돼요. 무료로 써 보세요.
  • Octoparse는 설정을 좀 더 세밀하게 만지고 싶은, 어느 정도 기술 있는 사용자에게 맞는 비주얼 워크플로우 도구예요.
  • Python은 개발자에게 완전한 유연성을 주지만, 유지보수와 차단 회피 문제, 내장 보강 기능 부재라는 부담이 따라와요.
  • 그리고 같은 방식이 Yellow Pages, Google Maps, Yelp, Manta, BBB에도 그대로 통해요. 여러 소스를 크롤링하고 병합하고 중복을 제거하면, 가능한 한 가장 완전한 지역 리드 리스트가 나와요.

Thunderbit이 실제로 어떻게 도는지 보고 싶다면 YouTube 채널에서 튜토리얼을 확인하거나, 팀에 맞는 요금이 궁금하면 Thunderbit 가격 페이지를 살펴보세요.

이제 디렉터리 페이지를 파이프라인으로 바꿔 보세요. 전화번호는 늘 제대로 포맷되고, 이메일은 언제나 검증돼 있기를 바라요.

자주 묻는 질문(FAQs)

SuperPages를 리드 발굴용으로 크롤링하는 것이 합법인가요?

공개된 비즈니스 디렉터리 데이터를 B2B 리서치에 쓰는 건 흔한 관행이지만, SuperPages 이용 약관은 Thryv의 사전 동의 없는 데이터 마이닝을 금지합니다. 항상 사이트 약관을 확인하고, 필요하면 허가를 받으며, CAN-SPAM과 TCPA 같은 아웃리치 규정도 지키세요. 이 글은 교육 목적으로 방법과 워크플로우를 설명한 것이며, 준법 사용의 책임은 사용자에게 있습니다.

SuperPages에서 어떤 데이터를 얻을 수 있나요?

일반적인 크롤링 결과에는 업체명, 전화번호, 주소, 웹사이트, 카테고리, 평점, 영업시간, 설명이 들어가요. 이메일은 검색 결과 페이지엔 거의 안 나오고, 보통 업체 상세 페이지나 업체 웹사이트를 방문해야 찾을 수 있어요(서브페이지 크롤링 또는 이메일 추출기를 사용).

코딩 없이 SuperPages를 크롤링할 수 있나요?

네. Thunderbit(AI Chrome 확장 프로그램)나 Octoparse(비주얼 스크래퍼) 같은 도구면 코드 한 줄 없이 SuperPages를 크롤링할 수 있어요. 가장 빠른 건 Thunderbit이에요. 확장 프로그램을 설치하고 SuperPages 검색을 연 뒤 "AI Suggest Fields", 다음에 "Scrape"를 클릭하면 돼요.

SuperPages 크롤링에서 페이지네이션은 어떻게 처리하나요?

Thunderbit은 페이지네이션을 자동으로 처리해요. "Next" 버튼이나 무한 스크롤을 감지하고 계속 진행하죠. Octoparse는 워크플로우에서 페이지네이션 단계를 직접 설정해야 해요. Python에서는 페이지 번호를 올리고 마지막 페이지를 감지하는 루프를 직접 짜야 해요.

SuperPages 목록에서 이메일은 어떻게 얻나요?

대부분의 SuperPages 목록은 검색 결과 페이지에 이메일을 안 보여 줘요. Thunderbit의 Subpage Scraping으로 상세 페이지를 방문하거나, 업체 웹사이트에서 무료 Email Extractor를 쓰세요. 그래도 부족하면 Apollo, BetterContact, Prospeo 같은 보강 도구를 써 볼 수 있어요. 다만 작은 지역 비즈니스엔 대형 B2B 데이터베이스보다 웹사이트 우선 추출이 더 잘 맞는 경우가 많아요.

SuperPages 리드를 위한 AI 웹 스크래퍼 사용해 보기 Get Started Free

더 알아보기

Shuai Guan
Shuai Guan
Thunderbit CEO | AI 데이터 자동화 전문가 Shuai Guan은 Thunderbit의 CEO이자 University of Michigan 공학과 출신입니다. 10년 가까운 기술 및 SaaS 아키텍처 경험을 바탕으로, 복잡한 AI 모델을 누구나 바로 활용할 수 있는 노코드 데이터 추출 도구로 바꾸는 데 전문성을 갖고 있습니다. 이 블로그에서는 웹 스크래핑과 자동화 전략에 대한 필터링 없는 실전 경험과 검증된 인사이트를 공유하며, 더 똑똑하고 데이터 중심적인 워크플로를 만드는 데 도움을 드립니다. 데이터 워크플로를 최적화하지 않을 때는, 같은 꼼꼼함으로 사진이라는 취미에 몰두합니다.
목차

말 한마디로 웹페이지를 스크래핑하세요

원하는 걸 평범한 영어로 말하면 됩니다. 아니면 아무 말도 안 해도 괜찮아요.

Thunderbit 사용해보기 무료
AI로 데이터 추출하기
Google Sheets, Airtable, Notion으로 데이터를 손쉽게 منتقل하세요
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week