Cách tôi trích xuất lead từ SuperPages (3 phương pháp, từng bước một)

Cập nhật lần cuối vào May 26, 2026
Cách tôi trích xuất lead từ SuperPages (3 phương pháp, từng bước một)
Tóm tắt bằng AI
Automate your lead generation from SuperPages by comparing three methods: AI no-code tools, visual scrapers, and Python scripts. Get tips for 2026.

Tuần trước, một người dùng của chúng tôi kể rằng anh ấy đã mất trọn cả buổi chiều để chép tay danh sách thợ sửa ống nước từ SuperPages vào bảng tính — 47 dòng trong ba tiếng. Cổ tay thì mỏi nhừ, dữ liệu lại lỗi chính tả tùm lum, mà cuối cùng vẫn chẳng có email nào. Câu chuyện đó làm tôi thấy rất quen, vì tôi cũng từng trải qua y chang như vậy, và đó chính là kiểu vấn đề mà chúng tôi xây dựng Thunderbit để giải quyết.

SuperPages là một trong những danh bạ doanh nghiệp địa phương lâu đời ở Mỹ, hiện do Thryv vận hành, phủ rộng ở các thành phố lớn và đủ loại ngành nghề — thợ ống nước, nha sĩ, luật sư, kỹ thuật viên HVAC, và còn rất nhiều lĩnh vực khác. Tài liệu kỹ thuật cũ từng mô tả đây là một cơ sở dữ liệu kiểu yellow pages trên toàn quốc với hơn 11 triệu danh sách, và đến nay website vẫn hiển thị dày đặc các hạng mục địa phương. Thách thức không nằm ở chuyện tìm ra danh sách. Vấn đề là biến chúng thành một danh sách lead sạch, giàu thông tin mà không bị rối tung lên — hay tốn luôn cả buổi chiều.

Theo báo cáo Sales Trends 2024 của HubSpot, nhân viên kinh doanh chỉ dành khoảng 2 giờ mỗi ngày cho việc bán hàng thực sự — phần còn lại bị nuốt mất bởi những việc như nhập liệu và nghiên cứu. Và 81% chuyên gia sales cho biết AI có thể giúp họ giảm bớt thời gian làm việc thủ công. Hướng dẫn này sẽ chỉ cho bạn 3 cách scrape SuperPages để lấy lead — từ AI không cần code đến Python — để bạn chọn phương pháp hợp với mình nhất và quay lại làm những việc thực sự tạo ra kết quả.

Trích xuất lead từ SuperPages bằng AI Get Started Free

SuperPages là gì (và vì sao đội sales rất thích dùng nó để tìm lead)

SuperPages là một danh bạ doanh nghiệp trực tuyến tập trung vào thị trường Mỹ, nơi các doanh nghiệp địa phương được liệt kê kèm thông tin liên hệ, danh mục, đánh giá và nhiều dữ liệu khác. Có thể hiểu nó như phiên bản số hóa của cuốn danh bạ điện thoại yellow pages ngày trước — nhưng giờ bạn có thể tìm theo danh mục và vị trí, đồng thời thông tin của từng doanh nghiệp cũng đầy đủ hơn nhiều.

superpages-directory-services.webp

Một danh sách SuperPages điển hình có thể bao gồm:

  • Tên doanh nghiệp
  • Số điện thoại
  • Địa chỉ đường phố
  • URL website (nếu có)
  • Danh mục (ví dụ: Plumbing, Family Law, HVAC)
  • Đánh giá và nhận xét
  • Giờ hoạt động (thường có trên trang chi tiết)
  • Mô tả (trang chi tiết)

Trang chủ SuperPages làm nổi bật các nhóm phổ biến như Home Services, Plumbers, Electricians, Dentists, Legal Services, Auto Repair, Restaurants và Pet Services — cũng chính là những nhóm ngành mà đội sales, agency và các nhà cung cấp dịch vụ địa phương thường nhắm tới trong hoạt động tiếp cận khách hàng.

Nói ngắn gọn, SuperPages là một mỏ vàng cho bất kỳ ai đang tìm khách hàng doanh nghiệp địa phương tại Mỹ. Dữ liệu có cấu trúc, độ phủ rộng và các danh mục được ánh xạ rất sát với những chiến dịch outbound ngoài thực tế.

Dùng Thunderbit để lấy lead từ SuperPages

Vì sao nên scrape SuperPages để lấy lead (các trường hợp sử dụng phổ biến nhất)

Việc tự mở SuperPages rồi chép dữ liệu vào bảng tính là một hố đen về năng suất. Scraping sẽ tự động hóa toàn bộ quy trình đó, giúp bạn có một danh sách mục tiêu có cấu trúc chỉ trong vài phút thay vì vài giờ. Và vì bạn tự kiểm soát truy vấn tìm kiếm (danh mục + thành phố + từ khóa), đầu ra thường sát nhu cầu hơn nhiều so với một danh sách lead mua sẵn chung chung.

Dưới đây là những trường hợp sử dụng phổ biến nhất mà tôi thấy từ người dùng của chúng tôi:

Trường hợp sử dụngAi được lợiVí dụ
Tạo lead địa phươngĐội sales, agencyLập danh sách thợ ống nước ở Dallas để gọi cold outreach
Nghiên cứu đối thủVận hành, marketingSo sánh đánh giá và dịch vụ giữa các đối thủ trong cùng thị trường
Lập bản đồ thị trườngPhát triển kinh doanhXác định toàn bộ nha sĩ trong một mã ZIP trước khi ra mắt sản phẩm mới
Tìm nhà cung cấpMua hàng, vận hànhTìm nhà cung cấp ở một khu vực kèm số điện thoại + website
Tìm prospect SEO địa phươngAgencyTìm doanh nghiệp không có website hoặc có dữ liệu listing yếu
Lập kế hoạch vùng phụ tráchSales thực địaNhóm các nhà thầu theo thành phố, mã ZIP hoặc khu vực dịch vụ

Thị trường tạo lead B2B tại Mỹ được ước tính đạt 8,5 tỷ USD vào năm 2024 và có thể tăng lên 18,2 tỷ USD vào năm 2034 — nghĩa là nhu cầu với kiểu dữ liệu này vẫn rất lớn. Một danh sách mới scrape, được lọc theo danh mục và vị trí, có thể nhắm mục tiêu tốt hơn nhiều so với danh sách mua sẵn chung chung, nhưng nó vẫn cần được xác minh và khử trùng lặp trước khi outreach (phần này mình sẽ nói kỹ hơn ở dưới).

Kết quả đầu ra trông như thế nào: ví dụ dữ liệu SuperPages sau khi scrape

Trước khi đi vào cách làm, tôi muốn cho bạn xem thành phẩm thực tế sẽ trông ra sao. Đây là phần mà đa số hướng dẫn thường bỏ qua — nhưng nếu bạn bỏ công sức, bạn cũng nên biết phần thưởng cuối cùng sẽ như thế nào.

Đây là một bảng đầu ra mẫu (dữ liệu giả, nhưng cấu trúc rất thực tế):

Tên doanh nghiệpĐiện thoạiĐịa chỉWebsiteDanh mụcĐánh giáGiờ làm việcEmail (đã enrich)
Sunset Pipe & Drain Co.+1 213-555-01481842 W 7th St, Los Angeles, CA 90057sunsetpipe.examplePlumbing4.6Mon-Fri 7a-6pservice@sunsetpipe.example
Arroyo HVAC Pros+1 626-555-018272 N Fair Oaks Ave, Pasadena, CA 91103arroyohvac.exampleHVAC4.8Mon-Sat 8a-7phello@arroyohvac.example
Wilshire Family Dental+1 323-555-01194100 Wilshire Blvd, Los Angeles, CA 90010wilshiredental.exampleDentists4.4Mon-Thu 9a-5pappointments@wilshiredental.example
Pacific Legal Aid Group+1 310-555-017311845 W Olympic Blvd, Los Angeles, CA 90064Legal Services4.2Mon-Fri 8:30a-5:30pintake@pacificlegal.example
Valley Auto Repair Center+1 818-555-019814422 Ventura Blvd, Sherman Oaks, CA 91423valleyautorepair.exampleAuto Repair4.7Mon-Sat 8a-6pinfo@valleyautorepair.example
Echo Park Pet Grooming+1 213-555-01661511 Sunset Blvd, Los Angeles, CA 90026echoparkpets.examplePet Grooming4.9Tue-Sun 9a-5pbooking@echoparkpets.example

Một vài điểm cần lưu ý:

  • Từ trang kết quả tìm kiếm: Tên doanh nghiệp, số điện thoại, địa chỉ một phần, danh mục, đánh giá, URL listing.
  • Từ trang chi tiết doanh nghiệp (trang con): Địa chỉ đầy đủ, giờ làm việc, mô tả, đánh giá, đôi khi có website.
  • Từ bước enrich: Email (thường chỉ tìm thấy trên website riêng của doanh nghiệp hoặc qua công cụ enrichment).
  • Từ bước làm sạch dữ liệu: Số điện thoại định dạng E.164, bang/ZIP chuẩn hóa, khóa khử trùng lặp, source URL và ngày scrape.

Đây là kiểu dữ liệu mà bạn có thể đưa thẳng vào CRM, Google Sheet hoặc Airtable và bắt đầu làm việc ngay.

3 cách scrape SuperPages để lấy lead: so sánh nhanh

ai-no-code-visual-python-comparison.webp

Không phải ai cũng thoải mái như nhau với kỹ thuật — hay có cùng mức kiên nhẫn. Vì vậy, dưới đây là ba phương pháp đặt cạnh nhau để bạn chọn cách phù hợp nhất:

Tiêu chíThunderbit (AI không cần code)Công cụ scrape trực quan (ví dụ: Octoparse)Python (Requests + BS4)
Thời gian thiết lập~2 phút (cài extension)~15 phút (tạo workflow)~30 phút (cài thư viện, viết code)
Có cần code khôngKhôngKhôngCó (Python)
Xử lý phân trangTích hợp sẵn (click hoặc cuộn)Cần cấu hìnhViết tay bằng code
Enrich trang con1 click với Subpage ScrapingCần workflow/vòng lặp riêngCần script riêng
Chống chặnCloud Scraping xử lýPhụ thuộc gói/proxy add-onTự xử lý (proxy, headers, rate limit)
Tùy chọn xuất dữ liệuExcel, Google Sheets, Airtable, Notion, CSV, JSONCSV, Excel, databaseTùy theo bạn code
Phù hợp nhất vớiĐội sales, agency, người không biết devNgười dùng bán kỹ thuậtDeveloper muốn kiểm soát toàn diện

Gợi ý của tôi: Nếu bạn muốn bắt đầu scrape trong 2 phút tới, hãy đi theo Phương pháp 1. Nếu bạn thích workflow trực quan và không ngại cấu hình chút ít, thử Phương pháp 2. Nếu bạn muốn toàn quyền kiểm soát và biết Python, hãy chuyển ngay sang Phương pháp 3.

Phương pháp 1: Scrape SuperPages bằng Thunderbit (AI, không cần code)

Đây là con đường nhanh nhất từ “tôi có một trang tìm kiếm trên SuperPages” đến “tôi có danh sách lead”. Không code, không trình dựng workflow, không phải lo proxy. Tôi hơi thiên vị — vì chính chúng tôi xây Thunderbit — nhưng tôi sẽ hướng dẫn bạn từng bước rõ ràng để bạn tự đánh giá.

Độ khó: Người mới bắt đầu
Thời gian cần: ~5 phút cho một lần scrape đầy đủ theo danh mục/thành phố
Bạn cần: Trình duyệt Chrome, Thunderbit Chrome Extension (bản miễn phí là đủ)

Bước 1: Cài Thunderbit và mở SuperPages

Vào trang tải Thunderbit Chrome Extension và cài extension Thunderbit. Chỉ mất khoảng một phút. Sau khi cài xong, hãy mở một trang kết quả tìm kiếm trên SuperPages — ví dụ, tìm “Plumbers in Los Angeles, CA” trên superpages.com.

Bạn sẽ thấy biểu tượng Thunderbit trên thanh công cụ của trình duyệt và một sidebar đã sẵn sàng để dùng.

Bước 2: Bấm “AI Suggest Fields” để tự động nhận diện cột dữ liệu

Mở sidebar của Thunderbit và bấm “AI Suggest Fields”. AI của Thunderbit sẽ đọc trang và tự động gợi ý các cột dựa trên những gì nó tìm thấy — thường là tên doanh nghiệp, số điện thoại, địa chỉ, website, danh mục, đánh giá và URL listing.

Bạn có thể chỉnh sửa, thêm hoặc xóa cột trước khi scrape. Muốn thêm cột tùy chỉnh như “Có website không?” hoặc “Khu vực phục vụ?” Chỉ cần nhập mô tả bằng tiếng Anh tự nhiên trong Field AI Prompt. Ví dụ, bạn có thể yêu cầu một cột “định dạng số điện thoại theo +1XXXXXXXXXX” hoặc “phân loại residential vs. commercial.”

Lúc này bạn sẽ thấy bản xem trước bảng với các cột đã cấu hình trong panel Thunderbit.

Bước 3: Bấm “Scrape” và xem dữ liệu được điền vào

Nhấn nút màu xanh “Scrape”. Thunderbit sẽ lấy toàn bộ listing trên trang hiện tại và điền vào bảng của bạn từng dòng một. Với một trang kết quả SuperPages thông thường, việc này mất khoảng 30–45 giây.

Thunderbit tự động xử lý phân trang — nó nhận ra nút “Next” hoặc cuộn vô hạn và tiếp tục cho đến khi hết trang hoặc chạm giới hạn của bạn. Nếu bạn scrape một tập kết quả lớn (ví dụ: toàn bộ thợ ống nước ở một vùng đô thị), hãy chuyển sang chế độ Cloud Scraping, có thể xử lý tới 50 trang cùng lúc mà không chiếm trình duyệt của bạn.

Bước 4: Dùng Subpage Scraping để làm giàu dữ liệu cho từng listing

business-profile-verification-process.webp

Trang kết quả chỉ cho bạn phần cơ bản, nhưng “vàng” thật sự — giờ làm việc, mô tả đầy đủ, đánh giá, đôi khi là email — lại nằm trên trang chi tiết của từng doanh nghiệp. Bấm “Scrape Subpages” và Thunderbit sẽ lần lượt mở trang chi tiết của từng listing để lấy thêm các cột enrich như giờ làm việc, mô tả, URL website và bất kỳ thông tin liên hệ nào xuất hiện ở đó.

Đây là quy trình một cú nhấp chuột. Không cần workflow riêng, không cần cấu hình. Dữ liệu enrich sẽ được nối thẳng vào bảng hiện có của bạn.

Bước 5: Xuất lead sang Excel, Google Sheets, Airtable hoặc Notion

Khi bạn hài lòng với dữ liệu, hãy bấm Export. Thunderbit cho phép bạn gửi lead trực tiếp đến:

  • Google Sheets (rất tiện để chuẩn bị CRM và chia sẻ)
  • Airtable (bảng pipeline gọn nhẹ)
  • Notion (cơ sở dữ liệu nghiên cứu)
  • Excel / CSV (nhập vào CRM)
  • JSON (bàn giao cho developer)

cloud50-data-workflow.webp

Tất cả tùy chọn xuất đều miễn phí. Nếu bạn đang đẩy lead vào HubSpot hoặc Salesforce, xuất sang CSV hoặc Google Sheets thường là cách nhanh nhất.

Mẹo nhỏ: Hãy scrape theo danh mục + thành phố thay vì tìm rộng theo toàn bang. “Emergency plumbers Dallas TX” sẽ cho bạn danh sách gọn và hữu ích hơn nhiều so với “plumbers Texas.” Thêm cột “Source URL” và “Scraped At” để dễ truy vết.

Phương pháp 2: Scrape SuperPages bằng công cụ trực quan (ví dụ Octoparse)

Các công cụ scrape trực quan như Octoparse nằm ở giữa: không cần code, nhưng cần nhiều thiết lập và cấu hình hơn Thunderbit. Octoparse thậm chí còn có template SuperPages dựng sẵn cho các trường hợp đơn giản.

Độ khó: Trung bình
Thời gian cần: ~20–30 phút cho thiết lập + scrape
Bạn cần: Tài khoản Octoparse (có gói miễn phí, nhưng giới hạn)

Bước 1: Tạo task mới và tải URL SuperPages

Mở Octoparse, bấm “New Task”, rồi dán URL tìm kiếm SuperPages của bạn (ví dụ: "https://www.superpages.com/los-angeles-ca/plumbers"). Trình duyệt tích hợp sẽ tải trang.

Bước 2: Tự động phát hiện hoặc chọn thủ công các trường dữ liệu

Bấm “Auto-detect” — Octoparse sẽ quét trang và tô sáng những trường dữ liệu mà nó cho là liên quan. Xem lại phần Data Preview. Theo kinh nghiệm của tôi, auto-detection thường bắt được phần lớn trường nhưng có thể lấy nhầm vài mục phụ (như nhãn quảng cáo hoặc text điều hướng) hoặc bỏ sót một số trường. Bạn nhiều khả năng sẽ phải thêm hoặc bớt vài trường bằng tay.

Theo tài liệu trợ giúp của Octoparse, auto-detection sẽ tạo ra workflow cơ bản với các bước phân trang và trích xuất dữ liệu, nhưng người dùng có thể cần bổ sung các trường còn thiếu thủ công.

Bước 3: Xây workflow và cấu hình phân trang

Bấm “Create workflow”. Octoparse sẽ tạo ra một chuỗi hành động theo từng bước. Hãy kiểm tra bước phân trang — đảm bảo nó click “Next” hoặc tải thêm kết quả đúng cách. Nếu bạn muốn lấy dữ liệu từ trang chi tiết của từng doanh nghiệp (giờ làm việc, email, mô tả), bạn sẽ phải thêm vòng lặp trang chi tiết hoặc action subpage vào workflow. Phần này phức tạp hơn nhiều so với cách one-click của Thunderbit.

Bước 4: Chạy task và xuất dữ liệu

Chạy task cục bộ (cho công việc nhỏ) hoặc trên cloud của Octoparse (cho job lớn hoặc job theo lịch — cloud là tính năng trả phí). Khi hoàn tất, xuất dữ liệu dưới dạng CSV, Excel hoặc JSON.

Điều cần biết: Gói miễn phí của Octoparse gồm 10 task, tối đa 50.000 dòng/tháng và chỉ trích xuất cục bộ. Chạy trên cloud, xoay IP, giải CAPTCHA và một số tích hợp xuất dữ liệu khác yêu cầu gói trả phí (bắt đầu khoảng 69 USD/tháng nếu thanh toán theo năm).

Phương pháp 3: Scrape SuperPages bằng Python (Requests + BeautifulSoup)

Đây là con đường dành cho developer. Toàn quyền kiểm soát, nhưng cũng đồng nghĩa là bạn tự lo toàn bộ. Nếu bạn thoải mái viết và duy trì script Python, cách này cho bạn độ linh hoạt cao nhất — nhưng cũng dễ làm bạn đau đầu nhất.

Độ khó: Nâng cao
Thời gian cần: ~30–60 phút (thiết lập + code + gỡ lỗi)
Bạn cần: Python 3.x, pip, requests, beautifulsoup4, lxml, một trình soạn thảo code

Bước 1: Thiết lập môi trường Python

python -m venv .venv
source .venv/bin/activate
pip install requests beautifulsoup4 lxml pandas

Bước 2: Kiểm tra cấu trúc HTML của SuperPages

Mở Developer Tools (F12) trên một trang kết quả SuperPages. Xác định các CSS selector cho tên doanh nghiệp, địa chỉ, điện thoại, website và link trang chi tiết. Hãy nhớ rằng cấu trúc HTML có thể thay đổi mà không báo trước, nghĩa là selector của bạn có thể gãy bất cứ lúc nào.

Bước 3: Viết scraper cho danh sách và xử lý phân trang

Dưới đây là một ví dụ rút gọn. Lưu ý quan trọng: Trong quá trình thử nghiệm của tôi, một request trực tiếp tới SuperPages trả về trang chặn Cloudflare “Attention Required”. Một script Requests ngây thơ có thể thất bại khi chạy ở quy mô lớn — bạn có thể cần ngữ cảnh phiên trình duyệt, giới hạn tốc độ, cơ chế thử lại hoặc các phương án được cho phép khác.

import csv, time
from urllib.parse import urljoin
import requests
from bs4 import BeautifulSoup

BASE_URL = "https://www.superpages.com"
HEADERS = {
    "User-Agent": (
        "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
        "AppleWebKit/537.36 (KHTML, like Gecko) "
        "Chrome/125.0 Safari/537.36"
    )
}

def fetch(url):
    resp = requests.get(url, headers=HEADERS, timeout=20)
    resp.raise_for_status()
    if "Attention Required" in resp.text or "Cloudflare" in resp.text:
        raise RuntimeError("Bị chặn. Hãy giảm tốc độ hoặc chuyển sang scrape bằng trình duyệt/cloud.")
    return BeautifulSoup(resp.text, "lxml")

def parse_listing(card):
    name_el = card.select_one(".business-name, a.business-name, h2 a, h3 a")
    phone_el = card.select_one(".phones, .phone, [class*=phone]")
    address_el = card.select_one(".street-address, .adr, [class*=address]")
    website_el = card.select_one("a.track-visit-website, a[href*='http']")
    rating_el = card.select_one(".rating, [class*=rating]")
    detail_url = urljoin(BASE_URL, name_el.get("href")) if name_el and name_el.get("href") else ""
    return {
        "business_name": name_el.get_text(" ", strip=True) if name_el else "",
        "phone": phone_el.get_text(" ", strip=True) if phone_el else "",
        "address": address_el.get_text(" ", strip=True) if address_el else "",
        "website": website_el.get("href", "") if website_el else "",
        "rating": rating_el.get_text(" ", strip=True) if rating_el else "",
        "detail_url": detail_url,
    }

def scrape_search(search_url, pages=3):
    all_rows = []
    for page in range(1, pages + 1):
        page_url = f"{search_url}?page={page}"
        soup = fetch(page_url)
        cards = soup.select(".result, .organic, [class*=result]")
        if not cards:
            break
        for card in cards:
            all_rows.append(parse_listing(card))
        time.sleep(5)
    return all_rows

if __name__ == "__main__":
    rows = scrape_search("https://www.superpages.com/los-angeles-ca/plumbers", pages=2)
    with open("superpages_leads.csv", "w", newline="", encoding="utf-8") as f:
        writer = csv.DictWriter(f, fieldnames=sorted({k for row in rows for k in row}))
        writer.writeheader()
        writer.writerows(rows)

Bước 4: Scrape trang chi tiết để enrich dữ liệu

Viết một hàm riêng để truy cập từng URL trang chi tiết và trích xuất giờ làm việc, email, mô tả và đánh giá. Điều này đồng nghĩa với việc bạn phải tự quản lý rate limit, xử lý lỗi và có thể là proxy — tất cả đều do bạn tự lo.

Bước 5: Lưu dữ liệu ra CSV hoặc JSON

Sử dụng các module csv hoặc json của Python. Bạn cũng cần tự viết logic khử trùng lặp, làm sạch dữ liệu và xuất dữ liệu.

Các lỗi thường gặp:

  • SuperPages có thể chặn request bằng Cloudflare hoặc các hệ thống chống bot tương tự (điều này đã được xác nhận trong quá trình thử nghiệm của tôi).
  • Selector ở đây được viết khá rộng vì markup của SuperPages có thể thay đổi.
  • Đừng cho rằng trang kết quả tìm kiếm sẽ có email. Thực tế là hầu như không bao giờ có.
  • Một scraper sản xuất thực sự cần xem xét robots/TOS, rate limiting, retry/backoff, logging có cấu trúc và bắt lỗi.

Nếu bạn muốn đào sâu hơn về scraping bằng Python, hãy xem hướng dẫn của chúng tôi về web scraping với Python hoặc bài tutorial BeautifulSoup.

Từ dữ liệu thô đến lead thực: quy trình đầy đủ (Scrape → Làm sạch → Xác minh → CRM)

Đây là lúc phần lớn hướng dẫn scrape dừng lại — và cũng là lúc giá trị thực sự bắt đầu. Scraping chỉ cho bạn nguyên liệu thô. Biến nó thành một danh sách lead có thể dùng được sẽ cần thêm vài bước nữa.

data-pipeline-workflow.webp

Quy trình sẽ như sau:

Tìm kiếm SuperPages → Scrape danh sách → Scrape trang chi tiết/website → Xuất ra Google Sheets hoặc CSV → Làm sạch điện thoại, địa chỉ, danh mục → Khử trùng lặp → Xác minh email/điện thoại → Enrich thông tin liên hệ còn thiếu → Nhập vào CRM → Outreach tuân thủ quy định

Khử trùng lặp: loại bỏ các listing trùng nhau

SuperPages thường hiển thị cùng một doanh nghiệp ở nhiều danh mục. Nếu bạn scrape cả “plumbers” và “drain cleaning” trong cùng một thành phố, chắc chắn sẽ có phần giao nhau.

  • Khóa khử trùng lặp chính: Số điện thoại đã chuẩn hóa + địa chỉ đường phố đã chuẩn hóa.
  • Khóa phụ: Domain + thành phố.
  • Phương án dự phòng: Tên doanh nghiệp + mã ZIP (nên xem thủ công với các chuỗi nhượng quyền).

Trong Google Sheets, dùng =UNIQUE(A:H) cho các dòng trùng hoàn toàn, hoặc tạo một cột phụ như =LOWER(REGEXREPLACE(B2&C2,"[^a-zA-Z0-9]","")) để bắt các bản ghi gần trùng. Trong Excel, dùng Data > Remove Duplicates.

Làm sạch dữ liệu: chuẩn hóa điện thoại, địa chỉ và định dạng

  • Định dạng số điện thoại theo E.164 (với Mỹ: +1 theo sau là 10 chữ số). Đây là định dạng mà hầu hết CRM và hệ thống gọi điện mong đợi. Bạn có thể dùng Field AI Prompt trong Thunderbit để tự động định dạng ngay khi scrape.
  • Chuẩn hóa địa chỉ: mở rộng viết tắt, bổ sung ZIP nếu thiếu, tách thành các cột street/city/state/ZIP nếu cần.
  • Loại bỏ HTML artifacts, khoảng trắng thừa và các tham số tracking khỏi URL.
  • Thêm các cột source_directory, source_urlscraped_at để dễ truy vết.

Xác minh email và điện thoại trước khi outreach

Đừng gửi hàng loạt cold email đến mọi địa chỉ bạn scrape được. Việc xác minh giúp bảo vệ uy tín người gửi và giữ tỷ lệ bounce ở mức thấp.

  • Xác minh email: ZeroBounce (giá từ khoảng 39 USD cho 2.000 credit, kèm 100 credit miễn phí mỗi tháng) hoặc Bouncer (8 USD cho 1.000 credit, credit không hết hạn) là những lựa chọn ổn.
  • Xác thực số điện thoại: Twilio Lookup cung cấp định dạng và xác thực miễn phí; caller ID là 0,01 USD/request.
  • Email Extractor và Phone Number Extractor miễn phí của Thunderbit có thể lấy các thông tin liên hệ bị bỏ sót trên trang listing.

Enrich: tìm liên hệ khi SuperPages không có email

Nhiều listing trên SuperPages hoàn toàn không hiển thị email — đặc biệt là ở trang kết quả tìm kiếm. Bạn nên làm gì?

  • Scrape trang Contact, About hoặc footer trên website của doanh nghiệp. Subpage Scraping hoặc Email Extractor của Thunderbit có thể làm việc này hàng loạt.
  • Dùng các công cụ enrich như Apollo, BetterContact, Icypeas hoặc Prospeo. Cảnh báo nhỏ: với các doanh nghiệp địa phương quy mô nhỏ (tiệm sửa ống nước 2 người, nha sĩ làm một mình), các cơ sở dữ liệu B2B lớn thường trả về rất ít kết quả. Cách lấy từ website thường hiệu quả hơn.
  • Kết hợp nhiều danh bạ. Scrape SuperPages, Yellow Pages và Google Maps cho cùng danh mục/thành phố rồi gộp và khử trùng lặp. Phần giao nhau sẽ giúp bạn có dữ liệu đầy đủ hơn.

Nếu bạn từng thử đưa danh sách SMB địa phương vào Apollo rồi nhận về chủ yếu là ô trống, bạn không phải người duy nhất. Đó là lý do cách ưu tiên website lại quan trọng đến vậy với nhóm này.

Nhập vào CRM: đưa lead vào HubSpot, Salesforce hoặc Google Sheets

  • HubSpot: Vào Data Management > Data Integration > Import data > Quick import (contacts only). Tải lên file .csv hoặc .xlsx. Hướng dẫn import của HubSpot sẽ giúp bạn map field.
  • Salesforce: Dùng Data Import Wizard. Chuẩn bị file CSV, map trường nguồn sang trường của Salesforce, rồi chạy import.
  • Google Sheets / Airtable / Notion: Thunderbit xuất trực tiếp sang cả ba — không cần qua CSV trung gian.

Mẹo: Map các cột đã scrape sang field của CRM trước khi import. Chỉ vài phút map field có thể tiết kiệm hàng giờ dọn dữ liệu sau này.

SuperPages so với các danh bạ doanh nghiệp địa phương khác: đâu là nơi có lead tốt nhất?

SuperPages là một điểm khởi đầu rất mạnh, nhưng không phải là danh bạ duy nhất đáng để scrape. Đây là cách nó so sánh với các lựa chọn khác:

Danh bạSố lượng leadTrường dữ liệu có sẵnĐộ mới của dữ liệuĐộ khó chống scrapingPhù hợp nhất
SuperPagesLớn (tập trung vào Mỹ)Tên, điện thoại, địa chỉ, website, danh mục, đánh giáTrung bìnhTrung bìnhDịch vụ tại nhà, nhà thầu, SMB
Yellow PagesLớn (tập trung vào Mỹ)Tương tự SuperPagesTrung bìnhTrung bìnhOutreach doanh nghiệp địa phương nói chung
Google MapsRất lớn (toàn cầu)Tên, điện thoại, địa chỉ, website, đánh giá, giờ làm, ảnhCao (được chủ doanh nghiệp cập nhật)Cao (chống bot mạnh)Dữ liệu địa phương mới nhất
YelpLớn (tập trung vào Mỹ)Tên, điện thoại, địa chỉ, đánh giá, mức giáCaoCaoNhà hàng, bán lẻ, doanh nghiệp dịch vụ
MantaTrung bìnhTên, điện thoại, địa chỉ, ước tính doanh thu, số nhân viênTrung bìnhThấpTìm prospect B2B (dữ liệu doanh thu/số nhân viên)
BBBTrung bìnhTên, điện thoại, địa chỉ, chứng nhận, khiếu nạiTrung bìnhThấpDoanh nghiệp uy tín/được kiểm chứng

Nguồn: trang chủ SuperPages, bài nghiên cứu VLDB về SuperPages, tài liệu Google Places API, tài liệu Yelp Places API, trang chủ Manta, hướng dẫn BBB.

Thunderbit hoạt động trên tất cả các nguồn này — bao gồm cả Instant Templates cho những website phổ biến như Google Maps và SuperPages — nên bạn có thể áp dụng cùng một quy trình cho nhiều nguồn khác nhau rồi gộp danh sách lead lại. Theo kinh nghiệm của tôi, cách làm hiệu quả nhất thường là scrape hai hoặc ba danh bạ cho cùng một danh mục/thành phố rồi khử trùng lặp. Phần giao nhau sẽ lấp đầy các khoảng trống và cho bạn cái nhìn đầy đủ hơn.

Để tìm hiểu thêm về scraping các danh bạ khác, hãy xem các hướng dẫn của chúng tôi về Yellow Pages scrapers, Google Maps scrapersYelp scrapers.

Mẹo pháp lý và đạo đức khi scrape lead từ SuperPages

data-privacy-compliance-infographic.webp

Tôi không phải luật sư, và đây không phải tư vấn pháp lý — nhưng tôi đã làm việc đủ lâu trong lĩnh vực này để biết rằng bỏ qua tuân thủ là cách nhanh nhất để tự chuốc rắc rối. Dưới đây là phần tóm lược thực tế.

Dữ liệu doanh nghiệp công khai vs. dữ liệu cá nhân

Danh sách doanh nghiệp — tên công ty, số điện thoại doanh nghiệp, địa chỉ doanh nghiệp, website doanh nghiệp — nhìn chung được xem là dữ liệu thương mại công khai. Điều này khác với dữ liệu người tiêu dùng cá nhân theo GDPR hoặc CCPA. Nhưng “công khai” không có nghĩa là “không có quy tắc”. Luôn kiểm tra Điều khoản dịch vụ của website.

Điều khoản sử dụng của SuperPages (cập nhật tháng 7/2019) có điều khoản “Data Mining Prohibited”: người dùng không được dùng bot, crawler, spider hoặc công cụ tương tự để thu thập hay trích xuất dữ liệu nếu chưa có sự đồng ý trước của Thryv. Bài viết này chỉ bàn về phương pháp và workflow, nhưng bạn nên đọc kỹ các điều khoản đó và xin phép khi cần trước khi scrape ở quy mô lớn.

Tuân thủ outreach: những điều cơ bản của CAN-SPAM và TCPA

Nếu bạn dùng email scrape được để gửi cold outreach, hướng dẫn của FTC về CAN-SPAM cho biết bạn phải:

  • Không dùng tiêu đề giả mạo hoặc gây hiểu lầm
  • Không dùng subject line lừa dối
  • Xác định rõ đây là quảng cáo khi luật yêu cầu
  • Bao gồm địa chỉ bưu chính hợp lệ
  • Cung cấp cơ chế từ chối nhận rõ ràng và tôn trọng yêu cầu đó nhanh chóng

Nếu bạn dùng số điện thoại scrape được để gọi cold call, hãy kiểm tra National Do Not Call Registry và tuân thủ các quy định TCPA — đặc biệt là với cuộc gọi tự động, tin nhắn ghi âm sẵn và SMS. FTC đã công bố các thay đổi trong năm 2024 nhằm tăng cường bảo vệ trước telemarketing B2B lừa đảo và các cuộc gọi scam dùng AI.

Danh sách kiểm tra nhanh về tuân thủ

  • ✅ Chỉ scrape dữ liệu doanh nghiệp đã được công khai
  • ✅ Đọc Điều khoản sử dụng của SuperPages và xin phép khi cần
  • ✅ Xác minh liên hệ trước khi outreach
  • ✅ Thêm tùy chọn opt-out trong email
  • ✅ Tôn trọng robots.txt và rate limit
  • ✅ Duy trì danh sách DNC và danh sách chặn email
  • ⚠️ Tránh scrape dữ liệu cá nhân/người tiêu dùng
  • ⚠️ Không bán lại dữ liệu scrape thô mà chưa được rà soát pháp lý

Chọn phương pháp của bạn và bắt đầu xây danh sách lead

Scrape SuperPages để lấy lead không chỉ là chuyện trích xuất vài dòng từ một website. Giá trị thực sự đến từ toàn bộ quy trình: scrape, làm sạch, khử trùng lặp, xác minh, enrich, import và outreach đúng quy định.

Tóm tắt nhanh:

  • Thunderbit là con đường nhanh nhất cho đội sales, agency và người không biết dev. Hai cú nhấp để scrape, một cú nhấp để enrich bằng subpages, xuất miễn phí sang Google Sheets, Airtable, Notion hoặc Excel. Dùng thử miễn phí.
  • Octoparse là một công cụ workflow trực quan khá ổn cho người dùng bán kỹ thuật muốn kiểm soát cấu hình nhiều hơn.
  • Python cho developer sự linh hoạt tối đa — nhưng đi kèm việc phải bảo trì, đau đầu với anti-blocking và không có enrich sẵn.
  • Và nhớ rằng: cùng quy trình này cũng áp dụng cho Yellow Pages, Google Maps, Yelp, Manta và BBB. Hãy scrape nhiều nguồn, gộp lại, khử trùng lặp, và bạn sẽ có danh sách lead địa phương đầy đủ nhất có thể.

Nếu bạn muốn xem Thunderbit hoạt động như thế nào, hãy xem kênh YouTube của chúng tôi để xem hướng dẫn từng bước, hoặc xem giá Thunderbit để biết gói nào hợp với đội của bạn.

Giờ thì biến những trang danh bạ đó thành pipeline — và mong rằng số điện thoại của bạn luôn được định dạng chuẩn, còn email thì luôn được xác minh đầy đủ.

Câu hỏi thường gặp

Có hợp pháp không nếu scrape SuperPages để lấy lead?

Việc scrape dữ liệu danh bạ doanh nghiệp công khai để nghiên cứu B2B là khá phổ biến, nhưng Điều khoản sử dụng của SuperPages cấm data mining nếu chưa có sự đồng ý trước của Thryv. Luôn xem kỹ điều khoản của website, xin phép khi cần và tuân thủ các quy định outreach như CAN-SPAM và TCPA. Bài viết này chỉ mang tính giáo dục về phương pháp và workflow — việc dùng chúng đúng quy định là trách nhiệm của bạn.

Tôi có thể lấy được dữ liệu gì từ SuperPages?

Một lần scrape điển hình sẽ thu được tên doanh nghiệp, số điện thoại, địa chỉ, website, danh mục, đánh giá, giờ làm việc và mô tả. Email hiếm khi xuất hiện trên trang kết quả tìm kiếm — thường bạn sẽ phải vào trang chi tiết doanh nghiệp hoặc website riêng của công ty (bằng subpage scraping hoặc email extractor) để tìm thấy.

Có thể scrape SuperPages mà không cần code không?

Có. Các công cụ như Thunderbit (extension Chrome dùng AI) và Octoparse (công cụ scrape trực quan) cho phép bạn scrape SuperPages mà không cần viết một dòng code nào. Thunderbit là lựa chọn nhanh nhất — cài extension, mở trang tìm kiếm SuperPages, bấm “AI Suggest Fields”, rồi bấm “Scrape.”

Làm sao xử lý phân trang khi scrape SuperPages?

Thunderbit tự xử lý phân trang — nó nhận ra nút “Next” hoặc cuộn vô hạn và tiếp tục chạy. Octoparse yêu cầu bạn cấu hình bước pagination trong workflow. Với Python, bạn phải tự viết logic vòng lặp trang (tăng số trang, phát hiện trang cuối).

Làm thế nào để lấy email từ các listing SuperPages?

Phần lớn listing SuperPages không hiển thị email trên trang kết quả tìm kiếm. Hãy dùng Subpage Scraping của Thunderbit để vào từng trang chi tiết, hoặc dùng Email Extractor miễn phí trên website của doanh nghiệp. Nếu vẫn còn thiếu, thử các công cụ enrichment như Apollo, BetterContact hoặc Prospeo — nhưng với doanh nghiệp địa phương nhỏ, cách lấy từ website thường hiệu quả hơn các cơ sở dữ liệu B2B lớn.

Dùng AI Web Scraper cho lead SuperPages Get Started Free

Tìm hiểu thêm

Shuai Guan
Shuai Guan
CEO tại Thunderbit | Chuyên gia Tự động hóa Dữ liệu AI Shuai Guan là CEO của Thunderbit và là cựu sinh viên ngành Kỹ thuật của University of Michigan. Với gần một thập kỷ kinh nghiệm trong lĩnh vực công nghệ và kiến trúc SaaS, anh chuyên biến các mô hình AI phức tạp thành những công cụ trích xuất dữ liệu thực tiễn, không cần viết mã. Trên blog này, anh chia sẻ những góc nhìn thẳng thắn, đã được kiểm chứng qua thực chiến về web scraping và các chiến lược tự động hóa, giúp bạn xây dựng quy trình làm việc thông minh hơn, dựa trên dữ liệu. Khi không tối ưu hóa quy trình dữ liệu, anh áp dụng sự tỉ mỉ đó vào niềm đam mê nhiếp ảnh.
Mục lục

Cào một trang web chỉ bằng cách hỏi

Nói bạn cần gì bằng tiếng Anh đơn giản. Hoặc tốt hơn, không cần nói gì cả.

Dùng Thunderbit ngay miễn phí
Trích xuất dữ liệu bằng AI
Dễ dàng chuyển dữ liệu sang Google Sheets, Airtable hoặc Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week