Tuần trước, một người dùng của chúng tôi kể rằng anh ấy đã mất trọn cả buổi chiều để chép tay danh sách thợ sửa ống nước từ SuperPages vào bảng tính — 47 dòng trong ba tiếng. Cổ tay thì mỏi nhừ, dữ liệu lại lỗi chính tả tùm lum, mà cuối cùng vẫn chẳng có email nào. Câu chuyện đó làm tôi thấy rất quen, vì tôi cũng từng trải qua y chang như vậy, và đó chính là kiểu vấn đề mà chúng tôi xây dựng Thunderbit để giải quyết.
SuperPages là một trong những danh bạ doanh nghiệp địa phương lâu đời ở Mỹ, hiện do Thryv vận hành, phủ rộng ở các thành phố lớn và đủ loại ngành nghề — thợ ống nước, nha sĩ, luật sư, kỹ thuật viên HVAC, và còn rất nhiều lĩnh vực khác. Tài liệu kỹ thuật cũ từng mô tả đây là một cơ sở dữ liệu kiểu yellow pages trên toàn quốc với hơn 11 triệu danh sách, và đến nay website vẫn hiển thị dày đặc các hạng mục địa phương. Thách thức không nằm ở chuyện tìm ra danh sách. Vấn đề là biến chúng thành một danh sách lead sạch, giàu thông tin mà không bị rối tung lên — hay tốn luôn cả buổi chiều.
Theo báo cáo Sales Trends 2024 của HubSpot, nhân viên kinh doanh chỉ dành khoảng 2 giờ mỗi ngày cho việc bán hàng thực sự — phần còn lại bị nuốt mất bởi những việc như nhập liệu và nghiên cứu. Và 81% chuyên gia sales cho biết AI có thể giúp họ giảm bớt thời gian làm việc thủ công. Hướng dẫn này sẽ chỉ cho bạn 3 cách scrape SuperPages để lấy lead — từ AI không cần code đến Python — để bạn chọn phương pháp hợp với mình nhất và quay lại làm những việc thực sự tạo ra kết quả.
Trích xuất lead từ SuperPages bằng AI Get Started Free
SuperPages là gì (và vì sao đội sales rất thích dùng nó để tìm lead)
SuperPages là một danh bạ doanh nghiệp trực tuyến tập trung vào thị trường Mỹ, nơi các doanh nghiệp địa phương được liệt kê kèm thông tin liên hệ, danh mục, đánh giá và nhiều dữ liệu khác. Có thể hiểu nó như phiên bản số hóa của cuốn danh bạ điện thoại yellow pages ngày trước — nhưng giờ bạn có thể tìm theo danh mục và vị trí, đồng thời thông tin của từng doanh nghiệp cũng đầy đủ hơn nhiều.

Một danh sách SuperPages điển hình có thể bao gồm:
- Tên doanh nghiệp
- Số điện thoại
- Địa chỉ đường phố
- URL website (nếu có)
- Danh mục (ví dụ: Plumbing, Family Law, HVAC)
- Đánh giá và nhận xét
- Giờ hoạt động (thường có trên trang chi tiết)
- Mô tả (trang chi tiết)
Trang chủ SuperPages làm nổi bật các nhóm phổ biến như Home Services, Plumbers, Electricians, Dentists, Legal Services, Auto Repair, Restaurants và Pet Services — cũng chính là những nhóm ngành mà đội sales, agency và các nhà cung cấp dịch vụ địa phương thường nhắm tới trong hoạt động tiếp cận khách hàng.
Nói ngắn gọn, SuperPages là một mỏ vàng cho bất kỳ ai đang tìm khách hàng doanh nghiệp địa phương tại Mỹ. Dữ liệu có cấu trúc, độ phủ rộng và các danh mục được ánh xạ rất sát với những chiến dịch outbound ngoài thực tế.
Dùng Thunderbit để lấy lead từ SuperPages
Vì sao nên scrape SuperPages để lấy lead (các trường hợp sử dụng phổ biến nhất)
Việc tự mở SuperPages rồi chép dữ liệu vào bảng tính là một hố đen về năng suất. Scraping sẽ tự động hóa toàn bộ quy trình đó, giúp bạn có một danh sách mục tiêu có cấu trúc chỉ trong vài phút thay vì vài giờ. Và vì bạn tự kiểm soát truy vấn tìm kiếm (danh mục + thành phố + từ khóa), đầu ra thường sát nhu cầu hơn nhiều so với một danh sách lead mua sẵn chung chung.
Dưới đây là những trường hợp sử dụng phổ biến nhất mà tôi thấy từ người dùng của chúng tôi:
| Trường hợp sử dụng | Ai được lợi | Ví dụ |
|---|---|---|
| Tạo lead địa phương | Đội sales, agency | Lập danh sách thợ ống nước ở Dallas để gọi cold outreach |
| Nghiên cứu đối thủ | Vận hành, marketing | So sánh đánh giá và dịch vụ giữa các đối thủ trong cùng thị trường |
| Lập bản đồ thị trường | Phát triển kinh doanh | Xác định toàn bộ nha sĩ trong một mã ZIP trước khi ra mắt sản phẩm mới |
| Tìm nhà cung cấp | Mua hàng, vận hành | Tìm nhà cung cấp ở một khu vực kèm số điện thoại + website |
| Tìm prospect SEO địa phương | Agency | Tìm doanh nghiệp không có website hoặc có dữ liệu listing yếu |
| Lập kế hoạch vùng phụ trách | Sales thực địa | Nhóm các nhà thầu theo thành phố, mã ZIP hoặc khu vực dịch vụ |
Thị trường tạo lead B2B tại Mỹ được ước tính đạt 8,5 tỷ USD vào năm 2024 và có thể tăng lên 18,2 tỷ USD vào năm 2034 — nghĩa là nhu cầu với kiểu dữ liệu này vẫn rất lớn. Một danh sách mới scrape, được lọc theo danh mục và vị trí, có thể nhắm mục tiêu tốt hơn nhiều so với danh sách mua sẵn chung chung, nhưng nó vẫn cần được xác minh và khử trùng lặp trước khi outreach (phần này mình sẽ nói kỹ hơn ở dưới).
Kết quả đầu ra trông như thế nào: ví dụ dữ liệu SuperPages sau khi scrape
Trước khi đi vào cách làm, tôi muốn cho bạn xem thành phẩm thực tế sẽ trông ra sao. Đây là phần mà đa số hướng dẫn thường bỏ qua — nhưng nếu bạn bỏ công sức, bạn cũng nên biết phần thưởng cuối cùng sẽ như thế nào.
Đây là một bảng đầu ra mẫu (dữ liệu giả, nhưng cấu trúc rất thực tế):
| Tên doanh nghiệp | Điện thoại | Địa chỉ | Website | Danh mục | Đánh giá | Giờ làm việc | Email (đã enrich) |
|---|---|---|---|---|---|---|---|
| Sunset Pipe & Drain Co. | +1 213-555-0148 | 1842 W 7th St, Los Angeles, CA 90057 | sunsetpipe.example | Plumbing | 4.6 | Mon-Fri 7a-6p | service@sunsetpipe.example |
| Arroyo HVAC Pros | +1 626-555-0182 | 72 N Fair Oaks Ave, Pasadena, CA 91103 | arroyohvac.example | HVAC | 4.8 | Mon-Sat 8a-7p | hello@arroyohvac.example |
| Wilshire Family Dental | +1 323-555-0119 | 4100 Wilshire Blvd, Los Angeles, CA 90010 | wilshiredental.example | Dentists | 4.4 | Mon-Thu 9a-5p | appointments@wilshiredental.example |
| Pacific Legal Aid Group | +1 310-555-0173 | 11845 W Olympic Blvd, Los Angeles, CA 90064 | Legal Services | 4.2 | Mon-Fri 8:30a-5:30p | intake@pacificlegal.example | |
| Valley Auto Repair Center | +1 818-555-0198 | 14422 Ventura Blvd, Sherman Oaks, CA 91423 | valleyautorepair.example | Auto Repair | 4.7 | Mon-Sat 8a-6p | info@valleyautorepair.example |
| Echo Park Pet Grooming | +1 213-555-0166 | 1511 Sunset Blvd, Los Angeles, CA 90026 | echoparkpets.example | Pet Grooming | 4.9 | Tue-Sun 9a-5p | booking@echoparkpets.example |
Một vài điểm cần lưu ý:
- Từ trang kết quả tìm kiếm: Tên doanh nghiệp, số điện thoại, địa chỉ một phần, danh mục, đánh giá, URL listing.
- Từ trang chi tiết doanh nghiệp (trang con): Địa chỉ đầy đủ, giờ làm việc, mô tả, đánh giá, đôi khi có website.
- Từ bước enrich: Email (thường chỉ tìm thấy trên website riêng của doanh nghiệp hoặc qua công cụ enrichment).
- Từ bước làm sạch dữ liệu: Số điện thoại định dạng E.164, bang/ZIP chuẩn hóa, khóa khử trùng lặp, source URL và ngày scrape.
Đây là kiểu dữ liệu mà bạn có thể đưa thẳng vào CRM, Google Sheet hoặc Airtable và bắt đầu làm việc ngay.
3 cách scrape SuperPages để lấy lead: so sánh nhanh

Không phải ai cũng thoải mái như nhau với kỹ thuật — hay có cùng mức kiên nhẫn. Vì vậy, dưới đây là ba phương pháp đặt cạnh nhau để bạn chọn cách phù hợp nhất:
| Tiêu chí | Thunderbit (AI không cần code) | Công cụ scrape trực quan (ví dụ: Octoparse) | Python (Requests + BS4) |
|---|---|---|---|
| Thời gian thiết lập | ~2 phút (cài extension) | ~15 phút (tạo workflow) | ~30 phút (cài thư viện, viết code) |
| Có cần code không | Không | Không | Có (Python) |
| Xử lý phân trang | Tích hợp sẵn (click hoặc cuộn) | Cần cấu hình | Viết tay bằng code |
| Enrich trang con | 1 click với Subpage Scraping | Cần workflow/vòng lặp riêng | Cần script riêng |
| Chống chặn | Cloud Scraping xử lý | Phụ thuộc gói/proxy add-on | Tự xử lý (proxy, headers, rate limit) |
| Tùy chọn xuất dữ liệu | Excel, Google Sheets, Airtable, Notion, CSV, JSON | CSV, Excel, database | Tùy theo bạn code |
| Phù hợp nhất với | Đội sales, agency, người không biết dev | Người dùng bán kỹ thuật | Developer muốn kiểm soát toàn diện |
Gợi ý của tôi: Nếu bạn muốn bắt đầu scrape trong 2 phút tới, hãy đi theo Phương pháp 1. Nếu bạn thích workflow trực quan và không ngại cấu hình chút ít, thử Phương pháp 2. Nếu bạn muốn toàn quyền kiểm soát và biết Python, hãy chuyển ngay sang Phương pháp 3.
Phương pháp 1: Scrape SuperPages bằng Thunderbit (AI, không cần code)
Đây là con đường nhanh nhất từ “tôi có một trang tìm kiếm trên SuperPages” đến “tôi có danh sách lead”. Không code, không trình dựng workflow, không phải lo proxy. Tôi hơi thiên vị — vì chính chúng tôi xây Thunderbit — nhưng tôi sẽ hướng dẫn bạn từng bước rõ ràng để bạn tự đánh giá.
Độ khó: Người mới bắt đầu
Thời gian cần: ~5 phút cho một lần scrape đầy đủ theo danh mục/thành phố
Bạn cần: Trình duyệt Chrome, Thunderbit Chrome Extension (bản miễn phí là đủ)
Bước 1: Cài Thunderbit và mở SuperPages
Vào trang tải Thunderbit Chrome Extension và cài extension Thunderbit. Chỉ mất khoảng một phút. Sau khi cài xong, hãy mở một trang kết quả tìm kiếm trên SuperPages — ví dụ, tìm “Plumbers in Los Angeles, CA” trên superpages.com.
Bạn sẽ thấy biểu tượng Thunderbit trên thanh công cụ của trình duyệt và một sidebar đã sẵn sàng để dùng.
Bước 2: Bấm “AI Suggest Fields” để tự động nhận diện cột dữ liệu
Mở sidebar của Thunderbit và bấm “AI Suggest Fields”. AI của Thunderbit sẽ đọc trang và tự động gợi ý các cột dựa trên những gì nó tìm thấy — thường là tên doanh nghiệp, số điện thoại, địa chỉ, website, danh mục, đánh giá và URL listing.
Bạn có thể chỉnh sửa, thêm hoặc xóa cột trước khi scrape. Muốn thêm cột tùy chỉnh như “Có website không?” hoặc “Khu vực phục vụ?” Chỉ cần nhập mô tả bằng tiếng Anh tự nhiên trong Field AI Prompt. Ví dụ, bạn có thể yêu cầu một cột “định dạng số điện thoại theo +1XXXXXXXXXX” hoặc “phân loại residential vs. commercial.”
Lúc này bạn sẽ thấy bản xem trước bảng với các cột đã cấu hình trong panel Thunderbit.
Bước 3: Bấm “Scrape” và xem dữ liệu được điền vào
Nhấn nút màu xanh “Scrape”. Thunderbit sẽ lấy toàn bộ listing trên trang hiện tại và điền vào bảng của bạn từng dòng một. Với một trang kết quả SuperPages thông thường, việc này mất khoảng 30–45 giây.
Thunderbit tự động xử lý phân trang — nó nhận ra nút “Next” hoặc cuộn vô hạn và tiếp tục cho đến khi hết trang hoặc chạm giới hạn của bạn. Nếu bạn scrape một tập kết quả lớn (ví dụ: toàn bộ thợ ống nước ở một vùng đô thị), hãy chuyển sang chế độ Cloud Scraping, có thể xử lý tới 50 trang cùng lúc mà không chiếm trình duyệt của bạn.
Bước 4: Dùng Subpage Scraping để làm giàu dữ liệu cho từng listing

Trang kết quả chỉ cho bạn phần cơ bản, nhưng “vàng” thật sự — giờ làm việc, mô tả đầy đủ, đánh giá, đôi khi là email — lại nằm trên trang chi tiết của từng doanh nghiệp. Bấm “Scrape Subpages” và Thunderbit sẽ lần lượt mở trang chi tiết của từng listing để lấy thêm các cột enrich như giờ làm việc, mô tả, URL website và bất kỳ thông tin liên hệ nào xuất hiện ở đó.
Đây là quy trình một cú nhấp chuột. Không cần workflow riêng, không cần cấu hình. Dữ liệu enrich sẽ được nối thẳng vào bảng hiện có của bạn.
Bước 5: Xuất lead sang Excel, Google Sheets, Airtable hoặc Notion
Khi bạn hài lòng với dữ liệu, hãy bấm Export. Thunderbit cho phép bạn gửi lead trực tiếp đến:
- Google Sheets (rất tiện để chuẩn bị CRM và chia sẻ)
- Airtable (bảng pipeline gọn nhẹ)
- Notion (cơ sở dữ liệu nghiên cứu)
- Excel / CSV (nhập vào CRM)
- JSON (bàn giao cho developer)

Tất cả tùy chọn xuất đều miễn phí. Nếu bạn đang đẩy lead vào HubSpot hoặc Salesforce, xuất sang CSV hoặc Google Sheets thường là cách nhanh nhất.
Mẹo nhỏ: Hãy scrape theo danh mục + thành phố thay vì tìm rộng theo toàn bang. “Emergency plumbers Dallas TX” sẽ cho bạn danh sách gọn và hữu ích hơn nhiều so với “plumbers Texas.” Thêm cột “Source URL” và “Scraped At” để dễ truy vết.
Phương pháp 2: Scrape SuperPages bằng công cụ trực quan (ví dụ Octoparse)
Các công cụ scrape trực quan như Octoparse nằm ở giữa: không cần code, nhưng cần nhiều thiết lập và cấu hình hơn Thunderbit. Octoparse thậm chí còn có template SuperPages dựng sẵn cho các trường hợp đơn giản.
Độ khó: Trung bình
Thời gian cần: ~20–30 phút cho thiết lập + scrape
Bạn cần: Tài khoản Octoparse (có gói miễn phí, nhưng giới hạn)
Bước 1: Tạo task mới và tải URL SuperPages
Mở Octoparse, bấm “New Task”, rồi dán URL tìm kiếm SuperPages của bạn (ví dụ: "https://www.superpages.com/los-angeles-ca/plumbers"). Trình duyệt tích hợp sẽ tải trang.
Bước 2: Tự động phát hiện hoặc chọn thủ công các trường dữ liệu
Bấm “Auto-detect” — Octoparse sẽ quét trang và tô sáng những trường dữ liệu mà nó cho là liên quan. Xem lại phần Data Preview. Theo kinh nghiệm của tôi, auto-detection thường bắt được phần lớn trường nhưng có thể lấy nhầm vài mục phụ (như nhãn quảng cáo hoặc text điều hướng) hoặc bỏ sót một số trường. Bạn nhiều khả năng sẽ phải thêm hoặc bớt vài trường bằng tay.
Theo tài liệu trợ giúp của Octoparse, auto-detection sẽ tạo ra workflow cơ bản với các bước phân trang và trích xuất dữ liệu, nhưng người dùng có thể cần bổ sung các trường còn thiếu thủ công.
Bước 3: Xây workflow và cấu hình phân trang
Bấm “Create workflow”. Octoparse sẽ tạo ra một chuỗi hành động theo từng bước. Hãy kiểm tra bước phân trang — đảm bảo nó click “Next” hoặc tải thêm kết quả đúng cách. Nếu bạn muốn lấy dữ liệu từ trang chi tiết của từng doanh nghiệp (giờ làm việc, email, mô tả), bạn sẽ phải thêm vòng lặp trang chi tiết hoặc action subpage vào workflow. Phần này phức tạp hơn nhiều so với cách one-click của Thunderbit.
Bước 4: Chạy task và xuất dữ liệu
Chạy task cục bộ (cho công việc nhỏ) hoặc trên cloud của Octoparse (cho job lớn hoặc job theo lịch — cloud là tính năng trả phí). Khi hoàn tất, xuất dữ liệu dưới dạng CSV, Excel hoặc JSON.
Điều cần biết: Gói miễn phí của Octoparse gồm 10 task, tối đa 50.000 dòng/tháng và chỉ trích xuất cục bộ. Chạy trên cloud, xoay IP, giải CAPTCHA và một số tích hợp xuất dữ liệu khác yêu cầu gói trả phí (bắt đầu khoảng 69 USD/tháng nếu thanh toán theo năm).
Phương pháp 3: Scrape SuperPages bằng Python (Requests + BeautifulSoup)
Đây là con đường dành cho developer. Toàn quyền kiểm soát, nhưng cũng đồng nghĩa là bạn tự lo toàn bộ. Nếu bạn thoải mái viết và duy trì script Python, cách này cho bạn độ linh hoạt cao nhất — nhưng cũng dễ làm bạn đau đầu nhất.
Độ khó: Nâng cao
Thời gian cần: ~30–60 phút (thiết lập + code + gỡ lỗi)
Bạn cần: Python 3.x, pip, requests, beautifulsoup4, lxml, một trình soạn thảo code
Bước 1: Thiết lập môi trường Python
python -m venv .venv
source .venv/bin/activate
pip install requests beautifulsoup4 lxml pandas
Bước 2: Kiểm tra cấu trúc HTML của SuperPages
Mở Developer Tools (F12) trên một trang kết quả SuperPages. Xác định các CSS selector cho tên doanh nghiệp, địa chỉ, điện thoại, website và link trang chi tiết. Hãy nhớ rằng cấu trúc HTML có thể thay đổi mà không báo trước, nghĩa là selector của bạn có thể gãy bất cứ lúc nào.
Bước 3: Viết scraper cho danh sách và xử lý phân trang
Dưới đây là một ví dụ rút gọn. Lưu ý quan trọng: Trong quá trình thử nghiệm của tôi, một request trực tiếp tới SuperPages trả về trang chặn Cloudflare “Attention Required”. Một script Requests ngây thơ có thể thất bại khi chạy ở quy mô lớn — bạn có thể cần ngữ cảnh phiên trình duyệt, giới hạn tốc độ, cơ chế thử lại hoặc các phương án được cho phép khác.
import csv, time
from urllib.parse import urljoin
import requests
from bs4 import BeautifulSoup
BASE_URL = "https://www.superpages.com"
HEADERS = {
"User-Agent": (
"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
"AppleWebKit/537.36 (KHTML, like Gecko) "
"Chrome/125.0 Safari/537.36"
)
}
def fetch(url):
resp = requests.get(url, headers=HEADERS, timeout=20)
resp.raise_for_status()
if "Attention Required" in resp.text or "Cloudflare" in resp.text:
raise RuntimeError("Bị chặn. Hãy giảm tốc độ hoặc chuyển sang scrape bằng trình duyệt/cloud.")
return BeautifulSoup(resp.text, "lxml")
def parse_listing(card):
name_el = card.select_one(".business-name, a.business-name, h2 a, h3 a")
phone_el = card.select_one(".phones, .phone, [class*=phone]")
address_el = card.select_one(".street-address, .adr, [class*=address]")
website_el = card.select_one("a.track-visit-website, a[href*='http']")
rating_el = card.select_one(".rating, [class*=rating]")
detail_url = urljoin(BASE_URL, name_el.get("href")) if name_el and name_el.get("href") else ""
return {
"business_name": name_el.get_text(" ", strip=True) if name_el else "",
"phone": phone_el.get_text(" ", strip=True) if phone_el else "",
"address": address_el.get_text(" ", strip=True) if address_el else "",
"website": website_el.get("href", "") if website_el else "",
"rating": rating_el.get_text(" ", strip=True) if rating_el else "",
"detail_url": detail_url,
}
def scrape_search(search_url, pages=3):
all_rows = []
for page in range(1, pages + 1):
page_url = f"{search_url}?page={page}"
soup = fetch(page_url)
cards = soup.select(".result, .organic, [class*=result]")
if not cards:
break
for card in cards:
all_rows.append(parse_listing(card))
time.sleep(5)
return all_rows
if __name__ == "__main__":
rows = scrape_search("https://www.superpages.com/los-angeles-ca/plumbers", pages=2)
with open("superpages_leads.csv", "w", newline="", encoding="utf-8") as f:
writer = csv.DictWriter(f, fieldnames=sorted({k for row in rows for k in row}))
writer.writeheader()
writer.writerows(rows)
Bước 4: Scrape trang chi tiết để enrich dữ liệu
Viết một hàm riêng để truy cập từng URL trang chi tiết và trích xuất giờ làm việc, email, mô tả và đánh giá. Điều này đồng nghĩa với việc bạn phải tự quản lý rate limit, xử lý lỗi và có thể là proxy — tất cả đều do bạn tự lo.
Bước 5: Lưu dữ liệu ra CSV hoặc JSON
Sử dụng các module csv hoặc json của Python. Bạn cũng cần tự viết logic khử trùng lặp, làm sạch dữ liệu và xuất dữ liệu.
Các lỗi thường gặp:
- SuperPages có thể chặn request bằng Cloudflare hoặc các hệ thống chống bot tương tự (điều này đã được xác nhận trong quá trình thử nghiệm của tôi).
- Selector ở đây được viết khá rộng vì markup của SuperPages có thể thay đổi.
- Đừng cho rằng trang kết quả tìm kiếm sẽ có email. Thực tế là hầu như không bao giờ có.
- Một scraper sản xuất thực sự cần xem xét robots/TOS, rate limiting, retry/backoff, logging có cấu trúc và bắt lỗi.
Nếu bạn muốn đào sâu hơn về scraping bằng Python, hãy xem hướng dẫn của chúng tôi về web scraping với Python hoặc bài tutorial BeautifulSoup.
Từ dữ liệu thô đến lead thực: quy trình đầy đủ (Scrape → Làm sạch → Xác minh → CRM)
Đây là lúc phần lớn hướng dẫn scrape dừng lại — và cũng là lúc giá trị thực sự bắt đầu. Scraping chỉ cho bạn nguyên liệu thô. Biến nó thành một danh sách lead có thể dùng được sẽ cần thêm vài bước nữa.

Quy trình sẽ như sau:
Tìm kiếm SuperPages → Scrape danh sách → Scrape trang chi tiết/website → Xuất ra Google Sheets hoặc CSV → Làm sạch điện thoại, địa chỉ, danh mục → Khử trùng lặp → Xác minh email/điện thoại → Enrich thông tin liên hệ còn thiếu → Nhập vào CRM → Outreach tuân thủ quy định
Khử trùng lặp: loại bỏ các listing trùng nhau
SuperPages thường hiển thị cùng một doanh nghiệp ở nhiều danh mục. Nếu bạn scrape cả “plumbers” và “drain cleaning” trong cùng một thành phố, chắc chắn sẽ có phần giao nhau.
- Khóa khử trùng lặp chính: Số điện thoại đã chuẩn hóa + địa chỉ đường phố đã chuẩn hóa.
- Khóa phụ: Domain + thành phố.
- Phương án dự phòng: Tên doanh nghiệp + mã ZIP (nên xem thủ công với các chuỗi nhượng quyền).
Trong Google Sheets, dùng =UNIQUE(A:H) cho các dòng trùng hoàn toàn, hoặc tạo một cột phụ như =LOWER(REGEXREPLACE(B2&C2,"[^a-zA-Z0-9]","")) để bắt các bản ghi gần trùng. Trong Excel, dùng Data > Remove Duplicates.
Làm sạch dữ liệu: chuẩn hóa điện thoại, địa chỉ và định dạng
- Định dạng số điện thoại theo E.164 (với Mỹ: +1 theo sau là 10 chữ số). Đây là định dạng mà hầu hết CRM và hệ thống gọi điện mong đợi. Bạn có thể dùng Field AI Prompt trong Thunderbit để tự động định dạng ngay khi scrape.
- Chuẩn hóa địa chỉ: mở rộng viết tắt, bổ sung ZIP nếu thiếu, tách thành các cột street/city/state/ZIP nếu cần.
- Loại bỏ HTML artifacts, khoảng trắng thừa và các tham số tracking khỏi URL.
- Thêm các cột
source_directory,source_urlvàscraped_atđể dễ truy vết.
Xác minh email và điện thoại trước khi outreach
Đừng gửi hàng loạt cold email đến mọi địa chỉ bạn scrape được. Việc xác minh giúp bảo vệ uy tín người gửi và giữ tỷ lệ bounce ở mức thấp.
- Xác minh email: ZeroBounce (giá từ khoảng 39 USD cho 2.000 credit, kèm 100 credit miễn phí mỗi tháng) hoặc Bouncer (8 USD cho 1.000 credit, credit không hết hạn) là những lựa chọn ổn.
- Xác thực số điện thoại: Twilio Lookup cung cấp định dạng và xác thực miễn phí; caller ID là 0,01 USD/request.
- Email Extractor và Phone Number Extractor miễn phí của Thunderbit có thể lấy các thông tin liên hệ bị bỏ sót trên trang listing.
Enrich: tìm liên hệ khi SuperPages không có email
Nhiều listing trên SuperPages hoàn toàn không hiển thị email — đặc biệt là ở trang kết quả tìm kiếm. Bạn nên làm gì?
- Scrape trang Contact, About hoặc footer trên website của doanh nghiệp. Subpage Scraping hoặc Email Extractor của Thunderbit có thể làm việc này hàng loạt.
- Dùng các công cụ enrich như Apollo, BetterContact, Icypeas hoặc Prospeo. Cảnh báo nhỏ: với các doanh nghiệp địa phương quy mô nhỏ (tiệm sửa ống nước 2 người, nha sĩ làm một mình), các cơ sở dữ liệu B2B lớn thường trả về rất ít kết quả. Cách lấy từ website thường hiệu quả hơn.
- Kết hợp nhiều danh bạ. Scrape SuperPages, Yellow Pages và Google Maps cho cùng danh mục/thành phố rồi gộp và khử trùng lặp. Phần giao nhau sẽ giúp bạn có dữ liệu đầy đủ hơn.
Nếu bạn từng thử đưa danh sách SMB địa phương vào Apollo rồi nhận về chủ yếu là ô trống, bạn không phải người duy nhất. Đó là lý do cách ưu tiên website lại quan trọng đến vậy với nhóm này.
Nhập vào CRM: đưa lead vào HubSpot, Salesforce hoặc Google Sheets
- HubSpot: Vào Data Management > Data Integration > Import data > Quick import (contacts only). Tải lên file
.csvhoặc.xlsx. Hướng dẫn import của HubSpot sẽ giúp bạn map field. - Salesforce: Dùng Data Import Wizard. Chuẩn bị file CSV, map trường nguồn sang trường của Salesforce, rồi chạy import.
- Google Sheets / Airtable / Notion: Thunderbit xuất trực tiếp sang cả ba — không cần qua CSV trung gian.
Mẹo: Map các cột đã scrape sang field của CRM trước khi import. Chỉ vài phút map field có thể tiết kiệm hàng giờ dọn dữ liệu sau này.
SuperPages so với các danh bạ doanh nghiệp địa phương khác: đâu là nơi có lead tốt nhất?
SuperPages là một điểm khởi đầu rất mạnh, nhưng không phải là danh bạ duy nhất đáng để scrape. Đây là cách nó so sánh với các lựa chọn khác:
| Danh bạ | Số lượng lead | Trường dữ liệu có sẵn | Độ mới của dữ liệu | Độ khó chống scraping | Phù hợp nhất |
|---|---|---|---|---|---|
| SuperPages | Lớn (tập trung vào Mỹ) | Tên, điện thoại, địa chỉ, website, danh mục, đánh giá | Trung bình | Trung bình | Dịch vụ tại nhà, nhà thầu, SMB |
| Yellow Pages | Lớn (tập trung vào Mỹ) | Tương tự SuperPages | Trung bình | Trung bình | Outreach doanh nghiệp địa phương nói chung |
| Google Maps | Rất lớn (toàn cầu) | Tên, điện thoại, địa chỉ, website, đánh giá, giờ làm, ảnh | Cao (được chủ doanh nghiệp cập nhật) | Cao (chống bot mạnh) | Dữ liệu địa phương mới nhất |
| Yelp | Lớn (tập trung vào Mỹ) | Tên, điện thoại, địa chỉ, đánh giá, mức giá | Cao | Cao | Nhà hàng, bán lẻ, doanh nghiệp dịch vụ |
| Manta | Trung bình | Tên, điện thoại, địa chỉ, ước tính doanh thu, số nhân viên | Trung bình | Thấp | Tìm prospect B2B (dữ liệu doanh thu/số nhân viên) |
| BBB | Trung bình | Tên, điện thoại, địa chỉ, chứng nhận, khiếu nại | Trung bình | Thấp | Doanh nghiệp uy tín/được kiểm chứng |
Nguồn: trang chủ SuperPages, bài nghiên cứu VLDB về SuperPages, tài liệu Google Places API, tài liệu Yelp Places API, trang chủ Manta, hướng dẫn BBB.
Thunderbit hoạt động trên tất cả các nguồn này — bao gồm cả Instant Templates cho những website phổ biến như Google Maps và SuperPages — nên bạn có thể áp dụng cùng một quy trình cho nhiều nguồn khác nhau rồi gộp danh sách lead lại. Theo kinh nghiệm của tôi, cách làm hiệu quả nhất thường là scrape hai hoặc ba danh bạ cho cùng một danh mục/thành phố rồi khử trùng lặp. Phần giao nhau sẽ lấp đầy các khoảng trống và cho bạn cái nhìn đầy đủ hơn.
Để tìm hiểu thêm về scraping các danh bạ khác, hãy xem các hướng dẫn của chúng tôi về Yellow Pages scrapers, Google Maps scrapers và Yelp scrapers.
Mẹo pháp lý và đạo đức khi scrape lead từ SuperPages

Tôi không phải luật sư, và đây không phải tư vấn pháp lý — nhưng tôi đã làm việc đủ lâu trong lĩnh vực này để biết rằng bỏ qua tuân thủ là cách nhanh nhất để tự chuốc rắc rối. Dưới đây là phần tóm lược thực tế.
Dữ liệu doanh nghiệp công khai vs. dữ liệu cá nhân
Danh sách doanh nghiệp — tên công ty, số điện thoại doanh nghiệp, địa chỉ doanh nghiệp, website doanh nghiệp — nhìn chung được xem là dữ liệu thương mại công khai. Điều này khác với dữ liệu người tiêu dùng cá nhân theo GDPR hoặc CCPA. Nhưng “công khai” không có nghĩa là “không có quy tắc”. Luôn kiểm tra Điều khoản dịch vụ của website.
Điều khoản sử dụng của SuperPages (cập nhật tháng 7/2019) có điều khoản “Data Mining Prohibited”: người dùng không được dùng bot, crawler, spider hoặc công cụ tương tự để thu thập hay trích xuất dữ liệu nếu chưa có sự đồng ý trước của Thryv. Bài viết này chỉ bàn về phương pháp và workflow, nhưng bạn nên đọc kỹ các điều khoản đó và xin phép khi cần trước khi scrape ở quy mô lớn.
Tuân thủ outreach: những điều cơ bản của CAN-SPAM và TCPA
Nếu bạn dùng email scrape được để gửi cold outreach, hướng dẫn của FTC về CAN-SPAM cho biết bạn phải:
- Không dùng tiêu đề giả mạo hoặc gây hiểu lầm
- Không dùng subject line lừa dối
- Xác định rõ đây là quảng cáo khi luật yêu cầu
- Bao gồm địa chỉ bưu chính hợp lệ
- Cung cấp cơ chế từ chối nhận rõ ràng và tôn trọng yêu cầu đó nhanh chóng
Nếu bạn dùng số điện thoại scrape được để gọi cold call, hãy kiểm tra National Do Not Call Registry và tuân thủ các quy định TCPA — đặc biệt là với cuộc gọi tự động, tin nhắn ghi âm sẵn và SMS. FTC đã công bố các thay đổi trong năm 2024 nhằm tăng cường bảo vệ trước telemarketing B2B lừa đảo và các cuộc gọi scam dùng AI.
Danh sách kiểm tra nhanh về tuân thủ
- ✅ Chỉ scrape dữ liệu doanh nghiệp đã được công khai
- ✅ Đọc Điều khoản sử dụng của SuperPages và xin phép khi cần
- ✅ Xác minh liên hệ trước khi outreach
- ✅ Thêm tùy chọn opt-out trong email
- ✅ Tôn trọng robots.txt và rate limit
- ✅ Duy trì danh sách DNC và danh sách chặn email
- ⚠️ Tránh scrape dữ liệu cá nhân/người tiêu dùng
- ⚠️ Không bán lại dữ liệu scrape thô mà chưa được rà soát pháp lý
Chọn phương pháp của bạn và bắt đầu xây danh sách lead
Scrape SuperPages để lấy lead không chỉ là chuyện trích xuất vài dòng từ một website. Giá trị thực sự đến từ toàn bộ quy trình: scrape, làm sạch, khử trùng lặp, xác minh, enrich, import và outreach đúng quy định.
Tóm tắt nhanh:
- Thunderbit là con đường nhanh nhất cho đội sales, agency và người không biết dev. Hai cú nhấp để scrape, một cú nhấp để enrich bằng subpages, xuất miễn phí sang Google Sheets, Airtable, Notion hoặc Excel. Dùng thử miễn phí.
- Octoparse là một công cụ workflow trực quan khá ổn cho người dùng bán kỹ thuật muốn kiểm soát cấu hình nhiều hơn.
- Python cho developer sự linh hoạt tối đa — nhưng đi kèm việc phải bảo trì, đau đầu với anti-blocking và không có enrich sẵn.
- Và nhớ rằng: cùng quy trình này cũng áp dụng cho Yellow Pages, Google Maps, Yelp, Manta và BBB. Hãy scrape nhiều nguồn, gộp lại, khử trùng lặp, và bạn sẽ có danh sách lead địa phương đầy đủ nhất có thể.
Nếu bạn muốn xem Thunderbit hoạt động như thế nào, hãy xem kênh YouTube của chúng tôi để xem hướng dẫn từng bước, hoặc xem giá Thunderbit để biết gói nào hợp với đội của bạn.
Giờ thì biến những trang danh bạ đó thành pipeline — và mong rằng số điện thoại của bạn luôn được định dạng chuẩn, còn email thì luôn được xác minh đầy đủ.
Câu hỏi thường gặp
Có hợp pháp không nếu scrape SuperPages để lấy lead?
Việc scrape dữ liệu danh bạ doanh nghiệp công khai để nghiên cứu B2B là khá phổ biến, nhưng Điều khoản sử dụng của SuperPages cấm data mining nếu chưa có sự đồng ý trước của Thryv. Luôn xem kỹ điều khoản của website, xin phép khi cần và tuân thủ các quy định outreach như CAN-SPAM và TCPA. Bài viết này chỉ mang tính giáo dục về phương pháp và workflow — việc dùng chúng đúng quy định là trách nhiệm của bạn.
Tôi có thể lấy được dữ liệu gì từ SuperPages?
Một lần scrape điển hình sẽ thu được tên doanh nghiệp, số điện thoại, địa chỉ, website, danh mục, đánh giá, giờ làm việc và mô tả. Email hiếm khi xuất hiện trên trang kết quả tìm kiếm — thường bạn sẽ phải vào trang chi tiết doanh nghiệp hoặc website riêng của công ty (bằng subpage scraping hoặc email extractor) để tìm thấy.
Có thể scrape SuperPages mà không cần code không?
Có. Các công cụ như Thunderbit (extension Chrome dùng AI) và Octoparse (công cụ scrape trực quan) cho phép bạn scrape SuperPages mà không cần viết một dòng code nào. Thunderbit là lựa chọn nhanh nhất — cài extension, mở trang tìm kiếm SuperPages, bấm “AI Suggest Fields”, rồi bấm “Scrape.”
Làm sao xử lý phân trang khi scrape SuperPages?
Thunderbit tự xử lý phân trang — nó nhận ra nút “Next” hoặc cuộn vô hạn và tiếp tục chạy. Octoparse yêu cầu bạn cấu hình bước pagination trong workflow. Với Python, bạn phải tự viết logic vòng lặp trang (tăng số trang, phát hiện trang cuối).
Làm thế nào để lấy email từ các listing SuperPages?
Phần lớn listing SuperPages không hiển thị email trên trang kết quả tìm kiếm. Hãy dùng Subpage Scraping của Thunderbit để vào từng trang chi tiết, hoặc dùng Email Extractor miễn phí trên website của doanh nghiệp. Nếu vẫn còn thiếu, thử các công cụ enrichment như Apollo, BetterContact hoặc Prospeo — nhưng với doanh nghiệp địa phương nhỏ, cách lấy từ website thường hiệu quả hơn các cơ sở dữ liệu B2B lớn.
Dùng AI Web Scraper cho lead SuperPages Get Started Free
Tìm hiểu thêm


