我認識的每一位創辦人,某個階段幾乎都買過一份號稱「已驗證」的 1 萬筆聯絡人名單,結果回覆率大概就停在零附近。我在職涯初期也做過同樣的事,然後很快學到一件事:一堆電子郵件不等於銷售漏斗。真正能推動成交的,是知道哪些公司值得聯繫,以及原因是什麼——這和單純從網路上撈名字,完全是兩回事。
網頁爬蟲常被包裝成「週五前拿到 1 萬筆潛在客戶」的捷徑,但到了 2026 年,真正好用的工具其實是為了更實際的目的而生:在公司剛釋出購買訊號的當下,找出有真實證據支持的真實帳戶。我在 Thunderbit 花了很多時間思考人們如何把資料爬下來用於銷售;而成效最好的團隊,從來不是爬最多列的那群,而是能在正確的資料列上附帶正確脈絡的人。
用網頁爬蟲找 B2B 潛在客戶,真正是什麼意思?
多數人一聽到「爬潛在客戶」,腦中想到的是一個工具把某個名錄頁整頁抓下來,吐出一份包含姓名、職稱和電子郵件的 CSV。那不叫潛在客戶開發,那叫聯絡人蒐集;也正因如此,這麼多銷售團隊最後手上都是一份大量退信、轉換更差的名單。
一筆真正的 lead 記錄,不能只靠名字。它需要帳戶身分(公司名稱與標準網域)、能證明這家公司確實符合你理想客戶輪廓的證據、一個帶時間戳的訊號來說明為什麼現在適合接觸、可被允許的聯繫方式、資料來源紀錄,以及之後可供檢視的狀態。這聽起來很多,但其實可以簡化成一個流程:先從公開且允許的來源開始,確認公司身分,蒐集匹配證據,記下觸發事件,找出最小必要的聯繫路徑,驗證、去重,最後匯入 CRM。少了一步,最後就會變成大家都討厭的東西——一張陌生人名單。
為什麼這件事比以往更重要
AI 讓爬蟲變得超級容易入門,也超級容易在大規模下做砸。幾年前,做一個爬蟲往往得找工程師,或是週末和 XPath selector 奮戰。現在,任何人都能把 AI 爬蟲對準一個頁面,在幾分鐘內拿到結構化資料。這對效率很棒,但也代表更多銷售團隊把未經篩選、未經驗證的資料更快塞進 CRM,而事後整理這些髒資料,往往比一開始就做對還要花更多時間。
同時,法規並不會因為工具變聰明就跟著鬆動。英國資訊專員辦公室(ICO)已經很明確說過,公開可得的商務聯絡資料仍可能受到英國 GDPR 規範,而即使是 B2B 情境,直接行銷的拒絕也必須被尊重。在美國,FTC 的 CAN-SPAM 指引也沒有替 B2B 電子郵件開特例——任何商業訊息都仍需具備正確標頭、可運作的退訂機制,並在 10 個工作天內處理退訂。這些都不是什麼冷門法律知識;不論你知不知道,這就是你實際運作時的基本框架。
開始之前:先看場合,也先看服務條款
我直接講白一點:不是每個網站都能隨便抓,不管你的爬蟲有多強。Google Maps 的條款明文禁止匯出或大量爬取地圖內容。LinkedIn 的使用者合約則直接禁止爬取與未授權自動化。Clutch 現行條款也禁止人工或自動爬取。這些都不是藏在角落的小字條款——在你把任何工具對準網站之前,這些才是第一個應該檢查的東西;我也曾經特別針對 LinkedIn 爬取寫過更多內容,因為這類問題真的太常出現。
robots.txt 值得理解,但不能把它當成法律上的放行通知。依照 IETF 自己的規範,它只是爬取指示,不是授權系統,也不是存取控制機制。網站就算在 robots.txt 允許爬取,仍然可以在服務條款裡禁止爬蟲;而一旦有爭議,通常是條款說了算。我的經驗法則是:如果網站需要登入才能看到資料、前面擋了 CAPTCHA,或是在條款中任何地方明寫「禁止爬取」,那就別把它當成要解的題目,而是該跳過的來源。
通常較安全、也更適合做 B2B 研究的公開來源,包括公司官網、政府申報資料、允許抓取的展商與合作夥伴名錄、徵才頁,以及新聞中心。以 SEC 的 EDGAR API 為例,它提供免費的公開 JSON 申報資料與 XBRL 資料,甚至不需要 API key——只要把自動請求頻率控制在 SEC 建議的每秒 10 次以下即可。
完整流程:從原始爬取到可進 CRM 的潛在客戶
以下是我真正會建議的流程;與其說是「爬資料」,不如說是一個以爬蟲為核心的小型研究流程。
第一步,選一個允許使用的公開來源,只抓組織層級欄位:公司名稱、網域、來源網址、類別、地點,以及一開始讓你注意到它的訊號(例如職缺、新聞稿、活動列表)。第二步,對看起來有機會的帳戶,前往其官網確認它們實際在做什麼、總部在哪裡,以及有哪些公開聯繫管道。第三步,只針對已通過資格門檻的帳戶做驗證與補充資訊,不要把名單擴充成本浪費在還沒篩選過的公司上。第四步,在匯入任何資料之前,先和既有 CRM 資料做去重。第五步,匯入時加上狀態欄位,讓銷售團隊知道哪些已經檢查過,哪些還需要人工確認。
最後這一步,比很多人想的都重要。我會建議每筆記錄都標記成類似 candidate_account、qualified_account、contact_ready、needs_review 或 rejected。這聽起來有點過度設計,直到你的 SDR 團隊問你:「等等,真的有人確認過這家公司符合我們的 ICP 嗎?」如果你有答案,那就值得。

到哪裡找高訊號的 B2B 帳戶
最有價值的訊號其實沒有藏起來,只是散落在多數團隊懶得系統性檢查的來源裡。公司招募頁可以看出他們正在招什麼人,這通常能反映他們正在投資的方向。新聞中心與新聞稿會透露融資、擴張與產品發布。合作夥伴與展商頁面(前提是允許爬取)則能看出誰活躍於某個產業生態。公開申報資料,特別是對規模較大的公司,往往比 LinkedIn 貼文更能揭示財務狀況與策略重點。
當然,單一訊號都不能直接證明購買意圖——例如「招募銷售副總裁」不代表這家公司明天就會買你的產品。但把這些訊號合併起來,再對照你自己的 ICP 標準,它們會比六個月前從某個 lead marketplace 買來、早已過時 20% 的靜態名單,強上太多。
為什麼 AI 驅動的爬蟲會改變計算方式
這裡和我五、六年前做爬蟲的方式,真的很不一樣。傳統爬蟲要為每一種頁面版型手動寫 selector;網站只要改版 HTML,你的爬蟲就壞了。AI 驅動的爬蟲工具更像人一樣讀頁面——它會根據上下文理解「這是公司名稱、這是地點、這是職稱」,而不是依賴脆弱的 CSS 路徑。
這種轉變,也是像 Thunderbit 這樣的工具可以在列表頁上直接看懂內容,並用 AI Suggest Fields 自動建議合適欄位,而不是要你手動把每個欄位都對好。你甚至只要用白話說出需求——像是「幫我抓公司名稱、網站、產業和地點」——AI 就會自己想辦法完成。我聽過一些團隊,以前每個網站要花半天設定爬蟲,現在只要點幾下再檢查一次。這不是因為底層法規變了——並沒有——而是因為把事情做好的技術門檻大幅下降了。若你想更全面了解這個轉變在 AI 爬蟲領域中的樣貌,可以參考我們對 AI 網頁爬蟲,以及它和舊式規則型方法差異的整理。
子頁面問題(為什麼只看列表頁通常只做了一半)
新手最常踩到的坑之一,就是以為列表頁就是全部。名錄頁可能只給你公司名稱和一個連結,但真正需要的證據——公司在做什麼、總部在哪裡、服務哪個產業——通常會藏在下一層,也就是公司自己的詳情頁或官網。
我看過很多團隊從名錄頁抓了幾百筆,最後才發現有一半「潛在客戶」少了那個其實最關鍵的欄位。這正是為什麼子頁面爬取是一個正式功能分類,而不是可有可無的小功能。好的爬蟲應該能先走訪列表頁,抓到每家公司詳情頁的連結,再自動追進去,把更深層的資料抓回來,最後合併成一列乾淨的資料。少了這一步,你其實只是在拿公司名稱和猜測來做資格判斷。
逐步操作:用 Thunderbit 找 B2B 潛在客戶
我會用我自己實際操作的方式來帶你走一遍,想像我坐在電腦前,手邊開著目標名錄,還有一杯咖啡。
第 1 步:安裝 Thunderbit 並打開你的目標名錄
先安裝 Thunderbit Chrome Extension,然後前往一個允許使用的公開來源——像是展商名單、產業名錄、徵才板,任何符合你 ICP 的來源都行。在繼續之前,先確認網站條款允許這種使用方式;這一步只要兩分鐘,卻能幫你省下後面很多麻煩。
第 2 步:點擊「AI Suggest Fields」
不用手動一欄一欄點頁面來定義欄位,讓 AI 先看頁面結構,自動建議像公司名稱、網站、地點、類別這些欄位。你也可以用白話文自行修改或新增欄位——例如「提取這家公司服務的產業」這種指令完全沒問題。
第 3 步:執行爬取
開始擷取,讓它跑完整個列表頁(如果名錄有多頁,也包含分頁)。這一步抓的是「原始」資料,也就是公司層級的識別資訊,還不是你會視為私人聯絡資訊的內容。
第 4 步:用子頁面爬取補充資料
對看起來有潛力的資料列,使用子頁面爬取追到公司的官網或詳情頁,抓更深一層的資訊,例如它們在做什麼、位於哪裡,以及列出的任何公開聯繫方式。這一步會把一筆空白的名錄資料,變成真正可用的合格帳戶記錄。
第 5 步:驗證與清理
在任何資料碰到 CRM 之前,先抽樣檢查。確認網域可以正常解析,確認你的判定理由真的成立,任何模糊不清的部分都標記成 needs_review,不要自己猜。這也是你可以在找到合法公開聯繫方式時,透過像 Hunter 這類服務做電子郵件驗證的時機——但請記得,「有效」的信箱不等於你就有權對那個人進行行銷。
第 6 步:匯出並推送到 CRM
Thunderbit 可以免費匯出成 CSV、Excel、Google Sheets、Airtable 和 Notion 這些格式。匯入 HubSpot 或 Salesforce 之前,先把公司網域統一成主鍵——HubSpot 自己的匯入說明建議公司用網域、聯絡人用電子郵件;如果你忽略這點,Salesforce 的重複規則可能會默默擋下或標記你的匯入。先用 20 到 30 筆做小批次測試,再全面匯入,這曾經不只一次幫我避免更麻煩的清理作業。
小技巧與常見地雷
以下是我會告訴今天才開始做這件事的人幾件事。不要把爬到的職稱或角色,直接當作有購買意圖的證據——它只是線索,不是綠燈。不要以為 AI 擷取出來的欄位就一定正確;任何流程在放大之前,都先抽樣檢查。名義聯絡人與直接電子郵件,最好和公司層級研究資料分開管理,並採取更嚴謹的治理方式,因為 B2B 並不會自動讓個資免於隱私規範。也不要讓「工具技術上做得到」變成你的合規政策——每一次都要檢查來源條款,不是只有第一次。
網頁爬蟲 vs. 購買潛在客戶資料庫
這兩種方式各有用途,假裝其中一種永遠比較好,老實說並不誠實。

| 因素 | 網頁爬蟲(允許的來源) | 購買潛在客戶資料庫 |
|---|---|---|
| 新鮮度 | 和你上次爬取一樣即時 | 往往幾週內就會過時 |
| 訊號品質 | 高——由你掌握觸發條件與脈絡 | 低——通常只有靜態公司資訊 |
| 覆蓋廣度 | 較窄,取決於來源 | 較廣,且較標準化 |
| 成本模式 | 主要是你的時間+工具訂閱費 | 持續性的按筆或按席費用 |
| 合規風險 | 只要來源與欄位選得謹慎,就可控 | 很大程度取決於供應商自己的資料來源方式 |
| 最適合的用途 | 針對特定訊號的外部開發 | 廣泛市場盤點、早期 TAM 規模估算 |
我的老實看法是:當你需要脈絡與時機——例如某個特定活動的展商名單、競品剛上線的新產品頁、剛刊登三個銷售職缺的公司——就用爬蟲。當你需要廣泛且標準化的覆蓋,並願意自己驗證新鮮度時,就購買或使用像 Apollo 這類補充資料供應商。兩者並不是互斥的;很多團隊會先爬訊號,再對通過篩選的帳戶做補充資訊,而不是永遠只走單一路線。
真實情境範例
假設你賣的是車隊管理軟體,想找成長中的物流公司。你去爬某個州交通部公開的運輸業者登錄資料,或某個產業協會的會員名錄,就能拿到公司名稱、地點和車隊規模類別——全部都是公開且允許使用的。接著再進到各家公司官網,確認它們確實在營運,並抓到一般聯絡電話。這樣可能得到 200 個合格帳戶,而不是 5000 個未驗證的名字,但每一個都值得 SDR 花時間,這才是真正目標。
B2B 潛在客戶的爬取,最有效的方式不是把它當成建名單,而是把它當成用更好工具做研究。我看過銷售團隊用 150 個高品質帳戶,創造出比 1 萬筆購買名單更多的 pipeline,原因很簡單:他們的接觸內容有關聯,而不是千篇一律。如果你正在思考 AI 爬蟲在整體銷售流程中該放在哪裡,很值得進一步看看 AI 如何重新塑造潛在客戶開發,以及銷售團隊日常如何實際使用 AI——這兩篇都會比單純談爬取步驟更深入。
建立這種流程,當然比直接下載聯絡人名單多花一點設定時間。但最後拿到的那些帳戶,是真的願意聽你說話的;而我這麼說,是因為多年來我已經把無數封冷郵件送進過虛空——多花那三十分鐘,真的值得。

常見問題
從網路爬取 B2B 公司資料是否合法?
完全取決於來源。公開的公司官網、政府申報資料,以及明確允許爬取的名錄,通常都可以用來做研究。但像 LinkedIn 和 Google Maps 這類網站,即使技術上做得到,條款也明文禁止爬取。在開始爬之前,一定要先看服務條款,並把 robots.txt 當成爬取指示,而不是法律授權。
在這個脈絡下,「lead」和「contact」有什麼差別?
contact 只是名字加上聯絡方式。真正做得好的 lead,則是一筆由證據支持的公司記錄,證明它符合你的理想客戶輪廓,並附上一個帶時間戳的訊號,說明你為什麼現在要聯繫。只抓大量聯絡人卻沒有這些脈絡,就是很多外撥活動表現不佳的原因。
AI 爬蟲可以保證資料正確嗎?
不行,任何聲稱可以保證的工具都值得提高警覺。AI 擷取很擅長把雜亂的頁面整理成結構化資料,但對模糊欄位仍可能誤判。不管你用哪一款工具,在放大流程前先抽樣檢查,都是值得保留的習慣。
我應該直接爬電子郵件,還是之後再用補充資料工具?
通常補充資料工具在尋找與驗證名義聯絡人的電子郵件方面,比直接從頁面爬取更可靠,而且一般也會清楚標示驗證狀態。我的建議是先爬公司層級的資格資訊,再只對已通過條件的帳戶做補充資料處理;這樣更有效率,也能降低合規風險。
我要怎麼避免把重複的潛在客戶匯入 CRM?
匯入前先以公司網域作為主要識別碼,而不是公司名稱——名稱太容易有各種變體,難以穩定去重。HubSpot 和 Salesforce 都有說明文件講它們的比對規則;先做一小批測試,再完整匯入,可以在問題變成大麻煩之前先抓出來。


