把一個網站的每個頁面都清點出來,聽起來像點幾下滑鼠的小事,做過的人才知道有多棘手。不論你要做 SEO 稽核、整理開發名單,還是只想搞清楚「這站到底多大」,都會撞上同一道牆:現在的網站幾乎沒一個乖乖把內容放在 HTML 裡。動態載入、無限捲動、JavaScript 選單、藏在登入後面的頁面,一層疊一層。目前約有 98.7% 的網站都使用 JavaScript,光是依賴無限捲動的線上網站就超過 55 萬個。也就是說,網路上一大批內容傳統爬蟲根本看不到,有時連你自己都不一定滑得到。
使用 AI 爬取並列出網站所有網址 Get Started Free
我在 SaaS、自動化與 AI 領域待了不少年,看過太多團隊為了把網址清點乾淨,耗掉好幾天,最後拿到的還是一份不完整又過時的清單。所幸像 Thunderbit 這類新一代 AI 工具把門檻壓得很低——就算不會寫程式,點個幾下也能把整站掃過一遍,拿到完整又準確的網址清單。以下就把運作邏輯、為什麼值得做,以及上手步驟一次講清楚。
「取得網站所有頁面」到底在做什麼?
說白了,把整站爬完,就是有系統地走遍每條連結、每個選單、每個藏起來的角落,把所有能存取的 URL 收攏成一份完整清單。重點不在抓首頁,也不在照抄 sitemap,而是連下面這幾類頁面都要撈出來:
- 靜態頁面:URL 固定、內容直接寫在 HTML 裡的傳統頁面,最好處理。
- 動態頁面:要靠 JavaScript 載入、按「載入更多」、無限捲動或互動元件才現身的內容,一般爬蟲多半抓不到。
- 孤兒頁面:沒有任何頁面連過去的 URL,只沿著連結走的工具很容易漏掉。
- 層級很深、分頁很多的內容:像電商站那樣,幾百個商品頁埋在一堆「下一頁」按鈕後面。
難點在哪?傳統爬蟲和手動方法,看到的通常只有 HTML 或 sitemap 裡現成的東西。一個頁面若要按按鈕、往下捲、或登入才出得來,對多數舊工具就等於不存在。而把希望全押在 sitemap.xml 上,等於把準確度交給一份不保證即時更新、又常常真的不更新的檔案。
目標其實很單純:建一份完整又準確的網站 URL 清單,靜態、動態、孤兒頁、藏得很深的頁面,一個都不放過。
為什麼要把整個網站爬完、列出所有網址?
你大概會問:「真的每個 URL 都要嗎?」以商業用途來說,多數情況答案是肯定的。理由如下:
| 應用場景 | 完整網址清單的好處 | 對團隊的 ROI/影響 |
|---|---|---|
| SEO 稽核 | 找出所有可索引頁面、修復壞連結、優化內容 | 排名更高、錯誤更少 |
| 內容治理 | 盤點所有素材、找出重複內容、管理更新 | 內容營運更順暢 |
| 開發名單 | 挖出隱藏的聯絡頁、活動頁或資源頁 | 更多潛在客戶、資料更完整 |
| 競品分析 | 看見競爭對手所有產品頁、促銷頁或落地頁 | 市場情報更到位 |
| 市場研究 | 彙整所有部落格、新聞、FAQ 做趨勢分析 | 訊息更精準、產品靈感更多 |
| 營運與 QA | 確認所有列表都仍在線上且為最新 | 減少錯誤、覆蓋更完整 |
舉個具體的:銷售團隊常會翻出主選單壓根沒放的「聯絡我們」或合作夥伴頁,這些往往就是名單金礦。行銷團隊則會拿完整清單,找出對手為 PPC 活動偷偷上線、彼此又不互連的落地頁。SEO 團隊更非有完整盤點不可,才修得掉爬取錯誤、逐頁優化,並閃開重複內容的坑。
近期一份調查顯示,72% 的中大型企業會使用網頁爬取來監控競爭對手,85% 的電商公司會爬取競爭對手的定價與促銷資訊。這些流程的起點都一樣:先拿到一份完整的 URL 清單。
方案比一比:傳統工具 vs. AI 網頁爬蟲
接著談工具。要爬完整站、列出所有網址,常見的路數大致分三類:
- 手動方法(複製貼上、瀏覽器擴充功能,或直接翻 sitemap):慢、易出錯,動態頁和孤兒頁基本上一定漏。
- 傳統爬蟲(Screaming Frog、SEMrush、自寫腳本):對付靜態網站很強,但碰到 JavaScript、無限捲動就卡住,也要有技術底子才設定得起來。
- AI 驅動的網頁爬蟲(例如 Thunderbit):讓 AI 像真人一樣「讀懂」網站,動態內容也能處理,全程不用寫程式。
三者放在一起比,大概長這樣:
| 功能/需求 | Thunderbit(AI 爬蟲) | Screaming Frog/SEMrush | 自訂腳本 |
|---|---|---|---|
| 無需程式碼設定 | 是 | 否 | 否 |
| 可處理動態/JS 內容 | 是 | 有限 | 有時可以 |
| 可找出孤兒頁/隱藏頁 | 是(AI 導航) | 否 | 否 |
| 支援子頁與分頁抓取 | 是(內建) | 需手動 | 需手動 |
| 可直接匯出(Sheets、Notion) | 是 | 只有 CSV | 否 |
| 網站版型變動時的適應能力 | AI 會重新建議欄位 | 否(需手動修正選擇器) | 否 |
| 價格(入門方案) | 免費方案 + 付費方案 | 每年 279 美元起 | 免費(但要付開發時間) |
Thunderbit 的強項,在門檻夠低、AI 會自動建議欄位,不寫程式也不套模板就能對付動態又複雜的網站。它服務的對象很明確:只想要結果、不想跟技術細節搏鬥的商務使用者。
第一步:動手爬之前,先把準備做足
正式開爬前花幾分鐘準備,後面會省下大把時間:
- 先把目標訂清楚:你要的是全部 URL,只要產品頁,還是別的東西?
- 先翻一下 sitemap:打開
https://example.com/sitemap.xml看看,當參考很好用,但別百分之百信它。 - 看一眼 robots.txt:到
https://example.com/robots.txt確認哪些區域不該碰(Thunderbit 預設就會遵守)。 - 大站先分段:超大型電商或目錄站,按分類或地區拆開來爬會更穩。
這幾個前置動作,能幫你少漏頁,也讓爬取更聚焦。
第二步:用 Thunderbit 取得網站所有頁面
重頭戲來了。以下是我實際用 Thunderbit 爬完整站、列出所有網址的流程——不寫程式,也不手忙腳亂。
先把 Thunderbit 裝好,跑第一次爬取
- 安裝 Thunderbit Chrome 擴充功能:從 Chrome 線上應用程式商店 或 Thunderbit 官網 取得都行。
- 註冊或登入:免費方案最多可抓 6 頁(完成試用加碼後可到 10 頁)。
- 把擴充功能釘選起來:之後在瀏覽器裡一鍵就能叫出來。
瀏覽器模式 vs. 雲端模式:
- 需要登入或抓私有內容,選瀏覽器模式,Thunderbit 會沿用你當下的登入狀態。
- 要爬大型公開網站,就用雲端模式——Thunderbit 一次最多可抓 50 頁,速度快很多。
靠「AI 建議欄位」精準抓 URL
- 先到起始頁面(首頁、分類頁,或某個區段頁)。
- 打開 Thunderbit,點「AI 建議欄位」。
- 讓 AI 掃一遍頁面——它會替找到的每條連結自動建議「頁面標題」、「URL」之類的欄位。
- 檢查並微調欄位:可以改名、刪除,或加自訂指令(例如「只保留含 /product/ 的網址」)。
- 不用再猜 selector,也不用寫 XPath——瑣碎的活交給 AI 就好。
抓子頁、處理分頁
- 分頁:Thunderbit 會自動偵測「下一頁」按鈕和無限捲動,把所有結果載入,不會只停在第一頁。
- 子頁抓取:第一輪爬完後點「抓取子頁」,Thunderbit 就會逐一走訪清單裡的每個 URL,再多撈一層細節(例如商品資訊或聯絡連結)。
- 多層級爬取:碰到結構複雜的網站(像帶分類、子分類的目錄站),Thunderbit 可以一層層遞迴往下爬,不必手動設定。
對電商、房地產這類層級很深的網站,這一項幫助很大。
第三步:匯出並整理你的網址清單
Thunderbit 跑完,你會拿到一份整理好的 URL 表格,連同設定的其他欄位。接下來呢?
- 匯出選項:
- Excel/CSV:走傳統試算表流程最順手。
- Google Sheets:方便團隊即時協作。
- Airtable/Notion:把清單變成即時資料庫或內部知識庫。
- JSON:給開發或系統整合用。
Thunderbit 匯出的資料乾淨、格式不亂,也不太需要你再手動去重。想更進一步,可以:
- 依 URL 模式篩選(例如只留
/blog/或/products/)。 - 去重:Thunderbit 本身就會盡量避免重複,但保險起見還是掃一遍。
- 分類整理:用試算表的篩選器,按區段或類型分組。
第四步:對付複雜或動態網站的進階招式
有些網站天生難搞,Thunderbit 也各有解法:
- 無限捲動:Thunderbit 的 AI 會模擬滑動、自動點「載入更多」。真的很難時,你可以先手動往下捲一段,幫 AI 抓出規律。
- 需要登入的網站:先登入,再切瀏覽器模式,Thunderbit 就會以你的身分抓取。
- 常見網站範本:Amazon、Zillow、Shopify 等常用範本都備好了,一鍵開跑。
- 排程:想讓 URL 清單一直保持最新?用 Thunderbit 的 Scheduled Scraper 自動執行(像「每週一早上 9 點」)。
碰到超大型網站,你甚至能一次餵多個起始 URL,讓 Thunderbit 並行爬取。
第五步:確保資料準確、操作合規
資料拿到手當然好,但也得確認它夠準、整個過程站得住腳。
- 驗證完整度:把結果對照網站 sitemap,或用 Google 搜尋
site:example.com,抓個頁數的大概。 - 抽查 URL:隨手點幾條,確認是有效頁,不是
javascript:void(0)或佔位符。 - 尊重 robots.txt:Thunderbit 預設會遵守,但抓敏感或私有內容時,還是再確認一次。
- 隱私與倫理:只抓公開、非個資的資料。要抓使用者檔案或留言,務必守好 GDPR/CCPA 等隱私法規。
- 控制抓取頻率:Thunderbit 預設就很有分寸,面對小型網站也可以把速度再放慢,別給對方伺服器添負擔。
結論與重點整理
放在幾年前,把一個網站爬完、列出所有 URL,是既技術又耗時的苦差事;現在有了 Thunderbit 這類 AI 工具,任何人兩下就能收工。不管你在銷售、行銷、SEO 還是營運團隊,手上有一份完整又準確的 URL 清單,本身就是競爭優勢。幾個要點可以記住:
- Thunderbit 的 AI 能吃下舊工具抓不到的動態內容、無限捲動與隱藏頁面。
- 不用寫程式、不用套模板,按「AI 建議欄位」再按「抓取」就行。
- 結果可即時匯出到 Excel、Sheets、Notion 或 Airtable。
- 子頁抓取、排程、範本這些進階功能,特別合商務使用者的胃口。
- 合規與倫理是設計時就內建的,讓你把心力放在洞察,而不是善後。
如果你受夠了漏頁、壞掉的腳本,以及手動爬取白白吃掉的時間,不妨先從 Thunderbit 的免費方案 試起。你會意外自己能挖出多少內容,省下來的時間也終於能投進真正重要的事。
想看更深入的拆解和實作教學,可以逛逛 Thunderbit 部落格,或參考我們手把手教你用 AI 取得所有網站頁面的 完整指南。
常見問題
1. 爬網站(crawling)和抓資料(scraping)差在哪?
爬取是有系統地走遍網站每個頁面與連結,建出一份 URL 清單;抓取則是從這些頁面撈特定資料,例如商品資訊或聯絡方式。Thunderbit 兩件事都能做:先爬出所有 URL,再逐頁抓你要的資料。
2. Thunderbit 能處理無限捲動或動態內容的網站嗎?
可以。Thunderbit 的 AI 能偵測無限捲動、「載入更多」按鈕,以及由 JavaScript 生成的內容,並把結果全部載入,不會只停在 HTML 裡看得到的那一層。
3. 怎麼避免漏掉隱藏頁或孤兒頁?
Thunderbit 的 AI 導航加上子頁抓取,正是為了找出主選單或 sitemap 裡沒收錄的連結,包括孤兒頁和動態載入的內容。
4. 列出一個網站的所有網址合法嗎?
一般來說,爬取公開頁面是合法的,但你仍應遵守 robots.txt、網站條款以及隱私法規。Thunderbit 鼓勵合規、負責任地爬取,也會幫你避開受限制區域。
5. 網站內容一直變,我要怎麼讓 URL 清單保持最新?
用 Thunderbit 的 Scheduled Scraper 排定自動爬取(每天、每週都行),讓清單永遠跟得上最新的網站結構。
想更聰明地爬、而不是更辛苦地爬嗎?下載 Thunderbit,親自感受取得網站所有頁面有多輕鬆——不用寫程式、不用焦慮,只有成果。
免費試用 Thunderbit AI 網頁爬蟲 Get Started Free
延伸閱讀


