網路每年都變得更複雜,而「我需要這些資料」和「我知道怎麼拿到它」之間的落差,始終大得讓人很頭痛。對初學者來說,第一個問題通常很單純:我真的只是想抓網站上的商品價格,就一定得學 Python 嗎?
好消息是,答案是否定的。但下一個問題——那我到底該用哪個工具?——才是真正讓人開始選擇障礙的地方。市面上有無程式碼桌面應用、瀏覽器擴充功能、Python 框架、Go 函式庫、SEO 爬蟲、託管 API,以及各種開源專案,彼此邊界常常混在一起。到了 2026 年,10 個值得關注的選項,正好從初學者最在意的幾個面向脫穎而出:需要多少程式碼、多久能拿到可用資料、能不能處理大量 JavaScript 的網站、免費方案能做到什麼程度,以及它們真正適合哪種情境。不管你是從沒寫過程式,還是剛入門、想找第一個爬蟲框架的初級工程師,這裡都能找到合適的起點。
我們是怎麼挑選最適合初學者的網頁爬蟲
「初學者」不等於「完全不懂技術」。它指的是還沒有建過網頁爬取流程的人——這也包括會寫基本 Python 或 JavaScript,但從沒處理過 URL 佇列,也沒碰過 robots.txt 檔案的人。
我們從六個直接對應新手常見問題的維度來評估每個工具:
- 是否需要程式碼 — 完全不需要、基礎 Python/JS,或中級以上
- 安裝與上手難度 — 從安裝到拿到第一筆可用資料要多久
- JavaScript 渲染能力 — 能不能處理 SPA 與動態載入內容的頁面
- 免費方案力度 — 在付費前能拿到什麼
- 輸出格式 — CSV、JSON、Excel、Google Sheets 等
- 最適用情境 — 這個工具對初學者真正最強的場景
這份清單橫跨三種技能層級:無程式碼(零程式設計)、中級(基礎 Python 或 JavaScript),以及進階初學者(Go 或更深入的框架知識)。我盡量老實說明每個工具擅長什麼、又在哪裡會卡關,因為選錯爬蟲,往往就是最快浪費半天的方式。
先選你的第一個網頁爬蟲:快速決策流程圖

在你開始看十個工具評測前,先回答三個問題。答案會直接指向最適合你的 1 到 2 個工具。
問題 1:你的程式能力到哪裡?
- 完全不會 → 看問題 2a
- 只會基礎 Python → 看問題 2b
- 會 JavaScript/TypeScript → 看問題 2c
- 會 Go → Colly
問題 2a(無程式碼):你的主要目標是什麼?
- 一般資料擷取(商品資訊、名單、研究資料)→ Thunderbit 或 Octoparse
- 複雜多步驟流程(登入、下拉選單、無限捲動)→ ParseHub 或 Octoparse
- SEO 稽核 → Screaming Frog
問題 2b(Python):你的主要目標是什麼?
- AI/LLM 流程(RAG、聊天機器人訓練)→ Crawl4AI 或 Firecrawl
- 大規模、結構化地爬取以靜態頁為主的網站 → Scrapy
- 在 JavaScript 密集網站上做瀏覽器自動化 → Playwright(但要自己設計爬取邏輯)
問題 2c(JavaScript/TypeScript):你的主要目標是什麼?
- 現代 SPA 爬取,並需要防封鎖能力 → Crawlee
- 複雜瀏覽器互動(登入、點擊、截圖)→ Playwright
- 給 AI 輸入的乾淨 Markdown → Firecrawl(透過 API/SDK)
**預算篩選:**如果你需要 0 元軟體,而且可以自行部署,那麼這裡的開源工具(Scrapy、Crawlee、Crawl4AI、Playwright 和 Colly)都沒有供應商設定的頁面配額,但運算資源、頻寬、儲存、維護成本,以及目標網站本身的限制仍然存在。如果你無法自行部署,Octoparse、ParseHub、Thunderbit、Firecrawl 和 Screaming Frog 都提供免費路徑,只是各自有不同限制。
光是這張流程圖,就可能幫你省下好幾個小時的分頁切換。建議先收藏。
一眼看懂:最適合初學者的網頁爬蟲
以下是完整比較表。"Coding Required" 會告訴你需要哪種語言(如果有的話)。"JS Rendering" 代表這個工具能不能處理透過 JavaScript 載入內容的頁面。"Free Tier" 則整理你在 0 元方案能拿到什麼。詳細評測會在下方展開。
| 工具 | 技能程度 | 是否需要程式碼 | JS 渲染 | 免費方案 | 最適合 |
|---|---|---|---|---|---|
| Octoparse | 初學者 | 不需要 | ✅ 內建 | 免費方案:10 個任務、僅本機執行、每次匯出 10K 列 | 以點選方式抓取結構化網站 |
| ParseHub | 初學者 | 不需要 | ✅ 內建 | 5 個公開專案、每次執行 200 頁、保存 14 天 | 不寫程式也能處理複雜多頁流程 |
| Thunderbit | 初學者 | 不需要 | ✅ 透過瀏覽器 | 免費方案(請確認最新限制) | 從你目前正在看的頁面,用 AI 輔助擷取資料 |
| Crawl4AI | 中級 | Python | ✅ Chromium | 開源(自架) | 為 RAG 流程準備好的 LLM 爬取 |
| Firecrawl | 中級 | API/SDK | ✅ 託管式 | 每月 1,000 credits(雲端) | 輸出乾淨 Markdown,方便 AI 直接使用 |
| Scrapy | 中級 | Python | ⚠️ 需外掛 | 開源(BSD) | 大規模、可高度客製化的 HTTP 爬取專案 |
| Crawlee | 中級 | JS/TS 或 Python | ✅ 透過 Playwright | 開源(Apache) | 現代 JS 爬取與防封鎖 |
| Playwright | 中級 | Python/JS/Java/.NET | ✅ 原生支援 | 開源(Apache) | 瀏覽器自動化 + 高互動 JavaScript 網站 |
| Screaming Frog | 初學者 | 不需要 | ✅(僅付費版) | 每次爬取 500 個 URL(永久免費) | SEO 稽核與技術性網站分析 |
| Colly | 進階初學者 | Go | ⚠️ 內建沒有 | 開源(Apache) | 高速、輕量、並行的 HTTP 爬取 |
接下來進入詳細分析。
1. Octoparse

Octoparse 是一款無程式碼桌面任務建立工具,另有可選的付費雲端執行。你只要貼上網址,讓 Auto-detect 自動辨識重複資料欄位與導覽模式,確認預覽後即可在本機執行。視覺化流程編輯器支援迴圈、分支、分頁、無限捲動、AJAX、表單與下拉選單——只是動態流程有時需要手動調整等待時間。
主要功能:
- 自動辨識資料欄位與頁面導覽
- 內建瀏覽器支援 JavaScript 渲染
- 內建數百個常見網站範本
- 可編輯工作流程,支援自訂迴圈、分支與選擇器控制
- 可匯出至 Excel、CSV、HTML、JSON、XML、Google Sheets 與資料庫(視方案而定)
**價格:**有限制的免費方案支援本機執行。雲端執行、排程、IP 輪換與 API 存取都需要付費方案。由於方案限制會變動,正式採用前請先確認最新價格。
**最適合:**想要定期、結構化地擷取電商、名錄或清單網站資料,又不想寫程式的初學者。如果你更需要瀏覽器擴充功能的便利性,或需要適合 LLM 的輸出格式,這就不是最理想的選擇。
2. ParseHub

ParseHub 是一款可下載的視覺化擷取工具,支援 Windows、macOS 與 Linux(透過 AppImage)。它的命令樹介面可用來描述選取、點擊、表單輸入、捲動與頁面範本。它支援 AJAX/JavaScript、下拉選單、分頁、彈出視窗、登入表單與無限捲動。
主要功能:
- 視覺化命令樹,適合多步驟擷取流程
- 支援 AJAX、JavaScript、下拉選單、分頁與無限捲動
- 跨平台桌面應用程式(Windows、macOS、Linux)
- 提供 API,可程式化取得資料
- 支援 CSV 與 JSON 匯出
**價格:**有免費與付費方案。計費的「頁面」有時可能是 URL,也可能是由點擊或捲動觸發的動態內容載入,所以頁面額度不一定等於同樣數量的 URL。選方案前,請先確認目前的專案、執行次數與保存期限限制。
**隱私提醒:**在把正式環境憑證輸入第三方爬蟲前,請先確認工具如何儲存登入資訊與專案資料。評估時建議使用權限受限的測試帳號。
**最適合:**需要不寫程式就能處理動態、多步驟網站(例如有複雜導覽、下拉選單或捲動載入)的初學者。
ParseHub vs. Octoparse:關鍵差異
兩者都是能處理 JavaScript 的無程式碼桌面工具。ParseHub 的命令樹模式能讓你對多步驟流程有更明確的控制,適合複雜導覽,但對簡單任務來說上手門檻較高。Octoparse 的 Auto-detect 對結構化簡單網站更快,而且免費方案的匯出限制也更寬鬆。如果你的目標網站主要是表格與清單,先從 Octoparse 開始。如果你需要描述一連串點擊、表單填寫與條件式導覽,ParseHub 會更清楚。
3. Thunderbit

Thunderbit 是一款適用於 Chrome 與 Edge 的 AI 網頁爬蟲瀏覽器擴充功能,專為想直接從目前瀏覽頁面擷取資料的非技術商務使用者設計。(先說明:我在 Thunderbit 任職,所以我會直接說明它的優點與限制。)
主要功能:
- AI Suggest Fields 會根據頁面內容自動辨識欄位
- 可在擷取時使用欄位層級的 AI 提示詞,進行分類、翻譯、格式化與標準化
- 可匯出到 Excel/CSV、Google Sheets、Airtable 與 Notion
- Browser Mode 使用使用者當下已渲染的瀏覽器 session,可處理支援頁面的 JavaScript 載入內容
- 除了 瀏覽器擴充功能 之外,無需額外安裝軟體
**價格:**目前免費方案包含每月 6 個頁面、每頁最多 30 credits。Starter 方案(每月 15 美元,或按年計費每月 9 美元)提供分頁、子頁抓取、批次抓取、資料補全、預建爬蟲與排程功能。最新價格請見此處。
**你需要知道的限制:**Thunderbit 是以頁面/資料結構為核心,而不是完整域名探索型爬蟲。分頁與子頁抓取屬於 Starter 功能,不在免費方案內。AI 建議欄位在真正執行前一定要檢查——建議通常不錯,但不是百分之百準確。
**最適合:**需要從瀏覽器當前頁面快速擷取結構化資料,並希望靠 AI 減少手動欄位設定的銷售、營運與研究團隊。如果你想把表格、清單或一組紀錄快速抓出來並匯出到試算表,這是我知道最快的路徑。
想了解 AI 輔助擷取在實務上怎麼運作,可參考我們的 AI 網頁爬蟲 指南。
4. Crawl4AI

Crawl4AI 是一個開源、以瀏覽器為核心的 Python 爬蟲,目標是為 LLM 工作流產出乾淨的內容。它可輸出原始與清理後的 HTML、多種 Markdown 變體、結構化擷取內容、連結、媒體、表格、截圖、PDF 與 MHTML。
主要功能:
- AsyncWebCrawler,底層使用 Chromium/Playwright
- 多種輸出格式,特別適合 RAG 流程與 agent 工作流
- 自適應爬取會評估覆蓋率、一致性與飽和度,以優先抓取相關連結,並在資訊足夠時停止
- 可選用 LLM 擷取,支援本地服務(Ollama)或雲端 API
- Apache-2.0 授權,另有額外的署名要求
**價格:**完全開源,沒有按頁收費。基礎設施由你自己負責,LLM 推論費用則視你使用本地或雲端而定。
**限制:**需要懂 Python 的非同步寫法與瀏覽器依賴。擷取品質也取決於你使用的 LLM(如果有)。自適應爬蟲會根據資訊充分性信號優先抓取相關連結——它不會永久學習,也不會自動修復 CSS 選擇器。
**最適合:**想為 AI 資料管線打造流程,並希望完全掌控、且不想付每次請求供應商費用的中級 Python 使用者。
5. Firecrawl

Firecrawl 是一個託管式網頁資料 API(同時提供 Python 與 Node.js 的 SDK),也有採用 AGPL 授權的自架版本。它的雲端服務會處理 JavaScript 渲染,並回傳 Markdown、摘要、HTML、連結、圖片、截圖、JSON 與變更追蹤資料。
主要功能:
/crawl端點支援 路徑篩選、探索深度、sitemap、限制、延遲與併發控制- 託管雲端會自動處理 JavaScript 渲染
- 多種輸出格式,包括乾淨 Markdown
/map端點可快速探索網站結構- Browser/Interact 與 beta agent 路徑可做多步驟互動(與基本爬取分開)
**價格:**Cloud Free 為 每月 1,000 credits,並有兩個並行請求與較低速率限制。付費方案以 credits 與併發為基礎——最新數字請看價格頁。自架會把基礎設施與維護責任轉回你身上,而且不包含所有託管雲端功能。
**限制:**基本 /crawl 會透過連結與 sitemap 遞迴探索 URL,但不保證能處理任意點擊式分頁。不同操作類型的 credit 成本也不同。自架版與雲端版的功能集並不完全相同。
**最適合:**想把網站內容餵給 LLM、聊天機器人或知識庫,並希望使用託管服務而不是自建瀏覽器堆疊的中級使用者。
Firecrawl vs. Crawl4AI:AI 流程該選誰?
Firecrawl 的強項是託管式 Markdown 轉換與乾淨 API——你送出 URL,就拿到結構化輸出。Crawl4AI 的強項則是偏本地化運作,你可以完全掌控瀏覽器與可選 LLM。如果你想盡量少管基礎設施,Firecrawl 的雲端會更簡單。如果你想要完全自架、又不想付供應商頁面費,而且熟悉 Python 非同步,Crawl4AI 會給你更多控制權。
6. Scrapy

Scrapy 是歷史悠久、採 BSD 授權的 Python 爬取與抓取框架,建立在 Twisted 非同步引擎之上。它提供請求排程、連結追蹤、去重、中介軟體、重試、節流、資料管線,以及 輸出至 JSON、JSON Lines、CSV、XML、pickle 與 marshal 的 feed 匯出。
主要功能:
- 非同步請求處理,適合大規模且範圍明確的爬取
- 完整的中介軟體生態系(代理、重試、節流、自訂標頭)
- 結構化管線架構,適合資料清理與儲存
- 龐大社群、文件與第三方擴充套件
- 完全開源(BSD 授權)
**限制:**沒有原生 JavaScript 渲染。官方的 動態內容指引 建議,能直接找到底層資料來源就盡量這麼做;否則就有意識地整合瀏覽器/渲染元件(例如 scrapy-playwright)。整體架構——spider、中介軟體、item pipeline、設定——學習曲線不低。
**價格:**免費。自己部署即可。
**最適合:**需要大規模抓取以靜態頁面或伺服器渲染頁面為主的中級 Python 使用者。
Scrapy 入門:有註解的快速開始
以下是從安裝到拿到第一筆資料的最短路徑:
pip install scrapy
scrapy startproject beginner_crawl
cd beginner_crawl
scrapy genspider example example.com
打開 beginner_crawl/spiders/example.py 並編輯:
import scrapy
class ExampleSpider(scrapy.Spider):
name = "example"
allowed_domains = ["example.com"] # 只停留在這個網域
start_urls = ["https://example.com"] # 種子 URL
custom_settings = {
"ROBOTSTXT_OBEY": True, # 尊重 robots.txt
"DOWNLOAD_DELAY": 2, # 每次請求間隔 2 秒
"CLOSESPIDER_PAGECOUNT": 10, # 10 頁後停止(安全上限)
"USER_AGENT": "Beginner-Crawl-Bot (+https://yoursite.com/bot-info)",
}
def parse(self, response):
yield {
"title": response.css("title::text").get(),
"url": response.url,
}
# 追蹤頁面上的連結(限 allowed_domains 內)
for link in response.css("a::attr(href)").getall():
yield response.follow(link, callback=self.parse)
執行:
scrapy crawl example -o output.json
在擴大規模前,先用 scrapy shell "https://example.com" 測試選擇器。實際上手時間會因為你的 Python 經驗而不同——如果你剛接觸虛擬環境和終端機指令,別期待十分鐘就搞定。
7. Crawlee

Crawlee 是由 Apify 維護、採 Apache 授權的爬蟲函式庫,支援 JavaScript/TypeScript 與 Python。它同時提供純 HTTP 類別(例如 CheerioCrawler)以及 Playwright/Puppeteer 瀏覽器爬蟲、請求佇列、資料集、session 管理、重試與邊界控制。
主要功能:
- 可依專案選擇 HTTP 優先(CheerioCrawler)或完整瀏覽器(PlaywrightCrawler)
- 內建請求佇列、去重與資料集儲存
- session 管理、瀏覽器指紋、重試與請求邊界控制
- 以 TypeScript 為先,Python 支援也相當穩定
- 官方快速開始 建議:若 HTML 已經包含資料,優先用 HTTP
**價格:**免費。開源、自行部署。
**限制:**需要 JavaScript/TypeScript 或 Python 知識。社群文件量比 Scrapy 少一些。防封鎖功能並不代表你取得了授權,也不保證一定能存取——它只能降低被偵測的風險,不能讓未授權爬取變成合法。
**最適合:**需要爬現代 SPA 與 JavaScript 渲染網站,並希望內建佇列管理與防封鎖能力的中級 JavaScript 開發者。
Crawlee 快速開始:從安裝到第一筆資料
npx crawlee create my-crawler
cd my-crawler
在設定提示出現時,選擇 Playwright 範本。
編輯 src/routes.ts 中的處理函式來擷取你要的內容,然後:
npm start
結果會以 JSON 形式出現在本機資料集目錄。正式擴大規模前,先加上 maxRequestsPerCrawl、深度限制、同網域規則,以及合理的併發上限。
8. Playwright

Playwright 是 Microsoft 推出的瀏覽器自動化框架,採 Apache 授權,支援 Python、Node.js、Java 與 .NET。它直接驅動真實的 Chromium、Firefox 與 WebKit 瀏覽器,因此非常適合 JavaScript 載入內容、需要登入流程,或互動很複雜的頁面。
主要功能:
- 真實瀏覽器的原生渲染,跨三大引擎
- 可處理 SPA、登入流程、點擊、表單填寫、檔案下載、截圖與 PDF
- 跨語言支援(Python、JS/TS、Java、.NET)
- 文件完整、持續積極開發
- 支援網路攔截與請求模擬
**Playwright 不是什麼:**它不是完整的爬蟲。它沒有原生 URL frontier、去重佇列、禮貌策略、重試模型或資料 feed 匯出器。這些部分要你自己搭,或搭配像 Crawlee 這類提供這些功能的框架一起用。
**價格:**免費。開源。
**最適合:**需要自動化高 JavaScript 比重或有登入保護網站的瀏覽器互動,且願意自己在外層搭建爬取邏輯的中級開發者。
9. Screaming Frog

Screaming Frog SEO Spider 是適用於 Windows、macOS 與 Linux 的桌面 SEO 技術爬蟲。它不是一般資料擷取工具——它是做 SEO 稽核的首選,用來找出壞連結、轉址鏈、重複內容、缺少的 metadata,以及數百種其他技術 SEO 問題。
主要功能:
- 免費可爬 500 個 URL(永久免費,不是試用)
- 可找出壞連結、轉址鏈、重複內容、缺少 metadata
- 有詳細分頁可看 page titles、meta descriptions、標題層級、圖片等
- 付費版新增 JavaScript 渲染、保存爬取、客製化擷取、GA/GSC 整合,以及 AI 整合(OpenAI、Gemini、Anthropic、Ollama)
**價格:**免費版永久可用,但限制為每次 500 URL,且不包含 JavaScript 渲染、進階設定、自訂擷取與整合功能。授權費為 每位使用者每年 £199 / $279 / €245。
**限制:**對非 SEO 使用者來說學習曲線偏陡。會消耗本機裝置資源(大型網站時偏記憶體密集)。沒有月付方案。不是為一般資料擷取設計的——它是稽核工具。
**最適合:**專注於 SEO 稽核與技術性網站分析的初學者。如果你要抓商品資料或建立名單,請找別的工具。
10. Colly

Colly 是一個採 Apache 授權的 Go HTTP 爬蟲/抓取框架,提供以 callback 為核心的 API、併發控制、session/cookie、佇列、快取,以及可替換的儲存後端。
主要功能:
- 快速的並行 HTTP 爬取,資源使用量低
- 簡潔、以 callback 為主的 API
- 內建 cookie/session 處理與快取
- 可透過 LimitRule 做網域層級速率限制
- 安裝指令:
go get github.com/gocolly/colly/v2
**初學者重要提醒:**Colly 目前原始碼預設會把 IgnoreRobotsTxt 設成 true。你必須明確把它設為 false,並且用適當的延遲與平行數去設定 LimitRule。如果不這麼做,Colly 會忽略 robots.txt,也很容易把目標伺服器壓垮。
**價格:**免費。開源。
**限制:**需要 Go 程式設計知識。沒有內建 JavaScript 渲染器,也沒有通用的 feed 匯出器——輸出要自己序列化。社群規模也比 Python 工具小。
**最適合:**懂 Go、且需要一個快速、輕量的 HTTP 爬蟲來處理靜態網站或 API 的進階初學者——前提是你有明確設定 robots 與速率限制。
免費方案比較:在付費前你實際拿得到什麼
這張表是重視成本的初學者最想看的。下列工具分成兩類:免費增值型產品(有上限,但不需自建基礎設施)與開源工具(頁面數不受限,但所有東西都要你自己架)。
免費增值 / 桌面免費方案
| 工具 | 免費限制 | 專案/任務上限 | 匯出限制 | 是否限時 | 主要鎖定功能 |
|---|---|---|---|---|---|
| Octoparse | 每次爬取無限頁數 | 10 個任務 | 每次匯出 10K 列;每月 50K 列 | 否(永久) | 雲端、排程、IP 輪換、API |
| ParseHub | 每次執行 200 頁 | 5 個公開專案 | CSV/JSON | 否(永久) | 專案/資料可能公開;保存 14 天 |
| Thunderbit | 每月 6 個頁面 | 不適用 | Excel/CSV、Sheets、Airtable、Notion | 否(永久) | 分頁、子頁、批次、排程屬 Starter 功能 |
| Firecrawl | 每月 1,000 credits | 不適用 | 所有格式 | 否(永久) | 2 個並行請求;低速率限制 |
| Screaming Frog | 每次爬取 500 個 URL | 執行次數不限 | 匯出功能有限 | 否(永久) | JavaScript 渲染、保存爬取、自訂擷取、整合 |
開源工具(自架)
| 工具 | 頁面限制 | 授權 | 你實際要付的是什麼 |
|---|---|---|---|
| Scrapy | 沒有 | BSD | 運算資源、頻寬、儲存、可選瀏覽器整合 |
| Crawlee | 沒有 | Apache | 運算資源、頻寬、瀏覽器程序 |
| Crawl4AI | 沒有 | Apache-2.0 + 署名要求 | 運算資源、瀏覽器程序、可選 LLM 推論 |
| Playwright | 沒有 | Apache | 運算資源、瀏覽器程序(CPU/記憶體消耗高) |
| Colly | 沒有 | Apache | 運算資源、頻寬 |
如果你的軟體預算是零,而且你能寫程式,開源工具可以避開供應商的頁面額度,但基礎設施、目標網站限制與營運成本仍然存在。不能寫程式?Octoparse、ParseHub 和 Thunderbit 都提供免費路徑——只是要注意各自的限制與隱私條件。
你的前 10 分鐘:三種技能層級的快速上手流程

理論很重要,但實作更重要。以下示範如何在三種代表性工具中,從零開始到第一次匯出資料——每個技能層級各選一個。
無程式碼路徑:用 Thunderbit 開始
- 安裝 Thunderbit 瀏覽器擴充功能
- 前往目標頁面(例如商品列表、名錄頁或搜尋結果頁)
- 點擊 Thunderbit 圖示並選擇 AI Suggest Fields——AI 會根據頁面內容自動辨識欄位
- 檢查並編輯系統建議的欄位(重新命名、刪除或新增欄位;也可加上 Field AI Prompts 進行分類或格式化)
- 點擊 Scrape
- 在擴充功能中查看結果,然後匯出到 Excel、Google Sheets、Airtable 或 Notion
在相容頁面上,這應該只是短暫設定,而不是一個程式專案。
更詳細的教學可參考我們的 使用 Thunderbit 從網頁擷取資料 指南。
Python 新手路徑:用 Scrapy 開始
請參考上方 Scrapy 章節的註解式快速開始。關鍵指令是 pip install scrapy、scrapy startproject,接著在 spider 裡設定 ROBOTSTXT_OBEY = True 和 DOWNLOAD_DELAY,最後執行 scrapy crawl example -o output.json。擴大規模前先在 scrapy shell 測試選擇器。所需時間會因你的 Python 環境熟悉度而不同。
JavaScript 路徑:用 Crawlee 開始
請參考上方 Crawlee 的快速開始。執行 npx crawlee create my-crawler,選擇 Playwright 範本,編輯 handler,然後執行 npm start。結果會以 JSON 形式出現在本機資料集目錄。擴大規模前請加入 maxRequestsPerCrawl 與網域限制。
如果你想看一個更完整、以 Python 為起點的流程,了解爬蟲專案是怎麼組成的,下面這個課程很適合作為搭配閱讀:
5 個會害你第一次爬取失敗的新手錯誤(以及如何避免)

這些問題在論壇裡超常出現,但幾乎沒有文章把它們獨立成專章講清楚。
錯誤 1:拿純 HTTP 爬蟲去爬 JavaScript 渲染的網站
問題:許多現代網站會在初始 HTML 回應之後,再用 JavaScript 載入資料。你只送出一個 HTTP 請求,拿回來的可能只是外殼頁面,裡面只有空的 <div> 標籤——完全沒有資料。
**解法:**在選工具前,先打開目標頁面,按右鍵查看原始碼。如果你要的資料不在原始 HTML 裡,就需要瀏覽器渲染能力:像 Playwright、Crawlee 的 PlaywrightCrawler,或是 Thunderbit、Octoparse 這類會在瀏覽器中渲染的無程式碼工具。不過也不要動不動就用瀏覽器——如果 HTTP 就夠了,瀏覽器只會增加成本和複雜度。
錯誤 2:忽略 robots.txt 和 Crawl-Delay 規則
問題:robots.txt 是一種標準,用來傳達某個命名爬蟲 token 可以存取哪些路徑。忽視網站的爬取政策,可能導致封鎖、營運損害與合規風險。
**解法:**在爬任何網站前,都先檢查 yoursite.com/robots.txt,並確認你選的工具預設值是什麼。預設設定各不相同:例如 Colly 預設會把 IgnoreRobotsTxt = true,需要你手動設定。也要注意,robots.txt 只是爬取控制訊號,不是法律授權。就算某路徑允許爬取,也不代表你可以任意蒐集或重用資料。
錯誤 3:不做速率限制就大量發送請求
問題:每秒狂打幾百個請求,很容易壓垮目標伺服器、讓你的 IP 被封,通常也不算好做法。
**解法:**設定正的延遲時間。在 Scrapy 中,使用 DOWNLOAD_DELAY = 2 並把 CONCURRENT_REQUESTS_PER_DOMAIN 設低。在 Colly 中,透過 LimitRule 設定延遲與平行數。雲端/無程式碼工具通常會自動處理,但仍要檢查設定。先從每個網域一個同時請求開始,只有在網站行為與條款允許時才逐步提高。
錯誤 4:小專案卻選了企業級工具
問題:為一個 500 頁的專案,去架分散式 Scrapy 集群、代理輪換與訊息佇列,就像為了買菜去租一台半掛車。
**解法:**回頭看前面的決策流程圖。讓工具複雜度與專案規模匹配。對小型、一次性的擷取任務來說,瀏覽器擴充功能或簡單腳本幾乎永遠是更好的選擇。
錯誤 5:沒有驗證輸出資料
問題:初學者常常匯出資料卻不先檢查,等過一陣子才發現一半的列是空白、重複,或是內容亂碼。
**解法:**在跑完整個爬取前,先抽查前 10 到 20 列。檢查空欄位、編碼問題(mojibake)、重複列與不合理的值。開始前就先定義好你期望的 schema——應該有哪些欄位、欄位類型是什麼、哪些欄位是必填。一次成功的爬取流程,並不代表資料一定正確。
什麼是「LLM-ready 輸出」?即使你不是在做 AI,也依然重要
到了 2026 年,"LLM-ready" 幾乎成了爬蟲產品行銷的標配。大多數解釋都預設你已經知道什麼是向量資料庫。這裡用白話說明。
LLM-ready 輸出 指的是乾淨、結構化的文字,AI 模型(像 GPT 或 Claude)可以直接吃進去,不需要你先人工整理。你可以把它想成:把一份排版清楚的試算表交給別人,跟丟給他一疊還混著廣告、導覽列與 cookie 橫幅的網頁列印稿,兩者差很多。
就算你不是在做聊天機器人,為什麼還要在意?因為以 LLM-ready 輸出為目標設計的工具,通常也會替所有人產出更乾淨、更好用的資料。後處理更少、雜欄位更少、編碼問題更少。乾淨資料就是乾淨資料,不管是人還是機器在看。
這份清單中,哪些工具原生就能輸出 LLM-ready 資料?
- Firecrawl → 乾淨 Markdown、摘要、結構化 JSON
- Crawl4AI → 多種 Markdown 變體、結構化區塊、表格
- Thunderbit → AI 建議的結構化欄位,並可用提示詞做標準化
下面用一個簡單前後對照來說明。產品頁面的原始 HTML 可能長這樣:
<div class="product-card">
<span class="price">$29.99</span>
<h2 class="title">Wireless Mouse</h2>
<p class="desc">Ergonomic design, 2.4GHz...</p>
<a href="/buy" class="btn">Add to Cart</a>
</div>
Firecrawl 輸出的 LLM-ready Markdown:
## Wireless Mouse
- **Price:** $29.99
- **Description:** Ergonomic design, 2.4GHz
Thunderbit 輸出的結構化資料:
| Product Name | Price | Description |
|---|---|---|
| Wireless Mouse | $29.99 | Ergonomic design, 2.4GHz |
這兩種都能立刻使用——不用解析 HTML、不用去除廣告、也不用手動對欄位。想更深入了解 AI 驅動擷取和傳統抓取的差異,可參考我們的 最佳 AI 網頁爬蟲 總覽。
負責任的網頁爬取:倫理與合規快速提醒
網頁爬取的倫理與合規非常重要,不能跳過:
- 爬取前先看 robots.txt。 這是標準的爬取控制訊號(RFC 9309),但它不是法律授權,也不是安全邊界。
- 遵守速率限制與 Retry-After 標頭。 遇到 429 或 503 時要放慢或停止。
- 只使用公開可得或已授權的資料。 若官方 API 或匯出功能已能滿足需求,優先使用它們。
- 檢查網站服務條款。 網站公開可見,不代表你就有普遍授權可以蒐集或重用資料。
- 留意個人資料。 最小化蒐集、設定保存/刪除規則,並對敏感用途取得合格審查。無論你用哪種工具,GDPR 與類似法規都可能適用。
很多工具都有支援負責任爬取的設定,但設定本身不會把責任從操作人身上轉移走。想更了解底層流程,可參考我們對 什麼是網頁抓取 的說明。
你該從哪個網頁爬蟲開始?
按技能層級快速總結:
- **無程式碼:**Thunderbit 適合 AI 輔助頁面擷取,Octoparse 適合視覺化流程建立,ParseHub 適合複雜多步驟流程,Screaming Frog 適合 SEO 稽核
- **中級 Python:**Scrapy 適合大規模 HTTP 爬取,Crawl4AI 適合 LLM 流程
- **中級 JavaScript:**Crawlee 適合現代 SPA 爬取,Playwright 適合複雜瀏覽器自動化
- **Go:**Colly 適合快速 HTTP 爬取(但要明確設定 robots 與速率限制)
- **託管 API:**Firecrawl 適合不想自架的乾淨 Markdown 輸出
最好的爬蟲,是最符合你的資料、權限、技能程度與營運限制的工具。先從簡單的開始,先驗證小規模執行,再視需要增加複雜度。如果你想試試 AI 輔助擷取,這個 Thunderbit 瀏覽器擴充功能 能讓你從相容頁面無程式碼直接匯出到試算表。
了解更多
常見問題
1. 什麼是網頁爬蟲?它和網頁抓取有什麼不同?
爬蟲負責發現與取得頁面——它會跟隨連結、管理 URL 佇列、處理去重與深度限制。抓取器則是從這些頁面中擷取特定的結構化資料——它會解析 HTML、選取欄位並輸出紀錄。現在很多工具都同時做兩者,只是程度不同,這兩個詞也常被交替使用;但在選工具時,這個區別很重要:有些工具(像 Playwright)非常擅長渲染頁面,但不提供爬取基礎設施;另一些工具(像 Scrapy)則提供完整爬取流程,但需要外掛來做 JavaScript 渲染。
2. 沒有程式能力的人,哪個網頁爬蟲最好?
Thunderbit、Octoparse 和 ParseHub 是一般資料擷取最強的無程式碼選擇。Thunderbit 用 AI 建議欄位,並以瀏覽器擴充功能運作;Octoparse 提供視覺化工作流程與 Auto-detect;ParseHub 則擅長複雜多步驟流程。如果只做 SEO,Screaming Frog 的免費版可在無需寫程式的情況下爬取最多 500 個 URL。
3. 網頁爬蟲可以免費使用嗎?
分兩類。完全開源的工具(Scrapy、Crawlee、Crawl4AI、Playwright、Colly)沒有按頁收費,但你得自己負責基礎設施,並支付運算、頻寬與儲存成本。免費增值工具(Octoparse、ParseHub、Thunderbit、Firecrawl、Screaming Frog)則提供免費方案,但在頁面數、專案數、匯出或功能上有不同限制。上面的免費方案比較表有更詳細的資訊。
4. 網頁爬蟲能處理大量 JavaScript 的網站嗎?
可以,但不是全部都行。內建瀏覽器渲染的工具——Playwright、Crawlee(PlaywrightCrawler)、Octoparse、ParseHub、Crawl4AI,以及 Thunderbit(透過 Browser Mode)——都能處理 JavaScript 載入的內容。Scrapy 和 Colly 是以 HTTP 為先,需要另外整合瀏覽器才有 JS 渲染能力。Screaming Frog 只有付費版才支援 JavaScript 渲染。要先確認目標頁面是否真的需要瀏覽器:先查看原始 HTML。
5. 網頁爬取合法嗎?
沒有一刀切的「可以」或「不可以」答案。法律分析會依資料類型、存取方式、用途、網站條款、合約、智慧財產權規則、GDPR 之類的隱私義務,以及適用司法管轄區而定。robots.txt 是爬取控制訊號,不是法律授權,而公開可見也不是通行許可。若是涉及個人資料、受版權保護內容、需要登入,或商業再利用等情境,請先諮詢合格的法律專業人士。


