網路世界每年都變得更加複雜,「我需要這些資料」和「我知道怎麼拿到資料」之間的落差一直都很大。對新手來說,第一個問題通常很單純:我真的需要先學 Python,才能把網站上的產品價格抓下來嗎?
好消息是,不需要。但接下來的問題——那我到底該用哪個工具?——才是真正讓人頭痛的地方。市面上有無程式碼桌面應用、瀏覽器擴充功能、Python 框架、Go 函式庫、SEO 蜘蛛、代管 API,以及各種開源專案,功能邊界常常彼此重疊。到了 2026 年,真正值得新手關注的十種工具,主要可以從這些面向來比較:需要多少程式能力、多久能拿到可用資料、是否能處理大量 JavaScript 的網站、免費方案提供多少資源,以及它最適合的實際情境。無論你是從沒寫過程式,還是剛起步的工程師,想找第一個爬蟲框架,這裡都能找到合適的切入點。
我們如何挑選最適合新手的網頁爬蟲
「新手」不等於「完全不懂技術」,而是指還沒實際做過網頁爬取流程的人——這也包含那些會寫基本 Python 或 JavaScript,卻從沒處理過 URL 佇列或 robots.txt 檔案的人。
我們從六個新手最常在論壇上詢問的角度來評估每個工具:
- 是否需要寫程式 — 完全不需要、基礎 Python/JS,或進階以上
- 安裝與上手難度 — 從安裝到取得第一份可用資料要多久
- JavaScript 渲染能力 — 能不能處理 SPA 與動態載入內容的頁面
- 免費方案友善度 — 在不付費前能拿到什麼
- 輸出格式 — CSV、JSON、Excel、Google Sheets 等
- 最適合的用途 — 這個工具對新手真正發揮價值的場景
這份清單涵蓋三種程度:無程式碼(完全不寫程式)、中階(基礎 Python 或 JavaScript)、以及進階新手(Go 或更深入的框架知識)。我盡量誠實說明每個工具的優勢與限制,因為選錯爬蟲、超出自己的技能範圍,是最容易浪費半天的方式之一。
選你的第一個網頁爬蟲:快速決策流程圖

在你開始看十款工具的介紹前,先回答三個問題。交集會指向一到兩個最適合你的工具。
問題 1:你的程式能力到哪裡?
- 完全不會 → 進到問題 2a
- 基礎 Python → 進到問題 2b
- JavaScript/TypeScript → 進到問題 2c
- Go → Colly
問題 2a(無程式碼):你的主要目標是什麼?
- 一般資料擷取(產品資訊、名單、研究資料)→ Thunderbit 或 Octoparse
- 複雜多步驟流程(登入、下拉選單、無限捲動)→ ParseHub 或 Octoparse
- SEO 稽核 → Screaming Frog
問題 2b(Python):你的主要目標是什麼?
- AI/LLM 流程(RAG、聊天機器人訓練)→ Crawl4AI 或 Firecrawl
- 大規模、以結構化為主的靜態網站爬取 → Scrapy
- 針對大量 JS 的網站做瀏覽器自動化 → Playwright(但要自己設計爬取邏輯)
問題 2c(JavaScript/TypeScript):你的主要目標是什麼?
- 現代 SPA 爬取並降低封鎖風險 → Crawlee
- 複雜瀏覽器互動(登入、點擊、截圖)→ Playwright
- 給 AI 直接吃的乾淨 Markdown → Firecrawl(透過 API/SDK)
**預算篩選:**如果你需要完全免費,且能自行架設,這裡的開源工具(Scrapy、Crawlee、Crawl4AI、Playwright、Colly)都沒有供應商設定的頁面額度,但運算、頻寬、儲存、維護,以及目標網站的限制仍然存在。如果你無法自架,Octoparse、ParseHub、Thunderbit、Firecrawl 和 Screaming Frog 都提供不同限制的免費路線。
這張流程圖本身就能幫你省下好幾個小時的分頁切換。建議先收藏。
一眼看懂最適合新手的網頁爬蟲
下面是完整比較表。「Coding Required」代表你需要會哪種語言(如果有的話)。「JS Rendering」代表工具能不能處理透過 JavaScript 載入內容的頁面。「Free Tier」則整理 $0 可以拿到什麼。詳細評測在表格後面。
| 工具 | 技能程度 | 需要程式 | JS 渲染 | 免費方案 | 最適合 |
|---|---|---|---|---|---|
| Octoparse | 新手 | 不需要 | ✅ 內建 | 免費方案:10 個任務、僅本機執行、每次匯出 1 萬列 | 點選式抓取結構化網站 |
| ParseHub | 新手 | 不需要 | ✅ 內建 | 5 個公開專案、每次執行 200 頁、保留 14 天 | 不寫程式也能處理複雜多頁流程 |
| Thunderbit | 新手 | 不需要 | ✅ 透過瀏覽器 | 免費方案(查看最新限制) | 從你正在看的頁面直接用 AI 擷取資料 |
| Crawl4AI | 中階 | Python | ✅ Chromium | 開源(自行架設) | 適合 LLM 的爬取,方便做 RAG 流程 |
| Firecrawl | 中階 | API/SDK | ✅ 代管 | 每月 1,000 credits(雲端) | 輸出乾淨 Markdown,方便 AI 讀取 |
| Scrapy | 中階 | Python | ⚠️ 需外掛 | 開源(BSD) | 大規模、可高度客製的 HTTP 爬取專案 |
| Crawlee | 中階 | JS/TS 或 Python | ✅ 透過 Playwright | 開源(Apache) | 現代 JavaScript 爬取,兼顧防封鎖 |
| Playwright | 中階 | Python/JS/Java/.NET | ✅ 原生支援 | 開源(Apache) | 瀏覽器自動化 + 大量 JS 網站互動 |
| Screaming Frog | 新手 | 不需要 | ✅(僅付費版) | 每次爬取 500 個 URL(永久免費) | SEO 稽核與技術網站分析 |
| Colly | 進階新手 | Go | ⚠️ 內建沒有 | 開源(Apache) | 快速、輕量、可並行的 HTTP 爬取 |
現在開始看詳細分析。
1. Octoparse

Octoparse 是一款無程式碼桌面任務建立工具,也可選擇付費雲端執行。你只要貼上 URL,讓 Auto-detect 自動辨識重複資料欄位與導覽模式,確認預覽後就能在本機執行。它的視覺化流程編輯器支援迴圈、分支、分頁、無限捲動、AJAX、表單與下拉選單,但動態流程有時仍需要手動調整節奏。
重點功能:
- Auto-detect 自動找出資料欄位與頁面導覽
- 內建 JavaScript 渲染,可透過內建瀏覽器處理動態內容
- 針對常見網站提供數百個預設範本
- 支援可編輯工作流程、自訂迴圈、分支與選擇器控制
- 可匯出到 Excel、CSV、HTML、JSON、XML、Google Sheets 與資料庫(依方案而定)
**價格:**有限制的免費方案支援本機執行。雲端執行、排程、IP 輪替與 API 存取需付費方案。實際價格與限制常變動,正式使用前務必查看最新資訊。
**最適合:**想要針對電商、目錄站或列表站做固定、結構化擷取,但不想寫程式的新手。如果你需要的是瀏覽器擴充功能那種即開即用,或是以 AI 直接可用的輸出格式,Octoparse 就沒那麼理想。
2. ParseHub

ParseHub 是一款可下載的視覺化擷取工具,支援 Windows、macOS 與 Linux(透過 AppImage)。它的命令樹介面可描述選取、點擊、表單輸入、捲動與頁面樣板。它支援 AJAX/JavaScript、下拉選單、分頁、彈出視窗、登入表單與無限捲動。
重點功能:
- 視覺化命令樹,適合多步驟擷取流程
- 可處理 AJAX、JavaScript、下拉選單、分頁、標籤頁與無限捲動
- 跨平台桌面應用程式(Windows、macOS、Linux)
- 可透過 API 以程式方式取得資料
- 支援 CSV 與 JSON 匯出
**價格:**有免費與付費方案。可計費的「頁面」有時是 URL,有時是由點擊或捲動觸發的動態內容載入,所以頁數額度不一定等於 URL 數。選方案前請確認目前的專案、執行次數與保存期限限制。
**隱私提醒:**在確認工具如何儲存登入資訊與專案資料之前,不要把正式帳號密碼直接放進第三方爬蟲。建議先用受限的測試帳號評估。
**最適合:**需要擷取動態、多步驟網站的新手,例如有複雜導覽、下拉選單或以捲動載入內容的網站,而且不想寫程式。
ParseHub vs. Octoparse:關鍵差異
兩者都是能處理 JavaScript 的無程式碼桌面工具。ParseHub 的命令樹模型能讓你更明確控制多步驟流程,適合複雜導覽,但對於簡單任務來說,上手門檻會高一些。Octoparse 的 Auto-detect 對於規則明確的結構化網站更快,而且免費方案的匯出額度也比較大。如果目標網站主要是表格與清單,先從 Octoparse 開始。如果你要模擬一連串點擊、填表與條件式導覽,ParseHub 可能更清楚。
3. Thunderbit

Thunderbit 是一款為 Chrome 與 Edge 設計的代理式網頁抓取瀏覽器擴充功能,專門給想直接從目前頁面擷取資料的非技術商務使用者。為避免誤會先說明:我在 Thunderbit 工作,所以我會直接講優點,也會坦白說限制。
重點功能:
- One Click Extract 會依頁面內容自動辨識欄位
- 欄位層級的 AI 提示詞,可在擷取過程中做分類、翻譯、格式化與標準化
- 可匯出到 Excel/CSV、Google Sheets、Airtable 與 Notion
- Browser Mode 會使用使用者當下已渲染的登入 session,可處理支援頁面的 JavaScript 動態內容
- 除了 瀏覽器擴充功能 外,幾乎不用額外安裝
**價格:**目前免費方案包含每月 6 頁,每頁最多 30 點 credits。Starter(每月 15 美元,或年繳每月 9 美元)新增分頁、子頁抓取、批量抓取、資料補全、預設爬蟲與排程功能。查看最新價格。
**值得注意的限制:**Thunderbit 是以頁面/資料結構為導向,不是用來做整個網域發現的蜘蛛。分頁與子頁抓取屬於 Starter 功能,不在免費方案內。AI 建議的欄位在正式執行前一定要檢查,雖然通常很準,但不是百分之百正確。
**最適合:**銷售、營運與研究團隊,想從瀏覽器正在看的頁面快速拿到結構化資料,並借助 AI 省去手動欄位設定。如果你要的是把表格、列表或一批記錄從相容頁面快速抓下來並匯出到試算表,這是我知道最快的方法。
關於 AI 輔助擷取實際怎麼運作,可以參考我們的 AI 網頁抓取 指南。
免寫程式,一鍵開始 Thunderbit 的代理式網頁爬蟲可以自己讀取頁面並挑選欄位,不需要寫程式,非常適合新手的第一個爬蟲。 Get Started Free
4. Crawl4AI

Crawl4AI 是一款以瀏覽器為核心、開源的 Python 爬蟲,專為產生適合 LLM 工作流程的乾淨輸出而設計。它可輸出原始與清理後的 HTML、多種 Markdown 版本、結構化擷取內容、連結、媒體、表格、截圖、PDF 與 MHTML。
重點功能:
- AsyncWebCrawler,底層使用 Chromium/Playwright
- 多種輸出格式,特別適合 RAG 流程與代理式工作流
- 自適應爬取會根據覆蓋率、一致性與飽和度評估,優先抓取相關連結,資料足夠時就停止
- 可選擇使用本地供應商(如 Ollama)或雲端 API 進行 LLM 擷取
- Apache-2.0 授權,但另有署名要求
**價格:**完全開源,沒有每頁費用。你要自行架設基礎設施,LLM 推理費用則視本地或雲端而定。
**限制:**需要 Python async 知識與瀏覽器相依環境。如果有使用 LLM,擷取品質也取決於所選模型。它的自適應爬蟲會依資訊充足信號來優先抓取相關連結,並不會永久學習或自我修復 CSS 選擇器。
**最適合:**正在建立 AI 資料管線的中階 Python 使用者,想要完整控制權,又不想付每次請求的供應商費用。
5. Firecrawl

Firecrawl 是一個代管的網頁資料 API(也提供 Python 與 Node.js 的 SDK),並且有一個 AGPL 授權的自架程式碼庫。雲端服務會處理 JavaScript 渲染,並回傳 Markdown、摘要、HTML、連結、圖片、截圖、JSON 與變更追蹤資料。
重點功能:
/crawl端點支援 路徑篩選、探索深度、sitemap、限制、延遲與並行控制- 雲端自動完成 JavaScript 渲染
- 多種輸出格式,包括乾淨的 Markdown
/map端點可快速探索網站結構- Browser/Interact 與 beta agent 路徑支援多步驟互動(與基本爬取分開)
**價格:**雲端免費方案每月 1,000 credits,並限制同時 2 個請求與較低速率。付費方案依 credits 與並行數計價,請以價格頁最新數字為準。自架則需要自己負責基礎設施與維護,也不包含所有代管雲端功能。
**限制:**基本的 /crawl 會透過連結與 sitemap 遞迴探索 URL,但不保證能處理任意點擊式分頁。不同操作的 credits 成本也不同。自架版與雲端版的功能集並不完全相同。
**最適合:**需要把網站內容餵給 LLM、聊天機器人或知識庫的中階使用者,且希望使用代管服務,而不是自己維護瀏覽器堆疊。
Firecrawl vs. Crawl4AI:AI 流程該選哪個?
Firecrawl 擅長代管式 Markdown 轉換與乾淨 API——你丟一個 URL,它就回你結構化輸出。Crawl4AI 則更適合本地優先的部署,你可以控制瀏覽器與可選的 LLM。如果你想把基礎設施管理降到最低,Firecrawl 的雲端會更容易上手。如果你想完全自架、避免供應商每頁費用,而且熟悉 Python async,Crawl4AI 會給你更多控制權。
6. Scrapy

Scrapy 是歷史悠久、採 BSD 授權的 Python 爬取與抓取框架,建立在 Twisted 非同步引擎之上。它提供請求排程、連結追蹤、去重、中介軟體、重試、節流機制,以及 輸出到 JSON、JSON Lines、CSV、XML、pickle 和 marshal 的 feed 匯出。
重點功能:
- 非同步請求處理,適合大規模且範圍清楚的爬取
- 豐富的中介軟體生態系(代理、重試、節流、自訂標頭)
- 結構化的 pipeline 架構,方便資料清洗與儲存
- 擁有龐大社群、文件與第三方擴充功能
- 完全開源(BSD 授權)
**限制:**沒有原生 JavaScript 渲染。官方的 動態內容指引 建議能找到底層資料來源就直接取用,或刻意整合瀏覽器/渲染元件(例如 scrapy-playwright)。其架構包含 spider、middleware、item pipeline、settings,學習曲線確實不低。
**價格:**免費,自行架設。
**最適合:**需要大規模爬取多半是靜態或伺服器端渲染網站的中階 Python 使用者。
Scrapy 入門:有註解的快速上手
這是從安裝到拿到第一筆資料的最短路徑:
pip install scrapy
scrapy startproject beginner_crawl
cd beginner_crawl
scrapy genspider example example.com
打開 beginner_crawl/spiders/example.py 並修改內容:
import scrapy
class ExampleSpider(scrapy.Spider):
name = "example"
allowed_domains = ["example.com"] # 只停留在這個網域
start_urls = ["https://example.com"] # 種子 URL
custom_settings = {
"ROBOTSTXT_OBEY": True, # 遵守 robots.txt
"DOWNLOAD_DELAY": 2, # 每次請求間隔 2 秒
"CLOSESPIDER_PAGECOUNT": 10, # 爬到 10 頁就停(安全上限)
"USER_AGENT": "Beginner-Crawl-Bot (+https://yoursite.com/bot-info)",
}
def parse(self, response):
yield {
"title": response.css("title::text").get(),
"url": response.url,
}
# 追蹤頁面中的連結(限於 allowed_domains)
for link in response.css("a::attr(href)").getall():
yield response.follow(link, callback=self.parse)
執行:
scrapy crawl example -o output.json
在大規模擴充前,先用 scrapy shell "https://example.com" 測試選擇器。實際安裝時間取決於你的 Python 經驗——如果你還不熟虛擬環境與終端機指令,不要期待十分鐘就搞定。
7. Crawlee

Crawlee 是由 Apify 維護、採 Apache 授權的爬蟲函式庫,支援 JavaScript/TypeScript 與 Python。它提供 HTTP 優先類別(如 CheerioCrawler),也提供 Playwright/Puppeteer 瀏覽器爬蟲、請求佇列、資料集、session 管理、重試與邊界控制。
重點功能:
- 可依專案選擇 HTTP 優先(CheerioCrawler)或完整瀏覽器(PlaywrightCrawler)
- 內建請求佇列、去重與資料集儲存
- session 管理、瀏覽器指紋、重試與請求邊界控制
- TypeScript 優先,也支援穩定的 Python
- 官方快速入門 建議:如果 HTML 本身就有資料,優先用 HTTP 模式
**價格:**免費,開源、自行架設。
**限制:**需要 JavaScript/TypeScript 或 Python 知識。社群文件量比 Scrapy 少一些。防封鎖功能不代表你就有授權,也不保證一定能存取——它只能降低被偵測的風險,不能讓未經授權的爬取變成合法。
**最適合:**需要爬取現代 SPA 與 JavaScript 渲染網站,且希望內建佇列管理與防封鎖機制的中階 JavaScript 開發者。
Crawlee 快速上手:從安裝到第一筆資料
npx crawlee create my-crawler
cd my-crawler
當設定提示出現時,選擇 Playwright 範本。
接著編輯 src/routes.ts 內的 handler 來擷取你需要的資料,然後:
npm start
結果會以 JSON 形式存到本機資料集目錄。正式擴大前,記得加入 maxRequestsPerCrawl、深度限制、同網域規則與合理的並行上限。
8. Playwright

Playwright 是 Microsoft 推出的 Apache 授權瀏覽器自動化框架,支援 Python、Node.js、Java 與 .NET。它能操控真正的 Chromium、Firefox 與 WebKit 瀏覽器,因此非常適合處理以 JavaScript 載入內容、需要登入流程,或互動非常複雜的頁面。
重點功能:
- 原生真實瀏覽器渲染,跨三種引擎
- 可處理 SPA、登入流程、點擊、表單填寫、檔案下載、截圖與 PDF
- 跨語言支援(Python、JS/TS、Java、.NET)
- 文件完整、開發活躍
- 支援網路攔截與請求模擬
**Playwright 不是什麼:**它不是完整的爬蟲。它沒有原生的 URL frontier、去重佇列、禮貌政策、重試模型或資料 feed 匯出器。這些要你自己做,或與像 Crawlee 這種提供這些功能的框架搭配使用。
**價格:**免費,開源。
**最適合:**需要在大量 JS 或受登入保護的網站上自動化瀏覽器互動,且願意自己包裝爬取邏輯的中階開發者。
9. Screaming Frog

Screaming Frog SEO Spider 是一款供 Windows、macOS 與 Linux 使用的桌面技術 SEO 爬蟲。它不是一般用途的資料擷取工具,而是做 SEO 稽核的首選:檢查失效連結、轉址鏈、重複內容、缺少 metadata,以及數百種其他技術 SEO 問題。
重點功能:
- 免費可爬取最多 500 個 URL(永久免費,不是試用)
- 可找出失效連結、轉址鏈、重複內容、缺少 metadata
- 分頁可詳細查看標題、meta description、heading、圖片等資訊
- 付費版新增 JavaScript 渲染、保存爬取結果、自訂擷取、GA/GSC 整合,以及 AI 整合(OpenAI、Gemini、Anthropic、Ollama)
**價格:**免費版永久提供每次 500 URLs,但不含 JavaScript 渲染、進階設定、自訂擷取與整合功能。授權費為 每位使用者每年 £199 / $279 / €245。
**限制:**對非 SEO 使用者來說學習曲線偏陡。會吃本機裝置資源,大型網站時特別受記憶體限制。沒有月費方案。它本來就不是為一般資料擷取設計的——它是稽核工具。
**最適合:**專注在 SEO 稽核與技術網站分析的新手。如果你要抓產品資料或建立潛在客戶名單,請找別的工具。
10. Colly

Colly 是一個採 Apache 授權的 Go HTTP 爬蟲/抓取框架,提供以 callback 為基礎的 API、並行控制、session/cookie、佇列、快取與可替換的儲存後端。
重點功能:
- 快速並行 HTTP 爬取,資源使用低
- 乾淨、以 callback 為核心的 API
- 內建 cookie/session 處理與快取
- 透過 LimitRule 做網域層級的速率限制
- 目前安裝方式:
go get github.com/gocolly/colly/v2
**新手必看警告:**Colly 現行原始碼預設會將 IgnoreRobotsTxt = true 設為啟用。你必須手動把它改成 false,並用適當的延遲與並行數設定 LimitRule。如果不做這些,Colly 會忽略 robots.txt,而且很容易把目標伺服器壓垮。
**價格:**免費,開源。
**限制:**需要 Go 程式知識。沒有內建 JavaScript 渲染器,也沒有通用的 feed 匯出功能——輸出得自己序列化。社群規模也比 Python 工具小。
**最適合:**懂 Go 的進階新手,需要一個快速、輕量的 HTTP 爬蟲來處理靜態網站或 API,而且願意明確設定 robots 與速率限制。
免費方案比較:在付費前你實際拿得到什麼
這是重視成本的新手最需要看的表格。下面的工具分成兩類:Freemium 產品(有上限但不用自建基礎設施)與開源工具(頁數不限,但一切都得自己架)。
Freemium / 桌面免費方案
| 工具 | 免費限制 | 專案/任務上限 | 匯出限制 | 有時間限制嗎? | 主要鎖定功能 |
|---|---|---|---|---|---|
| Octoparse | 每次爬取頁數無上限 | 10 個任務 | 每次匯出 1 萬列;每月 5 萬列 | 否(永久) | 雲端、排程、IP 輪替、API |
| ParseHub | 每次 200 頁 | 5 個公開專案 | CSV/JSON | 否(永久) | 專案/資料可能公開;保留 14 天 |
| Thunderbit | 每月 6 頁 | 不適用 | Excel/CSV、Sheets、Airtable、Notion | 否(永久) | 分頁、子頁、批量、排程皆屬 Starter |
| Firecrawl | 每月 1,000 credits | 不適用 | 全部格式 | 否(永久) | 同時 2 個請求;低速率限制 |
| Screaming Frog | 每次爬取 500 個 URL | 執行次數無上限 | 匯出功能有限 | 否(永久) | JS 渲染、保存爬取、自訂擷取、整合 |
開源工具(自行架設)
| 工具 | 頁面限制 | 授權 | 你的成本 |
|---|---|---|---|
| Scrapy | 無 | BSD | 運算、頻寬、儲存、可選瀏覽器整合 |
| Crawlee | 無 | Apache | 運算、頻寬、瀏覽器程序 |
| Crawl4AI | 無 | Apache-2.0 + 署名 | 運算、瀏覽器程序、可選 LLM 推理 |
| Playwright | 無 | Apache | 運算、瀏覽器程序(CPU/記憶體消耗高) |
| Colly | 無 | Apache | 運算、頻寬 |
如果你的軟體預算是零,而且你會寫程式,開源工具可以避免供應商的頁面額度限制,但基礎設施、目標網站限制與營運成本仍然存在。不能寫程式?Octoparse、ParseHub 與 Thunderbit 都提供免費路線,只是要注意各自的限制與隱私條件。
你的前 10 分鐘:三種技能程度的快速上手

紙上談兵很好,但實作更重要。下面示範如何用三種代表性工具,從零開始到匯出第一份資料——每個技能層級各一個。
無程式碼路線:用 Thunderbit 開始
- 安裝 Thunderbit 瀏覽器擴充功能
- 前往目標頁面(例如產品列表、目錄頁或搜尋結果頁)
- 點擊 Thunderbit 圖示並選擇 One Click Extract — AI 會讀取頁面、判斷結構、決定要抓哪些欄位,然後一次完成擷取
- 在擴充功能中檢視結果,必要時重新命名、刪除或新增欄位,並加入 Field AI Prompts 調整資料,最後匯出到 Excel、Google Sheets、Airtable 或 Notion
在相容頁面上,這應該是一個很短的設定流程,而不是一個程式專案。
更完整的操作說明可參考我們的 使用 Thunderbit 從網頁擷取資料 指南。
Python 新手路線:用 Scrapy 開始
請參考上面 Scrapy 章節中的註解版快速入門。關鍵指令是 pip install scrapy、scrapy startproject、把 spider 設成 ROBOTSTXT_OBEY = True 並加上 DOWNLOAD_DELAY,然後執行 scrapy crawl example -o output.json。擴大規模前先用 scrapy shell 測試選擇器。實際所需時間會依你的 Python 環境經驗而不同。
JavaScript 路線:用 Crawlee 開始
請參考上面的 Crawlee 快速入門。執行 npx crawlee create my-crawler,選擇 Playwright 範本,編輯 handler,然後執行 npm start。結果會以 JSON 形式出現在本機資料集目錄。正式放大前,先加上 maxRequestsPerCrawl 與網域限制。
如果你想看一個更長、以 Python 為主的流程,了解爬蟲專案如何組成,這門課會是很好的搭配:
免費試用,無需信用卡 免費方案每月可處理 6 頁,讓你在正式採用付費工具前先練習資料擷取。 Get Started Free
讓第一次爬取失敗的 5 個新手錯誤,以及如何避免

這些問題在論壇裡超常見,但很少有排名前面的文章把它們獨立整理出來。
錯誤 1:把只抓 HTTP 的工具拿去爬 JavaScript 渲染網站
問題:許多現代網站會在初始 HTML 回應後,透過 JavaScript 才把資料載入。單純的 HTTP 請求只會拿到空的 <div> 骨架頁,沒有資料。
**解法:**在選工具前,先打開目標頁面,按右鍵查看原始碼(View Source)。如果你要的資料不在原始 HTML 裡,那你就需要能渲染瀏覽器的工具:像 Playwright、Crawlee 的 PlaywrightCrawler,或是 Thunderbit、Octoparse 這類會在瀏覽器中渲染的無程式碼工具。但也別一律預設要用瀏覽器;如果 HTTP 就夠了,硬上瀏覽器只會增加成本與複雜度。
錯誤 2:忽略 robots.txt 與 Crawl-Delay 規則
問題:robots.txt 是一種標準,用來傳達哪些路徑可供指定爬蟲存取。忽略網站的爬取政策,可能導致被封鎖、對網站造成負擔,甚至帶來合規風險。
**解法:**爬之前一定先看 yoursite.com/robots.txt,並確認你選的工具真正的預設值。不同工具差很多:例如 Colly 預設會把 IgnoreRobotsTxt = true 啟用,必須自己明確設定。也要記得,robots.txt 是爬取控制訊號,不是法律授權;允許爬取不代表你就能任意蒐集或重複使用資料。
錯誤 3:不做速率限制就狂送請求
問題:每秒幾百個請求會把目標伺服器壓垮,也很容易讓你的 IP 被封,通常也被視為不好的實務。
**解法:**一定要設定合理延遲。在 Scrapy 中,使用 DOWNLOAD_DELAY = 2 並降低 CONCURRENT_REQUESTS_PER_DOMAIN。在 Colly 中,設定 LimitRule 的延遲與並行數。雲端或無程式碼工具通常會自動處理,但還是要確認設定。起步時,先讓每個網域只有 1 個進行中的請求,只有在網站行為與條款允許時才逐步加大。
錯誤 4:小專案卻選了企業級工具
問題:為一個 500 頁的專案去架分散式 Scrapy 叢集、代理輪換與訊息佇列,就像為了買菜去租一台聯結車。
**解法:**回頭看決策流程圖。工具複雜度要跟專案規模對得上。小型、一次性的擷取,瀏覽器擴充功能或簡單腳本通常才是正解。
錯誤 5:沒有驗證輸出資料
問題:新手常常匯出資料後就不再檢查,等過一陣子才發現有一半的列是空白、重複或亂碼。
**解法:**正式大規模爬取前,先抽查前 10 到 20 筆。看看有沒有空欄位、編碼問題(亂碼/mojibake)、重複列與意外數值。在開始前先定義你預期的 schema——應該有哪些欄位、各欄位的資料型別是什麼、哪些欄位是必填。一次成功的爬取流程,不代表資料就一定正確。
什麼是「LLM-ready 輸出」(即使你不是在做 AI,也值得了解)
到了 2026 年,"LLM-ready" 幾乎出現在所有爬蟲行銷文案裡。多數解釋都假設你已經知道向量資料庫是什麼。下面用最白話的方式說明。
LLM-ready 輸出,就是乾淨、結構化的文字資料,讓 AI 模型(像 GPT 或 Claude)不用額外清理就能直接讀取。你可以把它理解成:交給別人的是一份排版整齊的試算表,而不是一疊還帶著廣告、導覽列與 cookie 橫幅的列印網頁。
就算你不是在做聊天機器人,為什麼也該在意?因為專為 LLM-ready 設計的工具,通常對所有人來說都能產出更乾淨、更好用的資料。後處理更少、垃圾欄位更少、編碼問題更少。資料乾淨就是乾淨,不管最後是人看還是機器看。
這份清單裡,哪些工具原生就能產出 LLM-ready 輸出?
- Firecrawl → 乾淨 Markdown、摘要、結構化 JSON
- Crawl4AI → 多種 Markdown 版本、結構化區塊、表格
- Thunderbit → AI 建議的結構化欄位,並可透過提示詞做標準化
下面用一個簡單前後對比來說明。產品頁的原始 HTML 可能長這樣:
<div class="product-card">
<span class="price">$29.99</span>
<h2 class="title">Wireless Mouse</h2>
<p class="desc">Ergonomic design, 2.4GHz...</p>
<a href="/buy" class="btn">Add to Cart</a>
</div>
Firecrawl 產出的 LLM-ready Markdown 會像這樣:
## Wireless Mouse
- **Price:** $29.99
- **Description:** Ergonomic design, 2.4GHz
Thunderbit 產出的結構化結果會像這樣:
| 產品名稱 | 價格 | 描述 |
|---|---|---|
| Wireless Mouse | $29.99 | Ergonomic design, 2.4GHz |
兩者都能直接使用——不用解析 HTML、不用去除廣告、不用手動對欄位。想了解 AI 驅動的擷取和傳統抓取有什麼不同,可以參考我們的 最佳 AI 網頁爬蟲 總覽。
負責任的網頁爬取:倫理與合規快速提醒
網頁爬取的倫理與合規非常重要,不能略過:
- 爬取前先看 robots.txt。 它是標準的爬取控制訊號(RFC 9309),但不是法律授權,也不是安全邊界。
- 遵守速率限制與 Retry-After 標頭。 遇到 429 與 503 回應時要放慢或停止。
- 只使用公開可得或已授權的資料。 如果官方 API 或匯出功能已經能滿足需求,優先使用它們。
- 確認網站的服務條款。 即使資料是公開可見,也不代表你就能無限制蒐集或重複使用。
- 注意個人資料。 盡量減少蒐集、制定保存/刪除規則,若涉及敏感用途,應取得合格的專業審查。像 GDPR 這類法規,與你使用哪個工具無關,都可能適用。
很多工具都提供有助於負責任爬取的設定,但設定本身不會把責任從操作者身上移開。想更深入了解底層流程,可以看我們對 什麼是網頁抓取 的解說。
你應該從哪個網頁爬蟲開始?
依技能程度快速總結:
- **無程式碼:**Thunderbit 適合 AI 輔助的頁面擷取,Octoparse 適合建立視覺化流程,ParseHub 適合複雜多步驟流程,Screaming Frog 適合 SEO 稽核
- **中階 Python:**Scrapy 適合大型 HTTP 爬取,Crawl4AI 適合 LLM 流程
- **中階 JavaScript:**Crawlee 適合現代 SPA 爬取,Playwright 適合複雜瀏覽器自動化
- **Go:**Colly 適合快速 HTTP 爬取(但要明確設定 robots 與速率限制)
- **代管 API:**Firecrawl 適合在不自架的情況下取得乾淨 Markdown 輸出
最好的爬蟲,是最符合你的資料需求、權限條件、技能程度與營運限制的那一個。先從簡單的開始,先驗證小規模結果,只有在專案真的需要時再加複雜度。如果你想嘗試 AI 輔助擷取,Thunderbit 瀏覽器擴充功能 提供了一條不用寫程式、就能從相容頁面匯出到試算表的路線。
了解更多
試試 Thunderbit 的代理式網頁爬蟲 Get Started Free
常見問題
1. 什麼是網頁爬蟲?它和網頁抓取有什麼不同?
爬蟲負責發現並擷取頁面——它會追蹤連結、管理 URL 佇列、處理去重與深度限制。抓取器則負責從這些頁面中擷取特定結構化資料——它會解析 HTML、選取欄位並輸出記錄。現在很多工具都同時做兩件事,只是程度不同,而這兩個詞也常被混用;但在選工具時,這個差異很重要:有些工具(像 Playwright)很擅長渲染頁面,卻不提供完整的爬取基礎設施;另一些工具(像 Scrapy)提供完整的爬取流程,但需要外掛才能做 JavaScript 渲染。
2. 沒有程式基礎的人,哪個網頁爬蟲最適合?
Thunderbit、Octoparse 和 ParseHub 是一般資料擷取最好的無程式碼選擇。Thunderbit 用 AI 建議欄位,並以瀏覽器擴充功能形式運作;Octoparse 提供帶 Auto-detect 的視覺化流程編輯器;ParseHub 則擅長複雜多步驟流程。如果只做 SEO,Screaming Frog 的免費版可爬到 500 個 URL,完全不用寫程式。
3. 網頁爬蟲可以免費使用嗎?
有兩類。完全開源的工具(Scrapy、Crawlee、Crawl4AI、Playwright、Colly)沒有每頁費用,但你要自己架設基礎設施,並支付運算、頻寬與儲存成本。Freemium 工具(Octoparse、ParseHub、Thunderbit、Firecrawl、Screaming Frog)則提供免費方案,但在頁數、專案數、匯出或功能上都有不同限制。詳細內容請看上面的免費方案比較表。
4. 網頁爬蟲能處理大量 JavaScript 的網站嗎?
可以,但不是每一款都行。內建瀏覽器渲染的工具——像 Playwright、Crawlee(PlaywrightCrawler)、Octoparse、ParseHub、Crawl4AI 和 Thunderbit(透過 Browser Mode)——都能處理 JavaScript 載入的內容。Scrapy 和 Colly 則屬於 HTTP 優先,需要另外整合瀏覽器元件才能做 JS 渲染。Screaming Frog 只有付費版才支援 JavaScript 渲染。最保險的做法,是先查看目標頁面的原始 HTML,確認它真的需要瀏覽器。
5. 網頁爬取合法嗎?
沒有一個放諸四海皆準的「合法 / 不合法」答案。法律分析會依資料類型、存取方式、使用目的、網站條款、合約、智慧財產規則、GDPR 等隱私義務,以及適用司法管轄而不同。robots.txt 只是爬取控制訊號,不是法律授權;公開可見也不等於全然可用。若是涉及個人資料、受著作權保護的內容、登入後資料或商業再利用等情境,請諮詢合格的法律專業人士。


