Bạn gõ "scraper plugin" vào Google với kỳ vọng sẽ có ngay một nút trên thanh công cụ và một file bảng tính sau 5 phút. Nhưng thứ bạn nhận lại thường là hàng loạt API dành cho developer, đoạn mã mẫu, và trang báo giá đầy những cụm như "proxy rotation" hay "concurrent workers." Kẹt giữa hai thái cực đó, rất nhiều người dùng doanh nghiệp cuối cùng đành bỏ cuộc và tự copy-paste dữ liệu bằng tay.
Sự rối rắm này không phải ngẫu nhiên — mà là do vấn đề phân loại. Phần lớn các bài tổng hợp "best scraper" gom tiện ích mở rộng trình duyệt, ứng dụng desktop và API cloud vào cùng một danh sách, như thể cài một Chrome extension và tích hợp REST API là hai quyết định giống nhau. Thực tế thì không. Vì vậy, mình chia danh sách này theo kiểu cài đặt trước, rồi mới theo từng nhu cầu sử dụng, để bạn có thể biết chỉ trong khoảng 30 giây rằng mình cần plugin, ứng dụng hay chuyển việc cho developer.
Thế nào mới được xem là một scraper plugin thật sự? (Extensions vs. Desktop Apps vs. Cloud APIs)

Đây là một phép thử rất thực tế: công cụ có cài ngay trong trình duyệt của bạn và chạy trên chính trang bạn đang mở, mà không cần dựng trước một lớp tích hợp backend nào không? Nếu có, thì theo nghĩa thực tế nó đúng là một browser plugin. Nếu bạn phải tải về và mở một chương trình riêng, đó là desktop app. Nếu bạn đang viết code và gọi một endpoint, đó là cloud API — hữu ích, nhưng không phải plugin theo bất kỳ định nghĩa hợp lý nào.
| Phân loại | Chạy ở đâu | Cách điều khiển | Điểm mạnh | Hạn chế |
|---|---|---|---|---|
| Tiện ích mở rộng trình duyệt thật sự | Trong Chrome/Edge, ngay trên trang và phiên hiện tại | Thanh công cụ, sidebar, chọn và bấm | Ít cản trở nhất, hoạt động đúng trên thứ bạn đang nhìn thấy | Phụ thuộc vào tab đang mở; yếu hơn về lịch chạy/tính mở rộng |
| Ứng dụng desktop | Chương trình cài riêng với trình duyệt của nó | Trình dựng workflow trực quan | Kiểm soát điều hướng và dự án cục bộ tốt hơn | Tốn công cài đặt và thiết lập dự án |
| Nền tảng tự động hóa cloud | Dịch vụ lưu trữ sẵn, đôi khi có kèm extension | Template, robot, bộ lập lịch | Chạy lặp lại được, không cần mở laptop | Phức tạp về tài khoản/tín dụng |
| Cloud API/nền tảng | Hạ tầng của nhà cung cấp, được gọi từ code | HTTP request, SDK, CLI | Mở rộng tốt, lặp lại ổn định | Cần developer |
Sự phân biệt này rất quan trọng vì các công cụ lai đang làm nó mờ đi liên tục. Octoparse có kiểu template giống extension, nhưng cốt lõi vẫn là một ứng dụng desktop có thêm tầng cloud. PhantomBuster có browser extension, nhưng sản phẩm chính lại là nền tảng tự động hóa social trên cloud. Gọi mọi công cụ scraping có thành phần trình duyệt là "plugin" chính là kiểu nhập nhằng làm bạn rối ngay từ đầu.
Cách mình chọn ra các scraper plugin tốt nhất
Mình chấm từng công cụ theo 6 tiêu chí: độ ma sát khi cài đặt (extension thật, desktop hay API), thiết lập no-code hay phải viết code, khả năng xử lý JavaScript và anti-bot, nơi xuất dữ liệu, mức độ minh bạch về giá, và — điều mà nhiều bài đánh giá bỏ qua — gánh nặng bảo trì khi website thay đổi giao diện.
Tiêu chí cuối đáng nói hơn một chút. Mọi công cụ dựa trên selector trong danh sách này đều có ghi rõ trong trung tâm trợ giúp chính thức rằng chuyện gì xảy ra khi một trang web redesign: cột bị lệch, hàng trống, bản ghi trùng, hoặc lỗi âm thầm không báo gì. Trang xử lý sự cố của Octoparse liệt kê việc bỏ sót trang và vòng lặp vô hạn ở trang cuối là các lỗi bình thường. Mã lỗi của ParseHub có cả trường hợp "selected no elements" khi selector không còn khớp nữa. Đây không phải là điểm trừ riêng của các công cụ đó — nó chỉ phản ánh bản chất của việc bám vào các phần tử HTML cố định. Một công cụ đọc lại cấu trúc trang ở mỗi lần chạy sẽ xử lý khác với công cụ chỉ ghi nhớ đường dẫn CSS từ 6 tháng trước, và sự khác biệt đó ảnh hưởng trực tiếp đến công sức bảo trì sau này.
Tổng quan nhanh về các scraper plugin tốt nhất
| Công cụ | Phân loại | Phù hợp nhất cho | Thiết lập | Hỗ trợ JS/anti-bot | Xuất dữ liệu | Mô hình giá |
|---|---|---|---|---|---|---|
| Thunderbit | Browser extension gốc AI | Trích xuất một chạm, không cần selector | Bấm là chạy, không cần dựng schema trên các trang được hỗ trợ | Phân tích trang theo kiểu agent trên các trang tương thích/được phép | Excel, Google Sheets, Airtable, Notion, tải xuống | Tính theo credit (hãy kiểm tra thực tế) |
| Instant Data Scraper | Extension heuristic kiểu cũ | Scrape bảng/danh sách nhanh, miễn phí | Chọn và bấm, tự nhận diện bảng | Có tài liệu xử lý nội dung tải động và infinite scroll; không có proxy/CAPTCHA được quản lý | XLS/XLSX/CSV | Miễn phí |
| Web Scraper | Extension theo recipe | Scrape theo quy trình có cấu trúc, lặp lại được | Thiết lập sitemap/selector thủ công | Điều khiển JS/phân trang cục bộ; Cloud có thêm proxy và retry | CSV, XLSX cục bộ; JSON/API qua Cloud | Miễn phí bản local + Cloud trả phí |
| Octoparse | Ứng dụng desktop + tầng cloud | Người không biết code nhưng cần sức mạnh hơn trên trang động | Quy trình desktop kiểu template + point-and-click | Khá tốt nhờ Chrome/Phantom mode và cloud extraction | CSV, Excel, DB, API | Miễn phí + các gói subscription |
| ParseHub | Desktop point-and-click | Phân trang lồng nhau phức tạp | Cài ứng dụng desktop | Tốt với JS nhờ trình duyệt tích hợp; có snapshot server để debug | CSV, JSON, Google Sheets (qua script) | Miễn phí + gói trả phí |
| Browse AI | Robot cloud + giám sát | Theo dõi theo lịch và cảnh báo | Template robot (extension hiện đã ngừng dùng) | Tốt trên các tương tác đã ghi lại; có giới hạn tối thiểu với site cao cấp | CSV, JSON, S3, API, Sheets, Airtable | Tính theo credit/task |
| PhantomBuster | Tự động hóa cloud + extension đi kèm | Tự động hóa social/lead-gen được hỗ trợ | Các "Phantom" dựng sẵn | Chạy qua chính tài khoản đã đăng nhập của bạn | HubSpot đã xác minh; các kiểu export khác cần kiểm tra lại | Credit theo thời gian thực thi (giá chính thức không công khai đầy đủ) |
| Firecrawl | Context API trên cloud | Crawl quy mô lớn, nhiều JS | API/SDK/CLI, cần developer | Render trên cloud, smart wait, tôn trọng robots.txt cho FirecrawlAgent | Markdown, HTML, ảnh chụp màn hình, JSON | Tính theo credit (1 credit/trang cho Scrape/Crawl/Map/Monitor) |
| ScraperAPI | Proxy/scraping API trên cloud | Tránh chặn IP ở quy mô lớn | Cần API/code | Xoay proxy, xử lý CAPTCHA/browser, geotargeting | JSON (endpoint có cấu trúc); phản hồi thô cho API lõi | Tính theo mức sử dụng (không công khai giá chính xác) |
Nếu bạn đã biết rõ nhiệm vụ của mình là "đưa đúng cái bảng này vào Excel hôm nay," hãy nhảy thẳng tới Thunderbit hoặc Instant Data Scraper. Nếu nhiệm vụ là "developer của chúng tôi cần một cách ổn định để truy cập 10.000 URL mà không bị chặn," hãy đi thẳng tới Firecrawl hoặc ScraperAPI. Còn lại thì cứ đọc tiếp — vì phần giữa của danh sách này mới là nơi phần lớn nhu cầu kinh doanh thực sự rơi vào.
Tốt nhất cho trích xuất một chạm, không cần selector: Thunderbit

Thunderbit là một Chrome và Edge extension dùng AI, được thiết kế để người không rành kỹ thuật không bao giờ phải tự vẽ CSS selector. Bạn mở trang đích, bấm One Click Extract, và Thunderbit sẽ đọc, phân tích trang để hiểu nên trích xuất gì — sau đó hiện nút Run Now để bạn chạy ngay lập tức.
Đây là một quy trình thật sự khác với kiểu "AI Suggest Fields → review → Scrape" mà các bài review cũ về Thunderbit mô tả. Mặc định hiện tại gần với "một cú bấm là xong" hơn, và điều đó rất quan trọng nếu bạn tìm "scraper plugin" chính xác vì bạn không muốn phải cấu hình gì cả.
Tính năng nổi bật:
- Suy luận cột bằng AI, không cần dựng CSS selector thủ công, kèm tùy chỉnh trường bằng ngôn ngữ tự nhiên
- Mở rộng qua trang con / làm giàu sâu — tự đi theo link chi tiết của từng dòng và lấy thêm trường dữ liệu
- Xử lý phân trang, nhập hàng loạt URL, và infinite scroll trên các trang được hỗ trợ
- Chạy ở browser mode cho các trang bạn đã đăng nhập; chạy cloud cho các trang công khai
- Xuất ra Excel, CSV, Google Sheets, Airtable, Notion hoặc JSON
Giá tham khảo (hãy kiểm tra số hiện tại trên trang chính thức): gói miễn phí chạy 6 trang/tháng; Starter là 15 USD/tháng cho 500 credit; Pro là 38 USD/tháng cho 3.000 credit. Điều khoản của Thunderbit nói credit được tiêu theo từng dòng đầu ra, tức Starter vào khoảng 30 USD cho 1.000 dòng và Pro gần 12,67 USD cho 1.000 dòng — đây là phép tính theo hạn mức, không phải hóa đơn thực tế, nên hãy kiểm tra lại trang giá trước khi lập ngân sách.
Phù hợp nhất cho: người làm sales, ops hoặc marketing muốn có ngay một bảng tính từ một trang web mà không cần hiểu selector là gì.
Một hạn chế nói thật: giống như mọi extension trong danh sách này, Thunderbit chỉ hoạt động trên các trang tương thích và được phép. Nó không hứa vượt qua mọi CAPTCHA hay hệ thống anti-bot, và điều khoản của nó nêu rõ không được dùng để vượt cơ chế kiểm soát truy cập. Không có công cụ nào làm được điều đó một cách đáng tin cậy — ai nói ngược lại thì đang bán hàng.
Tùy chọn miễn phí tốt nhất cho một lần scrape nhanh một bảng: Instant Data Scraper

Instant Data Scraper là một Chrome extension miễn phí, dùng heuristic để tự phát hiện bảng hoặc danh sách có khả năng đúng nhất trên trang, rồi cho bạn xem trước, chỉnh nhẹ và xuất dữ liệu. Điều đáng biết là nhà phát hành hiện tại trên Chrome Web Store là Flavr Technology, không phải Web Robots — Web Robots là bên tạo ra nó nhưng nói rằng họ không còn sở hữu hay hỗ trợ nữa, nên hãy xem các hướng dẫn cũ từ domain đó như tài liệu tham khảo quy trình lịch sử, chứ không phải cam kết bảo mật hiện tại.
Điểm mạnh:
- Xuất CSV/Excel gần như tức thì cho các trang dạng danh bạ sạch và tĩnh
- Phát hiện nội dung tải động và infinite scroll, có thể điều chỉnh độ trễ crawl
- Không tốn công cài đặt — đúng là miễn phí, không cần tài khoản
Điểm chưa có: không có lịch chạy được tài liệu hóa, không có API, không xuất JSON, và cũng không có xử lý CAPTCHA được quản lý. Và có một điều bạn thật sự nên để ý — chính sách quyền riêng tư của nhà phát hành hiện tại (cập nhật lần cuối vào tháng 7/2026) cho biết họ thu thập cả hoạt động duyệt web, tìm kiếm và thương mại điện tử rộng hơn nhiều so với lời quảng bá "dữ liệu của bạn ở lại máy". Điều đó không có nghĩa là các dòng dữ liệu bạn scrape sẽ rời khỏi trình duyệt, nhưng có nghĩa đây không phải công cụ mình sẽ mặc định dùng cho một phiên đăng nhập nhạy cảm.
Phù hợp nhất cho: lấy dữ liệu một lần từ trang danh sách công khai, sạch, khi bạn muốn không ma sát và không tốn tiền.
Tốt nhất cho các recipe scrape có thể lặp lại: Web Scraper

Web Scraper tách khá rõ thành hai sản phẩm: một extension local miễn phí, không giới hạn, dùng sitemap selector theo kiểu point-and-click; và một gói Web Scraper Cloud trả phí, có thêm lập lịch, API, webhook và anti-blocking được quản lý.
Mô hình sitemap đòi hỏi nhiều bước hơn Thunderbit hay Instant Data Scraper — bạn phải tự định nghĩa điều hướng và các selector dữ liệu — nhưng đổi lại, công sức ban đầu đó mang về một thứ mà các công cụ heuristic không có: một recipe được tài liệu hóa, tái sử dụng được và chạy giống nhau mỗi lần (miễn là site không đổi). Tài liệu của Web Scraper cũng khá thẳng thắn về sự đánh đổi này, lưu ý rằng chọn tự động kiểu point-and-click "không phải lúc nào cũng đủ" và các selector được đánh dấu "multiple" cần một wrapper element rõ ràng, nếu không hàng dữ liệu sẽ bị lệch.
- Local: miễn phí, không giới hạn, xuất CSV/XLSX, không cần tài khoản
- Cloud: lập lịch (hàng ngày/theo khoảng thời gian/CRON), API, xuất JSON, proxy và các tính năng xử lý CAPTCHA
- Giá Cloud bắt đầu từ 50 USD/tháng (thanh toán năm) cho 5.000 URL credit — lưu ý đây là credit cho mỗi trang được tải, không phải mỗi dòng, nên chi phí trên mỗi dòng sẽ thay đổi theo số bản ghi trên từng trang
Phù hợp nhất cho: đội nhóm cần cùng một bài scrape nhiều trang chạy y hệt nhau qua từng tuần, và sẵn sàng bỏ thời gian thiết lập ban đầu để đổi lấy sự ổn định.
Bước nâng cấp no-code tốt nhất cho trang động: Octoparse

Octoparse phù hợp nhất để mô tả là một ứng dụng desktop có thêm tầng thực thi trên cloud — không có bản web, và cũng không chạy trên Linux hay Chromebook. Điểm mạnh so với browser extension là nó có Chrome Mode điều khiển trực tiếp trình Chrome đã cài, hữu ích cho các site nặng CAPTCHA/Cloudflare; có Phantom Mode để chạy local dạng headless; và có tầng cloud extraction thật sự cho các job cần sống sót ngay cả khi bạn đóng laptop.
- Phát hiện AJAX với timeout chờ có thể cấu hình cho nội dung động
- Xử lý phân trang rõ ràng cho nút Next, Load More và infinite scroll
- Xuất Excel, CSV, JSON, XML, Google Sheets, SQL databases hoặc cloud storage ở các gói trả phí
Phần giá là nơi bạn phải kiểm tra kỹ trước khi quyết định: trang giá live (tại thời điểm viết bài) hiển thị Standard "từ 69 USD/tháng" và Professional khoảng 199 USD, nhưng trang so sánh trong trung tâm trợ giúp của Octoparse lại nêu con số khác với thẻ giá trên trang chính. Hãy xác nhận công tắc thanh toán và ưu đãi hiện tại trước khi lập ngân sách.
Phù hợp nhất cho: người dùng đã vượt khỏi mức của một extension đơn giản và cần kiểm soát workflow trực quan trên các trang động thật sự, nhưng không muốn viết code.
Tốt nhất cho phân trang lồng nhau phức tạp: ParseHub

ParseHub là một ứng dụng desktop — không phải browser plugin — với giao diện point-and-click chạy trên trình duyệt tích hợp. Điểm khác biệt lớn của nó là hệ thống lệnh: Select, Relative Select, Click, và đặc biệt là lệnh Jump rất thông minh, có thể quay ngược đệ quy về một lựa chọn cha; tài liệu của ParseHub còn khuyến nghị riêng lệnh này cho các chuỗi bình luận lồng sâu.
Đó là một câu trả lời thực sự cho bài toán "phân trang lồng nhau phức tạp" — phần lớn công cụ trong danh sách này không có gì tương đương với Jump. Đổi lại là độ phức tạp khi thiết lập: hướng dẫn phân cấp của ParseHub thậm chí cảnh báo rằng đặt click sang trang kế tiếp dưới sai parent có thể khiến scraper cứ scrape lại trang hai mãi.
Một điểm cần lưu ý: các lần test chạy bằng IP local của bạn, nhưng các lần chạy "bình thường" (production) sẽ upload project và thực thi trên server của ParseHub với IP khác — nghĩa là một project chạy hoàn hảo lúc test có thể cho kết quả khác, hoặc bị chặn, khi chạy thật. ParseHub đã tạo tính năng "Server Snapshot" để gỡ rối chính xác khoảng lệch này.
Phù hợp nhất cho: phân trang nhiều cấp, lồng sâu (ví dụ: chuỗi bình luận, cây danh mục) nơi các công cụ point-and-click đơn giản bị đuối.
Tốt nhất cho giám sát định kỳ và cảnh báo: Browse AI

Browse AI đã âm thầm trở thành một nền tảng giám sát ưu tiên cloud hơn là browser extension — trung tâm trợ giúp của họ, cập nhật tháng 3/2026, nói rõ rằng extension Chrome đã bị thay thế bằng "Robot Studio." (Trang FAQ về giá của chính họ vẫn bảo người dùng mới cài extension, kiểu mâu thuẫn nội bộ thường xuất hiện khi một sản phẩm đổi hướng nhanh hơn nội dung marketing kịp theo.)
Điểm mạnh: bất kỳ "robot" nào đã ghi lại đều có thể được lên lịch theo giờ, theo ngày, theo tuần hoặc theo khoảng tùy chỉnh, kèm lịch sử thay đổi, email alert và tích hợp webhook. Hệ credit của họ khá chi tiết — 10 dòng danh sách tương đương 1 credit, mỗi task tối thiểu 1 credit, và các "premium sites" (bảo mật cao hơn, động hơn) sẽ tốn tối thiểu 2–10 credit cho mỗi task.
Phù hợp nhất cho: theo dõi giá lặp lại, giám sát đối thủ, hoặc workflow kiểu "báo cho tôi khi cái này thay đổi" — khi mục tiêu không phải xuất dữ liệu một lần mà là theo dõi lâu dài.
Tốt nhất cho tự động hóa social và lead-gen: PhantomBuster

PhantomBuster là một nền tảng tự động hóa cloud có extension trình duyệt đi kèm, được xây quanh các "Phantom" dựng sẵn cho các việc như tìm lead trên LinkedIn, enrich dữ liệu và outreach. FAQ của nhà cung cấp có một điểm đáng nhắc lại nguyên văn: nó tự động hóa qua chính tài khoản của bạn và không truy cập dữ liệu mà bạn vốn không thể nhìn thấy.
Đó là một nguyên tắc thiết kế hợp lý, nhưng nó không trả lời được câu hỏi khó hơn — tần suất hoặc loại hành động tự động hóa có vi phạm điều khoản của nền tảng đích hay không? Việc chỉ đọc dữ liệu và các hành động trên tài khoản (gửi lời mời kết nối, tin nhắn, lượt thích) mang mức rủi ro rất khác nhau, và homepage của PhantomBuster còn công khai quảng bá cả hai. Hãy xem câu "chạy qua tài khoản của bạn" như điểm khởi đầu để thẩm định, chứ không phải một bảo đảm an toàn.
Phù hợp nhất cho: đội sales chạy các workflow LinkedIn hoặc social lead-gen đã được hỗ trợ — không phải thay thế cho một trình scrape trang tổng quát.
Phương án cloud thay thế tốt nhất cho crawl lớn, nặng JS: Firecrawl

Firecrawl tự mô tả mình là một "context API để tìm kiếm, scrape và tương tác với web ở quy mô lớn," và đây là mô tả khá chính xác — không phải plugin, mà là hạ tầng cho developer với SDK cho Python, Node.js, Go, Rust, Java và Elixir, kèm một MCP server chính thức cho AI agents.
Đây là công cụ bạn tìm đến khi browser extension đã thật sự không còn đủ sức: laptop của bạn không thể mở suốt cho một crawl 10.000 trang, hoặc bạn cần đầu ra Markdown/JSON sạch cho pipeline LLM thay vì CSV. Endpoint Crawl của Firecrawl tôn trọng các rule robots.txt được viết cho directive FirecrawlAgent — một tín hiệu quản trị nhỏ nhưng rất cụ thể, đáng chú ý vì phần lớn đối thủ không công bố điều này.
Thanh toán dựa trên credit: Scrape, Crawl, Map và Monitor mất 1 credit mỗi trang; Search mất 2 credit cho mỗi 10 kết quả; Interact (các thao tác browser nhiều bước) mất 2 credit mỗi phút trình duyệt. Gói miễn phí bao gồm 1.000 credit/tháng. Giá USD trả phí chưa được xác nhận tại thời điểm nghiên cứu — hãy kiểm tra trang giá hiện tại.
Phù hợp nhất cho: developer xây dựng một crawl định kỳ hoặc đưa nội dung web có cấu trúc vào pipeline AI/RAG.
Phương án cloud thay thế tốt nhất để tránh chặn IP ở quy mô lớn: ScraperAPI

ScraperAPI được mô tả rõ là một "web scraping API để thu thập dữ liệu từ các website công khai" — không browser, không desktop app, chỉ là một endpoint xử lý xoay proxy, giải CAPTCHA và render trình duyệt phía sau scraper mà bạn đã xây từ trước. Công ty quảng bá một pool hơn 40 triệu proxy trên 50+ quốc gia, cùng các endpoint có cấu trúc cho mục tiêu cụ thể như Amazon và Google Search, trả về JSON đã parse sẵn thay vì HTML thô.
Đây là công cụ phù hợp khi vấn đề của bạn không phải "mình không biết parse trang này" — mà là "mình parse được rồi, nhưng cứ bị chặn IP hoặc CAPTCHA." Đó là một định vị hẹp hơn và trung thực hơn kiểu "mọi website," và mình khuyên nên giữ cách hiểu hẹp đó: homepage của ScraperAPI cũng tự giới hạn ở website công khai, không phải nội dung cần đăng nhập.
Tại thời điểm nghiên cứu, các gói giá chi tiết hiện tại chưa được xác nhận công khai — nhà cung cấp không công bố mức phí granular theo request trên các trang marketing chính, nên hãy xin báo giá hoặc kiểm tra trang giá live trước khi quyết định.
Phù hợp nhất cho: đội đã có scraper riêng nhưng nút thắt thực sự là chặn IP, không phải logic trích xuất.
Vì sao scraper plugin bị lỗi hoặc bị chặn?

Dữ liệu trống và dữ liệu "bị chặn" nhìn với người dùng thì giống hệt nhau, nhưng đó là hai vấn đề khác nhau và cần cách xử lý khác nhau.
| Loại lỗi | Điều gì đang xảy ra | Nên kiểm tra đầu tiên |
|---|---|---|
| Lệch DOM/selector | Website đổi giao diện làm trường dữ liệu đổi chỗ | Chạy nhận diện lại, cập nhật recipe |
| Timing của JS | Nội dung tải sau một API call hoặc thao tác nào đó | Thêm thời gian chờ, kiểm tra trạng thái đã render |
| Infinite scroll/danh sách ảo | Mỗi lần DOM chỉ chứa các hàng đang nhìn thấy | Test hành vi cuộn, kiểm tra khử trùng lặp |
| State phân trang/điều hướng | Logic sang trang sau không được theo đúng | Xác minh phạm vi vòng lặp và điều kiện dừng |
| Chặn bởi đăng nhập/session | Nội dung phụ thuộc cookie hoặc token | Xác nhận quyền truy cập và phạm vi session |
| Giới hạn tốc độ/chặn IP | Mẫu request kích hoạt throttling hoặc CAPTCHA | Giảm tốc độ, kiểm tra chính sách của site |
Các công cụ dựa trên selector (như cơ chế heuristic của Instant Data Scraper, sitemap cố định của Web Scraper) dễ gặp lớp lỗi đầu tiên nhất, vì chúng ghi nhớ cấu trúc thay vì đọc lại nó. Các công cụ có tính agent như Thunderbit sẽ phân tích lại trang ở mỗi lần chạy, điều này có thể giảm — nhưng không loại bỏ hoàn toàn — lỗi do selector bị lệch. Nó sẽ không giúp bạn qua rate limit, CAPTCHA hay tường đăng nhập, và không có nhà cung cấp nào trong danh sách này, kể cả Thunderbit, tuyên bố có thể làm vậy một cách đáng tin. Khi giới hạn tốc độ/chặn IP hoặc render JS nặng trở thành nút thắt lặp đi lặp lại thay vì phiền toái thỉnh thoảng mới gặp, đó là tín hiệu để chuyển sang phương án cloud thay thế như Firecrawl hoặc ScraperAPI, hoặc một chế độ cloud extraction như gói trả phí của Octoparse.
So sánh chi phí thực: các scraper plugin này tốn bao nhiêu cho mỗi 1.000 dòng?
Vấn đề khi so giá các công cụ này chỉ bằng một con số là: họ không tính cùng một đơn vị. Thunderbit tính theo mỗi dòng đầu ra. Web Scraper Cloud tính theo mỗi URL được tải (có thể ra 0 hoặc 1.000 dòng). Firecrawl tính theo mỗi trang cho Scrape/Crawl/Map/Monitor. Browse AI tính theo mỗi 10 dòng, với mức tối thiểu 1 credit/task có thể lấn át các job nhỏ. PhantomBuster và ScraperAPI không công khai đủ mức chi tiết để tính chính xác giá trên từng đơn vị.
| Công cụ | Đơn vị đã xác minh | Chi phí chuẩn hóa xấp xỉ | Điểm cần lưu ý |
|---|---|---|---|
| Thunderbit | Credit cho mỗi dòng đầu ra | ~30 USD/1K dòng (Starter), ~12,67 USD/1K (Pro) | Tác vụ agent có thể tiêu credit biến đổi |
| Instant Data Scraper | Miễn phí | 0 USD/1K dòng | Không tính thời gian dọn dữ liệu, không có scheduler |
| Web Scraper (Cloud) | Credit cho mỗi URL được tải | 10 USD/1K URL (Project), 5 USD/1K URL (Professional) | Số dòng trên mỗi URL thay đổi rất lớn |
| Browse AI | 10 dòng = 1 credit, tối thiểu 1 credit/task | ~1,90–20,90 USD/1K tùy mức dùng trang chi tiết | Trang chi tiết và premium site làm chi phí thực tăng mạnh |
| Firecrawl | 1 credit mỗi trang | Gói miễn phí bao gồm 1.000 trang/tháng | Trang ≠ dòng; giá USD trả phí chưa công khai tại thời điểm nghiên cứu |
| Octoparse, ParseHub, PhantomBuster, ScraperAPI | Khác nhau / không công khai đầy đủ | Không thể tính đáng tin cậy | Kiểm tra tài liệu thanh toán hiện tại trước khi lập ngân sách |
Đừng tin bất kỳ tuyên bố kiểu "$X cho 1.000 dòng" nào — kể cả của mình ở trên — nếu chưa kiểm tra trang giá live của công cụ và tính toán dựa trên mật độ dòng thực tế của bạn. Một công cụ tính credit theo trang nhìn thì rẻ cho đến khi một trang chỉ ra 10 dòng thay vì 100.
Chọn scraper plugin nào cho nhu cầu nào?
| Nhu cầu | Bắt đầu từ đây | Vì sao |
|---|---|---|
| Một trang, thiết lập tối thiểu, không code | Thunderbit | Một chạm, trường dữ liệu do AI suy luận |
| Miễn phí, dùng một lần, bảng tĩnh sạch | Instant Data Scraper | Không tốn tiền, không cần thiết lập |
| Recipe lặp lại hàng tuần | Web Scraper | Kiểm soát selector rõ ràng, có thể version hóa |
| Trang động, cần điều khiển kiểu desktop | Octoparse | Chrome/Phantom mode kèm tầng cloud |
| Phân trang lồng nhau sâu | ParseHub | Lệnh Jump được thiết kế riêng |
| Giám sát theo lịch + cảnh báo | Browse AI | Robot + lịch cloud, lịch sử thay đổi |
| Workflow social/lead-gen được hỗ trợ | PhantomBuster | Tự động hóa dựng sẵn, chạy qua tài khoản |
| Crawl lặp lại quy mô lớn, nặng JS cho AI/RAG | Firecrawl | Đầu ra Markdown/JSON, SDK, MCP |
| Scraper hiện có cứ bị chặn IP | ScraperAPI | Lớp proxy/CAPTCHA được quản lý |
Hãy chọn công cụ theo mô hình vận hành nhỏ nhất mà thực sự giải quyết được vấn đề của bạn. Đừng nhận luôn một API dành cho developer chỉ vì nó nghe có vẻ mạnh hơn — và cũng đừng giữ một tab trình duyệt mở vô thời hạn cho một việc lẽ ra nên chạy theo lịch ở đâu đó.
Dùng scraper plugin có hợp pháp không? Lưu ý nhanh về điều khoản và quyền riêng tư

Mình không phải luật sư, và đây không phải tư vấn pháp lý — nhưng đây là phiên bản thực tế hơn. Hãy chỉ làm việc với dữ liệu công khai hoặc dữ liệu mà bạn được phép truy cập rõ ràng. Kiểm tra điều khoản sử dụng và robots.txt của site trước khi scrape lặp đi lặp lại. Và cẩn thận hơn với các công cụ chạy trong session đã đăng nhập — browser mode của Thunderbit, cấu hình trạng thái đăng nhập của Web Scraper, và tự động hóa theo tài khoản của PhantomBuster đều thuộc nhóm này.
Có thể vượt qua một rào cản kỹ thuật (một CAPTCHA, một tường đăng nhập) không đồng nghĩa với việc bạn có quyền làm vậy. FAQ của PhantomBuster nói rằng nó chỉ truy cập dữ liệu mà bạn vốn đã có thể nhìn thấy qua tài khoản của mình — đó là một nguyên tắc thiết kế hợp lý, nhưng không cho bạn quyền tái xuất bản, bán lại hay liên hệ hàng loạt với người khác chỉ vì về mặt kỹ thuật bạn xem được profile của họ. Hãy giảm thiểu dữ liệu cá nhân thu thập, có mục đích sử dụng rõ ràng, và đừng giữ dữ liệu lâu hơn mức cần thiết.
Không công cụ nào trong danh sách này — kể cả những công cụ dùng ngôn ngữ "compliant" trên trang giá của họ — có thể tự động khiến trường hợp sử dụng cụ thể của bạn trở nên hợp pháp. Điều đó phụ thuộc vào site đích, loại dữ liệu bạn thu thập và cách bạn dùng dữ liệu sau đó.
Kết luận: Nên dùng scraper plugin nào?
Nếu hôm nay bạn cần một bảng tính sạch và không muốn nghĩ về selector, hãy cài một browser extension thật sự — Thunderbit nếu bạn muốn các trường do AI suy luận và xuất sang công cụ doanh nghiệp, Instant Data Scraper nếu trang sạch và bạn muốn miễn phí hoàn toàn. Nếu bạn chạy cùng một quy trình scrape mỗi tuần, mô hình recipe của Web Scraper hoặc workflow desktop của Octoparse sẽ mang lại tính lặp lại, đổi lại là thời gian thiết lập ban đầu. Nếu vấn đề của bạn thật sự là phân trang lồng nhau, cây lệnh của ParseHub được sinh ra cho việc đó. Nếu mục tiêu là "theo dõi và báo cho tôi," chọn Browse AI. Và nếu bạn đã vượt xa mọi thứ ở trên — hàng nghìn URL, site nặng JS, hoặc vấn đề IP-block lặp lại — hãy giao việc cho developer và hướng họ tới Firecrawl hoặc ScraperAPI tương ứng.
Plugin là công cụ phù hợp cho các tác vụ tự phục vụ, xem xét riêng lẻ, làm một lần. API là công cụ phù hợp cho pipeline không cần giám sát, quy mô lớn, do developer sở hữu. Đừng nhầm lẫn hai thứ chỉ vì cả hai đều có chữ "scraper" trong tên.
Câu hỏi thường gặp
Scraper plugin/extension có an toàn khi dùng trên website đã đăng nhập không? Chỉ khi bạn được phép truy cập dữ liệu đó và đã xem kỹ công cụ làm gì với session của bạn. Quyền trình duyệt rộng là chuyện bình thường vì scraper cần đọc các trang bất kỳ — điều đó không tự động có nghĩa là dữ liệu của bạn rời khỏi trình duyệt, nhưng có nghĩa là bạn nên kiểm tra chính sách quyền riêng tư của từng công cụ thay vì mặc định. Hãy tách các hành động sửa đổi tài khoản (như tính năng nhắn tin của PhantomBuster) khỏi việc chỉ trích xuất dữ liệu đọc-được trong cách bạn đánh giá rủi ro.
Khác nhau giữa scraper plugin và scraper API là gì? Plugin chạy ngay trong trình duyệt của bạn trên trang đang mở — không code, thiết lập tối thiểu, gắn với session hiện tại. API chạy trên hạ tầng (của bạn hoặc của nhà cung cấp) và trả dữ liệu theo cách có thể dùng trong pipeline. Các ứng dụng desktop như ParseHub và Octoparse nằm ở giữa: cần thiết lập nhiều hơn plugin, nhưng điều khiển trực quan hơn API thuần.
Vì sao scraper plugin của tôi đột nhiên trả về dữ liệu trống hoặc bị lỗi? Thường là một trong vài nguyên nhân: giao diện site thay đổi khiến selector không còn khớp, nội dung tải bằng JavaScript sau khi công cụ đã kiểm tra xong, logic phân trang không xử lý đúng một kiểu trang mới, hoặc cookie đăng nhập đã hết hạn. Các công cụ đọc lại cấu trúc trang ở mỗi lần chạy (như cách tiếp cận kiểu agent của Thunderbit) có thể giảm lỗi do lệch selector, nhưng không công cụ nào trong danh sách này loại bỏ được rate limit hay CAPTCHA.
Tôi có thể dùng scraper plugin miễn phí cho việc scrape định kỳ, theo lịch không? Không ổn định. Các công cụ miễn phí như Instant Data Scraper và extension local của Web Scraper không có scheduler được tài liệu hóa — chúng chỉ chạy khi trình duyệt đang mở và bạn bấm nút. Nếu bạn cần chạy định kỳ mà không cần giám sát thật sự, bạn sẽ phải dùng gói trả phí: scheduled scrapers của Thunderbit, Web Scraper Cloud, cloud extraction của Octoparse, hoặc sản phẩm monitor của Browse AI.
Tìm hiểu thêm


