Thunderbit là một tiện ích mở rộng AI Web Scraper trên Chrome, giúp người dùng doanh nghiệp trích xuất dữ liệu từ website bằng AI. Mấu chốt ở đây là: những gì nhìn qua có vẻ “rẻ” trên trang giá của ScrapingBee có thể đổi khác hoàn toàn khi bạn chạy khối lượng việc thực tế và thấy credit bay đi theo hệ số 5× đến 75× so với mức cơ bản. Bài đánh giá này sẽ đi qua 5 góc nhìn mà đa số bài viết hay bỏ qua: chi phí thật sự khi chạy ở quy mô lớn, trích xuất dựa trên selector so với AI, mức độ dễ dùng cho người không biết lập trình, quy trình xử lý dữ liệu sau khi scrape, và các tiêu chuẩn độ ổn định năm 2026. Nếu bạn đang cân nhắc ScrapingBee cho đội nhóm của mình — dù bạn là developer, lead sales ops hay founder — thì đây là bản phân tích bạn cần.
ScrapingBee là gì? Tổng quan nhanh

ScrapingBee là một API web scraping lo việc xoay proxy, render JavaScript và giải CAPTCHA để developer có thể lấy dữ liệu từ website mà không phải tự dựng hạ tầng scrape. Bạn chỉ cần gửi một HTTP request kèm tham số, rồi nhận lại HTML (hoặc JSON với một số endpoint nhất định). Tool này không có giao diện trực quan hay kiểu bấm chọn để dựng tác vụ scrape.
Các tính năng cốt lõi gồm:
- Proxy xoay vòng và proxy cao cấp (classic, premium, stealth, residential)
- Render trình duyệt headless (Chrome đầy đủ, bật mặc định)
- Tự động vượt CAPTCHA
- Google Search API (JSON có cấu trúc: kết quả tự nhiên, quảng cáo, bản đồ, knowledge graph, People Also Ask, hình ảnh, tin tức)
- Chụp ảnh màn hình (thường, toàn trang hoặc chỉ định bằng CSS selector)
- Nhắm mục tiêu theo địa lý qua tham số country_code
- Quy tắc trích xuất CSS/XPath (dạng JSON khai báo, trả về JSON có cấu trúc)
- API chuyên dụng cho Amazon, Walmart, YouTube và ChatGPT scraping
- AI extraction (thêm khoảng 2024–2025): các tham số ai_query, ai_extract_rules, ai_selector (+5 credit cho mỗi request)
- Công cụ CLI (ra mắt khoảng 2025–2026): xử lý hàng loạt, crawl, phân tích sitemap, làm giàu CSV, cron job theo lịch, nâng cấp proxy
Thành lập năm 2019 tại Pháp, đến đầu 2026 ScrapingBee đã lớn lên khoảng $5 triệu ARR với hơn 2.500 khách hàng (SAP, Zapier, Deloitte, Zillow) — tất cả đều bootstrap với đội ngũ chỉ 4–6 người. Tháng 6/2025, Oxylabs Group mua lại ScrapingBee trong một thương vụ tám chữ số. Thương hiệu và ban lãnh đạo vẫn độc lập, và đội hỗ trợ đã tăng hơn gấp đôi để phục vụ tốt hơn theo múi giờ.
Một lưu ý quan trọng: ScrapingBee vẫn chưa có trình dựng trực quan gốc, giao diện point-and-click, hay bộ lập lịch tích hợp trong dashboard web. Việc lên lịch chạy phải dùng CLI, cron job hoặc tự động hóa bên thứ ba (Zapier, Make, n8n). Các hướng dẫn "no-code" họ đăng thực ra là về việc dùng tích hợp Make và Zapier — chứ không phải giao diện no-code nguyên bản.
ScrapingBee thực sự dành cho ai?
ScrapingBee được thiết kế cho developer quen viết Python hoặc cURL, đọc HTML và tự dựng CSS/XPath selector. Tài liệu của họ thiên về code, nghiêng mạnh về ví dụ Python và cURL. Một người đánh giá trên Capterra nhận xét rằng họ "không cung cấp ví dụ bằng JavaScript", và người khác mô tả tài liệu là "cồng kềnh, mất từ một ngày đến một tuần mới đọc xong."
Nhưng nhóm người tìm kiếm "ScrapingBee review" năm 2026 rộng hơn backend engineer. Họ gồm quản lý marketing xây danh sách lead, nhóm sales ops làm giàu dữ liệu CRM, đội ecommerce theo dõi giá đối thủ, và founder đánh giá công cụ cho đội của mình. Ở mỗi phần dưới đây, tôi sẽ chỉ ra liệu tính năng hay hạn chế đó ảnh hưởng đến developer, người dùng doanh nghiệp hay cả hai.
Bảng giá ScrapingBee nhìn qua

Đây là các gói hiện tại của ScrapingBee (tính đến tháng 4/2026):
| Gói | Giá hàng tháng | API Credits/tháng | Số request đồng thời |
|---|---|---|---|
| Freelance | $49 | 250,000 | 10 |
| Startup | $99 | 1,000,000 | 50 |
| Business | $249 | 3,000,000 | 100 |
| Business+ | $599 | 8,000,000 | 200 |
| Enterprise | Liên hệ sales | 41M+ | Tùy chỉnh |
Thanh toán theo năm được giảm 17%. Bản dùng thử miễn phí cung cấp 1.000 API credit, không cần thẻ tín dụng. Google Search API gần đây đã được giảm từ 25 xuống 15 credit cho mỗi lần gọi sau khi mua lại.
Những con số credit trông thì khá hào phóng. Nhưng thực tế không hề đơn giản như vậy.
Bảng nhân hệ số credit
Đây là lúc giá của ScrapingBee trở nên rắc rối. Số credit hiển thị không phải là số trang bạn có thể scrape — nó còn phụ thuộc vào tính năng bạn bật cho mỗi request:
| Loại request | Credit mỗi request |
|---|---|
Proxy classic, không render JS (render_js=false) | 1 credit |
| Proxy classic, render JS (mặc định) | 5 credits |
| Proxy premium, không render JS | 10 credits |
| Proxy premium, render JS | 25 credits |
| Proxy stealth (luôn bật JS) | 75 credits |
| Add-on AI extraction | +5 credits thêm vào |
Chi tiết cực kỳ quan trọng: JavaScript rendering được bật mặc định. Nếu bạn không chủ động đặt render_js=false, mỗi request sẽ tốn ít nhất 5 credit. Nghĩa là gói Freelance với 250.000 credit thực ra chỉ tương đương 50.000 request mặc định — chứ không phải 250.000.
Phép tính credit ẩn mà ít ai cho bạn xem
Đây là chi phí thực tế của ScrapingBee cho 10.000 trang ở các kịch bản và gói khác nhau:
| Kịch bản | Credit cần | Freelance ($49/250K) | Startup ($99/1M) | Business ($249/3M) |
|---|---|---|---|---|
| 10K trang (HTML tĩnh, 1 cr) | 10,000 | ✅ Đủ ($0.20/1K) | ✅ Đủ ($0.10/1K) | ✅ Đủ ($0.08/1K) |
| 10K trang (render JS, 5 cr) | 50,000 | ✅ Đủ ($0.98/1K) | ✅ Đủ ($0.50/1K) | ✅ Đủ ($0.42/1K) |
| 10K trang (proxy premium + JS, 25 cr) | 250,000 | ⚠️ Vừa chạm giới hạn ($4.90/1K) | ✅ Đủ ($2.48/1K) | ✅ Đủ ($2.08/1K) |
| 10K trang (proxy stealth, 75 cr) | 750,000 | ❌ Vượt xa giới hạn | ✅ Vừa đủ ($7.43/1K) | ✅ Đủ ($6.23/1K) |
Cùng 10.000 trang nhưng chi phí có thể dao động từ $0.20 đến $7.43 cho mỗi nghìn trang tùy cấu hình proxy và rendering. Và bạn không phải lúc nào cũng biết trước cấu hình nào cần dùng cho đến khi thử thực tế.
Kịch bản ngân sách: tạo lead ở mức 10.000 trang/tháng
Một đội sales scrape 10.000 trang công ty mỗi tháng để tìm lead. Phần lớn website B2B hiện đại dùng React hoặc Vue, nên phải bật JS rendering:
- Credit cần: 50.000 (10K × 5 credit)
- Gói Freelance ($49): Đủ dùng, còn dư 200K credit
- Nhưng nếu các target cần proxy premium: 250.000 credit — đúng bằng hạn mức của một gói Freelance, không có dư địa
- Nếu cần proxy stealth: 750.000 credit — phải dùng gói Startup ở mức $99/tháng
Kịch bản ngân sách: theo dõi giá ecommerce ở mức 100.000 trang/tháng
Một đội ecommerce theo dõi 100.000 trang sản phẩm trên website đối thủ:
| Cấu hình | Credit cần | Gói cần dùng | Chi phí hàng tháng |
|---|---|---|---|
| HTML tĩnh (1 cr) | 100,000 | Freelance | $49 |
| Render JS (5 cr) | 500,000 | Startup | $99 |
| Proxy premium + JS (25 cr) | 2,500,000 | Business | $249 |
| Proxy stealth (75 cr) | 7,500,000 | Business+ | $599 |
Cùng một việc nhưng mức phí từ $49 đến $599/tháng. Đây không phải sai số nhỏ — mà là chênh lệch chi phí gấp 12 lần chỉ vì khác cấu hình.
"Mức giá khởi điểm $49 là con số gây hiểu lầm nhất trong thị trường API scraping." — Prospeo
"Credit bị tiêu rất nhanh khi dùng JavaScript rendering hoặc các tính năng nâng cao, khiến việc biện minh chi phí trở nên khó hơn với các dự án nhỏ hoặc đội nhóm có khối lượng scrape khó đoán." — Nick S, Manager, Computer Software, Capterra
Và credit chưa dùng không được cộng dồn sang tháng sau.
Chi phí của ScrapingBee so với đối thủ

Dùng gói tầm trung để so sánh công bằng:
| Kịch bản (mỗi 1K trang) | ScrapingBee ($99/1M) | ScraperAPI ($149/1M) | Scrapfly ($100/1M) |
|---|---|---|---|
| HTML tĩnh | $0.10 | $0.15 | $0.10 |
| Trang render JS | $0.50 | $1.64 | $0.60 |
| Premium + JS | $2.48 | $3.73 | $3.00 |
| Stealth/ultra premium + JS | $7.43 | $11.18 | N/A |
ScrapingBee nhìn chung rẻ nhất hoặc ngang rẻ nhất ở các trang HTML tĩnh và trang render JS. ScraperAPI thường là đắt nhất — chi phí render JS của họ là +10 credit so với +5 của ScrapingBee và Scrapfly. Nhưng một bài test độc lập của Scrape.do lại cho thấy bức tranh khác khi đưa độ phức tạp thực tế của website vào tính toán:
| Dịch vụ | Chi phí trung bình / 1K request | Tỷ lệ thành công | Thời gian phản hồi trung bình |
|---|---|---|---|
| Scrape.do | $0.80 | 98.19% | 4.7s |
| ScrapingBee | $3.90 | 92.69% | 11.7s |
| Scrapfly | $4.11 | — | — |
| ZenRows | $4.48 | 92.64% | 10.0s |
| ScraperAPI | $8.49 | 92.70% | 15.7s |
Mô hình credit của Thunderbit: cách tiếp cận khác hẳn
Thunderbit dùng mô hình giá đơn giản hơn rất nhiều: 1 credit = 1 dòng đầu ra, không có hệ số nhân cho JS rendering, loại proxy hay domain đích. Scrape subpage tốn 2 credit cho mỗi dòng.
| Gói | Giá hàng tháng | Credit | Chi phí mỗi dòng |
|---|---|---|---|
| Free | $0 | 6 trang/tháng | Miễn phí |
| Starter | $15 | 500 | $0.030 |
| Pro 1 | $38 | 3,000 | $0.013 |
| Pro 2 | $75 | 6,000 | $0.013 |
| Pro 3 | $125 | 10,000 | $0.013 |
| Pro 4 | $249 | 20,000 | $0.012 |
Một người dùng Thunderbit scrape 10.000 listing sản phẩm từ các website ecommerce nặng JS sẽ trả $125/tháng bất kể website có cần render JavaScript, proxy cao cấp hay vượt anti-bot hay không. Với ScrapingBee, cùng công việc đó có thể tốn từ $49 đến $599 tùy cấu hình. Khả năng dự đoán ngân sách là thứ rất thực tế.
CSS selector so với AI extraction: chi phí bảo trì bạn nên biết
Phần lớn bài review ScrapingBee bỏ qua hoàn toàn điểm này. Nhưng đây có lẽ là yếu tố quan trọng nhất với bất kỳ ai định scrape ở quy mô lớn trong nhiều tháng hoặc nhiều năm.
ScrapingBee dùng CSS/XPath selector để trích xuất dữ liệu từ HTML. Bạn định nghĩa quy tắc trích xuất bằng JSON, chỉ rõ CSS selector, rồi ScrapingBee trả về dữ liệu khớp. Lúc đầu thì chạy ngon. Vấn đề là chuyện xảy ra sau đó.
Vấn đề selector bị gãy
Khi website mục tiêu thay đổi bố cục — tên class, cấu trúc DOM, phiên bản framework — selector CSS của bạn sẽ hỏng. Trong các hệ thống scraping trưởng thành vận hành trên hơn 2.500 job đang chạy, nghiên cứu cho thấy tỷ lệ gãy 1–2% mỗi tuần, tương đương 30–35 lần sửa mỗi tuần chỉ để các extractor tiếp tục hoạt động. Với tổ chức scrape 50 website, chi phí bảo trì hàng năm có thể lên tới 850–1.300 giờ, tương đương $64.000–$156.000 theo mức lương engineer đầy đủ chi phí.
Nhiều đội thường đánh giá thấp khoản này. Ước tính ban đầu hay chỉ 10–15 giờ bảo trì/tháng, nhưng thực tế lại cao hơn 4–6 lần (40–90 giờ/tháng). Chỉ một lỗi âm thầm — selector bị gãy nhưng vẫn trả dữ liệu rỗng mà không báo ai — có thể gây thiệt hại ước tính $38.000–$57.000 do mất doanh số, tốn công phục hồi thứ hạng và nhân sự.
Nguyên nhân thường gặp: đổi tên CSS class khi cập nhật framework, chèn thêm container mới quanh phần tử cần lấy, nâng cấp React/Vue/Angular làm cấu trúc DOM thay đổi, A/B testing với class động, và cơ chế làm nhiễu chống scrape.
Trích xuất bằng AI cắt giảm 60–80% công bảo trì
Một nghiên cứu của DataRobot năm 2025 cho thấy scraper dùng AI cần ít bảo trì hơn 70% so với scraper truyền thống dựa trên selector sau khi website được thiết kế lại. Tỷ lệ phân bổ thời gian gần như đảo ngược:
| Chỉ số | Truyền thống (CSS selector) | Dùng AI |
|---|---|---|
| Bảo trì sau redesign | Mốc nền | Ít hơn 70% |
| Tỷ lệ thời gian (thiết lập : bảo trì) | 20% : 80% | 5% : 95% theo dữ liệu |
| Mức giảm bảo trì tổng thể | Mốc nền | Giảm 60–80% |
| Tốc độ trên trang nặng JS | Mốc nền | Nhanh hơn 30–40% |
Thời gian thiết lập: viết selector so với AI gợi ý trường dữ liệu
Thiết lập với ScrapingBee: Xem source của trang → xác định CSS selector → viết quy tắc trích xuất bằng JSON → test và debug → xử lý các trường hợp ngoại lệ do biến thể trang → theo dõi lỗi gãy → sửa selector khi website cập nhật.
Thiết lập với Thunderbit: Mở trang trong Chrome → bấm "AI Suggest Fields" → AI đọc trang và đề xuất các cột với kiểu dữ liệu phù hợp → bấm "Scrape." Không phải viết selector, không cần soi source code. AI của Thunderbit được hỗ trợ bởi nhiều mô hình nền tảng (ChatGPT, Gemini, Claude, DeepSeek R1) để đọc trang web giống như con người.
Field AI Prompts của Thunderbit còn thêm một lớp nữa: mỗi cột có thể có hướng dẫn AI tùy chỉnh để biến đổi dữ liệu ngay lúc trích xuất — định dạng ngày tháng, dịch văn bản, phân loại sản phẩm, tách tên, chuẩn hóa số điện thoại. Điều này loại bỏ một bước hậu xử lý riêng mà người dùng ScrapingBee phải tự dựng.
Dữ liệu đầu ra: HTML thô so với hàng dữ liệu sẵn dùng
| Khía cạnh | ScrapingBee (dựa trên selector) | Thunderbit (dùng AI) |
|---|---|---|
| Đầu ra mặc định | HTML thô | Các dòng có cấu trúc với cột đã định kiểu |
| Trích xuất có cấu trúc | Cần viết CSS/XPath rule hoặc dùng AI (+5 credit) | AI tự phát hiện trường dữ liệu |
| Kiểu dữ liệu hỗ trợ | Văn bản (phải parse HTML) | Text, số, ngày, URL, email, phone, image |
| Khả năng chịu thay đổi bố cục | ⚠️ Phải sửa selector thủ công | ✅ AI đọc lại trang mới mỗi lần |
| Kỹ năng kỹ thuật cần có | Python/cURL, CSS selector, hiểu HTML | Không cần — tiện ích Chrome với quy trình 2 click |
| Bảo trì theo thời gian | Liên tục (tỷ lệ gãy 1–2% mỗi tuần) | Tối thiểu (AI tự thích nghi) |
ScrapingBee đã thêm các tính năng AI extraction (ai_query, ai_extract_rules) để phần nào giải quyết vấn đề bảo trì selector. Nhưng các tính năng này cộng thêm +5 credit cho mỗi request, và công cụ vẫn về bản chất là API-first, không có giao diện trực quan.
ScrapingBee cho người không biết lập trình: kiểm tra mức độ dễ dùng một cách thẳng thắn
ScrapingBee không được thiết kế cho người dùng không kỹ thuật. Đây là một API. Bạn phải viết code để dùng nó. Nếu bạn là quản lý marketing hay lead sales ops đang đọc đến đây, thì đó đã là toàn bộ câu chuyện rồi.
Đây là trải nghiệm thực tế của người không chuyên khi dùng ScrapingBee:
- Viết API call bằng Python, cURL hoặc ngôn ngữ khác
- Hiểu các tham số HTTP như
render_js=true,premium_proxy=true,country_code=us - Phân tích phản hồi HTML thô bằng thư viện như BeautifulSoup
- Viết CSS selector để lấy đúng trường dữ liệu
- Xử lý pagination bằng logic crawl tự viết (ScrapingBee chỉ xử lý request từng trang)
- Xây pipeline dữ liệu để làm sạch, cấu trúc và lưu dữ liệu đã lấy
Không có builder kéo-thả. Không có giao diện bấm chọn. Không có bản xem trước trực quan cho thứ bạn đang scrape.
"Có đường cong học tập. Và tài liệu khá cồng kềnh, mất từ một ngày đến một tuần mới đọc xong." — Arvind K, Chủ doanh nghiệp, Financial Services, Capterra
"Hệ thống của họ rất đặc thù và phải mất một thời gian mới học được cách code và cấu trúc của họ." — Capterra review
Developer thì rất thích điều này. Một reviewer gọi nó là "hoàn toàn dựa trên API: rất hiện đại và tinh gọn: chỉ cần chạy là được." Nhưng "dễ dùng" với developer đang đánh giá API là một chuyện hoàn toàn khác với "dễ dùng" với người muốn tạo danh sách lead mà không viết code.
Khi nào nên chọn giải pháp no-code
Thunderbit Chrome Extension mang đến trải nghiệm hoàn toàn khác:
- Mở một trang web trong Chrome khi đã cài extension
- Bấm "AI Suggest Fields" — AI quét trang và đề xuất cột (Product Name, Price, Rating, URL, v.v.) với kiểu dữ liệu phù hợp
- Xem lại và chỉnh sửa — thêm, xóa hoặc đổi tên cột; thêm Field AI Prompts để biến đổi dữ liệu
- Bấm "Scrape" — dữ liệu được trích xuất thành các dòng có cấu trúc
- Xuất dữ liệu — một click ra Google Sheets, Airtable, Notion, Excel, CSV hoặc JSON (tất cả đều miễn phí)
Không API call, không selector, không code. Thunderbit hỗ trợ 55 ngôn ngữ tính đến tháng 4/2026.
Với các website phổ biến, Thunderbit còn cung cấp instant scraper templates — template dựng sẵn và được duy trì cho Amazon, Zillow, Shopify, LinkedIn, Google Maps, Instagram, eBay, Apollo, v.v. Bạn thậm chí không cần đợi AI gợi ý trường dữ liệu; template đã sẵn sàng.
Ngoài ra, Thunderbit còn có một số công cụ miễn phí vĩnh viễn không cần gói trả phí: email extractor, phone number extractor và image extractor — rất tiện cho đội sales và marketing chỉ cần lấy dữ liệu nhanh.
Khung ra quyết định: ai nên dùng gì
| Nếu bạn là… | Phù hợp nhất |
|---|---|
| Developer quen API và parse HTML | ScrapingBee hoặc ScraperAPI |
| Người dùng kỹ thuật muốn dữ liệu có cấu trúc mà không phải viết selector | Thunderbit API (Extract endpoint) |
| Người dùng doanh nghiệp (sales, marketing, ecommerce ops) không biết code | Thunderbit Chrome Extension |
| Đội cần monitoring theo lịch mà không có devops | Thunderbit Scheduled Scraper (lập lịch bằng ngôn ngữ tự nhiên) |
| Xây pipeline LLM/RAG cần markdown sạch | Thunderbit Distill API hoặc Firecrawl |
| Muốn chi phí dễ đoán, không muốn hệ số nhân credit | Thunderbit (1 credit = 1 dòng) |
Sau khi scrape: dữ liệu của bạn thực sự đi đâu?
Scraping chỉ là một nửa công việc. Nửa còn lại — đưa dữ liệu vào nơi hữu ích — là phần mà hầu hết review ScrapingBee lại lặng im.
ScrapingBee: xuất HTML thô, tự xây pipeline
ScrapingBee mặc định trả về HTML thô. Sau đó bạn phải:
- Parse HTML bằng BeautifulSoup hoặc lxml
- Loại bỏ navigation, footer, script và style (chiếm 80–90% nội dung của một trang điển hình)
- Trích xuất các trường dữ liệu cụ thể
- Chuyển sang định dạng có cấu trúc
- Xử lý pagination và trạng thái lỗi
- Lưu trữ và phân phối dữ liệu
"ScrapingBee trả về HTML thô. AI agent cần markdown sạch, semantic search và webhook." — KnowledgeSDK
ScrapingBee có cung cấp return_page_markdown=true và return_page_text=true như các lựa chọn bật thêm, và Google Search API trả về JSON có cấu trúc. Nhưng quy trình mặc định — và trải nghiệm scraping đa dụng — vẫn là HTML thô mà bạn phải tự xử lý.
Người dùng thường cần thêm công cụ khác: BeautifulSoup/lxml để parse, Pandas để làm sạch dữ liệu, cron/Airflow để lên lịch, logic crawl tự viết cho scrape nhiều trang, và lưu trữ đám mây riêng. Đó là rất nhiều việc kỹ thuật chỉ để đi từ "tôi đã scrape được" đến "tôi dùng được nó".
Thunderbit: đầu ra có cấu trúc và xuất dữ liệu tích hợp sẵn
Thunderbit trả về các dòng dữ liệu có cấu trúc với kiểu dữ liệu xác định (text, number, date, URL, email, phone, image) sẵn sàng để xuất. Tất cả tính năng export đều miễn phí ở mọi gói:
| Nơi xuất dữ liệu | Chi phí |
|---|---|
| Excel (.xlsx) | Miễn phí |
| Google Sheets | Miễn phí (tích hợp trực tiếp) |
| Airtable | Miễn phí (tích hợp trực tiếp) |
| Notion | Miễn phí (tích hợp trực tiếp) |
| CSV | Miễn phí |
| JSON | Miễn phí |
Với các đội đã dùng Google Sheets hoặc Airtable làm CRM hay trung tâm vận hành, điều này loại bỏ cả một tầng kỹ thuật. Khi xuất sang Notion hoặc Airtable, ảnh sẽ được tải lên thư viện ảnh để người dùng xem trực tiếp ngay trong nội dung — một chi tiết nhỏ nhưng rất quan trọng trong thực tế.
Hệ sinh thái tích hợp của ScrapingBee
ScrapingBee có tích hợp bên thứ ba: Zapier (hơn 8.000 kết nối ứng dụng), Make (hơn 3.000 app), n8n và Microsoft Power Automate. Những công cụ này có thể bắc cầu giữa HTML thô và nơi bạn muốn đẩy dữ liệu đến — nhưng chúng làm tăng chi phí, độ phức tạp và thêm một điểm có thể lỗi.
Với developer: Open API của Thunderbit
Với độc giả muốn xây pipeline theo lập trình, Thunderbit cung cấp Open API với hai endpoint chính:
- Distill endpoint — chuyển trang thành Markdown sạch, lý tưởng cho pipeline LLM/RAG (1 credit mỗi lần gọi)
- Extract endpoint — trả về JSON có cấu trúc khớp với schema do người dùng định nghĩa (20 credit mỗi lần gọi)
- Xử lý hàng loạt — tối đa 100 URL mỗi request
Điều này giúp Thunderbit phục vụ cả người dùng no-code (Chrome Extension) lẫn developer (Open API) trên cùng một AI engine. Đừng chỉ hỏi "nó có scrape được không" — hãy hỏi "dữ liệu sau đó đi đâu?"
Kiểm tra độ ổn định năm 2026: ScrapingBee có đủ tốt cho production không?
Các thread cũ trên Reddit (2021–2023) có phản ánh những phàn nàn về độ ổn định của ScrapingBee. Đến năm 2026, điều đó còn đúng không? Tôi đã tổng hợp dữ liệu từ sáu benchmark độc lập. Kết quả khá trái chiều — và đôi khi còn mâu thuẫn.
Benchmark hai tuần một lần của Scrapeway (tháng 4/2026)
Tổng thể: tỷ lệ thành công 33.3% — đứng thứ 7 trong 9 dịch vụ được thử.
| Website | Tỷ lệ thành công |
|---|---|
| Amazon | 48% |
| 41% | |
| Indeed | 38% |
| Etsy | 21% |
| Booking | 17% |
| Realtor | 0% |
| StockX | 0% |
| Twitter/X | 0% |
| Zillow | 0% |
| Walmart | 0% |
| 0% |
Bài test đối đầu của Scrapingdog (2025)
| Website | ScrapingBee | Scrapingdog | ScraperAPI |
|---|---|---|---|
| Amazon | 100% | 100% | 100% |
| Glassdoor | 0% | 100% | 100% |
| eBay | 100% | 100% | 100% |
| Walmart | 40% | 100% | 100% |
| 90% | 100% | 80% |
Benchmark của Proxyway (tháng 12/2025)
- 84.47% success ở 2 request/giây
- 72.98% success ở 10 request/giây — giảm 12 điểm khi tải tăng
- 25.46 giây thời gian phản hồi trung bình — chậm nhất trong nhóm benchmark
Benchmark của Scrape.do (2025–2026)
- 92.69% tỷ lệ thành công tổng thể
- Mạnh ở từng website riêng lẻ: Amazon 99.11%, Indeed 99.29%, GitHub 100%, X/Twitter 99.6%
- Yếu ở Capterra: chỉ 59% thành công với thời gian phản hồi 36 giây
Mô hình chung
Dữ liệu cho thấy một xu hướng rõ ràng:
- ScrapingBee hoạt động tốt trên các website phổ biến, bảo vệ vừa phải — Amazon, eBay, GitHub và Indeed thường đạt 90–100% thành công
- ScrapingBee thất bại hoàn toàn trên các website được bảo vệ mạnh — liên tục 0% trên LinkedIn, Zillow, Realtor.com, StockX và Twitter qua nhiều benchmark
- Hiệu năng giảm mạnh khi tải tăng — từ 84% ở 2 req/s xuống còn 73% ở 10 req/s
- Kết quả benchmark dao động rất lớn theo phương pháp đo — từ 33.3% (Scrapeway, nhiều loại site) đến 92.69% (Scrape.do, target vừa phải)
Xếp hạng Capterra 4.9/5 của ScrapingBee (137 đánh giá) là tín hiệu tích cực, nhưng điểm cao về dễ setup ban đầu không phải lúc nào cũng phản ánh độ ổn định dài hạn trong production ở quy mô lớn. Những người chuyển sang công cụ khác thường nhắc đến tỷ lệ lỗi tăng và chi phí tăng — chứ không phải khó khăn setup ban đầu.
"Rất tích cực. ScrapingBee ổn định, dễ đoán và dễ tích hợp vào production." — Verified Reviewer, CEO, Capterra
ScrapingBee thể hiện "độ ổn định không nhất quán," cụ thể là đạt "0% success rate trên Glassdoor" và "40% trên Walmart."
Cách scraping bằng AI xử lý độ ổn định khác đi
AI của Thunderbit đọc trang đã render theo thời gian thực, thích nghi với cơ chế chống bot và thay đổi bố cục ở mỗi phiên.
- Cloud scraping — chạy trên server cloud của Thunderbit, xử lý tối đa 50 trang cùng lúc, phù hợp nhất cho các job scrape công khai quy mô lớn trên Amazon, Zillow và Shopify
- Browser scraping — chạy cục bộ trong trình duyệt Chrome của người dùng, dùng chính phiên đăng nhập của họ — lý tưởng cho các site yêu cầu đăng nhập (LinkedIn, dashboard riêng, nền tảng SaaS) mà công cụ dựa trên API như ScrapingBee không thể truy cập nội dung phía sau xác thực
Thunderbit cũng cung cấp instant scraper templates cho các website phổ biến, được dựng sẵn và duy trì, giúp chúng tiếp tục hoạt động ngay cả khi website thay đổi cấu trúc. Với những site mà ScrapingBee cho 0% thành công (LinkedIn, Zillow), chế độ browser scraping của Thunderbit — dùng chính phiên đăng nhập của bạn — là một cách tiếp cận hoàn toàn khác.
ScrapingBee so với các lựa chọn hàng đầu: so sánh trực diện
| Khía cạnh | ScrapingBee | Thunderbit | ScraperAPI | Scrapfly |
|---|---|---|---|---|
| Loại | Chỉ API | Chrome Extension + API | Chỉ API | Chỉ API |
| Giá khởi điểm | $49/tháng | Miễn phí ($0) | $49/tháng | $30/tháng |
| Mô hình credit | Hệ số nhân (1×–75×) | 1 credit = 1 dòng (không nhân hệ số) | Hệ số nhân (1×–75×) | Hệ số nhân (1×–30×) |
| AI extraction | Có (+5 credit/request) | Tích hợp sẵn (AI Suggest Fields) | Không có AI gốc | Có |
| Tùy chọn no-code | Không (chỉ API) | Có (Chrome Extension) | Không (chỉ API) | Không (chỉ API) |
| Đầu ra có cấu trúc | Cần rule CSS hoặc AI add-on | Mặc định (cột đã định kiểu) | Endpoint có cấu trúc cho site cụ thể | Tùy |
| Nơi xuất dữ liệu | HTML/JSON thô (tự xây) | Excel, Sheets, Airtable, Notion, CSV, JSON (đều miễn phí) | HTML/JSON thô | HTML/JSON thô |
| Scrape subpage | Thủ công (tự viết crawl logic) | Tích hợp sẵn (2 credit/dòng) | Thủ công | Thủ công |
| Scrape theo lịch | Chỉ CLI (không có scheduler trên dashboard) | Tích hợp sẵn (ngôn ngữ tự nhiên) | Không có sẵn | Không có sẵn |
| Gói miễn phí | Trial 1.000 credit | 6 trang/tháng (vĩnh viễn) | 5.000 credit (trial 7 ngày) | 1.000 credit |
| JS rendering mặc định | BẬT (chi phí 5×) | Đã bao gồm (không tốn thêm) | TẮT | TẮT |
| Độ khó học | Cao (API + selector) | Thấp (quy trình 2 click) | Cao (API + selector) | Cao (API) |
| Phù hợp nhất | Dev muốn kiểm soát proxy | Người dùng doanh nghiệp + developer | Dev + endpoint có cấu trúc | Dev muốn bypass ASP |
| Capterra rating | 4.9/5 (137 reviews) | — | 4.6/5 (62 reviews) | 4.9/5 (221 reviews) |
ScrapingBee so với Thunderbit: khác biệt then chốt
Những khác biệt lớn nhất nằm ở kiến trúc và đối tượng sử dụng:
- Chỉ API vs. Chrome Extension + API: ScrapingBee yêu cầu code cho mọi tương tác. Thunderbit có Chrome Extension cho người dùng no-code và Open API cho developer — cùng một AI engine, hai giao diện.
- Dựa trên selector vs. trích xuất bằng AI: ScrapingBee bắt bạn viết và bảo trì CSS/XPath selector. AI của Thunderbit tự đề xuất trường dữ liệu và thích nghi khi website thay đổi.
- HTML thô vs. dòng dữ liệu có cấu trúc kèm xuất miễn phí: ScrapingBee trả về HTML bạn phải parse. Thunderbit trả về các dòng có nhãn, có kiểu dữ liệu, và bạn có thể xuất sang Excel, Google Sheets, Airtable hoặc Notion chỉ với một click.
- Scrape subpage: AI của Thunderbit sẽ vào từng trang chi tiết và làm giàu bảng chính — có sẵn, không cần tự viết crawl logic. ScrapingBee yêu cầu bạn tự viết logic đó.
- Instant templates: Thunderbit có template dựng sẵn cho các website phổ biến (Amazon, Zillow, Shopify, LinkedIn, Google Maps, eBay) dùng ngay được. ScrapingBee có API chuyên dụng cho Amazon và Walmart, nhưng bạn vẫn phải viết code để dùng.
Một số lựa chọn thay thế đáng chú ý khác
- Scrape.do — chi phí độc lập thấp nhất ở mức $0.80/1K request với tỷ lệ thành công 98.19%; giá khởi điểm $29/tháng
- Apify — nền tảng dựa trên actor với hơn 415 đánh giá G2 (4.7/5), nhưng "Pricing Issues" là phàn nàn số 1
- Firecrawl — AI/LLM-native, trả về markdown với số token ít hơn 67% so với HTML thô; core mã nguồn mở; giá khởi điểm $16/tháng
- Bright Data — cấp doanh nghiệp với hơn 72M IP, giá khởi điểm $499/tháng; pricing theo mức cố định
- ZenRows — 55M residential IP, scraper dựng sẵn cho Amazon/Walmart/Zillow, giá khởi điểm $69/tháng
Công cụ scrape nào phù hợp nhất cho đội của bạn?
Gợi ý theo từng kịch bản:
- Nếu bạn là developer đang xây pipeline scrape tùy chỉnh và muốn kiểm soát proxy chi tiết → ScrapingBee hoặc ScraperAPI. Bạn sẽ có tham số HTTP chi tiết, chọn loại proxy và kiểm soát đầy đủ phần rendering. Chỉ cần dự trù chi phí cho các hệ số nhân credit.
- Nếu bạn là đội sales hoặc marketing cần lấy lead từ website mà không viết code → Thunderbit Chrome Extension. Hai click để ra dữ liệu có cấu trúc, một click để đẩy sang Google Sheets. Không API, không selector, không parse.
- Nếu bạn cần dữ liệu có cấu trúc từ các website phổ biến thật nhanh → Thunderbit Instant Templates. Amazon, Zillow, Shopify, LinkedIn — dựng sẵn và được duy trì, không cần thiết lập AI.
- Nếu bạn cần theo dõi giá hoặc tồn kho theo lịch mà không có devops → Thunderbit Scheduled Scraper. Chỉ cần mô tả khoảng thời gian bằng tiếng Anh tự nhiên ("every Monday at 9 AM") và để nó chạy.
- Nếu bạn đang xây pipeline LLM/RAG và cần Markdown sạch ở quy mô lớn → Thunderbit Distill API hoặc Firecrawl. Cả hai đều trả về markdown tối ưu cho AI.
- Nếu bạn muốn chi phí dễ dự đoán và không muốn hệ số nhân credit → Thunderbit. 1 credit = 1 dòng, bất kể JS rendering hay loại proxy.
Tổng chi phí sở hữu không chỉ là giá API. Nó còn là thời gian setup + giờ bảo trì + công sức parse + quy trình xuất dữ liệu. Giá niêm yết của ScrapingBee cạnh tranh; nhưng bức tranh chi phí đầy đủ thì không hẳn.
Những điểm chính rút ra từ bài review ScrapingBee này
Năm điều đáng nhớ:
- Chi phí credit tăng rất nhanh khi ở quy mô lớn. Mức giá khởi điểm $49 có thể thành $599+ khi cần JS rendering và proxy premium. Mô hình 1 credit = 1 dòng của Thunderbit loại bỏ sự khó đoán này.
- CSS selector kéo theo chi phí bảo trì liên tục, trong khi AI extraction tránh được điều đó. Hãy kỳ vọng giảm 60–80% công bảo trì với công cụ dùng AI, và không còn lỗi selector khi website cập nhật.
- Người không biết lập trình sẽ gặp đường cong học tập dốc với ScrapingBee. Đây là công cụ chỉ API, cần code, cần soi HTML và xây selector. Người dùng doanh nghiệp nên xem các lựa chọn no-code.
- Xuất dữ liệu đòi hỏi kỹ thuật riêng. ScrapingBee trả về HTML thô; bạn phải tự xây pipeline. Thunderbit xuất dữ liệu có cấu trúc sang Excel, Sheets, Airtable và Notion hoàn toàn miễn phí.
- Độ ổn định tốt với một số site nhưng không nhất quán ở site khác. ScrapingBee hoạt động tốt trên Amazon và eBay nhưng đạt 0% trên LinkedIn, Zillow và nhiều target được bảo vệ mạnh khác.
ScrapingBee vẫn là một công cụ mạnh cho developer muốn truy cập HTTP có proxy quản lý cùng khả năng kiểm soát chi tiết. Nhưng bức tranh web scraping năm 2026 đã chuyển sang các công cụ AI, no-code — và Thunderbit được làm ra đúng cho xu hướng đó. Hãy thử gói miễn phí (6 trang miễn phí, hoặc nhiều hơn với bản trial) để tự cảm nhận sự khác biệt.
Câu hỏi thường gặp
ScrapingBee có còn đáng dùng trong năm 2026 không?
Điều đó còn tùy vào kỹ năng kỹ thuật và quy mô của bạn. Với developer scrape các trang tĩnh ở khối lượng vừa phải, ScrapingBee mang đến một API ổn định, tài liệu tốt, hỗ trợ phản hồi nhanh và điểm Capterra 4.9/5. Với người dùng doanh nghiệp, scrape khối lượng lớn, hoặc đội muốn dữ liệu có cấu trúc mà không cần code, các lựa chọn dùng AI như Thunderbit mang lại giá trị tốt hơn và tổng chi phí sở hữu thấp hơn đáng kể.
ScrapingBee có dùng được mà không cần code không?
Không. ScrapingBee là công cụ chỉ API, yêu cầu viết code (Python, cURL hoặc tương tự) và hiểu các tham số HTTP. Không có giao diện trực quan để tạo tác vụ scrape. Người dùng không kỹ thuật nên cân nhắc các lựa chọn no-code như Thunderbit Chrome Extension, nơi bạn có thể scrape và export dữ liệu mà không cần viết một dòng code nào.
Thực ra ScrapingBee tốn bao nhiêu tiền cho mỗi trang?
Tùy vào tính năng bạn bật. Một trang HTML tĩnh tốn 1 credit. Một trang có render JS (mặc định) tốn 5 credit. Một trang dùng premium proxy + JS tốn 25 credit. Một trang dùng stealth proxy tốn 75 credit. AI extraction cộng thêm +5 credit. Ở gói Freelance ($49/250K credit), đó là $0.20 cho mỗi 1.000 trang tĩnh hoặc $14.70 cho mỗi 1.000 trang dùng stealth proxy. Hãy xem các bảng chi phí chi tiết ở trên để có phân tích đầy đủ.
Những lựa chọn thay thế tốt nhất cho ScrapingBee năm 2026 là gì?
Các lựa chọn hàng đầu gồm Thunderbit (AI-powered, Chrome Extension + API no-code, 1 credit = 1 dòng), ScraperAPI (API cho developer với endpoint có cấu trúc cho site cụ thể), Scrapfly (API cho developer với khả năng vượt anti-bot mạnh), Scrape.do (chi phí thấp nhất trên mỗi request trong các bài test độc lập), và Firecrawl (AI/LLM-native, trả về markdown sạch). Mỗi công cụ có thế mạnh riêng — Thunderbit cho người dùng doanh nghiệp và tính dễ đoán về ngân sách, ScraperAPI và Scrapfly cho kiểm soát proxy của developer, Firecrawl cho pipeline LLM.
ScrapingBee có scrape được website nặng JavaScript không?
Có, nhưng chi phí là 5× credit cơ bản với proxy xoay vòng hoặc 25× với premium proxy. JavaScript rendering được bật mặc định, nên bạn vốn đã đang trả mức 5× trừ khi chủ động tắt nó đi. Thunderbit xử lý JS rendering tự động mà không có hệ số nhân credit — 1 credit mỗi dòng, bất kể trang được xây như thế nào.
Tìm hiểu thêm


