Indeed đang nắm giữ một kho dữ liệu việc làm khổng lồ — hơn 645 triệu hồ sơ người tìm việc, hơn 3,3 triệu nhà tuyển dụng, và hơn 24 triệu tin tuyển dụng đang hoạt động tại bất kỳ thời điểm nào.
Nếu bạn muốn đưa dữ liệu đó vào bảng tính, CRM hoặc dashboard phân tích, bạn cần một công cụ scrape thật sự dùng được. “Thật sự dùng được” là điểm mấu chốt, vì Indeed là một trong những trang việc làm được bảo vệ chặt chẽ nhất trên web công khai.
Tôi đã dành nhiều năm xây dựng các công cụ tự động hóa tại Thunderbit và trước đó là Automation Anywhere, nên tôi có thể nói với bạn rằng: scrape Indeed vào năm 2026 không giống chút nào so với scrape một danh mục sản phẩm đơn giản. Các thử thách Cloudflare, CAPTCHA, dấu vân tay IP và giới hạn tốc độ luân phiên khiến một nửa số script mà người ta viết năm ngoái giờ đã hỏng. Từ forum này sang forum khác, câu chuyện vẫn giống nhau — đoạn code chạy ổn hàng tháng trời bỗng nhiên chỉ trả về lỗi 403.
Vì vậy, tôi đã tổng hợp danh sách 10 công cụ scrape Indeed, bao gồm tiện ích không cần code, API cho nhà phát triển và thư viện mã nguồn mở, phù hợp với mọi cấp độ kỹ năng và ngân sách. Dù bạn là nhà tuyển dụng chỉ muốn dữ liệu lương trong Google Sheets hay một kỹ sư dữ liệu đang xây dựng pipeline tổng hợp việc làm, đều có công cụ phù hợp ở đây.
Vì sao Indeed là một trong những trang việc làm khó scrape nhất
Trước khi đi vào từng công cụ, bạn nên hiểu mình đang đối mặt với gì. Indeed không phải là mục tiêu thân thiện với các công cụ scrape, và nó ngày càng khó hơn qua từng năm.
Bốn lớp phòng thủ chống bot khiến nó nổi bật:
- Cloudflare WAF: Tài liệu hỗ trợ chính thức của Indeed thừa nhận người dùng có thể gặp lỗi Cloudflare và phản hồi 403 Forbidden. Đây là bức tường đầu tiên mà hầu hết công cụ scrape đụng phải.
- CAPTCHA và cổng thử thách: Các vòng lặp “Xác minh bạn là con người” xuất hiện rất thường xuyên. Chúng không chỉ gây phiền — mà còn làm hỏng hoàn toàn luồng tự động nếu công cụ của bạn không thể giải hoặc vượt qua.
- Giới hạn IP và tốc độ request: Tài liệu dành cho nhà phát triển của Indeed áp dụng lưu lượng theo cửa sổ trượt 60 giây và trả về HTTP 429 khi vượt quá. Phân trang là nơi vấn đề này lộ rõ nhất.
- Phụ thuộc vào JavaScript và cookie: Indeed nói rõ với người dùng bị chặn rằng họ cần bật JavaScript và cookie. Các công cụ chỉ gửi yêu cầu HTTP thuần túy — kiểu không render bằng trình duyệt thật — sẽ thất bại liên tục.
Bằng chứng từ cộng đồng nói rất thẳng. Một người dùng Reddit viết, “Tôi luôn nhận được lỗi 403 forbidden.” Một người khác báo cáo rằng “code web scraping mà tôi chạy suốt nhiều tháng đã ngừng hoạt động.” Một chuỗi thảo luận sau đó mô tả trang đầu tải bình thường nhưng các trang tiếp theo thì thất bại hoàn toàn.
So với các bảng việc làm khác, Indeed nằm ở mức từ trung bình đến khó. Hướng dẫn trên Scraperly đánh giá độ khó ở mức trung bình, với thông lượng an toàn khoảng 200–500 tin mỗi ngày cho mỗi IP, trong khi Glassdoor và LinkedIn thường còn khó hơn do có cổng đăng nhập. Nhưng “độ khó trung bình” vẫn có nghĩa là các công cụ rẻ tiền chỉ gửi request, cùng những script làm cho vui, thường xuyên bị hỏng. Ở đây, việc chọn đúng công cụ quan trọng hơn hầu hết các trang khác.
Chúng tôi chọn các công cụ scrape Indeed tốt nhất năm 2026 như thế nào
Tôi đã đánh giá mọi công cụ trong danh sách này dựa trên tám tiêu chí, mỗi tiêu chí gắn trực tiếp với những vấn đề thực tế mà tôi tìm thấy trên Reddit, issue GitHub và các forum dành cho nhà phát triển:
| Tiêu chí | Vì sao quan trọng trên Indeed |
|---|---|
| Vượt qua Cloudflare / chống bot | Phàn nàn số 1 — có năm chuỗi thảo luận khác nhau nhắc đến việc 403 làm hỏng công cụ scrape |
| Có cần code không | Người không biết code (nhà tuyển dụng, HR, nhà phân tích) là một nhóm rất lớn nhưng thường bị bỏ qua trong hầu hết danh sách công cụ scrape |
| Gói miễn phí / lựa chọn miễn phí | Có bốn lần nhắc trên forum về nhu cầu dùng miễn phí hoặc chi phí thấp; công cụ trả phí bị gọi là “quá đắt” |
| Định dạng xuất dữ liệu | Người dùng cần dữ liệu vào Sheets, Excel, Airtable — không phải JSON thô rồi tự chuyển đổi thủ công |
| Proxy / xoay vòng IP | Có ba lần nhắc; scrape Indeed mà không có proxy thì, như một người dùng nói, “là ý tưởng tồi” |
| Dễ thiết lập | Người dùng nói các scraper Python “làm tôi rối cả đầu” |
| Bảo trì / độ tin cậy | Indeed thay đổi đủ nhanh để trừng phạt những công cụ không được bảo trì |
| Chi phí cho mỗi 1K công việc scrape | Bài viết đối thủ thường đưa giá mơ hồ; tôi chuẩn hóa chi phí để so sánh công bằng hơn |
Một điểm khiến danh sách này khác với đa số: tôi cố ý đưa vào cả công cụ không cần code, ít code, API và mã nguồn mở. Hầu hết các bài “scraper Indeed tốt nhất” khác mà tôi tìm thấy chỉ nói về các lựa chọn dựa trên API.
Như vậy, họ bỏ sót một lượng lớn người chỉ muốn dữ liệu việc làm trong bảng tính mà không phải đụng vào terminal.
Scraper Indeed nào phù hợp với trình độ của bạn?
Trước khi đọc hết 10 công cụ, hãy xác định xem bạn thuộc nhóm nào. Việc này sẽ giúp bạn tiết kiệm thời gian.
| Trình độ của bạn | Cách tiếp cận phù hợp nhất | Công cụ nên cân nhắc |
|---|---|---|
| Không có kinh nghiệm lập trình | Tiện ích Chrome hoặc giao diện cấu hình | Thunderbit, Apify (giao diện cấu hình) |
| Python / scripting cơ bản | Thư viện + proxy hoặc API đơn giản | JobSpy, ScraperAPI, Decodo |
| Nhà phát triển / kỹ sư dữ liệu | Tích hợp API đầy đủ | Bright Data, Oxylabs, ZenRows, ScrapingBee, Scrapingdog |
Một nhà tuyển dụng chỉ muốn dữ liệu lương của 50 tin tuyển dụng thì không cần mạng proxy doanh nghiệp giá 500 USD/tháng. Và một người đang xây dựng aggregator việc làm thương mại thì cũng không nên phụ thuộc vào tiện ích Chrome miễn phí. Chọn đúng công cụ theo trình độ và mục đích sử dụng đã là một nửa cuộc chiến.
1. Thunderbit — Scraper Indeed tốt nhất cho người không kỹ thuật
Thunderbit là công cụ mà đội ngũ tôi và tôi đã xây dựng, nên tôi nói thẳng điều đó. Nhưng lý do nó đứng đầu danh sách không phải là thiên vị — mà vì Thunderbit là công cụ scrape Indeed thực sự không cần code duy nhất mà tôi tìm thấy, có thể xử lý chống bot, làm giàu dữ liệu từ trang con và xuất thẳng sang bảng tính mà không cần viết một dòng code nào.
Quy trình rất đơn giản. Cài đặt Chrome Extension, mở trang kết quả tìm kiếm Indeed, nhấp AI Suggest Fields (AI đọc trang và đề xuất các cột như Job Title, Company, Salary, Location, URL), xem lại các trường được gợi ý, nhấp Scrape, rồi xuất dữ liệu. Toàn bộ quá trình chỉ mất khoảng 2 phút từ lúc cài đặt đến khi dữ liệu nằm trong bảng tính của bạn.
Điểm khiến Thunderbit đặc biệt hữu ích trên Indeed:
- Scrape trang con: Bắt đầu từ trang kết quả tìm kiếm, rồi tự động truy cập từng trang chi tiết công việc để bổ sung mô tả đầy đủ, yêu cầu, quyền lợi và metadata của tin đăng. Với phân tích tuyển dụng cạnh tranh, đây là tính năng quan trọng nhất — bạn có được bức tranh đầy đủ, không chỉ đoạn trích của tin đăng.
- Chế độ scrape bằng trình duyệt + Cloud: Chế độ trình duyệt scrape từ phiên Chrome đã đăng nhập của bạn (rất hữu ích cho kết quả theo vị trí). Chế độ Cloud dùng hạ tầng lưu trữ của Thunderbit với IP luân phiên và logic chống chặn — có thể scrape cùng lúc tới 50 trang cho các mục tiêu công khai.
- Xử lý chống bot tích hợp sẵn: Chế độ Cloud tự động xử lý thử thách Cloudflare và CAPTCHA. Không cần thiết lập proxy, cũng không cần cấu hình dịch vụ giải CAPTCHA.
- Bộ trích xuất email/điện thoại miễn phí: Lấy dữ liệu liên hệ của nhà tuyển dụng trực tiếp từ trang công ty — rất hữu ích cho việc tìm lead tuyển dụng.
- Xuất dữ liệu trực tiếp: Google Sheets, Excel/CSV, Airtable và Notion — tất cả đều miễn phí. Không cần script chuyển JSON sang CSV.
Mẫu scraper Indeed đã được dựng sẵn, nên nếu muốn, bạn thậm chí không cần cấu hình trường thủ công.
Dùng thử Thunderbit cho việc scrape Indeed
Giá: Gói miễn phí của Thunderbit bao gồm 6 trang mỗi tháng, và bản dùng thử miễn phí cho bạn 10 trang. Các gói trả phí dùng mô hình tín dụng (1 tín dụng = 1 dòng đầu ra), tương đương khoảng 30 USD cho 1.000 dòng ở gói Starter, với mức thấp hơn ở các gói cao hơn. Tất cả tính năng xuất dữ liệu đều hoàn toàn miễn phí ở mọi gói. Xem chi tiết giá đầy đủ tại đây.
Ưu điểm: Không cần code, xuất thẳng sang bảng tính, làm giàu dữ liệu từ trang con, chế độ trình duyệt + Cloud, thiết lập rất nhanh
Nhược điểm: Thanh toán theo tín dụng kém hấp dẫn với các crawl khối lượng rất lớn (10.000+ tin/ngày); thiếu các benchmark độc lập chuyên biệt cho Indeed
Phù hợp nhất cho: Nhà tuyển dụng, đội ngũ HR và nhà phân tích kinh doanh cần dữ liệu Indeed trong bảng tính — không cần code.
2. Bright Data — Scraper Indeed tốt nhất cho dự án quy mô doanh nghiệp
Bright Data là “gã khổng lồ” trong nhóm này. Nó kết hợp mạng proxy khổng lồ (hơn 400 triệu IP mỗi tháng trên 195 quốc gia), giải CAPTCHA chuyên dụng, fingerprinting trình duyệt, render JavaScript, cùng bộ dữ liệu Indeed job posting được thiết kế riêng và Jobs Data API.
- Tính năng chính: Web Unlocker để vượt Cloudflare, scrape theo địa lý, cung cấp dataset có cấu trúc (JSON, CSV, NDJSON), tích hợp lưu trữ đám mây, và sản phẩm dữ liệu Indeed chuyên biệt
- Xử lý chống bot: Tốt nhất nhóm. Kết quả benchmark ScrapingTest của Bright Data cho thấy tỷ lệ thành công tổng thể 95,99% với thời gian phản hồi trung bình 7,45 giây
- Giá: Trả theo mức dùng, bắt đầu khoảng 2,50 USD cho mỗi 1.000 bản ghi cho web scraping, còn dataset Indeed bắt đầu từ 0,0025 USD mỗi bản ghi (đơn hàng tối thiểu 50 USD). Có tín dụng dùng thử nhưng không có gói miễn phí công khai.
Phù hợp nhất cho: Các nhóm dữ liệu scrape hàng nghìn trang Indeed mỗi ngày để benchmark lương, nghiên cứu thị trường lao động hoặc tổng hợp việc làm thương mại — đặc biệt khi uptime và độ phủ địa lý quan trọng hơn chi phí.
3. Apify Indeed Scraper — Scraper Indeed tốt nhất cho người dùng ít code
Apify nằm ở giữa thị trường. Nó không thân thiện với người mới bằng Thunderbit, nhưng dễ hơn API thô vì bạn có thể chạy các “Actor” dựng sẵn từ giao diện cấu hình. Actor Indeed phổ biến nhất (misceres/indeed-scraper) có khoảng 4,0/5 từ 54 đánh giá và 20 nghìn người dùng tổng cộng, với mức giá từ khoảng 3,00 USD cho mỗi 1.000 tin việc làm.
- Tính năng chính: Giao diện cấu hình (đặt từ khóa tìm kiếm, vị trí, số trang), lập lịch tích hợp, lưu dataset và xuất linh hoạt (JSON, CSV, Excel, XML, HTML, RSS, JSONL)
- Xử lý chống bot: Phụ thuộc vào Actor cụ thể và thiết lập proxy. Các luồng issue công khai cho thấy các lần chạy trên Indeed vẫn có thể bị chặn hoặc trả về kết quả thiếu.
- Giá: Gói miễn phí bao gồm 5 USD tín dụng nền tảng. Việc chạy Actor có thể “đốt” hết khá nhanh trên Indeed.
Phù hợp nhất cho: Người dùng có trình độ trung bình muốn có lập lịch và xuất dữ liệu có cấu trúc qua dashboard — không phải viết code scrape từ đầu.
4. ScraperAPI — API scraper Indeed tốt nhất cho nhà phát triển có ngân sách hạn chế
ScraperAPI là một trong những API dành cho nhà phát triển đơn giản nhất: chỉ cần gửi URL, dịch vụ sẽ xử lý xoay vòng proxy, giải CAPTCHA và render JS, rồi trả về HTML hoặc đầu ra có cấu trúc. Trang dành riêng cho Indeed quảng cáo tỷ lệ thành công 99,99% và thời gian phản hồi trung bình 1–3 giây, dù đó là tuyên bố từ nhà cung cấp.
- Tính năng chính: API REST đơn giản, xoay vòng proxy tích hợp, tự động thử lại, nhiều định dạng đầu ra (HTML, JSON, text, markdown, quy trình CSV)
- Giá: Gói Hobby là 49 USD cho 100K credits, nhưng các request được bảo vệ có thể tiêu tốn 10–25 credits mỗi request. Chi phí hiệu dụng cho lưu lượng bảo vệ kiểu Indeed: khoảng 4,90 USD cho mỗi 1.000 request được bảo vệ ở mức giá khởi điểm. Gói miễn phí: 5K credit dùng thử.
- Điểm cần lưu ý: Nếu một nửa số request của bạn thất bại (điều này có thể xảy ra trên Indeed), chi phí thực tế sẽ tăng gấp đôi.
Phù hợp nhất cho: Nhà phát triển đề cao tài liệu API rõ ràng và tích hợp dễ đoán, nhưng không muốn giá cấp doanh nghiệp.
5. Scrapingdog — API chi phí thấp tốt nhất cho việc scrape Indeed
Scrapingdog cạnh tranh bằng sự rõ ràng về giá. Các gói bắt đầu từ 40 USD cho 200K credits (khoảng 0,20 USD cho mỗi 1.000 credits), và công ty cung cấp 1.000 credit miễn phí để bắt đầu.
- Tính năng chính: Chế độ stealth cho các trang có chống bot, đầu ra JSON đã phân tích cho Indeed, logic retry (tối đa 60 giây mỗi request), chỉ tính phí cho request thành công
- Điểm cần lưu ý về giá: Chế độ stealth tốn 10 credits mỗi request, nên chi phí thực tế cho site được bảo vệ ở gói Lite gần 2,00 USD cho mỗi 1.000 request được bảo vệ. Vẫn rẻ so với hầu hết đối thủ.
- Ghi chú về hiệu năng: Benchmark ScrapingTest cho thấy hiệu năng biến động hơn so với Bright Data hoặc ScraperAPI, nên hãy kiểm thử kỹ trước khi mở rộng.
Một hướng dẫn Indeed chuyên biệt hướng dẫn cài đặt bằng Python.
Phù hợp nhất cho: Nhà phát triển quan tâm đến chi phí thấp nhất trên mỗi request và không ngại tự kiểm chứng độ tin cậy bằng các truy vấn của mình.
6. ZenRows — API scraper Indeed tốt nhất về độ tin cậy chống bot
ZenRows đã trở thành một trong những lựa chọn thể hiện rõ nhất định hướng chống bot trong thị trường scraping. Công cụ này công khai tiếp thị vượt WAF, vượt CAPTCHA, vượt fingerprinting và proxy xoay vòng cao cấp. Trang scraper Indeed của nó cho phép xuất CSV, một file JSON duy nhất hoặc một file JSON cho mỗi URL — thân thiện với nghiệp vụ hơn nhiều sản phẩm API thô.
- Tính năng chính: Scrape site được bảo vệ với render JS, chống bot được tích hợp trong mọi request, tùy chọn đầu ra có cấu trúc
- Giá: Gói Developer tương đương khoảng 0,276 USD cho mỗi 1.000 kết quả cơ bản, nhưng kết quả được bảo vệ tăng lên khoảng 6,90 USD cho mỗi 1.000. Dùng thử miễn phí: 1.000 kết quả cơ bản + 40 kết quả được bảo vệ, hiệu lực 14 ngày.
- Tuyên bố từ nhà cung cấp: Tỷ lệ thành công trung bình với site được bảo vệ là 99,93%.
Mức chi phí mỗi request nghe có vẻ cao cho đến khi bạn so với số giờ bạn sẽ mất để tự gỡ lỗi Cloudflare.
Phù hợp nhất cho: Nhà phát triển ưu tiên khả năng chống bot mạnh mẽ — nhưng chưa cần lên đến toàn bộ stack doanh nghiệp của Bright Data.
7. ScrapingBee — API scraper Indeed tốt nhất với chế độ proxy tàng hình
ScrapingBee mạnh nhất khi quy trình làm việc của nhà phát triển quan trọng không kém khả năng vượt chặn. Nó hỗ trợ trình duyệt headless, proxy xoay vòng, công cụ chuyên cho Cloudflare, quy tắc trích xuất (CSS/XPath selectors và trích xuất có hỗ trợ AI), cùng nhiều định dạng phản hồi: JSON, HTML, Markdown, CSV và NDJSON.
- Tính năng chính: Chế độ proxy tàng hình, render JS, quy tắc trích xuất dữ liệu có cấu trúc, phân tích cú pháp hỗ trợ AI
- Giá: Gói Freelance là 49 USD cho 250K credits (0,196 USD cho mỗi 1.000 credits), nhưng request có JS + proxy cao cấp tốn 25 credits mỗi request, tương đương khoảng 4,90 USD cho mỗi 1.000 ở giá khởi điểm. Gói miễn phí: 1.000 lượt gọi.
- Tín hiệu benchmark: Kết quả định hướng từ ScrapingTest cho thấy tỷ lệ thành công tổng thể 77,98% với thời gian trung bình 10,32 giây.
Phù hợp nhất cho: Nhà phát triển quan tâm đến trải nghiệm API mượt mà và muốn có sẵn quy tắc trích xuất để giảm bước xử lý sau.
8. Oxylabs — Scraper Indeed tốt nhất cho hạ tầng proxy quy mô lớn
Oxylabs xứng đáng có mặt trong danh sách này với các nhóm đã biết chắc mình cần hạ tầng proxy và unblocker nghiêm túc. Web Scraper API và Web Unblocker của họ hỗ trợ vượt CAPTCHA, render JS, giảm fingerprinting, retry và geotargeting rộng trên pool proxy hơn 177 triệu IP ở 195 quốc gia.
- Tính năng chính: Phân tích dữ liệu bằng AI, đầu ra nhiều định dạng (JSON, HTML, PNG, Markdown), tùy chọn gửi lên cloud
- Giá: Mục tiêu phổ thông bắt đầu khoảng 2,15 USD cho mỗi 1.000 nếu không dùng JS và 2,35 USD cho mỗi 1.000 nếu có JS trên mức giá khởi điểm của Web Scraper API. Web Unblocker tính theo lưu lượng. Gói miễn phí: tối đa 2.000 kết quả.
- Điểm tinh tế: Oxylabs không đóng gói một “scraper Indeed” có thương hiệu riêng gọn gàng như một số đối thủ. Bạn sẽ cần hiểu sự tách biệt sản phẩm giữa Web Scraper API (dữ liệu đã phân tích) và Web Unblocker (truy cập thô).
- Tín hiệu benchmark: ScrapingTest cho thấy tỷ lệ thành công tổng thể 83,89% với thời gian trung bình 12,75 giây.
Phù hợp nhất cho: Các nhóm doanh nghiệp đã đầu tư vào hạ tầng proxy, hoặc bất kỳ ai cần nhắm mục tiêu địa lý ở quy mô lớn.
9. JobSpy (python-jobspy) — Scraper Indeed mã nguồn mở miễn phí tốt nhất
JobSpy là lựa chọn mã nguồn mở đáng nhắc tới vì vẫn đủ hoạt động để tiếp tục nằm trong cuộc thảo luận. Kho GitHub của dự án cho thấy khoảng 3,2 nghìn sao, 58 bản phát hành, và hỗ trợ Indeed, LinkedIn, Glassdoor, ZipRecruiter, Google Jobs, Bayt và Bdjobs. Nó xuất ra pandas DataFrame và CSV.
- Tính năng chính: Scrape nhiều bảng việc làm trong một script, xuất DataFrame/CSV, hoàn toàn miễn phí, cộng đồng còn hoạt động
- Xử lý chống bot: Rất ít. Không có xoay vòng proxy tích hợp, không giải CAPTCHA. Bạn phải tự lo. Các issue công khai có nhiều báo cáo về việc Indeed chặn hoặc làm hỏng kết quả.
- Giá: Miễn phí (mã nguồn mở). Nhưng chi phí proxy và thời gian gỡ lỗi của bạn thì không miễn phí.
Chi phí ẩn của “miễn phí”
Điều này đáng nói rõ. “Miễn phí bằng tiền” không có nghĩa là miễn phí về thời gian. Nếu dùng JobSpy, bạn nên chuẩn bị tinh thần mất hàng giờ để gỡ lỗi các chặn Cloudflare, cấu hình xoay vòng proxy và sửa lỗi sau mỗi lần Indeed thay đổi giao diện. Với một nhà phát triển Python thích kiểu công việc đó, đây là một sự đánh đổi hợp lý. Với một nhà tuyển dụng chỉ cần 200 tin việc làm trong bảng tính, đây là một lựa chọn rất tệ.
Phù hợp nhất cho: Nhà phát triển Python thích scrape nhiều bảng việc làm và không


