Craigslist trông như chưa thay đổi từ năm 2003, nhưng dữ liệu ẩn trong những tin đăng dạng văn bản đơn giản đó lại có giá trị đáng ngạc nhiên. Với ~127 triệu lượt truy cập mỗi tháng và hàng chục triệu bài đăng mới mỗi tháng, đây vẫn là một trong những nền tảng rao vặt lớn nhất ở Mỹ — và lại không có API công khai để khai thác.
Tôi đã nhiều năm xây dựng các công cụ tự động hóa tại Thunderbit, và điều tôi thường xuyên nghe từ các đội sales, vận hành và bất động sản là: "Tôi cần dữ liệu Craigslist trong một bảng tính, và tôi không muốn copy-paste suốt ba tiếng đồng hồ." Vấn đề là hầu hết các bài hướng dẫn về "công cụ thu thập dữ liệu Craigslist tốt nhất" đều đã cũ, né tránh phần khó (như cơ chế chống bot), hoặc chỉ liệt kê công cụ mà không thực sự so sánh chúng.
Vì vậy, tôi đã tổng hợp hướng dẫn này với 10 công cụ vẫn thực sự hoạt động trong năm 2026 — từ tiện ích Chrome không cần code, đến nền tảng proxy cấp doanh nghiệp, đến thư viện Python mã nguồn mở. Dù bạn là người dùng doanh nghiệp chưa từng viết một dòng code nào hay là developer sống cùng Python, ở đây đều có lựa chọn phù hợp.
Vì sao nên thu thập dữ liệu Craigslist trong năm 2026? Các trường hợp sử dụng hàng đầu cho đội ngũ kinh doanh
Craigslist nhìn thì cũ, nhưng đó cũng chính là một phần sức hút — và giá trị của nó. Nó vẫn đứng thứ 3 toàn cầu trong số các trang rao vặt, và hoạt động trên 416 mục dành cho các bang/lãnh thổ và khu vực ở Mỹ trong danh mục chính thức. Đó là một khối lượng lớn hàng hóa/danh mục siêu địa phương mà bạn không thể tìm thấy ở một nơi nào khác.
Đây là những trường hợp sử dụng mà tôi thấy các đội ngũ quay lại hết lần này đến lần khác:
- Tìm kiếm khách hàng tiềm năng: Các bài đăng dịch vụ và việc làm thời vụ thường có mô tả doanh nghiệp, khu vực địa lý và đường dẫn liên hệ qua Craigslist — đủ để đội sales xây dựng danh sách lead địa phương.
- Theo dõi bất động sản: Các trang nhà ở hiển thị tiền thuê, khu vực lân cận, số phòng ngủ/phòng tắm, diện tích và thời gian đăng — rất phù hợp để so sánh giá thuê và theo dõi tình trạng còn trống.
- So sánh giá cạnh tranh: Các tin rao bán cho thấy tiêu đề, giá, tình trạng và vị trí, rất hữu ích cho nghiên cứu bán lại hoặc arbitrage.
- Tuyển dụng và theo dõi thị trường lao động: Các danh mục việc làm và gig hiển thị mức thù lao, loại hình việc làm và mô tả vai trò để quét thị trường nhân lực địa phương.
- Phân tích thị trường đa khu vực: Vì Craigslist được chia theo subdomain và thành phố, bạn có thể truy vấn theo từng khu vực để xem giá, khối lượng hay cơ cấu danh mục.
- Tự động hóa quy trình: Nhiều người chỉ muốn dữ liệu Craigslist đổ thẳng vào CSV, Google Sheets, Airtable hoặc CRM — không cần duyệt thủ công.
Một người dùng báo cáo rằng một lần thu thập Craigslist hằng ngày vốn mất 60–90 phút đã giảm xuống còn khoảng 5 phút nhờ tự động hóa. Đó là mức tiết kiệm thời gian tăng lên rất nhanh theo quy mô.
Thu thập dữ liệu Craigslist bằng AI Get Started Free
Cách chúng tôi chọn ra các công cụ thu thập dữ liệu Craigslist tốt nhất: Tiêu chí đánh giá
Không phải công cụ thu thập dữ liệu Craigslist nào cũng giống nhau, và "tốt nhất" còn phụ thuộc rất nhiều vào bạn là ai và bạn cần gì. Tôi đánh giá từng công cụ theo 6 tiêu chí:
- Mức độ dễ thiết lập — Có thân thiện với người mới (không cần code), hay đòi hỏi developer?
- Khả năng xử lý chống bot của Craigslist — Có xoay proxy sẵn, xử lý CAPTCHA, hoặc giả lập dấu vân tay trình duyệt không?
- Mức giá — Miễn phí, freemium, trả phí hay cấp doanh nghiệp?
- Tùy chọn xuất dữ liệu — CSV, Excel, Google Sheets, Airtable, Notion, JSON, cơ sở dữ liệu?
- Hỗ trợ đa khu vực — Có thể thu thập trên toàn bộ 416 site Craigslist ở Mỹ hay chỉ một thành phố mỗi lần?
- Công sức bảo trì — Công cụ có gãy khi Craigslist đổi bố cục trang hay tự thích ứng được?
Tôi chưa thấy bài viết đối thủ nào đưa ra so sánh song song bằng bộ tiêu chí nhất quán như vậy — nên nếu bạn từng khó chịu với những danh sách "top 10" mơ hồ, bài này dành cho bạn.
10 công cụ thu thập dữ liệu Craigslist tốt nhất nhìn nhanh
Trước khi đi sâu vào từng công cụ, đây là bảng so sánh tổng quan. Tôi đã chia chúng thành 3 nhóm: công cụ không cần code cho người dùng doanh nghiệp, nền tảng cấp doanh nghiệp cho quy mô lớn, và thư viện mã nguồn mở cho developer.
| Công cụ | Loại | Có gói miễn phí không? | Hỗ trợ proxy / chống bot | Xử lý CAPTCHA | Định dạng xuất | Phù hợp nhất cho |
|---|---|---|---|---|---|---|
| Thunderbit | Tiện ích Chrome không cần code | Có (6 trang/tháng) | Chế độ trình duyệt (không cần proxy cho các lần chạy vừa phải) | Không áp dụng (phiên trình duyệt) | Excel, Sheets, Airtable, Notion, CSV, JSON | Người dùng doanh nghiệp không rành kỹ thuật |
| Bright Data | Scraper doanh nghiệp + proxy + dataset | Dùng thử | Unblocking được quản lý, proxy, thử lại, render | Có (tự xử lý) | JSON, NDJSON, CSV, Parquet, XLSX, API | Thu thập ở quy mô doanh nghiệp |
| Oxylabs | API + bộ proxy | Dùng thử | Unblocking được quản lý, proxy residential/ISP | Có | HTML, ảnh chụp màn hình, đầu ra API | Developer cần hạ tầng cấp doanh nghiệp |
| Apify | Marketplace actor trên cloud | Có ($5/tháng credit) | Xoay proxy (tùy actor) | Một phần / tùy actor | JSON, CSV, XML, Excel, JSONL | Tự động hóa cloud linh hoạt, ít code |
| ParseHub | Trình thu thập trực quan không cần code | Có | Xoay proxy trả phí, chạy cloud | Không phải tính năng cốt lõi | CSV, JSON, API/S3/Dropbox (trả phí) | Người dùng no-code tiết kiệm ngân sách |
| Phantombuster | Nền tảng tự động hóa cloud | Có (giới hạn) | Có hỗ trợ proxy | Theo credit / theo workflow | CSV, JSON (trả phí) | Tự động hóa sales đa nền tảng |
| Scrapy | Trình thu thập Python mã nguồn mở | Miễn phí (OSS) | Tự chuẩn bị proxy/middleware | Không | JSON, JSONL, CSV, XML, DB | Trình thu thập cho môi trường production |
| Playwright | Tự động hóa trình duyệt mã nguồn mở | Miễn phí (OSS) | Tự chuẩn bị browser/proxy | Không | Xuất tùy biến | Kiểm soát ở cấp trình duyệt |
| Selenium | Tự động hóa trình duyệt mã nguồn mở | Miễn phí (OSS) | Tự chuẩn bị browser/proxy | Không | Xuất tùy biến | Stack đa ngôn ngữ kiểu cũ |
| BeautifulSoup | Trình phân tích HTML mã nguồn mở | Miễn phí (OSS) | Không có sẵn | Không | Xuất tùy biến | Phân tích nhẹ, đơn giản |
Có 3 nhóm nổi bật ở đây:
- Công cụ không cần code (Thunderbit, ParseHub, Phantombuster) dành cho người dùng doanh nghiệp muốn có dữ liệu mà không cần gánh nặng kỹ thuật.
- Nền tảng cấp doanh nghiệp (Bright Data, Oxylabs, Apify) dành cho đội ngũ cần quy mô, hạ tầng chống bot và cơ chế bàn giao được quản lý.
- Công cụ mã nguồn mở cho developer (Scrapy, Playwright, Selenium, BeautifulSoup) dành cho mức độ kiểm soát tối đa — đổi lại là công sức thiết lập, bảo trì và quản lý proxy.
Bây giờ là phần đi sâu vào từng công cụ.
1. Thunderbit
Thunderbit là một tiện ích Chrome chạy bằng AI, được xây dựng cho những ai muốn lấy dữ liệu có cấu trúc từ bất kỳ trang web nào — bao gồm cả Craigslist — mà không cần viết code hay cấu hình proxy.
Tôi thiên vị ở đây (vì chúng tôi đã xây dựng nó), nhưng lý do tôi đặt Thunderbit lên đầu là vì nó giải quyết đúng những điểm đau mà việc thu thập Craigslist tạo ra cho người dùng không rành kỹ thuật: bố cục trang thay đổi theo danh mục, làm giàu dữ liệu từ trang chi tiết, và tình trạng hỏng liên tục khi selector CSS thay đổi.
Cách hoạt động trên Craigslist:
- Cài đặt Thunderbit Chrome Extension và mở một trang danh sách Craigslist bất kỳ (ví dụ: căn hộ trong thành phố của bạn).
- Nhấp "AI Suggest Fields" — AI của Thunderbit sẽ đọc trang và đề xuất các cột phù hợp với nội dung thực tế trên đó. Với nhà ở, bạn sẽ có Title, Price, Sqft, Bedrooms, Location, Date Posted, Link. Với việc làm, bạn sẽ có Title, Compensation, Job Type, v.v. Không cần tự cấu hình selector.
- Nhấp "Scrape" và xem dữ liệu được đổ vào một bảng có cấu trúc.
- Xử lý phân trang — Thunderbit hoạt động tốt với kiểu phân trang dựa trên click của Craigslist.
- Dùng "Scrape Subpages" để mở từng tin riêng lẻ và lấy các trường chỉ có trên trang chi tiết: mô tả đầy đủ, toàn bộ ảnh, thông tin liên hệ nhúng, và nhiều hơn nữa.
- Xuất sang Google Sheets, Excel, Airtable, Notion hoặc CSV — miễn phí.
Tính năng chính:
- Nhận diện trường bằng AI: Tự động thích ứng với các danh mục Craigslist khác nhau — nhà ở sẽ có các cột sqft/phòng ngủ, việc làm có compensation/job type, hàng bán có tình trạng/giá. Không cần đụng vào CSS.
- Thu thập subpage: Sau khi quét trang kết quả, mở từng tin để lấy các trường ở trang chi tiết (mô tả đầy đủ, ảnh, thông tin liên hệ).
- Chế độ thu thập dựa trên trình duyệt: Chạy trong chính phiên Chrome của bạn, nên không cần proxy cho khối lượng vừa phải. Điều đó tự nó đã cắt giảm đáng kể chi phí và độ phức tạp.
- Không cần bảo trì: AI đọc lại trang từ đầu mỗi lần. Khi Craigslist đổi bố cục (và điều đó vẫn xảy ra), scraper của bạn không bị gãy.
- Xuất miễn phí: Excel, Google Sheets, Airtable, Notion, CSV, JSON — không khóa sau paywall.
Giá: Gói miễn phí (6 trang/tháng), bản dùng thử miễn phí (10 trang), gói trả phí cho nhu cầu lớn hơn.
Phù hợp nhất cho: Đội sales thu thập lead từ mục dịch vụ/gig trên Craigslist, đội bất động sản theo dõi giá thuê, đội vận hành cần dữ liệu Craigslist có cấu trúc mà không cần hỗ trợ developer, và bất kỳ ai muốn thu thập, gắn nhãn và xuất dữ liệu trong một bước.
Dùng thử Thunderbit cho việc thu thập Craigslist
2. Bright Data
Bright Data là lựa chọn nặng ký ở cấp doanh nghiệp. Đây là nền tảng duy nhất trong danh sách này vừa có trang sản phẩm Craigslist Scraper chuyên biệt, vừa có marketplace Craigslist Dataset.
Nếu bạn cần thu thập hàng nghìn tin Craigslist mỗi ngày trên toàn bộ các khu vực ở Mỹ, Bright Data được xây dựng cho quy mô đó. Web Unlocker của họ xử lý IP, retry, rendering và chặn truy cập — bao gồm cả tự động giải CAPTCHA theo mặc định. Web Scraper IDE cho phép bạn xây dựng workflow thu thập Craigslist tùy chỉnh, và bạn có thể lặp qua toàn bộ 416 URL khu vực theo lập trình.
Tính năng chính:
- Mạng proxy residential khổng lồ (hàng triệu IP)
- Có sẵn giải CAPTCHA và vượt cơ chế chống bot
- Sản phẩm scraper và dataset dành riêng cho Craigslist
- Xuất: JSON, NDJSON, CSV, Parquet, XLSX, giao qua API, webhook
Giá: Scraper Craigslist có mức giá 0,5 USD cho mỗi 1.000 lượt tải trang theo kiểu trả theo mức dùng, với các gói như 380.000 lượt tải trang giá 499 USD. Proxy residential bắt đầu từ 4 USD/GB theo mức dùng. Có bản dùng thử 1.000 request trong một tuần.
Phù hợp nhất cho: Các đội doanh nghiệp cần thu thập Craigslist khối lượng lớn, đa khu vực với thời gian hoạt động được đảm bảo và hỗ trợ chuyên biệt. Các nhóm nhỏ quan tâm ngân sách nên tìm lựa chọn khác.
3. Oxylabs
Oxylabs là nhà cung cấp hạ tầng proxy và scraping cao cấp, có Craigslist Scraper API riêng và trang proxy Craigslist.
Oxylabs thiên về developer hơn so với cách tiếp cận all-in-one của Bright Data. Web Scraper API và Web Unblocker hỗ trợ render JS, retry, quản lý phiên, sinh fingerprint và xử lý chống bot ở phạm vi rộng hơn. Bản dùng thử của Craigslist Scraper API hỗ trợ tối đa 2.000 kết quả.
Tính năng chính:
- Pool proxy residential và ISP (residential từ 6 USD/GB, ISP từ 0,60 USD/IP)
- Web Unblocker với fingerprint tự động và quản lý phiên
- Endpoint API chuyên cho Craigslist
- Có bản dùng thử 7 ngày
Giá: Web Scraper API cho các site "khác" bắt đầu khoảng 0,15 USD/1.000 kết quả nếu không có JS, 0,35 USD/1.000 kết quả nếu có JS. Gói Web Unblocker mức micro từ khoảng 75 USD/tháng. Proxy residential ở quy mô lớn có thể vào khoảng 0,50 USD/GB ở mức 1TB.
Phù hợp nhất cho: Các đội developer muốn hạ tầng proxy được quản lý và workflow dựa trên API để thu thập Craigslist bền vững. Các đội đã dùng proxy Oxylabs cho dự án khác sẽ thấy rất dễ thêm Craigslist vào.
4. Apify
Apify là nền tảng tự động hóa và thu thập dữ liệu web trên cloud với marketplace các "Actor" dựng sẵn — tức các scraper template bạn có thể chạy mà không cần viết code.
Bức tranh Craigslist trên Apify khá thú vị: có nhiều actor do cộng đồng duy trì với chất lượng rất khác nhau. Actor ivanvs/craigslist-scraper có tổng cộng 829 người dùng và đánh giá 5,0, trong khi automation-lab/craigslist-scraper có 44 người dùng và đánh giá 1,0. Chất lượng không đồng đều, nên bạn sẽ muốn thử trước khi quyết định dùng lâu dài.
Tính năng chính:
- Có nhiều actor Craigslist (một số có thể trích xuất ~120 tin mỗi trang với độ trễ tích hợp sẵn)
- Chạy cloud, lên lịch tự động, truy cập API, tích hợp webhook
- Có xoay proxy
- Xuất: JSON, CSV, XML, Excel, JSONL
Giá: Gói miễn phí với 5 USD/tháng credit, gói trả phí từ khoảng 49 USD/tháng. Giá tính theo compute có thể tăng mạnh nếu dùng nhiều — hãy theo dõi lượng CU tiêu thụ.
Phù hợp nhất cho: Các đội muốn giải pháp chạy trên cloud mà không phải tự quản hạ tầng, người dùng thoải mái với cấu hình ít code, và đội cần thu thập Craigslist định kỳ theo lịch.
5. ParseHub
ParseHub là công cụ thu thập dữ liệu web trực quan chạy trên máy tính, nơi bạn trỏ và nhấp vào các phần tử trên trang để định nghĩa dữ liệu cần lấy.
Để thiết lập một lần thu thập Craigslist trong ParseHub, bạn nhấp vào tiêu đề tin đăng, giá và liên kết để dạy công cụ biết cần lấy gì. Nó xử lý phân trang bằng vòng lặp click AJAX và hỗ trợ chạy cloud ở các gói trả phí. Gói miễn phí cho bạn tối đa 5 project, khá ổn cho công việc Craigslist quy mô nhỏ.
Tính năng chính:
- Trình xây workflow trực quan bằng point-and-click
- Hỗ trợ phân trang và nội dung động
- Chạy cloud và lập lịch ở gói trả phí
- Xuất: CSV, Excel, JSON
Giá: Gói miễn phí (5 project), gói trả phí từ khoảng 189 USD/tháng cho nhiều trang hơn và chạy theo lịch.
Hạn chế: Có thể chậm với các lần thu thập quy mô lớn, số lần chạy theo lịch bị giới hạn ở gói miễn phí, và — quan trọng nhất — nó dựa trên CSS selector nên cần bảo trì thủ công khi Craigslist đổi bố cục.
Phù hợp nhất cho: Người dùng cá nhân hoặc nhóm nhỏ có nhu cầu thu thập vừa phải, muốn một công cụ trực quan, không cần code, nhưng không cần nhận diện trường bằng AI.
6. Phantombuster
Phantombuster là nền tảng tự động hóa trên cloud, ban đầu nổi tiếng với việc thu thập dữ liệu LinkedIn và mạng xã hội. Đây không phải công cụ dành riêng cho Craigslist, nhưng Web Element Extractor của nó có thể thu thập các trang công khai bằng CSS selector.
Thiết lập thu thập Craigslist trong Phantombuster tốn công hơn một công cụ chuyên biệt — bạn sẽ phải chỉ định selector, xây workflow và thiết lập lịch chạy. Nhưng nếu bạn đã dùng Phantombuster cho LinkedIn hoặc thu thập lead từ mạng xã hội, thêm Craigslist vào pipeline là khá thẳng.
Tính năng chính:
- Mẫu tự động hóa dựng sẵn và chạy cloud
- Lập lịch và tích hợp CRM
- Có hỗ trợ proxy và credit giải CAPTCHA
- Xuất: CSV, JSON ở gói trả phí (gói miễn phí giới hạn 10 dòng)
Giá: Gói miễn phí với 5 slot, 2 giờ/tháng và giới hạn xuất 10 dòng. Gói trả phí theo năm bắt đầu khoảng 56 USD/tháng nếu thanh toán hằng năm.
Phù hợp nhất cho: Đội sales đã dùng Phantombuster cho tìm kiếm lead đa nền tảng và muốn thêm Craigslist vào quy trình hiện có.
7. Scrapy
Scrapy là framework thu thập dữ liệu web bằng Python mã nguồn mở phổ biến nhất, và là lựa chọn hiển nhiên cho các đội developer muốn kiểm soát tối đa quá trình crawl Craigslist của mình.
Phiên bản ổn định mới nhất là 2.15.0 (9 tháng 4 năm 2026). Scrapy hỗ trợ crawl đa khu vực (duyệt qua toàn bộ URL khu vực), lập lịch và throttling request tích hợp, downloader middleware cho việc xoay proxy, và feed export sang CSV, JSON, JSONL, XML và pipeline cơ sở dữ liệu. Plugin scrapy-playwright bổ sung render ở cấp trình duyệt khi cần.
Tính năng chính:
- Trình crawl có khả năng tùy biến cao, đạt chuẩn production
- Middleware cho proxy, retry, cookie và xoay user-agent
- Feed export: JSON, JSONL, CSV, XML, pipeline cơ sở dữ liệu
- Miễn phí và mã nguồn mở
Chi phí ẩn: Bản thân Scrapy miễn phí, nhưng chạy ở quy mô lớn trên Craigslist đồng nghĩa với subscription proxy (50–500+ USD/tháng), chi phí hosting/server, và bảo trì liên tục khi Craigslist đổi cấu trúc HTML.
Phù hợp nhất cho: Các đội developer đã có kinh nghiệm Python, cần độ linh hoạt tối đa, hạ tầng proxy sẵn có, và crawl Craigslist đa khu vực ở khối lượng lớn.
8. Playwright
Playwright là một thư viện tự động hóa trình duyệt hiện đại của Microsoft, điều khiển Chromium, Firefox và WebKit bằng lập trình. Nhịp phát hành hiện tại vẫn rất đều — v1.59.1 ra mắt ngày 1 tháng 4 năm 2026.
Trong cộng đồng developer, Playwright ngày càng được khuyến nghị hơn Selenium cho việc thu thập Craigslist. Nó nhanh hơn, ổn định hơn, và có khả năng tránh phát hiện bot tốt hơn nhờ các plugin cộng đồng như playwright-extra. Nó hỗ trợ chế độ headless và có giao diện, tự chờ phần tử, chặn/điều hướng network, và chụp ảnh màn hình/PDF.
Tính năng chính:
- Hỗ trợ Python, JavaScript/TypeScript, Java và .NET
- Chế độ trình duyệt headless và có giao diện
- Tự chờ phần tử, chặn network
- Miễn phí và mã nguồn mở
Ưu thế với Craigslist: Playwright có thể mô phỏng hành vi người dùng thật thuyết phục hơn so với các request HTTP thuần túy, từ đó giảm rủi ro bị chặn. Cảm nhận chung trên Reddit cũng nghiêng về Playwright hơn Selenium cho các dự án mới.
Chi phí ẩn: Giống Scrapy — chi phí proxy, hosting và bảo trì khi selector gãy.
Phù hợp nhất cho: Developer cần kiểm soát trình duyệt ở mức chi tiết, đội xây scraper xử lý nội dung render bằng JavaScript, và bất kỳ ai thích một lựa chọn hiện đại thay cho Selenium.
9. Selenium
Selenium là framework tự động hóa trình duyệt lâu đời, được sử dụng rộng rãi. Bản phát hành mới nhất là 4.43.0 (10 tháng 4 năm 2026), và nó vẫn tiếp tục mở rộng năng lực BiDi và kiểm soát network.
Selenium hỗ trợ nhiều ngôn ngữ (Python, Java, C#, JavaScript) và tất cả các trình duyệt lớn. Nó có thể mô phỏng đầy đủ phiên trình duyệt, xử lý đăng nhập nếu cần, và cuộn qua các trang. Nhưng so với Playwright, nó chậm hơn, dài dòng hơn, và dễ bị phát hiện là bot hơn nếu không có thêm thư viện ẩn danh như undetected-chromedriver.
Tính năng chính:
- Hỗ trợ đa ngôn ngữ (Python, Java, C#, JavaScript)
- Mô phỏng trọn phiên trình duyệt
- Hệ sinh thái trưởng thành với tài liệu phong phú
- Miễn phí và mã nguồn mở
Hạn chế: Cảm nhận cộng đồng năm 2026 nghiêng về Playwright cho các dự án mới. Một thread trên Reddit lưu ý rằng Cloudflare vẫn phát hiện Selenium "kể cả khi dùng proxy residential" — khả năng ẩn danh không tốt sẵn như mong đợi.
Phù hợp nhất cho: Các đội developer đã đầu tư vào Selenium và không muốn chuyển đổi, dự án cần hỗ trợ đa ngôn ngữ (Java, C#), và các thiết lập thu thập kiểu cũ.
10. BeautifulSoup
BeautifulSoup là một thư viện Python nhẹ để phân tích HTML và XML. Phiên bản PyPI hiện tại là 4.14.3 (30 tháng 11 năm 2025).
Một điểm cần làm rõ: BeautifulSoup là trình phân tích, không phải một scraper hoàn chỉnh. Nó không tự tải trang web hay xử lý tự động hóa trình duyệt. Bạn ghép nó với thư viện requests để lấy nội dung HTTP, rồi nó phân tích HTML mà bạn đưa vào. Điều đó khiến nó trở thành điểm khởi đầu đơn giản nhất cho developer, nhưng cũng bị giới hạn nhiều nhất.
Tính năng chính:
- Rất dễ học — chỉ cần rất ít code
- Tuyệt vời cho các lần thu thập Craigslist nhỏ hoặc dùng một lần
- Miễn phí và mã nguồn mở
Hạn chế: Không có sẵn xử lý phân trang, không render JavaScript, không xoay proxy — mọi thứ phải tự thêm thủ công. Nếu Craigslist đổi cấu trúc HTML, selector của bạn sẽ gãy và bạn phải sửa tay.
Phù hợp nhất cho: Người mới học Python muốn thử thu thập Craigslist với thiết lập tối thiểu, kéo dữ liệu nhanh một lần từ một danh mục hoặc khu vực duy nhất, và developer chỉ cần một trình phân tích nhẹ.
Sổ tay chống cấm của Craigslist: Proxy, giới hạn tốc độ và những thứ khiến bạn bị chặn
Đây là phần mà phần lớn hướng dẫn về thu thập Craigslist bỏ qua, nhưng lại là phần quan trọng nhất. Thử nghiệm tháng 4/2026 của Scraperly xếp Craigslist vào mức độ khó 3/5, nêu rõ CAPTCHA tùy chỉnh, rate limiting và chặn IP. Hướng dẫn của Bright Data khuyên người dùng dùng Web Unlocker hoặc Scraping Browser dựa trên Playwright thay vì HTTP thuần. Trang proxy của Oxylabs cho biết Craigslist có thể phát hiện proxy và proxy residential là lựa chọn tốt nhất.
Đây là những gì thực sự hiệu quả:
| Chiến lược | Hiệu quả trên Craigslist | Chi phí | Độ phức tạp |
|---|---|---|---|
| Proxy residential | ✅ Cao | $$ (4–6 USD/GB) | Trung bình |
| Proxy ISP | ✅ Cao | $ (0,60–0,80 USD/IP) | Trung bình |
| Proxy datacenter | ⚠️ Thấp (thường bị chặn) | $ (0,20–0,40 USD/IP) | Thấp |
| Thu thập dựa trên trình duyệt (phiên riêng của bạn) | ✅ Trung bình-Cao | Miễn phí | Thấp |
| Giới hạn tốc độ + độ trễ ngẫu nhiên | ✅ Nền tảng bắt buộc | Miễn phí | Thấp |
Mẹo thực tế:
- Độ trễ giữa các request: Tối thiểu 2–5 giây giữa các request. Scraperly khuyên nên giữ khoảng 5–10 request/phút cho mỗi IP và xoay sau 20–30 request.
- Xoay phiên: Xoay user-agent và dấu vân tay trình duyệt. Các mẫu crawl có thể đoán trước sẽ bị phát hiện rất nhanh.
- Tránh proxy datacenter: Chúng rẻ nhưng bị chặn rất nhanh trên Craigslist.
- Thu thập dựa trên trình duyệt giúp loại bỏ hoàn toàn vấn đề proxy ở khối lượng vừa phải. Chế độ trình duyệt của Thunderbit chạy trong chính phiên Chrome của bạn — không cần thiết lập proxy, không cần xoay IP, không tốn thêm chi phí. Với hầu hết người dùng doanh nghiệp chỉ thu thập vài trăm tin, như vậy là đủ dư.
Và đây là khía cạnh bảo trì mà nhiều người bỏ sót: khi Craigslist đổi CSS của họ (và điều này xảy ra theo chu kỳ), mọi scraper dựa trên CSS selector đều gãy. Bạn phải kiểm tra trang, tìm selector mới, cập nhật code và thử lại. Các công cụ chạy bằng AI như Thunderbit tránh được hoàn toàn điều đó — AI đọc lại cấu trúc trang từ đầu mỗi lần, nên thay đổi bố cục không làm gián đoạn quy trình của bạn.
Code vs. No-code: Hai quy trình thu thập Craigslist đầy đủ
Tôi biết độc giả của bài này chia gần như 50/50: người dùng doanh nghiệp không rành kỹ thuật chỉ muốn lấy dữ liệu, và developer mới đến trung cấp muốn có code chạy được. Vì vậy, dưới đây là cả hai cách, đặt song song.
No-code: Cách thu thập Craigslist bằng Thunderbit (từng bước)
- Cài đặt Thunderbit Chrome Extension từ Chrome Web Store.
- Mở một trang danh sách Craigslist — ví dụ, căn hộ trong thành phố của bạn (
https://yourcity.craigslist.org/search/apa). - Nhấp "AI Suggest Fields" — AI của Thunderbit đọc trang và đề xuất các cột phù hợp với danh mục. Với nhà ở, bạn sẽ thấy Title, Price, Sqft, Bedrooms, Location, Date Posted, Link.
- Xem lại và chỉnh sửa các cột được đề xuất nếu cần. Thêm hoặc bớt trường chỉ bằng một cú nhấp.
- Nhấp "Scrape" — xem dữ liệu được đổ vào bảng có cấu trúc.
- Xử lý phân trang — nhấp qua các trang hoặc để Thunderbit tự xử lý.
- Dùng "Scrape Subpages" để mở từng tin riêng và làm giàu bằng các trường ở trang chi tiết: mô tả đầy đủ, toàn bộ ảnh, thông tin liên hệ nhúng.
- Xuất sang Google Sheets, Excel, Airtable, Notion hoặc CSV — miễn phí.
Toàn bộ quá trình chỉ mất khoảng 2 phút cho một trang kết quả. Không cần CSS selector, không cần proxy, không cần code.
Con đường code: Cách thu thập Craigslist bằng Python + Playwright
Playwright là thư viện được khuyến nghị nhiều nhất cho việc thu thập Craigslist trong các diễn đàn developer năm 2026. Dưới đây là một đoạn Python hoạt động, thu thập một trang kết quả nhà ở trên Craigslist, trích xuất tiêu đề/giá/liên kết, xử lý phân trang và xuất kết quả.
Cách tiếp cận: thử JSON-LD structured data trước (Craigslist nhúng schema ItemList trên một số trang), rồi mới rơi về selector DOM. Phân trang bằng s=120.
import asyncio, json
from urllib.parse import urlparse, parse_qs, urlencode, urlunparse
from playwright.async_api import async_playwright
def next_page_url(url, step=120):
p = urlparse(url)
qs = parse_qs(p.query)
offset = int(qs.get("s", ["0"])[0]) + step
qs["s"] = [str(offset)]
return urlunparse((p.scheme, p.netloc, p.path, "", urlencode(qs, doseq=True), ""))
async def scrape_page(page, url):
await page.goto(url, wait_until="domcontentloaded")
await page.wait_for_timeout(1500)
data = []
# Thử JSON-LD trước
for raw in await page.locator('script[type="application/ld+json"]').all_text_contents():
try:
obj = json.loads(raw)
except Exception:
continue
if isinstance(obj, dict) and obj.get("@type") == "ItemList":
for item in obj.get("itemListElement", []):
thing = item.get("item", {})
data.append({
"title": thing.get("name"),
"price": thing.get("offers", {}).get("price"),
"link": thing.get("url"),
})
if data:
return data
# Fallback: DOM selectors
cards = page.locator("div.cl-search-result, li.cl-static-search-result")
count = await cards.count()
for i in range(count):
card = cards.nth(i)
title = await card.locator("a.posting-title, a.titlestring").first.text_content()
link = await card.locator("a.posting-title, a.titlestring").first.get_attribute("href")
price = (await card.locator(".price, .result-price").first.text_content()
if await card.locator(".price, .result-price").count() else None)
data.append({"title": (title or "").strip(), "price": (price or "").strip(), "link": link})
return data
async def main():
start_url = "https://newyork.craigslist.org/search/apa?query=studio"
async with async_playwright() as p:
browser = await p.chromium.launch(headless=True)
page = await browser.new_page()
url = start_url
all_rows = []
for _ in range(3): # thu thập 3 trang
rows = await scrape_page(page, url)
if not rows:
break
all_rows.extend(rows)
url = next_page_url(url)
await browser.close()
for row in all_rows[:10]:
print(row)
asyncio.run(main())
Những gì bạn cần ngoài script này: Cài Playwright (pip install playwright && playwright install), cấu hình proxy cho các lần chạy khối lượng lớn, và xử lý CAPTCHA thủ công nếu gặp rate limit. Đó chính là sự đánh đổi: kiểm soát hoàn toàn, nhưng cũng chịu trách nhiệm hoàn toàn.
Miễn phí vs. trả phí: Phân tích chi phí trung thực cho từng công cụ Craigslist
Đây là bảng tôi ước gì mình có lúc bắt đầu nghiên cứu chủ đề này. "Miễn phí" là một từ dễ gây hiểu lầm trong web scraping.
| Công cụ | Hoàn toàn miễn phí? | Giới hạn gói miễn phí | Giá khởi điểm gói trả phí | Chi phí ẩn |
|---|---|---|---|---|
| Thunderbit | Gói miễn phí | 6 trang/tháng; dùng thử = 10 trang | Có gói trả phí cho nhu cầu cao hơn | Không có — xuất dữ liệu miễn phí |
| Scrapy | ✅ Mã nguồn mở | Không giới hạn | 0 USD | Chi phí proxy, hosting, bảo trì |
| BeautifulSoup | ✅ Mã nguồn mở | Không giới hạn | 0 USD | Chi phí proxy, hosting, bảo trì |
| Playwright | ✅ Mã nguồn mở | Không giới hạn | 0 USD | Chi phí proxy, hosting, bảo trì |
| Selenium | ✅ Mã nguồn mở | Không giới hạn | 0 USD | Chi phí proxy, hosting, bảo trì |
| ParseHub | Gói miễn phí | 5 project | ~189 USD/tháng | Chạy theo lịch bị giới hạn ở gói miễn phí |
| Apify | Gói miễn phí | Tặng 5 USD/tháng credit | ~49 USD/tháng | Giá tính theo compute có thể tăng mạnh |
| Phantombuster | Gói miễn phí | 5 slot, 2 giờ/tháng, xuất 10 dòng | ~56 USD/tháng (năm) | Giá theo slot |
| Bright Data | Chỉ dùng thử | 1.000 request/1 tuần | ~500+ USD/tháng | Phụ phí proxy |
| Oxylabs | Chỉ dùng thử | 2.000 kết quả / 1 GB | ~75+ USD/tháng (Unblocker) | Giá cấp doanh nghiệp |
Dấu sao lớn trong phần "miễn phí" của các công cụ mã nguồn mở: Scrapy, Playwright, Selenium và BeautifulSoup tốn 0 USD để cài đặt, nhưng chạy ở quy mô lớn trên Craigslist đồng nghĩa với hàng giờ công của developer để thiết lập, 50–500+ USD/tháng cho proxy residential, và bảo trì liên tục mỗi khi Craigslist đổi HTML. Chế độ AI của Thunderbit đọc lại trang từ đầu mỗi lần (không cần bảo trì), xuất dữ liệu miễn phí, và thu thập dựa trên trình duyệt giúp loại bỏ chi phí proxy ở khối lượng vừa phải. Đó là một lợi thế thực sự cho người không phải developer.
Bạn thực sự có thể trích xuất gì: Các trường dữ liệu Craigslist theo từng danh mục
Các danh mục Craigslist khác nhau có cấu trúc dữ liệu hoàn toàn khác nhau. Một tin nhà ở không giống chút nào với một tin việc làm. Đây là những gì bạn có thể trích xuất một cách thực tế từ từng mục chính:
| Danh mục Craigslist | Trường có thể trích xuất | Có thông tin liên hệ không? |
|---|---|---|
| Nhà ở / Căn hộ | Tiêu đề, Giá, Diện tích, Phòng ngủ, Phòng tắm, Vị trí, Ngày đăng, Ảnh, Mô tả, Link bản đồ, Tình trạng còn trống, Chính sách thú cưng, Giặt là/Đỗ xe | ⚠️ Đôi khi (email relay ẩn danh) |
| Hàng bán | Tiêu đề, Giá, Tình trạng, Vị trí, Ngày đăng, Ảnh, Mô tả, Hãng/Mẫu/Năm (tùy) | ⚠️ Đôi khi |
| Việc làm | Tiêu đề, Công ty, Mức thù lao, Vị trí, Loại việc, Cấp độ kinh nghiệm, Ngày đăng, Mô tả | Hiếm khi (thường chỉ có link ứng tuyển) |
| Dịch vụ | Tiêu đề, Vị trí, Mô tả, Ảnh | ⚠️ Đôi khi |
| Gig | Tiêu đề, Mức thù lao, Vị trí, Ngày đăng, Mô tả | ⚠️ Đôi khi |
Một vài lưu ý quan trọng:
- Thông tin liên hệ: Craigslist dùng email relay ẩn danh để ngăn việc thu thập email trực tiếp. Những công cụ nói rằng chúng "trích xuất email" thường chỉ đang lấy địa chỉ relay (
reply+randomstring@craigslist.org), chứ không phải email thật của người đăng. - Các trường ở trang chi tiết như mô tả đầy đủ, toàn bộ ảnh và thông tin liên hệ nhúng chỉ xuất hiện khi bạn mở từng tin riêng — không có trên trang kết quả tìm kiếm.
- "AI Suggest Fields" của Thunderbit tự động phát hiện những trường nào đang có trên trang hiện tại và đề xuất cấu trúc cột phù hợp. Người dùng thu thập nhà ở sẽ thấy cột sqft/phòng ngủ; người thu thập việc làm sẽ thấy cột compensation/job type — không cần cấu hình thủ công. Tính năng thu thập subpage sau đó sẽ mở từng tin để lấy các trường chỉ có ở trang chi tiết.
Kiểm tra thực tế về pháp lý: Điều khoản Craigslist, vụ 3Taps, và điều bạn nên biết
Tôi không phải luật sư, và đây không phải tư vấn pháp lý. Nhưng tôi biết người dùng luôn lo về vấn đề này, và nó xứng đáng có một câu trả lời thẳng thắn.
Tiền lệ quan trọng: Trong Craigslist v. 3Taps (2013), Craigslist đã giành được lệnh cấm đối với 3Taps vì thu thập và đăng lại tin sau khi đã gửi thông báo chấm dứt. 3Taps bị cáo buộc đã vượt qua chặn IP bằng proxy server, và tòa coi việc truy cập sau khi bị chặn là có thể "không được phép." EFF ghi nhận vụ việc đã được dàn xếp vào năm 2015.
Điều khoản sử dụng của Craigslist nêu rõ cấm dùng "robots, spiders, scripts, scrapers, crawlers hoặc bất kỳ công cụ tự động hay thủ công tương đương nào" để tương tác với site. Họ thậm chí còn đặt mức bồi thường theo thỏa thuận là 0,25 USD cho mỗi trang sau 1.000 lượt xem trang đầu tiên trong khung 24 giờ nếu vi phạm.
Hướng dẫn thực tế:
- ✅ Thu thập dữ liệu tin đăng công khai cho nghiên cứu thị trường hoặc mục đích cá nhân
- ✅ Tôn trọng robots.txt và giới hạn tốc độ
- ⚠️ Không đăng lại hàng loạt các tin đã thu thập
- ⚠️ Không dùng thông tin liên hệ thu thập được cho marketing không xin phép
- ❌ Không vượt qua các hạn chế truy cập kỹ thuật sau khi đã bị chặn
Ranh giới ở đây rất quan trọng: thu thập dữ liệu công khai để bạn tự phân tích khác với việc đăng lại hàng loạt hoặc gom email để spam. Nhưng cần lưu ý rằng Craigslist trong lịch sử đã leo thang từ thực thi điều khoản, sang chặn IP, rồi đến hành động pháp lý.
Công cụ thu thập Craigslist nào phù hợp nhất với bạn?
Sau khi thử và đánh giá cả 10 công cụ, đây là khuyến nghị theo từng tình huống của tôi:
- Người dùng doanh nghiệp không rành kỹ thuật nhưng cần dữ liệu Craigslist nhanh → Thunderbit. Không cần code, nhận diện trường bằng AI, không cần bảo trì, xuất dữ liệu miễn phí. Con đường nhanh nhất từ "tôi cần dữ liệu này" đến "nó đã nằm trong bảng tính của tôi".
- Đội doanh nghiệp thu thập hàng nghìn tin mỗi ngày trên mọi khu vực → Bright Data. Scraper chuyên cho Craigslist, hạ tầng proxy khổng lồ, tự động giải CAPTCHA, hỗ trợ chuyên biệt.
- Đội developer cần hạ tầng proxy/API được quản lý → Oxylabs cho workflow ưu tiên proxy, Apify cho sự linh hoạt của marketplace actor.
- Developer muốn toàn quyền kiểm soát và tùy biến → Scrapy + Playwright. Mã nguồn mở, linh hoạt tối đa, nhưng phải tự lo proxy và bảo trì.
- Người dùng quan tâm ngân sách nhưng nhu cầu vừa phải → gói miễn phí của Apify (credit 5 USD/tháng) hoặc gói miễn phí của ParseHub (5 project).
- Đội sales đã dùng công cụ tìm lead đa nền tảng → Phantombuster. Thêm Craigslist vào pipeline hiện có.
- Người mới học Python làm một lần thu thập ngắn → BeautifulSoup + requests. Ít code, ít thiết lập, ít khả năng hơn.
Với phần lớn người dùng doanh nghiệp không rành kỹ thuật, Thunderbit mang lại sự cân bằng tốt nhất giữa dễ dùng, độ chính xác và chi phí. Với developer, Scrapy + Playwright là tổ hợp mạnh nhất. Còn ở quy mô doanh nghiệp, Bright Data rất khó bị vượt qua.
Nếu bạn muốn xem thu thập Craigslist bằng AI thực sự trông như thế nào, hãy thử Thunderbit — gói miễn phí là đủ để kiểm tra trên chính nhu cầu của bạn. Và nếu bạn muốn đi sâu hơn vào kỹ thuật web scraping, hãy xem các hướng dẫn của chúng tôi về cách scrape vào Google Sheets, những công cụ web scraping tự động tốt nhất, và web scraping mà không bị chặn. Bạn cũng có thể khám phá kênh YouTube của chúng tôi để xem video hướng dẫn từng bước.
Chúc bạn thu thập dữ liệu thuận lợi — và mong dữ liệu của bạn luôn sạch, có cấu trúc và sẵn sàng để hành động.
Câu hỏi thường gặp
Thu thập tin Craigslist có hợp pháp không?
Điều khoản sử dụng của Craigslist nêu rõ cấm thu thập tự động, và vụ Craigslist v. 3Taps là tiền lệ pháp lý quan trọng nhất. Thu thập dữ liệu tin công khai cho mục đích cá nhân hoặc phân tích thường được xử lý khác với việc đăng lại hàng loạt hoặc spam, nhưng bạn luôn nên tôn trọng giới hạn tốc độ và quy tắc của site — và đây không phải tư vấn pháp lý.
Tôi có thể thu thập Craigslist mà không cần code không?
Có. Các công cụ như Thunderbit, ParseHub và Apify đều cung cấp tùy chọn không cần code hoặc ít code để trích xuất dữ liệu Craigslist. Khả năng nhận diện trường bằng AI của Thunderbit làm mọi thứ đặc biệt dễ — chỉ cần nhấp "AI Suggest Fields" rồi "Scrape."
Công cụ thu thập Craigslist miễn phí tốt nhất là gì?
Với developer, Scrapy hoặc BeautifulSoup là hoàn toàn miễn phí và mã nguồn mở (dù chi phí proxy và bảo trì vẫn cộng dồn). Với người không viết code, gói miễn phí của Thunderbit (6 trang/tháng) là điểm khởi đầu tốt nhất, còn gói miễn phí của ParseHub (5 project) là một lựa chọn khác.
Làm sao để tránh bị chặn khi thu thập Craigslist?
Hãy dùng giới hạn tốc độ (tối thiểu chậm 2–5 giây giữa các request), xoay user-agent, tránh proxy datacenter (proxy residential hoặc ISP hiệu quả hơn nhiều trên Craigslist), và đừng đi theo các mẫu crawl có thể đoán trước. Với khối lượng vừa phải, các công cụ thu thập dựa trên trình duyệt như Thunderbit sẽ né được vấn đề proxy hoàn toàn bằng cách chạy ngay trong phiên Chrome của bạn.
Tôi có thể thu thập tất cả khu vực Craigslist cùng lúc không?
Với công cụ developer như Scrapy hoặc Playwright, bạn có thể lặp qua theo lập trình toàn bộ 416 URL khu vực ở Mỹ/lãnh thổ. Các công cụ doanh nghiệp như Bright Data và Oxylabs có sẵn hỗ trợ đa khu vực. Với Thunderbit, bạn chỉ cần mở từng site khu vực và thu thập bằng cùng một workflow — AI sẽ tự thích ứng với từng trang.
Dùng thử Thunderbit cho việc thu thập Craigslist Get Started Free
Tìm hiểu thêm


