Nói thật nhé: lần đầu tôi thử lấy hết URL từ một website lớn, tôi cứ nghĩ, “Chắc có gì khó đâu?” Vài tiếng sau, tôi vẫn đang click qua hết trang này đến trang khác, copy-paste link vào bảng tính, và bắt đầu tự hỏi về những lựa chọn của đời mình. Nếu bạn từng cố tìm tất cả các trang trên một website — dù để audit nội dung, tạo danh sách lead hay nghiên cứu đối thủ — thì bạn hiểu cảm giác đó. Việc này rất tẻ nhạt, dễ sai sót và, nói thẳng ra, chỉ làm phí thời gian lẫn công sức của bạn.
Nhưng tin vui là: bây giờ bạn không còn phải làm theo cách thủ công nữa. Các công cụ dùng AI như Thunderbit đang thay đổi cuộc chơi cho người dùng doanh nghiệp, giúp bạn tìm tất cả URL trên một domain chỉ trong vài phút, thay vì vài ngày. Thực tế, các công ty dùng công cụ web scraping dựa trên AI báo cáo tiết kiệm 30–40% thời gian cho các tác vụ thu thập dữ liệu, và có nơi còn giảm tới 80% thời gian so với cách làm thủ công. Đó không chỉ là một con số — mà là hàng giờ, thậm chí hàng ngày, bạn lấy lại được cho mình.
Vậy nên, hãy cùng đi vào lý do vì sao tìm tất cả các trang trên một website lại khó đến vậy, vì sao các mô hình AI chung như GPT hay Claude thực ra không giúp được nhiều, và vì sao các AI agent chuyên biệt — như Thunderbit — lại khiến việc này nhẹ như không. Và đúng vậy, tôi sẽ chỉ bạn cách trích xuất từng URL bạn cần, ngay cả khi bạn không biết code.
Vì sao việc tìm tất cả URL trên một domain lại khó đến thế
Nói thẳng ra: website không được thiết kế để đưa cho bạn một danh sách gọn gàng gồm mọi trang họ có. Chúng được xây cho người truy cập, chứ không phải cho những ai muốn tìm tất cả các trang trên một website cùng lúc. Đây là lý do khiến việc này đau đầu đến vậy:
- Ác mộng copy-paste thủ công: Click từng menu, từng danh sách, từng thư mục, rồi copy từng URL một vào bảng tính là công thức cho đau cổ tay (và bỏ sót một nửa số trang).
- Phân trang và cuộn vô tận: Nhiều site tách nội dung thành nhiều trang hoặc tải thêm kết quả khi bạn cuộn xuống. Chỉ cần bỏ qua nút “Next” hoặc không cuộn đủ xa là bạn sẽ mất cả một cụm nội dung.
- Cấu trúc trang không đồng nhất: Có trang liệt kê link theo một kiểu, có trang lại dùng bố cục khác. Theo dõi hết chúng là một cơn ác mộng.
- Trang ẩn hoặc trang mồ côi: Không phải trang nào cũng được link từ thanh điều hướng chính. Có những trang nằm sâu bên trong, chỉ có thể tìm qua sitemap hoặc tìm kiếm nội bộ.
- Lỗi do con người: Càng phải copy nhiều trang, bạn càng dễ nhầm — URL trùng, sai chính tả, hoặc đơn giản là bỏ quên mất một vài trang.

Và nếu bạn đang làm việc với một site có hàng trăm hay hàng nghìn trang thì sao? Bỏ cuộc đi. Trích xuất thủ công đơn giản là không thể mở rộng. Như một đội ngũ dữ liệu từng nói, với bất kỳ trường hợp nào vượt quá mức đơn giản, “bạn sẽ phải tự động hóa”.
“Tìm tất cả các trang trên một website” nghĩa là gì?
Trước khi đi vào giải pháp, hãy làm rõ mình đang muốn gì đã.
- URL nội bộ: Đây là các link trỏ tới những trang nằm trên cùng một domain (như /about-us hoặc /products/widget-123). Với hầu hết nhu cầu doanh nghiệp — audit nội dung, tạo lead, theo dõi sản phẩm — URL nội bộ là mục tiêu chính.
- URL ngoài: Là các link dẫn sang website khác. Thường thì bạn không cần chúng, trừ khi đang lập bản đồ các link đi ra ngoài.
- Trang danh sách vs. trang con: Nhiều site có các trang “hub” hoặc “list” (ví dụ: trang danh mục, blog archive, directory) rồi từ đó dẫn đến các trang chi tiết (như trang sản phẩm hoặc hồ sơ). Muốn thực sự tìm tất cả các trang trên một website, bạn phải crawl qua những trang danh sách này và lấy hết mọi trang con mà chúng dẫn tới.
- Trang mồ côi: Đây là những trang không được link từ bất kỳ nơi nào dễ thấy. Đôi khi bạn có thể bắt được chúng qua sitemap hoặc tìm kiếm nội bộ, nhưng rất dễ bị bỏ sót.
Vì vậy, khi nói về tìm tất cả URL trên một domain, ý của chúng ta là: lấy mọi URL trang nội bộ, từ trang chủ đến trang sản phẩm hoặc bài viết sâu nhất, lý tưởng nhất là ở định dạng bạn có thể dùng ngay, như một bảng tính.
Những cách truyền thống để tìm tất cả URL trên một domain
Có vài cách “kiểu cũ” để xử lý việc này, nhưng cách nào cũng có rắc rối riêng:
Copy-paste thủ công và công cụ trên trình duyệt
Đây là cách “dùng sức người”: click từng link, copy từng URL, dán vào bảng tính, rồi hy vọng không sót gì. Một số người dùng tiện ích mở rộng của trình duyệt để lấy toàn bộ link trên trang hiện tại, nhưng bạn vẫn phải lặp lại việc đó cho từng trang, và phần phân trang hay các khu vực ẩn thì bạn phải tự lo. Cách này ổn cho website có năm trang — chứ không ổn chút nào với site lớn hơn.
Dùng tìm kiếm site và sitemap
- Google site: Tìm site:yourdomain.com trên Google, bạn sẽ thấy một loạt trang đã được index. Nhưng Google chỉ hiển thị những gì nó đã index (thường bị giới hạn khoảng 1.000 kết quả), nên bạn sẽ bỏ lỡ các trang mới, trang ẩn hoặc trang chất lượng thấp. Tài liệu của chính Google cũng thừa nhận đây không phải là giải pháp đầy đủ.
- XML Sitemap: Nhiều site có /sitemap.xml liệt kê các URL quan trọng. Tuyệt — nếu sitemap luôn được cập nhật và có đủ mọi trang. Nhưng không phải site nào cũng có, và một số site còn chia sitemap thành nhiều file. Các trang mồ côi thường cũng không xuất hiện ở đó.
Crawler kỹ thuật và script
- Công cụ SEO (như Screaming Frog): Chúng crawl một site giống như công cụ tìm kiếm rồi xuất ra danh sách URL. Rất mạnh, nhưng cần thiết lập, cấu hình, và đôi khi phải mua bản quyền nếu site lớn.
- Python script (như Scrapy): Lập trình viên có thể viết script để crawl và trích xuất URL. Nhưng nói thật nhé: nếu bạn không quen code thì đây gần như là “không có cửa”. Chưa kể script còn dễ hỏng khi bố cục site thay đổi, nên lúc nào cũng phải chạy theo để sửa.
Kết luận ngắn gọn: Các cách truyền thống либо quá thủ công, либо thiếu đầy đủ, либо quá kỹ thuật với đa số người dùng doanh nghiệp. Không phải ngẫu nhiên mà rất nhiều người bỏ cuộc giữa chừng.
Vì sao các mô hình AI chung không thể tự động hóa hoàn toàn việc trích xuất URL
Có thể bạn đang nghĩ: “Thế tôi chỉ cần hỏi ChatGPT hoặc Claude tìm tất cả các trang trên website là xong chứ?” Giá mà dễ như vậy. Thực tế là:
- Không duyệt web trực tiếp: Các mô hình AI đa dụng như GPT hay Claude không thật sự duyệt web theo thời gian thực. Chúng không “nhìn thấy” trạng thái hiện tại của website — chúng chỉ dựa vào dữ liệu huấn luyện hoặc phần bạn dán vào.
- Không điều hướng web: Ngay cả khi có plugin hoặc bật chế độ duyệt web, LLM vẫn không biết click “Next”, xử lý infinite scroll, hay lần theo từng link trên site một cách có hệ thống.
- Bịa đặt thông tin: Khi bạn yêu cầu một AI chung liệt kê toàn bộ URL trên một domain, nó thường sẽ bịa ra những link nghe rất hợp lý nhưng thực tế không tồn tại. (Tôi đã thấy nó tự nghĩ ra trang /about-us cho những site chưa từng có trang đó.)
- Không xử lý được nội dung động: Các site tải nội dung bằng JavaScript, yêu cầu đăng nhập hoặc có điều hướng phức tạp đều nằm ngoài tầm với của các LLM chung.

Như hướng dẫn của Rayobyte nói: “Nếu bạn muốn scrape từ hàng trăm đến hàng nghìn trang… chỉ ChatGPT thôi là không đủ.” Bạn cần một công cụ được thiết kế riêng cho công việc này.
AI agent theo từng lĩnh vực là tương lai (và vì sao điều đó quan trọng)
Đây là chỗ kinh nghiệm của tôi trong SaaS và tự động hóa phát huy tác dụng: AI agent theo từng lĩnh vực — tức các công cụ AI được xây cho một phạm vi cụ thể, như trích xuất dữ liệu web — mới là cách duy nhất để có kết quả đáng tin cậy và có thể mở rộng cho các tác vụ doanh nghiệp. Vì sao?
- LLM đa dụng rất giỏi viết lách hoặc tìm kiếm, nhưng chúng dễ “ảo giác” và không xử lý được các quy trình nhiều bước, lặp lại với độ ổn định mà doanh nghiệp cần.
- Các công cụ SaaS cho doanh nghiệp cần tự động hóa rất nhiều tác vụ lặp đi lặp lại, có cấu trúc. Đó là lúc AI agent theo từng lĩnh vực phát huy lợi thế — chúng được xây để làm một việc, và làm thật tốt, với ít lỗi nhất.
- Ví dụ thì có ở khắp nơi: Thunderbit cho trích xuất dữ liệu web, Devin AI cho phát triển phần mềm, Alta cho tự động hóa bán hàng, IL VISTA của Infinity Learn cho giáo dục, Rippling cho nhân sự, Harvey cho pháp lý… còn rất nhiều nữa.
Tóm lại: nếu bạn muốn tìm tất cả các trang trên một website một cách đáng tin cậy, bạn cần một AI agent chuyên biệt được xây cho việc đó — chứ không phải một chatbot đa năng.
Gặp Thunderbit: trích xuất URL bằng AI cho mọi người
Trích xuất dữ liệu từ bất kỳ website nào bằng AI Get Started Free
Đây chính là lúc Thunderbit xuất hiện. Là một AI web scraper dưới dạng Chrome Extension, Thunderbit được thiết kế cho người dùng doanh nghiệp — không cần code, không cần thiết lập kỹ thuật, chỉ cần kết quả. Đây là những điểm khiến nó khác biệt:
- Giao diện ngôn ngữ tự nhiên: Chỉ cần mô tả thứ bạn muốn (“Liệt kê tất cả URL trang trên site này”), Thunderbit AI sẽ tự tìm cách trích xuất.
- AI Suggest Fields: Thunderbit quét trang và tự động gợi ý tên cột (như “Page URL”) — bạn không cần động vào CSS selector hay XPath.
- Xử lý pagination và infinite scroll: Thunderbit có thể tự click “Next” hoặc cuộn xuống, nên bạn không bỏ sót trang nào.
- Điều hướng sang trang con: Cần đi sâu hơn? Thunderbit có thể lần theo link sang các trang con và lấy dữ liệu ở đó.
- Xuất dữ liệu có cấu trúc: Xuất kết quả thẳng sang Google Sheets, Excel, Notion, Airtable hoặc CSV — miễn phí và chỉ một cú click.
- Không cần code: Nếu bạn biết mở website và xem trang, bạn dùng được Thunderbit. Đơn giản vậy thôi.
Và vì Thunderbit là một AI agent theo từng lĩnh vực, nó được xây để ổn định và lặp lại được — rất hợp cho người dùng doanh nghiệp cần tự động hóa cùng một công việc nhiều lần.
Từng bước: cách tìm tất cả URL trên một domain với Thunderbit
Sẵn sàng xem nó hoạt động thế nào chưa? Đây là hướng dẫn không cần kỹ thuật để trích xuất mọi URL bạn cần.
1. Cài tiện ích Thunderbit trên Chrome
Đầu tiên: tải Thunderbit từ Chrome Web Store. Thunderbit hoạt động trên Chrome, Edge, Brave và các trình duyệt dùng nhân Chromium khác. Hãy ghim nó lên thanh công cụ để truy cập nhanh hơn.
2. Mở trang danh sách hoặc thư mục mục tiêu của bạn
Đi tới website mà bạn muốn trích xuất URL. Đó có thể là trang chủ, sitemap, thư mục, hoặc bất kỳ trang danh sách nào đang dẫn tới những trang bạn cần.
3. Mở Thunderbit và thiết lập các trường
Click vào biểu tượng Thunderbit để mở tiện ích. Tạo một template scraper mới. Đây là lúc điều thú vị bắt đầu:
- Click “AI Suggest Fields”. AI của Thunderbit sẽ quét trang và gợi ý các cột — hãy tìm cột có nhãn “Page URL”, “Link” hoặc tương tự.
- Nếu bạn không thấy đúng trường mình cần, chỉ cần thêm một cột tên “Page URL” (hoặc tên nào hợp lý với bạn). AI của Thunderbit được huấn luyện để hiểu các thuật ngữ này và map chúng sang đúng dữ liệu.
4. Bật phân trang hoặc cuộn trang nếu cần
Nếu trang mục tiêu của bạn có nhiều trang (như “Page 1, 2, 3…” hoặc nút “Load more”), hãy bật chế độ phân trang trong Thunderbit:
- Chuyển sang chế độ “Click Pagination” cho các site có nút “Next”, hoặc “Infinite Scroll” cho các site tự tải thêm khi bạn cuộn xuống.
- Thunderbit sẽ nhắc bạn chọn nút “Next” hoặc vùng cuộn — chỉ cần click vào đó, phần còn lại AI sẽ xử lý.
5. Bắt đầu scrape và xem lại kết quả
Nhấn nút “Scrape”. Thunderbit sẽ crawl qua toàn bộ các trang và thu thập mọi URL tìm thấy. Bạn sẽ thấy kết quả hiện ra trong một bảng ngay trong tiện ích. Với site lớn, việc này có thể mất vài phút, nhưng vẫn nhanh hơn rất nhiều so với làm thủ công.
6. Xuất danh sách URL của bạn
Khi scrape xong, click Export. Bạn có thể gửi dữ liệu trực tiếp sang:
- Google Sheets
- Excel/CSV
- Notion
- Airtable
Việc xuất dữ liệu là miễn phí và giữ nguyên toàn bộ định dạng. Không còn cảnh copy-paste mệt mỏi nữa.
So sánh Thunderbit với các giải pháp trích xuất URL khác
| Phương pháp | Dễ dùng | Độ chính xác & độ phủ | Khả năng mở rộng | Tùy chọn xuất dữ liệu |
|---|---|---|---|---|
| Copy-paste thủ công | Rất mệt | Thấp (rất dễ bỏ sót) | Không có | Thủ công (Excel, v.v.) |
| Công cụ lấy link trên trình duyệt | Tạm ổn cho 1 trang | Trung bình | Kém | Thủ công |
Tìm kiếm Google site: | Dễ | Trung bình (không đầy đủ) | Bị giới hạn khoảng ~1.000 | Thủ công |
| XML Sitemap | Dễ (nếu có) | Tốt (nếu cập nhật) | Tốt | Thủ công/Script |
| Công cụ SEO (Screaming Frog) | Kỹ thuật | Cao | Cao (trả phí) | CSV, Excel |
| Python script (Scrapy, v.v.) | Rất kỹ thuật | Cao | Cao | Tùy chỉnh |
| Thunderbit | Rất dễ | Rất cao | Cao | Google Sheets, CSV, v.v. |
Thunderbit mang đến cho bạn độ chính xác và khả năng mở rộng của một crawler chuyên nghiệp cùng với sự dễ dùng của một tiện ích trình duyệt. Không code, không thiết lập phức tạp, chỉ có kết quả.
Bonus: Trích xuất nhiều hơn chỉ URL với Thunderbit
Tìm hiểu về Subpage Scraping Get Started Free
Điều hay là: Thunderbit không chỉ dành cho URL — bạn còn có thể trích xuất:
- Tiêu đề
- Số điện thoại
- Hình ảnh
- Bất kỳ dữ liệu có cấu trúc nào trên trang

Ví dụ, nếu bạn đang xây danh sách lead, bạn có thể để Thunderbit lấy URL hồ sơ, tên, email và số điện thoại từ từng mục trong directory — tất cả chỉ trong một lượt. Nếu bạn đang audit sản phẩm, bạn có thể lấy URL sản phẩm, tên, giá và tình trạng còn hàng. Thunderbit còn hỗ trợ subpage scraping, nên nó có thể click vào từng link và trích xuất chi tiết ngay từ đó.
Và đúng vậy, các công cụ trích xuất email và số điện thoại của Thunderbit hoàn toàn miễn phí. Điều này rất đáng giá với các team sales và marketing.
Những điểm chính: cách tìm tất cả các trang trên một website bằng AI
Tóm lại nhé:
- Trích xuất toàn bộ URL từ một domain rất khó nếu dùng cách thủ công hoặc công cụ chung chung.
- Các mô hình AI chung như GPT không xử lý được điều hướng web, phân trang hay nội dung động.
- AI agent theo từng lĩnh vực như Thunderbit được thiết kế riêng cho trích xuất dữ liệu web — ổn định, lặp lại được và dễ dùng cho người làm doanh nghiệp.
- Thunderbit làm mọi thứ rất đơn giản: cài extension, dùng AI để gợi ý trường, bật phân trang, scrape rồi xuất dữ liệu. Không code, không phiền phức.
- Bạn có thể trích xuất nhiều hơn chỉ URL: tiêu đề, email, số điện thoại và nhiều thứ khác — rất hợp cho tạo lead, audit hay nghiên cứu.
Nếu bạn đã quá ngán cảnh copy-paste link hoặc vật lộn với các crawler kỹ thuật, hãy thử Thunderbit. Có gói miễn phí, nên bạn có thể tự xem nó tiết kiệm cho mình bao nhiêu thời gian (và bao nhiêu sự tỉnh táo).
Và nếu bạn tò mò về những cách khác Thunderbit có thể hỗ trợ — như scrape sản phẩm Amazon, trích xuất dữ liệu vào Excel, hoặc scrape kết quả tìm kiếm Google — hãy xem Thunderbit Blog để đọc thêm hướng dẫn và mẹo hay.
Sẵn sàng lấy lại thời gian từ việc thu thập dữ liệu thủ công chưa? Tương lai của web data extraction là các AI agent theo từng lĩnh vực — và Thunderbit đang đi đầu. Hãy thử ngay, để lần audit, danh sách lead hay dự án nghiên cứu tiếp theo của bạn trở thành việc nhẹ nhàng nhất từ trước đến nay.
Trích xuất URL từ bất kỳ website nào với Thunderbit
Đọc thêm
- Chi phí thực sự của việc thu thập dữ liệu thủ công – Oxylabs
- Cách tìm mọi URL trên một website – Ahrefs
- Cách dùng toán tử tìm kiếm của Google để phân tích site – Moz
P.S. Nếu có lúc nào bạn thấy mình muốn copy-paste 1.000 URL bằng tay, hãy nhớ: giờ đã có AI lo việc đó rồi. Cổ tay của bạn (và sếp của bạn) sẽ biết ơn bạn.
Dùng thử AI Web Scraper Get Started Free

