Google News lấy tin từ hơn 50.000 nguồn trên toàn cầu, nên đây là một trong những bề mặt tin tức thời gian thực phong phú nhất trên internet. Nhưng có một điều ít ai nói thẳng với bạn: Google đã khai tử API News chính thức từ năm 2011 và đến giờ vẫn chưa thay thế.
Điều đó khiến các đội PR theo dõi nhắc đến thương hiệu, nhân viên sales giám sát tín hiệu ngành, hay các nhà phân tích xây dashboard tình báo cạnh tranh đều bị kẹt. Bạn cần dữ liệu tin tức có cấu trúc — tiêu đề, nguồn, ngày tháng, nội dung bài viết — nhưng Google lại chủ động cản việc thu thập tự động bằng CAPTCHA, giới hạn tần suất và giao diện thay đổi liên tục. Tôi đã dành nhiều năm xây dựng và kiểm thử các công cụ trích xuất dữ liệu tại Thunderbit, và tôi có thể nói rằng khoảng cách giữa câu “chắc chỉ cần scrape Google News nhanh thôi” với việc thực sự lấy được dữ liệu ổn định, có cấu trúc là lớn hơn đa số mọi người nghĩ.
Hướng dẫn này sẽ điểm qua 10 công cụ trích xuất Google News tốt nhất mà tôi tìm thấy, từ API, công cụ no-code đến các gói miễn phí — kèm so sánh giá thực tế, khả năng chống bot và mức độ chi tiết ở cấp trường dữ liệu để giúp bạn chọn đúng công cụ.
Dùng thử Thunderbit để trích xuất Google News
Vì sao Google News khó trích xuất dữ liệu (và vì sao không có API chính thức)
Google đã ngừng API News vào năm 2011. Từ đó đến nay, mọi công cụ tự nhận là “Google News API” thực ra đều là lớp bọc của bên thứ ba — dùng scraping hoặc proxy để lấy kết quả Google News thay bạn. Lựa chọn lập trình gần nhất mang tính chính thức là Custom Search JSON API, cho bạn 100 truy vấn miễn phí mỗi ngày và tính phí 5 USD cho mỗi 1.000 truy vấn. Nhưng nó yêu cầu cấu hình công cụ tìm kiếm tùy chỉnh và không thể thay thế trực tiếp cho Google News.
Trong khi đó, các lớp phòng thủ chống scraping của Google là có thật:
- Giới hạn tần suất theo IP: Nếu gửi quá nhanh vào Google News, bạn sẽ gặp lỗi 429 hoặc CAPTCHA.
- Trang đồng ý và trang chèn xen giữa: Tùy vị trí địa lý, Google có thể hiển thị màn hình đồng ý cookie khiến hầu hết trình phân tích bị vỡ.
- Nội dung render bằng JavaScript: Phần lớn Google News được tải động, nên các request HTTP đơn giản chỉ trả về HTML chưa đầy đủ.
- URL bọc qua trang chuyển hướng: Link trong Google News thường đi qua lớp chuyển hướng của Google trước khi tới trang nhà xuất bản.
- Giao diện thay đổi liên tục: Google thường xuyên đổi cách tổ chức thẻ tin, cụm bài và các mục chủ đề.
Tháng 3/2025, Google cũng chuyển hoàn toàn sang các trang xuất bản được tạo tự động, khiến nền tảng còn biến động hơn nữa. Các chủ đề cộng đồng trên GitHub và Stack Overflow đầy rẫy các mẹo xử lý trang đồng ý, selector bị hỏng và định dạng URL thay đổi.
Vậy tại sao người ta vẫn scrape nó? Vì mỗi ngày có hàng tỷ lượt tìm kiếm trên Google, và 15% trong số đó là các truy vấn Google chưa từng thấy trước đây. Với giám sát thương hiệu, phân tích xu hướng, phát hiện tín hiệu lead và tình báo cạnh tranh, Google News vẫn là một trong những bề mặt tin tức rộng nhất và linh hoạt nhất theo truy vấn mà bạn có thể dùng.
RSS vs. API vs. scraping no-code: chọn cách nào phù hợp
Không phải công cụ trích xuất Google News nào cũng hoạt động theo cùng một cách. Trước khi chọn, bạn nên hiểu 3 hướng tiếp cận chính — và khi nào mỗi cách phù hợp.
| Cách tiếp cận | Phù hợp nhất cho | Hạn chế | Ví dụ công cụ |
|---|---|---|---|
| RSS feed Google News | Theo dõi tiêu đề đơn giản, miễn phí, khối lượng thấp | Không có toàn văn, tối đa khoảng 100 kết quả, lọc hạn chế | Trình đọc RSS tích hợp, n8n |
| SERP / News API | Theo dõi từ khóa quy mô lớn, metadata có cấu trúc | Có chi phí định kỳ, thường chỉ có tiêu đề + đoạn trích | SerpApi, Scrapingdog, Newsdata.io |
| Scraping trực tiếp (no-code) | Toàn văn bài viết, trường dữ liệu tùy chỉnh, nghiên cứu một lần | Cần xử lý chống bot, khó mở rộng hơn API | Thunderbit, Octoparse, Apify |
| Scraping trực tiếp (code) | Kiểm soát tối đa, pipeline tùy biến | Bảo trì nặng, phải xử lý CAPTCHA, hay hỏng | Scrapy, BeautifulSoup + Selenium |
Phần lớn bài viết đối thủ chỉ nói về API và thư viện Python. Nhưng dữ liệu ý định người dùng mà tôi từng thấy cho thấy một bức tranh khác: phần lớn người tìm “best Google News scrapers” không phải lập trình viên — mà là quản lý PR, trưởng nhóm vận hành, đội sales — họ cần giải pháp bấm là dùng, không phải dự án code. Vì vậy danh sách này có cả tiện ích trình duyệt lẫn nền tảng no-code bên cạnh các API mạnh.
Cần lưu ý: RSS feed của Google News vẫn miễn phí và rất hữu ích cho nhu cầu theo dõi tiêu đề nhẹ nhàng. Bạn có thể đăng ký theo dõi một chủ đề hoặc từ khóa và nhận khoảng 100 kết quả với tiêu đề, liên kết và ngày xuất bản. Nhưng nếu bạn cần toàn văn bài viết, tên tác giả, cảm xúc, hoặc nhiều hơn 100 kết quả, bạn sẽ cần một trong các công cụ bên dưới.
Cách chúng tôi đánh giá các công cụ trích xuất Google News tốt nhất
Tôi áp dụng cùng một bộ tiêu chí cho mọi công cụ trong danh sách này:
- Dễ sử dụng: no-code, cần code, hay chỉ dùng API
- Xử lý chống bot / CAPTCHA: cực kỳ quan trọng với Google
- Các trường dữ liệu trích xuất: tiêu đề, nguồn, ngày, đoạn trích, URL, toàn văn bài viết, tác giả, hình ảnh, cảm xúc
- Có gói miễn phí và giới hạn ra sao
- Chi phí quy đổi trên 1.000 request: vì mỗi nhà cung cấp báo giá khác nhau (theo tháng, theo credit, theo request), tôi chuẩn hóa về chi phí cho 1.000 kết quả thành công ở gói trả phí thấp nhất
- Định dạng xuất dữ liệu: JSON, CSV, Google Sheets, Airtable, Notion, v.v.
- Khả năng mở rộng: giới hạn số lượng mỗi ngày, rate limit, concurrency
- Trường hợp sử dụng phù hợp nhất
Việc chuẩn hóa giá quan trọng hơn bạn tưởng. Một công cụ tính theo “search” (mỗi search trả 10 kết quả), công cụ khác tính theo “credit” (1 credit = 1 dòng), và công cụ thứ ba tính theo “request” (render JavaScript sẽ tốn thêm). Nếu không quy đổi, bạn đang so táo với đười ươi.
10 công cụ trích xuất Google News tốt nhất trong một cái nhìn
Đây là bảng so sánh tổng quan. Phần sau tôi sẽ đi sâu vào từng công cụ, nhưng bảng này sẽ giúp bạn thu hẹp lựa chọn nhanh.
| Công cụ | Loại | Gói miễn phí | ~Chi phí trên 1K kết quả | Xử lý chống bot | Trích xuất toàn văn | Định dạng xuất | Phù hợp nhất cho |
|---|---|---|---|---|---|---|---|
| Thunderbit | Tiện ích Chrome / AI no-code | Gói miễn phí (6 trang) | ~$6–$30 cho 1K dòng (tùy gói) | Chế độ trình duyệt (phiên của bạn) + chế độ đám mây | Có (scrape trang con) | Excel, CSV, Sheets, Airtable, Notion, JSON | Người không rành kỹ thuật, đội kinh doanh |
| SerpApi | SERP API | 250 lượt tìm kiếm/tháng | ~$5–$15 cho 1K kết quả | Chống phát hiện chuyên cho SERP | Không (chỉ tiêu đề + đoạn trích) | JSON | Lập trình viên, pipeline API có cấu trúc |
| ScraperAPI | API scraping tổng quát | 1.000 credit/tháng + trial 5K | ~$0,10–$0,49 cho 1K request | Xoay proxy, render JS | Không có parser riêng | JSON, HTML | Lập trình viên cần tiết kiệm, scraping tổng quát |
| Apify | Nền tảng scraping đám mây | Trial 7 ngày | Thay đổi theo actor/compute | Render JS, trình duyệt headless | Tùy actor | JSON, CSV, Excel, API | Đội kỹ thuật, quy trình dựng sẵn |
| Bright Data | Scraper/dataset cấp doanh nghiệp | 1K request dùng thử | ~$1,30–$2,50 cho 1K bản ghi | Proxy, giải CAPTCHA, render trình duyệt | Có (sản phẩm News Scraper) | JSON, CSV | Pipeline doanh nghiệp |
| Octoparse | Nền tảng no-code trực quan | Gói miễn phí (hạn chế) | ~$9–$25 cho 1K dòng (quy đổi) | Thực thi trên cloud, chống chặn | Có (template có cả body text) | CSV, Excel, JSON, cơ sở dữ liệu | Người thích workflow trực quan |
| ScrapingBee | API scraping | Credit dùng thử | Thay đổi (tính theo credit, JS tốn hơn) | Headless Chrome, xoay proxy, CAPTCHA | Không có parser riêng | JSON, HTML | Lập trình viên cần render JS |
| Oxylabs | API SERP / scraper | Dùng thử tới 2.000 kết quả | ~$1,00–$2,35 cho 1K kết quả | Hơn 100M proxy, giải CAPTCHA | Không (dữ liệu SERP) | JSON | Scraping quy mô lớn, nhắm theo khu vực |
| Scrapingdog | API SERP giá rẻ | 1.000 credit miễn phí | ~$0,10 cho 1K request | Chống phát hiện chuyên cho SERP | Không (chỉ tiêu đề + đoạn trích) | JSON | Lập trình viên tiết kiệm chi phí |
| Newsdata.io | API tin tức chuyên dụng | 200 request/ngày | Thay đổi theo gói | Không áp dụng (không scrape Google trực tiếp) | Có (gói premium) | JSON | Tính năng NLP chuyên cho tin tức |
Một vài điểm nổi bật. Rẻ nhất theo request? Scrapingdog và ScraperAPI. Thiết lập no-code dễ nhất? Thunderbit và Octoparse. Độ tin cậy cấp doanh nghiệp kèm nhắm mục tiêu theo khu vực? Bright Data và Oxylabs.
Giờ là phần phân tích chi tiết.
1. Thunderbit — Công cụ trích xuất Google News no-code tốt nhất cho người dùng doanh nghiệp
Thunderbit là công cụ do công ty chúng tôi xây dựng, nên tôi sẽ nói thẳng điều đó. Nhưng tôi cũng sẽ nói cụ thể về việc nó làm được gì và chưa làm được gì, vì tôi nghĩ sự trung thực hữu ích hơn thổi phồng.
Thunderbit là một tiện ích Chrome dùng AI, được thiết kế cho những ai cần dữ liệu có cấu trúc từ website mà không phải viết code. Riêng với Google News, quy trình sẽ như sau:
- Mở trang kết quả tìm kiếm Google News trong Chrome.
- Nhấn “AI Suggest Fields” — AI sẽ đọc trang và tự nhận diện các cột như tiêu đề, nguồn, ngày, đoạn trích và URL.
- Nhấn “Scrape” để trích xuất dữ liệu có cấu trúc thành bảng.
Đó là trang danh sách. Sức mạnh thực sự cho bài toán tin tức nằm ở bước tiếp theo: sau khi scrape kết quả Google News, bạn có thể nhấn “Scrape Subpages” để truy cập từng URL bài viết và lấy toàn văn, tác giả, hình ảnh, v.v. Điều này giải quyết trực tiếp bài toán “tôi có link nhưng vẫn cần crawl và trích xuất nội dung thật” mà các diễn đàn luôn nhắc tới.
Field AI Prompt cho phép bạn thêm hướng dẫn AI tùy chỉnh cho từng cột. Ví dụ, bạn có thể thêm cột “Cảm xúc” với prompt như “Phân loại bài viết này là tích cực, tiêu cực hay trung tính đối với [thương hiệu].” Nghĩa là bạn vừa trích xuất dữ liệu vừa làm giàu dữ liệu trong cùng một lượt — điều mà không công cụ API thuần nào có được.
Thunderbit hỗ trợ cả Browser Scraping (chạy trong phiên Chrome thật của bạn, dùng cookie và trạng thái đăng nhập của bạn nên tránh được nhiều tín hiệu phát hiện bot) lẫn Cloud Scraping (xử lý tối đa 50 trang cùng lúc với hạ tầng chống bot tích hợp). Bạn cũng có thể thiết lập scraping theo lịch cho nhu cầu theo dõi tin tức định kỳ.
Tính năng chính
- AI Suggest Fields tự động nhận diện các cột tiêu đề, nguồn, ngày, URL
- Scrape trang con để lấy toàn văn, tác giả và hình ảnh
- Field AI Prompt để phân tích cảm xúc, dịch hoặc gắn nhãn tùy chỉnh
- Chế độ scraping trên Cloud và trên Browser
- Scraping theo lịch cho việc theo dõi hằng ngày/hằng tuần
- Xuất dữ liệu miễn phí sang Google Sheets, Airtable, Notion, Excel, CSV, JSON
Giá
- Gói miễn phí: 6 trang
- Dùng thử miễn phí: 10 trang
- Gói trả phí từ khoảng 9 USD/tháng (tính theo credit, 1 credit = 1 dòng đầu ra)
- Chi phí quy đổi trên 1K dòng: khoảng 6–30 USD tùy gói
Phù hợp nhất cho
Đội sales, chuyên viên PR, quản lý vận hành và bất kỳ ai cần dữ liệu Google News có cấu trúc mà không muốn viết một dòng code nào. Đặc biệt mạnh khi bạn cần toàn văn bài viết kèm các trường dữ liệu được AI làm giàu như cảm xúc.
2. SerpApi — API Google News có cấu trúc tốt nhất cho lập trình viên
SerpApi là lựa chọn hàng đầu nếu bạn muốn một endpoint API Google News chuyên dụng trả về JSON sạch và có cấu trúc. Nó có hai endpoint liên quan: một cho news.google.com (trang Google News) và một cho tab tin tức tbm=nws trên Google Search tiêu chuẩn.
Tài liệu trường dữ liệu ở đây chi tiết bất thường — bạn có title, source, authors, link, thumbnail, topic_token, story_token, related_topics và related_publications. Việc hỗ trợ story-token và topic-token thực sự hữu ích để loại bỏ trùng lặp giữa các bài trong cùng cụm, một điểm đau mà nhiều công cụ khác bỏ qua.
Theo kinh nghiệm của tôi, tốc độ phản hồi của SerpApi khá nhanh (thường dưới 2 giây) và độ ổn định tốt. Hạn chế chính: nó chỉ có API, nên bạn cần code hoặc tích hợp no-code để dùng dữ liệu. Không có toàn văn bài viết — chỉ tiêu đề, đoạn trích và metadata.
Tính năng chính
- Endpoint tìm kiếm Google News chuyên dụng với JSON có cấu trúc
- Nhắm mục tiêu theo vị trí và ngôn ngữ
- Truy vấn tin tức lịch sử qua tham số
tbs - Hỗ trợ story token và topic token để gom cụm
Giá
- Miễn phí: 250 lượt tìm kiếm/tháng
- Developer: 75 USD/tháng cho 5.000 lượt tìm kiếm
- Production: 150 USD/tháng cho 15.000 lượt tìm kiếm
- Chi phí quy đổi trên 1K kết quả: khoảng 5–15 USD (giả sử mỗi search trả ~10 kết quả)
Phù hợp nhất cho
Lập trình viên xây dựng pipeline giám sát tin tức tự động, cần dữ liệu SERP có cấu trúc và độ bao phủ trường dữ liệu mạnh.
3. ScraperAPI — API tổng quát giá tốt nhất cho Google News
ScraperAPI là một API scraping đa dụng — không phải công cụ dành riêng cho Google News. Nhưng nó vẫn có mặt trong danh sách này vì đây là một trong những cách rẻ nhất để truy cập trang Google News ở quy mô lớn nếu bạn sẵn sàng tự viết parser.
ScraperAPI xử lý xoay proxy, render JavaScript và giải CAPTCHA qua một REST API đơn giản. Bạn gửi URL, nó trả lại HTML đã render. Điểm đánh đổi là không có parser riêng cho Google News, nên bạn sẽ phải tự trích xuất trường dữ liệu (hoặc kết hợp với thư viện parse).
Một số người dùng báo cáo thời gian phản hồi chậm hơn (7–23 giây trong benchmark), và hệ thống credit đồng nghĩa mỗi loại request sẽ tốn số credit khác nhau. Nhưng với các lập trình viên đã biết cách parse HTML của Google News, giá của ScraperAPI rất khó đánh bại.
Tính năng chính
- Xoay proxy tự động và nhắm mục tiêu theo khu vực
- Render JavaScript
- Mô hình tính theo credit (gói cơ bản có 100K credits)
- 1.000 credit miễn phí/tháng + 5.000 credit dùng thử
Giá
- Miễn phí: 1.000 credit/tháng
- Hobby: 49 USD/tháng (100.000 credit)
- Startup: 149 USD/tháng (1.000.000 credit)
- Chi phí quy đổi trên 1K request: khoảng 0,10–0,49 USD tùy gói
Phù hợp nhất cho
Lập trình viên muốn tối ưu chi phí, cần lớp proxy/rendering rẻ và sẵn sàng tự xây parser Google News.
4. Apify — Nền tảng đám mây tốt nhất với các actor Google News dựng sẵn
Apify là một nền tảng scraping trên cloud với chợ “Actors” — các scraper dựng sẵn mà bạn có thể chạy mà không cần code. Có khá nhiều actor Google News Scraper do cộng đồng đóng góp, và nền tảng hỗ trợ thực thi trên cloud, lập lịch và lưu trữ.
Bạn có thể bắt đầu nhanh với một actor dựng sẵn. Đổi lại, chất lượng và mức độ bảo trì của các actor cộng đồng không đồng đều. Một số có thể hỏng khi Google đổi giao diện, và bạn phụ thuộc vào tác giả actor để sửa. Hạ tầng của Apify rất ổn, nhưng trải nghiệm riêng cho Google News sẽ phụ thuộc vào actor bạn chọn.
Tính năng chính
- Các actor dành riêng cho Google News trong Apify Store
- Chạy theo lịch trên cloud
- Tích hợp API và webhook
- Xuất sang JSON, CSV, Excel và qua API
Giá
- Dùng thử: 7 ngày
- Gói trả phí từ 49 USD/tháng
- Chi phí quy đổi trên 1K request: thay đổi theo actor và mức tiêu thụ compute
Phù hợp nhất cho
Đội kỹ thuật muốn quy trình scraping dựng sẵn mà không phải xây từ đầu, và cần lập lịch trên cloud cùng tích hợp API.
5. Bright Data — Công cụ trích xuất Google News cấp doanh nghiệp tốt nhất
Bright Data là “gã khổng lồ” ở cấp doanh nghiệp. Sản phẩm News Scraper của họ hỗ trợ trực tiếp Google News và bao gồm quản lý proxy tự động, render trình duyệt đầy đủ, giải CAPTCHA và xử lý theo lô lên đến 5.000 URL. Trường dữ liệu gồm ID, URL, tiêu đề, tác giả, chủ đề, v.v.
Bright Data cũng bán sẵn bộ dữ liệu Google News thu thập trước, giá từ 2,50 USD cho mỗi 100K bản ghi — một lựa chọn hữu ích cho các đội không muốn scrape trực tiếp theo thời gian thực.
Mạng proxy residential hơn 72M là điểm khác biệt lớn nhất ở khả năng chống bot. Nếu bạn scraping Google News từ nhiều quốc gia với khối lượng lớn, Bright Data sẽ gánh phần phức tạp đó.
Tính năng chính
- News Scraper hỗ trợ Google News
- Hơn 72M proxy residential với nhắm mục tiêu theo khu vực
- Giải CAPTCHA tích hợp
- Web Scraper IDE (trực quan, bán no-code)
- Tùy chọn pay-as-you-go và thuê bao
Giá
- Dùng thử miễn phí: 1.000 request
- Pay as you go: khoảng 2,50 USD/1K bản ghi
- Scale: 499 USD/tháng (gồm 384K bản ghi, ~1,30 USD/1K bản ghi thêm)
Phù hợp nhất cho
Doanh nghiệp lớn và các công ty cần dữ liệu Google News khối lượng cao, độ tin cậy cao, phủ địa lý toàn cầu và có hạ tầng tuân thủ.
6. Octoparse — Công cụ scraping no-code trên máy tính tốt nhất cho Google News
Octoparse cung cấp cả template Google News Scraper thường và template Cloud. Danh sách trường dữ liệu khá minh bạch: keyword, source, title, publish date, URL, body text, author, abstract, images và cả trường thông báo lỗi.
Template cloud thậm chí công bố mức 0,1 USD cho 1.000 dòng ở Run Mode, một mức minh bạch giá hiếm thấy với công cụ no-code. Nhưng chi phí thực tế còn phụ thuộc vào gói thuê bao bạn cần cho lịch chạy trên cloud và các tính năng chống chặn.
Trình dựng workflow trực quan của Octoparse phù hợp với người muốn kiểm soát rõ từng bước trích xuất mà không phải viết code. Đường cong học tập dốc hơn cách tiếp cận bằng AI của Thunderbit, nhưng một số người dùng lại thích mức độ chi tiết đó.
Tính năng chính
- Template Google News dựng sẵn với trích xuất trường dữ liệu chi tiết
- Trình dựng workflow trực quan kiểu bấm-chọn
- Chạy trên cloud và cục bộ
- Scrape theo lịch và lặp lại
- Xuất sang CSV, Excel, JSON, cơ sở dữ liệu
Giá
- Gói miễn phí với tính năng hạn chế
- Gói trả phí từ 69 USD/tháng
- Chi phí quy đổi: khoảng 9–25 USD cho 1K dòng (tính theo chi phí gói)
Phù hợp nhất cho
Người dùng không rành kỹ thuật thích công cụ desktop trực quan, kiểm soát từng bước trích xuất rõ ràng và cần scraping Google News định kỳ.
7. ScrapingBee — API tốt nhất để xử lý các trang Google News nặng JavaScript
ScrapingBee chuyên về render trình duyệt headless, xoay proxy và vượt cơ chế chống bot. Đây là lựa chọn mạnh khi các trang Google News cần chạy JavaScript đầy đủ mới hiển thị kết quả — điều ngày càng thường xuyên hơn.
API rất đơn giản: gửi URL, nhận lại HTML đã render hoặc ảnh chụp màn hình. ScrapingBee xử lý xoay proxy và giải CAPTCHA ở hậu trường. Nhưng giống ScraperAPI, nó không có parser riêng cho Google News — bạn vẫn phải tự trích xuất trường dữ liệu.
Hệ thống credit nghĩa là request render JavaScript sẽ tốn nhiều hơn request HTTP đơn giản, nên hãy nhớ điều đó khi tính chi phí cho Google News.
Tính năng chính
- Render bằng Headless Chrome cho các trang nặng JS
- Xoay proxy tự động và vượt CAPTCHA
- Hỗ trợ scraping Google Search / News
- REST API đơn giản trả về JSON/HTML
Giá
- Gói từ 49 USD/tháng
- Tính theo credit (render JS tốn nhiều hơn mỗi request)
- Chi phí quy đổi trên 1K request: thay đổi tùy nhu cầu render
Phù hợp nhất cho
Lập trình viên cần render JavaScript ổn định và xử lý chống bot cho các trang Google News qua một API gọn nhẹ.
8. Oxylabs — Công cụ trích xuất Google News tốt nhất cho kết quả nhắm mục tiêu theo khu vực
Oxylabs có API Google News Scraper chuyên dụng trong bộ SERP của họ, được hậu thuẫn bởi pool hơn 100M proxy trên 195 quốc gia. Thông điệp của họ là: độ tin cậy cấp doanh nghiệp với kết quả theo khu vực địa lý cụ thể.
Oxylabs hỗ trợ đầu ra JSON có cấu trúc, chế độ scraping thời gian thực và theo lô, cùng logic parse tùy chỉnh bằng XPath và CSS selector. Giá cho Google rất rõ ràng: khoảng 2,00 USD/1K kết quả ở gói Micro, giảm còn khoảng 0,90 USD/1K ở các gói cao hơn.
Gói dùng thử cho bạn tới 2.000 kết quả, đủ để kiểm tra xem chất lượng dữ liệu có đáp ứng nhu cầu hay không.
Tính năng chính
- SERP Scraper API có hỗ trợ Google News
- Hơn 100M proxy trên 195 quốc gia
- Xuất JSON có cấu trúc
- Chế độ scraping thời gian thực và theo lô
Giá
- Dùng thử miễn phí: tới 2.000 kết quả
- Micro: khoảng 2,00 USD/1K kết quả Google (~2,35 USD/1K nếu render JS)
- Gói cao hơn: khoảng 0,90 USD/1K
- Có gói doanh nghiệp tùy chỉnh
Phù hợp nhất cho
Các đội enterprise và mid-market cần kết quả Google News nhắm mục tiêu theo khu vực ở quy mô lớn với độ tin cậy cao.
9. Scrapingdog — API Google News thân thiện với ngân sách tốt nhất
Scrapingdog định vị mình là lựa chọn tiết kiệm so với SerpApi, với endpoint Google News API chuyên dụng. Phản hồi JSON có cấu trúc gồm title, source, date, snippet và link.
Mức giá thực sự rất mạnh: một số gói cho 400K request với 40 USD, tương đương khoảng 0,10 USD cho mỗi 1.000 request. Thời gian phản hồi thường khoảng 2 giây, và bạn có 1.000 credit miễn phí để thử.
Đánh đổi là Scrapingdog là công ty nhỏ hơn, tài liệu và tích hợp ít hơn các ông lớn. Nhưng với startup và nhà xây dựng sản phẩm cần tiết kiệm, bài toán chi phí rất hấp dẫn.
Tính năng chính
- Endpoint API Google News Scraper chuyên dụng
- JSON có cấu trúc (title, source, date, snippet, link)
- Dữ liệu tin tức lịch sử qua tham số
tbs - 1.000 credit miễn phí để thử
Giá
- Miễn phí: 1.000 credit
- Gói trả phí từ 40 USD/tháng
- Chi phí quy đổi trên 1K request: khoảng 0,10 USD
Phù hợp nhất cho
Lập trình viên và startup cần dữ liệu Google News khối lượng lớn với chi phí trên mỗi request thấp nhất.
10. Newsdata.io — API tin tức chuyên dụng tốt nhất (vượt ra ngoài Google News)
Newsdata.io là một API dữ liệu tin tức được xây dựng chuyên biệt, tổng hợp từ hơn 50.000 nguồn trên toàn cầu. Đây không hẳn là công cụ trích xuất Google News — nó không scrape trực tiếp Google News. Thay vào đó, nó tổng hợp độc lập từ cùng các nguồn nhà xuất bản (và thêm nguồn khác), trả về JSON có cấu trúc cho tìm kiếm tin tức thời gian thực và lịch sử.
Gói premium bao gồm trích xuất toàn văn, phân tích cảm xúc và lọc theo danh mục — những tính năng mà hầu hết công cụ scrape SERP không có sẵn. Gói miễn phí cho bạn 200 request/ngày, khá hào phóng để thử nghiệm.
Nếu mục tiêu của bạn là “lấy dữ liệu tin tức về một chủ đề” thay vì cụ thể “trích xuất Google News”, Newsdata.io có thể phù hợp hơn bất kỳ công cụ SERP nào trong danh sách này.
Tính năng chính
- API tìm kiếm tin tức thời gian thực và lịch sử
- Trích xuất toàn văn bài viết (premium)
- Phân tích cảm xúc (premium)
- Lọc theo danh mục, ngôn ngữ và quốc gia
- Gói miễn phí 200 request/ngày
Giá
- Miễn phí: 200 request/ngày
- Gói trả phí từ 99,99 USD/tháng
- Chi phí quy đổi trên 1K request: thay đổi theo gói
Phù hợp nhất cho
Các đội cần một nguồn dữ liệu tin tức chuyên dụng với tính năng NLP tích hợp (cảm xúc, phân loại) và không nhất thiết phải scrape chính Google News.
So sánh các công cụ trích xuất Google News: chống bot, trường dữ liệu và giá
Khi chọn công cụ trích xuất Google News, có 3 chiều so sánh quan trọng hơn hết. Tôi chưa thấy hướng dẫn nào khác hệ thống hóa đủ cả ba.
Mỗi công cụ xử lý cơ chế chống bot của Google như thế nào
Xử lý chống bot là mối quan tâm số 1 với bất kỳ ai trích xuất Google News. Đây là cách từng công cụ tiếp cận:
| Chiến lược | Công cụ sử dụng |
|---|---|
| Xoay proxy tích hợp | Bright Data, ScrapingBee, Oxylabs, ScraperAPI |
| Bao gồm giải CAPTCHA | Bright Data, ScrapingBee, Oxylabs |
| Render JS / trình duyệt headless | Apify, Octoparse, ScrapingBee |
| Dựa trên trình duyệt (dùng phiên của bạn) | Thunderbit (chế độ Browser Scraping) |
| Chống phát hiện chuyên cho SERP | SerpApi, Scrapingdog |
Chế độ Browser Scraping của Thunderbit đáng nói kỹ hơn một chút. Vì nó chạy ngay trong phiên Chrome thật của bạn, nó kế thừa cookie và trạng thái đăng nhập của bạn. Điều đó giúp tránh nhiều tín hiệu phát hiện bot mà scraper headless thường gặp — trang đồng ý, CAPTCHA và các kiểm tra fingerprint. Với nhu cầu khối lượng lớn, Cloud Scraping của Thunderbit xử lý 50 trang cùng lúc bằng hạ tầng chống bot riêng.
Mỗi công cụ trích xuất Google News trả về những trường dữ liệu nào
Đây là bảng so sánh mà hầu như không ai công bố — nhưng lại quan trọng nhất khi chọn công cụ. Có công cụ chỉ cho bạn tiêu đề và link. Có công cụ còn lấy được toàn văn, tên tác giả, thậm chí cả cảm xúc.
| Công cụ | Tiêu đề | Nguồn | Ngày | Đoạn trích | URL bài viết | Toàn văn | Tác giả | Hình ảnh | Cảm xúc |
|---|---|---|---|---|---|---|---|---|---|
| Thunderbit | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ (qua trang con) | ✅ (qua AI) | ✅ | ✅ (qua Field AI Prompt) |
| SerpApi | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ✅ | ✅ | ❌ |
| ScraperAPI | ✅ (tự parse) | ✅ (tự parse) | ✅ (tự parse) | ✅ (tự parse) | ✅ (tự parse) | ❌ | ❌ | ❌ | ❌ |
| Apify | ✅ | ✅ | ✅ | ✅ | ✅ | Tùy actor | Tùy actor | ✅ | ❌ |
| Bright Data | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ (News Scraper) | ✅ | ✅ | ❌ |
| Octoparse | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ (template) | ✅ | ✅ | ❌ |
| ScrapingBee | ✅ (tự parse) | ✅ (tự parse) | ✅ (tự parse) | ✅ (tự parse) | ✅ (tự parse) | ❌ | ❌ | ❌ | ❌ |
| Oxylabs | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ❌ | ✅ | ❌ |
| Scrapingdog | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ❌ | ❌ | ❌ |
| Newsdata.io | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ (premium) | ✅ | ✅ | ✅ (premium) |
Điểm nổi bật là Thunderbit có thể lấy toàn văn bài viết qua Subpage Scraping và thêm các trường dữ liệu được AI làm giàu như cảm xúc trong cùng một lượt. Newsdata.io cũng có cảm xúc và toàn văn, nhưng thông qua API tin tức chuyên dụng chứ không phải scraping Google News. Phần lớn API SERP chỉ trả về những gì thấy trên trang danh sách Google News — tiêu đề, đoạn trích và liên kết.
Chi phí quy đổi trên 1.000 kết quả
Đây là bảng mà tôi muốn có khi đánh giá công cụ mà không tìm thấy ở đâu cả. Mỗi nhà cung cấp báo giá theo một kiểu, nên tôi đã quy đổi tất cả về chi phí trên 1.000 kết quả thành công ở gói trả phí thấp nhất.
| Công cụ | Gói miễn phí | Gói trả phí thấp nhất | ~Chi phí trên 1K kết quả | Ghi chú |
|---|---|---|---|---|
| Thunderbit | 6 trang miễn phí / trial: 10 trang | Từ khoảng 9 USD/tháng (tính theo credit) | ~$6–$30 | 1 credit = 1 dòng; đã gồm trích xuất AI |
| SerpApi | 250 lượt tìm kiếm/tháng | 75 USD/tháng (5.000 lượt tìm kiếm) | ~$15 | JSON có cấu trúc, endpoint Google News |
| ScraperAPI | 1.000 credit/tháng | 49 USD/tháng (100K credit) | ~$0,49 | Không có parser riêng cho Google News |
| Apify | Trial 7 ngày | 49 USD/tháng | Thay đổi | Tùy actor và compute |
| Bright Data | 1K request dùng thử | Pay-as-you-go | ~$1,30–$2,50 | Cấp doanh nghiệp, có tùy chọn dataset |
| Octoparse | Gói miễn phí (hạn chế) | $69/tháng | ~$9–$25 | Cloud template: 0,1 USD/1K dòng (cơ bản) |
| ScrapingBee | Credit dùng thử | 49 USD/tháng | Thay đổi (JS tốn hơn) | Tính theo credit, không có parser riêng |
| Oxylabs | Tới 2.000 kết quả | Gói Micro | ~$1,00–$2,35 | Nhắm mục tiêu theo khu vực, JSON có cấu trúc |
| Scrapingdog | 1.000 credit | 40 USD/tháng | ~$0,10 | Lựa chọn tiết kiệm, endpoint News chuyên dụng |
| Newsdata.io | 200 request/ngày | 99,99 USD/tháng | Thay đổi theo gói | Không scrape Google trực tiếp; có tính năng NLP |
Một vài kết luận. Scrapingdog là lựa chọn rẻ nhất theo request, nhưng chỉ trả về dữ liệu ở mức SERP (không có toàn văn). Bright Data và Oxylabs có chi phí tầm trung nhưng hạ tầng chống bot mạnh nhất. Thunderbit đắt hơn các API rẻ nhất nếu tính theo từng dòng, nhưng đây là công cụ duy nhất cho bạn trích xuất toàn văn bài viết kèm làm giàu bằng AI mà không cần viết code.
Nên chọn công cụ trích xuất Google News nào?
Khuyến nghị của tôi theo từng tình huống:
- Chỉ cần tiêu đề để theo dõi, ngân sách thấp? → Scrapingdog hoặc gói miễn phí của Newsdata.io
- Người không rành kỹ thuật, cần toàn văn + làm giàu dữ liệu? → Thunderbit
- Lập trình viên xây pipeline tin tức có cấu trúc? → SerpApi (bao phủ trường dữ liệu tốt nhất) hoặc Scrapingdog (giá tốt nhất)
- Doanh nghiệp, khối lượng lớn, nhắm mục tiêu theo khu vực? → Bright Data hoặc Oxylabs
- Muốn workflow desktop trực quan? → Octoparse
- Cần dữ liệu tin tức vượt ra ngoài Google News, có tính năng NLP? → Newsdata.io
- Cần lớp proxy/rendering tổng quát rẻ nhất? → ScraperAPI
Công cụ phù hợp phụ thuộc vào 3 yếu tố: trình độ kỹ thuật của bạn, nhu cầu khối lượng, và việc bạn chỉ cần tiêu đề hay cần toàn văn bài viết. Nếu chưa chắc, hãy bắt đầu với gói miễn phí — hầu hết công cụ ở đây đều có — rồi xem chất lượng dữ liệu có đáp ứng đúng bài toán của bạn hay không.
Nếu bạn muốn thử con đường no-code nhanh nhất, gói miễn phí của Thunderbit cho phép bạn trích xuất kết quả Google News chỉ trong vài cú nhấp và xuất thẳng sang Google Sheets hoặc Airtable. Để xem hướng dẫn, hãy ghé kênh YouTube của chúng tôi hoặc mẫu news scraper.
Và mong rằng tiêu đề của bạn luôn có cấu trúc, CAPTCHA luôn ít, và file xuất dữ liệu luôn sạch.
Dùng thử Thunderbit để trích xuất Google News Get Started Free
Câu hỏi thường gặp
Google có API News chính thức không?
Không. Google đã ngừng API News vào năm 2011 và chưa bao giờ thay thế nó. Lựa chọn gần nhất mang tính chính thức là Custom Search JSON API, cung cấp 100 truy vấn miễn phí mỗi ngày và tính 5 USD cho mỗi 1.000 truy vấn, nhưng nó yêu cầu một công cụ tìm kiếm tùy chỉnh đã cấu hình và không phải là sản phẩm Google News chuyên dụng. Mọi công cụ hiện nay tự nhận là “Google News API” đều là dịch vụ của bên thứ ba.
Tôi có thể dùng RSS feed của Google News thay cho scraper không?
Có, với nhu cầu đơn giản. RSS feed của Google News cung cấp tiêu đề và liên kết miễn phí, nhưng chỉ giới hạn khoảng 100 kết quả, không có toàn văn bài viết, và tùy chọn lọc rất ít. Nếu bạn cần dữ liệu phong phú hơn — toàn văn, tên tác giả, phân tích cảm xúc, hoặc hơn 100 kết quả — bạn sẽ cần một công cụ hoặc API chuyên dụng trong danh sách này.
Làm sao lấy được toàn văn bài viết từ kết quả Google News?
Danh sách Google News chỉ hiển thị tiêu đề và đoạn trích. Để lấy toàn văn, bạn cần công cụ có thể đi theo liên kết bài viết và trích xuất nội dung trang. Subpage Scraping của Thunderbit làm việc này tự động sau khi scrape trang danh sách Google News. Các công cụ API như Newsdata.io cung cấp toàn văn ở gói premium. Phần lớn API SERP (SerpApi, Scrapingdog, Oxylabs) chỉ trả về những gì hiển thị trên trang danh sách.
Scrape Google News có hợp pháp không?
Việc thu thập dữ liệu công khai thường không bị xem là truy cập trái phép theo luật Mỹ (theo tiền lệ hiQ v. LinkedIn), nhưng điều đó không có nghĩa là an toàn về mặt chính sách. Điều khoản dịch vụ của Google không khuyến khích truy vấn tự động, và Google chủ động hiển thị CAPTCHA và chặn khi phát hiện lưu lượng giống bot. Người dùng nên chỉ làm việc với dữ liệu công khai, tôn trọng bản quyền trên nội dung bài viết, và tham khảo tư vấn pháp lý với các trường hợp sử dụng quy mô thương mại.
Điều gì thường làm hỏng công cụ trích xuất Google News nhất?
Những thủ phạm phổ biến nhất là cơ chế phát hiện truy vấn tự động (CAPTCHA và lỗi 429), sai khác theo địa phương (kết quả khác nhau theo quốc gia/ngôn ngữ), trang đồng ý và trang chèn xen giữa, thay đổi markup của layout thẻ tin, và chuẩn hóa lại URL chuyển hướng. Lớp dữ liệu ổn định nhất là metadata bài viết (tiêu đề, nguồn, ngày, URL). Lớp kém ổn định nhất là phần hiển thị — cụm bài, thumbnail và cách tổ chức mục thường thay đổi liên tục.
Tìm hiểu thêm


