Her gün çevrimiçi ortamda 2 ila 3 milyon arasında haber makalesi yayımlanıyor. Başlıklar, tarihler, kaynaklar ve tam makale metinleri gibi verileri yapılandırılmış şekilde toplamak, neredeyse talimat olmadan mobilya kurmak kadar can sıkıcı.
Yıllardır Thunderbit’te otomasyon araçları geliştirip test ediyorum ve 2026’daki haber kazıma dünyası, büyük fırsatlarla gerçek hayal kırıklıklarının tuhaf bir karışımı. Google resmi News API’sini 2011’de kapattı; haber siteleri giderek daha agresif anti-bot önlemleri kullanıyor (Cloudflare, CAPTCHA’lar, JavaScript render engelleri) ve düzenler o kadar sık değişiyor ki, pazartesi çalışan bir kazıyıcı çarşamba günü bozulabiliyor. Buna rağmen PR ve satış ekiplerinden akademik araştırmacılara, AI mühendislerine kadar herkesin yapılandırılmış haber verisine ihtiyacı hiç olmadığı kadar fazla.
Bu yüzden API’ler, no-code platformlar ve açık kaynak kütüphaneler arasında 15 haber kazıma aracını test etmeye karar verdim. Amacım; fiyatlandırma, bakım yükü, temiz metin çıkarma ve gerçek kullanım senaryosu uyumu açısından size başka hiçbir rehberin sunmadığı, normalize edilmiş bir karşılaştırma vermekti.
2026’da En İyi Haber Kazıyıcıları Öne Çıkaran Nedir?
Çoğu “en iyi haber kazıyıcılar” yazısı değerlendirme kriterlerini tamamen atlıyor; ben ise gerçekte neye göre test yaptığımı burada paylaşıyorum. Bu tür yazıların çoğu sadece özellikleri sıralayıp geçiyor. Ama yıllardır kazıma altyapısı kurup geliştirdikten sonra şunu öğrendim: İş kullanıcılarının önemsediği kriterler nettir — ve çoğu zaman gözden kaçar.
Kullandığım değerlendirme çerçevesi şöyleydi:
| Kriter | Neyi Değerlendirdim |
|---|---|
| Yaklaşım | API, no-code tarayıcı aracı veya açık kaynak kütüphane |
| Anti-bot yönetimi | Proxy dönüşümü, CAPTCHA çözme, headless tarayıcı desteği |
| Temiz metin çıkarma | Reklamları/yan sütunları/navigasyonu ayıklayıp yalnızca makale gövdesini döndürebiliyor mu? |
| Meta veri çıktısı | Yazar, tarih, görseller, kaynak URL’si, kategori |
| Dışa aktarma formatları | CSV, JSON, Google Sheets, Airtable, Notion vb. |
| Sayfalama / toplu destek | Çok sayfalı sonuçları ve toplu URL’leri işleyebiliyor mu? |
| Bakım yükü | Site düzeni değişince bozuluyor mu? AI uyarlanabilir mi, seçici tabanlı mı? |
| Normalize edilmiş 1.000 sonuç başına maliyet | Aynı ölçekte fiyatlandırma (ücretsiz plan dahil) |
| En uygun kullanım senaryosu | PR izleme, lead üretimi, akademik araştırma, LLM hattı vb. |
İki kriter için ekstra bağlam gerekiyor. Normalize edilmiş 1.000 sonuç başına maliyet önemli, çünkü her sağlayıcı fiyatı farklı biçimde sunuyor — kredi başına, istek başına, arama başına, satır başına. Normalizasyon olmadan elmayla denizaltıyı karşılaştırıyorsunuz. Ve bakım yükü, kullanıcıların bana anlattığı en büyük acı noktası. Forumdan foruma şikâyet aynı: “haber siteleri her salı tarayıcılarımı bozmayı seviyor.” Her aracı üç seviyeli bir ölçeğe göre puanladım:
- 🟢 Düşük bakım: AI uyarlanabilir veya tamamen yönetilen API — düzen değişiklikleri iş akışınızı bozmaz
- 🟡 Orta bakım: Anti-bot sorunlarını çözer, ama çıkarım mantığınız yine de bozulabilir
- 🔴 Yüksek bakım: Seçici tabanlı — site değişince manuel düzeltme gerekir
Hangi Haber Kazıyıcı Rolünüze Uyar? Karar Matrisi
Kazıyıcı önerileri neredeyse her zaman tüm okuyucuları aynı görür; asıl sorun da burada. Marka bahsi takip eden bir PR yöneticisinin ihtiyaçları, RAG hattı kuran bir Python geliştiricisinden tamamen farklıdır. O yüzden tam listeye geçmeden önce kısa bir çerçeve:
| Kullanım Senaryosu | En İyi Yaklaşım | Önerilen Araçlar |
|---|---|---|
| Günlük haber özeti (teknik olmayan) | No-code tarayıcı aracı veya RSS | Thunderbit, Octoparse, ParseHub |
| Ölçekli PR / medya takibi | Uyarılarla birlikte News API | Newscatcher, Webz.io, Newsdata.io |
| Haberlerden satış lead’i çıkarma | Alt sayfa zenginleştirmeli AI kazıyıcı | Thunderbit (alt sayfa kazıma + e-posta/telefon çıkarma), Apify |
| Akademik araştırma / korpus oluşturma | Açık kaynak kütüphane | Newspaper4k |
| LLM hattı / RAG besleme | Markdown’a dönüştüren API | Thunderbit API, ScraperAPI |
| Rekabet istihbaratı / fiyat takibi | Zamanlanmış kazıma | Thunderbit (Scheduled Scraper), Bright Data |
Kendi senaryonuzu zaten biliyor musunuz? Atlayabilirsiniz. Yoksa aşağıdaki detaylı döküm yardımcı olacaktır.
Kısaca 15 En İyi Haber Kazıyıcı
İşte ana karşılaştırma — fiyatlar en düşük ücretli plandaki 1.000 sonuç başına maliyete göre normalize edildi, bakım ise üç seviyeli ölçeğe göre puanlandı.
| Araç | Tür | Ücretsiz Plan | 1.000 Sonuç Başına Maliyet (tah.) | Anti-Bot | Temiz Metin | Bakım | En Uygun Kullanım Senaryosu |
|---|---|---|---|---|---|---|---|
| Thunderbit | No-code AI (Chrome uzantısı + bulut) | Ayda 6 sayfa ücretsiz | ~$3–$15 | Güçlü (tarayıcı + bulut modları) | Evet (AI + alt sayfa) | 🟢 Düşük | İş ekipleri, lead üretimi, günlük izleme |
| SerpApi | API | Ayda 250 arama | ~$15 | Güçlü (SERP’e özel) | Hayır (yalnızca snippet) | 🟢 Düşük | Google News SERP panoları |
| ScraperAPI | API | Ayda 1.000 kredi | ~$1–$5 | Güçlü (proxy + JS render) | Hayır (ham HTML) | 🟡 Orta | Anti-bot altyapısı isteyen geliştiriciler |
| Newsdata.io | News API | Günde 200 istek | ~$5–$15 | N/A (yönetilen API) | Kısmi (premium) | 🟢 Düşük | Yapılandırılmış haber meta verisi |
| Apify | Bulut platformu | $5 ücretsiz kredi | ~$1–$6 | Güçlü | Aktöre göre değişir | 🟡 Orta | Özel bulut iş akışları |
| Oxylabs | Kurumsal API | 2.000 sonuç denemesi | ~$0.50–$2 | Çok güçlü | Kısmi | 🟢 Düşük | Kurumsal ölçekte SERP + web |
| ScrapingBee | API | Deneme kredileri | ~$2–$5 | Güçlü (headless Chrome) | Kısmi (temel) | 🟡 Orta | JS ağırlıklı haber siteleri |
| Scrapingdog | SERP API | 1.000 kredi | ~$0.10–$0.50 | Güçlü | Hayır (SERP verisi) | 🟢 Düşük | Bütçe dostu SERP izleme |
| Bright Data | Kurumsal platform | 1.000 istek denemesi | ~$0.30–$0.50 | Çok güçlü | Evet (News Scraper) | 🟢 Düşük | Ölçekli kurumsal haber verisi |
| Octoparse | No-code masaüstü + bulut | Sınırlı ücretsiz plan | ~$5–$10 (amorti edilmiş) | Güçlü | Evet (şablonlarla) | 🟡 Orta | Görsel no-code kazıma |
| ParseHub | No-code masaüstü | 5 proje, çalıştırma başına 200 sayfa | ~$5–$12 (amorti edilmiş) | Orta | Evet (yapılandırmayla) | 🔴 Yüksek | Başlangıç seviyesindekiler, küçük projeler |
| Newscatcher | News API | Herkese açık ücretsiz plan yok | Özel (kurumsal) | N/A (yönetilen API) | Evet (NLP ile zenginleştirilmiş) | 🟢 Düşük | PR/medya takibi |
| Webz.io | Haber veri platformu | Self-servis ücretsiz plan yok | Özel (kurumsal) | N/A (yönetilen akış) | Evet (tam metin + meta veri) | 🟢 Düşük | Tarihsel arşivler, LLM eğitimi |
| Newspaper4k | Açık kaynak Python | Ücretsiz | $0 (+ sunucu maliyetleri) | Yok | Evet (bu iş için tasarlanmış) | 🔴 Yüksek | Geliştiriciler, korpus oluşturma |
| HasData | SERP API | Ücretsiz kredi | ~$0.25–$0.60 | Güçlü | Hayır (SERP verisi) | 🟢 Düşük | Bütçe dostu haber SERP uç noktası |
Kısa özet: Scrapingdog ve HasData, istek başına en ucuz API seçenekleri. Thunderbit ve Newspaper4k, temiz makale metninde öne çıkıyor (ama çok farklı şekillerde). Bright Data ve Oxylabs, kurumsal segmentin sahibi. Bakım derdi istemiyorsanız, 🟢 araçlarda kalın.
1. Thunderbit — İş Ekipleri İçin En İyi No-Code AI Haber Kazıyıcı
Thunderbit, ekibimle birlikte özellikle “Bu web sitesinden veriye ihtiyacım var, ama kod yazmak ya da seçicilerle uğraşmak istemiyorum” sorununu çözmek için geliştirdiğimiz araçtır. Haber kazıma açısından iş akışı olabildiğince basit: bir haber sayfası açın, AI Suggest Fields’e tıklayın, Thunderbit’in önerdiği sütunları gözden geçirin (başlık, tarih, kaynak, URL, özet — sayfa yapısını okuyup orada ne olduğunu çıkarır), ardından Scrape’e tıklayın.
Thunderbit’i haberler için özellikle güçlü kılan birkaç özellik var:
- AI uyarlanabilir çıkarım: Yazıp bakımını yapmanız gereken CSS seçicileri yok. AI her seferinde mevcut sayfa düzenini okur; yani bir haber sitesi tasarımını değiştirdiğinde (ki hepsi değiştirir), kazıyıcınız bozulmaz.
- Alt sayfa kazıma: Makale bağlantısı listesini kazıdıktan sonra Scrape Subpages ile her makaleyi ziyaret edip tam gövde metnini, yazarı, yayın tarihini ve görselleri çıkarabilirsiniz. Temiz makale içeriğini, yalnızca başlıkları değil, böyle alırsınız.
- Field AI Prompt: AI’ya sütun bazında talimat verebilirsiniz — örneğin, “yalnızca ana makale gövdesini çıkar, navigasyon ve reklamları hariç tut” veya “bu makalenin tonunu olumlu, nötr ya da olumsuz olarak sınıflandır.” No-code araçlar arasında benzersizdir ve haber analizi için son derece kullanışlıdır.
- Tarayıcı Kazıma vs. Bulut Kazıma: Tarayıcı modu kendi oturumunuzu kullanır (bulut IP’lerini engelleyen siteler için faydalıdır), Bulut modu ise hız için aynı anda 50 sayfaya kadar işleyebilir.
- Scheduled Scraper: Doğal dilde zaman aralıklarıyla günlük veya haftalık kazıma işleri kurun — devam eden haber takibi için harika.
- Her yere dışa aktarım: Excel, CSV, Google Sheets, Airtable, Notion — hepsi desteklenir.
AI ile Haber Kazıma İçin Thunderbit’i Deneyin
Fiyatlandırma ve Sınırlamalar
Thunderbit ücretsiz bir plan (ayda 6 sayfa) ve 10 sayfalık deneme sunar. Ücretli planlar, 500 kredi için yıllık faturalandırmada yaklaşık ayda 9 $ seviyesinden başlar (1 kredi = 1 satır). Tarayıcı modu için Chrome uzantısı gerekir. AI özellikleri kredi tüketir; bu yüzden binlerce makalede yoğun kullanım ücretli plan gerektirir — ancak günlük izleme ya da haftalık araştırma yapan çoğu iş ekibi için maliyet oldukça makuldür.
Bakım: 🟢 Düşük. AI her seferinde sayfayı yeniden okur.
En uygun kullanım: Kod yazmadan ya da kazıyıcı bakımıyla uğraşmadan günlük haber verisi isteyen teknik olmayan satış, PR ve operasyon ekipleri.
Thunderbit’in kodsuz web kazıma yaklaşımını daha yakından görmek için rehberimize göz atın.
2. SerpApi — Yapılandırılmış Google News SERP Verileri İçin En İyisi
SerpApi, Google News sonuçlarından yapılandırılmış JSON döndüren SERP’e özel bir API’dir. Kullanım senaryonuz “bana bir anahtar kelime için üst Google News sonuçlarını, panoya hazır ve yapılandırılmış biçimde ver” ise SerpApi güçlü bir seçimdir. Başlık, kaynak, tarih, snippet ve küçük resim döndürür — ancak tam makale metni vermez. Asıl makale gövdesini almak için ayrı bir adım ya da araca ihtiyacınız olur.
Temel özellikler:
- Google News SERP’lerinden yapılandırılmış JSON çıktısı
- Anti-detection taraflarında yönetilir (SERP’e özel)
- Birden fazla Google News yerel sürümü ve dili destekler
Fiyatlandırma: Ayda 250 arama ile ücretsiz plan. Ücretli planlar 5.000 arama için ayda 75 $’dan başlar — bu da 1.000 sonuç başına yaklaşık 15 $ demektir.
Sınırlama: Yalnızca snippet döndürür. Tam makale metnine ihtiyacınız varsa, SerpApi birinci adımdır; tüm hat değildir.
Bakım: 🟢 Düşük (yönetilen API, Google’daki değişiklikleri onlar yönetir).
En uygun kullanım: Haber izleme panoları kuran veya SERP verisini analitik araçlara besleyen geliştiriciler.
3. ScraperAPI — Proxy Dönüşümü Olan En İyi Bütçe Dostu Kazıma API’si
ScraperAPI, haber sitelerine özel olmasa da genel amaçlı bir kazıma API’sidir; haber sayfalarını çekmek için etkilidir. Temel değeri proxy dönüşümü, JavaScript render etme ve CAPTCHA yönetimidir — aksi halde sizin kurmanız gereken anti-bot altyapısı.
Temel özellikler:
- Residential ve datacenter IP’lerle proxy dönüşümü
- Dinamik haber siteleri için JavaScript render desteği
- CAPTCHA yönetimi
- Ham HTML döndürür — makale içeriğini siz ayrıştırırsınız
Fiyatlandırma: Aylık 1.000 kredi ile ücretsiz plan (artı deneme kredileri). JS render etme, istek başına daha fazla kredi tüketir. Ücretli planlar ayda 49 $’dan başlar. Normalize edilmiş maliyet, JS kullanımına bağlı olarak 1.000 istek başına yaklaşık 1–5 $ aralığındadır.
Sınırlama: Yerleşik makale ayrıştırma yoktur. Temiz metin değil HTML alırsınız. Makale çıkarımı için Newspaper4k ya da kendi ayrıştırıcınızla birlikte kullanın.
Bakım: 🟡 Orta (anti-bot kısmı yönetilir, ama çıkarım mantığı sizindir).
En uygun kullanım: Kendi proxy ağını kurmak istemeyen geliştiriciler.
4. Newsdata.io — Yapılandırılmış Meta Veri İçin En İyi Özel News API’si
Newsdata.io, 150’den fazla ülkede 50.000+ kaynağı kapsayan, bu iş için özel olarak geliştirilmiş bir haber API’sidir. Başlık, açıklama, kaynak, tarih, kategoriler, duygu tonu gibi yapılandırılmış veriler — ve premium planlarda tam makale içeriği — döndürür.
Temel özellikler:
- Anahtar kelime, kategori, dil, ülkeye göre sorgu
- Duygu analizi dahil
- Tarihsel haber arşivi (ücretli planlar)
- Yönetilecek kazıma altyapısı yok
Fiyatlandırma: Sınırlı alanlarla günde 200 istek içeren ücretsiz plan. Ücretli planlar tam içeriği ve tarihsel veriyi açar. 1.000 sonuç başına maliyet plan seviyesine göre değişir ama 5–15 $ bandındadır.
Sınırlama: Kendi indekslediği kaynakları kapsar — herhangi bir URL’yi verip “bunu kazı” diyemezsiniz. Niş bir yayın onların dizininde yoksa burada bulamazsınız.
Bakım: 🟢 Düşük (tam yönetilen haber API’si).
En uygun kullanım: Yapılandırılmış haber meta verisine ihtiyaç duyan ve herhangi bir kazıma altyapısı yönetmek istemeyen ekipler.
5. Apify — Özel Haber Kazıma İş Akışları İçin En İyi Bulut Platformu
Apify, Google News, belirli yayınlar ve genel makale çıkarımı için hazır kazıyıcıları olan, aktör tabanlı bir bulut platformudur. No-code ile tam özel geliştirme arasında tatlı bir noktada durur.
Temel özellikler:
- Google News, makale çıkarımı ve daha fazlası için hazır aktörler
- JavaScript render ve headless tarayıcı yürütmeyi destekler
- Zamanlama ile bulutta çalıştırma
- JSON, CSV, Excel, XML ve daha fazlasına dışa aktarma
Fiyatlandırma: $5 kredi içeren ücretsiz plan. Ücretli katmanlar ayda 49, 499 ve 999 $’dır. 1.000 sonuç başına maliyet aktöre göre değişir — haber kazıma aktörlerinde kabaca 1–6 $ arası.
Sınırlama: Hazır aktörler topluluk tarafından sürdürülür ve haber siteleri değiştiğinde bozulabilir. Sade no-code araçlardan daha fazla kurulum gerektirir.
Bakım: 🟡 Orta (siteler değiştiğinde aktörlerin güncellenmesi gerekebilir).
En uygun kullanım: Bulutta çalıştırma isteyen ve pazar yeri aktörlerini seçip yapılandırmaya rahat olan ekipler.
6. Oxylabs — En İyi Kurumsal Seviye Kazıma Altyapısı
Oxylabs, 100M+ proxy havuzu, CAPTCHA çözme ve tarayıcı render desteği sunan kurumsal bir kazıma servisidir. SERP Scraper API’leri Google News sonuçlarını coğrafi hedefleme ile işler, Web Scraper API’leri ise herhangi bir haber sayfası için kullanılabilir.
Temel özellikler:
- Coğrafi hedefleme ile devasa proxy altyapısı
- Google News için SERP Scraper API
- Herhangi bir URL için Web Scraper API
- JSON/CSV çıktısı, büyük ölçekli eşzamanlı istekler
Fiyatlandırma: SERP verisi için aylık 49 $’dan başlar. Yüksek hacim için kurumsal özel fiyatlama vardır. 2.000 sonuca kadar ücretsiz deneme.
Sınırlama: Küçük ekipler için pahalıdır. Öncelikle büyük ölçekli operasyonlar için tasarlanmıştır.
Bakım: 🟢 Düşük (tam yönetilen kurumsal API).
En uygun kullanım: Yüksek hacimli, coğrafi hedefli haber verisine kurumsal güvenilirlikle ihtiyaç duyan şirketler.
7. ScrapingBee — JavaScript Ağırlıklı Haber Siteleri İçin En İyisi
ScrapingBee, gerçek tarayıcı yürütmesiyle JavaScript render etmeye odaklanan bir kazıma API’sidir. İhtiyacınız olan haber sitesi içeriği istemci tarafı JS ile yükleniyorsa (ve modern sitelerin çoğu böyle yapıyor), ScrapingBee bunu iyi yönetir.
Temel özellikler:
- Proxy dönüşümüyle headless Chrome
- CAPTCHA yönetimi
- Bazı sayfalar için temel bir “Article Extraction” özelliği
- Ham HTML, JSON veya Markdown benzeri çıktı döndürür
Fiyatlandırma: Planlar ayda 49 $’dan başlar. Kredi bazlıdır; JS render etme daha pahalıdır. Deneme kredileri mevcuttur.
Sınırlama: Makale çıkarma özelliği, AI destekli alternatiflere kıyasla temeldir. Esas olarak HTML döndürür — çoğu iş akışında yine ayrıştırma gerekir.
Bakım: 🟡 Orta (anti-bot kısmı yönetilir, ama çıkarımın yapılandırılması kullanıcıya aittir).
En uygun kullanım: Headless tarayıcı yönetmeden render edilmiş HTML isteyen JS ağırlıklı haber siteleri kazıyan geliştiriciler.
8. Scrapingdog — Haberler İçin En İyi Bütçe Dostu SERP API’si
Scrapingdog, özel bir Google News uç noktası olan bütçe dostu bir SERP API’sidir. Yanıt süreleri hızlıdır (testte istek başına yaklaşık 2 saniye) ve API seçenekleri arasında bu listedeki en rekabetçi fiyatlandırmayı sunar.
Temel özellikler:
- Özel Google News uç noktası
- Yapılandırılmış JSON çıktısı (başlıklar, kaynak, tarih, snippet’ler)
- Hızlı yanıt süreleri
Fiyatlandırma: 400.000 istek için ayda 40 $’dan başlar — bu da yaklaşık 1.000 sonuç başına 0,10 $ anlamına gelir; gerçekten çok ucuz. Ücretsiz plan: 1.000 kredi.
Sınırlama: Tam makale içeriği değil, yalnızca SERP verisi (başlıklar, snippet’ler) döndürür. SerpApi ile aynı ödünleşim, ama çok daha düşük fiyatla.
Bakım: 🟢 Düşük (yönetilen SERP API).
En uygun kullanım: Google News SERP verisine ölçekli biçimde ihtiyaç duyan bütçe odaklı geliştiriciler.
9. Bright Data — Ölçekli Kurumsal Haber Verisi İçin En İyisi
Bright Data, kurumsal devdir. Platformunda özel bir News Scraper ürünü, devasa proxy altyapısı, CAPTCHA çözme, tarayıcı render ve S3, Snowflake ve daha fazlasına aşağı akış teslimatı yer alır.
Temel özellikler:
- Özel News Scraper ürünü
- Hazır veri kümeleri ve gerçek zamanlı toplama
- Otomatik proxy yönetimi ve CAPTCHA çözme
- Zamanlanmış toplama ve uyarılar
- JSON, CSV, NDJSON, S3, Snowflake, GCS, Azure, SFTP’ye dışa aktarma
Fiyatlandırma: Kullanıma göre ödemede yaklaşık 1.000 kayıt başına 0,30–0,50 $’dan başlar. Kurumsal özel planlar mevcuttur. 1.000 istek ücretsiz deneme.
Sınırlama: Asgari taahhütler içeren karmaşık fiyatlandırma yapısı. Öncelikle kurumsal bütçelere göre tasarlanmıştır.
Bakım: 🟢 Düşük (kurumsal yönetimli, yüksek güvenilirlik).
En uygun kullanım: Yüksek hacimli, güvenilir haber veri hatlarına ihtiyaç duyan büyük kuruluşlar.
10. Octoparse — Haber Sayfaları İçin En İyi Görsel No-Code Kazıyıcı
Octoparse, görsel ve tıkla-seç iş akışı oluşturucusuna sahip bir masaüstü uygulamasıdır. Yaygın haber siteleri için hazır şablonları vardır, sayfalama ve sonsuz kaydırmayı destekler ve zamanlanmış çalıştırmalar için bulut yürütme sunar.
Temel özellikler:
- Görsel tıkla-seç iş akışı oluşturucu
- Hazır haber sitesi şablonları
- Zamanlama ile bulut yürütme
- IP dönüşümü ve otomatik CAPTCHA çözme
- Excel, CSV, JSON, veritabanları, Google Sheets’e dışa aktarma
Fiyatlandırma: 10 görev ve ayda 50 bin dışa aktarmaya kadar ücretsiz plan. Ücretli planlar yaklaşık ayda 89 $’dan başlar.
Sınırlama: Seçici tabanlı çıkarım, haber siteleri düzenlerini güncellediğinde kazıyıcıların bozulması anlamına gelir. Manuel düzeltme gerekir — ve haber siteleri düzenlerini sık sık günceller.
Bakım: 🟡 Orta (şablonlar yardımcı olur, ama seçiciler yine de bozulabilir).
En uygun kullanım: Görsel no-code oluşturucu isteyen ve ara sıra şablon bakımı yapmaktan rahatsız olmayan kullanıcılar.
11. ParseHub — Yeni Başlayanlar İçin En İyi Ücretsiz No-Code Seçeneği
ParseHub, cömert bir ücretsiz plana sahip görsel tıkla-seç kazıyıcıdır. JavaScript ile render edilen içeriği destekler ve tek seferlik araştırma projeleri veya küçük ölçekli haber çıkarımı için iyi çalışır.
Temel özellikler:
- Görsel öğe seçimi (kod yok)
- JavaScript ile render edilen sayfaları destekler
- CSV/JSON’a dışa aktarım
- Ücretsiz plan: 5 proje, çalıştırma başına 200 sayfa
Fiyatlandırma: 5 proje ve çalıştırma başına 200 sayfa ile ücretsiz plan. Ücretli planlar ayda 189 $’dan başlar.
Sınırlama: CSS seçici tabanlıdır; bu yüzden düzenler değiştiğinde kazıyıcılar sık sık bozulur. Ölçeklenebilirliği sınırlıdır ve API araçlarına göre daha yavaştır. Reddit ve forumlardaki kullanıcılar öğrenme eğrisine ve kırılganlığa sürekli dikkat çekiyor.
Bakım: 🔴 Yüksek (seçiciler sık bozulur, AI uyarlaması yok).
En uygun kullanım: Küçük, tek seferlik haber araştırma projeleri yapan ve ücretsiz bir başlangıç noktası isteyen yeni başlayanlar.
12. Newscatcher — PR ve Medya Takibi İçin En İyi News API’si
Newscatcher, 70.000+ kaynağı kapsayan özel bir haber toplama API’sidir. Duygu, özet ve varlık çıkarımı gibi NLP ile zenginleştirilmiş alanlarla medya takibi, PR izleme ve trend analizi için tasarlanmıştır.
Temel özellikler:
- 70.000+ kaynak kapsamı
- NLP zenginleştirmeleri: duygu, özet, varlık çıkarımı, çoğaltma önleme, kümeleme
- Anahtar kelime, konu, kaynak, dil, ülkeye göre sorgu
- Tarihsel arşiv erişimi
Fiyatlandırma: Kurumsal fiyatlandırma (özel teklif). Test için herkese açık ücretsiz plan yok, ancak talep üzerine deneme sunulabilir.
Sınırlama: Kurumsal odaklı fiyatlandırma küçük ekiplerin erişemeyeceği seviyede olabilir. Self-servis ücretsiz plan yok.
Bakım: 🟢 Düşük (tam yönetilen API).
En uygun kullanım: Orta ve büyük ölçekli şirketlerde PR ve medya takibi ekipleri.
13. Webz.io — Tarihsel Haber Arşivleri ve LLM Eğitim Verisi İçin En İyisi
Webz.io, yıllara yayılan milyarlarca makalelik devasa tarihsel arşive sahip bir haber veri platformudur. Hem gerçek zamanlı akışlar hem de tarihsel veri erişimi sağlar; tam makale metni, meta veri ve zenginleştirmeleri içeren yapılandırılmış JSON çıktısı verir.
Temel özellikler:
- Tarihsel arşivde milyarlarca makale
- Gerçek zamanlı akışlar ve tarihsel veri erişimi
- Yapılandırılmış meta veriyle tam makale metni
- Eğitim veri kümeleri ve RAG hatları için AI/ML ekipleri arasında popüler
Fiyatlandırma: Kurumsal/özel fiyatlandırma (veri hacmine bağlı). Haberler için self-servis ücretsiz plan yok.
Sınırlama: Sıradan kullanıcılar için tasarlanmadı. Yalnızca kurumsal fiyatlandırma.
Bakım: 🟢 Düşük (tam yönetilen veri akışı).
En uygun kullanım: Eğitim veri kümeleri oluşturan AI/ML ekipleri ve derin tarihsel haber arşivlerine ihtiyaç duyan kurumsal ekipler.
14. Newspaper4k — Makale Çıkarımı İçin En İyi Açık Kaynak Kütüphane
Newspaper4k, temiz makale içeriği çıkarmak için özel olarak geliştirilmiş bir Python kütüphanesidir (Newspaper3k’ün devamı). Reklamları, yan panelleri ve navigasyonu ayıklar; geriye yalnızca makaleyi bırakır: başlık, gövde metni, yazarlar, yayın tarihi, görseller, anahtar kelimeler ve özet.
Temel özellikler:
- Gürültüyü ayıklayarak temiz makale gövdesi çıkarır
- Başlık, yazarlar, yayın tarihi, görseller, anahtar kelimeler, özet döndürür
- Tamamen ücretsiz ve açık kaynak
- Statik HTML sayfalar için hafif ve hızlıdır
Fiyatlandırma: Ücretsiz. Ancak kendi sunucunuza, proxy altyapınıza ve geliştirici zamanınıza ihtiyacınız olacak.
Sınırlama: Yerleşik anti-bot yönetimi yoktur. Yoğun dinamik/JS ile render edilen haber sitelerinde bozulur. Temel çıkarımın ötesine geçmek için Python bilgisi ve özel bir hat gerekir. Bir sitenin HTML yapısı değiştiğinde, siz düzeltirsiniz.
Bakım: 🔴 Yüksek (site HTML’si değiştiğinde bozulur, manuel düzeltme gerekir).
En uygun kullanım: Makale ayrıştırmada maksimum kontrol isteyen Python geliştiricileri.
15. HasData — Haber Uç Noktası Olan En İyi Bütçe Dostu SERP API’si
HasData, özel bir Google News uç noktası olan bir SERP API’sidir. Haber sonuçlarını rekabetçi fiyatla yapılandırılmış JSON olarak döndürür.
Temel özellikler:
- Özel Google News uç noktası
- Yapılandırılmış JSON çıktısı
- İstek başına yaklaşık 3–4 saniye yanıt süresi
- Test için ücretsiz kredi
Fiyatlandırma: 200.000 kredi için ayda 49 $’dan başlar (haber isteği başına 5 kredi = 40.000 istek). Bu da yaklaşık 1.000 sonuç başına 0,25–0,60 $ demektir.
Sınırlama: Tam makale içeriği değil, SERP verisi (başlıklar, snippet’ler) döndürür.
Bakım: 🟢 Düşük (yönetilen SERP API).
En uygun kullanım: SerpApi’nin fiyat etiketi olmadan Google News SERP verisine ihtiyaç duyan bütçe odaklı ekipler.
Dikkat Çeken Kalıplar
Tüm 15 aracı inceledikten sonra birkaç kalıp öne çıkıyor.
SERP API’leri (SerpApi, Scrapingdog, HasData) yapılandırılmış başlık verisi için harika, ama tam makale metnine ihtiyacınız olduğunda sizi yarı yolda bırakıyor. Özel haber API’leri (Newsdata.io, Newscatcher, Webz.io) meta veri sorununu çok iyi çözüyor, ama rastgele URL’leri kazıyamıyor. No-code araçlar (Thunderbit, Octoparse, ParseHub) her sayfayı kazıma esnekliği sağlıyor — ancak bakım profilleri birbirinden çok farklı. Newspaper4k ise, hattı kendiniz kurup sürdürmeye razıysanız, en temiz makale çıkarımını sunuyor.
API vs. No-Code vs. Açık Kaynak: 1.000 Makale Başına Gerçek Maliyet
Bu karşılaştırmayı diğer hiç kimse tüm kategoriler arasında normalize etmiyor. İşte matematik:
| Yöntem | Kurulum Süresi | 1.000 Makale Başına Maliyet | Bakım | En İyi Olduğu Alan |
|---|---|---|---|---|
| Açık kaynak (Newspaper4k) | Saatler–günler | $0 (ama sunucu + geliştirici zamanı var) | 🔴 Yüksek | Özel ihtiyacı olan geliştiriciler |
| News API (Newsdata.io, Newscatcher, Webz.io) | Dakikalar | $5–$50+ | 🟢 Düşük | Yapılandırılmış veri, tarihsel arşivler |
| Kazıma API’si (ScraperAPI, ScrapingBee, Oxylabs) | 30 dk | $1–$5 | 🟡 Orta | Anti-bot yönetimi isteyen geliştiriciler |
| No-code AI (Thunderbit, Octoparse, ParseHub) | 2 dakika | $3–$15 | 🟢–🟡 | İş kullanıcıları, teknik olmayan ekipler |
“Ücretsiz” açık kaynak araçların gizli maliyeti geliştirici zamanıdır. Kırılmış bir Newspaper4k hattını ayda 4 saat düzelten kıdemli bir geliştirici? Bu ücretsiz değil — pahalı.
Diğer uçta, Webz.io ve Newscatcher gibi kurumsal API’ler bakımı düşük ama yalnızca ölçekle anlamlı olan fiyat etiketlerine sahip.
Benim konuştuğum çoğu iş ekibi için en iyi nokta ya esnek, ad hoc kazıma için no-code bir AI aracı (Thunderbit gibi) ya da yapılandırılmış, sürekli izleme için özel bir haber API’sidir.
Bakım Sorunu: Neden Çoğu Haber Kazıyıcı Bozulur (ve Hangileri Bozulmaz)
Bu konu kendi başına bir bölümü hak ediyor.
Forumlarda, destek taleplerinde ve kullanıcı görüşmelerinde en çok gördüğüm şikâyet bu. Haber siteleri düzenlerini sürekli değiştiriyor — bazen haftalık. CSS seçicilere ya da XPath’e dayalı bir kazıyıcı bugün kusursuz çalışıp yarın çöp döndürebilir.
15 aracın bakım spektrumunda nasıl sıralandığı şöyle:
| Bakım Seviyesi | Araçlar | Site Değiştiğinde Ne Olur |
|---|---|---|
| 🟢 Düşük (AI uyarlanabilir veya yönetilen API) | Thunderbit, SerpApi, Newsdata.io, Newscatcher, Webz.io, Scrapingdog, HasData, Oxylabs, Bright Data | AI sayfayı yeniden okur ya da API sağlayıcısı bunu yönetir. Siz hiçbir şeye dokunmazsınız. |
| 🟡 Orta (şablon + proxy) | ScraperAPI, ScrapingBee, Apify, Octoparse | Anti-bot yönetilir, ancak çıkarım mantığınız ya da aktör/şablon güncelleme gerektirebilir. |
| 🔴 Yüksek (seçici tabanlı) | ParseHub, Newspaper4k | Site değiştiğinde kazıyıcınız bozulur. Seçicileri ya da ayrıştırma kurallarını manuel düzeltirsiniz. |
Thunderbit’in yaklaşımı burada özellikle vurgulanmalı: AI, her kazıma çalıştırdığınızda mevcut sayfa yapısını yeniden okuduğu için, bakım gerektiren sabit kodlanmış seçiciler yoktur. Kullanıcılarımızın aynı haber kaynaklarını aylarca, konfigürasyonu güncellemeden kazıdığını gördüm — siteler düzen değişikliği yapsa bile. Günlük haber özeti ya da haftalık rekabet raporu çalıştırırken güvenilirlik tam da budur.
Temiz Makale Metni: Hangi Haber Kazıyıcılar Gürültüyü Gerçekten Ayıklıyor?
“Veriyi aldım ama reklamlar, navigasyon menüleri ve yan sütun çöpleriyle dolu.” Haber kazıma ile ilgili gördüğüm destek sorularının kabaca üçte ikisi bununla ilgili.
İşte dürüst döküm:
| Temiz Metin Kabiliyeti | Araçlar |
|---|---|
| Kutudan çıktığı gibi temiz makale metni döndürür | Newspaper4k, Thunderbit (alt sayfa kazıma + Field AI Prompt ile), Newsdata.io (premium), Webz.io, Bright Data (News Scraper), Newscatcher |
| Yalnızca başlık/snippet döndürür (tam metin yok) | SerpApi, Scrapingdog, HasData, Oxylabs (SERP modu) |
| Ham HTML döndürür (kullanıcı ayrıştırmalı) | ScraperAPI, ScrapingBee |
| Yapılandırmaya göre değişir | Apify, Octoparse, ParseHub |
Newspaper4k, standart haber sayfalarından gürültüyü ayıklamada altın standarttır — tam olarak bunun için yapılmıştır. Ama Python gerektirir ve JS ağırlıklı sitelerde bozulur.
Thunderbit’in Field AI Prompt’u no-code eşdeğeridir: AI’ya sütun bazında “yalnızca ana makale gövdesini çıkar, navigasyon ve reklamları hariç tut” diyebilirsiniz; ayrıca çıkarım sırasında metni etiketleyebilir, kategorize edebilir veya özetleyebilir. Temiz makale metnine kod yazmadan ihtiyaç duyan ekipler için bulduğum en pratik seçenek bu.
AI destekli çıkarımın geleneksel yöntemlerle karşılaştırmasını merak ediyorsanız, AI web kazıma yazımız daha derine iniyor.
Haber Kazımayı Sorumlu Şekilde Yapmak: Yasal ve Etik Temeller
Bulduğum hiçbir rakip yazı buna değinmiyor — özellikle kurumsal okuyucular için doldurulması gereken bir boşluk.
robots.txt: Her zaman kontrol edin. Birçok büyük haber sitesi belirli yolların kazınmasını açıkça yasaklar. Sorumlu araçlar (Thunderbit dahil) oturum bağlamına saygı duyan tarayıcı tabanlı kazımaya izin verir, ancak büyük ölçekli işlere başlamadan önce sitenin robots.txt dosyasını yine de incelemelisiniz.
Kullanım Şartları: İç araştırma için meta veri (başlıklar, tarihler, URL’ler) çıkarmak ile telifli tam makaleleri yeniden yayımlamak arasında anlamlı bir fark vardır. İlki genelde daha düşük risklidir; ikincisi gerçek hukuki maruz kalma yaratabilir. hiQ v. LinkedIn ve Meta v. Bright Data gibi yakın tarihli davalar, hukuki çerçevenin hâlâ gelişmekte olduğunu gösteriyor.
En iyi uygulamalar: Mümkün olduğunda resmi API’leri kullanın (Google News RSS, Newsdata.io, Newscatcher). Ön belleği sorumlu kullanın. İsteklerinizi hız sınırına tabi tutun. Asla ödeme duvarlarını aşmayın. Bu listedeki araçların birkaçı — Thunderbit, ScraperAPI ve Bright Data dahil — çizginin doğru tarafında kalmanıza yardımcı olan yerleşik hız sınırlama veya etik kazıma özellikleri sunuyor.
Bu makale bilgilendirme amaçlıdır, hukuki tavsiye değildir. Kurumsal ölçekte kazıma yapıyorsanız hukuk ekibinize danışın.
Thunderbit Haber Kazıma İş Akışınıza Nasıl Uyar?
Thunderbit’i ekibim geliştirdiği için, haber kazıma açısından güçlü ve zayıf yönlerini herkesten iyi biliyorum. İş akışı gerçekte şöyle görünür.
Bir iş kullanıcısının tipik akışı şöyle olur:
- Bir haber sayfası açın (Google News sonuçları, bir yayın ana sayfası, bir konu arama sayfası) Chrome’da.
- Thunderbit uzantısına tıklayın ve AI Suggest Fields seçeneğine basın. Thunderbit sayfayı okur ve başlık, tarih, kaynak, URL, snippet, görsel vb. sütunlar önerir.
- Gerekirse sütunları ayarlayın. Duygu sınıflandırması mı istiyorsunuz? “Duyguyu olumlu, nötr veya olumsuz olarak sınıflandır” gibi bir Field AI Prompt ile sütun ekleyin. Yalnızca belirli bir kategorideki makaleler mi olsun? Bir filtre prompt’u ekleyin.
- Scrape’e tıklayın. Tarayıcı modu (oturumunuzu kullanır, bulut IP’lerini engelleyen siteler için iyidir) veya Bulut modu (daha hızlıdır, aynı anda 50 sayfaya kadar işler) arasından seçim yapın.
- Scrape Subpages ile her makale URL’sini ziyaret edip tam gövde metnini, yazarı, yayın tarihini ve görselleri çıkarın.
- Excel, CSV, Google Sheets, Airtable veya Notion’a dışa aktarın.
Sürekli izleme için Scheduled Scraper, doğal dilde aralıklarla günlük veya haftalık çalıştırmalar kurmanıza izin verir (ör. “her hafta içi sabah 8’de”). Ve Thunderbit 34 dili desteklediği için, uluslararası haber takibi oldukça kolaydır.
Thunderbit’in daha az ideal olduğu yer: ayda milyonlarca makaleyi mümkün olan en düşük birim maliyetle kazımak — burada Bright Data veya Webz.io gibi kurumsal bir API daha maliyet-etkin olur. Ve API yanıtına gömülü derin NLP zenginleştirmesi (varlık çıkarımı, kümeleme, çoğaltma önleme) gerekiyorsa, Newscatcher bunun için özel olarak tasarlanmıştır.
Thunderbit’i Chrome uzantısı üzerinden ücretsiz deneyebilirsiniz — kredi kartı gerekmez.
Doğru Haber Kazıyıcı Nasıl Seçilir
15 aracın tamamını test ederek çıkardığım kısa rehberim:
- Teknik olmayan bir iş kullanıcısı ve günlük haber verisi mi istiyorsunuz? Thunderbit ile başlayın. İki tık, kod yok, AI düzen değişikliklerini yönetir.
- Bir izleme hattı kuran geliştirici misiniz? SERP verisi için SerpApi veya Scrapingdog. Ham HTML ve anti-bot için ScraperAPI veya ScrapingBee.
- Ölçek ve güvenilirlik isteyen kurumsal ekip misiniz? Bright Data veya Oxylabs.
- Binlerce kaynak boyunca marka bahsi izleyen bir PR ekibi misiniz? Newscatcher veya Newsdata.io.
- Metin korpusu oluşturan araştırmacı mısınız? Python konusunda rahatsanız Newspaper4k; değilseniz Thunderbit’in alt sayfa kazıması.
- RAG hattını besleyen bir AI mühendisi misiniz? Temiz, yapılandırılmış makale metni için Thunderbit API veya Webz.io.
- Bütçeniz kısıtlı mı? API için Scrapingdog, no-code için Thunderbit’in ücretsiz planı, açık kaynak için Newspaper4k.
Doğru araç; bakım toleransınıza, bütçenize ve teknik beceri seviyenize bağlıdır. Emin değil misiniz? Ücretsiz bir planla başlayın — çoğu araç bunu sunuyor — ve hangi iş akışının sizin gerçekliğinize uyduğunu görün.
Daha fazla seçenek ve karşılaştırma için en iyi AI web kazıyıcılar derlememiz daha geniş tabloyu kapsıyor. Ve bir araca bağlanmadan önce web kazıma tam olarak nedir diye anlamak istiyorsanız, bu rehber iyi bir başlangıç noktasıdır.
Sonuç
2026’da haber kazıma çözülmüş bir problem — durumunuza uygun aracı seçin, veri akacaktır. Herkese uyan tek bir öneri devri bitti. SERP API’leri başlıklar için harikadır ama makale metni vermez. Özel haber API’leri yapılandırılmış meta veri için mükemmeldir ama rastgele URL’leri kazıyamaz. Thunderbit gibi no-code AI araçları size esneklik ve düşük bakım sunarken, açık kaynak kütüphaneler kontrolü hafta sonlarınız pahasına verir.
Dürüst tavsiyem: başlıklara mı, tam makale metnine mi, yoksa zenginleştirilmiş meta veriye mi ihtiyacınız olduğuna karar verin — sonra bunu sürdürebileceğiniz bakım seviyesi ve bütçeyle eşleştirin. Ve satır yazmadan modern, AI uyarlanabilir haber kazımanın nasıl göründüğünü görmek istiyorsanız, Thunderbit’i deneyin. Birkaç tıkla ne kadar çok iş çıkarabileceğinize şaşıracağınızı düşünüyorum.
Keyifli kazımalar — ve makale metniniz her zaman temiz, seçicileriniz asla bozulmasın, dışa aktarımınız da doğru tabloya düşsün.
SSS
1. Teknik olmayan kullanıcılar için en iyi haber kazıyıcı hangisi?
Thunderbit, teknik olmayan kullanıcılar için en güçlü seçenektir. AI destekli, 2 tıkla çalışan iş akışı kod ya da CSS seçicileri gerektirmez. AI sayfa yapısını otomatik okur, çıkarım alanlarını önerir ve düzen değiştiğinde uyum sağlar — yani hiçbir şeyi sürdürmeniz gerekmez. Ayrıca doğrudan Google Sheets, Airtable ve Notion’a aktarır.
2. Haber kazıyıcılardan tam makale metni alabilir miyim, yoksa yalnızca başlıklar mı gelir?
Bu araca bağlıdır. SerpApi, Scrapingdog ve HasData gibi SERP API’leri yalnızca başlık ve snippet döndürür. Newsdata.io ve Webz.io gibi özel haber API’leri premium planlarda tam metin sunar. Thunderbit gibi no-code araçlar alt sayfa kazıma ile tam makale metni çıkarabilir; Newspaper4k ise Python’da temiz makale çıkarımı için özel olarak tasarlanmıştır. Bir aracı seçmeden önce ham HTML, snippet veya temiz makale gövdesi döndürüp döndürmediğini mutlaka kontrol edin.
3. Haber kazıyıcılar web siteleri düzenini değiştirdiğinde bozulur mu?
Seçici tabanlı araçlar (ParseHub, Octoparse, Newspaper4k, özel Scrapy hatları) haber siteleri düzen güncellediğinde sık sık bozulur — ve haber siteleri bunu sık yapar. Thunderbit gibi AI uyarlanabilir araçlar her seferinde sayfa yapısını yeniden okur, bu yüzden düzen değişiklikleri iş akışını bozmaz. Yönetilen API’ler (SerpApi, Newsdata.io, Newscatcher) değişiklikleri kendi taraflarında ele alır. Bakım sizin için önemliyse, karşılaştırma tablosunda 🟢 Düşük olarak işaretlenen araçları önceliklendirin.
4. Ölçekli biçimde haber kazımanın en ucuz yolu nedir?
API tabanlı kazıma için Scrapingdog en düşük istek başı maliyeti sunar (1.000 sonuç başına yaklaşık 0,10 $’dan başlar). No-code kazıma için Thunderbit’in ücretsiz planı küçük projeleri kapsar ve ücretli planlar yaklaşık 9 $/aydan başlar. Açık kaynak için Newspaper4k ücretsizdir — fakat hızla büyüyebilen geliştirici zamanını ve sunucu maliyetlerini hesaba katın.
5. Haber sitelerini kazımak yasal mı?
Herkese açık veriyi iç araştırma için kazımak genelde daha düşük risklidir, ancak telifli tam makaleleri yeniden yayımlamak hukuki risk yaratabilir. Kazımadan önce sitenin robots.txt ve Kullanım Şartları’nı mutlaka kontrol edin. Mümkün olduğunda resmi API’leri kullanın, hız sınırlarına uyun ve asla ödeme duvarlarını aşmayın. hiQ v. LinkedIn ve Meta v. Bright Data gibi yakın tarihli davalar, hukuki çerçevenin hâlâ gelişmekte olduğunu gösteriyor. Kurumsal ölçekte kazıma yapıyorsanız hukuk ekibinize danışın.
Haber Kazıma İçin Thunderbit’i Deneyin Get Started Free
Daha Fazla Bilgi


