Geçen yıl kurumların yüzde 96’sı açık kaynak kullanımını artırdı ya da aynı seviyede tuttu; bunu 2025 State of Open Source raporu söylüyor — ve bunun bir numaralı nedeni hâlâ “lisans maliyetinin olmaması”. Ama GitHub’dan bir scraper indirirken kimsenin sana açık açık söylemediği bir şey var: “açık kaynak” olmak ile “ticari ürününde güvenle kullanılabilir” olmak aynı şey değil.
Bu yılın önemli bir kısmını Scrapy, Playwright, Puppeteer ve Crawl4AI ile ScrapeGraphAI gibi daha yeni, AI odaklı crawler’lar arasında dolaşarak geçirdim. Asıl kritik nokta ise çoğu “en iyi scraper’lar” listesinin hiç değinmediği bir mesele: lisans türü. Listelerin çoğu GitHub yıldızına göre sıralanıyor. Ben ise hukuk ekibin “durun, bu AGPL mi?” diye sorduğunda ne olacağına göre sıralıyorum. Bu liste, 12 aracı önce kategori uyumuna göre (parser’lar, tarayıcı otomasyonu, AI-native scraper’lar, crawl framework’leri, no-code eklentiler) sonra lisansına göre sıralıyor; çünkü kararlar gerçekte tam da bu sırayla veriliyor.
Her Açık Kaynak Web Scraper İçin İlk Eleme Kriteri Neden Lisans Türü Olmalı?

“Açık kaynak” demek, “istediğin gibi her şeyi yapabilirsin” demek değildir. Açık Kaynak Tanımı, ticari kullanıma karşı ayrım yapılmasını açıkça yasaklar — bu yüzden bu listedeki tüm araçlar iş amaçlı kullanıma izin verir. Ama nasıl kullanabileceğin ve ürünü dağıttığında hangi yükümlülüklerin devreye gireceği tamamen lisansa bağlıdır.
İzin verici lisanslar — MIT, BSD-3-Clause, Apache-2.0 — telif hakkı bildirimini koruduğun sürece neredeyse her şeye izin verir. Apache-2.0 biraz daha ileri giderek açık bir patent lisansı da sunar; hukukçuların en çok sevdiği lisanslardan biri olmasının nedeni de budur. Bu üç lisansın hiçbiri senden kendi kaynak kodunu yayınlamanı istemez.
Copyleft lisanslar bambaşka bir dünyadır. İnsanları en çok zorlayan lisans AGPL-3.0’dır ve Firecrawl’ın self-hosted çekirdeği tam da bu lisansla sunulur (SDK’ler MIT, ama ana scraping motoru AGPL’dir). AGPL-3.0’un 13. Bölümü uyarınca, kapsanan programı değiştirip kullanıcıların bu değiştirilmiş sürümle ağ üzerinden etkileşime girmesine izin veriyorsan, ilgili kaynak kodu da sunmak zorundasın. Bu, internet forumlarının bazen anlattığı gibi “tüm SaaS açık kaynak olur” sonucu değildir — yükümlülük özellikle uzaktan etkileşime açılan değiştirilmiş kapsanan program için geçerlidir. Yine de bu, kapalı kaynak bir ürünün üzerine inşa etmeden önce Stack Overflow yorumu değil, gerçek hukuki danışmanlık gerektiren ciddi bir sorudur.
Bir de daha belirsiz olan “open-core” kategorisi var. Chrome eklentisi olan Web Scraper, GitHub’da tarihsel olarak LGPL-3.0 lisanslı bir depoya sahip — ancak o deponun son kod commit’i 2017’de kalmış durumda ve bu eski kaynak ile Chrome Web Store’daki mevcut eklenti (bu yazı itibarıyla sürüm 1.111.13) arasında doğrulanmış bir eşleşme yok. Dürüst yorum şu: yerel eklenti ücretsiz, zamanlama ve proxy rotasyonu sunan Cloud katmanı ise ayrı bir özel ürün ve bütün pakete “açık kaynak” demek bu ayrımı görünmez kılıyor.
Bu 12 En İyi Açık Kaynak Web Scraper Aracını Nasıl Karşılaştırdık?
Her aracı yedi eksende değerlendirdim: lisans türü ve ticari kullanım sürtünmesi, dil/runtime, yerel JavaScript render desteği (ya da bir eklenti eşleşmesine ihtiyaç olup olmaması), öğrenme eğrisi, gizli işlem gücü veya proxy maliyeti, topluluk sağlığı sinyalleri (açık sorunlar, sürüm sıklığı, son commit) ve en uygun kullanım senaryosu.
Liste, yalnızca yıldız sayısına göre değil; kategoriye göre gruplandı: statik parser’lar, tarayıcı otomasyon framework’leri, AI-native scraper’lar, crawl framework’leri ve ardından tek no-code tarayıcı eklentisi. Bu bilinçli bir tercih. Beautiful Soup ile Scrapy tamamen farklı problemleri çözer; ikisini aynı eksende sıralamak aslında kimseye doğru aracı seçtirmez.
| Kriter | İncelediğim Şey |
|---|---|
| Lisans ve ticari uyum | Kesin depo lisansı, atıf gereklilikleri, copyleft/ağ maddeleri |
| Runtime ve ekip uyumu | Python, Node/TypeScript, Java veya çok dilli destek |
| JS render desteği | Yerel tarayıcı desteği, eklenti eşleşmesi veya hiç olmaması |
| Framework kapsamı | Sadece parser, tarayıcı sürücüsü, tam crawl hattı veya yönetilen ürün |
| Topluluk sağlığı | GitHub yıldızları, son sürüm tarihi, açık issue’lar, son push |
| Gizli maliyet | Tarayıcı bellek kullanımı, proxy ihtiyacı, model API bağımlılığı, bakım yükü |
| En iyi kullanım | Belgelenmiş yetenekler veya issue’larla desteklenen belirli ekip/görev uyumu |
Topluluk sağlığı verilerine dair dürüst bir not: Beautiful Soup’un ana geliştirmesi GitHub’da değil Launchpad’de yapılıyor. Bu yüzden GitHub yıldız sayısı (resmî olmayan bir yansıtma ve 2022’den beri güncellenmemiş, 223 yıldızda duran bir depo) diğer 10 araçla doğrudan kıyaslanabilir değil. Aşağıda bunu açıkça belirtiyorum; sanki aynı tabloda rahatça yer alıyormuş gibi davranmıyorum.
Statik Siteler İçin En İyi Açık Kaynak Parsing Kütüphanesi: BeautifulSoup

BeautifulSoup HTML/XML ayrıştırma ağaçlarında gezinmek ve arama yapmak için kullanılan bir Python kütüphanesidir. Sayfayı çekmez, JavaScript çalıştırmaz, crawl kuyruklarını yönetmez — elinde zaten olan markup’ı alır ve dostane bir API ile içinden veri çıkarmanı sağlar. Kapsamının dar olması işte tam da bunun içindir: HTML elindeyse ve sadece içinden veri çekmen gerekiyorsa başvuracağın araç budur.
- Lisans: MIT — izin verici, bildirim metnini koruman dışında bir yükümlülük yok
- Öğrenme eğrisi: gerçekten başlangıç dostu; nesne modeli affedicidir
- JS render: yerleşik destek yok — önce render edilmiş HTML alan bir araçla eşleştir
- Bilinen sınırlama: resmî dokümanlar bunun “altındaki parser’lar kadar hızlı olmayacağını” açıkça söyler; ayrıca farklı parser altyapıları (lxml, html5lib, html.parser) bozuk HTML için anlamlı derecede farklı ağaçlar üretebilir
En uygun kullanım: hızlı iç betikler ve statik ya da önceden alınmış HTML’den tek seferlik veri çıkarma — ölçek için veya JS yoğun siteler için değil.
Eski Nesil Çoklu Tarayıcı Testi İçin En İyi Açık Kaynak Tarayıcı Otomasyon Framework’ü: Selenium

Selenium bu listedeki en eski isimdir; ilk olarak tarayıcı testleri için geliştirildi ve o zamandan beri scraping dünyasının yarısı tarafından yeniden kullanıldı. Onu tanımlayan şey hız değil, erişimdir. Resmî Selenium 4 bağlayıcıları Java, Python, C#, Ruby ve JavaScript’i kapsar; Chrome, Edge, Firefox ve Safari’yi W3C WebDriver standardı üzerinden yönetir.
- Lisans: Apache-2.0
- GitHub sağlığı: 34.366 yıldız, 98 açık issue, son bir yılda 12 kararlı sürüm (en yenisi: 4.47.0)
- JS render: gerçek tarayıcı üzerinden yerel destek
- Belgelenmiş sürtünme: Selenium’un kendi dokümanları senkronizasyonu “en yaygın zorluklardan biri” olarak tanımlar — sayfanın hazır olması, JS ile eklenen öğelerin de hazır olduğu anlamına gelmez; dinamik DOM yenilemesi sana
StaleElementReferenceExceptionfırlatabilir
En uygun kullanım: çoklu tarayıcı ya da çoklu dil desteğine ihtiyaç duyan ekipler veya QA için zaten Selenium kullanan ve scraping’de de aynı becerileri değerlendirmek isteyenler.
Modern, JS Yoğun Siteler İçin En İyi Açık Kaynak Tarayıcı Otomasyon Framework’ü: Playwright

Microsoft tarafından geliştirilen Playwright, “Selenium yavaş ve hantal geliyor” sorusuna modern cevaptır. Chromium, Firefox ve WebKit’i yerel olarak otomatikleştirir; etkileşimden önce öğelerin gerçekten hazır olmasını — görünür, kararlı ve etkin olmasını — bekleyen actionability kontrolleri içerir. Sadece bu otomatik bekleme davranışı bile Selenium kullanıcılarının elle yazdığı pek çok WebDriverWait kalıbını ortadan kaldırır.
Ama forumlardaki “Scrapy mi Playwright mı Selenium mu?” tartışmalarında gözden kaçan kritik nüans şu: Scrapy kendi başına JavaScript render etmez. Tarayıcı render’ı almak için ayrıca scrapy-playwright gibi bir eklenti gerekir. Playwright ve Puppeteer ise render işlemini doğal olarak yapar; çünkü render zaten ürünün kendisidir.
- Lisans: Apache-2.0
- GitHub sağlığı: 94.443 yıldız, son bir yılda 15 kararlı sürüm (en yenisi: 1.62.1)
- Gizli maliyet: yalnızca tarayıcı ikilileri yaklaşık Chromium için 281 MB, Firefox için 187 MB ve WebKit için 180 MB yer kaplar — ayrıca 1.38’deki kırıcı değişiklik otomatik tarayıcı indirmelerini durdurdu, bu yüzden Docker imajını sürüm sabitleyerek kullanman önemlidir
En uygun kullanım: React/Vue tek sayfa uygulamalarını güvenilir çapraz tarayıcı davranışıyla scrape eden ve bekleme mantığını sıfırdan yazmak istemeyen ekipler.
Chrome Odaklı Projeler İçin En İyi Açık Kaynak Tarayıcı Otomasyon Aracı: Puppeteer

Google’ın kendi otomasyon kütüphanesi olan Puppeteer, tasarım gereği Chrome önceliklidir — derin Chrome DevTools Protocol entegrasyonu, yerleşik ekran görüntüsü/PDF üretimi, hepsi mevcut. Burada eski bir varsayımı düzeltmek gerekir: güncel Puppeteer artık resmî olarak kararlı Firefox’u da destekliyor, dolayısıyla “sadece Chrome” demek tam doğru değil; yine de ana kullanım alanı hâlâ Chrome’dur.
- Lisans: Apache-2.0
- GitHub sağlığı: 95.458 yıldız, 249 açık issue — Playwright’a göre açık issue sayısı belirgin şekilde daha yüksek, bu da tepki hızını değerlendirirken hesaba katılmalı
- Anti-bot gerçeği: Puppeteer issue #7006, tamamen normal bir gezinmenin Cloudflare engeline takıldığını belgeler — bir sayfayı render etmen seni anti-bot sistemlerden görünmez yapmaz, nokta.
En uygun kullanım: Chrome standardına oturmuş Node.js ekipleri, özellikle scraping ile birlikte PDF/ekran görüntüsü üretmek isteyenler.
LLM ve RAG Hatları İçin En İyi Açık Source AI-Native Scraper: Crawl4AI

Crawl4AI, LLM ve RAG hatları için ham HTML yığını yerine temiz Markdown üretmek üzere tasarlanmış; perde arkasında Playwright kullanır. Hem “temiz Markdown” modu hem de bağlam pencereleri için ayarlanmış “Fit Markdown” modu sunar; istersen opsiyonel LLM çıkarımı da yapar — CSS/XPath ve BM25 filtreleme, hiçbir model API’sine dokunmadan çalışır.
Burada özellikle işaret edilmesi gereken bir ayrıntı var: GitHub depoyu Apache-2.0 olarak etiketliyor, ancak gerçek lisans dosyası kamuya açık kullanım ve dağıtımlar için zorunlu bir atıf şartı ekliyor. Bu, standart Apache-2.0 değildir — proje-spesifik koşul eklenmiş Apache-2.0’dır. Bu yüzden GitHub yan etiketine değil, lisans dosyasının kendisine bakılmalıdır.
- GitHub sağlığı: 77.959 yıldız, son sürüm v0.9.2 (Temmuz 2026)
- Kaynak ihtiyacı: self-hosting rehberi konteyner için en az 4 GB kullanılabilir RAM önerir
- Belgelenmiş istikrarsızlık: v0.9.0 değişiklik günlüğü, Docker-server kimlik doğrulama varsayımlarında kırıcı değişiklikler ve taşınan modüller kaydetti — bu araç aktif şekilde değişiyor, sürüm sabitle
En uygun kullanım: yeni web verisini LLM ajanlarına veya RAG hatlarına besleyen ve tarayıcı altyapısını kendisi yönetebilen Python ekipleri.
Self-Hosted Dağıtımlar İçin En İyi Açık Kaynak AI-Native Scraper (Ama Bir Lisans Uyarısıyla): Firecrawl

Firecrawl’ın self-hosted çekirdeği, AGPL tartışmasının somutlaştığı yerdir. API-first bir crawler’dır; Markdown, HTML, ekran görüntüleri ve yapılandırılmış veri döndürür — Fetch ve Playwright üzerine kurulmuş, gerçekten güçlü bir sistemdir. Ama insanların “Firecrawl” denince aklına gelen cilalı taraflar — yönetilen anti-bot işleme, proxy rotasyonu, Fire-engine stealth katmanı — Firecrawl Cloud’a aittir, self-hosted depoya değil. Firecrawl’ın kendi self-host dokümantasyonu, Fire-engine ve gelişmiş anti-bot davranışlarının varsayılan self-hosted yığında yer almadığını açıkça söyler; ekran görüntüleri ve sayfa eylemleri için bunlar gerekir.
- Lisans: çekirdek için ağırlıklı olarak AGPL-3.0-or-later, SDK’ler için MIT
- GitHub sağlığı: 166.527 yıldız — bu kategori için gerçekten çok büyük
- Kurulum gerçeği: self-hosting; Redis, RabbitMQ, PostgreSQL ve isteğe bağlı olarak FoundationDB kurmak demektir — bu tek konteynerlik bir iş değil, çok servisli bir operasyonudur
En uygun kullanım: iç araçlar veya AGPL’nin kaynak sunma yükümlülüğünü kabul eden açık kaynak projeler. Kapalı kaynak bir ticari ürünü doğrudan self-hosted çekirdek üzerine inşa etmeden önce iki kez düşünün ve hukuki inceleme alın.
Doğal Dil ile Çıkarma İçin En İyi Açık Kaynak AI-Native Scraper: ScrapeGraphAI

ScrapeGraphAI, seçici yazmak yerine ne istediğini düz dilde anlatmana izin verir — alan eşleştirme işini LLM çağrılarının yaptığı graf tabanlı bir hattır. MIT lisanslı bu kütüphane kendi altyapını kullanır: senin LLM API anahtarın (ya da istersen token faturasından kaçınmak için yerel bir Ollama modeli), senin yapılandırılmış Playwright örneğin.
Buradaki önemli nokta şu: “açık kaynak” burada “devam eden maliyet sıfır” demek değildir. Her çıkarım, bağladığın model üzerinden token tüketir. Ayrıca prompt ile yönlendirilen çıkarımın, seçici tabanlı araçlarda olmayan belirli bir hata modu vardır: bir açık issue, sayfada veri görünür şekilde mevcut olmasına rağmen hattın tüm aşamaları başarıyla tamamlayıp boş/NA alanlar döndürdüğünü bildirir — bu tür sessiz bir hata, deterministic CSS/XPath araçlarında olmaz.
- Lisans: MIT
- GitHub sağlığı: 29.447 yıldız, son kararlı sürüm v2.1.6
En uygun kullanım: prompt esnekliğinin model maliyetine ve doğrulama yüküne değdiği, düzensiz ve tek seferlik çıkarım işleri.
Hafif, Model Gerektirmeyen Çıkarma İçin En İyi Açık Kaynak AI-Native Scraper: AutoScraper

AutoScraper, LLM’i tamamen devre dışı bırakır. Sana bir URL ve çıkarmak istediğin örnek bir değer verirsin; araç sayfanın yapısal kurallarını çıkarır ve benzer sayfalarda bunları yeniden kullanır. Model API anahtarı yok, token faturası yok — iç tarafta sadece requests ve BeautifulSoup var.
Forumlarda bu araç için atılan “terk edilmiş” etiketine dikkat et. Bu doğru değil: 2025 ortasında gerçek commit’ler var ve deponun son push’u Temmuz 2026. Ancak kullanıcıların gerçekten pip install ile kuracağı paket hâlâ 2022’den kalma v1.1.14 sürümü. “Paketlenmiş sürümlerde yavaş ilerleme” doğru tanımdır; “ölü proje” değil.
- Lisans: MIT
- GitHub sağlığı: 7.844 yıldız
- Sert sınır: yerel JS render yok —
requests.get()çağırır ve gelen HTML’i ayrıştırır, hepsi bu
En uygun kullanım: yapısı sabit statik sayfalarda küçük, tekrarlayan çıkarım işleri; site yeniden tasarlanırsa ara sıra yeniden eğitim yapmaya razı olduğun durumlar.
Büyük Ölçekli Python Projeleri İçin En İyi Açık Kaynak Crawl Framework’ü: Scrapy

Scrapy, üretim kalitesinde bir Python crawl framework’üdür — motor, zamanlayıcı, indirici, item pipeline’ları, hepsi mevcut. Beautiful Soup bir neşter ise Scrapy tüm ameliyathanedir: asenkron ağ iletişimi, alan bazlı eşzamanlılık kontrolleri, AutoThrottle ve doğrudan CSV, JSON, JSON Lines, XML ya da bulut depolamaya yazan dışa aktarıcılar.
Daha önce işaret ettiğim nüans burada bir kez daha önemli, çünkü Scrapy hakkındaki en büyük kafa karışıklığı kaynağı bu: Scrapy’nin yerel JavaScript render desteği yoktur. Scrapy’nin kendi dokümanları, önce alttaki veri isteğini bulup onu taklit etmeyi önerir — çünkü bu genellikle tam bir tarayıcı render’ından daha hızlı ve daha eksiksizdir — ve yalnızca gerçekten başka çare yoksa scrapy-playwright kullanımını tavsiye eder.
- Lisans: BSD-3-Clause
- GitHub sağlığı: 63.830 yıldız, 304 açık issue, son bir yılda 9 kararlı sürüm (en yenisi: 2.17.0)
- Hız sınırı açığı: açık bir iyileştirme isteği, AutoThrottle’ın 429 HTTP yanıtlarına değil gecikmeye göre ayar yaptığını belirtiyor — yanıt farkındalıklı geri çekilme stratejisini senin eklemen gerekir
En uygun kullanım: yapılandırılmış pipeline’ların ve dışa aktarma esnekliğinin JS render’dan daha önemli olduğu büyük ölçekli statik site crawl’ları.
Node.js Üretim Yapıları İçin En İyi Açık Kaynak Crawl Framework’ü: Crawlee

Apify ekibinden Crawlee, Scrapy’ye en yakın Node/TypeScript karşılığıdır — fark şu ki JavaScript render sonradan eklenmez; ortak bir kuyruk, depolama ve proxy-rotasyon katmanı altında yer alan Playwright ve Puppeteer destekli crawler sınıfları sayesinde en baştan itibaren yerleşiktir.
- Lisans: Apache-2.0
- GitHub sağlığı: 25.364 yıldız, son bir yılda 8 kararlı sürüm (en yenisi: 3.18.1)
- Akıllı ayrıntı:
AutoscaledPool, gerçek zamanlı CPU, bellek ve event-loop yüküne göre eşzamanlılığı dinamik olarak ayarlar — ayrıca dokümanlar minimum eşzamanlılığı fazla yükseltmenin tüm crawl’ı çökertip çalıştırmayı bozabileceğini açıkça söyler
En uygun kullanım: Scrapy benzeri parçaları kendi başına birleştirmek istemeyen, üretime hazır kuyruk yönetimi ve JS render arayan Node.js/TypeScript ekipleri.
Kurumsal Java İndeksleme İçin En İyi Açık Kaynak Crawl Framework’ü: Apache Nutch

Apache Nutch, bu listedeki istisnadır — büyük ölçekli web indeksleme için tasarlanmış bir Java crawler’ıdır ve genellikle Solr, Elasticsearch veya OpenSearch’e veri besler. Bir rakip sitenin ürün fiyatlarını çekmek için ilk başvuracağın araç değildir; kurumsal arama ekiplerinin bir arama indeksinin altındaki crawl katmanını inşa ederken kullandığı araçtır.
- Lisans: Apache-2.0
- GitHub sağlığı: yalnızca 3.276 yıldız, ama en son Ağustos 2026’da push edilmiş — düşük yıldız sayısı ihmal değil, uzmanlaşmış niş alanın sonucu
- JS işleme: ayrı
protocol-seleniumeklentisi gerekir; bir JIRA kaydı bu eklenti yolunda HTTPS proxy hatasını belgeler
En uygun kullanım: Java/Hadoop altyapısı zaten çalışan ve ad hoc veri çekmekten ziyade kurumsal ölçekli web indeksleme ihtiyacı olan ekipler.
En İyi Açık Kaynak No-Code Tarayıcı Eklentisi: Web Scraper

Web Scraper, tıkla-çalıştır seçeneğidir — Chrome DevTools içinde yaşayan bir sitemap ve selector tree oluşturucusudur. Sayfalar arasında gezinir, butonlara tıklar, sonsuz kaydırmalı sayfaları dolaşır ve hiçbir kod satırı yazmadan yerel olarak CSV/XLSX dışa aktarır.
Burada open-core ayrımı, listedeki neredeyse her yerden daha önemlidir. Yerel çıkarım gerçekten ücretsizdir. Ancak planlı otomasyon, bulut çalıştırma, API erişimi ve proxy yönetimi Web Scraper Cloud arkasındadır; bu da ayrı ve ücretli bir üründür. Ve daha önce belirttiğim gibi, kamuya açık LGPL-3.0 kaynak deposuna 2017’den beri kod commit edilmemiştir — bu yüzden “açık kaynak” ifadesini, yerel eklentinin tarihsel kökeni olarak düşün; bugünkü Chrome Web Store yapısının ne olduğuna dair garanti olarak değil.
En uygun kullanım: kod yazmak istemeyen, ölçek ihtiyacı olmayan ve ara sıra yerel çıkarım yapan bireyler ya da küçük ekipler.
Statik Parser’lar mı, Headless Tarayıcılar mı: JS Yoğun Siteler İçin Doğru Aracı Seçmek

Bu konuyu sağlam bir veriye dayandıralım: Web sitelerinin yüzde 98,9’u JavaScript kullanıyor ve bunu istemci tarafı dili olarak kullanıyor. Ama bu sayı sürekli “sitelerin yüzde 98,9’u scraping için headless tarayıcı ister” diye yanlış aktarılıyor — ki söylenen şey bu değil. Ölçülen şey JavaScript’in varlığı; hedef verinin ilk HTML’de mi olduğu, yoksa sadece script çalıştırıldıktan sonra mı göründüğü değil.
Asıl karar noktası tam da budur. 12 aracı iki dürüst gruba ayır:
Statik parser’lar — BeautifulSoup, AutoScraper — hızlıdır, ucuzdur ve istemci tarafında render edilen hiçbir şeyi göremez. İstediğin veri ilk HTML cevabında ya da doğrudan çağırabildiğin bir JSON endpoint’inde duruyorsa, hız ve sadelikte her zaman bunlar kazanır.
Headless tarayıcı framework’leri — Playwright, Puppeteer, Selenium, Crawlee’nin tarayıcı crawler’ları — JavaScript’i gerçekten çalıştırır; yani gerçek işlem gücü tüketir. HTTP Archive’ın 2024 verileri, ortalama sayfanın mobilde 558 KB JavaScript yükü ve 22 ayrı JS isteği taşıdığını söylüyor — headless tarayıcının her sayfa yüklemesinde işlemesi gereken yük budur; buna karşılık statik parser yalnızca ham HTML’i alır.
Ve Scrapy tek başına yeniden hatırlatmaya değer garip orta noktada durur: O ne biri ne de diğeridir. Bu, yerleşik render desteği olmayan tam bir crawl framework’üdür; JS gerekiyorsa scrapy-playwright eklemen gerekir.
“Ücretsiz”in Gizli Maliyeti: Proxy’ler, İşlem Gücü ve Bakım Saatleri

Sıfır dolarlık lisans ücreti, toplam maliyetin sadece bir girdisidir; tüm denklem değildir. Gerçek maliyet modelini birkaç somut başlığa ayırırım:
İşlem gücü. Headless tarayıcıları büyük ölçekte çalıştırmak, yalnızca sunucu zamanı değil tarayıcı-saniyesi için ödeme yapmak demektir. AWS Fargate, Linux/x86 için kabaca vCPU-saniye başına $0.000011244 ve GB-saniye başına $0.000001235 ücret alır — çalıştırdığın eşzamanlı Playwright örnekleriyle çarpınca, çoğu kişinin beklediğinden hızlı büyür.
Proxy’ler. Bright Data’nın yayımladığı fiyatlarda residential proxy’ler yaklaşık $5/GB’den, datacenter proxy’ler ise $0.9/IP’den başlıyordu — ve bu fiyatlandırma modellerinde “bandwidth” yalnızca indirdiğin veri değil, istek ve yanıt payload’larının ikisini de kapsar. Ekipleri en çok şaşırtan kalem budur: rate limit ve bloklardan kaçınmak ücretsiz değildir; altyapı bütçende tekrar eden bir satırdır.
Bakım. Bu listedeki her statik parser ve yapısal kural aracı, site yeniden tasarlandığında seçicilerinin bozulmasına açıktır. AutoScraper’ın kendi README örneğinde bile hedef site değişince fiyat güncellemesi gerekmişti. Bu, $0 lisans etiketinin asla söylemediği “gizli işlem gücü/proxy maliyeti” kategorisidir — hedef sitenin geliştirici ekibinden biri yeniden tasarım yayınladığında kırılan çıkarımı düzeltmek için harcanan mühendislik saati.
Bu duvara sürekli toslayan ekipler için — selector kırılmaları, proxy hesap yönetimi, hiç bitmeyen DevOps yükü — self-hosted açık kaynak yığını, mühendis-saatlerini topladığında otomatik olarak daha ucuz seçenek değildir. Thunderbit’in Chrome eklentisi, teknik olmayan kullanıcılar için farklı bir yaklaşım sunar: yetkili bir sayfayı aç, One Click Extract’e tıkla, araç sayfayı analiz edip neyi çekmesi gerektiğini kendi belirlesin — selector yok, düzen değişince bakım betiği yok. Scrapy’nin yerine crawl-framework ölçeğinde geçmez; ama kırılgan bir AutoScraper kural setini elle taşıyan bir iş kullanıcısı için makul bir sonraki adımdır.
Karar Çerçevesi: Aracı Ekibinin Kısıtlarına Göre Eşleştirmek
Karşılaştırmaların çoğu “X kullanım senaryosu için en iyisi” noktasında biter. Bu tek değişkendir. Pratikte ekipler aynı anda en az dört şeyi dengeler: JS render ihtiyacı × ekip dili × gerekli çıktı formatı × lisans kısıtı.
| Ekip durumu | En uygun araç(lar) | Neden |
|---|---|---|
| Python, statik HTML, hızlı betik | BeautifulSoup, AutoScraper | JS gerekmez, MIT lisansı, minimal kurulum |
| Python, büyük ölçekli yapılandırılmış crawl | Scrapy | BSD-3-Clause, yerleşik pipeline’lar, JS gerçekten gerekiyorsa yalnızca scrapy-playwright ile |
| Node/TypeScript, JS’li üretim crawl | Crawlee | Apache-2.0, yerel tarayıcı desteği kuyruk sistemine gömülü |
| Çok dilli, geniş tarayıcı matrisi | Selenium | Apache-2.0, en geniş dil/tarayıcı kapsaması |
| Modern SPA otomasyonu, çapraz tarayıcı | Playwright | Apache-2.0, yerel render, yerleşik otomatik bekleme |
| Chrome odaklı otomasyon, ekran görüntüsü/PDF | Puppeteer | Apache-2.0, derin CDP entegrasyonu |
| LLM/RAG Markdown hattı | Crawl4AI | Apache-2.0 + atıf maddesi; ek koşul için hukuk ekibinin yaklaşımını kontrol edin |
| Prompt tabanlı, düzensiz çıkarım | ScrapeGraphAI | MIT, ama LLM token maliyetini bütçeye ekleyin |
| API’ye uygun, self-hosted crawler, AGPL ile uyumlu ekip | Firecrawl | AGPL-3.0-or-later; kapalı kaynak SaaS üzerine koymadan önce hukuk onayı alın |
| Kurumsal Java/Hadoop indeksleme | Apache Nutch | Apache-2.0, arama altyapısı için özel olarak tasarlanmış |
| No-code, ara sıra kullanım, teknik olmayan kullanıcı | Web Scraper eklentisi | Yerelde ücretsiz; tam şeffaflık varsaymadan önce open-core ayrımını anlayın |
12 Açık Kaynak Web Scraper Aracını Yan Yana Karşılaştırın
| Araç | Dil | Lisans | Ticari Kullanım Güvenli mi? | JS Render | Öğrenme Eğrisi | En İyi Kullanım |
|---|---|---|---|---|---|---|
| BeautifulSoup | Python | MIT | ✅ Evet | Yok (eşleştirme gerekir) | Düşük | Statik HTML ayrıştırma |
| Selenium | Çok dilli | Apache-2.0 | ✅ Evet | Yerel | Orta | Çoklu tarayıcı/dil testten scraping’e |
| Playwright | JS/TS/Python/Java/.NET | Apache-2.0 | ✅ Evet | Yerel | Orta | Modern JS yoğun siteler |
| Puppeteer | Node.js/TS | Apache-2.0 | ✅ Evet | Yerel | Orta | Chrome odaklı otomasyon |
| Crawl4AI | Python | Apache-2.0 + atıf maddesi | ⚠️ Maddeyi inceleyin | Yerel (Playwright üzerinden) | Orta | LLM/RAG Markdown hatları |
| Firecrawl (self-hosted) | TypeScript | AGPL-3.0-or-later (çekirdek) | ⚠️ Koşullu | Yerel (Playwright üzerinden) | Yüksek (çok servisli) | Self-hosted AI crawling, AGPL uyumlu ekipler |
| ScrapeGraphAI | Python | MIT | ✅ Evet | Yerel (Playwright üzerinden) | Orta | Doğal dil ile çıkarım |
| AutoScraper | Python | MIT | ✅ Evet | Yok | Düşük | Hafif, tekrarlı statik işler |
| Scrapy | Python | BSD-3-Clause | ✅ Evet | Eşleştirme gerekir | Yüksek | Büyük ölçekli statik site crawl’ları |
| Crawlee | Node.js/TS | Apache-2.0 | ✅ Evet | Yerel | Orta | Node.js üretim crawler’ları |
| Apache Nutch | Java | Apache-2.0 | ✅ Evet | Eklenti gerekir | Yüksek | Kurumsal arama indeksleme |
| Web Scraper (eklenti) | N/A (no-code) | Open-core | ⚠️ Pakete göre değişir | Yerel (canlı tarayıcı) | Düşük | Teknik olmayan, ara sıra kullanım |
Sonuç: Hangi Açık Kaynak Web Scraper’ı Kullanmalısınız?
Burada tek bir “en iyi” araç yok — doğru cevap lisans kısıtlarına, ekip diline ve hedef verinin statik HTML’de mi yoksa bir JavaScript duvarının arkasında mı olduğuna bağlı. Büyük ölçekli Python statik crawl’larında Scrapy öne çıkar. JS render vazgeçilmezse Playwright veya Crawlee kazanır. Bir LLM hattını besliyorsan Crawl4AI uygundur; ama lisans dosyasında hızlıca okunması gereken ek bir atıf maddesi olduğunu unutma. Firecrawl’ın self-hosted çekirdeği güçlüdür, fakat hukuk ekibinin içinde olması gereken bir AGPL konusuyla gelir, göz ardı edilmemelidir.
Eğer selector bakımı ve proxy yönetimi scraping’in kendisinden daha fazla mühendislik saati yiyorsa, bu genellikle self-hosted OSS yığınına bir katman daha eklemek yerine Thunderbit gibi no-code bir alternatife bakma zamanının geldiğinin işaretidir.
Açık Kaynak Web Scraper Araçları Hakkında SSS
İş amaçlı veri toplamak için açık kaynak web scraper araçlarını kullanmak yasal mı?
Genel olarak, herkese açık verileri scrape etmek; giriş duvarı veya ödeme duvarı arkasındaki verileri scrape etmeye kıyasla daha düşük risk taşır, ancak bu her durumda otomatik olarak yasal olduğu anlamına gelmez. Hedef sitenin kullanım şartlarını ve robots.txt dosyasını mutlaka kontrol et — ancak robots.txt bir izin mekanizması değil, bir talep protokolüdür; yani ona uymak iyi pratiktir ama tek başına yasal izin sağlamaz. GDPR gibi veri gizliliği yasaları da veriler kamuya açık görünse bile geçerlidir. Bu bir hukuki tavsiye değildir — düşük hacimli, gündelik kullanımın ötesindeki her şey için hukuk danışmanına başvur.
“Açık kaynak” bir aracın ticari kullanım için ücretsiz olduğu anlamına mı gelir?
Evet, Açık Kaynak Tanımı lisansların ticari kullanıma karşı ayrım yapmasını yasakladığı anlamında evet. Ancak “ticari olarak kullanılabilir” olmak ile “yükümlülüksüz” olmak aynı şey değildir — AGPL-3.0 (Firecrawl’ın self-hosted çekirdeğinde kullanılan lisans) ticari kullanıma izin verir, ama ağ üzerinden sunulan değiştirilmiş sürümler için ilgili kaynak kodu sunma yükümlülüğü getirir. MIT, BSD ve Apache-2.0 böyle bir zorunluluk taşımaz.
Açık kaynak bir scraper ile no-code scraping aracı arasındaki fark nedir?
Scrapy, Playwright veya BeautifulSoup gibi açık kaynak scraper’lar senden kod yazmanı, altyapıyı yönetmeni ve kendi crawl mantığını, proxy’lerini ve dışa aktarma süreçlerini kurmanı bekler. Web Scraper Chrome eklentisi veya Thunderbit’in tarayıcı eklentisi gibi no-code araçlar ise alan tespiti ve çıkarımı görsel bir arayüz veya AI destekli sayfa analiziyle yapar; esneklikten biraz feragat eder ama kurulum bariyerini ciddi biçimde düşürür.
Teknik olmayan kullanıcılar için en iyi açık kaynak web scraper hangisi?
Bu listedeki araçların neredeyse tamamı — Scrapy, Playwright, Puppeteer, Crawlee ve diğerleri — kod yazabildiğini varsayar. Teknik olmayan kullanıcılar için Web Scraper Chrome eklentisi tıkla-çalıştır kurulum sunar; ancak planlama ve bulut özellikleri ücretli plandadır. Selector’a dokunmadan otomatik alan tespiti istiyorsan, Thunderbit’in tarayıcı eklentisi daha pratik bir başlangıç noktasıdır.
Scrapy neden JavaScript’i render etmek için ayrı bir eklentiye ihtiyaç duyar?
Scrapy, HTTP-first bir framework olarak tasarlanmıştır — istek gönderir ve gelen HTML’i, istemci tarafı script’leri çalıştırmadan ayrıştırır. Bu mimari onu statik site crawl’ları için hızlı ve hafif yapar; fakat JavaScript ile oluşturulan içerik, Scrapy’nin aldığı yanıtta hiç yer almaz. scrapy-playwright, render kaçınılmaz olduğunda belirli istekleri gerçek bir Playwright tarayıcı örneği üzerinden yönlendirerek bu boşluğu kapatır.
Daha Fazlasını Öğrenin
- 2026’nın En İyi 15 Web Scraping GitHub Projesi ve En İyi No-Code Alternatif
- Crawl4AI Gerçek Bir Tarayıcıyla Markdown Üretiyor — Hayır, Seçicilerini Sizin Yerine Düzeltmez
- Playwright ve Puppeteer’ı Aynı Scraping Testlerinden Geçirdim
- Otomatik Çözümler İçin En İyi 10 No-Code Web Scraper
- Web Scraping Yasadışı mı? Hukuki Sonuçları Anlamak


