Web, her geçen yıl daha da karmaşık bir hâl alıyor ve “bu veriye ihtiyacım var” ile “bunu nasıl çekeceğimi biliyorum” arasındaki mesafe kolay kolay kapanmıyor. Yeni başlayan biri için ilk soru çoğu zaman oldukça net oluyor: Bir web sitesinden ürün fiyatlarını çekmek için gerçekten Python öğrenmem gerekiyor mu?
Neyse ki cevap hayır. Ama asıl zorlayan soru — hangi aracı kullanmalıyım? — işleri karıştıran kısım oluyor. Kodsuz masaüstü uygulamaları, tarayıcı eklentileri, Python framework’leri, Go kütüphaneleri, SEO spider’ları, yönetilen API’ler ve açık kaynak projeler arasında sınırlar iyice bulanıklaşıyor. 2026’da öne çıkan on seçenek; yeni başlayanların gerçekten önem verdiği alanlarda öne çıkıyor: ne kadar kod gerektiği, kullanışlı veriye ne kadar hızlı ulaşabildiğiniz, aracın JavaScript yoğun siteleri destekleyip desteklemediği, ücretsiz planda neler sunduğu ve hangi kullanım senaryosuna gerçekten uyduğu. İster hiç kod yazmamış olun ister ilk tarayıcı framework’ünü arayan bir junior geliştirici olun, burada size uygun bir başlangıç noktası var.
Başlangıç Seviyesi İçin En İyi Web Tarayıcılarını Nasıl Seçtik?
“Yeni başlayan” demek “teknik olmayan” demek değildir. Bu, daha önce bir web tarama iş akışı kurmamış herkes demektir — buna temel Python ya da JavaScript bilen ama hiç URL kuyruğu yönetmemiş veya robots.txt dosyasıyla uğraşmamış kişiler de dahildir.
Her aracı, forumlarda yeni başlayanların gerçekten sorduğu sorularla birebir örtüşen altı ölçüte göre değerlendirdik:
- Gerekli Kodlama Seviyesi — Yok, temel Python/JS ya da orta seviye+
- Kurulum Zorluğu — Kurulumdan ilk kullanılabilir veriye kadar geçen süre
- JavaScript Oluşturma Desteği — SPA’ları ve içeriği dinamik yüklenen sayfaları yönetebiliyor mu?
- Ücretsiz Plan Cömertliği — Hiç ödeme yapmadan önce neler sunuyor?
- Çıktı Formatları — CSV, JSON, Excel, Google Sheets vb.
- En Uygun Kullanım Senaryosu — Bir yeni başlayan için bu aracın parladığı spesifik durum
Liste üç beceri seviyesini kapsıyor: kodsuz (sıfır programlama), orta seviye (temel Python veya JavaScript) ve ileri başlangıç (Go veya daha derin framework bilgisi). Her aracın nerede güçlü, nerede zayıf olduğunu dürüstçe anlatmaya çalıştım — çünkü beceri seviyenize uymayan bir tarayıcı seçmek, bir öğleden sonrayı boşa harcamanın en hızlı yollarından biri.
İlk Web Tarayıcınızı Seçin: Hızlı Karar Akışı

On araçlık incelemelere geçmeden önce üç soruyu yanıtlayın. Kesişim sizi size uyan bir veya iki araca yönlendirecek.
Soru 1: Kodlama konfor seviyeniz nedir?
- Yok → 2a sorusuna geçin
- Temel Python → 2b sorusuna geçin
- JavaScript/TypeScript → 2c sorusuna geçin
- Go → Colly
Soru 2a (Kodsuz): Ana hedefiniz nedir?
- Genel veri çekme (ürün bilgisi, lead listeleri, araştırma) → Thunderbit veya Octoparse
- Karmaşık çok adımlı akışlar (giriş, açılır menüler, sonsuz kaydırma) → ParseHub veya Octoparse
- SEO denetimi → Screaming Frog
Soru 2b (Python): Ana hedefiniz nedir?
- AI/LLM hattı (RAG, chatbot eğitimi) → Crawl4AI veya Firecrawl
- Çoğunlukla statik sitelerin büyük ölçekli yapılandırılmış taranması → Scrapy
- JS yoğun sitelerde tarayıcı otomasyonu → Playwright (ama kendi tarama mantığınızı kurmayı planlayın)
Soru 2c (JavaScript/TypeScript): Ana hedefiniz nedir?
- Anti-blocking özellikli modern SPA taraması → Crawlee
- Karmaşık tarayıcı etkileşimi (giriş, tıklamalar, ekran görüntüleri) → Playwright
- AI tüketimi için temiz Markdown → Firecrawl (API/SDK üzerinden)
Bütçe filtresi: Eğer yazılım için 0 dolar bütçeniz varsa ve kendi altyapınızı barındırabiliyorsanız, buradaki açık kaynak araçların (Scrapy, Crawlee, Crawl4AI, Playwright ve Colly) satıcı kaynaklı sayfa kotası yoktur; ancak işlem gücü, bant genişliği, depolama, bakım ve hedef site kısıtları yine de geçerlidir. Kendi barındırmanızı yapamıyorsanız, Octoparse, ParseHub, Thunderbit, Firecrawl ve Screaming Frog farklı limitlerle ücretsiz bir yol sunar.
Bu akış şeması bile size saatlerce sekme değiştirmekten kurtarabilir. Kaydedin.
Başlangıç İçin En İyi Web Tarayıcılarına Genel Bakış
İşte tam karşılaştırma tablosu. “Gerekli Kodlama” size hangi dile ihtiyacınız olduğunu (varsa) söyler. “JS Rendering” aracın JavaScript ile yüklenen sayfaları işleyip işleyemediğini gösterir. “Free Tier” ise 0 dolarda neler aldığınızı özetler. Detaylı incelemeler aşağıda geliyor.
| Araç | Beceri Seviyesi | Gerekli Kodlama | JS Rendering | Ücretsiz Plan | En Uygun Olduğu Alan |
|---|---|---|---|---|---|
| Octoparse | Başlangıç | Yok | ✅ Dahili | Ücretsiz plan: 10 görev, sadece yerel kullanım, dışa aktarma başına 10K satır | Yapılandırılmış sitelerde tıkla-çalıştır scraping |
| ParseHub | Başlangıç | Yok | ✅ Dahili | 5 genel proje, koşum başına 200 sayfa, 14 gün saklama | Kodsuz karmaşık çok sayfalı akışlar |
| Thunderbit | Başlangıç | Yok | ✅ Tarayıcı üzerinden | Ücretsiz katman (mevcut limitleri doğrulayın) | İçinde bulunduğunuz sayfadan AI destekli veri çekme |
| Crawl4AI | Orta seviye | Python | ✅ Chromium | Açık kaynak (self-hosted) | RAG hatları için LLM’ye hazır tarama |
| Firecrawl | Orta seviye | API/SDK | ✅ Yönetilen | Ayda 1.000 kredi (cloud) | AI tüketimi için temiz Markdown çıktısı |
| Scrapy | Orta seviye | Python | ⚠️ Eklenti gerekir | Açık kaynak (BSD) | Büyük ölçekli, özelleştirilebilir HTTP tarama projeleri |
| Crawlee | Orta seviye | JS/TS veya Python | ✅ Playwright üzerinden | Açık kaynak (Apache) | Anti-blocking özellikli modern JS taraması |
| Playwright | Orta seviye | Python/JS/Java/.NET | ✅ Yerel | Açık kaynak (Apache) | Tarayıcı otomasyonu + JS yoğun site etkileşimi |
| Screaming Frog | Başlangıç | Yok | ✅ (yalnızca ücretli) | 500 URL/tarama (ömür boyu ücretsiz) | SEO denetimi ve teknik site analizi |
| Colly | İleri başlangıç | Go | ⚠️ Yerleşik yok | Açık kaynak (Apache) | Hızlı, hafif, eşzamanlı HTTP tarama |
Şimdi ayrıntılı incelemelere geçelim.
1. Octoparse

Octoparse, isteğe bağlı ücretli bulut çalıştırma sunan kodsuz bir masaüstü görev oluşturucudur. Bir URL yapıştırırsınız, Auto-detect tekrar eden veri alanlarını ve gezinme kalıplarını belirler, önizlemeyi kontrol edersiniz ve ardından görevi yerel olarak çalıştırırsınız. Görsel iş akışı düzenleyicisi döngüleri, dalları, sayfalama, sonsuz kaydırma, AJAX, formlar ve açılır menüleri destekler — ancak dinamik akışlar bazen manuel zamanlama ayarı gerektirebilir.
Temel özellikler:
- Veri alanlarını ve sayfa gezinmesini otomatik algılama
- Dahili tarayıcı ile yerleşik JavaScript rendering
- Sık kullanılan siteler için yüzlerce hazır şablon
- Özel döngüler, dallar ve seçici kontrollerle düzenlenebilir iş akışları
- Excel, CSV, HTML, JSON, XML, Google Sheets ve veritabanlarına dışa aktarma (plana bağlı)
Fiyatlandırma: Sınırlı ücretsiz katman yerel çalıştırmaları destekler. Bulut çalıştırma, zamanlama, IP rotasyonu ve API erişimi ücretli plan gerektirir. Plan limitleri değişebildiği için karar vermeden önce güncel fiyatlandırmayı kontrol edin.
Kimler için en uygun: Kod yazmadan e-ticaret, dizinler veya ilan sitelerinden düzenli ve yapılandırılmış veri çekmek isteyen yeni başlayanlar. Tarayıcı eklentisi rahatlığına veya LLM’ye hazır çıktı formatlarına ihtiyacınız varsa daha az idealdir.
2. ParseHub

ParseHub, Windows, macOS ve Linux (AppImage üzerinden) için indirilebilir bir görsel çıkarıcıdır. Komut ağacı arayüzü; seçimleri, tıklamaları, form girişlerini, kaydırmaları ve sayfa şablonlarını modellemeye yarar. AJAX/JavaScript, açılır menüler, sekmeler, açılır pencereler, sayfalama, giriş formları ve sonsuz kaydırma desteği sunar.
Temel özellikler:
- Çok adımlı çıkarım akışları için görsel komut ağacı
- AJAX, JavaScript, açılır menüler, sekmeler ve sonsuz kaydırmayı işler
- Çok platformlu masaüstü uygulaması (Windows, macOS, Linux)
- Programatik veri erişimi için API
- CSV ve JSON dışa aktarma
Fiyatlandırma: Ücretsiz ve ücretli katmanlar mevcuttur. Ücretlendirilebilir bir “sayfa”, bir URL ya da tıklama veya kaydırmayla tetiklenen dinamik içerik yüklemesi olabilir; bu nedenle sayfa limiti her zaman aynı sayıda URL anlamına gelmez. Plan seçmeden önce güncel proje, çalıştırma ve saklama limitlerini doğrulayın.
Gizlilik uyarısı: Bir üçüncü taraf tarayıcıya üretim ortamı kimlik bilgilerini girmeden önce, aracın giriş bilgilerini ve proje verilerini nasıl sakladığını inceleyin. Değerlendirme için kısıtlı bir test hesabı kullanın.
Kimler için en uygun: Kod yazmadan dinamik ve çok adımlı web sitelerini (karmaşık gezinme, açılır menüler veya kaydırma tabanlı yükleme içeren siteler) kazımak isteyen yeni başlayanlar.
ParseHub vs. Octoparse: Temel Farklar
İkisi de JavaScript destekleyen kodsuz masaüstü araçlarıdır. ParseHub’ın komut ağacı modeli, çok adımlı akışlarda daha net kontrol sağlar — bu karmaşık gezinmeler için faydalıdır ama basit görevler için başlangıç eşiği biraz daha yüksektir. Octoparse’un Auto-detect özelliği, basit yapılandırılmış sitelerde daha hızlıdır ve ücretsiz planda daha cömert dışa aktarma sınırları sunar. Hedef siteniz çoğunlukla tablo ve listelerden oluşuyorsa Octoparse ile başlayın. Bir dizi tıklama, form doldurma ve koşullu gezinme modellemeniz gerekiyorsa ParseHub’ın yaklaşımı daha anlaşılır olabilir.
3. Thunderbit

Thunderbit, hâlihazırda görüntülediğiniz sayfadan veri çıkarmak isteyen teknik olmayan iş kullanıcıları için tasarlanmış, Chrome ve Edge’de çalışan ajan temelli bir web scraping tarayıcı eklentisidir. (Tam açıklama: Thunderbit’te çalışıyorum; bu yüzden güçlü yönleri kadar sınırlamalarını da açıkça aktaracağım.)
Temel özellikler:
- Tek Tıkla Çıkarma, sayfa içeriğine göre sütunları otomatik algılar
- Çıkarma sırasında sınıflandırma, çeviri, biçimlendirme ve normalizasyon için alan bazında AI istemleri
- Excel/CSV, Google Sheets, Airtable ve Notion’a dışa aktarma
- Tarayıcı Modu, kullanıcının oturumunu kullanarak JavaScript ile yüklenen içeriği uyumlu sayfalarda işler
- Tarayıcı eklentisi dışında yazılım kurulumu gerekmez
Fiyatlandırma: Ücretsiz katman şu anda ayda 6 sayfa ve sayfa başına en fazla 30 kredi içerir. Starter ($15/ay veya yıllık faturalamada $9/ay), sayfalama, alt sayfa tarama, toplu tarama, zenginleştirme, hazır scraper’lar ve zamanlamalar ekler. Güncel fiyatlandırmayı buradan kontrol edin.
Bilinmesi gereken sınırlamalar: Thunderbit domain keşfi yapan tam kapsamlı bir spider değil, daha çok sayfa/şema odaklı bir araçtır. Sayfalama ve alt sayfa tarama, Free yerine Starter özelliğidir. AI’nın önerdiği alanlar, tarama çalıştırmadan önce mutlaka gözden geçirilmelidir — öneriler iyidir ama hatasız değildir.
Kimler için en uygun: Tarayıcılarında açık olan sayfadan yapılandırılmış veri çekmek isteyen satış, operasyon ve araştırma ekipleri; ayrıca manuel alan yapılandırmasını atlamak için AI yardımına ihtiyaç duyanlar. Uyumlu bir sayfadan tablo, liste veya kayıt kümesi çekip doğrudan bir elektronik tabloya aktarmanın hızlı yolunu arıyorsanız, bildiğim en hızlı seçenek bu.
AI destekli çıkarımın pratikte nasıl çalıştığı hakkında daha fazla bilgi için AI web scraping rehberimize bakın.
Kodu Atlayın, Tek Tıkla Başlayın Thunderbit'in ajan temelli web scraper'ı herhangi bir sayfayı okur ve alanları kendi seçer; kod gerekmez — yeni başlayanlar için iyi bir ilk tarayıcıdır. Get Started Free
4. Crawl4AI

Crawl4AI, LLM iş akışları için temiz çıktı üretmeye odaklanmış, açık kaynak ve tarayıcı öncelikli bir Python tarayıcısıdır. Ham ve temiz HTML, birden fazla Markdown varyantı, yapılandırılmış çıkarılmış içerik, bağlantılar, medya, tablolar, ekran görüntüleri, PDF’ler ve MHTML üretir.
Temel özellikler:
- İçeride Chromium/Playwright kullanan AsyncWebCrawler
- RAG hatları ve ajan iş akışları için optimize edilmiş çoklu çıktı formatları
- Kapsamı, tutarlılığı ve doyma seviyesini değerlendirerek ilgili bağlantılara öncelik veren ve yeterli bilgi toplandığında duran uyarlanabilir tarama
- Yerel sağlayıcılar (Ollama) veya bulut API’leri ile isteğe bağlı LLM çıkarımı
- Ek bir atıf gerekliliği olan Apache-2.0 lisansı
Fiyatlandırma: Tamamen açık kaynak — sayfa başı ücret yoktur. Altyapıyı siz barındırırsınız ve varsa LLM çalıştırma maliyetini (yerel veya bulut) siz ödersiniz.
Sınırlamalar: Python async bilgisi ve tarayıcı bağımlılıkları gerekir. Çıkarma kalitesi, kullanılan LLM’ye bağlıdır (kullanılıyorsa). Uyarlanabilir tarayıcı, bilgi yeterliliği sinyallerini kullanarak ilgili bağlantılara öncelik verir; kalıcı olarak öğrenmez veya CSS seçicileri kendi kendine onarmaz.
Kimler için en uygun: Sıfır istek başı satıcı maliyeti ve tam kontrol isteyen, AI veri hatları kuran orta seviye Python kullanıcıları.
5. Firecrawl

Firecrawl, Python ve Node.js için SDK’ları olan yönetilen bir web veri API’sidir; ayrıca AGPL lisanslı, self-host edilebilir bir kod tabanına sahiptir. Bulut hizmeti JavaScript rendering’i yönetir ve Markdown, özetler, HTML, bağlantılar, görseller, ekran görüntüleri, JSON ve değişiklik takibi döndürür.
Temel özellikler:
- Yol filtreleri, keşif derinliği, site haritaları, limitler, gecikmeler ve eşzamanlılık kontrolleri içeren
/crawluç noktası - Yönetilen bulutta otomatik JavaScript rendering
- Temiz Markdown dahil çoklu çıktı formatı
- Hızlı site yapısı keşfi için
/mapuç noktası - Çok adımlı etkileşim için Browser/Interact ve beta ajan yolları (temel taramadan ayrı)
Fiyatlandırma: Cloud Free, ayda 1.000 kredi, iki eşzamanlı istek ve düşük hız limitleri sunar. Ücretli planlar kredi/eşzamanlılık bazlıdır — güncel rakamlar için fiyatlandırma sayfasını kontrol edin. Self-hosting, altyapı ve bakımı size taşır ve tüm yönetilen bulut özelliklerini içermez.
Sınırlamalar: Temel /crawl, bağlantılar ve site haritaları üzerinden URL’leri özyinelemeli keşfeder; ancak rastgele tıklama tabanlı sayfalama işlemlerini garanti etmez. Kredi maliyeti işlem türüne göre değişir. Self-hosted ve cloud özellik setleri farklıdır.
Kimler için en uygun: Web sitesi içeriğini LLM’lere, chatbot’lara veya bilgi tabanlarına beslemek isteyen ve kendi tarayıcı yığınını barındırmak yerine yönetilen bir hizmet arayan orta seviye kullanıcılar.
Firecrawl vs. Crawl4AI: AI Hatları İçin Hangisi?
Firecrawl, temiz bir API ile yönetilen Markdown dönüşümünde öne çıkar — siz bir URL gönderirsiniz, yapılandırılmış çıktı alırsınız. Crawl4AI ise tarayıcıyı ve isteğe bağlı LLM’yi kontrol ettiğiniz yerel öncelikli kullanımda güçlüdür. Minimum altyapı yönetimi istiyorsanız Firecrawl’ın bulutu daha kolay yoldur. Satıcı sayfa ücreti olmadan tam self-hosting istiyorsanız ve Python async konusunda rahatsanız, Crawl4AI daha fazla kontrol sunar.
6. Scrapy

Scrapy, Twisted async motoru üzerine kurulu, uzun süredir kullanılan BSD lisanslı bir Python tarama ve scraping framework’üdür. İstek zamanlama, bağlantı takibi, tekrarları önleme, middleware, yeniden deneme, hız sınırlama, pipeline’lar ve JSON, JSON Lines, CSV, XML, pickle ve marshal’a feed export sağlar.
Temel özellikler:
- Büyük ve dikkatle sınırlandırılmış taramalar için uygun asenkron istek yönetimi
- Geniş middleware ekosistemi (proxy’ler, yeniden denemeler, hız sınırlama, özel başlıklar)
- Veri temizleme ve depolama için yapılandırılmış pipeline mimarisi
- Dev topluluk, kapsamlı dokümantasyon ve üçüncü taraf eklentiler
- Tamamen açık kaynak (BSD lisansı)
Sınırlamalar: Yerleşik JavaScript rendering yoktur. Resmî dinamik içerik rehberi, mümkün olduğunda verinin temel kaynağını bulmayı ya da browser/rendering bileşeniyle bilinçli şekilde entegre etmeyi önerir (ör. scrapy-playwright). Mimarisi — spider’lar, middleware, item pipeline’ları, ayarlar — gerçek bir öğrenme eğrisine sahiptir.
Fiyatlandırma: Ücretsiz. Siz barındırırsınız.
Kimler için en uygun: Büyük, çoğunlukla statik veya sunucu tarafında render edilen web sitelerini ölçekli biçimde taramak isteyen orta seviye Python kullanıcıları.
Scrapy ile Başlamak: Açıklamalı Hızlı Başlangıç
Kurulumdan ilk veriye ulaşmak için minimum yol şöyle:
pip install scrapy
scrapy startproject beginner_crawl
cd beginner_crawl
scrapy genspider example example.com
beginner_crawl/spiders/example.py dosyasını açıp düzenleyin:
import scrapy
class ExampleSpider(scrapy.Spider):
name = "example"
allowed_domains = ["example.com"] # Sadece bu domain içinde kal
start_urls = ["https://example.com"] # Başlangıç URL'si
custom_settings = {
"ROBOTSTXT_OBEY": True, # robots.txt'ye uy
"DOWNLOAD_DELAY": 2, # İstekler arasında 2 saniye bekle
"CLOSESPIDER_PAGECOUNT": 10, # 10 sayfadan sonra dur (güvenlik sınırı)
"USER_AGENT": "Beginner-Crawl-Bot (+https://yoursite.com/bot-info)",
}
def parse(self, response):
yield {
"title": response.css("title::text").get(),
"url": response.url,
}
# Sayfadaki bağlantıları takip et (allowed_domains içinde)
for link in response.css("a::attr(href)").getall():
yield response.follow(link, callback=self.parse)
Çalıştırın:
scrapy crawl example -o output.json
Ölçek büyütmeden önce seçicilerinizi scrapy shell "https://example.com" ile test edin. Kurulum süresi Python deneyiminize göre değişir — sanal ortamlar ve terminal komutlarına yeniyseniz on dakikada bitmesini beklemeyin.
7. Crawlee

Crawlee, Apify tarafından geliştirilen, JavaScript/TypeScript ve Python için Apache lisanslı bir tarayıcı kütüphanesidir. HTTP-odaklı sınıflar (örneğin CheerioCrawler) ile Playwright/Puppeteer tabanlı tarayıcılar, request queue’ları, dataset’ler, session yönetimi, yeniden denemeler ve sınırlandırma kontrolleri sunar.
Temel özellikler:
- Projeye göre HTTP-first (CheerioCrawler) veya tam tarayıcı (PlaywrightCrawler) seçimi
- Yerleşik request queue, deduplication ve dataset saklama
- Session yönetimi, tarayıcı parmak izleri, yeniden denemeler ve istek sınır kontrolleri
- TypeScript odaklı ama kararlı Python desteği de var
- Resmî hızlı başlangıç, HTML’de veri varsa HTTP-first yaklaşımını önerir
Fiyatlandırma: Ücretsiz. Açık kaynak, self-hosted.
Sınırlamalar: JavaScript/TypeScript veya Python bilgisi gerekir. Scrapy’ye göre topluluk dokümantasyonu daha azdır. Anti-blocking özellikleri yetkilendirme sağlamaz veya erişimi garanti etmez — tespit edilme riskini azaltır ama izinsiz taramayı meşru hale getirmez.
Kimler için en uygun: Yerleşik kuyruk yönetimi ve anti-blocking ile modern SPA’ları ve JS ile render edilen siteleri taramak isteyen orta seviye JavaScript geliştiricileri.
Crawlee Hızlı Başlangıç: Kurulumdan İlk Veriye
npx crawlee create my-crawler
cd my-crawler
Kurulum sorusu çıktığında Playwright şablonunu seçin.
src/routes.ts içindeki handler’ı ihtiyacınız olan veriyi çekecek şekilde düzenleyin, ardından:
npm start
Sonuçlar yerel dataset dizininde JSON olarak oluşur. Test çalıştırmasının ötesine geçmeden önce maxRequestsPerCrawl, derinlik sınırları, aynı domain kuralları ve makul bir eşzamanlılık limiti ekleyin.
8. Playwright

Playwright, Python, Node.js, Java ve .NET desteği olan Microsoft’un Apache lisanslı tarayıcı otomasyon framework’üdür. Gerçek Chromium, Firefox ve WebKit tarayıcılarını kontrol eder — bu da onu JavaScript ile yüklenen içerik, giriş akışları veya karmaşık etkileşimler içeren sayfalar için mükemmel kılar.
Temel özellikler:
- Üç motor üzerinde yerel gerçek tarayıcı rendering’i
- SPA’lar, giriş akışları, tıklamalar, form doldurma, dosya indirme, ekran görüntüleri ve PDF’ler
- Çoklu dil desteği (Python, JS/TS, Java, .NET)
- Mükemmel dokümantasyon ve aktif geliştirme
- Ağ yakalama ve istek taklidi
Playwright ne değildir: Tam bir tarayıcı değildir. Yerleşik URL frontier, deduplication kuyruğu, politeness policy, yeniden deneme modeli veya veri akışı dışa aktarıcı sunmaz. Bu parçaları kendiniz kurarsınız — ya da bunları sağlayan Crawlee gibi bir framework ile birleştirirsiniz.
Fiyatlandırma: Ücretsiz. Açık kaynak.
Kimler için en uygun: JS yoğun veya giriş korumalı sitelerde tarayıcı etkileşimlerini otomatikleştirmesi gereken ve etrafında kendi tarama mantığını kurabilecek orta seviye geliştiriciler.
9. Screaming Frog

Screaming Frog SEO Spider, Windows, macOS ve Linux için teknik SEO odaklı bir masaüstü tarayıcıdır. Genel amaçlı bir veri çıkarma aracı değildir — bozuk bağlantıları, yönlendirme zincirlerini, yinelenen içerikleri, eksik meta verileri ve yüzlerce başka teknik SEO sorununu tespit etmek için başvurulan araçtır.
Temel özellikler:
- Ücretsiz olarak 500 URL’ye kadar tarar (kalıcı, deneme sürümü değil)
- Bozuk bağlantıları, yönlendirme zincirlerini, yinelenen içerikleri, eksik meta verileri tespit eder
- Sayfa başlıkları, meta açıklamalar, başlıklar, görseller ve daha fazlası için ayrıntılı sekmeler
- Ücretli sürüm JavaScript rendering, tarama kaydetme, özel çıkarım, GA/GSC entegrasyonu ve AI entegrasyonları (OpenAI, Gemini, Anthropic, Ollama) ekler
Fiyatlandırma: Ücretsiz sürüm kalıcıdır ve tarama başına 500 URL sunar; ancak JavaScript rendering, gelişmiş yapılandırma, özel çıkarım ve entegrasyonlar içermez. Lisans kişi başı yıllık £199 / $279 / €245 seviyesindedir.
Sınırlamalar: SEO dışı kullanıcılar için öğrenme eğrisi yüksektir. Yerel cihaz kaynaklarını tüketir (büyük sitelerde bellek sınırına takılabilir). Aylık plan seçeneği yoktur. Genel veri çıkarımı için tasarlanmamıştır — bu bir denetim aracıdır.
Kimler için en uygun: SEO denetimi ve teknik site analizi odaklı yeni başlayanlar. Ürün verisi çekmek veya lead listesi oluşturmak istiyorsanız başka araçlara bakın.
10. Colly

Colly, callback tabanlı API, eşzamanlılık kontrolleri, session/cookie desteği, kuyruklar, önbellekleme ve değiştirilebilir depolama arka uçları sunan Apache lisanslı bir Go HTTP crawler/scraper framework’üdür.
Temel özellikler:
- Düşük kaynak kullanımıyla hızlı eşzamanlı HTTP tarama
- Temiz, callback odaklı API
- Yerleşik cookie/session yönetimi ve önbellekleme
- LimitRule ile domain bazlı hız sınırlama
- Kurulum:
go get github.com/gocolly/colly/v2
Yeni başlayanlar için kritik uyarı: Colly’nin mevcut kaynak kodu varsayılan olarak IgnoreRobotsTxt = true şeklinde başlatılır. Bunu açıkça false yapmalı ve uygun gecikme ile paralellik ayarlarına sahip LimitRule yapılandırmalısınız. Bu adımlar olmadan Colly robots.txt’yi yok sayar ve hedef sunucuyu kolayca aşırı yükleyebilir.
Fiyatlandırma: Ücretsiz. Açık kaynak.
Sınırlamalar: Go programlama bilgisi gerekir. Yerleşik JavaScript renderer veya evrensel feed exporter yoktur — çıktıyı kendiniz serialize edersiniz. Python tabanlı araçlara göre daha küçük bir topluluğa sahiptir.
Kimler için en uygun: Go bilen ve statik siteler veya API’ler için hızlı, hafif bir HTTP tarayıcısı isteyen ileri başlangıç seviyesindeki kullanıcılar — robots ve hız limitlerini açıkça yapılandırmak şartıyla.
Ücretsiz Plan Karşılaştırması: Ödeme Yapmadan Önce Gerçekte Ne Alıyorsunuz?
Bütçesine dikkat eden yeni başlayanların aradığı tablo bu. Aşağıdaki her araç iki kategoriye ayrılır: freemium ürünler (kısıtlı ama altyapı maliyetsiz) ve açık kaynak araçlar (sınırsız sayfa, ama her şeyi siz barındırırsınız).
Freemium / Masaüstü Ücretsiz Planları
| Araç | Ücretsiz Limit | Proje/Görev Limiti | Dışa Aktarma Kısıtları | Süre Sınırlı mı? | Temel Kısıtlar |
|---|---|---|---|---|---|
| Octoparse | Tarama başına sınırsız sayfa | 10 görev | Dışa aktarma başına 10K satır; ayda 50K satır | Hayır (kalıcı) | Bulut, zamanlama, IP rotasyonu, API |
| ParseHub | Koşum başına 200 sayfa | 5 genel proje | CSV/JSON | Hayır (kalıcı) | Projeler/veriler herkese açık olabilir; 14 gün saklama |
| Thunderbit | Ayda 6 sayfa | Yok | Excel/CSV, Sheets, Airtable, Notion | Hayır (kalıcı) | Sayfalama, alt sayfalar, toplu işlem ve zamanlamalar Starter’da |
| Firecrawl | Ayda 1.000 kredi | Yok | Tüm formatlar | Hayır (kalıcı) | 2 eşzamanlı istek; düşük hız limitleri |
| Screaming Frog | Tarama başına 500 URL | Sınırsız çalıştırma | Sınırlı dışa aktarma | Hayır (kalıcı) | JS rendering, tarama kaydetme, özel çıkarım, entegrasyonlar |
Açık Kaynak Araçlar (Self-Hosted)
| Araç | Sayfa Limiti | Lisans | Neye Para Ödersiniz |
|---|---|---|---|
| Scrapy | Yok | BSD | İşlem gücü, bant genişliği, depolama, isteğe bağlı tarayıcı entegrasyonu |
| Crawlee | Yok | Apache | İşlem gücü, bant genişliği, tarayıcı süreçleri |
| Crawl4AI | Yok | Apache-2.0 + atıf | İşlem gücü, tarayıcı süreçleri, isteğe bağlı LLM çalıştırma |
| Playwright | Yok | Apache | İşlem gücü, tarayıcı süreçleri (yüksek CPU/bellek) |
| Colly | Yok | Apache | İşlem gücü, bant genişliği |
Yazılım bütçeniz sıfırsa ve kod yazabiliyorsanız, açık kaynak araçlar satıcı kaynaklı sayfa kotasından kaçınmanızı sağlar; ancak altyapı, hedef site limitleri ve işletme maliyetleri devam eder. Kod yazamıyor musunuz? Octoparse, ParseHub ve Thunderbit ücretsiz bir yol sunar — sadece limitleri ve gizlilik koşullarını takip edin.
İlk 10 Dakikanız: 3 Beceri Seviyesi İçin Hızlı Başlangıç Rehberleri

Teori güzel. Pratik daha iyi. İşte üç temsilî araçta sıfırdan ilk veri dışa aktarımına nasıl geçeceğiniz — her beceri seviyesi için bir tane.
Kodsuz Yol: Thunderbit ile Başlamak
- Thunderbit tarayıcı eklentisini kurun
- Hedef sayfaya gidin (ör. ürün listeleme, dizin veya arama sonuçları sayfası)
- Thunderbit simgesine tıklayın ve Tek Tıkla Çıkarma seçin — AI sayfayı okur, yapısını çözer, hangi sütunların çekileceğine karar verir ve hepsini tek seferde çıkarır
- Sonuçları eklenti içinde gözden geçirin — gerekirse sütun adlarını değiştirin, silin, yeni sütun ekleyin ve alan bazlı AI istemleri ekleyin — ardından Excel, Google Sheets, Airtable veya Notion’a dışa aktarın
Uyumlu bir sayfada bu, programlama projesi yerine kısa bir kurulum süreci olarak tasarlanmıştır.
Daha ayrıntılı bir anlatım için Thunderbit kullanarak web sayfalarından veri çıkarma rehberimize bakın.
Python Başlangıç Yolu: Scrapy ile Başlamak
Yukarıdaki Scrapy bölümündeki açıklamalı hızlı başlangıcı inceleyin. Temel adımlar pip install scrapy, scrapy startproject, spider’ınızı ROBOTSTXT_OBEY = True ve bir DOWNLOAD_DELAY ile düzenlemek, ardından scrapy crawl example -o output.json komutunu çalıştırmaktır. Ölçek büyütmeden önce seçicileri scrapy shell içinde test edin. Süre, Python kurulum deneyiminize göre değişir.
JavaScript Yolu: Crawlee ile Başlamak
Yukarıdaki Crawlee hızlı başlangıcına bakın. npx crawlee create my-crawler komutunu çalıştırın, Playwright şablonunu seçin, handler’ınızı düzenleyin ve ardından npm start komutunu çalıştırın. Sonuçlar yerel dataset dizininde JSON olarak görünür. Ölçek büyütmeden önce maxRequestsPerCrawl ve domain kısıtları ekleyin.
Crawler projesinin nasıl bir araya geldiğini daha uzun bir Python odaklı anlatımla görmek isterseniz, bu kurs faydalı bir tamamlayıcı olabilir:
Ücretsiz Deneyin, Kredi Kartı Gerekmez Ücretsiz plan ayda 6 sayfa kapsar; böylece ücretli araca geçmeden önce veri çekmeyi pratik edebilirsiniz. Get Started Free
İlk Taramanızı Bozan 5 Yeni Başlayan Hatası (ve Bunlardan Nasıl Kaçınılır)

Bunlar forumlarda sürekli gündeme geliyor ve üst sıralarda yer alan makalelerin hiçbiri bunları ayrı bir bölüm olarak ele almıyor.
Hata 1: JavaScript ile Render Edilen Bir Sitede Sadece HTTP Kullanan Tarayıcı Kullanmak
Sorun: birçok modern site, ilk HTML yanıtından sonra veriyi JavaScript üzerinden yükler. Basit bir HTTP isteği, boş <div> etiketlerinden oluşan kabuk bir sayfa döndürür — veri yoktur.
Çözüm: Araç seçmeden önce hedef sayfayı açın, sağ tıklayın ve Kaynağı Görüntüle’ye bakın. İhtiyacınız olan veri ham HTML içinde yoksa tarayıcı rendering’i olan bir araca ihtiyacınız vardır: Playwright, Crawlee’nin PlaywrightCrawler’ı veya Thunderbit ya da Octoparse gibi tarayıcı içinde render eden kodsuz bir araç. Ama HTTP yeterliyken gereksiz yere tarayıcıya geçmeyin — maliyeti ve karmaşıklığı artırır.
Hata 2: robots.txt ve Crawl-Delay Kurallarını Görmezden Gelmek
Sorun: robots.txt, bir isimlendirilmiş tarayıcı token’ının hangi yolları ziyaret edebileceğini bildiren bir standarttır. Bir sitenin tarama politikasını yok saymak bloklanmaya, operasyonel zarara ve uyumluluk riskine yol açabilir.
Çözüm: Tarama yapmadan önce her zaman yoursite.com/robots.txt adresini kontrol edin ve seçtiğiniz aracın varsayılan davranışını doğrulayın. Varsayılanlar değişebilir: örneğin Colly, IgnoreRobotsTxt = true ile başlar ve açık yapılandırma ister. robots.txt’nin bir tarama kontrol sinyali olduğunu, yasal yetkilendirme olmadığını unutmayın. İzin verilen bir yol, veriyi herhangi bir amaçla toplama veya yeniden kullanma lisansı değildir.
Hata 3: Hız Sınırı Koymadan Çok Fazla İstek Göndermek
Sorun: saniyede yüzlerce istek göndermek hedef sunucuyu bunaltabilir, IP’nizin engellenmesine yol açabilir ve genel olarak kötü uygulama sayılır.
Çözüm: Pozitif bir gecikme ayarlayın. Scrapy’de DOWNLOAD_DELAY = 2 ve düşük CONCURRENT_REQUESTS_PER_DOMAIN kullanın. Colly’de LimitRule içinde gecikme ve paralellik yapılandırın. Bulut/kodsuz araçlar bunu çoğu zaman otomatik yönetir, ama ayarlarını yine de kontrol edin. Her domain için başlangıçta tek bir aktif istekle başlayın ve yalnızca sitenin davranışı ve şartları izin veriyorsa artırın.
Hata 4: Küçük Bir Proje İçin Kurumsal Ölçekli Bir Araç Seçmek
Sorun: 500 sayfalık bir proje için proxy rotasyonu ve mesaj kuyruğu olan dağıtık bir Scrapy kümesi kurmak, market alışverişi için kamyon kiralamaya benzer.
Çözüm: Karar akış şemasına geri dönün. Araç karmaşıklığını proje boyutuyla eşleştirin. Küçük, tek seferlik veri çekmeleri için tarayıcı eklentisi veya basit bir script neredeyse her zaman doğru tercihtir.
Hata 5: Çıktı Verinizi Doğrulamamak
Sorun: yeni başlayanlar çoğu zaman veriyi kontrol etmeden dışa aktarır ve daha sonra satırların yarısının boş, yinelenmiş veya bozuk olduğunu fark eder.
Çözüm: Tam taramayı çalıştırmadan önce ilk 10–20 satırı mutlaka örnekleyin. Boş alanlara, kodlama sorunlarına (mojibake), yinelenen satırlara ve beklenmeyen değerlere bakın. Başlamadan önce beklenen şemanızı tanımlayın — hangi sütunlar olmalı, hangi türde olmalı, hangi alanlar zorunlu? Başarılı bir tarama çalışması, verinin doğru olduğunu kanıtlamaz.
“LLM’ye Hazır Çıktı” Ne Demek? Neden AI Kurmuyor Olsanız Bile Önemli?
“LLM-ready” ifadesi 2026’daki tarayıcı pazarlamasında her yerde karşınıza çıkar. Açıklamaların çoğu, sanki siz zaten vektör veritabanının ne olduğunu biliyormuşsunuz gibi davranır. İşte sade anlatım.
LLM’ye hazır çıktı, bir AI modelinin (GPT veya Claude gibi) manuel temizlik gerektirmeden tüketebileceği temiz, yapılandırılmış metindir. Bunu, birine reklamlar, gezinme menüleri ve çerez banner’ları hâlâ üzerinde duran bir yığın basılı web sayfası vermek yerine, düzenli bir elektronik tablo vermeye benzetin.
Chatbot kurmuyor olsanız bile neden önemlidir? Çünkü LLM’ye hazır çıktı için tasarlanmış araçlar, herkes için daha temiz ve daha kullanışlı veri üretme eğilimindedir. Daha az son işleme, daha az gereksiz sütun, daha az kodlama sorunu. İnsan ya da makine okuyor olsun, temiz veri temiz veridir.
Bu listedeki hangi araçlar yerleşik olarak LLM’ye hazır çıktı üretir?
- Firecrawl → Temiz Markdown, özetler, yapılandırılmış JSON
- Crawl4AI → Birden fazla Markdown varyantı, yapılandırılmış parçalar, tablolar
- Thunderbit → İstem tabanlı normalizasyonla AI önerili yapılandırılmış alanlar
Kısa bir önce/sonra örneği:
Bir ürün sayfasından alınan ham HTML şöyle görünebilir:
<div class="product-card">
<span class="price">$29.99</span>
<h2 class="title">Wireless Mouse</h2>
<p class="desc">Ergonomic design, 2.4GHz...</p>
<a href="/buy" class="btn">Add to Cart</a>
</div>
Firecrawl’dan gelen LLM’ye hazır Markdown çıktısı:
## Wireless Mouse
- **Price:** $29.99
- **Description:** Ergonomic design, 2.4GHz
Thunderbit’ten gelen yapılandırılmış çıktı:
| Ürün Adı | Fiyat | Açıklama |
|---|---|---|
| Wireless Mouse | $29.99 | Ergonomic design, 2.4GHz |
İkisi de hemen kullanılabilir — HTML ayrıştırma, reklam temizleme, manuel sütun eşleme gerekmez. AI destekli çıkarımın geleneksel scraping ile nasıl karşılaştırıldığı hakkında daha fazla bilgi için en iyi AI web scraper’ları özetimize bakın.
Sorumlu Web Tarama: Etik ve Uyumluluk İçin Kısa İpuçları
Web tarama etiği ve uyumluluk atlanacak konular değildir:
- Her siteyi taramadan önce robots.txt kontrol edin. Bu, standart tarama kontrol sinyalidir (RFC 9309); ancak yasal yetki veya güvenlik sınırı değildir.
- Hız limitlerine ve Retry-After başlıklarına uyun. 429 ve 503 yanıtlarında yavaşlayın veya durun.
- Yalnızca herkese açık veya yetkilendirilmiş veriyi kullanın. İhtiyacınızı karşılıyorsa resmi API veya dışa aktarma tercih edin.
- Web sitesinin kullanım şartlarını kontrol edin. Kamuya açık görünürlük, veriyi toplamak veya yeniden kullanmak için evrensel bir lisans değildir.
- Kişisel veriler konusunda dikkatli olun. Toplamayı en aza indirin, saklama/silme kuralları koyun ve hassas kullanım durumlarında uzman değerlendirmesi alın. GDPR ve benzeri düzenlemeler, kullandığınız araçtan bağımsız olarak geçerlidir.
Birçok araç sorumlu taramayı destekleyen ayarlar sunar, ancak yapılandırma sorumluluğu operatörden almaz. Alttaki süreç hakkında daha derin bir bakış için web scraping nedir yazımıza bakın.
Hangi Web Tarayıcısıyla Başlamalısınız?
Beceri seviyesine göre kısa özet:
- Kodsuz: AI destekli sayfa çıkarımı için Thunderbit, görsel iş akışı oluşturma için Octoparse, karmaşık çok adımlı akışlar için ParseHub, SEO denetimleri için Screaming Frog
- Orta seviye Python: Büyük HTTP taramaları için Scrapy, LLM hatları için Crawl4AI
- Orta seviye JavaScript: Modern SPA taraması için Crawlee, karmaşık tarayıcı otomasyonu için Playwright
- Go: Açık robots ve hız limiti yapılandırmasıyla hızlı HTTP tarama için Colly
- Yönetilen API: Self-hosting olmadan temiz Markdown çıktısı için Firecrawl
En iyi tarayıcı; verinize, izinlerinize, beceri seviyenize ve işletme sınırlarınıza uyan tarayıcıdır. Basit başlayın, küçük bir çalıştırmayı doğrulayın ve yalnızca proje gerçekten gerektiriyorsa karmaşıklığı artırın. AI destekli çıkarımı denemek istiyorsanız, Thunderbit tarayıcı eklentisi uyumlu bir sayfadan elektronik tabloya geçiş için kodsuz bir yol sunar.
Daha Fazla Bilgi
- AI Web Scraping
- Kodsuz Web Scraping
- Web Scraping Nedir
- Instant Data Scraper Alternatifleri
- LinkedIn Scraping
Thunderbit'in Ajan Temelli Web Scraper'ını Deneyin Get Started Free
Sık Sorulan Sorular
1. Web tarayıcısı nedir ve web scraper’dan farkı nedir?
Tarayıcı sayfaları keşfeder ve çeker — bağlantıları takip eder, URL kuyruğunu yönetir, yinelenenleri ve derinlik sınırlarını ele alır. Scraper ise bu sayfalardan belirli yapılandırılmış verileri çıkarır — HTML’yi ayrıştırır, alanları seçer ve kayıtlar üretir. Modern araçların çoğu değişen oranlarda ikisini de yapar ve terimler sık sık birbirinin yerine kullanılır; ancak araç seçerken bu ayrım önemlidir: bazıları (Playwright gibi) sayfaları render etmede iyidir ama crawl altyapısı sunmaz, bazıları (Scrapy gibi) tam crawl hattı sunar ama JavaScript rendering için eklenti ister.
2. Kodlama bilmeyen biri için en iyi web tarayıcısı hangisidir?
Thunderbit, Octoparse ve ParseHub genel veri çıkarımı için en iyi kodsuz seçeneklerdir. Thunderbit AI ile alan önerir ve tarayıcı eklentisi olarak çalışır; Octoparse Auto-detect özellikli görsel bir iş akışı oluşturucu sunar; ParseHub karmaşık çok adımlı akışlarda iyidir. Sadece SEO kullanımında ise Screaming Frog’un ücretsiz sürümü 500 URL’ye kadar tarama yapar ve kod gerektirmez.
3. Web tarayıcıları ücretsiz mi?
İki kategori vardır. Tam açık kaynak araçlarda (Scrapy, Crawlee, Crawl4AI, Playwright, Colly) sayfa başı ücret yoktur; ancak altyapıyı siz barındırır ve işlem gücü, bant genişliği, depolama için ödeme yaparsınız. Freemium araçlar (Octoparse, ParseHub, Thunderbit, Firecrawl, Screaming Frog) ise sayfa, proje, dışa aktarma veya özelliklerde çeşitli limitlerle ücretsiz katman sunar. Ayrıntılar için yukarıdaki ücretsiz plan karşılaştırma tablosuna bakın.
4. Web tarayıcıları JavaScript yoğun web sitelerini yönetebilir mi?
Evet, ama hepsi değil. Yerleşik tarayıcı rendering’i olan araçlar — Playwright, Crawlee (PlaywrightCrawler), Octoparse, ParseHub, Crawl4AI ve Thunderbit (Browser Mode ile) — JavaScript ile yüklenen içeriği yönetebilir. Scrapy ve Colly HTTP-first yapıdadır ve JS rendering için ayrı tarayıcı entegrasyonlarına ihtiyaç duyar. Screaming Frog ise JavaScript rendering’i yalnızca ücretli sürümde destekler. Hedef sayfanızın gerçekten tarayıcı gerektirip gerektirmediğini önce kaynak HTML’sine bakarak kontrol edin.
5. Web tarama yasal mı?
Tek bir evet/hayır cevabı yoktur. Hukuki değerlendirme; veri türüne, erişim yöntemine, kullanım amacına, web sitesi şartlarına, sözleşmelere, fikri mülkiyet kurallarına, GDPR gibi gizlilik yükümlülüklerine ve geçerli yargı alanına bağlıdır. robots.txt bir tarama kontrol sinyalidir, yasal yetkilendirme değildir; kamuya açık görünürlük de sınırsız bir izin anlamına gelmez. Özellikle kişisel veri, telifli içerik, kimlik doğrulama veya ticari yeniden kullanım içeren durumlarda yetkin bir hukuk uzmanına danışın.


