trafilatura, tarayıcı gerektirmeyen bir Python içerik çıkarıcıdır. Bu makaledeki etiketlenmiş örneklerde, aynı HTML üzerinde kalite açısından ona en yakın rakip Mozilla Readability oldu: trafilatura 17 işaretlenmiş boilerplate biriminden 1’ini sızdırırken Readability 5’ini sızdırdı. Tarayıcı tabanlı araçlar yalnızca kurulum ayağı bağlamında anıldı; bu sayfalarda kalite testi yapılmadı.

Temel işi ana içeriği ayıklamaktır: HTML alır, karşılığında makale odaklı metin ve meta verileri verir; sayfa dekorunu ise sezgisel kurallarla ayıklar. Çıktıyı JSON ve başka formatlarda seri hale getirebilir, ancak size tanımlı bir satır şeması ya da tekrarlanan tipli katalog kayıtları üretmez. Test edilen sürüm 2.1.0’dı. JavaScript çalıştırmaz ve Readability ile yapılan karşılaştırma, kategori genelinde bir üstünlükten çok, doğruluk ile içerik koruma arasındaki dengeyi gösteriyor.
trafilatura nerede konumlanır, neyi bilinçli olarak yapmaz
trafilatura kendini web’den metin ve meta veri toplamak için kullanılan bir Python ve komut satırı aracı olarak tanımlar — tarama, scraping, extraction — ve çıktıyı CSV, JSON, HTML, Markdown, TXT ya da XML olarak verebilir. Kulağa geniş geliyor. Ama pratikte aracı taşıyan kısım daha dar ve nettir: bir HTML belgesini alır, çevresindeki sayfa süslemelerinden arındırılmış şekilde ana içeriği döndürür.

Bunu zihinde şöyle canlandırmak faydalı, çünkü hem güçlü yönünü hem sınırını açıklıyor. Sayfaya hedeflenen çoğu scraper seçici tabanlıdır — siz onlara "class product-price olan öğeyi al" dersiniz, onlar da o adresteki şeyi getirir. trafilatura ise ters yönde çalışır. Tüm belgeyi okur ve hangi blokların gerçek makale, hangilerinin boilerplate olduğuna içerik sezgileriyle karar verir; sizin yazdığınız bir seçiciye dayanmaz. Bu yüzden sayfa temizliği için siteye özel kurallara ihtiyaç duymaz. Ve tam da bu nedenle size yapılandırılmış bir katalog veremez: şema yok, tipli satır yok, sadece "işe yarar metin burada" var. Bu bir extractor’dır, hedefleyip yönlendirdiğiniz bir parser değil.
Ayrıca ayrı indirilmiş bir tarayıcı çalışma zamanı da gerektirmez. Bağımlılık ağacında lxml gibi platform wheel’leri vardır; bu yüzden “tarayıcı indirme yok” ifadesi, kaynak koddan kurulum veya yerel kod içermeyen bir kurulum anlamına gelmemelidir.
Kurulum: küçük bağımlılık ayak izi, tarayıcı kurulumu yok
Python 3.14 üzerinde temiz bir virtualenv içinde pip install trafilatura komutu 17 paket kurdu; kaydedilen en büyük wheel lxml idi ve boyutu 8.6 MB’tı; ayrıntılar pip-install-trafilatura.log içinde. Ayrı bir tarayıcı kurulumu ya da kurulum sonrası tarayıcı komutu gerekmedi.
Ölçek açısından, aynı araştırma tabanındaki Scrapling paketi fetcher’ları çalıştırmak için dört ayrı pip çağrısı gerektirdi ve 26 pakette kaldı; bunların ikisi 42.2 MB’lık Playwright driver wheel’leriydi (tools/scrapling/artifacts/logs/pip-install-scrapling.log) — bu da henüz herhangi bir tarayıcı binary’si indirilmeden önceydi. Crawlee paketi ise ayrı Chromium indirmesini yaklaşık 81.7 MiB olarak ölçtü (tools/crawlee/research-materials.md). Bu araçlar daha büyük bir işi yapıyor; dolayısıyla yetenek açısından bu adil bir kapışma değil. Sadece diskinizin ve CI önbelleğinizin gördüğü şey bu. Ayrıca pip’in bana verdiği sürüm (2.1.0) güncel sürüme eşitti; yani aşağıdaki sayılarda "eski bir sürüm test edildi" gibi bir dipnot yok.
Uygulamada: çıkarıcı gerçekte ne döndürdü

Aracı, hem güçlü olduğu noktaları hem de sınırına çarptığı durumları görmek için hazırlanan örnekler üzerinde çalıştırdım; ham çıktılar benchmark deposunda saklanıyor. Makale testi beni asıl ikna eden test oldu.
Yerel bir makale örneği aldım ve gerçek içeriğin etrafını gürültüyle çevreledim: giriş uyarısı, bir "Subscribe" hatırlatması, gezinme bağlantıları, bir telif hakkı altbilgisi — naif bir scraper’ın gövdeyle birlikte çekip getireceği standart boilerplate. trafilatura başlık + gövde paragraflarının 3’ünün 3’ünü döndürdü ve boilerplate işaretçileri — Login, Subscribe, Copyright — çıktıda tamamen kayboldu. Metne ek olarak, sayfa meta verilerinden yazar ve tarih bilgisini de doğru çekti. .txt, .md ve .json boyunca tam sonuç results/local_article.json içinde yer alıyor.
Aynı kaydedilmiş HTML düz metin, Markdown ve JSON olarak dışa aktarıldı. Makale, bu üç formatın tek bir eşzamanlı çağrıdan üretildiğini kanıtlamıyor; bunlar çıkarım hattının alternatif seri hale getirmeleridir. Buradaki JSON, kullanıcı tanımlı tekrarlanan kayıtları değil, çıkarılmış metin ve meta verileri paketler.
İlk çalıştırmanın tamamı aşağıda tek yerde; böylece iddiaları körlemesine kabul etmek yerine kontrol edebilirsiniz:
| Örnek | Geri dönen içerik | Çalışma süresi | Kanıt |
|---|---|---|---|
| Nav / login / subscribe / copyright ile sarılmış yerel makale | başlık + 3/3 paragraf, hiç boilerplate sızıntısı yok, yazar Thunderbit Research Lab, tarih 2026-07-09 | 0.007 s | local_article.json |
| Yerel ürün kataloğu | 12 ürün adı ve 12 fiyat, düz metin olarak, 0 yapılandırılmış satır, 478 karakter | 0.064 s | local_catalog_extraction.txt |
| HTTP 500 dönen sayfa | fetch_url, hata atmadan None döndürdü | 30.012 s | local_failure_500.json |
| Books to Scrape ürün sayfası (genel erişim) | 1,324 karakter temiz metin + Markdown karşılığı | 0.753 s | public_books_product.txt / .md |
Her satır trafilatura paketindeki artifacts/raw/trafilatura-test-summary.json dosyasından okunuyor — trafilatura 2.1.0, Python 3.14, macOS arm64, tek makinede tek çalıştırma. Süreleri bir benchmark değil, gözlem olarak değerlendirin.
500 örneğinde, fetch_url yaklaşık 30 saniye sonra None döndürdü; yakınlardaki yerel uç noktalar ise hızlıydı. Bu çalışma gecikmeyi ortaya koyuyor, fakat bunun retry/backoff, sabit bir timeout ya da başka bir dahili yol nedeniyle olup olmadığını göstermiyor. Bu makale, fetch_url için desteklenen bir çağrı-bazlı timeout parametresini doğrulamadı; kanıtlanmış kontrol yolu, çağıranın kontrol ettiği bir istemciyle HTML’i çekip çıkan HTML’i trafilatura’ya vermektir.

Aynı testler üç sınırı daha görünür kılıyor.
Birincisi ve en büyüğü: trafilatura bir content extractor’dır, yapılandırılmış bir scraper değil. Onu bir ürün kataloğu örneğinde çalıştırdım. Tüm 12 ürün adını — metin olarak — ve tam olarak 0 yapılandırılmış satırı döndürdü (results/local_catalog_extraction.txt dosyasına göre 478 karakterlik düz metin). Fiyatlar da geldi, $18.00’dan $51.00’a kadar, her adın altında ayrı satırlarda duruyordu. İstediğiniz her şey çıktının içindeydi; fakat hiçbiri alan değildi. Eğer [{name, price, rating}, …] istiyorsanız, bu yanlış araçtır ve bunu değiştirecek hiçbir ayar yoktur — bu bir tasarım tercihidir, hata değil.

İkincisi: JavaScript render etmez. Statik HTML tüketir. Client-side render edilen bir sayfaya yöneltirseniz, JS çalışmadan önce sunucunun gönderdiği şeyi alırsınız; bu da çoğu zaman işinize yarayan bir şey olmaz. Hedefleriniz JS ağırlıklıysa, yanında bir renderer kullanmanız gerekir; trafilatura o kısmı sizin için yapmaz.
Üçüncüsü, kendi kanıtım için bir not: ilk genel erişim testi gerçek bir haber makalesi değil, ürün açıklaması bloğu kullanıyordu; çünkü genel sandbox’ta haber sayfası yok. Yukarıdaki makale temizleme sonucu kontrollü bir yerel örnekten geliyor. Buna güveniyorum — boilerplate temizliği tartışmasız biçimde açık — ama ürün sayfasını newsroom kalitesinde çıkarımın kanıtı gibi göstermeye yanaşmadım; bu yüzden paket bunu açık bir boşluk olarak taşıdı. 2026-07-14 tarihli takip çalıştırması bu boşluğu kapattı ve sonuçlar bir sonraki bölümde.
Gerçek sayfa üzerinde boilerplate sağlama kontrolü

İki gerçek sayfa bir kez çekildi, SHA-256 hash’leriyle çevrimdışı örnekler olarak kaydedildi ve ağ erişimi olmadan yeniden çalıştırıldı. Süre ya da etiketli ground truth kaydedilmedi. Bu bir gerçek sayfa boilerplate sağlama kontrolüdür, doğruluk puanı değil.
| Gerçek makale örneği | Ham HTML | Çıkarılan gövde | Gövde/ham | Sayfa dekoru işaretçileri kaldırıldı | başlık | tarih | hostname | author | sitename |
|---|---|---|---|---|---|---|---|---|---|
| Wikipedia, "Web scraping" | 230,049 bytes | 26,673 bytes | 0.116 | 4/4 | evet | 2005-09-17 | wikipedia.org | null | null |
| Wikinews, "7th Heaven" (arşiv) | 79,716 bytes | 2,200 bytes | 0.028 | 5/5 | evet | 2005-11-29 | wikinews.org | null | null |
Her iki satır da artifacts/results/trafilatura-fidelity-summary.json dosyasından geliyor. Kontrol edilen işaretçiler şunlardı: "Jump to content", "Privacy policy", "Powered by MediaWiki", "This page was last edited" ve Wikinews sayfasında ayrıca "free news source" — ikisinde de tamamı düşürüldü, hiçbiri sızmadı.
Gövde/ham oranı azaltmayı ölçer, doğruluğu değil; atlanan makale içeriği puanlanmadı. author ve sitename bu iki MediaWiki şablonunda null döndü; kontrollü yerel örnek ise yazar bilgisi sağladı. Bu, testte gözlemlenen MediaWiki’ye özgü bir eksikliktir; genel bir byline güvenilirliği kanıtı değildir. Çıkarılan tarihlerin hepsi döndürüldükleri haliyle raporlandı ve ground truth ile doğrulanmadı.
Aynı HTML baytları, iki extractor, tek bir puanlama betiği

Bu araştırma tabanında trafilatura için aynı test ortamında yapılmış tek bir karşılaştırma vardır ve trafilatura’nın kendi paketi bunu üretmedi. Kontrol kolu olarak mozilla-readability paketi üretti: her metin bloğunun ARTICLE ya da BOILERPLATE olarak etiketlendiği ve her kelimenin kendine özgü bir sentinel token taşıdığı 22 elle etiketlenmiş örnek; böylece çıkarılan bir kelime tam olarak tek bir etiketli bloğa eşlenebiliyor. İki araç da aynı HTML baytlarını kullandı. Readability, jsdom 29.1.1 üzerinde Node v22.22.3 ile çalıştı; trafilatura kendi ayrıştırıcısını kullandı.
| Ölçüt (mikro ortalama, içerik-doğruluk seti) | trafilatura 2.1.0 | @mozilla/readability 0.6.0 | Kanıt |
|---|---|---|---|
| Kurtarılan makale birimi | 40/40 | 40/40 | comparison.json |
| Sızan boilerplate birimi | 1/17 | 5/17 | comparison.json |
| Çıktıyı kirleten boilerplate token sayısı | 3 | 41 | comparison.json |
| Token precision | 0.939 | 0.902 | comparison.json |
| Token F1 | 0.969 | 0.948 | comparison.json |
Prose olmayan içerik, f6_nonprose örneği | 7/8 | 8/8 | comparison.json |
Çok kısa makale, f3_short_120 F1 | 0.571 | 0.800 | comparison.json |
Kaynak: bu araştırma tabanındaki tools/mozilla-readability/artifacts/raw/comparison.json — içerik-doğruluk setinde 11 örnek, 40 makale birimi ve 17 boilerplate birimi. Bunlar, adversarial durumlara bilinçli biçimde ağırlık verilmiş sentetik örneklerdir; bu yüzden bunları bir gerçek-korpus sıralaması değil, mekanizmanın gösterimi olarak okuyun.
İki araç da her şeyi süpürmüyor; ilginç kısım da tam burada. trafilatura dekoru dışarıda bırakıyor — Readability’nin beş sızıntısına karşı bir sızdırılmış blok, 41’e karşı üç kirletici token. Bu, "temiz makale metni"nin doğruluk tarafıdır ve LLM bağlam pencerenizin yan menü bağlantılarıyla dolup dolmayacağına karar veren taraf da budur. Ama Readability, trafilatura’nın attığı bazı içerikleri geri getiriyor: prose olmayan örnekte trafilatura Readability’nin koruduğu bir <figcaption> öğesini düşürdü; çok kısa bir makalede ise 0.571 skor aldı, Readability ise 0.800 aldı. Sert temizleme, bedelsiz bir kazanç değildir. Korpusunuz kısa özetler, altyazılar ve tablo ağırlıklı sayfalarla doluysa, bu takas size ters döner.
Karşılaştırmayı nasıl bir seçim testine dönüştürürsünüz
Önce, pipeline’ınız için hangi hatanın daha pahalı olduğunu tanımlayın. Sayfa dekoru downstream token’ları tüketiyorsa ya da arama sonuçlarını kirletiyorsa, boilerplate sızıntısı ve kirletici token sayıları daha ağır basmalıdır. Bir altyazının, kısa bir gönderinin ya da prose olmayan bir bloğun kaybolması kabul edilemezse, sayfa şekline bağlı içerik geri çağırma daha önemli olmalıdır. Ortak örnek seti bu takası görünür kılar, ama bir haber arşivi, dokümantasyon korpusu ya da retrieval pipeline’ı için ağırlıkları sizin yerinize seçmez.
Daha geniş stres testi bağlamı on kütüphanelik bellek ve bozuk HTML karşılaştırmasında yer alıyor.
İki extractor’ın da aynı baytları alması için canlı URL’ler yerine kaydedilmiş HTML üzerinden bake-off yapın. Normal uzunlukta makaleler, kısa duyurular, altyazı ağırlıklı parçalar, tablo veya kod ağırlıklı dokümanlar ve gerçekten ingest ettiğiniz her yayıncının şablonlarını ekleyin. Herhangi bir aracı çalıştırmadan önce gerekli birkaç içerik birimini ve bilinen dekor bloklarını etiketleyin. Ardından boş çıktı, gerekli birim geri kazanımı, istenmeyen birim sızıntısı ve meta veri alanlarını ayrı ayrı puanlayın. Tek bir toplu “kalite” skoru, operasyonel olarak önemli olan tam hata modunu gizleyebilir.
Çıktı sözleşmesini downstream tarafta da doğrulayın. trafilatura’nın JSON’u çıkarılmış içerik ve meta verileri taşıyabilir, ancak bir JSON seri hale getirmesi, tipli bir satır şeması ile aynı şey değildir. Makale metni için, herhangi bir boş olmayan çıktıyı kabul etmek yerine minimum gövde uzunluğunu ve gerekli işaretçileri kontrol edin. Meta veriler için, eksik değer ile yanlış değeri ayırın ve kaçırılan sonuçların yeniden oynatılabilmesi için kaynak URL ile çıkarım sürümünü birlikte saklayın.
Çekme işlemi kendi katmanı olarak test edilmelidir. 30 saniyelik yerel başarısızlık gözlemi, HTML zaten elde edilip verilmişken yapılan çıkarım değil, fetch_url davranışına aittir ve iç mekanizması doğrulanmamıştır. Son tarih, retry, kimlik doğrulama ya da proxy politikası önemliyse, davranışını kontrol ettiğiniz bir istemci kullanın, son yanıt baytlarını kaydedin ve bu baytları çıkarıcıya verin. Bu, edinim hatalarını içerik seçimi hatalarından ayırır ve karşılaştırmaları tekrarlanabilir hale getirir.
Son olarak, dağıtım özelliklerini hedef platformda ölçün. 17 paketlik Python 3.14 kurulumu ayrı bir tarayıcı istemedi; ancak bu, throughput’u, bellek büyümesini, her mimaride wheel bulunabilirliğini ya da eşzamanlı worker altındaki davranışı belirlemez. Makale, Readability’ye karşı yararlı bir doğruluk/koruma mekanizması gösteriyor; üretime uygunluk ise hâlâ korpus ve çalışma zamanı testlerine bağlı.
Bu tablonun dışından bir doğrulama için, trafilatura’nın kendi değerlendirme sayfası ve herkese açık ScrapingHub article-extraction-benchmark onu ~181 gerçek sayfada word-F1 açısından readability-lxml’in önüne koyuyor — yukarıdaki tabloyla aynı yönde. Birçok yazının atladığı önemli bir not: bu benchmark’a atfedilen yaygın trafilatura F1 değeri (~0.945), burada test edilen 2.1.0’a değil, daha eski 0.5.1 serisine ait.
Artılar ve eksiler
Artılar:
- Ortak örnek setinde Readability’ye göre daha az etiketli boilerplate sızıntısı: 17 blokta 1, buna karşılık 5.
- Yerel örnekte yazar ve tarihi doğru çekti; iki gerçek makale sayfasında da başlık/tarih/hostname aldı.
- Aynı HTML, metin, Markdown veya JSON olarak seri hale getirilebilir.
- Ayrı bir tarayıcı çalışma zamanı olmadan 17 paketlik kurulum.
- Hata sessizce ele alınıyor:
fetch_url, HTTP 500 durumunda istisna atmadanNonedöndürüyor. - Test edilen sürüm en güncel sürümle aynı (2.1.0) — sürüm kayması yok.
- Apache-2.0 lisanslı — esnek ve ticari kullanıma uygun.
Eksiler:
- Yapılandırılmış scraper değil: katalog testi 12 adı ve 12 fiyatı metin olarak döndürdü, 0 tipli satır verdi. Şema yok, alan yok.
- JavaScript render etmiyor — yalnızca statik HTML; client-side sayfalar için ayrı bir renderer gerekiyor.
- İki gerçek MediaWiki sayfasında
authorvesitenamenull geldi; dolayısıyla byline çıkarımı garanti değil. - Sert temizlik bir maliyet getiriyor: Readability’nin koruduğu bir
<figcaption>öğesini düşürdü ve çok kısa bir makalede Readability’nin 0.800’üne karşı 0.571 aldı. - Sessiz 500 yanıtı
Nonedöndürmek için 30.012 saniye bekledi; deadline kontrolü gerekiyorsa çağıranın kontrol ettiği bir fetcher kullanın. - Yerleşik crawl/sitemap spider ve CSV/XML çıktı formatları bu turda test edilmedi; bu konuda iddia ileri sürmüyorum.
Kimler için uygun, kimler uzak durmalı
trafilatura, makale odaklı ana içerik çıkarımı için tasarlanmıştır. Sezgisel temizliğin kabul edilebilir olduğu durumlarda, statik HTML’den metin korpusu, okunabilir arşivler veya NLP girdileri üretmek için iyi bir adaydır. Ortak örnek seti karşılaştırması, Readability’ye göre daha az boilerplate sızıntısını destekler; buna karşılık Readability kısa ve prose olmayan örneklerde daha fazlasını korudu.
Eğer gerçekten ihtiyacınız olan yapılandırılmış çıkarım ise — fiyatlı ürün satırları, tipli kayıtlar, key: value alanları — bunu atlayın; çünkü size tablo değil metin verir (katalog testi 12 adın ve 12 fiyatın tamamını geri getirdi, ama 0 satır verdi). Hedefleriniz içeriği tarayıcıda render ediyorsa ve yanına ayrı bir renderer eklemek istemiyorsanız bunu da atlayın; trafilatura statik HTML’yi okur ve orada durur. Korpusunuz çoğunlukla kısa özetlerden, görsel altyazılarından ve tablo ağırlıklı sayfalardan oluşuyorsa iki kere düşünün: etiketli örneklerde tam olarak bu bölgede temizliği gerçek içeriği kesiyor (çok kısa makalede 0.571 F1, bir <figcaption> kaybı). Aracı işe göre seçin: tam makale metni için evet; yapılandırılmış JSON, JS sayfaları veya 100 kelimelik özetler için başka yere bakın.
Alternatifler ve Thunderbit’in yeri
trafilatura, her çağrı başına satıcı ücreti olmayan, Apache-2.0 lisanslı, kendi sunucunuzda çalıştırılan bir kütüphanedir; hesaplama, bant genişliği, çekme, izleme ve bakım maliyetleri operatöre aittir. Verilen HTML’den makale odaklı çıkarımı yapar; fakat tarayıcı yürütme ya da kullanıcı tanımlı tekrarlanan satır şemaları sunmaz.
Tüm altı extractor için aynı örneklerde karşılaştırmayı görmek isterseniz, altı kütüphanelik çıkarım karşılaştırmasına bakın.
Yönetilen bir servis, edinim, render etme ve şema şekillendirmeyi bir satıcı sınırının arkasına koyabilir. Biz Thunderbit geliştiriyoruz, ancak onu bu örneklerde çalıştırmadık; dolayısıyla bu makale kalite, render, gecikme, anti-bot ya da maliyet karşılaştırması sunmaz. Karar, kendi kendinize barındırdığınız HTML-to-content kontrolü ile yönetilen edinim ve yapılandırılmış çıkarım sınırı arasındadır.
İlgili benchmark incelemeleri: tam açık kaynak scraper karşılaştırması, Crawl4AI’nin tarayıcı tabanlı Markdown incelemesi ve Firecrawl’un kendi sunucunda çalıştırılan Markdown incelemesi.
Web Verisi Çıkarma için Thunderbit’i Deneyin
Sonuç
İşiniz statik HTML’den makale odaklı çıkarım yapmak ve önceliğiniz etiketli boilerplate’i reddetmekse trafilatura’yı düşünün. Ortak örneklerde, Readability’nin beşine karşı bir işaretlenmiş boilerplate birimini sızdırdı. Bu avantaj, çok kısa ve prose olmayan örneklerde daha düşük koruma ile geldi; dolayısıyla seçimi korpusun şekli belirlemeli.
JavaScript çalıştırmaz ve kullanıcı tanımlı tekrarlanan satırlar üretmez. İki MediaWiki sayfasında author ve sitename null geldi; bu, şablonla sınırlı bir gözlemdir. Readability, trafilatura’nın düşürdüğü altyazıyı korudu ve f3_short_120 etiketli örnekte daha yüksek puan aldı; görünen kanıt yalnızca "çok kısa örnekte daha düşük F1" sonucunu destekliyor, belirli bir karakter sayısını ya da çıktının bozulduğunu değil.
Web Verisi Çıkarma için Thunderbit’i Deneyin Get Started Free
SSS
trafilatura ne tür bir yapı döndürür? Çıkarılan içerik ve meta verileri JSON, Markdown, text, HTML, XML veya CSV olarak seri hale getirebilir. Bu, yapılandırılmış bir seri hale getirmedir; ancak ürün adı, fiyat ve puan gibi kullanıcı tanımlı tekrarlanan satır şeması değildir. Katalog örneği, değerleri tipli satırlar yerine düz içerik olarak döndürdü.
trafilatura bir ürün kataloğunu yapılandırılmış satırlara ayırabilir mi? Hayır. Bu bir content extractor’dır, yapılandırılmış scraper değil. Bir katalog örneğinde 12 ürün adının tamamını düz metin olarak ve 0 yapılandırılmış satırla döndürdü — adlar çıktıda var, ama alan değiller. Ad/fiyat/puan gibi tipli kayıtlar gerekiyorsa, seçici tabanlı bir parser ya da şema odaklı bir çıkarım API’si kullanın.
trafilatura JavaScript render eder mi? Hayır. Yalnızca statik HTML tüketir. Client-side render edilen bir sayfaya yönelttiğinizde, JavaScript çalışmadan önce sunucunun gönderdiği şeyi alırsınız; bu da çoğu zaman istediğiniz içerik olmaz. Hedefleriniz JS ağırlıklıysa ayrı bir renderer ile birlikte kullanın.
trafilatura kurması zor mu?
Test edilen Python 3.14 virtualenv içinde kurulum 17 paket çekti ve ayrı bir tarayıcı çalışma zamanı gerektirmedi. Kaydedilen en büyük wheel lxml idi ve boyutu 8.6 MB’tı. Ayrıca bir yerel 500 çağrısının None döndürmesi 30.012 saniye sürdü; doğrulanmış bir son tarih gerekiyorsa çağıranın kontrol ettiği bir HTTP istemcisi kullanın.
trafilatura ticari kullanım için ücretsiz mi? Apache-2.0 lisanslıdır; yani esnek ve ticari kullanıma uygundur. Her zamanki gibi, üzerine bir şey inşa etmeden önce güncel lisansı repo üzerinden doğrulayın.


