Facebook Scraper na GitHubu: Co stále funguje a co už ne

Naposledy aktualizováno August 5, 2026
Facebook Scraper na GitHubu: Co stále funguje a co už ne

Vyhledávání na GitHubu pro výraz „facebook scraper“ vrátí 475 repozitářů. Jen 62 z nich ale byly aktualizované během posledních šesti měsíců.

Právě ten rozdíl mezi „je to dostupné“ a „opravdu to funguje“ vystihuje situaci kolem scrapování Facebooku na GitHubu v roce 2026.

Strávil jsem hodně času procházením záložek issue v repozitářích, stížností na Redditu i skutečných výstupů těchto nástrojů. Vzorec je pořád stejný: většina nejvýše hodnocených projektů je potichu rozbitá, správci už se jim nevěnují a Facebook průběžně zpřísňuje své obranné mechanismy proti scrapingu. Vývojáři i firemní uživatelé pořád narážejí na stejné výsledky vyhledávání, instalují stejné repozitáře a končí se stejným prázdným výstupem. Tenhle článek je realitní kontrola pro rok 2026 — poctivý audit toho, které repozitáře ještě stojí za čas, co Facebook dělá pro jejich rozbíjení a kdy je lepší GitHub úplně přeskočit.

Proč lidé hledají Facebook Scraper na GitHubu

Důvody jsou už roky stejné — i když samotné nástroje postupně přestávají fungovat:

  • Generování leadů: získávání kontaktních údajů z firemních stránek (e-maily, telefonní čísla, adresy) pro oslovení
  • Monitoring marketplace: sledování produktových nabídek, cen a informací o prodejcích pro ecommerce nebo arbitráž
  • Průzkum skupin: archivace příspěvků a komentářů pro průzkum trhu, OSINT nebo správu komunity
  • Archivace obsahu a příspěvků: ukládání veřejných příspěvků stránek, reakcí, obrázků a časových značek
  • Agregace událostí: sběr názvů akcí, dat, míst a organizátorů

Přitažlivost GitHubu je zřejmá: viditelný kód, nulové náklady, komunitní údržba (alespoň teoreticky) a plná kontrola nad poli i datovým tokem.

Problém je v tom, že hvězdičky a fork žádným způsobem nezaručují, že projekt je dnes funkční. Mezi 10 nejvýše hodnocenými repozitáři s přesnou frází byly všechny 10 k dubnu 2026 více než 12 měsíců bez aktualizace. To není náhoda — to je norma.

Jeden uživatel Redditu v diskuzi z listopadu 2025 po šesti měsících snažení napsal napřímo, že je to „nemožné bez placené externí aplikace na sběr dat“ nebo bez Pythonu, JS renderingu a výrazného výpočetního výkonu. Jiný uživatel v diskuzi z dubna 2026 to shrnul takto: „Facebook je jeden z nejtěžších webů na scrapování, protože agresivně blokuje automatizaci“ a browser automation je „křehká, protože Facebook neustále mění DOM.“

Potřeba tu je. Poptávka taky. Frustrace je naprosto reálná. Zbytek článku je o tom, jak se v téhle propasti zorientovat.

Co je vlastně Facebook Scraper repozitář na GitHubu?

„Facebook scraper“ na GitHubu je open-source skript — většinou v Pythonu — který programově vytahuje veřejná data z Facebook stránek, příspěvků, skupin, Marketplace nebo profilů. Ne všechny fungují stejně. Dominují tři architektury:

Scrapery s automatizací prohlížeče vs. API wrappery vs. přímé HTTP scrapery

PřístupTypický stackSilná stránkaSlabina
Automatizace prohlížečeSelenium, Playwright, PuppeteerZvládne přihlašovací brány a napodobuje chování skutečného uživatelePomalé, náročné na zdroje, snadno odhalitelné, pokud nejsou správně nakonfigurované
Wrapper nad oficiálním APIMeta Graph API / Pages APIStabilní, dokumentované, v souladu s pravidly, pokud máte oprávněníSilně omezené — většina veřejných dat z příspěvků a skupin už není dostupná
Přímý HTTP scraperrequests, parsování HTML, nedokumentované endpointyRychlý a lehký, když fungujeRozbije se pokaždé, když Facebook změní strukturu stránky nebo anti-bot opatření

kevinzg/facebook-scraper je klasický příklad přímého HTTP scrapingu: veřejné stránky vytahuje „bez API klíče“ pomocí přímých požadavků a parsování. apurvmishra99/facebook-scraper-selenium je příklad automatizace prohlížeče. minimaxir/facebook-page-post-scraper představuje starší éru Graph API, kdy šlo z oficiálních endpointů tahat příspěvky stránek a skupin, což dnes už ve větší míře neplatí.

Typická data napříč těmito repozitáři zahrnují text příspěvků, časové značky, počty reakcí a komentářů, URL obrázků, metadata stránky (kategorie, telefon, e-mail, počet sledujících), pole z Marketplace a metadata skupin nebo událostí.

V roce 2026 už nejde ani tak o preferenci jazyka. Jde o to, jaký typ selhání jste ochotni tolerovat.

Audit aktuálnosti Facebook Scraper repozitářů na GitHubu v roce 2026: Které skutečně fungují?

Prošel jsem nejznámější a nejčastěji doporučované repozitáře Facebook scraperů na GitHubu proti reálným datům pro rok 2026 — ne podle tvrzení v README, ale podle skutečných dat posledních commitů, issue front a komunitních hlášení. Tohle je ta nejdůležitější část.

Kompletní tabulka auditu aktuálnosti

RepozitářHvězdičkyPoslední pushOtevřené issuesJazyk / runtimeCo ještě umí scrapovatStav
kevinzg/facebook-scraper3,1572024-06-22438Python ^3.6Omezené veřejné příspěvky stránek, některé komentáře/obrázky, metadata stránky⚠️ Částečně rozbité / zastaralé
moda20/facebook-scraper1102024-06-1429Python ^3.6Totéž co kevinzg + pomocné metody pro Marketplace⚠️ Částečně rozbitý / zastaralý fork
minimaxir/facebook-page-post-scraper2,1282019-05-2353Éra Python 2/3, závislé na Graph APIJen historická reference❌ Opuštěné
apurvmishra99/facebook-scraper-selenium2322020-06-287Python + SeleniumAutomatizace prohlížeče pro scrapování stránek❌ Opuštěné
passivebot/facebook-marketplace-scraper3752024-04-293Python 3.x + Playwright 1.40Nabídky Marketplace přes automatizaci prohlížeče⚠️ Křehké / úzce specializované
Mhmd-Hisham/selenium_facebook_scraper372022-11-291Python + SeleniumObecné scrapování přes Selenium❌ Opuštěné
anabastos/faceteer202023-07-115JavaScriptZaměřeno na automatizaci❌ Rizikové / málo ověřené

Z tabulky je na první pohled vidět několik věcí:

  • I ten „aktivní fork“ (moda20) nebyl pushnutý od června 2024.
  • Fronta issues prozradí skutečný stav rychleji než README.
  • kevinzg i moda20 stále deklarují Python ^3.6 v souborech pyproject.toml — což naznačuje, že základní verze závislostí se dlouho neaktualizovala.

kevinzg/facebook-scraper

Nejznámější Python Facebook scraper na GitHubu. Jeho README popisuje scrapování stránek, scrapování skupin, přihlášení přes přihlašovací údaje nebo cookies a pole na úrovni příspěvku jako comments, image, images, likes, post_id, post_text, text a time.

Provozní signál je ale slabý:

  • Poslední push: 22. června 2024
  • Otevřené issues: 438 — včetně názvů jako „Example Scrape does not return any posts“
  • Správce nereagoval na nedávné problémy

Verdikt: Částečně rozbité. Pořád může posloužit pro nízkoobjemové experimenty s veřejnými stránkami a jako reference názvů polí, ale pro produkční použití spolehlivé není.

moda20/facebook-scraper (komunitní fork)

Nejviditelnější fork kevinzg, doplněný o další volby a pomocné funkce zaměřené na Marketplace, například extract_listing (zdokumentované v jeho README).

Issue queue stav rozbití popisuje úplně otevřeně:

Jakmile se zjednodušené rozhraní mbasic změní nebo zmizí, celá třída scraperů se najednou rozpadne.

Verdikt: Nejvýraznější fork, ale v roce 2026 už také zastaralý a křehký. Pokud trváte na řešení z GitHubu, je to první volba na zkoušku, ale na stabilitu nespoléhejte.

minimaxir/facebook-page-post-scraper

Kdysi velmi praktický nástroj pro Graph API, který uměl shromažďovat příspěvky, reakce, komentáře a metadata z veřejných stránek a otevřených skupin do CSV. Jeho README stále vysvětluje použití App ID a App Secret z Facebook aplikace.

V roce 2026 je to už historický artefakt:

  • Poslední push: 23. května 2019
  • Otevřené issues: 53 — včetně „HTTP 400 Error Bad Request“ a „No data retrieved!!“

Verdikt: Opuštěné. Těsně navázané na model oprávnění API, který Meta mezitím výrazně omezila.

Další pozoruhodné repozitáře

  • passivebot/facebook-marketplace-scraper: Užitečný pro použití na Marketplace, ale jeho issue queue obsahuje hlášky jako „login to view the content“, „CSS selectors outdated“ a „Getting blocked“. Stručná ukázka toho, co na scrapingu Marketplace selhává.
  • apurvmishra99/facebook-scraper-selenium: Má issue doslova s otázkou „Does it work with new Facebook layout?“ z září 2020. To řekne skoro všechno.
  • Mhmd-Hisham/selenium_facebook_scraper a anabastos/faceteer: Ani jeden nemá dost aktuální aktivity na to, aby vzbuzoval důvěru.

facebook_scraper_repo_audit_v1.png

Obranné mechanismy Facebooku proti scrapingu: s čím bojuje každý GitHub scraper

Většina článků k tomuto tématu nabízí vágní upozornění typu „zkontrolujte ToS“. To není moc užitečné.

Facebook má jeden z nejagresivnějších anti-scraping systémů mezi velkými platformami. Pochopit konkrétní vrstvy ochrany je rozdíl mezi funkčním scraperem a odpolednem s prázdným výstupem.

Vlastní engineeringový příspěvek Meta z února 2025 popisuje „Anti Scraping tým“, který používá statickou analýzu napříč kódem k identifikaci scrapingových vektorů, posílá výzvy k ukončení činnosti, deaktivuje účty a spoléhá na systémy omezování rychlosti. To není hypotéza — je to organizační realita.

facebook_scraper_defense_layers_v1.png

Náhodně měněná DOM struktura a názvy CSS tříd

Facebook záměrně náhodně mění HTML ID prvků, názvy tříd i strukturu stránky. Jak napsal jeden komentující na r/webscraping: „Žádný normální scraper nemůže na Facebooku fungovat. HTML se mění mezi jednotlivými obnoveními.“

Co se rozbije: XPath a CSS selektory, které fungovaly minulý týden, dnes nevrátí nic.

Protiopatření: Kde to jde, používejte selektory založené na textu nebo atributech. Lépe to zvládá i AI parsing, který čte obsah stránky místo spoléhání na striktní selektory. Údržba selektorů bude opakující se náklad.

Přihlašovací brány a správa relace

Mnoho částí Facebooku — profily, skupiny, některé nabídky Marketplace — vyžaduje přihlášení. Headless browsery jsou přesměrované nebo dostanou osekané HTML. U scraperu od passivebot pro Marketplace se v issue tabulce jako jedna z hlavních stížností objevuje právě „login to view the content“.

Co se rozbije: Anonymní požadavky obsah vynechají nebo se přesměrují.

Protiopatření: Použijte session cookies z reálné browserové relace nebo nástroje pro scraping v prohlížeči, které běží uvnitř přihlášené relace. Rotace účtů je možná, ale riziková.

Digitální fingerprinting

Engineeringový příspěvek Meta říká, že neoprávněné scrapery „se často schovávají napodobováním způsobů, jakými lidé produkt běžně používají“ — což v praxi znamená, že kvalita prohlížeče i chování relace jsou klíčové pro detekci. Komunitní diskuse z března i dubna 2026 dál doporučují anti-detect prohlížeče a konzistentní fingerprinty.

Co se rozbije: Standardní hotové nastavení Selenium nebo Puppeteer se dá snadno poznat.

Protiopatření: Používejte nástroje jako undetected-chromedriver nebo anti-detect profily prohlížeče. Realistické relace a konzistentní fingerprinty jsou důležitější než pouhé přepsání user-agenta.

Omezování rychlosti a blokování podle IP

Engineeringový příspěvek Meta výslovně mluví o rate limitingu jako o součásti obranné strategie, včetně omezení počtu followerů, aby bylo potřeba více požadavků, které pak narazí na rate control. V praxi uživatelé hlásí omezení po publikování do 10 skupin v desetisekundových intervalech.

Co se rozbije: Hromadné požadavky ze stejné IP se během několika minut zpomalí nebo zablokují. Datacentrové proxy adresy bývají blokované předem.

Protiopatření: Rotace rezidenčních proxy serverů, ne datacentrových, a rozumné tempo požadavků.

Změny GraphQL schématu

Některé scrapery spoléhají na interní GraphQL endpointy Facebooku, protože vracejí čistší strukturovaná data než syrové HTML. Meta ale pro interní GraphQL neposkytuje garanci stability, takže se tyto dotazy rozbíjejí tiše — místo chyby vrací prázdná data.

Co se rozbije: Strukturované vytěžování začne vracet nic.

Protiopatření: Přidejte validační kontroly, sledujte změny schémat a připínejte se na známé funkční dotazy. S údržbou je potřeba počítat.

Shrnutí anti-scraping obrany

Vrstva ochranyJak rozbíjí scraperPraktické protiopatření
Změny rozložení / nestabilní selektoryXPath a CSS selektory nevrací nic nebo jen část políPreferujte odolnější ukotvení, validujte proti viditelnému obsahu stránky, počítejte s údržbou
Přihlašovací brányOdhlášené požadavky obsah nevidí nebo se přesměrujíPoužívejte platné session cookies nebo nástroje s browserovou relací
FingerprintingStandardní automatizace působí umělePoužívejte skutečné prohlížeče, konzistentní kvalitu relace a anti-detect opatření
Rate limitingPrázdný výstup, blokace, zpomaleníPomalejší tempo, menší dávky, rotace rezidenčních proxy
Změny interních dotazůStrukturovaný sběr začne vracet prázdná dataPřidejte validace, počítejte s údržbou dotazů

Když repozitáře na GitHubu selžou: zvolte povolenou alternativu

Rozbitý repozitář není důvod hledat jinou cestu, jak obejít kontrolní mechanismy platformy. Nejdřív si ujasněte obchodní otázku: potřebujete analytiku na úrovni stránek, transparentnost reklamy, veřejný adresář kontaktů nebo katalog produktů? Mnohé z těchto potřeb lze pokrýt oficiálním produktem Meta, API s uděleným oprávněním nebo veřejným zdrojem mimo Meta.

Graph API používejte jen tehdy, když má aplikace i use case potřebná oprávnění; Meta research programy jen pokud na ně máte nárok; pro reklamní informace používejte Meta Ad Library. Pro průzkum leadů, cen a lokálních firem je často lepší nezávislý veřejný web, u kterého si můžete přímo vyhodnotit podmínky i dopady na soukromí.

Ukázky reálného výstupu: co skutečně dostanete

Každý konkurenční článek ukazuje úryvky kódu, ale nikdy ne skutečný výstup. Tady je, co můžete reálně očekávat od jednotlivých přístupů.

Ukázkový výstup: kevinzg/facebook-scraper (nebo aktivní fork)

Podle ukázky v README vrátí scraped veřejný příspěvek JSON například takto:

{
  "comments": 459,
  "comments_full": null,
  "image": "https://...",
  "images": ["https://..."],
  "likes": 3509,
  "post_id": "2257188721032235",
  "post_text": "Don't let this diminutive version...",
  "text": "Don't let this diminutive version...",
  "time": "2019-04-30T05:00:01"
}

Všimněte si polí s hodnotou null, například comments_full. V roce 2026 čekejte, že více polí bude prázdných nebo úplně chybějících — to je obvykle známka blokace, ne neškodná chyba. Výstup je syrové JSON a vyžaduje další zpracování.

Ukázkový výstup: Facebook Graph API

Současné Pages API od Meta dokumentuje požadavky na informace o stránce jako GET /<PAGE_ID>?fields=id,name,about,fan_count. Referenční stránka Page obsahuje pole jako followers_count, fan_count, category, emails, phone a další veřejná metadata — ale jen při správných oprávněních, například Page Public Content Access nebo Page Public Metadata Access.

To je výrazně užší datový rozsah, než většina uživatelů scraperů z GitHubu čeká. Je to přístup orientovaný na stránky, podmíněný oprávněními a není to náhrada za libovolné scrapování veřejných příspěvků nebo skupin.

Matice typů Facebook dat × přístupová cesta

Typ Facebook datNejvhodnější výchozí bodHlavní omezení
Aktiva, která vaše organizace spravujeOficiální nástroje Meta pro správu a schválená APIOprávnění a dostupná pole se liší
Reklamní pozorováníMeta Ad LibraryPoužívejte jen pole a filtry, které nabízí
Veřejné firemní informace potřebné pro research leadůPovolený adresář nebo vydavatelský web mimo MetaOvěřte si podmínky a povinnosti týkající se soukromí
Soukromý, uzavřený, přihlášením chráněný nebo pouze účtový obsahSběr neautomatizujteHledejte autorizovanou cestu

Krok za krokem: jak nastavit Facebook scraper z GitHubu, když to dává smysl

Pokud jste přečetli audit aktuálnosti a přesto chcete jít cestou GitHubu, budiž. Tady je praktický postup — i s upřímnými poznámkami o tom, kde to selhává.

facebook_scraper_setup_flow_v1.png

Krok 1: Vyberte správný repozitář (použijte audit aktuálnosti)

Vraťte se k tabulce auditu. Vyberte nejméně zastaralý repozitář, který odpovídá cílové oblasti. Než cokoliv nainstalujete, zkontrolujte záložku Issues — názvy posledních problémů vám řeknou o aktuální funkčnosti víc než README.

Krok 2: Nastavte Python prostředí

python3 -m venv fb-scraper-env
source fb-scraper-env/bin/activate
pip install -r requirements.txt

Častý problém: konflikty verzí závislostí, hlavně u Selenium/Playwright. Kevinzg i moda20 deklarují Python ^3.6 v pyproject.toml — starší základ, který může kolidovat s novějšími knihovnami. Marketplace scraper od passivebot připíná playwright==1.40.0, což je v pohodě na experimentování, ale nedává to důkaz dlouhodobé odolnosti.

Krok 3: Nastavte proxy a anti-detection

Pokud děláte něco víc než jen rychlý test:

  • Nastavte rotaci rezidenčních proxy (hledajte poskytovatele s IP pooly vhodnými pro Facebook)
  • Pokud používáte automatizaci prohlížeče, nainstalujte undetected-chromedriver nebo nastavte anti-fingerprinting
  • Tento krok nevynechávejte — standardní Selenium nebo Puppeteer bývá označené velmi rychle

Krok 4: Spusťte malý test a ověřte výstup

Začněte jednou veřejnou stránkou, ne velkým dávkovým zpracováním. Výstup pečlivě zkontrolujte:

  • Prázdná pole nebo chybějící data většinou znamenají, že vás blokují obranné mechanismy Facebooku
  • Výstup porovnejte s tím, co opravdu vidíte v prohlížeči
  • Úspěšný test na jedné stránce je důležitější než hezké README

Krok 5: Počítejte s chybami, limity a údržbou

  • Zapracujte retry logiku a ošetření chyb
  • Počítejte s tím, že budete muset selektory nebo konfiguraci pravidelně upravovat — je to průběžná údržba, ne „nastav a zapomeň“
  • Pokud trávíte víc času údržbou scraperu než prací s daty, je to signál, že byste měli zvážit no-code cestu

Právní a etické aspekty scrapování Facebooku

Mohou se uplatnit podmínky platformy, pravidla ochrany soukromí, smluvní závazky i zákony na ochranu dat. Veřejná dostupnost neznamená automatické oprávnění k automatizovanému sběru. Minimalizujte množství dat, dokumentujte účel a právní základ a u komerčních nebo rozsáhlých projektů si vyžádejte právní radu.

Nepovažujte browser extension, přihlášenou relaci ani označení „veřejné“ za povolení k automatizovanému sběru dat z produktů Meta.

Hlavní závěry: co v roce 2026 pro Facebook scraping skutečně funguje

Aktivita repozitáře, fronta issues a aktuální pravidla platformy jsou důležitější než počet hvězdiček nebo staré README. Když obchodní otázka souvisí s aktivem, které spravujete, začněte u oficiálních nástrojů Meta a schválených API. Pro průzkum trhu, lead research a cenové otázky bývá často jednodušší dokumentovat a spravovat povolený zdroj mimo Meta.

Často kladené otázky

Existuje v roce 2026 funkční Facebook scraper na GitHubu?

Ano, ale možností je málo. Nejvýraznější je fork moda20/facebook-scraper z původního repozitáře kevinzg — aktuální stav najdete v tabulce auditu aktuálnosti výše. Umí částečně scrapovat veřejné příspěvky stránek a některá metadata, ale issue queue ukazuje zásadní problémy s mbasic a prázdným výstupem. Většina ostatních repozitářů je opuštěná nebo úplně rozbitá.

Dá se Facebook scrapovat bez programování?

Pro ruční průzkum použijte vlastní vyhledávání a administrační nástroje Facebooku. Pro opakovatelnou nebo programovou práci zvažte oficiální API a jeho oprávnění, případně přestavte workflow kolem povoleného zdroje mimo Meta. No-code pohodlí neodstraňuje povinnosti vůči platformě, soukromí ani smluvním podmínkám.

Je scrapování Facebooku legální?

Podmínky služby Facebooku zakazují automatizovaný sběr dat bez povolení. Meta to aktivně vymáhá blokací účtů, výzvami k ukončení činnosti a soudními spory. Legalita se liší podle jurisdikce a konkrétního použití. Držte se veřejně dostupných firemních dat, vyhýbejte se osobním profilům a při větším rozsahu se poraďte s právníkem.

Jaká data lze v roce 2026 ještě získat přes Facebook Graph API?

V roce 2026 je Graph API výrazně omezené. S odpovídajícími oprávněními, například Page Public Metadata Access, lze získat jen omezená data na úrovni stránek — například id, name, about, fan_count, emails, phone. Většina veřejných dat z příspěvků, data ze skupin (Groups API je zastaralé) i data na úrovni uživatelů už přes API dostupná není.

Jak často se Facebook scraper repozitáře na GitHubu rozbíjejí?

Velmi často. Facebook průběžně mění DOM strukturu, anti-bot opatření i interní API — přesná frekvence není veřejná, ale komunitní hlášení ukazují rozbití každých pár týdnů u aktivních scraperů. Issue queue forků moda20 kolem zmizení mbasic je čerstvý příklad. Pokud spoléháte na GitHub repozitář, počítejte s pravidelnou údržbou a validací výstupu.

Další informace

Ke
Ke
CTO ve Thunderbit | Senior Data Scientist a expert na ML S téměř desetiletou zkušeností v oblasti strojového učení a datové vědy je Ke Shen absolventem Kolumbijské univerzity a bývalým Senior Data Scientist ve Walmart Labs. Díky hlubokým odborným znalostem v Pythonu, R, Javě a statistice, uznávaným i mezi kolegy, sdílí ověřené poznatky o tom, jak převést složité AI algoritmy od teorie až k produkční architektuře.
Obsah
Thunderbit · AI agent pro webová data

Extrahuj data z libovolné stránky za 1 kliknutí

Důvěřuje mu více než 250 000 uživatelů
k dispozici bezplatný plán
Z webové stránky do tabulky
Popiš, co potřebuješ — AI agent Thunderbit to nasbírá a exportuje do Excelu, Google Sheets, Airtable nebo Notion. Začni zdarma.
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week