Vyhledávání na GitHubu pro výraz „facebook scraper“ vrátí 475 repozitářů. Jen 62 z nich ale byly aktualizované během posledních šesti měsíců.
Právě ten rozdíl mezi „je to dostupné“ a „opravdu to funguje“ vystihuje situaci kolem scrapování Facebooku na GitHubu v roce 2026.
Strávil jsem hodně času procházením záložek issue v repozitářích, stížností na Redditu i skutečných výstupů těchto nástrojů. Vzorec je pořád stejný: většina nejvýše hodnocených projektů je potichu rozbitá, správci už se jim nevěnují a Facebook průběžně zpřísňuje své obranné mechanismy proti scrapingu. Vývojáři i firemní uživatelé pořád narážejí na stejné výsledky vyhledávání, instalují stejné repozitáře a končí se stejným prázdným výstupem. Tenhle článek je realitní kontrola pro rok 2026 — poctivý audit toho, které repozitáře ještě stojí za čas, co Facebook dělá pro jejich rozbíjení a kdy je lepší GitHub úplně přeskočit.
Proč lidé hledají Facebook Scraper na GitHubu
Důvody jsou už roky stejné — i když samotné nástroje postupně přestávají fungovat:
- Generování leadů: získávání kontaktních údajů z firemních stránek (e-maily, telefonní čísla, adresy) pro oslovení
- Monitoring marketplace: sledování produktových nabídek, cen a informací o prodejcích pro ecommerce nebo arbitráž
- Průzkum skupin: archivace příspěvků a komentářů pro průzkum trhu, OSINT nebo správu komunity
- Archivace obsahu a příspěvků: ukládání veřejných příspěvků stránek, reakcí, obrázků a časových značek
- Agregace událostí: sběr názvů akcí, dat, míst a organizátorů
Přitažlivost GitHubu je zřejmá: viditelný kód, nulové náklady, komunitní údržba (alespoň teoreticky) a plná kontrola nad poli i datovým tokem.
Problém je v tom, že hvězdičky a fork žádným způsobem nezaručují, že projekt je dnes funkční. Mezi 10 nejvýše hodnocenými repozitáři s přesnou frází byly všechny 10 k dubnu 2026 více než 12 měsíců bez aktualizace. To není náhoda — to je norma.
Jeden uživatel Redditu v diskuzi z listopadu 2025 po šesti měsících snažení napsal napřímo, že je to „nemožné bez placené externí aplikace na sběr dat“ nebo bez Pythonu, JS renderingu a výrazného výpočetního výkonu. Jiný uživatel v diskuzi z dubna 2026 to shrnul takto: „Facebook je jeden z nejtěžších webů na scrapování, protože agresivně blokuje automatizaci“ a browser automation je „křehká, protože Facebook neustále mění DOM.“
Potřeba tu je. Poptávka taky. Frustrace je naprosto reálná. Zbytek článku je o tom, jak se v téhle propasti zorientovat.
Co je vlastně Facebook Scraper repozitář na GitHubu?
„Facebook scraper“ na GitHubu je open-source skript — většinou v Pythonu — který programově vytahuje veřejná data z Facebook stránek, příspěvků, skupin, Marketplace nebo profilů. Ne všechny fungují stejně. Dominují tři architektury:
Scrapery s automatizací prohlížeče vs. API wrappery vs. přímé HTTP scrapery
| Přístup | Typický stack | Silná stránka | Slabina |
|---|---|---|---|
| Automatizace prohlížeče | Selenium, Playwright, Puppeteer | Zvládne přihlašovací brány a napodobuje chování skutečného uživatele | Pomalé, náročné na zdroje, snadno odhalitelné, pokud nejsou správně nakonfigurované |
| Wrapper nad oficiálním API | Meta Graph API / Pages API | Stabilní, dokumentované, v souladu s pravidly, pokud máte oprávnění | Silně omezené — většina veřejných dat z příspěvků a skupin už není dostupná |
| Přímý HTTP scraper | requests, parsování HTML, nedokumentované endpointy | Rychlý a lehký, když funguje | Rozbije se pokaždé, když Facebook změní strukturu stránky nebo anti-bot opatření |
kevinzg/facebook-scraper je klasický příklad přímého HTTP scrapingu: veřejné stránky vytahuje „bez API klíče“ pomocí přímých požadavků a parsování. apurvmishra99/facebook-scraper-selenium je příklad automatizace prohlížeče. minimaxir/facebook-page-post-scraper představuje starší éru Graph API, kdy šlo z oficiálních endpointů tahat příspěvky stránek a skupin, což dnes už ve větší míře neplatí.
Typická data napříč těmito repozitáři zahrnují text příspěvků, časové značky, počty reakcí a komentářů, URL obrázků, metadata stránky (kategorie, telefon, e-mail, počet sledujících), pole z Marketplace a metadata skupin nebo událostí.
V roce 2026 už nejde ani tak o preferenci jazyka. Jde o to, jaký typ selhání jste ochotni tolerovat.
Audit aktuálnosti Facebook Scraper repozitářů na GitHubu v roce 2026: Které skutečně fungují?
Prošel jsem nejznámější a nejčastěji doporučované repozitáře Facebook scraperů na GitHubu proti reálným datům pro rok 2026 — ne podle tvrzení v README, ale podle skutečných dat posledních commitů, issue front a komunitních hlášení. Tohle je ta nejdůležitější část.
Kompletní tabulka auditu aktuálnosti
| Repozitář | Hvězdičky | Poslední push | Otevřené issues | Jazyk / runtime | Co ještě umí scrapovat | Stav |
|---|---|---|---|---|---|---|
| kevinzg/facebook-scraper | 3,157 | 2024-06-22 | 438 | Python ^3.6 | Omezené veřejné příspěvky stránek, některé komentáře/obrázky, metadata stránky | ⚠️ Částečně rozbité / zastaralé |
| moda20/facebook-scraper | 110 | 2024-06-14 | 29 | Python ^3.6 | Totéž co kevinzg + pomocné metody pro Marketplace | ⚠️ Částečně rozbitý / zastaralý fork |
| minimaxir/facebook-page-post-scraper | 2,128 | 2019-05-23 | 53 | Éra Python 2/3, závislé na Graph API | Jen historická reference | ❌ Opuštěné |
| apurvmishra99/facebook-scraper-selenium | 232 | 2020-06-28 | 7 | Python + Selenium | Automatizace prohlížeče pro scrapování stránek | ❌ Opuštěné |
| passivebot/facebook-marketplace-scraper | 375 | 2024-04-29 | 3 | Python 3.x + Playwright 1.40 | Nabídky Marketplace přes automatizaci prohlížeče | ⚠️ Křehké / úzce specializované |
| Mhmd-Hisham/selenium_facebook_scraper | 37 | 2022-11-29 | 1 | Python + Selenium | Obecné scrapování přes Selenium | ❌ Opuštěné |
| anabastos/faceteer | 20 | 2023-07-11 | 5 | JavaScript | Zaměřeno na automatizaci | ❌ Rizikové / málo ověřené |
Z tabulky je na první pohled vidět několik věcí:
- I ten „aktivní fork“ (moda20) nebyl pushnutý od června 2024.
- Fronta issues prozradí skutečný stav rychleji než README.
- kevinzg i moda20 stále deklarují Python ^3.6 v souborech pyproject.toml — což naznačuje, že základní verze závislostí se dlouho neaktualizovala.
kevinzg/facebook-scraper
Nejznámější Python Facebook scraper na GitHubu. Jeho README popisuje scrapování stránek, scrapování skupin, přihlášení přes přihlašovací údaje nebo cookies a pole na úrovni příspěvku jako comments, image, images, likes, post_id, post_text, text a time.
Provozní signál je ale slabý:
- Poslední push: 22. června 2024
- Otevřené issues: 438 — včetně názvů jako „Example Scrape does not return any posts“
- Správce nereagoval na nedávné problémy
Verdikt: Částečně rozbité. Pořád může posloužit pro nízkoobjemové experimenty s veřejnými stránkami a jako reference názvů polí, ale pro produkční použití spolehlivé není.
moda20/facebook-scraper (komunitní fork)
Nejviditelnější fork kevinzg, doplněný o další volby a pomocné funkce zaměřené na Marketplace, například extract_listing (zdokumentované v jeho README).
Issue queue stav rozbití popisuje úplně otevřeně:
- „mbasic je pryč“
- „CLI ‚Couldn't get any posts.‘“
- „https://mbasic.facebook.com už nefunguje“
Jakmile se zjednodušené rozhraní mbasic změní nebo zmizí, celá třída scraperů se najednou rozpadne.
Verdikt: Nejvýraznější fork, ale v roce 2026 už také zastaralý a křehký. Pokud trváte na řešení z GitHubu, je to první volba na zkoušku, ale na stabilitu nespoléhejte.
minimaxir/facebook-page-post-scraper
Kdysi velmi praktický nástroj pro Graph API, který uměl shromažďovat příspěvky, reakce, komentáře a metadata z veřejných stránek a otevřených skupin do CSV. Jeho README stále vysvětluje použití App ID a App Secret z Facebook aplikace.
V roce 2026 je to už historický artefakt:
- Poslední push: 23. května 2019
- Otevřené issues: 53 — včetně „HTTP 400 Error Bad Request“ a „No data retrieved!!“
Verdikt: Opuštěné. Těsně navázané na model oprávnění API, který Meta mezitím výrazně omezila.
Další pozoruhodné repozitáře
- passivebot/facebook-marketplace-scraper: Užitečný pro použití na Marketplace, ale jeho issue queue obsahuje hlášky jako „login to view the content“, „CSS selectors outdated“ a „Getting blocked“. Stručná ukázka toho, co na scrapingu Marketplace selhává.
- apurvmishra99/facebook-scraper-selenium: Má issue doslova s otázkou „Does it work with new Facebook layout?“ z září 2020. To řekne skoro všechno.
- Mhmd-Hisham/selenium_facebook_scraper a anabastos/faceteer: Ani jeden nemá dost aktuální aktivity na to, aby vzbuzoval důvěru.

Obranné mechanismy Facebooku proti scrapingu: s čím bojuje každý GitHub scraper
Většina článků k tomuto tématu nabízí vágní upozornění typu „zkontrolujte ToS“. To není moc užitečné.
Facebook má jeden z nejagresivnějších anti-scraping systémů mezi velkými platformami. Pochopit konkrétní vrstvy ochrany je rozdíl mezi funkčním scraperem a odpolednem s prázdným výstupem.
Vlastní engineeringový příspěvek Meta z února 2025 popisuje „Anti Scraping tým“, který používá statickou analýzu napříč kódem k identifikaci scrapingových vektorů, posílá výzvy k ukončení činnosti, deaktivuje účty a spoléhá na systémy omezování rychlosti. To není hypotéza — je to organizační realita.

Náhodně měněná DOM struktura a názvy CSS tříd
Facebook záměrně náhodně mění HTML ID prvků, názvy tříd i strukturu stránky. Jak napsal jeden komentující na r/webscraping: „Žádný normální scraper nemůže na Facebooku fungovat. HTML se mění mezi jednotlivými obnoveními.“
Co se rozbije: XPath a CSS selektory, které fungovaly minulý týden, dnes nevrátí nic.
Protiopatření: Kde to jde, používejte selektory založené na textu nebo atributech. Lépe to zvládá i AI parsing, který čte obsah stránky místo spoléhání na striktní selektory. Údržba selektorů bude opakující se náklad.
Přihlašovací brány a správa relace
Mnoho částí Facebooku — profily, skupiny, některé nabídky Marketplace — vyžaduje přihlášení. Headless browsery jsou přesměrované nebo dostanou osekané HTML. U scraperu od passivebot pro Marketplace se v issue tabulce jako jedna z hlavních stížností objevuje právě „login to view the content“.
Co se rozbije: Anonymní požadavky obsah vynechají nebo se přesměrují.
Protiopatření: Použijte session cookies z reálné browserové relace nebo nástroje pro scraping v prohlížeči, které běží uvnitř přihlášené relace. Rotace účtů je možná, ale riziková.
Digitální fingerprinting
Engineeringový příspěvek Meta říká, že neoprávněné scrapery „se často schovávají napodobováním způsobů, jakými lidé produkt běžně používají“ — což v praxi znamená, že kvalita prohlížeče i chování relace jsou klíčové pro detekci. Komunitní diskuse z března i dubna 2026 dál doporučují anti-detect prohlížeče a konzistentní fingerprinty.
Co se rozbije: Standardní hotové nastavení Selenium nebo Puppeteer se dá snadno poznat.
Protiopatření: Používejte nástroje jako undetected-chromedriver nebo anti-detect profily prohlížeče. Realistické relace a konzistentní fingerprinty jsou důležitější než pouhé přepsání user-agenta.
Omezování rychlosti a blokování podle IP
Engineeringový příspěvek Meta výslovně mluví o rate limitingu jako o součásti obranné strategie, včetně omezení počtu followerů, aby bylo potřeba více požadavků, které pak narazí na rate control. V praxi uživatelé hlásí omezení po publikování do 10 skupin v desetisekundových intervalech.
Co se rozbije: Hromadné požadavky ze stejné IP se během několika minut zpomalí nebo zablokují. Datacentrové proxy adresy bývají blokované předem.
Protiopatření: Rotace rezidenčních proxy serverů, ne datacentrových, a rozumné tempo požadavků.
Změny GraphQL schématu
Některé scrapery spoléhají na interní GraphQL endpointy Facebooku, protože vracejí čistší strukturovaná data než syrové HTML. Meta ale pro interní GraphQL neposkytuje garanci stability, takže se tyto dotazy rozbíjejí tiše — místo chyby vrací prázdná data.
Co se rozbije: Strukturované vytěžování začne vracet nic.
Protiopatření: Přidejte validační kontroly, sledujte změny schémat a připínejte se na známé funkční dotazy. S údržbou je potřeba počítat.
Shrnutí anti-scraping obrany
| Vrstva ochrany | Jak rozbíjí scraper | Praktické protiopatření |
|---|---|---|
| Změny rozložení / nestabilní selektory | XPath a CSS selektory nevrací nic nebo jen část polí | Preferujte odolnější ukotvení, validujte proti viditelnému obsahu stránky, počítejte s údržbou |
| Přihlašovací brány | Odhlášené požadavky obsah nevidí nebo se přesměrují | Používejte platné session cookies nebo nástroje s browserovou relací |
| Fingerprinting | Standardní automatizace působí uměle | Používejte skutečné prohlížeče, konzistentní kvalitu relace a anti-detect opatření |
| Rate limiting | Prázdný výstup, blokace, zpomalení | Pomalejší tempo, menší dávky, rotace rezidenčních proxy |
| Změny interních dotazů | Strukturovaný sběr začne vracet prázdná data | Přidejte validace, počítejte s údržbou dotazů |
Když repozitáře na GitHubu selžou: zvolte povolenou alternativu
Rozbitý repozitář není důvod hledat jinou cestu, jak obejít kontrolní mechanismy platformy. Nejdřív si ujasněte obchodní otázku: potřebujete analytiku na úrovni stránek, transparentnost reklamy, veřejný adresář kontaktů nebo katalog produktů? Mnohé z těchto potřeb lze pokrýt oficiálním produktem Meta, API s uděleným oprávněním nebo veřejným zdrojem mimo Meta.
Graph API používejte jen tehdy, když má aplikace i use case potřebná oprávnění; Meta research programy jen pokud na ně máte nárok; pro reklamní informace používejte Meta Ad Library. Pro průzkum leadů, cen a lokálních firem je často lepší nezávislý veřejný web, u kterého si můžete přímo vyhodnotit podmínky i dopady na soukromí.
Ukázky reálného výstupu: co skutečně dostanete
Každý konkurenční článek ukazuje úryvky kódu, ale nikdy ne skutečný výstup. Tady je, co můžete reálně očekávat od jednotlivých přístupů.
Ukázkový výstup: kevinzg/facebook-scraper (nebo aktivní fork)
Podle ukázky v README vrátí scraped veřejný příspěvek JSON například takto:
{
"comments": 459,
"comments_full": null,
"image": "https://...",
"images": ["https://..."],
"likes": 3509,
"post_id": "2257188721032235",
"post_text": "Don't let this diminutive version...",
"text": "Don't let this diminutive version...",
"time": "2019-04-30T05:00:01"
}
Všimněte si polí s hodnotou null, například comments_full. V roce 2026 čekejte, že více polí bude prázdných nebo úplně chybějících — to je obvykle známka blokace, ne neškodná chyba. Výstup je syrové JSON a vyžaduje další zpracování.
Ukázkový výstup: Facebook Graph API
Současné Pages API od Meta dokumentuje požadavky na informace o stránce jako GET /<PAGE_ID>?fields=id,name,about,fan_count. Referenční stránka Page obsahuje pole jako followers_count, fan_count, category, emails, phone a další veřejná metadata — ale jen při správných oprávněních, například Page Public Content Access nebo Page Public Metadata Access.
To je výrazně užší datový rozsah, než většina uživatelů scraperů z GitHubu čeká. Je to přístup orientovaný na stránky, podmíněný oprávněními a není to náhrada za libovolné scrapování veřejných příspěvků nebo skupin.
Matice typů Facebook dat × přístupová cesta
| Typ Facebook dat | Nejvhodnější výchozí bod | Hlavní omezení |
|---|---|---|
| Aktiva, která vaše organizace spravuje | Oficiální nástroje Meta pro správu a schválená API | Oprávnění a dostupná pole se liší |
| Reklamní pozorování | Meta Ad Library | Používejte jen pole a filtry, které nabízí |
| Veřejné firemní informace potřebné pro research leadů | Povolený adresář nebo vydavatelský web mimo Meta | Ověřte si podmínky a povinnosti týkající se soukromí |
| Soukromý, uzavřený, přihlášením chráněný nebo pouze účtový obsah | Sběr neautomatizujte | Hledejte autorizovanou cestu |
Krok za krokem: jak nastavit Facebook scraper z GitHubu, když to dává smysl
Pokud jste přečetli audit aktuálnosti a přesto chcete jít cestou GitHubu, budiž. Tady je praktický postup — i s upřímnými poznámkami o tom, kde to selhává.

Krok 1: Vyberte správný repozitář (použijte audit aktuálnosti)
Vraťte se k tabulce auditu. Vyberte nejméně zastaralý repozitář, který odpovídá cílové oblasti. Než cokoliv nainstalujete, zkontrolujte záložku Issues — názvy posledních problémů vám řeknou o aktuální funkčnosti víc než README.
Krok 2: Nastavte Python prostředí
python3 -m venv fb-scraper-env
source fb-scraper-env/bin/activate
pip install -r requirements.txt
Častý problém: konflikty verzí závislostí, hlavně u Selenium/Playwright. Kevinzg i moda20 deklarují Python ^3.6 v pyproject.toml — starší základ, který může kolidovat s novějšími knihovnami. Marketplace scraper od passivebot připíná playwright==1.40.0, což je v pohodě na experimentování, ale nedává to důkaz dlouhodobé odolnosti.
Krok 3: Nastavte proxy a anti-detection
Pokud děláte něco víc než jen rychlý test:
- Nastavte rotaci rezidenčních proxy (hledajte poskytovatele s IP pooly vhodnými pro Facebook)
- Pokud používáte automatizaci prohlížeče, nainstalujte undetected-chromedriver nebo nastavte anti-fingerprinting
- Tento krok nevynechávejte — standardní Selenium nebo Puppeteer bývá označené velmi rychle
Krok 4: Spusťte malý test a ověřte výstup
Začněte jednou veřejnou stránkou, ne velkým dávkovým zpracováním. Výstup pečlivě zkontrolujte:
- Prázdná pole nebo chybějící data většinou znamenají, že vás blokují obranné mechanismy Facebooku
- Výstup porovnejte s tím, co opravdu vidíte v prohlížeči
- Úspěšný test na jedné stránce je důležitější než hezké README
Krok 5: Počítejte s chybami, limity a údržbou
- Zapracujte retry logiku a ošetření chyb
- Počítejte s tím, že budete muset selektory nebo konfiguraci pravidelně upravovat — je to průběžná údržba, ne „nastav a zapomeň“
- Pokud trávíte víc času údržbou scraperu než prací s daty, je to signál, že byste měli zvážit no-code cestu
Právní a etické aspekty scrapování Facebooku
Mohou se uplatnit podmínky platformy, pravidla ochrany soukromí, smluvní závazky i zákony na ochranu dat. Veřejná dostupnost neznamená automatické oprávnění k automatizovanému sběru. Minimalizujte množství dat, dokumentujte účel a právní základ a u komerčních nebo rozsáhlých projektů si vyžádejte právní radu.
Nepovažujte browser extension, přihlášenou relaci ani označení „veřejné“ za povolení k automatizovanému sběru dat z produktů Meta.
Hlavní závěry: co v roce 2026 pro Facebook scraping skutečně funguje
Aktivita repozitáře, fronta issues a aktuální pravidla platformy jsou důležitější než počet hvězdiček nebo staré README. Když obchodní otázka souvisí s aktivem, které spravujete, začněte u oficiálních nástrojů Meta a schválených API. Pro průzkum trhu, lead research a cenové otázky bývá často jednodušší dokumentovat a spravovat povolený zdroj mimo Meta.
Často kladené otázky
Existuje v roce 2026 funkční Facebook scraper na GitHubu?
Ano, ale možností je málo. Nejvýraznější je fork moda20/facebook-scraper z původního repozitáře kevinzg — aktuální stav najdete v tabulce auditu aktuálnosti výše. Umí částečně scrapovat veřejné příspěvky stránek a některá metadata, ale issue queue ukazuje zásadní problémy s mbasic a prázdným výstupem. Většina ostatních repozitářů je opuštěná nebo úplně rozbitá.
Dá se Facebook scrapovat bez programování?
Pro ruční průzkum použijte vlastní vyhledávání a administrační nástroje Facebooku. Pro opakovatelnou nebo programovou práci zvažte oficiální API a jeho oprávnění, případně přestavte workflow kolem povoleného zdroje mimo Meta. No-code pohodlí neodstraňuje povinnosti vůči platformě, soukromí ani smluvním podmínkám.
Je scrapování Facebooku legální?
Podmínky služby Facebooku zakazují automatizovaný sběr dat bez povolení. Meta to aktivně vymáhá blokací účtů, výzvami k ukončení činnosti a soudními spory. Legalita se liší podle jurisdikce a konkrétního použití. Držte se veřejně dostupných firemních dat, vyhýbejte se osobním profilům a při větším rozsahu se poraďte s právníkem.
Jaká data lze v roce 2026 ještě získat přes Facebook Graph API?
V roce 2026 je Graph API výrazně omezené. S odpovídajícími oprávněními, například Page Public Metadata Access, lze získat jen omezená data na úrovni stránek — například id, name, about, fan_count, emails, phone. Většina veřejných dat z příspěvků, data ze skupin (Groups API je zastaralé) i data na úrovni uživatelů už přes API dostupná není.
Jak často se Facebook scraper repozitáře na GitHubu rozbíjejí?
Velmi často. Facebook průběžně mění DOM strukturu, anti-bot opatření i interní API — přesná frekvence není veřejná, ale komunitní hlášení ukazují rozbití každých pár týdnů u aktivních scraperů. Issue queue forků moda20 kolem zmizení mbasic je čerstvý příklad. Pokud spoléháte na GitHub repozitář, počítejte s pravidelnou údržbou a validací výstupu.
Další informace


