GDPR compliance pro web scrapery: praktický průvodce pro rok 2026

Naposledy aktualizováno August 20, 2026
GDPR compliance pro web scrapery: praktický průvodce pro rok 2026
AI shrnutí
• Veřejně dostupná data mohou být stále osobními údaji; otázky GDPR se týkají zpracování a zamýšleného použití, ne jen přístupu. • Před crawlingem si zdokumentujte účel, přesná pole, právní základ, omezení zdrojů, retenci a odpovědnost. • Minimalizujte sběr, ve výchozím nastavení vylučte citlivé nebo vysoce rizikové zdroje a u každého datasetu uchovávejte původ dat. • Zpřístupněte funkční postupy pro informace podle článku 14, námitky, přístup, opravu a výmaz ještě před produkčním nasazením. • Použijte přiměřená bezpečnostní opatření a včas posuďte DPIA u rozsáhlého sběru, profilování, citlivých dat nebo tréninku AI.

Krátká odpověď: GDPR web scraping přímo nezakazuje. Jakmile ale scraper sbírá, ukládá, třídí nebo znovu používá údaje o identifikovatelných osobách, jde o zpracování osobních údajů. „Bylo to veřejně dostupné“ rozhodně není strategie soulad s GDPR.

Tenhle rozdíl je dnes obzvlášť těžké přehlédnout. V červenci 2026 Evropský sbor pro ochranu osobních údajů (EDPB) uvedl, že GDPR se na scraping vztahuje, pokud zahrnuje operace zpracování osobních údajů, a jako klíčové body zdůraznil omezení účelu a transparentnost. Nové pokyny k web scrapingu jsou pořád v konzultaci, ale směr je jasný: technický akt načtení stránky je teprve začátek otázky souladu. Aktualizace EDPB

Tenhle průvodce je praktický rámec pro rozhodování, ne právní rada. Použijte ho pro lepší produktová a engineeringová rozhodnutí a u případů s reálným rizikem zapojte privacy counsel nebo pověřence pro ochranu osobních údajů (DPO).

Nejdřív oddělte „smím scrapovat“ od „smím data použít“

Často se pletou tři různé otázky:

OtázkaNa co se ptá
PřístupMáte oprávnění na web vstoupit a materiál sbírat?
Ochrana osobních údajůPokud lze osoby identifikovat, můžete data zpracovávat podle GDPR?
ZnovupoužitíMůžete je uchovávat, obohacovat, prodávat, trénovat na nich modely, zveřejňovat je nebo přes ně lidi kontaktovat?

Splnění jedné podmínky neznamená, že máte splněné všechny ostatní. Stránka může být veřejně viditelná a přesto obsahovat osobní údaje. Technicky úspěšný crawl může zároveň otevřít otázky podle GDPR, smluvního práva, práva duševního vlastnictví, databázových práv, ochrany spotřebitele nebo marketingových pravidel.

Tři samostatné kontrolní body pro přístup na web, ochranu osobních údajů a znovupoužití dat

Proto berte compliance jako workflow ještě před spuštěním úlohy, ne jako odstavec v zásadách ochrany osobních údajů doplněný až dodatečně.

1. Nejdřív si ověřte, jestli je GDPR vůbec ve hře

Začněte dvěma otázkami.

Obsahuje dataset osobní údaje?

Osobní údaj je širší pojem než jen jméno nebo e-mail. Zahrnuje informace vztahující se k identifikované nebo identifikovatelné fyzické osobě, například profilovou fotku, uživatelské jméno, které lze propojit s konkrétním člověkem, lokalitu, IP adresu, profesní historii, recenze nebo kombinaci jinak běžných údajů. Definice EDPB

Data na úrovni firmy mohou být v některých případech neškodná. „Obchodní kontakt“ se ale velmi rychle může stát osobním údajem, pokud obsahuje jmenovaného OSVČ, přímý e-mail zaměstnance, mobilní číslo nebo propojený profil. Navrhujte podle reálného datasetu, ne podle ideálního.

Vztahuje se GDPR na vaši organizaci a účel?

GDPR se může uplatnit, pokud je zpracování propojeno se sídlem nebo provozovnou v EU. Může se vztahovat i na organizaci mimo EU, pokud nabízí zboží nebo služby lidem v EU nebo sleduje jejich chování. Přehled Evropské komise

Pokud jsou obě odpovědi ano, berte scraping jako proces, který potřebuje zdokumentovanou cestu soulad s GDPR. Pokud je odpověď nejasná, neberte nejistotu jako zelenou; eskalujte ji.

2. Než crawler poběží, sepište jednostránkový brief ke sběru dat

Nejjednodušší kontrola bývá zároveň ta nejcennější: definujte, co přesně potřebujete, ještě před sběrem.

Brief by měl odpovědět na tyto body:

  • Účel: Jaké konkrétní rozhodnutí, služba nebo analýza tato data potřebuje?
  • Lidé a pole: Jaké kategorie osob se mohou objevit a která přesná pole jsou opravdu nutná?
  • Zdroj a přístup: Je obsah volně dostupný? Nebrání tomu podmínky používání, robots omezení, přihlašovací stěna nebo jiné technické bariéry?
  • Použití a příjemci: Kdo výsledky uvidí? Budou data obohacována, exportována, sdílena, využita pro přímý marketing nebo pro trénink modelů?
  • Retence: Kdy budou smazána nebo zrevidována surová data, pracovní soubory a odvozené záznamy?
  • Odpovědnost: Kdo je správce, kdo zpracovatel a kdo řeší žádosti subjektů údajů?

Není to byrokracie pro byrokracii. Zásady GDPR vyžadují stanovený účel a data přiměřená, relevantní a omezená na nezbytný rozsah. Zásady Evropské komise

Workflow bez textu pro určení účelu, výběr polí, posouzení rizik, kontrolu přístupových hranic a spuštění scrapingu

3. Vyberte a zdokumentujte právní základ – nepředpokládejte ho

Každé zpracování osobních údajů potřebuje právní základ. Souhlas může být vhodný pro některé produkty, ale u veřejných webových dat to není výchozí odpověď. U některých soukromých organizací může být možným základem oprávněný zájem, pokud je scraping úzce vymezený a doplněný skutečnými zárukami. Není to automatické.

Obhajitelný test oprávněného zájmu se ptá na tři věci:

  1. Je zájem legální, konkrétní, skutečný a aktuální?
  2. Je tenhle sběr pro daný účel nezbytný, nebo existuje méně invazivní cesta?
  3. Nepřevažují nad vaším zájmem zájmy, práva nebo rozumná očekávání dané osoby?

CNIL uvádí, že veřejně dostupná data získaná scrapingem se obecně posuzují optikou oprávněného zájmu, ale vyžadují další opatření ke snížení dopadu na lidi. Zároveň zdůrazňuje posuzování případ od případu, ne plošné povolení. Pokyny CNIL

Analýzu, předpoklady i zvolená opatření zdokumentujte. „Profil byl veřejný“ je kontext pro balanční test, ne samotný test.

4. Minimalizaci udělejte technickým požadavkem

Nejlepší compliant záznam je často ten, který váš scraper nikdy nesebral.

Do sběrné úlohy zapracujte tato pravidla:

  • Allowlist polí. Definujte pole, která potřebujete; nescra pujte všechno viditelné jen proto, že je to snadné.
  • Blokujte citlivé kategorie. Vylučte údaje o zdraví, politice, náboženství, odborech, sexuálním životě, biometrice a další zvláštní kategorie, pokud právník nenavrhl konkrétní právní cestu. I běžný text může tyto kategorie nečekaně prozradit.
  • Vylučte rizikové zdroje. Ve výchozím nastavení nechte mimo sběr podpůrné skupiny, zdravotní fóra, prostory pro děti a další kontexty, kde by znovupoužití mohlo být překvapivé nebo škodlivé.
  • Přetečení rychle mažte. Pokud se zachytí nerelevantní osobní údaje, izolujte je a smažte, místo abyste je „pro jistotu“ tiše uchovávali.
  • Zaznamenávejte původ. U každého datasetu ukládejte zdrojovou URL, datum sběru a relevantní konfiguraci sběru. Pomáhá to s přesností, mazáním i s vyřizováním práv.

CNIL výslovně doporučuje předem určit relevantní kategorie, filtrovat nepotřebná nebo citlivá data, mazat irelevantní data a respektovat technický či právní nesouhlas se sběrem. Ochranná opatření CNIL

5. Transparentnost berte jako součást produktu

Data získaná z webu jsou obvykle získaná nepřímo. To znamená, že mohou být relevantní povinnosti podle článku 14 o transparentnosti: vysvětlete, kdo jste, za jakým účelem data zpracováváte, jaké kategorie a z jakého zdroje pocházejí, na jakém právním základě, jak dlouho je uchováváte, komu je předáváte, zda je přenášíte a jaká práva lidé mají.

Souhrn Evropské komise uvádí, že pokud jsou data získána z jiného zdroje, informace se obecně poskytují do jednoho měsíce, při prvním kontaktu nebo při prvním zpřístupnění – podle toho, co je relevantní. Existují výjimky, například když je oznámení nemožné nebo by vyžadovalo nepřiměřené úsilí, ale jsou podmíněné a měly by být posouzeny a zdokumentovány, ne jen předpokládány. Povinnosti Evropské komise

U rozsáhlých sběrů může být smysluplnější jasné veřejné oznámení, stránka datasetu, vyhrazený kontaktní kanál a snadno dohledatelné pokyny pro námitku, přístup, opravu a výmaz než skrytá právní stránka. Vhodný formát závisí na zpracování a míře rizika.

6. Workflow pro výmaz a uplatnění práv připravte před spuštěním

Scraping ve velkém měřítku dělá pozdější úklid drahým. Každému záznamu dejte identifikátor, veďte kontrolovanou mapu od zdroje k záznamu a zajistěte, že budete umět dohledat a odstranit nebo potlačit údaje osoby napříč surovými záznamy, databázemi, exporty, indexy i downstream systémy.

Minimálně si určete:

  • kdo žádost přijímá a ověřuje;
  • jak se záznam dohledá bez zbytečného vyžadování dalších údajů;
  • jak se výmaz nebo námitka propíše do navazujících systémů;
  • jak se zabrání nechtěnému opětovnému sběru;
  • jak dlouho logy a zálohy záznam uchovávají a jaký platí výjimkový postup.

Pokud dataset poslouží pro model, obohacovací graf, profilování nebo přímý marketing, plán zpřísněte. Čím dál data putují, tím obtížnější je smysluplně respektovat práva subjektů údajů.

Cirkulární životní cyklus pro minimalizaci sbíraných dat, bezpečné ukládání, žádosti o práva a výmaz

7. Zabezpečte dataset a rizikové případy posuďte včas

GDPR vyžaduje opatření přiměřená riziku, včetně ochrany před neoprávněným přístupem, ztrátou, zničením a nezákonným zpracováním. Privacy by design a by default znamená zvolit tato opatření hned na začátku, ne až po incidentu. Povinnosti Evropské komise

Mezi užitečná základní opatření patří řízení přístupu podle rolí, šifrování při přenosu i v klidu, správa tajemství, auditní logy, kontrola dodavatelů, omezení exportu dat a otestovaný incident response proces. Pseudonymizace může riziko snížit, ale není to samé co anonymizace a sama o sobě obvykle neodstraňuje povinnosti podle GDPR.

DPIA by se měla zvážit před zpracováním, které pravděpodobně vytvoří vysoké riziko, zejména pokud kombinujete tyto faktory:

  • rozsáhlý sběr nebo monitorování;
  • profilování nebo rozhodnutí, která mají dopad na lidi;
  • zvláštní kategorie nebo vysoce osobní údaje;
  • děti nebo jiné zranitelné osoby;
  • kombinování datasetů za účelem nových inferencí;
  • dlouhodobou identifikaci, údaje o poloze nebo znovupoužití ve stylu datových brokerů;
  • trénink AI nebo model, který by mohl personal data memorovat či odhalit.

Komise mezi případy vyžadujícími DPIA uvádí systematické a rozsáhlé automatizované vyhodnocování, rozsáhlé zpracování citlivých údajů a rozsáhlé systematické monitorování. Pokyny k DPIA

Kontrolní seznam pro web scraping týmy před spuštěním

Před produkčním během si ověřte vše následující:

  • Víme, jestli sběr zahrnuje osobní údaje a proč se GDPR vztahuje, nebo nevztahuje.
  • Máme přesně sepsaný účel a allowlist požadovaných polí.
  • Máme zdokumentovaný právní základ a případně i test oprávněného zájmu.
  • Ve výchozím nastavení jsme vyloučili citlivé a vysoce rizikové zdroje nebo kategorie.
  • Posoudili jsme omezení zdroje a neobcházíme přístupové kontroly.
  • Máme transparentní veřejné vysvětlení a funkční cestu pro žádosti o práva a námitky.
  • Známe role správce/zpracovatele a máme odpovídající smluvní podmínky s dodavateli.
  • Máme postupy pro retenci, výmaz, potlačení a předávání do downstream systémů.
  • Máme přiměřená bezpečnostní opatření a určenou odpovědnost za incidenty.
  • Dokončili jsme DPIA a posouzení přeshraničních přenosů, nebo jsme vědomě zdokumentovali, proč je nepotřebujeme.

Praktické shrnutí

Soulad s GDPR u web scraperů není o hledání kouzelné věty v robots.txt ani o přidání disclaimeru do produktu. Jde o to, aby byl sběr přiměřený jasně stanovenému účelu, aby lidé měli smysluplný přehled a kontrolu a aby šlo později doložit, proč jste se rozhodli právě takhle.

Začněte úzce. Sbírejte méně. Uchovávejte zdroje a časová razítka. Zaveďte výmaz přímo do datového modelu. Citlivé, velkoobjemové, profilovací a AI-trénovací použití eskalujte dřív, než data začnou proudit dál. Tyto návyky dělají scraper důvěryhodnějším — a výrazně snadnějším na provoz, až přijde první otázka na soukromí.

Tento článek poskytuje obecné informace, nikoli právní radu. Pro fakta vaší organizace, jurisdikce, kategorie dat a zamýšlené použití si vyžádejte kvalifikované poradenství.

Zjistěte více

Shuai Guan
Shuai Guan
CEO ve společnosti Thunderbit | Expert na automatizaci dat s využitím AI Shuai Guan je CEO společnosti Thunderbit a absolvent inženýrského oboru na University of Michigan. Na základě téměř deseti let zkušeností v oblasti technologií a architektury SaaS se zaměřuje na převádění složitých modelů AI do praktických nástrojů pro extrakci dat bez nutnosti programování. Na tomto blogu sdílí nezkreslené a v praxi ověřené poznatky o web scrapingu a automatizačních strategiích, které vám pomohou vytvářet chytřejší datově řízené pracovní postupy. Když zrovna neoptimalizuje datové workflow, věnuje stejný důraz na detail také své vášni pro fotografii.
Topics
Soulad s GDPRSoulad web scrapinguOchrana osobních údajů
Obsah
Thunderbit · AI agent pro webová data

Extrahuj data z libovolné stránky za 1 kliknutí

Důvěřuje mu více než 250 000 uživatelů
k dispozici bezplatný plán
Z webové stránky do tabulky
Popiš, co potřebuješ — AI agent Thunderbit to nasbírá a exportuje do Excelu, Google Sheets, Airtable nebo Notion. Začni zdarma.
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week