Lyhyt vastaus: GDPR ei kiellä web-scrapingia. Mutta jos scraper kerää, tallentaa, jäsentää tai käyttää uudelleen tunnistettavissa olevia henkilöitä koskevia tietoja, kyse on henkilötietojen käsittelystä. “Se oli julkista” ei ole mikään vaatimustenmukaisuusstrategia.
Tämän rajan merkitys on nyt tavallistakin vaikeampi sivuuttaa. Heinäkuussa 2026 Euroopan tietosuojaneuvosto (EDPB) totesi, että GDPR soveltuu scrapingiin silloin, kun siihen sisältyy henkilötietojen käsittelyä, ja nosti keskeisiksi huolenaiheiksi käyttötarkoituksen rajoittamisen ja läpinäkyvyyden. Uudet web-scraping-ohjeet ovat yhä lausuntokierroksella, mutta suunta on selvä: tekninen sivun kerääminen on vasta vaatimustenmukaisuuskysymyksen alku. EDPB-päivitys
Tämä opas on käytännön toimintamalli, ei oikeudellista neuvontaa. Käytä sitä parempien tuote- ja kehityspäätösten tekemiseen, ja ota tietosuojajuristi tai DPO mukaan tilanteisiin, joissa riskit ovat aidosti merkittäviä.
Ensin: erottele “saako kerätä” ja “saako käyttää”
Kolme eri kysymystä menee usein helposti samaan nippuun:
| Kysymys | Mitä sillä tarkoitetaan |
|---|---|
| Pääsy | Onko sinulla oikeus päästä sivustolle ja kerätä aineistoa? |
| Tietosuoja | Jos henkilö on tunnistettavissa, voitko käsitellä tietoja GDPR:n nojalla? |
| Uudelleenkäyttö | Saako tietoja säilyttää, rikastaa, myydä, käyttää mallin kouluttamiseen, julkaista tai käyttää yhteydenottoihin? |
Yhden kohdan läpäisy ei tarkoita, että muutkin menisivät automaattisesti läpi. Sivu voi olla julkisesti nähtävissä, vaikka sen sisältämät tiedot olisivat silti henkilötietoja. Tekninen crawl voi onnistua täydellisesti ja silti aiheuttaa GDPR-, sopimus-, immateriaalioikeus-, tietokantaoikeus-, kuluttajansuoja- tai markkinointilainsäädännön ongelmia.

Siksi vaatimustenmukaisuus kannattaa rakentaa prosessiksi jo ennen työn aloittamista — ei lisätä jälkikäteen tietosuojakäytännön loppuun yhtenä kappaleena.
1. Päätä, kuuluuko asia GDPR:n piiriin
Aloita kahdesta kysymyksestä.
Sisältääkö aineisto henkilötietoja?
Henkilötieto on paljon laajempi käsite kuin nimi tai sähköpostiosoite. Se kattaa tiedot, jotka liittyvät tunnistettuun tai tunnistettavissa olevaan henkilöön, kuten profiilikuvan, käyttäjänimen, joka voidaan yhdistää henkilöön, sijainnin, IP-osoitteen, ammatillisen taustan, arvostelut tai useiden näennäisesti tavallisten kenttien yhdistelmän. EDPB:n määritelmä
Yritystason data voi joissain tapauksissa olla harmitonta. Mutta “yrityskontakti”-tietue voi muuttua henkilötiedoksi nopeasti, jos se sisältää nimetyn toiminimen, työntekijän suoran sähköpostiosoitteen, matkapuhelinnumeron tai linkitetyn profiilin. Suunnittele realistisen aineiston, älä idealisoidun version, mukaan.
Soveltuuko GDPR organisaatioosi ja käyttötarkoitukseesi?
GDPR voi soveltua, jos käsittely liittyy EU:ssa sijaitsevaan toimipaikkaan. Se voi soveltua myös EU:n ulkopuoliseen organisaatioon, jos se tarjoaa tavaroita tai palveluja EU:ssa oleville henkilöille tai seuraa heidän käyttäytymistään. Euroopan komission yleiskatsaus
Jos molempiin kysymyksiin vastaus on kyllä, lähtökohta on, että scraping tarvitsee dokumentoidun GDPR-polun. Jos vastaus on epäselvä, älä tulkitse epävarmuutta vihreäksi valoksi — vie asia eteenpäin.
2. Kirjoita yhden sivun keruukuvaus ennen kuin crawler käynnistyy
Yksinkertaisin kontrolli on usein myös tärkein: määritä, mitä tarvitset, ennen kuin mitään kerätään.
Kuvauksessa tulisi vastata ainakin näihin:
- Tarkoitus: Mikä konkreettinen päätös, palvelu tai analyysi tarvitsee tätä dataa?
- Henkilöt ja kentät: Mitä henkilöryhmiä aineistossa voi esiintyä, ja mitkä tarkat kentät ovat välttämättömiä?
- Lähde ja pääsy: Onko sisältö vapaasti saatavilla? Vastustaako lähde käyttöä ehdoilla, robots-säännöillä, kirjautumisen takana olevalla sisällöllä tai muilla teknisillä rajoituksilla?
- Käyttö ja vastaanottajat: Kuka näkee tulokset? Rikastetaanko, viedäänkö, jaetaanko, käytetäänkö suoramarkkinointiin tai mallin koulutukseen?
- Säilytys: Milloin raakadatan, työaineistojen ja johdettujen tietueiden tiedot poistetaan tai arvioidaan uudelleen?
- Omistajuus: Kuka on rekisterinpitäjä, kuka käsittelijä ja kuka hoitaa rekisteröityjen pyynnöt?
Tämä ei ole byrokratiaa byrokratian vuoksi. GDPR-periaatteet edellyttävät määriteltyä käyttötarkoitusta sekä tietoja, jotka ovat asianmukaisia, olennaisia ja rajoitettuja siihen, mikä on tarpeen. Euroopan komission periaatteet

3. Valitse ja dokumentoi lainmukainen käsittelyperuste — älä oleta sitä
Jokaiselle henkilötietojen käsittelylle tarvitaan lainmukainen peruste. Suostumus voi sopia joihinkin tuotteisiin, mutta se ei ole oletusratkaisu julkiselle verkkodatalle. Joissakin yksityisissä organisaatioissa oikeutettu etu voi olla mahdollinen peruste rajatulle scrapingille, jos suojatoimet ovat aidot. Se ei kuitenkaan ole automaattinen.
Puolustettava oikeutettujen etujen arviointi kysyy kolme asiaa:
- Onko etu laillinen, täsmällinen, todellinen ja ajankohtainen?
- Onko keruu välttämätöntä tätä tarkoitusta varten, vai onko olemassa vähemmän puuttuva tapa saavuttaa sama tavoite?
- Painavatko henkilön edut, oikeudet tai kohtuulliset odotukset sinun etuasi enemmän?
CNIL:n mukaan julkisesti saatavilla oleva scrapingilla kerätty data tarkastellaan yleensä oikeutettujen etujen näkökulmasta, mutta se edellyttää lisätoimia henkilöihin kohdistuvan vaikutuksen vähentämiseksi. Se korostaa myös tapauskohtaista arviointia eikä mitään yleistä lupaa. CNIL:n ohjeistus
Dokumentoi arviointi, sen oletukset ja valitsemasi lieventävät toimet. “Profiili oli julkinen” on taustatietoa punnintaan — ei itse testi.
4. Tee minimoinnista tekninen vaatimus
Paras vaatimustenmukainen tietue on usein se, jota scraper ei koskaan kerännyt.
Rakenna keruutehtävään seuraavat suojakaiteet:
- Salli vain tarvitut kentät. Määritä kentät, joita todella tarvitset; älä kerää kaikkia näkyviä kenttiä vain siksi, että se on helppoa.
- Estä arkaluonteiset kategoriat. Sulje pois terveyttä, poliittisia mielipiteitä, uskonnollista vakaumusta, ammattiliittojäsenyyttä, seksuaalielämää, biometrisiä tietoja ja muita erityisiä tietoryhmiä koskevat signaalit, ellei juristi ole suunnitellut niille erillistä lainmukaista polkua. Tavallinenkin teksti voi paljastaa tällaisia tietoja yllättäen.
- Sulje pois korkean riskin lähteet. Pidä oletusarvoinen poissulku-lista tukiryhmille, terveysfoorumeille, lasten tiloille ja muille konteksteille, joissa uudelleenkäyttö voisi olla yllättävää tai haitallista.
- Poista ylimääräinen data nopeasti. Jos talteen tarttuu irrelevanttia henkilötietoa, eristä ja poista se sen sijaan, että säilyttäisit sen hiljaisesti “varmuuden vuoksi”.
- Tallenna alkuperä. Säilytä kunkin aineiston yhteydessä lähde-URL, keräyspäivä ja olennaiset keruuasetukset. Se tukee oikeellisuutta, poistamista ja rekisteröityjen pyyntöjen käsittelyä.
CNIL suosittelee nimenomaisesti päättämään olennaiset kategoriat etukäteen, suodattamaan tarpeettomat tai arkaluonteiset tiedot, poistamaan epäolennaiset tiedot ja kunnioittamaan teknistä tai laillista vastustusta keruulle. CNIL:n suojatoimet
5. Käsittele läpinäkyvyyttä osana tuotetta
Verkkosivulta kerätty tieto on yleensä kerätty epäsuorasti. Tämä tarkoittaa, että GDPR:n 14 artiklan läpinäkyvyysvelvoitteet voivat olla relevantteja: kerro kuka olet, mihin tarkoitukseen dataa käytetään, mitä tietoryhmiä ja mistä lähteestä data on peräisin, mikä on lainmukainen peruste, säilytysajat, vastaanottajat, siirrot sekä rekisteröityjen oikeudet.
Euroopan komission yhteenvedon mukaan, jos tieto saadaan muusta lähteestä, informointi on yleensä annettava kuukauden kuluessa, ensimmäisen yhteydenoton yhteydessä tai ensimmäisen luovutuksen yhteydessä — sen mukaan, mikä soveltuu. Poikkeuksia on, mukaan lukien tapaukset, joissa ilmoittaminen on mahdotonta tai vaatisi suhteettoman paljon työtä, mutta ne ovat ehdollisia ja ne pitäisi arvioida ja dokumentoida oletuksen sijaan. Euroopan komission velvoitteet
Laajoissa keräyksissä selkeä julkinen ilmoitus, aineistosivu, oma yhteydenottokanava sekä helposti löydettävät ohjeet vastustamiseen, tarkastusoikeuteen, oikaisuun ja poistoon voivat olla merkityksellisempiä kuin piilotettu lakisivu. Sopiva muoto riippuu käsittelystä ja riskistä.
6. Rakenna poisto- ja oikeuspyyntöprosessi ennen julkaisua
Skaalassa tapahtuva scraping tekee myöhemmästä siivoamisesta kallista. Anna datalle tunniste, pidä hallittu lähde–tietue-kartta ja varmista, että pystyt paikantamaan ja poistamaan tai rajoittamaan henkilön tiedot raakakeruusta, tietokannoista, vienneistä, indekseistä ja jatkokäsittelijöiltä.
Päätä vähintään:
- kuka vastaanottaa ja vahvistaa oikeuspyynnön;
- miten tietue paikannetaan ilman tarpeettomien lisätietojen kysymistä;
- miten poisto tai vastustus välitetään jatkokehitysjärjestelmiin;
- miten estetään vahingossa tapahtuva uudelleenkeryäminen;
- kuinka kauan lokit ja varmuuskopiot säilyttävät tietueen ja mikä poikkeusprosessi tähän liittyy.
Jos aineisto syötetään malliin, rikastusgraafiin, profilointiin tai suoramarkkinointiin, tee suunnitelmasta vielä tiukempi. Mitä pidemmälle data kulkee, sitä vaikeampaa oikeuksien tosiasiallinen toteuttaminen on.

7. Suojaa aineisto ja arvioi korkean riskin tapaukset ajoissa
GDPR edellyttää riskin tasoon suhteutettuja toimenpiteitä, mukaan lukien suoja luvattomalta pääsyltä, häviämiseltä, tuhoutumiselta ja lainvastaiselta käsittelyltä. Sisäänrakennettu ja oletusarvoinen tietosuoja tarkoittaa, että nämä kontrollit valitaan alussa, ei vasta tietomurron jälkeen. Euroopan komission velvoitteet
Hyödyllisiä peruskontrolleja ovat roolipohjainen käyttöoikeuksien hallinta, salaus siirrossa ja levossa, salaisuuksien hallinta, audit-lokit, toimittaja-arviointi, datan vientirajoitukset sekä testattu häiriötilaprosessi. Pseudonymisointi voi pienentää riskiä, mutta se ei ole sama asia kuin anonymisointi, eikä se yleensä poista GDPR-velvoitteita itsessään.
DPIA:ta eli tietosuojaa koskevaa vaikutustenarviointia tulee harkita ennen käsittelyä, joka todennäköisesti aiheuttaa korkean riskin, erityisesti jos yhdistät useita seuraavista tekijöistä:
- laajamittainen keruu tai seuranta;
- profilointi tai päätökset, jotka vaikuttavat ihmisiin;
- erityiset tietoryhmät tai hyvin henkilökohtaiset tiedot;
- lapset tai muut haavoittuvat henkilöt;
- aineistojen yhdistäminen uusien johtopäätösten tekemiseksi;
- pysyvä tunnistaminen, sijaintitiedot tai datavälittäjätyyppinen uudelleenkäyttö;
- AI-mallin koulutus tai malli, joka voi tallentaa tai paljastaa henkilötietoja.
Komissio nimeää DPIA:ta edellyttäviksi tapauksiksi muun muassa järjestelmällisen ja laajan automaattisen arvioinnin, laajamittaisen arkaluonteisten tietojen käsittelyn sekä laajamittaisen järjestelmällisen seurannan. DPIA-ohjeistus
Web-scraping-tiimien julkaisukelpoinen tarkistuslista
Ennen tuotantoon viemistä varmista kaikki seuraavat:
- Tiedämme, sisältääkö keruu henkilötietoja ja miksi GDPR soveltuu tai ei sovellu.
- Meillä on tarkka kirjallinen käyttötarkoitus ja sallittujen kenttien lista.
- Olemme dokumentoineet lainmukaisen perusteen ja tarvittaessa oikeutettujen etujen arvioinnin.
- Olemme oletuksena sulkeneet pois arkaluonteiset ja korkean riskin lähteet tai kategoriat.
- Olemme arvioineet lähderajoitukset emmekä kierrä pääsynhallintaa.
- Meillä on läpinäkyvä julkinen selitys sekä toimiva reitti oikeuspyynnöille ja vastustamiselle.
- Tiedämme rekisterinpitäjän ja käsittelijän roolit ja meillä on asianmukaiset toimittajaehdot.
- Meillä on säilytys-, poisto-, rajoitus- ja jatkolevitysprosessit.
- Meillä on suhteutetut tietoturvakontrollit ja selkeä vastuutus häiriötilanteisiin.
- Olemme tehneet DPIA:n ja rajat ylittävien siirtojen arvioinnin, tai dokumentoineet perustellusti, miksi niitä ei tarvita.
Käytännön johtopäätös
Web-scrapereiden GDPR-vaatimustenmukaisuus ei ole taikasanan löytämistä robots-tiedostosta tai vastuuvapautuslausekkeen liimaamista tuotteeseen. Kyse on siitä, että keruu suhteutetaan selkeästi määriteltyyn tarkoitukseen, ihmisille annetaan oikeasti näkyvyyttä ja kontrollia, ja omat valinnat voidaan osoittaa myöhemmin.
Aloita rajatusti. Kerää vähemmän. Säilytä lähteet ja aikaleimat. Rakenna poistaminen osaksi tietomallia. Nosta esiin arkaluonteiset, laajamittaiset, profilointiin ja AI-koulutukseen liittyvät käyttötapaukset ennen kuin data virtaa eteenpäin. Tällaiset tavat tekevät scraperista luotettavamman — ja paljon helpomman hallita, kun ensimmäinen tietosuojakysymys tulee vastaan.
Tämä artikkeli tarjoaa yleistä tietoa, ei oikeudellista neuvontaa. Hanki asiantuntevaa neuvontaa oman organisaatiosi tosiseikkoihin, lainkäyttöalueisiin, tietoryhmiin ja käyttötarkoituksiin.
Lue lisää


