핵심만 먼저 말하자면: GDPR은 Web scraping 자체를 금지하는 게 아닙니다. 다만 scraper가 식별 가능한 개인에 관한 정보를 수집, 저장, 정리, 재사용한다면, 그건 personal data 처리에 해당합니다. “공개돼 있었으니 괜찮다”는 GDPR compliance의 근거가 되지 않습니다.
이 구분은 지금 특히 더 놓치면 안 됩니다. 2026년 7월, 유럽데이터보호위원회(EDPB)는 personal data 처리가 포함된 scraping에는 GDPR이 적용된다고 분명히 밝혔고, 목적 제한과 투명성을 핵심 쟁점으로 짚었습니다. Web scraping 관련 새 가이드라인은 아직 공개 의견수렴 중이지만, 방향은 아주 명확합니다. 즉, 페이지를 기술적으로 긁어왔다는 이유만으로 compliance 검토가 끝나는 건 아닙니다. EDPB update
이 가이드는 법률 자문이 아니라, 현업에서 바로 쓰는 운영 프레임워크입니다. product나 engineering 판단을 더 잘하기 위한 용도로 활용하고, 실제 리스크가 있는 경우에는 반드시 privacy 담당 법률고문이나 DPO와 상의하세요.
먼저, “스크래핑할 수 있다”와 “써도 된다”를 나눠서 보자
보통 아래 세 가지 질문이 한 덩어리로 섞여버립니다.
| 질문 | 확인할 내용 |
|---|---|
| 접근 | 그 사이트에 접근해서 정보를 수집할 권한이 있는가? |
| 데이터 보호 | 개인이 식별된다면, GDPR 아래에서 처리할 수 있는가? |
| 재사용 | 보관, 가공, 판매, 학습, 공개, 연락 등에 써도 되는가? |
하나가 통과했다고 해서 나머지 둘까지 자동으로 통과하는 건 아닙니다. 페이지가 일반에 공개돼 있어도, 그 안의 내용이 personal data일 수 있습니다. 기술적으로는 crawl이 가능하더라도, GDPR, 계약, 지식재산권, 데이터베이스권, 소비자보호법, 마케팅 관련 법규 문제가 남을 수 있습니다.

즉, compliance는 나중에 privacy policy에 한 문단 덧붙이는 일이 아니라, 작업을 시작하기 전의 workflow로 봐야 합니다.
1. 먼저 GDPR 대상인지부터 판단하자
가장 먼저 확인할 건 아래 두 가지입니다.
그 데이터셋에 personal data가 들어 있는가?
personal data는 이름이나 이메일 주소만 뜻하지 않습니다. 개인과 연결되거나 연결될 가능성이 있는 정보는 모두 포함됩니다. 예를 들면 프로필 사진, 개인과 연결 가능한 username, 위치 정보, IP address, 경력, 리뷰, 또는 얼핏 무해해 보이는 항목들의 조합도 해당될 수 있습니다. EDPB definition
기업 단위 정보라면 경우에 따라 문제없을 수도 있습니다. 하지만 “business contact” record에도 개인사업자의 실명, 직원의 직통 이메일, 휴대폰 번호, 연결된 프로필이 들어가면 바로 personal data가 될 수 있습니다. 이상적인 데이터셋이 아니라, 실제로 수집할 데이터셋을 기준으로 설계하세요.
그 조직과 목적에 GDPR이 적용되는가?
GDPR은 EU 내 거점과 관련된 처리에 적용될 수 있습니다. 또 EU 밖 조직이라도 EU 사람들에게 상품이나 서비스를 제공하거나, 그들의 행동을 감시하고 있다면 적용될 수 있습니다. European Commission overview
이 두 질문에 모두 “예”라면, scraping에는 문서화된 GDPR 대응 경로가 필요하다고 보세요. 판단이 애매하다면, 불확실성을 “해도 된다”는 신호로 해석하지 말고 반드시 escalation 하세요.
2. 크롤러를 돌리기 전에, 1페이지짜리 수집 메모를 만들자
가장 단순하면서도 효과가 큰 통제는, 수집 전에 무엇이 필요한지 명확히 적는 것입니다.
이 메모에는 다음 항목이 들어가야 합니다.
- 목적: 그 데이터로 어떤 구체적인 판단, 서비스, 분석을 할 것인가?
- 대상자와 항목: 어떤 사람이 대상이며, 어떤 필드가 정말 필요한가?
- 정보원과 접근: 내용이 자유롭게 공개돼 있는가? 이용약관, robots 제어, 로그인 장벽, 기타 기술적 제한은 있는가?
- 활용처와 수신자: 결과를 누가 보는가? 데이터를 보강, 외부 출력, 공유, direct marketing, model training에 쓰는가?
- 보관 기간: raw data, 작업 파일, 파생 레코드는 언제 삭제하거나 재검토할 것인가?
- 책임 분담: controller는 누구이고, processor는 누구이며, 권리 요청은 누가 처리하는가?
이건 단순한 행정절차가 아닙니다. GDPR 원칙에는 목적을 분명히 하고, 필요 최소한의 적절하고 관련성 있는 데이터만 다뤄야 한다는 요구가 들어 있습니다. European Commission principles

3. 법적 근거를 정하고 기록하자. 대충 넘기지 말자
personal data를 처리하려면 반드시 lawful basis가 필요합니다. 용도에 따라 consent가 맞을 때도 있지만, 공개 Web data에 대한 기본 해답은 아닙니다. 민간 조직의 경우, 제한된 범위에서 적절한 보호조치를 갖춘 scraping이라면 legitimate interests가 적법 근거가 될 수 있습니다. 다만 자동으로 성립하는 건 아닙니다.
legitimate interests가 인정될 수 있는지 보려면 아래 3가지를 확인해야 합니다.
- 그 이익이 합법적이고, 구체적이며, 현실적이고 현재 진행형인가?
- 그 목적을 달성하는 데 정말 필요한 수집인가, 아니면 덜 침해적인 방법이 있는가?
- 정보주체의 이익, 권리, 합리적 기대가 우리의 이익보다 더 크지 않은가?
CNIL은 scraping으로 얻은 공개 데이터도 일반적으로 legitimate interests 관점에서 검토될 수 있다고 보면서, 개인에게 미치는 영향을 줄이는 추가 조치가 필요하다고 설명합니다. 또 포괄적 허가가 아니라 case-by-case 분석이 필요하다고 강조합니다. CNIL guidance
분석 내용, 전제, 적용한 완화 조치는 반드시 기록하세요. “프로필이 공개돼 있었다”는 balancing test의 전제일 수는 있지만, 그 자체가 평가 결과는 아닙니다.
4. data minimisation을 기술 요구사항으로 넣자
가장 compliance가 잘 되는 레코드는, 애초에 scraper가 수집하지 않은 데이터입니다.
수집 job에는 아래 guardrail을 넣으세요.
- 필드 whitelist 적용. 필요한 항목만 정의하고, 보이는 건 전부 가져오는 식으로 설계하지 않는다.
- 민감 범주 제외. 건강, 정치, 종교, 노동조합, 성생활, 생체인식 등 특별 범주는 법무가 별도 적법 경로를 설계하지 않은 이상 제외한다. 일반 텍스트에도 이런 내용을 의도치 않게 드러내는 경우가 있습니다.
- 고위험 source 제외. support group, 건강 포럼, 아동 대상 공간처럼 재사용이 놀라움이나 피해로 이어질 수 있는 맥락은 기본적으로 제외 목록에 넣는다.
- 섞여 들어온 데이터는 즉시 삭제. 관계없는 personal data를 잘못 가져왔다면 “혹시 몰라서” 남기지 말고 분리해서 지운다.
- 출처 기록 유지. 각 데이터셋마다 원 URL, 수집 시각, 관련 수집 설정을 보관한다. 그래야 정확성, 삭제, 권리 대응이 쉬워집니다.
CNIL도 사전에 관련 범주를 정하고, 불필요하거나 민감한 데이터를 필터링하며, 필요 없는 데이터는 삭제하고, 수집에 대한 기술적·법적 반대를 존중하라고 분명히 권고합니다. CNIL safeguards
5. transparency는 product의 일부로 보자
웹사이트에서 가져온 데이터는 보통 간접 수집입니다. 즉, GDPR 제14조의 transparency 의무가 적용될 수 있습니다. 누가 처리하는지, 목적이 무엇인지, 데이터 종류와 출처, lawful basis, 보관 기간, 수신자, 이전, 그리고 정보주체의 권리를 설명해야 합니다.
유럽위원회 개요에 따르면, 다른 출처에서 얻은 경우에는 원칙적으로 1개월 이내, 첫 연락 시점, 또는 첫 공개 시점 중 해당되는 시점에 정보를 제공해야 합니다. 통지가 불가능하거나 과도한 노력이 드는 경우 같은 예외도 있지만, 조건이 붙습니다. 추정으로 처리하지 말고, 반드시 평가하고 문서화하세요. European Commission obligations
대규모 수집이라면, 눈에 잘 띄는 공개 안내문, 데이터셋 페이지, 전용 문의 창구, 이의 제기·열람·정정·삭제 절차를 쉽게 찾을 수 있게 하는 편이 숨겨진 법무 페이지보다 실효성이 높을 수 있습니다. 어떤 방식이 맞는지는 처리 내용과 리스크에 따라 달라집니다.
6. 요청 대응과 삭제 workflow를 공개 전에 만들어 두자
대규모 scraping에서는 나중에 정리하려고 하면 비용이 확 올라갑니다. 데이터에 식별자를 붙이고, source에서 record까지 이어지는 대응표를 관리하며, raw database, export, index, downstream processing까지 포함해서 personal data를 찾고, 삭제하고, 억제할 수 있게 해두세요.
적어도 아래는 정해 두어야 합니다.
- 어떤 담당이 권리 요청을 접수하고 검증하는가
- 불필요한 추가 정보를 요구하지 않고 레코드를 어떻게 찾는가
- 삭제나 이의 제기를 downstream system에 어떻게 반영하는가
- 재수집을 막는 suppression 처리를 어떻게 구현하는가
- 로그와 backup을 얼마나 오래 보관하며, 예외는 무엇인가
그 데이터셋이 model, enrichment graph, profiling, direct marketing에 쓰인다면 이 계획은 더 엄격해야 합니다. 데이터가 더 멀리 갈수록, 권리를 의미 있게 지키기는 더 어려워집니다.

7. 데이터셋을 보호하고, 고위험 건은 일찍 평가하자
GDPR은 risk-based control을 요구합니다. 여기에는 불법 접근, 분실, 파괴, 불법 처리로부터의 보호도 포함됩니다. privacy by design/default는 사고가 난 뒤가 아니라, 처음부터 그런 통제를 고르는 것입니다. European Commission obligations
기본적인 보호조치로는 role-based access control, 전송 중/저장 시 encryption, secrets 관리, audit log, vendor 검토, data export 통제, 그리고 실제로 검증된 incident response 절차가 있습니다. pseudonymization은 위험을 낮추지만 anonymization과 같지는 않고, 보통 GDPR 의무를 그것만으로 없애주진 않습니다.
다음 요소가 섞이면 특히 고위험 처리로 보고 DPIA를 사전에 검토해야 합니다.
- 대규모 수집 또는 모니터링
- profiling이나 사람에게 영향을 주는 의사결정
- 특별 범주 또는 극도로 개인적인 데이터
- 아동 등 취약한 사람들
- 여러 데이터셋을 결합해 새로운 추론을 만드는 경우
- 지속적 식별, 위치정보, data broker식 재사용
- AI training, 또는 개인 데이터를 기억하거나 노출할 수 있는 model
유럽위원회는 체계적이고 대규모인 자동 평가, 대규모 민감 데이터 처리, 대규모 체계적 감시를 DPIA가 필요한 사례로 들고 있습니다. DPIA guidance
Web scraping 팀을 위한 공개 전 체크리스트
본격적인 job을 돌리기 전에 아래를 전부 확인하세요.
- 그 수집에 personal data가 들어 있는지, GDPR이 적용되는지 이해했다
- 목적을 명확히 문서화했고, 필요한 필드 whitelist가 있다
- lawful basis를 문서화했으며, 해당 시 legitimate interests 평가도 있다
- 민감한 source와 고위험 source/category를 기본적으로 제외한다
- source 제한을 확인했고, 접근 통제를 우회하지 않는다
- 투명한 공개 설명과 권리 요청·이의 제기용 실질적 창구가 있다
- controller/processor 역할을 파악했고, 적절한 vendor 조항이 있다
- 보관 기간, 삭제, suppression, downstream 반영 절차가 있다
- 리스크에 맞는 security 조치와 incident 책임자가 정해져 있다
- DPIA와 국외 이전 평가를 수행했거나, 불필요하다는 이유를 의도적으로 문서화했다
실무 결론
Web scraper의 GDPR 대응은 robots.txt 어딘가에서 마법 같은 문장을 찾는 일이 아니고, product에 면책 문구를 붙이는 일도 아닙니다. 명확한 목적에 맞게 수집 범위를 적절히 줄이고, 사람에게 의미 있는 가시성과 통제를 제공하며, 나중에 자신의 판단을 증명할 수 있게 하는 것입니다.
작게 시작하세요. 덜 수집하세요. source와 timestamp를 남기세요. data model에 삭제를 넣으세요. 민감한 용도, 대규모 용도, profiling, AI training은 데이터가 downstream으로 흘러가기 전에 반드시 escalation 하세요. 이런 습관이 scraper의 신뢰도를 높이고, 첫 privacy 질문이 들어왔을 때 운영도 훨씬 편하게 만들어 줍니다.
이 글은 일반 정보 제공을 위한 것이며, 법률 자문이 아닙니다. 조직의 상황, 관할권, 데이터 범주, 예상 용도에 맞게 반드시 전문가의 조언을 받으세요.
더 알아보기


