Respuesta breve: el RGPD no prohíbe el web scraping. Pero cuando un rastreador recopila, almacena, organiza o reutiliza información sobre personas identificables, está tratando datos personales. Que “era público” no sirve como estrategia de cumplimiento.
Esa diferencia hoy cuesta más ignorarla. En julio de 2026, el Comité Europeo de Protección de Datos (EDPB) señaló que el RGPD se aplica al scraping cuando incluye operaciones de tratamiento de datos personales, y puso el foco en la limitación de la finalidad y la transparencia como puntos clave. Sus nuevas directrices sobre web scraping siguen abiertas a consulta, pero la línea está clara: el acto técnico de recoger una página es solo el comienzo de la cuestión de cumplimiento. Actualización del EDPB
Esta guía es un marco operativo práctico, no asesoramiento legal. Úsala para tomar mejores decisiones de producto e ingeniería, y luego involucra a asesoría jurídica de privacidad o a tu DPO en los casos con riesgo real.
Primero, separa “se puede rastrear” de “se puede usar”
A menudo se mezclan tres preguntas distintas:
| Pregunta | Qué plantea |
|---|---|
| Acceso | ¿Tienes autorización para entrar al sitio y recopilar el material? |
| Protección de datos | Si las personas son identificables, ¿puedes tratar esos datos conforme al RGPD? |
| Reutilización | ¿Puedes conservarlos, enriquecerlos, venderlos, entrenar modelos con ellos, publicarlos o contactar a personas usando esa información? |
Superar una de ellas no significa superar las demás. Una página puede ser visible públicamente y, aun así, contener datos personales. Un rastreo técnicamente correcto puede seguir generando problemas de RGPD, contrato, propiedad intelectual, derechos sobre bases de datos, protección del consumidor o normativa de marketing.

Por eso, trata el cumplimiento como un flujo de trabajo antes de empezar, no como un párrafo añadido después en la política de privacidad.
1. Decide si el RGPD entra en juego
Empieza con dos preguntas.
¿El conjunto de datos contiene datos personales?
Los datos personales abarcan mucho más que un nombre o un correo electrónico. Incluyen cualquier información relacionada con una persona identificada o identificable, como una foto de perfil, un nombre de usuario que pueda vincularse a alguien, ubicación, dirección IP, historial profesional, reseñas o la combinación de varios campos que por separado parecen normales. Definición del EDPB
En algunos casos, los datos a nivel de empresa pueden ser inofensivos. Pero un registro de “contacto comercial” puede convertirse rápido en dato personal si incluye a un autónomo con nombre y apellidos, el correo directo de un empleado, un número móvil o un perfil vinculado. Diseña pensando en el conjunto de datos realista, no en el idealizado.
¿El RGPD aplica a tu organización y a tu finalidad?
El RGPD puede aplicarse cuando el tratamiento está vinculado a un establecimiento en la UE. También puede aplicarse a una organización fuera de la UE si ofrece bienes o servicios a personas en la UE o supervisa su comportamiento. Resumen de la Comisión Europea
Si ambas respuestas son sí, asume que el scraping necesita una vía documentada de RGPD. Si la respuesta no está clara, no uses la duda como luz verde: escálala.
2. Redacta un brief de recopilación de una página antes de que el crawler arranque
El control más simple también suele ser el más útil: define lo que necesitas antes de recopilar.
Tu brief debería responder:
- Finalidad: ¿Qué decisión, servicio o análisis concreto necesita estos datos?
- Personas y campos: ¿Qué categorías de personas pueden aparecer y qué campos exactos hacen falta?
- Fuente y acceso: ¿El contenido está disponible libremente? ¿La fuente pone objeciones mediante términos, controles robots, muros de login u otras barreras técnicas?
- Uso y destinatarios: ¿Quién verá los resultados? ¿Los datos se enriquecerán, exportarán, compartirán, usarán para marketing directo o para entrenamiento de modelos?
- Conservación: ¿Cuándo se borrarán o revisarán los datos brutos, los archivos de trabajo y los registros derivados?
- Responsabilidad: ¿Quién es el responsable, quién es el encargado y quién gestiona las solicitudes de derechos?
Esto no es burocracia por gusto. Los principios del RGPD exigen una finalidad determinada y datos adecuados, pertinentes y limitados a lo necesario. Principios de la Comisión Europea

3. Elige y documenta una base jurídica, no la des por hecha
Toda actividad de tratamiento de datos personales necesita una base jurídica. El consentimiento puede encajar en algunos productos, pero no es la respuesta por defecto para datos públicos de la web. En algunas organizaciones privadas, los intereses legítimos pueden ser una base posible para un scraping de alcance limitado y con salvaguardas reales. No es automático.
Una evaluación defendible de intereses legítimos responde tres preguntas:
- ¿El interés es lícito, específico, real y actual?
- ¿Esta recopilación es necesaria para esa finalidad, o existe una forma menos invasiva de lograrla?
- ¿Los intereses, derechos o expectativas razonables de la persona pesan más que tu interés?
La CNIL indica que los datos públicamente disponibles recopilados mediante scraping suelen analizarse desde la óptica de los intereses legítimos, pero exige medidas adicionales para reducir el impacto en las personas. También insiste en un análisis caso por caso, no en una autorización general. Guía de la CNIL
Documenta el análisis, sus supuestos y las mitigaciones que elegiste. “El perfil era público” es contexto para la ponderación, no la ponderación en sí.
4. Haz de la minimización un requisito técnico
El mejor registro conforme suele ser aquel que tu scraper nunca llegó a recopilar.
Integra estas barreras en el trabajo de recopilación:
- Lista permitida de campos. Define los campos que necesitas; no extraigas todo lo visible solo porque sea fácil.
- Bloquea categorías sensibles. Excluye salud, política, religión, sindicatos, vida sexual, biometría y otros indicadores de categorías especiales salvo que un equipo jurídico haya diseñado una vía legal específica. Un texto ordinario puede revelar estas categorías sin querer.
- Excluye fuentes de alto riesgo. Mantén una lista de exclusión por defecto para grupos de apoyo, foros de salud, espacios infantiles y otros contextos en los que la reutilización pueda ser sorprendente o perjudicial.
- Elimina rápido lo que se cuele. Si se captura información personal irrelevante, aísla y elimínala en lugar de guardarla “por si acaso”.
- Registra la procedencia. Guarda la URL de origen, la fecha de recopilación y la configuración relevante con cada conjunto de datos. Eso facilita exactitud, borrado y atención de derechos.
La CNIL recomienda decidir de antemano las categorías relevantes, filtrar datos innecesarios o sensibles, borrar datos irrelevantes y respetar la oposición técnica o jurídica a la recopilación. Salvaguardas de la CNIL
5. Trata la transparencia como parte del producto
Los datos recogidos de un sitio web suelen obtenerse de forma indirecta. Eso significa que pueden aplicar las obligaciones de transparencia del artículo 14: explicar quién eres, la finalidad, las categorías y la fuente de los datos, la base jurídica, la conservación, los destinatarios, las transferencias y los derechos de las personas.
El resumen de la Comisión Europea indica que, cuando los datos se obtienen de otra fuente, la información debe facilitarse normalmente en el plazo de un mes, en el primer contacto o en la primera comunicación, según corresponda. Existen excepciones, incluidos los casos en que notificar sea imposible o suponga un esfuerzo desproporcionado, pero son condicionales y deben evaluarse y documentarse, no asumirse. Obligaciones de la Comisión Europea
Para recopilaciones amplias, un aviso público claro, una página del dataset, un canal de contacto dedicado y instrucciones fáciles de encontrar para oposición, acceso, rectificación y supresión pueden ser más útiles que una página legal escondida. El formato adecuado depende del tratamiento y del riesgo.
6. Construye un flujo para supresión y derechos antes del lanzamiento
El scraping a gran escala vuelve muy cara la limpieza posterior. Asigna un identificador a los datos, mantén un mapa controlado entre fuente y registro, y asegúrate de poder localizar y eliminar o bloquear los datos de una persona en capturas brutas, bases de datos, exportaciones, índices y procesadores posteriores.
Como mínimo, decide:
- quién recibe y verifica una solicitud de derechos;
- cómo localizar un registro sin pedir información extra innecesaria;
- cómo se propaga la supresión o la oposición a los sistemas posteriores;
- cómo el bloqueo evita una nueva recopilación accidental;
- cuánto tiempo conservan el registro los logs y las copias de seguridad, y qué proceso de excepción se aplica.
Si el dataset alimentará un modelo, un grafo de enriquecimiento, perfiles o marketing directo, este plan debe ser todavía más riguroso. Cuanto más lejos viajan los datos, más difícil es respetar los derechos de forma real.

7. Protege el dataset y evalúa pronto los casos de alto riesgo
El RGPD exige medidas proporcionales al riesgo, incluida la protección frente a accesos no autorizados, pérdida, destrucción y tratamiento ilícito. La privacidad desde el diseño y por defecto significa elegir esos controles desde el inicio, no después de una brecha. Obligaciones de la Comisión Europea
Entre los controles básicos útiles están el acceso por roles, el cifrado en tránsito y en reposo, la gestión de secretos, los registros de auditoría, la revisión de proveedores, los controles de exportación de datos y un proceso de incidentes probado. La seudonimización puede reducir el riesgo, pero no es lo mismo que anonimización y normalmente no elimina por sí sola las obligaciones del RGPD.
Debe considerarse una EIPD antes de cualquier tratamiento que probablemente genere alto riesgo, especialmente cuando combinas estos factores:
- recopilación o monitorización a gran escala;
- elaboración de perfiles o decisiones que afecten a personas;
- datos sensibles o muy personales;
- niños u otras personas vulnerables;
- combinación de datasets para obtener nuevas inferencias;
- identificación persistente, datos de ubicación o reutilización al estilo corredor de datos;
- entrenamiento de IA o un modelo que pueda memorizar o exponer datos personales.
La Comisión identifica la evaluación automatizada sistemática y extensa, el tratamiento a gran escala de datos sensibles y la monitorización sistemática a gran escala entre los casos que requieren una EIPD. Guía sobre EIPD
Lista de verificación para lanzar un equipo de web scraping
Antes de ejecutar un trabajo en producción, confirma todo lo siguiente:
- Sabemos si la recopilación incluye datos personales y por qué el RGPD aplica o no aplica.
- Tenemos una finalidad escrita y precisa, y una lista permitida de campos necesarios.
- Hemos documentado una base jurídica y, si corresponde, una evaluación de intereses legítimos.
- Hemos excluido por defecto las fuentes o categorías sensibles y de alto riesgo.
- Hemos evaluado las restricciones de la fuente y no eludimos controles de acceso.
- Tenemos una explicación pública transparente y un canal útil para solicitudes de derechos y oposiciones.
- Conocemos los roles de responsable/encargado y contamos con condiciones adecuadas con proveedores.
- Tenemos procedimientos de conservación, borrado, bloqueo y propagación aguas abajo.
- Contamos con controles de seguridad proporcionales y responsables de incidentes.
- Hemos realizado, o hemos documentado conscientemente por qué no hace falta, una EIPD y una evaluación de transferencias internacionales.
La conclusión práctica
El cumplimiento del RGPD para rastreadores web no consiste en encontrar una línea mágica en un archivo robots ni en pegar un aviso legal en tu producto. Consiste en hacer que la recopilación sea proporcional a una finalidad claramente definida, dar a las personas visibilidad y control reales, y poder demostrar después por qué tomaste esas decisiones.
Empieza con un alcance reducido. Recoge menos. Conserva fuentes y marcas de tiempo. Integra el borrado en el modelo de datos. Escala antes cualquier uso sensible, masivo, de perfiles o de entrenamiento de IA antes de que los datos sigan fluyendo aguas abajo. Esos hábitos hacen que un rastreador sea más fiable y mucho más fácil de operar cuando llega la primera pregunta sobre privacidad.
Este artículo ofrece información general, no asesoramiento legal. Busca orientación cualificada para los hechos, jurisdicciones, categorías de datos y el uso previsto de tu organización.
Más información
- ¿Es legal el web scraping en EE. UU.? Lo que realmente dice la ley
- Cómo empezar un tutorial de extracción de datos web usando Thunderbit
- 10 APIs de web scraping comparadas en la práctica (2026)
- Los 10 mejores navegadores proxy para la privacidad online
- Estadísticas clave sobre privacidad de datos de IA que debes conocer en 2026


