Cumplimiento del RGPD para rastreadores web: una guía práctica para 2026

Última actualización el August 6, 2026
Cumplimiento del RGPD para rastreadores web: una guía práctica para 2026
Resumen con IA
• Los datos de sitios web públicos pueden seguir siendo datos personales; las cuestiones del RGPD dependen del tratamiento y del uso previsto, no solo del acceso. • Antes de rastrear, documenta la finalidad, los campos exactos, la base jurídica, las restricciones de la fuente, la conservación y la responsabilidad. • Minimiza la recopilación, excluye por defecto las fuentes o categorías sensibles o de alto riesgo y conserva la procedencia de cada dataset. • Haz que la transparencia del artículo 14, las objeciones, el acceso, la rectificación y la supresión sean operativas antes de ejecutar en producción. • Aplica controles de seguridad proporcionales y evalúa pronto una EIPD para usos a gran escala, de perfilado, con datos sensibles o de entrenamiento de IA.

Respuesta breve: el RGPD no prohíbe el web scraping. Pero cuando un rastreador recopila, almacena, organiza o reutiliza información sobre personas identificables, está tratando datos personales. Que “era público” no sirve como estrategia de cumplimiento.

Esa diferencia hoy cuesta más ignorarla. En julio de 2026, el Comité Europeo de Protección de Datos (EDPB) señaló que el RGPD se aplica al scraping cuando incluye operaciones de tratamiento de datos personales, y puso el foco en la limitación de la finalidad y la transparencia como puntos clave. Sus nuevas directrices sobre web scraping siguen abiertas a consulta, pero la línea está clara: el acto técnico de recoger una página es solo el comienzo de la cuestión de cumplimiento. Actualización del EDPB

Esta guía es un marco operativo práctico, no asesoramiento legal. Úsala para tomar mejores decisiones de producto e ingeniería, y luego involucra a asesoría jurídica de privacidad o a tu DPO en los casos con riesgo real.

Primero, separa “se puede rastrear” de “se puede usar”

A menudo se mezclan tres preguntas distintas:

PreguntaQué plantea
Acceso¿Tienes autorización para entrar al sitio y recopilar el material?
Protección de datosSi las personas son identificables, ¿puedes tratar esos datos conforme al RGPD?
Reutilización¿Puedes conservarlos, enriquecerlos, venderlos, entrenar modelos con ellos, publicarlos o contactar a personas usando esa información?

Superar una de ellas no significa superar las demás. Una página puede ser visible públicamente y, aun así, contener datos personales. Un rastreo técnicamente correcto puede seguir generando problemas de RGPD, contrato, propiedad intelectual, derechos sobre bases de datos, protección del consumidor o normativa de marketing.

Tres puntos de control separados para acceso web, protección de datos y reutilización de datos

Por eso, trata el cumplimiento como un flujo de trabajo antes de empezar, no como un párrafo añadido después en la política de privacidad.

1. Decide si el RGPD entra en juego

Empieza con dos preguntas.

¿El conjunto de datos contiene datos personales?

Los datos personales abarcan mucho más que un nombre o un correo electrónico. Incluyen cualquier información relacionada con una persona identificada o identificable, como una foto de perfil, un nombre de usuario que pueda vincularse a alguien, ubicación, dirección IP, historial profesional, reseñas o la combinación de varios campos que por separado parecen normales. Definición del EDPB

En algunos casos, los datos a nivel de empresa pueden ser inofensivos. Pero un registro de “contacto comercial” puede convertirse rápido en dato personal si incluye a un autónomo con nombre y apellidos, el correo directo de un empleado, un número móvil o un perfil vinculado. Diseña pensando en el conjunto de datos realista, no en el idealizado.

¿El RGPD aplica a tu organización y a tu finalidad?

El RGPD puede aplicarse cuando el tratamiento está vinculado a un establecimiento en la UE. También puede aplicarse a una organización fuera de la UE si ofrece bienes o servicios a personas en la UE o supervisa su comportamiento. Resumen de la Comisión Europea

Si ambas respuestas son sí, asume que el scraping necesita una vía documentada de RGPD. Si la respuesta no está clara, no uses la duda como luz verde: escálala.

2. Redacta un brief de recopilación de una página antes de que el crawler arranque

El control más simple también suele ser el más útil: define lo que necesitas antes de recopilar.

Tu brief debería responder:

  • Finalidad: ¿Qué decisión, servicio o análisis concreto necesita estos datos?
  • Personas y campos: ¿Qué categorías de personas pueden aparecer y qué campos exactos hacen falta?
  • Fuente y acceso: ¿El contenido está disponible libremente? ¿La fuente pone objeciones mediante términos, controles robots, muros de login u otras barreras técnicas?
  • Uso y destinatarios: ¿Quién verá los resultados? ¿Los datos se enriquecerán, exportarán, compartirán, usarán para marketing directo o para entrenamiento de modelos?
  • Conservación: ¿Cuándo se borrarán o revisarán los datos brutos, los archivos de trabajo y los registros derivados?
  • Responsabilidad: ¿Quién es el responsable, quién es el encargado y quién gestiona las solicitudes de derechos?

Esto no es burocracia por gusto. Los principios del RGPD exigen una finalidad determinada y datos adecuados, pertinentes y limitados a lo necesario. Principios de la Comisión Europea

Un flujo de trabajo previo sin texto para definir la finalidad, seleccionar campos, evaluar riesgos, revisar límites de acceso y lanzar un scraper

3. Elige y documenta una base jurídica, no la des por hecha

Toda actividad de tratamiento de datos personales necesita una base jurídica. El consentimiento puede encajar en algunos productos, pero no es la respuesta por defecto para datos públicos de la web. En algunas organizaciones privadas, los intereses legítimos pueden ser una base posible para un scraping de alcance limitado y con salvaguardas reales. No es automático.

Una evaluación defendible de intereses legítimos responde tres preguntas:

  1. ¿El interés es lícito, específico, real y actual?
  2. ¿Esta recopilación es necesaria para esa finalidad, o existe una forma menos invasiva de lograrla?
  3. ¿Los intereses, derechos o expectativas razonables de la persona pesan más que tu interés?

La CNIL indica que los datos públicamente disponibles recopilados mediante scraping suelen analizarse desde la óptica de los intereses legítimos, pero exige medidas adicionales para reducir el impacto en las personas. También insiste en un análisis caso por caso, no en una autorización general. Guía de la CNIL

Documenta el análisis, sus supuestos y las mitigaciones que elegiste. “El perfil era público” es contexto para la ponderación, no la ponderación en sí.

4. Haz de la minimización un requisito técnico

El mejor registro conforme suele ser aquel que tu scraper nunca llegó a recopilar.

Integra estas barreras en el trabajo de recopilación:

  • Lista permitida de campos. Define los campos que necesitas; no extraigas todo lo visible solo porque sea fácil.
  • Bloquea categorías sensibles. Excluye salud, política, religión, sindicatos, vida sexual, biometría y otros indicadores de categorías especiales salvo que un equipo jurídico haya diseñado una vía legal específica. Un texto ordinario puede revelar estas categorías sin querer.
  • Excluye fuentes de alto riesgo. Mantén una lista de exclusión por defecto para grupos de apoyo, foros de salud, espacios infantiles y otros contextos en los que la reutilización pueda ser sorprendente o perjudicial.
  • Elimina rápido lo que se cuele. Si se captura información personal irrelevante, aísla y elimínala en lugar de guardarla “por si acaso”.
  • Registra la procedencia. Guarda la URL de origen, la fecha de recopilación y la configuración relevante con cada conjunto de datos. Eso facilita exactitud, borrado y atención de derechos.

La CNIL recomienda decidir de antemano las categorías relevantes, filtrar datos innecesarios o sensibles, borrar datos irrelevantes y respetar la oposición técnica o jurídica a la recopilación. Salvaguardas de la CNIL

5. Trata la transparencia como parte del producto

Los datos recogidos de un sitio web suelen obtenerse de forma indirecta. Eso significa que pueden aplicar las obligaciones de transparencia del artículo 14: explicar quién eres, la finalidad, las categorías y la fuente de los datos, la base jurídica, la conservación, los destinatarios, las transferencias y los derechos de las personas.

El resumen de la Comisión Europea indica que, cuando los datos se obtienen de otra fuente, la información debe facilitarse normalmente en el plazo de un mes, en el primer contacto o en la primera comunicación, según corresponda. Existen excepciones, incluidos los casos en que notificar sea imposible o suponga un esfuerzo desproporcionado, pero son condicionales y deben evaluarse y documentarse, no asumirse. Obligaciones de la Comisión Europea

Para recopilaciones amplias, un aviso público claro, una página del dataset, un canal de contacto dedicado y instrucciones fáciles de encontrar para oposición, acceso, rectificación y supresión pueden ser más útiles que una página legal escondida. El formato adecuado depende del tratamiento y del riesgo.

6. Construye un flujo para supresión y derechos antes del lanzamiento

El scraping a gran escala vuelve muy cara la limpieza posterior. Asigna un identificador a los datos, mantén un mapa controlado entre fuente y registro, y asegúrate de poder localizar y eliminar o bloquear los datos de una persona en capturas brutas, bases de datos, exportaciones, índices y procesadores posteriores.

Como mínimo, decide:

  • quién recibe y verifica una solicitud de derechos;
  • cómo localizar un registro sin pedir información extra innecesaria;
  • cómo se propaga la supresión o la oposición a los sistemas posteriores;
  • cómo el bloqueo evita una nueva recopilación accidental;
  • cuánto tiempo conservan el registro los logs y las copias de seguridad, y qué proceso de excepción se aplica.

Si el dataset alimentará un modelo, un grafo de enriquecimiento, perfiles o marketing directo, este plan debe ser todavía más riguroso. Cuanto más lejos viajan los datos, más difícil es respetar los derechos de forma real.

Un ciclo de vida circular para minimizar los datos recopilados, almacenarlos de forma segura, gestionar solicitudes de derechos y eliminarlos

7. Protege el dataset y evalúa pronto los casos de alto riesgo

El RGPD exige medidas proporcionales al riesgo, incluida la protección frente a accesos no autorizados, pérdida, destrucción y tratamiento ilícito. La privacidad desde el diseño y por defecto significa elegir esos controles desde el inicio, no después de una brecha. Obligaciones de la Comisión Europea

Entre los controles básicos útiles están el acceso por roles, el cifrado en tránsito y en reposo, la gestión de secretos, los registros de auditoría, la revisión de proveedores, los controles de exportación de datos y un proceso de incidentes probado. La seudonimización puede reducir el riesgo, pero no es lo mismo que anonimización y normalmente no elimina por sí sola las obligaciones del RGPD.

Debe considerarse una EIPD antes de cualquier tratamiento que probablemente genere alto riesgo, especialmente cuando combinas estos factores:

  • recopilación o monitorización a gran escala;
  • elaboración de perfiles o decisiones que afecten a personas;
  • datos sensibles o muy personales;
  • niños u otras personas vulnerables;
  • combinación de datasets para obtener nuevas inferencias;
  • identificación persistente, datos de ubicación o reutilización al estilo corredor de datos;
  • entrenamiento de IA o un modelo que pueda memorizar o exponer datos personales.

La Comisión identifica la evaluación automatizada sistemática y extensa, el tratamiento a gran escala de datos sensibles y la monitorización sistemática a gran escala entre los casos que requieren una EIPD. Guía sobre EIPD

Lista de verificación para lanzar un equipo de web scraping

Antes de ejecutar un trabajo en producción, confirma todo lo siguiente:

  • Sabemos si la recopilación incluye datos personales y por qué el RGPD aplica o no aplica.
  • Tenemos una finalidad escrita y precisa, y una lista permitida de campos necesarios.
  • Hemos documentado una base jurídica y, si corresponde, una evaluación de intereses legítimos.
  • Hemos excluido por defecto las fuentes o categorías sensibles y de alto riesgo.
  • Hemos evaluado las restricciones de la fuente y no eludimos controles de acceso.
  • Tenemos una explicación pública transparente y un canal útil para solicitudes de derechos y oposiciones.
  • Conocemos los roles de responsable/encargado y contamos con condiciones adecuadas con proveedores.
  • Tenemos procedimientos de conservación, borrado, bloqueo y propagación aguas abajo.
  • Contamos con controles de seguridad proporcionales y responsables de incidentes.
  • Hemos realizado, o hemos documentado conscientemente por qué no hace falta, una EIPD y una evaluación de transferencias internacionales.

La conclusión práctica

El cumplimiento del RGPD para rastreadores web no consiste en encontrar una línea mágica en un archivo robots ni en pegar un aviso legal en tu producto. Consiste en hacer que la recopilación sea proporcional a una finalidad claramente definida, dar a las personas visibilidad y control reales, y poder demostrar después por qué tomaste esas decisiones.

Empieza con un alcance reducido. Recoge menos. Conserva fuentes y marcas de tiempo. Integra el borrado en el modelo de datos. Escala antes cualquier uso sensible, masivo, de perfiles o de entrenamiento de IA antes de que los datos sigan fluyendo aguas abajo. Esos hábitos hacen que un rastreador sea más fiable y mucho más fácil de operar cuando llega la primera pregunta sobre privacidad.

Este artículo ofrece información general, no asesoramiento legal. Busca orientación cualificada para los hechos, jurisdicciones, categorías de datos y el uso previsto de tu organización.

Más información

Shuai Guan
Shuai Guan
CEO de Thunderbit | Experto en automatización de datos con IA Shuai Guan es el CEO de Thunderbit y exalumno de Ingeniería de la University of Michigan. Con casi una década de experiencia en tecnología y arquitectura SaaS, se especializa en convertir modelos de IA complejos en herramientas prácticas de extracción de datos sin código. En este blog comparte ideas directas, probadas en la práctica y sin filtros sobre web scraping y estrategias de automatización para ayudarte a crear flujos de trabajo más inteligentes y basados en datos. Cuando no está optimizando flujos de datos, aplica ese mismo ojo para el detalle a su pasión por la fotografía.
Topics
Cumplimiento del RGPDCumplimiento del web scrapingPrivacidad de datos
Tabla de contenidos
Thunderbit · AI web data agent

Extract data from any page in 1 click

Trusted by 250,000+ users
free plan available
Extrae datos usando IA
Transfiere fácilmente datos a Google Sheets, Airtable o Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week