10 de febrero de 2026

Derechos de propiedad intelectual sobre datos de entrenamiento de IA

Análisis legal de la titularidad, protección y licenciamiento de datos utilizados para entrenar modelos de inteligencia artificial. Implicaciones del AI Act y la Directiva de Copyright.

Propiedad Intelectual

¿A quién pertenecen los datos que entrenan la IA?

La propiedad intelectual de los datos de entrenamiento es uno de los debates legales más relevantes del ecosistema de IA. Para startups y empresas que desarrollan modelos de machine learning, la cuestión no es abstracta: determina qué pueden hacer con sus modelos, cómo pueden comercializarlos, y qué riesgos legales asumen.

Europa ha tomado una posición clara con dos instrumentos regulatorios complementarios:

Directiva de Copyright (2019/790), Artículo 4. Establece una excepción obligatoria de text and data mining (TDM) para cualquier persona con acceso legal al contenido, siempre que el titular de derechos no haya reservado expresamente sus derechos. Esto significa que puedes extraer datos de fuentes públicas para entrenar modelos, salvo que el propietario haya optado por excluir el uso (opt-out).

AI Act, obligaciones GPAI. Los proveedores de modelos de propósito general deben implementar una política de cumplimiento de derechos de autor y publicar un resumen suficientemente detallado del contenido utilizado para el entrenamiento. Esta obligación de transparencia es nueva y específica del AI Act.

No todos los datos de entrenamiento tienen el mismo estatus legal:

Datos creados internamente. Si tu empresa genera los datos (anotaciones, etiquetado, datos sintéticos), la titularidad es clara: pertenecen a la empresa, protegidos como base de datos y potencialmente por derechos de autor sobre la selección y disposición.

Datos públicos con copyright. Textos, imágenes, código, música — la mayoría del contenido online tiene derechos de autor. La excepción de TDM permite su uso para entrenamiento en Europa, pero con condiciones: acceso legal y respeto al opt-out del titular.

Datos personales. El GDPR se aplica independientemente del uso para entrenamiento de IA. Necesitas una base legal (consentimiento, interés legítimo) y debes cumplir con principios de minimización, proporcionalidad y derechos del interesado.

Datos de terceros bajo licencia. Los datasets comerciales tienen términos de licencia específicos que pueden limitar su uso para entrenamiento de IA. Es esencial revisar cada licencia.

Riesgos legales concretos para startups de IA

  1. Infracción de copyright por web scraping. Si tu modelo se entrenó con datos de internet y un titular de derechos demuestra que reservó sus derechos (opt-out), podrías enfrentar reclamaciones por infracción. Varios litigios están en curso en jurisdicciones europeas.

  2. Incumplimiento GDPR. Entrenar modelos con datos personales sin base legal adecuada puede resultar en sanciones. El caso de ChatGPT e Italia ilustra la sensibilidad de las autoridades europeas.

  3. Violación de secretos empresariales. Si utilizas datasets que contienen información confidencial de terceros (incluso inadvertidamente), podrías enfrentar reclamaciones bajo la Directiva de Secretos Empresariales.

  4. Obligaciones de transparencia AI Act. No publicar el resumen de contenido de entrenamiento o no implementar una política de copyright puede resultar en sanciones bajo el AI Act para proveedores GPAI.

Estrategia práctica de protección de datos de entrenamiento

Para tus propios datos:

  • Documenta la creación y el proceso de recopilación
  • Registra bases de datos significativas
  • Implementa controles de acceso
  • Incluye cláusulas de titularidad en contratos con anotadores y proveedores de datos

Para datos de terceros:

  • Audita las fuentes y licencias de todos los datasets
  • Documenta el cumplimiento de la excepción TDM
  • Implementa mecanismos de detección de opt-out
  • Mantén registros de procedencia de datos para cumplir con el AI Act

Para datos personales:

  • Realiza una evaluación de impacto en protección de datos (DPIA)
  • Establece la base legal más apropiada
  • Implementa anonimización o pseudonimización cuando sea posible
  • Documenta el cumplimiento para auditorías

El modelo entrenado: ¿derivado o creación nueva?

Una pregunta abierta es si un modelo entrenado constituye una obra derivada de los datos de entrenamiento. Si lo fuera, los titulares de los datos podrían reclamar derechos sobre el modelo. La doctrina mayoritaria en Europa tiende a considerar que el modelo no es una obra derivada si no reproduce directamente los datos, pero la jurisprudencia está evolucionando.

Para startups, la recomendación práctica es clara: documenta tu proceso de entrenamiento, asegura la legalidad de las fuentes, y mantén registros que demuestren cumplimiento. En A2 ayudamos a empresas de IA a estructurar su estrategia de datos de entrenamiento con seguridad jurídica. Consulta con nuestro equipo.

Contáctanos