Seguridad de datos en la implementación de IA: qué se puede compartir con los modelos y qué no
La pregunta más común de los gerentes: ¿a dónde irán nuestros datos? Analizamos las opciones de ubicación de datos, qué se puede compartir con modelos externos y cómo prevenir filtraciones.
En resumen, si no tienes tiempo para leerlo entero
- ✓Primero, clasifique los datos: qué es público, qué es interno, qué es personal o un secreto comercial.
- ✓Las API comerciales de los principales proveedores y el chat público están sujetos a diferentes condiciones de uso de datos.
- ✓Los datos más sensibles se pueden procesar con modelos locales, sin salir de su propio entorno.
- ✓Los derechos de acceso, la anonimización y los registros de acciones son más importantes que la elección de un modelo específico.
«¿Y adónde irán nuestros datos?» Esta pregunta la oímos en cada primera reunión. Y con razón. Porque lo peor que se puede hacer es copiar un contrato con un cliente en un chatbot público «solo para que haga un resumen corto».
Vamos a ver cómo se hace esto bien.
1. Empieza por clasificar los datos
No todos los datos son iguales. Antes de automatizar nada, ordénalos por categorías:
- Públicos: catálogo, precios en la web, artículos abiertos. Aquí casi no hay riesgos.
- Internos: normativas, instrucciones, correspondencia. Si se filtran, es desagradable, pero no una catástrofe.
- Datos personales: nombres, teléfonos, direcciones de clientes y empleados. Aquí se aplica la ley y hay que tratarlos en consecuencia.
- Secreto comercial: precios para clientes clave, informes financieros, condiciones contractuales. Es la categoría más sensible.
Para cada categoría, sus propias reglas. Y esas reglas hay que dejarlas fijadas antes de empezar, no después.
2. Tres opciones de despliegue
API en la nube de grandes proveedores. Los modelos más potentes, con la mínima infraestructura. Hay un matiz importante: las condiciones de uso de datos en las API para empresas y en un chat público gratuito no son las mismas. Antes de enviar nada sensible, hay que leer con atención las condiciones del proveedor concreto y elegir el plan adecuado.
Modelos locales en vuestro servidor. Los datos no salen en absoluto de vuestro perímetro. Los modelos abiertos hoy en día sirven perfectamente para muchas tareas: clasificación, extracción de campos, búsqueda en documentos. Se paga con hardware y mantenimiento.
Híbrido. En muchos casos, la opción más sensata. Lo sensible se procesa en local o se anonimiza, y las tareas más complejas con datos no sensibles van a un modelo en la nube más potente.
3. Reglas prácticas que sí funcionan
- Anonimización. Antes de enviar un texto a un modelo externo, sustituye nombres, teléfonos y números de cuenta por etiquetas. El modelo recibirá el contexto, no los datos personales.
- Permisos de acceso. El asistente corporativo solo muestra al empleado los documentos a los que ya tiene acceso.
- RAG en lugar de reentrenamiento. Vuestros documentos están en vuestra propia base, y el modelo recibe solo el fragmento necesario para una respuesta concreta. Más detalles, en el artículo qué es RAG.
- Registro de acciones. Cada solicitud, respuesta y llamada a herramienta queda registrada. Si algo sale mal, se ve qué pasó exactamente y cuándo.
- Claves solo en el servidor. Las claves de API nunca llegan al navegador ni a la aplicación móvil.
- NDA. Antes de entrar a fondo en vuestras bases, firmamos un acuerdo de confidencialidad y probamos con datos sintéticos o anonimizados.
4. Lo que no hay que hacer bajo ningún concepto
- No copiar documentos sensibles en chats públicos gratuitos.
- No dar a un agente de IA permisos más amplios de los que realmente necesita para la tarea.
- No conectar el modelo directamente a la base de producción sin una capa intermedia de comprobaciones.
La seguridad no es una opción aparte que se añade al final. Se incorpora a la arquitectura desde el primer día. Revisaremos vuestros datos y elegiremos la opción de despliegue adecuada durante la auditoría de procesos de negocio. Y si quieres entender cómo se organiza todo esto en una base de conocimiento corporativa, léelo en la página Base de conocimiento corporativa y RAG.
- RGPD y la legislación nacional aplicable en materia de protección de datos personales
- Políticas de uso de datos en las API comerciales de los principales proveedores de modelos de lenguaje
Base de conocimiento corporativo y RAG
¿Te quedan dudas sobre el tema del artículo?
Veamos cómo encajan estos enfoques en los procesos de tu empresa.