Los datos del cliente y la IA: guía rápida de privacidad
Las herramientas de IA de consumo no fueron creadas para resguardar información sensible de los clientes. Escribir los datos de un cliente en una de ellas, o dejar que un asistente de IA abra y lea el expediente de un cliente, no es lo mismo que tomar una nota privada. Es un acto de intercambio de datos, y para un cliente inmigrante o refugiado las consecuencias pueden ser graves y, a veces, imposibles de deshacer. Esta guía profundiza en el módulo del taller sobre qué no ingresar nunca en una herramienta de IA. Imprímala, téngala cerca de su escritorio, y use la lista de verificación antes de abrir un chatbot.
Los clientes inmigrantes y refugiados ya sopesan si el contacto es seguro
Esa cautela no es paranoia; está documentada. Friedman y Venkataramani (2021) cruzaron datos de encuestas nacionales con la actividad de Inmigración y Control de Aduanas (ICE) y encontraron que los adultos hispanos tenían menos probabilidades de reportar un proveedor habitual o un chequeo anual después de que la actividad de ICE aumentara en su estado, mientras que los adultos no hispanos no mostraron ese cambio. Young y colegas (2023) encontraron que, entre inmigrantes latinos y asiáticos en California, cada encuentro directo adicional con el sistema de control migratorio aumentaba las probabilidades de retrasar la atención (razón de momios de 1.30, IC del 95% de 1.10 a 1.50). Herring y Barnow (2025) estimaron que el programa Comunidades Seguras (Secure Communities) fue seguido de una disminución del 16.9 por ciento en las visitas a proveedores entre inmigrantes hispanos mayores presentes legalmente, un grupo que no está personalmente en riesgo de deportación; ese patrón señala al miedo y al efecto de contagio como el motor, no la expulsión directa.
La lección para el uso de la IA es directa. El estatus migratorio de un cliente, su número A, o el detalle de un caso no son información de contacto ordinaria. Si se filtran, son citados judicialmente (subpoena), o salen a la luz en una filtración de datos, pueden exponer al cliente o a su hogar a la aplicación de las leyes migratorias, a la denegación de alivio migratorio, o a un daño en su país de origen, y esos resultados no siempre se pueden revertir. Trate cada dato de un cliente que ingresa en una herramienta externa como si cargara ese peso.
Escribirlo es enviarlo
Cuando usted escribe texto en un chatbot, pega un documento, o deja que un asistente de IA abra y lea el expediente de un cliente, ese contenido sale de su computadora y viaja al centro de datos del proveedor, donde se procesa en sus servidores. Esto es así ya sea que usted mismo lo escriba o que un asistente lea el archivo por usted: hacer que la herramienta lea un archivo es en sí mismo una transferencia del contenido de ese archivo a la empresa. No es una nota privada. Es un acto de intercambio de datos con una empresa que usted no controla.
A continuación pueden ocurrir dos cosas distintas, y vale la pena separarlas. "Almacenado" significa que el proveedor conserva una copia de lo que usted ingresó durante un período de retención, durante el cual sus sistemas pueden leerlo, su personal o contratistas pueden revisarlo bajo ciertos términos, puede quedar expuesto en una filtración de datos, o puede presentarse en respuesta a una citación judicial (subpoena). "Usado para entrenar" significa que lo que usted ingresó se usa para mejorar el propio modelo, de modo que pasa a formar parte de lo que el modelo aprende. Una herramienta puede prometer que no entrena con sus datos y aun así almacenarlos, así que usted necesita saber ambas respuestas, no solo una.
Los modelos pueden memorizar y repetir sus datos de entrenamiento
Esto no es hipotético. Carlini y colegas (2021) demostraron que se puede hacer que un modelo de lenguaje emita fragmentos textuales de sus datos de entrenamiento, y entre lo que extrajeron de GPT-2 había detalles personales identificables reales, incluidos nombres, números de teléfono y direcciones de correo electrónico. Carlini y colegas (2023) demostraron luego que esta memorización aumenta con el tamaño del modelo, con cuántas veces se duplicó un fragmento de texto en el entrenamiento, y con cuánto contexto circundante aporta un atacante.
La conclusión para los profesionales es que la información que se introduce en una herramienta que entrena con las entradas no solo es vista por el proveedor ahora; más adelante puede salir a la luz frente a otra persona. Ese es el riesgo de extracción, y es una razón por la que vale la pena exigir, antes de usar una herramienta para algo sensible, una cláusula escrita de no entrenamiento.
El cifrado la protege de personas externas, no del proveedor
Las herramientas confiables cifran los datos en tránsito, de modo que no se pueden leer mientras cruzan la red, y en reposo, de modo que los archivos almacenados no se pueden leer si roban un disco. El cifrado (encryption) protege contra personas externas. No la protege a usted del proveedor, porque el proveedor descifra el contenido para poder procesarlo. El cifrado no es confidencialidad frente a la empresa que resguarda los datos.
La mayoría de las herramientas de IA a las que se accede por un navegador o una aplicación son herramientas en la nube (cloud): los datos salen de su control y van a un tercero. Un modelo local o en el dispositivo (on-device) funciona en su propia máquina y no envía el contenido hacia afuera, un perfil de riesgo fundamentalmente distinto y, en general, más seguro. El nivel de protección predeterminado también depende del nivel del producto. Las herramientas gratuitas de consumo son, por defecto, las más riesgosas; OpenAI declara que las conversaciones del ChatGPT de consumo se usan por defecto para entrenar sus modelos a menos que el usuario desactive el entrenamiento, mientras que sus productos Business, Enterprise, Team, Edu y la API no se usan por defecto para entrenar modelos (OpenAI, consultado en 2026). Los términos cambian y cada proveedor es distinto, así que nunca dé nada por sentado, y recuerde que la versión gratuita a la que se accede por defecto suele ser la que tiene las protecciones más débiles.
Adónde van sus datos
El camino es el mismo, ya sea que usted haya escrito el mensaje o le haya pedido a un asistente que lea un archivo.
- Usted escribe o sube un archivoUsted escribe un mensaje, pega un documento, o dirige a un asistente de IA hacia el expediente de un cliente para que lo resuma o lo lea.
- Sale de su dispositivoEl contenido viaja por internet hasta el proveedor, ya sea que usted lo haya escrito o que un asistente haya leído el archivo por usted.
- Llega al centro de datos del proveedorLos servidores del proveedor lo procesan. El personal o los contratistas pueden tener acceso a él bajo ciertos términos.
- Se almacena, y tal vez se usa para entrenarEl proveedor puede conservar una copia durante un período de retención, y por separado puede usarla para mejorar futuros modelos, a menos que el entrenamiento esté desactivado.
El cifrado (encryption) protege este trayecto de personas externas. No impide que el proveedor, en el otro extremo, lea lo que usted envió.
La lista de "lo que nunca se debe ingresar"
No ingrese nada de lo siguiente en una herramienta de IA de consumo o no aprobada, ya sea escribiéndolo o pidiéndole a la herramienta que lea un archivo que lo contenga.
Cualquiera de estos datos puede señalar a una sola persona, y combinado con cualquier otra cosa en el mensaje, la identificación se vuelve aún más precisa.
Un solo número de Seguro Social filtrado permite el robo de identidad y el fraude, que pueden perseguir a un cliente durante años.
Estos datos vinculan un mensaje directamente con un expediente de inmigración o un caso legal, y con los sistemas de control migratorio.
El estatus y su historial son exactamente los detalles de los que depende una acción de control migratorio; nunca deben quedar en el servidor de un proveedor.
Esta es información clínica protegida, y una filtración de datos o una citación judicial puede exponer la historia más privada de un cliente.
Los detalles de un caso pueden salir a relucir en un litigio o usarse contra un cliente de maneras con las que nunca estuvo de acuerdo.
Quitar el nombre no vuelve anónimo un registro
La desidentificación consiste en despojar la información hasta que ya no se pueda rastrear hasta una persona: eliminar no solo los identificadores directos, como nombres, números y direcciones, sino también los cuasi identificadores que, combinados, señalan a alguien. Reemplazar "María, fecha de nacimiento 3/12/1990, número A 087..." por "un cliente" es un comienzo, no el final.
Los límites son la parte importante. Rocher, Hendrickx y de Montjoye (2019), usando un método que se sostiene incluso cuando un conjunto de datos está incompleto, estimaron que el 99.98 por ciento de los estadounidenses podría ser reidentificado correctamente a partir de cualquier conjunto de datos usando solo 15 atributos demográficos. Conjuntos pequeños de atributos comunes bastan para señalar a alguien en particular, así que la desidentificación nunca está garantizada, y falla más rápido precisamente donde viven sus clientes: idiomas poco comunes, países de origen específicos, pueblos pequeños, y perfiles de caso poco habituales.
Los relatos en texto libre son especialmente propensos a filtrar información porque contienen detalles incidentales que ninguna lista de verificación pensaría en eliminar. La práctica segura no es desidentificar un registro real y pegarlo. En su lugar, trabaje en términos genéricos, hipotéticos o agregados, tal como haría una pregunta en una capacitación, sin vincularla a una persona real. Si usted no leería la frase en voz alta en un lugar público y concurrido con el cliente presente, no la ingrese.
¿Esto puede ingresar en esta herramienta?
Recorra estos filtros en orden. Detenerse en cualquier filtro significa detenerse.
- ¿La herramienta está en la lista aprobada de su agencia, con un acuerdo de datos firmado?Si no, deténgase. Use una herramienta aprobada o ninguna.
- ¿El contenido incluye algo de la lista de "lo que nunca se debe ingresar", incluso dentro de un archivo adjunto?Si es así, deténgase, o elimínelo y generalícelo antes de continuar.
- ¿Podrían los detalles restantes, en combinación, identificar a un cliente, familia o comunidad pequeña en particular?Si es así o no está seguro, deténgase. Suponga que los detalles de poblaciones pequeñas son identificables.
- ¿Sabe que esta herramienta no entrena con sus datos ingresados y tiene un límite de retención declarado?Si no, deténgase hasta que pueda confirmarlo.
- Si este texto exacto se hiciera público mañana, ¿podría dañar al cliente o a su hogar?Si es así o no está seguro, deténgase.
Solo si supera todos los filtros debe continuar, e incluso entonces, ingrese lo mínimo necesario.
Qué exigir antes de que su agencia adopte una herramienta
Adoptar una herramienta de IA para un trabajo cercano a la información de los clientes es una decisión organizacional, no individual.
El HHS exige un Acuerdo de Asociado Comercial (Business Associate Agreement, BAA) con cualquier proveedor que cree, reciba, mantenga o transmita información de salud protegida en su nombre; un servicio en la nube que la almacena o la procesa cuenta como tal. Para otros datos sensibles, exija el acuerdo de procesamiento de datos (data processing agreement) equivalente.
Los términos del proveedor deben establecer por escrito que sus datos ingresados no se usan para entrenar sus modelos, y alguien debe confirmar que esa configuración realmente está activada así, no que simplemente está disponible.
Sepa cuánto tiempo se conservan los datos ingresados, si usted puede solicitar su eliminación, y si existe una opción de retención cero o sin registros (no-log). Prefiera la retención más corta que pueda conseguir.
El personal individual no debería decidir herramienta por herramienta. Debe existir una lista mantenida de lo que está permitido para cada tipo de contenido, y una persona designada a quien consultar.
El cifrado en tránsito y en reposo, los controles de acceso, y los compromisos de notificación de filtraciones son necesarios, pero protegen contra personas externas y no sustituyen los términos de entrenamiento y retención anteriores.
Lista de verificación rápida
- La herramienta está en la lista aprobada de nuestra agencia para este tipo de contenido.
- Existe un acuerdo de datos firmado (BAA o su equivalente) que lo cubre.
- Los términos del proveedor dicen que los datos ingresados no se usan para entrenar, y esa configuración está confirmada.
- Los límites de retención son conocidos y lo más breves posible.
- Ningún elemento de la lista de "lo que nunca se debe ingresar" está en mi texto ni en ningún archivo que le pida a la herramienta que lea.
- Ninguna combinación de detalles pequeños podría identificar a un cliente o a un hogar.
- Estoy usando un planteamiento genérico o hipotético, no un registro real de un cliente.
- Si este texto se hiciera público mañana, ningún cliente resultaría dañado.
- Cuando no estoy seguro, me detengo y le pregunto a la persona que administra nuestras herramientas.
Fuentes
- Friedman, A. S., & Venkataramani, A. S. (2021). Chilling Effects: US Immigration Enforcement and Health Care Seeking Among Hispanic Adults. Health Affairs, 40(7), 1056–1065. doi:10.1377/hlthaff.2020.02356
- Young, M.-E. D. T., Tafolla, S., Saadi, A., Sudhinaraset, M., Chen, L., & Pourat, N. (2023). Beyond “Chilling Effects”: Latinx and Asian Immigrants’ Experiences With Enforcement and Barriers to Health Care. Medical Care, 61(5), 306–313. doi:10.1097/MLR.0000000000001839
- Herring, J., & Barnow, B. (2025). Indirect effects of immigration enforcement on health care utilization among lawfully present older Hispanics. Social Science & Medicine, 384, 118540. doi:10.1016/j.socscimed.2025.118540
- Carlini, N., Tramèr, F., Wallace, E., Jagielski, M., Herbert-Voss, A., Lee, K., Roberts, A., Brown, T., Song, D., Erlingsson, Ú., Oprea, A., & Raffel, C. (2021). Extracting Training Data from Large Language Models. 30th USENIX Security Symposium (USENIX Security 21). link
- Carlini, N., Ippolito, D., Jagielski, M., Lee, K., Tramèr, F., & Zhang, C. (2023). Quantifying Memorization Across Neural Language Models. The Eleventh International Conference on Learning Representations (ICLR 2023). link
- Rocher, L., Hendrickx, J. M., & de Montjoye, Y.-A. (2019). Estimating the success of re-identifications in incomplete datasets using generative models. Nature Communications, 10, 3069. doi:10.1038/s41467-019-10933-3
- OpenAI (2026). How your data is used to improve model performance; Enterprise privacy. OpenAI help center and enterprise privacy page (accessed 2026). link
- U.S. Department of Health and Human Services (2026). Business Associate Contracts; Guidance on HIPAA & Cloud Computing. HHS.gov (accessed 2026). link
Esta guía describe una práctica basada en los estudios enumerados arriba. Adáptela a las políticas de su agencia y a los idiomas y comunidades a quienes atiende.