베타 이 사이트는 베타 버전입니다. 정보는 계속 추가하고 검토하고 있습니다.
실무자 허브
실무자 가이드 · AI 리터러시

클라이언트 데이터와 AI: 프라이버시 요약 가이드

소비자용 AI 도구는 민감한 클라이언트 정보를 담아 두도록 만들어지지 않았습니다. 클라이언트의 세부 정보를 그런 도구에 입력하거나, AI 어시스턴트가 클라이언트의 파일을 열어 읽도록 두는 것은 개인적인 메모를 남기는 것과 같지 않습니다. 그것은 데이터를 공유하는 행위이며, 이민자나 난민 클라이언트에게는 그 결과가 심각하고 때로는 되돌릴 수 없을 수도 있습니다. 이 가이드는 AI 도구에 절대 입력하면 안 되는 것을 다루는 워크숍 모듈을 더 깊이 살펴봅니다. 인쇄해서 책상 가까이에 두고, 챗봇을 열기 전에 체크리스트를 활용하십시오.

위험이 더 큰 이유

이민자와 난민 클라이언트는 이미 연락이 안전한지를 저울질하고 있습니다

이러한 조심스러움은 근거 없는 불안이 아니라 문서로 뒷받침됩니다. Friedman과 Venkataramani(2021)는 전국 설문 데이터를 이민세관집행국(ICE) 활동과 대조하여, 자신이 속한 주에서 ICE 활동이 증가한 이후 히스패닉 성인은 평소 의료진이 있다거나 연례 건강검진을 받았다고 응답할 가능성이 낮아졌지만, 비히스패닉 성인은 그런 변화를 보이지 않았다는 사실을 발견했습니다. Young과 동료들(2023)은 캘리포니아의 라틴계 및 아시아계 이민자들 사이에서, 단속 시스템과의 직접적인 접촉이 한 번 늘어날 때마다 진료를 미룰 확률이 높아진다는 것을 발견했습니다(오즈비 1.30, 95% 신뢰구간 1.10~1.50). Herring과 Barnow(2025)는 "안전한 지역사회"(Secure Communities) 프로그램 시행 이후, 추방 위험이 개인적으로는 없는 집단인 합법 체류 고령 히스패닉 이민자들 사이에서 의료진 방문이 16.9% 감소했다고 추정했습니다. 이 패턴은 직접적인 추방이 아니라 두려움과 그 파급 효과가 원인임을 보여줍니다.

AI 사용에 주는 교훈은 명확합니다. 클라이언트의 체류 신분, A 번호, 또는 사건의 세부 사항은 일반적인 연락처 정보가 아닙니다. 이런 정보가 유출되거나, 소환장(subpoena)에 의해 제출되거나, 데이터 유출 사고에서 드러나면, 클라이언트나 그 가족을 단속에 노출시키거나, 구제 신청이 거부되게 하거나, 출신국에서 해를 입게 할 수 있으며, 이런 결과는 항상 되돌릴 수 있는 것이 아닙니다. 클라이언트 정보를 외부 도구에 입력하는 모든 행위를 이런 무게를 지닌 것으로 다루십시오.

실제로 일어나는 일

입력하는 것은 곧 내보내는 것입니다

챗봇에 텍스트를 입력하거나, 문서를 붙여넣거나, AI 어시스턴트가 클라이언트 파일을 열어 읽도록 할 때, 그 내용은 당신의 컴퓨터를 떠나 업체의 데이터 센터로 이동하여 그곳 서버에서 처리됩니다. 이는 당신이 직접 입력하든, 어시스턴트가 대신 파일을 읽든 마찬가지로 사실입니다. 도구가 파일을 읽게 하는 것 자체가 그 파일 내용을 그 회사로 전송하는 행위입니다. 그것은 개인 메모가 아닙니다. 당신이 통제할 수 없는 회사와의 데이터 공유 행위입니다.

그다음에는 서로 다른 두 가지 일이 일어날 수 있으며, 이를 구분해서 볼 가치가 있습니다. "저장된다"는 것은 업체가 일정한 보관 기간 동안 당신이 입력한 내용의 사본을 보관한다는 뜻이며, 그 기간 동안 회사의 시스템이 그것을 읽을 수 있고, 직원이나 계약업체가 일정한 조건 아래 그것을 열람할 수 있으며, 데이터 유출 사고로 노출될 수 있고, 소환장에 대한 응답으로 제출될 수 있습니다. "학습에 사용된다"는 것은 당신이 입력한 내용이 모델 자체를 개선하는 데 사용되어, 모델이 학습하는 내용의 일부가 된다는 뜻입니다. 어떤 도구는 당신의 데이터로 학습하지 않겠다고 약속하면서도 여전히 그것을 저장할 수 있으므로, 둘 중 하나만이 아니라 두 가지 답을 모두 알아야 합니다.

기억(memorization)이 중요한 이유

모델은 훈련 데이터를 기억했다가 그대로 재현할 수 있습니다

이는 가설이 아닙니다. Carlini와 동료들(2021)은 언어 모델이 훈련 데이터의 일부를 그대로 토해내도록 만들 수 있음을 보여주었고, GPT-2에서 추출한 내용 중에는 이름, 전화번호, 이메일 주소 등 실제 개인 식별 정보가 포함되어 있었습니다. 이후 Carlini와 동료들(2023)은 이러한 기억화가 모델의 크기, 훈련 중 특정 텍스트 조각이 중복된 횟수, 그리고 공격자가 제공하는 주변 맥락의 양에 따라 커진다는 것을 보여주었습니다.

실무자에게 주는 시사점은, 입력을 학습에 사용하는 도구에 들어간 정보는 지금 업체에게만 보이는 것이 아니라, 나중에 다른 누군가에게 드러날 수 있다는 것입니다. 이것이 바로 추출 위험이며, 민감한 내용에 어떤 도구를 사용하기 전에 서면으로 된 학습 미사용 조항을 요구할 가치가 있는 이유이기도 합니다.

무엇이 당신을 보호하고, 무엇이 보호하지 못하는가

암호화는 외부인으로부터 당신을 보호할 뿐, 업체로부터는 보호하지 못합니다

신뢰할 수 있는 도구는 전송 중인 데이터를 암호화하여 네트워크를 통과하는 동안 읽히지 않도록 하고, 저장된 데이터도 암호화하여 디스크가 도난당하더라도 저장된 파일을 읽을 수 없게 합니다. 암호화(encryption)는 외부인으로부터 당신을 보호합니다. 그러나 업체로부터는 당신을 보호하지 못하는데, 업체는 내용을 처리하기 위해 그것을 복호화하기 때문입니다. 암호화는 데이터를 보유한 회사에 대한 기밀 보장이 아닙니다.

브라우저나 앱을 통해 접근하는 대부분의 AI 도구는 클라우드 도구입니다. 즉 데이터가 당신의 통제를 벗어나 제3자에게 전달됩니다. 로컬 또는 온디바이스(on-device) 모델은 사용자 자신의 기기에서 실행되며 내용을 외부로 보내지 않는데, 이는 근본적으로 다르고 대체로 더 안전한 위험 특성을 가집니다. 기본 설정은 제품 등급에 따라서도 달라집니다. 무료 소비자용 도구가 기본적으로 가장 위험합니다. OpenAI는 사용자가 학습 기능을 끄지 않는 한 소비자용 ChatGPT 대화 내용이 기본적으로 자사 모델 학습에 사용된다고 밝히는 반면, Business, Enterprise, Team, Edu 및 API 제품은 기본적으로 모델 학습에 사용되지 않는다고 명시합니다(OpenAI, 2026년 확인). 약관은 계속 바뀌고 업체마다 다르므로 절대 당연시하지 말고, 기본으로 접하게 되는 무료 버전이 대개 보호 수준이 가장 약한 버전이라는 점을 기억하십시오.

당신의 데이터가 가는 곳

메시지를 직접 입력했든, 어시스턴트에게 파일을 읽어 달라고 요청했든 경로는 동일합니다.

  1. 입력하거나 업로드합니다메시지를 입력하거나, 문서를 붙여넣거나, AI 어시스턴트가 클라이언트 파일을 요약하거나 읽도록 지정합니다.
  2. 기기를 떠납니다직접 입력했든 어시스턴트가 대신 파일을 읽었든, 내용은 인터넷을 통해 업체로 전달됩니다.
  3. 업체의 데이터 센터에 도달합니다업체의 서버가 그것을 처리합니다. 직원이나 계약업체가 일정한 조건 아래 접근할 수 있습니다.
  4. 저장되고, 학습에 사용될 수도 있습니다업체는 일정한 보관 기간 동안 사본을 보관할 수 있으며, 학습 기능이 꺼져 있지 않다면 이를 별도로 향후 모델을 개선하는 데 사용할 수도 있습니다.

암호화(encryption)는 이 이동 경로를 외부인으로부터 보호합니다. 그러나 반대편에 있는 업체가 당신이 보낸 내용을 읽는 것을 막지는 못합니다.

"절대 입력하면 안 되는" 목록

다음 중 어떤 것도 소비자용이거나 승인되지 않은 AI 도구에 입력하지 마십시오. 직접 입력하는 경우든, 그 내용이 담긴 파일을 도구가 읽도록 요청하는 경우든 마찬가지입니다.

이름, 생년월일, 주소, 전화번호, 또는 이메일

이 중 어느 하나만으로도 특정 개인을 가리킬 수 있으며, 메시지 안의 다른 내용과 결합되면 범위가 더 좁혀집니다.

사회보장번호

단 하나의 사회보장번호가 유출되어도 신원 도용과 사기가 발생할 수 있으며, 이는 클라이언트를 수년간 따라다닐 수 있습니다.

A 번호, USCIS(미국 시민권·이민국) 접수번호나 사건 번호, 법원 사건 번호

이러한 정보는 메시지를 이민 사건이나 법률 사건 파일, 그리고 단속 시스템에 직접 연결합니다.

체류 신분 또는 시민권 상태

신분과 그 이력은 단속 조치가 근거로 삼는 바로 그 세부 사항이므로, 업체의 서버에 절대 남아 있어서는 안 됩니다.

건강, 정신건강, 약물 사용, 또는 장애 관련 정보

이는 보호되는 임상 정보이며, 데이터 유출이나 소환장은 클라이언트의 가장 사적인 이력을 노출시킬 수 있습니다.

법률 사건, 체포, 또는 범죄 이력에 관한 세부 사항

사건의 세부 사항은 소송에서 드러나거나, 클라이언트가 결코 동의한 적 없는 방식으로 그에게 불리하게 사용될 수 있습니다.

신원 비식별화와 그 한계

이름을 지운다고 해서 기록이 익명이 되는 것은 아닙니다

신원 비식별화란 정보를 더 이상 특정 개인으로 추적할 수 없을 때까지 벗겨내는 것을 말합니다. 즉 이름, 번호, 주소 같은 직접 식별자뿐 아니라, 조합되면 어떤 사람을 가리키게 되는 준식별자(quasi-identifier)까지 제거하는 것입니다. "마리아, 생년월일 1990년 3월 12일, A 번호 087..."를 "한 클라이언트"로 바꾸는 것은 시작일 뿐, 끝이 아닙니다.

중요한 것은 그 한계입니다. Rocher, Hendrickx, de Montjoye(2019)는 데이터셋이 불완전할 때도 성립하는 방법을 사용하여, 단 15개의 인구통계학적 속성만으로도 미국인의 99.98%를 임의의 데이터셋에서 정확히 재식별할 수 있다고 추정했습니다. 흔한 속성 몇 가지만 조합해도 어떤 사람을 특정하기에 충분하므로, 신원 비식별화는 결코 보장되지 않으며, 바로 당신의 클라이언트들이 사는 지점에서 가장 빨리 실패합니다. 즉 드문 언어, 특정 출신국, 작은 마을, 흔치 않은 사건 특징에서 그렇습니다.

자유 서술형 텍스트는 체크리스트가 결코 떠올리지 못할 부수적인 세부 사항을 담고 있기 때문에 특히 정보가 새기 쉽습니다. 안전한 관행은 실제 기록을 비식별화한 뒤 붙여넣는 것이 아닙니다. 대신 훈련에서 질문을 던질 때처럼, 실제 인물과 연결 짓지 않고 일반적이고 가정적이거나 집계된 표현으로 작업하십시오. 클라이언트가 그 자리에 있는 상태에서 붐비는 공공장소에서 그 문장을 소리 내어 읽지 않을 것 같다면, 그것을 입력하지 마십시오.

이것을 이 도구에 입력해도 될까요?

이 관문들을 순서대로 통과하십시오. 어느 관문에서든 멈추면, 그것은 멈추라는 뜻입니다.

  1. 이 도구는 귀 기관의 승인 목록에 있고, 서명된 데이터 협약이 있습니까?아니라면 멈추십시오. 승인된 도구를 사용하거나 아무 도구도 사용하지 마십시오.
  2. 첨부된 파일 내부를 포함하여, 내용에 "절대 입력하면 안 되는" 목록에 있는 항목이 포함되어 있습니까?그렇다면 멈추거나, 계속하기 전에 먼저 제거하고 일반화하십시오.
  3. 남아 있는 세부 사항들이 결합되었을 때 특정 클라이언트, 가족, 또는 소규모 커뮤니티를 식별할 수 있습니까?그렇거나 확실하지 않다면 멈추십시오. 소규모 인구 집단에 관한 세부 사항은 식별 가능하다고 가정하십시오.
  4. 이 도구가 당신의 입력 내용으로 학습하지 않으며 명시된 보관 기한이 있다는 것을 알고 있습니까?모른다면, 확인할 수 있을 때까지 멈추십시오.
  5. 이 정확한 텍스트가 내일 공개된다면, 클라이언트나 그 가족에게 해가 될 수 있습니까?그렇거나 확실하지 않다면 멈추십시오.

모든 관문을 통과했을 때만 진행하고, 그때에도 반드시 필요한 최소한만 입력하십시오.

귀 기관이 도구를 도입하기 전에 요구해야 할 사항

클라이언트 정보를 다루는 업무에 AI 도구를 도입하는 것은 개인이 아니라 조직 차원의 결정입니다.

서면 데이터 협약(BAA 또는 DPA)

HHS(미국 보건복지부)는 귀 기관을 대신하여 보호 대상 건강정보를 생성, 수신, 유지, 또는 전송하는 모든 업체와 업무협력계약(Business Associate Agreement, BAA)을 체결하도록 요구합니다. 이를 저장하거나 처리하는 클라우드 서비스도 이에 해당합니다. 그 밖의 민감한 데이터에 대해서는 이에 상응하는 데이터 처리 계약(data processing agreement)을 요구하십시오.

문서화된 학습 선택 해제(opt-out)

업체의 약관에는 귀하의 입력 내용이 자사 모델 학습에 사용되지 않는다고 서면으로 명시되어 있어야 하며, 그 설정이 단지 선택 가능한 것이 아니라 실제로 그렇게 구성되어 있는지 누군가가 확인해야 합니다.

명확한 보관 조건

입력 내용이 얼마나 오래 보관되는지, 삭제를 요청할 수 있는지, 그리고 무보관(zero-retention)이나 로그 미기록(no-log) 옵션이 존재하는지 확인하십시오. 확보할 수 있는 가장 짧은 보관 기간을 선호하십시오.

조직 차원의 승인과 승인된 도구 목록

개별 직원이 도구별로 결정해서는 안 됩니다. 어떤 종류의 내용에 어떤 도구가 허용되는지 정리된 목록과, 문의할 담당자가 지정되어 있어야 합니다.

업체의 보안 관리 체계

전송 중 및 저장 중 암호화, 접근 통제, 유출 통지 약속은 필요하지만, 이는 외부인으로부터 보호하는 것이며 위에서 말한 학습 및 보관 조건을 대체하지 못합니다.

빠른 체크리스트

출처

  1. Friedman, A. S., & Venkataramani, A. S. (2021). Chilling Effects: US Immigration Enforcement and Health Care Seeking Among Hispanic Adults. Health Affairs, 40(7), 1056–1065. doi:10.1377/hlthaff.2020.02356
  2. Young, M.-E. D. T., Tafolla, S., Saadi, A., Sudhinaraset, M., Chen, L., & Pourat, N. (2023). Beyond “Chilling Effects”: Latinx and Asian Immigrants’ Experiences With Enforcement and Barriers to Health Care. Medical Care, 61(5), 306–313. doi:10.1097/MLR.0000000000001839
  3. Herring, J., & Barnow, B. (2025). Indirect effects of immigration enforcement on health care utilization among lawfully present older Hispanics. Social Science & Medicine, 384, 118540. doi:10.1016/j.socscimed.2025.118540
  4. Carlini, N., Tramèr, F., Wallace, E., Jagielski, M., Herbert-Voss, A., Lee, K., Roberts, A., Brown, T., Song, D., Erlingsson, Ú., Oprea, A., & Raffel, C. (2021). Extracting Training Data from Large Language Models. 30th USENIX Security Symposium (USENIX Security 21). link
  5. Carlini, N., Ippolito, D., Jagielski, M., Lee, K., Tramèr, F., & Zhang, C. (2023). Quantifying Memorization Across Neural Language Models. The Eleventh International Conference on Learning Representations (ICLR 2023). link
  6. Rocher, L., Hendrickx, J. M., & de Montjoye, Y.-A. (2019). Estimating the success of re-identifications in incomplete datasets using generative models. Nature Communications, 10, 3069. doi:10.1038/s41467-019-10933-3
  7. OpenAI (2026). How your data is used to improve model performance; Enterprise privacy. OpenAI help center and enterprise privacy page (accessed 2026). link
  8. U.S. Department of Health and Human Services (2026). Business Associate Contracts; Guidance on HIPAA & Cloud Computing. HHS.gov (accessed 2026). link

이 가이드는 위에 나열된 연구들에 근거한 실무를 설명합니다. 귀 기관의 정책과 귀 기관이 서비스를 제공하는 언어 및 커뮤니티에 맞게 조정하십시오.