베타 이 사이트는 베타 버전입니다. 정보는 계속 추가하고 검토하고 있습니다.
워크숍 개요
1

일상 업무에서 AI가 할 수 있는 일과 할 수 없는 일

기관의 일상 업무에서 AI가 하는 일에 대해 현실적인 기대를 세우고, 챗봇이 완전히 확신에 찬 듯 들려도 틀릴 수 있는 이유를 이해합니다.

시작 액티비티

이미 무엇에 쓰고 있는지 지도를 그립니다

  1. 지난 한 주 동안 업무에서 AI에 시킨 일 다섯 가지를 각자 한 줄씩 적습니다.
  2. 각 줄 옆에 답을 출처로 확인했는지, 확인하지 않았는지 표시합니다.
  3. 벽에 붙이고 같은 업무끼리 묶습니다. 이 벽이 우리 기관이 AI를 실제로 어디에 쓰고 있는지 보여 주는 첫 번째 지도입니다.

이 가운데 아무도 확인하지 않은 채 클라이언트에게 갈 수 있는 업무는 무엇입니까?

한눈에 보기

AI가 도움이 되는 일과 반드시 확인해야 하는 일

AI가 실제로 도움이 되는 일
  • 편지, 이메일, 안내문의 초안 잡기
  • 긴 문서를 핵심만 간추리기
  • 메모의 대략적인 뜻을 옮겨 첫 실마리 잡기
  • 어떤 규정이 보통 어떻게 적용되는지 쉬운 말로 설명하기
반드시 확인해야 하는 일, AI가 자주 틀리기 때문
  • 전화번호, 주소, 업무 시간, 마감일
  • 금액이나 자격 요건
  • 최근·지역·드문 사안이거나 특정 개인에 관한 내용
  • 클라이언트가 실제로 따라 행동할 내용은 공식 출처와 대조해 확인
원리는 간단합니다. AI는 초안 작성과 설명에 유용하고, 구체적인 사실은 누군가 그에 따라 행동하기 전에 반드시 실제 출처와 대조해 확인합니다.
  • AI가 실제로 도움이 되는 일상 업무를 짚어 봅니다. 편지나 이메일의 초안 작성, 긴 문서를 핵심만 남기고 줄이기, 메모의 전반적인 의미 번역, 규정이 대체로 어떻게 적용되는지에 대한 쉬운 설명 얻기가 이에 해당합니다.
  • 챗봇이 왜 없는 내용을 지어내는지 쉬운 말로 설명합니다. 이런 오류는 흔히 "할루시네이션"이라고 부르는데, 실제 근거 없이 확신에 찬 것처럼 들리는 문장을 뜻합니다. 챗봇은 다음에 나올 가능성이 높은 단어를 예측해 매끄러운 문장을 만들어 내기 때문에, 실제로 존재하지 않는 진료소 이름, 전화번호, 신청 마감일, 자격 규정을 만들어 낼 수 있습니다.
  • 지어낸 답변을 드문 예외가 아니라 충분히 예상할 수 있는 흔한 일로 받아들입니다. 법률 인용이나 참고문헌 같은 사실 조회 질문에서, 연구들은 전체 답변의 4분의 1에서 절반 이상에 이르는 비율로 틀리거나 지어낸 답변이 나온다고 측정했습니다.
  • 지어낸 답변이 올바른 답변과 똑같은, 차분하고 확신에 찬 어조로 읽힌다는 점을 인식합니다. 따라서 매끄러운 문장이라고 해서 그 내용이 사실이라는 신호가 되지는 않습니다.
  • 클라이언트를 보호하는 단 하나의 습관을 만듭니다. 숫자, 날짜, 금액, 주소, 자격 규정처럼 클라이언트의 행동을 바꿀 수 있는 정보는 무엇이든, 누군가 그에 따라 행동하기 전에 반드시 공식 출처와 대조해 확인합니다.
  • 자신과 동료들에게 있는 눈에 띄지 않는 위험을 알아차립니다. 사람들은 매끄럽고 확신에 찬 답변을 확인 없이 받아들이는 경향이 있으며, 연구자들은 이러한 경향을 "자동화 편향"이라 부릅니다. 이는 증거가 뒷받침하는 정도보다 기계를 더 신뢰하는 것을 의미합니다.
  • 이민자 클라이언트를 포함한 클라이언트들이 이미 일상생활에서 이러한 도구를 사용하고 있다는 점을 확인합니다. 따라서 현실적인 목표는 사용을 막으려 하기보다 이른 시점부터 안전한 사용을 안내하는 것입니다.
왜 중요한가 (근거)

챗봇을 사실 조회 용도로 사용할 때 지어낸 답변은 흔히 나타납니다. 주요 모델들을 법률 질문으로 시험한 결과, Dahl 외, 2024년 연구진은 모델에 따라 58%에서 82%에 이르는 답변에서 허위 또는 조작된 정보를 발견했습니다. 참고문헌을 제시해 달라고 요청하면 챗봇은 그 문헌마저 지어냅니다. 한 비교 연구에서 Chelli 외, 2024년 연구진은 한 도구가 90% 넘게 인용을 지어냈고, 다른 두 도구는 약 29%에서 40% 사이의 비율로 지어냈다는 사실을 발견했습니다.

더 어려운 문제는 우리 자신입니다. 컴퓨터가 생성한 조언을 사용하는 사람들은 그 조언이 틀렸고 눈앞의 다른 정보가 그것과 모순되는 경우에도 이를 받아들이는 경향이 있습니다. 한 체계적 문헌고찰은 이러한 경향을 "자동화 편향"이라 이름 붙였는데, 이는 증거가 뒷받침하는 정도보다 도구를 더 신뢰하는 것을 의미합니다 (Goddard 외, 2012년). 약간의 "마찰"을 두는 것이 도움이 됩니다. 사람들이 AI의 제안을 보기 전에 스스로 답을 먼저 만들어 보게 하면 이러한 과도한 의존이 줄어드는 것으로 나타났습니다 (Buçinca 외, 2021년).

과제가 사실을 제공하는 것이 아니라 초안을 작성하거나 내용을 압축하는 것일 때는 AI의 강점이 실제로 발휘됩니다. 의사들이 기계가 작성한 임상 요약과 전문가가 작성한 임상 요약을 비교한 한 연구에서, 적응된 모델이 작성한 요약은 대부분의 경우 전문가의 요약과 동등하거나 그보다 더 나은 평가를 받았습니다 (Van Veen 외, 2024년). 그럼에도 저자들은 이따금 오류를 발견했으므로, 요약에 의존하기 전에 사람이 원문과 대조하여 읽어야 합니다.

클라이언트는 이미 이러한 도구를 사용하고 있습니다. 미국 성인 약 3명 중 1명은 건강 정보를 찾기 위해 AI 챗봇을 사용한다고 답했으며, 다수는 그 답변이 정확한지 확신하지 못합니다 (KFF Health Information and Trust 조사, 2024-25). 이민자 클라이언트는 특히 더 개방적일 수 있습니다. 이민자와 일반 인구 성인을 대상으로 한 연구에서 이민자는 AI 정신건강 챗봇을 사용할 의향이 더 높다고 답했습니다 (Yoo와 Jang, 2026년). 이러한 개방성은 안전한 사용을 일찍 안내해야 할 이유가 됩니다.

한 겹 더

AI의 지식과 사각지대는 어디에서 오는가

챗봇은 진실과 직접 연결되어 있지 않습니다. 챗봇은 훈련에 사용된 텍스트를 압축한 그림에 가깝습니다. 그 그림에 무엇이 담겼는지를 알면 어디를 신뢰하고 어디를 확인해야 할지 알 수 있습니다.

AI의 기억에는 마감 시점이 있으므로, 최신 정보는 웹 검색(web search)을 요청해야 합니다

모델이 훈련한 기억은 마감 시점까지 수집된 텍스트를 담은 고정된 그림이므로, 그 자체만으로는 그 이후에 무슨 일이 있었는지 알지 못하며, 스스로 알아서 정보를 항상 찾아보는 것은 아닙니다. 현재 적용되는 규정, 마감일, 소득 기준, 오늘 날짜의 전화번호처럼 시간에 민감한 정보가 필요할 때는 반드시 도구에 웹 검색(web search)을 요청하고 사용한 출처를 보여 달라고 요청해야 합니다. 실시간 검색은 도움이 되지만 그 나름의 위험도 지니는데, 답변의 질은 찾아낸 페이지만큼만 좋을 수 있고 그마저도 잘못 이해할 수 있기 때문입니다. 그러므로 어느 쪽이든 최근 정보나 지역 정보는 반드시 공식 출처와 대조해 확인해야 합니다.

흔한 것은 잘 배우고, 드문 것은 그렇지 않습니다

모델은 훈련 텍스트가 풍부하고 반복적으로 등장한 영역, 예를 들어 영어로 된 일반적인 건강 설명에서 가장 강합니다. 반대로 텍스트가 부족했던 영역, 예를 들어 지역별 절차, 소규모 프로그램, 클라이언트가 사용하는 언어, 특정 카운티나 진료소에만 해당하는 내용에서는 가장 약합니다. 이러한 공백은 무작위가 아니라 온라인에서 대표성이 낮은 부분을 그대로 반영합니다.

편향이 들어가면 편향이 나옵니다

훈련 텍스트에는 인간의 결정과 불평등이 담겨 있으므로 모델은 이를 그대로 재현할 수 있습니다. 잘 알려진 한 사례에서, 널리 사용된 한 건강 알고리즘은 공정해 보였지만, 질병의 대리 지표로 의료비 지출을 사용한 탓에 편향되어 있었고, 그 결과 흑인 환자의 필요를 과소평가했습니다 (Obermeyer 외, 2019). AI는 클라이언트가 누구인지에 따라 패턴을 보이며 확신에 차서 틀릴 수 있습니다.

반영할 뿐, 검증하지 않습니다

모델은 옳고 그름과 상관없이 자기 데이터에서 흔한 내용을 반복합니다. 그래서 널리 퍼진 속설도 사실만큼이나 확신에 찬 어조로 되돌아올 수 있습니다. 따라서 무언가가 사실인지를 판가름하는 것은 모델의 어조가 아니라, 여러분이 신뢰하는 출처입니다.

이 도구는 방대한 양의 과거 인간 텍스트를 비추는 거울과 같습니다. 그래서 일반적인 설명과 초안 작성에는 유용하지만, 최근 정보이거나 지역적이거나 드물거나 특정인에 관한 내용이라면 반드시 실제 출처와 대조해 확인해야 합니다.

함정

지어낸 답변은 올바른 답변과 똑같아 보입니다

올바른 답변

Main Street에 있는 카운티 진료소는 5 pm까지 예약 없이 방문할 수 있습니다. 소득 연동 요금은 $15부터 시작합니다. 734-555-0143으로 전화하십시오.

지어낸 답변

Main Street에 있는 카운티 진료소는 7 pm까지 예약 없이 방문할 수 있습니다. 소득 연동 요금은 $10부터 시작합니다. 734-555-0198로 전화하십시오.

두 답변 모두 똑같이 차분하고 확신에 찬 어조로 도착하며, 문장 어디에도 어느 쪽이 진짜인지 알려 주는 단서가 없습니다. 진료 시간, 요금, 전화번호는 모두 누군가 그에 따라 행동하기 전에 진료소 자체 페이지와 대조해 확인합니다.
Case study

확신에 찬 답변, 그러나 틀린 숫자

  1. 한 복지 내비게이터가 챗봇에 지역 Medicaid 사무실의 전화번호와 4인 가구 기준 현재 소득 한도를 물었고, 챗봇은 즉시 구체적인 번호와 구체적인 달러 금액으로 답했습니다.
  2. 답변이 매끄럽고 확실하게 들려서, 기다리고 있는 클라이언트에게 그대로 읽어 주고 싶은 유혹이 듭니다.
  3. 확인하는 습관에 따라, 내비게이터는 두 정보 모두를 아직 확인되지 않은 것으로 간주하고 주 정부 기관의 공식 페이지에서 직접 찾아봅니다.
  4. 확인 결과 전화번호는 이미 바뀐 번호였고, 소득 수치는 다른 가구 규모에 해당하는 값이었습니다. 둘 다 지어낸 정보였지만 올바른 답변과 똑같이 보였습니다.
  5. 내비게이터는 클라이언트에게 확인을 마친 번호와 금액을 전달하고, 챗봇은 다음 단계에 대한 쉬운 말 요약 초안을 작성하는 데에만 사용하며, 이를 공유하기 전에 직접 검토합니다.
이렇게 해 보십시오

AI 답변에서 지어낸 부분 찾기

클라이언트가 실제로 받을 법한 형태로, 진료소 이름을 대고 전화번호를 알려 주며 자격 규정을 밝히는 AI 답변을 소리 내어 읽습니다. 이에 따라 행동하기 전에 무엇을 확인하겠는지 참가자들에게 묻습니다. 그런 다음 전화번호와 나이 규정이 지어낸 것이며 올바른 답변과 똑같이 들린다는 사실을 밝힙니다. 각 참가자는 특정 정보를 클라이언트와 확인할 때 사용할 문장을 하나씩 말합니다.

함께 연습하기

AI를 믿고 맡길 수 있는지 기준으로 자신의 업무 분류하기

각 참가자에게 지난 한 주 동안 챗봇을 사용했을 법한 업무 세 가지를 적어 보게 합니다. 그룹 전체가 함께 모든 업무를 두 더미로 분류합니다. 첫 번째 더미는 알림 이메일 초안 작성, 긴 정책을 쉬운 말로 바꾸기, 동료를 위해 메모의 전반적인 의미를 번역하기처럼 AI가 표현이나 분량 줄이기에 도움을 주는 업무입니다. 두 번째 더미는 사무실 전화번호, 신청 마감일, 소득 한도, 자격 규정처럼 클라이언트가 그대로 따라 행동할 사실을 AI가 제공하는 업무입니다. 두 번째 더미에 속한 업무마다 무엇을 대조해 확인할지 공식 출처를 말해 봅니다. 마지막으로 첫 번째 더미는 AI가 실제로 시간을 절약해 주는 영역이고, 두 번째 더미는 매끄럽고 확신에 찬 답변이 사람을 잘못된 방향으로 이끌 가능성이 가장 큰 영역이라는 점을 짚으며 마무리합니다.