베타 이 사이트는 베타 버전입니다. 정보는 계속 추가하고 검토하고 있습니다.
AI로 실제로 할 수 있는 일
10

프로그램 데이터 분석하고 시각화하기

AI는 뒤죽박죽인 스프레드시트를 정리하고, 설문을 요약하고, 차트 초안을 만들고, 수식을 작성하는 등 일상적인 데이터 작업을 빠르게 해 줍니다. 설정 단계에서 빠르고, 여러분이 붙여 넣는 집계된 비식별화 수치를 바탕으로 작동합니다. 하지만 신뢰할 수 있는 계산기는 아니므로, 숫자와 그것이 의미하는 바는 여전히 여러분의 몫입니다.

이 작업 흐름

빠르게 준비하고, 검증하기

준비데이터를 정리하고 재구성하기
분석요약하고, 묶고, 수식 초안 작성하기
시각화차트와 캡션 초안 작성하기
검증핵심 수치를 직접 다시 계산하기
의사결정의 근거가 되는 모든 숫자는 원본과 대조해 다시 계산합니다.
AI는 준비하고 초안을 작성하는 데 가장 빠릅니다. 마지막 단계, 즉 계산과 의미를 확인하는 일은 여러분의 몫입니다.
  • 준비 단계에 적합합니다. 스프레드시트를 정리하고 재구성하고, 차트 유형을 제안하고, 스프레드시트나 코드 수식을 작성하고, 결과를 쉬운 말로 풀어낸 초안을 작성하는 데 유용합니다.
  • 모든 계산에는 코드를 작성해서 실행하도록 요청하고, 그럼에도 의사결정의 근거가 되는 숫자는 원본과 대조해 직접 다시 계산하십시오.
  • 방법을 선택하는 일과 인과 관계를 판단하는 일에서 가장 취약합니다. 여러분의 데이터에 맞지 않는 통계 기법을 확신에 차서 돌릴 수 있으며, 한 가지가 다른 것을 일으켰는지 물었을 때 가장 신뢰하기 어렵습니다.
  • 차트는 오해를 부를 수 있습니다. AI가 만든 차트 초안은 잘려 나간 축, 잘못된 인코딩, 색약 독자에게 통하지 않는 색상을 쓸 수 있으며, 모델은 차트가 오해를 일으키는지 알아차리는 데 서툽니다.
  • 집계되고 비식별화된 데이터만 사용하십시오. 클라이언트 명단이나 개인을 식별할 수 있는 내용은 일반 도구에 절대 붙여 넣지 마십시오.
  • 해석은 여러분의 몫입니다. 어떤 숫자가 여러분의 프로그램과 클라이언트에게 무엇을 의미하는지는 사람이 내리는 판단입니다.

작동 원리와 실패 지점

머릿속으로 계산하는 것은 믿을 수 없고, 코드를 실행하는 편이 낫습니다

일반 채팅창에 숫자를 붙여 넣고 평균이나 합계를 물으면, 모델은 실제로 계산하지 않습니다. 서술형 답이 어떤 모습이어야 할지를 예측할 뿐이며, 여기서 조용한 산술 오류와 반올림 오류가 생겨납니다. 모델이 직접 계산하는 대신 실제 인터프리터가 데이터에 대해 실행하는 코드를 작성하게 하면, 수학과 금융 관련 테스트 전반에서 서술형 추론보다 정확도가 약 12퍼센트포인트 높아졌는데, 이는 컴퓨터가 산술을 담당하기 때문입니다 (Chen 외, 2023). 코드는 산술은 바로잡아 주지만, 방법 선택까지 바로잡아 주지는 않습니다. 대규모 통계 벤치마크에서 가장 뛰어난 모델도 약 65%에 그쳤고, 그 오류는 대부분 데이터에 맞지 않는 방법을 적용한 데서 비롯되었는데, 이는 바쁜 사람이라면 놓치기 쉬운 오류입니다 (Zhu 외, 2024).

코드가 실행되어도, 다섯 개 중 하나꼴로 숫자가 여전히 틀릴 수 있습니다

실제 데이터 분석 과제에서 모델이 코드 인터프리터를 쓰도록 한 한 벤치마크에서, 코드는 거의 매번 실행되었지만, 계산된 답 중 옳은 것은 약 78%에 그쳤고 차트 중 옳은 것은 약 64%뿐이었습니다 (Zhang 외, 2024). 코드가 실행되는 것과 답이 옳은 것은 별개입니다. 모델이 잘못된 열을 읽거나, 잘못된 행을 걸러내거나, 잘못된 방법을 고르는 코드를 작성할 수 있기 때문입니다. 이 문제는 표의 크기가 커질수록 심해집니다. 붙여 넣은 표에 대한 단순 계산의 정확도는 표가 길어질수록 급격히 떨어졌고, 중복된 행만으로도 모델의 합계가 크게 어긋났습니다 (Wolff와 Hulsebos, 2025). 인과 관계는 가장 취약한 영역입니다. 한 데이터 추론 벤치마크에서 모델은 통계적 질문은 훨씬 잘 다뤘지만 인과적 질문은 절반에도 못 미쳤습니다 (Liu 외, 2024).

깔끔해 보이는 차트도 틀릴 수 있으며, 색상이 사각지대입니다

차트는 오류 없이 렌더링되면서도 데이터를 잘못 표현할 수 있습니다. 한 시각화 벤치마크에서 가장 뛰어난 모델도 유효하고 정확한 차트를 만든 비율은 약 4분의 3에 그쳤고, 다섯 개 중 하나꼴로는 실행은 되었지만 잘못된 축, 잘못된 매핑, 빠진 범례 같은 방식으로 데이터를 왜곡했습니다 (Chen 외, 2024). 모델에게 오해를 부르는 차트를 잡아내라고 요청해도 도움은 어느 정도에 그치고 프롬프트에 크게 좌우되며, 모델은 색상 문제를 발견하는 데 가장 취약합니다 (Lo와 Qu, 2024). 이름을 콕 집어 요청해야 하는 해결책은 색약 안전 팔레트(colorblind-safe palette)입니다. 널리 쓰이는 Okabe와 Ito의 팔레트는 색각 이상이 있는 남성 약 12명 중 1명꼴에게도 구별 가능하게 유지됩니다 (Wong, 2011).

믿을 수 있는 숫자 얻기
검증할 수 있는 데이터 작업을 진행하는 법
  1. 무엇이든 업로드하기 전에 이름, 생년월일, 주소, 사건 번호를 지우십시오.
  2. 모든 계산에 코드를 작성해 실행하도록 요청하고, 그 코드를 보여 달라고 하십시오.
  3. 차트에는 0에서 시작하는 축, 직접 표시된 레이블, Okabe-Ito 색약 안전 팔레트를 요청하십시오.
  4. 보고서에 들어가기 전에 핵심 숫자를 직접 다시 계산하거나 스프레드시트에서 확인하십시오.
  5. 해석, 그리고 한 가지가 다른 것을 일으켰다는 주장은 사람이 계속 맡으십시오.
뒤죽박죽인 접수 스프레드시트 확인할 수 있는 정리된 표
비식별화된 스프레드시트 정리하고 표준화하기

이 비식별화된 스프레드시트의 열을 표준화하는 Python 코드를 작성해서 실행해 주십시오. 범주 레이블을 일관되게 정리하고, 날짜를 한 가지 형식으로 통일하고, 빈 행이나 중복된 행을 표시해 주십시오. 아무것도 빠뜨리지 않았는지 제가 확인할 수 있도록 코드, 전후 행 수, 각 열의 값별 개수를 보여 주십시오. [비식별화된 내보내기 파일을 업로드하십시오, 이름이나 사건 번호 제외]

안전 수칙. 정리 과정에서 행이 조용히 빠지거나 병합될 수 있으므로, 행 수가 변하지 않았는지와 범주가 올바른지 확인하십시오. 자세한 내용은 모듈 4를 참고하십시오.

비식별화된 설문 데이터 개수를 함께 보여 주는 요약
클라이언트 만족도 설문 요약하기

코드를 사용해, 이 비식별화된 설문의 모든 문항에서 각 응답 선택지의 개수와 비율을 계산하고, 평점 문항은 평균도 계산해 주십시오. 평균만이 아니라 전체 분포를 보여 주고, 코드를 함께 출력해 주십시오. 제가 요청하지 않는 한 유의성 검정은 실행하지 마십시오. [비식별화된 응답을 업로드하십시오, 주관식 열은 먼저 삭제하십시오]

안전 수칙. 한 문항의 개수를 손으로 다시 더해 총합을 확인하고, 모델이 맞지 않는 방법을 고르는 경우가 흔하므로 도구가 제안하는 어떤 검정도 경계하십시오. 자세한 내용은 모듈 2를 참고하십시오.

작은 집계표 보고에 바로 쓸 수 있는 차트와 캡션
보고서용 차트와 쉬운 캡션 초안 작성하기

코드를 사용해 이 집계표로 막대 차트를 만들어 주십시오. y축은 0에서 시작하고, 막대에 직접 레이블을 붙이고, Okabe-Ito 색약 안전 팔레트를 사용해 주십시오. 그런 다음 인과에 대한 주장 없이 차트가 보여 주는 내용만 담은 두 문장짜리 캡션을 작성해 주십시오. [집계된 수치를 붙여 넣으십시오, 클라이언트 단위 행 제외]

안전 수칙. 축이 잘리지 않았는지, 레이블이 숫자와 일치하는지 확인하고, 캡션이 추세를 과장하지 않는지 직접 읽어 확인하십시오. 자세한 내용은 모듈 2를 참고하십시오.

적용 예시

더해 보니 맞지 않는 합계

  1. 월별 접수 건수 열을 붙여 넣고, 일반 채팅창에서 연간 합계와 증감률을 물어봅니다.
  2. 답변은 깔끔한 합계와 비율을 정돈되고 확신에 찬 형태로 제시합니다.
  3. 직접 열을 더해 보니, 모델이 빠뜨린 한 달만큼 합계가 어긋나 있고, 비율은 잘못된 기준값을 사용했습니다.
  4. 다시 코드를 작성해 실행하도록 요청하고, 결과를 여러분이 직접 더한 값과 대조한 뒤에야 그 숫자를 보고서에 넣습니다. 형식은 완성돼 보였지만, 산술은 그렇지 않았습니다.

안전 수칙. 집계되고 비식별화된 데이터만 사용하고, 모든 숫자를 초안으로 다루십시오. 중요한 숫자는 원본과 대조해 다시 계산하십시오. 자세한 내용은 모듈 2모듈 4를 참고하십시오. 결과를 보고서용 차트와 캡션으로 바꾸는 방법은 보고서, 보조금, 홍보를 위한 스토리텔링를 참고하십시오.

출처
  1. Chen, W., Ma, X., Wang, X., & Cohen, W. W. (2023). Program of thoughts prompting: Disentangling computation from reasoning for numerical reasoning tasks. Transactions on Machine Learning Research. https://arxiv.org/abs/2211.12588
  2. Zhu, Y., Du, S., Li, B., Luo, Y., & Tang, N. (2024). Are large language models good statisticians? In Advances in Neural Information Processing Systems 37 (Datasets and Benchmarks Track). https://arxiv.org/abs/2406.07815
  3. Liu, X., Wu, Z., Wu, X., Lu, P., Chang, K.-W., & Feng, Y. (2024). Are LLMs capable of data-based statistical and causal reasoning? Benchmarking advanced quantitative reasoning with data. In Findings of the Association for Computational Linguistics: ACL 2024. https://arxiv.org/abs/2402.17644
  4. Zhang, S., Zhang, C., Hu, Y., Shen, H., Liu, K., Ma, Z., et al. (2024). CIBench: Evaluating your LLMs with a code interpreter plugin. arXiv. https://arxiv.org/abs/2407.10499
  5. Chen, N., Zhang, Y., Xu, J., Ren, K., & Yang, Y. (2024). VisEval: A benchmark for data visualization in the era of large language models. IEEE Transactions on Visualization and Computer Graphics. https://arxiv.org/abs/2407.00981
  6. Lo, L. Y.-H., & Qu, H. (2024). How good (or bad) are LLMs at detecting misleading visualizations? IEEE Transactions on Visualization and Computer Graphics. https://arxiv.org/abs/2407.17291
  7. Wong, B. (2011). Points of view: Color blindness. Nature Methods, 8(6), 441. https://doi.org/10.1038/nmeth.1618