测试版 本网站处于测试版。信息仍在持续添加和审核中。
AI 实际上能帮你做什么
10

分析并可视化你的项目数据

AI 可以加快普通的数据工作:清理一张杂乱的电子表格、汇总一份调查、起草一张图表,或编写一个公式。它在前期准备上速度很快,依据你粘贴的汇总、已去标识的数字来工作。它不是一台你可以信赖的计算器,所以数字本身以及它们的含义,始终由你来把关。

这套工作流程

快速搭建,然后核实

准备清理并重塑数据
分析汇总、分组、起草公式
可视化起草图表及其说明文字
核实亲自重新计算关键数字
任何决策所依据的数字,都要对照原始数据重新计算。
AI 在准备和起草阶段最快;最后一步——核对运算和含义——由你来完成。
  • 在前期准备上很有用:清理并重塑一张电子表格、建议合适的图表类型、编写电子表格或代码公式,以及为一项结果起草通俗语言的说明。
  • 任何计算都要求它编写并运行代码,即便如此,任何决策所依据的数字仍要对照原始数据重新计算。
  • 它最薄弱的地方是选择合适的方法以及判断因果。它会很自信地套用一种并不适合你的数据的统计方法,而在被问及一件事是否导致了另一件事时,它最不可靠。
  • 图表可能会产生误导。AI 起草的图表可能使用被截断的坐标轴、错误的数据映射,或者色盲读者无法分辨的颜色,而模型也不擅长察觉一张图表何时具有误导性。
  • 只使用汇总的、已去标识的数据。绝不要把服务对象名单或任何能识别个人身份的内容粘贴进一个通用工具里。
  • 解读的责任在你。一个数字对你的项目和服务对象意味着什么,是需要人来做出的判断。

它是如何运作的,又会在哪里出错

"心算"不可靠,运行代码更可靠

当你把数字粘贴进一个普通聊天窗口,请它算出平均值或总数时,模型并不是在做计算。它是在预测一份写出来的答案应该长什么样,这正是那些不易察觉的运算和四舍五入错误的来源。让模型转而编写代码、交给一个真正的解释器在数据上运行,在一组数学和金融测试中,这样做比让模型直接写出推理过程的准确率高出约十二个百分点,因为这时是计算机在做运算(Chen 及同事,2023)。代码能修正运算,却修正不了方法的选择。在一项大型统计学基准测试中,表现最好的模型也只达到约百分之六十五,而它的错误大多是套用了一种不适合数据的方法,这类错误一个忙碌的人很难察觉(Zhu 及同事,2024)。

即使代码能运行,大约五分之一的数字仍然可能是错的

在一项让模型使用代码解释器处理真实数据分析任务的基准测试中,代码几乎每次都能运行成功,但计算出的答案里只有大约百分之七十八是正确的,图表里也只有大约百分之六十四是正确的(Zhang 及同事,2024)。代码能运行,不等于答案是对的,因为模型可能写出读错了列、筛选错了行,或者选用了错误方法的代码。表格越大,问题越严重:随着粘贴进去的表格变长,简单计算的准确率会急剧下降,仅仅是重复的行,就会严重破坏模型算出的总数(Wolff 和 Hulsebos,2025)。因果是所有问题里最薄弱的一环;在一项数据推理基准测试中,模型处理统计类问题的表现远好于因果类问题,后者的正确率不到一半(Liu 及同事,2024)。

一张看起来干净的图表也可能是错的,而颜色是最大的盲点

一张图表可能顺利渲染出来,却仍然错误地表达了数据。在一项可视化基准测试中,表现最好的模型大约四分之三的时候能生成有效且正确的图表,而大约五分之一的图表虽然能运行,却在某些方面破坏了数据,比如坐标轴错误、映射错误,或者缺少图例(Chen 及同事,2024)。要求模型去发现一张有误导性的图表只有中等程度的帮助,而且高度依赖提示词的写法,模型在发现颜色问题上表现最弱(Lo 和 Qu,2024)。你必须点名要求的修复方式,是一套色盲安全色板;被广泛使用的 Okabe 与 Ito 配色方案,对大约十二分之一患有色觉缺陷的男性来说,依然能够清楚分辨(Wong,2011)。

得到一个你可以信赖的数字
如何进行一项你可以核查的数据任务
  1. 在上传任何内容之前,去掉姓名、出生日期、地址和案件编号。
  2. 要求它为每一项计算都编写并运行代码,并把代码展示给你看。
  3. 对于图表,要求坐标轴从零开始、使用直接标注,并采用 Okabe-Ito 色盲安全色板。
  4. 在把关键数字写进报告之前,自己重新计算一遍,或在电子表格里核对一遍。
  5. 解读,以及任何"一件事导致了另一件事"的说法,都要由人来把关。
一张杂乱的接案电子表格 一张可以核查的清理后表格
清理并标准化一张已去标识的电子表格

编写并运行 Python 代码,标准化这张已去标识电子表格里的各列:统一分类标签、把日期改成同一种格式,并标出空白或重复的行。把代码、清理前后的行数,以及每一列的取值计数都展示给我,方便我确认没有任何内容被遗漏。 [上传一份已去标识的导出文件,不含姓名或案件编号]

安全提醒。 确认行数没有变化、分类也正确,因为清理过程可能会悄悄丢弃或合并行。参见 模块 4

一份已去标识的调查导出文件 一份显示计数的摘要
汇总一份服务对象满意度调查

用代码计算这份已去标识调查里每一道题每个选项的计数和百分比,并计算评分题的平均值。展示完整的分布,而不只是平均值,并打印出代码。除非我要求,否则不要运行任何显著性检验。 [上传已去标识的回复,先去掉任何开放式文本列]

安全提醒。 手动重新加总一道题的计数来核对总数,并对工具提出的任何检验保持警惕,因为模型常常会选用不适合数据的方法。参见 模块 2

一张小型汇总表 一份可直接提交理事会使用的图表和说明文字
为报告起草一张图表和通俗的说明文字

用代码依据这张汇总表制作一张条形图。让 y 轴从零开始,直接标注每根条形,并使用 Okabe-Ito 色盲安全色板。然后写一段两句话的说明文字,只陈述图表显示的内容,不做任何因果方面的判断。 [粘贴汇总计数,不含服务对象个体层面的行]

安全提醒。 检查坐标轴有没有被截断、标注是否与数字相符,并阅读说明文字,确保它没有夸大某种趋势。参见 模块 2

实例分析

一个加不起来的总数

  1. 你粘贴了一列月度接案人数,在一个普通聊天窗口里请它算出全年总数和百分比变化。
  2. 回复给出了一个整洁的总数和一个百分比,格式规范、语气自信。
  3. 你自己把这一列加了一遍,发现总数少了模型漏掉的那个月,而百分比用错了基数。
  4. 你再次要求它编写并运行代码,把结果和你自己算出的总和核对,然后才把这个数字放进报告里。格式看起来是完成品,运算却不是。

安全提醒。 只使用汇总的、已去标识的数据,把每一个数字都当作一份草稿。对照原始数据重新计算那些真正重要的数字。参见 模块 2模块 4。要把一项结果变成报告里的图表和说明文字,请参见 为报告、资助申请与外展工作讲故事

来源
  1. Chen, W., Ma, X., Wang, X., & Cohen, W. W. (2023). Program of thoughts prompting: Disentangling computation from reasoning for numerical reasoning tasks. Transactions on Machine Learning Research. https://arxiv.org/abs/2211.12588
  2. Zhu, Y., Du, S., Li, B., Luo, Y., & Tang, N. (2024). Are large language models good statisticians? In Advances in Neural Information Processing Systems 37 (Datasets and Benchmarks Track). https://arxiv.org/abs/2406.07815
  3. Liu, X., Wu, Z., Wu, X., Lu, P., Chang, K.-W., & Feng, Y. (2024). Are LLMs capable of data-based statistical and causal reasoning? Benchmarking advanced quantitative reasoning with data. In Findings of the Association for Computational Linguistics: ACL 2024. https://arxiv.org/abs/2402.17644
  4. Zhang, S., Zhang, C., Hu, Y., Shen, H., Liu, K., Ma, Z., et al. (2024). CIBench: Evaluating your LLMs with a code interpreter plugin. arXiv. https://arxiv.org/abs/2407.10499
  5. Chen, N., Zhang, Y., Xu, J., Ren, K., & Yang, Y. (2024). VisEval: A benchmark for data visualization in the era of large language models. IEEE Transactions on Visualization and Computer Graphics. https://arxiv.org/abs/2407.00981
  6. Lo, L. Y.-H., & Qu, H. (2024). How good (or bad) are LLMs at detecting misleading visualizations? IEEE Transactions on Visualization and Computer Graphics. https://arxiv.org/abs/2407.17291
  7. Wong, B. (2011). Points of view: Color blindness. Nature Methods, 8(6), 441. https://doi.org/10.1038/nmeth.1618