清理并标准化一张已去标识的电子表格
编写并运行 Python 代码,标准化这张已去标识电子表格里的各列:统一分类标签、把日期改成同一种格式,并标出空白或重复的行。把代码、清理前后的行数,以及每一列的取值计数都展示给我,方便我确认没有任何内容被遗漏。 [上传一份已去标识的导出文件,不含姓名或案件编号]
安全提醒。 确认行数没有变化、分类也正确,因为清理过程可能会悄悄丢弃或合并行。参见 模块 4。
This is a private beta prototype. Enter the password to continue. The content is unverified and must not be cited or relied upon.
Incorrect password. Please try again.
AI 可以加快普通的数据工作:清理一张杂乱的电子表格、汇总一份调查、起草一张图表,或编写一个公式。它在前期准备上速度很快,依据你粘贴的汇总、已去标识的数字来工作。它不是一台你可以信赖的计算器,所以数字本身以及它们的含义,始终由你来把关。
当你把数字粘贴进一个普通聊天窗口,请它算出平均值或总数时,模型并不是在做计算。它是在预测一份写出来的答案应该长什么样,这正是那些不易察觉的运算和四舍五入错误的来源。让模型转而编写代码、交给一个真正的解释器在数据上运行,在一组数学和金融测试中,这样做比让模型直接写出推理过程的准确率高出约十二个百分点,因为这时是计算机在做运算(Chen 及同事,2023)。代码能修正运算,却修正不了方法的选择。在一项大型统计学基准测试中,表现最好的模型也只达到约百分之六十五,而它的错误大多是套用了一种不适合数据的方法,这类错误一个忙碌的人很难察觉(Zhu 及同事,2024)。
在一项让模型使用代码解释器处理真实数据分析任务的基准测试中,代码几乎每次都能运行成功,但计算出的答案里只有大约百分之七十八是正确的,图表里也只有大约百分之六十四是正确的(Zhang 及同事,2024)。代码能运行,不等于答案是对的,因为模型可能写出读错了列、筛选错了行,或者选用了错误方法的代码。表格越大,问题越严重:随着粘贴进去的表格变长,简单计算的准确率会急剧下降,仅仅是重复的行,就会严重破坏模型算出的总数(Wolff 和 Hulsebos,2025)。因果是所有问题里最薄弱的一环;在一项数据推理基准测试中,模型处理统计类问题的表现远好于因果类问题,后者的正确率不到一半(Liu 及同事,2024)。
一张图表可能顺利渲染出来,却仍然错误地表达了数据。在一项可视化基准测试中,表现最好的模型大约四分之三的时候能生成有效且正确的图表,而大约五分之一的图表虽然能运行,却在某些方面破坏了数据,比如坐标轴错误、映射错误,或者缺少图例(Chen 及同事,2024)。要求模型去发现一张有误导性的图表只有中等程度的帮助,而且高度依赖提示词的写法,模型在发现颜色问题上表现最弱(Lo 和 Qu,2024)。你必须点名要求的修复方式,是一套色盲安全色板;被广泛使用的 Okabe 与 Ito 配色方案,对大约十二分之一患有色觉缺陷的男性来说,依然能够清楚分辨(Wong,2011)。
编写并运行 Python 代码,标准化这张已去标识电子表格里的各列:统一分类标签、把日期改成同一种格式,并标出空白或重复的行。把代码、清理前后的行数,以及每一列的取值计数都展示给我,方便我确认没有任何内容被遗漏。 [上传一份已去标识的导出文件,不含姓名或案件编号]
安全提醒。 确认行数没有变化、分类也正确,因为清理过程可能会悄悄丢弃或合并行。参见 模块 4。
用代码计算这份已去标识调查里每一道题每个选项的计数和百分比,并计算评分题的平均值。展示完整的分布,而不只是平均值,并打印出代码。除非我要求,否则不要运行任何显著性检验。 [上传已去标识的回复,先去掉任何开放式文本列]
安全提醒。 手动重新加总一道题的计数来核对总数,并对工具提出的任何检验保持警惕,因为模型常常会选用不适合数据的方法。参见 模块 2。
用代码依据这张汇总表制作一张条形图。让 y 轴从零开始,直接标注每根条形,并使用 Okabe-Ito 色盲安全色板。然后写一段两句话的说明文字,只陈述图表显示的内容,不做任何因果方面的判断。 [粘贴汇总计数,不含服务对象个体层面的行]
安全提醒。 检查坐标轴有没有被截断、标注是否与数字相符,并阅读说明文字,确保它没有夸大某种趋势。参见 模块 2。
安全提醒。 只使用汇总的、已去标识的数据,把每一个数字都当作一份草稿。对照原始数据重新计算那些真正重要的数字。参见 模块 2 和 模块 4。要把一项结果变成报告里的图表和说明文字,请参见 为报告、资助申请与外展工作讲故事。