超级促销周Claude Skills——20% 折扣
Tips

如何利用 AI 创建交叉表:完整指南

Powerdrill Bloom·
如何利用 AI 创建交叉表:完整指南

交叉表用于统计一个变量与另一个变量的交叉关系:例如按地区划分的满意度、按渠道划分的方案层级、按年龄段划分的回答。本指南将介绍交叉表需要包含哪些要素才能具备可读性,以及如何手动构建交叉表。随后,它将提供三个步骤,教您如何通过调查问卷或交易导出数据生成交叉表。

交叉表能解决什么问题

单变量汇总只能告诉您整体结果。例如“百分之六十二的人选择了选项 A”。这只是一个大标题,它隐藏了您通常真正需要的信息。

交叉表则将这个大标题拆解开来。它将一个变量放在行,另一个变量放在列,并在每个单元格中填入频数或百分比。现在,您可以清楚地看到,某个细分群体中有百分之七十八的人选择了选项 A,而另一个细分群体中只有百分之四十的人选择了该选项。

这个术语有多种不同的叫法。交叉制表(Cross-tabulation)、列联表(contingency table)和双向表(two-way table)指的都是同一种东西。在电子表格中,用于构建它的工具是PivotTable。

Microsoft的支持页面将其描述为“一个用于计算、汇总和分析数据的强大工具”。同一句话还补充道,它“让您能够查看数据中的对比、模式和趋势”。这是一个非常准确的描述,而其中起核心作用的词正是“对比”。

交叉表需要包含哪些要素才能具备可读性

表格中必须包含三个标签,而大多数手动构建的交叉表至少会遗漏其中一个。

基数。 每一个百分比都是相对于某个基数的百分比。Excel将其作为一个选项而非默认设置。您可以“将其显示为字段的百分比”,包括“总计的百分比”。对于嵌套布局,您可以通过选择“要用作基数的父字段”来“显示为父级汇总的百分比”。

方向。 即使频数完全相同,行百分比和列百分比回答的也是不同的问题。行百分比说明了每个细分群体做出了什么选择。列百分比则说明了做出每个选择的人群是由哪些细分群体组成的。

频数。 在 n=200 和 n=5 的情况下,单元格中显示的“百分之八十”代表着完全不同的意义。Microsoft文档介绍了如何同时显示这两者。您可以“将该项拖入‘值’区域两次”,然后“为每一项分别设置‘值汇总方式’和‘值显示方式’选项”。

开始之前您需要准备什么

  • 一份导出数据,其中每一行代表一个受访者、一笔交易或一张工单。
  • 您想要进行交叉分析的两个变量,各自位于独立的列中。
  • 在开始构建之前,先确定并记录下百分比的方向。
  • 设定一个最小单元格样本量,低于该数值将不报告百分比。
  • 清晰的表头。Microsoft的指南非常直接:“确保所有列都有表头,且每列只有单行唯一、非空的标签。”

最后一点比听起来更重要。同一页面还警告要“避免双行表头或合并单元格”。而调查问卷平台导出的数据恰恰就是这样:在选项行上方还有一个问题行。

如何手动构建

选项 1:构建 PivotTable

这是标准途径。Microsoft的指令非常简短:“选择‘插入’ > ‘PivotTable’。”

随后字段会自动放置,了解这些默认设置很有帮助。非数值字段“会被添加到‘行’区域”。日期和时间字段会进入“‘列’区域”,而数值字段则会落入“‘值’区域”。

前提是数据格式要整洁。指南指出,“您的数据应该以表格格式组织,并且不包含任何空行或空列”。

选项 2:使用 COUNTIFS 函数在手画的网格中进行统计

在侧边写下行标签,在顶部写下列标签,并在每个单元格中写入 COUNTIFS 函数。

这种方法透明且易于审计,当某个数字受到质疑时,这是一个真正的优势。但缺点在于网格是固定的。下个月的导出数据中如果出现了一个新的回答选项,表格会默默地忽略它,因为没有为它编写公式。

选项 3:先在查询工具中进行分组,然后粘贴结果

在电子表格之外进行聚合,然后粘贴整洁的三列结果并对其进行重塑。

这种方法能很好地处理大数据量。但它也会把逻辑放在同事看不到的地方,当有人第一次询问某个区间是如何定义的时候,这就会成为一个问题。

手动构建在哪些环节会变慢

第一个阻碍是数据类型陷阱,这一点在文档中也有记载。“默认情况下,放入‘值’区域的 PivotTable 字段会显示为 SUM。如果 Excel 将您的数据解读为文本,则数据会显示为 COUNT。”该页面还补充了警告:“这就是为什么确保不要混淆数值字段的数据类型如此重要的原因。”

数值列中只要有一个混入的文本条目,就会把总计变成计数。而此时表格看起来依然是正确的。

第二个阻碍是区间划分。年龄、任职时间、消费金额等都需要在进行交叉分析之前进行分桶,而分桶的边界往往取决于主观判断。由于没有人把这些边界记录下来,下个季度的表格就会使用不同的划分标准。

第三个是数据滞后。PivotTable 不会自动更新。文档中明确指出:向数据源添加新数据后,“任何基于该数据源构建的 PivotTable 都需要进行刷新”。

第四个是小单元格问题。一个包含 12 个地区和 6 个回答选项的交叉表有 72 个单元格,其中许多单元格可能只包含两到三个样本。在这些单元格上报告百分比,往往会导致调查得出无法在下一轮调查中重现的结论。

如何使用 Powerdrill Bloom 创建交叉表

步骤 1:上传受访者层级的导出文件

将原始导出文件拖入 Powerdrill Bloom,每行代表一个受访者。免费方案支持 Excel、CSV、PDF 和文档上传,因此无需付费方案即可导入文件。

使用 AI 上传受访者层级的导出文件以创建交叉表

如果您的调查工具导出的是带有双行表头的版本,直接上传即可。将其扁平化处理是请求的一部分,而不是前提条件。

步骤 2:指定两个变量、百分比方向和最小单元格样本量

用自然语言进行描述。指定行变量 and 列变量。说明您需要行百分比还是列百分比。然后给出频数阈值,低于该频数的单元格应显示原始数字而非百分比。

也可以在这里说明区间划分规则。说明年龄或消费分桶的起点和终点,以便每次运行时都应用相同的边界。

步骤 3:生成同时包含频数和百分比的表格

提出您需要的输出要求。即在每个单元格中同时包含频数和百分比的交叉表,以及每个百分比对应的基数。添加一段简短的说明,指出哪些差异足够显著、值得关注。Powerdrill Bloom 的价格页面介绍了如何获取包含图表、表格和导出的可靠解答。

生成的、同时显示频数和百分比的交叉表

如果需要将表格放入报告中,专业方案(Pro plan)可将其扩展为更完整的 Office 文档输出。AI 报告生成器页面介绍了书面报告的生成路径。

这能节省什么

任务 手动操作 通过上传的导出文件
扁平化处理双行调查表头 在开始任何操作前进行手动重塑 在同一步骤中自动处理
应用统一的区间边界 每个周期都需要重新决定 在请求中说明一次即可
同时显示频数和百分比 字段需要拖入两次,并分别进行配置 直接包含在请求中
隐藏小单元格的百分比 手动检查每个单元格 规则只需说明一次
收到新回答后进行刷新 手动刷新,且容易遗忘 针对新文件重新提问

最佳实践

将基数放在表格中,而不是脚注里。 如果读者必须去寻找 n 值,他们会默认该值很大。

每张表格只选择一种百分比方向。 混合了行百分比和列百分比的网格是无法阅读的,即使每个单元格的数据都完全正确。

宁可隐藏,也不要四舍五入。 在只有四个样本的单元格中显示破折号,比显示“百分之二十五”更诚实。

保留原始频数。 汇总数据容易引发争议。频数网格是解决争议的关键,同时也便于他人以不同的方式重新计算百分比。调查数据分析工具综述介绍了该领域更广泛的工具。

仅在模式简单时添加图表。 两个变量且各有两个或三个层级时,制成图表非常易读。但 12 乘 6 的表格则不适合,混乱调查数据处理指南介绍了这一界限所在。

结论

交叉表易于构建,但也容易被误读。构建它使用的是 PivotTable;难点在于使数字具有可解释性的三个标签,以及无人记录的区间边界。

一次性决定好方向、基数和最小单元格样本量。将它们写进请求中,而不是仅凭记忆,这样本季度的表格就能与上季度的表格保持可比性。

如果您有导出文件,但不想亲自动手重塑它,可以尝试使用受访者层级的文件体验 Powerdrill Bloom。如果您完全不想构建透视表而只想获取汇总,请参阅在不使用透视表的情况下汇总 Excel 数据

常见问题

什么是交叉表?

它是一种用于统计一个变量与另一个变量交叉关系的表格,侧边为行类别,顶部为列类别。每个单元格包含频数、百分比或两者兼有。交叉制表、列联表和双向表指的都是同一种东西。

交叉表和 PivotTable 是一回事吗?

PivotTable 是用于构建交叉表的电子表格功能。Microsoft将其描述为一种计算、汇总和分析数据的工具,以便您查看对比和趋势。交叉表是双变量分析的结果;而 PivotTable 还可以生成其他布局。

我应该使用行百分比还是列百分比?

根据您要回答的问题来选择。行百分比显示了每个细分群体做出了什么选择。列百分比显示了做出每个选择的人群是由哪些细分群体组成的。在同一个网格中混合使用两者会使表格无法阅读。

报告百分比的最小单元格样本量是多少?

并没有一个通用的数字,关键在于设定一个标准并始终如一地应用它。许多团队会隐藏单元格中样本量低于约 30 个的百分比,转而显示原始频数。

为什么我的 PivotTable 显示的是计数而不是求和?

Microsoft的文档对此有直接解释。默认情况下,值会显示为 SUM。如果 Excel 将数据解读为文本,则会显示为 COUNT。通常的原因是在本应是数值的列中混入了一个非数值条目。