如何使用 AI 创建帕累托图:分步指南

帕累托图按大小对类别进行排序,并绘制这些类别的累计总计。这展示了少数原因是如何占了大部分数量的。本指南介绍了该图表的组成部分,以及如何在 Excel 中手动构建它。然后,它提供了通过原始导出数据生成该图表的三个步骤。
帕累托图展示了什么
微软的支持页面对这种图表形状进行了精确的定义。“帕累托图或排序直方图既包含按降序排列的柱形,也包含一条代表累计总百分比的折线。”
因此它有两个层级。柱状图回答了“每个类别有多大”的问题,按从大到小的顺序排列。折线则回答了“到目前为止我们已经覆盖了总数的多少”。
同一页面还解释了该图表得名的原因:“帕累托图突出了数据集中的最大因素。”它还补充道,它们被“认为是质量控制的七大基本工具之一”。
最后一句话道出了其实用价值。排序柱状图可以告诉你哪个类别最大。而加入累计折线则能告诉你该在哪里停止阅读,这正是大多数人实际需要的决策依据。
如果只想了解概念而不涉及构建,这篇帕累托图详解介绍了其定义以及 80/20 法则背后的原理。
开始之前你需要准备什么
- 一列作为文本的类别:投诉原因、缺陷类型、供应商、产品代码。
- 一列用于排序的数字:成本、单位数量、损失时间(分钟)、工单数量。
- 明确这些数字代表什么。总成本和发生次数对同一份列表会产生不同的排序结果。
- 可以在图表上注明的具体时间窗口。13 个月的帕累托图和 12 个月的帕累托图是不具可比性的。
- 对长尾数据的处理方式。50 个各发生一次的类别会使坐标轴显得非常拥挤。
第二项往往是导致返工的原因。按总成本排序会将昂贵但罕见的故障排在最前面。按频率排序则会将便宜但频繁发生的烦人问题排在最前面。这两种方式都是合理的,但它们代表了不同的图表。
如何在 Excel 中手动制作
方案 1:使用内置的帕累托图类型
Excel 将其作为原生图表提供。微软的说明非常简短:“选择‘插入’ > ‘插入统计图表’,然后在‘直方图’下选择‘帕累托图’。”
其运行效果取决于你选择的内容,支持页面对此进行了详细说明。“通常,你需要选择一个包含文本(类别)的列和一个包含数字的列。然后,帕累托图会将相同的类别进行分组,并对相应的数字求和。”
另一种情况中存在一个陷阱。根据同一页面的说明,如果选择“两列数字”,结果就会发生改变。Excel 随后会“像直方图一样,按区间对数据进行图表化处理”。你虽然会得到一个图表,但它回答的将是另一个不同的问题。
方案 2:添加辅助列进行计数而非求和
这就是内置方法需要变通的地方。Excel 会对数值列求和,因此如果只有原始事件列表而没有成本列,就无法进行排序。
微软将解决方法作为一个技巧记录了下来。其目的是“计算文本字符串出现的次数”。你需要“添加一列并填充数值 1”,然后“将区间设置为‘按类别’”。
这个方法可行。但这也意味着,你对新导出的数据做的第一件事就是添加一列数字 1。这充分说明了工具与任务之间存在轻微的不匹配。
方案 3:自行构建柱状图和累计折线
降序排列,添加一个累计总计列,然后将其转换为占总计的百分比。绘制一个组合图表,并将百分比放在次坐标轴上。
这样你就可以完全控制标签、阈值和尾部数据。但这也意味着下个月的数据导出时,这四个步骤全部需要重做。当添加新行时,累计总计公式往往会悄无声息地失效。
手动操作在哪些环节会变慢
计算本身不是问题。问题在于导出的数据格式很少能直接符合图表类型所期望的格式。
实际导出的数据中,类别可能分散在多个列中。或者同一个类别有三种不同的拼写方式。又或者数值列被存储为了文本。Excel 的分组是完全基于字面值的,因此 Supplier A、supplier a 和 Supplier A 会变成三个不同的柱子。
第二个降低效率的环节是尾部数据。一旦你有 50 个类别,图表就会变得无法阅读,必须有人来决定“其他”从哪里开始。这个阈值是一个主观判断,除非有明确的文字规定,否则每个月的标准都会有所不同。
第三个是坐标轴。累计折线应该放在缩放到 100% 的次坐标轴上。手动调整好这个设置非常繁琐,一旦出错,折线看起来就会像第二个数据系列。
如何使用 Powerdrill Bloom 创建帕累托图
步骤 1:上传原始导出数据
将事件日志、投诉列表或交易导出数据拖入 Powerdrill Bloom。免费计划支持 Excel、CSV、PDF 和文档上传,因此无需付费计划即可导入文件。
无需事先对其进行排序、清理类别拼写或添加辅助列。这些工作是请求的一部分,而不是前提条件。
步骤 2:说明排序依据以及如何处理尾部数据
用自然语言表达即可。指出类别列的名称,并说明是按总和值还是按发生次数进行排序。然后说明从哪里开始将尾部数据归入“其他”分类中。
明确排序依据是关键所在。此外,还可以要求合并近似重复的类别标签。内置的图表类型仅对完全相同的类别进行分组,因此这种清理工作发生在生成图表之前,而不是在图表内部。
步骤 3:生成带累计折线的排序柱状图
提出你需要的输出要求。即按从大到小排序的类别,以及横跨这些类别的累计百分比。添加一个简短的说明,指出有多少个类别达到了前 80%。Powerdrill Bloom 的免费计划中包含了生成洞察、图表和摘要的功能。
如果图表要放入汇报材料中,Pro plan 可以将其扩展为更完整的幻灯片和 Office 文档输出。我们的 AI graph maker 页面单独介绍了图表构建功能。
这能节省什么
| 任务 | 手动操作 | 基于上传的导出数据 |
|---|---|---|
| 合并近似重复的类别标签 | 手动查找并替换,每月重做 | 包含在你提出的问题中 |
| 添加辅助列以计算发生次数 | 内置图表类型所必需 | 不需要 |
| 构建累计百分比折线 | 公式加次坐标轴 | 包含在请求中 |
| 决定并重新应用“其他”阈值 | 主观判断,每月标准不一 | 一次说明,每次运行自动应用 |
最佳实践
在图表上注明你是按数值还是按次数进行排序。 读者仅凭柱状图是无法分辨的,而且这两种排序方式对于哪个类别排在第一位往往会得出不同的结论。
将尾部数据作为一个单独的柱子保持可见。 隐藏它会导致累计折线过早达到 100%,从而夸大了数据的集中度。
不要将 80/20 仅仅视为一个发现。 It 是一个分析框架。真正的发现是你的数据需要多少个具体类别才能达到该比例。这个数字通常是 5 个或 15 个,而不是一个整整齐齐的五分之一。
关联原因,而不仅仅是排名。 缺陷类型的帕累托图可以告诉你数量集中在哪里。将其与供应商计分卡结合使用,才能将排名转化为实际行动。
对照第二种视图检查排名。 同一数据的热力图将显示某个类别是在所有地方都占主导地位,还是仅在某一个细分市场中占主导地位。
结论
帕累托图是在排序列表之上的两个简单图层,且 Excel 已经内置了这种图表类型。阻碍效率的几乎从来不是绘图本身,而是类别的清理、排序依据的确立以及尾部数据阈值的设定。
这三个决策正是让每个月的图表具有可比性的关键。一次性记录下来,每次都应用它们,图表就会变成一个持续的追踪工具,而不仅仅是一次性的工作。
如果你手头有导出数据,但没有时间重新调整其格式,可以尝试使用原始文件体验 Powerdrill Bloom。而 Excel AI assistant 方案则非常适合已经存在于工作簿中的数据。
常见问题解答
什么是帕累托图?
它是一个包含按降序排列的柱状图以及一条显示累计总百分比折线的图表。微软的文档将其描述为排序直方图,并将其列为质量控制的七大基本工具之一。柱状图对类别进行排序;折线则显示它们占总数的比例。
如何在 Excel 中制作帕累托图?
选择一个包含文本类别的列和一个数值列,然后选择“插入”、“插入统计图表”,并在“直方图”下选择“帕累托图”。Excel 会对匹配的类别进行分组并对数值求和。如果选择两列数值,则会生成类似于直方图的分箱输出。
如何计算发生次数而不是对数值求和?
微软记录的技巧是添加一个填充了数值 1 的列,然后绘制图表并将区间设置为“按类别”。这样图表就会对 1 进行求和,这与计算每个类别的行数效果相同。
我应该按成本还是按频率进行排序?
两者都是有效的,并且它们回答了不同的问题。成本指向昂贵但罕见的故障;频率则指向持续发生导致成本较低的故障。选择其中一种,在图表上注明,并在不同时期之间保持一致。
帕累托图应该显示多少个类别?
数量应足以越过累计折线变平缓的临界点,通常在 5 到 15 个柱子之间,外加一个用于剩余数据的组合柱。保持剩余数据可见可以防止折线夸大数据的集中程度。