如何制作一份能推动行动的 CSAT 报告

两个团队在同一天对同一批客户进行了调查。一个报告的数据是 82%,另一个则是 4.1。
两者都是正确的。一个使用了百分比法,另一个计算了平均分,而定义该指标的官方源头允许使用这两种方法。
这是在撰写报告前首先需要明确的一点。公式是一种选择,而非统一的标准。
本指南将介绍报告必须包含的内容以及两种合理的计算公式。接着,我们将探讨为什么量表和调查时机决定了你所获取的信息,以及如何通过导出的调查数据来制作这份报告。
CSAT 报告必须包含的内容
分数只是一个数字。而报告才是让这个数字发挥实际价值的关键。
同一视图中应包含六个要素:分数、所用公式、量表、回收样本量、受访人群以及触发点。
触发点是大多数报告最容易遗漏的要素。在客服电话结束后立即收集的分数,与用户购买 30 天后收集的分数,虽然名称相同,但实际上是完全不同的测量维度。
此外,还应呈现数据分布。保留量表上每个得分点的具体频数,因为如果只压缩成一个单一的数字,就会永久丢失数据的分布形态。
样本量(回复数量)的影响力往往超出人们的预期。如果只有 40 个样本,只要有几个人改变一分,就会导致最终得分产生好几个点的波动。
两种合理的公式,两个不同的数字
Qualtrics 在其 CSAT 页面上定义了该指标及其计算方法,并同时列出了这两种计算方式。
百分比法是其重点演示的方法。即“使用评分中 4(满意)和 5(非常满意)的回复”,然后套用其公布的公式。
具体公式如下:满意客户数量 / 调查回复总数 × 100。
采用“前两项(Top-Two)”规则是有明确依据的。该页面指出,“在反馈调查中采用最高的两个分值,是预测客户留存率最准确的指标”。
同一页面也认可了平均值法。虽然结果“可以取平均值以得出综合客户满意度得分”,但分数“通常更倾向于用百分比来表示”。
| 百分比法 | 平均值法 | |
|---|---|---|
| 输出结果 | 0% 至 100% | 量表范围内的某个数值 |
| 如何对待 3 分 | 不满意 | 中等/一般 |
| 敏感度 | 跨越 3 分到 4 分分界线的变化 | 任何分值的变动 |
| 与已发布行业基准的可比性 | 通常可以 | 极少 |
选定一种并在报告中注明。这两者无法直接换算,如果团队在年中中途更换计算方法,将会破坏历史趋势的连续性。
另一个相关指标则遵循不同的规则。NPS 在计算百分比时会排除中间区段,而 CSAT 则会将所有人保留在分母中。我们关于如何创建 NPS 报告的指南详细对比了这两者。
量表选择带来的实际影响
Qualtrics 推荐使用五分制量表来衡量 CSAT,区间从“非常不满意”到“非常满意”。
官方也公布了标准的问题措辞。即询问客户如何“评价您对所接受的 [产品/服务] 的总体满意度”。
许多工具默认采用的是七分制或十分制量表。这本身没有错,但它确实会改变计算逻辑。
“前两项(Top-Two)”规则在量表改变后将不再适用。在五分制中,前两项代表量表中最顶端的 40%;而在十分制中,前两项仅代表最顶端的 20%。
因此,在客户真实态度完全一致的情况下,采用“前两项”规则计算的十分制调查得出的 CSAT 评分,会明显低于五分制调查。这只是测量方式带来的偏差,而非客户反馈的真实变化。
由此可以得出两条极易实行的规则:固定量表标准,并在每次发布分数时在旁注明。
如果必须更改量表,请将其视为全新的数据序列。记录下更改日期,并停止与之前的数据进行对比。
调查时机决定了你获取的信息
调查时机是一项关键的设计决策,上述官方源头也将其视为核心要素。
Qualtrics 将 CSAT 描述为一种“即时”指标,它“针对的是特定的单次体验,而非长期的客户关系”。
这决定了何时提出问题才最有效。对于像致电客服中心这样的单次互动,官方页面建议在通话结束、记忆犹新时立即进行调查。
但对于需要长期使用的产品或服务,建议则恰恰相反。对于订阅服务或耐用品,可能需要等待几天或几周,客户才能做出客观的评价。
这会带来两个实际影响:将这两种不同触点的 CSAT 混为一谈得出的单一综合得分几乎毫无意义;正确的做法是按触发点分别进行报告。
官方页面还对调查频率提出了警告。过于频繁地向老客户发送调查“会带来新的问题”,这在数据上直接表现为问卷回收率的下降。
应当将回收率视为一个独立的指标来密切关注。如果得分在上升但回收率在下降,这通常只是“幸存者偏差”,而非服务质量的真正提升。
如何手动制作报告
方案 1:两次计数与一次除法
使用 COUNTIFS 函数统计评分为 4 和 5 的样本量,然后使用 COUNTA 函数统计评分列中的总样本量。
必须对评分列使用 COUNTA,而不是直接统计行数。因为未填写的空白评分不等于零分,如果将它们计入分母,会无形中拉低整体得分。
最后进行一次除法运算,并保持这两个统计数值可见。这样,任何人都可以通过上方的两个单元格重新计算并验证你的数据。
这种方法的局限性在于,你只能得到某一时期的单一总分,无法洞察具体是哪个触点或客群的数据发生了波动。
方案 2:完整的分布图表
统计量表上每个得分点的具体频数,然后基于同一张表格同时计算出百分比和平均值。
同时展示这两者可以作为一种有效的合理性检查。如果两者呈现出截然相反的趋势,说明数据呈现“双峰分布”,此时无论采用哪种单一指标都会产生误导。
此时,你可以对报告进行多维度下钻分析:按触发点、按产品、按渠道、按客服人员或按客户生命周期。
真正的洞察往往隐藏在细分维度中。一个看似健康的综合得分,背后可能掩盖了某个渠道的得分比其他渠道整整低了一分的事实。
这种方法的局限在于数据关联和数据量。如果需要将调查回复与账户或工单数据进行匹配,Excel 公式处理起来就会变得非常吃力。
方案 3:建立定义说明页
详细记录计算公式、量表标准、问题措辞、触发点以及受访人群。
将问题措辞纳入其中至关重要。提问方式的微调都会导致得分发生变化,而这种变化很容易被误读为客户态度的转变。
同时也要记录数据清洗规则。对于内部测试人员、重复提交以及超出有效范围的异常回复,都需要有明确的过滤和处理标准。
这种方法的局限性显而易见:仅仅把规则写下来并不能自动执行,到了下一个周期,大家往往又得重新手动设置一遍过滤条件。
共同的局限: 以上三种方案都建立在导出数据包含触发点或调查标识符的前提下。如果没有这些标识,综合得分就无法重新拆分并还原到具体的服务体验中。
手动制作报告的瓶颈所在
制作第一份报告可能只需要一个小时。但到了第四份时,耗时反而更长,因为有三个变量发生了变化。
调查工具在改版时悄悄更改了量表标准,而没人意识到分数的波动其实是问卷格式变化引起的。
受访人群在无形中被扩大了。例如,将调查发送给所有联系人,而不是仅发送给最近有购买行为的用户,这会导致许多近期没有实际体验的人也参与了评分。
接着是行业基准的引用。Qualtrics 指出,对 CSAT 进行基准对比“并非一门精密科学”,它在推荐参考 ACSI 行业数据的同时,也强调了每个企业和产品都存在差异。
它给出的最实用的建议其实很简单:只要你的分数在持续走高,就说明你的方向是对的。
临近汇报截止时,还会出现第四种隐形成本。当有人问起“82% 的得分算好吗?”时,要回答这个问题,你需要提供历史趋势、触发点细分以及你未曾准备的样本量数据。
关于工具层面的选择,我们在 用于调查数据分析的 AI 软件 一文中进行了盘点。
如何使用 Powerdrill Bloom 制作报告
步骤 1:上传导出的调查数据
直接从调查工具中上传导出的原始数据。Powerdrill Bloom 会在导入时自动分析各列数据,在计算任何分数之前,系统就会自动识别并指出空白评分、超出范围的异常值以及重复的受访者 ID。
步骤 2:用自然语言描述报告需求
无需手动构建规则,只需直接用语言描述即可。指定评分列、量表标准、计算公式、时间范围、受访人群以及触发点字段。
接着,提出可以排查错误的问题。例如,询问有多少条回复为空白或超出了量表范围;要求基于同一批数据同时计算百分比和平均值;或者要求按触发点和细分客群拆分得分。
步骤 3:导出图表、报告或 PPT 演示文稿
导出包含完整分布的评分、跨周期的趋势图,或者在分数旁清晰标注了公式和样本量的 PPT 幻灯片。
常见误区
未注明计算公式: 百分比法和平均值法都是合理的方法,但两者不可直接对比。请务必注明你使用的是哪一种。
在中途更改量表标准: 在客户真实态度完全一致的情况下,五分制和十分制调查会得出不同的分数。请将量表的更改视为全新数据序列的开始。
将空白评分计为零分: 未作答并不代表不满意。请在分子和分母中同时排除这些空白数据。
混淆不同的触发点: 客服通话结束后的评分与购买 30 天后的评分衡量的是完全不同的维度。请务必分开报告。
报告分数时未提供样本量: 样本量较小时,得分极易出现剧烈波动。请务必在分数旁注明回收的样本量。
将“回收率下降、得分上升”误读为服务改善: 这种数据表现通常只是“幸存者偏差”。请务必同步追踪问卷回收率。
盲目引用其他行业的基准作为目标: 在这里,基准对比并非一门精密科学。请以你自身的历史趋势作为主要参考。
总结
明确计算公式,固定量表标准 and 问题措辞,按触发点进行报告,并在发布分数时同步呈现样本量和数据分布。
分数本身并不是最终的交付成果。那些得分明显偏低的触发点或细分客群,才是指引你下个月工作改进方向的关键所在。
如果每个周期整理这些数据视图占用了你大量的时间,不妨在导出调查数据后尝试使用 Powerdrill Bloom。另请参阅我们关于如何利用 AI 将杂乱的调查数据转化为清晰图表的指南,以及客户之声总结器和CSV AI 助手页面。
常见问题解答
CSAT 是如何计算的?
最常用的方法是将评分为 4 和 5 的回复数量除以总回复数,然后乘以 100。计算原始评分的平均值也是一种可行的方法,但会得出不同的数值。
为什么只计算前两项(Top-Two)的回复?
Qualtrics 指出,采用最高的两个分值是预测客户留存率最准确的指标。同时,这也能让结果以直观的百分比形式呈现。
CSAT 调查应该使用什么量表?
官方公布的标准是采用从“非常不满意”到“非常满意”的五分制量表。更长的量表同样可行,前提是必须保持量表标准固定并做好记录。
应该在什么时候发送调查?
对于单次互动,应在互动结束后立即发送;而对于需要长期使用的产品,则应在几天或几周后发送。CSAT 衡量的是特定的单次体验,而非整体的客户关系。
CSAT 和 NPS 是一样的吗?
不一样。CSAT 的分母包含所有受访者;而 NPS 则是用推荐者百分比减去贬损者百分比,且在计算这两者时都会排除中间的被动者。