如何在没有统计学家的情况下分析 A/B 测试结果(2026 指南)

要分析 A/B 测试结果,请在单一主要指标上对比两个组。检查差距是否大于正常的随机波动,然后指出真实差异可能落入的范围。Excel 可以完成这些算术计算。但围绕其做出的判断往往才是最容易出错的地方。
本指南涵盖了在查看数据之前需要收集什么,以及如何手动运行测试。它还介绍了手动方法的局限性,以及如何客观地解读输出结果。
在解读测试之前,你需要准备什么
有四个要素决定了结果是否有意义。请先收集它们。
在测试运行前选定的单一主要指标。转化率、每位访客带来的收入或激活率。提前选好。在看到数据后再去挑选指标,是团队说服自己“赢了”的常见套路。
原始计数,而不仅仅是百分比。在 200 名访客中提升 3% 与在 200,000 名访客中提升 3% 意义完全不同。你需要分母。
完整的测试周期。不足整周的数据会使结果产生偏差,因为工作日和周末的用户行为不同。请运行整周。
变更记录。每次测试只改变一个变量。如果你同时修改了标题和按钮颜色,任何统计方法都无法将它们的影响区分开来。
如果这四个要素中缺少任何一个,请在开始计算前停下来。在一个有缺陷的测试上进行精确的计算,依然只会得出一个让人信以为真的错误答案。
每个 A/B 测试都要回答的两个问题
每个结果最终都可以归结为两个问题,而这两个问题很容易被混淆。
差异是真实的吗?这就是显著性问题。它探究的是,如果两个版本的实际表现完全相同,出现如此大差距的可能性有多大。p-value(p 值)可以回答这个问题。通常的做法是,低于 0.05 即被认为概率足够低,可以采取行动。
差异足够大到产生影响吗?这就是效应量(effect size)问题。置信区间(confidence interval)通过给出真实差异可能所处的范围来回答这个问题。一个在统计学上真实的 0.2% 提升,可能依然不值得投入研发成本。
显著但微不足道的测试结果是一种常见且代价高昂的误读。请按顺序回答这两个问题。同时报告这两个数据,因为一个只听 p-value 的团队会把每一个显著的结果都当作可以上线的成果。
在 Excel 中手动分析的路径
Excel 原生支持这种分析。具体路径取决于你所测试的指标类型。
将两个组并排排列
每个变体占用一列。对于像每位访客收入这样的连续指标,每一行代表一位访客的数值。对于转化率,每一行是 1 或 0。保留原始行数据而不是汇总数据,因为公式需要底层的数据分布。
对连续指标使用 T.TEST
T.TEST(array1, array2, tails, type) 返回与学生 t 检验(Student's t-test)相关的概率。除非你提前决定只考虑单向,否则请使用 tails = 2。对于 type,配对样本使用 1,两组方差相等时使用 2,方差不等时使用 3。对于大多数网页测试,双样本异方差(type = 3)是更安全的默认选择。
该公式直接返回 p-value。微软的 T.TEST 函数 页面记录了这些参数的详细说明。
区别对待转化率
转化率是一个比例,而不是连续度量。标准方法是双比例 z 检验(two-proportion z-test),而 Excel 没有提供单一的函数来处理它。你有两个可行的选择。
根据合并比例和标准误差手动构建 z 检验,然后使用 NORM.S.DIST 将得分转换为 p-value。或者,将计数排列为按变体划分的“已转化”和“未转化”的二乘二表格。计算期望计数,然后使用 CHISQ.TEST 获取 p-value。
两种方法都可行。但每次测试结构发生变化时,都需要重新构建。
手动方法的局限性
有三件事必然会使手动方法失效。
仅凭 p-value 无法告诉你提升的幅度,因此你仍然需要单独计算置信区间。多个指标会使你的假阳性率(false-positive rate)成倍增加,而表格中没有任何内容会对此发出警告。此外,每一次新测试都意味着要针对格式不同的导出数据重新构建相同的公式。
还有一个容易被忽视的第四种成本。构建表格的人成了唯一能够检查它的人。
对于单次测试,手动方法完全没问题。对于每周一次的测试计划,你一年需要重新构建同一个表格 50 次。
如何使用 Powerdrill Bloom 分析 A/B 测试结果
如果你的测试数据已经存在于导出文件中,你可以跳过公式组装步骤。
步骤 1:上传你的测试数据
拖入从测试工具或数据库导出的 Excel、CSV 或 TSV 文件。支持多个文件同时加载,因此可以在一次操作中对比事件文件和用户文件。上传时会自动运行列检测和清理。
步骤 2:用自然语言描述对比需求
像对同事说话一样提出你的问题。例如:“对比变体 A 和 B 之间的转化率,告诉我差异是否显著,并给出置信区间。”智能体(agent)会根据指标类型选择合适的检验方法,报告 p-value 和区间,并解释它使用了哪种检验。如果需要细分维度分析,只需直接提问,它就会重新运行,而无需你重新构建。
步骤 3:导出图表、报告或幻灯片
将结果导出为图表,融入书面总结,或将画布转换为用于汇报的幻灯片。专业、商务和精美风格均可导出至 PowerPoint 或 Notion。在视觉呈现方面,数据可视化工具涵盖了同一次上传中可用的其他图表类型。
如何客观解读输出结果,避免夸大其词
| 你看到的内容 | 它的含义 | 它不代表的含义 |
|---|---|---|
| p = 0.03 | 在没有真实差异的情况下,出现如此大的差距是不太可能的 | 并不代表 B 有 97% 的概率更好 |
| p = 0.20 | 没有足够的证据做出结论 | 并不证明这两个版本是完全相同的 |
| 区间为 −1% 至 +6% | 真实的提升可能是负数 | 并不代表提升了 2.5%,即使这是中点值 |
| 显著但提升仅为 0.2% | 差异是真实的,但可能不值得上线 | 其本身并不算是一次业务上的成功 |
| 在八个指标中有一个显著 | 大致相当于仅凭运气产生的结果 | 算不上是什么新发现 |
舍入也要诚实。将提升幅度报告到小数点后两位,暗示了样本量根本无法支持的精度。
将结论写成包含范围的句子。例如,“变体 B 将转化率提升了 1% 至 5% 之间”是诚实的表述。而“变体 B 胜出”则不诚实,除非置信区间完全大于零。
常见错误
在测试刚显现出显著性时就停止。反复检查并在第一个看似不错的时刻停止测试,会严重推高假阳性率。请提前决定样本量和结束日期,然后耐心等待。
测试八个指标并只报告胜出的那个。如果指标足够多,总会有一些指标纯粹靠运气突破 0.05。请提前指定主要指标,并将其他指标仅作为背景参考。
忽视分母。小样本会产生看似惊人的百分比波动。请务必在比率旁边展示具体的计数。
事后不断细分维度,直到找到显著结果。按设备、国家和渠道进行切片,直到某个切片呈现显著性,这只是换汤不换药的同一个问题。请提前登记你所关注的细分维度。
对比本就不具可比性的组。如果流量分配不均,或者变体在不同的日期运行,那么测量出的差异也会包含这种不平衡因素。
将无显著差异的结果(null result)视为失败。一个显示没有差异的测试也是真实的反馈。它能让你免于上线一个耗费精力却毫无回报的改动。
简而言之
分析 A/B 测试结果归结为两个答案:差异是否真实,以及差异是否足够大到产生影响。Excel 通过 T.TEST 给你第一个答案,打需要你手动组装出第二个答案。比例指标需要与连续指标不同的检验方法,而这正是大多数人会跳过的步骤。
如果你定期运行测试,那么重新构建表格这一步最值得省去。免费试用 Powerdrill Bloom —— 上传导出文件,用自然语言提出对比需求,并导出汇报结果。关于工具选择,请参阅 用于 A/B 测试分析的 AI 工具;关于基础准备工作,请参阅 如何运行描述性统计。
常见问题解答
我该如何知道我的 A/B 测试结果是否显著?
在你的主要指标上对比两个组,并计算 p-value。低于 0.05 通常是判定差异不太可能是偶然发生的阈值。请将其与置信区间结合使用,因为仅凭显著性无法说明差异有多大。
我可以在 Excel 中分析 A/B 测试结果吗?
可以。对于像每位访客收入这样的连续指标,请使用 T.TEST。转化率是比例,因此需要进行双比例 z 检验,或者对二乘二计数表进行卡方检验(chi-square test)。Excel 没有针对双比例检验的单一内置函数。
A/B 测试需要多大的样本量?
这取决于你的基准率以及值得检测的最小提升幅度。预期的提升幅度越小,需要的样本量就越大。请在启动前计算好目标样本量,然后运行到该数量,而不是在结果看起来不错时就停止。
p-value 到底能告诉我什么?
它给出了在两个版本实际表现相同的情况下,观察到至少如此大差异的概率。低 p-value 意味着偶然性不是一个合理的解释。它并不代表你的变体更好的概率。
为什么我的 A/B 测试显示没有差异?
有三个常见原因:样本量太小无法检测到效果、改动太细微无法改变用户行为,或者确实没有任何差异。无显著差异的结果也是一个真实的发现,它能保护你免于上线一个毫无回报的改动。