什么是统计学显著性?定义、示例与局限性 (2026)

统计学显著性意味着,在假设没有实际效应的前提下,结果不太可能仅仅是由巧合引起的。通常,当 p-value 低于 0.05 时,就会宣布结果具有显著性。这个阈值只是为了方便而采用的惯例,并非自然界的固有属性。显著的结果也并不等同于重要的结果。
这两句话涵盖了该概念在实践中出现的大部分问题。团队将 0.05 视为及格线,并将显著性视为产生影响的证据,而这两种解读都会导致在极少依据的基础上做出充满信心的决策。
本指南将介绍 p-value 实际回答了什么问题、该阈值的来源以及如何构建测试。最后,我们将阐述显著性真正无法告诉你的四件事。
什么是统计学显著性?
统计学显著性是关于“出乎意料”的陈述,而非关于“真理”的陈述。首先,你假设什么都没有发生——即两组数据完全相同,或者变量之间毫无关联。这个假设就是零假设。
然后你会问:如果零假设为真,我看到至少与我的数据同样极端的数据的频率有多高?如果答案是“极少”,那么观察到的数据就很难与该假设相调和,你就会拒绝它。
这就是全部的逻辑。请注意它不包括什么。它没有说明效应有多大、你的假设有多大可能是真的,或者该结果对任何人来说是否重要。
p-value 实际回答了什么
p-value 是在假设零假设为真的前提下,观察到至少与你的数据同样极端的数据的概率。
这个条件从句承载了所有的分量,但几乎总是被忽略。0.03 的 p-value 并不意味着结果有 3% 的概率是偶然发生的,也不意味着你的假设有 97% 的概率是正确的。它的意思是:如果确实没有效应,那么大约有 3% 的时间会出现如此极端的数据。
这种区别听起来很学术,直到它改变了一项决策。在一个完全没有实际效应的数据集上运行 20 次独立的测试,你仍然会得到大约一个“显著”的结果。无中生有的 5% 依然存在。这并不是数学上的缺陷,这正是 5% 阈值的含义。
0.05 阈值的来源
它没有任何推导过程。0.05 的分界线是通过 20 世纪初统计实践中的惯例进入常用领域的,并因为使用方便且大家都在使用而保留了下来。
这对于你如何解读临界结果至关重要。0.049 的 p-value 和 0.051 的 p-value 描述了几乎完全相同的证据,然而一个被称为显著,另一个则不然。将该边界视为真实与不真实之间的硬性分界线,是该概念最常见的一种误用。
请报告实际的 p-value,而不仅仅是它是否达标。这样读者就可以自己判断证据的强弱。
如何测试显著性
零假设
在查看结果之前,准确地陈述无效应的假设。“版本 B 的转化率与版本 A 相同”是可测试的。而“版本 B 更好”则不可测试,因为它没有具体说明什么可以作为反对它的证据。
检验统计量
选择与数据匹配的测试。比较两组均值通常需要进行 t-test;比较比例则需要进行 z 检验或列联表上的卡方检验。使用错误的测试会产生一个看起来合法但实际上不合法的数字。
p-value 与决策
测试会将你的数据转换为 p-value。将其与你在运行测试之前设定的阈值进行比较。在测试之后选择阈值,或者反复运行测试直到其达标,都会使整个过程失效。
统计学显著性 vs. 实际显著性
| 统计学显著性 | 实际显著性 | |
|---|---|---|
| 回答的问题 | 这可能是巧合吗? | 这值得采取行动吗? |
| 取决于样本量 | 极度依赖 | 完全不依赖 |
| 表示方式 | p-value | 效应量、置信区间 |
| 实现方式 | 收集更多数据 | 只能通过实际效应 |
最后一行是需要牢记的关键。只要样本量足够大,几乎任何差异都会变得在统计学上显著,包括那些微小到无足轻重的差异。在一千万用户中,0.02% 的转化率提升可以轻松通过你设定的任何阈值,但它仍然不值得投入工程时间。
这就是为什么每个 p-value 旁都应该附带效应量。显著性表明效应可能不为零;而效应量则表明是否有人应该予以关注。
统计学显著性无法告诉你什么
效应有多大。 无论潜在差异的大小如何,p-value 都会随着样本量的增加而减小。它不是衡量大小的指标。
你的假设有多大可能性。 p-value 是在假设零假设成立的前提下计算出来的。因此,它无法反过来告诉你零假设不成立的概率。回答这个问题需要一个完全不同的框架。
结果是否可以复现。 单个样本中的单个显著结果是微弱的证据。复现才能将其转化为一项发现。
研究设计是否合理。 显著性测试假设数据是妥善收集的。有偏差的样本会产生一个看似确凿显著、实则确凿错误的结果,后续任何程度的统计严谨性都无法对其进行弥补。
报告显著性时的常见错误
仅报告其是否通过了 0.05。 请公布实际的 p-value。“p = 0.048”和“p = 0.052”告诉读者的信息,远比“显著”和“不显著”要多得多。后一组标签暗示了实际上并不存在的证据差异。
持续运行测试直到其通过。 每天检查结果,并在 p-value 降至阈值以下时停止,这保证了最终一定会得到显著的结果,无论是否存在实际效应。请提前确定样本量。
在不进行调整的情况下测试多个变体。 将五个变体与对照组进行比较就是五次测试,出现至少一个假阳性的概率远高于 5%。对此恰好有相应的修正方法。
将不显著的结果解读为没有效应。 检验效能不足的测试无论是否存在效应都会一无所获。请报告置信区间,以便读者能够看到哪些效应量仍然是合理的。
遗漏效应量。 显著性表明效应可能不为零。只有效应量才能说明是否值得为此采取行动,也只有置信区间才能显示你对该效应量的定位有多精准。
如何使用 Powerdrill Bloom 对你自己的数据进行显著性测试
步骤 1:上传你的数据
上传结果文件——实验导出数据、调查问卷回复或交易记录。Powerdrill Bloom 会对列进行分析,因此在运行任何测试之前,组大小和缺失值都是可见的。
步骤 2:用自然语言描述测试
陈述你正在比较的内容以及它属于哪种度量指标。比较这两组之间的转化率,并说明差异是否显著。在要求提供 p-value 的同时,也要求提供效应量和置信区间。此外,还要询问该测试的假设是否适用于此数据,而不是直接默认其适用。
步骤 3:导出图表、报告或幻灯片
提取对比图表、包含 p-value 和置信区间的表格,或用于评审的书面总结。
结论
统计学显著性回答了一个狭窄的问题:这个结果有可能是仅仅由巧合引起的吗?它在这方面确实有用,但在人们要求它做的其他所有事情上都毫无用处。0.05 的阈值只是一个惯例,显著的结果可能微不足道,而不显著的结果也并不能证明什么都没有发生。
结合效应量和置信区间一起阅读,它才能发挥真正的作用。如果你想在不手动设置测试的情况下获得这三项指标,请在你的结果文件上尝试 Powerdrill Bloom。另请参阅我们的自动洞察页面、无需统计学家即可分析 A/B 测试结果指南、运行描述性统计以及使用 AI 进行 t 检验。
常见问题解答
用通俗的话来说,统计学显著是什么意思?
它的意思是,如果不存在实际效应,该结果就不太可能出现。这并不意味着效应很大或很重要——仅仅意味着单凭巧合很难解释你所观察到的现象。
什么是 p-value?
在假设零假设为真的前提下,观察到至少与你的数据同样极端的数据的概率。它不是你的假设正确的概率,也不是结果纯属偶然的概率。
为什么使用 0.05 作为显著性水平?
它是 20 世纪初统计实践中的一个惯例,而不是推导出来的数值。由于它是任意设定的,因此 0.049 的 p-value 和 0.051 的 p-value 尽管处于分界线的两侧,但它们代表的证据几乎完全相同。
结果可以是显著的但不重要吗?
是的,这在大样本中经常发生。足够大的样本量会使微小的差异在统计学上变得显著,这就是为什么应该始终在 p-value 旁报告效应量的原因。
如果我的结果不显著,这意味着什么?
这意味着你的数据没有提供反对零假设的强有力证据,并不意味着零假设就是真的。检验效能不足的测试可能会完全遗漏真实的效应,因此无结果往往只是说明样本量不够。