什麼是統計顯著性?定義、範例與限制 (2026)

統計顯著性意味著,在假設沒有真實效果的情況下,結果不太可能單純因巧合而產生。通常當 p 值低於 0.05 時,就會宣稱具有顯著性。該門檻是為了便利而採用的慣例,並非自然界的本質。顯著的結果也不等同於重要的結果。
這兩句話涵蓋了該概念在實務上出錯的大部分情況。團隊將 0.05 視為及格分數,並將顯著性視為影響力的證明,而這兩種解讀都會導致在極少依據下做出充滿自信的決策。
本指南將介紹 p 值實際回答了什麼問題、該門檻從何而來,以及如何建立檢定。最後會說明顯著性真正無法告訴您的四件事。
什麼是統計顯著性?
統計顯著性是關於「出乎意料程度」的陳述,而非關於「真理」。您首先要假設什麼都沒發生——即兩組數據完全相同,或變數之間毫無關係。這個假設就是虛無假說。
接著您要問:如果虛無假說為真,我看到至少與我的資料一樣極端的資料的頻率有多高?如果答案是「極少」,那麼觀察到的資料就很難與該假設相容,您就會拒絕它。
這就是完整的邏輯。請注意它不包含什麼。它沒有陳述效果有多大、您的假說有多大機率為真,或者該結果是否對任何人有影響。
What the p-value actually answers
p 值是在假設虛無假說為真的前提下,觀察到至少與您的資料一樣極端的資料的機率。
這個條件子句承載了所有的分量,但幾乎總是被人忽略。0.03 的 p 值並不代表結果有 3% 的機率是僥倖得來的。它也不代表您的假說有 97% 的機率是正確的。它的意思是:如果真的沒有效果,大約有 3% 的時間會出現如此極端的資料。
這種區別聽起來很學術,直到它改變了決策。在一個完全沒有真實效果的資料集上進行 20 次獨立檢定,您仍然會得到大約一個「顯著」的結果。什麼都沒有的 5% 依然是有些東西。這不是數學上的缺陷,這正是 5% 門檻的含意。
0.05 門檻從何而來
這並非推導出來的。0.05 的分界點是透過 20 世紀初統計實務中的慣例進入常用範疇,並因為使用方便且其他人都在使用而保留了下來。
這對於您如何解讀臨界結果至關重要。0.049 的 p 值和 0.051 的 p 值所描述的證據幾乎完全相同,然而一個被稱為顯著,另一個則不然。將該界線視為真實與不真實之間的硬性分水嶺,是該概念最常見的誤用。
請報告實際的 p 值,而不僅僅是它是否過關。讀者可以自行判斷證據有多強。
如何檢定顯著性
虛無假說
在查看結果之前,精確地陳述「無效果」的假設。「版本 B 的轉換率與版本 A 相同」是可檢定的。「版本 B 更好」則不可檢定,因為它沒有說明什麼樣的情況會被視為反對它的證據。
檢定統計量
選擇與資料相符的檢定。比較兩組平均值通常需要進行 t 檢定;比較比例則需要進行 z 檢定或針對列聯表進行卡方檢定。使用錯誤的檢定會產生一個看起來合法但實際上並非如此的數字。
p 值與決策
檢定會將您的資料轉換為 p 值。請將其與您在執行檢定之前設定的門檻進行比較。在事後選擇門檻,或重複執行檢定直到通過,都會使整個程序失效。
統計顯著性 vs. 實質顯著性
| 統計顯著性 | 實質顯著性 | |
|---|---|---|
| 回答的問題 | 這可能是巧合嗎? | 這值得採取行動嗎? |
| 取決於樣本大小 | 極度依賴 | 完全不影響 |
| 表示方式 | p 值 | 效果量、信賴區間 |
| 達成方式 | 收集更多資料 | 僅能透過真實效果 |
最後一行是需要牢記的重點。只要樣本量夠大,幾乎任何差異都會在統計上變得顯著,包括微小到無關緊要的差異。在一千萬名使用者中,0.02% 的轉換率提升可以通過您設定的任何門檻,但它仍然不值得投入工程時間。
這就是為什麼效果量應該與每個 p 值並列。顯著性表示效果可能不為零;效果量則說明是否有人應該在乎。
統計顯著性無法告訴您的事
效果有多大。 無論潛在差異的大小如何,p 值都會隨著樣本大小的增加而變小。它並非衡量幅度的指標。
您的假說有多大機率是正確的。 p 值是在假設虛無假說成立的情況下計算出來的。它無法反過來告訴您該假說不成立的機率。要回答這個問題,需要一個完全不同的框架。
結果是否可以重現。 單一樣本中的單一顯著結果是微弱的證據。重現性才是將其轉化為研究發現的關鍵。
研究設計是否完善。 顯著性檢定假設資料是以正確方式收集的。有偏差的樣本會產生一個「信心十足地顯著、信心十足地錯誤」的答案,事後再怎麼進行嚴謹的統計分析也無法彌補。
報告顯著性時的常見錯誤
僅報告是否通過 0.05。 請公布實際的 p 值。「p = 0.048」和「p = 0.052」能告訴讀者的資訊,遠比「顯著」和「不顯著」多得多。這兩個標籤暗示了實際上並不存在的證據差異。
持續執行檢定直到通過。 每天檢查結果,並在 p 值降至門檻以下時停止,這保證了最終一定會得到顯著的結果,無論是否存在真實效果。請提前固定樣本大小。
在未進行調整的情況下檢定多個變體。 將五個變體與對照組進行比較就是五次檢定,而至少出現一次偽陽性的機率遠高於 5%。這正是需要進行校正的原因。
將不顯著的結果解讀為沒有效果。 檢定力不足的檢定無論是否存在效果都會一無所獲。請報告信賴區間,以便讀者了解哪些效果量仍然是合理的。
遺漏效果量。 顯著性表示效果可能不為零。只有效果量能說明是否值得採取行動,也只有信賴區間能顯示您對該效果量的估計有多精確。
如何使用 Powerdrill Bloom 對您自己的資料進行顯著性檢定
步驟 1:上傳您的資料
上傳結果檔案——實驗匯出資料、問卷回覆或交易記錄。Powerdrill Bloom 會分析欄位特徵,因此在執行任何檢定之前,組別大小和缺失值都是可見的。
步驟 2:用自然語言描述檢定
說明您要比較什麼以及它是哪種度量指標。比較這兩個組別之間的轉換率,並說明差異是否顯著。在要求提供 p 值的同時,也要求提供效果量和信賴區間。此外,也要詢問該檢定的假設是否適用於此資料,而不是直接假設它們適用。
步驟 3:匯出圖表、報告或簡報
匯出比較圖表、包含 p 值和信賴區間的表格,或用於審查的書面摘要。
結論
統計顯著性回答了一個狹隘的問題:這個結果有可能單純來自巧合嗎?它在這方面確實有用,但在人們要求它做的其他所有事情上都毫無用處。0.05 的門檻只是一個慣例,顯著的結果可能微不足道,而不顯著的結果也不能證明什麼都沒發生。
與效果量和信賴區間結合閱讀時,它能發揮真正的作用。如果您想在不手動設定檢定的情況下獲得這三項指標,請對您的結果檔案嘗試使用 Powerdrill Bloom。另請參閱我們的自動洞察頁面、無需統計學家即可分析 A/B 測試結果指南、執行敘述性統計,以及使用 AI 進行 t 檢定。
常見問題
用簡單的話來說,統計上顯著是什麼意思?
這意味著如果沒有真實效果,該結果就不太可能出現。這並不代表效果很大或很重要——僅代表單純的巧合無法很好地解釋您所觀察到的現象。
什麼是 p 值?
在假設虛無假說為真的前提下,觀察到至少與您的資料一樣極端的資料的機率。它不是您的假說正確的機率,也不是結果純屬僥倖的機率。
為什麼使用 0.05 作為顯著水準?
這是 20 世紀初統計實務中的慣例,而非推導出來的數值。因為它是任意設定的,所以 0.049 的 p 值和 0.051 的 p 值儘管落在界線的兩側,但代表的證據幾乎完全相同。
結果是否可能顯著但不重要?
是的,這在大樣本中經常發生。足夠大的樣本會使微小的差異在統計上變得顯著,這就是為什麼應該始終在 p 值旁報告效果量。
如果我的結果不顯著,這代表什麼?
這代表您的資料沒有提供反對虛無假說的強力證據,並不代表虛無假說為真。檢定力不足的檢定可能會完全遺漏真實的效果,因此無結果往往是關於樣本大小的陳述。