如何無需統計學家也能分析 A/B 測試結果(2026 年指南)

要分析 A/B 測試結果,請比較兩組在單一主要指標上的表現。檢查差距是否大於正常的隨機變異,然後指出真實差異可能落入的範圍。Excel 可以處理這些運算,但圍繞在運算之外的判斷決策,通常才是出錯的地方。
本指南涵蓋了在查看數據之前需要收集哪些資料,以及如何手動進行測試。同時也會說明手動方法的局限性,以及如何誠實地解讀測試結果。
在解讀測試之前,您需要準備好什麼
有四個要素決定了測試結果是否有意義。請先收集這些要素。
在測試執行前就選定的一個主要指標。轉換率、每位訪客營收或啟用率。請提前挑選。在看到資料後才選擇指標,只是團隊用來自我說服「我們贏了」的手段。
原始計數,而非僅有百分比。在 200 名訪客中提升 3% 與在 200,000 名訪客中提升 3% 意義完全不同。您需要知道分母。
完整的測試週期。不完整的週數會扭曲結果,因為工作日和週末的行為模式不同。請以整週為單位執行測試。
變更內容的記錄。每次測試僅限一個變數。如果您同時修改了標題和按鈕顏色,沒有任何統計方法能將它們的影響區分開來。
如果缺少這四個要素中的任何一個,請在開始運算前止步。在有瑕疵的測試上進行精準的計算,依然只會得出一個讓人信以為真的錯誤答案。
每個 A/B 測試都要回答的兩個問題
每個結果都可以歸結為兩個問題,而這兩個問題很容易混淆。
這個差異是真實存在的嗎?這是有關顯著性的問題。它探討的是:如果兩個版本的實際表現完全相同,出現這麼大差距的可能性有多大?p 值回答了這個問題。通常的慣例是,低於 0.05 即代表機率低到足以採取行動。
這個差異大到值得關注嗎?這是效果量(effect size)的問題。信賴區間透過提供真實差異可能落入的範圍來回答這個問題。統計上顯著但僅有 0.2% 的提升,可能仍不值得投入工程開發成本。
測試結果顯著但提升幅度極微,是常見且代價高昂的誤讀。請依序回答這兩個問題。同時報告這兩個數值,因為如果團隊只聽到 p 值,就會把每個顯著的結果都當作可以上線的方案。
在 Excel 中手動計算的方法
Excel 本身就能處理這些計算。具體方法取決於您要測試的指標類型。
將兩組數據並排呈現
每個變體各佔一欄。對於像每位訪客營收這樣的連續指標,每一列代表一位訪客的數值。對於轉換率,每一列則是 1 或 0。請保留原始資料列而非僅保留摘要,因為公式需要底層的數據分佈。
針對連續指標使用 T.TEST
T.TEST(array1, array2, tails, type) 會傳回與 Student's t-test 相關的機率。除非您事先決定只計算單向,否則請使用 tails = 2。至於 type,成對樣本請使用 1,兩組具有等變異數時請使用 2,異變異數時請使用 3。對於大多數網站測試,雙樣本異變異數(type = 3)是較安全的預設值。
該公式會直接傳回 p 值。微軟的 T.TEST 函數說明頁面詳細記錄了這些引數。
轉換率需要不同的處理方式
轉換率是比例,而非連續度量。標準方法是雙比例 z 檢定(two-proportion z-test),而 Excel 沒有單一函數可以處理。您有兩種可行的選擇。
透過合併比例和標準誤差手動建立 z 檢定,然後使用 NORM.S.DIST 將分數轉換為 p 值。或者,將計數排列成一個二乘二的表格,呈現各變體的「已轉換」與「未轉換」人數。計算期望值,然後使用 CHISQ.TEST 取得 p 值。
這兩種方法都可行。但每次測試結構改變時,兩者都需要重新建構。
手動方法的局限性
有三件事必定會讓手動方法失效。
僅憑 p 值無法告訴您提升的幅度,因此您仍需要另外計算信賴區間。多個指標會使您的偽陽性率(false-positive rate)倍增,而試算表中沒有任何機制會對此發出警告。此外,每次進行新測試,都意味著必須針對格式不同的匯出資料重新建構相同的公式。
還有第四個容易被忽略的成本:建立該試算表的人,會成為唯一能夠檢查它的人。
如果只做一次測試,手動方法還算可行。但如果是每週都要執行的測試計畫,您一年就得重新建構同一個試算表五十次。
如何使用 Powerdrill Bloom 分析 A/B 測試結果
如果您的測試資料已經存在於匯出的檔案中,您可以跳過組合公式的步驟。
步驟 1:上傳您的測試資料
拖放從測試工具或資料庫匯出的 Excel、CSV 或 TSV 檔案。支援同時載入多個檔案,因此可以在一次操作中比較事件檔案和使用者檔案。系統會在上傳時自動進行欄位偵測與清理。
步驟 2:用自然語言描述比較需求
像對同事說話一樣提出您的問題。例如:「比較變體 A 和 B 之間的轉換率,告訴我差異是否顯著,並提供信賴區間。」代理(agent)會根據指標類型選擇合適的檢定方法,報告 p 值和區間,並解釋其所使用的檢定。若要求進行細分客群(segment)分析,它會直接重新執行,而不需要您重新建構。
步驟 3:匯出圖表、報告或簡報
將結果匯出為圖表、整合到書面摘要中,或將畫布轉換為簡報投影片以進行匯報。Professional、Business 和 Fancy 風格皆可匯出至 PowerPoint 或 Notion。在視覺化方面,資料視覺化工具也支援從同一次上傳中產生其他類型的圖表。
如何在不誇大效果的情況下解讀結果
| 您看到的內容 | 代表的意義 | 不代表的意義 |
|---|---|---|
| p = 0.03 | 在沒有真實差異的情況下,出現這麼大的差距機率極低 | 不代表有 97% 的機率 B 比較好 |
| p = 0.20 | 沒有足夠的證據做出結論 | 不代表證明了兩個版本完全相同 |
| 區間為 -1% 至 +6% | 真實的提升幅度可能是負值 | 不代表提升了 2.5%,即使那是中位數 |
| 結果顯著但提升幅度僅 0.2% | 差異是真實存在的,但可能不值得上線 | 這本身並不代表商業上的成功 |
| 在八個指標中只有一個顯著 | 這大約只是純粹巧合產生的結果 | 這稱不上是發現 |
捨入數值時也要誠實。將提升幅度報告到小數點後兩位,暗示了樣本大小根本無法支持的精確度。
請將結論寫成包含範圍的句子。例如「變體 B 將轉換率提升了介於 1% 到 5% 之間」是誠實的說法。而「變體 B 勝出」則不然,除非信賴區間完全大於零。
常見錯誤
在測試剛呈現顯著時就停止。反覆檢查並在第一個看似不錯的時刻停止,會嚴重推高偽陽性率。請事先決定好樣本大小和結束日期,然後耐心等待。
測試了八個指標並只報告勝出的那個。當指標足夠多時,總會有一些指標純粹因為運氣而跨過 0.05 的門檻。請事先指定主要指標,並將其餘指標視為背景參考。
忽略分母。小樣本容易產生看似驚人的百分比波動。請務必在比率旁邊顯示實際計數。
事後不斷細分數據,直到找到顯著結果為止。依裝置、國家和管道不斷切分數據,直到某個細分群體呈現顯著,這只是換湯不換藥的相同問題。請預先登記您關注的細分客群。
比較本就無法相比的組別。如果流量分配不均,或者不同變體在不同日期執行,測量到的差異就會包含這些不平衡因素。
將無顯著差異的結果視為失敗。未顯示出差異的測試也是真實且有價值的資訊。它能避免您上線一個耗費心力卻毫無回報的變更。
簡報版本
分析 A/B 測試結果歸結為兩個答案:差異是否真實存在,以及差異是否大到值得關注。Excel 透過 T.TEST 提供第一個答案,但需要您自行組合出第二個答案。比例與連續指標需要不同的檢定方法,而這正是大多數人忽略的步驟。
如果您定期執行測試,重新建構試算表就是最值得省去的步驟。免費試用 Powerdrill Bloom —— 上傳匯出的檔案,用自然語言要求進行比較,然後匯出匯報結果。關於工具選擇,請參閱用於 A/B 測試分析的 AI 工具;關於基礎準備工作,請參閱如何執行敘述性統計。
常見問題
我該如何知道我的 A/B 測試結果是否顯著?
比較兩組在主要指標上的表現並計算 p 值。低於 0.05 通常是判定差異不太可能是巧合的門檻。請將其與信賴區間結合使用,因為單憑顯著性無法說明差異有多大。
我可以在 Excel 中分析 A/B 測試結果嗎?
可以。對於每位訪客營收等連續指標,請使用 T.TEST。轉換率是比例,因此需要進行雙比例 z 檢定,或對二乘二的計數表進行卡方檢定。Excel 沒有針對雙比例檢定的單一內建函數。
A/B 測試需要多少樣本大小?
這取決於您的基準率(baseline rate)以及值得偵測的最小提升幅度。預期提升幅度越小,需要的樣本量就越大。請在啟動前計算好目標樣本數,然後執行到該數量為止,而不是在結果看起來不錯時就停止。
p 值實際上告訴了我什麼?
它提供了在兩個版本實際表現相同的情況下,觀察到至少如此大差異的機率。低 p 值意味著巧合並非合理的解釋。它並不代表您的變體比較好的機率。
為什麼我的 A/B 測試顯示沒有差異?
有三個常見原因:樣本量太小而無法偵測到效果、變更太過細微而無法改變行為,或者實際上真的沒有差異。無顯著差異的結果也是一項真實的發現,它能保護您免於上線一個毫無回報的變更。