Super Sale WeekClaude Skills — 20% OFF
Tips

如何無需統計學家也能分析 A/B 測試結果(2026 年指南)

Powerdrill Team·
如何無需統計學家也能分析 A/B 測試結果(2026 年指南)

要分析 A/B 測試結果,請比較兩組在單一主要指標上的表現。檢查差距是否大於正常的隨機變異,然後指出真實差異可能落入的範圍。Excel 可以處理這些運算,但圍繞在運算之外的判斷決策,通常才是出錯的地方。

本指南涵蓋了在查看數據之前需要收集哪些資料,以及如何手動進行測試。同時也會說明手動方法的局限性,以及如何誠實地解讀測試結果。

在解讀測試之前,您需要準備好什麼

有四個要素決定了測試結果是否有意義。請先收集這些要素。

在測試執行前就選定的一個主要指標。轉換率、每位訪客營收或啟用率。請提前挑選。在看到資料後才選擇指標,只是團隊用來自我說服「我們贏了」的手段。

原始計數,而非僅有百分比。在 200 名訪客中提升 3% 與在 200,000 名訪客中提升 3% 意義完全不同。您需要知道分母。

完整的測試週期。不完整的週數會扭曲結果,因為工作日和週末的行為模式不同。請以整週為單位執行測試。

變更內容的記錄。每次測試僅限一個變數。如果您同時修改了標題和按鈕顏色,沒有任何統計方法能將它們的影響區分開來。

如果缺少這四個要素中的任何一個,請在開始運算前止步。在有瑕疵的測試上進行精準的計算,依然只會得出一個讓人信以為真的錯誤答案。

每個 A/B 測試都要回答的兩個問題

每個結果都可以歸結為兩個問題,而這兩個問題很容易混淆。

這個差異是真實存在的嗎?這是有關顯著性的問題。它探討的是:如果兩個版本的實際表現完全相同,出現這麼大差距的可能性有多大?p 值回答了這個問題。通常的慣例是,低於 0.05 即代表機率低到足以採取行動。

這個差異大到值得關注嗎?這是效果量(effect size)的問題。信賴區間透過提供真實差異可能落入的範圍來回答這個問題。統計上顯著但僅有 0.2% 的提升,可能仍不值得投入工程開發成本。

測試結果顯著但提升幅度極微,是常見且代價高昂的誤讀。請依序回答這兩個問題。同時報告這兩個數值,因為如果團隊只聽到 p 值,就會把每個顯著的結果都當作可以上線的方案。

在 Excel 中手動計算的方法

Excel 本身就能處理這些計算。具體方法取決於您要測試的指標類型。

將兩組數據並排呈現

每個變體各佔一欄。對於像每位訪客營收這樣的連續指標,每一列代表一位訪客的數值。對於轉換率,每一列則是 1 或 0。請保留原始資料列而非僅保留摘要,因為公式需要底層的數據分佈。

針對連續指標使用 T.TEST

T.TEST(array1, array2, tails, type) 會傳回與 Student's t-test 相關的機率。除非您事先決定只計算單向,否則請使用 tails = 2。至於 type,成對樣本請使用 1,兩組具有等變異數時請使用 2,異變異數時請使用 3。對於大多數網站測試,雙樣本異變異數(type = 3)是較安全的預設值。

該公式會直接傳回 p 值。微軟的 T.TEST 函數說明頁面詳細記錄了這些引數。

轉換率需要不同的處理方式

轉換率是比例,而非連續度量。標準方法是雙比例 z 檢定(two-proportion z-test),而 Excel 沒有單一函數可以處理。您有兩種可行的選擇。

透過合併比例和標準誤差手動建立 z 檢定,然後使用 NORM.S.DIST 將分數轉換為 p 值。或者,將計數排列成一個二乘二的表格,呈現各變體的「已轉換」與「未轉換」人數。計算期望值,然後使用 CHISQ.TEST 取得 p 值。

這兩種方法都可行。但每次測試結構改變時,兩者都需要重新建構。

手動方法的局限性

有三件事必定會讓手動方法失效。

僅憑 p 值無法告訴您提升的幅度,因此您仍需要另外計算信賴區間。多個指標會使您的偽陽性率(false-positive rate)倍增,而試算表中沒有任何機制會對此發出警告。此外,每次進行新測試,都意味著必須針對格式不同的匯出資料重新建構相同的公式。

還有第四個容易被忽略的成本:建立該試算表的人,會成為唯一能夠檢查它的人。

如果只做一次測試,手動方法還算可行。但如果是每週都要執行的測試計畫,您一年就得重新建構同一個試算表五十次。

如何使用 Powerdrill Bloom 分析 A/B 測試結果

如果您的測試資料已經存在於匯出的檔案中,您可以跳過組合公式的步驟。

步驟 1:上傳您的測試資料

拖放從測試工具或資料庫匯出的 Excel、CSV 或 TSV 檔案。支援同時載入多個檔案,因此可以在一次操作中比較事件檔案和使用者檔案。系統會在上傳時自動進行欄位偵測與清理。

將 A/B 測試結果上傳至 Powerdrill Bloom 進行顯著性分析

步驟 2:用自然語言描述比較需求

像對同事說話一樣提出您的問題。例如:「比較變體 A 和 B 之間的轉換率,告訴我差異是否顯著,並提供信賴區間。」代理(agent)會根據指標類型選擇合適的檢定方法,報告 p 值和區間,並解釋其所使用的檢定。若要求進行細分客群(segment)分析,它會直接重新執行,而不需要您重新建構。

步驟 3:匯出圖表、報告或簡報

將結果匯出為圖表、整合到書面摘要中,或將畫布轉換為簡報投影片以進行匯報。Professional、Business 和 Fancy 風格皆可匯出至 PowerPoint 或 Notion。在視覺化方面,資料視覺化工具也支援從同一次上傳中產生其他類型的圖表。

在 Powerdrill Bloom 中將 A/B 測試匯報結果匯出為簡報投影片

如何在不誇大效果的情況下解讀結果

您看到的內容 代表的意義 不代表的意義
p = 0.03 在沒有真實差異的情況下,出現這麼大的差距機率極低 不代表有 97% 的機率 B 比較好
p = 0.20 沒有足夠的證據做出結論 不代表證明了兩個版本完全相同
區間為 -1% 至 +6% 真實的提升幅度可能是負值 不代表提升了 2.5%,即使那是中位數
結果顯著但提升幅度僅 0.2% 差異是真實存在的,但可能不值得上線 這本身並不代表商業上的成功
在八個指標中只有一個顯著 這大約只是純粹巧合產生的結果 這稱不上是發現

捨入數值時也要誠實。將提升幅度報告到小數點後兩位,暗示了樣本大小根本無法支持的精確度。

請將結論寫成包含範圍的句子。例如「變體 B 將轉換率提升了介於 1% 到 5% 之間」是誠實的說法。而「變體 B 勝出」則不然,除非信賴區間完全大於零。

常見錯誤

在測試剛呈現顯著時就停止。反覆檢查並在第一個看似不錯的時刻停止,會嚴重推高偽陽性率。請事先決定好樣本大小和結束日期,然後耐心等待。

測試了八個指標並只報告勝出的那個。當指標足夠多時,總會有一些指標純粹因為運氣而跨過 0.05 的門檻。請事先指定主要指標,並將其餘指標視為背景參考。

忽略分母。小樣本容易產生看似驚人的百分比波動。請務必在比率旁邊顯示實際計數。

事後不斷細分數據,直到找到顯著結果為止。依裝置、國家和管道不斷切分數據,直到某個細分群體呈現顯著,這只是換湯不換藥的相同問題。請預先登記您關注的細分客群。

比較本就無法相比的組別。如果流量分配不均,或者不同變體在不同日期執行,測量到的差異就會包含這些不平衡因素。

將無顯著差異的結果視為失敗。未顯示出差異的測試也是真實且有價值的資訊。它能避免您上線一個耗費心力卻毫無回報的變更。

簡報版本

分析 A/B 測試結果歸結為兩個答案:差異是否真實存在,以及差異是否大到值得關注。Excel 透過 T.TEST 提供第一個答案,但需要您自行組合出第二個答案。比例與連續指標需要不同的檢定方法,而這正是大多數人忽略的步驟。

如果您定期執行測試,重新建構試算表就是最值得省去的步驟。免費試用 Powerdrill Bloom —— 上傳匯出的檔案,用自然語言要求進行比較,然後匯出匯報結果。關於工具選擇,請參閱用於 A/B 測試分析的 AI 工具;關於基礎準備工作,請參閱如何執行敘述性統計

常見問題

我該如何知道我的 A/B 測試結果是否顯著?

比較兩組在主要指標上的表現並計算 p 值。低於 0.05 通常是判定差異不太可能是巧合的門檻。請將其與信賴區間結合使用,因為單憑顯著性無法說明差異有多大。

我可以在 Excel 中分析 A/B 測試結果嗎?

可以。對於每位訪客營收等連續指標,請使用 T.TEST。轉換率是比例,因此需要進行雙比例 z 檢定,或對二乘二的計數表進行卡方檢定。Excel 沒有針對雙比例檢定的單一內建函數。

A/B 測試需要多少樣本大小?

這取決於您的基準率(baseline rate)以及值得偵測的最小提升幅度。預期提升幅度越小,需要的樣本量就越大。請在啟動前計算好目標樣本數,然後執行到該數量為止,而不是在結果看起來不錯時就停止。

p 值實際上告訴了我什麼?

它提供了在兩個版本實際表現相同的情況下,觀察到至少如此大差異的機率。低 p 值意味著巧合並非合理的解釋。它並不代表您的變體比較好的機率。

為什麼我的 A/B 測試顯示沒有差異?

有三個常見原因:樣本量太小而無法偵測到效果、變更太過細微而無法改變行為,或者實際上真的沒有差異。無顯著差異的結果也是一項真實的發現,它能保護您免於上線一個毫無回報的變更。