Super Sale WeekClaude Skills — 20% OFF
Tips

如何免寫程式找出資料集中的離群值(2026年指南)

Powerdrill Team·
如何免寫程式找出資料集中的離群值(2026年指南)

您無需編寫程式碼,即可使用 IQR 規則、z 分數或箱形圖來找出離群值——這三種方法都適用於試算表。IQR 規則會標記超出四分位數 1.5 倍四分位距的值;z 分數則會標記距離平均值超過三個標準差的值。它們經常會得出不同的結果,而了解其中的原因才是真正的關鍵技能。

找出離群值只是簡單的前半部分。決定如何處理它,才是決定您的分析是否誠實客觀的關鍵,而沒有任何一種方法能替您解答這個問題。

本指南將說明為什麼這兩種標準方法會得出不同的結果,並介紹三種無需程式碼即可偵測離群值的方法。接著,我們將探討如何決定某個離群值應該被刪除、保留還是單獨報告。

為什麼處理離群值不只是「刪除它們」那麼簡單

這兩種標準方法在設計上本就不同

IQR 規則是根據四分位數(即位置)來運作的。它不在乎數值有多極端,只在乎它在排序後的位置。這使得它不易受到其正在尋找的離群值所干擾或扭曲。

z 分數則是根據平均值和標準差來計算的,而這兩者都會受到極端值的拉扯。一個極大的數值會拉高標準差,進而縮小每個 z 分數(包括它自己的 z 分數)。在小型資料集中,單一極端的離群值就可能透過這種方式隱藏自己。

這就是為什麼同一個欄位在 IQR 規則下可能會顯示四個離群值,而在 z 分數下卻只有一個。這些方法並非自相矛盾,而是它們測量的是不同的東西。

這項決策並非統計學問題

在一個平均訂單金額為 $200 的檔案中,一筆 $2 million 的交易會被所有方法標記。但是否應該將其刪除,取決於任何統計方法都無法獲取的實際背景資訊。

如果這是小數點點錯的輸入錯誤,請將其刪除。如果這是一筆真實的企業交易,刪除它就會將您最重要的客戶從分析中排除。如果這是某人忘記清除的測試交易,請將其刪除並檢查是否有其他類似交易。三種不同的處理方式,對應的卻是完全相同的標記。

分布形狀會打破基本假設

這兩種標準方法都假設資料大致呈鐘形分布。然而,收入、網頁瀏覽量、訂單金額和工作階段停留時間通常呈現右偏態(帶有長右尾),在這種情況下,高數值是常態而非異常。

如果對這類欄位套用 z 分數規則,您會標記出大量完全正常的資料。解決方法是先檢查分布形狀,並考慮進行對數轉換或改用基於百分位數的切點。

不當處理離群值的代價

無法代表任何人的平均值。 單一極端值就足以拉動平均值,使其偏離大多數資料實際所在的範圍。而決策卻是根據這個數字做出的。

軸線難以閱讀的圖表。 一個比其他數值大十倍的值會將所有其他資料壓縮到靠近底部的一條扁平線上。該圖表在技術上是正確的,但無法傳達任何資訊。

悄悄刪除。 最糟糕的結果是有人在分享檔案之前,悄悄刪除了不合適的資料列。下游的任何人都不知道基準已經改變,且結果無法被複現。

三種無需程式碼即可找出離群值的方法

選項 1:IQR 規則

使用 QUARTILE 函數獲取第一和第三四分位數,然後相減得到四分位距。標記任何低於 Q1 減去 1.5 × IQR 或高於 Q3 加上 1.5 × IQR 的值。

這被作為預設方法是有原因的:它對極端值具有抗性,且不需要任何分布假設。但在嚴重偏態的資料上,它仍會過度標記右尾,因此在相信統計數量之前,請先檢查分布形狀。

選項 2:z 分數

使用 STDEV.P 計算平均值和標準差,然後計算每個值距離平均值有多少個標準差。通常以超過三個標準差作為閾值。

這在大致對稱的資料上效果很好,並且能為您提供偏離幅度,而不僅僅是「是或否」的標記,這對於排序非常有用。但在小樣本和偏態欄位上,此方法並不可靠。

選項 3:箱形圖

將欄位繪製為箱形圖,並讀取超出鬚線的點。Excel 的箱形圖採用相同的 1.5 × IQR 慣例,因此結果與選項 1 一致。不同之處在於,您可以同時看到分布形狀。

這是檢查另外兩種方法是否適用的最快方式。如果箱體緊貼一端且帶有長尾,請對任何閾值規則保持懷疑態度。

這三種方法共同面臨的瓶頸

每種方法都會返回一個被標記的資料列清單。但沒有任何一種方法能告訴您哪些標記是錯誤、哪些是真實的極端值,以及哪些標記僅代表欄位呈現偏態而非資料髒亂。

要解答這些問題,需要結合上下文來查看被標記的資料列。例如該列中還有哪些其他資訊、它們是否集中在某個時間段或某個來源系統,以及同一個客戶是否重複出現。這是調查,而非計算,也是實際耗費時間的地方。

如何使用 Powerdrill Bloom 尋找離群值

步驟 1:上傳您的資料

上傳 Excel 或 CSV 檔案。Powerdrill Bloom 會在檔案匯入時對每個欄位進行分析,因此在您選擇偵測方法之前,分布形狀和極端值就已清晰可見。

上傳試算表以使用 Powerdrill Bloom 尋找資料集中的離群值

步驟 2:使用自然語言描述檢查需求

直接提問:標記此欄位中超出 1.5 倍四分位距的值,然後顯示完整的資料列以便我查看上下文。接著提出有助於做出決策的後續問題,例如被標記的資料列是否按日期或來源聚集、相同的識別碼是否重複出現,以及如果排除這些資料,摘要統計資料會如何變化。

步驟 3:匯出圖表、報告或簡報

匯出箱形圖、包含上下文的已標記資料列資料表,或是記錄了哪些資料列被排除及其原因的書面說明。

從 Powerdrill Bloom 匯出的帶有標記離群值列的箱形圖

為什麼這比手動偵測更好

試算表方法 Powerdrill Bloom
比較 IQR 和 z 分數結果 兩組公式,手動比對 直接要求兩者
查看標記值周圍的上下文 篩選並滾動瀏覽 隨資料列一同返回
先檢查分布形狀 建立直方圖 上傳時自動分析
測試排除後的影響 複製工作表 直接要求提供兩種版本

最後一列最為關鍵。處理模糊不清的離群值,最誠實的方法是同時報告包含與排除該值的結果。讓讀者看清結論是否取決於單一資料列。在試算表中,這種對比需要重新建構資料,這也是為什麼人們通常不會這麼做的原因。

最佳實踐:決定如何處理離群值

排除前先調查。 查看整行資料。在單一欄位中,點錯的小數點、測試記錄和真實的大客戶看起來完全一樣。

絕不悄悄刪除。 如果您排除了某些資料列,請在呈現結果的同一份文件中說明排除了多少列以及原因。在沒有任何說明的情況下更改基準的分析是無法被複現的。

在關鍵時刻報告兩種版本。 如果結論會因單一數值而發生逆轉,這本身就是一項發現,而不是一個需要被清理掉的麻煩。

在選擇閾值前先檢查分布形狀。 偏態欄位需要使用百分位數切點或對數轉換,而非 z 分數規則。

注意聚集現象。 在同一日期或來自同一來源的多個離群值,通常意味著資料管道(pipeline)出現問題,而非客戶真的異常。我們關於 清理與去重資料 的指南涵蓋了這種情況。

結論

無需程式碼尋找離群值主要歸結為三種工具。IQR 規則是具備抗性的預設方法;當您需要偏離幅度時,z 分數適用於大致對稱的資料;而箱形圖則可用於檢查這兩種假設是否成立。請預期它們會得出不同的結果,並將這種不一致視為有價值的資訊。

任何方法都無法替您做出的部分是決策。如果因為逐行調查太慢,導致您的離群值處理工作僅停留在標記欄位,不妨對該檔案 嘗試使用 Powerdrill Bloom。另請參閱我們的 AI 資料清理 頁面、執行敘述性統計 指南,以及 將 CSV 轉換為圖表

常見問題

在資料集中,什麼樣的值算作離群值?

按照慣例,是指超出第一或第三四分位數 1.5 倍四分位距的值,或是距離平均值超過三個標準差的值。這兩者都是慣例而非定律,適用哪一種取決於您的資料大致是對稱還是偏態分布。

如何在不編寫程式碼的情況下在 Excel 中尋找離群值?

使用 QUARTILE 建立 IQR 邊界並標記超出邊界的值,或者使用平均值和 STDEV.P 計算 z 分數。箱形圖能以視覺化方式提供相同的 IQR 結果,並同時顯示分布形狀。

我應該從分析中移除離群值嗎?

只有在確定其產生的原因後才應移除。輸入錯誤和測試記錄應該刪除;但真實的極端值通常不應該刪除,因為刪除它們會抹去真實的資訊。當情況模糊不清時,請同時報告兩種結果。

為什麼 IQR 和 z 分數會標記不同的值?

IQR 是根據四分位數運作的,極端值無法扭曲四分位數。z 分數則是根據平均值和標準差運作的,極端值確實會扭曲這兩者。一個足夠大的數值會拉高標準差,從而隱藏自己。

如果我的資料是偏態分布而非鐘形分布怎麼辦?

對於收入或訂單金額等偏態欄位,標準閾值會過度標記長尾部分。請使用基於百分位數的切點,或先對欄位進行對數轉換,並在選擇任何規則之前先檢查分布形狀。