Super Sale WeekClaude Skills — 20% OFF
Tips

코드 작성 없이 데이터셋에서 이상치를 찾는 방법 (2026년 가이드)

Powerdrill Team·
코드 작성 없이 데이터셋에서 이상치를 찾는 방법 (2026년 가이드)

코드를 작성하지 않고도 IQR 규칙, z-scores 또는 box plot을 사용하여 이상치를 찾을 수 있으며, 이 세 가지 방법 모두 스프레드시트에서 작동합니다. IQR 규칙은 사분위수 범위를 1.5배 벗어난 값을 표시하고, z-scores는 평균에서 표준편차의 3배를 초과하여 벗어난 값을 표시합니다. 이 두 방법은 자주 서로 다른 결과를 보여주며, 그 이유를 이해하는 것이 진짜 실력입니다.

이상치를 찾는 것은 쉬운 절반에 불과합니다. 이를 어떻게 처리할지 결정하는 것이 분석의 정직성을 결정하는 나머지 절반이며, 어떤 방법도 이를 대신 답해주지 않습니다.

이 가이드에서는 두 가지 표준 방법이 서로 다른 결과를 내는 이유와 코드 없이 이상치를 탐지하는 세 가지 방법을 다룹니다. 그런 다음, 특정 이상치를 제거해야 할지, 유지해야 할지, 아니면 별도로 보고해야 할지 결정하는 방법을 알아봅니다.

이상치 처리가 "그냥 삭제하기"보다 어려운 이유

두 표준 방법이 설계상 서로 다른 결과를 내는 이유

IQR 규칙은 위치 기준인 사분위수를 기반으로 작동합니다. 값이 얼마나 극단적인지는 신경 쓰지 않고, 정렬된 순서에서 어디에 위치하는지만 고려합니다. 덕분에 탐지하려는 바로 그 이상치에 의해 분석 결과가 왜곡되는 것을 방지할 수 있습니다.

Z-scores는 평균과 표준편차를 기반으로 작동하며, 이 두 가지 모두 극단적인 값의 영향을 받습니다. 하나의 거대한 값이 표준편차를 부풀리면, 그 값 자체를 포함하여 모든 z-score가 작아집니다. 소규모 데이터셋에서는 단 하나의 극단적인 이상치가 이런 방식으로 자신을 숨길 수 있습니다.

동일한 열에서 IQR 기준으로는 4개의 이상치가 나타나고 z-scores 기준으로는 1개만 나타날 수 있는 이유가 바로 이 때문입니다. 두 방법이 모순되는 것이 아니라, 서로 다른 것을 측정하고 있는 것입니다.

결정은 통계적인 영역이 아닙니다

평균 주문액이 $200인 파일에서 $2 million짜리 거래가 있다면 어떤 방법을 쓰든 이상치로 표시됩니다. 이를 제거해야 할지 여부는 그 어떤 통계적 방법으로도 알 수 없는 실제 사실 관계에 달려 있습니다.

소수점을 잘못 찍은 데이터 입력 오류라면 제거해야 합니다. 하지만 실제 기업 간 대형 계약이라면, 이를 제거하는 것은 분석에서 가장 중요한 고객을 삭제하는 결과를 낳습니다. 누군가 지우는 것을 깜빡한 테스트 거래라면 제거하고 다른 유사한 건이 없는지 확인해야 합니다. 동일한 이상치 표시에 대해 세 가지 서로 다른 조치가 필요한 것입니다.

분포의 형태가 가정을 깨뜨립니다

두 표준 방법 모두 데이터가 대략 종 모양을 이룬다고 가정합니다. 하지만 소득, 페이지 조회수, 주문 가치, 세션 시간 등은 대개 오른쪽으로 긴 꼬리를 가진 왜곡된 분포를 보이며, 여기서는 높은 값이 예외적인 것이 아니라 정상적인 현상입니다.

이러한 열에 z-score 규칙을 적용하면 지극히 평범한 데이터의 상당 부분이 이상치로 표시됩니다. 해결책은 먼저 분포의 형태를 확인하고, 로그 변환을 고려하거나 백분위수 기반의 기준을 사용하는 것입니다.

이상치를 방치할 때 치러야 할 대가

아무도 대변하지 못하는 평균. 단 하나의 극단적인 값이 평균을 크게 왜곡하여 대부분의 실제 데이터가 위치한 범위를 벗어나게 만들 수 있습니다. 그리고 의사결정은 바로 그 왜곡된 숫자를 바탕으로 내려지게 됩니다.

축을 읽을 수 없는 차트. 다른 값들보다 10배 큰 값 하나가 있으면 나머지 모든 데이터가 차트 바닥의 납작한 선으로 압축됩니다. 기술적으로는 정확한 차트일지 몰라도 아무런 정보도 전달하지 못합니다.

무단 삭제. 가장 최악의 상황은 누군가 파일을 공유하기 전에 불편한 행들을 조용히 삭제하는 것입니다. 후속 단계의 그 누구도 기준 데이터가 변경되었다는 사실을 알지 못하며, 그 결과는 재현할 수 없게 됩니다.

코드 없이 이상치를 찾는 세 가지 방법

옵션 1: IQR 규칙

Use QUARTILE 함수를 사용하여 1사분위수와 3사분위수를 구한 다음, 두 값을 빼서 사분위수 범위(IQR)를 구합니다. Q1에서 1.5 × IQR을 뺀 값보다 작거나, Q3에서 1.5 × IQR을 더한 값보다 큰 모든 값을 이상치로 표시합니다.

이 방법이 기본으로 사용되는 데는 이유가 있습니다. 극단적인 값에 영향을 받지 않고 분포에 대한 가정이 필요 없기 때문입니다. 다만 왜곡이 심한 데이터에서는 여전히 오른쪽 꼬리 부분을 과도하게 이상치로 표시할 수 있으므로, 탐지된 개수를 신뢰하기 전에 먼저 분포 형태를 확인하세요.

옵션 2: Z-scores

STDEV.P 함수로 평균과 표준편차를 계산한 다음, 각 값이 평균에서 표준편차의 몇 배만큼 떨어져 있는지 계산합니다. 보통 3을 초과하는 경우를 임계값으로 봅니다.

이 방법은 대략 대칭을 이루는 데이터에서 잘 작동하며, 단순한 여부 표시가 아닌 편차의 크기를 제공하므로 순위를 매길 때 유용합니다. 다만 표본 크기가 작거나 왜곡된 열에서는 신뢰하기 어렵습니다.

옵션 3: Box plot

열 데이터를 box plot으로 시각화하고 수염(whiskers)을 벗어난 점들을 확인합니다. Excel의 box plot은 동일한 1.5 × IQR 규칙을 사용하므로 결과는 옵션 1과 일치합니다. 차이점은 데이터의 분포 형태를 동시에 시각적으로 확인할 수 있다는 것입니다.

이 방법은 다른 두 방법이 적절한지 여부를 가장 빠르게 확인하는 방법입니다. 상자가 한쪽 끝에 바짝 붙어 있고 긴 꼬리가 늘어져 있다면, 임계값 규칙을 적용할 때 주의해야 합니다.

세 가지 방법 모두가 직면하는 한계

각 방법은 이상치로 표시된 행 목록을 반환할 뿐입니다. 어떤 표시가 오류인지, 어떤 것이 실제 극단값인지, 그리고 어떤 것이 데이터가 오염된 것이 아니라 단지 열이 왜곡된 분포를 가졌기 때문인지 알려주지 않습니다.

이에 답하려면 표시된 행들을 맥락 속에서 살펴보아야 합니다. 해당 행에 다른 어떤 데이터가 있는지, 특정 기간이나 특정 소스 시스템에 몰려 있는지, 동일한 고객이 반복해서 나타나는지 등을 확인해야 합니다. 이는 계산이 아닌 조사 영역이며, 실제로 가장 많은 시간이 소요되는 단계입니다.

Powerdrill Bloom으로 이상치를 찾는 방법

1단계: 데이터 업로드하기

Excel 또는 CSV 파일을 업로드합니다. Powerdrill Bloom은 파일이 업로드되는 즉시 각 열의 프로파일을 생성하므로, 탐지 방법을 선택하기 전에 분포 형태와 극단값을 미리 확인할 수 있습니다.

Powerdrill Bloom을 사용하여 데이터셋에서 이상치를 찾기 위해 스프레드시트를 업로드하는 모습

2단계: 자연어로 검사 내용 설명하기

"이 열에서 사분위수 범위의 1.5배를 벗어나는 값을 표시하고, 맥락을 파악할 수 있도록 전체 행을 보여줘"라고 직접 요청해 보세요. 그런 다음 실제 의사결정에 도움이 되는 질문들을 이어가세요. 표시된 행들이 날짜나 소스별로 군집해 있는지, 동일한 식별자가 반복되는지, 그리고 이들을 제외했을 때 요약 통계가 어떻게 변하는지 등을 물어볼 수 있습니다.

3단계: 차트, 보고서 또는 프레젠테이션 자료 내보내기

box plot, 맥락 정보가 포함된 이상치 행 테이블, 또는 어떤 행이 왜 제외되었는지 기록한 서면 노트를 내보낼 수 있습니다.

Powerdrill Bloom에서 내보낸 이상치 행이 표시된 box plot

수동 탐지 작업보다 이 방식이 더 나은 이유

스프레드시트 방식 Powerdrill Bloom
IQR 및 z-score 결과 비교 두 가지 수식 세트 작성 및 수동 대조 두 가지 모두 한 번에 요청
표시된 값 주변의 맥락 확인 필터링 및 스크롤 행과 함께 즉시 반환됨
분포 형태 먼저 확인 히스토그램 생성 필요 업로드 시 자동 프로파일링
제외 시 영향 테스트 시트 복제 필요 두 버전 모두 한 번에 요청

마지막 행이 가장 중요합니다. 모호한 이상치를 처리하는 가장 정직한 방법은 이상치를 포함한 결과와 제외한 결과를 모두 보고하는 것입니다. 독자가 결론이 단 하나의 행에 좌우되는지 직접 확인하게 하세요. 스프레드시트에서 이러한 비교 작업을 하려면 분석을 처음부터 다시 만들어야 하므로 보통은 생략되곤 합니다.

베스트 프랙티스: 이상치 처리 결정하기

제외하기 전에 조사하세요. 행 전체를 살펴보아야 합니다. 단일 열만 보면 소수점 입력 오류, 테스트 기록, 실제 대형 고객이 모두 동일하게 보입니다.

절대로 무단으로 삭제하지 마세요. 행을 제외하는 경우, 결과와 동일한 문서에 몇 개의 행을 왜 제외했는지 명시해야 합니다. 아무런 설명 없이 기준 데이터가 변경된 분석은 재현할 수 없습니다.

중요한 경우 두 버전을 모두 보고하세요. 단 하나의 값에 따라 결론이 뒤집힌다면, 그것이 바로 분석을 통해 발견한 사실이지 치워버려야 할 불편한 장애물이 아닙니다.

임계값을 선택하기 전에 분포 형태를 확인하세요. 왜곡된 열에는 z-score 규칙이 아니라 백분위수 기준의 컷오프나 로그 변환이 필요합니다.

군집 현상을 주의 깊게 살펴보세요. 동일한 날짜나 동일한 소스에서 여러 이상치가 발생하는 것은 대개 실제 특이한 고객이 아니라 데이터 파이프라인의 문제를 의미합니다. 이와 관련해서는 데이터 정제 및 중복 제거 가이드에서 자세히 다루고 있습니다.

결론

코드 없이 이상치를 찾는 방법은 결국 세 가지 도구로 요약됩니다. IQR 규칙은 왜곡에 강한 기본 옵션이고, z-scores는 대칭 데이터에서 편차의 크기를 파악하고자 할 때 적합하며, box plot은 두 가지 가정 중 어느 것이 타당한지 확인하는 데 쓰입니다. 두 방법의 결과가 다를 수 있음을 예상하고, 그 차이 자체를 유용한 정보로 활용하세요.

어떤 통계적 방법도 대신해 줄 수 없는 부분은 바로 '결정'입니다. 각 행을 조사하는 데 시간이 너무 많이 걸려 이상치 표시 단계에서 작업을 멈추고 있다면, 해당 파일에 Powerdrill Bloom을 사용해 보세요. 또한 AI 데이터 정제 페이지, 기술 통계 실행 가이드, 그리고 CSV를 차트로 변환하기 가이드도 함께 확인해 보세요.

자주 묻는 질문 (FAQ)

데이터셋에서 무엇을 이상치로 간주하나요?

관례적으로 1사분위수 또는 3사분위수에서 사분위수 범위의 1.5배를 벗어난 값이나, 평균에서 표준편차의 3배를 초과하여 벗어난 값을 말합니다. 둘 다 절대적인 법칙이 아닌 관례일 뿐이며, 데이터가 대략 대칭인지 아니면 왜곡되어 있는지에 따라 적합한 방법이 달라집니다.

Excel에서 코드 없이 이상치를 어떻게 찾나요?

QUARTILE 함수를 사용하여 IQR 범위를 설정하고 이를 벗어나는 값을 표시하거나, 평균과 STDEV.P 함수를 사용하여 z-scores를 계산합니다. box plot을 사용하면 동일한 IQR 결과를 시각적으로 확인할 수 있을 뿐만 아니라 데이터의 분포 형태도 동시에 파악할 수 있습니다.

분석에서 이상치를 제거해야 하나요?

이상치가 발생한 원인을 먼저 파악한 후에 결정해야 합니다. 데이터 입력 오류나 테스트 기록은 제거해야 하지만, 실제 극단값은 제거해서는 안 됩니다. 유용한 실제 정보를 지워버리는 결과를 낳기 때문입니다. 판단이 모호할 때는 두 가지 경우의 결과를 모두 보고하세요.

IQR과 z-score가 서로 다른 값을 표시하는 이유는 무엇인가요?

IQR은 극단값에 의해 왜곡되지 않는 사분위수를 기준으로 작동합니다. 반면 z-scores는 극단값에 의해 왜곡되는 평균과 표준편차를 기준으로 작동합니다. 값이 충분히 크면 표준편차 자체가 부풀려져 이상치 자체가 가려질 수 있습니다.

데이터가 종 모양이 아니라 왜곡되어 있다면 어떻게 해야 하나요?

소득이나 주문 가치와 같이 왜곡된 열에서는 표준 임계값을 적용할 경우 긴 꼬리 부분을 과도하게 이상치로 표시하게 됩니다. 백분위수 기반의 기준을 사용하거나 먼저 열을 로그 변환하고, 규칙을 선택하기 전에 분포 형태를 확인하세요.

코드 작성 없이 데이터셋에서 이상치를 찾는 방법 (2026년 가이드)