Excel에서 상자 수염 그림 만드는 방법: 무엇을 보여주는가

평균은 집단이 어디에 위치해 있는지만 알려줄 뿐, 그 집단이 얼마나 흩어져 있는지, 혹은 단 하나의 값이 전체 수치를 왜곡하고 있는지는 말해주지 않습니다.
상자 수염 그림(box plot)은 단 2초 만에 읽을 수 있는 형태로 이 두 가지 질문에 모두 답해 줍니다. 위치만큼이나 분포의 퍼짐 정도가 중요할 때 여러 집단을 비교하는 가장 빠른 방법입니다.
이 가이드에서는 상자 수염 그림이 실제로 무엇을 보여주는지, Excel에서 이를 만드는 방법, 그리고 과도한 해석 없이 올바르게 읽는 방법을 다룹니다.
상자 수염 그림이 보여주는 것
NIST의 통계 참조 자료는 그 목적을 정확하게 설명합니다. 상자 수염 그림은 "데이터 세트의 위치와 변동 정보를 전달하는 데 탁월한 도구"입니다.
주목해야 할 부분은 바로 다음 문장입니다. 상자 수염 그림은 특히 "서로 다른 데이터 집단 간의 위치 및 변동 변화를 감지하고 시각화하는 데" 유용합니다.
이것이 바로 핵심 활용 사례입니다. 이 차트 하나만 보면 약간의 정보만 얻을 수 있지만, 장비나 지역, 코호트별로 4개를 나란히 놓았을 때 비로소 이 시각화의 진가가 드러납니다.
Microsoft의 Excel 버전 설명도 제품 관점에서 동일한 내용을 담고 있습니다. 상자 수염 그림은 "데이터의 사분위수 분포를 보여주며, 평균과 이상치를 강조합니다."
형태 뒤에 숨겨진 5가지 수치
이 차트는 계산된 소수의 값들로 구성되며, 이 값들을 이해하면 차트를 쉽게 읽을 수 있습니다.
NIST는 그 구성 방식을 직접 설명합니다. "중앙값과 사분위수를 계산합니다(하위 사분위수는 25백분위수이고 상위 사분위수는 75백분위수입니다)."
그런 다음 이 사분위수 사이에 상자가 그려집니다. NIST의 표현을 빌리자면 "이 상자는 데이터의 중간 50%를 나타냅니다" — 핸드북에서 데이터의 '몸통(body)'이라고 부르는 부분입니다. 상자 내부의 선이나 기호는 중앙값을 표시합니다.
수염은 극단값을 향해 바깥쪽으로 뻗어 나갑니다. 그 결과, NIST가 설명하듯이 "상자 수염 그림은 데이터의 중간 50%, 중앙값, 그리고 극단값을 식별합니다."
| 구성 요소 | 나타내는 의미 |
|---|---|
| 상자 하단 | 하위 사분위수, 25백분위수 |
| 상자 내부 선 | 중앙값, 50백분위수 |
| 상자 상단 | 상위 사분위수, 75백분위수 |
| 상자 높이 | 사분위간 범위(IQR), 중간 절반을 포함 |
| 수염 | 사분위수를 벗어난 변동성 |
| 개별 점 | 수염 범위를 벗어난 값 |
수염이 멈추는 지점
구현 방식이 다르기 때문에 이 부분이 가장 많은 혼란을 야기하는 세부 사항입니다.
NIST는 이상치를 명확하게 식별하기 위해 설계된 일반적인 변형 방식을 설명합니다. 사분위간 범위를 계산하여 이를 IQ라고 부릅니다. 이로부터 4개의 경계가 도출됩니다. 2개는 하위 사분위수 아래에 위치하며, 각각 하위 사분위수 아래로 IQ의 1.5배와 3.0배 지점입니다. 나머지 2개의 대칭되는 경계는 상위 사분위수 위에 위치합니다.
그런 다음 수염은 최솟값까지 그려지는 것이 아니라, 하한 경계 위에 있는 가장 작은 데이터 포인트까지 그려집니다. 이 경계를 벗어난 포인트들은 개별 점으로 그려집니다.
Excel은 이 관례를 따릅니다. Microsoft의 문서에 따르면 수염은 "상위 및 하위 사분위수 외부의 변동성을 나타냅니다"라고 명시되어 있으며, 같은 문장에서 "이 선이나 수염 외부의 모든 포인트는 이상치로 간주됩니다"라고 이어집니다.
따라서 한 도구의 결과물을 다른 도구와 비교하기 전에, 각 도구가 어떤 수염 규칙을 사용했는지 확인하십시오. 상자는 일치하겠지만 수염은 일치하지 않을 수 있습니다.
Excel에서 상자 수염 그림을 만드는 방법
Excel에는 기본 제공 차트 종류가 있어 단계가 간단합니다.
이 차트에 대한 Microsoft의 안내 지침은 데이터 선택부터 시작합니다. "단일 데이터 계열 또는 여러 데이터 계열 중에서 데이터를 선택합니다." 그런 다음 "Excel에서 삽입 > 통계 차트 삽입 > 상자 수염을 선택합니다."
데이터 레이아웃에 관한 두 가지 유의 사항이 있습니다. 대부분의 시도가 실패하는 지점이 바로 여기이기 때문입니다.
데이터는 요약 통계가 아닌 원시 값이어야 합니다. Excel이 사분위수를 직접 계산하므로, 미리 계산된 중앙값 열을 입력하면 엉뚱한 결과가 나옵니다.
여러 집단을 비교하려면 머리글 행이 있는 인접한 열에 값을 넣거나, 값 열 옆에 범주 열을 사용하십시오. Excel은 나중에 사용자가 구성하는 설정이 아니라 레이아웃 자체에서 그룹화를 읽어옵니다.
차트가 생성되면 계열 옵션을 통해 평균 표식을 표시하거나 숨길 수 있습니다. 평균과 중앙값의 차이 자체가 유용한 정보를 주기 때문에 보통은 평균 표식을 켜두는 것이 좋습니다.
동일한 옵션 패널에서 내부 포인트의 표시 방식을 제어합니다. 내부 포인트를 표시하면 소규모 집단에는 도움이 되지만, 대규모 집단에서는 차트가 복잡해집니다. 각 상자 뒤에 얼마나 많은 데이터가 있는지에 따라 적절한 설정을 선택해야 합니다.
원시 데이터로 만들기
차트를 그리기 전에 데이터를 정제하거나 그룹화해야 하는 경우, 아래 순서에 따라 처음부터 끝까지 진행할 수 있습니다.
1단계: 데이터 세트 업로드 및 비교 설명하기
Powerdrill Bloom에서 CSV 또는 Excel 파일로 시작하십시오. 차트에 표시할 값과 그룹화 변수의 이름을 지정하여 원하는 상자 수염 그림을 자연어로 설명합니다.
그룹화에 대해 구체적으로 지정하십시오. 동일한 파일이라도 "창고별 배송 시간"과 "월별 배송 시간"은 서로 다른 차트를 생성하며, 그중 하나만 귀하의 질문에 대한 답이 될 것입니다.
특정 제품군, 특정 분기, 완료된 주문만 등 데이터를 먼저 필터링해야 할 수도 있습니다. 파일을 수동으로 미리 필터링하는 대신 동일한 요청에 이 내용을 포함하여 말씀해 주십시오.
2단계: 차트를 읽기 전에 그룹 크기 확인하기
한 그룹에는 8개의 관측치가 있고 다른 그룹에는 800개가 있는 차트는 기술적으로는 유효할지 몰라도 실제로는 오해를 불러일으킬 수 있습니다. 표본 크기가 너무 작으면 사분위수가 불안정해집니다.
차트와 함께 그룹별 데이터 개수를 요청하십시오. 관측치가 약 20개 미만인 그룹은 주의해서 해석해야 하며, 10개 미만인 그룹은 보통 개별 점으로 표시하는 것이 더 낫습니다.
또한 이 단계에서 값 열이 모두 숫자로 되어 있는지 확인해야 합니다. 숫자 열에 텍스트가 단 하나만 들어가도 그룹 계산 방식이 눈에 띄지 않게 달라질 수 있습니다.
3단계: 차트 및 지원 수치 생성하기
상자 수염 그림과 함께 그룹별 5가지 요약 수치(최솟값, 하위 사분위수, 중앙값, 상위 사분위수, 최댓값) 및 데이터 개수를 요청하십시오.
표는 차트만큼이나 중요합니다. "세 번째 그룹의 정확한 중앙값이 무엇인가"라고 묻는 독자가 픽셀 크기를 가늠하지 않고도 바로 답을 얻을 수 있어야 합니다.
두 가지를 모두 내보내고, 의문이 생겼을 때 언제든 수치를 역추적할 수 있도록 원본 파일을 첨부해 두십시오.
보유한 데이터에서 여러 그룹을 비교하고 싶으신가요? Powerdrill Bloom을 사용해 보세요.
상자 수염 그림을 읽는 방법
차트를 다음 순서대로 읽으면 거의 매번 유용한 정보를 얻을 수 있습니다.
가장 먼저 중앙값을 비교하십시오. 각 상자 내부의 선은 대표값입니다. 이 선들의 높이가 서로 다르다면, 집단 간의 중심 경향이 실제로 다르다는 것을 의미합니다.
두 번째로 상자의 높이를 비교하십시오. 상자가 길다는 것은 해당 집단의 중간 절반이 넓게 퍼져 있음을 의미합니다. 중앙값은 동일하지만 상자 높이가 크게 다른 두 집단은 완전히 다른 양상을 보이고 있는 것입니다.
세 번째로 수염의 비대칭성을 확인하십시오. 한쪽 수염이 훨씬 더 길다면 데이터가 왜도를 가짐을 나타냅니다. 상자 내부에서 중앙값이 한쪽으로 치우쳐 있는 것도 같은 의미입니다.
마지막으로 개별 점들을 살펴보십시오. 이 점들은 차트에서 특이값으로 표시한 수치들입니다. 이는 조사해 볼 대상이지, 무조건 오류라고 단정해서는 안 됩니다.
언급할 만한 한 가지 패턴은 평균 표식이 중앙값보다 눈에 띄게 위에 있다면, 소수의 큰 값들이 평균을 끌어올리고 있다는 뜻입니다. 이는 평균만 보고했을 때 모든 사람을 오도할 수 있는 전형적인 상황입니다.
상자 수염 그림이 적절하지 않은 경우
이 차트는 특수 목적용 차트이므로, 다음과 같은 상황에서는 한계를 보입니다.
비교 대상 없이 단 하나의 집단만 있는 경우, 대개 히스토그램이 더 많은 정보를 전달합니다. 이 차트는 분포를 5가지 수치로 압축하는 반면, 히스토그램은 실제 분포의 형태를 보여주기 때문입니다.
쌍봉형 데이터의 경우, 요약 수치가 가장 중요한 특징을 가려버립니다. 두 개의 클러스터가 존재하더라도 상자는 평범해 보이며, 차트의 그 어떤 부분도 그 사이의 간극을 드러내지 못합니다.
표본 크기가 매우 작으면 단 하나의 새로운 관측치만 추가되어도 사분위수가 크게 요동칩니다. 이럴 때는 데이터 포인트 자체를 그대로 플로팅하는 것이 더 정직한 방법입니다.
또한 이 차트를 한 번도 본 적이 없는 비전문가 청중을 대상으로 할 때는 분석 결과보다 차트 형태를 설명하는 데 처음 몇 분을 허비하게 될 수 있습니다. 이럴 때는 레이블이 잘 지정된 범위 차트가 더 효과적일 수 있습니다.
| 상황 | 더 나은 대안 |
|---|---|
| 집단 간 퍼짐 정도 비교 | 상자 수염 그림 |
| 단일 집단, 분포의 형태가 중요함 | 히스토그램 |
| 두 개의 클러스터가 의심됨 | 히스토그램 또는 밀도 그림 |
| 표본 크기가 매우 작음 | 개별 점 플로팅 |
| 시간에 따른 단일 집단 추적 | 꺾은선형 차트 |
차트를 처음 보는 사람들에게 발표할 때
이 차트는 통계학에서는 표준이지만 다른 분야에서는 대부분 생소합니다. 다음 세 가지 습관을 들이면 그 간극을 좁힐 수 있습니다.
원본 파일의 일반적인 변수명을 그대로 두지 말고, 사람들이 관심을 갖는 단위(일수, 달러, 천 명당 불량 수 등)로 축 레이블을 지정하십시오.
핵심 분석 결과를 제목에 넣으십시오. "댈러스 창고의 배송 시간 변동이 가장 큼"이라는 제목은 독자에게 무엇을 보아야 할지 알려줍니다. 반면 "창고별 배송 시간"은 독자가 스스로 알아내도록 방치하는 것과 같습니다.
상자의 의미를 쉬운 용어로 설명하는 한 줄짜리 범례를 추가하십시오. "상자는 주문의 중간 절반을 포함하며, 선은 대표적인 주문 값을 나타냅니다"와 같은 문구는 단 한 줄만으로도 가장 흔한 오해를 방지할 수 있습니다.
청중이 이 차트를 매달 보게 된다면 한 번쯤 제대로 설명해 줄 가치가 있습니다. 하지만 단 한 번만 볼 예정이라면, 더 단순한 차트로 동일한 메시지를 전달할 수 있을지 고민해 보십시오.
실시간 회의에서 도움이 되는 팁이 하나 더 있습니다. 데이터가 무엇을 보여주는지 말하기 전에 상자가 무엇을 의미하는지 먼저 설명하십시오. 차트 형태를 해독하느라 바쁜 사람들은 분석 결과에 귀를 기울이지 못합니다.
시간에 따른 집단 비교
자주 나오는 후속 질문은 집단 간 비교뿐만 아니라 기간에 따른 변화를 어떻게 보여줄 것인가 하는 점입니다.
가장 직관적인 방법은 기간별로 상자를 하나씩 왼쪽에서 오른쪽으로 배치하는 것입니다. 이 방법은 약 8개 기간까지는 잘 작동하지만, 그 이상이 되면 차트가 복잡해지고 개별 상자가 너무 좁아져 읽기 어려워집니다.
그 범위를 넘어서면 다른 구조를 사용하는 것이 좋습니다. 시간에 따른 중앙값을 꺾은선으로 플로팅하고, 그 주변에 사분위간 범위를 음영 밴드로 표시하십시오. 정보는 거의 동일하게 유지되면서 추세를 훨씬 쉽게 읽을 수 있게 됩니다.
효과적이지 않은 방법은 두 가지 그룹화를 하나의 차트에 혼합하는 것입니다. 월별, 창고별로 상자를 만들면 아무도 읽지 않는 상자의 장벽이 생겨납니다. 가장 중요한 비교 대상을 선택하여 그것만 차트로 그리십시오.
질문이 진정으로 2차원적인 성격을 띤다면, 소형 다중 차트가 가장 정직한 해답입니다. 즉, 창고별로 작은 차트를 하나씩 만들고 각각의 가로축에 월을 표시하는 것입니다.
이상치 탐색과의 차이점
상자 수염 그림은 분포를 보여주는 과정의 부산물로 특이한 포인트를 표시합니다. 이는 의도적으로 이상치를 찾아 나서는 작업과 관련은 있지만 동일하지는 않습니다.
그 차이는 질문의 본질에 있습니다. 이 차트는 집단들이 어떻게 비교되는지 묻습니다. 반면 이상치 조사는 어떤 특정 레코드가 잘못되었거나, 특이하거나, 재검토할 가치가 있는지 묻습니다. 여기에는 사분위수 규칙을 넘어 그 어떤 차트도 수행할 수 없는 도메인 검증을 포함한 방법들이 사용됩니다.
만약 후자가 목표라면, 코드 없이 데이터 세트에서 이상치 찾기에 대한 가이드가 해당 작업을 직접적으로 다룹니다. 집단 간의 비교가 핵심 목적이고, 특이값은 그 과정에서 자연스럽게 발견하는 부차적인 요소일 때 상자 수염 그림을 사용하십시오.
그 이후에 취하는 조치에도 실질적인 차이가 있습니다. 상자 수염 그림에 의해 드러난 이상치는 조사의 대상이 됩니다. 반면 동일한 차트에 의해 드러난 분포의 차이는 설명의 대상이 됩니다.
흔히 하는 실수들
원시 값 대신 요약 통계를 차트로 그리는 것. Excel이 사분위수를 계산하므로, 미리 계산된 중앙값을 입력하면 무의미한 차트가 생성됩니다.
그룹 크기를 무시하는 것. 표본 크기가 서로 다르면 실제로는 비교하기 어려움에도 상자가 비슷해 보여 오해를 살 수 있습니다.
표시된 포인트들을 오류라고 가정하는 것. IQR의 1.5배 규칙은 관례일 뿐 진단 결과가 아닙니다. 표시된 일부 값은 데이터 세트에서 가장 흥미로운 레코드일 수 있습니다.
수염 규칙을 확인하지 않고 도구 간 결과를 비교하는 것. 구현 방식에 따라 수염을 확장하는 방식이 다르므로, 상자는 일치하더라도 수염은 일치하지 않을 수 있습니다.
히스토그램이 필요한 곳에 상자 수염 그림을 사용하는 것. 단일 상자 수염 그림은 단일 히스토그램이 보여줄 수 있는 분포의 형태를 가려버립니다.
축 레이블을 지정하지 않는 것. 발표 자료에서 가장 흔히 발생하는 실패 사례이자 가장 고치기 쉬운 부분입니다.
상자 수염 그림을 읽을 때 상자 안에 대부분의 데이터가 포함되어 있다고 오해하는 것. 상자에는 정확히 절반만 포함됩니다. 값의 4분의 1은 상자 위에, 나머지 4분의 1은 상자 아래에 위치하며, 수염이 짧을 때 이 사실을 잊기 쉽습니다.
그룹을 알파벳 순서로 정렬하는 것. 대신 중앙값 순서로 정렬하면 추가 비용 없이 한눈에 비교하기가 훨씬 수월해집니다.
관련 차트 작업에 대해서는 Excel 데이터로 원형 차트 만들기 및 Excel 시트로 아름다운 그래프 빠르게 만들기 가이드를 참조하십시오. 이 차트와 자연스럽게 짝을 이루는 분산 통계량에 대해서는 Excel에서 표준편차 계산하기를 확인해 보세요.
자주 묻는 질문
상자 수염 그림은 어떤 용도로 사용되나요?
데이터 세트의 위치와 변동을 전달하며, 특히 여러 집단 간에 이러한 특성을 비교하는 데 유용합니다. NIST는 이를 서로 다른 데이터 집단 간의 위치 및 변동 변화를 감지하고 시각화하는 도구로 설명합니다.
상자 수염 그림은 어떻게 읽나요?
상자는 25백분위수부터 75백분위수까지 데이터의 중간 50%를 가로지르며, 선으로 중앙값을 표시합니다. 수염은 사분위수를 벗어난 변동성을 보여주며, 개별 점들은 해당 범위를 벗어난 값을 나타냅니다.
Excel에서 상자 수염 그림을 어떻게 만드나요?
단일 계열 또는 여러 계열의 데이터를 선택합니다. 그런 다음 삽입, 통계 차트 삽입, 상자 수염을 선택합니다. Excel이 사분위수를 직접 계산하므로 요약 통계가 아닌 원시 값을 제공해야 합니다.
상자 수염 그림의 수염 바깥쪽에 점들이 표시되는 이유는 무엇인가요?
이 점들은 수염 범위를 벗어난 값으로, Excel에서는 이상치로 취급합니다. 일반적인 규칙에 따라 수염은 각 사분위수에서 사분위간 범위의 1.5배까지 연장되며, 이를 초과하는 값은 개별적으로 그려집니다.
상자 수염 그림과 히스토그램의 차이점은 무엇인가요?
상자 수염 그림은 분포를 5가지 수치로 요약하며 집단 간 비교에 탁월합니다. 히스토그램은 두 개의 클러스터와 같은 특징을 포함하여 단일 분포의 전체 형태를 보여줍니다. 5가지 요약 수치는 형태보다는 위치와 퍼짐 정도를 설명하므로, 상자 수염 그림에서는 이러한 패턴이 보이지 않습니다.
출처: NIST/SEMATECH e-Handbook of Statistical Methods, "Box Plot," itl.nist.gov; Microsoft Support, "Create a box and whisker chart."