AI로 상관관계 행렬 만드는 법: 2026년 5가지 간편한 체크포인트

상관관계 행렬은 모든 숫자 열을 서로 대조하여 각 쌍이 얼마나 밀접하게 함께 움직이는지 보여줍니다. 이 가이드에서는 상관관계 행렬이 무엇인지, 그리고 이를 수동으로 만드는 방법을 다룹니다. 그런 다음 내보낸 데이터에서 행렬을 생성하는 3단계를 설명합니다. 마지막으로, 유용한 행렬과 오해의 소지가 있는 숫자 격자를 구분하는 5가지 체크포인트를 소개합니다.
상관관계 행렬이 알려주는 것
Microsoft의 Analysis ToolPak 설명서는 이 대상을 잘 정의하고 있습니다. Correlation 도구는 "출력 테이블인 상관관계 행렬을 제공"합니다. 이 테이블은 "측정 변수의 가능한 각 쌍에 적용된 CORREL(또는 PEARSON) 값을 보여줍니다."
또한 이 도구가 언제 필요한지도 설명합니다. 이 도구는 "N개의 각 대상에 대해 두 개 이상의 측정 변수가 있을 때 특히 유용합니다." 열이 두 개뿐이라면 숫자 하나만 계산하면 됩니다. 하지만 열이 12개라면 격자 형태의 표가 필요합니다.
계수 자체도 명확하게 설명되어 있습니다. 이는 "두 측정 변수가 '함께 변하는' 정도를 나타내는 척도"입니다. 유용한 특징은 스케일링(척도 조정)입니다. 공분산과 달리, 이 계수는 "변수가 표현되는 단위와 무관하게 값이 결정되도록 스케일이 조정"됩니다.
이것이 바로 상관관계 행렬을 쉽게 읽을 수 있는 이유입니다. 달러 단위의 매출과 횟수 단위의 방문 수는 동일한 스케일의 계수를 생성하므로 각 셀을 서로 비교할 수 있습니다.
값을 읽는 방법도 문서화되어 있습니다. 계수가 "+1 또는 -1에 가까울수록" "배열 간의 양의 상관관계(+1) 또는 음의 상관관계(-1)"를 나타냅니다. "0에 가까울수록 상관관계가 없거나 약함"을 나타냅니다. 단일 쌍 버전에 대한 개념은 상관계수 설명서에서 별도로 다루고 있습니다.
시작하기 전에 필요한 것
- 대상(고객, 매장, 주차, 캠페인 등)당 하나의 행으로 구성된 내보낸 데이터 1개.
- 최소 3개 이상의 숫자 열. 그 미만인 경우 행렬을 만드는 공수에 비해 가치가 떨어집니다.
- "대상"이 무엇인지에 대한 명확한 관점. 행은 동일한 종류의 대상이어야 하며, 그렇지 않으면 계수는 아무런 의미가 없습니다.
- 어떤 열이 서로에게서 파생되었는지에 대한 기록. 매출과 주문당 매출은 구조상 당연히 상관관계를 가집니다.
- 분석을 실행하기 전에 결정해야 할 빈칸 처리 방식.
마지막 항목은 단순히 표현 방식뿐만 아니라 결과 값 자체를 바꿉니다. 이에 대해서는 아래의 Check 2에서 자세히 다룹니다.
수동으로 만드는 방법
옵션 1: Analysis ToolPak의 Correlation 도구 사용하기
이는 가장 빠른 방법이며 상관관계 행렬을 직접 생성합니다. Microsoft는 이 추가 기능의 역할을 단계를 줄여주는 것으로 설명합니다. 사용자가 "각 분석에 대한 데이터와 매개변수를 제공"하면, 도구는 "매크로 함수를 사용하여 결과를 계산하고 출력 테이블에 표시"합니다.
미리 알아두어야 할 두 가지 제한 사항이 있습니다. 출력 결과는 정적인 숫자 블록이므로 데이터가 변경되어도 업데이트되지 않습니다. 또한 설명서에 따르면 "데이터 분석 기능은 한 번에 하나의 워크시트에서만 사용할 수 있습니다."
옵션 2: CORREL 수식 격자 작성하기
열 이름을 세로와 가로에 각각 배치한 다음, 두 범위에 대해 각 셀을 CORREL 수식으로 채웁니다.
장점은 자동으로 다시 계산된다는 것입니다. 단점은 규모입니다. 12개 열의 행렬은 절대 참조와 상대 참조가 혼합된 144개의 셀을 의미합니다. 수식을 한 번 잘못 드래그하면 오류 메시지 없이 잘못된 쌍이 잘못된 셀에 입력될 수 있습니다.
옵션 3: 스프레드시트 외부에서 계산하기
어떤 통계 라이브러리를 사용하든 단 한 줄의 코드로 상관관계 행렬을 반환하며, 누락된 데이터도 명시적으로 처리합니다.
이는 가장 신뢰할 수 있는 방법이지만, 공유하기는 가장 어렵습니다. 두 열이 왜 상관관계를 가지는지 알고 싶어 하는 동료는 여러분의 스크립트를 열어볼 수 없으며, 행렬은 복사해서 붙여넣은 이미지 형태로 전달될 뿐입니다.
수동 작업이 지체되는 지점
산술 계산은 순식간에 끝납니다. 시간이 걸리는 것은 그 외의 모든 주변 작업입니다.
첫 번째 비용은 열 선택입니다. 가공되지 않은 내보내기 데이터에는 ID 열, 숫자로 저장된 날짜 열, 0과 1로 코딩된 상태 플래그가 포함되어 있습니다. 이들은 모두 숫자형이므로 행렬에 모두 포함됩니다. 고객 ID와 매출 간의 상관관계는 그저 셀의 형태를 한 노이즈에 불과합니다.
두 번째 비용은 행렬을 읽는 것입니다. 12개 변수의 행렬은 대각선 위로 66개의 고유한 쌍을 가집니다. 흥미로운 결과를 찾기 위해 66개의 숫자를 훑어보는 것은 사람들이 가장 기피하는 작업이며, 이 때문에 행렬이 만들어진 후 방치되곤 합니다.
세 번째 비용은 반복 작업입니다. 상관관계 행렬을 딱 하나만 만드는 사람은 없습니다. 코호트별, 지역별, 분기별로 하나씩 만들게 되며, 그때마다 열 선택 작업을 매번 새로 시작해야 합니다.
Powerdrill Bloom으로 상관관계 행렬을 만드는 방법
1단계: 대상당 하나의 행으로 구성된 내보낸 데이터 업로드하기
열을 미리 선택할 필요 없이 파일을 Powerdrill Bloom에 끌어다 놓으세요. Free plan에서는 Excel, CSV, PDF 및 문서 업로드를 지원하므로 유료 플랜 없이도 가공되지 않은 내보내기 데이터를 바로 업로드할 수.
ID와 날짜 열은 그대로 두세요. 요청 사항에 제외해 달라고 명시하는 것이, 직접 열을 삭제했다가 어떤 열을 지웠는지 잊어버리는 것보다 훨씬 더 확실합니다.
2단계: 포함할 열 지정 및 빈칸 처리 방식 설정하기
자연어로 요청해 보세요. 실제 측정값인 열을 나열하고 제외할 열을 지정합니다. 그런 다음 누락된 값이 있는 행을 삭제할지, 아니면 쌍별로 처리할지 입력합니다.
다른 열에서 파생된 열이 무엇인지도 알려주세요. 뻔한 산술적 관계를 새로운 발견인 것처럼 보여주는 행렬은 독자의 소중한 시간을 낭비하게 만듭니다.
3단계: 테이블 및 히트맵 형태로 행렬 생성하기
필요한 출력을 요청하세요. 계수 테이블 형태의 행렬과 동일한 격자의 히트맵을 함께 요청할 수 있습니다. 여기에 표본 크기와 함께 살펴볼 만한 가치가 있는 쌍의 간단한 목록을 추가해 달라고 하세요. 요금제 페이지에는 차트, 테이블, 내보내기 기능을 통해 근거 있는 답변을 얻는 방법이 설명되어 있으며, 고급 분석(advanced analytics) 페이지의 시각화 도구 목록에는 Heatmap이 포함되어 있습니다.
행렬을 서면 분석 보고서에 삽입해야 하는 경우, Pro plan을 사용하면 더 완전한 Office 문서 출력으로 확장할 수 있습니다.
모든 상관관계 행렬이 통과해야 할 5가지 체크포인트
Check 1: 쌍을 이루는 열의 길이가 같습니까?
이는 셀 오류가 발생하는 가장 흔한 원인입니다. 이 함수에 대한 Microsoft의 설명서는 다음과 같이 명시하고 있습니다. "array1과 array2의 데이터 포인트 개수가 다르면 CORREL은 #N/A 오류를 반환합니다."
수동으로 격자를 만들 때 한 범위를 다른 범위보다 한 행 더 많이 드래그한 경우 이런 일이 발생합니다. 해결 방법은 간단하지만, 이를 알아차리는 것이 어렵습니다. 144개 셀로 이루어진 격자에서 단 하나의 #N/A 오류는 놓치기 쉽기 때문입니다.
Check 2: 빈칸과 텍스트가 예상대로 제외됩니까?
설명서에 명시된 두 가지 동작이 서로 다르게 작동하므로, 두 가지를 모두 알고 있어야 실수를 방지할 수 있습니다.
이 함수는 쌍별로 숫자가 아닌 값을 제외합니다. Microsoft에 따르면 인수의 "텍스트, 논리값 또는 빈 셀"은 무시됩니다. 하지만 "값이 0인 셀은 포함"됩니다. 즉, 빈칸은 건너뛰지만 0은 계산에 포함됩니다.
ToolPak의 Correlation 도구는 더 엄격합니다. 설명서에 따르면 "어떤 대상에 대해 누락된 관측치가 하나라도 있으면 해당 대상은 분석에서 제외"됩니다. 즉, 빈 셀이 하나만 있어도 행렬의 모든 쌍에서 해당 행 전체가 제거됩니다.
따라서 어떤 방법을 선택하느냐에 따라 동일한 데이터로 두 개의 서로 다른 행렬이 만들어질 수 있습니다. 열에 빈칸이 많은 경우, ToolPak 방식은 훨씬 더 작은 표본 크기로 격자를 조용히 계산해 버릴 수 있습니다.
Check 3: 상수로만 이루어진 열이 있습니까?
모든 행에서 동일한 값을 가지는 열은 상관관계를 분석할 변동성이 없습니다. 설명서에 명시된 결과는 오류입니다. "값의 표준편차(s)가 0인 경우", "CORREL은 #DIV/0! 오류를 반환"합니다.
이는 예상보다 자주 발생합니다. 내보낸 기간 동안 항상 참(true)이었던 플래그나 변경되지 않은 수수료 등이 모두 이와 같이 작동합니다.
Check 4: 숫자뿐만 아니라 분포의 형태도 확인하셨습니까?
상관계수는 두 열이 직선상에서 얼마나 일관되게 함께 움직이는지를 측정합니다. 상승했다가 하락하는 관계는 산점도(plot)상에서 뚜렷하고 명확하게 나타나더라도 계수는 0에 가깝게 나올 수 있습니다.
따라서 0에 가까운 셀이 독립성을 증명하는 것은 아닙니다. 이는 단지 선형 관계에 대한 설명일 뿐입니다. 결론을 내리기 전에 관심 있는 두세 개의 쌍을 그래프로 그려보고, 소수의 극단적인 행이 계수를 끌어올리고 있지는 않은지 확인하세요. 아웃라이어 가이드에서 이 단계를 다룹니다.
Check 5: 얼마나 많은 쌍을 살펴보았는지 고려하고 계십니까?
10개 열의 행렬에는 45개의 고유한 쌍이 포함됩니다. 12개 열의 행렬에는 66개가 포함됩니다. 충분히 많은 쌍을 훑어보다 보면 아무런 이유 없이 강한 상관관계를 보이는 쌍이 몇 개 나타나기 마련입니다.
두 가지 습관으로 이를 해결할 수 있습니다. 격자를 읽기 전에 예상했던 관계를 먼저 정의하고, 나머지는 확정된 결과가 아닌 후보군으로 취급하세요. 그리고 인용하려는 계수 옆에 표본 크기를 기록해 두세요. 통계적 유의성은 표본 크기에 따라 달라지기 때문입니다.
절약되는 리소스
| 작업 | 수동 작업 | 업로드된 내보내기 데이터 활용 |
|---|---|---|
| ID, 날짜 및 플래그 열 제외 | 매번 수동으로 재작업 | 요청 시 한 번만 명시 |
| 격자 구축 | 144개의 수식 또는 정적인 ToolPak 블록 | 질문의 일부로 처리 |
| 누락된 데이터 규칙 적용 | 선택한 방식에 따라 다름 | 명시적으로 지정 |
| 살펴볼 만한 쌍 추려내기 | 45~66개 셀을 육안으로 스캔 | 행렬과 함께 반환됨 |
| 다음 분기 버전 생성 | 열 선택 작업 재시작 | 동일한 요청에 새 파일만 적용 |
모범 사례
계수를 보고할 때는 표본 크기를 함께 기재하세요. 11개 행에서 얻은 0.7이라는 값은 11,000개 행에서 얻은 0.7과 동일한 신뢰도를 가지지 않습니다.
서로에게서 파생된 쌍이 있다면 하나를 제외하세요. 파생된 열은 이미 알고 있는 관계들로 행렬을 불필요하게 부풀립니다.
전체적인 파악을 위해서는 히트맵으로, 인용을 위해서는 테이블로 행렬을 보여주세요. 히트맵은 패턴을 찾는 데 유용하고, 테이블은 보고서에 복사해 넣을 정확한 숫자를 제공합니다.
행렬이 모델을 선택하게 두지 마세요. 가장 강한 상관관계만을 기준으로 예측 변수를 선택하면 다중공선성 변수들이 함께 선택되는 문제가 발생합니다. 이 문제를 해결하기 위한 도구는 Regression analysis입니다.
행렬 옆에 제외된 열 목록을 작성해 두세요. 독자가 두 번째로 던지는 질문은 항상 어떤 열이 제외되었는가입니다.
결론
상관관계 행렬은 계산 비용이 적게 들지만 과도하게 해석하기 쉽습니다. Excel은 두 가지 생성 방식을 모두 제공하지만, 누락된 데이터를 처리하는 방식이 서로 다릅니다. 이는 설명서에 명시되어 있지만 거의 주목받지 못하는 부분입니다.
행렬의 진정한 가치는 격자 자체보다 5가지 체크포인트에 있습니다. 동일한 길이의 쌍, 명시된 빈칸 처리 규칙, 상수로만 이루어진 열의 배제, 실제 분포 형태 확인, 그리고 스캔한 쌍의 개수에 대한 솔직한 인식이 중요합니다.
내보낸 데이터는 있지만 144개의 셀 격자를 직접 만들고 싶지 않다면, 가공되지 않은 파일 그대로 Powerdrill Bloom을 사용해 보세요. 이미 워크북에 있는 데이터라면 Excel AI assistant 기능이 적합합니다.
자주 묻는 질문
상관관계 행렬이란 무엇인가요?
데이터셋에 있는 모든 숫자형 변수 쌍의 상관계수를 보여주는 테이블입니다. Microsoft 설명서에서는 Analysis ToolPak의 출력을 가능한 모든 쌍에 CORREL 또는 PEARSON을 적용하여 보여주는 상관관계 행렬로 설명합니다. 측정 변수가 두 개 이상일 때 가장 유용합니다.
Excel에서 상관관계 행렬은 어떻게 만드나요?
두 가지 방법이 있습니다. Analysis ToolPak에는 행렬을 출력 테이블에 작성해 주는 Correlation 도구가 있습니다. 또는 CORREL 수식 격자를 직접 구축할 수도 있는데, 이 방법은 자동으로 다시 계산되지만 많은 셀이 필요하고 참조를 신중하게 지정해야 합니다.
Excel은 상관관계 분석 시 누락된 값을 어떻게 처리하나요?
어떤 방법을 사용하느냐에 따라 다릅니다. CORREL 함수는 텍스트, 논리값, 빈 셀은 무시하지만 0은 포함합니다. 반면 ToolPak의 Correlation 도구는 누락된 관측치가 있는 대상을 분석 전체에서 제외합니다.
어떤 경우에 강한 상관관계가 있다고 보나요?
Microsoft의 가이드는 수치적 기준보다는 방향성을 제시합니다. +1 또는 -1에 가까운 값은 더 강한 양의 상관관계 또는 음의 상관관계를 나타냅니다. 0에 가까운 값은 상관관계가 없거나 약함을 나타냅니다. 고정된 기준치는 연구 분야와 표본 크기에 따라 달라집니다.
높은 상관관계가 한 변수가 다른 변수의 원인임을 의미하나요?
아닙니다. 상관계수는 두 열이 얼마나 일관되게 함께 움직이는지만을 설명할 뿐, 인과관계의 방향이나 메커니즘에 대해서는 아무것도 알려주지 않습니다. 두 변수를 모두 움직이는 제3의 요인이 있거나, 한 열이 다른 열에서 파생된 경우에도 동일한 계수가 나타날 수 있습니다.