AI를 활용한 데이터 사전 작성법: 무료 단계별 가이드

데이터 사전은 데이터의 각 열이 실제로 무엇을 의미하는지 설명하는 문서입니다. 스프레드시트에서 파일 업로드, 각 필드 설명 및 유형 지정, 결과 검토 및 게시의 3단계로 데이터 사전을 구축할 수 있습니다. 이 가이드에서는 데이터 사전에 포함되어야 할 내용, 팀이 이를 수동으로 구축하는 방법, 그리고 번거로운 과정을 단축하는 방법을 다룹니다.
데이터 사전이란 무엇인가
미국 지질조사국(USGS)은 가장 명확한 정의를 제공합니다. USGS의 데이터 관리 지침에 따르면, 데이터 사전은 "데이터의 구조와 내용을 분류하고 전달하는 데 사용"되며, "개별적으로 명명된 데이터 객체에 대해 의미 있는 설명을 제공"합니다.
이 정의에서 가장 중요한 단어는 두 가지입니다. '분류(Catalog)'는 아무도 사용하지 않는 필드를 포함하여 모든 필드가 나열됨을 의미합니다. '전달(Communicate)'은 데이터베이스가 아닌 다른 사람이 읽을 수 있도록 작성되었음을 의미합니다.
이 두 번째 부분이 바로 실제 데이터 사전과 단순히 열 헤더를 스크린샷한 것의 차이점입니다. cust_stat_cd라는 헤더는 문서화가 아닙니다. 해당 코드가 무엇을 의미하는지, 어떤 값이 허용되는지, 빈칸이 무엇을 나타내는지 설명하는 행이 바로 문서화입니다.
대부분의 팀은 이미 데이터 사전이 필요하지만 그 사실을 인지하지 못하고 있습니다. "활성 고객"의 기준이 무엇인지에 대해 두 사람의 의견이 일치하지 않는 바로 그 순간, 누락된 문서가 바로 데이터 사전입니다.
데이터 사전에 포함되는 내용
USGS는 일반적인 구성 요소를 나열하고 있으며, 이 목록은 체크리스트로 사용할 수 있을 만큼 간결합니다.
| 구성 요소 | 기록하는 내용 |
|---|---|
| 데이터 객체 | 모든 필드의 이름 및 정의 |
| 세부 속성 | 데이터 유형, 크기, Null 허용 여부, 선택성, 인덱스 |
| 다이어그램 | 개체-관계(ERD) 및 기타 시스템 수준의 뷰 |
| 참조 데이터 | 분류 및 설명 도메인 |
| 품질 코드 | 누락된 데이터 및 품질 지표 코드 |
| 비즈니스 규칙 | 스키마 또는 데이터 품질 검증을 위한 규칙 |
모든 프로젝트에 이 여섯 가지가 모두 필요한 것은 아닙니다. 두 팀 간에 전달되는 단일 스프레드시트에는 처음 두 개와 다섯 번째 요소만 있으면 됩니다. 반면 프로덕션 데이터베이스에는 이 모든 요소가 필요합니다.
품질 코드 행은 가장 자주 생략되지만 가장 많이 후회하는 부분입니다. 빈 셀이 "0", "알 수 없음" 또는 "해당 없음"을 의미할 수 있는 경우, 이를 명문화해 두면 세 명의 분석가가 서로 다른 세 가지 집계 결과를 도출하는 것을 방지할 수 있습니다.
팀들이 데이터 사전을 구축하는 이유
USGS는 여섯 가지 용도를 제시하며, 각 용도는 실제로 예방할 수 있는 실패 사례와 매핑됩니다.
문서화(Documentation)는 사용자, 개발자 및 기타 이해관계자에게 구조적 세부 정보를 제공합니다. 의사소통(Communication)은 사람들에게 공통된 어휘를 제공하고 개발자가 스키마 변경의 영향을 평가하는 데 도움을 줍니다.
애플리케이션 설계(Application design)는 개발자가 올바른 데이터 유형과 컨트롤을 사용하여 양식 및 보고서를 빌드할 수 있도록 돕습니다. 시스템 분석(Systems analysis)은 분석가가 전반적인 설계를 파악하고 데이터가 각 프로세스와 만나는 지점을 추적할 수 있게 해줍니다.
데이터 통합(Data integration)은 스프레드시트 작업에서 가장 중요한 부분입니다. USGS는 명확한 정의가 "한 데이터 시스템을 다른 시스템에 매핑하는 방법을 결정할 때 필요한 맥락적 이해를 제공한다"고 설명합니다. 동일한 이해를 바탕으로 "특정 용도에 맞게 데이터를 하위 집합으로 만들거나, 병합하거나, 쌓거나, 변환할지 여부"를 결정하게 됩니다.
의사 결정(Decision making)은 마지막으로 데이터 수집 및 기타 협업 작업을 계획하는 데 도움을 줍니다.
같은 페이지에는 더 날카로운 지적이 숨겨져 있습니다. USGS는 데이터 사전이 신뢰성 문제를 드러낼 수 있다고 관찰합니다. 또한 "불완전한 데이터 정의는 다른 면에서 훌륭한 데이터를 사실상 쓸모없게 만들 수 있다"고 경고합니다.
요구 사항 측면도 문서화되어 있습니다. USGS 메타데이터 관련 조사 매뉴얼 장에서는 출처 및 사용 제한 사항과 함께 엔티티 및 속성의 정의를 기록에 포함하도록 의무화하고 있습니다.
팀이 수동으로 데이터 사전을 구축하는 방법
수동으로 구축하는 경로는 데이터가 어디에 저장되어 있는지에 따라 달라지며, 두 가지 방식 모두 유효합니다.
데이터가 데이터베이스에 있는 경우, 시스템이 첫 번째 초안을 생성해 줄 수 있습니다. USGS는 대부분의 데이터베이스 관리 시스템이 "활성 데이터 사전을 내장하고 있어 필요에 따라 문서를 생성할 수 있다"고 언급합니다.
데이터가 스프레드시트에 있는 경우, 자동 생성기가 없습니다. USGS는 "Excel에서 간단한 '데이터 사전'을 수동으로 만들기 위한" 빈 템플릿을 제시하는데, 이것이 바로 현재의 솔직한 기술 수준입니다.
수동 버전은 데이터를 잘 아는 사람이 열당 한 행씩 직접 채워 넣는 것을 의미합니다. 필드 이름, 쉬운 언어로 된 정의, 유형, 허용되는 값, 빈칸 허용 여부, 소유자 등이 포함됩니다.
15개 열로 구성된 내보내기 파일의 경우 20분 정도 걸립니다. 하지만 3개 시스템에서 가져온 60개 열의 운영 파일이라면 아무도 내고 싶지 않은 반나절의 시간을 고스란히 써야 합니다.
수동 방식의 병목 구간
병목 현상은 글쓰기 자체에서 발생하는 경우가 드릅니다. 진짜 문제는 '고고학적 발굴 작업'에 있습니다.
실제 내보낸 파일의 열 중 절반은 5년 전 누군가의 머릿속에만 있던 약어로 이름이 지정되어 있습니다. flag_2가 무엇을 의미하는지 파악하려면 데이터를 열고, 정렬하고, 값들로부터 규칙을 유추해야 합니다.
그 다음은 '변화(drift)'입니다. USGS는 그 결과에 대해 단호하게 경고합니다. "실제 데이터 구조에 맞춰 사전을 최신 상태로 유지하지 못하는 것은 데이터 관리 책임(stewardship)의 부재를 의미한다." 한 번 작성된 후 방치된 사전은 아예 없는 것보다 나쁩니다. 사람들이 그 사전을 신뢰하기 때문입니다.
두 문제 모두 기계적인 작업입니다. 모든 열을 읽고, 값을 프로파일링하고, 유형과 정의를 제안하는 것은 반복적인 과정입니다. 사람들은 이 작업을 지루하게 느끼며, 40번째 행쯤 가면 일관성을 잃기 시작합니다.
AI로 데이터 사전을 만드는 방법
1단계: 문서화가 필요한 파일 업로드하기
Powerdrill Bloom에 로그인하고 내보낸 파일을 업로드합니다. 무료 플랜에서는 Excel, CSV, PDF 및 문서 업로드가 지원됩니다.
일부만 잘라낸 샘플이 아닌 실제 파일을 업로드하세요. 보통 900번째에서 1,100번째 행 사이에 있는 특이한 값들에 흥미로운 규칙들이 숨어 있습니다.
2단계: 자연어로 필드별 프로파일링 요청하기
열당 한 행씩 결과를 요청하세요. 각 행에는 쉬운 언어로 된 정의, 추정되는 데이터 유형, 범위 또는 고유 값, 빈칸 개수가 포함되어야 합니다. 데이터가 아닌 코드처럼 보이는 값이 있으면 표시해 달라고 요청하세요.
그런 다음 모호한 부분들을 파고듭니다. 어떤 열이 코드화된 의미를 담고 있는 것으로 보이는지, 그리고 각 코드가 무엇을 나타내는지 물어보세요. 그런 다음 시스템을 잘 아는 사람과 함께 이를 확인하거나 수정할 수 있습니다.
이 단계의 출력물은 최종 문서가 아닌 초안입니다. 이 단계의 역할은 고고학적 발굴 작업을 없애고 사용자가 판단만 내릴 수 있도록 돕는 것입니다.
3단계: 정의 수정 및 게시하기
모든 행을 검토하고 인간만이 해결할 수 있는 부분을 수정합니다. 예를 들어 활성 상태의 기준이 무엇인지, 두 개의 날짜 열이 왜 일치하지 않는지, 어떤 필드가 신뢰할 수 있는 기준인지 등을 정리합니다. 그런 다음 결과를 시트나 문서로 내보냅니다.
데이터 자체와 같은 위치에 보관하세요. 누군가의 다운로드 폴더에 방치된 사전은 문서화가 아니며, 방금 수정한 '변화(drift)' 문제를 가장 빠르게 재발시키는 지름길입니다.
첫날 이후에도 유용하게 유지하는 방법
데이터 사전은 정확성을 유지할 때만 제값을 하며, USGS는 그 방법을 직접적으로 제시합니다. 미리 계획을 세우고, 새로운 요소가 확인되는 대로 추가하며, 구조가 변경될 때 사전을 업데이트하는 것입니다.
다음 세 가지 습관이 큰 도움이 됩니다.
외부인을 위해 정의를 작성하세요. 신입 사원이 추가 질문 없이 정의를 이해하고 사용할 수 없다면, 아직 완성된 것이 아닙니다.
데이터와 함께 버전을 관리하세요. 열이 추가되거나 유형이 변경되면 다음 분기가 아니라 바로 그 시점에 데이터 사전도 함께 변경되어야 합니다.
표준이 있다면 이를 채택하세요. USGS는 데이터 표준을 채택하고 인용하면 자체 문서를 관리할 필요가 전혀 없어진다고 설명합니다.
데이터 사전은 숫자에 대해 한 번에 합의하는 더 넓은 습관과도 자연스럽게 연결됩니다. 단일 진실 공급원(single source of truth) 구축 가이드는 이보다 한 단계 높은 레이어를 다룹니다. 한편, 다른 사람이 만든 스프레드시트 분석하기는 일반적으로 이러한 필요성을 유발하는 상황을 다룹니다.
이미 가지고 있는 파일로 시작해 보세요
무료 플랜에서도 위의 모든 과정을 완료할 수 있습니다. 무료 플랜에는 Excel, CSV, PDF 및 문서 업로드, 인사이트 및 요약 생성, 기본 슬라이드, 문서, 시트 및 이미지 생성이 포함됩니다.
두 가지 제한 사항을 명확히 말씀드립니다. Excel 분석 및 Office 문서 생성은 Pro 플랜에 포함되어 있습니다. 무료 플랜에는 예약된 작업이 1개만 포함되므로, 일정에 따라 주기적으로 재생성되는 데이터 사전은 유료 등급이 필요합니다.
원본 파일을 먼저 정리해야 하는 경우, AI 데이터 클리닝 페이지에서 해당 단계를 다룹니다. Excel AI assistant 및 CSV AI assistant 페이지에서는 가장 일반적인 두 가지 파일 유형을 다룹니다. 지금 바로 가장 복잡한 내보내기 파일을 문서화하려면 Powerdrill Bloom을 사용해 보세요.
자주 묻는 질문
데이터 사전과 메타데이터의 차이점은 무엇인가요?
데이터 사전은 개별 필드의 구조와 내용을 설명합니다. 메타데이터는 더 넓은 개념으로, 누가 데이터를 생성했는지, 왜 생성했는지, 어떻게 수집되고 처리되었는지 등을 다룹니다.
Excel에서 데이터 사전을 만들 수 있나요?
네, 스프레드시트 데이터의 경우 이것이 일반적인 접근 방식입니다. USGS는 Excel에서 간단한 데이터 사전을 수동으로 구축할 수 있는 빈 템플릿을 제공합니다.
각 필드 정의는 얼마나 자세해야 하나요?
팀 외부의 누군가가 질문 없이 해당 열을 사용할 수 있을 정도로 자세해야 합니다. 허용되는 값과 빈칸이 의미하는 바를 포함하세요. 대부분의 의견 불일치는 이 부분에서 발생하기 때문입니다.
데이터 사전의 소유권은 누구에게 있어야 하나요?
보고서를 요청한 사람이 아니라 데이터 구조를 소유한 사람이어야 합니다. 소유권은 열이 변경될 때 가장 중요해지는데, 데이터 사전도 같은 시점에 함께 변경되어야 하기 때문입니다.
데이터 사전은 얼마나 자주 업데이트해야 하나요?
기본 구조가 변경될 때마다 업데이트해야 합니다. USGS는 오래된 사전을 관리 책임(stewardship)의 문제로 취급합니다. 사람들은 더 이상 데이터와 일치하지 않는 정의를 계속 신뢰하기 때문입니다.