슈퍼 세일 위크Claude Skills — 20% 할인
Glossary

XML 파일 마스터하기: 구조, 사용 사례 및 주요 장점

Powerdrill Bloom·
XML 파일 마스터하기: 구조, 사용 사례 및 주요 장점

XML 파일은 행과 열 대신 중첩된, 사람이 읽을 수 있는 태그 형태로 구조화된 데이터를 저장합니다. Microsoft는 이 형식을 "사람이 읽을 수 있는 텍스트 파일에서 구조화된 데이터를 관리하고 공유하기 위해 설계된 기술"이라고 설명합니다. 이 가이드에서는 이러한 파일이 어떻게 빌드되는지, 어디에서 제공되는지, 스프레드시트에서 이를 어떻게 처리하는지, 그리고 이 파일에서 원하는 답을 얻는 방법을 다룹니다.

XML 파일이란 무엇인가요

이는 데이터와 그 데이터가 설명하는 대상의 이름을 모두 담고 있는 일반 텍스트 파일입니다. 쉼표로 구분된 내보내기는 값만 제공하며 그 의미는 헤더 행에 의존합니다. 반면 태그가 지정된 파일은 모든 값 바로 옆에 인라인으로 의미를 함께 전달합니다.

이러한 설계는 다른 무엇보다 먼저 이해해야 할 한 가지 결과를 가져옵니다. 이 형식은 계층 구조이므로 하나의 레코드가 여러 수준 깊이로 다른 레코드를 포함할 수 있습니다. 스프레드시트는 평면적이며, 이 두 형태 사이의 격차로 인해 대부분의 실무적인 어려움이 발생합니다.

Microsoft의 개요에서는 그 목적을 한 문장으로 요약합니다. 이 형식은 "데이터베이스, 애플리케이션, 조직 간의 데이터 정의, 전송, 유효성 검사 및 해석을 크게 용이하게 합니다."

구조가 작동하는 방식

요소와 중첩

모든 값은 이름이 지정된 요소 내에 위치하며, 요소는 다른 요소를 포함할 수 있습니다. 예를 들어 청구서에는 고객 블록, 품목 목록, 합계 블록이 포함될 수 있으며, 각 블록은 고유한 하위 요소를 가집니다.

중첩이 핵심입니다. 이는 평면적인 테이블에서는 행 전체에 걸쳐 값을 반복해야만 표현할 수 있는 관계를 기록합니다.

사용자 지정 태그

태그 이름은 형식에 의해 고정되어 있지 않습니다. 공식 개요에서 언급하듯이, "애플리케이션 설계자는 자신만의 사용자 지정 태그, 데이터 구조 및 스키마를 생성할 수 있습니다."

이 때문에 서로 다른 두 공급업체의 파일이 동일한 청구서를 설명하면서도 필드 이름을 거의 공유하지 않을 수 있습니다. 모든 분석은 눈앞에 있는 태그가 실제로 무엇을 의미하는지 읽는 것부터 시작해야 합니다.

스키마 및 유효성 검사

별도의 스키마 파일이 규칙을 정의합니다. Microsoft는 이 둘의 결합을 직접 설명합니다. 데이터 파일은 "사용자 지정 태그와 구조화된 데이터를 포함"합니다. 스키마 파일은 "데이터 유형 및 유효성 검사와 같은 규칙을 적용하는 스키마 태그를 포함"합니다.

스키마는 .xsd 확장자를 사용합니다. 또한 이 표준은 .xslt 확장자를 가진 변환 파일도 정의하는데, 이는 "스타일을 적용하고 XML 데이터를 다른 프레젠테이션 형식으로 변환하는 데 사용되는" 파일로 설명됩니다.

이 파일들이 사용되는 용도

이 형식을 직접 선택하는 경우는 드뭅니다. 보통 수년 동안 운영되어 온 시스템에서 전달됩니다.

  • 금융 및 은행 업무. 거래 내역서 및 결제 메시지 형식은 일반적으로 구분 기호 대신 태그가 지정된 형식을 사용합니다.
  • 전자 청구서 발행. 많은 국가의 전자 청구서 의무화 제도에서는 태그가 지정된 문서를 법적 증빙 자료로 지정합니다.
  • ERP 및 HR 내보내기. 오랫동안 사용된 엔터프라이즈 시스템은 종종 이 형식으로 기본 내보내기를 수행합니다.
  • 제품 및 콘텐츠 피드. 소매 카탈로그 피드 및 신디케이션 형식은 태그 기반입니다.
  • 구성 및 Office 문서. 최신 Office 파일 형식은 태그가 지정된 파트들을 압축한 모음입니다.

이 다섯 가지 모두 패턴은 동일합니다. 이 파일은 분석가를 위해 생성된 작업 파일이 아니라, 다른 머신을 위해 생성된 상호 교환용 결과물입니다.

평면적 형식과의 비교

태그 지정 파일 (.xml) CSV Parquet
형태 중첩됨, 여러 수준 평면적인 행과 열 평면적, 열 지향적
필드 이름 모든 값과 함께 인라인으로 전달됨 헤더 행에만 존재 파일 메타데이터에 저장됨
유효성 검사 선택적 스키마 파일이 유형을 강제함 기본 제공되지 않음 스키마에 유형이 유지됨
텍스트 편집기에서 읽기 가능 여부 가능 (장황하긴 함) 아니요
동일한 데이터 기준 일반적인 크기 가장 큼 중간 가장 작음
일반적인 출처 엔터프라이즈 시스템 및 상호 교환 표준 내보내기 및 보고서 데이터 플랫폼

이러한 형식을 자주 다루신다면, TSV 파일Parquet 파일에 대한 관련 설명서에서 위 표의 평면적 형식 부분을 자세히 다루고 있으니 참고하시기 바랍니다.

Excel에서 이 형식을 처리하는 방법

대부분의 분석가가 이 형식을 처음 접하는 지점이 바로 여기이며, 공식 문서에는 어떤 일이 일어나는지 이례적으로 명확하게 설명되어 있습니다.

가져오기 경로는 메인 리본 메뉴에 없습니다. Microsoft의 가져오기 지침은 "개발 도구 > 가져오기를 클릭합니다"입니다. 이 탭은 기본적으로 숨겨져 있기 때문에, 해당 페이지에서는 이 탭을 표시하는 단계도 함께 안내합니다.

기본적인 워크플로는 Microsoft의 표현을 빌리자면 "5단계"로 구성됩니다. 통합 문서에 스키마 파일을 추가한 다음, 해당 요소를 셀이나 테이블에 매핑합니다. 그런 다음 데이터 파일을 가져와 요소를 매핑된 셀에 바인딩합니다. 거기서부터 Excel에서 작업을 수행하고, 수정된 데이터를 다시 내보냅니다.

다른 무엇보다 중요한 두 가지 동작이 있습니다.

스키마를 제공하지 않으면 Excel이 스키마를 추측합니다. 스키마를 먼저 추가하지 않고 가져오면 "Excel이 스키마를 유유하려고 시도"합니다. 이 추측은 "XML 데이터 파일에 정의된 태그를 기반"으로 합니다.

그런 다음 추측된 스키마는 통합 문서와 함께 저장됩니다. 또한 해당 페이지에서는 "Excel에서 유추한 스키마를 별도의 XML 스키마 데이터 파일(.xsd)로 내보낼 수 없다"고 명시하고 있습니다.

가져오는 과정에서 중첩 구조가 평면화됩니다. Microsoft는 읽기 전용으로 열었을 때의 결과를 다음과 같이 설명합니다. 이는 "XML 태그를 열 머리글로 표시하는 행과 열이 있는 2차원 테이블"이 됩니다. 루트 요소는 "제목처럼 사용"됩니다.

이러한 평면화는 분석을 위해 정확히 원하는 작업인 동시에, 의미가 손실되는 지점이기도 합니다. 3단계 계층 구조가 열로 변환되며, 부모와 자식 간의 관계는 태그의 명명 방식에만 남게 됩니다.

주요 장점

데이터가 스스로를 설명합니다. 필드 이름이 값과 함께 이동하므로, 문서와 분리된 파일이라도 여전히 해석할 수 있습니다.

유효성 검사가 생태계의 일부입니다. 스키마는 데이터가 전달되기 전에 데이터 유형과 필수 필드를 강제할 수 있으며, 이는 일반적인 구분 기호 기반 내보내기에서는 불가능한 기능입니다.

조직의 경계를 넘나듭니다. 공식 개요에서 언급하듯이, 이 형식은 "업계 표준 가이드라인을 따르며 다양한 데이터베이스와 애플리케이션에서 처리할 수 있습니다."

계층 구조가 보존됩니다. 12개의 품목이 있는 청구서 1개는 헤더 값을 반복하는 12개의 행이 되는 대신, 여전히 1개의 청구서로 유지됩니다.

알아두어야 할 한계

장황함. 모든 값 주위에 태그 이름을 반복하기 때문에 평면적 형식의 동일한 데이터와 비교할 때 파일 크기가 커집니다.

태그 이름이 공급업체마다 표준화되어 있지 않습니다. 사용자 지정 태그는 이 형식의 특징이지만, 그 대가로 새로운 소스가 있을 때마다 해석이 필요합니다.

스프레드시트는 계층 구조를 평면화해야 합니다. 피벗, 차트 또는 수식은 직사각형 형태의 데이터를 요구하므로 분석을 시작하기 전에 형태를 변경해야 합니다.

유효성 검사 시 가져오기가 실패할 수 있습니다. Microsoft는 "Excel이 XML 맵에 따라 데이터를 확인할 수 없는 경우 XML 가져오기 오류 대화 상자를 표시한다"고 설명합니다. 이 경우 작업을 시작하기 전에 스키마를 다시 확인해야 합니다.

형태와 씨름하지 않고 답을 얻는 방법

실무적인 질문은 "이 파일을 어떻게 여는가"가 아니라, "오늘 오후까지 어떻게 이 파일로 차트를 만드는가"인 경우가 많습니다.

효과적인 방법은 Excel이 이미 암시하고 있는 방법입니다. 계층 구조를 직사각형 형태로 평면화하고, 계층 구조의 어느 수준을 하나의 행으로 삼을지 결정한 다음 거기서부터 분석하는 것입니다.

Powerdrill Bloom은 Excel, CSV, PDF 및 문서를 업로드 파일로 지원하므로, 태그가 지정된 소스 파일을 먼저 CSV 또는 통합 문서로 변환해야 합니다. Excel의 읽기 전용 열기 기능은 정확히 그러한 직사각형 형태를 만들어내며, 데이터 도구의 모든 변환 단계도 마찬가지입니다.

데이터가 평면화되면 분석은 평범해집니다. CSV AI assistant 페이지에서 해당 경로를 설명합니다. 요금제 페이지에서는 그 결과를 다음과 같이 요약합니다. 데이터를 기반으로 질문하고 "차트, 테이블 및 내보내기 기능이 포함된 근거 있는 답변을 얻으세요." 특히 차트를 원하신다면, CSV 파일을 차트로 변환하는 방법에 대한 가이드에서 처음부터 끝까지 자세히 다루고 있습니다.

변환하기 전에 신중하게 결정해야 할 사항이 하나 있습니다. 행의 세분성을 의도적으로 선택하십시오. 품목당 한 행으로 구성하는 것과 청구서당 한 행으로 구성하는 것은 서로 다른 질문에 대한 답을 제공합니다.

결론

이 형식은 장황하고, 스스로를 설명하며, 계층 구조를 가집니다. 이 세 가지 특성이 이 형식을 다루는 작업의 모든 것을 설명해 줍니다. 조직 간에 데이터를 이동하는 데는 매우 유용하지만, 조직 내부에서 데이터를 분석하는 데는 번거롭습니다.

변환을 단순한 잡무가 아닌 하나의 의사 결정으로 취급하십시오. 행이 될 수준을 선택하고 태그 이름을 열 머리글로 유지하십시오. 그 이후의 작업은 일반적인 스프레드시트 분석과 동일합니다.

지금 폴더에 이러한 파일 중 하나가 보관되어 있나요? 파이프라인 구축에 투자하기 전에, 평면화된 내보내기 파일로 Powerdrill Bloom을 사용해 보고 차트를 먼저 확인해 보세요.

자주 묻는 질문

XML 파일은 어떤 용도로 사용되나요?

시스템과 조직 간에 구조화된 데이터를 이동하는 데 사용됩니다. 일반적인 출처로는 은행 메시지, 전자 청구서, ERP 및 HR 내보내기, 소매 제품 피드, Office 문서의 내부 파트 등이 있습니다.

XML과 CSV의 차이점은 무엇인가요?

하나는 계층 구조이며 모든 값과 함께 인라인으로 필드 이름을 전달합니다. 다른 하나는 평면적이며 단일 헤더 행에 의존합니다. 또한 태그가 지정된 형식은 스키마 파일에 대해 유효성 검사를 수행할 수 있지만, 구분 기호로 분리된 내보내기 파일은 그렇게 할 수 없습니다.

Excel에서 XML 파일을 어떻게 여나요?

Microsoft가 문서화한 경로는 개발 도구 > 가져오기이며, 개발 도구 탭은 기본적으로 숨겨져 있습니다. 파일을 읽기 전용으로 열 수도 있으며, 이 경우 태그를 열 머리글로 사용하는 2차원 테이블이 생성됩니다.

데이터를 사용하려면 스키마 파일이 필요한가요?

아니요. Microsoft 문서에 따르면 스키마가 제공되지 않으면 Excel이 태그에서 스키마를 유추하려고 시도합니다. 유추된 스키마는 통합 문서와 함께 유지되며 별도의 .xsd 파일로 내보낼 수 없습니다.

XSLT란 무엇인가요?

Microsoft는 이를 데이터 형식과 함께 정의된 변환 표준으로 설명합니다. 이는 "스타일을 적용하고 XML 데이터를 다른 프레젠테이션 형식으로 변환하기 위해" .xslt 파일을 사용합니다.