AI를 활용한 주제 분석 방법: 단계별 가이드

주제 분석(Thematic analysis)은 인터뷰 녹취록이나 개방형 설문조사 답변과 같은 질적 데이터에서 의미의 패턴을 찾는 방법입니다. AI를 활용해 이를 수행하려면 녹취록과 연구 질문을 업로드하고, AI가 1차 코드를 제안하도록 한 다음, 직접 주제를 개발하고 검토하세요. AI는 읽기와 분류 속도를 높여주지만, 해석은 여전히 연구자의 몫입니다.
이 가이드는 주제 분석이 무엇인지 설명하고, 6단계 과정을 단계별로 살펴보며, AI가 도움이 되는 부분과 AI가 결정해서는 안 되는 부분을 보여줍니다. 또한 실전 예시, 결과 표 형식, 내용 분석(content analysis)과의 비교도 포함되어 있습니다.
주제 분석이란 무엇인가
이 방법론에서 가장 널리 인용되는 버전을 개발한 Virginia Braun과 Victoria Clarke는 자신들의 사이트에서 다음과 같이 정의합니다. "주제 분석(TA)은 데이터 세트 전반에서 패턴화된 의미를 탐색하고 해석하는 데 사용되는 다양한 질적 연구 방법을 의미합니다."
이 정의에서 두 단어가 중요합니다. "다양한(Range)"은 주제 분석이 하나의 고정된 절차가 아니라 일련의 접근 방식 모음임을 의미합니다. "해석하는(Interpreting)"은 결과물이 데이터가 말하는 바를 단순히 세어보는 것이 아니라, 데이터가 무엇을 의미하는지에 대한 논증임을 뜻합니다.
Braun과 Clarke는 이 접근 방식들을 코딩 신뢰도 접근법(coding reliability approaches), 코드북 접근법(codebook approaches), 그리고 그들의 자체적인 성찰적 접근법(reflexive approach)의 세 가지 클러스터로 분류합니다. 이 차이는 AI를 활용하는 방식에 영향을 미칩니다.
- 코딩 신뢰도는 코드북을 조기에 확정하고 서로 다른 코더들이 이를 동일한 방식으로 적용하는지 확인합니다.
- 코드북 접근법 역시 구조화된 프레임워크를 사용하지만, 어느 정도 유연하게 발전할 수 있도록 허용합니다.
- 성찰적 주제 분석(Reflexive thematic analysis)은 코딩을 열어두고 이해가 깊어짐에 따라 코딩이 변할 수 있도록 합니다. 이들의 FAQ에서는 "성찰적 TA는 코드북을 지양한다"고 명확히 밝히고 있습니다.
성찰적 주제 분석에서 주제(theme)는 단순한 토픽(topic) 이상입니다. Braun과 Clarke는 주제를 "중심 개념이나 아이디어에 의해 뒷받침되는 공유된 의미의 패턴"으로 설명합니다. 예를 들어 "가격 책정"이라는 토픽은 주제가 될 수 없습니다. "고객은 가격을 신뢰의 신호로 읽는다"가 주제가 됩니다.
6단계 과정
Braun and Clarke는 6단계를 제시합니다. 그들은 "이 단계들이 반드시 따라야 하는 엄격한 프로세스를 규정하는 것은 아니다"라고 강조합니다. 실제로 분석을 진행할 때는 이 단계들을 앞뒤로 오가게 됩니다.
- 데이터 세트에 익숙해지기. 데이터를 반복해서 읽고 첫 관찰 결과를 기록합니다.
- 코딩하기. 전체 데이터 세트에 걸쳐 의미 있는 세그먼트에 짧은 라벨을 붙이며, 두 번 이상 반복하여 진행합니다.
- 초기 주제 생성하기. 코드를 의미의 후보 패턴으로 클러스터링합니다.
- 주제 개발 및 검토하기. 코딩된 데이터 및 전체 데이터 세트와 비교하여 각 후보를 확인합니다. 필요에 따라 주제를 분할, 병합 또는 삭제합니다.
- 주제 세분화, 정의 및 명명하기. 각 주제의 범위와 스토리를 파악하고 유용한 이름을 부여합니다.
- 보고서 작성하기. 분석적 서사를 데이터 발췌본과 함께 엮어내고, 이를 기존 문헌과 연결합니다.
그들의 사이트에서는 이 과정을 솔직하게 설명합니다. "분석은 일반적으로 순환적인 과정입니다." 주제를 구축하기 시작한 후에도 다시 코딩 단계로 돌아갈 수 있음을 염두에 두어야 합니다.
AI가 도움이 되는 부분과 AI가 결정해서는 안 되는 부분
AI는 대량의 작업이 필요한 단계에서 진정으로 유용합니다. 40개의 녹취록을 빠르게 읽고, 후보 코드를 제안하며, 코드에 부합하는 모든 발췌본을 추출하고, 패턴이 나타나는 빈도를 계산할 수 있습니다.
하지만 해석적인 판단을 AI에 맡겨서는 안 됩니다. Braun과 Clarke는 "질적 분석은 숙련되고, 상황 맥락적이며, 주관적인 과정이다"라고 썼습니다. 모델은 연구 질문에 대한 여러분의 이해관계를 공유하지 않으며, 오직 여러분이 제공한 맥락만을 알 뿐입니다.
그들의 FAQ는 분석 소프트웨어에 대해서도 이와 관련된 지적을 합니다. 중요한 것은 "의식 있는 연구자가 되는 것"이라고 그들은 말합니다. 즉, 어떤 도구를 사용하든 자신이 선택한 접근 방식의 가치에 부합하는 방식으로 사용해야 한다는 의미입니다.
실용적인 역할 분담은 다음과 같습니다.
| 단계 | AI가 할 수 있는 일 | 연구자가 결정할 일 |
|---|---|---|
| 익숙해지기 | 각 녹취록 요약, 놀라운 구절 표시 | 어떤 구절이 질문에 중요한지 판단 |
| 코딩하기 | 1차 코드를 제안하고 일관되게 적용 | 어떤 코드를 유지, 병합 또는 이름을 변경할지 결정 |
| 주제 생성하기 | 코드를 클러스터링하고 뒷받침하는 발췌본 추출 | 클러스터가 실제 의미 있는 패턴인지 판단 |
| 주제 검토하기 | 데이터 세트에서 반대 사례 검색 | 주제가 타당하게 유지되는지 확인 |
| 주제 명명하기 | 이름 및 한 줄 정의 제안 | 최종 이름과 그것이 전달하는 스토리 결정 |
| 보고서 작성하기 | 섹션 초안 작성 및 인용구 취합 | 논증과 그 주장 구성 |
코드북 접근법을 사용하는 경우, AI의 결과물은 코드북 초안 역할을 할 수 있습니다. 성찰적 주제 분석을 사용하는 경우, AI 코드를 분석 결과 자체로 받아들이지 말고 사고를 자극하는 프롬프트로 취급하세요.
어떤 접근 방식을 사용하든 AI가 어떻게 관여했는지 기록해 두세요. 사용한 도구, 도움을 받은 단계, 그리고 이후에 수정한 내용을 적어둡니다. 짧은 방법론 단락을 작성해 두면 검토자, 심사위원 또는 이해관계자가 질문하기 전에 미리 답을 제공할 수 있습니다.
시작하기 전에 필요한 것
AI 도구가 데이터를 다루기 전에 다음 네 가지를 준비하세요.
명확한 연구 질문. 모든 코드와 주제는 이 질문을 기준으로 평가됩니다. "고객이 온보딩 중에 무엇을 경험하는가?"라는 질문은 "고객이 첫 달에 취소하는 이유는 무엇인가?"라는 질문과 완전히 다른 분석 결과를 낳습니다.
깨끗하게 비식별화된 녹취록. 이름, 회사명, 이메일 및 참가자를 식별할 수 있는 모든 세부 정보를 제거하세요. 업로드한 후가 아니라 업로드하기 전에 이 작업을 수행해야 합니다. 제3자 도구 사용에 제한이 있는지 윤리 승인 서류나 동의서를 확인하세요.
자체 성찰을 위한 메모 문서. 성찰적 주제 분석은 연구자의 관점을 전면에 내세웁니다. AI가 생성하는 결과물과는 별개로, 데이터를 읽으면서 생기는 가정과 반응을 지속적으로 기록해 두세요.
일관된 파일 형식. 화자 라벨이 포함된 인터뷰당 하나의 파일로 구성하면 모든 발췌본의 출처를 더 쉽게 추적할 수 있습니다. 참가자 코드와 인터뷰 날짜를 매핑하는 간단한 인덱스를 유지하세요.
AI로 주제 분석을 수행하는 방법
아래 단계들은 6단계 과정을 따르며, 세 번의 작업 세션으로 그룹화되어 있습니다.
1단계: 녹취록 로드 및 연구 질문 설정
비식별화된 녹취록을 Powerdrill Bloom과 같은 AI 워크스페이스에 업로드합니다. 요금제에 따라 Excel, CSV, PDF 및 문서 업로드가 지원되므로 Word나 PDF 형식의 녹취록을 그대로 사용할 수 있습니다. 스프레드시트로 내보낸 개방형 설문조사 답변도 작동합니다.
요청을 하기 전에 먼저 연구 질문을 명시하세요. 그런 다음 각 녹취록의 짧은 요약과 질문과 관련된 구절 목록을 요청합니다.
요약본을 읽은 다음, 녹취록을 직접 읽어보세요. AI 요약은 데이터에 익숙해지는 속도를 높여주지만, 직접 읽는 것을 대체할 수는 없습니다. AI가 생성한 코드를 보기 전에 별도의 문서에 자신만의 첫인상을 기록해 두세요.
2단계: 1차 코드 생성 후 직접 다시 코딩하기
AI에게 각 녹취록에 대한 코드를 제안하도록 요청하세요. 짧은 라벨, 각 코드에 대한 한 줄 정의, 그리고 이를 뒷받침하는 정확한 발췌본을 요청합니다.
유용한 요청은 짧고 구체적입니다. 연구 질문과 관련된 모든 내용에 대해 녹취록을 코딩하고, 라벨은 5단어 이하로 유지하며, 각 코드에 대해 정확한 구절을 인용하도록 하세요. 정확한 구절을 요청하면 참가자가 실제로 말한 내용에서 벗어난 코드를 쉽게 찾아낼 수 있습니다.
그런 다음 직접 두 번째 코딩을 진행하세요. 여러분의 코드와 AI의 목록을 비교해 봅니다. 일치하는 부분은 해당 코드가 실제로 존재하는 현상을 명확히 설명하고 있을 가능성이 높습니다. 서로 다른 부분은 면밀히 살펴보세요. AI가 여러분이 놓친 부분을 발견했거나, 의미보다는 표면적인 단어에 라벨을 붙였을 수 있습니다.
모든 발췌본을 추적 가능하게 유지하세요. 각 코드는 참가자와 구절을 가리켜야 합니다. Powerdrill Bloom의 홈페이지에서는 모든 숫자가 "해당 페이지, 행, 그리고 그 뒤에 있는 수치와 함께 반환된다"고 설명하고 있으며, 인용구에 대해서도 동일한 추적 가능성이 중요합니다.
3단계: 후보 주제 구축 및 데이터 대조 검토
AI에게 최종 코드를 후보 주제로 클러스터링하고, 각 주제를 뒷받침하는 발췌본을 추출하도록 요청하세요. 이 클러스터를 시작점으로 삼으십시오.
각 후보에 대해 한 가지 질문을 던져보세요. 그 뒤에 중심 개념이나 아이디어가 존재하는가? 만약 대답이 단지 공유된 토픽에 불과하다면, 그것은 아직 주제가 아닙니다. 분할하거나, 병합하거나, 삭제하세요.
그런 다음 각 주제를 테스트합니다. AI에게 해당 주제와 모순되는 발췌본을 찾도록 요청하세요. 의도적인 반대 사례 검색을 거쳐 살아남은 주제는 한 번도 검증받지 않은 주제보다 더 강력합니다.
마지막으로, 각 주제의 이름을 짓고 두 문장으로 된 정의를 작성합니다. 섹션별로 보고서 초안을 작성하고, 보고서에 들어가기 전에 모든 인용구를 원본 녹취록과 대조하여 확인하세요.
실전 예시
다음은 12명의 고객 인터뷰를 대상으로 진행한 제품 연구 조사 프로세스의 요약본입니다. 연구 질문은 신규 고객이 30일 이내에 제품 사용을 중단한 이유였습니다.
1차 AI 코딩 결과에는 "설정이 너무 오래 걸림", "불명확한 가격 책정", "IT 승인 필요" 등이 포함되었습니다.
두 번째 코딩 과정을 거친 후, 연구자는 이 세 가지 코드가 모두 제품을 직접 선택하지 않은 사람들의 인터뷰에서 나타났다는 점을 발견했습니다.
그 결과 도출된 주제는 "소유권 없는 도입(adoption without ownership)"이었습니다. 제품을 물려받아 사용하게 된 고객은 초기 마찰을 감수하며 사용할 이유가 없었던 것입니다.
연구자는 AI에게 반대 사례, 즉 제품을 직접 선택하지 않았음에도 계속 사용한 고객을 찾아달라고 요청했습니다. 두 건의 인터뷰가 이에 부합했습니다. 두 사례 모두 첫 주에 동료가 빠른 성과(quick win)를 보여주었다고 설명했으며, 이는 주제를 깨뜨리기보다는 오히려 더 정교하게 다듬어 주었습니다.
AI는 코드를 빠르게 표면화해 주었습니다. 하지만 주제는 코드가 스스로 포착하지 못한, "누가 그 말을 하고 있는가"를 연구자가 알아차림으로써 도출되었습니다.
주제 분석 결과 제시 방법
결과 섹션은 대개 주제 표로 시작하여, 각 주제를 뒷받침하는 발췌본과 함께 논의하는 방식으로 진행됩니다. 아래 표는 흔히 사용되는 형식을 보여줍니다.
| 주제 | 정의 | 참가자 | 발췌 예시 |
|---|---|---|---|
| 소유권 없는 도입 (Adoption without ownership) | 제품을 직접 선택하지 않은 사용자는 지속해서 사용할 이유가 거의 없음 | 12명 중 7명 | "그냥 쓰라고 해서 최소한으로만 사용했습니다." |
| 첫인상으로서의 설정 (Setup as a first impression) | 초기 설정에 들인 노력이 제품에 대한 전반적인 관점을 형성함 | 12명 중 9명 | "첫 한 시간이 힘들면 나머지 기능도 다 어려울 거라고 생각하게 됩니다." |
표 다음에 각 주제에 대한 짧은 섹션을 이어가세요. 중심 아이디어를 설명하고, 두세 개의 발췌본을 보여주며, 이를 연구 질문과 연결합니다.
같은 말을 하는 세 개의 인용구보다는 주제를 다양한 각도에서 보여주는 발췌본을 선택하세요. 발췌본은 짧게 유지하고, 항상 참가자 코드를 명시해야 합니다. 독자들은 여러 사람의 목소리를 통해 주제를 확인할 때 더 깊이 신뢰하게 됩니다.
참가자 수는 유용한 맥락을 제공하지만, Braun과 Clarke의 접근 방식은 빈도를 중요도의 척도로 취급하지 않습니다. 4명이 언급한 주제가 10명이 언급한 주제보다 더 중요할 수 있습니다.
이해관계자를 대상으로 할 때, 동일한 결과가 종종 짧은 프레젠테이션 덱으로 변환되기도 합니다. AI research synthesis 도구는 녹취록과 설문조사를 주제, 증거 및 이해관계자용 덱으로 결합하는 이 경로를 설명합니다.
주제 분석 vs 내용 분석
두 방법론은 모두 질적 데이터를 다루기 때문에 종종 혼동되곤 합니다.
| 주제 분석 (Thematic analysis) | 내용 분석 (Content analysis) | |
|---|---|---|
| 주요 목표 | 의미의 패턴 해석 | 콘텐츠 분류 및 빈도 측정 |
| 결과물 | 중심 아이디어가 있는 주제 | 빈도가 포함된 카테고리 |
| 수치 측정의 역할 | 기껏해야 보조적인 맥락 제공 | 종종 핵심적인 역할 수행 |
| 가장 적합한 용도 | 경험 및 관점 이해 | 특정 내용의 출현 빈도 측정 |
질문이 "고객이 가격 책정을 얼마나 자주 언급하는가?"라면 내용 분석이 적합합니다. 반면 "고객에게 가격 책정은 어떤 의미인가?"라면 주제 분석이 적합합니다.
일부 프로젝트에서는 두 방법을 순차적으로 사용하기도 합니다. 대규모 데이터 세트에서 빈도를 먼저 분석하여 데이터가 어디에 집중되어 있는지 파악한 다음, 더 작고 집중된 샘플에 대해 주제 분석을 진행하여 그 수치가 무엇을 의미하는지 설명하는 방식입니다.
수천 개의 리뷰나 지원 티켓과 같이 대규모 피드백의 경우, 빈도 관점의 분석이 가장 먼저 필요할 때가 많습니다. Voice of Customer Summarizer는 피드백 채널을 빈도 및 각 채널의 대표적인 실제 답변과 함께 주제별로 통합해 줍니다.
Excel에서 주제 분석 수행하기
많은 연구자들이 여전히 스프레드시트에서 코딩을 진행하며, 이는 소규모 연구에 잘 맞습니다. 간단한 레이아웃은 발췌본당 한 행을 사용합니다.
- A열: 참가자 코드.
- B열: 정확히 복사된 발췌본.
- C열: 1차 코드.
- D열: 2차 코드.
- E열: 후보 주제.
주제별로 필터링하면 이를 뒷받침하는 모든 발췌본을 한눈에 볼 수 있습니다. 또한 주제별 및 참가자별 행 수를 세어보면 특정 주제가 유독 말을 많이 한 한 명의 인터뷰 대상자에게만 의존하고 있는 것은 아닌지 한눈에 파악할 수 있습니다. 한계는 규모입니다. 발췌본이 수백 개를 넘어가면 수작업으로 분류하고 재코딩하는 속도가 느려지는데, 바로 이 부분에서 AI 지원 클러스터링이 시간을 가장 많이 절약해 줍니다.
프로젝트에 발표된 연구 자료 검토가 포함되어 있다면, AI를 활용한 문헌 검토(literature review) 작성 가이드에서 해당 내용을 다루고 있으니 참고하시기 바랍니다.
흔히 하는 실수들
- 토픽을 주제로 취급하는 것. "의사소통"은 토픽입니다. 주제는 이에 대해 무언가 주장하는 바가 있어야 합니다.
- 두 번째 검토 없이 AI 코드를 그대로 수용하는 것. 1차 코드는 의미보다는 표면적인 단어에 라벨을 붙이는 경우가 많습니다.
- 식별 가능한 데이터를 업로드하는 것. 업로드하기 전에 반드시 녹취록을 비식별화하세요.
- 빈도를 증거로 삼는 것. 빈도는 주제를 뒷받침할 뿐, 주제를 확립해 주지는 않습니다.
- 반대 사례 검색을 건너뛰는 것. 한 번도 검증받지 않은 주제는 보기보다 취약합니다.
- AI가 주제 이름을 짓게 두는 것. 이름은 논증을 담아내므로, 주제가 확정되고 정의되면 직접 이름을 작성하세요.
이러한 사항들을 올바르게 수행하는 것이 신뢰할 수 있는 분석과 단순한 제목별 요약본을 구분 짓는 기준입니다. 직접 보유한 녹취록을 바탕으로 읽기, 코딩, 클러스터링 작업을 더 빠르게 완료하고 싶다면, 하나의 연구 과제로 Powerdrill Bloom을 사용해 보세요.
자주 묻는 질문
주제 분석이란 쉽게 말해 무엇인가요?
주제 분석은 인터뷰와 같은 질적 데이터에서 의미의 패턴을 찾고 해석하는 방법입니다. 연구자는 데이터를 코딩하고, 코드를 주제별로 그룹화하며, 각 주제가 연구 질문에 대해 무엇을 말해주는지 설명합니다.
주제 분석의 6단계는 무엇인가요?
Braun과 Clarke의 6단계는 데이터 세트에 익숙해지기, 코딩하기, 초기 주제 생성하기, 주제 개발 및 검토하기, 주제 세분화, 정의 및 명명하기입니다. 여섯 번째 단계는 보고서 작성하기입니다. 그들은 이 단계들이 엄격한 규칙은 아니라고 언급합니다.
AI가 주제 분석을 수행할 수 있나요?
AI는 녹취록 요약, 코드 제안, 발췌본 추출 등 대량의 작업에 도움을 줄 수 있습니다. 하지만 주제가 무엇을 의미하는지 결정하는 해석 작업은 여전히 연구자의 몫입니다. Braun과 Clarke는 질적 분석을 숙련되고, 상황 맥락적이며, 주관적인 과정으로 설명합니다.
주제 분석에는 몇 개의 주제가 있어야 하나요?
Braun과 Clarke는 "주제 분석(TA)에서 주제의 수를 결정하는 정확한 공식은 없다"고 말합니다. 이는 데이터, 연구 질문 및 보고서의 길이에 따라 달라집니다. 분석을 통해 하나의 주제를 깊이 있게 다루거나 더 넓은 개요를 제공할 수 있습니다.
주제 분석과 내용 분석의 차이점은 무엇인가요?
주제 분석은 의미의 패턴을 해석하고 주제를 도출합니다. 내용 분석은 콘텐츠를 분류하고 카테고리가 나타나는 빈도를 측정하는 경우가 많습니다. 경험을 이해하려면 주제 분석을 선택하고, 빈도를 측정하려면 내용 분석을 선택하세요.
Sources: Braun and Clarke, Thematic Analysis · Understanding TA · Doing Reflexive TA · Thematic Analysis FAQs. 실전 예시와 결과 표는 예시용입니다.