AIを使ったテーマ分析の方法:ステップ・バイ・ステップ

テーマ分析(Thematic analysis)は、インタビューの文字起こしや自由記述式のアンケート回答などの質的データ全体から、意味のパターンを見つけ出すための手法です。AIを使ってこれを行うには、文字起こしデータと研究課題(リサーチクエスチョン)を読み込ませ、AIに第1段階のコードを提案させた後、自身でテーマを展開・検証します。AIは読み込みと分類をスピードアップさせますが、解釈を行うのはあくまであなた自身です。
本ガイドでは、テーマ分析とは何かを説明し、6つのフェーズを順に追いながら、AIが役立つ部分とAIに判断を委ねるべきではない部分を明らかにします。また、具体的な実例、結果テーブルのフォーマット、および内容分析(content analysis)との比較も紹介します。
テーマ分析とは何か
この手法の最も広く引用されているバージョンを開発したVirginia BraunとVictoria Clarkeは、自身のサイトで次のように定義しています。「テーマ分析(TA)とは、データセット全体にわたるパターン化された意味を探索し、解釈するために使用される、一連の質的研究手法を指す。」
この定義において、2つの言葉が重要です。「一連(Range)」は、テーマ分析が1つの固定された手順ではなく、アプローチの体系であることを意味します。「解釈(Interpreting)」は、出力されるものがデータが何を語っているかのカウントではなく、データが何を意味しているかについての議論であることを意味します。
BraunとClarkeはこの体系を、コーディング信頼性アプローチ、コードブックアプローチ、そして彼ら独自の反省的(リフレキシブ)アプローチの3つのクラスターに分類しています。この違いは、AIの活用方法に影響を与えます。
- コーディング信頼性は、早い段階でコードブックを固定し、異なるコーダーがそれを同じように適用しているかを検証します。
- コードブックアプローチも構造化された枠組みを使用しますが、ある程度の柔軟な変化を許容します。
- 反省的テーマ分析は、コーディングをオープンな状態に保ち、理解が深まるにつれて変化させます。彼らのFAQには、「反省的TAはコードブックを避ける」と明確に記載されています。
反省的テーマ分析において、テーマは単なるトピック以上のものです。BraunとClarkeはテーマを「中心的な概念やアイデアに裏打ちされた、共有された意味のパターン」と説明しています。たとえば、「価格設定」というトピックはテーマではありません。「顧客は価格を信頼のシグナルとして読み取っている」がテーマです。
6つのフェーズ
Braun and Clarkeは6つのフェーズを概説しています。彼らは「これらのフェーズは、従わなければならない厳格なプロセスを規定するものではない」と強調しています。実際には、これらのフェーズを行き来することになります。
- データセットに慣れ親しむ。 データを繰り返し読み込み、最初の気づきをメモします。
- コーディング。 データセット全体にわたって、意味のあるセグメントに短いラベルを付与します。これを2回以上のラウンドで行います。
- 初期テーマの生成。 コードを意味のパターンの候補へとクラスター化します。
- テーマの開発とレビュー。 各候補をコーディングされたデータおよびデータセット全体と照らし合わせて検証します。必要に応じて、テーマを分割、統合、または削除します。
- テーマの洗練、定義、命名。 各テーマの範囲とストーリーを明確にし、内容が伝わる名前を付けます。
- レポートの執筆。 分析的なナラティブ(語り)とデータの抜粋を織り交ぜ、既存の文献と結びつけます。
彼らのサイトでは、このプロセスを率直に説明しています。「分析は通常、再帰的なプロセスである。」テーマの構築を開始した後に、コーディングに戻ることを想定しておいてください。
AIが役立つ部分と、AIに判断を委ねるべきではない部分
AIは、量的な処理を伴うフェーズで真に役立ちます。40件の文字起こしデータを素早く読み込み、コードの候補を提案し、コードに適合するすべての抜粋を抽出し、パターンの出現頻度をカウントすることができます。
しかし、解釈の判断をAIに委ねるべきではありません。BraunとClarkeは「質的分析は、熟練を要する、状況に応じた、主観的なプロセスである」と書いています。モデルは研究課題に対するあなたの関心を共有しておらず、あなたが与えた文脈しか理解していません。
彼らのFAQでは、分析ソフトウェアに関して関連する指摘をしています。重要なのは「自覚的な研究者であること」だと彼らは書いています。つまり、どのようなツールであっても、自分が選択したアプローチの価値観に合致する方法で使用するということです。
実用的な役割分担は以下のようになります。
| フェーズ | AIができること | あなたが決定すること |
|---|---|---|
| 慣れ親しむ | 各文字起こしの要約、意外な一節のフラグ立て | どの記述が課題にとって重要か |
| コーディング | 第1段階のコードを提案し、一貫して適用する | どのコードを残し、統合し、または名前を変更するか |
| テーマの生成 | コードをクラスター化し、裏付けとなる抜粋を抽出する | クラスターが本当に意味のあるパターンであるかどうか |
| テーマのレビュー | データセットから反例を検索する | テーマが成立しているかどうか |
| テーマの命名 | 名前と1行の定義を提案する | 最終的な名前と、それが語るストーリー |
| レポートの執筆 | 各セクションの下書きと引用の組み立て | 議論とその主張内容 |
コードブックアプローチを使用する場合、AIの出力はコードブックの下書きとして役立ちます。反省的テーマ分析を使用する場合は、AIのコードを分析そのものとしてではなく、思考を深めるためのヒント(プロンプト)として扱ってください。
どちらのアプローチを使用する場合でも、AIがどのように関与したかを記録してください。ツール名、支援を受けたフェーズ、そしてその後に自分が変更した内容をメモしておきます。方法論に関する短い段落を1つ用意しておけば、査読者、審査員、またはステークホルダーから質問される前に、その疑問に答えることができます。
開始する前に必要なもの
AIツールにデータを読み込ませる前に、以下の4つの準備を整えてください。
明確な研究課題(リサーチクエスチョン)。 すべてのコードとテーマは、これに照らし合わせて評価されます。「オンボーディング中に顧客は何を体験しているか?」という問いは、「なぜ顧客は最初の1ヶ月で解約するのか?」という問いとは異なる分析を生み出します。
クリーンで匿名化された文字起こしデータ。 名前、会社名、メールアドレス、その他参加者を特定できる詳細な情報を削除します。これはアップロード後ではなく、必ずアップロード前に行ってください。サードパーティ製ツールの使用に関する制限について、倫理審査の承認内容や同意書を確認してください。
自己省察のためのメモ用ドキュメント。 反省的テーマ分析では、研究者の視点が前面に出されます。AIが生成するものとは別に、データを読み進める中での自身の前提や反応を継続的に記録しておきます。
一貫したファイル形式。 インタビューごとに1つのファイルを作成し、話者ラベルを付けておくことで、すべての抜粋を元のソースまで簡単に遡ることができます。参加者コードとインタビュー日をマッピングしたシンプルなインデックスを用意しておきましょう。
AIを使ってテーマ分析を行う方法
以下のステップは、6つのフェーズに沿っており、3つの作業セッションにグループ化されています。
ステップ1:文字起こしデータの読み込みと研究課題の設定
匿名化した文字起こしデータを、Powerdrill Bloom などのAIワークスペースにアップロードします。そのプランでは Excel、CSV、PDF、およびドキュメントのアップロードに対応しているため、WordやPDF形式の文字起こしデータをそのまま使用できます。スプレッドシートにエクスポートした自由記述式のアンケート回答も同様に機能します。
何かを依頼する前に、まず研究課題を提示します。その上で、各文字起こしデータの短い要約と、その課題に関連する一節のリストを求めます。
それらの要約を読み、その後、自分自身で文字起こしデータを読み込みます。AIによる要約はデータに慣れ親しむプロセスをスピードアップさせますが、その代わりになるものではありません。AIが生成したコードを見る前に、別のドキュメントに自分自身の第一印象をメモしておきましょう。
ステップ2:第1段階のコード生成と、自身による再コーディング
各文字起こしデータに対するコードの提案をAIに求めます。短いラベル、それぞれの1行の定義、そしてそれらを裏付ける正確な抜粋をリクエストしてください。
効果的なリクエストは、短く具体的です。研究課題に関連するすべての内容について文字起こしデータをコーディングし、ラベルは5語以内に抑え、それぞれについて正確な一節を引用するように指示します。正確な一節を求めることで、参加者が実際に語った内容から乖離してしまったコードを簡単に見つけ出すことができます。
その後、自分自身で2回目のコーディングを行います。自分のコードとAIのリストを比較してください。両者が一致している場合、そのコードは明らかに存在する何かを説明している可能性が高いです。相違がある場合は、注意深く観察してください。AIがあなたの見落としていた何かに気づいたか、あるいはAIが意味ではなく表面的な言葉遣いにラベルを付けてしまったかのどちらかです。
すべての抜粋を追跡可能な状態に保ちます。各コードは、特定の参加者と一節を指し示している必要があります。Powerdrill Bloom のホームページには、すべての数値が「その背景にあるページ、行、図とともに返される」と記載されていますが、引用についても同様の追跡可能性が重要です。
ステップ3:テーマ候補の構築とデータとの照合
最終的なコードをテーマ候補へとクラスター化し、それぞれに裏付けとなる抜粋を添えるようAIに依頼します。このクラスターを出発点として扱ってください。
各候補について、1つの問いを投げかけます。「その背景に中心的な概念やアイデアはあるか?」 答えが単に「共通のトピック」である場合、それはまだテーマではありません。分割、統合、または削除を行ってください。
次に、各テーマをテストします。そのテーマと矛盾する抜粋を見つけるようAIに依頼してください。意図的な反例の探索を乗り越えたテーマは、一度も検証されなかったテーマよりも強力です。
最後に、各テーマに名前を付け、2文程度の定義を書きます。セクションごとにレポートの下書きを作成し、レポートに掲載する前に、すべての引用を元の文字起こしデータと照らし合わせて確認します。
具体的な実例
以下は、12件の顧客インタビューを対象とした製品調査研究におけるプロセスの簡易版です。研究課題は、「なぜ新規顧客は30日以内に製品の使用を止めてしまうのか」というものでした。
第1段階のAIコードには、「セットアップに時間がかかりすぎる」、「価格設定が不明確」、「IT部門の承認が必要」などが含まれていました。
2回目のコーディングの後、研究者は、これら3つのコードすべてが「自分自身で製品を選んでいない人」のインタビューに現れていることに気づきました。
その結果得られたテーマは、「当事者意識なき導入(adoption without ownership)」でした。製品を引き継いだだけの顧客には、初期の摩擦を乗り越えてまで使い続ける理由がなかったのです。
その結果、研究者はAIに反例、つまり「製品を自分で選んでいないにもかかわらず、利用を継続した顧客」を探すよう依頼しました。2件のインタビューがこれに該当しました。どちらも、最初の1週間で同僚が簡単な成功体験(クイックウィン)を示してくれたと述べており、これによりテーマが崩れることなく、むしろ洗練されました。
AIはコードを素早く表面化させました。しかし、テーマは「誰がそれを言っているのか」に研究者が気づいたことから生まれました。これは、どのコード単体でも捉えきれなかった部分です。
テーマ分析の結果を提示する方法
結果セクションは通常、テーマの表から始まり、その後に裏付けとなる抜粋を交えて各テーマについて議論します。以下の表は、一般的なフォーマットを示しています。
| テーマ | 定義 | 参加者 | 抜粋例 |
|---|---|---|---|
| 当事者意識なき導入 | 製品を自分で選んでいないユーザーには、使い続ける理由がほとんどなかった | 12人中7人 | 「使うように言われたので、最低限のことだけやりました。」 |
| 第一印象としてのセットアップ | 初期のセットアップにかかる労力が、製品全体の印象を決定づけた | 12人中9人 | 「最初の1時間が大変だと、残りの部分も大変だろうと思ってしまいます。」 |
表の後に、各テーマに関する短いセクションを続けます。中心的なアイデアを説明し、2〜3個の抜粋を示し、それを研究課題と結びつけます。
同じことを言っている3つの引用ではなく、異なる角度からテーマを示している抜粋を選択してください。抜粋は短く抑え、必ず参加者コードを明記します。読者は、複数の声を通してテーマを確認できるときに、そのテーマをより信頼します。
参加者数は役立つ文脈ですが、BraunとClarkeのアプローチでは、頻度を重要性の尺度として扱いません。4人に言及されたテーマが、10人に言及されたテーマよりも重要な場合もあります。
ステークホルダー向けには、同じ結果が短いスライド資料(デッキ)にまとめられることがよくあります。AI research synthesis ツールはこのルートを説明しており、文字起こしデータやアンケートをテーマ、エビデンス、およびステークホルダー向け資料へと統合します。
テーマ分析 vs 内容分析
どちらも質的データを扱うため、これら2つの手法はしばしば混同されます。
| テーマ分析 | 内容分析 | |
|---|---|---|
| 主な目的 | 意味のパターンを解釈する | コンテンツを分類し、多くの場合カウントする |
| 出力 | 中心的なアイデアを持つテーマ | 頻度を伴うカテゴリー |
| カウントの役割 | せいぜい補足的な文脈 | 多くの場合、中心的 |
| 最適な用途 | 体験や見解の理解 | 何かが現れる頻度の測定 |
もし問いが「顧客はどのくらいの頻度で価格設定に言及しているか?」であれば、内容分析が適しています。「顧客にとって価格設定は何を意味しているか?」であれば、テーマ分析が適しています。
プロジェクトによっては、両方を順番に使用することもあります。大規模なデータセットに対して頻度分析を行うことで、どこにボリュームがあるかが明らかになります。その後、より小さく絞り込んだサンプルに対してテーマ分析を行うことで、そのボリュームが何を意味しているかを説明します。
数千件のレビューやサポートチケットなど、大規模なフィードバックの場合、まずは頻度の把握が必要になることがよくあります。Voice of Customer Summarizer は、フィードバックチャネルをテーマごとにまとめ、それぞれの頻度と代表的な生の声を提示します。
Excelでのテーマ分析
多くの研究者は現在もスプレッドシートでコーディングを行っており、小規模な研究ではこれがうまく機能します。シンプルなレイアウトでは、抜粋ごとに1行を使用します。
- A列: 参加者コード。
- B列: 正確にコピーされた抜粋。
- C列: 第1ラウンドのコード。
- D列: 第2ラウンドのコード。
- E列: テーマ候補。
テーマでフィルタリングすることで、裏付けとなるすべての抜粋を1つのビューで確認できます。テーマごと、および参加者ごとの行数をカウントすることで、特定のテーマが1人のよく喋るインタビュー対象者だけに依存していないかを一目で確認することもできます。限界は規模(スケール)です。抜粋が数百件を超えると、手作業での分類や再コーディングは遅くなります。ここで、AIを活用したクラスター化が最も時間を節約してくれます。
プロジェクトに発表済みの研究のレビューも含まれている場合は、AIを使った文献レビュー(literature review)の執筆ガイドがその部分をカバーしています。
よくある間違い
- トピックをテーマとして扱ってしまうこと。 「コミュニケーション」はトピックです。テーマはそれについて何かを語るものです。
- 2回目の検証を行わずにAIコードを受け入れてしまうこと。 第1段階のコードは、意味ではなく言葉遣いにラベルを付けていることがよくあります。
- 特定可能なデータをアップロードしてしまうこと。 アップロードする前に、必ず文字起こしデータを匿名化してください。
- カウントを証拠として扱うこと。 頻度はテーマをサポートしますが、テーマを確立するものではありません。
- 反例の探索をスキップすること。 一度も検証されなかったテーマは、見た目よりも脆弱です。
- AIにテーマの命名を任せてしまうこと。 名前は議論を伝えるものであるため、テーマが決定し定義されたら、自分で名前を書いてください。
これらを正しく行うことが、信頼できる分析と、単に見出しを付けただけの要約とを分ける境界線です。自身の文字起こしデータの読み込み、コーディング、クラスター化をより迅速に行いたい場合は、1つの研究で Powerdrill Bloom を試すことができます。
よくある質問
テーマ分析とは、簡単に言うと何ですか?
テーマ分析とは、インタビューなどの質的データにおける意味のパターンを見つけ出し、解釈する方法です。研究者がデータをコーディングし、コードをテーマにグループ化し、各テーマが研究課題について何を語っているかを説明します。
テーマ分析の6つのステップとは何ですか?
BraunとClarkeの6つのフェーズは、データセットに慣れ親しむ、コーディング、初期テーマの生成、テーマの開発とレビュー、テーマの洗練・定義・命名です。6つ目はレポートの執筆です。彼らは、これらのフェーズが厳格なルールではないと指摘しています。
AIはテーマ分析を行うことができますか?
AIは、文字起こしデータの要約、コードの提案、抜粋の抽出など、量的な作業を支援することができます。しかし、テーマが何を意味しているかを決定する解釈作業には、依然として研究者が必要です。BraunとClarkeは、質的分析を「熟練を要する、状況に応じた、主観的なプロセス」と説明しています。
テーマ分析にはいくつのテーマが必要ですか?
BraunとClarkeは、「TA(テーマ分析)におけるテーマの数を決定するための正確な公式はない」と述べています。それはデータ、研究課題、およびレポートの長さによって異なります。1つのテーマを深く報告することも、より広い概要を提供することもできます。
テーマ分析と内容分析の違いは何ですか?
テーマ分析は意味のパターンを解釈し、テーマを生成します。内容分析はコンテンツを分類し、多くの場合、カテゴリーが出現する頻度をカウントします。体験を理解するにはテーマ分析を、頻度を測定するには内容分析を選択してください。
情報源: Braun and Clarke, Thematic Analysis · Understanding TA · Doing Reflexive TA · Thematic Analysis FAQs。具体的な実例および結果テーブルは説明用です。