アンケート調査の結果は、しばしば平均値に集約されます。
「満足度は5段階で平均3.0だった」
「施策への賛成度は平均3.8だった」
「職員の心理的安全性は前年より0.2ポイント上昇した」
分かりやすい数字です。しかし、その分かりやすさと引き換えに、回答者の間に存在する重要な違いが消えている可能性があります。
たとえば、5段階評価で平均値が同じ「3.0」になる二つの集団を考えてみます。
一方は、ほぼ全員が「3」を選んだ集団です。意見は中間付近に集まっています。
もう一方は、半数が「1」、半数が「5」を選んだ集団です。平均値は同じでも、実態は強い賛否への分裂です。
前者は「おおむね中立」、後者は「深刻な二極化」です。意思決定上の意味はまったく異なります。
分散を見れば十分なのか
平均値だけでなく、標準偏差や分散を示せばよいという反論があります。視覚的には箱ひげ図などです。
確かに、分散を見れば回答が散らばっていることは分かります。しかし、それだけでは、そのばらつきが何によって生じているかは分かりません。
回答が広く連続的に散らばっているのか。
二つの異なる集団が混在しているのか。
全体としてはまとまっているが、少数の強い不満群が存在するのか。
同じ平均値と近い分散を示していても、回答分布の構造は異なり得ます。
ここに、分布構造分析(DSA)の役割があります。
DSAは、アンケート結果を一つの代表値へ圧縮する前に、回答の偏り、裾、分岐、多峰性、少数群などの分布構造を点検します。
重要なのは、「平均値が正しいか」を疑うことではありません。
平均値によって、意思決定に必要な構造が失われていないかを監査する。
これがDSAの役割です。
「それは従来統計でもできる」という反論
混合分布モデル、潜在クラス分析、クラスター分析などを使えば、従来統計でも複数の集団を検討できます。
したがって、DSAの価値を「従来統計にはできない分析」と説明するのは正確ではありません。
違いは、分析手法の有無ではなく、分析を実施する際の規律にあります。
従来のアンケート解析では、まず平均値や割合を示し、必要に応じて追加分析を行うことが一般的です。どの構造を探すか、どこまで細分化するかは、分析者の関心や裁量に左右されます。
これに対してDSAは、集約する前に分布構造を確認し、構造が認められた場合に限って測定し、構造が確認できなければ測定を拒否します。
つまり、できるかどうかではなく、
回答構造の確認を、任意の追加分析から標準的な監査工程へ変える。
ここに差別化があります。
分岐が見えても、原因とは限らない
もっとも、回答分布に複数の集団が見つかっただけでは、その原因までは説明できません。
たとえば、病院の満足度調査で、一部の患者に強い不満が集中していたとします。
待ち時間が長かったからでしょうか。
症状が重かったからでしょうか。
治療への期待が高かったからでしょうか。
医療者から受けた説明が不十分だったからでしょうか。
さらに、重症患者ほど待ち時間が長く、期待も高かったのであれば、単純に「待ち時間が満足度を低下させた」とは結論づけられません。
ここで因果推論モデル(DAG)が必要になります。
DAGは、変数間の想定される因果関係を可視化し、どの要因を調整すべきか、何を媒介変数として扱うべきか、どこに交絡や選択バイアスが入り得るかを点検します。
DSAが「回答者の間にどのような分岐があるか」を示し、DAGが「その分岐を原因として語ってよいか」を監査する。
この組み合わせによって、単なる集計から意思決定の監査へ進むことができます。
アンケート調査は、少数意見が消えやすい
DSA+DAGの特徴がアンケート調査で際立つもう一つの理由は、平均的な評価よりも、少数者の回答が重要になる場面が多いことです。
病院全体の満足度が高くても、特定の重症患者だけに強い不満が集中しているかもしれません。
職員の心理的安全性が改善していても、特定部署だけが深刻に悪化しているかもしれません。
新しい医療機器への評価が良好でも、操作経験の少ない職種だけが強い負担を感じているかもしれません。
全体平均としては成功でも、特定の集団に不利益が集中していれば、その意思決定を「成功」と呼んでよいとは限りません。
これは医療において、有効性の平均だけでなく、少数の有害事象にも注意を払う考え方と同じです。
少数意見は、単なる例外ではありません。全体集計では見えなかった制度、製品、組織の弱点を示すシグナルである可能性があります。
自由記述にも接続できる
選択式の回答や評価尺度は、そのまま定量データとして扱えます。一方、自由記述は、DSA+DAGが直接監査する対象ではありません。
しかし、自然言語処理やAIを用いて自由記述から、
- 不満や要望のテーマ
- 肯定・否定・不確実性
- 問題の重大度
- 対象となる部門やサービス
- 時系列や因果に関する主張
を抽出し、検証可能なカテゴリやスコアへ構造化すれば、その分布と因果的解釈を監査できます。
ただし、この場合には、AIが文章を正しく分類したかという別の監査が必要です。
自然言語を数値化すれば、直ちに客観的なデータになるわけではありません。構造化の過程そのものも、監査対象になります。
平均値を捨てるのではなく、平均値の前に立ち止まる
DSA+DAGは、従来統計を否定するものではありません。平均値、割合、回帰分析も重要です。
問題は、それらを計算する前に存在していた回答構造を確認せず、集約された数字だけで意思決定することです。
アンケート調査では、人の意見、経験、症状、期待、不満が数値へ変換されます。その瞬間、異なる意味を持つ回答が一つの代表値へ圧縮される危険が生じます。
だからこそ、アンケート調査はDSA+DAGの特徴が最も分かりやすく現れる領域です。
DSAは、平均値が消してしまう回答の分岐を残す。
DAGは、その分岐を原因として語ってよいかを監査する。
アンケート調査に必要なのは、より多くの数字を示すことだけではありません。
その数字の背後に、誰の、どのような経験が残され、誰の意見が消されているのかを確認することです。
DSA+DAGは、アンケートを「回答の集計」から「意思決定構造の監査」へ変える可能性を持っています。
