データ分析が役に立たないとき、疑うべきは「課題設定」
目次
統計学には、検定の教科書にはまず出てこない「第三種の過誤」という失敗があります。
第一種の過誤は、差がないのに「ある」と言ってしまうこと。第二種の過誤は、差があるのに見逃すこと。第三種はどちらとも違います。間違った問題に、正しい答えを出すことです。
データ分析が役に立たないとき、多くの人は手法の選び方やデータの量を疑います。ところがこの失敗は、計算がすべて正しくても起きます。原因は分析の前、課題設定の段階にあるからです。
正確な答えは、間違った問いにも出せてしまう
この失敗に名前を付けたのは、米オークリッジ国立研究所の統計家A・W・キンボール氏です。1957年、米国統計学会誌に寄せた論文で、統計相談の現場で実際に起きた失敗を並べました。
その一つが、放射線の研究です。ある遺伝学者が、ガンマ線と中性子線で生物に起きる突然変異の起こりやすさを比べようとしました。線量を段階的に変えて照射し、線量と突然変異の頻度の関係を直線で表す。その2本の傾きの差を検定してほしい、という依頼でした。
若い統計家は、頼まれた通りに傾きを求め、検定もしました。計算に誤りはありません。
ただ、中性子線の実験には約7%のガンマ線が混ざっていました。遺伝学者は、その分を差し引いた線量を「補正済み」として渡していました。線量の数字だけを減らしても、測った突然変異にはガンマ線の効果が残ったままです。これでは中性子線そのものの効果は比べられません。
論文は、補正の中身を一つ尋ねれば防げた誤りだとしています。実例を並べる前の箇所には、こんな一文もあります。私たちはたいてい、聞かれた問いには正しく答えている。困るのは、聞かれた問いが本当の問題とほとんど関係ないことが多い点だ。
1962年には、統計学者ジョン・テューキー氏が論文「データ解析の将来」にこう書きました。間違った問いへの厳密な答えより、正しい問いへの近似的な答えのほうがはるかに良い。そして間違った問いは、いつでも精密にできる。
ここに、課題設定の誤りが見つかりにくい理由があります。きれいなグラフも有意差も、問いが正しいかどうかと関係なく手に入ります。分析の出来栄えをいくら点検しても、問いの誤りは出てきません。
『外資系データサイエンティストの知的生産術』で山本康正さんたちは、「データ活用において最も大切なこと、それは『課題設定』です」と書いています。課題、計画、データ収集、分析、結論の5段階を回す「IPDACサイクル」でも、最重要とされるのは最初の課題(Issue)です。
同じデータと同じ問いから、29通りの答えが出た
問いの曖昧さが結果をどれだけ割るのか。それが見える実験があります。
2018年、ラファエル・シルバーザーン氏らの研究グループは、29の分析チーム(分析者61人)に同じデータを渡しました。欧州4か国のトップリーグに所属する選手2,034人と、審判との対戦記録です。問いも一つだけでした。肌の色が濃い選手は、薄い選手よりレッドカードを受けやすいか。
結果は割れました。効果の大きさを示すオッズ比は0.89から2.93まで散らばります。統計的に有意な差を報告したのは20チーム、有意差なしが9チームでした。この実験は、分析結果は誰が分析するかで変わる、という警告として広く引用されました。
2021年、ミュンヘン大学の社会学者カトリン・アウスプルク氏とヨーゼフ・ブリューデル氏は、別の読み方を示します。各チームの報告書を読むと、同じ一文の問いが少なくとも4通りに解釈されていたというのです。
- 肌の色によって、レッドカードの率に差があるか(そのまま比べる)
- 年齢やポジションなどをそろえても差が残るか(審判の偏りを問う)
- レッドカードをよく説明する要因の中に、肌の色が入るか(説明力を最大にする)
- 何か意外な発見はないか(探索する)
問いが違えば、比べ方も、そろえる条件も変わります。二人は問いを2番目の一つに絞り、考えられる分析の組み合わせを486通り試しました。結果の中央値はオッズ比1.28で、元の実験の1.31とほぼ同じです。一方、ばらつきを示す標準偏差は、元の29チームの0.45から0.06まで縮みました。
ただし、各チームがどの解釈をとったかは報告書からの推定で、二人もその分類は不確かだと認めています。2023年には元の研究チームと二人が共同で検証する計画を公開しており、決着した話として扱うのは早い段階です。それでもこの再分析は、答えのばらつきの多くが、分析の腕より問いの側から生まれうることを示しています。
仕事の場面に置き換えてみます。たとえば「先月のキャンペーンの効果を分析して」と頼まれたとします。期間中に何が起きたかを知りたいのか。キャンペーンがなければ起きなかった増加がどれだけあるかを知りたいのか。次にどの顧客へ配るべきかを知りたいのか。
山本さんたちは、データに向ける問いを「何が起きたのか(把握)」「なぜそうなったのか(因果)」「どうすればいいのか(予測・提案)」の3つに分けています。一つの依頼文に、この3つが区別されないまま入っていることは珍しくありません。
課題設定は、依頼と分析のあいだで崩れる
では、なぜ問いは曖昧なまま分析に渡るのでしょうか。キンボール氏は原因を、相談する側と分析する側の意思疎通の不足に求めました。
相談する側は、問題の全体像を話さないことがあります。分析者は現場を知らないから説明しても無駄だと思う。自分でも考えが固まっていない。統計を少し知っているので、問いを自分で分析の形に言い換えてしまう。相手の時間を取らせたくない。
分析する側にも責任があります。問題を理解する前に、見慣れた型に当てはめて手を動かしてしまうことです。
キンボール氏が「遠隔操作の相談」と呼んだ例もあります。ある研究者が電話で、2つの相関係数に差があるかを検定する方法を尋ねました。統計家は長電話を嫌い、定番の方法を教えて電話を切ります。後日わかったのは、2つの相関係数が同じ変数を共有しており、教えた方法の前提が崩れていたことでした。
論文の見立てでは、両者とも、相手が実際に何をしているのかを知る時間を惜しんだのが原因です。チャットの一行で分析を頼み、一行で受ける職場なら、電話がチャットに変わっただけで同じことが起こりえます。
安宅和人さんは『イシューからはじめよ』で、よいイシューの条件の一つに「本質的な選択肢である」ことを挙げています。答えしだいで、その先の方向性が変わる問いのことです。裏返せば、結果がどちらに出ても同じ行動をとるなら、その分析はどれだけ精密でも判断の役には立ちません。
分析の前に、3つだけ決めておく
ここまでを実務に落とすと、次の3つになります。
誤解:データを眺めていれば、課題は見えてくる → 分析に入る前に、問いを1文で書きます。そのうえで「把握」「因果」「打ち手」のどれを知りたいのかを一つ選びます。二つ以上に当てはまるなら、分析を分けます。
誤解:結果が出てから、どう使うかを考えればいい → 「結果がAなら何をする、Bなら何をする」を先に書きます。AでもBでも同じ行動になるなら、その分析はやめるか、問いを変えます。
誤解:依頼の意図は、分析する人が汲み取るもの → 依頼を受けたら、15分だけ依頼した人と話します。聞くのは、この結果で何を決めるのか、何と何を比べたいのか、データに加工や補正をしていないか。放射線の例で誤りを防げたのも、この種の質問でした。
今日5分でできることもあります。いま手元にある分析を一つ選び、「結果がAなら」「Bなら」の2行を書いてみてください。書けないなら、止めて見直すべきは分析の手順より課題設定のほうです。
おわりに
キンボール氏は論文の冒頭で、統計の新人は第一種と第二種の過誤を繰り返し教わるのに、第三種の存在は知らされないまま現場に出る、と嘆いています。
分析の腕を磨けば、正確な答えは出しやすくなります。問いが正しいかどうかは、その腕とは別の場所で決まります。次に分析を頼まれたら、ツールを開く前に一つだけ聞いてみてください。「この結果で、何を決めますか」。
この記事で参考にした本
『外資系データサイエンティストの知的生産術』山本康正さん・松谷恵さん → データ活用の出発点は課題設定。問いを把握、因果、予測・提案の3つに分ける考え方
『イシューからはじめよ[改訂版]』安宅和人さん → よいイシューは、答えによってその先の方向性が変わる「本質的な選択肢」である
合わせて読みたい
『結局、仮説で決まる。』柏木吉基さん|データを見る前に、考えなさい データに触れる前に仮説を立てる手順を、具体例で学べる一冊です。この記事で書いた「問いを1文で書く」の次に、何を確かめるかを決めるときに役立ちます。
同じ数字を見ているのに結論が違うのは、数字の「形」が違うから 問いがそろっていても、指標の定義がずれていれば結論は割れます。「解約率」の分母の違いから、数字の定義をそろえる方法を扱ったコラムです。
「正しい答え」を出しても、問いが間違っていたら意味がない 問いの誤りは、データ分析だけでなく経営判断でも起きます。ミッドウェー海戦の教訓から、取り組むべき課題を見抜く考え方をたどれます。