相関は答えではない: 予測モデルが必ず見落とすもの

tttt

Hatched by tttt

May 06, 2026

1 min read

88%

0

いちばん危険な予測は、よく当たる予測である

「当たっているように見える予測」は、しばしば私たちをいちばん深く誤らせます。売上が上がると広告費も増える、気温が上がるとアイスが売れる、顧客数が増えるとクレームも増える。散布図にきれいな線が見えると、人はつい原因をそこに見つけたくなります。しかし、そこにあるのはたいてい関係の痕跡であって、因果の証明ではありません。

この違いは、統計の入門知識として知っておくべき注意点にとどまりません。むしろ、現実世界で予測を使うときの核心です。なぜなら、予測とは「未来を当てること」ではなく、限られた情報から、どの関係を信じ、どの関係を疑うかを決めることだからです。

そしてここに、データ分析と機械学習をつなぐ本質的な問いがあります。相関を見つけることと、予測モデルを作ることは、どこが同じで、どこが決定的に違うのか。 さらに言えば、モデルが高精度に見えるとき、人間は何を見落としやすいのか。

答えは、予測モデルは世界の写し鏡ではなく、世界を切り取る仮説の機械だということです。モデルがうまくいくほど、私たちはその仮説を現実そのものだと錯覚しやすくなります。


散布図は地図だが、領土ではない

2つの量的データの関係を見るとき、私たちはまず散布図を描きます。右肩上がりなら正の相関、右肩下がりなら負の相関、ばらけていれば無相関。ここまではわかりやすい。問題は、その線を見た瞬間に人間の脳が「説明したい」という欲望を発動することです。

たとえば、アイスクリームの販売個数と顧客クレームの頻度に正の相関があるとします。これを見た瞬間、誰かはこう言うかもしれません。「アイスが客を不機嫌にさせるのではないか」と。だが、実際には第3の要因、たとえば顧客数が両方を増やしているだけかもしれません。ここで見えているのは原因ではなく、共通の背景が作り出した影です。

この発想は、予測の世界ではさらに重要になります。線形回帰のようなモデルは、入力と出力の関係を数式にし、将来の値を推定しようとします。けれども、モデルが見ているのはあくまでデータ上の関係です。データに現れた相関をなぞることはできても、相関が生まれた理由までは自動では理解できません。

相関は、世界の説明ではなく、世界の圧縮である。

この一文を忘れないことが重要です。圧縮された情報は便利ですが、圧縮される過程で文脈が抜け落ちます。散布図は地図のようなものです。地形のおおまかな高低はわかる。しかし、そこを歩いたときにぬかるみがあるか、風が強いか、どの道が通行止めかまではわからない。予測モデルも同じです。関係の輪郭は描けても、因果の地形までは保証しません。

ここで見えてくるのは、データ分析における第一の誤解です。人はしばしば「関係がある」ことを「理由がわかった」ことと混同します。しかし本当に必要なのは、関係の存在を確認することではなく、その関係がどの条件下で成立し、どの条件で崩れるかを見極めることです。


予測モデルが苦手なのは、例外ではなく文脈である

線形回帰は、入力から出力を説明するもっとも基本的な方法の一つです。キャビンのサイズが大きいほど価格が高い、というような直感的な関係を表すには向いています。ところが、現実の価格はサイズだけでは決まりません。水辺への近さ、サウナの大きさ、景観、需要の季節性、所有者の売り急ぎ、地域のブランド力。こうした要素が重なり、単純な直線では捉えきれない現象を生みます。

ここで重要なのは、モデルが「間違っている」のではなく、モデルの前提が世界より狭いということです。あるキャビンでは水辺に近いことが大きく価格を押し上げるが、別のキャビンではサイズの方が支配的かもしれない。したがって、同じ特徴を持つ2つの物件でも、実際の価格は違い得ます。これは例外ではなく、現実がそもそも多因子的であることの証拠です。

このとき役に立つのが、特徴量の見方を変える発想です。たとえば「キャビン全体の価格」を見るのではなく、「1平方メートルあたりの価格」を見る。すると、水辺に近づくにつれて、面積単価は上がるかもしれない。総額だけでは見えなかった関係が、尺度を変えることで見えてきます。

この単純な工夫は、実は非常に深い教訓を含んでいます。予測がうまくいかないとき、世界を無理に直線で押し込むより、問いの立て方を変えた方がよいのです。何を目的変数にするか、どの単位で考えるか、どの特徴を追加するか。モデル性能の違いは、アルゴリズムの優劣だけでなく、問題設定の質に大きく左右されます。

ここで、線形回帰の切片項の意味も見えてきます。切片は、入力がゼロでも出力を一定量ずらせるための項です。これは単なる技術的な部品ではありません。むしろ、説明できないベースラインの存在を認める装置です。現実の価格や行動には、私たちが測れていない土台がある。切片は、その土台を完全には説明できないまま、それでもモデルを現実に接続するための余白なのです。


本当の敵はノイズではなく、見えない構造である

機械学習の議論では、しばしば「データが多いほど良い」と言われます。たしかに、一般にはデータが増えるほど予測は安定しやすくなります。しかし、ここにも罠があります。データが増えれば、真理に近づくとは限らないのです。

なぜなら、データにはノイズだけでなく、交絡変数選択バイアスが混じるからです。ノイズは偶然の揺らぎです。交絡変数は、入力と出力の両方に関わる見えない要因です。選択バイアスは、集めたデータが世界全体を代表していないことです。これらは、単にデータ量を増やしただけでは消えません。むしろ、偏ったデータを大量に集めれば、偏りを精密に学習してしまいます。

ここで重要なのは、モデルの誤差を「予測の失敗」としてだけ見るのではなく、現象の切り取り方の失敗として見ることです。たとえば、住宅価格モデルにおいて海辺に近いほど高いという関係が見えたとしても、それは人気エリアに物件が集中しているからかもしれません。水辺そのものが価値を生むのか、土地の希少性が価値を生むのか、あるいはその両方なのか。モデルは答えを与えるように見えて、実際には問いの曖昧さを露出させます。

この意味で、良い予測モデルとは「何でも当てるモデル」ではありません。どの誤差が避けられず、どの誤差が設計で減らせるかを見分けるモデルです。ノイズは消えない。交絡は制御が必要。選択バイアスはデータ収集の時点で生まれる。つまり、モデルの改善とは、単に数式を洗練させることではなく、現実との接点を設計し直すことなのです。

モデル精度の向上とは、世界の複雑さを消すことではない。複雑さのどの部分を許容し、どの部分を疑うかを明確にすることだ。


「訓練で当たる」は、現実で当たることではない

ここで最後の大きな転換が起こります。データが増えれば良くなるはずなのに、なぜか精度が落ちることがある。これは直感に反しますが、極めて重要な現象です。

その理由は、訓練データとテストデータが違うからです。モデルが見たデータに対してうまく当てることは、過去を記憶する能力かもしれません。しかし本当に欲しいのは、まだ見ていない新しいデータに対する予測力です。ここで初めて、モデルの本当の価値が試されます。

これは、会議で何度も話し合った事案には詳しいが、新しい市場では失敗する組織にも似ています。過去の事例に合わせて最適化しすぎると、未知の状況では脆くなる。データ分析でも同じです。訓練データでの高精度は、しばしば「世界を理解した証拠」ではなく、既知のパターンに過適合した証拠にすぎません。

この点で、予測モデルの本質は逆説的です。モデルは未来を当てるために作るのに、信頼性を測るには未来に似た未知データが必要になる。つまり、モデルは完成品ではなく、現実との対話を続ける装置なのです。訓練とは記憶であり、テストとは謙虚さです。現実の前でどれだけ自分の知識を保留できるか、それがモデルを使う側の知性です。

では、どう使えばよいのか。答えは、モデルを結論ではなく、仮説を吟味するための道具として扱うことです。相関を見たら因果を疑う。精度が高くてもデータの偏りを疑う。大きなデータでも訓練とテストの差を確認する。こうした習慣があるだけで、予測は単なる当て物から、意思決定のための思考補助へと変わります。


Key Takeaways

  1. 相関は原因ではない。 散布図がきれいでも、そこに第3の要因が潜んでいる可能性を必ず考える。
  2. モデルは世界の写しではなく、世界の仮説である。 当たることと、理解したことは同じではない。
  3. 問題設定を変えるだけで見える関係が変わる。 総額ではなく単価を見るなど、尺度を変える発想を持つ。
  4. データ量は万能ではない。 ノイズ、交絡変数、選択バイアスは、量を増やしても自動では消えない。
  5. 訓練データの精度を過信しない。 本当に知りたいのは、未知のデータでどれだけ機能するかである。

結論: 予測とは、未来を知ることではなく、見落としを減らすこと

私たちはしばしば、予測モデルに未来を言い当てる魔法を期待します。けれども、本当に価値があるのは魔法ではありません。価値があるのは、何が見えていて、何が見えていないかを明らかにすることです。

相関は、関係があることを教えてくれます。回帰は、その関係を使って予測する方法を与えてくれます。しかし、どちらも自動的には因果を教えてくれないし、文脈の歪みも救済しません。だからこそ、優れたデータ活用とは、モデルを盲信することではなく、モデルの限界を理解したうえで、それでもなお意思決定に役立てる技術です。

最終的に問われるのは、どのモデルが最も複雑かではありません。どのモデルが、私たちの思い込みを最も上手に壊してくれるかです。データの本当の役割は、答えをくれることではなく、問いを洗い直すことにあるのです。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣