予測したい時代に、まず分類するべき理由
Hatched by tttt
Aug 04, 2026
1 min read
1 views
86%
そのデータは、答えを知っているのか
私たちは分析を始めるとき、つい「何を予測するか」から考えてしまう。売上を当てたい、価格を当てたい、解約率を当てたい。だが本当に先に問うべきなのは、そもそも答えが見えているのかということだ。
この問いを見落とすと、回帰とクラスタリング、分類といった手法の違いは単なる用語の暗記に終わる。けれど実際には、この違いはもっと根本的だ。これは「未来を当てたいのか」「世界の構造を見つけたいのか」という、知り方そのものの違いである。
予測とは、答えを当てることではない。まず、答えがどこにあるかを見極めることだ。
ここに、データ分析の最も重要な分岐点がある。目的変数があるのか、ないのか。連続値を推定したいのか、離散的なラベルを付けたいのか。あるいは、まだ誰も知らないグループを発見したいのか。この見極めができる人は、手法選びを間違えにくいだけでなく、問題設定そのものを洗練させることができる。
回帰は「予測」ではなく「条件付きの想像」である
回帰は、広く言えば「条件から結果を推定する」ための道具だ。家の広さ、駅からの距離、築年数から価格を予測する。広告費、季節、在庫量から売上を予測する。ここで重要なのは、求めたいものが最初から定義されていることだ。
つまり回帰は、「この世界では何が起きそうか」を数式に写す作業である。入力が与えられたら、出力を推定する。入力と出力の関係を学び、見えないケースでも値を出せるようにする。だから回帰は、未来予測の顔をしていても、実際には「既知の問いに対する最良の近似」を作る技術だ。
ここで多くの人が混乱するのは、回帰を「当てること」そのものだと思ってしまうからだ。しかし本質は逆で、回帰は何を当てるのかが定まっているから使える。目的変数が曖昧なら、回帰はうまく働かない。なぜなら、モデルは答えを作れないからだ。答えの器が先に必要である。
たとえば、不動産データがあるとする。価格を当てたいなら回帰が自然だ。しかし、もし「どんなタイプの物件が市場に存在するのか」をまだ知らないなら、いきなり価格を予測するより先に、物件の構造を探る必要がある。立地重視型、ファミリー型、投資向け高利回り型のような塊があるかもしれない。そのとき必要なのは、回帰ではなくクラスタリングだ。
回帰は便利だが、前提が強い。目的が見えている世界でしか強くない。だから優れた分析者は、モデルを選ぶ前に、まず問いを整える。
先に地図を描くか、先に名前を付けるか
クラスタリングは、まだ名前のない構造を見つけるための方法だ。データ全体を眺めて、似ているもの同士を集める。これは単なるグループ分けではない。むしろ、「このデータはどんな地形をしているのか」を探る営みである。
たとえば購買履歴があるとする。カップラーメンをよく買う人、健康食品をよく買う人、赤ちゃん用品をよく買う人がいたとしよう。まだ誰にもラベルを付けていなくても、データの中には自然なまとまりが生まれる可能性がある。クラスタリングはそのまとまりを見つける。A群、B群、C群と、世界の側に既にある境界線を探し出すのである。
ただし、ここで重要な区別がもう一つある。クラスタリングはグループを見つけること、分類はそのグループに新しいデータを割り当てることだ。似ているが別物である。
この違いは、地図作りと住所案内の違いに似ている。クラスタリングは「この地域にはどんな区画があるか」を見つける作業だ。分類は「いま来たこの人は、どの区画に属するか」を判断する作業だ。前者は構造の発見、後者は新規入力への帰属判断である。
この二段階を混同すると、分析は途端に不安定になる。まだ地図がないのに住所を聞かれている状態になるからだ。逆に、地図ができているのに、毎回ゼロから地域の境界を探し直すのも非効率だ。だから本当に強い分析は、まず探索して、次に割り当てるという順序を持っている。
分類とは、世界を理解した後に行う判断である。クラスタリングとは、世界を理解するために行う発見である。
この順序感覚を持つと、機械学習はただのアルゴリズム集ではなくなる。分析とは、答えを出す工程ではなく、問いの種類を見極める工程だと分かってくる。
いちばん難しいのは、手法選びではなく問題設定だ
多くの実務では、「回帰か分類か」「クラスタリングか教師ありか」という技術選択が議論の中心になる。だが本当の難所はそこではない。何を目的変数にするかを決めること、もっと言えば、何を「結果」とみなすかを定義することだ。
たとえば、顧客分析を考えよう。解約を予測したいなら回帰でも分類でも話が始められる。だがそれで終わりではない。解約というラベルは、しばしば事後的で、しかも曖昧だ。単に解約したかどうかではなく、熱心な利用者だったのに離れた人、最初から使い方が合わなかった人、価格に敏感な人では、対策が全く違う。
ここでクラスタリングが効いてくる。解約を当てる前に、顧客はそもそも何種類に分かれるのかを探る。すると、同じ解約でもまったく別の意味を持っていたことが見えてくる。解約率という一つの数字の裏に、複数の行動様式が隠れているのである。
この視点は、医療、教育、採用、マーケティング、製造など、あらゆる領域で重要だ。表面的には同じ結果に見えても、その結果に至る構造が違えば、打ち手は変わる。つまり、予測精度だけを上げても、理解が深まるとは限らない。
むしろ優れた分析は、次の順序で進むことが多い。
- まずクラスタリングで、データの自然なまとまりを探す
- 次に、そのまとまりごとに意味のあるラベルを考える
- その後で分類や回帰を使い、新しいデータに適用する
この順番は、単なる技術手順ではない。世界を未知から既知へ、そして既知から運用へ移す知的な流れである。
回帰とクラスタリングをつなぐ、ひとつの見方
ここで、二つの手法を対立ではなく連続体として捉えると、理解が一段深くなる。回帰は「連続的な差異」を扱う。クラスタリングは「離散的なまとまり」を扱う。分類は、その中間にある「境界を引く」行為だ。
この三つを並べると、分析の本質が見えてくる。それは、世界は連続しているが、人間はそれを区切って理解するということだ。
たとえばユーザー行動には、完全な断絶などほとんどない。少しずつ購入回数が増え、少しずつ利用頻度が上がり、少しずつロイヤル顧客に近づく。ここでは回帰が向いている。だが実務では、ある時点で「ライトユーザー」「ミドルユーザー」「ヘビーユーザー」と区切りたくなる。そこでクラスタリングや分類が登場する。
この切り替えは、単に手法を変えることではない。現実を連続として見るか、区分として見るかという認識の変化である。良い分析者は、その都度どちらの見方が価値を生むかを判断する。
もっと言えば、回帰は「量の違い」を見る眼、クラスタリングは「型の違い」を見る眼だ。量の違いだけでは説明しきれないものがある。たとえば同じ売上でも、少数の大口顧客による売上と、多数の小口顧客による売上は、構造が違う。平均値では同じでも、現実はまったく別だ。ここで必要なのは、数字を当てることではなく、世界の型を見抜くことである。
データ分析の成熟とは、精度を上げることだけではない。量の問題を、型の問題として再定義できるようになることだ。
実務で効くのは、モデルではなく順序である
この話を実務に落とすなら、最も重要なのは「どのアルゴリズムを使うか」ではなく、「どんな順番で考えるか」だ。手法は多いが、順序を間違えるとどれも無力になる。
たとえば新規事業のユーザー分析なら、最初からLTV予測に飛びつくより、まずクラスタリングで利用者のタイプを把握した方がよいことがある。すると、どのタイプが伸びしろを持つか、どのタイプが離脱しやすいか、どのタイプが高単価になりやすいかが見え始める。その後で回帰や分類を使えば、より意味のある予測になる。
逆に、目的変数が明確な場面では、回帰や分類を素直に使うべきだ。家賃、売上、需要、故障確率のように、答えが既に定義されているなら、構造探索に時間をかけすぎる必要はない。大事なのは、答えの有無によって発想を切り替えることだ。
この切り替えを習慣化するには、次の問いを毎回自分に投げるとよい。
- 私はいま、答えを予測したいのか
- それとも、世界の構造を発見したいのか
- 既に答えのラベルはあるのか
- 似たもの同士を分けたいのか、それとも新しいデータを振り分けたいのか
この問いに答えられるだけで、分析の質はかなり変わる。なぜなら、モデルの選択より先に、問題の解像度が上がるからだ。
Key Takeaways
- 回帰は「何を予測するか」が明確なときに使う。目的変数がない状態では、無理に回帰へ進まない。
- クラスタリングは、まだ知らない構造を見つけるための方法。答えを当てる前に、世界の区分を探る。
- 分類は、見つけた構造に新しいデータを割り当てる行為。クラスタリングと同じではない。
- 分析で最も重要なのはモデル選びより問題設定。答えがあるのか、構造を探すのかを先に決める。
- 優れた分析は、探索から予測へ進む。まず分けて、次に当てる。この順序が実務で強い。
予測の前に、世界を分け直す
回帰、分類、クラスタリングは、単なる機械学習の手法ではない。実はそれぞれ、世界との向き合い方を表している。回帰は、既にある問いに数で答える。クラスタリングは、まだ見ぬ輪郭を探す。分類は、輪郭の中に新しいものを置く。
この三つを一つの流れとして見ると、分析の役割ははっきりする。未来を当てることではなく、未来を当てられる形に世界を整えることだ。
だから本当に賢いデータ分析は、最初から正解を探さない。まず、何が分かっていて、何が分かっていないのかを切り分ける。そして、必要なら世界をいったん分け直す。その上でようやく、予測が意味を持つ。
私たちが学ぶべきなのは、どの手法が強いかではない。どんな順番で世界を見ると、答えが自然に現れるかである。そこを見誤らなければ、回帰はただの予測器ではなくなり、クラスタリングはただのグループ分けではなくなる。両者は、未知を既知に変えるための、ひとつの知的なプロセスになる。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣