前提
t値、χ^2(カイ二乗)値、回帰分析、ロジスティック回帰分析は、全部「データから結論を出す道具」ですが、いちばん大事なのは “最終的に知りたい答えの形” です。
ここを間違えると、手法を選んでもモヤモヤしやすいです。
概要(まず結論)
- t値:平均の差が「たまたま」かどうかを見る(数値の平均)
- χ^2(カイ二乗)値:割合やカテゴリの偏りが「たまたま」かどうかを見る(カテゴリの数え上げ)
- 回帰分析(線形回帰):数値を予測する(例:売上「金額」)
- ロジスティック回帰:カテゴリを予測する(例:購入する/しない)
ポイント:
「比べたい」のか「予測したい」のか、そして答えが「数値」か「カテゴリ」かで分ける。
1) t値
t値は一言でいうと、複数のデータ群の間で平均の差がハッキリしてるかを点数みたいに表したものです。
使う場面(例)
- AクラスとBクラスで テスト平均点 は違う?
- 薬を飲む前後で 血圧の平均 は変わった?
入力値の形
- データ群ごとの数値(点数、時間、金額など)
何が分かる?
- t値が大きいほど「差がハッキリしてそう」
- 各データ群のばらつきに対するデータ群間の平均の差(ばらつきが大きければ平均の差がぼやけ、ばらつきが小さければ平均の差が際立つ)
↓の例ではAとBの平均の差は同じですが、ばらつきが小さい方がAとBに有意な差が生まれているといえそうですよね?


補足:
t値は t検定だけでなく、回帰分析でも「この説明が本当に効いてそう?」を見るために出ることがあります。
その場合も考え方は似ていて「効果が偶然っぽくないか」をチェックします。
2) χ^2(カイ二乗)値
χ^2値は一言でいうと、「カテゴリごとの偏りがどれくらい大きいか」 の点数です。
「関係がありそう?」を確かめるのが得意です。
使う場面(例)
- 男女で 好きなスポーツ(サッカー/野球/バスケ)に差がある?
- 広告A/Bで クリックした/しない の割合は違う?
入力値の形
何が分かる?
- 偏りが大きいほど「関係がありそう」
- 独立性があるか否か(例えば性別と好きなスポーツは独立して考えられるか否か)
注意:
χ^2値、t値は「関係があるか」を見るのが得意ですが、
「どれくらい増えるか」を予測する道具ではありません(予測したいなら回帰へ)。
注意:
χ^2値、t値を算出した上で、どのくらいなら有意とするかは、有意水準を使って考えますが、その水準をどの程度にするかは、状況に合わせて決めることになります。
3) 回帰分析(線形回帰)
回帰分析(線形回帰)は一言でいうと、「いくつになりそう?」を当てにいく 道具です。
答え(目的)が 数値 のときに使います。
使う場面(例)
- 広告費や来店数から 売上金額 を予測したい
- 勉強時間から テスト点数 を予測したい
データの形
- 予測したい答え(目的変数)が 数値
- 原因候補(説明変数)も基本は数値(工夫すればカテゴリも入れられる)
何が分かる?
- 「勉強時間が1時間増えると点数が何点上がりやすい」など 影響の大きさ
- どれくらい当たっているか(例:当たりやすさの指標)
↓の図では、計測した点(data)からの距離の和が最小になる直線を引くことで、説明変数から目的変数の値を推測する式を求めることができます。

4) ロジスティック回帰
ロジスティック回帰は一言でいうと、「起きる確率」を出して Yes/No (またはカテゴリ)を予測する 道具です。
使う場面(例)
- この人は 購入する?しない?
- このメールは 迷惑メール?違う?
- 明日の天気は 晴れ/曇り/雨のうちどれか?
データの形
- 予測したい答え(目的変数)が 0/1またはカテゴリ
- 説明変数は数値でもカテゴリでもOK(工夫して入れる)
何が分かる?
- 「この条件だと購入する確率が高い」など 確率 で説明できる
- 影響がプラスかマイナスか(増える/減る)も見やすい
使い分けのコツ(最短で迷わない)
まず決める:知りたい「答えの形」
- 平均の差 を比べたい(数値の平均) → t値(t検定)
- 割合・カテゴリの偏り を比べたい(人数の表) → χ^2
- 数値 を予測したい(金額・点数など) → 回帰分析(線形回帰)
- Yes/Noやカテゴリ を予測したい(購入する/しない) → ロジスティック回帰
覚え方:
「比べる」なら t か χ^2、
「予測する」なら 回帰。
そして予測の答えが「数値」なら線形回帰、「分類」ならロジスティック回帰。
まとめ
- t値:数値の平均の差(または回帰で“効いてるか”)をチェック
- χ^2値:カテゴリの偏り・関係があるかをチェック
- 回帰分析(線形回帰):答えが数値の予測
- ロジスティック回帰:答えがカテゴリの予測(確率を出せる)
